当 传统搜索流量 2026 年预计下降 25%(Gartner,2024 年 2 月)、80% 消费者至少 40% 的搜索行为依赖 AI 结果(Bain & Company)、中国 GEO 市场从 2025 年的 349.3 亿元冲向 2026 年的 942 亿元(艾媒咨询,2026 年 2 月)时,行业里几乎所有的内容方法论都建立在一个从未被验证的前提上:AI 爬虫真的在抓我们的网页,而且抓的是我们以为的那些页面。
这个前提值得验一遍。我们打开了自己站点的服务器日志,把 12 天、420 万条请求全部拆开,逐条判断「谁来了、以什么身份、抓了什么、拿到什么状态码」。本文是这次盘点的完整结果——6 个发现,其中 3 个和我们原本的预期相反。
1 方法:怎么判断一个「AI 爬虫」是真的
只看 User-Agent 的统计会严重高估。任何人都能把 UA 改成 GPTBot。我们的判定用了三层规则,三者同时满足才算「验证通过」:
- 身份声明:请求的 User-Agent 与厂商公布的爬虫名称一致(OpenAI、Anthropic、Google、Microsoft、Naver 等官方文档)。
- 来源可核验:请求 IP 落在该厂商公布或可通过反向解析核验的网段内(例如 crawl-*.googlebot.com、*.petalsearch.com、*.search.msn.com,或 OpenAI / Anthropic 公开的 IP 段)。
- 行为信号:是否遵守 robots.txt、是否读取 sitemap.xml、请求路径是不是真实内容页。
第 2 条是分水岭。2026 年的现实是:AI 爬虫标签已经成了攻击流量的免费马甲——扫描器把 UA 换成 AI 厂商名字,既能绕过一部分粗糙的封禁规则,又容易被误统计成「AI 很关注我们」。
2 发现一:5 个 IP 轮流冒充 13 种爬虫
先看有公开网段可以核验的几家。同为「Googlebot」,自称 5,564 次,只有 395 次来自 Google 的真实网段:
真正能定性的是下面这一组数据:有 5 个 IP,每个 IP 在 12 天里分别使用过 12-13 种不同的 AI 爬虫身份——同一个来源,上一分钟是 GPTBot,下一分钟是 ClaudeBot,再下一分钟是 PerplexityBot、Bytespider、meta-externalagent。
它们的请求路径全部是扫描器特征(探测环境变量、云凭证、代理端点),与「抓取内容」毫无关系。结论:AI 爬虫统计里 83.9% 的请求身份存疑,不能作为 GEO 效果的证据。如果你对外汇报「本月 AI 爬虫访问增长 300%」,先验 IP——那很可能是扫描器换了个名字。
🧭 需要补充一句严谨的例外:ChatGPT-User、Claude-User、Perplexity-User 属于「用户触发的实时抓取」,厂商并未公布固定网段,本文将其计为「无法核验」而非「冒充」——这两件事性质不同,混为一谈同样是错的口径。
3 发现二:真正在抓内容的只有 6 个身份
把无法核验的部分剔除后,12 天里真正在抓我们内容的只有 6 个身份、合计 1,432 次请求,平均每天 119 次:
三种性格差异非常明显:GPTBot 是广度型(373 次请求打到了 304 条不同路径,几乎把能读的都读一遍);Googlebot 集中(112 条路径,聚焦越南城市页);ClaudeBot 的次数最多但绝大多数不是内容——这就是下一个发现。
4 发现三:ClaudeBot 三分之二的动作是读 robots.txt 和 sitemap.xml
ClaudeBot 在 12 天里对我们的 robots.txt 请求 110 次、sitemap.xml 请求 110 次——两个文件合计 220 次,占它全部 331 次核验请求的 66.5%。而且几乎每天成对出现,时间戳紧挨着:09-08 03:47:31 同秒发出两次请求,09-19 00:53 又是一对。
这就是 AI 检索的工作方式:先读权限、再读索引、最后才取内容。它给我们的行动指向非常直接——
- sitemap.xml 是 AI 检索的第一入口。新页面不进 sitemap,就等于在 AI 的视野里不存在(哪怕页面已经可以访问)。
- robots.txt 被高频复读:今天放行、明天拦截,AI 侧第二天就会知道。改动不需要「等收录更新」。
- 别在 robots.txt 里屏蔽 CSS/JS,也别把检索类爬虫和训练类爬虫一起拦掉——那是把自己从 AI 答案里删掉的最快方式(RFC 9309,IETF 2022-09)。
5 发现四:新文章上线后 2-4 小时被首次抓取(实测时间线)
我们用服务器上文章文件的落盘时间,和日志里爬虫第一次访问该 URL 的时间做了对照。三篇新内容的实测结果如下:
还有两个细节值得记下来:
- 双语站点两个语言版本几乎同时被抓:09-18 那篇稀土报告,ClaudeBot 先抓中文版(04:00:45),3 分钟后就抓走了越南语版(04:03:30)。hreflang 互链是有效的——它让爬虫顺着语言切换把对侧内容一起收走。
- 抓取有固定窗口:GPTBot 稳定出现在每天 05:55 前后,ClaudeBot 出现在 04:00-06:00 之间。在窗口之前完成发布,当天就能进语料管道;错过窗口,就要等下一个周期。
6 发现五:llms.txt 上线 48 小时,0 次被抓
这个发现和我们的预期相反,也和我们上一篇文章的推荐形成了对照。我们在 09-17 上线了站点级 llms.txt,并在 robots.txt 里注明了它的路径。截至 09-19 02:00:
诚实结论:llms.txt 目前仍处在「有规范、无爬虫」的阶段。它由 Jeremy Howard 在 2024 年 9 月提出,是倡议而非 IETF/W3C 标准;到 2026 年 9 月,主流 AI 检索爬虫还没有把它纳入常规抓取路径——至少对访问量在我们这个量级的站点是如此。
这不意味着不该写。我们的判断是:成本 1 小时、只是把一个 Markdown 文件放到站点根目录,写;但不能把它当成「AI 收录开关」,更不能替代 sitemap.xml 与 robots.txt。当厂商开始读它的时候,你已经就位;在那之前,GEO 的工程量应该花在真正被读的地方。
7 发现六:AI 爬虫爱看什么页面
把路径打开看,两类页面的权重被明显区分出来了。
第一类:品牌事实页(GPTBot 的主战场)
GPTBot 反复抓取的是:首页、/about.html(关于我们)、/services.html(服务)、/pricing.html(报价)、/cases.html(案例)、/terms.html 与 /privacy.html(条款隐私),以及各业务线的价格页与样式文件。它要的是「你是谁、做什么、多少钱、做过什么」的确定性事实——这正是 AI 回答用户提问时最需要引用的原材料。
反过来讲:很多企业把「关于我们」写成形容词堆叠的抒情文案,把报价藏进「请联系我们」,等于主动放弃了最容易被引用的位置。
第二类:本地化城市页(Googlebot 与 PetalBot 的主战场)
Googlebot 的 112 条路径几乎全部落在 /vietnam/<城市>/<主题>/ 结构上(北宁、海防、河内、岘港、胡志明市的产业园、投资、物流、成本等),PetalBot(越南语索引)同样集中在越南语城市页与越南语内容页。这说明:要进入某个国家的 AI 语料,最有效的入口是用当地语言写的、结构清晰的本地页面,而不是把中文页机翻一份丢上去。
8 顺手修复:日志替我们找出的两个真死链
盘点过程中我们顺手清了两个只有日志才能发现的债(已修复并回读验证):
- 被已发布文章链接、但页面不存在的失效链接:两篇 9 月文章里指向 fintech-geo-opportunity.html 的链接,该页面从未上线(日志中 3 次 404)。已改为指向已发布的《越南金融业 2026 深度报告》——内链 404 = AI 爬虫跟着走一圈然后空手而归。
- 相对路径诊断页:站点首页的免费诊断入口原先使用相对路径,在部分抓取上下文里会解析成根目录下的 /diagnosis.html(404)。已统一为绝对路径 /geo/diagnosis.html。
需要提醒的是:日志里的 404 绝大多数是扫描器制造的噪声(本次窗口内被探测最多的路径是各类云凭证与配置文件)。真正要清的,是「我们自己内链指向的 404」——那才是真债。
9 落到 GEO:5 条动作与 3 个监测 KPI
5 条动作(本周就能做)
- 每月做一次日志盘点:把爬虫 UA 与来源 IP 一起看,剔除无法核验的部分,只看真实抓取量。
- 发布即同步 sitemap.xml:这是 AI 检索的第一入口(ClaudeBot 12 天读了 110 次)。
- 双语站点两侧同时发布:实测两个语言版本在 3 分钟内被同一爬虫全部收走;只发一侧等于放弃一半语料。
- 把品牌事实页写实:服务范围、价格区间、交付周期、案例、资质——用可提取的 HTML 文本,不要图片、不要 PDF、不要「请联系我们」。
- 内链 404 清零:AI 爬虫会跟着你的内链走,404 就是一次次白跑。
3 个监测 KPI(比「AI 爬虫访问量」可靠得多)
- 有效爬虫请求数:剔除未核验 IP 之后的真实抓取量——先剔噪,再看趋势。
- 新内容首次抓取时延:从上线到被首次抓取的小时数,我们的实测基线是 2-4 小时;超过 48 小时说明 sitemap 或可访问性出了问题。
- 爬虫 404 率:核验爬虫请求中 404 的占比。本次窗口内 GPTBot 有 13 次 404,已定位并修复。
结语:一手数据比行业报告更能指导动作
行业报告告诉你「AI 搜索在涨」(Gartner 2024-02、Bain、艾媒咨询 2026-02 都是这么说的);只有你自己服务器日志里的那 1,432 次请求,才能告诉你 AI 具体在抓什么、多快抓、哪里抓空了。GEO 不是把内容写多,而是让每一次抓取都拿到正确的、可引用的东西——这就是「被 AI 理解,即是被世界看见」在工程侧的含义。