📡 一手数据实测

AI 爬虫实测报告:420 万条服务器日志里的 6 个发现

📅 2026年9月19日 ⏱️ 阅读时间 12分钟 🏷️ AI爬虫 · 服务器日志 · GPTBot · ClaudeBot · sitemap · 一手实测

传统搜索流量 2026 年预计下降 25%(Gartner,2024 年 2 月)、80% 消费者至少 40% 的搜索行为依赖 AI 结果(Bain & Company)、中国 GEO 市场从 2025 年的 349.3 亿元冲向 2026 年的 942 亿元(艾媒咨询,2026 年 2 月)时,行业里几乎所有的内容方法论都建立在一个从未被验证的前提上:AI 爬虫真的在抓我们的网页,而且抓的是我们以为的那些页面。

这个前提值得验一遍。我们打开了自己站点的服务器日志,把 12 天、420 万条请求全部拆开,逐条判断「谁来了、以什么身份、抓了什么、拿到什么状态码」。本文是这次盘点的完整结果——6 个发现,其中 3 个和我们原本的预期相反

📊 本次盘点样本(越智通GEO 站点一手日志,非第三方估算)
观测窗口(站点服务器 nginx 全量访问日志)2026-09-08 → 09-19 · 12 天
总请求量4,206,895 条
自称 AI / 搜索引擎爬虫的请求8,920 条
来源 IP 通过厂商公开网段核验的身份请求1,432 条(16.1%)

1 方法:怎么判断一个「AI 爬虫」是真的

只看 User-Agent 的统计会严重高估。任何人都能把 UA 改成 GPTBot。我们的判定用了三层规则,三者同时满足才算「验证通过」:

  1. 身份声明:请求的 User-Agent 与厂商公布的爬虫名称一致(OpenAI、Anthropic、Google、Microsoft、Naver 等官方文档)。
  2. 来源可核验:请求 IP 落在该厂商公布或可通过反向解析核验的网段内(例如 crawl-*.googlebot.com*.petalsearch.com*.search.msn.com,或 OpenAI / Anthropic 公开的 IP 段)。
  3. 行为信号:是否遵守 robots.txt、是否读取 sitemap.xml、请求路径是不是真实内容页。

第 2 条是分水岭。2026 年的现实是:AI 爬虫标签已经成了攻击流量的免费马甲——扫描器把 UA 换成 AI 厂商名字,既能绕过一部分粗糙的封禁规则,又容易被误统计成「AI 很关注我们」。

2 发现一:5 个 IP 轮流冒充 13 种爬虫

先看有公开网段可以核验的几家。同为「Googlebot」,自称 5,564 次,只有 395 次来自 Google 的真实网段

🔍 自称身份 vs IP 核验结果(同一观测窗口)
Googlebot(自称 / 核验通过 / 无法核验)5,564 / 395 / 5,169
GPTBot(自称 / 核验通过 / 无法核验)612 / 373 / 239
ClaudeBot(自称 / 核验通过 / 无法核验)450 / 331 / 119
OAI-SearchBot(自称 / 核验通过 / 无法核验)312 / 52 / 260
PetalBot / Bingbot(均 100% 通过核验)195 / 86

真正能定性的是下面这一组数据:有 5 个 IP,每个 IP 在 12 天里分别使用过 12-13 种不同的 AI 爬虫身份——同一个来源,上一分钟是 GPTBot,下一分钟是 ClaudeBot,再下一分钟是 PerplexityBot、Bytespider、meta-externalagent。

🚨 单一 IP 使用的爬虫身份数(≥3 即视为身份轮换)
34.143.255.45 / 34.156.53.196 / 34.7.24.213各 13 种
95.216.142.212 / 104.28.217.139各 12 种
这些 IP 请求的路径/fetch、/proxy、/.env、/.gcloud/credentials

它们的请求路径全部是扫描器特征(探测环境变量、云凭证、代理端点),与「抓取内容」毫无关系。结论:AI 爬虫统计里 83.9% 的请求身份存疑,不能作为 GEO 效果的证据。如果你对外汇报「本月 AI 爬虫访问增长 300%」,先验 IP——那很可能是扫描器换了个名字。

🧭 需要补充一句严谨的例外:ChatGPT-User、Claude-User、Perplexity-User 属于「用户触发的实时抓取」,厂商并未公布固定网段,本文将其计为「无法核验」而非「冒充」——这两件事性质不同,混为一谈同样是错的口径。

3 发现二:真正在抓内容的只有 6 个身份

把无法核验的部分剔除后,12 天里真正在抓我们内容的只有 6 个身份、合计 1,432 次请求,平均每天 119 次

🤖 核验通过的爬虫行为明细(12 天)
Googlebot:有效请求 / 独立路径 / 404395 / 112 / 2
GPTBot:有效请求 / 独立路径 / 404373 / 304 / 13
ClaudeBot:有效请求 / 独立路径 / 404331 / 107 / 2
PetalBot(越南语索引):有效请求 / 独立路径195 / 148
Bingbot / OAI-SearchBot:有效请求86 / 52

三种性格差异非常明显:GPTBot 是广度型(373 次请求打到了 304 条不同路径,几乎把能读的都读一遍);Googlebot 集中(112 条路径,聚焦越南城市页);ClaudeBot 的次数最多但绝大多数不是内容——这就是下一个发现。

4 发现三:ClaudeBot 三分之二的动作是读 robots.txt 和 sitemap.xml

ClaudeBot 在 12 天里对我们的 robots.txt 请求 110 次、sitemap.xml 请求 110 次——两个文件合计 220 次,占它全部 331 次核验请求的 66.5%。而且几乎每天成对出现,时间戳紧挨着:09-08 03:47:31 同秒发出两次请求,09-19 00:53 又是一对。

这就是 AI 检索的工作方式:先读权限、再读索引、最后才取内容。它给我们的行动指向非常直接——

5 发现四:新文章上线后 2-4 小时被首次抓取(实测时间线)

我们用服务器上文章文件的落盘时间,和日志里爬虫第一次访问该 URL 的时间做了对照。三篇新内容的实测结果如下:

⏱️ 上线 → 被 AI 爬虫首次抓取(实测)
越南语GEO实操方法论(09-13 02:03 上线)2 小时 48 分
robots.txt / llms.txt 指南(09-17 02:10 上线)3 小时 45 分
越南稀土与关键矿产报告(09-18 02:07 上线)1 小时 53 分

还有两个细节值得记下来:

6 发现五:llms.txt 上线 48 小时,0 次被抓

这个发现和我们的预期相反,也和我们上一篇文章的推荐形成了对照。我们在 09-17 上线了站点级 llms.txt,并在 robots.txt 里注明了它的路径。截至 09-19 02:00:

📄 三个「AI 导航文件」的实际被抓次数(12 天)
/robots.txt(ClaudeBot 110 · OAI-SearchBot 22 · Googlebot 49)合计 191 次
/sitemap.xml(ClaudeBot 110 · GPTBot 8 · Bingbot 12)合计 132 次
/llms.txt(全部核验爬虫)0 次

诚实结论:llms.txt 目前仍处在「有规范、无爬虫」的阶段。它由 Jeremy Howard 在 2024 年 9 月提出,是倡议而非 IETF/W3C 标准;到 2026 年 9 月,主流 AI 检索爬虫还没有把它纳入常规抓取路径——至少对访问量在我们这个量级的站点是如此。

这不意味着不该写。我们的判断是:成本 1 小时、只是把一个 Markdown 文件放到站点根目录,写;但不能把它当成「AI 收录开关」,更不能替代 sitemap.xml 与 robots.txt。当厂商开始读它的时候,你已经就位;在那之前,GEO 的工程量应该花在真正被读的地方。

7 发现六:AI 爬虫爱看什么页面

把路径打开看,两类页面的权重被明显区分出来了。

第一类:品牌事实页(GPTBot 的主战场)

GPTBot 反复抓取的是:首页、/about.html(关于我们)、/services.html(服务)、/pricing.html(报价)、/cases.html(案例)、/terms.html 与 /privacy.html(条款隐私),以及各业务线的价格页与样式文件。它要的是「你是谁、做什么、多少钱、做过什么」的确定性事实——这正是 AI 回答用户提问时最需要引用的原材料。

反过来讲:很多企业把「关于我们」写成形容词堆叠的抒情文案,把报价藏进「请联系我们」,等于主动放弃了最容易被引用的位置。

第二类:本地化城市页(Googlebot 与 PetalBot 的主战场)

Googlebot 的 112 条路径几乎全部落在 /vietnam/<城市>/<主题>/ 结构上(北宁、海防、河内、岘港、胡志明市的产业园、投资、物流、成本等),PetalBot(越南语索引)同样集中在越南语城市页与越南语内容页。这说明:要进入某个国家的 AI 语料,最有效的入口是用当地语言写的、结构清晰的本地页面,而不是把中文页机翻一份丢上去。

8 顺手修复:日志替我们找出的两个真死链

盘点过程中我们顺手清了两个只有日志才能发现的债(已修复并回读验证):

需要提醒的是:日志里的 404 绝大多数是扫描器制造的噪声(本次窗口内被探测最多的路径是各类云凭证与配置文件)。真正要清的,是「我们自己内链指向的 404」——那才是真债。

9 落到 GEO:5 条动作与 3 个监测 KPI

5 条动作(本周就能做)

  1. 每月做一次日志盘点:把爬虫 UA 与来源 IP 一起看,剔除无法核验的部分,只看真实抓取量。
  2. 发布即同步 sitemap.xml:这是 AI 检索的第一入口(ClaudeBot 12 天读了 110 次)。
  3. 双语站点两侧同时发布:实测两个语言版本在 3 分钟内被同一爬虫全部收走;只发一侧等于放弃一半语料。
  4. 把品牌事实页写实:服务范围、价格区间、交付周期、案例、资质——用可提取的 HTML 文本,不要图片、不要 PDF、不要「请联系我们」。
  5. 内链 404 清零:AI 爬虫会跟着你的内链走,404 就是一次次白跑。

3 个监测 KPI(比「AI 爬虫访问量」可靠得多)

结语:一手数据比行业报告更能指导动作

行业报告告诉你「AI 搜索在涨」(Gartner 2024-02、Bain、艾媒咨询 2026-02 都是这么说的);只有你自己服务器日志里的那 1,432 次请求,才能告诉你 AI 具体在抓什么、多快抓、哪里抓空了。GEO 不是把内容写多,而是让每一次抓取都拿到正确的、可引用的东西——这就是「被 AI 理解,即是被世界看见」在工程侧的含义。

🛠️ 让 AI 爬虫读懂你的官网 robots.txt、llms.txt 与结构化数据的实操指南 📈 GEO 效果怎么衡量 五大指标、声量份额与 ROI 归因 🔍 AI 搜索正在取代百度 越南 78% 网民已用 AI、ChatGPT 覆盖率 81% 📡 三引擎监测体系 ChatGPT / Google / Perplexity 都被正确引用

🎁 免费领取 AI 可见性诊断

你的站点里,AI 爬虫真实抓到了什么?哪些页面从未被读过、哪些内链是 404?
越智通GEO 团队提供免费诊断:抓取日志盘点、爬虫身份核验、结构化数据与引用现状逐项出报告。

立即领取免费诊断 →
✅ 日志抓取盘点 ✅ 爬虫身份核验 ✅ sitemap / robots 体检 ✅ 优化清单
数据来源:越智通GEO 站点服务器 nginx 全量访问日志一手统计(观测窗口 2026-09-08 至 2026-09-19,4,206,895 条请求;方法:UA 声明 + 厂商公开 IP 网段/反向解析核验 + 路径分类)· Gartner(2024-02,传统搜索流量 2026 预计下降 25%)· Bain & Company(80% 消费者至少 40% 搜索依赖 AI)· 艾媒咨询(2026-02,中国 GEO 市场 2025 年 349.3 亿元 → 2026 年 942 亿元)· Technode(2025-08,越南 ChatGPT 覆盖率 81%)· RFC 9309 / IETF(2022-09,Robots Exclusion Protocol)· OpenAI、Anthropic、Google、Microsoft、Naver 官方爬虫文档 · llmstxt.org(Jeremy Howard,2024-09 提案)
免责声明:本文统计仅代表本站观测窗口内的流量特征,不同站点、行业与访问量级可能存在显著差异;爬虫 UA 与 IP 网段由厂商调整,核验结果仅对本次窗口有效。