行业数据

AI 爬虫的阅读画像:100 篇文章全被抓过、平均只抓 1.53 次,38.2% 的“AI 爬虫”其实在扫你的 .env(12 天 324 万条日志实测)

📅 2026年9月24日 ⏱️ 阅读时间 11分钟 🏷️ AI爬虫,GPTBot,ClaudeBot,ChatGPT,geo,服务器日志,Sitemap,llms.txt

品牌方问得最多的问题已经从「要不要做 GEO」变成了「要发多少篇才够」。这个问题没法靠感觉回答,所以我们又翻了一遍自己的服务器日志——这次不是看「谁来了」,而是把站点上的每一篇文章逐个点名100 篇文章,12 天,3,244,964 条请求,谁被 AI 读过、读了几次、多久被读走。

📊 本轮实测核心数字(越智通GEO 自站 nginx 全量日志,2026-09-24)
日志窗口2026-09-13 03:47 → 09-24 01:37(+0800),12 个自然日
总请求数3,244,964 条(11 个日志文件)
其中负载均衡健康检查3,169,376 条(97.67%)
有效请求75,588 条
AI 类爬虫请求1,661 次(占有效请求 2.2%)
被 AI 抓过的文章100 / 100 篇(中文 50 + 越南语 50)
篇均抓取次数 / 最高1.53 次 / 3 次
AI 请求里的 404 比例635 次 / 1,661 次 = 38.2%
新内容首次被外部 AI 抓取中位 4.1 小时(最快 3.7 小时)

一、100 篇文章,100 篇都被读过——但每篇平均只被读 1.53 次

先把「AI 到底看不看我的内容」这个问题一次性结掉:站点上 100 篇文章(中文资讯 38 篇、越南语资讯 38 篇、中文产业深度报告 12 篇、越南语产业深度报告 12 篇)在窗口期内 100% 都被 AI 爬虫抓取过,没有一篇是零到访。这不是「内容够不够」的问题,而是「有没有被挂在可发现的位置上」的问题。

但反过来的数字更值得看:这 100 篇文章合计只被 AI 抓了 153 次——占全部 1,661 次 AI 请求的 9.2%。也就是说,AI 请求里的九成以上根本没有落在文章正文上,而是落在首页、robots.txt、sitemap.xml,以及后面第四节要讲的扫描路径上。

内容类别篇数AI 抓取次数篇均平均体积
中文资讯文章(/geo/blog/)38651.71 次13.5 KB
越南语资讯文章(/geo/vi/blog/)38481.26 次15.9 KB
中文产业深度报告(8 章)12181.50 次19.0 KB
越南语产业深度报告(8 章)12221.83 次23.4 KB
合计1001531.53 次

一个容易被误读的细节:每篇文章恰好被 GPTBot、ClaudeBot、meta-externalagent 各抓 1 次——这正是 1.53 这个均值的来源。它不是「AI 在反复读」,而是「三种爬虫各自做过一次确认」。

二、抓取次数只有 1、2、3 三档:AI 是「确认存在」,不是「深度阅读」

把 100 篇文章按被抓次数排开,分布窄得有点残酷:68 篇只被读过 1 次,11 篇 2 次,21 篇 3 次,最高就是 3 次。没有任何一篇文章因为「写得长、写得好、数据多」而被反复读取。

我们还顺手算了一下篇幅与抓取次数的相关系数:r = 0.40(弱-中相关)。产业报告平均 19.0 KB / 23.4 KB,篇均抓取 1.50 / 1.83 次;资讯文章平均 13.5 KB / 15.9 KB,篇均 1.71 / 1.26 次——体积差了将近一倍,抓取次数却没差出一倍。

💡 这条数据的真实含义
抓取不等于引用抓取只说明「文档进了索引池」,能否被引用取决于内容结构、数据可信度与实体一致性
长度不是杠杆把 1,500 字写成 5,000 字,不会换来更多抓取,只会拉高解析成本
结构才是杠杆小标题、表格、KPI 数据条、来源标注——这些决定 AI 能不能把段落直接摘出来用

三、真正抓正文的只有 3 个爬虫,挂「AI 检索」名头的爬虫 0 次抓正文

这是本轮最有信息量的发现。1,661 次 AI 请求按身份拆开后,「正文抓取」这一列只有三行非零:GPTBot 32 次、ClaudeBot 32 次、meta-externalagent 89 次,加起来正好等于 153。而挂着「AI 检索」「AI 用户代理」名头的那些身份——OAI-SearchBot、Claude-SearchBot、PerplexityBot、ChatGPT-User、Claude-User、Perplexity-User——12 天里对文章正文的抓取是 0 次。

爬虫身份(UA 声明)总请求正文抓取404 次数404 占比
GPTBot(OpenAI 训练)369325514.9%
ClaudeBot(Anthropic)33332298.7%
meta-externalagent(Meta)256892610.2%
OAI-SearchBot16006741.9%
Claude-User9209198.9%
PerplexityBot8104859.3%
Claude-SearchBot7804557.7%
ChatGPT-User6705379.1%
Perplexity-User56056100%
Amazonbot5305298.1%
Bytespider4804797.9%
MistralAI-User29029100%
Amzn-SearchBot2602596.2%
Google-Extended1301292.3%

怎么解释?两种可能同时成立:一是检索型爬虫的抓取策略更依赖既有索引与站点地图,先拿列表页和结构信息、按需回源,而本轮窗口内没有出现需要它们回源的查询;二是这些身份里有相当一部分是冒充的——下一节的数据直接支持第二种解释。

四、38.2% 的「AI 爬虫」请求打在 404 上——它们在找 .env,不是在读你的文章

1,661 次 AI 请求里,635 次(38.2%)的响应码是 404。把 404 的路径单独拉出来看,性质就暴露了:

更直接的证据在身份分布上:meta-externalagent 的 256 次请求来自 95 个不同 IP;而同期的 ClaudeBot 只用了 24 个 IP、GPTBot 13 个。真正的大厂爬虫 IP 是收敛的(官方网段),而分散到几十上百个 IP 的「同名身份」,是伪装扫描器的典型特征。MistralAI-User 的 29 次请求 100% 是 404、Perplexity-User 56 次也是 100% 404——一个「用户触发的抓取代理」不可能只访问不存在的路径。

⚠️ 三条实操结论
统计口径不要用 UA 判断「AI 来了多少次」——本轮 38.2% 的 AI 请求是伪装扫描;必须叠加 IP 段/反向解析交叉验证
安全视角AI 爬虫流量里混着凭据扫描,12 天 635 次;这不是 GEO 问题,是安全面问题
内容视角真正进正文的三家(GPTBot / ClaudeBot / meta-externalagent)才是内容侧要服务好的对象

五、AI 靠 robots.txt 和 sitemap.xml 找路;llms.txt 12 天 0 次读取

爬虫怎么找到那 100 篇文章?本轮窗口里的路径排序是:首页 159 次 > robots.txt 151 次 > sitemap.xml 111 次 > 文章正文 153 次(分散在 100 个 URL 上)

对比之下,站点根目录的 llms.txt 在整个 12 天窗口里被 AI 类爬虫读取 0 次。这不代表 llms.txt 毫无意义(它是给新型 AI 工具准备的低成本索引),但它说明一件很现实的事:在 2026 年的抓取现实里,sitemap 与 robots 仍是「主要道路」,llms.txt 还只是「路牌」。资源有限时,优先修 sitemap 的完整性与 robots 的放行规则,而不是先做一份漂亮的 llms.txt。

六、新内容 4 小时被 AI 抓走,中越双版本几乎同时被读

窗口内发布、且已被抓到的文章共 19 篇(含中越双语),从发布到首次被 AI 抓取的中位延迟是 4.1 小时,最快 3.7 小时。观察时间戳可以发现抓取是按固定节奏跑的:本站每天凌晨 02:00–02:30 部署新内容,抓取高峰落在 03:40–05:50 之间。

文章(发布日)语言首次被 AI 抓取延迟
越南市场有两个 AI 入口(09-21)中文09-21 03:403.7 小时
越南市场有两个 AI 入口(09-21)越南语09-21 03:393.7 小时
越南水产品 2026 深度报告(09-23)中文09-23 03:493.8 小时
越南水产品 2026 深度报告(09-23)越南语09-23 03:483.8 小时
越南零售业 AI 就绪度实测(09-20)中文09-20 03:543.9 小时
越南木材与家具 2026 报告(09-20)中文09-20 03:533.9 小时
越南稀土与关键矿产报告(09-18)中文09-18 04:004.0 小时
越南稀土与关键矿产报告(09-18)越南语09-18 04:034.1 小时

另一个细节值得所有做双语站的人注意:中越两个版本几乎是同一分钟内被先后抓走的(03:39 / 03:40、03:48 / 03:49)。说明爬虫不是「先读中文、以后再读译文」,而是把两个 hreflang 互链的页面当成同一批内容处理——这意味着越南语版本没有滞后成本,也没有「等翻译攒够量再上线」的理由。

七、越南语镜像不是「翻译作业」:50 个双语 slug,两侧 100% 被 AI 抓过

本站 50 个内容主题全部有中越双语版本(信息架构与 hreflang 互链见站点结构页)。本轮实测结果:50 个 slug 的双语页面 100% 都被 AI 爬虫抓取过,其中越南语产业深度报告篇均 1.83 次,甚至高于中文版的 1.50 次。

把它放进市场背景里看更有说服力:越南的 ChatGPT 覆盖率已达 81%,付费用户超过半数(Technode,2025-08);同时越南 AI 采用率为 23.5%、全球第 38(台湾外贸协会)。一边是极高的 AI 工具渗透,一边是偏低的系统化采用——这正是越南语内容在 AI 答案里「竞争还很少」的窗口期。

八、把这份画像翻成三条可执行动作

九、方法、口径与免责

数据来源:越智通GEO 自站 yuezhitong.com 的 nginx 全量访问日志,窗口 2026-09-13 03:47:51 → 2026-09-24 01:37:31(+0800),覆盖 11 个日志文件(10 个按日轮转归档 + 当日实时日志),合计 3,244,964 条请求

处理口径:①先剔除负载均衡健康检查(UA = SLBHealthCheck,3,169,376 条,占 97.67%);②用 UA 声明做初筛,把 14 类身份归入「AI 类爬虫」(GPTBot / OAI-SearchBot / ChatGPT-User / ClaudeBot / Claude-SearchBot / Claude-User / PerplexityBot / Perplexity-User / Google-Extended / Bytespider / Amazonbot / Amzn-SearchBot / meta-externalagent / MistralAI-User);③路径去掉查询串后按文章 URL 精确匹配,逐篇点名;④「正文抓取」定义为请求命中 /geo/blog/{slug}.html 或 /geo/vietnam-industry/{slug}.html 或对应越南语路径;⑤首次抓取延迟 = 文章 article:published_time(00:00)到该 URL 首条 AI 请求的时间差,只统计窗口内发布且被抓到的 19 篇。

免责声明:以上全部数字仅代表本站这一窗口的流量特征,AI 厂商会调整爬虫网段与抓取策略,历史结论不可直接外推为「平台规则」。文中外部市场数据均标注机构与时间,可按来源核对。

越南市场有两个 AI 入口:谁在抓你的站,谁从来没来过 10 天 282 万条日志实测:GPTBot 比 OAI-SearchBot 多 3.5 倍、越南本土爬虫 0 次、1 个 IP 换 16 种身份 AI 爬虫实测报告:服务器日志里的 6 个发现 420 万条请求的三层核验法,与本文构成「先看结构、再点名到篇」的两步实测 llms.txt 到底有没有用?写给 AI 爬虫的索引文件 本文实测 llms.txt 12 天 0 次读取——它和 sitemap 的关系该怎么排优先级

🎁 免费领取AI可见性诊断

你的品牌在ChatGPT、Perplexity、Google AI Overviews中被引用了吗?
越智通GEO团队为你提供免费的AI可见性诊断,找出品牌在AI答案中的隐形原因,给出可落地的优化建议。

立即领取免费诊断 →
✅ 30分钟深度诊断 ✅ AI引用现状分析 ✅ 竞品对比报告 ✅ 优化建议清单
数据来源:越智通GEO 站点 nginx 全量日志(yuezhitong.com,2026-09-13 → 2026-09-24,3,244,964 条请求;方法:剔除健康检查 + UA 声明初筛 + 路径行为分类 + 逐篇点名)· Gartner(2024-02,传统搜索 2026 降 25%)· Bain(80% 消费者至少 40% 搜索依赖 AI)· 艾媒咨询(2026-02,中国 GEO 市场 2025 年 349.3 亿元 → 2026E 942 亿元)· Technode(2025-08,越南 ChatGPT 覆盖率 81%)· 台湾外贸协会(越南 AI 采用率 23.5%,全球第 38)· 2026-09-24 本站实测
免责声明:本文数据来自公开研究报告与本站实测,仅供参考。具体GEO策略需结合企业实际情况调整。