品牌方问得最多的问题已经从「要不要做 GEO」变成了「要发多少篇才够」。这个问题没法靠感觉回答,所以我们又翻了一遍自己的服务器日志——这次不是看「谁来了」,而是把站点上的每一篇文章逐个点名:100 篇文章,12 天,3,244,964 条请求,谁被 AI 读过、读了几次、多久被读走。
一、100 篇文章,100 篇都被读过——但每篇平均只被读 1.53 次
先把「AI 到底看不看我的内容」这个问题一次性结掉:站点上 100 篇文章(中文资讯 38 篇、越南语资讯 38 篇、中文产业深度报告 12 篇、越南语产业深度报告 12 篇)在窗口期内 100% 都被 AI 爬虫抓取过,没有一篇是零到访。这不是「内容够不够」的问题,而是「有没有被挂在可发现的位置上」的问题。
但反过来的数字更值得看:这 100 篇文章合计只被 AI 抓了 153 次——占全部 1,661 次 AI 请求的 9.2%。也就是说,AI 请求里的九成以上根本没有落在文章正文上,而是落在首页、robots.txt、sitemap.xml,以及后面第四节要讲的扫描路径上。
| 内容类别 | 篇数 | AI 抓取次数 | 篇均 | 平均体积 |
|---|---|---|---|---|
| 中文资讯文章(/geo/blog/) | 38 | 65 | 1.71 次 | 13.5 KB |
| 越南语资讯文章(/geo/vi/blog/) | 38 | 48 | 1.26 次 | 15.9 KB |
| 中文产业深度报告(8 章) | 12 | 18 | 1.50 次 | 19.0 KB |
| 越南语产业深度报告(8 章) | 12 | 22 | 1.83 次 | 23.4 KB |
| 合计 | 100 | 153 | 1.53 次 | — |
一个容易被误读的细节:每篇文章恰好被 GPTBot、ClaudeBot、meta-externalagent 各抓 1 次——这正是 1.53 这个均值的来源。它不是「AI 在反复读」,而是「三种爬虫各自做过一次确认」。
二、抓取次数只有 1、2、3 三档:AI 是「确认存在」,不是「深度阅读」
把 100 篇文章按被抓次数排开,分布窄得有点残酷:68 篇只被读过 1 次,11 篇 2 次,21 篇 3 次,最高就是 3 次。没有任何一篇文章因为「写得长、写得好、数据多」而被反复读取。
我们还顺手算了一下篇幅与抓取次数的相关系数:r = 0.40(弱-中相关)。产业报告平均 19.0 KB / 23.4 KB,篇均抓取 1.50 / 1.83 次;资讯文章平均 13.5 KB / 15.9 KB,篇均 1.71 / 1.26 次——体积差了将近一倍,抓取次数却没差出一倍。
三、真正抓正文的只有 3 个爬虫,挂「AI 检索」名头的爬虫 0 次抓正文
这是本轮最有信息量的发现。1,661 次 AI 请求按身份拆开后,「正文抓取」这一列只有三行非零:GPTBot 32 次、ClaudeBot 32 次、meta-externalagent 89 次,加起来正好等于 153。而挂着「AI 检索」「AI 用户代理」名头的那些身份——OAI-SearchBot、Claude-SearchBot、PerplexityBot、ChatGPT-User、Claude-User、Perplexity-User——12 天里对文章正文的抓取是 0 次。
| 爬虫身份(UA 声明) | 总请求 | 正文抓取 | 404 次数 | 404 占比 |
|---|---|---|---|---|
| GPTBot(OpenAI 训练) | 369 | 32 | 55 | 14.9% |
| ClaudeBot(Anthropic) | 333 | 32 | 29 | 8.7% |
| meta-externalagent(Meta) | 256 | 89 | 26 | 10.2% |
| OAI-SearchBot | 160 | 0 | 67 | 41.9% |
| Claude-User | 92 | 0 | 91 | 98.9% |
| PerplexityBot | 81 | 0 | 48 | 59.3% |
| Claude-SearchBot | 78 | 0 | 45 | 57.7% |
| ChatGPT-User | 67 | 0 | 53 | 79.1% |
| Perplexity-User | 56 | 0 | 56 | 100% |
| Amazonbot | 53 | 0 | 52 | 98.1% |
| Bytespider | 48 | 0 | 47 | 97.9% |
| MistralAI-User | 29 | 0 | 29 | 100% |
| Amzn-SearchBot | 26 | 0 | 25 | 96.2% |
| Google-Extended | 13 | 0 | 12 | 92.3% |
怎么解释?两种可能同时成立:一是检索型爬虫的抓取策略更依赖既有索引与站点地图,先拿列表页和结构信息、按需回源,而本轮窗口内没有出现需要它们回源的查询;二是这些身份里有相当一部分是冒充的——下一节的数据直接支持第二种解释。
四、38.2% 的「AI 爬虫」请求打在 404 上——它们在找 .env,不是在读你的文章
1,661 次 AI 请求里,635 次(38.2%)的响应码是 404。把 404 的路径单独拉出来看,性质就暴露了:
/.env.production、/.env.local、/backend/.env、/api/.env、/frontend/.env、/services/.env、/@fs/.env—— 环境变量文件扫描(7 种路径变体)/privatekey.key、/.bash_profile—— 私钥与凭据文件/index.php、/_debugbar/open、/actuator/configprops—— 按 PHP/Laravel/Spring 栈盲扫/runtime-config.js、/firebase-config.json、/configuration.js—— 前端配置窃取/fetch(27 次)、/proxy(12 次)、/article/null(5 次)—— 代理滥用探测与空参数探测
更直接的证据在身份分布上:meta-externalagent 的 256 次请求来自 95 个不同 IP;而同期的 ClaudeBot 只用了 24 个 IP、GPTBot 13 个。真正的大厂爬虫 IP 是收敛的(官方网段),而分散到几十上百个 IP 的「同名身份」,是伪装扫描器的典型特征。MistralAI-User 的 29 次请求 100% 是 404、Perplexity-User 56 次也是 100% 404——一个「用户触发的抓取代理」不可能只访问不存在的路径。
五、AI 靠 robots.txt 和 sitemap.xml 找路;llms.txt 12 天 0 次读取
爬虫怎么找到那 100 篇文章?本轮窗口里的路径排序是:首页 159 次 > robots.txt 151 次 > sitemap.xml 111 次 > 文章正文 153 次(分散在 100 个 URL 上)。
对比之下,站点根目录的 llms.txt 在整个 12 天窗口里被 AI 类爬虫读取 0 次。这不代表 llms.txt 毫无意义(它是给新型 AI 工具准备的低成本索引),但它说明一件很现实的事:在 2026 年的抓取现实里,sitemap 与 robots 仍是「主要道路」,llms.txt 还只是「路牌」。资源有限时,优先修 sitemap 的完整性与 robots 的放行规则,而不是先做一份漂亮的 llms.txt。
六、新内容 4 小时被 AI 抓走,中越双版本几乎同时被读
窗口内发布、且已被抓到的文章共 19 篇(含中越双语),从发布到首次被 AI 抓取的中位延迟是 4.1 小时,最快 3.7 小时。观察时间戳可以发现抓取是按固定节奏跑的:本站每天凌晨 02:00–02:30 部署新内容,抓取高峰落在 03:40–05:50 之间。
| 文章(发布日) | 语言 | 首次被 AI 抓取 | 延迟 |
|---|---|---|---|
| 越南市场有两个 AI 入口(09-21) | 中文 | 09-21 03:40 | 3.7 小时 |
| 越南市场有两个 AI 入口(09-21) | 越南语 | 09-21 03:39 | 3.7 小时 |
| 越南水产品 2026 深度报告(09-23) | 中文 | 09-23 03:49 | 3.8 小时 |
| 越南水产品 2026 深度报告(09-23) | 越南语 | 09-23 03:48 | 3.8 小时 |
| 越南零售业 AI 就绪度实测(09-20) | 中文 | 09-20 03:54 | 3.9 小时 |
| 越南木材与家具 2026 报告(09-20) | 中文 | 09-20 03:53 | 3.9 小时 |
| 越南稀土与关键矿产报告(09-18) | 中文 | 09-18 04:00 | 4.0 小时 |
| 越南稀土与关键矿产报告(09-18) | 越南语 | 09-18 04:03 | 4.1 小时 |
另一个细节值得所有做双语站的人注意:中越两个版本几乎是同一分钟内被先后抓走的(03:39 / 03:40、03:48 / 03:49)。说明爬虫不是「先读中文、以后再读译文」,而是把两个 hreflang 互链的页面当成同一批内容处理——这意味着越南语版本没有滞后成本,也没有「等翻译攒够量再上线」的理由。
七、越南语镜像不是「翻译作业」:50 个双语 slug,两侧 100% 被 AI 抓过
本站 50 个内容主题全部有中越双语版本(信息架构与 hreflang 互链见站点结构页)。本轮实测结果:50 个 slug 的双语页面 100% 都被 AI 爬虫抓取过,其中越南语产业深度报告篇均 1.83 次,甚至高于中文版的 1.50 次。
把它放进市场背景里看更有说服力:越南的 ChatGPT 覆盖率已达 81%,付费用户超过半数(Technode,2025-08);同时越南 AI 采用率为 23.5%、全球第 38(台湾外贸协会)。一边是极高的 AI 工具渗透,一边是偏低的系统化采用——这正是越南语内容在 AI 答案里「竞争还很少」的窗口期。
八、把这份画像翻成三条可执行动作
- 动作一:把 sitemap 当成第一优先级。本轮 AI 通过 sitemap 找路 111 次、通过 robots 151 次,而 llms.txt 是 0 次。新页面发布后的第一件事不是写推广文案,而是确认它进了 sitemap 且有真实内链指向它。没有入口的内容,等于没有发布。
- 动作二:为「确认存在」而写,不要为「深度阅读」而写。抓取次数只有 1–3 档、篇幅相关系数 r = 0.40,说明长度不是杠杆。把每篇文章写成可被直接摘取的结构:小标题分章、表格承载对比数据、数据条承载 KPI、来源标注到机构 + 年份。
- 动作三:把 AI 爬虫流量当成两件事分开处理。内容侧只服务真正抓正文的三家(GPTBot / ClaudeBot / meta-externalagent);安全侧把 38.2% 的 404 扫描(.env、私钥、配置文件)当攻击面,而不是当成「AI 很关注我」。
九、方法、口径与免责
数据来源:越智通GEO 自站 yuezhitong.com 的 nginx 全量访问日志,窗口 2026-09-13 03:47:51 → 2026-09-24 01:37:31(+0800),覆盖 11 个日志文件(10 个按日轮转归档 + 当日实时日志),合计 3,244,964 条请求。
处理口径:①先剔除负载均衡健康检查(UA = SLBHealthCheck,3,169,376 条,占 97.67%);②用 UA 声明做初筛,把 14 类身份归入「AI 类爬虫」(GPTBot / OAI-SearchBot / ChatGPT-User / ClaudeBot / Claude-SearchBot / Claude-User / PerplexityBot / Perplexity-User / Google-Extended / Bytespider / Amazonbot / Amzn-SearchBot / meta-externalagent / MistralAI-User);③路径去掉查询串后按文章 URL 精确匹配,逐篇点名;④「正文抓取」定义为请求命中 /geo/blog/{slug}.html 或 /geo/vietnam-industry/{slug}.html 或对应越南语路径;⑤首次抓取延迟 = 文章 article:published_time(00:00)到该 URL 首条 AI 请求的时间差,只统计窗口内发布且被抓到的 19 篇。
免责声明:以上全部数字仅代表本站这一窗口的流量特征,AI 厂商会调整爬虫网段与抓取策略,历史结论不可直接外推为「平台规则」。文中外部市场数据均标注机构与时间,可按来源核对。