越南品牌方最近问得最多的一个问题是:「我们到底要出现在哪里,才算在 AI 里被看见?」答案是三个完全不同的入口,而不是「ChatGPT」四个字。为了说清楚这件事,我们做了一件同行很少做的事:把自己站点 10 天的服务器日志全部翻出来,一条条核验——到底是谁在抓我们的内容,谁一次都没有来过。
一、第一轨:Google 占 94.72%,本土 Cốc Cốc 只剩 4.44%
先看盘子。越南搜索市场 2026 年 8 月的份额是:Google 94.72%、Cốc Cốc 4.44%、Bing 0.47%、Yahoo 0.27%、DuckDuckGo 0.04%(Statcounter,2026-08)。Cốc Cốc 是越南唯一「Make in Vietnam」的浏览器与搜索引擎,2022 年被越南信息与通信部列入国家数字平台名单;到 2023 年 5 月它上线 AI 双产品时,已有超过 2,900 万用户、搜索每月处理 6 亿次以上查询(VnEconomy,2023-05)。
真正值得注意的不是 4.44% 这个数字,而是它的产品形态:Cốc Cốc AI Search 把多个来源摘要成一段回答,官方给出的响应时间约 2 秒,用户不必再点开网站。也就是说,越南本土引擎已经在做和 ChatGPT、Google AI Overviews 同样的事——把「链接列表」换成「答案」。你的品牌如果没有出现在被摘要的那几个来源里,就在这 4.44% 里隐形了。
二、第二轨:Zalo 里的 8,130 万人,AI 入口在聊天框里
第二条轨道不在浏览器里。VNG 2026 年第二季度财报显示:Zalo 月活 8,130 万,每天承载 22 亿条消息;约 2,400 万人每月使用 AI 加持的消息与通话功能,同比增长 33%;消息与 AI 板块收入 6,390 亿越南盾,同比增长 63%。同一份财报里,云服务 GreenNode 的 AI Cloud 收入同比增长 271%,已服务超过 1,000 家企业客户(Technode,2026-08)。Zalo AI 的越南语语音助手 Kiki 拿到过本地科技奖项。
对一个越南品牌来说,这意味着第二类入口:客户不在搜索引擎里问你,而是在每天打开的聊天框里问 AI。这类入口的可见度规则跟网页排名完全是两回事——它取决于本地内容生态、企业号资料、以及你被引用的本地信源。
三、第三轨:全球 AI 引擎,越南 ChatGPT 覆盖率 81%
第三条轨道是全球引擎在越南的渗透:ChatGPT 在越南的覆盖率 81%,付费用户超过半数(Technode,2025-08);越南整体 AI 采用率 23.5%,全球第 38 位。放到全球背景看:Gartner(2024-02)预测传统搜索流量 2026 年下降 25%;Bain 的调研显示 80% 消费者至少 40% 的搜索行为已经依赖 AI 结果。作为对照,中国 GEO 市场从 2025 年的 349.3 亿元增长到 2026 年预计的 942 亿元(艾媒咨询,2026-02)——同一套逻辑正在越南重演,只是入口更多。
四、我们翻了 10 天 282 万条日志:方法先说清楚
结论要经得起复算,所以方法先摆出来。窗口:2026-09-11 03:29 → 2026-09-21 02:02(+0800),覆盖 yuezhitong.com 的全部 nginx 访问日志(9 个归档文件 + 当日实时日志,共 2,820,868 条请求)。核验分三层:① UA 声明;② 反向解析(rDNS)与厂商公开网段交叉核验;③ 请求路径行为分类。本站自测流量(3 个自有 IP)全部剔除。
清洗出的第一个数字就说明问题:282 万条请求里,274.9 万条(97.5%)是负载均衡健康检查,真正来自人类与爬虫的只有 71,061 条。任何跳过这一步清洗的「流量分析」,结论都是垃圾——这也是很多企业拿到服务器日志后看不出任何东西的原因。
五、发现一:AI 爬虫只占 4.65%,但这 4.65% 决定一切
| 爬虫身份 | 用途 | 请求数 |
|---|---|---|
| Googlebot | 搜索索引 | 1,657 |
| GPTBot | 模型训练抓取 | 419 |
| ClaudeBot | 模型训练抓取 | 362 |
| PetalBot | 搜索索引(华为) | 211 |
| OAI-SearchBot | 检索式引用 | 120 |
| Bingbot | 搜索索引 | 98 |
| 其余 14 个身份 | 引用 / 训练 / 预览 | 435 |
剔除自测后,10 天里 AI 相关爬虫请求共 3,302 次,占有效请求的 4.65%。值得单独注意的是:GPTBot(训练用)比 OAI-SearchBot(检索引用用)多 3.5 倍。这两个身份在技术上就是两件事——被训练抓走,不等于会被引用;被引用,才有流量和信任。如果你的日志里只有 GPTBot 而没有 OAI-SearchBot / Claude-SearchBot / PerplexityBot,说明你的内容被「读走」了,但还没有进入答案。
六、发现二:越南本土引擎的爬虫,10 天 0 次到访
这是本轮最反直觉的一条。我们对日志做了宽口径扫描,关键词包含越南语变音符号写法(Cốc Cốc / CocCoc / Coc Coc / ZaloBot / Zalo Bot / ViettelBot / KiKi Bot 等),命中数为 0。此前看似命中的 fpt、zalo、shopee、tiki,逐一核对后全部来自文章 URL 里出现的词,不是爬虫身份。
结论要说准确:不是「本土引擎不重要」,而是本土入口的收录逻辑与国际爬虫不一样。它更多依赖本地内容生态、平台合作、超级应用内部数据,而不是你放在站点根目录的 robots.txt 与 sitemap。所以越南品牌的正确做法不是「等它来抓」,而是「主动在它依赖的本地信源里出现」——这也解释了为什么很多越南本地品牌在 Google 上排得很好,却在 AI 答案里完全消失。
七、发现三:一个 IP,88 秒,16 种 AI 爬虫身份
上一期我们报告过:自称 AI 爬虫的请求里,83.9% 无法通过来源核验。这一轮我们拿到了更直接的证据。IP 34.7.24.213(Google Cloud 主机段)在 09-13 的 88 秒内发出 442 次请求,轮换了 16 种身份:GPTBot、ClaudeBot、Claude-SearchBot、Claude-User、PerplexityBot、Perplexity-User、OAI-SearchBot、ChatGPT-User、Applebot、Amazonbot、Amzn-SearchBot、Bytespider、Google-Extended、meta-externalagent,甚至还有 GrokBot 与 facebookexternalhit。
真正的 AI 爬虫不会去找服务器凭证。同一次访问里,它有 100 次请求的目标是凭证与配置文件:/aws/credentials、/.env、/@fs/proc/1/environ、/.zshrc、/wp-config.php.swp、/__aws_leak_probe_… 这类路径。伪装身份 + 扫描凭证的组合,说明它不是任何一家 AI 公司的爬虫。
对企业的实操含义有两条:第一,统计 AI 可见度不能只看 UA——UA 是最容易被伪造的字段,必须用 IP 反解与厂商公开网段核验;第二,「AI 爬虫来访量暴涨」不一定是好消息,可能只是被人扫了一遍。
八、发现四:AI 爬虫靠 sitemap 找路,不靠你的站内链
10 天里 AI 爬虫读 robots.txt 231 次、读 sitemap.xml 139 次,而 llms.txt 的外部读取只有 3 次——这 3 次的 UA 还都是普通浏览器标识,没有一个是主流 AI 爬虫。llms.txt 上线已 5 天,主流 AI 爬虫读取次数仍是 0,与上一期(9 月 19 日)的观察一致。
同期 AI 爬虫读取本站 /geo/ 内容共 178 次,路径分布呈现明显的「sitemap 驱动」特征:中文页与越南语页成对出现,同一篇内容的两个语言版本被依次读走。这说明:sitemap 是 AI 发现内容的主干道,站内链接的权重远低于我们的直觉。把新文章放进 sitemap,比在首页挂一个链接更有效。至于 llms.txt,现阶段它是「写给未来」的资产,不是收录开关。
九、发现五:新内容 2 小时内被 AI 抓走,双语 5 分钟抓全
09-20 凌晨 01:44 我们发布了两篇新内容(中越双语共 4 个页面)。第一次被外部 AI 爬虫取走的时间是 03:51(越南语版本),随后 5 分钟内中文产业报告、中文文章、越南语产业报告全部被抓完。也就是说,放进 sitemap 的新链接,AI 大约 2 小时内就会来取——与上一期测到的 2–4 小时窗口一致。
这条数据对内容排期的意义很直接:新内容上线后的前 2 小时,是它进入 AI 语料的关键窗口。发布时同步更新 sitemap、保持页面可抓(不要登录墙、不要 JS 渲染正文),比事后「优化」重要得多。
十、给越南品牌的三个可执行结论
1. 按三个入口分别布局,不要只买「AI 搜索」这个词。全球 AI 引擎(要被抓 + 要结构化)、本土引擎与超级应用(Cốc Cốc AI Search / Zalo 生态,靠本地信源与内容生态)、以及你所在行业的垂直媒体与平台。三条入口的可见度规则不同,投放与内容策略也应该不同。
2. 把 sitemap、hreflang、结构化数据当成主干道。实测显示 AI 靠 sitemap 找路、靠结构化数据读懂事实、靠 robots.txt 确认许可。这三样东西的投入产出比,远高于反复修改首页文案。
3. 建自己的抓取与引用监测,以 IP 核验为准。UA 统计会把你带向错误结论(本轮实测:97.5% 的请求是健康检查,另有 16 种身份来自同一个伪装 IP)。只看「有多少 AI 爬虫来过」是假指标,真正的指标是「哪些页面被引用、被谁引用、引用得对不对」。
如果你想先知道自己在三个入口里的现状,可以从一次免费诊断开始:我们会给出品牌在主流 AI 引擎中的引用现状、结构化数据缺口与优先级清单。