我们每天都在帮客户测「你的品牌在 AI 答案里被提到了吗」,但很少把同一把尺子对准自己。这次做的是后者:把站点上全部 104 个内容页——39 篇中文文章、39 篇越南语文章、13 份中文产业深度报告、13 份越南语产业报告——逐个丢进自建的 AI 就绪度审计引擎,看我们自己到底在哪一维丢分。
结果比预期分裂:均分 67.62(满分 100),最高 70、最低 57,good 档(≥68 分)72 页、foundation 档 32 页。更扎眼的是结构性的那一项:8 个维度里「AI 发现端点」在 104 个页面上全部是 0 分。补齐 4 个机器可读文件(共 10,522 字节)后重测,均分升到 73.72、最高 76、good 档 98/104,且全线告别 60 分以下。
一、先把自己当成第 105 个客户:体检是怎么做的
审计引擎与诊断页上给客户用的那套完全同源:8 个维度、满分 100 分。8 个维度的权重差异很大——站级配置类维度占 64 分,页级内容类维度只占 36 分,这个比例决定了「哪里动手最划算」:
| 维度 | 满分 | 这一维在考什么 |
|---|---|---|
| AI 爬虫访问(robots.txt) | 18 | 检索类 AI 爬虫是否被显式放行 |
| llms.txt | 18 | 是否提供面向 AI 的索引文件,且结构完整 |
| 结构化数据 | 16 | JSON-LD / Schema.org 实体标注 |
| Meta 标签 | 14 | 标题、描述、canonical 等基础元数据 |
| 内容质量 | 12 | 正文体量与可提取性 |
| 技术信号 | 6 | 页面级技术可用性信号 |
| AI 发现端点 | 6 | ai.txt / summary.json / faq.json / service.json |
| 品牌实体 | 10 | 标题、H1、结构化数据里的品牌名是否一致 |
测试方式刻意选最干净的那条路:在服务器本机直调审计 API(127.0.0.1),绕开外层的请求限流桶,避免把自己的页面测成「抓取失败」。104 个页面全部拿到分数,0 个页面因抓取失败被跳过。分档门槛沿用引擎定义:68 分及以上为 good 档,68 分以下为 foundation 档——本轮实测里 good 档最低 68 分、foundation 档最高 67 分,与门槛自洽。
二、第一轮结果:均分 67.62,两个页面掉到 60 分以下
先看总分分布。修复前的分数高度集中——104 页里 86 页落在 65-69 分这个窄带里,说明这不是「内容参差不齐」,而是站级配置给全站设了一个天花板:
| 分数区间 | 页面数(修复前) | 页面数(修复后) |
|---|---|---|
| 75 分及以上 | 0 | 68 |
| 70-74 分 | 9 | 29 |
| 65-69 分 | 86 | 6 |
| 60-64 分 | 7 | 1 |
| 60 分以下 | 2 | 0 |
再看分组——两个反直觉的结论:越南语页面(均分 68.3)比中文页面(67.0)高;13 份长报告(均分 69.0)比 78 篇日常文章(67.2)高。中文日常文章是全场最低的一组(66.2)。这在实践上意味着:「翻译」并不会掉分,但「随手写的短文章」会。
| 分组 | 页面数 | 修复前均分 | 修复后均分 |
|---|---|---|---|
| 中文 · 日常文章 | 39 | 66.2 | 72.5 |
| 越南语 · 日常文章 | 39 | 68.2 | 74.2 |
| 中文 · 产业深度报告 | 13 | 69.3 | 75.3 |
| 越南语 · 产业深度报告 | 13 | 68.6 | 74.6 |
| 全部页面 | 104 | 67.62 | 73.72 |
三、8 维度体检表:哪一维接近满分,哪一维全站 0 分
把 104 页的分项得分按维度平均,强弱一目了然。请注意「得分率」这一列——它直接告诉你修补的顺序:
| 维度 | 满分 | 修复前均分 | 得分率 | 修复后均分 |
|---|---|---|---|---|
| 内容质量 | 12 | 9.98 | 83.2% | 10.08 |
| AI 爬虫访问 | 18 | 15.00 | 83.3% | 15.00 |
| 结构化数据 | 16 | 13.00 | 81.2% | 13.00 |
| Meta 标签 | 14 | 9.65 | 69.0% | 9.65 |
| llms.txt | 18 | 12.00 | 66.7% | 12.00 |
| 技术信号 | 6 | 4.00 | 66.7% | 4.00 |
| 品牌实体 | 10 | 4.89 | 48.9% | 4.89 |
| AI 发现端点 | 6 | 0.00 | 0.0% | 6.00 |
三个值得说的点。第一,结构化数据 81.2% 的得分率是今晚刚补出来的:在这之前,104 篇文章里带 JSON-LD 的是 0 篇,该维度是 0/16,直接把全站压在 45-53 分。补完实体标注后同一批页面升到 57-70 分——这解释了为什么「先修 Schema,再谈内容」。第二,内容质量 83.2% 的得分率说明「内容不是瓶颈」。第三,品牌实体只有 48.9%,是页级维度里最弱的一环,原因是品牌名在标题、H1、结构化数据之间还能更一致(多平台实体互认缺位)。
四、104 页全部 0 分的那个维度:4 个文件、10,522 字节
「AI 发现端点」考的是 4 个面向机器的固定路径。修复前,我们和绝大多数企业站一样——一个都没有。于是 104 个页面的这一维度全部为 0,全站凭空少 6 分。补齐后,该维度 104 页全部拿满 6/6。
| 端点 | 引擎检查条件 | 我们补的内容 |
|---|---|---|
| /.well-known/ai.txt | HTTP 200 且非空 | 站点定位、可引用的品牌名、机器入口清单、抓取与引用声明 |
| /ai/summary.json | JSON 合法,name ≥3 字符、description ≥20 字符 | 品牌名(中/越双语)、服务清单、关键页面、出版主体与统一社会信用代码 |
| /ai/faq.json | JSON 合法,question ≥10 字符、answer ≥20 字符 | 12 组问答(中越双语),含数据出处与免费诊断入口 |
| /ai/service.json | JSON 合法,name ≥3 字符、capabilities 非空列表 | 服务能力清单、输入输出契约(审计 API 的调用方式) |
这 4 个文件的全部成本是 10,522 字节纯文本,没有一行是给访客看的。它带来的收益是站级的:104 个页面每一页都多 6 分。这也是本次体检最重要的结论——先分清「站级分」和「页级分」,再决定改什么。站级的事改一次全站受益;页级的事只能逐页改。
五、补完之后重测:均分 73.72,98/104 进 good 档
重测结果与预期几乎一致:99 个页面精确 +6 分(正好是站级修复的净增益),4 个页面 +8 分、1 个页面 +9 分。
| 分数变化 | 页面数 | 原因 |
|---|---|---|
| +6 | 99 | 站级修复的净增益(AI 发现端点 0→6) |
| +8 | 4 | 站级 +6,另加内容维度被多算 2 分(测量口径,见下) |
| +9 | 1 | 站级 +6,另加内容维度被多算 3 分(同一口径) |
那 5 个多拿 2-3 分的页面值得单独说明,因为它是「测量口径」而不是「内容变好了」:重测时这些页面上已经挂上了「本页 AI 就绪度」徽章,而徽章自身的说明文字(约 40 个可读字符)被引擎算进了正文体量。我们发现后没有把它当作成绩上报——一个分数系统如果不解释分数为什么会动,就等于在卖黑箱。这也是为什么本文把所有原始口径都写出来:审计时点、修复动作、每一维的满分、分档门槛。
分档变化更能说明修复的量级:good 档从 72 页升到 98 页,foundation 档从 32 页降到 6 页,且 0 页低于 60 分。剩下的 6 页不是「内容不行」,而是两组老文章(中越各 4 篇的同一批)Meta 标签只拿 5-7 分(满分 14)——这是下一步要逐页修的清单。
六、站级分与页级分:哪些改一次全站受益
把 8 个维度按「全站是否同分」切开,结论非常干脆:5 个维度全站同分(robots、llms.txt、结构化数据、技术信号、AI 发现端点,合计 64 分中的 50 分是站级可控),3 个维度逐页波动(Meta 14 + 内容 12 + 品牌实体 10 = 36 分)。这次 104 页里 86 页挤在 65-69 分的窄带,本质就是站级天花板造成的。
页级维度里,最弱的是 8 个页面的 Meta 标签只有 5-7 分(同一批文章的中越两版,都是「数据更新」类老文),说明描述元数据在历史批量生产里被模板化处理过。另一个可复算的规律:页面体积与内容维度得分呈正相关(r=0.60,n=104,页面体积分布在 8.1-39.1 KB)——内容分不是靠堆字,但页面太薄一定吃亏。
七、两个自己抓出来的事故:分数系统最怕的不是低分
这一节的素材来自同一晚的巡检,写出来是因为它们比分数更有参考价值。
事故一:徽章剥离正则写坏了 104 个页面。徽章支持「每周复测刷分」,靠的是重跑时先剥离旧徽章再注新的。旧版剥离正则用非贪婪匹配到第一个 </div>,而这个 </div> 落在外层容器之前——结果 104/104 个页面都留下了「上一轮的旧分数文本 + 一个多余的 </div>」。后果有两个:页面上同时出现两个互相矛盾的分数(旧分数未加样式、新徽章带样式),以及每页的标签开闭不平衡。
事故二:两个页面级缺陷。巡检还抓到 1 个页面多一个 </div>(历史模板残留,不合法 HTML),以及 1 个越南语页面的语言切换器还挂着中文标签(应为 ZH|VI)。三处都已修复并复检。
为什么把这两个事故写出来:分数低可以修,分数假修不回来。徽章、评分、榜单这类「演示给客户看的东西」,一旦出现自相矛盾的数字,客户对整套方法的信任就没了。所以我们的规则是:抓取失败或内容不可提取的页面,宁可不显示分数,也不显示 0 分;显示出来的每个数字,都要能追溯到审计时点与原始口径。
八、把这份体检翻成 5 条动作
- 先测,再写。大多数企业的问题不在内容量,而在站级配置(发现端点、robots、llms.txt、结构化数据)。先做 8 维度体检,再决定投内容还是投配置。
- 站级 4 件套先补齐。ai.txt、summary.json、faq.json、service.json 是 4 个固定路径、总量 1 万字节上下的事,做完全站每页 +6 分。
- 每页都要有 JSON-LD。这一维 16 分,是仅次于 robots 与 llms.txt 的权重项;0 篇带标注会把全站压到 50 分上下。
- Meta 逐页过。14 分里我们已经白丢了 4.35 分(均分 9.65),集中在历史批量生产的文章上。
- 定期复测并公开口径。同一站点重复测量极差为 0(跨节点 ±1 分);分数一动,先查是站级修复还是测量口径,再对外解释。
九、方法、口径与免责
本文全部站点侧数字来自越智通GEO 自建审计引擎对本站 104 个内容页的全量实测(审计时点 @DATE@,修复前/修复后两轮,每页记录总分与 8 维度分)。原始数据集为 104 行 × 8 维度,可由「总分 = 8 维度之和(减负面信号扣分)」重算;本文引用的分档门槛、维度满分与端点检查条件均取自引擎源码,不是估算。
口径说明:审计时点为 @DATE@,对象是当时站上全部 104 个内容页;本文发布后站点内容页增至 106 页(新增本文中越两版),故文中「104 页」指审计时刻的口径,而非发布后的站点规模。
外部市场数据仅作背景,均标注机构与时间:Gartner(2024-02,传统搜索 2026 年下降 25%)、Bain(80% 消费者至少 40% 搜索依赖 AI)、艾媒咨询(2026-02,中国 GEO 市场 2025 年 349.3 亿元 → 2026 年预计 942 亿元)、Technode(2025-08,越南 ChatGPT 覆盖率 81%)。引擎基于开源项目 Auriti geo-optimizer-skill(MIT 许可)构建,端点的检查条件遵循 geo-checklist.dev 公开标准。不同引擎的权重与检查项不同,同一站点在不同工具下的分数不可直接比较。