当 传统搜索流量 2026 年预计下降 25%(Gartner,2024 年 2 月)、80% 消费者至少 40% 的搜索行为依赖 AI 结果(Bain & Company),中国 GEO 市场从 2025 年的 349.3 亿元冲向 2026 年的 942 亿元(艾媒咨询,2026 年 2 月)时,绝大多数品牌把注意力放在了内容层面:写什么、怎么写、投给谁。但很少有人回到最前面那一步——你的官网,AI 到底抓不抓得到、读不读得懂?
AI 答案不是凭空生成的。它先检索语料,再重排候选,最后生成自然语言回答。如果第一步检索召回里没有你的页面,后面所有内容优化都没有意义。本文给出 AI 时代官网的技术底座清单:爬虫分类、robots.txt 铁律、llms.txt 写法、结构化数据,以及五个最常见的抓取杀手。
1 抓不到 = 不存在:AI 答案的原材料从哪里来
传统搜索引擎时代,决定流量的是「收录」;AI 搜索时代,决定曝光的是「抓取 + 可解析 + 可引用」这三道门。三道门任何一道关上,你在 AI 答案里就不存在——不是排得靠后,而是根本不进候选池。
实测中最常见的三种失败模式:
- robots.txt 把 AI 爬虫拒之门外:历史上为了「保护内容」一刀切屏蔽爬虫,几年后 AI 搜索成为入口,屏蔽文件还在,AI 就是进不来。
- 正文靠 JavaScript 渲染:多数 AI 检索类爬虫只取 HTML 原文,不执行完整的前端渲染脚本。你的正文在浏览器里看得见,在爬虫眼里是一片空白。
- 关键信息藏在图片和 PDF 里:产品参数做成图、报价做成扫描件、资质做成 PDF——AI 无法稳定提取,等于没写。
🧭 一句话判断标准:打开你的官网,按 Ctrl+U 看 HTML 源码。如果源码里看不到正文、参数、联系方式,AI 检索爬虫大概率也看不到。
2 先分清两类 AI 爬虫:检索类 vs 训练类
2026 年最容易踩的坑,是把所有 AI 爬虫当成一锅端。事实上主流厂商已经把训练和检索拆成了两条独立通道:屏蔽训练爬虫不会让你从 AI 答案里消失,但屏蔽检索爬虫一定会的。
决策原则只有一条:带来引用和回链的检索爬虫放行;只把内容吃进训练集、不留出路的训练爬虫按自身策略决定。这个决定与「AI 答案里有没有你」无关,但与「你的内容是否成为别人模型的燃料」有关。
3 robots.txt 的五条铁律
robots.txt 是有正式标准的:RFC 9309(Robots Exclusion Protocol),2022 年 9 月成为 IETF 标准。它只管「能不能爬」,不管「内容是否被引用」,因此它是 GEO 的第一道闸门,而不是全部。
- 最具体匹配原则:一个爬虫只服从与它最匹配的那一组规则,组与组之间不会叠加。所以放行的爬虫必须和它的规则写在同一组里,写错位置等于没写。
- Sitemap 只写一行:指向站点地图,帮助爬虫发现新页面;重复多行无益,路径写错反而暴露问题。
- 不要屏蔽 CSS / JS 资源:渲染需要它们;屏蔽后搜索引擎与 AI 对页面的理解都会降级。
- 能用路径就别用正则:通配符与正则支持度各家不一,规则越复杂越容易误伤。
- 改完必须验证:用 curl 回读 + robots 测试工具双验证;同时记住 robots.txt 是「承诺」不是「防护」,恶意爬虫会直接无视。
一个最小可用的 AI 友好模板(承接原有规则,不改变通配符行为):
# robots.txt — RFC 9309 User-agent: * Allow: / # AI 检索类:带来引用与回链,放行 User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Claude-SearchBot Allow: / User-agent: PerplexityBot Allow: / # 站点地图 + 面向 AI 的站点索引 Sitemap: https://example.com/sitemap.xml # llms.txt: https://example.com/llms.txt
4 llms.txt:不是官方标准,但值得写
llms.txt 由 Jeremy Howard(Answer.AI)在 2024 年 9 月 3 日提出,规范页在 llmstxt.org:在站点根目录放一个 Markdown 文件,用「标题 + 一句话说明 + 链接列表」的方式告诉大模型,你的站点里哪些内容最值得读。需要说清楚的是——它不是 IETF 或 W3C 标准,也不是访问控制机制,更不是训练数据退出声明(它管不了训练爬虫,那是 robots.txt 的活)。
到 2026 年,llmstxt.org 的 v2 提案页提到:已有数千个站点发布 llms.txt,主流文档平台开始自动生成,Chrome 的 Lighthouse 也把它纳入 agentic browsing(智能体浏览)检查项。换句话说,它的定位正在从「极客玩法」变成「站点标配」。
与 robots.txt 的分工
- robots.txt 管「能不能爬」——权限闸门。
- llms.txt 管「该读什么」——内容导航,让模型少花力气猜。
- sitemap.xml 管「全站有哪些页面」——索引清单。
三者不互相替代,一起写成本极低、收益明确:AI 阅读理解你的成本越低,你被正确引用的概率越高。
llms.txt 写法模板
# 品牌/公司名(一句话定位) > 面向谁的什么业务,服务哪些市场,资质与联系方式。 ## 核心服务 - [服务页标题](https://example.com/services):一句话说明 - [报价与交付](https://example.com/pricing):一句话说明 ## 内容与洞察 - [文章标题](https://example.com/blog/a.html):一句话说明 ## 资质与联系 - [关于我们](https://example.com/about):公司主体、注册信息 - 联系邮箱 / 电话 / 地址(纯文本,便于提取)
四个常见错误:只写营销口号不写事实;链接指向 404 或登录页;把全站 URL 堆进去(那是 sitemap 的活);目标市场是越南却只写中文或英文——本地语言的入口必须一起给。
5 结构化数据:让 AI 直接提取正确答案
如果说 llms.txt 是给模型的地图,结构化数据就是把答案摆到桌上。优先做五类,用 JSON-LD(Google 官方推荐格式)写在页面里:
- Organization:公司主体、地址、logo、social 主页——AI 回答「这是谁」的锚点。
- Product / Service:产品名、参数、价格区间、适用场景——AI 回答「买哪个/找谁做」的依据。
- FAQPage:把客户最常问的 5-10 个问题做成问答对,这是被直接引用的最高频格式。
- BreadcrumbList:站点层级,帮助理解页面归属。
- Article:作者、发布/更新时间——时效性信号。
以 FAQPage 为例:
<script type="application/ld+json">
{
"@context": "https://schema.org",
"@type": "FAQPage",
"inLanguage": "zh-CN",
"mainEntity": [{
"@type": "Question",
"name": "你们提供哪些服务?",
"acceptedAnswer": {
"@type": "Answer",
"text": "一句话说清服务范围、交付周期与起订条件。"
}
}]
}
</script>
三条红线:结构化数据必须与页面可见内容一致(不一致是作弊信号,会被降权);中越双语站点要让 inLanguage 与 hreflang 保持一致,越南语页面里的地址、名称、联系方式用越南语与本地格式;同一组数据不要既放表格又放图片——图片里的数字 AI 提取不稳定。
6 五个最常见的抓取杀手
- JS 渲染:正文由前端异步加载,爬虫只拿到空壳。
- robots 误杀:把检索爬虫和训练爬虫一起屏蔽,连引用机会一起关掉。
- 内容图片化:参数表、报价单、资质证书做成图片或扫描 PDF。
- 标题与正文不符:meta 描述写的是 A,正文讲的是 B,模型摘要与正文对不上,直接不进引用池。
- 只有一种语言:越南用户用越南语提问,中文页面很难进入越南语检索池——当地语言的入口必须单独建。
7 90 天落地清单
第 0-30 天:爬虫审计与闸门修复
- 看服务器日志里的 AI 爬虫 UA(OAI-SearchBot、PerplexityBot、GPTBot 等),统计命中路径与状态码——先知道谁来过、被拦在哪。
- 修 robots.txt:检索类显式放行、Sitemap 一行、去掉误伤的 Disallow。
- 上线 llms.txt(1 小时工作量),并在 robots.txt 里注明路径。
- 按源码可读性抽查核心 20 页(Ctrl+U 法),列出需要 HTML 化的页面。
第 31-60 天:结构化与语言对齐
- 全站铺 Organization + BreadcrumbList;产品/服务页铺 Product / Service;核心页铺 FAQPage。
- 核心 20 页正文 HTML 化(含参数表、价格区间、交付说明)。
- 双语站点:hreflang 互链 + inLanguage 一致 + 当地语言内容独立成页。
第 61-90 天:内容与监测闭环
- 列出 20-50 条「客户真的会问 AI 的问题」,按语言分组,一条一条补内容。
- 建立固定采样(同一问题、同一时间窗、多次提问),记录品牌提及与引用来源。
- 验收 KPI:AI 爬虫命中路径数、结构化覆盖页数、AI 答案品牌提及率——三条曲线一起看,才知道是「没被看见」还是「被看见但写错了」。
结语:技术底座是 GEO 的分母
内容写得再好,如果爬虫进不来、正文读不出、答案对不上,GEO 的效果永远是零。反过来,技术底座做对之后,每一篇内容、每一个结构化字段都会持续复利——这才是「被 AI 理解,即是被世界看见」的工程含义。