🛠️ GEO技术底座

让 AI 爬虫读懂你的官网:robots.txt、llms.txt 与结构化数据 2026 实操指南

📅 2026年9月17日 ⏱️ 阅读时间 9分钟 🏷️ AI爬虫 · robots.txt · llms.txt · 结构化数据 · GEO技术底座

传统搜索流量 2026 年预计下降 25%(Gartner,2024 年 2 月)、80% 消费者至少 40% 的搜索行为依赖 AI 结果(Bain & Company),中国 GEO 市场从 2025 年的 349.3 亿元冲向 2026 年的 942 亿元(艾媒咨询,2026 年 2 月)时,绝大多数品牌把注意力放在了内容层面:写什么、怎么写、投给谁。但很少有人回到最前面那一步——你的官网,AI 到底抓不抓得到、读不读得懂?

AI 答案不是凭空生成的。它先检索语料,再重排候选,最后生成自然语言回答。如果第一步检索召回里没有你的页面,后面所有内容优化都没有意义。本文给出 AI 时代官网的技术底座清单:爬虫分类、robots.txt 铁律、llms.txt 写法、结构化数据,以及五个最常见的抓取杀手。

📊 为什么必须先把技术底座做对
传统搜索流量 2026 年预计下降(Gartner 2024-02)25%
消费者至少 40% 搜索依赖 AI 结果的人群占比(Bain)80%
中国 GEO 市场规模(2025 → 2026E,艾媒咨询 2026-02)349.3 亿 → 942 亿
越南 ChatGPT 覆盖率(Technode 2025-08)81%

1 抓不到 = 不存在:AI 答案的原材料从哪里来

传统搜索引擎时代,决定流量的是「收录」;AI 搜索时代,决定曝光的是「抓取 + 可解析 + 可引用」这三道门。三道门任何一道关上,你在 AI 答案里就不存在——不是排得靠后,而是根本不进候选池。

实测中最常见的三种失败模式:

🧭 一句话判断标准:打开你的官网,按 Ctrl+U 看 HTML 源码。如果源码里看不到正文、参数、联系方式,AI 检索爬虫大概率也看不到。

2 先分清两类 AI 爬虫:检索类 vs 训练类

2026 年最容易踩的坑,是把所有 AI 爬虫当成一锅端。事实上主流厂商已经把训练检索拆成了两条独立通道:屏蔽训练爬虫不会让你从 AI 答案里消失,但屏蔽检索爬虫一定会的。

🤖 主要 AI 爬虫与建议策略(依据各厂商官方爬虫文档)
OAI-SearchBot(OpenAI · ChatGPT 搜索索引)必须放行
ChatGPT-User(OpenAI · 用户触发的实时抓取)放行
Claude-SearchBot / Claude-User(Anthropic · 检索)放行
PerplexityBot(Perplexity · 检索索引)放行
Googlebot(Google 搜索 + AI Overviews 语料)放行
GPTBot / ClaudeBot(训练)自行决定
Google-Extended(仅影响 Gemini/AI 训练,不影响 Google 搜索)自行决定
Bytespider(字节跳动)、CCBot(Common Crawl)按业务权衡

决策原则只有一条:带来引用和回链的检索爬虫放行;只把内容吃进训练集、不留出路的训练爬虫按自身策略决定。这个决定与「AI 答案里有没有你」无关,但与「你的内容是否成为别人模型的燃料」有关。

3 robots.txt 的五条铁律

robots.txt 是有正式标准的:RFC 9309(Robots Exclusion Protocol),2022 年 9 月成为 IETF 标准。它只管「能不能爬」,不管「内容是否被引用」,因此它是 GEO 的第一道闸门,而不是全部。

  1. 最具体匹配原则:一个爬虫只服从与它最匹配的那一组规则,组与组之间不会叠加。所以放行的爬虫必须和它的规则写在同一组里,写错位置等于没写。
  2. Sitemap 只写一行:指向站点地图,帮助爬虫发现新页面;重复多行无益,路径写错反而暴露问题。
  3. 不要屏蔽 CSS / JS 资源:渲染需要它们;屏蔽后搜索引擎与 AI 对页面的理解都会降级。
  4. 能用路径就别用正则:通配符与正则支持度各家不一,规则越复杂越容易误伤。
  5. 改完必须验证:用 curl 回读 + robots 测试工具双验证;同时记住 robots.txt 是「承诺」不是「防护」,恶意爬虫会直接无视。

一个最小可用的 AI 友好模板(承接原有规则,不改变通配符行为):

# robots.txt — RFC 9309
User-agent: *
Allow: /

# AI 检索类:带来引用与回链,放行
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /

# 站点地图 + 面向 AI 的站点索引
Sitemap: https://example.com/sitemap.xml
# llms.txt: https://example.com/llms.txt

4 llms.txt:不是官方标准,但值得写

llms.txt 由 Jeremy Howard(Answer.AI)在 2024 年 9 月 3 日提出,规范页在 llmstxt.org:在站点根目录放一个 Markdown 文件,用「标题 + 一句话说明 + 链接列表」的方式告诉大模型,你的站点里哪些内容最值得读。需要说清楚的是——它不是 IETF 或 W3C 标准,也不是访问控制机制,更不是训练数据退出声明(它管不了训练爬虫,那是 robots.txt 的活)。

到 2026 年,llmstxt.org 的 v2 提案页提到:已有数千个站点发布 llms.txt,主流文档平台开始自动生成,Chrome 的 Lighthouse 也把它纳入 agentic browsing(智能体浏览)检查项。换句话说,它的定位正在从「极客玩法」变成「站点标配」。

与 robots.txt 的分工

三者不互相替代,一起写成本极低、收益明确:AI 阅读理解你的成本越低,你被正确引用的概率越高。

llms.txt 写法模板

# 品牌/公司名(一句话定位)

> 面向谁的什么业务,服务哪些市场,资质与联系方式。

## 核心服务
- [服务页标题](https://example.com/services):一句话说明
- [报价与交付](https://example.com/pricing):一句话说明

## 内容与洞察
- [文章标题](https://example.com/blog/a.html):一句话说明

## 资质与联系
- [关于我们](https://example.com/about):公司主体、注册信息
- 联系邮箱 / 电话 / 地址(纯文本,便于提取)

四个常见错误:只写营销口号不写事实;链接指向 404 或登录页;把全站 URL 堆进去(那是 sitemap 的活);目标市场是越南却只写中文或英文——本地语言的入口必须一起给。

5 结构化数据:让 AI 直接提取正确答案

如果说 llms.txt 是给模型的地图,结构化数据就是把答案摆到桌上。优先做五类,用 JSON-LD(Google 官方推荐格式)写在页面里:

  1. Organization:公司主体、地址、logo、social 主页——AI 回答「这是谁」的锚点。
  2. Product / Service:产品名、参数、价格区间、适用场景——AI 回答「买哪个/找谁做」的依据。
  3. FAQPage:把客户最常问的 5-10 个问题做成问答对,这是被直接引用的最高频格式。
  4. BreadcrumbList:站点层级,帮助理解页面归属。
  5. Article:作者、发布/更新时间——时效性信号。

以 FAQPage 为例:

<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "inLanguage": "zh-CN",
  "mainEntity": [{
    "@type": "Question",
    "name": "你们提供哪些服务?",
    "acceptedAnswer": {
      "@type": "Answer",
      "text": "一句话说清服务范围、交付周期与起订条件。"
    }
  }]
}
</script>

三条红线:结构化数据必须与页面可见内容一致(不一致是作弊信号,会被降权);中越双语站点要让 inLanguage 与 hreflang 保持一致,越南语页面里的地址、名称、联系方式用越南语与本地格式;同一组数据不要既放表格又放图片——图片里的数字 AI 提取不稳定。

6 五个最常见的抓取杀手

7 90 天落地清单

第 0-30 天:爬虫审计与闸门修复

第 31-60 天:结构化与语言对齐

第 61-90 天:内容与监测闭环

结语:技术底座是 GEO 的分母

内容写得再好,如果爬虫进不来、正文读不出、答案对不上,GEO 的效果永远是零。反过来,技术底座做对之后,每一篇内容、每一个结构化字段都会持续复利——这才是「被 AI 理解,即是被世界看见」的工程含义。

📋 GEO 内容策略:7 步方法论 从信源审计、结构化改造到引用监控 🚀 GEO 落地的 5 个关键动作 把方法论拆成可执行的周计划 🧠 AI 搜索引用的 3 个核心要素 可信度、时效性、结构化的底层逻辑 📡 三引擎监测体系 ChatGPT / Google / Perplexity 都被正确引用

🎁 免费领取 AI 可见性诊断

你的官网能被 AI 爬虫抓到吗?品牌在 ChatGPT、Perplexity、Google AI Overviews 中被正确引用了吗?
越智通GEO 团队提供免费诊断:抓取可读性、结构化数据、引用现状逐项出报告。

立即领取免费诊断 →
✅ 爬虫与可读性体检 ✅ 结构化数据核对 ✅ AI 引用现状采样 ✅ 优化清单
数据来源:Gartner(2024-02)· Bain & Company · 艾媒咨询(2026-02)· Technode(2025-08)· RFC 9309 / IETF(2022-09)· llmstxt.org(Jeremy Howard,2024-09 提案 · v2 规范)· OpenAI 与 Anthropic 官方爬虫文档 · Google Search Central 结构化数据文档
免责声明:本文所列爬虫名称与用途以各厂商官方文档为准,策略建议需结合自身内容与业务判断;爬虫 UA 与策略会随厂商调整而变化,落地前请复核官方文档。