Khi lưu lượng tìm kiếm truyền thống dự kiến giảm 25% trong năm 2026 (Gartner, 02/2024), 80% người tiêu dùng dành ít nhất 40% hoạt động tìm kiếm cho AI (Bain & Company), và thị trường GEO Trung Quốc đi từ 349,3 tỷ CNY (2025) lên 942 tỷ CNY (2026, iiMedia Research 02/2026), phần lớn thương hiệu dồn toàn bộ nguồn lực vào nội dung: viết gì, viết thế nào, gửi cho ai. Rất ít đơn vị quay lại bước đầu tiên — bot AI có vào được website của bạn và có đọc hiểu được nội dung hay không?

Câu trả lời AI không tự sinh ra từ hư không. Nó truy hồi ngữ liệu trước, xếp hạng lại các ứng viên, rồi mới diễn đạt thành câu trả lời. Nếu bước truy hồi không gọi được trang của bạn, mọi tối ưu nội dung phía sau đều vô nghĩa. Bài viết này đưa ra danh mục nền tảng kỹ thuật cho website thời AI: phân loại bot, nguyên tắc robots.txt, cách viết llms.txt, dữ liệu có cấu trúc và năm lỗi phổ biến nhất.

Vì sao phải làm đúng nền tảng kỹ thuật trước (số liệu đều ghi rõ nguồn):
• Tìm kiếm truyền thống: Gartner dự báo giảm 25% trong năm 2026 (Gartner 2024-02)
• Hành vi người dùng: 80% người tiêu dùng dành ít nhất 40% hoạt động tìm kiếm cho AI (Bain & Company)
• Thị trường GEO Trung Quốc: 349,3 tỷ CNY (2025) → dự kiến 942 tỷ CNY (2026) (iiMedia Research 2026-02)
• Việt Nam: tỷ lệ phủ sóng ChatGPT 81% (Technode 2025-08)

1. Không thu thập được = không tồn tại: ngữ liệu của câu trả lời AI đến từ đâu

Với tìm kiếm truyền thống, thứ quyết định lưu lượng là “được lập chỉ mục”. Với AI Search, thứ quyết định hiện diện là ba cánh cửa: thu thập được — phân tích được — trích dẫn được. Chỉ cần một cánh cửa đóng lại, bạn không tồn tại trong câu trả lời AI: không phải xếp hạng thấp, mà là không vào nổi danh sách ứng viên.

Ba dạng thất bại gặp nhiều nhất khi kiểm tra thực tế:

🧭 Cách kiểm tra nhanh: mở website, nhấn Ctrl+U để xem mã nguồn HTML. Nếu không thấy nội dung chính, thông số hay thông tin liên hệ trong mã nguồn, nhiều khả năng bot AI cũng không thấy.

2. Phân biệt hai nhóm bot AI: truy hồi và huấn luyện

Lỗi phổ biến nhất năm 2026 là gộp mọi bot AI vào một nhóm. Thực tế các nhà cung cấp lớn đã tách huấn luyệntruy hồi thành hai kênh độc lập: chặn bot huấn luyện không khiến bạn biến mất khỏi câu trả lời AI, nhưng chặn bot truy hồi thì chắc chắn có.

🤖 Bot AI chính và khuyến nghị (theo tài liệu chính thức của từng nhà cung cấp):
• OAI-SearchBot (OpenAI · chỉ mục tìm kiếm ChatGPT): phải cho phép
• ChatGPT-User (OpenAI · truy cập theo yêu cầu người dùng): cho phép
• Claude-SearchBot / Claude-User (Anthropic · truy hồi): cho phép
• PerplexityBot (Perplexity · chỉ mục truy hồi): cho phép
• Googlebot (Google Search + ngữ liệu AI Overviews): cho phép
• GPTBot / ClaudeBot (huấn luyện): tự quyết định theo chiến lược nội dung
• Google-Extended (chỉ ảnh hưởng huấn luyện AI, không ảnh hưởng Google Search): tự quyết định
• Bytespider (ByteDance), CCBot (Common Crawl): cân nhắc theo mục tiêu kinh doanh

Nguyên tắc quyết định chỉ có một: cho phép nhóm bot truy hồi — nhóm mang lại trích dẫn và liên kết ngược; nhóm bot huấn luyện thì quyết theo chiến lược của bạn. Quyết định này không liên quan tới việc “có tên trong câu trả lời AI hay không”, mà liên quan tới việc nội dung của bạn có trở thành nhiên liệu cho mô hình của người khác hay không.

3. Năm nguyên tắc của robots.txt

robots.txt có tiêu chuẩn chính thức: RFC 9309 (Robots Exclusion Protocol), trở thành tiêu chuẩn IETF từ tháng 9/2022. Tệp này chỉ quản việc “được phép thu thập hay không”, không quản việc “nội dung có được trích dẫn hay không” — vì vậy đây là cửa đầu tiên của GEO, không phải toàn bộ GEO.

  1. Nguyên tắc khớp cụ thể nhất: một bot chỉ tuân theo nhóm quy tắc khớp cụ thể nhất với nó, các nhóm không cộng dồn. Vì vậy bot được cho phép phải nằm cùng nhóm với quy tắc của nó; viết sai vị trí coi như không viết.
  2. Sitemap chỉ ghi một dòng: trỏ tới sitemap để bot phát hiện trang mới; ghi nhiều dòng vô ích, ghi sai đường dẫn còn để lộ lỗi.
  3. Không chặn tài nguyên CSS / JS: bản render cần chúng; chặn xong thì cả công cụ tìm kiếm lẫn AI đều hiểu trang kém hơn.
  4. Dùng đường dẫn thay vì biểu thức chính quy khi có thể: mức hỗ trợ wildcard và regex khác nhau giữa các bot, quy tắc càng phức tạp càng dễ chặn nhầm.
  5. Sửa xong phải kiểm chứng: đọc lại bằng curl và chạy công cụ kiểm tra robots; đồng thời nhớ rằng robots.txt là “lời cam kết”, không phải “hàng rào” — bot xấu sẽ phớt lờ.

Mẫu tối thiểu thân thiện với AI (kế thừa quy tắc cũ, không đổi hành vi của nhóm wildcard):

# robots.txt — RFC 9309
User-agent: *
Allow: /

# Nhóm truy hồi AI: mang lại trích dẫn và liên kết ngược, cho phép
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /

# Sitemap + chỉ mục dành cho AI
Sitemap: https://example.com/sitemap.xml
# llms.txt: https://example.com/llms.txt

4. llms.txt: không phải tiêu chuẩn chính thức, nhưng nên viết

llms.txt được Jeremy Howard (Answer.AI) đề xuất ngày 03/09/2024, trang quy định tại llmstxt.org: đặt một tệp Markdown ở thư mục gốc website, gồm “tiêu đề + một câu mô tả + danh sách liên kết” để cho mô hình biết nội dung nào đáng đọc nhất. Cần nói rõ: đây không phải tiêu chuẩn IETF hay W3C, không phải cơ chế kiểm soát truy cập, và cũng không phải tuyên bố từ chối huấn luyện — việc chặn bot huấn luyện thuộc về robots.txt.

Đến 2026, trang đề xuất v2 của llmstxt.org cho biết đã có hàng nghìn website công bố llms.txt, các nền tảng tài liệu phổ biến tự động sinh tệp này, và Lighthouse của Chrome đã đưa llms.txt vào bộ kiểm tra agentic browsing (duyệt web bằng tác nhân AI). Nói cách khác, định vị của nó đang chuyển từ “thủ thuật của dân kỹ thuật” sang “chuẩn mực của website”.

Phân công giữa robots.txt, llms.txt và sitemap

Ba tệp không thay thế nhau; chi phí làm cả ba rất thấp, lợi ích rõ ràng: chi phí để AI hiểu bạn càng thấp, xác suất bạn được trích dẫn đúng càng cao.

Mẫu viết llms.txt

# Tên thương hiệu / công ty (một câu định vị)

> Phục vụ ai, làm gì, ở những thị trường nào, năng lực và thông tin liên hệ.

## Dịch vụ chính
- [Tiêu đề trang dịch vụ](https://example.com/services): một câu mô tả
- [Báo giá và tiến độ](https://example.com/pricing): một câu mô tả

## Nội dung và phân tích
- [Tiêu đề bài viết](https://example.com/blog/a.html): một câu mô tả

## Năng lực và liên hệ
- [Về chúng tôi](https://example.com/about): pháp nhân, thông tin đăng ký
- Email / điện thoại / địa chỉ (văn bản thuần, dễ trích xuất)

Bốn lỗi thường gặp: chỉ viết khẩu hiệu marketing mà không có dữ kiện; liên kết trỏ tới trang 404 hoặc trang yêu cầu đăng nhập; nhồi toàn bộ URL của website (đó là việc của sitemap); thị trường mục tiêu là Việt Nam nhưng chỉ viết tiếng Trung hoặc tiếng Anh — cửa vào bằng ngôn ngữ bản địa phải có riêng.

5. Dữ liệu có cấu trúc: để AI trích xuất câu trả lời đúng ngay

Nếu llms.txt là bản đồ chỉ đường cho mô hình, dữ liệu có cấu trúc là việc đặt câu trả lời lên bàn. Ưu tiên 5 loại, dùng JSON-LD (định dạng Google khuyến nghị) đặt trong trang:

  1. Organization: pháp nhân, địa chỉ, logo, trang mạng xã hội — điểm neo cho câu hỏi “đây là ai”.
  2. Product / Service: tên sản phẩm, thông số, khoảng giá, kịch bản áp dụng — căn cứ cho câu hỏi “mua cái nào / thuê ai”.
  3. FAQPage: 5-10 câu hỏi khách hàng hay hỏi nhất, dựng thành cặp hỏi — đáp; đây là định dạng được trích dẫn trực tiếp nhiều nhất.
  4. BreadcrumbList: cấu trúc phân cấp, giúp hiểu trang thuộc mục nào.
  5. Article: tác giả, ngày đăng và ngày cập nhật — tín hiệu tính thời sự.

Ví dụ với FAQPage:

<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "inLanguage": "vi",
  "mainEntity": [{
    "@type": "Question",
    "name": "Công ty cung cấp dịch vụ gì?",
    "acceptedAnswer": {
      "@type": "Answer",
      "text": "Một câu nêu rõ phạm vi dịch vụ, thời gian bàn giao và điều kiện tối thiểu."
    }
  }]
}
</script>

Ba giới hạn đỏ: dữ liệu có cấu trúc phải khớp với nội dung hiển thị trên trang (không khớp là tín hiệu gian lận, sẽ bị giảm ưu tiên); website song ngữ Việt — Trung cần để inLanguage khớp với hreflang, và trong trang tiếng Việt thì địa chỉ, tên gọi, thông tin liên hệ phải viết theo định dạng bản địa; đừng vừa đặt bảng dữ liệu vừa đặt ảnh cho cùng một nội dung — con số trong ảnh khó được AI trích xuất ổn định.

6. Năm lỗi khiến bot bỏ qua website của bạn

7. Lộ trình triển khai 90 ngày

Ngày 0-30: kiểm toán bot và sửa cổng

Ngày 31-60: cấu trúc hóa và đồng bộ ngôn ngữ

Ngày 61-90: vòng lặp nội dung và đo lường

Kết luận: nền tảng kỹ thuật là mẫu số của GEO

Nội dung viết hay đến đâu cũng vô nghĩa nếu bot không vào được, không đọc ra nội dung, hoặc câu trả lời không khớp với trang. Ngược lại, khi nền tảng kỹ thuật đã đúng, mỗi bài viết và mỗi trường dữ liệu có cấu trúc đều tạo lãi kép theo thời gian — đó chính là ý nghĩa kỹ thuật của câu “Được AI thấu hiểu – được thế giới nhìn thấy”.

Website của bạn có được bot AI đọc hiểu không?

Điền biểu mẫu 30 giây — nhận miễn phí “Báo cáo chẩn đoán hiện diện trên AI” trong 24 giờ, gồm kiểm tra khả năng thu thập, dữ liệu có cấu trúc và hiện trạng trích dẫn.

Nhận báo cáo miễn phí →

Được AI thấu hiểu – được thế giới nhìn thấy

📎 Nguồn dữ liệu:
• Gartner. (2024). Predicts 2026: Search Traffic Decline Due to AI. Tháng 2/2024. (Lưu lượng tìm kiếm truyền thống giảm 25% trong năm 2026)
• Bain & Company. Consumer Search Behavior Study. (80% người tiêu dùng dành ít nhất 40% hoạt động tìm kiếm cho AI)
• iiMedia Research. (2026). Báo cáo ngành GEO Trung Quốc. Tháng 2/2026. (349,3 tỷ CNY năm 2025 → dự kiến 942 tỷ CNY năm 2026)
• Technode. (2025). ChatGPT Adoption in Vietnam. Tháng 8/2025. (Tỷ lệ phủ sóng ChatGPT tại Việt Nam 81%)
• IETF. (2022). RFC 9309 — Robots Exclusion Protocol. Tháng 9/2022.
• llmstxt.org — Jeremy Howard (Answer.AI), đề xuất 03/09/2024 và bản v2 năm 2026.
• Tài liệu bot chính thức của OpenAI và Anthropic; tài liệu dữ liệu có cấu trúc của Google Search Central.
Lưu ý: tên và mục đích của từng bot lấy theo tài liệu chính thức của nhà cung cấp; chiến lược đề xuất cần điều chỉnh theo nội dung và mô hình kinh doanh của từng đơn vị.