Khi lưu lượng tìm kiếm truyền thống dự kiến giảm 25% trong năm 2026 (Gartner, 02/2024), 80% người tiêu dùng dành ít nhất 40% hoạt động tìm kiếm cho AI (Bain & Company), và thị trường GEO Trung Quốc đi từ 349,3 tỷ CNY (2025) lên 942 tỷ CNY (2026, iiMedia Research 02/2026), phần lớn thương hiệu dồn toàn bộ nguồn lực vào nội dung: viết gì, viết thế nào, gửi cho ai. Rất ít đơn vị quay lại bước đầu tiên — bot AI có vào được website của bạn và có đọc hiểu được nội dung hay không?
Câu trả lời AI không tự sinh ra từ hư không. Nó truy hồi ngữ liệu trước, xếp hạng lại các ứng viên, rồi mới diễn đạt thành câu trả lời. Nếu bước truy hồi không gọi được trang của bạn, mọi tối ưu nội dung phía sau đều vô nghĩa. Bài viết này đưa ra danh mục nền tảng kỹ thuật cho website thời AI: phân loại bot, nguyên tắc robots.txt, cách viết llms.txt, dữ liệu có cấu trúc và năm lỗi phổ biến nhất.
• Tìm kiếm truyền thống: Gartner dự báo giảm 25% trong năm 2026 (Gartner 2024-02)
• Hành vi người dùng: 80% người tiêu dùng dành ít nhất 40% hoạt động tìm kiếm cho AI (Bain & Company)
• Thị trường GEO Trung Quốc: 349,3 tỷ CNY (2025) → dự kiến 942 tỷ CNY (2026) (iiMedia Research 2026-02)
• Việt Nam: tỷ lệ phủ sóng ChatGPT 81% (Technode 2025-08)
1. Không thu thập được = không tồn tại: ngữ liệu của câu trả lời AI đến từ đâu
Với tìm kiếm truyền thống, thứ quyết định lưu lượng là “được lập chỉ mục”. Với AI Search, thứ quyết định hiện diện là ba cánh cửa: thu thập được — phân tích được — trích dẫn được. Chỉ cần một cánh cửa đóng lại, bạn không tồn tại trong câu trả lời AI: không phải xếp hạng thấp, mà là không vào nổi danh sách ứng viên.
Ba dạng thất bại gặp nhiều nhất khi kiểm tra thực tế:
- robots.txt chặn bot AI: vì mục tiêu “bảo vệ nội dung” mà chặn toàn bộ bot từ nhiều năm trước, đến khi AI Search thành cửa vào chính thì tệp chặn vẫn còn nguyên.
- Nội dung chính render bằng JavaScript: phần lớn bot truy hồi chỉ lấy HTML gốc, không chạy đầy đủ script front-end. Người dùng nhìn thấy bài viết, bot chỉ thấy trang trắng.
- Thông tin quan trọng nằm trong ảnh và PDF: thông số sản phẩm làm thành ảnh, báo giá scan thành PDF, chứng nhận năng lực để dạng ảnh — AI không trích xuất ổn định được, coi như không có.
🧭 Cách kiểm tra nhanh: mở website, nhấn Ctrl+U để xem mã nguồn HTML. Nếu không thấy nội dung chính, thông số hay thông tin liên hệ trong mã nguồn, nhiều khả năng bot AI cũng không thấy.
2. Phân biệt hai nhóm bot AI: truy hồi và huấn luyện
Lỗi phổ biến nhất năm 2026 là gộp mọi bot AI vào một nhóm. Thực tế các nhà cung cấp lớn đã tách huấn luyện và truy hồi thành hai kênh độc lập: chặn bot huấn luyện không khiến bạn biến mất khỏi câu trả lời AI, nhưng chặn bot truy hồi thì chắc chắn có.
• OAI-SearchBot (OpenAI · chỉ mục tìm kiếm ChatGPT): phải cho phép
• ChatGPT-User (OpenAI · truy cập theo yêu cầu người dùng): cho phép
• Claude-SearchBot / Claude-User (Anthropic · truy hồi): cho phép
• PerplexityBot (Perplexity · chỉ mục truy hồi): cho phép
• Googlebot (Google Search + ngữ liệu AI Overviews): cho phép
• GPTBot / ClaudeBot (huấn luyện): tự quyết định theo chiến lược nội dung
• Google-Extended (chỉ ảnh hưởng huấn luyện AI, không ảnh hưởng Google Search): tự quyết định
• Bytespider (ByteDance), CCBot (Common Crawl): cân nhắc theo mục tiêu kinh doanh
Nguyên tắc quyết định chỉ có một: cho phép nhóm bot truy hồi — nhóm mang lại trích dẫn và liên kết ngược; nhóm bot huấn luyện thì quyết theo chiến lược của bạn. Quyết định này không liên quan tới việc “có tên trong câu trả lời AI hay không”, mà liên quan tới việc nội dung của bạn có trở thành nhiên liệu cho mô hình của người khác hay không.
3. Năm nguyên tắc của robots.txt
robots.txt có tiêu chuẩn chính thức: RFC 9309 (Robots Exclusion Protocol), trở thành tiêu chuẩn IETF từ tháng 9/2022. Tệp này chỉ quản việc “được phép thu thập hay không”, không quản việc “nội dung có được trích dẫn hay không” — vì vậy đây là cửa đầu tiên của GEO, không phải toàn bộ GEO.
- Nguyên tắc khớp cụ thể nhất: một bot chỉ tuân theo nhóm quy tắc khớp cụ thể nhất với nó, các nhóm không cộng dồn. Vì vậy bot được cho phép phải nằm cùng nhóm với quy tắc của nó; viết sai vị trí coi như không viết.
- Sitemap chỉ ghi một dòng: trỏ tới sitemap để bot phát hiện trang mới; ghi nhiều dòng vô ích, ghi sai đường dẫn còn để lộ lỗi.
- Không chặn tài nguyên CSS / JS: bản render cần chúng; chặn xong thì cả công cụ tìm kiếm lẫn AI đều hiểu trang kém hơn.
- Dùng đường dẫn thay vì biểu thức chính quy khi có thể: mức hỗ trợ wildcard và regex khác nhau giữa các bot, quy tắc càng phức tạp càng dễ chặn nhầm.
- Sửa xong phải kiểm chứng: đọc lại bằng curl và chạy công cụ kiểm tra robots; đồng thời nhớ rằng robots.txt là “lời cam kết”, không phải “hàng rào” — bot xấu sẽ phớt lờ.
Mẫu tối thiểu thân thiện với AI (kế thừa quy tắc cũ, không đổi hành vi của nhóm wildcard):
# robots.txt — RFC 9309 User-agent: * Allow: / # Nhóm truy hồi AI: mang lại trích dẫn và liên kết ngược, cho phép User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Claude-SearchBot Allow: / User-agent: PerplexityBot Allow: / # Sitemap + chỉ mục dành cho AI Sitemap: https://example.com/sitemap.xml # llms.txt: https://example.com/llms.txt
4. llms.txt: không phải tiêu chuẩn chính thức, nhưng nên viết
llms.txt được Jeremy Howard (Answer.AI) đề xuất ngày 03/09/2024, trang quy định tại llmstxt.org: đặt một tệp Markdown ở thư mục gốc website, gồm “tiêu đề + một câu mô tả + danh sách liên kết” để cho mô hình biết nội dung nào đáng đọc nhất. Cần nói rõ: đây không phải tiêu chuẩn IETF hay W3C, không phải cơ chế kiểm soát truy cập, và cũng không phải tuyên bố từ chối huấn luyện — việc chặn bot huấn luyện thuộc về robots.txt.
Đến 2026, trang đề xuất v2 của llmstxt.org cho biết đã có hàng nghìn website công bố llms.txt, các nền tảng tài liệu phổ biến tự động sinh tệp này, và Lighthouse của Chrome đã đưa llms.txt vào bộ kiểm tra agentic browsing (duyệt web bằng tác nhân AI). Nói cách khác, định vị của nó đang chuyển từ “thủ thuật của dân kỹ thuật” sang “chuẩn mực của website”.
Phân công giữa robots.txt, llms.txt và sitemap
- robots.txt quản “được phép thu thập hay không” — cổng phân quyền.
- llms.txt quản “nên đọc gì” — bản đồ nội dung, giúp mô hình bớt phải đoán.
- sitemap.xml quản “website có những trang nào” — danh mục chỉ mục.
Ba tệp không thay thế nhau; chi phí làm cả ba rất thấp, lợi ích rõ ràng: chi phí để AI hiểu bạn càng thấp, xác suất bạn được trích dẫn đúng càng cao.
Mẫu viết llms.txt
# Tên thương hiệu / công ty (một câu định vị) > Phục vụ ai, làm gì, ở những thị trường nào, năng lực và thông tin liên hệ. ## Dịch vụ chính - [Tiêu đề trang dịch vụ](https://example.com/services): một câu mô tả - [Báo giá và tiến độ](https://example.com/pricing): một câu mô tả ## Nội dung và phân tích - [Tiêu đề bài viết](https://example.com/blog/a.html): một câu mô tả ## Năng lực và liên hệ - [Về chúng tôi](https://example.com/about): pháp nhân, thông tin đăng ký - Email / điện thoại / địa chỉ (văn bản thuần, dễ trích xuất)
Bốn lỗi thường gặp: chỉ viết khẩu hiệu marketing mà không có dữ kiện; liên kết trỏ tới trang 404 hoặc trang yêu cầu đăng nhập; nhồi toàn bộ URL của website (đó là việc của sitemap); thị trường mục tiêu là Việt Nam nhưng chỉ viết tiếng Trung hoặc tiếng Anh — cửa vào bằng ngôn ngữ bản địa phải có riêng.
5. Dữ liệu có cấu trúc: để AI trích xuất câu trả lời đúng ngay
Nếu llms.txt là bản đồ chỉ đường cho mô hình, dữ liệu có cấu trúc là việc đặt câu trả lời lên bàn. Ưu tiên 5 loại, dùng JSON-LD (định dạng Google khuyến nghị) đặt trong trang:
- Organization: pháp nhân, địa chỉ, logo, trang mạng xã hội — điểm neo cho câu hỏi “đây là ai”.
- Product / Service: tên sản phẩm, thông số, khoảng giá, kịch bản áp dụng — căn cứ cho câu hỏi “mua cái nào / thuê ai”.
- FAQPage: 5-10 câu hỏi khách hàng hay hỏi nhất, dựng thành cặp hỏi — đáp; đây là định dạng được trích dẫn trực tiếp nhiều nhất.
- BreadcrumbList: cấu trúc phân cấp, giúp hiểu trang thuộc mục nào.
- Article: tác giả, ngày đăng và ngày cập nhật — tín hiệu tính thời sự.
Ví dụ với FAQPage:
<script type="application/ld+json">
{
"@context": "https://schema.org",
"@type": "FAQPage",
"inLanguage": "vi",
"mainEntity": [{
"@type": "Question",
"name": "Công ty cung cấp dịch vụ gì?",
"acceptedAnswer": {
"@type": "Answer",
"text": "Một câu nêu rõ phạm vi dịch vụ, thời gian bàn giao và điều kiện tối thiểu."
}
}]
}
</script>
Ba giới hạn đỏ: dữ liệu có cấu trúc phải khớp với nội dung hiển thị trên trang (không khớp là tín hiệu gian lận, sẽ bị giảm ưu tiên); website song ngữ Việt — Trung cần để inLanguage khớp với hreflang, và trong trang tiếng Việt thì địa chỉ, tên gọi, thông tin liên hệ phải viết theo định dạng bản địa; đừng vừa đặt bảng dữ liệu vừa đặt ảnh cho cùng một nội dung — con số trong ảnh khó được AI trích xuất ổn định.
6. Năm lỗi khiến bot bỏ qua website của bạn
- Render bằng JavaScript: nội dung chính tải bất đồng bộ, bot chỉ nhận được khung rỗng.
- Chặn nhầm bằng robots: chặn cả bot truy hồi lẫn bot huấn luyện, đóng luôn cơ hội được trích dẫn.
- Nội dung bị “ảnh hóa”: bảng thông số, báo giá, chứng nhận đưa hết vào ảnh hoặc PDF scan.
- Tiêu đề không khớp nội dung: mô tả meta nói chuyện A, nội dung nói chuyện B — bản tóm tắt của mô hình lệch với bài viết, lập tức bị loại khỏi nhóm được trích dẫn.
- Chỉ có một ngôn ngữ: người dùng Việt Nam đặt câu hỏi bằng tiếng Việt, trang tiếng Trung rất khó lọt vào nhóm truy hồi tiếng Việt — cửa vào bằng ngôn ngữ bản địa phải xây riêng.
7. Lộ trình triển khai 90 ngày
Ngày 0-30: kiểm toán bot và sửa cổng
- Xem user-agent của bot AI trong log máy chủ (OAI-SearchBot, PerplexityBot, GPTBot…), thống kê đường dẫn truy cập và mã phản hồi — biết ai đã tới và bị chặn ở đâu.
- Sửa robots.txt: cho phép rõ ràng nhóm truy hồi, một dòng Sitemap, bỏ các lệnh Disallow chặn nhầm.
- Công bố llms.txt (khoảng 1 giờ công việc) và ghi chú đường dẫn này trong robots.txt.
- Kiểm tra khả năng đọc mã nguồn của 20 trang cốt lõi (cách Ctrl+U), lập danh sách trang cần HTML hóa.
Ngày 31-60: cấu trúc hóa và đồng bộ ngôn ngữ
- Triển khai Organization + BreadcrumbList toàn site; Product / Service cho trang sản phẩm — dịch vụ; FAQPage cho trang cốt lõi.
- HTML hóa nội dung 20 trang cốt lõi (gồm bảng thông số, khoảng giá, điều kiện bàn giao).
- Website song ngữ: liên kết hreflang hai chiều, inLanguage khớp nhau, nội dung tiếng bản địa tách thành trang riêng.
Ngày 61-90: vòng lặp nội dung và đo lường
- Lập danh sách 20-50 câu hỏi “khách hàng thật sự sẽ hỏi AI”, chia theo ngôn ngữ, bổ sung nội dung từng câu một.
- Thiết lập lấy mẫu cố định (cùng câu hỏi, cùng khung giờ, hỏi lặp nhiều lần), ghi lại việc được nhắc thương hiệu và nguồn được trích dẫn.
- KPI nghiệm thu: số đường dẫn được bot AI truy cập, số trang có dữ liệu có cấu trúc, tỷ lệ được nhắc thương hiệu trong câu trả lời AI — đọc cả ba đường cong mới biết là “chưa được thấy” hay “được thấy nhưng bị viết sai”.
Kết luận: nền tảng kỹ thuật là mẫu số của GEO
Nội dung viết hay đến đâu cũng vô nghĩa nếu bot không vào được, không đọc ra nội dung, hoặc câu trả lời không khớp với trang. Ngược lại, khi nền tảng kỹ thuật đã đúng, mỗi bài viết và mỗi trường dữ liệu có cấu trúc đều tạo lãi kép theo thời gian — đó chính là ý nghĩa kỹ thuật của câu “Được AI thấu hiểu – được thế giới nhìn thấy”.
Website của bạn có được bot AI đọc hiểu không?
Điền biểu mẫu 30 giây — nhận miễn phí “Báo cáo chẩn đoán hiện diện trên AI” trong 24 giờ, gồm kiểm tra khả năng thu thập, dữ liệu có cấu trúc và hiện trạng trích dẫn.
Nhận báo cáo miễn phí →Được AI thấu hiểu – được thế giới nhìn thấy
• Gartner. (2024). Predicts 2026: Search Traffic Decline Due to AI. Tháng 2/2024. (Lưu lượng tìm kiếm truyền thống giảm 25% trong năm 2026)
• Bain & Company. Consumer Search Behavior Study. (80% người tiêu dùng dành ít nhất 40% hoạt động tìm kiếm cho AI)
• iiMedia Research. (2026). Báo cáo ngành GEO Trung Quốc. Tháng 2/2026. (349,3 tỷ CNY năm 2025 → dự kiến 942 tỷ CNY năm 2026)
• Technode. (2025). ChatGPT Adoption in Vietnam. Tháng 8/2025. (Tỷ lệ phủ sóng ChatGPT tại Việt Nam 81%)
• IETF. (2022). RFC 9309 — Robots Exclusion Protocol. Tháng 9/2022.
• llmstxt.org — Jeremy Howard (Answer.AI), đề xuất 03/09/2024 và bản v2 năm 2026.
• Tài liệu bot chính thức của OpenAI và Anthropic; tài liệu dữ liệu có cấu trúc của Google Search Central.
• Lưu ý: tên và mục đích của từng bot lấy theo tài liệu chính thức của nhà cung cấp; chiến lược đề xuất cần điều chỉnh theo nội dung và mô hình kinh doanh của từng đơn vị.