Báo cáo thực nghiệm bot AI: 6 phát hiện từ 4,2 triệu dòng log máy chủ

Chúng tôi mở log máy chủ của chính mình và kiểm tra từng yêu cầu: ai đến, tự nhận là ai, lấy gì và nhận mã trạng thái nào. Kết quả: 6 phát hiện, trong đó 3 phát hiện trái với kỳ vọng ban đầu.

Khi lưu lượng tìm kiếm truyền thống dự kiến giảm 25% trong năm 2026 (Gartner, 02/2024), 80% người tiêu dùng dành ít nhất 40% hoạt động tìm kiếm cho AI (Bain & Company), và thị trường GEO Trung Quốc đi từ 349,3 tỷ CNY (2025) lên 942 tỷ CNY (2026, iiMedia Research 02/2026), gần như mọi phương pháp luận trong ngành đều dựa trên một tiền đề chưa từng được kiểm chứng: bot AI thật sự đang thu thập trang của chúng ta, và thu thập đúng những trang chúng ta nghĩ.

Tiền đề đó đáng để kiểm tra. Chúng tôi rà soát 12 ngày, 4,2 triệu yêu cầu trong log máy chủ của website mình, phân loại từng dòng: ai đến, tự nhận là ai, lấy nội dung gì, nhận mã trạng thái nào.

📊 Mẫu khảo sát (log gốc của website VIETTRITHONG GEO, không phải ước lượng của bên thứ ba)

• Cửa sổ quan sát (log truy cập đầy đủ của nginx): 08/09/2026 → 19/09/2026, 12 ngày

• Tổng số yêu cầu: 4.206.895

• Số yêu cầu tự nhận là bot AI hoặc bot công cụ tìm kiếm: 8.920

• Số yêu cầu có IP nguồn khớp dải IP công bố của nhà cung cấp: 1.432 (16,1%)

1. Phương pháp: thế nào được coi là bot AI thật?

Nếu chỉ đếm theo User-Agent thì con số sẽ bị thổi phồng nghiêm trọng, vì bất kỳ ai cũng có thể đổi UA thành GPTBot. Chúng tôi dùng ba lớp kiểm tra, phải đồng thời thỏa mãn mới tính là “đã xác minh”:

  1. Khai báo danh tính: User-Agent trùng tên bot do nhà cung cấp công bố (tài liệu chính thức của OpenAI, Anthropic, Google, Microsoft, Naver…).
  2. Nguồn có thể xác minh: IP nguồn nằm trong dải mà nhà cung cấp công bố hoặc xác minh được bằng phân giải ngược (ví dụ crawl-*.googlebot.com, *.petalsearch.com, *.search.msn.com, hoặc dải IP công khai của OpenAI và Anthropic).
  3. Tín hiệu hành vi: có tuân thủ robots.txt, có đọc sitemap.xml, đường dẫn yêu cầu có phải trang nội dung thật hay không.

Lớp thứ hai là ranh giới phân biệt. Thực tế năm 2026: nhãn “bot AI” đã trở thành chiếc áo miễn phí cho lưu lượng tấn công — các công cụ quét đổi UA thành tên nhà cung cấp AI vừa để lách một số quy tắc chặn thô, vừa dễ bị đếm nhầm thành “AI đang rất quan tâm đến chúng ta”.

2. Phát hiện 1: 5 địa chỉ IP lần lượt mạo danh 13 loại bot

Trước hết là những nhà cung cấp có công bố dải IP. Cùng tự nhận là “Googlebot”: 5.564 lượt, nhưng chỉ 395 lượt đến từ dải IP thật của Google.

🔍 Danh tính tự nhận và kết quả xác minh IP (cùng cửa sổ quan sát)

• Googlebot: tự nhận 5.564 / xác minh 395 / không xác minh được 5.169

• GPTBot: tự nhận 612 / xác minh 373 / không xác minh được 239

• ClaudeBot: tự nhận 450 / xác minh 331 / không xác minh được 119

• OAI-SearchBot: tự nhận 312 / xác minh 52 / không xác minh được 260

• PetalBot và Bingbot: lần lượt 19586 lượt, 100% xác minh được

Nhóm dữ liệu mang tính quyết định là đây: có 5 địa chỉ IP, mỗi IP trong 12 ngày đã dùng 12-13 danh tính bot AI khác nhau — cùng một nguồn, phút trước là GPTBot, phút sau là ClaudeBot, rồi PerplexityBot, Bytespider, meta-externalagent.

🚨 Số danh tính bot dùng trên cùng một IP (từ 3 danh tính trở lên = luân chuyển danh tính)

• 34.143.255.45 / 34.156.53.196 / 34.7.24.213: mỗi IP 13 danh tính

• 95.216.142.212 / 104.28.217.139: mỗi IP 12 danh tính

• Đường dẫn các IP này yêu cầu: /fetch, /proxy, /.env, /.gcloud/credentials

Toàn bộ đường dẫn chúng yêu cầu đều mang đặc trưng của công cụ quét (dò biến môi trường, thông tin xác thực đám mây, điểm cuối proxy), không liên quan gì đến việc thu thập nội dung. Kết luận: 83,9% lưu lượng trong nhóm tự nhận là bot AI không xác minh được danh tính, không thể dùng làm bằng chứng cho hiệu quả GEO. Nếu báo cáo nội bộ nói “lượt truy cập của bot AI tăng 300% trong tháng”, hãy kiểm tra IP trước — rất có thể đó chỉ là công cụ quét đổi tên.

🧭 Cần bổ sung một ngoại lệ cho chính xác: ChatGPT-User, Claude-User, Perplexity-User thuộc nhóm “thu thập theo thời gian thực do người dùng kích hoạt”, nhà cung cấp không công bố dải IP cố định. Bài viết xếp chúng vào nhóm “không xác minh được”, không xếp vào nhóm “mạo danh” — hai việc này khác bản chất.

3. Phát hiện 2: chỉ 6 danh tính thật sự thu thập nội dung

Sau khi loại phần không xác minh được, trong 12 ngày chỉ có 6 danh tính thật sự thu thập nội dung, tổng 1.432 yêu cầu, trung bình 119 yêu cầu mỗi ngày:

🤖 Chi tiết hành vi của các bot đã xác minh (12 ngày)

• Googlebot: yêu cầu hợp lệ / đường dẫn riêng biệt / 404 → 395 / 112 / 2

• GPTBot: 373 / 304 / 13

• ClaudeBot: 331 / 107 / 2

• PetalBot (chỉ mục tiếng Việt): 195 / 148

• Bingbot và OAI-SearchBot: 86 / 52

Ba “tính cách” khác nhau khá rõ: GPTBot thuộc nhóm quét rộng (373 yêu cầu trải trên 304 đường dẫn khác nhau, gần như đọc hết những gì đọc được); Googlebot tập trung (112 đường dẫn, chủ yếu là các trang thành phố Việt Nam); ClaudeBot có số lượt cao nhất nhưng phần lớn không phải nội dung — đó là phát hiện tiếp theo.

4. Phát hiện 3: hai phần ba hoạt động của ClaudeBot là đọc robots.txt và sitemap.xml

Trong 12 ngày, ClaudeBot yêu cầu robots.txt 110 lần và sitemap.xml 110 lần — hai tệp cộng lại 220 lần, chiếm 66,5% trong tổng 331 yêu cầu đã xác minh. Chúng gần như xuất hiện thành cặp mỗi ngày, dấu thời gian sát nhau: 08/09 lúc 03:47:31 hai yêu cầu trong cùng một giây, 19/09 lúc 00:53 lại một cặp.

Đây chính là cách tìm kiếm AI vận hành: đọc quyền trước, đọc chỉ mục sau, cuối cùng mới lấy nội dung. Hàm ý hành động rất trực tiếp:

5. Phát hiện 4: bài mới được thu thập lần đầu sau 2-4 giờ (đo thực tế)

Chúng tôi đối chiếu thời điểm tệp bài viết được ghi lên máy chủ với thời điểm bot truy cập URL đó lần đầu trong log. Kết quả đo trên ba nội dung mới:

⏱️ Từ lúc lên sóng đến lần thu thập đầu tiên của bot AI (đo thực tế)

• Phương pháp GEO tiếng Việt (lên sóng 13/09 02:03): 2 giờ 48 phút

• Hướng dẫn robots.txt / llms.txt (lên sóng 17/09 02:10): 3 giờ 45 phút

• Báo cáo đất hiếm & khoáng sản (lên sóng 18/09 02:07): 1 giờ 53 phút

Hai chi tiết đáng ghi lại:

6. Phát hiện 5: llms.txt lên sóng 48 giờ, 0 lượt được đọc

Phát hiện này trái với kỳ vọng của chính chúng tôi, và tạo thành đối chiếu với khuyến nghị trong bài viết trước. Chúng tôi đưa llms.txt lên ở cấp website từ 17/09 và ghi rõ đường dẫn trong robots.txt. Tính đến 19/09 02:00:

📄 Số lượt được bot AI đọc thực tế của ba “tệp dẫn đường” (12 ngày)

• /robots.txt (ClaudeBot 110 · OAI-SearchBot 22 · Googlebot 49): tổng 191 lượt

• /sitemap.xml (ClaudeBot 110 · GPTBot 8 · Bingbot 12): tổng 132 lượt

• /llms.txt (toàn bộ bot đã xác minh): 0 lượt

Kết luận trung thực: llms.txt hiện vẫn ở giai đoạn “đã có đề xuất, chưa có bot đọc”. Nó do Jeremy Howard đề xuất tháng 09/2024, là sáng kiến chứ không phải tiêu chuẩn IETF/W3C; tính đến 09/2026, các bot truy hồi AI chủ lưu vẫn chưa đưa tệp này vào đường dẫn thu thập thường quy — ít nhất là với website có lượng truy cập ở mức như của chúng tôi.

Điều đó không có nghĩa là không nên viết. Quan điểm của chúng tôi: chi phí 1 giờ, chỉ cần đặt một tệp Markdown ở thư mục gốc — hãy làm; nhưng đừng coi nó là “công tắc được AI thu thập”, và tuyệt đối không dùng nó thay cho sitemap.xml hay robots.txt. Khi nhà cung cấp bắt đầu đọc, bạn đã ở đúng chỗ; trước lúc đó, công sức GEO nên dồn vào nơi thật sự được đọc.

7. Phát hiện 6: bot AI thích đọc trang nào nhất?

Mở đường dẫn ra xem, hai nhóm trang nổi lên rõ rệt.

Nhóm một: trang dữ kiện thương hiệu (sân chính của GPTBot)

GPTBot thu thập lặp lại: trang chủ, /about.html (về chúng tôi), /services.html (dịch vụ), /pricing.html (giá), /cases.html (dự án), /terms.html và /privacy.html (điều khoản, quyền riêng tư), cùng trang giá và tệp định dạng của từng dòng dịch vụ. Nó cần những dữ kiện xác định: bạn là ai, làm gì, giá bao nhiêu, đã làm cho ai — đúng phần nguyên liệu mà AI cần trích dẫn khi trả lời người dùng.

Ngược lại: rất nhiều doanh nghiệp viết trang “về chúng tôi” bằng tính từ hoa mỹ, giấu báo giá sau câu “vui lòng liên hệ” — tức là tự bỏ đi vị trí dễ được trích dẫn nhất.

Nhóm hai: trang địa phương theo thành phố (sân chính của Googlebot và PetalBot)

112 đường dẫn của Googlebot gần như nằm trọn trong cấu trúc /vietnam/<thành phố>/<chủ đề>/ (khu công nghiệp, đầu tư, logistics, chi phí của Bắc Ninh, Hải Phòng, Hà Nội, Đà Nẵng, TP. Hồ Chí Minh), PetalBot (chỉ mục tiếng Việt) cũng tập trung vào trang thành phố và trang nội dung tiếng Việt. Điều này cho thấy: muốn vào ngữ liệu AI của một quốc gia, cửa vào hiệu quả nhất là các trang bản địa viết bằng ngôn ngữ sở tại với cấu trúc rõ ràng, chứ không phải dịch máy một bản tiếng Trung rồi đăng lên.

8. Sửa luôn: log giúp tìm ra hai liên kết chết thật

Trong quá trình rà soát, chúng tôi dọn hai khoản nợ chỉ log mới phát hiện được (đã sửa và đọc lại xác minh):

Cần lưu ý: phần lớn 404 trong log là nhiễu do công cụ quét tạo ra (đường dẫn bị dò nhiều nhất trong cửa sổ này là các tệp thông tin xác thực và cấu hình đám mây). Việc thật sự cần dọn là những 404 mà liên kết nội bộ của chính mình trỏ tới.

9. Áp dụng vào GEO: 5 hành động và 3 chỉ số theo dõi

5 hành động (làm được ngay trong tuần này)

  1. Mỗi tháng rà soát log một lần: xem đồng thời UA và IP nguồn, loại phần không xác minh được, chỉ nhìn lượng thu thập thật.
  2. Xuất bản là cập nhật sitemap.xml ngay: đây là cửa vào đầu tiên của tìm kiếm AI (ClaudeBot đọc 110 lần trong 12 ngày).
  3. Website song ngữ phải xuất bản cả hai phía: đo thực tế cho thấy hai phiên bản ngôn ngữ được cùng một bot lấy trọn trong 3 phút; chỉ đăng một phía là bỏ đi một nửa ngữ liệu.
  4. Viết trang dữ kiện thương hiệu cho thật: phạm vi dịch vụ, khoảng giá, thời gian bàn giao, dự án, năng lực — bằng văn bản HTML trích xuất được, không dùng ảnh, không dùng PDF, không viết “vui lòng liên hệ”.
  5. Đưa số lượng 404 nội bộ về 0: bot AI đi theo liên kết nội bộ của bạn, mỗi 404 là một lần đi không.

3 chỉ số theo dõi (đáng tin hơn nhiều so với “lượt truy cập của bot AI”)

Kết luận: dữ liệu gốc định hướng hành động tốt hơn báo cáo ngành

Báo cáo ngành nói với bạn rằng “tìm kiếm AI đang tăng” (Gartner 02/2024, Bain, iiMedia Research 02/2026 đều nói vậy); chỉ 1.432 yêu cầu trong log máy chủ của chính bạn mới cho biết AI đang thu thập cái gì, nhanh đến đâu, và chỗ nào bị bỏ trống. GEO không phải là viết thật nhiều nội dung, mà là để mỗi lần thu thập đều nhận được thứ đúng và có thể trích dẫn — đó là ý nghĩa ở phía kỹ thuật của câu “Được AI thấu hiểu – được thế giới nhìn thấy”.

Website của bạn đang được bot AI thu thập những gì?

Điền biểu mẫu 30 giây — nhận miễn phí “Báo cáo chẩn đoán hiện diện trên AI” trong 24 giờ, gồm rà soát log thu thập, xác minh danh tính bot, kiểm tra sitemap / robots và hiện trạng trích dẫn.

Nhận báo cáo miễn phí →

Được AI thấu hiểu – được thế giới nhìn thấy

📎 Nguồn dữ liệu:
• Log truy cập đầy đủ của nginx trên máy chủ website VIETTRITHONG GEO — thống kê gốc (cửa sổ 08/09/2026 – 19/09/2026, 4.206.895 yêu cầu; phương pháp: khai báo UA + xác minh dải IP công bố/phân giải ngược + phân loại đường dẫn)
• Gartner. (02/2024). Dự báo lưu lượng tìm kiếm truyền thống giảm 25% trong năm 2026.
• Bain & Company. (80% người tiêu dùng dành ít nhất 40% hoạt động tìm kiếm cho AI)
• iiMedia Research. (02/2026). Thị trường GEO Trung Quốc: 349,3 tỷ CNY (2025) → 942 tỷ CNY (2026).
• Technode. (08/2025). Tỷ lệ phủ sóng ChatGPT tại Việt Nam 81%.
• IETF. (09/2022). RFC 9309 — Robots Exclusion Protocol.
• Tài liệu bot chính thức của OpenAI, Anthropic, Google, Microsoft, Naver; llmstxt.org (Jeremy Howard, đề xuất 09/2024).
Lưu ý: số liệu trong bài chỉ đại diện cho đặc điểm lưu lượng của website này trong cửa sổ quan sát; website, ngành và quy mô truy cập khác có thể cho kết quả rất khác. UA và dải IP do nhà cung cấp điều chỉnh, kết quả xác minh chỉ có giá trị trong cửa sổ nêu trên.
← Quay lại danh sách bài viết