Câu hỏi mà khách hàng thương hiệu hỏi nhiều nhất đã chuyển từ “có nên làm GEO không” sang “phải đăng bao nhiêu bài mới đủ”. Câu này không thể trả lời bằng cảm giác, nên chúng tôi lại mở toàn bộ nhật ký máy chủ của mình — lần này không chỉ xem “ai đã đến”, mà điểm danh từng bài một: 100 bài viết, 12 ngày, 3.244.964 lượt yêu cầu, bài nào được AI đọc, đọc mấy lần, và mất bao lâu để bị đọc.

📊 Những con số cốt lõi của lần đo này (nhật ký nginx đầy đủ của VIETTRITHONG GEO, 2026-09-24)
• Cửa sổ nhật ký: 2026-09-13 03:47 → 09-24 01:37 (+0800), 12 ngày
• Tổng số yêu cầu: 3.244.964 (11 tệp nhật ký)
• Kiểm tra tình trạng cân bằng tải: 3.169.376 lượt (97,67%)
• Yêu cầu thực tế: 75.588 lượt
• Yêu cầu từ bot AI: 1.661 lượt (2,2% yêu cầu thực tế)
• Bài viết từng bị AI thu thập: 100/100 bài (50 tiếng Trung + 50 tiếng Việt)
• Trung bình mỗi bài: 1,53 lượt, cao nhất 3 lượt
• Tỷ lệ 404 trong yêu cầu AI: 635/1.661 = 38,2%
• Nội dung mới bị AI bên ngoài thu thập lần đầu: trung vị 4,1 giờ (nhanh nhất 3,7 giờ)

1. 100 bài viết, 100 bài đều từng được đọc — nhưng trung bình chỉ 1,53 lượt mỗi bài

Trước hết, kết thúc dứt điểm câu hỏi “AI có đọc nội dung của tôi không”: toàn bộ 100 bài trên site (38 bài tin tiếng Trung, 38 bài tin tiếng Việt, 12 báo cáo ngành tiếng Trung, 12 báo cáo ngành tiếng Việt) đều được bot AI thu thập ít nhất một lần trong cửa sổ đo — không có bài nào bị bỏ quên hoàn toàn. Đây không phải vấn đề “nội dung có đủ nhiều hay không”, mà là vấn đề “có được đặt ở nơi có thể tìm thấy hay không”.

Nhưng con số ngược lại mới đáng chú ý: 100 bài này cộng lại chỉ bị bot AI thu thập 153 lượt — chiếm 9,2% trong tổng 1.661 lượt yêu cầu AI. Nói cách khác, hơn chín phần mười yêu cầu AI không hề rơi vào phần thân bài, mà rơi vào trang chủ, robots.txt, sitemap.xml, và các đường dẫn quét mà mục 4 sẽ nói tới.

Loại nội dungSố bàiLượt bot AITrung bình/bàiDung lượng trung bình
Tin tiếng Trung (/geo/blog/)38651,71 lượt13,5 KB
Tin tiếng Việt (/geo/vi/blog/)38481,26 lượt15,9 KB
Báo cáo ngành tiếng Trung (8 chương)12181,50 lượt19,0 KB
Báo cáo ngành tiếng Việt (8 chương)12221,83 lượt23,4 KB
Tổng1001531,53 lượt

Một chi tiết dễ bị hiểu sai: mỗi bài đúng một lượt từ GPTBot, một lượt từ ClaudeBot và một lượt từ meta-externalagent — đó chính là nguồn gốc của giá trị trung bình 1,53. Đây không phải “AI đọc đi đọc lại”, mà là “ba loại bot mỗi loại xác nhận sự tồn tại một lần”.

2. Số lượt thu thập chỉ có ba mức 1, 2, 3: AI “xác nhận tồn tại”, không “đọc sâu”

Xếp 100 bài theo số lượt bị thu thập, phân bố hẹp đến mức khắc nghiệt: 68 bài chỉ được đọc 1 lượt, 11 bài 2 lượt, 21 bài 3 lượt, cao nhất là 3 lượt. Không một bài nào được đọc lặp lại nhiều lần chỉ vì “viết dài, viết kỹ, nhiều số liệu”.

Chúng tôi cũng tính hệ số tương quan giữa dung lượng trang và số lượt thu thập: r = 0,40 (tương quan yếu – trung bình). Báo cáo ngành trung bình 19,0 KB / 23,4 KB với 1,50 / 1,83 lượt; bài tin trung bình 13,5 KB / 15,9 KB với 1,71 / 1,26 lượt — dung lượng chênh gần gấp đôi nhưng số lượt thu thập không chênh gấp đôi.

💡 Ý nghĩa thật của dữ liệu này
• Thu thập không đồng nghĩa với trích dẫn: thu thập chỉ nghĩa là “tài liệu đã vào bể chỉ mục”; việc có được trích dẫn hay không phụ thuộc cấu trúc, độ tin cậy của số liệu và tính nhất quán của thực thể.
• Độ dài không phải đòn bẩy: viết 1.500 chữ thành 5.000 chữ không mang lại thêm lượt thu thập, chỉ làm tăng chi phí phân tích.
• Cấu trúc mới là đòn bẩy: tiêu đề phụ, bảng biểu, dải số liệu KPI, ghi nguồn — đây là những thứ quyết định AI có thể trích nguyên đoạn để dùng hay không.

3. Chỉ có 3 loại bot thật sự lấy nội dung; các bot mang danh “tìm kiếm AI” không lấy nội dung lần nào

Đây là phát hiện có giá trị nhất của lần đo. Tách 1.661 lượt yêu cầu AI theo danh tính, cột “lấy nội dung bài viết” chỉ có ba dòng khác 0: GPTBot 32 lượt, ClaudeBot 32 lượt, meta-externalagent 89 lượt — cộng lại đúng bằng 153. Trong khi đó các danh tính mang tên “tìm kiếm AI” hay “tác nhân người dùng AI” — OAI-SearchBot, Claude-SearchBot, PerplexityBot, ChatGPT-User, Claude-User, Perplexity-User — không lấy nội dung bài viết lần nào trong 12 ngày.

Danh tính bot (khai báo UA)Tổng yêu cầuLấy nội dungSố 404Tỷ lệ 404
GPTBot (OpenAI, huấn luyện)369325514,9%
ClaudeBot (Anthropic)33332298,7%
meta-externalagent (Meta)256892610,2%
OAI-SearchBot16006741,9%
Claude-User9209198,9%
PerplexityBot8104859,3%
Claude-SearchBot7804557,7%
ChatGPT-User6705379,1%
Perplexity-User56056100%
Amazonbot5305298,1%
Bytespider4804797,9%
MistralAI-User29029100%
Amzn-SearchBot2602596,2%
Google-Extended1301292,3%

Hai cách giải thích cùng tồn tại: một là bot tìm kiếm dựa nhiều hơn vào chỉ mục sẵn có và sơ đồ site, lấy trang danh sách và thông tin cấu trúc trước, chỉ quay lại nguồn khi có truy vấn — mà trong cửa sổ này chưa xuất hiện truy vấn cần quay lại; hai là một phần đáng kể các danh tính này là giả mạo — dữ liệu mục tiếp theo trực tiếp ủng hộ cách giải thích thứ hai.

4. 38,2% yêu cầu “bot AI” rơi vào 404 — chúng đang tìm tệp .env, không đọc bài của bạn

Trong 1.661 yêu cầu AI, có 635 lượt (38,2%) trả về mã 404. Kéo riêng các đường dẫn 404 ra thì bản chất lộ rõ:

Bằng chứng trực tiếp hơn nằm ở phân bố IP: 256 yêu cầu của meta-externalagent đến từ 95 địa chỉ IP khác nhau; trong cùng kỳ ClaudeBot chỉ dùng 24 IP, GPTBot 13 IP. Bot của các hãng lớn thật sự có dải IP hội tụ (dải chính thức), còn “danh tính trùng tên” trải trên hàng chục đến hàng trăm IP là đặc trưng điển hình của scanner giả mạo. 29 yêu cầu của MistralAI-User 100% là 404, 56 yêu cầu của Perplexity-User cũng 100% là 404 — một “proxy thu thập do người dùng kích hoạt” không thể chỉ truy cập các đường dẫn không tồn tại.

⚠️ Ba kết luận thực chiến
• Cách đo: đừng dùng UA để kết luận “AI đã đến bao nhiêu lần” — 38,2% yêu cầu AI trong lần đo này là scanner giả mạo; phải kiểm tra chéo bằng dải IP / phân giải ngược.
• Góc nhìn an ninh: lưu lượng bot AI có lẫn quét thông tin xác thực, 635 lượt trong 12 ngày; đây không phải vấn đề GEO mà là vấn đề bề mặt tấn công.
• Góc nhìn nội dung: chỉ ba danh tính thật sự vào thân bài (GPTBot / ClaudeBot / meta-externalagent) là đối tượng mà phía nội dung cần phục vụ tốt.

5. AI tìm đường bằng robots.txt và sitemap.xml; llms.txt 0 lượt đọc trong 12 ngày

Bot tìm thấy 100 bài đó bằng cách nào? Thứ tự đường dẫn trong cửa sổ này là: trang chủ 159 lượt > robots.txt 151 lượt > sitemap.xml 111 lượt > thân bài 153 lượt (trải trên 100 URL).

So sánh với điều này: tệp llms.txt ở thư mục gốc của site được bot AI đọc 0 lần trong suốt 12 ngày. Điều này không có nghĩa llms.txt vô nghĩa (đây là chỉ mục chi phí thấp cho các công cụ AI mới), nhưng nó cho thấy một thực tế rất cụ thể: trong thực tế thu thập của năm 2026, sitemap và robots vẫn là “đường lớn”, còn llms.txt mới chỉ là “biển chỉ đường”. Khi nguồn lực có hạn, hãy sửa tính đầy đủ của sitemap và quy tắc cho phép trong robots trước, thay vì làm một tệp llms.txt thật đẹp.

6. Nội dung mới bị AI thu thập sau 4 giờ, hai phiên bản tiếng Trung và tiếng Việt gần như cùng lúc

Có 19 bài được đăng trong cửa sổ và đã bị thu thập (gồm cả hai ngôn ngữ), độ trễ trung vị từ lúc đăng đến lần thu thập đầu tiên của AI là 4,1 giờ, nhanh nhất 3,7 giờ. Nhìn dấu thời gian có thể thấy việc thu thập chạy theo nhịp cố định: site chúng tôi triển khai nội dung mới vào 02:00–02:30 mỗi ngày, và cao điểm thu thập rơi vào 03:40–05:50.

Bài viết (ngày đăng)Ngôn ngữLần bị thu thập đầuĐộ trễ
Hai cửa vào AI tại Việt Nam (21-09)Tiếng Trung21-09 03:403,7 giờ
Hai cửa vào AI tại Việt Nam (21-09)Tiếng Việt21-09 03:393,7 giờ
Báo cáo thủy sản Việt Nam 2026 (23-09)Tiếng Trung23-09 03:493,8 giờ
Báo cáo thủy sản Việt Nam 2026 (23-09)Tiếng Việt23-09 03:483,8 giờ
Mức độ sẵn sàng AI của bán lẻ Việt Nam (20-09)Tiếng Trung20-09 03:543,9 giờ
Báo cáo gỗ và nội thất Việt Nam (20-09)Tiếng Trung20-09 03:533,9 giờ
Báo cáo đất hiếm và khoáng sản (18-09)Tiếng Trung18-09 04:004,0 giờ
Báo cáo đất hiếm và khoáng sản (18-09)Tiếng Việt18-09 04:034,1 giờ

Một chi tiết nữa mà bất kỳ ai làm site song ngữ cũng nên lưu ý: hai phiên bản tiếng Trung và tiếng Việt gần như bị thu thập trong cùng một phút (03:39 / 03:40, 03:48 / 03:49). Nghĩa là bot không “đọc tiếng Trung trước, vài hôm sau đọc bản dịch”, mà xử lý hai trang liên kết hreflang như cùng một tập nội dung — điều này có nghĩa bản tiếng Việt không có chi phí trễ, và không có lý do gì để “chờ đủ số lượng bản dịch mới đăng”.

7. Bản tiếng Việt không phải “bài tập dịch”: 50 chủ đề song ngữ, cả hai phía đều 100% được AI thu thập

Toàn bộ 50 chủ đề nội dung của site đều có bản tiếng Trung và tiếng Việt (cấu trúc thông tin và liên kết hreflang xem ở trang cấu trúc site). Kết quả đo lần này: cả hai phía ngôn ngữ của 50 chủ đề đều 100% từng bị bot AI thu thập, trong đó báo cáo ngành tiếng Việt đạt 1,83 lượt mỗi bài, thậm chí cao hơn bản tiếng Trung (1,50 lượt).

Đặt vào bối cảnh thị trường thì sức thuyết phục càng rõ: tỷ lệ phủ ChatGPT tại Việt Nam đã đạt 81%, hơn một nửa người dùng là trả phí (Technode, 2025-08); đồng thời tỷ lệ ứng dụng AI của Việt Nam là 23,5%, xếp thứ 38 toàn cầu (Hiệp hội Ngoại thương Đài Loan). Một bên là mức thâm nhập công cụ AI rất cao, một bên là mức ứng dụng hệ thống còn thấp — đây chính là cửa sổ mà nội dung tiếng Việt “vẫn còn rất ít cạnh tranh” trong câu trả lời của AI.

8. Chuyển bức chân dung này thành ba hành động cụ thể

9. Phương pháp, quy ước và miễn trừ

Nguồn dữ liệu: nhật ký truy cập nginx đầy đủ của site yuezhitong.com do VIETTRITHONG GEO vận hành, cửa sổ 2026-09-13 03:47:51 → 2026-09-24 01:37:31 (+0800), bao gồm 11 tệp nhật ký (10 tệp lưu trữ luân chuyển theo ngày + nhật ký thời gian thực), tổng cộng 3.244.964 lượt yêu cầu.

Quy ước xử lý: ① loại bỏ kiểm tra tình trạng cân bằng tải (UA = SLBHealthCheck, 3.169.376 lượt, chiếm 97,67%); ② dùng khai báo UA để lọc sơ bộ, xếp 14 danh tính vào nhóm “bot AI” (GPTBot / OAI-SearchBot / ChatGPT-User / ClaudeBot / Claude-SearchBot / Claude-User / PerplexityBot / Perplexity-User / Google-Extended / Bytespider / Amazonbot / Amzn-SearchBot / meta-externalagent / MistralAI-User); ③ đường dẫn được cắt bỏ chuỗi truy vấn rồi khớp chính xác với URL bài viết để điểm danh từng bài; ④ “lấy nội dung” được định nghĩa là yêu cầu trúng /geo/blog/{slug}.html hoặc /geo/vietnam-industry/{slug}.html hay đường dẫn tiếng Việt tương ứng; ⑤ độ trễ thu thập đầu tiên = khoảng thời gian từ article:published_time (00:00) của bài đến yêu cầu AI đầu tiên cho URL đó, chỉ tính 19 bài đăng trong cửa sổ và đã bị thu thập.

Miễn trừ trách nhiệm: mọi con số trên chỉ đại diện cho đặc điểm lưu lượng của site này trong cửa sổ đo; các hãng AI có thể thay đổi dải IP và chiến lược thu thập, vì vậy kết luận lịch sử không nên được suy rộng thành “quy tắc nền tảng”. Dữ liệu thị trường bên ngoài trong bài đều ghi rõ cơ quan và thời điểm, có thể kiểm tra theo nguồn.