Câu hỏi mà các thương hiệu Việt Nam hỏi nhiều nhất gần đây là: “Chúng tôi phải xuất hiện ở đâu thì mới được coi là hiển thị trong AI?” Câu trả lời không phải bốn chữ “ChatGPT”, mà là ba cửa vào hoàn toàn khác nhau. Để nói rõ điều này, chúng tôi làm một việc ít đơn vị nào làm: lấy toàn bộ nhật ký máy chủ 10 ngày của website mình ra và kiểm tra từng dòng — rốt cuộc ai đang thu thập nội dung của chúng tôi, và ai chưa từng đến một lần.
Một, cửa thứ nhất: Google chiếm 94,72%, Cốc Cốc nội địa còn 4,44%
Nhìn vào thị phần trước. Tháng 8/2026 tại Việt Nam: Google 94,72%, Cốc Cốc 4,44%, Bing 0,47%, Yahoo 0,27%, DuckDuckGo 0,04% (Statcounter, 08/2026). Cốc Cốc là trình duyệt và công cụ tìm kiếm “Make in Vietnam” duy nhất của Việt Nam, được Bộ Thông tin và Truyền thông đưa vào danh sách nền tảng số quốc gia năm 2022; đến tháng 5/2023 khi ra mắt bộ đôi sản phẩm AI, Cốc Cốc đã có hơn 29 triệu người dùng và công cụ tìm kiếm xử lý hơn 600 triệu lượt truy vấn mỗi tháng (VnEconomy, 05/2023).
Điều đáng chú ý không phải con số 4,44%, mà là hình dạng sản phẩm: Cốc Cốc AI Search tóm tắt nhiều nguồn thành một câu trả lời, thời gian phản hồi theo công bố khoảng 2 giây, người dùng không cần mở website nữa. Nói cách khác, công cụ tìm kiếm nội địa Việt Nam đã làm đúng việc mà ChatGPT và Google AI Overviews đang làm — thay “danh sách liên kết” bằng “câu trả lời”. Nếu thương hiệu của bạn không nằm trong vài nguồn được tóm tắt đó, bạn vô hình ngay trong 4,44% này.
Hai, cửa thứ hai: 81,3 triệu người trong Zalo, cửa vào AI nằm ở khung chat
Cửa thứ hai không nằm trong trình duyệt. Báo cáo quý II/2026 của VNG cho thấy: Zalo có 81,3 triệu người dùng hoạt động mỗi tháng, mỗi ngày chuyển hơn 2,2 tỷ tin nhắn; khoảng 24 triệu người dùng các tính năng nhắn tin và gọi điện có AI mỗi tháng, tăng 33% so với cùng kỳ; doanh thu mảng tin nhắn và AI đạt 639 tỷ đồng, tăng 63%. Trong cùng báo cáo, doanh thu AI Cloud của GreenNode tăng 271%, phục vụ hơn 1.000 khách hàng doanh nghiệp (Technode, 08/2026). Trợ lý giọng nói tiếng Việt Kiki của Zalo AI từng nhận giải thưởng công nghệ trong nước.
Với một thương hiệu tại Việt Nam, đây là loại cửa vào thứ hai: khách hàng không hỏi bạn trong công cụ tìm kiếm, mà hỏi AI ngay trong khung chat họ mở mỗi ngày. Quy tắc hiển thị ở cửa này hoàn toàn khác xếp hạng trang web — nó phụ thuộc vào hệ sinh thái nội dung nội địa, hồ sơ doanh nghiệp và các nguồn tin nội địa trích dẫn bạn.
Ba, cửa thứ ba: công cụ AI toàn cầu, tỷ lệ phủ ChatGPT tại Việt Nam 81%
Cửa thứ ba là mức thâm nhập của các công cụ toàn cầu: tỷ lệ phủ của ChatGPT tại Việt Nam là 81%, hơn một nửa người dùng đã trả phí (Technode, 08/2025); tỷ lệ ứng dụng AI chung của Việt Nam là 23,5%, xếp thứ 38 toàn cầu. Trong bối cảnh toàn cầu: Gartner (02/2024) dự báo lưu lượng tìm kiếm truyền thống giảm 25% trong năm 2026; khảo sát của Bain cho thấy 80% người tiêu dùng dành ít nhất 40% hành vi tìm kiếm cho kết quả AI. Để so sánh, thị trường GEO Trung Quốc tăng từ 34,93 tỷ CNY năm 2025 lên mức dự báo 94,2 tỷ CNY năm 2026 (iiMedia Research, 02/2026) — cùng một logic đang lặp lại tại Việt Nam, chỉ khác là có nhiều cửa vào hơn.
Bốn, chúng tôi đọc 2,82 triệu dòng nhật ký trong 10 ngày: nói rõ phương pháp trước
Kết luận phải có thể tính lại được, nên phương pháp được nêu trước. Khoảng thời gian: 11/09/2026 03:29 → 21/09/2026 02:02 (+0800), bao gồm toàn bộ nhật ký truy cập nginx của yuezhitong.com (9 tệp lưu trữ + nhật ký trực tiếp trong ngày, tổng 2.820.868 lượt yêu cầu). Việc kiểm tra gồm ba lớp: ① khai báo UA; ② phân giải ngược (rDNS) đối chiếu với dải IP công bố của nhà cung cấp; ③ phân loại theo hành vi đường dẫn. Toàn bộ lưu lượng tự kiểm tra của chúng tôi (3 IP nội bộ) đã được loại bỏ.
Con số đầu tiên sau khi làm sạch đã cho thấy vấn đề: trong 2,82 triệu lượt yêu cầu, 2.749.807 lượt (97,5%) là kiểm tra tình trạng cân bằng tải, chỉ 71.061 lượt thực sự đến từ người dùng và bot. Bất kỳ phân tích lưu lượng nào bỏ qua bước làm sạch này đều cho ra kết luận vô giá trị — đây cũng là lý do nhiều doanh nghiệp mở nhật ký máy chủ ra mà không thấy được gì.
Năm, phát hiện một: bot AI chỉ chiếm 4,65%, nhưng chính 4,65% này quyết định tất cả
| Danh tính bot | Mục đích | Số yêu cầu |
|---|---|---|
| Googlebot | Lập chỉ mục tìm kiếm | 1.657 |
| GPTBot | Thu thập để huấn luyện mô hình | 419 |
| ClaudeBot | Thu thập để huấn luyện mô hình | 362 |
| PetalBot | Lập chỉ mục tìm kiếm (Huawei) | 211 |
| OAI-SearchBot | Trích dẫn theo truy vấn | 120 |
| Bingbot | Lập chỉ mục tìm kiếm | 98 |
| 14 danh tính còn lại | Trích dẫn / huấn luyện / xem trước | 435 |
Sau khi loại lưu lượng tự kiểm tra, trong 10 ngày có 3.302 lượt yêu cầu từ bot liên quan AI, chiếm 4,65% yêu cầu thực tế. Một chi tiết đáng chú ý riêng: GPTBot (dùng để huấn luyện) nhiều gấp 3,5 lần OAI-SearchBot (dùng để trích dẫn trong câu trả lời). Hai danh tính này về mặt kỹ thuật là hai việc khác nhau — bị lấy đi để huấn luyện không đồng nghĩa với được trích dẫn; chỉ khi được trích dẫn mới có lưu lượng và niềm tin. Nếu nhật ký của bạn chỉ có GPTBot mà không có OAI-SearchBot / Claude-SearchBot / PerplexityBot, nghĩa là nội dung đã bị “đọc đi”, nhưng chưa vào được câu trả lời.
Sáu, phát hiện hai: bot của công cụ tìm kiếm nội địa Việt Nam, 0 lượt trong 10 ngày
Đây là kết quả phản trực giác nhất của lần này. Chúng tôi quét nhật ký với tiêu chí rộng, bao gồm cả cách viết có dấu tiếng Việt (Cốc Cốc / CocCoc / Coc Coc / ZaloBot / Zalo Bot / ViettelBot / KiKi Bot và các biến thể), số lượt khớp là 0. Những trường hợp thoạt nhìn có khớp như fpt, zalo, shopee, tiki, sau khi kiểm tra từng dòng đều đến từ các từ nằm trong URL bài viết, không phải danh tính bot.
Cần nói chính xác kết luận: không phải “công cụ nội địa không quan trọng”, mà là logic thu thập của các cửa vào nội địa khác với bot quốc tế. Nó phụ thuộc nhiều hơn vào hệ sinh thái nội dung nội địa, hợp tác nền tảng và dữ liệu bên trong siêu ứng dụng, chứ không phải tệp robots.txt hay sitemap bạn đặt ở thư mục gốc. Vì vậy cách làm đúng cho thương hiệu Việt Nam không phải là “chờ họ đến thu thập”, mà là “chủ động xuất hiện trong các nguồn nội địa mà họ dựa vào” — điều này cũng giải thích vì sao nhiều thương hiệu Việt xếp hạng rất tốt trên Google nhưng biến mất hoàn toàn trong câu trả lời của AI.
Bảy, phát hiện ba: một IP, 88 giây, 16 danh tính bot AI
Kỳ trước chúng tôi báo cáo: trong các yêu cầu tự nhận là bot AI, 83,9% không thể xác minh nguồn gốc. Lần này chúng tôi có bằng chứng trực tiếp hơn. IP 34.7.24.213 (dải máy chủ Google Cloud) trong 88 giây ngày 13/09 đã gửi 442 yêu cầu và đổi 16 danh tính: GPTBot, ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User, OAI-SearchBot, ChatGPT-User, Applebot, Amazonbot, Amzn-SearchBot, Bytespider, Google-Extended, meta-externalagent, thậm chí cả GrokBot và facebookexternalhit.
Bot AI thật không đi tìm thông tin xác thực của máy chủ. Trong cùng lượt truy cập đó, 100 yêu cầu hướng tới các tệp thông tin xác thực và cấu hình: /aws/credentials, /.env, /@fs/proc/1/environ, /.zshrc, /wp-config.php.swp, /__aws_leak_probe_… Việc giả danh kết hợp với quét thông tin xác thực cho thấy đây không phải bot của bất kỳ công ty AI nào.
Hai hàm ý thực tế cho doanh nghiệp: thứ nhất, đo hiển thị AI không thể chỉ dựa vào UA — UA là trường dễ bị giả mạo nhất, phải xác minh bằng phân giải ngược IP và dải IP công bố của nhà cung cấp; thứ hai, “lượng bot AI tăng vọt” không chắc là tin tốt, có thể chỉ là bị quét một lượt.
Tám, phát hiện bốn: bot AI tìm đường bằng sitemap, không bằng liên kết nội bộ
Trong 10 ngày, bot AI đọc robots.txt 231 lượt, đọc sitemap.xml 139 lượt, trong khi llms.txt chỉ có 3 lượt đọc từ bên ngoài — và 3 lượt đó đều mang UA của trình duyệt thông thường, không có lượt nào là bot AI chủ lưu. llms.txt đã lên sóng 5 ngày, số lượt đọc của bot AI chủ lưu vẫn là 0, khớp với quan sát kỳ trước (19/09).
Cùng kỳ, bot AI đọc nội dung /geo/ của website 178 lượt, với phân bố đường dẫn mang đặc trưng “theo sitemap”: trang tiếng Trung và trang tiếng Việt xuất hiện thành cặp, hai phiên bản ngôn ngữ của cùng một nội dung được lấy lần lượt. Điều này cho thấy: sitemap là trục đường chính để AI phát hiện nội dung, trọng số của liên kết nội bộ thấp hơn nhiều so với trực giác. Đưa bài mới vào sitemap hiệu quả hơn gắn một liên kết trên trang chủ. Còn llms.txt, ở giai đoạn hiện tại nó là tài sản “viết cho tương lai”, không phải công tắc để được lập chỉ mục.
Chín, phát hiện năm: nội dung mới bị AI lấy trong 2 giờ, cả hai ngôn ngữ trong 5 phút
Rạng sáng 20/09 lúc 01:44, chúng tôi phát hành hai nội dung mới (tổng 4 trang cho cả tiếng Trung và tiếng Việt). Thời điểm lần đầu bị bot AI bên ngoài lấy là 03:51 (phiên bản tiếng Việt), sau đó trong vòng 5 phút, báo cáo ngành tiếng Trung, bài viết tiếng Trung và báo cáo ngành tiếng Việt đều được lấy hết. Nói cách khác, liên kết mới đưa vào sitemap sẽ được AI đến lấy trong khoảng 2 giờ — khớp với khung 2–4 giờ đo được ở kỳ trước.
Dữ liệu này có ý nghĩa trực tiếp với việc lên lịch nội dung: 2 giờ đầu sau khi lên sóng là khung thời gian then chốt để nội dung vào kho ngữ liệu AI. Cập nhật sitemap cùng lúc phát hành và giữ trang có thể thu thập được (không tường đăng nhập, không để phần nội dung chính render bằng JavaScript) quan trọng hơn nhiều so với việc “tối ưu” sau đó.
Mười, ba kết luận có thể hành động cho thương hiệu Việt Nam
1. Bố trí theo ba cửa vào riêng biệt, đừng chỉ mua đúng một từ khóa “tìm kiếm AI”. Công cụ AI toàn cầu (phải được thu thập + phải có dữ liệu có cấu trúc), công cụ nội địa và siêu ứng dụng (Cốc Cốc AI Search / hệ sinh thái Zalo, dựa vào nguồn tin nội địa và hệ sinh thái nội dung), cùng các media ngành và nền tảng dọc. Ba cửa có quy tắc hiển thị khác nhau, nên chiến lược nội dung cũng phải khác nhau.
2. Coi sitemap, hreflang và dữ liệu có cấu trúc là trục đường chính. Đo thực tế cho thấy AI tìm đường bằng sitemap, đọc dữ kiện bằng dữ liệu có cấu trúc, xác nhận quyền bằng robots.txt. Ba thứ này có tỷ lệ đầu tư trên hiệu quả cao hơn nhiều so với việc sửa đi sửa lại phần mô tả trên trang chủ.
3. Tự xây dựng hệ thống theo dõi thu thập và trích dẫn, lấy xác minh IP làm chuẩn. Thống kê theo UA sẽ dẫn bạn đến kết luận sai (lần đo này: 97,5% yêu cầu là kiểm tra tình trạng, và 16 danh tính đến từ cùng một IP giả danh). Chỉ nhìn vào “có bao nhiêu bot AI đến” là chỉ số giả; chỉ số thật là “trang nào được trích dẫn, ai trích dẫn, và trích dẫn có đúng không”.
Nếu bạn muốn biết hiện trạng của mình ở cả ba cửa vào, hãy bắt đầu bằng một buổi chẩn đoán miễn phí: chúng tôi sẽ đưa ra hiện trạng trích dẫn thương hiệu trên các công cụ AI chủ lưu, các khoảng trống dữ liệu có cấu trúc và danh sách ưu tiên.