Câu hỏi mà người làm GEO bị hỏi nhiều nhất là: anh làm cho thương hiệu được AI trích dẫn, rồi sao nữa? Khách có thật sự tới không?

Không thể trả lời bằng cảm giác. Câu trả lời chia làm hai nửa, và nửa năm qua ngành này trộn lẫn hai nửa đó khi nói: "được crawler AI lấy nội dung" (exposure / độ phủ) và "được AI giới thiệu" (referral / lượt bấm vào) là hai chuyện khác nhau, giữa chúng là cả một cơ chế gợi ý. Lượng crawl có thể đẩy lên bằng dữ liệu có cấu trúc, llms.txt, sitemap; lượng giới thiệu phụ thuộc việc AI có chịu nêu tên bạn trong câu trả lời hay không, và người dùng có chịu bấm thêm một lần hay không.

Bài này đếm riêng hai chuyện đó: trước hết tính lại toàn bộ log nginx 11 ngày của chính site chúng tôi theo đúng lớp "yêu cầu hợp lệ từ bên ngoài", sau đó công khai một lỗi đo lường của chính chúng tôi - kết luận rất đẹp ở bài trước, rằng "crawler AI dạng tìm kiếm đã lấy toàn bộ site theo từng đợt", khi tính lại hoá ra chủ yếu đến từ script kiểm toán của chính chúng tôi. Chúng tôi đặt cả hai kết quả cạnh nhau, vì một phương pháp đo biết tự sửa sai có giá trị hơn một kết luận đẹp.

Bốn mốc số liệu đối ngoại dùng trong bài (tổ chức + năm):
- Tìm kiếm truyền thống suy giảm: Gartner (2024-02), dự báo lượng tìm kiếm truyền thống giảm 25% vào năm 2026.
- Thói quen người dùng: Bain, 80% người tiêu dùng dùng AI cho ít nhất 40% nhu cầu tìm kiếm.
- Thị trường GEO Trung Quốc: iiMedia Research (2026-02), 349,3 tỷ CNY năm 2025, dự kiến 942 tỷ CNY năm 2026.
- Cửa vào AI tại Việt Nam: Technode (2025-08), tỷ lệ phủ ChatGPT tại Việt Nam 81%.

Một, tóm tắt: cùng một tập log, hai cách đếm, chênh 87 lần

Nói kết quả trước. Cửa sổ là 2026-09-23 03:12 đến 2026-10-04 02:03 (10 ngày 23 giờ, 11 tệp log). Log gốc 2.723.142 dòng. Theo cách đếm thô nhất, trong 11 ngày "crawler AI truy cập site" là 9.542 lượt; sau khi loại bỏ traffic từ script của chính chúng tôi, số lượt crawler AI thật từ bên ngoài là 1.436 lượt; trong đó thật sự vào thư mục nội dung GEO (/geo/) chỉ 197 lượt.

Và trong cùng cửa sổ đó, số lượt người thật bấm vào từ AI: 1 lượt.

Đối chiếu một câu (cửa sổ 2026-09-23 03:12 đến 2026-10-04 02:03):
- Crawler AI bên ngoài lấy nội dung: 1.436 lượt
- Trong đó đọc nội dung GEO (/geo/): 197 lượt
- Người thật được AI giới thiệu: 1 lượt (referrer = chatgpt.com)
- Được tìm kiếm truyền thống giới thiệu: 252 lượt (Google 105 / Baidu 64 / Bing 46 / DuckDuckGo 37)

Nói cách khác: trên mẫu nhỏ của chúng tôi, cứ 1.436 lần AI đọc site thì mới có 1 người bấm vào. Tỷ lệ này không có nghĩa "AI vô dụng", mà nói rõ AI search hiện đang cho thương hiệu cái gì: nó cho "vị trí trong câu trả lời", không cho traffic. Và đó chính là nền tảng lập luận của GEO: nếu thương hiệu không nằm trong câu trả lời thì người dùng thậm chí không có cơ hội bấm vào; nếu nằm trong câu trả lời thì người dùng cũng có thể không bấm.

Hai, phạm vi và phương pháp: ba lớp loại bỏ để lấy nhiễu ra khỏi dữ liệu

Độ tin cậy của một bài viết dựa trên log gốc nằm hoàn toàn ở phạm vi đo. Trong cửa sổ này có ba loại traffic phải loại trước, nếu không mọi kết luận đều sai.

Lớp một, kiểm tra sức khoẻ nội bộ. Health check của SLB (UA = SLBHealthCheck, IP nội bộ 172.16.0.49 và 172.23.232.126) chiếm 96,7% log gốc, tức 2.633.913 dòng. Mọi kết luận về "tỷ lệ crawler" hay "cấu trúc traffic" nếu không loại nó trước đều sai nghiêm trọng.

Lớp hai, script của chính chúng tôi. Đây là phát hiện lớn nhất của vòng này. Trong log có hai nhóm IP là của chúng tôi: máy phát hành 120.25.184.110 (54.901 dòng, pipeline cập nhật hằng ngày và script nghiệm thu) và IP công khai của chính máy chủ gốc 8.163.22.32 (22.293 dòng, engine chấm điểm GEO-Optimizer/2.0 chạy nội bộ). Tổng cộng 77.194 dòng, loại bỏ toàn bộ.

Lớp ba, tách "khai báo crawler" khỏi "danh tính thật". Việc phân loại crawler trong bài chỉ dựa trên khai báo UA, chưa đối chiếu reverse DNS, nên vẫn có khả năng mạo danh (điểm này chúng tôi nói riêng ở mục bảy).

LớpSố yêu cầuTỷ lệXử lý
Số dòng log gốc2.723.142100%-
Health check nội bộ SLBHealthCheck2.633.91396,74%Loại bỏ
Nguồn nội bộ (máy phát hành 120.25.184.110: 54.901, máy chủ gốc 8.163.22.32: 22.293)77.1942,83%Loại bỏ
Yêu cầu hợp lệ từ bên ngoài (mẫu phân tích của bài)12.0350,44%Phân tích

Sau ba lớp loại bỏ, 2,72 triệu dòng log chỉ còn 12.035 yêu cầu từ bên ngoài, đến từ 1.729 IP. Con số này tự nó là một lời nhắc: hơn 99% nội dung trong log website không phải "khách truy cập" - đó là health check, là bot của chính mình, là scanner. Không loại bỏ mà viết bài thì viết ra ảo giác.

Ba, kết quả: crawler AI bên ngoài 1.436 lượt trong 11 ngày, chỉ 197 lượt đọc nội dung GEO

Sau khi loại traffic nội bộ, crawler AI và công cụ tìm kiếm từ bên ngoài tổng cộng 1.436 lượt, chiếm 11,9% yêu cầu hợp lệ bên ngoài. Phân bố như sau:

Crawler (khai báo UA)Tổng yêu cầuTrong đó vào /geo/Tính chất
PetalBot (Huawei)3230Tìm kiếm truyền thống
Googlebot3140Tìm kiếm truyền thống
ClaudeBot (Anthropic, huấn luyện)29434Huấn luyện AI
meta-externalagent (Meta)263127Huấn luyện AI
GPTBot (OpenAI, huấn luyện)11236Huấn luyện AI
OAI-SearchBot (ChatGPT Search)590Tìm kiếm AI
360Spider (360 Search)420Tìm kiếm truyền thống
Baiduspider190Tìm kiếm truyền thống
ChatGPT-User (lấy nội dung theo yêu cầu người dùng)70Tìm kiếm AI
PerplexityBot30Tìm kiếm AI
Tổng1.436197-

Ba sự thật cấu trúc đáng chú ý:

Một, chỉ có ba loại UA thật sự đọc nội dung GEO của chúng tôi (/geo/): meta-externalagent 127 lượt, GPTBot 36 lượt, ClaudeBot 34 lượt, tổng 197 lượt. Còn ba crawler "dạng tìm kiếm" - OAI-SearchBot, PerplexityBot, ChatGPT-User - trong 11 ngày này không một lần đọc thư mục /geo/ (69 yêu cầu của chúng đều nằm ở các mục khác của site). Điều này ngược với nhận thức phổ biến trong ngành: hiện tại thứ hấp thụ bài dài GEO của chúng tôi một cách hệ thống là crawler "huấn luyện", không phải crawler "tìm kiếm".

Hai, nhóm huấn luyện gấp 9,7 lần nhóm tìm kiếm. GPTBot cộng ClaudeBot cộng meta-externalagent bằng 669 lượt, so với OAI-SearchBot cộng PerplexityBot cộng ChatGPT-User bằng 69 lượt. Kênh "nội dung được học vào mô hình" hiện hoạt động mạnh hơn hẳn kênh "được truy xuất và trích dẫn theo thời gian thực". Điều này giải thích một hiện tượng: vì sao có thương hiệu được nhắc trong câu trả lời AI mà không hề có traffic - nó được ghi vào trọng số mô hình, chứ không phải được truy xuất để trích dẫn.

Ba, thư mục /geo/ trả về 200 tổng cộng 161 lượt, trong đó 18 lượt từ UA không phải crawler. Nghĩa là hơn 60 bài song ngữ cộng 16 báo cáo ngành của chúng tôi, trong 11 ngày chỉ được các client "không phải crawler" bên ngoài đọc 18 lần. Con số này không đẹp, nhưng nó thật - và đó cũng là lý do chúng tôi lấy "được trích dẫn" làm KPI của GEO thay vì "được truy cập".

Bốn, kết quả: AI giới thiệu 1 lượt, tìm kiếm truyền thống giới thiệu 252 lượt

Crawl là hành vi của máy, giới thiệu mới là tiền. Chúng tôi lấy toàn bộ yêu cầu có referrer bên ngoài ra phân loại:

NguồnSố yêu cầu được giới thiệuTỷ lệ (phần quy được)
Chuyển trang nội bộ (yuezhitong.com và www)1.314- (điều hướng nội bộ, không phải thu hút khách)
Google10541,7%
Baidu6425,4%
Bing4618,3%
DuckDuckGo3714,7%
WeChat (servicewechat.com)45-
Engine AI (chatgpt.com)10,4%

Lượt duy nhất đó có thể mở ra xem đầy đủ (nguyên văn log):

Lượt giới thiệu từ AI duy nhất quan sát được trong cửa sổ:
- Thời điểm: 2026-09-29 12:20:36
- Trang đích: /cases.html?utm_source=chatgpt.com
- Referrer: https://chatgpt.com/
- Kết quả: HTTP 200 (UA trình duyệt, Windows Chrome 153)

Vậy trong 11 ngày này: AI giới thiệu so với tìm kiếm truyền thống là 1 : 252. Và chú ý trang đích - /cases.html (trang dự án) không nằm trong thư mục /geo/. Nghĩa là lượt giới thiệu này không phải thành quả trực tiếp của nội dung GEO, mà là hiệu ứng kèm theo sau khi AI đọc nội dung khác của site.

Tỷ lệ này không lạ, cũng không đáng xấu hổ. Nó chỉ cho thấy rằng mô tả giá trị của GEO như "mang traffic về website" là không trung thực ở thời điểm hiện tại. Cách nói trung thực là: GEO mua "vị trí trong câu trả lời" - một chiến trường xảy ra trước lượt bấm.

Năm, tự sửa sai: 8.106 lượt "crawler AI lấy nội dung" thật ra là chính chúng tôi

Giờ đến việc quan trọng nhất của vòng này.

Bài trước trên site (phát hành 2026-10-02) có một phát hiện: crawler AI dạng tìm kiếm đột ngột lấy toàn bộ site theo từng đợt từ ngày 27-09, và đến 30-09 "mỗi engine đi hết đúng cùng một tập 1.101 URL". Bài đó coi đây là bằng chứng gốc của site.

Khi vòng này tính lại theo phạm vi mới (loại nguồn nội bộ), kết luận đó sụp. Dữ liệu gốc như sau:

Crawler (khai báo UA)Số yêu cầu trong cửa sổIP nguồn
GPTBot1.3518.163.22.32 (chính máy chủ gốc của chúng tôi)
OAI-SearchBot1.3518.163.22.32
PerplexityBot1.3518.163.22.32
Claude-SearchBot1.3518.163.22.32
Googlebot1.3518.163.22.32
Applebot1.3518.163.22.32
Tổng8.106toàn bộ từ máy chủ gốc

Sáu engine khác nhau, số yêu cầu giống hệt nhau (1.351), và toàn bộ đến từ cùng một IP (máy chủ của chính chúng tôi) - đó là dấu vân tay của một script duy nhất. Trong thực tế, crawler của sáu nhà cung cấp độc lập không thể tạo ra số đếm giống hệt nhau: tần suất, tập URL và chính sách thử lại của họ đều khác. Dữ liệu thật cũng xác nhận: sau khi loại traffic nội bộ, số yêu cầu bên ngoài của Claude-SearchBot và Applebot trong cửa sổ là 0, của PerplexityBot là 3.

Vì sao xảy ra? Script chấm điểm mức độ sẵn sàng AI nội bộ của chúng tôi khi quét site của chính mình sẽ luân phiên nhiều UA crawler để gửi yêu cầu tới từng trang, nhằm kiểm tra "crawler với các danh tính khác nhau có lấy được nội dung bình thường không". Đây là hành động hợp lý khi kiểm toán hành vi robots.txt của chính mình, nhưng các yêu cầu nó sinh ra cũng được ghi vào log nginx. Phân tích vòng trước không làm bước "loại nguồn nội bộ", nên đã coi lượng tự truy cập này là hành vi crawler bên ngoài.

Chúng tôi xử lý thế nào? Ba việc: một là bài này tính lại theo phạm vi mới và công khai phần chênh lệch (9.542 trừ 1.436 bằng 8.106); hai là thêm ghi chú chỉnh phạm vi vào mục nguồn dữ liệu của bài trước, để người đọc không tiếp tục trích dẫn kết luận cũ; ba là đưa "loại nguồn nội bộ" vào quy trình phân tích thường quy - mọi kết luận đối ngoại dựa trên log đều phải qua bộ lọc nguồn trước.

Bài học thật của sự cố này:
- Không phải "script viết sai".
- Mà là "phạm vi đo thiếu một lớp loại bỏ: traffic của chính công cụ cũng là traffic".
- Công thức chung: khi "người đo" và "đối tượng được đo" nằm trên cùng một máy, việc đo sẽ làm nhiễm mẫu.

Đây cũng là yêu cầu chúng tôi tự đặt ra khi làm kiểm tra GEO cho khách: mọi con số trong báo cáo phải được người khác tính lại ra đúng như vậy với cùng phạm vi. Một phương pháp đo không biết tự sửa mình thì không có tư cách chấm điểm cho khách hàng.

Sáu, góc nhìn: AI search hiện là "cỗ máy độ phủ", không phải "cỗ máy traffic"

Ghép các mục trên lại, đây là bức tranh đầy đủ mà cửa sổ này đưa ra:

Chỉ sốGiá trị đo trong 11 ngàyCách đọc
Crawler AI bên ngoài lấy nội dung1.436 lượtThế giới AI đang "đọc" bạn
Trong đó đọc thư mục nội dung GEO197 lượtNội dung cấu trúc rõ ràng dễ được đọc hơn
Người thật được AI giới thiệu1 lượtThế giới AI gần như không "cho" traffic
Được tìm kiếm truyền thống giới thiệu252 lượtVẫn là nguồn truy cập ngoài chính hiện nay
Tỷ lệ 404 trong hàng đợi bên ngoài49,8% (5.992 trên 12.035)Một nửa yêu cầu ngoài là quét lỗ hổng, không phải đọc nội dung

Kết luận ngược trực giác nhưng hữu ích nhất cho người ra quyết định: sau khi người dùng thấy bạn trong AI, họ thường không bấm vào bạn. Có ba lý do, đều mang tính cấu trúc:

Một, câu trả lời đã thoả nhu cầu. AI đưa kết luận ra trực tiếp, người dùng không cần mở nội dung gốc - đây chính là kết quả của "zero-click" bị đẩy tới cực hạn trong thời đại AI. Gartner (2024-02) dự báo lượng tìm kiếm truyền thống giảm 25% vào 2026, và dữ liệu của Bain cho thấy 80% người tiêu dùng dùng AI cho ít nhất 40% nhu cầu tìm kiếm; cả hai đều nói về sự dịch chuyển này.

Hai, trích dẫn của AI không nhất thiết là liên kết. Nhiều câu trả lời viết "theo tính toán của một tổ chức" mà không kèm liên kết bấm được. Được nhắc không đồng nghĩa được dẫn link.

Ba, referrer sẽ bị tước. Mở trong app, chế độ riêng tư và một số client đều làm mất referrer, nên "1 lượt" là cận dưới, không phải cận trên - lượng giới thiệu thật từ AI chắc chắn bị đánh giá thấp. Điểm này phải được nêu kèm bất cứ khi nào trích dẫn số liệu của bài.

Vậy tài sản thương hiệu trong thời đại AI là gì? Không phải lượng truy cập, mà là chính việc "được viết vào câu trả lời một cách chính xác". Người dùng sẽ không bấm vào bạn, nhưng người dùng sẽ đọc câu nói về bạn - nếu câu đó sai, thiếu, hoặc hoàn toàn không có bạn, thì bạn không tồn tại trong lần ra quyết định này. Đó chính là vấn đề GEO giải quyết.

Bảy, rủi ro và biên độ: năm con số này không được nói thành tỷ lệ ngành

Rủi ro lớn nhất của dữ liệu gốc là bị đọc thành thống kê ngành. Dưới đây là biên độ của các số liệu trong bài, hãy trích dẫn kèm cả biên độ:

Một, mẫu một site. Toàn bộ số liệu đến từ một site yuezhitong.com trong cửa sổ 11 ngày, không đại diện cho bất kỳ mức trung bình ngành nào. Quy mô site, ngôn ngữ nội dung (song ngữ Trung - Việt) và cấu trúc chuyên mục đều làm thay đổi tỷ lệ đáng kể.

Hai, danh tính crawler phân loại theo khai báo UA, chưa đối chiếu reverse DNS. UA có thể giả - ngay trong cửa sổ này chúng tôi từng bắt được một scanner trên GCP luân phiên 16 danh tính crawler AI trong 88 giây và đồng thời quét các đường dẫn thông tin xác thực như /.env, /.git/config. Trong 1.436 lượt thật có thể lẫn traffic mạo danh.

Ba, 49,8% yêu cầu bên ngoài là 404. Nghĩa là một nửa traffic ngoài là quét tấn công (/.env, /.git/config, /xmlrpc.php v.v.), không phải khách. Lấy "lượng yêu cầu bên ngoài" làm bảng thành tích sẽ sai nghiêm trọng.

Bốn, số giới thiệu là cận dưới. Referrer bị tước trong app, chế độ riêng tư và một số client; đồng thời phía AI có thể dùng tham số utm_source thay vì referrer, hai phạm vi khác nhau. Bài này chỉ thống kê referrer quan sát được.

Năm, cửa sổ hơi ngắn (10 ngày 23 giờ). Chu kỳ quay lại của crawler AI thường tính theo tuần hoặc tháng, cần cửa sổ dài mới thấy cấu trúc ổn định. Mọi kết luận trong bài đều ghi rõ thời điểm bắt đầu và kết thúc cửa sổ, xin đừng suy rộng.

Tám, áp vào GEO: sáu việc để lấy "được trích dẫn" làm KPI

Nếu kết luận của bạn là "AI không cho traffic thì làm GEO làm gì", thì bạn đọc ngược rồi. Hành động đúng là đổi KPI từ "lượng truy cập" sang "được trích dẫn":

1. Thiết lập phạm vi log có thể tính lại. Loại health check và traffic nội bộ trước, rồi mới nói chuyện traffic AI. Bảng đầu tiên của bài này chính là mẫu - thiếu lớp đó thì mọi số liệu AI đều là ảo giác.

2. Chạy "công cụ đo" và "site được đo" tách rời nhau. Khi script chấm điểm hoặc kiểm toán chạy trên chính site của mình, nhất định phải lọc IP nguồn và UA của công cụ ở phía phân tích, nếu không công cụ sẽ làm nhiễm mẫu của bạn một cách ổn định (chúng tôi học được điều này với cái giá 8.106 yêu cầu).

3. Theo dõi "được trích dẫn" chứ không phải "được truy cập". Lập sổ theo tháng: số lần tên thương hiệu hoặc sản phẩm xuất hiện trong câu trả lời AI, trích dẫn có đúng không, có kèm liên kết không. Lượng truy cập chỉ là chỉ số phụ.

4. Nội dung phải để máy lấy được cả đoạn. Trong 1.436 lượt crawler AI bên ngoài có 197 lượt vào thư mục /geo/, cho thấy nội dung cấu trúc rõ ràng dễ được đọc hơn - JSON-LD, llms.txt, sitemap và thứ bậc tiêu đề rõ ràng không phải trang trí, mà là cửa vào.

5. Sửa trước những mục cơ bản "không đẹp". Mục 404 ngoài cao nhất trong cửa sổ là /favicon.ico (82 lượt), một mục thương hiệu nền tảng có thể sửa trong mười phút. Ấn tượng đầu tiên trong thời đại AI cũng được máy lưu trữ.

6. Trải song song tiếng Trung và tiếng Việt. Tỷ lệ phủ ChatGPT tại Việt Nam đã đạt 81% (Technode 2025-08), trong khi nội dung có cấu trúc chất lượng cao bằng tiếng Việt hiện vẫn là vùng trắng - cùng một chủ đề, phía tiếng Trung có hàng chục đối thủ, phía tiếng Việt có thể không có bài nào.

Chín, kết luận: sửa đúng phạm vi đo có giá trị hơn viết kết luận cho đẹp

Log 11 ngày này cho chúng tôi hai con số và một bài học: 1.436 lượt crawler AI bên ngoài, 1 lượt được AI giới thiệu, cùng với "người đo cũng làm nhiễm mẫu".

Bài học thứ hai quan trọng hơn cả hai con số. Ngành GEO hiện không thiếu những con số đẹp - thiếu những con số tính lại được. iiMedia Research (2026-02) đưa dự báo thị trường GEO Trung Quốc năm 2025 đạt 349,3 tỷ CNY và năm 2026 dự kiến 942 tỷ CNY; quy mô đó sẽ kéo vào rất nhiều "dữ liệu theo cảm giác". Ai đặt được phạm vi đo lên bàn, người đó mới có cơ hội được AI trích dẫn và được khách hàng tin.

Nên lời khuyên của chúng tôi cho thương hiệu chỉ một câu: hãy biến phạm vi đo thành tài sản trước, rồi mới nói tới tối ưu. Chúng tôi không ngại công khai việc mình từng làm nhiễm phạm vi đo một lần - vì lần tới khi kiểm tra cho bạn, chúng tôi biết cần lọc cái gì.