Một. Tóm tắt: sau 17 ngày, quay lại đúng nhóm site cũ, ngành gần như không nhúc nhích
Ngày 20/09/2026, chúng tôi đã thực hiện kỳ đo đầu tiên mang tên «Đo mức độ sẵn sàng cho AI của 14 website bán lẻ – thương mại điện tử hàng đầu Việt Nam». Kết luận khi đó: 9 site có thể chấm điểm, không site nào đạt mức «tốt», điểm trung bình chỉ 51,0; 5 site còn lại hoàn toàn vô hình trước crawler AI.
Câu hỏi chúng tôi nhận được nhiều nhất sau kỳ đó là: «Vậy họ có sửa không?». Câu này không thể trả lời bằng suy đoán, chỉ có thể trả lời bằng đo lại. Vì vậy ngày 07/10/2026, chúng tôi đo lại đúng 15 tên miền đó, với cùng danh sách tên miền, cùng engine chấm điểm, cùng điểm đo tại Singapore, cùng User-Agent và cùng quy tắc loại trừ.
Kết quả còn đáng viết hơn cả câu hỏi «họ có sửa không»:
- Cả ngành đang «đóng băng». Trong 9 site chấm được điểm, 8 site có cả 8 chiều điểm giống hệt kỳ trước — không phải «xấp xỉ», mà là giống tuyệt đối. Điểm trung bình từ 51,0 lên 52,3, và toàn bộ mức tăng đến từ một site duy nhất.
- Site duy nhất hành động lại chọn việc rẻ nhất. nguyenkim.com từ 54 lên 66 (+12), chiều duy nhất thay đổi là llms: 0 → 12. Việc họ làm trong 17 ngày qua là đưa lên một tệp llms.txt dung lượng 1.702 byte.
- «Cửa» vẫn đóng. Ba tên miền fptshop, vinamilk, masangroup: chúng tôi lần lượt gọi trang chủ bằng 12 loại User-Agent (gồm cả Googlebot, Bingbot và CocCocbot của Việt Nam), 36 lượt yêu cầu đều trả về 403; thegioididong vẫn hết thời gian chờ; llms.txt của VinFast dài tới 27.410 byte và viết rất tốt, nhưng trang chủ vẫn không vào được.
- Mẫu làm đúng đã tồn tại. lazada.vn ghi rõ trong robots.txt việc cho phép OAI-SearchBot / GPTBot / ChatGPT-User, kèm một llms.txt thật; goha.vn tách riêng nhóm «tìm kiếm AI và agent» được phép với nhóm «thu thập dữ liệu huấn luyện AI» bị từ chối. Điều này cho thấy bán lẻ Việt Nam không làm được không phải vì kỹ thuật, mà vì mức ưu tiên.
Bài này trình bày đầy đủ cách đo có thể so sánh, bảng đối chiếu từng site, chi tiết thay đổi theo từng chiều điểm, và một danh sách bốn bước xếp theo mức điểm thu về.
- Điểm trung bình 9 site chấm được: 51,0 → 52,3 / 100
- Số site giống hệt kỳ trước ở cả 8 chiều: 8 / 9 site
- Thay đổi duy nhất: nguyenkim.com (thêm llms.txt) 54 → 66 (+12)
- Tên miền vẫn vô hình với AI: 5 / 15
Hai. Cách đo: vì sao hai con số này trừ trực tiếp cho nhau được
Rủi ro lớn nhất của việc đo lại là đọc nhầm «chúng tôi đổi thước đo» thành «họ đã sửa». Nên phần này nói rõ cây thước trước — mọi mục dưới đây đều không đổi giữa hai kỳ:
| Hạng mục | Kỳ đầu 20/09/2026 | Kỳ đo lại 07/10/2026 | Khác biệt |
|---|---|---|---|
| Danh sách tên miền | 15 URL (14 hợp lệ + 1 tên miền viết sai chính tả) | Đúng 15 URL đó, không đổi một ký tự | Không |
| Engine chấm điểm | Engine GEO mã nguồn mở, 8 chiều, thang 100 điểm | Cùng engine, phiên bản 4.18.1 | Không (xem giải thích bên dưới) |
| Điểm đo | Singapore | Singapore | Không |
| Danh tính yêu cầu | User-Agent Chrome chuẩn, Accept-Language tiếng Việt | User-Agent Chrome chuẩn, Accept-Language tiếng Việt | Không |
| Quy tắc loại trừ | Site lấy thất bại và trang vỏ chống crawler không tính vào điểm trung bình | Cùng quy tắc | Không |
| Mẫu vào điểm trung bình | 9 site | 9 site (đúng nhóm cũ) | Không |
Tự chứng minh về phiên bản engine. Giữa hai kỳ engine có cập nhật phiên bản nhỏ, nên chúng tôi không thể khẳng định bản chạy là hoàn toàn giống nhau — nhưng có một bằng chứng mạnh hơn: 8 trong 9 site có điểm thành phần ở cả 8 chiều trùng khớp từng con số (các điểm nguyên như robots 15, schema 9, meta 14, content 12). Nếu cây thước bị lệch, không thể có kết quả «cả bảng khớp, chỉ một ô nhúc nhích» như vậy. Vì thế bài này quy toàn bộ thay đổi điểm về phía site, không quy về phía thước đo.
Ba quy ước khi đọc bảng:
- Không lấy được khác với 0 điểm. Các tên miền trả 403, hết thời gian chờ hay lỗi DNS đều được ghi «không chấm được điểm», tuyệt đối không ghi 0 điểm — biến «không lấy được» thành «yếu nghiêm trọng» là lỗi gây nhầm lẫn phổ biến nhất của loại báo cáo này.
- Trang vỏ chống crawler ghi riêng. shopee.vn trả 200, trang nặng 202 KB, nhưng phần nội dung và thẻ mô tả trống (trang vỏ captcha); 25 điểm của nó không đại diện chất lượng nội dung thật, nên không tính vào điểm trung bình mà ghi riêng.
- Tên miền viết sai vẫn giữ trong danh sách. shoppe.vn (thiếu một chữ e) là tên miền viết sai phát hiện ở kỳ đầu, chúng tôi giữ nguyên để kiểm tra xem sau này có được sửa không — kỳ này vẫn không phân giải được.
Ba. Kết quả từng site: đối chiếu đầy đủ 15 tên miền
Bảng dưới là điểm và trạng thái của toàn bộ 15 tên miền qua hai kỳ. Cột Δ để trống nghĩa là kỳ này hoặc kỳ trước không chấm được điểm (không so sánh được), không phải không thay đổi.
| Tên miền | Nhóm | 20/09/2026 | 07/10/2026 | Δ | Trạng thái kỳ này |
|---|---|---|---|---|---|
| nguyenkim.com | Bán lẻ 3C | 54 | 66 | +12 | Chấm được điểm (thay đổi duy nhất) |
| goha.vn | Đồng nghiệp GEO | 62 | 62 | 0 | Chấm được điểm |
| kidsplaza.vn | Bán lẻ mẹ và bé | 56 | 56 | 0 | Chấm được điểm |
| tiki.vn | Sàn thương mại điện tử | 54 | 54 | 0 | Chấm được điểm |
| cellphones.com.vn | Bán lẻ 3C | 49 | 49 | 0 | Chấm được điểm |
| masangroup.com | Tập đoàn tiêu dùng | 47 | 47 | 0 | Engine chấm được; đầu dò độc lập nhận 403 |
| mediamart.vn | Bán lẻ 3C | 47 | 47 | 0 | Chấm được điểm |
| lazada.vn | Sàn thương mại điện tử | 46 | 46 | 0 | Chấm được điểm |
| bibomart.com.vn | Bán lẻ mẹ và bé | 44 | 44 | 0 | Chấm được điểm |
| shopee.vn | Sàn thương mại điện tử | 25 | 25 | 0 | Trang vỏ chống crawler (không tính vào trung bình) |
| fptshop.com.vn | Bán lẻ 3C | — | — | — | Không chấm được: trang chủ 403 (12/12 UA) |
| vinamilk.com.vn | Thực phẩm – đồ uống | — | — | — | Không chấm được: trang chủ 403 (12/12 UA) |
| thegioididong.com | Đầu ngành bán lẻ 3C | — | — | — | Không chấm được: hết thời gian chờ (kỳ đầu 191 giây chưa kết nối được) |
| vinfastauto.com/vn_v | Ô tô và xe điện | — | — | — | Không chấm được: trang chủ 403 |
| shoppe.vn | Tên miền viết sai | — | — | — | Tên miền vẫn không phân giải được |
Xếp 9 site chấm được điểm lại: trung bình 52,3, trung vị 49, khoảng 44–66. Kỳ trước là trung bình 51,0, trung vị 49, khoảng 44–62. Điểm trung bình tăng 1,3 điểm và toàn bộ đến từ nguyenkim; trung vị không nhích một đơn vị — nghĩa là một site bán lẻ thương mại điện tử Việt Nam điển hình, trong mắt AI, vẫn dễ đọc y như 17 ngày trước.
Cũng cần nói rõ: kỳ này không site nào vào mức «tốt» (từ 68 điểm trở lên). Site tốt nhất kỳ trước là goha.vn (62) kỳ này vẫn 62; site đứng đầu kỳ này là nguyenkim.com với 66 điểm, vẫn ở mức «cần xây dựng».
Bốn. Nhận định một: cái gọi là «đóng băng» là cả 8 chiều khớp nguyên bảng
«Điểm không đổi» có hai khả năng: một là thật sự không làm gì, hai là có chiều tăng có chiều giảm rồi bù trừ nhau. Chúng tôi lấy toàn bộ điểm thành phần ra đối chiếu, kết quả là khả năng thứ nhất — 8 site, 8 chiều, 64 điểm thành phần, trùng khớp từng mục.
| Chiều (điểm tối đa) | Trung bình 9 site 20/09 | Trung bình 9 site 07/10 | Thay đổi | Ý nghĩa |
|---|---|---|---|---|
| robots (18) | 15,00 | 15,00 | 0 | Bài tập SEO truyền thống, nhìn chung làm tốt |
| llms (18) | 2,44 | 3,78 | +1,33 | Chiều tăng duy nhất, và đến từ một site |
| schema (16) | 7,33 | 7,33 | 0 | Một nửa số điểm, đứng yên ở giữa |
| meta (14) | 13,11 | 13,11 | 0 | Gần tối đa, là chiều trưởng thành nhất của ngành |
| content (12) | 9,00 | 9,00 | 0 | Lượng nội dung đủ, không phải điểm nghẽn |
| signals (6) | 3,00 | 3,00 | 0 | Đúng một nửa |
| ai_discovery (6) | 0,44 | 0,44 | 0 | Gần như trắng: 6 trong 9 site bằng 0 |
| brand_entity (10) | 3,89 | 3,89 | 0 | Thông tin nhất quán về thực thể còn thiếu dài hạn |
Bảng này cho nhiều thông tin hơn điểm tổng: bán lẻ thương mại điện tử Việt Nam làm được 15/18 cho «tìm kiếm phục vụ con người», nhưng dừng ở 0,44/6 cho «cửa vào phục vụ máy». meta 13,11/14 nghĩa là tiêu đề và mô tả đều đã có; ai_discovery 0,44/6 nghĩa là tại gốc site gần như không có cửa vào dạng máy đọc được (bản tóm tắt có cấu trúc, dữ liệu hỏi đáp, danh mục dịch vụ). llms 2,44/18 còn nói thẳng hơn: 6 trong 9 nền tảng có chiều llms bằng 0.
17 ngày đủ để đưa lên một tệp mới, cũng đủ để sửa một loạt schema. Nhưng trong khoảng thời gian đó, cả ngành chọn dồn sự chú ý vào việc khác.
Năm. Nhận định hai: site duy nhất hành động chọn việc rẻ nhất
nguyenkim.com là chuỗi bán lẻ điện máy – gia dụng lâu đời của Việt Nam (thành lập năm 1992, hàng chục siêu thị trên toàn quốc). Điểm tổng của họ từ 54 lên 66, trong 8 chiều thì 7 chiều đứng yên tuyệt đối (robots 15, schema 9, meta 14, content 12, signals 3, ai_discovery 0, brand_entity 4, điểm phạt vẫn là -3), chỉ chiều llms đi từ 0 lên 12.
Chúng tôi lấy llms.txt của họ về từ điểm đo Singapore để xem (1.702 byte, thuần tiếng Việt, không phải HTML). Cấu trúc rất rõ ràng:
| Khối nội dung | Viết gì | Vì sao hữu ích với AI |
|---|---|---|
| ## Trang chính (trang chính) | 5 liên kết kèm mô tả: trang chủ, Flash Sale, Hot Deal, hệ thống siêu thị, tin tức – kinh nghiệm mua sắm | Cho AI một danh mục «site này có những cửa vào chính thức nào» thay vì để nó tự đoán |
| ## Dữ liệu cho máy đọc | Sitemap tổng cùng ba sitemap con (sản phẩm, danh mục, bài viết) và đường dẫn robots.txt | Giao toàn bộ cửa vào thu thập dữ liệu một lần, giảm lãng phí ngân sách thu thập |
| ## Lưu ý | Giá và tồn kho thay đổi theo thời gian và khu vực, hãy lấy dữ liệu trực tiếp từ trang sản phẩm; liệt kê các đường dẫn cá nhân hoá không nên thu thập như /account, /cart, /checkout, /orders; cho biết bản di động ở m.nguyenkim.com | Nói rõ mong muốn kiểm soát rủi ro kiểu «đừng trích giá cũ của tôi», giảm khả năng AI đưa giá sai |
Tệp này không có thủ thuật cầu kỳ, toàn bộ là «nói cho rõ». Nó mang về 12 điểm, tương đương toàn bộ lý do site này đi từ 54 lên 66 trong 17 ngày qua, cũng khớp với quy luật chúng tôi đo được nhiều lần trên site của khách: chiều llms là một đòn bẩy chi phí thấp, tối đa 18 điểm.
Nhưng cũng phải chỉ ra một chỗ chưa làm trọn: robots.txt của nguyenkim.com chỉ 414 byte và không gọi tên bất kỳ crawler AI nào — họ đã thêm tệp hướng dẫn cho AI đọc, nhưng chưa mời AI đến đọc trong tệp luật. Hai việc này đi thành cặp: một llms.txt không được thu thập sẽ mất giá trị.
Sáu. Nhận định ba: hạng mục dành riêng cho AI vẫn trắng, «cửa» vẫn đóng
Đây là kết luận ổn định nhất qua các kỳ — vấn đề hiển thị trước AI của bán lẻ Việt Nam không nằm ở nội dung, mà ở cửa vào và quyền truy cập.
| Hạng mục kiểm tra | Kết quả đo 07/10/2026 | Ghi chú |
|---|---|---|
| llms.txt là tệp thật | 3 / 15 | lazada.vn (2.926 B), nguyenkim.com (1.702 B), vinfastauto.com (27.410 B) |
| llms.txt dạng 404 mềm | 2 / 15 | shopee.vn và bibomart.com.vn trả về một trang web cho đường dẫn /llms.txt — tệ hơn 404 thật vì công cụ kiểm tra sẽ tưởng «đã cấu hình» |
| Thiếu llms.txt | 9 / 15 | cellphones, tiki, kidsplaza, goha, masangroup, mediamart trả 404; fptshop và vinamilk trả 403; thegioididong hết thời gian chờ |
| robots.txt có nhắc crawler AI | 4 / 15 | lazada, goha, vinfastauto, mediamart (chất lượng chiến lược rất khác nhau, xem bên dưới) |
| Trang chủ trả 403 cho danh tính khách thường | 3 / 15 | fptshop, vinamilk, masangroup — 12 loại UA (gồm Googlebot, Bingbot, CocCocbot) với 36 lượt yêu cầu đều 403 |
Về «mẫu làm đúng». Bốn site nhắc tới crawler AI chia thành ba mức:
- Tinh nhất: goha.vn. Họ tách AI thành hai nhóm — «tìm kiếm AI và agent» được phép (OAI-SearchBot, ChatGPT-User, PerplexityBot, FirecrawlAgent, AndiBot, ExaBot), «thu thập dữ liệu huấn luyện AI» bị từ chối (GPTBot, CCBot, Google-Extended). Đây là robots.txt thể hiện rõ nhất sự đánh giá giá trị nội dung mà chúng tôi từng thấy ở site Việt Nam.
- Trực tiếp nhất: lazada.vn. Ghi Allow: / riêng cho OAI-SearchBot, GPTBot, ChatGPT-User, kèm llms.txt 2.926 byte. Mẫu đầy đủ «vừa có tệp hướng dẫn, vừa có quyền truy cập rõ ràng» hiện cả danh sách chỉ có một site này.
- Mâu thuẫn nhất: vinfastauto.com. robots.txt có hẳn mục «AI crawlers (AEO)» cho phép từng cái GPTBot, PerplexityBot, ClaudeBot, Amazonbot, llms.txt viết tới 27.410 byte — nhưng với danh tính thu thập thông thường họ trả 403, chúng tôi không vào được cả trang chủ. Người phát bài lại đóng cửa: luật viết là hoan nghênh AI, yêu cầu thực tế thì chặn hết ở ngoài cửa. Kết luận này từng xuất hiện trong bài quan sát thương hiệu tháng 9, kỳ đo lại xác nhận 17 ngày qua không thay đổi.
Một ghi chú trung thực về masangroup. Tên miền này được engine chấm điểm lấy trang chủ bình thường (kích thước hoàn toàn trùng kỳ trước, điểm 47), nhưng đầu dò độc lập của chúng tôi (curl, urllib, 12 loại UA) đều nhận 403 ở trang chủ. Hai kết quả quan sát không khớp nhau, chúng tôi không quy kết thêm (có thể liên quan tới cách WAF đánh giá dấu vân tay yêu cầu); bài này thống nhất dùng kết quả của engine để tính điểm, đồng thời ghi lại sự không khớp này để bạn đọc tự đánh giá.
Bảy. Cơ hội: danh sách bốn bước xếp theo điểm thu về
Nếu bạn làm thương mại điện tử hoặc bán lẻ tại Việt Nam, bốn bước dưới đây được xếp theo «điểm nhận được trên mỗi đơn vị công sức». Khoảng điểm dựa trên thay đổi thực tế quan sát được trong kỳ đo lại, cùng trọng số các chiều của engine (robots tối đa 18, llms tối đa 18, schema tối đa 16, signals tối đa 6, ai_discovery tối đa 6).
| Thứ tự | Việc cần làm | Điểm dự kiến thu về | Bằng chứng kỳ này |
|---|---|---|---|
| 1 | Đưa lên một llms.txt có thật (ở gốc site, văn bản thuần, không phải HTML): ghi rõ cửa vào chính, vị trí sitemap, các đường dẫn cá nhân hoá không nên thu thập, miễn trừ về giá và tồn kho | Chiều llms từ 0 lên 12 (đo thực tế ở nguyenkim), điểm tổng tăng 12 | Thay đổi duy nhất của kỳ này chính là việc này |
| 2 | Ghi tín hiệu rõ ràng cho crawler AI trong robots.txt (ít nhất cho phép nhóm tìm kiếm: OAI-SearchBot, ChatGPT-User, PerplexityBot; nhóm huấn luyện tuỳ chọn) | Chiều robots đi từ 15 lên gần mức tối đa 18 | Cách tách nhóm của goha.vn có thể tham khảo trực tiếp |
| 3 | Bổ sung cửa vào máy đọc được ở gốc site (bản tóm tắt cho AI, dữ liệu hỏi đáp, danh mục dịch vụ) | Chiều ai_discovery 6 điểm: kỳ này trung bình 9 site chỉ 0,44, và 6 site bằng 0 | Chiều thấp nhất của cả danh sách, dư địa nâng cao lớn nhất |
| 4 | Bổ sung dữ liệu có cấu trúc dạng FAQPage, Organization, đồng thời thống nhất thông tin thực thể thương hiệu (viết giống nhau trên toàn site) | Hưởng lợi cùng lúc ở schema 7,33/16 và brand_entity 3,89/10 | Hai chiều này 17 ngày qua 9 site đều không thay đổi |
Ngược lại, có một việc không nên làm: đừng chặn crawler bằng cách trả 403 cho mọi IP trung tâm dữ liệu. Kỳ này 3 tên miền trả 403 với cả 12 loại UA, trong đó có các yêu cầu nhân danh Googlebot, Bingbot và CocCocbot của Việt Nam. Hạ tầng thu thập của các engine AI đều nằm trên cloud; kiểu phòng vệ này vừa chặn «nội dung không muốn bị đọc», vừa khoá luôn «nội dung muốn được trích dẫn» ở ngoài cửa — mà với người dùng thật thì không ảnh hưởng gì, tức là thiệt một chiều.
Tám. Rủi ro và liên hệ tới GEO
Ba rủi ro, xếp theo đánh giá của chúng tôi:
- Rủi ro bị AI xếp lại vào quên lãng là rủi ro âm ỉ. AI trích dẫn ai phụ thuộc vào việc ai được thu thập, được hiểu và được cấu trúc hoá. Kỳ này 5 tên miền (gồm chuỗi bán lẻ 3C lớn nhất và một doanh nghiệp sữa đầu ngành của Việt Nam) hoàn toàn không tiếp cận được từ phía AI — việc này không sinh ra cảnh báo nào, không làm ô nào trên báo cáo chuyển đỏ, chỉ biểu hiện thành «khi khách hỏi ChatGPT về chúng tôi, cái tên được nhắc lại là của người khác».
- llms.txt là đề xuất, không phải tiêu chuẩn. Nó do llmstxt.org đề xuất; việc các hãng AI có đọc hay đọc tới đâu do từng hãng quyết. Log của chính site chúng tôi từng đo: llms.txt lên 11 ngày, crawler AI tạo sinh đọc 0 lần (cùng cửa sổ, robots.txt được đọc 97 lần, sitemap 49 lần). Vì vậy tâm thế đúng là: đây là bước chuẩn bị chi phí thấp, không phải công tắc bật traffic — nhưng chính vì rẻ nên không có lý do để bỏ qua.
- Không có chuyện «sửa một vòng là xong». Site duy nhất thay đổi kỳ này chỉ thêm một tệp, các chiều khác vẫn nguyên. Hiển thị trước AI là công việc theo từng chiều, và bất kỳ chiều nào để trắng đều giới hạn điểm cuối — thang 100 điểm là tổng của 8 chiều trừ điểm phạt, thiếu mục này không bù được bằng mục khác.
Liên hệ tới GEO, kết luận của chúng tôi chỉ một câu: vấn đề của bán lẻ thương mại điện tử Việt Nam không phải «không biết làm», mà là «chưa được xếp vào mức ưu tiên». Mẫu làm đúng đã tồn tại (cấu hình đầy đủ của lazada, chiến lược tách nhóm của goha, cách bổ sung tệp chi phí thấp của nguyenkim), có thể sao chép, định lượng được, chi phí rất thấp. Đó cũng là lý do chúng tôi định cố định nhóm site này và đo lại theo từng tháng — thứ thị trường Việt Nam thiếu không phải công cụ, mà là một bộ số đo công khai được cập nhật liên tục.
Nếu thương hiệu của bạn có hoạt động ở cả Trung Quốc và Việt Nam và muốn biết mình đang «được trích dẫn» hay «không tồn tại» trong câu trả lời của AI, hãy dùng bản chẩn đoán miễn phí của chúng tôi chạy một lần: nhập địa chỉ website, nhận điểm 8 chiều theo cùng một cây thước và thứ tự ưu tiên sửa lỗi.