Một. Tóm tắt: sau 17 ngày, quay lại đúng nhóm site cũ, ngành gần như không nhúc nhích

Ngày 20/09/2026, chúng tôi đã thực hiện kỳ đo đầu tiên mang tên «Đo mức độ sẵn sàng cho AI của 14 website bán lẻ – thương mại điện tử hàng đầu Việt Nam». Kết luận khi đó: 9 site có thể chấm điểm, không site nào đạt mức «tốt», điểm trung bình chỉ 51,0; 5 site còn lại hoàn toàn vô hình trước crawler AI.

Câu hỏi chúng tôi nhận được nhiều nhất sau kỳ đó là: «Vậy họ có sửa không?». Câu này không thể trả lời bằng suy đoán, chỉ có thể trả lời bằng đo lại. Vì vậy ngày 07/10/2026, chúng tôi đo lại đúng 15 tên miền đó, với cùng danh sách tên miền, cùng engine chấm điểm, cùng điểm đo tại Singapore, cùng User-Agent và cùng quy tắc loại trừ.

Kết quả còn đáng viết hơn cả câu hỏi «họ có sửa không»:

Bài này trình bày đầy đủ cách đo có thể so sánh, bảng đối chiếu từng site, chi tiết thay đổi theo từng chiều điểm, và một danh sách bốn bước xếp theo mức điểm thu về.

Bốn chỉ số then chốt của kỳ này (đo ngày 07/10/2026, điểm đo Singapore)
  • Điểm trung bình 9 site chấm được: 51,0 → 52,3 / 100
  • Số site giống hệt kỳ trước ở cả 8 chiều: 8 / 9 site
  • Thay đổi duy nhất: nguyenkim.com (thêm llms.txt) 54 → 66 (+12)
  • Tên miền vẫn vô hình với AI: 5 / 15

Hai. Cách đo: vì sao hai con số này trừ trực tiếp cho nhau được

Rủi ro lớn nhất của việc đo lại là đọc nhầm «chúng tôi đổi thước đo» thành «họ đã sửa». Nên phần này nói rõ cây thước trước — mọi mục dưới đây đều không đổi giữa hai kỳ:

Hạng mụcKỳ đầu 20/09/2026Kỳ đo lại 07/10/2026Khác biệt
Danh sách tên miền15 URL (14 hợp lệ + 1 tên miền viết sai chính tả)Đúng 15 URL đó, không đổi một ký tựKhông
Engine chấm điểmEngine GEO mã nguồn mở, 8 chiều, thang 100 điểmCùng engine, phiên bản 4.18.1Không (xem giải thích bên dưới)
Điểm đoSingaporeSingaporeKhông
Danh tính yêu cầuUser-Agent Chrome chuẩn, Accept-Language tiếng ViệtUser-Agent Chrome chuẩn, Accept-Language tiếng ViệtKhông
Quy tắc loại trừSite lấy thất bại và trang vỏ chống crawler không tính vào điểm trung bìnhCùng quy tắcKhông
Mẫu vào điểm trung bình9 site9 site (đúng nhóm cũ)Không

Tự chứng minh về phiên bản engine. Giữa hai kỳ engine có cập nhật phiên bản nhỏ, nên chúng tôi không thể khẳng định bản chạy là hoàn toàn giống nhau — nhưng có một bằng chứng mạnh hơn: 8 trong 9 site có điểm thành phần ở cả 8 chiều trùng khớp từng con số (các điểm nguyên như robots 15, schema 9, meta 14, content 12). Nếu cây thước bị lệch, không thể có kết quả «cả bảng khớp, chỉ một ô nhúc nhích» như vậy. Vì thế bài này quy toàn bộ thay đổi điểm về phía site, không quy về phía thước đo.

Ba quy ước khi đọc bảng:

Ba. Kết quả từng site: đối chiếu đầy đủ 15 tên miền

Bảng dưới là điểm và trạng thái của toàn bộ 15 tên miền qua hai kỳ. Cột Δ để trống nghĩa là kỳ này hoặc kỳ trước không chấm được điểm (không so sánh được), không phải không thay đổi.

Tên miềnNhóm20/09/202607/10/2026ΔTrạng thái kỳ này
nguyenkim.comBán lẻ 3C5466+12Chấm được điểm (thay đổi duy nhất)
goha.vnĐồng nghiệp GEO62620Chấm được điểm
kidsplaza.vnBán lẻ mẹ và bé56560Chấm được điểm
tiki.vnSàn thương mại điện tử54540Chấm được điểm
cellphones.com.vnBán lẻ 3C49490Chấm được điểm
masangroup.comTập đoàn tiêu dùng47470Engine chấm được; đầu dò độc lập nhận 403
mediamart.vnBán lẻ 3C47470Chấm được điểm
lazada.vnSàn thương mại điện tử46460Chấm được điểm
bibomart.com.vnBán lẻ mẹ và bé44440Chấm được điểm
shopee.vnSàn thương mại điện tử25250Trang vỏ chống crawler (không tính vào trung bình)
fptshop.com.vnBán lẻ 3C———Không chấm được: trang chủ 403 (12/12 UA)
vinamilk.com.vnThực phẩm – đồ uống———Không chấm được: trang chủ 403 (12/12 UA)
thegioididong.comĐầu ngành bán lẻ 3C———Không chấm được: hết thời gian chờ (kỳ đầu 191 giây chưa kết nối được)
vinfastauto.com/vn_vÔ tô và xe điện———Không chấm được: trang chủ 403
shoppe.vnTên miền viết sai———Tên miền vẫn không phân giải được

Xếp 9 site chấm được điểm lại: trung bình 52,3, trung vị 49, khoảng 44–66. Kỳ trước là trung bình 51,0, trung vị 49, khoảng 44–62. Điểm trung bình tăng 1,3 điểm và toàn bộ đến từ nguyenkim; trung vị không nhích một đơn vị — nghĩa là một site bán lẻ thương mại điện tử Việt Nam điển hình, trong mắt AI, vẫn dễ đọc y như 17 ngày trước.

Cũng cần nói rõ: kỳ này không site nào vào mức «tốt» (từ 68 điểm trở lên). Site tốt nhất kỳ trước là goha.vn (62) kỳ này vẫn 62; site đứng đầu kỳ này là nguyenkim.com với 66 điểm, vẫn ở mức «cần xây dựng».

Bốn. Nhận định một: cái gọi là «đóng băng» là cả 8 chiều khớp nguyên bảng

«Điểm không đổi» có hai khả năng: một là thật sự không làm gì, hai là có chiều tăng có chiều giảm rồi bù trừ nhau. Chúng tôi lấy toàn bộ điểm thành phần ra đối chiếu, kết quả là khả năng thứ nhất — 8 site, 8 chiều, 64 điểm thành phần, trùng khớp từng mục.

Chiều (điểm tối đa)Trung bình 9 site 20/09Trung bình 9 site 07/10Thay đổiÝ nghĩa
robots (18)15,0015,000Bài tập SEO truyền thống, nhìn chung làm tốt
llms (18)2,443,78+1,33Chiều tăng duy nhất, và đến từ một site
schema (16)7,337,330Một nửa số điểm, đứng yên ở giữa
meta (14)13,1113,110Gần tối đa, là chiều trưởng thành nhất của ngành
content (12)9,009,000Lượng nội dung đủ, không phải điểm nghẽn
signals (6)3,003,000Đúng một nửa
ai_discovery (6)0,440,440Gần như trắng: 6 trong 9 site bằng 0
brand_entity (10)3,893,890Thông tin nhất quán về thực thể còn thiếu dài hạn

Bảng này cho nhiều thông tin hơn điểm tổng: bán lẻ thương mại điện tử Việt Nam làm được 15/18 cho «tìm kiếm phục vụ con người», nhưng dừng ở 0,44/6 cho «cửa vào phục vụ máy». meta 13,11/14 nghĩa là tiêu đề và mô tả đều đã có; ai_discovery 0,44/6 nghĩa là tại gốc site gần như không có cửa vào dạng máy đọc được (bản tóm tắt có cấu trúc, dữ liệu hỏi đáp, danh mục dịch vụ). llms 2,44/18 còn nói thẳng hơn: 6 trong 9 nền tảng có chiều llms bằng 0.

17 ngày đủ để đưa lên một tệp mới, cũng đủ để sửa một loạt schema. Nhưng trong khoảng thời gian đó, cả ngành chọn dồn sự chú ý vào việc khác.

Năm. Nhận định hai: site duy nhất hành động chọn việc rẻ nhất

nguyenkim.com là chuỗi bán lẻ điện máy – gia dụng lâu đời của Việt Nam (thành lập năm 1992, hàng chục siêu thị trên toàn quốc). Điểm tổng của họ từ 54 lên 66, trong 8 chiều thì 7 chiều đứng yên tuyệt đối (robots 15, schema 9, meta 14, content 12, signals 3, ai_discovery 0, brand_entity 4, điểm phạt vẫn là -3), chỉ chiều llms đi từ 0 lên 12.

Chúng tôi lấy llms.txt của họ về từ điểm đo Singapore để xem (1.702 byte, thuần tiếng Việt, không phải HTML). Cấu trúc rất rõ ràng:

Khối nội dungViết gìVì sao hữu ích với AI
## Trang chính (trang chính)5 liên kết kèm mô tả: trang chủ, Flash Sale, Hot Deal, hệ thống siêu thị, tin tức – kinh nghiệm mua sắmCho AI một danh mục «site này có những cửa vào chính thức nào» thay vì để nó tự đoán
## Dữ liệu cho máy đọcSitemap tổng cùng ba sitemap con (sản phẩm, danh mục, bài viết) và đường dẫn robots.txtGiao toàn bộ cửa vào thu thập dữ liệu một lần, giảm lãng phí ngân sách thu thập
## Lưu ýGiá và tồn kho thay đổi theo thời gian và khu vực, hãy lấy dữ liệu trực tiếp từ trang sản phẩm; liệt kê các đường dẫn cá nhân hoá không nên thu thập như /account, /cart, /checkout, /orders; cho biết bản di động ở m.nguyenkim.comNói rõ mong muốn kiểm soát rủi ro kiểu «đừng trích giá cũ của tôi», giảm khả năng AI đưa giá sai

Tệp này không có thủ thuật cầu kỳ, toàn bộ là «nói cho rõ». Nó mang về 12 điểm, tương đương toàn bộ lý do site này đi từ 54 lên 66 trong 17 ngày qua, cũng khớp với quy luật chúng tôi đo được nhiều lần trên site của khách: chiều llms là một đòn bẩy chi phí thấp, tối đa 18 điểm.

Nhưng cũng phải chỉ ra một chỗ chưa làm trọn: robots.txt của nguyenkim.com chỉ 414 byte và không gọi tên bất kỳ crawler AI nào — họ đã thêm tệp hướng dẫn cho AI đọc, nhưng chưa mời AI đến đọc trong tệp luật. Hai việc này đi thành cặp: một llms.txt không được thu thập sẽ mất giá trị.

Sáu. Nhận định ba: hạng mục dành riêng cho AI vẫn trắng, «cửa» vẫn đóng

Đây là kết luận ổn định nhất qua các kỳ — vấn đề hiển thị trước AI của bán lẻ Việt Nam không nằm ở nội dung, mà ở cửa vào và quyền truy cập.

Hạng mục kiểm traKết quả đo 07/10/2026Ghi chú
llms.txt là tệp thật3 / 15lazada.vn (2.926 B), nguyenkim.com (1.702 B), vinfastauto.com (27.410 B)
llms.txt dạng 404 mềm2 / 15shopee.vn và bibomart.com.vn trả về một trang web cho đường dẫn /llms.txt — tệ hơn 404 thật vì công cụ kiểm tra sẽ tưởng «đã cấu hình»
Thiếu llms.txt9 / 15cellphones, tiki, kidsplaza, goha, masangroup, mediamart trả 404; fptshop và vinamilk trả 403; thegioididong hết thời gian chờ
robots.txt có nhắc crawler AI4 / 15lazada, goha, vinfastauto, mediamart (chất lượng chiến lược rất khác nhau, xem bên dưới)
Trang chủ trả 403 cho danh tính khách thường3 / 15fptshop, vinamilk, masangroup — 12 loại UA (gồm Googlebot, Bingbot, CocCocbot) với 36 lượt yêu cầu đều 403

Về «mẫu làm đúng». Bốn site nhắc tới crawler AI chia thành ba mức:

Một ghi chú trung thực về masangroup. Tên miền này được engine chấm điểm lấy trang chủ bình thường (kích thước hoàn toàn trùng kỳ trước, điểm 47), nhưng đầu dò độc lập của chúng tôi (curl, urllib, 12 loại UA) đều nhận 403 ở trang chủ. Hai kết quả quan sát không khớp nhau, chúng tôi không quy kết thêm (có thể liên quan tới cách WAF đánh giá dấu vân tay yêu cầu); bài này thống nhất dùng kết quả của engine để tính điểm, đồng thời ghi lại sự không khớp này để bạn đọc tự đánh giá.

Bảy. Cơ hội: danh sách bốn bước xếp theo điểm thu về

Nếu bạn làm thương mại điện tử hoặc bán lẻ tại Việt Nam, bốn bước dưới đây được xếp theo «điểm nhận được trên mỗi đơn vị công sức». Khoảng điểm dựa trên thay đổi thực tế quan sát được trong kỳ đo lại, cùng trọng số các chiều của engine (robots tối đa 18, llms tối đa 18, schema tối đa 16, signals tối đa 6, ai_discovery tối đa 6).

Thứ tựViệc cần làmĐiểm dự kiến thu vềBằng chứng kỳ này
1Đưa lên một llms.txt có thật (ở gốc site, văn bản thuần, không phải HTML): ghi rõ cửa vào chính, vị trí sitemap, các đường dẫn cá nhân hoá không nên thu thập, miễn trừ về giá và tồn khoChiều llms từ 0 lên 12 (đo thực tế ở nguyenkim), điểm tổng tăng 12Thay đổi duy nhất của kỳ này chính là việc này
2Ghi tín hiệu rõ ràng cho crawler AI trong robots.txt (ít nhất cho phép nhóm tìm kiếm: OAI-SearchBot, ChatGPT-User, PerplexityBot; nhóm huấn luyện tuỳ chọn)Chiều robots đi từ 15 lên gần mức tối đa 18Cách tách nhóm của goha.vn có thể tham khảo trực tiếp
3Bổ sung cửa vào máy đọc được ở gốc site (bản tóm tắt cho AI, dữ liệu hỏi đáp, danh mục dịch vụ)Chiều ai_discovery 6 điểm: kỳ này trung bình 9 site chỉ 0,44, và 6 site bằng 0Chiều thấp nhất của cả danh sách, dư địa nâng cao lớn nhất
4Bổ sung dữ liệu có cấu trúc dạng FAQPage, Organization, đồng thời thống nhất thông tin thực thể thương hiệu (viết giống nhau trên toàn site)Hưởng lợi cùng lúc ở schema 7,33/16 và brand_entity 3,89/10Hai chiều này 17 ngày qua 9 site đều không thay đổi

Ngược lại, có một việc không nên làm: đừng chặn crawler bằng cách trả 403 cho mọi IP trung tâm dữ liệu. Kỳ này 3 tên miền trả 403 với cả 12 loại UA, trong đó có các yêu cầu nhân danh Googlebot, Bingbot và CocCocbot của Việt Nam. Hạ tầng thu thập của các engine AI đều nằm trên cloud; kiểu phòng vệ này vừa chặn «nội dung không muốn bị đọc», vừa khoá luôn «nội dung muốn được trích dẫn» ở ngoài cửa — mà với người dùng thật thì không ảnh hưởng gì, tức là thiệt một chiều.

Tám. Rủi ro và liên hệ tới GEO

Ba rủi ro, xếp theo đánh giá của chúng tôi:

Liên hệ tới GEO, kết luận của chúng tôi chỉ một câu: vấn đề của bán lẻ thương mại điện tử Việt Nam không phải «không biết làm», mà là «chưa được xếp vào mức ưu tiên». Mẫu làm đúng đã tồn tại (cấu hình đầy đủ của lazada, chiến lược tách nhóm của goha, cách bổ sung tệp chi phí thấp của nguyenkim), có thể sao chép, định lượng được, chi phí rất thấp. Đó cũng là lý do chúng tôi định cố định nhóm site này và đo lại theo từng tháng — thứ thị trường Việt Nam thiếu không phải công cụ, mà là một bộ số đo công khai được cập nhật liên tục.

Nếu thương hiệu của bạn có hoạt động ở cả Trung Quốc và Việt Nam và muốn biết mình đang «được trích dẫn» hay «không tồn tại» trong câu trả lời của AI, hãy dùng bản chẩn đoán miễn phí của chúng tôi chạy một lần: nhập địa chỉ website, nhận điểm 8 chiều theo cùng một cây thước và thứ tự ưu tiên sửa lỗi.