Mỗi ngày chúng tôi dùng cùng một thước đo để chấm điểm website của khách hàng, và việc làm nhiều nhất trong nửa năm qua là phát hành cùng một bài viết thành hai bản tiếng Trung và tiếng Việt. Lần này chúng tôi quay thước đo về phía mình: đưa toàn bộ 114 trang nội dung của site — tức 57 cặp trang song ngữ cùng nguồn (43 bài viết + 14 báo cáo ngành Việt Nam, mỗi bài có bản tiếng Trung và bản tiếng Việt) — qua đúng engine mà khách hàng thấy trên trang chẩn đoán, rồi so từng hạng mục theo từng cặp: hai bản của cùng một bài lệch ở đâu, lệch bao nhiêu và vì sao.

Kết luận trước: bản tiếng Việt trung bình 74,33 điểm, bản tiếng Trung 73,35 điểm, lệch 0,98 điểm. Nhưng điều đáng viết lại không phải con số 0,98 này, mà là nguồn gốc của nó — 5 trong 8 hạng mục hoàn toàn bằng điểm ở cả hai ngôn ngữ (nhóm cấu hình toàn site, sửa một lần lợi cả hai bản), khác biệt có hệ thống duy nhất nằm ở hạng mục "chất lượng nội dung" (tiếng Trung 9,53 / tiếng Việt 10,79), và cơ chế của nó không phải chất lượng dịch thuật mà là cách tách từ: trong cùng một engine, tiếng Trung bị đếm thiếu 4,14 lần lượng nội dung vì không viết dấu cách, còn tiếng Việt bị cắt thành các âm tiết — cả 57 trang đều bị chấm oan là "nhồi từ khóa" và bị trừ 1 điểm.

📊 Những con số cốt lõi (đo toàn bộ bằng engine audit tự xây của VIETTRITHONG GEO, 2026-09-29)
• Đối tượng: 114 trang nội dung = 57 cặp trang song ngữ cùng nguồn (43 bài viết + 14 báo cáo ngành, mỗi bài hai bản Trung/Việt)
• Trung bình tiếng Trung / tiếng Việt: 73,35 / 74,33 (lệch +0,98)
• Đối đầu: bản tiếng Việt cao hơn 26 cặp · bằng nhau 19 cặp · thấp hơn 12 cặp
• 5 hạng mục bằng điểm ở cả hai bản: robots 15/18, llms 12/18, schema 13/16, signals 4/6, ai_discovery 6/6 — tổng 50/64 điểm (78,1%)
• Khác biệt có hệ thống duy nhất: chất lượng nội dung — tiếng Trung 9,53 / tiếng Việt 10,79 (+1,26)
• Chênh lệch cách đếm: tiếng Trung 447,5 "từ" / tiếng Việt 1.853,1 "từ" = 4,14 lần; ký tự mỗi "từ": 45,3 so với 13,1
• Trang tiếng Trung bị chấm oan: 26 trang không đạt ngưỡng "300 từ" (trung bình 1.023 chữ Hán, trong đó 9 trang trên 1.000 chữ Hán); phía tiếng Việt 0 trang
• Trang tiếng Việt bị trừ oan: 57/57 trang bị gắn "mật độ từ khóa cao" và trừ 1 điểm, mật độ trung bình 9,9%, từ bị gắn là các mảnh âm tiết như trong / trung / dung
• Còn dưới mức good: 6 trang (63–67 điểm), đều là nhóm bài "cập nhật dữ liệu" cũ, Meta chỉ 5/14

Một, vì sao đặt hai bản ngôn ngữ của cùng một bài cạnh nhau

Song ngữ Trung–Việt vừa là hình thái kinh doanh của chúng tôi, vừa là chuyện thường ngày của khách hàng: một bản thảo tiếng Trung, dịch sang tiếng Việt, cả hai bên đều phải được công cụ tìm kiếm AI hiểu đúng. Nếu công cụ chấm điểm xử lý hai ngôn ngữ khác nhau, thì chính thao tác "dịch bản tiếng Trung sang tiếng Việt" đã làm thay đổi điểm — điều này quyết định thứ tự khuyến nghị cho khách hàng song ngữ: sửa nội dung trước, sửa cấu hình trước, hay sửa cách đo trước.

Chúng tôi có ba giả định trước khi đo, sau đó hai giả định bị bác bỏ và một được xác nhận: ① "bản tiếng Việt sẽ thấp điểm hơn" — sai, trung bình còn cao hơn 0,98 điểm; ② "khác biệt đến từ chất lượng dịch" — sai, chênh lệch tập trung ở hạng mục chất lượng nội dung, và cơ chế là cách tách từ chứ không phải văn phong; ③ "cấu hình toàn site sẽ khác nhau giữa hai bản" — sai, 5 hạng mục hoàn toàn bằng điểm.

Hai, cách đo: 57 cặp trang cùng nguồn, cùng một thước đo, tính lại được từng hạng mục

Mọi con số trong bài đều tính lại được từ tập dữ liệu: điểm tổng = tổng 8 hạng mục + khoản trừ tín hiệu tiêu cực; điểm tối đa và các ngưỡng (300 từ, mật độ từ khóa 2,5%, trừ −1/−3/−5) lấy từ mã nguồn engine v4.18.0, không phải ước lượng.

Ba, kết quả tổng thể: lệch 0,98 điểm, gần như toàn bộ nằm ở "chất lượng nội dung"

Chỉ sốBản tiếng Trung (57 trang)Bản tiếng Việt (57 trang)Lệch
Điểm trung bình73,3574,33+0,98
Khoảng điểm71 – 7673 – 75—
Số cặp cao hơn12 cặp26 cặp—
Chất lượng nội dung (tối đa 12)9,5310,79+1,26
Meta (tối đa 14)9,689,680
Thực thể thương hiệu (tối đa 10)4,954,86−0,09
Số trang bị trừ −143 trang57 trang—

Trải chênh lệch của từng cặp thành phân bố sẽ rõ hơn: +4 điểm 11 cặp, +2 điểm 12 cặp, +1 điểm 3 cặp, bằng nhau 19 cặp, −1 điểm 9 cặp, −2 điểm 3 cặp. Nghĩa là 19 cặp bằng điểm tuyệt đối, 46 cặp lệch trong phạm vi 2 điểm; 11 cặp lệch trên 2 điểm đều là "bản tiếng Việt cao hơn" và đều là các trang tiếng Trung ngắn (xem phần Năm). Trong 8 hạng mục, chỉ "chất lượng nội dung" xuất hiện chênh lệch có hệ thống; 7 hạng mục còn lại hoặc bằng điểm, hoặc giải thích được từng trang (xem phần Bảy).

Bốn, 5 hạng mục bằng điểm ở cả hai bản: "lợi thế cấp site" của website song ngữ

Hạng mụcTối đaTB tiếng TrungTB tiếng ViệtLệchĐộ lệch chuẩn (114 trang)Tính chất
Bot AI truy cập (robots.txt)18151500,00Cấp site
llms.txt18121200,00Cấp site
Dữ liệu có cấu trúc16131300,00Cấp site
Tín hiệu kỹ thuật64400,00Cấp site
Điểm khám phá AI66600,00Cấp site
Thẻ Meta149,689,6801,17Cấp trang (lần này bằng nhau)
Chất lượng nội dung129,5310,79+1,261,50Cấp trang
Thực thể thương hiệu104,954,86−0,090,30Cấp trang

5 hạng mục "cấp site" này chiếm 50 trong 64 điểm (78,1%), đặc điểm là sửa một lần, cả hai bản cùng được lợi. Ví dụ rõ nhất là "điểm khám phá AI": 4 đường dẫn cố định (/.well-known/ai.txt, /ai/summary.json, /ai/faq.json, /ai/service.json) đạt 6/6 trên cả 57 cặp trang — nhóm tệp này được bổ sung ngày 27/09, sau đó cả 114 trang Trung lẫn Việt cùng tăng 6 điểm.

Cấp trang chỉ còn 36 điểm để giành (Meta 14, chất lượng nội dung 12, thực thể thương hiệu 10). Trong đó Meta bằng điểm ở hai bản với 9,68 — vì cả 114 trang đều thiếu thẻ Open Graph, mất trắng 4 điểm/trang; đây là vấn đề ở tầng mẫu (template), sửa một lần cũng lợi cả hai bản. Chỉ "chất lượng nội dung" và "thực thể thương hiệu" là khác nhau theo từng trang.

Năm, Phía tiếng Trung: tiếng Trung không viết dấu cách nên bị đếm thiếu 4,14 lần

Cách đếmTB bản tiếng TrungTB bản tiếng ViệtTỷ lệ
Số "từ" engine đếm được447,51.853,14,14 lần
Số ký tự của trang15.06820.2341,34 lần
Trong đó số chữ Hán1.957(không áp dụng)—
Ký tự trên mỗi "từ"45,313,13,5 lần
Số trang không đạt ngưỡng 300 từ26 / 570 / 57—

Engine chấm "chất lượng nội dung" có một ngưỡng cứng: thân bài phải đạt từ 300 "từ" trở lên mới được 2 điểm (hằng số CONTENT_MIN_WORDS=300 trong mã nguồn). Cùng một nhóm trang, bản tiếng Việt trung bình 1.853,1 "từ", bản tiếng Trung chỉ 447,5 "từ" — lệch 4,14 lần; nhưng số ký tự chỉ lệch 1,34 lần, và thân bài tiếng Trung trung bình chứa 1.957 chữ Hán.

Hệ quả rất cụ thể: 26 trang tiếng Trung không vượt được ngưỡng 300 từ (phía tiếng Việt 0 trang). 26 trang này trung bình 200,9 "từ" nhưng trung bình chứa 1.023 chữ Hán; trong đó 9 trang có hơn 1.000 chữ Hán, cao nhất là 1.948 chữ Hán nhưng chỉ được tính 275 "từ". Chúng bị trừ 2 điểm, bị tín hiệu tiêu cực gắn nhãn "nội dung quá mỏng" (24 trang) và nhận khuyến nghị "mở rộng thân bài lên trên 300 từ" — chính khuyến nghị này là sai, những trang đó không hề mỏng.

Nhìn qua hệ số tương quan: số chữ Hán của trang tiếng Trung tương quan với điểm "chất lượng nội dung" ở mức r=0,73, còn cách đếm "từ" là r=0,71 — việc chấm điểm thực chất chạy theo độ dài; phía tiếng Việt, "số từ" chỉ tương quan r=0,28 với điểm nội dung (bài dài đã bão hòa). Kết luận không phải câu chung chung "nội dung rất quan trọng", mà là câu có thể làm ngay: với site tiếng Trung, phải đánh giá lượng nội dung theo số ký tự (chữ Hán) chứ không theo cách tách từ bằng dấu cách.

Đây không phải nét lạ của riêng một công cụ. Phụ lục tiêu chuẩn Unicode #29 (UAX #29 – Phân đoạn văn bản Unicode) nêu rõ: tiếng Trung, tiếng Nhật và các chữ viết tượng hình, cùng tiếng Thái, không dùng dấu cách để tách từ; quy tắc biên từ mặc định không đủ cho chúng và cần tách từ theo ngôn ngữ (từ điển hoặc mô hình thống kê). "Tách theo dấu cách" là cách làm của môi trường tiếng Anh.

Sáu, Phía tiếng Việt: cả 57 trang bị một quy tắc "chỉ đọc chữ Latin" trừ điểm

Chiều sai lệch còn lại kín đáo hơn: cả 57 trang tiếng Việt (100%) đều bị gắn tín hiệu tiêu cực, trong khi phía tiếng Trung chỉ 43/57 (13 trang sạch, 1 trang mức trung bình). Tách từng mục bị gắn ra (bảng dưới), các trang tiếng Việt không bị gì khác — tất cả đều là "mật độ từ khóa cao".

Mục tín hiệu tiêu cựcSố trang bị gắn (tiếng Trung)Số trang bị gắn (tiếng Việt)
Nội dung quá mỏng (<300 từ và ≥3 tiêu đề phụ)240
Mật độ từ khóa cao (>2,5%)2157
Mật độ CTA quá cao00
Dấu hiệu popup / lớp phủ00
Liên kết rỗng (>3)00
Tỷ lệ văn bản khuôn mẫu cao00
H1 hứa hơn nội dung thực tế00
Thiếu tín hiệu tác giả0 (hai bản đều có)0 (hai bản đều có)

Xem tiếp những "từ khóa" bị gắn (engine ghi lại trong chi tiết). Phía tiếng Việt xuất hiện nhiều nhất là trong (14 trang), trung (13 trang), dung (4 trang), trang (3 trang), mật độ trung bình 9,9%, cao nhất 24,8%. Đây không phải từ khóa, mà là mảnh âm tiết tiếng Việt: trong nước, trung bình, doanh nghiệp bị cắt làm đôi. Còn 21 trang tiếng Trung bị gắn thì từ bị gắn gần như đều là từ Latin (google 5 trang, robots 2 trang, sitemap / cellphones / masan / sailun / query / json mỗi từ 1 trang) — nghĩa là trang tiếng Trung chỉ chạm quy tắc này khi có chèn từ tiếng Anh.

Cơ chế nằm ngay trong mã nguồn engine: biểu thức chính quy dùng để đo mật độ là \b[a-zA-ZÀ-ÿ]{4,}\b, ngưỡng 2,5%. Khoảng ký tự này chỉ phủ ASCII và khối "Latin-1 Supplement" (U+00C0–U+00FF); các chữ có dấu của tiếng Việt gần như nằm hết ở khối "Latin Extended Additional" (ồ U+1ED3, ệ U+1EC7, đ U+0111, ư U+01B0, ợ U+1EE3, ế U+1EBF). Vì vậy từ tiếng Việt có dấu bị cắt ngay tại chữ có dấu trong mắt biểu thức, phần âm tiết còn lại được đếm như một "từ" độc lập lặp lại, và mật độ của âm tiết xuất hiện nhiều nhất dễ dàng vượt ngưỡng — một quy tắc sinh ra để chống gian lận lại trở thành khoản trừ ổn định trên tiếng Việt.

Cùng một quy tắc còn có mặt còn lại: tiếng Trung không nằm trong biểu thức Latin, nên quy tắc này không hề có tác dụng với tiếng Trung — chính chú thích trong mã nguồn engine ghi: "the word regex below is Latin-only, so CJK pages get no stuffing detection yet". Một quy tắc tạo ra hai sai lệch: dương tính giả với tiếng Việt (57/57 trang bị trừ 1 điểm) và bỏ sót hoàn toàn với tiếng Trung.

Bảy, 12 cặp bản tiếng Việt thấp hơn: chỉ có hai nguyên nhân

Ngoài 26 cặp bản tiếng Việt cao hơn và 19 cặp bằng điểm, còn 12 cặp bản tiếng Việt thấp hơn. Truy nguyên từng cặp, nguyên nhân chỉ có hai, và cả hai đều không phải "nội dung viết kém":

Nguyên nhânSố cặpGiải thíchTrang tiêu biểu
Chấm oan tín hiệu tiêu cực8 cặpĐiểm 8 hạng mục hoàn toàn giống nhau, chỉ khác khoản trừ 1 điểm ở bản tiếng Việt (chấm oan mật độ từ khóa)ai-citation-mechanism, ai-platform-updates-h2-2026, china-ai-search-platforms-2026, vietnam-ai-search-2026, 02-manufacturing-2026, 12-seafood-2026, 13-rubber-tyre-2026, 14-coffee-pepper-2026
Nhất quán thực thể + chấm oan3 cặpTrang tiếng Việt kém 1 điểm "thực thể thương hiệu" (mô tả JSON-LD không khớp meta description), cộng thêm 1 điểm chấm oan04-logistics-2026, 05-finance-2026, 06-mining-2026
Chỉ kém nhất quán thực thể1 cặpNhư trên nhưng không có chênh lệch khoản trừ08-textile-2026

1 điểm "nhất quán thực thể" định vị được chính xác: engine kiểm tra "mô tả trong dữ liệu có cấu trúc có khớp với meta description của trang không" (1 trong 10 điểm của hạng mục thực thể thương hiệu). Trang tiếng Trung đạt 57/57, nhưng 5 trang tiếng Việt không đạt — vì mô tả JSON-LD và meta description của bản tiếng Việt được viết thành hai câu khác nhau. Đây là 1 điểm có thể sửa xong trong ngày.

Một lưu ý về phạm vi: trong 114 trang lần này vẫn còn 6 trang ở mức foundation (63–67 điểm), cùng một nhóm bài "cập nhật dữ liệu" cũ với Meta chỉ 5/14 (thiếu description / OG). Nhóm này không nằm trong kết luận về khác biệt song ngữ, mà là danh sách chúng tôi sẽ sửa từng trang ở vòng tiếp theo.

Tám, Chuyển thành hành động: 5 cách sửa cho website song ngữ (kèm bước tiếp theo của chính chúng tôi)

  1. Làm 5 hạng mục cấp site trước, rồi mới tới cấp trang. Trong 64 điểm có 50 điểm là cấu hình cấp site (robots 15/18, llms 12/18, schema 13/16, signals 4/6, ai_discovery 6/6) — sửa một lần cả hai bản cùng tăng; cấp trang chỉ còn 36 điểm để tranh.
  2. Sửa một lần ở tầng template: bổ sung Open Graph. Hiện 0/114 trang có đủ thẻ OG, hạng mục Meta kẹt ở 9,68/14; bổ sung OG là 4 điểm/trang, chỉ cần sửa template và tạo lại toàn site, cả hai bản cùng lợi.
  3. Hiệu chỉnh lượng nội dung của site tiếng Trung theo số ký tự. Đừng chỉ nhìn "số từ": với trang tiếng Trung, hãy đưa thân bài lên trên 1.200 chữ Hán rồi mới bàn tối ưu cấu trúc; trong báo cáo đối ngoại, chúng tôi công bố song song "cách đếm theo ký tự" và "cách đếm theo từ" để không áp chuẩn tiếng Anh lên tiếng Trung.
  4. Với site tiếng Việt, sửa nhất quán thực thể trước, bàn mật độ sau. Căn khớp từng chữ giữa description trong JSON-LD và meta description của bản tiếng Việt (5 trang trong lần đo này) — 1 điểm này không cần sửa nội dung.
  5. Thêm một bước "kiểm tra ngôn ngữ" khi đọc điểm. Thấy điểm hai bản song ngữ lệch nhau, hãy hỏi ba câu trước: có phải cách tách từ, có phải ngưỡng mật độ phụ thuộc ngôn ngữ, có phải tên thực thể không nhất quán giữa hai ngôn ngữ — rồi mới bàn chất lượng nội dung. Chúng tôi cũng sẽ ghi rõ sai lệch ngôn ngữ của công cụ trong báo cáo đối ngoại (lần này đã công bố hai sai lệch của engine nhà trong chính bài này).

Bước tiếp theo của chúng tôi cũng ghi ở đây để tiện đối chiếu: ① bổ sung Meta từng trang cho 6 bài "cập nhật dữ liệu" cũ (63–67 điểm, Meta 5/14); ② bổ sung Open Graph toàn site (sửa template một lần); ③ căn khớp mô tả JSON-LD với meta của các trang tiếng Việt; ④ llms.txt còn thiếu 6 điểm (12/18), cần thêm llms-full và cấu trúc phân mục sâu hơn.

Chín, Phương pháp, cách đo và miễn trừ

Toàn bộ số liệu trong bài đến từ một lần đo toàn bộ 114 trang nội dung của site bằng engine audit tự xây của VIETTRITHONG GEO lúc 02:08 ngày 29/09/2026, sau đó ghép thành 57 cặp trang song ngữ cùng nguồn và so từng hạng mục. Tập dữ liệu gồm 57 dòng × 8 hạng mục (kèm chi tiết tín hiệu tiêu cực: mục bị gắn, mật độ, từ bị gắn); điểm tổng tính lại được bằng "tổng 8 hạng mục + khoản trừ"; điểm tối đa (robots 18 / llms 18 / schema 16 / meta 14 / content 12 / signals 6 / ai_discovery 6 / brand_entity 10) và các ngưỡng (300 từ, mật độ 2,5%, trừ −1/−3/−5) lấy từ mã nguồn engine v4.18.0, không phải ước lượng.

Về phạm vi: sau khi bài này xuất bản, số trang nội dung tăng từ 114 lên 116 (thêm hai bản Trung và Việt của chính bài này), nên "114 trang / 57 cặp" là quy mô tại thời điểm đo. Phần văn bản đo được bao gồm cả khối huy hiệu tĩnh trên trang (khoảng 100 chữ), giống nhau ở cả hai bản, không ảnh hưởng kết luận so sánh.

Hai phát hiện trong bài cũng chính là hạn chế đã biết của công cụ chúng tôi: ① đếm từ theo dấu cách làm thiếu hụt có hệ thống lượng nội dung tiếng Trung (bài này kiểm chứng chéo bằng cách đếm ký tự); ② biểu thức mật độ từ khóa \b[a-zA-ZÀ-ÿ]{4,}\b không phủ khối Latin Extended Additional mà tiếng Việt sử dụng, gây dương tính giả với tiếng Việt và không có tác dụng với tiếng Trung. Báo cáo đo điểm đối ngoại của chúng tôi sẽ ghi rõ hai điểm này, và với site tiếng Trung sẽ cung cấp thêm lượng nội dung theo cách đếm ký tự.

Số liệu thị trường bên ngoài chỉ dùng làm bối cảnh, đều kèm nguồn và thời gian: Gartner (2024-02, tìm kiếm truyền thống giảm 25% vào 2026), Bain (80% người tiêu dùng dùng AI cho ít nhất 40% nhu cầu tìm kiếm), iiMedia Research (2026-02, thị trường GEO Trung Quốc 349,3 tỷ CNY năm 2025 → dự kiến 942 tỷ CNY năm 2026), Technode (2025-08, tỷ lệ phủ ChatGPT tại Việt Nam 81%), Phụ lục tiêu chuẩn Unicode #29 (UAX #29 – Phân đoạn văn bản Unicode: tiếng Trung / Nhật / Thái không tách từ bằng dấu cách, quy tắc biên từ mặc định không đủ). Engine dựa trên dự án mã nguồn mở Auriti geo-optimizer-skill (giấy phép MIT); trọng số và hạng mục của mỗi engine khác nhau nên điểm của cùng một site trên các công cụ khác nhau không so sánh trực tiếp được.

Bài liên quan: Tự chấm AI Readiness cho 104 trang · Đo 14 sàn bán lẻ Việt Nam · Phương pháp GEO tiếng Việt