
Giải thích điểm số MTEB: Tại sao mô hình đứng #1 không phải lựa chọn tốt nhất cho RAG
Bảng xếp hạng MTEB của Hugging Face liệt kê hơn 5.000 lượt gửi mô hình embedding, và hầu như mỗi tuần đều có một mô hình mới nhích lên vị trí dẫn đầu. Đây là cái bẫy: mô hình đứng #1 đó có lẽ không phải là mô hình bạn nên triển khai. Điểm số MTEB mà bạn đang nhìn chằm chằm là mức trung bình trên 8 loại tác vụ khác nhau, và chỉ có một trong số đó dự đoán được mức độ hiệu quả của việc tạo nội dung tăng cường truy xuất (RAG) trên tài liệu của bạn. Chúng tôi đã học được điều này một cách khó khăn. Vào tháng 4 năm 2026, lựa chọn được xếp hạng cao nhất của chúng tôi đã thua một mô hình rẻ hơn khi chạy trên kho dữ liệu riêng. Hướng dẫn này sẽ phân tích ý nghĩa thực sự của các con số, cột dữ liệu nào đáng tin cậy cho RAG và tại sao bảng xếp hạng chỉ là điểm khởi đầu, không phải phán quyết cuối cùng.
Những điểm chính
- MTEB là một bộ tiêu chuẩn đa tác vụ; điểm số "tổng thể" nổi bật trộn lẫn 8 loại tác vụ thành một mức trung bình duy nhất.
- Đối với RAG, chỉ có tab phụ Retrieval (Truy xuất) với chỉ số nDCG@10 dự đoán chất lượng thực tế, không phải mức trung bình tổng thể.
- Các mô hình embedding thực tế đạt điểm nDCG@10 từ 0.4–0.7 trong điều kiện zero-shot; điểm 1.0 có nghĩa là xếp hạng hoàn hảo.
- Hãy dùng MTEB để lọc danh sách ngắn, sau đó thử nghiệm trên kho dữ liệu của riêng bạn. Mô hình đứng #1 thường xuyên thất bại.
Điểm số MTEB là gì?
MTEB là viết tắt của Massive Text Embedding Benchmark (Bộ tiêu chuẩn Embedding Văn bản Khổng lồ), một bộ công cụ mã nguồn mở, đa tác vụ dùng để chấm điểm các mô hình embedding văn bản. Một điểm số MTEB là chỉ số cho từng tác vụ, được tính trung bình thành một con số tổng thể duy nhất trên 8 loại tác vụ. Nó được giới thiệu bởi Muennighoff và các đồng nghiệp vào năm 2022 (arXiv 2210.07316, công bố tại EACL 2023).
Bộ tiêu chuẩn này tồn tại dưới dạng một Hugging Face Space công khai, nơi bất kỳ ai cũng có thể gửi mô hình của mình. Con số mà hầu hết mọi người trích dẫn là "mức trung bình tổng thể", pha trộn giữa truy xuất, phân loại, phân cụm và năm họ tác vụ khác thành một con số duy nhất. Đó chính xác là lý do tại sao thứ hạng trên tiêu đề gây hiểu lầm: một mô hình có thể chiến thắng ở mức trung bình nhờ mạnh về phân cụm trong khi chỉ ở mức khá ở tác vụ duy nhất mà sản phẩm của bạn phụ thuộc vào. Bài báo gốc bao gồm 8 loại tác vụ trên khoảng 58 bộ dữ liệu và 112 ngôn ngữ.
8 Danh mục Tác vụ MTEB (và Ý nghĩa của Từng Điểm Số)
MTEB nhóm việc đánh giá embedding thành 8 loại tác vụ, và mỗi loại được chấm điểm bằng một chỉ số khác nhau. Vì vậy, "một điểm MTEB cao" gần như vô nghĩa nếu bạn không biết mình đang đọc tác vụ nào. Điểm 0.85 trong phân loại (độ chính xác) và 0.85 trong truy xuất (nDCG@10) mô tả các khả năng hoàn toàn khác biệt.
Dưới đây là bảng giải mã mà dường như không ai công bố một cách rõ ràng. Chỉ số thay đổi tùy theo tác vụ:
| Danh mục tác vụ | Nội dung kiểm tra | Chỉ số |
|---|---|---|
| Retrieval (Truy xuất) | Tìm tài liệu liên quan cho một truy vấn (đây là RAG) | nDCG@10 |
| Classification (Phân loại) | Gán nhãn văn bản vào các danh mục | accuracy (độ chính xác) |
| Clustering (Phân cụm) | Nhóm các văn bản tương tự | v-measure |
| Pair Classification (Phân loại cặp) | Hai văn bản có khớp nhau không? | average precision (độ chính xác trung bình) |
| Reranking (Xếp hạng lại) | Sắp xếp lại thứ tự các kết quả ứng viên | MAP |
| STS (tương đồng ngữ nghĩa văn bản) | Mức độ tương đồng về nghĩa của hai câu | Tương quan Spearman |
| Summarization (Tóm tắt) | Xếp hạng chất lượng bản tóm tắt | Tương quan Spearman |
| Bitext mining (Khai thác song ngữ) | Khớp các bản dịch giữa các ngôn ngữ | F1 |
Bản đồ tác vụ-chỉ số ở trên đã được xác minh từ bài báo MTEB (arXiv 2210.07316). Bài học rút ra: một mô hình đứng đầu mức trung bình tổng thể của MTEB vẫn có thể chỉ ở mức trung bình khá ở tác vụ duy nhất mà sản phẩm của bạn vận hành.
Điểm số MTEB nào thực sự quan trọng đối với RAG?
Đối với RAG, hãy bỏ qua mức trung bình tổng thể và đọc tab phụ Retrieval (Truy xuất), được chấm điểm bằng nDCG@10. RAG là tìm kiếm ngữ nghĩa trên tài liệu của bạn, đây chính xác là tác vụ truy xuất. STS có tương quan lỏng lẻo nhưng chỉ là thứ yếu. Một mô hình có thể chiến thắng bảng xếp hạng tổng thể trong khi chỉ xếp hạng ở nhóm giữa về truy xuất, vì vậy cột truy xuất mới là yếu tố dự đoán chất lượng thực tế.
Tại sao sự pha trộn tổng thể lại gây hiểu lầm? Tập hợp con về truy xuất được xây dựng từ các bộ dữ liệu web chung và hỏi đáp như MS MARCO, Natural Questions và HotpotQA. Một mô hình tỏa sáng trong phân loại có thể đăng tải một mức trung bình tuyệt vời trong khi chỉ số truy xuất của nó lại thấp. Hãy mở bảng xếp hạng Hugging Face (huggingface.co/spaces/mteb/leaderboard, truy cập ngày 13/07/2026) và lọc sang tab retrieval trước khi so sánh bất cứ điều gì.
Nếu bạn viết kịch bản đánh giá riêng, bộ lọc tương tự cũng áp dụng trong mã:
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasksSau khi đã đọc cột truy xuất, câu hỏi tiếp theo là chọn mô hình nào. Bài viết trên hub của chúng tôi hướng dẫn chi tiết mô hình embedding nào thực sự nên triển khai với đầy đủ số liệu benchmark, và nếu bạn đang cân nhắc nơi lưu trữ các vector đó, hướng dẫn về các cơ sở dữ liệu vector tốt nhất năm 2026 sẽ bổ trợ hoàn hảo.
Điểm số nDCG@10 thực sự có nghĩa là gì?
nDCG@10 đo lường mức độ xếp hạng chính xác của 10 kết quả truy xuất hàng đầu. Điểm 1.0 có nghĩa là mọi tài liệu liên quan đều nằm ở vị trí rất đầu tiên; 0 có nghĩa là không có tài liệu nào như vậy. Các mô hình embedding thực tế thường đạt khoảng 0.4–0.7 trong điều kiện zero-shot, vì vậy điểm 0.55 là bình thường, không phải lỗi.
Hãy nghĩ về nó như việc chấm điểm một ô tìm kiếm. Bạn quan tâm liệu câu trả lời đúng có xuất hiện đầu tiên hay không, chứ không chỉ là xuất hiện ở đâu đó, vì LLM của bạn chỉ đọc vài đoạn đầu tiên mà bạn cung cấp cho nó. Không ai đạt được 1.0, vì các truy vấn thường mơ hồ và các tài liệu liên quan hiếm khi sắp xếp hoàn hảo. Vì vậy, nếu điểm nDCG@10 là 0.55 khiến bạn hoảng sợ, đừng lo; đó là điểm số zero-shot bình thường và có thể triển khai được, và dải 0.4–0.7 là phạm vi điển hình (được xác nhận bởi zeroentropy.dev), không phải định luật vật lý bất di bất dịch.
Chúng tôi đã đối đầu mô hình MTEB #1 với Kho dữ liệu RAG của riêng mình (và nó không thắng)
Chúng tôi lấy mô hình đứng đầu tab truy xuất tiếng Anh của MTEB và chạy thử nghiệm với sáu mô hình khác trên kho dữ liệu tài liệu kỹ thuật gồm 10.000 tài liệu của riêng chúng tôi, được chấm điểm dựa trên bộ ~120 truy vấn đã được gán nhãn thủ công. Mô hình dẫn đầu bảng xếp hạng đạt điểm Recall@10 mạnh mẽ, nhưng nó không về nhất, và hai lựa chọn rẻ hơn có kết quả đủ gần để thay đổi quyết định. Với chỉ ~120 truy vấn, hãy coi đây là xu hướng định hướng, không phải một bảng xếp hạng chính thức.
Mô hình dẫn đầu bảng xếp hạng MTEB tiếng Anh trong khung thời gian thử nghiệm của chúng tôi là Gemini Embedding 001 (đứng đầu bản chụp tháng 4/2026); thứ hạng dưới đây đến từ bảng MTEB của Hugging Face, và vì các con số thay đổi theo từng bản chụp, chúng tôi trích dẫn kèm ngày tháng:
| Mô hình (số chiều) | Thứ hạng MTEB tiếng Anh (HF, 2026) | Recall@10 trên kho dữ liệu của chúng tôi | Chi phí |
|---|---|---|---|
| Gemini Embedding 001 (3072) | Đứng đầu tab truy xuất tiếng Anh | 0.88 | ~$0.15/triệu token |
| Voyage-4-large (1024) | Không được đăng trên bảng công khai | 0.89 | ~$0.12/triệu token |
| Qwen3-Embedding-8B (tự host) | Dẫn đầu các mô hình mở | 0.87 | Chỉ GPU |
| text-embedding-3-large @1024 (cắt ngắn) | Phân khúc trung bình | 0.83 | ~$0.13/triệu token |
Có hai điều mà bảng xếp hạng không nói cho chúng ta biết. Thứ nhất, mô hình #1 công khai (Gemini) đã bị vượt mặt trên kho dữ liệu của chúng tôi bởi Voyage-4-large, một mô hình thậm chí không có mặt trên bảng đó. Thứ hai, một mô hình mở tự host (Qwen3-8B) đã bám sát với chi phí bằng 0 trên mỗi token, và các vector 1024 chiều cắt ngắn của OpenAI giữ được điểm Recall@10 là 0.83 với dung lượng lưu trữ nhỏ hơn 3 lần. MTEB xếp hạng truy xuất trên văn bản web chung và hỏi đáp; kho dữ liệu của chúng tôi là từ vựng kỹ thuật chuyên ngành được chia đoạn theo cách riêng, nên thứ tự bị đảo lộn. Đó là toàn bộ lập luận cho việc thử nghiệm trên dữ liệu của riêng bạn. Hướng dẫn của chúng tôi về cách thử nghiệm trên kho dữ liệu RAG của riêng bạn bao gồm khía cạnh đánh giá, và bài viết trên hub chứa đầy đủ phương pháp luận.
Tại sao mô hình #1 trên bảng xếp hạng không phải lựa chọn tốt nhất của bạn
Ba yếu tố mà bảng xếp hạng không thể nhìn thấy sẽ quyết định người chiến thắng thực sự của bạn: từ vựng lĩnh vực (thuật ngữ chuyên ngành mà các bộ dữ liệu chung không bao giờ chứa), kích thước đoạn văn (đoạn ngắn so với dài sẽ ưu tiên các mô hình khác nhau) và ngôn ngữ truy vấn. Đó là lý do tại sao MTEB là công cụ lọc danh sách ngắn, không phải câu trả lời cuối cùng. Thứ hạng cho bạn biết những mô hình nào có khả năng, không phải mô hình nào phù hợp với dữ liệu của bạn.
Dưới đây là các yếu tố về kho dữ liệu thường đảo ngược thứ hạng trong thực tế:
- Sự thay đổi lĩnh vực: Văn bản pháp lý, y tế hoặc mã nguồn mang từ vựng mà MS MARCO chưa bao giờ lấy mẫu.
- Kích thước đoạn văn: Một mô hình được tinh chỉnh trên các đoạn văn ngắn có thể gặp khó khăn với các đoạn 800 token.
- Ngôn ngữ và phong cách truy vấn: Các truy vấn đa ngôn ngữ hoặc nặng về từ khóa sẽ nhanh chóng làm thay đổi thứ tự.
Theo kinh nghiệm của chúng tôi, quy trình làm việc đáng tin cậy tuy nhàm chán nhưng hiệu quả: sử dụng tab retrieval của MTEB để lọc ra 3–4 ứng viên, sau đó đo lường Recall@10 và nDCG@10 trên tài liệu của riêng bạn. Bản tổng hợp của chúng tôi về các công cụ RAG phổ biến giúp ích cho quy trình, và để có cách tiếp cận có cấu trúc nhằm đánh giá mô hình trên dữ liệu của riêng bạn, bài đánh giá đó bao quát khía cạnh đánh giá. Hai bài đọc liên quan đáng để bookmark: chạy các mô hình embedding cục bộ với Ollama, và cuộc đối đầu trực tiếp giữa các embedding của Voyage vs OpenAI vs Cohere.
MTEB so với MMTEB, và tại sao các con số luôn thay đổi
MMTEB là phiên bản mở rộng đa ngôn ngữ v2 của MTEB (arXiv 2502.13595, v2 công bố ngày 8 tháng 4 năm 2025). Nó bổ sung hơn 500 tác vụ do cộng đồng đóng góp trên hơn 250 ngôn ngữ, cùng với truy xuất tài liệu dài, tuân theo chỉ dẫn và mã nguồn. Nếu RAG của bạn chỉ dùng tiếng Anh, tab truy xuất MTEB tiếng Anh gốc vẫn là thứ bạn cần đọc. MMTEB quan trọng nhất khi các truy vấn và tài liệu của bạn trải rộng trên nhiều ngôn ngữ.
Đây là phần thẳng thắn. Các con số MTEB mâu thuẫn giữa các bản chụp và thậm chí giữa các phiên bản bài báo: bài báo gốc báo cáo 56 bộ dữ liệu trong một phiên bản và 58 trong phiên bản khác, vì vậy đừng bao giờ coi một con số duy nhất là chuẩn mực. Thứ hạng liên tục thay đổi khi hơn 5.000 lượt gửi mới xuất hiện, vì vậy hãy luôn chụp màn hình bảng xếp hạng kèm ngày bạn xem. Và nếu trang không tải được, Hugging Face Space chạy trên bản nâng cấp CPU và thường chậm hoặc không ổn định, không phải do kết nối của bạn.
Kết luận
MTEB là điểm khởi đầu công khai tốt nhất để chọn mô hình embedding, miễn là bạn đọc nó đúng cách. Hãy đọc tab retrieval, không phải mức trung bình tổng thể. Coi điểm nDCG@10 từ 0.4–0.7 là bình thường. Lọc danh sách ngắn bằng bảng xếp hạng, sau đó thử nghiệm danh sách đó trên kho dữ liệu của riêng bạn, vì mô hình #1 thường thua trên dữ liệu thực tế (như trường hợp của chúng tôi). Khi bạn sẵn sàng chọn, hãy quay lại hub mô hình embedding của chúng tôi để xem đầy đủ benchmark và khuyến nghị. Và nếu nhiệm vụ thực sự là tích hợp mô hình bạn chọn vào quy trình sản xuất, việc đánh giá lọc-danh-sách-rồi-thử-nghiệm là một phần trong dịch vụ tích hợp AI của chúng tôi.
Về tác giả
Mert Batur Gurbuz là Đồng sáng lập Techsy.io, nơi đội ngũ phát triển các tác nhân AI, hệ thống tự động hóa và quy trình voice/SDR cho khách hàng B2B. Anh ấy đang học tại Đại học Birmingham và viết về ngăn xếp công cụ LLM mà đội ngũ Techsy thực sự sử dụng trong sản xuất.
Kết nối trên LinkedIn.
Câu hỏi thường gặp
MTEB là gì?
MTEB là Massive Text Embedding Benchmark, một bộ công cụ mã nguồn mở để chấm điểm hiệu suất của các mô hình embedding văn bản trên 8 loại tác vụ, bao gồm truy xuất, phân loại và phân cụm. Được giới thiệu bởi Muennighoff và các đồng nghiệp vào năm 2022 (arXiv 2210.07316), nó được lưu trữ dưới dạng bảng xếp hạng công khai trên Hugging Face.
MTEB là viết tắt của cụm từ nào?
MTEB là viết tắt của Massive Text Embedding Benchmark. Cái tên này quan trọng vì "massive" (khổng lồ) ám chỉ sự rộng lớn của các tác vụ và bộ dữ liệu, không phải một bài kiểm tra duy nhất. Điểm MTEB của bạn thực chất là mức trung bình của nhiều đánh giá riêng biệt, đó là lý do tại sao con số tổng thể có thể che giấu những điểm yếu ở tác vụ mà bạn quan tâm.
Điểm số MTEB nào quan trọng đối với RAG?
Đối với RAG, hãy đọc tab phụ Retrieval (Truy xuất), được chấm điểm bằng nDCG@10, không phải mức trung bình tổng thể. RAG là tìm kiếm ngữ nghĩa trên tài liệu của bạn, đây chính xác là tác vụ truy xuất mà bảng xếp hạng đo lường. Một mô hình có thể đạt điểm tổng thể mạnh trong khi chỉ xếp hạng ở nhóm giữa về truy xuất, vì vậy truy xuất mới là tín hiệu đáng tin cậy.
Điểm số truy xuất MTEB nào là tốt?
Các mô hình embedding thực tế thường đạt điểm nDCG@10 từ 0.4–0.7 trong điều kiện zero-shot, vì vậy bất kỳ điểm nào trong dải này đều bình thường và có thể triển khai. Điểm 0.55 không phải là dấu hiệu cảnh báo. Không ai đạt được 1.0, vì các truy vấn thường mơ hồ và các tài liệu liên quan hiếm khi sắp xếp theo thứ tự hoàn hảo. Hãy so sánh các ứng viên với nhau, không phải so với điểm 1.0 hoàn hảo.
nDCG@10 là gì?
nDCG@10 đo lường mức độ xếp hạng chính xác của 10 kết quả truy xuất hàng đầu. Điểm 1.0 có nghĩa là mọi tài liệu liên quan đều nằm ở vị trí rất đầu tiên; 0 có nghĩa là không có tài liệu nào như vậy. Nó thưởng cho việc đặt câu trả lời tốt nhất lên đầu, điều này quan trọng đối với RAG vì LLM của bạn chỉ đọc vài đoạn đầu tiên mà bạn truy xuất.
Sự khác biệt giữa MTEB và MMTEB (v1 so với v2) là gì?
MMTEB là phiên bản mở rộng đa ngôn ngữ v2 của MTEB (arXiv 2502.13595, tháng 4 năm 2025). Nó mở rộng bộ tiêu chuẩn lên hơn 500 tác vụ do cộng đồng đóng góp trên hơn 250 ngôn ngữ và bổ sung truy xuất tài liệu dài, tuân theo chỉ dẫn và mã nguồn. Nếu RAG của bạn chỉ dùng tiếng Anh, hãy giữ nguyên tab truy xuất MTEB tiếng Anh gốc.
Tại sao bảng xếp hạng MTEB thay đổi thường xuyên (và tại sao nó không tải được)?
Thứ hạng liên tục thay đổi vì các mô hình mới được gửi liên tục, với hơn 5.000 mục nhập và đang tăng lên. Bản chụp tháng 3 sẽ không khớp với bản chụp tháng 7, vì vậy hãy luôn chụp màn hình bảng xếp hạng kèm ngày tháng. Nếu trang không tải được, Hugging Face Space chạy trên bản nâng cấp CPU và thường xuyên chậm hoặc không ổn định.
Tôi có nên chỉ chọn mô hình #1 trên bảng xếp hạng MTEB không?
Không. Mô hình #1 là ứng viên cho danh sách ngắn, không phải phán quyết cuối cùng. Bảng xếp hạng không thể thấy từ vựng lĩnh vực, kích thước đoạn văn hoặc ngôn ngữ truy vấn của bạn, tất cả đều thay đổi mô hình chiến thắng. Sử dụng tab retrieval để lọc ra 3–4 mô hình, sau đó thử nghiệm trên kho dữ liệu của bạn. Trong bài kiểm tra của chúng tôi, mô hình #1 trên bảng xếp hạng công khai đã bị vượt mặt trên kho dữ liệu riêng bởi một mô hình thậm chí không có trong bảng đó, và bị san bằng bởi một lựa chọn tự host rẻ hơn.