
MTEB 分數解析:為何排名第一的模型並非你 RAG 的最佳選擇
Hugging Face 的 MTEB 排行榜列出了 5,000 多個嵌入模型提交項目,幾乎每週都有新模型擠進榜首。這裡有個陷阱:那個排名第一的模型,很可能不該是你最終部署的選擇。你盯著看的 MTEB 分數是橫跨 8 種不同任務類型的平均值,而其中只有一種任務能預測檢索增強生成(RAG)在你文件上的表現。我們是吃過虧才學到這教訓。在 2026 年 4 月,我們原本選定的排名第一模型,在我們自己的語料庫測試中輸給了一個更便宜的模型。本指南將拆解這些數字背後的真正含義、針對 RAG 該信任哪一欄數據,以及為何排行榜只是起點而非最終判決。
重點摘要
- MTEB 是一個多任務基準測試;標題中的「整體」分數將 8 種任務類型混合成一個平均值。
- 對於 RAG,只有「檢索」(Retrieval)子頁籤(nDCG@10)能預測生產環境品質,而非整體平均分數。
- 實際的嵌入模型在零樣本(zero-shot)情況下的 nDCG@10 分數約為 0.4–0.7;1.0 代表完美排序。
- 使用 MTEB 進行初步篩選,然後在你的自有語料庫上進行測試。排名第一的模型經常會輸。
什麼是 MTEB 分數?
MTEB 代表 Massive Text Embedding Benchmark(大型文本嵌入基準測試),這是一個用於評分文本嵌入模型的開放式多任務套件。MTEB 分數是將各任務指標平均後得出的單一整體數值,涵蓋 8 種任務類型。它由 Muennighoff 及其同事於 2022 年提出(arXiv 2210.07316,發表於 EACL 2023)。
該基準測試以公開的 Hugging Face Space 形式存在,任何人都可以提交模型。大多數人引用的數字是「整體平均分數」,它將檢索、分類、聚類以及其他五種任務家族混合成一個數字。這正是標題排名具有誤導性的原因:一個模型可能因為在聚類任務表現強勁而贏得平均分數,但在你的產品所依賴的單一任務上表現平平。原始論文涵蓋了大約 58 個數據集和 112 種語言中的 8 種任務類型。
8 種 MTEB 任務類別(及各分數衡量標準)
MTEB 將嵌入評估分為 8 種任務類型,每種類型使用不同的指標進行評分。因此,除非你知道自己正在閱讀哪種任務,否則「高 MTEB 分數」幾乎沒有意義。分類任務中的 0.85(準確率)與檢索任務中的 0.85(nDCG@10)描述的是完全不同的能力。
以下是似乎沒人清晰發布的解碼表。指標會隨任務改變:
| 任務類別 | 測試內容 | 指標 |
|---|---|---|
| 檢索 (Retrieval) | 為查詢找到相關文件(這就是 RAG) | nDCG@10 |
| 分類 (Classification) | 將文本標記為類別 | 準確率 (accuracy) |
| 聚類 (Clustering) | 將相似文本分組 | v-measure |
| 配對分類 (Pair Classification) | 兩段文本是否匹配? | 平均精確度 (average precision) |
| 重排序 (Reranking) | 重新排列候選結果 | MAP |
| STS (語義文本相似度) | 兩個句子的語義相似程度 | Spearman 相關係數 |
| 摘要 (Summarization) | 排名摘要品質 | Spearman 相關係數 |
| 雙語挖掘 (Bitext mining) | 跨語言匹配翻譯 | F1 |
上述任務與指標的對應關係已透過 MTEB 論文(arXiv 2210.07316)驗證。重點在於:即使在整體 MTEB 平均分數中排名第一的模型,在你產品運行的單一任務上仍可能表現 mediocre(平庸)。
哪個 MTEB 分數對 RAG 真正重要?
對於 RAG,請忽略整體平均分數,並閱讀由 nDCG@10 評分的 檢索(Retrieval) 子頁籤。RAG 本質上是對你的文件進行語義搜索,這正是檢索任務。STS 雖有 loosely correlated(鬆散相關性),但屬於次要因素。一個模型可能贏得整體排行榜,但在檢索任務中排名中游,因此檢索欄位才是預測生產環境品質的關鍵。
為什麼整體混合數據會產生誤導?檢索子集建立在 MS MARCO、Natural Questions 和 HotpotQA 等通用網頁和問答數據集之上。一個在分類任務表現出色的模型可能會交出漂亮的全局平均分數,但其檢索數值卻偏低。打開 Hugging Face 排行榜(huggingface.co/spaces/mteb/leaderboard,訪問日期 2026-07-13),在比較任何內容之前,先過濾至檢索頁籤。
如果你編寫自己的評估腳本,代碼中也適用相同的過濾邏輯:
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasks讀完檢索欄位後,下一個問題是選擇哪個模型。我們的中心文章詳細介紹了實際上應該部署哪個嵌入模型,包含完整的基準測試數據;如果你正在決定這些向量存放在哪裡,我們的2026 年最佳向量數據庫指南可與之搭配參考。
nDCG@10 分數究竟意味著什麼?
nDCG@10 衡量前 10 個檢索結果的排序質量。分數為 1.0 表示所有相關文件都排在最頂端;0 表示沒有任何相關文件排在前面。實際的嵌入模型在零樣本(zero-shot)情況下得分約為 0.4–0.7,因此 0.55 是正常的,並非故障。
把它想像成對搜索框進行評分。你在意的是正確答案是否出現在第一位,而不僅僅是出現在某處,因為你的 LLM 只會閱讀你餵給它的前幾個片段。沒有人能達到 1.0,因為查詢具有歧義性,且相關文件很少能完美對齊。所以,如果 nDCG@10 為 0.55 讓你感到恐慌,請放心;這是一個正常且可部署的零樣本分數,0.4–0.7 的區間是典型範圍(經 zeroentropy.dev 證實),並非物理定律。
我們將 MTEB 第一名模型與我們的自有 RAG 語料庫進行對比(結果它沒贏)
我們选取了在 MTEB 英文檢索頁籤排名第一的模型,並在我們自有的 10,000 份文件 技術文檔語料庫上與其他六個模型進行運行測試,針對一組手動標註的約 120 個查詢進行評分。排行榜領先者獲得了強勁的 Recall@10(召回率),但並未獲得第一名,且兩個更便宜的選項表現足夠接近,足以改變決策。由於只有約 120 個查詢,請將這些結果視為方向性參考,而非排行榜定論。
在我們的測試窗口期間,MTEB 英文排行榜領先者是 Gemini Embedding 001(它在 2026 年 4 月的快照中位居榜首);以下的排名來自 Hugging Face MTEB 面板,由於數字會隨快照變化,我們標註了日期:
| 模型 (維度) | MTEB 英文排名 (HF, 2026) | 我們語料庫的 Recall@10 | 成本 |
|---|---|---|---|
| Gemini Embedding 001 (3072) | 英文檢索頁籤榜首 | 0.88 | ~$0.15/M |
| Voyage-4-large (1024) | 未發布至公共面板 | 0.89 | ~$0.12/M |
| Qwen3-Embedding-8B (自託管) | 開源模型領先者 | 0.87 | 僅 GPU |
| text-embedding-3-large @1024 (截斷) | 中階層級 | 0.83 | ~$0.13/M |
排行榜沒告訴我們的兩件事。首先,公共排名第一的模型(Gemini)在我們的語料庫中被 Voyage-4-large 小幅超越,而後者甚至沒有發布在該面板上。其次,一個自託管的開源模型(Qwen3-8B)以無每令牌成本的優勢緊隨其後,而 OpenAI 截斷的 1024 維向量以減少 3 倍的存儲空間保持了 0.83 的 Recall@10。MTEB 基於通用網頁和問答文本對檢索進行排名;我們的語料庫是採用獨特分塊方式的專業技術詞彙,因此順序發生了重排。這正是主張在你自己的數據上進行測試的全部理由。我們關於如何在你自己的 RAG 語料庫上進行測試的演練涵蓋了評估方面,而中心文章則攜帶完整的方法論。
為何排行榜第一名並非你的最佳選擇
有三件事是排行榜無法看到的,它們決定了你真正的贏家:領域詞彙(通用數據集中從未包含的行話)、分塊大小(短篇幅與長篇幅有利於不同的模型)以及查詢語言。這就是為什麼 MTEB 是一個篩選工具,而非最終答案。排名告訴你哪些模型是可行的,而不是哪一個適合你的數據。
以下是實際操作中會翻轉排名的語料庫因素:
- 領域偏移:法律、醫療或代碼庫文本帶有 MS MARCO 從未採樣的詞彙。
- 分塊大小:在短篇幅上調整的模型可能在處理 800 個 token 的分塊時表現不佳。
- 查詢語言和風格:多語言或重度依賴關鍵字的查詢會迅速重排順序。
根據我們的經驗,可靠的工作流程雖然枯燥但有效:使用 MTEB 檢索頁籤篩選出 3–4 個候選模型,然後在你的自有文件上測量 Recall@10 和 nDCG@10。我們對通用 RAG 工具的綜述有助於管道搭建,而對於在你自己的數據上評估模型的結構化方法,該評論涵蓋了評估方面。值得 bookmark(書籤收藏)的兩篇相關閱讀:使用 Ollama 在本地運行嵌入模型,以及 Voyage vs OpenAI vs Cohere 嵌入模型的正面對決。
MTEB 與 MMTEB,以及為何數字不斷變化
MMTEB 是 MTEB 的多語言 v2 擴展版(arXiv 2502.13595,v2 於 2025 年 4 月 8 日發布)。它增加了跨越 250 多種語言的 500 多個社區驅動任務,以及長文檔、指令遵循和代碼檢索。如果你的 RAG 僅限英文,原始的英文 MTEB 檢索頁籤仍然是你該閱讀的內容。當你的查詢和文件跨越多種語言時,MMTEB 最為重要。
這裡要誠實說明。MTEB 數字在不同快照甚至不同論文版本之間存在衝突:原始論文在一个版本中報告 56 個數據集,而在另一個版本中報告 58 個,因此切勿將單個數字視為權威標準。隨著 5,000 多個提交項目的到來,排名不斷重排,因此務必截圖保存你閱讀時的排行榜日期。如果頁面無法加載,那是因為 Hugging Face Space 運行在 CPU 升級過程中,經常緩慢或不穩定,並非你的網絡連接問題。
結論
一旦你正確解讀,MTEB 是選擇嵌入模型的最佳公共起點。閱讀檢索頁籤,而非整體平均分數。將 nDCG@10 的 0.4–0.7 視為正常範圍。使用排行榜進行初步篩選,然後在你的自有語料庫上測試該短名單,因為排名第一的模型在真實數據上經常會輸(我們的也是如此)。當你準備好選擇時,回到我們的嵌入模型中心獲取完整的基準測試和建議。如果真正的工作是將你選擇的模型接入生產管道,那麼這種「先篩選後測試」的評估方法也是我們 AI 集成工作的一部分。
關於作者
Mert Batur Gurbuz 是 Techsy.io 的聯合創始人,該團隊為 B2B 客戶交付 AI 代理、自動化系統以及語音/SDR 管道。他就讀於伯明翰大學,並撰寫關於 Techsy 團隊在生產環境中實際使用的 LLM 工具棧的文章。
在 LinkedIn 上聯繫。
常見問題
什麼是 MTEB?
MTEB 是 Massive Text Embedding Benchmark(大型文本嵌入基準測試),這是一個開放套件,用於評分文本嵌入模型在 8 種任務類型(包括檢索、分類和聚類)中的表現。它由 Muennighoff 及其同事於 2022 年推出(arXiv 2210.07316),並作為公共排行榜託管在 Hugging Face 上。
MTEB 代表什麼?
MTEB 代表 Massive Text Embedding Benchmark。這個名字很重要,因為「Massive」(大型)指的是任務和數據集的廣度,而非單一測試。你的 MTEB 分數實際上是許多單獨評估的平均值,這就是為什麼整體數字可能會掩蓋你在關心的任務上的弱點。
哪個 MTEB 分數對 RAG 重要?
對於 RAG,請閱讀由 nDCG@10 評分的檢索子頁籤,而非整體平均分數。RAG 是對你的文件進行語義搜索,這正是排行榜衡量的檢索任務。一個模型可能發布強勁的整體分數,但在檢索任務中排名中游,因此檢索才是可靠的信號。
什麼是好的 MTEB 檢索分數?
實際的嵌入模型在零樣本情況下通常得分為 0.4–0.7 nDCG@10,因此該區間內的任何數值都是正常且可部署的。0.55 並非危險信號。沒有人能達到 1.0,因為查詢具有歧義性,且相關文件很少能按完美順序排列。將候選模型相互比較,而非與完美的 1.0 比較。
什麼是 nDCG@10?
nDCG@10 衡量前 10 個檢索結果的排序質量。分數為 1.0 表示所有相關文件都排在最頂端;0 表示沒有任何相關文件排在前面。它獎勵將最佳答案放在第一位,這對 RAG 很重要,因為你的 LLM 只會閱讀你檢索到的前幾個片段。
MTEB 和 MMTEB(v1 與 v2)之間有什麼區別?
MMTEB 是 MTEB 的多語言 v2 擴展版(arXiv 2502.13595,2025 年 4 月)。它將基準測試擴展到跨越 250 多種語言的 500 多個社區驅動任務,並增加了長文檔、指令和代碼檢索。如果你的 RAG 僅限英文,請堅持使用原始的英文 MTEB 檢索頁籤。
為什麼 MTEB 排行榜變化如此頻繁(以及為什麼無法加載)?
排名不斷重排,因為新模型隨時都在提交,現有條目超過 5,000 個且仍在增長。3 月的快照與 7 月的快照不會匹配,因此務必截圖保存你閱讀時的排行榜日期。如果頁面無法加載,那是因為 Hugging Face Space 運行在 CPU 升級過程中,經常緩慢或不穩定。
我應該直接選擇 MTEB 排行榜上的第一名模型嗎?
不。第一名模型是一個候選短名單,而非最終判決。排行榜看不到你的領域詞彙、分塊大小或查詢語言,所有這些都會改變哪個模型獲勝。使用檢索頁籤篩選出 3–4 個模型,然後在你的語料庫上進行測試。在我們的測試中,公共排行榜第一名在我們自有語料庫上被一個甚至不在該面板上的模型小幅超越,並與一個更便宜的自託管選項持平。