
MTEB skóre vysvětleno: Proč model na 1. místě není nejlepší volbou pro váš RAG
Žebříček Hugging Face MTEB obsahuje více než 5 000 přihlášených embeddingových modelů a téměř každý týden se nový model dostane na první místo. V tom je past: model na 1. místě pravděpodobně není ten, který byste měli nasadit. MTEB skóre, na které se díváte, je průměr přes 8 různých typů úloh a pouze jeden z nich předpovídá, jak dobře bude retrieval-augmented generation fungovat na vašich dokumentech. Naučili jsme se to tvrdě. V dubnu 2026 náš favorizovaný model podle žebříčku prohrál na našem vlastním korpusu s levnějším modelem. Tento průvodce rozebírá, co čísla skutečně znamenají, kterému sloupci věřit pro RAG a proč je žebříček výchozí bod, nikoli verdikt.
Klíčové závěry
- MTEB je multitaskový benchmark; hlavní „celkový“ výsledek míchá 8 typů úloh do jednoho průměru.
- Pro RAG předpovídá produkční kvalitu pouze záložka Retrieval (nDCG@10), ne celkový průměr.
- Reálné embeddingové modely dosahují zero-shot nDCG@10 0,4–0,7; 1,0 by znamenalo perfektní pořadí.
- Použijte MTEB na užší výběr a poté testujte na vlastním korpusu. Model na 1. místě často prohraje.
Co je MTEB skóre?
MTEB znamená Massive Text Embedding Benchmark, otevřená multitasková sada pro hodnocení textových embeddingových modelů. MTEB skóre je metrika pro jednotlivé úlohy zprůměrovaná do jednoho celkového čísla napříč 8 typy úloh. Představili ho Muennighoff a kolegové v roce 2022 (arXiv 2210.07316, publikováno na EACL 2023).
Benchmark je veřejný Hugging Face Space, kam může kdokoli přihlásit model. Číslo, které většina lidí cituje, je „celkový průměr“, který mísí vyhledávání, klasifikaci, klastrování a pět dalších rodin úloh do jednoho údaje. Právě proto hlavní pořadí klame: model může vyhrát průměr tím, že je silný v klastrování, ale pouze průměrný v jediné úloze, na které váš produkt závisí. Původní článek zahrnuje 8 typů úloh napříč přibližně 58 datasety a 112 jazyky.
8 kategorií úloh MTEB (a co každé skóre měří)
MTEB rozděluje hodnocení embeddingů do 8 typů úloh a každý se hodnotí jinou metrikou. „Vysoké MTEB skóre“ proto téměř nic neříká, dokud nevíte, kterou úlohu čtete. 0,85 v klasifikaci (přesnost) a 0,85 ve vyhledávání (nDCG@10) popisují zcela odlišné schopnosti.
Zde je vysvětlující tabulka, kterou jako by nikdo nezveřejnil v čistém znění. Metrika se mění podle úlohy:
| Kategorie úlohy | Co testuje | Metrika |
|---|---|---|
| Retrieval | Hledání relevantních dokumentů pro dotaz (to je RAG) | nDCG@10 |
| Classification | Zařazování textu do kategorií | přesnost |
| Clustering | Seskupování podobných textů | v-measure |
| Pair Classification | Jsou dva texty shodné? | průměrná přesnost |
| Reranking | Přerovnání kandidátských výsledků | MAP |
| STS (sémantická podobnost textů) | Jak podobný je význam dvou vět | Spearmanova korelace |
| Summarization | Hodnocení kvality shrnutí | Spearmanova korelace |
| Bitext mining | Párování překladů napříč jazyky | F1 |
Výše uvedené mapování úloh na metriky je ověřené podle článku MTEB (arXiv 2210.07316). Jediné ponaučení: model, který vede celkový průměr MTEB, může být stále průměrný v jediné úloze, na které váš produkt běží.
Které MTEB skóre skutečně rozhoduje pro RAG?
Pro RAG ignorujte celkový průměr a čtěte záložku Retrieval, hodnocenou metrikou nDCG@10. RAG je sémantické vyhledávání nad vašimi dokumenty, což je přesně úloha retrieval. STS je volně korelované, ale druhotné. Model může vyhrát celkový žebříček, a přitom být ve vyhledávání až ve středu pole, takže sloupec vyhledávání je ten, který předpovídá produkční kvalitu.
Proč celkový mix klame? Podmnožina vyhledávání je postavená na obecných webových a QA datasetech, jako jsou MS MARCO, Natural Questions a HotpotQA. Model, který září v klasifikaci, může mít skvělý průměr, zatímco jeho číslo ve vyhledávání zaostává. Než cokoli porovnáte, otevřete žebříček Hugging Face (huggingface.co/spaces/mteb/leaderboard, přístup 13. 7. 2026) a přepněte se na záložku vyhledávání.
Pokud si vyhodnocení skriptujete sami, stejný filtr platí v kódu:
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasksAž si přečtete sloupec vyhledávání, další otázka je, který model vybrat. Náš rozcestník prochází který embeddingový model skutečně nasadit s kompletními benchmarkovými čísly, a pokud vybíráte, kde budou vektory uložené, náš průvodce nejlepší vektorové databáze v roce 2026 na něj navazuje.
Co vlastně znamená skóre nDCG@10?
nDCG@10 měří, jak dobře je seřazeno prvních 10 získaných výsledků. Skóre 1,0 znamená, že každý relevantní dokument je úplně nahoře; 0 znamená, že tam není žádný. Reálné embeddingové modely se zero-shot pohybují kolem 0,4–0,7, takže 0,55 je normální, ne chyba.
Představte si to jako hodnocení vyhledávacího pole. Záleží vám na tom, zda se správná odpověď zobrazí první, ne jen někde, protože váš LLM čte jen prvních několik chunků, které mu předáte. Nikdo nedosáhne 1,0, protože dotazy jsou nejednoznačné a relevantní dokumenty se zřídka seřadí dokonale. Takže pokud vás nDCG@10 0,55 nutí panikařit, nedělejte to; je to normální, nasaditelné zero-shot skóre a pásmo 0,4–0,7 je typický rozsah (potvrzuje to zeroentropy.dev), nikoli fyzikální zákon.
Postavili jsme model na 1. místě MTEB proti našemu vlastnímu RAG korpusu (a nevyhrál)
Vzali jsme model, který vede anglickou záložku Retrieval na MTEB, a otestovali ho proti šesti dalším na našem vlastním korpusu technické dokumentace s 10 000 dokumenty, vyhodnoceném vůči ručně označené sadě přibližně 120 dotazů. Lídr žebříčku zaznamenal silný Recall@10, ale neskončil první a dvě levnější možnosti se umístily dost blízko na to, aby změnily rozhodnutí. U pouhých ~120 dotazů to berte jako orientační směr, ne jako žebříček.
Lídrem anglického žebříčku MTEB v našem testovacím období byl Gemini Embedding 001 (vede snapshot z dubna 2026); níže uvedené pořadí vychází z žebříčku Hugging Face MTEB, a protože se čísla podle snapshotu mění, uvádíme naše s datem:
| Model (rozměry) | Umístění v anglickém MTEB (HF, 2026) | Recall@10 na našem korpusu | Náklady |
|---|---|---|---|
| Gemini Embedding 001 (3072) | vede anglickou záložku vyhledávání | 0,88 | ~$0.15/M |
| Voyage-4-large (1024) | není na veřejném žebříčku | 0,89 | ~$0.12/M |
| Qwen3-Embedding-8B (vlastní hostování) | nejlepší otevřený model | 0,87 | pouze GPU |
| text-embedding-3-large @1024 (zkráceno) | střední třída | 0,83 | ~$0.13/M |
Dvě věci, které nám žebříček neřekl. Zaprvé, veřejná jednička (Gemini) byla na našem korpusu těsně překonána modelem Voyage-4-large, který se na tomto žebříčku ani nezveřejňuje. Zadruhé, otevřený model s vlastním hostováním (Qwen3-8B) se přiblížil na vlas bez nákladů za token a zkrácené 1024rozměrné vektory od OpenAI udržely Recall@10 0,83 se třikrát menším úložištěm. MTEB hodnotí vyhledávání na obecném webu a QA textech; náš korpus má specializovanou technickou slovní zásobu chunkovanou svým způsobem, takže se pořadí přehází. To je celý argument pro testování na vlastních datech. Náš návod jak testovat na vlastním RAG korpusu pokrývá vyhodnocovací stránku a rozcestník obsahuje kompletní metodiku.
Proč jednička žebříčku není vaše nejlepší volba
O vašem skutečném vítězi rozhodují tři věci, které žebříček nevidí: doménová slovní zásoba (žargon, který obecné datasety nikdy neobsahují), velikost chunků (krátké versus dlouhé pasáže zvýhodňují různé modely) a jazyk dotazů. Proto je MTEB nástroj pro užší výběr, ne konečná odpověď. Pořadí vám říká, které modely připadají v úvahu, ne který sedí na vaše data.
Zde jsou faktory korpusu, které v praxi převrátí pořadí:
- Doménový posun: právní, lékařský text nebo text z kódu nese slovní zásobu, kterou MS MARCO nikdy nezahrnoval.
- Velikost chunků: model vyladěný na krátké pasáže může zakopnout na 800tokenových chuncích.
- Jazyk a styl dotazů: vícejazyčné dotazy nebo dotazy plné klíčových slov pořadí rychle zamíchají.
Podle našich zkušeností je spolehlivý postup nudný, ale funguje: použijte záložku vyhledávání MTEB k užšímu výběru 3–4 kandidátů a poté změřte Recall@10 a nDCG@10 na vlastních dokumentech. Náš přehled obecných nástrojů pro RAG pomůže s pipeline a pro strukturovaný způsob, jak vyhodnocovat modely na vlastních datech, tato recenze pokrývá vyhodnocovací stránku. Dva související články k uložení: spouštění embeddingových modelů lokálně s Ollama a srovnání Voyage vs OpenAI vs Cohere embeddingy.
MTEB vs MMTEB a proč se čísla neustále mění
MMTEB je vícejazyčná verze v2 rozšiřující MTEB (arXiv 2502.13595, v2 publikováno 8. dubna 2025). Přidává více než 500 komunitně řízených úloh napříč více než 250 jazyky, navíc vyhledávání dlouhých dokumentů, vyhledávání podle instrukcí a vyhledávání v kódu. Pokud je váš RAG pouze anglický, původní anglická záložka Retrieval MTEB je stále ta, kterou číst. MMTEB je nejdůležitější, když vaše dotazy a dokumenty zahrnují více jazyků.
A teď upřímná část. Čísla MTEB se rozcházejí mezi snapshoty i mezi verzemi článku: původní článek uvádí 56 datasetů v jedné verzi a 58 v jiné, takže nikdy nepovažujte jedno číslo za směrodatné. Pořadí se neustále přehazuje, jak přichází více než 5 000 přihlášení, takže vždy udělejte snímek žebříčku s datem, kdy jste ho četli. A pokud se stránka nenačte, Hugging Face Space běží na upgradované CPU a často je pomalý nebo nestabilní, není to vaše připojení.
Shrnutí
MTEB je nejlepší veřejný výchozí bod pro výběr embeddingového modelu, pokud ho čtete správně. Čtěte záložku vyhledávání, ne celkový průměr. Berte nDCG@10 0,4–0,7 jako normální. Udělejte užší výběr podle žebříčku a pak tento výběr otestujte na vlastním korpusu, protože model na 1. místě na reálných datech často prohraje (náš ano). Až budete připraveni vybrat, vraťte se na náš rozcestník embeddingových modelů pro kompletní benchmark a doporučení. A pokud je skutečným úkolem zapojit vybraný model do produkční pipeline, toto vyhodnocení formou užšího výběru a následného testu je součástí naší AI integrační práce.
O autorovi
Mert Batur Gurbuz je spoluzakladatelem Techsy.io, kde tým dodává AI agenty, automatizační systémy a hlasové/SDR pipeline pro B2B klienty. Studuje na University of Birmingham a píše o stacku nástrojů pro LLM, který tým Techsy skutečně používá v produkci.
Propojte se na LinkedIn.
Časté dotazy
Co je MTEB?
MTEB je Massive Text Embedding Benchmark, otevřená sada pro hodnocení toho, jak dobře si textové embeddingové modely vedou napříč 8 typy úloh, včetně vyhledávání, klasifikace a klastrování. Představili ho Muennighoff a kolegové v roce 2022 (arXiv 2210.07316) a je hostován jako veřejný žebříček na Hugging Face.
Co znamená MTEB?
MTEB znamená Massive Text Embedding Benchmark. Na názvu záleží, protože „massive“ odkazuje k šíři úloh a datasetů, ne k jednomu testu. Vaše MTEB skóre je ve skutečnosti průměr mnoha samostatných vyhodnocení, proto může celkové číslo skrývat slabá místa v úloze, na které vám záleží.
Které MTEB skóre je důležité pro RAG?
Pro RAG čtěte záložku Retrieval, hodnocenou nDCG@10, ne celkový průměr. RAG je sémantické vyhledávání nad vašimi dokumenty, což je přesně úloha vyhledávání, kterou žebříček měří. Model může mít silný celkový výsledek, a přitom být ve vyhledávání uprostřed pole, takže vyhledávání je spolehlivý signál.
Jaké je dobré MTEB skóre pro vyhledávání?
Reálné embeddingové modely typicky dosahují zero-shot nDCG@10 0,4–0,7, takže cokoli v tomto pásmu je normální a nasaditelné. 0,55 není varovný signál. Nikdo nedosahuje 1,0, protože dotazy jsou nejednoznačné a relevantní dokumenty se zřídka seřadí v dokonalém pořadí. Porovnávejte kandidáty mezi sebou, ne s dokonalou 1,0.
Co je nDCG@10?
nDCG@10 měří, jak dobře je seřazeno prvních 10 získaných výsledků. Skóre 1,0 znamená, že každý relevantní dokument je úplně nahoře; 0 znamená, že tam není žádný. Odměňuje umístění nejlepší odpovědi na první místo, což je důležité pro RAG, protože váš LLM čte jen prvních několik získaných chunků.
Jaký je rozdíl mezi MTEB a MMTEB (v1 vs v2)?
MMTEB je vícejazyčná verze v2 rozšiřující MTEB (arXiv 2502.13595, duben 2025). Rozšiřuje benchmark na více než 500 komunitně řízených úloh napříč více než 250 jazyky a přidává vyhledávání dlouhých dokumentů, instrukcí a kódu. Pokud je váš RAG pouze anglický, držte se původní anglické záložky Retrieval MTEB.
Proč se žebříček MTEB tak často mění (a proč se nenačítá)?
Pořadí se neustále přehazuje, protože nové modely jsou přihlašovány neustále, s více než 5 000 položkami a rostoucí. Březnový snapshot nebude odpovídat červencovému, takže vždy udělejte snímek žebříčku s datem. Pokud se stránka nenačítá, Hugging Face Space běží na upgradované CPU a často je pomalý nebo nestabilní.
Mám prostě vybrat model na 1. místě žebříčku MTEB?
Ne. Model na 1. místě je kandidát do užšího výběru, ne verdikt. Žebříček nevidí vaši doménovou slovní zásobu, velikost chunků ani jazyk dotazů, a to vše mění, který model vyhraje. Použijte záložku vyhledávání k užšímu výběru 3–4 modelů a poté testujte na svém korpusu. V našem testu byla veřejná jednička žebříčku na našem vlastním korpusu těsně překonána modelem, který na tomto žebříčku ani není, a vyrovnala se jí levnější varianta s vlastním hostováním.