
MTEB-score Uitgelegd: Waarom het #1-Model Niet Je Beste RAG-keuze Is
De Hugging Face MTEB-ranglijst telt 5.000+ ingezonden embedding-modellen, en bijna elke week schuift er weer een naar de topplek. Hier is de valkuil: dat #1-model is waarschijnlijk niet het model dat je moet inzetten. De MTEB-score die je ziet is een gemiddelde over 8 verschillende taaktypes, en maar één daarvan voorspelt hoe goed retrieval-augmented generation werkt op jouw documenten. Wij kwamen daar op de harde manier achter. In april 2026 verloor onze hoogst gerangschikte keuze van een goedkoper model op onze eigen dataset. Deze gids legt uit wat de cijfers echt betekenen, welke kolom je voor RAG kunt vertrouwen, en waarom de ranglijst een startpunt is, geen eindoordeel.
Belangrijkste Inzichten
- MTEB is een multi-task benchmark; de "overall"-score is een gemiddelde over 8 taaktypes.
- Voor RAG voorspelt alleen het Retrieval-tabblad (nDCG@10) de productiekwaliteit, niet het overall-gemiddelde.
- Echte embedding-modellen scoren 0.4–0.7 nDCG@10 zero-shot; 1.0 zou een perfecte rangschikking betekenen.
- Gebruik MTEB om te shortlisten, en test daarna op je eigen dataset. Het #1-model verliest vaak.
Wat Is een MTEB-score?
MTEB staat voor de Massive Text Embedding Benchmark, een open, multi-task suite voor het scoren van text-embedding-modellen. Een MTEB-score is een per-taak-metriek die wordt samengevoegd tot één overall cijfer over 8 taaktypes. De benchmark werd in 2022 geïntroduceerd door Muennighoff en collega's (arXiv 2210.07316, gepubliceerd op EACL 2023).
De benchmark draait als een publieke Hugging Face Space waar iedereen een model kan indienen. Het getal dat de meeste mensen citeren is het "overall gemiddelde," dat retrieval, classificatie, clustering en vijf andere taakfamilies samenvoegt tot één cijfer. Precies daarom is de koprangschikking misleidend: een model kan het gemiddelde winnen door sterk te zijn in clustering, terwijl het slechts middelmatig scoort op de ene taak waar jouw product van afhangt. Het oorspronkelijke paper omvat 8 taaktypes over ongeveer 58 datasets en 112 talen.
De 8 MTEB-taakcategorieën (en Wat Elke Score Meet)
MTEB groepeert embedding-evaluatie in 8 taaktypes, en elk wordt gescoord met een andere metriek. Dus "een hoge MTEB-score" betekent bijna niets totdat je weet welke taak je leest. Een 0.85 op classificatie (accuracy) en een 0.85 op retrieval (nDCG@10) beschrijven compleet verschillende vaardigheden.
Hier is de decodeertabel die niemand netjes lijkt te publiceren. De metriek verandert met de taak:
| Taakcategorie | Wat het test | Metriek |
|---|---|---|
| Retrieval | Relevante documenten vinden voor een query (dit is RAG) | nDCG@10 |
| Classificatie | Tekst labelen in categorieën | accuracy |
| Clustering | Vergelijkbare teksten groeperen | v-measure |
| Pair Classification | Zijn twee teksten een match? | average precision |
| Reranking | Kandidaatresultaten herordenen | MAP |
| STS (semantic textual similarity) | Hoe gelijk twee zinnen qua betekenis zijn | Spearman-correlatie |
| Summarization | Samenvattingskwaliteit rangschikken | Spearman-correlatie |
| Bitext mining | Vertalingen matchen tussen talen | F1 |
De taak-naar-metriek-koppeling hierboven is geverifieerd aan de hand van het MTEB-paper (arXiv 2210.07316). De belangrijkste conclusie: een model dat bovenaan het overall MTEB-gemiddelde staat, kan nog steeds middelmatig zijn op de ene taak waar jouw product op draait.
Welke MTEB-score Telt Echt voor RAG?
Voor RAG negeer je het overall-gemiddelde en lees je het Retrieval-tabblad, gescoord met nDCG@10. RAG is semantisch zoeken over jouw documenten, en dat is precies de retrieval-taak. STS correleert losjes maar is secundair. Een model kan de overall-ranglijst winnen terwijl het op retrieval in de middenmoot bungelt, dus de retrieval-kolom is degene die de productiekwaliteit voorspelt.
Waarom misleidt de overall-mix? De retrieval-subset is gebouwd op algemene web- en QA-datasets zoals MS MARCO, Natural Questions en HotpotQA. Een model dat uitblinkt in classificatie kan een prachtig gemiddelde neerzetten terwijl zijn retrieval-cijfer wegzakt. Open de Hugging Face-ranglijst (huggingface.co/spaces/mteb/leaderboard, geraadpleegd op 2026-07-13) en filter op het retrieval-tabblad voordat je iets vergelijkt.
Als je je eigen evaluatie scriptet, geldt hetzelfde filter in code:
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasksZodra je de retrieval-kolom hebt gelezen, is de volgende vraag welk model je kiest. Onze hubpost behandelt welk embedding-model je écht moet inzetten met alle benchmarkcijfers, en als je nog moet kiezen waar die vectors wonen, sluit onze gids over de beste vectordatabases in 2026 daarop aan.
Wat Betekent een nDCG@10-score Eigenlijk?
nDCG@10 meet hoe goed de top 10 opgehaalde resultaten zijn gerangschikt. Een score van 1.0 betekent dat elk relevant document helemaal bovenaan staat; 0 betekent dat geen enkele dat doet. Echte embedding-modellen landen zero-shot rond de 0.4–0.7, dus een 0.55 is normaal, niet kapot.
Zie het als het beoordelen van een zoekbalk. Het gaat erom of het juiste antwoord als eerste verschijnt, niet ergens verderop, want jouw LLM leest alleen de bovenste paar chunks die je aanlevert. Niemand haalt 1.0, want queries zijn ambigu en relevante documenten sluiten zelden perfect op elkaar aan. Dus als een nDCG@10 van 0.55 je paniek bezorgt: niet nodig, dat is een normale, verzendbare zero-shot-score, en de band 0.4–0.7 is een typisch bereik (bevestigd door zeroentropy.dev), geen natuurwet.
Wij Zetten het MTEB #1-model tegenover Onze Eigen RAG-dataset (en het Won Niet)
We namen het model dat bovenaan het Engelse MTEB retrieval-tabblad staat en lieten het het opnemen tegen zes andere modellen op onze eigen 10.000-documenten technische-documentatie-dataset, gescoord tegen een handmatig gelabelde set van ~120 queries. De koploper van de ranglijst behaalde een sterke Recall@10, maar eindigde niet op de eerste plek, en twee goedkopere opties zaten dicht genoeg in de buurt om de beslissing te veranderen. Met slechts ~120 queries zijn dit richtinggevende cijfers, geen ranglijst.
De koploper van de Engelse MTEB-ranglijst in ons testvenster was Gemini Embedding 001 (bovenaan de snapshot van april 2026); de stand hieronder komt van het Hugging Face MTEB-bord, en omdat de cijfers per snapshot verschuiven, noemen we de onze met een datum:
| Model (dims) | MTEB Engelse stand (HF, 2026) | Recall@10 op onze dataset | Kosten |
|---|---|---|---|
| Gemini Embedding 001 (3072) | bovenaan het Engelse retrieval-tabblad | 0.88 | ~$0.15/M |
| Voyage-4-large (1024) | niet op het publieke bord vermeld | 0.89 | ~$0.12/M |
| Qwen3-Embedding-8B (self-host) | koploper open modellen | 0.87 | alleen GPU |
| text-embedding-3-large @1024 (truncated) | middenmoot | 0.83 | ~$0.13/M |
Twee dingen die de ranglijst ons niet vertelde. Ten eerste werd de publieke #1 (Gemini) op onze dataset net verslagen door Voyage-4-large, een model dat niet eens op dat bord staat. Ten tweede kwam een self-hosted open model (Qwen3-8B) er rakelings dichtbij zonder kosten per token, en OpenAI's afgekapte 1024-dim vectors hielden 0.83 Recall@10 vast bij 3x kleinere opslag. MTEB rangschikt retrieval op algemene web- en QA-tekst; onze dataset bestaat uit gespecialiseerd technisch vocabulaire dat op zijn eigen manier is opgeknipt, dus de volgorde schudt om. Dat is precies het argument voor testen op je eigen data. Onze walkthrough over hoe je test op je eigen RAG-dataset behandelt de evaluatiekant, en de hubpost bevat de volledige methodologie.
Waarom de #1 op de Ranglijst Niet Je Beste Keuze Is
Drie dingen die de ranglijst niet ziet bepalen wie echt wint: domeinvocabulaire (jargon dat de algemene datasets nooit bevatten), chunkgrootte (korte versus lange passages bevoordelen verschillende modellen), en querytaal. Daarom is MTEB een shortlisting-tool, geen eindantwoord. De rang vertelt je welke modellen aannemelijk zijn, niet welke bij jouw data past.
Dit zijn de datasetfactoren die een rangschikking in de praktijk omgooien:
- Domeinverschuiving: juridische, medische of codebase-tekst bevat vocabulaire dat MS MARCO nooit heeft gezien.
- Chunkgrootte: een model dat is afgestemd op korte passages kan struikelen over chunks van 800 tokens.
- Querytaal en -stijl: meertalige of trefwoordzware queries husselen de volgorde snel om.
Uit onze ervaring is de betrouwbare werkwijze saai maar effectief: gebruik het MTEB retrieval-tabblad om 3-4 kandidaten te shortlisten, en meet daarna Recall@10 en nDCG@10 op je eigen documenten. Ons overzicht van algemene RAG-tools helpt met de pipeline, en voor een gestructureerde manier om modellen op je eigen data te evalueren behandelt die review de evaluatiekant. Twee gerelateerde leestips om te bookmarken: embedding-modellen lokaal draaien met Ollama, en een head-to-head van Voyage vs OpenAI vs Cohere embeddings.
MTEB vs MMTEB, en Waarom de Cijfers Blijven Veranderen
MMTEB is de meertalige v2-uitbreiding van MTEB (arXiv 2502.13595, v2 gepubliceerd op 8 april 2025). Het voegt 500+ community-taken toe over 250+ talen, plus long-document, instruction-following en code-retrieval. Als jouw RAG alleen Engels is, blijft het originele Engelse MTEB retrieval-tabblad de plek om te lezen. MMTEB is vooral belangrijk als jouw queries en documenten meerdere talen omspannen.
Hier is het eerlijke verhaal. MTEB-cijfers spreken elkaar tegen tussen snapshots en zelfs tussen paperversies: het oorspronkelijke paper noemt 56 datasets in de ene versie en 58 in de andere, dus behandel nooit één cijfer als definitief. Rangschikkingen husselen voortdurend om terwijl er 5.000+ inzendingen binnenkomen, dus maak altijd een screenshot van de ranglijst met de datum waarop je die las. En als de pagina niet laadt: de Hugging Face Space draait op een CPU-upgrade en is vaak traag of hapert, dat ligt niet aan jouw verbinding.
De Conclusie
MTEB is het beste publieke startpunt om een embedding-model te kiezen, zodra je het goed leest. Lees het retrieval-tabblad, niet het overall-gemiddelde. Behandel een nDCG@10 van 0.4–0.7 als normaal. Shortlist met de ranglijst, en test die shortlist daarna op je eigen dataset, want het #1-model verliest vaak op echte data (bij ons gebeurde dat ook). Zodra je klaar bent om te kiezen, ga dan terug naar onze embedding-modellen-hub voor de volledige benchmark en aanbevelingen. En als het echte werk is om het gekozen model in een productiepipeline te bouwen, hoort die shortlist-en-test-evaluatie bij ons AI-integratiewerk.
Over de Auteur
Mert Batur is Co-Founder van Techsy.io, waar het team AI-agents, automatiseringssystemen en voice/SDR-pipelines bouwt voor B2B-klanten. Hij schrijft over de LLM-tooling-stack die het Techsy-team daadwerkelijk in productie gebruikt.
Connect op LinkedIn.
Veelgestelde Vragen
Wat is MTEB?
MTEB is de Massive Text Embedding Benchmark, een open suite voor het scoren van hoe goed text-embedding-modellen presteren over 8 taaktypes, waaronder retrieval, classificatie en clustering. Geïntroduceerd door Muennighoff en collega's in 2022 (arXiv 2210.07316), en gehost als publieke ranglijst op Hugging Face.
Waarvoor staat MTEB?
MTEB staat voor Massive Text Embedding Benchmark. De naam is belangrijk omdat "massive" verwijst naar de breedte van taken en datasets, niet naar één enkele test. Jouw MTEB-score is eigenlijk een gemiddelde over veel losse evaluaties, en dat is waarom het overall-cijfer zwakke plekken kan verbergen op de taak waar het jou om gaat.
Welke MTEB-score telt voor RAG?
Voor RAG lees je het Retrieval-tabblad, gescoord met nDCG@10, niet het overall-gemiddelde. RAG is semantisch zoeken over jouw documenten, en dat is precies de retrieval-taak die de ranglijst meet. Een model kan een sterk overall-cijfer neerzetten terwijl het op retrieval in de middenmoot bungelt, dus retrieval is het betrouwbare signaal.
Wat is een goede MTEB retrieval-score?
Echte embedding-modellen scoren doorgaans 0.4–0.7 nDCG@10 zero-shot, dus alles in die band is normaal en verzendbaar. Een 0.55 is geen alarmsignaal. Niemand haalt 1.0, want queries zijn ambigu en relevante documenten sluiten zelden in perfecte volgorde op elkaar aan. Vergelijk kandidaten met elkaar, niet met een perfecte 1.0.
Wat is nDCG@10?
nDCG@10 meet hoe goed de top 10 opgehaalde resultaten zijn gerangschikt. Een score van 1.0 betekent dat elk relevant document helemaal bovenaan staat; 0 betekent dat geen enkele dat doet. Het beloont het als eerste tonen van het beste antwoord, wat belangrijk is voor RAG omdat jouw LLM alleen de bovenste paar chunks leest die je ophaalt.
Wat is het verschil tussen MTEB en MMTEB (v1 vs v2)?
MMTEB is de meertalige v2-uitbreiding van MTEB (arXiv 2502.13595, april 2025). Het laat de benchmark groeien tot 500+ community-taken over 250+ talen en voegt long-document, instruction en code-retrieval toe. Als jouw RAG alleen Engels is, blijf je bij het originele Engelse MTEB retrieval-tabblad.
Waarom verandert de MTEB-ranglijst zo vaak (en waarom laadt hij niet)?
Rangschikkingen husselen voortdurend om omdat er voortdurend nieuwe modellen worden ingezonden, met 5.000+ inzendingen en groeiend. Een snapshot van maart komt niet overeen met eentje van juli, dus maak altijd een screenshot van de ranglijst met de datum. Als de pagina niet laadt: de Hugging Face Space draait op een CPU-upgrade en hapert regelmatig of is traag.
Moet ik gewoon het #1-model op de MTEB-ranglijst kiezen?
Nee. Het #1-model is een shortlistkandidaat, geen eindoordeel. De ranglijst ziet jouw domeinvocabulaire, chunkgrootte of querytaal niet, en die bepalen allemaal welk model wint. Gebruik het retrieval-tabblad om 3-4 modellen te shortlisten, en test daarna op je eigen dataset. In onze test werd de publieke #1 op onze eigen dataset net verslagen door een model dat niet eens op dat bord staat, en geëvenaard door een goedkopere self-hosted optie.