
MTEB-score forklaret: Hvorfor #1-modellen ikke er dit bedste RAG-valg
Hugging Faces MTEB-leaderboard lister over 5.000 indsendelser af indbeddingsmodeller, og næsten hver uge sniger en ny sig ind på førstepladsen. Her er fælden: Den model, der ligger nummer 1, er sandsynligvis ikke den, du bør sende i produktion. Den MTEB-score, du stirrer på, er et gennemsnit på tværs af 8 forskellige opgavetyper, og kun én af dem forudsiger, hvor godt Retrieval-Augmented Generation (RAG) fungerer på dine dokumenter. Vi lærte dette på den hårde måde. I april 2026 tabte vores top-rangerede valg til en billigere model på vores eget korpus. Denne guide nedbryder, hvad tallene faktisk betyder, hvilken kolonne du kan stole på til RAG, og hvorfor leaderboardet er et udgangspunkt, ikke en dom.
Vigtigste pointer
- MTEB er en multi-opgave benchmark; overskriftens "samlede" score blander 8 opgavetyper til ét gennemsnit.
- Til RAG er det kun underfanen Retrieval (nDCG@10), der forudsiger produktionskvaliteten, ikke det samlede gennemsnit.
- Reelle indbeddingsmodeller scorer 0,4–0,7 i nDCG@10 zero-shot; 1,0 ville betyde perfekt rangering.
- Brug MTEB til at lave en shortlist, og test derefter på dit eget korpus. #1-modellen taber ofte.
Hvad er en MTEB-score?
MTEB står for Massive Text Embedding Benchmark, en åben, multi-opgave suite til scoring af tekst-indbeddingsmodeller. En MTEB-score er en metrik pr. opgave, der gennemsnittes til ét samlet tal på tværs af 8 opgavetyper. Den blev introduceret af Muennighoff og kolleger i 2022 (arXiv 2210.07316, publiceret ved EACL 2023).
Benchmarket eksisterer som et offentligt Hugging Face Space, hvor hvem som helst kan indsende en model. Det tal, de fleste citerer, er det "samlede gennemsnit", som blander retrieval, klassificering, klyngedannelse og fem andre opgavefamilier til én figur. Det er netop derfor, overskriftens rangering vildleder: En model kan vinde gennemsnittet ved at være stærk inden for klyngedannelse, mens den kun er middelgod til den ene opgave, dit produkt afhænger af. Den oprindelige artikel dækker 8 opgavetyper på tværs af cirka 58 datasæt og 112 sprog.
De 8 MTEB-opgavekategorier (og hvad hver score måler)
MTEB grupperer evaluering af indbeddings i 8 opgavetyper, og hver scores med en anden metrik. Så "en høj MTEB-score" betyder næsten intet, før du ved, hvilken opgave du læser. En score på 0,85 inden for klassificering (nøjagtighed) og 0,85 inden for retrieval (nDCG@10) beskriver helt forskellige evner.
Her er dekoder-tabellen, som ingen synes at publicere ordentligt. Metrikken ændres med opgaven:
| Opgavekategori | Hvad det tester | Metrik |
|---|---|---|
| Retrieval | At finde relevante dokumenter til en forespørgsel (dette er RAG) | nDCG@10 |
| Klassificering | Mærkning af tekst i kategorier | nøjagtighed (accuracy) |
| Klyngedannelse | Gruppering af lignende tekster | v-mål (v-measure) |
| Par-klassificering | Er to tekster et match? | gennemsnitlig præcision (average precision) |
| Omrangering | Omorganisering af kandidatresultater | MAP |
| STS (semantisk tekstlig lighed) | Hvor ensartede betydninger to sætninger har | Spearman-korrelation |
| Opsummering | Rangering af opsummeringskvalitet | Spearman-korrelation |
| Bitext-mining | Matching af oversættelser på tværs af sprog | F1 |
Kortet ovenfor over opgaver til metrikker er verificeret fra MTEB-artiklen (arXiv 2210.07316). Den vigtigste pointe: En model, der topper det samlede MTEB-gennemsnit, kan stadig være middelmådig til den enkelte opgave, dit produkt kører på.
Hvilken MTEB-score betyder faktisk noget for RAG?
Til RAG skal du ignorere det samlede gennemsnit og læse underfanen Retrieval, som scores med nDCG@10. RAG er semantisk søgning i dine dokumenter, hvilket er præcis retrieval-opgaven. STS er løst korreleret, men sekundær. En model kan vinde det samlede leaderboard, mens den rangerer i midten af feltet inden for retrieval, så det er retrieval-kolonnen, der forudsiger produktionskvaliteten.
Hvorfor vildleder det samlede blend? Retrieval-delsættet er bygget op omkring generelle web- og QA-datasæt som MS MARCO, Natural Questions og HotpotQA. En model, der skinner inden for klassificering, kan poste et flot gennemsnit, mens dens retrieval-tal halter. Åbn Hugging Face-leaderboardet (huggingface.co/spaces/mteb/leaderboard, accessed 2026-07-13) og filtrér til retrieval-fanen, før du sammenligner noget.
Hvis du scripter din egen evaluering, gælder det samme filter i koden:
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasksNår du har læst retrieval-kolonnen, er det næste spørgsmål, hvilken model du skal vælge. Vores hub-indlæg går igennem hvilken indbeddingsmodel du faktisk bør sende i produktion med de fulde benchmark-tal, og hvis du vælger, hvor disse vektorer skal bo, passer vores guide til de bedste vektordatabaser i 2026 godt til.
Hvad betyder en nDCG@10-score egentlig?
nDCG@10 måler, hvor godt de top 10 hentede resultater er rangeret. En score på 1,0 betyder, at hvert relevant dokument sidder helt i toppen; 0 betyder, at ingen af dem gør det. Reelle indbeddingsmodeller lander typisk omkring 0,4–0,7 zero-shot, så en score på 0,55 er normal, ikke defekt.
Tænk på det som at bedømme en søgefelt. Du er ligeglad med, om det rigtige svar dukker op først, ikke bare et sted, fordi din LLM kun læser de få øverste chunks, du fodrer den med. Ingen rammer 1,0, fordi forespørgsler er tvetydige, og relevante dokumenter sjældent stiller sig op i perfekt rækkefølge. Så hvis en nDCG@10 på 0,55 får dig til at gå i panik, så lad være; det er en normal, produktionsklar zero-shot-score, og båndet 0,4–0,7 er et typisk interval (bekræftet af zeroentropy.dev), ikke en fysisk lov.
Vi satte MTEB's #1 op mod vores eget RAG-korpus (og den vandt ikke)
Vi tog modellen, der toppede MTEB's engelske retrieval-fane, og kørte den mod seks andre på vores eget tekniske dokumentationskorpus på 10.000 dokumenter, scoret mod et manuelt mærket sæt på ca. 120 forespørgsler. Leaderboard-leaderen postede en stærk Recall@10, men den sluttede ikke først, og to billigere muligheder landede tæt nok på til at ændre beslutningen. Med kun ca. 120 forespørgsler skal du behandle disse som retningsgivende, ikke som et leaderboard.
MTEB's engelske leaderboard-leader i vores testvindue var Gemini Embedding 001 (den topper snapshotet fra apr. 2026); stillingen nedenfor kommer fra Hugging Face MTEB-boardet, og da tallene skifter efter snapshot, citerer vi vores med en dato:
| Model (dims) | MTEB engelsk placering (HF, 2026) | Vores korpus Recall@10 | Pris |
|---|---|---|---|
| Gemini Embedding 001 (3072) | topper den engelske retrieval-fane | 0,88 | ~$0,15/M |
| Voyage-4-large (1024) | ikke postet på det offentlige board | 0,89 | ~$0,12/M |
| Qwen3-Embedding-8B (self-host) | open-model leader | 0,87 | Kun GPU |
| text-embedding-3-large @1024 (trunkeret) | mellem-tier | 0,83 | ~$0,13/M |
To ting, som leaderboardet ikke fortalte os. For det første blev den offentlige #1 (Gemini) overhalet på vores korpus af Voyage-4-large, en model, der slet ikke poster på det board. For det andet kom en self-hosted open model (Qwen3-8B) inden for hårsbredde uden omkostninger per token, og OpenAI's trunkerede 1024-dim vektorer holdt en Recall@10 på 0,83 med 3x mindre lagring. MTEB rangerer retrieval på generel web- og QA-tekst; vores korpus har specialiseret teknisk vocabularium chunket på sin egen måde, så rækkefølgen ændrer sig. Det er hele argumentet for at teste på dine egne data. Vores gennemgang af hvordan man tester på sit eget RAG-korpus dækker eval-siden, og hub-indlægget indeholder den fulde metodologi.
Hvorfor leaderboardets #1 ikke er dit bedste valg
Tre ting, som leaderboardet ikke kan se, afgør din virkelige vinder: domæne-vocabularium (jargon, som de generelle datasæt aldrig indeholder), chunk-størrelse (korte versus lange passager favoriserer forskellige modeller) og forespørgselssprog. Det er derfor, MTEB er et værktøj til shortlisting, ikke et endeligt svar. Rangeringen fortæller dig, hvilke modeller der er plausible, ikke hvilken der passer til dine data.
Her er de korpusfaktorer, der vender en rangering i praksis:
- Domæneskift: Juridiske, medicinske eller kodebase-tekster bærer vocabularium, som MS MARCO aldrig har samplet.
- Chunk-størrelse: En model, der er finjusteret på korte passager, kan snuble over 800-token chunks.
- Forespørgselssprog og stil: Flersprogede eller søgeords-tunge forespørgsler ændrer hurtigt rækkefølgen.
I vores erfaring er det pålidelige workflow kedeligt, men det virker: Brug MTEB's retrieval-fane til at shortliste 3–4 kandidater, og mål derefter Recall@10 og nDCG@10 på dine egne dokumenter. Vores roundup af generelle RAG-værktøjer hjælper med pipeline'en, og for en struktureret måde at evaluere modeller på dine egne data på, dækker den anmeldelse eval-siden. To relaterede læsninger værd at bogmærke: kørsel af indbeddingsmodeller lokalt med Ollama, og en head-to-head af Voyage vs OpenAI vs Cohere embeddings.
MTEB vs MMTEB, og hvorfor tallene bliver ved med at ændre sig
MMTEB er den flersprogede v2-udvidelse af MTEB (arXiv 2502.13595, v2 publiceret 8. april 2025). Den tilføjer 500+ community-drevne opgaver på tværs af 250+ sprog samt long-document, instruction-following og code retrieval. Hvis din RAG er ren engelsk, er den oprindelige engelske MTEB retrieval-fane stadig den, du skal læse. MMTEB betyder mest, når dine forespørgsler og dokumenter spænder over flere sprog.
Her kommer den ærlige del. MTEB-tal konflikter på tværs af snapshots og endda på tværs af papirversioner: Den oprindelige artikel rapporterer 56 datasæt i én version og 58 i en anden, så behandl aldrig et enkelt tal som kanonisk. Rangeringerne ændrer sig konstant, efterhånden som 5.000+ indsendelser ankommer, så tag altid et screenshot af leaderboardet med den dato, du læser det. Og hvis siden ikke vil loade, kører Hugging Face Space'et på en CPU-opgradering og er ofte langsom eller ustabil, ikke din forbindelse.
Bundlinjen
MTEB er det bedste offentlige udgangspunkt for at vælge en indbeddingsmodel, når du læser det korrekt. Læs retrieval-fanen, ikke det samlede gennemsnit. Behandle en nDCG@10 på 0,4–0,7 som normal. Lav en shortlist med leaderboardet, og test derefter den shortlist på dit eget korpus, fordi #1-modellen ofte taber på rigtige data (det gjorde vores). Når du er klar til at vælge, så vend tilbage til vores hub for indbeddingsmodeller for det fulde benchmark og anbefalinger. Og hvis det egentlige job er at integrere den model, du vælger, i en produktionspipeline, er den evaluate-efter-shortlist-proces en del af vores AI-integrationsarbejde.
Om forfatteren
Mert Batur Gurbuz er medstifter af Techsy.io, hvor teamet leverer AI-agenter, automatiseringssystemer og voice/SDR-pipelines til B2B-kunder. Han studerer ved University of Birmingham og skriver om den LLM-tooling-stack, som Techsy-teamet faktisk bruger i produktion.
Forbind på LinkedIn.
Ofte stillede spørgsmål
Hvad er MTEB?
MTEB er Massive Text Embedding Benchmark, en åben suite til at score, hvor godt tekst-indbeddingsmodeller performer på tværs af 8 opgavetyper, herunder retrieval, klassificering og klyngedannelse. Introduceret af Muennighoff og kolleger i 2022 (arXiv 2210.07316), hostes det som et offentligt leaderboard på Hugging Face.
Hvad står MTEB for?
MTEB står for Massive Text Embedding Benchmark. Navnet betyder noget, fordi "massive" refererer til bredden af opgaver og datasæt, ikke en enkelt test. Din MTEB-score er virkelig et gennemsnit på tværs af mange separate evalueringer, hvilket er grunden til, at det samlede tal kan skjule svagheder på den opgave, du bekymrer dig om.
Hvilken MTEB-score betyder noget for RAG?
Til RAG skal du læse underfanen Retrieval, som scores med nDCG@10, ikke det samlede gennemsnit. RAG er semantisk søgning i dine dokumenter, hvilket er præcis den retrieval-opgave, leaderboardet måler. En model kan poste en stærk samlet score, mens den rangerer i midten af feltet inden for retrieval, så retrieval er det pålidelige signal.
Hvad er en god MTEB-retrieval-score?
Reelle indbeddingsmodeller scorer typisk 0,4–0,7 i nDCG@10 zero-shot, så alt i det bånd er normalt og klar til produktion. En score på 0,55 er ikke et advarselstegn. Ingen rammer 1,0, fordi forespørgsler er tvetydige, og relevante dokumenter sjældent stiller sig op i perfekt rækkefølge. Sammenlign kandidater med hinanden, ikke med en perfekt 1,0.
Hvad er nDCG@10?
nDCG@10 måler, hvor godt de top 10 hentede resultater er rangeret. En score på 1,0 betyder, at hvert relevant dokument sidder helt i toppen; 0 betyder, at ingen af dem gør det. Det belønner at placere det bedste svar først, hvilket betyder noget for RAG, fordi din LLM kun læser de få øverste chunks, du henter.
Hvad er forskellen mellem MTEB og MMTEB (v1 vs v2)?
MMTEB er den flersprogede v2-udvidelse af MTEB (arXiv 2502.13595, april 2025). Den udvider benchmarket til 500+ community-drevne opgaver på tværs af 250+ sprog og tilføjer long-document, instruction og code retrieval. Hvis din RAG er ren engelsk, så hold dig til den oprindelige engelske MTEB retrieval-fane.
Hvorfor ændrer MTEB-leaderboardet sig så ofte (og hvorfor vil det ikke loade)?
Rangeringerne ændrer sig konstant, fordi nye modeller indsendes hele tiden, med 5.000+ indlæg og voksende. Et snapshot fra marts vil ikke matche et fra juli, så tag altid et screenshot af leaderboardet med datoen. Hvis siden ikke vil loade, kører Hugging Face Space'et på en CPU-opgradering og er ofte langsom eller ustabil.
Skal jeg bare vælge #1-modellen på MTEB-leaderboardet?
Nej. #1-modellen er en shortlist-kandidat, ikke en dom. Leaderboardet kan ikke se dit domæne-vocabularium, chunk-størrelse eller forespørgselssprog, som alle ændrer, hvilken model der vinder. Brug retrieval-fanen til at shortliste 3–4 modeller, og test derefter på dit korpus. I vores test blev den offentlige leaderboard-#1 overhalet på vores eget korpus af en model, der slet ikke er på det board, og matchet af en billigere self-hosted mulighed.