
Hugging Face sin MTEB-rangering lister over 5000 innsendte embedding-modeller, og nesten hver uke klatrer en ny modell til toppen. Her er fellen: den modellen på førsteplass er sannsynligvis ikke den du bør sette i produksjon. MTEB-scoren du stirrer på, er et gjennomsnitt av 8 ulike oppgavetyper, og bare én av dem sier noe om hvor godt retrieval-augmented generation fungerer på dine egne dokumenter. Vi lærte dette på den harde måten. I april 2026 tapte vår toppvalgte modell mot en billigere modell på vårt eget korpus. Denne guiden går gjennom hva tallene faktisk betyr, hvilken kolonne du bør stole på for RAG, og hvorfor rangeringen er et utgangspunkt, ikke en fasit.
Nøkkelpunkter
- MTEB er en multi-task-benchmark; den overordnede "totalscoren" blander 8 oppgavetyper inn i ett gjennomsnitt.
- For RAG er det bare Retrieval-fanen (nDCG@10) som sier noe om produksjonskvalitet – ikke totalscoren.
- Ekte embedding-modeller scorer 0.4–0.7 i nDCG@10 zero-shot; 1.0 ville betydd perfekt rangering.
- Bruk MTEB til å lage en shortlist, og test deretter på ditt eget korpus. Modell nr. 1 taper ofte.
Hva er en MTEB-score?
MTEB står for Massive Text Embedding Benchmark, en åpen, flerdelt testsuite for å score embedding-modeller for tekst. En MTEB-score er en per-oppgave-metrikk som gjennomsnittes til ett samlet tall på tvers av 8 oppgavetyper. Den ble introdusert av Muennighoff og kolleger i 2022 (arXiv 2210.07316, publisert på EACL 2023).
Benchmarken ligger som et offentlig Hugging Face-space der hvem som helst kan sende inn en modell. Tallet folk flest siterer, er "totalgjennomsnittet", som blander retrieval, klassifisering, klynging og fem andre oppgavefamilier inn i ett tall. Nettopp derfor villeder toppplasseringen: en modell kan vinne gjennomsnittet ved å være sterk på klynging, mens den bare er middels på den ene oppgaven produktet ditt faktisk er avhengig av. Den originale artikkelen dekker 8 oppgavetyper på tvers av omtrent 58 datasett og 112 språk.
De 8 MTEB-oppgavekategoriene (og hva hver score faktisk måler)
MTEB grupperer embedding-evaluering i 8 oppgavetyper, og hver av dem scores med en annen metrikk. Så "en høy MTEB-score" betyr nesten ingenting før du vet hvilken oppgave du leser tallet fra. En 0.85 på klassifisering (nøyaktighet) og en 0.85 på retrieval (nDCG@10) beskriver to helt forskjellige evner.
Her er dekode-tabellen ingen ser ut til å publisere ordentlig. Metrikken endrer seg med oppgaven:
| Oppgavekategori | Hva den måler | Metrikk |
|---|---|---|
| Retrieval | Finner relevante dokumenter for et søk (dette er RAG) | nDCG@10 |
| Classification | Merker tekst med kategorier | nøyaktighet |
| Clustering | Grupperer lignende tekster | v-measure |
| Pair Classification | Er to tekster en match? | gjennomsnittlig presisjon |
| Reranking | Omrangerer kandidatresultater | MAP |
| STS (semantisk tekstlikhet) | Hvor like to setninger er i betydning | Spearman-korrelasjon |
| Summarization | Rangerer sammendragskvalitet | Spearman-korrelasjon |
| Bitext mining | Matcher oversettelser på tvers av språk | F1 |
Oppgave-til-metrikk-kartet over er verifisert mot MTEB-artikkelen (arXiv 2210.07316). Det ene du bør ta med deg: en modell som topper det totale MTEB-gjennomsnittet, kan likevel være middelmådig på den ene oppgaven produktet ditt faktisk kjører på.
Hvilken MTEB-score betyr egentlig noe for RAG?
For RAG kan du se bort fra totalgjennomsnittet og heller lese Retrieval-fanen, scoret med nDCG@10. RAG er semantisk søk over dine egne dokumenter, og det er nøyaktig det retrieval-oppgaven måler. STS henger løst sammen med dette, men er sekundært. En modell kan vinne den totale rangeringen mens den havner midt på treet i retrieval, så det er retrieval-kolonnen som faktisk sier noe om produksjonskvalitet.
Hvorfor villeder totalblandingen? Retrieval-delsettet er bygget på generelle web- og QA-datasett som MS MARCO, Natural Questions og HotpotQA. En modell som utmerker seg på klassifisering, kan levere et flott gjennomsnitt mens retrieval-tallet henger etter. Åpne Hugging Face-rangeringen (huggingface.co/spaces/mteb/leaderboard, besøkt 2026-07-13) og filtrer til retrieval-fanen før du sammenligner noe som helst.
Skal du skripte din egen evaluering, gjelder samme filter i kode:
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasksNår du har lest retrieval-kolonnen, er neste spørsmål hvilken modell du bør velge. Hub-innlegget vårt går gjennom hvilken embedding-modell du faktisk bør sette i produksjon med de fulle benchmark-tallene, og hvis du samtidig skal velge hvor disse vektorene skal bo, passer guiden vår til de beste vektordatabasene i 2026 godt sammen med det.
Hva betyr en nDCG@10-score egentlig?
nDCG@10 måler hvor godt de 10 øverste treffene er rangert. En score på 1.0 betyr at alle relevante dokumenter ligger helt øverst; 0 betyr at ingen av dem gjør det. Ekte embedding-modeller havner rundt 0.4–0.7 zero-shot, så en 0.55 er normalt, ikke ødelagt.
Tenk på det som å karaktersette en søkeboks. Det som betyr noe, er om riktig svar dukker opp først, ikke bare et sted, fordi LLM-en din bare leser de øverste bitene den får servert. Ingen treffer 1.0, fordi søk er tvetydige og relevante dokumenter sjelden havner i perfekt rekkefølge. Så hvis en nDCG@10 på 0.55 får deg til å få panikk, la være; det er en normal score du trygt kan sette i produksjon, og 0.4–0.7-båndet er et typisk intervall (bekreftet av zeroentropy.dev), ikke en naturlov.
Vi satte MTEB nr. 1 opp mot vårt eget RAG-korpus (og den vant ikke)
Vi tok modellen som topper den engelske MTEB-retrieval-fanen, og kjørte den mot seks andre på vårt eget 10 000-dokument-korpus med teknisk dokumentasjon, scoret mot et håndmerket sett på rundt 120 søk. Rangeringslederen leverte en solid Recall@10, men endte ikke først, og to billigere alternativer lå tett nok til å snu beslutningen. Med bare rundt 120 søk bør du se på dette som en pekepinn, ikke en rangering.
Lederen på den engelske MTEB-rangeringen i vårt testvindu var Gemini Embedding 001 (den topper april 2026-øyeblikksbildet); tallene under er hentet fra Hugging Face sin MTEB-tavle, og siden tallene endrer seg fra øyeblikksbilde til øyeblikksbilde, oppgir vi våre egne med en dato:
| Modell (dimensjoner) | Plassering på engelsk MTEB (HF, 2026) | Recall@10 på vårt korpus | Kostnad |
|---|---|---|---|
| Gemini Embedding 001 (3072) | topper den engelske retrieval-fanen | 0.88 | ~$0.15/M |
| Voyage-4-large (1024) | ikke publisert på den offentlige tavlen | 0.89 | ~$0.12/M |
| Qwen3-Embedding-8B (selvhostet) | leder blant åpne modeller | 0.87 | Kun GPU |
| text-embedding-3-large @1024 (kuttet) | midt på treet | 0.83 | ~$0.13/M |
To ting rangeringen ikke fortalte oss. For det første ble den offentlige nr. 1 (Gemini) forbigått på vårt korpus av Voyage-4-large, en modell som ikke engang er publisert på den tavlen. For det andre kom en selvhostet, åpen modell (Qwen3-8B) nesten like langt uten noen kostnad per token, og OpenAIs kuttede 1024-dimensjonale vektorer holdt 0.83 i Recall@10 med 3x mindre lagringsplass. MTEB rangerer retrieval på generell web- og QA-tekst; vårt korpus er spesialisert teknisk vokabular delt opp på sin egen måte, så rekkefølgen snus om. Det er hele poenget med å teste på egne data. Gjennomgangen vår om hvordan du tester på ditt eget RAG-korpus dekker evalueringsdelen, og hub-innlegget har hele metodikken.
Hvorfor nr. 1 på rangeringen ikke er ditt beste valg
Tre ting rangeringen ikke kan se, avgjør hvem som faktisk vinner hos deg: domenevokabular (sjargong de generelle datasettene aldri inneholder), chunk-størrelse (korte versus lange passasjer favoriserer forskjellige modeller) og søkespråk. Det er derfor MTEB er et shortlisting-verktøy, ikke et endelig svar. Rangeringen forteller deg hvilke modeller som er plausible, ikke hvilken som passer dine data.
Her er korpusfaktorene som i praksis snur en rangering på hodet:
- Domeneskifte: juridisk, medisinsk eller kode-tekst inneholder vokabular MS MARCO aldri har samplet.
- Chunk-størrelse: en modell trent på korte passasjer kan snuble på 800-token-chunker.
- Søkespråk og -stil: flerspråklige eller nøkkelordtunge søk snur rekkefølgen raskt.
Etter vår erfaring er den pålitelige arbeidsflyten kjedelig, men den virker: bruk MTEB sin retrieval-fane til å lage en shortlist på 3–4 kandidater, og mål deretter Recall@10 og nDCG@10 på dine egne dokumenter. Oversikten vår over generelle RAG-verktøy hjelper med selve pipelinen, og for en strukturert måte å evaluere modeller på egne data på, dekker den anmeldelsen evalueringsdelen. To relaterte artikler verdt å lagre: hvordan kjøre embedding-modeller lokalt med Ollama, og en direkte sammenligning av Voyage, OpenAI og Cohere sine embeddings.
MTEB vs. MMTEB, og hvorfor tallene stadig endrer seg
MMTEB er den flerspråklige v2-utvidelsen av MTEB (arXiv 2502.13595, v2 publisert 8. april 2025). Den legger til over 500 fellesskapsdrevne oppgaver på tvers av over 250 språk, pluss lange dokumenter, instruksjonsfølging og kode-retrieval. Er RAG-en din bare på engelsk, er den originale engelske MTEB-retrieval-fanen fortsatt den du bør lese. MMTEB betyr mest når søkene og dokumentene dine strekker seg over flere språk.
Her kommer den ærlige delen. MTEB-tallene spriker på tvers av øyeblikksbilder og til og med på tvers av artikkelversjoner: originalartikkelen oppgir 56 datasett i én versjon og 58 i en annen, så du bør aldri behandle ett enkelt tall som fasit. Rangeringene snus stadig om ettersom over 5000 innsendinger strømmer inn, så ta alltid et skjermbilde av rangeringen med datoen du leste den. Og hvis siden ikke laster, kjører Hugging Face-spacet på en CPU-oppgradering og er ofte treg eller ustabil – det er ikke din nettforbindelse.
Konklusjonen
MTEB er det beste offentlige utgangspunktet for å velge embedding-modell, så lenge du leser den riktig. Les retrieval-fanen, ikke totalgjennomsnittet. Behandle en nDCG@10 på 0.4–0.7 som normalt. Lag en shortlist med rangeringen, og test så den shortlisten på ditt eget korpus, for modell nr. 1 taper ofte på ekte data (det gjorde vår). Når du er klar til å velge, kan du gå tilbake til embedding-modell-hubben vår for de fulle benchmark-tallene og anbefalingene. Og hvis den egentlige jobben er å koble modellen du velger inn i en produksjonspipeline, er nettopp den shortlist-så-test-evalueringen en del av vårt AI-integrasjonsarbeid.
Om forfatteren
Mert Batur er medgründer av Techsy.io, der teamet leverer AI-agenter, automatiseringssystemer og tale-/SDR-pipeliner for B2B-kunder. Han skriver om LLM-verktøystakken Techsy-teamet faktisk bruker i produksjon.
Ta kontakt på LinkedIn.
Ofte stilte spørsmål
Hva er MTEB?
MTEB er Massive Text Embedding Benchmark, en åpen testsuite for å score hvor godt embedding-modeller for tekst presterer på tvers av 8 oppgavetyper, blant annet retrieval, klassifisering og klynging. Introdusert av Muennighoff og kolleger i 2022 (arXiv 2210.07316), og driftes som en offentlig rangering på Hugging Face.
Hva står MTEB for?
MTEB står for Massive Text Embedding Benchmark. Navnet er viktig fordi "massive" viser til bredden av oppgaver og datasett, ikke én enkelt test. MTEB-scoren din er egentlig et gjennomsnitt av mange separate evalueringer, og det er derfor totaltallet kan skjule svake punkter på akkurat den oppgaven du bryr deg om.
Hvilken MTEB-score betyr noe for RAG?
For RAG bør du lese Retrieval-fanen, scoret med nDCG@10, ikke totalgjennomsnittet. RAG er semantisk søk over dine egne dokumenter, og det er nøyaktig det retrieval-oppgaven på rangeringen måler. En modell kan ha en sterk totalscore mens den havner midt på treet i retrieval, så retrieval er det pålitelige signalet.
Hva er en god MTEB-retrieval-score?
Ekte embedding-modeller scorer typisk 0.4–0.7 i nDCG@10 zero-shot, så alt i det området er normalt og trygt å sette i produksjon. En 0.55 er ikke et faresignal. Ingen treffer 1.0, fordi søk er tvetydige og relevante dokumenter sjelden havner i perfekt rekkefølge. Sammenlign kandidatene mot hverandre, ikke mot en perfekt 1.0.
Hva er nDCG@10?
nDCG@10 måler hvor godt de 10 øverste treffene er rangert. En score på 1.0 betyr at alle relevante dokumenter ligger helt øverst; 0 betyr at ingen av dem gjør det. Metrikken belønner at det beste svaret kommer først, noe som betyr mye for RAG fordi LLM-en din bare leser de øverste bitene den henter.
Hva er forskjellen mellom MTEB og MMTEB (v1 vs. v2)?
MMTEB er den flerspråklige v2-utvidelsen av MTEB (arXiv 2502.13595, april 2025). Den utvider benchmarken til over 500 fellesskapsdrevne oppgaver på tvers av over 250 språk, og legger til lange dokumenter, instruksjoner og kode-retrieval. Er RAG-en din bare på engelsk, hold deg til den originale engelske MTEB-retrieval-fanen.
Hvorfor endrer MTEB-rangeringen seg så ofte (og hvorfor vil den ikke laste)?
Rangeringene snus stadig om fordi nye modeller sendes inn hele tiden, med over 5000 innslag og flere kommer til. Et øyeblikksbilde fra mars matcher ikke et fra juli, så ta alltid et skjermbilde av rangeringen med datoen. Hvis siden ikke laster, kjører Hugging Face-spacet på en CPU-oppgradering og er ofte treg eller ustabil.
Bør jeg bare velge modell nr. 1 på MTEB-rangeringen?
Nei. Modell nr. 1 er en shortlist-kandidat, ikke en fasit. Rangeringen kan ikke se domenevokabularet, chunk-størrelsen eller søkespråket ditt, og alt dette avgjør hvilken modell som faktisk vinner. Bruk retrieval-fanen til å lage en shortlist på 3–4 modeller, og test dem så på ditt eget korpus. I vår test ble den offentlige nr. 1 forbigått på vårt korpus av en modell som ikke engang er på den tavlen, og matchet av et billigere, selvhostet alternativ.