
MTEB-poäng förklarat: varför etta på listan förlorade i vårt RAG-test
Hugging Face MTEB-listan innehåller över 5 000 inskickade embeddingmodeller, och nästan varje vecka klättrar en ny modell upp till toppen. Här är fällan: den där ettan är förmodligen inte modellen du ska släppa i produktion. MTEB-poängen du stirrar på är ett snitt över 8 olika uppgiftstyper, och bara en av dem förutsäger hur bra retrieval-augmented generation (RAG) fungerar på dina egna dokument. Vi lärde oss det på det hårda sättet: i april 2026 förlorade vår topplacerade modell mot ett billigare alternativ på vår egen korpus. Den här guiden går igenom vad siffrorna faktiskt betyder, vilken kolumn du ska lita på för RAG, och varför listan är en startpunkt - inte en dom.
Viktiga slutsatser
- MTEB är ett flerdelat benchmark; den övergripande "totalpoängen" blandar 8 uppgiftstyper till ett snitt.
- För RAG är det bara Retrieval-fliken (nDCG@10) som förutsäger produktionskvalitet, inte totalsnittet.
- Riktiga embeddingmodeller får 0.4-0.7 i nDCG@10 utan finjustering (zero-shot); 1.0 skulle betyda perfekt rankning.
- Använd MTEB för att göra ett urval, testa sedan på din egen korpus. Ettan förlorar ofta.
Vad är en MTEB-poäng?
MTEB står för Massive Text Embedding Benchmark, en öppen, flerdelad testsvit för att poängsätta text-embeddingmodeller. En MTEB-poäng är ett mått per uppgift som räknas samman till en totalsiffra över 8 uppgiftstyper. Den introducerades av Muennighoff och kollegor 2022 (arXiv 2210.07316, publicerad vid EACL 2023).
Benchmarken finns som ett publikt Hugging Face-space där vem som helst kan skicka in en modell. Siffran de flesta citerar är "totalsnittet", som blandar retrieval, klassificering, klustring och fem andra uppgiftsfamiljer till en enda siffra. Det är precis därför den övergripande rankningen kan lura dig: en modell kan vinna snittet genom att vara stark på klustring men bara medioker på just den uppgift din produkt är beroende av. Originalartikeln omfattar 8 uppgiftstyper över ungefär 58 datamängder och 112 språk.
De 8 MTEB-uppgiftskategorierna (och vad varje poäng mäter)
MTEB delar upp embedding-utvärdering i 8 uppgiftstyper, och var och en poängsätts med ett eget mått. Så "en hög MTEB-poäng" betyder nästan ingenting förrän du vet vilken uppgift du läser. Ett 0.85 på klassificering (accuracy) och ett 0.85 på retrieval (nDCG@10) beskriver helt olika förmågor.
Här är dekodertabellen som ingen verkar publicera på ett tydligt sätt. Måttet ändras med uppgiften:
| Uppgiftskategori | Vad den testar | Mått |
|---|---|---|
| Retrieval | Hitta relevanta dokument för en sökning (det här är RAG) | nDCG@10 |
| Klassificering | Märka text i kategorier | accuracy |
| Klustring | Gruppera liknande texter | v-measure |
| Pair Classification | Är två texter en matchning? | average precision |
| Reranking | Omordna kandidatresultat | MAP |
| STS (semantisk textlikhet) | Hur lika två meningar är i betydelse | Spearman-korrelation |
| Sammanfattning | Rangordna sammanfattningskvalitet | Spearman-korrelation |
| Bitext mining | Matcha översättningar mellan språk | F1 |
Kartläggningen ovan från uppgift till mått är verifierad mot MTEB-artikeln (arXiv 2210.07316). Den viktigaste slutsatsen: en modell som toppar MTEB-totalsnittet kan fortfarande vara medioker på just den uppgift din produkt kör.
Vilken MTEB-poäng spelar egentligen roll för RAG?
För RAG ska du strunta i totalsnittet och läsa fliken Retrieval, som poängsätts med nDCG@10. RAG är semantisk sökning i dina egna dokument, vilket är exakt vad retrieval-uppgiften testar. STS korrelerar löst men är sekundärt. En modell kan vinna hela listan samtidigt som den hamnar i mittenskiktet på retrieval, så det är retrieval-kolumnen som förutsäger produktionskvalitet.
Varför lurar totalsnittet dig? Retrieval-delmängden är byggd på allmänna webb- och QA-datamängder som MS MARCO, Natural Questions och HotpotQA. En modell som glänser på klassificering kan få ett strålande snitt medan retrieval-siffran halkar efter. Öppna Hugging Face-listan (huggingface.co/spaces/mteb/leaderboard, besökt 2026-07-13) och filtrera till retrieval-fliken innan du jämför något alls.
Skriver du ditt eget utvärderingsskript gäller samma filter i kod:
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasksNär du har läst retrieval-kolumnen är nästa fråga vilken modell du ska välja. Vårt hubbinlägg går igenom vilken embeddingmodell du faktiskt bör välja med alla benchmarksiffror, och väljer du var vektorerna ska bo passar vår guide till de bästa vektordatabaserna 2026 bra ihop med den.
Vad betyder egentligen en nDCG@10-poäng?
nDCG@10 mäter hur väl de 10 bästa träffarna är rankade. En poäng på 1.0 skulle betyda att varje relevant dokument ligger allra högst upp; 0 betyder att inget av dem gör det. Riktiga embeddingmodeller hamnar runt 0.4-0.7 utan finjustering (zero-shot), så ett värde på 0.55 är normalt, inte trasigt.
Tänk på det som att betygsätta en sökruta. Det som spelar roll är om rätt svar dyker upp först, inte bara någonstans, eftersom din LLM bara läser de första chunkarna du matar den med. Ingen når 1.0, eftersom sökningar är tvetydiga och relevanta dokument sällan hamnar i perfekt ordning. Så om en nDCG@10 på 0.55 får dig att gå i panik - lugn, det är en normal, gångbar zero-shot-poäng, och intervallet 0.4-0.7 är ett typiskt spann (bekräftat av zeroentropy.dev), inte en naturlag.
Vi ställde MTEB-ettan mot vår egen RAG-korpus (och den vann inte)
Vi tog modellen som toppar den engelska MTEB-retrievalfliken och körde den mot sex andra på vår egen 10 000-dokument stora tekniska korpus, poängsatt mot en handmärkt uppsättning på ~120 sökfrågor. Listettan levererade en stark Recall@10, men slutade inte etta, och två billigare alternativ låg tillräckligt nära för att ändra beslutet. Med bara ~120 sökfrågor bör detta ses som vägledande, inte en topplista.
Ettan på den engelska MTEB-listan i vårt testfönster var Gemini Embedding 001 (den toppar ögonblicksbilden från april 2026); ställningen nedan kommer från Hugging Face MTEB-listan, och eftersom siffrorna skiftar mellan ögonblicksbilder anger vi ett datum för våra:
| Modell (dimensioner) | Position på engelska MTEB (HF, 2026) | Vår korpus Recall@10 | Kostnad |
|---|---|---|---|
| Gemini Embedding 001 (3072) | toppar den engelska retrieval-fliken | 0.88 | ~$0.15/M |
| Voyage-4-large (1024) | postas inte till den publika listan | 0.89 | ~$0.12/M |
| Qwen3-Embedding-8B (självhostad) | ledande öppen modell | 0.87 | Endast GPU |
| text-embedding-3-large @1024 (trunkerad) | mellanskikt | 0.83 | ~$0.13/M |
Två saker listan inte berättade för oss. För det första: den publika ettan (Gemini) knappades av Voyage-4-large på vår korpus - en modell som inte ens postas till den listan. För det andra: en självhostad öppen modell (Qwen3-8B) kom nästan lika bra utan någon kostnad per token, och OpenAIs trunkerade 1024-dimensionella vektorer höll 0.83 i Recall@10 med 3x mindre lagring. MTEB rankar retrieval på allmän webb- och QA-text; vår korpus är specialiserat tekniskt vokabulär chunkat på sitt eget sätt, så ordningen kastas om. Det är hela argumentet för att testa på egen data. Vår genomgång av hur du testar på din egen RAG-korpus täcker utvärderingssidan, och hubbinlägget har hela metodiken.
Varför listans etta inte är ditt bästa val
Tre saker listan inte kan se avgör din riktiga vinnare: domänvokabulär (jargong de allmänna datamängderna aldrig innehåller), chunk-storlek (korta kontra långa textstycken gynnar olika modeller), och sökspråk. Det är därför MTEB är ett urvalsverktyg, inte ett slutgiltigt svar. Placeringen visar vilka modeller som är rimliga, inte vilken som passar din data.
Här är korpusfaktorerna som i praktiken kastar om en rankning:
- Domänskifte: juridisk text, medicinsk text eller kodbastext bär vokabulär MS MARCO aldrig samplade.
- Chunk-storlek: en modell finjusterad på korta textstycken kan snubbla på 800-token-chunkar.
- Sökspråk och -stil: flerspråkiga eller nyckelordstunga sökningar kastar snabbt om ordningen.
Enligt vår erfarenhet är det tråkiga arbetsflödet det pålitliga: använd MTEB:s retrieval-flik för att göra ett urval på 3-4 kandidater, mät sedan Recall@10 och nDCG@10 på dina egna dokument. Vår översikt över allmänna RAG-verktyg hjälper med pipelinen, och för ett strukturerat sätt att utvärdera modeller på din egen data täcker den recensionen utvärderingssidan. Två relaterade läsningar värda att spara: att köra embeddingmodeller lokalt med Ollama, och en jämförelse mellan Voyage, OpenAI och Cohere embeddings.
MTEB vs MMTEB, och varför siffrorna hela tiden ändras
MMTEB är MTEB:s flerspråkiga v2-utökning (arXiv 2502.13595, v2 publicerad 8 april 2025). Den lägger till 500+ community-drivna uppgifter över 250+ språk, plus retrieval för långa dokument, instruktionsföljande och kod. Är din RAG bara på engelska är det fortfarande den ursprungliga engelska MTEB-retrievalfliken du ska läsa. MMTEB spelar störst roll när dina sökningar och dokument sträcker sig över flera språk.
Här kommer den ärliga delen. MTEB-siffror skiljer sig mellan ögonblicksbilder och till och med mellan artikelversioner: originalartikeln anger 56 datamängder i en version och 58 i en annan, så behandla aldrig en enskild siffra som facit. Rankningarna kastas ständigt om i takt med att 5 000+ inskickningar strömmar in, så ta alltid en skärmdump av listan tillsammans med datumet du läste den. Och laddar sidan inte - Hugging Face Space kör på en CPU-uppgradering och är ofta seg eller opålitlig, inte din uppkoppling.
Slutsatsen
MTEB är den bästa publika startpunkten för att välja embeddingmodell, så länge du läser den rätt. Läs retrieval-fliken, inte totalsnittet. Behandla en nDCG@10 på 0.4-0.7 som normalt. Gör ett urval med listan, testa sedan det urvalet på din egen korpus, för ettan förlorar ofta på riktig data (det gjorde vår). När du är redo att välja, gå tillbaka till vårt embeddingmodell-hubbinlägg för hela benchmarken och rekommendationerna. Och om det verkliga jobbet är att koppla in modellen du väljer i en produktionspipeline, är den där urval-sedan-test-utvärderingen en del av vårt AI-integrationsarbete.
Om författaren
Mert Batur är medgrundare av Techsy.io, där teamet bygger AI-agenter, automationssystem och röst-/SDR-pipelines för B2B-kunder. Han skriver om det LLM-verktygsstack Techsy-teamet faktiskt använder i produktion.
Anslut på LinkedIn.
Vanliga frågor
Vad är MTEB?
MTEB är Massive Text Embedding Benchmark, en öppen testsvit för att poängsätta hur väl text-embeddingmodeller presterar över 8 uppgiftstyper, inklusive retrieval, klassificering och klustring. Introducerad av Muennighoff och kollegor 2022 (arXiv 2210.07316), och den finns som en publik lista på Hugging Face.
Vad står MTEB för?
MTEB står för Massive Text Embedding Benchmark. Namnet spelar roll eftersom "massive" syftar på bredden av uppgifter och datamängder, inte ett enda test. Din MTEB-poäng är egentligen ett snitt över många separata utvärderingar, vilket är varför totalsiffran kan dölja svaga punkter på just den uppgift du bryr dig om.
Vilken MTEB-poäng spelar roll för RAG?
För RAG ska du läsa fliken Retrieval, som poängsätts med nDCG@10, inte totalsnittet. RAG är semantisk sökning i dina egna dokument, vilket är exakt den uppgift retrieval-fliken mäter. En modell kan få en stark totalpoäng samtidigt som den hamnar i mittenskiktet på retrieval, så retrieval är den pålitliga signalen.
Vad är en bra MTEB-retrievalpoäng?
Riktiga embeddingmodeller får vanligtvis 0.4-0.7 i nDCG@10 utan finjustering (zero-shot), så allt inom det spannet är normalt och gångbart. Ett värde på 0.55 är ingen varningssignal. Ingen når 1.0, eftersom sökningar är tvetydiga och relevanta dokument sällan hamnar i perfekt ordning. Jämför kandidater mot varandra, inte mot ett perfekt 1.0.
Vad är nDCG@10?
nDCG@10 mäter hur väl de 10 bästa träffarna är rankade. En poäng på 1.0 skulle betyda att varje relevant dokument ligger allra högst upp; 0 betyder att inget gör det. Måttet belönar att lägga det bästa svaret först, vilket spelar roll för RAG eftersom din LLM bara läser de första chunkarna du hämtar.
Vad är skillnaden mellan MTEB och MMTEB (v1 kontra v2)?
MMTEB är MTEB:s flerspråkiga v2-utökning (arXiv 2502.13595, april 2025). Den utökar benchmarken till 500+ community-drivna uppgifter över 250+ språk och lägger till retrieval för långa dokument, instruktioner och kod. Är din RAG bara på engelska, håll dig till den ursprungliga engelska MTEB-retrievalfliken.
Varför ändras MTEB-listan så ofta (och varför laddar den inte)?
Rankningarna kastas ständigt om eftersom nya modeller skickas in hela tiden, med 5 000+ poster och räknar uppåt. En ögonblicksbild från mars matchar inte en från juli, så ta alltid en skärmdump av listan tillsammans med datumet. Laddar sidan inte, kör Hugging Face Space på en CPU-uppgradering och är ofta seg eller opålitlig.
Ska jag bara välja ettan på MTEB-listan?
Nej. Ettan är en urvalskandidat, inte en dom. Listan kan inte se din domänvokabulär, chunk-storlek eller sökspråk - allt sådant som avgör vilken modell som vinner. Använd retrieval-fliken för att göra ett urval på 3-4 modeller, testa sedan på din egen korpus. I vårt test knappades den publika listettan av en modell som inte ens finns på den listan, och matchades av ett billigare självhostat alternativ.