
Scorul MTEB explicat: De ce modelul #1 nu este cea mai bună alegere pentru RAG
Clasamentul Hugging Face MTEB listează peste 5.000 de submiteri de modele de embedding, iar aproape în fiecare săptămână un nou model urcă pe primul loc. Iată capcana: acel model de pe locul #1 probabil nu este cel pe care ar trebui să îl implementezi în producție. Scorul MTEB pe care îl vezi este o medie calculată pe 8 tipuri diferite de sarcini, iar doar una dintre ele prezice cât de bine funcționează generarea augmentată prin regăsire (RAG) pe documentele tale. Am învățat acest lucru pe pielea noastră. În aprilie 2026, alegerea noastră clasată pe primul loc a fost depășită de un model mai ieftin pe propriul nostru corpus. Acest ghid explică ce înseamnă cu adevărat cifrele, ce coloană merită încredere pentru RAG și de ce clasamentul este un punct de plecare, nu un verdict final.
Idei principale
- MTEB este un benchmark multi-sarcină; scorul „general” combină 8 tipuri de sarcini într-o singură medie.
- Pentru RAG, doar sub-tab-ul Retrieval (nDCG@10) prezice calitatea în producție, nu media generală.
- Modelele reale de embedding obțin scoruri nDCG@10 zero-shot între 0,4–0,7; 1,0 ar însemna o clasare perfectă.
- Folosește MTEB pentru a face o listă scurtă, apoi testează pe propriul corpus. Modelul #1 pierde adesea.
Ce este un scor MTEB?
MTEB înseamnă Massive Text Embedding Benchmark, o suită open-source, multi-sarcină, pentru evaluarea modelelor de embedding de text. Un scor MTEB este o metrică per-sarcină, mediată într-un singur număr general across 8 tipuri de sarcini. A fost introdus de Muennighoff și colegii săi în 2022 (arXiv 2210.07316, publicat la EACL 2023).
Benchmark-ul există ca un spațiu public Hugging Face unde oricine poate submita un model. Numărul citat cel mai des este „media generală”, care combină regăsirea, clasificarea, clustering-ul și alte cinci familii de sarcini într-o singură cifră. Exact de aici provine confuzia clasamentului principal: un model poate câștiga la medie fiind puternic la clustering, dar mediocru la singura sarcină de care depinde produsul tău. Lucrarea originală acoperă 8 tipuri de sarcini pe aproximativ 58 de dataset-uri și 112 limbi.
Cele 8 categorii de sarcini MTEB (și ce măsoară fiecare scor)
MTEB grupează evaluarea embedding-urilor în 8 tipuri de sarcini, fiecare fiind scorată printr-o metrică diferită. Astfel, „un scor MTEB mare” nu înseamnă aproape nimic până nu știi exact ce sarcini citești. Un 0,85 la clasificare (acuratețe) și un 0,85 la regăsire (nDCG@10) descriu abilități complet diferite.
Iată tabelul decodor pe care puțini îl publică clar. Metrica se schimbă în funcție de sarcină:
| Categorie sarcină | Ce testează | Metrică |
|---|---|---|
| Retrieval | Găsirea documentelor relevante pentru o interogare (acesta este RAG) | nDCG@10 |
| Classification | Etichetarea textului în categorii | accuracy |
| Clustering | Gruparea textelor similare | v-measure |
| Pair Classification | Sunt două texte o potrivire? | average precision |
| Reranking | Reordonarea rezultatelor candidate | MAP |
| STS (similaritate textuală semantică) | Cât de similar este sensul a două propoziții | Corelația Spearman |
| Summarization | Clasarea calității rezumatului | Corelația Spearman |
| Bitext mining | Potrivirea traducerilor între limbi | F1 |
Maparea sarcină-metrică de mai sus este verificată din lucrarea MTEB (arXiv 2210.07316). Concluzia principală: un model care conduce media generală MTEB poate fi totuși mediocru la singura sarcină pe care rulează produsul tău.
Care scor MTEB contează cu adevărat pentru RAG?
Pentru RAG, ignoră media generală și uită-te la sub-tab-ul Retrieval, scorat prin nDCG@10. RAG este căutare semantică peste documentele tale, ceea ce este exact sarcina de retrieval. STS este vag corelat, dar secundar. Un model poate câștiga clasamentul general în timp ce se clasează la mijloc la retrieval, deci coloana de retrieval este cea care prezice calitatea în producție.
De ce media combinată induce în eroare? Subsetul de retrieval este construit din dataset-uri web generale și QA precum MS MARCO, Natural Questions și HotpotQA. Un model care strălucește la clasificare poate posta o medie excelentă, în timp ce scorul său de retrieval scade. Deschide clasamentul Hugging Face (huggingface.co/spaces/mteb/leaderboard, accesat la 2026-07-13) și filtrează după tab-ul de retrieval înainte de a compara orice.
Dacă îți scrii propria evaluare, același filtru se aplică în cod:
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasksOdată ce ai citit coloana de retrieval, următoarea întrebare este ce model să alegi. Postarea noastră de pe hub parcurge ce model de embedding să implementezi efectiv cu numerele complete ale benchmark-ului, iar dacă alegi unde să stochezi acei vectori, ghidul nostru despre cele mai bune baze de date vectoriale în 2026 se potrivește perfect.
Ce înseamnă cu adevărat un scor nDCG@10?
nDCG@10 măsoară cât de bine sunt clasate primele 10 rezultate recuperate. Un scor de 1,0 înseamnă că fiecare document relevant se află chiar în vârf; 0 înseamnă că niciunul nu o face. Modelele reale de embedding se situează în jurul valorilor de 0,4–0,7 zero-shot, deci un 0,55 este normal, nu defect.
Gândește-te la asta ca la notarea unei casete de căutare. Te interesează dacă răspunsul corect apare primul, nu doar undeva, deoarece LLM-ul tău citește doar primele câteva chunk-uri pe care i le furnizezi. Nimeni nu atinge 1,0, deoarece interogările sunt ambigue, iar documentele relevante rareori se aliniază perfect. Deci, dacă un nDCG@10 de 0,55 te panichează, nu o face; acesta este un scor zero-shot normal, gata de producție, iar banda 0,4–0,7 este un interval tipic (coroborat de zeroentropy.dev), nu o lege a fizicii.
Am pus modelul #1 MTEB față în față cu propriul nostru corpus RAG (și nu a câștigat)
Am luat modelul care conduce tab-ul English retrieval din MTEB și l-am rulat împotriva altor șase pe propriul nostru corpus de 10.000 de documente tehnice, scorat față de un set etichetat manual de ~120 de interogări. Liderul clasamentului a postat un Recall@10 puternic, dar nu a terminat pe primul loc, iar două opțiuni mai ieftine s-au apropiat suficient încât să schimbe decizia. Cu doar ~120 de interogări, tratează acestea ca indicative, nu ca un clasament oficial.
Liderul clasamentului MTEB English în fereastra noastră de test a fost Gemini Embedding 001 (conduce snapshot-ul din apr 2026); clasamentele de mai jos provin din tabla MTEB Hugging Face, și deoarece numerele se schimbă în funcție de snapshot, cităm ale noastre cu o dată:
| Model (dims) | Poziție MTEB English (HF, 2026) | Recall@10 pe corpusul nostru | Cost |
|---|---|---|---|
| Gemini Embedding 001 (3072) | conduce tab-ul English retrieval | 0.88 | ~$0.15/M |
| Voyage-4-large (1024) | neposted pe tabla publică | 0.89 | ~$0.12/M |
| Qwen3-Embedding-8B (self-host) | lider open-model | 0.87 | Doar GPU |
| text-embedding-3-large @1024 (truncated) | nivel mediu | 0.83 | ~$0.13/M |
Două lucruri pe care clasamentul nu ni le-a spus. În primul rând, liderul public #1 (Gemini) a fost depășit pe corpusul nostru de Voyage-4-large, un model care nici măcar nu postează pe acea tablă. În al doilea rând, un model open auto-găzduit (Qwen3-8B) a fost foarte aproape, fără cost per token, iar vectorii trunchiați la 1024 dim de la OpenAI au menținut un Recall@10 de 0,83 cu o stocare de 3 ori mai mică. MTEB clasează retrieval-ul pe text web general și QA; corpusul nostru are vocabular tehnic specializat, chunk-uit în modul său propriu, deci ordinea se restructurează. Acesta este întregul argument pentru testarea pe propria ta dată. Walkthrough-ul nostru despre cum să testezi pe propriul corpus RAG acoperă partea de eval, iar postarea de pe hub conține metodologia completă.
De ce liderul clasamentului #1 nu este cea mai bună alegere a ta
Trei lucruri pe care clasamentul nu le poate vedea decid câștigătorul real: vocabularul de domeniu (jargon pe care dataset-urile generale nu îl conțin niciodată), dimensiunea chunk-ului (pasajele scurte versus cele lungi favorizează modele diferite) și limba interogării. De aceea MTEB este un instrument de shortlisting, nu un răspuns final. Clasamentul îți spune care modele sunt plauzibile, nu care one se potrivește datelor tale.
Iată factorii de corpus care inversează un clasament în practică:
- Shift de domeniu: textul legal, medical sau din codebase poartă un vocabular pe care MS MARCO nu l-a sampling-uit niciodată.
- Dimensiunea chunk-ului: un model tune-uit pe pasaje scurte se poate împotmoli la chunk-uri de 800 de tokeni.
- Limba și stilul interogării: interogările multilingve sau cele heavy pe keyword-uri reordonează rapid clasamentul.
În experiența noastră, fluxul de lucru可靠il este plictisitor, dar funcționează: folosește tab-ul de retrieval MTEB pentru a face o shortlist de 3–4 candidați, apoi măsoară Recall@10 și nDCG@10 pe propriile tale documente. Roundup-ul nostru de tooling RAG general ajută cu pipeline-ul, iar pentru o modalitate structurată de a evalua modelele pe propria ta dată, acea recenzie acoperă partea de eval. Două lecturi conexe demne de bookmarkat: rularea modelelor de embedding local cu Ollama, și un head-to-head al embedding-urilor Voyage vs OpenAI vs Cohere.
MTEB vs MMTEB și de ce numerele se schimbă mereu
MMTEB este expansiunea multilingvă v2 a MTEB (arXiv 2502.13595, v2 publicat la 8 aprilie 2025). Adaugă 500+ sarcini drive-uite de comunitate across 250+ limbi, plus retrieval de documente lungi, follow-up de instrucțiuni și cod. Dacă RAG-ul tău este doar în engleză, tab-ul original English MTEB retrieval este tot cel pe care trebuie să îl citești. MMTEB contează cel mai mult când interogările și documentele tale span multiple limbi.
Iată partea onestă. Numerele MTEB intră în conflict across snapshot-uri și chiar across versiuni ale lucrării: lucrarea originală raportează 56 de dataset-uri într-o versiune și 58 în alta, deci nu trata niciodată o singură cifră ca canonică. Clasamentele se restructurează constant pe măsură ce sosesc 5.000+ submiteri, deci fă întotdeauna screenshot clasamentului cu data la care l-ai citit. Și dacă pagina nu se încarcă, Space-ul Hugging Face rulează pe un upgrade CPU și este adesea lent sau instabil, nu conexiunea ta.
Concluzia
MTEB este cel mai bun punct de plecare public pentru alegerea unui model de embedding, odată ce îl citești corect. Citește tab-ul de retrieval, nu media generală. Consideră un nDCG@10 de 0,4–0,7 ca normal. Fă o shortlist cu clasamentul, apoi testează acea shortlist pe propriul corpus, deoarece modelul #1 pierde adesea pe date reale (al nostru a făcut-o). Când ești gata să alegi, revino la hub-ul nostru de modele de embedding pentru benchmark-ul complet și recomandări. Și dacă job-ul real este integrarea modelului ales într-un pipeline de producție, acea evaluare shortlist-then-test face parte din munca noastră de integrare AI.
Despre autor
Mert Batur Gurbuz este Co-Founder al Techsy.io, unde echipa livrează agenți AI, sisteme de automatizare și pipeline-uri voice/SDR pentru clienți B2B. Studiază la University of Birmingham și scrie despre stack-ul de tooling LLM pe care echipa Techsy îl folosește efectiv în producție.
Conectează-te pe LinkedIn.
Întrebări frecvente
Ce este MTEB?
MTEB este Massive Text Embedding Benchmark, o suită open-source pentru scorarea performanței modelelor de embedding de text across 8 tipuri de sarcini, inclusiv retrieval, clasificare și clustering. Introdus de Muennighoff și colegii săi în 2022 (arXiv 2210.07316), este găzduit ca un clasament public pe Hugging Face.
Ce înseamnă MTEB?
MTEB înseamnă Massive Text Embedding Benchmark. Numele contează deoarece „massive” se referă la amploarea sarcinilor și dataset-urilor, nu la un singur test. Scorul tău MTEB este de fapt o medie across multe evaluări separate, motiv pentru care numărul general poate ascunde puncte slabe la sarcina care te interesează.
Care scor MTEB contează pentru RAG?
Pentru RAG, citește sub-tab-ul Retrieval, scorat prin nDCG@10, nu media generală. RAG este căutare semantică peste documentele tale, ceea ce este exact sarcina de retrieval măsurată de clasament. Un model poate posta un scor general puternic în timp ce se clasează la mijloc la retrieval, deci retrieval-ul este semnalul reliable.
Care este un scor bun de retrieval MTEB?
Modelele reale de embedding obțin de obicei scoruri nDCG@10 zero-shot între 0,4–0,7, deci orice în acea bandă este normal și gata de producție. Un 0,55 nu este un steag roșu. Nimeni nu atinge 1,0, deoarece interogările sunt ambigue, iar documentele relevante rareori se aliniază în ordine perfectă. Compară candidații între ei, nu față de un 1,0 perfect.
Ce este nDCG@10?
nDCG@10 măsoară cât de bine sunt clasate primele 10 rezultate recuperate. Un scor de 1,0 înseamnă că fiecare document relevant se află chiar în vârf; 0 înseamnă că niciunul nu o face. Recompensează punerea celui mai bun răspuns pe primul loc, ceea contează pentru RAG deoarece LLM-ul tău citește doar primele câteva chunk-uri pe care le retrieviezi.
Care este diferența dintre MTEB și MMTEB (v1 vs v2)?
MMTEB este expansiunea multilingvă v2 a MTEB (arXiv 2502.13595, aprilie 2025). Extinde benchmark-ul la 500+ sarcini drive-uite de comunitate across 250+ limbi și adaugă retrieval de documente lungi, instrucțiuni și cod. Dacă RAG-ul tău este doar în engleză, rămâi la tab-ul original English MTEB retrieval.
De ce se schimbă atât de des clasamentul MTEB (și de ce nu se încarcă)?
Clasamentele se restructurează constant deoarece noi modele sunt submitate tot timpul, cu 5.000+ intrări și în creștere. Un snapshot din martie nu va potrivi cu unul din iulie, deci fă întotdeauna screenshot clasamentului cu data. Dacă pagina nu se încarcă, Space-ul Hugging Face rulează pe un upgrade CPU și este frecvent lent sau instabil.
Ar trebui să aleg pur și simplu modelul #1 din clasamentul MTEB?
Nu. Modelul #1 este un candidat pentru shortlist, nu un verdict. Clasamentul nu poate vedea vocabularul tău de domeniu, dimensiunea chunk-ului sau limba interogării, toate schimbând care model câștigă. Folosește tab-ul de retrieval pentru a face o shortlist de 3–4 modele, apoi testează pe corpusul tău. În testul nostru, liderul public al clasamentului a fost depășit pe propriul nostru corpus de un model care nici măcar nu este pe acea tablă, și egalat de o opțiune self-hosted mai ieftină.