Techsy
Contact
Începe
Înapoi la Blog
ai-machine-learning

Scorul MTEB explicat: De ce modelul #1 nu este cea mai bună alegere pentru RAG

Scris de Mert Batur Gürbüz
Jul 13, 2026
11 min citire
Cuprins
Scorul MTEB explicat: De ce modelul #1 nu este cea mai bună alegere pentru RAG

Scorul MTEB explicat: De ce modelul #1 nu este cea mai bună alegere pentru RAG

Clasamentul Hugging Face MTEB listează peste 5.000 de submiteri de modele de embedding, iar aproape în fiecare săptămână un nou model urcă pe primul loc. Iată capcana: acel model de pe locul #1 probabil nu este cel pe care ar trebui să îl implementezi în producție. Scorul MTEB pe care îl vezi este o medie calculată pe 8 tipuri diferite de sarcini, iar doar una dintre ele prezice cât de bine funcționează generarea augmentată prin regăsire (RAG) pe documentele tale. Am învățat acest lucru pe pielea noastră. În aprilie 2026, alegerea noastră clasată pe primul loc a fost depășită de un model mai ieftin pe propriul nostru corpus. Acest ghid explică ce înseamnă cu adevărat cifrele, ce coloană merită încredere pentru RAG și de ce clasamentul este un punct de plecare, nu un verdict final.

Idei principale

  • MTEB este un benchmark multi-sarcină; scorul „general” combină 8 tipuri de sarcini într-o singură medie.
  • Pentru RAG, doar sub-tab-ul Retrieval (nDCG@10) prezice calitatea în producție, nu media generală.
  • Modelele reale de embedding obțin scoruri nDCG@10 zero-shot între 0,4–0,7; 1,0 ar însemna o clasare perfectă.
  • Folosește MTEB pentru a face o listă scurtă, apoi testează pe propriul corpus. Modelul #1 pierde adesea.

Ce este un scor MTEB?

MTEB înseamnă Massive Text Embedding Benchmark, o suită open-source, multi-sarcină, pentru evaluarea modelelor de embedding de text. Un scor MTEB este o metrică per-sarcină, mediată într-un singur număr general across 8 tipuri de sarcini. A fost introdus de Muennighoff și colegii săi în 2022 (arXiv 2210.07316, publicat la EACL 2023).

Benchmark-ul există ca un spațiu public Hugging Face unde oricine poate submita un model. Numărul citat cel mai des este „media generală”, care combină regăsirea, clasificarea, clustering-ul și alte cinci familii de sarcini într-o singură cifră. Exact de aici provine confuzia clasamentului principal: un model poate câștiga la medie fiind puternic la clustering, dar mediocru la singura sarcină de care depinde produsul tău. Lucrarea originală acoperă 8 tipuri de sarcini pe aproximativ 58 de dataset-uri și 112 limbi.

Cele 8 categorii de sarcini MTEB (și ce măsoară fiecare scor)

MTEB grupează evaluarea embedding-urilor în 8 tipuri de sarcini, fiecare fiind scorată printr-o metrică diferită. Astfel, „un scor MTEB mare” nu înseamnă aproape nimic până nu știi exact ce sarcini citești. Un 0,85 la clasificare (acuratețe) și un 0,85 la regăsire (nDCG@10) descriu abilități complet diferite.

Iată tabelul decodor pe care puțini îl publică clar. Metrica se schimbă în funcție de sarcină:

Categorie sarcinăCe testeazăMetrică
RetrievalGăsirea documentelor relevante pentru o interogare (acesta este RAG)nDCG@10
ClassificationEtichetarea textului în categoriiaccuracy
ClusteringGruparea textelor similarev-measure
Pair ClassificationSunt două texte o potrivire?average precision
RerankingReordonarea rezultatelor candidateMAP
STS (similaritate textuală semantică)Cât de similar este sensul a două propozițiiCorelația Spearman
SummarizationClasarea calității rezumatuluiCorelația Spearman
Bitext miningPotrivirea traducerilor între limbiF1

Maparea sarcină-metrică de mai sus este verificată din lucrarea MTEB (arXiv 2210.07316). Concluzia principală: un model care conduce media generală MTEB poate fi totuși mediocru la singura sarcină pe care rulează produsul tău.

Care scor MTEB contează cu adevărat pentru RAG?

Pentru RAG, ignoră media generală și uită-te la sub-tab-ul Retrieval, scorat prin nDCG@10. RAG este căutare semantică peste documentele tale, ceea ce este exact sarcina de retrieval. STS este vag corelat, dar secundar. Un model poate câștiga clasamentul general în timp ce se clasează la mijloc la retrieval, deci coloana de retrieval este cea care prezice calitatea în producție.

De ce media combinată induce în eroare? Subsetul de retrieval este construit din dataset-uri web generale și QA precum MS MARCO, Natural Questions și HotpotQA. Un model care strălucește la clasificare poate posta o medie excelentă, în timp ce scorul său de retrieval scade. Deschide clasamentul Hugging Face (huggingface.co/spaces/mteb/leaderboard, accesat la 2026-07-13) și filtrează după tab-ul de retrieval înainte de a compara orice.

Dacă îți scrii propria evaluare, același filtru se aplică în cod:

python
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasks

Odată ce ai citit coloana de retrieval, următoarea întrebare este ce model să alegi. Postarea noastră de pe hub parcurge ce model de embedding să implementezi efectiv cu numerele complete ale benchmark-ului, iar dacă alegi unde să stochezi acei vectori, ghidul nostru despre cele mai bune baze de date vectoriale în 2026 se potrivește perfect.

Ce înseamnă cu adevărat un scor nDCG@10?

nDCG@10 măsoară cât de bine sunt clasate primele 10 rezultate recuperate. Un scor de 1,0 înseamnă că fiecare document relevant se află chiar în vârf; 0 înseamnă că niciunul nu o face. Modelele reale de embedding se situează în jurul valorilor de 0,4–0,7 zero-shot, deci un 0,55 este normal, nu defect.

Gândește-te la asta ca la notarea unei casete de căutare. Te interesează dacă răspunsul corect apare primul, nu doar undeva, deoarece LLM-ul tău citește doar primele câteva chunk-uri pe care i le furnizezi. Nimeni nu atinge 1,0, deoarece interogările sunt ambigue, iar documentele relevante rareori se aliniază perfect. Deci, dacă un nDCG@10 de 0,55 te panichează, nu o face; acesta este un scor zero-shot normal, gata de producție, iar banda 0,4–0,7 este un interval tipic (coroborat de zeroentropy.dev), nu o lege a fizicii.

Am pus modelul #1 MTEB față în față cu propriul nostru corpus RAG (și nu a câștigat)

Am luat modelul care conduce tab-ul English retrieval din MTEB și l-am rulat împotriva altor șase pe propriul nostru corpus de 10.000 de documente tehnice, scorat față de un set etichetat manual de ~120 de interogări. Liderul clasamentului a postat un Recall@10 puternic, dar nu a terminat pe primul loc, iar două opțiuni mai ieftine s-au apropiat suficient încât să schimbe decizia. Cu doar ~120 de interogări, tratează acestea ca indicative, nu ca un clasament oficial.

Liderul clasamentului MTEB English în fereastra noastră de test a fost Gemini Embedding 001 (conduce snapshot-ul din apr 2026); clasamentele de mai jos provin din tabla MTEB Hugging Face, și deoarece numerele se schimbă în funcție de snapshot, cităm ale noastre cu o dată:

Model (dims)Poziție MTEB English (HF, 2026)Recall@10 pe corpusul nostruCost
Gemini Embedding 001 (3072)conduce tab-ul English retrieval0.88~$0.15/M
Voyage-4-large (1024)neposted pe tabla publică0.89~$0.12/M
Qwen3-Embedding-8B (self-host)lider open-model0.87Doar GPU
text-embedding-3-large @1024 (truncated)nivel mediu0.83~$0.13/M

Două lucruri pe care clasamentul nu ni le-a spus. În primul rând, liderul public #1 (Gemini) a fost depășit pe corpusul nostru de Voyage-4-large, un model care nici măcar nu postează pe acea tablă. În al doilea rând, un model open auto-găzduit (Qwen3-8B) a fost foarte aproape, fără cost per token, iar vectorii trunchiați la 1024 dim de la OpenAI au menținut un Recall@10 de 0,83 cu o stocare de 3 ori mai mică. MTEB clasează retrieval-ul pe text web general și QA; corpusul nostru are vocabular tehnic specializat, chunk-uit în modul său propriu, deci ordinea se restructurează. Acesta este întregul argument pentru testarea pe propria ta dată. Walkthrough-ul nostru despre cum să testezi pe propriul corpus RAG acoperă partea de eval, iar postarea de pe hub conține metodologia completă.

De ce liderul clasamentului #1 nu este cea mai bună alegere a ta

Trei lucruri pe care clasamentul nu le poate vedea decid câștigătorul real: vocabularul de domeniu (jargon pe care dataset-urile generale nu îl conțin niciodată), dimensiunea chunk-ului (pasajele scurte versus cele lungi favorizează modele diferite) și limba interogării. De aceea MTEB este un instrument de shortlisting, nu un răspuns final. Clasamentul îți spune care modele sunt plauzibile, nu care one se potrivește datelor tale.

Iată factorii de corpus care inversează un clasament în practică:

  • Shift de domeniu: textul legal, medical sau din codebase poartă un vocabular pe care MS MARCO nu l-a sampling-uit niciodată.
  • Dimensiunea chunk-ului: un model tune-uit pe pasaje scurte se poate împotmoli la chunk-uri de 800 de tokeni.
  • Limba și stilul interogării: interogările multilingve sau cele heavy pe keyword-uri reordonează rapid clasamentul.

În experiența noastră, fluxul de lucru可靠il este plictisitor, dar funcționează: folosește tab-ul de retrieval MTEB pentru a face o shortlist de 3–4 candidați, apoi măsoară Recall@10 și nDCG@10 pe propriile tale documente. Roundup-ul nostru de tooling RAG general ajută cu pipeline-ul, iar pentru o modalitate structurată de a evalua modelele pe propria ta dată, acea recenzie acoperă partea de eval. Două lecturi conexe demne de bookmarkat: rularea modelelor de embedding local cu Ollama, și un head-to-head al embedding-urilor Voyage vs OpenAI vs Cohere.

MTEB vs MMTEB și de ce numerele se schimbă mereu

MMTEB este expansiunea multilingvă v2 a MTEB (arXiv 2502.13595, v2 publicat la 8 aprilie 2025). Adaugă 500+ sarcini drive-uite de comunitate across 250+ limbi, plus retrieval de documente lungi, follow-up de instrucțiuni și cod. Dacă RAG-ul tău este doar în engleză, tab-ul original English MTEB retrieval este tot cel pe care trebuie să îl citești. MMTEB contează cel mai mult când interogările și documentele tale span multiple limbi.

Iată partea onestă. Numerele MTEB intră în conflict across snapshot-uri și chiar across versiuni ale lucrării: lucrarea originală raportează 56 de dataset-uri într-o versiune și 58 în alta, deci nu trata niciodată o singură cifră ca canonică. Clasamentele se restructurează constant pe măsură ce sosesc 5.000+ submiteri, deci fă întotdeauna screenshot clasamentului cu data la care l-ai citit. Și dacă pagina nu se încarcă, Space-ul Hugging Face rulează pe un upgrade CPU și este adesea lent sau instabil, nu conexiunea ta.

Concluzia

MTEB este cel mai bun punct de plecare public pentru alegerea unui model de embedding, odată ce îl citești corect. Citește tab-ul de retrieval, nu media generală. Consideră un nDCG@10 de 0,4–0,7 ca normal. Fă o shortlist cu clasamentul, apoi testează acea shortlist pe propriul corpus, deoarece modelul #1 pierde adesea pe date reale (al nostru a făcut-o). Când ești gata să alegi, revino la hub-ul nostru de modele de embedding pentru benchmark-ul complet și recomandări. Și dacă job-ul real este integrarea modelului ales într-un pipeline de producție, acea evaluare shortlist-then-test face parte din munca noastră de integrare AI.

Despre autor

Mert Batur Gurbuz este Co-Founder al Techsy.io, unde echipa livrează agenți AI, sisteme de automatizare și pipeline-uri voice/SDR pentru clienți B2B. Studiază la University of Birmingham și scrie despre stack-ul de tooling LLM pe care echipa Techsy îl folosește efectiv în producție.

Conectează-te pe LinkedIn.

Întrebări frecvente

Ce este MTEB?

MTEB este Massive Text Embedding Benchmark, o suită open-source pentru scorarea performanței modelelor de embedding de text across 8 tipuri de sarcini, inclusiv retrieval, clasificare și clustering. Introdus de Muennighoff și colegii săi în 2022 (arXiv 2210.07316), este găzduit ca un clasament public pe Hugging Face.

Ce înseamnă MTEB?

MTEB înseamnă Massive Text Embedding Benchmark. Numele contează deoarece „massive” se referă la amploarea sarcinilor și dataset-urilor, nu la un singur test. Scorul tău MTEB este de fapt o medie across multe evaluări separate, motiv pentru care numărul general poate ascunde puncte slabe la sarcina care te interesează.

Care scor MTEB contează pentru RAG?

Pentru RAG, citește sub-tab-ul Retrieval, scorat prin nDCG@10, nu media generală. RAG este căutare semantică peste documentele tale, ceea ce este exact sarcina de retrieval măsurată de clasament. Un model poate posta un scor general puternic în timp ce se clasează la mijloc la retrieval, deci retrieval-ul este semnalul reliable.

Care este un scor bun de retrieval MTEB?

Modelele reale de embedding obțin de obicei scoruri nDCG@10 zero-shot între 0,4–0,7, deci orice în acea bandă este normal și gata de producție. Un 0,55 nu este un steag roșu. Nimeni nu atinge 1,0, deoarece interogările sunt ambigue, iar documentele relevante rareori se aliniază în ordine perfectă. Compară candidații între ei, nu față de un 1,0 perfect.

Ce este nDCG@10?

nDCG@10 măsoară cât de bine sunt clasate primele 10 rezultate recuperate. Un scor de 1,0 înseamnă că fiecare document relevant se află chiar în vârf; 0 înseamnă că niciunul nu o face. Recompensează punerea celui mai bun răspuns pe primul loc, ceea contează pentru RAG deoarece LLM-ul tău citește doar primele câteva chunk-uri pe care le retrieviezi.

Care este diferența dintre MTEB și MMTEB (v1 vs v2)?

MMTEB este expansiunea multilingvă v2 a MTEB (arXiv 2502.13595, aprilie 2025). Extinde benchmark-ul la 500+ sarcini drive-uite de comunitate across 250+ limbi și adaugă retrieval de documente lungi, instrucțiuni și cod. Dacă RAG-ul tău este doar în engleză, rămâi la tab-ul original English MTEB retrieval.

De ce se schimbă atât de des clasamentul MTEB (și de ce nu se încarcă)?

Clasamentele se restructurează constant deoarece noi modele sunt submitate tot timpul, cu 5.000+ intrări și în creștere. Un snapshot din martie nu va potrivi cu unul din iulie, deci fă întotdeauna screenshot clasamentului cu data. Dacă pagina nu se încarcă, Space-ul Hugging Face rulează pe un upgrade CPU și este frecvent lent sau instabil.

Ar trebui să aleg pur și simplu modelul #1 din clasamentul MTEB?

Nu. Modelul #1 este un candidat pentru shortlist, nu un verdict. Clasamentul nu poate vedea vocabularul tău de domeniu, dimensiunea chunk-ului sau limba interogării, toate schimbând care model câștigă. Folosește tab-ul de retrieval pentru a face o shortlist de 3–4 modele, apoi testează pe corpusul tău. În testul nostru, liderul public al clasamentului a fost depășit pe propriul nostru corpus de un model care nici măcar nu este pe acea tablă, și egalat de o opțiune self-hosted mai ieftină.

Etichete

scor MTEB explicatnDCG@10regăsire MTEBembeddings RAGMMTEB

Distribuie acest articol

Articole similare

Mai multe din ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 a sosit: inteligență aproape de Fable 5 la jumătate de preț

Anthropic a lansat Claude Opus 5 pe 24 iulie 2026. Mai mult decât dublează scorul Opus 4.8 pe Frontier-Bench și menține prețul Opus, dar pierde câteva teste în fața Fable 5 și Mythos 5. Iată tabelul de benchmark-uri, prețul și verdictul: schimbi / aștepți / rămâi.

10 min read min citire
Citește
ai-machine-learning
Jul 20, 2026

Cele mai bune 8 API-uri de web scraping AI în 2026 (testate pe stack-ul nostru de agenți)

Am testat 8 API-uri de web scraping AI cu prețuri reale din 2026, obținute prin stack-ul nostru de agenți. Firecrawl, Bright Data, ScrapingBee și alte 5, clasificate pentru output gata pentru LLM, anti-bot și suport MCP.

9 min read min citire
Citește
ai-machine-learning
Jul 20, 2026

Ingineria prompturilor pentru programare: 7 modele pe care le folosim zilnic în Claude Code și Cursor (2026)

Majoritatea articolelor despre „prompturi AI pentru codare” îți oferă 50 de șabloane de copiat. Acest articol te învață cele 7 modele pe care le folosim în fiecare zi pentru a rula o pipeline Claude Code cu 16 agenți, cu exemple reale de „înainte și după” pentru fiecare, plus unde se aplică fiecare model în Claude Code, Cursor și Copilot în 2026.

11 min read min citire
Citește
Vezi toate articolele
Începe Proiectul Tău

Gata să construim ceva extraordinară?

Hai să-ți transformăm viziunea în realitate. Echipa noastră e pregătită să te ajute să creezi software care face diferența.

Programează un apel de 30 minVezi proiectele noastre

Cele mai populare din bibliotecă

Skill-uri Claude

Vezi toate
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automatizări AI

Vezi toate
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Cele mai populare din bibliotecă

Skill-uri Claude

Vezi toate
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automatizări AI

Vezi toate
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Servicii

  • Soluții Enterprise
  • Aplicații Mobile
  • Aplicații Web

Soluții

  • Sisteme CRM
  • Integrare AI
  • Soluții ERP
  • Agenți Vocali
  • Automatizarea Proceselor
  • Cibersécurité

Bibliotecă

  • Blog
  • Portofoliu

Comunitate

  • Automatizări AI
  • Skill-uri Claude

Tool-uri

  • Calculator cost aplicație mobilă
  • Calculator cost API OpenAI / LLM
  • Calculator cost MVP
  • Calculator cost agent AI vocal

Companie

  • Despre
  • Parteneri
  • Contact

Mențiuni legale

  • Politica de confidențialitate
  • Termeni și condiții
  • Politica cookie

Servicii

  • Soluții Enterprise
  • Aplicații Mobile
  • Aplicații Web

Soluții

  • Sisteme CRM
  • Integrare AI
  • Soluții ERP
  • Agenți Vocali
  • Automatizarea Proceselor
  • Cibersécurité

Bibliotecă

  • Blog
  • Portofoliu

Comunitate

  • Automatizări AI
  • Skill-uri Claude

Tool-uri

  • Calculator cost aplicație mobilă
  • Calculator cost API OpenAI / LLM
  • Calculator cost MVP
  • Calculator cost agent AI vocal

Companie

  • Despre
  • Parteneri
  • Contact
Mențiuni legalePolitica de confidențialitateTermeni și condițiiPolitica cookie
TECHSY
© 2026 Techsy. Toate drepturile rezervate.