ai-machine-learning

Punteggio MTEB Spiegato: Perché il Modello #1 Non È la Scelta Migliore per il RAG

Scritto da Mert Batur
Jul 13, 2026
11 lettura
Punteggio MTEB Spiegato: Perché il Modello #1 Non È la Scelta Migliore per il RAG

La classifica MTEB di Hugging Face elenca oltre 5.000 modelli di embedding sottomessi, e quasi ogni settimana uno nuovo si infila in cima. Ecco la trappola: quel modello #1 probabilmente non è quello che dovresti mettere in produzione. Il punteggio MTEB che stai guardando è una media su 8 tipi di task diversi, e solo uno di questi predice davvero come si comporterà il retrieval-augmented generation sui tuoi documenti. Lo abbiamo imparato a nostre spese: nell'aprile 2026 il modello che avevamo scelto perché primo in classifica ha perso contro un modello più economico sul nostro corpus. Questa guida spiega cosa significano davvero i numeri, quale colonna fidarsi per il RAG, e perché la classifica è un punto di partenza, non un verdetto.

Punti Chiave

  • MTEB è un benchmark multi-task; il punteggio "complessivo" in evidenza fonde 8 tipi di task in un'unica media.
  • Per il RAG, solo la scheda Retrieval (nDCG@10) predice la qualità in produzione, non la media generale.
  • I modelli di embedding reali ottengono 0.4–0.7 di nDCG@10 zero-shot; 1.0 significherebbe un ranking perfetto.
  • Usa MTEB per fare una shortlist, poi testa sul tuo corpus. Il modello #1 spesso perde.

Cos'è un Punteggio MTEB?

MTEB sta per Massive Text Embedding Benchmark, una suite aperta e multi-task per valutare i modelli di embedding testuale. Un punteggio MTEB è una metrica per task, mediata in un unico numero complessivo su 8 tipi di task. È stato introdotto da Muennighoff e colleghi nel 2022 (arXiv 2210.07316, pubblicato a EACL 2023).

Il benchmark vive come uno Space pubblico su Hugging Face, dove chiunque può sottomettere un modello. Il numero che la maggior parte delle persone cita è la "media complessiva", che fonde retrieval, classificazione, clustering e altre cinque famiglie di task in un'unica cifra. Questo è esattamente il motivo per cui il rank in evidenza inganna: un modello può vincere la media essendo forte nel clustering pur essendo solo nella media sull'unico task da cui dipende il tuo prodotto. Il paper originale copre 8 tipi di task su circa 58 dataset e 112 lingue.

Le 8 Categorie di Task MTEB (e Cosa Misura Ciascun Punteggio)

MTEB raggruppa la valutazione degli embedding in 8 tipi di task, e ognuno è misurato con una metrica diversa. Quindi "un punteggio MTEB alto" non significa quasi nulla finché non sai quale task stai leggendo. Uno 0.85 in classificazione (accuratezza) e uno 0.85 in retrieval (nDCG@10) descrivono abilità completamente diverse.

Ecco la tabella decodificatrice che nessuno sembra pubblicare in modo chiaro. La metrica cambia con il task:

Categoria di taskCosa misuraMetrica
RetrievalTrovare i documenti rilevanti per una query (questo è il RAG)nDCG@10
ClassificationAssegnare etichette al testo per categoriaaccuratezza
ClusteringRaggruppare testi similiv-measure
Pair ClassificationDue testi corrispondono?precisione media
RerankingRiordinare i risultati candidatiMAP
STS (similarità testuale semantica)Quanto due frasi hanno un significato similecorrelazione di Spearman
SummarizationClassificare la qualità dei riassunticorrelazione di Spearman
Bitext miningAbbinare traduzioni tra lingue diverseF1

La mappa task-metrica sopra è verificata dal paper MTEB (arXiv 2210.07316). L'unica cosa da ricordare: un modello che domina la media MTEB complessiva può comunque essere mediocre nell'unico task su cui gira il tuo prodotto.

Quale Punteggio MTEB Conta Davvero per il RAG?

Per il RAG, ignora la media complessiva e leggi la scheda Retrieval, misurata con nDCG@10. Il RAG è ricerca semantica sui tuoi documenti, che è esattamente il task di retrieval. STS è correlato in modo debole ma resta secondario. Un modello può vincere la classifica complessiva pur piazzandosi a metà classifica sul retrieval, quindi la colonna retrieval è quella che predice la qualità in produzione.

Perché la media complessiva inganna? Il subset di retrieval è costruito su dataset generici web e QA come MS MARCO, Natural Questions e HotpotQA. Un modello che brilla in classificazione può ottenere una media ottima mentre il suo numero di retrieval cala. Apri la classifica su Hugging Face (huggingface.co/spaces/mteb/leaderboard, consultata il 2026-07-13) e filtra sulla scheda retrieval prima di confrontare qualsiasi cosa.

Se scrivi la tua valutazione via codice, lo stesso filtro si applica così:

python
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasks

Una volta letta la colonna retrieval, la domanda successiva è quale modello scegliere. Il nostro post guida approfondisce quale modello di embedding scegliere davvero con tutti i numeri del benchmark, e se stai decidendo dove far vivere quei vettori, la nostra guida ai migliori database vettoriali del 2026 si accompagna bene a questo articolo.

Cosa Significa Davvero un Punteggio nDCG@10?

nDCG@10 misura quanto bene sono ordinati i primi 10 risultati recuperati. Un punteggio di 1.0 significa che ogni documento rilevante è in cima; 0 significa che nessuno lo è. I modelli di embedding reali si collocano intorno a 0.4–0.7 zero-shot, quindi uno 0.55 è normale, non un problema.

Pensala come la valutazione di una casella di ricerca. Ti importa che la risposta giusta compaia per prima, non solo da qualche parte, perché il tuo LLM legge solo i pochi chunk in cima che gli passi. Nessuno arriva a 1.0, perché le query sono ambigue e i documenti rilevanti raramente si allineano alla perfezione. Quindi se un nDCG@10 di 0.55 ti fa preoccupare, non farlo: è un punteggio zero-shot normale e spedibile, e la fascia 0.4–0.7 è un intervallo tipico (confermato anche da zeroentropy.dev), non una legge di natura.

Abbiamo Messo il #1 di MTEB Contro il Nostro Corpus RAG (e Non Ha Vinto)

Abbiamo preso il modello in cima alla scheda retrieval inglese di MTEB e lo abbiamo confrontato con altri sei sul nostro corpus tecnico di 10.000 documenti, valutato contro un set etichettato a mano di circa 120 query. Il leader della classifica ha ottenuto un Recall@10 solido, ma non è arrivato primo, e due opzioni più economiche si sono avvicinate abbastanza da cambiare la decisione. Con solo circa 120 query, considera questi risultati come indicativi, non come una classifica definitiva.

Il leader della classifica inglese MTEB nella nostra finestra di test era Gemini Embedding 001 (in vetta allo snapshot di aprile 2026); la classifica sotto viene dalla board MTEB di Hugging Face, e siccome i numeri cambiano a ogni snapshot li citiamo con una data:

Modello (dimensioni)Posizione MTEB inglese (HF, 2026)Recall@10 sul nostro corpusCosto
Gemini Embedding 001 (3072)in vetta alla scheda retrieval inglese0.88~$0.15/M
Voyage-4-large (1024)non presente sulla board pubblica0.89~$0.12/M
Qwen3-Embedding-8B (self-host)leader tra i modelli open0.87Solo GPU
text-embedding-3-large @1024 (troncato)fascia media0.83~$0.13/M

Due cose che la classifica non ci ha detto. Primo, il #1 pubblico (Gemini) è stato superato sul nostro corpus da Voyage-4-large, un modello che non compare nemmeno su quella board. Secondo, un modello open self-hosted (Qwen3-8B) è arrivato vicinissimo senza alcun costo per token, e i vettori troncati a 1024 dimensioni di OpenAI hanno tenuto uno 0.83 di Recall@10 con uno storage 3 volte più piccolo. MTEB valuta il retrieval su testo web e QA generico; il nostro corpus è vocabolario tecnico specializzato suddiviso a modo suo, quindi l'ordine si ribalta. Questo è tutto l'argomento a favore del test sui tuoi dati. Il nostro approfondimento su come testare sul tuo corpus RAG copre il lato valutazione, e il post guida contiene la metodologia completa.

Perché il #1 in Classifica Non È la Tua Scelta Migliore

Tre cose che la classifica non può vedere decidono chi vince davvero per te: il vocabolario di dominio (il gergo che i dataset generici non contengono mai), la dimensione dei chunk (passaggi brevi contro lunghi favoriscono modelli diversi) e la lingua delle query. Ecco perché MTEB è uno strumento per fare una shortlist, non una risposta definitiva. Il rank ti dice quali modelli sono plausibili, non quale si adatta ai tuoi dati.

Ecco i fattori del corpus che in pratica ribaltano un ranking:

  • Cambio di dominio: testi legali, medici o di codice contengono vocabolario che MS MARCO non ha mai campionato.
  • Dimensione dei chunk: un modello ottimizzato su passaggi brevi può inciampare su chunk da 800 token.
  • Lingua e stile delle query: query multilingue o ricche di parole chiave ribaltano l'ordine in fretta.

Per esperienza diretta, il workflow affidabile è noioso ma funziona: usa la scheda retrieval di MTEB per fare una shortlist di 3–4 candidati, poi misura Recall@10 e nDCG@10 sui tuoi documenti. La nostra rassegna sugli strumenti RAG generali aiuta con la pipeline, e per un modo strutturato di valutare i modelli sui tuoi dati, quella recensione copre il lato eval. Due letture correlate da tenere a portata di mano: far girare i modelli di embedding in locale con Ollama, e un confronto diretto tra Voyage, OpenAI e Cohere per gli embedding.

MTEB contro MMTEB, e Perché i Numeri Continuano a Cambiare

MMTEB è l'espansione multilingue v2 di MTEB (arXiv 2502.13595, v2 pubblicata l'8 aprile 2025). Aggiunge oltre 500 task guidati dalla community su oltre 250 lingue, più retrieval su documenti lunghi, istruzioni e codice. Se il tuo RAG è solo in inglese, la scheda retrieval originale di MTEB in inglese resta quella da leggere. MMTEB conta di più quando le tue query e i tuoi documenti coprono più lingue.

Ecco la parte onesta. I numeri MTEB entrano in conflitto tra uno snapshot e l'altro, e persino tra versioni diverse del paper: quello originale riporta 56 dataset in una versione e 58 in un'altra, quindi non trattare mai una singola cifra come definitiva. Le classifiche si ribaltano di continuo mentre arrivano oltre 5.000 sottomissioni, quindi fai sempre uno screenshot della classifica con la data in cui l'hai letta. E se la pagina non carica, lo Space di Hugging Face gira su un upgrade CPU ed è spesso lento o instabile: non è la tua connessione.

In Sintesi

MTEB è il miglior punto di partenza pubblico per scegliere un modello di embedding, una volta che lo leggi nel modo giusto. Leggi la scheda retrieval, non la media complessiva. Considera uno 0.4–0.7 di nDCG@10 come normale. Fai una shortlist con la classifica, poi testa quella shortlist sul tuo corpus, perché il modello #1 spesso perde sui dati reali (il nostro l'ha fatto). Quando sei pronto a scegliere, torna al nostro hub sui modelli di embedding per il benchmark completo e le raccomandazioni. E se il lavoro vero è collegare il modello scelto a una pipeline in produzione, quella valutazione shortlist-poi-test fa parte del nostro lavoro di integrazione AI.

Chi Ha Scritto Questo Articolo

Mert Batur è co-fondatore di Techsy.io, dove il team costruisce agenti AI, sistemi di automazione e pipeline voice/SDR per clienti B2B. Scrive sullo stack di strumenti LLM che il team Techsy usa davvero in produzione.

Connettiti su LinkedIn.

Domande Frequenti

Cos'è MTEB?

MTEB è il Massive Text Embedding Benchmark, una suite aperta per valutare quanto bene i modelli di embedding testuale si comportano su 8 tipi di task, inclusi retrieval, classificazione e clustering. Introdotto da Muennighoff e colleghi nel 2022 (arXiv 2210.07316), è ospitato come classifica pubblica su Hugging Face.

Cosa significa MTEB?

MTEB sta per Massive Text Embedding Benchmark. Il nome conta perché "massive" si riferisce all'ampiezza di task e dataset, non a un singolo test. Il tuo punteggio MTEB è in realtà una media su molte valutazioni separate, ed è per questo che il numero complessivo può nascondere punti deboli sul task che ti interessa davvero.

Quale punteggio MTEB conta per il RAG?

Per il RAG, leggi la scheda Retrieval, misurata con nDCG@10, non la media complessiva. Il RAG è ricerca semantica sui tuoi documenti, che è esattamente il task di retrieval misurato dalla classifica. Un modello può ottenere un punteggio complessivo forte pur piazzandosi a metà classifica sul retrieval, quindi il retrieval è il segnale affidabile.

Cos'è un buon punteggio di retrieval MTEB?

I modelli di embedding reali ottengono tipicamente 0.4–0.7 di nDCG@10 zero-shot, quindi qualsiasi cosa in quella fascia è normale e spedibile. Uno 0.55 non è un campanello d'allarme. Nessuno arriva a 1.0, perché le query sono ambigue e i documenti rilevanti raramente si allineano in ordine perfetto. Confronta i candidati tra loro, non contro un 1.0 perfetto.

Cos'è nDCG@10?

nDCG@10 misura quanto bene sono ordinati i primi 10 risultati recuperati. Un punteggio di 1.0 significa che ogni documento rilevante è in cima; 0 significa che nessuno lo è. Premia il mettere per prima la risposta migliore, il che conta per il RAG perché il tuo LLM legge solo i pochi chunk in cima che recuperi.

Qual è la differenza tra MTEB e MMTEB (v1 contro v2)?

MMTEB è l'espansione multilingue v2 di MTEB (arXiv 2502.13595, aprile 2025). Amplia il benchmark a oltre 500 task guidati dalla community su oltre 250 lingue e aggiunge retrieval su documenti lunghi, istruzioni e codice. Se il tuo RAG è solo in inglese, resta sulla scheda retrieval originale di MTEB in inglese.

Perché la classifica MTEB cambia così spesso (e perché a volte non carica)?

Le classifiche si ribaltano di continuo perché arrivano sempre nuovi modelli, con oltre 5.000 sottomissioni in crescita. Uno snapshot di marzo non corrisponderà a uno di luglio, quindi fai sempre uno screenshot della classifica con la data. Se la pagina non carica, lo Space di Hugging Face gira su un upgrade CPU ed è spesso lento o instabile.

Devo semplicemente scegliere il modello #1 sulla classifica MTEB?

No. Il modello #1 è un candidato per la shortlist, non un verdetto. La classifica non può vedere il tuo vocabolario di dominio, la dimensione dei chunk o la lingua delle query, tutti fattori che cambiano chi vince. Usa la scheda retrieval per fare una shortlist di 3–4 modelli, poi testa sul tuo corpus. Nel nostro test, il #1 pubblico in classifica è stato superato sul nostro corpus da un modello che non è nemmeno su quella board, e raggiunto da un'opzione self-hosted più economica.

Tag

punteggio MTEB spiegatonDCG@10retrieval MTEBembedding RAGMMTEB

Condividi questo articolo

Il Tuo Prossimo Passo

Hai un progetto in mente? Parliamone.

Prenota una call di 30 minuti. Ti ascoltiamo, capiamo il problema e ti diciamo se possiamo aiutarti.