ai-machine-learning

Score MTEB expliqué : pourquoi le n°1 n'est pas votre meilleur choix RAG

Écrit par Mert Batur
Jul 13, 2026
12 lecture
Score MTEB expliqué : pourquoi le n°1 n'est pas votre meilleur choix RAG

Score MTEB expliqué : pourquoi le n°1 n'est pas votre meilleur choix RAG

Le classement MTEB de Hugging Face référence plus de 5 000 soumissions de modèles d'embedding, et presque chaque semaine, un nouveau venu s'invite à la première place. Voici le piège : ce modèle n°1 n'est probablement pas celui que vous devriez déployer. Le score MTEB que vous regardez est une moyenne sur 8 types de tâches différents, et un seul d'entre eux prédit réellement la qualité du RAG (retrieval-augmented generation) sur vos propres documents. Nous l'avons appris à nos dépens : en avril 2026, notre modèle le mieux classé a perdu face à un modèle moins cher sur notre propre corpus. Ce guide détaille ce que ces chiffres signifient vraiment, quelle colonne mérite votre confiance pour le RAG, et pourquoi le classement n'est qu'un point de départ, pas un verdict.

Points clés

  • MTEB est un benchmark multi-tâches ; le score global « overall » mélange 8 types de tâches en une seule moyenne.
  • Pour le RAG, seul l'onglet Retrieval (nDCG@10) prédit la qualité en production, pas la moyenne globale.
  • Les modèles d'embedding réels obtiennent entre 0.4 et 0.7 en nDCG@10 en zero-shot ; 1.0 correspondrait à un classement parfait.
  • Utilisez MTEB pour présélectionner, puis testez sur votre propre corpus. Le modèle n°1 perd souvent.

Qu'est-ce qu'un score MTEB ?

MTEB signifie Massive Text Embedding Benchmark, une suite ouverte et multi-tâches pour évaluer les modèles d'embedding de texte. Un score MTEB est une métrique par tâche, moyennée en un seul chiffre global sur 8 types de tâches. Il a été introduit par Muennighoff et ses collègues en 2022 (arXiv 2210.07316, publié à EACL 2023).

Le benchmark vit sous la forme d'un Space Hugging Face public où n'importe qui peut soumettre un modèle. Le chiffre que la plupart des gens citent est la « moyenne globale », qui mélange recherche (retrieval), classification, clustering et cinq autres familles de tâches en un seul chiffre. C'est exactement pour cela que le classement affiché est trompeur : un modèle peut remporter la moyenne en étant fort en clustering tout en restant moyen sur la seule tâche dont dépend votre produit. L'article original couvre 8 types de tâches sur environ 58 jeux de données et 112 langues.

Les 8 catégories de tâches MTEB (et ce que chaque score mesure)

MTEB regroupe l'évaluation des embeddings en 8 types de tâches, et chacune est notée avec une métrique différente. Donc « un score MTEB élevé » ne veut presque rien dire tant qu'on ne sait pas quelle tâche on regarde. Un 0.85 en classification (précision) et un 0.85 en recherche (nDCG@10) décrivent des capacités totalement différentes.

Voici le tableau de décodage que personne ne semble publier clairement. La métrique change selon la tâche :

Catégorie de tâcheCe qu'elle testeMétrique
Recherche (Retrieval)Trouver les documents pertinents pour une requête (c'est le RAG)nDCG@10
ClassificationÉtiqueter du texte par catégoriesprécision (accuracy)
ClusteringRegrouper des textes similairesv-measure
Classification de pairesDeux textes correspondent-ils ?précision moyenne
RerankingRéordonner des résultats candidatsMAP
STS (similarité sémantique textuelle)À quel point deux phrases veulent dire la même chosecorrélation de Spearman
Résumé (Summarization)Classer la qualité des résuméscorrélation de Spearman
Bitext miningFaire correspondre des traductions entre languesF1

Ce tableau tâche-métrique est vérifié à partir de l'article MTEB (arXiv 2210.07316). Ce qu'il faut retenir : un modèle qui domine la moyenne globale MTEB peut rester médiocre sur l'unique tâche que fait tourner votre produit.

Quel score MTEB compte vraiment pour le RAG ?

Pour le RAG, ignorez la moyenne globale et lisez l'onglet Retrieval, noté par nDCG@10. Le RAG, c'est de la recherche sémantique sur vos documents, ce qui correspond exactement à la tâche de retrieval. Le STS est vaguement corrélé mais reste secondaire. Un modèle peut remporter le classement global tout en se classant dans la moyenne sur le retrieval, donc la colonne retrieval est celle qui prédit la qualité en production.

Pourquoi le mélange global induit-il en erreur ? Le sous-ensemble retrieval est construit à partir de jeux de données web et QA généraux comme MS MARCO, Natural Questions et HotpotQA. Un modèle qui brille en classification peut afficher une excellente moyenne pendant que son score de retrieval s'affaisse. Ouvrez le classement Hugging Face (huggingface.co/spaces/mteb/leaderboard, consulté le 13/07/2026) et filtrez sur l'onglet retrieval avant de comparer quoi que ce soit.

Si vous scriptez votre propre évaluation, le même filtre s'applique en code :

python
from mteb import MTEB
# ne garder que Retrieval, la colonne qui compte pour le RAG
tasks = MTEB(task_types=["Retrieval"]).tasks

Une fois la colonne retrieval lue, la question suivante est celle du modèle à choisir. Notre article central explique quel modèle d'embedding déployer réellement avec tous les chiffres de benchmark, et si vous cherchez où faire vivre ces vecteurs, notre guide sur les meilleures bases de données vectorielles en 2026 le complète.

Que signifie vraiment un score nDCG@10 ?

nDCG@10 mesure la qualité du classement des 10 premiers résultats retournés. Un score de 1.0 signifie que chaque document pertinent se trouve tout en haut ; 0 signifie qu'aucun ne l'est. Les modèles d'embedding réels se situent autour de 0.4–0.7 en zero-shot, donc un 0.55 est normal, pas cassé.

Pensez-y comme à la notation d'un moteur de recherche. Ce qui compte, c'est que la bonne réponse apparaisse en premier, pas juste quelque part, parce que votre LLM ne lit que les quelques premiers chunks que vous lui fournissez. Personne n'atteint 1.0, parce que les requêtes sont ambiguës et que les documents pertinents s'alignent rarement parfaitement. Donc si un nDCG@10 de 0.55 vous fait paniquer, ne paniquez pas : c'est un score zero-shot normal et tout à fait livrable, et la fourchette 0.4–0.7 est une plage typique (corroborée par zeroentropy.dev), pas une loi de la physique.

On a opposé le n°1 MTEB à notre propre corpus RAG (et il n'a pas gagné)

Nous avons pris le modèle en tête de l'onglet retrieval anglais de MTEB et l'avons confronté à six autres sur notre propre corpus technique de 10 000 documents, évalué face à un ensemble annoté à la main d'environ 120 requêtes. Le leader du classement a affiché un Recall@10 solide, mais il n'a pas fini premier, et deux options moins chères se sont approchées suffisamment pour changer la décision. Avec seulement ~120 requêtes, considérez ces résultats comme indicatifs, pas comme un classement.

Le leader du classement anglais MTEB au moment de notre test était Gemini Embedding 001 (il domine l'instantané d'avril 2026) ; le classement ci-dessous vient du tableau Hugging Face MTEB, et comme les chiffres bougent selon l'instantané, nous datons les nôtres :

Modèle (dimensions)Classement anglais MTEB (HF, 2026)Recall@10 sur notre corpusCoût
Gemini Embedding 001 (3072)domine l'onglet retrieval anglais0.88~$0.15/M
Voyage-4-large (1024)non publié sur le classement public0.89~$0.12/M
Qwen3-Embedding-8B (auto-hébergé)leader des modèles ouverts0.87GPU uniquement
text-embedding-3-large @1024 (tronqué)milieu de classement0.83~$0.13/M

Deux choses que le classement ne nous a pas dites. D'abord, le n°1 public (Gemini) a été devancé sur notre corpus par Voyage-4-large, un modèle qui ne figure même pas sur ce classement. Ensuite, un modèle ouvert auto-hébergé (Qwen3-8B) est arrivé à un cheveu, sans coût au token, et les vecteurs tronqués à 1024 dimensions d'OpenAI ont tenu 0.83 en Recall@10 avec un stockage 3 fois plus petit. MTEB classe le retrieval sur du texte web et QA généraliste ; notre corpus est un vocabulaire technique spécialisé, découpé à sa façon, donc l'ordre se redistribue. C'est tout l'argument en faveur du test sur vos propres données. Notre tutoriel sur comment tester sur votre propre corpus RAG couvre le volet évaluation, et l'article central porte la méthodologie complète.

Pourquoi le n°1 du classement n'est pas votre meilleur choix

Trois choses que le classement ne peut pas voir décident de votre vrai gagnant : le vocabulaire du domaine (le jargon que les jeux de données généraux ne contiennent jamais), la taille des chunks (les passages courts contre longs favorisent des modèles différents), et la langue des requêtes. C'est pour cela que MTEB est un outil de présélection, pas une réponse finale. Le classement vous dit quels modèles sont plausibles, pas lequel correspond à vos données.

Voici les facteurs liés au corpus qui renversent un classement en pratique :

  • Décalage de domaine : les textes juridiques, médicaux ou de code embarquent un vocabulaire que MS MARCO n'a jamais échantillonné.
  • Taille des chunks : un modèle réglé sur des passages courts peut trébucher sur des chunks de 800 tokens.
  • Langue et style des requêtes : des requêtes multilingues ou riches en mots-clés redistribuent l'ordre rapidement.

Dans notre expérience, le workflow fiable est ennuyeux mais il fonctionne : utilisez l'onglet retrieval de MTEB pour présélectionner 3 à 4 candidats, puis mesurez Recall@10 et nDCG@10 sur vos propres documents. Notre tour d'horizon des outils RAG généralistes aide sur le pipeline, et pour une façon structurée d'évaluer des modèles sur vos propres données, cette revue couvre le volet évaluation. Deux lectures connexes à garder sous le coude : faire tourner des modèles d'embedding en local avec Ollama, et un face-à-face entre Voyage, OpenAI et Cohere pour les embeddings.

MTEB vs MMTEB, et pourquoi les chiffres changent sans arrêt

MMTEB est l'extension multilingue v2 de MTEB (arXiv 2502.13595, v2 publiée le 8 avril 2025). Elle ajoute plus de 500 tâches créées par la communauté sur plus de 250 langues, plus les documents longs, le suivi d'instructions et le retrieval de code. Si votre RAG est uniquement en anglais, l'onglet retrieval anglais du MTEB original reste celui à lire. MMTEB compte surtout quand vos requêtes et vos documents couvrent plusieurs langues.

Voici la partie honnête. Les chiffres MTEB se contredisent d'un instantané à l'autre, et même d'une version de l'article à l'autre : l'article original rapporte 56 jeux de données dans une version et 58 dans une autre, donc ne traitez jamais un chiffre isolé comme définitif. Les classements se redistribuent en permanence à mesure que plus de 5 000 soumissions arrivent, donc faites toujours une capture d'écran du classement avec la date de consultation. Et si la page ne charge pas, le Space Hugging Face tourne sur un upgrade CPU et est souvent lent ou capricieux, ce n'est pas votre connexion.

En résumé

MTEB reste le meilleur point de départ public pour choisir un modèle d'embedding, une fois qu'on sait le lire correctement. Lisez l'onglet retrieval, pas la moyenne globale. Considérez un nDCG@10 de 0.4–0.7 comme normal. Présélectionnez avec le classement, puis testez cette présélection sur votre propre corpus, parce que le modèle n°1 perd souvent sur des données réelles (le nôtre a perdu). Quand vous êtes prêt à choisir, retournez vers notre article central sur les modèles d'embedding pour le benchmark complet et nos recommandations. Et si le vrai chantier consiste à brancher le modèle choisi sur un pipeline en production, cette évaluation « présélection puis test » fait partie de notre travail d'intégration IA.

À propos de l'auteur

Mert Batur est cofondateur de Techsy.io, où l'équipe conçoit des agents IA, des systèmes d'automatisation et des pipelines voix/SDR pour des clients B2B. Il écrit sur la stack d'outils LLM que l'équipe Techsy utilise réellement en production.

Retrouvez-le sur LinkedIn.

Questions fréquentes

Qu'est-ce que MTEB ?

MTEB est le Massive Text Embedding Benchmark, une suite ouverte pour évaluer la performance des modèles d'embedding de texte sur 8 types de tâches, dont le retrieval, la classification et le clustering. Introduit par Muennighoff et ses collègues en 2022 (arXiv 2210.07316), il est hébergé comme classement public sur Hugging Face.

Que signifie l'acronyme MTEB ?

MTEB signifie Massive Text Embedding Benchmark. Le nom compte, car « massive » renvoie à l'ampleur des tâches et des jeux de données, pas à un test unique. Votre score MTEB est en réalité une moyenne sur de nombreuses évaluations distinctes, ce qui explique pourquoi le chiffre global peut masquer des faiblesses sur la tâche qui vous intéresse.

Quel score MTEB compte pour le RAG ?

Pour le RAG, lisez l'onglet Retrieval, noté par nDCG@10, pas la moyenne globale. Le RAG, c'est de la recherche sémantique sur vos documents, ce qui correspond exactement à la tâche de retrieval mesurée par le classement. Un modèle peut afficher un bon score global tout en se classant dans la moyenne sur le retrieval, donc le retrieval est le signal fiable.

Qu'est-ce qu'un bon score de retrieval MTEB ?

Les modèles d'embedding réels obtiennent généralement entre 0.4 et 0.7 en nDCG@10 zero-shot, donc tout ce qui se situe dans cette fourchette est normal et livrable. Un 0.55 n'est pas un signal d'alarme. Personne n'atteint 1.0, parce que les requêtes sont ambiguës et que les documents pertinents s'alignent rarement dans un ordre parfait. Comparez les candidats entre eux, pas face à un 1.0 parfait.

Qu'est-ce que le nDCG@10 ?

Le nDCG@10 mesure la qualité du classement des 10 premiers résultats retournés. Un score de 1.0 signifie que chaque document pertinent se trouve tout en haut ; 0 signifie qu'aucun ne l'est. Il récompense le fait de placer la meilleure réponse en premier, ce qui compte pour le RAG puisque votre LLM ne lit que les quelques premiers chunks que vous récupérez.

Quelle est la différence entre MTEB et MMTEB (v1 vs v2) ?

MMTEB est l'extension multilingue v2 de MTEB (arXiv 2502.13595, avril 2025). Elle fait grossir le benchmark à plus de 500 tâches créées par la communauté sur plus de 250 langues, et ajoute les documents longs, les instructions et le retrieval de code. Si votre RAG est uniquement en anglais, restez sur l'onglet retrieval anglais du MTEB original.

Pourquoi le classement MTEB change-t-il aussi souvent (et pourquoi ne charge-t-il pas) ?

Les classements se redistribuent en permanence parce que de nouveaux modèles sont soumis en continu, avec plus de 5 000 entrées et une croissance constante. Un instantané de mars ne correspondra pas à celui de juillet, donc faites toujours une capture d'écran du classement avec la date. Si la page ne charge pas, le Space Hugging Face tourne sur un upgrade CPU et il est fréquemment lent ou capricieux.

Faut-il simplement choisir le modèle n°1 du classement MTEB ?

Non. Le modèle n°1 est un candidat à présélectionner, pas un verdict. Le classement ne peut pas voir votre vocabulaire de domaine, la taille de vos chunks ou la langue de vos requêtes, autant de facteurs qui changent le modèle gagnant. Utilisez l'onglet retrieval pour présélectionner 3 à 4 modèles, puis testez sur votre corpus. Dans notre test, le n°1 public a été devancé sur notre propre corpus par un modèle qui ne figure même pas sur ce classement, et égalé par une option moins chère et auto-hébergée.

Tags

score MTEB expliquénDCG@10recherche MTEBembeddings RAGMMTEB

Partager cet article

Démarrez Votre Projet

Prêt à construire quelque chose d'extraordinaire ?

Transformons votre vision en réalité. Notre équipe est prête à vous aider à créer un logiciel qui fait la différence.