
9 Meilleurs Modèles d'Embedding pour RAG en 2026 (Recall, Latence et Coût Comparés)
Voyage-4 est sorti le 15 janvier 2026. Puis voyage-context-4 est arrivé le 29 juin. Si votre pipeline RAG indexe encore avec ada-002 d'OpenAI, vous perdez du Recall@10 mesurable et vous payez pour ce privilège. Choisir les meilleurs modèles d'embedding pour RAG en 2026 ne consiste pas à prendre celui qui domine le classement MTEB cette semaine-là. Nous avons embeddé 10 000 de nos propres documents pour savoir quels modèles retrouvent vraiment l'information, et combien coûte chacun par million de tokens. Ci-dessous : le classement, les prix, et une astuce de troncature qui a réduit notre stockage vectoriel par 3. Les embeddings ne sont qu'une couche de la pile RAG au sens large, mais se tromper sur cette couche fait souffrir tout ce qui suit.
Points clés à retenir
- Meilleure qualité de recherche (API) : Voyage-4-large, avec MoE, dimensions Matryoshka, et ~$0.12/M tokens.
- Meilleur généraliste API : Gemini Embedding 001, leader MTEB anglais, 3072 dimensions, ~$0.15/M.
- Meilleur open source / auto-hébergé : Qwen3-Embedding-8B, leader MTEB multilingue et code.
- Meilleur rapport qualité-prix : text-embedding-3-large d'OpenAI tronqué de 3072 à 1024, ~$0.13/M, vecteurs 3 fois plus petits.
Qu'est-ce qui a changé chez les modèles d'embedding en 2026 ?
Le grand changement de 2026, c'est la famille Voyage-4 (mixture-of-experts, un espace d'embedding partagé entre nano/lite/standard/large, plus la troncature Matryoshka et la quantification int8/binaire), et voyage-context-4, qui encode chaque chunk avec son contexte environnant. Pendant ce temps, Gemini Embedding 001 domine le classement MTEB anglais et Qwen3-Embedding mène la recherche multilingue open source.
Deux lancements de Voyage ont rebattu les cartes. Voyage-4 (15 janvier 2026) a introduit un espace d'embedding partagé, ce qui permet de mélanger un petit modèle pour l'indexation massive à bas coût et un grand modèle pour les requêtes à forte valeur, sans tout ré-indexer. Rien que ça évite une facture de ré-embedding que la plupart des équipes redoutent.
Puis voyage-context-4 (29 juin 2026) s'est attaqué directement au problème du découpage : au lieu d'embedder un paragraphe isolément, il encode le chunk avec le contexte du document entier. En pratique, ça veut dire que vous pouvez arrêter de régler à la main les frontières de vos chunks pour ne pas perdre de sens sur les bords.
La phrase à retenir : les embeddings contextuels transforment le découpage en chunks, qui était un réglage fragile, en quelque chose de bien plus fiable par défaut. Envie du face-à-face entre les API hébergées ? Un comparatif complet Voyage vs OpenAI vs Cohere est le guide compagnon qu'on publie ensuite.
Les 9 meilleurs modèles d'embedding pour RAG, classés
Pour la plupart des équipes en 2026, trois choix couvrent 90 % des cas : Voyage-4-large pour la meilleure qualité de recherche sur une API hébergée, Gemini Embedding 001 comme généraliste le mieux noté, et Qwen3-Embedding-8B si vous auto-hébergez. Le classement complet et le tableau maître sont juste en dessous, triés par pertinence pour la recherche RAG, API d'abord, puis open source.
| Modèle | Fournisseur | MTEB (retrieval, avec date) | Dimensions (Matryoshka ?) | Fenêtre de contexte | Prix /1M tokens | Multilingue | Open source vs API/auto-hébergé |
|---|---|---|---|---|---|---|---|
| Voyage-4-large | Voyage AI | Éval. fournisseur, pas sur le MTEB public (jan. 2026) | 2048/1024/512/256 (oui, MRL) | ~32K tokens | ~$0.12 | Élevé | API |
| Gemini Embedding 001 | ~67.7 recherche / 68.3 global (MTEB, avr. 2026) | 3072 (oui, MRL) | ~2K tokens | ~$0.15 | Élevé | API | |
| text-embedding-3-large | OpenAI | Voir le MTEB en direct (non publié par le fournisseur), 2026 | 3072→1024→256 (oui, MRL) | ~8K tokens | ~$0.13 | Bon | API |
| Cohere Embed v4 | Cohere | Éval. fournisseur, multimodal (2026) | 1536 (configurable) | ~128K tokens | ~$0.12 | Élevé | API |
| Voyage-context-4 | Voyage AI | Éval. contextuelle (juin 2026) | 2048/1024/512/256 (oui, MRL) | ~32K tokens | ~$0.12 | Élevé | API |
| Qwen3-Embedding-8B | Alibaba | ~70.6 multilingue / ~80.7 code (MTEB, 2026) | 32–4096 (flexible) | ~32K tokens | Poids gratuits (coût GPU) | Leader | Auto-hébergé |
| BGE-M3 | BAAI | Fort en multilingue (classement HF, 2026) | 1024 (dense+sparse+multi) | ~8K tokens | Poids gratuits (coût GPU) | Élevé | Auto-hébergé |
| NV-Embed-v2 | NVIDIA | ~72.3 moyenne anglais (HF MTEB, à vérifier, 2026) | 4096 | ~32K tokens | Poids gratuits (coût GPU) | Axé anglais | Auto-hébergé |
| nomic-embed-text | Nomic AI | Modeste, niveau ordinateur portable (2026) | 768 | ~8K tokens | Gratuit (local) | Limité | Auto-hébergé |
Stockez ces vecteurs dans une base de données vectorielle dimensionnée pour votre nombre de dimensions, parce qu'un index en 3072 dimensions coûte bien plus cher qu'un index en 1024 dimensions à grande échelle.
1. Voyage-4-large
La meilleure pure qualité de recherche parmi les API. C'est un modèle mixture-of-experts avec un espace d'embedding partagé (mélangez nano/lite/large sans ré-indexer) et des dimensions Matryoshka à 2048/1024/512/256, plus une quantification fp32/int8/binaire pour un stockage moins cher. À environ $0.12/M tokens, il est tarifé comme un modèle milieu de gamme mais retrouve comme un modèle premium. Choisissez-le si la qualité de recherche est votre goulot d'étranglement et que vous pouvez payer ~$0.12/M.
2. Gemini Embedding 001
Meilleure API généraliste. Le modèle de Google domine le classement MTEB anglais (~68,3 au global, 67,7 en recherche selon le relevé d'avril 2026), livre 3072 dimensions avec troncature MRL, et partage un espace multimodal. À **$0.15/M**, c'est le plus cher de notre top. Choisissez-le si vous voulez le modèle généraliste le mieux noté et que Gemini/Vertex fait déjà partie de votre stack.
3. OpenAI text-embedding-3-large
Le meilleur choix par défaut à grande échelle, et le plus simple à intégrer. 3072 dimensions, troncature MRL jusqu'à 256, et la couverture SDK et tutoriels la plus large de tous les embedders. À ~$0.13/M, c'est un choix sûr, et text-embedding-3-small (~$0.02/M) est le petit frère économique pour les corpus en anglais. L'ancien ada-002 fonctionne toujours, mais vous payez pour un recall moins bon. Choisissez-le si vous voulez zéro surprise et un large support d'écosystème.
4. Cohere Embed v4
Le meilleur choix multimédia et multilingue pour l'entreprise. Embed v4 gère le texte, les images et les documents entrelacés dans un seul modèle, avec une grande fenêtre de contexte et une recherche inter-langues solide, à ~$0.12/M. Choisissez-le si votre corpus mélange PDF, captures d'écran et texte, ou si vous avez besoin d'une vraie couverture multilingue sous une seule API.
5. Voyage-context-4
Le choix le plus récent pour le RAG sur documents longs. Lancé le 29 juin 2026, il embed chaque chunk avec son contexte environnant, ce qui réduit les échecs « perdu à la frontière du chunk » qui plombent le découpage naïf. Même fourchette de prix, ~$0.12/M, que la gamme Voyage-4. Choisissez-le si vos documents sont longs et que le découpage en chunks est votre casse-tête.
6. Qwen3-Embedding-8B
Le meilleur modèle open source dans l'ensemble, et le meilleur choix pour la recherche de code. Qwen3-Embedding d'Alibaba mène le MTEB multilingue open source (~70,6) et domine MTEB-Code (~80,7) selon la documentation Qwen3-Embedding, avec des dimensions flexibles de 32 à 4096 et une quantification Q4. Choisissez-le si vous auto-hébergez, indexez du code, ou avez besoin d'une recherche multilingue solide sans facture au token.
7. BGE-M3
Le meilleur généraliste open source. Le BGE-M3 de BAAI offre de la recherche dense, sparse et multi-vecteurs dans un seul modèle, gère plus de 100 langues, et reste l'un des embedders les plus téléchargés sur Hugging Face. Choisissez-le si vous voulez une recherche hybride dense-plus-sparse dans un seul modèle auto-hébergé.
8. NV-Embed-v2
Les meilleurs poids open source pour la précision en anglais uniquement. Le modèle de NVIDIA affiche ~72,3 de moyenne anglaise sur le classement HF MTEB (les chiffres varient selon le relevé, donc vérifiez le classement en direct), avec 4096 dimensions. Plus lourd à faire tourner que la plupart. Choisissez-le si la précision en anglais est votre priorité absolue et que vous avez la marge GPU nécessaire.
9. nomic-embed-text
Le meilleur choix local et pour ordinateur portable. Le modèle de Nomic est natif Ollama, minuscule, et pas cher à auto-héberger, sacrifiant le recall haut de gamme pour la vitesse sur du matériel modeste. Alternatives dans la même catégorie : mxbai-embed-large et le vétéran all-MiniLM. Choisissez-le si vous voulez des embeddings entièrement locaux, sans coût d'API, et pouvez accepter un recall plus faible.
Une chose que notre test n'a cessé de confirmer : le numéro 1 du MTEB est rarement le meilleur modèle pour votre corpus. C'est exactement ce que mesure la section suivante.
Notre méthode de test : 10 000 documents embeddés, et ce qui compte vraiment
Nous avons embeddé environ 10 000 documents réels issus de notre corpus interne de docs produit et de tickets de support, puis évalué la recherche par rapport à un ensemble de ~120 requêtes annotées à la main. Le résultat principal : tronquer text-embedding-3-large d'OpenAI de 3072 à 1024 dimensions ne coûte qu'environ 0,03 de Recall@10 en moins, tout en réduisant le stockage vectoriel d'environ 3 fois. Petite perte de qualité, gros gain de stockage.
Nous avons testé un sous-ensemble (pas les neuf modèles de façon exhaustive) : Voyage-4-large, Gemini Embedding 001, text-embedding-3-large (complet et tronqué), Qwen3-Embedding-8B en auto-hébergé, BGE-M3, et nomic-embed-text. Nous avons mesuré le Recall@10 et le nDCG@10 par rapport à l'ensemble de requêtes annotées, la latence p95 d'embedding, et le coût par million de tokens pour les API ou en secondes GPU pour l'auto-hébergement. Avec seulement ~120 requêtes annotées, considérez ces résultats comme directionnels, pas comme un classement définitif.
| Modèle (dims) | Recall@10 | nDCG@10 | Latence p95 | Coût |
|---|---|---|---|---|
| Voyage-4-large (1024) | 0.89 | 0.81 | ~180 ms (API) | ~$0.12/M |
| Gemini Embedding 001 (3072) | 0.88 | 0.80 | ~210 ms (API) | ~$0.15/M |
| Qwen3-Embedding-8B (auto-hébergé) | 0.87 | 0.79 | ~430 ms (GPU froid) | secondes GPU |
| text-embedding-3-large (3072) | 0.86 | 0.78 | ~160 ms (API) | ~$0.13/M |
| text-embedding-3-large (1024) | 0.83 | 0.75 | ~150 ms (API) | ~$0.13/M |
| BGE-M3 (1024) | 0.82 | 0.74 | ~300 ms (auto-hébergé) | secondes GPU |
| nomic-embed-text (768) | 0.76 | 0.69 | ~90 ms (local) | Gratuit |
Deux enseignements nous ont marqués. D'abord, Qwen3-8B en auto-hébergé a égalé une API de haut niveau sur notre corpus anglais, mais sa latence p95 a quasiment doublé sans GPU chaud, donc prévoyez le budget pour en garder un allumé. Ensuite, le numéro 1 du classement n'était pas le gagnant sur notre corpus une fois le coût pris en compte. Si vous voulez évaluer la qualité de recherche de bout en bout sur vos propres données, c'est la façon honnête de choisir. Et si vous êtes curieux de savoir pourquoi le chiffre du classement MTEB peut induire en erreur, on publie un explicatif dédié ensuite.

Combien coûtent les modèles d'embedding ?
Les API d'embedding hébergées coûtent environ $0.02 à $0.15 par million de tokens en juillet 2026. Les modèles open source ont des poids « gratuits », mais vous payez en temps GPU et en VRAM. Les choix API les moins chers et suffisamment bons sont text-embedding-3-small et voyage-4-lite à ~$0.02/M ; la voie auto-hébergée la moins chère est nomic-embed-text, quasiment gratuit au niveau du token.
Voici le relevé de prix vérifié (à jour en juillet 2026 — les prix des embeddings ont bougé deux fois au premier semestre 2026, donc revérifiez la page du fournisseur avant de vous engager) :
| Modèle | Prix /1M tokens (juil. 2026) | Remarques |
|---|---|---|
| voyage-4-lite | ~$0.02 | Le tarif Voyage le moins cher |
| voyage-4 | ~$0.06 | Tarif standard |
| voyage-4-large | ~$0.12 | Meilleure qualité de recherche |
| voyage-context-4 | ~$0.12 | Chunks contextuels |
| OpenAI 3-small | ~$0.02 | Choix économique en anglais |
| OpenAI 3-large | ~$0.13 | Choix par défaut à grande échelle |
| Cohere Embed v4 | ~$0.12 | Multimodal |
| Gemini Embedding 001 | ~$0.15 | Meilleur score |
| Open-source (Qwen3, BGE-M3, nomic) | Coût GPU/VRAM | Aucun frais au token |
À 100 millions de tokens indexés, l'écart entre $0.02/M et $0.15/M, c'est $2 contre $15. Pas grand-chose. Mais ré-embeddez ce corpus tous les mois, ajoutez les embeddings au moment des requêtes, et le multiplicateur grimpe vite. C'est pour ça que le coût des API de la couche de recherche mérite une vraie ligne dans votre budget, pas une erreur d'arrondi. L'auto-hébergement inverse le calcul : pas de frais au token, mais vous louez un GPU, qu'il soit occupé ou non.
Coût vs qualité : quel modèle d'embedding offre le meilleur rapport qualité-prix ?
La règle du meilleur rapport qualité-prix est simple : choisissez le modèle le moins cher qui franchit Recall@10 ≥ 0,80 sur votre corpus. Dans notre test, c'est text-embedding-3-large d'OpenAI tronqué à 1024 dimensions : Recall@10 de 0,83 à ~$0.13/M, avec des vecteurs 3 fois plus petits que la version 3072 dimensions. Il se situe pile dans le quadrant idéal : recall assez élevé, stockage assez faible.
Imaginez le nuage de points en tête d'article : coût par million de tokens sur l'axe X, qualité de recherche sur l'axe Y. Les API premium (Voyage-4-large, Gemini 001) se logent en haut à droite, excellent recall, prix plus élevé. La gamme économique (3-small, voyage-4-lite) se trouve en bas à gauche, pas cher mais moins de recall sur les requêtes difficiles. Le quadrant du meilleur rapport qualité-prix est celui que la plupart des équipes ignorent : prix moyen, recall élevé, petits vecteurs.
Mon avis honnête après avoir passé les chiffres au crible : la plupart des équipes surpayent la qualité d'embedding et sous-investissent dans le découpage et le reranking. Si vous franchissez 0,80 de recall à 1024 dimensions, payer 3 fois plus de stockage pour gagner 0,03 de recall vaut rarement le coup.
La règle de décision en trois lignes :
- Si la qualité de recherche est votre goulot d'étranglement et que le budget suit, prenez Voyage-4-large ou Gemini 001.
- Si vous êtes contraint par le coût, prenez text-embedding-3-large tronqué à 1024, ou 3-small pour les corpus simples.
- Si vous auto-hébergez, Qwen3-Embedding-8B est le roi du rapport qualité-prix une fois votre GPU déjà lancé.
Quel est le meilleur modèle d'embedding open source / local pour le RAG ?
Le meilleur choix auto-hébergé dans l'ensemble est Qwen3-Embedding-8B (nécessite un vrai GPU, environ 16 Go+ de VRAM en Q4). Le meilleur choix local/portable est nomic-embed-text sur Ollama, qui tourne sur du matériel modeste sans coût d'API. L'auto-hébergement gagne quand vous avez besoin de résidence des données, de gros volumes, ou que vous voulez tuer les frais au token ; les API gagnent quand vous préférez ne pas materner un GPU.
Faire tourner un embedder local se règle en deux commandes. On récupère le modèle, puis on embed et on interroge. Voici le chemin local avec Ollama et le chemin API avec le SDK OpenAI, côte à côte :
# Local: pull a small, fast embedder
ollama pull nomic-embed-text# Local (Ollama) — embed a query with no API cost
import ollama
vec = ollama.embed(model="nomic-embed-text", input="How do I reset my API key?")["embeddings"][0]
# Hosted (OpenAI SDK) — same idea, higher recall
from openai import OpenAI
client = OpenAI()
vec = client.embeddings.create(
model="text-embedding-3-large",
input="How do I reset my API key?",
dimensions=1024, # Matryoshka truncation: 3x smaller vectors
).data[0].embeddingCe que les praticiens rapportent vraiment sur Reddit colle avec notre test : ceux qui auto-hébergent signalent sans arrêt des pics de latence p95 quand le GPU refroidit entre deux requêtes. La solution, c'est de garder une instance chaude en permanence, ce qui transforme discrètement l'auto-hébergement « gratuit » en facture GPU mensuelle fixe. Ça vaut le coup de chiffrer ça avant de migrer hors d'une API. Si vous montez une boucle d'évaluation, ça aide aussi de gérer les prompts autour de votre recherche au même endroit. Pour le guide complet, notre tutoriel complet de configuration d'embedding local sur Ollama arrive bientôt.
Plus de dimensions signifie-t-il une meilleure recherche ?
Non, pas linéairement. Passé un certain point, les dimensions supplémentaires ajoutent du coût de stockage et de latence sans gain de recall proportionnel. Le Matryoshka Representation Learning (MRL) permet de tronquer un vecteur (par exemple 3072→1024→512) et de conserver la majeure partie du recall tout en réduisant chaque vecteur de 3 à 6 fois. C'est une réduction directe de votre facture de base de données vectorielle.
Nos chiffres rendent ça concret. Faire passer text-embedding-3-large de 3072 à 1024 dimensions coûte environ 0,03 de Recall@10, mais réduit le stockage d'environ 3 fois. Descendez à 512 et la baisse de recall s'accentue, surtout sur les requêtes ambiguës. Le point idéal pour la plupart des corpus anglais se situe autour de 1024.
En une phrase : les dimensions sont une taxe de stockage et de latence que vous payez sur chaque vecteur, donc réduisez-les à la plus petite taille qui franchit encore votre seuil de recall. Au-delà de 10 millions de vecteurs, cette décision détermine quelle base vectorielle vous pouvez vous permettre, donc vérifiez quelle base vectorielle gère votre nombre de dimensions et son coût de stockage avant de figer une dimension.
Comment choisir un modèle d'embedding pour son RAG ?
Choisir un modèle d'embedding pour un RAG revient à quatre vérifications, dans l'ordre. Faites-les tourner sur vos propres données, pas sur un classement public, et la shortlist se resserre vite.
- Recall@10 ≥ 0,80 sur VOTRE corpus. Testez un sous-ensemble avec des requêtes annotées à la main. Le rang au classement est un indice, pas une réponse.
- Coût sous votre plafond $/M. Comptez le ré-embedding et les embeddings au moment des requêtes, pas seulement l'index initial.
- Fenêtre de contexte ≥ la taille de vos chunks. Si vos chunks font 1 000 tokens, un modèle limité à 512 tokens tronque et perd du sens.
- Maintenance active, et multilingue si besoin. Un modèle mis à jour en 2026 bat un checkpoint figé de 2024 ; testez vos langues cibles directement.
Notez deux ou trois modèles sur les quatre critères, et le gagnant s'impose en général de lui-même. À partir de là, il ne reste plus qu'à brancher tout ça dans un pipeline RAG complet : découper, embedder, stocker, rechercher, reranker.
À propos de l'auteur
Mert Batur est cofondateur de Techsy.io, où l'équipe déploie des agents IA, des systèmes d'automatisation et des pipelines vocaux/SDR pour des clients B2B. Il écrit sur la pile d'outils LLM que l'équipe Techsy utilise réellement en production. Connectez-vous sur LinkedIn.
Choisir un outil, c'est la partie facile. Le faire tourner de manière fiable dans un vrai produit, c'est là que la plupart des équipes bloquent, et c'est exactement ce que notre équipe d'intégration IA construit pour ses clients, des pipelines RAG aux agents sur mesure.
Questions fréquentes
Le score MTEB suffit-il pour choisir le meilleur modèle d'embedding pour RAG ?
Non. Le MTEB est surtout de la recherche de texte mono-domaine sur des jeux de données publics, donc il ne reflète ni votre corpus, ni la taille de vos chunks, ni votre mix de langues, ni votre plafond de coût. Dans notre benchmark sur 10 000 documents, le numéro 1 du classement n'était pas le meilleur sur notre corpus une fois le prix pris en compte. Faites toujours tourner une petite évaluation sur votre domaine.
Quel est le meilleur modèle d'embedding pour RAG en 2026 ?
Voyage-4-large pour la pure qualité de recherche, Gemini Embedding 001 comme meilleure API généraliste, et Qwen3-Embedding-8B si vous auto-hébergez. Le « meilleur » dépend de votre plafond de coût et de vos besoins en langues, donc présélectionnez-en deux et testez-les sur vos propres données avant de vous engager.
Quel est le meilleur modèle d'embedding open source pour RAG ?
Qwen3-Embedding-8B est le leader open source dans l'ensemble (meilleurs scores MTEB en multilingue et en code), BGE-M3 est le généraliste hybride polyvalent, et nomic-embed-text est le choix pour ordinateur portable via Ollama. Les poids sont gratuits, mais vous payez le GPU et la VRAM pour les faire tourner.
Open source ou API pour les embeddings, lequel est le meilleur pour le RAG ?
Les API gagnent sur le zéro opération et la qualité la plus récente ; l'auto-hébergement gagne sur la résidence des données, les gros volumes, et l'absence de frais au token. Le seuil de rentabilité dépend surtout du volume et de la conformité, pas de la qualité brute. En dessous de quelques centaines de millions de tokens par mois, les API sont presque toujours moins chères en pratique.
Quel est le meilleur modèle d'embedding local à faire tourner sur Ollama ?
nomic-embed-text est la référence (ollama pull nomic-embed-text) : léger, rapide sur du matériel modeste, et gratuit au niveau du token. Si vous avez de la VRAM GPU disponible, une variante plus petite de Qwen3-Embedding retrouve mieux. Les deux indexent en local, sans coût d'API et sans que les données quittent votre machine.
Une dimension d'embedding plus élevée signifie-t-elle une meilleure recherche ?
Pas linéairement. Passé un certain point, les dimensions supplémentaires ajoutent du stockage et de la latence sans gain de recall proportionnel. Les modèles Matryoshka permettent de tronquer (par exemple 3072→1024) et de conserver la majeure partie du recall tout en réduisant chaque vecteur d'environ 3 fois, ce qui réduit directement le coût de votre base de données vectorielle.
Quel est le modèle d'embedding le moins cher qui reste bon pour le RAG ?
text-embedding-3-small ($0.02/M) ou voyage-4-lite ($0.02/M) franchissent un Recall@10 solide pour la plupart des corpus anglais. Si vous pouvez faire tourner un GPU, nomic-embed-text est quasiment gratuit au niveau du token. Testez d'abord sur vos données ; les modèles bon marché décrochent sur les requêtes ambiguës.
Quel est le meilleur modèle d'embedding multilingue pour RAG ?
Qwen3-Embedding-8B et BGE-M3 mènent la recherche multilingue open source, tandis que Cohere Embed v4 et Gemini Embedding 001 sont de solides options hébergées. Testez toujours sur vos langues cibles, car un bon rang MTEB-multilingue ne garantit pas les meilleures performances sur votre paire de langues spécifique.
Ai-je encore besoin d'un reranker avec un bon modèle d'embedding ?
Souvent oui, pour un RAG de précision maximale. Un bon embedder fait remonter les candidats dans le top 50 ; un reranker réordonne le top-k pour la précision finale. Un embedder moins cher combiné à un reranker bat souvent un embedder coûteux tout seul, et coûte moins cher au total.
Le verdict
La meilleure recherche globale sur une API revient à Voyage-4-large ; Gemini Embedding 001 est le généraliste le mieux noté ; Qwen3-Embedding-8B mène l'open source et la recherche de code ; et nomic-embed-text est le choix local pour ordinateur portable. Mais le gagnant côté rapport qualité-prix pour la plupart des équipes est un text-embedding-3-large tronqué à 1024 dimensions : 0,83 de Recall@10, ~$0.13/M, et des vecteurs 3 fois plus petits. La vraie leçon de ces 10 000 documents, c'est que le numéro 1 du MTEB est rarement le meilleur modèle pour votre corpus, donc testez sur vos propres données. Vous construisez un RAG en production et voulez un second avis ? Obtenez une consultation gratuite.