
Pontuação MTEB Explicada: Por que o Modelo #1 Não é a Melhor Escolha para RAG
A tabela de classificação MTEB da Hugging Face lista mais de 5.000 submissões de modelos de incorporação (embedding), e quase todas as semanas um novo modelo ascende ao topo. Eis a armadilha: esse modelo nº 1 provavelmente não é aquele que deve colocar em produção. A pontuação MTEB que está a observar é uma média entre 8 tipos diferentes de tarefas, e apenas uma delas prevê o quão bem a geração aumentada por recuperação (RAG) funciona nos seus documentos. Aprendemos isto da maneira difícil. Em abril de 2026, a nossa escolha melhor classificada perdeu para um modelo mais barato no nosso próprio corpus. Este guia explica o que os números significam realmente, em que coluna confiar para RAG e por que razão a tabela de classificação é um ponto de partida, não um veredicto.
Pontos Principais
- O MTEB é um benchmark de múltiplas tarefas; a pontuação "geral" combina 8 tipos de tarefas numa única média.
- Para RAG, apenas a subsecção de Recuperação (nDCG@10) prevê a qualidade em produção, não a média geral.
- Os modelos de incorporação reais obtêm entre 0,4–0,7 de nDCG@10 em zero-shot; 1,0 significaria uma classificação perfeita.
- Utilize o MTEB para criar uma lista curta e, em seguida, teste no seu próprio corpus. O modelo nº 1 perde frequentemente.
O que é uma Pontuação MTEB?
MTEB significa Massive Text Embedding Benchmark, um conjunto aberto e de múltiplas tarefas para avaliar modelos de incorporação de texto. Uma pontuação MTEB é uma métrica por tarefa, calculada como uma média global entre 8 tipos de tarefas. Foi introduzido por Muennighoff e colegas em 2022 (arXiv 2210.07316, publicado na EACL 2023).
O benchmark existe como um Espaço público na Hugging Face, onde qualquer pessoa pode submeter um modelo. O número que a maioria das pessoas cita é a "média geral", que combina recuperação, classificação, agrupamento (clustering) e outras cinco famílias de tarefas num único valor. É exatamente por isso que a classificação principal engana: um modelo pode vencer na média por ser forte em agrupamento, enquanto tem um desempenho apenas mediano na única tarefa de que o seu produto depende. O artigo original abrange 8 tipos de tarefas em aproximadamente 58 conjuntos de dados e 112 idiomas.
As 8 Categorias de Tarefas do MTEB (e o que cada Pontuação Mede)
O MTEB agrupa a avaliação de incorporações em 8 tipos de tarefas, e cada uma é avaliada por uma métrica diferente. Assim, "uma pontuação MTEB alta" não significa quase nada até saber qual tarefa está a ler. Um 0,85 em classificação (precisão) e um 0,85 em recuperação (nDCG@10) descrevem capacidades completamente diferentes.
Eis a tabela decodificadora que ninguém parece publicar de forma clara. A métrica muda conforme a tarefa:
| Categoria de tarefa | O que testa | Métrica |
|---|---|---|
| Recuperação | Encontrar documentos relevantes para uma consulta (isto é RAG) | nDCG@10 |
| Classificação | Rotular texto em categorias | precisão (accuracy) |
| Agrupamento (Clustering) | Agrupar textos semelhantes | v-measure |
| Classificação de Pares | Dois textos correspondem? | precisão média (average precision) |
| Reordenação (Reranking) | Reordenar resultados candidatos | MAP |
| STS (similaridade textual semântica) | Quão similares são os significados de duas frases | correlação de Spearman |
| Sumarização | Classificar a qualidade do resumo | correlação de Spearman |
| Mineração de bitexto | Correspondência de traduções entre idiomas | F1 |
O mapa tarefa-métrica acima foi verificado a partir do artigo MTEB (arXiv 2210.07316). A principal conclusão: um modelo que lidera a média geral do MTEB pode ainda ser mediano na única tarefa em que o seu produto opera.
Qual Pontuação MTEB Realmente Importa para RAG?
Para RAG, ignore a média geral e leia a subsecção de Recuperação, avaliada por nDCG@10. RAG é pesquisa semântica sobre os seus documentos, que é exatamente a tarefa de recuperação. STS está vagamente correlacionado, mas é secundário. Um modelo pode vencer a tabela de classificação geral enquanto fica a meio da tabela em recuperação, portanto, a coluna de recuperação é a que prevê a qualidade em produção.
Por que razão a mistura geral engana? O subconjunto de recuperação é construído a partir de conjuntos de dados gerais da web e de perguntas e respostas, como MS MARCO, Natural Questions e HotpotQA. Um modelo que se destaca em classificação pode obter uma ótima média enquanto o seu número de recuperação baixa. Abra a tabela de classificação da Hugging Face (huggingface.co/spaces/mteb/leaderboard, acedido em 13-07-2026) e filtre pela aba de recuperação antes de comparar qualquer coisa.
Se criar a sua própria avaliação por script, aplica-se o mesmo filtro no código:
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasksDepois de ler a coluna de recuperação, a próxima questão é qual modelo escolher. O nosso artigo no hub explica qual modelo de incorporação realmente colocar em produção com os números completos do benchmark, e se estiver a escolher onde armazenar esses vetores, o nosso guia sobre as melhores bases de dados vetoriais em 2026 complementa-o.
O que Significa Realmente uma Pontuação nDCG@10?
nDCG@10 mede quão bem os 10 principais resultados recuperados estão classificados. Uma pontuação de 1,0 significa que todos os documentos relevantes estão no topo absoluto; 0 significa que nenhum deles está. Os modelos de incorporação reais situam-se geralmente entre 0,4–0,7 em zero-shot, por isso, um 0,55 é normal, não defeituoso.
Pense nisso como avaliar uma caixa de pesquisa. Importa-se se a resposta correta aparecer em primeiro lugar, e não apenas algures, porque o seu LLM lê apenas os primeiros fragmentos que lhe fornece. Ninguém atinge 1,0, porque as consultas são ambíguas e os documentos relevantes raramente se alinham perfeitamente. Portanto, se um nDCG@10 de 0,55 o entrar em pânico, não o faça; essa é uma pontuação zero-shot normal e viável para produção, e a faixa de 0,4–0,7 é um intervalo típico (corroborado por zeroentropy.dev), não uma lei da física.
Colocámos o Nº 1 do MTEB Contra o Nosso Próprio Corpus RAG (e Ele Não Ganhou)
Pegámos no modelo que liderava a aba de recuperação em inglês do MTEB e executámos-lo contra outros seis no nosso próprio corpus de 10.000 documentos técnicos, avaliado contra um conjunto rotulado manualmente de ~120 consultas. O líder da tabela de classificação obteve um Recall@10 forte, mas não terminou em primeiro lugar, e duas opções mais baratas ficaram perto o suficiente para alterar a decisão. Com apenas ~120 consultas, trate estes resultados como indicativos de direção, não como uma tabela de classificação definitiva.
O líder da tabela de classificação em inglês do MTEB na nossa janela de teste foi o Gemini Embedding 001 (lidera a captura de abril de 2026); as classificações abaixo provêm da tabela MTEB da Hugging Face, e como os números mudam conforme a captura, citamos os nossos com uma data:
| Modelo (dims) | Classificação MTEB Inglês (HF, 2026) | Recall@10 no nosso corpus | Custo |
|---|---|---|---|
| Gemini Embedding 001 (3072) | lidera a aba de recuperação em inglês | 0,88 | ~$0,15/M |
| Voyage-4-large (1024) | não publicado na tabela pública | 0,89 | ~$0,12/M |
| Qwen3-Embedding-8B (auto-hospedado) | líder entre modelos abertos | 0,87 | Apenas GPU |
| text-embedding-3-large @1024 (truncado) | nível intermédio | 0,83 | ~$0,13/M |
Duas coisas que a tabela de classificação não nos disse. Primeiro, o nº 1 público (Gemini) foi ultrapassado no nosso corpus pelo Voyage-4-large, um modelo que nem sequer publica nessa tabela. Segundo, um modelo aberto auto-hospedado (Qwen3-8B) ficou muito próximo sem custo por token, e os vetores truncados de 1024 dimensões da OpenAI mantiveram um Recall@10 de 0,83 com armazenamento 3x menor. O MTEB classifica a recuperação em texto geral da web e de QA; o nosso corpus tem vocabulário técnico especializado fragmentado à sua maneira, por isso a ordem muda. Esse é todo o argumento para testar nos seus próprios dados. O nosso guia sobre como testar no seu próprio corpus RAG cobre a parte de avaliação, e o artigo do hub contém a metodologia completa.
Por que o Nº 1 da Tabela de Classificação Não é a Sua Melhor Escolha
Três fatores que a tabela de classificação não consegue ver decidem o seu verdadeiro vencedor: vocabulário de domínio (jargão que os conjuntos de dados gerais nunca contêm), tamanho do fragmento (chunk) (passagens curtas versus longas favorecem modelos diferentes) e idioma da consulta. É por isso que o MTEB é uma ferramenta de triagem, não uma resposta final. A classificação diz-lhe quais modelos são plausíveis, não qual se adapta aos seus dados.
Eis os fatores do corpus que invertem uma classificação na prática:
- Mudança de domínio: texto jurídico, médico ou de base de código transporta vocabulário que o MS MARCO nunca amostrou.
- Tamanho do fragmento: um modelo ajustado para passagens curtas pode falhar em fragmentos de 800 tokens.
- Idioma e estilo da consulta: consultas multilingues ou pesadas em palavras-chave reorganizam a ordem rapidamente.
Na nossa experiência, o fluxo de trabalho fiável é aborrecido, mas funciona: utilize a aba de recuperação do MTEB para selecionar 3–4 candidatos e, em seguida, meça o Recall@10 e o nDCG@10 nos seus próprios documentos. O nosso resumo de ferramentas gerais de RAG ajuda com o pipeline, e para uma forma estruturada de avaliar modelos nos seus próprios dados, essa revisão cobre a parte de avaliação. Duas leituras relacionadas que vale a pena guardar: executar modelos de incorporação localmente com Ollama, e um confronto direto entre incorporações Voyage vs OpenAI vs Cohere.
MTEB vs MMTEB, e Por que os Números Continuam a Mudar
MMTEB é a expansão multilingue v2 do MTEB (arXiv 2502.13595, v2 publicada em 8 de abril de 2025). Adiciona mais de 500 tarefas conduzidas pela comunidade em mais de 250 idiomas, além de recuperação de documentos longos, seguimento de instruções e código. Se o seu RAG for apenas em inglês, a aba de recuperação original do MTEB em inglês continua a ser a que deve ler. O MMTEB é mais importante quando as suas consultas e documentos abrangem vários idiomas.
Eis a parte honesta. Os números do MTEB conflituam entre capturas e até entre versões do artigo: o artigo original reporta 56 conjuntos de dados numa versão e 58 noutra, por isso nunca trate um único número como canónico. As classificações mudam constantemente à medida que chegam mais de 5.000 submissões, por isso faça sempre uma captura de ecrã da tabela de classificação com a data em que a consultou. E se a página não carregar, o Espaço da Hugging Face funciona numa atualização de CPU e é frequentemente lento ou instável, não sendo problema da sua ligação.
Conclusão
O MTEB é o melhor ponto de partida público para escolher um modelo de incorporação, desde que o leia corretamente. Leia a aba de recuperação, não a média geral. Considere um nDCG@10 de 0,4–0,7 como normal. Faça uma lista curta com a tabela de classificação e, em seguida, teste essa lista no seu próprio corpus, porque o modelo nº 1 perde frequentemente em dados reais (o nosso perdeu). Quando estiver pronto para escolher, volte ao nosso hub de modelos de incorporação para o benchmark completo e recomendações. E se o trabalho real for integrar o modelo escolhido num pipeline de produção, essa avaliação de triagem e teste faz parte do nosso trabalho de integração de IA.
Sobre o Autor
Mert Batur Gurbuz é Co-Fundador da Techsy.io, onde a equipa desenvolve agentes de IA, sistemas de automação e pipelines de voz/SDR para clientes B2B. Estuda na Universidade de Birmingham e escreve sobre a stack de ferramentas LLM que a equipa da Techsy utiliza realmente em produção.
Ligue-se no LinkedIn.
Perguntas Frequentes
O que é o MTEB?
O MTEB é o Massive Text Embedding Benchmark, um conjunto aberto para avaliar o desempenho de modelos de incorporação de texto em 8 tipos de tarefas, incluindo recuperação, classificação e agrupamento. Introduzido por Muennighoff e colegas em 2022 (arXiv 2210.07316), está alojado como uma tabela de classificação pública na Hugging Face.
O que significa MTEB?
MTEB significa Massive Text Embedding Benchmark. O nome é importante porque "massive" refere-se à amplitude de tarefas e conjuntos de dados, não a um único teste. A sua pontuação MTEB é realmente uma média de muitas avaliações separadas, razão pela qual o número geral pode esconder pontos fracos na tarefa que lhe interessa.
Qual pontuação MTEB importa para RAG?
Para RAG, leia a subsecção de Recuperação, avaliada por nDCG@10, não a média geral. RAG é pesquisa semântica sobre os seus documentos, que é exatamente a tarefa de recuperação que a tabela de classificação mede. Um modelo pode obter uma pontuação geral forte enquanto fica a meio da tabela em recuperação, por isso a recuperação é o sinal fiável.
Qual é uma boa pontuação de recuperação MTEB?
Os modelos de incorporação reais obtêm tipicamente entre 0,4–0,7 de nDCG@10 em zero-shot, por isso qualquer valor nessa faixa é normal e viável para produção. Um 0,55 não é um sinal de alarme. Ninguém atinge 1,0, porque as consultas são ambíguas e os documentos relevantes raramente se alinham numa ordem perfeita. Compare os candidatos entre si, não contra um 1,0 perfeito.
O que é nDCG@10?
nDCG@10 mede quão bem os 10 principais resultados recuperados estão classificados. Uma pontuação de 1,0 significa que todos os documentos relevantes estão no topo absoluto; 0 significa que nenhum está. Recompensa colocar a melhor resposta em primeiro lugar, o que importa para RAG porque o seu LLM lê apenas os primeiros fragmentos que recupera.
Qual é a diferença entre MTEB e MMTEB (v1 vs v2)?
MMTEB é a expansão multilingue v2 do MTEB (arXiv 2502.13595, abril de 2025). Expande o benchmark para mais de 500 tarefas conduzidas pela comunidade em mais de 250 idiomas e adiciona recuperação de documentos longos, instruções e código. Se o seu RAG for apenas em inglês, mantenha-se na aba de recuperação original do MTEB em inglês.
Por que razão a tabela de classificação MTEB muda tão frequentemente (e por que não carrega)?
As classificações mudam constantemente porque novos modelos são submetidos o tempo todo, com mais de 5.000 entradas e a crescer. Uma captura de março não corresponderá a uma de julho, por isso faça sempre uma captura de ecrã da tabela com a data. Se a página não carregar, o Espaço da Hugging Face funciona numa atualização de CPU e é frequentemente lento ou instável.
Devo apenas escolher o modelo nº 1 na tabela de classificação MTEB?
Não. O modelo nº 1 é um candidato para lista curta, não um veredicto. A tabela de classificação não consegue ver o seu vocabulário de domínio, tamanho do fragmento ou idioma da consulta, fatores que alteram qual modelo vence. Utilize a aba de recuperação para selecionar 3–4 modelos e, em seguida, teste no seu corpus. No nosso teste, o nº 1 da tabela pública foi ultrapassado no nosso próprio corpus por um modelo que nem sequer está nessa tabela, e empatado por uma opção auto-hospedada mais barata.