Techsy
Contacto
Começar
Voltar ao blog
ai-machine-learning

Pontuação MTEB Explicada: Por que o Modelo #1 Não é a Melhor Escolha para RAG

Escrito por Mert Batur Gürbüz
Jul 13, 2026
12 min de leitura
Índice
Pontuação MTEB Explicada: Por que o Modelo #1 Não é a Melhor Escolha para RAG

Pontuação MTEB Explicada: Por que o Modelo #1 Não é a Melhor Escolha para RAG

A tabela de classificação MTEB da Hugging Face lista mais de 5.000 submissões de modelos de incorporação (embedding), e quase todas as semanas um novo modelo ascende ao topo. Eis a armadilha: esse modelo nº 1 provavelmente não é aquele que deve colocar em produção. A pontuação MTEB que está a observar é uma média entre 8 tipos diferentes de tarefas, e apenas uma delas prevê o quão bem a geração aumentada por recuperação (RAG) funciona nos seus documentos. Aprendemos isto da maneira difícil. Em abril de 2026, a nossa escolha melhor classificada perdeu para um modelo mais barato no nosso próprio corpus. Este guia explica o que os números significam realmente, em que coluna confiar para RAG e por que razão a tabela de classificação é um ponto de partida, não um veredicto.

Pontos Principais

  • O MTEB é um benchmark de múltiplas tarefas; a pontuação "geral" combina 8 tipos de tarefas numa única média.
  • Para RAG, apenas a subsecção de Recuperação (nDCG@10) prevê a qualidade em produção, não a média geral.
  • Os modelos de incorporação reais obtêm entre 0,4–0,7 de nDCG@10 em zero-shot; 1,0 significaria uma classificação perfeita.
  • Utilize o MTEB para criar uma lista curta e, em seguida, teste no seu próprio corpus. O modelo nº 1 perde frequentemente.

O que é uma Pontuação MTEB?

MTEB significa Massive Text Embedding Benchmark, um conjunto aberto e de múltiplas tarefas para avaliar modelos de incorporação de texto. Uma pontuação MTEB é uma métrica por tarefa, calculada como uma média global entre 8 tipos de tarefas. Foi introduzido por Muennighoff e colegas em 2022 (arXiv 2210.07316, publicado na EACL 2023).

O benchmark existe como um Espaço público na Hugging Face, onde qualquer pessoa pode submeter um modelo. O número que a maioria das pessoas cita é a "média geral", que combina recuperação, classificação, agrupamento (clustering) e outras cinco famílias de tarefas num único valor. É exatamente por isso que a classificação principal engana: um modelo pode vencer na média por ser forte em agrupamento, enquanto tem um desempenho apenas mediano na única tarefa de que o seu produto depende. O artigo original abrange 8 tipos de tarefas em aproximadamente 58 conjuntos de dados e 112 idiomas.

As 8 Categorias de Tarefas do MTEB (e o que cada Pontuação Mede)

O MTEB agrupa a avaliação de incorporações em 8 tipos de tarefas, e cada uma é avaliada por uma métrica diferente. Assim, "uma pontuação MTEB alta" não significa quase nada até saber qual tarefa está a ler. Um 0,85 em classificação (precisão) e um 0,85 em recuperação (nDCG@10) descrevem capacidades completamente diferentes.

Eis a tabela decodificadora que ninguém parece publicar de forma clara. A métrica muda conforme a tarefa:

Categoria de tarefaO que testaMétrica
RecuperaçãoEncontrar documentos relevantes para uma consulta (isto é RAG)nDCG@10
ClassificaçãoRotular texto em categoriasprecisão (accuracy)
Agrupamento (Clustering)Agrupar textos semelhantesv-measure
Classificação de ParesDois textos correspondem?precisão média (average precision)
Reordenação (Reranking)Reordenar resultados candidatosMAP
STS (similaridade textual semântica)Quão similares são os significados de duas frasescorrelação de Spearman
SumarizaçãoClassificar a qualidade do resumocorrelação de Spearman
Mineração de bitextoCorrespondência de traduções entre idiomasF1

O mapa tarefa-métrica acima foi verificado a partir do artigo MTEB (arXiv 2210.07316). A principal conclusão: um modelo que lidera a média geral do MTEB pode ainda ser mediano na única tarefa em que o seu produto opera.

Qual Pontuação MTEB Realmente Importa para RAG?

Para RAG, ignore a média geral e leia a subsecção de Recuperação, avaliada por nDCG@10. RAG é pesquisa semântica sobre os seus documentos, que é exatamente a tarefa de recuperação. STS está vagamente correlacionado, mas é secundário. Um modelo pode vencer a tabela de classificação geral enquanto fica a meio da tabela em recuperação, portanto, a coluna de recuperação é a que prevê a qualidade em produção.

Por que razão a mistura geral engana? O subconjunto de recuperação é construído a partir de conjuntos de dados gerais da web e de perguntas e respostas, como MS MARCO, Natural Questions e HotpotQA. Um modelo que se destaca em classificação pode obter uma ótima média enquanto o seu número de recuperação baixa. Abra a tabela de classificação da Hugging Face (huggingface.co/spaces/mteb/leaderboard, acedido em 13-07-2026) e filtre pela aba de recuperação antes de comparar qualquer coisa.

Se criar a sua própria avaliação por script, aplica-se o mesmo filtro no código:

python
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasks

Depois de ler a coluna de recuperação, a próxima questão é qual modelo escolher. O nosso artigo no hub explica qual modelo de incorporação realmente colocar em produção com os números completos do benchmark, e se estiver a escolher onde armazenar esses vetores, o nosso guia sobre as melhores bases de dados vetoriais em 2026 complementa-o.

O que Significa Realmente uma Pontuação nDCG@10?

nDCG@10 mede quão bem os 10 principais resultados recuperados estão classificados. Uma pontuação de 1,0 significa que todos os documentos relevantes estão no topo absoluto; 0 significa que nenhum deles está. Os modelos de incorporação reais situam-se geralmente entre 0,4–0,7 em zero-shot, por isso, um 0,55 é normal, não defeituoso.

Pense nisso como avaliar uma caixa de pesquisa. Importa-se se a resposta correta aparecer em primeiro lugar, e não apenas algures, porque o seu LLM lê apenas os primeiros fragmentos que lhe fornece. Ninguém atinge 1,0, porque as consultas são ambíguas e os documentos relevantes raramente se alinham perfeitamente. Portanto, se um nDCG@10 de 0,55 o entrar em pânico, não o faça; essa é uma pontuação zero-shot normal e viável para produção, e a faixa de 0,4–0,7 é um intervalo típico (corroborado por zeroentropy.dev), não uma lei da física.

Colocámos o Nº 1 do MTEB Contra o Nosso Próprio Corpus RAG (e Ele Não Ganhou)

Pegámos no modelo que liderava a aba de recuperação em inglês do MTEB e executámos-lo contra outros seis no nosso próprio corpus de 10.000 documentos técnicos, avaliado contra um conjunto rotulado manualmente de ~120 consultas. O líder da tabela de classificação obteve um Recall@10 forte, mas não terminou em primeiro lugar, e duas opções mais baratas ficaram perto o suficiente para alterar a decisão. Com apenas ~120 consultas, trate estes resultados como indicativos de direção, não como uma tabela de classificação definitiva.

O líder da tabela de classificação em inglês do MTEB na nossa janela de teste foi o Gemini Embedding 001 (lidera a captura de abril de 2026); as classificações abaixo provêm da tabela MTEB da Hugging Face, e como os números mudam conforme a captura, citamos os nossos com uma data:

Modelo (dims)Classificação MTEB Inglês (HF, 2026)Recall@10 no nosso corpusCusto
Gemini Embedding 001 (3072)lidera a aba de recuperação em inglês0,88~$0,15/M
Voyage-4-large (1024)não publicado na tabela pública0,89~$0,12/M
Qwen3-Embedding-8B (auto-hospedado)líder entre modelos abertos0,87Apenas GPU
text-embedding-3-large @1024 (truncado)nível intermédio0,83~$0,13/M

Duas coisas que a tabela de classificação não nos disse. Primeiro, o nº 1 público (Gemini) foi ultrapassado no nosso corpus pelo Voyage-4-large, um modelo que nem sequer publica nessa tabela. Segundo, um modelo aberto auto-hospedado (Qwen3-8B) ficou muito próximo sem custo por token, e os vetores truncados de 1024 dimensões da OpenAI mantiveram um Recall@10 de 0,83 com armazenamento 3x menor. O MTEB classifica a recuperação em texto geral da web e de QA; o nosso corpus tem vocabulário técnico especializado fragmentado à sua maneira, por isso a ordem muda. Esse é todo o argumento para testar nos seus próprios dados. O nosso guia sobre como testar no seu próprio corpus RAG cobre a parte de avaliação, e o artigo do hub contém a metodologia completa.

Por que o Nº 1 da Tabela de Classificação Não é a Sua Melhor Escolha

Três fatores que a tabela de classificação não consegue ver decidem o seu verdadeiro vencedor: vocabulário de domínio (jargão que os conjuntos de dados gerais nunca contêm), tamanho do fragmento (chunk) (passagens curtas versus longas favorecem modelos diferentes) e idioma da consulta. É por isso que o MTEB é uma ferramenta de triagem, não uma resposta final. A classificação diz-lhe quais modelos são plausíveis, não qual se adapta aos seus dados.

Eis os fatores do corpus que invertem uma classificação na prática:

  • Mudança de domínio: texto jurídico, médico ou de base de código transporta vocabulário que o MS MARCO nunca amostrou.
  • Tamanho do fragmento: um modelo ajustado para passagens curtas pode falhar em fragmentos de 800 tokens.
  • Idioma e estilo da consulta: consultas multilingues ou pesadas em palavras-chave reorganizam a ordem rapidamente.

Na nossa experiência, o fluxo de trabalho fiável é aborrecido, mas funciona: utilize a aba de recuperação do MTEB para selecionar 3–4 candidatos e, em seguida, meça o Recall@10 e o nDCG@10 nos seus próprios documentos. O nosso resumo de ferramentas gerais de RAG ajuda com o pipeline, e para uma forma estruturada de avaliar modelos nos seus próprios dados, essa revisão cobre a parte de avaliação. Duas leituras relacionadas que vale a pena guardar: executar modelos de incorporação localmente com Ollama, e um confronto direto entre incorporações Voyage vs OpenAI vs Cohere.

MTEB vs MMTEB, e Por que os Números Continuam a Mudar

MMTEB é a expansão multilingue v2 do MTEB (arXiv 2502.13595, v2 publicada em 8 de abril de 2025). Adiciona mais de 500 tarefas conduzidas pela comunidade em mais de 250 idiomas, além de recuperação de documentos longos, seguimento de instruções e código. Se o seu RAG for apenas em inglês, a aba de recuperação original do MTEB em inglês continua a ser a que deve ler. O MMTEB é mais importante quando as suas consultas e documentos abrangem vários idiomas.

Eis a parte honesta. Os números do MTEB conflituam entre capturas e até entre versões do artigo: o artigo original reporta 56 conjuntos de dados numa versão e 58 noutra, por isso nunca trate um único número como canónico. As classificações mudam constantemente à medida que chegam mais de 5.000 submissões, por isso faça sempre uma captura de ecrã da tabela de classificação com a data em que a consultou. E se a página não carregar, o Espaço da Hugging Face funciona numa atualização de CPU e é frequentemente lento ou instável, não sendo problema da sua ligação.

Conclusão

O MTEB é o melhor ponto de partida público para escolher um modelo de incorporação, desde que o leia corretamente. Leia a aba de recuperação, não a média geral. Considere um nDCG@10 de 0,4–0,7 como normal. Faça uma lista curta com a tabela de classificação e, em seguida, teste essa lista no seu próprio corpus, porque o modelo nº 1 perde frequentemente em dados reais (o nosso perdeu). Quando estiver pronto para escolher, volte ao nosso hub de modelos de incorporação para o benchmark completo e recomendações. E se o trabalho real for integrar o modelo escolhido num pipeline de produção, essa avaliação de triagem e teste faz parte do nosso trabalho de integração de IA.

Sobre o Autor

Mert Batur Gurbuz é Co-Fundador da Techsy.io, onde a equipa desenvolve agentes de IA, sistemas de automação e pipelines de voz/SDR para clientes B2B. Estuda na Universidade de Birmingham e escreve sobre a stack de ferramentas LLM que a equipa da Techsy utiliza realmente em produção.

Ligue-se no LinkedIn.

Perguntas Frequentes

O que é o MTEB?

O MTEB é o Massive Text Embedding Benchmark, um conjunto aberto para avaliar o desempenho de modelos de incorporação de texto em 8 tipos de tarefas, incluindo recuperação, classificação e agrupamento. Introduzido por Muennighoff e colegas em 2022 (arXiv 2210.07316), está alojado como uma tabela de classificação pública na Hugging Face.

O que significa MTEB?

MTEB significa Massive Text Embedding Benchmark. O nome é importante porque "massive" refere-se à amplitude de tarefas e conjuntos de dados, não a um único teste. A sua pontuação MTEB é realmente uma média de muitas avaliações separadas, razão pela qual o número geral pode esconder pontos fracos na tarefa que lhe interessa.

Qual pontuação MTEB importa para RAG?

Para RAG, leia a subsecção de Recuperação, avaliada por nDCG@10, não a média geral. RAG é pesquisa semântica sobre os seus documentos, que é exatamente a tarefa de recuperação que a tabela de classificação mede. Um modelo pode obter uma pontuação geral forte enquanto fica a meio da tabela em recuperação, por isso a recuperação é o sinal fiável.

Qual é uma boa pontuação de recuperação MTEB?

Os modelos de incorporação reais obtêm tipicamente entre 0,4–0,7 de nDCG@10 em zero-shot, por isso qualquer valor nessa faixa é normal e viável para produção. Um 0,55 não é um sinal de alarme. Ninguém atinge 1,0, porque as consultas são ambíguas e os documentos relevantes raramente se alinham numa ordem perfeita. Compare os candidatos entre si, não contra um 1,0 perfeito.

O que é nDCG@10?

nDCG@10 mede quão bem os 10 principais resultados recuperados estão classificados. Uma pontuação de 1,0 significa que todos os documentos relevantes estão no topo absoluto; 0 significa que nenhum está. Recompensa colocar a melhor resposta em primeiro lugar, o que importa para RAG porque o seu LLM lê apenas os primeiros fragmentos que recupera.

Qual é a diferença entre MTEB e MMTEB (v1 vs v2)?

MMTEB é a expansão multilingue v2 do MTEB (arXiv 2502.13595, abril de 2025). Expande o benchmark para mais de 500 tarefas conduzidas pela comunidade em mais de 250 idiomas e adiciona recuperação de documentos longos, instruções e código. Se o seu RAG for apenas em inglês, mantenha-se na aba de recuperação original do MTEB em inglês.

Por que razão a tabela de classificação MTEB muda tão frequentemente (e por que não carrega)?

As classificações mudam constantemente porque novos modelos são submetidos o tempo todo, com mais de 5.000 entradas e a crescer. Uma captura de março não corresponderá a uma de julho, por isso faça sempre uma captura de ecrã da tabela com a data. Se a página não carregar, o Espaço da Hugging Face funciona numa atualização de CPU e é frequentemente lento ou instável.

Devo apenas escolher o modelo nº 1 na tabela de classificação MTEB?

Não. O modelo nº 1 é um candidato para lista curta, não um veredicto. A tabela de classificação não consegue ver o seu vocabulário de domínio, tamanho do fragmento ou idioma da consulta, fatores que alteram qual modelo vence. Utilize a aba de recuperação para selecionar 3–4 modelos e, em seguida, teste no seu corpus. No nosso teste, o nº 1 da tabela pública foi ultrapassado no nosso próprio corpus por um modelo que nem sequer está nessa tabela, e empatado por uma opção auto-hospedada mais barata.

Etiquetas

pontuação MTEB explicadanDCG@10recuperação MTEBincorporações RAGMMTEB

Partilhar este artigo

Artigos relacionados

Mais em ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 chegou: inteligência quase Fable 5 a metade do preço

A Anthropic lançou o Claude Opus 5 a 24 de julho de 2026. Mais do que duplica o Opus 4.8 no Frontier-Bench e mantém o preço do Opus, mas perde alguns testes para o Fable 5 e o Mythos 5. Eis a tabela de benchmarks, o preço e a recomendação de mudar/esperar/ficar.

10 min read min de leitura
Ler
ai-machine-learning
Jul 20, 2026

8 Melhores APIs de Web Scraping com IA em 2026 (Testadas na Nossa Própria Stack de Agentes)

Testámos 8 APIs de web scraping com IA com preços reais de 2026, obtidos através da nossa própria stack de agentes. Firecrawl, Bright Data, ScrapingBee e mais 5, classificadas por output pronto para LLM, anti-bot e suporte MCP.

9 min read min de leitura
Ler
ai-machine-learning
Jul 20, 2026

Engenharia de Prompts para Programação: 7 Padrões Que Usamos Diariamente no Claude Code e Cursor (2026)

A maioria dos artigos sobre 'prompts de IA para programação' oferece 50 modelos para copiar. Este ensina os 7 padrões que usamos todos os dias para gerir um pipeline de 16 agentes no Claude Code, com exemplos reais de antes e depois, além de indicar onde cada padrão se encaixa no Claude Code, Cursor e Copilot em 2026.

11 min read min de leitura
Ler
Ver todos os artigos
Inicia o Teu Projeto

Pronto para criar algo extraordinário?

Vamos transformar a sua visão em realidade. A nossa equipa está pronta para o ajudar a criar software que faz a diferença.

Marca uma chamada de scope 30 minVer o Nosso Trabalho

Destaque da biblioteca

Skills do Claude

Ver tudo
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automações AI

Ver tudo
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Destaque da biblioteca

Skills do Claude

Ver tudo
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automações AI

Ver tudo
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Serviços

  • Soluções Empresariais
  • Aplicações Móveis
  • Aplicações Web

Soluções

  • Sistemas CRM
  • Integração de IA
  • Soluções ERP
  • Agentes de Voz
  • Automação de Processos
  • Cibersegurança

Biblioteca

  • Blogue
  • Portfólio

Comunidade

  • Automações AI
  • Skills do Claude

Ferramentas

  • Calculadora de Custo de App Móvel
  • Calculadora de Custo de API OpenAI / LLM
  • Calculadora de Custo de MVP
  • Calculadora de Custo de Agente de Voz AI

Empresa

  • Sobre
  • Parceiros
  • Contacto

Legal

  • Política de Privacidade
  • Termos de Serviço
  • Política de Cookies

Serviços

  • Soluções Empresariais
  • Aplicações Móveis
  • Aplicações Web

Soluções

  • Sistemas CRM
  • Integração de IA
  • Soluções ERP
  • Agentes de Voz
  • Automação de Processos
  • Cibersegurança

Biblioteca

  • Blogue
  • Portfólio

Comunidade

  • Automações AI
  • Skills do Claude

Ferramentas

  • Calculadora de Custo de App Móvel
  • Calculadora de Custo de API OpenAI / LLM
  • Calculadora de Custo de MVP
  • Calculadora de Custo de Agente de Voz AI

Empresa

  • Sobre
  • Parceiros
  • Contacto
LegalPolítica de PrivacidadeTermos de ServiçoPolítica de Cookies
TECHSY
© 2026 Techsy. Todos os direitos reservados.