
Puntuación MTEB Explicada: Por Qué el Modelo #1 No Es Tu Mejor Opción para RAG
El leaderboard de MTEB en Hugging Face lista más de 5.000 modelos de embeddings, y casi cada semana uno nuevo se cuela en el primer puesto. Aquí está la trampa: ese modelo #1 probablemente no es el que deberías usar en producción. La puntuación MTEB que estás mirando es un promedio entre 8 tipos de tareas distintas, y solo una de ellas predice qué tan bien funciona la generación aumentada por recuperación (RAG) sobre tus propios documentos. Lo aprendimos por las malas. En abril de 2026, nuestro modelo mejor clasificado perdió frente a uno más barato en nuestro propio corpus. Esta guía explica qué significan realmente los números, qué columna hay que mirar para RAG y por qué el leaderboard es un punto de partida, no un veredicto.
Puntos Clave
- MTEB es un benchmark multitarea; la puntuación "general" de portada mezcla 8 tipos de tareas en un solo promedio.
- Para RAG, solo la pestaña de Retrieval (nDCG@10) predice la calidad en producción, no el promedio general.
- Los modelos de embeddings reales puntúan entre 0,4 y 0,7 en nDCG@10 zero-shot; 1,0 significaría un ranking perfecto.
- Usa MTEB para hacer una preselección y luego prueba con tu propio corpus. El modelo #1 muchas veces pierde.
¿Qué Es una Puntuación MTEB?
MTEB significa Massive Text Embedding Benchmark, una suite abierta y multitarea para puntuar modelos de embeddings de texto. Una puntuación MTEB es una métrica por tarea promediada en un número general a lo largo de 8 tipos de tareas. Fue introducida por Muennighoff y sus colegas en 2022 (arXiv 2210.07316, publicado en EACL 2023).
El benchmark vive como un Space público de Hugging Face donde cualquiera puede enviar un modelo. El número que la mayoría cita es el "promedio general", que mezcla retrieval, clasificación, clustering y otras cinco familias de tareas en una sola cifra. Justo por eso el ranking de portada engaña: un modelo puede ganar el promedio por ser fuerte en clustering mientras apenas es mediocre en la única tarea de la que depende tu producto. El paper original abarca 8 tipos de tareas en aproximadamente 58 datasets y 112 idiomas.
Las 8 Categorías de Tareas de MTEB (y Qué Mide Cada Puntuación)
MTEB agrupa la evaluación de embeddings en 8 tipos de tareas, y cada una se puntúa con una métrica distinta. Así que "una puntuación MTEB alta" no significa casi nada hasta que sabes qué tarea estás leyendo. Un 0,85 en clasificación (accuracy) y un 0,85 en retrieval (nDCG@10) describen habilidades completamente diferentes.
Aquí está la tabla de referencia que nadie parece publicar de forma clara. La métrica cambia según la tarea:
| Categoría de tarea | Qué mide | Métrica |
|---|---|---|
| Retrieval | Encontrar documentos relevantes para una consulta (esto es RAG) | nDCG@10 |
| Classification | Etiquetar texto en categorías | exactitud |
| Clustering | Agrupar textos similares | v-measure |
| Pair Classification | ¿Coinciden dos textos? | precisión promedio |
| Reranking | Reordenar resultados candidatos | MAP |
| STS (similitud textual semántica) | Qué tan parecido es el significado de dos oraciones | correlación de Spearman |
| Summarization | Clasificar la calidad de un resumen | correlación de Spearman |
| Bitext mining | Emparejar traducciones entre idiomas | F1 |
El mapa tarea-métrica de arriba está verificado con el paper de MTEB (arXiv 2210.07316). La conclusión: un modelo que lidera el promedio general de MTEB puede seguir siendo mediocre en la única tarea que corre tu producto.
¿Qué Puntuación de MTEB Importa Realmente para RAG?
Para RAG, ignora el promedio general y lee la pestaña de Retrieval, puntuada por nDCG@10. RAG es búsqueda semántica sobre tus documentos, que es exactamente la tarea de retrieval. STS tiene una correlación débil pero es secundaria. Un modelo puede ganar el leaderboard general mientras queda a mitad de tabla en retrieval, así que la columna de retrieval es la que predice la calidad en producción.
¿Por qué engaña el promedio general? El subconjunto de retrieval se construye a partir de datasets generales de web y QA como MS MARCO, Natural Questions y HotpotQA. Un modelo que brilla en clasificación puede publicar un promedio excelente mientras su número de retrieval se hunde. Abre el leaderboard de Hugging Face (huggingface.co/spaces/mteb/leaderboard, consultado el 13-07-2026) y filtra por la pestaña de retrieval antes de comparar nada.
Si programas tu propia evaluación, se aplica el mismo filtro en código:
from mteb import MTEB
# quedarse solo con Retrieval, la columna que importa para RAG
tasks = MTEB(task_types=["Retrieval"]).tasksUna vez que hayas leído la columna de retrieval, la siguiente pregunta es qué modelo elegir. Nuestro artículo central repasa qué modelo de embeddings usar realmente con los números completos del benchmark, y si estás decidiendo dónde viven esos vectores, nuestra guía sobre las mejores bases de datos vectoriales en 2026 va de la mano con esto.
¿Qué Significa Realmente una Puntuación nDCG@10?
nDCG@10 mide qué tan bien están ordenados los 10 primeros resultados recuperados. Una puntuación de 1,0 significa que todos los documentos relevantes están en la cima; 0 significa que ninguno lo está. Los modelos de embeddings reales se sitúan alrededor de 0,4–0,7 en zero-shot, así que un 0,55 es normal, no está roto.
Piénsalo como calificar un buscador. Te importa que la respuesta correcta aparezca primero, no que aparezca en algún lugar, porque tu LLM solo lee los primeros fragmentos que le entregas. Nadie llega a 1,0, porque las consultas son ambiguas y los documentos relevantes rara vez se alinean a la perfección. Así que si un nDCG@10 de 0,55 te asusta, no lo hagas; es una puntuación zero-shot normal y lista para producción, y el rango de 0,4–0,7 es típico (corroborado por zeroentropy.dev), no una ley física.
Enfrentamos al #1 de MTEB Contra Nuestro Propio Corpus de RAG (y No Ganó)
Tomamos el modelo que lidera la pestaña de retrieval en inglés de MTEB y lo enfrentamos contra otros seis en nuestro propio corpus técnico de 10.000 documentos, evaluado contra un conjunto etiquetado a mano de unas 120 consultas. El líder del leaderboard publicó un Recall@10 sólido, pero no terminó primero, y dos opciones más baratas quedaron lo bastante cerca como para cambiar la decisión. Con solo ~120 consultas, toma esto como orientativo, no como un leaderboard.
El líder del leaderboard en inglés de MTEB durante nuestra ventana de test fue Gemini Embedding 001 (lidera el snapshot de abril de 2026); las posiciones de abajo vienen del leaderboard de MTEB en Hugging Face, y como los números cambian según el snapshot, los nuestros van con fecha:
| Modelo (dims) | Posición en MTEB inglés (HF, 2026) | Recall@10 en nuestro corpus | Costo |
|---|---|---|---|
| Gemini Embedding 001 (3072) | lidera la pestaña de retrieval en inglés | 0.88 | ~$0.15/M |
| Voyage-4-large (1024) | no publicado en el leaderboard público | 0.89 | ~$0.12/M |
| Qwen3-Embedding-8B (self-host) | líder entre modelos abiertos | 0.87 | solo GPU |
| text-embedding-3-large @1024 (truncado) | nivel medio | 0.83 | ~$0.13/M |
Dos cosas que el leaderboard no nos dijo. Primero, al #1 público (Gemini) lo superó por poco Voyage-4-large en nuestro corpus, un modelo que ni siquiera se publica en ese leaderboard. Segundo, un modelo abierto autoalojado (Qwen3-8B) quedó a un pelo sin costo por token, y los vectores truncados de 1024 dimensiones de OpenAI mantuvieron 0.83 de Recall@10 con un almacenamiento 3 veces menor. MTEB clasifica retrieval sobre texto general de web y QA; nuestro corpus tiene vocabulario técnico especializado dividido a su propia manera, así que el orden se reorganiza. Ese es todo el argumento a favor de probar con tus propios datos. Nuestra guía sobre cómo probar con tu propio corpus de RAG cubre el lado de la evaluación, y el artículo central lleva la metodología completa.
Por Qué el #1 del Leaderboard No Es Tu Mejor Opción
Tres cosas que el leaderboard no puede ver deciden a tu verdadero ganador: vocabulario de dominio (la jerga que los datasets generales nunca contienen), tamaño de fragmento (pasajes cortos frente a largos favorecen a modelos distintos) e idioma de consulta. Por eso MTEB es una herramienta de preselección, no una respuesta final. El ranking te dice qué modelos son plausibles, no cuál encaja con tus datos.
Estos son los factores del corpus que en la práctica invierten un ranking:
- Cambio de dominio: texto legal, médico o de código lleva vocabulario que MS MARCO nunca muestreó.
- Tamaño de fragmento: un modelo ajustado con pasajes cortos puede tropezar con fragmentos de 800 tokens.
- Idioma y estilo de consulta: consultas multilingües o cargadas de palabras clave reorganizan el orden rápido.
En nuestra experiencia, el flujo de trabajo fiable es aburrido pero funciona: usa la pestaña de retrieval de MTEB para preseleccionar 3 o 4 candidatos, y luego mide Recall@10 y nDCG@10 sobre tus propios documentos. Nuestro repaso de herramientas generales de RAG ayuda con el pipeline, y para una forma estructurada de evaluar modelos sobre tus propios datos, esa reseña cubre el lado de la evaluación. Dos lecturas relacionadas que vale la pena guardar: cómo correr modelos de embeddings en local con Ollama, y una comparación cara a cara entre Voyage, OpenAI y Cohere para embeddings.
MTEB vs MMTEB, y Por Qué los Números No Dejan de Cambiar
MMTEB es la expansión multilingüe v2 de MTEB (arXiv 2502.13595, v2 publicada el 8 de abril de 2025). Añade más de 500 tareas creadas por la comunidad en más de 250 idiomas, además de retrieval de documentos largos, seguimiento de instrucciones y retrieval de código. Si tu RAG es solo en inglés, la pestaña original de retrieval en inglés de MTEB sigue siendo la que hay que leer. MMTEB importa más cuando tus consultas y documentos abarcan varios idiomas.
Aquí va la parte honesta. Los números de MTEB no coinciden entre snapshots e incluso entre versiones del mismo paper: el paper original reporta 56 datasets en una versión y 58 en otra, así que nunca trates una sola cifra como definitiva. Los rankings se reorganizan constantemente a medida que llegan más de 5.000 envíos, así que siempre haz una captura del leaderboard con la fecha en que lo consultaste. Y si la página no carga, el Space de Hugging Face corre sobre una CPU y a menudo va lento o falla, no es tu conexión.
Conclusión
MTEB es el mejor punto de partida público para elegir un modelo de embeddings, una vez que lo lees bien. Lee la pestaña de retrieval, no el promedio general. Trata un nDCG@10 de 0,4–0,7 como normal. Preselecciona con el leaderboard y luego prueba esa preselección con tu propio corpus, porque el modelo #1 muchas veces pierde con datos reales (el nuestro perdió). Cuando estés listo para elegir, vuelve a nuestro artículo central de modelos de embeddings para ver el benchmark completo y las recomendaciones. Y si el trabajo real es conectar el modelo que elijas a un pipeline en producción, esa evaluación de preselección y prueba forma parte de nuestro trabajo de integración de IA.
Sobre el Autor
Mert Batur es Cofundador de Techsy.io, donde el equipo desarrolla agentes de IA, sistemas de automatización y pipelines de voz/SDR para clientes B2B. Escribe sobre el stack de herramientas LLM que el equipo de Techsy usa realmente en producción.
Conecta en LinkedIn.
Preguntas Frecuentes
¿Qué es MTEB?
MTEB es el Massive Text Embedding Benchmark, una suite abierta para puntuar qué tan bien rinden los modelos de embeddings de texto en 8 tipos de tareas, incluyendo retrieval, clasificación y clustering. Introducido por Muennighoff y sus colegas en 2022 (arXiv 2210.07316), se aloja como un leaderboard público en Hugging Face.
¿Qué significa MTEB?
MTEB significa Massive Text Embedding Benchmark. El nombre importa porque "massive" (masivo) se refiere a la amplitud de tareas y datasets, no a un único test. Tu puntuación MTEB en realidad es un promedio entre muchas evaluaciones separadas, y por eso el número general puede esconder puntos débiles en la tarea que te importa.
¿Qué puntuación de MTEB importa para RAG?
Para RAG, lee la pestaña de Retrieval, puntuada por nDCG@10, no el promedio general. RAG es búsqueda semántica sobre tus documentos, que es exactamente la tarea de retrieval que mide el leaderboard. Un modelo puede publicar una puntuación general sólida mientras queda a mitad de tabla en retrieval, así que retrieval es la señal fiable.
¿Qué es una buena puntuación de retrieval en MTEB?
Los modelos de embeddings reales suelen puntuar entre 0,4 y 0,7 en nDCG@10 zero-shot, así que cualquier valor en ese rango es normal y apto para producción. Un 0,55 no es una alerta roja. Nadie llega a 1,0, porque las consultas son ambiguas y los documentos relevantes rara vez se alinean en un orden perfecto. Compara candidatos entre sí, no contra un 1,0 perfecto.
¿Qué es nDCG@10?
nDCG@10 mide qué tan bien están ordenados los 10 primeros resultados recuperados. Una puntuación de 1,0 significa que todos los documentos relevantes están en la cima; 0 significa que ninguno lo está. Premia poner primero la mejor respuesta, algo que importa para RAG porque tu LLM solo lee los primeros fragmentos que recuperas.
¿Cuál es la diferencia entre MTEB y MMTEB (v1 vs v2)?
MMTEB es la expansión multilingüe v2 de MTEB (arXiv 2502.13595, abril de 2025). Amplía el benchmark a más de 500 tareas creadas por la comunidad en más de 250 idiomas y añade retrieval de documentos largos, de instrucciones y de código. Si tu RAG es solo en inglés, quédate con la pestaña original de retrieval en inglés de MTEB.
¿Por qué el leaderboard de MTEB cambia tanto (y por qué no carga)?
Los rankings se reorganizan constantemente porque se envían nuevos modelos todo el tiempo, con más de 5.000 entradas y creciendo. Un snapshot de marzo no coincidirá con uno de julio, así que siempre haz una captura del leaderboard con la fecha. Si la página no carga, el Space de Hugging Face corre sobre una CPU y con frecuencia va lento o falla.
¿Debería simplemente elegir el modelo #1 del leaderboard de MTEB?
No. El modelo #1 es un candidato para tu preselección, no un veredicto. El leaderboard no puede ver tu vocabulario de dominio, tamaño de fragmento ni idioma de consulta, y todo eso cambia qué modelo gana. Usa la pestaña de retrieval para preseleccionar 3 o 4 modelos y luego prueba con tu corpus. En nuestro test, al #1 público del leaderboard lo superó en nuestro propio corpus un modelo que ni siquiera está en ese leaderboard, y lo igualó una opción autoalojada más barata.