
9 Mejores Modelos de Embeddings para RAG en 2026 (Comparamos Recall, Latencia y Coste)
Voyage-4 salió el 15 de enero de 2026. Luego llegó voyage-context-4 el 29 de junio. Si tu pipeline de RAG todavía indexa con ada-002 de OpenAI, estás dejando Recall@10 medible sobre la mesa y pagando de más por ello. Elegir los mejores modelos de embeddings para RAG en 2026 no consiste en coger lo que encabece el leaderboard de MTEB esa semana. Nosotros embebimos 10.000 documentos propios para averiguar qué modelos realmente recuperan bien, y cuánto cuesta cada uno por millón de tokens. A continuación: el ranking, los precios y un truco de truncamiento que redujo nuestro almacenamiento vectorial 3 veces. Los embeddings son solo una capa de la pila RAG completa, pero si falla esta capa, todo lo que viene después sufre.
Puntos Clave
- Mejor calidad de recuperación (API): Voyage-4-large, con MoE, dimensiones Matryoshka y ~$0.12/M tokens.
- Mejor todoterreno API: Gemini Embedding 001, líder en MTEB en inglés, 3072 dimensiones, ~$0.15/M.
- Mejor open-source / autoalojado: Qwen3-Embedding-8B, líder en MTEB multilingüe y de código.
- Mejor relación calidad-precio: OpenAI text-embedding-3-large truncado de 3072 a 1024, ~$0.13/M, vectores 3 veces más pequeños.
¿Qué Cambió en los Modelos de Embeddings en 2026?
El gran cambio de 2026 es la familia Voyage-4 (mixture-of-experts, un espacio de embeddings compartido entre nano/lite/standard/large, más truncamiento Matryoshka y cuantización int8/binaria), y voyage-context-4, que codifica cada fragmento junto con su contexto circundante. Mientras tanto, Gemini Embedding 001 encabeza el leaderboard de MTEB en inglés y Qwen3-Embedding lidera la recuperación multilingüe open-source.
Dos lanzamientos de Voyage reiniciaron el terreno de juego. Voyage-4 (15 de enero de 2026) introdujo un espacio de embeddings compartido, así que puedes combinar un modelo pequeño para indexar en volumen barato y uno grande para consultas de alto valor sin reindexar todo. Solo eso ya evita esa factura de reembeber datos que la mayoría de equipos teme.
Después, voyage-context-4 (29 de junio de 2026) atacó el problema del chunking de frente: en lugar de embeber un párrafo de forma aislada, codifica el fragmento junto con el contexto del documento. En la práctica, eso significa que puedes dejar de ajustar a mano los límites de cada fragmento para no perder significado en los bordes.
La frase para recordar: los embeddings de fragmentos con contexto convierten el chunking de un ejercicio frágil de ajuste fino en algo mucho más parecido a un valor por defecto en el que puedes confiar. ¿Quieres el cara a cara entre las APIs alojadas? Una comparativa completa de Voyage vs OpenAI vs Cohere es la guía complementaria que publicaremos a continuación.
Los 9 Mejores Modelos de Embeddings para RAG, Clasificados
Para la mayoría de equipos en 2026, tres opciones cubren el 90% de los casos: Voyage-4-large para la mayor calidad de recuperación en una API alojada, Gemini Embedding 001 como el todoterreno con mejor puntuación, y Qwen3-Embedding-8B si autoalojas. El ranking completo y la tabla maestra están justo debajo, ordenados por idoneidad para recuperación en RAG, primero los modelos API y luego los open-source.
| Modelo | Proveedor | MTEB (recuperación, con fecha) | Dimensiones (¿Matryoshka?) | Ventana de contexto | Precio /1M tokens | Multilingüe | Abierto vs API/autoalojado |
|---|---|---|---|---|---|---|---|
| Voyage-4-large | Voyage AI | Evaluación del proveedor, no en el MTEB público (ene. 2026) | 2048/1024/512/256 (sí, MRL) | ~32K tokens | ~$0.12 | Fuerte | API |
| Gemini Embedding 001 | ~67.7 recuperación / 68.3 general (MTEB, abr. 2026) | 3072 (sí, MRL) | ~2K tokens | ~$0.15 | Fuerte | API | |
| text-embedding-3-large | OpenAI | Ver MTEB en vivo (no publicado por el proveedor), 2026 | 3072→1024→256 (sí, MRL) | ~8K tokens | ~$0.13 | Buena | API |
| Cohere Embed v4 | Cohere | Evaluación del proveedor, multimodal (2026) | 1536 (configurable) | ~128K tokens | ~$0.12 | Fuerte | API |
| Voyage-context-4 | Voyage AI | Evaluación contextual (jun. 2026) | 2048/1024/512/256 (sí, MRL) | ~32K tokens | ~$0.12 | Fuerte | API |
| Qwen3-Embedding-8B | Alibaba | ~70.6 multilingüe / ~80.7 código (MTEB, 2026) | 32–4096 (flexible) | ~32K tokens | Pesos gratuitos (coste de GPU) | Líder | Autoalojado |
| BGE-M3 | BAAI | Fuerte en multilingüe (leaderboard HF, 2026) | 1024 (denso+disperso+multi) | ~8K tokens | Pesos gratuitos (coste de GPU) | Fuerte | Autoalojado |
| NV-Embed-v2 | NVIDIA | ~72.3 promedio en inglés (MTEB de HF, verificar, 2026) | 4096 | ~32K tokens | Pesos gratuitos (coste de GPU) | Enfocado en inglés | Autoalojado |
| nomic-embed-text | Nomic AI | Modesto, nivel portátil (2026) | 768 | ~8K tokens | Gratis (local) | Limitado | Autoalojado |
Guarda estos vectores en una base de datos vectorial dimensionada para tu número de dimensiones, porque un índice de 3072 dimensiones cuesta mucho más que uno de 1024 a gran escala.
1. Voyage-4-large
La mejor calidad de recuperación pura entre las APIs. Es un modelo mixture-of-experts con un espacio de embeddings compartido (combina nano/lite/large sin reindexar) y dimensiones Matryoshka en 2048/1024/512/256, además de cuantización fp32/int8/binaria para un almacenamiento más barato. A unos $0.12/M tokens, tiene el precio de un modelo de gama media pero recupera como uno premium. Elige este si la calidad de recuperación es tu cuello de botella y puedes pagar ~$0.12/M.
2. Gemini Embedding 001
El mejor todoterreno entre las APIs. El modelo de Google encabeza el leaderboard de MTEB en inglés (~68.3 en general, 67.7 en recuperación según la instantánea de abril de 2026), viene con 3072 dimensiones con truncamiento MRL, y comparte un espacio multimodal. A **$0.15/M** es el más caro de nuestras opciones principales. Elige este si quieres el modelo generalista con mejor puntuación y Gemini/Vertex ya forma parte de tu stack.
3. OpenAI text-embedding-3-large
La mejor opción por defecto a gran escala y la más fácil de integrar. 3072 dimensiones, truncamiento MRL hasta 256, y la cobertura de SDKs y tutoriales más amplia de cualquier embedder. A ~$0.13/M es una elección segura, y text-embedding-3-small (~$0.02/M) es el hermano económico para corpus en inglés. El veterano ada-002 todavía funciona, pero estás pagando por un recall peor. Elige este si quieres cero sorpresas y un ecosistema amplio de soporte.
4. Cohere Embed v4
La mejor opción para contenido mixto y multilingüe empresarial. Embed v4 maneja texto, imágenes y documentos intercalados en un solo modelo, con una ventana de contexto grande y una recuperación cruzada entre idiomas sólida, a ~$0.12/M. Elige este si tu corpus mezcla PDFs, capturas de pantalla y texto, o necesitas cobertura multilingüe seria bajo una sola API.
5. Voyage-context-4
La opción más reciente para RAG con documentos largos. Lanzado el 29 de junio de 2026, embebe cada fragmento junto con su contexto circundante, lo que reduce los fallos de "pérdida en el límite del fragmento" que afectan a la división ingenua. Ronda el mismo ~$0.12/M que la línea Voyage-4. Elige este si tus documentos son largos y el chunking ha sido tu dolor de cabeza.
6. Qwen3-Embedding-8B
El mejor modelo open-source en general, y la mejor opción para recuperación de código. Qwen3-Embedding de Alibaba lidera el MTEB multilingüe abierto (~70.6) y encabeza MTEB-Code (~80.7) según la documentación de Qwen3-Embedding, con dimensiones flexibles de 32 a 4096 y cuantización Q4. Elige este si autoalojas, indexas código, o necesitas recuperación multilingüe sólida sin factura por token.
7. BGE-M3
El mejor todoterreno open-source. BGE-M3 de BAAI te da recuperación densa, dispersa y multivector en un solo modelo, maneja más de 100 idiomas, y sigue siendo uno de los embedders más descargados en Hugging Face. Elige este si quieres recuperación híbrida densa más dispersa desde un único modelo autoalojado.
8. NV-Embed-v2
Los mejores pesos abiertos para precisión solo en inglés. El modelo de NVIDIA reporta un promedio de ~72.3 en inglés en el leaderboard de MTEB de HF (las cifras varían según la instantánea, así que revisa el tablero en vivo), con 4096 dimensiones. Más pesado de ejecutar que la mayoría. Elige este si la precisión en inglés es tu prioridad principal y tienes margen de GPU.
9. nomic-embed-text
La mejor opción local y para portátil. El modelo de Nomic es nativo de Ollama, diminuto y barato de autoalojar, sacrificando el recall de gama alta a cambio de velocidad en hardware modesto. Alternativas en el mismo nivel: mxbai-embed-large y el veterano all-MiniLM. Elige este si quieres embeddings totalmente locales sin coste de API y puedes aceptar un recall más bajo.
Algo que nuestra prueba confirmó una y otra vez: el número 1 del MTEB rara vez es el mejor modelo para tu corpus. Eso es exactamente lo que mide la siguiente sección.
Cómo lo Probamos: Embebiendo 10.000 Documentos y Midiendo lo que Importa
Embebimos ~10.000 documentos reales de nuestro corpus interno de documentación de producto y tickets de soporte, y luego puntuamos la recuperación contra un conjunto de ~120 consultas etiquetadas a mano. El hallazgo principal: truncar text-embedding-3-large de OpenAI de 3072 a 1024 dimensiones costó solo una caída de unos 0.03 en Recall@10 mientras reducía el almacenamiento vectorial ~3 veces. Un golpe pequeño en calidad, una gran ganancia en almacenamiento.
Probamos un subconjunto (no los nueve modelos de forma exhaustiva): Voyage-4-large, Gemini Embedding 001, text-embedding-3-large (completo y truncado), Qwen3-Embedding-8B autoalojado, BGE-M3, y nomic-embed-text. Medimos Recall@10 y nDCG@10 contra el conjunto de consultas etiquetadas, latencia p95 de embedding, y coste por millón de tokens para las APIs o segundos de GPU para el autoalojado. Esto es orientativo (~120 consultas), no un leaderboard.
| Modelo (dimensiones) | Recall@10 | nDCG@10 | Latencia p95 | Coste |
|---|---|---|---|---|
| Voyage-4-large (1024) | 0.89 | 0.81 | ~180 ms (API) | ~$0.12/M |
| Gemini Embedding 001 (3072) | 0.88 | 0.80 | ~210 ms (API) | ~$0.15/M |
| Qwen3-Embedding-8B (autoalojado) | 0.87 | 0.79 | ~430 ms (GPU en frío) | segundos de GPU |
| text-embedding-3-large (3072) | 0.86 | 0.78 | ~160 ms (API) | ~$0.13/M |
| text-embedding-3-large (1024) | 0.83 | 0.75 | ~150 ms (API) | ~$0.13/M |
| BGE-M3 (1024) | 0.82 | 0.74 | ~300 ms (autoalojado) | segundos de GPU |
| nomic-embed-text (768) | 0.76 | 0.69 | ~90 ms (local) | Gratis |
Dos conclusiones se nos quedaron grabadas. Primero, el Qwen3-8B autoalojado igualó a una API de primer nivel en nuestro conjunto en inglés, pero su latencia p95 se duplicó aproximadamente sin una GPU caliente, así que presupuesta para mantener una activa. Segundo, el número 1 del leaderboard no fue el ganador en nuestro corpus una vez que el coste entró en juego. Si quieres evaluar la calidad de recuperación de punta a punta con tus propios datos, esa es la forma honesta de elegir. Y si tienes curiosidad de por qué el número del leaderboard de MTEB puede engañar, publicaremos una explicación dedicada a continuación.

¿Cuánto Cuestan los Modelos de Embeddings?
Las APIs de embeddings alojadas cuestan aproximadamente entre $0.02 y $0.15 por millón de tokens en julio de 2026. Los modelos open-source tienen pesos "gratuitos", pero pagas en tiempo de GPU y VRAM. Las opciones API más baratas que aún rinden bien son text-embedding-3-small y voyage-4-lite a ~$0.02/M; el camino autoalojado más barato es nomic-embed-text, efectivamente gratis a nivel de token.
Aquí está la instantánea de precios verificada (a fecha de julio de 2026; los precios de embeddings cambiaron dos veces en el primer semestre de 2026, así que revisa la página del proveedor antes de comprometerte):
| Modelo | Precio /1M tokens (jul. 2026) | Notas |
|---|---|---|
| voyage-4-lite | ~$0.02 | Nivel más barato de Voyage |
| voyage-4 | ~$0.06 | Nivel estándar |
| voyage-4-large | ~$0.12 | Mejor calidad de recuperación |
| voyage-context-4 | ~$0.12 | Fragmentos con contexto |
| OpenAI 3-small | ~$0.02 | Opción económica para inglés |
| OpenAI 3-large | ~$0.13 | Opción por defecto a escala |
| Cohere Embed v4 | ~$0.12 | Multimodal |
| Gemini Embedding 001 | ~$0.15 | La de mejor puntuación |
| Open-source (Qwen3, BGE-M3, nomic) | Coste de GPU/VRAM | Sin cuota por token |
Con 100 millones de tokens indexados, la diferencia entre $0.02/M y $0.15/M es $2 frente a $15. Poco. Pero reembebe ese corpus cada mes, añade embeddings en tiempo de consulta, y el multiplicador crece rápido. Por eso el coste de las APIs de la capa de recuperación merece una línea real en tu presupuesto, no un error de redondeo. Autoalojar invierte la cuenta: sin cuota por token, pero alquilas una GPU esté ocupada o inactiva.
Coste vs. Calidad: ¿Qué Modelo de Embeddings Tiene la Mejor Relación Calidad-Precio?
La regla de la mejor relación calidad-precio es simple: elige el modelo más barato que supere Recall@10 ≥ 0.80 en tu corpus. En nuestra prueba, ese es text-embedding-3-large de OpenAI truncado a 1024 dimensiones: Recall@10 de 0.83 a ~$0.13/M, con vectores 3 veces más pequeños que la versión de 3072 dimensiones. Se sitúa justo en el cuadrante óptimo: recall suficientemente alto, almacenamiento suficientemente bajo.
Imagina el gráfico de dispersión principal: coste por millón de tokens en el eje X, calidad de recuperación en el eje Y. Las APIs premium (Voyage-4-large, Gemini 001) viven arriba a la derecha, gran recall, precio más alto. El nivel económico (3-small, voyage-4-lite) se sitúa abajo a la izquierda, barato pero con menor recall en consultas difíciles. El cuadrante de mejor valor es el que la mayoría de equipos se salta: precio medio, recall alto, vectores pequeños.
Mi opinión honesta tras revisar los números: la mayoría de los equipos sobrecompran calidad de embedding e invierten poco en chunking y reranking. Si superas 0.80 de recall en 1024 dimensiones, pagar 3 veces más en almacenamiento por una mejora de 0.03 en recall casi nunca vale la pena.
La regla de decisión en tres líneas:
- Si la calidad de recuperación es tu cuello de botella y el presupuesto no es problema, elige Voyage-4-large o Gemini 001.
- Si tienes el coste limitado, elige text-embedding-3-large truncado a 1024, o 3-small para corpus sencillos.
- Si autoalojas, Qwen3-Embedding-8B es el rey del valor una vez que tu GPU ya está funcionando.
¿Cuál es el Mejor Modelo de Embeddings Open-Source / Local para RAG?
El mejor autoalojado en general es Qwen3-Embedding-8B (necesita una GPU real, unos 16GB+ de VRAM en Q4). La mejor opción para portátil/local es nomic-embed-text en Ollama, que corre en hardware modesto sin coste de API. Autoalojar gana cuando necesitas residencia de datos, volumen alto, o quieres eliminar las cuotas por token; las APIs ganan cuando prefieres no estar pendiente de una GPU.
Ejecutar un embedder local es cosa de dos comandos. Descarga el modelo, y luego embebe y consulta. Aquí tienes el camino local con Ollama junto al camino API con el SDK de OpenAI, lado a lado:
# Local: descarga un embedder pequeño y rápido
ollama pull nomic-embed-text# Local (Ollama) — embebe una consulta sin coste de API
import ollama
vec = ollama.embed(model="nomic-embed-text", input="How do I reset my API key?")["embeddings"][0]
# Alojado (SDK de OpenAI) — la misma idea, mayor recall
from openai import OpenAI
client = OpenAI()
vec = client.embeddings.create(
model="text-embedding-3-large",
input="How do I reset my API key?",
dimensions=1024, # Truncamiento Matryoshka: vectores 3 veces más pequeños
).data[0].embeddingLo que los profesionales reportan de verdad en Reddit coincide con nuestra prueba: quienes autoalojan siguen señalando picos de latencia p95 cuando la GPU se enfría entre peticiones. La solución es mantener una instancia siempre caliente, lo que silenciosamente convierte el autoalojamiento "gratis" en una factura fija de GPU cada mes. Vale la pena calcular el precio antes de migrar fuera de una API. Si estás montando un bucle de evaluación, también ayuda gestionar los prompts alrededor de tu recuperación en un solo lugar. Para la guía completa, nuestro tutorial de configuración de embeddings locales con Ollama llega a continuación.
¿Una Dimensión Más Alta Significa Mejor Recuperación?
No, no de forma lineal. Pasado cierto punto, las dimensiones adicionales añaden coste de almacenamiento y latencia sin una ganancia proporcional en recall. Matryoshka Representation Learning (MRL) te permite truncar un vector (por ejemplo 3072→1024→512) y mantener la mayor parte del recall mientras reduces cada vector entre 3 y 6 veces. Eso es un recorte directo a tu factura de base de datos vectorial.
Nuestros números lo hacen concreto. Bajar text-embedding-3-large de 3072 a 1024 dimensiones costó ~0.03 en Recall@10 pero redujo el almacenamiento unas 3 veces. Baja hasta 512 y la caída del recall se acentúa, sobre todo en consultas ambiguas. El punto óptimo para la mayoría de corpus en inglés está alrededor de 1024.
La frase resumen: las dimensiones son un impuesto de almacenamiento y latencia que pagas por cada vector, así que recórtalas hasta el tamaño más pequeño que aún supere tu umbral de recall. Con más de 10 millones de vectores, esa decisión determina qué base de datos vectorial te puedes permitir, así que revisa qué base de datos vectorial soporta tu número de dimensiones y el coste de almacenamiento antes de fijar una dimensión.
¿Cómo Eliges un Modelo de Embeddings para RAG?
Elegir un modelo de embeddings para RAG se reduce a cuatro comprobaciones, en orden. Aplícalas sobre tus propios datos, no sobre un leaderboard público, y la lista corta se acorta rápido.
- Recall@10 ≥ 0.80 en TU corpus. Prueba un subconjunto con un conjunto de consultas etiquetadas a mano. La posición en el leaderboard es una pista, no una respuesta.
- Coste bajo tu límite de $/1M. Ten en cuenta el reembebido y los embeddings en tiempo de consulta, no solo el índice inicial.
- Ventana de contexto ≥ el tamaño de tus fragmentos. Si tus fragmentos rondan los 1.000 tokens, un modelo de 512 tokens trunca y pierde significado.
- Mantenimiento activo y multilingüe si lo necesitas. Un modelo actualizado en 2026 supera a un checkpoint desactualizado de 2024; prueba directamente tus idiomas objetivo.
Puntúa dos o tres modelos en las cuatro y el ganador suele elegirse solo. A partir de ahí, se trata de conectar todo esto en un pipeline RAG completo: fragmentar, embeber, almacenar, recuperar, reordenar.
Sobre el Autor
Mert Batur es Cofundador de Techsy.io, donde el equipo desarrolla agentes de IA, sistemas de automatización, y pipelines de voz/SDR para clientes B2B. Escribe sobre el stack de herramientas LLM que el equipo de Techsy realmente usa en producción. Conecta en LinkedIn.
Elegir una herramienta es la parte fácil. Hacer que funcione de forma fiable dentro de un producto real es donde la mayoría de los equipos se atasca, y eso es exactamente lo que nuestro equipo de integración de IA construye para sus clientes, desde pipelines RAG hasta agentes a medida.
Preguntas Frecuentes
¿Es suficiente la puntuación MTEB para elegir el mejor modelo de embeddings para RAG?
No. MTEB es sobre todo recuperación de texto de un solo dominio sobre datasets públicos, así que no refleja tu corpus, tamaño de fragmento, mezcla de idiomas o límite de coste. En nuestro benchmark de 10.000 documentos, el número 1 del leaderboard no fue el mejor en nuestro corpus una vez incluido el precio. Ejecuta siempre una pequeña evaluación en tu propio dominio.
¿Cuál es el mejor modelo de embeddings para RAG en 2026?
Voyage-4-large para calidad de recuperación pura, Gemini Embedding 001 como el mejor todoterreno API, y Qwen3-Embedding-8B si autoalojas. "El mejor" depende de tu límite de coste y necesidades de idioma, así que preselecciona dos y pruébalos con tus propios datos antes de comprometerte.
¿Cuál es el mejor modelo de embeddings open-source para RAG?
Qwen3-Embedding-8B es el líder open-source en general (mejores puntuaciones en MTEB multilingüe y de código), BGE-M3 es el todoterreno híbrido versátil, y nomic-embed-text es la opción para portátil vía Ollama. Los pesos son gratuitos, pero pagas la GPU y la VRAM para ejecutarlos.
¿Embeddings open-source o API, cuál es mejor para RAG?
Las APIs ganan en cero operaciones y la última calidad; el autoalojamiento gana en residencia de datos, volumen alto y ninguna cuota por token. El punto de equilibrio suele estar marcado por el volumen y el cumplimiento normativo, no por la calidad en bruto. Por debajo de unos pocos cientos de millones de tokens al mes, las APIs son casi siempre más baratas en la práctica.
¿Cuál es el mejor modelo de embeddings local para ejecutar en Ollama?
nomic-embed-text es la opción de referencia (ollama pull nomic-embed-text): ligero, rápido en hardware modesto, y gratis a nivel de token. Si te sobra VRAM de GPU, una variante más pequeña de Qwen3-Embedding recupera mejor. Ambos indexan localmente sin coste de API ni datos que salgan de tu máquina.
¿Una dimensión de embedding más alta significa mejor recuperación?
No de forma lineal. Pasado cierto punto, las dimensiones adicionales añaden almacenamiento y latencia sin una ganancia proporcional en recall. Los modelos Matryoshka te permiten truncar (por ejemplo 3072→1024) y mantener la mayor parte del recall mientras reduces cada vector unas 3 veces, recortando directamente el coste de tu base de datos vectorial.
¿Cuál es el modelo de embeddings más barato que aún sea bueno para RAG?
text-embedding-3-small ($0.02/M) o voyage-4-lite ($0.02/M) superan un Recall@10 sólido para la mayoría de corpus en inglés. Si puedes ejecutar una GPU, nomic-embed-text es efectivamente gratis a nivel de token. Prueba primero con tus datos; los modelos baratos caen en consultas ambiguas.
¿Cuál es el mejor modelo de embeddings multilingüe para RAG?
Qwen3-Embedding-8B y BGE-M3 lideran la recuperación multilingüe abierta, mientras que Cohere Embed v4 y Gemini Embedding 001 son opciones alojadas sólidas. Prueba siempre con tus idiomas objetivo, ya que una posición alta en MTEB-multilingüe no garantiza el mejor rendimiento en tu par de idiomas específico.
¿Sigo necesitando un reranker con un buen modelo de embeddings?
A menudo sí, para RAG de máxima precisión. Un buen embedder mete a los candidatos en el top-50; un reranker reordena el top-k para la precisión final. Un embedder más barato más un reranker suele superar a un embedder caro solo, y cuesta menos en total.
El Veredicto
La mejor recuperación general en una API es para Voyage-4-large; Gemini Embedding 001 es el todoterreno con mejor puntuación; Qwen3-Embedding-8B lidera el open-source y la recuperación de código; y nomic-embed-text es la opción local para portátil. Pero el ganador en relación calidad-precio para la mayoría de equipos es un text-embedding-3-large truncado a 1024 dimensiones: 0.83 de Recall@10, ~$0.13/M, y vectores 3 veces más pequeños. La lección real de 10.000 documentos es que el número 1 del MTEB rara vez es el mejor modelo para tu corpus, así que pruébalo con tus propios datos. ¿Estás construyendo RAG en producción y quieres una segunda opinión? Consigue una consulta gratuita.