
Los mejores LLMs de código abierto en 2026: 8 modelos clasificados por rendimiento real
Última actualización: 5 de julio de 2026. Cada puntuación de benchmark, cada cifra de VRAM y cada licencia en esta guía fue reverificada para esta actualización. El ranking a continuación refleja modelos de pesos abiertos publicados hasta mediados de 2026 — si un nuevo lanzamiento cambia el orden, esta página se actualiza en el plazo de un mes.
El mejor LLM de código abierto en 2026 es Qwen 3 235B-A22B para razonamiento general y programación, con DeepSeek R1 liderando en razonamiento matemático profundo y Llama 4 Scout en contexto largo (10 millones de tokens). Para una sola GPU de consumidor, Gemma 3 27B (16 GB de VRAM) y Phi-4 14B (8 GB) son los más fáciles de autoalojar. Los tres modelos principales igualan el rendimiento de GPT-4 en código y matemáticas mientras se mantienen gratuitos para desplegar.
Principales LLMs de código abierto: instantánea de benchmarks
La tabla a continuación cubre cinco modelos de código abierto ampliamente desplegados, evaluados con benchmarks públicos estándar. MMLU mide conocimiento general amplio; HumanEval mide la tasa de éxito en generación de código.
| Modelo | Parámetros | Publicación | MMLU | HumanEval | Licencia | Mejor para |
|---|---|---|---|---|---|---|
| Llama 3.3 70B | 70B | Dic. 2024 | 86,0 | 88,4 | Llama 3.3 Community | Uso general, multilingüe |
| Qwen 2.5 72B | 72B | Sep. 2024 | 85,0+ | 86,6 | Qwen License | Matemáticas, programación, seguimiento de instrucciones |
| DeepSeek-V3 | 671B (37B activos) | Dic. 2024 | 87,1 | 82,6 | MIT | Uso general, programación, rentable |
| Mistral Small 3.1 | 24B | Mar. 2025 | 80,6 | 88,4 | Apache 2.0 | Flujos agénticos, visión, multilingüe |
| Gemma 3 27B | 27B | Mar. 2025 | ~78,6 | 87,8 | Gemma Terms of Use | Despliegue en GPU única, multimodal |
Actualizamos esta tabla mensualmente.
Los LLMs de código abierto ya no solo "compiten" con los modelos propietarios -- en programación, matemáticas y tareas de contexto largo, están ganando. La brecha entre una factura API de $200/mes y un modelo abierto autoalojado nunca ha sido tan pequeña.
Esta clasificación corta el ruido. Cada modelo aquí se evalúa en benchmarks que importan de verdad, en el hardware que realmente necesitarás, y en el caso de uso específico donde cada modelo brilla con más fuerza.
Resumen rápido: ¿Qué LLM de código abierto deberías elegir?
¿Necesitas el mejor razonamiento absoluto? Opta por Qwen 3 235B o DeepSeek R1. ¿Quieres ejecutar algo en una sola GPU? Gemma 3 27B o Phi-4 14B. ¿Procesando documentos masivos? La ventana de contexto de 10M tokens de Llama 4 Scout no tiene rival.
| Rango | Modelo | Parámetros (activos) | Mejor para | Licencia | VRAM mín. |
|---|---|---|---|---|---|
| no. 1 | Qwen 3 235B-A22B | 235B (22B) | Razonamiento + programación | Apache 2.0 | ~132 GB (Q4) |
| no. 2 | DeepSeek R1 | 671B (37B) | Razonamiento profundo + matemáticas | MIT | ~136 GB (Q4) |
| no. 3 | Llama 4 Scout | 109B (17B) | Contexto largo (10M tokens) | Llama License | ~55 GB (Q4) |
| no. 4 | DeepSeek V3 | 671B (37B) | Uso general + programación | MIT | ~136 GB (Q4) |
| no. 5 | Mistral Large 3 | 675B (41B) | Multilingüe + empresa | Apache 2.0 | ~140 GB (Q4) |
| no. 6 | Gemma 3 27B | 27B (27B, denso) | Despliegue en GPU única | Open weights | ~16 GB (Q4) |
| no. 7 | Phi-4 Reasoning | 14B (14B, denso) | Edge + dispositivos móviles | MIT | ~8 GB (Q4) |
| no. 8 | GLM-4.7 | 355B (32B) | Flujos de trabajo de codificación agéntica | MIT | ~130 GB (Q4) |
Los números de VRAM asumen cuantización Q4. Los requisitos de precisión completa son 2-4 veces más altos. Si eres nuevo en ejecutar modelos localmente, empieza con Gemma 3 o Phi-4 -- son las opciones más amigables con el hardware de esta lista.
Clasificación de LLMs de código abierto: ranking de julio de 2026
A partir de julio de 2026, Qwen 3 235B-A22B lidera nuestra clasificación de LLMs de código abierto en razonamiento y programación en general, con DeepSeek R1 en segundo lugar en matemáticas profundas y Llama 4 Scout en tercero en contexto largo. El ranking completo a continuación cubre los ocho modelos evaluados en esta guía, desde equipos de centro de datos hasta opciones aptas para portátiles.
| Rango | Modelo | Licencia | Mejor para | VRAM mín. |
|---|---|---|---|---|
| no. 1 | Qwen 3 235B-A22B | Apache 2.0 | Razonamiento + programación | ~132 GB (Q4) |
| no. 2 | DeepSeek R1 | MIT | Razonamiento profundo + matemáticas | ~136 GB (Q4) |
| no. 3 | Llama 4 Scout | Llama License | Contexto largo (10M tokens) | ~55 GB (Q4) |
| no. 4 | DeepSeek V3 | MIT | Uso general + programación | ~136 GB (Q4) |
| no. 5 | Mistral Large 3 | Apache 2.0 | Multilingüe + empresa | ~140 GB (Q4) |
| no. 6 | Gemma 3 27B | Open weights | Despliegue en GPU única | ~16 GB (Q4) |
| no. 7 | Phi-4 Reasoning | MIT | Edge + dispositivos móviles | ~8 GB (Q4) |
| no. 8 | GLM-4.7 | MIT | Flujos de codificación agéntica | ~130 GB (Q4) |
Estas clasificaciones reflejan nuestra revisión mensual de benchmarks, requisitos de hardware y términos de licencia.
Ahora desglosemos qué hace a cada modelo digno de tu atención.
1. Qwen 3 235B-A22B -- El mejor LLM de código abierto en general
El Qwen 3 235B-A22B de Alibaba es el modelo a batir ahora mismo. Es una arquitectura Mixture-of-Experts con 235 mil millones de parámetros totales, pero solo 22 mil millones se activan por token -- reduciendo el cómputo aproximadamente un 90% en comparación con un modelo denso de calidad similar.
Lo que distingue a Qwen 3 es su modo de pensamiento dual. Puedes alternar entre un "modo de pensamiento" para problemas complejos de matemáticas y programación (donde el modelo muestra su cadena de razonamiento) y un rápido "modo sin pensamiento" para respuestas de chat rápidas. Esa flexibilidad importa en producción.
Puntos destacados de benchmarks:
| Benchmark | Puntuación Qwen 3 235B | Contexto |
|---|---|---|
| AIME 2024 | 85,7% | Matemáticas a nivel de competición |
| AIME 2025 | 81,5% | Problemas matemáticos más difíciles |
| LiveCodeBench v5 | 70,7% | Tareas reales de codificación |
| CodeForces | 2.056 | Programación competitiva |
| BFCL v3 | 70,8% | Llamada a funciones |
Estas cifras lo ponen en el mismo nivel que DeepSeek R1, el o1 de OpenAI y Gemini 2.5 Pro -- excepto que puedes descargarlo, ajustarlo y desplegarlo donde quieras bajo Apache 2.0.
Requisitos de hardware: El modelo completo necesita aproximadamente 132 GB de VRAM con cuantización Q4. Es un setup multi-GPU -- piensa en cinco RTX 3090, tres A40, o un rig dual-H100. No es barato, pero está al alcance de una startup o laboratorio de investigación. La familia Qwen 3 también incluye variantes más pequeñas (32B, 14B, 8B, 4B) que funcionan en hardware de consumidor.
Quién debería usarlo: Equipos que necesitan razonamiento y programación a nivel frontera pero quieren ser dueños de su infraestructura. Especialmente fuerte para cargas de trabajo multilingüe con contexto de 256K y soporte para más de 100 idiomas. Si planeas ajustar un modelo para tu dominio específico, la licencia Apache 2.0 de Qwen 3 te da total libertad.
2. DeepSeek R1 -- El mejor para razonamiento profundo
DeepSeek R1 cambió el juego a principios de 2025, demostrando que los modelos de código abierto podían igualar al o1 de OpenAI en tareas de razonamiento. La actualización R1-0528 llevó las cosas aún más lejos -- la precisión en AIME 2025 saltó del 70% al 87,5%.
El secreto del modelo es su metodología de entrenamiento. DeepSeek primero creó R1-Zero usando aprendizaje por refuerzo puro sin ajuste fino supervisado previo. El modelo desarrolló espontáneamente razonamiento de cadena de pensamiento, autoverificación y comportamientos de retroceso. Literalmente se enseñó a sí mismo a verificar su propio trabajo.
Puntos destacados de benchmarks:
| Benchmark | Puntuación DeepSeek R1 | Contexto |
|---|---|---|
| AIME 2025 | 87,5% (R1-0528) | Olimpiada de matemáticas |
| GPQA Diamond | 71,5% | Ciencia a nivel posgrado |
| SWE-bench | 49,2% | Ingeniería de software real |
| HumanEval | 92,4% | Generación de código |
Requisitos de hardware: La misma arquitectura 671B MoE que DeepSeek V3, así que necesitas ~136 GB de VRAM en Q4. Pero aquí está el ángulo práctico: DeepSeek también lanzó variantes destiladas con 1,5B, 7B, 14B, 32B y 70B de parámetros. La destilación de 32B funciona en un solo RTX 4090 y aún supera a muchos modelos más grandes en tareas de razonamiento.
Quién debería usarlo: Cualquiera que construya aplicaciones que requieran razonamiento paso a paso -- demostración de teoremas, depuración compleja de código, análisis científico. Las variantes destiladas son especialmente útiles si necesitas capacidades de razonamiento con un presupuesto limitado. Consulta las mejores herramientas para ejecutar LLMs localmente si quieres desplegar las destilaciones más pequeñas en tu propio hardware.
3. Llama 4 Scout -- El mejor para contexto largo
El Llama 4 Scout de Meta trajo algo genuinamente nuevo al mundo del código abierto: una ventana de contexto de 10 millones de tokens. No es un error tipográfico. Puedes alimentarlo con una base de código completa, un estante de artículos de investigación o 20 horas de transcripción de video en un solo mensaje.
Scout usa 16 expertos MoE con solo 2 activos por token, dándole 109B de parámetros totales pero solo 17B activos. Meta afirma que cabe en un solo H100 con cuantización INT4, aunque la ventana de contexto de 10M tokens obviamente requiere más memoria para la caché KV.
Puntos destacados de benchmarks:
| Benchmark | Puntuación Llama 4 Scout | Contexto |
|---|---|---|
| Needle-in-a-Haystack (10M) | 100% | Recuperación perfecta |
| MMLU | 79,6% | Conocimiento general |
| HumanEval | 81,2% | Generación de código |
| DocVQA | 85,1% | Comprensión de documentos |
Esa puntuación perfecta de Needle-in-a-Haystack a 10M tokens es notable. La mayoría de los modelos empiezan a perder información mucho antes de los 128K. Scout usa un nuevo enfoque de enmascaramiento de atención entre documentos que mantiene los límites entre documentos incluso dentro de su masiva ventana de contexto.
Requisitos de hardware: En Q4, los pesos del modelo necesitan unos 55 GB de VRAM. Un solo H100 (80 GB) lo maneja cómodamente. Para hardware de consumidor, dos RTX 4090 (48 GB en total) pueden manejar longitudes de contexto más cortas. El inconveniente: usar realmente la ventana de contexto completa de 10M requiere una memoria enorme de caché KV además de los pesos del modelo. En la práctica, la mayoría de los despliegues autoalojados se limitan a 128K-256K tokens.
Quién debería usarlo: Equipos que trabajan con documentos masivos -- análisis legal, Q&A sobre repositorios de código, síntesis de artículos de investigación. Las capacidades multimodales (entrada de texto + imagen) también son sólidas. Solo sé realista sobre la longitud del contexto: el techo de 10M es real, pero necesitarás hardware de grado servidor para alcanzarlo.
4. DeepSeek V3 -- El mejor LLM de código abierto de propósito general
Mientras que DeepSeek R1 acapara los titulares por su razonamiento, DeepSeek V3 es posiblemente el modelo más práctico para el uso cotidiano. Es el caballo de batalla -- rápido, capaz en todos los frentes, y notablemente eficiente para su tamaño.
V3 comparte la misma arquitectura 671B MoE / 37B activos que R1 pero cambia las cadenas de razonamiento profundo por tiempos de respuesta más rápidos y capacidades generales más amplias. La actualización V3-0324 incorporó técnicas de aprendizaje por refuerzo del entrenamiento de R1, mejorando el razonamiento sin el impacto en la latencia de la cadena de pensamiento explícita.
Puntos destacados de benchmarks:
| Benchmark | Puntuación DeepSeek V3 | Contexto |
|---|---|---|
| MMLU | 87,1% | Conocimiento general |
| HumanEval | 82,6% | Generación de código |
| MATH | 90,2% | Razonamiento matemático |
| Ventana de contexto | 128K | Soporte de documentos largos |
DeepSeek V3 supera a GPT-4.5 en benchmarks de codificación y matemáticas. Su eficiencia de entrenamiento es legendaria -- solo 2,788 millones de horas GPU H800 para el ciclo completo de preentrenamiento, una fracción de lo que requieren modelos comparables.
Requisitos de hardware: Idénticos a R1 (~136 GB de VRAM en Q4). Para despliegues prácticos, las versiones cuantizadas GGUF se ejecutan a través de llama.cpp u Ollama en configuraciones multi-GPU de consumidor.
Quién debería usarlo: Si necesitas un modelo que maneje todo -- chat, programación, análisis, traducción, resumen -- V3 es la elección más equilibrada. No superará a R1 en razonamiento difícil ni a Scout en longitud de contexto, pero superará a ambos en cargas de trabajo de producción típicas donde la velocidad y la versatilidad importan más que las puntuaciones máximas en benchmarks.
5. Mistral Large 3 -- El mejor para uso multilingüe y empresarial
Mistral Large 3 devolvió a Mistral a la frontera. Con 675B de parámetros totales (41B activos), es un modelo MoE completo lanzado bajo Apache 2.0 -- un enorme cambio respecto a la restrictiva licencia de investigación de Mistral Large 2.
El modelo fue entrenado desde cero en 3.000 GPU NVIDIA H200, y se nota. En el LMSYS Chatbot Arena, se clasificó no. 2 entre los modelos abiertos y no. 6 en general (incluyendo los propietarios). Lo que lo hace especialmente interesante para equipos europeos es su fortaleza multilingüe -- aproximadamente 85,5% de precisión en una prueba MMLU multilingüe equilibrada.
Puntos destacados de benchmarks:
| Benchmark | Puntuación Mistral Large 3 | Contexto |
|---|---|---|
| MMLU multilingüe | 85,5% | Conocimiento entre idiomas |
| LMSYS Arena | no. 6 en general | Clasificación por preferencia humana |
| AIME 2025 (variante 14B) | 85% | Razonamiento matemático |
| Ventana de contexto | 128K | Soporte de documentos largos |
Un rasgo que distingue a los modelos Mistral: están entrenados para decir "No sé" en lugar de alucinar. Eso hace de Mistral Large 3 una opción sólida para pipelines RAG y aplicaciones empresariales donde la precisión factual importa más que la producción creativa.
Requisitos de hardware: Con 675B de parámetros totales, los requisitos de VRAM son similares a DeepSeek (~140 GB en Q4). Mistral también ofrece la variante Small 3 de 14B, que cabe en una sola GPU de consumidor y supera ampliamente su peso en razonamiento y programación.
Quién debería usarlo: Empresas europeas que necesitan capacidades multilingüe y soberanía de datos. Equipos empresariales que construyen sistemas RAG donde la reducción de alucinaciones es crítica. La licencia Apache 2.0 elimina completamente la fricción comercial.
6. Gemma 3 27B -- El mejor para despliegue en GPU única
El Gemma 3 27B de Google es el punto óptimo entre capacidad y accesibilidad. Con 27 mil millones de parámetros en una arquitectura densa, funciona en una sola RTX 4090 con cuantización Q4. Sin rigs multi-GPU, sin hardware de grado servidor -- solo una tarjeta gráfica de gaming normal.
No te dejes engañar por el modesto conteo de parámetros. Gemma 3 27B supera ampliamente su peso, especialmente en tareas multimodales. Maneja tanto texto como imagen de entrada, admite más de 140 idiomas, y su ventana de contexto de 130K es generosa para un modelo de este tamaño.
Puntos destacados de benchmarks:
| Benchmark | Puntuación Gemma 3 27B | Contexto |
|---|---|---|
| MMLU | 78,6% | Conocimiento general |
| DocVQA | 85,6% | Comprensión de documentos |
| MGSM | 74,3% | Matemáticas multilingüe |
| ChartQA | 76,3% | Razonamiento visual |
Esas puntuaciones multimodales (DocVQA 85,6%, ChartQA 76,3%) compiten con modelos 3-5 veces más grandes. Para desarrolladores que necesitan comprensión de imágenes sin un clúster de GPU, Gemma 3 es la elección obvia.
Requisitos de hardware: Alrededor de 16 GB de VRAM con cuantización Q4, 32 GB en Q8. Una sola RTX 4090 (24 GB) lo maneja cómodamente. Incluso un MacBook Pro M2 con 32 GB de memoria unificada puede ejecutarlo. Si sigues nuestra guía para ejecutar LLMs localmente, Gemma 3 es uno de los modelos más fáciles con los que empezar.
Quién debería usarlo: Desarrolladores individuales, equipos pequeños, y cualquiera que quiera un modelo multimodal capaz sin alquilar GPUs en la nube. También es excelente para prototipar -- prueba tu pipeline en Gemma 3 localmente, luego escala a un modelo más grande en producción si es necesario. Para el modelo pequeño más reciente de Google, consulta nuestra guía de Gemma 4 12B.
7. Phi-4 Reasoning -- El mejor para despliegues edge y con recursos limitados
El Phi-4 Reasoning de Microsoft demuestra que el conteo de parámetros no lo es todo. Con solo 14 mil millones de parámetros, supera la destilación de 70B de DeepSeek R1 en varios benchmarks de razonamiento. El recientemente lanzado Phi-4-reasoning-vision-15B añade capacidades multimodales, obteniendo un 17% más que Gemma 3 12B en tareas de razonamiento matemático-visual.
El secreto de la familia Phi-4 es la calidad de los datos de entrenamiento. El enfoque de Microsoft prioriza datos curados y de alta calidad sobre la escala bruta, y funciona -- Phi-4 obtiene más del 80% en los benchmarks MATH y MGSM, superando al Gemini Pro de Google y GPT-4o-mini en razonamiento matemático.
Puntos destacados de benchmarks:
| Benchmark | Puntuación Phi-4 | Contexto |
|---|---|---|
| MATH | 82,6% | Razonamiento matemático |
| HumanEval | 82,6% | Generación de código |
| MGSM | 80%+ | Matemáticas multilingüe |
| MathVista (vision) | +17% vs Gemma 12B | Matemáticas visuales |
Requisitos de hardware: Alrededor de 8 GB de VRAM en Q4 -- eso es una GPU de portátil o incluso una tarjeta de escritorio más antigua. El modelo funciona cómodamente en MacBooks de Apple Silicon, haciéndolo genuinamente portátil. Para despliegues edge, es uno de los pocos modelos que puede ejecutarse en el dispositivo con latencia razonable.
Quién debería usarlo: Desarrolladores móviles y edge, equipos que construyen funciones de IA en el dispositivo, y cualquiera que necesite un razonamiento sólido en hardware mínimo. Phi-4 también es una excelente opción para evaluar modelos ajustados ya que su pequeño tamaño hace que las iteraciones de entrenamiento sean rápidas y baratas. La licencia MIT no tiene restricciones comerciales.
8. GLM-4.7 -- El mejor para codificación agéntica
El GLM-4.7 de Z.ai está construido específicamente para un caso de uso: flujos de trabajo de codificación agéntica donde el modelo necesita razonar, usar herramientas y mantener contexto a través de largas interacciones de múltiples pasos.
Su arquitectura es un MoE de 355B con 32B de parámetros activos, pero la característica destacada es su sistema de pensamiento de tres niveles. A diferencia de la mayoría de los modelos que reinician su proceso de razonamiento en cada turno, GLM-4.7 retiene bloques de pensamiento durante toda la conversación. Ese contexto de razonamiento persistente hace una diferencia real cuando el modelo está orquestando tareas de codificación complejas de múltiples pasos.
Puntos destacados de benchmarks:
| Benchmark | Puntuación GLM-4.7 | Contexto |
|---|---|---|
| SWE-bench | 73,8% | Ingeniería de software real |
| HumanEval | 94,2% | Generación de código |
| Ventana de contexto | 200K | Interacciones largas |
| Salida máx. | 131K tokens | Generación extendida |
Esa puntuación del 73,8% en SWE-bench es competitiva con Claude Sonnet 4.5 -- en tareas de ingeniería de software del mundo real, no en benchmarks sintéticos. Y el 94,2% de HumanEval es el más alto de cualquier modelo en esta lista.
Requisitos de hardware: Similar a otros modelos MoE grandes (~130 GB de VRAM en Q4). La ventana de contexto de 200K y la salida máxima de 131K lo hacen intensivo en memoria durante sesiones agénticas largas.
Quién debería usarlo: Equipos de desarrollo asistido por IA que construyen agentes de codificación, herramientas de depuración automatizada o sistemas de revisión de código. Si estás eligiendo herramientas de ajuste fino para un modelo orientado a la codificación, GLM-4.7 es una base sólida. La licencia MIT permite el uso comercial completo.
El mejor LLM de código abierto para programar (julio de 2026)
Para programar en julio de 2026, GLM-4.7 es la mejor opción de código abierto, con un 94,2% en HumanEval y un 73,8% en SWE-bench, competitivo con Claude Sonnet 4.5 en tareas de software reales. ¿Buscas un modelo de programación sólido en hardware de consumidor? La destilación DeepSeek R1 32B funciona en una sola RTX 4090.
¿Estás valorando el lanzamiento más reciente de GLM? Consulta nuestro análisis de GLM 5.2 para ver cómo se compara.
Cómo elegir: marco de decisión
El modelo "mejor" depende enteramente de tus restricciones. Usa esta matriz para reducir tu decisión.
| Si necesitas... | Elige | Por qué |
|---|---|---|
| Mejor razonamiento general | Qwen 3 235B | Top en matemáticas, código y benchmarks generales |
| Cadena de pensamiento profunda | DeepSeek R1 | Razonamiento autocorrectivo, 87,5% AIME |
| Ventana de contexto masiva | Llama 4 Scout | 10M tokens, recuperación perfecta |
| Rápido y de propósito general | DeepSeek V3 | Mejor relación velocidad-calidad |
| Empresa multilingüe | Mistral Large 3 | 85,5% MMLU multilingüe, anti-alucinación |
| Una sola GPU de consumidor | Gemma 3 27B | 16 GB VRAM, fuerte en multimodal |
| Portátil o dispositivo edge | Phi-4 14B | 8 GB VRAM, licencia MIT |
| Agentes de codificación | GLM-4.7 | 94,2% HumanEval, razonamiento persistente |
¿Todavía indeciso? Empieza aquí: ¿Tienes hardware multi-GPU? Si no, tus opciones son Gemma 3 y Phi-4. Si sí, ¿estás construyendo un agente de codificación? Elige GLM-4.7 o DeepSeek R1. ¿Necesitas contexto largo? Llama 4 Scout. ¿Todo lo demás? Qwen 3 235B es la opción predeterminada más segura.
Cómo clasificamos estos modelos
Las clasificaciones no se basan en un solo benchmark. Cada modelo fue evaluado en cinco dimensiones:
- Rendimiento en benchmarks -- MMLU, HumanEval, AIME, SWE-bench y pruebas específicas del dominio
- Accesibilidad del hardware -- ¿Pueden los equipos reales realmente desplegarlo?
- Libertad de licencia -- Apache 2.0 y MIT puntúan más alto que las licencias restrictivas
- Madurez del ecosistema -- Disponible en Hugging Face, Ollama, vLLM y los principales motores de inferencia
- Adopción real -- Comunidad activa, despliegues en producción, actualizaciones continuas
Los modelos que puntúan bien en benchmarks pero requieren un clúster de GPU que nadie tiene (hablando de 671B en precisión completa) son penalizados. Los modelos con licencias restrictivas que bloquean el uso comercial también pierden puntos. El objetivo es el valor práctico, no presumir de posiciones en leaderboards.
Si quieres probar estos modelos tú mismo, nuestra guía de evaluación de LLMs explica cómo configurar benchmarks sistemáticos, y el resumen de las mejores herramientas de evaluación cubre los frameworks que necesitarás.
Elegir una herramienta es la parte fácil. Hacer que funcione de forma fiable dentro de un producto real es donde la mayoría de los equipos se atasca, y eso es exactamente lo que nuestro equipo de integración de IA construye para sus clientes, desde pipelines RAG hasta agentes a medida. ¿Quieres una segunda opinión sobre tu stack? Solicita una consultoría gratuita.
Preguntas frecuentes
¿Cuáles son los LLMs de código abierto más recientes en 2026?
La frontera de 2026 está liderada por Qwen 3 (Alibaba), DeepSeek R1 y V3, Llama 4 Scout (Meta), Mistral Large 3 y GLM-4.7 (Z.ai). Versiones puntuales como DeepSeek R1-0528 y la variante Phi-4 reasoning-vision llegaron a mediados de 2026. Revisamos esta lista mensualmente y actualizamos el ranking cada vez que un nuevo lanzamiento cambia la clasificación.
¿Con qué frecuencia se actualiza este ranking de LLMs de código abierto?
Mensualmente. Reverificamos las puntuaciones de benchmarks, los requisitos de VRAM y las licencias al inicio de cada mes y añadimos nuevos modelos a medida que se lanzan. La fecha "Última actualización" bajo el título refleja la revisión más reciente.
¿Cuál es el mejor LLM de código abierto en 2026?
Qwen 3 235B-A22B actualmente lidera en el rango más amplio de benchmarks, combinando razonamiento de primer nivel, programación y capacidades multilingüe bajo una licencia Apache 2.0. Para casos de uso específicos, DeepSeek R1 (razonamiento) y Llama 4 Scout (contexto largo) pueden ser mejores opciones.
¿Puedo ejecutar LLMs de código abierto en hardware de consumidor?
Sí. Gemma 3 27B funciona en una sola RTX 4090 (24 GB de VRAM) y Phi-4 14B cabe en una GPU de portátil con 8 GB. Las versiones cuantizadas (Q4, Q8) de modelos más grandes también funcionan en configuraciones multi-GPU de consumidor usando herramientas como Ollama y llama.cpp.
¿Son los LLMs de código abierto tan buenos como ChatGPT o Claude?
En benchmarks de programación y matemáticas, los mejores modelos de código abierto igualan o superan a GPT-4.5 y se acercan al rendimiento de Claude Sonnet 4.5. La brecha es más pequeña en tareas estructuradas (código, matemáticas, razonamiento) y más grande en escritura creativa y seguimiento de instrucciones matizadas.
¿Qué significa MoE (Mixture-of-Experts) para el hardware?
Los modelos MoE tienen un gran número total de parámetros pero solo activan una fracción por token. Sin embargo, todo el modelo debe cargarse en memoria para que el enrutador pueda seleccionar expertos. Un modelo MoE de 235B con 22B activos todavía necesita 235B de VRAM -- no ahorras memoria, ahorras cómputo.
¿Qué LLM de código abierto es mejor para programar?
GLM-4.7 lidera con 94,2% en HumanEval y 73,8% en SWE-bench. Para generación de código pura, DeepSeek R1 y Qwen 3 235B están justo detrás. Para programar en hardware de consumidor, la destilación DeepSeek R1 32B es la mejor relación capacidad-costo.
¿El contexto de 10 millones de tokens de Llama 4 Scout es realmente real?
La arquitectura lo soporta, y Meta demostró recuperación perfecta de Needle-in-a-Haystack a 10M tokens. Pero usar realmente el contexto completo requiere una enorme memoria de caché KV. La mayoría de los despliegues autoalojados se limitan realistamente a 128K-256K tokens. Proveedores de nube como Together AI y Fireworks ofrecen ventanas de contexto más largas.
¿Qué licencia debo buscar en un LLM de código abierto?
Apache 2.0 y MIT son las más permisivas -- uso comercial completo, modificación y redistribución. La licencia personalizada de Llama permite el uso comercial pero tiene restricciones para aplicaciones con más de 700M de usuarios. Algunos modelos de "pesos abiertos" (como Gemma) tienen términos específicos -- siempre lee la licencia antes del despliegue en producción.
¿Cuánta VRAM necesito para un modelo de 70B?
Con cuantización Q4, un modelo denso de 70B necesita aproximadamente 35-40 GB de VRAM. Un solo A100 (80 GB) lo maneja fácilmente, o dos RTX 4090 (48 GB en total). Con precisión completa (BF16), son 140+ GB -- lo que requiere efectivamente cuatro A100 o equivalente.
¿Puedo ajustar finamente LLMs de código abierto para mi caso de uso?
Absolutamente. QLoRA hace posible el ajuste fino de un modelo de 70B en una sola GPU de 24 GB. Los modelos más pequeños como Phi-4 y Gemma 3 son aún más accesibles para experimentos de ajuste fino. Los modelos con licencia Apache 2.0 y MIT no tienen restricciones en trabajos derivados.
¿Qué hay de los LLMs multimodales de código abierto?
Gemma 3 27B y Llama 4 Scout manejan nativamente entrada de texto e imagen. Phi-4-reasoning-vision-15B añade razonamiento visual a menor escala. Para comprensión de video, Llama 4 Scout admite hasta 20 horas de entrada de video dentro de su ventana de contexto.
¿Cuál es el mejor LLM de código abierto ahora mismo?
Ahora mismo, Qwen 3 235B-A22B es el mejor LLM de código abierto en general, liderando en razonamiento y programación bajo una licencia Apache 2.0. Para una sola GPU de consumidor, Gemma 3 27B (16 GB de VRAM) es la mejor opción, y GLM-4.7 gana en agentes de codificación con un 94,2% en HumanEval.
¿Existe un ranking de LLMs de código abierto?
Sí. Nuestra clasificación de julio de 2026 más arriba ordena los ocho modelos de esta guía, y Hugging Face aloja el Open LLM Leaderboard gestionado por la comunidad para una cobertura más amplia. Reverificamos nuestras clasificaciones mensualmente frente a benchmarks como MMLU, HumanEval, AIME y SWE-bench.