ai-machine-learning

Kimi K3 a examen: el modelo abierto de 2.8T de Moonshot frente a Fable 5 y GPT-5.6 Sol

Escrito por Mert Batur
Jul 17, 2026
19 lectura
Kimi K3 a examen: el modelo abierto de 2.8T de Moonshot frente a Fable 5 y GPT-5.6 Sol

Kimi K3 a examen: el modelo abierto de 2.8T de Moonshot frente a Fable 5 y GPT-5.6 Sol

Última verificación: 17 de julio de 2026. Cada especificación, precio y benchmark de este artículo se revisó contra la documentación de la plataforma de Moonshot, Artificial Analysis y cobertura independiente el mismo día de su publicación. Kimi K3 se lanzó el 16 de julio de 2026.

En esta reseña de Kimi K3, hay un dato de lanzamiento que lo dice todo: el nuevo modelo de Moonshot debutó en el puesto #1 del ranking Frontend Code de Arena, un salto de 17 puestos sobre Kimi K2.6, por delante de Claude Fable 5. Eso significa que un modelo chino de pesos abiertos ganó un concurso de codificación frontend juzgado por desarrolladores reales en enfrentamientos a ciegas. Por dentro es un diseño Mixture-of-Experts de 2.8 billones de parámetros que activa solo 16 de 896 expertos por token, procesa un millón de tokens de contexto y cobra entre $0.30 y $3.00 por millón en la entrada. La trampa que debes conocer antes de emocionarte: todavía no puedes descargar los pesos, y Moonshot dice que eso cambia el 27 de julio.

Veredicto rápido:

  • Qué es: el modelo insignia de Moonshot AI, un MoE de 2.8T parámetros con 1M de contexto, entrada nativa de imagen y vídeo, y razonamiento siempre activo. ID de API kimi-k3.
  • Dónde gana: navegación agéntica (BrowseComp 91.2) y codificación de largo recorrido (SWE Marathon 42.0, por encima de Fable 5 y GPT-5.6 Sol). #1 en la Frontend Code Arena de Arena.
  • Dónde se queda atrás: FrontierSWE y HLE-Full (lidera Fable 5), DeepSWE (lidera GPT-5.6 Sol). Artificial Analysis, de forma independiente, lo sitúa #4 de 189 en general.
  • Qué cuesta: $0.30 caché acertado / $3.00 entrada nueva, $15.00 salida por millón de tokens. El modelo más caro que ha lanzado un laboratorio chino.
  • La trampa: de pesos abiertos de nombre, pero el checkpoint no se publica hasta el 27 de julio de 2026. Hasta entonces, no hay autoalojamiento ni evaluaciones independientes de terceros.

Si quieres la respuesta en una línea: Kimi K3 es el primer modelo de pesos abiertos que de verdad intercambia golpes con la frontera cerrada, pero es software de día de lanzamiento con la publicación de pesos pendiente y un precio premium. Sigue leyendo para conocer las especificaciones, la realidad de los benchmarks (incluida una advertencia que cambia cómo debes leer cada cifra), las cuentas de precios y quién debería usarlo de verdad.

¿Qué es Kimi K3?

Kimi K3 es el modelo de lenguaje más reciente de Moonshot AI, lanzado el 16 de julio de 2026. Es un modelo Mixture-of-Experts con 2.8 billones de parámetros totales que activa solo 16 de sus 896 expertos en cada token, de modo que el coste de cómputo por token se mantiene muy por debajo de lo que exigiría un modelo denso de 2.8T. Acepta texto, imágenes y vídeo, mantiene una ventana de contexto de un millón de tokens y trae el razonamiento activado por defecto.

Aquí tienes la ficha técnica de un vistazo.

EspecificaciónKimi K3
Lanzamiento16 de julio de 2026
DesarrolladorMoonshot AI
Parámetros totales2.8 billones (Mixture-of-Experts)
Activos por token16 de 896 expertos
AtenciónKimi Delta Attention (KDA), hasta 6.3x más rápido en decodificación a 1M de contexto
Ventana de contexto1,000,000 tokens
ModalidadesEntrada de texto, imagen y vídeo
RazonamientoSiempre activo; un único nivel "max" en el lanzamiento
ID del modelo en la APIkimi-k3 (compatible con OpenAI-SDK)
PesosPesos abiertos; publicación pública prometida para el 27 de julio de 2026
Precio por M tokens$0.30 caché acertado o $3.00 entrada nueva, $15.00 salida

La parte de ingeniería más interesante es el diseño de atención. Moonshot lo llama Kimi Delta Attention, o KDA, un mecanismo de atención lineal híbrido que, según la compañía, ofrece hasta 6.3x más velocidad de decodificación en contextos de un millón de tokens. K3 lo combina con una serie de técnicas más nuevas que el laboratorio llama Attention Residuals, Gated MLA y Stable LatentMoE. No hace falta memorizar los nombres. Lo que consiguen en conjunto es un modelo que se mantiene rápido incluso con un contexto enorme, justo la carga de trabajo que rompe las arquitecturas más antiguas.

Si pones K3 junto al modelo que sustituye, el salto es grande. Casi triplica el número de parámetros de Kimi K2 (2.8T frente a aproximadamente 1T), cuadruplica la ventana de contexto de la línea K2.6 y K2.7 (1M frente a 256K) y añade entrada de imagen y vídeo a una familia que antes era solo de texto. Si probaste una Kimi anterior y te quedaste indiferente, esto es otro animal completamente distinto.

Los benchmarks de Kimi K3: dónde gana y dónde no

Los benchmarks de lanzamiento de Kimi K3 son de verdad sólidos, y de verdad mixtos. Lidera el campo en algunas tareas de codificación y de agentes, y claramente se queda atrás de la frontera cerrada en otras. Antes de la tabla, una advertencia que importa más que cualquier puntuación individual: Moonshot ejecutó cada modelo dentro de su propio entorno de codificación. K3 se puntuó en KimiCode, Fable 5 en Claude Code y GPT-5.6 Sol en Codex. El software que envuelve a un modelo afecta a sus resultados, así que interpreta estas cifras como orientativas, no como una clasificación definitiva.

Estas son las cifras destacadas de codificación y agentes de la tabla de lanzamiento de Moonshot.

BenchmarkKimi K3GPT-5.6 SolClaude Fable 5
Program Bench77.877.676.8
SWE Marathon42.039.035.0
Terminal-Bench 2.188.388.884.6
DeepSWE67.573.070.0
FrontierSWE81.271.386.6
BrowseComp91.2no publicadono publicado
OmniDocBench91.1no publicadono publicado

Si recorres las filas, aparece un patrón. K3 gana en el trabajo largo y pesado. En SWE Marathon, que mide sesiones de ingeniería sostenidas de varias horas, el 42.0 de K3 supera a GPT-5.6 Sol y a Fable 5 por un margen claro. Se impone por poco en Program Bench, y también lidera en el terreno de los agentes, con un 91.2 en BrowseComp y un 91.1 en OmniDocBench, donde Moonshot también reporta el primer puesto en Automation Bench.

¿Dónde pierde? En DeepSWE, GPT-5.6 Sol se adelanta con 73.0. En FrontierSWE, Fable 5 saca ventaja clara con 86.6, aunque vale la pena señalar que el 81.2 de K3 sigue superando al 71.3 de Sol ahí. La propia tabla de Moonshot admite que K3 se queda por detrás de Fable 5 en FrontierSWE y HLE-Full, y por detrás de GPT-5.6 Sol en DeepSWE. Este no es un modelo que gane a la frontera en todo. Es un modelo que le gana en algo, algo que ningún lanzamiento de pesos abiertos había logrado realmente antes.

La lectura independiente lo confirma. Artificial Analysis puntúa a K3 con 57 en su Intelligence Index y lo sitúa #4 de 189 modelos, por detrás de Claude Fable 5 y de dos configuraciones de razonamiento de GPT-5.6 Sol, pero por delante de Claude Opus 4.8. Su velocidad de salida medida es de unos modestos 62 tokens por segundo. En el terreno de la preferencia humana, el #1 de K3 en la Frontend Code Arena de Arena es lo más destacado, porque esa clasificación sale de desarrolladores votando sobre resultados reales de frontend, no de una puntuación autoinformada.

El desarrollador independiente Simon Willison sometió a K3 a su test del pelícano en bicicleta en SVG el mismo día del lanzamiento. El modelo dio un resultado sólido y escribió un texto alternativo preciso para su propia imagen, algo que habla bien de su visión. También señaló la sorpresa de precio de la que hablaremos en la sección de precios, y recordó a sus lectores que un test rápido de SVG no dice nada sobre las llamadas a herramientas agénticas, que es donde un modelo como este se gana el sueldo. Una precaución justa.

Kimi K3 frente a Fable 5, GPT-5.6 Sol, DeepSeek y Qwen

Entonces, ¿dónde queda K3 en el panorama más amplio? Importan dos comparaciones: frente a la frontera cerrada, y frente a sus compañeros modelos chinos de pesos abiertos.

Frente a la frontera, el planteamiento honesto es «cercano a la frontera, no por encima de ella». Claude Fable 5 y GPT-5.6 Sol siguen liderando las clasificaciones de inteligencia agregada, y Fable 5 mantiene una ventaja real en las evaluaciones de razonamiento más duras y de codificación de frontera. Lo que cambió con K3 es que la brecha se redujo a intercambios en benchmarks individuales en lugar de un abismo de categoría. Que un modelo descargable lidere SWE Marathon y encabece una votación a ciegas de codificación frontend es territorio nuevo.

Frente a sus compañeros de pesos abiertos, K3 es la nueva referencia en capacidad bruta, pero no es la opción por defecto obvia para cualquier tarea. Si estás valorando las opciones chinas de pesos abiertos como grupo, nuestra comparativa de Qwen vs DeepSeek vs GLM explica cómo esas tres familias se reparten el mercado: Qwen para el autoalojamiento más ligero y la licencia más permisiva, DeepSeek para los tokens más baratos, GLM para codificación práctica. K3 ahora se sitúa por encima de todos ellos en los benchmarks máximos, y también por encima en precio. Es la opción premium en una categoría que construyó su reputación siendo barata.

Para un panorama más amplio que incluya los modelos que de verdad superan la calidad de la clase GPT-4, nuestro ranking de los mejores LLM de código abierto para 2026 pone en contexto las afirmaciones de K3. La versión corta: K3 eleva el techo de los pesos abiertos, pero «pesos abiertos» y «barato» han dejado oficialmente de ser lo mismo.

Precios de Kimi K3 y las cuentas del caché acertado

Aquí es donde K3 se vuelve polémico. Moonshot lo cobra a $0.30 por millón de tokens de entrada con caché acertado, $3.00 por millón de tokens de entrada nueva y $15.00 por millón de tokens de salida, de forma plana en toda la ventana de contexto de un millón de tokens.

Compáralo con el modelo al que sustituye y el cambio es brutal.

Tipo de tokenKimi K3Kimi K2.6
Entrada, nueva$3.00 / M$0.95 / M
Entrada, caché acertado$0.30 / Mno revelado
Salida$15.00 / M$4.00 / M

Eso es aproximadamente un salto de 3x en la entrada y de casi 4x en la salida frente a K2.6. Willison señaló que la tarifa de $3/$15 queda en el mismo nivel que Claude Sonnet. The Decoder calificó a K3 como una señal de que la era de la IA china súper barata está terminando. Si tu único motivo para usar un modelo chino era el precio, K3 te hará pensarlo dos veces.

Pero la tarifa de caché acertado es la cifra que decide tu factura real, así que hagamos las cuentas de un bucle agéntico realista, usando las tarifas publicadas por Moonshot. Supongamos que tu agente de codificación lee un contexto de código de 200,000 tokens y escribe 8,000 tokens de salida, y lo hace 20 veces al día:

  • Fallo de caché (primera lectura en frío): 200,000 tokens de entrada a $3.00/M son $0.60, más 8,000 tokens de salida a $15.00/M son $0.12. Eso es aproximadamente $0.72 por llamada, o $14.40 al día.
  • Acierto de caché (contexto repetido, el caso habitual en una sesión de codificación): 200,000 tokens de entrada a $0.30/M son $0.06, más los mismos $0.12 de salida. Eso es aproximadamente $0.18 por llamada, o $3.60 al día.

La economía del caché reduce la factura de entrada unas diez veces, de $0.60 a $0.06 por llamada. Moonshot reporta más del 90% de aciertos de caché en cargas de trabajo de codificación, que es el escenario que hace que K3 sea asequible en lugar de desorbitado. La lección para tu presupuesto: K3 es caro en llamadas frías y de un solo uso, y razonable dentro de un bucle cálido y con mucho contexto.

Willison sacó a la luz otra trampa de coste. K3 solo expone un único nivel de razonamiento «max» por ahora, y los tokens de razonamiento se cobran a la tarifa de salida. Su sencillo test de SVG consumió 13,241 tokens de razonamiento además de 3,417 tokens de salida, así que un prompt trivial costó unos 25 centavos. Todavía no hay un modo barato de «razonamiento bajo», lo que significa que K3 paga de más en preguntas fáciles. Si el control de costes es tu prioridad, nuestras guías sobre precios de las API de LLM y cómo reducir los costes de las API de LLM se aplican directamente aquí: usa el caché de forma agresiva, dirige las llamadas triviales a un modelo más barato y reserva K3 para el trabajo difícil y de contexto largo donde se gana la prima de precio.

Pesos abiertos: qué significa «abierto» de verdad aquí

Esta es la parte que los titulares de lanzamiento pasaron por alto. Kimi K3 se anuncia como un modelo de pesos abiertos, y Moonshot tiene un historial real de publicar checkpoints descargables. Pero a fecha del 17 de julio de 2026, los pesos de K3 no son públicos. La organización de Moonshot en Hugging Face todavía solo lista checkpoints de la serie K2. La compañía dice que los pesos completos llegan el 27 de julio de 2026.

¿Por qué importa ese vacío? Tres razones prácticas:

  • Todavía no hay autoalojamiento. No puedes ejecutar K3 en tu propio hardware ni en un clúster privado hasta que salgan los pesos. Para equipos con requisitos de residencia de datos o air-gap, K3 es solo-API por ahora, lo que anula buena parte del motivo por el que elegirías un modelo abierto. Cuando los pesos lleguen, nuestras guías sobre las mejores herramientas para ejecutar LLMs en local y cómo ejecutar un LLM en local te ayudarán a empezar, aunque un modelo de 2.8T parámetros es de clase clúster, no de clase portátil.
  • Todavía no hay evaluaciones independientes. Todos los benchmarks de K3 que has visto los ha ejecutado el propio proveedor, en el entorno de Moonshot. Las cifras serias de terceros sobre cosas como HLE o tareas específicas de agentes no pueden existir hasta que laboratorios externos tengan los pesos para probarlos. Trata la tabla de lanzamiento como una afirmación contundente, no como un resultado verificado.
  • Los términos de licencia todavía se están definiendo. Los lanzamientos anteriores de Kimi usaron licencias permisivas, pero confirma la licencia exacta de K3 contra la ficha oficial del modelo cuando se publique el checkpoint, sobre todo si planeas un despliegue comercial.

Nada de esto hace que K3 sea menos impresionante. Sí significa que, si tu plan depende de descargar y hacer fine-tuning del modelo, tu evaluación real empieza el 27 de julio, no el 16.

Cómo estamos evaluando Kimi K3 para el trabajo con clientes

Una nota rápida sobre de dónde viene esta reseña, y dónde termina. En Techsy, conectamos LLMs de terceros a pipelines de producción para clientes B2B, normalmente a través de endpoints compatibles con OpenAI-SDK para poder cambiar de modelo sin reconstruir toda la fontanería. K3 encaja perfectamente en ese camino: expone una API compatible con OpenAI con el ID de modelo kimi-k3, así que incorporarlo a una integración existente para probarlo es un cambio de configuración, no una reescritura.

Cada vez que llega un modelo nuevo, lo pasamos por la misma evaluación fija con tareas representativas de nuestros clientes antes de recomendar nada. Y aquí está el límite honesto de esta reseña: todavía no publicamos nuestra propia puntuación de K3. Los pesos no están disponibles, los benchmarks de lanzamiento los ejecutó el propio proveedor en su entorno, y una cifra justa necesita una configuración neutral con tareas que se parezcan al trabajo real de un cliente, no a una clasificación. Citar un benchmark de primera parte de un modelo con un día de vida y los pesos pendientes sería exactamente el tipo de cifra que le decimos a nuestros clientes que desconfíen.

Lo que sí podemos evaluar hoy desde la API en vivo es la parte que no necesita una clasificación: la superficie de integración, el modelo de coste y los modos de fallo. Las cuentas de precios de arriba son un cálculo propio a partir de las tarifas publicadas por Moonshot, no un benchmark, y ya te dicen la verdad operativa: la disciplina de caché es la diferencia entre que K3 sea asequible o un problema de presupuesto. Si quieres ayuda para averiguar si un modelo como K3 tiene sitio en tu stack, ese es el tipo de evaluación que hacemos en la práctica de integración de IA de Techsy, y puedes reservar una consultoría gratuita para hablarlo.

Quién debería usar Kimi K3 (y quién no)

Kimi K3 encaja muy bien para un conjunto concreto de tareas y encaja mal para otras. Compáralo con tu carga de trabajo real.

Elige K3 si:

  • Haces navegación o investigación agéntica. Sus liderazgos en BrowseComp y Automation Bench, más la mejor lectura independiente en investigación con agentes, lo convierten en la opción de pesos abiertos más capaz para agentes que usan herramientas ahora mismo.
  • Haces codificación de largo recorrido. SWE Marathon es el benchmark que refleja sesiones de ingeniería de varias horas, y K3 lo lidera. Si tus agentes trabajan sobre bases de código grandes durante sesiones largas, este es su terreno natural.
  • Quieres un modelo de pesos abiertos cercano a la frontera y puedes esperar a los pesos. Si el objetivo es autoalojar un modelo abierto de primer nivel el 27 de julio, K3 es el candidato más capaz disponible.

Espera si:

  • Necesitas los pesos hoy. Hasta el 27 de julio, K3 es solo-API. Un modelo ya descargable te sirve mejor esta semana.
  • Manejas tráfico de alto volumen y sensible al coste. Con un único nivel de razonamiento caro y un precio de salida premium, K3 paga de más en llamadas sencillas. Kimi K2.7-Code o un modelo abierto más barato gana en trabajo masivo.
  • Necesitas evaluaciones independientes probadas antes de adoptarlo. Las cifras de lanzamiento las ejecutó el proveedor. Si tu proceso exige verificación de terceros, dale unas semanas.

Preguntas Frecuentes

¿Qué es Kimi K3?

Kimi K3 es el modelo de lenguaje insignia de Moonshot AI, lanzado el 16 de julio de 2026. Es un modelo Mixture-of-Experts de 2.8 billones de parámetros que activa 16 de 896 expertos por token, admite una ventana de contexto de 1M de tokens y acepta entrada de texto, imagen y vídeo con el razonamiento siempre activo.

¿Es Kimi K3 de código abierto?

Kimi K3 se anuncia como un modelo de pesos abiertos, pero los pesos no son públicos a fecha del 17 de julio de 2026. Moonshot dice que el checkpoint completo se publicará el 27 de julio de 2026. Hasta entonces solo está disponible a través de las apps de Kimi y la API, así que todavía no puedes autoalojarlo.

¿En qué se diferencia Kimi K3 de Kimi K2?

K3 casi triplica el número de parámetros de K2 (2.8 billones frente a aproximadamente 1 billón), cuadruplica la ventana de contexto de la línea K2.6 y K2.7 (1M frente a 256K tokens) y añade entrada nativa de imagen y vídeo a una familia que antes se centraba solo en texto. También introduce el nuevo diseño Kimi Delta Attention.

¿Cuánto cuesta Kimi K3?

Moonshot cobra K3 a $0.30 por millón de tokens de entrada con caché acertado, $3.00 por millón de tokens de entrada nueva y $15.00 por millón de tokens de salida. Eso es aproximadamente el triple del precio de entrada de K2.6 y casi el cuádruple de su precio de salida, lo que convierte a K3 en el modelo más caro que ha publicado un laboratorio chino.

¿Cuál es la ventana de contexto de Kimi K3?

Kimi K3 admite una ventana de contexto de un millón de tokens, y el precio se mantiene plano en toda esa ventana. El modelo usa un nuevo diseño de atención llamado Kimi Delta Attention, que según Moonshot ofrece hasta 6.3x más velocidad de decodificación en longitudes de contexto de un millón de tokens.

¿Puedo ejecutar Kimi K3 en local?

Todavía no. Los pesos no son públicos hasta el 27 de julio de 2026. Después de eso, el autoalojamiento es técnicamente posible, pero un modelo de 2.8 billones de parámetros necesita hardware de clase clúster en lugar de una única estación de trabajo, así que la mayoría de equipos seguirán accediendo a través de la API.

¿Es Kimi K3 realmente mejor que Fable 5?

Depende de la tarea. K3 supera a Claude Fable 5 en SWE Marathon, Program Bench y en la votación a ciegas de codificación frontend de Arena. Fable 5 sigue liderando en FrontierSWE, HLE-Full y en las clasificaciones generales de inteligencia agregada. Además, todos los benchmarks de lanzamiento se ejecutaron en el entorno propio de cada proveedor, así que trata las victorias en benchmarks individuales como orientativas.

¿Es Kimi K3 bueno para codificar?

Sí, especialmente para sesiones de codificación largas y sostenidas y para trabajo de frontend, donde actualmente lidera. También es fuerte en tareas agénticas y de terminal. El principal inconveniente es el coste: con un único nivel de razonamiento caro, paga de más en llamadas triviales, así que combínalo con modelos más baratos para trabajo rutinario de alto volumen.

¿Cómo accedo a Kimi K3?

Puedes usar Kimi K3 a través de la app web de Kimi, Kimi Work y Kimi Code, o mediante la API con el ID de modelo kimi-k3. La API es compatible con OpenAI-SDK, así que añadirlo a una integración existente al estilo OpenAI es sobre todo un cambio de configuración.

Sobre el Autor

Mert Batur, Co-Founder, Techsy.io. Conecta en LinkedIn.

Mert Batur es Cofundador de Techsy.io, donde el equipo lanza agentes de IA, sistemas de automatización y pipelines de voz/SDR para clientes B2B. Escribe sobre el stack de herramientas LLM que el equipo de Techsy usa de verdad en producción.

Puntos Clave

  • Le hace frente de verdad a la frontera cerrada. Kimi K3 es el primer modelo de pesos abiertos que lidera SWE Marathon y encabeza la votación a ciegas de codificación frontend de Arena, por delante de Claude Fable 5.
  • Cercano a la frontera, no por encima de ella. Artificial Analysis, de forma independiente, lo sitúa #4 de 189, y se queda por detrás de Fable 5 en las pruebas de razonamiento y codificación de frontera más duras.
  • Abierto de nombre, pendiente en la práctica. Los pesos no se publican hasta el 27 de julio de 2026, así que no hay autoalojamiento ni evaluación independiente hasta entonces.
  • El precio acabó con la era de la IA china barata. A $3/$15 por millón de tokens, la disciplina de caché es lo que mantiene a K3 asequible; presupuesta para un bucle cálido y con mucho contexto, no para llamadas frías de un solo uso.
  • Lo mejor para investigación agéntica y codificación de largo recorrido. Si necesitas los pesos hoy o manejas tráfico de alto volumen sensible al coste, espera o elige un modelo más barato. Habla con nosotros si quieres ayuda para decidir.

Etiquetas

reseña kimi k3kimi k3benchmarks kimi k3precios kimi k3moonshot aillm de pesos abiertos

Compartir este artículo

Inicia Tu Proyecto

¿Listo para construir algo extraordinario?

Convirtamos tu visión en realidad. Nuestro equipo está listo para ayudarte a crear software que marque la diferencia.