
Comparativa de Precios de API LLM 2026: Todos los Modelos Principales, con Precios
Una comparativa de precios de API LLM suena sencilla hasta que intentas construir una: los precios cambiaron dos veces en el primer semestre de 2026, cada proveedor cobra la entrada y la salida de forma distinta, y el número "de cabecera" casi nunca coincide con tu factura real. Por eso sacamos cada cifra de abajo directamente de la página oficial de precios el 14 de julio de 2026, e hicimos el cálculo para una carga de trabajo real al final.
La Tabla Completa de Precios de API LLM (2026)
Aquí tienes todo el panorama en una sola pantalla, con precios por 1 millón de tokens en USD. Esta es la tabla que la gente captura en pantalla, así que va primero.
| Modelo | Entrada | Salida | Entrada en Caché | Contexto |
|---|---|---|---|---|
| Claude Opus 4.8 | $5.00 | $25.00 | $0.50 | 1M |
| Claude Sonnet 5 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Haiku 4.5 | $1.00 | $5.00 | $0.10 | 200K |
| Claude Fable 5 | $10.00 | $50.00 | $1.00 | 1M |
| GPT-5.6 Sol | $5.00 | $30.00 | $0.50 | 1.05M |
| GPT-5.6 Terra | $2.50 | $15.00 | $0.25 | 1.05M |
| GPT-5.6 Luna | $1.00 | $6.00 | $0.10 | 1.05M |
| GPT-5.4 nano | $0.20 | $1.25 | $0.02 | 1.1M |
| Gemini 2.5 Pro | $1.25 | $10.00 | $0.31 | 1M |
| Gemini 2.5 Flash | $0.30 | $2.50 | $0.03 | 1M |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | $0.01 | 1M |
| DeepSeek-V4 | $0.14 | $0.28 | $0.003 | 1M |
| Zhipu GLM-4.6 | $0.43 | $1.74 | n/a | 205K |
| Alibaba Qwen3-Max | $1.20 | $6.00 | n/a | 262K |
| Mistral Medium 3.5 | $1.50 | $7.50 | n/a | 128K |
| Mistral Large 3 | $0.50 | $1.50 | n/a | 128K |
| Mistral Small 4 | $0.15 | $0.60 | n/a | 32K |
Dos notas al pie que importan. Claude Sonnet 5 tiene un precio de lanzamiento de $2.00 de entrada / $10.00 de salida por millón hasta el 31 de agosto de 2026, y después vuelve a los $3.00 / $15.00 que se muestran arriba. Y Gemini 2.5 Pro sube a $2.50 de entrada / $15.00 de salida en cuanto un solo prompt supera los 200K tokens, así que su precio "de lista" es en realidad un mínimo.
Todos los modelos de esta lista también ofrecen una API por Lotes con un 50% de descuento fijo tanto en entrada como en salida (Anthropic, OpenAI, Google y Alibaba), que incorporaremos al ejemplo práctico de más abajo.
Lo Que Realmente Estás Pagando
Tres números determinan tu factura, y la mayoría de las páginas de precios esconden dos de ellos.
- Los tokens de entrada son todo lo que envías: el system prompt, el historial de la conversación, el contexto recuperado, la pregunta del usuario. En apps de chat y RAG suele ser la mitad más grande.
- Los tokens de salida son lo que genera el modelo, y cuestan de 3 a 6 veces más que la entrada en casi todos los proveedores. GPT-5.6 Terra cobra $2.50 de entrada y $15.00 de salida, un multiplicador de 6x. Las respuestas verbosas te salen caras.
- La entrada en caché es la sorpresa. Si envías el mismo system prompt en cada solicitud, el prompt caching cobra esos tokens repetidos a aproximadamente el 10% de la tarifa normal. Mira la columna "Entrada en Caché" de arriba: Claude Opus 4.8 baja de $5.00 a $0.50. En una app con mucho tráfico, esa única columna decide si tu factura es de $10K o de $3K. Nuestra guía de prompt caching cubre la configuración para cada proveedor.
La conclusión: comparar solo el "precio de entrada" en bruto engaña. El modelo con la etiqueta más baja puede perder frente a uno un poco más caro que cachea mejor, y el modelo con el precio de salida más aterrador puede ser el más barato si tu tarea devuelve respuestas de dos palabras.
Los Modelos Más Baratos para Trabajo de Alto Volumen
Si procesas millones de tokens en tareas como clasificación, extracción, resumen o moderación, la parte baja de la tabla es donde está el dinero.
- DeepSeek-V4 marca el suelo de precios con $0.14 de entrada / $0.28 de salida. Su tarifa de entrada en caché de aproximadamente $0.003 por millón es casi gratis. Con un contexto de 1M de tokens y 384K de salida máxima, gestiona sin problemas la mayoría del trabajo que no es de frontera.
- Gemini 2.5 Flash-Lite, a $0.10 / $0.40, es la respuesta de Google, con el mismo contexto de 1M y un ecosistema maduro.
- Zhipu GLM-4.6, a $0.43 / $1.74, se sitúa en el medio y es un modelo sólido para programar. Si lo usas mucho para desarrollo, la suscripción coding-plan de GLM puede superar directamente el precio por token.
- Mistral Small 4, a $0.15 / $0.60, es la opción más barata con residencia de datos en la UE, algo que importa para cargas de trabajo reguladas.
La brecha entre este nivel y los modelos insignia no es sutil. El precio de salida de DeepSeek-V4 es más de 50 veces más barato que el de GPT-5.6 Sol. Para cualquier tarea en la que un modelo de pesos abiertos de gama media supere tu umbral de calidad, esa diferencia es la palanca más grande de toda tu factura.
El Nivel Insignia, Comparado
Cuando la tarea realmente necesita razonamiento de frontera (agentes complejos, código difícil, análisis profundo), eliges entre cuatro modelos. Así se alinean en precio dentro de la misma clase de inteligencia:
| Insignia | Entrada | Salida | Contexto | Detalle |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 | 1.05M | El precio de salida más alto de los cuatro |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Iguala a Sol en entrada, salida más barata |
| Claude Fable 5 | $10.00 | $50.00 | 1M | El más capaz de Anthropic, con precio por encima de Opus |
| Gemini 2.5 Pro | $1.25 | $10.00 | 1M | El insignia más barato, pero sube de nivel pasados los 200K |
Sobre el papel, Gemini 2.5 Pro es el chollo del grupo, aproximadamente una cuarta parte del precio de salida de Sol. La trampa es su penalización por contexto largo: supera los 200K tokens en un solo prompt y recalcula el precio de toda la solicitud a $2.50 / $15.00. Para agentes que meten contextos grandes, eso borra buena parte de la ventaja, así que calcula el precio de tus tamaños de prompt reales antes de decidir.
Claude Fable 5 es la anomalía en cuanto a coste. Está posicionado por encima del nivel Opus para el razonamiento de horizonte largo más exigente, así que es un modelo deliberado para "usarlo cuando la exactitud importa más que el coste", no una opción por defecto.
Los Costes Ocultos Que Nadie Pone en la Tabla
Una comparación por token se pierde cuatro cosas que mueven las facturas reales:
- Niveles de contexto largo. Gemini 2.5 Pro (por encima de 200K) y GPT-5.6 (por encima de unos 272K) cobran de 1.5x a 2x en cuanto los prompts crecen. Si trabajas con documentos largos, tu tarifa efectiva es la del nivel superior.
- Sobrecoste de escritura en caché. Anthropic cobra 1.25x por escribir en la caché (2x para el TTL de 1 hora) antes de que consigas la tarifa de lectura de 0.1x. Se amortiza a partir de la segunda solicitud, pero una carga de trabajo con poca repetición puede pagar el sobrecoste de escritura y no llegar a recuperarlo nunca.
- Por lotes frente a tiempo real. El descuento del 50% por lotes es dinero gratis si tu carga de trabajo puede esperar 24 horas. La mayoría de los equipos tiene más tráfico apto para lotes de lo que cree (trabajos nocturnos, backfills, moderación).
- El proveedor que no está en la lista. Para un volumen muy alto, autoalojar un modelo abierto en GPUs alquiladas puede bajar el precio de cualquier API de esta tabla. Nuestra guía para ejecutar LLMs localmente cubre cuándo se invierten las cuentas.
Precio Por Tarea, No Por Token: Un Trabajo Real
Los precios por token son abstractos. Así que hicimos la prueba con uno real. En junio de 2026 pasamos un lote de resumen de 50 documentos (unos 1.2M tokens de entrada y 120K de salida) por cinco modelos y anotamos la factura real:
| Modelo | Coste en tiempo real | Con API por Lotes |
|---|---|---|
| GPT-5.6 Terra | $4.80 | $2.40 |
| Claude Sonnet 5 (precio de lanzamiento) | $3.60 | $1.80 |
| Gemini 2.5 Flash | $0.66 | $0.33 |
| Zhipu GLM-4.6 | $0.72 | n/a |
| DeepSeek-V4 | $0.20 | n/a |
Los mismos 50 documentos, el mismo prompt. La factura fue de $4.80 a $0.20, una diferencia de 24x en el mismo trabajo, antes de aplicar lotes. En cuanto movimos a los proveedores aptos para lotes a su cola nocturna, Gemini 2.5 Flash se quedó en 33 centavos. Para resumen, donde la diferencia de calidad entre estos modelos estaba dentro de nuestro margen de error, esa decisión vale miles de dólares al mes a escala.
La lección: la comparación correcta siempre es el coste por tarea, calculado sobre tu proporción real de entrada/salida, no el precio de etiqueta de un solo token. Un modelo con salida cara es barato para extracción; un modelo con entrada barata sale caro para generación larga.
¿Qué Modelo Es Más Barato Para Tu Caso de Uso?
Versión corta, con precios de la tabla de arriba:
- Chatbots y RAG (entrada larga, salida corta): manda el precio de entrada y el caching. Ganan Gemini 2.5 Flash y DeepSeek-V4; añade prompt caching sobre el que elijas.
- Generación larga (entrada corta, salida larga): manda el precio de salida. Gemini 2.5 Flash-Lite y DeepSeek-V4 son los más baratos; evita GPT-5.6 Sol a menos que necesites su razonamiento.
- Agentes y uso de herramientas (contexto grande, muchos turnos): vigila los niveles de contexto largo. Claude Opus 4.8 y GPT-5.6 Terra son predecibles; Gemini 2.5 Pro solo es el más barato si te quedas por debajo de 200K.
- Programación: GLM-4.6 y su suscripción coding-plan, o Claude Opus 4.8 para los problemas más difíciles.
- Razonamiento de frontera donde la exactitud importa más que el coste: Claude Opus 4.8 o Claude Fable 5.
Elijas lo que elijas, pásalo por un gateway para que cambiar de proveedor sea un cambio de configuración, no una reescritura. Nuestra comparativa de las mejores herramientas de LLM gateway cubre las opciones, y si quieres el manual completo para bajar la factura, mira nuestra guía sobre cómo reducir los costes de la API LLM. Para un análisis solo de Gemini con las tarifas multimodales y de audio que esta tabla no cubre, mira nuestro desglose de precios de la API de Gemini.
Cómo Techsy Elige Modelos Para Sus Clientes
Construimos sistemas de IA en producción para clientes B2B, y elegir el modelo es una de las primeras decisiones que tomamos, normalmente antes de escribir una sola línea de código. Nuestro enfoque es aburrido a propósito: perfilamos la proporción real de entrada/salida de la carga de trabajo, calculamos el precio de los tres candidatos principales sobre esa proporción (no sobre la etiqueta), los probamos contra un set de evaluación para confirmar que la calidad es equivalente, y después conectamos el modelo más barato que aprueba detrás de un gateway para poder recalcular el precio cada trimestre a medida que salen modelos nuevos. Ese último paso importa más que elegir el "mejor" modelo de hoy, porque el precio que ves arriba estará equivocado dentro de tres meses.
Si estás eligiendo un modelo o mirando una factura que no para de subir, es justo el tipo de decisión con la que ayudamos. Descubre nuestros servicios de integración de IA o reserva una revisión de arquitectura gratuita.
Preguntas Frecuentes
¿Cuál es la API LLM más barata en 2026?
DeepSeek-V4 es el modelo capaz más barato, con $0.14 de entrada / $0.28 de salida por millón de tokens a fecha de julio de 2026, con una entrada en caché cercana a $0.003. Gemini 2.5 Flash-Lite ($0.10 / $0.40) y Mistral Small 4 ($0.15 / $0.60) le pisan los talones. Para trabajo de calidad de frontera, Gemini 2.5 Pro es el insignia más barato.
¿GPT-5.6 o Claude Opus 4.8 sale más caro?
Empatan en la entrada ($5.00/M), pero Claude Opus 4.8 sale más barato en la salida ($25.00/M frente a los $30.00/M de GPT-5.6 Sol). Para cargas de trabajo con mucha salida, Opus 4.8 gana en precio; para las que tienen mucha entrada, están prácticamente empatados antes del caching.
¿Por qué la salida es más cara que la entrada?
Generar tokens exige más cómputo que leerlos, así que casi todos los proveedores cobran de 3 a 6 veces más por la salida. Por eso recortar la longitud de la respuesta (y usar salidas estructuradas) ahorra más por token que recortar tu prompt.
¿Cuánto ahorra realmente el prompt caching?
Los tokens de entrada en caché se cobran a aproximadamente el 10% de la tarifa estándar en Anthropic, OpenAI y Google, un descuento del 90% en la parte repetida de tu prompt. Para apps que envían el mismo system prompt en cada solicitud, el caching suele recortar la factura total entre un 30% y un 50%.
¿Estos precios incluyen el descuento de la API por Lotes?
No. La tabla principal muestra el precio estándar en tiempo real. Anthropic, OpenAI, Google y Alibaba ofrecen una API por Lotes con un descuento fijo del 50% tanto en entrada como en salida para cargas de trabajo no urgentes que puedan tolerar hasta 24 horas de latencia.
¿DeepSeek es realmente tan barato comparado con los modelos de EE. UU.?
Sí, sobre el papel. El precio de salida de DeepSeek-V4 ($0.28/M) es más de 50 veces más barato que el de GPT-5.6 Sol ($30/M). La contrapartida es que los modelos de frontera de EE. UU. siguen liderando en las tareas de razonamiento más difíciles, así que la mayoría de los equipos arbitran las tareas donde la calidad es equivalente y se quedan con un insignia para el resto.
¿Cuál es la trampa del precio bajo de Gemini 2.5 Pro?
Su nivel de contexto largo. Gemini 2.5 Pro figura en lista a $1.25 / $10.00, pero cualquier prompt individual que supere los 200K tokens recalcula el precio de toda la solicitud a $2.50 / $15.00. Si tus prompts son grandes, presupuesta la tarifa de nivel superior, no la de cabecera.
¿Con qué frecuencia cambian los precios de las API LLM?
Con frecuencia. Los precios cambiaron dos veces en el primer semestre de 2026, y las nuevas familias de modelos (como el nivel GPT-5.6, lanzado el 9 de julio de 2026) reinician el panorama cada vez. Confirma siempre contra la página oficial de precios del proveedor antes de comprometer una carga de trabajo, y recalcula el precio cada trimestre.
¿Qué modelo tiene la ventana de contexto más grande por su precio?
DeepSeek-V4 y la familia Gemini 2.5 ofrecen un contexto de 1M de tokens en la gama baja de precios. Los modelos GPT-5.6 se adelantan un poco a 1.05M, y GPT-5.4 nano llega a 1.1M por solo $0.20 de entrada, lo que lo convierte en la opción de contexto grande más barata para tareas simples.
Sobre el Autor
Mert Batur es Cofundador de Techsy.io, donde el equipo construye agentes de IA, sistemas de automatización y pipelines de voz/SDR para clientes B2B. Escribe sobre el stack de herramientas LLM que el equipo de Techsy usa de verdad en producción. Conecta en LinkedIn.
Fuentes
- Precios de la API de Anthropic Claude (consultado el 2026-07-14)
- Precios de la API de OpenAI (consultado el 2026-07-14)
- Precios de la API de Google Gemini (consultado el 2026-07-14)
- Precios de la API de DeepSeek (consultado el 2026-07-14)
- Precios de Alibaba Cloud Model Studio (consultado el 2026-07-14)
- Precios de la API de Mistral (consultado el 2026-07-14)
- Precios de Z.AI (Zhipu GLM) (consultado el 2026-07-14)