Calculadora de coste de API OpenAI, Claude y Gemini
Compara el coste mensual de cada proveedor con el ahorro del caching y del batch.
El coste de las APIs de GPT, Claude y Gemini va de 0,15 $ a 75 $ por millón de tokens de entrada, y los tokens de salida suelen ser de 3 a 5 veces más caros. Con 10 millones de tokens al mes, GPT-4o ronda los 775 $, Claude Sonnet 4 los 1.140 $ y Gemini 2.5 Pro los 825 $. El prompt caching abarata los tokens cacheados hasta 10 veces; la Batch API recorta un 50 % el trabajo que no es en tiempo real. Esta calculadora modela tu uso exacto en los tres proveedores.
Tus parámetros
05 fieldsQuién debería usar esta herramienta
Fundadores que dimensionan un proyecto de openai api antes de hablar con proveedores. CTOs y responsables de ingeniería que preparan el presupuesto anual de nuevo producto. Product managers que convierten una idea de una línea en un rango defendible ante finanzas. Equipos de compras que contrastan los presupuestos de agencias y contratistas.
Cómo lo calculamos
Precios basados en las tarifas que OpenAI, Anthropic y Google tienen publicadas a fecha de 2026. El prompt caching se aplica solo a los tokens de entrada cacheados (normalmente el system prompt más el contexto estable). La Batch API se aplica tanto a los tokens de entrada como a los de salida en trabajos que no son en tiempo real, con un SLA de 24 horas.
Fuentes de datos
Factores que mueven el número
Selección de nivel de modelo
Los modelos de frontera como GPT-4.5, Claude Opus 4 y Gemini 2.5 Pro son de 5 a 10 veces más caros por token que sus hermanos de gama media. Reserva la gama alta solo para tareas de razonamiento difícil en las que la gama media se queda corta de verdad: lógica compleja de varios pasos, matemáticas, generación de código ambigua o tareas que exigen un conocimiento profundo del mundo. Enruta todo lo demás a Claude Sonnet 4, GPT-4o o Gemini Flash. La diferencia de coste es tan grande que un enrutamiento inteligente suele recortar el gasto entre un 60 % y un 80 % en cargas mixtas.
Prompt caching
Anthropic cachea los tokens de entrada durante 5 minutos gratis, o 1 hora con un recargo del 25 %, lo que abarata los tokens cacheados en torno a un 90 %. OpenAI los cachea de forma automática durante 5 a 10 minutos en ciertos endpoints, sin necesidad de configurar nada. El caching rinde mejor cuando tu system prompt supera los 2.000 tokens y se mantiene estable entre peticiones, que es justo el caso de la mayoría de los chatbots y sistemas RAG en producción. El ahorro es mayor en cargas con un contexto largo y estable y muchas peticiones por minuto.
Batch API
Tanto OpenAI como Anthropic ofrecen endpoints de batch con exactamente un 50 % de descuento sobre el precio estándar, a cambio de un SLA de 24 horas. El batch es ideal para clasificación, generación de embeddings, resumen, tandas de evaluación y cualquier procesamiento en segundo plano. La integración es trivial: mismo modelo, mismo prompt, otro endpoint y una cola en la que esperar los resultados. La mayoría de los equipos pasa por alto el batch y paga el precio completo por cargas que no necesitan respuesta en tiempo real, uno de los costes de IA más fáciles de evitar.
Tokens de salida
Los tokens de salida cuestan de 3 a 5 veces más que los de entrada en todos los proveedores, y la mayoría de las respuestas no necesitan los 4.000 tokens de salida que la API reserva por defecto. Si estás extrayendo una respuesta de sí o no, limita la salida a 10 tokens. Si estás generando un resumen corto, limítala a 200. El modelo suele querer explicar su razonamiento aunque no se lo pidas, y pagas por esas explicaciones. Ajustar max_tokens suele recortar el coste de salida entre un 30 % y un 50 % sin afectar a la calidad.
La ventana de contexto no equivale al precio
Todos los grandes proveedores cobran por token consumido, no por el tamaño de la ventana de contexto. Usar una ventana de 200K para un prompt de 5.000 tokens cuesta exactamente lo mismo que usar una de 5K para ese mismo prompt de 5.000 tokens. La conclusión es que los modelos de contexto largo no son "más caros de usar", salvo que de verdad llenes ese contexto. Elige el modelo por su capacidad y su precio por token, no por cuál tiene la ventana de contexto más grande.
Cómo reducir el coste
Activa el prompt caching como primera optimización, antes que ninguna otra. En Anthropic, marca tu system prompt estable con las cabeceras cache_control y los tokens cacheados bajan a en torno al 10 % del precio de entrada estándar. En OpenAI, el caching se activa solo en ciertos endpoints cuando el prefijo de tu prompt es idéntico entre peticiones. La ganancia es mayor en cargas con un contexto largo y estable y muchas peticiones: chatbots con personalidades detalladas, sistemas RAG con contexto de recuperación repetido y cualquier bucle de agente que reenvía un bloque largo de instrucciones. La mayoría de los equipos se olvida de activarlo y paga de 5 a 10 veces de más.
Pasa a la Batch API toda carga que no sea en tiempo real. Tanto Anthropic como OpenAI ofrecen endpoints de batch al 50 % exacto del precio estándar a cambio de un SLA de respuesta de 24 horas. La clasificación, la moderación de contenido, la generación de embeddings, las cadenas de resumen y las tandas de evaluación son todos buenos candidatos. La integración es trivial, porque el prompt y el modelo no cambian. Es habitual que los equipos ejecuten toda su cadena de etiquetado de contenido a precio estándar, cuando el batch les reduciría la factura a la mitad sin ninguna diferencia de calidad.
Enruta las peticiones según su dificultad. Las consultas sencillas (saludos, formateo, búsquedas básicas) van en GPT-4o mini, Claude Haiku o Gemini Flash, a entre 0,15 $ y 0,80 $ por millón de tokens de entrada. El razonamiento difícil va en Claude Opus, GPT-4.5 o Gemini Pro, a entre 1,25 $ y 75 $ por millón. Un clasificador pequeño por delante de tu enrutador de modelos suele recortar el coste entre un 60 % y un 80 % en cargas mixtas. Mandarlo todo a un modelo de frontera es el error de coste de IA más común que vemos en producción.
Limita max_tokens sin contemplaciones. Los tokens de salida cuestan de 3 a 5 veces más que los de entrada, y los 4.000 tokens de salida por defecto son muchos más de los que necesita la mayoría de las respuestas. Limita las respuestas de sí o no a 10 tokens, los resúmenes cortos a 200 y el JSON estructurado a lo que pida tu esquema más un pequeño margen. A veces el modelo quiere extenderse aunque no se lo pidas, y pagas por esas digresiones. Ajustar max_tokens recorta el coste de salida entre un 30 % y un 50 % en la mayoría de los casos.
Recorta el contexto recuperado a lo justo que necesita cada consulta. Los sistemas RAG suelen recuperar de 10 a 20 fragmentos y meterlos todos en el prompt por si acaso. El resultado es pagar miles de tokens irrelevantes en cada petición. Añadir un reranker que filtre hasta los 3 a 5 fragmentos más relevantes suele recortar el uso de tokens de entrada entre un 50 % y un 70 % sin perder calidad y, a menudo, ganándola, porque el modelo deja de distraerse con contexto que no viene a cuento.
Registra cada petición con el número de tokens, el modelo y si fue cacheada o no. No puedes optimizar lo que no ves, y los costes de IA pueden dispararse de la noche a la mañana cuando se lanza una funcionalidad nueva o se retoca un prompt. Configura alertas de gasto diario. Monta un dashboard que desglose el gasto por funcionalidad, modelo y endpoint. La mayoría de los sobrecostes que encontramos en producción se deben a que un patrón de uso cambió dos semanas antes de que alguien mirara la factura.
Coste por millón de tokens (tarifas de 2026)
| Modelo | Entrada | Salida | Entrada cacheada |
|---|---|---|---|
| GPT-4.5 | $75.00 | $150.00 | $37.50 |
| GPT-4o | $2.50 | $10.00 | $1.25 |
| GPT-4o mini | $0.15 | $0.60 | $0.075 |
| Claude Opus 4 | $15.00 | $75.00 | $1.50 |
| Claude Sonnet 4 | $3.00 | $15.00 | $0.30 |
| Claude Haiku 4 | $0.80 | $4.00 | $0.08 |
| Gemini 2.5 Pro | $1.25 | $10.00 | N/A |
| Gemini 2.5 Flash | $0.075 | $0.30 | N/A |
FAQ
Preguntas que recibimos cada semana
Respuestas cortas en lenguaje claro. Si tu pregunta no está aquí,
GPT-4o: 2,50 $ por millón de tokens de entrada y 10 $ de salida. GPT-4o mini: 0,15 $/M de entrada y 0,60 $ de salida. GPT-4.5: 75 $/M de entrada y 150 $ de salida. Con 10 millones de tokens al mes y un reparto 30/70 entre entrada y salida, calcula entre 25 $ y 13.000 $ según el modelo.
Para la mayoría de las cargas: GPT-4o mini, Gemini 2.5 Flash o Claude Haiku 4; todas por debajo de 1 $ por millón de tokens de entrada. Para un buen equilibrio entre calidad y precio: Claude Sonnet 4 o Gemini 2.5 Pro.
Anthropic y OpenAI cachean los prompts largos entre peticiones. Los tokens cacheados cuestan un 90 % menos. Va de maravilla para chatbots con system prompts estables o para sistemas RAG con contexto estable.
Exactamente un 50 % tanto en entrada como en salida. A cambio, hay que aceptar un SLA de respuesta de 24 horas. Va bien para clasificación, resumen, embeddings y evaluación. Va mal para el chat en tiempo real o cualquier experiencia interactiva.
Con niveles de calidad equivalentes, el coste es parecido. Claude Sonnet 4 frente a GPT-4o salen prácticamente igual. Claude Opus 4 con prompt caching resulta un 30 % más barato que GPT-4o en cargas con prompts estables.
(1) Activa el prompt caching. (2) Usa la Batch API siempre que puedas. (3) Enruta las consultas sencillas a los modelos mini. (4) Limita max_tokens sin contemplaciones. (5) Recorta el contexto recuperado a lo esencial.
El punto de equilibrio ronda los 5.000 $ al mes de gasto en API. Por debajo, sigue con las APIs. Por encima, alojar Llama 3.1 o Mistral en propio puede recortar el coste entre un 50 % y un 70 %, siempre que tengas experiencia en infraestructura.
Toma una muestra representativa de 100 peticiones. Mide la media de tokens de entrada y de salida. Multiplícala por tu volumen mensual de peticiones. Multiplica el resultado por el coste por millón de tokens. Y añade un 30 % de margen de seguridad.
Solo para tareas de razonamiento difícil en las que los modelos de gama media se quedan cortos. Para el 80 % de las cargas de producción, Sonnet 4, GPT-4o o Gemini 2.5 Pro rinden de sobra a una décima parte del coste.
Dentro de un ±15 % para cargas habituales. Las desviaciones reales vienen de la variación en la longitud de los prompts, en la longitud de las respuestas, de los bucles de error y reintento y de la lógica de enrutamiento. Úsala como herramienta de planificación, no como tu factura definitiva.
Herramientas similares
Otras calculadoras que la mayoría abre justo después de esta; elige la que encaje con tu próxima decisión.
Coste de desarrollo más coste mensual de operación; la foto completa.
Obtén una estimación precisa de nuestro equipo
Las calculadoras te dan un rango. Una llamada de 30 minutos te da alcance, plazo y presupuesto cerrados. Consulta gratuita, sin compromiso.
Iniciar la conversación