
¿Cuánto cuesta la inferencia de LLM? 4 escenarios con números reales
En marzo de 2023, GPT-4 costaba $30 por millón de tokens de entrada. Tres años después, GPT-5.6 procesa ese mismo millón por $10. Claude Opus 4.5 se queda en $15. ¿Y el suelo? Dos centavos. Entre la opción más barata y la más cara hay una diferencia de 1.500x por la misma unidad de trabajo. El coste de inferencia de LLM es la factura recurrente que pagas cada vez que un modelo entrenado lee tu entrada y genera una salida, y todos los grandes proveedores lo cobran por millón de tokens. Los modelos económicos se mueven entre $0,02 y $0,30 por millón de tokens de entrada. Los modelos frontier cobran de $15 a $75 por el mismo volumen. La brecha importa porque es tu carga de trabajo, no tu ambición, la que determina qué nivel necesitas de verdad.
Conclusiones clave:
- Los modelos económicos cuestan $0,02-$0,30 por millón de tokens de entrada; los frontier, $15-$75 (julio de 2026).
- Los tokens de salida cuestan 3-5x más que los de entrada porque la generación es secuencial, no paralela.
- Un chatbot de soporte con 50.000 conversaciones cuesta entre $9 y $420 al mes según el nivel de modelo.
- Los precios de inferencia caen unas 10x al año; Gartner proyecta un descenso del 90% para 2030.
¿Cuánto cuesta la inferencia de LLM por millón de tokens?
Los precios de inferencia de LLM siguen una estructura de tres niveles a julio de 2026. Los modelos económicos de proveedores como Google (Gemini 2.5 Flash) y las opciones open source (Llama 4, Qwen 3) cobran $0,02-$0,30 por millón de tokens de entrada. Los modelos de nivel medio (GPT-4.1, Claude Sonnet 4) se sitúan entre $0,55 y $15. Los modelos frontier de razonamiento (o3, Claude Opus 4.5) mandan con $15-$75. Todos los proveedores publican estas tarifas en sus páginas oficiales de precios (OpenAI, Anthropic), y PricePerToken.com rastrea más de 300 modelos en una cuadrilla en vivo.
A julio de 2026, puedes procesar un millón de tokens de entrada por tan solo dos centavos, o pagar setenta y cinco dólares por ese mismo millón en un modelo frontier.
| Nivel | Modelos de ejemplo | $/M tokens entrada | $/M tokens salida | $/M entrada en caché | Ideal para |
|---|---|---|---|---|---|
| Económico | Gemini 2.5 Flash, Llama 4 Scout, Qwen 3 32B | $0,02-$0,30 | $0,06-$1,20 | $0,01-$0,15 | Clasificación y enrutamiento de alto volumen |
| Medio | GPT-4.1, Claude Sonnet 4, Gemini 2.5 Pro, GPT-5.6 | $0,55-$15 | $2,20-$60 | $0,28-$7,50 | RAG, generación de código, análisis |
| Frontier | o3, Claude Opus 4.5 | $15-$75 | $60-$300 | $7,50-$37,50 | Razonamiento complejo, investigación |
Los descuentos por entrada en caché recortan tu factura un 50-90% en prompts repetidos (la guía de caché de prompts explica la mecánica). Para ver la cuadrilla en vivo de 300 modelos con las tarifas actuales de cada proveedor, consulta nuestra tabla completa de precios por token.
¿Qué determina el coste de inferencia de LLM? Los 4 componentes
Tu factura de inferencia se divide en cuatro componentes: el tiempo de cómputo de GPU por token, la memoria para los pesos del modelo y la caché KV, la asimetría entrada/salida que encarece la generación frente a la lectura, y la sobrecarga de infraestructura (energía, refrigeración, red). Saber qué componente domina tu carga de trabajo te dice dónde vale la pena optimizar.
| Componente | Qué es | Peso en tu factura | Qué lo mueve |
|---|---|---|---|
| Cómputo (tiempo de GPU) | FLOPs para procesar cada token a través de las capas del modelo | 40-60% | Tamaño del modelo, tamaño de batch, nivel de cuantización |
| Memoria (pesos + caché KV) | VRAM que almacena los parámetros del modelo y el estado de atención | 20-35% | Longitud del contexto, solicitudes simultáneas |
| Asimetría entrada/salida | La fase de decodificación corre en secuencia, un token por vez | Incluida en el precio de salida | Longitud de la salida, estrategia de muestreo |
| Sobrecarga de infraestructura | Energía, refrigeración, red, tiempo de GPU inactiva | 10-20% | Ubicación del centro de datos, tasa de utilización |
Cómputo: tiempo de GPU por token
Cada token atraviesa todas las capas del modelo. Un modelo de 70B de parámetros en FP16 necesita unos 140 GFLOPs por token. Cuantizar a INT4 lo reduce a unos 35 GFLOPs. La guía de benchmarks de inferencia de NVIDIA desglosa la fórmula completa de TCO: amortización del hardware más electricidad más gastos operativos, dividido por los tokens servidos.
Memoria: pesos del modelo + caché KV
Un modelo de 70B en FP16 ocupa unos 140 GB de VRAM solo en pesos. La caché KV crece con la longitud del contexto y el tamaño de batch simultáneo. Con un contexto de 128K y 32 solicitudes concurrentes, puedes quemar otros 80 GB. Por eso los requisitos de VRAM por modelo pesan tanto en las decisiones de autoalojamiento.
Asimetría entre entrada y salida
Los tokens de salida cuestan 3-5x más que los de entrada porque el modelo los genera de uno en uno, en orden. No puede paralelizar como hace al leer tu prompt.
La versión simple: leer tu prompt de 2.000 tokens (la fase de "prefill") procesa todos los tokens a la vez en los núcleos de la GPU. Generar 500 tokens de salida (la fase de "decode") corre un token por paso, y cada uno depende del anterior. La GPU pasa casi todo el tiempo esperando el ancho de banda de la memoria entre pasos. Ese tiempo muerto es lo que pagas a 3-5x la tarifa de entrada.
Sobrecarga de infraestructura
Energía, refrigeración, red y las GPUs paradas entre solicitudes. La documentación de optimización de Hugging Face cubre cómo el batching continuo y la decodificación especulativa exprimen más tokens por hora de GPU del mismo hardware, lo que reduce directamente esta porción de la factura.
¿Cuánto cuesta la inferencia de LLM en 4 cargas de trabajo reales?
Un chatbot de soporte típico cuesta $9-$420 al mes, un pipeline RAG corre $168-$3.360 al mes, un asistente de código para 200 desarrolladores factura $123-$2.078 al mes, y el procesamiento de documentos por lotes se sitúa entre $240 y $6.400 al mes. La horquilla depende casi por completo del nivel de modelo elegido. Construimos estos cuatro escenarios con volúmenes de tokens de despliegues de nuestros clientes, valorados contra las páginas oficiales de julio de 2026. Cada cifra de abajo es reproducible: supuestos de tokens declarados multiplicados por tarifas publicadas. Análisis nuestro, no promesas de proveedores.
Chatbot de atención al cliente: 50.000 conversaciones al mes
Conversación media: 800 tokens de entrada (prompt de sistema + mensajes del usuario + contexto recuperado), 400 tokens de salida. Volumen mensual: 50.000 conversaciones = 40M de tokens de entrada, 20M de tokens de salida.
- Opción económica (Gemini 2.5 Flash): 40M × $0,075/M + 20M × $0,30/M = $9/mes. Casi sospechosamente barato.
- Opción media (Claude Sonnet 4): 40M × $3/M + 20M × $15/M = $420/mes.
Para un bot de soporte que atiende tickets de nivel 1, el modelo económico resuelve el 90% de las consultas sin problema. Enruta el 10% difícil al nivel medio con un clasificador.
Pipeline RAG: 10.000 consultas al día
Consulta media: 3.200 tokens de entrada (fragmentos recuperados + prompt de sistema + pregunta del usuario), 600 tokens de salida. Mensual: 300.000 consultas = 960M de tokens de entrada, 180M de tokens de salida.
- Opción económica (Llama 4 Scout vía API): 960M × $0,10/M + 180M × $0,40/M = $168/mes.
- Opción media (GPT-4.1): 960M × $2/M + 180M × $8/M = $3.360/mes.
La carga RAG depende mucho de la entrada, así que los descuentos por entrada en caché pegan fuerte aquí. Con un 70% de caché de prompts, el nivel medio baja a unos $2.100/mes.
Asistente de código: 200 desarrolladores
Sesión media: 4.500 tokens de entrada (contexto de archivos + conversación), 1.200 tokens de salida. Supón 15 solicitudes por desarrollador al día, 22 días laborables = 66.000 solicitudes al mes = 297M de entrada, 79M de salida.
- Opción económica (Qwen 3 32B): 297M × $0,20/M + 79M × $0,80/M = $123/mes.
- Opción media (Claude Sonnet 4): 297M × $3/M + 79M × $15/M = $2.078/mes.
Los desarrolladores notan los saltos de calidad enseguida. Para código, el nivel medio suele ser el suelo. Los modelos económicos sirven para sugerencias tipo autocompletado, pero sufren con refactorizaciones de varios archivos.
Procesamiento de documentos por lotes: 1M de documentos al mes
Documento medio: 2.000 tokens de entrada, 300 tokens de salida (extracción, clasificación, resumen). Mensual: 2.000M de entrada, 300M de salida.
- Opción económica (Gemini 2.5 Flash): 2.000M × $0,075/M + 300M × $0,30/M = $240/mes.
- Opción media (GPT-4.1): 2.000M × $2/M + 300M × $8/M = $6.400/mes.
Con este volumen, la brecha de 27x entre niveles es una partida de $6.160 al mes. Los modelos económicos manejan bien la extracción estructurada. Para dimensionar el hardware si consideras autoalojar este volumen, revisa los requisitos de VRAM por modelo.
| Carga de trabajo | Modelo | Tokens/solicitud (ent./sal.) | Solicitudes/mes | $/mes |
|---|---|---|---|---|
| Chatbot de soporte | Gemini 2.5 Flash | 800 / 400 | 50.000 | $9 |
| Chatbot de soporte | Claude Sonnet 4 | 800 / 400 | 50.000 | $420 |
| Pipeline RAG | Llama 4 Scout | 3.200 / 600 | 300.000 | $168 |
| Pipeline RAG | GPT-4.1 | 3.200 / 600 | 300.000 | $3.360 |
| Asistente de código | Qwen 3 32B | 4.500 / 1.200 | 66.000 | $123 |
| Asistente de código | Claude Sonnet 4 | 4.500 / 1.200 | 66.000 | $2.078 |
| Documentos por lotes | Gemini 2.5 Flash | 2.000 / 300 | 1M | $240 |
| Documentos por lotes | GPT-4.1 | 2.000 / 300 | 1M | $6.400 |
def monthly_cost(input_tokens, output_tokens, requests, price_in, price_out):
"""Estimate monthly LLM inference cost.
Args:
input_tokens: avg input tokens per request
output_tokens: avg output tokens per request
requests: monthly request volume
price_in: $/M input tokens
price_out: $/M output tokens
"""
total_in = input_tokens * requests / 1_000_000
total_out = output_tokens * requests / 1_000_000
return (total_in * price_in) + (total_out * price_out)
# Example: support chatbot on Claude Sonnet 4
cost = monthly_cost(
input_tokens=800,
output_tokens=400,
requests=50_000,
price_in=3.00,
price_out=15.00
)
print(f"${cost:,.2f}/month") # $420.00/month¿API o autoalojado? ¿Cuándo gana cada uno?
La API gana por debajo de unas 20.000 solicitudes al día o cuando a tu equipo le falta experiencia en infraestructura de ML. El autoalojamiento gana por encima de 200.000 solicitudes al día con una utilización de GPU sostenida superior al 50%. El punto de equilibrio, según el análisis de Introl, se sitúa en torno a 50.000-80.000 solicitudes diarias para un modelo de la clase 70B en un solo nodo H100. Por debajo de ese umbral, la eficiencia multitenant del proveedor de API supera las cuentas de tu hardware monousuario.
| Nivel de volumen | $/mes en API | $/mes autoalojado (GPU + ops) | Ganador | Por qué |
|---|---|---|---|---|
| Bajo: 2.000 sol./día | $150-$400 | $2.800-$4.500 | API | La GPU está inactiva el 85% del tiempo |
| Medio: 20.000 sol./día | $1.500-$4.000 | $3.200-$5.000 | API (por poco) | La utilización llega al 40%, aún bajo el equilibrio |
| Alto: 200.000 sol./día | $15.000-$40.000 | $5.500-$8.000 | Autoalojado | Una utilización del 70%+ amortiza el hardware rápido |
Cuándo gana la API
Lanzas en días, no en semanas. Sin salario de ingeniero de ML ($180.000-$250.000 al año), sin guardias por fallos de GPU, sin planificación de capacidad. Para la mayoría de los equipos con menos de 50 ingenieros, la API es el valor por defecto correcto. Punto.
Cuándo gana el autoalojamiento
Superaste las 200.000 solicitudes al día, tu carga de trabajo es predecible y ya tienes gente de infraestructura de ML en plantilla. Los modelos open source (Llama 4, Qwen 3, Mistral) corren en tu hardware al coste de la electricidad más la amortización. Los benchmarks de vLLM vs SGLang muestran diferencias de rendimiento del 15-30% según la forma de la carga de trabajo, y a esta escala eso importa.
El número de equilibrio
El autoalojamiento solo gana por encima de una utilización de GPU sostenida de alrededor del 50%. Por debajo, estás pagando por silicio inactivo. Los costes ocultos de personal (tiempo de ingeniería de ML, guardias, actualizaciones de modelos, parches de seguridad) son la razón real por la que la mayoría de los equipos se quedan en la API incluso cuando las cuentas puras de GPU parecen favorables. Si aun así autoalojas, desplegar modelos en Modal elimina la capa de gestión de infraestructura y mantiene los costes por token por debajo de las tarifas de API.
Los costes ocultos que nadie presupuesta
El gasto bruto en tokens es el 60-80% de tu factura real. El resto se esconde en seis partidas que nunca aparecen en una calculadora de precios. Presupuesta un 20-40% adicional sobre tu estimación de tokens para cubrirlas.
- Herramientas de monitorización y observabilidad: $200-$1.500 al mes. Paneles de uso de tokens, seguimiento de latencia, atribución de costes por funcionalidad. Un stack de observabilidad de LLM se paga solo la primera vez que detectas una regresión de prompt antes de que se coma tu presupuesto.
- Reintentos y ejecuciones fallidas: el 3-8% de las solicitudes fallan o necesitan reintento (timeouts, límites de tasa, salidas mal formadas). Eso es un 3-8% de tu factura de tokens gastado en no producir nada.
- Horas de iteración en prompt engineering: 20-60 horas por trimestre a un coste de ingeniería cargado de $100-$200 la hora. Cada ajuste de prompt vuelve a ejecutar lotes de prueba.
- Evals y pruebas de regresión: $100-$800 al mes en tokens para suites de evaluación automatizadas. Estás pagando al modelo por corregirse a sí mismo.
- Redundancia multirregión: 1,5-2x el coste de infraestructura si necesitas conmutación por error entre regiones por latencia o cumplimiento normativo.
- Penalizaciones por arranque en frío: los despliegues de GPU serverless (Modal, AWS Lambda) cobran por el tiempo de inactividad. Los arranques en frío suman 2-8 segundos y te facturan el calentamiento.
La regla práctica: multiplica tu estimación bruta de tokens por 1,3 para obtener un presupuesto realista. Multiplica por 1,4 si estás en un sector regulado con sobrecarga de cumplimiento.
¿Por qué la inferencia de LLM no deja de abaratarse?
Los precios de inferencia de LLM han caído unas 10x al año desde 2023. Una carga de trabajo que costaba $1.000 al mes en 2024 cuesta hoy cerca de $100. Tres fuerzas impulsan esto: las mejoras de hardware (NVIDIA Blackwell FP4, Google TPU v6), la presión competitiva (DeepSeek y los modelos open source forzando guerras de precios) y la optimización de software (decodificación especulativa, batching continuo, cuantización). Gartner proyecta que los costes de inferencia caerán otro 90% para 2030, aunque eso es una proyección, no una garantía.
El seguimiento de precios de Epoch AI documenta este descenso con puntos de datos concretos. El análisis "LLMflation" de a16z acuñó el término y enmarcó las implicaciones económicas: la inferencia se deflaciona más rápido que cualquier categoría de cómputo anterior.
Coste de entrenamiento vs coste de inferencia
Entrenar un modelo frontier cuesta $50M-$200M (una sola vez). La inferencia de ese mismo modelo, entre todos los usuarios, cuesta $5M-$50M al año según la escala. Para la mayoría de los equipos, la proporción es de 10-100x: el entrenamiento cuesta entre 10 y 100 veces lo que cuesta un año de inferencia. Pero el entrenamiento es un gasto de capital puntual. La inferencia es la factura operativa recurrente que se acumula con el crecimiento de usuarios. No pagas por el entrenamiento a menos que estés construyendo un modelo fundacional. Pagas por la inferencia todos y cada uno de los días.
La partida de energía
Una NVIDIA H100 consume unos 700W bajo carga. A $0,10/kWh (media de EE. UU.), eso son $0,07 por hora de GPU. Un modelo de 70B en una sola H100 genera unos 2.000 tokens de salida por segundo en batch. En una hora: 7,2M de tokens. Coste de electricidad por millón de tokens de salida: unos $0,01. Cálculo nuestro, etiquetado como tal. La energía es el 1-3% de tu factura de API, pero el 8-15% del TCO autoalojado. Importa más si corres tus propias GPUs en una región con electricidad cara (en Alemania, a $0,30/kWh, este número se triplica).
La conclusión práctica: los precios caen lo bastante rápido como para que un compromiso de 12 meses con un nivel de modelo concreto sea arriesgado. Reevalúa cada trimestre. Las 12 formas de recortar tu factura de LLM cubren movimientos tácticos que puedes aplicar ahora mismo mientras la tendencia macro hace el trabajo pesado.
¿Cómo estimas TU coste de inferencia?
Estima tu coste de inferencia de LLM mensual en cuatro pasos: cuenta los tokens por solicitud, multiplica por el volumen mensual, aplica la tarifa del nivel y suma un 20-40% de sobrecarga. Por nuestra experiencia dimensionando presupuestos de inferencia para clientes, la mayoría de los equipos se saltan el paso cuatro y luego se preguntan por qué su factura real supera la estimación en un tercio. Este es el proceso que usamos.
- Cuenta los tokens por solicitud. Registra tu media de tokens de entrada (prompt de sistema + contexto + mensaje del usuario) y de salida (respuesta del modelo) en más de 100 solicitudes reales. No adivines. Mide.
- Multiplica por el volumen mensual. Solicitudes al día × 30 = solicitudes mensuales. Multiplica por tus conteos de tokens por solicitud.
- Aplica la tarifa del nivel. Multiplica el total de tokens de entrada por la tarifa de $/M de entrada del modelo. Haz lo mismo con la salida. Suma ambos.
- Suma un 20-40% de sobrecarga. Reintentos, evals, iteración de prompts, monitorización. Este es el número que va en tu presupuesto, no el del paso 3.
def estimate_monthly_budget(avg_input_tokens, avg_output_tokens,
requests_per_day, price_in, price_out,
overhead_pct=0.30):
"""Full monthly budget estimate with overhead."""
monthly_requests = requests_per_day * 30
raw_cost = monthly_cost(
avg_input_tokens, avg_output_tokens,
monthly_requests, price_in, price_out
)
return raw_cost * (1 + overhead_pct)
# RAG pipeline: 10K queries/day on GPT-4.1
budget = estimate_monthly_budget(
avg_input_tokens=3200,
avg_output_tokens=600,
requests_per_day=10_000,
price_in=2.00,
price_out=8.00,
overhead_pct=0.30
)
print(f"${budget:,.0f}/month") # $4,368/monthCuando conozcas tu número, las herramientas de gateway de LLM enrutan el tráfico al modelo más barato que supera tu listón de calidad. Un gateway con selección de modelo por solicitud puede recortar tu coste combinado un 30-50% sin tocar tus prompts.
Sobre el autor
Mert Batur es cofundador de Techsy.io, donde el equipo despliega agentes de IA, sistemas de automatización y pipelines de voz/SDR para clientes B2B. Escribe sobre la pila de herramientas de LLM que el equipo de Techsy usa de verdad en producción. Conecta en LinkedIn.
Preguntas frecuentes
¿Es cara la inferencia de LLM?
Depende de la escala y de la elección de modelo. Un millón de tokens de entrada cuesta $0,02 en Gemini 2.5 Flash o $75 en un modelo frontier de razonamiento. Para una app pequeña que procesa 10.000 solicitudes al día, cuenta con $50-$400 al mes. Para cargas empresariales de más de 1M de solicitudes al día, los presupuestos van de $5.000 a $40.000 al mes. El coste unitario es bajo; el volumen es lo que lo multiplica.
¿Cuánto es 1 millón de tokens en un LLM?
Un millón de tokens equivale a unas 750.000 palabras, o a unas 10 novelas completas. En julio de 2026, procesar 1M de tokens de entrada cuesta de $0,02 (nivel económico) a $75 (nivel frontier). Los tokens de salida para el mismo volumen van de $0,06 a $300. La mayoría de las cargas de producción se sitúan en el nivel medio: $2-$15 por millón de tokens de entrada.
¿Por qué es tan cara la inferencia de IA?
La inferencia exige pasar cada token por miles de millones de parámetros del modelo en GPUs que cuestan $25.000-$40.000 cada una. La fase de decodificación genera tokens en secuencia y deja núcleos de GPU inactivos entre pasos. Estás pagando por hardware especializado, electricidad, refrigeración y el equipo de ingeniería del proveedor que mantiene la pila de servicio funcionando 24/7.
¿Están bajando los costes de inferencia de IA?
Sí, unas 10x al año desde 2023. GPT-4 se lanzó a $30/$60 por millón de tokens (entrada/salida). Una capacidad equivalente cuesta hoy $2-$10. Los datos de Epoch AI confirman esta trayectoria en todos los proveedores. Gartner proyecta otro descenso del 90% para 2030, impulsado por las mejoras de hardware y la presión competitiva de los modelos open source.
¿Cuánto cuesta la inferencia de LLM en 2026?
Modelos económicos: $0,02-$0,30 por millón de tokens de entrada. Nivel medio: $0,55-$15. Frontier: $15-$75. Una carga de producción típica (chatbot de soporte, pipeline RAG o asistente de código) cuesta $150-$4.000 al mes en modelos de nivel medio. Los modelos económicos resuelven tareas de alto volumen y baja complejidad por 10-30x menos.
¿Cuál es la diferencia entre coste de entrenamiento y coste de inferencia?
El entrenamiento es el gasto puntual de enseñar a un modelo desde cero: $50M-$200M para un modelo frontier, con miles de GPUs durante meses. La inferencia es el coste recurrente de usar ese modelo ya entrenado: pasar entradas por él para obtener salidas, facturado por token. Para la mayoría de los equipos, la inferencia es la única factura que pagan. El entrenamiento es para las empresas que construyen modelos fundacionales.
¿Cómo calculo el coste de inferencia de LLM para mi app?
Multiplica la media de tokens de entrada por solicitud por tu volumen mensual de solicitudes y luego por la tarifa de $/M de entrada del modelo. Repite con los tokens de salida. Suma ambos. Añade un 30% por reintentos, evals y sobrecarga de monitorización. Los fragmentos de Python de este artículo automatizan las cuentas. Mide conteos reales de tokens en lugar de adivinar: los registros de más de 100 solicitudes dan una media fiable.
¿Cuestan más los tokens de salida que los de entrada?
Sí, normalmente 3-5x más. El procesamiento de la entrada (prefill) se paraleliza en todos los tokens a la vez y aprovecha los núcleos de la GPU a fondo. La generación de salida (decode) produce un token por vez, y cada uno depende del anterior. La GPU espera el ancho de banda de la memoria entre pasos. Los proveedores cobran más por la salida para reflejar esta menor eficiencia del hardware.
¿Es más barata la inferencia autoalojada que usar una API?
Solo por encima de unas 200.000 solicitudes al día con una utilización de GPU sostenida superior al 50%. Por debajo, la eficiencia multitenant de los proveedores de API supera a tu hardware monousuario. El autoalojamiento también suma costes ocultos: salarios de ingenieros de ML ($180.000-$250.000 al año), guardias, actualizaciones de modelos y parches de seguridad. La mayoría de los equipos con menos de 50 ingenieros deberían quedarse en la API.
¿Consume mucha energía la inferencia de LLM?
Una GPU H100 consume unos 700W bajo carga. A $0,10/kWh, eso son $0,07 por hora de GPU, lo que se traduce en unos $0,01 por millón de tokens de salida para un modelo de 70B. La energía es el 1-3% de una factura de API, pero el 8-15% del TCO autoalojado. En regiones con electricidad cara (Alemania, $0,30/kWh), la porción de energía se triplica y afecta de forma material a las cuentas del autoalojamiento.
En resumen
Cuatro números para recordar: $0,02 (el suelo económico por millón de tokens de entrada), 3-5x (la prima de la salida sobre la entrada), 20-40% (la sobrecarga que hay que sumar al cálculo bruto de tokens) y 10x (la caída anual de precios desde 2023). Tu factura real depende del volumen, del nivel de modelo y de con qué agresividad uses la caché, el batching y el enrutamiento de tráfico.
En Techsy, nuestro equipo dimensiona presupuestos de inferencia y elige niveles de modelo para clientes B2B que corren cargas de LLM en producción. Si quieres una segunda opinión sobre tu modelo de costes, pide una consulta gratuita.