ai-machine-learning

¿Cuánto cuesta la inferencia de LLM? 4 escenarios con números reales

Escrito por Mert Batur
Aug 1, 2026
18 lectura
¿Cuánto cuesta la inferencia de LLM? 4 escenarios con números reales

¿Cuánto cuesta la inferencia de LLM? 4 escenarios con números reales

En marzo de 2023, GPT-4 costaba $30 por millón de tokens de entrada. Tres años después, GPT-5.6 procesa ese mismo millón por $10. Claude Opus 4.5 se queda en $15. ¿Y el suelo? Dos centavos. Entre la opción más barata y la más cara hay una diferencia de 1.500x por la misma unidad de trabajo. El coste de inferencia de LLM es la factura recurrente que pagas cada vez que un modelo entrenado lee tu entrada y genera una salida, y todos los grandes proveedores lo cobran por millón de tokens. Los modelos económicos se mueven entre $0,02 y $0,30 por millón de tokens de entrada. Los modelos frontier cobran de $15 a $75 por el mismo volumen. La brecha importa porque es tu carga de trabajo, no tu ambición, la que determina qué nivel necesitas de verdad.

Conclusiones clave:

  • Los modelos económicos cuestan $0,02-$0,30 por millón de tokens de entrada; los frontier, $15-$75 (julio de 2026).
  • Los tokens de salida cuestan 3-5x más que los de entrada porque la generación es secuencial, no paralela.
  • Un chatbot de soporte con 50.000 conversaciones cuesta entre $9 y $420 al mes según el nivel de modelo.
  • Los precios de inferencia caen unas 10x al año; Gartner proyecta un descenso del 90% para 2030.

¿Cuánto cuesta la inferencia de LLM por millón de tokens?

Los precios de inferencia de LLM siguen una estructura de tres niveles a julio de 2026. Los modelos económicos de proveedores como Google (Gemini 2.5 Flash) y las opciones open source (Llama 4, Qwen 3) cobran $0,02-$0,30 por millón de tokens de entrada. Los modelos de nivel medio (GPT-4.1, Claude Sonnet 4) se sitúan entre $0,55 y $15. Los modelos frontier de razonamiento (o3, Claude Opus 4.5) mandan con $15-$75. Todos los proveedores publican estas tarifas en sus páginas oficiales de precios (OpenAI, Anthropic), y PricePerToken.com rastrea más de 300 modelos en una cuadrilla en vivo.

A julio de 2026, puedes procesar un millón de tokens de entrada por tan solo dos centavos, o pagar setenta y cinco dólares por ese mismo millón en un modelo frontier.

NivelModelos de ejemplo$/M tokens entrada$/M tokens salida$/M entrada en cachéIdeal para
EconómicoGemini 2.5 Flash, Llama 4 Scout, Qwen 3 32B$0,02-$0,30$0,06-$1,20$0,01-$0,15Clasificación y enrutamiento de alto volumen
MedioGPT-4.1, Claude Sonnet 4, Gemini 2.5 Pro, GPT-5.6$0,55-$15$2,20-$60$0,28-$7,50RAG, generación de código, análisis
Frontiero3, Claude Opus 4.5$15-$75$60-$300$7,50-$37,50Razonamiento complejo, investigación

Los descuentos por entrada en caché recortan tu factura un 50-90% en prompts repetidos (la guía de caché de prompts explica la mecánica). Para ver la cuadrilla en vivo de 300 modelos con las tarifas actuales de cada proveedor, consulta nuestra tabla completa de precios por token.

¿Qué determina el coste de inferencia de LLM? Los 4 componentes

Tu factura de inferencia se divide en cuatro componentes: el tiempo de cómputo de GPU por token, la memoria para los pesos del modelo y la caché KV, la asimetría entrada/salida que encarece la generación frente a la lectura, y la sobrecarga de infraestructura (energía, refrigeración, red). Saber qué componente domina tu carga de trabajo te dice dónde vale la pena optimizar.

ComponenteQué esPeso en tu facturaQué lo mueve
Cómputo (tiempo de GPU)FLOPs para procesar cada token a través de las capas del modelo40-60%Tamaño del modelo, tamaño de batch, nivel de cuantización
Memoria (pesos + caché KV)VRAM que almacena los parámetros del modelo y el estado de atención20-35%Longitud del contexto, solicitudes simultáneas
Asimetría entrada/salidaLa fase de decodificación corre en secuencia, un token por vezIncluida en el precio de salidaLongitud de la salida, estrategia de muestreo
Sobrecarga de infraestructuraEnergía, refrigeración, red, tiempo de GPU inactiva10-20%Ubicación del centro de datos, tasa de utilización

Cómputo: tiempo de GPU por token

Cada token atraviesa todas las capas del modelo. Un modelo de 70B de parámetros en FP16 necesita unos 140 GFLOPs por token. Cuantizar a INT4 lo reduce a unos 35 GFLOPs. La guía de benchmarks de inferencia de NVIDIA desglosa la fórmula completa de TCO: amortización del hardware más electricidad más gastos operativos, dividido por los tokens servidos.

Memoria: pesos del modelo + caché KV

Un modelo de 70B en FP16 ocupa unos 140 GB de VRAM solo en pesos. La caché KV crece con la longitud del contexto y el tamaño de batch simultáneo. Con un contexto de 128K y 32 solicitudes concurrentes, puedes quemar otros 80 GB. Por eso los requisitos de VRAM por modelo pesan tanto en las decisiones de autoalojamiento.

Asimetría entre entrada y salida

Los tokens de salida cuestan 3-5x más que los de entrada porque el modelo los genera de uno en uno, en orden. No puede paralelizar como hace al leer tu prompt.

La versión simple: leer tu prompt de 2.000 tokens (la fase de "prefill") procesa todos los tokens a la vez en los núcleos de la GPU. Generar 500 tokens de salida (la fase de "decode") corre un token por paso, y cada uno depende del anterior. La GPU pasa casi todo el tiempo esperando el ancho de banda de la memoria entre pasos. Ese tiempo muerto es lo que pagas a 3-5x la tarifa de entrada.

Sobrecarga de infraestructura

Energía, refrigeración, red y las GPUs paradas entre solicitudes. La documentación de optimización de Hugging Face cubre cómo el batching continuo y la decodificación especulativa exprimen más tokens por hora de GPU del mismo hardware, lo que reduce directamente esta porción de la factura.

¿Cuánto cuesta la inferencia de LLM en 4 cargas de trabajo reales?

Un chatbot de soporte típico cuesta $9-$420 al mes, un pipeline RAG corre $168-$3.360 al mes, un asistente de código para 200 desarrolladores factura $123-$2.078 al mes, y el procesamiento de documentos por lotes se sitúa entre $240 y $6.400 al mes. La horquilla depende casi por completo del nivel de modelo elegido. Construimos estos cuatro escenarios con volúmenes de tokens de despliegues de nuestros clientes, valorados contra las páginas oficiales de julio de 2026. Cada cifra de abajo es reproducible: supuestos de tokens declarados multiplicados por tarifas publicadas. Análisis nuestro, no promesas de proveedores.

Chatbot de atención al cliente: 50.000 conversaciones al mes

Conversación media: 800 tokens de entrada (prompt de sistema + mensajes del usuario + contexto recuperado), 400 tokens de salida. Volumen mensual: 50.000 conversaciones = 40M de tokens de entrada, 20M de tokens de salida.

  • Opción económica (Gemini 2.5 Flash): 40M × $0,075/M + 20M × $0,30/M = $9/mes. Casi sospechosamente barato.
  • Opción media (Claude Sonnet 4): 40M × $3/M + 20M × $15/M = $420/mes.

Para un bot de soporte que atiende tickets de nivel 1, el modelo económico resuelve el 90% de las consultas sin problema. Enruta el 10% difícil al nivel medio con un clasificador.

Pipeline RAG: 10.000 consultas al día

Consulta media: 3.200 tokens de entrada (fragmentos recuperados + prompt de sistema + pregunta del usuario), 600 tokens de salida. Mensual: 300.000 consultas = 960M de tokens de entrada, 180M de tokens de salida.

  • Opción económica (Llama 4 Scout vía API): 960M × $0,10/M + 180M × $0,40/M = $168/mes.
  • Opción media (GPT-4.1): 960M × $2/M + 180M × $8/M = $3.360/mes.

La carga RAG depende mucho de la entrada, así que los descuentos por entrada en caché pegan fuerte aquí. Con un 70% de caché de prompts, el nivel medio baja a unos $2.100/mes.

Asistente de código: 200 desarrolladores

Sesión media: 4.500 tokens de entrada (contexto de archivos + conversación), 1.200 tokens de salida. Supón 15 solicitudes por desarrollador al día, 22 días laborables = 66.000 solicitudes al mes = 297M de entrada, 79M de salida.

  • Opción económica (Qwen 3 32B): 297M × $0,20/M + 79M × $0,80/M = $123/mes.
  • Opción media (Claude Sonnet 4): 297M × $3/M + 79M × $15/M = $2.078/mes.

Los desarrolladores notan los saltos de calidad enseguida. Para código, el nivel medio suele ser el suelo. Los modelos económicos sirven para sugerencias tipo autocompletado, pero sufren con refactorizaciones de varios archivos.

Procesamiento de documentos por lotes: 1M de documentos al mes

Documento medio: 2.000 tokens de entrada, 300 tokens de salida (extracción, clasificación, resumen). Mensual: 2.000M de entrada, 300M de salida.

  • Opción económica (Gemini 2.5 Flash): 2.000M × $0,075/M + 300M × $0,30/M = $240/mes.
  • Opción media (GPT-4.1): 2.000M × $2/M + 300M × $8/M = $6.400/mes.

Con este volumen, la brecha de 27x entre niveles es una partida de $6.160 al mes. Los modelos económicos manejan bien la extracción estructurada. Para dimensionar el hardware si consideras autoalojar este volumen, revisa los requisitos de VRAM por modelo.

Carga de trabajoModeloTokens/solicitud (ent./sal.)Solicitudes/mes$/mes
Chatbot de soporteGemini 2.5 Flash800 / 40050.000$9
Chatbot de soporteClaude Sonnet 4800 / 40050.000$420
Pipeline RAGLlama 4 Scout3.200 / 600300.000$168
Pipeline RAGGPT-4.13.200 / 600300.000$3.360
Asistente de códigoQwen 3 32B4.500 / 1.20066.000$123
Asistente de códigoClaude Sonnet 44.500 / 1.20066.000$2.078
Documentos por lotesGemini 2.5 Flash2.000 / 3001M$240
Documentos por lotesGPT-4.12.000 / 3001M$6.400
python
def monthly_cost(input_tokens, output_tokens, requests, price_in, price_out):
    """Estimate monthly LLM inference cost.
    
    Args:
        input_tokens: avg input tokens per request
        output_tokens: avg output tokens per request
        requests: monthly request volume
        price_in: $/M input tokens
        price_out: $/M output tokens
    """
    total_in = input_tokens * requests / 1_000_000
    total_out = output_tokens * requests / 1_000_000
    return (total_in * price_in) + (total_out * price_out)

# Example: support chatbot on Claude Sonnet 4
cost = monthly_cost(
    input_tokens=800,
    output_tokens=400,
    requests=50_000,
    price_in=3.00,
    price_out=15.00
)
print(f"${cost:,.2f}/month")  # $420.00/month

¿API o autoalojado? ¿Cuándo gana cada uno?

La API gana por debajo de unas 20.000 solicitudes al día o cuando a tu equipo le falta experiencia en infraestructura de ML. El autoalojamiento gana por encima de 200.000 solicitudes al día con una utilización de GPU sostenida superior al 50%. El punto de equilibrio, según el análisis de Introl, se sitúa en torno a 50.000-80.000 solicitudes diarias para un modelo de la clase 70B en un solo nodo H100. Por debajo de ese umbral, la eficiencia multitenant del proveedor de API supera las cuentas de tu hardware monousuario.

Nivel de volumen$/mes en API$/mes autoalojado (GPU + ops)GanadorPor qué
Bajo: 2.000 sol./día$150-$400$2.800-$4.500APILa GPU está inactiva el 85% del tiempo
Medio: 20.000 sol./día$1.500-$4.000$3.200-$5.000API (por poco)La utilización llega al 40%, aún bajo el equilibrio
Alto: 200.000 sol./día$15.000-$40.000$5.500-$8.000AutoalojadoUna utilización del 70%+ amortiza el hardware rápido

Cuándo gana la API

Lanzas en días, no en semanas. Sin salario de ingeniero de ML ($180.000-$250.000 al año), sin guardias por fallos de GPU, sin planificación de capacidad. Para la mayoría de los equipos con menos de 50 ingenieros, la API es el valor por defecto correcto. Punto.

Cuándo gana el autoalojamiento

Superaste las 200.000 solicitudes al día, tu carga de trabajo es predecible y ya tienes gente de infraestructura de ML en plantilla. Los modelos open source (Llama 4, Qwen 3, Mistral) corren en tu hardware al coste de la electricidad más la amortización. Los benchmarks de vLLM vs SGLang muestran diferencias de rendimiento del 15-30% según la forma de la carga de trabajo, y a esta escala eso importa.

El número de equilibrio

El autoalojamiento solo gana por encima de una utilización de GPU sostenida de alrededor del 50%. Por debajo, estás pagando por silicio inactivo. Los costes ocultos de personal (tiempo de ingeniería de ML, guardias, actualizaciones de modelos, parches de seguridad) son la razón real por la que la mayoría de los equipos se quedan en la API incluso cuando las cuentas puras de GPU parecen favorables. Si aun así autoalojas, desplegar modelos en Modal elimina la capa de gestión de infraestructura y mantiene los costes por token por debajo de las tarifas de API.

Los costes ocultos que nadie presupuesta

El gasto bruto en tokens es el 60-80% de tu factura real. El resto se esconde en seis partidas que nunca aparecen en una calculadora de precios. Presupuesta un 20-40% adicional sobre tu estimación de tokens para cubrirlas.

  • Herramientas de monitorización y observabilidad: $200-$1.500 al mes. Paneles de uso de tokens, seguimiento de latencia, atribución de costes por funcionalidad. Un stack de observabilidad de LLM se paga solo la primera vez que detectas una regresión de prompt antes de que se coma tu presupuesto.
  • Reintentos y ejecuciones fallidas: el 3-8% de las solicitudes fallan o necesitan reintento (timeouts, límites de tasa, salidas mal formadas). Eso es un 3-8% de tu factura de tokens gastado en no producir nada.
  • Horas de iteración en prompt engineering: 20-60 horas por trimestre a un coste de ingeniería cargado de $100-$200 la hora. Cada ajuste de prompt vuelve a ejecutar lotes de prueba.
  • Evals y pruebas de regresión: $100-$800 al mes en tokens para suites de evaluación automatizadas. Estás pagando al modelo por corregirse a sí mismo.
  • Redundancia multirregión: 1,5-2x el coste de infraestructura si necesitas conmutación por error entre regiones por latencia o cumplimiento normativo.
  • Penalizaciones por arranque en frío: los despliegues de GPU serverless (Modal, AWS Lambda) cobran por el tiempo de inactividad. Los arranques en frío suman 2-8 segundos y te facturan el calentamiento.

La regla práctica: multiplica tu estimación bruta de tokens por 1,3 para obtener un presupuesto realista. Multiplica por 1,4 si estás en un sector regulado con sobrecarga de cumplimiento.

¿Por qué la inferencia de LLM no deja de abaratarse?

Los precios de inferencia de LLM han caído unas 10x al año desde 2023. Una carga de trabajo que costaba $1.000 al mes en 2024 cuesta hoy cerca de $100. Tres fuerzas impulsan esto: las mejoras de hardware (NVIDIA Blackwell FP4, Google TPU v6), la presión competitiva (DeepSeek y los modelos open source forzando guerras de precios) y la optimización de software (decodificación especulativa, batching continuo, cuantización). Gartner proyecta que los costes de inferencia caerán otro 90% para 2030, aunque eso es una proyección, no una garantía.

El seguimiento de precios de Epoch AI documenta este descenso con puntos de datos concretos. El análisis "LLMflation" de a16z acuñó el término y enmarcó las implicaciones económicas: la inferencia se deflaciona más rápido que cualquier categoría de cómputo anterior.

Coste de entrenamiento vs coste de inferencia

Entrenar un modelo frontier cuesta $50M-$200M (una sola vez). La inferencia de ese mismo modelo, entre todos los usuarios, cuesta $5M-$50M al año según la escala. Para la mayoría de los equipos, la proporción es de 10-100x: el entrenamiento cuesta entre 10 y 100 veces lo que cuesta un año de inferencia. Pero el entrenamiento es un gasto de capital puntual. La inferencia es la factura operativa recurrente que se acumula con el crecimiento de usuarios. No pagas por el entrenamiento a menos que estés construyendo un modelo fundacional. Pagas por la inferencia todos y cada uno de los días.

La partida de energía

Una NVIDIA H100 consume unos 700W bajo carga. A $0,10/kWh (media de EE. UU.), eso son $0,07 por hora de GPU. Un modelo de 70B en una sola H100 genera unos 2.000 tokens de salida por segundo en batch. En una hora: 7,2M de tokens. Coste de electricidad por millón de tokens de salida: unos $0,01. Cálculo nuestro, etiquetado como tal. La energía es el 1-3% de tu factura de API, pero el 8-15% del TCO autoalojado. Importa más si corres tus propias GPUs en una región con electricidad cara (en Alemania, a $0,30/kWh, este número se triplica).

La conclusión práctica: los precios caen lo bastante rápido como para que un compromiso de 12 meses con un nivel de modelo concreto sea arriesgado. Reevalúa cada trimestre. Las 12 formas de recortar tu factura de LLM cubren movimientos tácticos que puedes aplicar ahora mismo mientras la tendencia macro hace el trabajo pesado.

¿Cómo estimas TU coste de inferencia?

Estima tu coste de inferencia de LLM mensual en cuatro pasos: cuenta los tokens por solicitud, multiplica por el volumen mensual, aplica la tarifa del nivel y suma un 20-40% de sobrecarga. Por nuestra experiencia dimensionando presupuestos de inferencia para clientes, la mayoría de los equipos se saltan el paso cuatro y luego se preguntan por qué su factura real supera la estimación en un tercio. Este es el proceso que usamos.

  1. Cuenta los tokens por solicitud. Registra tu media de tokens de entrada (prompt de sistema + contexto + mensaje del usuario) y de salida (respuesta del modelo) en más de 100 solicitudes reales. No adivines. Mide.
  2. Multiplica por el volumen mensual. Solicitudes al día × 30 = solicitudes mensuales. Multiplica por tus conteos de tokens por solicitud.
  3. Aplica la tarifa del nivel. Multiplica el total de tokens de entrada por la tarifa de $/M de entrada del modelo. Haz lo mismo con la salida. Suma ambos.
  4. Suma un 20-40% de sobrecarga. Reintentos, evals, iteración de prompts, monitorización. Este es el número que va en tu presupuesto, no el del paso 3.
python
def estimate_monthly_budget(avg_input_tokens, avg_output_tokens,
                            requests_per_day, price_in, price_out,
                            overhead_pct=0.30):
    """Full monthly budget estimate with overhead."""
    monthly_requests = requests_per_day * 30
    raw_cost = monthly_cost(
        avg_input_tokens, avg_output_tokens,
        monthly_requests, price_in, price_out
    )
    return raw_cost * (1 + overhead_pct)

# RAG pipeline: 10K queries/day on GPT-4.1
budget = estimate_monthly_budget(
    avg_input_tokens=3200,
    avg_output_tokens=600,
    requests_per_day=10_000,
    price_in=2.00,
    price_out=8.00,
    overhead_pct=0.30
)
print(f"${budget:,.0f}/month")  # $4,368/month

Cuando conozcas tu número, las herramientas de gateway de LLM enrutan el tráfico al modelo más barato que supera tu listón de calidad. Un gateway con selección de modelo por solicitud puede recortar tu coste combinado un 30-50% sin tocar tus prompts.

Sobre el autor

Mert Batur es cofundador de Techsy.io, donde el equipo despliega agentes de IA, sistemas de automatización y pipelines de voz/SDR para clientes B2B. Escribe sobre la pila de herramientas de LLM que el equipo de Techsy usa de verdad en producción. Conecta en LinkedIn.

Preguntas frecuentes

¿Es cara la inferencia de LLM?

Depende de la escala y de la elección de modelo. Un millón de tokens de entrada cuesta $0,02 en Gemini 2.5 Flash o $75 en un modelo frontier de razonamiento. Para una app pequeña que procesa 10.000 solicitudes al día, cuenta con $50-$400 al mes. Para cargas empresariales de más de 1M de solicitudes al día, los presupuestos van de $5.000 a $40.000 al mes. El coste unitario es bajo; el volumen es lo que lo multiplica.

¿Cuánto es 1 millón de tokens en un LLM?

Un millón de tokens equivale a unas 750.000 palabras, o a unas 10 novelas completas. En julio de 2026, procesar 1M de tokens de entrada cuesta de $0,02 (nivel económico) a $75 (nivel frontier). Los tokens de salida para el mismo volumen van de $0,06 a $300. La mayoría de las cargas de producción se sitúan en el nivel medio: $2-$15 por millón de tokens de entrada.

¿Por qué es tan cara la inferencia de IA?

La inferencia exige pasar cada token por miles de millones de parámetros del modelo en GPUs que cuestan $25.000-$40.000 cada una. La fase de decodificación genera tokens en secuencia y deja núcleos de GPU inactivos entre pasos. Estás pagando por hardware especializado, electricidad, refrigeración y el equipo de ingeniería del proveedor que mantiene la pila de servicio funcionando 24/7.

¿Están bajando los costes de inferencia de IA?

Sí, unas 10x al año desde 2023. GPT-4 se lanzó a $30/$60 por millón de tokens (entrada/salida). Una capacidad equivalente cuesta hoy $2-$10. Los datos de Epoch AI confirman esta trayectoria en todos los proveedores. Gartner proyecta otro descenso del 90% para 2030, impulsado por las mejoras de hardware y la presión competitiva de los modelos open source.

¿Cuánto cuesta la inferencia de LLM en 2026?

Modelos económicos: $0,02-$0,30 por millón de tokens de entrada. Nivel medio: $0,55-$15. Frontier: $15-$75. Una carga de producción típica (chatbot de soporte, pipeline RAG o asistente de código) cuesta $150-$4.000 al mes en modelos de nivel medio. Los modelos económicos resuelven tareas de alto volumen y baja complejidad por 10-30x menos.

¿Cuál es la diferencia entre coste de entrenamiento y coste de inferencia?

El entrenamiento es el gasto puntual de enseñar a un modelo desde cero: $50M-$200M para un modelo frontier, con miles de GPUs durante meses. La inferencia es el coste recurrente de usar ese modelo ya entrenado: pasar entradas por él para obtener salidas, facturado por token. Para la mayoría de los equipos, la inferencia es la única factura que pagan. El entrenamiento es para las empresas que construyen modelos fundacionales.

¿Cómo calculo el coste de inferencia de LLM para mi app?

Multiplica la media de tokens de entrada por solicitud por tu volumen mensual de solicitudes y luego por la tarifa de $/M de entrada del modelo. Repite con los tokens de salida. Suma ambos. Añade un 30% por reintentos, evals y sobrecarga de monitorización. Los fragmentos de Python de este artículo automatizan las cuentas. Mide conteos reales de tokens en lugar de adivinar: los registros de más de 100 solicitudes dan una media fiable.

¿Cuestan más los tokens de salida que los de entrada?

Sí, normalmente 3-5x más. El procesamiento de la entrada (prefill) se paraleliza en todos los tokens a la vez y aprovecha los núcleos de la GPU a fondo. La generación de salida (decode) produce un token por vez, y cada uno depende del anterior. La GPU espera el ancho de banda de la memoria entre pasos. Los proveedores cobran más por la salida para reflejar esta menor eficiencia del hardware.

¿Es más barata la inferencia autoalojada que usar una API?

Solo por encima de unas 200.000 solicitudes al día con una utilización de GPU sostenida superior al 50%. Por debajo, la eficiencia multitenant de los proveedores de API supera a tu hardware monousuario. El autoalojamiento también suma costes ocultos: salarios de ingenieros de ML ($180.000-$250.000 al año), guardias, actualizaciones de modelos y parches de seguridad. La mayoría de los equipos con menos de 50 ingenieros deberían quedarse en la API.

¿Consume mucha energía la inferencia de LLM?

Una GPU H100 consume unos 700W bajo carga. A $0,10/kWh, eso son $0,07 por hora de GPU, lo que se traduce en unos $0,01 por millón de tokens de salida para un modelo de 70B. La energía es el 1-3% de una factura de API, pero el 8-15% del TCO autoalojado. En regiones con electricidad cara (Alemania, $0,30/kWh), la porción de energía se triplica y afecta de forma material a las cuentas del autoalojamiento.

En resumen

Cuatro números para recordar: $0,02 (el suelo económico por millón de tokens de entrada), 3-5x (la prima de la salida sobre la entrada), 20-40% (la sobrecarga que hay que sumar al cálculo bruto de tokens) y 10x (la caída anual de precios desde 2023). Tu factura real depende del volumen, del nivel de modelo y de con qué agresividad uses la caché, el batching y el enrutamiento de tráfico.

En Techsy, nuestro equipo dimensiona presupuestos de inferencia y elige niveles de modelo para clientes B2B que corren cargas de LLM en producción. Si quieres una segunda opinión sobre tu modelo de costes, pide una consulta gratuita.

Etiquetas

coste de inferencia de LLMprecios de inferencia LLMcoste por millón de tokensutilización de GPUinferencia autoalojada

Compartir este artículo

Inicia Tu Proyecto

¿Listo para construir algo extraordinario?

Convirtamos tu visión en realidad. Nuestro equipo está listo para ayudarte a crear software que marque la diferencia.