
Quanto Custa a Inferência de LLM? 4 Cenários com Contas Reais
O GPT-4 custava US$ 30 por milhão de tokens de entrada em março de 2023. Três anos depois, o GPT-5.6 processa o mesmo milhão por US$ 10. O Claude Opus 4.5 fica em US$ 15. O piso? Dois centavos. Isso é uma diferença de 1.500x entre a opção mais barata e a mais cara para a mesma unidade de trabalho. O custo de inferência de LLM é a conta recorrente que você paga toda vez que um modelo treinado lê sua entrada e gera uma saída, cobrada por milhão de tokens por todos os grandes provedores. Modelos econômicos custam US$ 0,02 a US$ 0,30 por milhão de tokens de entrada. Modelos de fronteira cobram US$ 15 a US$ 75 pelo mesmo volume. A diferença importa porque é o seu workload, não a sua ambição, que determina de qual nível você realmente precisa.
Principais aprendizados:
- Modelos econômicos custam US$ 0,02 a US$ 0,30 por milhão de tokens de entrada; modelos de fronteira custam US$ 15 a US$ 75 (julho de 2026).
- Tokens de saída custam de 3 a 5 vezes mais que tokens de entrada, porque a geração é sequencial, não paralela.
- Um chatbot de suporte com 50 mil conversas custa cerca de US$ 9 a US$ 420 por mês, conforme o nível do modelo.
- Os preços de inferência caíram cerca de 10x ao ano; o Gartner projeta 90% a menos até 2030.
Quanto Custa a Inferência de LLM por Milhão de Tokens?
Os preços de inferência de LLM seguem uma estrutura de três níveis em julho de 2026. Modelos econômicos de provedores como Google (Gemini 2.5 Flash) e opções open source (Llama 4, Qwen 3) cobram US$ 0,02 a US$ 0,30 por milhão de tokens de entrada. Modelos intermediários (GPT-4.1, Claude Sonnet 4) ficam entre US$ 0,55 e US$ 15. Modelos de raciocínio de fronteira (o3, Claude Opus 4.5) comandam US$ 15 a US$ 75. Todos os provedores publicam essas taxas em suas páginas oficiais de preços (OpenAI, Anthropic), e o PricePerToken.com rastreia mais de 300 modelos em uma grade ao vivo.
Em julho de 2026, você pode processar um milhão de tokens de entrada por apenas dois centavos, ou pagar setenta e cinco dólares pelo mesmo milhão em um modelo de fronteira.
| Nível | Modelos de exemplo | US$/M tokens de entrada | US$/M tokens de saída | Entrada em cache US$/M | Melhor para |
|---|---|---|---|---|---|
| Econômico | Gemini 2.5 Flash, Llama 4 Scout, Qwen 3 32B | US$ 0,02-US$ 0,30 | US$ 0,06-US$ 1,20 | US$ 0,01-US$ 0,15 | Classificação e roteamento de alto volume |
| Intermediário | GPT-4.1, Claude Sonnet 4, Gemini 2.5 Pro, GPT-5.6 | US$ 0,55-US$ 15 | US$ 2,20-US$ 60 | US$ 0,28-US$ 7,50 | RAG, geração de código, análise |
| Fronteira | o3, Claude Opus 4.5 | US$ 15-US$ 75 | US$ 60-US$ 300 | US$ 7,50-US$ 37,50 | Raciocínio complexo, pesquisa |
Os descontos por entrada em cache cortam sua conta em 50-90% em prompts repetidos (prompt caching reduz custos de entrada explica a mecânica). Para a grade ao vivo de 300 modelos com as taxas atuais de cada provedor, veja nossa tabela completa de preços por token.
O Que Determina o Custo de Inferência de LLM? Os 4 Componentes
Sua conta de inferência se divide em quatro fatores de custo: tempo de computação de GPU por token, memória para os pesos do modelo e o cache KV, a assimetria de entrada/saída que torna a geração mais cara que a leitura, e o overhead de infraestrutura (energia, refrigeração, rede). Entender qual componente domina o seu workload mostra onde a otimização compensa.
| Componente | O que é | Fatia da sua conta | O que o move |
|---|---|---|---|
| Computação (tempo de GPU) | FLOPs para processar cada token pelas camadas do modelo | 40-60% | Tamanho do modelo, tamanho do batch, nível de quantização |
| Memória (pesos + cache KV) | VRAM que guarda os parâmetros do modelo e o estado de atenção | 20-35% | Comprimento do contexto, requisições simultâneas |
| Assimetria entrada/saída | A fase de decodificação roda em sequência, um token por vez | Embutida no preço de saída | Comprimento da saída, estratégia de amostragem |
| Overhead de infraestrutura | Energia, refrigeração, rede, tempo de GPU ociosa | 10-20% | Localização do data center, taxa de utilização |
Computação: tempo de GPU por token
Cada token passa por todas as camadas do modelo. Um modelo de 70 bilhões de parâmetros em FP16 precisa de cerca de 140 GFLOPs por token. Quantizar para INT4 corta isso para cerca de 35 GFLOPs. O guia de benchmarking de inferência da NVIDIA detalha a fórmula completa de TCO: amortização do hardware mais eletricidade mais overhead operacional, dividido pelos tokens servidos.
Memória: pesos do modelo + cache KV
Um modelo de 70B em FP16 ocupa cerca de 140 GB de VRAM só para os pesos. O cache KV cresce com o comprimento do contexto e o tamanho do batch simultâneo. Com contexto de 128K e 32 requisições simultâneas, você pode queimar outros 80 GB. É por isso que os requisitos de VRAM por modelo importam tanto para decisões de self-hosting.
Assimetria entre entrada e saída
Tokens de saída custam de 3 a 5 vezes mais que tokens de entrada porque o modelo os gera um de cada vez, em ordem. Ele não pode paralelizar do jeito que faz ao ler seu prompt.
Veja a versão simples: ler seu prompt de 2.000 tokens (a fase de "prefill") processa todos os tokens simultaneamente pelos núcleos da GPU. Gerar 500 tokens de saída (a fase de "decode") roda um token por passo, cada um dependendo do anterior. A GPU fica quase ociosa esperando a largura de banda da memória entre os passos. Esse tempo ocioso é o que você paga a 3-5 vezes a taxa de entrada.
Overhead de infraestrutura
Energia, refrigeração, rede e as GPUs paradas entre as requisições. A documentação de otimização da Hugging Face cobre como o batching contínuo e a decodificação especulativa extraem mais tokens por GPU-hora do mesmo hardware, cortando diretamente essa fatia de overhead.
Quanto Custa a Inferência de LLM em 4 Workloads Reais?
Um chatbot de suporte típico custa US$ 9 a US$ 420 por mês, um pipeline RAG roda US$ 168 a US$ 3.360 por mês, um assistente de código para 200 desenvolvedores cobra US$ 123 a US$ 2.078 por mês, e o processamento de documentos em lote fica entre US$ 240 e US$ 6.400 por mês. A variação depende quase inteiramente da escolha do nível de modelo. Montamos esses quatro cenários a partir de volumes de tokens de deployments de clientes nossos, com preços das páginas oficiais de julho de 2026. Cada valor em dólar abaixo é reproduzível: premissas de tokens declaradas multiplicadas pelas taxas publicadas. Análise nossa, não alegações de fornecedores.
Chatbot de suporte ao cliente: 50 mil conversas por mês
Conversa média: 800 tokens de entrada (prompt de sistema + mensagens do usuário + contexto recuperado), 400 tokens de saída. Volume mensal: 50.000 conversas = 40 milhões de tokens de entrada, 20 milhões de tokens de saída.
- Opção econômica (Gemini 2.5 Flash): 40M × US$ 0,075/M + 20M × US$ 0,30/M = US$ 9/mês. Quase suspeitamente barato.
- Opção intermediária (Claude Sonnet 4): 40M × US$ 3/M + 20M × US$ 15/M = US$ 420/mês.
Para um bot de suporte que cuida de tickets de nível 1, o modelo econômico resolve 90% das consultas bem. Roteie os 10% difíceis para o intermediário com um classificador.
Pipeline RAG: 10 mil consultas por dia
Consulta média: 3.200 tokens de entrada (chunks recuperados + prompt de sistema + pergunta do usuário), 600 tokens de saída. Mensal: 300 mil consultas = 960 milhões de tokens de entrada, 180 milhões de tokens de saída.
- Opção econômica (Llama 4 Scout via API): 960M × US$ 0,10/M + 180M × US$ 0,40/M = US$ 168/mês.
- Opção intermediária (GPT-4.1): 960M × US$ 2/M + 180M × US$ 8/M = US$ 3.360/mês.
O workload RAG é pesado em entrada, então os descontos por cache de prompt pesam muito aqui. Com 70% de cache de prompt, o intermediário cai para cerca de US$ 2.100/mês.
Assistente de código: 200 desenvolvedores
Sessão média: 4.500 tokens de entrada (contexto de arquivo + conversa), 1.200 tokens de saída. Suponha 15 requisições/desenvolvedor/dia, 22 dias úteis = 66.000 requisições/mês = 297M de entrada, 79M de saída.
- Opção econômica (Qwen 3 32B): 297M × US$ 0,20/M + 79M × US$ 0,80/M = US$ 123/mês.
- Opção intermediária (Claude Sonnet 4): 297M × US$ 3/M + 79M × US$ 15/M = US$ 2.078/mês.
Desenvolvedores percebem diferenças de qualidade rápido. Para código, o intermediário costuma ser o piso. Modelos econômicos funcionam para sugestões estilo autocomplete, mas sofrem com refatorações multiarquivo.
Processamento de documentos em lote: 1 milhão de docs por mês
Documento médio: 2.000 tokens de entrada, 300 tokens de saída (extração, classificação, sumarização). Mensal: 2 bilhões de entrada, 300M de saída.
- Opção econômica (Gemini 2.5 Flash): 2B × US$ 0,075/M + 300M × US$ 0,30/M = US$ 240/mês.
- Opção intermediária (GPT-4.1): 2B × US$ 2/M + 300M × US$ 8/M = US$ 6.400/mês.
Nesse volume, a diferença de preço de 27x entre os níveis é uma linha de US$ 6.160/mês no orçamento. Modelos econômicos dão conta de extração estruturada bem. Para dimensionar o hardware se você considerar hospedar esse volume, confira os requisitos de VRAM por modelo.
| Workload | Modelo | Tokens/requisição (ent./saída) | Requisições/mês | US$/mês |
|---|---|---|---|---|
| Chatbot de suporte | Gemini 2.5 Flash | 800 / 400 | 50 mil | US$ 9 |
| Chatbot de suporte | Claude Sonnet 4 | 800 / 400 | 50 mil | US$ 420 |
| Pipeline RAG | Llama 4 Scout | 3.200 / 600 | 300 mil | US$ 168 |
| Pipeline RAG | GPT-4.1 | 3.200 / 600 | 300 mil | US$ 3.360 |
| Assistente de código | Qwen 3 32B | 4.500 / 1.200 | 66 mil | US$ 123 |
| Assistente de código | Claude Sonnet 4 | 4.500 / 1.200 | 66 mil | US$ 2.078 |
| Docs em lote | Gemini 2.5 Flash | 2.000 / 300 | 1M | US$ 240 |
| Docs em lote | GPT-4.1 | 2.000 / 300 | 1M | US$ 6.400 |
def monthly_cost(input_tokens, output_tokens, requests, price_in, price_out):
"""Estimate monthly LLM inference cost.
Args:
input_tokens: avg input tokens per request
output_tokens: avg output tokens per request
requests: monthly request volume
price_in: $/M input tokens
price_out: $/M output tokens
"""
total_in = input_tokens * requests / 1_000_000
total_out = output_tokens * requests / 1_000_000
return (total_in * price_in) + (total_out * price_out)
# Example: support chatbot on Claude Sonnet 4
cost = monthly_cost(
input_tokens=800,
output_tokens=400,
requests=50_000,
price_in=3.00,
price_out=15.00
)
print(f"${cost:,.2f}/month") # $420.00/monthAPI ou Self-Hosted: Quando Cada Um Vence?
A API vence abaixo de cerca de 20 mil requisições/dia ou quando sua equipe não tem experiência em infraestrutura de ML. O self-hosted vence acima de 200 mil requisições/dia com utilização sustentada de GPU acima de 50%. O ponto de equilíbrio, segundo a análise da Introl, fica em torno de 50-80 mil requisições/dia para um modelo de classe 70B em um único nó H100. Abaixo desse limite, a eficiência multitenant do provedor de API supera a conta do seu hardware single-tenant.
| Nível de volume | US$/mês via API | US$/mês self-hosted (GPU + ops) | Vencedor | Por quê |
|---|---|---|---|---|
| Baixo: 2 mil req/dia | US$ 150-US$ 400 | US$ 2.800-US$ 4.500 | API | A GPU fica ociosa 85% do tempo |
| Médio: 20 mil req/dia | US$ 1.500-US$ 4.000 | US$ 3.200-US$ 5.000 | API (por pouco) | Utilização chega a ~40%, ainda abaixo do equilíbrio |
| Alto: 200 mil req/dia | US$ 15.000-US$ 40.000 | US$ 5.500-US$ 8.000 | Self-hosted | Utilização de 70%+ amortiza o hardware rápido |
Quando a API vence
Você lança em dias, não semanas. Sem salário de engenheiro de ML (US$ 180 mil-US$ 250 mil/ano), sem plantão para falhas de GPU, sem planejamento de capacidade. Para a maioria das equipes com menos de 50 engenheiros, a API é o padrão correto. Ponto final.
Quando o self-hosted vence
Você passou de 200 mil requisições/dia, seu workload é previsível e você já emprega pessoas de infraestrutura de ML. Modelos open source (Llama 4, Qwen 3, Mistral) rodam no seu hardware pelo custo de eletricidade mais amortização. Os benchmarks de vLLM vs SGLang mostram diferenças de throughput de 15-30% conforme o formato do workload, o que importa nessa escala.
O número do ponto de equilíbrio
O self-hosted só vence acima de cerca de 50% de utilização sustentada de GPU. Abaixo disso, você está pagando por silício ocioso. Os custos ocultos de pessoal (tempo de engenheiro de ML, plantão, atualizações de modelo, patches de segurança) são a razão real pela qual a maioria das equipes fica na API mesmo quando a conta bruta de GPU parece favorável. Se você for hospedar por conta própria, fazer deploy de modelos no Modal remove a camada de gerenciamento de infraestrutura mantendo os custos por token abaixo das taxas de API.
Os Custos Ocultos Que Ninguém Coloca no Orçamento
O gasto bruto com tokens é 60-80% da sua conta real. O resto se esconde em seis linhas que nunca aparecem em uma calculadora de preços. Reserve 20-40% extras sobre sua estimativa de tokens para cobri-los.
- Ferramentas de monitoramento e observabilidade: US$ 200-US$ 1.500/mês. Dashboards de uso de tokens, rastreamento de latência, atribuição de custo por funcionalidade. Uma stack de observabilidade de LLM se paga na primeira vez que você pega uma regressão de prompt antes que ela queime seu orçamento.
- Retentativas e re-execuções por falha: 3-8% das requisições falham ou precisam de retry (timeouts, limites de taxa, saídas malformadas). Isso é 3-8% da sua conta de tokens, gasto sem produzir nada.
- Horas de iteração de engenharia de prompt: 20-60 horas por trimestre a US$ 100-US$ 200/hora de custo de engenharia carregado. Cada ajuste de prompt reexecuta lotes de teste.
- Testes de avaliação e regressão: US$ 100-US$ 800/mês em gasto de tokens para suítes de avaliação automatizadas. Você está pagando o modelo para se corrigir.
- Redundância multirregião: 1,5-2x o custo de infraestrutura se você precisar de failover entre regiões por latência ou conformidade.
- Penalidades de latência de cold start: Deployments de GPU serverless (Modal, AWS Lambda) cobram por tempo ocioso. Cold starts adicionam 2-8 segundos e cobram pelo aquecimento.
A regra prática: multiplique sua estimativa bruta de tokens por 1,3 para um orçamento realista. Multiplique por 1,4 se você está em um setor regulado com overhead de conformidade.
Por Que a Inferência de LLM Fica Cada Vez Mais Barata?
Os preços de inferência de LLM caíram cerca de 10x ao ano desde 2023. Um workload que custava US$ 1.000/mês em 2024 custa perto de US$ 100 hoje. Três forças impulsionam isso: melhorias de hardware (NVIDIA Blackwell FP4, Google TPU v6), pressão competitiva (DeepSeek, modelos open source forçando guerras de preços) e otimização de software (decodificação especulativa, batching contínuo, quantização). O Gartner projeta que os custos de inferência cairão outros 90% até 2030, embora isso seja uma projeção, não uma garantia.
O rastreamento de preços da Epoch AI documenta esse declínio com pontos de dados concretos. A análise de "LLMflation" da a16z cunhou o termo e enquadrou as implicações econômicas: a inferência está deflacionando mais rápido que qualquer categoria anterior de computação.
Custo de treinamento vs inferência
Treinar um modelo de fronteira custa US$ 50 milhões-US$ 200 milhões (uma vez). A inferência desse mesmo modelo, entre todos os usuários, custa US$ 5 milhões-US$ 50 milhões por ano, conforme a escala. Para a maioria das equipes, a proporção é de 10-100x: o treinamento custa 10-100 vezes o que um ano de inferência custa. Mas o treinamento é uma despesa de capital única. A inferência é a conta operacional recorrente que se acumula com o crescimento de usuários. Você não paga pelo treinamento a menos que esteja construindo um modelo de fundação. Você paga pela inferência todos os dias.
A linha de energia
Uma NVIDIA H100 consome cerca de 700W sob carga. A US$ 0,10/kWh (média dos EUA), isso é US$ 0,07 por GPU-hora. Um modelo de 70B em uma única H100 gera cerca de 2.000 tokens de saída/segundo em batch. Em uma hora: 7,2 milhões de tokens. Custo de eletricidade por milhão de tokens de saída: cerca de US$ 0,01. Nosso cálculo, identificado como tal. A energia é 1-3% da sua conta de API, mas 8-15% do TCO de self-hosting. Ela importa mais se você está rodando suas próprias GPUs em uma região de energia cara (a Alemanha, a US$ 0,30/kWh, triplica esse número).
O aprendizado prático: os preços estão caindo rápido o suficiente para que um compromisso de 12 meses com um nível específico de modelo seja arriscado. Reavalie trimestralmente. O guia 12 formas de cortar sua conta de LLM cobre movimentos táticos que você pode fazer agora, enquanto a tendência macro faz o trabalho pesado.
Como Estimar o SEU Custo de Inferência?
Estime seu custo de inferência de LLM mensal em quatro passos: conte os tokens por requisição, multiplique pelo volume mensal, aplique o preço do nível e some 20-40% de overhead. Na nossa experiência dimensionando orçamentos de inferência para clientes, a maioria das equipes pula o passo quatro e se pergunta por que a conta real supera a estimativa em um terço. Aqui está o processo que usamos.
- Conte os tokens por requisição. Registre sua média de tokens de entrada (prompt de sistema + contexto + mensagem do usuário) e tokens de saída (resposta do modelo) ao longo de 100+ requisições reais. Não chute. Meça.
- Multiplique pelo volume mensal. Requisições/dia × 30 = requisições mensais. Multiplique pelas suas contagens de tokens por requisição.
- Aplique o preço do nível. Multiplique o total de tokens de entrada pela taxa de US$/M de entrada do modelo. O mesmo para a saída. Some os dois.
- Some 20-40% de overhead. Retentativas, avaliações, iteração de prompt, monitoramento. Este é o número que vai no seu orçamento, não o passo 3.
def estimate_monthly_budget(avg_input_tokens, avg_output_tokens,
requests_per_day, price_in, price_out,
overhead_pct=0.30):
"""Full monthly budget estimate with overhead."""
monthly_requests = requests_per_day * 30
raw_cost = monthly_cost(
avg_input_tokens, avg_output_tokens,
monthly_requests, price_in, price_out
)
return raw_cost * (1 + overhead_pct)
# RAG pipeline: 10K queries/day on GPT-4.1
budget = estimate_monthly_budget(
avg_input_tokens=3200,
avg_output_tokens=600,
requests_per_day=10_000,
price_in=2.00,
price_out=8.00,
overhead_pct=0.30
)
print(f"${budget:,.0f}/month") # $4,368/monthQuando você souber seu número, as ferramentas de gateway de LLM roteiam o tráfego para o modelo mais barato que passa na sua barra de qualidade. Um gateway com seleção de modelo por requisição pode cortar seu custo combinado em 30-50% sem tocar nos seus prompts.
Sobre o autor
Mert Batur é cofundador da Techsy.io, onde a equipe entrega agentes de IA, sistemas de automação e pipelines de voz/SDR para clientes B2B. Ele escreve sobre a stack de ferramentas de LLM que a equipe da Techsy realmente usa em produção. Conecte-se no LinkedIn.
Perguntas frequentes
A inferência de LLM é cara?
Depende da escala e da escolha do modelo. Um milhão de tokens de entrada custa US$ 0,02 no Gemini 2.5 Flash ou US$ 75 em um modelo de raciocínio de fronteira. Para um app pequeno processando 10 mil requisições/dia, espere US$ 50-US$ 400/mês. Para workloads corporativos com 1M+ requisições/dia, os orçamentos ficam em US$ 5.000-US$ 40.000/mês. O custo unitário é baixo; o volume faz a conta crescer.
Quanto vale 1 milhão de tokens em um LLM?
Um milhão de tokens equivale a cerca de 750.000 palavras, ou uns 10 romances completos. Em julho de 2026, processar 1M de tokens de entrada custa US$ 0,02 (nível econômico) a US$ 75 (nível fronteira). Tokens de saída para o mesmo volume custam US$ 0,06 a US$ 300. A maioria dos workloads de produção fica no intermediário: US$ 2-US$ 15 por milhão de tokens de entrada.
Por que a inferência de IA é tão cara?
A inferência exige passar cada token por bilhões de parâmetros do modelo em GPUs que custam US$ 25.000-US$ 40.000 cada. A fase de decodificação gera tokens em sequência, deixando os núcleos da GPU ociosos entre os passos. Você está pagando por hardware especializado, eletricidade, refrigeração e a equipe de engenharia do provedor que mantém a stack de serviço funcionando 24/7.
Os custos de inferência de IA estão caindo?
Sim, cerca de 10x ao ano desde 2023. O GPT-4 foi lançado a US$ 30/US$ 60 por milhão de tokens (entrada/saída). Capacidade equivalente agora custa US$ 2-US$ 10. Os dados da Epoch AI confirmam essa trajetória em todos os provedores. O Gartner projeta outro declínio de 90% até 2030, impulsionado por melhorias de hardware e pressão competitiva de modelos open source.
Quanto custa a inferência de LLM em 2026?
Modelos econômicos: US$ 0,02-US$ 0,30 por milhão de tokens de entrada. Intermediário: US$ 0,55-US$ 15. Fronteira: US$ 15-US$ 75. Um workload de produção típico (chatbot de suporte, pipeline RAG ou assistente de código) custa US$ 150-US$ 4.000/mês em modelos intermediários. Modelos econômicos dão conta de tarefas de alto volume e baixa complexidade por 10-30x menos.
Qual a diferença entre custo de treinamento e custo de inferência?
O treinamento é a despesa única de ensinar um modelo do zero: US$ 50 milhões-US$ 200 milhões para um modelo de fronteira, exigindo milhares de GPUs por meses. A inferência é o custo recorrente de usar esse modelo treinado: passar entradas por ele para obter saídas, cobradas por token. Para a maioria das equipes, a inferência é a única conta que pagam. O treinamento é para empresas que constroem modelos de fundação.
Como calculo o custo de inferência de LLM para meu app?
Multiplique a média de tokens de entrada por requisição pelo seu volume mensal de requisições, depois pela taxa de US$/M de entrada do modelo. Repita para os tokens de saída. Some os dois. Some 30% para retentativas, avaliações e overhead de monitoramento. Os trechos de Python neste post automatizam a conta. Meça contagens reais de tokens em vez de chutar; logs de 100+ requisições dão uma média confiável.
Tokens de saída custam mais que tokens de entrada?
Sim, tipicamente 3-5x mais. O processamento de entrada (prefill) paraleliza entre todos os tokens simultaneamente, usando totalmente os núcleos da GPU. A geração de saída (decode) produz um token por vez, cada um dependendo do anterior. A GPU espera a largura de banda da memória entre os passos. Os provedores cobram mais pela saída para refletir essa menor eficiência de hardware.
A inferência self-hosted é mais barata que usar uma API?
Só acima de cerca de 200 mil requisições/dia com utilização sustentada de GPU acima de 50%. Abaixo disso, a eficiência multitenant dos provedores de API supera seu hardware single-tenant. O self-hosting também adiciona custos ocultos: salários de engenheiros de ML (US$ 180 mil-US$ 250 mil/ano), plantões, atualizações de modelo e patches de segurança. A maioria das equipes com menos de 50 engenheiros deve ficar na API.
A inferência de LLM consome muita energia?
Uma GPU H100 consome cerca de 700W sob carga. A US$ 0,10/kWh, isso é US$ 0,07/GPU-hora, o que se traduz em cerca de US$ 0,01 por milhão de tokens de saída para um modelo de 70B. A energia é 1-3% de uma conta de API, mas 8-15% do TCO de self-hosting. Em regiões de energia cara (Alemanha, US$ 0,30/kWh), a fatia de energia triplica e afeta materialmente a economia do self-hosting.
Resumo final
Quatro números para lembrar: US$ 0,02 (piso econômico por milhão de tokens de entrada), 3-5x (prêmio de saída sobre entrada), 20-40% (overhead para somar sobre a conta bruta de tokens) e 10x (declínio anual de preço desde 2023). Sua conta real depende do volume, do nível do modelo e de quão agressivamente você usa cache, batch e roteamento de tráfego.
Na Techsy, nossa equipe dimensiona orçamentos de inferência e escolhe níveis de modelo para clientes B2B rodando workloads de LLM em produção. Se você quer uma segunda opinião sobre seu modelo de custo, peça uma consulta gratuita.