
Monitoramento de Custos de LLM: Acompanhe os Gastos Antes do Pico (2026)
Monitoramento de custos de LLM é a diferença entre uma fatura surpresa de US$ 412 e uma notificação no Slack quando o orçamento chega a 80%. O Claude Sonnet 5 cobra US$ 3,00 por milhão de tokens de entrada este mês, e um único loop de agente fora de controle pode queimar isso em uma tarde. A maioria das equipes monta o rastreamento em um dia; o alerta é a parte que elas pulam.
Principais aprendizados:
- O monitoramento de custos de LLM anexa uma contagem de tokens e uma estimativa em dólares a cada requisição e depois agrega por modelo e equipe.
- Acompanhe cinco métricas: tokens por requisição, custo por funcionalidade/equipe/modelo, taxa de acerto de cache, custo por conversa e taxa de pico.
- Orçamentos no LiteLLM, traces no Langfuse ou Datadog LLM Observability: qualquer um deles dá visibilidade de gastos em menos de um dia.
- Dashboards mostram estimativas; preços de entrada em cache e descontos de batch fazem a fatura real quase sempre ficar abaixo delas.
O que o monitoramento de custos de LLM realmente rastreia?
Monitoramento de custos de LLM é a prática de anexar uma contagem de tokens e uma estimativa em dólares a cada requisição de LLM e agregar essas estimativas por modelo, funcionalidade e equipe, para que os gastos disparem um alerta antes da fatura chegar. A estimativa é calculada por requisição a partir dos preços públicos de tokens, consolidada pelas tags que você atribui a cada chamada e comparada com um orçamento definido com antecedência.
A matemática por trás disso é neutra em relação a fornecedor. A resposta de uso de qualquer provedor divide os tokens em campos, e a documentação de custos do Datadog descreve essas relações explicitamente. As convenções semânticas de GenAI da OpenTelemetry padronizam esses mesmos campos entre fornecedores, então um dashboard construído sobre elas não fica preso a um único provedor.
| Campo | O que conta | Cobrado como |
|---|---|---|
| input_tokens | Tudo o que você envia: prompt de sistema, histórico, contexto recuperado, a pergunta | Tarifa base de entrada |
| output_tokens | Tudo o que o modelo gera | Tarifa base de saída (3 a 6x a entrada) |
| cache_read_tokens | Entrada reutilizada de um cache anterior | 0,1x a 0,25x da entrada base |
| cache_write_tokens | Entrada gravada no cache pela primeira vez | ~1,25x da entrada base (TTL de 5 min na Anthropic) |
| reasoning_tokens | Cadeia de raciocínio interna, um subconjunto da saída | Tarifa de saída |
Três relações fazem a maior parte do trabalho: total de tokens = entrada + saída; entrada = sem cache + cache_read + cache_write; e os tokens de raciocínio ficam dentro da saída, cobrados pela tarifa de saída. Acerte essas contas e a estimativa por requisição permanece próxima da realidade; ignore-as e o dashboard se afasta da fatura todo mês. O monitoramento de custos é um pilar da observabilidade de IA; tracing e evals são os outros dois, e os três compartilham esse mesmo vocabulário de campos.
Seu dashboard mostra uma estimativa; a fatura é a única métrica de custo que nunca passa por cache.
Quanto custa 1 milhão de tokens em um LLM?
Depende do modelo e da direção: 1 milhão de tokens custa US$ 0,14 como entrada no DeepSeek-V4 e US$ 15,00 como saída no GPT-5.6 Terra, uma diferença de 100x para a mesma unidade. Aqui estão quatro modelos da nossa pesquisa de preços de 14 de julho de 2026, verificados nas páginas oficiais:
| Modelo | Entrada / 1M de tokens | Saída / 1M de tokens | Entrada em cache / 1M de tokens |
|---|---|---|---|
| Claude Sonnet 5 | US$ 3,00 | US$ 15,00 | US$ 0,30 |
| GPT-5.6 Terra | US$ 2,50 | US$ 15,00 | US$ 0,25 |
| Gemini 2.5 Pro | US$ 1,25 | US$ 10,00 | US$ 0,31 |
| DeepSeek-V4 | US$ 0,14 | US$ 0,28 | US$ 0,003 |
Fontes: preços da OpenAI e preços da Anthropic. Uma observação: o Claude Sonnet 5 tem preço promocional de US$ 2,00 na entrada / US$ 10,00 na saída até 31 de agosto de 2026; depois volta aos valores acima.
As 5 métricas que realmente importam
Cinco métricas cobrem o controle de custos de LLM, e a maioria das equipes só configura alertas para duas delas. Comece pelas duas primeiras linhas: tokens por requisição pega o inchaço de prompts no dia em que ele aparece, e o custo por equipe é o número que o financeiro uma hora vai pedir. As outras três refinam o quadro depois que essas duas estiverem rodando.
| Métrica | Como calcular | Por que importa | Limite de alerta |
|---|---|---|---|
| Tokens por requisição | Some entrada + saída por chamada, agrupe por funcionalidade | Inchaço de prompt e excesso de contexto aparecem aqui primeiro | +30% sobre a mediana de 7 dias |
| Custo por funcionalidade / equipe / modelo | Some o custo estimado, agrupe por tag ou chave virtual | A base para chargeback e para os orçamentos de verdade | 80% do orçamento mensal |
| Taxa de acerto de cache | cache_read / total de tokens de entrada | Taxas baixas significam preço cheio para prompts repetidos | Abaixo de 50% com tráfego estável |
| Custo por conversa / sessão | Some o custo de todos os turnos de uma sessão | Revela agentes multi-turno fora de controle que a visão por requisição não pega | 2x a sessão do percentil 90 |
| Taxa de pico / anomalia | Variação diária do gasto total | A única métrica que pega um loop quebrado antes da fatura | +50% de um dia para o outro |
Uma nota sobre granularidade: o Datadog armazena o custo por requisição em nanodólares (bilionésimos de dólar), segundo sua documentação de custos. A US$ 0,14 por milhão de tokens, uma única requisição ao DeepSeek-V4 pode custar menos de um milésimo de centavo, então agregue antes de arredondar, ou o tráfego dos modelos pequenos desaparece do relatório.
Se não for acompanhar mais nada, acompanhe as linhas um e dois. Tokens por requisição é o aviso mais precoce que existe; custo por equipe é o número que sobrevive ao contato com o departamento contábil.
Três formas de implementar o monitoramento de custos de LLM
Nenhuma das páginas mais bem ranqueadas para essa busca entrega uma única linha de código executável, então aqui vão três configurações que funcionam de verdade. Cada uma entra em produção em menos de um dia, e elas se combinam: nós rodamos as duas primeiras juntas.
O que rodamos em produção: na nossa configuração, cada agente de cliente fala com o proxy LiteLLM por meio da sua própria chave virtual, com um orçamento mensal em cada chave e o Langfuse rastreando cada requisição atrás do proxy. Quando colocamos os dois no ar juntos, a divisão de trabalho era o ponto principal: o proxy aplica os limites, e os traces explicam o que os consumiu. Cada uma das nossas chaves de cliente também carrega um tpm_limit de 100.000 tokens por minuto como um segundo fusível; pela documentação do LiteLLM, o proxy rejeita requisições quando um limite é atingido, e é nesse comportamento documentado que confiamos, não em um benchmark que medimos por conta própria. Nossa configuração pula inteiramente o LiteLLM 1.82.7 e o 1.82.8, as duas versões envolvidas no incidente de cadeia de suprimentos de março de 2026, e fixa a tag da imagem em vez de flutuar na latest.
Proxy LiteLLM: chaves virtuais + orçamentos
A Techsy roda uma configuração de proxy LiteLLM em produção com uma chave virtual por cliente e um orçamento mensal em cada chave. A requisição abaixo é o formato documentado na documentação de virtual_keys do LiteLLM: por essa documentação, quando o gasto acumulado dessa chave ultrapassa US$ 50 em um mês, o proxy rejeita novas requisições com um erro de orçamento excedido, em vez de registrar um aviso depois do fato.
curl -X POST http://localhost:4000/key/generate \
-H "Authorization: Bearer $LITELLM_MASTER_KEY" \
-H "Content-Type: application/json" \
-d '{
"key_alias": "client-acme-search",
"max_budget": 50.0,
"budget_duration": "monthly",
"tpm_limit": 100000,
"models": ["anthropic/claude-sonnet-4-5"]
}'Faça as contas com os preços públicos: a US$ 3,00 / US$ 15,00 por milhão de tokens no Claude Sonnet 5, US$ 50 compram cerca de 16,7M de tokens de entrada ou 3,3M de tokens de saída, mais ou menos uma semana de tráfego para um dos nossos agentes de cliente mais leves. É exatamente o raio de impacto que queremos. O tpm_limit é o segundo fusível: um loop fora de controle estoura os 100K tokens por minuto muito antes de estourar o orçamento mensal. A atribuição por usuário funciona do mesmo jeito pelo endpoint de usuários, e o nosso guia das melhores ferramentas de gateway de LLM cobre quando um proxy vale o lugar dele e quando é só mais um salto na rede.
Langfuse: rastreamento de custos com @observe
O autocompletar do Google junta "langfuse monitoring" com essa busca, e por um bom motivo: o Langfuse é o padrão de tracing open source. O SDK de Python dele envolve o cliente do seu provedor para que cada chamada vire um trace com a contagem de tokens e o custo calculado, segundo a documentação de tracing do Langfuse:
# pip install langfuse openai
from langfuse import observe
from langfuse.openai import openai # drop-in wrapper, auto-traces
@observe()
def answer(question: str):
return openai.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": question}],
)
answer("what is llm cost monitoring")
# the trace now carries usage.total_tokens and total_cost,
# priced from Langfuse's model price cardsO custo aparece no trace sem nenhuma conta de tokens da sua parte; agrupe traces por sessão ou id de usuário para consolidações por funcionalidade e faça self-host se os dados não puderem sair da sua rede.
Datadog LLM Observability: se você já usa
Se a sua equipe já usa agentes do Datadog, a documentação de custos de LLM dele é a referência individual mais completa desta página: custo por requisição em nanodólares, cost_tags customizadas para quebrar por equipe e funcionalidade e uma seção real de troubleshooting para lacunas de custo parcial. O limite honesto: só funciona no Datadog. As métricas não saem da plataforma, e não existe alternativa open source se o preço deixar de caber. Escolha pela consolidação, não pela flexibilidade.
Como configurar orçamentos, alertas e chargeback?
Você configura em três camadas: um teto de orçamento que rejeita requisições no limite, um alerta de webhook que dispara em um percentual antes do teto e chaves virtuais por equipe que transformam showback e chargeback em uma query, não em uma discussão. O LiteLLM entrega os três nativamente; os padrões se transferem para qualquer gateway com orçamentos por chave.
Um orçamento que só conta é um relatório; um orçamento que rejeita requisições no teto é um controle.
Alertas que disparam antes do pico
Configure o alerta em 80% do teto, não em 100%. O LiteLLM já vem com alertas de Slack embutidos: defina alerting: ["slack"] e alerting_threshold: 80 em general_settings, aponte a variável de ambiente SLACK_WEBHOOK_URL para um canal, e uma mensagem como esta chega quando uma chave cruza o limite:
{
"text": "LLM budget alert: client-acme-search spent $40.18 of its $50.00 monthly cap (80.4%). Top model: anthropic/claude-sonnet-4-5."
}Em 80%, um humano ainda tem dias para agir: rebaixar o modelo, enxugar o prompt ou aumentar o teto com o nome de alguém na aprovação. Um alerta em 100% é uma autópsia.
Do showback ao chargeback
Showback significa que cada equipe vê o próprio gasto; chargeback significa que ele sai do orçamento dela. Os dois dependem de um único ingrediente: uma chave virtual por equipe, com tag no momento da criação. O relatório mensal vira então um group-by sobre a tabela de gastos:
| Equipe | Orçamento mensal | Gasto até agora | Status |
|---|---|---|---|
| search | US$ 50 | US$ 40,18 | alerta disparado em 80% |
| support-chat | US$ 200 | US$ 112,40 | dentro do previsto |
| evals-batch | US$ 30 | US$ 29,97 | teto atingido, rejeitando |
| sandbox | US$ 10 | US$ 1,06 | dentro do previsto |
Formato de exemplo, não dados de cliente. A linha evals-batch é o padrão funcionando como deveria: o trabalho em batch rodou até o teto e parou, em vez de sangrar silenciosamente para a fatura. O comportamento de aplicação está documentado na documentação de virtual_keys do LiteLLM, incluindo como a duração do orçamento é reiniciada.
Por que seu dashboard diverge da fatura?
Porque dashboards cobram pelo preço de tabela, enquanto as faturas aplicam descontos que o seu monitoramento nunca vê. Entrada em cache sai por 0,1x a 0,25x do preço base, execuções em batch pela metade, e tokens de raciocínio são cobrados pela tarifa de saída dentro da contagem de saída. Quando os dois números divergem, a fatura costuma ser o menor deles, e a diferença quase sempre vem de um de quatro modificadores.
| Modificador de preço | Multiplicador típico | Efeito na sua estimativa |
|---|---|---|
| Entrada em cache (cache read) | 0,1x a 0,25x da entrada base | O dashboard fica alto se cobrar acertos de cache a preço cheio |
| API Batch | 0,5x na entrada e na saída | Trabalhos assíncronos custam metade do número rastreado |
| Tokens de raciocínio | 1x a tarifa de saída, contados dentro da saída | Cadeias longas de raciocínio queimam o orçamento de saída em silêncio |
| Gravação de cache | ~1,25x da entrada base | A primeira requisição de uma janela de cache custa um pouco mais |
O catálogo aberto pydantic/genai-prices mostra por que esses multiplicadores variam por modelo: cada provedor define os próprios fatores de cache e batch, então uma tabela de preços fixa sai da realidade no dia em que um provedor revisa os valores. A documentação de custos do Datadog cobre a outra metade do problema: lacunas de custo parcial, em que um campo de token ausente retorna COST UNAVAILABLE para uma requisição. Olhe ali quando o dashboard marcar menos que a fatura; olhe a tabela de descontos quando marcar mais. O mecanismo por trás do maior multiplicador é o cache de prompts de LLM, e uma taxa alta de acerto de cache é o motivo mais comum para uma estimativa rastreada ficar acima da fatura real.
Uma estimativa de custo sem os descontos de cache e de batch é um teto, não uma previsão.
Quais ferramentas realmente fazem o controle de custos de LLM?
Seis ferramentas cobrem a maioria das configurações de produção: Langfuse, LiteLLM, Helicone e Portkey do lado open source e de gateway, Datadog e Braintrust do lado comercial. A divisão honesta é aplicação versus observabilidade: um proxy consegue rejeitar requisições no orçamento, enquanto uma ferramenta de tracing mede o gasto depois do fato. A maioria das stacks maduras acaba com uma de cada.
| Ferramenta | Tipo | Abordagem de controle de custos | Plano gratuito | Escolha se... |
|---|---|---|---|---|
| Langfuse | Open source | Custo por trace a partir de cartões de preço de modelos, self-host possível | Self-host gratuito; plano hobby grátis na nuvem | Você quer open source e controle dos dados |
| LiteLLM | Proxy open source | Orçamentos por chave e equipe aplicados no gateway | Gratuito (OSS); enterprise pago | Você precisa de orçamentos que rejeitem requisições, não só contem |
| Helicone | Gateway open source | Logs de custo no nível do proxy, por chave e modelo | Plano gratuito com limites de taxa | Você quer trocar o proxy com uma linha, sem mexer no SDK |
| Portkey | Gateway comercial | Orçamentos por chave virtual e análise de custos | Plano gratuito para desenvolvedores | Você quer gateway, prompts e evals em um só painel |
| Datadog LLM Observability | Comercial | Métricas de requisição em nanodólares e cost_tags | Teste de 14 dias | Você já usa Datadog para todo o resto |
| Braintrust | Comercial | Gasto vinculado a evals, por projeto | Plano gratuito | Seu trabalho de custos começa nos evals, não nas faturas |
Uma ressalva sobre conteúdo de fornecedores nessa área: a própria comparação de ferramentas de controle de custos que a Braintrust publicou em 2026 coloca a si mesma em primeiro lugar e omite todas as opções open source da tabela acima. Leia os listicles de fornecedores pelos dados, não pelo ranking.
Para uma equipe começando do zero, nós rodaríamos o LiteLLM na frente e o Langfuse atrás: o proxy aplica os orçamentos, os traces os explicam, e a dupla não custa nada até você passar para os planos hospedados. Se você está pesando os dois padrões de tracing, nossa análise Langfuse vs Langsmith detalha essa escolha a fundo, e o roundup das melhores plataformas de observabilidade de IA cobre o campo inteiro.
Do monitoramento ao corte de custos
O monitoramento mostra para onde o dinheiro vai; o passo seguinte é decidir quanto vai para lá. As três alavancas, em ordem de retorno: fazer cache de entradas repetidas, rotear requisições fáceis para modelos mais baratos e reduzir o porte do modelo onde a qualidade ainda se sustenta. Nosso guia de como reduzir custos de API de LLM cobre cada alavanca, e a comparação de preços de APIs de LLM é a base de toda a conta acima.
Nossa perspectiva: quando o gasto de LLM de um cliente o surpreende, monitoramos primeiro e cortamos depois, nunca o inverso. Equipes que fazem cache antes de medir acabam fazendo cache dos prompts errados. O monitoramento diz para onde o dinheiro vai; cache e roteamento decidem quanto vai para lá. Se a sua fatura já está doendo, agende uma consulta gratuita e olhamos os números com você.
Sobre o autor
Mert Batur é cofundador da Techsy.io, onde a equipe entrega agentes de IA, sistemas de automação e pipelines de voz/SDR para clientes B2B. Ele escreve sobre a stack de ferramentas de LLM que o time da Techsy realmente usa em produção. Conecte-se no LinkedIn.
Perguntas frequentes
Quanto custa 1 milhão de tokens em um LLM?
No preço de tabela, de US$ 0,14 a US$ 15 por milhão, dependendo do modelo e da direção: a entrada do DeepSeek-V4 custa US$ 0,14 por milhão, enquanto a saída do GPT-5.6 Terra custa US$ 15. Tokens de saída custam de 3 a 6 vezes a tarifa de entrada em todos os grandes provedores. A tabela da primeira seção tem quatro modelos, e a nossa comparação de preços de APIs de LLM cobre os dezessete, verificada nas páginas da OpenAI e da Anthropic em julho de 2026.
O que é otimização de custos de LLM?
A prática de reduzir o custo por requisição sem perder qualidade: cache de prompts para entradas repetidas, roteamento de tarefas fáceis para modelos mais baratos, APIs batch para trabalho assíncrono e ajuste do porte do modelo por funcionalidade. O monitoramento de custos de LLM é o pré-requisito, já que você não otimiza o que não atribuiu. Taxa de acerto de cache e custo por funcionalidade são as duas métricas que apontam primeiro para as maiores alavancas.
Por que os LLMs são tão caros?
A inferência é limitada por computação: cada token gerado executa um forward pass completo do modelo em GPUs, e modelos de raciocínio gastam tokens extras pensando antes de responder, cobrados pelas tarifas de saída. Prompts de sistema longos multiplicam esse custo em cada requisição. A fatura cresce com a verbosidade dos dois lados da chamada, e é por isso que tokens por requisição é a primeira métrica que vale acompanhar.
Quanto custa um LLM nos EUA?
Os preços de API são em dólar e globais: OpenAI, Anthropic e Google cobram o mesmo preço de tabela por milhão de tokens, quer a requisição parta de Ohio ou de Osaka. As diferenças regionais aparecem no self-hosting, onde as horas de GPU variam por região de nuvem, e nas plataformas hospedadas que adicionam margem. Para trabalho via API, a localização muda a latência, não o preço.
Como rastreio custos de LLM por equipe?
Emita uma chave virtual por equipe por meio de um proxy como o LiteLLM, dê a cada chave a tag do nome da equipe no momento da criação e agregue os gastos por essa tag. Cada requisição já nasce com atribuição, sem precisar analisar logs. A tabela de showback da seção de orçamentos acima é o produto final: equipe, orçamento mensal, gasto até agora, status.
Langfuse vs Datadog para controle de custos de LLM: qual escolher?
Escolha o Langfuse se você quer open source, self-hosting e dados sob seu controle; rodar é grátis e ele rastreia o custo por requisição desde o início. Escolha o Datadog só se a sua equipe já o usa para infraestrutura, já que os recursos de custos de LLM dele não saem da plataforma. Para a maioria das equipes começando do zero, Langfuse mais um proxy LiteLLM supera qualquer uma das opções sozinha.
Os custos estimados de LLM batem com a fatura real?
Não, e em geral a fatura é menor. Dashboards cobram pelo preço de tabela, enquanto entrada em cache sai por 0,1x a 0,25x e trabalhos batch por 0,5x, então uma carga de trabalho com muito cache vê a fatura real ficar bem abaixo da estimativa rastreada. Campos de token ausentes empurram o erro para o outro lado. A tabela de divergências acima lista cada multiplicador e onde procurar.
Como configuro alertas para picos de gastos com LLM?
Configure um alerta de limite em 80% do orçamento mensal de cada equipe, entregue no Slack por webhook, mais um alerta de anomalia dia a dia em +50% para loops que queimam rápido. O LiteLLM entrega o padrão de limite nativamente pela configuração alerting_threshold. Um alerta em 80% deixa dias para reagir; um alerta em 100% só confirma que o teto fez o trabalho dele.
Existe algum rastreador gratuito de custos de LLM?
Sim, três confiáveis. O Langfuse self-hosted é gratuito e open source, com um plano hobby grátis na nuvem segundo a página de preços do Langfuse. Os orçamentos de chave embutidos do LiteLLM não custam nada no proxy open source. O plano gratuito do Helicone cobre logs de custo no nível do proxy com limites de taxa. Planos gratuitos cobrem o monitoramento; aplicação de limites e alertas em escala é onde começam os planos pagos.
Conclusão
Escolha um caminho de configuração hoje, porque o alerta que você vai querer daqui a seis semanas leva uma tarde para configurar agora. A versão curta:
- Acompanhe primeiro tokens por requisição e custo por equipe; adicione as outras três métricas quando essas estiverem funcionando.
- Um orçamento que rejeita requisições é um controle; um que só conta é um relatório.
- Configure o alerta em 80%, no Slack, antes que a fatura surpreenda alguém.
- Seu dashboard é uma estimativa; preços de cache e de batch fazem a fatura quase sempre ficar abaixo dela.
Se você prefere ter alguém olhando os números com você, agende uma consulta gratuita.