ai-machine-learning

Monitoramento de Custos de LLM: Acompanhe os Gastos Antes do Pico (2026)

Escrito por Mert Batur
Atualizado Jul 31, 2026
16 min de leitura
Monitoramento de Custos de LLM: Acompanhe os Gastos Antes do Pico (2026)

Monitoramento de Custos de LLM: Acompanhe os Gastos Antes do Pico (2026)

Monitoramento de custos de LLM é a diferença entre uma fatura surpresa de US$ 412 e uma notificação no Slack quando o orçamento chega a 80%. O Claude Sonnet 5 cobra US$ 3,00 por milhão de tokens de entrada este mês, e um único loop de agente fora de controle pode queimar isso em uma tarde. A maioria das equipes monta o rastreamento em um dia; o alerta é a parte que elas pulam.

Principais aprendizados:

  • O monitoramento de custos de LLM anexa uma contagem de tokens e uma estimativa em dólares a cada requisição e depois agrega por modelo e equipe.
  • Acompanhe cinco métricas: tokens por requisição, custo por funcionalidade/equipe/modelo, taxa de acerto de cache, custo por conversa e taxa de pico.
  • Orçamentos no LiteLLM, traces no Langfuse ou Datadog LLM Observability: qualquer um deles dá visibilidade de gastos em menos de um dia.
  • Dashboards mostram estimativas; preços de entrada em cache e descontos de batch fazem a fatura real quase sempre ficar abaixo delas.

O que o monitoramento de custos de LLM realmente rastreia?

Monitoramento de custos de LLM é a prática de anexar uma contagem de tokens e uma estimativa em dólares a cada requisição de LLM e agregar essas estimativas por modelo, funcionalidade e equipe, para que os gastos disparem um alerta antes da fatura chegar. A estimativa é calculada por requisição a partir dos preços públicos de tokens, consolidada pelas tags que você atribui a cada chamada e comparada com um orçamento definido com antecedência.

A matemática por trás disso é neutra em relação a fornecedor. A resposta de uso de qualquer provedor divide os tokens em campos, e a documentação de custos do Datadog descreve essas relações explicitamente. As convenções semânticas de GenAI da OpenTelemetry padronizam esses mesmos campos entre fornecedores, então um dashboard construído sobre elas não fica preso a um único provedor.

CampoO que contaCobrado como
input_tokensTudo o que você envia: prompt de sistema, histórico, contexto recuperado, a perguntaTarifa base de entrada
output_tokensTudo o que o modelo geraTarifa base de saída (3 a 6x a entrada)
cache_read_tokensEntrada reutilizada de um cache anterior0,1x a 0,25x da entrada base
cache_write_tokensEntrada gravada no cache pela primeira vez~1,25x da entrada base (TTL de 5 min na Anthropic)
reasoning_tokensCadeia de raciocínio interna, um subconjunto da saídaTarifa de saída

Três relações fazem a maior parte do trabalho: total de tokens = entrada + saída; entrada = sem cache + cache_read + cache_write; e os tokens de raciocínio ficam dentro da saída, cobrados pela tarifa de saída. Acerte essas contas e a estimativa por requisição permanece próxima da realidade; ignore-as e o dashboard se afasta da fatura todo mês. O monitoramento de custos é um pilar da observabilidade de IA; tracing e evals são os outros dois, e os três compartilham esse mesmo vocabulário de campos.

Seu dashboard mostra uma estimativa; a fatura é a única métrica de custo que nunca passa por cache.

Quanto custa 1 milhão de tokens em um LLM?

Depende do modelo e da direção: 1 milhão de tokens custa US$ 0,14 como entrada no DeepSeek-V4 e US$ 15,00 como saída no GPT-5.6 Terra, uma diferença de 100x para a mesma unidade. Aqui estão quatro modelos da nossa pesquisa de preços de 14 de julho de 2026, verificados nas páginas oficiais:

ModeloEntrada / 1M de tokensSaída / 1M de tokensEntrada em cache / 1M de tokens
Claude Sonnet 5US$ 3,00US$ 15,00US$ 0,30
GPT-5.6 TerraUS$ 2,50US$ 15,00US$ 0,25
Gemini 2.5 ProUS$ 1,25US$ 10,00US$ 0,31
DeepSeek-V4US$ 0,14US$ 0,28US$ 0,003

Fontes: preços da OpenAI e preços da Anthropic. Uma observação: o Claude Sonnet 5 tem preço promocional de US$ 2,00 na entrada / US$ 10,00 na saída até 31 de agosto de 2026; depois volta aos valores acima.

As 5 métricas que realmente importam

Cinco métricas cobrem o controle de custos de LLM, e a maioria das equipes só configura alertas para duas delas. Comece pelas duas primeiras linhas: tokens por requisição pega o inchaço de prompts no dia em que ele aparece, e o custo por equipe é o número que o financeiro uma hora vai pedir. As outras três refinam o quadro depois que essas duas estiverem rodando.

MétricaComo calcularPor que importaLimite de alerta
Tokens por requisiçãoSome entrada + saída por chamada, agrupe por funcionalidadeInchaço de prompt e excesso de contexto aparecem aqui primeiro+30% sobre a mediana de 7 dias
Custo por funcionalidade / equipe / modeloSome o custo estimado, agrupe por tag ou chave virtualA base para chargeback e para os orçamentos de verdade80% do orçamento mensal
Taxa de acerto de cachecache_read / total de tokens de entradaTaxas baixas significam preço cheio para prompts repetidosAbaixo de 50% com tráfego estável
Custo por conversa / sessãoSome o custo de todos os turnos de uma sessãoRevela agentes multi-turno fora de controle que a visão por requisição não pega2x a sessão do percentil 90
Taxa de pico / anomaliaVariação diária do gasto totalA única métrica que pega um loop quebrado antes da fatura+50% de um dia para o outro

Uma nota sobre granularidade: o Datadog armazena o custo por requisição em nanodólares (bilionésimos de dólar), segundo sua documentação de custos. A US$ 0,14 por milhão de tokens, uma única requisição ao DeepSeek-V4 pode custar menos de um milésimo de centavo, então agregue antes de arredondar, ou o tráfego dos modelos pequenos desaparece do relatório.

Se não for acompanhar mais nada, acompanhe as linhas um e dois. Tokens por requisição é o aviso mais precoce que existe; custo por equipe é o número que sobrevive ao contato com o departamento contábil.

Três formas de implementar o monitoramento de custos de LLM

Nenhuma das páginas mais bem ranqueadas para essa busca entrega uma única linha de código executável, então aqui vão três configurações que funcionam de verdade. Cada uma entra em produção em menos de um dia, e elas se combinam: nós rodamos as duas primeiras juntas.

O que rodamos em produção: na nossa configuração, cada agente de cliente fala com o proxy LiteLLM por meio da sua própria chave virtual, com um orçamento mensal em cada chave e o Langfuse rastreando cada requisição atrás do proxy. Quando colocamos os dois no ar juntos, a divisão de trabalho era o ponto principal: o proxy aplica os limites, e os traces explicam o que os consumiu. Cada uma das nossas chaves de cliente também carrega um tpm_limit de 100.000 tokens por minuto como um segundo fusível; pela documentação do LiteLLM, o proxy rejeita requisições quando um limite é atingido, e é nesse comportamento documentado que confiamos, não em um benchmark que medimos por conta própria. Nossa configuração pula inteiramente o LiteLLM 1.82.7 e o 1.82.8, as duas versões envolvidas no incidente de cadeia de suprimentos de março de 2026, e fixa a tag da imagem em vez de flutuar na latest.

Proxy LiteLLM: chaves virtuais + orçamentos

A Techsy roda uma configuração de proxy LiteLLM em produção com uma chave virtual por cliente e um orçamento mensal em cada chave. A requisição abaixo é o formato documentado na documentação de virtual_keys do LiteLLM: por essa documentação, quando o gasto acumulado dessa chave ultrapassa US$ 50 em um mês, o proxy rejeita novas requisições com um erro de orçamento excedido, em vez de registrar um aviso depois do fato.

bash
curl -X POST http://localhost:4000/key/generate \
  -H "Authorization: Bearer $LITELLM_MASTER_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "key_alias": "client-acme-search",
    "max_budget": 50.0,
    "budget_duration": "monthly",
    "tpm_limit": 100000,
    "models": ["anthropic/claude-sonnet-4-5"]
  }'

Faça as contas com os preços públicos: a US$ 3,00 / US$ 15,00 por milhão de tokens no Claude Sonnet 5, US$ 50 compram cerca de 16,7M de tokens de entrada ou 3,3M de tokens de saída, mais ou menos uma semana de tráfego para um dos nossos agentes de cliente mais leves. É exatamente o raio de impacto que queremos. O tpm_limit é o segundo fusível: um loop fora de controle estoura os 100K tokens por minuto muito antes de estourar o orçamento mensal. A atribuição por usuário funciona do mesmo jeito pelo endpoint de usuários, e o nosso guia das melhores ferramentas de gateway de LLM cobre quando um proxy vale o lugar dele e quando é só mais um salto na rede.

Langfuse: rastreamento de custos com @observe

O autocompletar do Google junta "langfuse monitoring" com essa busca, e por um bom motivo: o Langfuse é o padrão de tracing open source. O SDK de Python dele envolve o cliente do seu provedor para que cada chamada vire um trace com a contagem de tokens e o custo calculado, segundo a documentação de tracing do Langfuse:

python
# pip install langfuse openai
from langfuse import observe
from langfuse.openai import openai  # drop-in wrapper, auto-traces

@observe()
def answer(question: str):
    return openai.chat.completions.create(
        model="gpt-4o-mini",
        messages=[{"role": "user", "content": question}],
    )

answer("what is llm cost monitoring")
# the trace now carries usage.total_tokens and total_cost,
# priced from Langfuse's model price cards

O custo aparece no trace sem nenhuma conta de tokens da sua parte; agrupe traces por sessão ou id de usuário para consolidações por funcionalidade e faça self-host se os dados não puderem sair da sua rede.

Datadog LLM Observability: se você já usa

Se a sua equipe já usa agentes do Datadog, a documentação de custos de LLM dele é a referência individual mais completa desta página: custo por requisição em nanodólares, cost_tags customizadas para quebrar por equipe e funcionalidade e uma seção real de troubleshooting para lacunas de custo parcial. O limite honesto: só funciona no Datadog. As métricas não saem da plataforma, e não existe alternativa open source se o preço deixar de caber. Escolha pela consolidação, não pela flexibilidade.

Como configurar orçamentos, alertas e chargeback?

Você configura em três camadas: um teto de orçamento que rejeita requisições no limite, um alerta de webhook que dispara em um percentual antes do teto e chaves virtuais por equipe que transformam showback e chargeback em uma query, não em uma discussão. O LiteLLM entrega os três nativamente; os padrões se transferem para qualquer gateway com orçamentos por chave.

Um orçamento que só conta é um relatório; um orçamento que rejeita requisições no teto é um controle.

Alertas que disparam antes do pico

Configure o alerta em 80% do teto, não em 100%. O LiteLLM já vem com alertas de Slack embutidos: defina alerting: ["slack"] e alerting_threshold: 80 em general_settings, aponte a variável de ambiente SLACK_WEBHOOK_URL para um canal, e uma mensagem como esta chega quando uma chave cruza o limite:

json
{
  "text": "LLM budget alert: client-acme-search spent $40.18 of its $50.00 monthly cap (80.4%). Top model: anthropic/claude-sonnet-4-5."
}

Em 80%, um humano ainda tem dias para agir: rebaixar o modelo, enxugar o prompt ou aumentar o teto com o nome de alguém na aprovação. Um alerta em 100% é uma autópsia.

Do showback ao chargeback

Showback significa que cada equipe vê o próprio gasto; chargeback significa que ele sai do orçamento dela. Os dois dependem de um único ingrediente: uma chave virtual por equipe, com tag no momento da criação. O relatório mensal vira então um group-by sobre a tabela de gastos:

EquipeOrçamento mensalGasto até agoraStatus
searchUS$ 50US$ 40,18alerta disparado em 80%
support-chatUS$ 200US$ 112,40dentro do previsto
evals-batchUS$ 30US$ 29,97teto atingido, rejeitando
sandboxUS$ 10US$ 1,06dentro do previsto

Formato de exemplo, não dados de cliente. A linha evals-batch é o padrão funcionando como deveria: o trabalho em batch rodou até o teto e parou, em vez de sangrar silenciosamente para a fatura. O comportamento de aplicação está documentado na documentação de virtual_keys do LiteLLM, incluindo como a duração do orçamento é reiniciada.

Por que seu dashboard diverge da fatura?

Porque dashboards cobram pelo preço de tabela, enquanto as faturas aplicam descontos que o seu monitoramento nunca vê. Entrada em cache sai por 0,1x a 0,25x do preço base, execuções em batch pela metade, e tokens de raciocínio são cobrados pela tarifa de saída dentro da contagem de saída. Quando os dois números divergem, a fatura costuma ser o menor deles, e a diferença quase sempre vem de um de quatro modificadores.

Modificador de preçoMultiplicador típicoEfeito na sua estimativa
Entrada em cache (cache read)0,1x a 0,25x da entrada baseO dashboard fica alto se cobrar acertos de cache a preço cheio
API Batch0,5x na entrada e na saídaTrabalhos assíncronos custam metade do número rastreado
Tokens de raciocínio1x a tarifa de saída, contados dentro da saídaCadeias longas de raciocínio queimam o orçamento de saída em silêncio
Gravação de cache~1,25x da entrada baseA primeira requisição de uma janela de cache custa um pouco mais

O catálogo aberto pydantic/genai-prices mostra por que esses multiplicadores variam por modelo: cada provedor define os próprios fatores de cache e batch, então uma tabela de preços fixa sai da realidade no dia em que um provedor revisa os valores. A documentação de custos do Datadog cobre a outra metade do problema: lacunas de custo parcial, em que um campo de token ausente retorna COST UNAVAILABLE para uma requisição. Olhe ali quando o dashboard marcar menos que a fatura; olhe a tabela de descontos quando marcar mais. O mecanismo por trás do maior multiplicador é o cache de prompts de LLM, e uma taxa alta de acerto de cache é o motivo mais comum para uma estimativa rastreada ficar acima da fatura real.

Uma estimativa de custo sem os descontos de cache e de batch é um teto, não uma previsão.

Quais ferramentas realmente fazem o controle de custos de LLM?

Seis ferramentas cobrem a maioria das configurações de produção: Langfuse, LiteLLM, Helicone e Portkey do lado open source e de gateway, Datadog e Braintrust do lado comercial. A divisão honesta é aplicação versus observabilidade: um proxy consegue rejeitar requisições no orçamento, enquanto uma ferramenta de tracing mede o gasto depois do fato. A maioria das stacks maduras acaba com uma de cada.

FerramentaTipoAbordagem de controle de custosPlano gratuitoEscolha se...
LangfuseOpen sourceCusto por trace a partir de cartões de preço de modelos, self-host possívelSelf-host gratuito; plano hobby grátis na nuvemVocê quer open source e controle dos dados
LiteLLMProxy open sourceOrçamentos por chave e equipe aplicados no gatewayGratuito (OSS); enterprise pagoVocê precisa de orçamentos que rejeitem requisições, não só contem
HeliconeGateway open sourceLogs de custo no nível do proxy, por chave e modeloPlano gratuito com limites de taxaVocê quer trocar o proxy com uma linha, sem mexer no SDK
PortkeyGateway comercialOrçamentos por chave virtual e análise de custosPlano gratuito para desenvolvedoresVocê quer gateway, prompts e evals em um só painel
Datadog LLM ObservabilityComercialMétricas de requisição em nanodólares e cost_tagsTeste de 14 diasVocê já usa Datadog para todo o resto
BraintrustComercialGasto vinculado a evals, por projetoPlano gratuitoSeu trabalho de custos começa nos evals, não nas faturas

Uma ressalva sobre conteúdo de fornecedores nessa área: a própria comparação de ferramentas de controle de custos que a Braintrust publicou em 2026 coloca a si mesma em primeiro lugar e omite todas as opções open source da tabela acima. Leia os listicles de fornecedores pelos dados, não pelo ranking.

Para uma equipe começando do zero, nós rodaríamos o LiteLLM na frente e o Langfuse atrás: o proxy aplica os orçamentos, os traces os explicam, e a dupla não custa nada até você passar para os planos hospedados. Se você está pesando os dois padrões de tracing, nossa análise Langfuse vs Langsmith detalha essa escolha a fundo, e o roundup das melhores plataformas de observabilidade de IA cobre o campo inteiro.

Do monitoramento ao corte de custos

O monitoramento mostra para onde o dinheiro vai; o passo seguinte é decidir quanto vai para lá. As três alavancas, em ordem de retorno: fazer cache de entradas repetidas, rotear requisições fáceis para modelos mais baratos e reduzir o porte do modelo onde a qualidade ainda se sustenta. Nosso guia de como reduzir custos de API de LLM cobre cada alavanca, e a comparação de preços de APIs de LLM é a base de toda a conta acima.

Nossa perspectiva: quando o gasto de LLM de um cliente o surpreende, monitoramos primeiro e cortamos depois, nunca o inverso. Equipes que fazem cache antes de medir acabam fazendo cache dos prompts errados. O monitoramento diz para onde o dinheiro vai; cache e roteamento decidem quanto vai para lá. Se a sua fatura já está doendo, agende uma consulta gratuita e olhamos os números com você.

Sobre o autor

Mert Batur é cofundador da Techsy.io, onde a equipe entrega agentes de IA, sistemas de automação e pipelines de voz/SDR para clientes B2B. Ele escreve sobre a stack de ferramentas de LLM que o time da Techsy realmente usa em produção. Conecte-se no LinkedIn.

Perguntas frequentes

Quanto custa 1 milhão de tokens em um LLM?

No preço de tabela, de US$ 0,14 a US$ 15 por milhão, dependendo do modelo e da direção: a entrada do DeepSeek-V4 custa US$ 0,14 por milhão, enquanto a saída do GPT-5.6 Terra custa US$ 15. Tokens de saída custam de 3 a 6 vezes a tarifa de entrada em todos os grandes provedores. A tabela da primeira seção tem quatro modelos, e a nossa comparação de preços de APIs de LLM cobre os dezessete, verificada nas páginas da OpenAI e da Anthropic em julho de 2026.

O que é otimização de custos de LLM?

A prática de reduzir o custo por requisição sem perder qualidade: cache de prompts para entradas repetidas, roteamento de tarefas fáceis para modelos mais baratos, APIs batch para trabalho assíncrono e ajuste do porte do modelo por funcionalidade. O monitoramento de custos de LLM é o pré-requisito, já que você não otimiza o que não atribuiu. Taxa de acerto de cache e custo por funcionalidade são as duas métricas que apontam primeiro para as maiores alavancas.

Por que os LLMs são tão caros?

A inferência é limitada por computação: cada token gerado executa um forward pass completo do modelo em GPUs, e modelos de raciocínio gastam tokens extras pensando antes de responder, cobrados pelas tarifas de saída. Prompts de sistema longos multiplicam esse custo em cada requisição. A fatura cresce com a verbosidade dos dois lados da chamada, e é por isso que tokens por requisição é a primeira métrica que vale acompanhar.

Quanto custa um LLM nos EUA?

Os preços de API são em dólar e globais: OpenAI, Anthropic e Google cobram o mesmo preço de tabela por milhão de tokens, quer a requisição parta de Ohio ou de Osaka. As diferenças regionais aparecem no self-hosting, onde as horas de GPU variam por região de nuvem, e nas plataformas hospedadas que adicionam margem. Para trabalho via API, a localização muda a latência, não o preço.

Como rastreio custos de LLM por equipe?

Emita uma chave virtual por equipe por meio de um proxy como o LiteLLM, dê a cada chave a tag do nome da equipe no momento da criação e agregue os gastos por essa tag. Cada requisição já nasce com atribuição, sem precisar analisar logs. A tabela de showback da seção de orçamentos acima é o produto final: equipe, orçamento mensal, gasto até agora, status.

Langfuse vs Datadog para controle de custos de LLM: qual escolher?

Escolha o Langfuse se você quer open source, self-hosting e dados sob seu controle; rodar é grátis e ele rastreia o custo por requisição desde o início. Escolha o Datadog só se a sua equipe já o usa para infraestrutura, já que os recursos de custos de LLM dele não saem da plataforma. Para a maioria das equipes começando do zero, Langfuse mais um proxy LiteLLM supera qualquer uma das opções sozinha.

Os custos estimados de LLM batem com a fatura real?

Não, e em geral a fatura é menor. Dashboards cobram pelo preço de tabela, enquanto entrada em cache sai por 0,1x a 0,25x e trabalhos batch por 0,5x, então uma carga de trabalho com muito cache vê a fatura real ficar bem abaixo da estimativa rastreada. Campos de token ausentes empurram o erro para o outro lado. A tabela de divergências acima lista cada multiplicador e onde procurar.

Como configuro alertas para picos de gastos com LLM?

Configure um alerta de limite em 80% do orçamento mensal de cada equipe, entregue no Slack por webhook, mais um alerta de anomalia dia a dia em +50% para loops que queimam rápido. O LiteLLM entrega o padrão de limite nativamente pela configuração alerting_threshold. Um alerta em 80% deixa dias para reagir; um alerta em 100% só confirma que o teto fez o trabalho dele.

Existe algum rastreador gratuito de custos de LLM?

Sim, três confiáveis. O Langfuse self-hosted é gratuito e open source, com um plano hobby grátis na nuvem segundo a página de preços do Langfuse. Os orçamentos de chave embutidos do LiteLLM não custam nada no proxy open source. O plano gratuito do Helicone cobre logs de custo no nível do proxy com limites de taxa. Planos gratuitos cobrem o monitoramento; aplicação de limites e alertas em escala é onde começam os planos pagos.

Conclusão

Escolha um caminho de configuração hoje, porque o alerta que você vai querer daqui a seis semanas leva uma tarde para configurar agora. A versão curta:

  • Acompanhe primeiro tokens por requisição e custo por equipe; adicione as outras três métricas quando essas estiverem funcionando.
  • Um orçamento que rejeita requisições é um controle; um que só conta é um relatório.
  • Configure o alerta em 80%, no Slack, antes que a fatura surpreenda alguém.
  • Seu dashboard é uma estimativa; preços de cache e de batch fazem a fatura quase sempre ficar abaixo dela.

Se você prefere ter alguém olhando os números com você, agende uma consulta gratuita.

Etiquetas

monitoramento de custos de llmcontrole de custos de llmrastreamento de uso de tokensobservabilidade de llm

Partilhar este artigo

Inicia o Teu Projeto

Pronto para criar algo extraordinário?

Vamos transformar a sua visão em realidade. A nossa equipa está pronta para o ajudar a criar software que faz a diferença.