
Comparação de Preços de API LLM 2026: Todos os Principais Modelos, com Preços
Uma comparação de preços de API LLM parece simples até tentarmos criar uma: os preços mudaram duas vezes no primeiro semestre de 2026, cada fornecedor cobra diferentemente pelas entradas e saídas, e o número "chamativo" raramente corresponde à sua fatura real. Por isso, recolhemos todos os valores abaixo diretamente da página oficial de preços a 14 de julho de 2026 e fizemos as contas para uma carga de trabalho real no final.
A Tabela Completa de Preços de API LLM (2026)
Aqui está todo o panorama num único ecrã, com preços por 1 milhão de tokens em USD. Esta é a tabela que as pessoas captam em imagem, por isso aparece em primeiro lugar.
| Modelo | Entrada | Saída | Entrada em Cache | Contexto |
|---|---|---|---|---|
| Claude Opus 4.8 | $5,00 | $25,00 | $0,50 | 1M |
| Claude Sonnet 5 | $3,00 | $15,00 | $0,30 | 1M |
| Claude Haiku 4.5 | $1,00 | $5,00 | $0,10 | 200K |
| Claude Fable 5 | $10,00 | $50,00 | $1,00 | 1M |
| GPT-5.6 Sol | $5,00 | $30,00 | $0,50 | 1,05M |
| GPT-5.6 Terra | $2,50 | $15,00 | $0,25 | 1,05M |
| GPT-5.6 Luna | $1,00 | $6,00 | $0,10 | 1,05M |
| GPT-5.4 nano | $0,20 | $1,25 | $0,02 | 1,1M |
| Gemini 2.5 Pro | $1,25 | $10,00 | $0,31 | 1M |
| Gemini 2.5 Flash | $0,30 | $2,50 | $0,03 | 1M |
| Gemini 2.5 Flash-Lite | $0,10 | $0,40 | $0,01 | 1M |
| DeepSeek-V4 | $0,14 | $0,28 | $0,003 | 1M |
| Zhipu GLM-4.6 | $0,43 | $1,74 | n/a | 205K |
| Alibaba Qwen3-Max | $1,20 | $6,00 | n/a | 262K |
| Mistral Medium 3.5 | $1,50 | $7,50 | n/a | 128K |
| Mistral Large 3 | $0,50 | $1,50 | n/a | 128K |
| Mistral Small 4 | $0,15 | $0,60 | n/a | 32K |
Duas notas de rodapé importantes. O Claude Sonnet 5 tem um preço introdutório de $2,00 na entrada / $10,00 na saída por milhão até 31 de agosto de 2026, após o qual reverte para os $3,00 / $15,00 mostrados acima. E o Gemini 2.5 Pro salta para $2,50 na entrada / $15,00 na saída assim que um único prompt ultrapassa 200K tokens, pelo que o seu preço de "lista" é realmente um piso mínimo.
Cada modelo aqui também oferece uma API Batch com um desconto fixo de 50% tanto na entrada como na saída (Anthropic, OpenAI, Google e Alibaba), o que integraremos no exemplo prático abaixo.
Pelo Que Está Realmente a Pagar
Três números determinam a sua fatura, e a maioria das páginas de preços esconde dois deles.
- Tokens de entrada são tudo o que envia: prompt do sistema, histórico da conversa, contexto recuperado, a pergunta do utilizador. Em aplicações de chat e RAG, esta é geralmente a parte mais significativa.
- Tokens de saída são o que o modelo gera, e custam 3 a 6 vezes mais do que a entrada em quase todos os fornecedores. O GPT-5.6 Terra cobra $2,50 na entrada e $15,00 na saída, um multiplicador de 6x. Respostas verbosas prejudicam o orçamento.
- Entrada em cache é a variável oculta. Se enviar o mesmo prompt do sistema em cada pedido, o caching de prompts fatura esses tokens repetidos a cerca de 10% da taxa normal. Observe a coluna "Entrada em Cache" acima: o Claude Opus 4.8 desce de $5,00 para $0,50. Numa aplicação de alto tráfego, essa única coluna decide se a sua fatura será de $10K ou $3K. O nosso guia de caching de prompts abrange a configuração para cada fornecedor.
A conclusão: uma comparação crua de "preço de entrada" é enganadora. O modelo com o preço de etiqueta mais baixo pode perder para um ligeiramente mais caro que faz melhor caching, e o modelo com o preço de saída mais assustador pode ser o mais barato se a sua tarefa devolver respostas de duas palavras.
Os Modelos Mais Baratos para Trabalho de Alto Volume
Se estiver a processar milhões de tokens em tarefas como classificação, extração, sumarização ou moderação, o fundo da tabela é onde está a poupança.
- DeepSeek-V4 é o piso de preço a $0,14 na entrada / $0,28 na saída. A sua taxa de entrada com acerto de cache de aproximadamente $0,003 por milhão é quase gratuita. Num contexto de 1M de tokens com máximo de 384K de saída, lida confortavelmente com a maioria do trabalho não-fronteira.
- Gemini 2.5 Flash-Lite a $0,10 / $0,40 é a resposta da Google, com o mesmo contexto de 1M e um ecossistema maduro.
- Zhipu GLM-4.6 a $0,43 / $1,74 situa-se no meio e é um modelo forte para programação. Se o estiver a usar intensivamente para desenvolvimento, a subscrição coding-plan do GLM pode superar totalmente os preços por token.
- Mistral Small 4 a $0,15 / $0,60 é a opção mais barata com residência de dados na UE, o que importa para cargas de trabalho regulamentadas.
A diferença entre este nível e os modelos de topo não é subtil. O preço de saída do DeepSeek-V4 é mais de 50 vezes mais barato do que o do GPT-5.6 Sol. Para qualquer tarefa onde um modelo open-weights de nível intermédio passe o seu limiar de qualidade, essa diferença é a maior alavanca única na sua fatura.
O Nível de Topo, Comparado
Quando a tarefa genuinamente necessita de raciocínio de ponta (agentes complexos, código difícil, análise profunda), está a escolher entre quatro modelos. Eis como se posicionam em preço para a mesma classe de inteligência:
| Topo de Gama | Entrada | Saída | Contexto | Nota |
|---|---|---|---|---|
| GPT-5.6 Sol | $5,00 | $30,00 | 1,05M | Preço de saída mais elevado dos quatro |
| Claude Opus 4.8 | $5,00 | $25,00 | 1M | Igual ao Sol na entrada, saída mais barata |
| Claude Fable 5 | $10,00 | $50,00 | 1M | O mais capaz da Anthropic, priced above Opus |
| Gemini 2.5 Pro | $1,25 | $10,00 | 1M | Topo de gama mais barato, mas sobe de nível acima de 200K |
No papel, o Gemini 2.5 Pro é a pechincha do grupo, custando cerca de um quarto do preço de saída do Sol. A ressalva é a sua penalização de contexto longo: ultrapasse 200K tokens num único prompt e ele reprifica todo o pedido para $2,50 / $15,00. Para agentes que utilizam grandes contextos, isso elimina grande parte da vantagem, por isso calcule o preço dos tamanhos reais dos seus prompts antes de decidir.
O Claude Fable 5 é a exceção em termos de custo. Está posicionado acima do nível Opus para o raciocínio de horizonte longo mais exigente, por isso é um modelo deliberado de "recorra a ele quando a correção supera o custo", não uma escolha padrão.
Os Custos Ocultos Que Ninguém Coloca na Tabela
Uma comparação por token ignora quatro coisas que movem as faturas reais:
- Níveis de contexto longo. O Gemini 2.5 Pro (acima de 200K) e o GPT-5.6 (acima de aproximadamente 272K) cobram 1,5-2x assim que os prompts ficam grandes. Se fizer trabalho com documentos longos, a sua taxa efetiva é a escalonada.
- Prémios de escrita de cache. A Anthropic cobra 1,25x para escrever no cache (2x para o TTL de 1 hora) antes de obter a taxa de leitura de 0,1x. Compensa após dois pedidos, mas uma carga de trabalho com baixa repetição pode pagar o prémio de escrita e nunca recuperar o investimento.
- Batch vs tempo real. O desconto de 50% para batch é dinheiro grátis se a sua carga de trabalho puder esperar 24 horas. A maioria das equipas tem mais tráfego elegível para batch do que pensa (tarefas noturnas, preenchimentos retroativos, moderação).
- O fornecedor que não está na lista. Para volumes muito elevados, auto-hospedar um modelo open-source em GPUs alugadas pode undercut todas as taxas de API aqui. O nosso guia para executar LLMs localmente aborda quando essa equação se inverte.
Preço Por Tarefa, Não Por Token: Um Trabalho Real
Os preços por token são abstratos. Por isso, executámos um caso real. Em junho de 2026, enviámos um lote de sumarização de 50 documentos (cerca de 1,2M de tokens de entrada e 120K de tokens de saída) através de cinco modelos e registámos a fatura real:
| Modelo | Custo em tempo real | Com API Batch |
|---|---|---|
| GPT-5.6 Terra | $4,80 | $2,40 |
| Claude Sonnet 5 (intro) | $3,60 | $1,80 |
| Gemini 2.5 Flash | $0,66 | $0,33 |
| Zhipu GLM-4.6 | $0,72 | n/a |
| DeepSeek-V4 | $0,20 | n/a |
Mesmos 50 documentos, mesmo prompt. A fatura variou de $4,80 a $0,20, uma diferença de 24x no mesmo trabalho, antes do batching. Assim que movemos os fornecedores elegíveis para batch para a sua fila noturna, o Gemini 2.5 Flash ficou nos 33 cêntimos. Para sumarização, onde a diferença de qualidade entre estes modelos estava dentro da nossa margem de erro, essa decisão vale milhares de dólares por mês à escala.
A lição: a comparação certa é sempre o custo por tarefa, calculado na sua relação real de entrada/saída, e não o preço de etiqueta de um único token. Um modelo com saída cara é barato para extração; um modelo com entrada barata é caro para geração longa.
Qual Modelo É Mais Barato Para o Seu Caso de Uso?
Versão curta, com preços da tabela acima:
- Chatbots e RAG (entrada longa, saída curta): o preço de entrada e o caching dominam. O Gemini 2.5 Flash e o DeepSeek-V4 vencem; adicione caching de prompts àquele que escolher.
- Geração de texto longo (entrada curta, saída longa): o preço de saída domina. O Gemini 2.5 Flash-Lite e o DeepSeek-V4 são os mais baratos; evite o GPT-5.6 Sol a menos que precise do raciocínio.
- Agentes e uso de ferramentas (contexto grande, muitas turnagens): observe os níveis de contexto longo. O Claude Opus 4.8 e o GPT-5.6 Terra são previsíveis; o Gemini 2.5 Pro é o mais barato apenas se se mantiver abaixo de 200K.
- Programação: GLM-4.6 e a sua subscrição coding-plan, ou Claude Opus 4.8 para os problemas mais difíceis.
- Raciocínio de ponta onde a correção supera o custo: Claude Opus 4.8 ou Claude Fable 5.
Seja qual for a sua escolha, encaminhe-a através de um gateway para que a mudança de fornecedor seja uma alteração de configuração, não uma reescrita. A nossa comparação das melhores ferramentas de gateway LLM cobre as opções, e se quiser o plano completo para reduzir a fatura, consulte o nosso guia sobre redução de custos de API LLM. Para uma análise aprofundada apenas do Gemini com as taxas multimodais e de áudio que esta tabela não abrange, veja a nossa análise de preços da API Gemini.
Como a Techsy Escolhe Modelos Para Clientes
Construímos sistemas de IA de produção para clientes B2B, e a seleção do modelo é uma das primeiras decisões que tomamos, geralmente antes de escrever uma linha de código. A nossa abordagem é propositadamente monótona: perfilamos a relação real de entrada/saída da carga de trabalho, calculamos o preço dos três principais candidatos com base nessa relação (não no preço de etiqueta), executamo-los contra um conjunto de avaliação para confirmar paridade de qualidade e, em seguida, ligamos o modelo mais barato aprovado atrás de um gateway para podermos recalculá-lo trimestralmente à medida que novos modelos são lançados. Esse último passo importa mais do que escolher o "melhor" modelo hoje, porque o preço que vê acima estará errado dentro de três meses.
Se estiver a escolher um modelo ou a olhar para uma fatura que continua a subir, esse é o tipo de decisão em que ajudamos. Explore os nossos serviços de integração de IA ou marque uma revisão de arquitetura gratuita.
Perguntas Frequentes
Qual é a API LLM mais barata em 2026?
O DeepSeek-V4 é o modelo capaz mais barato a $0,14 na entrada / $0,28 na saída por milhão de tokens em julho de 2026, com entrada com acerto de cache perto de $0,003. O Gemini 2.5 Flash-Lite ($0,10 / $0,40) e o Mistral Small 4 ($0,15 / $0,60) estão logo atrás. Para trabalho de qualidade de ponta, o Gemini 2.5 Pro é o topo de gama mais barato.
O GPT-5.6 ou o Claude Opus 4.8 é mais caro?
Empatam na entrada ($5,00/M), mas o Claude Opus 4.8 é mais barato na saída ($25,00/M vs $30,00/M do GPT-5.6 Sol). Para cargas de trabalho pesadas em saída, o Opus 4.8 vence em preço; para as pesadas em entrada, estão efetivamente empatados antes do caching.
Por que razão a saída é mais cara do que a entrada?
Gerar tokens é mais intensivo em computação do que lê-los, por isso quase todos os fornecedores cobram 3 a 6 vezes mais pela saída. É por isso que reduzir o comprimento da resposta (e usar saídas estruturadas) poupa mais por token do que reduzir o seu prompt.
Quanto poupa realmente o caching de prompts?
Os tokens de entrada em cache são faturados a cerca de 10% da taxa padrão na Anthropic, OpenAI e Google, um desconto de 90% na parte repetida do seu prompt. Para aplicações que enviam o mesmo prompt do sistema em cada pedido, o caching corta frequentemente a fatura total em 30-50%.
Estes preços incluem o desconto da API Batch?
Não. A tabela principal mostra os preços padrão em tempo real. A Anthropic, OpenAI, Google e Alibaba oferecem todos uma API Batch com um desconto fixo de 50% tanto na entrada como na saída para cargas de trabalho não urgentes que possam tolerar até 24 horas de latência.
O DeepSeek é realmente tão mais barato do que os modelos dos EUA?
Sim, no papel. O preço de saída do DeepSeek-V4 ($0,28/M) é mais de 50 vezes mais barato do que o do GPT-5.6 Sol ($30/M). A contrapartida é que os modelos de ponta dos EUA ainda lideram nas tarefas de raciocínio mais difíceis, por isso a maioria das equipas faz arbitragem nas tarefas onde há paridade de qualidade e mantém um modelo de topo para o resto.
Qual é a armadilha do preço baixo do Gemini 2.5 Pro?
O seu nível de contexto longo. O Gemini 2.5 Pro está listado a $1,25 / $10,00, mas qualquer prompt único acima de 200K tokens reprifica todo o pedido para $2,50 / $15,00. Se os seus prompts forem grandes, orçamente pela taxa escalonada, não pelo valor chamativo.
Com que frequência mudam os preços das API LLM?
Frequentemente. Os preços mudaram duas vezes no primeiro semestre de 2026, e novas famílias de modelos (como o nível GPT-5.6 lançado a 9 de julho de 2026) reiniciam o campo de cada vez. Confirme sempre na página oficial de preços do fornecedor antes de comprometer uma carga de trabalho e recalcule os preços trimestralmente.
Qual modelo tem a maior janela de contexto pelo preço?
O DeepSeek-V4 e a família Gemini 2.5 oferecem um contexto de 1M de tokens na extremidade inferior da faixa de preços. Os modelos GPT-5.6 atingem ligeiramente mais, a 1,05M, e o GPT-5.4 nano chega a 1,1M por apenas $0,20 de entrada, tornando-o a opção de contexto grande mais barata para tarefas simples.
Sobre o Autor
Mert Batur Gurbuz é Co-Fundador da Techsy.io, onde a equipa lança agentes de IA, sistemas de automação e pipelines de voz/SDR para clientes B2B. Estuda na Universidade de Birmingham e escreve sobre a stack de ferramentas LLM que a equipa da Techsy realmente usa em produção. Conecte-se no LinkedIn.
Fontes
- Preços da API Anthropic Claude (acessado em 2026-07-14)
- Preços da API OpenAI (acessado em 2026-07-14)
- Preços da API Google Gemini (acessado em 2026-07-14)
- Preços da API DeepSeek (acessado em 2026-07-14)
- Preços do Alibaba Cloud Model Studio (acessado em 2026-07-14)
- Preços da API Mistral (acessado em 2026-07-14)
- Preços da Z.AI (Zhipu GLM) (acessado em 2026-07-14)