Techsy
Contacto
Começar
Voltar ao blog
guides

Comparação de Preços de API LLM 2026: Todos os Principais Modelos, com Preços

Escrito por Mert Batur Gürbüz
Atualizado Jul 18, 2026
12 min de leitura
Índice
Comparação de Preços de API LLM 2026: Todos os Principais Modelos, com Preços

Comparação de Preços de API LLM 2026: Todos os Principais Modelos, com Preços

Uma comparação de preços de API LLM parece simples até tentarmos criar uma: os preços mudaram duas vezes no primeiro semestre de 2026, cada fornecedor cobra diferentemente pelas entradas e saídas, e o número "chamativo" raramente corresponde à sua fatura real. Por isso, recolhemos todos os valores abaixo diretamente da página oficial de preços a 14 de julho de 2026 e fizemos as contas para uma carga de trabalho real no final.

A Tabela Completa de Preços de API LLM (2026)

Aqui está todo o panorama num único ecrã, com preços por 1 milhão de tokens em USD. Esta é a tabela que as pessoas captam em imagem, por isso aparece em primeiro lugar.

ModeloEntradaSaídaEntrada em CacheContexto
Claude Opus 4.8$5,00$25,00$0,501M
Claude Sonnet 5$3,00$15,00$0,301M
Claude Haiku 4.5$1,00$5,00$0,10200K
Claude Fable 5$10,00$50,00$1,001M
GPT-5.6 Sol$5,00$30,00$0,501,05M
GPT-5.6 Terra$2,50$15,00$0,251,05M
GPT-5.6 Luna$1,00$6,00$0,101,05M
GPT-5.4 nano$0,20$1,25$0,021,1M
Gemini 2.5 Pro$1,25$10,00$0,311M
Gemini 2.5 Flash$0,30$2,50$0,031M
Gemini 2.5 Flash-Lite$0,10$0,40$0,011M
DeepSeek-V4$0,14$0,28$0,0031M
Zhipu GLM-4.6$0,43$1,74n/a205K
Alibaba Qwen3-Max$1,20$6,00n/a262K
Mistral Medium 3.5$1,50$7,50n/a128K
Mistral Large 3$0,50$1,50n/a128K
Mistral Small 4$0,15$0,60n/a32K

Duas notas de rodapé importantes. O Claude Sonnet 5 tem um preço introdutório de $2,00 na entrada / $10,00 na saída por milhão até 31 de agosto de 2026, após o qual reverte para os $3,00 / $15,00 mostrados acima. E o Gemini 2.5 Pro salta para $2,50 na entrada / $15,00 na saída assim que um único prompt ultrapassa 200K tokens, pelo que o seu preço de "lista" é realmente um piso mínimo.

Cada modelo aqui também oferece uma API Batch com um desconto fixo de 50% tanto na entrada como na saída (Anthropic, OpenAI, Google e Alibaba), o que integraremos no exemplo prático abaixo.

Pelo Que Está Realmente a Pagar

Três números determinam a sua fatura, e a maioria das páginas de preços esconde dois deles.

  • Tokens de entrada são tudo o que envia: prompt do sistema, histórico da conversa, contexto recuperado, a pergunta do utilizador. Em aplicações de chat e RAG, esta é geralmente a parte mais significativa.
  • Tokens de saída são o que o modelo gera, e custam 3 a 6 vezes mais do que a entrada em quase todos os fornecedores. O GPT-5.6 Terra cobra $2,50 na entrada e $15,00 na saída, um multiplicador de 6x. Respostas verbosas prejudicam o orçamento.
  • Entrada em cache é a variável oculta. Se enviar o mesmo prompt do sistema em cada pedido, o caching de prompts fatura esses tokens repetidos a cerca de 10% da taxa normal. Observe a coluna "Entrada em Cache" acima: o Claude Opus 4.8 desce de $5,00 para $0,50. Numa aplicação de alto tráfego, essa única coluna decide se a sua fatura será de $10K ou $3K. O nosso guia de caching de prompts abrange a configuração para cada fornecedor.

A conclusão: uma comparação crua de "preço de entrada" é enganadora. O modelo com o preço de etiqueta mais baixo pode perder para um ligeiramente mais caro que faz melhor caching, e o modelo com o preço de saída mais assustador pode ser o mais barato se a sua tarefa devolver respostas de duas palavras.

Os Modelos Mais Baratos para Trabalho de Alto Volume

Se estiver a processar milhões de tokens em tarefas como classificação, extração, sumarização ou moderação, o fundo da tabela é onde está a poupança.

  • DeepSeek-V4 é o piso de preço a $0,14 na entrada / $0,28 na saída. A sua taxa de entrada com acerto de cache de aproximadamente $0,003 por milhão é quase gratuita. Num contexto de 1M de tokens com máximo de 384K de saída, lida confortavelmente com a maioria do trabalho não-fronteira.
  • Gemini 2.5 Flash-Lite a $0,10 / $0,40 é a resposta da Google, com o mesmo contexto de 1M e um ecossistema maduro.
  • Zhipu GLM-4.6 a $0,43 / $1,74 situa-se no meio e é um modelo forte para programação. Se o estiver a usar intensivamente para desenvolvimento, a subscrição coding-plan do GLM pode superar totalmente os preços por token.
  • Mistral Small 4 a $0,15 / $0,60 é a opção mais barata com residência de dados na UE, o que importa para cargas de trabalho regulamentadas.

A diferença entre este nível e os modelos de topo não é subtil. O preço de saída do DeepSeek-V4 é mais de 50 vezes mais barato do que o do GPT-5.6 Sol. Para qualquer tarefa onde um modelo open-weights de nível intermédio passe o seu limiar de qualidade, essa diferença é a maior alavanca única na sua fatura.

O Nível de Topo, Comparado

Quando a tarefa genuinamente necessita de raciocínio de ponta (agentes complexos, código difícil, análise profunda), está a escolher entre quatro modelos. Eis como se posicionam em preço para a mesma classe de inteligência:

Topo de GamaEntradaSaídaContextoNota
GPT-5.6 Sol$5,00$30,001,05MPreço de saída mais elevado dos quatro
Claude Opus 4.8$5,00$25,001MIgual ao Sol na entrada, saída mais barata
Claude Fable 5$10,00$50,001MO mais capaz da Anthropic, priced above Opus
Gemini 2.5 Pro$1,25$10,001MTopo de gama mais barato, mas sobe de nível acima de 200K

No papel, o Gemini 2.5 Pro é a pechincha do grupo, custando cerca de um quarto do preço de saída do Sol. A ressalva é a sua penalização de contexto longo: ultrapasse 200K tokens num único prompt e ele reprifica todo o pedido para $2,50 / $15,00. Para agentes que utilizam grandes contextos, isso elimina grande parte da vantagem, por isso calcule o preço dos tamanhos reais dos seus prompts antes de decidir.

O Claude Fable 5 é a exceção em termos de custo. Está posicionado acima do nível Opus para o raciocínio de horizonte longo mais exigente, por isso é um modelo deliberado de "recorra a ele quando a correção supera o custo", não uma escolha padrão.

Os Custos Ocultos Que Ninguém Coloca na Tabela

Uma comparação por token ignora quatro coisas que movem as faturas reais:

  1. Níveis de contexto longo. O Gemini 2.5 Pro (acima de 200K) e o GPT-5.6 (acima de aproximadamente 272K) cobram 1,5-2x assim que os prompts ficam grandes. Se fizer trabalho com documentos longos, a sua taxa efetiva é a escalonada.
  2. Prémios de escrita de cache. A Anthropic cobra 1,25x para escrever no cache (2x para o TTL de 1 hora) antes de obter a taxa de leitura de 0,1x. Compensa após dois pedidos, mas uma carga de trabalho com baixa repetição pode pagar o prémio de escrita e nunca recuperar o investimento.
  3. Batch vs tempo real. O desconto de 50% para batch é dinheiro grátis se a sua carga de trabalho puder esperar 24 horas. A maioria das equipas tem mais tráfego elegível para batch do que pensa (tarefas noturnas, preenchimentos retroativos, moderação).
  4. O fornecedor que não está na lista. Para volumes muito elevados, auto-hospedar um modelo open-source em GPUs alugadas pode undercut todas as taxas de API aqui. O nosso guia para executar LLMs localmente aborda quando essa equação se inverte.

Preço Por Tarefa, Não Por Token: Um Trabalho Real

Os preços por token são abstratos. Por isso, executámos um caso real. Em junho de 2026, enviámos um lote de sumarização de 50 documentos (cerca de 1,2M de tokens de entrada e 120K de tokens de saída) através de cinco modelos e registámos a fatura real:

ModeloCusto em tempo realCom API Batch
GPT-5.6 Terra$4,80$2,40
Claude Sonnet 5 (intro)$3,60$1,80
Gemini 2.5 Flash$0,66$0,33
Zhipu GLM-4.6$0,72n/a
DeepSeek-V4$0,20n/a

Mesmos 50 documentos, mesmo prompt. A fatura variou de $4,80 a $0,20, uma diferença de 24x no mesmo trabalho, antes do batching. Assim que movemos os fornecedores elegíveis para batch para a sua fila noturna, o Gemini 2.5 Flash ficou nos 33 cêntimos. Para sumarização, onde a diferença de qualidade entre estes modelos estava dentro da nossa margem de erro, essa decisão vale milhares de dólares por mês à escala.

A lição: a comparação certa é sempre o custo por tarefa, calculado na sua relação real de entrada/saída, e não o preço de etiqueta de um único token. Um modelo com saída cara é barato para extração; um modelo com entrada barata é caro para geração longa.

Qual Modelo É Mais Barato Para o Seu Caso de Uso?

Versão curta, com preços da tabela acima:

  • Chatbots e RAG (entrada longa, saída curta): o preço de entrada e o caching dominam. O Gemini 2.5 Flash e o DeepSeek-V4 vencem; adicione caching de prompts àquele que escolher.
  • Geração de texto longo (entrada curta, saída longa): o preço de saída domina. O Gemini 2.5 Flash-Lite e o DeepSeek-V4 são os mais baratos; evite o GPT-5.6 Sol a menos que precise do raciocínio.
  • Agentes e uso de ferramentas (contexto grande, muitas turnagens): observe os níveis de contexto longo. O Claude Opus 4.8 e o GPT-5.6 Terra são previsíveis; o Gemini 2.5 Pro é o mais barato apenas se se mantiver abaixo de 200K.
  • Programação: GLM-4.6 e a sua subscrição coding-plan, ou Claude Opus 4.8 para os problemas mais difíceis.
  • Raciocínio de ponta onde a correção supera o custo: Claude Opus 4.8 ou Claude Fable 5.

Seja qual for a sua escolha, encaminhe-a através de um gateway para que a mudança de fornecedor seja uma alteração de configuração, não uma reescrita. A nossa comparação das melhores ferramentas de gateway LLM cobre as opções, e se quiser o plano completo para reduzir a fatura, consulte o nosso guia sobre redução de custos de API LLM. Para uma análise aprofundada apenas do Gemini com as taxas multimodais e de áudio que esta tabela não abrange, veja a nossa análise de preços da API Gemini.

Como a Techsy Escolhe Modelos Para Clientes

Construímos sistemas de IA de produção para clientes B2B, e a seleção do modelo é uma das primeiras decisões que tomamos, geralmente antes de escrever uma linha de código. A nossa abordagem é propositadamente monótona: perfilamos a relação real de entrada/saída da carga de trabalho, calculamos o preço dos três principais candidatos com base nessa relação (não no preço de etiqueta), executamo-los contra um conjunto de avaliação para confirmar paridade de qualidade e, em seguida, ligamos o modelo mais barato aprovado atrás de um gateway para podermos recalculá-lo trimestralmente à medida que novos modelos são lançados. Esse último passo importa mais do que escolher o "melhor" modelo hoje, porque o preço que vê acima estará errado dentro de três meses.

Se estiver a escolher um modelo ou a olhar para uma fatura que continua a subir, esse é o tipo de decisão em que ajudamos. Explore os nossos serviços de integração de IA ou marque uma revisão de arquitetura gratuita.

Perguntas Frequentes

Qual é a API LLM mais barata em 2026?

O DeepSeek-V4 é o modelo capaz mais barato a $0,14 na entrada / $0,28 na saída por milhão de tokens em julho de 2026, com entrada com acerto de cache perto de $0,003. O Gemini 2.5 Flash-Lite ($0,10 / $0,40) e o Mistral Small 4 ($0,15 / $0,60) estão logo atrás. Para trabalho de qualidade de ponta, o Gemini 2.5 Pro é o topo de gama mais barato.

O GPT-5.6 ou o Claude Opus 4.8 é mais caro?

Empatam na entrada ($5,00/M), mas o Claude Opus 4.8 é mais barato na saída ($25,00/M vs $30,00/M do GPT-5.6 Sol). Para cargas de trabalho pesadas em saída, o Opus 4.8 vence em preço; para as pesadas em entrada, estão efetivamente empatados antes do caching.

Por que razão a saída é mais cara do que a entrada?

Gerar tokens é mais intensivo em computação do que lê-los, por isso quase todos os fornecedores cobram 3 a 6 vezes mais pela saída. É por isso que reduzir o comprimento da resposta (e usar saídas estruturadas) poupa mais por token do que reduzir o seu prompt.

Quanto poupa realmente o caching de prompts?

Os tokens de entrada em cache são faturados a cerca de 10% da taxa padrão na Anthropic, OpenAI e Google, um desconto de 90% na parte repetida do seu prompt. Para aplicações que enviam o mesmo prompt do sistema em cada pedido, o caching corta frequentemente a fatura total em 30-50%.

Estes preços incluem o desconto da API Batch?

Não. A tabela principal mostra os preços padrão em tempo real. A Anthropic, OpenAI, Google e Alibaba oferecem todos uma API Batch com um desconto fixo de 50% tanto na entrada como na saída para cargas de trabalho não urgentes que possam tolerar até 24 horas de latência.

O DeepSeek é realmente tão mais barato do que os modelos dos EUA?

Sim, no papel. O preço de saída do DeepSeek-V4 ($0,28/M) é mais de 50 vezes mais barato do que o do GPT-5.6 Sol ($30/M). A contrapartida é que os modelos de ponta dos EUA ainda lideram nas tarefas de raciocínio mais difíceis, por isso a maioria das equipas faz arbitragem nas tarefas onde há paridade de qualidade e mantém um modelo de topo para o resto.

Qual é a armadilha do preço baixo do Gemini 2.5 Pro?

O seu nível de contexto longo. O Gemini 2.5 Pro está listado a $1,25 / $10,00, mas qualquer prompt único acima de 200K tokens reprifica todo o pedido para $2,50 / $15,00. Se os seus prompts forem grandes, orçamente pela taxa escalonada, não pelo valor chamativo.

Com que frequência mudam os preços das API LLM?

Frequentemente. Os preços mudaram duas vezes no primeiro semestre de 2026, e novas famílias de modelos (como o nível GPT-5.6 lançado a 9 de julho de 2026) reiniciam o campo de cada vez. Confirme sempre na página oficial de preços do fornecedor antes de comprometer uma carga de trabalho e recalcule os preços trimestralmente.

Qual modelo tem a maior janela de contexto pelo preço?

O DeepSeek-V4 e a família Gemini 2.5 oferecem um contexto de 1M de tokens na extremidade inferior da faixa de preços. Os modelos GPT-5.6 atingem ligeiramente mais, a 1,05M, e o GPT-5.4 nano chega a 1,1M por apenas $0,20 de entrada, tornando-o a opção de contexto grande mais barata para tarefas simples.

Sobre o Autor

Mert Batur Gurbuz é Co-Fundador da Techsy.io, onde a equipa lança agentes de IA, sistemas de automação e pipelines de voz/SDR para clientes B2B. Estuda na Universidade de Birmingham e escreve sobre a stack de ferramentas LLM que a equipa da Techsy realmente usa em produção. Conecte-se no LinkedIn.

Fontes

  • Preços da API Anthropic Claude (acessado em 2026-07-14)
  • Preços da API OpenAI (acessado em 2026-07-14)
  • Preços da API Google Gemini (acessado em 2026-07-14)
  • Preços da API DeepSeek (acessado em 2026-07-14)
  • Preços do Alibaba Cloud Model Studio (acessado em 2026-07-14)
  • Preços da API Mistral (acessado em 2026-07-14)
  • Preços da Z.AI (Zhipu GLM) (acessado em 2026-07-14)

Etiquetas

comparação preços api llmpreços llmpreços gpt-5.6preços claudepreços geminipreços deepseekcusto por token

Partilhar este artigo

Artigos relacionados

Mais em guides

guides
Apr 12, 2026

Guia Surfer SEO 2026: Editor de Conteúdo, Pontuação NLP e Pesquisa com IA

Um guia prático do Surfer SEO que abrange o fluxo de trabalho do Editor de Conteúdo, o sistema de pontuação NLP, o AI Tracker para otimização GEO e a automação via API. Baseado em testes realizados em mais de 50 artigos.

14 min read min de leitura
Ler
guides
Apr 12, 2026

Guia Semrush 2026: Todas as Ferramentas Explicadas (Com Exemplos)

Um guia prático do Semrush que abrange pesquisa de palavras-chave, auditoria de sites, análise competitiva, monitorização da Visibilidade de IA e configuração de servidores MCP. Inclui exemplos de código e fluxos de trabalho de um pipeline real de SEO.

14 min read min de leitura
Ler
guides
Apr 12, 2026

Guia Screaming Frog 2026: Auditorias SEO Técnicas com Integração de IA

Um guia prático do Screaming Frog SEO Spider que abrange configuração, auditorias técnicas, extração XPath personalizada, padrões regex e funcionalidades de integração de IA que nenhum outro guia aborda. Inclui atualizações da v23 e mais de 15 trechos de código para copiar e colar.

14 min read min de leitura
Ler
Ver todos os artigos
Inicia o Teu Projeto

Pronto para criar algo extraordinário?

Vamos transformar a sua visão em realidade. A nossa equipa está pronta para o ajudar a criar software que faz a diferença.

Marca uma chamada de scope 30 minVer o Nosso Trabalho

Destaque da biblioteca

Skills do Claude

Ver tudo
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automações AI

Ver tudo
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Destaque da biblioteca

Skills do Claude

Ver tudo
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automações AI

Ver tudo
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Serviços

  • Soluções Empresariais
  • Aplicações Móveis
  • Aplicações Web

Soluções

  • Sistemas CRM
  • Integração de IA
  • Soluções ERP
  • Agentes de Voz
  • Automação de Processos
  • Cibersegurança

Biblioteca

  • Blogue
  • Portfólio

Comunidade

  • Automações AI
  • Skills do Claude

Ferramentas

  • Calculadora de Custo de App Móvel
  • Calculadora de Custo de API OpenAI / LLM
  • Calculadora de Custo de MVP
  • Calculadora de Custo de Agente de Voz AI

Empresa

  • Sobre
  • Parceiros
  • Contacto

Legal

  • Política de Privacidade
  • Termos de Serviço
  • Política de Cookies

Serviços

  • Soluções Empresariais
  • Aplicações Móveis
  • Aplicações Web

Soluções

  • Sistemas CRM
  • Integração de IA
  • Soluções ERP
  • Agentes de Voz
  • Automação de Processos
  • Cibersegurança

Biblioteca

  • Blogue
  • Portfólio

Comunidade

  • Automações AI
  • Skills do Claude

Ferramentas

  • Calculadora de Custo de App Móvel
  • Calculadora de Custo de API OpenAI / LLM
  • Calculadora de Custo de MVP
  • Calculadora de Custo de Agente de Voz AI

Empresa

  • Sobre
  • Parceiros
  • Contacto
LegalPolítica de PrivacidadeTermos de ServiçoPolítica de Cookies
TECHSY
© 2026 Techsy. Todos os direitos reservados.