Techsy
Contacto
Começar

Calculadora de custos das APIs OpenAI, Claude & Gemini

Compare os custos mensais entre fornecedores com poupanças por caching e batch.

Os custos de API para GPT, Claude e Gemini variam entre $0,15 e $75 por milhão de tokens de entrada, sendo os tokens de saída normalmente 3 a 5× mais caros. Com 10 milhões de tokens/mês, o GPT-4o fica em cerca de $775, o Claude Sonnet 4 em cerca de $1.140 e o Gemini 2.5 Pro em cerca de $825. O prompt caching reduz os custos 10× nos tokens em cache; a Batch API reduz os custos em 50% para trabalho não em tempo real. Esta calculadora permite modelar a utilização exata nos três fornecedores.

Início/Recursos/Ferramentas/Calculadora de custos das APIs OpenAI, Claude & Gemini
↓ Abrir a calculadora

Os seus dados

05 fields

Custo mensal estimado

● Alta confiança

€ 43 – € 66

Estimativa mediana: € 51

Detalhamento dos custos

Tokens de entrada (10M × $2.50/M)€ 23
Tokens de saída (3M × $10.00/M)€ 28

E-mail e telefone obrigatórios. Chamada de análise de 30 minutos com a nossa equipa.

Veja como uma equipa em Spain orçamentaria o seu âmbito completo →

Quem deve utilizar esta ferramenta

Fundadores que estão a delimitar um projeto de openai api antes de falar com fornecedores. CTOs e líderes de engenharia a construir o orçamento anual para novos desenvolvimentos de produto. Gestores de produto a transformar uma ideia inicial num intervalo de custos justificável para as finanças. Equipas de compras a validar orçamentos de agências e prestadores de serviços.

Como calculamos isto

Preços baseados nas tarifas publicadas pela OpenAI, Anthropic e Google em 2026. A cache de prompts aplica-se apenas aos tokens de input em cache (tipicamente o system prompt + contexto estável). A Batch API aplica-se tanto aos tokens de input como de output para trabalho não em tempo real com SLA de 24 horas.

Fontes de dados

  • Preços públicos da API OpenAI
  • Documentação da API Batch OpenAI
  • Preços públicos da API Anthropic
  • Documentação de caching de prompts Anthropic
  • API Message Batches Anthropic
  • Preços da API Google AI / Gemini
  • Documentação de caching de prompts OpenAI

Fatores que influenciam o valor

Seleção do nível do modelo

Modelos de fronteira como o GPT-4.5, o Claude Opus 4 e o Gemini 2.5 Pro são 5 a 10 vezes mais caros por token do que os seus equivalentes intermédios. Use modelos de fronteira apenas para tarefas de raciocínio complexo onde os intermédios falham genuinamente: lógica multi-etapas complexa, matemática, geração de código ambíguo ou tarefas que exijam conhecimento profundo do mundo. Encaminhe tudo o resto para o Claude Sonnet 4, o GPT-4o ou o Gemini Flash. A diferença de custo é suficientemente grande para que um encaminhamento inteligente reduza tipicamente a despesa em 60 a 80% em cargas mistas.

Caching de prompts

A Anthropic faz cache dos tokens de input durante 5 minutos gratuitamente ou 1 hora com um acréscimo de 25%, reduzindo o custo dos tokens em cache em cerca de 90%. A OpenAI faz cache automaticamente durante 5 a 10 minutos em determinados endpoints, sem necessidade de configuração. A cache funciona melhor quando o system prompt tem mais de 2K tokens e é estável entre pedidos, o que descreve a maioria dos chatbots de produção e sistemas RAG. As poupanças são maiores em cargas com contexto longo e estável e muitos pedidos por minuto.

API Batch

Tanto a OpenAI como a Anthropic oferecem endpoints batch com exatamente 50% de desconto sobre o preço standard, em troca de um SLA de 24 horas. O batch é ideal para classificação, geração de embeddings, sumarização, execuções de avaliação e qualquer processamento em segundo plano. A integração é trivial: mesmo modelo, mesmo prompt, endpoint diferente, mais uma fila para aguardar resultados. A maioria das equipas ignora o batch e paga o preço total por cargas que não têm qualquer requisito de tempo real, o que é um dos custos de IA evitáveis mais fáceis de prevenir.

Tokens de saída

Os tokens de output custam 3 a 5 vezes mais do que os tokens de input em todos os fornecedores, e a maioria das respostas não precisa do buffer de 4K tokens que a API permite por defeito. Se está a extrair uma resposta de sim ou não, limite o output a 10 tokens. Se está a gerar um resumo curto, limite a 200. O modelo muitas vezes quer explicar o seu raciocínio mesmo quando não pediu, e está a pagar por essas explicações. Reduzir o max_tokens corta frequentemente os custos de output em 30 a 50% sem impacto na qualidade.

A janela de contexto não equivale ao preço

Todos os grandes fornecedores cobram por token consumido, não pelo tamanho da janela de contexto. Usar uma janela de contexto de 200K para um prompt de 5K tokens custa exatamente o mesmo que usar uma janela de 5K para um prompt de 5K tokens. Na prática, os modelos de contexto longo não são "mais caros de usar" a menos que se encha mesmo o contexto. Escolha o modelo com base na capacidade e no preço por token, não no tamanho da janela de contexto.

Como reduzir custos

Ative a cache de prompts como primeira otimização, antes de qualquer outra. Na Anthropic, marque o seu prompt de sistema estável com cabeçalhos cache_control e os tokens em cache caem para cerca de 10% do preço standard de input. Na OpenAI, a cache acontece automaticamente em certos endpoints quando o prefixo do prompt é idêntico entre pedidos. O ganho é maior em workloads com contexto longo e estável e muitos pedidos: chatbots com personas detalhadas, sistemas RAG com contexto de recuperação repetido, e qualquer loop de agente que reenvia um conjunto longo de instruções. A maioria das equipas esquece-se de ativar a cache e paga 5 a 10 vezes mais.

Passe todos os workloads que não sejam em tempo real para a Batch API. Tanto a Anthropic como a OpenAI oferecem endpoints batch a exatamente 50% do preço standard, em troca de um SLA de resposta de 24 horas. Trabalhos de classificação, moderação de conteúdo, geração de embeddings, pipelines de sumarização e execuções de avaliação são todos bons candidatos. O trabalho de integração é trivial porque o prompt e o modelo não mudam. Há equipas que rotineiramente correm o pipeline inteiro de tagging de conteúdo a preço standard quando o batch cortaria a fatura a meio sem qualquer diferença de qualidade.

Encaminhe os pedidos por dificuldade. Consultas simples (saudações, formatação, pesquisas básicas) pertencem ao GPT-4o mini, Claude Haiku ou Gemini Flash, a $0,15 a $0,80 por milhão de tokens de input. Raciocínio difícil pertence ao Claude Opus, GPT-4.5 ou Gemini Pro, a $1,25 a $75 por milhão. Um pequeno classificador à frente do router de modelos corta tipicamente os custos em 60 a 80% em workloads mistos. Enviar tudo para um modelo de fronteira é o erro de custos de IA mais comum que vemos em produção.

Limite o max_tokens de forma agressiva. Os tokens de output custam 3 a 5 vezes mais do que os tokens de input, e o buffer de output padrão de 4K é bem maior do que a maioria das respostas precisa. Limite as respostas de sim-ou-não a 10 tokens, resumos curtos a 200, JSON estruturado ao que o seu schema exigir mais um pequeno buffer. Por vezes o modelo quer elaborar mesmo quando não pediu, e paga por essas elaborações. Apertar o max_tokens é uma redução de 30 a 50% nos custos de output na maioria dos casos.

Reduza o contexto recuperado apenas ao que é necessário por consulta. Os sistemas RAG recuperam frequentemente 10 a 20 chunks e enchem-nos todos no prompt por segurança. O resultado é pagar por milhares de tokens irrelevantes por pedido. Adicionar um reranker que filtre para os 3 a 5 chunks mais relevantes corta tipicamente o uso de tokens de input em 50 a 70% sem perda de qualidade, muitas vezes com melhoria de qualidade porque o modelo não é distraído por contexto irrelevante.

Registe todos os pedidos com contagens de tokens, modelo e estado de cache versus sem cache. Não se pode otimizar o que não se vê, e os custos de IA podem mudar de forma da noite para o dia quando uma nova funcionalidade é lançada ou um prompt é ajustado. Defina alertas de gasto diários. Construa um dashboard que decomponha o gasto por funcionalidade, modelo e endpoint. A maioria dos excessos de custos em produção que encontramos acontecem porque um padrão de uso mudou duas semanas antes de alguém olhar para a fatura.

Custo por milhão de tokens (preços de 2026)

ModeloEntradaSaídaEntrada em cache
GPT-4.5$75,00$150,00$37,50
GPT-4o$2,50$10,00$1,25
GPT-4o mini$0,15$0,60$0,075
Claude Opus 4$15,00$75,00$1,50
Claude Sonnet 4$3,00$15,00$0,30
Claude Haiku 4$0,80$4,00$0,08
Gemini 2.5 Pro$1,25$10,00N/A
Gemini 2.5 Flash$0,075$0,30N/A

Perguntas frequentes

As dúvidas que recebemos todas as semanas

Respostas curtas, em linguagem simples. Se a sua questão não está aqui,

GPT-4o: $2,50 por milhão de tokens de entrada, $10 de saída. GPT-4o mini: $0,15/M de entrada, $0,60 de saída. GPT-4.5: $75/M de entrada, $150 de saída. Com 10 milhões de tokens por mês numa proporção de 30/70 entrada/saída, conte com $25–$13 mil, consoante o modelo.

Para a maioria das cargas de trabalho: GPT-4o mini, Gemini 2.5 Flash ou Claude Haiku 4; todos abaixo de $1 por milhão de tokens de entrada. Para o melhor equilíbrio qualidade-preço: Claude Sonnet 4 ou Gemini 2.5 Pro.

A Anthropic e a OpenAI fazem cache de prompts de entrada grandes entre pedidos. Os tokens em cache custam cerca de 90% menos do que os não cacheados. Ideal para chatbots com system prompts estáveis ou RAG com contexto estável.

Exatamente 50% tanto nos tokens de entrada como nos de saída. Requer aceitar um SLA de 24 horas. Bom para classificação, sumarização, embeddings e avaliação. Mau para chat em tempo real ou UX interativa.

Em níveis de qualidade comparáveis, o custo é semelhante. O Claude Sonnet 4 face ao GPT-4o fica praticamente ao mesmo nível. O Claude Opus 4 com prompt caching fica cerca de 30% mais barato do que o GPT-4o em cargas de trabalho com prompts estáveis.

(1) Ativar o prompt caching. (2) Usar a Batch API sempre que possível. (3) Encaminhar consultas simples para modelos mini. (4) Limitar o max_tokens de forma agressiva. (5) Reduzir o contexto de recuperação ao essencial.

O ponto de equilíbrio situa-se em torno dos $5 mil por mês em gastos de API. Abaixo disso: continue a usar APIs. Acima: alojar o Llama 3.1 ou o Mistral em infraestrutura própria reduz os custos em 50–70%, se tiver a competência técnica necessária.

Recolha uma amostra representativa de 100 pedidos. Meça a média de tokens de input e output. Multiplique pelo volume mensal de pedidos. Multiplique pelo custo por milhão de tokens. Acrescente uma margem de segurança de 30%.

Apenas para raciocínio complexo onde os modelos intermédios falham. Para 80% das cargas de produção, o Sonnet 4, o GPT-4o ou o Gemini 2.5 Pro funcionam perfeitamente a um custo 10× inferior.

Com uma margem de ±15% para cargas de trabalho típicas. A variância real resulta da variação no comprimento dos prompts, da variação no comprimento das respostas, dos ciclos de erro e repetição, e da lógica de encaminhamento. Use a calculadora como ferramenta de planeamento, não como fatura final.

Ferramentas semelhantes

Outros calculadores que a maioria das pessoas abre logo de seguida; escolha o que melhor se adapta à sua próxima decisão.

Calculadora de custos de integração IA
Calculadora de custos de integração IA

Custo de construção mais custo operacional mensal; a imagem completa.

Abrir a calculadora

Obtenha uma estimativa precisa da nossa equipa

Os calculadores dão-lhe um intervalo de valores. Uma chamada de 30 minutos permite definir um âmbito fixo, um cronograma e um orçamento. Consulta gratuita, sem compromisso.

Iniciar a conversa

Destaque da biblioteca

Recursos

Ver tudo
  • The Software Procurement Playbook

    A repeatable framework for buying software without burning six months and a million dollars on the wrong platform.

  • The Architecture Decision Playbook

    A practical framework for picking your stack: when to build vs. buy, monolith vs. microservices, and how to avoid resume-driven design.

  • The Vendor Selection Playbook

    How to pick the right development partner (agency, freelancer, in-house) without overpaying or shipping a half-built product.

Skills do Claude

Ver tudo
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automações AI

Ver tudo
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Destaque da biblioteca

Recursos

Ver tudo
  • The Software Procurement Playbook

    A repeatable framework for buying software without burning six months and a million dollars on the wrong platform.

  • The Architecture Decision Playbook

    A practical framework for picking your stack: when to build vs. buy, monolith vs. microservices, and how to avoid resume-driven design.

  • The Vendor Selection Playbook

    How to pick the right development partner (agency, freelancer, in-house) without overpaying or shipping a half-built product.

Skills do Claude

Ver tudo
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automações AI

Ver tudo
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Serviços

  • Soluções Empresariais
  • Aplicações Móveis
  • Aplicações Web

Soluções

  • Sistemas CRM
  • Integração de IA
  • Soluções ERP
  • Agentes de Voz
  • Automação de Processos
  • Cibersegurança

Biblioteca

  • Recursos
  • Blogue
  • Portfólio

Comunidade

  • Automações AI
  • Skills do Claude

Ferramentas

  • Calculadora de Custo de App Móvel
  • Calculadora de Custo de API OpenAI / LLM
  • Calculadora de Custo de MVP
  • Calculadora de Custo de Agente de Voz AI

Empresa

  • Sobre
  • Parceiros
  • Contacto

Legal

  • Política de Privacidade
  • Termos de Serviço
  • Política de Cookies

Serviços

  • Soluções Empresariais
  • Aplicações Móveis
  • Aplicações Web

Soluções

  • Sistemas CRM
  • Integração de IA
  • Soluções ERP
  • Agentes de Voz
  • Automação de Processos
  • Cibersegurança

Biblioteca

  • Recursos
  • Blogue
  • Portfólio

Comunidade

  • Automações AI
  • Skills do Claude

Ferramentas

  • Calculadora de Custo de App Móvel
  • Calculadora de Custo de API OpenAI / LLM
  • Calculadora de Custo de MVP
  • Calculadora de Custo de Agente de Voz AI

Empresa

  • Sobre
  • Parceiros
  • Contacto
LegalPolítica de PrivacidadeTermos de ServiçoPolítica de Cookies
TECHSY
© 2026 Techsy. Todos os direitos reservados.