Kostnadskalkylator för OpenAI-, Claude- och Gemini-API

Jämför månadskostnaden mellan leverantörerna, med besparingar från caching och batch inräknade.

API-kostnaderna för GPT, Claude och Gemini sträcker sig från 0,15 $ till 75 $ per miljon indata-tokens, och utdata-tokens är normalt 3–5× dyrare. Vid 10 miljoner tokens i månaden landar GPT-4o på cirka 775 $, Claude Sonnet 4 på cirka 1 140 $ och Gemini 2.5 Pro på cirka 825 $. Prompt caching kapar kostnaden 10× på cachade tokens; Batch API halverar kostnaden för arbete som inte sker i realtid. Med kalkylatorn modellerar du din exakta användning hos alla tre leverantörerna.

Öppna kalkylatorn

Dina inställningar

05 fields

Vem ska använda detta verktyg

Grundare som ringar in ett openai api-projekt innan de pratar med leverantörer. CTO:er och tekniska ledare som lägger en årsbudget för nytt produktarbete. Produktchefer som omsätter en idé på en rad till ett försvarbart intervall för ekonomiavdelningen. Inköpsteam som dubbelkollar offerter från byråer och konsulter.

Så räknar vi

Priserna bygger på publikt angivna priser från OpenAI, Anthropic och Google per 2026. Prompt caching gäller endast cachade input-tokens (vanligtvis system-prompten plus stabil kontext). Batch API gäller både input- och output-tokens för arbete som inte är i realtid, med 24-timmars SLA.

Datakällor

Faktorer som påverkar siffran

Val av modellnivå

Frontier-modeller som GPT-4.5, Claude Opus 4 och Gemini 2.5 Pro är 5 till 10 gånger dyrare per token än sina mellanklassvarianter. Ta fram frontier bara för svåra resonemangsuppgifter där mellanklassen verkligen går bet: komplex flerstegslogik, matematik, tvetydig kodgenerering eller uppgifter som kräver djup faktakunskap om världen. Skicka allt annat till Claude Sonnet 4, GPT-4o eller Gemini Flash. Kostnadsgapet är så pass stort att smart routing oftast kapar utgifterna med 60 till 80 % på blandade arbetslaster.

Prompt caching

Anthropic cachar input-tokens i 5 minuter gratis eller 1 timme med ett påslag på 25 %, vilket kapar kostnaden för cachade tokens med ungefär 90 %. OpenAI cachar automatiskt i 5 till 10 minuter på vissa endpoints utan någon konfiguration. Cachning fungerar bäst när din system-prompt är över 2K tokens och stabil mellan anrop, vilket beskriver de flesta chatbottar och RAG-system i produktion. Besparingen är störst på arbetslaster med lång stabil kontext och många anrop per minut.

Batch API

Både OpenAI och Anthropic erbjuder batch-endpoints till exakt 50 % rabatt på standardpriset i utbyte mot en SLA på 24 timmar. Batch är idealiskt för klassificering, embedding-generering, summering, evalueringskörningar och all bakgrundsbearbetning. Integrationen är trivial: samma modell, samma prompt, annan endpoint, plus en kö som väntar på resultaten. De flesta team förbiser batch och betalar fullpris för arbetslaster som inte har något realtidskrav, vilket är en av de enklaste AI-kostnaderna att undvika.

Output-tokens

Output-tokens kostar 3 till 5 gånger mer än input-tokens hos alla leverantörer, och de flesta svar behöver inte den 4K-token stora output-bufferten API:et tillåter som standard. Om du extraherar ett ja-eller-nej-svar, begränsa output till 10 tokens. Om du genererar en kort sammanfattning, begränsa till 200. Modellen vill ofta förklara sitt resonemang även när du inte bett om det, och du betalar för de förklaringarna. Att strama åt max_tokens kapar ofta output-kostnaderna 30 till 50 % utan kvalitetspåverkan.

Kontextfönstret är inte lika med priset

Alla större leverantörer tar betalt per förbrukad token, inte efter kontextfönstrets storlek. Att använda ett kontextfönster på 200K för en prompt på 5K tokens kostar exakt lika mycket som att använda ett fönster på 5K för samma prompt. Slutsatsen är att modeller med långt kontextfönster inte är "dyrare att använda" om du inte faktiskt fyller fönstret. Välj modell utifrån kapacitet och pris per token, inte efter vem som har störst kontextfönster.

Så minskar du kostnaden

Slå på prompt caching som första optimering, före allt annat. För Anthropic, markera din stabila system-prompt med cache_control-headers så faller cachade tokens till ungefär 10 % av standardpriset för input. För OpenAI sker cachning automatiskt på vissa endpoints när din prompt-prefix är identisk mellan anrop. Vinsten är störst på arbetslaster med lång stabil kontext och många anrop: chatbottar med detaljerade personas, RAG-system med upprepad retrieval-kontext, och varje agentloop som skickar om en lång instruktionsuppsättning. De flesta team glömmer att slå på cachning och överbetalar 5 till 10 gånger.

Flytta varje arbetslast som inte är realtid till Batch API. Både Anthropic och OpenAI erbjuder batch-endpoints till exakt 50 % av standardpriset i utbyte mot en svars-SLA på 24 timmar. Klassificeringsjobb, innehållsmoderering, embedding-generering, summeringspipelines och evalueringskörningar är alla bra kandidater. Integrationsarbetet är trivialt eftersom prompt och modell är oförändrade. Team kör rutinmässigt hela sin pipeline för innehållstaggning på standardpris när batch skulle halvera räkningen utan någon kvalitetsskillnad.

Dirigera anropen efter svårighetsgrad. Enkla frågor (hälsningar, formatering, enkla uppslag) hör hemma på GPT-4o mini, Claude Haiku eller Gemini Flash för 0,15 till 0,80 USD per miljon input-tokens. Svårt resonemang hör hemma på Claude Opus, GPT-4.5 eller Gemini Pro för 1,25 till 75 USD per miljon. En liten klassificerare framför din modell-router kapar oftast kostnaderna 60 till 80 % på blandade arbetslaster. Att skicka allt till en frontier-modell är det vanligaste AI-kostnadsmisstaget vi ser i produktion.

Begränsa max_tokens hårt. Output-tokens kostar 3 till 5 gånger mer än input-tokens, och standardbufferten på 4K output är långt större än de flesta svar behöver. Begränsa ja-eller-nej-svar till 10 tokens, korta sammanfattningar till 200, strukturerad JSON till vad ditt schema kräver plus en liten buffert. Modellen vill ibland utveckla även när du inte bett om det, och du betalar för de utläggningarna. Att strama åt max_tokens är en kostnadsminskning på 30 till 50 % för output i de flesta fall.

Skala ner hämtad kontext till bara det som behövs per fråga. RAG-system hämtar ofta 10 till 20 chunks och proppar in dem alla i prompten för säkerhets skull. Resultatet är att du betalar för tusentals irrelevanta tokens per anrop. Att lägga till en reranker som filtrerar ner till de 3 till 5 mest relevanta chunkarna kapar vanligtvis input-tokenanvändningen med 50 till 70 % utan kvalitetsförlust, ofta med kvalitetsförbättring eftersom modellen inte distraheras av irrelevant kontext.

Logga varje anrop med antal tokens, modell och om det var cachat eller inte. Du kan inte optimera det du inte ser, och AI-kostnaderna kan ändra karaktär över en natt när en ny funktion lanseras eller en prompt justeras. Lägg upp dagliga kostnadslarm. Bygg en dashboard som bryter ner utgifterna per funktion, modell och endpoint. De flesta kostnadsöverskridanden vi stöter på i produktion beror på att ett användningsmönster skiftade ett par veckor innan någon ens tittade på räkningen.

Kostnad per miljon tokens (priser 2026)

ModellInputOutputCachad input
GPT-4.5$75.00$150.00$37.50
GPT-4o$2.50$10.00$1.25
GPT-4o mini$0.15$0.60$0.075
Claude Opus 4$15.00$75.00$1.50
Claude Sonnet 4$3.00$15.00$0.30
Claude Haiku 4$0.80$4.00$0.08
Gemini 2.5 Pro$1.25$10.00N/A
Gemini 2.5 Flash$0.075$0.30N/A

FAQ

Frågor vi får varje vecka

Korta svar i vanlig text. Saknas din fråga,

GPT-4o: 2,50 $ per miljon indata-tokens, 10 $ utdata. GPT-4o mini: 0,15 $/M indata, 0,60 $ utdata. GPT-4.5: 75 $/M indata, 150 $ utdata. Vid 10M tokens/månad (30/70-split): 25 $–13 000 $ beroende på modell.

För de flesta arbetsbelastningar: GPT-4o mini, Gemini 2.5 Flash eller Claude Haiku 4; alla under 1 $ per miljon indata-tokens. För kvalitet/pris-balans: Claude Sonnet 4 eller Gemini 2.5 Pro.

Anthropic och OpenAI stöder caching av stora indata-prompter mellan förfrågningar. Cachade tokens kostar 90 % mindre. Bäst för chatbots med stabila system-prompter eller RAG med stabil kontext.

Exakt 50 % på indata och utdata. Kräver acceptans av 24-timmars svars-SLA. Bra för: klassificering, sammanfattning, embedding, evaluering. Dåligt för: realtidschat, interaktiv UX.

Vid jämförbara kvalitetsnivåer är de ungefär lika. Claude Sonnet 4 mot GPT-4o är i stort sett jämbördigt. Claude Opus 4 med prompt caching går på ~30 % lägre kostnad än GPT-4o på arbetsbelastningar med stabila prompter.

(1) Aktivera prompt caching. (2) Använd Batch API där möjligt. (3) Routa enkla queries till mini-modeller. (4) Begränsa max_tokens aggressivt. (5) Reducera retrieval-kontext till det väsentliga.

Brytpunkten ligger runt 5 000 $/månad i API-utgifter. Under den: fortsätt med API:er. Över den: självhosting med Llama 3.1 eller Mistral kan kapa kostnaderna 50–70 % om du har infra-kompetensen.

Ta ett representativt urval på 100 förfrågningar. Mät genomsnittliga indata- och utdata-tokens. Multiplicera med månadsvolymen. Multiplicera med kostnaden per miljon. Lägg till 30 % marginal.

Endast för svåra resoneringsuppgifter där mid-tier-modeller misslyckas. För 80 % av produktionsarbetsbelastningar är Sonnet 4, GPT-4o eller Gemini 2.5 Pro fina vid 10× lägre kostnad.

Inom ±15 % för typiska arbetsbelastningar. Verklig varians kommer från variation i prompt-längd, variation i utdata-längd, fel- och retry-loopar samt routing-logik. Använd kalkylatorn som planeringsverktyg, inte som en slutlig faktura.

Liknande verktyg

Andra kalkylatorer som folk öppnar direkt efter den här; välj den som matchar ditt nästa beslut.

Få en exakt uppskattning från vårt team

Kalkylatorer ger dig ett intervall. Ett 30-minuters samtal ger dig fast omfattning, tidplan och budget. Gratis konsultation, utan förpliktelser.

Ta kontakt