Kostnadskalkulator for OpenAI-, Claude- og Gemini-API

Sammenlign månedlige kostnader på tvers av leverandører, med besparelser fra caching og batch.

API-kostnadene for GPT, Claude og Gemini ligger på 0,15 $ til 75 $ per million inndata-tokens, og utdata-tokens er typisk 3–5× dyrere. Ved 10 millioner tokens i måneden koster GPT-4o rundt 775 $, Claude Sonnet 4 rundt 1 140 $ og Gemini 2.5 Pro rundt 825 $. Prompt caching kutter kostnaden 10× på cachede tokens, og Batch API kutter kostnaden 50 % for arbeid som ikke trenger sanntid. Med denne kalkulatoren kan du modellere det eksakte forbruket ditt på tvers av alle tre leverandørene.

Åpne kalkulatoren

Dine forutsetninger

05 fields

Hvem bør bruke verktøyet

Gründere som skal avgrense et openai api-prosjekt før de snakker med leverandører. CTO-er og teknologiledere som setter opp årsbudsjett for nytt produktarbeid. Produktledere som skal gjøre en énlinjes idé om til et spenn finansavdelingen kan stå inne for. Innkjøpsteam som vil kontrollregne tilbud fra byråer og konsulenter.

Slik beregner vi

Prisene bygger på offentlig publiserte rater fra OpenAI, Anthropic og Google per 2026. Prompt caching gjelder kun cachede inndata-tokens (typisk systemprompten pluss stabil kontekst). Batch API gjelder både inndata- og utdata-tokens for arbeid som ikke skjer i sanntid, med 24-timers SLA.

Datakilder

Faktorer som påvirker tallet

Valg av modellnivå

Frontier-modeller som GPT-4.5, Claude Opus 4 og Gemini 2.5 Pro er 5 til 10 ganger dyrere per token enn mellomklassesøsknene sine. Bruk frontier kun til tung resonnering der mellomklassen virkelig kommer til kort: kompleks flerstegslogikk, matematikk, tvetydig kodegenerering eller oppgaver som krever dyp kunnskap om verden. Rut alt annet til Claude Sonnet 4, GPT-4o eller Gemini Flash. Kostnadsgapet er stort nok til at smart ruting typisk kutter forbruket 60 til 80 % på blandede arbeidslaster.

Prompt caching

Anthropic cacher inndata-tokens i 5 minutter gratis, eller 1 time mot et påslag på 25 %, og kutter kostnaden for cachede tokens med rundt 90 %. OpenAI cacher automatisk i 5 til 10 minutter på enkelte endepunkter, helt uten konfigurasjon. Caching fungerer best når systemprompten din er over 2K tokens og holder seg stabil på tvers av forespørsler, noe som beskriver de fleste chatboter og RAG-systemer i produksjon. Besparelsene er størst på arbeidslaster med lang, stabil kontekst og mange forespørsler i minuttet.

Batch API

Både OpenAI og Anthropic tilbyr batch-endepunkter til nøyaktig 50 % av standardprisen, mot at du godtar en 24-timers SLA. Batch er ideelt for klassifisering, generering av embeddings, oppsummering, evalueringskjøringer og all bakgrunnsprosessering. Integrasjonen er enkel: samme modell, samme prompt, annet endepunkt, pluss en kø som venter på resultatene. De fleste team overser batch og betaler full pris for arbeidslaster som ikke har noe sanntidskrav, og det er en av AI-kostnadene som er aller enklest å unngå.

Output-tokens

Utdata-tokens koster 3 til 5 ganger mer enn inndata-tokens hos alle leverandører, og de fleste svar trenger ikke utdata-bufferen på 4K tokens som API-et tillater som standard. Henter du ut et ja-eller-nei-svar, sett grensen til 10 tokens. Genererer du en kort oppsummering, sett den til 200. Modellen vil ofte forklare resonnementet sitt selv når du ikke ba om det, og du betaler for de forklaringene. Å stramme inn max_tokens kutter ofte utdata-kostnaden 30 til 50 % uten kvalitetstap.

Kontekstvindu er ikke lik pris

Alle de store leverandørene tar betalt per token du faktisk bruker, ikke etter hvor stort kontekstvinduet er. Å bruke et kontekstvindu på 200K til en prompt på 5K tokens koster nøyaktig det samme som å bruke et 5K-vindu til den samme prompten på 5K tokens. Konsekvensen er at modeller med lang kontekst ikke er "dyrere i bruk" med mindre du faktisk fyller konteksten. Velg modell ut fra kapasitet og pris per token, ikke ut fra hvem som har det største kontekstvinduet.

Slik reduserer du kostnaden

Aktiver prompt caching som aller første optimalisering, før alt annet. For Anthropic merker du den stabile systemprompten din med cache_control-headere, og cachede tokens faller til rundt 10 % av standard inndata-pris. For OpenAI skjer caching automatisk på enkelte endepunkter når prompt-prefikset er identisk på tvers av forespørsler. Gevinsten er størst på arbeidslaster med lang, stabil kontekst og mange forespørsler: chatboter med detaljerte personaer, RAG-systemer med gjentatt gjenfinningskontekst, og enhver agentløkke som sender det samme lange instruksjonssettet om og om igjen. De fleste team glemmer å slå på caching og betaler 5 til 10 ganger for mye.

Flytt alle arbeidslaster som ikke trenger sanntid over til Batch API. Både Anthropic og OpenAI tilbyr batch-endepunkter til nøyaktig 50 % av standardprisen mot en 24-timers svar-SLA. Klassifiseringsjobber, innholdsmoderering, generering av embeddings, oppsummeringspipelines og evalueringskjøringer er alle gode kandidater. Integrasjonsarbeidet er minimalt, siden prompt og modell er de samme. Mange team kjører hele pipelinen for innholdsmerking til standardpris, når batch ville halvert regningen uten noen kvalitetsforskjell.

Rut forespørslene etter vanskelighetsgrad. Enkle spørringer (hilsener, formatering, grunnleggende oppslag) hører hjemme på GPT-4o mini, Claude Haiku eller Gemini Flash, til $0,15 til $0,80 per million inndata-tokens. Tung resonnering hører hjemme på Claude Opus, GPT-4.5 eller Gemini Pro, til $1,25 til $75 per million. En liten klassifiserer foran modellruteren din kutter typisk kostnadene 60 til 80 % på blandede arbeidslaster. Å sende alt til en frontier-modell er den vanligste AI-kostnadstabben vi ser i produksjon.

Sett en stram grense på max_tokens. Utdata-tokens koster 3 til 5 ganger mer enn inndata-tokens, og standardbufferen på 4K er langt større enn de fleste svar trenger. Begrens ja-eller-nei-svar til 10 tokens, korte oppsummeringer til 200 og strukturert JSON til det skjemaet ditt krever pluss en liten buffer. Modellen vil av og til utbrodere selv om du ikke ba om det, og du betaler for utbroderingen. Å stramme inn max_tokens kutter utdata-kostnaden 30 til 50 % i de fleste tilfeller.

Trim gjenfunnet kontekst ned til kun det som trengs for hver spørring. RAG-systemer henter ofte 10 til 20 chunks og dytter alle inn i prompten for sikkerhets skyld. Resultatet er at du betaler for tusenvis av irrelevante tokens per forespørsel. En reranker som filtrerer ned til de 3 til 5 mest relevante chunkene kutter typisk inndata-tokenbruken med 50 til 70 % uten kvalitetstap, og ofte med kvalitetsforbedring, fordi modellen ikke distraheres av irrelevant kontekst.

Logg hver forespørsel med antall tokens, modell og om de var cachet eller ikke. Du kan ikke optimalisere det du ikke ser, og AI-kostnadene kan endre form over natten når en ny funksjon lanseres eller en prompt blir justert. Sett opp daglige forbruksvarsler. Bygg et dashbord som bryter ned forbruket etter funksjon, modell og endepunkt. De fleste kostnadssprekkene vi møter i produksjon, skjer fordi et bruksmønster endret seg to uker før noen i det hele tatt så på regningen.

Kostnad per million tokens (priser for 2026)

ModellInputOutputCachet input
GPT-4.5$75.00$150.00$37.50
GPT-4o$2.50$10.00$1.25
GPT-4o mini$0.15$0.60$0.075
Claude Opus 4$15.00$75.00$1.50
Claude Sonnet 4$3.00$15.00$0.30
Claude Haiku 4$0.80$4.00$0.08
Gemini 2.5 Pro$1.25$10.00N/A
Gemini 2.5 Flash$0.075$0.30N/A

FAQ

Spørsmål vi får hver uke

Korte svar på vanlig norsk. Mangler spørsmålet ditt,

GPT-4o: 2,50 $ per million inndata-tokens og 10 $ for utdata. GPT-4o mini: 0,15 $/M inndata, 0,60 $ utdata. GPT-4.5: 75 $/M inndata, 150 $ utdata. Ved 10M tokens i måneden med en 30/70-fordeling mellom inndata og utdata kan du vente deg 25 $ til 13 000 $, avhengig av modell.

For de fleste arbeidslaster: GPT-4o mini, Gemini 2.5 Flash eller Claude Haiku 4, alle under 1 $ per million inndata-tokens. For best balanse mellom kvalitet og pris: Claude Sonnet 4 eller Gemini 2.5 Pro.

Anthropic og OpenAI mellomlagrer store inndata-prompter mellom forespørsler. Cachede tokens koster rundt 90 % mindre enn ucachede. Best for chatboter med stabile systemprompter eller RAG med stabil kontekst.

Nøyaktig 50 % på både inndata- og utdata-tokens. Til gjengjeld må du godta en 24-timers SLA. Bra for klassifisering, oppsummering, embedding og evaluering. Dårlig for sanntidschat og interaktiv UX.

På sammenlignbare kvalitetsnivåer er kostnaden omtrent lik. Claude Sonnet 4 mot GPT-4o er nær jevnt. Claude Opus 4 med prompt caching ligger rundt 30 % under GPT-4o på arbeidslaster med stabile prompter.

(1) Aktiver prompt caching. (2) Bruk Batch API der det er mulig. (3) Rut enkle spørringer til mini-modeller. (4) Sett en stram grense på max_tokens. (5) Trim gjenfinningskonteksten ned til det aller nødvendigste.

Balansepunktet ligger rundt 5 000 $ i måneden i API-utgifter. Under det: hold deg til API-ene. Over det: selv-hosting av Llama 3.1 eller Mistral kutter kostnaden 50–70 %, forutsatt at du har infrastrukturkompetansen.

Ta et representativt utvalg på 100 forespørsler. Mål gjennomsnittlig antall inndata- og utdata-tokens. Gang med månedlig forespørselsvolum. Gang med kostnad per million tokens. Legg til 30 % sikkerhetsmargin.

Bare for tung resonnering der mellomklassemodellene feiler. For 80 % av arbeidslastene i produksjon klarer Sonnet 4, GPT-4o eller Gemini 2.5 Pro jobben fint, til 10× lavere kostnad.

Innenfor ±15 % for typiske arbeidslaster. Den reelle variasjonen kommer fra ulik prompt-lengde, ulik utdata-lengde, feil- og retry-løkker og rutinglogikk. Bruk kalkulatoren som et planleggingsverktøy, ikke som en endelig regning.

Lignende verktøy

Andre kalkulatorer folk flest åpner rett etter denne; velg den som passer din neste beslutning.

Få et nøyaktig estimat fra teamet vårt

Kalkulatorer gir deg et spenn. En 30-minutters samtale gir deg fast omfang, tidsplan og budsjett. Gratis rådgivning, helt uforpliktende.

Start samtalen