OpenAI, Claude & Gemini API omkostningskalkulator
Sammenlign månedlige omkostninger på tværs af udbydere med caching- og batch-besparelser.
API-omkostningerne for GPT, Claude og Gemini ligger på mellem $0,15 og $75 pr. million input-tokens, mens output-tokens typisk er 3–5× dyrere. Ved 10 millioner tokens om måneden koster GPT-4o cirka $775, Claude Sonnet 4 cirka $1.140 og Gemini 2.5 Pro cirka $825. Prompt-caching sænker omkostningerne med en faktor 10 på cachede tokens, og Batch API halverer prisen på arbejde, der ikke kører i realtid. Med denne lommeregner kan du modellere dit præcise forbrug på tværs af alle tre udbydere.
Dine input
05 fieldsHvem skal bruge dette værktøj
Grundlæggere, der kortlægger et openai api-projekt, før de taler med leverandører. CTO'er og ingeniørledere, der opstiller årlige budgetter til ny produktudvikling. Produktledere, der oversætter en enkelt idé til et forsvarligt interval til økonomiafdelingen. Indkøbsafdelinger, der tjekker tilbud fra bureauer og freelancere for sundhed.
Sådan beregner vi tallene
Priserne bygger på de offentligt tilgængelige takster fra OpenAI, Anthropic og Google fra 2026. Promptcaching gælder kun for cachede input-tokens (typisk systemprompten + stabil kontekst). Batch-API gælder for både input- og output-tokens til ikke-realtidsarbejde med en SLA på 24 timer.
Datakilder
Faktorer, der påvirker prisen
Valg af modeltier
Frontiermodeller som GPT-4.5, Claude Opus 4 og Gemini 2.5 Pro koster 5 til 10 gange mere pr. token end deres mellemklasse-søskende. Brug kun frontier til svære ræsonneringsopgaver, hvor mellemklassen reelt kommer til kort: kompleks flertrinslogik, matematik, tvetydig kodegenerering eller opgaver, der kræver dyb verdensviden. Send alt andet til Claude Sonnet 4, GPT-4o eller Gemini Flash. Prisforskellen er stor nok til, at intelligent routing typisk skærer 60 til 80 % af udgifterne på blandede workloads.
Prompt-caching
Anthropic cacher input-tokens gratis i 5 minutter eller i 1 time mod et tillæg på 25 %, hvilket skærer prisen på cachede tokens med cirka 90 %. OpenAI cacher automatisk i 5 til 10 minutter på visse endpoints uden nogen konfiguration. Caching fungerer bedst, når din systemprompt er over 2K tokens og stabil på tværs af forespørgsler, hvilket beskriver de fleste produktionschatbots og RAG-systemer. Besparelsen er størst på workloads med lang, stabil kontekst og mange forespørgsler i minuttet.
Batch API
Både OpenAI og Anthropic tilbyder batch-endpoints til præcis 50 % rabat på standardprisen mod en SLA på 24 timer. Batch er ideelt til klassificering, generering af embeddings, opsummering, evalueringskørsler og al slags baggrundsbehandling. Integrationen er triviel: samme model, samme prompt, andet endpoint, plus en kø til at vente på resultaterne. De fleste teams overser batch og betaler fuld pris for workloads uden noget reelt realtidskrav, hvilket er en af de nemmeste AI-udgifter at undgå.
Output-tokens
Output-tokens koster 3 til 5 gange mere end input-tokens hos alle udbydere, og de fleste svar har ikke brug for den buffer på 4K tokens, som API'et tillader som standard. Hvis du udtrækker et ja-eller-nej-svar, så sæt output til højst 10 tokens. Hvis du genererer en kort opsummering, så sæt den til 200. Modellen vil ofte forklare sin ræsonnering, selv når du ikke har bedt om det, og du betaler for de forklaringer. At stramme max_tokens skærer ofte 30 til 50 % af outputomkostningerne uden nogen påvirkning af kvaliteten.
Context window svarer ikke til pris
Alle store udbydere tager betaling pr. token, der bruges – ikke efter kontekstvinduets størrelse. Det koster præcis det samme at bruge et 200K-kontekstvindu til en prompt på 5K tokens som at bruge et 5K-kontekstvindu til en prompt på 5K tokens. Det betyder, at modeller med lang kontekst ikke er "dyrere at bruge", medmindre du rent faktisk fylder konteksten op. Vælg model ud fra evner og pris pr. token – ikke ud fra, hvilket kontekstvindu der er størst.
Sådan reducerer du omkostningerne
Aktivér promptcaching som det første, du optimerer – før alt andet. Hos Anthropic markerer du din stabile systemprompt med cache_control-headers, og cachede tokens falder til cirka 10 % af standardprisen for input. Hos OpenAI sker caching automatisk på visse endpoints, når dit promptpræfiks er identisk på tværs af forespørgsler. Gevinsten er størst ved workloads med lang, stabil kontekst og mange forespørgsler: chatbots med detaljerede personaer, RAG-systemer med gentaget retrieval-kontekst og alle agent-loops, der gensender et langt sæt instruktioner. De fleste teams glemmer at slå caching til og betaler 5 til 10 gange for meget.
Flyt alle workloads, der ikke kræver realtid, over på Batch API'et. Både Anthropic og OpenAI tilbyder batch-endpoints til præcis 50 % af standardprisen mod en responstid på 24 timer. Klassificeringsjobs, indholdsmoderation, generering af embeddings, opsummeringspipelines og evalueringskørsler er alle gode kandidater. Integrationsarbejdet er minimalt, fordi prompt og model er uændrede. Teams kører rutinemæssigt hele deres content tagging-pipeline til standardpris, selvom batch ville halvere regningen uden den mindste forskel i kvalitet.
Route forespørgsler efter sværhedsgrad. Simple forespørgsler (hilsner, formatering, simple opslag) hører hjemme på GPT-4o mini, Claude Haiku eller Gemini Flash til $0,15 til $0,80 pr. million input-tokens. Svær ræsonnering hører hjemme på Claude Opus, GPT-4.5 eller Gemini Pro til $1,25 til $75 pr. million. En lille klassifikator foran din modelrouter skærer typisk 60 til 80 % af omkostningerne ved blandede workloads. At sende alt til en frontier-model er den mest almindelige AI-omkostningsfejl, vi ser i produktion.
Sæt et stramt loft over max_tokens. Output-tokens koster 3 til 5 gange mere end input-tokens, og standardbufferen på 4K output er langt større, end de fleste svar har brug for. Sæt loftet for ja/nej-svar til 10 tokens, korte opsummeringer til 200 og struktureret JSON til det, dit schema kræver, plus en lille buffer. Modellen vil nogle gange uddybe, selvom du ikke har bedt om det, og du betaler for de uddybninger. At stramme max_tokens giver i de fleste tilfælde en besparelse på 30 til 50 % på output-omkostningerne.
Skær den hentede kontekst ned til kun det, der er brug for pr. forespørgsel. RAG-systemer henter ofte 10 til 20 chunks og propper dem alle i prompten for en sikkerheds skyld. Resultatet er, at du betaler for tusindvis af irrelevante tokens pr. forespørgsel. Tilføjer du en reranker, der filtrerer ned til de 3 til 5 mest relevante chunks, skærer det typisk input-tokenforbruget med 50 til 70 % uden tab af kvalitet – ofte med en forbedring, fordi modellen ikke distraheres af irrelevant kontekst.
Log alle forespørgsler med tokenantal, model og status for cachede versus ikke-cachede tokens. Du kan ikke optimere det, du ikke kan se, og AI-omkostninger kan ændre sig fra den ene dag til den anden, når en ny feature sendes ud, eller en prompt justeres. Opsæt daglige advarsler om forbrug. Byg et dashboard, der fordeler forbruget på feature, model og endpoint. De fleste overskridelser af omkostningerne i produktion, vi støder på, sker, fordi et brugsmønster ændrede sig to uger før, nogen kiggede på regningen.
Pris per million tokens (prissætning fra 2026)
| Model | Input | Output | Cachelagret input |
|---|---|---|---|
| GPT-4.5 | $75,00 | $150,00 | $37,50 |
| GPT-4o | $2,50 | $10,00 | $1,25 |
| GPT-4o mini | $0,15 | $0,60 | $0,075 |
| Claude Opus 4 | $15,00 | $75,00 | $1,50 |
| Claude Sonnet 4 | $3,00 | $15,00 | $0,30 |
| Claude Haiku 4 | $0,80 | $4,00 | $0,08 |
| Gemini 2.5 Pro | $1,25 | $10,00 | N/A |
| Gemini 2.5 Flash | $0,075 | $0,30 | N/A |
Ofte stillede spørgsmål
Spørgsmål vi får hver uge
Korte svar på dansk. Hvis dit spørgsmål ikke er her,
GPT-4o: $2,50 pr. million input-tokens, $10 for output. GPT-4o mini: $0,15/M input, $0,60 output. GPT-4.5: $75/M input, $150 output. Ved 10 millioner tokens om måneden med en 30/70-fordeling mellem input og output skal du forvente $25–$13.000 afhængigt af modellen.
Til de fleste opgaver: GPT-4o mini, Gemini 2.5 Flash eller Claude Haiku 4 – alle til under $1 pr. million input-tokens. Vil du have den bedste balance mellem kvalitet og pris, så vælg Claude Sonnet 4 eller Gemini 2.5 Pro.
Anthropic og OpenAI cacher store input-prompts på tværs af forespørgsler. Cachede tokens koster cirka 90 % mindre end ikke-cachede. Det er ideelt til chatbots med stabile system-prompts eller RAG med fast kontekst.
Præcis 50 % på både input- og output-tokens. Det kræver, at du accepterer en SLA på 24 timer. Godt til klassificering, opsummering, embedding og evaluering. Mindre velegnet til realtidschat eller interaktiv UX.
På sammenlignelige kvalitetsniveauer er prisen nogenlunde den samme. Claude Sonnet 4 og GPT-4o ligger ret tæt. Claude Opus 4 med prompt-caching er cirka 30 % billigere end GPT-4o på opgaver med stabile prompts.
(1) Slå prompt-caching til. (2) Brug Batch API, hvor det er muligt. (3) Send enkle forespørgsler til mini-modeller. (4) Sæt max_tokens stramt. (5) Skær retrieval-konteksten ned til det væsentligste.
Break-even ligger på cirka $5.000 om måneden i API-forbrug. Under det: fortsæt med at bruge API'er. Over det: Selvhosting af Llama 3.1 eller Mistral kan sænke omkostningerne med 50–70 %, hvis du har den nødvendige ekspertise inden for infrastruktur.
Tag en repræsentativ stikprøve på 100 forespørgsler. Mål det gennemsnitlige antal input- og output-tokens. Gang med det månedlige antal forespørgsler. Gang med prisen pr. million tokens. Læg en sikkerhedsmargin på 30 % til.
Kun til tung ræsonnering, hvor mellemklassemodeller kommer til kort. Til 80 % af alle produktionsworkloads klarer Sonnet 4, GPT-4o eller Gemini 2.5 Pro opgaven fint til en tiendedel af prisen.
Inden for ±15 % for typiske workloads. Variationen i praksis skyldes svingende prompt- og outputlængder, fejl- og forsøgssløjfer samt routinglogik. Brug lommeregneren som et planlægningsværktøj, ikke som en endelig regning.
Lignende værktøjer
Andre kalkulatorer, de fleste åbner straks efter denne; vælg den, der passer til din næste beslutning.
Udviklingsomkostninger plus løbende driftsomkostninger; det fulde overblik.
Få et præcist estimat fra vores team
Kalkulatorer giver dig et interval. Et 30-minutters opkald giver dig et fast omfang, en tidsplan og et budget. Gratis konsultation, ingen forpligtelser.
Start samtalen