Kostencalculator voor de OpenAI-, Claude- en Gemini-API
Vergelijk de maandkosten van alle aanbieders, inclusief besparingen via caching en batch.
De API-kosten voor GPT, Claude en Gemini lopen uiteen van $0,15 tot $75 per miljoen input-tokens, waarbij output-tokens doorgaans 3 tot 5× duurder zijn. Bij 10 miljoen tokens per maand kost GPT-4o ongeveer $775, Claude Sonnet 4 ongeveer $1.140 en Gemini 2.5 Pro ongeveer $825. Prompt caching maakt gecachete tokens 10× goedkoper; de Batch API halveert de kosten voor werk dat niet realtime hoeft. Met deze calculator reken je je exacte verbruik door bij alle drie de aanbieders.
Jouw invoer
05 fieldsWie deze tool zou moeten gebruiken
Founders die een openai api-project afbakenen voordat ze met leveranciers praten. CTO’s en engineering leaders die een jaarbudget opstellen voor nieuw productwerk. Productmanagers die een idee van één regel vertalen naar een onderbouwde range voor finance. Inkoopteams die offertes van bureaus en freelancers willen toetsen.
Hoe we dit berekenen
De prijzen zijn gebaseerd op de openbaar gepubliceerde tarieven van OpenAI, Anthropic en Google per 2026. Prompt caching geldt alleen voor gecachete input-tokens (meestal de system prompt plus de stabiele context). De Batch API geldt voor zowel input- als output-tokens bij werk dat niet realtime hoeft, met een SLA van 24 uur.
Databronnen
Wat het bedrag omhoog of omlaag duwt
De keuze van de model-tier
Frontier-modellen als GPT-4.5, Claude Opus 4 en Gemini 2.5 Pro zijn 5 tot 10 keer duurder per token dan hun mid-tier varianten. Zet frontier alleen in voor zware redeneertaken waarop mid-tier echt stukloopt: complexe meerstapslogica, wiskunde, dubbelzinnige codegeneratie of taken die diepe wereldkennis vragen. Stuur al het andere naar Claude Sonnet 4, GPT-4o of Gemini Flash. Het verschil in kosten is groot genoeg dat slimme routing de uitgaven op gemengde workloads doorgaans met 60 tot 80% drukt.
Prompt caching
Anthropic bewaart input-tokens 5 minuten gratis in cache, of een uur met een toeslag van 25%, wat de kosten van gecachete tokens met grofweg 90% drukt. OpenAI cachet automatisch 5 tot 10 minuten op bepaalde endpoints, zonder dat je iets hoeft in te stellen. Caching werkt het best als je system prompt boven de 2K tokens uitkomt en stabiel blijft over verzoeken heen, wat geldt voor de meeste chatbots en RAG-systemen in productie. De besparing is het grootst bij workloads met lange, stabiele context en veel verzoeken per minuut.
Batch API
OpenAI en Anthropic bieden allebei batch-endpoints met precies 50% korting op de standaardprijs, in ruil voor een SLA van 24 uur. Batch is ideaal voor classificatie, het genereren van embeddings, samenvatten, evaluatieruns en alle achtergrondverwerking. De integratie is minimaal: hetzelfde model, dezelfde prompt, een ander endpoint en een queue die op de resultaten wacht. De meeste teams kijken eroverheen en betalen de volle prijs voor workloads die helemaal niet realtime hoeven, een van de makkelijkst te vermijden AI-kosten.
Output-tokens
Output-tokens kosten bij alle aanbieders 3 tot 5 keer meer dan input-tokens, en de meeste antwoorden hebben de standaard output-buffer van 4K tokens niet nodig. Vraag je om een ja-of-nee, begrens de output dan op 10 tokens. Genereer je een korte samenvatting, zet de limiet op 200. Het model legt zijn redenering vaak uit ook als je daar niet om vroeg, en die uitleg betaal je. max_tokens strakker zetten drukt de outputkosten vaak met 30 tot 50%, zonder verlies aan kwaliteit.
Een groter contextvenster betekent niet meer kosten
Alle grote aanbieders rekenen per verbruikt token, niet per grootte van het contextvenster. Een venster van 200K gebruiken voor een prompt van 5K tokens kost precies hetzelfde als een venster van 5K gebruiken voor diezelfde 5K tokens. Met andere woorden: long-context modellen zijn niet "duurder in gebruik", tenzij je dat venster ook echt vult. Kies je model op capaciteit en prijs per token, niet op wie het grootste contextvenster heeft.
Hoe je kosten verlaagt
Schakel prompt caching als allereerste optimalisatie in, nog vóór al het andere. Markeer bij Anthropic je stabiele system prompt met cache_control-headers, en de gecachete tokens zakken naar grofweg 10% van de standaard inputprijs. Bij OpenAI gebeurt caching automatisch op bepaalde endpoints zodra je prompt-prefix over de verzoeken heen identiek is. De winst is het grootst bij workloads met lange, stabiele context en veel verzoeken: chatbots met uitgebreide persona's, RAG-systemen met steeds dezelfde retrieval-context en elke agent-loop die een lange instructieset telkens opnieuw meestuurt. De meeste teams vergeten caching aan te zetten en betalen 5 tot 10 keer te veel.
Verplaats elke workload die niet realtime hoeft naar de Batch API. Anthropic en OpenAI bieden allebei batch-endpoints tegen precies 50% van de standaardprijs, in ruil voor een antwoord-SLA van 24 uur. Classificatie, content-moderatie, het genereren van embeddings, samenvattingspipelines en evaluatieruns zijn allemaal geschikte kandidaten. Het integratiewerk is minimaal, want prompt en model blijven hetzelfde. Teams draaien hun hele content-taggingpipeline routineus op de standaardprijs, terwijl batch de rekening zou halveren zonder enig verschil in kwaliteit.
Routeer verzoeken op moeilijkheid. Simpele queries (begroetingen, opmaak, eenvoudige lookups) horen thuis op GPT-4o mini, Claude Haiku of Gemini Flash, voor $0,15 tot $0,80 per miljoen input-tokens. Zware redeneertaken horen op Claude Opus, GPT-4.5 of Gemini Pro, voor $1,25 tot $75 per miljoen. Een kleine classifier vóór je model-router drukt de kosten op gemengde workloads doorgaans met 60 tot 80%. Alles naar een frontier-model sturen is de meest voorkomende kostenfout die we in productie zien.
Begrens max_tokens streng. Output-tokens kosten 3 tot 5 keer meer dan input-tokens, en de standaard output-buffer van 4K is veel groter dan de meeste antwoorden nodig hebben. Zet ja-of-nee-antwoorden op 10 tokens, korte samenvattingen op 200 en gestructureerde JSON op wat je schema vraagt plus een kleine marge. Het model wil soms uitweiden ook als je daar niet om vroeg, en die uitweidingen betaal je. max_tokens strakker zetten levert in de meeste gevallen 30 tot 50% lagere outputkosten op.
Beperk de opgehaalde context tot precies wat een query nodig heeft. RAG-systemen halen vaak 10 tot 20 chunks op en proppen ze voor de zekerheid allemaal in de prompt. Het gevolg: je betaalt per verzoek voor duizenden irrelevante tokens. Een reranker die terugfiltert naar de 3 tot 5 meest relevante chunks drukt het input-tokengebruik doorgaans met 50 tot 70% zonder kwaliteitsverlies, vaak zelfs met kwaliteitswinst, omdat het model niet wordt afgeleid door overbodige context.
Log elk verzoek met het aantal tokens, het model en de gecachete versus ongecachete status. Je kunt niet optimaliseren wat je niet ziet, en AI-kosten kunnen van de ene dag op de andere van vorm veranderen zodra er een nieuwe feature live gaat of een prompt wordt aangepast. Stel dagelijkse uitgavenmeldingen in en bouw een dashboard dat de kosten uitsplitst per feature, model en endpoint. De meeste kostenoverschrijdingen die we in productie tegenkomen, ontstaan doordat een gebruikspatroon al twee weken was verschoven voordat iemand naar de rekening keek.
Kosten per miljoen tokens (prijzen 2026)
| Model | Input | Output | Gecachete input |
|---|---|---|---|
| GPT-4.5 | $75.00 | $150.00 | $37.50 |
| GPT-4o | $2.50 | $10.00 | $1.25 |
| GPT-4o mini | $0.15 | $0.60 | $0.075 |
| Claude Opus 4 | $15.00 | $75.00 | $1.50 |
| Claude Sonnet 4 | $3.00 | $15.00 | $0.30 |
| Claude Haiku 4 | $0.80 | $4.00 | $0.08 |
| Gemini 2.5 Pro | $1.25 | $10.00 | N/A |
| Gemini 2.5 Flash | $0.075 | $0.30 | N/A |
FAQ
Vragen die we elke week krijgen
Korte antwoorden in duidelijke taal. Staat je vraag er niet bij,
GPT-4o: $2,50 per miljoen input-tokens, $10 voor output. GPT-4o mini: $0,15/M input, $0,60 output. GPT-4.5: $75/M input, $150 output. Bij 10M tokens per maand met een 30/70-verdeling input/output reken je op $25 tot $13.000, afhankelijk van het model.
Voor de meeste workloads: GPT-4o mini, Gemini 2.5 Flash of Claude Haiku 4, allemaal onder de $1 per miljoen input-tokens. Voor de beste verhouding tussen kwaliteit en prijs: Claude Sonnet 4 of Gemini 2.5 Pro.
Anthropic en OpenAI bewaren grote input-prompts in cache tussen verzoeken. Gecachete tokens kosten ongeveer 90% minder dan ongecachete. Ideaal voor chatbots met een vaste system prompt of voor RAG met stabiele context.
Precies 50% op zowel input- als output-tokens, in ruil voor een response-SLA van 24 uur. Goed voor classificatie, samenvatten, embeddings en evaluatie. Niet geschikt voor realtime chat of interactieve UX.
Bij vergelijkbare kwaliteitsniveaus liggen de kosten dicht bij elkaar. Claude Sonnet 4 en GPT-4o ontlopen elkaar nauwelijks. Claude Opus 4 met prompt caching is bij workloads met een stabiele prompt zo’n 30% goedkoper dan GPT-4o.
(1) Schakel prompt caching in. (2) Gebruik de Batch API waar het kan. (3) Stuur eenvoudige queries naar mini-modellen. (4) Begrens max_tokens streng. (5) Beperk de retrieval-context tot het essentiële.
Het break-evenpunt ligt rond de $5.000 per maand aan API-uitgaven. Daaronder kun je beter API’s blijven gebruiken. Daarboven kan zelf Llama 3.1 of Mistral hosten de kosten met 50 tot 70% drukken, mits je de infra-expertise in huis hebt.
Neem een representatieve steekproef van 100 verzoeken. Meet het gemiddelde aantal input- en output-tokens. Vermenigvuldig dat met je maandelijkse verzoekvolume en vervolgens met de kosten per miljoen tokens. Tel er 30% veiligheidsmarge bij op.
Alleen voor zware redeneertaken waarop mid-tier modellen stuklopen. Voor 80% van de productieworkloads volstaan Sonnet 4, GPT-4o of Gemini 2.5 Pro prima, tegen 10× lagere kosten.
Binnen ±15% voor typische workloads. De werkelijke afwijking komt door schommelingen in prompt- en outputlengte, fout- en retry-loops en je routinglogica. Gebruik de calculator als planningshulp, niet als definitieve voorspelling van je rekening.
Vergelijkbare tools
Andere calculators die mensen meestal meteen hierna openen; kies degene die past bij je volgende beslissing.
Eenmalige bouwkosten plus wat het maandelijks kost om te draaien; het complete plaatje.
Krijg een precieze schatting van ons team
Een calculator geeft je een range. Een gesprek van 30 minuten geeft een vaste scope, planning en budget. Gratis advies, vrijblijvend.
Start het gesprek