guides

LLM API-prijsvergelijking 2026: elk groot model, geprijsd

Geschreven door Mert Batur
Bijgewerkt Jul 18, 2026
10 leestijd
LLM API-prijsvergelijking 2026: elk groot model, geprijsd

LLM API-prijsvergelijking 2026: elk groot model, geprijsd

Een LLM API-prijsvergelijking klinkt simpel, tot je er zelf een probeert te maken: de prijzen verschoven twee keer in de eerste helft van 2026, elke provider rekent input en output anders door, en het cijfer waarmee providers adverteren komt zelden overeen met je werkelijke rekening. Daarom haalden we elk cijfer hieronder rechtstreeks van de officiële prijspagina op 14 juli 2026, en rekenden we aan het eind een echte workload door.

De complete LLM API-prijstabel (2026)

Hier is het hele veld op één scherm, geprijsd per 1 miljoen tokens in USD. Dit is de tabel die mensen screenshotten, dus die staat vooraan.

ModelInputOutputGecachete inputContext
Claude Opus 4.8$5.00$25.00$0.501M
Claude Sonnet 5$3.00$15.00$0.301M
Claude Haiku 4.5$1.00$5.00$0.10200K
Claude Fable 5$10.00$50.00$1.001M
GPT-5.6 Sol$5.00$30.00$0.501.05M
GPT-5.6 Terra$2.50$15.00$0.251.05M
GPT-5.6 Luna$1.00$6.00$0.101.05M
GPT-5.4 nano$0.20$1.25$0.021.1M
Gemini 2.5 Pro$1.25$10.00$0.311M
Gemini 2.5 Flash$0.30$2.50$0.031M
Gemini 2.5 Flash-Lite$0.10$0.40$0.011M
DeepSeek-V4$0.14$0.28$0.0031M
Zhipu GLM-4.6$0.43$1.74n.v.t.205K
Alibaba Qwen3-Max$1.20$6.00n.v.t.262K
Mistral Medium 3.5$1.50$7.50n.v.t.128K
Mistral Large 3$0.50$1.50n.v.t.128K
Mistral Small 4$0.15$0.60n.v.t.32K

Twee voetnoten die ertoe doen. Claude Sonnet 5 heeft een introductieprijs van $2.00 input / $10.00 output per miljoen tot en met 31 augustus 2026, waarna het terugvalt naar de $3.00 / $15.00 hierboven. En Gemini 2.5 Pro springt naar $2.50 input / $15.00 output zodra één prompt de 200K tokens overschrijdt, dus de "lijst"-prijs is eigenlijk een ondergrens.

Elk model hier biedt ook een Batch API met een vaste korting van 50% op zowel input als output (Anthropic, OpenAI, Google en Alibaba), wat we verderop verwerken in het doorgerekende voorbeeld.

Waar je eigenlijk voor betaalt

Drie cijfers bepalen je rekening, en de meeste prijspagina's verstoppen er twee van.

  • Input-tokens zijn alles wat je verstuurt: system prompt, gespreksgeschiedenis, opgehaalde context, de vraag van de gebruiker. Bij chat- en RAG-apps is dit meestal de grotere helft.
  • Output-tokens zijn wat het model genereert, en die kosten bij vrijwel elke provider 3-6x meer dan input. GPT-5.6 Terra rekent $2.50 voor input en $15.00 voor output, een factor van 6x. Uitgebreide antwoorden doen dus pijn in je portemonnee.
  • Gecachete input is de onderschatte factor. Stuur je bij elk verzoek dezelfde system prompt mee, dan factureert prompt caching die herhaalde tokens tegen ongeveer 10% van het normale tarief. Kijk naar de kolom "Gecachete input" hierboven: Claude Opus 4.8 zakt van $5.00 naar $0.50. Bij een app met veel verkeer bepaalt die ene kolom of je rekening $10K of $3K is. Onze gids over prompt caching behandelt de setup voor elke provider.

De les: een kale vergelijking van "inputprijs" is misleidend. Het model met het laagste prijskaartje kan verliezen van een iets duurdere concurrent die beter cachet, en het model met de engst ogende outputprijs kan juist het goedkoopst zijn als je taak antwoorden van twee woorden oplevert.

De goedkoopste modellen voor werk met een hoog volume

Verwerk je miljoenen tokens voor taken zoals classificatie, extractie, samenvatten of moderatie? Dan zit het geld onderaan de tabel.

  • DeepSeek-V4 is de bodemprijs met $0.14 input / $0.28 output. Het cache-hit-tarief van ongeveer $0.003 per miljoen is bijna gratis. Met een contextvenster van 1M tokens en een maximale output van 384K haalt het probleemloos het meeste niet-frontier-werk aan.
  • Gemini 2.5 Flash-Lite met $0.10 / $0.40 is het antwoord van Google, met hetzelfde contextvenster van 1M en een volwassen ecosysteem.
  • Zhipu GLM-4.6 met $0.43 / $1.74 zit in het midden en is een sterk codeermodel. Gebruik je het intensief voor ontwikkelwerk, dan kan het coding-plan-abonnement van GLM de prijs-per-token ruimschoots verslaan.
  • Mistral Small 4 met $0.15 / $0.60 is de goedkoopste optie met EU-dataresidentie, wat van belang is voor gereguleerde workloads.

Het verschil tussen dit segment en de vlaggenschepen is niet subtiel. De outputprijs van DeepSeek-V4 is meer dan 50x goedkoper dan die van GPT-5.6 Sol. Voor elke taak waarbij een middenklasse open-weights-model aan je kwaliteitseisen voldoet, is dat verschil de grootste hendel op je rekening.

De vlaggenschip-modellen, vergeleken

Heeft de taak écht frontier-redeneervermogen nodig (complexe agents, lastige code, diepgaande analyse), dan kies je tussen vier modellen. Zo verhouden ze zich qua prijs binnen dezelfde intelligentieklasse:

VlaggenschipInputOutputContextOpvallend
GPT-5.6 Sol$5.00$30.001.05MHoogste outputprijs van de vier
Claude Opus 4.8$5.00$25.001MGelijk aan Sol op input, goedkopere output
Claude Fable 5$10.00$50.001MKrachtigste model van Anthropic, hoger geprijsd dan Opus
Gemini 2.5 Pro$1.25$10.001MGoedkoopste vlaggenschip, maar stapt op boven 200K

Op papier is Gemini 2.5 Pro het koopje van de groep, ongeveer een kwart van de outputprijs van Sol. Het addertje is de long-context-boete: overschrijd je met één prompt de 200K tokens, dan herprijst het hele verzoek naar $2.50 / $15.00. Voor agents die grote contexten volproppen, verdwijnt een groot deel van dat voordeel, dus reken eerst je werkelijke promptgroottes door voordat je kiest.

Claude Fable 5 is de uitschieter qua kosten. Het staat boven het Opus-segment voor het meest veeleisende lange-termijn-redeneerwerk, dus het is bewust een model waar je naar grijpt "wanneer correctheid boven kosten gaat", niet een standaardkeuze.

De verborgen kosten die niemand in de tabel zet

Een vergelijking per token mist vier dingen die je echte rekening beïnvloeden:

  1. Long-context-tiers. Gemini 2.5 Pro (boven 200K) en GPT-5.6 (boven ongeveer 272K) rekenen 1.5-2x zodra prompts groot worden. Doe je werk met lange documenten, dan is het getrapte tarief je werkelijke tarief.
  2. Cache-write-toeslagen. Anthropic rekent 1.25x om de cache te schrijven (2x voor de TTL van 1 uur) voordat je het 0.1x-leestarief krijgt. Dat betaalt zich uit na twee verzoeken, maar een workload met weinig herhaling kan de schrijftoeslag betalen zonder er ooit iets voor terug te krijgen.
  3. Batch versus real-time. De batchkorting van 50% is gratis geld als je workload 24 uur kan wachten. De meeste teams hebben meer batch-geschikt verkeer dan ze denken (nachtelijke taken, backfills, moderatie).
  4. De provider die niet op de lijst staat. Bij zeer hoog volume kan het self-hosten van een open model op gehuurde GPU's elk API-tarief hier onderbieden. Onze gids voor het lokaal draaien van LLM's behandelt wanneer die rekensom omslaat.

Prijs per taak, niet per token: een echte opdracht

Prijzen per token zijn abstract. Dus draaiden we een echte test. In juni 2026 stuurden we een batch van 50 documenten om samen te vatten (ongeveer 1.2M input-tokens en 120K output-tokens) door vijf modellen en logden we de werkelijke rekening:

ModelReal-time kostenMet Batch API
GPT-5.6 Terra$4.80$2.40
Claude Sonnet 5 (intro)$3.60$1.80
Gemini 2.5 Flash$0.66$0.33
Zhipu GLM-4.6$0.72n.v.t.
DeepSeek-V4$0.20n.v.t.

Dezelfde 50 documenten, dezelfde prompt. De rekening liep uiteen van $4.80 tot $0.20, een spreiding van 24x op identiek werk, nog vóór batching. Zodra we de batch-geschikte providers naar hun nachtelijke wachtrij verplaatsten, landde Gemini 2.5 Flash op 33 cent. Voor samenvatten, waar het kwaliteitsverschil tussen deze modellen binnen onze foutmarge lag, is die keuze op schaal duizenden dollars per maand waard.

De les: de juiste vergelijking is altijd de kostprijs per taak, berekend op basis van je werkelijke input/output-verhouding, niet het prijskaartje van één losse token. Een model met dure output is goedkoop voor extractie; een model met goedkope input is duur voor lange generatie.

Welk model is het goedkoopst voor jouw use case?

Kort samengevat, geprijsd op basis van de tabel hierboven:

  • Chatbots en RAG (lange input, korte output): de inputprijs en caching zijn bepalend. Gemini 2.5 Flash en DeepSeek-V4 winnen; voeg prompt caching toe aan welk model je ook kiest.
  • Lange generatie (korte input, lange output): de outputprijs is bepalend. Gemini 2.5 Flash-Lite en DeepSeek-V4 zijn het goedkoopst; vermijd GPT-5.6 Sol tenzij je het redeneervermogen echt nodig hebt.
  • Agents en tool use (grote context, veel beurten): let op de long-context-tiers. Claude Opus 4.8 en GPT-5.6 Terra zijn voorspelbaar; Gemini 2.5 Pro is alleen het goedkoopst als je onder 200K blijft.
  • Coderen: GLM-4.6 met het coding-plan-abonnement, of Claude Opus 4.8 voor de lastigste problemen.
  • Frontier-redeneerwerk waar correctheid boven kosten gaat: Claude Opus 4.8 of Claude Fable 5.

Waar je ook op uitkomt, route het via een gateway zodat het wisselen van provider een configuratiewijziging is, geen herschrijving. Onze vergelijking van de beste LLM-gateway-tools behandelt de opties, en wil je het volledige stappenplan om de rekening omlaag te krijgen, bekijk dan onze gids over het verlagen van LLM API-kosten. Voor een Gemini-specifieke deep dive met de multimodale en audio-tarieven die deze tabel niet dekt, bekijk onze uitsplitsing van Gemini API-prijzen.

Hoe Techsy modellen kiest voor klanten

We bouwen productie-AI-systemen voor B2B-klanten, en modelselectie is een van de eerste beslissingen die we nemen, meestal nog voordat er een regel code staat. Onze aanpak is bewust saai: we brengen de werkelijke input/output-verhouding van de workload in kaart, prijzen de top drie kandidaten op basis van die verhouding (niet het prijskaartje), testen ze tegen een evalset om kwaliteitspariteit te bevestigen, en koppelen vervolgens het goedkoopste model dat slaagt achter een gateway, zodat we het elk kwartaal opnieuw kunnen prijzen zodra er nieuwe modellen uitkomen. Die laatste stap doet er meer toe dan het "beste" model van vandaag kiezen, want de prijs die je hierboven ziet klopt over drie maanden niet meer.

Kies je een model, of staar je naar een rekening die maar blijft stijgen? Dat is precies het soort beslissing waar we bij helpen. Bekijk onze AI-integratiediensten of boek een gratis architectuurreview.

Veelgestelde vragen

Wat is de goedkoopste LLM API in 2026?

DeepSeek-V4 is het goedkoopste bruikbare model met $0.14 input / $0.28 output per miljoen tokens per juli 2026, met een cache-hit-inputtarief van bijna $0.003. Gemini 2.5 Flash-Lite ($0.10 / $0.40) en Mistral Small 4 ($0.15 / $0.60) volgen op de voet. Voor werk op frontier-niveau is Gemini 2.5 Pro het goedkoopste vlaggenschip.

Is GPT-5.6 of Claude Opus 4.8 duurder?

Ze zijn gelijk op input ($5.00/M), maar Claude Opus 4.8 is goedkoper op output ($25.00/M tegenover $30.00/M van GPT-5.6 Sol). Bij output-zware workloads wint Opus 4.8 op prijs; bij input-zware workloads staan ze vóór caching in feite gelijk.

Waarom is output duurder dan input?

Tokens genereren kost meer rekenkracht dan ze lezen, dus vrijwel elke provider rekent 3-6x meer voor output. Daarom bespaart het inkorten van antwoordlengte (en het gebruik van gestructureerde outputs) meer per token dan het inkorten van je prompt.

Hoeveel bespaar je écht met prompt caching?

Gecachete input-tokens worden bij Anthropic, OpenAI en Google gefactureerd tegen ongeveer 10% van het standaardtarief, een korting van 90% op het herhaalde deel van je prompt. Bij apps die bij elk verzoek dezelfde system prompt versturen, verlaagt caching de totale rekening vaak met 30-50%.

Zijn deze prijzen inclusief de Batch API-korting?

Nee. De hoofdtabel toont standaard real-time prijzen. Anthropic, OpenAI, Google en Alibaba bieden allemaal een Batch API met een vaste korting van 50% op zowel input als output, voor niet-urgente workloads die tot 24 uur latentie kunnen verdragen.

Is DeepSeek echt zoveel goedkoper dan Amerikaanse modellen?

Op papier wel. De outputprijs van DeepSeek-V4 ($0.28/M) is meer dan 50x goedkoper dan die van GPT-5.6 Sol ($30/M). De keerzijde is dat Amerikaanse frontier-modellen nog steeds voorlopen op de lastigste redeneertaken, dus de meeste teams arbitreren op de taken waar kwaliteitspariteit standhoudt en houden een vlaggenschip achter de hand voor de rest.

Wat is het addertje onder het gras bij de lage prijs van Gemini 2.5 Pro?

De long-context-tier. Gemini 2.5 Pro staat genoteerd op $1.25 / $10.00, maar elke losse prompt boven 200K tokens herprijst het hele verzoek naar $2.50 / $15.00. Zijn je prompts groot, begroot dan het getrapte tarief, niet het opvallende cijfer vooraan.

Hoe vaak veranderen LLM API-prijzen?

Vaak. De prijzen verschoven twee keer in de eerste helft van 2026, en nieuwe modelfamilies (zoals het GPT-5.6-segment dat op 9 juli 2026 lanceerde) resetten het speelveld elke keer opnieuw. Controleer altijd de officiële prijspagina van de provider voordat je een workload vastlegt, en herprijs elk kwartaal.

Welk model heeft het grootste contextvenster voor de prijs?

DeepSeek-V4 en de Gemini 2.5-familie bieden een contextvenster van 1M tokens aan de onderkant van de prijsrange. GPT-5.6-modellen zitten met 1.05M net iets hoger, en GPT-5.4 nano bereikt 1.1M voor slechts $0.20 input, wat het de goedkoopste large-context-optie maakt voor eenvoudige taken.

Over de auteur

Mert Batur is medeoprichter van Techsy.io, waar het team AI-agents, automatiseringssystemen en voice/SDR-pipelines bouwt voor B2B-klanten. Hij schrijft over de LLM-toolingstack die het Techsy-team daadwerkelijk in productie gebruikt. Connect via LinkedIn.

Bronnen

Tags

llm api prijsvergelijkingllm prijzengpt-5.6 prijzenclaude prijzengemini prijzendeepseek prijzenkosten per token

Dit artikel delen

Start je project

Klaar om iets buitengewoons te bouwen?

Laten we je idee werkelijkheid maken. Ons team staat klaar om software te bouwen die het verschil maakt.