
LLM API-prissammenligning 2026: Alle store modeller priset
En LLM API-prissammenligning høres enkelt ut helt til du faktisk skal lage en: prisene endret seg to ganger i første halvår av 2026, hver leverandør priser inndata og utdata ulikt, og «hovedtallet» stemmer sjelden med den faktiske regningen din. Så vi hentet hvert eneste tall nedenfor rett fra den offisielle prissiden 14. juli 2026, og regnet ut kostnaden for en reell arbeidsmengde til slutt.
Den komplette LLM API-pristabellen (2026)
Her er hele feltet på én skjerm, priset per 1 million tokens i USD. Dette er tabellen folk tar skjermbilde av, så den kommer først.
| Modell | Inndata | Utdata | Cachet inndata | Kontekst |
|---|---|---|---|---|
| Claude Opus 4.8 | $5.00 | $25.00 | $0.50 | 1M |
| Claude Sonnet 5 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Haiku 4.5 | $1.00 | $5.00 | $0.10 | 200K |
| Claude Fable 5 | $10.00 | $50.00 | $1.00 | 1M |
| GPT-5.6 Sol | $5.00 | $30.00 | $0.50 | 1.05M |
| GPT-5.6 Terra | $2.50 | $15.00 | $0.25 | 1.05M |
| GPT-5.6 Luna | $1.00 | $6.00 | $0.10 | 1.05M |
| GPT-5.4 nano | $0.20 | $1.25 | $0.02 | 1.1M |
| Gemini 2.5 Pro | $1.25 | $10.00 | $0.31 | 1M |
| Gemini 2.5 Flash | $0.30 | $2.50 | $0.03 | 1M |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | $0.01 | 1M |
| DeepSeek-V4 | $0.14 | $0.28 | $0.003 | 1M |
| Zhipu GLM-4.6 | $0.43 | $1.74 | n/a | 205K |
| Alibaba Qwen3-Max | $1.20 | $6.00 | n/a | 262K |
| Mistral Medium 3.5 | $1.50 | $7.50 | n/a | 128K |
| Mistral Large 3 | $0.50 | $1.50 | n/a | 128K |
| Mistral Small 4 | $0.15 | $0.60 | n/a | 32K |
To fotnoter som betyr noe. Claude Sonnet 5 har introduksjonspris på $2.00 inndata / $10.00 utdata per million frem til 31. august 2026, deretter går den tilbake til $3.00 / $15.00 som vist ovenfor. Og Gemini 2.5 Pro hopper til $2.50 inndata / $15.00 utdata så snart en enkelt prompt passerer 200K tokens, så «listeprisen» er egentlig et gulv.
Hver modell her tilbyr også et Batch API med en fast 50% rabatt på både inndata og utdata (Anthropic, OpenAI, Google og Alibaba), noe vi tar med i det gjennomregnede eksempelet nedenfor.
Hva du faktisk betaler for
Tre tall styrer regningen din, og de fleste prissider gjemmer bort to av dem.
- Inndatatokens er alt du sender: system-prompt, samtalehistorikk, hentet kontekst, brukerens spørsmål. På chat- og RAG-apper er dette vanligvis den største halvparten.
- Utdatatokens er det modellen genererer, og de koster 3-6x mer enn inndata hos nesten alle leverandører. GPT-5.6 Terra tar $2.50 for inndata og $15.00 for utdata, en 6x-multiplikator. Ordrike svar koster deg.
- Cachet inndata er den store sovende fordelen. Hvis du sender samme system-prompt på hver forespørsel, fakturerer prompt caching de gjentatte tokensene til rundt 10% av normalprisen. Se på «Cachet inndata»-kolonnen ovenfor: Claude Opus 4.8 faller fra $5.00 til $0.50. På en app med høy trafikk avgjør akkurat den kolonnen om regningen din blir $10K eller $3K. Vår guide til prompt caching dekker oppsettet for hver leverandør.
Konklusjonen: en rå «inndatapris»-sammenligning er misvisende. Modellen med den laveste prislappen kan tape mot en litt dyrere modell som cacher bedre, og modellen med den skumleste utdataprisen kan være billigst hvis oppgaven din returnerer to-ords svar.
De billigste modellene for arbeid med høyt volum
Hvis du behandler millioner av tokens på oppgaver som klassifisering, uttrekk, oppsummering eller moderering, er det bunnen av tabellen pengene ligger.
- DeepSeek-V4 er prisgulvet på $0.14 inndata / $0.28 utdata. Cache-treff-inndataraten på rundt $0.003 per million er nesten gratis. Med en 1M-tokens kontekst og 384K maks utdata håndterer den de fleste ikke-frontier-oppgaver uten problemer.
- Gemini 2.5 Flash-Lite til $0.10 / $0.40 er Googles svar, med samme 1M kontekst og et modent økosystem.
- Zhipu GLM-4.6 til $0.43 / $1.74 ligger midt på treet og er en sterk kodemodell. Hvis du bruker den mye til utvikling, kan GLMs kodeplanabonnement rett og slett slå token-for-token-prising.
- Mistral Small 4 til $0.15 / $0.60 er det billigste alternativet med EU-datalagring, noe som betyr mye for regulerte arbeidsmengder.
Gapet mellom dette nivået og flaggskipene er ikke subtilt. DeepSeek-V4s utdatapris er over 50x billigere enn GPT-5.6 Sols. For enhver oppgave der en åpen-vekt-modell i mellomklassen holder kvalitetsmålet ditt, er det spennet den enkeltstørste spaken på regningen din.
Flaggskipnivået, sammenlignet
Når oppgaven faktisk trenger frontier-resonnering (komplekse agenter, vanskelig kode, dyp analyse), velger du mellom fire modeller. Slik stiller de opp på pris innenfor samme intelligensklasse:
| Flaggskip | Inndata | Utdata | Kontekst | Merknad |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 | 1.05M | Høyest utdatapris av de fire |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Matcher Sol på inndata, billigere utdata |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Anthropics mest kapable, priset over Opus |
| Gemini 2.5 Pro | $1.25 | $10.00 | 1M | Billigste flaggskip, men prises opp forbi 200K |
På papiret er Gemini 2.5 Pro kupp-modellen i gruppen, omtrent en fjerdedel av Sols utdatapris. Haken er langkontekst-straffen: passerer du 200K tokens i én enkelt prompt, repriser den hele forespørselen til $2.50 / $15.00. For agenter som fyller opp store kontekster, spiser det opp mye av fordelen, så prissett dine faktiske prompt-størrelser før du bestemmer deg.
Claude Fable 5 er avvikeren på pris. Den er posisjonert over Opus-nivået for den mest krevende langsiktige resonneringen, så det er en bevisst «grip til den når korrekthet slår kostnad»-modell, ikke et standardvalg.
De skjulte kostnadene ingen setter i tabellen
En pris-per-token-sammenligning går glipp av fire ting som faktisk flytter regninger:
- Langkontekst-nivåer. Gemini 2.5 Pro (over 200K) og GPT-5.6 (over omtrent 272K) tar 1.5-2x når promptene blir store. Driver du med lange dokumenter, er den effektive raten din den nivådelte.
- Cache-skrivepåslag. Anthropic tar 1.25x for å skrive cachen (2x for 1-timers TTL) før du får 0.1x leseraten. Det lønner seg etter to forespørsler, men en arbeidsmengde med lite repetisjon kan betale skrivepåslaget uten å noensinne hente det inn.
- Batch vs. sanntid. 50%-batchrabatten er gratis penger hvis arbeidsmengden din kan vente 24 timer. De fleste team har mer batch-kvalifisert trafikk enn de tror (nattlige jobber, etterfylling, moderering).
- Leverandøren som ikke er på listen. For svært høyt volum kan selvhosting av en åpen modell på leide GPU-er underby hver eneste API-rate her. Vår guide til å kjøre LLM-er lokalt dekker når det regnestykket snur.
Pris per oppgave, ikke per token: en reell jobb
Pris-per-token er abstrakt. Så vi kjørte en reell test. I juni 2026 kjørte vi en oppsummeringsbatch på 50 dokumenter (omtrent 1.2M inndatatokens og 120K utdatatokens) gjennom fem modeller og loggførte den faktiske regningen:
| Modell | Sanntidskostnad | Med Batch API |
|---|---|---|
| GPT-5.6 Terra | $4.80 | $2.40 |
| Claude Sonnet 5 (intro) | $3.60 | $1.80 |
| Gemini 2.5 Flash | $0.66 | $0.33 |
| Zhipu GLM-4.6 | $0.72 | n/a |
| DeepSeek-V4 | $0.20 | n/a |
Samme 50 dokumenter, samme prompt. Regningen varierte fra $4.80 til $0.20, et 24x spenn på identisk arbeid, før batching. Da vi flyttet de batch-kvalifiserte leverandørene til nattkøen deres, landet Gemini 2.5 Flash på 33 cent. For oppsummering, der kvalitetsforskjellen mellom disse modellene lå innenfor feilmarginen vår, er den beslutningen verdt tusenvis av dollar i måneden i skala.
Lærdommen: den riktige sammenligningen er alltid kostnad per oppgave, beregnet på ditt reelle inndata/utdata-forhold, ikke prislappen på en enkelt token. En modell med dyr utdata er billig for uttrekk; en modell med billig inndata er dyr for lang generering.
Hvilken modell er billigst for ditt bruksområde?
Kortversjonen, priset fra tabellen ovenfor:
- Chatbotter og RAG (lang inndata, kort utdata): inndatapris og caching dominerer. Gemini 2.5 Flash og DeepSeek-V4 vinner; legg til prompt caching uansett hvilken du velger.
- Langformsgenerering (kort inndata, lang utdata): utdatapris dominerer. Gemini 2.5 Flash-Lite og DeepSeek-V4 er billigst; unngå GPT-5.6 Sol med mindre du trenger resonneringen.
- Agenter og verktøybruk (stor kontekst, mange runder): følg med på langkontekst-nivåene. Claude Opus 4.8 og GPT-5.6 Terra er forutsigbare; Gemini 2.5 Pro er kun billigst hvis du holder deg under 200K.
- Koding: GLM-4.6 og kodeplanabonnementet, eller Claude Opus 4.8 for de vanskeligste problemene.
- Frontier-resonnering der korrekthet slår kostnad: Claude Opus 4.8 eller Claude Fable 5.
Uansett hva du lander på, rut det gjennom en gateway slik at leverandørbytte er en konfigurasjonsendring, ikke en omskriving. Vår sammenligning av de beste LLM-gateway-verktøyene dekker alternativene, og hvis du vil ha hele spilleboken for å presse ned regningen, se guiden vår om å redusere LLM API-kostnader. For en ren Gemini-dypdykk med de multimodale og lyd-ratene denne tabellen ikke dekker, se vår gjennomgang av Gemini API-priser.
Hvordan Techsy velger modeller for kunder
Vi bygger produksjons-AI-systemer for B2B-kunder, og modellvalg er en av de første beslutningene vi tar, som regel før en eneste kodelinje. Tilnærmingen vår er kjedelig med hensikt: vi profilerer det reelle inndata/utdata-forholdet til arbeidsmengden, priser de tre beste kandidatene på det forholdet (ikke prislappen), kjører dem mot et evalueringssett for å bekrefte kvalitetsparitet, og kobler deretter den billigste modellen som består bak en gateway, slik at vi kan reprissette den hvert kvartal etter hvert som nye modeller lanseres. Det siste steget betyr mer enn å velge «beste» modell i dag, fordi prisen du ser ovenfor vil være feil om tre måneder.
Hvis du skal velge en modell eller stirrer på en regning som bare fortsetter å stige, er det nettopp den typen beslutning vi hjelper til med. Utforsk våre AI-integrasjonstjenester eller book en gratis arkitekturgjennomgang.
Vanlige spørsmål
Hva er den billigste LLM API-en i 2026?
DeepSeek-V4 er den billigste kapable modellen til $0.14 inndata / $0.28 utdata per million tokens per juli 2026, med cache-treff-inndata på rundt $0.003. Gemini 2.5 Flash-Lite ($0.10 / $0.40) og Mistral Small 4 ($0.15 / $0.60) er like bak. For frontier-kvalitetsarbeid er Gemini 2.5 Pro det billigste flaggskipet.
Er GPT-5.6 eller Claude Opus 4.8 dyrest?
De matcher på inndata ($5.00/M), men Claude Opus 4.8 er billigere på utdata ($25.00/M mot GPT-5.6 Sols $30.00/M). For utdatatunge arbeidsmengder vinner Opus 4.8 på pris; for inndatatunge er de i praksis likestilt før caching.
Hvorfor er utdata dyrere enn inndata?
Å generere tokens er mer beregningskrevende enn å lese dem, så nesten alle leverandører tar 3-6x mer for utdata. Det er derfor det å kutte svarlengden (og bruke strukturerte utdata) sparer mer per token enn å kutte prompten din.
Hvor mye sparer prompt caching egentlig?
Cachede inndatatokens faktureres til rundt 10% av standardraten hos Anthropic, OpenAI og Google, en 90%-rabatt på den gjentatte delen av prompten din. For apper som sender samme system-prompt på hver forespørsel, kutter caching ofte totalregningen med 30-50%.
Inkluderer disse prisene Batch API-rabatten?
Nei. Hovedtabellen viser standard sanntidspriser. Anthropic, OpenAI, Google og Alibaba tilbyr alle et Batch API med en fast 50%-rabatt på både inndata og utdata for ikke-tidskritiske arbeidsmengder som tåler opptil 24 timers ventetid.
Er DeepSeek virkelig så mye billigere enn amerikanske modeller?
Ja, på papiret. DeepSeek-V4s utdatapris ($0.28/M) er over 50x billigere enn GPT-5.6 Sols ($30/M). Avveiningen er at amerikanske frontier-modeller fortsatt leder på de vanskeligste resonneringsoppgavene, så de fleste team arbitrerer oppgavene der kvalitetsparitet holder og beholder et flaggskip for resten.
Hva er haken med Gemini 2.5 Pros lave pris?
Langkontekst-nivået. Gemini 2.5 Pro er listet til $1.25 / $10.00, men enhver enkelt prompt over 200K tokens repriser hele forespørselen til $2.50 / $15.00. Hvis promptene dine er store, budsjetter med den nivådelte raten, ikke hovedtallet.
Hvor ofte endres LLM API-priser?
Ofte. Prisene endret seg to ganger i første halvår av 2026, og nye modellfamilier (som GPT-5.6-nivået som lanserte 9. juli 2026) nullstiller feltet hver gang. Bekreft alltid mot leverandørens offisielle prisside før du forplikter en arbeidsmengde, og reprissett kvartalsvis.
Hvilken modell har det største kontekstvinduet for prisen?
DeepSeek-V4 og Gemini 2.5-familien tilbyr en 1M-tokens kontekst i den lave enden av prisspennet. GPT-5.6-modellene ligger litt høyere på 1.05M, og GPT-5.4 nano når 1.1M for kun $0.20 inndata, noe som gjør den til det billigste store-kontekst-alternativet for enkle oppgaver.
Om forfatteren
Mert Batur er medgrunnlegger av Techsy.io, der teamet leverer AI-agenter, automasjonssystemer og voice/SDR-pipelines for B2B-kunder. Han skriver om LLM-verktøystacken som Techsy-teamet faktisk bruker i produksjon. Ta kontakt på LinkedIn.
Kilder
- Anthropic Claude API Pricing (accessed 2026-07-14)
- OpenAI API Pricing (accessed 2026-07-14)
- Google Gemini API Pricing (accessed 2026-07-14)
- DeepSeek API Pricing (accessed 2026-07-14)
- Alibaba Cloud Model Studio Pricing (accessed 2026-07-14)
- Mistral API Pricing (accessed 2026-07-14)
- Z.AI (Zhipu GLM) Pricing (accessed 2026-07-14)