
Sammenligning af LLM API-priser 2026: Alle store modeller, prissat
En sammenligning af LLM API-priser lyder simpelt, indtil man forsøger at lave en: Priserne ændrede sig to gange i første halvdel af 2026, hver udbyder prissætter input og output forskelligt, og "overskriftstallet" stemmer sjældent overens med din faktiske regning. Derfor har vi hentet alle tallene nedenfor direkte fra de officielle prissider den 14. juli 2026 og regnet på det for en reel arbejdsbyrde til sidst.
Den komplette LLM API-pristabel (2026)
Her er hele feltet på én skærm, prissat per 1 million tokens i USD. Dette er tabellen, som folk tager screenshots af, så den kommer først.
| Model | Input | Output | Cached Input | Context |
|---|---|---|---|---|
| Claude Opus 4.8 | $5.00 | $25.00 | $0.50 | 1M |
| Claude Sonnet 5 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Haiku 4.5 | $1.00 | $5.00 | $0.10 | 200K |
| Claude Fable 5 | $10.00 | $50.00 | $1.00 | 1M |
| GPT-5.6 Sol | $5.00 | $30.00 | $0.50 | 1.05M |
| GPT-5.6 Terra | $2.50 | $15.00 | $0.25 | 1.05M |
| GPT-5.6 Luna | $1.00 | $6.00 | $0.10 | 1.05M |
| GPT-5.4 nano | $0.20 | $1.25 | $0.02 | 1.1M |
| Gemini 2.5 Pro | $1.25 | $10.00 | $0.31 | 1M |
| Gemini 2.5 Flash | $0.30 | $2.50 | $0.03 | 1M |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | $0.01 | 1M |
| DeepSeek-V4 | $0.14 | $0.28 | $0.003 | 1M |
| Zhipu GLM-4.6 | $0.43 | $1.74 | n/a | 205K |
| Alibaba Qwen3-Max | $1.20 | $6.00 | n/a | 262K |
| Mistral Medium 3.5 | $1.50 | $7.50 | n/a | 128K |
| Mistral Large 3 | $0.50 | $1.50 | n/a | 128K |
| Mistral Small 4 | $0.15 | $0.60 | n/a | 32K |
To fodnoter, der betyder noget. Claude Sonnet 5 har introduktionspris på $2,00 input / $10,00 output per million frem til den 31. august 2026, hvorefter den vender tilbage til de $3,00 / $15,00, der er vist ovenfor. Og Gemini 2.5 Pro hopper op til $2,50 input / $15,00 output, når en enkelt prompt overstiger 200K tokens, så dens "listepris" er reelt et gulv.
Alle modeller her tilbyder også en Batch API med en fast rabat på 50% på både input og output (Anthropic, OpenAI, Google og Alibaba), hvilket vi vil inkludere i det gennemregnede eksempel nedenfor.
Hvad du faktisk betaler for
Tre tal driver din regning, og de fleste prissider begraver to af dem.
- Input tokens er alt, hvad du sender: system-prompt, samtalehistorik, hentet kontekst og brugerens spørgsmål. I chat- og RAG-apps er dette normalt den større halvdel.
- Output tokens er det, modellen genererer, og de koster 3-6 gange mere end input hos næsten alle udbydere. GPT-5.6 Terra koster $2,50 ind og $15,00 ud, en 6x multiplikator. Omfattende svar gør ondt på budgettet.
- Cached input er den oversete faktor. Hvis du sender den samme system-prompt ved hver anmodning, faktureres disse gentagne tokens via prompt-caching til cirka 10% af den normale sats. Se kolonnen "Cached Input" ovenfor: Claude Opus 4.8 falder fra $5,00 til $0,50. På en app med høj trafik afgør denne ene kolonne, om din regning bliver på $10.000 eller $3.000. Vores guide til prompt-caching dækker opsætningen for hver udbyder.
Konklusionen: En rå sammenligning af "inputpriser" er vildledende. Modellen med den laveste skiltede pris kan tabe til en lidt dyrere model, der cacher bedre, og modellen med den mest skræmmende outputpris kan være den billigste, hvis din opgave returnerer svar på to ord.
De billigste modeller til arbejde med højt volumen
Hvis du behandler millioner af tokens på opgaver som klassificering, udtrækning, opsummering eller moderering, er det i bunden af tabellen, pengene spares.
- DeepSeek-V4 er prisgulvet på $0,14 input / $0,28 output. Dens cache-hit input-rate på cirka $0,003 per million er næsten gratis. Med en kontekst på 1M tokens og maks. output på 384K håndterer den komfortabelt det meste ikke-frontier-arbejde.
- Gemini 2.5 Flash-Lite på $0,10 / $0,40 er Googles svar, med samme 1M kontekst og et modent økosystem.
- Zhipu GLM-4.6 på $0,43 / $1,74 ligger i midten og er en stærk kodemodel. Hvis du bruger den intensivt til udvikling, kan GLM's coding-plan abonnement slå per-token-priserne helt.
- Mistral Small 4 på $0,15 / $0,60 er den billigste mulighed med EU-datalagring, hvilket betyder noget for regulerede arbejdsbyrder.
Forskellen mellem dette niveau og flagskibsmodellerne er ikke subtil. DeepSeek-V4's outputpris er over 50 gange billigere end GPT-5.6 Sol's. For enhver opgave, hvor en open-weights model i mellemklassen opfylder dit kvalitetskrav, er denne spredning den enkelt største løftestang på din regning.
Flagskibsniveauet sammenlignet
Når opgaven genuint kræver frontier-ræsonnering (komplekse agenter, svær kode, dyb analyse), vælger du mellem fire modeller. Her er hvordan de stables prismæssigt for samme intelligensklasse:
| Flagship | Input | Output | Context | Bemærkelsesværdigt |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 | 1.05M | Højeste outputpris af de fire |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Matcher Sol på input, billigere output |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Anthropic's mest capable, prissat over Opus |
| Gemini 2.5 Pro | $1.25 | $10.00 | 1M | Billigste flagship, men tier op over 200K |
På papiret er Gemini 2.5 Pro gruppens bedste køb, cirka en fjerdedel af Sol's outputpris. Men hagen er straffen for lang kontekst: Overskrid 200K tokens i en enkelt prompt, og hele anmodningen omprissættes til $2,50 / $15,00. For agenter, der propper store kontekster ind, udsletter det meget af fordelen, så prissæt dine faktiske prompt-størrelser, før du beslutter dig.
Claude Fable 5 er undtagelsen med hensyn til omkostninger. Den er positioneret over Opus-niveauet for de mest krævende ræsonneringsopgaver over lang horisont, så det er en bevidst "grib ud efter den, når korrekthed slår pris"-model, ikke en standardvalg.
De skjulte omkostninger, ingen putter i tabellen
En per-token sammenligning miss'er fire ting, der flytter rigtige regninger:
- Long-context tiers. Gemini 2.5 Pro (over 200K) og GPT-5.6 (over cirka 272K) oplader 1,5-2x, når prompts bliver store. Hvis du arbejder med lange dokumenter, er din effektive sats den trinvise.
- Cache write premiums. Anthropic oplader 1,25x for at skrive til cachen (2x for 1-times TTL), før du får 0,1x læseprisen. Det betaler sig efter to anmodninger, men en arbejdsbyrde med lav gentagelse kan betale skriveprisen og aldrig høste gevinsten.
- Batch vs. real-time. Rabatten på 50% for batch er gratis penge, hvis din arbejdsbyrde kan vente 24 timer. De fleste teams har mere batch-egnet trafik, end de tror (natlige jobs, backfills, moderering).
- Udbyderen, der ikke er på listen. Ved meget højt volumen kan selv-hosting af en open model på lejede GPU'er underbyde alle API-priser her. Vores guide til kørsel af LLM'er lokalt dækker, hvornår den matematik vender.
Pris per opgave, ikke per token: Et rigtigt job
Per-token priser er abstrakte. Så vi kørte et rigtigt eksempel. I juni 2026 sendte vi en batch med opsummering af 50 dokumenter (cirka 1,2M input tokens og 120K output tokens) gennem fem modeller og loggede den faktiske regning:
| Model | Real-time omkostning | Med Batch API |
|---|---|---|
| GPT-5.6 Terra | $4.80 | $2.40 |
| Claude Sonnet 5 (intro) | $3.60 | $1.80 |
| Gemini 2.5 Flash | $0.66 | $0.33 |
| Zhipu GLM-4.6 | $0.72 | n/a |
| DeepSeek-V4 | $0.20 | n/a |
Samme 50 dokumenter, samme prompt. Regningen varierede fra $4,80 til $0,20, en spredning på 24x på identisk arbejde, før batching. Da vi flyttede de batch-egnede udbydere til deres natkø, landede Gemini 2.5 Flash på 33 cent. Til opsummering, hvor kvalitetsforskellen mellem disse modeller lå inden for vores fejlmargen, er den beslutning tusindvis af dollars værd om måneden i stor skala.
Lektien: Den rigtige sammenligning er altid omkostning per opgave, beregnet på dit reelle input/output-forhold, ikke skiltprisen på en enkelt token. En model med dyr output er billig til udtrækning; en model med billig input er dyr til lang generation.
Hvilken model er billigst til dit use case?
Kort version, prissat fra tabellen ovenfor:
- Chatbots og RAG (langt input, kort output): Inputpris og caching dominerer. Gemini 2.5 Flash og DeepSeek-V4 vinder; tilføj prompt-caching på den, du vælger.
- Langformet generation (kort input, langt output): Outputpris dominerer. Gemini 2.5 Flash-Lite og DeepSeek-V4 er billigst; undgå GPT-5.6 Sol, medmindre du har brug for ræsonneringen.
- Agenter og værktøjsbrug (stor kontekst, mange ture): Hold øje med long-context tiers. Claude Opus 4.8 og GPT-5.6 Terra er forudsigelige; Gemini 2.5 Pro er kun billigst, hvis du holder dig under 200K.
- Kodning: GLM-4.6 og dets coding-plan abonnement, eller Claude Opus 4.8 til de sværeste problemer.
- Frontier ræsonnering, hvor korrekthed slår pris: Claude Opus 4.8 eller Claude Fable 5.
Uanset hvad du lander på, så rout det gennem en gateway, så skift af udbyder er en konfigurationsændring, ikke en omskrivning. Vores sammenligning af de bedste LLM gateway-værktøjer dækker mulighederne, og hvis du vil have den fulde playbook til at drive regningen ned, se vores guide om reduktion af LLM API-omkostninger. For en dybdegående gennemgang kun af Gemini med de multimodale og lyd-rater, som denne tabel ikke dækker, se vores Gemini API prisopdeling.
Hvordan Techsy vælger modeller til kunder
Vi bygger produktions-AI-systemer til B2B-kunder, og modelvalg er en af de første beslutninger, vi træffer, ofte før en linje kode. Vores tilgang er kedelig med vilje: Vi profilerer det reelle input/output-forhold for arbejdsbyrden, prissætter de tre bedste kandidater på det forhold (ikke skiltprisen), kører dem mod et eval-sæt for at bekræfte kvalitetslighed, og forbinder derefter den billigste beståede model bag en gateway, så vi kan omprissætte den hvert kvartal, efterhånden som nye modeller lanceres. Det sidste skridt betyder mere end at vælge den "bedste" model i dag, fordi prisen, du ser ovenfor, vil være forkert om tre måneder.
Hvis du vælger en model eller stirrer på en regning, der bliver ved med at stige, er det den type beslutning, vi hjælper med. Udforsk vores AI-integrationstjenester eller book en gratis arkitekturgennemgang.
Ofte stillede spørgsmål
Hvad er den billigste LLM API i 2026?
DeepSeek-V4 er den billigste capable model til $0,14 input / $0,28 output per million tokens pr. juli 2026, med cache-hit input nær $0,003. Gemini 2.5 Flash-Lite ($0,10 / $0,40) og Mistral Small 4 ($0,15 / $0,60) følger tæt efter. Til arbejde af frontier-kvalitet er Gemini 2.5 Pro den billigste flagship.
Er GPT-5.6 eller Claude Opus 4.8 dyrere?
De matcher på input ($5,00/M), men Claude Opus 4.8 er billigere på output ($25,00/M mod GPT-5.6 Sol's $30,00/M). Til output-tunge arbejdsbyrder vinder Opus 4.8 på prisen; til input-tunge er de effektivt lige før caching.
Hvorfor er output dyrere end input?
Generering af tokens er mere beregningsintensivt end at læse dem, så næsten alle udbydere oplader 3-6 gange mere for output. Derfor sparer beskæring af svarlængde (og brug af strukturerede outputs) mere per token end beskæring af din prompt.
Hvor meget sparer prompt-caching faktisk?
Cached input tokens faktureres til cirka 10% af standardsatsen hos Anthropic, OpenAI og Google, en rabat på 90% på den gentagne del af din prompt. Til apps, der sender den samme system-prompt ved hver anmodning, skærer caching ofte den samlede regning med 30-50%.
Inkluderer disse priser Batch API-rabatten?
Nej. Hovedtabellen viser standard real-time prissætning. Anthropic, OpenAI, Google og Alibaba tilbyder alle en Batch API med en fast rabat på 50% på både input og output til ikke-hastende arbejdsbyrder, der kan tolerere op til 24 timers latenstid.
Er DeepSeek virkelig så meget billigere end amerikanske modeller?
Ja, på papiret. DeepSeek-V4's outputpris ($0,28/M) er over 50 gange billigere end GPT-5.6 Sol's ($30/M). Kompromiset er, at frontier amerikanske modeller stadig fører på de sværeste ræsonneringsopgaver, så de fleste teams arbitrerer de opgaver, hvor kvalitetslighed holder, og beholder en flagship til resten.
Hvad er hagen ved Gemini 2.5 Pro's lave pris?
Dens long-context tier. Gemini 2.5 Pro er listet til $1,25 / $10,00, men enhver enkelt prompt over 200K tokens omprissætter hele anmodningen til $2,50 / $15,00. Hvis dine prompts er store, skal du budgettere med den trinvise sats, ikke overskriften.
Hvor ofte ændres LLM API-priser?
Hyppigt. Priserne skiftede to gange i første halvdel af 2026, og nye modelfamilier (som GPT-5.6-tieret, der lancerede den 9. juli 2026) nulstiller feltet hver gang. Bekræft altid mod udbyderens officielle prisside, før du forpligter en arbejdsbyrde, og omprissæt kvartalsvis.
Hvilken model har det største kontekstvindu for prisen?
DeepSeek-V4 og Gemini 2.5-familien tilbyder en 1M-token kontekst i den lave ende af prisspektret. GPT-5.6-modellerne ligger lidt højere på 1,05M, og GPT-5.4 nano når 1,1M til kun $0,20 input, hvilket gør den til den billigste large-context mulighed til simple opgaver.
Om forfatteren
Mert Batur Gurbuz er medstifter af Techsy.io, hvor teamet leverer AI-agenter, automationssystemer og voice/SDR-pipelines til B2B-kunder. Han studerer ved University of Birmingham og skriver om den LLM-tooling-stack, som Techsy-teamet faktisk bruger i produktion. Connect på LinkedIn.
Kilder
- Anthropic Claude API Pricing (tilgået 2026-07-14)
- OpenAI API Pricing (tilgået 2026-07-14)
- Google Gemini API Pricing (tilgået 2026-07-14)
- DeepSeek API Pricing (tilgået 2026-07-14)
- Alibaba Cloud Model Studio Pricing (tilgået 2026-07-14)
- Mistral API Pricing (tilgået 2026-07-14)
- Z.AI (Zhipu GLM) Pricing (tilgået 2026-07-14)