
LLM API -hinnoittelun vertailu 2026: Kaikki merkittävät mallit hinnoiteltuina
LLM API -hinnoittelun vertailu kuulostaa yksinkertaiselta, kunnes yrität tehdä sellaisen: hinnat muuttuivat kahdesti vuoden 2026 ensimmäisellä puoliskolla, jokainen palveluntarjoaja hinnoittelee syötteen ja tulosteen eri tavalla, eikä ”etusivun” numero harvoin vastaa todellista laskuasi. Siksi keräsimme alla olevat luvut suoraan virallisilta hinnoittelusivuilta 14. heinäkuuta 2026 ja teimme lopuksi laskelmat todelliselle työkuormalle.
Täydellinen LLM API -hinnoittelutaulukko (2026)
Tässä on koko kenttä yhdellä näytöllä, hinnoiteltu miljoonaa tokenia kohden Yhdysvaltain dollareissa. Tämä on taulukko, jonka ihmiset ottavat kuvakaappauksena, joten se on ensin.
| Malli | Syöte | Tuloste | Välimuistitettu syöte | Konteksti |
|---|---|---|---|---|
| Claude Opus 4.8 | $5.00 | $25.00 | $0.50 | 1M |
| Claude Sonnet 5 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Haiku 4.5 | $1.00 | $5.00 | $0.10 | 200K |
| Claude Fable 5 | $10.00 | $50.00 | $1.00 | 1M |
| GPT-5.6 Sol | $5.00 | $30.00 | $0.50 | 1.05M |
| GPT-5.6 Terra | $2.50 | $15.00 | $0.25 | 1.05M |
| GPT-5.6 Luna | $1.00 | $6.00 | $0.10 | 1.05M |
| GPT-5.4 nano | $0.20 | $1.25 | $0.02 | 1.1M |
| Gemini 2.5 Pro | $1.25 | $10.00 | $0.31 | 1M |
| Gemini 2.5 Flash | $0.30 | $2.50 | $0.03 | 1M |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | $0.01 | 1M |
| DeepSeek-V4 | $0.14 | $0.28 | $0.003 | 1M |
| Zhipu GLM-4.6 | $0.43 | $1.74 | n/a | 205K |
| Alibaba Qwen3-Max | $1.20 | $6.00 | n/a | 262K |
| Mistral Medium 3.5 | $1.50 | $7.50 | n/a | 128K |
| Mistral Large 3 | $0.50 | $1.50 | n/a | 128K |
| Mistral Small 4 | $0.15 | $0.60 | n/a | 32K |
Kaksi huomautusta, jotka ovat tärkeitä. Claude Sonnet 5:n esittelyhinta on 2,00 $ syötteestä / 10,00 $ tulosteesta miljoonaa tokenia kohden 31. elokuuta 2026 asti, minkä jälkeen hinta palaa yllä olevaan 3,00 $ / 15,00 $. Ja Gemini 2.5 Pro:n hinta nousee 2,50 $ syötteestä / 15,00 $ tulosteesta, kun yksittäinen kehote ylittää 200 000 tokenia, joten sen ”listahinta” on oikeastaan vain alaraja.
Jokainen tässä mainittu malli tarjoaa myös Batch API:n, jossa on tasainen 50 % alennus sekä syötteeseen että tulosteeseen (Anthropic, OpenAI, Google ja Alibaba), mikä sisällytetään alla olevaan esimerkkilaskelmaan.
Mistä todella maksat
Kolme lukua ajavat laskuasi, ja useimmat hinnoittelusivut hautaavat kaksi niistä.
- Syötetokenit ovat kaikkea, mitä lähetät: järjestelmäkehote, keskusteluhistoria, haettu konteksti, käyttäjän kysymys. Chat- ja RAG-sovelluksissa tämä on yleensä suurempi puolikas.
- Tulostetokenit ovat mallin tuottamaa sisältöä, ja ne maksavat 3–6 kertaa enemmän kuin syöte lähes kaikilla palveluntarjoajilla. GPT-5.6 Terra veloittaa 2,50 $ sisään ja 15,00 $ ulos, eli 6-kertaisen kertoimen. Monisanaiset vastaukset satuttavat lompakkoa.
- Välimuistitettu syöte on yllättävä tekijä. Jos lähetät saman järjestelmäkehotteen jokaisessa pyynnössä, kehotteen välimuisti laskuttaa nämä toistuvat tokenit noin 10 %:lla normaalihinnasta. Katso yllä olevaa ”Välimuistitettu syöte” -saraketta: Claude Opus 4.8:n hinta laskee 5,00 dollarista 0,50 dollariin. Suuren liikenteen sovelluksessa tämä yksi sarake ratkaisee, onko laskusi 10 000 $ vai 3 000 $. Kehotteen välimuistiohjaimme kattaa asennuksen kullekin palveluntarjoajalle.
Ydinviesti: raaka ”syötteen hinnan” vertailu on harhaanjohtava. Malli, jolla on alhaisin listahinta, voi hävitä hieman kalliimmalle mallille, joka hyödyntää välimuistia paremmin, ja malli, jonka tulostehinta on pelottavin, voi olla halvin, jos tehtäväsi palauttaa kaksisanaisia vastauksia.
Halvimmat mallit suurten volyymien työhön
Jos käsittelet miljoonia tokeneja tehtävissä kuten luokittelu, poiminta, tiivistäminen tai moderointi, raha löytyy taulukon alaosasta.
- DeepSeek-V4 on hintalattialla 0,14 $ syöte / 0,28 $ tuloste. Sen välimuistiosuman syötteen hinta noin 0,003 $ miljoonaa tokenia kohden on lähes ilmainen. 1M-tokenin kontekstissa ja 384K maksimitulosteella se käsittelee mukavasti suurimman osan ei-aivan huipputason työstä.
- Gemini 2.5 Flash-Lite hinnalla 0,10 $ / 0,40 $ on Googlen vastine, samalla 1M kontekstilla ja kypsällä ekosysteemillä.
- Zhipu GLM-4.6 hinnalla 0,43 $ / 1,74 $ sijoittuu keskikastiin ja on vahva koodausmalli. Jos käytät sitä paljon kehittämiseen, GLM:n koodaussuunnitelman tilaus voi voittaa tokenikohtaisen hinnoittelun täysin.
- Mistral Small 4 hinnalla 0,15 $ / 0,60 $ on halvin vaihtoehto EU:n tietosäilytyksellä, mikä on tärkeää säännellyille työkuormille.
Kuilu tämän tason ja lippulaivamallien välillä ei ole hienovarainen. DeepSeek-V4:n tulostehinta on yli 50 kertaa halvempi kuin GPT-5.6 Sol:n. Mihin tahansa tehtävään, jossa keskitason avoimen painomallin laatu riittää, tuo ero on suurin vipu laskussasi.
Lippulaivatason vertailu
Kun tehtävä todella vaatii eturivin päättelykykyä (monimutkaiset agentit, vaikea koodi, syvä analyysi), valitset neljän mallin välillä. Näin ne asettuvat hinnoittelussa samalle älykkyystasolle:
| Lippulaiva | Syöte | Tuloste | Konteksti | Huomioitavaa |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 | 1.05M | Korkein tulostehinta neljästä |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Vastaa Solia syötteessä, halvempi tuloste |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Anthropicin kyvykkäin, hinnoiteltu Opusta kalliimmaksi |
| Gemini 2.5 Pro | $1.25 | $10.00 | 1M | Halvin lippulaiva, mutta siirtyy korkeampaan tasoon 200K:n jälkeen |
Paperilla Gemini 2.5 Pro on ryhmän edullisin, noin neljäsosa Solin tulostehinnasta. Koukku on sen pitkän kontekstin rangaistus: ylitä 200 000 tokenia yhdessä kehotteessa, ja se hinnoittelee koko pyynnön uudelleen hintaan 2,50 $ / 15,00 $. Agenteille, jotka ahtavat suuria konteksteja, tämä pyyhkii pois suuren osan edusta, joten hinnoittele todelliset kehotteesi koot ennen päätöstä.
Claude Fable 5 on poikkeus kustannuksissa. Se on sijoitettu Opus-tason yläpuolelle vaativimpaan pitkän aikavälin päättelyyn, joten se on tarkoituksellinen ”käytä tätä, kun oikeellisuus voittaa kustannukset” -malli, ei oletusarvo.
Piilokustannukset, joita kukaan ei laita taulukkoon
Tokenikohtainen vertailu jättää huomioimatta neljä asiaa, jotka liikuttavat todellisia laskuja:
- Pitkän kontekstin tasot. Gemini 2.5 Pro (yli 200K) ja GPT-5.6 (yli noin 272K) veloittavat 1,5–2-kertaisesti, kun kehotteet kasvavat suuriksi. Jos teet pitkiä dokumentteja käsittelevää työtä, tehokas hintasi on porrastettu hinta.
- Välimuistin kirjoitusmaksut. Anthropic veloittaa 1,25-kertaisesti välimuistin kirjoittamisesta (2-kertaisesti 1 tunnin TTL:lle), ennen kuin saat 0,1-kertaisen lukuhinnan. Se maksaa itsensä takaisin kahden pyynnön jälkeen, mutta vähätoistoinen työkuorma voi maksaa kirjoitusmaksun ilman hyötyä.
- Batch vs reaaliaika. 50 %:n batch-alennus on ilmaista rahaa, jos työkuormasi voi odottaa 24 tuntia. Useimmilla tiimeillä on enemmän batch-kelpoista liikennettä kuin he uskovat (yöajot, täydennykset, moderointi).
- Palveluntarjoaja, joka ei ole listalla. Erittäin suurissa volumeissa open-source-mallin itse isännöinti vuokratuilla GPU:illa voi alittaa kaikki tässä mainitut API-hinnat. Oppaamme LLM-ajamiseen paikallisesti käsittelee, milloin tämä matematiikka kääntyy.
Hinta per tehtävä, ei per token: Todellinen työ
Tokenihinnat ovat abstrakteja. Joten ajoimme todellisen testin. Kesäkuussa 2026 ajoimme 50 dokumentin tiivistämiserän (noin 1,2 miljoonaa syötetokenia ja 120 000 tulostetokenia) viiden mallin läpi ja kirjasimme todellisen laskun:
| Malli | Reaaliaikainen kustannus | Batch API:n kanssa |
|---|---|---|
| GPT-5.6 Terra | $4.80 | $2.40 |
| Claude Sonnet 5 (esittely) | $3.60 | $1.80 |
| Gemini 2.5 Flash | $0.66 | $0.33 |
| Zhipu GLM-4.6 | $0.72 | n/a |
| DeepSeek-V4 | $0.20 | n/a |
Samat 50 dokumenttia, sama kehote. Lasku vaihteli 4,80 dollarista 0,20 dollariin, eli 24-kertainen ero identtisessä työssä ennen batchingia. Kun siirsimme batch-kelpoiset palveluntarjoajat yön yli -jonoon, Gemini 2.5 Flashin hinta oli 33 senttiä. Tiivistämisessä, jossa laatuero näiden mallien välillä oli virhemarginaalin sisällä, tuo päätös on arvoltaan tuhansia dollareita kuukaudessa skaalattuna.
Opetus: oikea vertailu on aina kustannus per tehtävä, laskettuna todellisella syöte/tuloste-suhteella, ei yhden tokenin listahinta. Malli, jonka tuloste on kallis, on haluva poimintaan; malli, jonka syöte on halpa, on kallis pitkälle generoinnille.
Mikä malli on halvin käyttötapaukseesi?
Lyhyt versio, hinnoiteltu yllä olevan taulukon mukaan:
- Chatbotit ja RAG (pitkä syöte, lyhyt tuloste): syötteen hinta ja välimuisti dominoivat. Gemini 2.5 Flash ja DeepSeek-V4 voittavat; lisää kehotteen välimuisti siihen, jonka valitset.
- Pitkän muodon generointi (lyhyt syöte, pitkä tuloste): tulosteen hinta dominoi. Gemini 2.5 Flash-Lite ja DeepSeek-V4 ovat halvimmat; vältä GPT-5.6 Solia, ellei tarvitse sen päättelykykyä.
- Agentit ja työkalujen käyttö (suuri konteksti, monta kierrosta): tarkkaile pitkän kontekstin tasoja. Claude Opus 4.8 ja GPT-5.6 Terra ovat ennustettavia; Gemini 2.5 Pro on halvin vain, jos pysyt alle 200K:ssa.
- Koodaus: GLM-4.6 ja sen koodaussuunnitelman tilaus, tai Claude Opus 4.8 vaikeimpiin ongelmiin.
- Eturivin päättely, jossa oikeellisuus voittaa kustannuksen: Claude Opus 4.8 tai Claude Fable 5.
Mihin tahansa päädytkin, reititä se portaalipalvelun kautta, jotta palveluntarjoajan vaihtaminen on konfiguraatiomuutos, ei uudelleenkirjoitus. Parhaiden LLM-portaalityökalujen vertailumme kattaa vaihtoehdot, ja jos haluat täydellisen pelikirjan laskun pienentämiseen, katso oppaamme LLM API -kustannusten vähentämisestä. Geminiin keskittyvää syventymistä varten, jossa on multimodaaliset ja äänihinnat, joita tämä taulukko ei kata, katso Gemini API -hinnoitteluerittelymme.
Miten Techsy valitsee malleja asiakkaille
Rakennamme tuotantokäyttöön tarkoitettuja AI-järjestelmiä B2B-asiakkaille, ja mallin valinta on yksi ensimmäisistä päätöksistämme, yleisesti ennen yhtäkään koodiriviä. Lähestymistapamme on tarkoituksellisen tylsä: profiloi työkuorman todellinen syöte/tuloste-suhde, hinnoittele kolme parasta ehdokasta tuolla suhteella (ei listahinnalla), aja ne eval-settiä vastaan laadun tasavertaisuuden varmistamiseksi, ja kytkä halvin läpäissyt malli portaalipalvelun taakse, jotta voimme hinnoitella sen uudelleen joka kvartaali uusien mallien lanseerautuessa. Viimeinen vaihe on tärkeämpi kuin ”parhaan” mallin valinta tänään, koska yllä näkemäsi hinta on väärä kolmen kuukauden kuluttua.
Jos valitset mallia tai tuijotat jatkuvasti kasvavaa laskua, tämäntyyppisiin päätöksiin autamme. Tutustu AI-integraatiopalveluihimme tai varaa ilmainen arkkitehtuurikatselmus.
Usein kysytyt kysymykset
Mikä on halvin LLM API vuonna 2026?
DeepSeek-V4 on halvin kyvykäs malli hinnalla 0,14 $ syöte / 0,28 $ tuloste miljoonaa tokenia kohden heinäkuusta 2026 alkaen, välimuistiosuman syötteen hinnan ollessa lähellä 0,003 $. Gemini 2.5 Flash-Lite (0,10 $ / 0,40 $) ja Mistral Small 4 (0,15 $ / 0,60 $) ovat aivan perässä. Eturivin laadun työhön Gemini 2.5 Pro on halvin lippulaiva.
Onko GPT-5.6 vai Claude Opus 4.8 kalliimpi?
Ne vastaavat toisiaan syötteessä (5,00 $/M), mutta Claude Opus 4.8 on halvempi tulosteessa (25,00 $/M vs GPT-5.6 Solin 30,00 $/M). Tulostevoittoisissa työkuormissa Opus 4.8 voittaa hinnassa; syötevoittoisissa ne ovat käytännössä tasoissa ennen välimuistia.
Miksi tuloste on kalliimpaa kuin syöte?
Tokenien generointi on laskennallisesti intensiivisempää kuin niiden lukeminen, joten lähes jokainen palveluntarjoaja veloittaa 3–6 kertaa enemmän tulosteesta. Siksi vastauksen pituuden rajaaminen (ja strukturoitujen tulosteiden käyttäminen) säästää enemmän per token kuin kehotteen lyhentäminen.
Kuinka paljon kehotteen välimuisti todella säästää?
Välimuistitetut syötetokenit laskutetaan noin 10 %:lla vakiohinnasta Anthropicilla, OpenAI:lla ja Googlella, eli 90 % alennus kehotteen toistuvasta osasta. Sovelluksissa, jotka lähettävät saman järjestelmäkehotteen jokaisessa pyynnössä, välimuisti leikkaa usein kokonaislaskua 30–50 %.
Sisältävätkö nämä hinnat Batch API -alennuksen?
Ei. Päätaulukko näyttää standardin reaaliaikaisen hinnoittelun. Anthropic, OpenAI, Google ja Alibaba tarjoavat kaikki Batch API:n tasaisella 50 % alennuksella sekä syötteeseen että tulosteeseen ei-kiireellisille työkuormille, jotka sietävät jopa 24 tunnin viiveen.
Onko DeepSeek todella niin paljon halvempi kuin yhdysvaltalaiset mallit?
Kyllä, paperilla. DeepSeek-V4:n tulostehinta (0,28 $/M) on yli 50 kertaa halvempi kuin GPT-5.6 Solin (30 $/M). Kompromissi on, että eturivin yhdysvaltalaiset mallit johtavat edelleen vaikeimmissa päättelytehtävissä, joten useimmat tiimit arbitraasioivat tehtävät, joissa laatu on tasavertainen, ja pitävät lippulaivan muuhun käyttöön.
Mikä on koukku Gemini 2.5 Pro:n alhaisessa hinnassa?
Sen pitkän kontekstin taso. Gemini 2.5 Pro:n listahinta on 1,25 $ / 10,00 $, mutta mikä tahansa yksittäinen kehote yli 200 000 tokenia hinnoittelee koko pyynnön uudelleen hintaan 2,50 $ / 15,00 $. Jos kehotteesi ovat suuria, budjetoi porrastettu hinta, ei etusivun hinta.
Kuinka usein LLM API -hinnoittelu muuttuu?
Usein. Hinnat muuttuivat kahdesti vuoden 2026 ensimmäisellä puoliskolla, ja uudet malliperheet (kuten GPT-5.6-taso, joka lanseerattiin 9. heinäkuuta 2026) nollasivat kentän joka kerta. Varmista aina palveluntarjoajan viralliselta hinnoittelusivulta ennen työkuorman sitomista, ja hinnoittele uudelleen kvartaaleittain.
Millä mallilla on suurin konteksti-ikkuna hintaan nähden?
DeepSeek-V4 ja Gemini 2.5 -perhe tarjoavat 1M-tokenin kontekstin hintaskaalan alaosassa. GPT-5.6 -mallit ovat hieman korkeammalla 1,05M:ssä, ja GPT-5.4 nano ulottuu 1,1M:iin vain 0,20 $ syötehinnalla, mikä tekee siitä halvimman suuren kontekstin vaihtoehdon yksinkertaisiin tehtäviin.
Kirjoittajasta
Mert Batur Gurbuz on Techsy.io:n co-founder, jossa tiimi toimittaa AI-agentteja, automaatiojärjestelmiä ja voice/SDR-pipelineja B2B-asiakkaille. Hän opiskelee Birminghamin yliopistossa ja kirjoittaa LLM-työkalupakista, jota Techsyn tiimi todella käyttää tuotannossa. Yhdistä LinkedInissä.
Lähteet
- Anthropic Claude API Pricing (käytetty 2026-07-14)
- OpenAI API Pricing (käytetty 2026-07-14)
- Google Gemini API Pricing (käytetty 2026-07-14)
- DeepSeek API Pricing (käytetty 2026-07-14)
- Alibaba Cloud Model Studio Pricing (käytetty 2026-07-14)
- Mistral API Pricing (käytetty 2026-07-14)
- Z.AI (Zhipu GLM) Pricing (käytetty 2026-07-14)