OpenAI, Claude & Gemini API -kustannuslaskuri
Vertaa kuukausikustannuksia eri tarjoajien välillä cachingin ja batch-säästöjen avulla.
GPT:n, Clauden ja Geminin API-kustannukset vaihtelevat 0,15 dollarista 75 dollariin miljoonaa syöte-tokenia kohden, ja output-tokenit ovat tyypillisesti 3–5 kertaa kalliimpia. 10 miljoonalla tokenilla kuukaudessa GPT-4o maksaa noin 775 dollaria, Claude Sonnet 4 noin 1 140 dollaria ja Gemini 2.5 Pro noin 825 dollaria. Prompttien välimuistitus leikkaa välimuistittujen tokenien kustannuksia 10-kertaisesti; Batch API puolittaa kustannukset työssä, joka ei vaadi reaaliaikaisuutta. Tällä laskurilla voit mallintaa tarkan käytön kaikkien kolmen tarjoajan osalta.
Syötteesi
05 fieldsKenelle tämä työkalu on tarkoitettu
Perustajat, jotka kartoittavat openai api-projektia ennen myyjiin tutustumista. CTO:t ja tekniset johtajat, jotka rakentavat budjettia uusille tuotekehityshankkeille. Tuotepäälliköt, jotka muuntavat yksittäisen idean rahoitusosaston kannalta perusteltavaksi hinnanvälialueeksi. Hankintatiimit, jotka tekevät järkevyystarkastuksen toimittajien ja konsulttien tarjouksille.
Miten laskemme tämän
Hinnat perustuvat OpenAI:n, Anthropicin ja Googlen julkisesti ilmoittamiin hintoihin vuoden 2026 tasojen mukaan. Kehotteen välimuisti koskee vain välimuistissa olevia syötetokeneita (yleensä järjestelmäkehote ja vakaa konteksti). Batch API koskee sekä syöte- että tulostetokeneita muussa kuin reaaliaikaisessa työssä, jossa on 24 tunnin SLA.
Tietolähteet
Tekijät, jotka muuttavat hintaa
Mallitason valinta
GPT-4.5:n, Claude Opus 4:n ja Gemini 2.5 Pro:n kaltaiset huippumallit ovat tokenia kohden 5–10 kertaa kalliimpia kuin keskitason sisaruksensa. Käytä huippumalleja vain vaikeisiin päättelytehtäviin, joissa keskitason mallit todella epäonnistuvat: monivaiheinen logiikka, matematiikka, monitulkintainen koodin generointi tai tehtävät, jotka vaativat syvää maailmantietoa. Ohjaa kaikki muu Claude Sonnet 4:lle, GPT-4o:lle tai Gemini Flashille. Hintaero on niin suuri, että älykäs reititys leikkaa tyypillisesti kuluja 60–80 % sekakuormissa.
Prompt-kalastus
Anthropic välimuistaa syötetokenit ilmaiseksi 5 minuutiksi tai tunniksi 25 %:n lisämaksulla, mikä leikkaa välimuistitokenien kustannuksia noin 90 %. OpenAI välimuistaa automaattisesti 5–10 minuutiksi tietyissä päätepisteissä ilman erillistä konfiguraatiota. Välimuisti toimii parhaiten, kun järjestelmäkehote on yli 2 000 tokenia ja vakaa pyyntöjen välillä, mikä kuvaa useimpia tuotannon chatbotteja ja RAG-järjestelmiä. Säästöt ovat suurimpia kuormissa, joissa on pitkä vakaa konteksti ja paljon pyyntöjä minuutissa.
Batch API
Sekä OpenAI että Anthropic tarjoavat batch-päätepisteitä tasan 50 %:n alennuksella normaalihinnoista 24 tunnin SLA:ta vastaan. Batch sopii luokitteluun, upotusten generointiin, tiivistämiseen, arviointiajoihin ja kaikkeen taustakäsittelyyn. Integraatio on yksinkertainen: sama malli, sama kehote, eri päätepiste ja jono tulosten odottamiseen. Useimmat tiimit sivuuttavat batchin ja maksavat täyttä hintaa kuormista, joilla ei ole reaaliaikavaatimusta – tämä on yksi helpoimmin vältettävistä tekoälykuluista.
Output-tokenit
Tulostetokenit maksavat 3–5 kertaa enemmän kuin syötetokenit kaikilla tarjoajilla, eivätkä useimmat vastaukset tarvitse API:n oletuksena sallimaa 4 000 tokenin tulostpuskuria. Jos poimit kyllä-tai-ei-vastausta, rajoita tuloste 10 tokeniin. Jos generoit lyhyttä tiivistelmää, rajoita se 200 tokeniin. Malli haluaa usein selittää päättelyään, vaikka et sitä pyytäisi, ja maksat näistä selityksistä. max_tokens-arvon tiukentaminen leikkaa tulostekustannuksia usein 30–50 % ilman laatuvaikutusta.
Context-ikkuna ei ole sama asia kuin hinta
Kaikki suuret toimittajat veloittavat kulutettujen tokenien mukaan, ei kontekstiikkunan koon perusteella. 200K:n kontekstiikkunan käyttäminen 5 000 tokenin syötteelle maksaa täsmälleen saman kuin 5K:n kontekstiikkuna 5 000 tokenin syötteelle. Käytännössä pitkän kontekstin mallit eivät ole "kalliimpia käyttää", ellet todella täytä kontekstia. Valitse malli kyvykkyyden ja tokenihinnan perusteella, älä sen mukaan, kenellä on suurin kontekstiikkuna.
Miten vähennät kustannuksia
Ota prompt-välimuisti käyttöön ensimmäisenä optimointina, ennen kaikkea muuta. Anthropicilla merkitse vakaa järjestelmäpromptisi cache_control-otsikoilla, jolloin välimuistitetut tokenit laskevat noin 10 prosenttiin normaalista syötehinnasta. OpenAI:lla välimuistitus tapahtuu automaattisesti tietyissä päätepisteissä, kun promptisi alkuosa on identtinen pyyntöjen välillä. Hyöty on suurin työkuormissa, joissa on pitkä vakaa konteksti ja paljon pyyntöjä: yksityiskohtaiset chatbotit, RAG-järjestelmät toistuvalla hakukontekstilla ja kaikki agenttisilmukat, jotka lähettävät pitkän ohjeistuksen uudelleen. Useimmat tiimit unohtavat ottaa välimuistin käyttöön ja maksavat 5–10 kertaa liikaa.
Siirrä kaikki ei-realiaikaiset työkuormat Batch API:lle. Sekä Anthropic että OpenAI tarjoavat batch-päätepisteet tasan 50 % normaalihinnoittelusta 24 tunnin vastausaikaa vastaan. Luokittelutyöt, sisällön moderointi, upotusten generointi, tiivistysputket ja arviointiajot sopivat kaikki hyvin. Integraatiotyö on vähäistä, koska prompti ja malli pysyvät samoina. Tiimit ajavat rutiinisti koko sisällön tagausputkensa normaalihinnalla, vaikka batch puolittaisi laskun ilman laadullista eroa.
Reititä pyynnöt vaativuuden mukaan. Yksinkertaiset kyselyt (tervehdykset, muotoilut, perushaut) kuuluvat GPT-4o mini-, Claude Haiku- tai Gemini Flash -malleille, joiden hinta on 0,15–0,80 dollaria miljoonaa syötokenia kohden. Vaativa päättely kuuluu Claude Opus-, GPT-4.5- tai Gemini Pro -malleille, joiden hinta on 1,25–75 dollaria miljoonaa kohden. Pieni luokittelija mallireitittimesi edessä leikkaa tyypillisesti kustannuksia 60–80 % sekatyökuormissa. Kaiken lähettäminen huippumallille on yleisin tekoälyn kustannusvirhe, jonka näemme tuotannossa.
Rajoita max_tokensia reilusti. Tulostokenit maksavat 3–5 kertaa enemmän kuin syötokenit, ja oletusarvoinen 4K:n tulostuspuskuri on paljon suurempi kuin useimmat vastaukset tarvitsevat. Rajoita kyllä-tai-ei-vastaukset 10 tokeniin, lyhyet tiivistelmät 200:aan ja jäsennelty JSON siihen, mitä skeemasi vaatii, plus pieni puskuri. Malli haluaa joskus laajentaa vastausta, vaikka et pyytänyt, ja maksat näistä laajennuksista. max_tokensin kiristäminen tarkoittaa useimmissa tapauksissa 30–50 % pienempiä tulostuskustannuksia.
Karsi haettu konteksti vain siihen, mitä kukin kysely tarvitsee. RAG-järjestelmät hakevat usein 10–20 lohkoa ja pakkaavat ne kaikki promptiin varmuuden vuoksi. Tuloksena on tuhansien epäolennaisten tokenien maksaminen joka pyynnössä. Uudelleenjärjestelijän lisääminen, joka suodattaa 3–5 olennaisimpaan lohkoon, leikkaa tyypillisesti syötokenien käyttöä 50–70 % ilman laadun heikkenemistä – usein laatu jopa paranee, koska malli ei häiriinny epäolennaisesta kontekstista.
Kirjaa jokainen pyyntö tokenmäärineen, malleineen ja välimuistitilanteineen. Et voi optimoida sitä, mitä et näe, ja tekoälyn kustannukset voivat muuttua yhdessä yössä, kun uusi ominaisuus julkaistaan tai promptia säädetään. Aseta päivittäiset kulutusvaroitukset. Rakenna kojelauta, joka erittelee kulutuksen ominaisuuden, mallin ja päätepisteen mukaan. Useimmat tuotannon kustannusylitykset, joita kohtaamme, johtuvat siitä, että käyttömalli muuttui kaksi viikkoa ennen kuin kukaan katsoi laskua.
Kustannus miljoonaa tokenia kohti (2026 hinnasto)
| Malli | Syöte | Tuotos | Välimuistitettu syöte |
|---|---|---|---|
| GPT-4.5 | $75,00 | $150,00 | $37,50 |
| GPT-4o | $2,50 | $10,00 | $1,25 |
| GPT-4o mini | $0,15 | $0,60 | $0,075 |
| Claude Opus 4 | $15,00 | $75,00 | $1,50 |
| Claude Sonnet 4 | $3,00 | $15,00 | $0,30 |
| Claude Haiku 4 | $0,80 | $4,00 | $0,08 |
| Gemini 2.5 Pro | $1,25 | $10,00 | N/A |
| Gemini 2.5 Flash | $0,075 | $0,30 | N/A |
Usein kysytyt kysymykset
Kysymyksiä, joita saamme joka viikko
Lyhyet vastauksia selkeällä suomen kielellä. Jos etsimääsi vastausta ei löydy täältä,
GPT-4o: 2,50 dollaria miljoonaa syöte-tokenia kohden, output 10 dollaria. GPT-4o mini: 0,15 dollaria/M syöte, 0,60 dollaria output. GPT-4.5: 75 dollaria/M syöte, 150 dollaria output. 10 miljoonalla tokenilla kuukaudessa ja 30/70 syöte/output-suhteella kustannukset ovat mallista riippuen 25–13 000 dollaria.
Useimpiin kuormiin: GPT-4o mini, Gemini 2.5 Flash tai Claude Haiku 4 – kaikki alle dollarin miljoonaa syöte-tokenia kohden. Hinta-laatusuhteeltaan parhaat: Claude Sonnet 4 tai Gemini 2.5 Pro.
Anthropic ja OpenAI tallentavat suuret syötepromptit välimuistiin pyyntöjen välillä. Välimuistitut tokenit maksavat noin 90 % vähemmän kuin välimuistittomat. Sopii parhaiten chatboteille, joilla on vakaa järjestelmäprompti, tai RAG-ratkaisuille, joissa konteksti pysyy vakaana.
Tasan 50 % sekä syöte- että output-tokeneista. Edellyttää 24 tunnin SLA:n hyväksymistä. Sopii luokitteluun, tiivistämiseen, upotuksiin ja arviointiin. Ei sovi reaaliaikaiseen chatiin tai interaktiiviseen käyttökokemukseen.
Samantasoisissa laatuluokissa kustannukset ovat samankaltaiset. Claude Sonnet 4 ja GPT-4o ovat suunnilleen tasoissa. Claude Opus 4 on prompttien välimuistituksella noin 30 % GPT-4o:ta edullisempi kuormissa, joissa prompti pysyy vakaana.
(1) Ota prompttien välimuistitus käyttöön. (2) Käytä Batch API:a aina kun mahdollista. (3) Ohjaa yksinkertaiset kyselyt mini-malleille. (4) Rajoita max_tokens tiukasti. (5) Karsi hakukonteksti olennaiseen.
Kannattavuusraja on noin 5 000 dollarin API-kulut kuukaudessa. Sen alle: jatka API:en käyttöä. Sen yli: Llama 3.1:n tai Mistralin oma hostaus leikkaa kustannuksia 50–70 %, jos sinulla on infrastruktuuriosaamista.
Ota edustava 100 pyynnön otos. Mittaa keskimääräiset syöte- ja tulostetokenit. Kerro kuukausittaisella pyyntömäärällä. Kerro miljoonan tokenin hinnalla. Lisää 30 %:n turvamarginaali.
Vain vaativaan päättelyyn, jossa keskitason mallit eivät riitä. 80 %:ssa tuotannon kuormista Sonnet 4, GPT-4o tai Gemini 2.5 Pro toimivat mainiosti kymmenyksellä hinnasta.
Tyypillisissä kuormissa ±15 %:n tarkkuudella. Todellinen vaihtelu johtuu kehotteiden pituuseroista, vastausten pituuseroista, virhe- ja uudelleenyrityssilmukoista sekä reitityslogiikasta. Käytä laskuria suunnittelun apuna, ei lopullisena laskuna.
Vastaavia työkaluja
Muut laskurit, jotka ihmiset avaavat yleensä tämän jälkeen; valitse se, joka tukee seuraavaa päätöstäsi.
Kehityskustannus plus kuukausittainen käyttökustannus; kokonaiskuva.
Tarkka arvio meidän tiimiltämme
Laskurit antavat arvion vaihteluvälinä. 30 minuutin puhelu puolestaan tarjoaa kiinteän laajuuden, aikataulun ja budjetin. Ilmainen konsultaatio, ei sitoumuksia.
Aloita keskustelu