
Paljonko LLM-inferenssi maksaa? 4 skenaariota oikeilla laskelmilla
GPT-4 maksoi 30 dollaria miljoonalta syöketokenilta maaliskuussa 2023. Kolme vuotta myöhemmin GPT-5.6 ajaa saman miljoonan kymmenellä dollarilla. Claude Opus 4.5 maksaa 15 dollaria. Lattia? Kaksi senttiä. Halvimman ja kalleimman vaihtoehdon välinen ero on siis 1 500-kertainen täsmälleen samasta työsuoritteesta. LLM-inferenssin hinta on toistuva lasku, jonka maksat joka kerta kun koulutettu malli lukee syötteesi ja tuottaa vastauksen, ja jokainen suuri palveluntarjoaja hinnoittelee sen miljoonaa tokenia kohden. Budjettimallit maksavat 0,02–0,30 dollaria miljoonalta syöketokenilta. Frontier-mallit veloittavat samasta volyymista 15–75 dollaria. Ero merkitsee, koska työkuormasi eikä kunnianhimosi ratkaisee, minkä tason mallia todella tarvitset.
Keskeisimmät asiat:
- Budjettimallit maksavat 0,02–0,30 dollaria miljoonalta syöketokenilta, frontier-mallit 15–75 dollaria (heinäkuu 2026).
- Ulostulotokenit maksavat 3–5 kertaa enemmän kuin syöketokenit, koska generointi etenee peräkkäin eikä rinnakkain.
- 50 000 keskustelun tukichatbot maksaa mallitasosta riippuen noin 9–420 dollaria kuukaudessa.
- Inferenssihinnat ovat laskeneet noin 10-kertaisesti vuodessa; Gartner ennustaa 90 % laskua vuoteen 2030 mennessä.
Paljonko LLM-inferenssi maksaa miljoonaa tokenia kohden?
LLM-inferenssin hinnoittelu noudattaa heinäkuussa 2026 kolmiportaista rakennetta. Budjettimallit palveluntarjoajilta kuten Google (Gemini 2.5 Flash) ja avoimen lähdekoodin vaihtoehdot (Llama 4, Qwen 3) maksavat 0,02–0,30 dollaria miljoonalta syöketokenilta. Keskitason mallit (GPT-4.1, Claude Sonnet 4) asettuvat 0,55 ja 15 dollarin väliin. Frontier-tason päättelymallit (o3, Claude Opus 4.5) maksavat 15–75 dollaria. Jokainen palveluntarjoaja julkaisee hintansa virallisilla hinnoittelusivuillaan (OpenAI, Anthropic), ja PricePerToken.com seuraa yli 300 mallia reaaliaikaisessa taulukossa.
Heinäkuussa 2026 miljoonan syöketokenin voi ajaa kahdella sentillä tai maksaa samasta miljoonasta 75 dollaria frontier-mallilla.
| Taso | Esimerkkimallit | Syöte $/M tokenia | Ulostulo $/M tokenia | Välimuistisyöte $/M | Paras käyttö |
|---|---|---|---|---|---|
| Budjetti | Gemini 2.5 Flash, Llama 4 Scout, Qwen 3 32B | $0,02–0,30 | $0,06–1,20 | $0,01–0,15 | Suuren volyymin luokittelu, reititys |
| Keskitaso | GPT-4.1, Claude Sonnet 4, Gemini 2.5 Pro, GPT-5.6 | $0,55–15 | $2,20–60 | $0,28–7,50 | RAG, koodigenerointi, analyysi |
| Frontier | o3, Claude Opus 4.5 | $15–75 | $60–300 | $7,50–37,50 | Monimutkainen päättely, tutkimus |
Välimuistisyötteen alennukset leikkaavat laskuasi 50–90 % toistuvissa prompteissa (promptien välimuistitus leikkaa syökekustannuksia selittää mekaniikan). Kaikkien palveluntarjoajien ajantasaiset hinnat 300 mallin live-taulukossa ovat täydellisessä token-hintavertailussamme.
Mistä LLM-inferenssin hinta muodostuu? Neljä osatekijää
Inferenssilaskusi jakautuu neljään kustannustekijään: tokenikohtainen GPU-laskenta-aika, mallin painojen ja KV-välimuistin vaatima muisti, syötteen ja ulostulon epäsymmetria, joka tekee generoinnista lukemista kalliimpaa, sekä infrastruktuurin yleiskulut (sähkö, jäähdytys, verkko). Kun ymmärrät, mikä tekijä hallitsee työkuormaasi, tiedät missä optimointi kannattaa.
| Osatekijä | Mikä se on | Osuus laskustasi | Mikä sitä liikuttaa |
|---|---|---|---|
| Laskenta (GPU-aika) | FLOPit, joilla kukin tokeni kulkee mallin kerrosten läpi | 40–60 % | Mallin koko, batch-koko, kvantisoinnin taso |
| Muisti (painot + KV-välimuisti) | VRAM, joka pitää mallin parametrit ja tarkkaavaisuustilan | 20–35 % | Kontekstin pituus, samanaikaiset pyynnöt |
| Syötteen/ulostulon epäsymmetria | Dekoodausvaihe etenee peräkkäin, yksi token kerrallaan | Sisäänrakennettu ulostulon hintaan | Ulostulon pituus, näytteenottostrategia |
| Infrastruktuurin yleiskulut | Sähkö, jäähdytys, verkko, GPU:n toimeton aika | 10–20 % | Datakeskuksen sijainti, käyttöaste |
Laskenta: GPU-aika tokenia kohden
Jokainen tokeni kulkee mallin jokaisen kerroksen läpi. 70 miljardin parametrin malli FP16-tarkkuudella tarvitsee noin 140 GFLOPs per tokeni. Kvantisointi INT4-tasoon pudottaa luvun noin 35 GFLOPsiin. NVIDIAN inferenssin benchmarkkausopas erittelee täydellisen TCO-kaavan: laitteistopoistot plus sähkö plus toiminnalliset yleiskulut jaettuna tarjoiltujen tokenien määrällä.
Muisti: mallin painot + KV-välimuisti
70B-malli FP16-tarkkuudella vie pelkkiin painoihin noin 140 GB VRAMia. KV-välimuisti kasvaa kontekstin pituuden ja samanaikaisten batchien koon mukaan. 128K-kontekstilla ja 32 samanaikaisella pyynnöllä voit polttaa toiset 80 GB. Siksi mallikohtaiset VRAM-vaatimukset merkitsevät niin paljon päätettäessä omaa infraa.
Syötteen ja ulostulon epäsymmetria
Ulostulotokenit maksavat 3–5 kertaa enemmän kuin syöketokenit, koska malli generoi ne yksi kerrallaan järjestyksessä. Se ei voi rinnakkaistaa niitä samalla tavalla kuin se lukee promptisi.
Tässä asia yksinkertaisesti: 2 000 tokenin promptisi lukeminen ("prefill"-vaihe) käsittelee kaikki tokenit samanaikaisesti GPU-ytimien yli. 500 ulostulotokenin generointi ("decode"-vaihe) etenee yksi token per askel, ja kukin token riippuu edellisestä. GPU on suurimman osan ajasta toimettomana odottaessaan muistikaistaa askelten välissä. Juuri tuosta toimettoajasta maksat 3–5-kertaisen syötehinnan.
Infrastruktuurin yleiskulut
Sähkö, jäähdytys, verkko ja pyyntöjen välissä toimettomana seisovat GPU:t. Hugging Facen optimointidokumentaatio käsittelee sitä, miten continuous batching ja spekulatiivinen dekoodaus puristavat samasta laitteistosta enemmän tokeneita per GPU-tunti ja leikkaavat suoraan tätä yleiskulujen osuutta.
Paljonko LLM-inferenssi maksaa neljässä todellisessa työkuormassa?
Tyypillinen tukichatbot maksaa 9–420 dollaria kuukaudessa, RAG-putki 168–3 360 dollaria kuukaudessa, 200 kehittäjän koodiavustaja 123–2 078 dollaria kuukaudessa ja dokumenttien eräkäsittely 240–6 400 dollaria kuukaudessa. Vaihteluväli riippuu lähes kokonaan mallitason valinnasta. Rakensimme nämä neljä skenaariota asiakaskäyttöönottomme token-volyymeista hinnoiteltuna virallisten heinäkuun 2026 hintasivujen mukaan. Jokainen alla oleva dollariluku on toistettavissa: ilmoitetut token-oletukset kerrottuna julkaistuilla hinnoilla. Meidän analyysiämme, ei toimittajien väitteitä.
Asiakastuen chatbot: 50 000 keskustelua kuukaudessa
Keskivertokeskustelu: 800 syöketokenia (järjestelmäprompt + käyttäjän viestit + haettu konteksti), 400 ulostulotokenia. Kuukausivolyymi: 50 000 keskustelua = 40 miljoonaa syöketokenia, 20 miljoonaa ulostulotokenia.
- Budjettivalinta (Gemini 2.5 Flash): 40 M × $0,075/M + 20 M × $0,30/M = $9/kk. Lähes epäilyttävän halpaa.
- Keskitason valinta (Claude Sonnet 4): 40 M × $3/M + 20 M × $15/M = $420/kk.
Tason 1 tikettejä hoitavalle tukibotille budjettimalli hoitaa 90 % kyselyistä mainiosti. Reitä vaikea 10 % keskitasolle luokittelijalla.
RAG-putki: 10 000 hakua päivässä
Keskivertohaku: 3 200 syöketokenia (haetut palaset + järjestelmäprompt + käyttäjän kysymys), 600 ulostulotokenia. Kuukaudessa: 300 000 hakua = 960 miljoonaa syöketokenia, 180 miljoonaa ulostulotokenia.
- Budjettivalinta (Llama 4 Scout API:n kautta): 960 M × $0,10/M + 180 M × $0,40/M = $168/kk.
- Keskitason valinta (GPT-4.1): 960 M × $2/M + 180 M × $8/M = $3 360/kk.
RAG-työkuorma on syötepainotteinen, joten välimuistisyötteen alennukset purevat täällä kovaa. 70 % prompt-välimuistituksella keskitason hinta putoaa noin 2 100 dollariin kuukaudessa.
Koodiavustaja: 200 kehittäjää
Keskivertoistunto: 4 500 syöketokenia (tiedostokonteksti + keskustelu), 1 200 ulostulotokenia. Oletetaan 15 pyyntöä kehittäjää kohden päivässä, 22 työpäivää = 66 000 pyyntöä kuukaudessa = 297 miljoonaa syötettä, 79 miljoonaa ulostuloa.
- Budjettivalinta (Qwen 3 32B): 297 M × $0,20/M + 79 M × $0,80/M = $123/kk.
- Keskitason valinta (Claude Sonnet 4): 297 M × $3/M + 79 M × $15/M = $2 078/kk.
Kehittäjät huomaavat laatuerot nopeasti. Koodissa keskitaso on yleensä lattia. Budjettimallit toimivat automaattitäydennystyyppisiin ehdotuksiin, mutta kamppailevat usean tiedoston refaktorointien kanssa.
Dokumenttien eräkäsittely: 1 miljoonaa dokumenttia kuukaudessa
Keskivertodokumentti: 2 000 syöketokenia, 300 ulostulotokenia (ekstraktio, luokittelu, tiivistäminen). Kuukaudessa: 2 miljardia syötettä, 300 miljoonaa ulostuloa.
- Budjettivalinta (Gemini 2.5 Flash): 2 mrd. × $0,075/M + 300 M × $0,30/M = $240/kk.
- Keskitason valinta (GPT-4.1): 2 mrd. × $2/M + 300 M × $8/M = $6 400/kk.
Tällä volyymilla tasojen 27-kertainen hintaero on 6 160 dollarin kuukausierä. Budjettimallit hoitavat strukturoidun ekstraktion hyvin. Jos harkitset tämän volyymin ajamista omalla infralla, tarkista mallikohtaiset VRAM-vaatimukset laitteistomitoitusta varten.
| Työkuorma | Malli | Tokenia/pyyntö (sisään/ulos) | Pyyntöä/kk | $/kk |
|---|---|---|---|---|
| Tukichatbot | Gemini 2.5 Flash | 800 / 400 | 50 000 | $9 |
| Tukichatbot | Claude Sonnet 4 | 800 / 400 | 50 000 | $420 |
| RAG-putki | Llama 4 Scout | 3 200 / 600 | 300 000 | $168 |
| RAG-putki | GPT-4.1 | 3 200 / 600 | 300 000 | $3 360 |
| Koodiavustaja | Qwen 3 32B | 4 500 / 1 200 | 66 000 | $123 |
| Koodiavustaja | Claude Sonnet 4 | 4 500 / 1 200 | 66 000 | $2 078 |
| Dokumenttien eräajo | Gemini 2.5 Flash | 2 000 / 300 | 1 000 000 | $240 |
| Dokumenttien eräajo | GPT-4.1 | 2 000 / 300 | 1 000 000 | $6 400 |
def monthly_cost(input_tokens, output_tokens, requests, price_in, price_out):
"""Estimate monthly LLM inference cost.
Args:
input_tokens: avg input tokens per request
output_tokens: avg output tokens per request
requests: monthly request volume
price_in: $/M input tokens
price_out: $/M output tokens
"""
total_in = input_tokens * requests / 1_000_000
total_out = output_tokens * requests / 1_000_000
return (total_in * price_in) + (total_out * price_out)
# Example: support chatbot on Claude Sonnet 4
cost = monthly_cost(
input_tokens=800,
output_tokens=400,
requests=50_000,
price_in=3.00,
price_out=15.00
)
print(f"${cost:,.2f}/month") # $420.00/monthAPI vai oma infra: kumpi voittaa milloinkin?
API voittaa alle noin 20 000 pyynnöllä päivässä tai kun tiimiltäsi puuttuu ML-infrastruktuurikokemus. Oma infra voittaa yli 200 000 pyynnöllä päivässä, kun GPU:n käyttöaste pysyy yli 50 prosentissa. Kannattavuusraja asettuu Introlin analyysin mukaan noin 50 000–80 000 pyyntöön päivässä 70B-luokan mallilla yhdellä H100-noodilla. Alle tuon rajan API-palveluntarjoajan monivuokraajaefektiivisyys voittaa oman yksivuokraajalaitteistosi matematiikan.
| Volyymitaso | API $/kk | Oma infra $/kk (GPU + ylläpito) | Voittaja | Miksi |
|---|---|---|---|---|
| Matala: 2 000 pv | $150–400 | $2 800–4 500 | API | GPU seisoo toimettomana 85 % ajasta |
| Keskitaso: 20 000 pv | $1 500–4 000 | $3 200–5 000 | API (niukasti) | Käyttöaste noin 40 %, yhä kannattavuusrajan alla |
| Korkea: 200 000 pv | $15 000–40 000 | $5 500–8 000 | Oma infra | Yli 70 % käyttöaste kuittaa laitteet nopeasti |
Milloin API voittaa
Julkaiset päivissä etkä viikoissa. Ei ML-insinöörin palkkaa (180 000–250 000 dollaria vuodessa), ei GPU-vikojen päivystysvuoroja, ei kapasiteettisuunnittelua. Useimmille alle 50 insinöörin tiimeille API on oikea oletus. Piste.
Milloin oma infra voittaa
Olet ylittänyt 200 000 pyyntöä päivässä, työkuormasi on ennustettava ja palkkaat jo ML-infrastruktuuri-ihmisiä. Avoimen lähdekoodin mallit (Llama 4, Qwen 3, Mistral) kulkevat omalla laitteistollasi sähkönhinnalla plus poistoilla. vLLM vs SGLang -benchmarkit näyttävät 15–30 % läpimenieroja työkuorman muodosta riippuen, ja tällä skaalalla se merkitsee.
Kannattavuusraja
Oma infra voittaa vasta yli noin 50 % pysyvällä GPU-käyttöasteella. Sen alla maksat toimettomasta piistä. Piilossa olevat henkilökulut (ML-insinöörien aika, päivystys, mallipäivitykset, tietoturvapaikkaukset) ovat todellinen syy siihen, miksi useimmat tiimit pysyvät API:ssa vaikka raaka GPU-matematiikka näyttäisi suotuisalta. Jos ajat silti omaa infraa, mallien ajaminen Modalissa poistaa infrastruktuurin hallintakerroksen ja pitää tokenkohtaiset kustannukset API-hintojen alapuolella.
Piilokustannukset, joita kukaan ei budjetoi
Raaka token-kulutus on 60–80 % todellisesta laskustasi. Loput piilevät kuudessa erässä, jotka eivät koskaan näy hintalaskurissa. Budjetoi token-arviosi päälle vielä 20–40 % niiden kattamiseen.
- Monitorointi- ja observability-työkalut: 200–1 500 dollaria kuukaudessa. Token-käytön kojelaudat, viiveenseuranta, kustannusten kohdennus ominaisuuskohtaisesti. LLM-observability-pino maksaa itsensä takaisin heti ensimmäisellä kerralla, kun huomaat prompt-regression ennen kuin se syö budjettisi.
- Uudelleenyritykset ja epäonnistuneet ajot: 3–8 % pyynnöistä epäonnistuu tai vaatii uudelleenyrityksen (aikakatkaisut, rajat, virheelliset ulostulot). Se on 3–8 % token-laskustasi kulutettuna tyhjään.
- Prompt-engineeringin iterointitunnit: 20–60 tuntia kvartaalissa 100–200 dollarin sivukulullisella insinöörituntihinnalla. Jokainen prompt-muutos ajaa testierät uudelleen.
- Eval- ja regressiotestaus: 100–800 dollaria kuukaudessa token-kulutusta automatisoiduille eval-sarjoille. Maksat mallille itsensä arvioinnista.
- Monialueinen redundanssi: 1,5–2-kertaiset infrastruktuurikustannukset, jos tarvitset alueiden välisen varamiehityksen viiveen tai compliance-vaatimusten vuoksi.
- Kylmäkäynnistysviiveen sakko: Serverless-GPU-ajot (Modal, AWS Lambda) veloittavat toimettoajasta. Kylmäkäynnistykset lisäävät 2–8 sekuntia ja laskuttavat lämpenemisestä.
Nyrkkisääntö: kerro raaka token-arviosi 1,3:lla saadaksesi realistisen budjetin. Kerro 1,4:llä, jos toimit säännellyllä alalla, jossa on compliance-yleiskuluja.
Miksi LLM-inferenssi halpenee koko ajan?
LLM-inferenssin hinnat ovat laskeneet noin 10-kertaisesti vuodessa vuodesta 2023. Työkuorma, joka maksoi 1 000 dollaria kuukaudessa vuonna 2024, maksaa tänään lähempänä sataa dollaria. Kolme voimaa ajaa tätä: laitteistokehitys (NVIDIA Blackwell FP4, Google TPU v6), kilpailupaine (DeepSeek ja avoimen lähdekoodin mallit pakottavat hintasotia) ja ohjelmisto-optimointi (spekulatiivinen dekoodaus, continuous batching, kvantisointi). Gartner ennustaa inferenssikustannusten laskevan vielä 90 % vuoteen 2030 mennessä, mutta se on ennuste eikä takuu.
Epoch AI:n hintaseuranta dokumentoi tämän laskun kovilla datapisteillä. a16z:n "LLMflation"-analyysi loi termin ja kehysti taloudelliset seuraukset: inferenssi deflatoituu nopeammin kuin mikään aiempi laskentakategoria.
Koulutus vs. inferenssi: kustannusero
Frontier-mallin koulutus maksaa 50–200 miljoonaa dollaria (kertaosto). Saman mallin inferenssi kaikkien käyttäjien yli maksaa skaalasta riippuen 5–50 miljoonaa dollaria vuodessa. Useimmilla tiimeillä suhde on 10–100-kertainen: koulutus maksaa 10–100 kertaa sen mitä yhden vuoden inferenssi. Mutta koulutus on kertaluonteinen pääomakulu. Inferenssi on toistuva käyttökulu, joka kasvaa käyttäjämäärän mukana. Et maksa koulutuksesta ellet rakenna perusmallia. Inferenssistä maksat joka ikinen päivä.
Energiakulu
NVIDIA H100 ottaa kuormalla noin 700 W. Sähkön hinnan ollessa $0,10/kWh (Yhdysvaltain keskiarvo) se on $0,07 per GPU-tunti. 70B-malli yhdellä H100:lla tuottaa batch-ajossa noin 2 000 ulostulotokenia sekunnissa. Yhdessä tunnissa: 7,2 miljoonaa tokenia. Sähkökulu miljoonaa ulostulotokenia kohden: noin $0,01. Meidän laskelmamme, ja nimetty sellaiseksi. Energia on 1–3 % API-laskustasi mutta 8–15 % itse ylläpidetyn infran TCO:sta. Se merkitsee enemmän, jos ajat omia GPU:itasi kalliin sähkön alueella (Saksa $0,30/kWh kolminkertaistaa luvun).
Käytännön johtopäätös: hinnat laskevat niin nopeasti, että 12 kuukauden sitoutuminen tiettyyn mallitasoon on riski. Arvioi uudelleen kvartaaleittain. 12 tapaa leikata LLM-laskuasi kattaa taktiset siirrot, jotka voit tehdä heti, kun makrotrendi tekee raskaan työn.
Näin arvioit oman inferenssikustannuksesi
Arvioi kuukausittainen LLM-inferenssikustannuksesi neljässä vaiheessa: laske tokenit per pyyntö, kerro kuukausivolyymilla, sovelra tasohinnoittelua ja lisää sitten 20–40 % yleiskuluja. Kokemuksemme mukaan asiakkaan inferenssibudjetteja mitoittaessa useimmat tiimit jättävät neljännen vaiheen väliin ja ihmettelevät, miksi todellinen lasku ylittää arvion kolmanneksella. Tässä prosessi, jota käytämme.
- Laske tokenit per pyyntö. Kirjaa keskimääräiset syöketokenisi (järjestelmäprompt + konteksti + käyttäjän viesti) ja ulostulotokenisi (mallin vastaus) yli sadasta todellisesta pyynnöstä. Älä arvaa. Mittaa.
- Kerro kuukausivolyymilla. Pyyntöä/pv × 30 = kuukausipyynnöt. Kerro pyyntökohtaisilla tokenmäärilläsi.
- Sovella tasohinnoittelua. Kerro syöketokenien kokonaismäärä mallin $/M-syötehinnalla. Sama ulostulolle. Laske yhteen.
- Lisää 20–40 % yleiskuluja. Uudelleenyritykset, evalit, prompt-iterointi, monitorointi. Tämä luku menee budjettiisi, ei vaihe 3.
def estimate_monthly_budget(avg_input_tokens, avg_output_tokens,
requests_per_day, price_in, price_out,
overhead_pct=0.30):
"""Full monthly budget estimate with overhead."""
monthly_requests = requests_per_day * 30
raw_cost = monthly_cost(
avg_input_tokens, avg_output_tokens,
monthly_requests, price_in, price_out
)
return raw_cost * (1 + overhead_pct)
# RAG pipeline: 10K queries/day on GPT-4.1
budget = estimate_monthly_budget(
avg_input_tokens=3200,
avg_output_tokens=600,
requests_per_day=10_000,
price_in=2.00,
price_out=8.00,
overhead_pct=0.30
)
print(f"${budget:,.0f}/month") # $4,368/monthKun tiedät oman lukusi, LLM-gateway-työkalut reitittävät liikenteen halvimmalle mallille, joka ylittää laatukriteerisi. Gateway, jossa on pyyntökohtainen mallivalinta, voi leikata sekoitettua hintaasi 30–50 % koskematta prompteihisi.
Tietoja kirjoittajasta
Mert Batur on Techsy.io:n perustajaosakas, jonka tiimi toimittaa tekoälyagentteja, automaatiojärjestelmiä ja ääni-/SDR-putkia B2B-asiakkaille. Hän kirjoittaa LLM-työkalupinosta, jota Techsyn tiimi todella käyttää tuotannossa. Yhdistä LinkedInissä.
Usein kysytyt kysymykset
Onko LLM-inferenssi kallista?
Se riippuu skaalasta ja mallivalinnasta. Miljoona syöketokenia maksaa 0,02 dollaria Gemini 2.5 Flashilla tai 75 dollaria frontier-päättelymallilla. 10 000 pyyntöä päivässä käsittelevälle pienelle sovellukselle voit odottaa 50–400 dollaria kuukaudessa. Yli miljoonan pyynnön päivittäisille yritystyökuormille budjetit liikkuvat 5 000–40 000 dollarissa kuukaudessa. Yksikköhinta on matala; volyymi saa summan kasvamaan.
Paljonko 1 miljoona tokenia on LLM:ssä?
Miljoona tokenia vastaa noin 750 000 sanaa eli noin kymmentä täysmittaista romaania. Heinäkuussa 2026 miljoonan syöketokenin käsittely maksaa 0,02 dollaria (budjettitaso) – 75 dollaria (frontier-taso). Saman volyymin ulostulotokenit maksavat 0,06–300 dollaria. Useimmat tuotantotyökuormat asettuvat keskitasolle: 2–15 dollaria miljoonalta syöketokenilta.
Miksi tekoälyn inferenssi on niin kallista?
Inferenssi vaatii jokaisen tokenin ajamisen miljardien malliparametrien läpi GPU:illa, jotka maksavat 25 000–40 000 dollaria kappale. Dekoodausvaihe generoi tokenit peräkkäin ja jättää GPU-ytimet toimettomaksi askelten välissä. Maksat erikoislaitteistosta, sähköstä, jäähdytyksestä ja palveluntarjoajan insinööritiimistä, joka pitää tarjoilupinon käynnissä vuorokauden ympäri.
Ovatko tekoälyn inferenssikustannukset laskussa?
Kyllä, noin 10-kertaisesti vuodessa vuodesta 2023. GPT-4 julkaistiin 30/60 dollarin hinnalla miljoonaa tokenia kohden (syöte/ulostulo). Vastaava kyky maksaa nyt 2–10 dollaria. Epoch AI:n data vahvistaa tämän kehityksen kaikilla palveluntarjoajilla. Gartner ennustaa vielä 90 % laskua vuoteen 2030 mennessä laitteistokehityksen ja avoimen lähdekoodin mallien kilpailupaineen ajamana.
Paljonko LLM-inferenssi maksaa vuonna 2026?
Budjettimallit: 0,02–0,30 dollaria miljoonalta syöketokenilta. Keskitaso: 0,55–15 dollaria. Frontier: 15–75 dollaria. Tyypillinen tuotantotyökuorma (tukichatbot, RAG-putki tai koodiavustaja) maksaa keskitason malleilla 150–4 000 dollaria kuukaudessa. Budjettimallit hoitavat suuren volyymin ja matalan kompleksisuuden tehtävät 10–30 kertaa halvemmalla.
Mitä eroa on koulutuskustannuksilla ja inferenssikustannuksilla?
Koulutus on kertaluonteinen kulu mallin opettamiseen tyhjästä: frontier-mallilla 50–200 miljoonaa dollaria, ja se vaatii tuhansia GPU:ita kuukausien ajan. Inferenssi on toistuva kulu tuon koulutetun mallin käyttämisestä: syötteiden ajamista sen läpi vastauksien saamiseksi, laskutettuna tokenia kohden. Useimmille tiimeille inferenssi on ainoa lasku, jonka he maksavat. Koulutus on perusmalleja rakentaville yhtiöille.
Miten lasken sovellukseni LLM-inferenssikustannukset?
Kerro pyyntökohtainen syöketokenien keskiarvo kuukausittaisella pyyntövolyymillasi ja sitten mallin $/M-syötehinnalla. Toista ulostulotokeneille. Laske molemmat yhteen. Lisää 30 % uudelleenyrityksiä, evaleita ja monitoroinnin yleiskuluja varten. Tämän artikkelin Python-pätkät automatisoivat matematiikan. Mittaa todelliset tokenmäärät arvaamisen sijaan; yli sadan pyynnön lokit antavat luotettavan keskiarvon.
Ovatko ulostulotokenit kalliimpia kuin syöketokenit?
Kyllä, tyypillisesti 3–5 kertaa. Syötteen käsittely (prefill) rinnakkaistuu kaikkien tokenien yli samanaikaisesti ja hyödyntää GPU-ytimet täysimääräisesti. Ulostulon generointi (decode) tuottaa yhden tokenin kerrallaan, ja kukin riippuu edellisestä. GPU odottaa muistikaistaa askelten välissä. Palveluntarjoajat hinnoittelevat ulostulon korkeammaksi heijastamaan tätä matalampaa laitteistotehokkuutta.
Onko itse ylläpidetty inferenssi API:ta halvempi?
Vain yli noin 200 000 pyynnöllä päivässä ja pysyvällä yli 50 % GPU-käyttöasteella. Sen alla API-palveluntarjoajien monivuokraajaefektiivisyys voittaa yksivuokraajalaitteistosi. Oma infra lisää myös piilokuluja: ML-insinöörien palkat (180 000–250 000 dollaria vuodessa), päivystysvuorot, mallipäivitykset ja tietoturvapaikkaus. Useimpien alle 50 insinöörin tiimien kannattaa pysyä API:ssa.
Kuluttaako LLM-inferenssi paljon energiaa?
H100-GPU ottaa kuormalla noin 700 W. Hinnalla $0,10/kWh se on $0,07/GPU-tunti, mikä kääntyy 70B-mallilla noin 0,01 dollariin miljoonaa ulostulotokenia kohden. Energia on 1–3 % API-laskusta mutta 8–15 % itse ylläpidetyn infran TCO:sta. Kalliin sähkön alueilla (Saksa, $0,30/kWh) energiaosuus kolminkertaistuu ja vaikuttaa olennaisesti oman infran talouteen.
Yhteenveto
Neljä lukua, jotka kannattaa muistaa: $0,02 (budjettilattia miljoonaa syöketokenia kohden), 3–5x (ulostulon preemio syötteeseen nähden), 20–40 % (yleiskulut, jotka lisätään raakaan token-matematiikkaan) ja 10x (vuotuinen hintalasku vuodesta 2023). Todellinen laskusi riippuu volyymista, mallitasosta ja siitä, kuinka aggressiivisesti välimuistitat, batchaat ja reitität liikennettä.
Techsyllä tiimimme mitoittaa inferenssibudjetteja ja valitsee mallitasoja B2B-asiakkaille, jotka ajavat tuotannon LLM-työkuormia. Jos haluat toisen silmäparin katsomaan kustannusmalliasi, pyydä ilmainen konsultaatio.