
LLM-kustannusten seuranta: seuraa kulutusta ennen kuin se piikittää (2026)
LLM-kustannusten seuranta on ero 412 dollarin yllätyslaskun ja 80 prosentin budjetissa tulevan Slack-viestin välillä. Claude Sonnet 5 laskuttaa tässä kuussa 3,00 dollaria miljoonalta input-tokenilta, ja yksikin karkuun päässyt agenttisilmukka voi polttaa sen iltapäivässä. Useimmat tiimit asentavat seurannan päivässä; hälytys on osa, jonka ne jättävät väliin.
Keskeiset kohdat:
- LLM-kustannusten seuranta liittää jokaiseen pyyntöön token-määrän ja kustannusarvion ja kokoaa ne sitten mallin ja tiimin mukaan.
- Seuraa viittä mittaria: tokenit pyyntöä kohden, kustannus per ominaisuus/tiimi/malli, välimuistin osumasuhde, kustannus per keskustelu, piikkien tahti.
- LiteLLM-budjetit, Langfuse-tracet tai Datadog LLM Observability tuottavat kukin kulunäkyvyyden alle päivässä.
- Koontinäytöt näyttävät arvioita; välimuistisyötteen hinnoittelu ja eräalennukset tarkoittavat, että lasku jää usein niitä pienemmäksi.
Mitä LLM-kustannusten seuranta oikeastaan mittaa?
LLM-kustannusten seuranta tarkoittaa sitä, että jokaiseen LLM-pyyntöön liitetään token-määrä ja kustannusarvio, minkä jälkeen arviot kootaan mallin, ominaisuuden ja tiimin mukaan. Näin kulutuksesta voidaan hälyttää ennen kuin lasku saapuu. Arvio lasketaan pyyntöä kohden julkaistuista token-hinnoista, summataan valitsemiesi tunnisteiden mukaan ja verrataan etukäteen asetettuun budjettiin.
Alla oleva laskenta on toimittajariippumaton. Jokaisen tarjoajan käyttövastaus erittelee tokenit kenttiin, ja Datadogin kustannusdokumentaatio kuvaa suhteet suoraan. OpenTelemetry GenAI -semanttiset sopimukset standardoivat samat kentät tarjoajien välillä, joten niiden varaan rakennettu koontinäyttö ei lukitu yhteen tarjoajaan.
| Kenttä | Mitä se laskee | Laskutetaan |
|---|---|---|
| input_tokens | Kaikki mitä lähetät: järjestelmäpromptti, historia, haettu konteksti, kysymys | Syötteen perushinta |
| output_tokens | Kaikki mitä malli tuottaa | Tulosteen perushinta (3–6x syöte) |
| cache_read_tokens | Syöte, joka käytetään uudelleen aiemmasta välimuistista | 0,1x–0,25x syötteen perushinnasta |
| cache_write_tokens | Syöte, joka kirjoitetaan välimuistiin ensimmäistä kertaa | ~1,25x syötteen perushinta (Anthropic 5 min TTL) |
| reasoning_tokens | Sisäinen ajatusketju, osa tulostetta | Tulosteen hinta |
Kolme suhdetta tekevät suurimman osan työstä: tokenit yhteensä = syöte + tuloste; syöte = välimuistiton + cache_read + cache_write; ja reasoning-tokenit sijaitsevat tulosteen sisällä tulosteen hinnalla. Kun nämä ovat oikein, pyyntökohtainen arvio pysyy lähellä todellista; jos ne jättää huomiotta, koontinäyttö ajautuu joka kuukausi erilleen laskusta. Kustannusseuranta on yksi AI-havainnoinnin pilari; jäljitys ja arvioinnit ovat kaksi muuta, ja ne jakavat saman kenttäsanaston.
Koontinäyttösi näyttää arvion; lasku on ainoa kustannusmittari, jota ei koskaan välimuistita.
Kuinka paljon 1 miljoona tokenia on LLM:ssä?
Se riippuu mallista ja suunnasta: 1M tokenia maksaa 0,14 dollaria DeepSeek-V4-syötteenä ja 15,00 dollaria GPT-5.6 Terra -tulosteena, eli 100-kertainen ero samalla yksiköllä. Tässä neljä mallia 14. heinäkuuta 2026 tekemästämme hinnoittelututkimuksesta, varmennettuna virallisia sivuja vasten:
| Malli | Syöte / 1M tokenia | Tuloste / 1M tokenia | Välimuistisyöte / 1M tokenia |
|---|---|---|---|
| Claude Sonnet 5 | $3.00 | $15.00 | $0.30 |
| GPT-5.6 Terra | $2.50 | $15.00 | $0.25 |
| Gemini 2.5 Pro | $1.25 | $10.00 | $0.31 |
| DeepSeek-V4 | $0.14 | $0.28 | $0.003 |
Lähteet: OpenAI-hinnoittelu ja Anthropic-hinnoittelu. Yksi alaviite: Claude Sonnet 5 on esittelyhinnoittelussa 2,00 dollaria syöte / 10,00 dollaria tuloste 31. elokuuta 2026 asti, minkä jälkeen hinnat palaavat yllä oleviin lukuihin.
Viisi mittaria, joilla oikeasti on väliä
Viisi mittaria kattaa LLM-kulujen seurannan, ja useimmat tiimit hälyttävät niistä vain kahdesta. Aloita kahdesta ensimmäisestä rivistä: tokenit pyyntöä kohden paljastaa promptin turpoamisen heti kun se ilmestyy, ja kustannus per tiimi on luku, jonka talousosasto lopulta pyytää. Kolme muuta tarkentavat kuvaa, kun nämä kaksi ovat käytössä.
| Mittari | Miten se lasketaan | Miksi se merkitsee | Hälytysraja |
|---|---|---|---|
| Tokenit pyyntöä kohden | Summaa syöte + tuloste per kutsu, ryhmittele ominaisuuden mukaan | Promptin turpoaminen ja kontekstin täyttö näkyvät täällä ensin | +30 % yli 7 päivän mediaanin |
| Kustannus per ominaisuus / tiimi / malli | Summaa arvioitu kustannus, ryhmittele tunnisteen tai virtuaaliavaimen mukaan | Yksikkö, jolla sisäinen laskutus ja budjetit oikeasti pyörivät | 80 % kuukausibudjetista |
| Välimuistin osumasuhde | cache_read / syötetokenit yhteensä | Matala suhde tarkoittaa, että maksat toistuvista prompteista täyden hinnan | Alle 50 % vakaassa liikenteessä |
| Kustannus per keskustelu / istunto | Summaa kustannus yhden istunnon jokaiselta kierrokselta | Paljastaa karkaavat monikierroksiset agentit, joita pyyntökohtainen näkymä ei näe | 2x 90. persentiilin istunto |
| Piikki- / poikkeamatahti | Kokonaiskulun muutos päivästä toiseen | Ainoa mittari, joka havaitsee rikki menneen silmukan ennen laskua | +50 % päivästä toiseen |
Yksi huomio tarkkuudesta: Datadog tallentaa pyyntötason kustannuksen nanodollareina (dollarin miljardisosina) kustannusdokumentaationsa mukaan. Hinnalla 0,14 dollaria miljoonalta tokenilta yksittäinen DeepSeek-V4-pyyntö voi maksaa alle sentin tuhannesosan, joten summaa ennen pyöristystä, tai pienten mallien liikenne katoaa raportista.
Jos et seuraa muuta, seuraa rivejä yksi ja kaksi. Tokenit pyyntöä kohden on varhaisin varoitus, jonka saat; kustannus per tiimi on se, joka kestää kohtaamisen kirjanpito-osaston kanssa.
Kolme tapaa asentaa LLM-kustannusten seuranta
Yksikään tämän hakulausekkeen kärkisivu ei julkaise yhtäkään ajettavaa koodiriviä, joten tässä kolme toimivaa toteutusta. Jokainen saadaan tuotantoon alle päivässä, ja ne täydentävät toisiaan: ajamme kahta ensimmäistä yhdessä.
Mitä oikeasti ajamme tuotannossa: meidän asetelmassamme jokainen asiakasagentti puhuu LiteLLM-proxylle oman virtuaaliavaimensa kautta, jokaisella avaimella on kuukausibudjetti ja Langfuse jäljittää jokaisen proxyn takana olevan pyynnön. Kun otimme nämä kaksi käyttöön yhdessä, työnjako oli koko pointti: proxy valvoo kattoja, ja tracet selittävät, mikä ne kulutti. Jokaisella asiakasavaimellamme on myös tpm_limit-raja 100 000 tokenia minuutissa toisena sulakkeena; LiteLLM:n dokumentaation mukaan proxy hylkää pyynnöt, kun raja täyttyy, ja tuohon dokumentoituun käyttäytymiseen me luotamme, emme itse mittaamaamme benchmarkiin. Konfiguraatiomme ohittaa LiteLLM-versiot 1.82.7 ja 1.82.8 kokonaan, ne kaksi versiota, jotka joutuivat maaliskuun 2026 toimitusketjuvälikohtaukseen, ja kiinnittää imagetunnisteen sen sijaan, että kelluisi latest-tagilla.
LiteLLM-proxy: virtuaaliavaimet + budjetit
Techsy ajaa LiteLLM-proxy-asennusta tuotannossa yhdellä virtuaaliavaimella per asiakas ja kuukausibudjetilla jokaisella avaimella. Alla oleva pyyntö on LiteLLM:n virtual_keys-dokumentaation mukainen muoto: dokumentaation perusteella, kun tämän avaimen kumulatiivinen kulutus ylittää 50 dollaria kuukaudessa, proxy hylkää lisäpyynnöt budjetti ylitetty -virheellä sen sijaan, että kirjaisi varoituksen jälkikäteen.
curl -X POST http://localhost:4000/key/generate \
-H "Authorization: Bearer $LITELLM_MASTER_KEY" \
-H "Content-Type: application/json" \
-d '{
"key_alias": "client-acme-search",
"max_budget": 50.0,
"budget_duration": "monthly",
"tpm_limit": 100000,
"models": ["anthropic/claude-sonnet-4-5"]
}'Tee lasku julkaistujen hintojen mukaan: Claude Sonnet 5:n hinnalla 3,00 / 15,00 dollaria miljoonalta tokenilta 50 dollaria ostaa suunnilleen 16,7M input-tokenia tai 3,3M output-tokenia, eli noin viikon liikenteen yhdelle kevyemmistä asiakasagenteistamme. Se on täsmälleen se säde, jonka haluamme. tpm_limit on toinen sulake: karkaava silmukka laukaisee 100K tokenin minuuttirajan kauan ennen kuin se laukaisee kuukausibudjetin. Käyttäjäkohtainen kohdennus toimii samalla tavalla users-päätepisteen kautta, ja oppaamme parhaista LLM-gateway-työkaluista kattaa, milloin proxy ansaitsee paikkansa ja milloin se on vain yksi hyppy lisää.
Langfuse: @observe-kustannusjäljitys
Googlen automaattitäydennys yhdistää "langfuse monitoring" -hakuun tämän kyselyn, ja hyvästä syystä: Langfuse on avoimen lähdekoodin jäljityksen oletusvalinta. Sen Python-SDK käärii tarjoaja-asiakkaasi niin, että jokaisesta kutsusta tulee trace, joka kantaa token-määriä ja laskettua kustannusta, Langfuse-jäljitysdokumentaation mukaan:
# pip install langfuse openai
from langfuse import observe
from langfuse.openai import openai # drop-in wrapper, auto-traces
@observe()
def answer(question: str):
return openai.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": question}],
)
answer("what is llm cost monitoring")
# the trace now carries usage.total_tokens and total_cost,
# priced from Langfuse's model price cardsKustannus päätyy traceen ilman token-laskentaa sinun puolellasi; ryhmittele tracet istunnon tai käyttäjätunnuksen mukaan ominaisuuskohtaisia yhteenvetoja varten, ja aja omalla palvelimella, jos data ei voi poistua verkostasi.
Datadog LLM Observability: jos olet jo sisällä
Jos tiimisi jo ajaa Datadog-agenteja, sen LLM-kustannusdokumentaatio on tämän sivun syvällisin yksittäinen lähde: pyyntötason kustannus nanodollareina, mukautetut cost_tags tiimi- ja ominaisuuserittelyihin, ja oikea vianmääritysosio osittaiskustannusten aukoille. Rehellinen raja: se on vain Datadogille. Mittarit eivät poistu alustalta, eikä avoimen lähdekoodin varasuunnitelmaa ole, jos hinnoittelu lakkaa sopimasta. Valitse se konsolidointiin, älä joustavuuteen.
Miten budjetit, hälytykset ja sisäinen laskutus kytketään?
Se kytketään kolmessa kerroksessa: budjettikatto, joka hylkää pyynnöt rajalla, webhook-hälytys, joka laukeaa prosenttirajalla ennen kattoa, ja tiimikohtaiset virtuaaliavaimet, jotka tekevät kulun näyttämisestä ja sisäisestä laskutuksesta kyselyn eikä riidan. LiteLLM toimittaa kaikki kolme natiivisti; kuviot siirtyvät mihin tahansa gatewayhin, jolla on avaintason budjetit.
Budjetti, joka vain laskee, on raportti; budjetti, joka hylkää pyynnöt katolla, on ohjauskeino.
Hälytykset, jotka laukeavat ennen piikkiä
Aseta hälytys 80 prosenttiin katosta, älä 100 prosenttiin. LiteLLM toimittaa Slack-hälytyksen valmiina: aseta alerting: ["slack"] ja alerting_threshold: 80 kohtaan general_settings, osoita SLACK_WEBHOOK_URL-ympäristömuuttuja kanavalle, ja tämän kaltainen viesti saapuu, kun avain ylittää rajan:
{
"text": "LLM budget alert: client-acme-search spent $40.18 of its $50.00 monthly cap (80.4%). Top model: anthropic/claude-sonnet-4-5."
}80 prosentissa ihmisellä on vielä päiviä aikaa toimia: vaihda malli pienempään, kiristä prompttia tai nosta kattoa niin, että hyväksynnässä on nimi. Hälytys 100 prosentissa on ruumiinavaus.
Näyttämisestä sisäiseen laskutukseen
Näyttäminen tarkoittaa, että jokainen tiimi näkee oman kulutuksensa; sisäinen laskutus tarkoittaa, että se vähennetään heidän budjetistaan. Molemmat pyörivät yhdellä aineksella: virtuaaliavain per tiimi, tunnisteella luontihetkellä. Kuukausiraportti on silloin ryhmittely kulutustaulun yli:
| Tiimi | Kuukausibudjetti | Kulutus toistaiseksi | Tila |
|---|---|---|---|
| search | $50 | $40.18 | hälytys laukesi 80 %:ssa |
| support-chat | $200 | $112.40 | aikataulussa |
| evals-batch | $30 | $29.97 | katto täynnä, hylkää |
| sandbox | $10 | $1.06 | aikataulussa |
Esimerkkimuoto, ei asiakasdataa. evals-batch-rivi on kuvio toimimassa tarkoitetusti: erätyö ajoi kattoonsa ja pysähtyi sen sijaan, että se olisi vuotanut hiljaisuudessa laskuun. Täytäntöönpanokäyttäytyminen on dokumentoitu LiteLLM:n virtual_keys-dokumentaatioon, mukaan lukien se, miten budjetin kesto nollautuu.
Miksi koontinäyttösi on eri mieltä kuin lasku?
Koska koontinäytöt laskuttavat listahintaan, kun taas laskut soveltavat alennuksia, joita seurantajasi ei koskaan näe. Välimuistisyöte asettuu 0,1x–0,25x perushinnasta, eräajot puoleen hintaan, ja reasoning-tokenit laskutetaan tulosteen hinnalla tulostemäärän sisällä. Kun kaksi lukua erkanevat, lasku on yleensä pienempi, ja ero on lähes aina jokin neljästä muuttujasta.
| Hinnoittelumuuttuja | Tyypillinen kerroin | Vaikutus arvioosi |
|---|---|---|
| Välimuistisyöte (cache read) | 0,1x–0,25x syötteen perushinnasta | Koontinäyttö näyttää liian suurta, jos se laskuttaa välimuistiosumat täyteen hintaan |
| Batch API | 0,5x syötteestä ja tulosteesta | Asynkroniset työt maksavat puolet seuratusta luvusta |
| Reasoning-tokenit | 1x tulosteen hinta, lasketaan tulosteen sisällä | Pitkät ajatusketjut polttavat tulostebudjettia hiljaisuudessa |
| Välimuistiin kirjoitus | ~1,25x syötteen perushinta | Ensimmäinen pyyntö välimuisti-ikkunassa maksaa hieman enemmän |
Avoin pydantic/genai-prices -katalogi näyttää, miksi nämä kertoimet eroavat malleittain: jokainen tarjoaja asettaa omat välimuisti- ja eräkertoimensa, joten yksittäinen kovakoodattu hintataulukko ajautuu pois kohdaltaan sinä päivänä, kun tarjoaja tarkistaa hintansa. Datadogin kustannusdokumentaatio kuvaa ongelman toisen puoliskon, osittaiskustannusten aukot, joissa puuttuva token-kenttä palauttaa COST UNAVAILABLE -tilan pyynnölle. Tarkista sieltä, kun koontinäyttö näyttää laskua pienempää; tarkista alennustaulukko, kun se näyttää suurempaa. Suurimman kertoimen taustalla oleva mekanismi on LLM-prompttien välimuistitus, ja korkea välimuistin osumasuhde on yleisin syy siihen, että seurattu arvio ylittää todellisen laskun.
Kustannusarvio ilman välimuistiosuma- ja eräalennuksia on katto, ei ennuste.
Mitkä työkalut oikeasti tekevät LLM-kulujen seurantaa?
Kuusi työkalua kattaa useimmat tuotantoasetelmat: Langfuse, LiteLLM, Helicone ja Portkey avoimen lähdekoodin ja gatewayn puolella, Datadog ja Braintrust kaupallisella puolella. Rehellinen jako on täytäntöönpano vastaan havainnointi: proxy voi hylätä pyynnöt budjetin rajalla, kun taas jäljitystyökalu mittaa kulutuksen jälkikäteen. Useimmat kypsät pinot päätyvät yhteen kumpaakin.
| Työkalu | Tyyppi | Kulunseurannan lähestymistapa | Ilmaisversio | Valitse tämä, jos... |
|---|---|---|---|---|
| Langfuse | Avoin lähdekoodi | Tracekohtainen kustannus mallien hintakorteista, itse ylläpidettävä | Itse ylläpidettynä ilmainen; ilmainen harrastetaso pilvessä | Haluat avoimen lähdekoodin ja omistat datan |
| LiteLLM | Avoimen lähdekoodin proxy | Avain- ja tiimibudjetit, jotka pannaan täytäntöön gatewaylla | Ilmainen (OSS); maksullinen enterprise | Tarvitset budjetit, jotka hylkäävät pyyntöjä, eivät vain laske |
| Helicone | Avoimen lähdekoodin gateway | Proxytason kustannuslokit per avain ja malli | Ilmaisversio nopeusrajoilla | Haluat yhden rivin proxyn vaihdon ilman SDK-muutoksia |
| Portkey | Kaupallinen gateway | Virtuaaliavainten budjetit ja kustannusanalytiikka | Ilmaisversio kehittäjille | Haluat gatewayn, promptit ja arvioinnit yhdessä paneelissa |
| Datadog LLM Observability | Kaupallinen | Nanodollari-pyyntömittarit ja cost_tags | 14 päivän kokeilu | Ajat jo Datadogia kaikelle muulle |
| Braintrust | Kaupallinen | Arviointeihin sidottu kulutus per projekti | Ilmaisversio | Kustannustyösi alkaa arvioinneista, ei laskuista |
Yksi varoitus toimittajien sisällöstä tällä alueella: Braintrustin oma vuoden 2026 vertailu kulunseurantatyökaluista sijoittaa itsensä ensimmäiseksi ja jättää pois jokaisen yllä olevan taulukon avoimen lähdekoodin vaihtoehdon. Lue toimittajien listikkeleitä niiden datan, älä niiden sijoitusten vuoksi.
Nollasta aloittavalle tiimille ajaisimme LiteLLM:n edessä ja Langfusen sen takana: proxy panee budjetit täytäntöön, tracet selittävät ne, ja yhdistelmä ei maksa mitään ennen kuin siirryt isännöityihin paketteihin. Jos punnitset kahta jäljityksen oletusvalintaa, Langfuse vs Langsmith -erittelymme käy tuon valinnan syvällisesti läpi, ja parhaiden AI-havainnointialustojen kokoelma kattaa koko kentän.
Seurannasta kustannusten leikkaamiseen
Seuranta näyttää, mihin raha menee; seuraava askel on päättää, kuinka paljon sinne menee. Kolme vipua, tuottojärjestyksessä: välimuista toistuva syöte, reititä helpot pyynnöt halvemmille malleille ja pienennä mallia siellä, missä laatu vielä kestää. LLM-API-kustannusten vähentämisen oppaamme kattaa jokaisen vivun, ja LLM-API-hinnoittelun vertailu on syöte kaikkeen yllä olevaan laskentaan.
Näkökulmamme: kun asiakkaan LLM-kulutus yllättää heidät, me seuraamme ensin ja leikkaamme toiseksi, emme koskaan toisinpäin. Tiimit, jotka välimuistavat ennen kuin mittaavat, päätyvät yleensä välimuistamaan väärät promptit. Seuranta kertoo, mihin raha menee; välimuistitus ja reititys päättävät, kuinka paljon sinne menee. Jos laskusi jo kirvelee, varaa ilmainen konsultaatio, niin katsomme luvut yhdessä läpi.
Tietoja kirjoittajasta
Mert Batur on Techsy.io:n perustajaosakas, jonka tiimi toimittaa AI-agentteja, automaatiojärjestelmiä ja ääni-/SDR-putkia B2B-asiakkaille. Hän kirjoittaa LLM-työkalupinosta, jota Techsyn tiimi oikeasti käyttää tuotannossa. Yhdistä LinkedInissä.
Usein kysytyt kysymykset
Kuinka paljon 1 miljoona tokenia on LLM:ssä?
Listahinnalla missä tahansa 0,14 dollarista 15 dollariin miljoonalta mallista ja suunnasta riippuen: DeepSeek-V4-syöte maksaa 0,14 dollaria miljoonalta, kun taas GPT-5.6 Terra -tuloste maksaa 15 dollaria. Tulostetokenit maksavat 3–6 kertaa syötteen hinnan jokaisella suurella tarjoajalla. Ensimmäisen osion taulukossa on neljä mallia, ja LLM-API-hinnoittelun vertailumme hinnoittelee kaikki seitsemäntoista, varmennettuna OpenAI- ja Anthropic-sivuja vasten heinäkuussa 2026.
Mitä on LLM-kustannusten optimointi?
Käytäntö, jolla kustannusta pyyntöä kohden lasketaan laatua heikentämättä: prompttien välimuistitus toistuvalle syötteelle, helppojen tehtävien reititys halvemmille malleille, batch-APIt asynkroniselle työlle ja mallin mitoitus oikein per ominaisuus. LLM-kustannusten seuranta on edellytys, koska et voi optimoida sitä, mitä et ole kohdistanut. Välimuistin osumasuhde ja kustannus per ominaisuus ovat kaksi mittaria, jotka osoittavat suurimmat vivut ensin.
Miksi LLM:t ovat niin kalliita?
Päättely on laskentatehorajoitteista: jokainen tuotettu token ajaa mallin täyden eteenpäinajon GPU:illa, ja päättelymallit käyttävät ylimääräisiä tokeneita ajatteluun ennen vastausta, laskutettuna tulosteen hinnalla. Pitkät järjestelmäpromptit moninkertaistavat tuon kustannuksen jokaisessa yksittäisessä pyynnössä. Lasku kasvaa runsassanaisuuden myötä puhelun molemmilla puolilla, minkä vuoksi tokenit pyyntöä kohden on ensimmäinen seurannan arvoinen mittari.
Kuinka paljon LLM maksaa Yhdysvalloissa?
API-hinnoittelu on dollarimääräinen ja globaali: OpenAI, Anthropic ja Google veloittavat saman listahinnan miljoonalta tokenilta riippumatta siitä, tuleeko pyyntö Ohiosta vai Osakasta. Alueelliset erot näkyvät itse ylläpidossa, jossa GPU-tunnit vaihtelevat pilvialueittain, ja isännöidyissä alustoissa, jotka lisäävät katetta. API-työssä sijainti muuttaa viivettä, ei hintaa.
Miten seuraan LLM-kustannuksia per tiimi?
Myönnä yksi virtuaaliavain per tiimi LiteLLM:n kaltaisen proxyn kautta, lisää jokaiseen avaimeen tiimin nimi tunnisteeksi luontihetkellä ja summaa kulutus tuon tunnisteen mukaan. Jokainen pyyntö kantaa silloin kohdennusta siitä hetkestä lähtien, kun se tehdään, ilman lokien jäsentämistä. Näyttämistaulukko yllä olevassa budjettiosiossa on lopputuote: tiimi, kuukausibudjetti, kulutus toistaiseksi, tila.
Langfuse vai Datadog LLM-kulujen seurantaan: kumman valitsen?
Valitse Langfuse, jos haluat avoimen lähdekoodin, itse ylläpidon ja datan, jota hallitset; sen ajaminen on ilmaista ja se jäljittää kustannuksen per pyyntö valmiiksi. Valitse Datadog vain, jos tiimisi jo ajaa sitä infrastruktuurille, koska sen LLM-kustannusominaisuudet eivät poistu alustalta. Useimmille nollasta aloittaville tiimeille Langfuse ja LiteLLM-proxy yhdessä voittavat kumman tahansa yksinään.
Vastaavatko arvioidut LLM-kustannukset todellista laskua?
Eivät, ja yleensä lasku on pienempi. Koontinäytöt laskuttavat listahintaan, kun taas välimuistisyöte asettuu 0,1x–0,25x ja erätyöt 0,5x, joten runsaasti välimuistia käyttävässä kuormassa todellinen lasku jää selvästi seurattua arviota pienemmäksi. Puuttuvat token-kentät työntävät virheen toiseen suuntaan. Yllä oleva erojen taulukko listaa jokaisen kertoimen ja mistä katsoa.
Miten hälytän LLM-kulutuksen piikeistä?
Aseta rajahälytys 80 prosenttiin jokaisen tiimin kuukausibudjetista, toimitettuna Slackiin webhookilla, sekä päivästä toiseen -poikkeamahälytys +50 prosenttiin nopeasti polttaville silmukoille. LiteLLM toimittaa rajakuvion natiivisti alerting_threshold-asetuksensa kautta. Hälytys 80 prosentissa jättää päiviä reagointiin; hälytys 100 prosentissa vain vahvistaa, että katto teki tehtävänsä.
Onko olemassa ilmaista LLM-kulujen seuraajaa?
On, kolme uskottavaa. Itse ylläpidetty Langfuse on ilmainen ja avointa lähdekoodia, ja pilvessä on ilmainen harrastetaso Langfuse-hinnoittelusivun mukaan. LiteLLM:n sisäänrakennetut avainbudjetit eivät maksa mitään avoimen lähdekoodin proxyssa. Heliconen ilmaisversio kattaa proxytason kustannuslokit nopeusrajoilla. Ilmaisversiot kattavat seurannan; täytäntöönpano ja hälytys skaalassa ovat se, mistä maksulliset paketit alkavat.
Johtopäätös
Valitse toteutuspolku tänään, koska hälytys, jonka kuuden viikon kuluttua haluat, vie iltapäivän asentaa nyt. Lyhyt versio:
- Seuraa ensin tokeneita pyyntöä kohden ja kustannusta per tiimi; lisää kolme muuta mittaria, kun nämä toimivat.
- Budjetti, joka hylkää pyyntöjä, on ohjauskeino; se, joka vain laskee, on raportti.
- Aseta hälytys 80 prosenttiin, Slackiin, ennen kuin lasku voi yllättää kenenkään.
- Koontinäyttösi on arvio; välimuistisyötteen ja eräajon hinnoittelu tarkoittaa, että lasku jää usein sitä pienemmäksi.
Jos haluat mieluummin jonkun katsomaan lukujasi kanssasi, varaa ilmainen konsultaatio.