ai-machine-learning

LLM-kustannusten seuranta: seuraa kulutusta ennen kuin se piikittää (2026)

Kirjoittanut Mert Batur
Päivitetty Jul 31, 2026
11 lukuaika
LLM-kustannusten seuranta: seuraa kulutusta ennen kuin se piikittää (2026)

LLM-kustannusten seuranta: seuraa kulutusta ennen kuin se piikittää (2026)

LLM-kustannusten seuranta on ero 412 dollarin yllätyslaskun ja 80 prosentin budjetissa tulevan Slack-viestin välillä. Claude Sonnet 5 laskuttaa tässä kuussa 3,00 dollaria miljoonalta input-tokenilta, ja yksikin karkuun päässyt agenttisilmukka voi polttaa sen iltapäivässä. Useimmat tiimit asentavat seurannan päivässä; hälytys on osa, jonka ne jättävät väliin.

Keskeiset kohdat:

  • LLM-kustannusten seuranta liittää jokaiseen pyyntöön token-määrän ja kustannusarvion ja kokoaa ne sitten mallin ja tiimin mukaan.
  • Seuraa viittä mittaria: tokenit pyyntöä kohden, kustannus per ominaisuus/tiimi/malli, välimuistin osumasuhde, kustannus per keskustelu, piikkien tahti.
  • LiteLLM-budjetit, Langfuse-tracet tai Datadog LLM Observability tuottavat kukin kulunäkyvyyden alle päivässä.
  • Koontinäytöt näyttävät arvioita; välimuistisyötteen hinnoittelu ja eräalennukset tarkoittavat, että lasku jää usein niitä pienemmäksi.

Mitä LLM-kustannusten seuranta oikeastaan mittaa?

LLM-kustannusten seuranta tarkoittaa sitä, että jokaiseen LLM-pyyntöön liitetään token-määrä ja kustannusarvio, minkä jälkeen arviot kootaan mallin, ominaisuuden ja tiimin mukaan. Näin kulutuksesta voidaan hälyttää ennen kuin lasku saapuu. Arvio lasketaan pyyntöä kohden julkaistuista token-hinnoista, summataan valitsemiesi tunnisteiden mukaan ja verrataan etukäteen asetettuun budjettiin.

Alla oleva laskenta on toimittajariippumaton. Jokaisen tarjoajan käyttövastaus erittelee tokenit kenttiin, ja Datadogin kustannusdokumentaatio kuvaa suhteet suoraan. OpenTelemetry GenAI -semanttiset sopimukset standardoivat samat kentät tarjoajien välillä, joten niiden varaan rakennettu koontinäyttö ei lukitu yhteen tarjoajaan.

KenttäMitä se laskeeLaskutetaan
input_tokensKaikki mitä lähetät: järjestelmäpromptti, historia, haettu konteksti, kysymysSyötteen perushinta
output_tokensKaikki mitä malli tuottaaTulosteen perushinta (3–6x syöte)
cache_read_tokensSyöte, joka käytetään uudelleen aiemmasta välimuistista0,1x–0,25x syötteen perushinnasta
cache_write_tokensSyöte, joka kirjoitetaan välimuistiin ensimmäistä kertaa~1,25x syötteen perushinta (Anthropic 5 min TTL)
reasoning_tokensSisäinen ajatusketju, osa tulostettaTulosteen hinta

Kolme suhdetta tekevät suurimman osan työstä: tokenit yhteensä = syöte + tuloste; syöte = välimuistiton + cache_read + cache_write; ja reasoning-tokenit sijaitsevat tulosteen sisällä tulosteen hinnalla. Kun nämä ovat oikein, pyyntökohtainen arvio pysyy lähellä todellista; jos ne jättää huomiotta, koontinäyttö ajautuu joka kuukausi erilleen laskusta. Kustannusseuranta on yksi AI-havainnoinnin pilari; jäljitys ja arvioinnit ovat kaksi muuta, ja ne jakavat saman kenttäsanaston.

Koontinäyttösi näyttää arvion; lasku on ainoa kustannusmittari, jota ei koskaan välimuistita.

Kuinka paljon 1 miljoona tokenia on LLM:ssä?

Se riippuu mallista ja suunnasta: 1M tokenia maksaa 0,14 dollaria DeepSeek-V4-syötteenä ja 15,00 dollaria GPT-5.6 Terra -tulosteena, eli 100-kertainen ero samalla yksiköllä. Tässä neljä mallia 14. heinäkuuta 2026 tekemästämme hinnoittelututkimuksesta, varmennettuna virallisia sivuja vasten:

MalliSyöte / 1M tokeniaTuloste / 1M tokeniaVälimuistisyöte / 1M tokenia
Claude Sonnet 5$3.00$15.00$0.30
GPT-5.6 Terra$2.50$15.00$0.25
Gemini 2.5 Pro$1.25$10.00$0.31
DeepSeek-V4$0.14$0.28$0.003

Lähteet: OpenAI-hinnoittelu ja Anthropic-hinnoittelu. Yksi alaviite: Claude Sonnet 5 on esittelyhinnoittelussa 2,00 dollaria syöte / 10,00 dollaria tuloste 31. elokuuta 2026 asti, minkä jälkeen hinnat palaavat yllä oleviin lukuihin.

Viisi mittaria, joilla oikeasti on väliä

Viisi mittaria kattaa LLM-kulujen seurannan, ja useimmat tiimit hälyttävät niistä vain kahdesta. Aloita kahdesta ensimmäisestä rivistä: tokenit pyyntöä kohden paljastaa promptin turpoamisen heti kun se ilmestyy, ja kustannus per tiimi on luku, jonka talousosasto lopulta pyytää. Kolme muuta tarkentavat kuvaa, kun nämä kaksi ovat käytössä.

MittariMiten se lasketaanMiksi se merkitseeHälytysraja
Tokenit pyyntöä kohdenSummaa syöte + tuloste per kutsu, ryhmittele ominaisuuden mukaanPromptin turpoaminen ja kontekstin täyttö näkyvät täällä ensin+30 % yli 7 päivän mediaanin
Kustannus per ominaisuus / tiimi / malliSummaa arvioitu kustannus, ryhmittele tunnisteen tai virtuaaliavaimen mukaanYksikkö, jolla sisäinen laskutus ja budjetit oikeasti pyörivät80 % kuukausibudjetista
Välimuistin osumasuhdecache_read / syötetokenit yhteensäMatala suhde tarkoittaa, että maksat toistuvista prompteista täyden hinnanAlle 50 % vakaassa liikenteessä
Kustannus per keskustelu / istuntoSummaa kustannus yhden istunnon jokaiselta kierrokseltaPaljastaa karkaavat monikierroksiset agentit, joita pyyntökohtainen näkymä ei näe2x 90. persentiilin istunto
Piikki- / poikkeamatahtiKokonaiskulun muutos päivästä toiseenAinoa mittari, joka havaitsee rikki menneen silmukan ennen laskua+50 % päivästä toiseen

Yksi huomio tarkkuudesta: Datadog tallentaa pyyntötason kustannuksen nanodollareina (dollarin miljardisosina) kustannusdokumentaationsa mukaan. Hinnalla 0,14 dollaria miljoonalta tokenilta yksittäinen DeepSeek-V4-pyyntö voi maksaa alle sentin tuhannesosan, joten summaa ennen pyöristystä, tai pienten mallien liikenne katoaa raportista.

Jos et seuraa muuta, seuraa rivejä yksi ja kaksi. Tokenit pyyntöä kohden on varhaisin varoitus, jonka saat; kustannus per tiimi on se, joka kestää kohtaamisen kirjanpito-osaston kanssa.

Kolme tapaa asentaa LLM-kustannusten seuranta

Yksikään tämän hakulausekkeen kärkisivu ei julkaise yhtäkään ajettavaa koodiriviä, joten tässä kolme toimivaa toteutusta. Jokainen saadaan tuotantoon alle päivässä, ja ne täydentävät toisiaan: ajamme kahta ensimmäistä yhdessä.

Mitä oikeasti ajamme tuotannossa: meidän asetelmassamme jokainen asiakasagentti puhuu LiteLLM-proxylle oman virtuaaliavaimensa kautta, jokaisella avaimella on kuukausibudjetti ja Langfuse jäljittää jokaisen proxyn takana olevan pyynnön. Kun otimme nämä kaksi käyttöön yhdessä, työnjako oli koko pointti: proxy valvoo kattoja, ja tracet selittävät, mikä ne kulutti. Jokaisella asiakasavaimellamme on myös tpm_limit-raja 100 000 tokenia minuutissa toisena sulakkeena; LiteLLM:n dokumentaation mukaan proxy hylkää pyynnöt, kun raja täyttyy, ja tuohon dokumentoituun käyttäytymiseen me luotamme, emme itse mittaamaamme benchmarkiin. Konfiguraatiomme ohittaa LiteLLM-versiot 1.82.7 ja 1.82.8 kokonaan, ne kaksi versiota, jotka joutuivat maaliskuun 2026 toimitusketjuvälikohtaukseen, ja kiinnittää imagetunnisteen sen sijaan, että kelluisi latest-tagilla.

LiteLLM-proxy: virtuaaliavaimet + budjetit

Techsy ajaa LiteLLM-proxy-asennusta tuotannossa yhdellä virtuaaliavaimella per asiakas ja kuukausibudjetilla jokaisella avaimella. Alla oleva pyyntö on LiteLLM:n virtual_keys-dokumentaation mukainen muoto: dokumentaation perusteella, kun tämän avaimen kumulatiivinen kulutus ylittää 50 dollaria kuukaudessa, proxy hylkää lisäpyynnöt budjetti ylitetty -virheellä sen sijaan, että kirjaisi varoituksen jälkikäteen.

bash
curl -X POST http://localhost:4000/key/generate \
  -H "Authorization: Bearer $LITELLM_MASTER_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "key_alias": "client-acme-search",
    "max_budget": 50.0,
    "budget_duration": "monthly",
    "tpm_limit": 100000,
    "models": ["anthropic/claude-sonnet-4-5"]
  }'

Tee lasku julkaistujen hintojen mukaan: Claude Sonnet 5:n hinnalla 3,00 / 15,00 dollaria miljoonalta tokenilta 50 dollaria ostaa suunnilleen 16,7M input-tokenia tai 3,3M output-tokenia, eli noin viikon liikenteen yhdelle kevyemmistä asiakasagenteistamme. Se on täsmälleen se säde, jonka haluamme. tpm_limit on toinen sulake: karkaava silmukka laukaisee 100K tokenin minuuttirajan kauan ennen kuin se laukaisee kuukausibudjetin. Käyttäjäkohtainen kohdennus toimii samalla tavalla users-päätepisteen kautta, ja oppaamme parhaista LLM-gateway-työkaluista kattaa, milloin proxy ansaitsee paikkansa ja milloin se on vain yksi hyppy lisää.

Langfuse: @observe-kustannusjäljitys

Googlen automaattitäydennys yhdistää "langfuse monitoring" -hakuun tämän kyselyn, ja hyvästä syystä: Langfuse on avoimen lähdekoodin jäljityksen oletusvalinta. Sen Python-SDK käärii tarjoaja-asiakkaasi niin, että jokaisesta kutsusta tulee trace, joka kantaa token-määriä ja laskettua kustannusta, Langfuse-jäljitysdokumentaation mukaan:

python
# pip install langfuse openai
from langfuse import observe
from langfuse.openai import openai  # drop-in wrapper, auto-traces

@observe()
def answer(question: str):
    return openai.chat.completions.create(
        model="gpt-4o-mini",
        messages=[{"role": "user", "content": question}],
    )

answer("what is llm cost monitoring")
# the trace now carries usage.total_tokens and total_cost,
# priced from Langfuse's model price cards

Kustannus päätyy traceen ilman token-laskentaa sinun puolellasi; ryhmittele tracet istunnon tai käyttäjätunnuksen mukaan ominaisuuskohtaisia yhteenvetoja varten, ja aja omalla palvelimella, jos data ei voi poistua verkostasi.

Datadog LLM Observability: jos olet jo sisällä

Jos tiimisi jo ajaa Datadog-agenteja, sen LLM-kustannusdokumentaatio on tämän sivun syvällisin yksittäinen lähde: pyyntötason kustannus nanodollareina, mukautetut cost_tags tiimi- ja ominaisuuserittelyihin, ja oikea vianmääritysosio osittaiskustannusten aukoille. Rehellinen raja: se on vain Datadogille. Mittarit eivät poistu alustalta, eikä avoimen lähdekoodin varasuunnitelmaa ole, jos hinnoittelu lakkaa sopimasta. Valitse se konsolidointiin, älä joustavuuteen.

Miten budjetit, hälytykset ja sisäinen laskutus kytketään?

Se kytketään kolmessa kerroksessa: budjettikatto, joka hylkää pyynnöt rajalla, webhook-hälytys, joka laukeaa prosenttirajalla ennen kattoa, ja tiimikohtaiset virtuaaliavaimet, jotka tekevät kulun näyttämisestä ja sisäisestä laskutuksesta kyselyn eikä riidan. LiteLLM toimittaa kaikki kolme natiivisti; kuviot siirtyvät mihin tahansa gatewayhin, jolla on avaintason budjetit.

Budjetti, joka vain laskee, on raportti; budjetti, joka hylkää pyynnöt katolla, on ohjauskeino.

Hälytykset, jotka laukeavat ennen piikkiä

Aseta hälytys 80 prosenttiin katosta, älä 100 prosenttiin. LiteLLM toimittaa Slack-hälytyksen valmiina: aseta alerting: ["slack"] ja alerting_threshold: 80 kohtaan general_settings, osoita SLACK_WEBHOOK_URL-ympäristömuuttuja kanavalle, ja tämän kaltainen viesti saapuu, kun avain ylittää rajan:

json
{
  "text": "LLM budget alert: client-acme-search spent $40.18 of its $50.00 monthly cap (80.4%). Top model: anthropic/claude-sonnet-4-5."
}

80 prosentissa ihmisellä on vielä päiviä aikaa toimia: vaihda malli pienempään, kiristä prompttia tai nosta kattoa niin, että hyväksynnässä on nimi. Hälytys 100 prosentissa on ruumiinavaus.

Näyttämisestä sisäiseen laskutukseen

Näyttäminen tarkoittaa, että jokainen tiimi näkee oman kulutuksensa; sisäinen laskutus tarkoittaa, että se vähennetään heidän budjetistaan. Molemmat pyörivät yhdellä aineksella: virtuaaliavain per tiimi, tunnisteella luontihetkellä. Kuukausiraportti on silloin ryhmittely kulutustaulun yli:

TiimiKuukausibudjettiKulutus toistaiseksiTila
search$50$40.18hälytys laukesi 80 %:ssa
support-chat$200$112.40aikataulussa
evals-batch$30$29.97katto täynnä, hylkää
sandbox$10$1.06aikataulussa

Esimerkkimuoto, ei asiakasdataa. evals-batch-rivi on kuvio toimimassa tarkoitetusti: erätyö ajoi kattoonsa ja pysähtyi sen sijaan, että se olisi vuotanut hiljaisuudessa laskuun. Täytäntöönpanokäyttäytyminen on dokumentoitu LiteLLM:n virtual_keys-dokumentaatioon, mukaan lukien se, miten budjetin kesto nollautuu.

Miksi koontinäyttösi on eri mieltä kuin lasku?

Koska koontinäytöt laskuttavat listahintaan, kun taas laskut soveltavat alennuksia, joita seurantajasi ei koskaan näe. Välimuistisyöte asettuu 0,1x–0,25x perushinnasta, eräajot puoleen hintaan, ja reasoning-tokenit laskutetaan tulosteen hinnalla tulostemäärän sisällä. Kun kaksi lukua erkanevat, lasku on yleensä pienempi, ja ero on lähes aina jokin neljästä muuttujasta.

HinnoittelumuuttujaTyypillinen kerroinVaikutus arvioosi
Välimuistisyöte (cache read)0,1x–0,25x syötteen perushinnastaKoontinäyttö näyttää liian suurta, jos se laskuttaa välimuistiosumat täyteen hintaan
Batch API0,5x syötteestä ja tulosteestaAsynkroniset työt maksavat puolet seuratusta luvusta
Reasoning-tokenit1x tulosteen hinta, lasketaan tulosteen sisälläPitkät ajatusketjut polttavat tulostebudjettia hiljaisuudessa
Välimuistiin kirjoitus~1,25x syötteen perushintaEnsimmäinen pyyntö välimuisti-ikkunassa maksaa hieman enemmän

Avoin pydantic/genai-prices -katalogi näyttää, miksi nämä kertoimet eroavat malleittain: jokainen tarjoaja asettaa omat välimuisti- ja eräkertoimensa, joten yksittäinen kovakoodattu hintataulukko ajautuu pois kohdaltaan sinä päivänä, kun tarjoaja tarkistaa hintansa. Datadogin kustannusdokumentaatio kuvaa ongelman toisen puoliskon, osittaiskustannusten aukot, joissa puuttuva token-kenttä palauttaa COST UNAVAILABLE -tilan pyynnölle. Tarkista sieltä, kun koontinäyttö näyttää laskua pienempää; tarkista alennustaulukko, kun se näyttää suurempaa. Suurimman kertoimen taustalla oleva mekanismi on LLM-prompttien välimuistitus, ja korkea välimuistin osumasuhde on yleisin syy siihen, että seurattu arvio ylittää todellisen laskun.

Kustannusarvio ilman välimuistiosuma- ja eräalennuksia on katto, ei ennuste.

Mitkä työkalut oikeasti tekevät LLM-kulujen seurantaa?

Kuusi työkalua kattaa useimmat tuotantoasetelmat: Langfuse, LiteLLM, Helicone ja Portkey avoimen lähdekoodin ja gatewayn puolella, Datadog ja Braintrust kaupallisella puolella. Rehellinen jako on täytäntöönpano vastaan havainnointi: proxy voi hylätä pyynnöt budjetin rajalla, kun taas jäljitystyökalu mittaa kulutuksen jälkikäteen. Useimmat kypsät pinot päätyvät yhteen kumpaakin.

TyökaluTyyppiKulunseurannan lähestymistapaIlmaisversioValitse tämä, jos...
LangfuseAvoin lähdekoodiTracekohtainen kustannus mallien hintakorteista, itse ylläpidettäväItse ylläpidettynä ilmainen; ilmainen harrastetaso pilvessäHaluat avoimen lähdekoodin ja omistat datan
LiteLLMAvoimen lähdekoodin proxyAvain- ja tiimibudjetit, jotka pannaan täytäntöön gatewayllaIlmainen (OSS); maksullinen enterpriseTarvitset budjetit, jotka hylkäävät pyyntöjä, eivät vain laske
HeliconeAvoimen lähdekoodin gatewayProxytason kustannuslokit per avain ja malliIlmaisversio nopeusrajoillaHaluat yhden rivin proxyn vaihdon ilman SDK-muutoksia
PortkeyKaupallinen gatewayVirtuaaliavainten budjetit ja kustannusanalytiikkaIlmaisversio kehittäjilleHaluat gatewayn, promptit ja arvioinnit yhdessä paneelissa
Datadog LLM ObservabilityKaupallinenNanodollari-pyyntömittarit ja cost_tags14 päivän kokeiluAjat jo Datadogia kaikelle muulle
BraintrustKaupallinenArviointeihin sidottu kulutus per projektiIlmaisversioKustannustyösi alkaa arvioinneista, ei laskuista

Yksi varoitus toimittajien sisällöstä tällä alueella: Braintrustin oma vuoden 2026 vertailu kulunseurantatyökaluista sijoittaa itsensä ensimmäiseksi ja jättää pois jokaisen yllä olevan taulukon avoimen lähdekoodin vaihtoehdon. Lue toimittajien listikkeleitä niiden datan, älä niiden sijoitusten vuoksi.

Nollasta aloittavalle tiimille ajaisimme LiteLLM:n edessä ja Langfusen sen takana: proxy panee budjetit täytäntöön, tracet selittävät ne, ja yhdistelmä ei maksa mitään ennen kuin siirryt isännöityihin paketteihin. Jos punnitset kahta jäljityksen oletusvalintaa, Langfuse vs Langsmith -erittelymme käy tuon valinnan syvällisesti läpi, ja parhaiden AI-havainnointialustojen kokoelma kattaa koko kentän.

Seurannasta kustannusten leikkaamiseen

Seuranta näyttää, mihin raha menee; seuraava askel on päättää, kuinka paljon sinne menee. Kolme vipua, tuottojärjestyksessä: välimuista toistuva syöte, reititä helpot pyynnöt halvemmille malleille ja pienennä mallia siellä, missä laatu vielä kestää. LLM-API-kustannusten vähentämisen oppaamme kattaa jokaisen vivun, ja LLM-API-hinnoittelun vertailu on syöte kaikkeen yllä olevaan laskentaan.

Näkökulmamme: kun asiakkaan LLM-kulutus yllättää heidät, me seuraamme ensin ja leikkaamme toiseksi, emme koskaan toisinpäin. Tiimit, jotka välimuistavat ennen kuin mittaavat, päätyvät yleensä välimuistamaan väärät promptit. Seuranta kertoo, mihin raha menee; välimuistitus ja reititys päättävät, kuinka paljon sinne menee. Jos laskusi jo kirvelee, varaa ilmainen konsultaatio, niin katsomme luvut yhdessä läpi.

Tietoja kirjoittajasta

Mert Batur on Techsy.io:n perustajaosakas, jonka tiimi toimittaa AI-agentteja, automaatiojärjestelmiä ja ääni-/SDR-putkia B2B-asiakkaille. Hän kirjoittaa LLM-työkalupinosta, jota Techsyn tiimi oikeasti käyttää tuotannossa. Yhdistä LinkedInissä.

Usein kysytyt kysymykset

Kuinka paljon 1 miljoona tokenia on LLM:ssä?

Listahinnalla missä tahansa 0,14 dollarista 15 dollariin miljoonalta mallista ja suunnasta riippuen: DeepSeek-V4-syöte maksaa 0,14 dollaria miljoonalta, kun taas GPT-5.6 Terra -tuloste maksaa 15 dollaria. Tulostetokenit maksavat 3–6 kertaa syötteen hinnan jokaisella suurella tarjoajalla. Ensimmäisen osion taulukossa on neljä mallia, ja LLM-API-hinnoittelun vertailumme hinnoittelee kaikki seitsemäntoista, varmennettuna OpenAI- ja Anthropic-sivuja vasten heinäkuussa 2026.

Mitä on LLM-kustannusten optimointi?

Käytäntö, jolla kustannusta pyyntöä kohden lasketaan laatua heikentämättä: prompttien välimuistitus toistuvalle syötteelle, helppojen tehtävien reititys halvemmille malleille, batch-APIt asynkroniselle työlle ja mallin mitoitus oikein per ominaisuus. LLM-kustannusten seuranta on edellytys, koska et voi optimoida sitä, mitä et ole kohdistanut. Välimuistin osumasuhde ja kustannus per ominaisuus ovat kaksi mittaria, jotka osoittavat suurimmat vivut ensin.

Miksi LLM:t ovat niin kalliita?

Päättely on laskentatehorajoitteista: jokainen tuotettu token ajaa mallin täyden eteenpäinajon GPU:illa, ja päättelymallit käyttävät ylimääräisiä tokeneita ajatteluun ennen vastausta, laskutettuna tulosteen hinnalla. Pitkät järjestelmäpromptit moninkertaistavat tuon kustannuksen jokaisessa yksittäisessä pyynnössä. Lasku kasvaa runsassanaisuuden myötä puhelun molemmilla puolilla, minkä vuoksi tokenit pyyntöä kohden on ensimmäinen seurannan arvoinen mittari.

Kuinka paljon LLM maksaa Yhdysvalloissa?

API-hinnoittelu on dollarimääräinen ja globaali: OpenAI, Anthropic ja Google veloittavat saman listahinnan miljoonalta tokenilta riippumatta siitä, tuleeko pyyntö Ohiosta vai Osakasta. Alueelliset erot näkyvät itse ylläpidossa, jossa GPU-tunnit vaihtelevat pilvialueittain, ja isännöidyissä alustoissa, jotka lisäävät katetta. API-työssä sijainti muuttaa viivettä, ei hintaa.

Miten seuraan LLM-kustannuksia per tiimi?

Myönnä yksi virtuaaliavain per tiimi LiteLLM:n kaltaisen proxyn kautta, lisää jokaiseen avaimeen tiimin nimi tunnisteeksi luontihetkellä ja summaa kulutus tuon tunnisteen mukaan. Jokainen pyyntö kantaa silloin kohdennusta siitä hetkestä lähtien, kun se tehdään, ilman lokien jäsentämistä. Näyttämistaulukko yllä olevassa budjettiosiossa on lopputuote: tiimi, kuukausibudjetti, kulutus toistaiseksi, tila.

Langfuse vai Datadog LLM-kulujen seurantaan: kumman valitsen?

Valitse Langfuse, jos haluat avoimen lähdekoodin, itse ylläpidon ja datan, jota hallitset; sen ajaminen on ilmaista ja se jäljittää kustannuksen per pyyntö valmiiksi. Valitse Datadog vain, jos tiimisi jo ajaa sitä infrastruktuurille, koska sen LLM-kustannusominaisuudet eivät poistu alustalta. Useimmille nollasta aloittaville tiimeille Langfuse ja LiteLLM-proxy yhdessä voittavat kumman tahansa yksinään.

Vastaavatko arvioidut LLM-kustannukset todellista laskua?

Eivät, ja yleensä lasku on pienempi. Koontinäytöt laskuttavat listahintaan, kun taas välimuistisyöte asettuu 0,1x–0,25x ja erätyöt 0,5x, joten runsaasti välimuistia käyttävässä kuormassa todellinen lasku jää selvästi seurattua arviota pienemmäksi. Puuttuvat token-kentät työntävät virheen toiseen suuntaan. Yllä oleva erojen taulukko listaa jokaisen kertoimen ja mistä katsoa.

Miten hälytän LLM-kulutuksen piikeistä?

Aseta rajahälytys 80 prosenttiin jokaisen tiimin kuukausibudjetista, toimitettuna Slackiin webhookilla, sekä päivästä toiseen -poikkeamahälytys +50 prosenttiin nopeasti polttaville silmukoille. LiteLLM toimittaa rajakuvion natiivisti alerting_threshold-asetuksensa kautta. Hälytys 80 prosentissa jättää päiviä reagointiin; hälytys 100 prosentissa vain vahvistaa, että katto teki tehtävänsä.

Onko olemassa ilmaista LLM-kulujen seuraajaa?

On, kolme uskottavaa. Itse ylläpidetty Langfuse on ilmainen ja avointa lähdekoodia, ja pilvessä on ilmainen harrastetaso Langfuse-hinnoittelusivun mukaan. LiteLLM:n sisäänrakennetut avainbudjetit eivät maksa mitään avoimen lähdekoodin proxyssa. Heliconen ilmaisversio kattaa proxytason kustannuslokit nopeusrajoilla. Ilmaisversiot kattavat seurannan; täytäntöönpano ja hälytys skaalassa ovat se, mistä maksulliset paketit alkavat.

Johtopäätös

Valitse toteutuspolku tänään, koska hälytys, jonka kuuden viikon kuluttua haluat, vie iltapäivän asentaa nyt. Lyhyt versio:

  • Seuraa ensin tokeneita pyyntöä kohden ja kustannusta per tiimi; lisää kolme muuta mittaria, kun nämä toimivat.
  • Budjetti, joka hylkää pyyntöjä, on ohjauskeino; se, joka vain laskee, on raportti.
  • Aseta hälytys 80 prosenttiin, Slackiin, ennen kuin lasku voi yllättää kenenkään.
  • Koontinäyttösi on arvio; välimuistisyötteen ja eräajon hinnoittelu tarkoittaa, että lasku jää usein sitä pienemmäksi.

Jos haluat mieluummin jonkun katsomaan lukujasi kanssasi, varaa ilmainen konsultaatio.

Aihepiirit

llm-kustannusten-seurantallm-kulujen-seurantatoken-kayton-seurantallm-havainnointi

Jaa tämä artikkeli

Aloita projekti

Valmiina rakentamaan jotain erinomainen?

Muutetaan visiosi todellisuudeksi. Tiimimme on valmis auttamaan sinua luomaan ohjelmistoja, joilla on todellinen vaikutus.