ai-machine-learning

Monitorizare costuri LLM: urmărește cheltuielile înainte de vârf (2026)

Scris de Mert Batur
Actualizat Jul 31, 2026
14 min citire
Monitorizare costuri LLM: urmărește cheltuielile înainte de vârf (2026)

Monitorizare costuri LLM: urmărește cheltuielile înainte de vârf (2026)

Monitorizarea costurilor LLM este diferența dintre o factură-surpriză de 412 $ și o notificare Slack la 80% din buget. Claude Sonnet 5 se facturează luna aceasta cu 3,00 $ per milion de tokeni de intrare, iar o singură buclă de agent scăpată de sub control poate consuma totul într-o după-amiază. Majoritatea echipelor configurează urmărirea într-o zi. Alerta este partea pe care o sar.

Idei principale:

  • Monitorizarea costurilor LLM atașează fiecărui request un număr de tokeni și o estimare în dolari, apoi agregă pe model și echipă.
  • Urmărește cinci metrici: tokeni per request, cost per funcționalitate/echipă/model, rata de hit în cache, cost per conversație, rata creșterilor bruște.
  • Bugetele LiteLLM, traseele Langfuse sau Datadog LLM Observability oferă vizibilitate asupra cheltuielilor în mai puțin de o zi.
  • Dashboard-urile arată estimări. Prețurile pentru intrarea în cache și reducerile batch fac ca factura să aterizeze de obicei sub ele.

Ce urmărește, de fapt, monitorizarea costurilor LLM?

Monitorizarea costurilor LLM este practica de a atașa un număr de tokeni și o estimare în dolari fiecărui request LLM, apoi de a agrega acele estimări pe model, funcționalitate și echipă, astfel încât cheltuielile să poată fi alertate înainte ca factura să sosească. Estimarea se calculează per request din prețurile publice ale tokenilor, se rulează pe tag-urile aplicate apelului și se compară cu un buget stabilit dinainte.

Matematica de dedesubt este neutră față de furnizor. Răspunsul de utilizare al fiecărui provider desparte tokenii în câmpuri, iar documentația Datadog pentru costuri descrie relațiile explicit. Convențiile semantice OpenTelemetry GenAI standardizează aceleași câmpuri între furnizori, deci un dashboard construit pe ele nu este legat de un singur provider.

CâmpCe numărăSe facturează la
input_tokensTot ce trimiți: prompt de sistem, istoric, context recuperat, întrebareaTariful de bază pentru intrare
output_tokensTot ce generează modelulTariful de bază pentru ieșire (3-6x intrarea)
cache_read_tokensIntrare reutilizată dintr-un cache anterior0,1x-0,25x din intrarea de bază
cache_write_tokensIntrare scrisă în cache pentru prima dată~1,25x intrarea de bază (TTL de 5 min la Anthropic)
reasoning_tokensLanț de gândire intern, un subset al ieșiriiTariful de ieșire

Trei relații fac cea mai mare parte din treabă: total tokeni = intrare + ieșire; intrare = necitită din cache + cache_read + cache_write; iar tokenii de raționament stau în interiorul ieșirii, la tariful de ieșire. Dacă le nimerești, estimarea per request rămâne aproape. Dacă le ignori, dashboard-ul se îndepărtează de factură în fiecare lună. Monitorizarea costurilor este unul dintre pilonii observabilității AI. Tracing-ul și evaluările sunt ceilalți doi piloni și împart același vocabular de câmpuri.

Dashboard-ul tău arată o estimare. Factura este singura metrică de cost care nu intră niciodată în cache.

Cât costă 1 milion de tokeni într-un LLM?

Depinde de model și de direcție: 1 milion de tokeni costă 0,14 $ ca intrare DeepSeek-V4 și 15,00 $ ca ieșire GPT-5.6 Terra, o diferență de 100x pe aceeași unitate. Iată patru modele din cercetarea noastră de prețuri din 14 iulie 2026, verificate pe paginile oficiale:

ModelIntrare / 1 mil. tokeniIeșire / 1 mil. tokeniIntrare în cache / 1 mil. tokeni
Claude Sonnet 53,00 $15,00 $0,30 $
GPT-5.6 Terra2,50 $15,00 $0,25 $
Gemini 2.5 Pro1,25 $10,00 $0,31 $
DeepSeek-V40,14 $0,28 $0,003 $

Surse: prețuri OpenAI și prețuri Anthropic. O notă de subsol: Claude Sonnet 5 rulează prețuri introductive de 2,00 $ intrare / 10,00 $ ieșire până pe 31 august 2026, apoi revine la numerele de mai sus.

Cei 5 metrici care contează cu adevărat

Cinci metrici acoperă urmărirea costurilor LLM, iar majoritatea echipelor nu alertează niciodată decât pe doi dintre ei. Începe cu primele două rânduri: tokenii per request prind umflarea promptului în ziua în care apare, iar costul pe echipă este numărul pe care finanțele îl cer până la urmă. Ceilalți trei rafinează imaginea după ce primii sunt configurați.

MetricCum se calculeazăDe ce conteazăPrag de alertă
Tokeni per requestSuma intrare + ieșire per apel, grupat pe funcționalitateUmflarea promptului și încărcarea contextului apar aici primele+30% peste mediana pe 7 zile
Cost per funcționalitate / echipă / modelSuma costului estimat, grupat pe tag sau cheie virtualăBaza pe care rulează chargeback-ul unitar și bugetele80% din bugetul lunar
Rata de hit în cachecache_read / total tokeni de intrareRatele mici înseamnă că plătești preț întreg pentru prompturi repetateSub 50% pe trafic stabil
Cost per conversație / sesiuneSuma costului pe toate tururile unei sesiuniDezvăluie agenții multi-tur scăpați de sub control, pe care vederea per request îi ratează2x sesiunea la percentila 90
Rata de vârf / anomalieVariația de la o zi la alta a cheltuielii totaleSingura metrică ce prinde o buclă defectă înainte de factură+50% de la o zi la alta

O notă despre granularitate: Datadog stochează costul per request în nanodolari (miliardimi de dolar), conform documentației de cost. La 0,14 $ per milion de tokeni, un singur request DeepSeek-V4 poate costa mai puțin de o miime de cent, deci agregă înainte să rotunjești, altfel traficul pe modele mici dispare din raport.

Dacă nu urmărești altceva, urmărește rândurile unu și doi. Tokenii per request sunt cel mai timpuriu semnal de avertizare pe care îl primești. Costul pe echipă este cel care supraviețuiește întâlnirii cu departamentul de contabilitate.

Trei moduri de a configura monitorizarea costurilor LLM

Zero dintre paginile clasate pe primele locuri pentru această căutare livrează măcar o linie de cod executabilă, deci iată trei configurări funcționale. Fiecare intră în producție în mai puțin de o zi și se compun: noi le rulăm pe primele două împreună.

Ce rulăm de fapt în producție: în configurarea noastră, fiecare agent client vorbește cu proxy-ul LiteLLM prin propria cheie virtuală, cu un buget lunar pe fiecare cheie, iar Langfuse urmărește fiecare request în spatele proxy-ului. Când am implementat cele două componente împreună, împărțirea muncii a fost ideea: proxy-ul impune plafoanele, iar traseele explică ce le-a consumat. Fiecare dintre cheile noastre client poartă și un tpm_limit de 100.000 de tokeni pe minut, ca siguranță secundară. Conform documentației LiteLLM, proxy-ul respinge request-urile odată ce o limită este atinsă, iar pe comportamentul documentat ne bazăm, nu pe un benchmark măsurat de noi. Configurarea noastră sare complet peste LiteLLM 1.82.7 și 1.82.8, cele două versiuni prinse în incidentul de supply chain din martie 2026, și fixează tag-ul imaginii în loc să plutească pe latest.

Proxy LiteLLM: chei virtuale + bugete

Techsy rulează o configurare de proxy LiteLLM în producție, cu o cheie virtuală per client și un buget lunar pe fiecare cheie. Request-ul de mai jos este forma documentată din documentația virtual_keys a LiteLLM: conform acelei documentații, odată ce cheltuiala cumulată pe această cheie depășește 50 $ într-o lună, proxy-ul respinge request-urile ulterioare cu o eroare de buget depășit, în loc să înregistreze un avertisment după fapt.

bash
curl -X POST http://localhost:4000/key/generate \
  -H "Authorization: Bearer $LITELLM_MASTER_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "key_alias": "client-acme-search",
    "max_budget": 50.0,
    "budget_duration": "monthly",
    "tpm_limit": 100000,
    "models": ["anthropic/claude-sonnet-4-5"]
  }'

Fă aritmetica pe prețurile publice: la 3,00 $ / 15,00 $ per milion de tokeni pentru Claude Sonnet 5, 50 $ cumpără aproximativ 16,7 milioane de tokeni de intrare sau 3,3 milioane de tokeni de ieșire, cam o săptămână de trafic pentru unul dintre agenții noștri client mai ușori. Exact raza de impact pe care o vrem. tpm_limit este siguranța a doua: o buclă scăpată de sub control declanșează limita de 100.000 de tokeni pe minut cu mult înainte să atingă bugetul lunar. Atribuirea per utilizator funcționează la fel prin endpoint-ul users, iar ghidul nostru despre cele mai bune instrumente LLM gateway acoperă momentul în care un proxy își merită locul și momentul în care este doar un hop în plus.

Langfuse: tracing de cost cu @observe

Autocompletarea Google asociază „langfuse monitoring” cu această căutare, și pe bună dreptate: Langfuse este opțiunea implicită open-source pentru tracing. SDK-ul său Python înfășoară clientul de provider, astfel încât fiecare apel devine un traseu care poartă numărul de tokeni și un cost calculat, conform documentației Langfuse pentru tracing:

python
# pip install langfuse openai
from langfuse import observe
from langfuse.openai import openai  # drop-in wrapper, auto-traces

@observe()
def answer(question: str):
    return openai.chat.completions.create(
        model="gpt-4o-mini",
        messages=[{"role": "user", "content": question}],
    )

answer("what is llm cost monitoring")
# the trace now carries usage.total_tokens and total_cost,
# priced from Langfuse's model price cards

Costul aterizează pe traseu fără niciun calcul de tokeni din partea ta. Grupează traseele pe sesiune sau id de utilizator pentru rulări pe funcționalitate și auto-găzduiește dacă datele nu pot părăsi rețeaua ta.

Datadog LLM Observability: dacă ești deja acolo

Dacă echipa ta livrează deja agenți Datadog, documentația LLM pentru costuri este cea mai profundă referință unică de pe această pagină: cost per request în nanodolari, cost_tags personalizate pentru defalcări pe echipă și funcționalitate și o secțiune reală de troubleshooting pentru golurile de cost parțial. Limita sinceră: este doar pentru Datadog. Metricile nu părăsesc platforma și nu există o alternativă open-source dacă prețul nu mai convine. Alege-l pentru consolidare, nu pentru flexibilitate.

Cum configurezi bugete, alerte și chargeback?

Le configurezi pe trei straturi: un plafon de buget care respinge request-urile la limită, o alertă webhook care se declanșează la un prag procentual înainte de plafon și chei virtuale per echipă care transformă showback-ul și chargeback-ul într-o interogare, nu într-o ceartă. LiteLLM livrează toate trei nativ. Tiparele se transferă oricărui gateway cu bugete la nivel de cheie.

Un buget care doar numără este un raport. Un buget care respinge request-uri la plafon este un control.

Alerte care se declanșează înainte de vârf

Pune alerta la 80% din plafon, nu la 100%. LiteLLM vine cu alertare Slack integrată: setează alerting: ["slack"] și alerting_threshold: 80 în general_settings, îndreaptă variabila de mediu SLACK_WEBHOOK_URL către un canal și un mesaj ca acesta sosește când o cheie trece de prag:

json
{
  "text": "LLM budget alert: client-acme-search spent $40.18 of its $50.00 monthly cap (80.4%). Top model: anthropic/claude-sonnet-4-5."
}

La 80%, un om mai are zile ca să acționeze: downgrade de model, strângerea promptului sau ridicarea plafonului cu un nume pe aprobare. O alertă la 100% este o autopsie.

De la showback la chargeback

Showback înseamnă că fiecare echipă își vede propria cheltuială. Chargeback înseamnă că ea iese din bugetul lor. Ambele rulează pe un singur ingredient: o cheie virtuală per echipă, etichetată la creare. Raportul lunar este atunci un group-by pe tabelul de cheltuieli:

EchipăBuget lunarCheltuială până acumStatus
search50 $40,18 $alertă declanșată la 80%
support-chat200 $112,40 $în grafic
evals-batch30 $29,97 $plafon atins, respinge
sandbox10 $1,06 $în grafic

Format exemplu, nu date de client. Rândul evals-batch este tiparul funcționând cum trebuie: lucrarea batch a rulat până la plafon și s-a oprit, în loc să se scurgă silențios în factură. Comportamentul de aplicare este documentat în documentația virtual_keys a LiteLLM, inclusiv modul în care se resetează durata bugetului.

De ce nu se potrivește dashboard-ul cu factura?

Pentru că dashboard-urile facturează la preț de listă, în timp ce facturile aplică reduceri pe care monitorizarea ta nu le vede niciodată. Intrarea citită din cache aterizează la 0,1x-0,25x din prețul de bază, rularea batch la jumătate, iar tokenii de raționament se facturează la tariful de ieșire, din interiorul numărului de ieșire. Când cele două numere diverg, factura este de obicei cea mai mică, iar diferența este aproape întotdeauna unul dintre cei patru modificatori.

Modificator de prețMultiplicator tipicEfect asupra estimării
Intrare în cache (citire din cache)0,1x-0,25x din intrarea de bazăDashboard-ul iese prea sus dacă facturează hit-urile în cache la preț întreg
Batch API0,5x pe intrare și ieșireJoburile asincrone costă jumătate din numărul urmărit
Tokeni de raționament1x tariful de ieșire, numărați în interiorul ieșiriiLanțurile lungi de gândire ard bugetul de ieșire în tăcere
Scriere în cache~1,25x intrarea de bazăPrimul request dintr-o fereastră de cache costă puțin mai mult

Catalogul deschis pydantic/genai-prices arată de ce acești multiplicatori diferă de la model la model: fiecare furnizor își stabilește proprii factori de cache și batch, deci un tabel de prețuri codat rigid se decalibrează în ziua în care un provider își revizuiește grilele. Documentația de cost a Datadog descrie cealaltă jumătate a problemei, golurile de cost parțial în care un câmp de tokeni lipsă întoarce COST UNAVAILABLE pentru un request. Verifică acolo când dashboard-ul arată mai puțin decât factura. Verifică tabelul de reduceri când arată mai mult. Mecanismul din spatele celui mai mare multiplicator este prompt caching-ul LLM, iar o rată mare de hit în cache este cel mai frecvent motiv pentru care o estimare urmărită depășește factura reală.

O estimare de cost fără reducerile de cache și batch este un plafon, nu o prognoză.

Ce instrumente fac, de fapt, urmărirea costurilor LLM?

Șase instrumente acoperă majoritatea configurărilor de producție: Langfuse, LiteLLM, Helicone și Portkey pe partea open-source și de gateway, Datadog și Braintrust pe partea comercială. Împărțirea sinceră este aplicare versus observabilitate: un proxy poate respinge request-uri la un buget, în timp ce un instrument de tracing măsoară cheltuiala după fapt. Cele mai mature stive ajung să aibă câte unul din fiecare.

InstrumentTipAbordare de urmărire a costuluiPlan gratuitAlege-l dacă...
LangfuseOpen sourceCost per traseu din grilele de preț ale modelului, auto-găzduibilGratuit auto-găzduit; plan hobby gratuit pe cloudVrei open source și deții datele
LiteLLMProxy open sourceBugete pe cheie și pe echipă, aplicate la gatewayGratuit (OSS); enterprise plătitAi nevoie de bugete care resping request-uri, nu doar numără
HeliconeGateway open sourceJurnale de cost la nivel de proxy, per cheie și modelPlan gratuit cu limite de ratăVrei un schimb de proxy dintr-o linie, fără modificări de SDK
PortkeyGateway comercialBugete pe chei virtuale plus analitice de costPlan dezvoltator gratuitVrei gateway, prompturi și evaluări într-un singur panou
Datadog LLM ObservabilityComercialMetrici de request în nanodolari plus cost_tagsTrial de 14 zileRulezi deja Datadog pentru tot restul
BraintrustComercialCheltuială legată de evaluări, per proiectPlan gratuitMunca ta de cost pornește de la evaluări, nu de la facturi

Un avertisment despre conținutul vendorilor în acest domeniu: propria comparație Braintrust din 2026 a instrumentelor de urmărire a costurilor se clasează pe sine pe primul loc și omite toate opțiunile open-source din tabelul de mai sus. Citește listicle-urile vendorilor pentru datele lor, nu pentru clasamentele lor.

Pentru o echipă care pornește de la zero, am rula LiteLLM în față și Langfuse în spatele lui: proxy-ul aplică bugetele, traseele le explică, iar combinația nu costă nimic până treci pe planuri găzduite. Dacă cântărești cele două opțiuni implicite de tracing, analiza noastră Langfuse vs Langsmith intră în detaliu pe acea alegere, iar sinteza despre cele mai bune platforme de observabilitate AI acoperă întregul domeniu.

De la monitorizare la reducerea costurilor

Monitorizarea arată unde se duc banii. Pasul următor este să decizi cât se duce acolo. Cele trei pârghii, în ordinea câștigului: cache pentru intrare repetată, rutarea request-urilor ușoare către modele mai ieftine și micșorarea modelului acolo unde calitatea încă ține. Ghidul nostru despre reducerea costurilor API LLM acoperă fiecare pârghie, iar comparația de prețuri API LLM este intrarea pentru toată matematica de mai sus.

Perspectiva noastră: când cheltuiala LLM a unui client îi ia prin surprindere, monitorizăm întâi și tăiem al doilea, niciodată invers. Echipele care fac cache înainte să măsoare ajung de obicei să stocheze în cache prompturile greșite. Monitorizarea îți spune unde se duc banii; cache-ul și rutarea decid cât se duce acolo. Dacă factura ta deja doare, programează o consultație gratuită și ne uităm la numere împreună cu tine.

Despre autor

Mert Batur este Co-Fondator al Techsy.io, unde echipa livrează agenți AI, sisteme de automatizare și pipeline-uri de voce/SDR pentru clienți B2B. El scrie despre stiva de instrumente LLM pe care echipa Techsy o folosește efectiv în producție. Conectează-te pe LinkedIn.

Întrebări frecvente

Cât costă 1 milion de tokeni într-un LLM?

La preț de listă, oriunde între 0,14 $ și 15 $ per milion, în funcție de model și direcție: intrarea DeepSeek-V4 costă 0,14 $ per milion, în timp ce ieșirea GPT-5.6 Terra costă 15 $. Tokenii de ieșire costă de 3 până la 6 ori tariful de intrare la fiecare furnizor important. Tabelul din prima secțiune are patru modele, iar comparația noastră de prețuri API LLM le prețuiește pe toate șaptesprezece, verificate pe paginile OpenAI și Anthropic în iulie 2026.

Ce este optimizarea costurilor LLM?

Practica de a coborî costul per request fără să pierzi calitate: prompt caching pentru intrare repetată, rutarea sarcinilor ușoare către modele mai ieftine, API-uri batch pentru muncă asincronă și dimensionarea corectă a modelului per funcționalitate. Monitorizarea costurilor LLM este condiția prealabilă, din moment ce nu poți optimiza ce nu ai atribuit. Rata de hit în cache și costul per funcționalitate sunt cele două metrici care indică primele cele mai mari pârghii.

De ce sunt LLM-urile atât de scumpe?

Inferența este limitată de calcul: fiecare token generat rulează un forward pass complet al modelului pe GPU-uri, iar modelele de raționament consumă tokeni suplimentari gândind înainte să răspundă, facturați la tarife de ieșire. Prompturile de sistem lungi înmulțesc acel cost pe fiecare request în parte. Factura crește cu verbozitatea de ambele părți ale apelului, de aceea tokenii per request sunt prima metrică care merită urmărită.

Cât costă un LLM în SUA?

Prețurile API sunt denominate în USD și globale: OpenAI, Anthropic și Google taxează același preț de listă per milion de tokeni, indiferent dacă request-ul pornește din Ohio sau Osaka. Diferențele regionale apar la auto-găzduire, unde orele de GPU variază pe regiune de cloud, și la platformele găzduite care adaugă marjă. Pentru munca pe API, locația schimbă latența, nu prețul.

Cum urmăresc costurile LLM pe echipă?

Emite o cheie virtuală per echipă printr-un proxy ca LiteLLM, etichetează fiecare cheie cu numele echipei la creare și agregă cheltuiala pe acel tag. Fiecare request poartă atunci atribuirea din momentul în care este făcut, fără parsare de jurnale. Tabelul de showback din secțiunea de bugete de mai sus este produsul final: echipă, buget lunar, cheltuială până acum, status.

Langfuse vs Datadog pentru urmărirea costurilor LLM: pe care să-l aleg?

Alege Langfuse dacă vrei open source, auto-găzduire și date pe care le controlezi. Rulează gratuit și urmărește costul per request din start. Alege Datadog doar dacă echipa ta îl rulează deja pentru infrastructură, din moment ce funcțiile sale de cost LLM nu părăsesc platforma. Pentru majoritatea echipelor care pornesc de la zero, Langfuse plus un proxy LiteLLM bate oricare dintre opțiuni luate singure.

Costurile LLM estimate se potrivesc cu factura reală?

Nu, și de obicei factura este mai mică. Dashboard-urile facturează la preț de listă, în timp ce intrarea în cache aterizează la 0,1x-0,25x, iar joburile batch la 0,5x, deci o sarcină cu mult cache vede factura reală venind mult sub estimarea urmărită. Câmpurile de tokeni lipsă împing eroarea în direcția opusă. Tabelul de divergență de mai sus listează fiecare multiplicator și unde să te uiți.

Cum alertez la creșteri bruște ale cheltuielii LLM?

Setează o alertă de prag la 80% din bugetul lunar al fiecărei echipe, livrată pe Slack prin webhook, plus o alertă de anomalie de +50% de la o zi la alta pentru buclele care ard repede. LiteLLM livrează tiparul de prag nativ prin setarea alerting_threshold. O alertă la 80% lasă zile de reacție. O alertă la 100% doar confirmă că plafonul și-a făcut treaba.

Există un tracker gratuit de costuri LLM?

Da, trei credibile. Langfuse auto-găzduit este gratuit și open source, cu un plan hobby gratuit pe cloud, conform paginii de prețuri Langfuse. Bugetele integrate pe cheie ale LiteLLM nu costă nimic pe proxy-ul open source. Planul gratuit Helicone acoperă jurnalele de cost la nivel de proxy, cu limite de rată. Planurile gratuite acoperă monitorizarea; aplicarea și alertarea la scală sunt locul unde încep planurile plătite.

Concluzie

Alege o cale de configurare azi, pentru că alerta pe care o vei vrea peste șase săptămâni durează o după-amiază de configurat acum. Versiunea scurtă:

  • Urmărește întâi tokenii per request și costul pe echipă. Adaugă ceilalți trei metrici după ce aceștia funcționează.
  • Un buget care respinge request-uri este un control. Unul care doar numără este un raport.
  • Pune alerta la 80%, pe Slack, înainte ca factura să poată surprinde pe cineva.
  • Dashboard-ul tău este o estimare. Prețurile de intrare în cache și batch fac ca factura să aterizeze de obicei sub ea.

Dacă preferi ca cineva să se uite la numerele tale împreună cu tine, programează o consultație gratuită.

Etichete

monitorizare costuri llmurmărire costuri llmurmărire consum tokeniobservabilitate llm

Distribuie acest articol

Începe Proiectul Tău

Gata să construim ceva extraordinară?

Hai să-ți transformăm viziunea în realitate. Echipa noastră e pregătită să te ajute să creezi software care face diferența.