
Monitoring nákladů LLM: zachyťte výdaje, než vyletí (2026)
Monitoring nákladů LLM je rozdíl mezi překvapivou fakturou na 412 $ a slackovou zprávou při 80 % rozpočtu. Claude Sonnet 5 se tento měsíc účtuje 3,00 $ za milion vstupních tokenů a jediná splašená smyčka agenta tuto částku spálí za jedno odpoledne. Většina týmů zprovozní sledování za den; alerty jsou ta část, kterou vynechávají.
Klíčové poznatky:
- Monitoring nákladů LLM přiřadí každému požadavku počet tokenů a odhad v dolarech a poté je agreguje podle modelu a týmu.
- Sledujte pět metrik: tokeny na požadavek, náklady na funkci/tým/model, míru zásahů cache, náklady na konverzaci, míru nárůstů.
- Rozpočty LiteLLM, trace Langfuse nebo Datadog LLM Observability, každé z nich zprovozní přehled o výdajích za méně než den.
- Dashboardy ukazují odhady; ceny za cachované vstupy a batchové slevy znamenají, že faktura obvykle dorazí pod nimi.
Co vlastně monitoring nákladů LLM sleduje?
Monitoring nákladů LLM je praxe, kdy ke každému požadavku na LLM přiřadíte počet tokenů a odhad v dolarech a tyto odhady poté agregujete podle modelu, funkce a týmu, aby bylo možné výdaje alarmovat dříve, než dorazí faktura. Odhad se počítá pro každý požadavek z publikovaných cen tokenů, sčítá se podle tagů, kterými volání označíte, a porovnává s předem nastaveným rozpočtem.
Matematika pod tím je neutrální vůči dodavatelům. Odpověď o využití od každého poskytovatele rozbíjí tokeny na pole a dokumentace nákladů Datadog tyto vztahy popisuje explicitně. Sémantické konvence OpenTelemetry GenAI standardizují tatáž pole napříč dodavateli, takže dashboard nad nimi postavený není uzamčen u jednoho poskytovatele.
| Pole | Co počítá | Účtuje se za |
|---|---|---|
| input_tokens | Vše, co odešlete: systémový prompt, historie, stažený kontext, otázka | Základní vstupní sazba |
| output_tokens | Vše, co model vygeneruje | Základní výstupní sazba (3-6x vstup) |
| cache_read_tokens | Vstup znovu použitý z předchozí cache | 0,1x-0,25x základního vstupu |
| cache_write_tokens | Vstup poprvé zapsaný do cache | ~1,25x základního vstupu (5minutové TTL Anthropic) |
| reasoning_tokens | Vnitřní řetězec úloh, podmnožina výstupu | Výstupní sazba |
Tři vztahy odvedou většinu práce: celkové tokeny = vstup + výstup; vstup = necachovaný + cache_read + cache_write; a tokeny uvažování leží uvnitř výstupu, za výstupní sazbu. Když je uchopíte správně, odhad na požadavek zůstane blízko realitě; když je ignorujete, dashboard se bude každý měsíc rozcházet s fakturou. Monitoring nákladů je jedním z pilířů AI observability; tracing a evaluace jsou ty další dva a sdílejí tento stejný slovník polí.
Váš dashboard ukazuje odhad; faktura je jediná metrika nákladů, která se nikdy necachuje.
Kolik stojí 1 milion tokenů u LLM?
Záleží na modelu a směru: 1M tokenů stojí 0,14 $ jako vstup DeepSeek-V4 a 15,00 $ jako výstup GPT-5.6 Terra, tedy stonásobný rozdíl na téže jednotce. Zde jsou čtyři modely z našeho cenového průzkumu z 14. července 2026, ověřené podle oficiálních stránek:
| Model | Vstup / 1M tokenů | Výstup / 1M tokenů | Cachovaný vstup / 1M tokenů |
|---|---|---|---|
| Claude Sonnet 5 | 3,00 $ | 15,00 $ | 0,30 $ |
| GPT-5.6 Terra | 2,50 $ | 15,00 $ | 0,25 $ |
| Gemini 2.5 Pro | 1,25 $ | 10,00 $ | 0,31 $ |
| DeepSeek-V4 | 0,14 $ | 0,28 $ | 0,003 $ |
Zdroje: ceník OpenAI a ceník Anthropic. Jedna poznámka pod čarou: Claude Sonnet 5 běží do 31. srpna 2026 za zaváděcí ceny 2,00 $ vstup / 10,00 $ výstup a poté se vrátí na čísla výše.
5 metrik, na kterých skutečně záleží
Pět metrik pokrývá sledování nákladů LLM a většina týmů kdy alarmuje jen dvě z nich. Začněte prvními dvěma řádky: tokeny na požadavek odhalí nafouknutí promptu v den, kdy se objeví, a náklady na tým jsou číslo, které si finance dříve či později vyžádají. Zbylé tři obraz zpřesní, jakmile tyto dvě poběží.
| Metrika | Jak ji spočítat | Proč je důležitá | Prahová hodnota alertu |
|---|---|---|---|
| Tokeny na požadavek | Součet vstupu a výstupu na volání, seskupit podle funkce | Nafouknutí promptu a cpání kontextu se projeví nejdřív zde | +30 % nad 7denním mediánem |
| Náklady na funkci / tým / model | Součet odhadovaných nákladů, seskupit podle tagu nebo virtuálního klíče | Jednotka, na které reálně běží chargeback a rozpočty | 80 % měsíčního rozpočtu |
| Míra zásahů cache | cache_read / celkové vstupní tokeny | Nízké poměry znamenají, že za opakované prompty platíte plnou cenu | Pod 50 % při stabilním provozu |
| Náklady na konverzaci / relaci | Součet nákladů přes všechna kola jedné relace | Odhalí splašené vícekolové agenty, které pohled na požadavek mine | 2násobek 90. percentilu relace |
| Míra nárůstů / anomálií | Změna celkových výdajů den ode dne | Jediná metrika, která zachytí rozbitou smyčku před fakturou | +50 % den ode dne |
Jedna poznámka ke granularitě: Datadog ukládá náklady na úrovni požadavku v nanodolarech (miliardtina dolaru) podle své dokumentace nákladů. Při 0,14 $ za milion tokenů může jeden požadavek na DeepSeek-V4 stát méně než tisícinu centu, takže agregujte před zaokrouhlováním, jinak provoz malých modelů z reportu zmizí.
Pokud nesledujete nic jiného, sledujte řádek jedna a dva. Tokeny na požadavek jsou nejčasnější varování, které dostanete; náklady na tým jsou to, co přežije kontakt s účetním oddělením.
Tři způsoby, jak zprovoznit monitoring nákladů LLM
Žádná z nejlépe umístěných stránek pro tento dotaz nepublikuje jediný spustitelný řádek kódu, takže zde jsou tři funkční nastavení. Každé z nich jde do produkce za méně než den a dají se kombinovat: my provozujeme první dvě společně.
Co skutečně provozujeme v produkci: v našem nastavení mluví každý klientský agent s LiteLLM proxy přes svůj vlastní virtuální klíč, s měsíčním rozpočtem na každý klíč a Langfuse tracuje každý požadavek za proxy. Když jsme nasadili obě dvě společně, rozdělení práce bylo tím hlavním: proxy vynucuje limity a trace vysvětlují, co je spotřebovalo. Každý z našich klientských klíčů nese také tpm_limit 100 000 tokenů za minutu jako druhou pojistku; podle dokumentace LiteLLM proxy odmítne požadavky, jakmile je limit dosažen, a toto dokumentované chování je to, na co se spoléháme, ne benchmark, který jsme si měřili sami. Naše konfigurace zcela vynechává LiteLLM 1.82.7 a 1.82.8, dvě verze zasažené incidentem v dodavatelském řetězci v březnu 2026, a pinuje tag obrazu místo plavání na latest.
LiteLLM proxy: virtuální klíče + rozpočty
Techsy provozuje nastavení LiteLLM proxy v produkci s jedním virtuálním klíčem na klienta a měsíčním rozpočtem na každý klíč. Požadavek níže je dokumentovaná podoba z dokumentace virtual_keys LiteLLM: podle této dokumentace, jakmile kumulativní útrata na tomto klíči překročí 50 $ za měsíc, proxy odmítne další požadavky s chybou překročeného rozpočtu, místo aby jen zaznamenala varování zpětně.
curl -X POST http://localhost:4000/key/generate \
-H "Authorization: Bearer $LITELLM_MASTER_KEY" \
-H "Content-Type: application/json" \
-d '{
"key_alias": "client-acme-search",
"max_budget": 50.0,
"budget_duration": "monthly",
"tpm_limit": 100000,
"models": ["anthropic/claude-sonnet-4-5"]
}'Proveďte aritmetiku proti publikovaným cenám: při 3,00 $ / 15,00 $ za milion tokenů u Claude Sonnet 5 koupí 50 $ zhruba 16,7M vstupních tokenů nebo 3,3M výstupních tokenů, asi týden provozu pro jednoho z našich lehčích klientských agentů. Přesně to je rozsah dopadu, který chceme. tpm_limit je druhá pojistka: splašená smyčka narazí na 100K tokenů za minutu dávno předtím, než narazí na měsíční rozpočet. Přiřazení na uživatele funguje stejně přes endpoint users a náš průvodce nejlepšími nástroji LLM gateway pokrývá, kdy si proxy zaslouží své místo a kdy je jen dalším skokem.
Langfuse: tracing nákladů s @observe
Našeptávání Google páruje „langfuse monitoring" s tímto dotazem, a ne bez důvodu: Langfuse je open-source výchozí volba pro tracing. Jeho Python SDK obalí klienta vašeho poskytovatele, takže každé volání se stane trace nesoucí počty tokenů a spočítané náklady, podle dokumentace trace Langfuse:
# pip install langfuse openai
from langfuse import observe
from langfuse.openai import openai # drop-in wrapper, auto-traces
@observe()
def answer(question: str):
return openai.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": question}],
)
answer("what is llm cost monitoring")
# the trace now carries usage.total_tokens and total_cost,
# priced from Langfuse's model price cardsNáklady přistanou na trace bez jakékoli matematiky s tokeny na vaší straně; seskupte trace podle relace nebo ID uživatele pro rollupy za funkci a hostujte si je sami, pokud data nemohou opustit vaši síť.
Datadog LLM Observability: pokud už v něm jste
Pokud váš tým už nasazuje agenty Datadog, jeho dokumentace nákladů LLM je nejhlubší jednotlivá reference na této stránce: náklady na úrovni požadavku v nanodolarech, vlastní cost_tags pro rozbory za tým a funkci a skutečná sekce řešení problémů pro mezery v částečných nákladech. Upřímný limit: je to jen pro Datadog. Metriky neopustí platformu a neexistuje žádná open-source záchrana, pokud ceny přestanou vyhovovat. Vyberte ho pro konsolidaci, ne pro flexibilitu.
Jak zapojit rozpočty, alerty a chargeback?
Zapojíte to ve třech vrstvách: rozpočtový limit, který při dosažení meze odmítá požadavky, webhookový alert, který se spustí na procentuálním prahu před limitem, a virtuální klíče na tým, které ze showbacku a chargebacku udělají dotaz místo hádky. LiteLLM dodává všechny tři nativně; vzory se přenášejí na jakoukoli gateway s rozpočty na úrovni klíčů.
Rozpočet, který jen počítá, je report; rozpočet, který na limitu odmítá požadavky, je řízení.
Alerty, které se spustí před nárůstem
Nastavte alert na 80 % limitu, ne na 100 %. LiteLLM dodává slackové alertování vestavěné: nastavte alerting: ["slack"] a alerting_threshold: 80 v general_settings, nasměrujte proměnnou prostředí SLACK_WEBHOOK_URL na kanál a zpráva jako tato dorazí, když klíč překročí práh:
{
"text": "LLM budget alert: client-acme-search spent $40.18 of its $50.00 monthly cap (80.4%). Top model: anthropic/claude-sonnet-4-5."
}Při 80 % má člověk stále dny na reakci: downgrade modelu, zpřísnění promptu nebo zvýšení limitu se jménem na schválení. Alert na 100 % je pitva.
Od showbacku k chargebacku
Showback znamená, že každý tým vidí své vlastní výdaje; chargeback znamená, že jdou z jeho rozpočtu. Obojí běží na jedné přísadě: virtuální klíč na tým, otagovaný při vytvoření. Měsíční report je pak group-by nad tabulkou výdajů:
| Tým | Měsíční rozpočet | Výdaje k dnešku | Stav |
|---|---|---|---|
| search | 50 $ | 40,18 $ | alert se spustil v 80 % |
| support-chat | 200 $ | 112,40 $ | v plánu |
| evals-batch | 30 $ | 29,97 $ | limit dosažen, odmítá |
| sandbox | 10 $ | 1,06 $ | v plánu |
Příklad formátu, ne klientská data. Řádek evals-batch je vzor fungující tak, jak má: batchová práce běžela až do svého limitu a zastavila se, místo aby tiše krvácela do faktury. Chování vynucování je dokumentováno v dokumentaci virtual_keys LiteLLM, včetně toho, jak se resetuje doba trvání rozpočtu.
Proč se váš dashboard rozchází s fakturou?
Protože dashboardy účtují ceníkové ceny, zatímco faktury uplatňují slevy, které váš monitoring nikdy neuvidí. Cachovaný vstup přistane na 0,1x až 0,25x základní ceny, batch běží za polovinu a tokeny uvažování se účtují za výstupní sazbu, skryté uvnitř počtu výstupních tokenů. Když se ta dvě čísla rozcházejí, faktura je obvykle to nižší a mezera je téměř vždy jeden ze čtyř modifikátorů.
| Cenový modifikátor | Typický násobitel | Vliv na váš odhad |
|---|---|---|
| Cachovaný vstup (čtení cache) | 0,1x-0,25x základního vstupu | Dashboard běží vysoko, pokud účtuje zásahy cache za plnou cenu |
| Batch API | 0,5x na vstupu i výstupu | Asynchronní úlohy stojí polovinu sledovaného čísla |
| Tokeny uvažování | 1x výstupní sazba, počítáno uvnitř výstupu | Dlouhé řetězce úloh tiše spalují výstupní rozpočet |
| Zápis do cache | ~1,25x základního vstupu | První požadavek v okně cache stojí o něco více |
Otevřený katalog pydantic/genai-prices ukazuje, proč se tyto násobitele liší model od modelu: každý poskytovatel si nastavuje vlastní faktory cache a batch, takže jediná natvrdo zakódovaná tabulka cen se rozjede v den, kdy poskytovatel reviduje své ceníky. Dokumentace nákladů Datadog dokumentuje druhou polovinu problému, mezery v částečných nákladech, kdy chybějící pole tokenů vrátí pro požadavek COST UNAVAILABLE. Podívejte se tam, když dashboard ukazuje méně než faktura; podívejte se do tabulky slev, když ukazuje více. Mechanismus za největším násobitelem je prompt caching LLM a vysoká míra zásahů cache je nejčastější důvod, proč sledovaný odhad přestřeluje skutečnou fakturu.
Odhad nákladů bez slev za zásahy cache a batch je strop, ne prognóza.
Které nástroje skutečně dělají sledování nákladů LLM?
Šest nástrojů pokrývá většinu produkčních nastavení: Langfuse, LiteLLM, Helicone a Portkey na straně open-source a gateway, Datadog a Braintrust na komerční straně. Upřímné rozdělení je vynucování versus observability: proxy umí odmítnout požadavky na rozpočtu, zatímco tracingový nástroj měří výdaje zpětně. Většina vyspělých stacků skončí s jedním od každého.
| Nástroj | Typ | Přístup ke sledování nákladů | Free tier | Vyberte tento, pokud... |
|---|---|---|---|---|
| Langfuse | Open source | Náklady na trace z ceníkových karet modelů, self-hostovatelný | Self-host zdarma; hobby tier zdarma na cloudu | Chcete open source a vlastnit data |
| LiteLLM | Open source proxy | Rozpočty klíčů a týmů vynucované na gateway | Zdarma (OSS); placený enterprise | Potřebujete rozpočty, které odmítají požadavky, ne jen počítají |
| Helicone | Open source gateway | Logy nákladů na úrovni proxy, na klíč a model | Free tier s rate limity | Chcete jednořádkovou výměnu proxy bez změn SDK |
| Portkey | Komerční gateway | Rozpočty virtuálních klíčů plus analytika nákladů | Free tier pro vývojáře | Chcete gateway, prompty a evaluace v jednom panelu |
| Datadog LLM Observability | Komerční | Metriky požadavků v nanodolarech plus cost_tags | 14denní trial | Už provozujete Datadog na všechno ostatní |
| Braintrust | Komerční | Výdaje vázané na evaluace, na projekt | Free tier | Vaše práce s náklady začíná u evaluací, ne u faktur |
Jedna výhrada k obsahu dodavatelů v tomto prostoru: vlastní srovnání nástrojů na sledování nákladů od Braintrust z roku 2026 řadí sebe na první místo a vynechává každou open-source možnost v tabulce výše. Čtěte listikly dodavatelů pro jejich data, ne pro jejich žebříčky.
Pro tým začínající od nuly bychom provozovali LiteLLM vpředu a Langfuse za ním: proxy vynucuje rozpočty, trace je vysvětlují a tato kombinace nestojí nic, dokud nepřekročíte do hostovaných plánů. Pokud zvažujete dvě výchozí volby pro tracing, náš rozbor Langfuse vs Langsmith jde do hloubky u této volby a přehled nejlepších platforem AI observability pokrývá celé pole.
Od monitoringu ke snižování nákladů
Monitoring ukáže, kam peníze jdou; další krok je rozhodnout, kolik jich tam jde. Tři páky, v pořadí podle návratnosti: cachovat opakované vstupy, směrovat jednoduché požadavky na levnější modely a zmenšit model tam, kde kvalita stále drží. Náš průvodce snížením nákladů na LLM API pokrývá každou páku a srovnání cen LLM API je vstupem do veškeré matematiky výše.
Náš pohled: když klienta překvapí jeho výdaje za LLM, nejprve monitorujeme a teprve pak škrtáme, nikdy naopak. Týmy, které cachují před měřením, obvykle skončí cachováním špatných promptů. Monitoring vám řekne, kam peníze jdou; caching a routing rozhodnou, kolik jich tam jde. Pokud vás faktura už teď bolí, získejte bezplatnou konzultaci a my se na ta čísla podíváme s vámi.
O autorovi
Mert Batur je spoluzakladatel Techsy.io, kde tým dodává AI agenty, automatizační systémy a hlasové/SDR pipeline pro B2B klienty. Píše o stacku nástrojů LLM, který tým Techsy skutečně používá v produkci. Spojte se na LinkedIn.
Často kladené otázky
Kolik stojí 1 milion tokenů u LLM?
Za ceníkové ceny kdekoli od 0,14 $ do 15 $ za milion podle modelu a směru: vstup DeepSeek-V4 stojí 0,14 $ za milion, zatímco výstup GPT-5.6 Terra stojí 15 $. Výstupní tokeny běží 3- až 6násobně nad vstupní sazbou u každého velkého poskytovatele. Tabulka v první sekci má čtyři modely a naše srovnání cen LLM API naceňuje všech sedmnáct, ověřeno podle stránek OpenAI a Anthropic v červenci 2026.
Co je optimalizace nákladů LLM?
Praxe snižování nákladů na požadavek bez poklesu kvality: prompt caching pro opakované vstupy, směrování jednoduchých úloh na levnější modely, batch API pro asynchronní práci a správná velikost modelu na funkci. Monitoring nákladů LLM je předpoklad, protože nemůžete optimalizovat to, co jste nepřiřadili. Míra zásahů cache a náklady na funkci jsou dvě metriky, které nejdřív ukážou na největší páky.
Proč jsou LLM tak drahé?
Inference je omezená výpočty: každý vygenerovaný token provede plný dopředný průchod modelu na GPU a modely uvažování utratí extra tokeny přemýšlením před odpovědí, účtované za výstupní sazby. Dlouhé systémové prompty násobí tyto náklady na každý jednotlivý požadavek. Účty rostou s upovídaností na obou stranách volání, a proto jsou tokeny na požadavek první metrika, kterou se vyplatí sledovat.
Kolik stojí LLM v USA?
Ceny API jsou denominované v USD a globální: OpenAI, Anthropic a Google účtují stejnou ceníkovou cenu za milion tokenů, ať požadavek pochází z Ohia nebo Ósaky. Regionální rozdíly se objevují u self-hostingu, kde se hodiny GPU liší podle cloudového regionu, a u hostovaných platforem, které přidávají přirážku. Pro práci s API mění místo latenci, ne cenu.
Jak sledovat náklady LLM na tým?
Vydejte jeden virtuální klíč na tým přes proxy jako LiteLLM, při vytvoření každý klíč otagujte názvem týmu a agregujte výdaje podle tohoto tagu. Každý požadavek pak nese přiřazení od okamžiku, kdy je proveden, bez parsování logů. Tabulka showbacku v sekci o rozpočtech výše je konečný produkt: tým, měsíční rozpočet, výdaje k dnešku, stav.
Langfuse vs Datadog pro sledování nákladů LLM: který vybrat?
Vyberte Langfuse, pokud chcete open source, self-hosting a data, která kontrolujete; provoz je zdarma a tracing nákladů na požadavek funguje hned po instalaci. Vyberte Datadog, jen pokud ho váš tým už provozuje pro infrastrukturu, protože jeho funkce pro náklady LLM neopouštějí platformu. Pro většinu týmů začínajících od nuly Langfuse plus LiteLLM proxy porazí kteroukoli možnost samotnou.
Odpovídají odhadované náklady LLM skutečné faktuře?
Ne, a obvykle je faktura nižší. Dashboardy účtují ceníkové ceny, zatímco cachovaný vstup přistane na 0,1x až 0,25x a batch úlohy na 0,5x, takže workload s vysokou cache uvidí skutečnou fakturu výrazně pod sledovaným odhadem. Chybějící pole tokenů tlačí chybu na druhou stranu. Tabulka odchylek výše uvádí každý násobitel a kam se podívat.
Jak alarmovat na nárůsty výdajů LLM?
Nastavte prahový alert na 80 % měsíčního rozpočtu každého týmu, doručovaný do Slacku přes webhook, plus anomální alert den ode dne na +50 % pro smyčky, které pálí rychle. LiteLLM dodává prahový vzor nativně přes nastavení alerting_threshold. Alert na 80 % nechává dny na reakci; alert na 100 % jen potvrzuje, že limit splnil svou práci.
Existuje bezplatný nástroj na sledování nákladů LLM?
Ano, tři důvěryhodné. Self-hostovaný Langfuse je zdarma a open source, s hobby tier zdarma na cloudu podle ceníkové stránky Langfuse. Vestavěné rozpočty klíčů LiteLLM nestojí nic na open-source proxy. Free tier Helicone pokrývá logy nákladů na úrovni proxy s rate limity. Free tiery pokrývají monitoring; vynucování a alertování ve škále je místo, kde začínají placené plány.
Závěr
Vyberte si cestu nastavení dnes, protože alert, který budete chtít za šest týdnů, zabere odpoledne zprovoznit teď. Krátká verze:
- Nejprve sledujte tokeny na požadavek a náklady na tým; přidejte další tři metriky, jakmile tyto poběží.
- Rozpočet, který odmítá požadavky, je řízení; ten, který jen počítá, je report.
- Nastavte alert na 80 %, ve Slacku, dříve než může faktura kohokoli překvapit.
- Váš dashboard je odhad; ceny za cachované vstupy a batch znamenají, že faktura obvykle dorazí pod ním.
Pokud chcete, aby se na vaše čísla podíval někdo s vámi, získejte bezplatnou konzultaci.