
Kolik stojí LLM inference? 4 scénáře s reálnými výpočty
V březnu 2023 stál GPT-4 $30 za milion vstupních tokenů. O tři roky později zpracuje GPT-5.6 stejný milion za $10. Claude Opus 4.5 se drží na $15. A spodní hranice? Dva centy. To je rozpětí 1 500x mezi nejlevnější a nejdražší variantou pro naprosto stejnou jednotku práce. Cena LLM inference je opakující se účet, který platíte pokaždé, když natrénovaný model přečte váš vstup a vygeneruje výstup. Všichni velcí poskytovatelé ji účtují po milionech tokenů. Rozpočtové modely běží za $0,02-$0,30 za milion vstupních tokenů. Špičkové modely si za stejný objem účtují $15-$75. Na tom rozdílu záleží, protože o tom, kterou třídu skutečně potřebujete, rozhoduje váš workload, ne vaše ambice.
Klíčové body:
- Rozpočtové modely stojí $0,02-$0,30 za milion vstupních tokenů; špičkové modely běží za $15-$75 (červenec 2026).
- Výstupní tokeny jsou 3-5x dražší než vstupní, protože generování probíhá sekvenčně, ne paralelně.
- Podporový chatbot s 50 000 konverzacemi stojí zhruba $9-$420 měsíčně podle třídy modelu.
- Ceny inference klesají zhruba 10x ročně; Gartner předpovídá do roku 2030 pokles o 90 %.
Kolik stojí LLM inference za milion tokenů?
Cenotvorba LLM inference má k červenci 2026 třístupňovou strukturu. Rozpočtové modely od poskytovatelů jako Google (Gemini 2.5 Flash) a open-source varianty (Llama 4, Qwen 3) si účtují $0,02-$0,30 za milion vstupních tokenů. Střední třída (GPT-4.1, Claude Sonnet 4) se pohybuje mezi $0,55 a $15. Špičkové uvažovací modely (o3, Claude Opus 4.5) commandují $15-$75. Každý poskytovatel tyto sazby zveřejňuje na svých oficiálních cenových stránkách (OpenAI, Anthropic) a PricePerToken.com sleduje více než 300 modelů v živé tabulce.
K červenci 2026 můžete zpracovat milion vstupních tokenů už za dva centy, nebo za stejný milion na špičkovém modelu zaplatit sedmdesát pět dolarů.
| Třída | Příklad modelů | Vstup $/M tokenů | Výstup $/M tokenů | Cache vstup $/M | Vhodné pro |
|---|---|---|---|---|---|
| Rozpočtová | Gemini 2.5 Flash, Llama 4 Scout, Qwen 3 32B | $0,02-$0,30 | $0,06-$1,20 | $0,01-$0,15 | Hromadná klasifikace, routování |
| Střední | GPT-4.1, Claude Sonnet 4, Gemini 2.5 Pro, GPT-5.6 | $0,55-$15 | $2,20-$60 | $0,28-$7,50 | RAG, generování kódu, analýza |
| Špičková | o3, Claude Opus 4.5 | $15-$75 | $60-$300 | $7,50-$37,50 | Složité uvažování, výzkum |
Slevy za cachovaný vstup sníží váš účet o 50-90 % u opakujících se promptů (mechaniku vysvětluje prompt caching snižuje vstupní náklady). Živou tabulku 300 modelů s aktuálními sazbami všech poskytovatelů najdete v našem úplném ceníku po tokenech.
Co žene cenu LLM inference? 4 složky
Váš účet za inferenci se rozpadá na čtyři nákladové faktory: výpočetní čas GPU na token, paměť pro váhy modelu a KV cache, asymetrie vstupu a výstupu, která dělá generování dražším než čtení, a režie infrastruktury (elektřina, chlazení, síť). Pochopení toho, která složka u vašeho workloadu převažuje, vám řekne, kde se optimalizace vyplatí.
| Složka | Co to je | Podíl na vašem účtu | Co ji hýbe |
|---|---|---|---|
| Výpočet (čas GPU) | FLOPs pro zpracování každého tokenů vrstvami modelu | 40-60 % | Velikost modelu, batch size, míra kvantizace |
| Paměť (váhy + KV cache) | VRAM držící parametry modelu a stav attention | 20-35 % | Délka kontextu, souběžné požadavky |
| Asymetrie vstupu/výstupu | Fáze decode běží sekvenčně, jeden token po druhém | Zabudováno v ceně výstupu | Délka výstupu, strategie vzorkování |
| Režie infrastruktury | Elektřina, chlazení, síť, nečinný čas GPU | 10-20 % | Umístění datacentra, míra využití |
Výpočet: čas GPU na token
Každý token projde každou vrstvou modelu. Model se 70B parametry ve FP16 potřebuje zhruba 140 GFLOPs na token. Kvantizace na INT4 to srazí na ~35 GFLOPs. Průvodce benchmarkingem inference od NVIDIA rozebírá celý vzorec TCO: amortizace hardwaru plus elektřina plus provozní režie, děleno počtem obsloužených tokenů.
Paměť: váhy modelu + KV cache
Model se 70B parametry ve FP16 zabere ~140 GB VRAM jen na váhy. KV cache roste s délkou kontextu a velikostí souběžné dávky. Při kontextu 128K se 32 souběžnými požadavky spálíte dalších 80 GB. Proto jsou požadavky na VRAM podle modelu tak důležité pro rozhodování o vlastním hostingu.
Asymetrie vstupu a výstupu
Výstupní tokeny stojí 3-5x více než vstupní, protože je model generuje jeden po druhém, v pořadí. Nedokáže je paralelizovat tak, jako čte váš prompt.
Tady je ta prostá verze: čtení vašeho 2 000tokenového promptu (fáze „prefill") zpracuje všechny tokeny současně napříč jádry GPU. Generování 500 výstupních tokenů (fáze „decode") běží jeden token za krok, přičemž každý závisí na tom předchozím. GPU mezi kroky většinou nečinně čeká na paměťovou propustnost. Právě tento nečinný čas platíte sazbou 3-5násobku vstupu.
Režie infrastruktury
Elektřina, chlazení, síť a GPU, které mezi požadavky leží ladem. Dokumentace optimalizace od Hugging Face popisuje, jak kontinuální batchování a spekulativní dekódování vymáčknou ze stejného hardwaru více tokenů na GPU-hodinu, čímž přímo snižují tento podíl režie.
Kolik stojí LLM inference pro 4 reálné workloads?
Typický podporový chatbot stojí $9-$420 měsíčně, RAG pipeline běží za $168-$3 360 měsíčně, kódový asistent pro 200 vývojářů vyjde na $123-$2 078 měsíčně a dávkové zpracování dokumentů se pohybuje mezi $240 a $6 400 měsíčně. Rozpětí závisí téměř výhradně na volbě třídy modelu. Tyto čtyři scénáře jsme postavili na objemech tokenů z našich klientských nasazení, oceněných proti oficiálním ceníkům z července 2026. Každá dolarová částka níže je reprodukovatelná: uvedené předpoklady tokenů vynásobené zveřejněnými sazbami. Naše analýza, ne tvrzení prodejců.
Podporový chatbot: 50 000 konverzací měsíčně
Průměrná konverzace: 800 vstupních tokenů (systémový prompt + zprávy uživatele + stažený kontext), 400 výstupních tokenů. Měsíční objem: 50 000 konverzací = 40M vstupních tokenů, 20M výstupních tokenů.
- Rozpočtová volba (Gemini 2.5 Flash): 40M × $0,075/M + 20M × $0,30/M = $9 měsíčně. Podezřele levné.
- Střední volba (Claude Sonnet 4): 40M × $3/M + 20M × $15/M = $420 měsíčně.
Pro podporového bota, který zvládá tickety první úrovně, rozpočtový model v pohodě pokryje 90 % dotazů. Těch složitých 10 % směrujte na střední třídu pomocí klasifikátoru.
RAG pipeline: 10 000 dotazů denně
Průměrný dotaz: 3 200 vstupních tokenů (stažené úryvky + systémový prompt + otázka uživatele), 600 výstupních tokenů. Měsíčně: 300K dotazů = 960M vstupních tokenů, 180M výstupních tokenů.
- Rozpočtová volba (Llama 4 Scout přes API): 960M × $0,10/M + 180M × $0,40/M = $168 měsíčně.
- Střední volba (GPT-4.1): 960M × $2/M + 180M × $8/M = $3 360 měsíčně.
RAG workload je těžký na vstup, takže slevy za cachovaný vstup tu tvrdě dopadají. Při 70% prompt caching klesne střední třída na ~$2 100 měsíčně.
Kódový asistent: 200 vývojářů
Průměrná relace: 4 500 vstupních tokenů (kontext souborů + konverzace), 1 200 výstupních tokenů. Počítejme 15 požadavků na vývojáře denně, 22 pracovních dní = 66 000 požadavků měsíčně = 297M vstup, 79M výstup.
- Rozpočtová volba (Qwen 3 32B): 297M × $0,20/M + 79M × $0,80/M = $123 měsíčně.
- Střední volba (Claude Sonnet 4): 297M × $3/M + 79M × $15/M = $2 078 měsíčně.
Vývojáři si kvalitativních mezer všimnou rychle. U kódu je střední třída obvykle spodní hranice. Rozpočtové modely fungují na našeptávání ve stylu autocomplete, ale s refaktory napříč soubory se perou.
Dávkové zpracování dokumentů: 1M dokumentů měsíčně
Průměrný dokument: 2 000 vstupních tokenů, 300 výstupních tokenů (extrakce, klasifikace, sumarizace). Měsíčně: 2B vstup, 300M výstup.
- Rozpočtová volba (Gemini 2.5 Flash): 2B × $0,075/M + 300M × $0,30/M = $240 měsíčně.
- Střední volba (GPT-4.1): 2B × $2/M + 300M × $8/M = $6 400 měsíčně.
Při tomto objemu je 27násobný cenový rozdíl mezi třídami položkou $6 160 měsíčně. Rozpočtové modely zvládají strukturovanou extrakci dobře. Pro dimenzování hardwaru, pokud zvažujete vlastní hosting tohoto objemu, se podívejte na požadavky na VRAM podle modelu.
| Workload | Model | Tokeny/požadavek (vstup/výstup) | Požadavků/měsíc | $/měsíc |
|---|---|---|---|---|
| Podporový chatbot | Gemini 2.5 Flash | 800 / 400 | 50K | $9 |
| Podporový chatbot | Claude Sonnet 4 | 800 / 400 | 50K | $420 |
| RAG pipeline | Llama 4 Scout | 3 200 / 600 | 300K | $168 |
| RAG pipeline | GPT-4.1 | 3 200 / 600 | 300K | $3 360 |
| Kódový asistent | Qwen 3 32B | 4 500 / 1 200 | 66K | $123 |
| Kódový asistent | Claude Sonnet 4 | 4 500 / 1 200 | 66K | $2 078 |
| Dávkové dokumenty | Gemini 2.5 Flash | 2 000 / 300 | 1M | $240 |
| Dávkové dokumenty | GPT-4.1 | 2 000 / 300 | 1M | $6 400 |
def monthly_cost(input_tokens, output_tokens, requests, price_in, price_out):
"""Estimate monthly LLM inference cost.
Args:
input_tokens: avg input tokens per request
output_tokens: avg output tokens per request
requests: monthly request volume
price_in: $/M input tokens
price_out: $/M output tokens
"""
total_in = input_tokens * requests / 1_000_000
total_out = output_tokens * requests / 1_000_000
return (total_in * price_in) + (total_out * price_out)
# Example: support chatbot on Claude Sonnet 4
cost = monthly_cost(
input_tokens=800,
output_tokens=400,
requests=50_000,
price_in=3.00,
price_out=15.00
)
print(f"${cost:,.2f}/month") # $420.00/monthAPI nebo vlastní hosting: kdy vyhraje které?
API vyhrává pod ~20K požadavky denně nebo když vašemu týmu chybí zkušenosti s ML infrastrukturou. Vlastní hosting vyhrává nad 200K požadavky denně při trvalém využití GPU přes 50 %. Bod zvratu podle analýzy Introl leží kolem 50-80K požadavků denně pro model třídy 70B na jednom uzlu H100. Pod touto hranicí porazí více tenantská efektivita poskytovatele API matematiku vašeho single-tenant hardwaru.
| Úroveň objemu | API $/měsíc | Vlastní hosting $/měsíc (GPU + provoz) | Vítěz | Proč |
|---|---|---|---|---|
| Nízká: 2K pož./den | $150-$400 | $2 800-$4 500 | API | GPU leží ladem 85 % času |
| Střední: 20K pož./den | $1 500-$4 000 | $3 200-$5 000 | API (těsně) | Využití dosahuje ~40 %, stále pod bodem zvratu |
| Vysoká: 200K pož./den | $15 000-$40 000 | $5 500-$8 000 | Vlastní hosting | Využití 70 %+ rychle amortizuje hardware |
Kdy vyhrává API
Nasadíte za dny, ne za týdny. Žádný plat ML inženýra ($180K-$250K ročně), žádná on-call rotace na výpadky GPU, žádné plánování kapacity. Pro většinu týmů pod 50 inženýrů je API správná výchozí volba. Tečka.
Kdy vyhrává vlastní hosting
Překročili jste 200K požadavků denně, váš workload je předvídatelný a už zaměstnáváte lidi na ML infrastrukturu. Open-source modely (Llama 4, Qwen 3, Mistral) běží na vašem hardwaru za cenu elektřiny plus amortizace. Benchmarky vLLM vs SGLang ukazují rozdíly v propustnosti 15-30 % podle tvaru workloadu, což v tomto měřítku hraje roli.
Číslo bodu zvratu
Vlastní hosting vyhrává až nad ~50% trvalým využitím GPU. Pod ním platíte za nečinný křemík. Skryté personální náklady (čas ML inženýrů, on-call, aktualizace modelů, bezpečnostní záplaty) jsou skutečným důvodem, proč většina týmů zůstává na API, i když surová matematika GPU vypadá příznivě. Pokud přesto vlastní hosting zvolíte, nasazení modelů na Modal odstraní vrstvu správy infrastruktury a zároveň udrží náklady na token pod sazbami API.
Skryté náklady, které nikdo neplánuje
Surové výdaje za tokeny jsou 60-80 % vašeho reálného účtu. Zbytek se skrývá v šesti položkách, které se v cenové kalkulačce nikdy neobjeví. K odhadu tokenů připočtěte navrch dalších 20-40 %, abyste je pokryli.
- Nástroje pro monitoring a observabilitu: $200-$1 500 měsíčně. Dashboards spotřeby tokenů, sledování latence, přiřazení nákladů na funkci. Observability stack pro LLM se zaplatí hned poprvé, co odchytíte regresi promptu dřív, než vám propálí rozpočet.
- Opakování a chybné běhy: 3-8 % požadavků selže nebo potřebuje opakovat (timeouty, rate limity, zmršené výstupy). To jsou 3-8 % vašeho účtu za tokeny, utracené za nic.
- Hodiny iterací nad prompt-engineeringem: 20-60 hodin čtvrtletně při plněném inženýrském nákladu $100-$200 za hodinu. Každá úprava promptu znovu pouští testovací dávky.
- Eval a regresní testování: $100-$800 měsíčně v útratě za tokeny pro automatizované eval sady. Platíte modelu, aby sám sebe známkoval.
- Víceregionová redundance: 1,5-2x náklady infrastruktury, pokud potřebujete failover mezi regiony kvůli latenci nebo compliance.
- Penále za cold-start latenci: Serverless GPU nasazení (Modal, AWS Lambda) účtují nečinný čas. Cold start přidá 2-8 sekund a naúčtuje vám i zahřátí.
Pravidlo palce: vynásobte svůj surový odhad tokenů 1,3 pro realistický rozpočet. Vynásobte 1,4, pokud jste v regulovaném odvětví s compliance režií.
Proč LLM inference pořád zlevňuje?
Ceny LLM inference klesají zhruba 10x ročně od roku 2023. Workload, který v roce 2024 stál $1 000 měsíčně, dnes vyjde blíž ke $100. Ženou to tři síly: hardwarová vylepšení (NVIDIA Blackwell FP4, Google TPU v6), konkurenční tlak (DeepSeek, open-source modely vynucující cenové války) a softwarová optimalizace (spekulativní dekódování, kontinuální batchování, kvantizace). Gartner předpovídá, že náklady inference do roku 2030 klesnou o dalších 90 %, i když jde o projekci, ne záruku.
Sledování cen od Epoch AI dokumentuje tento pokles tvrdými datovými body. Analýza „LLMflation" od a16z razila tento termín a zarámovala ekonomické důsledky: inference defluje rychle než kterákoli předchozí výpočetní kategorie.
Náklady na trénink vs inference
Trénink špičkového modelu vyjde na $50M-$200M (jednorázově). Inference téhož modelu, napříč všemi uživateli, běží za $5M-$50M ročně podle škály. Pro většinu týmů je poměr 10-100x: trénink stojí 10-100násobek toho, co jeden rok inference. Jenže trénink je jednorázový kapitálový výdaj. Inference je opakující se provozní účet, který se s růstem uživatelů úročí. Za trénink neplatíte, pokud nestavíte základní model. Za inferenci platíte každý den.
Položka energie
NVIDIA H100 si pod zátěží bere ~700W. Při $0,10/kWh (průměr USA) je to $0,07 na GPU-hodinu. Model se 70B parametry na jedné H100 vygeneruje v dávce zhruba 2 000 výstupních tokenů za sekundu. Za jednu hodinu: 7,2M tokenů. Náklady na elektřinu na milion výstupních tokenů: ~$0,01. Náš výpočet, jako takový označený. Energie je 1-3 % vašeho účtu za API, ale 8-15 % TCO vlastního hostingu. Záleží na ní víc, pokud provozujete vlastní GPU v regionu s drahou elektřinou (Německo při $0,30/kWh toto číslo ztrojnásobí).
Praktické poučení: ceny klesají dost rychle na to, aby byl 12měsíční závazek konkrétní třídě modelu riskantní. Přehodnocujte čtvrtletně. 12 způsobů, jak snížit účet za LLM pokrývá taktické kroky, které můžete udělat hned teď, zatímco makro trend odvádí těžkou práci.
Jak odhadnete VÁŠ náklad na inferenci?
Odhadněte svůj měsíční náklad na LLM inferenci ve čtyřech krocích: spočítejte tokeny na požadavek, vynásobte měsíčním objemem, aplikujte třídní ceník a přičtěte 20-40 % režie. Podle našich zkušeností s dimenzováním rozpočtů inference pro klienty většina týmů krok čtyři přeskočí a pak se diví, proč jejich reálný účet překračuje odhad o třetinu. Tady je postup, který používáme.
- Spočítejte tokeny na požadavek. Zalogujte si průměrné vstupní tokeny (systémový prompt + kontext + zpráva uživatele) a výstupní tokeny (odpověď modelu) na 100 a více reálných požadavcích. Nehádejte. Měřte.
- Vynásobte měsíčním objemem. Požadavky/den × 30 = měsíční požadavky. Vynásobte počtem tokenů na požadavek.
- Aplikujte třídní ceník. Vynásobte celkové vstupní tokeny sazbou modelu $/M vstup. Stejně pro výstup. Sečtěte.
- Přičtěte 20-40 % režie. Opakování, evaly, iterace promptů, monitoring. Toto je číslo, které patří do vašeho rozpočtu, ne krok 3.
def estimate_monthly_budget(avg_input_tokens, avg_output_tokens,
requests_per_day, price_in, price_out,
overhead_pct=0.30):
"""Full monthly budget estimate with overhead."""
monthly_requests = requests_per_day * 30
raw_cost = monthly_cost(
avg_input_tokens, avg_output_tokens,
monthly_requests, price_in, price_out
)
return raw_cost * (1 + overhead_pct)
# RAG pipeline: 10K queries/day on GPT-4.1
budget = estimate_monthly_budget(
avg_input_tokens=3200,
avg_output_tokens=600,
requests_per_day=10_000,
price_in=2.00,
price_out=8.00,
overhead_pct=0.30
)
print(f"${budget:,.0f}/month") # $4,368/monthJakmile znáte své číslo, nástroje LLM gateway směrují provoz na nejlevnější model, který projde vaší laťkou kvality. Gateway s výběrem modelu na úrovni požadavku umí snížit váš průměrný náklad o 30-50 %, aniž byste sáhli na prompty.
O autorovi
Mert Batur je spoluzakladatel Techsy.io, kde tým nasazuje AI agenty, automatizační systémy a hlasové/SDR pipeline pro B2B klienty. Píše o stacku nástrojů LLM, který tým Techsy skutečně používá v produkci. Spojte se na LinkedIn.
Často kladené otázky
Je LLM inference drahá?
Záleží na škále a volbě modelu. Milion vstupních tokenů stojí $0,02 na Gemini 2.5 Flash nebo $75 na špičkovém uvažovacím modelu. Pro malou aplikaci zpracovávající 10K požadavků denně počítejte s $50-$400 měsíčně. Pro podnikové workloads nad 1M požadavků denně běží rozpočty na $5 000-$40 000 měsíčně. Jednotková cena je nízká; objem to nabalí.
Kolik je 1 milion tokenů v LLM?
Jeden milion tokenů odpovídá zhruba 750 000 slovům, tedy asi 10 plnohodnotným románům. V červenci 2026 stojí zpracování 1M vstupních tokenů $0,02 (rozpočtová třída) až $75 (špičková třída). Výstupní tokeny pro stejný objem běží za $0,06 až $300. Většina produkčních workloadů skončí ve střední třídě: $2-$15 za milion vstupních tokenů.
Proč je AI inference tak drahá?
Inference vyžaduje protlačit každý token miliardami parametrů modelu na GPU, z nichž každý stojí $25 000-$40 000. Fáze decode generuje tokeny sekvenčně, takže jádra GPU mezi kroky leží ladem. Platíte za specializovaný hardware, elektřinu, chlazení a inženýrský tým poskytovatele, který drží serving stack v chodu 24/7.
Klesají náklady na AI inferenci?
Ano, zhruba 10x ročně od roku 2023. GPT-4 startoval na $30/$60 za milion tokenů (vstup/výstup). Ekvivalentní schopnost dnes stojí $2-$10. Data Epoch AI potvrzují tuto trajektorii napříč všemi poskytovateli. Gartner předpovídá do roku 2030 další pokles o 90 %, tažený hardwarovými vylepšeními a konkurenčním tlakem open-source modelů.
Kolik stojí LLM inference v roce 2026?
Rozpočtové modely: $0,02-$0,30 za milion vstupních tokenů. Střední třída: $0,55-$15. Špičková: $15-$75. Typický produkční workload (podporový chatbot, RAG pipeline nebo kódový asistent) stojí na modelech střední třídy $150-$4 000 měsíčně. Rozpočtové modely zvládnou hromadné, málo složité úlohy za 10-30x méně.
Jaký je rozdíl mezi náklady na trénink a inferenci?
Trénink je jednorázový výdaj za naučení modelu od nuly: $50M-$200M za špičkový model, vyžadující tisíce GPU po měsíce. Inference je opakující se náklad za používání toho natrénovaného modelu: proháníte jí vstupy, abyste dostali výstupy, účtováno po tokenech. Pro většinu týmů je inference jediný účet, který platí. Trénink je pro firmy stavějící základní modely.
Jak spočítám náklad na LLM inferenci pro svou aplikaci?
Vynásobte průměrné vstupní tokeny na požadavek svým měsíčním objemem požadavků a pak sazbou modelu $/M vstup. Zopakujte pro výstupní tokeny. Obojí sečtěte. Přičtěte 30 % na opakování, evaly a monitoring. Python snippety v tomto článku matematiku automatizují. Měřte reálné počty tokenů, místo abyste hádali; logy ze 100 a více požadavků dají spolehlivý průměr.
Stojí výstupní tokeny víc než vstupní?
Ano, typicky 3-5x víc. Zpracování vstupu (prefill) paralelizuje napříč všemi tokeny současně a plně využívá jádra GPU. Generování výstupu (decode) produkuje jeden token po druhém, přičemž každý závisí na předchozím. GPU mezi kroky čeká na paměťovou propustnost. Poskytovatelé oceňují výstup výš, aby zohlednili tuto nižší hardwarovou efektivitu.
Je vlastní hosting inference levnější než použití API?
Jen nad ~200K požadavky denně při trvalém využití GPU přes 50 %. Pod ním porazí více tenantská efektivita poskytovatelů API váš single-tenant hardware. Vlastní hosting navíc přidává skryté náklady: platy ML inženýrů ($180K-$250K ročně), on-call rotace, aktualizace modelů a bezpečnostní záplaty. Většina týmů pod 50 inženýrů by měla zůstat na API.
Spotřebuje LLM inference hodně energie?
GPU H100 si pod zátěží bere ~700W. Při $0,10/kWh je to $0,07/GPU-hodinu, což u modelu se 70B parametry odpovídá zhruba $0,01 na milion výstupních tokenů. Energie je 1-3 % účtu za API, ale 8-15 % TCO vlastního hostingu. V regionech s drahou elektřinou (Německo, $0,30/kWh) se podíl energie ztrojnásobí a materiálně ovlivní ekonomiku vlastního hostingu.
Shrnutí
Čtyři čísla, která si zapamatovat: $0,02 (rozpočtová spodní hranice za milion vstupních tokenů), 3-5x (prémie výstupu vůči vstupu), 20-40 % (režie, kterou přičíst k surové matematice tokenů) a 10x (roční pokles cen od roku 2023). Váš reálný účet závisí na objemu, třídě modelu a na tom, jak agresivně cachujete, batchujete a směrujete provoz.
V Techsy náš tým dimenzuje rozpočty inference a vybírá třídy modelů pro B2B klienty provozující produkční LLM workloads. Pokud chcete druhý pár očí na svůj nákladový model, získejte bezplatnou konzultaci.