ai-machine-learning

Kolik stojí LLM inference? 4 scénáře s reálnými výpočty

Napsal Mert Batur
Aug 1, 2026
14 minut čtení
Kolik stojí LLM inference? 4 scénáře s reálnými výpočty

Kolik stojí LLM inference? 4 scénáře s reálnými výpočty

V březnu 2023 stál GPT-4 $30 za milion vstupních tokenů. O tři roky později zpracuje GPT-5.6 stejný milion za $10. Claude Opus 4.5 se drží na $15. A spodní hranice? Dva centy. To je rozpětí 1 500x mezi nejlevnější a nejdražší variantou pro naprosto stejnou jednotku práce. Cena LLM inference je opakující se účet, který platíte pokaždé, když natrénovaný model přečte váš vstup a vygeneruje výstup. Všichni velcí poskytovatelé ji účtují po milionech tokenů. Rozpočtové modely běží za $0,02-$0,30 za milion vstupních tokenů. Špičkové modely si za stejný objem účtují $15-$75. Na tom rozdílu záleží, protože o tom, kterou třídu skutečně potřebujete, rozhoduje váš workload, ne vaše ambice.

Klíčové body:

  • Rozpočtové modely stojí $0,02-$0,30 za milion vstupních tokenů; špičkové modely běží za $15-$75 (červenec 2026).
  • Výstupní tokeny jsou 3-5x dražší než vstupní, protože generování probíhá sekvenčně, ne paralelně.
  • Podporový chatbot s 50 000 konverzacemi stojí zhruba $9-$420 měsíčně podle třídy modelu.
  • Ceny inference klesají zhruba 10x ročně; Gartner předpovídá do roku 2030 pokles o 90 %.

Kolik stojí LLM inference za milion tokenů?

Cenotvorba LLM inference má k červenci 2026 třístupňovou strukturu. Rozpočtové modely od poskytovatelů jako Google (Gemini 2.5 Flash) a open-source varianty (Llama 4, Qwen 3) si účtují $0,02-$0,30 za milion vstupních tokenů. Střední třída (GPT-4.1, Claude Sonnet 4) se pohybuje mezi $0,55 a $15. Špičkové uvažovací modely (o3, Claude Opus 4.5) commandují $15-$75. Každý poskytovatel tyto sazby zveřejňuje na svých oficiálních cenových stránkách (OpenAI, Anthropic) a PricePerToken.com sleduje více než 300 modelů v živé tabulce.

K červenci 2026 můžete zpracovat milion vstupních tokenů už za dva centy, nebo za stejný milion na špičkovém modelu zaplatit sedmdesát pět dolarů.

TřídaPříklad modelůVstup $/M tokenůVýstup $/M tokenůCache vstup $/MVhodné pro
RozpočtováGemini 2.5 Flash, Llama 4 Scout, Qwen 3 32B$0,02-$0,30$0,06-$1,20$0,01-$0,15Hromadná klasifikace, routování
StředníGPT-4.1, Claude Sonnet 4, Gemini 2.5 Pro, GPT-5.6$0,55-$15$2,20-$60$0,28-$7,50RAG, generování kódu, analýza
Špičkováo3, Claude Opus 4.5$15-$75$60-$300$7,50-$37,50Složité uvažování, výzkum

Slevy za cachovaný vstup sníží váš účet o 50-90 % u opakujících se promptů (mechaniku vysvětluje prompt caching snižuje vstupní náklady). Živou tabulku 300 modelů s aktuálními sazbami všech poskytovatelů najdete v našem úplném ceníku po tokenech.

Co žene cenu LLM inference? 4 složky

Váš účet za inferenci se rozpadá na čtyři nákladové faktory: výpočetní čas GPU na token, paměť pro váhy modelu a KV cache, asymetrie vstupu a výstupu, která dělá generování dražším než čtení, a režie infrastruktury (elektřina, chlazení, síť). Pochopení toho, která složka u vašeho workloadu převažuje, vám řekne, kde se optimalizace vyplatí.

SložkaCo to jePodíl na vašem účtuCo ji hýbe
Výpočet (čas GPU)FLOPs pro zpracování každého tokenů vrstvami modelu40-60 %Velikost modelu, batch size, míra kvantizace
Paměť (váhy + KV cache)VRAM držící parametry modelu a stav attention20-35 %Délka kontextu, souběžné požadavky
Asymetrie vstupu/výstupuFáze decode běží sekvenčně, jeden token po druhémZabudováno v ceně výstupuDélka výstupu, strategie vzorkování
Režie infrastrukturyElektřina, chlazení, síť, nečinný čas GPU10-20 %Umístění datacentra, míra využití

Výpočet: čas GPU na token

Každý token projde každou vrstvou modelu. Model se 70B parametry ve FP16 potřebuje zhruba 140 GFLOPs na token. Kvantizace na INT4 to srazí na ~35 GFLOPs. Průvodce benchmarkingem inference od NVIDIA rozebírá celý vzorec TCO: amortizace hardwaru plus elektřina plus provozní režie, děleno počtem obsloužených tokenů.

Paměť: váhy modelu + KV cache

Model se 70B parametry ve FP16 zabere ~140 GB VRAM jen na váhy. KV cache roste s délkou kontextu a velikostí souběžné dávky. Při kontextu 128K se 32 souběžnými požadavky spálíte dalších 80 GB. Proto jsou požadavky na VRAM podle modelu tak důležité pro rozhodování o vlastním hostingu.

Asymetrie vstupu a výstupu

Výstupní tokeny stojí 3-5x více než vstupní, protože je model generuje jeden po druhém, v pořadí. Nedokáže je paralelizovat tak, jako čte váš prompt.

Tady je ta prostá verze: čtení vašeho 2 000tokenového promptu (fáze „prefill") zpracuje všechny tokeny současně napříč jádry GPU. Generování 500 výstupních tokenů (fáze „decode") běží jeden token za krok, přičemž každý závisí na tom předchozím. GPU mezi kroky většinou nečinně čeká na paměťovou propustnost. Právě tento nečinný čas platíte sazbou 3-5násobku vstupu.

Režie infrastruktury

Elektřina, chlazení, síť a GPU, které mezi požadavky leží ladem. Dokumentace optimalizace od Hugging Face popisuje, jak kontinuální batchování a spekulativní dekódování vymáčknou ze stejného hardwaru více tokenů na GPU-hodinu, čímž přímo snižují tento podíl režie.

Kolik stojí LLM inference pro 4 reálné workloads?

Typický podporový chatbot stojí $9-$420 měsíčně, RAG pipeline běží za $168-$3 360 měsíčně, kódový asistent pro 200 vývojářů vyjde na $123-$2 078 měsíčně a dávkové zpracování dokumentů se pohybuje mezi $240 a $6 400 měsíčně. Rozpětí závisí téměř výhradně na volbě třídy modelu. Tyto čtyři scénáře jsme postavili na objemech tokenů z našich klientských nasazení, oceněných proti oficiálním ceníkům z července 2026. Každá dolarová částka níže je reprodukovatelná: uvedené předpoklady tokenů vynásobené zveřejněnými sazbami. Naše analýza, ne tvrzení prodejců.

Podporový chatbot: 50 000 konverzací měsíčně

Průměrná konverzace: 800 vstupních tokenů (systémový prompt + zprávy uživatele + stažený kontext), 400 výstupních tokenů. Měsíční objem: 50 000 konverzací = 40M vstupních tokenů, 20M výstupních tokenů.

  • Rozpočtová volba (Gemini 2.5 Flash): 40M × $0,075/M + 20M × $0,30/M = $9 měsíčně. Podezřele levné.
  • Střední volba (Claude Sonnet 4): 40M × $3/M + 20M × $15/M = $420 měsíčně.

Pro podporového bota, který zvládá tickety první úrovně, rozpočtový model v pohodě pokryje 90 % dotazů. Těch složitých 10 % směrujte na střední třídu pomocí klasifikátoru.

RAG pipeline: 10 000 dotazů denně

Průměrný dotaz: 3 200 vstupních tokenů (stažené úryvky + systémový prompt + otázka uživatele), 600 výstupních tokenů. Měsíčně: 300K dotazů = 960M vstupních tokenů, 180M výstupních tokenů.

  • Rozpočtová volba (Llama 4 Scout přes API): 960M × $0,10/M + 180M × $0,40/M = $168 měsíčně.
  • Střední volba (GPT-4.1): 960M × $2/M + 180M × $8/M = $3 360 měsíčně.

RAG workload je těžký na vstup, takže slevy za cachovaný vstup tu tvrdě dopadají. Při 70% prompt caching klesne střední třída na ~$2 100 měsíčně.

Kódový asistent: 200 vývojářů

Průměrná relace: 4 500 vstupních tokenů (kontext souborů + konverzace), 1 200 výstupních tokenů. Počítejme 15 požadavků na vývojáře denně, 22 pracovních dní = 66 000 požadavků měsíčně = 297M vstup, 79M výstup.

  • Rozpočtová volba (Qwen 3 32B): 297M × $0,20/M + 79M × $0,80/M = $123 měsíčně.
  • Střední volba (Claude Sonnet 4): 297M × $3/M + 79M × $15/M = $2 078 měsíčně.

Vývojáři si kvalitativních mezer všimnou rychle. U kódu je střední třída obvykle spodní hranice. Rozpočtové modely fungují na našeptávání ve stylu autocomplete, ale s refaktory napříč soubory se perou.

Dávkové zpracování dokumentů: 1M dokumentů měsíčně

Průměrný dokument: 2 000 vstupních tokenů, 300 výstupních tokenů (extrakce, klasifikace, sumarizace). Měsíčně: 2B vstup, 300M výstup.

  • Rozpočtová volba (Gemini 2.5 Flash): 2B × $0,075/M + 300M × $0,30/M = $240 měsíčně.
  • Střední volba (GPT-4.1): 2B × $2/M + 300M × $8/M = $6 400 měsíčně.

Při tomto objemu je 27násobný cenový rozdíl mezi třídami položkou $6 160 měsíčně. Rozpočtové modely zvládají strukturovanou extrakci dobře. Pro dimenzování hardwaru, pokud zvažujete vlastní hosting tohoto objemu, se podívejte na požadavky na VRAM podle modelu.

WorkloadModelTokeny/požadavek (vstup/výstup)Požadavků/měsíc$/měsíc
Podporový chatbotGemini 2.5 Flash800 / 40050K$9
Podporový chatbotClaude Sonnet 4800 / 40050K$420
RAG pipelineLlama 4 Scout3 200 / 600300K$168
RAG pipelineGPT-4.13 200 / 600300K$3 360
Kódový asistentQwen 3 32B4 500 / 1 20066K$123
Kódový asistentClaude Sonnet 44 500 / 1 20066K$2 078
Dávkové dokumentyGemini 2.5 Flash2 000 / 3001M$240
Dávkové dokumentyGPT-4.12 000 / 3001M$6 400
python
def monthly_cost(input_tokens, output_tokens, requests, price_in, price_out):
    """Estimate monthly LLM inference cost.
    
    Args:
        input_tokens: avg input tokens per request
        output_tokens: avg output tokens per request
        requests: monthly request volume
        price_in: $/M input tokens
        price_out: $/M output tokens
    """
    total_in = input_tokens * requests / 1_000_000
    total_out = output_tokens * requests / 1_000_000
    return (total_in * price_in) + (total_out * price_out)

# Example: support chatbot on Claude Sonnet 4
cost = monthly_cost(
    input_tokens=800,
    output_tokens=400,
    requests=50_000,
    price_in=3.00,
    price_out=15.00
)
print(f"${cost:,.2f}/month")  # $420.00/month

API nebo vlastní hosting: kdy vyhraje které?

API vyhrává pod ~20K požadavky denně nebo když vašemu týmu chybí zkušenosti s ML infrastrukturou. Vlastní hosting vyhrává nad 200K požadavky denně při trvalém využití GPU přes 50 %. Bod zvratu podle analýzy Introl leží kolem 50-80K požadavků denně pro model třídy 70B na jednom uzlu H100. Pod touto hranicí porazí více tenantská efektivita poskytovatele API matematiku vašeho single-tenant hardwaru.

Úroveň objemuAPI $/měsícVlastní hosting $/měsíc (GPU + provoz)VítězProč
Nízká: 2K pož./den$150-$400$2 800-$4 500APIGPU leží ladem 85 % času
Střední: 20K pož./den$1 500-$4 000$3 200-$5 000API (těsně)Využití dosahuje ~40 %, stále pod bodem zvratu
Vysoká: 200K pož./den$15 000-$40 000$5 500-$8 000Vlastní hostingVyužití 70 %+ rychle amortizuje hardware

Kdy vyhrává API

Nasadíte za dny, ne za týdny. Žádný plat ML inženýra ($180K-$250K ročně), žádná on-call rotace na výpadky GPU, žádné plánování kapacity. Pro většinu týmů pod 50 inženýrů je API správná výchozí volba. Tečka.

Kdy vyhrává vlastní hosting

Překročili jste 200K požadavků denně, váš workload je předvídatelný a už zaměstnáváte lidi na ML infrastrukturu. Open-source modely (Llama 4, Qwen 3, Mistral) běží na vašem hardwaru za cenu elektřiny plus amortizace. Benchmarky vLLM vs SGLang ukazují rozdíly v propustnosti 15-30 % podle tvaru workloadu, což v tomto měřítku hraje roli.

Číslo bodu zvratu

Vlastní hosting vyhrává až nad ~50% trvalým využitím GPU. Pod ním platíte za nečinný křemík. Skryté personální náklady (čas ML inženýrů, on-call, aktualizace modelů, bezpečnostní záplaty) jsou skutečným důvodem, proč většina týmů zůstává na API, i když surová matematika GPU vypadá příznivě. Pokud přesto vlastní hosting zvolíte, nasazení modelů na Modal odstraní vrstvu správy infrastruktury a zároveň udrží náklady na token pod sazbami API.

Skryté náklady, které nikdo neplánuje

Surové výdaje za tokeny jsou 60-80 % vašeho reálného účtu. Zbytek se skrývá v šesti položkách, které se v cenové kalkulačce nikdy neobjeví. K odhadu tokenů připočtěte navrch dalších 20-40 %, abyste je pokryli.

  • Nástroje pro monitoring a observabilitu: $200-$1 500 měsíčně. Dashboards spotřeby tokenů, sledování latence, přiřazení nákladů na funkci. Observability stack pro LLM se zaplatí hned poprvé, co odchytíte regresi promptu dřív, než vám propálí rozpočet.
  • Opakování a chybné běhy: 3-8 % požadavků selže nebo potřebuje opakovat (timeouty, rate limity, zmršené výstupy). To jsou 3-8 % vašeho účtu za tokeny, utracené za nic.
  • Hodiny iterací nad prompt-engineeringem: 20-60 hodin čtvrtletně při plněném inženýrském nákladu $100-$200 za hodinu. Každá úprava promptu znovu pouští testovací dávky.
  • Eval a regresní testování: $100-$800 měsíčně v útratě za tokeny pro automatizované eval sady. Platíte modelu, aby sám sebe známkoval.
  • Víceregionová redundance: 1,5-2x náklady infrastruktury, pokud potřebujete failover mezi regiony kvůli latenci nebo compliance.
  • Penále za cold-start latenci: Serverless GPU nasazení (Modal, AWS Lambda) účtují nečinný čas. Cold start přidá 2-8 sekund a naúčtuje vám i zahřátí.

Pravidlo palce: vynásobte svůj surový odhad tokenů 1,3 pro realistický rozpočet. Vynásobte 1,4, pokud jste v regulovaném odvětví s compliance režií.

Proč LLM inference pořád zlevňuje?

Ceny LLM inference klesají zhruba 10x ročně od roku 2023. Workload, který v roce 2024 stál $1 000 měsíčně, dnes vyjde blíž ke $100. Ženou to tři síly: hardwarová vylepšení (NVIDIA Blackwell FP4, Google TPU v6), konkurenční tlak (DeepSeek, open-source modely vynucující cenové války) a softwarová optimalizace (spekulativní dekódování, kontinuální batchování, kvantizace). Gartner předpovídá, že náklady inference do roku 2030 klesnou o dalších 90 %, i když jde o projekci, ne záruku.

Sledování cen od Epoch AI dokumentuje tento pokles tvrdými datovými body. Analýza „LLMflation" od a16z razila tento termín a zarámovala ekonomické důsledky: inference defluje rychle než kterákoli předchozí výpočetní kategorie.

Náklady na trénink vs inference

Trénink špičkového modelu vyjde na $50M-$200M (jednorázově). Inference téhož modelu, napříč všemi uživateli, běží za $5M-$50M ročně podle škály. Pro většinu týmů je poměr 10-100x: trénink stojí 10-100násobek toho, co jeden rok inference. Jenže trénink je jednorázový kapitálový výdaj. Inference je opakující se provozní účet, který se s růstem uživatelů úročí. Za trénink neplatíte, pokud nestavíte základní model. Za inferenci platíte každý den.

Položka energie

NVIDIA H100 si pod zátěží bere ~700W. Při $0,10/kWh (průměr USA) je to $0,07 na GPU-hodinu. Model se 70B parametry na jedné H100 vygeneruje v dávce zhruba 2 000 výstupních tokenů za sekundu. Za jednu hodinu: 7,2M tokenů. Náklady na elektřinu na milion výstupních tokenů: ~$0,01. Náš výpočet, jako takový označený. Energie je 1-3 % vašeho účtu za API, ale 8-15 % TCO vlastního hostingu. Záleží na ní víc, pokud provozujete vlastní GPU v regionu s drahou elektřinou (Německo při $0,30/kWh toto číslo ztrojnásobí).

Praktické poučení: ceny klesají dost rychle na to, aby byl 12měsíční závazek konkrétní třídě modelu riskantní. Přehodnocujte čtvrtletně. 12 způsobů, jak snížit účet za LLM pokrývá taktické kroky, které můžete udělat hned teď, zatímco makro trend odvádí těžkou práci.

Jak odhadnete VÁŠ náklad na inferenci?

Odhadněte svůj měsíční náklad na LLM inferenci ve čtyřech krocích: spočítejte tokeny na požadavek, vynásobte měsíčním objemem, aplikujte třídní ceník a přičtěte 20-40 % režie. Podle našich zkušeností s dimenzováním rozpočtů inference pro klienty většina týmů krok čtyři přeskočí a pak se diví, proč jejich reálný účet překračuje odhad o třetinu. Tady je postup, který používáme.

  1. Spočítejte tokeny na požadavek. Zalogujte si průměrné vstupní tokeny (systémový prompt + kontext + zpráva uživatele) a výstupní tokeny (odpověď modelu) na 100 a více reálných požadavcích. Nehádejte. Měřte.
  2. Vynásobte měsíčním objemem. Požadavky/den × 30 = měsíční požadavky. Vynásobte počtem tokenů na požadavek.
  3. Aplikujte třídní ceník. Vynásobte celkové vstupní tokeny sazbou modelu $/M vstup. Stejně pro výstup. Sečtěte.
  4. Přičtěte 20-40 % režie. Opakování, evaly, iterace promptů, monitoring. Toto je číslo, které patří do vašeho rozpočtu, ne krok 3.
python
def estimate_monthly_budget(avg_input_tokens, avg_output_tokens,
                            requests_per_day, price_in, price_out,
                            overhead_pct=0.30):
    """Full monthly budget estimate with overhead."""
    monthly_requests = requests_per_day * 30
    raw_cost = monthly_cost(
        avg_input_tokens, avg_output_tokens,
        monthly_requests, price_in, price_out
    )
    return raw_cost * (1 + overhead_pct)

# RAG pipeline: 10K queries/day on GPT-4.1
budget = estimate_monthly_budget(
    avg_input_tokens=3200,
    avg_output_tokens=600,
    requests_per_day=10_000,
    price_in=2.00,
    price_out=8.00,
    overhead_pct=0.30
)
print(f"${budget:,.0f}/month")  # $4,368/month

Jakmile znáte své číslo, nástroje LLM gateway směrují provoz na nejlevnější model, který projde vaší laťkou kvality. Gateway s výběrem modelu na úrovni požadavku umí snížit váš průměrný náklad o 30-50 %, aniž byste sáhli na prompty.

O autorovi

Mert Batur je spoluzakladatel Techsy.io, kde tým nasazuje AI agenty, automatizační systémy a hlasové/SDR pipeline pro B2B klienty. Píše o stacku nástrojů LLM, který tým Techsy skutečně používá v produkci. Spojte se na LinkedIn.

Často kladené otázky

Je LLM inference drahá?

Záleží na škále a volbě modelu. Milion vstupních tokenů stojí $0,02 na Gemini 2.5 Flash nebo $75 na špičkovém uvažovacím modelu. Pro malou aplikaci zpracovávající 10K požadavků denně počítejte s $50-$400 měsíčně. Pro podnikové workloads nad 1M požadavků denně běží rozpočty na $5 000-$40 000 měsíčně. Jednotková cena je nízká; objem to nabalí.

Kolik je 1 milion tokenů v LLM?

Jeden milion tokenů odpovídá zhruba 750 000 slovům, tedy asi 10 plnohodnotným románům. V červenci 2026 stojí zpracování 1M vstupních tokenů $0,02 (rozpočtová třída) až $75 (špičková třída). Výstupní tokeny pro stejný objem běží za $0,06 až $300. Většina produkčních workloadů skončí ve střední třídě: $2-$15 za milion vstupních tokenů.

Proč je AI inference tak drahá?

Inference vyžaduje protlačit každý token miliardami parametrů modelu na GPU, z nichž každý stojí $25 000-$40 000. Fáze decode generuje tokeny sekvenčně, takže jádra GPU mezi kroky leží ladem. Platíte za specializovaný hardware, elektřinu, chlazení a inženýrský tým poskytovatele, který drží serving stack v chodu 24/7.

Klesají náklady na AI inferenci?

Ano, zhruba 10x ročně od roku 2023. GPT-4 startoval na $30/$60 za milion tokenů (vstup/výstup). Ekvivalentní schopnost dnes stojí $2-$10. Data Epoch AI potvrzují tuto trajektorii napříč všemi poskytovateli. Gartner předpovídá do roku 2030 další pokles o 90 %, tažený hardwarovými vylepšeními a konkurenčním tlakem open-source modelů.

Kolik stojí LLM inference v roce 2026?

Rozpočtové modely: $0,02-$0,30 za milion vstupních tokenů. Střední třída: $0,55-$15. Špičková: $15-$75. Typický produkční workload (podporový chatbot, RAG pipeline nebo kódový asistent) stojí na modelech střední třídy $150-$4 000 měsíčně. Rozpočtové modely zvládnou hromadné, málo složité úlohy za 10-30x méně.

Jaký je rozdíl mezi náklady na trénink a inferenci?

Trénink je jednorázový výdaj za naučení modelu od nuly: $50M-$200M za špičkový model, vyžadující tisíce GPU po měsíce. Inference je opakující se náklad za používání toho natrénovaného modelu: proháníte jí vstupy, abyste dostali výstupy, účtováno po tokenech. Pro většinu týmů je inference jediný účet, který platí. Trénink je pro firmy stavějící základní modely.

Jak spočítám náklad na LLM inferenci pro svou aplikaci?

Vynásobte průměrné vstupní tokeny na požadavek svým měsíčním objemem požadavků a pak sazbou modelu $/M vstup. Zopakujte pro výstupní tokeny. Obojí sečtěte. Přičtěte 30 % na opakování, evaly a monitoring. Python snippety v tomto článku matematiku automatizují. Měřte reálné počty tokenů, místo abyste hádali; logy ze 100 a více požadavků dají spolehlivý průměr.

Stojí výstupní tokeny víc než vstupní?

Ano, typicky 3-5x víc. Zpracování vstupu (prefill) paralelizuje napříč všemi tokeny současně a plně využívá jádra GPU. Generování výstupu (decode) produkuje jeden token po druhém, přičemž každý závisí na předchozím. GPU mezi kroky čeká na paměťovou propustnost. Poskytovatelé oceňují výstup výš, aby zohlednili tuto nižší hardwarovou efektivitu.

Je vlastní hosting inference levnější než použití API?

Jen nad ~200K požadavky denně při trvalém využití GPU přes 50 %. Pod ním porazí více tenantská efektivita poskytovatelů API váš single-tenant hardware. Vlastní hosting navíc přidává skryté náklady: platy ML inženýrů ($180K-$250K ročně), on-call rotace, aktualizace modelů a bezpečnostní záplaty. Většina týmů pod 50 inženýrů by měla zůstat na API.

Spotřebuje LLM inference hodně energie?

GPU H100 si pod zátěží bere ~700W. Při $0,10/kWh je to $0,07/GPU-hodinu, což u modelu se 70B parametry odpovídá zhruba $0,01 na milion výstupních tokenů. Energie je 1-3 % účtu za API, ale 8-15 % TCO vlastního hostingu. V regionech s drahou elektřinou (Německo, $0,30/kWh) se podíl energie ztrojnásobí a materiálně ovlivní ekonomiku vlastního hostingu.

Shrnutí

Čtyři čísla, která si zapamatovat: $0,02 (rozpočtová spodní hranice za milion vstupních tokenů), 3-5x (prémie výstupu vůči vstupu), 20-40 % (režie, kterou přičíst k surové matematice tokenů) a 10x (roční pokles cen od roku 2023). Váš reálný účet závisí na objemu, třídě modelu a na tom, jak agresivně cachujete, batchujete a směrujete provoz.

V Techsy náš tým dimenzuje rozpočty inference a vybírá třídy modelů pro B2B klienty provozující produkční LLM workloads. Pokud chcete druhý pár očí na svůj nákladový model, získejte bezplatnou konzultaci.

Štítky

cena LLM inferencecenotvorba LLM inferencecena za milion tokenůvyužití GPUvlastní hosting inference

Sdílet článek

Začněte svůj projekt

Pojďme něco postavit nevšedního?

Proměňme vaši vizi ve skutečnost. Náš tým je připraven vám pomoct vytvořit software, který dělá rozdíl.