Kalkulačka nákladů na API OpenAI, Claude a Gemini
Porovnejte měsíční náklady napříč poskytovateli s využitím úspor z ukládání a dávkového zpracování.
Ceny API pro GPT, Claude a Gemini se pohybují od 0,15 do 75 USD za milion vstupních tokenů, přičemž výstupní tokeny bývají 3–5× dražší. Při 10 milionech tokenů měsíčně vyjde GPT-4o zhruba na 775 USD, Claude Sonnet 4 na 1 140 USD a Gemini 2.5 Pro na 825 USD. Prompt caching snižuje náklady na cachované tokeny 10×; Batch API snižuje náklady o 50 % u úloh bez požadavku na okamžitou odezvu. Tato kalkulačka vám umožní přesně namodelovat využití napříč všemi třemi poskytovateli.
Vaše vstupy
05 fieldsKdo by měl tento nástroj používat
Zakladatelé definující rozsah projektu openai api před konzultacemi s dodavateli. CTOs a technologičtí lídři budující roční rozpočet na vývoj nových produktů. Product manažeři převádějící jednorázový nápad na udržitelný rozpočtový rámec pro finance. Nákupní týmy ověřující nabídky agentur a freelancerů.
Jak počítáme
Ceny vycházejí z veřejně uvedených ceníků OpenAI, Anthropic a Google k roku 2026. Cachování promptů se vztahuje pouze na cachované vstupní tokeny (typicky systémový prompt + stabilní kontext). Batch API se vztahuje na vstupní i výstupní tokeny u úloh bez požadavku na reálný čas, s 24hodinovým SLA.
Zdroje dat
Co cenu ovlivňuje
Výběr tieru modelu
Špičkové modely jako GPT-4.5, Claude Opus 4 a Gemini 2.5 Pro jsou 5× až 10× dražší za token než jejich protějšky ze střední třídy. Používejte je jen na náročné úlohy vyžadující hluboké uvažování, kde střední třída opravdu selhává: složitá vícekroková logika, matematika, nejednoznačné generování kódu nebo úlohy vyžadující hluboké znalosti o světě. Všechno ostatní směrujte na Claude Sonnet 4, GPT-4o nebo Gemini Flash. Cenový rozdíl je tak velký, že chytré směrování u smíšených úloh obvykle sníží náklady o 60 až 80 %.
Mezipaměť promptů
Anthropic cachuje vstupní tokeny na 5 minut zdarma nebo na 1 hodinu s 25% příplatkem, čímž snižuje náklady na cachované tokeny zhruba o 90 %. OpenAI na některých endpointech cachuje automaticky na 5 až 10 minut bez nutnosti konfigurace. Cachování funguje nejlépe, když má systémový prompt přes 2K tokenů a je stabilní napříč požadavky, což platí pro většinu produkčních chatbotů a RAG systémů. Největší úspory přináší u úloh s dlouhým stabilním kontextem a velkým počtem požadavků za minutu.
Dávkové API
OpenAI i Anthropic nabízejí batch endpointy s přesně 50% slevou ze standardní ceny výměnou za 24hodinové SLA. Batch je ideální pro klasifikaci, generování embeddingů, sumarizaci, evaluační běhy a jakékoli zpracování na pozadí. Integrace je triviální: stejný model, stejný prompt, jiný endpoint a fronta, ve které se čeká na výsledky. Většina týmů batch přehlíží a platí plnou cenu za úlohy bez požadavku na reálný čas, což je jeden z nejsnáze odstranitelných nákladů na AI.
Počet výstupních tokenů
Výstupní tokeny jsou u všech poskytovatelů 3× až 5× dražší než vstupní tokeny a většina odpovědí nepotřebuje výstupní buffer o velikosti 4K tokenů, který API ve výchozím nastavení povoluje. Pokud extrahujete odpověď ano/ne, omezte výstup na 10 tokenů. Pokud generujete krátké shrnutí, omezte ho na 200. Model často chce vysvětlovat své uvažování, i když jste o to nežádali, a vy za tato vysvětlení platíte. Přísnější nastavení max_tokens často sníží náklady na výstup o 30 až 50 % bez dopadu na kvalitu.
Široké kontextové okno neznamená vyšší cenu
Všichni velcí poskytovatelé účtují za spotřebované tokeny, ne za velikost kontextového okna. Použít 200K kontextové okno na prompt o 5K tokenech stojí naprosto stejně jako použít 5K kontextové okno na prompt o 5K tokenech. Z toho plyne, že modely s dlouhým kontextem nejsou "dražší na používání", pokud kontext skutečně nezaplníte. Vybírejte model podle schopností a ceny za token, ne podle toho, které kontextové okno je největší.
Jak snížit náklady
Jako první optimalizaci zapněte cachování promptů, ještě před čímkoli jiným. U Anthropic označte stabilní systémový prompt hlavičkami cache_control a cachované tokeny vyjdou zhruba na 10 % standardní ceny vstupu. U OpenAI cachování probíhá automaticky na určitých endpointech, pokud je prefix promptu ve všech požadavcích stejný. Největší přínos má u workloadů s dlouhým stabilním kontextem a velkým počtem požadavků: chatboti s propracovanými personami, RAG systémy s opakujícím se kontextem vyhledávání a jakákoli agentská smyčka, která opakovaně posílá dlouhou sadu instrukcí. Většina týmů na zapnutí cachování zapomíná a přeplácí 5× až 10×.
Všechny workloady mimo reálný čas přesuňte do Batch API. Anthropic i OpenAI nabízejí batch endpointy za přesně 50 % standardní ceny, výměnou za 24hodinové SLA na odpověď. Klasifikační úlohy, moderování obsahu, generování embeddingů, sumarizační pipeliny i evaluační běhy — to vše jsou vhodní kandidáti. Integrační práce je triviální, protože prompt a model zůstávají beze změny. Týmy běžně pouští celé pipeline na tagování obsahu za standardní ceny, přitom batch by snížil účet na polovinu s nulovým rozdílem v kvalitě.
Směrujte požadavky podle náročnosti. Jednoduché dotazy (pozdravy, formátování, základní vyhledávání) patří na GPT-4o mini, Claude Haiku nebo Gemini Flash za 0,15 až 0,80 $ za milion vstupních tokenů. Náročné uvažování patří na Claude Opus, GPT-4.5 nebo Gemini Pro za 1,25 až 75 $ za milion. Malý klasifikátor před routerem modelů typicky sníží náklady u smíšených workloadů o 60 až 80 %. Posílat všechno na frontier model je nejčastější chyba v nákladech na AI, kterou v produkci vídáme.
Agresivně zastropujte max_tokens. Výstupní tokeny stojí 3× až 5× více než vstupní a výchozí 4K buffer pro výstup je mnohem větší, než většina odpovědí potřebuje. Odpovědi ano/ne omezte na 10 tokenů, krátká shrnutí na 200 a strukturovaný JSON na to, co vyžaduje vaše schéma, plus malou rezervu. Model se občas rozepíše, i když jste o to nežádali, a vy za tu výřečnost platíte. Přísnější limit max_tokens ve většině případů znamená snížení nákladů na výstup o 30 až 50 %.
Ořežte načtený kontext jen na to, co daný dotaz potřebuje. RAG systémy často načtou 10 až 20 chunků a pro jistotu je všechny nacpou do promptu. Výsledkem je, že platíte za tisíce irelevantních tokenů na každý požadavek. Přidání rerankeru, který výběr zúží na 3 až 5 nejrelevantnějších chunků, typicky sníží spotřebu vstupních tokenů o 50 až 70 % bez ztráty kvality — a často se kvalita dokonce zlepší, protože model nerozptyluje irelevantní kontext.
Logujte každý požadavek s počtem tokenů, modelem a stavem cachováno vs. necachováno. Co nevidíte, to nemůžete optimalizovat — a náklady na AI mohou přes noc změnit podobu, když vyjde nová funkce nebo se doladí prompt. Nastavte si denní alerty na útratu. Postavte si dashboard, který útratu člení podle funkce, modelu a endpointu. Většina překročení nákladů v produkci, se kterými se setkáváme, vzniká proto, že se vzorec používání změnil dva týdny předtím, než se někdo podíval na účet.
Cena za milion tokenů (ceník 2026)
| Model | Vstup | Výstup | Mezipaměť vstupu |
|---|---|---|---|
| GPT-4.5 | $75,00 | $150,00 | $37,50 |
| GPT-4o | $2,50 | $10,00 | $1,25 |
| GPT-4o mini | $0,15 | $0,60 | $0,075 |
| Claude Opus 4 | $15,00 | $75,00 | $1,50 |
| Claude Sonnet 4 | $3,00 | $15,00 | $0,30 |
| Claude Haiku 4 | $0,80 | $4,00 | $0,08 |
| Gemini 2.5 Pro | $1,25 | $10,00 | N/A |
| Gemini 2.5 Flash | $0,075 | $0,30 | N/A |
Časté dotazy
Otázky, které dostáváme každý týden
Stručné odpovědi srozumitelnou řečí. Pokud svou otázku nenajdete,
GPT-4o: 2,50 USD za milion vstupních tokenů, 10 USD za milion výstupních tokenů. GPT-4o mini: 0,15 USD/M vstup, 0,60 USD/M výstup. GPT-4.5: 75 USD/M vstup, 150 USD/M výstup. Při 10 milionech tokenů měsíčně s poměrem vstupu a výstupu 30/70 počítejte s 25 USD až 13 000 USD podle modelu.
Pro většinu úloh: GPT-4o mini, Gemini 2.5 Flash nebo Claude Haiku 4; všechny pod 1 USD za milion vstupních tokenů. Pro vyvážený poměr kvality a ceny: Claude Sonnet 4 nebo Gemini 2.5 Pro.
Anthropic a OpenAI ukládají velké vstupní prompty mezi jednotlivými požadavky do mezipaměti. Cachované tokeny stojí přibližně o 90 % méně než necachované. Ideální pro chatboty se stabilními systémovými prompty nebo RAG se stabilním kontextem.
Přesně 50 % na vstupních i výstupních tokenech. Vyžaduje souhlas s 24hodinovým SLA. Vhodné pro klasifikaci, sumarizaci, embeddingy a evaluace. Nevhodné pro real-time chat nebo interaktivní UX.
U srovnatelných úrovní kvality jsou náklady podobné. Claude Sonnet 4 versus GPT-4o: zhruba nastejno. Claude Opus 4 s ukládáním promptů do mezipaměti vychází u úloh se stabilními prompty přibližně o 30 % levněji než GPT-4o.
(1) Zapněte prompt caching. (2) Kde je to možné, používejte Batch API. (3) Jednoduché dotazy směrujte na mini modely. (4) Agresivně omezujte max_tokens. (5) Omezte kontext z vyhledávání jen na to nejnutnější.
Bod zvratu se pohybuje kolem 5 000 USD měsíčně v nákladech na API. Pod touto hranicí: dál používejte API. Nad ní: self-hosting modelů Llama 3.1 nebo Mistral snižuje náklady o 50–70 %, pokud máte odborné znalosti v oblasti infrastruktury.
Vezměte reprezentativní vzorek 100 požadavků. Změřte průměrný počet vstupních a výstupních tokenů. Vynásobte tento průměr měsíčním objemem požadavků. Vynásobte výsledek cenou za milion tokenů. Připočtěte 30% rezervu.
Pouze pro náročné uvažování, kde modely střední třídy selhávají. Pro 80 % produkčních úloh bohatě stačí Sonnet 4, GPT-4o nebo Gemini 2.5 Pro, a to s 10× nižšími náklady.
U typických úloh se odchylka pohybuje do ±15 %. V reálu se výsledky liší kvůli různě dlouhým promptům a výstupům, chybovým smyčkám a opakování pokusů a směrovací logice. Používejte kalkulačku jako plánovací nástroj, ne jako konečný účet.
Podobné nástroje
Další kalkulačky, které si lidé otevřou hned poté; vyberte tu, která nejlépe odpovídá vašemu dalšímu rozhodnutí.
Náklady na vývoj plus měsíční provoz; kompletní přehled.
Získejte přesnou kalkulaci od našeho týmu
Kalkulačky vám dají rozmezí cen. 30minutový hovor vám přinese pevně stanovený rozsah, harmonogram i rozpočet. Konzultace zdarma a bez závazků.
Zahájit konverzaci