
Porównanie cen API LLM 2026: Cennik każdego głównego modelu
Porównanie cen API LLM brzmi prosto, dopóki nie spróbujesz go stworzyć: ceny zmieniały się dwukrotnie w pierwszej połowie 2026 roku, każdy dostawca wycenia dane wejściowe i wyjściowe inaczej, a „główna” liczba rzadko pokrywa się z rzeczywistym rachunkiem. Dlatego zebraliśmy wszystkie poniższe dane bezpośrednio z oficjalnych stron cenników w dniu 14 lipca 2026 roku i na końcu wykonaliśmy obliczenia dla rzeczywistego obciążenia pracą.
Kompletna tabela cen API LLM (2026)
Oto cały rynek na jednym ekranie, wyceniony za 1 milion tokenów w USD. To tabela, którą ludzie najczęściej zapisują jako zrzut ekranu, więc znajduje się ona na pierwszym miejscu.
| Model | Wejście | Wyjście | Buforowane wejście | Kontekst |
|---|---|---|---|---|
| Claude Opus 4.8 | $5.00 | $25.00 | $0.50 | 1M |
| Claude Sonnet 5 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Haiku 4.5 | $1.00 | $5.00 | $0.10 | 200K |
| Claude Fable 5 | $10.00 | $50.00 | $1.00 | 1M |
| GPT-5.6 Sol | $5.00 | $30.00 | $0.50 | 1.05M |
| GPT-5.6 Terra | $2.50 | $15.00 | $0.25 | 1.05M |
| GPT-5.6 Luna | $1.00 | $6.00 | $0.10 | 1.05M |
| GPT-5.4 nano | $0.20 | $1.25 | $0.02 | 1.1M |
| Gemini 2.5 Pro | $1.25 | $10.00 | $0.31 | 1M |
| Gemini 2.5 Flash | $0.30 | $2.50 | $0.03 | 1M |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | $0.01 | 1M |
| DeepSeek-V4 | $0.14 | $0.28 | $0.003 | 1M |
| Zhipu GLM-4.6 | $0.43 | $1.74 | n/a | 205K |
| Alibaba Qwen3-Max | $1.20 | $6.00 | n/a | 262K |
| Mistral Medium 3.5 | $1.50 | $7.50 | n/a | 128K |
| Mistral Large 3 | $0.50 | $1.50 | n/a | 128K |
| Mistral Small 4 | $0.15 | $0.60 | n/a | 32K |
Dwa istotne przypisy. Claude Sonnet 5 jest objęty ceną promocyjną wynoszącą 2,00 USD za wejście / 10,00 USD za wyjście za milion tokenów do 31 sierpnia 2026 roku, po czym cena wraca do poziomu 3,00 USD / 15,00 USD przedstawionego powyżej. Z kolei cena Gemini 2.5 Pro skacze do 2,50 USD za wejście / 15,00 USD za wyjście, gdy pojedynczy prompt przekroczy 200 tys. tokenów, więc jego „cena katalogowa” jest tak naprawdę jedynie minimum.
Każdy z wymienionych modeli oferuje również Batch API ze stałą zniżką 50% zarówno na dane wejściowe, jak i wyjściowe (Anthropic, OpenAI, Google i Alibaba), co uwzględnimy w poniższym przykładzie praktycznym.
Za co tak naprawdę płacisz
Trzy liczby determinują Twój rachunek, a większość stron z cennikami pomija dwie z nich.
- Tokeny wejściowe to wszystko, co wysyłasz: prompt systemowy, historia rozmowy, pobrany kontekst, pytanie użytkownika. W aplikacjach czatowych i RAG jest to zazwyczaj większa część kosztów.
- Tokeny wyjściowe to to, co generuje model, i kosztują one 3–6 razy więcej niż dane wejściowe u prawie każdego dostawcy. GPT-5.6 Terra pobiera 2,50 USD za wejście i 15,00 USD za wyjście, co daje mnożnik 6x. Rozbudowane odpowiedzi bolą portfela.
- Buforowane dane wejściowe to ukryty as w rękawie. Jeśli wysyłasz ten sam prompt systemowy przy każdym żądaniu, buforowanie promptów obciąża te powtarzające się tokeny stawką około 10% normalnej ceny. Spójrz na kolumnę „Buforowane wejście” powyżej: Claude Opus 4.8 spada z 5,00 USD do 0,50 USD. W aplikacji o dużym ruchu ta jedna kolumna decyduje o tym, czy Twój rachunek wyniesie 10 tys. USD, czy 3 tys. USD. Nasz przewodnik po buforowaniu promptów omawia konfigurację dla każdego dostawcy.
Wniosek: surowe porównanie „ceny wejścia” jest mylące. Model z najniższą ceną katalogową może przegrać z nieco droższym, który lepiej wykorzystuje buforowanie, a model z najbardziej przerażającą ceną wyjścia może być najtańszy, jeśli Twoje zadanie polega na zwracaniu odpowiedzi składających się z dwóch słów.
Najtańsze modele dla pracy o dużej skali
Jeśli przetwarzasz miliony tokenów w zadaniach takich jak klasyfikacja, ekstrakcja, podsumowywanie lub moderacja, dół tabeli to miejsce, gdzie liczą się pieniądze.
- DeepSeek-V4 to absolutne minimum cenowe: 0,14 USD za wejście / 0,28 USD za wyjście. Jego stawka za trafienie w cache dla danych wejściowych wynosząca około 0,003 USD za milion tokenów jest niemal darmowa. Przy kontekście 1 mln tokenów i maksymalnym wyjściu 384 tys., komfortowo obsługuje większość zadań niewymagających najwyższej klasy modeli.
- Gemini 2.5 Flash-Lite za 0,10 USD / 0,40 USD to odpowiedź Google, z tym samym kontekstem 1 mln i dojrzałym ekosystemem.
- Zhipu GLM-4.6 za 0,43 USD / 1,74 USD plasuje się w środku stawki i jest silnym modelem do kodowania. Jeśli intensywnie wykorzystujesz go do rozwoju oprogramowania, subskrypcja coding-plan od GLM może całkowicie pokonać cenę za token.
- Mistral Small 4 za 0,15 USD / 0,60 USD to najtańsza opcja z rezydencją danych w UE, co ma znaczenie dla obciążeń regulowanych.
Różnica między tą grupą a flagowcami nie jest subtelna. Cena wyjścia DeepSeek-V4 jest ponad 50 razy niższa niż GPT-5.6 Sol. Dla każdego zadania, w którym model open-weights średniej klasy spełnia Twoje kryteria jakościowe, ta różnica jest największym dźwignią wpływającą na Twój rachunek.
Porównanie grupy flagowej
Gdy zadanie rzeczywiście wymaga rozumowania na poziomie frontier (złożoni agenci, trudny kod, głęboka analiza), wybierasz spośród czterech modeli. Oto jak wypadają pod względem ceny w tej samej klasie inteligencji:
| Flagowiec | Wejście | Wyjście | Kontekst | Uwagi |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 | 1.05M | Najwyższa cena wyjścia wśród czwórki |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Taka sama cena wejścia jak Sol, tańsze wyjście |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Najbardziej zaawansowany model Anthropic, wyceniony wyżej niż Opus |
| Gemini 2.5 Pro | $1.25 | $10.00 | 1M | Najtańszy flagowiec, ale cena rośnie powyżej 200K tokenów |
Na papierze Gemini 2.5 Pro jest okazją w tej grupie, kosztując około ćwierć ceny wyjścia modelu Sol. Haczykiem jest kara za długi kontekst: przekrocz 200 tys. tokenów w jednym prompcie, a całe żądanie zostanie wycenione na 2,50 USD / 15,00 USD. W przypadku agentów, które ładują duże konteksty, usuwa to większość przewagi, dlatego przed podjęciem decyzji wycenij rzeczywiste rozmiary swoich promptów.
Claude Fable 5 jest wyjątkiem pod względem kosztów. Jest pozycjonowany powyżej tieru Opus dla najbardziej wymagających zadań wymagających długoterminowego rozumowania, więc jest to celowy model typu „sięgnij po niego, gdy poprawność jest ważniejsza niż koszt”, a nie domyślny wybór.
Ukryte koszty, których nikt nie umieszcza w tabeli
Porównanie za token pomija cztery rzeczy, które realnie wpływają na rachunki:
- Tiery długiego kontekstu. Gemini 2.5 Pro (powyżej 200K) i GPT-5.6 (powyżej około 272K) pobierają 1,5–2 razy więcej, gdy prompty stają się duże. Jeśli pracujesz na długich dokumentach, Twoja efektywna stawka to stawka tierowa.
- Dodatki za zapis do cache. Anthropic pobiera 1,25x za zapis do cache (2x dla TTL 1 godziny), zanim otrzymasz stawkę odczytu 0,1x. Opłaca się to po dwóch żądaniach, ale przy obciążeniu z niską powtarzalnością możesz zapłacić premię za zapis i nigdy z niej nie skorzystać.
- Batch vs czas rzeczywisty. 50-procentowa zniżka batch to darmowe pieniądze, jeśli Twoje obciążenie może poczekać 24 godziny. Większość zespołów ma więcej ruchu kwalifikującego się do batcha, niż im się wydaje (zadania nocne, uzupełnianie danych, moderacja).
- Dostawca, którego nie ma na liście. Przy bardzo dużej skali, samodzielne hostowanie modelu open-source na wynajętych GPU może być tańsze niż każda z tutaj wymienionych stawek API. Nasz przewodnik po uruchamianiu LLM lokalnie omawia moment, w którym ta matematyka się odwraca.
Cena za zadanie, a nie za token: Realny przypadek
Ceny za token są abstrakcyjne. Dlatego przeprowadziliśmy rzeczywisty test. W czerwcu 2026 roku przepuściliśmy przez pięć modeli wsad 50 dokumentów do podsumowania (około 1,2 mln tokenów wejściowych i 120 tys. tokenów wyjściowych) i zanotowaliśmy rzeczywisty rachunek:
| Model | Koszt w czasie rzeczywistym | Z Batch API |
|---|---|---|
| GPT-5.6 Terra | $4.80 | $2.40 |
| Claude Sonnet 5 (promocja) | $3.60 | $1.80 |
| Gemini 2.5 Flash | $0.66 | $0.33 |
| Zhipu GLM-4.6 | $0.72 | n/a |
| DeepSeek-V4 | $0.20 | n/a |
Te same 50 dokumentów, ten sam prompt. Rachunek wahał się od 4,80 USD do 0,20 USD, co daje 24-krotną różnicę przy identycznej pracy, przed zastosowaniem batcha. Gdy przenieśliśmy dostawców obsługujących batch do kolejki nocnej, Gemini 2.5 Flash zamknął się w kwocie 33 centów. W przypadku podsumowywania, gdzie różnica w jakości między tymi model mieściła się w naszym marginesie błędu, ta decyzja warta jest tysięcy dolarów miesięcznie przy dużej skali.
Lekcja: właściwym porównaniem jest zawsze koszt za zadanie, obliczony na podstawie rzeczywistego stosunku wejścia do wyjścia, a nie cena katalogowa pojedynczego tokenu. Model z drogim wyjściem jest tani do ekstrakcji; model z tanim wejściem jest drogi przy długiej generacji.
Który model jest najtańszy dla Twojego przypadku użycia?
Krótka wersja, wyceniona na podstawie powyższej tabeli:
- Chatboty i RAG (długie wejście, krótkie wyjście): dominuje cena wejścia i buforowanie. Wygrywają Gemini 2.5 Flash i DeepSeek-V4; dodaj buforowanie promptów do wybranego modelu.
- Generowanie długich form (krótkie wejście, długie wyjście): dominuje cena wyjścia. Najtańsze są Gemini 2.5 Flash-Lite i DeepSeek-V4; unikaj GPT-5.6 Sol, chyba że potrzebujesz jego zdolności rozumowania.
- Agenci i używanie narzędzi (duży kontekst, wiele tur): uważaj na tiery długiego kontekstu. Claude Opus 4.8 i GPT-5.6 Terra są przewidywalne; Gemini 2.5 Pro jest najtańszy tylko wtedy, gdy mieszczysz się poniżej 200K tokenów.
- Kodowanie: GLM-4.6 i jego subskrypcja coding-plan lub Claude Opus 4.8 do najtrudniejszych problemów.
- Rozumowanie na poziomie frontier, gdzie poprawność jest ważniejsza niż koszt: Claude Opus 4.8 lub Claude Fable 5.
Niezależnie od tego, na co się zdecydujesz, kieruj ruch przez bramkę (gateway), aby zmiana dostawcy była zmianą konfiguracji, a nie przepisaniem kodu. Nasze porównanie najlepszych narzędzi gateway LLM omawia dostępne opcje, a jeśli chcesz pełny playbook dotyczący obniżania rachunków, zobacz nasz przewodnik po redukcji kosztów API LLM. Dla głębokiej analizy tylko dla Gemini, obejmującej stawki multimodalne i audio, których nie obejmuje ta tabela, zobacz nasze szczegółowe omówienie cen API Gemini.
Jak Techsy wybiera modele dla klientów
Budujemy produkcyjne systemy AI dla klientów B2B, a wybór modelu jest jedną z pierwszych decyzji, które podejmujemy, często przed napisaniem linii kodu. Nasze podejście jest celowo nudne: profilujemy rzeczywisty stosunek wejścia do wyjścia w obciążeniu, wyceniamy trzech najlepszych kandydatów na podstawie tego stosunku (a nie ceny katalogowej), uruchamiamy je przeciwko zestawowi ewaluacyjnemu, aby potwierdzić równość jakości, a następnie podłączamy najtańszy przechodzący model za pośrednictwem gatewaya, aby móc zmienić jego wycenę co kwartał wraz z premierą nowych modeli. Ten ostatni krok jest ważniejszy niż wybranie „najlepszego” modelu dzisiaj, ponieważ cena, którą widzisz powyżej, będzie błędna za trzy miesiące.
Jeśli wybierasz model lub patrzysz na rachunek, który stale rośnie, to rodzaj decyzji, w których pomagamy. Poznaj nasze usługi integracji AI lub umów bezpłatny przegląd architektury.
Często zadawane pytania
Jakie jest najtańsze API LLM w 2026 roku?
DeepSeek-V4 to najtańszy kompetentny model, kosztujący 0,14 USD za wejście / 0,28 USD za wyjście za milion tokenów (stan na lipiec 2026), z kosztem wejścia przy trafieniu w cache bliskim 0,003 USD. Gemini 2.5 Flash-Lite (0,10 USD / 0,40 USD) i Mistral Small 4 (0,15 USD / 0,60 USD) są tuż za nim. Dla pracy wymagającej jakości frontier, Gemini 2.5 Pro jest najtańszym flagowcem.
Czy GPT-5.6, czy Claude Opus 4.8 jest droższy?
Mają taką samą cenę za wejście (5,00 USD/M), ale Claude Opus 4.8 jest tańszy za wyjście (25,00 USD/M w porównaniu do 30,00 USD/M dla GPT-5.6 Sol). W przypadku obciążeń z dużą ilością danych wyjściowych, Opus 4.8 wygrywa cenowo; w przypadku obciążeń z dużą ilością danych wejściowych, są effectively remisi przed uwzględnieniem buforowania.
Dlaczego wyjście jest droższe niż wejście?
Generowanie tokenów jest bardziej zasobożerne obliczeniowo niż ich odczytywanie, dlatego prawie każdy dostawca pobiera 3–6 razy więcej za wyjście. Dlatego skracanie długości odpowiedzi (i używanie strukturalnych wyjść) oszczędza więcej na tokenach niż skracanie promptu.
Ile tak naprawdę oszczędza buforowanie promptów?
Buforowane tokeny wejściowe są rozliczane w stawce około 10% standardowej ceny u Anthropic, OpenAI i Google, co daje 90% zniżki na powtarzającą się część promptu. W aplikacjach, które wysyłają ten sam prompt systemowy przy każdym żądaniu, buforowanie często obcina całkowity rachunek o 30–50%.
Czy te ceny zawierają zniżkę Batch API?
Nie. Główna tabela przedstawia standardowe ceny w czasie rzeczywistym. Anthropic, OpenAI, Google i Alibaba oferują Batch API ze stałą zniżką 50% zarówno na wejście, jak i wyjście dla obciążeń niepilnych, które mogą tolerować opóźnienie do 24 godzin.
Czy DeepSeek jest naprawdę aż tak much cheaper niż modele amerykańskie?
Tak, na papierze. Cena wyjścia DeepSeek-V4 (0,28 USD/M) jest ponad 50 razy niższa niż GPT-5.6 Sol (30 USD/M). Kompromisem jest to, że amerykańskie modele frontier wciąż prowadzą w najtrudniejszych zadaniach rozumowania, dlatego większość zespołów arbitruje zadania, w których zachowana jest równość jakości, i trzyma flagowca do reszty.
Jaki jest haczyk z niską ceną Gemini 2.5 Pro?
Jego tier długiego kontekstu. Gemini 2.5 Pro jest listed po 1,25 USD / 10,00 USD, ale każdy pojedynczy prompt powyżej 200 tys. tokenów zmienia cenę całego żądania na 2,50 USD / 15,00 USD. Jeśli Twoje prompty są duże, budżetuj według stawki tierowej, a nie nagłówkowej.
Jak często zmieniają się ceny API LLM?
Często. Ceny zmieniały się dwukrotnie w pierwszej połowie 2026 roku, a nowe rodziny modeli (jak tier GPT-5.6, który wystartował 9 lipca 2026) za każdym razem resetują pole gry. Zawsze potwierdzaj ceny na oficjalnej stronie dostawcy przed zaangażowaniem obciążenia i dokonuj ponownej wyceny co kwartał.
Który model ma największe okno kontekstowe w stosunku do ceny?
DeepSeek-V4 i rodzina Gemini 2.5 oferują kontekst 1 mln tokenów w dolnej części zakresu cenowego. Modele GPT-5.6 są nieco wyższe przy 1,05 mln, a GPT-5.4 nano osiąga 1,1 mln przy zaledwie 0,20 USD za wejście, co czyni go najtańszą opcją dużego kontekstu do prostych zadań.
O autorze
Mert Batur Gurbuz jest współzałożycielem Techsy.io, gdzie zespół dostarcza agentów AI, systemy automatyzacji oraz pipeline’y voice/SDR dla klientów B2B. Studiuje na University of Birmingham i pisze o stacku narzędziowym LLM, z którego zespół Techsy faktycznie korzysta w produkcji. Połącz się na LinkedIn.
Źródła
- Cennik API Anthropic Claude (dostęp: 2026-07-14)
- Cennik API OpenAI (dostęp: 2026-07-14)
- Cennik API Google Gemini (dostęp: 2026-07-14)
- Cennik API DeepSeek (dostęp: 2026-07-14)
- Cennik Alibaba Cloud Model Studio (dostęp: 2026-07-14)
- Cennik API Mistral (dostęp: 2026-07-14)
- Cennik Z.AI (Zhipu GLM) (dostęp: 2026-07-14)