Kalkulator kosztów API OpenAI, Claude i Gemini
Porównaj miesięczne koszty u różnych dostawców, uwzględniając oszczędności dzięki cache’owaniu i batchowi.
Koszty API dla GPT, Claude i Gemini wynoszą od 0,15 do 75 dolarów za milion tokenów wejściowych, a tokeny wyjściowe są zwykle 3–5 razy droższe. Przy 10 milionach tokenów miesięcznie GPT-4o kosztuje około 775 dolarów, Claude Sonnet 4 około 1140 dolarów, a Gemini 2.5 Pro około 825 dolarów. Buforowanie promptów obniża koszt buforowanych tokenów 10-krotnie, a Batch API tnie koszty o 50% w zadaniach niewymagających czasu rzeczywistego. Ten kalkulator pozwala precyzyjnie modelować zużycie u wszystkich trzech dostawców.
Twoje dane
05 fieldsDla kogo jest to narzędzie
Założyciele planujący projekt openai api przed rozmowami z dostawcami. CTO i liderzy inżynierii budujący roczny budżet na nowy produkt. Product managerowie zamieniający jednozdaniową ideę w uzasadniony zakres kosztów dla działu finansów. Zespoły zakupowe weryfikujące oferty agencji i freelancerów.
Jak obliczamy koszty
Ceny oparte na publicznie dostępnych stawkach OpenAI, Anthropic i Google z 2026 roku. Buforowanie promptów dotyczy wyłącznie buforowanych tokenów wejściowych (zazwyczaj prompt systemowy + stabilny kontekst). Batch API obejmuje zarówno tokeny wejściowe, jak i wyjściowe w przypadku pracy w czasie nierzeczywistym z 24-godzinnym SLA.
Źródła danych
Co wpływa na finalną kwotę
Wybór warstwy modelu
Modele klasy frontier, takie jak GPT-4.5, Claude Opus 4 i Gemini 2.5 Pro, są od 5 do 10 razy droższe za token niż ich odpowiedniki średniej klasy. Korzystaj z modeli frontier wyłącznie do trudnych zadań wymagających rozumowania, w których modele średniej klasy rzeczywiście zawodzą: złożona logika wieloetapowa, matematyka, niejednoznaczne generowanie kodu lub zadania wymagające głębokiej wiedzy o świecie. Wszystko inne kieruj do Claude Sonnet 4, GPT-4o lub Gemini Flash. Różnica w kosztach jest na tyle duża, że inteligentny routing zazwyczaj pozwala obniżyć wydatki o 60–80% w przypadku obciążeń mieszanych.
Cache’owanie promptów
Anthropic buforuje tokeny wejściowe na 5 minut za darmo lub na 1 godzinę z 25% dopłatą, obniżając koszt buforowanych tokenów o około 90%. OpenAI buforuje automatycznie na 5–10 minut na wybranych endpointach bez konieczności konfiguracji. Buforowanie sprawdza się najlepiej, gdy prompt systemowy ma ponad 2 tys. tokenów i jest stabilny między żądaniami, co opisuje większość produkcyjnych chatbotów i systemów RAG. Oszczędności są największe w przypadku obciążeń z długim, stabilnym kontekstem i wieloma żądaniami na minutę.
Batch API
Zarówno OpenAI, jak i Anthropic oferują endpointy batch z dokładnie 50% rabatem od standardowych cen w zamian za 24-godzinny SLA. Batch idealnie nadaje się do klasyfikacji, generowania embeddingów, podsumowywania, przebiegów ewaluacyjnych i wszelkiego przetwarzania w tle. Integracja jest trywialna: ten sam model, ten sam prompt, inny endpoint, plus kolejka do oczekiwania na wyniki. Większość zespołów pomija batch i płaci pełną cenę za obciążenia, które nie mają wymagań czasu rzeczywistego, co jest jednym z najłatwiejszych do uniknięcia kosztów AI.
Tokeny wyjściowe
Tokeny wyjściowe kosztują od 3 do 5 razy więcej niż tokeny wejściowe u wszystkich dostawców, a większość odpowiedzi nie wymaga domyślnego bufora 4 tys. tokenów wyjściowych, na który pozwala API. Jeśli wyodrębniasz odpowiedź tak/nie, ogranicz wynik do 10 tokenów. Jeśli generujesz krótkie podsumowanie, ogranicz je do 200. Model często chce wyjaśniać swoje rozumowanie, nawet gdy o to nie prosisz, a Ty płacisz za te wyjaśnienia. Zaostrzenie max_tokens często obniża koszty wyjściowe o 30–50% bez wpływu na jakość.
Szerokość kontekstu nie przekłada się bezpośrednio na cenę
Wszyscy najwięksi dostawcy pobierają opłaty za zużyte tokeny, a nie za rozmiar okna kontekstu. Wykorzystanie okna kontekstu 200K dla promptu o długości 5K tokenów kosztuje dokładnie tyle samo, co wykorzystanie okna 5K dla promptu o długości 5K tokenów. Wniosek: modele z długim kontekstem nie są „droższe w użyciu”, chyba że rzeczywiście zapełnisz kontekst. Wybieraj model na podstawie możliwości i ceny za token, a nie największego okna kontekstu.
Jak zmniejszyć koszty
Włącz buforowanie promptów jako pierwszą optymalizację, zanim zrobisz cokolwiek innego. W Anthropic oznacz stabilny prompt systemowy nagłówkami cache_control, a tokeny z pamięci podręcznej będą kosztować około 10% standardowej ceny tokenów wejściowych. W OpenAI buforowanie działa automatycznie w niektórych endpointach, gdy prefiks promptu jest identyczny w kolejnych żądaniach. Największe oszczędności uzyskasz w obciążeniach z długim, stabilnym kontekstem i dużą liczbą żądań: chatbotach ze szczegółowymi personami, systemach RAG z powtarzanym kontekstem wyszukiwania oraz pętlach agentów, które wielokrotnie wysyłają ten sam długi zestaw instrukcji. Większość zespołów zapomina włączyć buforowanie i przepłaca od 5 do 10 razy.
Przenieś wszystkie obciążenia, które nie muszą działać w czasie rzeczywistym, do Batch API. Zarówno Anthropic, jak i OpenAI oferują endpointy batchowe za dokładnie 50% standardowej ceny w zamian za SLA odpowiedzi do 24 godzin. Zadania klasyfikacji, moderacja treści, generowanie embeddingów, potoki sumaryzacji i uruchomienia ewaluacyjne to dobrzy kandydaci. Praca integracyjna jest trywialna, bo prompt i model pozostają bez zmian. Zespoły rutynowo uruchamiają całe potoki tagowania treści po standardowych stawkach, choć batch obniżyłby rachunek o połowę bez żadnej różnicy w jakości.
Kieruj żądania według stopnia trudności. Proste zapytania (powitania, formatowanie, podstawowe wyszukiwania) powinny trafiać do GPT-4o mini, Claude Haiku lub Gemini Flash w cenie od 0,15 do 0,80 USD za milion tokenów wejściowych. Trudne rozumowanie powinno trafiać do Claude Opus, GPT-4.5 lub Gemini Pro w cenie od 1,25 do 75 USD za milion tokenów. Mały klasyfikator przed routerem modeli zwykle obniża koszty o 60–80% w mieszanych obciążeniach. Wysyłanie wszystkiego do modelu klasy frontier to najczęstszy błąd kosztowy w AI, jaki widzimy w środowisku produkcyjnym.
Agresywnie ograniczaj max_tokens. Tokeny wyjściowe kosztują od 3 do 5 razy więcej niż tokeny wejściowe, a domyślny bufor wyjściowy 4K jest znacznie większy, niż potrzebuje większość odpowiedzi. Ogranicz odpowiedzi tak/nie do 10 tokenów, krótkie podsumowania do 200, a ustrukturyzowany JSON do tego, czego wymaga Twój schemat, plus niewielki bufor. Model czasem chce rozwijać wypowiedź, nawet gdy o to nie prosisz, a Ty płacisz za te rozwinięcia. Ograniczenie max_tokens w większości przypadków oznacza obniżenie kosztów tokenów wyjściowych o 30–50%.
Ogranicz pobrany kontekst tylko do tego, co potrzebne dla danego zapytania. Systemy RAG często pobierają od 10 do 20 fragmentów i na wszelki wypadek umieszczają wszystkie w prompcie. Efekt to płacenie za tysiące nieistotnych tokenów w każdym żądaniu. Dodanie rerankera, który filtruje 3–5 najbardziej trafnych fragmentów, zwykle ogranicza zużycie tokenów wejściowych o 50–70% bez utraty jakości, a często nawet poprawia jakość, bo model nie rozprasza się nieistotnym kontekstem.
Loguj każde żądanie wraz z liczbą tokenów, modelem oraz statusem buforowania (z pamięcią podręczną lub bez). Nie można optymalizować czegoś, czego nie widać, a koszty AI mogą zmienić się z dnia na dzień, gdy pojawi się nowa funkcja lub ktoś poprawi prompt. Ustaw dzienne alerty o wydatkach. Zbuduj dashboard z podziałem wydatków według funkcji, modelu i endpointu. Większość przekroczeń kosztów w środowisku produkcyjnym, z którymi się spotykamy, wynika z tego, że wzorzec użycia zmienił się dwa tygodnie wcześniej, zanim ktokolwiek spojrzał na rachunek.
Koszt za milion tokenów (ceny 2026)
| Model | Wejście | Wyjście | Zbuforowane wejście |
|---|---|---|---|
| GPT-4.5 | $75,00 | $150,00 | $37,50 |
| GPT-4o | $2,50 | $10,00 | $1,25 |
| GPT-4o mini | $0,15 | $0,60 | $0,075 |
| Claude Opus 4 | $15,00 | $75,00 | $1,50 |
| Claude Sonnet 4 | $3,00 | $15,00 | $0,30 |
| Claude Haiku 4 | $0,80 | $4,00 | $0,08 |
| Gemini 2.5 Pro | $1,25 | $10,00 | N/A |
| Gemini 2.5 Flash | $0,075 | $0,30 | N/A |
FAQ
Najczęściej zadawane pytania
Krótkie odpowiedzi w prostym języku. Jeśli nie znalazłeś swojej kwestii,
GPT-4o: 2,50 $ za milion tokenów wejściowych, 10 $ za wyjściowe. GPT-4o mini: 0,15 $/M wejściowych, 0,60 $ za wyjściowe. GPT-4.5: 75 $/M wejściowych, 150 $ za wyjściowe. Przy 10 milionach tokenów miesięcznie i podziale 30/70 na wejście/wyjście licz się z kosztem od 25 do 13 tysięcy dolarów, w zależności od modelu.
Dla większości zastosowań: GPT-4o mini, Gemini 2.5 Flash lub Claude Haiku 4 — wszystkie poniżej 1 dolara za milion tokenów wejściowych. Gdy szukasz równowagi między jakością a ceną: Claude Sonnet 4 lub Gemini 2.5 Pro.
Anthropic i OpenAI buforują duże prompty wejściowe między żądaniami. Buforowane tokeny kosztują około 90% mniej niż niebuforowane. To najlepsze rozwiązanie dla chatbotów ze stabilnym promptem systemowym lub RAG ze stałym kontekstem.
Dokładnie 50% zarówno na tokenach wejściowych, jak i wyjściowych. Wymaga zaakceptowania 24-godzinnego SLA. Sprawdza się w klasyfikacji, podsumowywaniu, embeddingu i ewaluacji. Nie nadaje się do czatu w czasie rzeczywistym ani interaktywnego UX.
Przy porównywalnym poziomie jakości koszt jest podobny. Claude Sonnet 4 wypada mniej więcej tak samo jak GPT-4o. Claude Opus 4 z buforowaniem promptów wychodzi około 30% taniej niż GPT-4o w zadaniach ze stabilnymi promptami.
(1) Włącz buforowanie promptów. (2) Korzystaj z Batch API, gdzie tylko się da. (3) Kieruj proste zapytania do modeli mini. (4) Agresywnie ograniczaj max_tokens. (5) Przytnij kontekst wyszukiwania do niezbędnego minimum.
Próg opłacalności to około 5 tysięcy dolarów miesięcznie na API. Poniżej tej kwoty: zostań przy API. Powyżej: samodzielny hosting Llama 3.1 lub Mistral obniża koszty o 50–70%, o ile masz odpowiednie kompetencje infrastrukturalne.
Pobierz reprezentatywną próbkę 100 żądań. Zmierz średnią liczbę tokenów wejściowych i wyjściowych. Pomnóż przez miesięczną liczbę żądań. Pomnóż przez koszt za milion tokenów. Dodaj 30% marginesu bezpieczeństwa.
Tylko do trudnych zadań wymagających rozumowania, w których modele średniej klasy zawodzą. W 80% obciążeń produkcyjnych Sonnet 4, GPT-4o lub Gemini 2.5 Pro sprawdzają się doskonale przy 10-krotnie niższych kosztach.
W granicach ±15% dla typowych obciążeń. Rzeczywiste odchylenia wynikają ze zmiennej długości promptów, zmiennej długości odpowiedzi, pętli błędów i ponowień oraz logiki routingu. Traktuj kalkulator jako narzędzie do planowania, a nie ostateczny rachunek.
Pokrewne narzędzia
Inne kalkulatory, które użytkownicy otwierają zaraz po tym; wybierz ten, który najlepiej pasuje do Twoich kolejnych decyzji.
Koszt budowy plus koszty eksploatacji; pełny obraz.
Uzyskaj precyzyjną wycenę od naszego zespołu
Kalkulatory pokazują widełki kosztów. 30-minutowa rozmowa pozwala ustalić zakres, harmonogram i budżet. Bezpłatna konsultacja, bez zobowiązań.
Rozpocznij rozmowę