Techsy
Kontakt
Rozpocznij

Kalkulator kosztów API OpenAI, Claude i Gemini

Porównaj miesięczne koszty u różnych dostawców, uwzględniając oszczędności dzięki cache’owaniu i batchowi.

Koszty API dla GPT, Claude i Gemini wynoszą od 0,15 do 75 dolarów za milion tokenów wejściowych, a tokeny wyjściowe są zwykle 3–5 razy droższe. Przy 10 milionach tokenów miesięcznie GPT-4o kosztuje około 775 dolarów, Claude Sonnet 4 około 1140 dolarów, a Gemini 2.5 Pro około 825 dolarów. Buforowanie promptów obniża koszt buforowanych tokenów 10-krotnie, a Batch API tnie koszty o 50% w zadaniach niewymagających czasu rzeczywistego. Ten kalkulator pozwala precyzyjnie modelować zużycie u wszystkich trzech dostawców.

Strona główna/Zasoby/Narzędzia/Kalkulator kosztów API OpenAI, Claude i Gemini
↓ Otwórz kalkulator

Twoje dane

05 fields

Szacowany koszt miesięczny

● Wysokie zaufanie

187 zł – 286 zł

Mediana: 220 zł

Struktura kosztów

Tokeny wejściowe (10M × $2.50/M)100 zł
Tokeny wyjściowe (3M × $10.00/M)120 zł

Wymagany e-mail i telefon. 30-minutowa rozmowa konsultacyjna z naszym zespołem.

Sprawdź, jak wyceniłby Twój pełny zakres zespół z Poland →

Dla kogo jest to narzędzie

Założyciele planujący projekt openai api przed rozmowami z dostawcami. CTO i liderzy inżynierii budujący roczny budżet na nowy produkt. Product managerowie zamieniający jednozdaniową ideę w uzasadniony zakres kosztów dla działu finansów. Zespoły zakupowe weryfikujące oferty agencji i freelancerów.

Jak obliczamy koszty

Ceny oparte na publicznie dostępnych stawkach OpenAI, Anthropic i Google z 2026 roku. Buforowanie promptów dotyczy wyłącznie buforowanych tokenów wejściowych (zazwyczaj prompt systemowy + stabilny kontekst). Batch API obejmuje zarówno tokeny wejściowe, jak i wyjściowe w przypadku pracy w czasie nierzeczywistym z 24-godzinnym SLA.

Źródła danych

  • Publiczne cenniki API OpenAI
  • Dokumentacja Batch API OpenAI
  • Publiczne cenniki API Anthropic
  • Dokumentacja cache’owania promptów Anthropic
  • Anthropic Message Batches API
  • Cenniki API Google AI / Gemini
  • Dokumentacja cache’owania promptów OpenAI

Co wpływa na finalną kwotę

Wybór warstwy modelu

Modele klasy frontier, takie jak GPT-4.5, Claude Opus 4 i Gemini 2.5 Pro, są od 5 do 10 razy droższe za token niż ich odpowiedniki średniej klasy. Korzystaj z modeli frontier wyłącznie do trudnych zadań wymagających rozumowania, w których modele średniej klasy rzeczywiście zawodzą: złożona logika wieloetapowa, matematyka, niejednoznaczne generowanie kodu lub zadania wymagające głębokiej wiedzy o świecie. Wszystko inne kieruj do Claude Sonnet 4, GPT-4o lub Gemini Flash. Różnica w kosztach jest na tyle duża, że inteligentny routing zazwyczaj pozwala obniżyć wydatki o 60–80% w przypadku obciążeń mieszanych.

Cache’owanie promptów

Anthropic buforuje tokeny wejściowe na 5 minut za darmo lub na 1 godzinę z 25% dopłatą, obniżając koszt buforowanych tokenów o około 90%. OpenAI buforuje automatycznie na 5–10 minut na wybranych endpointach bez konieczności konfiguracji. Buforowanie sprawdza się najlepiej, gdy prompt systemowy ma ponad 2 tys. tokenów i jest stabilny między żądaniami, co opisuje większość produkcyjnych chatbotów i systemów RAG. Oszczędności są największe w przypadku obciążeń z długim, stabilnym kontekstem i wieloma żądaniami na minutę.

Batch API

Zarówno OpenAI, jak i Anthropic oferują endpointy batch z dokładnie 50% rabatem od standardowych cen w zamian za 24-godzinny SLA. Batch idealnie nadaje się do klasyfikacji, generowania embeddingów, podsumowywania, przebiegów ewaluacyjnych i wszelkiego przetwarzania w tle. Integracja jest trywialna: ten sam model, ten sam prompt, inny endpoint, plus kolejka do oczekiwania na wyniki. Większość zespołów pomija batch i płaci pełną cenę za obciążenia, które nie mają wymagań czasu rzeczywistego, co jest jednym z najłatwiejszych do uniknięcia kosztów AI.

Tokeny wyjściowe

Tokeny wyjściowe kosztują od 3 do 5 razy więcej niż tokeny wejściowe u wszystkich dostawców, a większość odpowiedzi nie wymaga domyślnego bufora 4 tys. tokenów wyjściowych, na który pozwala API. Jeśli wyodrębniasz odpowiedź tak/nie, ogranicz wynik do 10 tokenów. Jeśli generujesz krótkie podsumowanie, ogranicz je do 200. Model często chce wyjaśniać swoje rozumowanie, nawet gdy o to nie prosisz, a Ty płacisz za te wyjaśnienia. Zaostrzenie max_tokens często obniża koszty wyjściowe o 30–50% bez wpływu na jakość.

Szerokość kontekstu nie przekłada się bezpośrednio na cenę

Wszyscy najwięksi dostawcy pobierają opłaty za zużyte tokeny, a nie za rozmiar okna kontekstu. Wykorzystanie okna kontekstu 200K dla promptu o długości 5K tokenów kosztuje dokładnie tyle samo, co wykorzystanie okna 5K dla promptu o długości 5K tokenów. Wniosek: modele z długim kontekstem nie są „droższe w użyciu”, chyba że rzeczywiście zapełnisz kontekst. Wybieraj model na podstawie możliwości i ceny za token, a nie największego okna kontekstu.

Jak zmniejszyć koszty

Włącz buforowanie promptów jako pierwszą optymalizację, zanim zrobisz cokolwiek innego. W Anthropic oznacz stabilny prompt systemowy nagłówkami cache_control, a tokeny z pamięci podręcznej będą kosztować około 10% standardowej ceny tokenów wejściowych. W OpenAI buforowanie działa automatycznie w niektórych endpointach, gdy prefiks promptu jest identyczny w kolejnych żądaniach. Największe oszczędności uzyskasz w obciążeniach z długim, stabilnym kontekstem i dużą liczbą żądań: chatbotach ze szczegółowymi personami, systemach RAG z powtarzanym kontekstem wyszukiwania oraz pętlach agentów, które wielokrotnie wysyłają ten sam długi zestaw instrukcji. Większość zespołów zapomina włączyć buforowanie i przepłaca od 5 do 10 razy.

Przenieś wszystkie obciążenia, które nie muszą działać w czasie rzeczywistym, do Batch API. Zarówno Anthropic, jak i OpenAI oferują endpointy batchowe za dokładnie 50% standardowej ceny w zamian za SLA odpowiedzi do 24 godzin. Zadania klasyfikacji, moderacja treści, generowanie embeddingów, potoki sumaryzacji i uruchomienia ewaluacyjne to dobrzy kandydaci. Praca integracyjna jest trywialna, bo prompt i model pozostają bez zmian. Zespoły rutynowo uruchamiają całe potoki tagowania treści po standardowych stawkach, choć batch obniżyłby rachunek o połowę bez żadnej różnicy w jakości.

Kieruj żądania według stopnia trudności. Proste zapytania (powitania, formatowanie, podstawowe wyszukiwania) powinny trafiać do GPT-4o mini, Claude Haiku lub Gemini Flash w cenie od 0,15 do 0,80 USD za milion tokenów wejściowych. Trudne rozumowanie powinno trafiać do Claude Opus, GPT-4.5 lub Gemini Pro w cenie od 1,25 do 75 USD za milion tokenów. Mały klasyfikator przed routerem modeli zwykle obniża koszty o 60–80% w mieszanych obciążeniach. Wysyłanie wszystkiego do modelu klasy frontier to najczęstszy błąd kosztowy w AI, jaki widzimy w środowisku produkcyjnym.

Agresywnie ograniczaj max_tokens. Tokeny wyjściowe kosztują od 3 do 5 razy więcej niż tokeny wejściowe, a domyślny bufor wyjściowy 4K jest znacznie większy, niż potrzebuje większość odpowiedzi. Ogranicz odpowiedzi tak/nie do 10 tokenów, krótkie podsumowania do 200, a ustrukturyzowany JSON do tego, czego wymaga Twój schemat, plus niewielki bufor. Model czasem chce rozwijać wypowiedź, nawet gdy o to nie prosisz, a Ty płacisz za te rozwinięcia. Ograniczenie max_tokens w większości przypadków oznacza obniżenie kosztów tokenów wyjściowych o 30–50%.

Ogranicz pobrany kontekst tylko do tego, co potrzebne dla danego zapytania. Systemy RAG często pobierają od 10 do 20 fragmentów i na wszelki wypadek umieszczają wszystkie w prompcie. Efekt to płacenie za tysiące nieistotnych tokenów w każdym żądaniu. Dodanie rerankera, który filtruje 3–5 najbardziej trafnych fragmentów, zwykle ogranicza zużycie tokenów wejściowych o 50–70% bez utraty jakości, a często nawet poprawia jakość, bo model nie rozprasza się nieistotnym kontekstem.

Loguj każde żądanie wraz z liczbą tokenów, modelem oraz statusem buforowania (z pamięcią podręczną lub bez). Nie można optymalizować czegoś, czego nie widać, a koszty AI mogą zmienić się z dnia na dzień, gdy pojawi się nowa funkcja lub ktoś poprawi prompt. Ustaw dzienne alerty o wydatkach. Zbuduj dashboard z podziałem wydatków według funkcji, modelu i endpointu. Większość przekroczeń kosztów w środowisku produkcyjnym, z którymi się spotykamy, wynika z tego, że wzorzec użycia zmienił się dwa tygodnie wcześniej, zanim ktokolwiek spojrzał na rachunek.

Koszt za milion tokenów (ceny 2026)

ModelWejścieWyjścieZbuforowane wejście
GPT-4.5$75,00$150,00$37,50
GPT-4o$2,50$10,00$1,25
GPT-4o mini$0,15$0,60$0,075
Claude Opus 4$15,00$75,00$1,50
Claude Sonnet 4$3,00$15,00$0,30
Claude Haiku 4$0,80$4,00$0,08
Gemini 2.5 Pro$1,25$10,00N/A
Gemini 2.5 Flash$0,075$0,30N/A

FAQ

Najczęściej zadawane pytania

Krótkie odpowiedzi w prostym języku. Jeśli nie znalazłeś swojej kwestii,

GPT-4o: 2,50 $ za milion tokenów wejściowych, 10 $ za wyjściowe. GPT-4o mini: 0,15 $/M wejściowych, 0,60 $ za wyjściowe. GPT-4.5: 75 $/M wejściowych, 150 $ za wyjściowe. Przy 10 milionach tokenów miesięcznie i podziale 30/70 na wejście/wyjście licz się z kosztem od 25 do 13 tysięcy dolarów, w zależności od modelu.

Dla większości zastosowań: GPT-4o mini, Gemini 2.5 Flash lub Claude Haiku 4 — wszystkie poniżej 1 dolara za milion tokenów wejściowych. Gdy szukasz równowagi między jakością a ceną: Claude Sonnet 4 lub Gemini 2.5 Pro.

Anthropic i OpenAI buforują duże prompty wejściowe między żądaniami. Buforowane tokeny kosztują około 90% mniej niż niebuforowane. To najlepsze rozwiązanie dla chatbotów ze stabilnym promptem systemowym lub RAG ze stałym kontekstem.

Dokładnie 50% zarówno na tokenach wejściowych, jak i wyjściowych. Wymaga zaakceptowania 24-godzinnego SLA. Sprawdza się w klasyfikacji, podsumowywaniu, embeddingu i ewaluacji. Nie nadaje się do czatu w czasie rzeczywistym ani interaktywnego UX.

Przy porównywalnym poziomie jakości koszt jest podobny. Claude Sonnet 4 wypada mniej więcej tak samo jak GPT-4o. Claude Opus 4 z buforowaniem promptów wychodzi około 30% taniej niż GPT-4o w zadaniach ze stabilnymi promptami.

(1) Włącz buforowanie promptów. (2) Korzystaj z Batch API, gdzie tylko się da. (3) Kieruj proste zapytania do modeli mini. (4) Agresywnie ograniczaj max_tokens. (5) Przytnij kontekst wyszukiwania do niezbędnego minimum.

Próg opłacalności to około 5 tysięcy dolarów miesięcznie na API. Poniżej tej kwoty: zostań przy API. Powyżej: samodzielny hosting Llama 3.1 lub Mistral obniża koszty o 50–70%, o ile masz odpowiednie kompetencje infrastrukturalne.

Pobierz reprezentatywną próbkę 100 żądań. Zmierz średnią liczbę tokenów wejściowych i wyjściowych. Pomnóż przez miesięczną liczbę żądań. Pomnóż przez koszt za milion tokenów. Dodaj 30% marginesu bezpieczeństwa.

Tylko do trudnych zadań wymagających rozumowania, w których modele średniej klasy zawodzą. W 80% obciążeń produkcyjnych Sonnet 4, GPT-4o lub Gemini 2.5 Pro sprawdzają się doskonale przy 10-krotnie niższych kosztach.

W granicach ±15% dla typowych obciążeń. Rzeczywiste odchylenia wynikają ze zmiennej długości promptów, zmiennej długości odpowiedzi, pętli błędów i ponowień oraz logiki routingu. Traktuj kalkulator jako narzędzie do planowania, a nie ostateczny rachunek.

Pokrewne narzędzia

Inne kalkulatory, które użytkownicy otwierają zaraz po tym; wybierz ten, który najlepiej pasuje do Twoich kolejnych decyzji.

Kalkulator kosztów integracji AI
Kalkulator kosztów integracji AI

Koszt budowy plus koszty eksploatacji; pełny obraz.

Otwórz kalkulator

Uzyskaj precyzyjną wycenę od naszego zespołu

Kalkulatory pokazują widełki kosztów. 30-minutowa rozmowa pozwala ustalić zakres, harmonogram i budżet. Bezpłatna konsultacja, bez zobowiązań.

Rozpocznij rozmowę

Z naszej biblioteki

Zasoby

Zobacz wszystkie
  • The Software Procurement Playbook

    A repeatable framework for buying software without burning six months and a million dollars on the wrong platform.

  • The Architecture Decision Playbook

    A practical framework for picking your stack: when to build vs. buy, monolith vs. microservices, and how to avoid resume-driven design.

  • The Vendor Selection Playbook

    How to pick the right development partner (agency, freelancer, in-house) without overpaying or shipping a half-built product.

Umiejętności Claude

Zobacz wszystkie
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automatyzacje AI

Zobacz wszystkie
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Z naszej biblioteki

Zasoby

Zobacz wszystkie
  • The Software Procurement Playbook

    A repeatable framework for buying software without burning six months and a million dollars on the wrong platform.

  • The Architecture Decision Playbook

    A practical framework for picking your stack: when to build vs. buy, monolith vs. microservices, and how to avoid resume-driven design.

  • The Vendor Selection Playbook

    How to pick the right development partner (agency, freelancer, in-house) without overpaying or shipping a half-built product.

Umiejętności Claude

Zobacz wszystkie
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automatyzacje AI

Zobacz wszystkie
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Usługi

  • Rozwiązania Enterprise
  • Aplikacje mobilne
  • Aplikacje webowe

Rozwiązania

  • Systemy CRM
  • Integracja AI
  • Rozwiązania ERP
  • Agenci głosowi
  • Automatyzacja procesów
  • Cyberbezpieczeństwo

Biblioteka

  • Zasoby
  • Blog
  • Portfel realizacji

Społeczność

  • Automatyzacje AI
  • Umiejętności Claude

Narzędzia

  • Kalkulator kosztów aplikacji mobilnej
  • Kalkulator kosztów API OpenAI / LLM
  • Kalkulator kosztów MVP
  • Kalkulator kosztów agenta Voice AI

Firma

  • O nas
  • Partnerzy
  • Kontakt

Prawne

  • Polityka prywatności
  • Regulamin
  • Polityka cookies

Usługi

  • Rozwiązania Enterprise
  • Aplikacje mobilne
  • Aplikacje webowe

Rozwiązania

  • Systemy CRM
  • Integracja AI
  • Rozwiązania ERP
  • Agenci głosowi
  • Automatyzacja procesów
  • Cyberbezpieczeństwo

Biblioteka

  • Zasoby
  • Blog
  • Portfel realizacji

Społeczność

  • Automatyzacje AI
  • Umiejętności Claude

Narzędzia

  • Kalkulator kosztów aplikacji mobilnej
  • Kalkulator kosztów API OpenAI / LLM
  • Kalkulator kosztów MVP
  • Kalkulator kosztów agenta Voice AI

Firma

  • O nas
  • Partnerzy
  • Kontakt
PrawnePolityka prywatnościRegulaminPolityka cookies
TECHSY
© 2026 Techsy. Wszystkie prawa zastrzeżone.