Calculator cost API OpenAI, Claude & Gemini
Compară costurile lunare între furnizori cu economii din caching și batch.
Costurile API pentru GPT, Claude și Gemini variază între $0,15 și $75 per milion de tokeni de intrare, iar tokenii de ieșire sunt de obicei de 3–5 ori mai scumpi. La 10 milioane de tokeni pe lună, GPT-4o costă aproximativ $775, Claude Sonnet 4 aproximativ $1.140, iar Gemini 2.5 Pro aproximativ $825. Prompt caching reduce costurile de 10 ori pentru tokenii memorati în cache; Batch API reduce costurile cu 50% pentru sarcinile care nu necesită răspuns în timp real. Cu acest calculator poți modela utilizarea exactă pentru toți cei trei furnizori.
Datele tale
05 fieldsCui se adresează acest instrument
Antreprenori care definesc un proiect openai api înainte de a discuta cu furnizorii. CTO și lideri tehnici care construiesc bugetul anual pentru dezvoltarea de produse noi. Manageri de produs care transformă o idee într-o singură propoziție într-un interval justificabil financiar. Echipe de achiziții care verifică raționalitatea ofertelor primite de la agenții și contractori.
Cum calculăm aceste valori
Prețurile se bazează pe tarifele publicate oficial de OpenAI, Anthropic și Google, valabile din 2026. Stocarea în cache a prompturilor se aplică doar tokenurilor de intrare stocate în cache (de obicei, promptul de sistem + contextul stabil). API-ul Batch se aplică atât tokenurilor de intrare, cât și celor de ieșire, pentru sarcini non-realtime, cu un SLA de 24 de ore.
Surse de date
Ce influențează valoarea finală
Selecția nivelului modelului
Modelele de frontieră precum GPT-4.5, Claude Opus 4 și Gemini 2.5 Pro sunt de 5 până la 10 ori mai scumpe per token decât variantele lor de nivel mediu. Folosește modelele de frontieră doar pentru sarcini de raționament dificil, acolo unde cele de nivel mediu chiar nu fac față: logică complexă în mai mulți pași, matematică, generare de cod ambiguu sau sarcini care necesită cunoștințe profunde despre lume. Direcționează tot restul către Claude Sonnet 4, GPT-4o sau Gemini Flash. Diferența de cost este suficient de mare încât o rutare inteligentă reduce de obicei cheltuielile cu 60–80% în cazul sarcinilor mixte.
Caching prompturi
Anthropic stochează în cache tokenurile de intrare gratuit timp de 5 minute sau timp de 1 oră cu un supliment de 25%, reducând costul tokenurilor stocate în cache cu aproximativ 90%. OpenAI stochează automat în cache timp de 5 până la 10 minute pe anumite endpointuri, fără nicio configurare necesară. Stocarea în cache funcționează cel mai bine când promptul de sistem depășește 2K de tokenuri și este stabil între cereri, ceea ce descrie majoritatea chatbot-urilor de producție și a sistemelor RAG. Economiile sunt cele mai mari în cazul sarcinilor cu un context lung și stabil și multe cereri pe minut.
API Batch
Atât OpenAI, cât și Anthropic oferă endpointuri batch cu o reducere de exact 50% din prețul standard, în schimbul unui SLA de 24 de ore. Batch este ideal pentru clasificare, generare de embedding-uri, rezumare, rulări de evaluare și orice procesare în fundal. Integrarea este banală: același model, același prompt, un endpoint diferit, plus o coadă de așteptare pentru rezultate. Majoritatea echipelor ignoră opțiunea batch și plătesc prețul întreg pentru sarcini care nu au nicio cerință de timp real, ceea ce reprezintă unul dintre cele mai ușor de evitat costuri AI.
Tokeni de ieșire
Tokenurile de ieșire costă de 3 până la 5 ori mai mult decât tokenurile de intrare la toți furnizorii, iar majoritatea răspunsurilor nu au nevoie de bufferul de ieșire de 4K de tokenuri permis implicit de API. Dacă extragi un răspuns de tip da sau nu, limitează ieșirea la 10 tokenuri. Dacă generezi un rezumat scurt, limiteaz-o la 200. Modelul vrea adesea să-și explice raționamentul chiar și atunci când nu i-ai cerut asta, iar tu plătești pentru acele explicații. Restrângerea max_tokens reduce adesea costurile de ieșire cu 30–50%, fără niciun impact asupra calității.
Fereastra de context nu egalează prețul
Toți furnizorii importanți taxează per token consumat, nu per dimensiunea ferestrei de context. Folosirea unei ferestre de context de 200K pentru un prompt de 5K de tokeni costă exact la fel ca folosirea unei ferestre de context de 5K pentru un prompt de 5K de tokeni. Concluzia este că modelele cu context lung nu sunt „mai scumpe de utilizat” decât dacă chiar umpli contextul. Alege modelul în funcție de capabilități și de prețul per token, nu în funcție de care fereastră de context este cea mai mare.
Cum puteți reduce cheltuielile
Activează prompt caching ca primă optimizare, înaintea oricărei alte măsuri. La Anthropic, marchează promptul de sistem stabil cu headere cache_control, iar tokenii din cache vor costa aproximativ 10% din prețul standard de input. La OpenAI, cachingul se aplică automat pe anumite endpointuri atunci când prefixul promptului este identic de la o cerere la alta. Câștigul este maxim pentru workloaduri cu context lung și stabil și multe cereri: chatboți cu persona detaliată, sisteme RAG cu context de retrieval repetat și orice buclă de agent care retrimite un set lung de instrucțiuni. Majoritatea echipelor uită să activeze cachingul și plătesc de 5 până la 10 ori mai mult.
Mută toate workloadurile care nu țin de timp real pe Batch API. Atât Anthropic, cât și OpenAI oferă endpointuri batch la exact 50% din prețul standard, în schimbul unui SLA de răspuns de 24 de ore. Joburile de clasificare, moderarea conținutului, generarea de embeddinguri, pipelineurile de sumarizare și rulările de evaluare sunt toate candidate potrivite. Efortul de integrare este minim, pentru că promptul și modelul rămân neschimbate. Echipele rulează în mod obișnuit întregul pipeline de etichetare a conținutului la preț standard, deși batch ar înjumătăți factura, fără nicio diferență de calitate.
Rutează cererile în funcție de dificultate. Interogările simple (saluturi, formatare, căutări de bază) se potrivesc pe GPT-4o mini, Claude Haiku sau Gemini Flash, la $0,15 până la $0,80 per milion de tokeni de input. Raționamentul complex se potrivește pe Claude Opus, GPT-4.5 sau Gemini Pro, la $1,25 până la $75 per milion. Un clasificator mic plasat în fața routerului de modele reduce de obicei costurile cu 60 până la 80% pentru workloaduri mixte. Trimiterea tuturor cererilor către un model de frontieră este cea mai frecventă greșeală de costuri AI pe care o vedem în producție.
Limitează agresiv max_tokens. Tokenii de output costă de 3 până la 5 ori mai mult decât tokenii de input, iar bufferul implicit de 4K pentru output este mult mai mare decât au nevoie majoritatea răspunsurilor. Limitează răspunsurile de tip da sau nu la 10 tokeni, sumarele scurte la 200, iar JSON-ul structurat la cât cere schema ta, plus un buffer mic. Uneori modelul vrea să elaboreze chiar și când nu ai cerut asta, iar tu plătești pentru acele elaborări. Restrângerea max_tokens înseamnă o reducere cu 30 până la 50% a costurilor de output în majoritatea cazurilor.
Redu contextul recuperat la strictul necesar pentru fiecare interogare. Sistemele RAG recuperează adesea 10 până la 20 de chunkuri și le îndesă pe toate în prompt, pentru siguranță. Rezultatul înseamnă să plătești pentru mii de tokeni irelevanți per cerere. Adăugarea unui reranker care filtrează până la primele 3 până la 5 cele mai relevante chunkuri reduce de obicei consumul de tokeni de input cu 50 până la 70%, fără pierderi de calitate, adesea chiar cu o îmbunătățire a calității, pentru că modelul nu mai este distras de context irelevant.
Loghează fiecare cerere cu numărul de tokeni, modelul și statusul cached versus uncached. Nu poți optimiza ceea ce nu vezi, iar costurile AI își pot schimba forma peste noapte când se lansează o funcționalitate nouă sau când un prompt este ajustat. Setează alerte zilnice de cheltuieli. Construiește un dashboard care defalcă cheltuielile pe funcționalitate, model și endpoint. Majoritatea depășirilor de costuri în producție pe care le întâlnim apar pentru că un tipar de utilizare s-a schimbat cu două săptămâni înainte ca cineva să se uite pe factură.
Cost per milion de tokeni (tarife 2026)
| Model | Intrare | Ieșire | Intrare stocată în cache |
|---|---|---|---|
| GPT-4.5 | $75,00 | $150,00 | $37,50 |
| GPT-4o | $2,50 | $10,00 | $1,25 |
| GPT-4o mini | $0,15 | $0,60 | $0,075 |
| Claude Opus 4 | $15,00 | $75,00 | $1,50 |
| Claude Sonnet 4 | $3,00 | $15,00 | $0,30 |
| Claude Haiku 4 | $0,80 | $4,00 | $0,08 |
| Gemini 2.5 Pro | $1,25 | $10,00 | N/A |
| Gemini 2.5 Flash | $0,075 | $0,30 | N/A |
Întrebări frecvente
Întrebările pe care le primim în fiecare săptămână
Răspunsuri scurte, explicate simplu. Dacă nu-ți găsești întrebarea aici,
GPT-4o: $2,50 per milion de tokeni de intrare, $10 pentru ieșire. GPT-4o mini: $0,15/M intrare, $0,60 ieșire. GPT-4.5: $75/M intrare, $150 ieșire. La 10 milioane de tokeni pe lună, cu o proporție de 30/70 intrare/ieșire, așteaptă-te la costuri între $25 și $13K, în funcție de model.
Pentru majoritatea sarcinilor: GPT-4o mini, Gemini 2.5 Flash sau Claude Haiku 4 — toate sub $1 per milion de tokeni de intrare. Pentru cel mai bun raport calitate-preț: Claude Sonnet 4 sau Gemini 2.5 Pro.
Anthropic și OpenAI memorează în cache prompturile mari de intrare între cereri. Tokenii din cache costă cu aproximativ 90% mai puțin decât cei necacheați. Ideal pentru chatboți cu prompturi de sistem stabile sau pentru RAG cu context stabil.
Exact 50%, atât pentru tokenii de intrare, cât și pentru cei de ieșire. Necesită acceptarea unui SLA de 24 de ore. Potrivit pentru clasificare, sumarizare, embedding și evaluare. Nepotrivit pentru chat în timp real sau experiențe interactive.
La niveluri de calitate comparabile, costurile sunt similare. Claude Sonnet 4 față de GPT-4o sunt aproximativ la egalitate. Claude Opus 4 cu prompt caching costă cu aproximativ 30% mai puțin decât GPT-4o pentru sarcini cu prompturi stabile.
(1) Activează prompt caching. (2) Folosește Batch API ori de câte ori e posibil. (3) Direcționează interogările simple către modele mini. (4) Limitează agresiv max_tokens. (5) Redu contextul de retrieval la esențial.
Pragul de rentabilitate se situează în jur de $5K pe lună în cheltuieli API. Sub acest prag: continuă să folosești API-urile. Peste: self-hosting cu Llama 3.1 sau Mistral reduce costurile cu 50–70%, dacă ai expertiza necesară în infrastructură.
Ia un eșantion reprezentativ de 100 de cereri. Măsoară media tokenurilor de intrare și de ieșire. Înmulțește cu volumul lunar de cereri. Înmulțește cu costul per milion de tokenuri. Adaugă o marjă de siguranță de 30%.
Doar pentru raționament complex, acolo unde modelele de nivel mediu eșuează. Pentru 80% din sarcinile de producție, Sonnet 4, GPT-4o sau Gemini 2.5 Pro funcționează perfect la un cost de 10 ori mai mic.
În limita a ±15% pentru sarcinile tipice. Variațiile reale provin din diferențele de lungime a prompturilor, variațiile de lungime a răspunsurilor, buclele de eroare și reîncercare și logica de rutare. Folosește calculatorul ca instrument de planificare, nu ca factură finală.
Instrumente similare
Alte calculatoare pe care le deschid utilizatorii imediat după acesta; alege-l pe cel care se potrivește următoarei tale decizii.
Costul de dezvoltare plus costul operațional lunar; imaginea completă.
Obține o estimare precisă de la echipa noastră
Calculatoarele îți oferă un interval de preț. Un apel de 30 de minute îți oferă un scope fixat, un cronogramă și un buget clar. Consultație gratuită, fără nicio obligație.
Demarăm conversația