OpenAI, Claude ve Gemini API maliyet hesaplayıcı

Caching ve batch tasarruflarını da hesaba katarak sağlayıcılar arasındaki aylık maliyetleri karşılaştırın.

GPT, Claude ve Gemini için API maliyetleri milyon girdi token başına 0,15 $ ile 75 $ arasında değişir; çıktı token'ları genellikle 3–5 kat daha pahalıdır. Ayda 10 milyon tokenda GPT-4o yaklaşık 775 $, Claude Sonnet 4 yaklaşık 1.140 $, Gemini 2.5 Pro yaklaşık 825 $ tutar. Prompt caching, önbelleğe alınan token'larda maliyeti 10 kat düşürür; Batch API ise gerçek zamanlı olmayan işlerde maliyeti %50 azaltır. Bu hesaplayıcıyla üç sağlayıcıdaki kullanımınızı tek tek modelleyebilirsiniz.

Hesaplayıcıyı aç

Girdileriniz

05 fields

Bu aracı kim kullanmalı

Tedarikçilerle görüşmeden önce bir openai api projesinin kapsamını netleştirmek isteyen kurucular. Yeni ürün çalışmaları için yıllık bütçe oluşturan CTO'lar ve mühendislik liderleri. Tek cümlelik bir fikri finans ekibine sunabilecekleri savunulabilir bir aralığa çeviren ürün yöneticileri. Ajanslardan ve serbest çalışanlardan gelen tekliflerin gerçekçiliğini sınayan satın alma ekipleri.

Bunu nasıl hesaplıyoruz

Fiyatlar; OpenAI, Anthropic ve Google'ın 2026 itibarıyla kamuya açık olarak yayımladığı tarifelere dayanır. Prompt caching yalnızca önbelleğe alınan girdi token'larına uygulanır (genellikle sistem prompt'u artı sabit bağlam). Batch API ise 24 saatlik SLA ile gerçek zamanlı olmayan işlerde hem girdi hem çıktı token'larına uygulanır.

Veri kaynakları

Maliyeti aşağı yukarı oynatan etkenler

Model katmanı seçimi

GPT-4.5, Claude Opus 4 ve Gemini 2.5 Pro gibi en üst seviye modeller, orta seviye kardeşlerinden token başına 5 ila 10 kat daha pahalıdır. En üst seviyeyi yalnızca orta seviyenin gerçekten yetersiz kaldığı zorlu muhakeme işlerinde kullanın: karmaşık çok adımlı mantık, matematik, belirsiz kod üretimi ya da derin alan bilgisi gerektiren görevler. Geri kalan her şeyi Claude Sonnet 4, GPT-4o ya da Gemini Flash'a yönlendirin. Maliyet farkı o kadar büyüktür ki, akıllı yönlendirme karışık iş yüklerinde harcamayı tipik olarak %60 ila 80 düşürür.

Prompt caching

Anthropic, girdi token'larını 5 dakika ücretsiz ya da %25 ek ücretle 1 saat boyunca önbelleğe alır; bu da önbellekten okunan token maliyetini kabaca %90 düşürür. OpenAI ise belirli uç noktalarda, hiçbir ayar gerektirmeden 5 ila 10 dakika otomatik önbelleğe alır. Önbellekleme en iyi sonucu, sistem prompt'unuz 2K token'ın üzerindeyken ve istekler arasında sabit kaldığında verir; bu da çoğu üretim chatbot'u ve RAG sistemi için geçerlidir. Tasarruf, bağlamın uzun ve sabit olduğu, dakikada çok sayıda istek alan iş yüklerinde en yüksektir.

Batch API

Hem OpenAI hem Anthropic, 24 saatlik bir SLA karşılığında standart fiyattan tam %50 indirimli batch uç noktaları sunar. Batch; sınıflandırma, embedding üretimi, özetleme, değerlendirme koşuları ve her türlü arka plan işi için idealdir. Entegrasyonu son derece basittir: aynı model, aynı prompt, yalnızca farklı bir uç nokta ve sonuçları beklemek için bir kuyruk. Çoğu ekip batch'i gözden kaçırır ve gerçek zamanlı olması gerekmeyen işler için tam fiyat öder; oysa bu, önlenmesi en kolay AI maliyetlerinden biridir.

Çıktı token'ları

Çıktı token'ları tüm sağlayıcılarda girdi token'larından 3 ila 5 kat daha pahalıdır ve çoğu yanıt, API'nin varsayılan olarak ayırdığı 4K token'lık çıktı tamponuna ihtiyaç duymaz. Evet-hayır cevabı alıyorsanız çıktıyı 10 token'la sınırlayın. Kısa bir özet üretiyorsanız 200 token yeter. Model çoğu zaman siz istemeseniz bile gerekçesini açıklamak ister; o açıklamaların bedelini de siz ödersiniz. max_tokens değerini kısmak çoğu durumda kaliteyi etkilemeden çıktı maliyetini %30 ila 50 düşürür.

Bağlam penceresi büyüklüğü fiyatı belirlemez

Tüm büyük sağlayıcılar, bağlam penceresinin boyutuna göre değil, tüketilen token başına ücret alır. 5K token'lık bir prompt için 200K bağlam penceresi kullanmak, aynı prompt için 5K bağlam penceresi kullanmakla tam olarak aynı maliyettedir. Yani bağlamı gerçekten doldurmadığınız sürece uzun bağlamlı modeller "daha pahalı" değildir. Modeli hangi bağlam penceresinin en büyük olduğuna göre değil, yeteneğine ve token başına fiyatına göre seçin.

Maliyet nasıl düşürülür

İlk optimizasyon olarak, her şeyden önce prompt caching'i açın. Anthropic'te sabit sistem prompt'unuzu cache_control başlıklarıyla işaretleyin; önbelleğe alınan token'lar standart girdi fiyatının kabaca %10'una iner. OpenAI'da ise prompt öneki istekler arasında birebir aynı olduğunda belirli uç noktalarda önbellekleme kendiliğinden devreye girer. Kazanç en çok, bağlamın uzun ve sabit olduğu, çok sayıda istek alan iş yüklerinde belirginleşir: ayrıntılı persona'lı chatbot'lar, aynı getirme bağlamını tekrar tekrar kullanan RAG sistemleri ve uzun bir talimat setini her seferinde yeniden gönderen agent döngüleri. Çoğu ekip önbelleklemeyi açmayı unutur ve 5 ila 10 kat fazla öder.

Gerçek zamanlı olması gerekmeyen her iş yükünü Batch API'ye taşıyın. Hem Anthropic hem OpenAI, 24 saatlik bir yanıt SLA'sı karşılığında standart fiyatın tam %50'sine batch uç noktaları sunar. Sınıflandırma işleri, içerik denetimi, embedding üretimi, özetleme pipeline'ları ve değerlendirme koşularının hepsi iyi birer adaydır. Entegrasyon işi neredeyse yok denecek kadar azdır; çünkü prompt ve model aynı kalır. Birçok ekip tüm içerik etiketleme pipeline'ını tam fiyattan çalıştırır; oysa batch, hiçbir kalite farkı olmadan faturayı yarıya indirirdi.

İstekleri zorluk seviyesine göre yönlendirin. Basit sorgular (selamlaşma, biçimlendirme, temel aramalar) milyon girdi token başına 0,15 ila 0,80 $'a GPT-4o mini, Claude Haiku ya da Gemini Flash'a gider. Zorlu muhakeme işleri ise milyon token başına 1,25 ila 75 $'a Claude Opus, GPT-4.5 ya da Gemini Pro'ya gider. Model yönlendiricinizin önüne koyacağınız küçük bir sınıflandırıcı, karışık iş yüklerinde maliyeti tipik olarak %60 ila 80 düşürür. Her şeyi en üst seviye bir modele göndermek, üretimde en sık karşılaştığımız AI maliyet hatasıdır.

max_tokens değerini olabildiğince sıkı tutun. Çıktı token'ları girdi token'larından 3 ila 5 kat daha pahalıdır ve varsayılan 4K çıktı tamponu çoğu yanıtın ihtiyacından kat kat fazladır. Evet-hayır yanıtlarını 10 token'la, kısa özetleri 200'le, yapılandırılmış JSON'u şemanızın gerektirdiği kadar artı küçük bir tamponla sınırlayın. Model bazen siz istemeseniz bile sözü uzatmak ister; o uzatmaların bedelini de siz ödersiniz. max_tokens'ı kısmak çoğu durumda çıktı maliyetini %30 ila 50 düşürür.

Getirilen bağlamı her sorgu için yalnızca gerekenle sınırlayın. RAG sistemleri çoğu zaman 10 ila 20 parça getirir ve güvenli olsun diye hepsini prompt'a doldurur. Sonuçta her istekte binlerce alakasız token'ın bedeli ödenir. En alakalı 3 ila 5 parçaya indiren bir yeniden sıralayıcı (reranker) eklemek, girdi token kullanımını genellikle hiç kalite kaybı olmadan %50 ila 70 azaltır; hatta model alakasız bağlamla dağılmadığı için çoğu zaman kaliteyi artırır.

Her isteği token sayısı, kullanılan model ve önbellekli mi önbelleksiz mi olduğu bilgisiyle birlikte kaydedin. Göremediğiniz şeyi optimize edemezsiniz; üstelik AI maliyetleri yeni bir özellik yayınlandığında ya da bir prompt değiştiğinde bir gecede şekil değiştirebilir. Günlük harcama uyarıları kurun. Harcamayı özelliğe, modele ve uç noktaya göre ayrıştıran bir panel oluşturun. Karşılaştığımız üretim maliyet aşımlarının çoğu, biri faturaya bakmadan iki hafta önce bir kullanım kalıbının değişmesinden kaynaklanır.

Milyon token başına maliyet (2026 fiyatlandırması)

ModelGirdiÇıktıÖnbellekli girdi
GPT-4.5$75.00$150.00$37.50
GPT-4o$2.50$10.00$1.25
GPT-4o mini$0.15$0.60$0.075
Claude Opus 4$15.00$75.00$1.50
Claude Sonnet 4$3.00$15.00$0.30
Claude Haiku 4$0.80$4.00$0.08
Gemini 2.5 Pro$1.25$10.00N/A
Gemini 2.5 Flash$0.075$0.30N/A

SSS

Her hafta karşımıza çıkan sorular

Yalın bir dille, kısa yanıtlar. Sorunuzu burada bulamazsanız

GPT-4o: milyon girdi token başına 2,50 $, çıktı 10 $. GPT-4o mini: milyon girdide 0,15 $, çıktı 0,60 $. GPT-4.5: milyon girdide 75 $, çıktı 150 $. Ayda 10 milyon tokenda (30/70 girdi/çıktı dağılımıyla) modele göre 25 $ ile 13.000 $ arası beklenir.

Çoğu iş yükü için GPT-4o mini, Gemini 2.5 Flash veya Claude Haiku 4; hepsi milyon girdi token başına 1 $'ın altında. Kalite-fiyat dengesi için Claude Sonnet 4 veya Gemini 2.5 Pro.

Anthropic ve OpenAI, istekler arasında büyük girdi prompt'larını önbelleğe alır. Önbellekten okunan token'lar yaklaşık %90 daha ucuzdur. Sistem prompt'u sabit kalan chatbot'lar ya da bağlamı sabit RAG sistemleri için idealdir.

Hem girdi hem çıktı token'larında tam %50. Karşılığında 24 saatlik yanıt SLA'sını kabul etmeniz gerekir. Sınıflandırma, özetleme, embedding ve değerlendirme için çok uygun; gerçek zamanlı sohbet ve etkileşimli arayüzler için uygun değil.

Benzer kalite seviyelerinde maliyetler de yakındır. Claude Sonnet 4 ile GPT-4o kabaca başa baştır. Prompt caching ile Claude Opus 4, prompt'un sabit kaldığı iş yüklerinde GPT-4o'dan yaklaşık %30 daha ucuza gelir.

(1) Prompt caching'i açın. (2) Mümkün olan her yerde Batch API kullanın. (3) Basit sorguları mini modellere yönlendirin. (4) max_tokens değerini sıkı tutun. (5) Getirilen bağlamı yalnızca gerekenle sınırlayın.

Başa baş nokta aylık yaklaşık 5.000 $ API harcamasındadır. Bunun altında API kullanmaya devam edin. Üstündeyseniz ve altyapı uzmanlığınız varsa, Llama 3.1 veya Mistral'i kendi sunucunuzda barındırmak maliyeti %50–70 düşürebilir.

Temsil gücü yüksek 100 istekten oluşan bir örnek alın. Ortalama girdi ve çıktı token sayısını ölçün. Aylık istek hacminizle çarpın. Sonra milyon token başına maliyetle çarpın. Üzerine %30 güvenlik payı ekleyin.

Yalnızca orta seviye modellerin yetersiz kaldığı zorlu muhakeme işleri için. Üretim iş yüklerinin %80'inde Sonnet 4, GPT-4o veya Gemini 2.5 Pro, 10 kat daha düşük maliyetle işinizi rahatça görür.

Tipik iş yüklerinde ±%15 aralığında. Gerçekteki sapma şunlardan kaynaklanır: prompt uzunluğundaki değişim, çıktı uzunluğundaki değişim, hata ve yeniden deneme döngüleri ve model yönlendirme mantığı. Hesaplayıcıyı kesin fatura değil, bir planlama aracı olarak kullanın.

Benzer araçlar

Çoğu kişinin hemen bunun ardından açtığı diğer hesaplayıcılar; bir sonraki kararınıza en çok yarayanı seçin.

Ekibimizden net bir tahmin alın

Hesaplayıcılar size bir aralık verir; 30 dakikalık bir görüşme ise net bir kapsam, takvim ve bütçe verir. Görüşme ücretsiz, hiçbir yükümlülük yok.

Konuşmayı başlat