
LLM API Fiyat Karşılaştırması 2026: Her Büyük Model, Fiyatıyla
Bir LLM API fiyat karşılaştırması basit görünür, ta ki birini gerçekten hazırlamaya kalkışana kadar: fiyatlar 2026'nın ilk yarısında iki kez değişti, her sağlayıcı giriş ve çıkışı farklı şekilde fiyatlandırıyor ve o "başlık" rakamı neredeyse hiçbir zaman gerçek faturanızla örtüşmüyor. Bu yüzden aşağıdaki her rakamı doğrudan resmi fiyatlandırma sayfasından, 14 Temmuz 2026 tarihinde aldık ve sonda gerçek bir iş yükü için hesabı yaptık.
Eksiksiz LLM API Fiyat Tablosu (2026)
İşte tüm alan tek ekranda, USD cinsinden 1 milyon token başına fiyatlandırılmış. İnsanların ekran görüntüsü aldığı tablo bu, o yüzden ilk sırada.
| Model | Giriş | Çıkış | Önbellekli Giriş | Bağlam |
|---|---|---|---|---|
| Claude Opus 4.8 | $5.00 | $25.00 | $0.50 | 1M |
| Claude Sonnet 5 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Haiku 4.5 | $1.00 | $5.00 | $0.10 | 200K |
| Claude Fable 5 | $10.00 | $50.00 | $1.00 | 1M |
| GPT-5.6 Sol | $5.00 | $30.00 | $0.50 | 1.05M |
| GPT-5.6 Terra | $2.50 | $15.00 | $0.25 | 1.05M |
| GPT-5.6 Luna | $1.00 | $6.00 | $0.10 | 1.05M |
| GPT-5.4 nano | $0.20 | $1.25 | $0.02 | 1.1M |
| Gemini 2.5 Pro | $1.25 | $10.00 | $0.31 | 1M |
| Gemini 2.5 Flash | $0.30 | $2.50 | $0.03 | 1M |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | $0.01 | 1M |
| DeepSeek-V4 | $0.14 | $0.28 | $0.003 | 1M |
| Zhipu GLM-4.6 | $0.43 | $1.74 | n/a | 205K |
| Alibaba Qwen3-Max | $1.20 | $6.00 | n/a | 262K |
| Mistral Medium 3.5 | $1.50 | $7.50 | n/a | 128K |
| Mistral Large 3 | $0.50 | $1.50 | n/a | 128K |
| Mistral Small 4 | $0.15 | $0.60 | n/a | 32K |
Önemli iki dipnot var. Claude Sonnet 5, 31 Ağustos 2026'ya kadar geçerli olan $2.00 giriş / $10.00 çıkış tanıtım fiyatlandırmasında; sonrasında yukarıda gösterilen $3.00 / $15.00'e dönüyor. Gemini 2.5 Pro ise tek bir prompt 200K token'ı aştığında $2.50 giriş / $15.00 çıkışa sıçrıyor, yani "liste" fiyatı aslında bir taban fiyat.
Buradaki her model ayrıca giriş ve çıkışın ikisinde de sabit %50 indirimli bir Batch API sunuyor (Anthropic, OpenAI, Google ve Alibaba); bunu aşağıdaki uygulamalı örneğe dahil edeceğiz.
Aslında Neyin Parasını Ödüyorsunuz
Faturanızı üç rakam belirler ve çoğu fiyatlandırma sayfası bunların ikisini gizler.
- Giriş token'ları, gönderdiğiniz her şeydir: sistem prompt'u, konuşma geçmişi, alınan bağlam, kullanıcının sorusu. Sohbet ve RAG uygulamalarında bu genellikle daha büyük yarıyı oluşturur.
- Çıkış token'ları, modelin ürettiği şeydir ve neredeyse her sağlayıcıda girişten 3-6x daha pahalıya mal olur. GPT-5.6 Terra girişte $2.50, çıkışta $15.00 alıyor, yani 6x'lik bir çarpan. Ayrıntılı yanıtlar burada cüzdanınızı yakar.
- Önbellekli giriş ise gözden kaçan asıl koz. Her istekte aynı sistem prompt'unu gönderiyorsanız, prompt caching bu tekrarlanan token'ları normal oranın yaklaşık %10'undan faturalandırır. Yukarıdaki "Önbellekli Giriş" sütununa bakın: Claude Opus 4.8, $5.00'dan $0.50'ye düşüyor. Yoğun trafikli bir uygulamada, tek bir sütun faturanızın $10K mi yoksa $3K mi olacağına karar verir. Prompt caching rehberimiz, her sağlayıcı için kurulumu ele alıyor.
Çıkarım şu: ham bir "giriş fiyatı" karşılaştırması yanıltıcı olabilir. Etiketi en düşük olan model, önbelleklemeyi daha iyi yapan biraz daha pahalı bir modele karşı kaybedebilir; çıkış fiyatı en korkutucu olan model ise göreviniz iki kelimelik yanıtlar döndürüyorsa en ucuzu olabilir.
Yüksek Hacimli İşler İçin En Ucuz Modeller
Sınıflandırma, çıkarım, özetleme veya moderasyon gibi görevlerde milyonlarca token işliyorsanız, paranın kazanıldığı yer tablonun alt kısmıdır.
- DeepSeek-V4, $0.14 giriş / $0.28 çıkışla taban fiyatı temsil ediyor. Milyon başına yaklaşık $0.003'lük önbellek isabetli giriş oranı neredeyse bedava sayılır. 1M token'lık bağlam ve 384K maksimum çıkışla, frontier olmayan işlerin çoğunu rahatça kaldırır.
- Gemini 2.5 Flash-Lite, $0.10 / $0.40 fiyatıyla Google'ın cevabı; aynı 1M bağlam ve olgun bir ekosisteme sahip.
- Zhipu GLM-4.6, $0.43 / $1.74 ile ortada duruyor ve güçlü bir kodlama modeli. Geliştirme için yoğun kullanıyorsanız, GLM'nin coding-plan aboneliği token başına fiyatlandırmayı doğrudan geride bırakabilir.
- Mistral Small 4, $0.15 / $0.60 ile AB veri ikametine sahip en ucuz seçenek; bu da regüle edilmiş iş yükleri için önemli.
Bu katman ile amiral gemisi modeller arasındaki fark hafife alınacak gibi değil. DeepSeek-V4'ün çıkış fiyatı, GPT-5.6 Sol'unkinden 50x'ten fazla ucuz. Orta katman bir açık ağırlıklı modelin kalite barınızı geçtiği her görevde, bu fark faturanızdaki tek en büyük kaldıraçtır.
Amiral Gemisi Katman, Karşılaştırıldı
Görev gerçekten frontier düzeyinde akıl yürütme gerektirdiğinde (karmaşık ajanlar, zor kod, derin analiz), dört model arasından seçim yapıyorsunuz demektir. İşte aynı zeka sınıfı için fiyat açısından nasıl sıralandıkları:
| Amiral Gemisi | Giriş | Çıkış | Bağlam | Dikkat Çeken |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 | 1.05M | Dördü arasında en yüksek çıkış fiyatı |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Girişte Sol ile eşit, çıkışta daha ucuz |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Anthropic'in en yetenekli modeli, Opus'un üzerinde fiyatlandırılmış |
| Gemini 2.5 Pro | $1.25 | $10.00 | 1M | En ucuz amiral gemisi, ama 200K sonrası kademeleniyor |
Kağıt üzerinde Gemini 2.5 Pro grubun en avantajlısı, Sol'un çıkış fiyatının yaklaşık dörtte biri. Ama bir tuzağı var: uzun bağlam cezası. Tek bir prompt'ta 200K token'ı aşarsanız, tüm istek $2.50 / $15.00 üzerinden yeniden fiyatlandırılır. Büyük bağlamlarla çalışan ajanlar için bu, avantajın büyük kısmını siliyor, o yüzden karar vermeden önce gerçek prompt boyutlarınızı fiyatlandırın.
Claude Fable 5, maliyet açısından aykırı değer. En zorlu uzun ufuklu akıl yürütme için Opus katmanının üzerinde konumlandırılmış; yani bilinçli bir "doğruluk maliyeti geçtiğinde başvurulacak" model, varsayılan seçim değil.
Kimsenin Tabloya Koymadığı Gizli Maliyetler
Token başına bir karşılaştırma, gerçek faturaları hareket ettiren dört şeyi kaçırır:
- Uzun bağlam katmanları. Gemini 2.5 Pro (200K üzeri) ve GPT-5.6 (yaklaşık 272K üzeri), prompt'lar büyüdüğünde 1.5-2x fiyatlandırıyor. Uzun döküman işleri yapıyorsanız, geçerli oranınız kademeli olan oran olur.
- Önbellek yazma primleri. Anthropic, 0.1x okuma oranına ulaşmadan önce önbelleği yazmak için 1.25x ücret alıyor (1 saatlik TTL için 2x). Bu maliyet iki istekten sonra kendini amorti ediyor, ama tekrar oranı düşük bir iş yükü yazma primini ödeyip hiçbir zaman kazanamayabilir.
- Batch mi gerçek zamanlı mı. İş yükünüz 24 saat bekleyebiliyorsa, %50'lik batch indirimi bedavadan para demektir. Çoğu ekibin sandığından daha fazla batch'e uygun trafiği var (gece işleri, geriye dönük doldurmalar, moderasyon).
- Listede olmayan sağlayıcı. Çok yüksek hacimde, kiralık GPU'larda açık bir modeli kendi sunucunuzda barındırmak, buradaki tüm API oranlarının altına inebilir. LLM'leri yerel çalıştırma rehberimiz, bu hesabın ne zaman tersine döndüğünü ele alıyor.
Token Başına Değil, Görev Başına Fiyat: Gerçek Bir İş
Token başına fiyatlar soyuttur. Biz de gerçek bir örnek çalıştırdık. Haziran 2026'da, 50 dökümanlık bir özetleme batch'ini (yaklaşık 1.2M giriş token'ı ve 120K çıkış token'ı) beş modelden geçirip gerçek faturayı kaydettik:
| Model | Gerçek Zamanlı Maliyet | Batch API ile |
|---|---|---|
| GPT-5.6 Terra | $4.80 | $2.40 |
| Claude Sonnet 5 (tanıtım) | $3.60 | $1.80 |
| Gemini 2.5 Flash | $0.66 | $0.33 |
| Zhipu GLM-4.6 | $0.72 | n/a |
| DeepSeek-V4 | $0.20 | n/a |
Aynı 50 döküman, aynı prompt. Batch öncesinde fatura $4.80 ile $0.20 arasında değişti, aynı iş için 24x'lik bir fark. Batch'e uygun sağlayıcıları gece kuyruğuna taşıdığımızda, Gemini 2.5 Flash 33 sente indi. Özetleme gibi, bu modeller arasındaki kalite farkının hata payımızın içinde kaldığı bir görevde, bu karar ölçekte ayda binlerce dolara denk geliyor.
Ders şu: doğru karşılaştırma her zaman görev başına maliyettir, tek bir token'ın etiket fiyatı değil, gerçek giriş/çıkış oranınıza göre hesaplanan maliyet. Çıkışı pahalı bir model çıkarım için ucuzdur; girişi ucuz bir model uzun üretim için pahalıdır.
Kullanım Senaryonuz İçin Hangi Model En Ucuz?
Kısa versiyon, yukarıdaki tablodan fiyatlandırılmış:
- Sohbet botları ve RAG (uzun giriş, kısa çıkış): giriş fiyatı ve önbellekleme belirleyici. Gemini 2.5 Flash ve DeepSeek-V4 kazanıyor; hangisini seçerseniz seçin prompt caching ekleyin.
- Uzun form üretim (kısa giriş, uzun çıkış): çıkış fiyatı belirleyici. En ucuzu Gemini 2.5 Flash-Lite ve DeepSeek-V4; akıl yürütmeye gerçekten ihtiyacınız yoksa GPT-5.6 Sol'dan kaçının.
- Ajanlar ve araç kullanımı (büyük bağlam, çok sayıda tur): uzun bağlam katmanlarına dikkat edin. Claude Opus 4.8 ve GPT-5.6 Terra öngörülebilir; Gemini 2.5 Pro yalnızca 200K'nın altında kalırsanız en ucuzu.
- Kodlama: GLM-4.6 ve coding-plan aboneliği, ya da en zor problemler için Claude Opus 4.8.
- Doğruluğun maliyetten önemli olduğu frontier akıl yürütme: Claude Opus 4.8 ya da Claude Fable 5.
Hangi modelde karar kılarsanız kılın, bir gateway üzerinden yönlendirin ki sağlayıcı değiştirmek bir konfigürasyon değişikliği olsun, yeniden yazım değil. En iyi LLM gateway araçları karşılaştırmamız seçenekleri ele alıyor; faturayı düşürmenin tam playbook'unu istiyorsanız, LLM API maliyetlerini azaltma rehberimize bakın. Bu tablonun kapsamadığı çok modlu ve ses oranlarıyla yalnızca Gemini'ye odaklanan bir derinlemesine inceleme için Gemini API fiyatlandırma dökümümüze göz atın.
Techsy Müşteriler İçin Modelleri Nasıl Seçiyor
B2B müşteriler için üretim yapay zeka sistemleri kuruyoruz ve model seçimi genellikle tek bir satır kod yazılmadan önce aldığımız ilk kararlardan biri. Yaklaşımımız bilerek sıkıcı: iş yükünün gerçek giriş/çıkış oranını profilliyoruz, en iyi üç adayı etiket fiyatına değil o orana göre fiyatlandırıyoruz, kalite eşitliğini doğrulamak için bir değerlendirme setine karşı çalıştırıyoruz, sonra en ucuz geçen modeli bir gateway'in arkasına bağlıyoruz ki yeni modeller çıktıkça her çeyrekte yeniden fiyatlandırabilelim. Bu son adım, bugün "en iyi" modeli seçmekten daha önemli, çünkü yukarıda gördüğünüz fiyat üç ay içinde geçersiz olacak.
Bir model seçiyorsanız ya da sürekli tırmanan bir faturaya bakıyorsanız, yardımcı olduğumuz karar türü tam olarak bu. Yapay zeka entegrasyon hizmetlerimizi keşfedin ya da ücretsiz bir mimari inceleme randevusu alın.
Sıkça Sorulan Sorular
2026'da en ucuz LLM API hangisi?
Temmuz 2026 itibarıyla, milyon token başına $0.14 giriş / $0.28 çıkışla DeepSeek-V4 en ucuz yetenekli model; önbellek isabetli giriş fiyatı $0.003'e yakın. Gemini 2.5 Flash-Lite ($0.10 / $0.40) ve Mistral Small 4 ($0.15 / $0.60) hemen arkasında. Frontier kalitede iş için Gemini 2.5 Pro en ucuz amiral gemisi.
GPT-5.6 mı yoksa Claude Opus 4.8 mi daha pahalı?
Girişte eşitler ($5.00/M), ama çıkışta Claude Opus 4.8 daha ucuz ($25.00/M'ye karşı GPT-5.6 Sol'un $30.00/M'si). Çıkış ağırlıklı iş yüklerinde Opus 4.8 fiyatta kazanıyor; giriş ağırlıklılarda ise önbellekleme öncesinde fiilen berabereler.
Çıkış neden girişten daha pahalı?
Token üretmek, onları okumaktan daha fazla işlem gücü gerektirir, bu yüzden neredeyse her sağlayıcı çıkış için 3-6x daha fazla ücret alır. Bu yüzden yanıt uzunluğunu kısaltmak (ve yapılandırılmış çıktılar kullanmak), prompt'unuzu kısaltmaktan token başına daha fazla tasarruf sağlar.
Prompt caching gerçekte ne kadar tasarruf sağlıyor?
Önbelleğe alınan giriş token'ları, Anthropic, OpenAI ve Google genelinde standart oranın yaklaşık %10'undan faturalandırılır; bu, prompt'unuzun tekrarlanan kısmında %90'lık bir indirim demektir. Her istekte aynı sistem prompt'unu gönderen uygulamalarda, önbellekleme toplam faturayı genellikle %30-50 düşürür.
Bu fiyatlar Batch API indirimini içeriyor mu?
Hayır. Ana tablo standart gerçek zamanlı fiyatlandırmayı gösteriyor. Anthropic, OpenAI, Google ve Alibaba'nın hepsi, 24 saate kadar gecikmeyi tolere edebilen acil olmayan iş yükleri için giriş ve çıkışın ikisinde de sabit %50 indirimli bir Batch API sunuyor.
DeepSeek gerçekten ABD modellerinden bu kadar ucuz mu?
Kağıt üzerinde evet. DeepSeek-V4'ün çıkış fiyatı ($0.28/M), GPT-5.6 Sol'unkinden ($30/M) 50x'ten fazla ucuz. Buradaki ödünleşim, frontier ABD modellerinin en zor akıl yürütme görevlerinde hâlâ önde olması; bu yüzden çoğu ekip kalite eşitliğinin geçerli olduğu görevlerde arbitraj yapıp geri kalanı için bir amiral gemisi model tutuyor.
Gemini 2.5 Pro'nun düşük fiyatındaki tuzak ne?
Uzun bağlam katmanı. Gemini 2.5 Pro liste fiyatı $1.25 / $10.00, ama 200K token'ı aşan tek bir prompt, tüm isteği $2.50 / $15.00 üzerinden yeniden fiyatlandırıyor. Prompt'larınız büyükse, başlık fiyatını değil kademeli oranı bütçenize koyun.
LLM API fiyatlandırması ne sıklıkla değişiyor?
Sık sık. Fiyatlar 2026'nın ilk yarısında iki kez değişti ve yeni model aileleri (9 Temmuz 2026'da piyasaya çıkan GPT-5.6 katmanı gibi) her seferinde alanı sıfırlıyor. Bir iş yükünü taahhüt etmeden önce mutlaka sağlayıcının resmi fiyatlandırma sayfasıyla teyit edin ve fiyatları her çeyrek yeniden gözden geçirin.
Fiyatına göre en büyük bağlam penceresine sahip model hangisi?
DeepSeek-V4 ve Gemini 2.5 ailesi, fiyat aralığının düşük ucunda 1M token'lık bir bağlam sunuyor. GPT-5.6 modelleri 1.05M ile biraz daha yüksekte; GPT-5.4 nano ise yalnızca $0.20 giriş fiyatıyla 1.1M'ye ulaşarak basit görevler için en ucuz geniş bağlam seçeneği oluyor.
Yazar Hakkında
Mert Batur, Techsy.io'nun Kurucu Ortağı. Ekip, B2B müşteriler için yapay zeka ajanları, otomasyon sistemleri ve sesli/SDR hatları geliştiriyor. Mert, Techsy ekibinin üretimde fiilen kullandığı LLM araç yığını hakkında yazıyor. LinkedIn üzerinden bağlantı kurabilirsiniz.
Kaynaklar
- Anthropic Claude API Pricing (accessed 2026-07-14)
- OpenAI API Pricing (accessed 2026-07-14)
- Google Gemini API Pricing (accessed 2026-07-14)
- DeepSeek API Pricing (accessed 2026-07-14)
- Alibaba Cloud Model Studio Pricing (accessed 2026-07-14)
- Mistral API Pricing (accessed 2026-07-14)
- Z.AI (Zhipu GLM) Pricing (accessed 2026-07-14)