ai-machine-learning

LLM Inference Maliyeti Ne Kadar? Gerçek Hesaplamayla 4 Senaryo

Yazan Mert Batur
Aug 1, 2026
14 okuma
LLM Inference Maliyeti Ne Kadar? Gerçek Hesaplamayla 4 Senaryo

LLM Inference Maliyeti Ne Kadar? Gerçek Hesaplamayla 4 Senaryo

GPT-4, Mart 2023'te milyon girdi tokenı başına 30 $ ile çıktı. Üç yıl sonra GPT-5.6 aynı milyon tokenı 10 $'a işliyor. Claude Opus 4.5 ise 15 $ seviyesinde. Taban fiyat mı? İki sent. Aynı iş birimi için en ucuz ile en pahalı seçenek arasında 1.500 kat fark var. LLM inference maliyeti, eğitilmiş bir model girdinizi okuyup bir çıktı ürettiğinde her seferinde ödediğiniz tekrarlayan faturadır ve büyük sağlayıcıların tamamı bunu milyon token başına fiyatlandırır. Bütçe sınıfı modeller, milyon girdi tokenı başına 0,02-0,30 $ aralığında çalışır. Frontier modeller aynı hacim için 15-75 $ ister. Bu makas önemlidir, çünkü hangi katmana gerçekten ihtiyacınız olduğunu belirleyen şey hırslarınız değil, iş yükünüzdür.

Öne Çıkanlar:

  • Bütçe sınıfı modeller milyon girdi tokenı başına 0,02-0,30 $; frontier modeller 15-75 $ (Temmuz 2026).
  • Çıktı tokenları girdi tokenlarından 3-5 kat pahalıdır; çünkü üretim paralel değil, sıralı ilerler.
  • 50 bin görüşmelik bir destek chatbot'u, model katmanına göre ayda yaklaşık 9-420 $ tutar.
  • Inference fiyatları yılda yaklaşık 10 kat düştü; Gartner 2030'a kadar %90 daha düşük olacağını öngörüyor.

LLM Inference, Milyon Token Başına Ne Kadar?

LLM inference fiyatlandırması, Temmuz 2026 itibarıyla üç katmanlı bir yapı izler. Google (Gemini 2.5 Flash) gibi sağlayıcıların bütçe sınıfı modelleri ve açık kaynak seçenekler (Llama 4, Qwen 3), milyon girdi tokenı başına 0,02-0,30 $ ücret alır. Orta segment modeller (GPT-4.1, Claude Sonnet 4) 0,55 $ ile 15 $ arasına oturur. Frontier akıl yürütme modelleri (o3, Claude Opus 4.5) 15-75 $ aralığındadır. Her sağlayıcı bu oranları resmi fiyat sayfalarında yayımlar (OpenAI, Anthropic); PricePerToken.com ise 300'den fazla modeli canlı bir tabloda takip eder.

Temmuz 2026 itibarıyla bir milyon girdi tokenını iki sente işletebilir ya da aynı milyon token için bir frontier modelde 75 $ ödeyebilirsiniz.

KatmanÖrnek ModellerGirdi $/M TokenÇıktı $/M TokenÖnbellek Girdi $/MEn Uygun Olduğu Alan
BütçeGemini 2.5 Flash, Llama 4 Scout, Qwen 3 32B0,02-0,30 $0,06-1,20 $0,01-0,15 $Yüksek hacimli sınıflandırma, yönlendirme
OrtaGPT-4.1, Claude Sonnet 4, Gemini 2.5 Pro, GPT-5.60,55-15 $2,20-60 $0,28-7,50 $RAG, kod üretimi, analiz
Frontiero3, Claude Opus 4.515-75 $60-300 $7,50-37,50 $Karmaşık akıl yürütme, araştırma

Önbelleğe alınmış girdi indirimleri, tekrarlayan prompt'larda faturanızı %50-90 düşürür (prompt önbellekleme girdi maliyetlerini düşürür yazısı mekaniği anlatıyor). Tüm sağlayıcıların güncel oranlarını içeren 300 modelleri canlı tablo için tam token fiyat tablosu yazımıza bakın.

LLM Inference Maliyetini Ne Belirler? 4 Bileşen

Inference faturanız dört maliyet sürücüsüne ayrılır: token başına GPU hesaplama süresi, model ağırlıkları ve KV önbelleği için bellek, üretimi okumadan daha pahalı yapan girdi/çıktı asimetrisi ve altyapı giderleri (elektrik, soğutma, ağ). Hangi bileşenin iş yükünüzde baskın olduğunu bilmek, optimizasyonun nerede işe yarayacağını gösterir.

BileşenNedirFaturanızdaki PayıNeye Göre Değişir
Hesaplama (GPU süresi)Her tokenı model katmanlarından geçirmek için gereken FLOP%40-60Model boyutu, batch boyutu, kuantizasyon seviyesi
Bellek (ağırlıklar + KV önbelleği)Model parametrelerini ve attention durumunu tutan VRAM%20-35Bağlam uzunluğu, eşzamanlı istekler
Girdi/çıktı asimetrisiDecode aşaması sıralı çalışır, her seferinde bir tokenÇıktı fiyatına dahildirÇıktı uzunluğu, örnekleme stratejisi
Altyapı giderleriElektrik, soğutma, ağ, boşta kalan GPU süresi%10-20Veri merkezi konumu, kullanım oranı

Hesaplama: Token Başına GPU Süresi

Her token, modelin her katmanından geçer. FP16'da 70B parametreli bir model, token başına yaklaşık 140 GFLOP gerektirir. INT4'e kuantizasyon bunu yaklaşık 35 GFLOP'a indirir. NVIDIA'nın inference kıyaslama rehberi tam TCO formülünü ayrıntılandırır: donanım amortismanı artı elektrik artı operasyonel giderler, sunulan token sayısına bölünür.

Bellek: Model Ağırlıkları + KV Önbelleği

FP16'da bir 70B modeli, yalnızca ağırlıklar için yaklaşık 140 GB VRAM kaplar. KV önbelleği, bağlam uzunluğu ve eşzamanlı batch boyutuyla büyür. 128K bağlam ve 32 eşzamanlı istekte bir 80 GB daha harcanabilir. Self-hosting kararlarında modele göre VRAM gereksinimleri tablosunun bu kadar önemli olmasının nedeni budur.

Girdi ve Çıktı Asimetrisi

Çıktı tokenları girdi tokenlarından 3-5 kat pahalıdır; çünkü model onları sırayla, birer birer üretir. Prompt'unuzu okurken yaptığı gibi paralelleştiremez.

Yalın hali şöyle: 2.000 tokenlık prompt'unuzun okunması ("prefill" aşaması), tüm tokenları GPU çekirdekleri arasında aynı anda işler. 500 çıktı tokenının üretilmesi ("decode" aşaması) ise adım başına bir token ile ilerler ve her token bir öncekine bağlıdır. GPU, adımlar arasında çoğunlukla bellek bant genişliğini bekleyerek boşta kalır. Girdi oranının 3-5 katı ödediğiniz şey, işte bu boşta kalma süresidir.

Altyapı Giderleri

Elektrik, soğutma, ağ ve istekler arasında boşta duran GPU'lar. Hugging Face'in optimizasyon dokümanları, continuous batching ve speculative decoding'in aynı donanımdan GPU-saat başına daha fazla token çıkarmayı nasıl sağladığını ve bu gider payını doğrudan düşürdüğünü anlatır.

4 Gerçek İş Yükü İçin LLM Inference Maliyeti Ne?

Tipik bir destek chatbot'u ayda 9-420 $, bir RAG pipeline'ı ayda 168-3.360 $, 200 geliştiricilik bir kod asistanı ayda 123-2.078 $, toplu belge işleme ise ayda 240-6.400 $ aralığında seyreder. Bu makas neredeyse tamamen model katmanı seçimine bağlıdır. Bu dört senaryoyu, müşteri dağıtımlarımızdaki token hacimlerinden yola çıkarak Temmuz 2026 resmi fiyat sayfalarına göre kurduk. Aşağıdaki her dolar rakamı yeniden üretilebilir: belirtilen token varsayımları, yayımlanmış oranlarla çarpıldı. Bu bizim analizimiz, satıcı iddiaları değil.

Müşteri Desteği Chatbot'u: Ayda 50 Bin Görüşme

Ortalama görüşme: 800 girdi tokenı (sistem prompt'u + kullanıcı mesajları + getirilen bağlam), 400 çıktı tokenı. Aylık hacim: 50.000 görüşme = 40 Mn girdi tokenı, 20 Mn çıktı tokenı.

  • Bütçe seçimi (Gemini 2.5 Flash): 40 Mn × 0,075 $/M + 20 Mn × 0,30 $/M = ayda 9 $. Neredeyse şüpheli derecede ucuz.
  • Orta segment seçimi (Claude Sonnet 4): 40 Mn × 3 $/M + 20 Mn × 15 $/M = ayda 420 $.

Birinci seviye destek taleplerini karşılayan bir bot için bütçe modeli, sorguların %90'ını rahatça halleder. Zorlu %10'luk kısmı bir sınıflandırıcıyla orta segmente yönlendirin.

RAG Pipeline'ı: Günde 10 Bin Sorgu

Ortalama sorgu: 3.200 girdi tokenı (getirilen parçalar + sistem prompt'u + kullanıcı sorusu), 600 çıktı tokenı. Aylık: 300.000 sorgu = 960 Mn girdi tokenı, 180 Mn çıktı tokenı.

  • Bütçe seçimi (API üzerinden Llama 4 Scout): 960 Mn × 0,10 $/M + 180 Mn × 0,40 $/M = ayda 168 $.
  • Orta segment seçimi (GPT-4.1): 960 Mn × 2 $/M + 180 Mn × 8 $/M = ayda 3.360 $.

RAG iş yükü girdi ağırlıklıdır, bu yüzden önbelleğe alınmış girdi indirimleri burada sert işe yarar. %70 prompt önbellekleme ile orta segment yaklaşık 2.100 $/ay seviyesine iner.

Kod Asistanı: 200 Geliştirici

Ortalama oturum: 4.500 girdi tokenı (dosya bağlamı + konuşma), 1.200 çıktı tokenı. Geliştirici başına günde 15 istek, 22 iş günü varsayarsak ayda 66.000 istek = 297 Mn girdi, 79 Mn çıktı.

  • Bütçe seçimi (Qwen 3 32B): 297 Mn × 0,20 $/M + 79 Mn × 0,80 $/M = ayda 123 $.
  • Orta segment seçimi (Claude Sonnet 4): 297 Mn × 3 $/M + 79 Mn × 15 $/M = ayda 2.078 $.

Geliştiriciler kalite farkını hemen fark eder. Kod için orta segment genellikle tabandır. Bütçe modelleri otomatik tamamlama tarzı önerilerde iş görür ama çok dosyalı refactor'larda zorlanır.

Toplu Belge İşleme: Ayda 1 Milyon Belge

Ortalama belge: 2.000 girdi tokenı, 300 çıktı tokenı (çıkarma, sınıflandırma, özetleme). Aylık: 2 Mr girdi, 300 Mn çıktı.

  • Bütçe seçimi (Gemini 2.5 Flash): 2 Mr × 0,075 $/M + 300 Mn × 0,30 $/M = ayda 240 $.
  • Orta segment seçimi (GPT-4.1): 2 Mr × 2 $/M + 300 Mn × 8 $/M = ayda 6.400 $.

Bu hacimde katmanlar arası 27 katlık fiyat farkı, ayda 6.160 $'lık bir kalem demektir. Bütçe modeller yapılandırılmış veri çıkarmayı iyi becerir. Bu hacmi kendi altyapınızda çalıştırmayı düşünüyorsanız, donanım boyutlandırması için modele göre VRAM gereksinimleri tablosuna bakın.

İş YüküModelToken/İstek (Girdi/Çıktı)İstek/Ay$/Ay
Destek chatbot'uGemini 2.5 Flash800 / 40050.0009 $
Destek chatbot'uClaude Sonnet 4800 / 40050.000420 $
RAG pipeline'ıLlama 4 Scout3.200 / 600300.000168 $
RAG pipeline'ıGPT-4.13.200 / 600300.0003.360 $
Kod asistanıQwen 3 32B4.500 / 1.20066.000123 $
Kod asistanıClaude Sonnet 44.500 / 1.20066.0002.078 $
Toplu belgeGemini 2.5 Flash2.000 / 3001 Mn240 $
Toplu belgeGPT-4.12.000 / 3001 Mn6.400 $
python
def monthly_cost(input_tokens, output_tokens, requests, price_in, price_out):
    """Estimate monthly LLM inference cost.
    
    Args:
        input_tokens: avg input tokens per request
        output_tokens: avg output tokens per request
        requests: monthly request volume
        price_in: $/M input tokens
        price_out: $/M output tokens
    """
    total_in = input_tokens * requests / 1_000_000
    total_out = output_tokens * requests / 1_000_000
    return (total_in * price_in) + (total_out * price_out)

# Example: support chatbot on Claude Sonnet 4
cost = monthly_cost(
    input_tokens=800,
    output_tokens=400,
    requests=50_000,
    price_in=3.00,
    price_out=15.00
)
print(f"${cost:,.2f}/month")  # $420.00/month

API mi, Kendi Altyapınız mı? Hangisi Ne Zaman Kazanır?

API kazanır: günde yaklaşık 20 bin isteğin altındaysanız veya ekibinizin ML altyapı deneyimi yoksa. Self-hosted kazanır: günde 200 bin isteğin üzerinde ve %50'nin üzerinde sürekli GPU kullanımıyla. Introl'un analizine göre başabaş noktası, tek H100 düğümünde 70B sınıfı bir model için günde yaklaşık 50-80 bin isteğe oturur. Bu eşiğin altında, API sağlayıcısının çok kiracılı verimliliği, sizin tek kiracılı donanım hesabınızı yener.

Hacim SeviyesiAPI $/AySelf-Hosted $/Ay (GPU + Operasyon)KazananNeden
Düşük: günde 2 bin istek150-400 $2.800-4.500 $APIGPU zamanın %85'inde boşta kalır
Orta: günde 20 bin istek1.500-4.000 $3.200-5.000 $API (kıl payı)Kullanım yaklaşık %40'a çıkar, hâlâ başabaşın altında
Yüksek: günde 200 bin istek15.000-40.000 $5.500-8.000 $Self-hosted%70+ kullanım donanımı hızla amorti eder

API'nin Kazandığı Durum

Günler içinde yayına çıkarsınız, haftalar değil. ML mühendisi maaşı yok (yılda 180-250 bin $), GPU arızaları için nöbet rotasyonu yok, kapasite planlaması yok. 50'nin altında mühendisi olan çoğu ekip için API doğru varsayılandır. Nokta.

Kendi Altyapınızın Kazandığı Durum

Günde 200 bin isteği aştıysanız, iş yükünüz öngörülebilirse ve zaten ML altyapı uzmanlarınız varsa. Açık kaynak modeller (Llama 4, Qwen 3, Mistral) kendi donanımınızda, elektrik maliyeti artı amortisman ile çalışır. vLLM ve SGLang kıyaslamaları, iş yükü şekline göre %15-30 throughput farkları gösterir; bu ölçekte bu fark önemlidir.

Başabaş Noktası

Self-hosted yalnızca yaklaşık %50'nin üzerinde sürekli GPU kullanımında kazanır. Bunun altında, boşta kalan silikon için ödeme yaparsınız. Gizli insan maliyetleri (ML mühendis zamanı, nöbet, model güncellemeleri, güvenlik yamaları), ham GPU hesabı lehte görünse bile çoğu ekibin API'de kalmasının asıl nedenidir. Kendi altyapınızı kuracaksanız, Modal üzerinde model dağıtımı, token başına maliyetleri API oranlarının altında tutarken altyapı yönetimi katmanını ortadan kaldırır.

Kimsenin Bütçeye Koymadığı Gizli Maliyetler

Ham token harcaması, gerçek faturanızın %60-80'idir. Geri kalanı, hiçbir fiyat hesaplama aracında görünmeyen altı kalemde gizlenir. Bunları karşılamak için token tahmininizin üzerine %20-40 ekleyin.

  • İzleme ve gözlemlenebilirlik araçları: ayda 200-1.500 $. Token kullanım panoları, gecikme takibi, özellik başına maliyet ataması. Bir LLM gözlemlenebilirlik yığını, bir prompt regresyonunu bütçenizi eritmeden yakaladığınız ilk anda kendini amorti eder.
  • Yeniden deneme ve başarısız çalıştırmalar: isteklerin %3-8'i başarısız olur ya da yeniden deneme gerektirir (zaman aşımları, hız limitleri, hatalı çıktılar). Bu, token faturanızın %3-8'i demektir ve hiçbir şey üretmeden harcanır.
  • Prompt mühendisliği iterasyon saatleri: çeyrek başına 20-60 saat, saat başına 100-200 $ yüklenmiş mühendislik maliyetiyle. Her prompt değişikliği test batch'lerini yeniden çalıştırır.
  • Eval ve regresyon testleri: otomatik eval paketleri için ayda 100-800 $ token harcaması. Modele kendini notlandırtmak için ödeme yaparsınız.
  • Çok bölgeli yedeklilik: gecikme veya uyumluluk için bölgeler arası failover gerekiyorsa 1,5-2 kat altyapı maliyeti.
  • Soğuk başlatma gecikme cezaları: sunucusuz GPU dağıtımları (Modal, AWS Lambda) boşta kalma süresi için ücret alır. Soğuk başlatmalar 2-8 saniye ekler ve ısınma için de fatura kesilir.

Pratik kural: gerçekçi bir bütçe için ham token tahmininizi 1,3 ile çarpın. Uyumluluk yükü olan regüle bir sektördeyseniz 1,4 ile çarpın.

LLM Inference Neden Sürekli Ucuzluyor?

LLM inference fiyatları, 2023'ten bu yana yılda yaklaşık 10 kat düştü. 2024'te ayda 1.000 $'a mal olan bir iş yükü, bugün yaklaşık 100 $'a çıkıyor. Bunu üç güç sürüyor: donanım iyileştirmeleri (NVIDIA Blackwell FP4, Google TPU v6), rekabet baskısı (DeepSeek, fiyat savaşlarını zorlayan açık kaynak modeller) ve yazılım optimizasyonu (speculative decoding, continuous batching, kuantizasyon). Gartner, inference maliyetlerinin 2030'a kadar %90 daha düşeceğini öngörüyor; ama bu bir tahmin, garanti değil.

Epoch AI'ın fiyat takibi, bu düşüşü somut veri noktalarıyla belgeler. a16z'nin "LLMflation" analizi terimi ortaya attı ve ekonomik sonuçlarını çerçeveledi: inference, daha önceki hiçbir hesaplama kategorisinden daha hızlı deflasyona uğruyor.

Eğitim Maliyeti ve Inference Maliyeti

Frontier bir modelin eğitimi 50-200 Mn $ tutar (tek seferlik). Aynı modelin tüm kullanıcılardaki inference'ı, ölçeğe bağlı olarak yılda 5-50 Mn $ tutar. Çoğu ekip için oran 10-100 kattır: eğitim, bir yıllık inference maliyetinin 10-100 katına mal olur. Ama eğitim tek seferlik bir sermaye harcamasıdır. Inference ise kullanıcı büyümesiyle katlanan, tekrarlayan işletme faturasıdır. Bir temel model inşa etmiyorsanız eğitim için ödeme yapmazsınız. Inference için ise her gün ödeme yaparsınız.

Enerji Kalemi

Bir NVIDIA H100, yük altında yaklaşık 700W çeker. 0,10 $/kWh (ABD ortalaması) ile bu, GPU-saat başına 0,07 $ demektir. Tek H100'de bir 70B modeli, batch ile saniyede yaklaşık 2.000 çıktı tokenı üretir. Bir saatte: 7,2 Mn token. Milyon çıktı tokenı başına elektrik maliyeti: yaklaşık 0,01 $. Kendi hesabımızdır, böyle etiketledik. Enerji, API faturanızın %1-3'üdür ama self-hosted TCO'nun %8-15'idir. Kendi GPU'larınızı elektriğin pahalı olduğu bir bölgede çalıştırıyorsanız (0,30 $/kWh ile Almanya bu rakamı üçe katlar) enerji daha da önem kazanır.

Pratik çıkarım: fiyatlar o kadar hızlı düşüyor ki belirli bir model katmanına 12 aylık taahhüt risklidir. Çeyreklik olarak yeniden değerlendirin. LLM faturanızı düşürmenin 12 yolu, makro trend ağır işi yaparken hemen uygulayabileceğiniz taktik hamleleri kapsar.

Kendi Inference Maliyetinizi Nasıl Hesaplarsınız?

Aylık LLM inference maliyetinizi dört adımda tahmin edin: istek başına tokenları sayın, aylık hacimle çarpın, katman fiyatını uygulayın, sonra %20-40 gider ekleyin. Müşteriler için inference bütçesi boyutlandırma deneyimimizde, çoğu ekip dördüncü adımı atlar ve gerçek faturanın tahmini neden üçte bir aştığını merak eder. Kullandığımız süreç şu.

  1. İstek başına tokenları sayın. 100'den fazla gerçek istek boyunca ortalama girdi tokenlarınızı (sistem prompt'u + bağlam + kullanıcı mesajı) ve çıktı tokenlarınızı (model yanıtı) kaydedin. Tahmin etmeyin. Ölçün.
  2. Aylık hacimle çarpın. Günde istek × 30 = aylık istek. Bunu istek başına token sayılarınızla çarpın.
  3. Katman fiyatını uygulayın. Toplam girdi tokenlarını modelin $/M girdi oranıyla çarpın. Çıktı için aynısını yapın. İkisini toplayın.
  4. %20-40 gider ekleyin. Yeniden denemeler, eval'lar, prompt iterasyonu, izleme. Bütçenize girecek rakam budur, 3. adım değil.
python
def estimate_monthly_budget(avg_input_tokens, avg_output_tokens,
                            requests_per_day, price_in, price_out,
                            overhead_pct=0.30):
    """Full monthly budget estimate with overhead."""
    monthly_requests = requests_per_day * 30
    raw_cost = monthly_cost(
        avg_input_tokens, avg_output_tokens,
        monthly_requests, price_in, price_out
    )
    return raw_cost * (1 + overhead_pct)

# RAG pipeline: 10K queries/day on GPT-4.1
budget = estimate_monthly_budget(
    avg_input_tokens=3200,
    avg_output_tokens=600,
    requests_per_day=10_000,
    price_in=2.00,
    price_out=8.00,
    overhead_pct=0.30
)
print(f"${budget:,.0f}/month")  # $4,368/month

Kendi rakamınızı bildiğinizde, LLM gateway araçları trafiği, kalite çıtanızı geçen en ucuz modele yönlendirir. İstek başına model seçimi yapabilen bir gateway, prompt'larınıza dokunmadan harmanlanmış maliyetinizi %30-50 düşürebilir.

Yazar Hakkında

Mert Batur, Techsy.io'nun Kurucu Ortağıdır; ekibi B2B müşteriler için AI ajanları, otomasyon sistemleri ve ses/SDR pipeline'ları geliştirir. Techsy ekibinin üretimde gerçekten kullandığı LLM araç yığını hakkında yazar. LinkedIn'den bağlanın.

Sıkça Sorulan Sorular

LLM inference pahalı mı?

Ölçeğe ve model seçimine bağlıdır. Bir milyon girdi tokenı, Gemini 2.5 Flash'ta 0,02 $, frontier bir akıl yürütme modelinde 75 $ tutar. Günde 10 bin istek işleyen küçük bir uygulama için ayda 50-400 $ bekleyin. Günde 1 Mn+ isteğe çıkan kurumsal iş yüklerinde bütçeler ayda 5.000-40.000 $ aralığında seyreder. Birim maliyet düşüktür; hacim onu büyütür.

LLM'de 1 milyon token ne kadara denk gelir?

Bir milyon token yaklaşık 750.000 kelimeye, yani yaklaşık 10 tam uzunlukta romana denk gelir. Temmuz 2026'da 1 Mn girdi tokenını işlemek 0,02 $ (bütçe katmanı) ile 75 $ (frontier katmanı) arasındadır. Aynı hacim için çıktı tokenları 0,06 $ ile 300 $ aralığındadır. Üretim iş yüklerinin çoğu orta segmente oturur: milyon girdi tokenı başına 2-15 $.

AI inference neden bu kadar pahalı?

Inference, her tokenın, tanesi 25.000-40.000 $ olan GPU'larda milyarlarca model parametresinden geçirilmesini gerektirir. Decode aşaması tokenları sıralı üretir ve GPU çekirdeklerini adımlar arasında boşta bırakır. Uzmanlaşmış donanıma, elektriğe, soğutmaya ve sunum yığınını 7/24 ayakta tutan sağlayıcının mühendislik ekibine ödeme yaparsınız.

AI inference maliyetleri düşüyor mu?

Evet, 2023'ten bu yana yılda yaklaşık 10 kat. GPT-4, milyon token başına 30 $/60 $ (girdi/çıktı) ile çıktı. Eşdeğer kapasite bugün 2-10 $ tutuyor. Epoch AI'ın verileri bu gidişatı tüm sağlayıcılarda doğrular. Gartner, donanım iyileştirmeleri ve açık kaynak modellerin rekabet baskısıyla 2030'a kadar %90'lık bir düşüş daha öngörüyor.

2026'da LLM inference maliyeti ne kadar?

Bütçe modeller: milyon girdi tokenı başına 0,02-0,30 $. Orta segment: 0,55-15 $. Frontier: 15-75 $. Tipik bir üretim iş yükü (destek chatbot'u, RAG pipeline'ı veya kod asistanı), orta segment modellerde ayda 150-4.000 $ tutar. Bütçe modeller, yüksek hacimli ve düşük karmaşıklıktaki işleri 10-30 kat ucuza halleder.

Eğitim maliyeti ile inference maliyeti arasındaki fark nedir?

Eğitim, bir modeli sıfırdan öğretmenin tek seferlik gideridir: frontier bir model için 50-200 Mn $, aylarca binlerce GPU gerekir. Inference, eğitilmiş o modeli kullanmanın tekrarlayan maliyetidir: girdileri içinden geçirip çıktı almak, token başına faturalandırılır. Çoğu ekip için ödenen tek fatura inference'tır. Eğitim, temel model inşa eden şirketler içindir.

Uygulamamın LLM inference maliyetini nasıl hesaplarım?

İstek başına ortalama girdi tokenlarını aylık istek hacminizle, sonra modelin $/M girdi oranıyla çarpın. Çıktı tokenları için aynısını yapın. İkisini toplayın. Yeniden deneme, eval ve izleme giderleri için %30 ekleyin. Bu yazıdaki Python parçacıkları hesabı otomatikleştirir. Tahmin yürütmek yerine gerçek token sayılarını ölçün; 100'den fazla isteğin logları güvenilir bir ortalama verir.

Çıktı tokenları girdi tokenlarından daha mı pahalı?

Evet, genellikle 3-5 kat. Girdi işleme (prefill) tüm tokenları aynı anda paralelleştirir ve GPU çekirdeklerini tam kullanır. Çıktı üretimi (decode) her seferinde bir token üretir ve her token öncekine bağlıdır. GPU, adımlar arasında bellek bant genişliğini bekler. Sağlayıcılar, bu düşük donanım verimliliğini yansıtmak için çıktıyı daha yüksek fiyatlandırır.

Kendi altyapımda çalıştırmak API'den daha mı ucuz?

Yalnızca günde yaklaşık 200 bin isteğin üzerinde ve %50'nin üzerinde sürekli GPU kullanımıyla. Bunun altında, API sağlayıcılarının çok kiracılı verimliliği sizin tek kiracılı donanımınızı yener. Self-hosting ayrıca gizli maliyetler ekler: ML mühendisi maaşları (yılda 180-250 bin $), nöbet rotasyonları, model güncellemeleri ve güvenlik yamaları. 50'nin altında mühendisi olan çoğu ekip API'de kalmalı.

LLM inference çok enerji harcar mı?

Bir H100 GPU, yük altında yaklaşık 700W çeker. 0,10 $/kWh ile bu, GPU-saat başına 0,07 $ demektir ve bir 70B modeli için milyon çıktı tokenı başına yaklaşık 0,01 $'a karşılık gelir. Enerji, API faturasının %1-3'üdür ama self-hosted TCO'nun %8-15'idir. Elektriğin pahalı olduğu bölgelerde (Almanya, 0,30 $/kWh) enerji payı üçe katlanır ve self-hosting ekonomisini somut biçimde etkiler.

Özet

Akılda tutulacak dört rakam: 0,02 $ (milyon girdi tokenı başına bütçe tabanı), 3-5 kat (çıktının girdiye primi), %20-40 (ham token hesabının üzerine eklenecek gider) ve 10 kat (2023'ten bu yana yıllık fiyat düşüşü). Gerçek faturanız hacme, model katmanına ve trafiği ne kadar agresif önbelleğe aldığınıza, batch'lediğinize ve yönlendirdiğinize bağlıdır.

Techsy'de ekibimiz, üretimde LLM iş yükü çalıştıran B2B müşteriler için inference bütçelerini boyutlandırır ve model katmanlarını seçer. Maliyet modelinize ikinci bir göz isterseniz, ücretsiz danışmanlık alın.

Etiketler

llm inference maliyetillm inference fiyatlandırmasımilyon token başına maliyetgpu kullanımıself-hosted inference

Bu makaleyi paylaş

Projenize Başlayın

Harika bir şey inşa etmeye hazır mısınız?

Vizyonunuzu hayata geçirelim. Fark yaratan yazılımlar için ekibimiz hazır.