Techsy
Bize Ulaşın
Başla
Bloga Dön
ai-machine-learning

Serverless GPU'da LLM Dağıtımı: 5 Platform, Gerçek Fiyatlar, Dürüst Cold Start Verileri

Yazan Mert Batur
Aug 8, 2026
12 okuma
İçindekiler
Serverless GPU'da LLM Dağıtımı: 5 Platform, Gerçek Fiyatlar, Dürüst Cold Start Verileri

Serverless GPU'da LLM Dağıtımı: 5 Platform, Gerçek Fiyatlar, Dürüst Cold Start Verileri

RunPod, A100 80GB için saatte 2,72 $ alıyor. Endpoint'iniz öğlene kadar on iki istek alıyor. GPU kalan 23 saat boşta duruyor ve fatura tüm bu süre boyunca işliyor. LLM'i serverless GPU üzerinde dağıttığınızda yalnızca bir istek çalışırken ödeme yaparsınız. Bunu yapan beş platform var. Beşi de beş farklı birimle faturalandırıyor. Hiçbiri bunları normalize etmiyor.

Boşta duran bir GPU, meşgul olanla tam olarak aynı maliyete sahiptir.

Öne Çıkanlar

  • Serverless GPU yalnızca bir istek çalışırken faturalandırılır ve istek aralarında sıfıra ölçeklenir.
  • Cloud Run'da örnek başına tek GPU; 70B modeller çoklu GPU gerektirir, bu yüzden serverless genellikle bunları barındıramaz.
  • Model ağırlıkları ya imajın içinde yaşar, ya ağ diskinde durur, ya da her cold start'ta yeniden indirilir.
  • Cold start üç şeydir: konteyner açılışı, ağırlık yükleme, motor başlatma. Yalnızca ilki hızlıdır.
  • Günde yaklaşık 47.000 isteğin altında, sıfıra ölçeklenme 7/24 kiralık GPU'yu maliyette yener.

'Serverless GPU' bir LLM için gerçekte ne anlama gelir?

Serverless GPU platformu, çıkarım konteynerinizi paylaşımlı GPU donanımında çalıştırır, bir istek geldiğinde onu başlatır ve trafik durduğunda sıfıra ölçekler. Yalnızca konteyner hayattayken, saniye başına (veya sağlayıcıya göre dakika ya da saat) ödeme yaparsınız. Boşta fatura yok. Rezerve örnek yok.

Faturalandırma birimi sağlayıcıya göre değişir; bir sonraki bölümde her şeyi $/GPU-saat cinsine normalize etmemizin nedeni budur.

İki kısıt insanları şaşırtır. Birincisi, Google Cloud Run örnek başına en fazla bir GPU'ya izin verir. Bu, VRAM tavanınızı tek kartla sınırlar. İkincisi, "serverless" kalıcı durum anlamına gelmez. İstekler arasında ağırlıklarınızı RAM'de tutan uzun ömürlü bir süreç yoktur. Konteyner öldüğünde bellekteki her şey onunla birlikte ölür. İşte bu tek gerçek, aşağıdaki model ağırlıkları bölümündeki depolama kararını yönlendirir.

Serverless, sunucu yok demek değildir. İsteklerinizin arasında sunucu yok demektir ve model ağırlıklarınızın ortadan kaybolduğu yer de tam olarak burasıdır.

Hangi serverless GPU platformunu seçmelisiniz? (2026 fiyatları, yan yana)

Bu platformların hiçbirini satmıyoruz ve hiçbirinden affiliate geliri almıyoruz. Bu sorgu ve yakın varyantları için yarışan yedi makaleden dördü, serverless GPU satan bir şirket tarafından yayınlanmış. Bu tablo öyle değil.

Tüm oranlar 30.07.2026 tarihinde sağlayıcıların kendi fiyatlandırma sayfalarından okundu. Oranlar değişir; taahhüt vermeden önce tekrar kontrol edin.

PlatformYayınlanan birim (kendi ifadeleriyle)$/GPU-saat (A100 80GB)$/GPU-saat (H100)Ücretsiz kredilerŞu durumda seçin...
Modal0,000694 $/sn2,50 $3,95 $30 $/ay Startersaniyelik faturalandırma, hızlı build ve GPU snapshot istiyorsanız
RunPod2,72 $/saat2,72 $4,55 $yayınlanmamışsabit saatlik oranlarla en geniş GPU menüsünü istiyorsanız
Beam0,000625 $/sn2,25 $3,55 $30 $/aybaşlatma ve imaj yükleme için sıfır fatura istiyorsanız
Baseten0,06667 $/dk4,00 $6,50 $evet, tutar yayınlanmamışaktif işlem faturalı yönetilen çıkarım istiyorsanız
Cloud Runsaniyelik (L4 ve RTX PRO 6000 Blackwell; A100/H100 yok)yayınlanmamış (A100 yok)yayınlanmamış (H100 yok)300 $ GCP kredisizaten GCP'deyseniz ve AB/ABD bölge kontrolü gerekiyorsa

Normalize etme aritmetiği, denetleyebilmeniz için bir kez gösteriliyor: Modal A100 80GB, 0,000694 $/sn çarpı 3600 saniye eşittir 2,4984 $/saat. Beam: 0,000625 çarpı 3600 eşittir 2,25 $/saat. Baseten: 0,06667 $/dk çarpı 60 eşittir 4,00 $/saat. Aynı A100 için Beam ile Baseten arasındaki 1,8 katlık fark gerçek ve göz önünde saklanıyor, çünkü hiç kimse aynı birimi yayınlamıyor.

Üç uyarı. Beam'in fiyatlandırma sayfası, sunucu başlatma veya konteyner imajı yükleme için fatura kesmediğini açıkça belirtir. Baseten'in fiyatlandırma SSS'si "Baseten'de boşta süre için ödeme yapar mıyım?" sorusuna "Hayır, boşta süre için ödeme yapmazsınız" yanıtını verir, ardından faturalandırılabilir sürenin "modelinizin aktif olarak dağıtıldığı, ölçeklendiği veya tahmin yaptığı süre" olduğunu ekler; yani sayaç tahmin süresinden fazlasını kapsar ve bütçelenmesi gereken kısım da budur. RunPod fiyatlandırma sayfasında saatlik oranları yayınlar, cold start rakamı yayınlamaz.

Tercihiniz Modal ise, Modal adım adım rehberini ayrıca yazdık.

Modeliniz sığacak mı? VRAM, tek GPU sınırları ve kota

70B model serverless GPU'da çalışır mı? Genellikle hayır. FP16'da 70B yaklaşık 140 GB VRAM gerektirir. Cloud Run örnek başına tek GPU ile sınırlıdır (RTX PRO 6000'de en fazla 96 GB). Kantizasyon (FP8/GGUF) veya çoklu GPU platformu olmadan bu hesap kapanmıyor.

GPUVRAMMin CPU / bellekTipik model tavanı
L424 GB4 CPU / 16 GiB7B-13B (FP16), kantize 30B'ye kadar
A100 80GB80 GBplatforma göre değişirkantize 30B-70B
H100 80GB80 GBplatforma göre değişirkantize 30B-70B
RTX PRO 6000 Blackwell96 GB20 CPU / 80 GiBFP8'de 70B

Cloud Run'ın varsayılan kotası bölge ve proje başına 3 L4 GPU'dur (RTX PRO 6000 ayrıca, 3.000 milliGPU olarak verilir) ve altı L4 bölgesine yayılır: asia-southeast1, asia-south1, europe-west1, europe-west4, us-central1, us-east4. Avrupa'da serverless GPU soran herkes için veri ikametinin Cloud Run yarısı budur; Modal ve RunPod kendi AB bölgelerini belgeliyor, kalanı SSS'de.

Ismaili Simba'nın dev.to'daki Cloud Run rehberi (Nisan 2025), kota talebinin "onaylanmasının biraz zaman alabildiğini (5 iş gününe kadar)" ve "Cloud Run'da bulunan L4 GPU'ların 16 GB RAM sınırına sahip olduğunu" bildiriyor. Bu gecikmeyi planlayın.

Model bazında VRAM boyutlandırması için VRAM gereksinimleri rehberimize bakın.

Model ağırlıklarınız nerede duruyor (ve bunun maliyeti ne)?

Kasım 2024'ten bir Reddit başlığı, 30.07.2026'da kontrol ettiğimizde Google'da tam da bu sorgu için hâlâ 5. sıradaydı ve kelimesi kelimesine şunu soruyordu:

"80 GB modeli depolamanın ücretini bulamadım… Her api çağrısında modeli indirmek istemezsem alternatif ne (çağrıda pod hazırlanıp sonra kapanıyor)? … Bu platformlar neden model depolama maliyetini listelemiyor?"

Üç düşük puanlı yanıt, hiçbiri cevap değil. Bu aramayı 30.07.2026'da yaptığımızda ilk on sonuç hâlâ model depolamanın maliyetini soran o iki yıllık başlığı içeriyordu. Başlıkta kimse yanıt vermemiş. Her iki platform da oranı yayınlıyor. Modal'da ilk TiB ücretsiz olmak üzere GiB başına ayda 0,09 $; yani o 80 GB'lık checkpoint 0,00 $ faturalanır. RunPod'da 1 TB altı ağ depolama için GB başına ayda 0,07 $; bu da aynı checkpoint'i ayda yaklaşık 5,60 $'a koyar.

YerleşimCold start etkisiMaliyetiModeli değiştirmek için yeniden build?En uygun
Konteyner imajına gömülüEn hızlı açılışİmaj boyutu şişer (27B FP8 = onlarca GB)Evet, tam yeniden buildTek modelleri endpoint'ler
Kalıcı ağ diskiHızlı (host'ta önbelleğe alınır)Modal 0,09 $/GiB/ay, 1 TiB ücretsiz; RunPod 1 TB altı 0,07 $/GB/ayHayır, yolu değiştirinÇoklu model veya sık değişim
Açılışta Hugging Face'ten çekilirEn yavaş: 5 GB/s'de 130 GB için 26 sn+Ücretsiz (HF bant genişliği)HayırYalnızca prototipleme

Üçüncü satır hata modudur. ServerlessLLM'in 2024 tarihli TU München incelemesi (arXiv 2411.15664), LLaMA-2-70B'nin (130 GB) 5 GB/s'de çekilmesinin 26 saniyeden fazla sürdüğünü, buna 8 GPU'ya yüklemenin yaklaşık 84 saniye eklendiğini, token üretiminin ise yaklaşık 100 ms olduğunu bildiriyor. Bu rakamlar o incelemede alıntılanmış, kendileri ölçülmemiş.

RunPod'un fiyatlandırma sayfasında bir Depolama bölümü var: konteyner diski 0,10 $/GB/ay, birim diski çalışırken 0,10 $/GB/ay ve boşta 0,20 $/GB/ay, ağ depolama 1 TB altı 0,07 $/GB/ay ve üstü 0,05 $/GB/ay, yüksek performanslı ağ depolama 0,14 $/GB/ay. Rakam var. Sadece okuyucunun soruyu aklına getirdiği anda karşılaştırdığı GPU başına serverless oranlarının yanında durmuyor, endpoint yapılandırma akışında da yok. Bir gizlilik değil, bulunabilirlik sorunu; ve iki yıl sonra soruyu canlı tutmaya yetiyor.

bash
# Point the Hugging Face cache at a mounted network volume
# so weights persist across cold starts (RunPod / Modal pattern)
export HF_HOME=/workspace/hf-cache
export TRANSFORMERS_CACHE=/workspace/hf-cache
export HF_HUB_ENABLE_HF_TRANSFER=1
dockerfile
# Alternative: bake weights into the image at build time
FROM vllm/vllm-openai:latest
COPY ./model-weights /models/qwen3-27b-fp8
ENV MODEL_NAME=/models/qwen3-27b-fp8
# Downside: 30+ GB image, full rebuild to change models

Henüz model seçmediyseniz, 2026 açık ağırlıklı modeller derlememiz her seçeneği dağıtım için boyutlandırıyor.

Dağıtın: RunPod Serverless üzerinde vLLM, uçtan uca

Sıfırdan çağrılabilir bir endpoint'e altı adım. Her birini RunPod'un vLLM prosedürü ile doğrulayın (22 Haziran 2026 güncellemesi); fiyat yayınlamıyor.

  1. Modelinizi seçin. GPU'nuzun boyutuna uygun açık ağırlıklı bir model seçin (yukarıdaki VRAM tablosuna bakın). Hugging Face'te kısıtlıysa önce erişim token'ı oluşturun.

  2. Serverless endpoint'i oluşturun. RunPod konsolunda Serverless'ı seçin, vLLM worker şablonunu seçin ve GPU katmanınızı belirleyin.

  3. Önemli ortam değişkenlerini ayarlayın.

env
MODEL_NAME=Qwen/Qwen3.6-27B-FP8
MAX_MODEL_LEN=32768
GPU_MEMORY_UTILIZATION=0.90
DTYPE=auto

MODEL_NAME hatalıysa açılışta 404 alırsınız. MAX_MODEL_LEN VRAM'inize göre çok yüksek ayarlanırsa ilk token'dan önce OOM olur. GPU_MEMORY_UTILIZATION 0,95 üstü, KV-cache ani yükselmeleri için boşluk bırakmaz.

  1. Min/maks worker ve boşta zaman aşımını ayarlayın. Min worker 0 size sıfıra ölçeklenme (ve cold start) verir. Min worker 1 cold start'ları öldürür ama sürekli faturalandırır. Aşağıdaki cold start bölümü bu ödünleşimi işliyor.

  2. Model ağırlıkları bölümünde karar verdiğiniz ağ diskini bağlayın veya imaja gömme yolunu kabul edin. Bunu atlarsanız her cold start checkpoint'i yeniden indirir.

  3. İlk isteği gönderin. Endpoint ID'yi konsoldan okuyun ve token'ların döndüğünü doğrulayın.

bash
curl -X POST "https://api.runpod.ai/v2/${ENDPOINT_ID}/runsync" \
  -H "Authorization: Bearer ${RUNPOD_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "input": {
      "messages": [{"role": "user", "content": "Explain cold starts in one sentence."}],
      "max_tokens": 60
    }
  }'

Sunum motorunun kendisini tartıyorsanız, vLLM ve SGLang'i throughput ve gecikme açısından karşılaştırdık.

Endpoint'i uygulamanızdan nasıl çağırırsınız?

Kısa listedeki her platform OpenAI uyumlu API konuşur. Tek Python parçası her yerde çalışır. Sağlayıcı değiştirmek bir base_url değişikliğidir, yeniden yazım değil. Bu, "hangi sağlayıcı" sorusunu bir kilitlenme kararından yapılandırma kararına dönüştürür.

python
import os

from openai import OpenAI

ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]

client = OpenAI(
    base_url=f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
    api_key=os.environ["RUNPOD_API_KEY"],
)

response = client.chat.completions.create(
    model="Qwen/Qwen3.6-27B-FP8",
    messages=[{"role": "user", "content": "What is scale to zero?"}],
    max_tokens=120,
)
print(response.choices[0].message.content)
python
# Same code, different provider. One line changes.
ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]

PROVIDERS = {
    "runpod": f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
    "modal": "https://your-app--your-func.modal.run/v1",
    "beam": "https://your-beam-endpoint/v1",
}

client = OpenAI(base_url=PROVIDERS["modal"], api_key="your-key")

Her sağlayıcı OpenAI lehçesini konuşuyorsa, "hangi serverless GPU sağlayıcısı" bir mimari karar olmaktan çıkar ve tek satır yapılandırma olur.

Birden fazla endpoint'iniz olduğunda, LLM gateway karşılaştırmamız yönlendirme ve yedekliliği kapsar. Daha hafif bir kurulum için LiteLLM proxy yeniden deneme ve loglama ekler.

Gerçekte hangi cold start'ı göreceksiniz?

Serverless GPU'da 7B model için, gerçek bir cold start'ta (konteyner açılışı artı ağırlık yükleme artı motor başlatma) uygulayıcı raporlarına göre 10 ila 30 saniye bekleyin. Sağlayıcı belgeleri yalnızca konteyner açılışı için 1 ila 5 saniye veriyor. Bu rakamlar arasındaki fark, checkpoint'inizin ağ üzerinden geçişidir.

RunPod'un ürün sayfası 200 ms altı FlashBoot cold start vaat ediyor (sağlayıcı iddiası, ölçüm değil). r/LLMDevs'ten bir uygulayıcı şöyle bildiriyor: "benim deneyimimde cold start'lar pek iyi değil … yaklaşık 10 - 30 sn diyebilirim" ve ekliyor "ama deneyimimin çoğu difüzyon modelleri etrafında." İkisi de doğru. Farklı şeyleri ölçüyorlar.

Cold start rakamı üst üste konmuş üç rakamdır:

  1. Konteyner açılışı. Modal belgeleri: "Konteynerler yaklaşık bir saniyede açılır." Cloud Run: sürücüleri önceden yüklü örnekler "yaklaşık 5 saniyede başlar."

  2. Ağırlık yükleme. Kimsenin reklamını yapmadığı kısım. ServerlessLLM'in 2024 tarihli TU München incelemesi (arXiv 2411.15664) LLaMA-2-70B için 26 saniyeden fazla çekme süresi ve 8 GPU'ya yüklemenin yaklaşık 84 saniye olduğunu belirtiyor.

  3. Motor başlatma. vLLM graf yakalama ve ısınma. Logesh Umapathi ölçtü: A100-80GB üzerinde Qwen3.6-27B-FP8, 460 sn tabandan eager modla 219 sn'ye, vLLM sleep mode artı Modal GPU snapshot ile yaklaşık 70 sn'ye indi. Bu 6,5 kat, 17 Mayıs 2026'da yayınlandı.

KaynakÖlçülenRakamTarihTür
Modal belgeleriKonteyner açılışı~1 sngüncelSağlayıcı belgesi
Cloud Run belgeleriÖrnek başlatma (sürücüler önceden yüklü)~5 sngüncelSağlayıcı belgesi
UmapathiQwen3.6-27B-FP8, A100-80GB, tam cold start460 sn'den 219 sn'ye, ~70 sn'yeMayıs 2026Bağımsız ölçüm
ServerlessLLM TU München incelemesi (arXiv 2411.15664)LLaMA-2-70B çekme + yükleme, rakamlar alıntı, ölçüm değil26 sn çekme + 84 sn yükleme2024arXiv ön baskı (inceleme)
r/LLMDevs uygulayıcısıRunPod'da 7B, tam istek~10-30 snAralık 2024Anektod (difüzyon şerhi)

Yayınlanan verilerin yorumumuz: sağlayıcı rakamları konteyneri ölçer. Uygulayıcı rakamları tüm isteği. Bu iki kronometrenin arasında, ağ üzerinden geçen 80 GB ağırlık duruyor. Tür sütunu asıl noktadır.

Ne yapmalı: vLLM sleep mode, GPU snapshot ve ölçekleme penceresi ayarı. Modal'ın varsayılan boşta süresi 60 saniyedir (2 sn-20 dk arası yapılandırılabilir). Sıcak worker cold start'ları öldürür ama her zaman açıkmış gibi faturalandırır.

python
# Modal scaledown config (illustrative)
# A 60s window means you pay for 60 idle seconds per burst.
# A warm worker (min_containers=1) costs ~$2.50/hr on A100 80GB, 24/7.
@app.function(
    gpu="A100",
    scaledown_window=60,  # seconds idle before shutdown
    # min_containers=1,   # uncomment to kill cold starts; costs $60/day
)

Serverless GPU her zaman açık GPU'dan ucuz mu?

GPU'nuz günün çoğunda boşta duruyorsa serverless GPU daha ucuzdur. A100 80GB'de günde 3.000 istek, ortalama 2 saniye ile serverless yaklaşık 4,17 $/gün tutar; 7/24 çalışan kiralık GPU ise 65,28 $/gün. Kesişim noktası bir hacim değil, görev döngüsü sorusudur.

Varsayımlar (bizimkiler, yeniden hesaplayabilin diye belirtiyoruz): Modal'ın 2,50 $/saat oranıyla A100 80GB, istek başına ortalama 2 saniye GPU süresi, RunPod'un 2,72 $/saat oranıyla 7/24 kiralık GPU, 0,40 $/1M token barındırılan token API'si (orta seviye yayın oranı) ve istek başına yaklaşık 1.000 token.

İstek/günServerless (tahmini)Kiralık 7/24 GPUBarındırılan token APIEn ucuz
5000,69 $65,28 $0,20 $Token API
3.0004,17 $65,28 $1,20 $Token API
10.00013,89 $65,28 $4,00 $Token API
50.00069,44 $65,28 $20,00 $Token API
200.000277,78 $65,28 $80,00 $Kiralık GPU

Kesişim yaklaşık 47.000 istek/güne denk geliyor. Altında serverless kazanır. Barındırılan token API, düşük hacimde sıradan bir modelle ikisini de yener. Başa baş noktası kaç istek aldığınızla ilgili değildir. GPU'nuzun kaç saat hiçbir şey yapmadan durduğuyla ilgilidir.

BentoML'un Ağustos 2024 analizi bu ödünleşimi iyi çerçeveliyor, ancak fiyatlandırma örnekleri GPT-3.5-turbo döneminden ve iki yıl eski.

Barındırılan token API'sinin sizin hacminizde ne tuttuğunu görmek için LLM API fiyatlandırma karşılaştırmamıza bakın. Çıkarım tarafında istek başına maliyeti düşürmek için prompt önbellekleme tekrarlanan bağlamda genellikle %30-60 tasarruf sağlar.

python
# Break-even calculator: adjust these and re-run
REQUESTS_PER_DAY = 3000
SECONDS_PER_REQUEST = 2
SERVERLESS_RATE_HR = 2.50   # Modal A100 80GB
RENTED_RATE_HR = 2.72       # RunPod A100 80GB, 24/7

serverless_daily = REQUESTS_PER_DAY * SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR
rented_daily = RENTED_RATE_HR * 24

print(f"Serverless: ${serverless_daily:.2f}/day")
print(f"Rented 24/7: ${rented_daily:.2f}/day")
print(f"Crossover: {int(RENTED_RATE_HR * 24 / (SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR))} req/day")

Serverless GPU'nun yanlış tercih olduğu durumlar

  • Sürekli yüksek trafik. Bu oranlarda yaklaşık 47.000 istek/günün üzerinde görev döngüsü tersine döner ve kiralık GPU istek başına daha ucuzdur.
  • Soğuk yolda katı saniye altı SLO'lar. Hiçbir snapshot hilesi ilk isteği anlık yapmaz. Sıcak worker tutun veya kutuyu kiralayın.
  • Çoklu GPU gerektiren 70B+ modeller. Cloud Run'da örnek başına tek GPU bu konuşmayı bitirir.
  • Katı veri ikameti. Cloud Run'da tüm menü altı L4 bölgesidir.
  • Zaten ödediğiniz bir worker slotuna kaybeden istek ekonomisi. Boşta GPU kapasiteniz varsa çıkarım eklemek ekstra hiçbir şeye mal olmaz.

GPU'nuz günde on altı saat meşgulse, serverless pahalı seçenektir; aksini söyleyen serverless satıyordur.

Yerel öncelikli yol için yerel LLM araçları rehberimize bakın.

Yazar Hakkında

Mert Batur, Techsy.io'nun Kurucu Ortağıdır; ekip burada B2B müşteriler için AI ajanları, otomasyon sistemleri ve ses/SDR süreçleri geliştiriyor. Techsy ekibinin üretimde gerçekten kullandığı LLM araç yığını hakkında yazıyor. LinkedIn'den bağlanın.

Sıkça Sorulan Sorular

Serverless GPU nedir?

Serverless GPU platformu, model konteynerinizi paylaşımlı donanımda çalıştırır, istekler arasında sıfıra ölçekler ve yalnızca aktif işlem için fatura keser. Kalıcı bir GPU örneği yönetmeden bir çıkarım endpoint'i alırsınız. Ödünleşim, başlatmadaki cold start gecikmesidir.

LLM'i serverless GPU'da çalıştırmanın maliyeti ne?

A100 80GB Beam'de 2,25 $/saat, Modal'da 2,50 $/saat, RunPod'da 2,72 $/saat (30.07.2026 doğrulandı). Faturanız görev döngüsüne bağlıdır: günde 3.000 istek, her biri 2 sn, Modal'da yaklaşık 4 $/gün tutar. Depolama 0,09 $/GiB/ay ekler, 1 TiB ücretsizdir.

Model ağırlıklarını depolamak için ödeme yapar mıyım?

Evet, ama ucuzdur. Modal GiB başına ayda 0,09 $ alır, ayda 1 TiB ücretsizdir; yani 80 GB'lık checkpoint hiçbir şey tutmaz. RunPod'un fiyatlandırma sayfası ağ depolamayı 1 TB altı 0,07 $/GB/ay olarak listeler, aynı 80 GB için yaklaşık 5,60 $/ay.

Modelim her istekte yeniden indirilir mi?

Yalnızca hiçbir şey önbelleğe alınmadıysa. Kalıcı diskteki veya imaja gömülü ağırlıklar cold start'lardan sağ çıkar. Hugging Face önbelleğini geçici depolamaya yönlendirirseniz 130 GB'lık model her başlatmada yeniden indirilir. Kaçınılması gereken hata modu budur.

7B model için cold start ne kadar?

Uygulayıcı raporlarına göre gerçek bir cold start'ta 10-30 saniye bekleyin (r/LLMDevs, Aralık 2024). Konteyner 1-5 sn'de açılır (Modal, Cloud Run belgeleri). Geri kalanı ağırlık yükleme ve motor başlatmadır. Snapshot ve sleep mode ile Umapathi 27B model için 460 sn'den yaklaşık 70 sn'ye ölçtü.

70B modeli serverless GPU'da çalıştırabilir miyim?

Genellikle hayır. FP16'da 70B modeli yaklaşık 140 GB VRAM gerektirir. Cloud Run örnek başına tek GPU'ya izin verir (en fazla 96 GB). Tek 80 GB karta sığmak için FP8 kantizasyonu veya çoklu GPU platformu gerekir. Çoğu serverless yüzeyi tek GPU ile sınırlıdır.

Serverless GPU, GPU'yu 7/24 kiralamaktan ucuz mu?

Yaklaşık 47.000 istek/günün altında (A100 80GB'de 2 sn/istek), evet. Serverless yalnızca aktif saniyeleri faturalandırır; kiralık GPU ne olursa olsun 24 saat faturalandırır. Üstünde kiralık GPU kazanır. Düşük hacimde barındırılan token API ikisini de yener. Yukarıdaki başa baş tablosuna bakın.

LLM'i serverless GPU'da ücretsiz dağıtabilir miyim?

Modal ayda 30 $ ücretsiz kredi verir (Starter). Beam ayda 30 $ verir. GCP'nin 300 $ yeni hesap kredisi Cloud Run GPU kullanımını karşılar. Prototip için yeterli, üretim trafiği için değil. Hiçbir platform GPU çıkarımı için kalıcı ücretsiz katman sunmuyor.

Hangi serverless GPU sağlayıcıları Avrupa'da mevcut?

Cloud Run L4 GPU'ları europe-west1 (Belçika) ve europe-west4 (Hollanda)'da sunar. Modal AB bölge seçimini belgeliyor (eu-west, eu-north, eu-south), temel oranların 1,5-1,75 katı fiyatla. RunPod EU-NL-1 ve EU-FR-1 dahil Avrupa veri merkezlerini adlandırır. Bölgeyi açıkça sabitleyin; hiçbiri varsayılan olarak AB'ye gitmez.

LLM'i serverless GPU'da dağıtmak için Docker gerekir mi?

Her zaman değil. RunPod, Docker'ı atlayan önceden hazırlanmış vLLM worker şablonları sunar. Modal, konteynerleri koddaki bir Python imaj tanımından oluşturur. Özel bağımlılıklar için Dockerfile yazarsınız. Standart vLLM sunumu için önceden hazırlanmış yol dakikalar içinde çalışır.

Sonuç

Beş platform, beş faturalandırma birimi, tek normalize tablo. Karar, sağlayıcı sayfalarının gösterdiğinden daha basit:

  • GPU'nuzu markaya göre değil VRAM'e göre seçin.
  • Modellerinizi asla değiştirmiyorsanız ağırlıkları imaja gömün; aksi halde diske koyun.
  • 10-30 saniyelik cold start bekleyin ve planınızı buna göre yapın.
  • Yaklaşık 47.000 istek/günün altında sıfıra ölçeklenme maliyette kazanır.
  • Endpoint'in arkasındaki sunum motoru değiştirilebilir; base_url tek satırdır.

Çağrılabilir bir endpoint'iniz var. Sıradaki: yönlendirme ve yedeklilik gerektiğinde önünde ne duracak? LLM gateway karşılaştırmamız bunu yanıtlıyor. Veya kurulumunuzu bizimle konuşun.

Etiketler

serverless-gpu-llm-dagitimserverless-gpuvllmllm-cikarimcold-start

Bu makaleyi paylaş

İlgili Makaleler

Daha fazla ai-machine-learning

ai-machine-learning
Aug 7, 2026

AI Ajan İş Akışı Desenleri: 7 Desen ve Her Birinin Gerçekte Ne Zaman Kazandığı (2026)

Yedi AI ajan iş akışı deseni her satıcı sınıflandırmasında tekrar tekrar karşımıza çıkıyor, ama hiçbiri her yerde kazanmıyor. Bu yazıda desenleri Google Research ve Anthropic'in yayımlanmış 2026 benchmark verileriyle, aritmetiği göstererek, her yapı için çalıştırılabilir Python koduyla ve seçim yapmanızı sağlayan bir karar merdiveniyle sıralıyoruz.

13 dk okuma okuma
Oku
ai-machine-learning
Aug 7, 2026

RAG Parçalama Stratejileri: 7 Yöntem, Erişim Verisiyle Sıralandı (2026)

Parçalama, belgelerinizi embedding öncesinde böler ve bölme noktaları retriever'ınızın neyi bulup neyi bulamayacağını belirler. 7 RAG parçalama stratejisini Chroma'nın açık 472 sorguluk benchmark'ına göre sıraladık, ardından her birini zaten kullandığınız embedding modeline eşleştirdik.

15 dk okuma okuma
Oku
ai-machine-learning
Aug 6, 2026

2026'da En İyi RAG Framework: LangChain vs LlamaIndex vs Haystack (ve Hiçbirine Gerek Duymadığınız An)

LangChain 1.0 çoğu ekip için varsayılan tercih, ancak tek korpuslu bir soru-cevap uygulaması için dürüst cevap, hiçbir framework'e ihtiyacınız olmayabileceği. 8 orkestrasyon katmanını kod, tarihli repo verileri ve bir gecikme bütçesiyle yan yana karşılaştırdık.

14 dk okuma okuma
Oku
Tüm Yazıları Görüntüle
Projenize Başlayın

Harika bir şey inşa etmeye hazır mısınız?

Vizyonunuzu hayata geçirelim. Fark yaratan yazılımlar için ekibimiz hazır.

30 dakikalık keşif görüşmesi ayarlayınProjelerimiz

Kütüphaneden öne çıkanlar

Claude Skills

Tümünü gör
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI Otomasyonları

Tümünü gör
  • Güvenlik Denetçisi

    Önceliklendirilmiş düzeltme PR'larıyla haftalık SCA + IaC taraması.

  • Soğuk E-posta Yazarı

    Tek bir somut kamuya açık detaya dayalı ilk temas e-postaları üretir.

  • Lead Araştırma Agent'ı

    Bir e-postayı profile zenginleştirir, uygunluğu puanlar, Slack'te uyarır.

Kütüphaneden öne çıkanlar

Claude Skills

Tümünü gör
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI Otomasyonları

Tümünü gör
  • Güvenlik Denetçisi

    Önceliklendirilmiş düzeltme PR'larıyla haftalık SCA + IaC taraması.

  • Soğuk E-posta Yazarı

    Tek bir somut kamuya açık detaya dayalı ilk temas e-postaları üretir.

  • Lead Araştırma Agent'ı

    Bir e-postayı profile zenginleştirir, uygunluğu puanlar, Slack'te uyarır.

Hizmetler

  • Kurumsal Çözümler
  • Mobil Uygulamalar
  • Web Uygulamaları

Çözümler

  • CRM Sistemleri
  • Yapay Zeka Entegrasyonu
  • ERP Çözümleri
  • Sesli Asistanlar
  • Süreç Otomasyonu
  • Siber ve Veri Güvenliği

Kütüphane

  • Blog
  • Portfolyo

Topluluk

  • AI Otomasyonları
  • Claude Skills

Araçlar

  • Mobil Uygulama Maliyet Hesaplayıcı
  • OpenAI / LLM API Maliyet Hesaplayıcı
  • MVP Maliyet Hesaplayıcı
  • Sesli AI Ajan Maliyet Hesaplayıcı

Şirket

  • Hakkımızda
  • Partnerler
  • İletişim

Yasal

  • Gizlilik Politikası
  • Kullanım Şartları
  • Çerez Politikası

Hizmetler

  • Kurumsal Çözümler
  • Mobil Uygulamalar
  • Web Uygulamaları

Çözümler

  • CRM Sistemleri
  • Yapay Zeka Entegrasyonu
  • ERP Çözümleri
  • Sesli Asistanlar
  • Süreç Otomasyonu
  • Siber ve Veri Güvenliği

Kütüphane

  • Blog
  • Portfolyo

Topluluk

  • AI Otomasyonları
  • Claude Skills

Araçlar

  • Mobil Uygulama Maliyet Hesaplayıcı
  • OpenAI / LLM API Maliyet Hesaplayıcı
  • MVP Maliyet Hesaplayıcı
  • Sesli AI Ajan Maliyet Hesaplayıcı

Şirket

  • Hakkımızda
  • Partnerler
  • İletişim
YasalGizlilik PolitikasıKullanım ŞartlarıÇerez Politikası
TECHSY
© 2026 Techsy. Tüm hakları saklıdır.