
Deploy LLM di GPU Serverless: 5 Platform, Harga Nyata, Cold Start Jujur
RunPod mematok $2,72/jam untuk A100 80GB. Endpoint kamu cuma dapat dua belas request sebelum makan siang. GPU itu menganggur 23 jam sisanya, tapi tagihan jalan terus. Deploy LLM di GPU serverless dan kamu hanya bayar saat request berjalan. Lima platform melakukan ini. Mereka menagih dalam lima satuan berbeda. Tidak ada yang menormalisasi.
GPU menganggur biayanya persis sama dengan GPU sibuk.
Poin Penting
- GPU serverless hanya menagih saat request berjalan dan scale to zero di antaranya.
- Satu GPU per instance di Cloud Run; model 70B butuh multi-GPU, jadi serverless biasanya tidak bisa meng-host-nya.
- Bobot model ada di dalam image, di network volume, atau diunduh ulang setiap cold start.
- Cold start itu tiga hal: boot container, pemuatan bobot, inisialisasi engine. Hanya yang pertama yang cepat.
- Di bawah sekitar 47.000 request per hari, scale-to-zero lebih murah dari GPU sewaan 24/7.
Apa sebenarnya arti 'GPU serverless' untuk LLM?
Platform GPU serverless menjalankan container inferensi kamu di hardware GPU bersama, menyalakannya saat request datang, dan scale to zero saat trafik berhenti. Kamu bayar per detik (atau per menit, atau per jam, tergantung vendor) hanya selama container hidup. Tidak ada tagihan menganggur. Tidak ada reserved instance.
Satuan penagihan berbeda tiap vendor, makanya bagian berikutnya menormalisasi semuanya ke $/GPU-jam.
Dua batasan yang sering bikin kaget. Pertama, Google Cloud Run mengizinkan satu GPU per instance, maksimal. Itu membatasi plafon VRAM kamu di satu kartu. Kedua, "serverless" bukan berarti state persisten. Tidak ada proses long-lived yang menahan bobot kamu di RAM antar-request. Saat container mati, semua yang ada di memori ikut mati. Satu fakta itu yang menentukan keputusan penyimpanan di bagian bobot model di bawah.
Serverless bukan berarti tanpa server. Artinya tidak ada server di antara request kamu, dan persis di situlah bobot model kamu menghilang.
Platform GPU serverless mana yang harus kamu pilih? (Harga 2026, berdampingan)
Kami tidak menjual satu pun platform ini dan tidak menerima pendapatan afiliasi dari mana pun. Dari tujuh artikel yang bersaing untuk query ini dan varian dekatnya, empat dipublikasikan oleh perusahaan yang menjual GPU serverless. Tabel ini bukan.
Semua tarif dibaca dari halaman harga resmi vendor pada 2026-07-30. Tarif berubah; cek ulang sebelum kamu commit.
| Platform | Satuan publik (kata mereka) | $/GPU-jam (A100 80GB) | $/GPU-jam (H100) | Kredit gratis | Pilih ini jika... |
|---|---|---|---|---|---|
| Modal | $0,000694/s | $2,50 | $3,95 | $30/bln Starter | kamu mau penagihan per detik, build cepat, dan GPU snapshot |
| RunPod | $2,72/jam | $2,72 | $4,55 | tidak dipublikasikan | kamu mau menu GPU terlengkap dengan tarif per jam flat |
| Beam | $0,000625/s | $2,25 | $3,55 | $30/bln | kamu mau nol tagihan untuk spin-up dan pemuatan image |
| Baseten | $0,06667/mnt | $4,00 | $6,50 | ya, jumlah tidak dipublikasikan | kamu mau inferensi terkelola dengan penagihan komputasi aktif |
| Cloud Run | per detik (L4 dan RTX PRO 6000 Blackwell; tanpa A100/H100) | tidak dipublikasikan (tanpa A100) | tidak dipublikasikan (tanpa H100) | kredit GCP $300 | kamu sudah di GCP dan butuh kontrol region EU/US |
Aritmetika normalisasi, ditampilkan sekali supaya kamu bisa audit: Modal A100 80GB di $0,000694/s dikali 3600 detik sama dengan $2,4984/jam. Beam: $0,000625 kali 3600 sama dengan $2,25/jam. Baseten: $0,06667/mnt kali 60 sama dengan $4,00/jam. Selisih 1,8x antara Beam dan Baseten untuk A100 yang sama itu nyata, dan tersembunyi di depan mata karena tidak ada yang mempublikasikan satuan yang sama.
Tiga catatan. Halaman harga Beam secara eksplisit menyatakan tidak menagih untuk spin-up server atau pemuatan image container. FAQ harga Baseten menjawab "Apakah saya bayar untuk waktu menganggur di Baseten?" dengan "Tidak, Anda tidak membayar untuk waktu menganggur," lalu menambahkan bahwa waktu yang ditagih adalah "waktu model Anda aktif di-deploy, scaling naik atau turun, atau membuat prediksi," jadi meternya mencakup lebih dari waktu prediksi, dan itu bagian yang perlu dianggarkan. RunPod mempublikasikan tarif per jam dan tanpa angka cold start di halaman harganya.
Jika Modal pilihan kamu, kami sudah menulis panduan lengkap Modal secara terpisah.
Apakah model kamu muat? VRAM, batas satu GPU, dan kuota
Bisa jalankan model 70B di GPU serverless? Biasanya tidak. Di FP16, 70B butuh ~140 GB VRAM. Cloud Run membatasi satu GPU per instance (maks 96 GB di RTX PRO 6000). Hitungannya tidak masuk tanpa kuantisasi (FP8/GGUF) atau platform multi-GPU.
| GPU | VRAM | Min CPU / memori | Plafon model tipikal |
|---|---|---|---|
| L4 | 24 GB | 4 CPU / 16 GiB | 7B-13B (FP16), hingga 30B kuantisasi |
| A100 80GB | 80 GB | bervariasi per platform | 30B-70B kuantisasi |
| H100 80GB | 80 GB | bervariasi per platform | 30B-70B kuantisasi |
| RTX PRO 6000 Blackwell | 96 GB | 20 CPU / 80 GiB | 70B di FP8 |
Kuota default Cloud Run adalah 3 GPU L4 per region per project (RTX PRO 6000 diberikan terpisah, sebagai 3.000 milliGPU), di enam region L4: asia-southeast1, asia-south1, europe-west1, europe-west4, us-central1, us-east4. Itu separuh Cloud Run dari jawaban residensi data untuk siapa pun yang bertanya soal GPU serverless di Eropa; Modal dan RunPod mendokumentasikan region EU mereka sendiri, dan FAQ punya sisanya.
Ismaili Simba di panduan Cloud Run di dev.to (April 2025) melaporkan bahwa permintaan kuota "bisa memakan waktu (hingga 5 hari kerja) untuk disetujui," dan bahwa "GPU L4 yang tersedia di Cloud Run memiliki batas RAM 16GB." Rencanakan keterlambatan itu.
Untuk sizing VRAM per model, lihat panduan kebutuhan VRAM kami.
Di mana bobot model kamu disimpan (dan berapa biayanya)?
Sebuah thread Reddit dari November 2024 yang masih duduk di #5 Google untuk query persis ini saat kami cek pada 2026-07-30 bertanya, verbatim:
"Saya tidak bisa menemukan tarif untuk menyimpan model 80 gb… Apa alternatifnya jika saya tidak mau mengunduh model di setiap panggilan api (pod di-provision saat panggilan lalu ditutup)? … Kenapa platform-platform ini tidak mencantumkan biaya penyimpanan model?"
Tiga balasan berskor rendah, tidak satu pun menjawab. Saat kami menjalankan pencarian ini pada 2026-07-30, sepuluh hasil teratas masih termasuk thread berumur dua tahun yang bertanya berapa biaya penyimpanan model. Tidak ada di thread itu yang menjawab. Kedua platform mempublikasikan tarifnya. Di Modal, $0,09 per GiB per bulan dengan TiB pertama gratis, jadi checkpoint 80 GB itu ditagih $0,00. Di RunPod, $0,07 per GB per bulan untuk network storage di bawah 1 TB, yang menempatkan checkpoint yang sama di sekitar $5,60 per bulan.
| Penempatan | Dampak cold start | Biayanya | Rebuild untuk ganti model? | Terbaik untuk |
|---|---|---|---|---|
| Di-bake ke dalam image container | Boot tercepat | Ukuran image membengkak (27B FP8 = puluhan GB) | Ya, rebuild penuh | Endpoint satu model |
| Network volume persisten | Cepat (di-cache di host) | Modal $0,09/GiB/bln, 1 TiB gratis; RunPod $0,07/GB/bln di bawah 1 TB | Tidak, ganti path-nya | Multi-model atau sering ganti |
| Diunduh dari Hugging Face saat boot | Paling lambat: 26s+ untuk 130 GB di 5 GB/s | Gratis (bandwidth HF) | Tidak | Prototyping saja |
Baris ketiga adalah mode kegagalan. Sebuah ulasan TU München 2024 tentang ServerlessLLM (arXiv 2411.15664) melaporkan LLaMA-2-70B (130 GB) butuh 26+ detik untuk diunduh di 5 GB/s, plus ~84 detik untuk dimuat ke 8 GPU, terhadap ~100 ms generasi token. Angka-angka itu dikutip di ulasan tersebut, bukan diukur olehnya.
Halaman harga RunPod punya bagian Storage: container disk $0,10/GB/bln, volume disk $0,10/GB/bln berjalan dan $0,20/GB/bln menganggur, network storage $0,07/GB/bln di bawah 1 TB dan $0,05/GB/bln di atasnya, high-performance network storage $0,14/GB/bln. Angkanya ada. Hanya saja tidak duduk di samping tarif per GPU serverless yang sedang dibandingkan pembaca saat pertanyaan itu muncul, juga tidak di alur konfigurasi endpoint. Masalah ketercarian, bukan kerahasiaan, dan cukup untuk menjaga pertanyaan itu tetap hidup dua tahun kemudian.
# Point the Hugging Face cache at a mounted network volume
# so weights persist across cold starts (RunPod / Modal pattern)
export HF_HOME=/workspace/hf-cache
export TRANSFORMERS_CACHE=/workspace/hf-cache
export HF_HUB_ENABLE_HF_TRANSFER=1# Alternative: bake weights into the image at build time
FROM vllm/vllm-openai:latest
COPY ./model-weights /models/qwen3-27b-fp8
ENV MODEL_NAME=/models/qwen3-27b-fp8
# Downside: 30+ GB image, full rebuild to change modelsJika kamu belum memilih model, roundup open-weights 2026 kami mengukur setiap opsi untuk deployment.
Deploy: vLLM di RunPod Serverless, dari awal sampai akhir
Enam langkah dari nol ke endpoint yang bisa dipanggil. Verifikasi masing-masing terhadap prosedur vLLM RunPod (diperbarui 22 Jun 2026), yang tidak mempublikasikan harga.
-
Pilih model kamu. Pilih model open-weights yang sesuai ukuran GPU kamu (lihat tabel VRAM di atas). Jika modelnya gated di Hugging Face, buat access token dulu.
-
Buat endpoint serverless. Di konsol RunPod, pilih Serverless, pilih template worker vLLM, dan pilih tier GPU kamu.
-
Set environment variable yang penting.
MODEL_NAME=Qwen/Qwen3.6-27B-FP8
MAX_MODEL_LEN=32768
GPU_MEMORY_UTILIZATION=0.90
DTYPE=autoMODEL_NAME salah berarti 404 saat boot. MAX_MODEL_LEN terlalu tinggi untuk VRAM kamu berarti OOM sebelum token pertama. GPU_MEMORY_UTILIZATION di atas 0,95 tidak menyisakan headroom untuk lonjakan KV-cache.
-
Set min/max worker dan idle timeout. Min worker di 0 memberi kamu scale-to-zero (dan cold start). Min worker di 1 menghilangkan cold start tapi menagih terus-menerus. Bagian cold start di bawah mengurai trade-off itu.
-
Pasang network volume yang sudah kamu putuskan di bagian bobot model, atau terima jalur image-bake. Jika kamu lewati ini, setiap cold start mengunduh ulang checkpoint.
-
Kirim request pertama. Baca endpoint ID dari konsol dan konfirmasi token kembali.
curl -X POST "https://api.runpod.ai/v2/${ENDPOINT_ID}/runsync" \
-H "Authorization: Bearer ${RUNPOD_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"input": {
"messages": [{"role": "user", "content": "Explain cold starts in one sentence."}],
"max_tokens": 60
}
}'Jika kamu sedang menimbang serving engine-nya sendiri, kami sudah membandingkan vLLM dan SGLang soal throughput dan latensi.
Bagaimana cara memanggil endpoint dari aplikasi kamu?
Setiap platform di daftar pendek ini berbicara API yang kompatibel dengan OpenAI. Satu snippet Python bekerja di mana saja. Ganti provider cukup ubah base_url, bukan tulis ulang. Itu mengubah "provider mana" dari keputusan lock-in menjadi keputusan konfigurasi.
import os
from openai import OpenAI
ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]
client = OpenAI(
base_url=f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
api_key=os.environ["RUNPOD_API_KEY"],
)
response = client.chat.completions.create(
model="Qwen/Qwen3.6-27B-FP8",
messages=[{"role": "user", "content": "What is scale to zero?"}],
max_tokens=120,
)
print(response.choices[0].message.content)# Same code, different provider. One line changes.
ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]
PROVIDERS = {
"runpod": f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
"modal": "https://your-app--your-func.modal.run/v1",
"beam": "https://your-beam-endpoint/v1",
}
client = OpenAI(base_url=PROVIDERS["modal"], api_key="your-key")Jika setiap provider berbicara dialek OpenAI, "provider GPU serverless mana" berhenti jadi keputusan arsitektur dan jadi satu baris konfigurasi.
Setelah kamu punya beberapa endpoint, perbandingan LLM gateway kami membahas routing dan failover. Untuk setup yang lebih ringan, proxy LiteLLM menambahkan retry dan logging.
Cold start seperti apa yang sebenarnya akan kamu lihat?
Untuk model 7B di GPU serverless, perkirakan 10 sampai 30 detik pada cold start sejati (boot container plus pemuatan bobot plus inisialisasi engine), berdasarkan laporan praktisi. Dokumen vendor mengutip 1 sampai 5 detik untuk boot container saja. Jarak antara angka-angka itu adalah checkpoint kamu yang menyeberangi jaringan.
Halaman produk RunPod mengklaim cold start FlashBoot di bawah 200ms (klaim vendor, bukan pengukuran). Seorang praktisi di r/LLMDevs melaporkan: "cold start menurut pengalaman saya tidak bagus… saya bilang sekitar 10 - 30 detik", menambahkan "sebagian besar pengalaman saya di model difusi sih." Keduanya benar. Mereka mengukur hal berbeda.
Angka cold start itu tiga angka yang ditumpuk:
-
Boot container. Dokumen Modal: "Container boot dalam sekitar satu detik." Cloud Run: instance dengan driver terinstal sebelumnya "mulai dalam sekitar 5 detik."
-
Pemuatan bobot. Bagian yang tidak diiklankan siapa pun. Ulasan TU München 2024 tentang ServerlessLLM (arXiv 2411.15664) menempatkan LLaMA-2-70B di 26+ detik untuk unduh plus ~84 detik untuk dimuat ke 8 GPU.
-
Inisialisasi engine. Graph capture dan warm-up vLLM. Logesh Umapathi mengukur Qwen3.6-27B-FP8 di A100-80GB dari baseline 460s ke 219s dengan eager mode hingga ~70s dengan vLLM sleep mode plus Modal GPU snapshot. Itu 6,5x, dipublikasikan 17 Mei 2026.
| Sumber | Yang diukur | Angka | Tanggal | Jenis |
|---|---|---|---|---|
| Dokumen Modal | Boot container | ~1s | saat ini | Dokumen vendor |
| Dokumen Cloud Run | Mulai instance (driver terinstal) | ~5s | saat ini | Dokumen vendor |
| Umapathi | Qwen3.6-27B-FP8, A100-80GB, cold start penuh | 460s ke 219s ke ~70s | Mei 2026 | Pengukuran independen |
| Ulasan TU München tentang ServerlessLLM (arXiv 2411.15664) | Unduh + muat LLaMA-2-70B, angka dikutip bukan diukur | 26s unduh + 84s muat | 2024 | Preprint arXiv (ulasan) |
| Praktisi r/LLMDevs | 7B di RunPod, request penuh | ~10-30s | Des 2024 | Anekdot (catatan difusi) |
Interpretasi kami terhadap data yang dipublikasikan: angka vendor mengukur container. Angka praktisi mengukur seluruh request. Di antara dua stopwatch itu duduk 80 GB bobot yang menyeberangi jaringan. Kolom Jenis adalah poinnya.
Yang harus dilakukan: vLLM sleep mode, GPU snapshot, dan menyetel jendela scaledown. Default idle Modal 60 detik (bisa dikonfigurasi 2s-20mnt). Worker hangat menghilangkan cold start tapi menagih seperti always-on.
# Modal scaledown config (illustrative)
# A 60s window means you pay for 60 idle seconds per burst.
# A warm worker (min_containers=1) costs ~$2.50/hr on A100 80GB, 24/7.
@app.function(
gpu="A100",
scaledown_window=60, # seconds idle before shutdown
# min_containers=1, # uncomment to kill cold starts; costs $60/day
)Apakah GPU serverless lebih murah dari GPU always-on?
GPU serverless lebih murah saat GPU kamu menganggur sebagian besar hari. Di 3.000 request/hari rata-rata 2 detik masing-masing di A100 80GB, serverless biaya sekitar $4,17/hari versus $65,28/hari untuk GPU sewaan yang jalan 24/7. Titik silangnya adalah pertanyaan duty-cycle, bukan pertanyaan volume.
Asumsi (kami, dinyatakan supaya kamu bisa jalankan ulang): A100 80GB di $2,50/jam Modal, 2 detik rata-rata waktu GPU per request, GPU sewaan di $2,72/jam RunPod sepanjang waktu, API token hosted di $0,40/1M token (tarif publik kelas menengah), dan ~1.000 token per request.
| Request/hari | Serverless (est.) | GPU sewaan 24/7 | API token hosted | Termurah |
|---|---|---|---|---|
| 500 | $0,69 | $65,28 | $0,20 | API token |
| 3.000 | $4,17 | $65,28 | $1,20 | API token |
| 10.000 | $13,89 | $65,28 | $4,00 | API token |
| 50.000 | $69,44 | $65,28 | $20,00 | API token |
| 200.000 | $277,78 | $65,28 | $80,00 | GPU sewaan |
Titik silang mendarat di sekitar 47.000 request/hari. Di bawah itu, serverless menang. API token hosted mengalahkan keduanya di volume rendah dengan model komoditas. Break-even bukan soal berapa banyak request yang kamu dapat. Soal berapa jam GPU kamu menghabiskan waktu tanpa melakukan apa-apa.
Analisis BentoML Agustus 2024 membingkai trade-off ini dengan baik, meski contoh harganya dari era GPT-3.5-turbo dan sudah dua tahun usang.
Untuk biaya API token hosted di volume kamu, lihat perbandingan harga API LLM kami. Untuk memotong biaya per request di sisi inferensi, prompt caching biasanya menghemat 30-60% pada konteks berulang.
# Break-even calculator: adjust these and re-run
REQUESTS_PER_DAY = 3000
SECONDS_PER_REQUEST = 2
SERVERLESS_RATE_HR = 2.50 # Modal A100 80GB
RENTED_RATE_HR = 2.72 # RunPod A100 80GB, 24/7
serverless_daily = REQUESTS_PER_DAY * SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR
rented_daily = RENTED_RATE_HR * 24
print(f"Serverless: ${serverless_daily:.2f}/day")
print(f"Rented 24/7: ${rented_daily:.2f}/day")
print(f"Crossover: {int(RENTED_RATE_HR * 24 / (SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR))} req/day")Kapan GPU serverless adalah pilihan yang salah
- Trafik tinggi berkelanjutan. Lewat ~47.000 request/hari di tarif ini, duty cycle berbalik dan GPU sewaan lebih murah per request.
- SLO sub-detik ketat di jalur cold. Tidak ada trik snapshot yang membuat request pertama instan. Pelihara worker hangat atau sewa box-nya.
- Model 70B+ yang butuh banyak GPU. Satu GPU per instance di Cloud Run mengakhiri percakapan itu.
- Residensi data ketat. Enam region L4 adalah seluruh menu di Cloud Run.
- Ekonomi per-request yang kalah dari slot worker yang sudah kamu bayar. Jika kamu punya headroom GPU cadangan, menambah inferensi tidak biaya ekstra.
Jika GPU kamu sibuk enam belas jam sehari, serverless adalah opsi mahal dan siapa pun yang bilang sebaliknya sedang menjual serverless.
Untuk jalur local-first, lihat panduan tooling LLM lokal kami.
Tentang Penulis
Mert Batur adalah Co-Founder Techsy.io, di mana timnya membangun AI agent, sistem otomasi, dan pipeline voice/SDR untuk klien B2B. Dia menulis tentang stack tooling LLM yang tim Techsy benar-benar gunakan di produksi. Terhubung di LinkedIn.
Pertanyaan yang Sering Diajukan
Apa itu GPU serverless?
Platform GPU serverless menjalankan container model kamu di hardware bersama, scale to zero antar-request, dan hanya menagih komputasi aktif. Kamu dapat endpoint inferensi tanpa mengelola instance GPU persisten. Trade-off-nya adalah penundaan cold start saat spin-up.
Berapa biaya menjalankan LLM di GPU serverless?
A100 80GB jalan $2,25/jam di Beam, $2,50/jam di Modal, $2,72/jam di RunPod (diverifikasi 2026-07-30). Tagihan kamu tergantung duty cycle: 3.000 request/hari di 2s masing-masing biaya ~$4/hari di Modal. Storage menambah $0,09/GiB/bulan, dengan 1 TiB gratis.
Apakah saya bayar untuk menyimpan bobot model?
Ya, tapi murah. Modal mematok $0,09/GiB/bulan dengan 1 TiB/bulan gratis, jadi checkpoint 80 GB tidak biaya apa-apa. Halaman harga RunPod mencantumkan network storage di $0,07/GB/bulan di bawah 1 TB, sekitar $5,60/bulan untuk 80 GB yang sama.
Apakah model saya diunduh ulang di setiap request?
Hanya jika tidak ada yang di-cache. Bobot di volume persisten atau di-bake ke image bertahan melewati cold start. Arahkan cache Hugging Face ke ephemeral storage dan model 130 GB diunduh ulang setiap spin-up. Itu mode kegagalan yang harus dihindari.
Berapa lama cold start untuk model 7B?
Perkirakan 10-30 detik pada cold start sejati, menurut laporan praktisi (r/LLMDevs, Des 2024). Container boot dalam 1-5s (dokumen Modal, Cloud Run). Sisanya pemuatan bobot dan inisialisasi engine. Dengan snapshot dan sleep mode, Umapathi mengukur ~70s untuk model 27B, turun dari 460s.
Bisa jalankan model 70B di GPU serverless?
Biasanya tidak. Model 70B di FP16 butuh ~140 GB VRAM. Cloud Run mengizinkan satu GPU per instance (maks 96 GB). Kamu butuh kuantisasi FP8 untuk muat di satu kartu 80 GB, atau platform multi-GPU. Kebanyakan permukaan serverless membatasi satu GPU.
Apakah GPU serverless lebih murah dari sewa GPU 24/7?
Di bawah ~47.000 request/hari (di 2s/request pada A100 80GB), ya. Serverless hanya menagih detik aktif; GPU sewaan menagih 24 jam tanpa peduli. Di atas itu, GPU sewaan menang. API token hosted mengalahkan keduanya di volume rendah. Lihat tabel break-even di atas.
Bisa deploy LLM di GPU serverless gratis?
Modal memberi kredit gratis $30/bulan (Starter). Beam memberi $30/bulan. Kredit akun baru GCP $300 mencakup penggunaan GPU Cloud Run. Cukup untuk prototyping, tidak untuk trafik produksi. Tidak ada platform yang menawarkan tier gratis permanen untuk inferensi GPU.
Provider GPU serverless mana yang tersedia di Eropa?
Cloud Run melayani GPU L4 di europe-west1 (Belgia) dan europe-west4 (Belanda). Modal mendokumentasikan pemilihan region EU (eu-west, eu-north, eu-south) dengan harga 1,5-1,75x tarif dasar. RunPod menyebutkan data center Eropa termasuk EU-NL-1 dan EU-FR-1. Pin region secara eksplisit; tidak ada yang default ke EU.
Apakah saya butuh Docker untuk deploy LLM di GPU serverless?
Tidak selalu. RunPod menawarkan template worker vLLM prebuilt yang melewati Docker. Modal membangun container dari definisi image Python di kode. Untuk dependensi kustom kamu perlu menulis Dockerfile. Untuk serving vLLM standar, jalur prebuilt bekerja dalam hitungan menit.
Kesimpulan
Lima platform, lima satuan penagihan, satu tabel ternormalisasi. Keputusannya lebih sederhana dari yang halaman vendor tunjukkan:
- Pilih GPU berdasarkan VRAM, bukan merek.
- Taruh bobot kamu di volume, bukan di image, kecuali kamu tidak pernah ganti model.
- Perkirakan cold start 10-30 detik dan rencanakan di sekitarnya.
- Di bawah ~47.000 request/hari, scale-to-zero menang di biaya.
- Serving engine di balik endpoint bisa ditukar;
base_urlcuma satu baris.
Kamu punya endpoint yang bisa dipanggil. Berikutnya: apa yang duduk di depannya saat kamu butuh routing dan failover? Perbandingan LLM gateway kami menjawab itu. Atau diskusikan setup kamu dengan kami.