Techsy
Kontak
Mulai Sekarang
Kembali ke Blog
ai-machine-learning

Deploy LLM di GPU Serverless: 5 Platform, Harga Nyata, Cold Start Jujur

Ditulis oleh Mert Batur
Aug 8, 2026
13 baca
Daftar Isi
Deploy LLM di GPU Serverless: 5 Platform, Harga Nyata, Cold Start Jujur

Deploy LLM di GPU Serverless: 5 Platform, Harga Nyata, Cold Start Jujur

RunPod mematok $2,72/jam untuk A100 80GB. Endpoint kamu cuma dapat dua belas request sebelum makan siang. GPU itu menganggur 23 jam sisanya, tapi tagihan jalan terus. Deploy LLM di GPU serverless dan kamu hanya bayar saat request berjalan. Lima platform melakukan ini. Mereka menagih dalam lima satuan berbeda. Tidak ada yang menormalisasi.

GPU menganggur biayanya persis sama dengan GPU sibuk.

Poin Penting

  • GPU serverless hanya menagih saat request berjalan dan scale to zero di antaranya.
  • Satu GPU per instance di Cloud Run; model 70B butuh multi-GPU, jadi serverless biasanya tidak bisa meng-host-nya.
  • Bobot model ada di dalam image, di network volume, atau diunduh ulang setiap cold start.
  • Cold start itu tiga hal: boot container, pemuatan bobot, inisialisasi engine. Hanya yang pertama yang cepat.
  • Di bawah sekitar 47.000 request per hari, scale-to-zero lebih murah dari GPU sewaan 24/7.

Apa sebenarnya arti 'GPU serverless' untuk LLM?

Platform GPU serverless menjalankan container inferensi kamu di hardware GPU bersama, menyalakannya saat request datang, dan scale to zero saat trafik berhenti. Kamu bayar per detik (atau per menit, atau per jam, tergantung vendor) hanya selama container hidup. Tidak ada tagihan menganggur. Tidak ada reserved instance.

Satuan penagihan berbeda tiap vendor, makanya bagian berikutnya menormalisasi semuanya ke $/GPU-jam.

Dua batasan yang sering bikin kaget. Pertama, Google Cloud Run mengizinkan satu GPU per instance, maksimal. Itu membatasi plafon VRAM kamu di satu kartu. Kedua, "serverless" bukan berarti state persisten. Tidak ada proses long-lived yang menahan bobot kamu di RAM antar-request. Saat container mati, semua yang ada di memori ikut mati. Satu fakta itu yang menentukan keputusan penyimpanan di bagian bobot model di bawah.

Serverless bukan berarti tanpa server. Artinya tidak ada server di antara request kamu, dan persis di situlah bobot model kamu menghilang.

Platform GPU serverless mana yang harus kamu pilih? (Harga 2026, berdampingan)

Kami tidak menjual satu pun platform ini dan tidak menerima pendapatan afiliasi dari mana pun. Dari tujuh artikel yang bersaing untuk query ini dan varian dekatnya, empat dipublikasikan oleh perusahaan yang menjual GPU serverless. Tabel ini bukan.

Semua tarif dibaca dari halaman harga resmi vendor pada 2026-07-30. Tarif berubah; cek ulang sebelum kamu commit.

PlatformSatuan publik (kata mereka)$/GPU-jam (A100 80GB)$/GPU-jam (H100)Kredit gratisPilih ini jika...
Modal$0,000694/s$2,50$3,95$30/bln Starterkamu mau penagihan per detik, build cepat, dan GPU snapshot
RunPod$2,72/jam$2,72$4,55tidak dipublikasikankamu mau menu GPU terlengkap dengan tarif per jam flat
Beam$0,000625/s$2,25$3,55$30/blnkamu mau nol tagihan untuk spin-up dan pemuatan image
Baseten$0,06667/mnt$4,00$6,50ya, jumlah tidak dipublikasikankamu mau inferensi terkelola dengan penagihan komputasi aktif
Cloud Runper detik (L4 dan RTX PRO 6000 Blackwell; tanpa A100/H100)tidak dipublikasikan (tanpa A100)tidak dipublikasikan (tanpa H100)kredit GCP $300kamu sudah di GCP dan butuh kontrol region EU/US

Aritmetika normalisasi, ditampilkan sekali supaya kamu bisa audit: Modal A100 80GB di $0,000694/s dikali 3600 detik sama dengan $2,4984/jam. Beam: $0,000625 kali 3600 sama dengan $2,25/jam. Baseten: $0,06667/mnt kali 60 sama dengan $4,00/jam. Selisih 1,8x antara Beam dan Baseten untuk A100 yang sama itu nyata, dan tersembunyi di depan mata karena tidak ada yang mempublikasikan satuan yang sama.

Tiga catatan. Halaman harga Beam secara eksplisit menyatakan tidak menagih untuk spin-up server atau pemuatan image container. FAQ harga Baseten menjawab "Apakah saya bayar untuk waktu menganggur di Baseten?" dengan "Tidak, Anda tidak membayar untuk waktu menganggur," lalu menambahkan bahwa waktu yang ditagih adalah "waktu model Anda aktif di-deploy, scaling naik atau turun, atau membuat prediksi," jadi meternya mencakup lebih dari waktu prediksi, dan itu bagian yang perlu dianggarkan. RunPod mempublikasikan tarif per jam dan tanpa angka cold start di halaman harganya.

Jika Modal pilihan kamu, kami sudah menulis panduan lengkap Modal secara terpisah.

Apakah model kamu muat? VRAM, batas satu GPU, dan kuota

Bisa jalankan model 70B di GPU serverless? Biasanya tidak. Di FP16, 70B butuh ~140 GB VRAM. Cloud Run membatasi satu GPU per instance (maks 96 GB di RTX PRO 6000). Hitungannya tidak masuk tanpa kuantisasi (FP8/GGUF) atau platform multi-GPU.

GPUVRAMMin CPU / memoriPlafon model tipikal
L424 GB4 CPU / 16 GiB7B-13B (FP16), hingga 30B kuantisasi
A100 80GB80 GBbervariasi per platform30B-70B kuantisasi
H100 80GB80 GBbervariasi per platform30B-70B kuantisasi
RTX PRO 6000 Blackwell96 GB20 CPU / 80 GiB70B di FP8

Kuota default Cloud Run adalah 3 GPU L4 per region per project (RTX PRO 6000 diberikan terpisah, sebagai 3.000 milliGPU), di enam region L4: asia-southeast1, asia-south1, europe-west1, europe-west4, us-central1, us-east4. Itu separuh Cloud Run dari jawaban residensi data untuk siapa pun yang bertanya soal GPU serverless di Eropa; Modal dan RunPod mendokumentasikan region EU mereka sendiri, dan FAQ punya sisanya.

Ismaili Simba di panduan Cloud Run di dev.to (April 2025) melaporkan bahwa permintaan kuota "bisa memakan waktu (hingga 5 hari kerja) untuk disetujui," dan bahwa "GPU L4 yang tersedia di Cloud Run memiliki batas RAM 16GB." Rencanakan keterlambatan itu.

Untuk sizing VRAM per model, lihat panduan kebutuhan VRAM kami.

Di mana bobot model kamu disimpan (dan berapa biayanya)?

Sebuah thread Reddit dari November 2024 yang masih duduk di #5 Google untuk query persis ini saat kami cek pada 2026-07-30 bertanya, verbatim:

"Saya tidak bisa menemukan tarif untuk menyimpan model 80 gb… Apa alternatifnya jika saya tidak mau mengunduh model di setiap panggilan api (pod di-provision saat panggilan lalu ditutup)? … Kenapa platform-platform ini tidak mencantumkan biaya penyimpanan model?"

Tiga balasan berskor rendah, tidak satu pun menjawab. Saat kami menjalankan pencarian ini pada 2026-07-30, sepuluh hasil teratas masih termasuk thread berumur dua tahun yang bertanya berapa biaya penyimpanan model. Tidak ada di thread itu yang menjawab. Kedua platform mempublikasikan tarifnya. Di Modal, $0,09 per GiB per bulan dengan TiB pertama gratis, jadi checkpoint 80 GB itu ditagih $0,00. Di RunPod, $0,07 per GB per bulan untuk network storage di bawah 1 TB, yang menempatkan checkpoint yang sama di sekitar $5,60 per bulan.

PenempatanDampak cold startBiayanyaRebuild untuk ganti model?Terbaik untuk
Di-bake ke dalam image containerBoot tercepatUkuran image membengkak (27B FP8 = puluhan GB)Ya, rebuild penuhEndpoint satu model
Network volume persistenCepat (di-cache di host)Modal $0,09/GiB/bln, 1 TiB gratis; RunPod $0,07/GB/bln di bawah 1 TBTidak, ganti path-nyaMulti-model atau sering ganti
Diunduh dari Hugging Face saat bootPaling lambat: 26s+ untuk 130 GB di 5 GB/sGratis (bandwidth HF)TidakPrototyping saja

Baris ketiga adalah mode kegagalan. Sebuah ulasan TU München 2024 tentang ServerlessLLM (arXiv 2411.15664) melaporkan LLaMA-2-70B (130 GB) butuh 26+ detik untuk diunduh di 5 GB/s, plus ~84 detik untuk dimuat ke 8 GPU, terhadap ~100 ms generasi token. Angka-angka itu dikutip di ulasan tersebut, bukan diukur olehnya.

Halaman harga RunPod punya bagian Storage: container disk $0,10/GB/bln, volume disk $0,10/GB/bln berjalan dan $0,20/GB/bln menganggur, network storage $0,07/GB/bln di bawah 1 TB dan $0,05/GB/bln di atasnya, high-performance network storage $0,14/GB/bln. Angkanya ada. Hanya saja tidak duduk di samping tarif per GPU serverless yang sedang dibandingkan pembaca saat pertanyaan itu muncul, juga tidak di alur konfigurasi endpoint. Masalah ketercarian, bukan kerahasiaan, dan cukup untuk menjaga pertanyaan itu tetap hidup dua tahun kemudian.

bash
# Point the Hugging Face cache at a mounted network volume
# so weights persist across cold starts (RunPod / Modal pattern)
export HF_HOME=/workspace/hf-cache
export TRANSFORMERS_CACHE=/workspace/hf-cache
export HF_HUB_ENABLE_HF_TRANSFER=1
dockerfile
# Alternative: bake weights into the image at build time
FROM vllm/vllm-openai:latest
COPY ./model-weights /models/qwen3-27b-fp8
ENV MODEL_NAME=/models/qwen3-27b-fp8
# Downside: 30+ GB image, full rebuild to change models

Jika kamu belum memilih model, roundup open-weights 2026 kami mengukur setiap opsi untuk deployment.

Deploy: vLLM di RunPod Serverless, dari awal sampai akhir

Enam langkah dari nol ke endpoint yang bisa dipanggil. Verifikasi masing-masing terhadap prosedur vLLM RunPod (diperbarui 22 Jun 2026), yang tidak mempublikasikan harga.

  1. Pilih model kamu. Pilih model open-weights yang sesuai ukuran GPU kamu (lihat tabel VRAM di atas). Jika modelnya gated di Hugging Face, buat access token dulu.

  2. Buat endpoint serverless. Di konsol RunPod, pilih Serverless, pilih template worker vLLM, dan pilih tier GPU kamu.

  3. Set environment variable yang penting.

env
MODEL_NAME=Qwen/Qwen3.6-27B-FP8
MAX_MODEL_LEN=32768
GPU_MEMORY_UTILIZATION=0.90
DTYPE=auto

MODEL_NAME salah berarti 404 saat boot. MAX_MODEL_LEN terlalu tinggi untuk VRAM kamu berarti OOM sebelum token pertama. GPU_MEMORY_UTILIZATION di atas 0,95 tidak menyisakan headroom untuk lonjakan KV-cache.

  1. Set min/max worker dan idle timeout. Min worker di 0 memberi kamu scale-to-zero (dan cold start). Min worker di 1 menghilangkan cold start tapi menagih terus-menerus. Bagian cold start di bawah mengurai trade-off itu.

  2. Pasang network volume yang sudah kamu putuskan di bagian bobot model, atau terima jalur image-bake. Jika kamu lewati ini, setiap cold start mengunduh ulang checkpoint.

  3. Kirim request pertama. Baca endpoint ID dari konsol dan konfirmasi token kembali.

bash
curl -X POST "https://api.runpod.ai/v2/${ENDPOINT_ID}/runsync" \
  -H "Authorization: Bearer ${RUNPOD_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "input": {
      "messages": [{"role": "user", "content": "Explain cold starts in one sentence."}],
      "max_tokens": 60
    }
  }'

Jika kamu sedang menimbang serving engine-nya sendiri, kami sudah membandingkan vLLM dan SGLang soal throughput dan latensi.

Bagaimana cara memanggil endpoint dari aplikasi kamu?

Setiap platform di daftar pendek ini berbicara API yang kompatibel dengan OpenAI. Satu snippet Python bekerja di mana saja. Ganti provider cukup ubah base_url, bukan tulis ulang. Itu mengubah "provider mana" dari keputusan lock-in menjadi keputusan konfigurasi.

python
import os

from openai import OpenAI

ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]

client = OpenAI(
    base_url=f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
    api_key=os.environ["RUNPOD_API_KEY"],
)

response = client.chat.completions.create(
    model="Qwen/Qwen3.6-27B-FP8",
    messages=[{"role": "user", "content": "What is scale to zero?"}],
    max_tokens=120,
)
print(response.choices[0].message.content)
python
# Same code, different provider. One line changes.
ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]

PROVIDERS = {
    "runpod": f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
    "modal": "https://your-app--your-func.modal.run/v1",
    "beam": "https://your-beam-endpoint/v1",
}

client = OpenAI(base_url=PROVIDERS["modal"], api_key="your-key")

Jika setiap provider berbicara dialek OpenAI, "provider GPU serverless mana" berhenti jadi keputusan arsitektur dan jadi satu baris konfigurasi.

Setelah kamu punya beberapa endpoint, perbandingan LLM gateway kami membahas routing dan failover. Untuk setup yang lebih ringan, proxy LiteLLM menambahkan retry dan logging.

Cold start seperti apa yang sebenarnya akan kamu lihat?

Untuk model 7B di GPU serverless, perkirakan 10 sampai 30 detik pada cold start sejati (boot container plus pemuatan bobot plus inisialisasi engine), berdasarkan laporan praktisi. Dokumen vendor mengutip 1 sampai 5 detik untuk boot container saja. Jarak antara angka-angka itu adalah checkpoint kamu yang menyeberangi jaringan.

Halaman produk RunPod mengklaim cold start FlashBoot di bawah 200ms (klaim vendor, bukan pengukuran). Seorang praktisi di r/LLMDevs melaporkan: "cold start menurut pengalaman saya tidak bagus… saya bilang sekitar 10 - 30 detik", menambahkan "sebagian besar pengalaman saya di model difusi sih." Keduanya benar. Mereka mengukur hal berbeda.

Angka cold start itu tiga angka yang ditumpuk:

  1. Boot container. Dokumen Modal: "Container boot dalam sekitar satu detik." Cloud Run: instance dengan driver terinstal sebelumnya "mulai dalam sekitar 5 detik."

  2. Pemuatan bobot. Bagian yang tidak diiklankan siapa pun. Ulasan TU München 2024 tentang ServerlessLLM (arXiv 2411.15664) menempatkan LLaMA-2-70B di 26+ detik untuk unduh plus ~84 detik untuk dimuat ke 8 GPU.

  3. Inisialisasi engine. Graph capture dan warm-up vLLM. Logesh Umapathi mengukur Qwen3.6-27B-FP8 di A100-80GB dari baseline 460s ke 219s dengan eager mode hingga ~70s dengan vLLM sleep mode plus Modal GPU snapshot. Itu 6,5x, dipublikasikan 17 Mei 2026.

SumberYang diukurAngkaTanggalJenis
Dokumen ModalBoot container~1ssaat iniDokumen vendor
Dokumen Cloud RunMulai instance (driver terinstal)~5ssaat iniDokumen vendor
UmapathiQwen3.6-27B-FP8, A100-80GB, cold start penuh460s ke 219s ke ~70sMei 2026Pengukuran independen
Ulasan TU München tentang ServerlessLLM (arXiv 2411.15664)Unduh + muat LLaMA-2-70B, angka dikutip bukan diukur26s unduh + 84s muat2024Preprint arXiv (ulasan)
Praktisi r/LLMDevs7B di RunPod, request penuh~10-30sDes 2024Anekdot (catatan difusi)

Interpretasi kami terhadap data yang dipublikasikan: angka vendor mengukur container. Angka praktisi mengukur seluruh request. Di antara dua stopwatch itu duduk 80 GB bobot yang menyeberangi jaringan. Kolom Jenis adalah poinnya.

Yang harus dilakukan: vLLM sleep mode, GPU snapshot, dan menyetel jendela scaledown. Default idle Modal 60 detik (bisa dikonfigurasi 2s-20mnt). Worker hangat menghilangkan cold start tapi menagih seperti always-on.

python
# Modal scaledown config (illustrative)
# A 60s window means you pay for 60 idle seconds per burst.
# A warm worker (min_containers=1) costs ~$2.50/hr on A100 80GB, 24/7.
@app.function(
    gpu="A100",
    scaledown_window=60,  # seconds idle before shutdown
    # min_containers=1,   # uncomment to kill cold starts; costs $60/day
)

Apakah GPU serverless lebih murah dari GPU always-on?

GPU serverless lebih murah saat GPU kamu menganggur sebagian besar hari. Di 3.000 request/hari rata-rata 2 detik masing-masing di A100 80GB, serverless biaya sekitar $4,17/hari versus $65,28/hari untuk GPU sewaan yang jalan 24/7. Titik silangnya adalah pertanyaan duty-cycle, bukan pertanyaan volume.

Asumsi (kami, dinyatakan supaya kamu bisa jalankan ulang): A100 80GB di $2,50/jam Modal, 2 detik rata-rata waktu GPU per request, GPU sewaan di $2,72/jam RunPod sepanjang waktu, API token hosted di $0,40/1M token (tarif publik kelas menengah), dan ~1.000 token per request.

Request/hariServerless (est.)GPU sewaan 24/7API token hostedTermurah
500$0,69$65,28$0,20API token
3.000$4,17$65,28$1,20API token
10.000$13,89$65,28$4,00API token
50.000$69,44$65,28$20,00API token
200.000$277,78$65,28$80,00GPU sewaan

Titik silang mendarat di sekitar 47.000 request/hari. Di bawah itu, serverless menang. API token hosted mengalahkan keduanya di volume rendah dengan model komoditas. Break-even bukan soal berapa banyak request yang kamu dapat. Soal berapa jam GPU kamu menghabiskan waktu tanpa melakukan apa-apa.

Analisis BentoML Agustus 2024 membingkai trade-off ini dengan baik, meski contoh harganya dari era GPT-3.5-turbo dan sudah dua tahun usang.

Untuk biaya API token hosted di volume kamu, lihat perbandingan harga API LLM kami. Untuk memotong biaya per request di sisi inferensi, prompt caching biasanya menghemat 30-60% pada konteks berulang.

python
# Break-even calculator: adjust these and re-run
REQUESTS_PER_DAY = 3000
SECONDS_PER_REQUEST = 2
SERVERLESS_RATE_HR = 2.50   # Modal A100 80GB
RENTED_RATE_HR = 2.72       # RunPod A100 80GB, 24/7

serverless_daily = REQUESTS_PER_DAY * SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR
rented_daily = RENTED_RATE_HR * 24

print(f"Serverless: ${serverless_daily:.2f}/day")
print(f"Rented 24/7: ${rented_daily:.2f}/day")
print(f"Crossover: {int(RENTED_RATE_HR * 24 / (SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR))} req/day")

Kapan GPU serverless adalah pilihan yang salah

  • Trafik tinggi berkelanjutan. Lewat ~47.000 request/hari di tarif ini, duty cycle berbalik dan GPU sewaan lebih murah per request.
  • SLO sub-detik ketat di jalur cold. Tidak ada trik snapshot yang membuat request pertama instan. Pelihara worker hangat atau sewa box-nya.
  • Model 70B+ yang butuh banyak GPU. Satu GPU per instance di Cloud Run mengakhiri percakapan itu.
  • Residensi data ketat. Enam region L4 adalah seluruh menu di Cloud Run.
  • Ekonomi per-request yang kalah dari slot worker yang sudah kamu bayar. Jika kamu punya headroom GPU cadangan, menambah inferensi tidak biaya ekstra.

Jika GPU kamu sibuk enam belas jam sehari, serverless adalah opsi mahal dan siapa pun yang bilang sebaliknya sedang menjual serverless.

Untuk jalur local-first, lihat panduan tooling LLM lokal kami.

Tentang Penulis

Mert Batur adalah Co-Founder Techsy.io, di mana timnya membangun AI agent, sistem otomasi, dan pipeline voice/SDR untuk klien B2B. Dia menulis tentang stack tooling LLM yang tim Techsy benar-benar gunakan di produksi. Terhubung di LinkedIn.

Pertanyaan yang Sering Diajukan

Apa itu GPU serverless?

Platform GPU serverless menjalankan container model kamu di hardware bersama, scale to zero antar-request, dan hanya menagih komputasi aktif. Kamu dapat endpoint inferensi tanpa mengelola instance GPU persisten. Trade-off-nya adalah penundaan cold start saat spin-up.

Berapa biaya menjalankan LLM di GPU serverless?

A100 80GB jalan $2,25/jam di Beam, $2,50/jam di Modal, $2,72/jam di RunPod (diverifikasi 2026-07-30). Tagihan kamu tergantung duty cycle: 3.000 request/hari di 2s masing-masing biaya ~$4/hari di Modal. Storage menambah $0,09/GiB/bulan, dengan 1 TiB gratis.

Apakah saya bayar untuk menyimpan bobot model?

Ya, tapi murah. Modal mematok $0,09/GiB/bulan dengan 1 TiB/bulan gratis, jadi checkpoint 80 GB tidak biaya apa-apa. Halaman harga RunPod mencantumkan network storage di $0,07/GB/bulan di bawah 1 TB, sekitar $5,60/bulan untuk 80 GB yang sama.

Apakah model saya diunduh ulang di setiap request?

Hanya jika tidak ada yang di-cache. Bobot di volume persisten atau di-bake ke image bertahan melewati cold start. Arahkan cache Hugging Face ke ephemeral storage dan model 130 GB diunduh ulang setiap spin-up. Itu mode kegagalan yang harus dihindari.

Berapa lama cold start untuk model 7B?

Perkirakan 10-30 detik pada cold start sejati, menurut laporan praktisi (r/LLMDevs, Des 2024). Container boot dalam 1-5s (dokumen Modal, Cloud Run). Sisanya pemuatan bobot dan inisialisasi engine. Dengan snapshot dan sleep mode, Umapathi mengukur ~70s untuk model 27B, turun dari 460s.

Bisa jalankan model 70B di GPU serverless?

Biasanya tidak. Model 70B di FP16 butuh ~140 GB VRAM. Cloud Run mengizinkan satu GPU per instance (maks 96 GB). Kamu butuh kuantisasi FP8 untuk muat di satu kartu 80 GB, atau platform multi-GPU. Kebanyakan permukaan serverless membatasi satu GPU.

Apakah GPU serverless lebih murah dari sewa GPU 24/7?

Di bawah ~47.000 request/hari (di 2s/request pada A100 80GB), ya. Serverless hanya menagih detik aktif; GPU sewaan menagih 24 jam tanpa peduli. Di atas itu, GPU sewaan menang. API token hosted mengalahkan keduanya di volume rendah. Lihat tabel break-even di atas.

Bisa deploy LLM di GPU serverless gratis?

Modal memberi kredit gratis $30/bulan (Starter). Beam memberi $30/bulan. Kredit akun baru GCP $300 mencakup penggunaan GPU Cloud Run. Cukup untuk prototyping, tidak untuk trafik produksi. Tidak ada platform yang menawarkan tier gratis permanen untuk inferensi GPU.

Provider GPU serverless mana yang tersedia di Eropa?

Cloud Run melayani GPU L4 di europe-west1 (Belgia) dan europe-west4 (Belanda). Modal mendokumentasikan pemilihan region EU (eu-west, eu-north, eu-south) dengan harga 1,5-1,75x tarif dasar. RunPod menyebutkan data center Eropa termasuk EU-NL-1 dan EU-FR-1. Pin region secara eksplisit; tidak ada yang default ke EU.

Apakah saya butuh Docker untuk deploy LLM di GPU serverless?

Tidak selalu. RunPod menawarkan template worker vLLM prebuilt yang melewati Docker. Modal membangun container dari definisi image Python di kode. Untuk dependensi kustom kamu perlu menulis Dockerfile. Untuk serving vLLM standar, jalur prebuilt bekerja dalam hitungan menit.

Kesimpulan

Lima platform, lima satuan penagihan, satu tabel ternormalisasi. Keputusannya lebih sederhana dari yang halaman vendor tunjukkan:

  • Pilih GPU berdasarkan VRAM, bukan merek.
  • Taruh bobot kamu di volume, bukan di image, kecuali kamu tidak pernah ganti model.
  • Perkirakan cold start 10-30 detik dan rencanakan di sekitarnya.
  • Di bawah ~47.000 request/hari, scale-to-zero menang di biaya.
  • Serving engine di balik endpoint bisa ditukar; base_url cuma satu baris.

Kamu punya endpoint yang bisa dipanggil. Berikutnya: apa yang duduk di depannya saat kamu butuh routing dan failover? Perbandingan LLM gateway kami menjawab itu. Atau diskusikan setup kamu dengan kami.

Tag

deploy-llm-gpu-serverlessgpu-serverlessvllminferensi-llmcold-start

Bagikan artikel ini

Artikel Terkait

Lebih lanjut di ai-machine-learning

ai-machine-learning
Aug 7, 2026

Pola Workflow AI Agent: 7 Pola dan Kapan Masing-Masing Benar-Benar Menang (2026)

Tujuh pola workflow AI agent terus muncul di setiap taksonomi vendor, tapi tidak ada yang menang di semua kasus. Artikel ini meranking semuanya berdasarkan data benchmark 2026 yang dipublikasikan Google Research dan Anthropic, lengkap dengan perhitungannya, kode Python yang bisa langsung dijalankan untuk tiap bentuk, dan tangga keputusan untuk memilih.

13 menit baca baca
Baca
ai-machine-learning
Aug 7, 2026

Strategi Chunking RAG: 7 Metode, Peringkat Berdasarkan Data Retrieval (2026)

Chunking membagi dokumen sebelum embedding, dan titik pembagiannya menentukan apa yang bisa dan tidak bisa ditemukan retriever. Kami memberi peringkat 7 strategi chunking RAG terhadap benchmark publik 472 query milik Chroma, lalu memetakan masing-masing ke model embedding yang sudah kamu pakai.

15 menit baca baca
Baca
ai-machine-learning
Aug 6, 2026

Framework RAG Terbaik 2026: LangChain vs LlamaIndex vs Haystack (dan Kapan Kamu Tidak Butuh Satu Pun)

LangChain 1.0 adalah pilihan default untuk kebanyakan tim, tapi jawaban jujur untuk aplikasi Q&A satu korpus adalah kamu mungkin tidak butuh framework sama sekali. Kami membandingkan 8 lapisan orkestrasi berdampingan, dengan kode, data repo terbaru, dan anggaran latensi.

14 menit baca baca
Baca
Lihat Semua Postingan
Mulai Proyek Anda

Siap membangun sesuatu lu biasa?

Mari wujudkan visi Anda menjadi kenyataan. Tim kami siap membantu Anda menciptakan software yang benar-benar berdampak.

Jadwalkan panggilan scoping 30 menitLihat Karya Kami

Terbaru dari library

Skill Claude

Lihat semua
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Otomatisasi AI

Lihat semua
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Terbaru dari library

Skill Claude

Lihat semua
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Otomatisasi AI

Lihat semua
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Layanan

  • Solusi Enterprise
  • Aplikasi Mobile
  • Aplikasi Web

Solusi

  • Sistem CRM
  • Integrasi AI
  • Solusi ERP
  • Agen Suara
  • Otomasi Proses
  • Keamanan Siber

Perpustakaan

  • Blog
  • Portofolio

Komunitas

  • Otomatisasi AI
  • Skill Claude

Alat

  • Kalkulator Biaya Aplikasi Mobile
  • Kalkulator Biaya API OpenAI / LLM
  • Kalkulator Biaya MVP
  • Kalkulator Biaya Voice AI Agent

Perusahaan

  • Tentang
  • Mitra
  • Kontak

Hukum

  • Kebijakan Privasi
  • Syarat Layanan
  • Kebijakan Kuki

Layanan

  • Solusi Enterprise
  • Aplikasi Mobile
  • Aplikasi Web

Solusi

  • Sistem CRM
  • Integrasi AI
  • Solusi ERP
  • Agen Suara
  • Otomasi Proses
  • Keamanan Siber

Perpustakaan

  • Blog
  • Portofolio

Komunitas

  • Otomatisasi AI
  • Skill Claude

Alat

  • Kalkulator Biaya Aplikasi Mobile
  • Kalkulator Biaya API OpenAI / LLM
  • Kalkulator Biaya MVP
  • Kalkulator Biaya Voice AI Agent

Perusahaan

  • Tentang
  • Mitra
  • Kontak
HukumKebijakan PrivasiSyarat LayananKebijakan Kuki
TECHSY
© 2026 Techsy. Seluruh hak cipta dilindungi.