
Nasazení LLM na serverless GPU: 5 platforem, reálné ceny, studené starty bez příkras
RunPod účtuje 2,72 $/h za A100 80GB. Váš endpoint do oběda dostane dvanáct požadavků. Zbylých 23 hodin GPU nečinně stojí a celou dobu fakturuje. Nasaďte LLM na serverless GPU a platíte jenom zatímco požadavek běží. Dělá to pět platforem. Každá účtuje v jiné jednotce. Nikdo je nepřepočítává.
Nečinná GPU stojí přesně tolik co vytížená.
Hlavní body
- Serverless GPU fakturuje jenom zatímco požadavek běží, a mezi požadavky škáluje na nulu.
- Cloud Run dává jednu GPU na instanci; 70B modely potřebují několik GPU, takže je serverless většinou neutáhne.
- Váhy modelu leží v image, na síťovém svazku, nebo se při každém studeném startu stahují znovu.
- Studený start jsou tři věci: start kontejneru, načtení vah, inicializace enginu. Rychlá je jenom ta první.
- Zhruba pod 47 000 požadavků denně vyjde škálování na nulu levněji než pronajatá GPU 24/7.
Co vlastně znamená „serverless GPU" pro LLM?
Platforma se serverless GPU spouští váš inferenční kontejner na sdíleném GPU hardwaru, nastartuje ho, když přijde požadavek, a škáluje na nulu, když provoz ustane. Platíte za sekundu (nebo za minutu či za hodinu, podle vendora) jenom zatímco kontejner žije. Žádná faktura za nečinnost. Žádná rezervovaná instance.
Fakturační jednotka se u každého vendora liší, proto další sekce všechno přepočítává na $/GPU-hodinu.
Dvě omezení lidi překvapí. Zaprvé, Google Cloud Run povoluje nanejvýš jednu GPU na instanci. Tím končí strop VRAM na jedné kartě. Zadruhé, „serverless" neznamená trvalý stav. Neexistuje žádný dlouho běžící proces, který by mezi požadavky držel vaše váhy v RAM. Když kontejner zemře, všechno v paměti zemře s ním. Právě tahle skutečnost řídí rozhodnutí o úložišti v sekci o vahách modelu níže.
Serverless neznamená bez serveru. Znamená to žádný server mezi vašimi požadavky, a přesně tam se vaše váhy modelu ztrácejí.
Kterou serverless GPU platformu vybrat? (ceny 2026, vedle sebe)
Žádnou z těchto platforem neprodáváme a z žádné nemáme affiliate příjem. Ze sedmi článků, které o tento dotaz a jeho varianty soutěží, publikovaly čtyři firmy, jež serverless GPU prodávají. Tahle tabulka ne.
Všechny sazby jsme četli z ceníků samotných vendorů 30. 7. 2026. Ceny se mění; před závazným rozhodnutím je znovu zkontrolujte.
| Platforma | Zveřejněná jednotka (jejich slovy) | $/GPU-h (A100 80GB) | $/GPU-h (H100) | Kredity zdarma | Vyberte ji, pokud… |
|---|---|---|---|---|---|
| Modal | 0,000694 $/s | 2,50 $ | 3,95 $ | 30 $/měs. (Starter) | chcete fakturaci po sekundách, rychlé buildy a GPU snapshoty |
| RunPod | 2,72 $/h | 2,72 $ | 4,55 $ | žádné zveřejněné | chcete nejširší nabídku GPU za paušální hodinové sazby |
| Beam | 0,000625 $/s | 2,25 $ | 3,55 $ | 30 $/měs. | chcete nulovou fakturaci za start a načtení image |
| Baseten | 0,06667 $/min | 4,00 $ | 6,50 $ | ano, částka nezveřejněna | chcete spravovanou inferenci s fakturací aktivního výpočtu |
| Cloud Run | po sekundách (L4 a RTX PRO 6000 Blackwell; žádné A100/H100) | nezveřejněno (žádné A100) | nezveřejněno (žádné H100) | 300$ GCP kredit | už jste na GCP a potřebujete kontrolu nad EU/US regiony |
Aritmetika přepočtu, ukázaná jednou, abyste si ji mohli ověřit: Modal A100 80GB za 0,000694 $/s krát 3600 sekund se rovná 2,4984 $/h. Beam: 0,000625 krát 3600 se rovná 2,25 $/h. Baseten: 0,06667 $/min krát 60 se rovná 4,00 $/h. Ten 1,8násobný rozdíl mezi Beamem a Basetenem za totéž A100 je reálný a skrývá se přímo před očima, protože nikdo nezveřejňuje stejnou jednotku.
Tři výhrady. Ceník Beamu výslovně uvádí, že neúčtuje start serveru ani načtení obrazu kontejneru. FAQ ceníku Basetenu odpovídá na otázku „Platím na Basetenu za čas nečinnosti?" větou „Ne, za čas nečinnosti neplatíte" a dodává, že fakturovatelný čas je „doba, kdy se váš model aktivně nasazuje, škáluje nahoru či dolů nebo provádí predikce", takže měřič pokrývá víc než jen čas predikce, a právě tuhle část je třeba rozpočítávat. RunPod zveřejňuje hodinové sazby a na stránce ceníku žádné číslo studeného startu nemá.
Pokud je váš favorit Modal, napsali jsme kompletní návod pro Modal zvlášť.
Vejde se váš model vůbec? VRAM, limit jedné GPU a kvóty
Poběží 70B model na serverless GPU? Většinou ne. V FP16 potřebuje 70B zhruba 140 GB VRAM. Cloud Run končí na jedné GPU na instanci (maximálně 96 GB na RTX PRO 6000). Bez kvantizace (FP8/GGUF) nebo víце-GPU platformy ta rovnice nevychází.
| GPU | VRAM | Min. CPU / paměť | Obvyklý strop modelů |
|---|---|---|---|
| L4 | 24 GB | 4 CPU / 16 GiB | 7B-13B (FP16), kvantizovaně až 30B |
| A100 80GB | 80 GB | liší se podle platformy | 30B-70B kvantizovaně |
| H100 80GB | 80 GB | liší se podle platformy | 30B-70B kvantizovaně |
| RTX PRO 6000 Blackwell | 96 GB | 20 CPU / 80 GiB | 70B v FP8 |
Výchozí kvóta Cloud Runu jsou 3 GPU L4 na region a projekt (RTX PRO 6000 se přiděluje zvlášť, jako 3 000 milliGPU), a to v šesti regionech L4: asia-southeast1, asia-south1, europe-west1, europe-west4, us-central1, us-east4. To je cloudrunovská polovina odpovědi na datovou rezidenci pro každého, kdo se ptá na serverless GPU v Evropě; Modal a RunPod dokumentují vlastní EU regiony a zbytek najdete ve FAQ.
Cloud Run návod Ismailiho Simby na dev.to (duben 2025) uvádí, že schválení žádosti o kvótu „může nějakou dobu trvat (až 5 pracovních dnů)" a že „GPU L4 dostupné na Cloud Run mají limit 16 GB RAM." S tím zpožděním počítejte.
Pro dimenzování VRAM model po modelu viz náš průvodce požadavky na VRAM.
Kde leží váhy vašeho modelu (a co to stojí)?
Vlákno na Redditu z listopadu 2024, které se při naší kontrole 30. 7. 2026 pořád drželo na 5. místě Googlu přesně pro tento dotaz, se doslova ptá:
„Nedaří se mi najít sazbu za uložení 80GB modelu… Jaká je alternativa, když nechci model stahovat při každém volání API (pod se při volání zřídí a pak zavře)? … Proč tyto platformy neuvádějí cenu za uložení modelu?"
Tři odpovědi s nízkým skóre, žádná z nich odpovědí není. Když jsme totéž hledali 30. 7. 2026, v první desítce výsledků pořád bylo to dva roky staré vlákno ptající se, kolik stojí uložení modelu. Nikdo v něm neodpověděl. Přitom obě platformy sazbu zveřejňují. Na Modalu je to 0,09 $ za GiB a měsíc, první TiB zdarma, takže onen 80GB checkpoint vyjde na 0,00 $. Na RunPodu je to 0,07 $ za GB a měsíc za síťové úložiště do 1 TB, což tentýž checkpoint staví zhruba na 5,60 $ měsíčně.
| Umístění | Dopad na studený start | Co to stojí | Rebuild kvůli výměně modelu? | Nejlepší pro |
|---|---|---|---|---|
| Zapečené v image kontejneru | Nejrychlejší start | Nafouknutí image (27B FP8 = desítky GB) | Ano, kompletní rebuild | Endpointy s jedním modelem |
| Trvalý síťový svazek | Rychlé (cache na hostiteli) | Modal 0,09 $/GiB/měs., 1 TiB zdarma; RunPod 0,07 $/GB/měs. do 1 TB | Ne, stačí vyměnit cestu | Více modelů nebo časté výměny |
| Stažení z Hugging Face při startu | Nejpomalejší: 26 s+ za 130 GB při 5 GB/s | Zdarma (bandwidth HF) | Ne | Jen prototypování |
Třetí řádek je ten selhávající scénář. Recenze ServerlessLLM od TU München z roku 2024 (arXiv 2411.15664) uvádí, že LLaMA-2-70B (130 GB) potřebuje přes 26 sekund na stažení při 5 GB/s a navíc zhruba 84 sekund na načtení na 8 GPU, proti zhruba 100 ms generování tokenu. Ta čísla jsou v recenzi citovaná, ne měřená.
Ceník RunPodu má sekci Storage: disk kontejneru 0,10 $/GB/měs., disk svazku 0,10 $/GB/měs. za běhu a 0,20 $/GB/měs. v nečinnosti, síťové úložiště 0,07 $/GB/měs. do 1 TB a 0,05 $/GB/měs. nad tím, vysokorychlostní síťové úložiště 0,14 $/GB/měs. To číslo existuje. Jenom nesedí vedle serverless sazeb za GPU, které čtenář porovnává ve chvíli, kdy ho otázka napadne, ani v konfiguračním flow endpointu. Problém dohledatelnosti, ne tajnůstkářství, a dost na to, aby otázka zůstala naživu i po dvou letech.
# Point the Hugging Face cache at a mounted network volume
# so weights persist across cold starts (RunPod / Modal pattern)
export HF_HOME=/workspace/hf-cache
export TRANSFORMERS_CACHE=/workspace/hf-cache
export HF_HUB_ENABLE_HF_TRANSFER=1# Alternative: bake weights into the image at build time
FROM vllm/vllm-openai:latest
COPY ./model-weights /models/qwen3-27b-fp8
ENV MODEL_NAME=/models/qwen3-27b-fp8
# Downside: 30+ GB image, full rebuild to change modelsPokud jste model ještě nevybrali, náš přehled open-weights modelů pro 2026 dimenzuje každou variantu pro nasazení.
Nasazení: vLLM na RunPod Serverless, od začátku do konce
Šest kroků od nuly k volatelnému endpointu. Každý si ověřte podle postupu RunPodu pro vLLM (aktualizováno 22. 6. 2026), který žádné ceny nezveřejňuje.
-
Vyberte model. Zvolte open-weights model dimenzovaný na vaši GPU (viz tabulka VRAM výše). Pokud je na Hugging Face řízený přístupem, vygenerujte si nejdřív přístupový token.
-
Vytvořte serverless endpoint. V konzoli RunPodu vyberte Serverless, zvolte šablonu workeru vLLM a vyberte tier GPU.
-
Nastavte proměnné prostředí, na kterých záleží.
MODEL_NAME=Qwen/Qwen3.6-27B-FP8
MAX_MODEL_LEN=32768
GPU_MEMORY_UTILIZATION=0.90
DTYPE=autoŠpatný MODEL_NAME znamená 404 při startu. MAX_MODEL_LEN nastavený příliš vysoko na vaši VRAM znamená OOM ještě před prvním tokenem. GPU_MEMORY_UTILIZATION nad 0,95 nenechává žádnou rezervu pro špičky KV-cache.
-
Nastavte minimum/maximum workerů a idle timeout. Minimum workerů na 0 vám dá škálování na nulu (a studené starty). Minimum workerů na 1 studené starty odstraní, ale fakturuje průběžně. Sekce o studených startech níže tenhle kompromis rozebírá.
-
Připojte síťový svazek, který jste si vybrali v sekci o vahách modelu, nebo přijměte cestu zapečení do image. Pokud tenhle krok přeskočíte, každý studený start checkpoint stáhne znovu.
-
Odešlete první požadavek. Přečtěte ID endpointu z konzole a potvrďte, že se vracejí tokeny.
curl -X POST "https://api.runpod.ai/v2/${ENDPOINT_ID}/runsync" \
-H "Authorization: Bearer ${RUNPOD_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"input": {
"messages": [{"role": "user", "content": "Explain cold starts in one sentence."}],
"max_tokens": 60
}
}'Pokud zvažujete samotný servingový engine, porovnali jsme vLLM a SGLang na throughputu a latenci.
Jak endpoint voláte ze své aplikace?
Každá platforma v užším výběru mluví API kompatibilním s OpenAI. Jeden úryvek v Pythonu funguje všude. Přechod k jinému poskytovateli je změna base_url, ne přepis. To přerámovává otázku „který poskytovatel" z rozhodnutí o vendor lock-inu na rozhodnutí o konfiguraci.
import os
from openai import OpenAI
ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]
client = OpenAI(
base_url=f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
api_key=os.environ["RUNPOD_API_KEY"],
)
response = client.chat.completions.create(
model="Qwen/Qwen3.6-27B-FP8",
messages=[{"role": "user", "content": "What is scale to zero?"}],
max_tokens=120,
)
print(response.choices[0].message.content)# Same code, different provider. One line changes.
ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]
PROVIDERS = {
"runpod": f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
"modal": "https://your-app--your-func.modal.run/v1",
"beam": "https://your-beam-endpoint/v1",
}
client = OpenAI(base_url=PROVIDERS["modal"], api_key="your-key")Když každý poskytovatel mluví dialektem OpenAI, přestává být otázka „který serverless GPU poskytovatel" architektonickým rozhodnutím a stává se jedním řádkem konfigurace.
Jakmile máte endpointů víc, naše srovnání LLM gateway pokrývá routování a failover. Pro lehčí setup přidá proxy LiteLLM retry a logování.
Jaký studený start reálně uvidíte?
U 7B modelu na serverless GPU počítejte při opravdovém studeném startu s 10 až 30 sekundami (start kontejneru plus načtení vah plus inicializace enginu), podle hlášení praktiků. Dokumentace vendorů uvádí 1 až 5 sekund jenom na start kontejneru. Rozdíl mezi těmi čísly je váš checkpoint putující po síti.
Produktová stránka RunPodu tvrdí, že studené starty FlashBoot trvají pod 200 ms (tvrzení vendora, ne měření). Praktik v r/LLMDevs hlásí: „studené starty podle mých zkušeností nejsou nic moc… řekl bych tak 10–30 s" a dodává „většina mých zkušeností se ale točí kolem difuzních modelů." Obojí platí. Měří různé věci.
Číslo studeného startu jsou tři čísla naskládaná na sebe:
-
Start kontejneru. Dokumentace Modalu: „Kontejnery startují zhruba za jednu sekundu." Cloud Run: instance s předinstalovanými ovladači „startují přibližně za 5 sekund."
-
Načtení vah. Část, kterou nikdo nereklamuje. Recenze ServerlessLLM od TU München z roku 2024 (arXiv 2411.15664) udává u LLaMA-2-70B přes 26 sekund na stažení a navíc zhruba 84 sekund na načtení na 8 GPU.
-
Inicializace enginu. Zachycení grafu a zahřátí ve vLLM. Logesh Umapathi změřil, že Qwen3.6-27B-FP8 na A100-80GB klesl ze 460 s v základu na 219 s s eager módem a na zhruba 70 s se sleep módem vLLM plus GPU snapshoty Modalu. To je 6,5násobek, publikováno 17. 5. 2026.
| Zdroj | Co se měřilo | Číslo | Datum | Typ |
|---|---|---|---|---|
| Dokumentace Modalu | Start kontejneru | ~1 s | aktuální | Dokumentace vendora |
| Dokumentace Cloud Run | Start instance (ovladače předinstalované) | ~5 s | aktuální | Dokumentace vendora |
| Umapathi | Qwen3.6-27B-FP8, A100-80GB, kompletní studený start | 460 s na 219 s na ~70 s | květen 2026 | Nezávislé měření |
| Recenze ServerlessLLM od TU München (arXiv 2411.15664) | Stažení + načtení LLaMA-2-70B, čísla citovaná, ne měřená | 26 s stažení + 84 s načtení | 2024 | Preprint arXiv (recenze) |
| Praktik z r/LLMDevs | 7B na RunPodu, celý požadavek | ~10-30 s | prosinec 2024 | Anegdota (výhrada: difuzní modely) |
Naše interpretace zveřejněných dat: čísla vendorů měří kontejner. Čísla praktiků měří celý požadavek. Mezi těmi dvěma stopkami leží 80 GB vah putujících po síti. Sloupec Typ je to podstatné.
Co s tím: sleep mód vLLM, GPU snapshoty a ladění okna pro škálování dolů. Výchozí idle doba Modalu je 60 sekund (konfigurovatelně 2 s až 20 min). Teplý worker studené starty zabije, ale fakturuje jako trvale zapnutý.
# Modal scaledown config (illustrative)
# A 60s window means you pay for 60 idle seconds per burst.
# A warm worker (min_containers=1) costs ~$2.50/hr on A100 80GB, 24/7.
@app.function(
gpu="A100",
scaledown_window=60, # seconds idle before shutdown
# min_containers=1, # uncomment to kill cold starts; costs $60/day
)Je serverless GPU levnější než GPU běžící nepřetržitě?
Serverless GPU je levnější, když vaše GPU většinu dne nečinně stojí. Při 3 000 požadavcích denně s průměrem 2 sekundy každý na A100 80GB vyjde serverless zhruba na 4,17 $/den proti 65,28 $/den za pronajatou GPU běžící 24/7. Bod zlomu je otázka pracovního cyklu, ne objemu.
Předpoklady (naše, uvedené, abyste si je mohli přepočítat): A100 80GB za 2,50 $/h na Modalu, průměrně 2 sekundy GPU času na požadavek, pronajatá GPU za 2,72 $/h na RunPodu nepřetržitě, hostované tokenové API za 0,40 $/1M tokenů (střední zveřejněná sazba) a zhruba 1 000 tokenů na požadavek.
| Požadavků/den | Serverless (odhad) | Pronajatá GPU 24/7 | Hostované tokenové API | Nejlevnější |
|---|---|---|---|---|
| 500 | 0,69 $ | 65,28 $ | 0,20 $ | Tokenové API |
| 3 000 | 4,17 $ | 65,28 $ | 1,20 $ | Tokenové API |
| 10 000 | 13,89 $ | 65,28 $ | 4,00 $ | Tokenové API |
| 50 000 | 69,44 $ | 65,28 $ | 20,00 $ | Tokenové API |
| 200 000 | 277,78 $ | 65,28 $ | 80,00 $ | Pronajatá GPU |
Bod zlomu leží kolem 47 000 požadavků denně. Pod ním vyhrává serverless. Hostované tokenové API při malém objemu s komoditním modelem poráží obě varianty. Návratnost není o tom, kolik požadavků dostanete. Je o tom, kolik hodin vaše GPU tráví tím, že nedělá nic.
Analýza BentoML ze srpna 2024 tenhle kompromis rámuje dobře, i když její cenové příklady jsou z éry GPT-3.5-turbo a dva roky staré.
Kolik stojí hostované tokenové API při vašem objemu, ukazuje naše srovnání cen LLM API. Ke snížení nákladů na požadavek na inferenční straně prompt caching typicky ušetří 30–60 % na opakovaném kontextu.
# Break-even calculator: adjust these and re-run
REQUESTS_PER_DAY = 3000
SECONDS_PER_REQUEST = 2
SERVERLESS_RATE_HR = 2.50 # Modal A100 80GB
RENTED_RATE_HR = 2.72 # RunPod A100 80GB, 24/7
serverless_daily = REQUESTS_PER_DAY * SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR
rented_daily = RENTED_RATE_HR * 24
print(f"Serverless: ${serverless_daily:.2f}/day")
print(f"Rented 24/7: ${rented_daily:.2f}/day")
print(f"Crossover: {int(RENTED_RATE_HR * 24 / (SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR))} req/day")Kdy je serverless GPU špatná volba
- Trvale vysoký provoz. Nad zhruba 47 000 požadavků denně při těchto sazbách se pracovní cyklus obrátí a pronajatá GPU je levnější na požadavek.
- Tvrdé subsekundové SLO na studené cestě. Žádný trikový snapshot neudělá první požadavek okamžitým. Držte teplý worker, nebo si krabici pronajměte.
- Modely 70B+ potřebující několik GPU. Jedna GPU na instanci na Cloud Run tuhle debatu končí.
- Přísná datová rezidence. Šest regionů L4 je na Cloud Run celý jídelní lístek.
- Ekonomika na požadavek, která prohrává s workerským slotem, za který už platíte. Pokud máte volnou kapacitu GPU, přidání inference nestojí nic navíc.
Pokud je vaše GPU vytížená šestnáct hodin denně, serverless je ta drahá varianta a každý, kdo vám tvrdí opak, prodává serverless.
Pro cestu lokálního provozu viz náš průvodce nástroji pro lokální LLM.
O autorovi
Mert Batur je spoluzakladatel Techsy.io, kde tým dodává AI agenty, automatizační systémy a hlasové/SDR pipeline pro B2B klienty. Píše o stacku nástrojů pro LLM, který tým Techsy skutečně používá v produkci. Spojte se na LinkedInu.
Často kladené otázky
Co je serverless GPU?
Platforma se serverless GPU spouští kontejner vašeho modelu na sdíleném hardwaru, mezi požadavky škáluje na nulu a fakturuje jenom aktivní výpočet. Dostanete inferenční endpoint bez správy trvalé GPU instance. Kompromisem je zpoždění studeného startu při naskočení.
Kolik stojí provoz LLM na serverless GPU?
A100 80GB běží za 2,25 $/h na Beamu, 2,50 $/h na Modalu a 2,72 $/h na RunPodu (ověřeno 30. 7. 2026). Vaše faktura závisí na pracovním cyklu: 3 000 požadavků denně po 2 s stojí na Modalu zhruba 4 $/den. Úložiště přidává 0,09 $/GiB/měsíc, přičemž 1 TiB je zdarma.
Platím za uložení vah modelu?
Ano, ale je to levné. Modal účtuje 0,09 $/GiB/měsíc a 1 TiB měsíce zdarma, takže 80GB checkpoint nestojí nic. Ceník RunPodu uvádí síťové úložiště za 0,07 $/GB/měsíc do 1 TB, tedy zhruba 5,60 $/měsíc za stejných 80 GB.
Stahuje se můj model znovu při každém požadavku?
Jenom pokud není nic v cache. Váhy na trvalém svazku nebo zapečené v image studené starty přežijí. Nasměrujte cache Hugging Face na efemérní úložiště a 130GB model se stáhne znovu při každém naskočení. To je ten selhávající scénář, kterému se vyhnout.
Jak dlouhý je studený start u 7B modelu?
Počítejte s 10–30 sekundami při opravdovém studeném startu, podle hlášení praktiků (r/LLMDevs, prosinec 2024). Kontejner startuje za 1–5 s (dokumentace Modalu a Cloud Runu). Zbytek je načítání vah a inicializace enginu. Se snapshoty a sleep módem naměřil Umapathi u 27B modelu zhruba 70 s, dolů ze 460 s.
Poběží 70B model na serverless GPU?
Většinou ne. 70B model v FP16 potřebuje zhruba 140 GB VRAM. Cloud Run povoluje jednu GPU na instanci (maximálně 96 GB). Na jednu 80GB kartu byste se vešli jen s FP8 kvantizací, nebo potřebujete více-GPU platformu. Většina serverless rozhraní končí na jedné GPU.
Je serverless GPU levnější než pronájem GPU 24/7?
Pod zhruba 47 000 požadavků denně (při 2 s/požadavek na A100 80GB) ano. Serverless fakturuje jenom aktivní sekundy; pronajatá GPU fakturuje 24 hodin bez ohledu na cokoliv. Nad tou hranicí vyhrává pronajatá GPU. Hostované tokenové API při malém objemu poráží obě. Viz tabulka návratnosti výše.
Dá se LLM nasadit na serverless GPU zdarma?
Modal dává 30 $/měsíc kreditů zdarma (Starter). Beam dává 30 $/měsíc. 300$ kredit GCP pro nové účty pokrývá využití GPU na Cloud Run. Dost na prototypování, ne na produkční provoz. Žádná platforma nenabízí trvalý free tier pro GPU inferenci.
Kteří poskytovatelé serverless GPU jsou dostupní v Evropě?
Cloud Run poskytuje GPU L4 v europe-west1 (Belgie) a europe-west4 (Nizozemsko). Modal dokumentuje výběr EU regionu (eu-west, eu-north, eu-south) za 1,5–1,75násobek základních sazeb. RunPod jmenuje evropská datová centra včetně EU-NL-1 a EU-FR-1. Region nastavte explicitně; žádný z nich nemá EU jako výchozí.
Potřebuji k nasazení LLM na serverless GPU Docker?
Ne vždycky. RunPod nabízí předpřipravené šablony workerů vLLM, které Docker obejdou. Modal builduje kontejnery z definice Python image v kódu. Pro vlastní závislosti napíšete Dockerfile. Pro standardní serving vLLM funguje předpřipravená cesta během minut.
Závěr
Pět platforem, pět fakturačních jednotek, jedna normalizovaná tabulka. Rozhodnutí je jednodušší, než jak ho stránky vendorů vykreslují:
- Vybírejte GPU podle VRAM, ne podle značky.
- Dejte váhy na svazek, ne do image, ledaže modely nikdy neměníte.
- Počítejte se studenými starty 10–30 sekund a plánujte kolem nich.
- Pod zhruba 47 000 požadavků denně vyhrává nákladově škálování na nulu.
- Servingový engine za endpointem je vyměnitelný;
base_urlje jeden řádek.
Máte volatelný endpoint. Co dál: co stojí před ním, když potřebujete routování a failover? Naše srovnání LLM gateway na to odpovídá. Nebo s námi svůj setup proberte.