Techsy
Kontakt
Začít
Zpět na blog
ai-machine-learning

Nasazení LLM na serverless GPU: 5 platforem, reálné ceny, studené starty bez příkras

Napsal Mert Batur
Aug 8, 2026
13 minut čtení
Obsah
Nasazení LLM na serverless GPU: 5 platforem, reálné ceny, studené starty bez příkras

Nasazení LLM na serverless GPU: 5 platforem, reálné ceny, studené starty bez příkras

RunPod účtuje 2,72 $/h za A100 80GB. Váš endpoint do oběda dostane dvanáct požadavků. Zbylých 23 hodin GPU nečinně stojí a celou dobu fakturuje. Nasaďte LLM na serverless GPU a platíte jenom zatímco požadavek běží. Dělá to pět platforem. Každá účtuje v jiné jednotce. Nikdo je nepřepočítává.

Nečinná GPU stojí přesně tolik co vytížená.

Hlavní body

  • Serverless GPU fakturuje jenom zatímco požadavek běží, a mezi požadavky škáluje na nulu.
  • Cloud Run dává jednu GPU na instanci; 70B modely potřebují několik GPU, takže je serverless většinou neutáhne.
  • Váhy modelu leží v image, na síťovém svazku, nebo se při každém studeném startu stahují znovu.
  • Studený start jsou tři věci: start kontejneru, načtení vah, inicializace enginu. Rychlá je jenom ta první.
  • Zhruba pod 47 000 požadavků denně vyjde škálování na nulu levněji než pronajatá GPU 24/7.

Co vlastně znamená „serverless GPU" pro LLM?

Platforma se serverless GPU spouští váš inferenční kontejner na sdíleném GPU hardwaru, nastartuje ho, když přijde požadavek, a škáluje na nulu, když provoz ustane. Platíte za sekundu (nebo za minutu či za hodinu, podle vendora) jenom zatímco kontejner žije. Žádná faktura za nečinnost. Žádná rezervovaná instance.

Fakturační jednotka se u každého vendora liší, proto další sekce všechno přepočítává na $/GPU-hodinu.

Dvě omezení lidi překvapí. Zaprvé, Google Cloud Run povoluje nanejvýš jednu GPU na instanci. Tím končí strop VRAM na jedné kartě. Zadruhé, „serverless" neznamená trvalý stav. Neexistuje žádný dlouho běžící proces, který by mezi požadavky držel vaše váhy v RAM. Když kontejner zemře, všechno v paměti zemře s ním. Právě tahle skutečnost řídí rozhodnutí o úložišti v sekci o vahách modelu níže.

Serverless neznamená bez serveru. Znamená to žádný server mezi vašimi požadavky, a přesně tam se vaše váhy modelu ztrácejí.

Kterou serverless GPU platformu vybrat? (ceny 2026, vedle sebe)

Žádnou z těchto platforem neprodáváme a z žádné nemáme affiliate příjem. Ze sedmi článků, které o tento dotaz a jeho varianty soutěží, publikovaly čtyři firmy, jež serverless GPU prodávají. Tahle tabulka ne.

Všechny sazby jsme četli z ceníků samotných vendorů 30. 7. 2026. Ceny se mění; před závazným rozhodnutím je znovu zkontrolujte.

PlatformaZveřejněná jednotka (jejich slovy)$/GPU-h (A100 80GB)$/GPU-h (H100)Kredity zdarmaVyberte ji, pokud…
Modal0,000694 $/s2,50 $3,95 $30 $/měs. (Starter)chcete fakturaci po sekundách, rychlé buildy a GPU snapshoty
RunPod2,72 $/h2,72 $4,55 $žádné zveřejněnéchcete nejširší nabídku GPU za paušální hodinové sazby
Beam0,000625 $/s2,25 $3,55 $30 $/měs.chcete nulovou fakturaci za start a načtení image
Baseten0,06667 $/min4,00 $6,50 $ano, částka nezveřejněnachcete spravovanou inferenci s fakturací aktivního výpočtu
Cloud Runpo sekundách (L4 a RTX PRO 6000 Blackwell; žádné A100/H100)nezveřejněno (žádné A100)nezveřejněno (žádné H100)300$ GCP kredituž jste na GCP a potřebujete kontrolu nad EU/US regiony

Aritmetika přepočtu, ukázaná jednou, abyste si ji mohli ověřit: Modal A100 80GB za 0,000694 $/s krát 3600 sekund se rovná 2,4984 $/h. Beam: 0,000625 krát 3600 se rovná 2,25 $/h. Baseten: 0,06667 $/min krát 60 se rovná 4,00 $/h. Ten 1,8násobný rozdíl mezi Beamem a Basetenem za totéž A100 je reálný a skrývá se přímo před očima, protože nikdo nezveřejňuje stejnou jednotku.

Tři výhrady. Ceník Beamu výslovně uvádí, že neúčtuje start serveru ani načtení obrazu kontejneru. FAQ ceníku Basetenu odpovídá na otázku „Platím na Basetenu za čas nečinnosti?" větou „Ne, za čas nečinnosti neplatíte" a dodává, že fakturovatelný čas je „doba, kdy se váš model aktivně nasazuje, škáluje nahoru či dolů nebo provádí predikce", takže měřič pokrývá víc než jen čas predikce, a právě tuhle část je třeba rozpočítávat. RunPod zveřejňuje hodinové sazby a na stránce ceníku žádné číslo studeného startu nemá.

Pokud je váš favorit Modal, napsali jsme kompletní návod pro Modal zvlášť.

Vejde se váš model vůbec? VRAM, limit jedné GPU a kvóty

Poběží 70B model na serverless GPU? Většinou ne. V FP16 potřebuje 70B zhruba 140 GB VRAM. Cloud Run končí na jedné GPU na instanci (maximálně 96 GB na RTX PRO 6000). Bez kvantizace (FP8/GGUF) nebo víце-GPU platformy ta rovnice nevychází.

GPUVRAMMin. CPU / paměťObvyklý strop modelů
L424 GB4 CPU / 16 GiB7B-13B (FP16), kvantizovaně až 30B
A100 80GB80 GBliší se podle platformy30B-70B kvantizovaně
H100 80GB80 GBliší se podle platformy30B-70B kvantizovaně
RTX PRO 6000 Blackwell96 GB20 CPU / 80 GiB70B v FP8

Výchozí kvóta Cloud Runu jsou 3 GPU L4 na region a projekt (RTX PRO 6000 se přiděluje zvlášť, jako 3 000 milliGPU), a to v šesti regionech L4: asia-southeast1, asia-south1, europe-west1, europe-west4, us-central1, us-east4. To je cloudrunovská polovina odpovědi na datovou rezidenci pro každého, kdo se ptá na serverless GPU v Evropě; Modal a RunPod dokumentují vlastní EU regiony a zbytek najdete ve FAQ.

Cloud Run návod Ismailiho Simby na dev.to (duben 2025) uvádí, že schválení žádosti o kvótu „může nějakou dobu trvat (až 5 pracovních dnů)" a že „GPU L4 dostupné na Cloud Run mají limit 16 GB RAM." S tím zpožděním počítejte.

Pro dimenzování VRAM model po modelu viz náš průvodce požadavky na VRAM.

Kde leží váhy vašeho modelu (a co to stojí)?

Vlákno na Redditu z listopadu 2024, které se při naší kontrole 30. 7. 2026 pořád drželo na 5. místě Googlu přesně pro tento dotaz, se doslova ptá:

„Nedaří se mi najít sazbu za uložení 80GB modelu… Jaká je alternativa, když nechci model stahovat při každém volání API (pod se při volání zřídí a pak zavře)? … Proč tyto platformy neuvádějí cenu za uložení modelu?"

Tři odpovědi s nízkým skóre, žádná z nich odpovědí není. Když jsme totéž hledali 30. 7. 2026, v první desítce výsledků pořád bylo to dva roky staré vlákno ptající se, kolik stojí uložení modelu. Nikdo v něm neodpověděl. Přitom obě platformy sazbu zveřejňují. Na Modalu je to 0,09 $ za GiB a měsíc, první TiB zdarma, takže onen 80GB checkpoint vyjde na 0,00 $. Na RunPodu je to 0,07 $ za GB a měsíc za síťové úložiště do 1 TB, což tentýž checkpoint staví zhruba na 5,60 $ měsíčně.

UmístěníDopad na studený startCo to stojíRebuild kvůli výměně modelu?Nejlepší pro
Zapečené v image kontejneruNejrychlejší startNafouknutí image (27B FP8 = desítky GB)Ano, kompletní rebuildEndpointy s jedním modelem
Trvalý síťový svazekRychlé (cache na hostiteli)Modal 0,09 $/GiB/měs., 1 TiB zdarma; RunPod 0,07 $/GB/měs. do 1 TBNe, stačí vyměnit cestuVíce modelů nebo časté výměny
Stažení z Hugging Face při startuNejpomalejší: 26 s+ za 130 GB při 5 GB/sZdarma (bandwidth HF)NeJen prototypování

Třetí řádek je ten selhávající scénář. Recenze ServerlessLLM od TU München z roku 2024 (arXiv 2411.15664) uvádí, že LLaMA-2-70B (130 GB) potřebuje přes 26 sekund na stažení při 5 GB/s a navíc zhruba 84 sekund na načtení na 8 GPU, proti zhruba 100 ms generování tokenu. Ta čísla jsou v recenzi citovaná, ne měřená.

Ceník RunPodu má sekci Storage: disk kontejneru 0,10 $/GB/měs., disk svazku 0,10 $/GB/měs. za běhu a 0,20 $/GB/měs. v nečinnosti, síťové úložiště 0,07 $/GB/měs. do 1 TB a 0,05 $/GB/měs. nad tím, vysokorychlostní síťové úložiště 0,14 $/GB/měs. To číslo existuje. Jenom nesedí vedle serverless sazeb za GPU, které čtenář porovnává ve chvíli, kdy ho otázka napadne, ani v konfiguračním flow endpointu. Problém dohledatelnosti, ne tajnůstkářství, a dost na to, aby otázka zůstala naživu i po dvou letech.

bash
# Point the Hugging Face cache at a mounted network volume
# so weights persist across cold starts (RunPod / Modal pattern)
export HF_HOME=/workspace/hf-cache
export TRANSFORMERS_CACHE=/workspace/hf-cache
export HF_HUB_ENABLE_HF_TRANSFER=1
dockerfile
# Alternative: bake weights into the image at build time
FROM vllm/vllm-openai:latest
COPY ./model-weights /models/qwen3-27b-fp8
ENV MODEL_NAME=/models/qwen3-27b-fp8
# Downside: 30+ GB image, full rebuild to change models

Pokud jste model ještě nevybrali, náš přehled open-weights modelů pro 2026 dimenzuje každou variantu pro nasazení.

Nasazení: vLLM na RunPod Serverless, od začátku do konce

Šest kroků od nuly k volatelnému endpointu. Každý si ověřte podle postupu RunPodu pro vLLM (aktualizováno 22. 6. 2026), který žádné ceny nezveřejňuje.

  1. Vyberte model. Zvolte open-weights model dimenzovaný na vaši GPU (viz tabulka VRAM výše). Pokud je na Hugging Face řízený přístupem, vygenerujte si nejdřív přístupový token.

  2. Vytvořte serverless endpoint. V konzoli RunPodu vyberte Serverless, zvolte šablonu workeru vLLM a vyberte tier GPU.

  3. Nastavte proměnné prostředí, na kterých záleží.

env
MODEL_NAME=Qwen/Qwen3.6-27B-FP8
MAX_MODEL_LEN=32768
GPU_MEMORY_UTILIZATION=0.90
DTYPE=auto

Špatný MODEL_NAME znamená 404 při startu. MAX_MODEL_LEN nastavený příliš vysoko na vaši VRAM znamená OOM ještě před prvním tokenem. GPU_MEMORY_UTILIZATION nad 0,95 nenechává žádnou rezervu pro špičky KV-cache.

  1. Nastavte minimum/maximum workerů a idle timeout. Minimum workerů na 0 vám dá škálování na nulu (a studené starty). Minimum workerů na 1 studené starty odstraní, ale fakturuje průběžně. Sekce o studených startech níže tenhle kompromis rozebírá.

  2. Připojte síťový svazek, který jste si vybrali v sekci o vahách modelu, nebo přijměte cestu zapečení do image. Pokud tenhle krok přeskočíte, každý studený start checkpoint stáhne znovu.

  3. Odešlete první požadavek. Přečtěte ID endpointu z konzole a potvrďte, že se vracejí tokeny.

bash
curl -X POST "https://api.runpod.ai/v2/${ENDPOINT_ID}/runsync" \
  -H "Authorization: Bearer ${RUNPOD_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "input": {
      "messages": [{"role": "user", "content": "Explain cold starts in one sentence."}],
      "max_tokens": 60
    }
  }'

Pokud zvažujete samotný servingový engine, porovnali jsme vLLM a SGLang na throughputu a latenci.

Jak endpoint voláte ze své aplikace?

Každá platforma v užším výběru mluví API kompatibilním s OpenAI. Jeden úryvek v Pythonu funguje všude. Přechod k jinému poskytovateli je změna base_url, ne přepis. To přerámovává otázku „který poskytovatel" z rozhodnutí o vendor lock-inu na rozhodnutí o konfiguraci.

python
import os

from openai import OpenAI

ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]

client = OpenAI(
    base_url=f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
    api_key=os.environ["RUNPOD_API_KEY"],
)

response = client.chat.completions.create(
    model="Qwen/Qwen3.6-27B-FP8",
    messages=[{"role": "user", "content": "What is scale to zero?"}],
    max_tokens=120,
)
print(response.choices[0].message.content)
python
# Same code, different provider. One line changes.
ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]

PROVIDERS = {
    "runpod": f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
    "modal": "https://your-app--your-func.modal.run/v1",
    "beam": "https://your-beam-endpoint/v1",
}

client = OpenAI(base_url=PROVIDERS["modal"], api_key="your-key")

Když každý poskytovatel mluví dialektem OpenAI, přestává být otázka „který serverless GPU poskytovatel" architektonickým rozhodnutím a stává se jedním řádkem konfigurace.

Jakmile máte endpointů víc, naše srovnání LLM gateway pokrývá routování a failover. Pro lehčí setup přidá proxy LiteLLM retry a logování.

Jaký studený start reálně uvidíte?

U 7B modelu na serverless GPU počítejte při opravdovém studeném startu s 10 až 30 sekundami (start kontejneru plus načtení vah plus inicializace enginu), podle hlášení praktiků. Dokumentace vendorů uvádí 1 až 5 sekund jenom na start kontejneru. Rozdíl mezi těmi čísly je váš checkpoint putující po síti.

Produktová stránka RunPodu tvrdí, že studené starty FlashBoot trvají pod 200 ms (tvrzení vendora, ne měření). Praktik v r/LLMDevs hlásí: „studené starty podle mých zkušeností nejsou nic moc… řekl bych tak 10–30 s" a dodává „většina mých zkušeností se ale točí kolem difuzních modelů." Obojí platí. Měří různé věci.

Číslo studeného startu jsou tři čísla naskládaná na sebe:

  1. Start kontejneru. Dokumentace Modalu: „Kontejnery startují zhruba za jednu sekundu." Cloud Run: instance s předinstalovanými ovladači „startují přibližně za 5 sekund."

  2. Načtení vah. Část, kterou nikdo nereklamuje. Recenze ServerlessLLM od TU München z roku 2024 (arXiv 2411.15664) udává u LLaMA-2-70B přes 26 sekund na stažení a navíc zhruba 84 sekund na načtení na 8 GPU.

  3. Inicializace enginu. Zachycení grafu a zahřátí ve vLLM. Logesh Umapathi změřil, že Qwen3.6-27B-FP8 na A100-80GB klesl ze 460 s v základu na 219 s s eager módem a na zhruba 70 s se sleep módem vLLM plus GPU snapshoty Modalu. To je 6,5násobek, publikováno 17. 5. 2026.

ZdrojCo se měřiloČísloDatumTyp
Dokumentace ModaluStart kontejneru~1 saktuálníDokumentace vendora
Dokumentace Cloud RunStart instance (ovladače předinstalované)~5 saktuálníDokumentace vendora
UmapathiQwen3.6-27B-FP8, A100-80GB, kompletní studený start460 s na 219 s na ~70 skvěten 2026Nezávislé měření
Recenze ServerlessLLM od TU München (arXiv 2411.15664)Stažení + načtení LLaMA-2-70B, čísla citovaná, ne měřená26 s stažení + 84 s načtení2024Preprint arXiv (recenze)
Praktik z r/LLMDevs7B na RunPodu, celý požadavek~10-30 sprosinec 2024Anegdota (výhrada: difuzní modely)

Naše interpretace zveřejněných dat: čísla vendorů měří kontejner. Čísla praktiků měří celý požadavek. Mezi těmi dvěma stopkami leží 80 GB vah putujících po síti. Sloupec Typ je to podstatné.

Co s tím: sleep mód vLLM, GPU snapshoty a ladění okna pro škálování dolů. Výchozí idle doba Modalu je 60 sekund (konfigurovatelně 2 s až 20 min). Teplý worker studené starty zabije, ale fakturuje jako trvale zapnutý.

python
# Modal scaledown config (illustrative)
# A 60s window means you pay for 60 idle seconds per burst.
# A warm worker (min_containers=1) costs ~$2.50/hr on A100 80GB, 24/7.
@app.function(
    gpu="A100",
    scaledown_window=60,  # seconds idle before shutdown
    # min_containers=1,   # uncomment to kill cold starts; costs $60/day
)

Je serverless GPU levnější než GPU běžící nepřetržitě?

Serverless GPU je levnější, když vaše GPU většinu dne nečinně stojí. Při 3 000 požadavcích denně s průměrem 2 sekundy každý na A100 80GB vyjde serverless zhruba na 4,17 $/den proti 65,28 $/den za pronajatou GPU běžící 24/7. Bod zlomu je otázka pracovního cyklu, ne objemu.

Předpoklady (naše, uvedené, abyste si je mohli přepočítat): A100 80GB za 2,50 $/h na Modalu, průměrně 2 sekundy GPU času na požadavek, pronajatá GPU za 2,72 $/h na RunPodu nepřetržitě, hostované tokenové API za 0,40 $/1M tokenů (střední zveřejněná sazba) a zhruba 1 000 tokenů na požadavek.

Požadavků/denServerless (odhad)Pronajatá GPU 24/7Hostované tokenové APINejlevnější
5000,69 $65,28 $0,20 $Tokenové API
3 0004,17 $65,28 $1,20 $Tokenové API
10 00013,89 $65,28 $4,00 $Tokenové API
50 00069,44 $65,28 $20,00 $Tokenové API
200 000277,78 $65,28 $80,00 $Pronajatá GPU

Bod zlomu leží kolem 47 000 požadavků denně. Pod ním vyhrává serverless. Hostované tokenové API při malém objemu s komoditním modelem poráží obě varianty. Návratnost není o tom, kolik požadavků dostanete. Je o tom, kolik hodin vaše GPU tráví tím, že nedělá nic.

Analýza BentoML ze srpna 2024 tenhle kompromis rámuje dobře, i když její cenové příklady jsou z éry GPT-3.5-turbo a dva roky staré.

Kolik stojí hostované tokenové API při vašem objemu, ukazuje naše srovnání cen LLM API. Ke snížení nákladů na požadavek na inferenční straně prompt caching typicky ušetří 30–60 % na opakovaném kontextu.

python
# Break-even calculator: adjust these and re-run
REQUESTS_PER_DAY = 3000
SECONDS_PER_REQUEST = 2
SERVERLESS_RATE_HR = 2.50   # Modal A100 80GB
RENTED_RATE_HR = 2.72       # RunPod A100 80GB, 24/7

serverless_daily = REQUESTS_PER_DAY * SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR
rented_daily = RENTED_RATE_HR * 24

print(f"Serverless: ${serverless_daily:.2f}/day")
print(f"Rented 24/7: ${rented_daily:.2f}/day")
print(f"Crossover: {int(RENTED_RATE_HR * 24 / (SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR))} req/day")

Kdy je serverless GPU špatná volba

  • Trvale vysoký provoz. Nad zhruba 47 000 požadavků denně při těchto sazbách se pracovní cyklus obrátí a pronajatá GPU je levnější na požadavek.
  • Tvrdé subsekundové SLO na studené cestě. Žádný trikový snapshot neudělá první požadavek okamžitým. Držte teplý worker, nebo si krabici pronajměte.
  • Modely 70B+ potřebující několik GPU. Jedna GPU na instanci na Cloud Run tuhle debatu končí.
  • Přísná datová rezidence. Šest regionů L4 je na Cloud Run celý jídelní lístek.
  • Ekonomika na požadavek, která prohrává s workerským slotem, za který už platíte. Pokud máte volnou kapacitu GPU, přidání inference nestojí nic navíc.

Pokud je vaše GPU vytížená šestnáct hodin denně, serverless je ta drahá varianta a každý, kdo vám tvrdí opak, prodává serverless.

Pro cestu lokálního provozu viz náš průvodce nástroji pro lokální LLM.

O autorovi

Mert Batur je spoluzakladatel Techsy.io, kde tým dodává AI agenty, automatizační systémy a hlasové/SDR pipeline pro B2B klienty. Píše o stacku nástrojů pro LLM, který tým Techsy skutečně používá v produkci. Spojte se na LinkedInu.

Často kladené otázky

Co je serverless GPU?

Platforma se serverless GPU spouští kontejner vašeho modelu na sdíleném hardwaru, mezi požadavky škáluje na nulu a fakturuje jenom aktivní výpočet. Dostanete inferenční endpoint bez správy trvalé GPU instance. Kompromisem je zpoždění studeného startu při naskočení.

Kolik stojí provoz LLM na serverless GPU?

A100 80GB běží za 2,25 $/h na Beamu, 2,50 $/h na Modalu a 2,72 $/h na RunPodu (ověřeno 30. 7. 2026). Vaše faktura závisí na pracovním cyklu: 3 000 požadavků denně po 2 s stojí na Modalu zhruba 4 $/den. Úložiště přidává 0,09 $/GiB/měsíc, přičemž 1 TiB je zdarma.

Platím za uložení vah modelu?

Ano, ale je to levné. Modal účtuje 0,09 $/GiB/měsíc a 1 TiB měsíce zdarma, takže 80GB checkpoint nestojí nic. Ceník RunPodu uvádí síťové úložiště za 0,07 $/GB/měsíc do 1 TB, tedy zhruba 5,60 $/měsíc za stejných 80 GB.

Stahuje se můj model znovu při každém požadavku?

Jenom pokud není nic v cache. Váhy na trvalém svazku nebo zapečené v image studené starty přežijí. Nasměrujte cache Hugging Face na efemérní úložiště a 130GB model se stáhne znovu při každém naskočení. To je ten selhávající scénář, kterému se vyhnout.

Jak dlouhý je studený start u 7B modelu?

Počítejte s 10–30 sekundami při opravdovém studeném startu, podle hlášení praktiků (r/LLMDevs, prosinec 2024). Kontejner startuje za 1–5 s (dokumentace Modalu a Cloud Runu). Zbytek je načítání vah a inicializace enginu. Se snapshoty a sleep módem naměřil Umapathi u 27B modelu zhruba 70 s, dolů ze 460 s.

Poběží 70B model na serverless GPU?

Většinou ne. 70B model v FP16 potřebuje zhruba 140 GB VRAM. Cloud Run povoluje jednu GPU na instanci (maximálně 96 GB). Na jednu 80GB kartu byste se vešli jen s FP8 kvantizací, nebo potřebujete více-GPU platformu. Většina serverless rozhraní končí na jedné GPU.

Je serverless GPU levnější než pronájem GPU 24/7?

Pod zhruba 47 000 požadavků denně (při 2 s/požadavek na A100 80GB) ano. Serverless fakturuje jenom aktivní sekundy; pronajatá GPU fakturuje 24 hodin bez ohledu na cokoliv. Nad tou hranicí vyhrává pronajatá GPU. Hostované tokenové API při malém objemu poráží obě. Viz tabulka návratnosti výše.

Dá se LLM nasadit na serverless GPU zdarma?

Modal dává 30 $/měsíc kreditů zdarma (Starter). Beam dává 30 $/měsíc. 300$ kredit GCP pro nové účty pokrývá využití GPU na Cloud Run. Dost na prototypování, ne na produkční provoz. Žádná platforma nenabízí trvalý free tier pro GPU inferenci.

Kteří poskytovatelé serverless GPU jsou dostupní v Evropě?

Cloud Run poskytuje GPU L4 v europe-west1 (Belgie) a europe-west4 (Nizozemsko). Modal dokumentuje výběr EU regionu (eu-west, eu-north, eu-south) za 1,5–1,75násobek základních sazeb. RunPod jmenuje evropská datová centra včetně EU-NL-1 a EU-FR-1. Region nastavte explicitně; žádný z nich nemá EU jako výchozí.

Potřebuji k nasazení LLM na serverless GPU Docker?

Ne vždycky. RunPod nabízí předpřipravené šablony workerů vLLM, které Docker obejdou. Modal builduje kontejnery z definice Python image v kódu. Pro vlastní závislosti napíšete Dockerfile. Pro standardní serving vLLM funguje předpřipravená cesta během minut.

Závěr

Pět platforem, pět fakturačních jednotek, jedna normalizovaná tabulka. Rozhodnutí je jednodušší, než jak ho stránky vendorů vykreslují:

  • Vybírejte GPU podle VRAM, ne podle značky.
  • Dejte váhy na svazek, ne do image, ledaže modely nikdy neměníte.
  • Počítejte se studenými starty 10–30 sekund a plánujte kolem nich.
  • Pod zhruba 47 000 požadavků denně vyhrává nákladově škálování na nulu.
  • Servingový engine za endpointem je vyměnitelný; base_url je jeden řádek.

Máte volatelný endpoint. Co dál: co stojí před ním, když potřebujete routování a failover? Naše srovnání LLM gateway na to odpovídá. Nebo s námi svůj setup proberte.

Štítky

nasazeni-llm-serverless-gpuserverless-gpuvllmllm-inferencestudeny-start

Sdílet článek

Související články

Více z kategorie ai-machine-learning

ai-machine-learning
Aug 7, 2026

Vzorce workflow AI agentů: 7 vzorců a kdy každý skutečně vyhrává (2026)

Sedm vzorců workflow AI agentů se vrací v taxonomii každého prodejce, ale žádný z nich nevyhrává všude. Tento článek je řadí podle publikovaných benchmarkových dat Google Research a Anthropicu z roku 2026, ukazuje aritmetiku, spustitelný Python pro každý tvar a rozhodovací žebříček pro výběr.

13 min čtení minut čtení
Číst
ai-machine-learning
Aug 7, 2026

Strategie chunkování RAG: 7 metod hodnocených podle dat o vyhledávání (2026)

Chunkování dělí dokumenty před embeddingem a body dělení určují, co váš retriever najde a co ne. Seřadili jsme 7 strategií chunkování RAG podle veřejného benchmarku Chroma se 472 dotazy a každou namapovali na embeddingový model, který už provozujete.

15 min čtení minut čtení
Číst
ai-machine-learning
Aug 6, 2026

Nejlepší RAG framework 2026: LangChain vs LlamaIndex vs Haystack (a kdy žádný nepotřebujete)

LangChain 1.0 je výchozí volbou pro většinu týmů, ale upřímná odpověď pro Q&A aplikaci nad jedním korpusem zní: možná žádný framework nepotřebujete. Porovnali jsme 8 orchestračních vrstev vedle sebe, s kódem, daty z repozitářů a rozpočtem latence.

14 min čtení minut čtení
Číst
Zobrazit všechny články
Začněte svůj projekt

Pojďme něco postavit nevšedního?

Proměňme vaši vizi ve skutečnost. Náš tým je připraven vám pomoct vytvořit software, který dělá rozdíl.

Rezervovat 30minutový úvodní hovorNaše projekty

Než z knihovny

Claude dovednosti

Zobrazit vše
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI automatizace

Zobrazit vše
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Než z knihovny

Claude dovednosti

Zobrazit vše
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI automatizace

Zobrazit vše
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Služby

  • Podniková řešení
  • Mobilní aplikace
  • Webové aplikace

Řešení

  • CRM systémy
  • Integrace AI
  • ERP systémy
  • Hlasoví agenti
  • Automatizace procesů
  • Kybernetická bezpečnost

Knihovna

  • Blog
  • Reference

Komunita

  • AI automatizace
  • Claude dovednosti

Nástroje

  • Kalkulátor ceny mobilní aplikace
  • Kalkulátor ceny OpenAI / LLM API
  • Kalkulátor ceny MVP
  • Kalkulátor ceny hlasového AI agenta

Společnost

  • O projektu
  • Partneři
  • Kontakt

Právní informace

  • Zásady ochrany osobních údajů
  • Podmínky poskytování služeb
  • Zásady používání cookies

Služby

  • Podniková řešení
  • Mobilní aplikace
  • Webové aplikace

Řešení

  • CRM systémy
  • Integrace AI
  • ERP systémy
  • Hlasoví agenti
  • Automatizace procesů
  • Kybernetická bezpečnost

Knihovna

  • Blog
  • Reference

Komunita

  • AI automatizace
  • Claude dovednosti

Nástroje

  • Kalkulátor ceny mobilní aplikace
  • Kalkulátor ceny OpenAI / LLM API
  • Kalkulátor ceny MVP
  • Kalkulátor ceny hlasového AI agenta

Společnost

  • O projektu
  • Partneři
  • Kontakt
Právní informaceZásady ochrany osobních údajůPodmínky poskytování služebZásady používání cookies
TECHSY
© 2026 Techsy. Všechna práva vyhrazena.