Techsy
Otetttaa yhteyte
Aloita
Takaisin blogiin
ai-machine-learning

Deployaa LLM serverless GPU:lle: 5 alustaa, oikeat hinnat, rehelliset cold start -luvut

Kirjoittanut Mert Batur
Aug 8, 2026
11 lukuaika
Sisällys
Deployaa LLM serverless GPU:lle: 5 alustaa, oikeat hinnat, rehelliset cold start -luvut

Deployaa LLM serverless GPU:lle: 5 alustaa, oikeat hinnat, rehelliset cold start -luvut

RunPod veloittaa $2,72/tunti A100 80GB:stä. Endpointisi saa tusinan pyyntöjä ennen lounasta. GPU seisoo tyhjäkäynnillä loput 23 tuntia ja laskuttaa koko ajan. Kun deployaat LLM:n serverless GPU:lle, maksat vain silloin kun pyyntö ajaa. Viisi alustaa tekee näin. Ne laskuttavat viidessä eri yksikössä. Kukaan ei normalisoi niitä.

Tyhjäkäynnillä oleva GPU maksaa täsmälleen yhtä paljon kuin varattu.

Keskeiset opit

  • Serverless GPU laskuttaa vain pyynnön ajon ajalta ja skaalautuu nollaan pyyntöjen välissä.
  • Cloud Runissa yksi GPU per instanssi; 70B-mallit tarvitsevat useita GPU:ta, joten serverless ei yleensä pysty hostaamaan niitä.
  • Mallin painot ovat joko imagessa, verkkovolyymillä tai latautuvat uudelleen jokaisessa cold startissa.
  • Cold start koostuu kolmesta vaiheesta: kontin käynnistys, painojen lataus ja moottorin alustus. Vain ensimmäinen on nopea.
  • Alle noin 47 000 pyyntöä vuorokaudessa: nollaan skaalaus voittaa vuokratun 24/7-GPU:n.

Mitä 'serverless GPU' oikeastaan tarkoittaa LLM:lle?

Serverless GPU -alusta ajaa päättelykonttiasi jaetulla GPU-laitteistolla, käynnistää sen pyynnön saapuessa ja skaalautuu nollaan, kun liikenne loppuu. Maksat sekunnilta (tai minuutilta tai tunnilta, toimittajasta riippuen) vain silloin kun kontti on käynnissä. Ei tyhjäkäyntilaskua. Ei varattua instanssia.

Laskutusyksikkö vaihtelee toimittajittain, minkä vuoksi seuraava osio normalisoi kaiken muotoon $/GPU-tunti.

Kaksi rajoitusta yllättävät useimmat. Ensinnäkin Google Cloud Run sallii enintään yhden GPU:n per instanssi. Se asettaa VRAM-katoksi yhden kortin. Toiseksi "serverless" ei tarkoita pysyvää tilaa. Mikään pitkäikäinen prosessi ei pidä painojasi RAM-muistissa pyyntöjen välissä. Kun kontti sammuu, kaikki muistissa oleva sammuu sen mukana. Tämä yksi tosiasia ratkaisee tallennusratkaisun alla olevassa mallipainojen osiossa.

Serverless ei tarkoita, ettei palvelinta ole. Se tarkoittaa, ettei palvelinta ole pyyntöjesi välissä, ja juuri sinne mallipainosi katoavat.

Minkä serverless GPU -alustan valitset? (2026 hinnat rinnakkain)

Emme myy mitään näistä alustoista emmekä saa affiliate-tuloja yhdestäkään. Seitsemästä artikkelista, jotka kilpailevat tästä hakusanasta ja sen muunnelmista, neljä on serverless GPU:ta myyvän yrityksen julkaisemia. Tämä taulukko ei ole.

Kaikki hinnat luettu toimittajien omilta hinnoittelusivuilta 30.7.2026. Hinnat muuttuvat; tarkista ennen sitoutumista.

AlustaJulkaistu yksikkö (heidän sanoin)$/GPU-h (A100 80GB)$/GPU-h (H100)IlmaisrahatValitse tämä, jos...
Modal$0,000694/s$2,50$3,95$30/kk Starterhaluat sekuntilaskutuksen, nopeat buildit ja GPU-snapshotit
RunPod$2,72/h$2,72$4,55ei julkaistuhaluat laajimman GPU-valikoiman kiinteillä tuntihinnoilla
Beam$0,000625/s$2,25$3,55$30/kkhaluat nollalaskutuksen käynnistykselle ja imagen lataukselle
Baseten$0,06667/min$4,00$6,50kyllä, summaa ei julkaistuhaluat hallitun päättelyn aktiivisen laskennan laskutuksella
Cloud Runsekuntilaskutus (L4 ja RTX PRO 6000 Blackwell; ei A100/H100)ei julkaistu (ei A100)ei julkaistu (ei H100)$300 GCP-krediittiolet jo GCP:ssä ja tarvitset EU/US-aluevalintaa

Normalisointilasku kerran näytettynä, jotta voit tarkistaa sen: Modal A100 80GB, $0,000694/s kerrottuna 3600 sekunnilla on $2,4984/h. Beam: $0,000625 kertaa 3600 on $2,25/h. Baseten: $0,06667/min kertaa 60 on $4,00/h. Tuo 1,8-kertainen ero Beamin ja Basetenin välillä samalla A100:lla on todellinen, ja se piiloutuu näkyville, koska kukaan ei julkaise samaa yksikköä.

Kolme varausta. Beamin hinnoittelusivu kertoo suoraan, ettei se laskuta palvelimen käynnistyksestä eikä kontti-imagen latauksesta. Basetenin hinnoittelu-FAQ vastaa kysymykseen "Maksanko Basetenilla tyhjäkäynnistä?" vastauksella "Et, et maksa tyhjäkäynnistä" ja lisää sitten, että laskutettava aika on "aika, jolloin mallisi on aktiivisesti deployautumassa, skaalautumassa ylös tai alas tai tuottamassa ennusteita", joten mittari kattaa muutakin kuin ennustusaika, ja juuri se osa kannattaa budjetoida. RunPod julkaisee tuntihinnat eikä lainkaan cold start -lukua hinnoittelusivullaan.

Jos Modal on valintasi, kirjoitimme täyden Modal-läpikäynnin erikseen.

Mahtuuko mallisi edes? VRAM, yhden GPU:n rajat ja kiintiöt

Voitko ajaa 70B-mallia serverless GPU:lla? Yleensä et. FP16:lla 70B tarvitsee ~140 Gt VRAM:ia. Cloud Run rajoittaa yhteen GPU:hun per instanssi (enintään 96 Gt RTX PRO 6000:lla). Laskelma ei täsmää ilman kvantisointia (FP8/GGUF) tai usean GPU:n alustaa.

GPUVRAMMin CPU / muistiTyypillinen mallikatto
L424 Gt4 CPU / 16 GiB7B–13B (FP16), kvantisoituna jopa 30B
A100 80GB80 Gtvaihtelee alustan mukaan30B–70B kvantisoituna
H100 80GB80 Gtvaihtelee alustan mukaan30B–70B kvantisoituna
RTX PRO 6000 Blackwell96 Gt20 CPU / 80 GiB70B FP8:lla

Cloud Runin oletuskiintiö on 3 L4-GPU:ta aluetta ja projektia kohden (RTX PRO 6000 myönnetään erikseen, 3 000 milliGPU:na), kuudella L4-alueella: asia-southeast1, asia-south1, europe-west1, europe-west4, us-central1, us-east4. Se on Cloud Runin puolisko vastauksesta datan sijaintia koskevaan kysymykseen kaikille, jotka kysyvät serverless GPU:sta Euroopassa; Modal ja RunPod dokumentoivat omat EU-alueensa, ja FAQ:ssä on loput.

Ismaili Simban Cloud Run -läpikäynti dev.to:ssa (huhtikuu 2025) raportoi, että kiintiöpyynnön hyväksyminen "voi kestää jonkin aikaa (jopa 5 työpäivää)" ja että "Cloud Runin L4-GPU:illa on 16 Gt RAM-raja." Varaudu tuohon viiveeseen.

Mallikohtaiseen VRAM-mitoitukseen: VRAM-vaatimusoppaamme.

Missä mallipainosi ovat (ja mitä se maksaa)?

Reddit-ketju marraskuulta 2024, joka oli tarkistushetkellämme 30.7.2026 yhä sijalla 5 Googlessa tällä samalla haulla, kysyy sanatarkasti:

"En ole löytänyt hintaa 80 Gt:n mallin tallennukselle… Mikä on vaihtoehto, jos en halua ladata mallia jokaisella API-kutsulla (pod varataan kutsulla ja suljetaan sitten)? … Mikseivät nämä alustat listaa mallitallennuksen hintaa?"

Kolme vähäistä vastausta, ei yhtään oikeaa vastausta. Kun ajoimme tämän haun 30.7.2026, kymmenen kärjessä oli yhä tuo kaksivuotias ketju kysymässä mallitallennuksen hintaa. Kukaan ketjussa ei vastannut siihen. Molemmat alustat julkaisevat hinnan. Modalilla se on $0,09 per GiB kuukaudessa, ensimmäinen TiB ilmainen, joten tuo 80 Gt:n checkpoint laskuttuu $0,00. RunPodilla verkkotallennus alle 1 TB on $0,07 per Gt kuukaudessa, mikä asettaa saman checkpointin noin $5,60:een kuukaudessa.

SijoitusVaikutus cold startiinHintaRebuild mallin vaihtoon?Paras kohteelle
Leivottu kontti-imageenNopein käynnistysImagen koko kasvaa (27B FP8 = kymmeniä Gt)Kyllä, täysi rebuildYhden mallin endpointit
Pysyvä verkkovolyymiNopea (välimuistissa hostilla)Modal $0,09/GiB/kk, 1 TiB ilmainen; RunPod $0,07/Gt/kk alle 1 TBEi, vaihda polkuUseat mallit tai tiheät vaihdot
Hugging Facesta ladattuna käynnistyksessäHitain: yli 26 s 130 Gt:lle 5 Gt/s nopeudellaIlmainen (HF-kaista)EiVain prototyyppiin

Kolmas rivi on vikamoodi. TU Münchenin 2024 ServerlessLLM-katsaus (arXiv 2411.15664) raportoi, että LLaMA-2-70B (130 Gt) tarvitsee yli 26 sekuntia lataukseen 5 Gt/s nopeudella, plus ~84 sekuntia lataamiseen 8 GPU:lle, verrattuna ~100 ms tokenin generointiin. Nuo luvut on siteerattu katsauksessa, ei mitattu siinä.

RunPodin hinnoittelusivulla on Storage-osio: konttilevy $0,10/Gt/kk, volyymilevy $0,10/Gt/kk käynnissä ja $0,20/Gt/kk tyhjäkäynnillä, verkkotallennus $0,07/Gt/kk alle 1 TB ja $0,05/Gt/kk sen yli, korkean suorituskyvyn verkkotallennus $0,14/Gt/kk. Luku on olemassa. Se ei vain ole niiden GPU-kohtaisten serverless-hintojen vieressä, joita lukija vertailee kysymyksen juolahtaessa mieleen, eikä endpointin asetusten säätövaiheessa. Löydettävyysongelma, ei salailua, ja riittää pitämään kysymyksen elossa kaksi vuotta myöhemmin.

bash
# Point the Hugging Face cache at a mounted network volume
# so weights persist across cold starts (RunPod / Modal pattern)
export HF_HOME=/workspace/hf-cache
export TRANSFORMERS_CACHE=/workspace/hf-cache
export HF_HUB_ENABLE_HF_TRANSFER=1
dockerfile
# Alternative: bake weights into the image at build time
FROM vllm/vllm-openai:latest
COPY ./model-weights /models/qwen3-27b-fp8
ENV MODEL_NAME=/models/qwen3-27b-fp8
# Downside: 30+ GB image, full rebuild to change models

Jos et ole vielä valinnut mallia, avoimien painojen 2026-katsauksemme mitoittaa jokaisen vaihtoehdon deployausta varten.

Deploy: vLLM RunPod Serverlessillä alusta loppuun

Kuusi vaihetta nollasta kutsuttavaan endpointtiin. Varmista jokainen RunPodin vLLM-ohjeesta (päivitetty 22.6.2026), joka ei julkaise hintoja.

  1. Valitse mallisi. Valitse avoimien painojen malli, joka on mitoitettu GPU:llesi (katso VRAM-taulukko yllä). Jos se on rajattu Hugging Facessa, generoi access token ensin.

  2. Luo serverless-endpoint. Valitse RunPodin konsolissa Serverless, valitse vLLM-worker-template ja valitse GPU-tasosi.

  3. Aseta ympäristömuuttujat, joilla on väliä.

env
MODEL_NAME=Qwen/Qwen3.6-27B-FP8
MAX_MODEL_LEN=32768
GPU_MEMORY_UTILIZATION=0.90
DTYPE=auto

Väärä MODEL_NAME tarkoittaa 404:ää käynnistyksessä. Liian korkea MAX_MODEL_LEN VRAM:iisi nähden tarkoittaa OOM:ia ennen ensimmäistä tokenia. GPU_MEMORY_UTILIZATION yli 0,95 ei jätä liikkumavaraa KV-cache-piikeille.

  1. Aseta min/max-workerit ja tyhjäkäynnin aikakatkaisu. Min-workerit nollassa antaa nollaan skaalautumisen (ja cold startit). Min-workerit yhdessä tappaa cold startit mutta laskuttaa tauotta. Alla oleva cold start -osio käy tuon kompromissin läpi.

  2. Liitä verkkovolyymi, jonka päätit mallipainojen osiossa, tai hyväksy image-leivontapolku. Jos ohitat tämän, jokainen cold start lataa checkpointin uudelleen.

  3. Ammu ensimmäinen pyyntö. Lue endpoint-ID konsolista ja varmista, että tokeneita palautuu.

bash
curl -X POST "https://api.runpod.ai/v2/${ENDPOINT_ID}/runsync" \
  -H "Authorization: Bearer ${RUNPOD_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "input": {
      "messages": [{"role": "user", "content": "Explain cold starts in one sentence."}],
      "max_tokens": 60
    }
  }'

Jos punnitset itse päättelymoottoria, vertailimme vLLM:ää ja SGLangia läpimenon ja latenssin osalta.

Miten kutsut endpointia sovelluksestasi?

Jokainen listan alusta puhuu OpenAI-yhteensopivaa API:a. Yksi Python-pätkä toimii kaikkialla. Toimittajan vaihto on base_url-muutos, ei uudelleenkirjoitus. Se muuttaa "minkä toimittajan" kysymyksen lukkiutumispäätöksestä asetuspäätökseksi.

python
import os

from openai import OpenAI

ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]

client = OpenAI(
    base_url=f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
    api_key=os.environ["RUNPOD_API_KEY"],
)

response = client.chat.completions.create(
    model="Qwen/Qwen3.6-27B-FP8",
    messages=[{"role": "user", "content": "What is scale to zero?"}],
    max_tokens=120,
)
print(response.choices[0].message.content)
python
# Same code, different provider. One line changes.
ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]

PROVIDERS = {
    "runpod": f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
    "modal": "https://your-app--your-func.modal.run/v1",
    "beam": "https://your-beam-endpoint/v1",
}

client = OpenAI(base_url=PROVIDERS["modal"], api_key="your-key")

Jos jokainen toimittaja puhuu OpenAI:n murretta, "mikä serverless GPU -toimittaja" lakkaa olemasta arkkitehtuuripäätös ja muuttuu yhdeksi konfiguraatioriviksi.

Kun sinulla on useita endpointteja, LLM-gateway-vertailumme kattaa reitityksen ja failoverin. Kevyempään setupiin LiteLLM-proxy lisää uudelleenyritykset ja lokituksen.

Minkä cold startin oikeasti näet?

7B-mallille serverless GPU:lla voit odottaa 10–30 sekuntia todellisessa cold startissa (kontin käynnistys plus painojen lataus plus moottorin alustus), käytännön tekijöiden raporttien mukaan. Toimittajien dokumentit lupaavat 1–5 sekuntia pelkälle kontin käynnistykselle. Noiden lukujen välinen kuilu on checkpointisi ylittämässä verkkoa.

RunPodin tuotesivu lupaa alle 200 ms FlashBoot-cold-startteja (toimittajan väite, ei mittaus). Käytännön tekijä r/LLMDevsissä raportoi: "cold startit kokemukseni mukaan eivät ole hyviä … sanoisin ~ 10–30 s" ja lisää "suurin osa kokemuksestani koskee tosin diffuusiomalleja." Molemmat ovat totta. Ne mittaavat eri asioita.

Cold start -luku on kolme päällekkäistä lukua:

  1. Kontin käynnistys. Modalin dokumentit: "Kontit käynnistyvät noin sekunnissa." Cloud Run: instanssit, joilla ajurit ovat esiasennettuna, "käynnistyvät noin 5 sekunnissa."

  2. Painojen lataus. Osa, jota kukaan ei mainosta. TU Münchenin 2024 ServerlessLLM-katsaus (arXiv 2411.15664) asettaa LLaMA-2-70B:lle yli 26 sekuntia lataus plus ~84 sekuntia 8 GPU:lle lataaminen.

  3. Moottorin alustus. vLLM:n graafikaappaus ja warm-up. Logesh Umapathi mittasi, että Qwen3.6-27B-FP8 A100-80GB:llä putosi 460 s:n perustasolta 219 s:ään eager moodilla ja ~70 s:ään vLLM sleep moodilla plus Modalin GPU-snapshoteilla. Se on 6,5-kertainen parannus, julkaistu 17.5.2026.

LähdeMitä mitattiinLukuPäiväysTyyppi
Modalin dokumentitKontin käynnistys~1 snykyinenToimittajan dokumentti
Cloud Runin dokumentitInstanssin käynnistys (ajurit esiasennettu)~5 snykyinenToimittajan dokumentti
UmapathiQwen3.6-27B-FP8, A100-80GB, täysi cold start460 s → 219 s → ~70 stoukokuu 2026Riippumaton mittaus
TU Münchenin ServerlessLLM-katsaus (arXiv 2411.15664)LLaMA-2-70B lataus + load, siteeratut ei mitatut luvut26 s lataus + 84 s load2024arXiv-preprintti (katsaus)
r/LLMDevs-käyttäjä7B RunPodilla, täysi pyyntö~10–30 sjoulukuu 2024Anekdootti (diffuusiovaraus)

Tulkintamme julkaistusta datasta: toimittajien luvut mittaavat konttia. Käytännön tekijöiden luvut mittaavat koko pyyntöä. Noiden kahden sekuntikellon välissä on 80 Gt painoja ylittämässä verkkoa. Tyyppi-sarake on pointti.

Mitä tehdä: vLLM sleep mode, GPU-snapshotit ja skaalausikkunan säätö. Modalin oletus-tyhjäkäynti on 60 sekuntia (säädettävissä 2 s – 20 min). Lämmin worker tappaa cold startit mutta laskuttaa kuin aina päällä.

python
# Modal scaledown config (illustrative)
# A 60s window means you pay for 60 idle seconds per burst.
# A warm worker (min_containers=1) costs ~$2.50/hr on A100 80GB, 24/7.
@app.function(
    gpu="A100",
    scaledown_window=60,  # seconds idle before shutdown
    # min_containers=1,   # uncomment to kill cold starts; costs $60/day
)

Onko serverless GPU halvempi kuin aina päällä oleva GPU?

Serverless GPU on halvempi, kun GPU:si seisoo tyhjäkäynnillä suurimman osan vuorokaudesta. 3 000 pyynnöllä vuorokaudessa, keskimäärin 2 sekuntia per pyyntö A100 80GB:llä, serverless maksaa noin $4,17/päivä verrattuna vuokratun 24/7-GPU:n $65,28:aan päivässä. Rajakohdan ylitys on kysymys käyttöasteesta, ei volyymistä.

Oletukset (meidän, ilmoitettu jotta voit ajaa ne uudelleen): A100 80GB Modalin $2,50/h, 2 sekuntia keskimäärin GPU-aikaa per pyyntö, vuokrattu GPU RunPodin $2,72/h ympäri vuorokauden, hostattu token-API $0,40/1 M tokenia (keskitason julkaistu hinta) ja ~1 000 tokenia per pyyntö.

Pyyntöä/pvServerless (arvio)Vuokrattu 24/7 GPUHostattu token-APIHalvin
500$0,69$65,28$0,20Token-API
3 000$4,17$65,28$1,20Token-API
10 000$13,89$65,28$4,00Token-API
50 000$69,44$65,28$20,00Token-API
200 000$277,78$65,28$80,00Vuokrattu GPU

Rajakohdan ylitys osuu noin 47 000 pyyntöön vuorokaudessa. Sen alla serverless voittaa. Hostattu token-API voittaa molemmat pienellä volyymillä commodity-mallilla. Break-even ei riipu siitä, kuinka monta pyyntöä saat. Se riippuu siitä, kuinka monta tuntia GPU:si viettää tekemättä mitään.

BentoML:n elokuun 2024 analyysi kehystää tämän kompromissin hyvin, joskin sen hintaesimerkit ovat GPT-3.5-turbo-kaudelta ja kaksi vuotta vanhoja.

Mitä hostattu token-API maksaa volyymilläsi: LLM-API-hintavertailumme. Leikataksesi pyyntökohtaista kustannusta päättelypuolella, prompt caching säästää tyypillisesti 30–60 % toistuvassa kontekstissa.

python
# Break-even calculator: adjust these and re-run
REQUESTS_PER_DAY = 3000
SECONDS_PER_REQUEST = 2
SERVERLESS_RATE_HR = 2.50   # Modal A100 80GB
RENTED_RATE_HR = 2.72       # RunPod A100 80GB, 24/7

serverless_daily = REQUESTS_PER_DAY * SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR
rented_daily = RENTED_RATE_HR * 24

print(f"Serverless: ${serverless_daily:.2f}/day")
print(f"Rented 24/7: ${rented_daily:.2f}/day")
print(f"Crossover: {int(RENTED_RATE_HR * 24 / (SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR))} req/day")

Milloin serverless GPU on väärä valinta

  • Tasaisesti korkea liikenne. Yli ~47 000 pyyntöä vuorokaudessa näillä hinnoilla: käyttöaste kääntyy ja vuokrattu GPU on halvempi per pyyntö.
  • Kovat alle sekunnin SLO:t kylmällä polulla. Mikään snapshot-kikka ei tee ensimmäisestä pyynnöstä välitöntä. Pidä lämmin worker tai vuokraa boksi.
  • 70B+ -mallit, jotka tarvitsevat useita GPU:ta. Yksi GPU per instanssi Cloud Runissa päättää sen keskustelun.
  • Tiukka datan sijaintivaatimus. Kuusi L4-aluetta on koko valikko Cloud Runissa.
  • Pyyntökohtainen laskelma, joka häviää jo maksamallesi worker-paikalle. Jos sinulla on ylimääräistä GPU-kapasiteettia, päättelyn lisääminen ei maksa ylimääräistä.

Jos GPU:si on varattu kuusitoista tuntia vuorokaudessa, serverless on kallis vaihtoehto, ja kuka tahansa muuta väittävä myy serverlessiä.

Paikallista polkua varten: paikallisten LLM-työkalujen oppaamme.

Kirjoittajasta

Mert Batur on Techsy.io:n perustajajäsen, missä tiimi toimittaa AI-agentteja, automaatiojärjestelmiä ja ääni-/SDR-pipelineja B2B-asiakkaille. Hän kirjoittaa LLM-työkalupinosta, jota Techsyn tiimi oikeasti käyttää tuotannossa. Yhdistä LinkedInissä.

Usein kysytyt kysymykset

Mikä on serverless GPU?

Serverless GPU -alusta ajaa mallikonttiasi jaetulla laitteistolla, skaalautuu nollaan pyyntöjen välissä ja laskuttaa vain aktiivisesta laskennasta. Saat päättely-endpointin hallinnoimatta pysyvää GPU-instanssia. Kompromissi on cold start -viive käynnistyksessä.

Paljonko LLM:n ajaminen serverless GPU:lla maksaa?

A100 80GB maksaa $2,25/h Beamilla, $2,50/h Modalilla, $2,72/h RunPodilla (varmistettu 30.7.2026). Laskusi riippuu käyttöasteesta: 3 000 pyyntöä vuorokaudessa à 2 s maksaa ~$4/päivä Modalilla. Tallennus lisää $0,09/GiB/kk, 1 TiB ilmainen.

Maksanko mallipainojen tallennuksesta?

Kyllä, mutta se on halpaa. Modal veloittaa $0,09/GiB/kk, 1 TiB/kk ilmainen, joten 80 Gt:n checkpoint ei maksa mitään. RunPodin hinnoittelusivu listaa verkkotallennuksen $0,07/Gt/kk alle 1 TB:lle, noin $5,60/kk samalle 80 Gt:lle.

Latautuuko mallini uudelleen jokaisella pyynnöllä?

Vain jos mikään ei ole välimuistissa. Painot pysyvällä volyymillä tai imageen leivottuna selviävät cold starteista. Osoita Hugging Face -välimuisti väliaikaistallennukseen, ja 130 Gt:n malli latautuu uudelleen jokaisella käynnistyksellä. Se on vältettävä vikamoodi.

Kuinka pitkä on 7B-mallin cold start?

Odota 10–30 sekuntia todellisessa cold startissa käytännön raporttien mukaan (r/LLMDevs, joulukuu 2024). Kontti käynnistyy 1–5 s:ssa (Modal, Cloud Run -dokumentit). Loput on painojen latausta ja moottorin alustusta. Snapshoteilla ja sleep moodilla Umapathi mittasi 27B-mallille ~70 s, alas 460 s:stä.

Voinko ajaa 70B-mallia serverless GPU:lla?

Yleensä et. 70B-malli FP16:lla tarvitsee ~140 Gt VRAM:ia. Cloud Run sallii yhden GPU:n per instanssi (enintään 96 Gt). Tarvitset FP8-kvantisoinnin mahtuaksesi yhdelle 80 Gt:n kortille tai usean GPU:n alustan. Useimmat serverless-pinnat rajoittavat yhteen GPU:hun.

Onko serverless GPU halvempi kuin GPU:n vuokraus 24/7?

Alle ~47 000 pyyntöä vuorokaudessa (2 s/pyyntö A100 80GB:llä), kyllä. Serverless laskuttaa vain aktiiviset sekunnit; vuokrattu GPU laskuttaa 24 tuntia joka tapauksessa. Sen yläpuolella vuokrattu GPU voittaa. Hostattu token-API voittaa molemmat pienellä volyymillä. Katso break-even-taulukko yllä.

Voinko deployata LLM:n serverless GPU:lle ilmaiseksi?

Modal antaa $30/kk ilmaisrahaa (Starter). Beam antaa $30/kk. GCP:n $300 uuden tilin krediitti kattaa Cloud Run -GPU-käytön. Riittää prototyyppiin, ei tuotantoliikenteen pyörittämiseen. Yksikään alusta ei tarjoa pysyvää ilmaista tasoa GPU-päättelylle.

Mitkä serverless GPU -toimittajat ovat saatavilla Euroopassa?

Cloud Run tarjoaa L4-GPU:ta alueilla europe-west1 (Belgia) ja europe-west4 (Alankomaat). Modal dokumentoi EU-aluevalinnan (eu-west, eu-north, eu-south), hinnoiteltuna 1,5–1,75-kertaiseen perushintaan. RunPod nimeää eurooppalaisia datakeskuksia, kuten EU-NL-1 ja EU-FR-1. Kiinnitä alue eksplisiittisesti; mikään niistä ei oletuksena ole EU.

Tarvitsenko Dockerin deployatakseni LLM:n serverless GPU:lle?

Et aina. RunPod tarjoaa esivalmisteltuja vLLM-worker-templateja, jotka ohittavat Dockerin. Modal rakentaa kontit Python-image-määrittelystä koodissa. Räätälöidyille riippuvuuksille kirjoitat Dockerfilen. Vakio-vLLM-palvelulle esivalmisteltu polku toimii minuuteissa.

Johtopäätös

Viisi alustaa, viisi laskutusyksikköä, yksi normalisoitu taulukko. Päätös on yksinkertaisempi kuin toimittajien sivut antavat ymmärtää:

  • Valitse GPU:si VRAM:in mukaan, et brändin.
  • Laita painosi volyymille, ei imageen, ellet koskaan vaihda mallia.
  • Odota 10–30 sekunnin cold startteja ja suunnittele niiden ympärille.
  • Alle ~47 000 pyyntöä vuorokaudessa: nollaan skaalaus voittaa kustannuksissa.
  • Endpointin takana oleva päättelymoottori on vaihdettavissa; base_url on yksi rivi.

Sinulla on kutsuttava endpoint. Seuraavaksi: mitä sen edessä on, kun tarvitset reititystä ja failoveria? LLM-gateway-vertailumme vastaa siihen. Tai käy setupisi läpi kanssamme.

Aihepiirit

deploy-llm-serverless-gpuserverless-gpuvllmllm-inferenssikylmä-käynnistys

Jaa tämä artikkeli

Aiheeseen liittyvät julkaisut

Lisää aiheesta ai-machine-learning

ai-machine-learning
Aug 7, 2026

AI-agenttien työnkulumallit: 7 mallia ja milloin ne toimivat (2026)

Seitsemän AI-agenttien työnkulumallia toistuvat jokaisen toimittajan taksonomiassa, mutta mikään niistä ei voita kaikkialla. Tässä artikkelissa ne asetetaan paremmuusjärjestykseen Google Researchin ja Anthropicin julkaistun 2026 benchmark-datan perusteella, laskutoimitukset näkyvillä, ajettava Python-koodi jokaiselle mallille ja päätöstikkaat oikean valintaan.

13 min lukuaika lukuaika
Lue
ai-machine-learning
Aug 7, 2026

RAG:n paloittelustrategiat: 7 menetelmää, hakudatan perusteella järjestettynä (2026)

Paloittelu pilkkoo dokumentit ennen upotusta, ja pilkkomiskohdat määräävät, mitä hakumoduuli löytää ja mitä ei. Järjestimme 7 RAG:n paloittelustrategiaa Chroman julkisen 472 kyselyn benchmarkin perusteella ja sovitimme kukin jo käytössä olevaan upotusmalliin.

15 min lukuaika lukuaika
Lue
ai-machine-learning
Aug 6, 2026

Paras RAG-framework 2026: LangChain vs LlamaIndex vs Haystack (ja milloin et tarvitse mitään)

LangChain 1.0 on useimmille tiimeille oletusvalinta, mutta rehellinen vastaus yhden korpuksen Q&A-sovellukseen on, että frameworkia ei ehkä tarvita lainkaan. Vertailimme 8 orkestrointikerrosta rinnakkain: koodi, repojen tuore data ja viivebudjetti.

14 min lukuaika lukuaika
Lue
Katso kaikki julkaisut
Aloita projekti

Valmiina rakentamaan jotain erinomainen?

Muutetaan visiosi todellisuudeksi. Tiimimme on valmis auttamaan sinua luomaan ohjelmistoja, joilla on todellinen vaikutus.

Varaa lyhyt suunnittelukeskusteluKatso töitämme

Suosittuja kirjastosta

Claude-taidot

Katso kaikki
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Tekoäly automatisoinnit

Katso kaikki
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Suosittuja kirjastosta

Claude-taidot

Katso kaikki
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Tekoäly automatisoinnit

Katso kaikki
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Palvelut

  • Yritysratkaisut
  • Mobiilisovellukset
  • Verkkosovellukset

Ratkaisut

  • CRM-järjestelmät
  • Tekoälyintegraatio
  • ERP-ratkaisut
  • Ääniapurarit
  • Prosessien automatisointi
  • Kyberturvallisuus

Kirjasto

  • Blogi
  • Portfolio

Yhteisö

  • Tekoäly automatisoinnit
  • Claude-taidot

Työkalut

  • Mobile sovelluksen hintalaskuri
  • OpenAI / LLM API -hintalaskuri
  • MVP-hintalaskuri
  • Puhe-tekoälyasiamies-hintalaskuri

Yritys

  • Tietoja
  • Kumppanit
  • Ota yhteyttä

Juridiset asiat

  • Tietosuopolitiiikka
  • Käyttöehdot
  • Evästekäytäntö

Palvelut

  • Yritysratkaisut
  • Mobiilisovellukset
  • Verkkosovellukset

Ratkaisut

  • CRM-järjestelmät
  • Tekoälyintegraatio
  • ERP-ratkaisut
  • Ääniapurarit
  • Prosessien automatisointi
  • Kyberturvallisuus

Kirjasto

  • Blogi
  • Portfolio

Yhteisö

  • Tekoäly automatisoinnit
  • Claude-taidot

Työkalut

  • Mobile sovelluksen hintalaskuri
  • OpenAI / LLM API -hintalaskuri
  • MVP-hintalaskuri
  • Puhe-tekoälyasiamies-hintalaskuri

Yritys

  • Tietoja
  • Kumppanit
  • Ota yhteyttä
Juridiset asiatTietosuopolitiiikkaKäyttöehdotEvästekäytäntö
TECHSY
© 2026 Techsy. Kaikki oikeudet pidätetään.