
Deployaa LLM serverless GPU:lle: 5 alustaa, oikeat hinnat, rehelliset cold start -luvut
RunPod veloittaa $2,72/tunti A100 80GB:stä. Endpointisi saa tusinan pyyntöjä ennen lounasta. GPU seisoo tyhjäkäynnillä loput 23 tuntia ja laskuttaa koko ajan. Kun deployaat LLM:n serverless GPU:lle, maksat vain silloin kun pyyntö ajaa. Viisi alustaa tekee näin. Ne laskuttavat viidessä eri yksikössä. Kukaan ei normalisoi niitä.
Tyhjäkäynnillä oleva GPU maksaa täsmälleen yhtä paljon kuin varattu.
Keskeiset opit
- Serverless GPU laskuttaa vain pyynnön ajon ajalta ja skaalautuu nollaan pyyntöjen välissä.
- Cloud Runissa yksi GPU per instanssi; 70B-mallit tarvitsevat useita GPU:ta, joten serverless ei yleensä pysty hostaamaan niitä.
- Mallin painot ovat joko imagessa, verkkovolyymillä tai latautuvat uudelleen jokaisessa cold startissa.
- Cold start koostuu kolmesta vaiheesta: kontin käynnistys, painojen lataus ja moottorin alustus. Vain ensimmäinen on nopea.
- Alle noin 47 000 pyyntöä vuorokaudessa: nollaan skaalaus voittaa vuokratun 24/7-GPU:n.
Mitä 'serverless GPU' oikeastaan tarkoittaa LLM:lle?
Serverless GPU -alusta ajaa päättelykonttiasi jaetulla GPU-laitteistolla, käynnistää sen pyynnön saapuessa ja skaalautuu nollaan, kun liikenne loppuu. Maksat sekunnilta (tai minuutilta tai tunnilta, toimittajasta riippuen) vain silloin kun kontti on käynnissä. Ei tyhjäkäyntilaskua. Ei varattua instanssia.
Laskutusyksikkö vaihtelee toimittajittain, minkä vuoksi seuraava osio normalisoi kaiken muotoon $/GPU-tunti.
Kaksi rajoitusta yllättävät useimmat. Ensinnäkin Google Cloud Run sallii enintään yhden GPU:n per instanssi. Se asettaa VRAM-katoksi yhden kortin. Toiseksi "serverless" ei tarkoita pysyvää tilaa. Mikään pitkäikäinen prosessi ei pidä painojasi RAM-muistissa pyyntöjen välissä. Kun kontti sammuu, kaikki muistissa oleva sammuu sen mukana. Tämä yksi tosiasia ratkaisee tallennusratkaisun alla olevassa mallipainojen osiossa.
Serverless ei tarkoita, ettei palvelinta ole. Se tarkoittaa, ettei palvelinta ole pyyntöjesi välissä, ja juuri sinne mallipainosi katoavat.
Minkä serverless GPU -alustan valitset? (2026 hinnat rinnakkain)
Emme myy mitään näistä alustoista emmekä saa affiliate-tuloja yhdestäkään. Seitsemästä artikkelista, jotka kilpailevat tästä hakusanasta ja sen muunnelmista, neljä on serverless GPU:ta myyvän yrityksen julkaisemia. Tämä taulukko ei ole.
Kaikki hinnat luettu toimittajien omilta hinnoittelusivuilta 30.7.2026. Hinnat muuttuvat; tarkista ennen sitoutumista.
| Alusta | Julkaistu yksikkö (heidän sanoin) | $/GPU-h (A100 80GB) | $/GPU-h (H100) | Ilmaisrahat | Valitse tämä, jos... |
|---|---|---|---|---|---|
| Modal | $0,000694/s | $2,50 | $3,95 | $30/kk Starter | haluat sekuntilaskutuksen, nopeat buildit ja GPU-snapshotit |
| RunPod | $2,72/h | $2,72 | $4,55 | ei julkaistu | haluat laajimman GPU-valikoiman kiinteillä tuntihinnoilla |
| Beam | $0,000625/s | $2,25 | $3,55 | $30/kk | haluat nollalaskutuksen käynnistykselle ja imagen lataukselle |
| Baseten | $0,06667/min | $4,00 | $6,50 | kyllä, summaa ei julkaistu | haluat hallitun päättelyn aktiivisen laskennan laskutuksella |
| Cloud Run | sekuntilaskutus (L4 ja RTX PRO 6000 Blackwell; ei A100/H100) | ei julkaistu (ei A100) | ei julkaistu (ei H100) | $300 GCP-krediitti | olet jo GCP:ssä ja tarvitset EU/US-aluevalintaa |
Normalisointilasku kerran näytettynä, jotta voit tarkistaa sen: Modal A100 80GB, $0,000694/s kerrottuna 3600 sekunnilla on $2,4984/h. Beam: $0,000625 kertaa 3600 on $2,25/h. Baseten: $0,06667/min kertaa 60 on $4,00/h. Tuo 1,8-kertainen ero Beamin ja Basetenin välillä samalla A100:lla on todellinen, ja se piiloutuu näkyville, koska kukaan ei julkaise samaa yksikköä.
Kolme varausta. Beamin hinnoittelusivu kertoo suoraan, ettei se laskuta palvelimen käynnistyksestä eikä kontti-imagen latauksesta. Basetenin hinnoittelu-FAQ vastaa kysymykseen "Maksanko Basetenilla tyhjäkäynnistä?" vastauksella "Et, et maksa tyhjäkäynnistä" ja lisää sitten, että laskutettava aika on "aika, jolloin mallisi on aktiivisesti deployautumassa, skaalautumassa ylös tai alas tai tuottamassa ennusteita", joten mittari kattaa muutakin kuin ennustusaika, ja juuri se osa kannattaa budjetoida. RunPod julkaisee tuntihinnat eikä lainkaan cold start -lukua hinnoittelusivullaan.
Jos Modal on valintasi, kirjoitimme täyden Modal-läpikäynnin erikseen.
Mahtuuko mallisi edes? VRAM, yhden GPU:n rajat ja kiintiöt
Voitko ajaa 70B-mallia serverless GPU:lla? Yleensä et. FP16:lla 70B tarvitsee ~140 Gt VRAM:ia. Cloud Run rajoittaa yhteen GPU:hun per instanssi (enintään 96 Gt RTX PRO 6000:lla). Laskelma ei täsmää ilman kvantisointia (FP8/GGUF) tai usean GPU:n alustaa.
| GPU | VRAM | Min CPU / muisti | Tyypillinen mallikatto |
|---|---|---|---|
| L4 | 24 Gt | 4 CPU / 16 GiB | 7B–13B (FP16), kvantisoituna jopa 30B |
| A100 80GB | 80 Gt | vaihtelee alustan mukaan | 30B–70B kvantisoituna |
| H100 80GB | 80 Gt | vaihtelee alustan mukaan | 30B–70B kvantisoituna |
| RTX PRO 6000 Blackwell | 96 Gt | 20 CPU / 80 GiB | 70B FP8:lla |
Cloud Runin oletuskiintiö on 3 L4-GPU:ta aluetta ja projektia kohden (RTX PRO 6000 myönnetään erikseen, 3 000 milliGPU:na), kuudella L4-alueella: asia-southeast1, asia-south1, europe-west1, europe-west4, us-central1, us-east4. Se on Cloud Runin puolisko vastauksesta datan sijaintia koskevaan kysymykseen kaikille, jotka kysyvät serverless GPU:sta Euroopassa; Modal ja RunPod dokumentoivat omat EU-alueensa, ja FAQ:ssä on loput.
Ismaili Simban Cloud Run -läpikäynti dev.to:ssa (huhtikuu 2025) raportoi, että kiintiöpyynnön hyväksyminen "voi kestää jonkin aikaa (jopa 5 työpäivää)" ja että "Cloud Runin L4-GPU:illa on 16 Gt RAM-raja." Varaudu tuohon viiveeseen.
Mallikohtaiseen VRAM-mitoitukseen: VRAM-vaatimusoppaamme.
Missä mallipainosi ovat (ja mitä se maksaa)?
Reddit-ketju marraskuulta 2024, joka oli tarkistushetkellämme 30.7.2026 yhä sijalla 5 Googlessa tällä samalla haulla, kysyy sanatarkasti:
"En ole löytänyt hintaa 80 Gt:n mallin tallennukselle… Mikä on vaihtoehto, jos en halua ladata mallia jokaisella API-kutsulla (pod varataan kutsulla ja suljetaan sitten)? … Mikseivät nämä alustat listaa mallitallennuksen hintaa?"
Kolme vähäistä vastausta, ei yhtään oikeaa vastausta. Kun ajoimme tämän haun 30.7.2026, kymmenen kärjessä oli yhä tuo kaksivuotias ketju kysymässä mallitallennuksen hintaa. Kukaan ketjussa ei vastannut siihen. Molemmat alustat julkaisevat hinnan. Modalilla se on $0,09 per GiB kuukaudessa, ensimmäinen TiB ilmainen, joten tuo 80 Gt:n checkpoint laskuttuu $0,00. RunPodilla verkkotallennus alle 1 TB on $0,07 per Gt kuukaudessa, mikä asettaa saman checkpointin noin $5,60:een kuukaudessa.
| Sijoitus | Vaikutus cold startiin | Hinta | Rebuild mallin vaihtoon? | Paras kohteelle |
|---|---|---|---|---|
| Leivottu kontti-imageen | Nopein käynnistys | Imagen koko kasvaa (27B FP8 = kymmeniä Gt) | Kyllä, täysi rebuild | Yhden mallin endpointit |
| Pysyvä verkkovolyymi | Nopea (välimuistissa hostilla) | Modal $0,09/GiB/kk, 1 TiB ilmainen; RunPod $0,07/Gt/kk alle 1 TB | Ei, vaihda polku | Useat mallit tai tiheät vaihdot |
| Hugging Facesta ladattuna käynnistyksessä | Hitain: yli 26 s 130 Gt:lle 5 Gt/s nopeudella | Ilmainen (HF-kaista) | Ei | Vain prototyyppiin |
Kolmas rivi on vikamoodi. TU Münchenin 2024 ServerlessLLM-katsaus (arXiv 2411.15664) raportoi, että LLaMA-2-70B (130 Gt) tarvitsee yli 26 sekuntia lataukseen 5 Gt/s nopeudella, plus ~84 sekuntia lataamiseen 8 GPU:lle, verrattuna ~100 ms tokenin generointiin. Nuo luvut on siteerattu katsauksessa, ei mitattu siinä.
RunPodin hinnoittelusivulla on Storage-osio: konttilevy $0,10/Gt/kk, volyymilevy $0,10/Gt/kk käynnissä ja $0,20/Gt/kk tyhjäkäynnillä, verkkotallennus $0,07/Gt/kk alle 1 TB ja $0,05/Gt/kk sen yli, korkean suorituskyvyn verkkotallennus $0,14/Gt/kk. Luku on olemassa. Se ei vain ole niiden GPU-kohtaisten serverless-hintojen vieressä, joita lukija vertailee kysymyksen juolahtaessa mieleen, eikä endpointin asetusten säätövaiheessa. Löydettävyysongelma, ei salailua, ja riittää pitämään kysymyksen elossa kaksi vuotta myöhemmin.
# Point the Hugging Face cache at a mounted network volume
# so weights persist across cold starts (RunPod / Modal pattern)
export HF_HOME=/workspace/hf-cache
export TRANSFORMERS_CACHE=/workspace/hf-cache
export HF_HUB_ENABLE_HF_TRANSFER=1# Alternative: bake weights into the image at build time
FROM vllm/vllm-openai:latest
COPY ./model-weights /models/qwen3-27b-fp8
ENV MODEL_NAME=/models/qwen3-27b-fp8
# Downside: 30+ GB image, full rebuild to change modelsJos et ole vielä valinnut mallia, avoimien painojen 2026-katsauksemme mitoittaa jokaisen vaihtoehdon deployausta varten.
Deploy: vLLM RunPod Serverlessillä alusta loppuun
Kuusi vaihetta nollasta kutsuttavaan endpointtiin. Varmista jokainen RunPodin vLLM-ohjeesta (päivitetty 22.6.2026), joka ei julkaise hintoja.
-
Valitse mallisi. Valitse avoimien painojen malli, joka on mitoitettu GPU:llesi (katso VRAM-taulukko yllä). Jos se on rajattu Hugging Facessa, generoi access token ensin.
-
Luo serverless-endpoint. Valitse RunPodin konsolissa Serverless, valitse vLLM-worker-template ja valitse GPU-tasosi.
-
Aseta ympäristömuuttujat, joilla on väliä.
MODEL_NAME=Qwen/Qwen3.6-27B-FP8
MAX_MODEL_LEN=32768
GPU_MEMORY_UTILIZATION=0.90
DTYPE=autoVäärä MODEL_NAME tarkoittaa 404:ää käynnistyksessä. Liian korkea MAX_MODEL_LEN VRAM:iisi nähden tarkoittaa OOM:ia ennen ensimmäistä tokenia. GPU_MEMORY_UTILIZATION yli 0,95 ei jätä liikkumavaraa KV-cache-piikeille.
-
Aseta min/max-workerit ja tyhjäkäynnin aikakatkaisu. Min-workerit nollassa antaa nollaan skaalautumisen (ja cold startit). Min-workerit yhdessä tappaa cold startit mutta laskuttaa tauotta. Alla oleva cold start -osio käy tuon kompromissin läpi.
-
Liitä verkkovolyymi, jonka päätit mallipainojen osiossa, tai hyväksy image-leivontapolku. Jos ohitat tämän, jokainen cold start lataa checkpointin uudelleen.
-
Ammu ensimmäinen pyyntö. Lue endpoint-ID konsolista ja varmista, että tokeneita palautuu.
curl -X POST "https://api.runpod.ai/v2/${ENDPOINT_ID}/runsync" \
-H "Authorization: Bearer ${RUNPOD_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"input": {
"messages": [{"role": "user", "content": "Explain cold starts in one sentence."}],
"max_tokens": 60
}
}'Jos punnitset itse päättelymoottoria, vertailimme vLLM:ää ja SGLangia läpimenon ja latenssin osalta.
Miten kutsut endpointia sovelluksestasi?
Jokainen listan alusta puhuu OpenAI-yhteensopivaa API:a. Yksi Python-pätkä toimii kaikkialla. Toimittajan vaihto on base_url-muutos, ei uudelleenkirjoitus. Se muuttaa "minkä toimittajan" kysymyksen lukkiutumispäätöksestä asetuspäätökseksi.
import os
from openai import OpenAI
ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]
client = OpenAI(
base_url=f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
api_key=os.environ["RUNPOD_API_KEY"],
)
response = client.chat.completions.create(
model="Qwen/Qwen3.6-27B-FP8",
messages=[{"role": "user", "content": "What is scale to zero?"}],
max_tokens=120,
)
print(response.choices[0].message.content)# Same code, different provider. One line changes.
ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]
PROVIDERS = {
"runpod": f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
"modal": "https://your-app--your-func.modal.run/v1",
"beam": "https://your-beam-endpoint/v1",
}
client = OpenAI(base_url=PROVIDERS["modal"], api_key="your-key")Jos jokainen toimittaja puhuu OpenAI:n murretta, "mikä serverless GPU -toimittaja" lakkaa olemasta arkkitehtuuripäätös ja muuttuu yhdeksi konfiguraatioriviksi.
Kun sinulla on useita endpointteja, LLM-gateway-vertailumme kattaa reitityksen ja failoverin. Kevyempään setupiin LiteLLM-proxy lisää uudelleenyritykset ja lokituksen.
Minkä cold startin oikeasti näet?
7B-mallille serverless GPU:lla voit odottaa 10–30 sekuntia todellisessa cold startissa (kontin käynnistys plus painojen lataus plus moottorin alustus), käytännön tekijöiden raporttien mukaan. Toimittajien dokumentit lupaavat 1–5 sekuntia pelkälle kontin käynnistykselle. Noiden lukujen välinen kuilu on checkpointisi ylittämässä verkkoa.
RunPodin tuotesivu lupaa alle 200 ms FlashBoot-cold-startteja (toimittajan väite, ei mittaus). Käytännön tekijä r/LLMDevsissä raportoi: "cold startit kokemukseni mukaan eivät ole hyviä … sanoisin ~ 10–30 s" ja lisää "suurin osa kokemuksestani koskee tosin diffuusiomalleja." Molemmat ovat totta. Ne mittaavat eri asioita.
Cold start -luku on kolme päällekkäistä lukua:
-
Kontin käynnistys. Modalin dokumentit: "Kontit käynnistyvät noin sekunnissa." Cloud Run: instanssit, joilla ajurit ovat esiasennettuna, "käynnistyvät noin 5 sekunnissa."
-
Painojen lataus. Osa, jota kukaan ei mainosta. TU Münchenin 2024 ServerlessLLM-katsaus (arXiv 2411.15664) asettaa LLaMA-2-70B:lle yli 26 sekuntia lataus plus ~84 sekuntia 8 GPU:lle lataaminen.
-
Moottorin alustus. vLLM:n graafikaappaus ja warm-up. Logesh Umapathi mittasi, että Qwen3.6-27B-FP8 A100-80GB:llä putosi 460 s:n perustasolta 219 s:ään eager moodilla ja ~70 s:ään vLLM sleep moodilla plus Modalin GPU-snapshoteilla. Se on 6,5-kertainen parannus, julkaistu 17.5.2026.
| Lähde | Mitä mitattiin | Luku | Päiväys | Tyyppi |
|---|---|---|---|---|
| Modalin dokumentit | Kontin käynnistys | ~1 s | nykyinen | Toimittajan dokumentti |
| Cloud Runin dokumentit | Instanssin käynnistys (ajurit esiasennettu) | ~5 s | nykyinen | Toimittajan dokumentti |
| Umapathi | Qwen3.6-27B-FP8, A100-80GB, täysi cold start | 460 s → 219 s → ~70 s | toukokuu 2026 | Riippumaton mittaus |
| TU Münchenin ServerlessLLM-katsaus (arXiv 2411.15664) | LLaMA-2-70B lataus + load, siteeratut ei mitatut luvut | 26 s lataus + 84 s load | 2024 | arXiv-preprintti (katsaus) |
| r/LLMDevs-käyttäjä | 7B RunPodilla, täysi pyyntö | ~10–30 s | joulukuu 2024 | Anekdootti (diffuusiovaraus) |
Tulkintamme julkaistusta datasta: toimittajien luvut mittaavat konttia. Käytännön tekijöiden luvut mittaavat koko pyyntöä. Noiden kahden sekuntikellon välissä on 80 Gt painoja ylittämässä verkkoa. Tyyppi-sarake on pointti.
Mitä tehdä: vLLM sleep mode, GPU-snapshotit ja skaalausikkunan säätö. Modalin oletus-tyhjäkäynti on 60 sekuntia (säädettävissä 2 s – 20 min). Lämmin worker tappaa cold startit mutta laskuttaa kuin aina päällä.
# Modal scaledown config (illustrative)
# A 60s window means you pay for 60 idle seconds per burst.
# A warm worker (min_containers=1) costs ~$2.50/hr on A100 80GB, 24/7.
@app.function(
gpu="A100",
scaledown_window=60, # seconds idle before shutdown
# min_containers=1, # uncomment to kill cold starts; costs $60/day
)Onko serverless GPU halvempi kuin aina päällä oleva GPU?
Serverless GPU on halvempi, kun GPU:si seisoo tyhjäkäynnillä suurimman osan vuorokaudesta. 3 000 pyynnöllä vuorokaudessa, keskimäärin 2 sekuntia per pyyntö A100 80GB:llä, serverless maksaa noin $4,17/päivä verrattuna vuokratun 24/7-GPU:n $65,28:aan päivässä. Rajakohdan ylitys on kysymys käyttöasteesta, ei volyymistä.
Oletukset (meidän, ilmoitettu jotta voit ajaa ne uudelleen): A100 80GB Modalin $2,50/h, 2 sekuntia keskimäärin GPU-aikaa per pyyntö, vuokrattu GPU RunPodin $2,72/h ympäri vuorokauden, hostattu token-API $0,40/1 M tokenia (keskitason julkaistu hinta) ja ~1 000 tokenia per pyyntö.
| Pyyntöä/pv | Serverless (arvio) | Vuokrattu 24/7 GPU | Hostattu token-API | Halvin |
|---|---|---|---|---|
| 500 | $0,69 | $65,28 | $0,20 | Token-API |
| 3 000 | $4,17 | $65,28 | $1,20 | Token-API |
| 10 000 | $13,89 | $65,28 | $4,00 | Token-API |
| 50 000 | $69,44 | $65,28 | $20,00 | Token-API |
| 200 000 | $277,78 | $65,28 | $80,00 | Vuokrattu GPU |
Rajakohdan ylitys osuu noin 47 000 pyyntöön vuorokaudessa. Sen alla serverless voittaa. Hostattu token-API voittaa molemmat pienellä volyymillä commodity-mallilla. Break-even ei riipu siitä, kuinka monta pyyntöä saat. Se riippuu siitä, kuinka monta tuntia GPU:si viettää tekemättä mitään.
BentoML:n elokuun 2024 analyysi kehystää tämän kompromissin hyvin, joskin sen hintaesimerkit ovat GPT-3.5-turbo-kaudelta ja kaksi vuotta vanhoja.
Mitä hostattu token-API maksaa volyymilläsi: LLM-API-hintavertailumme. Leikataksesi pyyntökohtaista kustannusta päättelypuolella, prompt caching säästää tyypillisesti 30–60 % toistuvassa kontekstissa.
# Break-even calculator: adjust these and re-run
REQUESTS_PER_DAY = 3000
SECONDS_PER_REQUEST = 2
SERVERLESS_RATE_HR = 2.50 # Modal A100 80GB
RENTED_RATE_HR = 2.72 # RunPod A100 80GB, 24/7
serverless_daily = REQUESTS_PER_DAY * SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR
rented_daily = RENTED_RATE_HR * 24
print(f"Serverless: ${serverless_daily:.2f}/day")
print(f"Rented 24/7: ${rented_daily:.2f}/day")
print(f"Crossover: {int(RENTED_RATE_HR * 24 / (SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR))} req/day")Milloin serverless GPU on väärä valinta
- Tasaisesti korkea liikenne. Yli ~47 000 pyyntöä vuorokaudessa näillä hinnoilla: käyttöaste kääntyy ja vuokrattu GPU on halvempi per pyyntö.
- Kovat alle sekunnin SLO:t kylmällä polulla. Mikään snapshot-kikka ei tee ensimmäisestä pyynnöstä välitöntä. Pidä lämmin worker tai vuokraa boksi.
- 70B+ -mallit, jotka tarvitsevat useita GPU:ta. Yksi GPU per instanssi Cloud Runissa päättää sen keskustelun.
- Tiukka datan sijaintivaatimus. Kuusi L4-aluetta on koko valikko Cloud Runissa.
- Pyyntökohtainen laskelma, joka häviää jo maksamallesi worker-paikalle. Jos sinulla on ylimääräistä GPU-kapasiteettia, päättelyn lisääminen ei maksa ylimääräistä.
Jos GPU:si on varattu kuusitoista tuntia vuorokaudessa, serverless on kallis vaihtoehto, ja kuka tahansa muuta väittävä myy serverlessiä.
Paikallista polkua varten: paikallisten LLM-työkalujen oppaamme.
Kirjoittajasta
Mert Batur on Techsy.io:n perustajajäsen, missä tiimi toimittaa AI-agentteja, automaatiojärjestelmiä ja ääni-/SDR-pipelineja B2B-asiakkaille. Hän kirjoittaa LLM-työkalupinosta, jota Techsyn tiimi oikeasti käyttää tuotannossa. Yhdistä LinkedInissä.
Usein kysytyt kysymykset
Mikä on serverless GPU?
Serverless GPU -alusta ajaa mallikonttiasi jaetulla laitteistolla, skaalautuu nollaan pyyntöjen välissä ja laskuttaa vain aktiivisesta laskennasta. Saat päättely-endpointin hallinnoimatta pysyvää GPU-instanssia. Kompromissi on cold start -viive käynnistyksessä.
Paljonko LLM:n ajaminen serverless GPU:lla maksaa?
A100 80GB maksaa $2,25/h Beamilla, $2,50/h Modalilla, $2,72/h RunPodilla (varmistettu 30.7.2026). Laskusi riippuu käyttöasteesta: 3 000 pyyntöä vuorokaudessa à 2 s maksaa ~$4/päivä Modalilla. Tallennus lisää $0,09/GiB/kk, 1 TiB ilmainen.
Maksanko mallipainojen tallennuksesta?
Kyllä, mutta se on halpaa. Modal veloittaa $0,09/GiB/kk, 1 TiB/kk ilmainen, joten 80 Gt:n checkpoint ei maksa mitään. RunPodin hinnoittelusivu listaa verkkotallennuksen $0,07/Gt/kk alle 1 TB:lle, noin $5,60/kk samalle 80 Gt:lle.
Latautuuko mallini uudelleen jokaisella pyynnöllä?
Vain jos mikään ei ole välimuistissa. Painot pysyvällä volyymillä tai imageen leivottuna selviävät cold starteista. Osoita Hugging Face -välimuisti väliaikaistallennukseen, ja 130 Gt:n malli latautuu uudelleen jokaisella käynnistyksellä. Se on vältettävä vikamoodi.
Kuinka pitkä on 7B-mallin cold start?
Odota 10–30 sekuntia todellisessa cold startissa käytännön raporttien mukaan (r/LLMDevs, joulukuu 2024). Kontti käynnistyy 1–5 s:ssa (Modal, Cloud Run -dokumentit). Loput on painojen latausta ja moottorin alustusta. Snapshoteilla ja sleep moodilla Umapathi mittasi 27B-mallille ~70 s, alas 460 s:stä.
Voinko ajaa 70B-mallia serverless GPU:lla?
Yleensä et. 70B-malli FP16:lla tarvitsee ~140 Gt VRAM:ia. Cloud Run sallii yhden GPU:n per instanssi (enintään 96 Gt). Tarvitset FP8-kvantisoinnin mahtuaksesi yhdelle 80 Gt:n kortille tai usean GPU:n alustan. Useimmat serverless-pinnat rajoittavat yhteen GPU:hun.
Onko serverless GPU halvempi kuin GPU:n vuokraus 24/7?
Alle ~47 000 pyyntöä vuorokaudessa (2 s/pyyntö A100 80GB:llä), kyllä. Serverless laskuttaa vain aktiiviset sekunnit; vuokrattu GPU laskuttaa 24 tuntia joka tapauksessa. Sen yläpuolella vuokrattu GPU voittaa. Hostattu token-API voittaa molemmat pienellä volyymillä. Katso break-even-taulukko yllä.
Voinko deployata LLM:n serverless GPU:lle ilmaiseksi?
Modal antaa $30/kk ilmaisrahaa (Starter). Beam antaa $30/kk. GCP:n $300 uuden tilin krediitti kattaa Cloud Run -GPU-käytön. Riittää prototyyppiin, ei tuotantoliikenteen pyörittämiseen. Yksikään alusta ei tarjoa pysyvää ilmaista tasoa GPU-päättelylle.
Mitkä serverless GPU -toimittajat ovat saatavilla Euroopassa?
Cloud Run tarjoaa L4-GPU:ta alueilla europe-west1 (Belgia) ja europe-west4 (Alankomaat). Modal dokumentoi EU-aluevalinnan (eu-west, eu-north, eu-south), hinnoiteltuna 1,5–1,75-kertaiseen perushintaan. RunPod nimeää eurooppalaisia datakeskuksia, kuten EU-NL-1 ja EU-FR-1. Kiinnitä alue eksplisiittisesti; mikään niistä ei oletuksena ole EU.
Tarvitsenko Dockerin deployatakseni LLM:n serverless GPU:lle?
Et aina. RunPod tarjoaa esivalmisteltuja vLLM-worker-templateja, jotka ohittavat Dockerin. Modal rakentaa kontit Python-image-määrittelystä koodissa. Räätälöidyille riippuvuuksille kirjoitat Dockerfilen. Vakio-vLLM-palvelulle esivalmisteltu polku toimii minuuteissa.
Johtopäätös
Viisi alustaa, viisi laskutusyksikköä, yksi normalisoitu taulukko. Päätös on yksinkertaisempi kuin toimittajien sivut antavat ymmärtää:
- Valitse GPU:si VRAM:in mukaan, et brändin.
- Laita painosi volyymille, ei imageen, ellet koskaan vaihda mallia.
- Odota 10–30 sekunnin cold startteja ja suunnittele niiden ympärille.
- Alle ~47 000 pyyntöä vuorokaudessa: nollaan skaalaus voittaa kustannuksissa.
- Endpointin takana oleva päättelymoottori on vaihdettavissa;
base_urlon yksi rivi.
Sinulla on kutsuttava endpoint. Seuraavaksi: mitä sen edessä on, kun tarvitset reititystä ja failoveria? LLM-gateway-vertailumme vastaa siihen. Tai käy setupisi läpi kanssamme.