
Distribuer en LLM på serverless GPU: 5 plattformer, ekte priser, ærlige kaldstarter
RunPod tar $2.72/time for en A100 80GB. Endepunktet ditt får tolv forespørsler før lunsj. GPU-en står ubrukt de andre 23 timene og fakturerer hele veien. Distribuer en LLM på serverless GPU, så betaler du bare mens en forespørsel kjører. Fem plattformer gjør dette. De fakturerer i fem forskjellige enheter. Ingen normaliserer dem.
En ubrukt GPU koster nøyaktig like mye som en opptatt.
Nøkkelpunkter
- Serverless GPU fakturerer bare mens en forespørsel kjører, og skalerer til null mellom dem.
- Én GPU per instans på Cloud Run; 70B-modeller trenger flere GPU-er, så serverless kan vanligvis ikke huse dem.
- Modellvekter ligger i imaget, på et nettverksvolum, eller lastes ned på nytt ved hver kaldstart.
- Kaldstart er tre ting: kontainer-oppstart, vekter-lasting, motor-init. Bare den første er rask.
- Under rundt 47 000 forespørsler om dagen slår skalering-til-null en leid 24/7-GPU.
Hva betyr «serverless GPU» egentlig for en LLM?
En serverless GPU-plattform kjører inferens-kontaineren din på delt GPU-maskinvare, spinner den opp når en forespørsel kommer inn, og skalerer til null når trafikken stopper. Du betaler per sekund (eller per minutt, eller per time, avhengig av leverandøren) bare mens kontaineren lever. Ingen ubrukt-regning. Ingen reservert instans.
Faktureringsenheten varierer mellom leverandører, og derfor normaliserer neste seksjon alt til $/GPU-time.
To begrensninger overrasker folk. For det første tillater Google Cloud Run én GPU per instans, maksimalt. Det setter VRAM-taket ditt til ett enkelt kort. For det andre betyr ikke «serverless» vedvarende tilstand. Det finnes ingen langlevd prosess som holder vektene dine i RAM mellom forespørslene. Når kontaineren dør, dør alt i minnet med den. Det ene faktumet driver lagringsbeslutningen i modellvekter-seksjonen nedenfor.
Serverless betyr ikke ingen server. Det betyr ingen server mellom forespørslene dine, og det er nøyaktig dit modellvektene dine forsvinner.
Hvilken serverless GPU-plattform bør du velge? (2026-priser, side om side)
Vi selger ingen av disse plattformene og tar ingen affiliate-inntekter fra noen. Av de syv artiklene som konkurrerer om dette søket og nære varianter, er fire publisert av et selskap som selger serverless GPU. Denne tabellen er ikke det.
Alle priser er lest fra leverandørenes egne prissider 2026-07-30. Priser endres; sjekk på nytt før du binder deg.
| Plattform | Publisert enhet (deres ord) | $/GPU-time (A100 80GB) | $/GPU-time (H100) | Gratis kreditter | Velg denne hvis... |
|---|---|---|---|---|---|
| Modal | $0.000694/s | $2.50 | $3.95 | $30/mnd Starter | du vil ha per-sekund fakturering, raske bygg og GPU-snapshots |
| RunPod | $2.72/time | $2.72 | $4.55 | ingen publisert | du vil ha den bredeste GPU-menyen til faste timepriser |
| Beam | $0.000625/s | $2.25 | $3.55 | $30/mnd | du vil ha null fakturering for oppstart og image-lasting |
| Baseten | $0.06667/min | $4.00 | $6.50 | ja, beløp ikke publisert | du vil ha forvaltet inferens med aktiv-beregning-fakturering |
| Cloud Run | per sekund (L4 og RTX PRO 6000 Blackwell; ingen A100/H100) | ikke publisert (ingen A100) | ikke publisert (ingen H100) | $300 GCP-kreditt | du allerede er på GCP og trenger EU/US-regionkontroll |
Normaliseringsregnestykket, vist én gang så du kan revidere det: Modal A100 80GB til $0.000694/s ganget med 3600 sekunder blir $2.4984/time. Beam: $0.000625 ganger 3600 blir $2.25/time. Baseten: $0.06667/min ganger 60 blir $4.00/time. Det 1,8x spriket mellom Beam og Baseten for samme A100 er reelt, og det gjemmer seg rett foran øynene på alle fordi ingen publiserer samme enhet.
Tre forbehold. Beams prisside sier eksplisitt at de ikke fakturerer for server-oppstart eller kontainer-image-lasting. Basetens pris-FAQ svarer på «Do I pay for idle time on Baseten?» med «No, you do not pay for idle time», og legger så til at fakturerbar tid er «the time your model is actively deploying, scaling up or down, or making predictions», så måleren dekker mer enn prediksjonstid, og det er delen det er verdt å budsjettere for. RunPod publiserer timepriser og ingen kaldstart-tall på prissiden sin.
Hvis Modal er valget ditt, har vi skrevet den fulle Modal-gjennomgangen separat.
Får modellen din plass i det hele tatt? VRAM, ett-GPU-grenser og kvote
Kan du kjøre en 70B-modell på en serverless GPU? Vanligvis ikke. På FP16 trenger 70B ~140 GB VRAM. Cloud Run stopper på én GPU per instans (96 GB maks på RTX PRO 6000). Regnestykket går ikke opp uten kvantisering (FP8/GGUF) eller en fler-GPU-plattform.
| GPU | VRAM | Min CPU / minne | Typisk modell-tak |
|---|---|---|---|
| L4 | 24 GB | 4 CPU / 16 GiB | 7B-13B (FP16), opptil 30B kvantisert |
| A100 80GB | 80 GB | varierer per plattform | 30B-70B kvantisert |
| H100 80GB | 80 GB | varierer per plattform | 30B-70B kvantisert |
| RTX PRO 6000 Blackwell | 96 GB | 20 CPU / 80 GiB | 70B på FP8 |
Cloud Runs standardkvote er 3 L4 GPU-er per region per prosjekt (RTX PRO 6000 gis separat, som 3 000 milliGPU), fordelt på seks L4-regioner: asia-southeast1, asia-south1, europe-west1, europe-west4, us-central1, us-east4. Det er Cloud Run-halvparten av datasuverenitet-svaret for alle som spør om serverless GPU i Europa; Modal og RunPod dokumenterer sine egne EU-regioner, og FAQ-en har resten.
Ismaili Simbas Cloud Run-gjennomgang på dev.to (april 2025) rapporterer at kvoteforespørselen «can take some time (up to 5 working days) to be approved», og at «the L4 GPUs available on Cloud Run have a limit of 16GB RAM». Planlegg for den forsinkelsen.
For VRAM-dimensjonering modell for modell, se vår VRAM-krav-guide.
Hvor ligger modellvektene dine (og hva koster det)?
En Reddit-tråd fra november 2024 som fortsatt lå på #5 på Google for nøyaktig dette søket da vi sjekket 2026-07-30, spør ordrett:
«I have been unable to find rate for storing the 80 gb model… What's an alternative if I don't want to download the model at every api calls (pod provisioned at call then closed)? … Why do these platforms not list model storage cost?»
Tre svar med lav poengsum, ingen av dem et svar. Da vi kjørte dette søket 2026-07-30, inkluderte topp ti-resultatene fortsatt den to år gamle tråden som spurte hva modelllagring koster. Ingen i tråden svarte på det. Begge plattformene publiserer prisen. På Modal er den $0.09 per GiB per måned med den første TiB gratis, så det 80 GB sjekkpunktet faktureres $0.00. På RunPod er den $0.07 per GB per måned for nettverkslagring under 1 TB, som setter samme sjekkpunkt til rundt $5.60 i måneden.
| Plassering | Kaldstart-påvirkning | Hva det koster | Bygg om for å bytte modell? | Best for |
|---|---|---|---|---|
| Bakt inn i kontainer-image | Raskest oppstart | Image-størrelse svulmer (27B FP8 = titalls GB) | Ja, full ombygging | Enkeltmodell-endepunkter |
| Vedvarende nettverksvolum | Raskt (bufret på vert) | Modal $0.09/GiB/mnd, 1 TiB gratis; RunPod $0.07/GB/mnd under 1 TB | Nei, bytt stien | Flere modeller eller hyppige bytter |
| Trukket fra Hugging Face ved oppstart | Tregest: 26s+ for 130 GB på 5 GB/s | Gratis (HF-båndbredde) | Nei | Bare prototyping |
Den tredje raden er feilmodusen. En 2024 TU München-gjennomgang av ServerlessLLM (arXiv 2411.15664) rapporterer at LLaMA-2-70B (130 GB) trenger 26+ sekunder å trekke på 5 GB/s, pluss ~84 sekunder å laste på 8 GPU-er, mot ~100 ms tokengenerering. Disse tallene er sitert i den gjennomgangen, ikke målt av den.
RunPods prisside har en Storage-seksjon: kontainer-disk $0.10/GB/mnd, volum-disk $0.10/GB/mnd kjørende og $0.20/GB/mnd ubrukt, nettverkslagring $0.07/GB/mnd under 1 TB og $0.05/GB/mnd over det, høy-ytelse nettverkslagring $0.14/GB/mnd. Tallet finnes. Det sitter bare ikke ved siden av per-GPU serverless-prisene en leser sammenligner når spørsmålet melder seg, og heller ikke i endepunkt-konfigurasjonsflyten. Et synlighetsproblem, ikke et hemmelighold-problem, og nok til å holde spørsmålet i live to år senere.
# Point the Hugging Face cache at a mounted network volume
# so weights persist across cold starts (RunPod / Modal pattern)
export HF_HOME=/workspace/hf-cache
export TRANSFORMERS_CACHE=/workspace/hf-cache
export HF_HUB_ENABLE_HF_TRANSFER=1# Alternative: bake weights into the image at build time
FROM vllm/vllm-openai:latest
COPY ./model-weights /models/qwen3-27b-fp8
ENV MODEL_NAME=/models/qwen3-27b-fp8
# Downside: 30+ GB image, full rebuild to change modelsHvis du ikke har valgt modell ennå, dimensjonerer vår 2026-oppsummering av åpne vekter hvert alternativ for distribusjon.
Distribuer den: vLLM på RunPod Serverless, ende til ende
Seks steg fra null til et kallbart endepunkt. Verifiser hvert steg mot RunPods vLLM-prosedyre (oppdatert 22. juni 2026), som ikke publiserer priser.
-
Velg modellen din. Velg en åpen-vekter-modell dimensjonert for GPU-en din (se VRAM-tabellen over). Hvis den er portbeskyttet på Hugging Face, generer en tilgangstoken først.
-
Opprett serverless-endepunktet. I RunPods konsoll, velg Serverless, plukk vLLM-arbeidermalen, og velg GPU-nivået ditt.
-
Sett miljøvariablene som betyr noe.
MODEL_NAME=Qwen/Qwen3.6-27B-FP8
MAX_MODEL_LEN=32768
GPU_MEMORY_UTILIZATION=0.90
DTYPE=autoFeil MODEL_NAME betyr en 404 ved oppstart. MAX_MODEL_LEN satt for høyt for VRAM-en din betyr OOM før første token. GPU_MEMORY_UTILIZATION over 0.95 etterlater ingen margin for KV-cache-topper.
-
Sett min/maks-arbeidere og ubrukt-timeout. Min-arbeidere på 0 gir deg skalering-til-null (og kaldstarter). Min-arbeidere på 1 dreper kaldstarter, men fakturerer kontinuerlig. Kaldstart-seksjonen nedenfor går gjennom den avveiningen.
-
Koble til nettverksvolumet du bestemte deg for i modellvekter-seksjonen, eller godta image-bake-stien. Hvis du hopper over dette, laster hver kaldstart sjekkpunktet på nytt.
-
Fyr av den første forespørselen. Les endepunkt-ID-en fra konsollen og bekreft at tokens kommer tilbake.
curl -X POST "https://api.runpod.ai/v2/${ENDPOINT_ID}/runsync" \
-H "Authorization: Bearer ${RUNPOD_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"input": {
"messages": [{"role": "user", "content": "Explain cold starts in one sentence."}],
"max_tokens": 60
}
}'Hvis du veier selve serveringsmotoren, sammenlignet vi vLLM og SGLang på gjennomstrømming og latens.
Hvordan kaller du endepunktet fra appen din?
Hver plattform på kortlisten snakker et OpenAI-kompatibelt API. Én Python-snutt fungerer overalt. Å bytte leverandør er en base_url-endring, ikke en omskriving. Det reframer «hvilken leverandør» fra en lock-in-beslutning til en konfigurasjonsbeslutning.
import os
from openai import OpenAI
ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]
client = OpenAI(
base_url=f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
api_key=os.environ["RUNPOD_API_KEY"],
)
response = client.chat.completions.create(
model="Qwen/Qwen3.6-27B-FP8",
messages=[{"role": "user", "content": "What is scale to zero?"}],
max_tokens=120,
)
print(response.choices[0].message.content)# Same code, different provider. One line changes.
ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]
PROVIDERS = {
"runpod": f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
"modal": "https://your-app--your-func.modal.run/v1",
"beam": "https://your-beam-endpoint/v1",
}
client = OpenAI(base_url=PROVIDERS["modal"], api_key="your-key")Hvis hver leverandør snakker OpenAI-dialekten, slutter «hvilken serverless GPU-leverandør» å være en arkitekturbeslutning og blir én linje med konfigurasjon.
Når du har flere endepunkter, dekker vår LLM-gateway-sammenligning ruting og failover. For et lettere oppsett legger en LiteLLM-proxy til nye forsøk og logging.
Hvilken kaldstart får du faktisk?
For en 7B-modell på serverless GPU, forvent 10 til 30 sekunder på en ekte kaldstart (kontainer-oppstart pluss vekter-lasting pluss motor-init), basert på utøverrapporter. Leverandørdokumentasjon siterer 1 til 5 sekunder for bare kontainer-oppstarten. Gapet mellom de tallene er sjekkpunktet ditt som krysser et nettverk.
RunPods produktside hevder sub-200ms FlashBoot-kaldstarter (en leverandør-påstand, ikke en måling). En utøver i r/LLMDevs rapporterer: «cold starts in my experience aren't great … I would say ~ 10 - 30 s», og legger til «most of my experience revolves around diffusion models though.» Begge er sanne. De måler forskjellige ting.
Kaldstart-tallet er tre tall stablet:
-
Kontainer-oppstart. Modals dokumentasjon: «Containers boot in about one second.» Cloud Run: instanser med drivere forhåndsinstallert «start in approximately 5 seconds.»
-
Vekter-lasting. Delen ingen reklamerer for. En 2024 TU München-gjennomgang av ServerlessLLM (arXiv 2411.15664) setter LLaMA-2-70B til 26+ sekunder å trekke pluss ~84 sekunder å laste på 8 GPU-er.
-
Motor-init. vLLM graf-fangst og oppvarming. Logesh Umapathi målte Qwen3.6-27B-FP8 på en A100-80GB fra 460s baseline til 219s med eager mode til ~70s med vLLM sleep mode pluss Modal GPU-snapshots. Det er 6,5x, publisert 17. mai 2026.
| Kilde | Hva som ble målt | Tall | Dato | Type |
|---|---|---|---|---|
| Modal-dokumentasjon | Kontainer-oppstart | ~1s | nåværende | Leverandørdokumentasjon |
| Cloud Run-dokumentasjon | Instans-start (drivere forhåndsinstallert) | ~5s | nåværende | Leverandørdokumentasjon |
| Umapathi | Qwen3.6-27B-FP8, A100-80GB, full kaldstart | 460s til 219s til ~70s | mai 2026 | Uavhengig måling |
| TU München-gjennomgang av ServerlessLLM (arXiv 2411.15664) | LLaMA-2-70B trekk + lasting, tall sitert ikke målt | 26s trekk + 84s lasting | 2024 | arXiv-forhåndstrykk (gjennomgang) |
| r/LLMDevs-utøver | 7B på RunPod, full forespørsel | ~10-30s | des 2024 | Anekdotisk (diffusjon-forbehold) |
Vår tolkning av publiserte data: leverandørtall måler kontaineren. Utøvertall måler hele forespørselen. Mellom de to stoppeklokkene sitter 80 GB med vekter som krysser et nettverk. Type-kolonnen er poenget.
Hva du bør gjøre: vLLM sleep mode, GPU-snapshots, og tuning av nedskaleringsvinduet. Modals standard ubrukt-tid er 60 sekunder (konfigurerbar 2s-20min). En varm arbeider dreper kaldstarter, men fakturerer som alltid-på.
# Modal scaledown config (illustrative)
# A 60s window means you pay for 60 idle seconds per burst.
# A warm worker (min_containers=1) costs ~$2.50/hr on A100 80GB, 24/7.
@app.function(
gpu="A100",
scaledown_window=60, # seconds idle before shutdown
# min_containers=1, # uncomment to kill cold starts; costs $60/day
)Er serverless GPU billigere enn en alltid-på GPU?
Serverless GPU er billigere når GPU-en din står ubrukt mesteparten av dagen. På 3 000 forespørsler/dag med gjennomsnitt 2 sekunder hver på en A100 80GB, koster serverless rundt $4.17/dag mot $65.28/dag for en leid GPU som kjører 24/7. Krysset er et driftssyklus-spørsmål, ikke et volumspørsmål.
Antagelser (våre, oppgitt så du kan kjøre dem på nytt): A100 80GB til Modals $2.50/time, 2 sekunder gjennomsnittlig GPU-tid per forespørsel, leid GPU til RunPods $2.72/time døgnet rundt, hostet token-API til $0.40/1M tokens (en mellomklasse publisert pris), og ~1 000 tokens per forespørsel.
| Forespørsler/dag | Serverless (est.) | Leid 24/7 GPU | Hostet token-API | Billigst |
|---|---|---|---|---|
| 500 | $0.69 | $65.28 | $0.20 | Token-API |
| 3,000 | $4.17 | $65.28 | $1.20 | Token-API |
| 10,000 | $13.89 | $65.28 | $4.00 | Token-API |
| 50,000 | $69.44 | $65.28 | $20.00 | Token-API |
| 200,000 | $277.78 | $65.28 | $80.00 | Leid GPU |
Krysset lander rundt 47 000 forespørsler/dag. Under det vinner serverless. Et hostet token-API slår begge ved lavt volum med en varemodell. Break-even handler ikke om hvor mange forespørsler du får. Det handler om hvor mange timer GPU-en din bruker på å gjøre ingenting.
BentoMLs august 2024-analyse rammer denne avveiningen godt, selv om priseksemplene dens er fra GPT-3.5-turbo-æraen og to år utdatert.
For hva et hostet token-API koster på volumet ditt, se vår LLM-API-prissammenligning. For å kutte kostnad per forespørsel på inferenssiden, sparer prompt-bufring typisk 30-60% på gjentatt kontekst.
# Break-even calculator: adjust these and re-run
REQUESTS_PER_DAY = 3000
SECONDS_PER_REQUEST = 2
SERVERLESS_RATE_HR = 2.50 # Modal A100 80GB
RENTED_RATE_HR = 2.72 # RunPod A100 80GB, 24/7
serverless_daily = REQUESTS_PER_DAY * SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR
rented_daily = RENTED_RATE_HR * 24
print(f"Serverless: ${serverless_daily:.2f}/day")
print(f"Rented 24/7: ${rented_daily:.2f}/day")
print(f"Crossover: {int(RENTED_RATE_HR * 24 / (SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR))} req/day")Når serverless GPU er feil valg
- Vedvarende høy trafikk. Over ~47 000 forespørsler/dag på disse prisene, snur driftssyklusen og en leid GPU er billigere per forespørsel.
- Harde sub-sekund SLO-er på en kald sti. Ingen snapshot-triks gjør en første forespørsel umiddelbar. Hold en varm arbeider eller lei boksen.
- 70B+ modeller som trenger flere GPU-er. Én GPU per instans på Cloud Run avslutter den samtalen.
- Streng datasuverenitet. Seks L4-regioner er hele menyen på Cloud Run.
- Per-forespørsel-økonomi som taper mot en arbeiderplass du allerede betaler for. Hvis du har ledig GPU-margin, koster det ingenting ekstra å legge til inferens.
Hvis GPU-en din er opptatt seksten timer om dagen, er serverless det dyre alternativet, og alle som sier noe annet selger serverless.
For den lokale-først-stien, se vår lokale LLM-verktøyguide.
Om forfatteren
Mert Batur er medgrunnlegger av Techsy.io, der teamet leverer AI-agenter, automatiseringssystemer og stemme/SDR-pipelines for B2B-kunder. Han skriver om LLM-verktøystacken Techsy-teamet faktisk bruker i produksjon. Koble til på LinkedIn.
Ofte stilte spørsmål
Hva er en serverless GPU?
En serverless GPU-plattform kjører modellkontaineren din på delt maskinvare, skalerer til null mellom forespørsler, og fakturerer bare for aktiv beregning. Du får et inferens-endepunkt uten å forvalte en vedvarende GPU-instans. Avveiningen er en kaldstart-forsinkelse ved oppstart.
Hvor mye koster det å kjøre en LLM på en serverless GPU?
En A100 80GB kjører $2.25/time på Beam, $2.50/time på Modal, $2.72/time på RunPod (verifisert 2026-07-30). Regningen din avhenger av driftssyklusen: 3 000 forespørsler/dag på 2s hver koster ~$4/dag på Modal. Lagring legger til $0.09/GiB/måned, med 1 TiB gratis.
Betaler jeg for å lagre modellvektene?
Ja, men det er billig. Modal tar $0.09/GiB/måned med 1 TiB/måned gratis, så et 80 GB sjekkpunkt koster ingenting. RunPods prisside lister nettverkslagring til $0.07/GB/måned under 1 TB, rundt $5.60/måned for de samme 80 GB.
Lastes modellen min på nytt for hver forespørsel?
Bare hvis ingenting er bufret. Vekter på et vedvarende volum eller bakt inn i imaget overlever kaldstarter. Pek Hugging Face-cachen mot flyktig lagring, og en 130 GB modell lastes på nytt ved hver oppstart. Det er feilmodusen du bør unngå.
Hvor lang er kaldstarten for en 7B-modell?
Forvent 10-30 sekunder på en ekte kaldstart, ifølge utøverrapporter (r/LLMDevs, des 2024). Kontaineren starter på 1-5s (Modal, Cloud Run-dokumentasjon). Resten er vekter-lasting og motor-init. Med snapshots og sleep mode målte Umapathi ~70s for en 27B-modell, ned fra 460s.
Kan jeg kjøre en 70B-modell på serverless GPU?
Vanligvis ikke. En 70B-modell på FP16 trenger ~140 GB VRAM. Cloud Run tillater én GPU per instans (96 GB maks). Du trenger FP8-kvantisering for å få plass på ett enkelt 80 GB kort, eller en fler-GPU-plattform. De fleste serverless-flater stopper på én GPU.
Er serverless GPU billigere enn å leie en GPU 24/7?
Under ~47 000 forespørsler/dag (på 2s/forespørsel på en A100 80GB), ja. Serverless fakturerer bare aktive sekunder; en leid GPU fakturerer 24 timer uansett. Over det vinner den leidde GPU-en. Et hostet token-API slår begge ved lavt volum. Se break-even-tabellen over.
Kan jeg distribuere en LLM på serverless GPU gratis?
Modal gir $30/måned gratis kreditter (Starter). Beam gir $30/måned. GCPs $300 nykonto-kreditt dekker Cloud Run GPU-bruk. Nok til å prototyppe, ikke til å kjøre produksjonstrafikk. Ingen plattform tilbyr et permanent gratisnivå for GPU-inferens.
Hvilke serverless GPU-leverandører er tilgjengelige i Europa?
Cloud Run serverer L4 GPU-er i europe-west1 (Belgia) og europe-west4 (Nederland). Modal dokumenterer EU-regionvalg (eu-west, eu-north, eu-south) priset til 1,5-1,75x basispriser. RunPod navngir europeiske datasentre inkludert EU-NL-1 og EU-FR-1. Fest regionen eksplisitt; ingen av dem har EU som standard.
Trenger jeg Docker for å distribuere en LLM på serverless GPU?
Ikke alltid. RunPod tilbyr forhåndsbygde vLLM-arbeidermaler som hopper over Docker. Modal bygger kontainere fra en Python-image-definisjon i kode. For egendefinerte avhengigheter skriver du en Dockerfile. For standard vLLM-servering fungerer den forhåndsbygde stien på minutter.
Konklusjon
Fem plattformer, fem faktureringsenheter, én normalisert tabell. Beslutningen er enklere enn leverandørsidene får det til å se ut:
- Velg GPU etter VRAM, ikke etter merke.
- Legg vektene dine på et volum, ikke i imaget, med mindre du aldri bytter modeller.
- Forvent 10-30 sekunders kaldstarter og planlegg rundt dem.
- Under ~47 000 forespørsler/dag vinner skalering-til-null på kostnad.
- Serveringsmotoren bak endepunktet er utskiftbar;
base_urler én linje.
Du har et kallbart endepunkt. Neste: hva sitter foran det når du trenger ruting og failover? Vår LLM-gateway-sammenligning svarer på det. Eller snakk gjennom oppsettet ditt med oss.