
Udrul en LLM på serverless GPU: 5 platforme, reelle priser, ærlige kolde starter
RunPod tager $2,72/time for en A100 80GB. Dit endpoint får tolv requests inden frokost. Den GPU står stille de andre 23 timer og fakturerer hele vejen igennem. Udrul en LLM på serverless GPU, og du betaler kun, mens et request kører. Fem platforme gør det her. De fakturerer i fem forskellige enheder. Ingen normaliserer dem.
En inaktiv GPU koster præcis det samme som en travl.
Nøglepointer
- Serverless GPU fakturerer kun, mens et request kører, og skalerer til nul imellem dem.
- Én GPU per instans på Cloud Run; 70B-modeller kræver flere GPU'er, så serverless kan som regel ikke hoste dem.
- Modelvægte ligger i imaget, på en netværksvolume eller bliver downloadet igen ved hver kold start.
- En kold start er tre ting: container-boot, indlæsning af vægte, engine-init. Kun den første er hurtig.
- Under cirka 47.000 requests om dagen slår scale-to-zero en lejet 24/7-GPU.
Hvad betyder 'serverless GPU' egentlig for en LLM?
En serverless GPU-platform kører din inferens-container på delt GPU-hardware, starter den op, når der kommer et request, og skalerer til nul, når trafikken stopper. Du betaler per sekund (eller per minut eller per time, afhængigt af leverandøren), kun mens containeren kører. Ingen regning for inaktivitet. Ingen reserveret instans.
Faktureringsenheden varierer fra leverandør til leverandør, og derfor normaliserer næste afsnit alt til $/GPU-time.
To begrænsninger overrasker folk. For det første tillader Google Cloud Run maksimalt én GPU per instans. Det sætter loftet for din VRAM på ét kort. For det andet betyder 'serverless' ikke vedvarende state. Der er ingen langlivet proces, der holder dine vægte i RAM mellem requests. Når containeren dør, dør alt i hukommelsen med den. Den ene kendsgerning driver storage-beslutningen i afsnittet om modelvægte nedenfor.
Serverless betyder ikke ingen server. Det betyder ingen server mellem dine requests, og det er præcis dér, dine modelvægte forsvinder hen.
Hvilken serverless GPU-platform skal du vælge? (2026-priser, side om side)
Vi sælger ingen af disse platforme og får ingen affiliate-indtægter fra nogen af dem. Af de syv artikler, der konkurrerer om denne søgning og dens nære varianter, er fire udgivet af en virksomhed, der sælger serverless GPU. Det er denne tabel ikke.
Alle priser er læst fra leverandørernes egne prissider den 30. juli 2026. Priser ændrer sig; tjek igen, før du binder dig.
| Platform | Publiceret enhed (deres egne ord) | $/GPU-time (A100 80GB) | $/GPU-time (H100) | Gratis kreditter | Vælg denne, hvis... |
|---|---|---|---|---|---|
| Modal | $0,000694/s | $2,50 | $3,95 | $30/måned Starter | du vil have sekundbaseret fakturering, hurtige builds og GPU-snapshots |
| RunPod | $2,72/time | $2,72 | $4,55 | ingen publiceret | du vil have den bredeste GPU-menu til faste timepriser |
| Beam | $0,000625/s | $2,25 | $3,55 | $30/måned | du vil have nul fakturering for opstart og image-load |
| Baseten | $0,06667/min | $4,00 | $6,50 | ja, beløb ikke publiceret | du vil have managed inferens med fakturering for aktiv compute |
| Cloud Run | per sekund (L4 og RTX PRO 6000 Blackwell; ingen A100/H100) | ikke publiceret (ingen A100) | ikke publiceret (ingen H100) | $300 GCP-kredit | du allerede er på GCP og har brug for EU/US-regionskontrol |
Normaliseringsregnestykket, vist én gang så du kan efterprøve det: Modal A100 80GB til $0,000694/s ganget med 3600 sekunder giver $2,4984/time. Beam: $0,000625 gange 3600 giver $2,25/time. Baseten: $0,06667/min gange 60 giver $4,00/time. Den 1,8x spredning mellem Beam og Baseten for den samme A100 er reel, og den gemmer sig midt for øjnene af alle, fordi ingen publicerer den samme enhed.
Tre forbehold. Beams prisside siger udtrykkeligt, at de ikke fakturerer for serveropstart eller indlæsning af container-image. Basetens pris-FAQ besvarer "Do I pay for idle time on Baseten?" med "No, you do not pay for idle time" og tilføjer så, at fakturerbar tid er "the time your model is actively deploying, scaling up or down, or making predictions", så måleren dækker mere end ren prediction-tid, og det er den del, der er værd at budgettere med. RunPod publicerer timepriser og intet tal for kold start på deres prisside.
Hvis Modal er dit valg, har vi skrevet den fulde Modal-gennemgang separat.
Kan din model overhovedet være der? VRAM, én-GPU-grænser og kvoter
Kan du køre en 70B-model på en serverless GPU? Som regel ikke. I FP16 kræver 70B cirka 140 GB VRAM. Cloud Run har et loft på én GPU per instans (maks 96 GB på RTX PRO 6000). Regnestykket går ikke op uden kvantisering (FP8/GGUF) eller en multi-GPU-platform.
| GPU | VRAM | Min. CPU / hukommelse | Typisk model-loft |
|---|---|---|---|
| L4 | 24 GB | 4 CPU / 16 GiB | 7B-13B (FP16), op til 30B kvantiseret |
| A100 80GB | 80 GB | varierer per platform | 30B-70B kvantiseret |
| H100 80GB | 80 GB | varierer per platform | 30B-70B kvantiseret |
| RTX PRO 6000 Blackwell | 96 GB | 20 CPU / 80 GiB | 70B i FP8 |
Cloud Runs standardkvote er 3 L4-GPU'er per region per projekt (RTX PRO 6000 bevilges separat som 3.000 milliGPU) fordelt på seks L4-regioner: asia-southeast1, asia-south1, europe-west1, europe-west4, us-central1, us-east4. Det er Cloud Run-halvdelen af svaret om dataplacering for alle, der spørger til serverless GPU i Europa; Modal og RunPod dokumenterer deres egne EU-regioner, og FAQ'en har resten.
Ismaili Simbas Cloud Run-gennemgang på dev.to (april 2025) rapporterer, at kvoteanmodningen "can take some time (up to 5 working days) to be approved", og at "the L4 GPUs available on Cloud Run have a limit of 16GB RAM". Planlæg med den forsinkelse.
Til VRAM-dimensionering model for model, se vores VRAM-kravsguide.
Hvor ligger dine modelvægte (og hvad koster det)?
En Reddit-tråd fra november 2024, der stadig lå nummer 5 på Google for præcis denne søgning, da vi tjekkede den 30. juli 2026, spørger ordret:
"I have been unable to find rate for storing the 80 gb model… What's an alternative if I don't want to download the model at every api calls (pod provisioned at call then closed)? … Why do these platforms not list model storage cost?"
Tre svar med lav score, ingen af dem et svar. Da vi kørte denne søgning den 30. juli 2026, indeholdt top ti stadig den to år gamle tråd, der spørger, hvad modellagring koster. Ingen i tråden svarede på det. Begge platforme publicerer prisen. På Modal er den $0,09 per GiB per måned med den første TiB gratis, så det 80 GB checkpoint koster $0,00. På RunPod er den $0,07 per GB per måned for netværksstorage under 1 TB, hvilket sætter det samme checkpoint til cirka $5,60 om måneden.
| Placering | Effekt på kold start | Hvad det koster | Genbyg for at skifte model? | Bedst til |
|---|---|---|---|---|
| Bagt ind i container-imaget | Hurtigste boot | Image-størrelsen vokser (27B FP8 = titals GB) | Ja, fuld genbyg | Enkeltmodel-endpoints |
| Fast netværksvolume | Hurtig (cachet på hosten) | Modal $0,09/GiB/måned, 1 TiB gratis; RunPod $0,07/GB/måned under 1 TB | Nej, skift stien | Flere modeller eller hyppige skift |
| Hentet fra Hugging Face ved boot | Langsomst: 26 s+ for 130 GB ved 5 GB/s | Gratis (HF-båndbredde) | Nej | Kun prototyping |
Den tredje række er fejltilstanden. Et review fra 2024 af TU München om ServerlessLLM (arXiv 2411.15664) rapporterer, at LLaMA-2-70B (130 GB) kræver over 26 sekunder at hente ved 5 GB/s plus cirka 84 sekunder at indlæse på 8 GPU'er, mod cirka 100 ms tokengenerering. De tal er citeret i det review, ikke målt af det.
RunPods prisside har et Storage-afsnit: container-disk $0,10/GB/måned, volume-disk $0,10/GB/måned kørende og $0,20/GB/måned inaktiv, netværksstorage $0,07/GB/måned under 1 TB og $0,05/GB/måned over, højtydende netværksstorage $0,14/GB/måned. Tallet findes. Det står bare ikke ved siden af de serverless per-GPU-priser, en læser sammenligner, når spørgsmålet melder sig, og heller ikke i endpoint-konfigurationsflowet. Et problem med synlighed, ikke med hemmelighedskræmmeri, og nok til at holde spørgsmålet i live to år senere.
# Point the Hugging Face cache at a mounted network volume
# so weights persist across cold starts (RunPod / Modal pattern)
export HF_HOME=/workspace/hf-cache
export TRANSFORMERS_CACHE=/workspace/hf-cache
export HF_HUB_ENABLE_HF_TRANSFER=1# Alternative: bake weights into the image at build time
FROM vllm/vllm-openai:latest
COPY ./model-weights /models/qwen3-27b-fp8
ENV MODEL_NAME=/models/qwen3-27b-fp8
# Downside: 30+ GB image, full rebuild to change modelsHvis du ikke har valgt model endnu, dimensionerer vores 2026-oversigt over open-weights-modeller hver mulighed til udrulning.
Udrul det: vLLM på RunPod Serverless, ende til ende
Seks trin fra nul til et endpoint, du kan kalde. Efterprøv hvert trin mod RunPods vLLM-procedure (opdateret 22. juni 2026), som ikke publicerer priser.
-
Vælg din model. Vælg en open-weights-model, der passer til din GPU (se VRAM-tabellen ovenfor). Hvis den er gated på Hugging Face, skal du først generere en access token.
-
Opret serverless-endpointet. I RunPods konsol vælger du Serverless, vælger vLLM-worker-skabelonen og vælger dit GPU-niveau.
-
Sæt de miljøvariabler, der betyder noget.
MODEL_NAME=Qwen/Qwen3.6-27B-FP8
MAX_MODEL_LEN=32768
GPU_MEMORY_UTILIZATION=0.90
DTYPE=autoForkert MODEL_NAME giver en 404 ved boot. MAX_MODEL_LEN sat for højt i forhold til din VRAM giver OOM før den første token. GPU_MEMORY_UTILIZATION over 0,95 efterlader ingen luft til KV-cache-spikes.
-
Sæt min./maks. workers og idle-timeout. Min. workers på 0 giver dig scale-to-zero (og kolde starter). Min. workers på 1 dræber kolde starter, men fakturerer løbende. Afsnittet om kolde starter nedenfor går den trade-off igennem.
-
Tilknyt den netværksvolume, du valgte i afsnittet om modelvægte, eller acceptér image-bake-vejen. Hvis du springer det over, downloader hver kold start checkpointet igen.
-
Fyr det første request af. Læs endpoint-ID'et fra konsollen, og bekræft, at der kommer tokens tilbage.
curl -X POST "https://api.runpod.ai/v2/${ENDPOINT_ID}/runsync" \
-H "Authorization: Bearer ${RUNPOD_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"input": {
"messages": [{"role": "user", "content": "Explain cold starts in one sentence."}],
"max_tokens": 60
}
}'Hvis du vejer selve serving-enginen, sammenlignede vi vLLM og SGLang på throughput og latenstid.
Hvordan kalder du endpointet fra din app?
Alle platforme på shortlisten taler et OpenAI-kompatibelt API. Én Python-snippet virker overalt. At skifte leverandør er en ændring af base_url, ikke en omskrivning. Det gør "hvilken leverandør" fra en lock-in-beslutning til en konfigurationsbeslutning.
import os
from openai import OpenAI
ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]
client = OpenAI(
base_url=f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
api_key=os.environ["RUNPOD_API_KEY"],
)
response = client.chat.completions.create(
model="Qwen/Qwen3.6-27B-FP8",
messages=[{"role": "user", "content": "What is scale to zero?"}],
max_tokens=120,
)
print(response.choices[0].message.content)# Same code, different provider. One line changes.
ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]
PROVIDERS = {
"runpod": f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
"modal": "https://your-app--your-func.modal.run/v1",
"beam": "https://your-beam-endpoint/v1",
}
client = OpenAI(base_url=PROVIDERS["modal"], api_key="your-key")Hvis alle leverandører taler OpenAI's dialekt, holder "hvilken serverless GPU-leverandør" op med at være en arkitekturbeslutning og bliver én linjes konfiguration.
Når du har flere endpoints, dækker vores LLM-gateway-sammenligning routing og failover. Til et lettere setup tilføjer en LiteLLM-proxy retries og logning.
Hvilken kold start ser du i praksis?
For en 7B-model på serverless GPU skal du forvente 10 til 30 sekunder på en ægte kold start (container-boot plus indlæsning af vægte plus engine-init) baseret på rapporter fra praktikere. Leverandørernes dokumentation nævner 1 til 5 sekunder for selve container-booten. Gabet mellem de tal er dit checkpoint, der krydser et netværk.
RunPods produktside påstår FlashBoot kolde starter under 200 ms (et udsagn fra leverandøren, ikke en måling). En praktiker i r/LLMDevs rapporterer: "cold starts in my experience aren't great … I would say ~ 10 - 30 s" og tilføjer "most of my experience revolves around diffusion models though." Begge dele er sande. De måler forskellige ting.
Tallet for kold start er tre tal stablet oven på hinanden:
-
Container-boot. Modals dokumentation: "Containers boot in about one second." Cloud Run: instanser med præinstallerede drivere "start in approximately 5 seconds."
-
Indlæsning af vægte. Den del ingen reklamerer med. Et review fra 2024 af TU München om ServerlessLLM (arXiv 2411.15664) sætter LLaMA-2-70B til over 26 sekunder at hente plus cirka 84 sekunder at indlæse på 8 GPU'er.
-
Engine-init. vLLM graph capture og warm-up. Logesh Umapathi målte Qwen3.6-27B-FP8 på en A100-80GB fra 460 s baseline til 219 s med eager mode og til cirka 70 s med vLLM sleep mode plus Modal GPU-snapshots. Det er 6,5x, publiceret 17. maj 2026.
| Kilde | Hvad der blev målt | Tal | Dato | Type |
|---|---|---|---|---|
| Modals dokumentation | Container-boot | ~1 s | nuværende | Leverandørdokumentation |
| Cloud Run-dokumentation | Instansstart (drivere præinstalleret) | ~5 s | nuværende | Leverandørdokumentation |
| Umapathi | Qwen3.6-27B-FP8, A100-80GB, fuld kold start | 460 s til 219 s til ~70 s | maj 2026 | Uafhængig måling |
| TU München-review af ServerlessLLM (arXiv 2411.15664) | LLaMA-2-70B hent + indlæs, tal citeret ikke målt | 26 s hent + 84 s indlæs | 2024 | arXiv-preprint (review) |
| Praktiker fra r/LLMDevs | 7B på RunPod, fuldt request | ~10-30 s | dec. 2024 | Anecdote (diffusion-forbehold) |
Vores fortolkning af de publicerede data: leverandørtallene måler containeren. Praktiker-tallene måler hele requestet. Mellem de to stopure sidder 80 GB vægte, der krydser et netværk. Type-kolonnen er pointen.
Hvad du kan gøre: vLLM sleep mode, GPU-snapshots og tuning af scaledown-vinduet. Modals standard-idle er 60 sekunder (konfigurerbar 2 s-20 min). En varm worker dræber kolde starter, men fakturerer som altid-tændt.
# Modal scaledown config (illustrative)
# A 60s window means you pay for 60 idle seconds per burst.
# A warm worker (min_containers=1) costs ~$2.50/hr on A100 80GB, 24/7.
@app.function(
gpu="A100",
scaledown_window=60, # seconds idle before shutdown
# min_containers=1, # uncomment to kill cold starts; costs $60/day
)Er serverless GPU billigere end en altid-tændt GPU?
Serverless GPU er billigere, når din GPU står stille det meste af dagen. Ved 3.000 requests/dag med i gennemsnit 2 sekunder hver på en A100 80GB koster serverless cirka $4,17/dag mod $65,28/dag for en lejet GPU, der kører 24/7. Skæringspunktet er et spørgsmål om driftscyklus, ikke om volumen.
Antagelser (vores, angivet så du kan genberegne dem): A100 80GB til Modals $2,50/time, 2 sekunders gennemsnitlig GPU-tid per request, lejet GPU til RunPods $2,72/time døgnet rundt, hosted token-API til $0,40/1M tokens (en publiceret mellempris) og cirka 1.000 tokens per request.
| Requests/dag | Serverless (est.) | Lejet 24/7 GPU | Hosted token-API | Billigst |
|---|---|---|---|---|
| 500 | $0,69 | $65,28 | $0,20 | Token-API |
| 3.000 | $4,17 | $65,28 | $1,20 | Token-API |
| 10.000 | $13,89 | $65,28 | $4,00 | Token-API |
| 50.000 | $69,44 | $65,28 | $20,00 | Token-API |
| 200.000 | $277,78 | $65,28 | $80,00 | Lejet GPU |
Skæringspunktet lander omkring 47.000 requests/dag. Under det vinder serverless. Et hosted token-API slår begge dele ved lav volumen med en commodity-model. Break-even handler ikke om, hvor mange requests du får. Det handler om, hvor mange timer din GPU bruger på ingenting.
BentoML's analyse fra august 2024 indrammer denne trade-off godt, selvom deres priseksempler er fra GPT-3.5-turbo-æraen og to år gamle.
For hvad et hosted token-API koster ved din volumen, se vores LLM-API-prissammenligning. For at skære omkostningen per request på inferens-siden sparer prompt-caching typisk 30-60 % på gentaget kontekst.
# Break-even calculator: adjust these and re-run
REQUESTS_PER_DAY = 3000
SECONDS_PER_REQUEST = 2
SERVERLESS_RATE_HR = 2.50 # Modal A100 80GB
RENTED_RATE_HR = 2.72 # RunPod A100 80GB, 24/7
serverless_daily = REQUESTS_PER_DAY * SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR
rented_daily = RENTED_RATE_HR * 24
print(f"Serverless: ${serverless_daily:.2f}/day")
print(f"Rented 24/7: ${rented_daily:.2f}/day")
print(f"Crossover: {int(RENTED_RATE_HR * 24 / (SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR))} req/day")Hvornår serverless GPU er det forkerte valg
- Vedvarende høj trafik. Over cirka 47.000 requests/dag til disse priser vender driftscyklussen, og en lejet GPU er billigere per request.
- Hårde SLO'er under ét sekund på en kold sti. Intet snapshot-trick gør et første request øjeblikkeligt. Behold en varm worker, eller lej kassen.
- 70B+-modeller, der kræver flere GPU'er. Én GPU per instans på Cloud Run afslutter den samtale.
- Strikse krav om dataplacering. Seks L4-regioner er hele menuen på Cloud Run.
- Per-request-økonomi, der taber til en worker-plads, du allerede betaler for. Hvis du har ledig GPU-kapacitet, koster ekstra inferens intet.
Hvis din GPU er travl seksten timer i døgnet, er serverless den dyre løsning, og alle, der siger noget andet, sælger serverless.
Til local-first-vejen, se vores guide til lokale LLM-værktøjer.
Om forfatteren
Mert Batur er medstifter af Techsy.io, hvor teamet leverer AI-agenter, automatiseringssystemer og voice/SDR-pipelines til B2B-kunder. Han skriver om den LLM-værktøjsstack, Techsy-teamet faktisk bruger i produktion. Forbind på LinkedIn.
Ofte stillede spørgsmål
Hvad er en serverless GPU?
En serverless GPU-platform kører din model-container på delt hardware, skalerer til nul mellem requests og fakturerer kun for aktiv compute. Du får et inferens-endpoint uden at administrere en vedvarende GPU-instans. Til gengæld får du en kold-start-forsinkelse ved opstart.
Hvad koster det at køre en LLM på en serverless GPU?
En A100 80GB kører til $2,25/time på Beam, $2,50/time på Modal og $2,72/time på RunPod (verificeret 30. juli 2026). Din regning afhænger af driftscyklussen: 3.000 requests/dag à 2 s hver koster cirka $4/dag på Modal. Storage lægger $0,09/GiB/måned til, med 1 TiB gratis.
Betaler jeg for at lagre modelvægtene?
Ja, men det er billigt. Modal tager $0,09/GiB/måned med 1 TiB/måned gratis, så et 80 GB checkpoint koster ingenting. RunPods prisside sætter netværksstorage til $0,07/GB/måned under 1 TB, cirka $5,60/måned for de samme 80 GB.
Downloades min model igen ved hvert request?
Kun hvis intet er cachet. Vægte på en fast volume eller bagt ind i imaget overlever kolde starter. Peg Hugging Face-cachen på flygtig storage, og en 130 GB model downloades igen ved hver opstart. Det er fejltilstanden, du skal undgå.
Hvor lang er den kolde start for en 7B-model?
Forvent 10-30 sekunder på en ægte kold start ifølge rapporter fra praktikere (r/LLMDevs, dec. 2024). Containeren booter på 1-5 s (Modal, Cloud Run-dokumentation). Resten er indlæsning af vægte og engine-init. Med snapshots og sleep mode målte Umapathi cirka 70 s for en 27B-model, ned fra 460 s.
Kan jeg køre en 70B-model på serverless GPU?
Som regel ikke. En 70B-model i FP16 kræver cirka 140 GB VRAM. Cloud Run tillader én GPU per instans (maks 96 GB). Du skal bruge FP8-kvantisering for at kunne være på ét 80 GB-kort, eller en multi-GPU-platform. De fleste serverless-platforme har et loft på én GPU.
Er serverless GPU billigere end at leje en GPU 24/7?
Under cirka 47.000 requests/dag (ved 2 s/request på en A100 80GB), ja. Serverless fakturerer kun aktive sekunder; en lejet GPU fakturerer 24 timer uanset hvad. Over det vinder den lejede GPU. Et hosted token-API slår begge dele ved lav volumen. Se break-even-tabellen ovenfor.
Kan jeg udrulle en LLM på serverless GPU gratis?
Modal giver $30/måned i gratis kreditter (Starter). Beam giver $30/måned. GCP's $300-kredit til nye konti dækker Cloud Run GPU-brug. Nok til prototyping, ikke til produktionstrafik. Ingen platform tilbyder en permanent gratis tier til GPU-inferens.
Hvilke serverless GPU-leverandører er tilgængelige i Europa?
Cloud Run leverer L4-GPU'er i europe-west1 (Belgien) og europe-west4 (Holland). Modal dokumenterer EU-regionsvalg (eu-west, eu-north, eu-south) prissat til 1,5-1,75x basispriser. RunPod nævner europæiske datacentre, herunder EU-NL-1 og EU-FR-1. Fastlås regionen eksplicit; ingen af dem har EU som standard.
Har jeg brug for Docker til at udrulle en LLM på serverless GPU?
Ikke altid. RunPod tilbyder præbyggede vLLM-worker-skabeloner, der springer Docker over. Modal bygger containere fra en Python-image-definition i kode. Til egne dependencies skriver du en Dockerfile. Til standard vLLM-serving virker den præbyggede vej på minutter.
Konklusion
Fem platforme, fem faktureringsenheder, én normaliseret tabel. Beslutningen er enklere, end leverandørernes sider får det til at se ud:
- Vælg din GPU efter VRAM, ikke efter mærke.
- Læg dine vægte på en volume, ikke i imaget, medmindre du aldrig skifter model.
- Forvent kolde starter på 10-30 sekunder, og planlæg efter dem.
- Under cirka 47.000 requests/dag vinder scale-to-zero på omkostninger.
- Serving-enginen bag endpointet kan skiftes ud;
base_urler én linje.
Du har et endpoint, der kan kaldes. Næste spørgsmål: hvad sidder foran det, når du har brug for routing og failover? Vores LLM-gateway-sammenligning svarer på det. Eller tal med os om dit setup.