Kostnadskalkulator for KI-integrasjon

Utviklingskostnad og månedlig driftskostnad; hele regnestykket.

Å integrere KI i eksisterende programvare koster 15 000–250 000 $ å utvikle, pluss 500–50 000 $+/måned i løpende kostnader til API og infrastruktur. Det som overrasker flest team: tokenforbruket når volumet vokser. En mellomstor SaaS som lanserer en KI-funksjon for 10 000 aktive brukere betaler typisk 3 000–12 000 $/måned bare i API-kostnader til modellen.

Åpne kalkulatoren

Dine forutsetninger

05 fields

Påvirker den blandede timeraten; seniorutviklere koster 35 % mer.

Hvem bør bruke verktøyet

Gründere som skal avgrense et ai integration-prosjekt før de snakker med leverandører. CTO-er og teknologiledere som setter opp årsbudsjett for nytt produktarbeid. Produktledere som skal gjøre en énlinjes idé om til et spenn finansavdelingen kan stå inne for. Innkjøpsteam som vil kontrollregne tilbud fra byråer og konsulenter.

Slik beregner vi

Utviklingskostnaden er estimert ut fra antall timer. RAG, finjustering og agenter gir mer arkitektonisk kompleksitet og høyere multiplikatorer. Selvhosting legger til oppsett av infrastruktur og løpende MLOps-arbeid. De månedlige kostnadene vises separat, siden de avhenger av faktisk bruk.

Datakilder

Faktorer som påvirker tallet

Kompleksitet i bruksscenario

Klassifisering og oppsummering er de billigste KI-integrasjonene, fordi hver forespørsel består av én prompt og ett svar. RAG legger til gjenfinning, oppdeling av dokumenter, generering av embeddings og reranking, noe som omtrent dobler kompleksiteten i utviklingen. Agenter legger til løkker over flere steg med tilstandshåndtering, verktøykall og feilhåndtering, og dobler kompleksiteten enda en gang. Det samme bruksområdet, "KI-chatbot", kan bety alt fra en enkel prompt uten tilstand til 20 000 $, til en agent til 150 000 $, avhengig av hva den faktisk gjør.

Valg av modell

Claude Opus 4 og GPT-4.5 er de dyreste modellene per token, men også de mest kapable på tung resonnering. Claude Sonnet 4 og GPT-4o treffer det optimale punktet mellom kostnad og kvalitet i produksjon: rundt 1/10 av prisen på frontmodellene, med 90 til 95 % av kvaliteten på de fleste oppgaver. Modeller med åpen kildekode som Llama 3.1 405B og Mistral Large fjerner per-token-kostnaden helt, men krever GPU-infrastruktur og MLOps-kompetanse for å kjøre stabilt.

Prompt caching

Både Anthropic og OpenAI støtter prompt caching, som kutter kostnaden på mellomlagrede input-tokens med rundt 90 %. Hvis systemprompten din er 2K tokens eller større og holder seg stabil mellom forespørsler, tjener du inn caching i løpet av en dag. Anthropics 5-minutters cache er gratis; 1-times-cachen koster 25 % ekstra. De største gevinstene ligger i RAG-systemer med stabil gjenfinningskontekst og chatboter med lange personaprompter. De fleste team glemmer å slå det på, og det er en av de vanligste måtene å la penger ligge igjen på bordet i KI-produksjon.

Bruk av Batch API

Både OpenAI og Anthropic tilbyr Batch API-endepunkter som koster nøyaktig 50 % av standardprisen, i bytte mot en SLA på 24 timer. Klassifisering, oppsummering, generering av embeddings, evalueringskjøringer og alle slags bakgrunnsjobber bør gå via batch som standard. Sanntidschat og interaktive grensesnitt kan det ikke. Batch er en av de enkleste kostnadskuttene, for det krever ingen endring i arkitekturen, bare et annet API-endepunkt og en kø som venter på resultatene.

Avveiningen ved selvhosting

Å selvhoste Llama, Mistral eller Qwen på egne GPU-er fjerner per-token-kostnaden, men legger til 2 000–20 000 $ i måneden i GPU-infrastruktur, pluss 20 til 40 timer i måneden med MLOps-arbeid for å holde inferensstacken i gang. Balansepunktet mot driftede API-er ligger rundt 10M tokens i måneden ved kvalitet på nivå med GPT-4o. Under den terskelen vinner driftede API-er på alle punkter. Over den kan selvhosting kutte kostnadene 50 til 70 %, men bare hvis du har infrastrukturkompetansen til å drifte det selv.

Slik reduserer du kostnaden

Slå på prompt caching før du optimaliserer noe annet. Både Anthropic og OpenAI lar deg mellomlagre de stabile delene av inputen (systemprompt, gjenfunnet kontekst, verktøydefinisjoner) for rundt 90 % rabatt på de mellomlagrede tokenene. Anthropics 5-minutters cache er gratis, mens 1-times-cachen koster 25 % ekstra. For enhver chatbot eller ethvert RAG-system med en stabil systemprompt over 2K tokens tjener caching seg inn allerede timer etter lansering. De fleste team glemmer å slå det på og betaler 5 til 10 ganger for mye i månedsvis.

Flytt alt som ikke trenger å skje i sanntid over til Batch API. Klassifisering, oppsummering, generering av embeddings, evalueringskjøringer og prosessering over natten er alle gode kandidater. Batch koster nøyaktig 50 % av standardprisen i bytte mot en SLA på 24 timer, og integrasjonsarbeidet er minimalt: samme modell, samme prompt, bare et annet endepunkt. Mange team kjører hele pipelinen for innholdsmoderering eller dokumentmerking til standardpris, når batch ville halvert regningen uten noen forskjell i kvalitet.

Rut forespørslene etter vanskelighetsgrad. Send enkle spørringer (hilsener, enkle oppslag, formateringsoppgaver) til Claude Haiku eller GPT-4o mini til 0,15–0,80 $ per million input-tokens. Reserver Claude Opus eller GPT-4.5 (til 15–75 $ per million) for tung resonnering som de billigere modellene faktisk ikke klarer. En enkel klassifiserer for vanskelighetsgrad foran modellruteren kutter typisk kostnadene 60 til 80 % på blandede arbeidslaster. De fleste team sender alt til en frontmodell, og det er litt som å ta drosje til postkassen.

Sett en stram grense på max_tokens. Output-tokens koster 3 til 5 ganger mer enn input-tokens, og de fleste svar trenger ikke output-bufferen på 4K tokens som API-et tillater som standard. Henter du ut et ja- eller nei-svar, sett grensen til 10 tokens. Genererer du en kort oppsummering, sett den til 200. Modellen vil av og til forklare resonnementet sitt selv om du ikke ba om det, og du betaler for de forklaringene. Bare det å stramme inn max_tokens kutter ofte output-kostnadene 30 til 50 %.

Mellomlagre deterministiske svar på applikasjonsnivå. Når samme input alltid gir samme output (kategorisering, faste oppslag, kodeoversettelse), lagre resultatet i Redis eller en database og lever det fra cache ved gjentatte forespørsler. Caching på applikasjonsnivå oppå caching på API-nivå kan kutte det totale LLM-forbruket med ytterligere 30 til 50 % på arbeidslaster med mange like forespørsler. Det klassiske eksempelet er produktkategorisering i e-handelsskala, der samme SKU kategoriseres hundrevis av ganger helt unødvendig.

Sett opp token-overvåking fra dag én. Du kan ikke optimalisere det du ikke måler, og KI-kostnader vokser raskt nok til at en feilkonfigurert prompt eller en løpsk løkke kan gi en regning på 10 000 $ i løpet av en helg. Logg input-tokens, output-tokens, hvilken modell som ble brukt, og om forespørselen traff cachen eller ikke. Sett opp daglige forbruksvarsler. De fleste budsjettsprekkene vi ser i produksjon skjer fordi ingen oppdaget et skifte i bruksmønsteret før fakturaen kom to uker senere.

Månedlig API-kostnad ved 10M tokens

Leverandør / modellInput-kostnadOutput-kostnadTotalt (10M tokens, 30/70-fordeling)
OpenAI GPT-4o$2.50/M$10.00/M~$775/mo
OpenAI GPT-4.5$75.00/M$150.00/M~$11,250/mo
Anthropic Claude Opus 4$15.00/M (with caching)$75.00/M~$675/mo (cached) / ~$5,700/mo (uncached)
Anthropic Claude Sonnet 4$3.00/M$15.00/M~$1,140/mo
Google Gemini 2.5 Pro$1.25/M$10.00/M~$825/mo
Selvhostet Llama 3.1 405B$0/M (infra)$0/M (infra)~$4K/mo infra fixed

FAQ

Spørsmål vi får hver uke

Korte svar på vanlig norsk. Mangler spørsmålet ditt,

Utviklingskostnaden ligger på 15 000–250 000 $ avhengig av hvor komplekst bruksområdet er. Den månedlige driftskostnaden ligger på 500–50 000 $+, og domineres av API-tokenforbruket når volumet vokser.

På sammenlignbare kvalitetsnivåer er de omtrent like dyre. Anthropic Claude med prompt caching blir rundt 30 % billigere enn GPT-4o når systemprompten holder seg stabil mellom forespørsler. OpenAI er billigere på korte engangsforespørsler.

Utvikling: 40 000–120 000 $. Drift: 1 000–15 000 $/måned for vektordatabase, embeddings og LLM-tokens til sammen. Kostnaden vokser med dokumentmengde, søkevolum og hvor høy presisjon du krever.

Bare hvis (a) dataene ikke kan forlate din egen infrastruktur, (b) de månedlige API-regningene overstiger 5 000 $, eller (c) du trenger finjusterte modeller som ikke finnes via API. Ellers er driftede API-er billigere fra ende til ende.

Anthropic og OpenAI mellomlagrer store input-prompter mellom forespørsler. Mellomlagrede tokens koster rundt 90 % mindre. Lønner seg mest for chatboter med stabile systemprompter og RAG med stabil kontekst.

Ja, vanligvis i løpet av 2–6 måneder for kundeservice (saker som løses uten agent), innholdsproduksjon (raskere skriving) eller interne verktøy (raskere søk). Avkastningen avhenger av oppgaven du erstatter, ikke av teknologien i seg selv.

Slik regner du: gjennomsnittlig antall tokens per forespørsel × antall forespørsler per måned × kostnad per million tokens. Legg på 30 % sikkerhetsmargin for vekst i bruken, og følg forbruket daglig de tre første månedene.

Drift av vektordatabase, generering av embeddings, tid til prompt-engineering, infrastruktur for evaluering og innholdsmoderering. Til sammen legger dette lett 20–40 % oppå de rene API-kostnadene.

GPT-4o og Claude Sonnet 4 treffer 90–95 % nøyaktighet på de fleste forretningsoppgaver. RAG øker presisjonen på domenespesifikke spørsmål, og finjustering legger til ytterligere 5–10 %. Ingen KI er 100 % nøyaktig; planlegg for feiltilfellene.

OpenAI har det bredeste verktøyøkosystemet. Anthropic er best på lang kontekst og koding. Google Gemini integrerer best med Google Workspace, og åpen kildekode gir deg full kontroll. De fleste produksjonssystemer tjener på å rute forespørsler mellom flere leverandører.

Lignende verktøy

Andre kalkulatorer folk flest åpner rett etter denne; velg den som passer din neste beslutning.

Få et nøyaktig estimat fra teamet vårt

Kalkulatorer gir deg et spenn. En 30-minutters samtale gir deg fast omfang, tidsplan og budsjett. Gratis rådgivning, helt uforpliktende.

Start samtalen