ai-machine-learning

Kimi K3-anmeldelse: Moonshots 2.8T åpne modell mot Fable 5 og GPT-5.6 Sol

Skrevet av Mert Batur
Jul 17, 2026
15 lesing
Kimi K3-anmeldelse: Moonshots 2.8T åpne modell mot Fable 5 og GPT-5.6 Sol

Kimi K3-anmeldelse: Moonshots 2.8T åpne modell mot Fable 5 og GPT-5.6 Sol

Sist verifisert: 17. juli 2026. Hver spesifikasjon, pris og benchmark under er dobbeltsjekket mot Moonshots plattformdokumentasjon, Artificial Analysis og uavhengig dekning samme dag som denne artikkelen ble publisert. Kimi K3 ble lansert 16. juli 2026.

I denne Kimi K3-anmeldelsen er det ett lanseringstall som sier alt: Moonshots nye modell debuterte som #1 på Arenas Frontend Code-rangering, et hopp på 17 plasser forbi Kimi K2.6, og rangert over Claude Fable 5. Det er en kinesisk åpen modell som vinner en frontend-kodekonkurranse dømt av ekte utviklere i blinde sammenligninger. Under panseret er det en Mixture-of-Experts-modell med 2.8 trillion parametere som bare aktiverer 16 av 896 eksperter per token, leser en million tokens kontekst, og priser input mellom $0.30 og $3.00 per million. Fangsten du bør kjenne til før du blir for ivrig: du kan ikke laste ned vektene ennå, og Moonshot sier det endrer seg 27. juli.

Kort dom:

  • Hva det er: Moonshot AIs flaggskip, en 2.8T-parameter MoE-modell med 1M kontekst, native bilde- og videoinput, og alltid-på resonnering. API-id kimi-k3.
  • Der den vinner: agentbasert nettlesing (BrowseComp 91.2) og langvarig koding (SWE Marathon 42.0, over både Fable 5 og GPT-5.6 Sol). #1 på Arenas Frontend Code Arena.
  • Der den henger etter: FrontierSWE og HLE-Full (Fable 5 leder), DeepSWE (GPT-5.6 Sol leder). Uavhengige Artificial Analysis rangerer den som #4 av 189 totalt.
  • Hva den koster: $0.30 cache-hit / $3.00 for fersk input, $15.00 output per million tokens. Den dyreste modellen noe kinesisk laboratorium har lansert.
  • Fangsten: åpen i navnet, men vektsettet blir ikke offentlig før 27. juli 2026. Frem til da: ingen selvhosting og ingen uavhengige tredjepartsevalueringer.

Skal vi oppsummere i én setning: Kimi K3 er den første åpne modellen som virkelig kan måle krefter med de lukkede toppmodellene, men det er lanseringsdags-programvare med et vektsett som ennå ikke er sluppet, og en pris i toppsjiktet. Les videre for spesifikasjonene, benchmark-virkeligheten (inkludert et forbehold som endrer hvordan du bør lese hvert eneste tall), prisregnestykket, og hvem som faktisk bør kjøre den.

Hva er Kimi K3?

Kimi K3 er Moonshot AIs nyeste store språkmodell, lansert 16. juli 2026. Det er en Mixture-of-Experts-modell med 2.8 trillion totale parametere som aktiverer bare 16 av sine 896 eksperter per token, slik at beregningskostnaden per token holder seg langt under det en tett (dense) 2.8T-modell ville krevd. Den tar imot tekst, bilder og video, har et kontekstvindu på én million tokens, og har resonnering slått på som standard.

Her er spesifikasjonene i et raskt overblikk.

SpesifikasjonKimi K3
Lansert16. juli 2026
UtviklerMoonshot AI
Totale parametere2.8 trillion (Mixture-of-Experts)
Aktive per token16 av 896 eksperter
OppmerksomhetKimi Delta Attention (KDA), opptil 6.3x raskere dekoding ved 1M kontekst
Kontekstvindu1,000,000 tokens
ModaliteterTekst-, bilde- og videoinput
ResonneringAlltid på; ett enkelt «max»-nivå ved lansering
API-modell-idkimi-k3 (OpenAI-SDK-kompatibel)
VekterÅpen vekt; offentlig utgivelse lovet 27. juli 2026
Pris per M tokens$0.30 cache-hit eller $3.00 fersk input, $15.00 output

Den mest interessante tekniske historien er oppmerksomhetsdesignet. Moonshot kaller det Kimi Delta Attention, eller KDA, en hybrid lineær oppmerksomhetsmekanisme som selskapet rapporterer gir opptil 6.3x raskere dekoding ved kontekster på millioner av tokens. K3 kombinerer dette med en samling nyere teknikker laboratoriet kaller Attention Residuals, Gated MLA og Stable LatentMoE. Du trenger ikke å pugge forkortelsene. Det de til sammen betyr, er en modell som holder farten oppe selv med en enorm kontekst, som er nøyaktig den typen arbeidslast som knekker eldre arkitekturer.

Sett K3 ved siden av modellen den erstatter, og hoppet er stort. Den nesten tripler parameterantallet til Kimi K2 (2.8T mot rundt 1T), firedobler kontekstvinduet til K2.6- og K2.7-linjen (1M mot 256K), og legger til bilde- og videoinput i en familie som tidligere var tekstfokusert. Har du prøvd en tidligere Kimi og trukket på skuldrene, er dette et helt annet dyr.

Kimi K3-benchmarker: Hvor den vinner, og hvor den ikke gjør det

Kimi K3s lanseringsbenchmarker er genuint sterke, og genuint blandede. Den topper feltet på enkelte kodings- og agentoppgaver, og henger tydelig etter de lukkede toppmodellene på andre. Før tabellen, ett forbehold som betyr mer enn noen enkelt poengsum: Moonshot kjørte hver modell i sitt eget kodemiljø. K3 ble målt i KimiCode, Fable 5 i Claude Code, og GPT-5.6 Sol i Codex. Programvaren rundt en modell påvirker resultatene, så les disse tallene som en pekepinn, ikke som en fastlåst rangering.

Her er hovedtallene for koding og agentoppgaver fra Moonshots lanseringstabell.

BenchmarkKimi K3GPT-5.6 SolClaude Fable 5
Program Bench77.877.676.8
SWE Marathon42.039.035.0
Terminal-Bench 2.188.388.884.6
DeepSWE67.573.070.0
FrontierSWE81.271.386.6
BrowseComp91.2ikke publisertikke publisert
OmniDocBench91.1ikke publisertikke publisert

Følger du radene nedover, dukker det opp et mønster. K3 vinner det lange, tunge arbeidet. På SWE Marathon, som måler sammenhengende ingeniørøkter over flere timer, slår K3s 42.0 både GPT-5.6 Sol og Fable 5 med klar margin. Den slår feltet med knapp margin på Program Bench, og leder også på agentsiden, med 91.2 på BrowseComp og 91.1 på OmniDocBench, hvor Moonshot også rapporterer topp-plasseringen på Automation Bench.

Hvor taper den? På DeepSWE trekker GPT-5.6 Sol fra med 73.0. På FrontierSWE ligger Fable 5 klart foran med 86.6, selv om det er verdt å nevne at K3s 81.2 fortsatt slår Sols 71.3 der. Moonshots egen tabell innrømmer at K3 henger etter Fable 5 på FrontierSWE og HLE-Full, og etter GPT-5.6 Sol på DeepSWE. Dette er ikke en modell som slår toppsjiktet overalt. Det er en modell som slår det et sted, noe ingen tidligere åpen modell egentlig har klart før.

Den uavhengige vurderingen bekrefter dette. Artificial Analysis gir K3 en score på 57 på sin Intelligence Index og rangerer den som #4 av 189 modeller, bak Claude Fable 5 og to GPT-5.6 Sol-resonneringsinnstillinger, men foran Claude Opus 4.8. Den målte utdatahastigheten er en nokså beskjeden 62 tokens per sekund. På preferansesiden blant mennesker er K3s førsteplass på Arenas Frontend Code Arena det som skiller seg ut, fordi den rangeringen kommer fra utviklere som stemmer på reell frontend-output, ikke en selvrapportert score.

Den uavhengige utvikleren Simon Willison kjørte K3 gjennom sin pelikan-på-sykkel-SVG-test på lanseringsdagen. Modellen leverte et solid resultat og skrev nøyaktig alt-tekst for sitt eget bilde, noe som taler godt for synsevnen. Han påpekte også prisoverraskelsen vi kommer tilbake til i prisdelen, og minnet leserne på at en rask SVG-test ikke sier noe som helst om agentbasert verktøybruk, som er der en modell som denne faktisk må bevise seg. En rettferdig advarsel.

Kimi K3 mot Fable 5, GPT-5.6 Sol, DeepSeek og Qwen

Så hvor plasserer K3 seg i det store bildet? To sammenligninger betyr noe: mot de lukkede toppmodellene, og mot sine kinesiske åpne søskenmodeller.

Mot toppsjiktet er den ærlige beskrivelsen «nær toppen, men ikke på toppen». Claude Fable 5 og GPT-5.6 Sol leder fortsatt de samlede intelligensrangeringene, og Fable 5 beholder et reelt forsprang på de vanskeligste resonnerings- og toppkodings-evalueringene. Det som har endret seg med K3, er at gapet har krympet til enkeltbenchmark-utvekslinger fremfor en kategoriforskjell. At en nedlastbar modell leder SWE Marathon og topper en blind frontend-kodingsavstemning, er nytt territorium.

Mot sine åpne søskenmodeller er K3 det nye toppmerket på ren kapasitet, men den er ikke det opplagte standardvalget for enhver jobb. Hvis du veier de kinesiske åpne alternativene mot hverandre som gruppe, går vår sammenligning av Qwen mot DeepSeek mot GLM gjennom hvordan disse tre familiene deler markedet: Qwen for det letteste selvhostingsfotavtrykket og den mest liberale lisensen, DeepSeek for de billigste tokenene, GLM for praktisk koding. K3 ligger nå over alle sammen på toppbenchmarker, og over dem på pris også. Det er det dyre alternativet i en kategori som bygget sitt rykte på å være billig.

For et bredere felt, inkludert modellene som faktisk slår GPT-4-klassens kvalitet, setter vår oversikt over de beste open source-LLM-ene for 2026 K3s påstander i kontekst. Kortversjonen: K3 løfter taket for åpne modeller, men «åpen vekt» og «billig» har offisielt sluttet å bety det samme.

Kimi K3-prising og cache-hit-regnestykket

Her er det K3 blir omstridt. Moonshot priser den til $0.30 per million cache-hit input-tokens, $3.00 per million ferske input-tokens og $15.00 per million output-tokens, flatt gjennom hele det million-token store kontekstvinduet.

Sett den opp mot modellen den erstatter, og skiftet er brutalt.

TokentypeKimi K3Kimi K2.6
Input, fersk$3.00 / M$0.95 / M
Input, cache-hit$0.30 / Mikke oppgitt
Output$15.00 / M$4.00 / M

Det er omtrent en 3x økning på input og nesten 4x på output sammenlignet med K2.6. Willison påpekte at $3/$15-satsen havner i samme sjikt som Claude Sonnet. The Decoder kalte K3 et signal om at æraen med superbillig kinesisk AI er i ferd med å ta slutt. Hvis hele grunnen din til å kjøre en kinesisk modell var prisen, vil K3 få deg til å tenke deg om en gang til.

Men cache-hit-satsen er tallet som avgjør den reelle regningen din, så la oss regne på en realistisk agentbasert løkke med Moonshots publiserte priser. Si at kodeagenten din leser en kodebase-kontekst på 200,000 tokens og skriver 8,000 tokens output, og gjør det 20 ganger om dagen:

  • Cache-miss (første kalde lesing): 200,000 input-tokens til $3.00/M er $0.60, pluss 8,000 output-tokens til $15.00/M er $0.12. Det blir omtrent $0.72 per kall, eller $14.40 om dagen.
  • Cache-hit (gjentatt kontekst, det vanlige tilfellet i en kodeøkt): 200,000 input-tokens til $0.30/M er $0.06, pluss de samme $0.12 i output. Det blir omtrent $0.18 per kall, eller $3.60 om dagen.

Cache-økonomien kutter input-regningen med rundt ti ganger, fra $0.60 til $0.06 per kall. Moonshot rapporterer over 90% cache-treff i kodearbeidslaster, som er scenarioet som gjør K3 overkommelig i stedet for smertefullt dyr. Lærdommen for budsjettet ditt: K3 er dyr på kalde engangskall, og fornuftig i en varm, konteksttung løkke.

Nok en kostnadsfelle Willison avdekket. K3 eksponerer i dag bare ett enkelt «max»-resonneringsnivå, og resonneringstokens faktureres til output-satsen. Hans enkle SVG-test brukte opp 13,241 resonneringstokens på toppen av 3,417 output-tokens, så en triviell prompt kostet omtrent 25 cents. Det finnes ennå ingen billig «lav resonnering»-modus, noe som betyr at K3 overbetaler på enkle spørsmål. Hvis kostnadskontroll er prioriteten din, passer våre guider om LLM API-priser og hvordan redusere LLM API-kostnader direkte her: cache aggressivt, ruter trivielle kall til en billigere modell, og reserver K3 til det tunge, langkontekst-arbeidet der den er verdt prisen.

Åpne vekter: Hva «åpen» faktisk betyr her

Dette er delen lanseringsoverskriftene glattet over. Kimi K3 er annonsert som en åpen modell, og Moonshot har en reell merittliste med å slippe nedlastbare vektsett. Men per 17. juli 2026 er K3-vektene ikke offentlige. Moonshots Hugging Face-organisasjon lister fortsatt bare opp K2-seriens vektsett. Selskapet sier de fullstendige vektene kommer 27. juli 2026.

Hvorfor betyr det gapet noe? Tre praktiske grunner:

  • Ingen selvhosting ennå. Du kan ikke kjøre K3 på egen maskinvare eller en privat klynge før vektene slippes. For team med krav til datalagring på egen jord eller air-gap er K3 kun API for nå, noe som fjerner en stor del av grunnen til at man velger en åpen modell. Når vektene lander, får du hjelp i gang av våre guider om de beste verktøyene for å kjøre LLM-er lokalt og hvordan kjøre en LLM lokalt, selv om en 2.8T-parameter-modell er klynge-klasse, ikke laptop-klasse.
  • Ingen uavhengige evalueringer ennå. Hver K3-benchmark du har sett, er kjørt av leverandøren selv, i Moonshots eget miljø. Seriøse tredjepartstall på ting som HLE eller agentspesifikke oppgaver kan ikke finnes før eksterne laboratorier har vektene å teste. Behandle lanseringstabellen som en sterk påstand, ikke et verifisert resultat.
  • Lisensvilkårene er fortsatt ikke fastsatt. Tidligere Kimi-utgivelser brukte liberale lisenser, men bekreft den nøyaktige K3-lisensen mot det offisielle modellkortet når vektsettet publiseres, spesielt hvis du planlegger kommersiell bruk.

Ingenting av dette gjør K3 mindre imponerende. Det betyr derimot at hvis planen din avhenger av å laste ned og finjustere modellen, starter den reelle evalueringen din 27. juli, ikke 16. juli.

Slik evaluerer vi Kimi K3 for kundearbeid

Et raskt notat om hvor denne anmeldelsen kommer fra, og hvor den stopper. Hos Techsy kobler vi tredjeparts-LLM-er inn i produksjonspipeliner for B2B-kunder, som regel gjennom OpenAI-SDK-kompatible endepunkter, slik at vi kan bytte modeller uten å bygge om rørleggingen. K3 passer rett inn i det løpet: den eksponerer et OpenAI-kompatibelt API med modell-id-en kimi-k3, så å legge den inn i en eksisterende integrasjon for å prøve den ut, er en konfigurasjonsendring, ikke en omskriving.

Hver gang en ny modell lander, kjører vi den gjennom den samme faste evalueringen på kunde-representative oppgaver før vi anbefaler noe som helst. Og her er den ærlige begrensningen ved denne anmeldelsen: vi publiserer ikke vår egen K3-score ennå. Vektene er ikke ute, lanseringsbenchmarkene ble kjørt av leverandøren selv i Moonshots eget miljø, og et rettferdig tall trenger et nøytralt oppsett på oppgaver som ligner reelt kundearbeid, ikke en rangeringsliste. Å sitere en førstepartsbenchmark fra en modell som er én dag gammel og fortsatt venter på vektene, ville vært akkurat den typen tall vi ber kundene våre om å ikke stole på.

Det vi kan evaluere i dag fra det live API-et, er delen som ikke trenger en rangeringsliste: integrasjonsflaten, kostnadsmodellen og feilmodusene. Prisregnestykket over er vår egen beregning basert på Moonshots publiserte priser, ikke en benchmark, og det forteller deg allerede den operasjonelle sannheten: cache-disiplin er forskjellen på om K3 er overkommelig eller et budsjettproblem. Hvis du trenger hjelp til å finne ut om en modell som K3 hører hjemme i stacken din, er det den typen evaluering vi gjør hos Techsys AI-integrasjonspraksis, og du kan book en gratis konsultasjon for å snakke gjennom det.

Hvem bør bruke Kimi K3 (og hvem bør ikke)

Kimi K3 passer godt til et bestemt sett med oppgaver, og dårlig til andre. Match den mot din faktiske arbeidslast.

Velg K3 hvis:

  • Du driver med agentbasert nettlesing eller research. Dens ledelse på BrowseComp og Automation Bench, pluss den beste uavhengige agent-research-vurderingen, gjør den til det mest kapable åpne alternativet for verktøybrukende agenter akkurat nå.
  • Du driver med langvarig koding. SWE Marathon er benchmarken som gjenspeiler ingeniørøkter over flere timer, og K3 leder den. Jobber agentene dine på tvers av store kodebaser over lange løp, er dette hjemmebanen dens.
  • Du vil ha en åpen, nær-toppen-modell og kan vente på vektene. Er målet å selvhoste en toppmodell 27. juli, er K3 den mest kapable kandidaten tilgjengelig.

Vent hvis:

  • Du trenger vektene i dag. Frem til 27. juli er K3 kun API. En allerede nedlastbar modell tjener deg bedre denne uken.
  • Du kjører høyvolum, kostnadsfølsom trafikk. Med ett enkelt dyrt resonneringsnivå og prising i toppsjiktet for output, overbetaler K3 på enkle kall. Kimi K2.7-Code eller en billigere åpen modell vinner på bulkarbeid.
  • Du krever dokumenterte, uavhengige evalueringer før du tar den i bruk. Lanseringstallene er kjørt av leverandøren selv. Krever prosessen din tredjepartsverifisering, gi det noen uker.

Ofte stilte spørsmål

Hva er Kimi K3?

Kimi K3 er Moonshot AIs flaggskip blant store språkmodeller, lansert 16. juli 2026. Det er en Mixture-of-Experts-modell med 2.8 trillion parametere som aktiverer 16 av 896 eksperter per token, støtter et kontekstvindu på 1M tokens, og tar imot tekst-, bilde- og videoinput med resonnering alltid på.

Er Kimi K3 open source?

Kimi K3 er annonsert som en åpen modell, men vektene er ikke offentlige per 17. juli 2026. Moonshot sier det fullstendige vektsettet slippes 27. juli 2026. Frem til da er den kun tilgjengelig gjennom Kimi-appene og API-et, så du kan ikke selvhoste den ennå.

Hvordan skiller Kimi K3 seg fra Kimi K2?

K3 nesten tripler K2s parameterantall (2.8 trillion mot rundt 1 trillion), firedobler kontekstvinduet til K2.6- og K2.7-linjen (1M mot 256K tokens), og legger til native bilde- og videoinput i en familie som tidligere var tekstfokusert. Den introduserer også det nye Kimi Delta Attention-designet.

Hvor mye koster Kimi K3?

Moonshot priser K3 til $0.30 per million cache-hit input-tokens, $3.00 per million ferske input-tokens og $15.00 per million output-tokens. Det er omtrent tre ganger K2.6s inputpris og nesten fire ganger dens outputpris, noe som gjør K3 til den dyreste modellen et kinesisk laboratorium har sluppet.

Hva er Kimi K3s kontekstvindu?

Kimi K3 støtter et kontekstvindu på én million tokens, og prisen holder seg flat gjennom hele det vinduet. Modellen bruker et nytt oppmerksomhetsdesign kalt Kimi Delta Attention, som Moonshot rapporterer gir opptil 6.3x raskere dekoding ved kontekstlengder på millioner av tokens.

Kan jeg kjøre Kimi K3 lokalt?

Ikke ennå. Vektene blir ikke offentlige før 27. juli 2026. Etter det er selvhosting teknisk mulig, men en 2.8-trillion-parameter-modell trenger klynge-klasse maskinvare fremfor en enkelt arbeidsstasjon, så de fleste team vil fortsatt bruke den gjennom API-et.

Er Kimi K3 egentlig bedre enn Fable 5?

Det kommer an på oppgaven. K3 slår Claude Fable 5 på SWE Marathon, Program Bench og Arenas blinde frontend-kodingsavstemning. Fable 5 leder fortsatt på FrontierSWE, HLE-Full og de samlede intelligensrangeringene. Hver lanseringsbenchmark ble også kjørt i hver leverandørs eget miljø, så behandle enkeltbenchmark-seire som en pekepinn.

Er Kimi K3 god til koding?

Ja, spesielt for lange, sammenhengende kodeøkter og frontend-arbeid, der den for øyeblikket leder. Den er også sterk på agentbaserte oppgaver og terminaloppgaver. Hovedulempen er kostnad: med ett dyrt resonneringsnivå overbetaler den på trivielle kall, så kombiner den med billigere modeller for høyvolum rutinearbeid.

Hvordan får jeg tilgang til Kimi K3?

Du kan bruke Kimi K3 gjennom Kimi-nettappen, Kimi Work og Kimi Code, eller gjennom API-et med modell-id-en kimi-k3. API-et er OpenAI-SDK-kompatibelt, så å legge det til i en eksisterende OpenAI-stil-integrasjon er stort sett bare en konfigurasjonsendring.

Om forfatteren

Mert Batur, Co-Founder, Techsy.io. Connect on LinkedIn.

Mert Batur er medgrunnlegger av Techsy.io, der teamet leverer AI-agenter, automasjonssystemer og voice/SDR-pipeliner til B2B-kunder. Han skriver om LLM-verktøystabelen Techsy-teamet faktisk bruker i produksjon.

Nøkkelpunkter

  • Kimi K3 er den første åpne modellen som genuint kan måle krefter med de lukkede toppmodellene, med ledelse på SWE Marathon og en førsteplass på Arenas blinde frontend-kodingsavstemning, over Claude Fable 5.
  • Den er nær toppen, men ikke på toppen. Uavhengige Artificial Analysis rangerer den som #4 av 189, og den henger etter Fable 5 på de vanskeligste resonnerings- og toppkodingstestene.
  • Åpen i navnet, ventende i praksis. Vektene publiseres ikke før 27. juli 2026, så det finnes ingen selvhosting og ingen uavhengig evaluering før da.
  • Prisen satte en stopper for æraen med billig kinesisk AI. Ved $3/$15 per million tokens er cache-disiplin det som holder K3 overkommelig; budsjetter for en varm, konteksttung løkke, ikke kalde engangskall.
  • Best for agentbasert research og langvarig koding. Trenger du vektene i dag, eller kjører du kostnadsfølsom høyvolumtrafikk, vent eller velg en billigere modell. Snakk med oss hvis du vil ha hjelp til å bestemme deg.

Emneord

kimi k3 anmeldelsekimi k3kimi k3 benchmarkerkimi k3 prismoonshot aiåpen llm

Del denne artikkelen

Kom i gang

Klar til å bygge noe ekstraordinært?

La oss gjøre visjonen din til virkelighet. Teamet vårt er klart til å hjelpe deg med å lage programvare som utgjør en forskjell.