
Kimi K3 anmeldelse: Moonshots 2,8T åbne model vs Fable 5 og GPT-5.6 Sol
Sidst verificeret: 17. juli 2026. Alle specifikationer, priser og benchmarks nedenfor blev gentjekket mod Moonshots platformdokumentation, Artificial Analysis og uafhængig dækning den dag, dette gik live. Kimi K3 blev lanceret den 16. juli 2026.
I denne Kimi K3-anmeldelse taler ét lanceringstal for sig selv: Moonshots nye model debuterede som nr. 1 på Arena's Frontend Code leaderboard, et hop på 17 pladser i forhold til Kimi K2.6, og placerede sig over Claude Fable 5. Det er en kinesisk open-weight model, der vinder en front-end kodningskonkurrence bedømt af rigtige udviklere i blinde matchups. Under motorhjelmen er det en Mixture-of-Experts-design med 2,8 billioner parametre, der kun aktiverer 16 af 896 eksperter per token, læser en million tokens kontekst og prissætter input mellem $0,30 og $3,00 per million. Hagen, du skal kende, før du bliver for begejstret: Du kan ikke downloade vægtene endnu, og Moonshot siger, at det ændres den 27. juli.
Hurtig dom:
- Hvad det er: Moonshot AIs flagskib, en MoE-model med 2,8T parametre, 1M kontekst, native billede- og videoinput samt altid-aktiv ræsonnering. API-id
kimi-k3. - Hvor den vinder: Agent-baseret browsing (BrowseComp 91,2) og langsigtede kodningsopgaver (SWE Marathon 42,0, over både Fable 5 og GPT-5.6 Sol). Nr. 1 på Arena's Frontend Code Arena.
- Hvor den halter bagefter: FrontierSWE og HLE-Full (Fable 5 fører), DeepSWE (GPT-5.6 Sol fører). Uafhængige Artificial Analysis rangerer den som nr. 4 af 189 samlet set.
- Hvad det koster: $0,30 cache-hit / $3,00 nyt input, $15,00 output per million tokens. Den dyreste model, noget kinesisk lab har leveret.
- Hagen: Open-weight i navnet, men checkpointet bliver ikke offentligt før den 27. juli 2026. Indtil da ingen self-hosting og ingen uafhængige tredjepartsevalueringer.
Hvis du vil have svaret i én linje: Kimi K3 er den første open-weight model, der virkelig kan måle sig med de lukkede frontier-modeller, men det er software på lanceringsdagen med en ventende vægtudgivelse og en premiumpris. Læs videre for specifikationerne, benchmark-virkeligheden (inklusive en forbehold, der ændrer, hvordan du bør læse hvert tal), prismatematikken og hvem der faktisk bør køre den.
Hvad er Kimi K3?
Kimi K3 er Moonshot AIs nyeste store sprogmodel, udgivet den 16. juli 2026. Det er en Mixture-of-Experts-model med 2,8 billioner totale parametre, der kun aktiverer 16 af sine 896 eksperter på hvert token, så beregningsomkostningen per token holder sig langt under, hvad en dense 2,8T-model ville kræve. Den accepterer tekst, billeder og video, har et kontekstvindue på en million tokens og holder ræsonnering tændt som standard.
Her er specifikationsarket ved første øjekast.
| Spec | Kimi K3 |
|---|---|
| Udgivet | 16. juli 2026 |
| Udvikler | Moonshot AI |
| Totale parametre | 2,8 billioner (Mixture-of-Experts) |
| Aktive per token | 16 af 896 eksperter |
| Attention | Kimi Delta Attention (KDA), op til 6,3x hurtigere afkodning ved 1M kontekst |
| Kontekstvindue | 1.000.000 tokens |
| Modaliteter | Tekst-, billede- og videoinput |
| Ræsonnering | Altid tændt; et enkelt "max"-niveau ved lancering |
| API model id | kimi-k3 (OpenAI-SDK kompatibel) |
| Vægte | Open-weight; offentlig udgivelse lovet den 27. juli 2026 |
| Pris per M tokens | $0,30 cache-hit eller $3,00 nyt input, $15,00 output |
Den interessante ingeniørhistorie er attention-designet. Moonshot kalder det Kimi Delta Attention eller KDA, en hybrid lineær attention-mekanisme, som virksomheden rapporterer leverer op til 6,3x hurtigere afkodning i kontekster med en million tokens. K3 parrer det med en stak af nyere tricks, som labbet kalder Attention Residuals, Gated MLA og Stable LatentMoE. Du behøver ikke at memorere akronymerne. Det, de tilsammen giver, er en model, der kan forblive hurtig, mens den bærer en enorm kontekst, hvilket er præcis den arbejdsbyrde, der knækker ældre arkitekturer.
Sætter man K3 ved siden af den model, den erstatter, er springet stort. Den næsten tredobler parameterantallet for Kimi K2 (2,8T mod cirka 1T), firedobler kontekstvinduet for K2.6- og K2.7-linjen (1M mod 256K) og tilføjer billede- og videoinput til en familie, der tidligere var tekst-first. Hvis du prøvede en tidligere Kimi og trak på skuldrene, er dette et andet dyr.
Kimi K3 Benchmarks: Hvor den vinder, og hvor den ikke gør
Kimi K3's lanceringsbenchmarks er genuint stærke og genuint blandede. Den topper feltet inden for nogle kodnings- og agentopgaver og ligger tydeligt efter de lukkede frontier-modeller på andre. Før tabellen, et forbehold, der betyder mere end enhver enkelt score: Moonshot kørte hver model i sit eget kodningsmiljø. K3 blev scoret i KimiCode, Fable 5 i Claude Code og GPT-5.6 Sol i Codex. Softwaren, der omgiver en model, påvirker dens resultater, så læs disse som retningsgivende, ikke som en afgjort leaderboard.
Her er hovedtallene for kodning og agenter fra Moonshots lancerings tabel.
| Benchmark | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Program Bench | 77,8 | 77,6 | 76,8 |
| SWE Marathon | 42,0 | 39,0 | 35,0 |
| Terminal-Bench 2.1 | 88,3 | 88,8 | 84,6 |
| DeepSWE | 67,5 | 73,0 | 70,0 |
| FrontierSWE | 81,2 | 71,3 | 86,6 |
| BrowseComp | 91,2 | ikke offentliggjort | ikke offentliggjort |
| OmniDocBench | 91,1 | ikke offentliggjort | ikke offentliggjort |
Læser man hen over rækkerne, viser der sig et mønster. K3 vinder det lange, slidende arbejde. På SWE Marathon, som måler vedvarende ingeniørsessioner over flere timer, slår K3's 42,0 både GPT-5.6 Sol og Fable 5 med klar margin. Den snupper sejren i Program Bench, og den fører også på agentsiden med 91,2 på BrowseComp og 91,1 på OmniDocBench, hvor Moonshot også rapporterer førstepladsen på Automation Bench.
Hvor taber den? På DeepSWE trækker GPT-5.6 Sol fra med 73,0. På FrontierSWE er Fable 5 klart foran med 86,6, selvom det er værd at bemærke, at K3's 81,2 stadig slår Sol's 71,3 der. Moonshots egen tabel indrømmer, at K3 halter bagefter Fable 5 på FrontierSWE og HLE-Full og bag GPT-5.6 Sol på DeepSWE. Dette er ikke en model, der slår frontieren overalt. Det er en model, der slår den nogle steder, hvilket ingen open-weight udgivelse rigtig havde formået før.
Den uafhængige læsning bakker det op. Artificial Analysis scorer K3 til 57 på sit Intelligence Index og rangerer den som nr. 4 ud af 189 modeller, bag Claude Fable 5 og to GPT-5.6 Sol ræsonneringsindstillinger, men foran Claude Opus 4.8. Dens målte output-hastighed er en ret beskeden 62 tokens per sekund. På siden med menneskelige præferencer er K3's førsteplads på Arena's Frontend Code Arena det fremtrædende, fordi den rangering kommer fra udviklere, der stemmer på reel front-end output snarere end en selvrapporteret score.
Uafhængig udvikler Simon Willison kørte K3 gennem sin pelican-on-a-bicycle SVG-test på lanceringsdagen. Modellen producerede et solidt resultat og skrev præcis alt-tekst til sit eget billede, hvilket taler godt for dens vision. Han flaggede også prisoverraskelsen, som vi kommer til i prisafsnittet, og mindede læserne om, at en hurtig SVG-test ikke fortæller dig noget om agent-baseret tool calling, hvilket er der, en model som denne tjener sine penge. Fair advarsel.
Kimi K3 vs Fable 5, GPT-5.6 Sol, DeepSeek og Qwen
Så hvor sidder K3 i det bredere felt? To sammenligninger betyder noget: mod den lukkede frontier og mod dens kinesiske open-weight kolleger.
Mod frontieren er den ærlige formulering "frontier-adjacent, ikke frontier-topping". Claude Fable 5 og GPT-5.6 Sol fører stadig de samlede intelligensranglister, og Fable 5 beholder en reel fordel på de sværeste ræsonnerings- og frontier-kodningsevalueringer. Det, der ændrede sig med K3, er, at kløften indsnævredes til single-benchmark bytter snarere end et kategori-gab. For en downloadbar model at føre SWE Marathon og toppe en blind front-end kodningsafstemning er nyt territorium.
Mod sine open-weight peers er K3 det nye højvandsmærke for rå kapacitet, men den er ikke den obvious default for ethvert job. Hvis du vejer de kinesiske open-weight muligheder som en gruppe, går vores Qwen vs DeepSeek vs GLM sammenligning igennem, hvordan disse tre familier opdeler markedet: Qwen for den letteste self-host footprint og den mest tilladende licens, DeepSeek for de billigste tokens, GLM for hands-on kodning. K3 sidder nu over dem alle på peak benchmarks og også over dem på prisen. Det er premium-valget i en kategori, der byggede sit rygte på at være billig.
For et bredere felt inklusive de modeller, der faktisk slår GPT-4-klassens kvalitet, sætter vores oversigt over bedste open-source LLM'er for 2026 K3's påstande i perspektiv. Den korte version: K3 hæver loftet for open weights, men "open weights" og "billig" er officielt holdt op med at være det samme.
Kimi K3 Priser og Cache-Hit Matematikken
Her bliver K3 kontroversiel. Moonshot prissætter den til $0,30 per million cache-hit input tokens, $3,00 per million nye input tokens og $15,00 per million output tokens, fast på tværs af hele million-token konteksten.
Stiller man det op mod den model, den erstatter, er skiftet markant.
| Token type | Kimi K3 | Kimi K2.6 |
|---|---|---|
| Input, nyt | $3,00 / M | $0,95 / M |
| Input, cache-hit | $0,30 / M | ikke oplyst |
| Output | $15,00 / M | $4,00 / M |
Det er cirka et 3x hop på input og næsten 4x på output i forhold til K2.6. Willison bemærkede, at $3/$15-raten lander i samme tier som Claude Sonnet. The Decoder kaldte K3 et signal om, at æraen med superbillig kinesisk AI er slut. Hvis din eneste grund til at køre en kinesisk model var prisen, vil K3 få dig til at se nærmere på det.
Men cache-hit raten er tallet, der afgør din regning, så lad os gøre matematikken på en realistisk agent-loop ved hjælp af Moonshots offentliggjorte satser. Lad os sige, at din kodningsagent læser en 200.000-token kodebase-kontekst og skriver 8.000 tokens output, og den gør det 20 gange om dagen:
- Cache-miss (første kolde læsning): 200.000 input tokens til $3,00/M er $0,60, plus 8.000 output tokens til $15,00/M er $0,12. Det er omkring $0,72 per kald eller $14,40 om dagen.
- Cache-hit (gentaget kontekst, det almindelige tilfælde i en kodningssession): 200.000 input tokens til $0,30/M er $0,06, plus de samme $0,12 output. Det er omkring $0,18 per kald eller $3,60 om dagen.
Cache-økonomien skærer input-regningen med cirka ti gange, fra $0,60 til $0,06 per kald. Moonshot rapporterer over 90% cache hits i kodningsarbejdsbyrder, hvilket er scenariet, der gør K3 overkommelig snarere end øjenbøjende. Lektien for dit budget: K3 er dyr på kolde, one-shot kald og rimelig inde i en varm, konteksttung loop.
En anden prisfælde, Willison afdækkede. K3 eksponerer kun et enkelt "max" ræsonneringsniveau i dag, og ræsonneringstokens faktureres til output-satsen. Hans simple SVG-test brændte 13.241 ræsonneringstokens oven i 3.417 output tokens, så en trivial prompt kostede omkring 25 cent. Der er ingen billig "low reasoning"-tilstand endnu, hvilket betyder, at K3 betaler overpris på nemme spørgsmål. Hvis omkostningskontrol er din prioritet, gælder vores guider om LLM API-priser og hvordan man reducerer LLM API-omkostninger direkte her: cach aggressivt, rout trivielle kald til en billigere model, og reserver K3 til det hårde, lang-kontekst arbejde, hvor den tjener premiumprisen.
Open Weights: Hvad "Åben" Faktisk Betyder Her
Dette er den del, som lanceringsheadlinesne gled let hen over. Kimi K3 annonceres som en open-weight model, og Moonshot har en reel track record for at levere downloadbare checkpoints. Men pr. 17. juli 2026 er K3-vægtene ikke offentlige. Moonshot Hugging Face-organisationen lister stadig kun K2-serie checkpoints. Virksomheden siger, at de fulde vægte ankommer den 27. juli 2026.
Hvorfor betyder det gab noget? Tre praktiske årsager:
- Ingen self-hosting endnu. Du kan ikke køre K3 på din egen hardware eller et privat cluster, før vægtene dropes. For teams med data-residency eller air-gap krav er K3 kun API-baseret lige nu, hvilket underminerer en stor del af grunden til, at du ville vælge en åben model. Når vægtene lander, vil vores guider om de bedste værktøjer til at køre LLM'er lokalt og køre en LLM lokalt få dig i gang, selvom en 2,8T-parameter model er cluster-klasse, ikke laptop-klasse.
- Ingen uafhængige evalueringer endnu. Hver K3 benchmark, du har set, er vendor-kørt i Moonshots eget miljø. Alvorlige tredjepartstal på ting som HLE eller agent-specifikke opgaver kan ikke eksistere, før eksterne labs har vægtene at teste med. Behandle lancerings-tabellen som et stærkt krav, ikke et verificeret resultat.
- Licenstermerne er stadig under afklaring. Tidligere Kimi-udgivelser brugte tilladende licenser, men bekræft den nøjagtige K3-licens mod det officielle model card, når checkpointet publiceres, især hvis du planlægger kommerciel implementering.
Intet af dette gør K3 mindre imponerende. Det betyder bare, at hvis din plan afhænger af at downloade og fine-tune modellen, starter din reelle evaluering den 27. juli, ikke den 16. juli.
Hvordan Vi Evaluerer Kimi K3 til Klientarbejde
En hurtig note om, hvor denne anmeldelse kommer fra, og hvor den stopper. Hos Techsy integrerer vi tredjeparts LLM'er i produktionspipelines for B2B-klienter, normalt gennem OpenAI-SDK-kompatible endpoints, så vi kan bytte modeller uden at genopbygge rørledningen. K3 passer rent ind i den sti: den eksponerer en OpenAI-kompatibel API med model-id'et kimi-k3, så at droppe den ind i en eksisterende integration for at prøve den er en konfigurationsændring, ikke en omskrivning.
Hver gang en ny model lander, kører vi den gennem den samme faste evaluering på klient-repræsentative opgaver, før vi anbefaler noget. Og her er den ærlige begrænsning på denne anmeldelse: Vi publicerer ikke vores egen K3-score endnu. Vægtene er ikke ude, lanceringsbenchmarksene blev vendor-kørt i Moonshots eget miljø, og et fair tal har brug for en neutral opsætning på opgaver, der ligner rigtigt klientarbejde, ikke en leaderboard. At citere et first-party benchmark fra en en-dag-gammel, vægt-ventende model ville være præcis den slags tal, vi fortæller klienter, de skal mistro.
Det, vi kan evaluere i dag fra den live API, er den del, der ikke har brug for en leaderboard: integrationsoverfladen, omkostningsmodellen og fejlmodes. Prismatematikken ovenfor er vores egen beregning fra Moonshots offentliggjorte satser, ikke et benchmark, og den fortæller dig allerede den operationelle sandhed: cache-disciplin er forskellen mellem, at K3 er overkommelig, og at den er et budgetproblem. Hvis du vil have hjælp til at finde ud af, om en model som K3 hører hjemme i din stack, er det den slags evaluering, vi laver hos Techsys AI-integrationspraksis, og du kan booke en gratis konsultation for at tale om det.
Hvem Bør Bruge Kimi K3 (og Hvem Bør Ikke)
Kimi K3 er en stærk pasform til et specifikt sæt jobs og en dårlig pasform til andre. Match den til din faktiske arbejdsbyrde.
Ræk ud efter K3 hvis:
- Du kører agent-baseret browsing eller research. Dens BrowseComp- og Automation Bench-førerskab plus den bedste uafhængige agent-research læsning gør den til den mest capable open-weight option til tool-using agenter lige nu.
- Du laver langsigtet kodning. SWE Marathon er benchmarket, der spejler multi-time ingeniørsessioner, og K3 fører det. Hvis dine agenter arbejder på tværs af store kodebaser over lange kørsler, er dette dens hjemmebane.
- Du vil have en open-weight frontier-adjacent model og kan vente på vægtene. Hvis self-hosting af en top-tier open model den 27. juli er målet, er K3 den mest capable kandidat tilgængelig.
Vent hvis:
- Du har brug for vægtene i dag. Indtil den 27. juli er K3 kun API-baseret. En allerede-downloadbar model tjener dig bedre denne uge.
- Du kører high-volume, prisfølsom trafik. Med et enkelt dyrt ræsonneringsniveau og premium output-priser betaler K3 overpris på simple kald. Kimi K2.7-Code eller en billigere open model vinder på bulk-arbejde.
- Du kræver beviste, uafhængige evalueringer før adoption. Lanceringstallene er vendor-kørte. Hvis din proces kræver tredjepartsverifikation, giv det et par uger.
Ofte Stillede Spørgsmål
Hvad er Kimi K3?
Kimi K3 er Moonshot AIs flagskibs store sprogmodel, udgivet den 16. juli 2026. Det er en Mixture-of-Experts-model med 2,8 billioner parametre, der aktiverer 16 af 896 eksperter per token, understøtter et 1M-token kontekstvindue og accepterer tekst-, billede- og videoinput med ræsonnering altid tændt.
Er Kimi K3 open source?
Kimi K3 annonceres som en open-weight model, men vægtene er ikke offentlige pr. 17. juli 2026. Moonshot siger, at det fulde checkpoint vil blive udgivet den 27. juli 2026. Indtil da er den kun tilgængelig gennem Kimi-apps og API'en, så du kan ikke self-hoste den endnu.
Hvordan er Kimi K3 anderledes end Kimi K2?
K3 næsten tredobler K2's parameterantal (2,8 billioner mod cirka 1 billion), firedobler kontekstvinduet for K2.6- og K2.7-linjen (1M mod 256K tokens) og tilføjer native billede- og videoinput til en familie, der tidligere var tekst-fokuseret. Den introducerer også det nye Kimi Delta Attention-design.
Hvor meget koster Kimi K3?
Moonshot prissætter K3 til $0,30 per million cache-hit input tokens, $3,00 per million nye input tokens og $15,00 per million output tokens. Det er cirka det tredobbelte af K2.6's inputpris og næsten det firedobbelte af dens outputpris, hvilket gør K3 til den dyreste model, et kinesisk lab har udgivet.
Hvad er Kimi K3's kontekstvindue?
Kimi K3 understøtter et kontekstvindue på en million tokens, og prisen forbliver flad på tværs af det fulde vindue. Modellen bruger et nyt attention-design kaldet Kimi Delta Attention, som Moonshot rapporterer giver op til 6,3x hurtigere afkodning ved million-token kontekstlængder.
Kan jeg køre Kimi K3 lokalt?
Ikke endnu. Vægtene er ikke offentlige før den 27. juli 2026. Derefter er self-hosting teknisk muligt, men en 2,8-billioner-parameter model har brug for cluster-klasse hardware snarere end en enkelt workstation, så de fleste teams vil stadig få adgang til den gennem API'en.
Er Kimi K3 virkelig bedre end Fable 5?
Det afhænger af opgaven. K3 slår Claude Fable 5 på SWE Marathon, Program Bench og Arena's blinde front-end kodningsafstemning. Fable 5 fører stadig på FrontierSWE, HLE-Full og samlede aggregate intelligensranglister. Hvert lanceringsbenchmark kørte også i hver vendors eget miljø, så behandl single-benchmark sejre som retningsgivende.
Er Kimi K3 god til kodning?
Ja, især til lange, vedvarende kodningssessioner og front-end arbejde, hvor den fører lige nu. Den er også stærk på agent- og terminalopgaver. Den største ulempe er omkostninger: med ét dyrt ræsonneringsniveau betaler den overpris på trivielle kald, så par den med billigere modeller til high-volume rutinearbejde.
Hvordan får jeg adgang til Kimi K3?
Du kan bruge Kimi K3 gennem Kimi web-appen, Kimi Work og Kimi Code eller gennem API'en med model-id'et kimi-k3. API'en er OpenAI-SDK kompatibel, så tilføjelse til en eksisterende OpenAI-stil integration er mest en konfigurationsændring.
Om Forfatteren
Mert Batur Gurbuz, Co-Founder, Techsy.io (University of Birmingham). Connect on LinkedIn.
Mert Batur Gurbuz er Co-Founder af Techsy.io, hvor teamet leverer AI-agenter, automatiseringssystemer og voice/SDR-pipelines til B2B-klienter. Han studerer ved University of Birmingham og skriver om den LLM-tooling stack, som Techsy-teamet faktisk bruger i produktion.
Vigtigste Pointer
- Kimi K3 er den første open-weight model, der genuint kan måle sig med den lukkede frontier, fører SWE Marathon og topper Arena's blinde front-end kodningsafstemning over Claude Fable 5.
- Den er frontier-adjacent, ikke frontier-topping. Uafhængige Artificial Analysis rangerer den som nr. 4 af 189, og den halter bagefter Fable 5 på de sværeste ræsonnerings- og frontier-kodningstests.
- Åben i navn, ventende i praksis. Vægtene publiceres ikke før den 27. juli 2026, så der er ingen self-hosting og ingen uafhængig evaluering indtil da.
- Prisen sluttede æraen med billig-kinesisk-AI. Til $3/$15 per million tokens er cache-disciplin det, der holder K3 overkommelig; budgetter for en varm, konteksttung loop, ikke kolde one-shot kald.
- Bedst til agent-baseret research og langsigtet kodning. Hvis du har brug for vægte i dag eller kører prisfølsom high-volume trafik, så vent eller vælg en billigere model. Tal med os, hvis du vil have hjælp til at beslutte.