
Kimi K3-recension: Moonshots 2.8T öppna modell mot Fable 5 och GPT-5.6 Sol
Senast verifierad: 17 juli 2026. Varje specifikation, pris och benchmark nedan kontrollerades igen mot Moonshots plattformsdokumentation, Artificial Analysis och oberoende bevakning samma dag som detta publicerades. Kimi K3 lanserades 16 juli 2026.
I den här Kimi K3-recensionen är det en enda lanseringssiffra som talar: Moonshots nya modell debuterade som #1 på Arenas Frontend Code-topplista, ett 17-place-hopp över Kimi K2.6, och rankad över Claude Fable 5. Det är en kinesisk öppen-vikt-modell som vinner en frontend-kodningstävling bedömd av riktiga utvecklare i blinda matchningar. Under huven är det en Mixture-of-Experts-design med 2.8 trillion parametrar som bara aktiverar 16 av 896 experter per token, läser en miljon token kontext och prissätter indata mellan $0.30 och $3.00 per miljon. Haken du behöver känna till innan du blir för entusiastisk: du kan inte ladda ner vikterna än, och Moonshot säger att det ändras den 27 juli.
Snabb dom:
- Vad det är: Moonshot AI:s flaggskepp, en 2.8T-parameters MoE-modell med 1M kontext, inbyggt bild- och videostöd och alltid påslaget resonemang. API-id
kimi-k3. - Var den vinner: agentisk webbläsning (BrowseComp 91.2) och långsiktig kodning (SWE Marathon 42.0, över både Fable 5 och GPT-5.6 Sol). #1 på Arenas Frontend Code Arena.
- Var den ligger efter: FrontierSWE och HLE-Full (Fable 5 leder), DeepSWE (GPT-5.6 Sol leder). Oberoende Artificial Analysis rankar den som #4 av 189 totalt.
- Vad den kostar: $0.30 cache-hit / $3.00 färsk indata, $15.00 utdata per miljon token. Den dyraste modellen något kinesiskt labb har släppt.
- Haken: öppen vikt till namnet, men checkpointen blir inte publik förrän 27 juli 2026. Fram tills dess: ingen självhostning och inga oberoende tredjepartsutvärderingar.
Om du vill ha svaret på en rad: Kimi K3 är den första öppen-vikt-modellen som på riktigt ger den stängda fronten en match, men det är lanseringsdagens mjukvara med väntande viktsläpp och ett premiumpris. Läs vidare för specifikationerna, benchmarkverkligheten (inklusive en brasklapp som förändrar hur du bör läsa varje siffra), prissättningsmatematiken och vem som faktiskt bör köra den.
Vad är Kimi K3?
Kimi K3 är Moonshot AI:s senaste stora språkmodell, lanserad 16 juli 2026. Det är en Mixture-of-Experts-modell med totalt 2.8 trillion parametrar som aktiverar bara 16 av sina 896 experter för varje token, så beräkningskostnaden per token stannar långt under vad en tät (dense) 2.8T-modell skulle kräva. Den tar emot text, bilder och video, har ett kontextfönster på en miljon token och kör resonemang påslaget som standard.
Här är specifikationsbladet i korthet.
| Specifikation | Kimi K3 |
|---|---|
| Lanserad | 16 juli 2026 |
| Utvecklare | Moonshot AI |
| Totalt antal parametrar | 2.8 trillion (Mixture-of-Experts) |
| Aktiva per token | 16 av 896 experter |
| Attention | Kimi Delta Attention (KDA), upp till 6.3x snabbare avkodning vid 1M kontext |
| Kontextfönster | 1,000,000 token |
| Modaliteter | Text-, bild- och videoindata |
| Resonemang | Alltid på; en enda "max"-nivå vid lansering |
| API-modell-id | kimi-k3 (OpenAI-SDK-kompatibel) |
| Vikter | Öppen vikt; publikt släpp utlovat 27 juli 2026 |
| Pris per M token | $0.30 cache-hit eller $3.00 färsk indata, $15.00 utdata |
Den intressanta ingenjörshistorien handlar om attention-designen. Moonshot kallar den Kimi Delta Attention, eller KDA, en hybrid linjär attention-mekanism som företaget uppger levererar upp till 6.3x snabbare avkodning vid kontexter på miljontals token. K3 kombinerar den med en samling nyare knep som labbet namnger Attention Residuals, Gated MLA och Stable LatentMoE. Du behöver inte memorera akronymerna. Det de tillsammans ger är en modell som kan hålla farten uppe samtidigt som den bär en enorm kontext, vilket är precis den arbetsbelastning som får äldre arkitekturer att kollapsa.
Ställ K3 bredvid modellen den ersätter och hoppet är stort. Den nästan tredubblar parameterantalet jämfört med Kimi K2 (2.8T mot ungefär 1T), fyrdubblar kontextfönstret jämfört med K2.6- och K2.7-linjen (1M mot 256K), och lägger till bild- och videoindata till en familj som tidigare var textfokuserad. Om du testade en tidigare Kimi och ryckte på axlarna är det här ett helt annat djur.
Kimi K3-benchmarks: var den vinner och var den inte gör det
Kimi K3:s lanseringsbenchmarks är genuint starka, och genuint blandade. Den toppar fältet på vissa kodnings- och agentuppgifter och ligger tydligt efter den stängda fronten på andra. Innan tabellen, en brasklapp som väger tyngre än någon enskild poäng: Moonshot körde varje modell i sin egen kodningsmiljö. K3 poängsattes i KimiCode, Fable 5 i Claude Code och GPT-5.6 Sol i Codex. Mjukvaran runt en modell påverkar resultaten, så läs siffrorna som en fingervisning, inte som en fastslagen topplista.
Här är de främsta kodnings- och agentsiffrorna från Moonshots lanseringstabell.
| Benchmark | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Program Bench | 77.8 | 77.6 | 76.8 |
| SWE Marathon | 42.0 | 39.0 | 35.0 |
| Terminal-Bench 2.1 | 88.3 | 88.8 | 84.6 |
| DeepSWE | 67.5 | 73.0 | 70.0 |
| FrontierSWE | 81.2 | 71.3 | 86.6 |
| BrowseComp | 91.2 | ej publicerad | ej publicerad |
| OmniDocBench | 91.1 | ej publicerad | ej publicerad |
Läs raderna och ett mönster framträder. K3 vinner det långa, slitsamma arbetet. På SWE Marathon, som mäter uthålliga ingenjörssessioner över flera timmar, slår K3:s 42.0 både GPT-5.6 Sol och Fable 5 med tydlig marginal. Den knappar in fältet på Program Bench, och den leder även på agentsidan, med 91.2 på BrowseComp och 91.1 på OmniDocBench, där Moonshot dessutom rapporterar förstaplatsen på Automation Bench.
Var förlorar den? På DeepSWE drar GPT-5.6 Sol ifrån med 73.0. På FrontierSWE ligger Fable 5 klart före med 86.6, även om det är värt att notera att K3:s 81.2 fortfarande slår Sols 71.3 där. Moonshots egen tabell medger att K3 ligger efter Fable 5 på FrontierSWE och HLE-Full, och efter GPT-5.6 Sol på DeepSWE. Det här är inte en modell som slår fronten överallt. Det är en modell som slår den någonstans, vilket ingen tidigare öppen-vikt-lansering egentligen lyckats med.
Den oberoende läsningen bekräftar det. Artificial Analysis ger K3 57 poäng på sitt Intelligence Index och rankar den som #4 av 189 modeller, bakom Claude Fable 5 och två GPT-5.6 Sol-resonemangslägen men före Claude Opus 4.8. Den uppmätta output-hastigheten är ganska blygsamma 62 token per sekund. På människopreferenssidan är K3:s förstaplats på Arenas Frontend Code Arena höjdpunkten, eftersom den rankingen kommer från utvecklare som röstar på riktig frontend-output snarare än en självrapporterad poäng.
Den oberoende utvecklaren Simon Willison körde K3 genom sitt pelikan-på-cykel-SVG-test på lanseringsdagen. Modellen producerade ett solitt resultat och skrev korrekt alt-text för sin egen bild, vilket talar gott om dess bildförståelse. Han flaggade också kostnadsöverraskningen vi kommer till i prisavsnittet, och påminde läsarna om att ett snabbt SVG-test inte säger något om agentisk verktygsanvändning, vilket är där en modell som den här faktiskt tjänar sitt uppehälle. Rimlig försiktighet.
Kimi K3 mot Fable 5, GPT-5.6 Sol, DeepSeek och Qwen
Så var hamnar K3 i det bredare fältet? Två jämförelser spelar roll: mot den stängda fronten, och mot sina kinesiska öppen-vikt-kollegor.
Mot fronten är den ärliga beskrivningen "frontnära, inte fronttoppande". Claude Fable 5 och GPT-5.6 Sol leder fortfarande de sammanlagda intelligensrankingarna, och Fable 5 behåller ett reellt övertag på de tuffaste resonemangs- och frontkodningsutvärderingarna. Det som förändrades med K3 är att gapet krympte till enstaka benchmarkbyten snarare än en kategoriklyfta. Att en nedladdningsbar modell leder SWE Marathon och toppar en blind frontend-kodningsomröstning är ny mark.
Mot sina öppen-vikt-kollegor är K3 den nya vattendelaren för ren kapacitet, men den är inte det självklara förstahandsvalet för varje uppgift. Om du väger de kinesiska öppen-vikt-alternativen mot varandra går vår jämförelse av Qwen vs DeepSeek vs GLM igenom hur de tre familjerna delar upp marknaden: Qwen för det lättaste självhostade fotavtrycket och den mest tillåtande licensen, DeepSeek för de billigaste tokens, GLM för handgriplig kodning. K3 ligger nu över alla dem på toppbenchmarks, och över dem på pris också. Den är premiumalternativet i en kategori som byggde sitt rykte på att vara billig.
För ett bredare fält, inklusive modellerna som faktiskt slår GPT-4-klassens kvalitet, sätter vår sammanställning av de bästa open source-LLM:erna för 2026 K3:s påståenden i sitt sammanhang. Kortversionen: K3 höjer taket för öppna vikter, men "öppna vikter" och "billigt" har officiellt slutat vara samma sak.
Kimi K3-prissättning och cache-hit-matematiken
Här blir K3 omdiskuterad. Moonshot prissätter den till $0.30 per miljon cache-hit-indata-token, $3.00 per miljon färska indata-token och $15.00 per miljon utdata-token, platt över hela miljon-token-kontexten.
Ställ den mot modellen den ersätter och skiftet är dramatiskt.
| Tokentyp | Kimi K3 | Kimi K2.6 |
|---|---|---|
| Indata, färsk | $3.00 / M | $0.95 / M |
| Indata, cache-hit | $0.30 / M | ej redovisat |
| Utdata | $15.00 / M | $4.00 / M |
Det är ungefär ett 3x-hopp på indata och nästan 4x på utdata jämfört med K2.6. Willison noterade att $3/$15-nivån hamnar i samma klass som Claude Sonnet. The Decoder kallade K3 en signal om att eran med superbilliga kinesiska AI-modeller går mot sitt slut. Om hela din anledning att köra en kinesisk modell var priset kommer K3 att få dig att tänka om.
Men cache-hit-frekvensen är siffran som avgör din verkliga räkning, så låt oss räkna på en realistisk agentisk loop med Moonshots publicerade priser. Säg att din kodningsagent läser en kodbaskontext på 200,000 token och skriver 8,000 token utdata, och gör det 20 gånger om dagen:
- Cache miss (första kalla läsning): 200,000 indata-token à $3.00/M blir $0.60, plus 8,000 utdata-token à $15.00/M blir $0.12. Det blir ungefär $0.72 per anrop, eller $14.40 om dagen.
- Cache-hit (upprepad kontext, det vanliga fallet i en kodningssession): 200,000 indata-token à $0.30/M blir $0.06, plus samma $0.12 utdata. Det blir ungefär $0.18 per anrop, eller $3.60 om dagen.
Cache-ekonomin skär indata-notan med ungefär tio gånger, från $0.60 till $0.06 per anrop. Moonshot rapporterar över 90% cache-träffar i kodningsarbetsbelastningar, vilket är scenariot som gör K3 överkomlig snarare än smärtsam. Lärdomen för din budget: K3 är dyr vid kalla engångsanrop och rimlig inuti en varm, kontexttung loop.
Ytterligare en kostnadsfälla Willison uppmärksammade. K3 exponerar bara en enda "max"-resonemangsnivå idag, och resonemangstoken debiteras till utdatapriset. Hans enkla SVG-test brände 13,241 resonemangstoken utöver 3,417 utdata-token, så en trivial prompt kostade ungefär 25 cents. Det finns inget billigt "lågt resonemang"-läge än, vilket betyder att K3 betalar för mycket på enkla frågor. Om kostnadskontroll är din prioritet gäller våra guider om LLM-API-prissättning och hur du minskar LLM-API-kostnader direkt här: cacha aggressivt, dirigera triviala anrop till en billigare modell, och spara K3 till det svåra, kontexttunga arbetet där den tjänar in premiumpriset.
Öppna vikter: vad "öppet" egentligen betyder här
Det här är delen lanseringsrubrikerna gled förbi. Kimi K3 tillkännages som en öppen-vikt-modell, och Moonshot har ett verkligt track record av att släppa nedladdningsbara checkpoints. Men per 17 juli 2026 är K3:s vikter inte publika. Moonshots Hugging Face-organisation listar fortfarande bara checkpoints i K2-serien. Företaget säger att de fullständiga vikterna anländer 27 juli 2026.
Varför spelar det gapet roll? Tre praktiska skäl:
- Ingen självhostning än. Du kan inte köra K3 på egen hårdvara eller ett privat kluster förrän vikterna släpps. För team med krav på datalokalisering eller air-gap är K3 bara API för tillfället, vilket underminerar en stor del av anledningen till att man skulle välja en öppen modell. När vikterna väl landar kommer våra guider om de bästa verktygen för att köra LLM:er lokalt och att köra en LLM lokalt att hjälpa dig igång, även om en 2.8T-parametersmodell är klusterklass, inte bärbar-dator-klass.
- Inga oberoende utvärderingar än. Varje K3-benchmark du sett är körd av leverantören själv, i Moonshots egen miljö. Seriösa tredjepartssiffror på saker som HLE eller agentspecifika uppgifter kan inte existera förrän externa labb har vikterna att testa. Betrakta lanseringstabellen som ett starkt påstående, inte ett verifierat resultat.
- Licensvillkoren håller fortfarande på att sätta sig. Tidigare Kimi-lanseringar använde tillåtande licenser, men bekräfta den exakta K3-licensen mot det officiella modellkortet när checkpointen publiceras, särskilt om du planerar kommersiell driftsättning.
Inget av det här gör K3 mindre imponerande. Det betyder dock att om din plan är beroende av att ladda ner och finjustera modellen börjar din riktiga utvärdering 27 juli, inte 16 juli.
Så utvärderar vi Kimi K3 för kunduppdrag
En snabb notering om varifrån den här recensionen kommer, och var den slutar. På Techsy kopplar vi in tredjeparts-LLM:er i produktionspipelines för B2B-kunder, oftast genom OpenAI-SDK-kompatibla endpoints så att vi kan byta modell utan att bygga om rörledningarna. K3 passar den vägen rent: den exponerar ett OpenAI-kompatibelt API med modell-id:t kimi-k3, så att lägga in den i en befintlig integration för att testa den är en konfigurationsändring, inte en omskrivning.
Varje gång en ny modell landar kör vi den genom samma fasta utvärdering på kundrepresentativa uppgifter innan vi rekommenderar något. Och här är den ärliga begränsningen med den här recensionen: vi publicerar inte vår egen K3-poäng än. Vikterna är inte ute, lanseringsbenchmarken kördes av leverantören i Moonshots egen miljö, och en rättvis siffra kräver en neutral uppsättning på uppgifter som liknar riktigt kundarbete, inte en topplista. Att citera ett förstapartsbenchmark från en modell som är en dag gammal och väntar på vikter vore precis den typen av siffra vi säger åt kunder att misstro.
Det vi kan utvärdera idag från det live API:et är delen som inte behöver en topplista: integrationsytan, kostnadsmodellen och felmodena. Prissättningsmatematiken ovan är vår egen uträkning från Moonshots publicerade priser, inte ett benchmark, och den berättar redan den operativa sanningen: cache-disciplin är skillnaden mellan att K3 är överkomlig och att den är ett budgetproblem. Om du vill ha hjälp att räkna ut om en modell som K3 hör hemma i din stack är det den typen av utvärdering vi gör på Techsys AI-integrationstjänst, och du kan boka en kostnadsfri konsultation för att prata igenom det.
Vem bör använda Kimi K3 (och vem bör inte)
Kimi K3 passar starkt för en specifik uppsättning uppgifter och dåligt för andra. Matcha den mot din faktiska arbetsbelastning.
Välj K3 om:
- Du kör agentisk webbläsning eller research. Dess ledande resultat på BrowseComp och Automation Bench, plus den bästa oberoende agent-research-läsningen, gör den till det mest kapabla öppen-vikt-alternativet för verktygsanvändande agenter just nu.
- Du gör långsiktig kodning. SWE Marathon är benchmarken som speglar ingenjörssessioner över flera timmar, och K3 leder den. Om dina agenter arbetar över stora kodbaser under långa körningar är det här dess hemmaplan.
- Du vill ha en frontnära öppen-vikt-modell och kan vänta på vikterna. Om målet är att självhosta en toppmodell med öppna vikter 27 juli är K3 den mest kapabla kandidaten som finns.
Vänta om:
- Du behöver vikterna idag. Fram till 27 juli är K3 bara tillgänglig via API. En redan nedladdningsbar modell tjänar dig bättre den här veckan.
- Du kör högvolym-, kostnadskänslig trafik. Med en enda dyr resonemangsnivå och premium-utdatapris betalar K3 för mycket på enkla anrop. Kimi K2.7-Code eller en billigare öppen modell vinner på massarbete.
- Du kräver bevisade, oberoende utvärderingar innan adoption. Lanseringssiffrorna är körda av leverantören. Om din process kräver tredjepartsverifiering, ge det några veckor.
Vanliga frågor
Vad är Kimi K3?
Kimi K3 är Moonshot AI:s flaggskeppsmodell inom stora språkmodeller, lanserad 16 juli 2026. Det är en Mixture-of-Experts-modell med 2.8 trillion parametrar som aktiverar 16 av 896 experter per token, stödjer ett kontextfönster på 1M token och tar emot text-, bild- och videoindata med resonemang alltid påslaget.
Är Kimi K3 open source?
Kimi K3 tillkännages som en öppen-vikt-modell, men vikterna är inte publika per 17 juli 2026. Moonshot säger att den fullständiga checkpointen släpps 27 juli 2026. Fram till dess är den bara tillgänglig via Kimi-apparna och API:et, så du kan inte självhosta den än.
Hur skiljer sig Kimi K3 från Kimi K2?
K3 nästan tredubblar K2:s parameterantal (2.8 trillion mot ungefär 1 trillion), fyrdubblar kontextfönstret jämfört med K2.6- och K2.7-linjen (1M mot 256K token), och lägger till inbyggd bild- och videoindata till en familj som tidigare var textfokuserad. Den introducerar också den nya Kimi Delta Attention-designen.
Hur mycket kostar Kimi K3?
Moonshot prissätter K3 till $0.30 per miljon cache-hit-indata-token, $3.00 per miljon färska indata-token och $15.00 per miljon utdata-token. Det är ungefär tre gånger K2.6:s indatapris och nästan fyra gånger dess utdatapris, vilket gör K3 till den dyraste modellen ett kinesiskt labb har släppt.
Vad är Kimi K3:s kontextfönster?
Kimi K3 stödjer ett kontextfönster på en miljon token, och prissättningen förblir platt över hela det fönstret. Modellen använder en ny attention-design som kallas Kimi Delta Attention, vilken Moonshot uppger ger upp till 6.3x snabbare avkodning vid kontextlängder på miljontals token.
Kan jag köra Kimi K3 lokalt?
Inte än. Vikterna är inte publika förrän 27 juli 2026. Efter det är självhostning tekniskt möjligt, men en modell med 2.8 trillion parametrar behöver hårdvara i klusterklass snarare än en enskild arbetsstation, så de flesta team kommer fortfarande att nå den via API:et.
Är Kimi K3 verkligen bättre än Fable 5?
Det beror på uppgiften. K3 slår Claude Fable 5 på SWE Marathon, Program Bench och Arenas blinda frontend-kodningsomröstning. Fable 5 leder fortfarande på FrontierSWE, HLE-Full och de sammanlagda intelligensrankingarna. Varje lanseringsbenchmark kördes dessutom i respektive leverantörs egen miljö, så betrakta enskilda benchmarkvinster som en fingervisning.
Är Kimi K3 bra för kodning?
Ja, särskilt för långa, uthålliga kodningssessioner och frontend-arbete, där den för närvarande leder. Den är också stark på agentiska uppgifter och terminaluppgifter. Den största nackdelen är kostnaden: med en enda dyr resonemangsnivå betalar den för mycket på triviala anrop, så para ihop den med billigare modeller för högvolyms rutinarbete.
Hur får jag tillgång till Kimi K3?
Du kan använda Kimi K3 genom webbappen Kimi, Kimi Work och Kimi Code, eller genom API:et med modell-id:t kimi-k3. API:et är OpenAI-SDK-kompatibelt, så att lägga till det i en befintlig OpenAI-liknande integration är mestadels en konfigurationsändring.
Om författaren
Mert Batur, Co-Founder, Techsy.io. Connect on LinkedIn.
Mert Batur är medgrundare av Techsy.io, där teamet levererar AI-agenter, automationssystem och röst/SDR-pipelines till B2B-kunder. Han skriver om den LLM-verktygsstacken som Techsy-teamet faktiskt använder i produktion.
Nyckelinsikter
- Kimi K3 är den första öppen-vikt-modellen som på riktigt ger den stängda fronten en match, den leder SWE Marathon och toppar Arenas blinda frontend-kodningsomröstning över Claude Fable 5.
- Den är frontnära, inte fronttoppande. Oberoende Artificial Analysis rankar den som #4 av 189, och den ligger efter Fable 5 på de tuffaste resonemangs- och frontkodningstesterna.
- Öppen till namnet, väntande i praktiken. Vikterna publiceras inte förrän 27 juli 2026, så det finns ingen självhostning och ingen oberoende utvärdering fram tills dess.
- Priset avslutade eran med billig kinesisk AI. Vid $3/$15 per miljon token är cache-disciplin det som håller K3 överkomlig; budgetera för en varm, kontexttung loop, inte kalla engångsanrop.
- Bäst för agentisk research och långsiktig kodning. Om du behöver vikterna idag eller kör kostnadskänslig högvolymstrafik, vänta eller välj en billigare modell. Prata med oss om du vill ha hjälp att bestämma dig.