ai-machine-learning

Kimi K3 review: Moonshot's 2.8T open model vs. Fable 5 en GPT-5.6 Sol

Geschreven door Mert Batur
Jul 17, 2026
16 leestijd
Kimi K3 review: Moonshot's 2.8T open model vs. Fable 5 en GPT-5.6 Sol

Kimi K3 review: Moonshot's 2.8T open model vs. Fable 5 en GPT-5.6 Sol

Laatst geverifieerd: 17 juli 2026. Elke specificatie, prijs en benchmark hieronder is opnieuw gecontroleerd tegen Moonshot's platformdocumentatie, Artificial Analysis en onafhankelijke berichtgeving op de dag dat dit artikel live ging. Kimi K3 werd op 16 juli 2026 gelanceerd.

In deze Kimi K3 review draait het om één lancering-cijfer: Moonshot's nieuwe model debuteerde op #1 in Arena's Frontend Code-ranglijst, een sprong van 17-place ten opzichte van Kimi K2.6, en eindigde daarmee boven Claude Fable 5. Dat is een Chinees open-weight model dat een front-end codeerwedstrijd wint, beoordeeld door echte developers in blinde vergelijkingen. Onder de motorkap gaat het om een Mixture-of-Experts-ontwerp met 2.8 trillion parameters dat per token slechts 16 of 896 experts activeert, een miljoen tokens aan context leest en input prijst tussen $0.30 en $3.00 per miljoen. De adder onder het gras voordat je enthousiast wordt: je kunt de weights nog niet downloaden, en Moonshot zegt dat dit verandert op 27 juli.

Kort verdict:

  • Wat het is: Moonshot AI's vlaggenschip, een 2.8T-parameter MoE-model met 1M context, native beeld- en video-input, en permanent actief redeneren. API-id kimi-k3.
  • Waar het wint: agentic browsen (BrowseComp 91.2) en langdurige coding (SWE Marathon 42.0, boven zowel Fable 5 als GPT-5.6 Sol). #1 in Arena's Frontend Code Arena.
  • Waar het achterblijft: FrontierSWE en HLE-Full (Fable 5 leidt), DeepSWE (GPT-5.6 Sol leidt). Onafhankelijke Artificial Analysis rangschikt het #4 van 189 in totaal.
  • Wat het kost: $0.30 cache-hit / $3.00 verse input, $15.00 output per miljoen tokens. Het duurste model dat een Chinees lab ooit heeft uitgebracht.
  • De adder onder het gras: open-weight in naam, maar de checkpoint wordt pas publiek op 27 juli 2026. Tot die tijd geen self-hosting en geen onafhankelijke evaluaties door derden.

Als je het antwoord in één zin wilt: Kimi K3 is het eerste open-weight model dat de closed frontier serieus partij geeft, maar het is launch-day software met een uitgestelde weight-release en een premium prijs. Lees verder voor de specificaties, de benchmarkrealiteit (inclusief een voorbehoud dat verandert hoe je elk cijfer moet lezen), de prijsrekensom, en wie het model daadwerkelijk zou moeten draaien.

Wat is Kimi K3?

Kimi K3 is Moonshot AI's nieuwste large language model, uitgebracht op 16 juli 2026. Het is een Mixture-of-Experts-model met 2.8 trillion totale parameters dat per token slechts 16 of 896 experts activeert, waardoor de rekenkosten per token ver onder blijven van wat een dense 2.8T-model zou vragen. Het accepteert tekst, beeld en video, heeft een contextvenster van een miljoen tokens, en houdt redeneren standaard ingeschakeld.

Hier is het specificatieoverzicht in één oogopslag.

SpecificatieKimi K3
Uitgebracht16 juli 2026
OntwikkelaarMoonshot AI
Totaal parameters2.8 trillion (Mixture-of-Experts)
Actief per token16 of 896 experts
AttentionKimi Delta Attention (KDA), tot 6.3x snellere decodering bij 1M context
Contextvenster1,000,000 tokens
ModaliteitenTekst-, beeld- en video-input
RedenerenAltijd actief; één "max"-niveau bij launch
API model-idkimi-k3 (compatibel met OpenAI-SDK)
WeightsOpen-weight; publieke release beloofd op 27 juli 2026
Prijs per M tokens$0.30 cache-hit of $3.00 verse input, $15.00 output

Het interessantste technische verhaal zit in het attention-ontwerp. Moonshot noemt het Kimi Delta Attention, of KDA, een hybride lineair attention-mechanisme waarvan het bedrijf zegt dat het tot 6.3x snellere decodering levert bij contexten van een miljoen tokens. K3 combineert dit met een reeks nieuwere technieken die het lab Attention Residuals, Gated MLA en Stable LatentMoE noemt. Je hoeft de afkortingen niet uit je hoofd te leren. Wat ze samen opleveren is een model dat snel blijft terwijl het een enorme context meedraagt, precies de workload waarop oudere architecturen vastlopen.

Zet K3 naast het model dat het vervangt en het verschil is groot. Het aantal parameters verdrievoudigt bijna ten opzichte van Kimi K2 (2.8T tegenover ongeveer 1T), het contextvenster van de K2.6- en K2.7-lijn verviervoudigt (1M tegenover 256K), en er komt beeld- en video-input bij voor een familie die voorheen vooral tekst deed. Als je een eerdere Kimi probeerde en er niet van onder de indruk was, is dit een heel ander beestje.

Kimi K3 benchmarks: waar het wint en waar niet

Kimi K3's lancering-benchmarks zijn oprecht sterk, en oprecht gemengd. Het model is toonaangevend op sommige coding- en agenttaken en blijft duidelijk achter bij de closed frontier op andere. Vóór de tabel eerst een voorbehoud dat zwaarder weegt dan elk individueel cijfer: Moonshot testte elk model in zijn eigen coding-omgeving. K3 werd beoordeeld in KimiCode, Fable 5 in Claude Code, en GPT-5.6 Sol in Codex. De software rond een model beïnvloedt de resultaten, dus lees deze cijfers als richtinggevend, niet als een vaststaande ranglijst.

Hier zijn de belangrijkste coding- en agentcijfers uit Moonshot's lanceringstabel.

BenchmarkKimi K3GPT-5.6 SolClaude Fable 5
Program Bench77.877.676.8
SWE Marathon42.039.035.0
Terminal-Bench 2.188.388.884.6
DeepSWE67.573.070.0
FrontierSWE81.271.386.6
BrowseComp91.2niet gepubliceerdniet gepubliceerd
OmniDocBench91.1niet gepubliceerdniet gepubliceerd

Lees de rijen langs en er tekent zich een patroon af. K3 wint het lange, taaie werk. Op SWE Marathon, dat langdurige, meerdere uren durende engineeringsessies meet, verslaat K3's 42.0 zowel GPT-5.6 Sol als Fable 5 met een duidelijke marge. Het is ook net iets beter op Program Bench, en leidt ook aan de agentkant, met 91.2 op BrowseComp en 91.1 op OmniDocBench, waarbij Moonshot ook de topplek op Automation Bench claimt.

Waar verliest het? Op DeepSWE trekt GPT-5.6 Sol de leiding naar zich toe met 73.0. Op FrontierSWE staat Fable 5 duidelijk voorop met 86.6, al is het vermeldenswaard dat K3's 81.2 daar nog steeds Sol's 71.3 verslaat. Moonshot's eigen tabel erkent dat K3 achterblijft bij Fable 5 op FrontierSWE en HLE-Full, en bij GPT-5.6 Sol op DeepSWE. Dit is geen model dat overal de frontier verslaat. Het is een model dat het ergens verslaat, iets wat geen enkele eerdere open-weight release echt voor elkaar had gekregen.

De onafhankelijke lezing bevestigt dit. Artificial Analysis geeft K3 een score van 57 op zijn Intelligence Index en rangschikt het #4 van 189 modellen, achter Claude Fable 5 en twee GPT-5.6 Sol reasoning-instellingen, maar vóór Claude Opus 4.8. De gemeten output-snelheid is een vrij bescheiden 62 tokens per seconde. Aan de kant van menselijke voorkeur is K3's #1-plek in Arena's Frontend Code Arena de uitschieter, omdat die ranking komt van developers die stemmen op echte front-end output in plaats van een zelfgerapporteerde score.

Onafhankelijk developer Simon Willison liet K3 op de lanceringsdag zijn pelican-op-een-fiets SVG-test doorlopen. Het model produceerde een solide resultaat en schreef nauwkeurige alt-tekst voor zijn eigen afbeelding, wat goed spreekt voor zijn visuele vermogen. Hij wees ook op de kostenverrassing waar we in het prijzengedeelte op terugkomen, en herinnerde lezers eraan dat een snelle SVG-test niets zegt over agentic tool calling, waar een model als dit zijn geld pas écht waard maakt. Terechte voorzichtigheid.

Kimi K3 vs Fable 5, GPT-5.6 Sol, DeepSeek en Qwen

Waar staat K3 dan in het bredere veld? Twee vergelijkingen zijn relevant: tegenover de closed frontier, en tegenover zijn mede-Chinese open-weight modellen.

Tegenover de frontier is de eerlijke omschrijving "frontier-adjacent, niet frontier-toppend". Claude Fable 5 en GPT-5.6 Sol leiden nog steeds de totale intelligentierangschikking, en Fable 5 houdt een reële voorsprong op de zwaarste reasoning- en frontier-codingevaluaties. Wat er met K3 veranderde, is dat de kloof versmalde tot wisselende overwinningen per benchmark in plaats van een categorie-kloof. Voor een downloadbaar model om SWE Marathon te leiden en een blinde front-end codeerstemming te winnen, is dat nieuw terrein.

Tegenover zijn open-weight collega's is K3 het nieuwe hoogtepunt op ruwe capaciteit, maar het is niet vanzelfsprekend de beste keuze voor elke taak. Als je de Chinese open-weight opties als groep afweegt, loopt onze Qwen vs DeepSeek vs GLM-vergelijking door hoe die drie families de markt verdelen: Qwen voor de lichtste self-host footprint en de meest permissieve licentie, DeepSeek voor de goedkoopste tokens, GLM voor hands-on coding. K3 staat nu boven al deze modellen qua piekbenchmarks, en ook qua prijs. Het is de premiumoptie in een categorie die haar reputatie opbouwde op goedkoop zijn.

Voor een breder overzicht, inclusief modellen die daadwerkelijk GPT-4-klasse kwaliteit verslaan, plaatst ons overzicht van de beste open-source LLM's voor 2026 K3's claims in perspectief. De korte versie: K3 verhoogt het plafond voor open weights, maar "open weights" en "goedkoop" zijn officieel opgehouden hetzelfde te zijn.

Kimi K3 prijzen en de cache-hit rekensom

Hier wordt K3 verdeeld. Moonshot prijst het op $0.30 per miljoen cache-hit inputtokens, $3.00 per miljoen verse inputtokens, en $15.00 per miljoen outputtokens, vlak over het volledige contextvenster van een miljoen tokens.

Zet het naast het model dat het vervangt en de verschuiving is fors.

Type tokenKimi K3Kimi K2.6
Input, vers$3.00 / M$0.95 / M
Input, cache-hit$0.30 / Mniet bekendgemaakt
Output$15.00 / M$4.00 / M

Dat is ruwweg een verdrievoudiging op input en bijna een vervierdubbeling op output ten opzichte van K2.6. Willison merkte op dat het tarief van $3/$15 in hetzelfde segment valt als Claude Sonnet. The Decoder noemde K3 een signaal dat het tijdperk van supergoedkope Chinese AI ten einde loopt. Als je hele reden om een Chinees model te draaien de prijs was, zal K3 je twee keer laten kijken.

Maar het cache-hit-tarief is het cijfer dat je échte rekening bepaalt, dus laten we de rekensom maken voor een realistische agentic loop, met Moonshot's gepubliceerde tarieven. Stel dat je coding agent een codebase-context van 200,000 tokens leest en 8,000 tokens output schrijft, en dat 20 keer per dag doet:

  • Cache-miss (eerste koude read): 200,000 inputtokens tegen $3.00/M is $0.60, plus 8,000 outputtokens tegen $15.00/M is $0.12. Dat is ongeveer $0.72 per call, of $14.40 per dag.
  • Cache-hit (herhaalde context, het gangbare geval in een codeersessie): 200,000 inputtokens tegen $0.30/M is $0.06, plus dezelfde $0.12 output. Dat is ongeveer $0.18 per call, of $3.60 per dag.

De cache-economie snijdt de inputrekening met ongeveer tien keer, van $0.60 naar $0.06 per call. Moonshot rapporteert meer dan 90% cache-hits bij coding-workloads, precies het scenario dat K3 betaalbaar maakt in plaats van schrikbarend duur. De les voor je budget: K3 is duur bij koude, eenmalige calls en redelijk binnen een warme, context-zware loop.

Nog een kostenval die Willison blootlegde. K3 biedt vandaag slechts één "max"-reasoningniveau, en reasoning-tokens worden gefactureerd tegen het outputtarief. Zijn simpele SVG-test verbruikte 13,241 reasoning-tokens bovenop 3,417 outputtokens, waardoor een triviale prompt zo'n 25 cents kostte. Er is nog geen goedkope "low reasoning"-modus, wat betekent dat K3 te veel betaalt op makkelijke vragen. Als kostenbeheersing je prioriteit is, zijn onze gidsen over LLM API-prijzen en hoe je LLM API-kosten verlaagt hier direct relevant: cache agressief, route triviale calls naar een goedkoper model, en bewaar K3 voor het zware, long-context werk waar het de premium waard is.

Open weights: wat "open" hier echt betekent

Dit is het deel dat de lanceringskoppen grotendeels oversloegen. Kimi K3 wordt aangekondigd als een open-weight model, en Moonshot heeft een reëel trackrecord van het uitbrengen van downloadbare checkpoints. Maar per 17 juli 2026 zijn de K3-weights nog niet publiek. De Moonshot Hugging Face-organisatie vermeldt nog steeds alleen K2-serie checkpoints. Het bedrijf zegt dat de volledige weights op 27 juli 2026 arriveren.

Waarom is die kloof belangrijk? Drie praktische redenen:

  • Nog geen self-hosting. Je kunt K3 niet op je eigen hardware of een private cluster draaien totdat de weights beschikbaar komen. Voor teams met data-residency- of air-gap-vereisten is K3 voorlopig alleen via de API te gebruiken, wat een groot deel van de reden om voor een open model te kiezen tenietdoet. Zodra de weights er zijn, helpen onze gidsen over de beste tools om LLM's lokaal te draaien en een LLM lokaal draaien je op weg, al is een model met 2.8 trillion parameters cluster-klasse, geen laptop-klasse.
  • Nog geen onafhankelijke evaluaties. Elke K3-benchmark die je tot nu toe hebt gezien, is uitgevoerd door de leverancier zelf, in Moonshot's eigen omgeving. Serieuze cijfers van derden op zaken als HLE of agentspecifieke taken kunnen pas bestaan zodra externe labs de weights hebben om te testen. Behandel de lanceringstabel als een sterke claim, niet als een geverifieerd resultaat.
  • Licentievoorwaarden liggen nog niet vast. Eerdere Kimi-releases gebruikten permissieve licenties, maar controleer de exacte K3-licentie tegen de officiële modelkaart zodra de checkpoint gepubliceerd wordt, zeker als je commerciële inzet overweegt.

Niets hiervan maakt K3 minder indrukwekkend. Het betekent wel dat als je plan afhangt van het downloaden en fine-tunen van het model, je échte evaluatie op 27 juli begint, niet op 16 juli.

Hoe wij Kimi K3 evalueren voor klantwerk

Een korte noot over waar deze review vandaan komt, en waar ze ophoudt. Bij Techsy koppelen we externe LLM's aan productiepipelines voor B2B-klanten, meestal via OpenAI-SDK-compatibele endpoints zodat we modellen kunnen wisselen zonder de hele loodgieterij te herbouwen. K3 sluit daar goed op aan: het biedt een OpenAI-compatibele API met model-id kimi-k3, dus het in een bestaande integratie zetten om te testen is een configuratiewijziging, geen herschrijving.

Elke keer dat een nieuw model verschijnt, laten we het door dezelfde vaste evaluatie lopen op klant-representatieve taken voordat we iets aanbevelen. En hier is de eerlijke grens van deze review: we publiceren nog geen eigen K3-score. De weights zijn er niet, de lanceringsbenchmarks zijn door de leverancier zelf uitgevoerd in Moonshot's eigen omgeving, en een eerlijk cijfer heeft een neutrale opzet nodig op taken die op echt klantwerk lijken, geen ranglijst. Een first-party benchmark citeren van een model dat één dag oud is en waarvan de weights nog moeten verschijnen, zou precies het soort cijfer zijn waarvoor we klanten waarschuwen.

Wat we vandaag wél kunnen evalueren vanuit de live API is het deel dat geen ranglijst nodig heeft: het integratieoppervlak, het kostenmodel, en de faalmodi. De prijsrekensom hierboven is onze eigen berekening op basis van Moonshot's gepubliceerde tarieven, geen benchmark, en die vertelt je nu al de operationele waarheid: cache-discipline is het verschil tussen K3 betaalbaar of een budgetprobleem. Als je hulp wilt bij de vraag of een model als K3 in jouw stack thuishoort, is dat precies het soort evaluatie dat we doen bij Techsy's AI-integratiepraktijk, en je kunt een gratis consult boeken om erover te praten.

Wie zou Kimi K3 moeten gebruiken (en wie niet)

Kimi K3 is een sterke match voor een specifieke set taken en een slechte match voor andere. Match het model met je werkelijke workload.

Kies voor K3 als:

  • Je draait agentic browsen of onderzoek. De koppositie op BrowseComp en Automation Bench, plus de beste onafhankelijke agent-research-score, maken het nu het meest capabele open-weight model voor tool-gebruikende agents.
  • Je doet langdurige coding. SWE Marathon is de benchmark die meerdere-uren-durende engineeringsessies weerspiegelt, en K3 leidt hierin. Als je agents over grote codebases heen langdurig werken, is dit zijn thuisterrein.
  • Je wilt een open-weight frontier-adjacent model en kunt wachten op de weights. Als self-hosting van een top-tier open model op 27 juli het doel is, is K3 de meest capabele kandidaat die beschikbaar is.

Wacht nog als:

  • Je hebt de weights vandaag nodig. Tot 27 juli is K3 alleen via de API beschikbaar. Een model dat al downloadbaar is, dient je deze week beter.
  • Je draait high-volume, kostengevoelig verkeer. Met één duur reasoningniveau en premium outputprijzen betaalt K3 te veel op simpele calls. Kimi K2.7-Code of een goedkoper open model wint op bulkwerk.
  • Je vereist bewezen, onafhankelijke evaluaties vóór adoptie. De lanceringscijfers zijn door de leverancier zelf uitgevoerd. Als je proces verificatie door derden vereist, geef het nog een paar weken.

Veelgestelde vragen

Wat is Kimi K3?

Kimi K3 is Moonshot AI's vlaggenschip large language model, uitgebracht op 16 juli 2026. Het is een Mixture-of-Experts-model dat 16 of 896 experts per token activeert, een contextvenster van 1M tokens ondersteunt, en tekst-, beeld- en video-input accepteert met redeneren standaard ingeschakeld.

Is Kimi K3 open source?

Kimi K3 wordt aangekondigd als open-weight model, maar de weights zijn per 17 juli 2026 nog niet publiek. Moonshot zegt dat de volledige checkpoint op 27 juli 2026 wordt vrijgegeven. Tot die tijd is het alleen beschikbaar via de Kimi-apps en de API, dus je kunt het nog niet self-hosten.

Hoe verschilt Kimi K3 van Kimi K2?

K3 verdrievoudigt bijna het aantal parameters van K2 (2.8 trillion tegenover ongeveer 1 trillion), verviervoudigt het contextvenster van de K2.6- en K2.7-lijn (1M tegenover 256K tokens), en voegt native beeld- en video-input toe aan een familie die voorheen vooral tekst deed. Het introduceert ook het nieuwe Kimi Delta Attention-ontwerp.

Hoeveel kost Kimi K3?

Moonshot prijst K3 op $0.30 per miljoen cache-hit inputtokens, $3.00 per miljoen verse inputtokens, en $15.00 per miljoen outputtokens. Dat is ruwweg driemaal K2.6's inputprijs en bijna viermaal de outputprijs, waardoor K3 het duurste model is dat een Chinees lab ooit heeft uitgebracht.

Wat is het contextvenster van Kimi K3?

Kimi K3 ondersteunt een contextvenster van een miljoen tokens, en de prijs blijft vlak over dat volledige venster. Het model gebruikt een nieuw attention-ontwerp genaamd Kimi Delta Attention, dat volgens Moonshot tot 6.3x snellere decodering geeft bij contexten van een miljoen tokens.

Kan ik Kimi K3 lokaal draaien?

Nog niet. De weights zijn pas op 27 juli 2026 publiek. Daarna is self-hosting technisch mogelijk, maar een model met 2.8 trillion parameters vraagt cluster-klasse hardware in plaats van één werkstation, dus de meeste teams zullen het waarschijnlijk nog steeds via de API benaderen.

Is Kimi K3 echt beter dan Fable 5?

Dat hangt van de taak af. K3 verslaat Claude Fable 5 op SWE Marathon, Program Bench en Arena's blinde front-end codeerstemming. Fable 5 leidt nog steeds op FrontierSWE, HLE-Full en de totale intelligentierangschikking. Elke lanceringsbenchmark draaide bovendien in de eigen omgeving van elke leverancier, dus behandel losse overwinningen als richtinggevend.

Is Kimi K3 goed voor coding?

Ja, vooral voor lange, langdurige codeersessies en front-end werk, waar het momenteel leidt. Het is ook sterk op agentic en terminal-taken. Het grootste nadeel is de prijs: met één duur reasoningniveau betaalt het te veel op triviale calls, dus combineer het met goedkopere modellen voor high-volume routinewerk.

Hoe krijg ik toegang tot Kimi K3?

Je kunt Kimi K3 gebruiken via de Kimi-webapp, Kimi Work en Kimi Code, of via de API met model-id kimi-k3. De API is compatibel met de OpenAI-SDK, dus toevoegen aan een bestaande OpenAI-stijl integratie is meestal alleen een configuratiewijziging.

Over de auteur

Mert Batur, Co-Founder, Techsy.io. Volg hem op LinkedIn.

Mert Batur is medeoprichter van Techsy.io, waar het team AI-agents, automatiseringssystemen en voice/SDR-pipelines bouwt voor B2B-klanten. Hij schrijft over de LLM-toolingstack die het Techsy-team daadwerkelijk in productie gebruikt.

Belangrijkste conclusies

  • Kimi K3 is het eerste open-weight model dat serieus partij geeft aan de closed frontier, met de leiding op SWE Marathon en de winst in Arena's blinde front-end codeerstemming boven Claude Fable 5.
  • Het is frontier-adjacent, niet frontier-toppend. Onafhankelijke Artificial Analysis rangschikt het #4 van 189, en het blijft achter bij Fable 5 op de zwaarste reasoning- en frontier-codingtests.
  • Open in naam, in de praktijk nog in de wacht. De weights worden pas op 27 juli 2026 gepubliceerd, dus tot die tijd geen self-hosting en geen onafhankelijke evaluatie.
  • De prijs maakte een einde aan het tijdperk van goedkope Chinese AI. Bij $3/$15 per miljoen tokens is cache-discipline wat K3 betaalbaar houdt; begroot voor een warme, context-zware loop, niet voor koude eenmalige calls.
  • Het beste voor agentic research en langdurige coding. Als je vandaag de weights nodig hebt of high-volume kostengevoelig verkeer draait, wacht of kies een goedkoper model. Praat met ons als je hulp wilt bij die keuze.

Tags

kimi k3 reviewkimi k3kimi k3 benchmarkskimi k3 prijzenmoonshot aiopen-weight llm

Dit artikel delen

Start je project

Klaar om iets buitengewoons te bouwen?

Laten we je idee werkelijkheid maken. Ons team staat klaar om software te bouwen die het verschil maakt.