
Recenze Kimi K3: Moonshotův open model s 2,8 biliony parametrů versus Fable 5 a GPT-5.6 Sol
Poslední ověření: 17. července 2026. Každá specifikace, cena a benchmark níže byly znovu zkontrolovány podle dokumentace platformy Moonshot, Artificial Analysis a nezávislých zdrojů v den publikace tohoto článku. Kimi K3 byl spuštěn 16. července 2026.
V této recenzi Kimi K3 mluví jedno startovací číslo jasně: nový model od Moonshot debutoval na 1. místě v žebříčku Frontend Code na Arena, což je skok o 17 příček oproti Kimi K2.6 a umístění nad modelem Claude Fable 5. Jde o čínský open-weight model, který vyhrál soutěž ve front-endovém kódování hodnocenou skutečnými vývojáři v anonymních soubojích. Pod kapotou se jedná o architekturu Mixture-of-Experts s 2,8 bilionu parametrů, která aktivuje pouze 16 z 896 expertů na token, zpracovává kontext o délce jednoho milionu tokenů a účtuje vstup mezi 0,30 $ a 3,00 $ za milion tokenů. Háček, který musíte znát, než se začnete radovat: váhy modelu zatím nelze stáhnout a Moonshot uvádí, že se to změní 27. července.
Rychlý verdikt:
- Co to je: Vlajková loď Moonshot AI, MoE model s 2,8 bilionu parametrů, kontextem 1M tokenů, nativním vstupem pro obrázky a video a vždy zapnutým uvažováním (reasoning). ID modelu v API je
kimi-k3. - Kde vítězí: Agentní prohlížení webu (BrowseComp 91,2) a dlouhodobé kódování (SWE Marathon 42,0, nad oběma Fable 5 i GPT-5.6 Sol). Číslo 1 ve Frontend Code Arena.
- Kde zaostává: FrontierSWE a HLE-Full (vede Fable 5), DeepSWE (vede GPT-5.6 Sol). Nezávislá analýza Artificial Analysis ho řadí na celkové 4. místo ze 189 modelů.
- Cena: 0,30 $ za cache-hit / 3,00 $ za čerstvý vstup, 15,00 $ za výstup na milion tokenů. Nejdražší model, jaký kdy čínská laboratoř vydala.
- Háček: Oficiálně open-weight, ale checkpoint nebude veřejný až do 27. července 2026. Do té doby žádné self-hosting ani nezávislá hodnocení třetích stran.
Pokud hledáte odpověď v jedné větě: Kimi K3 je prvním open-weight modelem, který si může měřit síly s uzavřenou špičkou trhu, ale jde o software prvního dne vydání s čekajícím uvolněním vah a prémiovou cenou. Čtěte dále pro specifikace, realitu benchmarků (včetně upozornění, které mění způsob, jakým byste měli číst každé číslo), cenovou matematiku a informace o tom, kdo by ho měl skutečně používat.
Co je Kimi K3?
Kimi K3 je nejnovější velký jazykový model od Moonshot AI, vydaný 16. července 2026. Jedná se o model typu Mixture-of-Experts s celkem 2,8 bilionu parametrů, který aktivuje pouze 16 ze svých 896 expertů na každý token, takže výpočetní náklady na token zůstávají výrazně nižší než u hustého (dense) modelu s 2,8 bilionu parametrů. Přijímá text, obrázky a video, disponuje kontextovým oknem o velikosti jednoho milionu tokenů a má ve výchozím nastavení zapnuté uvažování (reasoning).
Zde je přehled specifikací na první pohled.
| Specifikace | Kimi K3 |
|---|---|
| Vydáno | 16. července 2026 |
| Vývojář | Moonshot AI |
| Celkový počet parametrů | 2,8 bilionu (Mixture-of-Experts) |
| Aktivních na token | 16 z 896 expertů |
| Attention mechanismus | Kimi Delta Attention (KDA), až 6,3x rychlejší dekódování při kontextu 1M |
| Kontextové okno | 1 000 000 tokenů |
| Modality | Textový, obrazový a video vstup |
| Reasoning | Vždy zapnuto; při spuštění pouze jedna úroveň „max“ |
| ID modelu v API | kimi-k3 (kompatibilní s OpenAI SDK) |
| Váhy | Open-weight; veřejné vydání slíbeno na 27. července 2026 |
| Cena za M tokenů | 0,30 $ cache-hit nebo 3,00 $ čerstvý vstup, 15,00 $ výstup |
Zajímavým inženýrským příběhem je design attention mechanismu. Moonshot jej nazývá Kimi Delta Attention neboli KDA, hybridní lineární attention mechanismus, který podle společnosti poskytuje až 6,3x rychlejší dekódování v kontextech s miliony tokenů. K3 jej kombinuje s řadou novějších triků, které laboratoř nazývá Attention Residuals, Gated MLA a Stable LatentMoE. Nemusíte si pamatovat zkratky. Dohromady dávají model, který dokáže zůstat rychlý i při nesení enormního kontextu, což je přesně ta zátěž, která láme starší architektury.
Když postavíte K3 vedle modelu, který nahrazuje, rozdíl je velký. Téměř trojnásobně zvyšuje počet parametrů oproti Kimi K2 (2,8 bilionu versus přibližně 1 bilion), čtyřnásobně zvětšuje kontextové okno linie K2.6 a K2.7 (1M versus 256K) a přidává vstup pro obrázky a video do rodiny, která byla dříve zaměřena primárně na text. Pokud jste vyzkoušeli dřívější verzi Kimi a pokrčili rameny, toto je jiné zvíře.
Benchmarky Kimi K3: Kde vítězí a kde ne
Startovací benchmarky Kimi K3 jsou skutečně silné, ale také smíšené. Na některých úkolech kódování a agentních úlohách vede pole, zatímco na jiných jasně zaostává za uzavřenou špičkou trhu. Před tabulkou je třeba uvést jedno upozornění, které je důležitější než jakékoli jednotlivé skóre: Moonshot spustil každý model ve svém vlastním kódovacím prostředí. K3 byl hodnocen v KimiCode, Fable 5 v Claude Code a GPT-5.6 Sol v Codex. Software, který obaluje model, ovlivňuje jeho výsledky, takže tyto údaje berte jako směrové, nikoliv jako ustálený žebříček.
Zde jsou hlavní čísla pro kódování a agenty z launch tabulky Moonshot.
| Benchmark | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Program Bench | 77,8 | 77,6 | 76,8 |
| SWE Marathon | 42,0 | 39,0 | 35,0 |
| Terminal-Bench 2.1 | 88,3 | 88,8 | 84,6 |
| DeepSWE | 67,5 | 73,0 | 70,0 |
| FrontierSWE | 81,2 | 71,3 | 86,6 |
| BrowseComp | 91,2 | nezveřejněno | nezveřejněno |
| OmniDocBench | 91,1 | nezveřejněno | nezveřejněno |
Když se podíváte napříč řádky, objeví se vzorec. K3 vítězí v dlouhé, namáhavé práci. Na SWE Marathon, který měří udržení výkonu během vícehodinových inženýrských sesí, K3 s hodnotou 42,0 poráží jak GPT-5.6 Sol, tak Fable 5 s jasným náskokem. Na Program Bench těsně vede pole a vede i na straně agentů, kde dosahuje 91,2 na BrowseComp a 91,1 na OmniDocBench, kde Moonshot hlásí také první místo na Automation Bench.
Kde prohrává? Na DeepSWE přebírá vedení GPT-5.6 Sol s hodnotou 73,0. Na FrontierSWE je Fable 5 jasně napřed s 86,6, ačkoli stojí za to zdůraznit, že K3 s 81,2 tam stále poráží Sol s 71,3. Vlastní tabulka Moonshot připouští, že K3 zaostává za Fable 5 na FrontierSWE a HLE-Full a za GPT-5.6 Sol na DeepSWE. Není to model, který poráží špičku všude. Je to model, který ji poráží někde, což se žádnému open-weight vydání doposud příliš nepodařilo.
Nezávislý pohled to potvrzuje. Artificial Analysis hodnotí K3 na 57 bodů ve svém Intelligence Index a řadí jej na 4. místo ze 189 modelů, za Claude Fable 5 a dvěma nastaveními reasoning pro GPT-5.6 Sol, ale před Claude Opus 4.8. Jeho naměřená rychlost výstupu je poměrně skromných 62 tokenů za sekundu. Na straně lidských preferencí je standoutem 1. místo K3 ve Frontend Code Arena, protože toto hodnocení pochází od vývojářů hlasujících o skutečném front-endovém výstupu, nikoliv ze samoohlášeného skóre.
Nezávislý vývojář Simon Willison nechal K3 projít svým testem SVG pelikána na kole v den spuštění. Model vytvořil solidní výsledek a napsal přesný alt text pro svůj vlastní obrázek, což svědčí dobře o jeho vizuálních schopnostech. Také upozornil na cenové překvapení, ke kterému se dostaneme v sekci o cenách, a připomněl čtenářům, že rychlý test SVG vám nic neřekne o agentic tool calling, což je oblast, kde si takový model vydělává na své místo. Spravedlivé varování.
Kimi K3 vs Fable 5, GPT-5.6 Sol, DeepSeek a Qwen
Takže kde se K3 nachází v širším poli? Důležitá jsou dvě srovnání: proti uzavřené špičce a proti ostatním čínským open-weight modelům.
Proti špičce je upřímné rámecování „blízko špičky, ale ne na vrcholu“. Claude Fable 5 a GPT-5.6 Sol stále vedou v agregovaných žebříčcích inteligence a Fable 5 si udržuje skutečnou výhodu v nejtěžších úlohách reasoning a frontier-coding. To, co se změnilo s K3, je, že se mezera zúžila na souboje v jednotlivých benchmarcích, nikoliv na propast mezi kategoriemi. Pro stažitelný model vést v SWE Marathon a vyhrát anonymní hlasování ve front-endovém kódování je nové území.
Proti svým open-weight kolegům je K3 novou laťkou v surových schopnostech, ale není zřejmou volbou pro každou práci. Pokud zvažujete čínské open-weight možnosti jako skupinu, naše srovnání Qwen vs DeepSeek vs GLM ukazuje, jak tyto tři rodiny rozdělují trh: Qwen pro nejlehčí self-hosting a nejpovolnější licenci, DeepSeek pro nejlevnější tokeny, GLM pro praktické kódování. K3 nyní stojí nad všemi nimi ve špičkových benchmarcích a také v ceně. Je to prémiová možnost v kategorii, která si vybudovala pověst levnosti.
Pro širší pole včetně modelů, které skutečně porážejí kvalitu třídy GPT-4, náš přehled nejlepších open-source LLM pro rok 2026 zasazuje tvrzení K3 do kontextu. Krátká verze: K3 zvyšuje strop pro open weights, ale „open weights“ a „levné“ oficiálně přestaly být totéž.
Ceny Kimi K3 a matematika cache-hit
Zde se K3 stává kontroverzním. Moonshot jej oceňuje na 0,30 $ za milion vstupních tokenů z cache (cache-hit), 3,00 $ za milion čerstvých vstupních tokenů a 15,00 $ za milion výstupních tokenů, plošně pro celé kontextové okno o milionu tokenů.
Když to srovnáte s modelem, který nahrazuje, posun je drastický.
| Typ tokenu | Kimi K3 | Kimi K2.6 |
|---|---|---|
| Vstup, čerstvý | 3,00 $ / M | 0,95 $ / M |
| Vstup, cache-hit | 0,30 $ / M | nezveřejněno |
| Výstup | 15,00 $ / M | 4,00 $ / M |
To je zhruba trojnásobný skok u vstupu a téměř čtyřnásobný u výstupu oproti K2.6. Willison poznamenal, že sazba 3 $/15 $ spadá do stejné tieru jako Claude Sonnet. The Decoder označil K3 za signál, že éra superlevné čínské AI končí. Pokud byl vaším hlavním důvodem pro používání čínského modelu cena, K3 vás donutí se zamyslet.
Ale míra úspěšnosti cache (cache-hit rate) je číslo, které rozhoduje o vašem skutečném účtu, takže si udělejme matematiku pro realistický agentní cyklus pomocí publikovaných sazeb Moonshot. Řekněme, že váš kódovací agent přečte kontext kódové báze o 200 000 tokenech a napíše 8 000 tokenů výstupu, a dělá to 20krát denně:
- Cache-miss (první studené čtení): 200 000 vstupních tokenů za 3,00 $/M je 0,60 $, plus 8 000 výstupních tokenů za 15,00 $/M je 0,12 $. To je asi 0,72 $ za volání, neboli 14,40 $ denně.
- Cache-hit (opakovaný kontext, běžný případ v kódovací relaci): 200 000 vstupních tokenů za 0,30 $/M je 0,06 $, plus stejných 0,12 $ za výstup. To je asi 0,18 $ za volání, neboli 3,60 $ denně.
Ekonomika cache snižuje účet za vstup přibližně desetkrát, z 0,60 $ na 0,06 $ za volání. Moonshot hlásí více než 90 % úspěšnost cache u kódovacích úloh, což je scénář, který činí K3 dostupným, nikoliv astronomicky drahým. Poučení pro váš rozpočet: K3 je drahý při studených, jednorázových voláních a rozumný v teplém, kontextově náročném cyklu.
Ještě jednu cenovou past objevil Willison. K3 dnes exposeuje pouze jednu úroveň reasoning „max“ a reasoning tokeny se účtují sazbou pro výstup. Jeho jednoduchý SVG test spotřeboval 13 241 reasoning tokenů navíc k 3 417 výstupním tokenům, takže triviální prompt stál asi 25 centů. Zatím neexistuje žádný levný režim „low reasoning“, což znamená, že K3 přeplácí na snadných otázkách. Pokud je vaší prioritou kontrola nákladů, naše průvodce cenami LLM API a jak snížit náklady na LLM API se sem přímo hodí: agresivně cachujte, směrujte triviální volání na levnější model a rezervujte si K3 pro těžkou, dlouhou kontextovou práci, kde si zaslouží prémii.
Open Weights: Co „Open“ zde skutečně znamená
To je část, kterou launch titulky přehlédly. Kimi K3 je oznámen jako open-weight model a Moonshot má skutečnou historii vydávání stažitelných checkpointů. Ale k 17. červenci 2026 nejsou váhy K3 veřejné. Organizace Moonshot na Hugging Face stále uvádí pouze checkpointy série K2. Společnost říká, že plné váhy dorazí 27. července 2026.
Proč je tato mezera důležitá? Tři praktické důvody:
- Zatím žádné self-hosting. Nemůžete spustit K3 na svém vlastním hardwaru nebo soukromém clusteru, dokud váhy nepadnou. Pro týmy s požadavky na rezidenci dat nebo air-gap je K3 zatím pouze API-only, což poráží velkou část důvodů, proč byste si vybrali open model. Když váhy dorazí, naše průvodce nejlepšími nástroji pro běh LLM lokálně a během LLM lokálně vám pomohou začít, ačkoli model s 2,8 bilionu parametrů je spíše clusterové třídy než laptopové.
- Zatím žádná nezávislá hodnocení. Každý benchmark K3, který jste viděli, je prováděn vendorem, v prostředí Moonshot. Vážná třetí strana nemůže existovat u věcí jako HLE nebo agent-specific tasks, dokud externí laboratoře nemají váhy k testování. Berte launch tabulku jako silné tvrzení, nikoliv ověřený výsledek.
- Licenční podmínky se stále usazují. Předchozí vydání Kimi používala permisivní licence, ale potvrďte přesnou licenci K3 proti oficiální model card, když bude checkpoint publikován, zejména pokud plánujete komerční nasazení.
Žádné z toho nedělá K3 méně působivým. Znamená to však, že pokud váš plán závisí na stažení a fine-tuning modelu, vaše skutečné hodnocení začíná 27. července, nikoliv 16. července.
Jak hodnotíme Kimi K3 pro klientskou práci
Rychlá poznámka k tomu, odkud tato recenze pochází a kde končí. V Techsy zapojujeme LLM třetích stran do produkčních pipeline pro B2B klienty, obvykle prostřednictvím endpointů kompatibilních s OpenAI SDK, abychom mohli měnit modely bez přestavby infrastruktury. K3 do této cesty čistě zapadá: exposeuje API kompatibilní s OpenAI s ID modelu kimi-k3, takže jeho nasazení do existující integrace pro vyzkoušení je změna konfigurace, nikoliv přepis.
Pokaždé, když přijde nový model, spustíme jej prostřednictvím stejného fixního hodnocení na úlohách reprezentativních pro klienty, než něco doporučíme. A zde je upřímný limit této recenze: ještě nezveřejňujeme naše vlastní skóre K3. Váhy nejsou venku, launch benchmarky byly prováděny vendorem v prostředí Moonshot a férové číslo potřebuje neutrální setup na úlohách, které vypadají jako skutečná klientská práce, nikoliv žebříček. Citování first-party benchmarku z modelu starého jeden den s čekajícími váhami by bylo přesně ten typ čísla, kterému říkáme klientům, aby nedůvěřovali.
Co můžeme dnes hodnotit z live API, je část, která nepotřebuje žebříček: integrační povrch, cenový model a failure modes. Cenová matematika výše je náš vlastní výpočet z publikovaných sazeb Moonshot, nikoliv benchmark, a již vám říká operační pravdu: disciplína v cache je rozdílem mezi tím, zda je K3 dostupný, nebo problémem pro rozpočet. Pokud chcete pomoc s určením, zda model jako K3 patří do vašeho stacku, to je typ hodnocení, které děláme v praxi AI integrace Techsy, a můžete si rezervovat bezplatnou konzultaci a probrat to.
Kdo by měl používat Kimi K3 (a kdo ne)
Kimi K3 je silnou volbou pro specifickou sadu úloh a špatnou volbou pro jiné. Přizpůsobte ho své skutečné zátěži.
Sáhněte po K3, pokud:
- Provozujete agentní prohlížení nebo research. Jeho vedení v BrowseComp a Automation Bench plus nejlepší nezávislé čtení agent-research z něj dělají nejschopnější open-weight option pro agenty používající nástroje právě teď.
- Děláte dlouhodobé kódování. SWE Marathon je benchmark, který odráží vícehodinové inženýrské session, a K3 v něm vede. Pokud vaši agenti pracují napříč velkými kódovými základnami během dlouhých běhů, toto je jejich domovská půda.
- Chcete open-weight model blízko špičky a můžete počkat na váhy. Pokud je cílem self-hosting top-tier open modelu 27. července, K3 je nejvhodnější kandidát.
Počkejte, pokud:
- Potřebujete váhy dnes. Do 27. července je K3 pouze API-only. Již stažitelný model vám tento týden poslouží lépe.
- Provozujete vysoký objem trafficu citlivý na cenu. S jednou drahou úrovní reasoning a prémiovým cenováním výstupu K3 přeplácí na jednoduchých voláních. Kimi K2.7-Code nebo levnější open model vyhraje na hromadné práci.
- Vyžadujete pro ověřená, nezávislá hodnocení před adoptací. Launch čísla jsou vendor-run. Pokud váš proces vyžaduje ověření třetí stranou, dejte mu několik týdnů.
Často kladené dotazy
Co je Kimi K3?
Kimi K3 je vlajková loď velkých jazykových modelů od Moonshot AI, vydaná 16. července 2026. Jedná se o model Mixture-of-Experts s 2,8 bilionu parametrů, který aktivuje 16 z 896 expertů na token, podporuje kontextové okno 1M tokenů a přijímá textový, obrazový a video vstup s vždy zapnutým reasoning.
Je Kimi K3 open source?
Kimi K3 je oznámen jako open-weight model, ale váhy nejsou veřejné k 17. červenci 2026. Moonshot říká, že plný checkpoint bude vydán 27. července 2026. Do té doby je dostupný pouze prostřednictvím aplikací Kimi a API, takže jej zatím nemůžete self-hostovat.
Jak se Kimi K3 liší od Kimi K2?
K3 téměř trojnásobně zvyšuje počet parametrů K2 (2,8 bilionu versus přibližně 1 bilion), čtyřnásobně zvětšuje kontextové okno linie K2.6 a K2.7 (1M versus 256K tokenů) a přidává nativní vstup pro obrázky a video do rodiny, která byla dříve zaměřena na text. Také zavádí nový design Kimi Delta Attention.
Kolik stojí Kimi K3?
Moonshot oceňuje K3 na 0,30 $ za milion vstupních tokenů z cache, 3,00 $ za milion čerstvých vstupních tokenů a 15,00 $ za milion výstupních tokenů. To je zhruba trojnásobek vstupní ceny K2.6 a téměř čtyřnásobek jeho výstupní ceny, což činí K3 nejdražším modelem vydaným čínskou laboratoří.
Jaké je kontextové okno Kimi K3?
Kimi K3 podporuje kontextové okno o velikosti jednoho milionu tokenů a cena zůstává plošná pro celé toto okno. Model používá nový design attention nazvaný Kimi Delta Attention, který podle Moonshot poskytuje až 6,3x rychlejší dekódování při délce kontextu v řádu milionů tokenů.
Mohu spustit Kimi K3 lokálně?
Zatím ne. Váhy nejsou veřejné až do 27. července 2026. Poté je self-hosting technicky možný, ale model s 2,8 bilionu parametrů potřebuje hardware clusterové třídy, nikoliv jednu pracovní stanici, takže většina týmů k němu bude stále přistupovat prostřednictvím API.
Je Kimi K3 opravdu lepší než Fable 5?
Záleží na úloze. K3 poráží Claude Fable 5 na SWE Marathon, Program Bench a v anonymním hlasování ve front-endovém kódování na Arena. Fable 5 stále vede na FrontierSWE, HLE-Full a v celkových agregovaných žebříčcích inteligence. Každý launch benchmark také běžel v prostředí každého vendora, takže berte vítězství v jednotlivých benchmarcích jako směrové.
Je Kimi K3 dobrý pro kódování?
Ano, zejména pro dlouhé, udržované kódovací session a front-endovou práci, kde aktuálně vede. Je také silný na agentních a terminálových úlohách. Hlavní nevýhodou jsou náklady: s jednou drahou úrovní reasoning přeplácí na triviálních voláních, takže jej párujte s levnějšími modely pro vysoký objem rutinní práce.
Jak získám přístup ke Kimi K3?
Můžete používat Kimi K3 prostřednictvím webové aplikace Kimi, Kimi Work a Kimi Code, nebo prostřednictvím API s ID modelu kimi-k3. API je kompatibilní s OpenAI SDK, takže jeho přidání do existující integrace ve stylu OpenAI je většinou změna konfigurace.
O autorovi
Mert Batur Gurbuz, spoluzakladatel, Techsy.io (University of Birmingham). Spoňte se na LinkedIn.
Mert Batur Gurbuz je spoluzakladatelem Techsy.io, kde tým dodává AI agenty, automatizační systémy a voice/SDR pipeline pro B2B klienty. Studuje na University of Birmingham a píše o stacku nástrojů pro LLM, který tým Techsy skutečně používá v produkci.
Klíčová zjištění
- Kimi K3 je prvním open-weight modelem, který si skutečně měří síly s uzavřenou špičkou, vede v SWE Marathon a topped anonymní hlasování ve front-endovém kódování na Arena nad Claude Fable 5.
- Je blízko špičky, ale ne na vrcholu. Nezávislá Artificial Analysis jej řadí na 4. místo ze 189 a zaostává za Fable 5 v nejtěžších testech reasoning a frontier-coding.
- Open v názvu, čekající v praxi. Váhy nejsou publikovány až do 27. července 2026, takže do té doby není žádné self-hosting ani nezávislé hodnocení.
- Cena ukončila éru levné čínské AI. Při 3 $/15 $ za milion tokenů je disciplína v cache tím, co udržuje K3 dostupný; rozpočtujte na teplý, kontextově náročný cyklus, nikoliv na studená jednorázová volání.
- Nejlepší pro agentní research a dlouhodobé kódování. Pokud potřebujete váhy dnes nebo provozujete vysoký objem trafficu citlivý na cenu, počkejte nebo zvolte levnější model. Promluvte si s námi, pokud chcete pomoc s rozhodováním.