
Recenzie Kimi K3: Modelul open de 2,8T al Moonshot vs Fable 5 și GPT-5.6 Sol
Ultima verificare: 17 iulie 2026. Fiecare specificație, preț și benchmark de mai jos a fost reverificat în raport cu documentația platformei Moonshot, Artificial Analysis și surse independente în ziua publicării acestui articol. Kimi K3 a fost lansat pe 16 iulie 2026.
În această recenzie Kimi K3, un singur număr de la lansare spune totul: noul model al Moonshot a debutat pe locul #1 în clasamentul Arena Frontend Code, o salt de 17 poziții față de Kimi K2.6, clasându-se peste Claude Fable 5. Este vorba despre un model chinezesc open-weight care câștigă un concurs de codare front-end, judecat de developeri reali în matchup-uri oarbe. Sub capotă, este un design Mixture-of-Experts (MoE) cu 2,8 trilioane de parametri, care activează doar 16 din cei 896 de experți per token, citește un context de un milion de tokeni și are prețuri pentru input între 0,30 și 3,00 USD per milion. Captura pe care trebuie să o știi înainte de a te entuziasma: nu poți descărca încă weight-urile, iar Moonshot anunță că acest lucru se va schimba pe 27 iulie.
Verdict rapid:
- Ce este: Modelul flagship al Moonshot AI, un model MoE cu 2,8T parametri, context de 1M, input nativ pentru imagini și video și raționament mereu activ. ID API
kimi-k3. - Unde câștigă: navigare agențială (BrowseComp 91.2) și codare pe orizont lung (SWE Marathon 42.0, peste atât Fable 5, cât și GPT-5.6 Sol). Locul #1 în Arena Frontend Code.
- Unde rămâne în urmă: FrontierSWE și HLE-Full (Fable 5 conduce), DeepSWE (GPT-5.6 Sol conduce). Clasamentul independent Artificial Analysis îl plasează pe locul #4 din 189 în total.
- Cât costă: 0,30 USD cache-hit / 3,00 USD input fresh, 15,00 USD output per milion de tokeni. Cel mai scump model lansat vreodată de un laborator chinezesc.
- Captura: open-weight doar cu numele, deoarece checkpoint-ul nu devine public până pe 27 iulie 2026. Până atunci, fără self-hosting și fără evaluări independente terțe.
Dacă vrei răspunsul într-o singură propoziție: Kimi K3 este primul model open-weight care se luptă de la egal la egal cu frontier-a closed, dar este un software de zi de lansare cu o lansare a weight-urilor în așteptare și un preț premium. Citește mai departe pentru specificații, realitatea benchmark-urilor (inclusiv o nuanță care schimbă modul în care ar trebui să interpretezi fiecare număr), calculul prețurilor și cine ar trebui să îl folosească efectiv.
Ce este Kimi K3?
Kimi K3 este cel mai nou model de limbaj mare al Moonshot AI, lansat pe 16 iulie 2026. Este un model Mixture-of-Experts cu 2,8 trilioane de parametri totali, care activează doar 16 dintre cei 896 de experți ai săi la fiecare token, astfel încât costul de calcul per token rămâne mult sub ceea ce ar necesita un model dens de 2,8T. Acceptă text, imagini și video, menține o fereastră de context de un milion de tokeni și păstrează raționamentul activat implicit.
Iată fișa tehnică, pe scurt.
| Specificație | Kimi K3 |
|---|---|
| Lansat | 16 iulie 2026 |
| Developer | Moonshot AI |
| Parametri totali | 2,8 trilioane (Mixture-of-Experts) |
| Activi per token | 16 din 896 experți |
| Atenție | Kimi Delta Attention (KDA), decodare de până la 6,3x mai rapidă la context de 1M |
| Fereastră context | 1.000.000 tokeni |
| Modalități | Input text, imagine și video |
| Raționament | Mereu activ; un singur nivel „max” la lansare |
| ID model API | kimi-k3 (compatibil cu OpenAI-SDK) |
| Weight-uri | Open-weight; lansare publică promisă pentru 27 iulie 2026 |
| Preț per M tokeni | 0,30 USD cache-hit sau 3,00 USD input fresh, 15,00 USD output |
Povestea inginerescă interesantă este design-ul atenției. Moonshot îl numește Kimi Delta Attention, sau KDA, un mecanism hibrid de atenție liniară despre care compania raportează că oferă o decodare de până la 6,3 ori mai rapidă în contexte de un milion de tokeni. K3 îl asociază cu o serie de trucuri noi pe care laboratorul le numește Attention Residuals, Gated MLA și Stable LatentMoE. Nu trebuie să memorezi acronimele. Ceea ce adună toate acestea laolaltă este un model care poate rămâne rapid în timp ce gestionează un context enorm, exact sarcina de lucru care blochează arhitecturile mai vechi.
Pune K3 lângă modelul pe care îl înlocuiește și saltul este mare. Își triplează aproape numărul de parametri față de Kimi K2 (2,8T față de aproximativ 1T), cvadruplează fereastra de context a liniei K2.6 și K2.7 (1M față de 256K) și adaugă input pentru imagini și video unei familii care era anterior orientată spre text. Dacă ai încercat un Kimi anterior și ai dat din umeri, acesta este un animal diferit.
Benchmark-uri Kimi K3: Unde Câștigă și Unde Nu
Benchmark-urile de lansare ale Kimi K3 sunt genuin puternice și genuin mixte. Conduce terenul în unele sarcini de codare și agențiale, dar rămâne clar în urma frontier-ei closed în altele. Înainte de tabel, o nuanță care contează mai mult decât orice scor individual: Moonshot a rulat fiecare model în propriul său mediu de codare. K3 a fost scorat în KimiCode, Fable 5 în Claude Code, iar GPT-5.6 Sol în Codex. Software-ul care înconjoară un model îi afectează rezultatele, așa că citește aceste date ca fiind direcționale, nu ca un clasament stabilit definitiv.
Iată cifrele principale de codare și agențiale din tabelul de lansare al Moonshot.
| Benchmark | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Program Bench | 77.8 | 77.6 | 76.8 |
| SWE Marathon | 42.0 | 39.0 | 35.0 |
| Terminal-Bench 2.1 | 88.3 | 88.8 | 84.6 |
| DeepSWE | 67.5 | 73.0 | 70.0 |
| FrontierSWE | 81.2 | 71.3 | 86.6 |
| BrowseComp | 91.2 | nepublicat | nepublicat |
| OmniDocBench | 91.1 | nepublicat | nepublicat |
Citind rândurile, apare un tipar. K3 câștigă munca lungă și grea. La SWE Marathon, care măsoară sesiuni de inginerie susținute pe durata mai multor ore, scorul de 42.0 al lui K3 bate atât GPT-5.6 Sol, cât și Fable 5 cu o marjă clară. Depășește ușor competiția la Program Bench și conduce și pe partea agențială, obținând 91.2 la BrowseComp și 91.1 la OmniDocBench, unde Moonshot raportează, de asemenea, primul loc la Automation Bench.
Unde pierde? La DeepSWE, GPT-5.6 Sol ia avans cu 73.0. La FrontierSWE, Fable 5 este clar în frunte cu 86.6, deși merită subliniat că scorul de 81.2 al lui K3 bate totuși scorul de 71.3 al lui Sol acolo. Tabelul propriu al Moonshot recunoaște că K3 rămâne în urma lui Fable 5 la FrontierSWE și HLE-Full și în urma lui GPT-5.6 Sol la DeepSWE. Acesta nu este un model care bate frontier-a peste tot. Este un model care o bate undeva, lucru pe care nicio lansare open-weight nu reușise cu adevărat înainte.
Lectura independentă confirmă acest lucru. Artificial Analysis punctează K3 cu 57 în Indexul său de Inteligență și îl clasează pe locul #4 din 189 de modele, în spatele Claude Fable 5 și a două setări de raționament GPT-5.6 Sol, dar în fața Claude Opus 4.8. Viteza sa măsurată de output este una destul de modestă, de 62 de tokeni pe secundă. Pe partea preferințelor umane, finish-ul pe locul #1 al lui K3 în Arena Frontend Code este remarcabil, deoarece acel clasament provine din voturile developerilor pe output front-end real, nu dintr-un scor auto-raportat.
Developerul independent Simon Willison a testat K3 prin testul său SVG pelican-on-a-bicycle în ziua lansării. Modelul a produs un rezultat solid și a scris text alternativ precis pentru propria sa imagine, ceea ce vorbește bine despre capacitatea sa de vision. El a semnalat, de asemenea, surpriza costurilor despre care vom vorbi în secțiunea de prețuri și le-a reamintit cititorilor că un test SVG rapid nu îți spune nimic despre apelarea agențială a tool-urilor, acolo unde un model ca acesta își câștigă pâinea. O precauție corectă.
Kimi K3 vs Fable 5, GPT-5.6 Sol, DeepSeek și Qwen
Așadar, unde se situează K3 în panorama largă? Două comparații contează: împotriva frontier-ei closed și împotriva colegilor săi modele chinezești open-weight.
Împotriva frontier-ei, încadrarea onestă este „adiacent frontier-ei, nu lider al frontier-ei”. Claude Fable 5 și GPT-5.6 Sol conduc încă clasamentele agregate de inteligență, iar Fable 5 păstrează un avantaj real în cele mai dificile evaluări de raționament și codare de frontieră. Ceea ce s-a schimbat cu K3 este că decalajul s-a redus la schimburi pe benchmark-uri individuale, mai degrabă decât la un abis categorial. Ca un model descărcabil să conducă SWE Marathon și să câștige un vot orb de codare front-end reprezintă un teritoriu nou.
Împotriva colegilor săi open-weight, K3 este noul reper maxim în ceea ce privește capacitatea brută, dar nu este opțiunea implicită evidentă pentru fiecare job. Dacă cântărești opțiunile chinezești open-weight ca grup, comparația noastră Qwen vs DeepSeek vs GLM explică modul în care aceste trei familii împart piața: Qwen pentru cea mai ușoară amprentă de self-host și cea mai permisivă licență, DeepSeek pentru cei mai ieftini tokeni, GLM pentru codare practică. K3 se situează acum peste toate acestea la benchmark-urile de vârf și, de asemenea, la preț. Este opțiunea premium într-o categorie care și-a construit reputația pe faptul că era ieftină.
Pentru un câmp mai larg care include modelele care bat efectiv calitatea de clasă GPT-4, lista noastră cu cele mai bune LLM open-source pentru 2026 pune afirmațiile lui K3 în context. Pe scurt: K3 ridică plafonul pentru weight-urile open, dar „weight-uri open” și „ieftin” au încetat oficial să mai fie același lucru.
Prețurile Kimi K3 și Calculul Cache-Hit
Aici devine K3 controversat. Moonshot îl prețuiește la 0,30 USD per milion de tokeni de input cu cache-hit, 3,00 USD per milion de tokeni de input fresh și 15,00 USD per milion de tokeni de output, tarife fixe pe întreaga fereastră de context de un milion de tokeni.
Aliniază-l cu modelul pe care îl înlocuiește și schimbarea este drastică.
| Tip token | Kimi K3 | Kimi K2.6 |
|---|---|---|
| Input, fresh | 3,00 USD / M | 0,95 USD / M |
| Input, cache-hit | 0,30 USD / M | nedisclosed |
| Output | 15,00 USD / M | 4,00 USD / M |
Aceasta reprezintă o creștere de aproximativ 3x la input și de aproape 4x la output față de K2.6. Willison a remarcat că rata de 3/15 USD se încadrează în aceeași ligă cu Claude Sonnet. The Decoder a numit K3 un semnal că era AI-ului chinezesc super-ieftin se încheie. Dacă întregul tău motiv pentru rularea unui model chinezesc era prețul, K3 te va face să te gândești de două ori.
Dar rata de cache-hit este numărul care decide factura ta reală, așa că hai să facem matematica pentru o buclă agențială realistă, folosind ratele publicate de Moonshot. Să zicem că agentul tău de codare citește un context de codebase de 200.000 de tokeni și scrie 8.000 de tokeni de output, și face asta de 20 de ori pe zi:
- Cache-miss (prima citire rece): 200.000 tokeni de input la 3,00 USD/M înseamnă 0,60 USD, plus 8.000 tokeni de output la 15,00 USD/M înseamnă 0,12 USD. Asta înseamnă aproximativ 0,72 USD per apel, sau 14,40 USD pe zi.
- Cache-hit (context repetat, cazul comun într-o sesiune de codare): 200.000 tokeni de input la 0,30 USD/M înseamnă 0,06 USD, plus aceiași 0,12 USD pentru output. Asta înseamnă aproximativ 0,18 USD per apel, sau 3,60 USD pe zi.
Economia cache-ului reduce factura de input de aproximativ zece ori, de la 0,60 USD la 0,06 USD per apel. Moonshot raportează peste 90% cache hits în sarcinile de codare, scenariul care face K3 accesibil financiar, mai degrabă decât exorbitant. Lecția pentru bugetul tău: K3 este scump la apelurile cold, one-shot și rezonabil într-o buclă warm, cu context intens.
O altă capcană de cost scoasă la iveală de Willison. K3 expune astăzi un singur nivel de raționament „max”, iar tokenii de raționament se facturează la rata de output. Testul său simplu SVG a consumat 13.241 de tokeni de raționament în plus față de 3.417 tokeni de output, astfel încât un prompt trivial a costat aproximativ 25 de cenți. Nu există încă un mod „low reasoning” ieftin, ceea ce înseamnă că K3 plătește în exces pentru întrebările ușoare. Dacă controlul costurilor este prioritatea ta, ghidurile noastre despre prețurile API LLM și cum să reduci costurile API LLM se aplică direct aici: folosește cache-ul agresiv, direcționează apelurile banale către un model mai ieftin și rezervă K3 pentru munca grea, cu context lung, unde își justifică premium-ul.
Weight-uri Open: Ce Înseamnă De Facto „Open” Aici
Aceasta este partea pe care titlurile de lansare au trecut cu vederea. Kimi K3 este anunțat ca un model open-weight, iar Moonshot are un istoric real în livrarea de checkpoint-uri descărcabile. Dar, începând cu 17 iulie 2026, weight-urile K3 nu sunt publice. Organizația Moonshot Hugging Face listează încă doar checkpoint-uri din seria K2. Compania afirmă că weight-urile complete vor sosi pe 27 iulie 2026.
De ce contează acest decalaj? Trei motive practice:
- Fără self-hosting încă. Nu poți rula K3 pe hardware-ul propriu sau pe un cluster privat până când nu apar weight-urile. Pentru echipele cu cerințe de rezidență a datelor sau air-gap, K3 este doar API momentan, ceea ce anulează o parte importantă din motivul pentru care ai alege un model open. Când weight-urile vor ajunge, ghidurile noastre despre cele mai bune tool-uri pentru rularea LLM local și rularea unui LLM local te vor ajuta să începi, deși un model cu 2,8T parametri este de clasă cluster, nu de laptop.
- Fără evaluări independente încă. Fiecare benchmark K3 pe care l-ai văzut este rulat de vendor, în mediul propriu al Moonshot. Numere serioase terțe pentru lucruri precum HLE sau sarcini specifice agenților nu pot exista până când laboratoarele externe nu au weight-urile pentru testare. Tratează tabelul de lansare ca pe o afirmație puternică, nu ca pe un rezultat verificat.
- Termenii licenței sunt încă în stabilizare. Lansările Kimi anterioare au folosit licențe permisive, dar confirmă licența exactă K3 în raport cu model card-ul oficial când checkpoint-ul este publicat, mai ales dacă planifici o implementare comercială.
Niciunul dintre aceste aspecte nu face ca K3 să fie mai puțin impresionant. Înseamnă doar că, dacă planul tău depinde de descărcarea și fine-tuning-ul modelului, evaluarea ta reală începe pe 27 iulie, nu pe 16 iulie.
Cum Evaluăm Kimi K3 pentru Munca cu Clienții
O notă rapidă despre originea acestei recenzii și unde se oprește. La Techsy, integrăm LLM-uri terțe în pipeline-uri de producție pentru clienți B2B, de obicei prin endpoint-uri compatibile cu OpenAI-SDK, astfel încât să putem schimba modelele fără a reconstrui infrastructura. K3 se potrivește perfect pe această cale: expune un API compatibil cu OpenAI cu ID-ul modelului kimi-k3, astfel încât introducerea sa într-o integrare existentă pentru trial este o schimbare de configurare, nu o rescriere.
De fiecare dată când apare un model nou, îl supunem aceleiași evaluări fixe pe sarcini reprezentative pentru clienți înainte de a recomanda ceva. Și iată limita onestă a acestei recenzii: nu publicăm încă propriul nostru scor K3. Weight-urile nu sunt disponibile, benchmark-urile de lansare au fost rulate de vendor în mediul propriu al Moonshot, iar un număr corect necesită o configurare neutră pe sarcini care seamănă cu munca reală a clienților, nu cu un clasament. Citarea unui benchmark first-party de la un model vechi de o zi, cu weight-urile în așteptare, ar fi exact genul de număr pe care le spunem clienților să nu aibă încredere.
Ceea ce putem evalua astăzi din API-ul live este partea care nu are nevoie de un clasament: suprafața de integrare, modelul de costuri și modurile de eșec. Calculul prețurilor de mai sus este calculul nostru propriu bazat pe ratele publicate de Moonshot, nu un benchmark, și îți spune deja adevărul operațional: disciplina cache-ului este diferența dintre K3 fiind accesibil și fiind o problemă de buget. Dacă vrei ajutor pentru a afla dacă un model precum K3 aparține stack-ului tău, acesta este genul de evaluare pe care îl facem la practica de integrare AI a Techsy, și poți programa o consultație gratuită pentru a discuta despre asta.
Cine Ar Trebui Să Folosească Kimi K3 (și Cine Nu)
Kimi K3 este o potrivire puternică pentru un set specific de joburi și o potrivire slabă pentru altele. Potrivește-l cu sarcina ta de lucru actuală.
Alege K3 dacă:
- Rulezi navigare agențială sau research. Liderii săi la BrowseComp și Automation Bench, plus lectura independentă de top pentru research agențial, îl fac cea mai capabilă opțiune open-weight pentru agenții care folosesc tool-uri chiar acum.
- Faci codare pe orizont lung. SWE Marathon este benchmark-ul care oglindește sesiunile de inginerie de câteva ore, iar K3 îl conduce. Dacă agenții tăi lucrează peste codebase-uri mari pe durate lungi, acesta este terenul său de joacă.
- Vrei un model open-weight adiacent frontier-ei și poți aștepta weight-urile. Dacă self-hosting-ul unui model open de top pe 27 iulie este obiectivul, K3 este candidatul cel mai capabil disponibil.
Așteaptă dacă:
- Ai nevoie de weight-uri astăzi. Până pe 27 iulie, K3 este doar API. Un model deja descărcabil te servește mai bine în această săptămână.
- Rulezi trafic high-volume, sensibil la costuri. Cu un singur nivel de raționament scump și prețuri premium pentru output, K3 plătește în exces pentru apeluri simple. Kimi K2.7-Code sau un model open mai ieftin câștigă la munca de volum.
- Ai nevoie de evaluări independente dovedite înainte de adoptare. Numerele de lansare sunt rulate de vendor. Dacă procesul tău cere verificare terță, acordă-i câteva săptămâni.
Întrebări Frecvente
Ce este Kimi K3?
Kimi K3 este modelul flagship de limbaj mare al Moonshot AI, lansat pe 16 iulie 2026. Este un model Mixture-of-Experts cu 2,8 trilioane de parametri care activează 16 din 896 de experți per token, suportă o fereastră de context de 1M tokeni și acceptă input text, imagine și video cu raționamentul mereu activ.
Este Kimi K3 open source?
Kimi K3 este anunțat ca un model open-weight, dar weight-urile nu sunt publice începând cu 17 iulie 2026. Moonshot afirmă că checkpoint-ul complet va fi lansat pe 27 iulie 2026. Până atunci, este disponibil doar prin aplicațiile Kimi și API, deci nu îl poți self-host încă.
Cum diferă Kimi K3 de Kimi K2?
K3 își triplează aproape numărul de parametri față de K2 (2,8 trilioane față de aproximativ 1 trilion), cvadruplează fereastra de context a liniei K2.6 și K2.7 (1M față de 256K tokeni) și adaugă input nativ pentru imagini și video unei familii care era anterior axată pe text. Introduce, de asemenea, noul design Kimi Delta Attention.
Cât costă Kimi K3?
Moonshot prețuiește K3 la 0,30 USD per milion de tokeni de input cu cache-hit, 3,00 USD per milion de tokeni de input fresh și 15,00 USD per milion de tokeni de output. Aceasta este de aproximativ trei ori prețul de input al lui K2.6 și de aproape patru ori prețul său de output, făcând din K3 cel mai scump model lansat de un laborator chinezesc.
Care este fereastra de context a Kimi K3?
Kimi K3 suportă o fereastră de context de un milion de tokeni, iar prețurile rămân fixe pe întreaga această fereastră. Modelul folosește un nou design de atenție numit Kimi Delta Attention, despre care Moonshot raportează că oferă o decodare de până la 6,3 ori mai rapidă la lungimi de context de un milion de tokeni.
Pot rula Kimi K3 local?
Nu încă. Weight-urile nu sunt publice până pe 27 iulie 2026. După aceea, self-hosting-ul este posibil din punct de vedere tehnic, dar un model cu 2,8 trilioane de parametri necesită hardware de clasă cluster, nu o singură stație de lucru, astfel încât majoritatea echipelor îl vor accesa tot prin API.
Este Kimi K3 realmente mai bun decât Fable 5?
Depinde de sarcină. K3 bate Claude Fable 5 la SWE Marathon, Program Bench și votul orb de codare front-end din Arena. Fable 5 conduce încă la FrontierSWE, HLE-Full și în clasamentele agregate generale de inteligență. Fiecare benchmark de lansare a fost rulat, de asemenea, în mediul propriu al fiecărui vendor, așa că tratează victoriile pe benchmark-uri individuale ca fiind direcționale.
Este Kimi K3 bun pentru codare?
Da, mai ales pentru sesiuni de codare lungi și susținute și pentru munca front-end, unde conduce currently. Este, de asemenea, puternic la sarcini agențiale și de terminal. Principalul dezavantaj este costul: cu un singur nivel de raționament scump, plătește în exces pentru apeluri banale, așa că asociază-l cu modele mai ieftine pentru munca rutinieră de volum mare.
Cum accesez Kimi K3?
Poți folosi Kimi K3 prin aplicația web Kimi, Kimi Work și Kimi Code, sau prin API cu ID-ul modelului kimi-k3. API-ul este compatibil cu OpenAI-SDK, deci adăugarea sa la o integrare existentă de stil OpenAI este în mare parte o schimbare de configurare.
Despre Autor
Mert Batur Gurbuz, Co-Founder, Techsy.io (University of Birmingham). Conectează-te pe LinkedIn.
Mert Batur Gurbuz este Co-Founder al Techsy.io, unde echipa livrează agenți AI, sisteme de automatizare și pipeline-uri voice/SDR pentru clienți B2B. Studiază la University of Birmingham și scrie despre stack-ul de tool-uri LLM pe care echipa Techsy îl folosește efectiv în producție.
Concluzii Cheie
- Kimi K3 este primul model open-weight care se luptă genuin cu frontier-a closed, conducând SWE Marathon și ocupând primul loc în votul orb de codare front-end al Arena, peste Claude Fable 5.
- Este adiacent frontier-ei, nu lider al frontier-ei. Artificial Analysis independent îl clasează pe locul #4 din 189, iar el rămâne în urma lui Fable 5 la cele mai dificile teste de raționament și codare de frontieră.
- Open cu numele, în așteptare în practică. Weight-urile nu sunt publicate până pe 27 iulie 2026, deci nu există self-hosting și nici evaluare independentă până atunci.
- Prețul a pus capăt erei AI chinezesc ieftin. La 3/15 USD per milion de tokeni, disciplina cache-ului este ceea ce menține K3 accesibil; bugetează pentru o buclă warm, cu context intens, nu pentru apeluri cold one-shot.
- Cel mai bun pentru research agențial și codare pe orizont lung. Dacă ai nevoie de weight-uri astăzi sau rulezi trafic high-volume sensibil la costuri, așteaptă sau alege un model mai ieftin. Vorbește cu noi dacă vrei ajutor pentru a decide.