
Kimi K3 : le modèle open-weight 2.8T de Moonshot face à Fable 5 et GPT-5.6 Sol
Dernière vérification : 17 juillet 2026. Chaque spécification, prix et benchmark ci-dessous a été revérifié auprès de la documentation de la plateforme Moonshot, d'Artificial Analysis et de sources indépendantes le jour de la mise en ligne. Kimi K3 a été lancé le 16 juillet 2026.
Dans cet avis Kimi K3, un seul chiffre de lancement résume tout : le nouveau modèle de Moonshot a débuté #1 du classement Frontend Code d'Arena, un bond de 17 places par rapport à Kimi K2.6, devançant Claude Fable 5. C'est un modèle chinois open-weight qui remporte un concours de codage front-end jugé par de vrais développeurs lors de duels en aveugle. Sous le capot, c'est une architecture Mixture-of-Experts à 2.8 trillion de paramètres qui n'active que 16 des 896 experts par token, lit un million de tokens de contexte, et facture l'entrée entre $0.30 et $3.00 par million. Le piège à connaître avant de s'emballer : impossible de télécharger les poids pour l'instant, et Moonshot annonce que ça change le 27 juillet.
Verdict rapide :
- Ce que c'est : le fleuron de Moonshot AI, un modèle MoE à 2.8T paramètres avec 1M de contexte, entrée native image et vidéo, et raisonnement toujours activé. ID API
kimi-k3. - Ses points forts : navigation agentique (BrowseComp 91.2) et codage longue durée (SWE Marathon 42.0, au-dessus de Fable 5 et GPT-5.6 Sol). #1 sur la Frontend Code Arena d'Arena.
- Ses points faibles : FrontierSWE et HLE-Full (Fable 5 en tête), DeepSWE (GPT-5.6 Sol en tête). Artificial Analysis, indépendant, le classe #4 sur 189 au global.
- Ce que ça coûte : $0.30 en cache-hit / $3.00 en entrée fraîche, $15.00 en sortie par million de tokens. Le modèle le plus cher jamais publié par un laboratoire chinois.
- Le piège : open-weight de nom, mais le checkpoint ne sera public que le 27 juillet 2026. D'ici là, pas d'auto-hébergement ni d'évaluations tierces indépendantes.
Si vous voulez la réponse en une ligne : Kimi K3 est le premier modèle open-weight qui rivalise vraiment avec la frontière fermée, mais c'est un logiciel de jour de lancement avec une sortie des poids en attente et un tarif premium. La suite couvre les spécifications, la réalité des benchmarks (avec une réserve qui change la façon de lire chaque chiffre), le calcul des prix, et qui devrait vraiment l'utiliser.
Qu'est-ce que Kimi K3 ?
Kimi K3 est le tout dernier grand modèle de langage de Moonshot AI, lancé le 16 juillet 2026. C'est un modèle Mixture-of-Experts avec 2.8 trillion de paramètres au total, qui n'active que 16 de ses 896 experts à chaque token, si bien que le coût de calcul par token reste bien en dessous de ce qu'exigerait un modèle dense de 2.8T. Il accepte texte, images et vidéo, tient une fenêtre de contexte d'un million de tokens, et garde le raisonnement activé par défaut.
Voici la fiche technique en un coup d'œil.
| Spécification | Kimi K3 |
|---|---|
| Date de lancement | 16 juillet 2026 |
| Développeur | Moonshot AI |
| Paramètres totaux | 2.8 trillion (Mixture-of-Experts) |
| Actifs par token | 16 des 896 experts |
| Attention | Kimi Delta Attention (KDA), jusqu'à 6.3x de décodage plus rapide à 1M de contexte |
| Fenêtre de contexte | 1,000,000 tokens |
| Modalités | Entrée texte, image et vidéo |
| Raisonnement | Toujours activé ; un seul niveau « max » au lancement |
| ID du modèle API | kimi-k3 (compatible OpenAI-SDK) |
| Poids | Open-weight ; sortie publique promise pour le 27 juillet 2026 |
| Prix par M tokens | $0.30 en cache-hit ou $3.00 en entrée fraîche, $15.00 en sortie |
L'histoire technique intéressante, c'est le design de l'attention. Moonshot l'appelle Kimi Delta Attention, ou KDA, un mécanisme d'attention linéaire hybride qui, selon l'entreprise, offre jusqu'à 6.3x de décodage plus rapide sur des contextes d'un million de tokens. K3 l'associe à une pile de techniques plus récentes que le laboratoire nomme Attention Residuals, Gated MLA et Stable LatentMoE. Pas besoin de retenir les acronymes. Ce qu'ils permettent, au final, c'est un modèle capable de rester rapide tout en portant un contexte énorme, exactement la charge de travail qui fait craquer les architectures plus anciennes.
Placez K3 à côté du modèle qu'il remplace, et le bond est énorme. Il triple presque le nombre de paramètres de Kimi K2 (2.8T contre environ 1T), quadruple la fenêtre de contexte de la lignée K2.6 et K2.7 (1M contre 256K), et ajoute l'entrée image et vidéo à une famille qui était jusque-là centrée sur le texte. Si un Kimi précédent vous avait laissé indifférent, celui-ci est une autre bête.
Benchmarks Kimi K3 : ses points forts et ses points faibles
Les benchmarks de lancement de Kimi K3 sont vraiment solides, et vraiment mitigés. Il domine le peloton sur certaines tâches de codage et d'agent, et il traîne clairement derrière la frontière fermée sur d'autres. Avant le tableau, une réserve qui compte plus que n'importe quel score isolé : Moonshot a fait tourner chaque modèle dans son propre environnement de codage. K3 a été évalué dans KimiCode, Fable 5 dans Claude Code, et GPT-5.6 Sol dans Codex. Le logiciel qui entoure un modèle influence ses résultats, donc lisez ces chiffres comme une tendance, pas comme un classement définitif.
Voici les chiffres phares de codage et d'agent issus du tableau de lancement de Moonshot.
| Benchmark | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Program Bench | 77.8 | 77.6 | 76.8 |
| SWE Marathon | 42.0 | 39.0 | 35.0 |
| Terminal-Bench 2.1 | 88.3 | 88.8 | 84.6 |
| DeepSWE | 67.5 | 73.0 | 70.0 |
| FrontierSWE | 81.2 | 71.3 | 86.6 |
| BrowseComp | 91.2 | non publié | non publié |
| OmniDocBench | 91.1 | non publié | non publié |
En parcourant les lignes, un schéma se dessine. K3 gagne sur le travail long et exigeant. Sur SWE Marathon, qui mesure des sessions d'ingénierie soutenues sur plusieurs heures, le 42.0 de K3 bat GPT-5.6 Sol et Fable 5 avec une marge nette. Il devance légèrement le peloton sur Program Bench, et il mène aussi côté agent, avec 91.2 sur BrowseComp et 91.1 sur OmniDocBench, où Moonshot revendique également la première place sur Automation Bench.
Où perd-il ? Sur DeepSWE, GPT-5.6 Sol prend l'avantage avec 73.0. Sur FrontierSWE, Fable 5 est nettement devant avec 86.6, même s'il faut noter que le 81.2 de K3 bat quand même le 71.3 de Sol sur ce point. Le tableau de Moonshot lui-même reconnaît que K3 est derrière Fable 5 sur FrontierSWE et HLE-Full, et derrière GPT-5.6 Sol sur DeepSWE. Ce n'est pas un modèle qui bat la frontière partout. C'est un modèle qui la bat quelque part, ce qu'aucune sortie open-weight n'avait vraiment réussi jusqu'ici.
La lecture indépendante confirme cela. Artificial Analysis attribue à K3 un score de 57 sur son Intelligence Index et le classe #4 sur 189 modèles, derrière Claude Fable 5 et deux configurations de raisonnement de GPT-5.6 Sol, mais devant Claude Opus 4.8. Sa vitesse de sortie mesurée reste assez modeste, à 62 tokens par seconde. Côté préférence humaine, la première place de K3 sur la Frontend Code Arena d'Arena est ce qui ressort le plus, car ce classement vient de développeurs qui votent sur du vrai code front-end plutôt que d'un score auto-déclaré.
Le développeur indépendant Simon Willison a soumis K3 à son test SVG du pélican à vélo le jour du lancement. Le modèle a produit un résultat solide et écrit un texte alternatif précis pour sa propre image, ce qui dit du bien de sa vision. Il a aussi signalé la surprise côté coût qu'on aborde dans la partie tarification, et a rappelé à ses lecteurs qu'un simple test SVG ne dit rien sur l'appel d'outils agentique, là où un modèle comme celui-ci doit vraiment faire ses preuves. Une mise en garde justifiée.
Kimi K3 face à Fable 5, GPT-5.6 Sol, DeepSeek et Qwen
Alors, où se situe K3 dans le paysage plus large ? Deux comparaisons comptent : face à la frontière fermée, et face à ses homologues chinois open-weight.
Face à la frontière, le cadrage honnête est « proche de la frontière, pas au sommet ». Claude Fable 5 et GPT-5.6 Sol dominent encore les classements d'intelligence globale, et Fable 5 garde une vraie avance sur les évaluations de raisonnement les plus dures et de codage frontière. Ce qui a changé avec K3, c'est que l'écart s'est réduit à des échanges benchmark par benchmark plutôt qu'à un gouffre de catégorie. Qu'un modèle téléchargeable mène SWE Marathon et remporte un vote en aveugle sur le codage front-end, c'est un territoire inédit.
Face à ses pairs open-weight, K3 fixe la nouvelle barre en matière de capacité brute, mais ce n'est pas le choix évident pour chaque tâche. Si vous comparez les options chinoises open-weight dans leur ensemble, notre comparatif Qwen vs DeepSeek vs GLM détaille comment ces trois familles se partagent le marché : Qwen pour l'empreinte d'auto-hébergement la plus légère et la licence la plus permissive, DeepSeek pour les tokens les moins chers, GLM pour le codage pratique au quotidien. K3 se place désormais au-dessus de tous sur les benchmarks de pointe, et au-dessus d'eux côté prix aussi. C'est l'option premium d'une catégorie qui a bâti sa réputation sur des prix bas.
Pour un panorama plus large incluant les modèles qui dépassent réellement la qualité de la classe GPT-4, notre comparatif des meilleurs LLM open source pour 2026 remet les affirmations de K3 en contexte. En résumé : K3 relève le plafond pour les modèles open-weight, mais « open-weight » et « pas cher » ont officiellement cessé d'être synonymes.
Prix de Kimi K3 et le calcul du cache-hit
C'est là que K3 divise. Moonshot le facture à $0.30 par million de tokens d'entrée en cache-hit, $3.00 par million de tokens d'entrée fraîche, et $15.00 par million de tokens en sortie, un tarif fixe sur toute la fenêtre d'un million de tokens.
Comparé au modèle qu'il remplace, le changement est brutal.
| Type de token | Kimi K3 | Kimi K2.6 |
|---|---|---|
| Entrée, fraîche | $3.00 / M | $0.95 / M |
| Entrée, cache-hit | $0.30 / M | non divulgué |
| Sortie | $15.00 / M | $4.00 / M |
C'est un bond d'environ 3x sur l'entrée et de presque 4x sur la sortie par rapport à K2.6. Willison a noté que le tarif $3/$15 se situe dans la même gamme que Claude Sonnet. The Decoder a présenté K3 comme le signal que l'ère de l'IA chinoise ultra-bon-marché touche à sa fin. Si votre seule raison de choisir un modèle chinois était le prix, K3 va vous faire réfléchir à deux fois.
Mais le tarif cache-hit est le chiffre qui décide de votre facture réelle, alors faisons le calcul sur une boucle agentique réaliste, avec les tarifs publiés par Moonshot. Disons que votre agent de codage lit un contexte de codebase de 200,000 tokens et écrit 8,000 tokens de sortie, et qu'il fait ça 20 fois par jour :
- Cache-miss (première lecture à froid) : 200,000 tokens d'entrée à $3.00/M donnent $0.60, plus 8,000 tokens de sortie à $15.00/M donnent $0.12. Ça fait environ $0.72 par appel, soit $14.40 par jour.
- Cache-hit (contexte répété, le cas courant dans une session de codage) : 200,000 tokens d'entrée à $0.30/M donnent $0.06, plus les mêmes $0.12 de sortie. Ça fait environ $0.18 par appel, soit $3.60 par jour.
L'économie du cache divise la facture d'entrée par environ dix, de $0.60 à $0.06 par appel. Moonshot annonce plus de 90% de cache hits sur les charges de codage, un scénario qui rend K3 abordable plutôt que vertigineux. La leçon pour votre budget : K3 est cher sur des appels à froid, ponctuels, et raisonnable dans une boucle chaude et riche en contexte.
Autre piège de coût relevé par Willison. K3 n'expose aujourd'hui qu'un seul niveau de raisonnement « max », et les tokens de raisonnement sont facturés au tarif de sortie. Son simple test SVG a brûlé 13,241 tokens de raisonnement en plus de 3,417 tokens de sortie, si bien qu'un prompt anodin a coûté environ 25 cents. Il n'existe pas encore de mode « raisonnement faible » économique, ce qui veut dire que K3 surpaie sur les questions faciles. Si la maîtrise des coûts est votre priorité, nos guides sur le prix des API LLM et comment réduire les coûts d'API LLM s'appliquent directement ici : mettez en cache de manière agressive, redirigez les appels anodins vers un modèle moins cher, et réservez K3 au travail long et complexe où il justifie sa prime.
Poids ouverts : ce que « open » signifie vraiment ici
C'est la partie que les gros titres de lancement ont survolée. Kimi K3 est annoncé comme un modèle open-weight, et Moonshot a un vrai historique de checkpoints téléchargeables déjà publiés. Mais au 17 juillet 2026, les poids de K3 ne sont pas publics. L'organisation Hugging Face de Moonshot ne liste encore que des checkpoints de la série K2. L'entreprise annonce que les poids complets arrivent le 27 juillet 2026.
Pourquoi cet écart compte-t-il ? Trois raisons concrètes :
- Pas d'auto-hébergement pour l'instant. Impossible de faire tourner K3 sur votre propre matériel ou un cluster privé tant que les poids ne sont pas sortis. Pour les équipes avec des contraintes de résidence des données ou d'air-gap, K3 n'est disponible que via l'API pour le moment, ce qui annule une grande partie de l'intérêt de choisir un modèle ouvert. Quand les poids arriveront, nos guides sur les meilleurs outils pour faire tourner des LLM en local et comment faire tourner un LLM en local vous aideront à démarrer, même si un modèle à 2.8T de paramètres relève du cluster, pas du laptop.
- Pas d'évaluations indépendantes pour l'instant. Chaque benchmark K3 que vous avez vu vient du fournisseur lui-même, dans son propre environnement. Des chiffres tiers sérieux sur des sujets comme HLE ou des tâches spécifiques aux agents ne peuvent pas exister tant que des labos externes n'ont pas les poids à tester. Considérez le tableau de lancement comme une affirmation forte, pas un résultat vérifié.
- Les conditions de licence sont encore en cours de définition. Les précédentes sorties Kimi utilisaient des licences permissives, mais vérifiez la licence exacte de K3 sur la fiche modèle officielle une fois le checkpoint publié, surtout si vous envisagez un déploiement commercial.
Rien de tout ça ne rend K3 moins impressionnant. Cela signifie juste que si votre projet dépend du téléchargement et du fine-tuning du modèle, votre vraie évaluation commence le 27 juillet, pas le 16 juillet.
Comment nous évaluons Kimi K3 pour nos clients
Une brève précision sur d'où vient ce test, et où il s'arrête. Chez Techsy, nous intégrons des LLM tiers dans des pipelines de production pour des clients B2B, généralement via des endpoints compatibles OpenAI-SDK, pour pouvoir changer de modèle sans reconstruire toute la plomberie. K3 s'intègre bien dans cette approche : il expose une API compatible OpenAI avec l'ID de modèle kimi-k3, donc l'ajouter à une intégration existante pour le tester revient à un changement de configuration, pas à une réécriture.
Chaque fois qu'un nouveau modèle sort, nous le faisons passer par la même évaluation fixe sur des tâches représentatives de nos clients avant de recommander quoi que ce soit. Et voici la limite honnête de ce test : nous ne publions pas encore notre propre score K3. Les poids ne sont pas sortis, les benchmarks de lancement viennent du fournisseur lui-même dans son propre environnement, et un chiffre équitable a besoin d'une configuration neutre sur des tâches qui ressemblent à du vrai travail client, pas d'un classement. Citer un benchmark maison venant d'un modèle vieux d'un jour et aux poids toujours en attente serait exactement le genre de chiffre que nous conseillons à nos clients de ne pas croire.
Ce que nous pouvons évaluer dès aujourd'hui à partir de l'API en production, c'est la partie qui ne nécessite pas de classement : la surface d'intégration, le modèle de coût, et les modes de défaillance. Le calcul de prix ci-dessus est notre propre calcul à partir des tarifs publiés par Moonshot, pas un benchmark, et il vous dit déjà la vérité opérationnelle : la discipline de cache fait toute la différence entre un K3 abordable et un K3 qui plombe le budget. Si vous voulez de l'aide pour déterminer si un modèle comme K3 a sa place dans votre stack, c'est exactement le type d'évaluation que nous faisons chez Techsy, dans notre practice d'intégration IA, et vous pouvez réserver une consultation gratuite pour en discuter.
Qui devrait utiliser Kimi K3 (et qui devrait s'abstenir)
Kimi K3 convient très bien à certains types de tâches et beaucoup moins bien à d'autres. Faites correspondre le modèle à votre charge de travail réelle.
Optez pour K3 si :
- Navigation ou recherche agentique. Ses avances sur BrowseComp et Automation Bench, plus la meilleure lecture indépendante en recherche agentique, en font l'option open-weight la plus capable pour les agents qui utilisent des outils, à ce jour.
- Codage longue durée. SWE Marathon est le benchmark qui reflète des sessions d'ingénierie de plusieurs heures, et K3 le mène. Si vos agents travaillent sur de grandes codebases sur de longues durées, c'est son terrain de prédilection.
- Modèle open-weight proche de la frontière. Si vous pouvez attendre les poids et que l'objectif est d'auto-héberger un modèle ouvert haut de gamme le 27 juillet, K3 est le candidat le plus capable disponible.
Attendez si :
- Besoin des poids aujourd'hui. Jusqu'au 27 juillet, K3 n'est disponible que via l'API. Un modèle déjà téléchargeable vous servira mieux cette semaine.
- Trafic à fort volume et sensible au coût. Avec un seul niveau de raisonnement coûteux et une tarification de sortie premium, K3 surpaie sur les appels simples. Kimi K2.7-Code ou un modèle ouvert moins cher l'emporte sur le travail en masse.
- Évaluations indépendantes exigées avant adoption. Les chiffres de lancement viennent du fournisseur. Si votre processus exige une vérification tierce, laissez passer quelques semaines.
Questions fréquentes
Qu'est-ce que Kimi K3 ?
Kimi K3 est le grand modèle de langage phare de Moonshot AI, lancé le 16 juillet 2026. C'est un modèle Mixture-of-Experts à 2.8 trillion de paramètres qui active 16 des 896 experts par token, prend en charge une fenêtre de contexte de 1M tokens, et accepte texte, image et vidéo en entrée avec le raisonnement toujours activé.
Kimi K3 est-il open source ?
Kimi K3 est annoncé comme un modèle open-weight, mais les poids ne sont pas publics au 17 juillet 2026. Moonshot annonce que le checkpoint complet sera publié le 27 juillet 2026. D'ici là, il n'est disponible que via les applications Kimi et l'API, vous ne pouvez donc pas encore l'auto-héberger.
En quoi Kimi K3 diffère-t-il de Kimi K2 ?
K3 triple presque le nombre de paramètres de K2 (2.8 trillion contre environ 1 trillion), quadruple la fenêtre de contexte de la lignée K2.6 et K2.7 (1M contre 256K tokens), et ajoute une entrée native image et vidéo à une famille jusque-là centrée sur le texte. Il introduit aussi le nouveau design Kimi Delta Attention.
Combien coûte Kimi K3 ?
Moonshot facture K3 à $0.30 par million de tokens d'entrée en cache-hit, $3.00 par million de tokens d'entrée fraîche, et $15.00 par million de tokens en sortie. C'est environ le triple du prix d'entrée de K2.6 et presque le quadruple de son prix de sortie, ce qui fait de K3 le modèle le plus cher jamais publié par un laboratoire chinois.
Quelle est la fenêtre de contexte de Kimi K3 ?
Kimi K3 prend en charge une fenêtre de contexte d'un million de tokens, et le tarif reste fixe sur toute cette fenêtre. Le modèle utilise un nouveau design d'attention appelé Kimi Delta Attention, qui offre selon Moonshot jusqu'à 6.3x de décodage plus rapide sur des contextes d'un million de tokens.
Puis-je faire tourner Kimi K3 en local ?
Pas encore. Les poids ne seront publics que le 27 juillet 2026. Après cette date, l'auto-hébergement sera techniquement possible, mais un modèle à 2.8 trillion de paramètres a besoin d'un matériel de niveau cluster plutôt que d'un simple poste de travail, donc la plupart des équipes continueront d'y accéder via l'API.
Kimi K3 est-il vraiment meilleur que Fable 5 ?
Ça dépend de la tâche. K3 bat Claude Fable 5 sur SWE Marathon, Program Bench, et le vote en aveugle d'Arena sur le codage front-end. Fable 5 reste devant sur FrontierSWE, HLE-Full, et les classements d'intelligence globale. Chaque benchmark de lancement a aussi tourné dans l'environnement propre de chaque fournisseur, donc considérez les victoires sur un seul benchmark comme des tendances plutôt que des certitudes.
Kimi K3 est-il bon pour le codage ?
Oui, surtout pour les sessions de codage longues et soutenues et le travail front-end, où il est actuellement en tête. Il est aussi solide sur les tâches agentiques et de terminal. Le principal inconvénient est le coût : avec un seul niveau de raisonnement coûteux, il surpaie sur les appels anodins, donc associez-le à des modèles moins chers pour le travail routinier à fort volume.
Comment accéder à Kimi K3 ?
Vous pouvez utiliser Kimi K3 via l'application web Kimi, Kimi Work et Kimi Code, ou via l'API avec l'ID de modèle kimi-k3. L'API est compatible OpenAI-SDK, donc l'ajouter à une intégration existante de type OpenAI se résume la plupart du temps à un changement de configuration.
À propos de l'auteur
Mert Batur, Co-Founder, Techsy.io. Connect on LinkedIn.
Mert Batur est cofondateur de Techsy.io, où l'équipe déploie des agents IA, des systèmes d'automatisation et des pipelines voix/SDR pour des clients B2B. Il écrit sur la pile d'outils LLM que l'équipe Techsy utilise réellement en production.
Points clés à retenir
- Premier modèle open-weight à vraiment rivaliser avec la frontière fermée : Kimi K3 mène SWE Marathon et remporte le vote en aveugle d'Arena sur le front-end, devant Claude Fable 5.
- Proche de la frontière, pas au sommet. Artificial Analysis, indépendant, le classe #4 sur 189, et il reste derrière Fable 5 sur les tests de raisonnement et de codage frontière les plus durs.
- Ouvert de nom, en attente dans les faits. Les poids ne seront publiés que le 27 juillet 2026, donc pas d'auto-hébergement ni d'évaluation indépendante avant cette date.
- Le prix a mis fin à l'ère de l'IA chinoise bon marché. À $3/$15 par million de tokens, la discipline de cache est ce qui garde K3 abordable ; prévoyez une boucle chaude et riche en contexte, pas des appels à froid ponctuels.
- Idéal pour la recherche agentique et le codage longue durée. Si vous avez besoin des poids dès aujourd'hui ou gérez un trafic à fort volume sensible au coût, attendez ou choisissez un modèle moins cher. Contactez-nous si vous voulez de l'aide pour décider.