ai-machine-learning

Recensione Kimi K3: il Modello Open da 2.8T di Moonshot contro Fable 5 e GPT-5.6 Sol

Scritto da Mert Batur
Jul 17, 2026
18 lettura
Recensione Kimi K3: il Modello Open da 2.8T di Moonshot contro Fable 5 e GPT-5.6 Sol

Recensione Kimi K3: il Modello Open da 2.8T di Moonshot contro Fable 5 e GPT-5.6 Sol

Ultima verifica: 17 luglio 2026. Ogni specifica, prezzo e benchmark qui sotto è stato ricontrollato rispetto alla documentazione della piattaforma di Moonshot, Artificial Analysis e fonti indipendenti il giorno stesso della pubblicazione. Kimi K3 è stato lanciato il 16 luglio 2026.

In questa recensione di Kimi K3 è un solo numero di lancio a parlare: il nuovo modello di Moonshot ha debuttato al #1 nella classifica Frontend Code di Arena, un salto di 17 posizioni rispetto a Kimi K2.6, superando persino Claude Fable 5. Un modello open-weight cinese che vince un contest di coding front-end giudicato da sviluppatori reali in confronti alla cieca. Sotto il cofano è un design Mixture-of-Experts da 2.8 trilioni di parametri che attiva solo 16 esperti su 896 per token, legge un milione di token di contesto e prezza l'input tra $0.30 e $3.00 per milione. La trappola da conoscere prima di entusiasmarsi: i pesi non sono ancora scaricabili, e Moonshot promette che cambierà il 27 luglio.

Verdetto rapido:

  • Cos'è: il modello di punta di Moonshot AI, un modello MoE da 2.8T di parametri con contesto da 1M, input nativo di immagini e video, e reasoning sempre attivo. ID API kimi-k3.
  • Dove vince: navigazione agentica (BrowseComp 91.2) e coding a lungo orizzonte (SWE Marathon 42.0, sopra sia Fable 5 sia GPT-5.6 Sol). #1 nella Frontend Code Arena di Arena.
  • Dove resta indietro: FrontierSWE e HLE-Full (guida Fable 5), DeepSWE (guida GPT-5.6 Sol). Artificial Analysis indipendente lo classifica #4 su 189 complessivamente.
  • Quanto costa: $0.30 cache-hit / $3.00 input fresco, $15.00 output per milione di token. Il modello più costoso mai rilasciato da un laboratorio cinese.
  • La trappola: open-weight di nome, ma il checkpoint non sarà pubblico fino al 27 luglio 2026. Fino ad allora, niente self-hosting e nessuna valutazione indipendente di terze parti.

Se vuoi la risposta in una riga: Kimi K3 è il primo modello open-weight che se la gioca davvero alla pari con la frontiera chiusa, ma è software da day-one con un rilascio dei pesi ancora sospeso e un prezzo premium. Continua a leggere per le specifiche, la realtà dei benchmark (incluso un avvertimento che cambia il modo in cui devi leggere ogni numero), la matematica dei prezzi e chi dovrebbe davvero usarlo.

Cos'è Kimi K3?

Kimi K3 è il più recente modello linguistico di grandi dimensioni di Moonshot AI, uscito il 16 luglio 2026. È un modello Mixture-of-Experts con 2.8 trilioni di parametri totali che attiva soltanto 16 dei suoi 896 esperti a ogni token, così il costo di calcolo per token resta ben al di sotto di quello che richiederebbe un modello denso da 2.8T. Accetta testo, immagini e video, ha una finestra di contesto da un milione di token e mantiene il reasoning attivo di default.

Ecco la scheda tecnica in breve.

SpecificaKimi K3
Uscita16 luglio 2026
SviluppatoreMoonshot AI
Parametri totali2.8 trilioni (Mixture-of-Experts)
Attivi per token16 esperti su 896
AttenzioneKimi Delta Attention (KDA), fino a 6.3x di decoding più veloce a 1M di contesto
Finestra di contesto1,000,000 token
ModalitàInput di testo, immagini e video
ReasoningSempre attivo; un unico livello "max" al lancio
ID modello APIkimi-k3 (compatibile OpenAI-SDK)
PesiOpen-weight; rilascio pubblico promesso per il 27 luglio 2026
Prezzo per M token$0.30 cache-hit oppure $3.00 input fresco, $15.00 output

La parte tecnica più interessante è il design dell'attenzione. Moonshot la chiama Kimi Delta Attention, o KDA, un meccanismo di attenzione lineare ibrida che, secondo l'azienda, offre fino a 6.3x di decoding più veloce su contesti da un milione di token. K3 la abbina a una serie di tecniche più recenti che il laboratorio chiama Attention Residuals, Gated MLA e Stable LatentMoE. Non serve memorizzare gli acronimi. Il risultato è un modello che resta veloce anche con un contesto enorme, esattamente il tipo di carico che manda in crisi le architetture più vecchie.

Se metti K3 accanto al modello che sostituisce, il salto è enorme. Quasi triplica il conteggio dei parametri di Kimi K2 (2.8T contro circa 1T), quadruplica la finestra di contesto della linea K2.6 e K2.7 (1M contro 256K) e aggiunge input di immagini e video a una famiglia che prima era incentrata sul testo. Se avevi provato un Kimi precedente e non ti aveva convinto, qui è tutta un'altra storia.

Benchmark di Kimi K3: Dove Vince e Dove No

I benchmark di lancio di Kimi K3 sono davvero solidi, e davvero misti. Domina il campo su alcuni task di coding e agentici e resta chiaramente indietro rispetto alla frontiera chiusa su altri. Prima della tabella, un avvertimento che conta più di qualsiasi singolo punteggio: Moonshot ha testato ogni modello nel proprio ambiente di coding. K3 è stato valutato in KimiCode, Fable 5 in Claude Code e GPT-5.6 Sol in Codex. Il software che avvolge un modello ne influenza i risultati, quindi leggi questi numeri come indicativi, non come una classifica definitiva.

Ecco i numeri principali di coding e agenti dalla tabella di lancio di Moonshot.

BenchmarkKimi K3GPT-5.6 SolClaude Fable 5
Program Bench77.877.676.8
SWE Marathon42.039.035.0
Terminal-Bench 2.188.388.884.6
DeepSWE67.573.070.0
FrontierSWE81.271.386.6
BrowseComp91.2non pubblicatonon pubblicato
OmniDocBench91.1non pubblicatonon pubblicato

Scorrendo le righe emerge uno schema. K3 vince sul lavoro lungo e faticoso. Su SWE Marathon, che misura sessioni di ingegneria sostenute per più ore, il 42.0 di K3 batte sia GPT-5.6 Sol sia Fable 5 con un margine netto. Supera di poco il campo su Program Bench, e guida anche sul fronte agentico, con 91.2 su BrowseComp e 91.1 su OmniDocBench, dove Moonshot riporta anche il primo posto su Automation Bench.

Dove perde? Su DeepSWE, GPT-5.6 Sol va avanti con 73.0. Su FrontierSWE, Fable 5 è nettamente avanti con 86.6, anche se vale la pena notare che l'81.2 di K3 batte comunque il 71.3 di Sol su quel fronte. La stessa tabella di Moonshot ammette che K3 resta indietro rispetto a Fable 5 su FrontierSWE e HLE-Full, e rispetto a GPT-5.6 Sol su DeepSWE. Non è un modello che batte la frontiera ovunque. È un modello che la batte in alcuni punti, cosa che nessun rilascio open-weight era mai riuscito davvero a fare prima.

La lettura indipendente lo conferma. Artificial Analysis assegna a K3 un punteggio di 57 sul suo Intelligence Index e lo colloca al #4 su 189 modelli, dietro Claude Fable 5 e due configurazioni di reasoning di GPT-5.6 Sol, ma davanti a Claude Opus 4.8. La sua velocità di output misurata è un modesto 62 token al secondo. Sul fronte delle preferenze umane, il primo posto di K3 nella Frontend Code Arena di Arena è il dato più rilevante, perché quella classifica nasce dal voto di sviluppatori su output front-end reali, non da un punteggio auto-dichiarato.

Lo sviluppatore indipendente Simon Willison ha sottoposto K3 al suo test SVG del pellicano in bicicletta il giorno del lancio. Il modello ha prodotto un risultato solido e ha scritto un alt text accurato per la propria immagine, il che dice bene della sua capacità visiva. Ha anche segnalato la sorpresa sui costi di cui parleremo nella sezione prezzi, e ha ricordato ai lettori che un rapido test SVG non dice nulla sulla capacità di chiamare strumenti in modo agentico, che è dove un modello come questo si guadagna davvero il proprio posto. Un avvertimento sensato.

Kimi K3 contro Fable 5, GPT-5.6 Sol, DeepSeek e Qwen

Allora dove si colloca K3 nel campo più ampio? Contano due confronti: con la frontiera chiusa e con gli altri modelli open-weight cinesi.

Rispetto alla frontiera, l'inquadramento onesto è "vicino alla frontiera, non in cima alla frontiera". Claude Fable 5 e GPT-5.6 Sol guidano ancora le classifiche aggregate di intelligenza, e Fable 5 mantiene un vantaggio reale sulle valutazioni di reasoning più difficili e sul coding di frontiera. Ciò che è cambiato con K3 è che il divario si è ridotto a scambi su singoli benchmark, non più a un abisso di categoria. Che un modello scaricabile guidi SWE Marathon e vinca un voto alla cieca sul coding front-end è un territorio nuovo.

Rispetto ai suoi pari open-weight, K3 è il nuovo punto di riferimento sulla capacità grezza, ma non è la scelta ovvia per ogni lavoro. Se stai valutando le opzioni open-weight cinesi come gruppo, il nostro confronto Qwen vs DeepSeek vs GLM spiega come queste tre famiglie si dividono il mercato: Qwen per l'impronta self-host più leggera e la licenza più permissiva, DeepSeek per i token più economici, GLM per il coding pratico. K3 ora si colloca sopra tutti loro sui benchmark di punta, e sopra di loro anche sul prezzo. È l'opzione premium in una categoria che ha costruito la propria reputazione sull'essere economica.

Per un campo più ampio, che include i modelli che battono davvero la qualità di classe GPT-4, la nostra rassegna dei migliori LLM open source per il 2026 mette in prospettiva le affermazioni di K3. La versione breve: K3 alza il soffitto per i modelli open-weight, ma "open-weight" ed "economico" hanno ufficialmente smesso di essere sinonimi.

Prezzi di Kimi K3 e la Matematica del Cache-Hit

Qui K3 diventa divisivo. Moonshot lo prezza a $0.30 per milione di token di input in cache-hit, $3.00 per milione di token di input fresco e $15.00 per milione di token di output, in modo uniforme su tutta la finestra di contesto da un milione di token.

Mettilo a confronto con il modello che sostituisce e il cambiamento salta all'occhio.

Tipo di tokenKimi K3Kimi K2.6
Input, fresco$3.00 / M$0.95 / M
Input, cache-hit$0.30 / Mnon dichiarato
Output$15.00 / M$4.00 / M

Si tratta di un salto di circa 3x sull'input e quasi 4x sull'output rispetto a K2.6. Willison ha notato che la tariffa $3/$15 si colloca nella stessa fascia di Claude Sonnet. The Decoder ha definito K3 un segnale che l'era dell'AI cinese super economica sta finendo. Se il tuo unico motivo per usare un modello cinese era il prezzo, K3 ti farà riflettere due volte.

Ma è la tariffa cache-hit il numero che decide il tuo conto reale, quindi facciamo i calcoli su un ciclo agentico realistico, usando le tariffe pubblicate da Moonshot. Supponi che il tuo agente di coding legga un contesto di codebase da 200,000 token e scriva 8,000 token di output, e lo faccia 20 volte al giorno:

  • Cache-miss (prima lettura a freddo): 200,000 token di input a $3.00/M fanno $0.60, più 8,000 token di output a $15.00/M fanno $0.12. Sono circa $0.72 per chiamata, o $14.40 al giorno.
  • Cache-hit (contesto ripetuto, il caso comune in una sessione di coding): 200,000 token di input a $0.30/M fanno $0.06, più gli stessi $0.12 di output. Sono circa $0.18 per chiamata, o $3.60 al giorno.

L'economia della cache taglia il conto dell'input di circa dieci volte, da $0.60 a $0.06 per chiamata. Moonshot riporta oltre il 90% di cache hit nei carichi di lavoro di coding, lo scenario che rende K3 conveniente invece che esoso. La lezione per il tuo budget: K3 è costoso su chiamate fredde e isolate, ragionevole dentro un ciclo caldo e ricco di contesto.

Un'altra trappola sui costi emersa da Willison. Oggi K3 espone un solo livello di reasoning, "max", e i token di reasoning vengono fatturati alla tariffa dell'output. Il suo semplice test SVG ha bruciato 13,241 token di reasoning oltre a 3,417 token di output, quindi un prompt banale è costato circa 25 cents. Non esiste ancora una modalità economica "low reasoning", il che significa che K3 paga troppo sulle domande facili. Se il controllo dei costi è la tua priorità, le nostre guide su prezzi delle API LLM e su come ridurre i costi delle API LLM si applicano direttamente qui: usa la cache in modo aggressivo, instrada le chiamate banali verso un modello più economico e riserva K3 al lavoro difficile e a lungo contesto dove si guadagna il premium.

Pesi Open: Cosa Significa Davvero "Open" Qui

Questa è la parte che i titoli di lancio hanno glissato. Kimi K3 è annunciato come modello open-weight, e Moonshot ha un track record reale nel rilasciare checkpoint scaricabili. Ma al 17 luglio 2026, i pesi di K3 non sono pubblici. L'organizzazione Moonshot su Hugging Face elenca ancora soltanto i checkpoint della serie K2. L'azienda afferma che i pesi completi arriveranno il 27 luglio 2026.

Perché conta questo divario? Tre motivi pratici:

  • Ancora niente self-hosting. Non puoi eseguire K3 sul tuo hardware o su un cluster privato finché i pesi non saranno disponibili. Per i team con requisiti di residenza dei dati o air-gap, K3 è per ora solo via API, il che vanifica gran parte del motivo per cui sceglieresti un modello open. Quando i pesi arriveranno, le nostre guide su i migliori strumenti per eseguire LLM in locale e su come eseguire un LLM in locale ti aiuteranno a partire, anche se un modello da 2.8T di parametri è di classe cluster, non di classe laptop.
  • Ancora nessuna valutazione indipendente. Ogni benchmark di K3 che hai visto è stato eseguito dal fornitore, nell'ambiente proprio di Moonshot. Numeri seri di terze parti su cose come HLE o task specifici per agenti non possono esistere finché i laboratori esterni non avranno i pesi da testare. Considera la tabella di lancio come un'affermazione forte, non come un risultato verificato.
  • I termini di licenza sono ancora in definizione. Le precedenti versioni di Kimi usavano licenze permissive, ma verifica la licenza esatta di K3 sulla model card ufficiale quando il checkpoint sarà pubblicato, soprattutto se pianifichi un deployment commerciale.

Niente di tutto ciò rende K3 meno notevole. Significa però che se il tuo piano dipende dallo scaricare e fare fine-tuning del modello, la tua vera valutazione inizia il 27 luglio, non il 16 luglio.

Come Stiamo Valutando Kimi K3 per il Lavoro con i Clienti

Una nota veloce su da dove viene questa recensione, e dove si ferma. In Techsy colleghiamo LLM di terze parti a pipeline di produzione per clienti B2B, di solito tramite endpoint compatibili con OpenAI-SDK, così possiamo cambiare modello senza ricostruire l'impianto. K3 si inserisce bene in questo percorso: espone un'API compatibile con OpenAI con l'ID modello kimi-k3, quindi inserirlo in un'integrazione esistente per provarlo è una modifica di configurazione, non una riscrittura.

Ogni volta che arriva un nuovo modello, lo sottoponiamo alla stessa valutazione fissa su task rappresentativi dei clienti prima di consigliare qualsiasi cosa. Ed ecco il limite onesto di questa recensione: non stiamo ancora pubblicando il nostro punteggio K3. I pesi non sono usciti, i benchmark di lancio sono stati eseguiti dal fornitore nel proprio ambiente Moonshot, e un numero equo richiede un setup neutrale su task che assomiglino al vero lavoro dei clienti, non a una classifica. Citare un benchmark di prima parte da un modello vecchio di un giorno e con i pesi ancora in sospeso sarebbe esattamente il tipo di numero che diciamo ai clienti di non fidarsi.

Quello che possiamo valutare oggi dall'API live è la parte che non ha bisogno di una classifica: la superficie di integrazione, il modello di costo e le modalità di fallimento. La matematica dei prezzi qui sopra è un nostro calcolo basato sulle tariffe pubblicate da Moonshot, non un benchmark, e ti dice già la verità operativa: la disciplina della cache è la differenza tra un K3 conveniente e un K3 che diventa un problema di budget. Se vuoi capire se un modello come K3 ha senso nel tuo stack, è esattamente il tipo di valutazione che facciamo nella pratica di integrazione AI di Techsy, e puoi prenotare una consulenza gratuita per parlarne.

Chi Dovrebbe Usare Kimi K3 (e Chi No)

Kimi K3 è adatto a un set specifico di lavori e poco adatto ad altri. Confrontalo con il tuo carico di lavoro reale.

Scegli K3 se:

  • Fai navigazione o ricerca agentica. I suoi primati su BrowseComp e Automation Bench, più la migliore lettura indipendente per la ricerca agentica, lo rendono al momento l'opzione open-weight più capace per gli agenti che usano strumenti.
  • Fai coding a lungo orizzonte. SWE Marathon è il benchmark che rispecchia sessioni di ingegneria di più ore, e K3 lo guida. Se i tuoi agenti lavorano su codebase grandi in run lunghe, questo è il suo terreno di casa.
  • Vuoi un modello open-weight vicino alla frontiera e puoi aspettare i pesi. Se l'obiettivo è fare self-hosting di un modello open di alto livello il 27 luglio, K3 è il candidato più capace disponibile.

Aspetta se:

  • Ti servono i pesi oggi. Fino al 27 luglio, K3 è solo via API. Un modello già scaricabile ti serve meglio questa settimana.
  • Gestisci traffico ad alto volume e sensibile ai costi. Con un solo livello di reasoning costoso e un prezzo premium sull'output, K3 paga troppo sulle chiamate semplici. Kimi K2.7-Code o un modello open più economico vince sul lavoro di massa.
  • Ti servono valutazioni indipendenti e comprovate prima di adottarlo. I numeri di lancio sono eseguiti dal fornitore. Se il tuo processo richiede una verifica di terze parti, aspetta qualche settimana.

Domande Frequenti

Cos'è Kimi K3?

Kimi K3 è il modello linguistico di punta di Moonshot AI, uscito il 16 luglio 2026. È un modello Mixture-of-Experts da 2.8 trilioni di parametri che attiva 16 esperti su 896 per token, supporta una finestra di contesto da 1M token e accetta input di testo, immagini e video con il reasoning sempre attivo.

Kimi K3 è open source?

Kimi K3 è annunciato come modello open-weight, ma i pesi non sono pubblici al 17 luglio 2026. Moonshot afferma che il checkpoint completo sarà rilasciato il 27 luglio 2026. Fino ad allora è disponibile solo tramite le app Kimi e l'API, quindi non puoi ancora fare self-hosting.

In cosa Kimi K3 è diverso da Kimi K2?

K3 quasi triplica il conteggio dei parametri di K2 (2.8 trilioni contro circa 1 trilione), quadruplica la finestra di contesto della linea K2.6 e K2.7 (1M contro 256K token) e aggiunge input nativo di immagini e video a una famiglia che prima era incentrata sul testo. Introduce anche il nuovo design Kimi Delta Attention.

Quanto costa Kimi K3?

Moonshot prezza K3 a $0.30 per milione di token di input in cache-hit, $3.00 per milione di token di input fresco e $15.00 per milione di token di output. È circa il triplo del prezzo di input di K2.6 e quasi il quadruplo del prezzo di output, il che rende K3 il modello più costoso mai rilasciato da un laboratorio cinese.

Qual è la finestra di contesto di Kimi K3?

Kimi K3 supporta una finestra di contesto di un milione di token, e il prezzo resta uniforme su tutta quella finestra. Il modello usa un nuovo design di attenzione chiamato Kimi Delta Attention, che secondo Moonshot offre fino a 6.3x di decoding più veloce a lunghezze di contesto di un milione di token.

Posso eseguire Kimi K3 in locale?

Non ancora. I pesi non saranno pubblici fino al 27 luglio 2026. Dopo quella data, il self-hosting sarà tecnicamente possibile, ma un modello da 2.8 trilioni di parametri richiede hardware di classe cluster piuttosto che una singola workstation, quindi la maggior parte dei team continuerà ad accedervi tramite API.

Kimi K3 è davvero migliore di Fable 5?

Dipende dal task. K3 batte Claude Fable 5 su SWE Marathon, Program Bench e il voto alla cieca sul coding front-end di Arena. Fable 5 guida ancora su FrontierSWE, HLE-Full e le classifiche aggregate complessive di intelligenza. Anche ogni benchmark di lancio è girato nell'ambiente proprio di ciascun fornitore, quindi considera le vittorie sui singoli benchmark come indicative.

Kimi K3 è adatto al coding?

Sì, soprattutto per sessioni di coding lunghe e sostenute e per il lavoro front-end, dove al momento guida. È forte anche su task agentici e da terminale. Il difetto principale è il costo: con un solo livello di reasoning costoso, paga troppo sulle chiamate banali, quindi va abbinato a modelli più economici per il lavoro di routine ad alto volume.

Come posso accedere a Kimi K3?

Puoi usare Kimi K3 tramite la web app Kimi, Kimi Work e Kimi Code, oppure tramite l'API con l'ID modello kimi-k3. L'API è compatibile con OpenAI-SDK, quindi aggiungerla a un'integrazione esistente in stile OpenAI è per lo più una modifica di configurazione.

Chi è l'Autore

Mert Batur, Co-Founder, Techsy.io. Connettiti su LinkedIn.

Mert Batur è Co-Founder di Techsy.io, dove il team sviluppa agenti AI, sistemi di automazione e pipeline voice/SDR per clienti B2B. Scrive dello stack di strumenti LLM che il team Techsy usa realmente in produzione.

Punti Chiave

  • Kimi K3 è il primo modello open-weight a competere realmente con la frontiera chiusa, guidando SWE Marathon e vincendo il voto alla cieca sul coding front-end di Arena davanti a Claude Fable 5.
  • È vicino alla frontiera, non in cima. Artificial Analysis indipendente lo classifica #4 su 189, e resta indietro rispetto a Fable 5 sui test di reasoning e coding di frontiera più difficili.
  • Open di nome, in sospeso nella pratica. I pesi non saranno pubblicati fino al 27 luglio 2026, quindi fino ad allora non c'è self-hosting né valutazione indipendente.
  • Il prezzo ha chiuso l'era dell'AI cinese economica. A $3/$15 per milione di token, la disciplina della cache è ciò che rende K3 conveniente; pianifica il budget per un ciclo caldo e ricco di contesto, non per chiamate fredde isolate.
  • Ideale per ricerca agentica e coding a lungo orizzonte. Se ti servono i pesi oggi o gestisci traffico ad alto volume sensibile ai costi, aspetta o scegli un modello più economico. Parla con noi se vuoi aiuto a decidere.

Tag

recensione kimi k3kimi k3benchmark kimi k3prezzi kimi k3moonshot aillm open-weight

Condividi questo articolo

Il Tuo Prossimo Passo

Hai un progetto in mente? Parliamone.

Prenota una call di 30 minuti. Ti ascoltiamo, capiamo il problema e ti diciamo se possiamo aiutarti.