
Qwen vs DeepSeek vs GLM: il Trio Cinese Open-Weight (2026)
Ultima verifica: 14 luglio 2026. Versioni dei modelli (Qwen3.6, DeepSeek V4, GLM-5.2), prezzi e licenze ricontrollati sui canali ufficiali il giorno stesso della pubblicazione.
Qwen vs DeepSeek vs GLM è esattamente il confronto a tre che la maggior parte degli sviluppatori digita quando cerca un modello cinese open-weight capace di tenere testa a Claude e GPT. Ne abbiamo usato uno, GLM-5.2 (stringa modello GLM-5.2[1m]), come modello principale per il coding per tre settimane a 72$/mese. DeepSeek V4 dichiara circa l'80,6% su SWE-bench Verified. Qwen3.6 è distribuito sotto licenza Apache 2.0, la più permissiva tra le tre. Tre laboratori, tre scommesse molto diverse. Ecco come si posizionano davvero, con una tabella tecnica, una tabella benchmark che segnala chi ha riportato ogni numero, e un test reale in produzione.
Per il coding agentico e gli agenti a lungo orizzonte, la nostra scelta è GLM-5.2 (l'abbiamo usato tre settimane in produzione). Per i token più economici e il RAG su larga scala, DeepSeek V4 Flash vince sul prezzo. Per il self-hosting locale e la licenza più permissiva, Qwen3 (Apache 2.0) ha l'impronta più ampia e leggera.
Risposta rapida:
- Qwen, DeepSeek e GLM sono tre aziende separate (Alibaba, DeepSeek, Zhipu/Z.ai), non un unico modello.
- Il più economico per token: DeepSeek V4 Flash (0,14$ in / 0,28$ out per M; cache-hit 0,0028$).
- Migliore scelta hands-on per il coding: GLM-5.2 (l'abbiamo usato tre settimane in Claude Code); licenza più permissiva: Qwen (Apache 2.0).
- Tutti e tre raggiungono ormai circa 1M di contesto, con sfumature per modello (i modelli open di Qwen variano).
Chiarimento rapido: sono tre aziende separate, non un unico modello con tre nomi. I vecchi checkpoint R1 "distill Qwen" di DeepSeek sono una cosa completamente diversa e più datata.
Qwen vs DeepSeek vs GLM in Breve
Le tre famiglie fanno scommesse di design opposte. Qwen (Alibaba) è la gamma più ampia, con l'impronta self-host più leggera e licenza Apache 2.0. DeepSeek (DeepSeek) è una strategia prezzo-prestazioni a due livelli costruita su enormi modelli Mixture-of-Experts. GLM-5.2 (Zhipu/Z.ai) è lo specialista per il coding e gli agenti a lungo orizzonte. Ecco la scheda tecnica, fianco a fianco.
| Famiglia | Fornitore | Flagship open (+ chiuso) | Parametri (totali / attivi) | Contesto | Licenza | Self-host |
|---|---|---|---|---|---|---|
| Qwen | Alibaba | Qwen3.6-27B dense, Qwen3.6-35B-A3B; Qwen3-Coder-Next 80B-A3B (Max = chiuso/solo API) | es. 35B / 3B attivi (MoE) | fino a 256K nativi (Coder-Next); alcuni livelli Plus ~1M | Apache 2.0 | Il più leggero (27B dense ~18GB VRAM, dato riportato) |
| DeepSeek | DeepSeek | V4 Pro (reasoning/agentico), V4 Flash (veloce/economico) | V4 Pro 1.6T / 49B; V4 Flash 284B / 13B (dato riportato) | 1M (ufficiale) | MIT | Pesante (MoE da cluster) |
| GLM | Zhipu / Z.ai | GLM-5.2 | 753B / ~40B attivi | 1M (da metà giugno 2026) | MIT | Pesante |
Due note. Qwen separa i suoi modelli open da un flagship chiuso e solo API chiamato "Max", quindi specifica sempre quale intendi. E i conteggi dei parametri di DeepSeek V4 sono riportati da blog, non ufficiali, motivo per cui portano l'etichetta "reported".
Come si Confrontano Qwen, DeepSeek e GLM sui Benchmark?
Nessun modello vince tutti i benchmark, quindi leggi il gruppo di risultati, non la classifica secca. Sul coding, GLM-5.2 guida nei task da agente a lungo orizzonte, mentre DeepSeek V4 Pro è in testa nei punteggi coding aggregati. Sul reasoning, entrambi spingono AIME quasi alla saturazione. Sugli indici di intelligenza generale, GLM si colloca a metà classifica tra i modelli open-weight. Ambienti di test diversi rendono i numeri tra modelli difficili da confrontare direttamente, quindi ogni punteggio qui sotto è etichettato con chi lo ha pubblicato.
Legenda: [SR] = autodichiarato dal fornitore. [3P] = classifica di terze parti, aggregatore indipendente, o nostro test diretto. Una cella n/a significa che il fornitore non ha pubblicato un punteggio comparabile, non uno zero.
| Benchmark | Qwen | DeepSeek V4 | GLM-5.2 | Riportato da |
|---|---|---|---|---|
| SWE-bench Verified | Coder-Next 70.6-71.3% [SR]; 3.6-27B 77.2% [3P] | Pro-Max ~80.6% [3P] | n/a | report Qwen; singolo blog (cautela); scaffold DeepSeek (non verificato) |
| SWE-bench Pro | n/a | n/a | 62.1 [3P] | developersdigest / DataCamp (vs Claude Opus 4.8 ~69) |
| Terminal-Bench 2.1 | n/a | n/a | 81.0 [3P] | developersdigest |
| AIME 2025 | Qwen3-235B 81.5 [SR] | n/a | 99.2 [3P] | report Qwen; GLM quasi saturo (effetto soglia) |
| LiveCodeBench v5 | Qwen3-235B 70.7 [SR] | n/a | n/a | report Qwen |
| BenchLM (lug 2026) | n/a | Pro overall 87 / coding 89.8 [3P] | n/a | classifica BenchLM per LLM cinesi |
| AA Intelligence Index | n/a | n/a | 51 [3P] | Artificial Analysis |
La lettura onesta dei benchmark open-weight cinesi nel 2026 è questa: nessun modello vince ogni riga, e metà dei numeri più appariscenti sono autodichiarati. Quel 77,2% di Qwen3.6-27B viene da un singolo blog, e l'~80,6% di DeepSeek ha usato uno "scaffold non verificato", quindi trattali entrambi con cautela. Nei nostri test ci affidiamo alla classifica SWE-bench e ad Artificial Analysis più che ai numeri da content farm, perché un semplice cambio di scaffold può spostare un punteggio di diversi punti. Quando un modello cita solo la propria scheda di autovalutazione, sconta il dato di un livello.
DeepSeek V4: il Re del Rapporto Prezzo-Prestazioni
DeepSeek V4 è la scelta giusta quando ogni milione di token conta. Arriva in due livelli: V4 Pro per il reasoning e il lavoro agentico, e V4 Flash per chiamate veloci, economiche e ad alto volume. Il suo vantaggio strutturale è il pricing sulla cache. Se il tuo carico di lavoro rilegge continuamente lo stesso contesto, come una pipeline RAG o un agente che rimanda lo stesso system prompt, la tariffa cache-hit lo rende di gran lunga l'opzione più economica qui.
DeepSeek V4 è stato lanciato in anteprima il 24 aprile 2026. Architettura riportata: un MoE 1.6T / 49B attivi per V4 Pro e 284B / 13B per V4 Flash, entrambi riportati da blog e non confermati ufficialmente. I pesi si trovano su Hugging Face (deepseek-ai/DeepSeek-V4-Pro, deepseek-ai/DeepSeek-V4-Flash) sotto licenza MIT, con una finestra di contesto ufficiale di 1M.
Ecco dove si vede davvero l'economia della cache-hit: V4 Flash costa 0,14$ per M di input su un cache miss, ma solo 0,0028$ su un cache hit, contro 0,28$ in output. Per un servizio RAG che martella continuamente lo stesso archivio documenti, questo divario fa tutta la differenza. I numeri completi sono sulla pagina prezzi ufficiale di DeepSeek.
Una trappola di freschezza che nessun altro segnala: se stai ancora chiamando deepseek-chat o deepseek-reasoner, questi endpoint vanno in pensione il 24 luglio 2026 alle 15:59 UTC. Migra subito a deepseek-v4-pro o deepseek-v4-flash, perché quella scadenza arriva solo dieci giorni dopo la pubblicazione di questo articolo.
Scegli DeepSeek V4 per prodotti API-first sensibili al costo, specialmente con contesto ripetuto pesante. Non è il modello da self-hostare su una singola workstation: il grande MoE richiede hardware di classe cluster.
Qwen3: la Famiglia Più Ampia e la Miglior Impronta Self-Host
Qwen3 è il modello da far girare sul tuo hardware. È la famiglia più ampia delle tre, i modelli open portano una licenza Apache 2.0 (la più permissiva qui), e il livello dense è abbastanza leggero per una singola GPU. È anche il più forte sugli assi non legati al coding, come il lavoro multilingue, che i confronti focalizzati solo sul coding ignorano completamente.
La gamma è profonda. Sul lato open trovi Qwen3.6-27B (dense), Qwen3.6-35B-A3B (MoE), e la linea coding guidata da Qwen3-Coder-Next (80B-A3B, contesto 256K). A parte, Qwen3-Max è un flagship chiuso e solo API, quindi non confonderlo con i pesi open. Versioni e termini della licenza Apache 2.0 sono sul repo GitHub di Qwen3-Coder e sul blog del team Qwen.
Sul coding, Qwen3-Coder-Next segna 70,6-71,3% su SWE-bench Verified a seconda dell'ambiente di test (autodichiarato, SOTA tra i modelli open senza test-time scaling). La notizia per il self-host: la classe dense 27B gira, a quanto riportato, su circa 18GB di VRAM, una singola scheda da 24GB con margine. Il dato viene da un solo blog, quindi verificalo sul tuo setup. Ecco come far girare questi modelli in locale, e come servirli con vLLM o SGLang una volta superata una singola macchina.
Il naming di Qwen è il meno stabile dei tre, quindi riconferma il nome del flagship open attuale prima di fissare una dipendenza. Scegli Qwen3 per il deployment locale su hardware modesto, la copertura multilingue, o qualsiasi caso in cui ti serva specificamente Apache 2.0 invece di MIT.
GLM-5.2: la Scelta per il Coding e gli Agenti a Lungo Orizzonte
GLM-5.2 è lo specialista per il coding e gli agenti a lungo orizzonte, ed è l'unico che conosciamo in prima persona. È un MoE da 753B totali / ~40B attivi sotto licenza MIT, con una finestra di contesto di 1M da metà giugno 2026 e circa 131K di output massimo. Sui benchmark agentici regge bene: SWE-bench Pro 62.1, Terminal-Bench 2.1 a 81.0, AIME quasi saturo a 99.2, e un Artificial Analysis Intelligence Index di 51 (tutti dati di terze parti).
Ecco la parte onesta, il segnale di fiducia che distingue questo articolo da una semplice rassegna di benchmark: la nostra profondità hands-on riguarda solo GLM. Abbiamo usato GLM-5.2 Pro come modello principale per il coding per tre settimane su repository reali di clienti, pilotato tramite Claude Code contro l'endpoint compatibile Anthropic di Z.AI (api.z.ai/api/anthropic, stringa modello GLM-5.2[1m]). Una settimana normale valeva circa 1.300 dei nostri ~2.000 prompt settimanali. Durante due settimane pesanti di migrazione abbiamo raggiunto il tetto settimanale al giorno 5, uno stop netto senza possibilità di superamento. Ha portato a termine senza intoppi un vero refactor delle API route di Next.js 16 su circa una dozzina di file. Costo: 72$/mese sul livello Pro del GLM Coding Plan, contro i ~200$/mese che avremmo altrimenti pagato per Claude Max. Per Qwen3 e DeepSeek V4 ci affidiamo ai benchmark pubblicati più brevi controlli via API, quindi pesa il verdetto su GLM come quello che abbiamo davvero vissuto in prima persona.
Il passaggio in sé richiede solo tre variabili d'ambiente, che puoi riusare direttamente dal nostro articolo 3 settimane con il GLM Coding Plan in Claude Code:
# Point Claude Code at GLM-5.2 via Z.AI's Anthropic-compatible endpoint
export ANTHROPIC_BASE_URL="https://api.z.ai/api/anthropic"
export ANTHROPIC_AUTH_TOKEN="your-zai-key"
export ANTHROPIC_MODEL="GLM-5.2[1m]"
claudeTre settimane su GLM-5.2 a 72$/mese hanno svolto il lavoro di coding per cui normalmente pagheremmo ~200$/mese di Claude Max, fino a quando abbiamo raggiunto il tetto settimanale al giorno cinque. L'analisi completa è nella nostra recensione completa di GLM-5.2 e nell'articolo sul coding plan qui sopra; questa sezione resta volutamente breve per mantenere il confronto a tre equilibrato. I dettagli del modello sono sulla documentazione Z.AI.
Quanto Costano Qwen, DeepSeek e GLM?
DeepSeek V4 Flash è il più economico per token, GLM vende un abbonamento fisso (il Coding Plan) oltre al puro pay-per-token, e il livello "Plus" di Qwen si colloca nel mezzo. Tutte e tre le licenze sono commercial-friendly. I prezzi qui sotto sono per 1M di token, rilevati il 14 luglio 2026.
| Modello | Input (cache miss) | Input (cache hit) | Output | Contesto | Note |
|---|---|---|---|---|---|
| deepseek-v4-flash | $0.14 | $0.0028 | $0.28 | 1M | il più economico; vantaggio cache-hit [ufficiale 2026-07-14] |
| deepseek-v4-pro | $0.435 | $0.003625 | $0.87 | 1M | reasoning/agentico [ufficiale 2026-07-14] |
| GLM-5.2 (listino Z.ai) | ~$1.40 | n/a | ~$4.40 | 1M | mediana provider terzi ~$0.55 in / ~$1.85 out [3P] |
| Qwen3.6 Plus | ~$0.325 (promo 35%) | n/a | ~$1.95 | variabile | Qwen Max ~$0.80-1.25 in / ~$3.75-3.90 out [3P] |
La tabella prezzi nasconde una grande riformulazione. Il Coding Plan di GLM è un abbonamento fisso, non a token: Lite 18$, Pro 72$, Max 160$ al mese. Se scrivi codice tutto il giorno, quell'abbonamento batte la spesa per l'API GLM a token, ed è esattamente per questo che il nostro test di tre settimane ha girato su di esso. Se fai solo chiamate occasionali, l'API GLM a token o DeepSeek V4 Flash sono più economiche.
Sulle licenze: DeepSeek e GLM sono MIT, Qwen è Apache 2.0. Tutte e tre sono commercial-friendly. Apache 2.0 è la più permissiva se prevedi di ridistribuire o hai bisogno di termini di brevetto espliciti, quindi conferma la licenza esatta sulla model card di Hugging Face per il checkpoint che distribuisci.
Ora la domanda che toglie davvero il sonno a chi valuta un modello cinese: la residenza dei dati. Questi sono fornitori cinesi. Puoi tenere i dati nella tua giurisdizione? Sì, se fai self-hosting: pesi open più licenza MIT o Apache 2.0 significano che puoi far girare uno qualsiasi di questi su infrastruttura UE (o della tua regione) senza che nessuna richiesta lasci la tua rete. L'API hostata è l'opposto: i tuoi dati vanno al fornitore, e la nostra recensione di GLM segnala specificamente i termini di hosting in Cina e di conservazione dati di Z.ai per l'endpoint hostato. Quindi per un hosting UE rigoroso o per compliance, fai self-hosting, e Qwen è il più semplice da self-hostare in questo senso. (E sì, deepseek-chat / deepseek-reasoner vanno comunque in pensione il 24 luglio 2026 alle 15:59 UTC.)
Quale Dovresti Scegliere?
Non c'è un vincitore unico, quindi abbina il modello al compito. Qui sotto trovi la matrice decisionale per caso d'uso. Versione breve: GLM-5.2 per il coding agentico, DeepSeek V4 Flash per i token più economici, DeepSeek V4 Pro o GLM per il reasoning più impegnativo, e Qwen3 per il self-host locale, l'ampiezza multilingue e la residenza dei dati.
| Caso d'uso | Scelta | Perché |
|---|---|---|
| Coding agentico / agenti a lungo orizzonte | GLM-5.2 | il nostro test di 3 settimane in produzione; SWE-bench Pro 62.1, Terminal-Bench 81.0 |
| Token più economici / RAG su larga scala | DeepSeek V4 Flash | $0.14 / $0.28 per M, cache-hit $0.0028 |
| Reasoning più impegnativo / tool-use di frontiera | DeepSeek V4 Pro o GLM-5.2 | BenchLM coding 89.8 vs GLM Terminal-Bench 81.0; scegli in base al budget |
| Self-host locale su hardware modesto | Qwen3.6-27B dense | ~18GB VRAM (dato riportato), Apache 2.0, impronta più leggera |
| Ampiezza multilingue | Qwen3 | famiglia più ampia, asse non-coding più forte |
| Residenza dati UE / compliance | self-host di un modello open qualsiasi (Qwen il più semplice) | l'API hostata significa che i dati lasciano la tua giurisdizione |
Perché non Kimi? Domanda legittima, perché Kimi K2.6 (Moonshot) è reale e forte: BenchLM lo classifica #2 tra i modelli cinesi (overall 81, coding 88.7). Abbiamo tracciato il confine a tre perché "qwen vs deepseek vs glm" è esattamente l'insieme che le persone cercano, e un confronto a tre pulito resta utile. Kimi è la naturale quarta scelta se vuoi una shortlist più lunga, e appartiene alla classifica più ampia degli LLM open-source insieme a Llama e Mistral. Un paragrafo onesto, senza dilagare a quattro.
Chi è l'Autore
Mert Batur è Co-Founder di Techsy.io, dove il team realizza agenti AI, sistemi di automazione e pipeline voice/SDR per clienti B2B. Scrive sullo stack di tooling LLM che il team Techsy usa davvero in produzione.
Co-Founder, Techsy.io. Connettiti su LinkedIn.
Domande Frequenti
Qwen, DeepSeek e GLM sono la stessa cosa?
No. Provengono da tre aziende diverse: Alibaba produce Qwen, DeepSeek produce DeepSeek V4, e Zhipu/Z.ai produce GLM. La confusione di solito nasce dai vecchi checkpoint R1 "distill Qwen" di DeepSeek, che erano il reasoning di DeepSeek distillato in modelli base Qwen. Sono una cosa più vecchia e separata rispetto agli attuali flagship indipendenti.
Qual è il migliore per il coding nel 2026?
Dipende se scegli hosted o self-host. Per il coding agentico hands-on, GLM-5.2 è la nostra scelta dopo un test di tre settimane in produzione. DeepSeek V4 Pro guida il punteggio coding aggregato di BenchLM (89.8). Per il modello più forte che puoi self-hostare, Qwen3-Coder-Next guida su SWE-bench Verified open con 70.6-71.3%. Tutti e tre sono davvero utilizzabili.
Qual è il più economico per token?
DeepSeek V4 Flash, con largo margine. Costa 0,14$ per M di input su un cache miss, 0,0028$ su un cache hit, e 0,28$ in output (dato ufficiale, 14 luglio 2026). Per carichi di lavoro a contesto ripetuto come il RAG o agenti che rileggono lo stesso system prompt, la tariffa cache-hit lo rende più economico di qualunque altro modello in questo confronto.
Posso fare self-hosting di Qwen, DeepSeek e GLM sul mio hardware?
Sì, tutti e tre pubblicano pesi open. Il dense 27B di Qwen è il più leggero e, a quanto riportato, gira su circa 18GB di VRAM, quindi basta una singola scheda da 24GB. DeepSeek V4 e GLM-5.2 sono grandi modelli Mixture-of-Experts che richiedono hardware di classe cluster. Servili con vLLM o SGLang una volta superata una singola macchina.
Quale ha la finestra di contesto più grande?
Si raggruppano tutti intorno a 1M di token, ma non appiattire il dettaglio. DeepSeek V4 ha un 1M ufficiale, e GLM-5.2 ha raggiunto 1M a metà giugno 2026. I modelli open di Qwen variano: Qwen3-Coder-Next è 256K nativo, mentre alcuni livelli hostati "Plus" arrivano a circa 1M. Controlla il checkpoint specifico che distribuisci invece di dare per scontato.
GLM-5.2 vale quanto Claude o GPT per il coding?
È vicino sui benchmark (SWE-bench Pro 62.1 contro il Claude Opus 4.8 intorno a 69) e più vicino nella pratica di quanto suggerisca il divario. Nel nostro test di tre settimane GLM-5.2 ha svolto la maggior parte del nostro lavoro di coding a 72$/mese, contro i ~200$/mese che paghiamo per Claude Max. Il compromesso è un tetto settimanale rigido che ci ha fermato al giorno cinque nelle settimane più intense.
E Kimi K2.6? Perché non è uno dei tre?
Kimi (Moonshot) è reale e forte. BenchLM lo classifica come il modello cinese #2 nel punteggio complessivo (81) e 88.7 sul coding. Abbiamo mantenuto esattamente il confronto a tre che le persone cercano, quindi Kimi non è entrato nel set principale. Pensalo come la naturale quarta scelta in una shortlist open-weight più lunga, non come una dimenticanza.
Quale licenza posso usare commercialmente?
Tutte e tre. DeepSeek e GLM sono distribuiti sotto MIT, e i modelli open di Qwen sotto Apache 2.0. Ognuna di queste è commercial-friendly. Apache 2.0 è la più permissiva, con termini di brevetto espliciti, che possono contare per la ridistribuzione. Conferma sempre la licenza sulla model card di Hugging Face per il modello esatto che distribuisci.
Qwen vs DeepSeek V4: quale scegliere per un prodotto basato su API?
DeepSeek V4 per prodotti sensibili al costo, ad alto volume o RAG-intensivi, grazie al vantaggio di prezzo sulla cache-hit. Qwen quando ti serve ampiezza multilingue o specificamente una licenza Apache 2.0. Entrambi sono disponibili via API ed entrambi si prestano al self-host, quindi i fattori decisivi sono di solito il tuo volume di token e i tuoi vincoli di licenza.
Il Verdetto
Non forzare un vincitore unico tra Qwen vs DeepSeek vs GLM. Classificali per livello, poi scegli in base al compito:
- GLM-5.2 per il coding agentico e gli agenti a lungo orizzonte. È quello che abbiamo usato per tre settimane a 72$/mese, e si è guadagnato il posto.
- DeepSeek V4 Flash per i token più economici e il RAG su larga scala, con un prezzo cache-hit che nessun altro qui eguaglia.
- Qwen3 per il self-host locale su hardware modesto, il lavoro multilingue, e la licenza più permissiva (Apache 2.0).
La lezione più grande: leggi il gruppo di benchmark, non la classifica secca, e sconta i numeri autodichiarati. In questo spazio la freschezza conta più del conteggio delle parole, perché tutti e tre rilasciano nuove versioni con una cadenza quasi mensile.
Scegliere il modello è la parte facile. Integrarlo in uno stack di produzione con fallback, tetti di costo ed eval gate è dove i team si bloccano. È quello che facciamo noi in Techsy, integrando un modello open-weight in uno stack di agenti in produzione che regge sotto traffico reale.