ai-machine-learning

Qwen vs DeepSeek vs GLM : le grand trio chinois à poids ouverts (2026)

Écrit par Mert Batur
Jul 14, 2026
16 lecture
Qwen vs DeepSeek vs GLM : le grand trio chinois à poids ouverts (2026)

Qwen vs DeepSeek vs GLM : le grand trio chinois à poids ouverts (2026)

Dernière vérification : 14 juillet 2026. Les versions des modèles (Qwen3.6, DeepSeek V4, GLM-5.2), les prix et les licences ont été revérifiés sur les canaux officiels le jour de la mise en ligne de cet article.

Qwen vs DeepSeek vs GLM, c'est exactement le trio que tape la plupart des développeurs en quête d'un modèle chinois à poids ouverts capable de tenir tête à Claude et GPT. Nous avons fait tourner l'un des trois, GLM-5.2 (identifiant de modèle GLM-5.2[1m]), comme modèle de codage principal pendant trois semaines à $72/mo. DeepSeek V4 affiche un score déclaré d'environ 80.6% sur SWE-bench Verified. Qwen3.6 est distribué sous licence Apache 2.0, la plus permissive des trois. Trois labos, trois paris très différents. Voici comment ils se comparent vraiment, avec un tableau de spécifications, un tableau de benchmarks qui précise qui a publié chaque chiffre, et un vrai test de production.

Pour le codage agentique et les agents à long horizon, c'est GLM-5.2 que nous recommandons (nous l'avons fait tourner trois semaines en production). Pour les tokens les moins chers et le RAG à grande échelle, DeepSeek V4 Flash gagne sur le prix. Pour l'auto-hébergement local et la licence la plus permissive, Qwen3 (Apache 2.0) a l'empreinte la plus large et la plus légère.

Réponse rapide :

  • Qwen, DeepSeek et GLM sont trois entreprises distinctes (Alibaba, DeepSeek, Zhipu/Z.ai), pas un seul modèle.
  • Le moins cher par token : DeepSeek V4 Flash ($0.14 en entrée / $0.28 en sortie par M ; cache-hit $0.0028).
  • Le meilleur choix testé en conditions réelles pour le codage : GLM-5.2 (fait tourner trois semaines dans Claude Code) ; licence la plus permissive : Qwen (Apache 2.0).
  • Les trois atteignent désormais environ 1M de contexte, avec des nuances par modèle (les modèles ouverts de Qwen varient).

Petite clarification : ce sont trois entreprises distinctes, pas un seul modèle avec trois noms. Les anciens checkpoints R1 « distill Qwen » de DeepSeek sont une tout autre histoire, plus ancienne.

Qwen vs DeepSeek vs GLM en un coup d'œil

Les trois familles font des paris de conception opposés. Qwen (Alibaba) propose la gamme la plus large avec l'empreinte d'auto-hébergement la plus légère et une licence Apache 2.0. DeepSeek (DeepSeek) mise sur un rapport prix-performance à deux paliers, bâti sur d'énormes modèles Mixture-of-Experts. GLM-5.2 (Zhipu/Z.ai) est le spécialiste du codage et des agents à long horizon. Voici la fiche technique, côte à côte.

FamilleÉditeurModèle phare ouvert (+ fermé)Paramètres (total / actifs)ContexteLicenceAuto-hébergement
QwenAlibabaQwen3.6-27B dense, Qwen3.6-35B-A3B ; Qwen3-Coder-Next 80B-A3B (Max = fermé/API uniquement)ex. 35B / 3B actifs (MoE)jusqu'à 256K natif (Coder-Next) ; certains paliers Plus ~1MApache 2.0Le plus léger (27B dense ~18GB VRAM, chiffre rapporté)
DeepSeekDeepSeekV4 Pro (raisonnement/agentique), V4 Flash (rapide/économique)V4 Pro 1.6T / 49B ; V4 Flash 284B / 13B (rapporté)1M (officiel)MITLourd (MoE de classe cluster)
GLMZhipu / Z.aiGLM-5.2753B / ~40B actifs1M (depuis mi-juin 2026)MITLourd

Deux précisions. Qwen sépare ses modèles ouverts d'un modèle phare « Max » fermé, accessible uniquement par API, donc précisez toujours lequel vous visez. Et les chiffres de paramètres de DeepSeek V4 proviennent de blogs, pas de sources officielles, d'où l'étiquette « rapporté ».

Comment Qwen, DeepSeek et GLM se comparent-ils sur les benchmarks ?

Aucun modèle ne remporte tous les benchmarks, donc lisez la tendance d'ensemble plutôt que le classement brut. Sur le codage, GLM-5.2 domine les tâches d'agents à long horizon tandis que DeepSeek V4 Pro arrive en tête des scores de codage agrégés. Sur le raisonnement, les deux poussent AIME près de la saturation. Sur les indices d'intelligence générale, GLM se situe dans la moyenne des modèles à poids ouverts. Les harnais de test diffèrent d'un modèle à l'autre, donc chaque score ci-dessous est étiqueté avec sa source.

Légende : [SR] = autodéclaré par l'éditeur. [3P] = classement tiers, agrégateur indépendant, ou notre propre test en conditions réelles. Une cellule n/a signifie que l'éditeur n'a publié aucun score comparable, pas un zéro.

BenchmarkQwenDeepSeek V4GLM-5.2Source
SWE-bench VerifiedCoder-Next 70.6-71.3% [SR] ; 3.6-27B 77.2% [3P]Pro-Max ~80.6% [3P]n/aRapport Qwen ; blog isolé (à prendre avec prudence) ; scaffold DeepSeek (non vérifié)
SWE-bench Pron/an/a62.1 [3P]developersdigest / DataCamp (vs Claude Opus 4.8 ~69)
Terminal-Bench 2.1n/an/a81.0 [3P]developersdigest
AIME 2025Qwen3-235B 81.5 [SR]n/a99.2 [3P]Rapport Qwen ; GLM proche de la saturation (effet plafond)
LiveCodeBench v5Qwen3-235B 70.7 [SR]n/an/aRapport Qwen
BenchLM (juil. 2026)n/aPro global 87 / codage 89.8 [3P]n/aClassement BenchLM des LLM chinois
Indice d'intelligence AAn/an/a51 [3P]Artificial Analysis

Pour être honnête sur les benchmarks chinois à poids ouverts en 2026 : aucun modèle ne gagne sur toute la ligne, et la moitié des chiffres qui accrochent l'œil sont autodéclarés. Le 77.2% de Qwen3.6-27B vient d'un seul blog, et le ~80.6% de DeepSeek utilisait un « scaffold non vérifié » — donc traitez les deux avec prudence. Dans nos propres tests, nous nous appuyons sur le classement SWE-bench et Artificial Analysis plutôt que sur les chiffres de sites de contenu générique, parce qu'un simple changement de scaffold peut déplacer un score de plusieurs points. Quand un modèle ne cite que son propre bulletin de notes, pondérez-le à la baisse.

DeepSeek V4 : le roi du rapport prix-performance

DeepSeek V4 est le choix quand chaque million de tokens compte. Il se décline en deux paliers : V4 Pro pour le raisonnement et le travail agentique, et V4 Flash pour les appels rapides, économiques et à haut volume. Son avantage structurel, c'est la tarification du cache. Si votre charge de travail relit le même contexte encore et encore, comme un pipeline RAG ou un agent qui renvoie sans cesse le même prompt système, le taux de cache-hit en fait l'option la moins chère ici, et de loin.

DeepSeek V4 a été lancé en preview le 24 avril 2026. Architecture rapportée : un MoE 1.6T / 49B actifs pour V4 Pro et 284B / 13B pour V4 Flash, tous deux rapportés par des blogs plutôt que confirmés officiellement. Les poids sont hébergés sur Hugging Face (deepseek-ai/DeepSeek-V4-Pro, deepseek-ai/DeepSeek-V4-Flash) sous licence MIT, avec une fenêtre de contexte officielle de 1M.

Voici où l'économie du cache-hit change tout : V4 Flash facture $0.14 par M en entrée en cas de cache miss, mais seulement $0.0028 en cas de cache hit, contre $0.28 en sortie. Pour un service RAG qui martèle sans cesse le même entrepôt de documents, cet écart fait toute la différence. Les tarifs complets sont sur la page tarifaire officielle DeepSeek.

Une mine cachée que personne d'autre ne signale : si vous appelez encore deepseek-chat ou deepseek-reasoner, ces endpoints seront retirés le 2026-07-24 à 15:59 UTC. Migrez vers deepseek-v4-pro ou deepseek-v4-flash dès maintenant, car cette échéance tombe seulement dix jours après la publication de cet article.

Choisissez DeepSeek V4 pour des produits sensibles au coût et API-first, surtout tout ce qui repose sur un contexte répété massivement. Ce n'est pas le modèle à auto-héberger sur un simple poste de travail : le gros MoE réclame du matériel de classe cluster.

Qwen3 : la famille la plus large et la meilleure empreinte d'auto-hébergement

Qwen3 est le modèle à faire tourner sur votre propre matériel. C'est la famille la plus large des trois, les modèles ouverts sont sous licence Apache 2.0 (la plus permissive ici), et le palier dense est assez léger pour tenir sur un seul GPU. C'est aussi le plus fort sur les axes hors codage, comme le multilingue, que les comparaisons centrées uniquement sur le code ignorent complètement.

La gamme est étoffée. Côté ouvert, vous trouvez Qwen3.6-27B (dense), Qwen3.6-35B-A3B (MoE), et la ligne codage couronnée par Qwen3-Coder-Next (80B-A3B, contexte 256K). Séparément, Qwen3-Max est un modèle phare fermé, accessible uniquement par API — ne le confondez pas avec les poids ouverts. Les versions et les termes de la licence Apache 2.0 sont sur le dépôt GitHub Qwen3-Coder et le blog de l'équipe Qwen.

Sur le codage, Qwen3-Coder-Next affiche 70.6-71.3% sur SWE-bench Verified selon les harnais (autodéclaré, SOTA parmi les modèles ouverts sans test-time scaling). Le point fort pour l'auto-hébergement : le palier dense 27B tournerait, selon les chiffres rapportés, sur environ 18GB de VRAM, une seule carte 24GB avec de la marge. Ce chiffre vient d'un seul blog, donc vérifiez-le sur votre propre configuration. Voici comment faire tourner ces modèles en local, et comment les servir avec vLLM ou SGLang une fois que vous dépassez une seule machine.

Le nommage des modèles Qwen est le moins stable des trois, donc reconfirmez le nom du modèle phare ouvert actuel avant de figer une dépendance. Choisissez Qwen3 pour un déploiement local sur du matériel modeste, une couverture multilingue, ou tout cas où vous avez spécifiquement besoin d'Apache 2.0 plutôt que de MIT.

GLM-5.2 : le choix pour le codage et les agents à long horizon

GLM-5.2 est le spécialiste du codage et des agents à long horizon, et c'est celui que nous connaissons de première main. C'est un MoE de 753B au total / ~40B actifs sous licence MIT, avec une fenêtre de contexte de 1M depuis mi-juin 2026 et une sortie maximale d'environ 131K. Sur les benchmarks agentiques, il tient la route : SWE-bench Pro 62.1, Terminal-Bench 2.1 à 81.0, AIME quasi saturé à 99.2, et un Indice d'intelligence Artificial Analysis de 51 (tous tiers).

Voici la partie honnête, et c'est le signal de confiance qui distingue ceci d'un simple recyclage de benchmarks : notre profondeur d'expérience terrain ne concerne que GLM. Nous avons fait tourner GLM-5.2 Pro comme modèle de codage principal pendant trois semaines sur des dépôts clients réels, piloté via Claude Code contre l'endpoint compatible Anthropic de Z.AI (api.z.ai/api/anthropic, identifiant de modèle GLM-5.2[1m]). Une semaine normale représentait environ 1,300 de nos ~2,000 prompts hebdomadaires. Pendant deux semaines chargées en migration, nous avons atteint le plafond hebdomadaire dès le jour 5, un arrêt net sans dépassement possible. Il a mené à bien un vrai refactor de routes API Next.js 16 proprement, sur une douzaine de fichiers environ. Coût : $72/mo sur le palier Pro du GLM Coding Plan, contre les ~$200/mo que nous paierions autrement pour Claude Max. Pour Qwen3 et DeepSeek V4, nous nous appuyons sur les benchmarks publiés plus quelques vérifications ponctuelles via API — gardez donc à l'esprit que le verdict GLM est le seul que nous avons vraiment vécu au quotidien.

Le changement lui-même tient en trois variables d'environnement, que vous pouvez réutiliser directement depuis notre article 3 semaines avec le GLM Coding Plan dans Claude Code :

bash
# Point Claude Code at GLM-5.2 via Z.AI's Anthropic-compatible endpoint
export ANTHROPIC_BASE_URL="https://api.z.ai/api/anthropic"
export ANTHROPIC_AUTH_TOKEN="your-zai-key"
export ANTHROPIC_MODEL="GLM-5.2[1m]"
claude

Trois semaines sur GLM-5.2 à $72/mo ont couvert le travail de codage que nous payions normalement ~$200/mo avec Claude Max, jusqu'à ce que nous atteignions le plafond hebdomadaire au jour cinq. L'analyse complète se trouve dans notre revue complète de GLM-5.2 et l'article sur le coding plan ci-dessus ; cette section reste volontairement courte pour que le trio garde un poids équilibré. Les détails du modèle sont sur la documentation Z.AI.

Combien coûtent Qwen, DeepSeek et GLM ?

DeepSeek V4 Flash est le moins cher par token, GLM vend un abonnement forfaitaire (le Coding Plan) plutôt qu'un tarif uniquement au token, et le palier « Plus » de Qwen se situe entre les deux. Les trois licences sont compatibles avec un usage commercial. Les prix ci-dessous sont pour 1M tokens, relevés le 14 juillet 2026.

ModèleEntrée (cache miss)Entrée (cache hit)SortieContexteRemarques
deepseek-v4-flash$0.14$0.0028$0.281Mle moins cher ; avantage cache-hit [officiel 2026-07-14]
deepseek-v4-pro$0.435$0.003625$0.871Mraisonnement/agentique [officiel 2026-07-14]
GLM-5.2 (tarif Z.ai)~$1.40n/a~$4.401Mmédiane des fournisseurs tiers ~$0.55 entrée / ~$1.85 sortie [3P]
Qwen3.6 Plus~$0.325 (promo de 35%)n/a~$1.95variableQwen Max ~$0.80-1.25 entrée / ~$3.75-3.90 sortie [3P]

Le tableau de tarifs cache un basculement important. Le Coding Plan de GLM est un abonnement forfaitaire, pas un tarif au token : Lite $18, Pro $72, Max $160 par mois. Si vous codez toute la journée, cet abonnement bat la dépense API GLM au token — c'est exactement pour ça que notre test de trois semaines a tourné dessus. Si vous ne faites que des appels occasionnels, l'API GLM au token ou DeepSeek V4 Flash est moins cher.

Côté licences : DeepSeek et GLM sont sous MIT, Qwen sous Apache 2.0. Les trois sont adaptées à un usage commercial. Apache 2.0 est la plus permissive si vous comptez redistribuer ou avez besoin de clauses de brevet explicites, donc confirmez la licence exacte sur la fiche modèle Hugging Face du checkpoint que vous déployez.

Vient maintenant la question qui empêche vraiment de dormir un acheteur de modèle chinois : la résidence des données. Ce sont des fournisseurs chinois. Pouvez-vous garder vos données dans votre juridiction ? Oui, si vous auto-hébergez : poids ouverts plus licence MIT ou Apache 2.0 signifient que vous pouvez faire tourner n'importe lequel d'entre eux sur une infrastructure en UE (ou dans votre propre région), sans qu'aucune requête ne quitte votre réseau. L'API hébergée, c'est l'inverse : vos données partent chez le fournisseur, et notre revue de GLM pointe spécifiquement les conditions d'hébergement en Chine et de rétention des données de Z.ai pour l'endpoint hébergé. Donc pour un hébergement en UE strict ou pour la conformité, auto-hébergez — et Qwen est le plus simple à auto-héberger dans ce cas. (Et oui, deepseek-chat / deepseek-reasoner seront bien retirés le 2026-07-24 à 15:59 UTC.)

Lequel choisir ?

Il n'y a pas de gagnant unique, donc adaptez le modèle à la tâche. Voici la matrice de décision par cas d'usage. En version courte : GLM-5.2 pour le codage agentique, DeepSeek V4 Flash pour les tokens les moins chers, DeepSeek V4 Pro ou GLM pour le raisonnement le plus exigeant, et Qwen3 pour l'auto-hébergement local, la couverture multilingue et la résidence des données.

Cas d'usageChoixPourquoi
Codage agentique / agents à long horizonGLM-5.2notre test de production de 3 semaines ; SWE-bench Pro 62.1, Terminal-Bench 81.0
Tokens les moins chers / RAG à grande échelleDeepSeek V4 Flash$0.14 / $0.28 par M, cache-hit $0.0028
Raisonnement le plus exigeant / usage d'outils de pointeDeepSeek V4 Pro ou GLM-5.2BenchLM codage 89.8 vs GLM Terminal-Bench 81.0 ; choisissez selon le budget
Auto-hébergement local sur matériel modesteQwen3.6-27B dense~18GB VRAM (rapporté), Apache 2.0, empreinte la plus légère
Couverture multilingueQwen3famille la plus large, axe hors codage le plus fort
Résidence des données en UE / conformitéauto-hébergez n'importe quel modèle ouvert (Qwen le plus simple)l'API hébergée signifie que les données quittent votre juridiction

Pourquoi pas Kimi ? Question légitime, parce que Kimi K2.6 (Moonshot) est réel et solide : BenchLM le classe #2 parmi les modèles chinois (global 81, codage 88.7). Nous nous sommes arrêtés à trois parce que « qwen vs deepseek vs glm » est exactement la requête que les gens tapent, et qu'un trio net reste plus utile. Kimi est le quatrième naturel si vous voulez une liste plus longue, et il a sa place dans le classement plus large des LLM open source aux côtés de Llama et Mistral. Un paragraphe honnête, pas un éclatement à quatre.

À propos de l'auteur

Mert Batur est cofondateur de Techsy.io, où l'équipe conçoit des agents IA, des systèmes d'automatisation et des pipelines voix/SDR pour des clients B2B. Il écrit sur la pile d'outils LLM que l'équipe Techsy utilise réellement en production.

Cofondateur, Techsy.io. Retrouvez-le sur LinkedIn.

Questions fréquentes

Qwen, DeepSeek et GLM, est-ce la même chose ?

Non. Ils viennent de trois entreprises différentes : Alibaba fabrique Qwen, DeepSeek fabrique DeepSeek V4, et Zhipu/Z.ai fabrique GLM. La confusion vient généralement des anciens checkpoints R1 « distill Qwen » de DeepSeek, qui étaient le raisonnement de DeepSeek distillé dans des modèles de base Qwen. C'est une chose plus ancienne et distincte des modèles phares indépendants actuels.

Lequel est le meilleur pour le codage en 2026 ?

Ça dépend si vous êtes hébergé ou auto-hébergé. Pour le codage agentique en conditions réelles, GLM-5.2 est notre choix après un test de production de trois semaines. DeepSeek V4 Pro arrive en tête du score de codage agrégé BenchLM (89.8). Pour le modèle le plus fort que vous pouvez auto-héberger, Qwen3-Coder-Next mène le SWE-bench Verified ouvert à 70.6-71.3%. Les trois sont réellement utilisables.

Lequel est le moins cher par token ?

DeepSeek V4 Flash, sans discussion possible. Il coûte $0.14 par M en entrée en cas de cache miss, $0.0028 en cas de cache hit, et $0.28 en sortie (officiel, 14 juillet 2026). Pour les charges de travail à contexte répété comme le RAG ou les agents qui relisent un prompt système, le taux de cache-hit le rend moins cher que tout le reste de cette comparaison.

Puis-je auto-héberger Qwen, DeepSeek et GLM sur mon propre matériel ?

Oui, les trois publient des poids ouverts. Le 27B dense de Qwen est le plus léger et tournerait, selon les chiffres rapportés, sur environ 18GB de VRAM, donc une seule carte 24GB suffit. DeepSeek V4 et GLM-5.2 sont de gros modèles Mixture-of-Experts qui réclament du matériel de classe cluster. Servez n'importe lequel d'entre eux avec vLLM ou SGLang une fois que vous dépassez une seule machine.

Lequel a la plus grande fenêtre de contexte ?

Ils se regroupent tous autour de 1M tokens, mais ne noyez pas le détail. DeepSeek V4 est à 1M officiel, et GLM-5.2 a atteint 1M mi-juin 2026. Les modèles ouverts de Qwen varient : Qwen3-Coder-Next est à 256K natif, tandis que certains paliers hébergés « Plus » atteignent environ 1M. Vérifiez le checkpoint précis que vous déployez plutôt que de supposer.

GLM-5.2 est-il aussi bon que Claude ou GPT pour le codage ?

Il est proche sur les benchmarks (SWE-bench Pro 62.1 contre environ 69 pour Claude Opus 4.8) et encore plus proche en pratique que l'écart ne le suggère. Dans notre test de trois semaines, GLM-5.2 a couvert l'essentiel de notre travail de codage à $72/mo contre les ~$200/mo que nous payons pour Claude Max. Le compromis, c'est un plafond hebdomadaire strict qui nous a arrêtés au jour cinq pendant les semaines chargées.

Et Kimi K2.6, pourquoi ne fait-il pas partie des trois ?

Kimi (Moonshot) est réel et solide. BenchLM le classe #2 modèle chinois au global (81) et 88.7 en codage. Nous avons gardé le cadre exact du trio que les gens recherchent, donc Kimi n'a pas fait partie de la sélection principale. Voyez-le comme le quatrième choix naturel sur une liste plus longue de modèles à poids ouverts, pas comme un oubli.

Quelle licence puis-je utiliser commercialement ?

Les trois. DeepSeek et GLM sont distribués sous MIT, et les modèles ouverts de Qwen sous Apache 2.0. Chacune de ces licences est adaptée à un usage commercial. Apache 2.0 est la plus permissive, avec des clauses de brevet explicites, ce qui peut compter pour la redistribution. Confirmez toujours la licence sur la fiche modèle Hugging Face du modèle exact que vous déployez.

Qwen vs DeepSeek V4, lequel choisir pour un produit basé sur API ?

DeepSeek V4 pour les produits sensibles au coût, à haut volume, ou fortement basés sur le RAG, grâce à l'avantage tarifaire du cache-hit. Qwen quand vous avez besoin d'une couverture multilingue ou spécifiquement d'une licence Apache 2.0. Les deux sont disponibles par API et les deux s'auto-hébergent, donc les facteurs décisifs sont généralement votre volume de tokens et vos contraintes de licence.

Le verdict

Ne forcez pas un gagnant unique entre Qwen vs DeepSeek vs GLM. Hiérarchisez-les, puis choisissez selon la tâche :

  • GLM-5.2 pour le codage agentique et les agents à long horizon. C'est celui que nous avons fait tourner trois semaines à $72/mo, et il a mérité sa place.
  • DeepSeek V4 Flash pour les tokens les moins chers et le RAG à grande échelle, avec un prix cache-hit qu'aucun autre ici n'égale.
  • Qwen3 pour l'auto-hébergement local sur matériel modeste, le travail multilingue, et la licence la plus permissive (Apache 2.0).

La leçon plus large : lisez la tendance d'ensemble des benchmarks, pas le classement brut, et pondérez à la baisse les chiffres autodéclarés. La fraîcheur compte plus que le nombre de mots dans ce domaine, parce que les trois sortent de nouvelles versions à un rythme quasi mensuel.

Choisir le modèle, c'est la partie facile. L'intégrer dans une stack de production avec des fallbacks, des plafonds de coût et des portes d'évaluation, c'est là que les équipes coincent. C'est ce que nous faisons chez Techsy : intégrer un modèle à poids ouverts dans une stack d'agents de production capable de tenir sous un vrai trafic.

Tags

qwen vs deepseek vs glmdeepseek v4qwen3glm-5.2open-weight llmchinese llm 2026

Partager cet article

Démarrez Votre Projet

Prêt à construire quelque chose d'extraordinaire ?

Transformons votre vision en réalité. Notre équipe est prête à vous aider à créer un logiciel qui fait la différence.