
Qwen vs DeepSeek vs GLM:2026年の中国オープンウェイト御三家 (2026)
最終確認日:2026年7月14日。 モデルバージョン(Qwen3.6、DeepSeek V4、GLM-5.2)、価格、およびライセンスは、この記事が公開された当日に公式チャネルで再確認されました。
「Qwen vs DeepSeek vs GLM」は、ClaudeやGPTと互角に戦える中国製のオープンウェイトモデルを探しているほとんどの開発者が検索する、まさにその三者比較です。私たちはそのうちの1つ、GLM-5.2(モデル文字列 GLM-5.2[1m])をメインのコーディングモデルとして3週間、月額72ドルで使用しました。DeepSeek V4はSWE-bench Verifiedで報告値約80.6%を記録しています。Qwen3.6はApache 2.0という、ここで紹介する中で最も寛容なライセンスの下で提供されています。3つのラボ、3つの全く異なる賭け。仕様表、誰が各数値を報告したかを明記したベンチマーク表、そして実際の本番環境でのテストを通じて、これらが実際にどう並ぶのかをご紹介します。
エージェント型コーディングや長期ホライズンのエージェントタスクには、GLM-5.2 が私たちの選択です(本番環境で3週間運用しました)。大規模なRAGにおいて最も安価なトークンを実現するには、価格面でDeepSeek V4 Flash が勝ります。ローカルでのセルフホスティングと最も寛容なライセンスを求めるなら、Qwen3(Apache 2.0)が最も広範で軽量なフットプリントを提供します。
クイックアンサー:
- Qwen、DeepSeek、GLMは1つのモデルではなく、それぞれ別々の企業(Alibaba、DeepSeek、Zhipu/Z.ai)によって提供されています。
- トークンあたりの最安値:DeepSeek V4 Flash(入力$0.14 / 出力$0.28 per M;キャッシュヒット時$0.0028)。
- 実践的なコーディングでのベストチョイス:GLM-5.2(Claude Codeで3週間運用);最も寛容なライセンス:Qwen(Apache 2.0)。
- 3社すべてが現在、モデルごとのニュアンスの違いはあるものの(Qwenのオープンモデルは様々)、概ね100万トークンのコンテキスト長に対応しています。
簡単な区別:これらは1つのモデルに3つの名前があるのではなく、3つの別々の企業です。DeepSeekの古いR1「distill Qwen」チェックポイントは、まったく別の古いものです。
一目でわかる Qwen vs DeepSeek vs GLM
この3つのファミリーは、正反対の設計方針を採用しています。Qwen(Alibaba)は、最も幅広いラインナップを持ち、セルフホスティングのフットプリントが軽く、Apache 2.0ライセンスを採用しています。DeepSeek(DeepSeek)は、巨大なMixture-of-Experts(MoE)モデルに基づいた、2段階の価格パフォーマンス戦略です。GLM-5.2(Zhipu/Z.ai)は、コーディングと長期ホライズンのエージェントタスクに特化しています。以下に仕様書を並べて示します。
| ファミリー | ベンダー | オープンフラッグシップ (+ クローズド) | パラメータ数 (合計 / アクティブ) | コンテキスト | ライセンス | セルフホスト |
|---|---|---|---|---|---|---|
| Qwen | Alibaba | Qwen3.6-27B dense, Qwen3.6-35B-A3B; Qwen3-Coder-Next 80B-A3B (Max = クローズド/APIのみ) | 例: 35B / 3B アクティブ (MoE) | ネイティブで最大256K (Coder-Next); 一部のPlusティアは約100万 | Apache 2.0 | 最軽量 (27B dense は報告値でVRAM約18GB) |
| DeepSeek | DeepSeek | V4 Pro (推論/エージェント用), V4 Flash (高速/低コスト) | V4 Pro 1.6T / 49B; V4 Flash 284B / 13B (報告値) | 100万 (公式) | MIT | 重厚 (クラスター級MoE) |
| GLM | Zhipu / Z.ai | GLM-5.2 | 753B / ~40B アクティブ | 100万 (2026年6月中旬以降) | MIT | 重厚 |
2点注意事項。Qwenはオープンモデルと、クローズドでAPI専用の「Max」フラッグシップを分けているため、意図するモデルを明確に指定する必要があります。また、DeepSeek V4のパラメータ数は公式ではなくブログで報告された値であるため、「報告値」というタグが付いています。
ベンチマークでの Qwen、DeepSeek、GLM の比較は?
すべてのベンチマークで勝利する単一のモデルはないため、順位ではなくクラスター全体を読んでください。コーディングでは、GLM-5.2が長期ホライズンのエージェントタスクでリードし、DeepSeek V4 Proが集計コーディングスコアでトップとなっています。推論では、両者ともAIMEで飽和状態に近い数値を出しています。一般知能指数では、GLMはオープンウェイトの中で中位に位置しています。異なるハーネスを使用するとモデル間の数値比較が難しくなるため、以下のスコアはすべて誰が公開したものか明記しています。
凡例:[SR] = ベンダーによる自己報告。[3P] = サードパーティのリーダーボード、独立した集計者、または私たち自身の実践テスト。n/aのセルは、ベンダーが同等のスコアを公開していないことを意味し、ゼロではありません。
| ベンチマーク | Qwen | DeepSeek V4 | GLM-5.2 | 報告元 |
|---|---|---|---|---|
| SWE-bench Verified | Coder-Next 70.6-71.3% [SR]; 3.6-27B 77.2% [3P] | Pro-Max ~80.6% [3P] | n/a | Qwenレポート; 単一ブログ (慎重扱い); DeepSeek スキャフォールド (未検証) |
| SWE-bench Pro | n/a | n/a | 62.1 [3P] | developersdigest / DataCamp (vs Claude Opus 4.8 ~69) |
| Terminal-Bench 2.1 | n/a | n/a | 81.0 [3P] | developersdigest |
| AIME 2025 | Qwen3-235B 81.5 [SR] | n/a | 99.2 [3P] | Qwenレポート; GLMはほぼ飽和 (天井効果) |
| LiveCodeBench v5 | Qwen3-235B 70.7 [SR] | n/a | n/a | Qwenレポート |
| BenchLM (2026年7月) | n/a | Pro 総合 87 / コーディング 89.8 [3P] | n/a | BenchLM 中国LLMランキング |
| AA Intelligence Index | n/a | n/a | 51 [3P] | Artificial Analysis |
2026年の中国製オープンウェイトベンチマークに対する率直な見解:すべての項目で勝利するモデルはなく、目を引く数値の半分は自己報告によるものです。Qwen3.6-27Bの77.2%という数値は単一のブログから来ており、DeepSeekの約80.6%は「未検証のスキャフォールド」を使用したものなので、どちらも慎重に扱う必要があります。私たち自身のテストでは、コンテンツファームの数値よりもSWE-benchリーダーボードやArtificial Analysisを重視しています。スキャフォールドの変更だけでスコアが数ポイント変動する可能性があるからです。モデルが自社の報告書のみを引用している場合は、その数値を少し割引いて考えるべきです。
DeepSeek V4:価格パフォーマンスの王者
DeepSeek V4は、100万トークンあたりのコストが重要な場合の選択肢です。2つのティアを提供しており、推論やエージェントワークにはV4 Pro、高速で低コストな大量コールにはV4 Flashを使用します。構造的な優位性はキャッシュ価格にあります。RAGパイプラインやエージェントがシステムプロンプトを再送信するなど、ワークロードが同じコンテキストを再読み込みする場合、キャッシュヒット率により、ここで紹介する他のオプションと比較して圧倒的に安価になります。
DeepSeek V4は2026年4月24日にプレビューとして launch されました。報告されているアーキテクチャは、V4 Proが1.6T / 49BアクティブMoE、V4 Flashが284B / 13Bですが、これらは公式に確認されたものではなくブログでの報告値です。ウェイトはMITライセンスの下でHugging Face (deepseek-ai/DeepSeek-V4-Pro, deepseek-ai/DeepSeek-V4-Flash) にあり、公式のコンテキストウィンドウは100万トークンです。
キャッシュヒットの経済性がどのように作用するかはこちらです:V4 Flashはキャッシュミス時に入力あたり$0.14/Mですが、キャッシュヒット時はわずか**$0.0028**、出力は$0.28です。同じドキュメントストアに頻繁にアクセスするRAGサービスにとって、この差が決定的です。完全な数値は公式DeepSeek価格ページに記載されています。
他社が指摘していない鮮度に関する落とし穴が1つあります:もしまだ deepseek-chat や deepseek-reasoner を呼び出している場合、これらのエンドポイントは2026年7月24日 15:59 UTC に廃止されます。この投稿からわずか10日後に期限が来るため、今すぐ deepseek-v4-pro または deepseek-v4-flash に移行してください。
DeepSeek V4は、コストに敏感でAPIファーストの製品、特に繰り返されるコンテキストが多い場合に適しています。シングルワークステーションでセルフホストするモデルではありません;大きなMoEはクラスター級のハードウェアを必要とします。
Qwen3:最も幅広いファミリーと最高のセルフホストフットプリント
Qwen3は、独自のハードウェアで実行するためのモデルです。3つの中で最も幅広いファミリーであり、オープンモデルはApache 2.0ライセンス(ここで最も寛容)を採用しており、denseティアはシングルGPUでも動作するほど軽量です。また、コーディングのみの比較では完全に省略されている、多言語ワークなどの非コーディング軸でも最強です。
ラインナップは深いです。オープン側では、Qwen3.6-27B (dense)、Qwen3.6-35B-A3B (MoE)、そしてコーディングラインの頂点であるQwen3-Coder-Next (80B-A3B, 256Kコンテキスト) が利用できます。別途、Qwen3-Max はクローズドでAPI専用のフラッグシップであるため、オープンウェイトと混同しないでください。バージョンとApache 2.0の条項は、Qwen3-Coder GitHubリポジトリ および Qwenチームのブログ で確認できます。
コーディングでは、Qwen3-Coder-Nextはハーネス間でSWE-bench Verified 70.6-71.3%を記録しています(自己報告、テスト時スケーリングなしのオープンモデルの中でSOTA)。セルフホストの見出し:dense 27Bクラスは報告値でVRAM約18GBで動作し、24GBカード1枚で余裕を持って実行できます。この数値は1つのブログからのものなので、自分の環境で検証してください。これらのモデルをローカルで実行する方法 や、1台のマシンを超えてスケールアップした際にvLLMまたはSGLangで提供する方法 はこちらです。
Qwenの命名規則は3つの中で最も不安定であるため、依存関係を固定する前に現在のオープンフラッグシップ名を再確認してください。 modest なハードウェアでのローカルデプロイ、多言語カバレッジ、またはMITではなくApache 2.0を特に必要とする場合には、Qwen3を選択してください。
GLM-5.2:コーディングと長期ホライズンエージェントの選択肢
GLM-5.2はコーディングと長期ホライズンのエージェントに特化したモデルで、私たちが firsthand で知っているものです。MITライセンスの下、合計753B / アクティブ約40BのMoEで、2026年6月中旬以降は100万トークンのコンテキストウィンドウを持ち、最大出力は約131Kトークンです。エージェントベンチマークでも健闘しており、SWE-bench Pro 62.1、Terminal-Bench 2.1で81.0、AIMEで99.2(ほぼ飽和)、Artificial Analysis Intelligence Indexで51(すべてサードパーティ)を記録しています。
ここで率直な部分を述べます。これが単なるベンチマークの焼き直しではなく信頼性を示すシグナルです:私たちの実践的な深さはGLMのみです。私たちはGLM-5.2 Pro を主要なコーディングモデルとして3週間、実際のクライアントリポジトリで使用し、Z.AIのAnthropic互換エンドポイント (api.z.ai/api/anthropic, モデル文字列 GLM-5.2[1m]) を介してClaude Codeから駆動しました。通常の週では、私たちの週次プロンプト約2,000件のうち1,300件程度を使用しました。移行作業が集中した2週間では、5日目に週次キャップに達し、超過分なしでハードストップとなりました。約12ファイルにわたる実際のNext.js 16 APIルートリファクタリングをクリーンに処理しました。コスト:GLM Coding Plan Proティアで月額72ドル。これは、そうでなければClaude Maxに支払うであろう約200ドル/月と比較して安価です。Qwen3とDeepSeek V4については公開されたベンチマークと短いAPIスポットチェックに依存しているため、GLMの評価は実際に私たちが体験したものであることに重きを置いてください。
切り替え自体は3つの環境変数で行え、Claude CodeでGLM Coding Planを3週間運用した記事 からそのまま再利用できます:
# Point Claude Code at GLM-5.2 via Z.AI's Anthropic-compatible endpoint
export ANTHROPIC_BASE_URL="https://api.z.ai/api/anthropic"
export ANTHROPIC_AUTH_TOKEN="your-zai-key"
export ANTHROPIC_MODEL="GLM-5.2[1m]"
claude月額72ドルでGLM-5.2を3週間使用することで、通常であればClaude Maxに約200ドル/月支払っていたコーディング作業をこなしましたが、忙しい週には5日目で週次キャップに達しました。完全な分解分析は私たちのGLM-5.2完全レビュー と上記のコーディンプランの投稿にあります;このセクションは3者の比較を均等にするために意図的に短くしています。モデルの詳細はZ.AIドキュメント にあります。
Qwen、DeepSeek、GLM のコストはいくら?
DeepSeek V4 Flashはトークンあたり最も安価で、GLMはトークン単位だけでなくフラットなサブスクリプション(Coding Plan)を販売しており、Qwenの「Plus」ティアは中間に位置します。3社すべてが商業利用に適したライセンスを採用しています。以下の価格は2026年7月14日時点の100万トークンあたりの価格です。
| モデル | 入力 (キャッシュミス) | 入力 (キャッシュヒット) | 出力 | コンテキスト | 備考 |
|---|---|---|---|---|---|
| deepseek-v4-flash | $0.14 | $0.0028 | $0.28 | 100万 | 最安値;キャッシュヒット優位 [公式 2026-07-14] |
| deepseek-v4-pro | $0.435 | $0.003625 | $0.87 | 100万 | 推論/エージェント用 [公式 2026-07-14] |
| GLM-5.2 (Z.aiリスト) | ~$1.40 | n/a | ~$4.40 | 100万 | サードパーティプロバイダー中央値 入力~$0.55 / 出力~$1.85 [3P] |
| Qwen3.6 Plus | ~$0.325 (35% プロモ) | n/a | ~$1.95 | 様々 | Qwen Max 入力~$0.80-1.25 / 出力~$3.75-3.90 [3P] |
価格表には大きな視点の転換が隠れています。GLMのCoding Plan はトークン単位ではなくフラットなサブスクリプションです:Lite $18、Pro $72、Max $160 / 月。終日コーディングを行う場合、このサブスクリプションはトークン単位のGLM API支出を上回ります。これがまさに私たちの3週間テストでこれを使用した理由です。たまにしかコールを発行しない場合は、トークン単位のGLM APIまたはDeepSeek V4 Flashの方が安価です。
ライセンスについて:DeepSeekとGLMはMIT、QwenはApache 2.0です。3社すべてが商業利用に適しています。再配布を計画している場合や明示的な特許条項が必要な場合は、Apache 2.0が最も寛容です。そのため、デプロイするチェックポイントのHugging Faceモデルカードで正確なライセンスを確認してください。
ここで中国モデル購入者が実際に寝不足になる質問:データレジデンシー。これらは中国のプロバイダーです。データを自国の管轄内に留めることはできますか? はい、セルフホストする場合可能です。オープンウェイト加上MITまたはApache 2.0ライセンス意味着您可以在EU(或您自己所在区域)的基础设施上运行其中任何一个模型,并且没有任何请求会离开您的网络。托管API则相反:您的数据会发送给提供商,我们的GLM评测特别指出了Z.ai针对托管端点的中国托管和保留条款。因此,对于严格的欧盟托管或合规性要求,请进行自我托管,而Qwen在这方面是最容易自我托管的。(是的,deepseek-chat / deepseek-reasoner 仍然会在2026-07-24 15:59 UTC退役。)
どれを選ぶべきか?
唯一の勝者はいないため、用途に合わせてモデルを選択してください。以下はユースケース別の決定マトリックスです。要約すると:エージェント型コーディングにはGLM-5.2、最も安価なトークンにはDeepSeek V4 Flash、最も困難な推論にはDeepSeek V4 ProまたはGLM、ローカルセルフホスト、多言語対応、データレジデンシーにはQwen3です。
| ユースケース | 選択 | 理由 |
|---|---|---|
| エージェント型コーディング / 長期ホライズンエージェント | GLM-5.2 | 私たちの3週間本番テスト;SWE-bench Pro 62.1、Terminal-Bench 81.0 |
| 最安トークン / 大規模RAG | DeepSeek V4 Flash | $0.14 / $0.28 per M、キャッシュヒット$0.0028 |
| 最も困難な推論 / フロンティアツール使用 | DeepSeek V4 Pro または GLM-5.2 | BenchLMコーディング 89.8 vs GLM Terminal-Bench 81.0;予算に応じて選択 |
| modest なハードウェアでのローカルセルフホスト | Qwen3.6-27B dense | VRAM約18GB (報告値)、Apache 2.0、最軽量フットプリント |
| 多言語対応の広さ | Qwen3 | 最も幅広いファミリー、非コーディング軸で最強 |
| EUデータレジデンシー / コンプライアンス | いずれかのオープンモデルをセルフホスト (Qwenが最も容易) | hosted APIはデータが管轄外へ流出するため |
なぜKimiではないのか? 良い質問です。Kimi K2.6 (Moonshot) は実在し強力です:BenchLMでは中国モデルの中で#2にランクインしています(総合81、コーディング88.7)。あえて3社に絞ったのは、「qwen vs deepseek vs glm」が人々が検索する正確なセットであり、清潔な三者比較が有用だからです。Kimiはより長いショートリストが必要な場合の自然な4番目の選択肢であり、LlamaやMistral alongside より広範なオープンソースLLMリーダーボード に載せるべきものです。正直な1段落で、四者比較の拡散は避けます。
著者について
Mert Batur GurbuzはTechsy.ioの共同創設者であり、同社チームはB2Bクライアント向けにAIエージェント、自動化システム、音声/SDRパイプラインを提供しています。バーミンガム大学で学び、Techsyチームが実際に本番環境で使用しているLLMツールスタックについて執筆しています。
共同創設者、Techsy.io — バーミンガム大学。LinkedIn でつながる。
よくある質問
Qwen、DeepSeek、GLMは同じものですか?
いいえ。これらは3つの異なる企業由来です:AlibabaがQwenを、DeepSeekがDeepSeek V4を、Zhipu/Z.aiがGLMを提供しています。混乱は通常、DeepSeekの古いR1「distill Qwen」チェックポイントに起因します。これらはDeepSeekの推論能力をQwenベースモデルに蒸留したものでした。これらは今日の独立したフラッグシップとは異なる、古い別物です。
2026年にコーディングに最適なのはどれですか?
ホスト型かセルフホスト型かによります。実践的なエージェント型コーディングでは、3週間の本番テストを経てGLM-5.2が私たちの選択です。DeepSeek V4 ProはBenchLMコーディングスコアでトップ(89.8)です。セルフホスト可能な最強モデルとしては、Qwen3-Coder-NextがオープンSWE-bench Verifiedで70.6-71.3%をリードしています。3社すべてが実際に使用可能です。
トークンあたり最も安価なのはどれですか?
間違いなくDeepSeek V4 Flashです。キャッシュミス時に入力$0.14/M、キャッシュヒット時$0.0028、出力$0.28(公式、2026年7月14日時点)です。RAGやシステムプロンプトを再読み込みするエージェントなど、繰り返しコンテキストを使用するワークロードでは、キャッシュヒット率により、この比較対象中の他の任何东西よりも安価になります。
Qwen、DeepSeek、GLMを独自のハードウェアでセルフホストできますか?
はい、3社すべてがオープンウェイトを公開しています。Qwenのdense 27Bは最も軽量で、報告値でVRAM約18GBで動作するため、24GBカード1枚で動作します。DeepSeek V4とGLM-5.2は大きなMixture-of-Expertsモデルであり、クラスター級ハードウェアを必要とします。1台のマシンを超えた場合は、vLLMまたはSGLangを使用していずれかを提供してください。
最大のコンテキストウィンドウを持つのはどれですか?
それらは100万トークン前後でクラスタリングしていますが、詳細を平坦化しないでください。DeepSeek V4は公式に100万、GLM-5.2は2026年6月中旬に100万に達しました。Qwenのオープンモデルは様々です:Qwen3-Coder-Nextはネイティブで256K、一部のホスト型「Plus」ティアは約100万に達します。想定せず、デプロイする特定のチェックポイントを確認してください。
GLM-5.2はコーディングにおいてClaudeやGPTと同じくらい優れていますか?
ベンチマークでは接近しています(SWE-bench Pro 62.1 vs Claude Opus 4.8 約69)し、実践ではギャップが示唆するよりも近いです。私たちの3週間テストでは、GLM-5.2は月額72ドルで、私たちがClaude Maxに支払っている約200ドル/月の大部分のコーディング作業をこなしました。トレードオフは、忙しい週には5日目に停止させる硬い週次キャップです。
Kimi K2.6はどうなのか、なぜ3つに含まれていないのですか?
Kimi (Moonshot) は実在し強力です。BenchLMでは中国モデル全体で#2(81)、コーディングで88.7とランク付けされています。私たちは人々が検索する正確な三者比較フレームを維持したため、Kimiは見出しセットに入りませんでした。より長いオープンウェイトショートリスト上の自然な4番目の選択肢と考えてください。欠落ではありません。
商業利用可能なライセンスはどれですか?
3社すべてです。DeepSeekとGLMはMIT、QwenのオープンモデルはApache 2.0の下で提供されています。これらすべてが商業利用に適しています。Apache 2.0は明示的な特許条項があり、再配布の場合に重要になる可能性があるため、最も寛容です。デプロイする正確なモデルのHugging Faceモデルカードでライセンスを常に確認してください。
APIベースの製品にはQwenとDeepSeek V4のどちらを選ぶべきですか?
キャッシュヒット価格の優位性のおかげで、コストに敏感、高ボリューム、またはRAG重視の製品にはDeepSeek V4です。多言語対応の広さや特にApache 2.0ライセンスが必要な場合はQwenです。どちらもAPI経由で利用可能で、どちらもセルフホスト可能であるため、決定要因は通常、トークン量とライセンス制約です。
結論
Qwen vs DeepSeek vs GLMから単一の勝者を無理に選び出さないでください。階層化し、仕事に応じて選択してください:
- エージェント型コーディングと長期ホライズンのエージェントにはGLM-5.2。月額72ドルで3週間運用し、その座を獲得しました。
- 最も安価なトークンと大規模RAGにはDeepSeek V4 Flash。ここにある他の任何东西も匹配しないキャッシュヒット価格を提供します。
- modest なハードウェアでのローカルセルフホスト、多言語ワーク、最も寛容なライセンス(Apache 2.0)にはQwen3。
より大きな教訓:順位ではなくベンチマークのクラスターを読み、自己報告数値を割引いてください。この分野では単語数よりも鮮度が重要です。3社すべてがほぼ月次のペースで新しいバージョンを出荷しているからです。
モデルを選ぶのは簡単な部分です。フォールバック、コストキャップ、評価ゲートを備えた本番スタックに配線することが、チームが行き詰まる場所です。それが私たちがTechsyで行っていることで、本番エージェントスタックにオープンウェイトモデルを組み込む ことで、実際のトラフィックの下でも耐えられるようにしています。