Techsy
お問い合わせ
始める
ブログ一覧へ戻る
ai-machine-learning

2026年ベストなオープンソースLLM:8モデルをベンチマーク、GPT-4級を超えたのは3つだけ

著者: Mert Batur Gürbüz
更新日 Jul 5, 2026
4 分
目次
2026年ベストなオープンソースLLM:8モデルをベンチマーク、GPT-4級を超えたのは3つだけ

2026年ベストなオープンソースLLM:8モデルをベンチマーク、GPT-4級を超えたのは3つだけ

最終更新:2026年7月5日。 本ガイドに掲載しているすべてのベンチマークスコア、VRAM数値、ライセンスは、今回の更新に合わせて再検証しました。以下のランキングは2026年半ばまでにリリースされたオープンウェイトモデルを反映しています。新たなリリースによって順位が変わった場合は、当月内にこのページを更新します。

2026年最高のオープンソースLLMは、総合的な推論とコーディングで Qwen 3 235B-A22B です。深い数学的推論では DeepSeek R1 が、ロングコンテキスト(1000万トークン)では Llama 4 Scout がリードしています。コンシューマー向けGPU 1枚で動かすなら、Gemma 3 27B(VRAM 16GB)と Phi-4 14B(8GB)が最もセルフホストしやすいモデルです。上位3モデルはいずれも、コードと数学で GPT-4級のパフォーマンスを達成しながら、無料でデプロイできます。

主要オープンソースLLM:ベンチマーク概要

以下の表は、広くデプロイされている5つのオープンソースモデルを、標準的な公開ベンチマークで評価したものです。MMLU は幅広い汎用知識を、HumanEval はコード生成のパス率を測定します。

モデルパラメータリリースMMLUHumanEvalライセンス最適な用途
Llama 3.3 70B70B2024年12月86.088.4Llama 3.3 Community汎用、多言語
Qwen 2.5 72B72B2024年9月85.0+86.6Qwen License数学、コーディング、指示追従
DeepSeek-V3671B(アクティブ 37B)2024年12月87.182.6MIT汎用、コーディング、高コスト効率
Mistral Small 3.124B2025年3月80.688.4Apache 2.0エージェント型ワークフロー、ビジョン、多言語
Gemma 3 27B27B2025年3月~78.687.8Gemma Terms of Use単一GPUデプロイ、マルチモーダル

この表は毎月更新しています。

オープンソースLLMは、もはやプロプライエタリモデルと「競合する」だけの存在ではありません。コーディング、数学、ロングコンテキストのタスクでは、むしろ勝っているのです。月額200ドルのAPI請求書と、セルフホストしたオープンモデルとの差は、かつてないほど小さくなっています。

このランキングは、誇大広告を排したものです。ここで取り上げるすべてのモデルを、重要なベンチマーク、実際に必要となるハードウェア、そしてそれぞれが最も輝く具体的なユースケースという観点で評価しています。

クイックサマリー:どのオープンソースLLMを選ぶべきか?

最高峰の推論性能が必要ですか? それなら Qwen 3 235B か DeepSeek R1 です。GPU 1枚で何か動かしたい? Gemma 3 27B か Phi-4 14B がおすすめです。巨大な文書を処理したい? Llama 4 Scout の1000万トークンコンテキストは他を圧倒しています。

順位モデルパラメータ(アクティブ)最適な用途ライセンス最小VRAM
1位Qwen 3 235B-A22B235B(22B)推論+コーディングApache 2.0~132 GB(Q4)
2位DeepSeek R1671B(37B)深い推論+数学MIT~136 GB(Q4)
3位Llama 4 Scout109B(17B)ロングコンテキスト(1000万トークン)Llama License~55 GB(Q4)
4位DeepSeek V3671B(37B)汎用+コーディングMIT~136 GB(Q4)
5位Mistral Large 3675B(41B)多言語+エンタープライズApache 2.0~140 GB(Q4)
6位Gemma 3 27B27B(27B、密)単一GPUデプロイオープンウェイト~16 GB(Q4)
7位Phi-4 Reasoning14B(14B、密)エッジ+モバイル端末MIT~8 GB(Q4)
8位GLM-4.7355B(32B)エージェント型コーディングワークフローMIT~130 GB(Q4)

VRAMの数値は Q4 量子化を前提としています。フル精度での必要量は2〜4倍になります。モデルのローカル実行が初めての方は、Gemma 3 か Phi-4 から始めるのがおすすめです。このリストの中で最もハードウェアに優しい選択肢だからです。

オープンソースLLMリーダーボード:2026年7月ランキング

2026年7月現在、総合的な推論とコーディングでオープンソースLLMリーダーボードの首位に立っているのは Qwen 3 235B-A22B です。深い数学で2位に DeepSeek R1、ロングコンテキストで3位に Llama 4 Scout が続きます。以下の完全版ランキングでは、本ガイドで評価した8モデルすべてを、データセンター向けの本格構成からノートPCで動く軽量モデルまで網羅しています。

順位モデルライセンス最適な用途最小VRAM
1位Qwen 3 235B-A22BApache 2.0推論+コーディング~132 GB(Q4)
2位DeepSeek R1MIT深い推論+数学~136 GB(Q4)
3位Llama 4 ScoutLlama Licenseロングコンテキスト(1000万トークン)~55 GB(Q4)
4位DeepSeek V3MIT汎用+コーディング~136 GB(Q4)
5位Mistral Large 3Apache 2.0多言語+エンタープライズ~140 GB(Q4)
6位Gemma 3 27Bオープンウェイト単一GPUデプロイ~16 GB(Q4)
7位Phi-4 ReasoningMITエッジ+モバイル端末~8 GB(Q4)
8位GLM-4.7MITエージェント型コーディングワークフロー~130 GB(Q4)

これらのランキングは、ベンチマーク、必要なハードウェア、ライセンス条件を毎月再検証した結果を反映しています。

それでは、各モデルがなぜ注目に値するのか、詳しく見ていきましょう。

1. Qwen 3 235B-A22B、総合ベストなオープンソースLLM

Alibaba の Qwen 3 235B-A22B は、今まさに打倒すべきモデルです。総パラメータ数2350億の Mixture-of-Experts アーキテクチャですが、トークンごとに活性化するのはわずか220億で、同等品質の密(dense)モデルと比べて計算量を約90%削減しています。

Qwen 3 を際立たせているのは、デュアルモードの思考機能です。複雑な数学やコーディングの問題には「思考モード」(モデルが思考の連鎖を表示します)を、素早いチャット応答には高速な「非思考モード」を切り替えて使えます。この柔軟性は、本番環境で大きな意味を持ちます。

ベンチマークのハイライト:

ベンチマークQwen 3 235B スコア内容
AIME 202485.7%競技レベルの数学
AIME 202581.5%より難しい数学問題
LiveCodeBench v570.7%実際のコーディングタスク
CodeForces2,056競技プログラミング
BFCL v370.8%関数呼び出し

これらの数値は、DeepSeek R1、OpenAI の o1、Gemini 2.5 Pro と同じ水準にあります。ただし、Apache 2.0 の下で、ダウンロードもファインチューニングも、好きな場所へのデプロイも自由にできる点が異なります。

必要なハードウェア: フルモデルには Q4 量子化で約132GBの VRAM が必要です。つまりマルチGPU構成で、具体的には RTX 3090 5枚、A40 3枚、あるいは H100 2枚構成のマシンを想定してください。安くはありませんが、スタートアップや研究ラボなら十分手の届く範囲です。Qwen 3 ファミリーには、コンシューマー向けハードウェアで動作する小型バリアント(32B、14B、8B、4B)も含まれています。

どんな人向けか: フロンティアレベルの推論・コーディング性能が必要で、かつインフラを自社で保有したいチーム向けです。256K のコンテキストと100以上の言語サポートを備え、多言語ワークロードに特に強みを発揮します。特定のドメイン向けにモデルをファインチューニングする予定があるなら、Qwen 3 の Apache 2.0 ライセンスで完全に自由に行えます。

2. DeepSeek R1 —— 深い推論に最適

DeepSeek R1 は2025年初頭の登場時にゲームチェンジャーとなり、オープンソースモデルが推論タスクで OpenAI の o1 に匹敵しうることを証明しました。R1-0528 アップデートで性能はさらに向上し、AIME 2025 の正答率は70%から87.5%へ跳ね上がりました。

このモデルの秘密兵器は、その学習手法にあります。DeepSeek はまず、教師ありファインチューニングによるウォームアップを一切行わず、純粋な強化学習だけで R1-Zero を構築しました。モデルは自発的に、思考の連鎖による推論、自己検証、バックトラッキングといった振る舞いを獲得しました。まさに、自分の答えを自分でチェックする方法を自ら学び取ったのです。

ベンチマークのハイライト:

ベンチマークDeepSeek R1 スコア内容
AIME 202587.5%(R1-0528)数学オリンピック
GPQA Diamond71.5%大学院レベルの科学
SWE-bench49.2%実際のソフトウェアエンジニアリング
HumanEval92.4%コード生成

必要なハードウェア: DeepSeek V3 と同じ671Bの MoE アーキテクチャなので、Q4 で約136GBの VRAM を見込む必要があります。ただし実用的な観点があります。DeepSeek は1.5B、7B、14B、32B、70Bのパラメータを持つ蒸留(distill)バリアントも公開しています。32Bの蒸留モデルは RTX 4090 1枚で動作し、推論タスクではより大きなモデルの多くを上回る性能を発揮します。

どんな人向けか: ステップバイステップの推論、定理証明、複雑なコードデバッグ、科学的分析を必要とするアプリケーションを構築するすべての人におすすめです。蒸留バリアントは、限られた予算で推論機能が必要な場合に特に有用です。小型の蒸留モデルを自分のハードウェアでデプロイしたい方は、LLM のローカル実行に最適なツールをご覧ください。

3. Llama 4 Scout、ロングコンテキストに最適

Meta の Llama 4 Scout は、オープンソースの世界に真に新しいものをもたらしました。1000万トークンのコンテキストウィンドウです。打ち間違いではありません。コードベース全体、棚いっぱいの研究論文、あるいは20時間分の動画の文字起こしを、たった1つのプロンプトで投入できます。

Scout は16個の MoE エキスパートを使用し、トークンごとに活性化するのはそのうち2つだけです。総パラメータは109Bですが、アクティブなのはわずか17Bです。Meta は INT4 量子化で H100 1枚に収まると主張していますが、1000万トークンのコンテキストウィンドウには当然、KVキャッシュ用にさらに多くのメモリが必要です。

ベンチマークのハイライト:

ベンチマークLlama 4 Scout スコア内容
Needle-in-a-Haystack(1000万)100%完全な検索精度
MMLU79.6%汎用知識
HumanEval81.2%コード生成
DocVQA85.1%文書理解

1000万トークンで Needle-in-a-Haystack スコア100%を達成している点は驚異的です。ほとんどのモデルは128Kに達するはるか前から情報を失い始めます。Scout は、文書間のアテンションをマスクする独自のアプローチを採用しており、巨大なコンテキストウィンドウ内でも文書同士の境界を維持します。

必要なハードウェア: Q4 では、モデルの重みに約55GBの VRAM が必要です。H100 1枚(80GB)で余裕を持って処理できます。コンシューマー向けハードウェアでは、RTX 4090 2枚(合計48GB)で短めのコンテキスト長なら対応可能です。注意点として、1000万トークンのコンテキストウィンドウをフルに使うには、モデルの重みに加えて膨大な KVキャッシュメモリが必要になります。実際には、セルフホストのデプロイの多くは128K〜256Kトークンが上限です。

どんな人向けか: 巨大な文書を扱うチーム、法務分析、コードリポジトリのQ&A、研究論文の統合などに最適です。マルチモーダル機能(テキスト+画像入力)も強力です。ただしコンテキスト長については現実的に考えてください。1000万という上限は実在しますが、そこに到達するにはサーバーグレードのハードウェアが必要です。

4. DeepSeek V3 —— 汎用ベストなオープンソースLLM

推論で話題をさらっているのは DeepSeek R1 ですが、DeepSeek V3 は日常利用という点で、おそらくこちらのほうが実用的なモデルです。まさに働き者で、高速、全方位的に高性能、そしてこのサイズからは信じがたいほど高効率です。

V3 は R1 と同じ671Bの MoE / アクティブ37Bというアーキテクチャを共有していますが、深い推論の連鎖の代わりに、より高速な応答と幅広い汎用性能を手に入れています。V3-0324 アップデートでは R1 の学習で使われた強化学習の手法が取り込まれ、明示的な思考の連鎖によるレイテンシの増加なしに推論性能を強化しています。

ベンチマークのハイライト:

ベンチマークDeepSeek V3 スコア内容
MMLU87.1%汎用知識
HumanEval82.6%コード生成
MATH90.2%数学的推論
コンテキストウィンドウ128K長文書サポート

DeepSeek V3 は、コーディングと数学のベンチマークで GPT-4.5 を上回っています。その学習効率の高さは伝説的で、フルの事前学習に要したのはわずか278万8000 H800 GPU時間と、同等のモデルが必要とする量のほんの一部です。

必要なハードウェア: R1 と同じ(Q4 で約136GBの VRAM)です。実用的なデプロイには、GGUF 量子化バージョンを llama.cpp や Ollama 経由で、マルチGPUのコンシューマー向け構成で実行できます。

どんな人向けか: チャット、コーディング、分析、翻訳、要約と、すべてをこなす1つのモデルが必要なら、V3 が最もバランスの取れた選択肢です。難しい推論で R1 に、コンテキスト長で Scout に勝つことはできませんが、速度と汎用性がピーク時のベンチマークスコア以上に重要な、典型的な本番ワークロードでは両者を上回ります。

5. Mistral Large 3 —— 多言語・エンタープライズに最適

Mistral Large 3 は、Mistral をフロンティアの舞台に復帰させました。総パラメータ675B(アクティブ41B)の本格的な MoE モデルで、Apache 2.0 の下でリリースされています。これは Mistral Large 2 の制限の多い研究用ライセンスからの大きな転換です。

このモデルは3000基の NVIDIA H200 GPU でゼロから学習されており、その成果は数字に表れています。LMSYS Chatbot Arena では、オープンモデルの中で2位、全体(プロプライエタリモデル含む)で6位にランクインしました。ヨーロッパのチームにとって特に興味深いのはその多言語性能で、バランスの取れた多言語 MMLU テストで約85.5%の正答率を記録しています。

ベンチマークのハイライト:

ベンチマークMistral Large 3 スコア内容
多言語 MMLU85.5%言語横断的な知識
LMSYS Arena全体6位人間の嗜好ランキング
AIME 2025(14B バリアント)85%数学的推論
コンテキストウィンドウ128K長文書サポート

Mistral モデルを際立たせる特徴が1つあります。ハルシネーションを起こす代わりに「わかりません」と言うように学習されている点です。そのため Mistral Large 3 は、RAG パイプラインや、創造的な出力よりも事実の正確さが重視されるエンタープライズアプリケーションに最適です。

必要なハードウェア: 総パラメータ675Bのため、VRAM の必要量は DeepSeek と同程度(Q4 で約140GB)です。Mistral は14Bの Small 3 バリアントも提供しており、コンシューマー向けGPU 1枚に収まりながら、推論・コーディングでサイズを大きく上回る性能を発揮します。

どんな人向けか: 多言語対応とデータ主権が必要なヨーロッパの企業向けです。ハルシネーションの削減が重要な RAG システムを構築するエンタープライズチームにも最適です。Apache 2.0 ライセンスにより、商用利用の障壁は完全に取り除かれています。

6. Gemma 3 27B、単一GPUデプロイに最適

Google の Gemma 3 27B は、性能と使いやすさのちょうど良いバランス点にあります。密(dense)アーキテクチャで270億パラメータながら、Q4 量子化で RTX 4090 1枚で動作します。マルチGPU構成もサーバーグレードのハードウェアも不要で、普通のゲーミング用グラフィックカードで動きます。

控えめなパラメータ数に騙されてはいけません。Gemma 3 27B は、特にマルチモーダルタスクでサイズを大きく上回る実力を発揮します。テキストと画像の両方の入力に対応し、140以上の言語をサポート、130Kのコンテキストウィンドウはこのサイズのモデルとしては十分すぎるほど広いです。

ベンチマークのハイライト:

ベンチマークGemma 3 27B スコア内容
MMLU78.6%汎用知識
DocVQA85.6%文書理解
MGSM74.3%多言語数学
ChartQA76.3%視覚的推論

これらのマルチモーダルスコア(DocVQA 85.6%、ChartQA 76.3%)は、3〜5倍大きなモデルに匹敵します。GPUクラスターなしで画像理解が必要な開発者にとって、Gemma 3 は明白な選択肢です。

必要なハードウェア: Q4 量子化で約16GBの VRAM、Q8 で32GBです。RTX 4090 1枚(24GB)で余裕を持って処理できます。32GBの統合メモリを搭載した M2 MacBook Pro でも動作します。LLM のローカル実行ガイドに従って進めている方にとって、Gemma 3 は最も始めやすいモデルの1つです。

どんな人向けか: 個人開発者、小規模チーム、そしてクラウドGPUを借りずに高性能なマルチモーダルモデルを使いたいすべての人におすすめです。プロトタイピングにも最適で、まず Gemma 3 でローカルにパイプラインをテストし、必要に応じて本番ではより大きなモデルにスケールアップできます。Google の新しい小型モデルについては、Gemma 4 12B ガイドをご覧ください。

7. Phi-4 Reasoning、エッジ・リソース制約下でのデプロイに最適

Microsoft の Phi-4 Reasoning は、パラメータ数がすべてではないことを証明しています。わずか140億パラメータながら、複数の推論ベンチマークで DeepSeek R1 の70B蒸留モデルを上回っています。最近リリースされた Phi-4-reasoning-vision-15B はマルチモーダル機能を追加し、数学・視覚推論タスクで Gemma 3 12B を17%上回るスコアを記録しました。

Phi-4 ファミリーの秘密は、学習データの品質にあります。Microsoft のアプローチは、単純な規模よりも厳選された高品質なデータを重視するもので、それが功を奏しています。Phi-4 は MATH と MGSM のベンチマークで80%以上を記録し、数学的推論で Google の Gemini Pro や GPT-4o-mini を上回っています。

ベンチマークのハイライト:

ベンチマークPhi-4 スコア内容
MATH82.6%数学的推論
HumanEval82.6%コード生成
MGSM80%+多言語数学
MathVista(ビジョン)Gemma 12B 比 +17%視覚数学

必要なハードウェア: Q4 で約8GBの VRAM です。ノートPCのGPU、あるいは少し前のデスクトップ用グラフィックカードでも動きます。Apple Silicon 搭載 MacBook でも快適に動作し、真の意味でポータブルです。エッジデプロイ向けには、デバイス上で妥当なレイテンシで動作できる数少ないモデルの1つです。

どんな人向けか: モバイル・エッジ開発者、デバイスオンデバイス AI 機能を構築するチーム、そして最小限のハードウェアで強力な推論が必要なすべての人におすすめです。Phi-4 はサイズが小さいため学習のイテレーションが速く安価で、ファインチューニングしたモデルの評価にも最適です。MIT ライセンスなので商用利用の制限もありません。

8. GLM-4.7 —— エージェント型コーディングに最適

Z.ai の GLM-4.7 は、特定のユースケースに特化して作られています。モデルが推論し、ツールを使い、長いマルチステップのやり取りを通じてコンテキストを維持する必要がある、エージェント型コーディングワークフローです。

アーキテクチャは355Bの MoE で、アクティブパラメータは32Bです。しかし最大の特徴は、3層構造の思考システムにあります。ほとんどのモデルがターンごとに推論プロセスをリセットするのに対し、GLM-4.7 は会話全体を通じて思考ブロックを保持します。この永続的な推論コンテキストが、モデルが複雑なマルチステップのコーディングタスクを統括する際に、大きな差を生みます。

ベンチマークのハイライト:

ベンチマークGLM-4.7 スコア内容
SWE-bench73.8%実際のソフトウェアエンジニアリング
HumanEval94.2%コード生成
コンテキストウィンドウ200K長いやり取り
最大出力131K トークン拡張生成

この73.8%という SWE-bench スコアは、Claude Sonnet 4.5 に匹敵します。しかも合成ベンチマークではなく、実世界のソフトウェアエンジニアリングタスクでの結果です。そして94.2%の HumanEval は、このリストの中で最高値です。

必要なハードウェア: 他の大規模 MoE モデルと同程度(Q4 で約130GBの VRAM)です。200Kのコンテキストウィンドウと131Kの最大出力により、長いエージェントセッション中はメモリを大量に消費します。

どんな人向けか: コーディングエージェント、自動デバッグツール、コードレビューシステムを構築する AI 支援開発チーム向けです。コーディング特化モデル向けのファインチューニングツールを選んでいるなら、GLM-4.7 は有力なベースモデルになります。MIT ライセンスなので、完全な商用利用が可能です。

コーディングに最適なオープンソースLLM(2026年7月)

2026年7月時点のコーディングでは、GLM-4.7 がオープンソースの最有力候補です。HumanEval で94.2%、SWE-bench で73.8%を記録し、実際のソフトウェアタスクで Claude Sonnet 4.5 に匹敵します。コンシューマー向けハードウェアで強力なコーディングモデルを使いたいなら、DeepSeek R1 の32B蒸留モデルは RTX 4090 1枚で動作します。

新しい GLM リリースを検討していますか? 比較については GLM 5.2 の詳細解説をご覧ください。

選び方:意思決定フレームワーク

「ベスト」なモデルは、完全にあなたの制約条件次第です。このマトリックスを使って選択肢を絞り込んでください。

もし必要なら...選ぶべきモデル理由
総合ベストの推論Qwen 3 235B数学・コード・汎用ベンチマークで最高水準
深い思考の連鎖DeepSeek R1自己修正型推論、AIME 87.5%
巨大なコンテキストウィンドウLlama 4 Scout1000万トークン、完全な検索精度
高速な汎用モデルDeepSeek V3速度と品質の比が最高
多言語エンタープライズMistral Large 3多言語 MMLU 85.5%、ハルシネーション抑制
コンシューマー向けGPU 1枚Gemma 3 27BVRAM 16GB、強力なマルチモーダル
ノートPC・エッジ端末Phi-4 14BVRAM 8GB、MIT ライセンス
コーディングエージェントGLM-4.7HumanEval 94.2%、永続的推論

まだ迷っていますか? ここから始めましょう。マルチGPUのハードウェアはありますか? ないなら、選択肢は Gemma 3 と Phi-4 です。あるなら、コーディングエージェントを作っていますか? 作っているなら GLM-4.7 か DeepSeek R1 を選びましょう。ロングコンテキストが必要ですか? Llama 4 Scout です。それ以外なら? Qwen 3 235B が最も無難な定番です。

ランキングの算出方法

ランキングは単一のベンチマークに基づいていません。各モデルを5つの観点で評価しました。

  1. ベンチマーク性能 — MMLU、HumanEval、AIME、SWE-bench、およびドメイン固有のテスト
  2. ハードウェアの入手しやすさ — 実際のチームが本当にデプロイできるか?
  3. ライセンスの自由度 — Apache 2.0 と MIT は制限の多いライセンスより高評価
  4. エコシステムの成熟度 — Hugging Face、Ollama、vLLM、主要な推論エンジンで利用可能か
  5. 実世界での採用実績 — 活発なコミュニティ、本番デプロイ、継続的なアップデート

ベンチマークで高スコアを出しても、誰も持っていないGPUクラスターを要求するモデル(そう、671Bのフル精度のことです)は減点されます。商用利用を阻む制限の多いライセンスのモデルも減点です。目的はリーダーボードでの見栄ではなく、実用的な価値です。

これらのモデルを自分でテストしたい方は、LLM 評価ガイドで体系的なベンチマークの構築方法を解説しています。また、ベストな評価ツールのまとめでは、必要となるフレームワークを紹介しています。

よくある質問(FAQ)

2026年最新のオープンソースLLMは?

2026年のフロンティアは、Qwen 3(Alibaba)、DeepSeek R1 と V3、Llama 4 Scout(Meta)、Mistral Large 3、そして GLM-4.7(Z.ai)がリードしています。DeepSeek R1-0528 や Phi-4 reasoning-vision バリアントといったポイントリリースは、2026年半ばまでに登場しました。このリストは毎月再確認し、新たなリリースでランキングが変わるたびにリーダーボードを更新しています。

このオープンソースLLMリーダーボードはどれくらいの頻度で更新されますか?

毎月です。毎月初めにベンチマークスコア、VRAM の必要量、ライセンスを再検証し、新しいモデルがリリースされ次第追加しています。タイトル下の「最終更新」日付が、最新のレビューを反映しています。

2026年最高のオープンソースLLMは?

現在、最も幅広いベンチマークでリードしているのは Qwen 3 235B-A22B で、Apache 2.0 ライセンスの下、最高水準の推論・コーディング・多言語性能を兼ね備えています。特定のユースケースでは、DeepSeek R1(推論)や Llama 4 Scout(ロングコンテキスト)のほうが適している場合もあります。

オープンソースLLMはコンシューマー向けハードウェアで動かせますか?

はい。Gemma 3 27B は RTX 4090 1枚(VRAM 24GB)で動作し、Phi-4 14B は8GBのノートPC用GPUに収まります。大きなモデルの量子化バージョン(Q4、Q8)も、Ollama や llama.cpp といったツールを使えば、マルチGPUのコンシューマー向け構成で動作します。

オープンソースLLMは ChatGPT や Claude に匹敵しますか?

コーディングと数学のベンチマークでは、最高のオープンソースモデルは GPT-4.5 に匹敵するか上回り、Claude Sonnet 4.5 の性能に迫っています。構造化されたタスク(コード、数学、推論)では差が最も小さく、創造的な文章写作やニュアンスを要する指示追従では差が最も大きくなります。

MoE(Mixture-of-Experts)はハードウェアにとって何を意味しますか?

MoE モデルは総パラメータ数が多いものの、トークンごとに活性化するのはその一部だけです。ただし、ルーターがエキスパートを選択できるように、モデル全体をメモリに読み込む必要があります。アクティブ22Bの235B MoE モデルでも、235B分の VRAM が必要です。メモリは節約できず、節約できるのは計算量です。

コーディングに最適なオープンソースLLMは?

GLM-4.7 が HumanEval 94.2%、SWE-bench 73.8%でリードしています。純粋なコード生成では、DeepSeek R1 と Qwen 3 235B が僅差で続きます。コンシューマー向けハードウェアでのコーディングには、DeepSeek R1 の32B蒸留モデルが性能対コスト比で最良です。

Llama 4 Scout は本当に1000万トークンのコンテキストに対応しているのですか?

アーキテクチャ上は対応しており、Meta は1000万トークンで Needle-in-a-Haystack の完全な検索精度を実証しています。ただし、コンテキストをフルに使うには膨大な KVキャッシュメモリが必要です。セルフホストのデプロイでは、現実的には128K〜256Kトークンが上限です。Together AI や Fireworks といったクラウドプロバイダーは、より長いコンテキストウィンドウを提供しています。

オープンソースLLMではどのライセンスを選ぶべきですか?

Apache 2.0 と MIT が最も寛容で、商用利用、改変、再配布が完全に自由です。Llama の独自ライセンスは商用利用を認めていますが、ユーザー数7億人以上のアプリには制限があります。Gemma のようないくつかの「オープンウェイト」モデルには固有の利用条件があるため、本番デプロイ前に必ずライセンスを確認してください。

70Bモデルにはどれだけの VRAM が必要ですか?

Q4 量子化で、70Bの密(dense)モデルには約35〜40GBの VRAM が必要です。A100 1枚(80GB)で余裕を持って処理でき、RTX 4090 2枚(合計48GB)でも対応できます。フル精度(BF16)では140GB以上となり、事実上 A100 4枚かそれに相当する構成が必要です。

自分のユースケースに合わせてオープンソースLLMをファインチューニングできますか?

もちろん可能です。QLoRA を使えば、24GBのGPU 1枚で70Bモデルのファインチューニングができます。Phi-4 や Gemma 3 といった小型モデルは、ファインチューニングの実験がさらに手軽です。Apache 2.0 と MIT ライセンスのモデルは、派生作品に制限がありません。

オープンソースのマルチモーダルLLMはどうですか?

Gemma 3 27B と Llama 4 Scout は、どちらもテキストと画像の入力にネイティブに対応しています。Phi-4-reasoning-vision-15B は、より小規模ながら視覚的推論を追加しています。動画理解については、Llama 4 Scout がコンテキストウィンドウ内で最大20時間の動画入力に対応しています。

今、最高のオープンソースLLMは?

現在、総合で最高のオープンソースLLMは Qwen 3 235B-A22B で、Apache 2.0 ライセンスの下、推論とコーディングでリードしています。コンシューマー向けGPU 1枚なら、Gemma 3 27B(VRAM 16GB)が最有力で、コーディングエージェントでは GLM-4.7 が HumanEval 94.2%でトップです。

オープンソースLLMのリーダーボードはありますか?

はい。上記の2026年7月版リーダーボードでは、本ガイドの8モデルすべてをランキングしています。また、Hugging Face はコミュニティ運営の Open LLM Leaderboard をホストしており、より幅広いモデルをカバーしています。MMLU、HumanEval、AIME、SWE-bench といったベンチマークに対し、毎月ランキングを再検証しています。

ツールを選ぶのは、作業の半分、しかも簡単な半分です。実際のプロダクトの中で安定して動作させるところで、ほとんどのチームが足踏みします。そしてそれこそが、私たちの AI インテグレーションチームがクライアント向けに構築しているものです。RAG パイプラインからカスタムエージェントまで対応します。あなたの技術スタックについてセカンドオピニオンが欲しいですか? 無料相談はこちら。

情報源

  • Qwen 3 技術レポート - arXiv
  • Meta Llama 4 公式ページ
  • DeepSeek R1 - Hugging Face
  • Gemma 3 - Google DeepMind
  • Phi-4 Reasoning 技術レポート - Microsoft Research
  • Mistral Large 3 発表
  • GLM-4.7 - Hugging Face
  • Open LLM Leaderboard - Hugging Face

タグ

2026年 ベスト オープンソース LLMオープンソース LLMllama 4qwen 3deepseekgemma 3phi-4LLM セルフホストローカル LLM

記事をシェアする

関連記事

その他の記事 ai-machine-learning

ai-machine-learning
Jul 20, 2026

2026年ベストAIウェブスクレイピングAPI 8選(自社エージェントスタックで実測)

自社エージェントスタックで取得した2026年の実価格をもとに、8つのAIウェブスクレイピングAPIをテスト。Firecrawl、Bright Data、ScrapingBeeほか5社を、LLM対応出力・アンチボット突破・MCPサポートの観点でランキング。

9 min read 分
読む
ai-machine-learning
Jul 20, 2026

コーディングのためのプロンプトエンジニアリング:Claude CodeとCursorで毎日使う7つのパターン(2026年版)

多くの「AIコーディングプロンプト」記事はコピー用のテンプレートを50個並べるだけですが、この記事では私たちが16エージェントのClaude Codeパイプラインを運用するために毎日使っている7つのパターンを紹介します。各パターンの具体的な改善前後の例に加え、2026年時点でのClaude Code、Cursor、Copilotにおける各パターンの適用方法も解説します。

11 min read 分
読む
ai-machine-learning
Jul 19, 2026

AI PoCから本番環境へ:リリース前の12項目チェックリスト

AIのデモが動くことと、本番システムは別物です。本記事の12項目チェックリストでは、すべてのAI機能がリリース前に必要な3つのフェーズ(強化・安定化・デプロイ)を、コスト上限、レート制限、フォールバック、ロールバック条件の具体的な閾値とともに解説します。

10 min read 分
読む
すべての記事を表示
プロジェクトを始めよう

さあ、何かを作ろう。 特別なものへ?

ビジョンを、かたちに。変化を生むソフトウェアづくりは、私たちのチームにお任せください。

30分のスコーピング通話を予約する実績を見る

注目のツール

Claude Skills

すべて表示
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI自動化

すべて表示
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

注目のツール

Claude Skills

すべて表示
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI自動化

すべて表示
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

サービス

  • エンタープライズソリューション
  • モバイルアプリ
  • Webアプリケーション

ソリューション

  • CRMシステム
  • AI統合
  • ERPソリューション
  • 音声エージェント
  • プロセス自動化
  • サイバーセキュリティ

ライブラリ

  • ブログ
  • ポートフォリオ

コミュニティ

  • AI自動化
  • Claude Skills

ツール

  • モバイルアプリ開発費用計算ツール
  • OpenAI / LLM API 利用料金計算ツール
  • MVP(Minimum Viable Product)開発費用計算ツール
  • 音声AIエージェント構築費用計算ツール

会社情報

  • 概要
  • パートナー
  • お問い合わせ

法的情報

  • プライバシーポリシー
  • 利用規約
  • クッキーポリシー

サービス

  • エンタープライズソリューション
  • モバイルアプリ
  • Webアプリケーション

ソリューション

  • CRMシステム
  • AI統合
  • ERPソリューション
  • 音声エージェント
  • プロセス自動化
  • サイバーセキュリティ

ライブラリ

  • ブログ
  • ポートフォリオ

コミュニティ

  • AI自動化
  • Claude Skills

ツール

  • モバイルアプリ開発費用計算ツール
  • OpenAI / LLM API 利用料金計算ツール
  • MVP(Minimum Viable Product)開発費用計算ツール
  • 音声AIエージェント構築費用計算ツール

会社情報

  • 概要
  • パートナー
  • お問い合わせ
法的情報プライバシーポリシー利用規約クッキーポリシー
TECHSY
© 2026 Techsy. 無断複写・転載を禁じます