
2026 年最佳開源 LLM:我們實測 8 款——僅 3 款擊敗 GPT-4 級模型
最後更新:2026 年 7 月 5 日。 本指南中的每個基準測試分數、VRAM 數據和授權條款都經過本次更新的重新驗證。以下排名反映 2026 年年中之前發布的開放權重模型——如果有新發布改變了順序,本頁面將在當月內更新。
2026 年最佳開源 LLM 是 Qwen 3 235B-A22B,在整體推理和程式設計方面表現最佳,DeepSeek R1 在深度數學推理領先,Llama 4 Scout 則在長上下文(1000 萬 token)領先。對於單張消費級顯示卡,Gemma 3 27B(16 GB VRAM)和 Phi-4 14B(8 GB)是最容易自行託管的。這三款頂級模型在程式和數學上都匹敵 GPT-4 級效能,同時保持免費部署。
領先的開源 LLM:基準測試快照
下表涵蓋五款廣泛部署的開源模型,以標準公開基準測試評分。MMLU 衡量廣泛的通用知識;HumanEval 衡量程式碼生成的通過率。
| 模型 | 參數 | 發布 | MMLU | HumanEval | 授權 | 最適合 |
|---|---|---|---|---|---|---|
| Llama 3.3 70B | 70B | 2024 年 12 月 | 86.0 | 88.4 | Llama 3.3 Community | 通用、多語言 |
| Qwen 2.5 72B | 72B | 2024 年 9 月 | 85.0+ | 86.6 | Qwen License | 數學、程式設計、指令遵循 |
| DeepSeek-V3 | 671B(37B 活躍) | 2024 年 12 月 | 87.1 | 82.6 | MIT | 通用、程式設計、低成本 |
| Mistral Small 3.1 | 24B | 2025 年 3 月 | 80.6 | 88.4 | Apache 2.0 | 代理工作流、視覺、多語言 |
| Gemma 3 27B | 27B | 2025 年 3 月 | ~78.6 | 87.8 | Gemma Terms of Use | 單卡部署、多模態 |
我們每月更新此表。
開源 LLM 不再只是與專有模型「競爭」——在程式設計、數學和長上下文任務上,它們正在獲勝。每月 200 美元的 API 帳單與自行託管的開源模型之間的差距從未如此之小。
這個排名穿透了炒作。這裡的每個模型都根據重要的基準測試、你實際需要的硬體,以及每個模型最閃耀的特定應用場景來評估。
快速總結:你該選哪款開源 LLM?
需要絕對最佳的推理? 選 Qwen 3 235B 或 DeepSeek R1。想在單卡上運行? Gemma 3 27B 或 Phi-4 14B。處理海量文件? Llama 4 Scout 的 1000 萬 token 上下文無與倫比。
| 排名 | 模型 | 參數(活躍) | 最適合 | 授權 | 最低 VRAM |
|---|---|---|---|---|---|
| 第 1 名 | Qwen 3 235B-A22B | 235B (22B) | 推理 + 程式設計 | Apache 2.0 | ~132 GB (Q4) |
| 第 2 名 | DeepSeek R1 | 671B (37B) | 深度推理 + 數學 | MIT | ~136 GB (Q4) |
| 第 3 名 | Llama 4 Scout | 109B (17B) | 長上下文(1000 萬 token) | Llama License | ~55 GB (Q4) |
| 第 4 名 | DeepSeek V3 | 671B (37B) | 通用 + 程式設計 | MIT | ~136 GB (Q4) |
| 第 5 名 | Mistral Large 3 | 675B (41B) | 多語言 + 企業 | Apache 2.0 | ~140 GB (Q4) |
| 第 6 名 | Gemma 3 27B | 27B(27B,稠密) | 單卡部署 | 開放權重 | ~16 GB (Q4) |
| 第 7 名 | Phi-4 Reasoning | 14B(14B,稠密) | 邊緣 + 行動裝置 | MIT | ~8 GB (Q4) |
| 第 8 名 | GLM-4.7 | 355B (32B) | 代理程式設計工作流 | MIT | ~130 GB (Q4) |
VRAM 數據假設 Q4 量化。全精度需求高出 2-4 倍。如果你是在本機運行模型的新手,從 Gemma 3 或 Phi-4 開始——它們是這份清單上對硬體最友善的選項。
開源 LLM 排行榜:2026 年 7 月排名
截至 2026 年 7 月,Qwen 3 235B-A22B 在我們的開源 LLM 排行榜上以全方位推理和程式設計居首,DeepSeek R1 以深度數學居第二,Llama 4 Scout 以長上下文居第三。以下完整排名涵蓋本指南中評測的全部八款模型,從資料中心設備到適合筆記型電腦的選擇。
| 排名 | 模型 | 授權 | 最適合 | 最低 VRAM |
|---|---|---|---|---|
| 第 1 名 | Qwen 3 235B-A22B | Apache 2.0 | 推理 + 程式設計 | ~132 GB (Q4) |
| 第 2 名 | DeepSeek R1 | MIT | 深度推理 + 數學 | ~136 GB (Q4) |
| 第 3 名 | Llama 4 Scout | Llama License | 長上下文(1000 萬 token) | ~55 GB (Q4) |
| 第 4 名 | DeepSeek V3 | MIT | 通用 + 程式設計 | ~136 GB (Q4) |
| 第 5 名 | Mistral Large 3 | Apache 2.0 | 多語言 + 企業 | ~140 GB (Q4) |
| 第 6 名 | Gemma 3 27B | 開放權重 | 單卡部署 | ~16 GB (Q4) |
| 第 7 名 | Phi-4 Reasoning | MIT | 邊緣 + 行動裝置 | ~8 GB (Q4) |
| 第 8 名 | GLM-4.7 | MIT | 代理程式設計工作流 | ~130 GB (Q4) |
這些排名反映我們每月對基準測試、硬體需求和授權條款的重新檢查。
現在,讓我們逐一解析每款模型為何值得你關注。
1. Qwen 3 235B-A22B——最佳整體開源 LLM
阿里巴巴的 Qwen 3 235B-A22B 是目前最值得擊敗的模型。它採用混合專家(MoE)架構,總參數 2350 億,但每個 token 僅啟動 220 億,與同等品質的稠密模型相比,運算量削減約 90%。
Qwen 3 的脫穎而出在於其雙模式思考。你可以在「思考模式」(用於複雜的數學和程式問題,模型會展示其思維鏈)和快速的「非思考模式」(用於快速聊天回應)之間切換。這種靈活性在生產環境中很重要。
基準測試亮點:
| 基準測試 | Qwen 3 235B 分數 | 說明 |
|---|---|---|
| AIME 2024 | 85.7% | 競賽級數學 |
| AIME 2025 | 81.5% | 更難的數學題 |
| LiveCodeBench v5 | 70.7% | 真實程式任務 |
| CodeForces | 2,056 | 競爭性程式設計 |
| BFCL v3 | 70.8% | 函式呼叫 |
這些數字使它與 DeepSeek R1、OpenAI 的 o1 和 Gemini 2.5 Pro 處於同一級別,只不過你可以在 Apache 2.0 下下載、微調並部署到任何地方。
硬體需求: 完整模型在 Q4 量化下需要約 132 GB VRAM。那是多卡設置——想想五張 RTX 3090、三張 A40,或雙 H100 設備。不便宜,但對新創公司或研究實驗室來說完全在可及範圍內。Qwen 3 系列還包含較小的變體(32B、14B、8B、4B),可在消費級硬體上運行。
誰該使用: 需要前沿級推理和程式設計、但想擁有自己基礎設施的團隊。它特別適合具有 256K 上下文並支援 100 多種語言的多語言工作負載。如果你打算為特定領域微調模型,Qwen 3 的 Apache 2.0 授權給你完全的自由。
2. DeepSeek R1——深度推理最佳
DeepSeek R1 在 2025 年初發布時改變了遊戲規則,證明了開源模型可以在推理任務上匹敵 OpenAI 的 o1。R1-0528 更新更進一步,AIME 2025 準確率從 70% 躍升至 87.5%。
該模型的秘訣是其訓練方法。DeepSeek 首先使用純強化學習創建了 R1-Zero,沒有監督式微調的熱身。模型自發地發展出思維鏈推理、自我驗證和回溯行為。它真的教會了自己檢查自己的工作。
基準測試亮點:
| 基準測試 | DeepSeek R1 分數 | 說明 |
|---|---|---|
| AIME 2025 | 87.5% (R1-0528) | 數學奧林匹亞 |
| GPQA Diamond | 71.5% | 研究所級科學 |
| SWE-bench | 49.2% | 真實軟體工程 |
| HumanEval | 92.4% | 程式碼生成 |
硬體需求: 與 DeepSeek V3 相同的 671B MoE 架構,所以 Q4 下約需 136 GB VRAM。但這裡有個實際的角度:DeepSeek 還發布了 1.5B、7B、14B、32B 和 70B 參數的蒸餾變體。32B 蒸餾版可在單張 RTX 4090 上運行,在推理任務上仍優於許多更大的模型。
誰該使用: 任何建構需要逐步推理、定理證明、複雜程式碼除錯、科學分析的應用程式的人。如果你需要在預算內獲得推理能力,蒸餾變體特別有用。如果你想在自有硬體上部署較小的蒸餾版,請查看在本機運行 LLM 的最佳工具。
3. Llama 4 Scout——長上下文最佳
Meta 的 Llama 4 Scout 為開源世界帶來了真正全新的東西:1000 萬 token 的上下文視窗。這不是打錯字。你可以在單個提示中餵給它整個程式碼庫、一書架的研究論文,或 20 小時的影片轉錄。
Scout 使用 16 個 MoE 專家,每個 token 僅啟動 2 個,總參數 109B 但僅 17B 活躍。Meta 聲稱它在 INT4 量化下可裝在單張 H100 上,不過 1000 萬的上下文視窗顯然需要更多記憶體用於 KV 快取。
基準測試亮點:
| 基準測試 | Llama 4 Scout 分數 | 說明 |
|---|---|---|
| Needle-in-a-Haystack (10M) | 100% | 完美檢索 |
| MMLU | 79.6% | 通用知識 |
| HumanEval | 81.2% | 程式碼生成 |
| DocVQA | 85.1% | 文件理解 |
那個在 1000 萬 token 下的完美 Needle-in-a-Haystack 分數令人矚目。大多數模型在遠早於 128K 時就開始丟失資訊。Scout 使用一種新穎的文件間注意力遮罩方法,即使在其巨大的上下文視窗內也能維持文件之間的邊界。
硬體需求: Q4 下,模型權重需要約 55 GB VRAM。單張 H100(80 GB)可輕鬆處理。對於消費級硬體,兩張 RTX 4090(共 48 GB)可以管理較短的上下文長度。問題是:實際使用完整的 1000 萬上下文視窗需要在模型權重之上巨大的 KV 快取記憶體。實際上,大多數自行託管的部署上限為 128K-256K token。
誰該使用: 處理海量文件的團隊——法律分析、程式碼庫問答、研究論文綜合。多模態能力(文字 + 圖片輸入)也很強。只需對上下文長度保持現實:1000 萬的上限是真實的,但你需要伺服器級硬體才能達到。
4. DeepSeek V3——最佳通用開源 LLM
雖然 DeepSeek R1 因推理而登上頭條,但 DeepSeek V3 可以說是日常使用更實用的模型。它是主力——快速、各方面都能幹,而且以其規模而言效率極高。
V3 與 R1 共享相同的 671B MoE / 37B 活躍架構,但用深度推理鏈換取更快的回應時間和更廣泛的通用能力。V3-0324 更新納入了 R1 訓練中的強化學習技術,在不增加顯式思維鏈延遲的情況下提升推理。
基準測試亮點:
| 基準測試 | DeepSeek V3 分數 | 說明 |
|---|---|---|
| MMLU | 87.1% | 通用知識 |
| HumanEval | 82.6% | 程式碼生成 |
| MATH | 90.2% | 數學推理 |
| 上下文視窗 | 128K | 長文件支援 |
DeepSeek V3 在程式設計和數學基準測試上超越了 GPT-4.5。它的訓練效率堪稱傳奇——完整的預訓練運行僅需 278.8 萬 H800 GPU 小時,只是同等模型所需的一小部分。
硬體需求: 與 R1 相同(Q4 下約 136 GB VRAM)。對於實際部署,GGUF 量化版本可透過 llama.cpp 或 Ollama 在多卡消費級設置上運行。
誰該使用: 如果你需要一個處理所有事情的模型——聊天、程式設計、分析、翻譯、摘要——V3 是最平衡的選擇。它在困難推理上不會擊敗 R1,在上下文長度上不會擊敗 Scout,但在速度和多功能性比巔峰基準分數更重要的典型生產工作負載上,它會優於兩者。
5. Mistral Large 3——多語言和企業使用最佳
Mistral Large 3 讓 Mistral 重返前沿。總參數 675B(41B 活躍),它是一個以 Apache 2.0 發布的完整 MoE 模型——相較於 Mistral Large 2 的限制性研究授權,這是巨大的轉變。
該模型從零開始在 3,000 張 NVIDIA H200 GPU 上訓練,效果顯現。在 LMSYS Chatbot Arena 上,它在開源模型中排名第 2,整體排名第 6(包括專有模型)。對歐洲團隊來說特別有趣的是它的多語言優勢——在平衡的多語言 MMLU 測試上準確率約 85.5%。
基準測試亮點:
| 基準測試 | Mistral Large 3 分數 | 說明 |
|---|---|---|
| 多語言 MMLU | 85.5% | 跨語言知識 |
| LMSYS Arena | 整體第 6 | 人類偏好排名 |
| AIME 2025(14B 變體) | 85% | 數學推理 |
| 上下文視窗 | 128K | 長文件支援 |
讓 Mistral 模型與眾不同的一個特質:它們被訓練為說「我不知道」而不是幻覺。這使 Mistral Large 3 非常適合 RAG 管線和事實準確性比創意輸出更重要的企業應用。
硬體需求: 總參數 675B,VRAM 需求與 DeepSeek 相似(Q4 下約 140 GB)。Mistral 還提供 14B 的 Small 3 變體,可裝在單張消費級顯示卡上,在推理和程式設計上表現遠超其級別。
誰該使用: 需要多語言能力和資料主權的歐洲公司。建構 RAG 系統且減少幻覺至關重要的企業團隊。Apache 2.0 授權完全消除了商業摩擦。
6. Gemma 3 27B——單卡部署最佳
Google 的 Gemma 3 27B 是能力與易用性之間的甜蜜點。270 億參數的稠密架構,在 Q4 量化下可在單張 RTX 4090 上運行。不需要多卡設備,不需要伺服器級硬體,只需一張普通的遊戲卡。
不要被適中的參數數量所迷惑。Gemma 3 27B 表現遠超其級別,尤其是在多模態任務上。它處理文字和圖片輸入,支援 140 多種語言,其 130K 上下文視窗對於這個規模的模型來說很慷慨。
基準測試亮點:
| 基準測試 | Gemma 3 27B 分數 | 說明 |
|---|---|---|
| MMLU | 78.6% | 通用知識 |
| DocVQA | 85.6% | 文件理解 |
| MGSM | 74.3% | 多語言數學 |
| ChartQA | 76.3% | 視覺推理 |
那些多模態分數(DocVQA 85.6%、ChartQA 76.3%)可與大 3-5 倍的模型競爭。對於需要圖片理解而沒有 GPU 叢集的開發者,Gemma 3 是顯而易見的選擇。
硬體需求: Q4 量化下約 16 GB VRAM,Q8 下 32 GB。單張 RTX 4090(24 GB)可輕鬆處理。即使是 32 GB 統一記憶體的 M2 MacBook Pro 也能運行。如果你正在遵循我們的在本機運行 LLM 指南,Gemma 3 是最容易入門的模型之一。
誰該使用: 獨立開發者、小團隊,以及任何想要一個能幹的多模態模型而不想租用雲端 GPU 的人。它也非常適合原型開發——在本機用 Gemma 3 測試你的管線,然後在需要時在生產環境擴展到更大的模型。關於 Google 較新的小型模型,請參閱我們的 Gemma 4 12B 指南。
7. Phi-4 Reasoning——邊緣和資源受限部署最佳
Microsoft 的 Phi-4 Reasoning 證明了參數數量並不是一切。僅 140 億參數,它在多個推理基準測試上優於 DeepSeek R1 的 70B 蒸餾版。最近發布的 Phi-4-reasoning-vision-15B 增加了多模態能力,在數學視覺推理任務上比 Gemma 3 12B 高 17%。
Phi-4 系列的秘密是訓練資料品質。Microsoft 的方法優先考慮精選的高品質資料而非原始規模,而且有效——Phi-4 在 MATH 和 MGSM 基準測試上得分超過 80%,在數學推理上優於 Google 的 Gemini Pro 和 GPT-4o-mini。
基準測試亮點:
| 基準測試 | Phi-4 分數 | 說明 |
|---|---|---|
| MATH | 82.6% | 數學推理 |
| HumanEval | 82.6% | 程式碼生成 |
| MGSM | 80%+ | 多語言數學 |
| MathVista(視覺) | 比 Gemma 12B 高 17% | 視覺數學 |
硬體需求: Q4 下約 8 GB VRAM——那是筆記型電腦 GPU 甚至較舊的桌機卡。該模型可在 Apple Silicon MacBook 上輕鬆運行,真正便攜。對於邊緣部署,它是少數可以在裝置上以合理延遲運行的模型之一。
誰該使用: 行動和邊緣開發者、建構裝置上 AI 功能的團隊,以及任何需要在最少硬體上獲得強大推理的人。Phi-4 也是評估微調模型的好選擇,因為其小尺寸使訓練迭代快速且便宜。MIT 授權意味著沒有商業限制。
8. GLM-4.7——代理程式設計最佳
Z.ai 的 GLM-4.7 是為特定應用場景量身打造的:代理程式設計工作流,模型需要推理、使用工具,並在長的多步驟互動中維持上下文。
其架構是 355B MoE,32B 活躍參數,但突出的功能是其三層思考系統。與大多數每輪都重新開始推理過程的模型不同,GLM-4.7 在整個對話中保留思考區塊。當模型編排複雜的多步驟程式任務時,這種持久的推理上下文帶來真正的差異。
基準測試亮點:
| 基準測試 | GLM-4.7 分數 | 說明 |
|---|---|---|
| SWE-bench | 73.8% | 真實軟體工程 |
| HumanEval | 94.2% | 程式碼生成 |
| 上下文視窗 | 200K | 長互動 |
| 最大輸出 | 131K token | 擴展生成 |
那個 73.8% 的 SWE-bench 分數可與 Claude Sonnet 4.5 競爭——在真實世界的軟體工程任務上,不是合成基準測試。而 94.2% 的 HumanEval 是這份清單上所有模型中最高的。
硬體需求: 與其他大型 MoE 模型相似(Q4 下約 130 GB VRAM)。200K 上下文視窗和 131K 最大輸出使其在長代理會話期間很吃記憶體。
誰該使用: 建構程式代理、自動除錯工具或程式碼審查系統的 AI 輔助開發團隊。如果你正在為以程式設計為主的模型選擇微調工具,GLM-4.7 是一個強大的基礎。MIT 授權意味著完全的商業使用。
程式設計最佳開源 LLM(2026 年 7 月)
2026 年 7 月的程式設計,GLM-4.7 是頂級開源選擇,HumanEval 得分 94.2%,SWE-bench 得分 73.8%,在真實軟體任務上可與 Claude Sonnet 4.5 競爭。想要在消費級硬體上獲得強大的程式設計模型?DeepSeek R1 32B 蒸餾版可在單張 RTX 4090 上運行。
在考慮較新的 GLM 發布?請參閱我們的 GLM 5.2 解析了解它的比較。
如何選擇:決策框架
「最佳」模型完全取決於你的限制條件。使用這個矩陣來縮小你的決定。
| 如果你需要... | 選擇 | 原因 |
|---|---|---|
| 最佳整體推理 | Qwen 3 235B | 頂級數學、程式和通用基準測試 |
| 深度思維鏈 | DeepSeek R1 | 自我修正推理,87.5% AIME |
| 海量上下文視窗 | Llama 4 Scout | 1000 萬 token,完美檢索 |
| 快速通用 | DeepSeek V3 | 最佳速度品質比 |
| 多語言企業 | Mistral Large 3 | 85.5% 多語言 MMLU,抗幻覺 |
| 單張消費級顯示卡 | Gemma 3 27B | 16 GB VRAM,強多模態 |
| 筆記型電腦或邊緣裝置 | Phi-4 14B | 8 GB VRAM,MIT 授權 |
| 程式代理 | GLM-4.7 | 94.2% HumanEval,持久推理 |
還不確定?從這裡開始:你有多卡硬體嗎?如果沒有,你的選擇是 Gemma 3 和 Phi-4。如果有,你正在建構程式代理嗎?選 GLM-4.7 或 DeepSeek R1。需要長上下文?Llama 4 Scout。其他一切?Qwen 3 235B 是最安全的預設。
我們如何排名這些模型
排名不是基於單一基準測試。每個模型都經過五個維度的評估:
- 基準測試效能——MMLU、HumanEval、AIME、SWE-bench 和領域特定測試
- 硬體可及性——真實團隊能否實際部署?
- 授權自由度——Apache 2.0 和 MIT 得分高於限制性授權
- 生態系統成熟度——可在 Hugging Face、Ollama、vLLM 和主要推理引擎上取得
- 真實世界採用——活躍社群、生產部署、持續更新
基準測試得分高但需要沒有人擁有的 GPU 叢集的模型(說的就是你,671B 全精度)會被扣分。有限制性授權而阻擋商業使用的模型也會失分。目標是實用價值,而不是排行榜上的吹噓資本。
如果你想自己測試這些模型,我們的 LLM 評估指南會逐步介紹如何設定系統化基準測試,最佳評估工具彙整涵蓋你需要的框架。
常見問題
2026 年最新的開源 LLM 有哪些?
2026 年的前沿由 Qwen 3(阿里巴巴)、DeepSeek R1 和 V3、Llama 4 Scout(Meta)、Mistral Large 3 和 GLM-4.7(Z.ai)引領。像 DeepSeek R1-0528 和 Phi-4 reasoning-vision 變體這樣的小版本更新在 2026 年年中之前陸續到來。我們每月重新檢查這份清單,並在新發布改變排名時更新排行榜。
這個開源 LLM 排行榜多久更新一次?
每月。我們在每月初重新驗證基準測試分數、VRAM 需求和授權,並在新模型發布時加入。標題下的「最後更新」日期反映最近的審查。
2026 年最佳開源 LLM 是什麼?
Qwen 3 235B-A22B 目前在最廣泛的基準測試範圍上領先,在 Apache 2.0 授權下結合了頂級的推理、程式設計和多語言能力。對於特定應用場景,DeepSeek R1(推理)和 Llama 4 Scout(長上下文)可能是更好的選擇。
我可以在消費級硬體上運行開源 LLM 嗎?
可以。Gemma 3 27B 可在單張 RTX 4090(24 GB VRAM)上運行,Phi-4 14B 可裝在 8 GB 的筆記型電腦 GPU 上。較大模型的量化版本(Q4、Q8)也可以使用 Ollama 和 llama.cpp 等工具在多卡消費級設置上運行。
開源 LLM 和 ChatGPT 或 Claude 一樣好嗎?
在程式設計和數學基準測試上,最佳開源模型匹敵或擊敗 GPT-4.5,並接近 Claude Sonnet 4.5 的效能。差距在結構化任務(程式、數學、推理)上最小,在創意寫作和細微的指令遵循上最大。
MoE(混合專家)對硬體意味著什麼?
MoE 模型總參數量很大,但每個 token 僅啟動一小部分。然而,整個模型必須載入記憶體,路由器才能選擇專家。一個 235B MoE 模型即使只有 22B 活躍,仍需要 235B 的 VRAM——你沒有節省記憶體,你節省的是運算。
哪款開源 LLM 最適合程式設計?
GLM-4.7 以 94.2% HumanEval 和 73.8% SWE-bench 領先。對於純程式碼生成,DeepSeek R1 和 Qwen 3 235B 緊隨其後。對於消費級硬體上的程式設計,DeepSeek R1 32B 蒸餾版是能力與成本的最佳比率。
Llama 4 Scout 真的有 1000 萬 token 的上下文嗎?
架構支援,而且 Meta 展示了在 1000 萬 token 下完美的 Needle-in-a-Haystack 檢索。但實際使用完整上下文需要巨大的 KV 快取記憶體。大多數自行託管的部署實際上上限為 128K-256K token。像 Together AI 和 Fireworks 這樣的雲端供應商提供更長的上下文視窗。
我應該尋找什麼授權的開源 LLM?
Apache 2.0 和 MIT 是最寬容的——完全的商業使用、修改和再分發。Llama 的自訂授權允許商業使用,但對超過 7 億用戶的應用程式有限制。一些「開放權重」模型(如 Gemma)有特定條款——在生產部署前務必閱讀授權。
70B 模型需要多少 VRAM?
Q4 量化下,70B 稠密模型需要約 35-40 GB VRAM。單張 A100(80 GB)可輕鬆處理,或兩張 RTX 4090(共 48 GB)。全精度(BF16)下,你需要 140+ GB,實際上需要四張 A100 或同等設備。
我可以為我的應用場景微調開源 LLM 嗎?
絕對可以。QLoRA 使在單張 24 GB 顯示卡上微調 70B 模型成為可能。像 Phi-4 和 Gemma 3 這樣的較小模型更適合微調實驗。Apache 2.0 和 MIT 授權的模型對衍生作品沒有限制。
開源多模態 LLM 呢?
Gemma 3 27B 和 Llama 4 Scout 都原生處理文字和圖片輸入。Phi-4-reasoning-vision-15B 在較小規模上增加了視覺推理。對於影片理解,Llama 4 Scout 在其上下文視窗內支援最多 20 小時的影片輸入。
目前最佳開源 LLM 是什麼?
目前,Qwen 3 235B-A22B 是整體最佳開源 LLM,在 Apache 2.0 授權下於推理和程式設計領先。對於單張消費級顯示卡,Gemma 3 27B(16 GB VRAM)是首選,而 GLM-4.7 以 94.2% HumanEval 贏得程式代理。
有開源 LLM 排行榜嗎?
有。我們上面的 2026 年 7 月排行榜對本指南中的全部八款模型進行排名,Hugging Face 則主辦社群運行的 Open LLM Leaderboard,涵蓋更廣。我們每月根據 MMLU、HumanEval、AIME 和 SWE-bench 等基準測試重新驗證我們的排名。
選擇工具是容易的一半。讓它在真實產品中可靠運行才是大多數團隊停滯的地方,而這正是我們的 AI 整合團隊為客戶建構的——從 RAG 管線到自訂代理。想要對你的技術堆疊聽取第二意見?獲得免費諮詢。