
Gemma 4 12B:基準測試、VRAM 需求與如何在本地運行
Google DeepMind 在 2026 年 6 月 3 日發布了 Gemma 4 12B。三天後,大家反覆傳頌的數字是 MMLU Pro 分數:77.2%。這擊敗了去年的 Gemma 3 27B,後者在同一測試中只拿到 67.6%。一個 120 億參數的模型,分數竟然超過 27B 的旗艦?而且記憶體用量還不到一半?沒錯。而且授權條款也變了。Gemma 4 採用 Apache 2.0 授權,所以商用沒問題,沒有任何附帶條件。它具備 256K token 的上下文窗口,量化後大約只需 6.6 GB 的 VRAM 就能運行。最後這一點對我們多數人來說才是重點:這東西能塞進一張中階 GPU。
重點整理
- Gemma 4 12B(2026 年 6 月 3 日發布)在 MMLU Pro 拿下 77.2%,擊敗去年的 Gemma 3 27B(67.6%)。
- 在 Q4_K_M 量化下約需 6.6 GB VRAM,可放進 8GB GPU;約 16GB 則有充裕的空間。
- Apache 2.0 授權(可商用)、256K 上下文、原生音訊 + 影像輸入、無編碼器架構。
- 一行指令即可運行:
ollama run gemma4:12b(7.6 GB 下載)。
Gemma 4 12B 是什麼?
Gemma 4 12B 是 Google DeepMind 推出的 120 億參數開放權重模型,於 2026 年 6 月 3 日發布,採用 Apache 2.0 授權。它是一個無編碼器的統整多模態模型:文字、影像與原生音訊輸入,輸出文字。它具備 256K token 的上下文窗口,支援 140 種語言。
你實際會運行的指令微調版本名為 gemma-4-12B-it(「it」是 instruction-tuned 的縮寫,也就是可直接對話的版本)。它總共有 119.5 億參數,所以「12B」其實是四捨五入往上取了一點。訓練資料截至 2025 年 1 月。
讓它有趣的是這部分:Gemma 4 12B 是第一個具備原生音訊輸入的中型 Gemma。沒有另外接上一個獨立的音訊編碼器。原始波形直接投影進模型。影像也是如此。這個設計選擇正是它能小到在單張消費級顯卡上運行的原因,我們待會會說明為什麼。
想先了解大局嗎?我們的在自己的機器上運行開放模型指南涵蓋了設定基礎,適合本地 LLM 新手。Google 的官方發布文章則有完整的公告。
Gemma 4 12B 規格一覽
所有經過驗證的資訊,都在這一張表裡。不靠猜測。
| 規格 | 數值 |
|---|---|
| 全名 | Gemma 4 12B(gemma-4-12B-it) |
| 參數 | 119.5 億(約 12B) |
| 授權 | Apache 2.0(可商用) |
| 上下文窗口 | 256K token |
| 模態 | 文字 + 影像 + 原生音訊輸入,輸出文字 |
| 架構 | 無編碼器統整架構、48 層、混合注意力 |
| 語言 | 140 種 |
| 訓練截止 | 2025 年 1 月 |
| Ollama 標籤 | gemma4:12b(7.6 GB 下載) |
| Apple Silicon 標籤 | gemma4:12b-mlx |
| 建議取樣 | temperature 1.0、top_p 0.95、top_k 64 |
關於取樣的一點提醒:除非你有特別理由,否則請使用建議的 temperature=1.0, top_p=0.95, top_k=64。Gemma 模型在低溫時表現會很怪,所以別像對其他模型那樣,反射性地把它降到 0.2。
無編碼器架構是怎麼運作的?
無編碼器代表沒有獨立的模型在影像或音訊進入語言模型之前先做轉換。視覺區塊與原始音訊波形透過輕薄的線性層,直接投影進共享的嵌入空間。多數多模態模型會在 LLM 上接一個厚重的視覺編碼器。Gemma 4 12B 跳過這一步,所以它能放進 16GB。
可以把它想成翻譯員與雙語人士的差別。舊做法是請一個獨立的翻譯員(編碼器)把影像轉換成模型聽得懂的語言,再交給模型。Gemma 4 12B 則是天生的雙語人士。音訊與影像資料直接說模型的原生語言,透過輕量的投影層,而非笨重的編碼器。
骨子裡,它是 48 層、採混合注意力。多數層使用 1024 token 的滑動窗口(便宜、本地),其間穿插少數能看到整個上下文的全域注意力層。這種組合讓它能處理 256K 上下文,又不會把你的 GPU 燒掉。

實際的好處:花在編碼器上的參數變少,代表你的 VRAM 預算有更多能用於真正的推理。正是這個取捨,讓一個 12B 模型能爆發出遠超其身量的表現。
Gemma 4 12B 基準測試:真實數據
這個標題經得起檢驗:Gemma 4 12B 在 MMLU Pro 拿下 77.2%,在同一測試中擊敗 Gemma 3 27B 的 67.6%,而 VRAM 用量不到一半。這些是 Google 官方指令微調(-it)版本的數據,不是社群估計值。以下是完整數據。
| 基準測試 | Gemma 4 12B | Gemma 3 27B(參考) |
|---|---|---|
| MMLU Pro | 77.2% | 67.6% |
| GPQA Diamond | 78.8% | , |
| MMMU Pro | 69.1% | , |
| AIME 2026(無工具) | 77.5% | , |
| LiveCodeBench v6 | 72.0% | , |
| Codeforces ELO | 1659 | , |
一個 12B 模型如今在 MMLU Pro 上擊敗了去年的 27B 旗艦:77.2% 對 67.6%。這種世代級的躍進,會讓你忍不住重新檢視自己的硬體估算。

兩個誠實的提醒。第一,那些破折號代表 Google 沒有公布那些項目的 Gemma 3 27B 數據,所以那些格子保持空白,而不是填上猜測值。第二,這裡所有分數都是指令微調模型的數據。基礎模型的數據不同。你可以在 HuggingFace 模型卡和 DeepMind 模型頁面交叉核對所有這些數據。
Gemma 4 12B 需要多少 VRAM?
Gemma 4 12B 在 Q4_K_M 量化下大約需要 6.6 GB 的 VRAM,也就是說它能放進 8GB GPU。若要有充裕的空間,尤其是想用到 256K 上下文的一大塊,建議以 16GB 的 VRAM 或統一記憶體為目標。它能在筆電上運行。M 系列 Mac 透過統一記憶體也能應付得很好。
量化說穿了就是模型權重的壓縮。數字精度較低、檔案較小、準確度略降。以下是常見等級的對應情況。
| 量化 | 約略 VRAM | 品質 | 適合 |
|---|---|---|---|
| Q4_K_M | 約 6.6 GB | 接近完整,損失極小 | 合理的預設;放得進 8GB 卡 |
| Q5_K_M | 約 8.5 GB | 略優於 Q4 | VRAM 稍有多餘、想要更高準確度 |
| Q8 | 約 13 GB | 實質上完整品質 | 16GB 以上卡,最高保真度 |
| QAT Q4_0 | 約 6.6 GB | 在 Q4 體量下接近 FP | 每 GB 品質最佳(6 月 5 日發布) |

如果你正圍繞這個模型挑選硬體,我們的本地 LLM 工具實測總整理涵蓋了哪些後端能從特定顯卡榨出最多效能。簡短版本是:12GB 卡運行 Q4 還有餘裕,8GB 卡運行 Q4 則要把上下文控制在適度範圍。
Gemma 4 12B 速度:各真實硬體的 Tokens/sec
它有多快?這取決於你的顯卡、量化方式與後端,所以我們沒有給單一數字,而是把已公布的第三方數據彙整到一處。這些由社群測試者與廠商回報,並標註各來源。它們不是我們自己實驗室的數據。
| 硬體 | 量化 | 回報 tokens/sec | 來源 |
|---|---|---|---|
| RTX 3060 (6GB) | Q4_K_M | 約 6.6 GB VRAM 占用,可本地運行(tok/s 未精確回報) | runaiathome |
| RTX 4090 (24GB) | Q4_K_M | 即時對話等級(具體 tok/s 尚未回報) | apxml / 社群 |
| Apple M 系列(統一記憶體) | mlx / Q4 | 透過 gemma4:12b-mlx 運行(tok/s 尚未廣泛回報) | Ollama / 社群 |
我跟你坦白講,目前公開數據實際上是怎麼說的。runaiathome 確認了模型在 6GB RTX 3060 上、以其約 6.6 GB 的 Q4_K_M 占用運行,這是目前最具體、已公布的硬體報告。apxml 的規格表與 Ollama 資料庫頁面確認了模型能在 24GB RTX 4090 上以 Q4 本地提供服務,穩穩落在即時對話的範圍,但那張卡目前還沒有公布精確的持續 tok/s 數據。Apple Silicon 的 gemma4:12b-mlx 版本確實存在且能運行,但發布三天後,可靠的 tok/s 數據仍未出現。
這對你意味著什麼,依等級來看:在 RTX 3060 這類 6GB 卡上,預期它能載入並運行本地對話,只是要把上下文窗口控制在適度範圍。在 24GB RTX 4090 上以 Q4_K_M 運行,已公布的報告顯示它穩穩落在即時對話的範圍。在 Apple Silicon 上,MLX 版本能運行,但基準測試數據仍在陸續出現。
這些是已公布的第三方數據,不是我們自己實驗室的數據,所以請當作概略參考。你的 tok/s 取決於提示長度、上下文大小與後端版本。來源:Ollama 資料庫頁面、apxml 與 runaiathome。隨著未來兩週有更多社群基準測試出爐,我們會更新這張表。
如何在本地運行 Gemma 4 12B?
最短路徑:安裝 Ollama,執行一行指令,搞定。ollama run gemma4:12b 會拉下 7.6 GB 的模型,並把你帶進對話提示。不需要設定檔,也不需要 Python 環境。如果你想要更多控制,或你用的是 Apple Silicon,下面還有四條路。
1. Ollama(簡單的預設)。 兩行即可拉取並運行:
ollama pull gemma4:12b
ollama run gemma4:12b2. llama.cpp 搭配 GGUF。 如果你想要特定的量化,把 llama.cpp 指向 HuggingFace 上的一個 GGUF。GGUF 是 llama.cpp 用於量化權重的檔案格式:
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."3. Apple Silicon 上的 MLX。 M 系列 Mac 有專屬的 MLX 版本,使用 Apple 的框架而非 CUDA:
ollama run gemma4:12b-mlx4. LM Studio(圖形介面,不用終端機)。 偏好桌面應用程式嗎?打開 LM Studio,點搜尋分頁,輸入 gemma 4 12b。選一個 Q4_K_M 的 GGUF 並下載。LM Studio 會處理其餘的事,包括一個本地伺服器開關。
5. 透過 API 查詢。 Ollama 在 11434 埠上提供一個與 OpenAI 相容的端點,所以現有程式碼只要換一行 base-URL 就能用:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:12b",
"messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
}'一旦你在命令列上跑起來,大概就會想要一個真正的介面。你可以用 Open WebUI 把它包成 ChatGPT 風格的介面,大約五分鐘搞定。這些都是新東西嗎?從我們的完整本地 LLM 設定指南開始。關於官方取樣建議與運行路徑,請見 ai.google.dev 與 Ollama 文件。
Gemma 4 12B 該用哪種量化?
對多數人來說,Q4_K_M 是合理的預設:約 6.6 GB VRAM、接近完整的品質,而且放得進 8GB GPU。如果你有 16GB 以上,且想要最高保真度,就升級到 Q8。如果你想要目前每 GB 能買到的最佳品質,就看看新的 QAT Q4_0 檢查點。
這裡有個還沒有人納入的新鮮角度。2026 年 6 月 5 日,也就是發布後僅僅兩天,Google 發布了量化感知訓練(QAT)Q4_0 檢查點,同時還有一種新的行動格式。QAT 代表模型在訓練時就把量化納入考量,所以它能在 Q4 的體量下保持接近 FP(接近全精度)的品質。同樣約 6.6 GB,準確度損失卻明顯比標準的訓練後 Q4 少。如果你 VRAM 受限、卻對品質敏感,那就是你的選擇。
快速決策指南:
- 8GB 卡,想簡單: Q4_K_M。
- 8GB 卡,想在該體量下要最佳品質: QAT Q4_0。
- 16GB 以上卡,想要最高保真度: Q8。
- 介於兩者之間,VRAM 稍有多餘: Q5_K_M。
你可以在 Google 的 QAT 公告讀到他們的理由。重點是:Q4_K_M 沒問題,QAT Q4_0 在同樣體量下更好,而只有當準確度比記憶體更重要時,你才需要 Q8。
Gemma 4 12B 對上 Gemma 3 12B 與 Qwen 3.5:升級值得嗎?
是的,如果你在意 Apache 2.0 授權、原生音訊輸入、256K 上下文窗口,或 MMLU Pro 的躍進,從 Gemma 3 12B 升級是值得的。對上 Qwen 3.5,差距就比較接近。Gemma 4 12B 在授權寬鬆度與原生音訊上勝出,但 Qwen 3.5 拿下了一些 12B 級的基準測試項目。請依你的實際需求來選,而不是看標題。
| 特性 | Gemma 4 12B | Gemma 3 12B | Qwen 3.5(12B 級) |
|---|---|---|---|
| 授權 | Apache 2.0 | 自訂 Gemma 授權 | Apache 2.0 |
| 上下文 | 256K | 128K | 最高 256K |
| 模態 | 文字 + 影像 + 音訊 | 文字 + 影像 | 文字 + 影像 |
| 原生音訊 | 有 | 無 | 無 |
| MMLU Pro | 77.2% | 較低 | 有競爭力,贏下部分項目 |
| Q4 VRAM | 約 6.6 GB | 約 6.6 GB | 約 6.6 GB |
光是授權條款這項改變,就足以讓許多團隊有理由離開 Gemma 3 12B。Gemma 3 採用 Google 的自訂授權,帶有使用限制;Gemma 4 則是直接的 Apache 2.0。如果你之前因為商用考量而對 Gemma 觀望,那個障礙已經消失了。
對上 Qwen 3.5,要對自己誠實。Qwen 3.5 確實很強,在某些推理與編碼項目上略勝 Gemma 4 12B。如果音訊輸入與寬鬆授權不在你的清單上,在投入之前,先用你自己的任務對兩者做基準測試。關於更廣泛的領域,請見 Gemma 4 12B 在最佳開放模型中的位置。而且因為它是 Apache 2.0,你可以在 Apache 2.0 下用 Unsloth 對它進行微調,不會有授權上的麻煩。
什麼時候不該用 Gemma 4 12B
如果你需要只有大得多的模型才能提供的最前沿推理,如果 Qwen 3.5 贏下了你工作負載所依賴的特定基準測試項目,或者如果你的專案高度依賴在發布三天後仍在成熟的音訊工具,那就跳過 Gemma 4 12B。它是一個出色的 12B 模型,但不是魔法。
Gemma 4 12B 不見得總是正確的選擇。如果你需要最前沿的推理,更大的模型仍然會贏。原生音訊支援是真材實料、令人印象深刻,但周邊的工具、函式庫、輔助工具、框架整合,都只有幾天歷史,某些地方還很粗糙。如果你這週就要推出一個重度依賴音訊的產品,在押注之前請徹底測試。
還有幾個誠實的取消資格理由。如果你要把它接進代理,先確認它在你的任務上的工具呼叫可靠性,因為代理行為會因模型而異。如果你的優勢在於長上下文,請確保你充分利用 256K 上下文窗口,而不是假設原始的窗口大小就等於更好的輸出。如果你要從本地運行走向生產環境的推論服務,超越本地的生產推論服務路徑涵蓋了 vLLM 與 SGLang。如果你要在生產環境部署像 Gemma 4 12B 這樣的開放模型,我們能提供協助。
關於作者
Mert Batur Gurbuz 是 Techsy.io 的共同創辦人,團隊為 B2B 客戶打造 AI 代理、自動化系統與語音/SDR 流程。他就讀於伯明罕大學,並撰寫關於 Techsy 團隊在生產環境實際使用的 LLM 工具堆的文章。歡迎在 LinkedIn 上聯繫。
挑選工具是簡單的一半。讓它在真實產品裡穩定運行,才是多數團隊卡關的地方,而那正是我們的 AI 整合團隊為客戶打造的東西,從 RAG 流程到客製代理。
常見問題
如何在本地運行 Gemma 4 12B?
安裝 Ollama,然後執行 ollama run gemma4:12b。它會拉下 7.6 GB 的模型並開啟對話提示。不需要 Python 環境或設定檔。如果你想要圖形應用程式,LM Studio 也行:在它的模型瀏覽器搜尋 gemma 4 12b,下載一個 Q4_K_M 版本即可。
Gemma 4 12B 的 VRAM 與硬體需求為何?
Gemma 4 12B 在 Q4_K_M 量化下大約需要 6.6 GB 的 VRAM,所以放得進 8GB GPU。若要有充裕的空間,尤其在使用長上下文時,建議以 16GB 的 VRAM 或統一記憶體為目標。它能在筆電上運行,包括透過統一記憶體在 M 系列 Mac 上運行。
Gemma 4 12B 能在 16GB 筆電上運行嗎?
可以,輕而易舉。在 Q4_K_M 下,模型大約使用 6.6 GB,在 16GB 機器上留有充足空間。在 Apple Silicon 筆電上,統一記憶體透過 gemma4:12b-mlx 版本能妥善應付。你甚至可以在 16GB 上升級到 Q8 量化,取得更高保真度。
Gemma 4 12B 真的比 Llama 或 Qwen 3.5 好嗎?
這取決於你衡量什麼。Gemma 4 12B 在 Apache 2.0 授權、原生音訊輸入與 256K 上下文窗口上勝出,並在 MMLU Pro 繳出亮眼的 77.2%。但 Qwen 3.5 拿下了一些 12B 級的推理與編碼項目。在決定之前,先用你自己的任務對兩者做基準測試。
Gemma 4 12B 比 Gemma 3 12B 好嗎?
是的。Gemma 4 12B 改用寬鬆的 Apache 2.0 授權、加入原生音訊輸入、把上下文窗口加倍到 256K token,並在 MMLU Pro 上有顯著提升。光是授權條款這項改變,就足以讓被 Gemma 3 自訂條款擋住的商用專案有理由升級。
Gemma 4 12B 該用哪種量化?
Q4_K_M 是合理的預設,約 6.6 GB、品質接近完整。如果你想在同樣體量下取得最佳品質,請使用 2026 年 6 月 5 日發布的新 QAT Q4_0 檢查點,它能在 Q4 體量下保持接近全精度的品質。只有在你有 16GB 以上、且需要最高保真度時,才使用 Q8。
Gemma 4 12B 可免費商用嗎?
可以。Gemma 4 12B 採用 Apache 2.0 授權,允許商用,沒有 Gemma 3 自訂 Gemma 授權的使用限制。你可以打造商用產品、對它微調,並重新散布。那項授權改變,正是許多團隊從 Gemma 3 升級的最大原因之一。
Gemma 4 12B 真的支援音訊輸入嗎?
是的。Gemma 4 12B 是第一個具備原生音訊輸入的中型 Gemma。拜其無編碼器設計之賜,原始音訊波形直接投影進模型,沒有獨立的音訊編碼器。話雖如此,周邊工具只有幾天歷史,所以在生產環境推出重度依賴音訊的功能之前,請仔細測試。
Gemma 4 12B 在 RTX 4090 上有多快?
已公布的第三方報告顯示,Gemma 4 12B 在 Q4_K_M 下,於 24GB RTX 4090 上穩穩落在即時對話的範圍,儘管在發布三天後,精確的持續 tokens/sec 數據尚未公布。速度會隨提示長度、上下文大小與後端版本而異,所以請把早期數據當作概略參考。
在哪裡下載 Gemma 4 12B?
指令微調模型在 HuggingFace 上,名為 google/gemma-4-12B-it,或者你可以透過 Ollama 用 ollama run gemma4:12b 拉取(7.6 GB 下載)。LM Studio 使用者可以在應用程式的模型瀏覽器搜尋 gemma 4 12b。若要特定量化,GGUF 檔案可在 Unsloth 等社群儲存庫取得。