
Gemma 4 12B: Benchmark, Yêu cầu VRAM & Cách chạy cục bộ
Google DeepMind đã phát hành Gemma 4 12B vào ngày 3 tháng 6 năm 2026. Ba ngày sau, con số mà ai cũng nhắc đến là điểm MMLU Pro: 77.2%. Con số này vượt qua Gemma 3 27B năm ngoái, vốn chỉ đạt 67.6% trong cùng bài kiểm tra. Một mô hình 12 tỷ tham số vượt điểm một flagship 27B? Với chưa đến một nửa bộ nhớ? Đúng vậy. Và giấy phép cũng đã thay đổi. Gemma 4 được phát hành theo Apache 2.0, nên việc sử dụng thương mại hoàn toàn ổn, không có ràng buộc gì. Nó có cửa sổ ngữ cảnh 256K token và chỉ cần khoảng 6.6 GB VRAM sau khi lượng tử hóa. Phần cuối đó mới là toàn bộ câu chuyện với hầu hết chúng ta: thứ này vừa vặn trên một GPU tầm trung.
Những điểm chính
- Gemma 4 12B (phát hành ngày 3 tháng 6 năm 2026) đạt 77.2% trên MMLU Pro, vượt qua Gemma 3 27B năm ngoái (67.6%).
- Nó chạy với ~6.6 GB VRAM ở Q4_K_M, vừa với GPU 8GB; ~16GB cho khoảng trống thoải mái.
- Giấy phép Apache 2.0 (dùng thương mại OK), ngữ cảnh 256K, đầu vào âm thanh + hình ảnh gốc, kiến trúc không encoder.
- Một lệnh duy nhất để chạy:
ollama run gemma4:12b(tải xuống 7.6 GB).
Gemma 4 12B là gì?
Gemma 4 12B là mô hình có trọng số mở 12 tỷ tham số của Google DeepMind, phát hành ngày 3 tháng 6 năm 2026 theo giấy phép Apache 2.0. Đây là mô hình đa phương thức thống nhất, không encoder: văn bản, hình ảnh và âm thanh gốc đưa vào, văn bản đưa ra. Nó có cửa sổ ngữ cảnh 256K token và hỗ trợ 140 ngôn ngữ.
Biến thể instruction-tuned mà bạn thực sự sẽ chạy có tên gemma-4-12B-it ("it" là viết tắt của instruction-tuned, phiên bản sẵn sàng để chat). Nó có tổng cộng 11.95B tham số, nên "12B" là làm tròn lên một chút. Dữ liệu huấn luyện có giới hạn đến tháng 1 năm 2025.
Đây là phần khiến nó trở nên thú vị: Gemma 4 12B là mô hình Gemma cỡ trung đầu tiên có đầu vào âm thanh gốc. Không có encoder âm thanh riêng biệt nào được gắn thêm. Dạng sóng thô được chiếu thẳng vào mô hình. Hình ảnh cũng vậy. Lựa chọn thiết kế đó là lý do nó đủ nhỏ để chạy trên một card tiêu dùng đơn, và chúng ta sẽ tìm hiểu lý do ngay sau đây.
Muốn có bức tranh tổng thể trước? Hướng dẫn của chúng tôi về chạy mô hình mở trên máy của chính bạn bao gồm những kiến thức cơ bản về thiết lập nếu bạn mới làm quen với LLM cục bộ. Bài đăng ra mắt chính thức của Google có đầy đủ thông báo.
Tổng quan thông số Gemma 4 12B
Mọi thứ đã xác minh, trong một bảng. Không phỏng đoán.
| Thông số | Giá trị |
|---|---|
| Tên đầy đủ | Gemma 4 12B (gemma-4-12B-it) |
| Tham số | 11.95B (~12B) |
| Giấy phép | Apache 2.0 (dùng thương mại OK) |
| Cửa sổ ngữ cảnh | 256K token |
| Phương thức | Văn bản + hình ảnh + âm thanh gốc vào, văn bản ra |
| Kiến trúc | Thống nhất không encoder, 48 lớp, attention lai |
| Ngôn ngữ | 140 |
| Giới hạn huấn luyện | Tháng 1 năm 2025 |
| Tag Ollama | gemma4:12b (tải xuống 7.6 GB) |
| Tag Apple Silicon | gemma4:12b-mlx |
| Sampling khuyến nghị | temperature 1.0, top_p 0.95, top_k 64 |
Một lưu ý về sampling: hãy giữ temperature=1.0, top_p=0.95, top_k=64 như khuyến nghị trừ khi bạn có lý do cụ thể. Các mô hình Gemma hoạt động khá kỳ lạ ở temperature thấp, nên đừng theo phản xạ hạ nó xuống 0.2 như bạn có thể làm với các mô hình khác.
Kiến trúc không encoder hoạt động như thế nào?
Không encoder (encoder-free) nghĩa là không có mô hình riêng biệt nào chuyển đổi hình ảnh hay âm thanh trước khi chúng đến mô hình ngôn ngữ. Các patch hình ảnh và dạng sóng âm thanh thô được chiếu trực tiếp vào không gian embedding chung thông qua các lớp tuyến tính mỏng. Hầu hết các mô hình đa phương thức gắn thêm một encoder thị giác nặng nề vào LLM. Gemma 4 12B bỏ qua điều đó, đây là lý do nó vừa trong 16GB.
Hãy nghĩ về nó như một phiên dịch viên so với một người song ngữ. Cách tiếp cận cũ thuê một phiên dịch viên riêng (encoder) để chuyển đổi hình ảnh sang ngôn ngữ mà mô hình hiểu, rồi chuyển tiếp kết quả. Gemma 4 12B song ngữ từ khi sinh ra. Dữ liệu âm thanh và hình ảnh nói trực tiếp ngôn ngữ gốc của mô hình, thông qua một lớp chiếu nhẹ thay vì một encoder cồng kềnh.
Bên trong, nó có 48 lớp với attention lai. Hầu hết các lớp sử dụng cửa sổ trượt 1024 token (rẻ, cục bộ), xen kẽ với các lớp attention toàn cục thỉnh thoảng xuất hiện để nhìn toàn bộ ngữ cảnh. Sự kết hợp đó là cách nó xử lý ngữ cảnh 256K mà không làm nóng chảy GPU của bạn.

Lợi ích thực tế: ít tham số dành cho encoder hơn nghĩa là nhiều ngân sách VRAM của bạn hơn dành cho suy luận thực sự. Đó là sự đánh đổi cho phép một mô hình 12B vượt trội đến vậy so với kích thước của nó.
Benchmark Gemma 4 12B: Những con số thực
Tiêu đề đứng vững: Gemma 4 12B đạt 77.2% trên MMLU Pro, vượt qua 67.6% của Gemma 3 27B trong cùng bài kiểm tra, với chưa đến một nửa VRAM. Đây là những con số chính thức của mô hình instruction-tuned (-it) từ Google, không phải ước tính của cộng đồng. Đây là bộ đầy đủ.
| Benchmark | Gemma 4 12B | Gemma 3 27B (tham khảo) |
|---|---|---|
| MMLU Pro | 77.2% | 67.6% |
| GPQA Diamond | 78.8% | , |
| MMMU Pro | 69.1% | , |
| AIME 2026 (không công cụ) | 77.5% | , |
| LiveCodeBench v6 | 72.0% | , |
| Codeforces ELO | 1659 | , |
Một mô hình 12B giờ đây vượt qua flagship 27B năm ngoái trên MMLU Pro: 77.2% so với 67.6%. Đó là kiểu nhảy vọt thế hệ khiến bạn phải kiểm tra lại tính toán phần cứng của mình.

Hai lưu ý trung thực. Thứ nhất, các dấu gạch ngang nghĩa là Google không công bố con số Gemma 3 27B cho những hàng đó, nên các ô để trống thay vì điền bằng phỏng đoán. Thứ hai, mọi điểm số ở đây đều là của mô hình instruction-tuned. Con số của mô hình gốc (base) khác. Bạn có thể kiểm tra chéo tất cả những điều này trên model card HuggingFace và trang mô hình DeepMind.
Gemma 4 12B cần bao nhiêu VRAM?
Gemma 4 12B cần khoảng 6.6 GB VRAM ở lượng tử hóa Q4_K_M, nghĩa là nó vừa trên GPU 8GB. Để có khoảng trống thoải mái, đặc biệt nếu bạn muốn dùng một phần ngữ cảnh 256K đó, hãy nhắm đến 16GB VRAM hoặc bộ nhớ thống nhất. Nó chạy được trên laptop. Các máy Mac M-series xử lý nó tốt thông qua bộ nhớ thống nhất.
Lượng tử hóa chỉ là nén cho trọng số mô hình. Số có độ chính xác thấp hơn, tệp nhỏ hơn, độ chính xác kém hơn một chút. Đây là cách các mức phổ biến tương ứng.
| Lượng tử hóa | VRAM xấp xỉ | Chất lượng | Phù hợp nhất cho |
|---|---|---|---|
| Q4_K_M | ~6.6 GB | Gần đầy đủ, mất mát rất nhỏ | Mặc định hợp lý; vừa card 8GB |
| Q5_K_M | ~8.5 GB | Tốt hơn Q4 một chút | Có chút VRAM dư, muốn thêm độ chính xác |
| Q8 | ~13 GB | Chất lượng gần như đầy đủ | Card 16GB+, độ trung thực tối đa |
| QAT Q4_0 | ~6.6 GB | Gần FP ở dung lượng Q4 | Chất lượng tốt nhất mỗi GB (phát hành 5 tháng 6) |

Nếu bạn đang chọn phần cứng xoay quanh mô hình này, bài tổng hợp của chúng tôi về các công cụ LLM cục bộ mà chúng tôi đã benchmark bao gồm thông tin về backend nào tận dụng tối đa một card nhất định. Phiên bản ngắn: card 12GB chạy Q4 với khoảng trống dư dả, card 8GB chạy Q4 nếu bạn giữ ngữ cảnh ở mức vừa phải.
Tốc độ Gemma 4 12B: Token/giây trên phần cứng thực
Nó nhanh thế nào? Điều đó phụ thuộc vào card, mức lượng tử hóa và backend của bạn, nên thay vì một con số, chúng tôi đã tập hợp các con số bên thứ ba đã công bố vào một chỗ. Những con số này được báo cáo bởi các tester cộng đồng và nhà cung cấp, có ghi nguồn từng nguồn. Đây không phải con số phòng lab của riêng chúng tôi.
| Phần cứng | Quant | Token/giây báo cáo | Nguồn |
|---|---|---|---|
| RTX 3060 (6GB) | Q4_K_M | Dung lượng VRAM ~6.6 GB, chạy cục bộ (tok/s chưa được báo cáo chính xác) | runaiathome |
| RTX 4090 (24GB) | Q4_K_M | Mức chat thời gian thực (tok/s cụ thể chưa được báo cáo) | apxml / cộng đồng |
| Apple M-series (thống nhất) | mlx / Q4 | Chạy qua gemma4:12b-mlx (tok/s chưa được báo cáo rộng rãi) | Ollama / cộng đồng |
Tôi sẽ nói thẳng với bạn về những gì dữ liệu công khai thực sự nói vào lúc này. runaiathome đã xác nhận mô hình chạy trên RTX 3060 6GB trong dung lượng Q4_K_M ~6.6 GB của nó, đây là báo cáo phần cứng đã công bố cụ thể nhất cho đến nay. Bảng thông số của apxml và trang thư viện Ollama xác nhận mô hình phục vụ cục bộ trên RTX 4090 24GB ở Q4, thoải mái trong mức chat thời gian thực, nhưng con số tok/s duy trì chính xác vẫn chưa được công bố cho card đó. Biến thể gemma4:12b-mlx của Apple Silicon tồn tại và chạy được, nhưng các con số tok/s đáng tin cậy vẫn chưa xuất hiện sau ba ngày ra mắt.
Điều này có nghĩa gì với bạn, theo từng cấp: trên card 6GB như RTX 3060, hãy mong nó tải và chạy được cho chat cục bộ, chỉ cần giữ cửa sổ ngữ cảnh ở mức vừa phải. Trên RTX 4090 24GB ở Q4_K_M, các báo cáo đã công bố cho thấy nó thoải mái ở mức chat thời gian thực. Trên Apple Silicon, bản build MLX chạy được nhưng các con số benchmark vẫn đang nhỏ giọt xuất hiện.
Đây là những con số bên thứ ba đã công bố, không phải con số phòng lab của riêng chúng tôi, nên hãy xem chúng như mức ước chừng. Tok/s của bạn phụ thuộc vào độ dài prompt, kích thước ngữ cảnh và phiên bản backend. Nguồn: trang thư viện Ollama, apxml, và runaiathome. Khi có thêm benchmark cộng đồng trong hai tuần tới, chúng tôi sẽ cập nhật bảng này.
Làm thế nào để chạy Gemma 4 12B cục bộ?
Con đường ngắn nhất: cài Ollama, chạy một lệnh, xong. ollama run gemma4:12b tải mô hình 7.6 GB và đưa bạn vào prompt chat. Không cần tệp cấu hình, không cần môi trường Python. Nếu bạn muốn kiểm soát nhiều hơn hoặc đang dùng Apple Silicon, có bốn con đường khác bên dưới.
1. Ollama (mặc định dễ dàng). Tải và chạy trong hai dòng:
ollama pull gemma4:12b
ollama run gemma4:12b2. llama.cpp với GGUF. Nếu bạn muốn một mức lượng tử hóa cụ thể, hãy trỏ llama.cpp đến một GGUF trên HuggingFace. GGUF là định dạng tệp mà llama.cpp dùng cho trọng số đã lượng tử hóa:
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."3. MLX trên Apple Silicon. Máy Mac M-series có bản build MLX riêng dùng framework của Apple thay vì CUDA:
ollama run gemma4:12b-mlx4. LM Studio (GUI, không cần terminal). Thích một ứng dụng desktop? Mở LM Studio, nhấn tab tìm kiếm, và gõ gemma 4 12b. Chọn một GGUF Q4_K_M và tải xuống. LM Studio xử lý phần còn lại, bao gồm cả một nút bật máy chủ cục bộ.
5. Truy vấn qua API. Ollama cung cấp một endpoint tương thích OpenAI trên cổng 11434, nên mã hiện có hoạt động được với việc thay đổi base-URL một dòng:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:12b",
"messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
}'Khi bạn đã chạy được nó trên CLI, có thể bạn sẽ muốn một giao diện thực sự. Bạn có thể bọc nó trong một UI kiểu ChatGPT với Open WebUI trong khoảng năm phút. Mới với tất cả những thứ này? Bắt đầu với hướng dẫn thiết lập LLM cục bộ đầy đủ của chúng tôi. Để biết các khuyến nghị sampling chính thức và các cách chạy, hãy xem ai.google.dev và tài liệu Ollama.
Nên dùng lượng tử hóa nào cho Gemma 4 12B?
Với hầu hết mọi người, Q4_K_M là mặc định hợp lý: khoảng 6.6 GB VRAM, chất lượng gần đầy đủ, và vừa GPU 8GB. Nếu bạn có 16GB trở lên và muốn độ trung thực tối đa, hãy nâng lên Q8. Và nếu bạn muốn chất lượng tốt nhất mỗi gigabyte có sẵn ngay lúc này, hãy xem các checkpoint QAT Q4_0 mới.
Đây là góc độ mới mẻ mà chưa ai đề cập. Vào ngày 5 tháng 6 năm 2026, chỉ hai ngày sau khi ra mắt, Google đã phát hành các checkpoint Quantization-Aware-Training (QAT) Q4_0 cùng với một định dạng di động mới. QAT nghĩa là mô hình được huấn luyện có tính đến lượng tử hóa, nên nó giữ chất lượng gần FP (gần đầy đủ độ chính xác) ở dung lượng Q4. Cùng ~6.6 GB, mất mát độ chính xác ít hơn đáng kể so với Q4 sau huấn luyện tiêu chuẩn. Nếu bạn bị giới hạn VRAM nhưng nhạy cảm về chất lượng, đó là lựa chọn của bạn.
Hướng dẫn quyết định nhanh:
- Card 8GB, muốn đơn giản: Q4_K_M.
- Card 8GB, muốn chất lượng tốt nhất ở kích thước đó: QAT Q4_0.
- Card 16GB+, muốn độ trung thực tối đa: Q8.
- Ở giữa, có chút VRAM dư: Q5_K_M.
Bạn có thể đọc lý luận của Google trong thông báo QAT của họ. Điểm mấu chốt: Q4_K_M ổn, QAT Q4_0 tốt hơn ở cùng kích thước, và bạn chỉ cần Q8 nếu độ chính xác quan trọng hơn bộ nhớ.
Gemma 4 12B vs Gemma 3 12B vs Qwen 3.5: Nâng cấp có đáng không?
Có, việc nâng cấp từ Gemma 3 12B là đáng giá nếu bạn quan tâm đến giấy phép Apache 2.0, đầu vào âm thanh gốc, cửa sổ ngữ cảnh 256K, hoặc bước nhảy MMLU Pro. So với Qwen 3.5, thì sát hơn. Gemma 4 12B thắng về sự cởi mở của giấy phép và âm thanh gốc, nhưng Qwen 3.5 giành một số hàng benchmark hạng 12B. Hãy chọn theo nhu cầu thực tế của bạn, không phải theo tiêu đề.
| Tính năng | Gemma 4 12B | Gemma 3 12B | Qwen 3.5 (hạng 12B) |
|---|---|---|---|
| Giấy phép | Apache 2.0 | Giấy phép Gemma tùy chỉnh | Apache 2.0 |
| Ngữ cảnh | 256K | 128K | Lên đến 256K |
| Phương thức | Văn bản + hình ảnh + âm thanh | Văn bản + hình ảnh | Văn bản + hình ảnh |
| Âm thanh gốc | Có | Không | Không |
| MMLU Pro | 77.2% | Thấp hơn | Cạnh tranh, thắng một số hàng |
| VRAM Q4 | ~6.6 GB | ~6.6 GB | ~6.6 GB |
Chỉ riêng thay đổi giấy phép đã biện minh cho việc rời bỏ Gemma 3 12B đối với nhiều nhóm. Gemma 3 được phát hành theo giấy phép tùy chỉnh của Google với các hạn chế sử dụng; Gemma 4 là Apache 2.0 hoàn toàn. Nếu bạn đã trì hoãn Gemma vì lý do thương mại, rào cản đó đã biến mất.
So với Qwen 3.5, hãy thành thật với bản thân. Qwen 3.5 thực sự mạnh và nhỉnh hơn Gemma 4 12B ở một số hàng suy luận và lập trình. Nếu đầu vào âm thanh và giấy phép cởi mở không nằm trong danh sách của bạn, hãy benchmark cả hai trên tác vụ của riêng bạn trước khi cam kết. Xem Gemma 4 12B xếp ở đâu trong số các mô hình mở tốt nhất để biết bức tranh rộng hơn. Và vì nó là Apache 2.0, bạn có thể fine-tune nó theo Apache 2.0 với Unsloth mà không đau đầu về giấy phép.
Khi nào KHÔNG nên dùng Gemma 4 12B
Hãy bỏ qua Gemma 4 12B nếu bạn cần suy luận cấp frontier mà chỉ một mô hình lớn hơn nhiều mới mang lại, nếu Qwen 3.5 thắng ở hàng benchmark cụ thể mà khối lượng công việc của bạn phụ thuộc vào, hoặc nếu dự án của bạn dựa nhiều vào công cụ âm thanh vẫn đang trưởng thành sau ba ngày ra mắt. Đây là một mô hình 12B xuất sắc, không phải mô hình ma thuật.
Gemma 4 12B không phải lúc nào cũng là lựa chọn đúng. Nếu bạn cần suy luận cấp frontier, một mô hình lớn hơn vẫn thắng. Hỗ trợ âm thanh gốc là có thật và ấn tượng, nhưng các công cụ xung quanh, thư viện, tiện ích hỗ trợ, tích hợp framework, mới chỉ vài ngày tuổi và còn thô ráp ở một số chỗ. Nếu bạn đang tung ra một sản phẩm nặng về âm thanh trong tuần này, hãy kiểm tra kỹ lưỡng trước khi đặt cược vào nó.
Vài lý do loại trừ trung thực nữa. Nếu bạn đang kết nối nó vào một agent, hãy xác nhận độ tin cậy của việc gọi công cụ trên các tác vụ của bạn trước, vì hành vi agentic thay đổi theo mô hình. Nếu lợi thế của bạn là ngữ cảnh dài, hãy đảm bảo bạn tận dụng tối đa cửa sổ ngữ cảnh 256K thay vì cho rằng kích thước cửa sổ thô đồng nghĩa với đầu ra tốt hơn. Và nếu bạn đang vượt ra ngoài việc chạy cục bộ để phục vụ production, lộ trình phục vụ production vượt ra ngoài cục bộ bao gồm vLLM và SGLang. Nếu bạn đang triển khai các mô hình mở như Gemma 4 12B trong production, chúng tôi có thể giúp.
Về tác giả
Mert Batur Gurbuz là Đồng sáng lập của Techsy.io, nơi nhóm phát triển các AI agent, hệ thống tự động hóa, và pipeline giọng nói/SDR cho khách hàng B2B. Anh học tại Đại học Birmingham và viết về chồng công cụ LLM mà nhóm Techsy thực sự sử dụng trong production. Kết nối trên LinkedIn.
Chọn một công cụ là nửa dễ dàng. Làm cho nó chạy đáng tin cậy bên trong một sản phẩm thực mới là nơi hầu hết các nhóm chững lại, và đó chính xác là những gì nhóm tích hợp AI của chúng tôi xây dựng cho khách hàng, từ pipeline RAG đến agent tùy chỉnh.
Câu hỏi thường gặp
Làm thế nào để chạy Gemma 4 12B cục bộ?
Cài Ollama, rồi chạy ollama run gemma4:12b. Lệnh đó tải mô hình 7.6 GB và mở một prompt chat. Không cần môi trường Python hay tệp cấu hình. Nếu bạn muốn một ứng dụng đồ họa thay thế, LM Studio cũng hoạt động: tìm gemma 4 12b trong trình duyệt mô hình của nó và tải xuống một bản build Q4_K_M.
Yêu cầu VRAM và phần cứng cho Gemma 4 12B là gì?
Gemma 4 12B cần khoảng 6.6 GB VRAM ở lượng tử hóa Q4_K_M, nên nó vừa GPU 8GB. Để có khoảng trống thoải mái, đặc biệt khi dùng ngữ cảnh dài, hãy nhắm đến 16GB VRAM hoặc bộ nhớ thống nhất. Nó chạy được trên laptop, bao gồm cả Mac M-series thông qua bộ nhớ thống nhất.
Gemma 4 12B có chạy được trên laptop 16GB không?
Có, dễ dàng. Ở Q4_K_M mô hình dùng khoảng 6.6 GB, để lại nhiều khoảng trống trên máy 16GB. Trên laptop Apple Silicon, bộ nhớ thống nhất xử lý nó tốt thông qua bản build gemma4:12b-mlx. Bạn thậm chí có thể nâng lên lượng tử hóa Q8 trên 16GB để có độ trung thực cao hơn.
Gemma 4 12B có thực sự tốt hơn Llama hay Qwen 3.5 không?
Tùy thuộc vào bạn đo lường điều gì. Gemma 4 12B thắng ở giấy phép Apache 2.0, đầu vào âm thanh gốc, và cửa sổ ngữ cảnh 256K, và nó đạt 77.2% mạnh mẽ trên MMLU Pro. Nhưng Qwen 3.5 giành một số hàng suy luận và lập trình hạng 12B. Hãy benchmark cả hai trên tác vụ của riêng bạn trước khi quyết định.
Gemma 4 12B có tốt hơn Gemma 3 12B không?
Có. Gemma 4 12B chuyển sang giấy phép Apache 2.0 cởi mở, thêm đầu vào âm thanh gốc, nhân đôi cửa sổ ngữ cảnh lên 256K token, và đạt cải thiện MMLU Pro đáng kể. Chỉ riêng thay đổi giấy phép đã biện minh cho việc nâng cấp đối với các dự án thương mại từng bị chặn bởi các điều khoản tùy chỉnh của Gemma 3.
Nên dùng lượng tử hóa nào cho Gemma 4 12B?
Q4_K_M là mặc định hợp lý ở khoảng 6.6 GB với chất lượng gần đầy đủ. Nếu bạn muốn chất lượng tốt nhất ở cùng kích thước đó, hãy dùng các checkpoint QAT Q4_0 mới phát hành ngày 5 tháng 6 năm 2026, giữ chất lượng gần đầy đủ độ chính xác ở dung lượng Q4. Chỉ dùng Q8 nếu bạn có 16GB+ và cần độ trung thực tối đa.
Gemma 4 12B có miễn phí cho sử dụng thương mại không?
Có. Gemma 4 12B được phát hành theo giấy phép Apache 2.0, cho phép sử dụng thương mại mà không có các hạn chế sử dụng của giấy phép Gemma tùy chỉnh của Gemma 3. Bạn có thể xây dựng sản phẩm thương mại, fine-tune nó, và phân phối lại. Thay đổi giấy phép đó là một trong những lý do lớn nhất khiến các nhóm nâng cấp từ Gemma 3.
Gemma 4 12B có thực sự hỗ trợ đầu vào âm thanh không?
Có. Gemma 4 12B là mô hình Gemma cỡ trung đầu tiên có đầu vào âm thanh gốc. Nhờ thiết kế không encoder, dạng sóng âm thanh thô chiếu trực tiếp vào mô hình mà không cần encoder âm thanh riêng. Tuy nhiên, các công cụ xung quanh mới chỉ vài ngày tuổi, nên hãy kiểm tra kỹ trước khi tung ra các tính năng nặng về âm thanh trong production.
Gemma 4 12B nhanh thế nào trên RTX 4090?
Các báo cáo bên thứ ba đã công bố cho thấy Gemma 4 12B ở Q4_K_M thoải mái ở mức chat thời gian thực trên RTX 4090 24GB, mặc dù con số token/giây duy trì chính xác vẫn chưa được công bố sau ba ngày ra mắt. Tốc độ thay đổi theo độ dài prompt, kích thước ngữ cảnh, và phiên bản backend, nên hãy xem các con số ban đầu là ước chừng.
Tải Gemma 4 12B ở đâu?
Mô hình instruction-tuned nằm trên HuggingFace với tên google/gemma-4-12B-it, hoặc bạn có thể tải nó qua Ollama bằng ollama run gemma4:12b (tải xuống 7.6 GB). Người dùng LM Studio có thể tìm gemma 4 12b trong trình duyệt mô hình của ứng dụng. Đối với các mức lượng tử hóa cụ thể, các tệp GGUF có sẵn từ các kho cộng đồng như Unsloth.