
Gemma 4 12B: benchmarki, wymagania VRAM i jak uruchomić lokalnie
Google DeepMind wydało Gemmę 4 12B 3 czerwca 2026. Trzy dni później liczba, którą wszyscy powtarzają, to wynik na MMLU Pro: 77,2%. To więcej niż zeszłoroczna Gemma 3 27B, która osiągnęła 67,6% na tym samym teście. Model z 12 miliardami parametrów pokonuje flagowca 27B? Przy mniej niż połowie pamięci? Tak. I licencja też się zmieniła. Gemma 4 jest dystrybuowana na licencji Apache 2.0, więc komercyjne użycie jest w porządku, bez gwiazdek. Model ma okno kontekstu 256K tokenów i działa w około 6,6 GB VRAM po kwantyzacji. Ta ostatnia część to cała historia dla większości z nas: ten model mieści się na GPU ze średniej półki.
Najważniejsze wnioski
- Gemma 4 12B (wydana 3 czerwca 2026) zdobywa 77,2% na MMLU Pro, pokonując zeszłoroczną Gemmę 3 27B (67,6%).
- Działa w ~6,6 GB VRAM przy Q4_K_M, mieszcząc się na GPU 8GB; ~16GB daje komfortowy zapas.
- Licencja Apache 2.0 (użycie komercyjne OK), kontekst 256K, natywne wejście audio + obraz, architektura bez enkodera.
- Jedna komenda, żeby uruchomić:
ollama run gemma4:12b(7,6 GB do pobrania).
Czym jest Gemma 4 12B?
Gemma 4 12B to model z otwartymi wagami o 12 miliardach parametrów od Google DeepMind, wydany 3 czerwca 2026 na licencji Apache 2.0. To zunifikowany model multimodalny bez enkodera: tekst, obraz i natywne audio wchodzą, tekst wychodzi. Ma okno kontekstu 256K tokenów i obsługuje 140 języków.
Wariant z dostrajaniem instrukcyjnym, który faktycznie uruchomisz, nazywa się gemma-4-12B-it („it" to skrót od instruction-tuned, wersja gotowa do czatu). Ma łącznie 11,95B parametrów, więc „12B" to lekkie zaokrąglenie w górę. Dane treningowe sięgają do stycznia 2025.
Oto co czyni go interesującym: Gemma 4 12B to pierwsza średniej wielkości Gemma z natywnym wejściem audio. Nie ma osobnego enkodera audio doczepionego z boku. Surowe przebiegi falowe trafiają wprost do modelu. To samo dotyczy obrazów. Ten wybór projektowy sprawia, że model pozostaje wystarczająco mały, by działać na pojedynczej konsumenckiej karcie — i za chwilę wyjaśnimy dlaczego.
Chcesz najpierw szerszy obraz? Nasz przewodnik po uruchamianiu otwartych modeli na własnym komputerze obejmuje podstawy konfiguracji, jeśli jesteś nowy w lokalnych LLM-ach. Oficjalny wpis Google o premierze zawiera pełne ogłoszenie.
Specyfikacja Gemma 4 12B w skrócie
Wszystko zweryfikowane, w jednej tabeli. Bez zgadywania.
| Specyfikacja | Wartość |
|---|---|
| Pełna nazwa | Gemma 4 12B (gemma-4-12B-it) |
| Parametry | 11,95B (~12B) |
| Licencja | Apache 2.0 (użycie komercyjne OK) |
| Okno kontekstu | 256K tokenów |
| Modalności | Tekst + obraz + natywne audio na wejściu, tekst na wyjściu |
| Architektura | Zunifikowana bez enkodera, 48 warstw, hybrydowa uwaga |
| Języki | 140 |
| Granica danych treningowych | Styczeń 2025 |
| Tag Ollama | gemma4:12b (7,6 GB do pobrania) |
| Tag Apple Silicon | gemma4:12b-mlx |
| Zalecane próbkowanie | temperature 1.0, top_p 0.95, top_k 64 |
Jedna uwaga o próbkowaniu: trzymaj się zalecanego temperature=1.0, top_p=0.95, top_k=64, chyba że masz powód, by to zmienić. Modele Gemma zachowują się dziwnie przy niskich temperaturach, więc nie obniżaj odruchowo do 0,2 jak w przypadku innych modeli.
Jak działa architektura bez enkodera?
„Bez enkodera" oznacza, że nie ma osobnego modelu konwertującego obrazy lub audio, zanim trafią do modelu językowego. Fragmenty wizyjne i surowe przebiegi audio są rzutowane bezpośrednio do wspólnej przestrzeni embeddingów przez cienkie warstwy liniowe. Większość modeli multimodalnych doczepia ciężki enkoder wizyjny do LLM. Gemma 4 12B to pomija, dlatego mieści się w 16GB.
Pomyśl o tym jak o tłumaczu kontra osobie dwujęzycznej. Stare podejście zatrudnia osobnego tłumacza (enkoder), który konwertuje obrazy na język zrozumiały dla modelu, a potem przekazuje wynik. Gemma 4 12B jest dwujęzyczna od urodzenia. Dane audio i obrazowe mówią natywnym językiem modelu bezpośrednio, przez lekką warstwę projekcji zamiast masywnego enkodera.
Pod maskiem to 48 warstw z hybrydową uwagą. Większość warstw używa okna przesuwnego o 1024 tokenach (tanie, lokalne), przeplatanych okazjonalnymi warstwami uwagi globalnej, które widzą cały kontekst. Ta mieszanka pozwala obsłużyć kontekst 256K bez przegrzewania GPU.

Praktyczna korzyść: mniej parametrów wydanych na enkodery oznacza, że więcej budżetu VRAM trafia na właściwe rozumowanie. To ten kompromis pozwala modelowi 12B bić tak daleko powyżej swojej kategorii wagowej.
Benchmarki Gemma 4 12B: prawdziwe liczby
Główna teza się broni: Gemma 4 12B zdobywa 77,2% na MMLU Pro, pokonując 67,6% Gemmy 3 27B na tym samym teście, przy mniej niż połowie VRAM. To oficjalne liczby modelu z dostrajaniem instrukcyjnym (-it) od Google, nie szacunki społeczności. Oto pełen zestaw.
| Benchmark | Gemma 4 12B | Gemma 3 27B (odniesienie) |
|---|---|---|
| MMLU Pro | 77,2% | 67,6% |
| GPQA Diamond | 78,8% | , |
| MMMU Pro | 69,1% | , |
| AIME 2026 (bez narzędzi) | 77,5% | , |
| LiveCodeBench v6 | 72,0% | , |
| Codeforces ELO | 1659 | , |
Model 12B pokonuje teraz zeszłorocznego flagowca 27B na MMLU Pro: 77,2% vs 67,6%. To skok generacyjny, który każe przeliczyć kalkulacje sprzętowe od nowa.

Dwa uczciwe zastrzeżenia. Po pierwsze, myślniki oznaczają, że Google nie opublikowało wyniku Gemmy 3 27B dla tych wierszy, więc komórki pozostają puste, zamiast być wypełnione zgadywaniem. Po drugie, każdy wynik tutaj dotyczy modelu z dostrajaniem instrukcyjnym. Liczby modelu bazowego są inne. Możesz zweryfikować wszystkie te dane na karcie modelu HuggingFace i na stronie modelu DeepMind.
Ile VRAM potrzebuje Gemma 4 12B?
Gemma 4 12B potrzebuje około 6,6 GB VRAM przy kwantyzacji Q4_K_M, co oznacza, że mieści się na GPU 8GB. Dla komfortowego zapasu, szczególnie jeśli chcesz wykorzystać część kontekstu 256K, celuj w 16GB VRAM lub pamięci zunifikowanej. Działa na laptopie. Maki z serii M radzą sobie z tym przez pamięć zunifikowaną bez problemu.
Kwantyzacja to po prostu kompresja wag modelu. Liczby o niższej precyzji, mniejszy plik, nieco mniejsza dokładność. Oto jak wyglądają popularne poziomy.
| Kwantyzacja | Przybliżony VRAM | Jakość | Najlepsza dla |
|---|---|---|---|
| Q4_K_M | ~6,6 GB | Bliska pełnej, minimalna strata | Rozsądny domyślny wybór; mieści się na kartach 8GB |
| Q5_K_M | ~8,5 GB | Nieco lepsza niż Q4 | Trochę zapasu VRAM, chcesz więcej dokładności |
| Q8 | ~13 GB | Praktycznie pełna jakość | Karty 16GB+, maksymalna wierność |
| QAT Q4_0 | ~6,6 GB | Bliska FP przy rozmiarze Q4 | Najlepsza jakość na GB (wydana 5 czerwca) |

Jeśli dobierasz sprzęt pod ten model, nasze zestawienie narzędzi do lokalnych LLM-ów, które benchmarkowaliśmy obejmuje informacje, które backendy wyciskają najwięcej z danej karty. W skrócie: karta 12GB uruchamia Q4 z zapasem, karta 8GB uruchamia Q4, jeśli trzymasz kontekst w rozsądnych granicach.
Szybkość Gemma 4 12B: tokeny/s na różnym sprzęcie
Jak szybki jest? To zależy od karty, kwantyzacji i backendu, więc zamiast jednej liczby zebraliśmy opublikowane dane stron trzecich w jednym miejscu. Są to wyniki zgłaszane przez testerów społeczności i dostawców, z przypisaniem do źródła. To nie są nasze własne pomiary laboratoryjne.
| Sprzęt | Kwant | Zgłaszane tokeny/s | Źródło |
|---|---|---|---|
| RTX 3060 (6GB) | Q4_K_M | ~6,6 GB ślad VRAM, działa lokalnie (tok/s nie podano dokładnie) | runaiathome |
| RTX 4090 (24GB) | Q4_K_M | Zakres czatu w czasie rzeczywistym (konkretne tok/s jeszcze nie podane) | apxml / społeczność |
| Apple M-series (zunifikowana) | mlx / Q4 | Działa przez gemma4:12b-mlx (tok/s jeszcze szeroko nie podane) | Ollama / społeczność |
Powiedem wprost, co mówią publiczne dane w tej chwili. runaiathome potwierdziło działanie modelu na 6GB RTX 3060 w jego ~6,6 GB śladzie Q4_K_M, co jest najbardziej konkretnym opublikowanym raportem sprzętowym do tej pory. Specyfikacja apxml i strona biblioteki Ollama potwierdzają, że model obsługuje lokalnie na 24GB RTX 4090 przy Q4, komfortowo w zakresie czatu w czasie rzeczywistym, ale dokładna utrzymywana wartość tok/s nie została jeszcze opublikowana dla tej karty. Wariant gemma4:12b-mlx na Apple Silicon istnieje i działa, ale wiarygodne liczby tok/s nie pojawiły się trzy dni po premierze.
Co to oznacza dla Ciebie, według poziomu: na karcie 6GB jak RTX 3060, spodziewaj się, że model się załaduje i będzie działać do lokalnego czatu, ale trzymaj okno kontekstu w rozsądnych granicach. Na 24GB RTX 4090 przy Q4_K_M, opublikowane raporty sytuują go komfortowo w zakresie czatu w czasie rzeczywistym. Na Apple Silicon build MLX działa, ale liczby benchmarkowe wciąż napływają.
To opublikowane dane stron trzecich, nie nasze własne pomiary, więc traktuj je jako orientacyjne. Twoje tok/s zależy od długości promptu, rozmiaru kontekstu i wersji backendu. Źródła: strona biblioteki Ollama, apxml i runaiathome. W miarę jak pojawią się kolejne benchmarki społeczności w ciągu najbliższych dwóch tygodni, zaktualizujemy tę tabelę.
Jak uruchomić Gemmę 4 12B lokalnie?
Najkrótsza ścieżka: zainstaluj Ollama, uruchom jedną komendę, gotowe. ollama run gemma4:12b pobiera model 7,6 GB i otwiera prompt czatu. Bez plików konfiguracyjnych, bez środowiska Python. Jeśli chcesz więcej kontroli lub jesteś na Apple Silicon, poniżej są cztery inne ścieżki.
1. Ollama (łatwy domyślny wybór). Pobierz i uruchom w dwóch liniach:
ollama pull gemma4:12b
ollama run gemma4:12b2. llama.cpp z GGUF. Jeśli chcesz konkretną kwantyzację, skieruj llama.cpp na plik GGUF na HuggingFace. GGUF to format pliku, którego llama.cpp używa dla skwantyzowanych wag:
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."3. MLX na Apple Silicon. Maki z serii M mają dedykowany build MLX, który używa frameworka Apple zamiast CUDA:
ollama run gemma4:12b-mlx4. LM Studio (GUI, bez terminala). Wolisz aplikację desktopową? Otwórz LM Studio, wejdź w zakładkę wyszukiwania i wpisz gemma 4 12b. Wybierz GGUF Q4_K_M i pobierz. LM Studio zajmie się resztą, w tym przełącznikiem serwera lokalnego.
5. Odpytuj przez API. Ollama udostępnia endpoint kompatybilny z OpenAI na porcie 11434, więc istniejący kod działa z jednolinijkową zamianą base-URL:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:12b",
"messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
}'Gdy już uruchomisz go w CLI, prawdopodobnie zechcesz prawdziwy interfejs. Możesz opakować go w interfejs w stylu ChatGPT z Open WebUI w około pięć minut. Jesteś nowy w tym wszystkim? Zacznij od naszego pełnego przewodnika po konfiguracji lokalnego LLM. Oficjalne zalecenia dotyczące próbkowania i ścieżki uruchamiania znajdziesz na ai.google.dev i w dokumentacji Ollama.
Którą kwantyzację wybrać dla Gemmy 4 12B?
Dla większości osób Q4_K_M to rozsądny domyślny wybór: około 6,6 GB VRAM, jakość bliska pełnej, i mieści się na GPU 8GB. Jeśli masz 16GB lub więcej i chcesz maksymalną wierność, przejdź na Q8. A jeśli chcesz najlepszą jakość na gigabajt dostępną teraz, spójrz na nowe checkpointy QAT Q4_0.
Oto aspekt świeżości, którego nikt jeszcze nie uwzględnił. 5 czerwca 2026, zaledwie dwa dni po premierze, Google wydało checkpointy Quantization-Aware-Training (QAT) Q4_0 wraz z nowym formatem mobilnym. QAT oznacza, że model był trenowany z myślą o kwantyzacji, więc utrzymuje jakość bliską FP (bliską pełnej precyzji) przy rozmiarze Q4. Te same ~6,6 GB, zauważalnie mniejsza strata dokładności niż standardowe Q4 po treningu. Jeśli masz ograniczony VRAM, ale zależy Ci na jakości, to jest Twój wybór.
Szybki przewodnik decyzyjny:
- Karta 8GB, chcesz prostoty: Q4_K_M.
- Karta 8GB, chcesz najlepszej jakości w tym rozmiarze: QAT Q4_0.
- Karta 16GB+, chcesz maksymalnej wierności: Q8.
- Pomiędzy, trochę zapasu VRAM: Q5_K_M.
Możesz przeczytać uzasadnienie Google w ich ogłoszeniu o QAT. Wniosek: Q4_K_M jest w porządku, QAT Q4_0 jest lepszy w tym samym rozmiarze, a Q8 potrzebujesz tylko jeśli dokładność jest ważniejsza niż pamięć.
Gemma 4 12B vs Gemma 3 12B vs Qwen 3.5: czy warto aktualizować?
Tak, aktualizacja z Gemmy 3 12B jest warta, jeśli zależy Ci na licencji Apache 2.0, natywnym wejściu audio, oknie kontekstu 256K lub skoku na MMLU Pro. W porównaniu z Qwen 3.5 jest bliżej. Gemma 4 12B wygrywa na liberalności licencji i natywnym audio, ale Qwen 3.5 bierze niektóre wiersze benchmarkowe klasy 12B. Wybieraj według swoich rzeczywistych potrzeb, nie nagłówków.
| Funkcja | Gemma 4 12B | Gemma 3 12B | Qwen 3.5 (klasa 12B) |
|---|---|---|---|
| Licencja | Apache 2.0 | Własna licencja Gemma | Apache 2.0 |
| Kontekst | 256K | 128K | Do 256K |
| Modalności | Tekst + obraz + audio | Tekst + obraz | Tekst + obraz |
| Natywne audio | Tak | Nie | Nie |
| MMLU Pro | 77,2% | Niżej | Konkurencyjny, wygrywa niektóre wiersze |
| VRAM Q4 | ~6,6 GB | ~6,6 GB | ~6,6 GB |
Sama zmiana licencji uzasadnia przejście z Gemmy 3 12B dla wielu zespołów. Gemma 3 była dystrybuowana na własnej licencji Google z ograniczeniami użycia; Gemma 4 to czysty Apache 2.0. Jeśli wstrzymywałeś się z Gemmą z powodów komercyjnych, ta blokada zniknęła.
W porównaniu z Qwen 3.5, bądź ze sobą szczery. Qwen 3.5 jest naprawdę silny i wyprzedza Gemmę 4 12B w niektórych wierszach rozumowania i kodowania. Jeśli wejście audio i liberalna licencja nie są na Twojej liście, zbenchmarkuj oba na własnym zadaniu przed podjęciem decyzji. Zobacz gdzie Gemma 4 12B plasuje się wśród najlepszych otwartych modeli dla szerszego kontekstu. A ponieważ to Apache 2.0, możesz dostrajać go na licencji Apache 2.0 z Unsloth bez problemów licencyjnych.
Kiedy NIE używać Gemmy 4 12B
Pomiń Gemmę 4 12B, jeśli potrzebujesz rozumowania na poziomie frontier, które dostarcza tylko znacznie większy model, jeśli Qwen 3.5 wygrywa konkretny wiersz benchmarkowy, od którego zależy Twoje obciążenie, lub jeśli Twój projekt mocno opiera się na narzędziach audio, które wciąż dojrzewają trzy dni po premierze. To doskonały model 12B, nie magiczny.
Gemma 4 12B nie zawsze jest właściwym wyborem. Jeśli potrzebujesz rozumowania na poziomie frontier, większy model wciąż wygrywa. Natywne wsparcie audio jest prawdziwe i imponujące, ale otaczające narzędzia, biblioteki, programy pomocnicze, integracje z frameworkami — mają kilka dni i są miejscami surowe. Jeśli wysyłasz produkt mocno oparty na audio w tym tygodniu, przetestuj gruntownie, zanim na nim postawisz.
Kilka uczciwych dyskwalifikatorów. Jeśli podłączasz go do agenta, najpierw potwierdź niezawodność wywoływania narzędzi na swoich zadaniach, bo zachowanie agentowe różni się między modelami. Jeśli Twoją przewagą jest długi kontekst, upewnij się, że wykorzystujesz w pełni okno kontekstu 256K, zamiast zakładać, że surowy rozmiar okna równa się lepszy wynik. A jeśli przechodzisz od lokalnych uruchomień do produkcyjnego serwowania, ścieżka produkcyjnego serwowania poza lokalnym obejmuje vLLM i SGLang. Jeśli wdrażasz otwarte modele jak Gemma 4 12B w produkcji, możemy pomóc.
O autorze
Mert Batur Gurbuz jest współzałożycielem Techsy.io, gdzie zespół dostarcza agentów AI, systemy automatyzacji i pipeline'y głosowe/SDR dla klientów B2B. Studiuje na University of Birmingham i pisze o stosie narzędzi LLM, którego zespół Techsy faktycznie używa w produkcji. Połącz się na LinkedIn.
Wybór narzędzia to łatwiejsza połowa. Sprawienie, by działało niezawodnie w prawdziwym produkcie — to miejsce, gdzie większość zespołów się zatrzymuje, i to dokładnie to, co nasz zespół integracji AI buduje dla klientów, od pipeline'ów RAG po niestandardowych agentów.
Często zadawane pytania
Jak uruchomić Gemmę 4 12B lokalnie?
Zainstaluj Ollama, a następnie uruchom ollama run gemma4:12b. To pobiera model 7,6 GB i otwiera prompt czatu. Nie potrzeba środowiska Python ani plików konfiguracyjnych. Jeśli wolisz aplikację graficzną, LM Studio też działa: wyszukaj gemma 4 12b w przeglądarce modeli i pobierz build Q4_K_M.
Jakie są wymagania VRAM i sprzętowe dla Gemmy 4 12B?
Gemma 4 12B potrzebuje około 6,6 GB VRAM przy kwantyzacji Q4_K_M, więc mieści się na GPU 8GB. Dla komfortowego zapasu, szczególnie przy korzystaniu z długiego kontekstu, celuj w 16GB VRAM lub pamięci zunifikowanej. Działa na laptopach, w tym Makach z serii M przez pamięć zunifikowaną.
Czy Gemma 4 12B może działać na laptopie z 16GB?
Tak, bez problemu. Przy Q4_K_M model używa około 6,6 GB, zostawiając dużo miejsca na maszynie z 16GB. Na laptopach Apple Silicon pamięć zunifikowana radzi sobie dobrze przez build gemma4:12b-mlx. Możesz nawet przejść na kwantyzację Q8 na 16GB dla wyższej wierności.
Czy Gemma 4 12B jest naprawdę lepsza niż Llama lub Qwen 3.5?
To zależy od tego, co mierzysz. Gemma 4 12B wygrywa na licencji Apache 2.0, natywnym wejściu audio i oknie kontekstu 256K, i osiąga solidne 77,2% na MMLU Pro. Ale Qwen 3.5 bierze niektóre wiersze rozumowania i kodowania klasy 12B. Zbenchmarkuj oba na własnym zadaniu przed podjęciem decyzji.
Czy Gemma 4 12B jest lepsza niż Gemma 3 12B?
Tak. Gemma 4 12B przechodzi na liberalną licencję Apache 2.0, dodaje natywne wejście audio, podwaja okno kontekstu do 256K tokenów i osiąga znaczącą poprawę na MMLU Pro. Sama zmiana licencji uzasadnia aktualizację dla projektów komercyjnych, które były zablokowane przez własne warunki Gemmy 3.
Którą kwantyzację powinienem użyć dla Gemmy 4 12B?
Q4_K_M to rozsądny domyślny wybór przy około 6,6 GB z jakością bliską pełnej. Jeśli chcesz najlepszą jakość w tym samym rozmiarze, użyj nowych checkpointów QAT Q4_0 wydanych 5 czerwca 2026, które utrzymują jakość bliską pełnej precyzji przy rozmiarze Q4. Użyj Q8 tylko jeśli masz 16GB+ i potrzebujesz maksymalnej wierności.
Czy Gemma 4 12B jest darmowa do użytku komercyjnego?
Tak. Gemma 4 12B jest dystrybuowana na licencji Apache 2.0, która zezwala na użycie komercyjne bez ograniczeń użycia własnej licencji Gemma 3. Możesz budować komercyjne produkty, dostrajać go i redystrybuować. Ta zmiana licencji to jeden z największych powodów, dla których zespoły aktualizują z Gemmy 3.
Czy Gemma 4 12B naprawdę obsługuje wejście audio?
Tak. Gemma 4 12B to pierwsza średniej wielkości Gemma z natywnym wejściem audio. Dzięki konstrukcji bez enkodera, surowe przebiegi audio są rzutowane bezpośrednio do modelu bez osobnego enkodera audio. Niemniej otaczające narzędzia mają kilka dni, więc testuj ostrożnie przed wysłaniem funkcji mocno opartych na audio do produkcji.
Jak szybka jest Gemma 4 12B na RTX 4090?
Opublikowane raporty stron trzecich sytuują Gemmę 4 12B przy Q4_K_M komfortowo w zakresie czatu w czasie rzeczywistym na 24GB RTX 4090, choć dokładna utrzymywana wartość tokenów/s nie została jeszcze opublikowana trzy dni po premierze. Szybkość zależy od długości promptu, rozmiaru kontekstu i wersji backendu, więc traktuj wczesne dane jako orientacyjne.
Skąd pobrać Gemmę 4 12B?
Model z dostrajaniem instrukcyjnym znajduje się na HuggingFace jako google/gemma-4-12B-it, albo możesz go pobrać przez Ollama komendą ollama run gemma4:12b (7,6 GB do pobrania). Użytkownicy LM Studio mogą wyszukać gemma 4 12b w przeglądarce modeli aplikacji. Dla konkretnych kwantyzacji pliki GGUF są dostępne z repozytoriów społeczności jak Unsloth.