
Gemma 4 12B: Benchmarkuri, cerințe VRAM și cum să-l rulezi local
Google DeepMind a lansat Gemma 4 12B pe 3 iunie 2026. Trei zile mai târziu, numărul pe care toată lumea îl repetă este scorul MMLU Pro: 77,2%. Depășește Gemma 3 27B de anul trecut, care a obținut 67,6% pe același test. Un model cu 12 miliarde de parametri care bate un flagship de 27B? Cu mai puțin de jumătate din memorie? Da. Și licența s-a schimbat și ea. Gemma 4 vine sub Apache 2.0, deci utilizarea comercială e permisă, fără asteriscuri. Are o fereastră de context de 256K tokeni și rulează în aproximativ 6,6 GB de VRAM odată cuantizat. Ultima parte e toată povestea pentru majoritatea dintre noi: chestia asta încape pe un GPU mid-range.
Concluzii principale
- Gemma 4 12B (lansat pe 3 iunie 2026) obține 77,2% pe MMLU Pro, depășind Gemma 3 27B de anul trecut (67,6%).
- Rulează în ~6,6 GB VRAM la Q4_K_M, încăpând pe un GPU de 8GB; ~16GB oferă marjă confortabilă.
- Licență Apache 2.0 (utilizare comercială OK), context 256K, intrare audio + imagine nativă, arhitectură fără encoder.
- O singură comandă pentru rulare:
ollama run gemma4:12b(descărcare de 7,6 GB).
Ce este Gemma 4 12B?
Gemma 4 12B este un model open-weights cu 12 miliarde de parametri de la Google DeepMind, lansat pe 3 iunie 2026 sub licență Apache 2.0. E un model multimodal unificat, fără encoder: text, imagine și audio nativ intră, text iese. Are o fereastră de context de 256K tokeni și suportă 140 de limbi.
Varianta instruction-tuned pe care o vei rula efectiv se numește gemma-4-12B-it („it" vine de la instruction-tuned, versiunea pregătită pentru chat). Are 11,95B parametri totali, deci „12B" e o rotunjire în sus. Datele de antrenare au un cutoff în ianuarie 2025.
Iată partea care-l face interesant: Gemma 4 12B e primul Gemma de dimensiune medie cu intrare audio nativă. Nu există un encoder audio separat atașat. Formele de undă brute se proiectează direct în model. La fel și pentru imagini. Această alegere de design e motivul pentru care rămâne suficient de mic să ruleze pe o singură placă de consum, și vom ajunge la motiv într-un moment.
Vrei întâi imaginea de ansamblu? Ghidul nostru despre rularea modelelor open pe propriul calculator acoperă bazele configurării dacă ești nou în lumea LLM-urilor locale. Postarea oficială de lansare Google are anunțul complet.
Specificații Gemma 4 12B dintr-o privire
Totul verificat, într-un singur tabel. Fără presupuneri.
| Specificație | Valoare |
|---|---|
| Nume complet | Gemma 4 12B (gemma-4-12B-it) |
| Parametri | 11,95B (~12B) |
| Licență | Apache 2.0 (utilizare comercială OK) |
| Fereastră de context | 256K tokeni |
| Modalități | Text + imagine + audio nativ intrare, text ieșire |
| Arhitectură | Unificată fără encoder, 48 de straturi, atenție hibridă |
| Limbi | 140 |
| Cutoff antrenare | Ianuarie 2025 |
| Tag Ollama | gemma4:12b (descărcare de 7,6 GB) |
| Tag Apple Silicon | gemma4:12b-mlx |
| Sampling recomandat | temperature 1.0, top_p 0.95, top_k 64 |
O notă despre sampling: rămâi la valorile recomandate temperature=1.0, top_p=0.95, top_k=64 dacă nu ai un motiv să le schimbi. Modelele Gemma se comportă ciudat la temperaturi scăzute, deci nu scădea reflex la 0.2 cum ai face cu alte modele.
Cum funcționează arhitectura fără encoder?
Fără encoder înseamnă că nu există un model separat care să convertească imaginile sau audio-ul înainte să ajungă la modelul de limbaj. Patch-urile vizuale și formele de undă audio brute se proiectează direct în spațiul de embedding partajat prin straturi liniare subțiri. Majoritatea modelelor multimodale atașează un encoder vizual greu la LLM. Gemma 4 12B sare peste asta, motiv pentru care încape în 16GB.
Gândește-te la un traducător versus o persoană bilingvă. Abordarea veche angajează un traducător separat (encoderul) care convertește imaginile într-un limbaj pe care modelul îl înțelege, apoi predă rezultatul. Gemma 4 12B e bilingv din naștere. Datele audio și imagine vorbesc direct limbajul nativ al modelului, printr-un strat de proiecție ușor în loc de un encoder voluminos.
Sub capotă sunt 48 de straturi cu atenție hibridă. Majoritatea straturilor folosesc o fereastră glisantă de 1024 tokeni (ieftină, locală), intercalate cu straturi ocazionale de atenție globală care văd întregul context. Amestecul ăsta e modul în care gestionează un context de 256K fără să-ți topească GPU-ul.

Câștigul practic: mai puțini parametri cheltuiți pe encodere înseamnă că mai mult din bugetul tău de VRAM merge către raționamentul propriu-zis. Ăsta e schimbul care permite unui model de 12B să lovească atât de mult peste categoria lui.
Benchmarkuri Gemma 4 12B: numerele reale
Titlul se susține: Gemma 4 12B obține 77,2% pe MMLU Pro, depășind cei 67,6% ai Gemma 3 27B pe același test, cu mai puțin de jumătate din VRAM. Acestea sunt numere oficiale instruction-tuned (-it) de la Google, nu estimări ale comunității. Iată setul complet.
| Benchmark | Gemma 4 12B | Gemma 3 27B (referință) |
|---|---|---|
| MMLU Pro | 77,2% | 67,6% |
| GPQA Diamond | 78,8% | , |
| MMMU Pro | 69,1% | , |
| AIME 2026 (fără instrumente) | 77,5% | , |
| LiveCodeBench v6 | 72,0% | , |
| Codeforces ELO | 1659 | , |
Un model de 12B bate acum flagship-ul de 27B de anul trecut pe MMLU Pro: 77,2% vs 67,6%. E genul de salt generațional care te face să-ți reverifici calculele de hardware.

Două avertismente oneste. Primul: liniuțele înseamnă că Google nu a publicat un număr Gemma 3 27B pentru acele rânduri, deci celulele rămân goale în loc să fie completate cu presupuneri. Al doilea: fiecare scor de aici e al modelului instruction-tuned. Numerele modelului de bază diferă. Poți verifica încrucișat toate astea pe cardul de model HuggingFace și pe pagina de model DeepMind.
Cât VRAM are nevoie Gemma 4 12B?
Gemma 4 12B are nevoie de aproximativ 6,6 GB de VRAM la cuantizarea Q4_K_M, ceea ce înseamnă că încape pe un GPU de 8GB. Pentru marjă confortabilă, mai ales dacă vrei să folosești o bucată din contextul de 256K, țintește spre 16GB de VRAM sau memorie unificată. Rulează pe laptop. Mac-urile cu M-series îl gestionează bine prin memoria unificată.
Cuantizarea e pur și simplu compresie pentru ponderile modelului. Numere cu precizie mai scăzută, fișier mai mic, acuratețe ușor mai mică. Iată cum se mapează nivelurile comune.
| Cuantizare | VRAM aprox. | Calitate | Cel mai bun pentru |
|---|---|---|---|
| Q4_K_M | ~6,6 GB | Aproape completă, pierdere minimă | Default-ul sensibil; încape pe plăci de 8GB |
| Q5_K_M | ~8,5 GB | Ușor mai bună decât Q4 | Puțin VRAM în plus, vrei mai multă acuratețe |
| Q8 | ~13 GB | Practic calitate completă | Plăci de 16GB+, fidelitate maximă |
| QAT Q4_0 | ~6,6 GB | Aproape-FP la amprenta Q4 | Cel mai bun raport calitate-per-GB (lansat pe 5 iunie) |

Dacă alegi hardware în jurul acestui model, roundup-ul nostru cu instrumentele LLM locale pe care le-am testat acoperă ce backend-uri storc cel mai mult dintr-o placă dată. Versiunea scurtă: o placă de 12GB rulează Q4 cu loc de rezervă, o placă de 8GB rulează Q4 dacă ții contextul modest.
Viteza Gemma 4 12B: tokeni/sec pe hardware real
Cât de rapid e? Depinde de placa ta, cuantizarea ta și backend-ul tău, deci în loc de un singur număr am adunat cifrele publicate de terți într-un singur loc. Acestea sunt raportate de testeri din comunitate și vendori, atribuite fiecărei surse. Nu sunt numere din laboratorul nostru.
| Hardware | Cuantizare | Tokeni/sec raportați | Sursă |
|---|---|---|---|
| RTX 3060 (6GB) | Q4_K_M | Amprentă VRAM ~6,6 GB, rulează local (tok/s nu e raportat precis) | runaiathome |
| RTX 4090 (24GB) | Q4_K_M | Interval de chat în timp real (tok/s specific nu e încă raportat) | apxml / comunitate |
| Apple M-series (unificată) | mlx / Q4 | Rulează prin gemma4:12b-mlx (tok/s nu e încă raportat pe scară largă) | Ollama / comunitate |
O să fiu direct cu tine despre ce spun de fapt datele publice acum. runaiathome a confirmat modelul rulând pe un RTX 3060 de 6GB în amprenta sa Q4_K_M de ~6,6 GB, ceea ce e cel mai concret raport de hardware publicat până acum. Fișa tehnică apxml și pagina de bibliotecă Ollama confirmă că modelul servește local pe un RTX 4090 de 24GB la Q4, confortabil în teritoriul chat-ului în timp real, dar o cifră precisă de tok/s susținut nu e încă publicată pentru acea placă. Varianta Apple Silicon gemma4:12b-mlx există și rulează, dar numere fiabile de tok/s nu au apărut la trei zile după lansare.
Ce înseamnă asta pentru tine, pe niveluri: pe o placă de 6GB ca RTX 3060, așteaptă-te să se încarce și să ruleze pentru chat local, doar ține fereastra de context modestă. Pe un RTX 4090 de 24GB la Q4_K_M, rapoartele publicate îl plasează confortabil în teritoriul chat-ului în timp real. Pe Apple Silicon, build-ul MLX rulează, dar numerele de benchmark încă curg.
Acestea sunt cifre publicate de terți, nu numere din laboratorul nostru, deci tratează-le ca orientative. Tok/s-ul tău depinde de lungimea promptului, dimensiunea contextului și versiunea backendului. Surse: pagina de bibliotecă Ollama, apxml și runaiathome. Pe măsură ce mai multe benchmarkuri din comunitate apar în următoarele două săptămâni, vom actualiza acest tabel.
Cum rulezi Gemma 4 12B local?
Cea mai scurtă cale: instalezi Ollama, rulezi o comandă, gata. ollama run gemma4:12b descarcă modelul de 7,6 GB și te pune într-un prompt de chat. Fără fișiere de configurare, fără mediu Python. Dacă vrei mai mult control sau ești pe Apple Silicon, există alte patru căi mai jos.
1. Ollama (default-ul ușor). Descarcă și rulează în două linii:
ollama pull gemma4:12b
ollama run gemma4:12b2. llama.cpp cu un GGUF. Dacă vrei o cuantizare specifică, îndreaptă llama.cpp către un GGUF de pe HuggingFace. GGUF e formatul de fișier pe care llama.cpp îl folosește pentru ponderi cuantizate:
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."3. MLX pe Apple Silicon. Mac-urile cu M-series primesc un build MLX dedicat care folosește framework-ul Apple în loc de CUDA:
ollama run gemma4:12b-mlx4. LM Studio (GUI, fără terminal). Preferi o aplicație desktop? Deschide LM Studio, apasă pe tab-ul de căutare și tastează gemma 4 12b. Alege un GGUF Q4_K_M și descarcă. LM Studio se ocupă de rest, inclusiv un toggle pentru server local.
5. Interoghează-l prin API. Ollama expune un endpoint compatibil OpenAI pe portul 11434, deci codul existent funcționează cu o schimbare de o linie a base-URL:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:12b",
"messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
}'Odată ce-l ai rulând în CLI, probabil vei vrea o interfață reală. Poți să-l împachetezi într-o interfață stil ChatGPT cu Open WebUI în cam cinci minute. Nou în toate astea? Începe cu ghidul nostru complet de configurare LLM local. Pentru recomandările oficiale de sampling și căile de rulare, vezi ai.google.dev și documentația Ollama.
Ce cuantizare ar trebui să folosești pentru Gemma 4 12B?
Pentru majoritatea, Q4_K_M e default-ul sensibil: aproximativ 6,6 GB de VRAM, calitate aproape completă și încape pe un GPU de 8GB. Dacă ai 16GB sau mai mult și vrei fidelitate maximă, treci la Q8. Și dacă vrei cel mai bun raport calitate-per-gigabyte disponibil acum, uită-te la noile checkpoint-uri QAT Q4_0.
Iată unghiul de prospețime pe care nimeni nu l-a integrat încă. Pe 5 iunie 2026, la doar două zile după lansare, Google a lansat checkpoint-uri QAT Q4_0 (Quantization-Aware-Training) alături de un nou format mobil. QAT înseamnă că modelul a fost antrenat cu cuantizarea în minte, deci menține calitate aproape-FP (aproape-precizie-completă) la o amprentă Q4. Același ~6,6 GB, pierdere de acuratețe vizibil mai mică decât Q4-ul standard post-antrenare. Dacă ești limitat de VRAM dar sensibil la calitate, asta e alegerea ta.
Ghid rapid de decizie:
- Placă de 8GB, vrei simplitate: Q4_K_M.
- Placă de 8GB, vrei cea mai bună calitate la acea dimensiune: QAT Q4_0.
- Placă de 16GB+, vrei fidelitate maximă: Q8.
- Între ele, puțin VRAM în plus: Q5_K_M.
Poți citi raționamentul Google în anunțul lor QAT. Concluzia: Q4_K_M e în regulă, QAT Q4_0 e mai bun la aceeași dimensiune, și ai nevoie de Q8 doar dacă acuratețea contează mai mult decât memoria.
Gemma 4 12B vs Gemma 3 12B vs Qwen 3.5: merită upgrade-ul?
Da, upgrade-ul de la Gemma 3 12B merită dacă te interesează licența Apache 2.0, intrarea audio nativă, fereastra de context de 256K sau saltul pe MMLU Pro. Față de Qwen 3.5, e mai strâns. Gemma 4 12B câștigă la permisivitatea licenței și audio nativ, dar Qwen 3.5 ia câteva rânduri de benchmark din clasa 12B. Alege pe baza nevoilor tale reale, nu a titlului.
| Caracteristică | Gemma 4 12B | Gemma 3 12B | Qwen 3.5 (clasa 12B) |
|---|---|---|---|
| Licență | Apache 2.0 | Licență Gemma personalizată | Apache 2.0 |
| Context | 256K | 128K | Până la 256K |
| Modalități | Text + imagine + audio | Text + imagine | Text + imagine |
| Audio nativ | Da | Nu | Nu |
| MMLU Pro | 77,2% | Mai scăzut | Competitiv, câștigă câteva rânduri |
| VRAM Q4 | ~6,6 GB | ~6,6 GB | ~6,6 GB |
Doar schimbarea de licență justifică trecerea de la Gemma 3 12B pentru multe echipe. Gemma 3 a venit sub licența personalizată Google cu restricții de utilizare; Gemma 4 e direct Apache 2.0. Dacă amânai Gemma din motive comerciale, blocajul ăla a dispărut.
Față de Qwen 3.5, fii sincer cu tine. Qwen 3.5 e genuinely puternic și depășește Gemma 4 12B pe anumite rânduri de raționament și codare. Dacă intrarea audio și o licență permisivă nu sunt pe lista ta, testează ambele pe task-ul tău înainte să te decizi. Vezi unde se plasează Gemma 4 12B printre cele mai bune modele open pentru peisajul mai larg. Și fiindcă e Apache 2.0, poți să-l fine-tune sub Apache 2.0 cu Unsloth fără bătăi de cap de licență.
Când să NU folosești Gemma 4 12B
Sari peste Gemma 4 12B dacă ai nevoie de raționament de nivel frontier pe care doar un model mult mai mare îl livrează, dacă Qwen 3.5 câștigă rândul specific de benchmark de care depinde workload-ul tău, sau dacă proiectul tău se bazează mult pe tooling audio care încă se maturează la trei zile după lansare. E un model de 12B excelent, nu unul magic.
Gemma 4 12B nu e întotdeauna alegerea potrivită. Dacă ai nevoie de raționament de nivel frontier, un model mai mare încă câștigă. Suportul audio nativ e real și impresionant, dar tooling-ul din jur, bibliotecile, utilitarele ajutătoare, integrările de framework, au câteva zile și sunt aspre pe alocuri. Dacă livrezi un produs audio-heavy săptămâna asta, testează temeinic înainte să pariezi pe el.
Câteva descalificări oneste în plus. Dacă îl conectezi într-un agent, confirmă fiabilitatea tool-calling pe task-urile tale mai întâi, fiindcă comportamentul agentic variază de la model la model. Dacă avantajul tău e contextul lung, asigură-te că profite la maximum de fereastra de context de 256K în loc să presupui că dimensiunea brută a ferestrei înseamnă output mai bun. Și dacă treci de rulările locale la servire în producție, calea de servire în producție dincolo de local acoperă vLLM și SGLang. Dacă implementezi modele open ca Gemma 4 12B în producție, te putem ajuta.
Despre autor
Mert Batur Gurbuz este Co-Fondator al Techsy.io, unde echipa livrează agenți AI, sisteme de automatizare și pipeline-uri voice/SDR pentru clienți B2B. Studiază la University of Birmingham și scrie despre stack-ul de tooling LLM pe care echipa Techsy îl folosește efectiv în producție. Conectează-te pe LinkedIn.
Alegerea unui instrument e jumătatea ușoară. Să-l faci să ruleze fiabil într-un produs real e locul unde majoritatea echipelor se blochează, și exact asta construiește echipa noastră de integrare AI pentru clienți, de la pipeline-uri RAG la agenți personalizați.
Întrebări frecvente
Cum rulez Gemma 4 12B local?
Instalează Ollama, apoi rulează ollama run gemma4:12b. Asta descarcă modelul de 7,6 GB și deschide un prompt de chat. Fără mediu Python sau fișiere de configurare. Dacă vrei o aplicație grafică în schimb, LM Studio funcționează și el: caută gemma 4 12b în browserul de modele și descarcă un build Q4_K_M.
Care sunt cerințele de VRAM și hardware pentru Gemma 4 12B?
Gemma 4 12B are nevoie de aproximativ 6,6 GB de VRAM la cuantizarea Q4_K_M, deci încape pe un GPU de 8GB. Pentru marjă confortabilă, mai ales când folosești contextul lung, țintește spre 16GB de VRAM sau memorie unificată. Rulează pe laptopuri, inclusiv Mac-uri cu M-series prin memoria unificată.
Poate Gemma 4 12B rula pe un laptop de 16GB?
Da, ușor. La Q4_K_M modelul folosește aproximativ 6,6 GB, lăsând loc berechet pe o mașină de 16GB. Pe laptopurile Apple Silicon, memoria unificată îl gestionează bine prin build-ul gemma4:12b-mlx. Poți chiar să treci la cuantizarea Q8 pe 16GB pentru fidelitate mai mare.
E Gemma 4 12B chiar mai bun decât Llama sau Qwen 3.5?
Depinde ce măsori. Gemma 4 12B câștigă la licența Apache 2.0, intrarea audio nativă și fereastra de context de 256K, și postează un 77,2% solid pe MMLU Pro. Dar Qwen 3.5 ia câteva rânduri de raționament și codare din clasa 12B. Testează ambele pe task-ul tău înainte să decizi.
E Gemma 4 12B mai bun decât Gemma 3 12B?
Da. Gemma 4 12B trece la licența permisivă Apache 2.0, adaugă intrare audio nativă, dublează fereastra de context la 256K tokeni și postează o îmbunătățire semnificativă pe MMLU Pro. Doar schimbarea de licență justifică upgrade-ul pentru proiectele comerciale care erau blocate de termenii personalizați ai Gemma 3.
Ce cuantizare ar trebui să folosesc pentru Gemma 4 12B?
Q4_K_M e default-ul sensibil la aproximativ 6,6 GB cu calitate aproape completă. Dacă vrei cea mai bună calitate la aceeași dimensiune, folosește noile checkpoint-uri QAT Q4_0 lansate pe 5 iunie 2026, care mențin calitate aproape-precizie-completă la o amprentă Q4. Folosește Q8 doar dacă ai 16GB+ și ai nevoie de fidelitate maximă.
E Gemma 4 12B gratuit pentru utilizare comercială?
Da. Gemma 4 12B vine sub licența Apache 2.0, care permite utilizarea comercială fără restricțiile de utilizare ale licenței Gemma personalizate din Gemma 3. Poți construi produse comerciale, să-l fine-tune și să-l redistribui. Schimbarea de licență e unul dintre cele mai mari motive pentru care echipele fac upgrade de la Gemma 3.
Chiar suportă Gemma 4 12B intrare audio?
Da. Gemma 4 12B e primul Gemma de dimensiune medie cu intrare audio nativă. Datorită designului său fără encoder, formele de undă audio brute se proiectează direct în model, fără encoder audio separat. Asta spus, tooling-ul din jur are câteva zile, deci testează cu atenție înainte să livrezi funcționalități audio-heavy în producție.
Cât de rapid e Gemma 4 12B pe un RTX 4090?
Rapoartele publicate de terți plasează Gemma 4 12B la Q4_K_M confortabil în teritoriul chat-ului în timp real pe un RTX 4090 de 24GB, deși o cifră precisă de tokeni/sec susținut nu e încă publicată la trei zile după lansare. Viteza variază cu lungimea promptului, dimensiunea contextului și versiunea backendului, deci tratează cifrele timpurii ca orientative.
De unde descarc Gemma 4 12B?
Modelul instruction-tuned se află pe HuggingFace ca google/gemma-4-12B-it, sau îl poți descărca prin Ollama cu ollama run gemma4:12b (o descărcare de 7,6 GB). Utilizatorii LM Studio pot căuta gemma 4 12b în browserul de modele al aplicației. Pentru cuantizări specifice, fișierele GGUF sunt disponibile din repo-uri comunitare ca Unsloth.