
Google DeepMind lanceerde Gemma 4 12B op 3 juni 2026. Drie dagen later is het getal dat iedereen herhaalt de MMLU Pro-score: 77,2%. Dat verslaat de Gemma 3 27B van vorig jaar, die 67,6% haalde op dezelfde test. Een model met 12 miljard parameters dat een 27B-flagship overtreft? Bij minder dan de helft van het geheugen? Ja. En de licentie is ook veranderd. Gemma 4 valt onder Apache 2.0, commercieel gebruik is dus gewoon toegestaan, geen voorbehouden. Het heeft een contextvenster van 256K tokens en draait op ongeveer 6,6 GB VRAM na kwantisatie. Dat laatste is het hele verhaal voor de meesten: dit ding past op een mid-range GPU.
Belangrijkste punten
- Gemma 4 12B (uitgebracht op 3 juni 2026) scoort 77,2% op MMLU Pro, beter dan Gemma 3 27B (67,6%).
- Draait op ~6,6 GB VRAM bij Q4KM, past op een 8GB GPU; ~16GB geeft comfortabele ruimte.
- Apache 2.0-licentie (commercieel gebruik OK), 256K context, native audio- en beeldinvoer, encoder-free architectuur.
- Eén commando om het te starten:
ollama run gemma4:12b(7,6 GB download).
Wat is Gemma 4 12B?
Gemma 4 12B is een open-weights model met 12 miljard parameters van Google DeepMind, uitgebracht op 3 juni 2026 onder een Apache 2.0-licentie. Het is een encoder-free, unified multimodaal model: tekst, afbeeldingen en native audio gaan erin, tekst komt eruit. Het heeft een contextvenster van 256K tokens en ondersteunt 140 talen.
De instruction-tuned variant die je in de praktijk gebruikt heet gemma-4-12B-it (de "it" staat voor instruction-tuned, de chatklare versie). Het heeft in totaal 11,95 miljard parameters, dus "12B" is licht afgerond naar boven. De trainingsdata loopt tot een afkappunt in januari 2025.
Dit is het interessante deel: Gemma 4 12B is de eerste middelgrote Gemma met native audio-invoer. Er is geen aparte audio-encoder bij vastgeklonken. Ruwe golfvormen worden rechtstreeks in het model geprojecteerd. Hetzelfde geldt voor afbeeldingen. Die ontwerpkeuze is de reden dat het klein genoeg blijft om op één consumentenkaart te draaien, en we komen zo meteen op de reden daarvoor.
Wil je eerst het grotere plaatje? Onze gids over open modellen lokaal draaien behandelt de basis als je nieuw bent met lokale LLM's. Google's officiële aankondiging heeft de volledige details.
Gemma 4 12B: specificaties in één oogopslag
Alles geverifieerd, in één tabel. Geen giswerk.
| Specificatie | Waarde |
|---|---|
| Volledige naam | Gemma 4 12B (gemma-4-12B-it) |
| Parameters | 11,95B (~12B) |
| Licentie | Apache 2.0 (commercieel gebruik OK) |
| Contextvenster | 256K tokens |
| Modaliteiten | Tekst + afbeelding + native audio in, tekst uit |
| Architectuur | Encoder-free unified, 48 lagen, hybride attention |
| Talen | 140 |
| Trainingsafkappunt | Januari 2025 |
| Ollama-tag | gemma4:12b (7,6 GB download) |
| Apple Silicon-tag | gemma4:12b-mlx |
| Aanbevolen sampling | temperature 1.0, top_p 0.95, top_k 64 |
Een noot over sampling: hou je aan de aanbevolen temperature=1.0, top_p=0.95, top_k=64 tenzij je een goede reden hebt om af te wijken. Gemma-modellen gedragen zich vreemd bij lage temperaturen, dus zet die niet reflexmatig op 0.2 zoals je bij andere modellen misschien zou doen.
Hoe werkt de encoder-free architectuur?
Encoder-free betekent dat er geen apart model is dat afbeeldingen of audio verwerkt vóór ze de taalmodel bereiken. Visuele patches en ruwe audiogolfvormen worden via dunne lineaire lagen direct in de gedeelde embeddingsruimte geprojecteerd. De meeste multimodale modellen koppelen een zware vision encoder aan het LLM. Gemma 4 12B slaat dat over, en daarom past het in 16GB.
Vergelijk het met een tolk versus een tweetalig persoon. De oude aanpak huurt een aparte tolk in (de encoder) om afbeeldingen te vertalen naar een taal die het model begrijpt, en geeft dat vervolgens door. Gemma 4 12B is tweetalig van geboorte. Audio- en beelddata spreken de eigen taal van het model rechtstreeks, via een lichtgewicht projectielaag in plaats van een logge encoder.
Onder de motorkap zitten 48 lagen met hybride attention. De meeste lagen gebruiken een sliding window van 1024 tokens (goedkoop, lokaal), afgewisseld met globale attention-lagen die de hele context zien. Die mix is hoe het een contextvenster van 256K aankan zonder je GPU te smelten.

Het praktische voordeel: minder parameters voor encoders betekent dat meer van je VRAM-budget naar het eigenlijke redeneren gaat. Dat is de ruil die een 12B-model zo ver boven zijn gewichtsklasse laat stoten.
Gemma 4 12B benchmarks: de echte cijfers
De kop klopt: Gemma 4 12B scoort 77,2% op MMLU Pro, beter dan de 67,6% van Gemma 3 27B op dezelfde test, bij minder dan de helft van het VRAM. Dit zijn de officiële instruction-tuned (-it) cijfers van Google, geen schattingen van de community. Hier is de volledige set.
| Benchmark | Gemma 4 12B | Gemma 3 27B (referentie) |
|---|---|---|
| MMLU Pro | 77,2% | 67,6% |
| GPQA Diamond | 78,8% | — |
| MMMU Pro | 69,1% | — |
| AIME 2026 (zonder tools) | 77,5% | — |
| LiveCodeBench v6 | 72,0% | — |
| Codeforces ELO | 1659 | — |
Een 12B-model verslaat nu het 27B-flagship van vorig jaar op MMLU Pro: 77,2% vs 67,6%. Dat is het soort generatiesprong waarbij je je hardwarerekening heroverweegt.

Twee eerlijke kanttekeningen. Ten eerste: de streepjes betekenen dat Google geen Gemma 3 27B-cijfer heeft gepubliceerd voor die rijen, dus die cellen blijven leeg in plaats van gevuld met giswerk. Ten tweede: alle scores hier zijn van het instruction-tuned model. De basismodelcijfers wijken af. Je kunt dit alles narekenen op de HuggingFace-modelkaart en de DeepMind-modelpagina.
Hoeveel VRAM heeft Gemma 4 12B nodig?
Gemma 4 12B heeft ongeveer 6,6 GB VRAM nodig bij Q4KM-kwantisatie, wat betekent dat het op een 8GB GPU past. Voor comfortabele ruimte, zeker als je een flink deel van dat 256K-contextvenster wilt gebruiken, streef je naar 16GB VRAM of unified memory. Het draait op een laptop. M-series Macs doen het via unified memory prima.
Kwantisatie is gewoon compressie voor modelgewichten. Lagere precisie, kleiner bestand, iets minder nauwkeurigheid. Hier is hoe de gangbare niveaus zich verhouden.
| Kwantisatie | VRAM (circa) | Kwaliteit | Het beste voor |
|---|---|---|---|
| Q4_K_M | ~6,6 GB | Bijna volledig, minimaal verlies | De verstandige standaard; past op 8GB kaarten |
| Q5_K_M | ~8,5 GB | Iets beter dan Q4 | Wat extra VRAM beschikbaar, meer nauwkeurigheid gewenst |
| Q8 | ~13 GB | Effectief volledige kwaliteit | 16GB+ kaarten, maximale getrouwheid |
| QAT Q4_0 | ~6,6 GB | Bijna-FP bij Q4-voetafdruk | Beste kwaliteit per GB (uitgebracht op 5 juni) |

Als je hardware wilt kiezen op basis van dit model, behandelt onze vergelijking van lokale LLM-tools die we hebben doorgelicht welke backends het meeste uit een bepaalde kaart halen. De korte versie: een 12GB kaart draait Q4 met ruimte over, een 8GB kaart draait Q4 als je de context bescheiden houdt.
Gemma 4 12B snelheid: tokens/sec op echte hardware
Hoe snel is het? Dat hangt af van je kaart, je kwantisatie en je backend, dus in plaats van één getal hebben we de gepubliceerde cijfers van derden op één plek verzameld. Dit zijn gerapporteerde cijfers van community-testers en leveranciers, met attributie per bron. Het zijn geen eigen labmetingen.
| Hardware | Kwant | Gerapporteerde tokens/sec | Bron |
|---|---|---|---|
| RTX 3060 (6GB) | Q4_K_M | ~6,6 GB VRAM-voetafdruk, draait lokaal (tok/s niet precies gerapporteerd) | runaiathome |
| RTX 4090 (24GB) | Q4_K_M | Real-time-chat-bereik (specifiek tok/s nog niet gerapporteerd) | apxml / community |
| Apple M-series (unified) | mlx / Q4 | Draait via gemma4:12b-mlx (tok/s nog niet breed gerapporteerd) | Ollama / community |
Om eerlijk te zijn over wat de publieke data op dit moment werkelijk zegt: runaiathome bevestigde dat het model draait op een 6GB RTX 3060 binnen zijn ~6,6 GB Q4KM-voetafdruk — dat is het meest concrete gepubliceerde hardwarerapport tot nu toe. De specificatiesheet van apxml en de Ollama-bibliotheekpagina bevestigen dat het model lokaal draait op een 24GB RTX 4090 bij Q4, comfortabel in real-time-chat-territorium, maar een precies gemiddeld tok/s-cijfer is voor die kaart nog niet gepubliceerd. De Apple Silicon gemma4:12b-mlx-variant bestaat en draait, maar betrouwbare tok/s-cijfers zijn drie dagen na de lancering nog niet opgedoken.
Wat dit betekent per categorie: op een 6GB kaart zoals de RTX 3060 kun je het laden en gebruiken voor lokale chat, hou je contextvenster alleen bescheiden. Op een 24GB RTX 4090 bij Q4KM plaatsen gepubliceerde rapporten het comfortabel in real-time-chat-territorium. Op Apple Silicon draait de MLX-build, maar benchmarkcijfers zijn nog onderweg.
Dit zijn gepubliceerde cijfers van derden, geen eigen labmetingen — behandel ze als richtlijn. Je tok/s hangt af van promptlengte, contextgrootte en backend-versie. Bronnen: de Ollama-bibliotheekpagina, apxml en runaiathome. Zodra de komende twee weken meer community-benchmarks binnenkomen, werken we deze tabel bij.
Hoe draai je Gemma 4 12B lokaal?
De kortste weg: installeer Ollama, voer één commando uit, klaar. ollama run gemma4:12b haalt het model van 7,6 GB op en zet je in een chatprompt. Geen configuratiebestanden, geen Python-omgeving. Als je meer controle wilt of op Apple Silicon zit, zijn er hieronder vier andere manieren.
1. Ollama (de makkelijke standaard). Ophalen en starten in twee regels:
ollama pull gemma4:12b
ollama run gemma4:12b2. llama.cpp met een GGUF. Als je een specifieke kwantisatie wilt, wijs llama.cpp naar een GGUF op HuggingFace. GGUF is het bestandsformaat dat llama.cpp gebruikt voor gekwantiseerde gewichten:
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."3. MLX op Apple Silicon. M-series Macs krijgen een speciale MLX-build die Apple's framework gebruikt in plaats van CUDA:
ollama run gemma4:12b-mlx4. LM Studio (GUI, geen terminal). Liever een desktopapp? Open LM Studio, klik op het zoektabblad en typ gemma 4 12b. Kies een Q4KM GGUF en download. LM Studio regelt de rest, inclusief een lokale server-toggle.
5. Bevraag het via de API. Ollama biedt een OpenAI-compatibel endpoint op poort 11434, dus bestaande code werkt met één aanpassing van de basis-URL:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:12b",
"messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
}'Zodra je het op de CLI hebt draaien, wil je waarschijnlijk een fatsoenlijke interface. Je kunt het in een ChatGPT-achtige UI met Open WebUI zetten in zo'n vijf minuten. Nieuw hiermee? Begin met onze volledige installatiegids voor lokale LLM's. Voor de officiële sampling-aanbevelingen en manieren om het te draaien, zie ai.google.dev en de Ollama-documentatie.
Welke kwantisatie moet je gebruiken voor Gemma 4 12B?
Voor de meeste mensen is Q4KM de verstandige standaard: ongeveer 6,6 GB VRAM, bijna volledige kwaliteit en het past op een 8GB GPU. Als je 16GB of meer hebt en maximale getrouwheid wilt, stap dan over naar Q8. En als je op dit moment de beste kwaliteit per gigabyte wilt, kijk dan naar de nieuwe QAT Q4_0-checkpoints.
Hier is een verse hoek die nog nauwelijks is opgepikt. Op 5 juni 2026, slechts twee dagen na de lancering, bracht Google Quantization-Aware-Training (QAT) Q4_0-checkpoints uit samen met een nieuw mobiel formaat. QAT betekent dat het model is getraind met kwantisatie in gedachten, zodat het bijna-FP-kwaliteit (bijna volledige precisie) behoudt bij een Q4-voetafdruk. Hetzelfde ~6,6 GB, merkbaar minder nauwkeurigheidsverlies dan standaard post-training Q4. Als je VRAM-beperkt bent maar kwaliteitsgevoelig, is dat jouw keuze.
Snelle beslissingsgids:
- 8GB kaart, wil het simpel: Q4KM.
- 8GB kaart, beste kwaliteit op die grootte: QAT Q4_0.
- 16GB+ kaart, maximale getrouwheid: Q8.
- Daartussenin, wat extra VRAM beschikbaar: Q5KM.
Je kunt Google's redenering lezen in hun QAT-aankondiging. De conclusie: Q4KM is prima, QAT Q4_0 is beter op dezelfde grootte en Q8 heb je alleen nodig als nauwkeurigheid zwaarder weegt dan geheugen.
Gemma 4 12B vs Gemma 3 12B vs Qwen 3.5: is de upgrade de moeite waard?
Ja, de upgrade van Gemma 3 12B is de moeite waard als je om de Apache 2.0-licentie geeft, native audio-invoer, het 256K-contextvenster of de MMLU Pro-sprong. Vergeleken met Qwen 3.5 is het minder eenzijdig. Gemma 4 12B wint op licentie-permissiviteit en native audio, maar Qwen 3.5 wint sommige 12B-klasse benchmark-rijen. Kies op je werkelijke behoeften, niet op de kop.
| Kenmerk | Gemma 4 12B | Gemma 3 12B | Qwen 3.5 (12B-klasse) |
|---|---|---|---|
| Licentie | Apache 2.0 | Aangepaste Gemma-licentie | Apache 2.0 |
| Context | 256K | 128K | Tot 256K |
| Modaliteiten | Tekst + afbeelding + audio | Tekst + afbeelding | Tekst + afbeelding |
| Native audio | Ja | Nee | Nee |
| MMLU Pro | 77,2% | Lager | Competitief, wint sommige rijen |
| Q4 VRAM | ~6,6 GB | ~6,6 GB | ~6,6 GB |
De licentiewijziging alleen al rechtvaardigt de overstap van Gemma 3 12B voor veel teams. Gemma 3 werd geleverd onder Google's aangepaste licentie met gebruiksbeperkingen; Gemma 4 is gewoon Apache 2.0. Als je Gemma om commerciële redenen had laten liggen, is die blokkade verdwenen.
Vergeleken met Qwen 3.5: wees eerlijk met jezelf. Qwen 3.5 is echt sterk en haalt Gemma 4 12B in op bepaalde redeneer- en coderingsrijen. Als audio-invoer en een permissieve licentie niet op je lijstje staan, benchmark dan beide op je eigen taak voordat je kiest. Bekijk waar Gemma 4 12B staat tussen de beste open modellen voor het bredere veld. En omdat het Apache 2.0 is, kun je het fine-tunen onder Apache 2.0 met Unsloth zonder licentiegedoe.
Wanneer moet je Gemma 4 12B niet gebruiken?
Sla Gemma 4 12B over als je frontier-niveau redenering nodig hebt die alleen een veel groter model levert, als Qwen 3.5 de specifieke benchmark-rij wint waarvan jouw werkdruk afhankelijk is, of als je project zwaar leunt op audio-tooling die drie dagen na de lancering nog volop in ontwikkeling is. Het is een uitstekend 12B-model, geen tovermiddel.
Gemma 4 12B is niet altijd de juiste keuze. Als je frontier-niveau redenering nodig hebt, wint een groter model nog steeds. De native audio-ondersteuning is echt en indrukwekkend, maar de bijbehorende tooling — bibliotheken, hulpprogramma's, framework-integraties — is pas enkele dagen oud en op plekken ruw. Als je deze week een audio-zwaar product lanceert, test dan grondig voordat je erop vertrouwt.
Nog een paar eerlijke uitsluitingsgronden. Als je het in een agent wilt integreren, controleer dan eerst de betrouwbaarheid van tool-calling op jouw taken, want agentisch gedrag verschilt per model. Als je voordeel het lange contextvenster is, zorg er dan voor dat je de 256K tokens optimaal benut in plaats van ervan uit te gaan dat een groter venster automatisch betere uitvoer geeft. En als je van lokaal draaien overgaat op productie-serving, behandelt de productie-serving weg voorbij lokaal vLLM en SGLang. Zet je Gemma 4 12B in productie in? Wij helpen je graag verder.
Over de auteur
Mert Batur Gurbuz is medeoprichter van Techsy.io, waar het team AI-agents, automatiseringssystemen en voice/SDR-pipelines bouwt voor B2B-klanten. Hij studeert aan de University of Birmingham en schrijft over de LLM-toolingstack die het Techsy-team daadwerkelijk in productie gebruikt. Verbind op LinkedIn.
Een tool kiezen is het makkelijke deel. Hem betrouwbaar in een echt product laten draaien, daar lopen de meeste teams vast, en dat is precies wat ons AI-integratieteam voor klanten bouwt, van RAG-pipelines tot maatwerkagents.
Veelgestelde vragen
Hoe draai ik Gemma 4 12B lokaal?
Installeer Ollama en voer ollama run gemma4:12b uit. Dat haalt het model van 7,6 GB op en opent een chatprompt. Geen Python-omgeving of configuratiebestanden nodig. Als je liever een grafische app gebruikt, werkt LM Studio ook: zoek gemma 4 12b in de modelbrowser en download een Q4KM-build.
Wat zijn de VRAM- en hardwarevereisten voor Gemma 4 12B?
Gemma 4 12B heeft ongeveer 6,6 GB VRAM nodig bij Q4KM-kwantisatie, dus het past op een 8GB GPU. Voor comfortabele ruimte, zeker bij gebruik van de lange context, streef je naar 16GB VRAM of unified memory. Het draait op laptops, inclusief M-series Macs via unified memory.
Kan Gemma 4 12B draaien op een 16GB laptop?
Ja, makkelijk. Bij Q4KM gebruikt het model ongeveer 6,6 GB, wat ruimschoots past op een 16GB machine. Op Apple Silicon-laptops verwerkt het unified memory het prima via de gemma4:12b-mlx-build. Op 16GB kun je zelfs overstappen naar Q8-kwantisatie voor hogere getrouwheid.
Is Gemma 4 12B werkelijk beter dan Llama of Qwen 3.5?
Het hangt ervan af wat je meet. Gemma 4 12B wint op de Apache 2.0-licentie, native audio-invoer en een 256K-contextvenster, en haalt een sterke 77,2% op MMLU Pro. Maar Qwen 3.5 wint sommige 12B-klasse rijen voor redeneren en codering. Benchmark beide op je eigen taak voordat je beslist.
Is Gemma 4 12B beter dan Gemma 3 12B?
Ja. Gemma 4 12B stapt over op de permissieve Apache 2.0-licentie, voegt native audio-invoer toe, verdubbelt het contextvenster naar 256K tokens en boekt een duidelijke MMLU Pro-verbetering. De licentiewijziging alleen al rechtvaardigt de upgrade voor commerciële projecten die geblokkeerd waren door de aangepaste voorwaarden van Gemma 3.
Welke kwantisatie moet ik gebruiken voor Gemma 4 12B?
Q4KM is de verstandige standaard bij ongeveer 6,6 GB en bijna volledige kwaliteit. Als je de beste kwaliteit op diezelfde grootte wilt, gebruik dan de nieuwe QAT Q4_0-checkpoints die op 5 juni 2026 zijn uitgebracht, die bijna-volledige-precisie-kwaliteit bieden bij een Q4-voetafdruk. Gebruik Q8 alleen als je 16GB+ hebt en maximale getrouwheid nodig hebt.
Is Gemma 4 12B gratis voor commercieel gebruik?
Ja. Gemma 4 12B valt onder de Apache 2.0-licentie, die commercieel gebruik toestaat zonder de gebruiksbeperkingen van de aangepaste Gemma-licentie van Gemma 3. Je kunt er commerciële producten mee bouwen, het fine-tunen en herdistribueren. Die licentiewijziging is een van de grootste redenen waarom teams upgraden van Gemma 3.
Ondersteunt Gemma 4 12B werkelijk audio-invoer?
Ja. Gemma 4 12B is de eerste middelgrote Gemma met native audio-invoer. Dankzij het encoder-free ontwerp worden ruwe audiogolfvormen direct in het model geprojecteerd zonder aparte audio-encoder. Dat gezegd: de bijbehorende tooling is nog maar een paar dagen oud, test dus zorgvuldig voordat je audio-zware functies in productie neemt.
Hoe snel is Gemma 4 12B op een RTX 4090?
Gepubliceerde rapporten van derden plaatsen Gemma 4 12B bij Q4KM comfortabel in real-time-chat-territorium op een 24GB RTX 4090, maar een precies gemiddeld tokens/sec-cijfer is nog niet gepubliceerd drie dagen na de lancering. De snelheid varieert met promptlengte, contextgrootte en backend-versie, dus behandel vroege cijfers als richtlijn.
Waar download ik Gemma 4 12B?
Het instruction-tuned model staat op HuggingFace als google/gemma-4-12B-it, of je kunt het ophalen via Ollama met ollama run gemma4:12b (een download van 7,6 GB). LM Studio-gebruikers kunnen gemma 4 12b zoeken in de modelbrowser van de app. Voor specifieke kwantisaties zijn GGUF-bestanden beschikbaar via community-repos zoals Unsloth.