
Gemma 4 12B: Benchmarks, VRAM-krav og sådan kører du den lokalt
Google DeepMind sendte Gemma 4 12B på gaden 3. juni 2026. Tre dage senere er det tal, alle gentager, MMLU Pro-scoren: 77,2 %. Det slår sidste års Gemma 3 27B, som nåede 67,6 % på samme test. En 12-milliarder-parameter-model, der scorer højere end en 27B-flagship? Til mindre end halvdelen af hukommelsen? Ja. Og licensen er også ændret. Gemma 4 leveres under Apache 2.0, så kommerciel brug er helt fint, ingen asterisker. Den har et kontekstvindue på 256K tokens og kører i cirka 6,6 GB VRAM, når du kvantiserer den. Den sidste del er hele historien for de fleste af os: Den her model får plads på et mellemklasse-GPU.
Nøglepointer
- Gemma 4 12B (udgivet 3. juni 2026) scorer 77,2 % på MMLU Pro og slår sidste års Gemma 3 27B (67,6 %).
- Den kører i ~6,6 GB VRAM ved Q4_K_M og får plads på et 8GB-GPU; ~16 GB giver god luft.
- Apache 2.0-licens (kommerciel brug OK), 256K kontekst, native lyd- + billedinput, encoder-fri arkitektur.
- Én kommando for at køre den:
ollama run gemma4:12b(7,6 GB download).
Hvad er Gemma 4 12B?
Gemma 4 12B er en 12-milliarder-parameter open-weights-model fra Google DeepMind, udgivet 3. juni 2026 under en Apache 2.0-licens. Det er en encoder-fri, samlet multimodal model: Tekst, billede og native lyd ind, tekst ud. Den har et kontekstvindue på 256K tokens og understøtter 140 sprog.
Den instruction-tuned variant, du rent faktisk kører, hedder gemma-4-12B-it ("it" står for instruction-tuned, altså den chat-klare version). Den har 11,95B parametre i alt, så "12B" er en lille afrunding opad. Træningsdataene går til januar 2025.
Her er det, der gør den interessant: Gemma 4 12B er den første mellemstore Gemma med native lydinput. Der er ingen separat lyd-encoder boltet på. Rå bølgeformer projiceres direkte ind i modellen. Det samme gælder billeder. Det designvalg er grunden til, at den forbliver lille nok til at køre på et enkelt forbruger-grafikkort, og vi kommer til hvorfor om lidt.
Vil du have det store billede først? Vores guide til at køre åbne modeller på din egen maskine dækker opsætningsbasics, hvis du er ny inden for lokale LLM'er. Googles officielle lanceringsindlæg har den fulde annoncering.
Gemma 4 12B-specs i overblik
Alt verificeret, i én tabel. Ingen gæt.
| Spec | Værdi |
|---|---|
| Fuldt navn | Gemma 4 12B (gemma-4-12B-it) |
| Parametre | 11,95B (~12B) |
| Licens | Apache 2.0 (kommerciel brug OK) |
| Kontekstvindue | 256K tokens |
| Modaliteter | Tekst + billede + native lyd ind, tekst ud |
| Arkitektur | Encoder-fri samlet, 48 lag, hybrid attention |
| Sprog | 140 |
| Træningsafslutning | Januar 2025 |
| Ollama-tag | gemma4:12b (7,6 GB download) |
| Apple Silicon-tag | gemma4:12b-mlx |
| Anbefalet sampling | temperature 1,0, top_p 0,95, top_k 64 |
En note om sampling: Hold dig til de anbefalede temperature=1.0, top_p=0.95, top_k=64, medmindre du har en grund til andet. Gemma-modeller opfører sig mærkeligt ved lave temperaturer, så sænk den ikke refleksivt til 0,2, som du måske ville med andre modeller.
Hvordan virker den encoder-fri arkitektur?
Encoder-fri betyder, at der ikke er en separat model, der konverterer billeder eller lyd, før de når sprogmodellen. Syns-patches og rå lydbølgeformer projiceres direkte ind i det delte embedding-rum gennem tynde lineære lag. De fleste multimodale modeller bolter en tung syns-encoder på LLM'en. Gemma 4 12B springer det over, og det er derfor, den får plads i 16 GB.
Tænk på det som en oversætter versus en tosproget person. Den gamle tilgang hyrer en separat oversætter (encoderen) til at konvertere billeder til et sprog, modellen forstår, og afleverer så resultatet. Gemma 4 12B er tosproget fra fødslen. Lyd- og billeddata taler modellens modersmål direkte gennem et letvægts-projektionslag i stedet for en tung encoder.
Under hjelmen er det 48 lag med hybrid attention. De fleste lag bruger et 1024-token glidende vindue (billigt, lokalt), afbrudt af lejlighedsvise global-attention-lag, der ser hele konteksten. Den blanding er sådan, den håndterer en 256K-kontekst uden at smelte dit GPU.

Den praktiske gevinst: Færre parametre brugt på encodere betyder, at mere af dit VRAM-budget går til den faktiske ræsonnering. Det er den handel, der lader en 12B-model slå så langt over sin vægtklasse.
Gemma 4 12B-benchmarks: De reelle tal
Overskriften holder: Gemma 4 12B scorer 77,2 % på MMLU Pro, slår Gemma 3 27B's 67,6 % på samme test, til mindre end halvdelen af VRAM. Det er officielle instruction-tuned (-it)-tal fra Google, ikke community-estimater. Her er det fulde sæt.
| Benchmark | Gemma 4 12B | Gemma 3 27B (reference) |
|---|---|---|
| MMLU Pro | 77,2 % | 67,6 % |
| GPQA Diamond | 78,8 % | , |
| MMMU Pro | 69,1 % | , |
| AIME 2026 (uden værktøjer) | 77,5 % | , |
| LiveCodeBench v6 | 72,0 % | , |
| Codeforces ELO | 1659 | , |
En 12B-model slår nu sidste års 27B-flagship på MMLU Pro: 77,2 % mod 67,6 %. Det er den slags generationsspring, der får dig til at genberegne dit hardware-regnestykke.

To ærlige forbehold. For det første betyder stregerne, at Google ikke publicerede et Gemma 3 27B-tal for de rækker, så cellerne forbliver tomme frem for at blive fyldt med gæt. For det andet er alle scorer her den instruction-tuned model. Basemodel-tallene er anderledes. Du kan krydstjekke det hele på HuggingFace-modelkortet og DeepMind-modelsiden.
Hvor meget VRAM kræver Gemma 4 12B?
Gemma 4 12B kræver cirka 6,6 GB VRAM ved Q4_K_M-kvantisering, hvilket betyder, at den får plads på et 8GB-GPU. For god luft, især hvis du vil bruge en del af det 256K kontekstvindue, så sigt efter 16 GB VRAM eller unified memory. Den kører på en laptop. M-series Macs håndterer den fint gennem unified memory.
Kvantisering er bare komprimering af modelvægte. Lavere præcisionstal, mindre fil, lidt mindre nøjagtighed. Sådan fordeler de gængse niveauer sig.
| Kvantisering | Ca. VRAM | Kvalitet | Bedst til |
|---|---|---|---|
| Q4_K_M | ~6,6 GB | Næsten fuld, minimalt tab | Det fornuftige standardvalg; passer til 8GB-kort |
| Q5_K_M | ~8,5 GB | Lidt bedre end Q4 | Lidt ekstra VRAM, vil have mere nøjagtighed |
| Q8 | ~13 GB | Effektivt fuld kvalitet | 16GB+-kort, maksimal fidelitet |
| QAT Q4_0 | ~6,6 GB | Næsten FP ved Q4-fodaftryk | Bedste kvalitet pr. GB (udgivet 5. juni) |

Hvis du vælger hardware omkring den her model, dækker vores roundup af de lokale LLM-værktøjer, vi har benchmarket, hvilke backends der presser mest ud af et givent kort. Den korte version: Et 12GB-kort kører Q4 med luft tilovers, et 8GB-kort kører Q4, hvis du holder konteksten beskeden.
Gemma 4 12B-hastighed: Tokens/sek. på tværs af reelt hardware
Hvor hurtigt er det? Det afhænger af dit kort, din kvantisering og din backend, så i stedet for ét tal har vi samlet de publicerede tredjepartstal ét sted. De er rapporteret af community-testere og leverandører, tilskrevet hver kilde. Det er ikke vores egne lab-tal.
| Hardware | Kvantisering | Rapporterede tokens/sek. | Kilde |
|---|---|---|---|
| RTX 3060 (6GB) | Q4_K_M | ~6,6 GB VRAM-fodaftryk, kører lokalt (tok/s ikke præcist rapporteret) | runaiathome |
| RTX 4090 (24GB) | Q4_K_M | Realtidschat-niveau (specifik tok/s endnu ikke rapporteret) | apxml / community |
| Apple M-serien (unified) | mlx / Q4 | Kører via gemma4:12b-mlx (tok/s endnu ikke bredt rapporteret) | Ollama / community |
Jeg er ærlig om, hvad de offentlige data faktisk siger lige nu. runaiathome bekræftede, at modellen kører på et 6GB RTX 3060 inden for sit ~6,6 GB Q4_K_M-fodaftryk, hvilket er den mest konkrete publicerede hardwarerapport indtil videre. apxmls spec-ark og Ollama-bibliotekssiden bekræfter, at modellen server lokalt på et 24GB RTX 4090 ved Q4, komfortabelt i realtidschat-territorie, men et præcist vedvarende tok/s-tal er endnu ikke publiceret for det kort. Apple Silicon gemma4:12b-mlx-varianten findes og kører, men pålidelige tok/s-tal er ikke dukket op tre dage efter lancering.
Hvad det betyder for dig, efter niveau: På et 6GB-kort som RTX 3060 kan du forvente, at den loader og kører til lokal chat, bare hold dit kontekstvindue beskedent. På et 24GB RTX 4090 ved Q4_K_M placerer publicerede rapporter den komfortabelt i realtidschat-territorie. På Apple Silicon kører MLX-buildet, men benchmark-tal siver stadig ind.
Det er publicerede tredjepartstal, ikke vores egne lab-tal, så behandl dem som omtrentlige. Dine tok/s afhænger af promptlængde, kontekststørrelse og backend-version. Kilder: Ollama-bibliotekssiden, apxml og runaiathome. Efterhånden som flere community-benchmarks lander over de næste to uger, opdaterer vi den her tabel.
Hvordan kører du Gemma 4 12B lokalt?
Den korteste vej: Installér Ollama, kør én kommando, færdig. ollama run gemma4:12b henter den 7,6 GB store model og smider dig ind i en chat-prompt. Ingen konfigurationsfiler, intet Python-miljø. Vil du have mere kontrol, eller er du på Apple Silicon, er der fire andre veje nedenfor.
1. Ollama (det nemme standardvalg). Hent og kør på to linjer:
ollama pull gemma4:12b
ollama run gemma4:12b2. llama.cpp med en GGUF. Vil du have en specifik kvantisering, så peg llama.cpp mod en GGUF på HuggingFace. GGUF er det filformat, llama.cpp bruger til kvantiserede vægte:
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."3. MLX på Apple Silicon. M-series Macs får et dedikeret MLX-build, der bruger Apples framework i stedet for CUDA:
ollama run gemma4:12b-mlx4. LM Studio (GUI, ingen terminal). Foretrækker du en desktop-app? Åbn LM Studio, gå til søgefanen og skriv gemma 4 12b. Vælg en Q4_K_M GGUF og download. LM Studio klarer resten, inklusive en lokal server-kontakt.
5. Forespørg via API'et. Ollama eksponerer et OpenAI-kompatibelt endpoint på port 11434, så eksisterende kode virker med et én-linjes base-URL-skift:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:12b",
"messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
}'Når du har den kørende på CLI'en, vil du sikkert have en rigtig grænseflade. Du kan pakke den ind i en ChatGPT-lignende UI med Open WebUI på cirka fem minutter. Ny i det hele? Start med vores fulde lokale LLM-opsætningsguide. For de officielle sampling-anbefalinger og kørselsveje, se ai.google.dev og Ollama-dokumentationen.
Hvilken kvantisering skal du bruge til Gemma 4 12B?
For de fleste er Q4_K_M det fornuftige standardvalg: Cirka 6,6 GB VRAM, næsten fuld kvalitet, og den får plads på et 8GB-GPU. Har du 16 GB eller mere og vil have maksimal fidelitet, så gå op til Q8. Og vil du have den bedste kvalitet pr. gigabyte tilgængelig lige nu, så kig på de nye QAT Q4_0-checkpoints.
Her er friskheds-vinklen, ingen har foldet ind endnu. Den 5. juni 2026, bare to dage efter lanceringen, udgav Google Quantization-Aware-Training (QAT) Q4_0-checkpoints sammen med et nyt mobilformat. QAT betyder, at modellen er trænet med kvantisering i tankerne, så den holder næsten-FP (næsten-fuld-præcision) kvalitet ved et Q4-fodaftryk. Samme ~6,6 GB, mærkbart mindre nøjagtighedstab end standard post-training Q4. Er du VRAM-begrænset men kvalitetsfølsom, er det dit valg.
Hurtig beslutningsguide:
- 8GB-kort, vil have det simpelt: Q4_K_M.
- 8GB-kort, vil have bedste kvalitet i den størrelse: QAT Q4_0.
- 16GB+-kort, vil have maksimal fidelitet: Q8.
- Midt imellem, lidt ekstra VRAM: Q5_K_M.
Du kan læse Googles begrundelse i deres QAT-annoncering. Konklusionen: Q4_K_M er fint, QAT Q4_0 er bedre i samme størrelse, og du har kun brug for Q8, hvis nøjagtighed betyder mere end hukommelse.
Gemma 4 12B vs Gemma 3 12B vs Qwen 3.5: Er opgraderingen det værd?
Ja, opgraderingen fra Gemma 3 12B er det værd, hvis du går op i Apache 2.0-licensen, native lydinput, 256K-kontekstvinduet eller MMLU Pro-springet. Mod Qwen 3.5 er det tættere. Gemma 4 12B vinder på licenstilladelser og native lyd, men Qwen 3.5 tager nogle 12B-klasse benchmark-rækker. Vælg ud fra dine faktiske behov, ikke overskriften.
| Funktion | Gemma 4 12B | Gemma 3 12B | Qwen 3.5 (12B-klasse) |
|---|---|---|---|
| Licens | Apache 2.0 | Brugerdefineret Gemma-licens | Apache 2.0 |
| Kontekst | 256K | 128K | Op til 256K |
| Modaliteter | Tekst + billede + lyd | Tekst + billede | Tekst + billede |
| Native lyd | Ja | Nej | Nej |
| MMLU Pro | 77,2 % | Lavere | Konkurrencedygtig, vinder nogle rækker |
| Q4 VRAM | ~6,6 GB | ~6,6 GB | ~6,6 GB |
Licensændringen alene retfærdiggør skiftet væk fra Gemma 3 12B for mange teams. Gemma 3 leveredes under Googles brugerdefinerede licens med brugsbegrænsninger; Gemma 4 er ren Apache 2.0. Hvis du holdt dig fra Gemma af kommercielle årsager, er den blokering væk.
Mod Qwen 3.5: Vær ærlig over for dig selv. Qwen 3.5 er genuint stærk og slår Gemma 4 12B på visse ræsonnerings- og kodningsrækker. Hvis lydinput og en tilladende licens ikke står på din liste, så benchmark begge på din egen opgave, før du binder dig. Se hvor Gemma 4 12B placerer sig blandt de bedste åbne modeller for det bredere felt. Og siden det er Apache 2.0, kan du fine-tune den under Apache 2.0 med Unsloth uden licenshovedpiner.
Hvornår du IKKE skal bruge Gemma 4 12B
Spring Gemma 4 12B over, hvis du har brug for frontier-niveau ræsonnering, som kun en meget større model leverer, hvis Qwen 3.5 vinder den specifikke benchmark-række, din arbejdsbyrde afhænger af, eller hvis dit projekt læner sig tungt op ad lydværktøjer, der stadig modnes tre dage efter lancering. Det er en fremragende 12B-model, ikke en magisk en.
Gemma 4 12B er ikke altid det rigtige valg. Hvis du har brug for frontier-niveau ræsonnering, vinder en større model stadig. Den native lydunderstøttelse er reel og imponerende, men det omgivende værktøj, biblioteker, hjælpeprogrammer, framework-integrationer, er dage gammelt og ujævnt nogle steder. Shipper du et lyd-tungt produkt i denne uge, så test grundigt, før du satser på det.
Et par ærlige diskvalifikationer mere. Hvis du kobler den til en agent, så bekræft tool-calling-pålideligheden på dine opgaver først, da agentisk adfærd varierer efter model. Hvis din fordel er den lange kontekst, så sørg for at udnytte 256K-kontekstvinduet fuldt ud i stedet for at antage, at rå vinduesstørrelse lig bedre output. Og hvis du bevæger dig forbi lokale kørsler til produktionsservering, dækker produktions-serveringsvejen ud over lokalt vLLM og SGLang. Deployer du åbne modeller som Gemma 4 12B i produktion, kan vi hjælpe.
Om forfatteren
Mert Batur Gurbuz er medstifter af Techsy.io, hvor teamet leverer AI-agenter, automatiseringssystemer og voice/SDR-pipelines til B2B-kunder. Han studerer på University of Birmingham og skriver om det LLM-værktøjsstack, Techsy-teamet faktisk bruger i produktion. Forbind på LinkedIn.
At vælge et værktøj er den nemme halvdel. At få det til at køre pålideligt inde i et rigtigt produkt er der, de fleste teams går i stå, og det er præcis, hvad vores AI-integrationsteam bygger for kunder, fra RAG-pipelines til brugerdefinerede agenter.
Ofte stillede spørgsmål
Hvordan kører jeg Gemma 4 12B lokalt?
Installér Ollama og kør derefter ollama run gemma4:12b. Det henter den 7,6 GB store model og åbner en chat-prompt. Intet Python-miljø eller konfigurationsfiler nødvendige. Vil du have en grafisk app i stedet, virker LM Studio også: Søg efter gemma 4 12b i dens modelbrowser og download et Q4_K_M-build.
Hvad er VRAM- og hardwarekravene for Gemma 4 12B?
Gemma 4 12B kræver cirka 6,6 GB VRAM ved Q4_K_M-kvantisering, så den får plads på et 8GB-GPU. For god luft, især når du bruger den lange kontekst, så sigt efter 16 GB VRAM eller unified memory. Den kører på laptops, inklusive M-series Macs gennem unified memory.
Kan Gemma 4 12B køre på en 16GB-laptop?
Ja, nemt. Ved Q4_K_M bruger modellen cirka 6,6 GB, hvilket masser af plads på en 16GB-maskine. På Apple Silicon-laptops håndterer unified memory det fint gennem gemma4:12b-mlx-buildet. Du kan endda gå op til Q8-kvantisering på 16 GB for højere fidelitet.
Er Gemma 4 12B faktisk bedre end Llama eller Qwen 3.5?
Det afhænger af, hvad du måler. Gemma 4 12B vinder på Apache 2.0-licensen, native lydinput og et 256K-kontekstvindue, og den leverer en stærk 77,2 % på MMLU Pro. Men Qwen 3.5 tager nogle 12B-klasse ræsonnerings- og kodningsrækker. Benchmark begge på din egen opgave, før du beslutter dig.
Er Gemma 4 12B bedre end Gemma 3 12B?
Ja. Gemma 4 12B skifter til den tilladende Apache 2.0-licens, tilføjer native lydinput, fordobler kontekstvinduet til 256K tokens og leverer en meningsfuld MMLU Pro-forbedring. Licensændringen alene retfærdiggør opgraderingen for kommercielle projekter, der var blokeret af Gemma 3's brugerdefinerede vilkår.
Hvilken kvantisering skal jeg bruge til Gemma 4 12B?
Q4_K_M er det fornuftige standardvalg på cirka 6,6 GB med næsten fuld kvalitet. Vil du have den bedste kvalitet i samme størrelse, så brug de nye QAT Q4_0-checkpoints udgivet 5. juni 2026, som holder næsten-fuld-præcision kvalitet ved et Q4-fodaftryk. Brug kun Q8, hvis du har 16GB+ og har brug for maksimal fidelitet.
Er Gemma 4 12B gratis til kommerciel brug?
Ja. Gemma 4 12B leveres under Apache 2.0-licensen, som tillader kommerciel brug uden brugsbegrænsningerne i Gemma 3's brugerdefinerede Gemma-licens. Du kan bygge kommercielle produkter, fine-tune den og redistribuere den. Den licensændring er en af de største grunde til, at teams opgraderer fra Gemma 3.
Understøtter Gemma 4 12B virkelig lydinput?
Ja. Gemma 4 12B er den første mellemstore Gemma med native lydinput. Takket være dens encoder-fri design projiceres rå lydbølgeformer direkte ind i modellen uden separat lyd-encoder. Når det er sagt, er det omgivende værktøj dage gammelt, så test omhyggeligt, før du shipper lyd-tunge funktioner i produktion.
Hvor hurtig er Gemma 4 12B på et RTX 4090?
Publicerede tredjepartsrapporter placerer Gemma 4 12B ved Q4_K_M komfortabelt i realtidschat-territorie på et 24GB RTX 4090, selvom et præcist vedvarende tokens/sek.-tal endnu ikke er publiceret tre dage efter lancering. Hastigheden varierer med promptlængde, kontekststørrelse og backend-version, så behandl tidlige tal som omtrentlige.
Hvor downloader jeg Gemma 4 12B?
Den instruction-tuned model ligger på HuggingFace som google/gemma-4-12B-it, eller du kan hente den gennem Ollama med ollama run gemma4:12b (en 7,6 GB download). LM Studio-brugere kan søge efter gemma 4 12b i appens modelbrowser. For specifikke kvantiseringer er GGUF-filer tilgængelige fra community-repos som Unsloth.