
Google DeepMind slapp Gemma 4 12B den 3. juni 2026. Tre dager senere er det én score alle snakker om: 77,2 % på MMLU Pro. Det er bedre enn fjorårets Gemma 3 27B, som landet på 67,6 % på samme test. En 12-milliarders-parametersmodell som slår en 27B-flaggskip? Med under halvparten av VRAM-bruken? Jo. Og lisensen er endret. Gemma 4 leveres under Apache 2.0, så kommersiell bruk er uproblematisk, uten forbehold. Modellen har et kontekstvindu på 256K tokens og kjører på omtrent 6,6 GB VRAM etter kvantisering. Det siste punktet er hele poenget for de fleste: dette passer på et mellomklasse GPU.
Viktigste punkter
- Gemma 4 12B (utgitt 3. juni 2026) scorer 77,2 % på MMLU Pro, bedre enn fjorårets Gemma 3 27B (67,6 %).
- Kjører på ~6,6 GB VRAM ved Q4KM, passer på et 8 GB GPU; ~16 GB gir god margin.
- Apache 2.0-lisens (kommersiell bruk OK), 256K kontekst, innebygd lyd- og bildeinput, encoder-fri arkitektur.
- Én kommando for å kjøre:
ollama run gemma4:12b(7,6 GB nedlasting).
Hva er Gemma 4 12B?
Gemma 4 12B er en åpen-vekt-modell med 12 milliarder parametere fra Google DeepMind, utgitt 3. juni 2026 under Apache 2.0-lisens. Det er en encoder-fri, unified multimodal modell: tekst, bilde og lyd inn, tekst ut. Den har et 256K-tokens kontekstvindu og støtter 140 språk.
Instruksjonsstyrt variant du faktisk vil kjøre heter gemma-4-12B-it (der "it" står for instruction-tuned, altså chat-klar versjon). Den har 11,95 milliarder parametere totalt, så "12B" er avrundet litt opp. Treningsdataene strekker seg til januar 2025.
Det som gjør den interessant: Gemma 4 12B er den første mellomstore Gemma-modellen med innebygd lydinput. Det er ikke lagt til en separat lydenkoder. Rå lydbølger projiseres rett inn i modellen. Samme med bilder. Det er det designvalget som holder den liten nok til å kjøre på ett forbrukerkort.
Vil du ha det store bildet først? Vår guide til å kjøre åpne modeller på egen maskin dekker det grunnleggende hvis du er ny til lokale LLM-er. Googles offisielle lansering har hele kunngjøringen.
Gemma 4 12B spesifikasjoner
Alt verifisert, samlet i én tabell.
| Spesifikasjon | Verdi |
|---|---|
| Fullt navn | Gemma 4 12B (gemma-4-12B-it) |
| Parametere | 11,95 mrd (~12B) |
| Lisens | Apache 2.0 (kommersiell bruk OK) |
| Kontekstvindu | 256K tokens |
| Modaliteter | Tekst + bilde + innebygd lyd inn, tekst ut |
| Arkitektur | Encoder-fri unified, 48 lag, hybrid attention |
| Språk | 140 |
| Treningsdata til | Januar 2025 |
| Ollama-tag | gemma4:12b (7,6 GB nedlasting) |
| Apple Silicon-tag | gemma4:12b-mlx |
| Anbefalt sampling | temperature 1,0, top_p 0,95, top_k 64 |
Et notat om sampling: hold deg til de anbefalte parameterne temperature=1.0, top_p=0.95, top_k=64 med mindre du har en god grunn til noe annet. Gemma-modeller oppfører seg rart ved lave temperaturer, så ikke fall for fristelsen til å sette den til 0,2 slik du kanskje gjør med andre modeller.
Hvordan fungerer den encoder-frie arkitekturen?
Encoder-fri betyr at det ikke finnes en separat modell som konverterer bilder eller lyd før de når språkmodellen. Visuelle bildedeler og rå lydbølger projiseres direkte inn i det delte embedding-rommet gjennom tynne lineære lag. De fleste multimodale modeller setter en tung visjonsenkoer oppå LLM-en. Gemma 4 12B hopper over det, og det er grunnen til at den passer i 16 GB.
Tenk på det som en tolk versus en tospråklig person. Den gamle tilnærmingen ansetter en separat tolk (enkoderen) til å oversette bilder til et språk modellen forstår, og så gir den det videre. Gemma 4 12B er tospråklig fra starten av. Lyd- og bildedata snakker modellens morsmål direkte, gjennom et lettere projeksjonslag i stedet for en tung enkoder.
Under panseret er det 48 lag med hybrid attention. De fleste lag bruker et 1024-token glidende vindu (billig, lokalt), flettet med innimellom globale attention-lag som ser hele konteksten. Den blandingen er det som lar den håndtere 256K kontekst uten å smelte GPU-en din.

Den praktiske fordelen: færre parametere brukt på enkodere betyr at mer av VRAM-budsjettet ditt går til faktisk resonnering. Det er den avveiingen som lar en 12B-modell prestere så langt over sin vektklasse.
Gemma 4 12B benchmarks: de reelle tallene
Overskriften holder: Gemma 4 12B scorer 77,2 % på MMLU Pro, bedre enn Gemma 3 27Bs 67,6 % på samme test, med under halvparten av VRAM. Dette er offisielle instruction-tuned (-it) tall fra Google, ikke fellesskapets estimater. Her er hele settet.
| Benchmark | Gemma 4 12B | Gemma 3 27B (referanse) |
|---|---|---|
| MMLU Pro | 77,2 % | 67,6 % |
| GPQA Diamond | 78,8 % | — |
| MMMU Pro | 69,1 % | — |
| AIME 2026 (uten verktøy) | 77,5 % | — |
| LiveCodeBench v6 | 72,0 % | — |
| Codeforces ELO | 1659 | — |
En 12B-modell slår nå fjorårets 27B-flaggskip på MMLU Pro: 77,2 % mot 67,6 %. Det er den typen generasjonshopp som gjør at du dobbeltsjekker maskinvarebudsjettet ditt.

To ærlige forbehold. For det første: strekene betyr at Google ikke publiserte Gemma 3 27B-tall for de radene, så cellene forblir tomme i stedet for å fylles med gjetninger. For det andre: alle scorene her er for instruction-tuned-modellen. Basismodellens tall er annerledes. Du kan krysssjekke alt dette på HuggingFace model card og DeepMind model page.
Hvor mye VRAM trenger Gemma 4 12B?
Gemma 4 12B trenger omtrent 6,6 GB VRAM ved Q4KM-kvantisering, noe som betyr at den passer på et 8 GB GPU. For god margin, særlig hvis du vil bruke mye av det 256K-lange kontekstvinduet, sikt mot 16 GB VRAM eller unified memory. Den kjører på bærbar PC. M-series Mac-er håndterer det fint via unified memory.
Kvantisering er i bunn og grunn komprimering av modellvekter. Lavere presisjon, mindre fil, litt lavere nøyaktighet. Her er en oversikt over de vanligste nivåene.
| Kvantisering | Omtrentlig VRAM | Kvalitet | Best for |
|---|---|---|---|
| Q4_K_M | ~6,6 GB | Nær full, svært lite tap | Det fornuftige standardvalget; passer 8 GB-kort |
| Q5_K_M | ~8,5 GB | Litt bedre enn Q4 | Litt ekstra VRAM og ønsker mer nøyaktighet |
| Q8 | ~13 GB | Effektivt full kvalitet | 16 GB+-kort, maksimal troskap |
| QAT Q4_0 | ~6,6 GB | Nær-FP ved Q4-fotavtrykk | Beste kvalitet per GB (utgitt 5. juni) |

Hvis du velger maskinvare rundt denne modellen, dekker vår gjennomgang av de lokale LLM-verktøyene vi har testet hvilke backends som får mest ut av et gitt kort. Kortversjonen: et 12 GB-kort kjører Q4 med god margin, et 8 GB-kort kjører Q4 hvis du holder konteksten beskjeden.
Gemma 4 12B hastighet: tokens/sek på ekte maskinvare
Hvor raskt er det? Det avhenger av kortet ditt, kvantiseringen og backenden, så i stedet for ett enkelt tall har vi samlet publiserte tredjepartstall på ett sted. Disse er rapportert av fellesskapsbrukere og leverandører, tilskrevet kilden. De er ikke egne laboratorietall.
| Maskinvare | Quant | Rapportert tokens/sek | Kilde |
|---|---|---|---|
| RTX 3060 (6 GB) | Q4_K_M | ~6,6 GB VRAM-fotavtrykk, kjører lokalt (tok/s ikke presist rapportert) | runaiathome |
| RTX 4090 (24 GB) | Q4_K_M | Sanntidschat-rekkevidde (spesifikk tok/s ikke rapportert ennå) | apxml / fellesskap |
| Apple M-series (unified) | mlx / Q4 | Kjører via gemma4:12b-mlx (tok/s ikke bredt rapportert ennå) | Ollama / fellesskap |
Her er hva de offentlige dataene faktisk sier akkurat nå. runaiathome bekreftet at modellen kjører på en 6 GB RTX 3060 innenfor sitt ~6,6 GB Q4KM-fotavtrykk, som er den mest konkrete publiserte maskinvarerapporten så langt. apxmls spesifikasjonsark og Ollama-bibliotekets side bekrefter at modellen serverer lokalt på en 24 GB RTX 4090 ved Q4, komfortabelt i sanntidschat-territoriet, men et presist vedvarende tok/s-tall er ikke publisert ennå for det kortet. Apple Silicon-varianten gemma4:12b-mlx eksisterer og kjører, men pålitelige tok/s-tall har ikke dukket opp tre dager etter lansering.
Hva det betyr for deg etter nivå: på et 6 GB-kort som RTX 3060 forventer du at den laster og kjører for lokal chat, men hold kontekstvinduet beskjeden. På en 24 GB RTX 4090 ved Q4KM plasserer publiserte rapporter den komfortabelt i sanntidschat-territoriet. På Apple Silicon kjører MLX-bygget, men benchmark-tall triller fremdeles inn.
Dette er publiserte tredjepartstall, ikke egne laboratorietall, så behandle dem som omtrentlige. Din tok/s avhenger av promptlengde, kontekststørrelse og backend-versjon. Kilder: Ollama-bibliotekets side, apxml og runaiathome. Etter hvert som flere felleskapsbenchmarks kommer inn de neste to ukene, oppdaterer vi denne tabellen.
Slik kjører du Gemma 4 12B lokalt
Den korteste veien: installer Ollama, kjør én kommando, ferdig. ollama run gemma4:12b laster ned den 7,6 GB store modellen og gir deg et chat-prompt. Ingen konfigurasjonsfiler, ikke noe Python-miljø. Vil du ha mer kontroll, eller er du på Apple Silicon, er det fire andre alternativer nedenfor.
1. Ollama (det enkle standardvalget). Last ned og kjør med to linjer:
ollama pull gemma4:12b
ollama run gemma4:12b2. llama.cpp med GGUF. Vil du ha en spesifikk kvantisering, peker du llama.cpp på en GGUF på HuggingFace. GGUF er filformatet llama.cpp bruker for kvantiserte vekter:
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."3. MLX på Apple Silicon. M-series Mac-er får et dedikert MLX-bygg som bruker Apples rammeverk i stedet for CUDA:
ollama run gemma4:12b-mlx4. LM Studio (GUI, uten terminal). Foretrekker du en skrivebordsapp? Åpne LM Studio, trykk på søkefanen og skriv gemma 4 12b. Velg en Q4KM GGUF og last ned. LM Studio tar seg av resten, inkludert en lokal server-toggle.
5. Spør via API. Ollama eksponerer et OpenAI-kompatibelt endepunkt på port 11434, så eksisterende kode fungerer med en enkel base-URL-bytting:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:12b",
"messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
}'Når du har det kjørende i terminalen, vil du sannsynligvis ha et ordentlig grensesnitt. Du kan pakke det inn i et ChatGPT-lignende UI med Open WebUI på omtrent fem minutter. Ny på alt dette? Start med vår fullstendige guide for lokal LLM-oppsett. For offisielle samplinganbefalinger og kjøreveier, se ai.google.dev og Ollama-dokumentasjonen.
Hvilken kvantisering bør du bruke for Gemma 4 12B?
For de fleste er Q4KM det fornuftige standardvalget: omtrent 6,6 GB VRAM, nær full kvalitet, og det passer på et 8 GB GPU. Har du 16 GB eller mer og vil ha maksimal troskap, gå opp til Q8. Og ønsker du best mulig kvalitet per gigabyte akkurat nå, se på de nye QAT Q4_0-sjekkpunktene.
Her er ferskhetsvinkelen ingen har fått med seg ennå. Den 5. juni 2026, bare to dager etter lansering, ga Google ut QAT Q4_0-sjekkpunkter (Quantization-Aware Training) ved siden av et nytt mobilformat. QAT betyr at modellen ble trent med kvantisering i tankene, slik at den beholder nær-FP-kvalitet (nær full presisjon) ved et Q4-fotavtrykk. Samme ~6,6 GB, men merkbart lavere nøyaktighetstap enn standard Q4 etter trening. Er du VRAM-begrenset men kvalitetsbevisst, er det det du bør velge.
Rask beslutningsveiledning:
- 8 GB-kort, vil ha enkelt: Q4KM.
- 8 GB-kort, vil ha best kvalitet på den størrelsen: QAT Q4_0.
- 16 GB+-kort, vil ha maksimal troskap: Q8.
- Imellom, litt ekstra VRAM: Q5KM.
Du kan lese Googles begrunnelse i deres QAT-kunngjøring. Konklusjonen: Q4KM er bra, QAT Q4_0 er bedre på samme størrelse, og du trenger bare Q8 hvis nøyaktighet betyr mer enn minne.
Gemma 4 12B vs Gemma 3 12B vs Qwen 3.5: Er oppgraderingen verdt det?
Ja, oppgraderingen fra Gemma 3 12B er verdt det hvis du bryr deg om Apache 2.0-lisensen, innebygd lydinput, 256K-kontekstvinduet eller MMLU Pro-fremgangen. Mot Qwen 3.5 er det tettere. Gemma 4 12B vinner på lisensfleksibilitet og innebygd lyd, men Qwen 3.5 tar noen 12B-klasse benchmark-rader. Velg basert på dine faktiske behov, ikke overskriften.
| Funksjon | Gemma 4 12B | Gemma 3 12B | Qwen 3.5 (12B-klasse) |
|---|---|---|---|
| Lisens | Apache 2.0 | Egendefinert Gemma-lisens | Apache 2.0 |
| Kontekst | 256K | 128K | Opptil 256K |
| Modaliteter | Tekst + bilde + lyd | Tekst + bilde | Tekst + bilde |
| Innebygd lyd | Ja | Nei | Nei |
| MMLU Pro | 77,2 % | Lavere | Konkurransedyktig, vinner noen rader |
| Q4 VRAM | ~6,6 GB | ~6,6 GB | ~6,6 GB |
Lisensendringen alene rettferdiggjør overgangen fra Gemma 3 12B for mange team. Gemma 3 ble levert under Googles egendefinerte lisens med bruksbegrensninger; Gemma 4 er ren Apache 2.0. Holdt du tilbake Gemma av kommersielle årsaker, er den hindringen borte.
Mot Qwen 3.5: vær ærlig med deg selv. Qwen 3.5 er genuint sterk og slår Gemma 4 12B på visse resonnerings- og kode-rader. Hvis lydinput og en åpen lisens ikke er på listen din, benchmark begge på din egen oppgave før du bestemmer deg. Se hvor Gemma 4 12B lander blant de beste åpne modellene for det større feltet. Og siden det er Apache 2.0, kan du finjustere det under Apache 2.0 med Unsloth uten lisensproblemer.
Når du IKKE bør bruke Gemma 4 12B
Hopp over Gemma 4 12B hvis du trenger resonnering på grense-nivå som bare en mye større modell leverer, hvis Qwen 3.5 vinner den spesifikke benchmark-raden arbeidsmengden din avhenger av, eller hvis prosjektet ditt er tungt avhengig av lydverktøy som fremdeles modnes tre dager etter lansering. Det er en utmerket 12B-modell, ikke en magisk en.
Gemma 4 12B er ikke alltid det rette valget. Trenger du resonnering på frontiernivå, vinner en større modell fremdeles. Den innebygde lydstøtten er reell og imponerende, men de omkringliggende verktøyene – biblioteker, hjelpefunksjoner, framework-integrasjoner – er bare noen dager gamle og uferdig på steder. Skal du sende et lydtungt produkt denne uken, test grundig før du satser på det.
Et par ærlige frarådinggrunner til. Kobler du det inn i en agent, verifiser verktøykallingens pålitelighet på dine oppgaver først, siden agentisk atferd varierer per modell. Er kontekstlengden kanten din, sørg for at du utnytter 256K-kontekstvinduet optimalt i stedet for å anta at råt vindusstrørrelse gir bedre output. Og beveger du deg forbi lokal kjøring til produksjonsserving, dekker produksjonsserving-veien vLLM og SGLang. Deployerer du åpne modeller som Gemma 4 12B i produksjon, kan vi hjelpe.
Om forfatteren
Mert Batur Gurbuz er medgründer av Techsy.io, der teamet bygger AI-agenter, automasjonssystemer og voice/SDR-pipelines for B2B-kunder. Han studerer ved University of Birmingham og skriver om LLM-verktøystakken Techsy-teamet faktisk bruker i produksjon. Koble til på LinkedIn.
Å velge verktøy er den enkle delen. Å få det til å kjøre stabilt i et ekte produkt er der de fleste team står fast, og det er akkurat det vårt AI-integrasjonsteam bygger for kundene, fra RAG-pipelines til skreddersydde agenter.
Ofte stilte spørsmål
Hvordan kjører jeg Gemma 4 12B lokalt?
Installer Ollama, kjør deretter ollama run gemma4:12b. Det laster ned den 7,6 GB store modellen og åpner et chat-prompt. Ingen Python-miljø eller konfigurasjonsfiler nødvendig. Foretrekker du en grafisk app, fungerer LM Studio også: søk etter gemma 4 12b i modellnettleseren og last ned en Q4KM-bygning.
Hva er VRAM- og maskinvarekravene for Gemma 4 12B?
Gemma 4 12B trenger omtrent 6,6 GB VRAM ved Q4KM-kvantisering, så det passer på et 8 GB GPU. For god margin, særlig ved bruk av lang kontekst, sikt mot 16 GB VRAM eller unified memory. Det kjører på bærbare PC-er, inkludert M-series Mac-er via unified memory.
Kan Gemma 4 12B kjøre på en 16 GB bærbar PC?
Ja, uten problemer. Ved Q4KM bruker modellen omtrent 6,6 GB, noe som gir god plass på en 16 GB-maskin. På Apple Silicon-bærbare håndterer unified memory det fint via gemma4:12b-mlx-bygget. Du kan til og med gå opp til Q8-kvantisering på 16 GB for høyere troskap.
Er Gemma 4 12B faktisk bedre enn Llama eller Qwen 3.5?
Det avhenger av hva du måler. Gemma 4 12B vinner på Apache 2.0-lisensen, innebygd lydinput og et 256K-kontekstvindu, og den poster et sterkt resultat på 77,2 % på MMLU Pro. Men Qwen 3.5 tar noen 12B-klasse resonerings- og kode-rader. Benchmark begge på din egen oppgave før du bestemmer deg.
Er Gemma 4 12B bedre enn Gemma 3 12B?
Ja. Gemma 4 12B gir den åpne Apache 2.0-lisensen, legger til innebygd lydinput, dobler kontekstvinduet til 256K tokens og viser en merkbar MMLU Pro-forbedring. Lisensendringen alene rettferdiggjør oppgradering for kommersielle prosjekter som var blokkert av Gemma 3s egendefinerte vilkår.
Hvilken kvantisering bør jeg bruke for Gemma 4 12B?
Q4KM er det fornuftige standardvalget på omtrent 6,6 GB med nær full kvalitet. Vil du ha best mulig kvalitet på samme størrelse, bruk de nye QAT Q4_0-sjekkpunktene utgitt 5. juni 2026, som beholder nær full presisjon ved et Q4-fotavtrykk. Bruk Q8 kun hvis du har 16 GB+ og trenger maksimal troskap.
Er Gemma 4 12B gratis for kommersiell bruk?
Ja. Gemma 4 12B leveres under Apache 2.0-lisensen, som tillater kommersiell bruk uten bruksbegrensningene i Gemma 3s egendefinerte Gemma-lisens. Du kan bygge kommersielle produkter, finjustere det og redistribuere det. Den lisensendringen er én av de største grunnene til at team oppgraderer fra Gemma 3.
Støtter Gemma 4 12B virkelig lydinput?
Ja. Gemma 4 12B er den første mellomstore Gemma med innebygd lydinput. Takket være det encoder-frie designet projiseres rå lydbølger direkte inn i modellen uten noen separat lydenkoder. Det er imidlertid verdt å merke seg at de omkringliggende verktøyene er bare noen dager gamle, så test grundig før du sender lydtunge funksjoner i produksjon.
Hvor rask er Gemma 4 12B på en RTX 4090?
Publiserte tredjepartsrapporter plasserer Gemma 4 12B ved Q4KM komfortabelt i sanntidschat-territoriet på en 24 GB RTX 4090, selv om et presist vedvarende tokens/sek-tall ikke er publisert ennå tre dager etter lansering. Hastigheten varierer med promptlengde, kontekststørrelse og backend-versjon, så behandle tidlige tall som omtrentlige.
Hvor laster jeg ned Gemma 4 12B?
Den instruksjonsstyrte modellen finnes på HuggingFace som google/gemma-4-12B-it, eller du kan laste den ned via Ollama med ollama run gemma4:12b (7,6 GB nedlasting). LM Studio-brukere kan søke etter gemma 4 12b i appens modellnettleser. For spesifikke kvantiseringer er GGUF-filer tilgjengelige fra fellesskapsrepos som Unsloth.