
Google DeepMind skickade ut Gemma 4 12B den 3 juni 2026. Tre dagar senare är det en siffra som alla upprepar: MMLU Pro-poängen på 77,2%. Det slår förra årets Gemma 3 27B, som klarade 67,6% på samma test. En modell med 12 miljarder parametrar som presterar bättre än en 27B-flaggskepp? Med mindre än hälften av minnesåtgången? Ja. Licensen har också ändrats. Gemma 4 levereras under Apache 2.0, vilket innebär att kommersiell användning är tillåten utan krångel. Modellen har ett kontextfönster på 256K tokens och körs på ungefär 6,6 GB VRAM efter kvantiisering. Det sista är det viktigaste för de flesta: den här modellen passar på ett mellanklass-GPU.
Viktigaste punkter
- Gemma 4 12B (lanserad 3 juni 2026) når 77,2% på MMLU Pro, bättre än Gemma 3 27B (67,6%).
- Den körs på ~6,6 GB VRAM vid Q4KM, vilket passar ett 8GB-GPU; ~16GB ger bekvämt spelrum.
- Apache 2.0-licens (kommersiell användning OK), 256K kontext, inbyggt ljud- och bildinput, kodarvfri arkitektur.
- Ett kommando:
ollama run gemma4:12b(7,6 GB nedladdning).
Vad är Gemma 4 12B?
Gemma 4 12B är en open-weights-modell med 12 miljarder parametrar från Google DeepMind, lanserad 3 juni 2026 under Apache 2.0-licens. Det är en kodarvfri, enhetlig multimodal modell: text, bild och inbyggt ljud in, text ut. Den har ett kontextfönster på 256K tokens och stöder 140 språk.
Den instruktionsfinjusterade varianten du faktiskt kommer köra heter gemma-4-12B-it (där "it" är förkortning för instruction-tuned, den chattklara versionen). Den har 11,95B parametrar totalt, så "12B" är en lätt avrundning. Träningsdatan har ett cutoff i januari 2025.
Det som gör den intressant: Gemma 4 12B är den första mellanstorleks-Gemma med inbyggt ljudinput. Det finns ingen separat ljudkodare inkopplad. Råa vågformer projiceras direkt in i modellen. Samma sak för bilder. Det designvalet är anledningen till att den förblir liten nog för ett enda konsumentkort — och vi återkommer till varför om en stund.
Vill du ha en bredare överblick först? Vår guide om att köra öppna modeller på din egen maskin täcker installationsgrunderna om du är ny på lokala LLM:er. Googles officiella lanseringsinlägg har hela tillkännagivandet.
Gemma 4 12B-specifikationer i korthet
Allt verifierat, i en tabell. Inga gissningar.
| Specifikation | Värde |
|---|---|
| Fullständigt namn | Gemma 4 12B (gemma-4-12B-it) |
| Parametrar | 11,95B (~12B) |
| Licens | Apache 2.0 (kommersiell användning OK) |
| Kontextfönster | 256K tokens |
| Modaliteter | Text + bild + inbyggt ljud in, text ut |
| Arkitektur | Kodarvfri, enhetlig, 48 lager, hybrid attention |
| Språk | 140 |
| Träningscutoff | Januari 2025 |
| Ollama-tagg | gemma4:12b (7,6 GB nedladdning) |
| Apple Silicon-tagg | gemma4:12b-mlx |
| Rekommenderad sampling | temperature 1.0, top_p 0.95, top_k 64 |
En notering om sampling: håll dig till de rekommenderade temperature=1.0, top_p=0.95, top_k=64 om du inte har skäl att göra annorlunda. Gemma-modeller uppför sig konstigt vid låga temperaturer, så sänk den inte reflexmässigt till 0.2 som du kanske gör med andra modeller.
Hur fungerar den kodarvfria arkitekturen?
Kodarvfri innebär att det inte finns någon separat modell som konverterar bilder eller ljud innan de når språkmodellen. Bildpatchar och råa ljudvågformer projiceras direkt in i det delade inbäddningsutrymmet via tunna linjära lager. De flesta multimodala modeller kopplar en tung bildkodare till LLM:en. Gemma 4 12B hoppar över det, vilket är anledningen till att den passar i 16GB.
Tänk på det som skillnaden mellan en tolk och en tvåspråkig person. Det gamla sättet anlitar en separat tolk (kodaren) för att konvertera bilder till ett språk modellen förstår, och skickar sedan vidare resultatet. Gemma 4 12B är tvåspråkig från grunden. Ljud- och bilddata talar modellens modersmål direkt, via ett lättviktsprojektionslager i stället för en otymplig kodare.
Under huven är det 48 lager med hybrid attention. De flesta lager använder ett 1024-token glidande fönster (billigt, lokalt), varvat med enstaka globala attention-lager som ser hela kontexten. Den kombinationen är hur den hanterar ett 256K-kontextfönster utan att smälta ditt GPU.

Den praktiska vinsten: färre parametrar spenderade på kodare innebär mer VRAM-budget för faktisk resonemang. Det är bytet som låter en 12B-modell prestera så långt över sin vikt.
Gemma 4 12B-benchmarks: de verkliga siffrorna
Rubriken håller: Gemma 4 12B når 77,2% på MMLU Pro, bättre än Gemma 3 27B:s 67,6% på samma test, med mindre än hälften av VRAM-åtgången. Dessa är officiella instruction-tuned (-it) siffror från Google, inte community-uppskattningar. Här är hela uppsättningen.
| Benchmark | Gemma 4 12B | Gemma 3 27B (referens) |
|---|---|---|
| MMLU Pro | 77,2% | 67,6% |
| GPQA Diamond | 78,8% | — |
| MMMU Pro | 69,1% | — |
| AIME 2026 (inga verktyg) | 77,5% | — |
| LiveCodeBench v6 | 72,0% | — |
| Codeforces ELO | 1659 | — |
En 12B-modell slår nu förra årets 27B-flaggskepp på MMLU Pro: 77,2% mot 67,6%. Det är den typen av generationshopp som får en att dubbelkolla sin hårdvarukalkyl.

Två ärliga förbehåll. Strecken innebär att Google inte publicerade något Gemma 3 27B-tal för de raderna, så cellerna förblir tomma i stället för att fyllas med gissningar. Alla poäng här är för instruction-tuned-modellen. Basmodellens siffror skiljer sig. Du kan verifiera allt detta på HuggingFace-modellkortet och DeepMind-modellsidan.
Hur mycket VRAM behöver Gemma 4 12B?
Gemma 4 12B behöver ungefär 6,6 GB VRAM vid Q4KM-kvantiisering, vilket innebär att den passar på ett 8GB-GPU. För bekvämt spelrum, särskilt om du vill använda en stor del av det 256K-långa kontextfönstret, sikta på 16GB VRAM eller unified memory. Den körs på en bärbar dator. M-serie Mac-datorer hanterar det utan problem via unified memory.
Kvantiisering är helt enkelt komprimering av modellvikter. Lägre precision, mindre fil, marginellt sämre noggrannhet. Så här ser de vanliga nivåerna ut.
| Kvantiisering | Ungefärlig VRAM | Kvalitet | Bäst för |
|---|---|---|---|
| Q4_K_M | ~6,6 GB | Nära full, minimal förlust | Det förnuftiga standardvalet; passar 8GB-kort |
| Q5_K_M | ~8,5 GB | Något bättre än Q4 | Lite extra VRAM, vill ha mer noggrannhet |
| Q8 | ~13 GB | Effektivt full kvalitet | 16GB+-kort, maximal fidelitet |
| QAT Q4_0 | ~6,6 GB | Nära FP vid Q4-fotavtryck | Bästa kvalitet per GB (lanserad 5 juni) |

Väljer du hårdvara kring den här modellen täcker vår sammanställning av lokala LLM-verktyg vi benchmarkat vilka backends som pressar ut mest av ett givet kort. Kortversionen: ett 12GB-kort kör Q4 med marginal, ett 8GB-kort kör Q4 om du håller kontexten rimlig.
Gemma 4 12B-hastighet: tokens/sek på verklig hårdvara
Hur snabb är den? Det beror på ditt kort, din kvantiisering och din backend, så i stället för ett enda tal har vi samlat de publicerade tredjepartssiffrorna på ett ställe. Dessa rapporteras av community-testare och leverantörer, med källa angiven för varje. Det är inte våra egna labsiffror.
| Hårdvara | Kvant | Rapporterade tokens/sek | Källa |
|---|---|---|---|
| RTX 3060 (6GB) | Q4_K_M | ~6,6 GB VRAM-fotavtryck, körs lokalt (tok/s ej preciserat) | runaiathome |
| RTX 4090 (24GB) | Q4_K_M | Realtids-chat-område (specifikt tok/s ej rapporterat än) | apxml / community |
| Apple M-serie (unified) | mlx / Q4 | Körs via gemma4:12b-mlx (tok/s ej allmänt rapporterat än) | Ollama / community |
Vad den publika datan faktiskt säger just nu: runaiathome bekräftade att modellen körs på ett 6GB RTX 3060 inom sitt ~6,6 GB Q4KM-fotavtryck, vilket är den mest konkreta publicerade hårdvarurapporten hittills. apxml:s specblad och Ollama-bibliotekssidan bekräftar att modellen körs lokalt på en 24GB RTX 4090 vid Q4, bekvämt i realtids-chat-territorium, men ett exakt hållet tok/s-tal är inte publicerat för det kortet än. Apple Silicon-varianten gemma4:12b-mlx finns och körs, men tillförlitliga tok/s-tal har inte dykt upp tre dagar efter lansering.
Vad det innebär för dig per nivå: på ett 6GB-kort som RTX 3060 kan du räkna med att den laddar och körs för lokal chatt — håll bara kontextfönstret rimligt. På en 24GB RTX 4090 vid Q4KM placerar publicerade rapporter den bekvämt i realtids-chat-territorium. På Apple Silicon körs MLX-bygget men benchmarksiffror droppar fortfarande in.
Det här är publicerade tredjepartssiffror, inte egna labsiffror, så behandla dem som riktmärken. Dina tok/s beror på promptlängd, kontextstorlek och backend-version. Källor: Ollama-bibliotekssidan, apxml och runaiathome. När fler community-benchmarks dyker upp de närmaste två veckorna uppdaterar vi den här tabellen.
Hur kör du Gemma 4 12B lokalt?
Den kortaste vägen: installera Ollama, kör ett kommando, klart. ollama run gemma4:12b hämtar 7,6 GB-modellen och ger dig en chattprömpt. Inga konfigfiler, ingen Python-miljö. Vill du ha mer kontroll eller använder du Apple Silicon finns det fyra andra vägar nedan.
1. Ollama (det enkla standardvalet). Hämta och kör på två rader:
ollama pull gemma4:12b
ollama run gemma4:12b2. llama.cpp med en GGUF. Vill du ha en specifik kvantiisering pekar du llama.cpp mot en GGUF på HuggingFace. GGUF är filformatet llama.cpp använder för kvantiiserade vikter:
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."3. MLX på Apple Silicon. M-serie Mac-datorer får ett dedikerat MLX-bygge som använder Apples framework i stället för CUDA:
ollama run gemma4:12b-mlx4. LM Studio (GUI, ingen terminal). Föredrar du en skrivbordsapp? Öppna LM Studio, klicka på sökfliken och skriv gemma 4 12b. Välj en Q4KM GGUF och ladda ned. LM Studio sköter resten, inklusive en lokal serverväxlare.
5. Anropa den via API. Ollama exponerar en OpenAI-kompatibel endpoint på port 11434, så befintlig kod fungerar med ett enkelt byte av bas-URL:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:12b",
"messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
}'När du väl har fått det att köra på kommandoraden vill du förmodligen ha ett riktigt gränssnitt. Du kan sätta upp ett ChatGPT-liknande UI med Open WebUI på ungefär fem minuter. Ny på allt det här? Börja med vår fullständiga guide för lokal LLM-installation. För officiella samplingsrekommendationer och körvägar, se ai.google.dev och Ollama-dokumentationen.
Vilken kvantiisering ska du använda för Gemma 4 12B?
För de flesta är Q4KM det förnuftiga standardvalet: ungefär 6,6 GB VRAM, nära full kvalitet och passar ett 8GB-GPU. Har du 16GB eller mer och vill ha maximal fidelitet, gå upp till Q8. Vill du ha bästa möjliga kvalitet per gigabyte just nu, titta på de nya QAT Q4_0-checkpointsen.
Här är det ingen uppmärksammar ännu. Den 5 juni 2026, bara två dagar efter lansering, släppte Google Quantization-Aware-Training (QAT) Q4_0-checkpoints tillsammans med ett nytt mobilformat. QAT innebär att modellen tränades med kvantiisering i åtanke, så den behåller nära-FP (nära full precision) kvalitet vid ett Q4-fotavtryck. Samma ~6,6 GB, märkbart lägre noggrannhetsförlust än standard Q4 efter träning. Är du VRAM-begränsad men kvalitetskänslig, det är ditt val.
Snabbt beslutshjälpmedel:
- 8GB-kort, vill ha enkelt: Q4KM.
- 8GB-kort, vill ha bästa kvalitet i den storleken: QAT Q4_0.
- 16GB+-kort, vill ha maximal fidelitet: Q8.
- Däremellan, lite extra VRAM: Q5KM.
Du kan läsa Googles resonemang i deras QAT-tillkännagivande. Slutsatsen: Q4KM fungerar bra, QAT Q4_0 är bättre i samma storlek, och du behöver bara Q8 om noggrannhet väger tyngre än minne.
Gemma 4 12B vs Gemma 3 12B vs Qwen 3.5: är uppgraderingen värd det?
Ja, uppgraderingen från Gemma 3 12B är värd det om du bryr dig om Apache 2.0-licensen, inbyggt ljudinput, det 256K-långa kontextfönstret eller MMLU Pro-hoppet. Mot Qwen 3.5 är det jämnare. Gemma 4 12B vinner på licensfrihet och inbyggt ljud, men Qwen 3.5 tar vissa benchmark-rader i 12B-klassen. Välj utifrån dina faktiska behov, inte rubriken.
| Funktion | Gemma 4 12B | Gemma 3 12B | Qwen 3.5 (12B-klass) |
|---|---|---|---|
| Licens | Apache 2.0 | Googles anpassade Gemma-licens | Apache 2.0 |
| Kontext | 256K | 128K | Upp till 256K |
| Modaliteter | Text + bild + ljud | Text + bild | Text + bild |
| Inbyggt ljud | Ja | Nej | Nej |
| MMLU Pro | 77,2% | Lägre | Konkurrenskraftig, vinner vissa rader |
| Q4 VRAM | ~6,6 GB | ~6,6 GB | ~6,6 GB |
Licensändringen ensam motiverar flytten från Gemma 3 12B för många team. Gemma 3 levererades under Googles anpassade licens med användningsbegränsningar; Gemma 4 är ren Apache 2.0. Väntar du på Gemma av kommersiella skäl? Den bromsen är borta.
Mot Qwen 3.5 — var ärlig mot dig själv. Qwen 3.5 är genuint stark och slår Gemma 4 12B på vissa resonemang- och kodrader. Om ljudinput och permissiv licens inte finns på din lista, benchmarka båda på din egen uppgift innan du väljer. Se var Gemma 4 12B hamnar bland de bästa öppna modellerna för en bredare översikt. Och eftersom det är Apache 2.0 kan du finjustera det med Unsloth utan licensbekymmer.
När ska du INTE använda Gemma 4 12B?
Hoppa över Gemma 4 12B om du behöver frontierresonemang som bara en mycket större modell klarar, om Qwen 3.5 vinner den specifika benchmark-raden ditt arbetsflöde beror på, eller om ditt projekt lutar hårt mot ljudverktyg som fortfarande mognar tre dagar efter lansering. Det är en utmärkt 12B-modell, inte en magisk.
Gemma 4 12B är inte alltid rätt val. Behöver du frontierresonemang vinner en större modell ändå. Stödet för inbyggt ljud är verkligt och imponerande, men det omgivande verktygsekosystemet — bibliotek, hjälputiliteter, ramverksintegrationer — är dagsgammalt och skrovligt på ställen. Ska du lansera en ljudtung produkt den här veckan, testa ordentligt innan du satsar på det.
Ytterligare några ärliga diskvalificeringar. Ska du integrera det i en agent, kontrollera verktygsanropsreliabiliteten på dina uppgifter först, eftersom agentbeteende varierar per modell. Är ditt försprång det långa kontexten, se till att du utnyttjar det 256K-långa kontextfönstret i stället för att anta att ett stort fönster automatiskt ger bättre output. Går du från lokala körningar till produktionsservning täcker produktionsservningsbanan bortom lokalt vLLM och SGLang. Distribuerar du öppna modeller som Gemma 4 12B i produktion kan vi hjälpa.
Om skribenten
Mert Batur Gurbuz är medgrundare av Techsy.io, där teamet bygger AI-agenter, automationssystem och röst- och SDR-pipelines för B2B-kunder. Han studerar vid University of Birmingham och skriver om det LLM-verktygsstack Techsy-teamet faktiskt använder i produktion. Anslut på LinkedIn.
Att välja verktyg är den enkla delen. Att få det att rulla stabilt i en riktig produkt är där de flesta team fastnar, och det är precis vad vårt AI-integrationsteam bygger åt kunder, från RAG-pipelines till skräddarsydda agenter.
Vanliga frågor
Hur kör jag Gemma 4 12B lokalt?
Installera Ollama, kör sedan ollama run gemma4:12b. Det hämtar 7,6 GB-modellen och öppnar en chattprömpt. Ingen Python-miljö eller konfigfiler behövs. Föredrar du en grafisk app fungerar LM Studio också: sök gemma 4 12b i dess modellbläddrare och ladda ned ett Q4KM-bygge.
Vilka är VRAM- och hårdvarukraven för Gemma 4 12B?
Gemma 4 12B behöver ungefär 6,6 GB VRAM vid Q4KM-kvantiisering, så det passar ett 8GB-GPU. För bekvämt spelrum, särskilt när du använder den långa kontexten, sikta på 16GB VRAM eller unified memory. Det körs på bärbara datorer, inklusive M-serie Mac-datorer via unified memory.
Kan Gemma 4 12B köras på en 16GB-laptop?
Ja, utan problem. Vid Q4KM använder modellen ungefär 6,6 GB, vilket lämnar gott om utrymme på en 16GB-maskin. På Apple Silicon-laptops hanterar unified memory det väl via gemma4:12b-mlx-bygget. Du kan till och med gå upp till Q8-kvantiisering på 16GB för högre fidelitet.
Är Gemma 4 12B faktiskt bättre än Llama eller Qwen 3.5?
Det beror på vad du mäter. Gemma 4 12B vinner på Apache 2.0-licensen, inbyggt ljudinput och ett 256K-kontextfönster, och når starka 77,2% på MMLU Pro. Men Qwen 3.5 tar vissa resonemang- och kodrader i 12B-klassen. Benchmarka båda på din egen uppgift innan du bestämmer dig.
Är Gemma 4 12B bättre än Gemma 3 12B?
Ja. Gemma 4 12B byter till den permissiva Apache 2.0-licensen, lägger till inbyggt ljudinput, fördubblar kontextfönstret till 256K tokens och visar en tydlig MMLU Pro-förbättring. Licensändringen ensam motiverar en uppgradering för kommersiella projekt som blockerades av Gemma 3:s anpassade villkor.
Vilken kvantiisering ska jag använda för Gemma 4 12B?
Q4KM är det förnuftiga standardvalet på ungefär 6,6 GB med nära full kvalitet. Vill du ha bästa kvalitet i samma storlek, använd de nya QAT Q4_0-checkpointsen som lanserades 5 juni 2026 — de behåller nära-full-precisionskvalitet vid ett Q4-fotavtryck. Använd Q8 bara om du har 16GB+ och behöver maximal fidelitet.
Är Gemma 4 12B gratis för kommersiellt bruk?
Ja. Gemma 4 12B levereras under Apache 2.0-licensen, som tillåter kommersiell användning utan de begränsningar som gällde för Gemma 3:s anpassade Gemma-licens. Du kan bygga kommersiella produkter, finjustera den och distribuera om den. Licensändringen är en av de största anledningarna till att team uppgraderar från Gemma 3.
Stöder Gemma 4 12B verkligen ljudinput?
Ja. Gemma 4 12B är den första mellanstorleks-Gemma med inbyggt ljudinput. Tack vare sin kodarvfria design projiceras råa ljudvågformer direkt in i modellen utan separat ljudkodare. Det sagt är det omgivande verktygsekosystemet dagsgammalt, så testa noggrant innan du lanserar ljudtunga funktioner i produktion.
Hur snabb är Gemma 4 12B på en RTX 4090?
Publicerade tredjepartsrapporter placerar Gemma 4 12B vid Q4KM bekvämt i realtids-chat-territorium på en 24GB RTX 4090, men ett exakt hållet tokens/sek-tal är inte publicerat ännu tre dagar efter lansering. Hastigheten varierar med promptlängd, kontextstorlek och backend-version, så behandla tidiga siffror som riktmärken.
Var laddar jag ned Gemma 4 12B?
Instruction-tuned-modellen finns på HuggingFace som google/gemma-4-12B-it, eller så kan du hämta den via Ollama med ollama run gemma4:12b (7,6 GB nedladdning). LM Studio-användare kan söka gemma 4 12b i appens modellbläddrare. För specifika kvantiseringar finns GGUF-filer hos community-repos som Unsloth.