
Gemma 4 12B: benchmarky, nároky na VRAM a jak ji spustit lokálně
Google DeepMind vydal Gemma 4 12B 3. června 2026. O tři dny později je číslo, které všichni opakují, skóre na MMLU Pro: 77,2 %. To překonává loňskou Gemma 3 27B, která na stejném testu zvládla 67,6 %. Dvanáctimiliardový model poráží 27B vlajkovou loď? Při méně než poloviční paměti? Jo. A změnila se i licence. Gemma 4 vychází pod Apache 2.0, takže komerční použití je v pořádku, bez hvězdiček. Má kontextové okno 256K tokenů a po kvantizaci běží v přibližně 6,6 GB VRAM. Ta poslední část je pro většinu z nás celý příběh: tohle se vejde na střední třídu GPU.
Klíčové body
- Gemma 4 12B (vydána 3. června 2026) získává na MMLU Pro 77,2 %, čímž poráží loňskou Gemma 3 27B (67,6 %).
- Při Q4_K_M běží v ~6,6 GB VRAM, vejde se na 8GB GPU; ~16 GB poskytuje pohodlnou rezervu.
- Licence Apache 2.0 (komerční použití OK), 256K kontext, nativní audio + obrazový vstup, architektura bez enkodéru.
- Jeden příkaz ke spuštění:
ollama run gemma4:12b(7,6 GB ke stažení).
Co je Gemma 4 12B?
Gemma 4 12B je dvanáctimiliardový model s otevřenými vahami od Google DeepMind, vydaný 3. června 2026 pod licencí Apache 2.0. Jde o unitární multimodální model bez enkodéru: text, obraz a nativní audio vstupují, text vystupuje. Má kontextové okno 256K tokenů a podporuje 140 jazyků.
Instrukčně doladěná varianta, kterou budete ve skutečnosti spouštět, se jmenuje gemma-4-12B-it („it" je zkratka pro instruction-tuned, verze připravená na chat). Má celkem 11,95B parametrů, takže „12B" je mírné zaokrouhlení nahoru. Trénovací data sahají do ledna 2025.
A teď to zajímavé: Gemma 4 12B je první středně velká Gemma s nativním audio vstupem. Není žádný samostatný audio enkodér přilepený vedle. Surové průběhy se promítají přímo do modelu. Stejné je to s obrázky. Právě díky tomuto designovému rozhodnutí zůstává dost malá na to, aby běžela na jedné spotřebitelské kartě — a k tomu, proč, se dostaneme za chvíli.
Chcete nejdřív širší kontext? Náš průvodce spouštěním otevřených modelů na vlastním stroji pokrývá základy nastavení, pokud jste v lokálních LLM noví. Oficiální příspěvek Google k uvedení obsahuje kompletní oznámení.
Specifikace Gemma 4 12B na první pohled
Vše ověřené, v jedné tabulce. Bez dohadů.
| Specifikace | Hodnota |
|---|---|
| Plný název | Gemma 4 12B (gemma-4-12B-it) |
| Parametry | 11,95B (~12B) |
| Licence | Apache 2.0 (komerční použití OK) |
| Kontextové okno | 256K tokenů |
| Modality | Text + obraz + nativní audio vstup, text výstup |
| Architektura | Unitární bez enkodéru, 48 vrstev, hybridní attention |
| Jazyky | 140 |
| Tréninkový cutoff | Leden 2025 |
| Ollama tag | gemma4:12b (7,6 GB ke stažení) |
| Tag pro Apple Silicon | gemma4:12b-mlx |
| Doporučený sampling | temperature 1.0, top_p 0.95, top_k 64 |
Poznámka k samplování: držte se doporučeného temperature=1.0, top_p=0.95, top_k=64, pokud nemáte důvod to měnit. Modely Gemma se při nízkých teplotách chovají podivně, takže ji reflexivně nesnižujte na 0.2, jak byste možná dělali u jiných modelů.
Jak funguje architektura bez enkodéru?
Bez enkodéru znamená, že neexistuje žádný samostatný model, který by převáděl obrázky nebo audio, než se dostanou do jazykového modelu. Vizuální patche a surové audio průběhy se promítají přímo do sdíleného prostoru embeddingů přes tenké lineární vrstvy. Většina multimodálních modelů přilepí na LLM těžký vizuální enkodér. Gemma 4 12B to přeskakuje, a proto se vejde do 16 GB.
Představte si to jako překladatele versus bilingvního člověka. Starý přístup najímá samostatného překladatele (enkodér), který převede obrázky do jazyka, jemuž model rozumí, a pak to předá dál. Gemma 4 12B je bilingvní od narození. Audio a obrazová data mluví přímo nativním jazykem modelu, přes lehkou projekční vrstvu místo objemného enkodéru.
Pod kapotou je 48 vrstev s hybridní attention. Většina vrstev používá klouzavé okno 1024 tokenů (levné, lokální), proložené občasnými vrstvami s globální attention, které vidí celý kontext. Právě tato kombinace umožňuje zvládnout 256K kontext, aniž by se vám GPU roztavilo.

Praktický přínos: méně parametrů utracených za enkodéry znamená, že víc z vašeho VRAM rozpočtu jde na samotné uvažování. To je ten kompromis, který umožňuje 12B modelu tak výrazně přesahovat svou váhovou kategorii.
Benchmarky Gemma 4 12B: skutečná čísla
Titulek platí: Gemma 4 12B získává 77,2 % na MMLU Pro, čímž poráží 67,6 % Gemma 3 27B na stejném testu, při méně než poloviční VRAM. Jde o oficiální čísla instrukčně doladěné (-it) verze od Google, ne o odhady komunity. Zde je kompletní sada.
| Benchmark | Gemma 4 12B | Gemma 3 27B (reference) |
|---|---|---|
| MMLU Pro | 77,2 % | 67,6 % |
| GPQA Diamond | 78,8 % | , |
| MMMU Pro | 69,1 % | , |
| AIME 2026 (bez nástrojů) | 77,5 % | , |
| LiveCodeBench v6 | 72,0 % | , |
| Codeforces ELO | 1659 | , |
12B model teď poráží loňskou 27B vlajkovou loď na MMLU Pro: 77,2 % vs 67,6 %. To je generační skok, kvůli kterému přepočítáváte svou hardwarovou matematiku.

Dvě upřímné výhrady. Zaprvé, pomlčky znamenají, že Google nepublikoval číslo Gemma 3 27B pro dané řádky, takže buňky zůstávají prázdné, místo aby byly vyplněné dohady. Zadruhé, každé skóre zde je instrukčně doladěný model. Čísla základního modelu se liší. Vše si můžete ověřit na kartě modelu na HuggingFace a na stránce modelu DeepMind.
Kolik VRAM Gemma 4 12B potřebuje?
Gemma 4 12B potřebuje přibližně 6,6 GB VRAM při kvantizaci Q4_K_M, což znamená, že se vejde na 8GB GPU. Pro pohodlnou rezervu, zejména pokud chcete využít část z toho 256K kontextu, mířte na 16 GB VRAM nebo unified memory. Běží na notebooku. M-series Macy to zvládají přes unified memory bez problémů.
Kvantizace je prostě komprese vah modelu. Čísla s nižší přesností, menší soubor, mírně nižší přesnost. Zde je přehled, jak si běžné úrovně odpovídají.
| Kvantizace | Přibl. VRAM | Kvalita | Nejlepší pro |
|---|---|---|---|
| Q4_K_M | ~6,6 GB | Téměř plná, minimální ztráta | Rozumná defaultní volba; vejde se na 8GB karty |
| Q5_K_M | ~8,5 GB | Mírně lepší než Q4 | Trochu VRAM navíc, chcete vyšší přesnost |
| Q8 | ~13 GB | Prakticky plná kvalita | Karty 16 GB+, maximální věrnost |
| QAT Q4_0 | ~6,6 GB | Téměř FP při Q4 velikosti | Nejlepší kvalita na GB (vydáno 5. června) |

Pokud vybíráte hardware kolem tohoto modelu, náš přehled nástrojů pro lokální LLM, které jsme benchmarkovali pokrývá, které backendy z dané karty dostanou nejvíc. Krátká verze: 12GB karta spustí Q4 s rezervou, 8GB karta spustí Q4, pokud udržíte kontext na uzdě.
Rychlost Gemma 4 12B: tokeny/s na reálném hardwaru
Jak rychle to běží? Záleží na vaší kartě, kvantizaci a backendu, takže místo jednoho čísla jsme shromáždili publikované údaje třetích stran na jedno místo. Tyto pocházejí od komunitních testerů a prodejců, s uvedením zdroje. Nejsou to naše vlastní laboratorní čísla.
| Hardware | Kvant. | Nahlášené tokeny/s | Zdroj |
|---|---|---|---|
| RTX 3060 (6GB) | Q4_K_M | ~6,6 GB VRAM, běží lokálně (tok/s přesně nehlášeno) | runaiathome |
| RTX 4090 (24GB) | Q4_K_M | Rozsah real-time chatu (konkrétní tok/s zatím nehlášeno) | apxml / komunita |
| Apple M-series (unified) | mlx / Q4 | Běží přes gemma4:12b-mlx (tok/s zatím široce nehlášeno) | Ollama / komunita |
Budu s vámi upřímný ohledně toho, co veřejná data momentálně říkají. runaiathome potvrdil, že model běží na 6GB RTX 3060 v rámci ~6,6 GB Q4_K_M, což je dosud nejkonkrétnější publikovaná hardwarová zpráva. Specifikace od apxml a stránka knihovny Ollama potvrzují, že model lokálně obsluhuje na 24GB RTX 4090 při Q4, pohodlně v pásmu real-time chatu, ale přesné udržitelné tok/s zatím pro tuto kartu publikováno nebylo. Varianta gemma4:12b-mlx pro Apple Silicon existuje a běží, ale spolehlivé údaje tok/s se tři dny po uvedení neobjevily.
Co to znamená pro vás, podle úrovně: na 6GB kartě jako RTX 3060 čekejte, že se načte a poběží pro lokální chat, jen udržujte kontextové okno skromné. Na 24GB RTX 4090 při Q4_K_M publikované zprávy řadí model pohodlně do pásma real-time chatu. Na Apple Silicon MLX build běží, ale benchmarková čísla stále přicházejí postupně.
Toto jsou publikované údaje třetích stran, ne naše vlastní laboratorní čísla, takže je berte jako orientační. Vaše tok/s závisí na délce promptu, velikosti kontextu a verzi backendu. Zdroje: stránka knihovny Ollama, apxml a runaiathome. Jak budou v příštích dvou týdnech přibývat komunitní benchmarky, tuto tabulku aktualizujeme.
Jak spustit Gemma 4 12B lokálně?
Nejkratší cesta: nainstalujte Ollama, spusťte jeden příkaz, hotovo. ollama run gemma4:12b stáhne 7,6GB model a hodí vás do chatového promptu. Žádné konfigurační soubory, žádné Python prostředí. Pokud chcete víc kontroly nebo jste na Apple Silicon, níže jsou čtyři další cesty.
1. Ollama (snadný default). Stáhněte a spusťte na dva řádky:
ollama pull gemma4:12b
ollama run gemma4:12b2. llama.cpp s GGUF. Pokud chcete konkrétní kvantizaci, nasměrujte llama.cpp na GGUF na HuggingFace. GGUF je souborový formát, který llama.cpp používá pro kvantizované váhy:
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."3. MLX na Apple Silicon. Macy s M-series mají dedikovaný MLX build, který používá framework Apple místo CUDA:
ollama run gemma4:12b-mlx4. LM Studio (GUI, bez terminálu). Preferujete desktopovou aplikaci? Otevřete LM Studio, klikněte na záložku hledání a napište gemma 4 12b. Vyberte Q4_K_M GGUF a stáhněte. LM Studio se postará o zbytek, včetně přepínače lokálního serveru.
5. Dotazování přes API. Ollama vystavuje endpoint kompatibilní s OpenAI na portu 11434, takže existující kód funguje s výměnou base-URL na jednom řádku:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:12b",
"messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
}'Jakmile to máte běžící na CLI, pravděpodobně budete chtít skutečné rozhraní. Můžete to obalit do UI ve stylu ChatGPT s Open WebUI za přibližně pět minut. Jste v tomhle noví? Začněte s naším kompletním průvodcem nastavením lokálního LLM. Pro oficiální doporučení k samplování a způsoby spuštění viz ai.google.dev a dokumentace Ollama.
Jakou kvantizaci zvolit pro Gemma 4 12B?
Pro většinu lidí je Q4_K_M rozumná defaultní volba: přibližně 6,6 GB VRAM, téměř plná kvalita, a vejde se na 8GB GPU. Pokud máte 16 GB nebo víc a chcete maximální věrnost, přejděte na Q8. A pokud chcete nejlepší kvalitu na gigabyte, která je právě teď k dispozici, podívejte se na nové QAT Q4_0 checkpointy.
Zde je úhel čerstvosti, který zatím nikdo nezpracoval. 5. června 2026, pouhé dva dny po uvedení, Google vydal checkpointy Quantization-Aware-Training (QAT) Q4_0 spolu s novým mobilním formátem. QAT znamená, že model byl trénován s ohledem na kvantizaci, takže si drží téměř plnou přesnost (near-FP) při Q4 velikosti. Stejných ~6,6 GB, znatelně menší ztráta přesnosti než standardní post-training Q4. Pokud jste omezení VRAM, ale záleží vám na kvalitě, tohle je vaše volba.
Rychlý průvodce rozhodováním:
- 8GB karta, chcete jednoduchost: Q4_K_M.
- 8GB karta, chcete nejlepší kvalitu v dané velikosti: QAT Q4_0.
- Karta 16 GB+, chcete maximální věrnost: Q8.
- Mezi tím, trochu VRAM navíc: Q5_K_M.
Zdůvodnění Google si můžete přečíst v jejich oznámení QAT. Shrnutí: Q4_K_M je v pořádku, QAT Q4_0 je lepší při stejné velikosti a Q8 potřebujete jen tehdy, pokud je přesnost důležitější než paměť.
Gemma 4 12B vs Gemma 3 12B vs Qwen 3.5: vyplatí se upgrade?
Ano, upgrade z Gemma 3 12B se vyplatí, pokud vám záleží na licenci Apache 2.0, nativním audio vstupu, 256K kontextovém okně nebo skoku na MMLU Pro. Proti Qwen 3.5 je to těsnější. Gemma 4 12B vyhrává v permisivitě licence a nativním audiu, ale Qwen 3.5 bere některé řádky ve třídě 12B benchmarků. Vybírejte podle svých skutečných potřeb, ne podle titulku.
| Funkce | Gemma 4 12B | Gemma 3 12B | Qwen 3.5 (třída 12B) |
|---|---|---|---|
| Licence | Apache 2.0 | Vlastní licence Gemma | Apache 2.0 |
| Kontext | 256K | 128K | Až 256K |
| Modality | Text + obraz + audio | Text + obraz | Text + obraz |
| Nativní audio | Ano | Ne | Ne |
| MMLU Pro | 77,2 % | Nižší | Konkurenceschopné, vyhrává některé řádky |
| Q4 VRAM | ~6,6 GB | ~6,6 GB | ~6,6 GB |
Samotná změna licence ospravedlňuje přechod z Gemma 3 12B pro spoustu týmů. Gemma 3 vyšla pod vlastní licencí Google s omezeními použití; Gemma 4 je čistá Apache 2.0. Pokud jste s Gemma otáleli z komerčních důvodů, ta překážka je pryč.
Proti Qwen 3.5 buďte k sobě upřímní. Qwen 3.5 je opravdu silný a na některých řádcích uvažování a kódování Gemma 4 12B těsně poráží. Pokud audio vstup a permisivní licence nejsou na vašem seznamu, benchmarkujte oba na vlastním úkolu, než se rozhodnete. Podívejte se, kam se Gemma 4 12B řadí mezi nejlepšími otevřenými modely, pro širší pole. A protože je Apache 2.0, můžete ji doladit pod Apache 2.0 s Unsloth bez licenčních komplikací.
Kdy Gemma 4 12B nepoužívat
Přeskočte Gemma 4 12B, pokud potřebujete uvažování na úrovni frontier, které poskytuje jen mnohem větší model, pokud Qwen 3.5 vyhrává konkrétní řádek benchmarku, na kterém vaše zátěž závisí, nebo pokud se váš projekt silně opírá o audio nástroje, které jsou tři dny po uvedení stále ve vývoji. Je to vynikající 12B model, ne kouzelný.
Gemma 4 12B není vždy správná volba. Pokud potřebujete uvažování na úrovni frontier, větší model stále vyhrává. Nativní podpora audia je skutečná a působivá, ale okolní nástroje, knihovny, pomocné utility, integrace do frameworků — to vše je dny staré a místy drsné. Pokud tento týden nasazujete produkt s velkým podílem audia, důkladně testujte, než na to vsadíte.
Pár dalších upřímných diskvalifikací. Pokud to zapojíte do agenta, nejprve ověřte spolehlivost volání nástrojů na vašich úlohách, protože agentní chování se podle modelu liší. Pokud je vaše výhoda dlouhý kontext, ujistěte se, že využíváte 256K kontextové okno naplno, místo abyste předpokládali, že surová velikost okna rovná se lepší výstup. A pokud přecházíte od lokálního spuštění k produkčnímu servírování, produkční cesta servírování mimo lokál pokrývá vLLM a SGLang. Pokud nasazujete otevřené modely jako Gemma 4 12B v produkci, můžeme pomoci.
O autorovi
Mert Batur Gurbuz je spoluzakladatel Techsy.io, kde tým dodává AI agenty, automatizační systémy a hlasové/SDR pipeline pro B2B klienty. Studuje na University of Birmingham a píše o stacku nástrojů pro LLM, který tým Techsy skutečně používá v produkci. Spojte se na LinkedIn.
Výběr nástroje je ta snadná polovina. Rozběhnout ho spolehlivě uvnitř skutečného produktu je místo, kde většina týmů uvázne — a přesně to náš tým AI integrací pro klienty staví, od RAG pipeline po vlastní agenty.
Často kladené otázky
Jak spustím Gemma 4 12B lokálně?
Nainstalujte Ollama a spusťte ollama run gemma4:12b. Tím stáhnete 7,6GB model a otevře se chatový prompt. Není potřeba žádné Python prostředí ani konfigurační soubory. Pokud chcete grafickou aplikaci, LM Studio také funguje: vyhledejte gemma 4 12b v prohlížeči modelů a stáhněte Q4_K_M build.
Jaké jsou nároky na VRAM a hardware pro Gemma 4 12B?
Gemma 4 12B potřebuje přibližně 6,6 GB VRAM při kvantizaci Q4_K_M, takže se vejde na 8GB GPU. Pro pohodlnou rezervu, zejména při použití dlouhého kontextu, mířte na 16 GB VRAM nebo unified memory. Běží na noteboocích, včetně Maců s M-series přes unified memory.
Poběží Gemma 4 12B na 16GB notebooku?
Ano, snadno. Při Q4_K_M model využívá přibližně 6,6 GB, takže na 16GB stroji zbývá spousta místa. Na noteboocích s Apple Silicon to unified memory zvládá dobře přes build gemma4:12b-mlx. Na 16 GB můžete dokonce přejít na kvantizaci Q8 pro vyšší věrnost.
Je Gemma 4 12B skutečně lepší než Llama nebo Qwen 3.5?
Záleží na tom, co měříte. Gemma 4 12B vyhrává v licenci Apache 2.0, nativním audio vstupu a 256K kontextovém okně a dosahuje silných 77,2 % na MMLU Pro. Ale Qwen 3.5 bere některé řádky uvažování a kódování ve třídě 12B. Než se rozhodnete, benchmarkujte oba na vlastní úloze.
Je Gemma 4 12B lepší než Gemma 3 12B?
Ano. Gemma 4 12B přechází na permisivní licenci Apache 2.0, přidává nativní audio vstup, zdvojnásobuje kontextové okno na 256K tokenů a dosahuje významného zlepšení na MMLU Pro. Samotná změna licence ospravedlňuje upgrade pro komerční projekty, které blokovaly vlastní podmínky Gemma 3.
Jakou kvantizaci mám použít pro Gemma 4 12B?
Q4_K_M je rozumná defaultní volba při přibližně 6,6 GB s téměř plnou kvalitou. Pokud chcete nejlepší kvalitu při stejné velikosti, použijte nové QAT Q4_0 checkpointy vydané 5. června 2026, které si drží téměř plnou přesnost při Q4 velikosti. Q8 použijte jen tehdy, pokud máte 16 GB+ a potřebujete maximální věrnost.
Je Gemma 4 12B zdarma pro komerční použití?
Ano. Gemma 4 12B vychází pod licencí Apache 2.0, která umožňuje komerční použití bez omezení vlastní licence Gemma 3. Můžete stavět komerční produkty, doladit ji a redistribuovat. Tato změna licence je jedním z největších důvodů, proč týmy přecházejí z Gemma 3.
Opravdu Gemma 4 12B podporuje audio vstup?
Ano. Gemma 4 12B je první středně velká Gemma s nativním audio vstupem. Díky designu bez enkodéru se surové audio průběhy promítají přímo do modelu bez samostatného audio enkodéru. Nicméně okolní nástroje jsou dny staré, takže před nasazením funkcí s velkým podílem audia do produkce důkladně testujte.
Jak rychle běží Gemma 4 12B na RTX 4090?
Publikované zprávy třetích stran řadí Gemma 4 12B při Q4_K_M pohodlně do pásma real-time chatu na 24GB RTX 4090, i když přesné udržitelné tokeny/s zatím tři dny po uvedení publikováno nebylo. Rychlost se liší podle délky promptu, velikosti kontextu a verze backendu, takže rané údaje berte jako orientační.
Kde stáhnu Gemma 4 12B?
Instrukčně doladěný model je na HuggingFace jako google/gemma-4-12B-it, nebo ho můžete stáhnout přes Ollama příkazem ollama run gemma4:12b (7,6 GB ke stažení). Uživatelé LM Studio mohou vyhledat gemma 4 12b v prohlížeči modelů v aplikaci. Pro konkrétní kvantizace jsou GGUF soubory dostupné z komunitních repozitářů jako Unsloth.