
Google DeepMind ha rilasciato Gemma 4 12B il 3 giugno 2026. Tre giorni dopo, il numero che tutti citano è il punteggio MMLU Pro: 77,2%. Questo supera Gemma 3 27B dell'anno scorso, che aveva ottenuto il 67,6% sullo stesso test. Un modello da 12 miliardi di parametri che batte un flagship da 27B? Con meno della metà della memoria? Già. E la licenza è cambiata. Gemma 4 viene distribuito sotto Apache 2.0, quindi l'uso commerciale è consentito, senza asterischi. Ha una finestra di contesto da 256K token e gira in circa 6,6 GB di VRAM una volta quantizzato. Quest'ultimo punto è la cosa più importante per la maggior parte di noi: questo modello entra in una GPU di fascia media.
Punti chiave
- Gemma 4 12B (rilasciato il 3 giugno 2026) segna 77,2% su MMLU Pro, superando Gemma 3 27B dell'anno scorso (67,6%).
- Gira in circa 6,6 GB di VRAM a Q4KM, adatto a GPU da 8GB; ~16GB offre ampio margine.
- Licenza Apache 2.0 (uso commerciale consentito), contesto da 256K, input audio e immagine nativi, architettura encoder-free.
- Un solo comando per eseguirlo:
ollama run gemma4:12b(download da 7,6 GB).
Cos'è Gemma 4 12B?
Gemma 4 12B è un modello open-weights da 12 miliardi di parametri di Google DeepMind, rilasciato il 3 giugno 2026 con licenza Apache 2.0. È un modello multimodale unificato senza encoder: testo, immagini e audio nativo in ingresso, testo in uscita. Ha una finestra di contesto da 256K token e supporta 140 lingue.
La variante instruction-tuned che userete effettivamente si chiama gemma-4-12B-it (dove "it" sta per instruction-tuned, la versione pronta per la chat). Ha 11,95 miliardi di parametri totali, quindi "12B" è un arrotondamento. I dati di addestramento si fermano a gennaio 2025.
Ecco cosa lo rende interessante: Gemma 4 12B è il primo Gemma di taglia media con input audio nativo. Non c'è un encoder audio separato aggiunto di peso. Le forme d'onda grezze si proiettano direttamente nel modello. Lo stesso vale per le immagini. Questa scelta di design è il motivo per cui rimane abbastanza compatto da girare su una singola scheda consumer, e tra poco vedremo perché.
Volete prima il quadro generale? La nostra guida su come eseguire modelli open in locale copre le basi di configurazione se siete nuovi agli LLM locali. Il post ufficiale di lancio di Google ha l'annuncio completo.
Gemma 4 12B: Specifiche a Colpo d'Occhio
Tutto verificato, in un'unica tabella.
| Specifica | Valore |
|---|---|
| Nome completo | Gemma 4 12B (gemma-4-12B-it) |
| Parametri | 11,95B (~12B) |
| Licenza | Apache 2.0 (uso commerciale consentito) |
| Finestra di contesto | 256K token |
| Modalità | Testo + immagine + audio nativo in ingresso, testo in uscita |
| Architettura | Unificata encoder-free, 48 layer, attenzione ibrida |
| Lingue | 140 |
| Data di cutoff | Gennaio 2025 |
| Tag Ollama | gemma4:12b (download da 7,6 GB) |
| Tag Apple Silicon | gemma4:12b-mlx |
| Sampling consigliato | temperature 1.0, top_p 0.95, top_k 64 |
Una nota sul sampling: attenetevi ai valori consigliati temperature=1.0, top_p=0.95, top_k=64 a meno che non abbiate un motivo preciso. I modelli Gemma si comportano in modo strano a temperature basse, quindi non scendete a 0,2 per abitudine come fareste con altri modelli.
Come Funziona l'Architettura Encoder-Free?
Encoder-free significa che non c'è un modello separato che converte immagini o audio prima che arrivino al language model. Le patch visive e le forme d'onda audio grezze si proiettano direttamente nello spazio di embedding condiviso attraverso layer lineari sottili. La maggior parte dei modelli multimodali aggancia un pesante encoder visivo all'LLM. Gemma 4 12B salta questo passaggio, ed è per questo che entra in 16GB.
Pensatelo come la differenza tra un traduttore e una persona bilingue. Il vecchio approccio assume un traduttore separato (l'encoder) per convertire le immagini in un linguaggio che il modello capisce, poi gli passa il risultato. Gemma 4 12B è bilingue fin dall'inizio. Dati audio e immagine parlano il linguaggio nativo del modello direttamente, attraverso un layer di proiezione leggero invece di un pesante encoder.
Internamente ha 48 layer con attenzione ibrida. La maggior parte dei layer usa una sliding window da 1024 token (economica, locale), intervallata da layer di attenzione globale occasionali che vedono l'intero contesto. È questa combinazione che gli permette di gestire un contesto da 256K senza mandare in crisi la GPU.

Il vantaggio pratico: meno parametri spesi sugli encoder significa più budget VRAM per il ragionamento effettivo. È questo il compromesso che permette a un modello da 12B di performare così al di sopra del suo peso.
Benchmark Gemma 4 12B: I Numeri Reali
Il titolo regge: Gemma 4 12B segna 77,2% su MMLU Pro, superando il 67,6% di Gemma 3 27B sullo stesso test, con meno della metà della VRAM. Questi sono i numeri ufficiali instruction-tuned (-it) di Google, non stime della community. Ecco il set completo.
| Benchmark | Gemma 4 12B | Gemma 3 27B (riferimento) |
|---|---|---|
| MMLU Pro | 77,2% | 67,6% |
| GPQA Diamond | 78,8% | — |
| MMMU Pro | 69,1% | — |
| AIME 2026 (senza strumenti) | 77,5% | — |
| LiveCodeBench v6 | 72,0% | — |
| Codeforces ELO | 1659 | — |
Un modello da 12B ora supera il flagship da 27B dell'anno scorso su MMLU Pro: 77,2% contro 67,6%. È il tipo di salto generazionale che fa rivedere i conti sull'hardware.

Due avvertenze oneste. Prima: i trattini indicano che Google non ha pubblicato un numero per Gemma 3 27B in quelle righe, quindi le celle restano vuote piuttosto che riempirsi con supposizioni. Seconda: tutti i punteggi qui si riferiscono al modello instruction-tuned. I numeri del modello base differiscono. Potete verificare tutto sul model card di HuggingFace e sulla pagina del modello di DeepMind.
Quanta VRAM Richiede Gemma 4 12B?
Gemma 4 12B richiede circa 6,6 GB di VRAM a quantizzazione Q4KM, il che significa che entra in una GPU da 8GB. Per un margine confortevole, specialmente se volete usare una buona parte del contesto da 256K, puntate a 16GB di VRAM o unified memory. Gira su un laptop. I Mac con chip M-series lo gestiscono perfettamente tramite unified memory.
La quantizzazione è semplicemente una compressione dei pesi del modello. Numeri a precisione inferiore, file più piccolo, leggermente meno accuratezza. Ecco come si mappano i livelli comuni.
| Quantizzazione | VRAM approssimativa | Qualità | Adatta a |
|---|---|---|---|
| Q4_K_M | ~6,6 GB | Quasi completa, perdita minima | Il default sensato; entra in GPU da 8GB |
| Q5_K_M | ~8,5 GB | Leggermente meglio di Q4 | Un po' di VRAM in più, si vuole più accuratezza |
| Q8 | ~13 GB | Qualità praticamente completa | GPU da 16GB+, fedeltà massima |
| QAT Q4_0 | ~6,6 GB | Quasi-FP a impronta Q4 | Miglior qualità per GB (rilasciato il 5 giugno) |

Se state scegliendo l'hardware per questo modello, la nostra panoramica degli strumenti per LLM locali che abbiamo analizzato copre quali backend sfruttano al meglio una determinata scheda. In breve: una scheda da 12GB esegue Q4 con margine, una da 8GB esegue Q4 se si mantiene il contesto modesto.
Velocità di Gemma 4 12B: Tokens/sec su Hardware Reale
Quanto è veloce? Dipende dalla scheda, dalla quantizzazione e dal backend, quindi invece di un numero unico abbiamo raccolto in un posto solo le cifre pubblicate da terze parti. Questi valori sono riportati da tester della community e vendor, attribuiti a ciascuna fonte. Non sono misurazioni di laboratorio proprie.
| Hardware | Quant | tokens/sec riportati | Fonte |
|---|---|---|---|
| RTX 3060 (6GB) | Q4_K_M | ~6,6 GB di impronta VRAM, funziona in locale (tok/s non riportato con precisione) | runaiathome |
| RTX 4090 (24GB) | Q4_K_M | Zona real-time-chat (tok/s specifico non ancora riportato) | apxml / community |
| Apple M-series (unified) | mlx / Q4 | Funziona via gemma4:12b-mlx (tok/s non ancora ampiamente riportato) | Ollama / community |
Ecco cosa dicono effettivamente i dati pubblici in questo momento. runaiathome ha confermato il modello in esecuzione su un RTX 3060 da 6GB nella sua impronta Q4KM di ~6,6 GB, che è il report hardware pubblicato più concreto finora. Il foglio delle specifiche di apxml e la pagina della libreria Ollama confermano che il modello gira in locale su un RTX 4090 da 24GB a Q4, comodamente in zona real-time-chat, ma un tok/s sostenuto preciso per quella scheda non è ancora pubblicato. La variante Apple Silicon gemma4:12b-mlx esiste e funziona, ma numeri di tok/s affidabili non sono emersi tre giorni dopo il lancio.
Cosa significa per voi, per categoria: su una scheda da 6GB come l'RTX 3060, aspettatevi che si carichi e giri per la chat locale, tenendo il contesto modesto. Su un RTX 4090 da 24GB a Q4KM, i report pubblicati lo collocano comodamente in zona real-time-chat. Su Apple Silicon, la build MLX funziona ma i numeri di benchmark sono ancora in arrivo.
Questi sono dati di terze parti pubblicati, non misurazioni di laboratorio proprie, quindi tratateli come orientativi. Il vostro tok/s dipende dalla lunghezza del prompt, dalla dimensione del contesto e dalla versione del backend. Fonti: la pagina della libreria Ollama, apxml e runaiathome. Man mano che arrivano altri benchmark dalla community nelle prossime due settimane, aggiorneremo questa tabella.
Come Eseguire Gemma 4 12B in Locale?
Il percorso più breve: installate Ollama, eseguite un comando, fatto. ollama run gemma4:12b scarica il modello da 7,6 GB e apre un prompt di chat. Nessun file di configurazione, nessun ambiente Python. Se volete più controllo o siete su Apple Silicon, ci sono altri quattro percorsi qui sotto.
1. Ollama (il default comodo). Scaricate ed eseguite in due righe:
ollama pull gemma4:12b
ollama run gemma4:12b2. llama.cpp con un GGUF. Se volete una quantizzazione specifica, puntate llama.cpp a un GGUF su HuggingFace. GGUF è il formato di file che llama.cpp usa per i pesi quantizzati:
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."3. MLX su Apple Silicon. I Mac con chip M-series hanno una build MLX dedicata che usa il framework di Apple invece di CUDA:
ollama run gemma4:12b-mlx4. LM Studio (interfaccia grafica, senza terminale). Preferite un'app desktop? Aprite LM Studio, andate alla scheda di ricerca e digitate gemma 4 12b. Scegliete un GGUF Q4KM e scaricate. LM Studio fa il resto, incluso un toggle per il server locale.
5. Interrogarlo via API. Ollama espone un endpoint compatibile con OpenAI sulla porta 11434, quindi il codice esistente funziona con una semplice sostituzione del base-URL:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:12b",
"messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
}'Una volta avviato da CLI, probabilmente vorrete un'interfaccia vera. Potete avvolgerlo in una UI stile ChatGPT con Open WebUI in circa cinque minuti. Nuovi a tutto questo? Iniziate con la nostra guida completa alla configurazione LLM locale. Per i consigli di sampling ufficiali e i percorsi di esecuzione, consultate ai.google.dev e la documentazione di Ollama.
Quale Quantizzazione Usare per Gemma 4 12B?
Per la maggior parte delle persone, Q4KM è il default sensato: circa 6,6 GB di VRAM, qualità quasi completa, e si adatta a GPU da 8GB. Se avete 16GB o più e volete fedeltà massima, passate a Q8. E se volete la miglior qualità per gigabyte disponibile ora, guardate i nuovi checkpoint QAT Q4_0.
Ecco l'aspetto di freschezza che pochi hanno ancora integrato. Il 5 giugno 2026, appena due giorni dopo il lancio, Google ha rilasciato checkpoint QAT (Quantization-Aware Training) Q4_0 insieme a un nuovo formato mobile. QAT significa che il modello è stato addestrato tenendo conto della quantizzazione, così mantiene una qualità quasi-FP (quasi piena precisione) a un'impronta Q4. Stessi ~6,6 GB, perdita di accuratezza notevolmente inferiore rispetto al Q4 post-training standard. Se siete limitati dalla VRAM ma sensibili alla qualità, questa è la scelta giusta.
Guida rapida alle decisioni:
- GPU da 8GB, si vuole semplicità: Q4KM.
- GPU da 8GB, si vuole la migliore qualità a quella dimensione: QAT Q4_0.
- GPU da 16GB+, si vuole fedeltà massima: Q8.
- Nel mezzo, un po' di VRAM in più: Q5KM.
Potete leggere il ragionamento di Google nel loro annuncio QAT. La conclusione: Q4KM va bene, QAT Q4_0 è meglio a parità di dimensione, e Q8 serve solo se l'accuratezza conta più della memoria.
Gemma 4 12B vs Gemma 3 12B vs Qwen 3.5: Vale l'Aggiornamento?
Sì, l'aggiornamento da Gemma 3 12B vale la pena se vi interessa la licenza Apache 2.0, l'input audio nativo, la finestra di contesto da 256K o il salto su MMLU Pro. Contro Qwen 3.5, è più competitivo. Gemma 4 12B vince su permissività della licenza e audio nativo, ma Qwen 3.5 conquista alcune righe dei benchmark della classe 12B. Scegliete in base alle vostre esigenze reali, non al titolo.
| Caratteristica | Gemma 4 12B | Gemma 3 12B | Qwen 3.5 (classe 12B) |
|---|---|---|---|
| Licenza | Apache 2.0 | Licenza Gemma custom | Apache 2.0 |
| Contesto | 256K | 128K | Fino a 256K |
| Modalità | Testo + immagine + audio | Testo + immagine | Testo + immagine |
| Audio nativo | Sì | No | No |
| MMLU Pro | 77,2% | Inferiore | Competitivo, vince alcune righe |
| VRAM Q4 | ~6,6 GB | ~6,6 GB | ~6,6 GB |
Il solo cambio di licenza giustifica il passaggio da Gemma 3 12B per molti team. Gemma 3 era distribuito con la licenza custom di Google con restrizioni d'uso; Gemma 4 è puro Apache 2.0. Se eravate in attesa su Gemma per ragioni commerciali, quell'ostacolo non c'è più.
Contro Qwen 3.5, siate onesti con voi stessi. Qwen 3.5 è genuinamente forte e supera Gemma 4 12B su certe righe di ragionamento e coding. Se l'input audio e una licenza permissiva non sono nella vostra lista, fate il benchmark di entrambi sul vostro task specifico prima di scegliere. Guardate dove Gemma 4 12B si posiziona tra i migliori modelli open per il panorama più ampio. E poiché è Apache 2.0, potete fare fine-tuning con Unsloth sotto Apache 2.0 senza problemi di licenza.
Quando NON Usare Gemma 4 12B
Evitate Gemma 4 12B se avete bisogno di un ragionamento al limite delle possibilità che solo un modello molto più grande può offrire, se Qwen 3.5 vince la specifica riga di benchmark da cui dipende il vostro workload, o se il vostro progetto si basa pesantemente su strumenti audio ancora immaturi tre giorni dopo il lancio. È un ottimo modello da 12B, non un modello magico.
Gemma 4 12B non è sempre la scelta giusta. Se avete bisogno di ragionamento al limite delle possibilità, un modello più grande vince ancora. Il supporto audio nativo è reale e impressionante, ma gli strumenti circostanti — librerie, utility di supporto, integrazioni con i framework — hanno pochi giorni di vita e sono grezzi in alcuni punti. Se state rilasciando un prodotto audio-intensive questa settimana, testate accuratamente prima di scommetterci.
Alcune ulteriori limitazioni oneste. Se lo integrate in un agente, verificate prima l'affidabilità del tool-calling sui vostri task, poiché il comportamento agentico varia da modello a modello. Se il vostro vantaggio è il contesto lungo, assicuratevi di sfruttare al meglio la finestra da 256K piuttosto che assumere che la dimensione grezza della finestra equivalga a un output migliore. E se state andando oltre le esecuzioni locali verso il serving in produzione, il percorso verso il serving in produzione copre vLLM e SGLang. Se state distribuendo modelli open come Gemma 4 12B in produzione, possiamo aiutarvi.
Informazioni sull'Autore
Mert Batur Gurbuz è co-fondatore di Techsy.io, dove il team sviluppa agenti AI, sistemi di automazione e pipeline voice/SDR per clienti B2B. Studia all'Università di Birmingham e scrive dello stack di strumenti LLM che il team di Techsy usa effettivamente in produzione. Collegati su LinkedIn.
Scegliere uno strumento è la parte facile. Farlo funzionare in modo affidabile dentro un prodotto reale è il punto in cui la maggior parte dei team si blocca, ed è esattamente ciò che il nostro team di integrazione AI costruisce per i clienti, dalle pipeline RAG agli agenti su misura.
Domande Frequenti
Come si esegue Gemma 4 12B in locale?
Installate Ollama, poi eseguite ollama run gemma4:12b. Questo scarica il modello da 7,6 GB e apre un prompt di chat. Non servono ambienti Python o file di configurazione. Se preferite un'app grafica, LM Studio funziona: cercate gemma 4 12b nel suo browser di modelli e scaricate una build Q4KM.
Quali sono i requisiti di VRAM e hardware per Gemma 4 12B?
Gemma 4 12B richiede circa 6,6 GB di VRAM a quantizzazione Q4KM, quindi entra in una GPU da 8GB. Per un margine confortevole, specialmente quando si usa il contesto lungo, puntate a 16GB di VRAM o unified memory. Gira su laptop, inclusi i Mac con chip M-series tramite unified memory.
Gemma 4 12B può girare su un laptop da 16GB?
Sì, facilmente. A Q4KM il modello usa circa 6,6 GB, lasciando ampio spazio su una macchina da 16GB. Sui laptop Apple Silicon la unified memory la gestisce bene tramite la build gemma4:12b-mlx. Potete anche passare a quantizzazione Q8 su 16GB per una fedeltà superiore.
Gemma 4 12B è davvero migliore di Llama o Qwen 3.5?
Dipende da cosa si misura. Gemma 4 12B vince sulla licenza Apache 2.0, l'input audio nativo e la finestra di contesto da 256K, e segna un solido 77,2% su MMLU Pro. Ma Qwen 3.5 conquista alcune righe di ragionamento e coding della classe 12B. Fate il benchmark di entrambi sul vostro task specifico prima di decidere.
Gemma 4 12B è migliore di Gemma 3 12B?
Sì. Gemma 4 12B passa alla permissiva licenza Apache 2.0, aggiunge input audio nativo, raddoppia la finestra di contesto a 256K token e segna un miglioramento significativo su MMLU Pro. Il solo cambio di licenza giustifica l'aggiornamento per i progetti commerciali bloccati dai termini custom di Gemma 3.
Quale quantizzazione usare per Gemma 4 12B?
Q4KM è il default sensato a circa 6,6 GB con qualità quasi completa. Se volete la miglior qualità a quella stessa dimensione, usate i nuovi checkpoint QAT Q4_0 rilasciati il 5 giugno 2026, che mantengono una qualità quasi piena precisione a un'impronta Q4. Usate Q8 solo se avete 16GB+ e avete bisogno di fedeltà massima.
Gemma 4 12B è gratuito per uso commerciale?
Sì. Gemma 4 12B viene distribuito sotto la licenza Apache 2.0, che consente l'uso commerciale senza le restrizioni della licenza Gemma custom di Gemma 3. Potete costruire prodotti commerciali, fare fine-tuning e ridistribuirlo. Quel cambio di licenza è uno dei motivi principali per cui i team stanno migrando da Gemma 3.
Gemma 4 12B supporta davvero l'input audio?
Sì. Gemma 4 12B è il primo Gemma di taglia media con input audio nativo. Grazie alla sua architettura encoder-free, le forme d'onda audio grezze si proiettano direttamente nel modello senza un encoder audio separato. Detto questo, gli strumenti circostanti sono nuovi di pochi giorni, quindi testate attentamente prima di rilasciare funzionalità audio-intensive in produzione.
Quanto è veloce Gemma 4 12B su un RTX 4090?
I report di terze parti pubblicati collocano Gemma 4 12B a Q4KM comodamente in zona real-time-chat su un RTX 4090 da 24GB, anche se un valore preciso di tokens/sec sostenuto non è ancora pubblicato tre giorni dopo il lancio. La velocità varia con la lunghezza del prompt, la dimensione del contesto e la versione del backend, quindi trattate le cifre iniziali come orientative.
Dove si scarica Gemma 4 12B?
Il modello instruction-tuned è su HuggingFace come google/gemma-4-12B-it, oppure potete scaricarlo tramite Ollama con ollama run gemma4:12b (un download da 7,6 GB). Gli utenti di LM Studio possono cercare gemma 4 12b nel browser di modelli dell'app. Per quantizzazioni specifiche, i file GGUF sono disponibili nei repo della community come Unsloth.