
Google DeepMind a livré Gemma 4 12B le 3 juin 2026. Trois jours plus tard, le chiffre qui circule partout est le score MMLU Pro : 77,2 %. Ça bat le Gemma 3 27B de l'an dernier, qui plafonnait à 67,6 % sur le même test. Un modèle à 12 milliards de paramètres qui surclasse un flagship à 27B ? Pour moins de la moitié de la mémoire ? Oui. Et la licence a changé aussi. Gemma 4 est sous Apache 2.0, donc l'usage commercial est libre, sans astérisques. Il embarque une fenêtre de contexte de 256K tokens et tourne dans environ 6,6 Go de VRAM une fois quantisé. C'est ce dernier point qui intéresse la plupart d'entre nous : ce modèle rentre sur un GPU milieu de gamme.
Points clés
- Gemma 4 12B (sorti le 3 juin 2026) obtient 77,2 % sur MMLU Pro, dépassant le Gemma 3 27B de l'an dernier (67,6 %).
- Il tourne dans ~6,6 Go de VRAM en Q4KM, ce qui rentre sur un GPU 8 Go ; ~16 Go offre une marge confortable.
- Licence Apache 2.0 (usage commercial autorisé), fenêtre de 256K tokens, entrées audio et image natives, architecture sans encodeur.
- Une seule commande pour le lancer :
ollama run gemma4:12b(téléchargement de 7,6 Go).
Qu'est-ce que Gemma 4 12B ?
Gemma 4 12B est un modèle open-weights à 12 milliards de paramètres signé Google DeepMind, publié le 3 juin 2026 sous licence Apache 2.0. C'est un modèle multimodal unifié sans encodeur : texte, image et audio natif en entrée, texte en sortie. Il dispose d'une fenêtre de contexte de 256K tokens et supporte 140 langues.
La variante instruction-tuned que vous allez réellement utiliser s'appelle gemma-4-12B-it (le « it » abrège instruction-tuned, la version prête pour le chat). Elle compte 11,95 milliards de paramètres au total, donc « 12B » est un arrondi léger. Les données d'entraînement s'arrêtent à janvier 2025.
Ce qui le rend intéressant : Gemma 4 12B est le premier Gemma de taille moyenne avec une entrée audio native. Pas d'encodeur audio séparé greffé dessus. Les formes d'onde brutes se projettent directement dans le modèle. Pareil pour les images. C'est ce choix d'architecture qui lui permet de rester assez léger pour tourner sur une carte grand public — on y revient dans un moment.
Vous voulez d'abord comprendre le contexte général ? Notre guide sur l'exécution de modèles ouverts sur votre propre machine couvre les bases de configuration si vous débutez avec les LLM locaux. Le billet d'annonce officiel de Google contient toute la présentation.
Gemma 4 12B : fiche technique complète
Tout est vérifié, dans un seul tableau. Pas de spéculation.
| Spécification | Valeur |
|---|---|
| Nom complet | Gemma 4 12B (gemma-4-12B-it) |
| Paramètres | 11,95B (~12B) |
| Licence | Apache 2.0 (usage commercial autorisé) |
| Fenêtre de contexte | 256K tokens |
| Modalités | Texte + image + audio natif en entrée, texte en sortie |
| Architecture | Unifiée sans encodeur, 48 couches, attention hybride |
| Langues | 140 |
| Limite de données d'entraînement | Janvier 2025 |
| Tag Ollama | gemma4:12b (7,6 Go à télécharger) |
| Tag Apple Silicon | gemma4:12b-mlx |
| Sampling recommandé | temperature 1.0, top_p 0.95, top_k 64 |
Une remarque sur le sampling : restez sur les valeurs recommandées temperature=1.0, top_p=0.95, top_k=64 sauf raison précise d'y déroger. Les modèles Gemma se comportent bizarrement aux basses températures, donc ne baissez pas réflexivement à 0.2 comme vous le feriez avec d'autres modèles.
Comment fonctionne l'architecture sans encodeur ?
Sans encodeur, il n'y a pas de modèle distinct qui convertit les images ou l'audio avant qu'ils n'atteignent le modèle de langage. Les patches visuels et les formes d'onde audio brutes se projettent directement dans l'espace d'embedding partagé via de fines couches linéaires. La plupart des modèles multimodaux greffent un encodeur visuel lourd sur le LLM. Gemma 4 12B supprime cette étape, d'où sa capacité à tenir dans 16 Go.
C'est comme la différence entre un interprète et une personne bilingue. L'approche classique embauche un interprète séparé (l'encodeur) pour convertir les images dans une langue que le modèle comprend, puis lui transmet le résultat. Gemma 4 12B est bilingue de naissance. Audio et image parlent directement le langage natif du modèle, via une couche de projection légère plutôt qu'un encodeur massif.
Sous le capot : 48 couches avec attention hybride. La plupart des couches utilisent une fenêtre glissante de 1024 tokens (locale, peu coûteuse), entrecoupées de couches d'attention globale qui voient l'intégralité du contexte. Ce mélange est ce qui permet de gérer un contexte de 256K sans faire fondre votre GPU.

Le bénéfice concret : moins de paramètres consacrés aux encodeurs signifie que davantage de votre budget VRAM va au raisonnement proprement dit. C'est le compromis qui permet à un modèle 12B de frapper aussi au-dessus de sa catégorie.
Benchmarks de Gemma 4 12B : les vrais chiffres
Le titre tient la route : Gemma 4 12B obtient 77,2 % sur MMLU Pro, dépassant le 67,6 % de Gemma 3 27B sur le même test, pour moins de la moitié de la VRAM. Ce sont les chiffres officiels du modèle instruction-tuned (-it) publiés par Google, pas des estimations communautaires. Voici l'ensemble complet.
| Benchmark | Gemma 4 12B | Gemma 3 27B (référence) |
|---|---|---|
| MMLU Pro | 77,2 % | 67,6 % |
| GPQA Diamond | 78,8 % | — |
| MMMU Pro | 69,1 % | — |
| AIME 2026 (sans outils) | 77,5 % | — |
| LiveCodeBench v6 | 72,0 % | — |
| Codeforces ELO | 1659 | — |
Un modèle 12B qui surclasse le flagship 27B de l'an dernier sur MMLU Pro : 77,2 % contre 67,6 %. C'est le genre de saut générationnel qui vous fait revoir vos calculs de configuration matérielle.

Deux mises en garde honnêtes. D'abord, les tirets signifient que Google n'a pas publié de chiffre Gemma 3 27B pour ces lignes ; les cellules restent vides plutôt que remplies d'estimations. Ensuite, tous les scores ici correspondent au modèle instruction-tuned. Les chiffres du modèle de base diffèrent. Vous pouvez vérifier tout cela sur la fiche HuggingFace du modèle et la page DeepMind du modèle.
Combien de VRAM faut-il pour Gemma 4 12B ?
Gemma 4 12B a besoin d'environ 6,6 Go de VRAM en quantisation Q4KM, ce qui signifie qu'il rentre sur un GPU 8 Go. Pour une marge confortable, surtout si vous voulez utiliser une bonne partie de ce contexte 256K, visez 16 Go de VRAM ou de mémoire unifiée. Il tourne sur un ordinateur portable. Les Mac M-series le gèrent très bien via la mémoire unifiée.
La quantisation, c'est simplement de la compression pour les poids du modèle. Des nombres en précision plus faible, un fichier plus petit, et une légère perte de qualité. Voici comment les niveaux courants se répartissent.
| Quantisation | VRAM approximative | Qualité | Idéal pour |
|---|---|---|---|
| Q4_K_M | ~6,6 Go | Quasi-intégrale, perte minime | Le choix par défaut raisonnable ; rentre sur les cartes 8 Go |
| Q5_K_M | ~8,5 Go | Légèrement meilleure que Q4 | Un peu de VRAM de spare, plus de précision souhaitée |
| Q8 | ~13 Go | Qualité pratiquement totale | Cartes 16 Go+, fidélité maximale |
| QAT Q4_0 | ~6,6 Go | Quasi-FP avec empreinte Q4 | Meilleure qualité par Go (sorti le 5 juin) |

Si vous choisissez du matériel autour de ce modèle, notre comparatif des outils LLM locaux que nous avons testés couvre quels backends tirent le meilleur parti d'une carte donnée. En résumé : une carte 12 Go fait tourner Q4 avec de la marge, une carte 8 Go fait tourner Q4 si vous gardez le contexte modeste.
Gemma 4 12B en pratique : tokens/sec sur du vrai matériel
À quelle vitesse tourne-t-il ? Cela dépend de votre carte, de votre quantisation et de votre backend. Plutôt qu'un chiffre unique, voici les données publiées par des tiers, regroupées au même endroit. Ces chiffres sont rapportés par des testeurs communautaires et des fournisseurs, avec attribution à chaque source. Ce ne sont pas nos propres mesures en laboratoire.
| Matériel | Quant | Tokens/sec rapportés | Source |
|---|---|---|---|
| RTX 3060 (6 Go) | Q4_K_M | ~6,6 Go d'empreinte VRAM, tourne en local (tok/s non précisément rapporté) | runaiathome |
| RTX 4090 (24 Go) | Q4_K_M | Plage chat temps réel (tok/s spécifique pas encore rapporté) | apxml / communauté |
| Apple M-series (mémoire unifiée) | mlx / Q4 | Tourne via gemma4:12b-mlx (tok/s pas encore largement rapporté) | Ollama / communauté |
Voici ce que les données publiques disent réellement à ce stade. runaiathome a confirmé que le modèle tourne sur un RTX 3060 6 Go dans son empreinte Q4KM de ~6,6 Go, ce qui est le rapport matériel publié le plus concret à ce jour. La fiche technique d'apxml et la page Ollama confirment que le modèle sert localement sur un RTX 4090 24 Go en Q4, confortablement dans la plage chat temps réel, mais un tok/s soutenu précis n'est pas encore publié pour cette carte. La variante gemma4:12b-mlx pour Apple Silicon existe et tourne, mais des chiffres de tok/s fiables n'ont pas encore émergé trois jours après le lancement.
Ce que cela signifie selon votre configuration : sur une carte 6 Go comme le RTX 3060, attendez-vous à charger le modèle et à l'utiliser pour du chat local, en gardant une fenêtre de contexte modeste. Sur un RTX 4090 24 Go en Q4KM, les rapports publiés le placent confortablement dans la plage chat temps réel. Sur Apple Silicon, le build MLX tourne mais les chiffres de benchmark arrivent encore au compte-gouttes.
Ce sont des chiffres publiés par des tiers, pas nos propres mesures en laboratoire, donc traitez-les comme des ordres de grandeur. Votre tok/s dépend de la longueur du prompt, de la taille du contexte et de la version du backend. Sources : la page de la bibliothèque Ollama, apxml et runaiathome. À mesure que les benchmarks communautaires arrivent dans les deux prochaines semaines, nous mettrons ce tableau à jour.
Comment faire tourner Gemma 4 12B en local ?
Le chemin le plus court : installez Ollama, lancez une commande, c'est fait. ollama run gemma4:12b télécharge le modèle de 7,6 Go et vous ouvre une invite de chat. Pas de fichiers de config, pas d'environnement Python. Si vous voulez plus de contrôle ou si vous êtes sur Apple Silicon, il y a quatre autres approches ci-dessous.
1. Ollama (la valeur par défaut simple). Téléchargement et lancement en deux lignes :
ollama pull gemma4:12b
ollama run gemma4:12b2. llama.cpp avec un GGUF. Si vous voulez une quantisation spécifique, pointez llama.cpp vers un GGUF sur HuggingFace. GGUF est le format de fichier que llama.cpp utilise pour les poids quantisés :
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."3. MLX sur Apple Silicon. Les Mac M-series disposent d'un build MLX dédié qui utilise le framework d'Apple au lieu de CUDA :
ollama run gemma4:12b-mlx4. LM Studio (interface graphique, sans terminal). Vous préférez une appli bureau ? Ouvrez LM Studio, cliquez sur l'onglet de recherche et tapez gemma 4 12b. Choisissez un GGUF Q4KM et téléchargez. LM Studio gère le reste, y compris un toggle de serveur local.
5. Requête via l'API. Ollama expose un endpoint compatible OpenAI sur le port 11434, donc le code existant fonctionne avec un simple changement d'URL de base :
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:12b",
"messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
}'Une fois le modèle lancé en CLI, vous voudrez probablement une vraie interface. Vous pouvez l'envelopper dans une UI façon ChatGPT avec Open WebUI en cinq minutes environ. Vous débutez entièrement ? Commencez par notre guide complet de configuration LLM local. Pour les recommandations de sampling officielles et les chemins d'exécution, consultez ai.google.dev et la documentation Ollama.
Quelle quantisation choisir pour Gemma 4 12B ?
Pour la plupart des usages, Q4KM est le choix raisonnable par défaut : environ 6,6 Go de VRAM, qualité quasi-intégrale, et ça rentre sur un GPU 8 Go. Si vous avez 16 Go ou plus et voulez la fidélité maximale, passez à Q8. Et si vous voulez la meilleure qualité par gigaoctet disponible en ce moment, regardez les nouveaux checkpoints QAT Q4_0.
Voici l'angle fraîcheur que peu de gens ont encore intégré. Le 5 juin 2026, deux jours seulement après le lancement, Google a publié des checkpoints QAT Q4_0 (Quantization-Aware Training) accompagnés d'un nouveau format mobile. QAT signifie que le modèle a été entraîné en ayant la quantisation en tête, ce qui lui permet de conserver une qualité quasi-FP (quasi-précision complète) avec une empreinte Q4. Les mêmes ~6,6 Go, mais avec une perte de précision nettement moindre qu'un Q4 post-entraînement standard. Si vous êtes limité en VRAM mais soucieux de qualité, c'est votre choix.
Guide de décision rapide :
- Carte 8 Go, simplicité souhaitée : Q4KM.
- Carte 8 Go, meilleure qualité à cette taille : QAT Q4_0.
- Carte 16 Go+, fidélité maximale : Q8.
- Entre les deux, un peu de VRAM de spare : Q5KM.
Vous pouvez lire le raisonnement de Google dans leur annonce QAT. Le résumé : Q4KM convient, QAT Q4_0 est meilleur à la même taille, et Q8 n'est nécessaire que si la précision compte plus que la mémoire.
Gemma 4 12B vs Gemma 3 12B vs Qwen 3.5 : vaut-il la peine de passer à la nouvelle version ?
Oui, le passage depuis Gemma 3 12B vaut le coup si vous tenez à la licence Apache 2.0, à l'entrée audio native, à la fenêtre de contexte 256K ou au saut sur MMLU Pro. Face à Qwen 3.5, c'est plus serré. Gemma 4 12B gagne sur la permissivité de la licence et l'audio natif, mais Qwen 3.5 prend certaines lignes de benchmark en catégorie 12B. Choisissez selon vos besoins réels, pas selon le titre accrocheur.
| Caractéristique | Gemma 4 12B | Gemma 3 12B | Qwen 3.5 (classe 12B) |
|---|---|---|---|
| Licence | Apache 2.0 | Licence Gemma personnalisée | Apache 2.0 |
| Contexte | 256K | 128K | Jusqu'à 256K |
| Modalités | Texte + image + audio | Texte + image | Texte + image |
| Audio natif | Oui | Non | Non |
| MMLU Pro | 77,2 % | Inférieur | Compétitif, prend quelques lignes |
| VRAM Q4 | ~6,6 Go | ~6,6 Go | ~6,6 Go |
Le changement de licence justifie à lui seul la migration depuis Gemma 3 12B pour beaucoup d'équipes. Gemma 3 était sous la licence personnalisée de Google avec des restrictions d'usage ; Gemma 4 est en Apache 2.0 pur. Si vous hésitiez à utiliser Gemma pour des raisons commerciales, ce verrou est levé.
Face à Qwen 3.5, soyez honnête avec vous-même. Qwen 3.5 est vraiment solide et devance Gemma 4 12B sur certaines lignes de raisonnement et de code. Si l'entrée audio et une licence permissive ne sont pas dans votre liste de critères, faites le benchmark des deux sur votre propre tâche avant de vous engager. Consultez la place de Gemma 4 12B parmi les meilleurs modèles open source pour voir le tableau d'ensemble. Et puisqu'il est sous Apache 2.0, vous pouvez le fine-tuner avec Unsloth sans vous soucier de la licence.
Quand ne pas utiliser Gemma 4 12B
Passez votre chemin si vous avez besoin d'un raisonnement de niveau frontier que seul un modèle bien plus grand peut fournir, si Qwen 3.5 gagne sur la ligne de benchmark spécifique dont dépend votre charge de travail, ou si votre projet s'appuie fortement sur des outils audio dont l'écosystème n'a que trois jours d'existence. C'est un excellent modèle 12B, pas un modèle magique.
Gemma 4 12B n'est pas toujours le bon choix. Si vous avez besoin d'un raisonnement de niveau frontier, un modèle plus grand gagne encore. Le support audio natif est réel et impressionnant, mais l'outillage autour, les bibliothèques, les utilitaires, les intégrations de frameworks, n'a que quelques jours et reste brut par endroits. Si vous livrez un produit fortement basé sur l'audio cette semaine, testez soigneusement avant de miser dessus.
Quelques autres raisons honnêtes de ne pas l'utiliser. Si vous l'intégrez dans un agent, vérifiez d'abord la fiabilité des appels d'outils sur vos tâches spécifiques, car le comportement agentique varie selon les modèles. Si votre avantage réside dans le long contexte, assurez-vous de tirer le meilleur parti de la fenêtre de 256K tokens plutôt que de supposer que la taille de la fenêtre suffit à améliorer les résultats. Et si vous passez des exécutions locales au service en production, le guide de serving en production au-delà du local couvre vLLM et SGLang. Si vous déployez des modèles ouverts comme Gemma 4 12B en production, nous pouvons vous aider.
À propos de l'auteur
Mert Batur Gurbuz est co-fondateur de Techsy.io, où l'équipe développe des agents IA, des systèmes d'automatisation et des pipelines voix/SDR pour des clients B2B. Il étudie à l'Université de Birmingham et écrit sur la stack d'outils LLM que l'équipe Techsy utilise réellement en production. Retrouvez-le sur LinkedIn.
Choisir un outil, c'est la partie facile. Le faire tourner de manière fiable dans un vrai produit, c'est là que la plupart des équipes bloquent, et c'est exactement ce que notre équipe d'intégration IA construit pour ses clients, des pipelines RAG aux agents sur mesure.
Foire aux questions
Comment faire tourner Gemma 4 12B en local ?
Installez Ollama, puis lancez ollama run gemma4:12b. Cela télécharge le modèle de 7,6 Go et ouvre une invite de chat. Pas d'environnement Python ni de fichiers de configuration nécessaires. Si vous préférez une application graphique, LM Studio fonctionne aussi : cherchez gemma 4 12b dans son navigateur de modèles et téléchargez un build Q4KM.
Quels sont les besoins en VRAM et en matériel pour Gemma 4 12B ?
Gemma 4 12B a besoin d'environ 6,6 Go de VRAM en quantisation Q4KM, ce qui rentre sur un GPU 8 Go. Pour une marge confortable, surtout lors de l'utilisation du long contexte, visez 16 Go de VRAM ou de mémoire unifiée. Il tourne sur des ordinateurs portables, y compris les Mac M-series via la mémoire unifiée.
Gemma 4 12B peut-il tourner sur un ordinateur portable avec 16 Go ?
Oui, facilement. En Q4KM, le modèle utilise environ 6,6 Go, ce qui laisse beaucoup de place sur un appareil 16 Go. Sur les Mac Apple Silicon, la mémoire unifiée le gère très bien via le build gemma4:12b-mlx. Vous pouvez même passer à la quantisation Q8 sur 16 Go pour une meilleure fidélité.
Gemma 4 12B est-il vraiment meilleur que Llama ou Qwen 3.5 ?
Ça dépend de ce que vous mesurez. Gemma 4 12B gagne sur la licence Apache 2.0, l'entrée audio native et une fenêtre de contexte de 256K tokens, et il affiche un solide 77,2 % sur MMLU Pro. Mais Qwen 3.5 prend certaines lignes de raisonnement et de code en catégorie 12B. Faites le benchmark des deux sur votre propre tâche avant de décider.
Gemma 4 12B est-il meilleur que Gemma 3 12B ?
Oui. Gemma 4 12B passe à la licence permissive Apache 2.0, ajoute l'entrée audio native, double la fenêtre de contexte à 256K tokens et affiche une amélioration significative sur MMLU Pro. Le changement de licence justifie à lui seul la migration pour les projets commerciaux bloqués par les conditions personnalisées de Gemma 3.
Quelle quantisation utiliser pour Gemma 4 12B ?
Q4KM est le choix raisonnable par défaut, avec environ 6,6 Go et une qualité quasi-intégrale. Si vous voulez la meilleure qualité à cette même taille, utilisez les nouveaux checkpoints QAT Q4_0 publiés le 5 juin 2026, qui conservent une qualité quasi-précision complète avec une empreinte Q4. Utilisez Q8 seulement si vous avez 16 Go+ et avez besoin de la fidélité maximale.
Gemma 4 12B est-il gratuit pour un usage commercial ?
Oui. Gemma 4 12B est publié sous la licence Apache 2.0, qui autorise l'usage commercial sans les restrictions d'usage de la licence Gemma personnalisée de Gemma 3. Vous pouvez développer des produits commerciaux, le fine-tuner et le redistribuer. Ce changement de licence est l'une des principales raisons pour lesquelles les équipes migrent depuis Gemma 3.
Gemma 4 12B supporte-t-il vraiment l'entrée audio ?
Oui. Gemma 4 12B est le premier Gemma de taille moyenne avec une entrée audio native. Grâce à son design sans encodeur, les formes d'onde audio brutes se projettent directement dans le modèle sans encodeur audio séparé. Cela dit, l'outillage autour n'a que quelques jours, donc testez soigneusement avant de mettre en production des fonctionnalités fortement audio.
Quelle est la vitesse de Gemma 4 12B sur un RTX 4090 ?
Les rapports publiés par des tiers placent Gemma 4 12B en Q4KM confortablement dans la plage chat temps réel sur un RTX 4090 24 Go, bien qu'un tok/s soutenu précis ne soit pas encore publié trois jours après le lancement. La vitesse varie selon la longueur du prompt, la taille du contexte et la version du backend, donc traitez les chiffres actuels comme des ordres de grandeur.
Où télécharger Gemma 4 12B ?
Le modèle instruction-tuned est disponible sur HuggingFace sous google/gemma-4-12B-it, ou vous pouvez le télécharger via Ollama avec ollama run gemma4:12b (7,6 Go à télécharger). Les utilisateurs de LM Studio peuvent chercher gemma 4 12b dans le navigateur de modèles de l'application. Pour des quantisations spécifiques, les fichiers GGUF sont disponibles dans des dépôts communautaires comme Unsloth.