
Google DeepMind lanzó Gemma 4 12B el 3 de junio de 2026. Tres días después, el número que todos repiten es el resultado en MMLU Pro: 77,2%. Eso supera al Gemma 3 27B del año pasado, que obtuvo 67,6% en la misma prueba. ¿Un modelo de 12 mil millones de parámetros superando a uno de 27B? Con menos de la mitad de memoria. Y la licencia también cambió: Gemma 4 viene bajo Apache 2.0, así que el uso comercial está permitido sin asteriscos. Tiene una ventana de contexto de 256K tokens y funciona con unos 6,6 GB de VRAM una vez cuantizado. Esa última parte es la clave para la mayoría: este modelo cabe en una GPU de gama media.
Puntos Clave
- Gemma 4 12B (lanzado el 3 de junio de 2026) obtiene 77,2% en MMLU Pro, superando al Gemma 3 27B (67,6%).
- Funciona con ~6,6 GB de VRAM en Q4KM, cabiendo en una GPU de 8 GB; ~16 GB da margen cómodo.
- Licencia Apache 2.0 (uso comercial OK), contexto de 256K, entrada nativa de audio e imagen, arquitectura sin encoder.
- Un comando para ejecutarlo:
ollama run gemma4:12b(descarga de 7,6 GB).
¿Qué Es Gemma 4 12B?
Gemma 4 12B es un modelo de código abierto con 12 mil millones de parámetros de Google DeepMind, lanzado el 3 de junio de 2026 bajo licencia Apache 2.0. Es un modelo multimodal unificado sin encoder: texto, imagen y audio nativo entran, texto sale. Tiene una ventana de contexto de 256K tokens y admite 140 idiomas.
La variante ajustada por instrucciones que usarás es gemma-4-12B-it (la "it" es de instruction-tuned, la versión lista para chat). Tiene 11,95B de parámetros en total, así que "12B" es un redondeo al alza. Los datos de entrenamiento tienen un corte en enero de 2025.
Aquí está la parte que lo hace interesante: Gemma 4 12B es el primer Gemma de tamaño medio con entrada de audio nativa. No hay un encoder de audio separado añadido. Las formas de onda brutas se proyectan directamente al modelo. Lo mismo con las imágenes. Esa decisión de diseño es por qué sigue siendo lo suficientemente pequeño para ejecutarse en una sola tarjeta de consumidor, y veremos el porqué en un momento.
¿Quieres el panorama general primero? Nuestra guía para ejecutar modelos abiertos en tu propia máquina cubre los fundamentos si eres nuevo en LLMs locales. El post oficial de lanzamiento de Google tiene el anuncio completo.
Especificaciones de Gemma 4 12B de un Vistazo
Todo verificado, en una tabla. Sin suposiciones.
| Especificación | Valor |
|---|---|
| Nombre completo | Gemma 4 12B (gemma-4-12B-it) |
| Parámetros | 11,95B (~12B) |
| Licencia | Apache 2.0 (uso comercial OK) |
| Ventana de contexto | 256K tokens |
| Modalidades | Texto + imagen + audio nativo de entrada, texto de salida |
| Arquitectura | Unificada sin encoder, 48 capas, atención híbrida |
| Idiomas | 140 |
| Corte de entrenamiento | Enero de 2025 |
| Tag de Ollama | gemma4:12b (descarga de 7,6 GB) |
| Tag para Apple Silicon | gemma4:12b-mlx |
| Muestreo recomendado | temperature 1.0, top_p 0.95, top_k 64 |
Una nota sobre el muestreo: mantén los valores recomendados temperature=1.0, top_p=0.95, top_k=64 salvo que tengas un motivo concreto para cambiarlos. Los modelos Gemma se comportan de forma extraña a temperaturas bajas, así que no lo bajes a 0,2 por costumbre como harías con otros modelos.
¿Cómo Funciona la Arquitectura Sin Encoder?
Sin encoder significa que no hay un modelo separado convirtiendo imágenes o audio antes de que lleguen al modelo de lenguaje. Los parches de visión y las formas de onda de audio en bruto se proyectan directamente al espacio de embeddings compartido a través de capas lineales ligeras. La mayoría de los modelos multimodales acoplan un encoder de visión pesado al LLM. Gemma 4 12B se salta eso, razón por la que cabe en 16 GB.
Piénsalo como un traductor versus una persona bilingüe. El enfoque antiguo contrata a un traductor separado (el encoder) para convertir imágenes a un lenguaje que el modelo entiende, y luego las pasa. Gemma 4 12B es bilingüe desde el nacimiento. Los datos de audio e imagen hablan el idioma nativo del modelo directamente, a través de una capa de proyección ligera en lugar de un encoder voluminoso.
Por dentro tiene 48 capas con atención híbrida. La mayoría de las capas usan una ventana deslizante de 1024 tokens (económica, local), intercaladas con capas de atención global ocasionales que ven todo el contexto. Esa mezcla es cómo maneja un contexto de 256K sin fundir tu GPU.

El beneficio práctico: menos parámetros gastados en encoders significa que más de tu presupuesto de VRAM va al razonamiento real. Ese es el intercambio que permite a un modelo de 12B rendir muy por encima de su peso.
Benchmarks de Gemma 4 12B: Los Números Reales
El titular se sostiene: Gemma 4 12B obtiene 77,2% en MMLU Pro, superando el 67,6% de Gemma 3 27B en la misma prueba, con menos de la mitad de VRAM. Estos son los números oficiales del modelo ajustado por instrucciones (-it) de Google, no estimaciones de la comunidad. Aquí está el conjunto completo.
| Benchmark | Gemma 4 12B | Gemma 3 27B (referencia) |
|---|---|---|
| MMLU Pro | 77,2% | 67,6% |
| GPQA Diamond | 78,8% | — |
| MMMU Pro | 69,1% | — |
| AIME 2026 (sin herramientas) | 77,5% | — |
| LiveCodeBench v6 | 72,0% | — |
| Codeforces ELO | 1659 | — |
Un modelo de 12B ahora supera al buque insignia de 27B del año pasado en MMLU Pro: 77,2% frente a 67,6%. Es el tipo de salto generacional que te hace repasar los cálculos de hardware.

Dos advertencias honestas. Primero, los guiones significan que Google no publicó un número de Gemma 3 27B para esas filas, así que las celdas quedan en blanco en lugar de rellenarse con suposiciones. Segundo, cada puntuación aquí es del modelo ajustado por instrucciones. Los números del modelo base difieren. Puedes verificar todos estos en la tarjeta del modelo en HuggingFace y la página del modelo de DeepMind.
¿Cuánta VRAM Necesita Gemma 4 12B?
Gemma 4 12B necesita unos 6,6 GB de VRAM con cuantización Q4KM, lo que significa que cabe en una GPU de 8 GB. Para tener margen cómodo, especialmente si quieres usar una parte de ese contexto de 256K, apunta a 16 GB de VRAM o memoria unificada. Funciona en un portátil. Los Mac con chip M lo manejan perfectamente a través de memoria unificada.
La cuantización es simplemente compresión para los pesos del modelo. Números de menor precisión, archivo más pequeño, un poco menos de precisión. Así es cómo se mapean los niveles más comunes.
| Cuantización | VRAM aprox. | Calidad | Mejor para |
|---|---|---|---|
| Q4_K_M | ~6,6 GB | Casi completa, pérdida mínima | El predeterminado razonable; cabe en tarjetas de 8 GB |
| Q5_K_M | ~8,5 GB | Ligeramente mejor que Q4 | Un poco de VRAM extra, más precisión |
| Q8 | ~13 GB | Calidad efectivamente completa | Tarjetas de 16 GB+, máxima fidelidad |
| QAT Q4_0 | ~6,6 GB | Cerca de FP con huella de Q4 | Mejor calidad por GB (lanzado el 5 de junio) |

Si estás eligiendo hardware para este modelo, nuestro análisis de las herramientas de LLM local que comparamos cubre qué backends sacan el máximo partido de cada tarjeta. La versión corta: una tarjeta de 12 GB ejecuta Q4 con margen de sobra, una de 8 GB ejecuta Q4 si mantienes el contexto modesto.
Velocidad de Gemma 4 12B: Tokens/sec en Hardware Real
¿Qué tan rápido es? Depende de tu tarjeta, tu cuantización y tu backend, así que en lugar de un solo número recopilamos las cifras publicadas por terceros en un solo lugar. Estas son reportadas por testers de la comunidad y proveedores, atribuidas a cada fuente. No son nuestros propios números de laboratorio.
| Hardware | Cuant | Tokens/sec reportados | Fuente |
|---|---|---|---|
| RTX 3060 (6 GB) | Q4_K_M | ~6,6 GB de huella VRAM, funciona localmente (tok/s no reportados con precisión) | runaiathome |
| RTX 4090 (24 GB) | Q4_K_M | Rango de chat en tiempo real (tok/s específico aún no reportado) | apxml / comunidad |
| Apple M-series (unificada) | mlx / Q4 | Funciona vía gemma4:12b-mlx (tok/s aún no ampliamente reportados) | Ollama / comunidad |
Aquí está la situación real con los datos públicos disponibles hasta ahora. runaiathome confirmó que el modelo funciona en un RTX 3060 de 6 GB dentro de su huella de ~6,6 GB en Q4KM, que es el informe de hardware publicado más concreto hasta ahora. La hoja de especificaciones de apxml y la página de la biblioteca de Ollama confirman que el modelo sirve localmente en un RTX 4090 de 24 GB en Q4, cómodamente en territorio de chat en tiempo real, pero no se ha publicado aún una cifra de tok/s sostenidos precisa para esa tarjeta. La variante gemma4:12b-mlx para Apple Silicon existe y funciona, pero no han surgido números fiables de tok/s tres días después del lanzamiento.
Lo que significa esto para ti, por nivel: en una tarjeta de 6 GB como el RTX 3060, espera que se cargue y funcione para chat local, solo mantén la ventana de contexto modesta. En un RTX 4090 de 24 GB en Q4KM, los informes publicados lo sitúan cómodamente en territorio de chat en tiempo real. En Apple Silicon, la build MLX funciona pero los números de benchmark siguen llegando.
Estas son cifras publicadas por terceros, no nuestros propios números de laboratorio, así que trátalas como aproximadas. Tus tok/s dependen de la longitud del prompt, el tamaño del contexto y la versión del backend. Fuentes: la página de la biblioteca de Ollama, apxml y runaiathome. A medida que lleguen más benchmarks de la comunidad durante las próximas dos semanas, actualizaremos esta tabla.
¿Cómo Ejecutar Gemma 4 12B en Local?
El camino más corto: instala Ollama, ejecuta un comando, listo. ollama run gemma4:12b descarga el modelo de 7,6 GB y te deja en un prompt de chat. Sin archivos de configuración, sin entorno de Python. Si quieres más control o estás en Apple Silicon, hay cuatro opciones más abajo.
1. Ollama (el predeterminado fácil). Descarga y ejecuta en dos líneas:
ollama pull gemma4:12b
ollama run gemma4:12b2. llama.cpp con un GGUF. Si quieres una cuantización específica, apunta llama.cpp a un GGUF en HuggingFace. GGUF es el formato de archivo que llama.cpp usa para los pesos cuantizados:
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."3. MLX en Apple Silicon. Los Mac con chip M-series tienen una build MLX dedicada que usa el framework de Apple en lugar de CUDA:
ollama run gemma4:12b-mlx4. LM Studio (GUI, sin terminal). ¿Prefieres una aplicación de escritorio? Abre LM Studio, ve a la pestaña de búsqueda y escribe gemma 4 12b. Elige un GGUF Q4KM y descárgalo. LM Studio se encarga del resto, incluyendo un toggle de servidor local.
5. Consultas vía API. Ollama expone un endpoint compatible con OpenAI en el puerto 11434, así que el código existente funciona con un cambio de una línea en la URL base:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:12b",
"messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
}'Una vez que lo tengas corriendo en la CLI, probablemente quieras una interfaz real. Puedes añadirle una UI estilo ChatGPT con Open WebUI en unos cinco minutos. ¿Nuevo en todo esto? Comienza con nuestra guía completa de configuración de LLM local. Para las recomendaciones oficiales de muestreo y rutas de ejecución, consulta ai.google.dev y la documentación de Ollama.
¿Qué Cuantización Deberías Usar para Gemma 4 12B?
Para la mayoría, Q4KM es el predeterminado razonable: unos 6,6 GB de VRAM, calidad casi completa, y cabe en una GPU de 8 GB. Si tienes 16 GB o más y quieres máxima fidelidad, sube a Q8. Y si quieres la mejor calidad por gigabyte disponible ahora mismo, mira los nuevos checkpoints QAT Q4_0.
Aquí está el ángulo fresco que nadie ha incorporado todavía. El 5 de junio de 2026, solo dos días después del lanzamiento, Google publicó checkpoints de Quantization-Aware-Training (QAT) Q4_0 junto con un nuevo formato móvil. QAT significa que el modelo fue entrenado con la cuantización en mente, así que mantiene una calidad casi-FP (casi de precisión completa) con una huella de Q4. Los mismos ~6,6 GB, con una pérdida de precisión notablemente menor que el Q4 estándar post-entrenamiento. Si tienes restricciones de VRAM pero te importa la calidad, esa es tu opción.
Guía rápida de decisión:
- Tarjeta de 8 GB, quieres algo simple: Q4KM.
- Tarjeta de 8 GB, quieres la mejor calidad a ese tamaño: QAT Q4_0.
- Tarjeta de 16 GB+, quieres máxima fidelidad: Q8.
- En medio, un poco de VRAM extra: Q5KM.
Puedes leer el razonamiento de Google en su anuncio de QAT. La conclusión: Q4KM está bien, QAT Q4_0 es mejor al mismo tamaño, y solo necesitas Q8 si la precisión importa más que la memoria.
Gemma 4 12B vs Gemma 3 12B vs Qwen 3.5: ¿Vale la Pena el Cambio?
Sí, la actualización desde Gemma 3 12B vale la pena si te importa la licencia Apache 2.0, la entrada de audio nativa, la ventana de contexto de 256K o el salto en MMLU Pro. Contra Qwen 3.5, la cosa está más reñida. Gemma 4 12B gana en permisividad de licencia y audio nativo, pero Qwen 3.5 gana en algunas filas de benchmark de la clase 12B. Elige según tus necesidades reales, no el titular.
| Característica | Gemma 4 12B | Gemma 3 12B | Qwen 3.5 (clase 12B) |
|---|---|---|---|
| Licencia | Apache 2.0 | Licencia Gemma personalizada | Apache 2.0 |
| Contexto | 256K | 128K | Hasta 256K |
| Modalidades | Texto + imagen + audio | Texto + imagen | Texto + imagen |
| Audio nativo | Sí | No | No |
| MMLU Pro | 77,2% | Menor | Competitivo, gana algunas filas |
| VRAM en Q4 | ~6,6 GB | ~6,6 GB | ~6,6 GB |
El cambio de licencia por sí solo justifica el movimiento desde Gemma 3 12B para muchos equipos. Gemma 3 venía con la licencia personalizada de Google con restricciones de uso; Gemma 4 es Apache 2.0 puro. Si estabas evitando Gemma por razones comerciales, ese obstáculo ya no existe.
Contra Qwen 3.5, sé honesto contigo mismo. Qwen 3.5 es genuinamente sólido y supera a Gemma 4 12B en ciertas filas de razonamiento y código. Si la entrada de audio y una licencia permisiva no están en tu lista, compara ambos en tu tarea específica antes de comprometerte. Mira dónde se sitúa Gemma 4 12B entre los mejores modelos abiertos para el panorama más amplio. Y dado que es Apache 2.0, puedes ajustarlo con Unsloth bajo Apache 2.0 sin complicaciones de licencia.
Cuándo NO Usar Gemma 4 12B
Descarta Gemma 4 12B si necesitas razonamiento de nivel frontera que solo entrega un modelo mucho más grande, si Qwen 3.5 gana la fila de benchmark específica de la que depende tu carga de trabajo, o si tu proyecto depende mucho de herramientas de audio que aún maduran tres días después del lanzamiento. Es un excelente modelo de 12B, no uno mágico.
Gemma 4 12B no siempre es la opción correcta. Si necesitas razonamiento de nivel frontera, un modelo más grande sigue ganando. El soporte de audio nativo es real e impresionante, pero el ecosistema circundante — bibliotecas, utilidades de ayuda, integraciones de frameworks — tiene días de vida y es rugoso en algunos aspectos. Si estás lanzando un producto centrado en audio esta semana, prueba a fondo antes de apostar por él.
Algunos descalificadores más honestos. Si lo estás integrando en un agente, confirma primero la fiabilidad de las llamadas a herramientas en tus tareas, ya que el comportamiento agéntico varía por modelo. Si tu ventaja es el contexto largo, asegúrate de aprovechar al máximo la ventana de contexto de 256K en lugar de asumir que el tamaño bruto de la ventana equivale a mejor output. Y si estás pasando de ejecuciones locales a producción, la ruta de servicio en producción más allá del entorno local cubre vLLM y SGLang. Si estás desplegando modelos abiertos como Gemma 4 12B en producción, podemos ayudarte.
Sobre el Autor
Mert Batur Gürbüz es cofundador de Techsy.io, donde el equipo desarrolla agentes de IA, sistemas de automatización y pipelines de voz/SDR para clientes B2B. Estudia en la Universidad de Birmingham y escribe sobre el stack de herramientas LLM que el equipo de Techsy usa en producción. Conéctate en LinkedIn.
Elegir una herramienta es la parte fácil. Hacer que funcione de forma fiable dentro de un producto real es donde la mayoría de los equipos se atasca, y eso es exactamente lo que nuestro equipo de integración de IA construye para sus clientes, desde pipelines RAG hasta agentes a medida.
Preguntas Frecuentes
¿Cómo ejecuto Gemma 4 12B en local?
Instala Ollama y luego ejecuta ollama run gemma4:12b. Eso descarga el modelo de 7,6 GB y abre un prompt de chat. No se necesita entorno de Python ni archivos de configuración. Si prefieres una aplicación gráfica, LM Studio también funciona: busca gemma 4 12b en su navegador de modelos y descarga una build Q4KM.
¿Cuáles son los requisitos de VRAM y hardware para Gemma 4 12B?
Gemma 4 12B necesita unos 6,6 GB de VRAM con cuantización Q4KM, así que cabe en una GPU de 8 GB. Para tener margen cómodo, especialmente cuando usas el contexto largo, apunta a 16 GB de VRAM o memoria unificada. Funciona en portátiles, incluyendo Mac con chip M-series a través de la memoria unificada.
¿Puede Gemma 4 12B ejecutarse en un portátil de 16 GB?
Sí, sin problema. En Q4KM el modelo usa unos 6,6 GB, dejando mucho espacio en una máquina de 16 GB. En portátiles con Apple Silicon la memoria unificada lo maneja bien a través de la build gemma4:12b-mlx. Incluso puedes subir a cuantización Q8 en 16 GB para mayor fidelidad.
¿Es Gemma 4 12B realmente mejor que Llama o Qwen 3.5?
Depende de lo que midas. Gemma 4 12B gana en la licencia Apache 2.0, la entrada de audio nativa y una ventana de contexto de 256K, y publica un sólido 77,2% en MMLU Pro. Pero Qwen 3.5 gana algunas filas de razonamiento y código de la clase 12B. Compara ambos en tu propia tarea antes de decidir.
¿Es Gemma 4 12B mejor que Gemma 3 12B?
Sí. Gemma 4 12B pasa a la licencia permisiva Apache 2.0, añade entrada de audio nativa, duplica la ventana de contexto a 256K tokens y publica una mejora significativa en MMLU Pro. El cambio de licencia por sí solo justifica la actualización para proyectos comerciales que estaban bloqueados por los términos personalizados de Gemma 3.
¿Qué cuantización debería usar para Gemma 4 12B?
Q4KM es el predeterminado razonable con unos 6,6 GB y calidad casi completa. Si quieres la mejor calidad a ese mismo tamaño, usa los nuevos checkpoints QAT Q4_0 publicados el 5 de junio de 2026, que mantienen una calidad casi de precisión completa con huella de Q4. Usa Q8 solo si tienes 16 GB+ y necesitas máxima fidelidad.
¿Gemma 4 12B es gratuito para uso comercial?
Sí. Gemma 4 12B viene bajo la licencia Apache 2.0, que permite el uso comercial sin las restricciones de la licencia Gemma personalizada de Gemma 3. Puedes construir productos comerciales, ajustarlo y redistribuirlo. Ese cambio de licencia es una de las principales razones por las que los equipos están actualizando desde Gemma 3.
¿Gemma 4 12B realmente admite entrada de audio?
Sí. Gemma 4 12B es el primer Gemma de tamaño medio con entrada de audio nativa. Gracias a su diseño sin encoder, las formas de onda de audio en bruto se proyectan directamente al modelo sin un encoder de audio separado. Dicho esto, el ecosistema circundante tiene días de vida, así que prueba con cuidado antes de lanzar funciones centradas en audio en producción.
¿Qué tan rápido es Gemma 4 12B en un RTX 4090?
Los informes publicados por terceros sitúan a Gemma 4 12B en Q4KM cómodamente en territorio de chat en tiempo real en un RTX 4090 de 24 GB, aunque no se ha publicado aún una cifra de tokens/sec sostenidos precisos tres días después del lanzamiento. La velocidad varía con la longitud del prompt, el tamaño del contexto y la versión del backend, así que trata las cifras iniciales como aproximadas.
¿Dónde descargo Gemma 4 12B?
El modelo ajustado por instrucciones está en HuggingFace como google/gemma-4-12B-it, o puedes descargarlo a través de Ollama con ollama run gemma4:12b (una descarga de 7,6 GB). Los usuarios de LM Studio pueden buscar gemma 4 12b en el navegador de modelos de la app. Para cuantizaciones específicas, los archivos GGUF están disponibles en repositorios de la comunidad como Unsloth.