
Gemma 4 12B: бенчмарки, вимоги до VRAM і як запустити її локально
Google DeepMind випустила Gemma 4 12B 3 червня 2026 року. Через три дні цифра, яку всі повторюють, — це результат MMLU Pro: 77,2%. Це перевершує торішню Gemma 3 27B, яка набрала 67,6% на тому самому тесті. Модель із 12 мільярдами параметрів обходить 27-мільярдний флагман? Менш ніж за половину пам'яті? Авжеж. І ліцензія теж змінилася. Gemma 4 виходить під Apache 2.0, тож комерційне використання дозволене — без жодних застережень. Вона має контекстне вікно на 256 тисяч токенів і після квантування працює приблизно в 6,6 ГБ VRAM. Саме цей останній пункт і є всією історією для більшості з нас: ця модель вміщується на GPU середнього рівня.
Ключові висновки
- Gemma 4 12B (вийшла 3 червня 2026 року) набирає 77,2% на MMLU Pro, випереджаючи торішню Gemma 3 27B (67,6%).
- Працює у ~6,6 ГБ VRAM при Q4_K_M, вміщується на 8-гігабайтний GPU; ~16 ГБ дають комфортний запас.
- Ліцензія Apache 2.0 (комерційне використання дозволене), контекст на 256 тисяч, вбудоване введення звуку та зображень, архітектура без енкодера.
- Одна команда для запуску:
ollama run gemma4:12b(завантаження 7,6 ГБ).
Що таке Gemma 4 12B?
Gemma 4 12B — це модель із відкритими вагами на 12 мільярдів параметрів від Google DeepMind, випущена 3 червня 2026 року під ліцензією Apache 2.0. Це уніфікована мультимодальна модель без енкодера: на вході — текст, зображення та звук, на виході — текст. Вона має контекстне вікно на 256 тисяч токенів і підтримує 140 мов.
Інструктивно доналаштований варіант, який ви насправді запускатимете, має назву gemma-4-12B-it («it» — це скорочення від instruction-tuned, версія, готова до чату). Загалом вона має 11,95 мільярда параметрів, тож «12B» — це невелике округлення в більший бік. Навчальні дані охоплюють період до січня 2025 року.
Ось що робить її цікавою: Gemma 4 12B — перша Gemma середнього розміру з вбудованим введенням звуку. Окремий аудіоенкодер тут не прикручено. Сирі хвильові форми проєктуються прямо в модель. Те саме — для зображень. Саме завдяки такому рішенню модель залишається достатньо компактною, щоб працювати на одній споживчій відеокарті, і чому так — ми пояснимо трохи згодом.
Хочете спочатку ширшу картину? Наш гід із запуску відкритих моделей на власному комп'ютері пояснює основи налаштування, якщо ви новачок у локальних LLM. В офіційному анонсі Google є повна інформація про реліз.
Характеристики Gemma 4 12B коротко
Усе перевірене, в одній таблиці. Жодних здогадок.
| Характеристика | Значення |
|---|---|
| Повна назва | Gemma 4 12B (gemma-4-12B-it) |
| Параметри | 11,95 млрд (~12 млрд) |
| Ліцензія | Apache 2.0 (комерційне використання дозволене) |
| Контекстне вікно | 256 тисяч токенів |
| Модальності | Текст + зображення + звук на вході, текст на виході |
| Архітектура | Уніфікована без енкодера, 48 шарів, гібридна увага |
| Мови | 140 |
| Межа навчальних даних | Січень 2025 |
| Тег Ollama | gemma4:12b (завантаження 7,6 ГБ) |
| Тег для Apple Silicon | gemma4:12b-mlx |
| Рекомендований семплінг | temperature 1.0, top_p 0.95, top_k 64 |
Одна порада щодо семплінгу: дотримуйтеся рекомендованих temperature=1.0, top_p=0.95, top_k=64, якщо немає причини робити інакше. Моделі Gemma поводяться дивно за низьких температур, тож не поспішайте рефлекторно знижувати її до 0.2, як ви могли б зробити з іншими моделями.
Як працює архітектура без енкодера?
«Без енкодера» означає, що немає окремої моделі, яка перетворювала б зображення чи звук, перш ніж вони потраплять до мовної моделі. Патчі зображень і сирі звукові хвилі проєктуються безпосередньо у спільний простір ембедінгів через тонкі лінійні шари. Більшість мультимодальних моделей прикручують до LLM важкий візуальний енкодер. Gemma 4 12B обходиться без нього — саме тому вона вміщується в 16 ГБ.
Уявіть це як різницю між перекладачем і двомовною людиною. Старий підхід наймає окремого перекладача (енкодера), який перетворює зображення на мову, зрозумілу моделі, а потім передає результат. Gemma 4 12B — двомовна від народження. Дані звуку та зображень одразу розмовляють рідною мовою моделі — через легкий проєкційний шар замість громіздкого енкодера.
Під капотом — 48 шарів із гібридною увагою. Більшість шарів використовують ковзне вікно на 1024 токени (дешеве, локальне), які чергуються з окремими шарами глобальної уваги, що бачать весь контекст. Саме така комбінація дає змогу працювати з контекстом на 256 тисяч токенів, не розплавляючи ваш GPU.

Практичний виграш: менше параметрів іде на енкодери, тож більша частина вашого VRAM дістається власне міркуванню. Саме цей компроміс дає моделі на 12 мільярдів змогу грати далеко вище своєї вагової категорії.
Бенчмарки Gemma 4 12B: реальні цифри
Головний висновок підтверджується: Gemma 4 12B набирає 77,2% на MMLU Pro, випереджаючи 67,6% у Gemma 3 27B на тому самому тесті, використовуючи менш ніж половину VRAM. Це офіційні цифри Google для інструктивно доналаштованої (-it) моделі, а не оцінки спільноти. Ось повний набір.
| Бенчмарк | Gemma 4 12B | Gemma 3 27B (для порівняння) |
|---|---|---|
| MMLU Pro | 77,2% | 67,6% |
| GPQA Diamond | 78,8% | , |
| MMMU Pro | 69,1% | , |
| AIME 2026 (без інструментів) | 77,5% | , |
| LiveCodeBench v6 | 72,0% | , |
| Codeforces ELO | 1659 | , |
Модель на 12 мільярдів тепер обходить торішній 27-мільярдний флагман на MMLU Pro: 77,2% проти 67,6%. Це той самий стрибок між поколіннями, який змушує передивитися свої розрахунки щодо заліза.

Два чесні застереження. По-перше, прочерки означають, що Google не опублікувала результат Gemma 3 27B для цих рядків, тож клітинки залишаються порожніми, а не заповненими здогадками. По-друге, всі наведені тут результати — для інструктивно доналаштованої моделі. Цифри базової моделі відрізняються. Усе це можна перевірити на картці моделі на HuggingFace та на сторінці моделі на DeepMind.
Скільки VRAM потрібно Gemma 4 12B?
Gemma 4 12B потребує приблизно 6,6 ГБ VRAM при квантуванні Q4_K_M, а це означає, що вона вміщується на 8-гігабайтний GPU. Для комфортного запасу, особливо якщо ви хочете використовувати частину того контексту на 256 тисяч, орієнтуйтеся на 16 ГБ VRAM або об'єднаної пам'яті. Вона працює на ноутбуці. Mac на чіпах M-серії чудово справляються через об'єднану пам'ять.
Квантування — це просто стиснення ваг моделі. Числа нижчої розрядності, менший файл, трохи нижча точність. Ось як виглядають поширені рівні.
| Квантування | Приблизний VRAM | Якість | Найкраще для |
|---|---|---|---|
| Q4_K_M | ~6,6 ГБ | Майже повна, мінімальні втрати | Розумний вибір за замовчуванням; вміщується на 8-гігабайтні карти |
| Q5_K_M | ~8,5 ГБ | Трохи краща за Q4 | Є трохи зайвого VRAM, хочеться більшої точності |
| Q8 | ~13 ГБ | Фактично повна якість | Карти 16 ГБ+, максимальна точність |
| QAT Q4_0 | ~6,6 ГБ | Майже FP при розмірі Q4 | Найкраща якість на гігабайт (випущено 5 червня) |

Якщо ви підбираєте залізо під цю модель, наш огляд інструментів для локальних LLM, які ми тестували розповідає, які бекенди вичавлюють максимум із конкретної карти. Коротко: 12-гігабайтна карта запускає Q4 із запасом, 8-гігабайтна карта тягне Q4, якщо тримати контекст помірним.
Швидкість Gemma 4 12B: токени/с на реальному заліззі
Наскільки вона швидка? Це залежить від вашої карти, квантування та бекенду, тож замість однієї цифри ми зібрали опубліковані сторонні показники в одному місці. Їх повідомили тестувальники зі спільноти та вендори, з посиланням на кожне джерело. Це не наші власні лабораторні дані.
| Залізо | Квант. | Повідомлені токени/с | Джерело |
|---|---|---|---|
| RTX 3060 (6 ГБ) | Q4_K_M | ~6,6 ГБ VRAM, працює локально (токени/с точно не повідомлялися) | runaiathome |
| RTX 4090 (24 ГБ) | Q4_K_M | Рівень чату в реальному часі (конкретні токени/с ще не повідомлялися) | apxml / спільнота |
| Apple M-серії (об'єднана пам'ять) | mlx / Q4 | Працює через gemma4:12b-mlx (токени/с ще широко не повідомлялися) | Ollama / спільнота |
Скажу прямо про те, що насправді кажуть публічні дані просто зараз. runaiathome підтвердив, що модель працює на 6-гігабайтній RTX 3060 у межах свого обсягу ~6,6 ГБ Q4_K_M — це найконкретніший опублікований звіт щодо заліза на сьогодні. Специфікація apxml і сторінка бібліотеки Ollama підтверджують, що модель обслуговується локально на 24-гігабайтній RTX 4090 при Q4, комфортно в діапазоні чату в реальному часі, але точний показник стабільних токенів/с для цієї карти ще не опубліковано. Варіант gemma4:12b-mlx для Apple Silicon існує й працює, але надійні цифри токенів/с за три дні після релізу так і не з'явилися.
Що це означає для вас, за рівнями: на 6-гігабайтній карті на кшталт RTX 3060 розраховуйте, що вона завантажиться і працюватиме для локального чату, просто тримайте контекстне вікно помірним. На 24-гігабайтній RTX 4090 при Q4_K_M опубліковані звіти впевнено відносять її до рівня чату в реальному часі. На Apple Silicon збірка MLX працює, але бенчмарки ще потрохи надходять.
Це опубліковані сторонні показники, а не наші власні лабораторні дані, тож ставтеся до них як до приблизних. Ваші токени/с залежать від довжини промпту, розміру контексту та версії бекенду. Джерела: сторінка бібліотеки Ollama, apxml і runaiathome. Щойно за наступні два тижні з'явиться більше бенчмарків від спільноти, ми оновимо цю таблицю.
Як запустити Gemma 4 12B локально?
Найкоротший шлях: встановіть Ollama, виконайте одну команду — готово. ollama run gemma4:12b завантажує модель на 7,6 ГБ і відкриває чат. Жодних конфігів, жодного Python-оточення. Якщо хочете більше контролю або ви на Apple Silicon, нижче є ще чотири шляхи.
1. Ollama (простий вибір за замовчуванням). Завантажте й запустіть у два рядки:
ollama pull gemma4:12b
ollama run gemma4:12b2. llama.cpp із GGUF. Якщо вам потрібне конкретне квантування, вкажіть llama.cpp файл GGUF на HuggingFace. GGUF — це формат файлів, який llama.cpp використовує для квантованих ваг:
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."3. MLX на Apple Silicon. Mac на чіпах M-серії отримують окрему збірку MLX, яка використовує фреймворк Apple замість CUDA:
ollama run gemma4:12b-mlx4. LM Studio (GUI, без термінала). Віддаєте перевагу десктопному застосунку? Відкрийте LM Studio, перейдіть на вкладку пошуку й введіть gemma 4 12b. Виберіть GGUF Q4_K_M і завантажте. LM Studio зробить решту, зокрема дасть перемикач локального сервера.
5. Запитуйте через API. Ollama надає ендпоінт, сумісний з OpenAI, на порту 11434, тож наявний код працюватиме після заміни базового URL в один рядок:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:12b",
"messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
}'Коли ви запустите її в CLI, вам, імовірно, захочеться справжнього інтерфейсу. Ви можете обгорнути її в інтерфейс у стилі ChatGPT за допомогою Open WebUI приблизно за п'ять хвилин. Уперше зіткнулися з усім цим? Почніть з нашого повного гіда з налаштування локальних LLM. Офіційні рекомендації щодо семплінгу та способів запуску дивіться на ai.google.dev і в документації Ollama.
Яке квантування обрати для Gemma 4 12B?
Для більшості людей Q4_K_M — розумний вибір за замовчуванням: приблизно 6,6 ГБ VRAM, майже повна якість, і вміщується на 8-гігабайтний GPU. Якщо у вас 16 ГБ чи більше і хочеться максимальної точності, переходьте на Q8. А якщо потрібна найкраща якість на гігабайт із доступних зараз, придивіться до нових чекпоінтів QAT Q4_0.
Ось свіжий аспект, який ще ніхто не врахував. 5 червня 2026 року, лише за два дні після релізу, Google випустила чекпоінти Quantization-Aware-Training (QAT) Q4_0 разом із новим мобільним форматом. QAT означає, що модель навчали з урахуванням квантування, тож вона зберігає якість, близьку до FP (повної точності), при розмірі Q4. Ті самі ~6,6 ГБ, але помітно менші втрати точності, ніж у стандартного Q4 після навчання. Якщо у вас обмежений VRAM, але якість важлива, — це ваш вибір.
Короткий гід із вибору:
- 8-гігабайтна карта, хочеться простоти: Q4_K_M.
- 8-гігабайтна карта, хочеться найкращої якості за цього розміру: QAT Q4_0.
- Карта 16 ГБ+, хочеться максимальної точності: Q8.
- Щось посередині, є трохи зайвого VRAM: Q5_K_M.
Обґрунтування Google можна прочитати в їхньому анонсі QAT. Висновок: Q4_K_M — це добре, QAT Q4_0 — краще за того самого розміру, а Q8 потрібен лише тоді, коли точність важливіша за пам'ять.
Gemma 4 12B проти Gemma 3 12B проти Qwen 3.5: чи варто оновлюватися?
Так, оновлення з Gemma 3 12B варте того, якщо вам важливі ліцензія Apache 2.0, вбудоване введення звуку, контекстне вікно на 256 тисяч або стрибок на MMLU Pro. Порівняно з Qwen 3.5 різниця менша. Gemma 4 12B виграє за відкритістю ліцензії та вбудованому звуку, але Qwen 3.5 бере верх у деяких рядках бенчмарків 12-мільярдного класу. Обирайте за своїми реальними потребами, а не за заголовками.
| Можливість | Gemma 4 12B | Gemma 3 12B | Qwen 3.5 (12-мільярдний клас) |
|---|---|---|---|
| Ліцензія | Apache 2.0 | Власна ліцензія Gemma | Apache 2.0 |
| Контекст | 256 тисяч | 128 тисяч | До 256 тисяч |
| Модальності | Текст + зображення + звук | Текст + зображення | Текст + зображення |
| Вбудований звук | Так | Ні | Ні |
| MMLU Pro | 77,2% | Нижче | Конкурентна, виграє в деяких рядках |
| VRAM при Q4 | ~6,6 ГБ | ~6,6 ГБ | ~6,6 ГБ |
Сама лише зміна ліцензії виправдовує відмову від Gemma 3 12B для багатьох команд. Gemma 3 виходила під власною ліцензією Google з обмеженнями на використання; Gemma 4 — це одразу Apache 2.0. Якщо ви відкладали Gemma з комерційних причин, ця перешкода зникла.
Порівняно з Qwen 3.5, будьте чесні із собою. Qwen 3.5 справді сильна й обходить Gemma 4 12B у деяких рядках із міркування та кодингу. Якщо введення звуку й відкрита ліцензія не у вашому списку, протестуйте обидві на власному завданні, перш ніж вирішувати. Дивіться місце Gemma 4 12B серед найкращих відкритих моделей, щоб побачити ширшу картину. А оскільки це Apache 2.0, ви можете доналаштувати її під Apache 2.0 за допомогою Unsloth без ліцензійних проблем.
Коли НЕ варто використовувати Gemma 4 12B
Пропустіть Gemma 4 12B, якщо вам потрібне міркування передового рівня, яке забезпечує лише значно більша модель, якщо Qwen 3.5 виграє в тому конкретному рядку бенчмарку, від якого залежить ваше навантаження, або якщо ваш проєкт сильно спирається на аудіоінструменти, які ще дозрівають за три дні після релізу. Це чудова 12-мільярдна модель, але не магічна.
Gemma 4 12B не завжди правильний вибір. Якщо вам потрібне міркування передового рівня, більша модель досі перемагає. Вбудована підтримка звуку реальна й вражаюча, але навколишні інструменти, бібліотеки, допоміжні утиліти, інтеграції з фреймворками — усього кілька днів від народження, і місцями вони шорсткі. Якщо ви цього тижня випускаєте продукт із великою часткою звуку, ретельно протестуйте, перш ніж робити ставку на нього.
Ще кілька чесних причин відмовитися. Якщо ви вбудовуєте її в агента, спершу переконайтеся в надійності виклику інструментів на ваших завданнях, адже агентна поведінка різниться від моделі до моделі. Якщо ваша перевага — довгий контекст, подбайте про те, щоб використати контекстне вікно на 256 тисяч на повну, а не вважати, що сам розмір вікна означає кращий результат. А якщо ви виходите за межі локальних запусків у продакшн-обслуговування, шлях продакшн-обслуговування за межами локального розповідає про vLLM і SGLang. Якщо ви розгортаєте відкриті моделі на кшталт Gemma 4 12B у продакшні, ми можемо допомогти.
Про автора
Мерт Батур Гюрбюз — співзасновник Techsy.io, де команда створює AI-агентів, системи автоматизації та голосові/SDR-конвеєри для B2B-клієнтів. Він навчається в Бірмінгемському університеті й пише про стек інструментів для LLM, який команда Techsy реально використовує в продакшні. Зв'язатися можна в LinkedIn.
Вибір інструменту — це легша половина. Домогтися його надійної роботи всередині реального продукту — ось де більшість команд застрягають, і саме це наша команда AI-інтеграції будує для клієнтів: від RAG-конвеєрів до кастомних агентів.
Часті запитання
Як запустити Gemma 4 12B локально?
Встановіть Ollama, потім виконайте ollama run gemma4:12b. Це завантажить модель на 7,6 ГБ і відкриє чат. Python-оточення чи конфіги не потрібні. Якщо хочете графічний застосунок, LM Studio теж підійде: знайдіть gemma 4 12b у браузері моделей і завантажте збірку Q4_K_M.
Які вимоги до VRAM і заліза для Gemma 4 12B?
Gemma 4 12B потребує приблизно 6,6 ГБ VRAM при квантуванні Q4_K_M, тож вміщується на 8-гігабайтний GPU. Для комфортного запасу, особливо під час використання довгого контексту, орієнтуйтеся на 16 ГБ VRAM або об'єднаної пам'яті. Вона працює на ноутбуках, зокрема на Mac M-серії через об'єднану пам'ять.
Чи може Gemma 4 12B працювати на 16-гігабайтному ноутбуці?
Так, легко. При Q4_K_M модель використовує приблизно 6,6 ГБ, залишаючи чимало місця на 16-гігабайтній машині. На ноутбуках Apple Silicon об'єднана пам'ять добре справляється через збірку gemma4:12b-mlx. На 16 ГБ можна навіть перейти на квантування Q8 для вищої точності.
Чи справді Gemma 4 12B краща за Llama або Qwen 3.5?
Залежить від того, що вимірювати. Gemma 4 12B виграє завдяки ліцензії Apache 2.0, вбудованому введенню звуку та контекстному вікну на 256 тисяч, а ще показує сильні 77,2% на MMLU Pro. Але Qwen 3.5 бере верх у деяких рядках міркування та кодингу 12-мільярдного класу. Протестуйте обидві на власному завданні, перш ніж вирішувати.
Чи краща Gemma 4 12B за Gemma 3 12B?
Так. Gemma 4 12B переходить на відкриту ліцензію Apache 2.0, додає вбудоване введення звуку, подвоює контекстне вікно до 256 тисяч токенів і демонструє відчутне покращення на MMLU Pro. Сама лише зміна ліцензії виправдовує оновлення для комерційних проєктів, яким заважали власні умови Gemma 3.
Яке квантування використовувати для Gemma 4 12B?
Q4_K_M — розумний вибір за замовчуванням: приблизно 6,6 ГБ і майже повна якість. Якщо хочете найкращої якості за того самого розміру, використовуйте нові чекпоінти QAT Q4_0, випущені 5 червня 2026 року, які зберігають якість, близьку до повної точності, при розмірі Q4. Використовуйте Q8, лише якщо маєте 16 ГБ+ і потрібна максимальна точність.
Чи безкоштовна Gemma 4 12B для комерційного використання?
Так. Gemma 4 12B виходить під ліцензією Apache 2.0, яка дозволяє комерційне використання без обмежень власної ліцензії Gemma 3. Ви можете створювати комерційні продукти, доналаштовувати її та поширювати. Саме ця зміна ліцензії — одна з головних причин, чому команди оновлюються з Gemma 3.
Чи справді Gemma 4 12B підтримує введення звуку?
Так. Gemma 4 12B — перша Gemma середнього розміру з вбудованим введенням звуку. Завдяки архітектурі без енкодера сирі звукові хвилі проєктуються безпосередньо в модель без окремого аудіоенкодера. Втім, навколишнім інструментам усього кілька днів, тож ретельно тестуйте, перш ніж випускати функції з великою часткою звуку в продакшн.
Наскільки швидка Gemma 4 12B на RTX 4090?
Опубліковані сторонні звіти впевнено відносять Gemma 4 12B при Q4_K_M до рівня чату в реальному часі на 24-гігабайтній RTX 4090, хоча точний показник стабільних токенів/с за три дні після релізу ще не опубліковано. Швидкість залежить від довжини промпту, розміру контексту та версії бекенду, тож ставтеся до ранніх цифр як до приблизних.
Де завантажити Gemma 4 12B?
Інструктивно доналаштована модель доступна на HuggingFace як google/gemma-4-12B-it, або її можна завантажити через Ollama командою ollama run gemma4:12b (7,6 ГБ). Користувачі LM Studio можуть знайти gemma 4 12b у браузері моделей застосунку. Для конкретних квантувань файли GGUF доступні в репозиторіях спільноти, як-от Unsloth.