
Google DeepMind hat Gemma 4 12B am 3. Juni 2026 veröffentlicht. Drei Tage später ist die Zahl, die überall kursiert, der MMLU-Pro-Score: 77,2 %. Das übertrifft das letztjährige Gemma 3 27B, das auf demselben Test 67,6 % erreichte. Ein Modell mit 12 Milliarden Parametern, das ein 27B-Flaggschiff schlägt? Bei weniger als halbem Speicherbedarf? Das ist bemerkenswert. Und die Lizenz hat sich ebenfalls geändert. Gemma 4 erscheint unter Apache 2.0, kommerzielle Nutzung ist also problemlos möglich, ohne Einschränkungen. Das Modell verfügt über ein 256K-Token-Kontextfenster und läuft nach der Quantisierung mit rund 6,6 GB VRAM. Genau das ist für die meisten Nutzer entscheidend: dieses Modell passt auf eine mittelklassige GPU.
Wichtigste Erkenntnisse
- Gemma 4 12B (veröffentlicht am 3. Juni 2026) erzielt 77,2 % auf MMLU Pro und übertrifft damit das letztjährige Gemma 3 27B (67,6 %).
- Es läuft mit ca. 6,6 GB VRAM bei Q4KM und passt auf eine 8-GB-GPU; ca. 16 GB bieten komfortablen Spielraum.
- Apache-2.0-Lizenz (kommerzielle Nutzung erlaubt), 256K Kontext, nativer Audio- und Bildeingabe, encoderfreie Architektur.
- Einziger Befehl zum Starten:
ollama run gemma4:12b(7,6 GB Download).
Was ist Gemma 4 12B?
Gemma 4 12B ist ein Open-Weights-Modell mit 12 Milliarden Parametern von Google DeepMind, veröffentlicht am 3. Juni 2026 unter einer Apache-2.0-Lizenz. Es handelt sich um ein encoderfreies, einheitliches multimodales Modell: Text, Bilder und nativer Audio-Input werden verarbeitet, Text wird ausgegeben. Das Modell verfügt über ein 256K-Token-Kontextfenster und unterstützt 140 Sprachen.
Die Instruction-Tuned-Variante, die Sie tatsächlich verwenden werden, heißt gemma-4-12B-it (das „it" steht für instruction-tuned, also die für Chat optimierte Version). Sie hat 11,95 Milliarden Parameter insgesamt, „12B" ist also leicht gerundet. Trainingsschluss war Januar 2025.
Das Interessante an Gemma 4 12B: Es ist das erste mittelgroße Gemma mit nativem Audio-Input. Es gibt keinen separaten Audio-Encoder, der zusätzlich eingebunden wurde. Rohe Audio-Wellenformen werden direkt in das Modell projiziert. Dasselbe gilt für Bilder. Diese Designentscheidung erklärt, warum es klein genug bleibt, um auf einer einzigen Consumer-GPU zu laufen — dazu gleich mehr.
Für den größeren Überblick: Unser Leitfaden zum Betrieb offener Modelle auf dem eigenen Rechner erklärt die Setup-Grundlagen, falls Sie neu im Bereich lokaler LLMs sind. Googles offizielle Ankündigung enthält alle Details.
Gemma 4 12B: Technische Daten auf einen Blick
Alle verifizierten Angaben in einer Tabelle. Kein Rätselraten.
| Spezifikation | Wert |
|---|---|
| Vollständiger Name | Gemma 4 12B (gemma-4-12B-it) |
| Parameter | 11,95 Mrd. (~12B) |
| Lizenz | Apache 2.0 (kommerzielle Nutzung erlaubt) |
| Kontextfenster | 256K Tokens |
| Modalitäten | Text + Bild + nativer Audio-Input, Text-Output |
| Architektur | Encoderfrei, einheitlich, 48 Schichten, hybride Attention |
| Sprachen | 140 |
| Trainingsschluss | Januar 2025 |
| Ollama-Tag | gemma4:12b (7,6 GB Download) |
| Apple-Silicon-Tag | gemma4:12b-mlx |
| Empfohlenes Sampling | temperature 1.0, top_p 0.95, top_k 64 |
Ein Hinweis zum Sampling: Bleiben Sie bei den empfohlenen Werten temperature=1.0, top_p=0.95, top_k=64, sofern Sie keinen triftigen Grund haben, davon abzuweichen. Gemma-Modelle verhalten sich bei niedrigen Temperaturen merkwürdig — senken Sie die Temperatur also nicht reflexartig auf 0,2, wie Sie es vielleicht von anderen Modellen gewohnt sind.
Wie funktioniert die encoderfreie Architektur?
Encoderfrei bedeutet, dass es kein separates Modell gibt, das Bilder oder Audio umwandelt, bevor sie das Sprachmodell erreichen. Bild-Patches und rohe Audio-Wellenformen werden direkt über dünne lineare Schichten in den gemeinsamen Embedding-Raum projiziert. Die meisten multimodalen Modelle bauen einen schweren Vision-Encoder auf das LLM auf. Gemma 4 12B verzichtet darauf — deshalb passt es in 16 GB.
Ein nützlicher Vergleich: Stellen Sie sich einen Übersetzer im Gegensatz zu einer zweisprachig aufgewachsenen Person vor. Der alte Ansatz heuert einen separaten Übersetzer (den Encoder) an, der Bilder in eine Sprache übersetzt, die das Modell versteht, und leitet das Ergebnis weiter. Gemma 4 12B ist von Anfang an zweisprachig. Audio- und Bilddaten sprechen die Muttersprache des Modells direkt, über eine leichtgewichtige Projektionsschicht statt eines umfangreichen Encoders.
Technisch besteht das Modell aus 48 Schichten mit hybrider Attention. Die meisten Schichten verwenden ein Sliding-Window mit 1.024 Tokens (günstig, lokal), abwechselnd mit globalen Attention-Schichten, die den gesamten Kontext berücksichtigen. Diese Kombination ermöglicht ein 256K-Kontextfenster, ohne die GPU zu überlasten.

Der praktische Vorteil: Weniger Parameter für Encoder bedeuten, dass mehr VRAM-Budget für die eigentliche Verarbeitung zur Verfügung steht. Darin liegt der Kompromiss, der einem 12B-Modell diese Leistung ermöglicht.
Gemma 4 12B Benchmarks: Die echten Zahlen
Das Kernresultat hält stand: Gemma 4 12B erzielt 77,2 % auf MMLU Pro und übertrifft damit Gemma 3 27B mit 67,6 % auf demselben Test, bei weniger als halbem VRAM-Verbrauch. Dies sind die offiziellen Instruction-Tuned-Werte (-it) von Google, keine Community-Schätzungen. Hier die vollständige Übersicht.
| Benchmark | Gemma 4 12B | Gemma 3 27B (Referenz) |
|---|---|---|
| MMLU Pro | 77,2 % | 67,6 % |
| GPQA Diamond | 78,8 % | — |
| MMMU Pro | 69,1 % | — |
| AIME 2026 (ohne Werkzeuge) | 77,5 % | — |
| LiveCodeBench v6 | 72,0 % | — |
| Codeforces ELO | 1659 | — |
Ein 12B-Modell übertrifft jetzt das 27B-Flaggschiff des letzten Jahres auf MMLU Pro: 77,2 % gegenüber 67,6 %. Das ist ein generationeller Sprung, der einen dazu bringt, seine Hardware-Kalkulationen zu überdenken.

Zwei ehrliche Einschränkungen. Erstens: Die Striche bedeuten, dass Google für diese Zeilen keine Gemma-3-27B-Werte veröffentlicht hat, daher bleiben die Felder leer, anstatt mit Schätzungen gefüllt zu werden. Zweitens: Alle hier angegebenen Werte beziehen sich auf das Instruction-Tuned-Modell. Die Basismodell-Zahlen weichen ab. Sie können alle Werte auf der HuggingFace-Modellkarte und der DeepMind-Modellseite überprüfen.
Wie viel VRAM benötigt Gemma 4 12B?
Gemma 4 12B benötigt ca. 6,6 GB VRAM bei Q4KM-Quantisierung, was bedeutet, dass es auf eine 8-GB-GPU passt. Für komfortablen Spielraum, insbesondere wenn Sie einen größeren Teil des 256K-Kontexts nutzen möchten, sollten Sie auf 16 GB VRAM oder Unified Memory abzielen. Es läuft auf einem Laptop. M-Serie-Macs kommen damit über Unified Memory problemlos zurecht.
Quantisierung ist im Wesentlichen Komprimierung für Modellgewichte. Niedrigere Präzisionszahlen, kleinere Datei, minimal verringerte Genauigkeit. Hier sehen Sie, wie die gängigen Stufen im Vergleich aussehen.
| Quantisierung | Ungefährer VRAM | Qualität | Empfohlen für |
|---|---|---|---|
| Q4_K_M | ~6,6 GB | Nahezu vollständig, minimaler Verlust | Sinnvoller Standard; passt auf 8-GB-Karten |
| Q5_K_M | ~8,5 GB | Etwas besser als Q4 | Etwas freier VRAM, höhere Genauigkeit gewünscht |
| Q8 | ~13 GB | Effektiv volle Qualität | 16 GB+ Karten, maximale Qualität |
| QAT Q4_0 | ~6,6 GB | Nahezu FP bei Q4-Größe | Beste Qualität pro GB (veröffentlicht am 5. Juni) |

Wenn Sie Hardware rund um dieses Modell auswählen: Unser Überblick über lokale LLM-Tools, die wir getestet haben, zeigt, welche Backends das Beste aus einer bestimmten Karte herausholen. Die Kurzfassung: Eine 12-GB-Karte läuft Q4 mit Reserve, eine 8-GB-Karte läuft Q4, wenn Sie den Kontext überschaubar halten.
Gemma 4 12B Geschwindigkeit: Tokens/sec auf echter Hardware
Wie schnell ist es? Das hängt von der Grafikkarte, der Quantisierung und dem Backend ab. Statt einer einzelnen Zahl wurden hier die publizierten Drittanbieter-Werte an einem Ort zusammengestellt. Diese wurden von Community-Testern und Anbietern gemeldet und sind der jeweiligen Quelle zugeordnet. Es handelt sich nicht um eigene Labormessungen.
| Hardware | Quant | Gemeldete tokens/sec | Quelle |
|---|---|---|---|
| RTX 3060 (6 GB) | Q4_K_M | ~6,6 GB VRAM-Footprint, läuft lokal (tok/s nicht präzise gemeldet) | runaiathome |
| RTX 4090 (24 GB) | Q4_K_M | Echtzeit-Chat-Bereich (genaue tok/s noch nicht gemeldet) | apxml / Community |
| Apple M-Serie (Unified) | mlx / Q4 | Läuft über gemma4:12b-mlx (tok/s noch nicht weit verbreitet gemeldet) | Ollama / Community |
Hier eine klare Aussage dazu, was die öffentlichen Daten aktuell tatsächlich zeigen. runaiathome bestätigte, dass das Modell auf einem 6-GB-RTX-3060 innerhalb des ~6,6-GB-Q4KM-Footprints läuft — das ist bislang der konkreteste veröffentlichte Hardware-Bericht. Das apxml-Datenblatt und die Ollama-Library-Seite bestätigen, dass das Modell auf einer 24-GB-RTX-4090 bei Q4 lokal und im Echtzeit-Chat-Bereich läuft, aber ein präziser anhaltender tok/s-Wert für diese Karte ist drei Tage nach dem Launch noch nicht publiziert. Die Apple-Silicon-Variante gemma4:12b-mlx existiert und läuft, aber verlässliche tok/s-Zahlen haben sich drei Tage nach dem Launch noch nicht herauskristallisiert.
Was das für Sie bedeutet, nach Tier: Auf einer 6-GB-Karte wie der RTX 3060 lädt und läuft das Modell für lokalen Chat — halten Sie das Kontextfenster dabei überschaubar. Auf einer 24-GB-RTX-4090 bei Q4KM setzen publizierte Berichte es komfortabel in den Echtzeit-Chat-Bereich. Auf Apple Silicon läuft der MLX-Build, aber Benchmark-Zahlen kommen noch.
Dies sind publizierte Drittanbieter-Angaben, keine eigenen Labormessungen — behandeln Sie sie als grobe Richtwerte. Ihre tok/s hängen von der Prompt-Länge, der Kontextgröße und der Backend-Version ab. Quellen: Ollama Library, apxml und runaiathome. Wenn in den nächsten zwei Wochen weitere Community-Benchmarks eintreffen, wird diese Tabelle aktualisiert.
Wie betreibt man Gemma 4 12B lokal?
Der kürzeste Weg: Ollama installieren, einen Befehl ausführen, fertig. ollama run gemma4:12b lädt das 7,6-GB-Modell herunter und öffnet direkt einen Chat-Prompt. Keine Konfigurationsdateien, keine Python-Umgebung. Wenn Sie mehr Kontrolle möchten oder auf Apple Silicon arbeiten, gibt es vier weitere Wege.
1. Ollama (der einfache Standard). In zwei Zeilen starten:
ollama pull gemma4:12b
ollama run gemma4:12b2. llama.cpp mit einem GGUF. Wenn Sie eine bestimmte Quantisierungsstufe wünschen, verweisen Sie llama.cpp auf eine GGUF-Datei auf HuggingFace. GGUF ist das Dateiformat, das llama.cpp für quantisierte Gewichte verwendet:
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."3. MLX auf Apple Silicon. M-Serie-Macs erhalten einen dedizierten MLX-Build, der Apples Framework statt CUDA nutzt:
ollama run gemma4:12b-mlx4. LM Studio (GUI, kein Terminal). Bevorzugen Sie eine Desktop-App? LM Studio öffnen, auf den Such-Tab klicken und gemma 4 12b eingeben. Ein Q4KM-GGUF auswählen und herunterladen. LM Studio erledigt den Rest, einschließlich eines lokalen Server-Schalters.
5. Über die API abfragen. Ollama stellt einen OpenAI-kompatiblen Endpunkt auf Port 11434 bereit, sodass vorhandener Code mit einem einzeiligen Base-URL-Tausch funktioniert:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:12b",
"messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
}'Sobald das Modell über die Befehlszeile läuft, möchten Sie wahrscheinlich eine richtige Oberfläche. Sie können es in etwa fünf Minuten in eine ChatGPT-ähnliche UI mit Open WebUI einbinden. Neu in diesem Bereich? Beginnen Sie mit unserem vollständigen Leitfaden zum lokalen LLM-Setup. Offizielle Sampling-Empfehlungen und Startoptionen finden Sie auf ai.google.dev sowie in der Ollama-Dokumentation.
Welche Quantisierung sollte man für Gemma 4 12B verwenden?
Für die meisten Nutzer ist Q4KM der sinnvolle Standard: rund 6,6 GB VRAM, nahezu volle Qualität, passt auf eine 8-GB-GPU. Wer 16 GB oder mehr hat und maximale Qualität möchte, wählt Q8. Und wer das beste Qualitäts-zu-Gigabyte-Verhältnis möchte, sollte sich die neuen QAT-Q4_0-Checkpoints ansehen.
Hier die Aktualitätsperspektive, die bislang kaum jemand einbezogen hat. Am 5. Juni 2026, nur zwei Tage nach dem Launch, veröffentlichte Google Quantization-Aware-Training-Checkpoints (QAT) Q4_0 zusammen mit einem neuen Mobilformat. QAT bedeutet, dass das Modell mit Quantisierung im Training berücksichtigt wurde, sodass es bei einem Q4-Footprint nahezu die Qualität der vollen Präzision (near-FP) beibehält. Gleiche ~6,6 GB, merklich geringerer Qualitätsverlust als bei Standard-Q4 nach dem Training. Wer VRAM-limitiert, aber qualitätssensibel ist, trifft damit die richtige Wahl.
Schnelle Entscheidungshilfe:
- 8-GB-Karte, einfache Lösung: Q4KM.
- 8-GB-Karte, beste Qualität bei dieser Größe: QAT Q4_0.
- 16-GB+-Karte, maximale Qualität: Q8.
- Dazwischen, etwas freier VRAM: Q5KM.
Googles Begründung ist in der QAT-Ankündigung nachzulesen. Fazit: Q4KM ist in Ordnung, QAT Q4_0 ist bei gleicher Größe besser, und Q8 lohnt sich nur, wenn Genauigkeit wichtiger ist als Speicher.
Gemma 4 12B vs. Gemma 3 12B vs. Qwen 3.5: Lohnt sich das Upgrade?
Ja, das Upgrade von Gemma 3 12B lohnt sich, wenn die Apache-2.0-Lizenz, nativer Audio-Input, das 256K-Kontextfenster oder der MMLU-Pro-Sprung relevant sind. Gegenüber Qwen 3.5 ist es knapper. Gemma 4 12B gewinnt bei der Lizenzfreizügigkeit und nativem Audio, aber Qwen 3.5 führt bei einigen 12B-Benchmark-Zeilen. Die Entscheidung sollte auf dem konkreten Bedarf basieren, nicht auf der Schlagzeile.
| Merkmal | Gemma 4 12B | Gemma 3 12B | Qwen 3.5 (12B-Klasse) |
|---|---|---|---|
| Lizenz | Apache 2.0 | Custom-Gemma-Lizenz | Apache 2.0 |
| Kontext | 256K | 128K | Bis zu 256K |
| Modalitäten | Text + Bild + Audio | Text + Bild | Text + Bild |
| Nativer Audio-Input | Ja | Nein | Nein |
| MMLU Pro | 77,2 % | Niedriger | Wettbewerbsfähig, führt bei einigen Zeilen |
| Q4 VRAM | ~6,6 GB | ~6,6 GB | ~6,6 GB |
Die Lizenzänderung allein rechtfertigt für viele Teams den Wechsel von Gemma 3 12B. Gemma 3 wurde unter Googles eigener Lizenz mit Nutzungsbeschränkungen veröffentlicht; Gemma 4 ist reines Apache 2.0. Wer Gemma aus kommerziellen Gründen bisher gemieden hat, hat jetzt freie Fahrt.
Gegenüber Qwen 3.5 sollte man ehrlich mit sich sein. Qwen 3.5 ist wirklich stark und übertrifft Gemma 4 12B bei bestimmten Reasoning- und Coding-Zeilen. Wer Audio-Input und eine permissive Lizenz nicht benötigt, sollte beide Modelle auf der eigenen Aufgabe benchmarken, bevor er sich festlegt. Einen Überblick, wo Gemma 4 12B unter den besten Open-Source-Modellen steht, gibt es hier. Und da es Apache 2.0 ist, kann man es mit Unsloth unter Apache 2.0 fine-tunen ohne Lizenzprobleme.
Wann sollte man Gemma 4 12B nicht verwenden?
Gemma 4 12B ist nicht die richtige Wahl, wenn Frontier-Level-Reasoning erforderlich ist, das nur ein viel größeres Modell liefert, wenn Qwen 3.5 bei der Benchmark-Zeile führt, auf die es bei der eigenen Aufgabe ankommt, oder wenn das Projekt stark auf Audio-Tooling setzt, das drei Tage nach dem Launch noch reift. Es ist ein ausgezeichnetes 12B-Modell, kein Allheilmittel.
Gemma 4 12B ist nicht immer die richtige Wahl. Wer Frontier-Level-Reasoning benötigt, wird mit einem größeren Modell besser bedient. Die native Audio-Unterstützung ist real und beeindruckend, aber das Ökosystem drumherum — Bibliotheken, Hilfsprogramme, Framework-Integrationen — ist wenige Tage alt und stellenweise noch rau. Wer diese Woche ein audio-lastiges Produkt ausliefert, sollte gründlich testen, bevor er darauf setzt.
Noch einige ehrliche Ausschlusskriterien. Wer das Modell in einen Agenten einbindet, sollte die Tool-Calling-Zuverlässigkeit auf den eigenen Aufgaben zuerst prüfen, da agentisches Verhalten modellabhängig variiert. Wer auf den langen Kontext setzt, sollte sicherstellen, das 256K-Kontextfenster auch wirklich gut zu nutzen, denn reine Fenstergröße bedeutet nicht automatisch bessere Ausgabe. Und wer über lokale Ausführung hinaus in den Produktivbetrieb geht, findet bei vLLM vs. SGLang den Einstieg in das Thema Production-Serving. Bei der Produktionsbereitstellung offener Modelle wie Gemma 4 12B helfen wir gerne.
Über den Autor
Mert Batur Gurbuz ist Mitgründer von Techsy.io, wo das Team KI-Agenten, Automatisierungssysteme und Voice/SDR-Pipelines für B2B-Kunden entwickelt. Er studiert an der University of Birmingham und schreibt über den LLM-Tooling-Stack, den das Techsy-Team tatsächlich in der Produktion einsetzt. Kontakt über LinkedIn.
Ein Tool auszuwählen ist der einfache Teil. Es zuverlässig in einem echten Produkt zum Laufen zu bringen, daran scheitern die meisten Teams, und genau das baut unser KI-Integrationsteam für Kunden, von RAG-Pipelines bis zu individuellen Agenten.
Häufig gestellte Fragen
Wie betreibt man Gemma 4 12B lokal?
Ollama installieren, dann ollama run gemma4:12b ausführen. Das lädt das 7,6-GB-Modell und öffnet einen Chat-Prompt. Keine Python-Umgebung oder Konfigurationsdateien erforderlich. Wer lieber eine grafische App bevorzugt, kann auch LM Studio verwenden: Im Modell-Browser nach gemma 4 12b suchen und einen Q4KM-Build herunterladen.
Welche VRAM- und Hardwareanforderungen hat Gemma 4 12B?
Gemma 4 12B benötigt bei Q4KM-Quantisierung rund 6,6 GB VRAM und passt damit auf eine 8-GB-GPU. Für komfortablen Spielraum, insbesondere beim Einsatz des langen Kontexts, sollten Sie 16 GB VRAM oder Unified Memory anstreben. Es läuft auf Laptops, einschließlich M-Serie-Macs über Unified Memory.
Kann Gemma 4 12B auf einem 16-GB-Laptop laufen?
Ja, problemlos. Bei Q4KM nutzt das Modell rund 6,6 GB, es bleibt also reichlich Platz auf einem 16-GB-Gerät. Auf Apple-Silicon-Laptops funktioniert das Unified Memory gut über den gemma4:12b-mlx-Build. Auf 16 GB können Sie sogar auf Q8-Quantisierung für höhere Qualität wechseln.
Ist Gemma 4 12B wirklich besser als Llama oder Qwen 3.5?
Das hängt davon ab, was gemessen wird. Gemma 4 12B gewinnt bei der Apache-2.0-Lizenz, nativem Audio-Input und einem 256K-Kontextfenster, und erzielt starke 77,2 % auf MMLU Pro. Qwen 3.5 führt jedoch bei einigen 12B-Reasoning- und Coding-Zeilen. Beide Modelle sollten auf der eigenen Aufgabe benchmarkt werden, bevor eine Entscheidung fällt.
Ist Gemma 4 12B besser als Gemma 3 12B?
Ja. Gemma 4 12B wechselt zur permissiven Apache-2.0-Lizenz, fügt nativen Audio-Input hinzu, verdoppelt das Kontextfenster auf 256K Tokens und zeigt eine deutliche MMLU-Pro-Verbesserung. Die Lizenzänderung allein rechtfertigt das Upgrade für kommerzielle Projekte, die durch die Custom-Bedingungen von Gemma 3 blockiert waren.
Welche Quantisierung sollte man für Gemma 4 12B verwenden?
Q4KM ist der sinnvolle Standard mit rund 6,6 GB und nahezu voller Qualität. Wer bei gleicher Größe die beste Qualität möchte, verwendet die neuen QAT-Q4_0-Checkpoints, die am 5. Juni 2026 veröffentlicht wurden und nahezu Full-Precision-Qualität bei Q4-Footprint bieten. Q8 empfiehlt sich nur bei 16 GB+ und maximalem Qualitätsbedarf.
Ist Gemma 4 12B für die kommerzielle Nutzung kostenlos?
Ja. Gemma 4 12B wird unter der Apache-2.0-Lizenz veröffentlicht, die kommerzielle Nutzung ohne die Einschränkungen der Custom-Gemma-Lizenz von Gemma 3 erlaubt. Es können kommerzielle Produkte entwickelt, das Modell fine-getuned und weiterverbreitet werden. Diese Lizenzänderung ist einer der Hauptgründe, warum Teams von Gemma 3 upgraden.
Unterstützt Gemma 4 12B wirklich Audio-Input?
Ja. Gemma 4 12B ist das erste mittelgroße Gemma mit nativem Audio-Input. Dank seines encoderfreien Designs werden rohe Audio-Wellenformen direkt in das Modell projiziert, ohne separaten Audio-Encoder. Allerdings ist das Ökosystem rundherum erst wenige Tage alt — sorgfältiges Testen vor der Produktionsnutzung audio-lastiger Features ist daher ratsam.
Wie schnell ist Gemma 4 12B auf einer RTX 4090?
Publizierte Drittanbieter-Berichte setzen Gemma 4 12B bei Q4KM auf einer 24-GB-RTX-4090 komfortabel in den Echtzeit-Chat-Bereich, obwohl drei Tage nach dem Launch noch kein präziser anhaltender tokens/sec-Wert für diese Karte publiziert ist. Die Geschwindigkeit variiert je nach Prompt-Länge, Kontextgröße und Backend-Version — frühe Zahlen sind als grobe Richtwerte zu betrachten.
Wo kann man Gemma 4 12B herunterladen?
Das Instruction-Tuned-Modell ist auf HuggingFace als google/gemma-4-12B-it verfügbar, oder es kann über Ollama mit ollama run gemma4:12b (7,6-GB-Download) geladen werden. LM-Studio-Nutzer suchen im Modell-Browser der App nach gemma 4 12b. Für bestimmte Quantisierungsstufen sind GGUF-Dateien aus Community-Repos wie Unsloth verfügbar.