Techsy
Kontakt
Loslegen
Zurück zum Blog
ai-machine-learning

Gemma 4 12B: Benchmarks, VRAM-Bedarf & lokaler Betrieb

Geschrieben von Mert Batur Gürbüz
Aktualisiert Jul 14, 2026
13 Lesezeit
Inhaltsverzeichnis
Gemma 4 12B: Benchmarks, VRAM-Bedarf & lokaler Betrieb

Google DeepMind hat Gemma 4 12B am 3. Juni 2026 veröffentlicht. Drei Tage später ist die Zahl, die überall kursiert, der MMLU-Pro-Score: 77,2 %. Das übertrifft das letztjährige Gemma 3 27B, das auf demselben Test 67,6 % erreichte. Ein Modell mit 12 Milliarden Parametern, das ein 27B-Flaggschiff schlägt? Bei weniger als halbem Speicherbedarf? Das ist bemerkenswert. Und die Lizenz hat sich ebenfalls geändert. Gemma 4 erscheint unter Apache 2.0, kommerzielle Nutzung ist also problemlos möglich, ohne Einschränkungen. Das Modell verfügt über ein 256K-Token-Kontextfenster und läuft nach der Quantisierung mit rund 6,6 GB VRAM. Genau das ist für die meisten Nutzer entscheidend: dieses Modell passt auf eine mittelklassige GPU.

Wichtigste Erkenntnisse

  • Gemma 4 12B (veröffentlicht am 3. Juni 2026) erzielt 77,2 % auf MMLU Pro und übertrifft damit das letztjährige Gemma 3 27B (67,6 %).
  • Es läuft mit ca. 6,6 GB VRAM bei Q4KM und passt auf eine 8-GB-GPU; ca. 16 GB bieten komfortablen Spielraum.
  • Apache-2.0-Lizenz (kommerzielle Nutzung erlaubt), 256K Kontext, nativer Audio- und Bildeingabe, encoderfreie Architektur.
  • Einziger Befehl zum Starten: ollama run gemma4:12b (7,6 GB Download).

Was ist Gemma 4 12B?

Gemma 4 12B ist ein Open-Weights-Modell mit 12 Milliarden Parametern von Google DeepMind, veröffentlicht am 3. Juni 2026 unter einer Apache-2.0-Lizenz. Es handelt sich um ein encoderfreies, einheitliches multimodales Modell: Text, Bilder und nativer Audio-Input werden verarbeitet, Text wird ausgegeben. Das Modell verfügt über ein 256K-Token-Kontextfenster und unterstützt 140 Sprachen.

Die Instruction-Tuned-Variante, die Sie tatsächlich verwenden werden, heißt gemma-4-12B-it (das „it" steht für instruction-tuned, also die für Chat optimierte Version). Sie hat 11,95 Milliarden Parameter insgesamt, „12B" ist also leicht gerundet. Trainingsschluss war Januar 2025.

Das Interessante an Gemma 4 12B: Es ist das erste mittelgroße Gemma mit nativem Audio-Input. Es gibt keinen separaten Audio-Encoder, der zusätzlich eingebunden wurde. Rohe Audio-Wellenformen werden direkt in das Modell projiziert. Dasselbe gilt für Bilder. Diese Designentscheidung erklärt, warum es klein genug bleibt, um auf einer einzigen Consumer-GPU zu laufen — dazu gleich mehr.

Für den größeren Überblick: Unser Leitfaden zum Betrieb offener Modelle auf dem eigenen Rechner erklärt die Setup-Grundlagen, falls Sie neu im Bereich lokaler LLMs sind. Googles offizielle Ankündigung enthält alle Details.

Gemma 4 12B: Technische Daten auf einen Blick

Alle verifizierten Angaben in einer Tabelle. Kein Rätselraten.

SpezifikationWert
Vollständiger NameGemma 4 12B (gemma-4-12B-it)
Parameter11,95 Mrd. (~12B)
LizenzApache 2.0 (kommerzielle Nutzung erlaubt)
Kontextfenster256K Tokens
ModalitätenText + Bild + nativer Audio-Input, Text-Output
ArchitekturEncoderfrei, einheitlich, 48 Schichten, hybride Attention
Sprachen140
TrainingsschlussJanuar 2025
Ollama-Taggemma4:12b (7,6 GB Download)
Apple-Silicon-Taggemma4:12b-mlx
Empfohlenes Samplingtemperature 1.0, top_p 0.95, top_k 64

Ein Hinweis zum Sampling: Bleiben Sie bei den empfohlenen Werten temperature=1.0, top_p=0.95, top_k=64, sofern Sie keinen triftigen Grund haben, davon abzuweichen. Gemma-Modelle verhalten sich bei niedrigen Temperaturen merkwürdig — senken Sie die Temperatur also nicht reflexartig auf 0,2, wie Sie es vielleicht von anderen Modellen gewohnt sind.

Wie funktioniert die encoderfreie Architektur?

Encoderfrei bedeutet, dass es kein separates Modell gibt, das Bilder oder Audio umwandelt, bevor sie das Sprachmodell erreichen. Bild-Patches und rohe Audio-Wellenformen werden direkt über dünne lineare Schichten in den gemeinsamen Embedding-Raum projiziert. Die meisten multimodalen Modelle bauen einen schweren Vision-Encoder auf das LLM auf. Gemma 4 12B verzichtet darauf — deshalb passt es in 16 GB.

Ein nützlicher Vergleich: Stellen Sie sich einen Übersetzer im Gegensatz zu einer zweisprachig aufgewachsenen Person vor. Der alte Ansatz heuert einen separaten Übersetzer (den Encoder) an, der Bilder in eine Sprache übersetzt, die das Modell versteht, und leitet das Ergebnis weiter. Gemma 4 12B ist von Anfang an zweisprachig. Audio- und Bilddaten sprechen die Muttersprache des Modells direkt, über eine leichtgewichtige Projektionsschicht statt eines umfangreichen Encoders.

Technisch besteht das Modell aus 48 Schichten mit hybrider Attention. Die meisten Schichten verwenden ein Sliding-Window mit 1.024 Tokens (günstig, lokal), abwechselnd mit globalen Attention-Schichten, die den gesamten Kontext berücksichtigen. Diese Kombination ermöglicht ein 256K-Kontextfenster, ohne die GPU zu überlasten.

Architekturdiagramm ohne Encoder: Audio-Wellenformen und Bild-Patches projizieren direkt in den Gemma 4 12B Embedding-Raum
So verarbeitet Gemma 4 12B Audio- und Bilddaten ohne separaten Encoder

Der praktische Vorteil: Weniger Parameter für Encoder bedeuten, dass mehr VRAM-Budget für die eigentliche Verarbeitung zur Verfügung steht. Darin liegt der Kompromiss, der einem 12B-Modell diese Leistung ermöglicht.

Gemma 4 12B Benchmarks: Die echten Zahlen

Das Kernresultat hält stand: Gemma 4 12B erzielt 77,2 % auf MMLU Pro und übertrifft damit Gemma 3 27B mit 67,6 % auf demselben Test, bei weniger als halbem VRAM-Verbrauch. Dies sind die offiziellen Instruction-Tuned-Werte (-it) von Google, keine Community-Schätzungen. Hier die vollständige Übersicht.

BenchmarkGemma 4 12BGemma 3 27B (Referenz)
MMLU Pro77,2 %67,6 %
GPQA Diamond78,8 %—
MMMU Pro69,1 %—
AIME 2026 (ohne Werkzeuge)77,5 %—
LiveCodeBench v672,0 %—
Codeforces ELO1659—

Ein 12B-Modell übertrifft jetzt das 27B-Flaggschiff des letzten Jahres auf MMLU Pro: 77,2 % gegenüber 67,6 %. Das ist ein generationeller Sprung, der einen dazu bringt, seine Hardware-Kalkulationen zu überdenken.

Balkendiagramm: Gemma 4 12B vs. Gemma 3 27B vs. Gemma 3 12B auf dem MMLU-Pro-Benchmark
Gemma 4 12B vs. Gemma 3 27B vs. Gemma 3 12B auf MMLU Pro — das kleinere neue Modell erzielt den höchsten Wert

Zwei ehrliche Einschränkungen. Erstens: Die Striche bedeuten, dass Google für diese Zeilen keine Gemma-3-27B-Werte veröffentlicht hat, daher bleiben die Felder leer, anstatt mit Schätzungen gefüllt zu werden. Zweitens: Alle hier angegebenen Werte beziehen sich auf das Instruction-Tuned-Modell. Die Basismodell-Zahlen weichen ab. Sie können alle Werte auf der HuggingFace-Modellkarte und der DeepMind-Modellseite überprüfen.

Wie viel VRAM benötigt Gemma 4 12B?

Gemma 4 12B benötigt ca. 6,6 GB VRAM bei Q4KM-Quantisierung, was bedeutet, dass es auf eine 8-GB-GPU passt. Für komfortablen Spielraum, insbesondere wenn Sie einen größeren Teil des 256K-Kontexts nutzen möchten, sollten Sie auf 16 GB VRAM oder Unified Memory abzielen. Es läuft auf einem Laptop. M-Serie-Macs kommen damit über Unified Memory problemlos zurecht.

Quantisierung ist im Wesentlichen Komprimierung für Modellgewichte. Niedrigere Präzisionszahlen, kleinere Datei, minimal verringerte Genauigkeit. Hier sehen Sie, wie die gängigen Stufen im Vergleich aussehen.

QuantisierungUngefährer VRAMQualitätEmpfohlen für
Q4_K_M~6,6 GBNahezu vollständig, minimaler VerlustSinnvoller Standard; passt auf 8-GB-Karten
Q5_K_M~8,5 GBEtwas besser als Q4Etwas freier VRAM, höhere Genauigkeit gewünscht
Q8~13 GBEffektiv volle Qualität16 GB+ Karten, maximale Qualität
QAT Q4_0~6,6 GBNahezu FP bei Q4-GrößeBeste Qualität pro GB (veröffentlicht am 5. Juni)

Horizontales Balkendiagramm: VRAM-Verbrauch von Gemma 4 12B nach Quantisierungsstufe mit Referenzlinien bei 8 GB und 16 GB
VRAM-Footprint von Gemma 4 12B pro Quantisierungsstufe, mit 8-GB- und 16-GB-GPU-Referenzlinien

Wenn Sie Hardware rund um dieses Modell auswählen: Unser Überblick über lokale LLM-Tools, die wir getestet haben, zeigt, welche Backends das Beste aus einer bestimmten Karte herausholen. Die Kurzfassung: Eine 12-GB-Karte läuft Q4 mit Reserve, eine 8-GB-Karte läuft Q4, wenn Sie den Kontext überschaubar halten.

Gemma 4 12B Geschwindigkeit: Tokens/sec auf echter Hardware

Wie schnell ist es? Das hängt von der Grafikkarte, der Quantisierung und dem Backend ab. Statt einer einzelnen Zahl wurden hier die publizierten Drittanbieter-Werte an einem Ort zusammengestellt. Diese wurden von Community-Testern und Anbietern gemeldet und sind der jeweiligen Quelle zugeordnet. Es handelt sich nicht um eigene Labormessungen.

HardwareQuantGemeldete tokens/secQuelle
RTX 3060 (6 GB)Q4_K_M~6,6 GB VRAM-Footprint, läuft lokal (tok/s nicht präzise gemeldet)runaiathome
RTX 4090 (24 GB)Q4_K_MEchtzeit-Chat-Bereich (genaue tok/s noch nicht gemeldet)apxml / Community
Apple M-Serie (Unified)mlx / Q4Läuft über gemma4:12b-mlx (tok/s noch nicht weit verbreitet gemeldet)Ollama / Community

Hier eine klare Aussage dazu, was die öffentlichen Daten aktuell tatsächlich zeigen. runaiathome bestätigte, dass das Modell auf einem 6-GB-RTX-3060 innerhalb des ~6,6-GB-Q4KM-Footprints läuft — das ist bislang der konkreteste veröffentlichte Hardware-Bericht. Das apxml-Datenblatt und die Ollama-Library-Seite bestätigen, dass das Modell auf einer 24-GB-RTX-4090 bei Q4 lokal und im Echtzeit-Chat-Bereich läuft, aber ein präziser anhaltender tok/s-Wert für diese Karte ist drei Tage nach dem Launch noch nicht publiziert. Die Apple-Silicon-Variante gemma4:12b-mlx existiert und läuft, aber verlässliche tok/s-Zahlen haben sich drei Tage nach dem Launch noch nicht herauskristallisiert.

Was das für Sie bedeutet, nach Tier: Auf einer 6-GB-Karte wie der RTX 3060 lädt und läuft das Modell für lokalen Chat — halten Sie das Kontextfenster dabei überschaubar. Auf einer 24-GB-RTX-4090 bei Q4KM setzen publizierte Berichte es komfortabel in den Echtzeit-Chat-Bereich. Auf Apple Silicon läuft der MLX-Build, aber Benchmark-Zahlen kommen noch.

Dies sind publizierte Drittanbieter-Angaben, keine eigenen Labormessungen — behandeln Sie sie als grobe Richtwerte. Ihre tok/s hängen von der Prompt-Länge, der Kontextgröße und der Backend-Version ab. Quellen: Ollama Library, apxml und runaiathome. Wenn in den nächsten zwei Wochen weitere Community-Benchmarks eintreffen, wird diese Tabelle aktualisiert.

Wie betreibt man Gemma 4 12B lokal?

Der kürzeste Weg: Ollama installieren, einen Befehl ausführen, fertig. ollama run gemma4:12b lädt das 7,6-GB-Modell herunter und öffnet direkt einen Chat-Prompt. Keine Konfigurationsdateien, keine Python-Umgebung. Wenn Sie mehr Kontrolle möchten oder auf Apple Silicon arbeiten, gibt es vier weitere Wege.

1. Ollama (der einfache Standard). In zwei Zeilen starten:

bash
ollama pull gemma4:12b
ollama run gemma4:12b

2. llama.cpp mit einem GGUF. Wenn Sie eine bestimmte Quantisierungsstufe wünschen, verweisen Sie llama.cpp auf eine GGUF-Datei auf HuggingFace. GGUF ist das Dateiformat, das llama.cpp für quantisierte Gewichte verwendet:

bash
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."

3. MLX auf Apple Silicon. M-Serie-Macs erhalten einen dedizierten MLX-Build, der Apples Framework statt CUDA nutzt:

bash
ollama run gemma4:12b-mlx

4. LM Studio (GUI, kein Terminal). Bevorzugen Sie eine Desktop-App? LM Studio öffnen, auf den Such-Tab klicken und gemma 4 12b eingeben. Ein Q4KM-GGUF auswählen und herunterladen. LM Studio erledigt den Rest, einschließlich eines lokalen Server-Schalters.

5. Über die API abfragen. Ollama stellt einen OpenAI-kompatiblen Endpunkt auf Port 11434 bereit, sodass vorhandener Code mit einem einzeiligen Base-URL-Tausch funktioniert:

bash
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemma4:12b",
    "messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
  }'

Sobald das Modell über die Befehlszeile läuft, möchten Sie wahrscheinlich eine richtige Oberfläche. Sie können es in etwa fünf Minuten in eine ChatGPT-ähnliche UI mit Open WebUI einbinden. Neu in diesem Bereich? Beginnen Sie mit unserem vollständigen Leitfaden zum lokalen LLM-Setup. Offizielle Sampling-Empfehlungen und Startoptionen finden Sie auf ai.google.dev sowie in der Ollama-Dokumentation.

Welche Quantisierung sollte man für Gemma 4 12B verwenden?

Für die meisten Nutzer ist Q4KM der sinnvolle Standard: rund 6,6 GB VRAM, nahezu volle Qualität, passt auf eine 8-GB-GPU. Wer 16 GB oder mehr hat und maximale Qualität möchte, wählt Q8. Und wer das beste Qualitäts-zu-Gigabyte-Verhältnis möchte, sollte sich die neuen QAT-Q4_0-Checkpoints ansehen.

Hier die Aktualitätsperspektive, die bislang kaum jemand einbezogen hat. Am 5. Juni 2026, nur zwei Tage nach dem Launch, veröffentlichte Google Quantization-Aware-Training-Checkpoints (QAT) Q4_0 zusammen mit einem neuen Mobilformat. QAT bedeutet, dass das Modell mit Quantisierung im Training berücksichtigt wurde, sodass es bei einem Q4-Footprint nahezu die Qualität der vollen Präzision (near-FP) beibehält. Gleiche ~6,6 GB, merklich geringerer Qualitätsverlust als bei Standard-Q4 nach dem Training. Wer VRAM-limitiert, aber qualitätssensibel ist, trifft damit die richtige Wahl.

Schnelle Entscheidungshilfe:

  • 8-GB-Karte, einfache Lösung: Q4KM.
  • 8-GB-Karte, beste Qualität bei dieser Größe: QAT Q4_0.
  • 16-GB+-Karte, maximale Qualität: Q8.
  • Dazwischen, etwas freier VRAM: Q5KM.

Googles Begründung ist in der QAT-Ankündigung nachzulesen. Fazit: Q4KM ist in Ordnung, QAT Q4_0 ist bei gleicher Größe besser, und Q8 lohnt sich nur, wenn Genauigkeit wichtiger ist als Speicher.

Gemma 4 12B vs. Gemma 3 12B vs. Qwen 3.5: Lohnt sich das Upgrade?

Ja, das Upgrade von Gemma 3 12B lohnt sich, wenn die Apache-2.0-Lizenz, nativer Audio-Input, das 256K-Kontextfenster oder der MMLU-Pro-Sprung relevant sind. Gegenüber Qwen 3.5 ist es knapper. Gemma 4 12B gewinnt bei der Lizenzfreizügigkeit und nativem Audio, aber Qwen 3.5 führt bei einigen 12B-Benchmark-Zeilen. Die Entscheidung sollte auf dem konkreten Bedarf basieren, nicht auf der Schlagzeile.

MerkmalGemma 4 12BGemma 3 12BQwen 3.5 (12B-Klasse)
LizenzApache 2.0Custom-Gemma-LizenzApache 2.0
Kontext256K128KBis zu 256K
ModalitätenText + Bild + AudioText + BildText + Bild
Nativer Audio-InputJaNeinNein
MMLU Pro77,2 %NiedrigerWettbewerbsfähig, führt bei einigen Zeilen
Q4 VRAM~6,6 GB~6,6 GB~6,6 GB

Die Lizenzänderung allein rechtfertigt für viele Teams den Wechsel von Gemma 3 12B. Gemma 3 wurde unter Googles eigener Lizenz mit Nutzungsbeschränkungen veröffentlicht; Gemma 4 ist reines Apache 2.0. Wer Gemma aus kommerziellen Gründen bisher gemieden hat, hat jetzt freie Fahrt.

Gegenüber Qwen 3.5 sollte man ehrlich mit sich sein. Qwen 3.5 ist wirklich stark und übertrifft Gemma 4 12B bei bestimmten Reasoning- und Coding-Zeilen. Wer Audio-Input und eine permissive Lizenz nicht benötigt, sollte beide Modelle auf der eigenen Aufgabe benchmarken, bevor er sich festlegt. Einen Überblick, wo Gemma 4 12B unter den besten Open-Source-Modellen steht, gibt es hier. Und da es Apache 2.0 ist, kann man es mit Unsloth unter Apache 2.0 fine-tunen ohne Lizenzprobleme.

Wann sollte man Gemma 4 12B nicht verwenden?

Gemma 4 12B ist nicht die richtige Wahl, wenn Frontier-Level-Reasoning erforderlich ist, das nur ein viel größeres Modell liefert, wenn Qwen 3.5 bei der Benchmark-Zeile führt, auf die es bei der eigenen Aufgabe ankommt, oder wenn das Projekt stark auf Audio-Tooling setzt, das drei Tage nach dem Launch noch reift. Es ist ein ausgezeichnetes 12B-Modell, kein Allheilmittel.

Gemma 4 12B ist nicht immer die richtige Wahl. Wer Frontier-Level-Reasoning benötigt, wird mit einem größeren Modell besser bedient. Die native Audio-Unterstützung ist real und beeindruckend, aber das Ökosystem drumherum — Bibliotheken, Hilfsprogramme, Framework-Integrationen — ist wenige Tage alt und stellenweise noch rau. Wer diese Woche ein audio-lastiges Produkt ausliefert, sollte gründlich testen, bevor er darauf setzt.

Noch einige ehrliche Ausschlusskriterien. Wer das Modell in einen Agenten einbindet, sollte die Tool-Calling-Zuverlässigkeit auf den eigenen Aufgaben zuerst prüfen, da agentisches Verhalten modellabhängig variiert. Wer auf den langen Kontext setzt, sollte sicherstellen, das 256K-Kontextfenster auch wirklich gut zu nutzen, denn reine Fenstergröße bedeutet nicht automatisch bessere Ausgabe. Und wer über lokale Ausführung hinaus in den Produktivbetrieb geht, findet bei vLLM vs. SGLang den Einstieg in das Thema Production-Serving. Bei der Produktionsbereitstellung offener Modelle wie Gemma 4 12B helfen wir gerne.

Über den Autor

Mert Batur Gurbuz ist Mitgründer von Techsy.io, wo das Team KI-Agenten, Automatisierungssysteme und Voice/SDR-Pipelines für B2B-Kunden entwickelt. Er studiert an der University of Birmingham und schreibt über den LLM-Tooling-Stack, den das Techsy-Team tatsächlich in der Produktion einsetzt. Kontakt über LinkedIn.

Ein Tool auszuwählen ist der einfache Teil. Es zuverlässig in einem echten Produkt zum Laufen zu bringen, daran scheitern die meisten Teams, und genau das baut unser KI-Integrationsteam für Kunden, von RAG-Pipelines bis zu individuellen Agenten.

Häufig gestellte Fragen

Wie betreibt man Gemma 4 12B lokal?

Ollama installieren, dann ollama run gemma4:12b ausführen. Das lädt das 7,6-GB-Modell und öffnet einen Chat-Prompt. Keine Python-Umgebung oder Konfigurationsdateien erforderlich. Wer lieber eine grafische App bevorzugt, kann auch LM Studio verwenden: Im Modell-Browser nach gemma 4 12b suchen und einen Q4KM-Build herunterladen.

Welche VRAM- und Hardwareanforderungen hat Gemma 4 12B?

Gemma 4 12B benötigt bei Q4KM-Quantisierung rund 6,6 GB VRAM und passt damit auf eine 8-GB-GPU. Für komfortablen Spielraum, insbesondere beim Einsatz des langen Kontexts, sollten Sie 16 GB VRAM oder Unified Memory anstreben. Es läuft auf Laptops, einschließlich M-Serie-Macs über Unified Memory.

Kann Gemma 4 12B auf einem 16-GB-Laptop laufen?

Ja, problemlos. Bei Q4KM nutzt das Modell rund 6,6 GB, es bleibt also reichlich Platz auf einem 16-GB-Gerät. Auf Apple-Silicon-Laptops funktioniert das Unified Memory gut über den gemma4:12b-mlx-Build. Auf 16 GB können Sie sogar auf Q8-Quantisierung für höhere Qualität wechseln.

Ist Gemma 4 12B wirklich besser als Llama oder Qwen 3.5?

Das hängt davon ab, was gemessen wird. Gemma 4 12B gewinnt bei der Apache-2.0-Lizenz, nativem Audio-Input und einem 256K-Kontextfenster, und erzielt starke 77,2 % auf MMLU Pro. Qwen 3.5 führt jedoch bei einigen 12B-Reasoning- und Coding-Zeilen. Beide Modelle sollten auf der eigenen Aufgabe benchmarkt werden, bevor eine Entscheidung fällt.

Ist Gemma 4 12B besser als Gemma 3 12B?

Ja. Gemma 4 12B wechselt zur permissiven Apache-2.0-Lizenz, fügt nativen Audio-Input hinzu, verdoppelt das Kontextfenster auf 256K Tokens und zeigt eine deutliche MMLU-Pro-Verbesserung. Die Lizenzänderung allein rechtfertigt das Upgrade für kommerzielle Projekte, die durch die Custom-Bedingungen von Gemma 3 blockiert waren.

Welche Quantisierung sollte man für Gemma 4 12B verwenden?

Q4KM ist der sinnvolle Standard mit rund 6,6 GB und nahezu voller Qualität. Wer bei gleicher Größe die beste Qualität möchte, verwendet die neuen QAT-Q4_0-Checkpoints, die am 5. Juni 2026 veröffentlicht wurden und nahezu Full-Precision-Qualität bei Q4-Footprint bieten. Q8 empfiehlt sich nur bei 16 GB+ und maximalem Qualitätsbedarf.

Ist Gemma 4 12B für die kommerzielle Nutzung kostenlos?

Ja. Gemma 4 12B wird unter der Apache-2.0-Lizenz veröffentlicht, die kommerzielle Nutzung ohne die Einschränkungen der Custom-Gemma-Lizenz von Gemma 3 erlaubt. Es können kommerzielle Produkte entwickelt, das Modell fine-getuned und weiterverbreitet werden. Diese Lizenzänderung ist einer der Hauptgründe, warum Teams von Gemma 3 upgraden.

Unterstützt Gemma 4 12B wirklich Audio-Input?

Ja. Gemma 4 12B ist das erste mittelgroße Gemma mit nativem Audio-Input. Dank seines encoderfreien Designs werden rohe Audio-Wellenformen direkt in das Modell projiziert, ohne separaten Audio-Encoder. Allerdings ist das Ökosystem rundherum erst wenige Tage alt — sorgfältiges Testen vor der Produktionsnutzung audio-lastiger Features ist daher ratsam.

Wie schnell ist Gemma 4 12B auf einer RTX 4090?

Publizierte Drittanbieter-Berichte setzen Gemma 4 12B bei Q4KM auf einer 24-GB-RTX-4090 komfortabel in den Echtzeit-Chat-Bereich, obwohl drei Tage nach dem Launch noch kein präziser anhaltender tokens/sec-Wert für diese Karte publiziert ist. Die Geschwindigkeit variiert je nach Prompt-Länge, Kontextgröße und Backend-Version — frühe Zahlen sind als grobe Richtwerte zu betrachten.

Wo kann man Gemma 4 12B herunterladen?

Das Instruction-Tuned-Modell ist auf HuggingFace als google/gemma-4-12B-it verfügbar, oder es kann über Ollama mit ollama run gemma4:12b (7,6-GB-Download) geladen werden. LM-Studio-Nutzer suchen im Modell-Browser der App nach gemma 4 12b. Für bestimmte Quantisierungsstufen sind GGUF-Dateien aus Community-Repos wie Unsloth verfügbar.

Tags

gemma 4 12bollamalokales llmquantisierunggemma

Diesen Artikel teilen

Verwandte Artikel

Mehr in ai-machine-learning

ai-machine-learning
Jul 20, 2026

Prompt Engineering für Coding: 7 Muster, die wir täglich in Claude Code und Cursor nutzen (2026)

Die meisten Artikel zu KI-Coding-Prompts geben Ihnen 50 Vorlagen zum Kopieren. Dieser vermittelt die 7 Muster, mit denen wir täglich eine 16-Agenten-Claude-Code-Pipeline betreiben, mit echtem Vorher-Nachher-Vergleich für jedes Muster und dem Fundort jedes Musters in Claude Code, Cursor und Copilot im Jahr 2026.

11 min read Lesezeit
Lesen
ai-machine-learning
Jul 20, 2026

8 beste KI-Web-Scraping-APIs 2026 (getestet mit unserem eigenen Agenten-Stack)

Wir haben 8 KI-Web-Scraping-APIs mit echten 2026er-Preisen getestet, abgerufen über unseren eigenen Agenten-Stack. Firecrawl, Bright Data, ScrapingBee und 5 weitere, bewertet nach LLM-tauglicher Ausgabe, Anti-Bot-Stärke und MCP-Support.

9 Min. Lesezeit Lesezeit
Lesen
ai-machine-learning
Jul 19, 2026

Chain of Thought Prompting 2026: Wann es hilft, wann es scheitert

Chain of Thought Prompting steigert 2026 bei manchen Modellen weiterhin die Genauigkeit und schadet anderen still. Reasoning-Modelle wie GPT-5 und Claude denken bereits intern in Schritten, sodass manuelles „Denke Schritt für Schritt" oft überflüssig ist. Hier erfahren Sie genau, wann Sie CoT nutzen, wann Sie es weglassen und wie Sie entscheiden, mit Belegen aus OpenAIs und Anthropics eigener Dokumentation.

11 Min. Lesezeit Lesezeit
Lesen
Alle Beiträge ansehen
Ihr Projekt starten

Bereit, etwas Außergewöhnliches zu bauen?

Machen wir aus Ihrer Vision ein fertiges Produkt. Unser Team baut mit Ihnen Software, die spürbar etwas bewegt.

30-Minuten-Scoping-Call buchenUnsere Arbeit ansehen

Frisch aus der Bibliothek

Ressourcen

Alle ansehen
  • Das Software-Beschaffungs-Playbook

    Ein wiederholbares Vorgehen, um Software einzukaufen, ohne sechs Monate und eine Million auf der falschen Plattform zu verbrennen.

  • Das Architektur-Entscheidungs-Playbook

    Ein praxisnahes Vorgehen für die Wahl Ihres Stacks: wann selbst bauen, wann einkaufen, Monolith oder Microservices, und wie Sie lebenslauf-getriebenes Design vermeiden.

  • Das Playbook zur Anbieterauswahl

    Wie Sie den richtigen Entwicklungspartner finden, ob Agentur, Freelancer oder Inhouse, ohne zu viel zu zahlen oder ein halbfertiges Produkt zu bekommen.

Claude Skills

Alle ansehen
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

KI-Automatisierungen

Alle ansehen
  • Security-Auditor

    Wöchentlicher SCA- + IaC-Scan mit priorisierten Fix-PRs.

  • Cold-Email-Texter

    Erzeugt Erstkontakt-Mails, verankert in einem konkreten öffentlichen Detail.

  • Lead-Research-Agent

    Reichert eine E-Mail zum Profil an, bewertet den Fit, meldet in Slack.

Frisch aus der Bibliothek

Ressourcen

Alle ansehen
  • Das Software-Beschaffungs-Playbook

    Ein wiederholbares Vorgehen, um Software einzukaufen, ohne sechs Monate und eine Million auf der falschen Plattform zu verbrennen.

  • Das Architektur-Entscheidungs-Playbook

    Ein praxisnahes Vorgehen für die Wahl Ihres Stacks: wann selbst bauen, wann einkaufen, Monolith oder Microservices, und wie Sie lebenslauf-getriebenes Design vermeiden.

  • Das Playbook zur Anbieterauswahl

    Wie Sie den richtigen Entwicklungspartner finden, ob Agentur, Freelancer oder Inhouse, ohne zu viel zu zahlen oder ein halbfertiges Produkt zu bekommen.

Claude Skills

Alle ansehen
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

KI-Automatisierungen

Alle ansehen
  • Security-Auditor

    Wöchentlicher SCA- + IaC-Scan mit priorisierten Fix-PRs.

  • Cold-Email-Texter

    Erzeugt Erstkontakt-Mails, verankert in einem konkreten öffentlichen Detail.

  • Lead-Research-Agent

    Reichert eine E-Mail zum Profil an, bewertet den Fit, meldet in Slack.

Leistungen

  • Enterprise-Lösungen
  • Mobile Apps
  • Web-Anwendungen

Lösungen

  • CRM-Systeme
  • KI-Integration
  • ERP-Lösungen
  • Voice Agents
  • Prozessautomatisierung
  • Cybersicherheit

Bibliothek

  • Ressourcen
  • Blog
  • Portfolio

Community

  • KI-Automatisierungen
  • Claude Skills

Tools

  • Mobile-App-Kostenrechner
  • OpenAI / LLM API-Kostenrechner
  • MVP-Kostenrechner
  • Voice-AI-Agent-Kostenrechner

Unternehmen

  • Über uns
  • Partner
  • Kontakt

Rechtliches

  • Datenschutz
  • Nutzungsbedingungen
  • Cookie-Richtlinie

Leistungen

  • Enterprise-Lösungen
  • Mobile Apps
  • Web-Anwendungen

Lösungen

  • CRM-Systeme
  • KI-Integration
  • ERP-Lösungen
  • Voice Agents
  • Prozessautomatisierung
  • Cybersicherheit

Bibliothek

  • Ressourcen
  • Blog
  • Portfolio

Community

  • KI-Automatisierungen
  • Claude Skills

Tools

  • Mobile-App-Kostenrechner
  • OpenAI / LLM API-Kostenrechner
  • MVP-Kostenrechner
  • Voice-AI-Agent-Kostenrechner

Unternehmen

  • Über uns
  • Partner
  • Kontakt
RechtlichesDatenschutzNutzungsbedingungenCookie-Richtlinie
TECHSY
© 2026 Techsy. Alle Rechte vorbehalten.