Techsy
Kontakt
Rozpocznij
Powrót do bloga
ai-machine-learning

Gemma 4 12B: benchmarki, wymagania VRAM i jak uruchomić lokalnie

Napisane przez Mert Batur Gürbüz
Zaktualizowano Jun 6, 2026
13 min
Spis treści
Gemma 4 12B: benchmarki, wymagania VRAM i jak uruchomić lokalnie

Gemma 4 12B: benchmarki, wymagania VRAM i jak uruchomić lokalnie

Google DeepMind wydało Gemmę 4 12B 3 czerwca 2026. Trzy dni później liczba, którą wszyscy powtarzają, to wynik na MMLU Pro: 77,2%. To więcej niż zeszłoroczna Gemma 3 27B, która osiągnęła 67,6% na tym samym teście. Model z 12 miliardami parametrów pokonuje flagowca 27B? Przy mniej niż połowie pamięci? Tak. I licencja też się zmieniła. Gemma 4 jest dystrybuowana na licencji Apache 2.0, więc komercyjne użycie jest w porządku, bez gwiazdek. Model ma okno kontekstu 256K tokenów i działa w około 6,6 GB VRAM po kwantyzacji. Ta ostatnia część to cała historia dla większości z nas: ten model mieści się na GPU ze średniej półki.

Najważniejsze wnioski

  • Gemma 4 12B (wydana 3 czerwca 2026) zdobywa 77,2% na MMLU Pro, pokonując zeszłoroczną Gemmę 3 27B (67,6%).
  • Działa w ~6,6 GB VRAM przy Q4_K_M, mieszcząc się na GPU 8GB; ~16GB daje komfortowy zapas.
  • Licencja Apache 2.0 (użycie komercyjne OK), kontekst 256K, natywne wejście audio + obraz, architektura bez enkodera.
  • Jedna komenda, żeby uruchomić: ollama run gemma4:12b (7,6 GB do pobrania).

Czym jest Gemma 4 12B?

Gemma 4 12B to model z otwartymi wagami o 12 miliardach parametrów od Google DeepMind, wydany 3 czerwca 2026 na licencji Apache 2.0. To zunifikowany model multimodalny bez enkodera: tekst, obraz i natywne audio wchodzą, tekst wychodzi. Ma okno kontekstu 256K tokenów i obsługuje 140 języków.

Wariant z dostrajaniem instrukcyjnym, który faktycznie uruchomisz, nazywa się gemma-4-12B-it („it" to skrót od instruction-tuned, wersja gotowa do czatu). Ma łącznie 11,95B parametrów, więc „12B" to lekkie zaokrąglenie w górę. Dane treningowe sięgają do stycznia 2025.

Oto co czyni go interesującym: Gemma 4 12B to pierwsza średniej wielkości Gemma z natywnym wejściem audio. Nie ma osobnego enkodera audio doczepionego z boku. Surowe przebiegi falowe trafiają wprost do modelu. To samo dotyczy obrazów. Ten wybór projektowy sprawia, że model pozostaje wystarczająco mały, by działać na pojedynczej konsumenckiej karcie — i za chwilę wyjaśnimy dlaczego.

Chcesz najpierw szerszy obraz? Nasz przewodnik po uruchamianiu otwartych modeli na własnym komputerze obejmuje podstawy konfiguracji, jeśli jesteś nowy w lokalnych LLM-ach. Oficjalny wpis Google o premierze zawiera pełne ogłoszenie.

Specyfikacja Gemma 4 12B w skrócie

Wszystko zweryfikowane, w jednej tabeli. Bez zgadywania.

SpecyfikacjaWartość
Pełna nazwaGemma 4 12B (gemma-4-12B-it)
Parametry11,95B (~12B)
LicencjaApache 2.0 (użycie komercyjne OK)
Okno kontekstu256K tokenów
ModalnościTekst + obraz + natywne audio na wejściu, tekst na wyjściu
ArchitekturaZunifikowana bez enkodera, 48 warstw, hybrydowa uwaga
Języki140
Granica danych treningowychStyczeń 2025
Tag Ollamagemma4:12b (7,6 GB do pobrania)
Tag Apple Silicongemma4:12b-mlx
Zalecane próbkowanietemperature 1.0, top_p 0.95, top_k 64

Jedna uwaga o próbkowaniu: trzymaj się zalecanego temperature=1.0, top_p=0.95, top_k=64, chyba że masz powód, by to zmienić. Modele Gemma zachowują się dziwnie przy niskich temperaturach, więc nie obniżaj odruchowo do 0,2 jak w przypadku innych modeli.

Jak działa architektura bez enkodera?

„Bez enkodera" oznacza, że nie ma osobnego modelu konwertującego obrazy lub audio, zanim trafią do modelu językowego. Fragmenty wizyjne i surowe przebiegi audio są rzutowane bezpośrednio do wspólnej przestrzeni embeddingów przez cienkie warstwy liniowe. Większość modeli multimodalnych doczepia ciężki enkoder wizyjny do LLM. Gemma 4 12B to pomija, dlatego mieści się w 16GB.

Pomyśl o tym jak o tłumaczu kontra osobie dwujęzycznej. Stare podejście zatrudnia osobnego tłumacza (enkoder), który konwertuje obrazy na język zrozumiały dla modelu, a potem przekazuje wynik. Gemma 4 12B jest dwujęzyczna od urodzenia. Dane audio i obrazowe mówią natywnym językiem modelu bezpośrednio, przez lekką warstwę projekcji zamiast masywnego enkodera.

Pod maskiem to 48 warstw z hybrydową uwagą. Większość warstw używa okna przesuwnego o 1024 tokenach (tanie, lokalne), przeplatanych okazjonalnymi warstwami uwagi globalnej, które widzą cały kontekst. Ta mieszanka pozwala obsłużyć kontekst 256K bez przegrzewania GPU.

Diagram architektury bez enkodera pokazujący surowe audio i fragmenty obrazu rzutowane bezpośrednio do przestrzeni embeddingów Gemma 4 12B
Jak Gemma 4 12B podaje dane audio i obrazu wprost do modelu bez osobnego enkodera

Praktyczna korzyść: mniej parametrów wydanych na enkodery oznacza, że więcej budżetu VRAM trafia na właściwe rozumowanie. To ten kompromis pozwala modelowi 12B bić tak daleko powyżej swojej kategorii wagowej.

Benchmarki Gemma 4 12B: prawdziwe liczby

Główna teza się broni: Gemma 4 12B zdobywa 77,2% na MMLU Pro, pokonując 67,6% Gemmy 3 27B na tym samym teście, przy mniej niż połowie VRAM. To oficjalne liczby modelu z dostrajaniem instrukcyjnym (-it) od Google, nie szacunki społeczności. Oto pełen zestaw.

BenchmarkGemma 4 12BGemma 3 27B (odniesienie)
MMLU Pro77,2%67,6%
GPQA Diamond78,8%,
MMMU Pro69,1%,
AIME 2026 (bez narzędzi)77,5%,
LiveCodeBench v672,0%,
Codeforces ELO1659,

Model 12B pokonuje teraz zeszłorocznego flagowca 27B na MMLU Pro: 77,2% vs 67,6%. To skok generacyjny, który każe przeliczyć kalkulacje sprzętowe od nowa.

Wykres słupkowy porównujący Gemmę 4 12B z Gemmą 3 27B i Gemmą 3 12B na benchmarku MMLU Pro
Gemma 4 12B vs Gemma 3 27B vs Gemma 3 12B na MMLU Pro, mniejszy nowy model z najwyższym wynikiem

Dwa uczciwe zastrzeżenia. Po pierwsze, myślniki oznaczają, że Google nie opublikowało wyniku Gemmy 3 27B dla tych wierszy, więc komórki pozostają puste, zamiast być wypełnione zgadywaniem. Po drugie, każdy wynik tutaj dotyczy modelu z dostrajaniem instrukcyjnym. Liczby modelu bazowego są inne. Możesz zweryfikować wszystkie te dane na karcie modelu HuggingFace i na stronie modelu DeepMind.

Ile VRAM potrzebuje Gemma 4 12B?

Gemma 4 12B potrzebuje około 6,6 GB VRAM przy kwantyzacji Q4_K_M, co oznacza, że mieści się na GPU 8GB. Dla komfortowego zapasu, szczególnie jeśli chcesz wykorzystać część kontekstu 256K, celuj w 16GB VRAM lub pamięci zunifikowanej. Działa na laptopie. Maki z serii M radzą sobie z tym przez pamięć zunifikowaną bez problemu.

Kwantyzacja to po prostu kompresja wag modelu. Liczby o niższej precyzji, mniejszy plik, nieco mniejsza dokładność. Oto jak wyglądają popularne poziomy.

KwantyzacjaPrzybliżony VRAMJakośćNajlepsza dla
Q4_K_M~6,6 GBBliska pełnej, minimalna strataRozsądny domyślny wybór; mieści się na kartach 8GB
Q5_K_M~8,5 GBNieco lepsza niż Q4Trochę zapasu VRAM, chcesz więcej dokładności
Q8~13 GBPraktycznie pełna jakośćKarty 16GB+, maksymalna wierność
QAT Q4_0~6,6 GBBliska FP przy rozmiarze Q4Najlepsza jakość na GB (wydana 5 czerwca)

Poziomy wykres słupkowy zużycia VRAM Gemma 4 12B według poziomu kwantyzacji z liniami odniesienia przy 8GB i 16GB
Ślad VRAM Gemma 4 12B na poziom kwantyzacji, z liniami odniesienia GPU 8GB i 16GB

Jeśli dobierasz sprzęt pod ten model, nasze zestawienie narzędzi do lokalnych LLM-ów, które benchmarkowaliśmy obejmuje informacje, które backendy wyciskają najwięcej z danej karty. W skrócie: karta 12GB uruchamia Q4 z zapasem, karta 8GB uruchamia Q4, jeśli trzymasz kontekst w rozsądnych granicach.

Szybkość Gemma 4 12B: tokeny/s na różnym sprzęcie

Jak szybki jest? To zależy od karty, kwantyzacji i backendu, więc zamiast jednej liczby zebraliśmy opublikowane dane stron trzecich w jednym miejscu. Są to wyniki zgłaszane przez testerów społeczności i dostawców, z przypisaniem do źródła. To nie są nasze własne pomiary laboratoryjne.

SprzętKwantZgłaszane tokeny/sŹródło
RTX 3060 (6GB)Q4_K_M~6,6 GB ślad VRAM, działa lokalnie (tok/s nie podano dokładnie)runaiathome
RTX 4090 (24GB)Q4_K_MZakres czatu w czasie rzeczywistym (konkretne tok/s jeszcze nie podane)apxml / społeczność
Apple M-series (zunifikowana)mlx / Q4Działa przez gemma4:12b-mlx (tok/s jeszcze szeroko nie podane)Ollama / społeczność

Powiedem wprost, co mówią publiczne dane w tej chwili. runaiathome potwierdziło działanie modelu na 6GB RTX 3060 w jego ~6,6 GB śladzie Q4_K_M, co jest najbardziej konkretnym opublikowanym raportem sprzętowym do tej pory. Specyfikacja apxml i strona biblioteki Ollama potwierdzają, że model obsługuje lokalnie na 24GB RTX 4090 przy Q4, komfortowo w zakresie czatu w czasie rzeczywistym, ale dokładna utrzymywana wartość tok/s nie została jeszcze opublikowana dla tej karty. Wariant gemma4:12b-mlx na Apple Silicon istnieje i działa, ale wiarygodne liczby tok/s nie pojawiły się trzy dni po premierze.

Co to oznacza dla Ciebie, według poziomu: na karcie 6GB jak RTX 3060, spodziewaj się, że model się załaduje i będzie działać do lokalnego czatu, ale trzymaj okno kontekstu w rozsądnych granicach. Na 24GB RTX 4090 przy Q4_K_M, opublikowane raporty sytuują go komfortowo w zakresie czatu w czasie rzeczywistym. Na Apple Silicon build MLX działa, ale liczby benchmarkowe wciąż napływają.

To opublikowane dane stron trzecich, nie nasze własne pomiary, więc traktuj je jako orientacyjne. Twoje tok/s zależy od długości promptu, rozmiaru kontekstu i wersji backendu. Źródła: strona biblioteki Ollama, apxml i runaiathome. W miarę jak pojawią się kolejne benchmarki społeczności w ciągu najbliższych dwóch tygodni, zaktualizujemy tę tabelę.

Jak uruchomić Gemmę 4 12B lokalnie?

Najkrótsza ścieżka: zainstaluj Ollama, uruchom jedną komendę, gotowe. ollama run gemma4:12b pobiera model 7,6 GB i otwiera prompt czatu. Bez plików konfiguracyjnych, bez środowiska Python. Jeśli chcesz więcej kontroli lub jesteś na Apple Silicon, poniżej są cztery inne ścieżki.

1. Ollama (łatwy domyślny wybór). Pobierz i uruchom w dwóch liniach:

bash
ollama pull gemma4:12b
ollama run gemma4:12b

2. llama.cpp z GGUF. Jeśli chcesz konkretną kwantyzację, skieruj llama.cpp na plik GGUF na HuggingFace. GGUF to format pliku, którego llama.cpp używa dla skwantyzowanych wag:

bash
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."

3. MLX na Apple Silicon. Maki z serii M mają dedykowany build MLX, który używa frameworka Apple zamiast CUDA:

bash
ollama run gemma4:12b-mlx

4. LM Studio (GUI, bez terminala). Wolisz aplikację desktopową? Otwórz LM Studio, wejdź w zakładkę wyszukiwania i wpisz gemma 4 12b. Wybierz GGUF Q4_K_M i pobierz. LM Studio zajmie się resztą, w tym przełącznikiem serwera lokalnego.

5. Odpytuj przez API. Ollama udostępnia endpoint kompatybilny z OpenAI na porcie 11434, więc istniejący kod działa z jednolinijkową zamianą base-URL:

bash
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemma4:12b",
    "messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
  }'

Gdy już uruchomisz go w CLI, prawdopodobnie zechcesz prawdziwy interfejs. Możesz opakować go w interfejs w stylu ChatGPT z Open WebUI w około pięć minut. Jesteś nowy w tym wszystkim? Zacznij od naszego pełnego przewodnika po konfiguracji lokalnego LLM. Oficjalne zalecenia dotyczące próbkowania i ścieżki uruchamiania znajdziesz na ai.google.dev i w dokumentacji Ollama.

Którą kwantyzację wybrać dla Gemmy 4 12B?

Dla większości osób Q4_K_M to rozsądny domyślny wybór: około 6,6 GB VRAM, jakość bliska pełnej, i mieści się na GPU 8GB. Jeśli masz 16GB lub więcej i chcesz maksymalną wierność, przejdź na Q8. A jeśli chcesz najlepszą jakość na gigabajt dostępną teraz, spójrz na nowe checkpointy QAT Q4_0.

Oto aspekt świeżości, którego nikt jeszcze nie uwzględnił. 5 czerwca 2026, zaledwie dwa dni po premierze, Google wydało checkpointy Quantization-Aware-Training (QAT) Q4_0 wraz z nowym formatem mobilnym. QAT oznacza, że model był trenowany z myślą o kwantyzacji, więc utrzymuje jakość bliską FP (bliską pełnej precyzji) przy rozmiarze Q4. Te same ~6,6 GB, zauważalnie mniejsza strata dokładności niż standardowe Q4 po treningu. Jeśli masz ograniczony VRAM, ale zależy Ci na jakości, to jest Twój wybór.

Szybki przewodnik decyzyjny:

  • Karta 8GB, chcesz prostoty: Q4_K_M.
  • Karta 8GB, chcesz najlepszej jakości w tym rozmiarze: QAT Q4_0.
  • Karta 16GB+, chcesz maksymalnej wierności: Q8.
  • Pomiędzy, trochę zapasu VRAM: Q5_K_M.

Możesz przeczytać uzasadnienie Google w ich ogłoszeniu o QAT. Wniosek: Q4_K_M jest w porządku, QAT Q4_0 jest lepszy w tym samym rozmiarze, a Q8 potrzebujesz tylko jeśli dokładność jest ważniejsza niż pamięć.

Gemma 4 12B vs Gemma 3 12B vs Qwen 3.5: czy warto aktualizować?

Tak, aktualizacja z Gemmy 3 12B jest warta, jeśli zależy Ci na licencji Apache 2.0, natywnym wejściu audio, oknie kontekstu 256K lub skoku na MMLU Pro. W porównaniu z Qwen 3.5 jest bliżej. Gemma 4 12B wygrywa na liberalności licencji i natywnym audio, ale Qwen 3.5 bierze niektóre wiersze benchmarkowe klasy 12B. Wybieraj według swoich rzeczywistych potrzeb, nie nagłówków.

FunkcjaGemma 4 12BGemma 3 12BQwen 3.5 (klasa 12B)
LicencjaApache 2.0Własna licencja GemmaApache 2.0
Kontekst256K128KDo 256K
ModalnościTekst + obraz + audioTekst + obrazTekst + obraz
Natywne audioTakNieNie
MMLU Pro77,2%NiżejKonkurencyjny, wygrywa niektóre wiersze
VRAM Q4~6,6 GB~6,6 GB~6,6 GB

Sama zmiana licencji uzasadnia przejście z Gemmy 3 12B dla wielu zespołów. Gemma 3 była dystrybuowana na własnej licencji Google z ograniczeniami użycia; Gemma 4 to czysty Apache 2.0. Jeśli wstrzymywałeś się z Gemmą z powodów komercyjnych, ta blokada zniknęła.

W porównaniu z Qwen 3.5, bądź ze sobą szczery. Qwen 3.5 jest naprawdę silny i wyprzedza Gemmę 4 12B w niektórych wierszach rozumowania i kodowania. Jeśli wejście audio i liberalna licencja nie są na Twojej liście, zbenchmarkuj oba na własnym zadaniu przed podjęciem decyzji. Zobacz gdzie Gemma 4 12B plasuje się wśród najlepszych otwartych modeli dla szerszego kontekstu. A ponieważ to Apache 2.0, możesz dostrajać go na licencji Apache 2.0 z Unsloth bez problemów licencyjnych.

Kiedy NIE używać Gemmy 4 12B

Pomiń Gemmę 4 12B, jeśli potrzebujesz rozumowania na poziomie frontier, które dostarcza tylko znacznie większy model, jeśli Qwen 3.5 wygrywa konkretny wiersz benchmarkowy, od którego zależy Twoje obciążenie, lub jeśli Twój projekt mocno opiera się na narzędziach audio, które wciąż dojrzewają trzy dni po premierze. To doskonały model 12B, nie magiczny.

Gemma 4 12B nie zawsze jest właściwym wyborem. Jeśli potrzebujesz rozumowania na poziomie frontier, większy model wciąż wygrywa. Natywne wsparcie audio jest prawdziwe i imponujące, ale otaczające narzędzia, biblioteki, programy pomocnicze, integracje z frameworkami — mają kilka dni i są miejscami surowe. Jeśli wysyłasz produkt mocno oparty na audio w tym tygodniu, przetestuj gruntownie, zanim na nim postawisz.

Kilka uczciwych dyskwalifikatorów. Jeśli podłączasz go do agenta, najpierw potwierdź niezawodność wywoływania narzędzi na swoich zadaniach, bo zachowanie agentowe różni się między modelami. Jeśli Twoją przewagą jest długi kontekst, upewnij się, że wykorzystujesz w pełni okno kontekstu 256K, zamiast zakładać, że surowy rozmiar okna równa się lepszy wynik. A jeśli przechodzisz od lokalnych uruchomień do produkcyjnego serwowania, ścieżka produkcyjnego serwowania poza lokalnym obejmuje vLLM i SGLang. Jeśli wdrażasz otwarte modele jak Gemma 4 12B w produkcji, możemy pomóc.

O autorze

Mert Batur Gurbuz jest współzałożycielem Techsy.io, gdzie zespół dostarcza agentów AI, systemy automatyzacji i pipeline'y głosowe/SDR dla klientów B2B. Studiuje na University of Birmingham i pisze o stosie narzędzi LLM, którego zespół Techsy faktycznie używa w produkcji. Połącz się na LinkedIn.

Wybór narzędzia to łatwiejsza połowa. Sprawienie, by działało niezawodnie w prawdziwym produkcie — to miejsce, gdzie większość zespołów się zatrzymuje, i to dokładnie to, co nasz zespół integracji AI buduje dla klientów, od pipeline'ów RAG po niestandardowych agentów.

Często zadawane pytania

Jak uruchomić Gemmę 4 12B lokalnie?

Zainstaluj Ollama, a następnie uruchom ollama run gemma4:12b. To pobiera model 7,6 GB i otwiera prompt czatu. Nie potrzeba środowiska Python ani plików konfiguracyjnych. Jeśli wolisz aplikację graficzną, LM Studio też działa: wyszukaj gemma 4 12b w przeglądarce modeli i pobierz build Q4_K_M.

Jakie są wymagania VRAM i sprzętowe dla Gemmy 4 12B?

Gemma 4 12B potrzebuje około 6,6 GB VRAM przy kwantyzacji Q4_K_M, więc mieści się na GPU 8GB. Dla komfortowego zapasu, szczególnie przy korzystaniu z długiego kontekstu, celuj w 16GB VRAM lub pamięci zunifikowanej. Działa na laptopach, w tym Makach z serii M przez pamięć zunifikowaną.

Czy Gemma 4 12B może działać na laptopie z 16GB?

Tak, bez problemu. Przy Q4_K_M model używa około 6,6 GB, zostawiając dużo miejsca na maszynie z 16GB. Na laptopach Apple Silicon pamięć zunifikowana radzi sobie dobrze przez build gemma4:12b-mlx. Możesz nawet przejść na kwantyzację Q8 na 16GB dla wyższej wierności.

Czy Gemma 4 12B jest naprawdę lepsza niż Llama lub Qwen 3.5?

To zależy od tego, co mierzysz. Gemma 4 12B wygrywa na licencji Apache 2.0, natywnym wejściu audio i oknie kontekstu 256K, i osiąga solidne 77,2% na MMLU Pro. Ale Qwen 3.5 bierze niektóre wiersze rozumowania i kodowania klasy 12B. Zbenchmarkuj oba na własnym zadaniu przed podjęciem decyzji.

Czy Gemma 4 12B jest lepsza niż Gemma 3 12B?

Tak. Gemma 4 12B przechodzi na liberalną licencję Apache 2.0, dodaje natywne wejście audio, podwaja okno kontekstu do 256K tokenów i osiąga znaczącą poprawę na MMLU Pro. Sama zmiana licencji uzasadnia aktualizację dla projektów komercyjnych, które były zablokowane przez własne warunki Gemmy 3.

Którą kwantyzację powinienem użyć dla Gemmy 4 12B?

Q4_K_M to rozsądny domyślny wybór przy około 6,6 GB z jakością bliską pełnej. Jeśli chcesz najlepszą jakość w tym samym rozmiarze, użyj nowych checkpointów QAT Q4_0 wydanych 5 czerwca 2026, które utrzymują jakość bliską pełnej precyzji przy rozmiarze Q4. Użyj Q8 tylko jeśli masz 16GB+ i potrzebujesz maksymalnej wierności.

Czy Gemma 4 12B jest darmowa do użytku komercyjnego?

Tak. Gemma 4 12B jest dystrybuowana na licencji Apache 2.0, która zezwala na użycie komercyjne bez ograniczeń użycia własnej licencji Gemma 3. Możesz budować komercyjne produkty, dostrajać go i redystrybuować. Ta zmiana licencji to jeden z największych powodów, dla których zespoły aktualizują z Gemmy 3.

Czy Gemma 4 12B naprawdę obsługuje wejście audio?

Tak. Gemma 4 12B to pierwsza średniej wielkości Gemma z natywnym wejściem audio. Dzięki konstrukcji bez enkodera, surowe przebiegi audio są rzutowane bezpośrednio do modelu bez osobnego enkodera audio. Niemniej otaczające narzędzia mają kilka dni, więc testuj ostrożnie przed wysłaniem funkcji mocno opartych na audio do produkcji.

Jak szybka jest Gemma 4 12B na RTX 4090?

Opublikowane raporty stron trzecich sytuują Gemmę 4 12B przy Q4_K_M komfortowo w zakresie czatu w czasie rzeczywistym na 24GB RTX 4090, choć dokładna utrzymywana wartość tokenów/s nie została jeszcze opublikowana trzy dni po premierze. Szybkość zależy od długości promptu, rozmiaru kontekstu i wersji backendu, więc traktuj wczesne dane jako orientacyjne.

Skąd pobrać Gemmę 4 12B?

Model z dostrajaniem instrukcyjnym znajduje się na HuggingFace jako google/gemma-4-12B-it, albo możesz go pobrać przez Ollama komendą ollama run gemma4:12b (7,6 GB do pobrania). Użytkownicy LM Studio mogą wyszukać gemma 4 12b w przeglądarce modeli aplikacji. Dla konkretnych kwantyzacji pliki GGUF są dostępne z repozytoriów społeczności jak Unsloth.

Tagi

gemma 4 12bollamalokalne-llmkwantyzacjagemma

Udostępnij artykuł

Powiązane artykuły

Więcej w ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 już jest: inteligencja bliska Fable 5 za połowę ceny

Anthropic wydał Claude Opus 5 24 lipca 2026. Model ponad dwukrotnie przebija Opus 4.8 w Frontier-Bench i utrzymuje cenę Opus, ale przegrywa kilka testów z Fable 5 i Mythos 5. Oto tabela benchmarków, ceny i rekomendacja: przejść, poczekać czy zostać.

10 min read min
Czytaj
ai-machine-learning
Jul 20, 2026

8 najlepszych API do scrapingu AI w 2026 (przetestowane na naszym stacku agentów)

Przetestowaliśmy 8 API do scrapingu AI z realnymi cenami z 2026 roku, pobranymi przez nasz własny stack agentów. Firecrawl, Bright Data, ScrapingBee i 5 innych — ranking pod kątem wyjścia gotowego dla LLM, omijania antybotów i obsługi MCP.

9 min read min
Czytaj
ai-machine-learning
Jul 20, 2026

Inżynieria promptów dla programistów: 7 wzorców, których używamy codziennie w Claude Code i Cursor (2026)

Większość artykułów o „promptach do kodowania z AI” serwuje 50 szablonów do skopiowania. Ten uczy 7 wzorców, których używamy każdego dnia do obsługi potoku 16 agentów Claude Code, z rzeczywistymi przykładami „przed i po” oraz informacją, gdzie każdy wzorzec stosować w Claude Code, Cursor i Copilot w 2026 roku.

11 min read min
Czytaj
Zobacz wszystkie artykuły
Rozpocznij swój projekt

Gotowi, by zbudować coś co Cię wyróżnia?

Zamieńmy Twoją wizję w rzeczywistość. Nasz zespół jest gotowy, by pomóc Ci stworzyć oprogramowanie, które robi różnicę.

Umów 30-minutowe spotkanie wstępneZobacz nasze realizacje

Z naszej biblioteki

Umiejętności Claude

Zobacz wszystkie
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automatyzacje AI

Zobacz wszystkie
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Z naszej biblioteki

Umiejętności Claude

Zobacz wszystkie
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automatyzacje AI

Zobacz wszystkie
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Usługi

  • Rozwiązania Enterprise
  • Aplikacje mobilne
  • Aplikacje webowe

Rozwiązania

  • Systemy CRM
  • Integracja AI
  • Rozwiązania ERP
  • Agenci głosowi
  • Automatyzacja procesów
  • Cyberbezpieczeństwo

Biblioteka

  • Blog
  • Portfel realizacji

Społeczność

  • Automatyzacje AI
  • Umiejętności Claude

Narzędzia

  • Kalkulator kosztów aplikacji mobilnej
  • Kalkulator kosztów API OpenAI / LLM
  • Kalkulator kosztów MVP
  • Kalkulator kosztów agenta Voice AI

Firma

  • O nas
  • Partnerzy
  • Kontakt

Prawne

  • Polityka prywatności
  • Regulamin
  • Polityka cookies

Usługi

  • Rozwiązania Enterprise
  • Aplikacje mobilne
  • Aplikacje webowe

Rozwiązania

  • Systemy CRM
  • Integracja AI
  • Rozwiązania ERP
  • Agenci głosowi
  • Automatyzacja procesów
  • Cyberbezpieczeństwo

Biblioteka

  • Blog
  • Portfel realizacji

Społeczność

  • Automatyzacje AI
  • Umiejętności Claude

Narzędzia

  • Kalkulator kosztów aplikacji mobilnej
  • Kalkulator kosztów API OpenAI / LLM
  • Kalkulator kosztów MVP
  • Kalkulator kosztów agenta Voice AI

Firma

  • O nas
  • Partnerzy
  • Kontakt
PrawnePolityka prywatnościRegulaminPolityka cookies
TECHSY
© 2026 Techsy. Wszystkie prawa zastrzeżone.