
Gemma 4 12B: Benchmarkit, VRAM-vaatimukset ja paikallinen ajaminen
Google DeepMind julkaisi Gemma 4 12B:n 3. kesäkuuta 2026. Kolme päivää myöhemmin luku, jota kaikki toistavat, on MMLU Pro -tulos: 77,2 %. Se voittaa viime vuoden Gemma 3 27B:n, joka pääsi samassa testissä 67,6 %:iin. 12 miljardin parametrin malli päihittää 27B-lippulaivan? Alle puolella muistista? Kyllä. Ja lisenssikin muuttui. Gemma 4 julkaistaan Apache 2.0 -lisenssillä, joten kaupallinen käyttö on sallittua ilman asteriskeja. Mallissa on 256K tokenin konteksti-ikkuna ja se pyörii noin 6,6 gigatavun VRAM-muistissa kvantisoituna. Juuri tuo viimeinen osa on koko juttu useimmille meistä: tämä mahtuu keskiluokan GPU:lle.
Keskeiset havainnot
- Gemma 4 12B (julkaistu 3.6.2026) saavuttaa 77,2 % MMLU Prossa, voittaen viime vuoden Gemma 3 27B:n (67,6 %).
- Se pyörii ~6,6 GB VRAM-muistissa Q4_K_M-kvantisoinnilla ja mahtuu 8GB GPU:lle; ~16GB antaa mukavasti liikkumavaraa.
- Apache 2.0 -lisenssi (kaupallinen käyttö OK), 256K konteksti, natiivi ääni- ja kuvasyöte, enkooderiton arkkitehtuuri.
- Yksi komento ajamiseen:
ollama run gemma4:12b(7,6 GB lataus).
Mikä on Gemma 4 12B?
Gemma 4 12B on 12 miljardin parametrin avoimella painomallilla varustettu malli Google DeepMindilta, julkaistu 3. kesäkuuta 2026 Apache 2.0 -lisenssillä. Se on enkooderiton, yhtenäinen multimodaalinen malli: teksti, kuva ja natiivi ääni menevät sisään, teksti tulee ulos. Mallissa on 256K tokenin konteksti-ikkuna ja se tukee 140 kieltä.
Instruktio-viritetty versio, jota käytännössä ajat, on nimeltään gemma-4-12B-it ("it" tulee sanasta instruction-tuned, eli valmis chat-versio). Siinä on yhteensä 11,95 miljardia parametria, joten "12B" on hieman ylöspäin pyöristetty. Harjoitusdata ulottuu tammikuuhun 2025.
Tässä tulee mielenkiintoinen osa: Gemma 4 12B on ensimmäinen keskikokoinen Gemma, jossa on natiivi äänisyöte. Erillistä äänienkooderia ei ole pultattu kylkeen. Raaka aaltomuoto projisoidaan suoraan malliin. Sama koskee kuvia. Juuri tämä suunnitteluratkaisu pitää mallin tarpeeksi pienenä pyörimään yhdellä kuluttajakortilla, ja palaamme siihen hetken kuluttua miksi.
Haluatko ensin isomman kuvan? Oppaamme avoimien mallien ajamisesta omalla koneella kattaa perusasiat, jos paikalliset LLM:t ovat uusia. Googlen virallinen julkistuspostaus sisältää täyden tiedotteen.
Gemma 4 12B:n tekniset tiedot yhdellä silmäyksellä
Kaikki vahvistettu, yhdessä taulukossa. Ei arvailua.
| Tieto | Arvo |
|---|---|
| Koko nimi | Gemma 4 12B (gemma-4-12B-it) |
| Parametrit | 11,95B (~12B) |
| Lisenssi | Apache 2.0 (kaupallinen käyttö OK) |
| Konteksti-ikkuna | 256K tokenia |
| Modaalit | Teksti + kuva + natiivi ääni sisään, teksti ulos |
| Arkkitehtuuri | Enkooderiton yhtenäinen, 48 kerrosta, hybridi huomio |
| Kielet | 140 |
| Harjoitusdatan raja | Tammikuu 2025 |
| Ollama-tagi | gemma4:12b (7,6 GB lataus) |
| Apple Silicon -tagi | gemma4:12b-mlx |
| Suositeltu näytteenotto | temperature 1.0, top_p 0.95, top_k 64 |
Yksi huomio näytteenotosta: pysy suositelluissa arvoissa temperature=1.0, top_p=0.95, top_k=64 ellei sinulla ole syytä muuhun. Gemma-mallit käyttäytyvät oudosti matalilla lämpötiloilla, joten älä reflexinomaisesti pudota sitä 0,2:een kuten muiden mallien kanssa saattaisit tehdä.
Miten enkooderiton arkkitehtuuri toimii?
Enkooderiton tarkoittaa, että erillistä mallia ei ole muuntamassa kuvia tai ääntä ennen kuin ne saavuttavat kielimallin. Näkökenttäpalaset ja raaka ääniaaltomuoto projisoidaan suoraan jaettuun upotusavaruuteen ohuiden lineaarikerrosten kautta. Useimmat multimodaaliset mallit pultaavat raskaan näköenkooderin LLM:n kylkeen. Gemma 4 12B ohittaa sen, minkä vuoksi se mahtuu 16 gigatavuun.
Ajattele sitä kääntäjän ja kaksikielisen ihmisen erona. Vanha lähestymistapa palkkaa erillisen kääntäjän (enkooderin) muuntamaan kuvat kielelle, jonka malli ymmärtää, ja luovuttaa sen sitten eteenpäin. Gemma 4 12B on kaksikielinen syntymästään asti. Ääni- ja kuvadata puhuvat mallin omaa kieltä suoraan, kevyen projektiokerroksen kautta raskaan enkooderin sijaan.
Pinnan alla on 48 kerrosta hybridihuomiolla. Useimmat kerrokset käyttävät 1024 tokenin liukuikkunaa (halpa, lokaali), ja niiden lomassa on satunnaisia globaalin huomion kerroksia, jotka näkevät koko kontekstin. Tuo yhdistelmä mahdollistaa 256K kontekstin käsittelyn sulattamatta GPU:tasi.

Käytännön hyöty: vähemmän parametreja enkoodereihin tarkoittaa, että suurempi osa VRAM-budjetistasi menee varsinaiseen päättelyyn. Se on se vaihtokauppa, joka mahdollistaa 12B-mallin lyövän näin paljon painoluokkaansa ylöspäin.
Gemma 4 12B:n benchmarkit: Todelliset luvut
Otsikko pitää paikkansa: Gemma 4 12B saavuttaa 77,2 % MMLU Prossa, voittaen Gemma 3 27B:n 67,6 % samassa testissä, alle puolella VRAM-muistista. Nämä ovat Googlen viralliset instruktio-viritetyn (-it) mallin luvut, eivät yhteisön arvioita. Tässä koko setti.
| Benchmark | Gemma 4 12B | Gemma 3 27B (vertailu) |
|---|---|---|
| MMLU Pro | 77,2 % | 67,6 % |
| GPQA Diamond | 78,8 % | , |
| MMMU Pro | 69,1 % | , |
| AIME 2026 (ilman työkaluja) | 77,5 % | , |
| LiveCodeBench v6 | 72,0 % | , |
| Codeforces ELO | 1659 | , |
12B-malli voittaa nyt viime vuoden 27B-lippulaivan MMLU Prossa: 77,2 % vs 67,6 %. Se on sellainen sukupolviharppaus, joka saa tarkistamaan laskelmasi uudelleen.

Kaksi rehellistä varausta. Ensinnäkin viivat tarkoittavat, ettei Google julkaissut Gemma 3 27B -lukua noille riveille, joten solut pysyvät tyhjinä arvausten sijaan. Toiseksi jokainen tulos tässä on instruktio-viritetyltä mallilta. Perusmallin luvut eroavat. Voit ristitarkistaa kaikki nämä HuggingFace-mallikortista ja DeepMindin mallisivulta.
Kuinka paljon VRAM-muistia Gemma 4 12B tarvitsee?
Gemma 4 12B tarvitsee noin 6,6 GB VRAM-muistia Q4_K_M-kvantisoinnilla, mikä tarkoittaa, että se mahtuu 8GB GPU:lle. Mukavaan liikkumavaraan, erityisesti jos haluat käyttää osaa 256K kontekstista, tähtää 16 gigatavuun VRAM- tai yhtenäismuistia. Se pyörii läppärillä. M-sarjan Macit hoitavat sen yhtenäismuistin kautta mainiosti.
Kvantisointi on vain mallipainojen pakkausta. Pienemmän tarkkuuden lukuja, pienempi tiedosto, hieman vähemmän tarkkuutta. Tässä yleisimmät tasot.
| Kvantisointi | Noin VRAM | Laatu | Sopii parhaiten |
|---|---|---|---|
| Q4_K_M | ~6,6 GB | Lähes täysi, minimaalinen häviö | Järkevä oletus; mahtuu 8GB korteille |
| Q5_K_M | ~8,5 GB | Hieman parempi kuin Q4 | Vähän ylimääräistä VRAMia, haluaa enemmän tarkkuutta |
| Q8 | ~13 GB | Käytännössä täysi laatu | 16GB+ kortit, maksimitarkkuus |
| QAT Q4_0 | ~6,6 GB | Lähes FP Q4-jalanjäljellä | Paras laatu per GB (julkaistu 5.6.) |

Jos valitset laitteistoa tämän mallin ympärille, kokoelmamme benchmarkkaamistamme paikallisista LLM-työkaluista kattaa mitkä backendit puristavat eniten irti tietystä kortista. Lyhyt versio: 12GB kortti ajaa Q4:ää yllin kyllin, 8GB kortti ajaa Q4:ää jos pidät kontekstin maltillisena.
Gemma 4 12B:n nopeus: Tokenit/sek eri laitteistoilla
Kuinka nopea se on? Se riippuu kortistasi, kvantisoinnistasi ja backendistasi, joten yhden luvun sijaan kokosimme julkaistut kolmannen osapuolen luvut yhteen paikkaan. Nämä ovat yhteisön testaajien ja valmistajien raportoimia, lähteineen mainittuina. Ne eivät ole omia laboratoriolukujamme.
| Laitteisto | Kvantisointi | Raportoidut tokenit/sek | Lähde |
|---|---|---|---|
| RTX 3060 (6GB) | Q4_K_M | ~6,6 GB VRAM-jalanjälki, pyörii paikallisesti (tok/s ei tarkasti raportoitu) | runaiathome |
| RTX 4090 (24GB) | Q4_K_M | Reaaliaikaisen chatin luokkaa (tarkkaa tok/s ei vielä raportoitu) | apxml / yhteisö |
| Apple M-sarja (yhtenäismuisti) | mlx / Q4 | Pyörii gemma4:12b-mlx:llä (tok/s ei vielä laajasti raportoitu) | Ollama / yhteisö |
Kerron suoraan, mitä julkinen data oikeasti sanoo tällä hetkellä. runaiathome vahvisti mallin pyörivän 6GB RTX 3060:llä sen ~6,6 GB Q4_K_M -jalanjäljessä, mikä on konkreettisin julkaistu laitteistoraportti tähän mennessä. apxml:n tekninen taulukko ja Ollaman kirjastosivu vahvistavat mallin palvelevan paikallisesti 24GB RTX 4090:llä Q4:llä, mukavasti reaaliaikaisen chatin alueella, mutta tarkkaa ylläpidettyä tok/s-lukua ei ole vielä julkaistu tuolle kortille. Apple Siliconin gemma4:12b-mlx-versio on olemassa ja pyörii, mutta luotettavia tok/s-lukuja ei ole ilmestynyt kolme päivää julkaisun jälkeen.
Mitä tämä tarkoittaa sinulle, tasoittain: 6GB kortilla kuten RTX 3060, odota sen latautuvan ja pyörivän paikalliseen chattiin, pidä vain konteksti-ikkuna maltillisena. 24GB RTX 4090:llä Q4_K_M:llä julkaistut raportit sijoittavat sen mukavasti reaaliaikaisen chatin alueelle. Apple Siliconilla MLX-versio pyörii, mutta benchmark-luvut valuvat vielä sisään.
Nämä ovat julkaistuja kolmannen osapuolen lukuja, eivät omia laboratoriolukujamme, joten käsittele niitä suuntaa-antavina. Sinun tok/s riippuu promptin pituudesta, kontekstin koosta ja backendin versiosta. Lähteet: Ollaman kirjastosivu, apxml ja runaiathome. Kun lisää yhteisön benchmarkkeja saapuu seuraavan kahden viikon aikana, päivitämme tätä taulukkoa.
Miten ajat Gemma 4 12B:tä paikallisesti?
Lyhin reitti: asenna Ollama, aja yksi komento, valmis. ollama run gemma4:12b lataa 7,6 GB mallin ja pudottaa sinut chat-kehotteeseen. Ei asetustiedostoja, ei Python-ympäristöä. Jos haluat enemmän kontrollia tai olet Apple Siliconilla, alla on neljä muuta reittiä.
1. Ollama (helppo oletus). Lataa ja aja kahdella rivillä:
ollama pull gemma4:12b
ollama run gemma4:12b2. llama.cpp GGUF:lla. Jos haluat tietyn kvantisoinnin, osoita llama.cpp HuggingFacessa olevaan GGUF-tiedostoon. GGUF on tiedostomuoto, jota llama.cpp käyttää kvantisoiduille painoille:
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."3. MLX Apple Siliconilla. M-sarjan Macit saavat oman MLX-version, joka käyttää Applen frameworkia CUDAn sijaan:
ollama run gemma4:12b-mlx4. LM Studio (GUI, ei terminaalia). Suositko työpöytäsovellusta? Avaa LM Studio, mene hakuvälilehteen ja kirjoita gemma 4 12b. Valitse Q4_K_M GGUF ja lataa. LM Studio hoitaa loput, mukaan lukien paikallisen palvelimen kytkimen.
5. Kysele API:n yli. Ollama tarjoaa OpenAI-yhteensopivan endpointin portissa 11434, joten olemassa oleva koodi toimii yhden rivin base-URL-vaihdolla:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:12b",
"messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
}'Kun olet saanut sen pyörimään komentorivillä, haluat todennäköisesti oikean käyttöliittymän. Voit kietoa sen ChatGPT-tyyliseen käyttöliittymään Open WebUI:lla noin viidessä minuutissa. Uusi kaikelle tälle? Aloita täydellisestä paikallisen LLM-asetusoppaastamme. Viralliset näytteenottosuositukset ja ajoreitit löydät osoitteesta ai.google.dev ja Ollaman dokumentaatiosta.
Mitä kvantisointia kannattaa käyttää Gemma 4 12B:lle?
Useimmille Q4_K_M on järkevä oletus: noin 6,6 GB VRAMia, lähes täysi laatu ja mahtuu 8GB GPU:lle. Jos sinulla on 16GB tai enemmän ja haluat maksimitarkkuuden, siirry Q8:aan. Ja jos haluat parhaan laadun per gigatavu tällä hetkellä, katso uusia QAT Q4_0 -tarkistuspisteitä.
Tässä tuoreuskulma, jota kukaan ei ole vielä huomioinut. 5. kesäkuuta 2026, vain kaksi päivää julkaisun jälkeen, Google julkaisi Quantization-Aware-Training (QAT) Q4_0 -tarkistuspisteet uuden mobiiliformaatin rinnalla. QAT tarkoittaa, että malli on harjoitettu kvantisointi mielessä, joten se säilyttää lähes täyden tarkkuuden (near-FP) Q4-jalanjäljellä. Sama ~6,6 GB, huomattavasti vähemmän tarkkuushäviötä kuin tavallisessa jälkikäteisessä Q4:ssä. Jos VRAM on rajallinen mutta laatu merkitsee, se on sinun valintasi.
Pikainen päätösopas:
- 8GB kortti, haluat yksinkertaista: Q4_K_M.
- 8GB kortti, haluat parhaan laadun tuossa koossa: QAT Q4_0.
- 16GB+ kortti, haluat maksimitarkkuuden: Q8.
- Siltä väliltä, vähän ylimääräistä VRAMia: Q5_K_M.
Voit lukea Googlen perustelut heidän QAT-tiedotteestaan. Yhteenveto: Q4_K_M on hyvä, QAT Q4_0 on parempi samassa koossa, ja Q8:aa tarvitset vain jos tarkkuus merkitsee enemmän kuin muisti.
Gemma 4 12B vs Gemma 3 12B vs Qwen 3.5: Kannattaako päivitys?
Kyllä, päivitys Gemma 3 12B:stä kannattaa, jos välität Apache 2.0 -lisenssistä, natiivista äänisyötteestä, 256K konteksti-ikkunasta tai MMLU Pro -harppauksesta. Qwen 3.5:tä vastaan tilanne on tasaisempi. Gemma 4 12B voittaa lisenssin sallivuudessa ja natiivissa äänessä, mutta Qwen 3.5 vie joitain 12B-luokan benchmark-rivejä. Valitse todellisten tarpeidesi perusteella, älä otsikon.
| Ominaisuus | Gemma 4 12B | Gemma 3 12B | Qwen 3.5 (12B-luokka) |
|---|---|---|---|
| Lisenssi | Apache 2.0 | Räätälöity Gemma-lisenssi | Apache 2.0 |
| Konteksti | 256K | 128K | Jopa 256K |
| Modaalit | Teksti + kuva + ääni | Teksti + kuva | Teksti + kuva |
| Natiivi ääni | Kyllä | Ei | Ei |
| MMLU Pro | 77,2 % | Matalampi | Kilpailukykyinen, voittaa joitain rivejä |
| Q4 VRAM | ~6,6 GB | ~6,6 GB | ~6,6 GB |
Pelkkä lisenssimuutos oikeuttaa siirtymisen pois Gemma 3 12B:stä monelle tiimille. Gemma 3 julkaistiin Googlen räätälöidyllä lisenssillä, jossa oli käyttörajoituksia; Gemma 4 on suoraan Apache 2.0. Jos olet pidättäytynyt Gemmasta kaupallisista syistä, tuo este on poissa.
Qwen 3.5:tä vastaan ole rehellinen itsellesi. Qwen 3.5 on aidosti vahva ja ohittaa Gemma 4 12B:n tietyissä päättely- ja koodausriveissä. Jos äänisyöte ja salliva lisenssi eivät ole listallasi, benchmarkkaa molemmat omalla tehtävälläsi ennen sitoutumista. Katso mihin Gemma 4 12B sijoittuu parhaiden avointen mallien joukossa laajemman kentän osalta. Ja koska se on Apache 2.0, voit hienosäätää sitä Apache 2.0 -lisenssillä Unslothilla ilman lisenssiongelmia.
Milloin Gemma 4 12B:tä EI kannata käyttää
Ohita Gemma 4 12B, jos tarvitset frontier-tason päättelyä, jonka vain paljon suurempi malli tarjoaa, jos Qwen 3.5 voittaa sen tietyn benchmark-rivin, johon työkuormasi nojaa, tai jos projektisi nojaa vahvasti äänityökaluihin, jotka ovat vielä kypsymässä kolme päivää julkaisun jälkeen. Se on erinomainen 12B-malli, ei taikatemppu.
Gemma 4 12B ei ole aina oikea valinta. Jos tarvitset frontier-tason päättelyä, suurempi malli voittaa edelleen. Natiivi äänituki on todellinen ja vaikuttava, mutta ympäröivät työkalut, kirjastot, apuohjelmat ja framework-integraatiot ovat päivien ikäisiä ja paikoin karkeita. Jos julkaiset äänipainotteista tuotetta tällä viikolla, testaa perusteellisesti ennen kuin lyöt vetoa sen puolesta.
Muutama rehellinen hylkäysperuste lisää. Jos olet kytkemässä sitä agenttiin, varmista työkalukutsujen luotettavuus omilla tehtävilläsi ensin, koska agenttinen käyttäytyminen vaihtelee malleittain. Jos etusi on pitkä konteksti, varmista että hyödynnät 256K konteksti-ikkunaa täysimääräisesti sen sijaan, että olettaisit raakan ikkunakoon tarkoittavan parempaa tulosta. Ja jos olet siirtymässä paikallisesta ajamisesta tuotannon tarjoiluun, tuotantotason tarjoilureitti paikallisen jälkeen kattaa vLLM:n ja SGLangin. Jos otat käyttöön avoimia malleja kuten Gemma 4 12B:tä tuotannossa, voimme auttaa.
Kirjoittajasta
Mert Batur Gurbuz on Techsy.io:n perustajaosakas, jossa tiimi toimittaa tekoälyagentteja, automaatiojärjestelmiä ja ääni-/SDR-putkia B2B-asiakkaille. Hän opiskelee Birminghamin yliopistossa ja kirjoittaa LLM-työkalupinosta, jota Techsyn tiimi oikeasti käyttää tuotannossa. Yhdistä LinkedInissä.
Työkalun valitseminen on helppo puolisko. Sen saaminen pyörimään luotettavasti oikean tuotteen sisällä on missä useimmat tiimit jumittuvat, ja juuri sitä meidän tekoälyintegraatiotiimimme rakentaa asiakkaille, RAG-putkista räätälöityihin agentteihin.
Usein kysytyt kysymykset
Miten ajan Gemma 4 12B:tä paikallisesti?
Asenna Ollama ja aja sitten ollama run gemma4:12b. Se lataa 7,6 GB mallin ja avaa chat-kehotteen. Python-ympäristöä tai asetustiedostoja ei tarvita. Jos haluat graafisen sovelluksen, LM Studio toimii myös: hae gemma 4 12b sen malliselaimessa ja lataa Q4_K_M-versio.
Mitkä ovat Gemma 4 12B:n VRAM- ja laitteistovaatimukset?
Gemma 4 12B tarvitsee noin 6,6 GB VRAM-muistia Q4_K_M-kvantisoinnilla, joten se mahtuu 8GB GPU:lle. Mukavaan liikkumavaraan, erityisesti pitkää kontekstia käytettäessä, tähtää 16 gigatavuun VRAM- tai yhtenäismuistia. Se pyörii läppäreillä, mukaan lukien M-sarjan Macit yhtenäismuistin kautta.
Voiko Gemma 4 12B pyöriä 16GB läppärillä?
Kyllä, helposti. Q4_K_M:llä malli käyttää noin 6,6 GB, jättäen runsaasti tilaa 16GB koneella. Apple Silicon -läppäreillä yhtenäismuisti hoitaa sen mainiosti gemma4:12b-mlx-version kautta. Voit jopa siirtyä Q8-kvantisointiin 16 gigatavulla korkeampaa tarkkuutta varten.
Onko Gemma 4 12B oikeasti parempi kuin Llama tai Qwen 3.5?
Riippuu mitä mittaat. Gemma 4 12B voittaa Apache 2.0 -lisenssillä, natiivilla äänisyötteellä ja 256K konteksti-ikkunalla, ja se saavuttaa vahvat 77,2 % MMLU Prossa. Mutta Qwen 3.5 vie joitain 12B-luokan päättely- ja koodausrivejä. Benchmarkkaa molemmat omalla tehtävälläsi ennen päätöstä.
Onko Gemma 4 12B parempi kuin Gemma 3 12B?
Kyllä. Gemma 4 12B siirtyy sallivaan Apache 2.0 -lisenssiin, lisää natiivin äänisyötteen, kaksinkertaistaa konteksti-ikkunan 256K tokeniin ja saavuttaa merkittävän MMLU Pro -parannuksen. Pelkkä lisenssimuutos oikeuttaa päivityksen kaupallisille projekteille, joita Gemma 3:n räätälöidyt ehdot estivät.
Mitä kvantisointia kannattaa käyttää Gemma 4 12B:lle?
Q4_K_M on järkevä oletus noin 6,6 gigatavulla ja lähes täydellä laadulla. Jos haluat parhaan laadun samassa koossa, käytä uusia QAT Q4_0 -tarkistuspisteitä, jotka julkaistiin 5. kesäkuuta 2026 ja säilyttävät lähes täyden tarkkuuden Q4-jalanjäljellä. Käytä Q8:aa vain jos sinulla on 16GB+ ja tarvitset maksimitarkkuuden.
Onko Gemma 4 12B ilmainen kaupalliseen käyttöön?
Kyllä. Gemma 4 12B julkaistaan Apache 2.0 -lisenssillä, joka sallii kaupallisen käytön ilman Gemma 3:n räätälöidyn lisenssin käyttörajoituksia. Voit rakentaa kaupallisia tuotteita, hienosäätää sitä ja jakaa sitä uudelleen. Tuo lisenssimuutos on yksi suurimmista syistä, miksi tiimit päivittävät Gemma 3:sta.
Tukeeko Gemma 4 12B todella äänisyötettä?
Kyllä. Gemma 4 12B on ensimmäinen keskikokoinen Gemma, jossa on natiivi äänisyöte. Enkooderittoman suunnittelun ansiosta raaka ääniaaltomuoto projisoidaan suoraan malliin ilman erillistä äänienkooderia. Siitä huolimatta ympäröivät työkalut ovat päivien ikäisiä, joten testaa huolellisesti ennen äänipainotteisten ominaisuuksien julkaisua tuotannossa.
Kuinka nopea Gemma 4 12B on RTX 4090:llä?
Julkaistut kolmannen osapuolen raportit sijoittavat Gemma 4 12B:n Q4_K_M:llä mukavasti reaaliaikaisen chatin alueelle 24GB RTX 4090:llä, vaikka tarkkaa ylläpidettyä tokenit/sek-lukua ei ole vielä julkaistu kolme päivää julkaisun jälkeen. Nopeus vaihtelee promptin pituuden, kontekstin koon ja backendin version mukaan, joten käsittele varhaisia lukuja suuntaa-antavina.
Mistä lataan Gemma 4 12B:n?
Instruktio-viritetty malli löytyy HuggingFacesta nimellä google/gemma-4-12B-it, tai voit ladata sen Ollaman kautta komennolla ollama run gemma4:12b (7,6 GB lataus). LM Studion käyttäjät voivat hakea gemma 4 12b sovelluksen malliselaimessa. Tiettyjä kvantisointeja varten GGUF-tiedostoja on saatavilla yhteisön repoista kuten Unslothista.