Techsy
Otetttaa yhteyte
Aloita
Takaisin blogiin
ai-machine-learning

Gemma 4 12B: Benchmarkit, VRAM-vaatimukset ja paikallinen ajaminen

Kirjoittanut Mert Batur Gürbüz
Päivitetty Jun 6, 2026
11 lukuaika
Sisällys
Gemma 4 12B: Benchmarkit, VRAM-vaatimukset ja paikallinen ajaminen

Gemma 4 12B: Benchmarkit, VRAM-vaatimukset ja paikallinen ajaminen

Google DeepMind julkaisi Gemma 4 12B:n 3. kesäkuuta 2026. Kolme päivää myöhemmin luku, jota kaikki toistavat, on MMLU Pro -tulos: 77,2 %. Se voittaa viime vuoden Gemma 3 27B:n, joka pääsi samassa testissä 67,6 %:iin. 12 miljardin parametrin malli päihittää 27B-lippulaivan? Alle puolella muistista? Kyllä. Ja lisenssikin muuttui. Gemma 4 julkaistaan Apache 2.0 -lisenssillä, joten kaupallinen käyttö on sallittua ilman asteriskeja. Mallissa on 256K tokenin konteksti-ikkuna ja se pyörii noin 6,6 gigatavun VRAM-muistissa kvantisoituna. Juuri tuo viimeinen osa on koko juttu useimmille meistä: tämä mahtuu keskiluokan GPU:lle.

Keskeiset havainnot

  • Gemma 4 12B (julkaistu 3.6.2026) saavuttaa 77,2 % MMLU Prossa, voittaen viime vuoden Gemma 3 27B:n (67,6 %).
  • Se pyörii ~6,6 GB VRAM-muistissa Q4_K_M-kvantisoinnilla ja mahtuu 8GB GPU:lle; ~16GB antaa mukavasti liikkumavaraa.
  • Apache 2.0 -lisenssi (kaupallinen käyttö OK), 256K konteksti, natiivi ääni- ja kuvasyöte, enkooderiton arkkitehtuuri.
  • Yksi komento ajamiseen: ollama run gemma4:12b (7,6 GB lataus).

Mikä on Gemma 4 12B?

Gemma 4 12B on 12 miljardin parametrin avoimella painomallilla varustettu malli Google DeepMindilta, julkaistu 3. kesäkuuta 2026 Apache 2.0 -lisenssillä. Se on enkooderiton, yhtenäinen multimodaalinen malli: teksti, kuva ja natiivi ääni menevät sisään, teksti tulee ulos. Mallissa on 256K tokenin konteksti-ikkuna ja se tukee 140 kieltä.

Instruktio-viritetty versio, jota käytännössä ajat, on nimeltään gemma-4-12B-it ("it" tulee sanasta instruction-tuned, eli valmis chat-versio). Siinä on yhteensä 11,95 miljardia parametria, joten "12B" on hieman ylöspäin pyöristetty. Harjoitusdata ulottuu tammikuuhun 2025.

Tässä tulee mielenkiintoinen osa: Gemma 4 12B on ensimmäinen keskikokoinen Gemma, jossa on natiivi äänisyöte. Erillistä äänienkooderia ei ole pultattu kylkeen. Raaka aaltomuoto projisoidaan suoraan malliin. Sama koskee kuvia. Juuri tämä suunnitteluratkaisu pitää mallin tarpeeksi pienenä pyörimään yhdellä kuluttajakortilla, ja palaamme siihen hetken kuluttua miksi.

Haluatko ensin isomman kuvan? Oppaamme avoimien mallien ajamisesta omalla koneella kattaa perusasiat, jos paikalliset LLM:t ovat uusia. Googlen virallinen julkistuspostaus sisältää täyden tiedotteen.

Gemma 4 12B:n tekniset tiedot yhdellä silmäyksellä

Kaikki vahvistettu, yhdessä taulukossa. Ei arvailua.

TietoArvo
Koko nimiGemma 4 12B (gemma-4-12B-it)
Parametrit11,95B (~12B)
LisenssiApache 2.0 (kaupallinen käyttö OK)
Konteksti-ikkuna256K tokenia
ModaalitTeksti + kuva + natiivi ääni sisään, teksti ulos
ArkkitehtuuriEnkooderiton yhtenäinen, 48 kerrosta, hybridi huomio
Kielet140
Harjoitusdatan rajaTammikuu 2025
Ollama-tagigemma4:12b (7,6 GB lataus)
Apple Silicon -tagigemma4:12b-mlx
Suositeltu näytteenottotemperature 1.0, top_p 0.95, top_k 64

Yksi huomio näytteenotosta: pysy suositelluissa arvoissa temperature=1.0, top_p=0.95, top_k=64 ellei sinulla ole syytä muuhun. Gemma-mallit käyttäytyvät oudosti matalilla lämpötiloilla, joten älä reflexinomaisesti pudota sitä 0,2:een kuten muiden mallien kanssa saattaisit tehdä.

Miten enkooderiton arkkitehtuuri toimii?

Enkooderiton tarkoittaa, että erillistä mallia ei ole muuntamassa kuvia tai ääntä ennen kuin ne saavuttavat kielimallin. Näkökenttäpalaset ja raaka ääniaaltomuoto projisoidaan suoraan jaettuun upotusavaruuteen ohuiden lineaarikerrosten kautta. Useimmat multimodaaliset mallit pultaavat raskaan näköenkooderin LLM:n kylkeen. Gemma 4 12B ohittaa sen, minkä vuoksi se mahtuu 16 gigatavuun.

Ajattele sitä kääntäjän ja kaksikielisen ihmisen erona. Vanha lähestymistapa palkkaa erillisen kääntäjän (enkooderin) muuntamaan kuvat kielelle, jonka malli ymmärtää, ja luovuttaa sen sitten eteenpäin. Gemma 4 12B on kaksikielinen syntymästään asti. Ääni- ja kuvadata puhuvat mallin omaa kieltä suoraan, kevyen projektiokerroksen kautta raskaan enkooderin sijaan.

Pinnan alla on 48 kerrosta hybridihuomiolla. Useimmat kerrokset käyttävät 1024 tokenin liukuikkunaa (halpa, lokaali), ja niiden lomassa on satunnaisia globaalin huomion kerroksia, jotka näkevät koko kontekstin. Tuo yhdistelmä mahdollistaa 256K kontekstin käsittelyn sulattamatta GPU:tasi.

Enkooderittoman arkkitehtuurin kaavio, jossa raaka ääni ja kuvapalaset projisoidaan suoraan Gemma 4 12B:n upotusavaruuteen
Miten Gemma 4 12B syöttää ääni- ja kuvadatan suoraan malliin ilman erillistä enkooderia

Käytännön hyöty: vähemmän parametreja enkoodereihin tarkoittaa, että suurempi osa VRAM-budjetistasi menee varsinaiseen päättelyyn. Se on se vaihtokauppa, joka mahdollistaa 12B-mallin lyövän näin paljon painoluokkaansa ylöspäin.

Gemma 4 12B:n benchmarkit: Todelliset luvut

Otsikko pitää paikkansa: Gemma 4 12B saavuttaa 77,2 % MMLU Prossa, voittaen Gemma 3 27B:n 67,6 % samassa testissä, alle puolella VRAM-muistista. Nämä ovat Googlen viralliset instruktio-viritetyn (-it) mallin luvut, eivät yhteisön arvioita. Tässä koko setti.

BenchmarkGemma 4 12BGemma 3 27B (vertailu)
MMLU Pro77,2 %67,6 %
GPQA Diamond78,8 %,
MMMU Pro69,1 %,
AIME 2026 (ilman työkaluja)77,5 %,
LiveCodeBench v672,0 %,
Codeforces ELO1659,

12B-malli voittaa nyt viime vuoden 27B-lippulaivan MMLU Prossa: 77,2 % vs 67,6 %. Se on sellainen sukupolviharppaus, joka saa tarkistamaan laskelmasi uudelleen.

Pylväsdiagrammi, jossa verrataan Gemma 4 12B:tä Gemma 3 27B:hen ja Gemma 3 12B:hen MMLU Pro -benchmarkissa
Gemma 4 12B vs Gemma 3 27B vs Gemma 3 12B MMLU Prossa, pienempi uusi malli saa korkeimman tuloksen

Kaksi rehellistä varausta. Ensinnäkin viivat tarkoittavat, ettei Google julkaissut Gemma 3 27B -lukua noille riveille, joten solut pysyvät tyhjinä arvausten sijaan. Toiseksi jokainen tulos tässä on instruktio-viritetyltä mallilta. Perusmallin luvut eroavat. Voit ristitarkistaa kaikki nämä HuggingFace-mallikortista ja DeepMindin mallisivulta.

Kuinka paljon VRAM-muistia Gemma 4 12B tarvitsee?

Gemma 4 12B tarvitsee noin 6,6 GB VRAM-muistia Q4_K_M-kvantisoinnilla, mikä tarkoittaa, että se mahtuu 8GB GPU:lle. Mukavaan liikkumavaraan, erityisesti jos haluat käyttää osaa 256K kontekstista, tähtää 16 gigatavuun VRAM- tai yhtenäismuistia. Se pyörii läppärillä. M-sarjan Macit hoitavat sen yhtenäismuistin kautta mainiosti.

Kvantisointi on vain mallipainojen pakkausta. Pienemmän tarkkuuden lukuja, pienempi tiedosto, hieman vähemmän tarkkuutta. Tässä yleisimmät tasot.

KvantisointiNoin VRAMLaatuSopii parhaiten
Q4_K_M~6,6 GBLähes täysi, minimaalinen häviöJärkevä oletus; mahtuu 8GB korteille
Q5_K_M~8,5 GBHieman parempi kuin Q4Vähän ylimääräistä VRAMia, haluaa enemmän tarkkuutta
Q8~13 GBKäytännössä täysi laatu16GB+ kortit, maksimitarkkuus
QAT Q4_0~6,6 GBLähes FP Q4-jalanjäljelläParas laatu per GB (julkaistu 5.6.)

Vaakasuuntainen pylväsdiagrammi Gemma 4 12B:n VRAM-käytöstä kvantisointitasoittain vertailuviivoilla 8GB ja 16GB kohdalla
Gemma 4 12B:n VRAM-jalanjälki kvantisointitasoittain, 8GB ja 16GB GPU-vertailuviivoilla

Jos valitset laitteistoa tämän mallin ympärille, kokoelmamme benchmarkkaamistamme paikallisista LLM-työkaluista kattaa mitkä backendit puristavat eniten irti tietystä kortista. Lyhyt versio: 12GB kortti ajaa Q4:ää yllin kyllin, 8GB kortti ajaa Q4:ää jos pidät kontekstin maltillisena.

Gemma 4 12B:n nopeus: Tokenit/sek eri laitteistoilla

Kuinka nopea se on? Se riippuu kortistasi, kvantisoinnistasi ja backendistasi, joten yhden luvun sijaan kokosimme julkaistut kolmannen osapuolen luvut yhteen paikkaan. Nämä ovat yhteisön testaajien ja valmistajien raportoimia, lähteineen mainittuina. Ne eivät ole omia laboratoriolukujamme.

LaitteistoKvantisointiRaportoidut tokenit/sekLähde
RTX 3060 (6GB)Q4_K_M~6,6 GB VRAM-jalanjälki, pyörii paikallisesti (tok/s ei tarkasti raportoitu)runaiathome
RTX 4090 (24GB)Q4_K_MReaaliaikaisen chatin luokkaa (tarkkaa tok/s ei vielä raportoitu)apxml / yhteisö
Apple M-sarja (yhtenäismuisti)mlx / Q4Pyörii gemma4:12b-mlx:llä (tok/s ei vielä laajasti raportoitu)Ollama / yhteisö

Kerron suoraan, mitä julkinen data oikeasti sanoo tällä hetkellä. runaiathome vahvisti mallin pyörivän 6GB RTX 3060:llä sen ~6,6 GB Q4_K_M -jalanjäljessä, mikä on konkreettisin julkaistu laitteistoraportti tähän mennessä. apxml:n tekninen taulukko ja Ollaman kirjastosivu vahvistavat mallin palvelevan paikallisesti 24GB RTX 4090:llä Q4:llä, mukavasti reaaliaikaisen chatin alueella, mutta tarkkaa ylläpidettyä tok/s-lukua ei ole vielä julkaistu tuolle kortille. Apple Siliconin gemma4:12b-mlx-versio on olemassa ja pyörii, mutta luotettavia tok/s-lukuja ei ole ilmestynyt kolme päivää julkaisun jälkeen.

Mitä tämä tarkoittaa sinulle, tasoittain: 6GB kortilla kuten RTX 3060, odota sen latautuvan ja pyörivän paikalliseen chattiin, pidä vain konteksti-ikkuna maltillisena. 24GB RTX 4090:llä Q4_K_M:llä julkaistut raportit sijoittavat sen mukavasti reaaliaikaisen chatin alueelle. Apple Siliconilla MLX-versio pyörii, mutta benchmark-luvut valuvat vielä sisään.

Nämä ovat julkaistuja kolmannen osapuolen lukuja, eivät omia laboratoriolukujamme, joten käsittele niitä suuntaa-antavina. Sinun tok/s riippuu promptin pituudesta, kontekstin koosta ja backendin versiosta. Lähteet: Ollaman kirjastosivu, apxml ja runaiathome. Kun lisää yhteisön benchmarkkeja saapuu seuraavan kahden viikon aikana, päivitämme tätä taulukkoa.

Miten ajat Gemma 4 12B:tä paikallisesti?

Lyhin reitti: asenna Ollama, aja yksi komento, valmis. ollama run gemma4:12b lataa 7,6 GB mallin ja pudottaa sinut chat-kehotteeseen. Ei asetustiedostoja, ei Python-ympäristöä. Jos haluat enemmän kontrollia tai olet Apple Siliconilla, alla on neljä muuta reittiä.

1. Ollama (helppo oletus). Lataa ja aja kahdella rivillä:

bash
ollama pull gemma4:12b
ollama run gemma4:12b

2. llama.cpp GGUF:lla. Jos haluat tietyn kvantisoinnin, osoita llama.cpp HuggingFacessa olevaan GGUF-tiedostoon. GGUF on tiedostomuoto, jota llama.cpp käyttää kvantisoiduille painoille:

bash
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."

3. MLX Apple Siliconilla. M-sarjan Macit saavat oman MLX-version, joka käyttää Applen frameworkia CUDAn sijaan:

bash
ollama run gemma4:12b-mlx

4. LM Studio (GUI, ei terminaalia). Suositko työpöytäsovellusta? Avaa LM Studio, mene hakuvälilehteen ja kirjoita gemma 4 12b. Valitse Q4_K_M GGUF ja lataa. LM Studio hoitaa loput, mukaan lukien paikallisen palvelimen kytkimen.

5. Kysele API:n yli. Ollama tarjoaa OpenAI-yhteensopivan endpointin portissa 11434, joten olemassa oleva koodi toimii yhden rivin base-URL-vaihdolla:

bash
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemma4:12b",
    "messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
  }'

Kun olet saanut sen pyörimään komentorivillä, haluat todennäköisesti oikean käyttöliittymän. Voit kietoa sen ChatGPT-tyyliseen käyttöliittymään Open WebUI:lla noin viidessä minuutissa. Uusi kaikelle tälle? Aloita täydellisestä paikallisen LLM-asetusoppaastamme. Viralliset näytteenottosuositukset ja ajoreitit löydät osoitteesta ai.google.dev ja Ollaman dokumentaatiosta.

Mitä kvantisointia kannattaa käyttää Gemma 4 12B:lle?

Useimmille Q4_K_M on järkevä oletus: noin 6,6 GB VRAMia, lähes täysi laatu ja mahtuu 8GB GPU:lle. Jos sinulla on 16GB tai enemmän ja haluat maksimitarkkuuden, siirry Q8:aan. Ja jos haluat parhaan laadun per gigatavu tällä hetkellä, katso uusia QAT Q4_0 -tarkistuspisteitä.

Tässä tuoreuskulma, jota kukaan ei ole vielä huomioinut. 5. kesäkuuta 2026, vain kaksi päivää julkaisun jälkeen, Google julkaisi Quantization-Aware-Training (QAT) Q4_0 -tarkistuspisteet uuden mobiiliformaatin rinnalla. QAT tarkoittaa, että malli on harjoitettu kvantisointi mielessä, joten se säilyttää lähes täyden tarkkuuden (near-FP) Q4-jalanjäljellä. Sama ~6,6 GB, huomattavasti vähemmän tarkkuushäviötä kuin tavallisessa jälkikäteisessä Q4:ssä. Jos VRAM on rajallinen mutta laatu merkitsee, se on sinun valintasi.

Pikainen päätösopas:

  • 8GB kortti, haluat yksinkertaista: Q4_K_M.
  • 8GB kortti, haluat parhaan laadun tuossa koossa: QAT Q4_0.
  • 16GB+ kortti, haluat maksimitarkkuuden: Q8.
  • Siltä väliltä, vähän ylimääräistä VRAMia: Q5_K_M.

Voit lukea Googlen perustelut heidän QAT-tiedotteestaan. Yhteenveto: Q4_K_M on hyvä, QAT Q4_0 on parempi samassa koossa, ja Q8:aa tarvitset vain jos tarkkuus merkitsee enemmän kuin muisti.

Gemma 4 12B vs Gemma 3 12B vs Qwen 3.5: Kannattaako päivitys?

Kyllä, päivitys Gemma 3 12B:stä kannattaa, jos välität Apache 2.0 -lisenssistä, natiivista äänisyötteestä, 256K konteksti-ikkunasta tai MMLU Pro -harppauksesta. Qwen 3.5:tä vastaan tilanne on tasaisempi. Gemma 4 12B voittaa lisenssin sallivuudessa ja natiivissa äänessä, mutta Qwen 3.5 vie joitain 12B-luokan benchmark-rivejä. Valitse todellisten tarpeidesi perusteella, älä otsikon.

OminaisuusGemma 4 12BGemma 3 12BQwen 3.5 (12B-luokka)
LisenssiApache 2.0Räätälöity Gemma-lisenssiApache 2.0
Konteksti256K128KJopa 256K
ModaalitTeksti + kuva + ääniTeksti + kuvaTeksti + kuva
Natiivi ääniKylläEiEi
MMLU Pro77,2 %MatalampiKilpailukykyinen, voittaa joitain rivejä
Q4 VRAM~6,6 GB~6,6 GB~6,6 GB

Pelkkä lisenssimuutos oikeuttaa siirtymisen pois Gemma 3 12B:stä monelle tiimille. Gemma 3 julkaistiin Googlen räätälöidyllä lisenssillä, jossa oli käyttörajoituksia; Gemma 4 on suoraan Apache 2.0. Jos olet pidättäytynyt Gemmasta kaupallisista syistä, tuo este on poissa.

Qwen 3.5:tä vastaan ole rehellinen itsellesi. Qwen 3.5 on aidosti vahva ja ohittaa Gemma 4 12B:n tietyissä päättely- ja koodausriveissä. Jos äänisyöte ja salliva lisenssi eivät ole listallasi, benchmarkkaa molemmat omalla tehtävälläsi ennen sitoutumista. Katso mihin Gemma 4 12B sijoittuu parhaiden avointen mallien joukossa laajemman kentän osalta. Ja koska se on Apache 2.0, voit hienosäätää sitä Apache 2.0 -lisenssillä Unslothilla ilman lisenssiongelmia.

Milloin Gemma 4 12B:tä EI kannata käyttää

Ohita Gemma 4 12B, jos tarvitset frontier-tason päättelyä, jonka vain paljon suurempi malli tarjoaa, jos Qwen 3.5 voittaa sen tietyn benchmark-rivin, johon työkuormasi nojaa, tai jos projektisi nojaa vahvasti äänityökaluihin, jotka ovat vielä kypsymässä kolme päivää julkaisun jälkeen. Se on erinomainen 12B-malli, ei taikatemppu.

Gemma 4 12B ei ole aina oikea valinta. Jos tarvitset frontier-tason päättelyä, suurempi malli voittaa edelleen. Natiivi äänituki on todellinen ja vaikuttava, mutta ympäröivät työkalut, kirjastot, apuohjelmat ja framework-integraatiot ovat päivien ikäisiä ja paikoin karkeita. Jos julkaiset äänipainotteista tuotetta tällä viikolla, testaa perusteellisesti ennen kuin lyöt vetoa sen puolesta.

Muutama rehellinen hylkäysperuste lisää. Jos olet kytkemässä sitä agenttiin, varmista työkalukutsujen luotettavuus omilla tehtävilläsi ensin, koska agenttinen käyttäytyminen vaihtelee malleittain. Jos etusi on pitkä konteksti, varmista että hyödynnät 256K konteksti-ikkunaa täysimääräisesti sen sijaan, että olettaisit raakan ikkunakoon tarkoittavan parempaa tulosta. Ja jos olet siirtymässä paikallisesta ajamisesta tuotannon tarjoiluun, tuotantotason tarjoilureitti paikallisen jälkeen kattaa vLLM:n ja SGLangin. Jos otat käyttöön avoimia malleja kuten Gemma 4 12B:tä tuotannossa, voimme auttaa.

Kirjoittajasta

Mert Batur Gurbuz on Techsy.io:n perustajaosakas, jossa tiimi toimittaa tekoälyagentteja, automaatiojärjestelmiä ja ääni-/SDR-putkia B2B-asiakkaille. Hän opiskelee Birminghamin yliopistossa ja kirjoittaa LLM-työkalupinosta, jota Techsyn tiimi oikeasti käyttää tuotannossa. Yhdistä LinkedInissä.

Työkalun valitseminen on helppo puolisko. Sen saaminen pyörimään luotettavasti oikean tuotteen sisällä on missä useimmat tiimit jumittuvat, ja juuri sitä meidän tekoälyintegraatiotiimimme rakentaa asiakkaille, RAG-putkista räätälöityihin agentteihin.

Usein kysytyt kysymykset

Miten ajan Gemma 4 12B:tä paikallisesti?

Asenna Ollama ja aja sitten ollama run gemma4:12b. Se lataa 7,6 GB mallin ja avaa chat-kehotteen. Python-ympäristöä tai asetustiedostoja ei tarvita. Jos haluat graafisen sovelluksen, LM Studio toimii myös: hae gemma 4 12b sen malliselaimessa ja lataa Q4_K_M-versio.

Mitkä ovat Gemma 4 12B:n VRAM- ja laitteistovaatimukset?

Gemma 4 12B tarvitsee noin 6,6 GB VRAM-muistia Q4_K_M-kvantisoinnilla, joten se mahtuu 8GB GPU:lle. Mukavaan liikkumavaraan, erityisesti pitkää kontekstia käytettäessä, tähtää 16 gigatavuun VRAM- tai yhtenäismuistia. Se pyörii läppäreillä, mukaan lukien M-sarjan Macit yhtenäismuistin kautta.

Voiko Gemma 4 12B pyöriä 16GB läppärillä?

Kyllä, helposti. Q4_K_M:llä malli käyttää noin 6,6 GB, jättäen runsaasti tilaa 16GB koneella. Apple Silicon -läppäreillä yhtenäismuisti hoitaa sen mainiosti gemma4:12b-mlx-version kautta. Voit jopa siirtyä Q8-kvantisointiin 16 gigatavulla korkeampaa tarkkuutta varten.

Onko Gemma 4 12B oikeasti parempi kuin Llama tai Qwen 3.5?

Riippuu mitä mittaat. Gemma 4 12B voittaa Apache 2.0 -lisenssillä, natiivilla äänisyötteellä ja 256K konteksti-ikkunalla, ja se saavuttaa vahvat 77,2 % MMLU Prossa. Mutta Qwen 3.5 vie joitain 12B-luokan päättely- ja koodausrivejä. Benchmarkkaa molemmat omalla tehtävälläsi ennen päätöstä.

Onko Gemma 4 12B parempi kuin Gemma 3 12B?

Kyllä. Gemma 4 12B siirtyy sallivaan Apache 2.0 -lisenssiin, lisää natiivin äänisyötteen, kaksinkertaistaa konteksti-ikkunan 256K tokeniin ja saavuttaa merkittävän MMLU Pro -parannuksen. Pelkkä lisenssimuutos oikeuttaa päivityksen kaupallisille projekteille, joita Gemma 3:n räätälöidyt ehdot estivät.

Mitä kvantisointia kannattaa käyttää Gemma 4 12B:lle?

Q4_K_M on järkevä oletus noin 6,6 gigatavulla ja lähes täydellä laadulla. Jos haluat parhaan laadun samassa koossa, käytä uusia QAT Q4_0 -tarkistuspisteitä, jotka julkaistiin 5. kesäkuuta 2026 ja säilyttävät lähes täyden tarkkuuden Q4-jalanjäljellä. Käytä Q8:aa vain jos sinulla on 16GB+ ja tarvitset maksimitarkkuuden.

Onko Gemma 4 12B ilmainen kaupalliseen käyttöön?

Kyllä. Gemma 4 12B julkaistaan Apache 2.0 -lisenssillä, joka sallii kaupallisen käytön ilman Gemma 3:n räätälöidyn lisenssin käyttörajoituksia. Voit rakentaa kaupallisia tuotteita, hienosäätää sitä ja jakaa sitä uudelleen. Tuo lisenssimuutos on yksi suurimmista syistä, miksi tiimit päivittävät Gemma 3:sta.

Tukeeko Gemma 4 12B todella äänisyötettä?

Kyllä. Gemma 4 12B on ensimmäinen keskikokoinen Gemma, jossa on natiivi äänisyöte. Enkooderittoman suunnittelun ansiosta raaka ääniaaltomuoto projisoidaan suoraan malliin ilman erillistä äänienkooderia. Siitä huolimatta ympäröivät työkalut ovat päivien ikäisiä, joten testaa huolellisesti ennen äänipainotteisten ominaisuuksien julkaisua tuotannossa.

Kuinka nopea Gemma 4 12B on RTX 4090:llä?

Julkaistut kolmannen osapuolen raportit sijoittavat Gemma 4 12B:n Q4_K_M:llä mukavasti reaaliaikaisen chatin alueelle 24GB RTX 4090:llä, vaikka tarkkaa ylläpidettyä tokenit/sek-lukua ei ole vielä julkaistu kolme päivää julkaisun jälkeen. Nopeus vaihtelee promptin pituuden, kontekstin koon ja backendin version mukaan, joten käsittele varhaisia lukuja suuntaa-antavina.

Mistä lataan Gemma 4 12B:n?

Instruktio-viritetty malli löytyy HuggingFacesta nimellä google/gemma-4-12B-it, tai voit ladata sen Ollaman kautta komennolla ollama run gemma4:12b (7,6 GB lataus). LM Studion käyttäjät voivat hakea gemma 4 12b sovelluksen malliselaimessa. Tiettyjä kvantisointeja varten GGUF-tiedostoja on saatavilla yhteisön repoista kuten Unslothista.

Aihepiirit

gemma 4 12bollamapaikallinen-llmkvantisointigemma

Jaa tämä artikkeli

Aiheeseen liittyvät julkaisut

Lisää aiheesta ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 on täällä: Lähes Fable 5:n älykkyys puoleen hintaan

Anthropic julkaisi Claude Opus 5:n 24. heinäkuuta 2026. Se yli kaksinkertaistaa Opus 4.8:n tuloksen Frontier-Benchissä ja pitää Opus-hinnoittelun, mutta häviää muutamia testejä Fable 5:lle ja Mythos 5:lle. Tässä benchmark-taulukko, hinnoittelu ja vaihda/odota/pysy-suositus.

10 min read lukuaika
Lue
ai-machine-learning
Jul 20, 2026

8 parasta tekoälypohjaista web scraping -APIa vuonna 2026 (testattu omalla agenttipinollamme)

Testasimme 8 tekoälypohjaista web scraping -APIa todellisilla vuoden 2026 hinnoilla, jotka haimme oman agenttipinomme kautta. Firecrawl, Bright Data, ScrapingBee ja 5 muuta – sijoitettuna LLM-valmiin tulosteen, bottitorjunnan ja MCP-tuen mukaan.

9 min read lukuaika
Lue
ai-machine-learning
Jul 20, 2026

Kehitystyön prompt-suunnittelu: 7 mallia, joita käytämme päivittäin Claude Codessa ja Cursorissa (2026)

Useimmat 'tekoälyn koodausprompteja' käsittelevät artikkelit tarjoavat 50 valmista mallia kopioitavaksi. Tämä opettaa 7 mallia, joita käytämme joka päivä 16 agentin Claude Code -putkiston ajamiseen, mukana todelliset ennen-jälkeen-esimerkit kustakin sekä tieto siitä, missä kukin malli sijaitsee Claude Codessa, Cursorissa ja Copilotissa vuonna 2026.

11 min read lukuaika
Lue
Katso kaikki julkaisut
Aloita projekti

Valmiina rakentamaan jotain erinomainen?

Muutetaan visiosi todellisuudeksi. Tiimimme on valmis auttamaan sinua luomaan ohjelmistoja, joilla on todellinen vaikutus.

Varaa lyhyt suunnittelukeskusteluKatso töitämme

Suosittuja kirjastosta

Claude-taidot

Katso kaikki
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Tekoäly automatisoinnit

Katso kaikki
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Suosittuja kirjastosta

Claude-taidot

Katso kaikki
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Tekoäly automatisoinnit

Katso kaikki
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Palvelut

  • Yritysratkaisut
  • Mobiilisovellukset
  • Verkkosovellukset

Ratkaisut

  • CRM-järjestelmät
  • Tekoälyintegraatio
  • ERP-ratkaisut
  • Ääniapurarit
  • Prosessien automatisointi
  • Kyberturvallisuus

Kirjasto

  • Blogi
  • Portfolio

Yhteisö

  • Tekoäly automatisoinnit
  • Claude-taidot

Työkalut

  • Mobile sovelluksen hintalaskuri
  • OpenAI / LLM API -hintalaskuri
  • MVP-hintalaskuri
  • Puhe-tekoälyasiamies-hintalaskuri

Yritys

  • Tietoja
  • Kumppanit
  • Ota yhteyttä

Juridiset asiat

  • Tietosuopolitiiikka
  • Käyttöehdot
  • Evästekäytäntö

Palvelut

  • Yritysratkaisut
  • Mobiilisovellukset
  • Verkkosovellukset

Ratkaisut

  • CRM-järjestelmät
  • Tekoälyintegraatio
  • ERP-ratkaisut
  • Ääniapurarit
  • Prosessien automatisointi
  • Kyberturvallisuus

Kirjasto

  • Blogi
  • Portfolio

Yhteisö

  • Tekoäly automatisoinnit
  • Claude-taidot

Työkalut

  • Mobile sovelluksen hintalaskuri
  • OpenAI / LLM API -hintalaskuri
  • MVP-hintalaskuri
  • Puhe-tekoälyasiamies-hintalaskuri

Yritys

  • Tietoja
  • Kumppanit
  • Ota yhteyttä
Juridiset asiatTietosuopolitiiikkaKäyttöehdotEvästekäytäntö
TECHSY
© 2026 Techsy. Kaikki oikeudet pidätetään.