
Paras avoimen lähdekoodin LLM 2026: Testasimme 8 — vain 3 päihitti GPT-4-luokan
Viimeksi päivitetty: 5. heinäkuuta 2026. Jokainen tämän oppaan vertailutestitulos, VRAM-luku ja lisenssi on tarkistettu uudelleen tätä päivitystä varten. Alla oleva järjestys heijastaa avoimen painon malleja, jotka on julkaistu vuoden 2026 puoliväliin mennessä — jos uusi julkaisu muuttaa järjestystä, tämä sivu päivittyy kuukauden sisällä.
Vuoden 2026 paras avoimen lähdekoodin LLM on Qwen 3 235B-A22B yleisessä päättelyssä ja koodauksessa, DeepSeek R1:n johtaessa syvässä matemaattisessa päättelyssä ja Llama 4 Scoutin pitkässä kontekstissa (10 milj. tokenia). Yhdelle kuluttajanäytönohjaimelle Gemma 3 27B (16 GB VRAM) ja Phi-4 14B (8 GB) ovat helpoimmat itse ylläpitää. Kaikki kolme huippumallia vastaavat GPT-4-luokan suorituskykyä koodissa ja matematiikassa pysyen silti vapaasti käyttöönotettavina.
Johtavat avoimen lähdekoodin LLM:t: vertailutestien yhteenveto
Alla oleva taulukko kattaa viisi laajalti käytettyä avoimen lähdekoodin mallia, jotka on pisteytetty vakiintuneilla julkisilla vertailutesteillä. MMLU mittaa laajaa yleissivistystä; HumanEval mittaa koodingeneroinnin läpäisyastetta.
| Malli | Parametrit | Julkaisu | MMLU | HumanEval | Lisenssi | Paras käyttö |
|---|---|---|---|---|---|---|
| Llama 3.3 70B | 70B | joulu 2024 | 86.0 | 88.4 | Llama 3.3 Community | Yleiskäyttö, monikielisyys |
| Qwen 2.5 72B | 72B | syys 2024 | 85.0+ | 86.6 | Qwen License | Matematiikka, koodaus, ohjeiden noudattaminen |
| DeepSeek-V3 | 671B (37B aktiivinen) | joulu 2024 | 87.1 | 82.6 | MIT | Yleiskäyttö, koodaus, kustannustehokas |
| Mistral Small 3.1 | 24B | maalis 2025 | 80.6 | 88.4 | Apache 2.0 | Agenttiset työnkulut, näkö, monikielisyys |
| Gemma 3 27B | 27B | maalis 2025 | ~78.6 | 87.8 | Gemma Terms of Use | Yhden näytönohjaimen käyttö, multimodaalinen |
Päivitämme tätä taulukkoa kuukausittain.
Avoimen lähdekoodin LLM:t eivät enää vain "kilpaile" suljettujen mallien kanssa — koodauksessa, matematiikassa ja pitkän kontekstin tehtävissä ne ovat voitolla. Kuilu 200 dollarin kuukausittaisen API-laskun ja itse ylläpidetyn avoimen mallin välillä ei ole koskaan ollut pienempi.
Tämä järjestys leikkaa hypen läpi. Jokainen tässä oleva malli arvioidaan merkityksellisten vertailutestien, todellisesti tarvitsemasi laitteiston ja sen erityisen käyttökohteen mukaan, jossa kukin loistaa kirkkaimmin.
Pikayhteenveto: minkä avoimen lähdekoodin LLM:n valitset?
Tarvitsetko ehdottomasti parhaan päättelyn? Valitse Qwen 3 235B tai DeepSeek R1. Haluatko ajaa jotain yhdellä näytönohjaimella? Gemma 3 27B tai Phi-4 14B. Käsitteletkö valtavia asiakirjoja? Llama 4 Scoutin 10 miljoonan tokenin konteksti on vertaansa vailla.
| Sija | Malli | Parametrit (aktiiviset) | Paras käyttö | Lisenssi | Vähimmäis-VRAM |
|---|---|---|---|---|---|
| nro 1 | Qwen 3 235B-A22B | 235B (22B) | Päättely + koodaus | Apache 2.0 | ~132 GB (Q4) |
| nro 2 | DeepSeek R1 | 671B (37B) | Syvä päättely + matematiikka | MIT | ~136 GB (Q4) |
| nro 3 | Llama 4 Scout | 109B (17B) | Pitkä konteksti (10 milj. tokenia) | Llama License | ~55 GB (Q4) |
| nro 4 | DeepSeek V3 | 671B (37B) | Yleiskäyttö + koodaus | MIT | ~136 GB (Q4) |
| nro 5 | Mistral Large 3 | 675B (41B) | Monikielisyys + yrityskäyttö | Apache 2.0 | ~140 GB (Q4) |
| nro 6 | Gemma 3 27B | 27B (27B, tiheä) | Yhden näytönohjaimen käyttö | Avoimet painot | ~16 GB (Q4) |
| nro 7 | Phi-4 Reasoning | 14B (14B, tiheä) | Edge + mobiililaitteet | MIT | ~8 GB (Q4) |
| nro 8 | GLM-4.7 | 355B (32B) | Agenttiset koodaustyönkulut | MIT | ~130 GB (Q4) |
VRAM-luvut olettavat Q4-kvantisointia. Täyden tarkkuuden vaatimukset ovat 2–4-kertaiset. Jos olet uusi mallien paikallisessa ajamisessa, aloita Gemma 3:lla tai Phi-4:llä -- ne ovat tämän listan laitteistoystävällisimmät vaihtoehdot.
Avoimen lähdekoodin LLM-johtotaulukko: heinäkuun 2026 järjestys
Heinäkuussa 2026 Qwen 3 235B-A22B johtaa avoimen lähdekoodin LLM-johtotaulukkoamme yleisessä päättelyssä ja koodauksessa, DeepSeek R1:n ollessa toinen syvässä matematiikassa ja Llama 4 Scoutin kolmas pitkässä kontekstissa. Alla oleva täysi järjestys kattaa kaikki tässä oppaassa arvioidut kahdeksan mallia datakeskuslaitteistoista kannettavaystävällisiin valintoihin.
| Sija | Malli | Lisenssi | Paras käyttö | Vähimmäis-VRAM |
|---|---|---|---|---|
| nro 1 | Qwen 3 235B-A22B | Apache 2.0 | Päättely + koodaus | ~132 GB (Q4) |
| nro 2 | DeepSeek R1 | MIT | Syvä päättely + matematiikka | ~136 GB (Q4) |
| nro 3 | Llama 4 Scout | Llama License | Pitkä konteksti (10 milj. tokenia) | ~55 GB (Q4) |
| nro 4 | DeepSeek V3 | MIT | Yleiskäyttö + koodaus | ~136 GB (Q4) |
| nro 5 | Mistral Large 3 | Apache 2.0 | Monikielisyys + yrityskäyttö | ~140 GB (Q4) |
| nro 6 | Gemma 3 27B | Avoimet painot | Yhden näytönohjaimen käyttö | ~16 GB (Q4) |
| nro 7 | Phi-4 Reasoning | MIT | Edge + mobiililaitteet | ~8 GB (Q4) |
| nro 8 | GLM-4.7 | MIT | Agenttiset koodaustyönkulut | ~130 GB (Q4) |
Nämä sijoitukset heijastavat kuukausittaista vertailutestien, laitteistotarpeiden ja lisenssiehtojen uudelleentarkistustamme.
Nyt käydään läpi, mikä tekee jokaisesta mallista huomiosi arvoisen.
1. Qwen 3 235B-A22B, paras avoimen lähdekoodin LLM yleisesti
Alibaban Qwen 3 235B-A22B on tällä hetkellä voitettava malli. Se on Mixture-of-Experts-arkkitehtuuri, jossa on yhteensä 235 miljardia parametria, mutta vain 22 miljardia aktivoituu per token, mikä leikkaa laskentaa noin 90 % vastaavanlaiseen tiheään malliin verrattuna.
Qwen 3:n erottaa muista sen kaksoistila-ajattelu. Voit vaihtaa "ajattelutilan" (monimutkaisiin matematiikka- ja koodausongelmiin, jolloin malli näyttää ajatusketjunsa) ja nopean "ei-ajattelutilan" (nopeisiin keskusteluvastauksiin) välillä. Tämä joustavuus merkitsee tuotannossa.
Vertailutestien kohokohdat:
| Vertailutesti | Qwen 3 235B -tulos | Konteksti |
|---|---|---|
| AIME 2024 | 85.7% | Kilpailutason matematiikka |
| AIME 2025 | 81.5% | Vaikeammat matematiikkaongelmat |
| LiveCodeBench v5 | 70.7% | Todelliset koodaustehtävät |
| CodeForces | 2,056 | Kilpailuohjelmointi |
| BFCL v3 | 70.8% | Funktiokutsut |
Nämä luvut asettavat sen samaan luokkaan DeepSeek R1:n, OpenAI:n o1:n ja Gemini 2.5 Pron kanssa — paitsi että voit ladata sen, hienosäätää sitä ja ottaa sen käyttöön missä haluat Apache 2.0 -lisenssillä.
Laitteistovaatimukset: Täysi malli tarvitsee noin 132 GB VRAM:ia Q4-kvantisoinnilla. Se on usean näytönohjaimen kokoonpano, ajattele viittä RTX 3090:tä, kolmea A40:tä tai kaksois-H100-laitteistoa. Ei halpa, mutta täysin saavutettavissa startupille tai tutkimuslaboratoriolle. Qwen 3 -perheeseen kuuluu myös pienempiä muunnelmia (32B, 14B, 8B, 4B), jotka toimivat kuluttajalaitteistolla.
Kenelle: Tiimit, jotka tarvitsevat huipputason päättelyä ja koodausta mutta haluavat omistaa infrastruktuurinsa. Se on erityisen vahva monikielisissä työkuormissa 256K-kontekstilla ja tuella yli 100 kielelle. Jos suunnittelet mallin hienosäätöä omaan toimialaasi, Qwen 3:n Apache 2.0 -lisenssi antaa täyden vapauden.
2. DeepSeek R1 -- paras syvään päättelyyn
DeepSeek R1 muutti pelin, kun se ilmestyi vuoden 2025 alussa, todistaen, että avoimen lähdekoodin mallit voivat vastata OpenAI:n o1:tä päättelytehtävissä. R1-0528-päivitys vei asiat vielä pidemmälle — AIME 2025 -tarkkuus hyppäsi 70 %:sta 87,5 %:iin.
Mallin salaisuus on sen harjoitusmenetelmä. DeepSeek loi ensin R1-Zeron käyttäen puhdasta vahvistusoppimista ilman ohjatun hienosäädön lämmittelyä. Malli kehitti spontaanisti ajatusketjupäättelyn, itsevarmistuksen ja peruutuskäyttäytymisen. Se kirjaimellisesti opetti itsensä tarkistamaan oman työnsä.
Vertailutestien kohokohdat:
| Vertailutesti | DeepSeek R1 -tulos | Konteksti |
|---|---|---|
| AIME 2025 | 87.5% (R1-0528) | Matematiikkaolympialaiset |
| GPQA Diamond | 71.5% | Jatko-opintotason tiede |
| SWE-bench | 49.2% | Todellinen ohjelmistokehitys |
| HumanEval | 92.4% | Koodin generointi |
Laitteistovaatimukset: Sama 671B MoE -arkkitehtuuri kuin DeepSeek V3:lla, joten tarvitset noin 136 GB VRAM:ia Q4:llä. Mutta tässä on käytännön puoli: DeepSeek julkaisi myös tislattuja muunnelmia 1.5B, 7B, 14B, 32B ja 70B parametreilla. 32B-tisle toimii yhdellä RTX 4090:llä ja silti päihittää monet suuremmat mallit päättelytehtävissä.
Kenelle: Kuka tahansa, joka rakentaa sovelluksia, jotka vaativat vaiheittaista päättelyä, teoreemien todistamista, monimutkaista koodin virheenkorjausta, tieteellistä analyysiä. Tislatut muunnelmat ovat erityisen hyödyllisiä, jos tarvitset päättelykykyä edullisesti. Tutustu parhaisiin työkaluihin LLM:ien paikallisessa ajamisessa, jos haluat ottaa pienemmät tisle käyttöön omalla laitteistollasi.
3. Llama 4 Scout, paras pitkään kontekstiin
Metan Llama 4 Scout toi avoimen lähdekoodin maailmaan jotain aidosti uutta: 10 miljoonan tokenin konteksti-ikkunan. Se ei ole kirjoitusvirhe. Voit syöttää sille kokonaisen koodikannan, hyllyllisen tutkimuspapereita tai 20 tuntia videotranskriptiota yhdellä kehotteella.
Scout käyttää 16 MoE-asiantuntijaa, joista vain 2 on aktiivisia per token, antaen sille 109B kokonaisparametria mutta vain 17B aktiivista. Meta väittää sen mahtuvan yhdelle H100:lle INT4-kvantisoinnilla, vaikka 10 miljoonan tokenin konteksti-ikkuna ilmeisesti vaatii enemmän muistia KV-välimuistille.
Vertailutestien kohokohdat:
| Vertailutesti | Llama 4 Scout -tulos | Konteksti |
|---|---|---|
| Needle-in-a-Haystack (10M) | 100% | Täydellinen haku |
| MMLU | 79.6% | Yleissivistys |
| HumanEval | 81.2% | Koodin generointi |
| DocVQA | 85.1% | Asiakirjojen ymmärtäminen |
Tuo täydellinen Needle-in-a-Haystack-tulos 10 miljoonalla tokenilla on merkittävä. Useimmat mallit alkavat menettää informaatiota jo paljon ennen 128K:ta. Scout käyttää uudenlaista asiakirjojen välistä huomiomaskausmenetelmää, joka ylläpitää rajoja asiakirjojen välillä jopa sen valtavassa konteksti-ikkunassa.
Laitteistovaatimukset: Q4:llä mallin painot tarvitsevat noin 55 GB VRAM:ia. Yksi H100 (80 GB) hoitaa sen mukavasti. Kuluttajalaitteistolla kaksi RTX 4090:tä (48 GB yhteensä) pystyy hallitsemaan lyhyempiä kontekstipituuksia. Ongelma: täyden 10 miljoonan tokenin konteksti-ikkunan todellinen käyttö vaatii valtavasti KV-välimuistia mallin painojen päälle. Käytännössä useimmat itse ylläpidetyt käyttöönotot rajoittuvat 128K–256K tokeniin.
Kenelle: Tiimit, jotka työskentelevät valtavien asiakirjojen, juridiikan analyysin, koodivaraston kysymys-vastauksen, tutkimuspapereiden synteesin parissa. Multimodaaliset kyvyt (teksti + kuvasyöte) ovat myös vahvat. Ole vain realistinen kontekstipituuden suhteen: 10 miljoonan katto on todellinen, mutta tarvitset palvelinluokan laitteistoa sen saavuttamiseen.
4. DeepSeek V3 -- paras yleiskäyttöinen avoimen lähdekoodin LLM
Kun DeepSeek R1 saa otsikot päättelystä, DeepSeek V3 on kiistatta käytännöllisempi malli arkipäiväiseen käyttöön. Se on työjuhta, nopea, kyvykäs laidasta laitaan ja huomattavan tehokas kokoisekseen.
V3 jakaa saman 671B MoE / 37B aktiivinen -arkkitehtuurin kuin R1, mutta vaihtaa syvät päättelyketjut nopeampiin vasteaikoihin ja laajempiin yleisiin kykyihin. V3-0324-päivitys sisällytti vahvistusoppimistekniikoita R1:n harjoituksesta, tehostaen päättelyä ilman eksplisiittisen ajatusketjun viivettä.
Vertailutestien kohokohdat:
| Vertailutesti | DeepSeek V3 -tulos | Konteksti |
|---|---|---|
| MMLU | 87.1% | Yleissivistys |
| HumanEval | 82.6% | Koodin generointi |
| MATH | 90.2% | Matemaattinen päättely |
| Konteksti-ikkuna | 128K | Pitkien asiakirjojen tuki |
DeepSeek V3 ylittää GPT-4.5:n koodaus- ja matematiikkavertailuissa. Sen harjoitustehokkuus on legendaarinen — vain 2,788 miljoonaa H800 GPU-tuntia täyteen esiharjoitusajoon, murto-osa siitä, mitä vastaavat mallit vaativat.
Laitteistovaatimukset: Identtiset R1:n kanssa (~136 GB VRAM Q4:llä). Käytännön käyttöönotossa GGUF-kvantisoidut versiot toimivat llama.cpp:n tai Ollaman kautta usean näytönohjaimen kuluttajakokoonpanoissa.
Kenelle: Jos tarvitset yhden mallin, joka hoitaa kaiken — keskustelu, koodaus, analyysi, käännös, tiivistäminen — V3 on tasapainoisin valinta. Se ei voita R1:tä vaikeassa päättelyssä eikä Scoutia kontekstipituudessa, mutta se päihittää molemmat tyypillisissä tuotantotyökuormissa, joissa nopeus ja monipuolisuus merkitsevät enemmän kuin vertailutestien huipputulokset.
5. Mistral Large 3 -- paras monikieliseen ja yrityskäyttöön
Mistral Large 3 palautti Mistralin takaisin huipulle. 675B kokonaisparametrilla (41B aktiivinen) se on täysi MoE-malli, joka on julkaistu Apache 2.0 -lisenssillä -- valtava muutos Mistral Large 2:n rajoittavasta tutkimuslisenssistä.
Malli harjoitettiin alusta asti 3 000 NVIDIA H200 GPU:lla, ja se näkyy. LMSYS Chatbot Arenalla se sijoittui toiseksi avointen mallien joukossa ja kuudenneksi yleisesti (mukaan lukien suljetut). Sen, mikä tekee siitä erityisen kiinnostavan eurooppalaisille tiimeille, on sen monikielisyys — noin 85,5 %:n tarkkuus tasapainotetussa monikielisessä MMLU-testissä.
Vertailutestien kohokohdat:
| Vertailutesti | Mistral Large 3 -tulos | Konteksti |
|---|---|---|
| Monikielinen MMLU | 85.5% | Kielten välinen tietämys |
| LMSYS Arena | nro 6 yleisesti | Ihmisten mieltymysjärjestys |
| AIME 2025 (14B-muunnelma) | 85% | Matemaattinen päättely |
| Konteksti-ikkuna | 128K | Pitkien asiakirjojen tuki |
Yksi piirre, joka erottaa Mistral-mallit: ne on harjoitettu sanomaan "en tiedä" sen sijaan, että ne hallusinoisivat. Se tekee Mistral Large 3:sta vahvan valinnan RAG-putkille ja yritysovelluksille, joissa faktuaalinen tarkkuus merkitsee enemmän kuin luova tuotos.
Laitteistovaatimukset: 675B kokonaisparametrilla VRAM-tarpeet ovat samankaltaiset kuin DeepSeekillä (~140 GB Q4:llä). Mistral tarjoaa myös 14B Small 3 -muunnelman, joka mahtuu yhdelle kuluttajanäytönohjaimelle ja lyö selvästi painoluokkaansa yläpuolelle päättelyssä ja koodauksessa.
Kenelle: Eurooppalaiset yritykset, jotka tarvitsevat monikielisyyttä ja datasuvereniteettia. Yritystiimit, jotka rakentavat RAG-järjestelmiä, joissa hallusinaatioiden vähentäminen on kriittistä. Apache 2.0 -lisenssi poistaa kaupallisen kitkan kokonaan.
6. Gemma 3 27B, paras yhden näytönohjaimen käyttöön
Googlen Gemma 3 27B on ihanteellinen tasapaino kyvyn ja saavutettavuuden välillä. 27 miljardilla parametrilla tiheässä arkkitehtuurissa se toimii yhdellä RTX 4090:llä Q4-kvantisoinnilla. Ei usean näytönohjaimen laitteistoja, ei palvelinluokan laitteistoa, vain tavallinen pelinäytönohjain.
Älä anna vaatimattoman parametrimäärän hämätä. Gemma 3 27B lyö selvästi painoluokkaansa yläpuolelle, erityisesti multimodaalisissa tehtävissä. Se käsittelee sekä teksti- että kuvasyötettä, tukee yli 140 kieltä, ja sen 130K-konteksti-ikkuna on antelias tämän kokoiselle mallille.
Vertailutestien kohokohdat:
| Vertailutesti | Gemma 3 27B -tulos | Konteksti |
|---|---|---|
| MMLU | 78.6% | Yleissivistys |
| DocVQA | 85.6% | Asiakirjojen ymmärtäminen |
| MGSM | 74.3% | Monikielinen matematiikka |
| ChartQA | 76.3% | Visuaalinen päättely |
Nuo multimodaaliset tulokset (DocVQA 85.6%, ChartQA 76.3%) kilpailevat 3–5-kertaisesti suurempien mallien kanssa. Kehittäjille, jotka tarvitsevat kuvien ymmärtämistä ilman GPU-klusteria, Gemma 3 on ilmeinen valinta.
Laitteistovaatimukset: Noin 16 GB VRAM:ia Q4-kvantisoinnilla, 32 GB Q8:lla. Yksi RTX 4090 (24 GB) hoitaa sen mukavasti. Jopa M2 MacBook Pro 32 GB:n yhdistetyllä muistilla pystyy ajamaan sitä. Jos seuraat opastamme LLM:ien paikallisessa ajamisessa, Gemma 3 on yksi helpoimmista malleista aloittaa.
Kenelle: Yksittäiskehittäjät, pienet tiimit ja kuka tahansa, joka haluaa kyvykkään multimodaalisen mallin vuokraamatta pilvi-GPU:ita. Se on myös erinomainen prototyyppien tekoon — testaa putkesi Gemma 3:lla paikallisesti, sitten skaalaa suurempaan malliin tuotannossa tarvittaessa. Googlen uudempaan pieneen malliin voit tutustua Gemma 4 12B -oppaassamme.
7. Phi-4 Reasoning, paras edge- ja resurssirajoitteiseen käyttöön
Microsoftin Phi-4 Reasoning todistaa, ettei parametrimäärä ole kaikkea. Vain 14 miljardilla parametrilla se päihittää DeepSeek R1:n 70B-tisleen useissa päättelyvertailuissa. Hiljattain julkaistu Phi-4-reasoning-vision-15B lisää multimodaaliset kyvyt ja pisteytyy 17 % korkeammalle kuin Gemma 3 12B matematiikka-visuaalisessa päättelyssä.
Phi-4-perheen salaisuus on harjoitusdatan laatu. Microsoftin lähestymistapa priorisoi kuratoidun, korkealaatuisen datan raakan skaalan sijaan, ja se toimii — Phi-4 saa yli 80 % MATH- ja MGSM-vertailuissa, päihittäen Googlen Gemini Pron ja GPT-4o-minin matemaattisessa päättelyssä.
Vertailutestien kohokohdat:
| Vertailutesti | Phi-4-tulos | Konteksti |
|---|---|---|
| MATH | 82.6% | Matemaattinen päättely |
| HumanEval | 82.6% | Koodin generointi |
| MGSM | 80%+ | Monikielinen matematiikka |
| MathVista (näkö) | +17% vs Gemma 12B | Visuaalinen matematiikka |
Laitteistovaatimukset: Noin 8 GB VRAM:ia Q4:llä -- se on kannettavan GPU tai jopa vanhempi pöytäkoneen näytönohjain. Malli toimii mukavasti Apple Silicon -MacBookeilla, tehden siitä aidosti kannettavan. Edge-käyttöön se on yksi harvoista malleista, joka voi toimia laitteessa kohtuullisella viiveellä.
Kenelle: Mobiili- ja edge-kehittäjät, tiimit, jotka rakentavat laitteessa toimivia AI-ominaisuuksia, ja kuka tahansa, joka tarvitsee vahvaa päättelyä minimaalisella laitteistolla. Phi-4 on myös loistava valinta hienosäädettyjen mallien arviointiin, koska sen pieni koko tekee harjoitusiteraatioista nopeita ja halpoja. MIT-lisenssi tarkoittaa, ettei kaupallisia rajoituksia ole.
8. GLM-4.7 -- paras agenttiseen koodaukseen
Z.ai:n GLM-4.7 on tarkoitusrakennettu tiettyyn käyttökohteeseen: agenttiset koodaustyönkulut, joissa mallin täytyy päätellä, käyttää työkaluja ja ylläpitää kontekstia pitkissä monivaiheisissa vuorovaikutuksissa.
Sen arkkitehtuuri on 355B MoE, jossa on 32B aktiivista parametria, mutta erottuva ominaisuus on sen kolmiportainen ajattelujärjestelmä. Toisin kuin useimmat mallit, jotka käynnistävät päättelyprosessinsa uudelleen joka vuorossa, GLM-4.7 säilyttää ajattelulohkot koko keskustelun ajan. Tämä pysyvä päättelykonteksti tekee todellisen eron, kun malli orkestroi monimutkaisia monivaiheisia koodaustehtäviä.
Vertailutestien kohokohdat:
| Vertailutesti | GLM-4.7-tulos | Konteksti |
|---|---|---|
| SWE-bench | 73.8% | Todellinen ohjelmistokehitys |
| HumanEval | 94.2% | Koodin generointi |
| Konteksti-ikkuna | 200K | Pitkät vuorovaikutukset |
| Maksimituloste | 131K tokenia | Laajennettu generointi |
Tuo 73,8 %:n SWE-bench-tulos on kilpailukykyinen Claude Sonnet 4.5:n kanssa -- todellisissa ohjelmistokehitystehtävissä, ei synteettisissä vertailuissa. Ja 94,2 %:n HumanEval on korkein tämän listan malleista.
Laitteistovaatimukset: Samankaltaiset kuin muilla suurilla MoE-malleilla (~130 GB VRAM Q4:llä). 200K-konteksti-ikkuna ja 131K maksimituloste tekevät siitä muistinnälkäisen pitkissä agenttisissa istunnoissa.
Kenelle: AI-avusteiset kehitystiimit, jotka rakentavat koodausagentteja, automatisoituja virheenkorjaustyökaluja tai koodintarkistusjärjestelmiä. Jos valitset hienosäätötyökaluja koodauspainotteiselle mallille, GLM-4.7 on vahva perusta. MIT-lisenssi tarkoittaa täyttä kaupallista käyttöä.
Paras avoimen lähdekoodin LLM koodaukseen (heinäkuu 2026)
Koodauksessa heinäkuussa 2026 GLM-4.7 on avoimen lähdekoodin kärkivalinta: 94,2 % HumanEvalissa ja 73,8 % SWE-benchissä, kilpailukykyinen Claude Sonnet 4.5:n kanssa todellisissa ohjelmistotehtävissä. Haluatko vahvan koodausmallin kuluttajalaitteistolle? DeepSeek R1 32B -tisle toimii yhdellä RTX 4090:llä.
Harkitsetko uudempaa GLM-julkaisua? Katso GLM 5.2 -analyysimme nähdäksesi, miten se vertautuu.
Miten valita: päätösviitekehys
"Paras" malli riippuu täysin rajoitteistasi. Käytä tätä matriisia päätöksesi rajaamiseen.
| Jos tarvitset... | Valitse | Miksi |
|---|---|---|
| Paras yleinen päättely | Qwen 3 235B | Huippu matematiikassa, koodissa ja yleisissä vertailuissa |
| Syvä ajatusketju | DeepSeek R1 | Itseään korjaava päättely, 87.5% AIME |
| Valtava konteksti-ikkuna | Llama 4 Scout | 10 milj. tokenia, täydellinen haku |
| Nopea yleiskäyttöinen | DeepSeek V3 | Paras nopeus-laatu-suhde |
| Monikielinen yritys | Mistral Large 3 | 85.5% monikielinen MMLU, hallusinaation esto |
| Yksi kuluttajanäytönohjain | Gemma 3 27B | 16 GB VRAM, vahva multimodaalinen |
| Kannettava tai edge-laite | Phi-4 14B | 8 GB VRAM, MIT-lisenssi |
| Koodausagentit | GLM-4.7 | 94.2% HumanEval, pysyvä päättely |
Etkö ole vielä varma? Aloita tästä: Onko sinulla usean näytönohjaimen laitteisto? Jos ei, valintasi ovat Gemma 3 ja Phi-4. Jos on, rakennatko koodausagenttia? Valitse GLM-4.7 tai DeepSeek R1. Tarvitsetko pitkää kontekstia? Llama 4 Scout. Kaikki muu? Qwen 3 235B on turvallisin oletus.
Miten sijoitimme nämä mallit
Sijoitukset eivät perustu yksittäiseen vertailutestiin. Jokainen malli arvioitiin viidellä ulottuvuudella:
- Vertailutestisuorituskyky, MMLU, HumanEval, AIME, SWE-bench ja toimialakohtaiset testit
- Laitteistosaavutettavuus, Voivatko todelliset tiimit todella ottaa sen käyttöön?
- Lisenssivapaus, Apache 2.0 ja MIT pisteytyvät korkeammalle kuin rajoittavat lisenssit
- Ekosysteemin kypsyys, Saatavilla Hugging Facessa, Ollassa, vLLM:ssä ja tärkeimmissä päättelymoottoreissa
- Todellinen käyttöönotto, Aktiivinen yhteisö, tuotantokäytöt, jatkuvat päivitykset
Mallit, jotka pisteytyvät hyvin vertailuissa mutta vaativat GPU-klusterin, jota kenelläkään ei ole (katson sinua, 671B täydellä tarkkuudella), saavat miinusta. Mallit, joilla on rajoittavat lisenssit, jotka estävät kaupallisen käytön, menettävät myös pisteitä. Tavoitteena on käytännön arvo, ei johtotaulukon kerskailuoikeudet.
Jos haluat testata näitä malleja itse, LLM-arviointioppaamme opastaa systemaattisten vertailutestien pystyttämisessä, ja parhaiden arviointityökalujen katsaus kattaa tarvitsemasi viitekehykset.
UKK
Mitkä ovat uusimmat avoimen lähdekoodin LLM:t vuonna 2026?
Vuoden 2026 kärkeä johtavat Qwen 3 (Alibaba), DeepSeek R1 ja V3, Llama 4 Scout (Meta), Mistral Large 3 ja GLM-4.7 (Z.ai). Pistojulkaisut kuten DeepSeek R1-0528 ja Phi-4 reasoning-vision -muunnelma saapuivat vuoden 2026 puoliväliin mennessä. Tarkistamme tämän listan kuukausittain ja päivitämme johtotaulukon aina, kun uusi julkaisu muuttaa järjestystä.
Kuinka usein tätä avoimen lähdekoodin LLM-johtotaulukkoa päivitetään?
Kuukausittain. Tarkistamme vertailutulokset, VRAM-vaatimukset ja lisenssit jokaisen kuukauden alussa ja lisäämme uudet mallit niiden ilmestyessä. Otsikon alla oleva "Viimeksi päivitetty" -päivämäärä heijastaa viimeisintä tarkistusta.
Mikä on paras avoimen lähdekoodin LLM vuonna 2026?
Qwen 3 235B-A22B johtaa tällä hetkellä laajimmalla vertailualueella, yhdistäen huipputason päättelyn, koodauksen ja monikielisyyden Apache 2.0 -lisenssillä. Tiettyihin käyttökohteisiin DeepSeek R1 (päättely) ja Llama 4 Scout (pitkä konteksti) voivat olla parempia valintoja.
Voinko ajaa avoimen lähdekoodin LLM:iä kuluttajalaitteistolla?
Kyllä. Gemma 3 27B toimii yhdellä RTX 4090:llä (24 GB VRAM) ja Phi-4 14B mahtuu kannettavan GPU:lle 8 GB:lla. Suurempien mallien kvantisoidut versiot (Q4, Q8) toimivat myös usean näytönohjaimen kuluttajakokoonpanoissa työkaluilla kuten Ollama ja llama.cpp.
Ovatko avoimen lähdekoodin LLM:t yhtä hyviä kuin ChatGPT tai Claude?
Koodaus- ja matematiikkavertailuissa parhaat avoimen lähdekoodin mallit vastaavat tai päihittävät GPT-4.5:n ja lähestyvät Claude Sonnet 4.5:n suorituskykyä. Kuilu on kapein strukturoiduissa tehtävissä (koodi, matematiikka, päättely) ja levein luovassa kirjoittamisessa ja vivahteikkaassa ohjeiden noudattamisessa.
Mitä MoE (Mixture-of-Experts) tarkoittaa laitteiston kannalta?
MoE-malleilla on suuri kokonaisparametrimäärä, mutta vain osa aktivoituu per token. Kuitenkin koko malli täytyy ladata muistiin, jotta reititin voi valita asiantuntijat. 235B MoE -malli, jossa on 22B aktiivista, tarvitsee silti 235B:n edestä VRAM:ia — et säästä muistia, säästät laskentaa.
Mikä avoimen lähdekoodin LLM on paras koodaukseen?
GLM-4.7 johtaa 94,2 % HumanEvalilla ja 73,8 % SWE-benchillä. Puhtaaseen koodin generointiin DeepSeek R1 ja Qwen 3 235B ovat lähellä perässä. Koodaukseen kuluttajalaitteistolla DeepSeek R1 32B -tisle on paras kyky-hinta-suhde.
Onko Llama 4 Scout todella 10 miljoonaa tokenia kontekstia?
Arkkitehtuuri tukee sitä, ja Meta esitteli täydellisen Needle-in-a-Haystack-haun 10 miljoonalla tokenilla. Mutta täyden kontekstin todellinen käyttö vaatii valtavasti KV-välimuistia. Useimmat itse ylläpidetyt käyttöönotot rajoittuvat realistisesti 128K–256K tokeniin. Pilvipalveluntarjoajat kuten Together AI ja Fireworks tarjoavat pidempiä konteksti-ikkunoita.
Mitä lisenssiä minun pitäisi etsiä avoimen lähdekoodin LLM:ssä?
Apache 2.0 ja MIT ovat sallivimmat — täysi kaupallinen käyttö, muokkaus ja uudelleenjakelu. Llaman mukautettu lisenssi sallii kaupallisen käytön, mutta siinä on rajoituksia sovelluksille, joilla on yli 700 miljoonaa käyttäjää. Joillakin "avoimien painojen" malleilla (kuten Gemma) on erityisehdot — lue aina lisenssi ennen tuotantokäyttöön ottoa.
Kuinka paljon VRAM:ia tarvitsen 70B-mallille?
Q4-kvantisoinnilla 70B tiheä malli tarvitsee noin 35–40 GB VRAM:ia. Yksi A100 (80 GB) hoitaa sen helposti, tai kaksi RTX 4090:tä (48 GB yhteensä). Täydellä tarkkuudella (BF16) tarvitset 140+ GB, käytännössä vaatii neljä A100:aa tai vastaavan.
Voinko hienosäätää avoimen lähdekoodin LLM:iä omaan käyttööni?
Ehdottomasti. QLoRA tekee 70B-mallin hienosäädöstä mahdollisen yhdellä 24 GB:n näytönohjaimella. Pienemmät mallit kuten Phi-4 ja Gemma 3 ovat vielä saavutettavampia hienosäätökokeiluille. Apache 2.0- ja MIT-lisensoiduilla malleilla ei ole rajoituksia johdannaisteoksille.
Entä avoimen lähdekoodin multimodaaliset LLM:t?
Gemma 3 27B ja Llama 4 Scout käsittelevät molemmat teksti- ja kuvasyötettä natiivisti. Phi-4-reasoning-vision-15B lisää visuaalisen päättelyn pienemmässä skaalassa. Videon ymmärtämiseen Llama 4 Scout tukee jopa 20 tuntia videosyötettä konteksti-ikkunassaan.
Mikä on paras avoimen lähdekoodin LLM juuri nyt?
Juuri nyt Qwen 3 235B-A22B on paras avoimen lähdekoodin LLM yleisesti, johtaen päättelyssä ja koodauksessa Apache 2.0 -lisenssillä. Yhdelle kuluttajanäytönohjaimelle Gemma 3 27B (16 GB VRAM) on kärkivalinta, ja GLM-4.7 voittaa koodausagenteissa 94,2 %:n HumanEval-tuloksella.
Onko olemassa avoimen lähdekoodin LLM-johtotaulukkoa?
Kyllä. Yllä oleva heinäkuun 2026 johtotaulukkomme sijoittaa kaikki tämän oppaan kahdeksan mallia, ja Hugging Face isännöi yhteisön ylläpitämää Open LLM Leaderboardia laajempaan kattavuuteen. Tarkistamme sijoituksemme kuukausittain vertailuja kuten MMLU, HumanEval, AIME ja SWE-bench vastaan.
Työkalun valitseminen on helppo puoli. Sen luotettava saaminen toimimaan todellisen tuotteen sisällä on, missä useimmat tiimit jumittuvat — ja juuri sitä AI-integraatiotiimimme rakentaa asiakkaille, RAG-putkista mukautettuihin agentteihin. Haluatko toisen mielipiteen pinostasi? Ota ilmainen konsultaatio.