
De beste open source-LLM-ene i 2026: 8 modeller rangert etter virkelig ytelse
Sist oppdatert: 5. juli 2026. Alle benchmarkpoeng, VRAM-tall og lisenser i denne guiden ble re-verifisert for denne oppdateringen. Rangeringen nedenfor gjenspeiler open-weight-modeller utgitt frem til midten av 2026 — hvis en ny versjon endrer rekkefølgen, oppdateres denne siden innen en måned.
Den beste open source-LLM-en i 2026 er Qwen 3 235B-A22B for generell resonnering og koding, med DeepSeek R1 i teten på dyp matematisk resonnering og Llama 4 Scout på lang kontekst (10 millioner tokens). For ett enkelt forbruker-GPU er Gemma 3 27B (16 GB VRAM) og Phi-4 14B (8 GB) de enkleste å selvhoste. Alle tre toppmodellene matcher GPT-4-klasse ytelse på kode og matematikk, og forblir gratis å distribuere.
Ledende open source-LLM-er: benchmark-øyeblikksbilde
Tabellen nedenfor dekker fem mye brukte open source-modeller vurdert på standard offentlige benchmarks. MMLU måler bred generell kunnskap; HumanEval måler bestått-prosenten for kodegenerering.
| Modell | Parametere | Utgivelse | MMLU | HumanEval | Lisens | Beste for |
|---|---|---|---|---|---|---|
| Llama 3.3 70B | 70B | Des. 2024 | 86,0 | 88,4 | Llama 3.3 Community | Generelt formål, flerspråklig |
| Qwen 2.5 72B | 72B | Sep. 2024 | 85,0+ | 86,6 | Qwen License | Matematikk, koding, instruksjonsføling |
| DeepSeek-V3 | 671B (37B aktive) | Des. 2024 | 87,1 | 82,6 | MIT | Generelt formål, koding, kostnadseffektiv |
| Mistral Small 3.1 | 24B | Mar. 2025 | 80,6 | 88,4 | Apache 2.0 | Agentiske arbeidsflyter, visjon, flerspråklig |
| Gemma 3 27B | 27B | Mar. 2025 | ~78,6 | 87,8 | Gemma Terms of Use | Enkelt GPU-distribusjon, multimodal |
Vi oppdaterer denne tabellen månedlig.
Open source-LLM-er "konkurrerer" ikke lenger bare med proprietære modeller -- innen koding, matematikk og oppgaver med lang kontekst vinner de. Gapet mellom en API-regning på $200/måned og en egenhosted åpen modell har aldri vært mindre.
Denne rangeringen kutter gjennom hypen. Hver modell her evalueres på benchmarks som virkelig betyr noe, på maskinvaren du faktisk vil trenge, og på det spesifikke brukstilfellet der hver modell skinner sterkest.
Rask oppsummering: Hvilken open source-LLM bør du velge?
Trenger du absolutt beste resonnering? Velg Qwen 3 235B eller DeepSeek R1. Vil du kjøre noe på ett enkelt GPU? Gemma 3 27B eller Phi-4 14B. Behandler du enorme dokumenter? Llama 4 Scouts 10M-tokenkontekst er uovertruffen.
| Rang | Modell | Parametere (aktive) | Beste for | Lisens | Min. VRAM |
|---|---|---|---|---|---|
| no. 1 | Qwen 3 235B-A22B | 235B (22B) | Resonnering + koding | Apache 2.0 | ~132 GB (Q4) |
| no. 2 | DeepSeek R1 | 671B (37B) | Dyp resonnering + matematikk | MIT | ~136 GB (Q4) |
| no. 3 | Llama 4 Scout | 109B (17B) | Lang kontekst (10M tokens) | Llama License | ~55 GB (Q4) |
| no. 4 | DeepSeek V3 | 671B (37B) | Generelt formål + koding | MIT | ~136 GB (Q4) |
| no. 5 | Mistral Large 3 | 675B (41B) | Flerspråklig + enterprise | Apache 2.0 | ~140 GB (Q4) |
| no. 6 | Gemma 3 27B | 27B (27B, tett) | Enkelt GPU-distribusjon | Åpne vekter | ~16 GB (Q4) |
| no. 7 | Phi-4 Reasoning | 14B (14B, tett) | Edge + mobile enheter | MIT | ~8 GB (Q4) |
| no. 8 | GLM-4.7 | 355B (32B) | Agentiske kodingsarbeidsflyter | MIT | ~130 GB (Q4) |
VRAM-tallene forutsetter Q4-kvantisering. Krav for full presisjon er 2-4 ganger høyere. Hvis du er ny på å kjøre modeller lokalt, start med Gemma 3 eller Phi-4 -- de er de mest maskinvarevennlige alternativene på denne listen.
Open Source-LLM-leaderboard: rangeringer juli 2026
Per juli 2026 topper Qwen 3 235B-A22B open source-LLM-leaderboardet vårt for allsidig resonnering og koding, med DeepSeek R1 på andreplass innen dyp matematikk og Llama 4 Scout på tredjeplass innen lang kontekst. Den fullstendige rangeringen nedenfor dekker alle åtte modellene som er vurdert i denne guiden, fra datasenterrigger til bærbar-vennlige valg.
| Rang | Modell | Lisens | Best for | Min. VRAM |
|---|---|---|---|---|
| no. 1 | Qwen 3 235B-A22B | Apache 2.0 | Resonnering + koding | ~132 GB (Q4) |
| no. 2 | DeepSeek R1 | MIT | Dyp resonnering + matematikk | ~136 GB (Q4) |
| no. 3 | Llama 4 Scout | Llama License | Lang kontekst (10M tokens) | ~55 GB (Q4) |
| no. 4 | DeepSeek V3 | MIT | Generelt formål + koding | ~136 GB (Q4) |
| no. 5 | Mistral Large 3 | Apache 2.0 | Flerspråklig + enterprise | ~140 GB (Q4) |
| no. 6 | Gemma 3 27B | Åpne vekter | Enkelt GPU-distribusjon | ~16 GB (Q4) |
| no. 7 | Phi-4 Reasoning | MIT | Edge + mobile enheter | ~8 GB (Q4) |
| no. 8 | GLM-4.7 | MIT | Agentiske kodingsarbeidsflyter | ~130 GB (Q4) |
Denne rangeringen gjenspeiler vår månedlige re-sjekk av benchmarks, maskinvarebehov og lisensvilkår.
La oss nå bryte ned hva som gjør hver modell verdt oppmerksomheten din.
1. Qwen 3 235B-A22B -- Beste open source-LLM totalt sett
Alibabas Qwen 3 235B-A22B er modellen å slå akkurat nå. Det er en Mixture-of-Experts-arkitektur med 235 milliarder totale parametere, men bare 22 milliarder aktiveres per token -- noe som reduserer beregningen med omtrent 90% sammenlignet med en tett modell av lignende kvalitet.
Det som skiller Qwen 3 er dens doble tenkemodus. Du kan veksle mellom en "tenkemodus" for komplekse matematikk- og kodingsproblemer (der modellen viser sin tankekjede) og en rask "ikke-tenkemodus" for raske chattsvar. Den fleksibiliteten betyr noe i produksjon.
Benchmark-høydepunkter:
| Benchmark | Qwen 3 235B-poeng | Kontekst |
|---|---|---|
| AIME 2024 | 85,7% | Matematikk på konkurransenivå |
| AIME 2025 | 81,5% | Vanskeligere matematikkproblemer |
| LiveCodeBench v5 | 70,7% | Virkelige kodingsoppgaver |
| CodeForces | 2 056 | Konkurranseprogrammering |
| BFCL v3 | 70,8% | Funksjonskall |
Disse tallene plasserer den i samme nivå som DeepSeek R1, OpenAIs o1 og Gemini 2.5 Pro -- bortsett fra at du kan laste den ned, finjustere den og distribuere den hvor du vil under Apache 2.0.
Maskinvarekrav: Den fullstendige modellen trenger omtrent 132 GB VRAM ved Q4-kvantisering. Det er et multi-GPU-oppsett -- tenk fem RTX 3090, tre A40 eller en dual-H100-rigg. Ikke billig, men godt innen rekkevidde for en oppstart eller et forskningslaboratorium. Qwen 3-familien inkluderer også mindre varianter (32B, 14B, 8B, 4B) som kjører på forbrukerhardvare.
Hvem bør bruke den: Team som trenger resonnering og koding på grensen, men ønsker å eie sin infrastruktur. Spesielt sterk for flerspråklige arbeidsbelastninger med 256K kontekst og støtte for 100+ språk. Hvis du planlegger å finjustere en modell for ditt spesifikke domene, gir Qwen 3s Apache 2.0-lisens deg full frihet.
2. DeepSeek R1 -- Beste for dyp resonnering
DeepSeek R1 endret spillet da den ble lansert tidlig i 2025, og beviste at open source-modeller kunne matche OpenAIs o1 på resonnneringsoppgaver. R1-0528-oppdateringen drev ting enda lenger -- AIME 2025-nøyaktigheten hoppet fra 70% til 87,5%.
Modellens hemmelighet er dens treningsmetodologi. DeepSeek opprettet først R1-Zero med ren forsterkningslæring uten overvåket finjusteringsoppvarming. Modellen utviklet spontant tankekjedetenkning, selvverifisering og tilbakesporingsadferd. Den lærte bokstavelig talt seg selv å sjekke sitt eget arbeid.
Benchmark-høydepunkter:
| Benchmark | DeepSeek R1-poeng | Kontekst |
|---|---|---|
| AIME 2025 | 87,5% (R1-0528) | Matematikkolympiade |
| GPQA Diamond | 71,5% | Vitenskap på postgraduatnivå |
| SWE-bench | 49,2% | Virkelig programvareutvikling |
| HumanEval | 92,4% | Kodegenerering |
Maskinvarekrav: Samme 671B MoE-arkitektur som DeepSeek V3, så du trenger ~136 GB VRAM ved Q4. Men her er den praktiske vinkelen: DeepSeek slapp også destillerte varianter på 1,5B, 7B, 14B, 32B og 70B parametere. 32B-destillasjonen kjører på ett enkelt RTX 4090 og overgår fremdeles mange større modeller på resonnneringsoppgaver.
Hvem bør bruke den: Alle som bygger applikasjoner som krever trinnvis resonnering -- teorembevisning, kompleks kodefeilsøking, vitenskapelig analyse. De destillerte variantene er spesielt nyttige hvis du trenger resonnneringsevner med et begrenset budsjett. Sjekk ut de beste verktøyene for å kjøre LLM-er lokalt hvis du vil distribuere de mindre destillasjonene på din egen maskinvare.
3. Llama 4 Scout -- Beste for lang kontekst
Metas Llama 4 Scout brakte noe genuint nytt til open source-verdenen: et kontekstvindu på 10 millioner tokens. Det er ikke en skrivefeil. Du kan mate inn en hel kodebase, en hylle med forskningsartikler eller 20 timers videotranskripsjoner i en enkelt forespørsel.
Scout bruker 16 MoE-eksperter med bare 2 aktive per token, noe som gir den 109B totale parametere men bare 17B aktive. Meta hevder at den passer på ett enkelt H100 med INT4-kvantisering, selv om 10M-tokenkontekstvinduet åpenbart krever mer minne for KV-cachen.
Benchmark-høydepunkter:
| Benchmark | Llama 4 Scout-poeng | Kontekst |
|---|---|---|
| Needle-in-a-Haystack (10M) | 100% | Perfekt gjenfinning |
| MMLU | 79,6% | Generell kunnskap |
| HumanEval | 81,2% | Kodegenerering |
| DocVQA | 85,1% | Dokumentforståelse |
Den perfekte Needle-in-a-Haystack-poengsummen ved 10M tokens er bemerkelsesverdig. De fleste modeller begynner å miste informasjon lenge før 128K. Scout bruker en ny inter-dokument-oppmerksomhetsmaskingstilnærming som opprettholder grenser mellom dokumenter selv innenfor det massive kontekstvinduet.
Maskinvarekrav: Ved Q4 trenger modellvektene omtrent 55 GB VRAM. Ett enkelt H100 (80 GB) håndterer det komfortabelt. For forbrukerhardvare kan to RTX 4090 (48 GB totalt) håndtere kortere kontekstlengder. Problemet: å faktisk bruke det fulle 10M-kontekstvinduet krever enormt KV-cacheminne i tillegg til modellvektene. I praksis begrenser de fleste egenhoste distribusjoner konteksten til 128K-256K tokens.
Hvem bør bruke den: Team som jobber med enorme dokumenter -- juridisk analyse, Q&A om kodelagre, syntese av forskningsartikler. De multimodale egenskapene (tekst + bildeinntasting) er også sterke. Vær bare realistisk om kontekstlengden: 10M-taket er ekte, men du trenger hardware på servernivå for å nå det.
4. DeepSeek V3 -- Beste generelle open source-LLM
Mens DeepSeek R1 får overskriftene for sin resonnering er DeepSeek V3 sannsynligvis den mer praktiske modellen for daglig bruk. Det er arbeidshesten -- rask, kapabel på alle fronter og bemerkelsesverdig effektiv for sin størrelse.
V3 deler den samme 671B MoE / 37B aktive arkitekturen som R1, men bytter dype resonnneringskjeder mot raskere responstider og bredere generelle evner. V3-0324-oppdateringen inkorporerte forsterkningslæringsteknikker fra R1s trening, og forbedret resonnering uten latenstreffet fra eksplisitte tankekjeder.
Benchmark-høydepunkter:
| Benchmark | DeepSeek V3-poeng | Kontekst |
|---|---|---|
| MMLU | 87,1% | Generell kunnskap |
| HumanEval | 82,6% | Kodegenerering |
| MATH | 90,2% | Matematisk resonnering |
| Kontekstvindu | 128K | Støtte for lange dokumenter |
DeepSeek V3 overgår GPT-4.5 i koding og matematikkbenchmarks. Treningseffektiviteten er legendarisk -- bare 2,788 millioner H800 GPU-timer for hele forhåndsopplæringskjøringen, en brøkdel av det sammenlignbare modeller krever.
Maskinvarekrav: Identiske med R1 (~136 GB VRAM ved Q4). For praktisk distribusjon kjører GGUF-kvantiserte versjoner via llama.cpp eller Ollama på multi-GPU-forbrukerkonfigurasjoner.
Hvem bør bruke den: Hvis du trenger én modell som håndterer alt -- chat, koding, analyse, oversettelse, oppsummering -- er V3 det mest balanserte valget. Den vil ikke slå R1 på vanskelig resonnering eller Scout på kontekstlengde, men den vil overgå begge på typiske produksjonsarbeidsbelastninger der hastighet og allsidighet betyr mer enn toppbenchmarkpoeng.
5. Mistral Large 3 -- Beste for flerspråklig og enterprise-bruk
Mistral Large 3 brakte Mistral tilbake til fronten. Med 675B totale parametere (41B aktive) er det en fullstendig MoE-modell lansert under Apache 2.0 -- et enormt skifte fra Mistral Large 2s restriktive forskningslisens.
Modellen ble trent fra bunnen av på 3 000 NVIDIA H200 GPU-er, og det syns. På LMSYS Chatbot Arena rangerte den no. 2 blant åpne modeller og no. 6 totalt (inkludert proprietære). Det som gjør den spesielt interessant for europeiske team er dens flerspråklige styrke -- omtrent 85,5% nøyaktighet på en balansert flerspråklig MMLU-test.
Benchmark-høydepunkter:
| Benchmark | Mistral Large 3-poeng | Kontekst |
|---|---|---|
| Flerspråklig MMLU | 85,5% | Tverrspråklig kunnskap |
| LMSYS Arena | no. 6 totalt | Menneskelig preferanserangering |
| AIME 2025 (14B-variant) | 85% | Matematisk resonnering |
| Kontekstvindu | 128K | Støtte for lange dokumenter |
Et trekk som skiller Mistral-modellene: de er trent til å si "Jeg vet ikke" i stedet for å hallusinere. Det gjør Mistral Large 3 til et sterkt valg for RAG-pipelines og enterprise-applikasjoner der faktanøyaktighet betyr mer enn kreativ produksjon.
Maskinvarekrav: Med 675B totale parametere er VRAM-kravene lik DeepSeek (~140 GB ved Q4). Mistral tilbyr også 14B Small 3-varianten, som passer på ett enkelt forbruker-GPU og presterer langt over sin vektklasse på resonnering og koding.
Hvem bør bruke den: Europeiske selskaper som trenger flerspråklige evner og datasuverenitet. Enterprise-team som bygger RAG-systemer der hallusinasjonsreduksjon er kritisk. Apache 2.0-lisensen eliminerer kommersiell friksjon fullstendig.
6. Gemma 3 27B -- Beste for enkelt GPU-distribusjon
Googles Gemma 3 27B er det søte midtpunktet mellom evne og tilgjengelighet. Med 27 milliarder parametere i en tett arkitektur kjører den på ett enkelt RTX 4090 med Q4-kvantisering. Ingen multi-GPU-rigger, ingen maskinvare på servernivå -- bare et vanlig spillkort.
Ikke la deg lure av det beskjedne parameterantallet. Gemma 3 27B presterer langt over sin vektklasse, spesielt på multimodale oppgaver. Den håndterer både tekst- og bildeinntasting, støtter 140+ språk, og 130K kontekstvinduet er generøst for en modell av denne størrelsen.
Benchmark-høydepunkter:
| Benchmark | Gemma 3 27B-poeng | Kontekst |
|---|---|---|
| MMLU | 78,6% | Generell kunnskap |
| DocVQA | 85,6% | Dokumentforståelse |
| MGSM | 74,3% | Flerspråklig matematikk |
| ChartQA | 76,3% | Visuell resonnering |
De multimodale poengene (DocVQA 85,6%, ChartQA 76,3%) konkurrerer med modeller som er 3-5 ganger større. For utviklere som trenger bildeforståelse uten et GPU-kluster er Gemma 3 det åpenbare valget.
Maskinvarekrav: Omtrent 16 GB VRAM ved Q4-kvantisering, 32 GB ved Q8. Ett enkelt RTX 4090 (24 GB) håndterer det komfortabelt. Selv en M2 MacBook Pro med 32 GB enhetlig minne kan kjøre det. Hvis du følger vår guide for å kjøre LLM-er lokalt, er Gemma 3 en av de enkleste modellene å starte med.
Hvem bør bruke den: Enkeltutvikling, små team og alle som ønsker en kapabel multimodal modell uten å leie sky-GPU-er. Det er også utmerket for prototyping -- test pipelinen din på Gemma 3 lokalt, og skaler deretter opp til en større modell i produksjon om nødvendig. For Googles nyere småmodell, se vår Gemma 4 12B-guide.
7. Phi-4 Reasoning -- Beste for edge og ressursbegrensede distribusjoner
Microsofts Phi-4 Reasoning beviser at parameterantall ikke er alt. Med bare 14 milliarder parametere overgår den DeepSeek R1s 70B-destillasjon på flere resonnneringsbenchmarks. Den nylig lanserte Phi-4-reasoning-vision-15B legger til multimodale evner og scorer 17% høyere enn Gemma 3 12B på matematisk-visuelle resonnneringsoppgaver.
Phi-4-familjens hemmelighet er kvaliteten på treningsdataene. Microsofts tilnærming prioriterer kuraterte, høykvalitets data fremfor rå skala, og det fungerer -- Phi-4 scorer over 80% på MATH- og MGSM-benchmarks og overgår Googles Gemini Pro og GPT-4o-mini på matematisk resonnering.
Benchmark-høydepunkter:
| Benchmark | Phi-4-poeng | Kontekst |
|---|---|---|
| MATH | 82,6% | Matematisk resonnering |
| HumanEval | 82,6% | Kodegenerering |
| MGSM | 80%+ | Flerspråklig matematikk |
| MathVista (vision) | +17% vs Gemma 12B | Visuell matematikk |
Maskinvarekrav: Omtrent 8 GB VRAM ved Q4 -- det er et laptop-GPU eller til og med et eldre skrivebordskort. Modellen kjører komfortabelt på Apple Silicon MacBooks, noe som gjør den genuint bærbar. For edge-distribusjon er den en av de få modellene som kan kjøre on-device med rimelig forsinkelse.
Hvem bør bruke den: Mobil- og edge-utviklere, team som bygger on-device AI-funksjoner og alle som trenger sterk resonnering på minimal maskinvare. Phi-4 er også et godt valg for å evaluere finjusterte modeller siden den lille størrelsen gjør treningsitersjoner raske og billige. MIT-lisensen betyr ingen kommersielle begrensninger.
8. GLM-4.7 -- Beste for agentisk koding
Z.ais GLM-4.7 er spesialbygget for ett spesifikt brukstilfelle: agentiske kodingsarbeidsflyter der modellen trenger å resonnere, bruke verktøy og opprettholde kontekst på tvers av lange flertrinnssinteraksjoner.
Arkitekturen er en 355B MoE med 32B aktive parametere, men den fremtredende funksjonen er dens tretrinns tenkesystem. I motsetning til de fleste modeller som starter opp resonnneringsprosessen på nytt hver tur, beholder GLM-4.7 tankeblokker gjennom hele samtalen. Den vedvarende resonnneringskonteksten gjør en virkelig forskjell når modellen orkestrerer komplekse flertrinnskodingsoppgaver.
Benchmark-høydepunkter:
| Benchmark | GLM-4.7-poeng | Kontekst |
|---|---|---|
| SWE-bench | 73,8% | Virkelig programvareutvikling |
| HumanEval | 94,2% | Kodegenerering |
| Kontekstvindu | 200K | Lange interaksjoner |
| Maks. utdata | 131K tokens | Utvidet generering |
Den 73,8% SWE-bench-poengsummen er konkurransedyktig med Claude Sonnet 4.5 -- på virkelige programvareingenjøroppgaver, ikke syntetiske benchmarks. Og 94,2% HumanEval er den høyeste for enhver modell på denne listen.
Maskinvarekrav: Ligner på andre store MoE-modeller (~130 GB VRAM ved Q4). 200K kontekstvinduet og 131K maks. utdata gjør det minnehungrig under lange agentiske sesjoner.
Hvem bør bruke den: AI-støttede utviklingsteam som bygger kodingsagenter, automatiserte feilsøkingsverktøy eller kodegjennomgangssystemer. Hvis du velger finjusteringsverktøy for en kodingsfokusert modell, er GLM-4.7 et sterkt grunnlag. MIT-lisensen tillater full kommersiell bruk.
Beste open source-LLM for koding (juli 2026)
For koding i juli 2026 er GLM-4.7 det ledende open source-valget, med 94,2% på HumanEval og 73,8% på SWE-bench -- konkurransedyktig med Claude Sonnet 4.5 på virkelige programvareoppgaver. Vil du ha en sterk kodingsmodell på forbrukerhardvare? DeepSeek R1 32B-destillasjonen kjører på ett enkelt RTX 4090.
Vurderer du den nyere GLM-utgivelsen? Se vår gjennomgang av GLM 5.2 for hvordan den sammenlignes.
Hvordan velge: beslutningsramme
Den "beste" modellen avhenger helt av begrensningene dine. Bruk denne matrisen for å innsnevre beslutningen.
| Hvis du trenger... | Velg | Hvorfor |
|---|---|---|
| Beste totale resonnering | Qwen 3 235B | Topp matematikk, kode og generelle benchmarks |
| Dyp tankekjede | DeepSeek R1 | Selvreparerende resonnering, 87,5% AIME |
| Enormt kontekstvindu | Llama 4 Scout | 10M tokens, perfekt gjenfinning |
| Rask og generell | DeepSeek V3 | Beste hastighets-kvalitetsforhold |
| Flerspråklig enterprise | Mistral Large 3 | 85,5% flerspråklig MMLU, anti-hallusinasjon |
| Enkelt forbruker-GPU | Gemma 3 27B | 16 GB VRAM, sterk multimodal |
| Laptop eller edge-enhet | Phi-4 14B | 8 GB VRAM, MIT-lisens |
| Kodingsagenter | GLM-4.7 | 94,2% HumanEval, vedvarende resonnering |
Fortsatt usikker? Start her: Har du multi-GPU-maskinvare? Hvis nei er valgene dine Gemma 3 og Phi-4. Hvis ja, bygger du en kodingsagent? Velg GLM-4.7 eller DeepSeek R1. Trenger du lang kontekst? Llama 4 Scout. Alt annet? Qwen 3 235B er det sikreste standardvalget.
Hvordan vi rangerte disse modellene
Rangeringene er ikke basert på ett enkelt benchmark. Hver modell ble evaluert på fem dimensjoner:
- Benchmark-ytelse -- MMLU, HumanEval, AIME, SWE-bench og domene-spesifikke tester
- Maskinvaretilgjengelighet -- Kan ekte team faktisk distribuere den?
- Lisensfrihet -- Apache 2.0 og MIT får høyere poeng enn restriktive lisenser
- Økosystemsmodenhet -- Tilgjengelig på Hugging Face, Ollama, vLLM og store inferensmotorer
- Virkelig adopsjon -- Aktivt fellesskap, produksjonsdistribusjoner, pågående oppdateringer
Modeller som gjør det bra på benchmarks men krever et GPU-kluster som ingen har (dere vet hvilke, 671B full presisjon) straffes. Modeller med restriktive lisenser som blokkerer kommersiell bruk mister også poeng. Målet er praktisk verdi, ikke skryt om leaderboard-plasseringer.
Hvis du vil teste disse modellene selv, forklarer vår LLM-evalueringsguide hvordan du setter opp systematiske benchmarks, og oppsummeringen av beste evalueringsverktøy dekker rammeverkene du vil trenge.
Å velge verktøy er den enkle delen. Å få det til å kjøre stabilt i et ekte produkt er der de fleste team står fast, og det er akkurat det vårt AI-integrasjonsteam bygger for kundene, fra RAG-pipelines til skreddersydde agenter. Vil du ha en ny vurdering av oppsettet ditt? Få en gratis konsultasjon.
Vanlige spørsmål
Hvilke er de nyeste open source-LLM-ene i 2026?
2026-fronten ledes av Qwen 3 (Alibaba), DeepSeek R1 og V3, Llama 4 Scout (Meta), Mistral Large 3 og GLM-4.7 (Z.ai). Punktoppdateringer som DeepSeek R1-0528 og Phi-4 reasoning-vision-varianten kom i løpet av midten av 2026. Vi sjekker denne listen månedlig og oppdaterer rangeringen når en ny versjon endrer rekkefølgen.
Hvor ofte oppdateres dette open source-LLM-leaderboardet?
Månedlig. Vi re-verifiserer benchmarkpoeng, VRAM-krav og lisenser ved starten av hver måned og legger til nye modeller etter hvert som de lanseres. Datoen "Sist oppdatert" under tittelen gjenspeiler den siste gjennomgangen.
Hva er den beste open source-LLM-en i 2026?
Qwen 3 235B-A22B leder for øyeblikket på det bredeste spekteret av benchmarks og kombinerer førsteklasses resonnering, koding og flerspråklige evner under en Apache 2.0-lisens. For spesifikke brukstilfeller kan DeepSeek R1 (resonnering) og Llama 4 Scout (lang kontekst) være bedre valg.
Kan jeg kjøre open source-LLM-er på forbrukerhardvare?
Ja. Gemma 3 27B kjører på ett enkelt RTX 4090 (24 GB VRAM) og Phi-4 14B passer på et laptop-GPU med 8 GB. Kvantiserte versjoner (Q4, Q8) av større modeller fungerer også på multi-GPU-forbrukerkonfigurasjoner med verktøy som Ollama og llama.cpp.
Er open source-LLM-er like gode som ChatGPT eller Claude?
På koding og matematikkbenchmarks matcher eller overgår de beste open source-modellene GPT-4.5 og nærmer seg Claude Sonnet 4.5-ytelsen. Gapet er minst på strukturerte oppgaver (kode, matematikk, resonnering) og størst på kreativ skriving og nyansert instruksjonsoppfølging.
Hva betyr MoE (Mixture-of-Experts) for maskinvaren?
MoE-modeller har et stort totalt parameterantall, men aktiverer bare en brøkdel per token. Hele modellen må imidlertid lastes inn i minnet slik at ruteren kan velge eksperter. En 235B MoE-modell med 22B aktive trenger fortsatt 235B verdi av VRAM -- du sparer ikke minne, du sparer beregning.
Hvilken open source-LLM er best for koding?
GLM-4.7 leder med 94,2% HumanEval og 73,8% SWE-bench. For ren kodegenerering er DeepSeek R1 og Qwen 3 235B rett bak. For koding på forbrukerhardvare er DeepSeek R1 32B-destillasjonen det beste forholdet mellom evner og kostnad.
Er Llama 4 Scouts 10 millioner tokeners kontekst virkelig ekte?
Arkitekturen støtter det, og Meta demonstrerte perfekt Needle-in-a-Haystack-gjenfinning ved 10M tokens. Men å faktisk bruke den fulle konteksten krever enormt KV-cacheminne. De fleste egenhoste distribusjoner begrenser realistisk konteksten til 128K-256K tokens. Skyleverandører som Together AI og Fireworks tilbyr lengre kontekstvinduer.
Hvilken lisens bør jeg se etter i en open source-LLM?
Apache 2.0 og MIT er de mest permissive -- full kommersiell bruk, modifikasjon og redistribusjon. Llamas tilpassede lisens tillater kommersiell bruk, men har begrensninger for apper med 700M+ brukere. Noen "open-weight"-modeller (som Gemma) har spesifikke vilkår -- les alltid lisensen før produksjonsdistribusjon.
Hvor mye VRAM trenger jeg for en 70B-modell?
Med Q4-kvantisering trenger en tett 70B-modell omtrent 35-40 GB VRAM. Ett enkelt A100 (80 GB) håndterer det enkelt, eller to RTX 4090 (48 GB totalt). Med full presisjon (BF16) er du på 140+ GB -- noe som effektivt krever fire A100 eller tilsvarende.
Kan jeg finjustere open source-LLM-er for mitt brukstilfelle?
Absolutt. QLoRA gjør det mulig å finjustere en 70B-modell på ett enkelt 24 GB GPU. Mindre modeller som Phi-4 og Gemma 3 er enda mer tilgjengelige for finjusteringseksperimenter. Apache 2.0 og MIT-lisensierte modeller har ingen begrensninger på avledede verk.
Hva med open source multimodale LLM-er?
Gemma 3 27B og Llama 4 Scout håndterer begge tekst og bildeinntasting innebygd. Phi-4-reasoning-vision-15B legger til visuell resonnering i en mindre skala. For videoforståelse støtter Llama 4 Scout opptil 20 timer med videoinntasting innenfor kontekstvinduet sitt.
Hva er den beste open source-LLM-en akkurat nå?
Akkurat nå er Qwen 3 235B-A22B den beste open source-LLM-en totalt sett, og leder på resonnering og koding under en Apache 2.0-lisens. For ett enkelt forbruker-GPU er Gemma 3 27B (16 GB VRAM) toppvalget, og GLM-4.7 vinner for kodingsagenter med 94,2% HumanEval.
Finnes det et open source LLM-leaderboard?
Ja. Vårt leaderboard for juli 2026 ovenfor rangerer alle åtte modellene i denne guiden, og Hugging Face er vertskap for det fellesskapsdrevne Open LLM Leaderboard for bredere dekning. Vi re-verifiserer rangeringene våre månedlig mot benchmarks som MMLU, HumanEval, AIME og SWE-bench.