ai-machine-learning

Beste Open Source-LLM 2026: Vi testet 8 — bare 3 slo GPT-4-klassen

Skrevet av Mert Batur
Oppdatert Jul 5, 2026
16 lesing
Beste Open Source-LLM 2026: Vi testet 8 — bare 3 slo GPT-4-klassen

De beste open source-LLM-ene i 2026: 8 modeller rangert etter virkelig ytelse

Sist oppdatert: 5. juli 2026. Alle benchmarkpoeng, VRAM-tall og lisenser i denne guiden ble re-verifisert for denne oppdateringen. Rangeringen nedenfor gjenspeiler open-weight-modeller utgitt frem til midten av 2026 — hvis en ny versjon endrer rekkefølgen, oppdateres denne siden innen en måned.

Den beste open source-LLM-en i 2026 er Qwen 3 235B-A22B for generell resonnering og koding, med DeepSeek R1 i teten på dyp matematisk resonnering og Llama 4 Scout på lang kontekst (10 millioner tokens). For ett enkelt forbruker-GPU er Gemma 3 27B (16 GB VRAM) og Phi-4 14B (8 GB) de enkleste å selvhoste. Alle tre toppmodellene matcher GPT-4-klasse ytelse på kode og matematikk, og forblir gratis å distribuere.

Ledende open source-LLM-er: benchmark-øyeblikksbilde

Tabellen nedenfor dekker fem mye brukte open source-modeller vurdert på standard offentlige benchmarks. MMLU måler bred generell kunnskap; HumanEval måler bestått-prosenten for kodegenerering.

ModellParametereUtgivelseMMLUHumanEvalLisensBeste for
Llama 3.3 70B70BDes. 202486,088,4Llama 3.3 CommunityGenerelt formål, flerspråklig
Qwen 2.5 72B72BSep. 202485,0+86,6Qwen LicenseMatematikk, koding, instruksjonsføling
DeepSeek-V3671B (37B aktive)Des. 202487,182,6MITGenerelt formål, koding, kostnadseffektiv
Mistral Small 3.124BMar. 202580,688,4Apache 2.0Agentiske arbeidsflyter, visjon, flerspråklig
Gemma 3 27B27BMar. 2025~78,687,8Gemma Terms of UseEnkelt GPU-distribusjon, multimodal

Vi oppdaterer denne tabellen månedlig.

Open source-LLM-er "konkurrerer" ikke lenger bare med proprietære modeller -- innen koding, matematikk og oppgaver med lang kontekst vinner de. Gapet mellom en API-regning på $200/måned og en egenhosted åpen modell har aldri vært mindre.

Denne rangeringen kutter gjennom hypen. Hver modell her evalueres på benchmarks som virkelig betyr noe, på maskinvaren du faktisk vil trenge, og på det spesifikke brukstilfellet der hver modell skinner sterkest.

Rask oppsummering: Hvilken open source-LLM bør du velge?

Trenger du absolutt beste resonnering? Velg Qwen 3 235B eller DeepSeek R1. Vil du kjøre noe på ett enkelt GPU? Gemma 3 27B eller Phi-4 14B. Behandler du enorme dokumenter? Llama 4 Scouts 10M-tokenkontekst er uovertruffen.

RangModellParametere (aktive)Beste forLisensMin. VRAM
no. 1Qwen 3 235B-A22B235B (22B)Resonnering + kodingApache 2.0~132 GB (Q4)
no. 2DeepSeek R1671B (37B)Dyp resonnering + matematikkMIT~136 GB (Q4)
no. 3Llama 4 Scout109B (17B)Lang kontekst (10M tokens)Llama License~55 GB (Q4)
no. 4DeepSeek V3671B (37B)Generelt formål + kodingMIT~136 GB (Q4)
no. 5Mistral Large 3675B (41B)Flerspråklig + enterpriseApache 2.0~140 GB (Q4)
no. 6Gemma 3 27B27B (27B, tett)Enkelt GPU-distribusjonÅpne vekter~16 GB (Q4)
no. 7Phi-4 Reasoning14B (14B, tett)Edge + mobile enheterMIT~8 GB (Q4)
no. 8GLM-4.7355B (32B)Agentiske kodingsarbeidsflyterMIT~130 GB (Q4)

VRAM-tallene forutsetter Q4-kvantisering. Krav for full presisjon er 2-4 ganger høyere. Hvis du er ny på å kjøre modeller lokalt, start med Gemma 3 eller Phi-4 -- de er de mest maskinvarevennlige alternativene på denne listen.

Open Source-LLM-leaderboard: rangeringer juli 2026

Per juli 2026 topper Qwen 3 235B-A22B open source-LLM-leaderboardet vårt for allsidig resonnering og koding, med DeepSeek R1 på andreplass innen dyp matematikk og Llama 4 Scout på tredjeplass innen lang kontekst. Den fullstendige rangeringen nedenfor dekker alle åtte modellene som er vurdert i denne guiden, fra datasenterrigger til bærbar-vennlige valg.

RangModellLisensBest forMin. VRAM
no. 1Qwen 3 235B-A22BApache 2.0Resonnering + koding~132 GB (Q4)
no. 2DeepSeek R1MITDyp resonnering + matematikk~136 GB (Q4)
no. 3Llama 4 ScoutLlama LicenseLang kontekst (10M tokens)~55 GB (Q4)
no. 4DeepSeek V3MITGenerelt formål + koding~136 GB (Q4)
no. 5Mistral Large 3Apache 2.0Flerspråklig + enterprise~140 GB (Q4)
no. 6Gemma 3 27BÅpne vekterEnkelt GPU-distribusjon~16 GB (Q4)
no. 7Phi-4 ReasoningMITEdge + mobile enheter~8 GB (Q4)
no. 8GLM-4.7MITAgentiske kodingsarbeidsflyter~130 GB (Q4)

Denne rangeringen gjenspeiler vår månedlige re-sjekk av benchmarks, maskinvarebehov og lisensvilkår.

La oss nå bryte ned hva som gjør hver modell verdt oppmerksomheten din.

1. Qwen 3 235B-A22B -- Beste open source-LLM totalt sett

Alibabas Qwen 3 235B-A22B er modellen å slå akkurat nå. Det er en Mixture-of-Experts-arkitektur med 235 milliarder totale parametere, men bare 22 milliarder aktiveres per token -- noe som reduserer beregningen med omtrent 90% sammenlignet med en tett modell av lignende kvalitet.

Det som skiller Qwen 3 er dens doble tenkemodus. Du kan veksle mellom en "tenkemodus" for komplekse matematikk- og kodingsproblemer (der modellen viser sin tankekjede) og en rask "ikke-tenkemodus" for raske chattsvar. Den fleksibiliteten betyr noe i produksjon.

Benchmark-høydepunkter:

BenchmarkQwen 3 235B-poengKontekst
AIME 202485,7%Matematikk på konkurransenivå
AIME 202581,5%Vanskeligere matematikkproblemer
LiveCodeBench v570,7%Virkelige kodingsoppgaver
CodeForces2 056Konkurranseprogrammering
BFCL v370,8%Funksjonskall

Disse tallene plasserer den i samme nivå som DeepSeek R1, OpenAIs o1 og Gemini 2.5 Pro -- bortsett fra at du kan laste den ned, finjustere den og distribuere den hvor du vil under Apache 2.0.

Maskinvarekrav: Den fullstendige modellen trenger omtrent 132 GB VRAM ved Q4-kvantisering. Det er et multi-GPU-oppsett -- tenk fem RTX 3090, tre A40 eller en dual-H100-rigg. Ikke billig, men godt innen rekkevidde for en oppstart eller et forskningslaboratorium. Qwen 3-familien inkluderer også mindre varianter (32B, 14B, 8B, 4B) som kjører på forbrukerhardvare.

Hvem bør bruke den: Team som trenger resonnering og koding på grensen, men ønsker å eie sin infrastruktur. Spesielt sterk for flerspråklige arbeidsbelastninger med 256K kontekst og støtte for 100+ språk. Hvis du planlegger å finjustere en modell for ditt spesifikke domene, gir Qwen 3s Apache 2.0-lisens deg full frihet.

2. DeepSeek R1 -- Beste for dyp resonnering

DeepSeek R1 endret spillet da den ble lansert tidlig i 2025, og beviste at open source-modeller kunne matche OpenAIs o1 på resonnneringsoppgaver. R1-0528-oppdateringen drev ting enda lenger -- AIME 2025-nøyaktigheten hoppet fra 70% til 87,5%.

Modellens hemmelighet er dens treningsmetodologi. DeepSeek opprettet først R1-Zero med ren forsterkningslæring uten overvåket finjusteringsoppvarming. Modellen utviklet spontant tankekjedetenkning, selvverifisering og tilbakesporingsadferd. Den lærte bokstavelig talt seg selv å sjekke sitt eget arbeid.

Benchmark-høydepunkter:

BenchmarkDeepSeek R1-poengKontekst
AIME 202587,5% (R1-0528)Matematikkolympiade
GPQA Diamond71,5%Vitenskap på postgraduatnivå
SWE-bench49,2%Virkelig programvareutvikling
HumanEval92,4%Kodegenerering

Maskinvarekrav: Samme 671B MoE-arkitektur som DeepSeek V3, så du trenger ~136 GB VRAM ved Q4. Men her er den praktiske vinkelen: DeepSeek slapp også destillerte varianter på 1,5B, 7B, 14B, 32B og 70B parametere. 32B-destillasjonen kjører på ett enkelt RTX 4090 og overgår fremdeles mange større modeller på resonnneringsoppgaver.

Hvem bør bruke den: Alle som bygger applikasjoner som krever trinnvis resonnering -- teorembevisning, kompleks kodefeilsøking, vitenskapelig analyse. De destillerte variantene er spesielt nyttige hvis du trenger resonnneringsevner med et begrenset budsjett. Sjekk ut de beste verktøyene for å kjøre LLM-er lokalt hvis du vil distribuere de mindre destillasjonene på din egen maskinvare.

3. Llama 4 Scout -- Beste for lang kontekst

Metas Llama 4 Scout brakte noe genuint nytt til open source-verdenen: et kontekstvindu på 10 millioner tokens. Det er ikke en skrivefeil. Du kan mate inn en hel kodebase, en hylle med forskningsartikler eller 20 timers videotranskripsjoner i en enkelt forespørsel.

Scout bruker 16 MoE-eksperter med bare 2 aktive per token, noe som gir den 109B totale parametere men bare 17B aktive. Meta hevder at den passer på ett enkelt H100 med INT4-kvantisering, selv om 10M-tokenkontekstvinduet åpenbart krever mer minne for KV-cachen.

Benchmark-høydepunkter:

BenchmarkLlama 4 Scout-poengKontekst
Needle-in-a-Haystack (10M)100%Perfekt gjenfinning
MMLU79,6%Generell kunnskap
HumanEval81,2%Kodegenerering
DocVQA85,1%Dokumentforståelse

Den perfekte Needle-in-a-Haystack-poengsummen ved 10M tokens er bemerkelsesverdig. De fleste modeller begynner å miste informasjon lenge før 128K. Scout bruker en ny inter-dokument-oppmerksomhetsmaskingstilnærming som opprettholder grenser mellom dokumenter selv innenfor det massive kontekstvinduet.

Maskinvarekrav: Ved Q4 trenger modellvektene omtrent 55 GB VRAM. Ett enkelt H100 (80 GB) håndterer det komfortabelt. For forbrukerhardvare kan to RTX 4090 (48 GB totalt) håndtere kortere kontekstlengder. Problemet: å faktisk bruke det fulle 10M-kontekstvinduet krever enormt KV-cacheminne i tillegg til modellvektene. I praksis begrenser de fleste egenhoste distribusjoner konteksten til 128K-256K tokens.

Hvem bør bruke den: Team som jobber med enorme dokumenter -- juridisk analyse, Q&A om kodelagre, syntese av forskningsartikler. De multimodale egenskapene (tekst + bildeinntasting) er også sterke. Vær bare realistisk om kontekstlengden: 10M-taket er ekte, men du trenger hardware på servernivå for å nå det.

4. DeepSeek V3 -- Beste generelle open source-LLM

Mens DeepSeek R1 får overskriftene for sin resonnering er DeepSeek V3 sannsynligvis den mer praktiske modellen for daglig bruk. Det er arbeidshesten -- rask, kapabel på alle fronter og bemerkelsesverdig effektiv for sin størrelse.

V3 deler den samme 671B MoE / 37B aktive arkitekturen som R1, men bytter dype resonnneringskjeder mot raskere responstider og bredere generelle evner. V3-0324-oppdateringen inkorporerte forsterkningslæringsteknikker fra R1s trening, og forbedret resonnering uten latenstreffet fra eksplisitte tankekjeder.

Benchmark-høydepunkter:

BenchmarkDeepSeek V3-poengKontekst
MMLU87,1%Generell kunnskap
HumanEval82,6%Kodegenerering
MATH90,2%Matematisk resonnering
Kontekstvindu128KStøtte for lange dokumenter

DeepSeek V3 overgår GPT-4.5 i koding og matematikkbenchmarks. Treningseffektiviteten er legendarisk -- bare 2,788 millioner H800 GPU-timer for hele forhåndsopplæringskjøringen, en brøkdel av det sammenlignbare modeller krever.

Maskinvarekrav: Identiske med R1 (~136 GB VRAM ved Q4). For praktisk distribusjon kjører GGUF-kvantiserte versjoner via llama.cpp eller Ollama på multi-GPU-forbrukerkonfigurasjoner.

Hvem bør bruke den: Hvis du trenger én modell som håndterer alt -- chat, koding, analyse, oversettelse, oppsummering -- er V3 det mest balanserte valget. Den vil ikke slå R1 på vanskelig resonnering eller Scout på kontekstlengde, men den vil overgå begge på typiske produksjonsarbeidsbelastninger der hastighet og allsidighet betyr mer enn toppbenchmarkpoeng.

5. Mistral Large 3 -- Beste for flerspråklig og enterprise-bruk

Mistral Large 3 brakte Mistral tilbake til fronten. Med 675B totale parametere (41B aktive) er det en fullstendig MoE-modell lansert under Apache 2.0 -- et enormt skifte fra Mistral Large 2s restriktive forskningslisens.

Modellen ble trent fra bunnen av på 3 000 NVIDIA H200 GPU-er, og det syns. På LMSYS Chatbot Arena rangerte den no. 2 blant åpne modeller og no. 6 totalt (inkludert proprietære). Det som gjør den spesielt interessant for europeiske team er dens flerspråklige styrke -- omtrent 85,5% nøyaktighet på en balansert flerspråklig MMLU-test.

Benchmark-høydepunkter:

BenchmarkMistral Large 3-poengKontekst
Flerspråklig MMLU85,5%Tverrspråklig kunnskap
LMSYS Arenano. 6 totaltMenneskelig preferanserangering
AIME 2025 (14B-variant)85%Matematisk resonnering
Kontekstvindu128KStøtte for lange dokumenter

Et trekk som skiller Mistral-modellene: de er trent til å si "Jeg vet ikke" i stedet for å hallusinere. Det gjør Mistral Large 3 til et sterkt valg for RAG-pipelines og enterprise-applikasjoner der faktanøyaktighet betyr mer enn kreativ produksjon.

Maskinvarekrav: Med 675B totale parametere er VRAM-kravene lik DeepSeek (~140 GB ved Q4). Mistral tilbyr også 14B Small 3-varianten, som passer på ett enkelt forbruker-GPU og presterer langt over sin vektklasse på resonnering og koding.

Hvem bør bruke den: Europeiske selskaper som trenger flerspråklige evner og datasuverenitet. Enterprise-team som bygger RAG-systemer der hallusinasjonsreduksjon er kritisk. Apache 2.0-lisensen eliminerer kommersiell friksjon fullstendig.

6. Gemma 3 27B -- Beste for enkelt GPU-distribusjon

Googles Gemma 3 27B er det søte midtpunktet mellom evne og tilgjengelighet. Med 27 milliarder parametere i en tett arkitektur kjører den på ett enkelt RTX 4090 med Q4-kvantisering. Ingen multi-GPU-rigger, ingen maskinvare på servernivå -- bare et vanlig spillkort.

Ikke la deg lure av det beskjedne parameterantallet. Gemma 3 27B presterer langt over sin vektklasse, spesielt på multimodale oppgaver. Den håndterer både tekst- og bildeinntasting, støtter 140+ språk, og 130K kontekstvinduet er generøst for en modell av denne størrelsen.

Benchmark-høydepunkter:

BenchmarkGemma 3 27B-poengKontekst
MMLU78,6%Generell kunnskap
DocVQA85,6%Dokumentforståelse
MGSM74,3%Flerspråklig matematikk
ChartQA76,3%Visuell resonnering

De multimodale poengene (DocVQA 85,6%, ChartQA 76,3%) konkurrerer med modeller som er 3-5 ganger større. For utviklere som trenger bildeforståelse uten et GPU-kluster er Gemma 3 det åpenbare valget.

Maskinvarekrav: Omtrent 16 GB VRAM ved Q4-kvantisering, 32 GB ved Q8. Ett enkelt RTX 4090 (24 GB) håndterer det komfortabelt. Selv en M2 MacBook Pro med 32 GB enhetlig minne kan kjøre det. Hvis du følger vår guide for å kjøre LLM-er lokalt, er Gemma 3 en av de enkleste modellene å starte med.

Hvem bør bruke den: Enkeltutvikling, små team og alle som ønsker en kapabel multimodal modell uten å leie sky-GPU-er. Det er også utmerket for prototyping -- test pipelinen din på Gemma 3 lokalt, og skaler deretter opp til en større modell i produksjon om nødvendig. For Googles nyere småmodell, se vår Gemma 4 12B-guide.

7. Phi-4 Reasoning -- Beste for edge og ressursbegrensede distribusjoner

Microsofts Phi-4 Reasoning beviser at parameterantall ikke er alt. Med bare 14 milliarder parametere overgår den DeepSeek R1s 70B-destillasjon på flere resonnneringsbenchmarks. Den nylig lanserte Phi-4-reasoning-vision-15B legger til multimodale evner og scorer 17% høyere enn Gemma 3 12B på matematisk-visuelle resonnneringsoppgaver.

Phi-4-familjens hemmelighet er kvaliteten på treningsdataene. Microsofts tilnærming prioriterer kuraterte, høykvalitets data fremfor rå skala, og det fungerer -- Phi-4 scorer over 80% på MATH- og MGSM-benchmarks og overgår Googles Gemini Pro og GPT-4o-mini på matematisk resonnering.

Benchmark-høydepunkter:

BenchmarkPhi-4-poengKontekst
MATH82,6%Matematisk resonnering
HumanEval82,6%Kodegenerering
MGSM80%+Flerspråklig matematikk
MathVista (vision)+17% vs Gemma 12BVisuell matematikk

Maskinvarekrav: Omtrent 8 GB VRAM ved Q4 -- det er et laptop-GPU eller til og med et eldre skrivebordskort. Modellen kjører komfortabelt på Apple Silicon MacBooks, noe som gjør den genuint bærbar. For edge-distribusjon er den en av de få modellene som kan kjøre on-device med rimelig forsinkelse.

Hvem bør bruke den: Mobil- og edge-utviklere, team som bygger on-device AI-funksjoner og alle som trenger sterk resonnering på minimal maskinvare. Phi-4 er også et godt valg for å evaluere finjusterte modeller siden den lille størrelsen gjør treningsitersjoner raske og billige. MIT-lisensen betyr ingen kommersielle begrensninger.

8. GLM-4.7 -- Beste for agentisk koding

Z.ais GLM-4.7 er spesialbygget for ett spesifikt brukstilfelle: agentiske kodingsarbeidsflyter der modellen trenger å resonnere, bruke verktøy og opprettholde kontekst på tvers av lange flertrinnssinteraksjoner.

Arkitekturen er en 355B MoE med 32B aktive parametere, men den fremtredende funksjonen er dens tretrinns tenkesystem. I motsetning til de fleste modeller som starter opp resonnneringsprosessen på nytt hver tur, beholder GLM-4.7 tankeblokker gjennom hele samtalen. Den vedvarende resonnneringskonteksten gjør en virkelig forskjell når modellen orkestrerer komplekse flertrinnskodings­oppgaver.

Benchmark-høydepunkter:

BenchmarkGLM-4.7-poengKontekst
SWE-bench73,8%Virkelig programvareutvikling
HumanEval94,2%Kodegenerering
Kontekstvindu200KLange interaksjoner
Maks. utdata131K tokensUtvidet generering

Den 73,8% SWE-bench-poengsummen er konkurransedyktig med Claude Sonnet 4.5 -- på virkelige programvareingenjøroppgaver, ikke syntetiske benchmarks. Og 94,2% HumanEval er den høyeste for enhver modell på denne listen.

Maskinvarekrav: Ligner på andre store MoE-modeller (~130 GB VRAM ved Q4). 200K kontekstvinduet og 131K maks. utdata gjør det minnehungrig under lange agentiske sesjoner.

Hvem bør bruke den: AI-støttede utviklingsteam som bygger kodingsagenter, automatiserte feilsøkingsverktøy eller kodegjennomgangssystemer. Hvis du velger finjusteringsverktøy for en kodingsfokusert modell, er GLM-4.7 et sterkt grunnlag. MIT-lisensen tillater full kommersiell bruk.

Beste open source-LLM for koding (juli 2026)

For koding i juli 2026 er GLM-4.7 det ledende open source-valget, med 94,2% på HumanEval og 73,8% på SWE-bench -- konkurransedyktig med Claude Sonnet 4.5 på virkelige programvareoppgaver. Vil du ha en sterk kodingsmodell på forbrukerhardvare? DeepSeek R1 32B-destillasjonen kjører på ett enkelt RTX 4090.

Vurderer du den nyere GLM-utgivelsen? Se vår gjennomgang av GLM 5.2 for hvordan den sammenlignes.

Hvordan velge: beslutningsramme

Den "beste" modellen avhenger helt av begrensningene dine. Bruk denne matrisen for å innsnevre beslutningen.

Hvis du trenger...VelgHvorfor
Beste totale resonneringQwen 3 235BTopp matematikk, kode og generelle benchmarks
Dyp tankekjedeDeepSeek R1Selvreparerende resonnering, 87,5% AIME
Enormt kontekstvinduLlama 4 Scout10M tokens, perfekt gjenfinning
Rask og generellDeepSeek V3Beste hastighets-kvalitetsforhold
Flerspråklig enterpriseMistral Large 385,5% flerspråklig MMLU, anti-hallusinasjon
Enkelt forbruker-GPUGemma 3 27B16 GB VRAM, sterk multimodal
Laptop eller edge-enhetPhi-4 14B8 GB VRAM, MIT-lisens
KodingsagenterGLM-4.794,2% HumanEval, vedvarende resonnering

Fortsatt usikker? Start her: Har du multi-GPU-maskinvare? Hvis nei er valgene dine Gemma 3 og Phi-4. Hvis ja, bygger du en kodingsagent? Velg GLM-4.7 eller DeepSeek R1. Trenger du lang kontekst? Llama 4 Scout. Alt annet? Qwen 3 235B er det sikreste standardvalget.

Hvordan vi rangerte disse modellene

Rangeringene er ikke basert på ett enkelt benchmark. Hver modell ble evaluert på fem dimensjoner:

  1. Benchmark-ytelse -- MMLU, HumanEval, AIME, SWE-bench og domene-spesifikke tester
  2. Maskinvaretilgjengelighet -- Kan ekte team faktisk distribuere den?
  3. Lisensfrihet -- Apache 2.0 og MIT får høyere poeng enn restriktive lisenser
  4. Økosystemsmodenhet -- Tilgjengelig på Hugging Face, Ollama, vLLM og store inferensmotorer
  5. Virkelig adopsjon -- Aktivt fellesskap, produksjonsdistribusjoner, pågående oppdateringer

Modeller som gjør det bra på benchmarks men krever et GPU-kluster som ingen har (dere vet hvilke, 671B full presisjon) straffes. Modeller med restriktive lisenser som blokkerer kommersiell bruk mister også poeng. Målet er praktisk verdi, ikke skryt om leaderboard-plasseringer.

Hvis du vil teste disse modellene selv, forklarer vår LLM-evalueringsguide hvordan du setter opp systematiske benchmarks, og oppsummeringen av beste evalueringsverktøy dekker rammeverkene du vil trenge.

Å velge verktøy er den enkle delen. Å få det til å kjøre stabilt i et ekte produkt er der de fleste team står fast, og det er akkurat det vårt AI-integrasjonsteam bygger for kundene, fra RAG-pipelines til skreddersydde agenter. Vil du ha en ny vurdering av oppsettet ditt? Få en gratis konsultasjon.

Vanlige spørsmål

Hvilke er de nyeste open source-LLM-ene i 2026?

2026-fronten ledes av Qwen 3 (Alibaba), DeepSeek R1 og V3, Llama 4 Scout (Meta), Mistral Large 3 og GLM-4.7 (Z.ai). Punktoppdateringer som DeepSeek R1-0528 og Phi-4 reasoning-vision-varianten kom i løpet av midten av 2026. Vi sjekker denne listen månedlig og oppdaterer rangeringen når en ny versjon endrer rekkefølgen.

Hvor ofte oppdateres dette open source-LLM-leaderboardet?

Månedlig. Vi re-verifiserer benchmarkpoeng, VRAM-krav og lisenser ved starten av hver måned og legger til nye modeller etter hvert som de lanseres. Datoen "Sist oppdatert" under tittelen gjenspeiler den siste gjennomgangen.

Hva er den beste open source-LLM-en i 2026?

Qwen 3 235B-A22B leder for øyeblikket på det bredeste spekteret av benchmarks og kombinerer førsteklasses resonnering, koding og flerspråklige evner under en Apache 2.0-lisens. For spesifikke brukstilfeller kan DeepSeek R1 (resonnering) og Llama 4 Scout (lang kontekst) være bedre valg.

Kan jeg kjøre open source-LLM-er på forbrukerhardvare?

Ja. Gemma 3 27B kjører på ett enkelt RTX 4090 (24 GB VRAM) og Phi-4 14B passer på et laptop-GPU med 8 GB. Kvantiserte versjoner (Q4, Q8) av større modeller fungerer også på multi-GPU-forbrukerkonfigurasjoner med verktøy som Ollama og llama.cpp.

Er open source-LLM-er like gode som ChatGPT eller Claude?

På koding og matematikkbenchmarks matcher eller overgår de beste open source-modellene GPT-4.5 og nærmer seg Claude Sonnet 4.5-ytelsen. Gapet er minst på strukturerte oppgaver (kode, matematikk, resonnering) og størst på kreativ skriving og nyansert instruksjonsoppfølging.

Hva betyr MoE (Mixture-of-Experts) for maskinvaren?

MoE-modeller har et stort totalt parameterantall, men aktiverer bare en brøkdel per token. Hele modellen må imidlertid lastes inn i minnet slik at ruteren kan velge eksperter. En 235B MoE-modell med 22B aktive trenger fortsatt 235B verdi av VRAM -- du sparer ikke minne, du sparer beregning.

Hvilken open source-LLM er best for koding?

GLM-4.7 leder med 94,2% HumanEval og 73,8% SWE-bench. For ren kodegenerering er DeepSeek R1 og Qwen 3 235B rett bak. For koding på forbrukerhardvare er DeepSeek R1 32B-destillasjonen det beste forholdet mellom evner og kostnad.

Er Llama 4 Scouts 10 millioner tokeners kontekst virkelig ekte?

Arkitekturen støtter det, og Meta demonstrerte perfekt Needle-in-a-Haystack-gjenfinning ved 10M tokens. Men å faktisk bruke den fulle konteksten krever enormt KV-cacheminne. De fleste egenhoste distribusjoner begrenser realistisk konteksten til 128K-256K tokens. Skyleverandører som Together AI og Fireworks tilbyr lengre kontekstvinduer.

Hvilken lisens bør jeg se etter i en open source-LLM?

Apache 2.0 og MIT er de mest permissive -- full kommersiell bruk, modifikasjon og redistribusjon. Llamas tilpassede lisens tillater kommersiell bruk, men har begrensninger for apper med 700M+ brukere. Noen "open-weight"-modeller (som Gemma) har spesifikke vilkår -- les alltid lisensen før produksjonsdistribusjon.

Hvor mye VRAM trenger jeg for en 70B-modell?

Med Q4-kvantisering trenger en tett 70B-modell omtrent 35-40 GB VRAM. Ett enkelt A100 (80 GB) håndterer det enkelt, eller to RTX 4090 (48 GB totalt). Med full presisjon (BF16) er du på 140+ GB -- noe som effektivt krever fire A100 eller tilsvarende.

Kan jeg finjustere open source-LLM-er for mitt brukstilfelle?

Absolutt. QLoRA gjør det mulig å finjustere en 70B-modell på ett enkelt 24 GB GPU. Mindre modeller som Phi-4 og Gemma 3 er enda mer tilgjengelige for finjusteringseksperimenter. Apache 2.0 og MIT-lisensierte modeller har ingen begrensninger på avledede verk.

Hva med open source multimodale LLM-er?

Gemma 3 27B og Llama 4 Scout håndterer begge tekst og bildeinntasting innebygd. Phi-4-reasoning-vision-15B legger til visuell resonnering i en mindre skala. For videoforståelse støtter Llama 4 Scout opptil 20 timer med videoinntasting innenfor kontekstvinduet sitt.

Hva er den beste open source-LLM-en akkurat nå?

Akkurat nå er Qwen 3 235B-A22B den beste open source-LLM-en totalt sett, og leder på resonnering og koding under en Apache 2.0-lisens. For ett enkelt forbruker-GPU er Gemma 3 27B (16 GB VRAM) toppvalget, og GLM-4.7 vinner for kodingsagenter med 94,2% HumanEval.

Finnes det et open source LLM-leaderboard?

Ja. Vårt leaderboard for juli 2026 ovenfor rangerer alle åtte modellene i denne guiden, og Hugging Face er vertskap for det fellesskapsdrevne Open LLM Leaderboard for bredere dekning. Vi re-verifiserer rangeringene våre månedlig mot benchmarks som MMLU, HumanEval, AIME og SWE-bench.

Kilder

Emneord

beste open source llm 2026open source llmllama 4qwen 3deepseekgemma 3phi-4egenhosted llmlokal llm

Del denne artikkelen

Kom i gang

Klar til å bygge noe ekstraordinært?

La oss gjøre visjonen din til virkelighet. Teamet vårt er klart til å hjelpe deg med å lage programvare som utgjør en forskjell.