
Bedste open source-LLM 2026: Vi testede 8 — kun 3 slog GPT-4-klassen
Senest opdateret: 5. juli 2026. Alle benchmark-score, VRAM-tal og licenser i denne guide blev gennemtjekt igen til denne opdatering. Rangeringen nedenfor afspejler open weight-modeller udgivet frem til midten af 2026 — hvis en ny udgivelse ændrer rækkefølgen, opdateres denne side inden for en måned.
Den bedste open source-LLM i 2026 er Qwen 3 235B-A22B til overordnet ræsonnement og kodning, mens DeepSeek R1 fører inden for dyb matematisk ræsonnering og Llama 4 Scout inden for lang kontekst (10M tokens). Til et enkelt forbrugergrafikkort er Gemma 3 27B (16 GB VRAM) og Phi-4 14B (8 GB) de nemmeste at self-hoste. Alle tre topmodeller matcher GPT-4-klasse-ydelse på kode og matematik, mens de forbliver gratis at udrulle.
Førende open source-LLM'er: Benchmark-øjebliksbillede
Tabellen nedenfor dækker fem bredt udbredte open source-modeller scoret på standard offentlige benchmarks. MMLU måler bred generel viden; HumanEval måler beståelsesrate for kodegenerering.
| Model | Parametre | Udgivelse | MMLU | HumanEval | Licens | Bedst til |
|---|---|---|---|---|---|---|
| Llama 3.3 70B | 70B | dec. 2024 | 86,0 | 88,4 | Llama 3.3 Community | Generel brug, flersproget |
| Qwen 2.5 72B | 72B | sep. 2024 | 85,0+ | 86,6 | Qwen License | Matematik, kodning, instruktionsfølge |
| DeepSeek-V3 | 671B (37B aktive) | dec. 2024 | 87,1 | 82,6 | MIT | Generel brug, kodning, omkostningseffektiv |
| Mistral Small 3.1 | 24B | mar. 2025 | 80,6 | 88,4 | Apache 2.0 | Agentiske workflows, vision, flersproget |
| Gemma 3 27B | 27B | mar. 2025 | ~78,6 | 87,8 | Gemma Terms of Use | Single-GPU-udrulning, multimodal |
Vi opdaterer denne tabel månedligt.
Open source-LLM'er "konkurrerer" ikke længere blot med proprietære modeller — inden for kodning, matematik og lang-kontekst-opgaver vinder de. Kløften mellem en API-regning på 200 $/måned og en self-hostet åben model har aldrig været mindre.
Denne rangering skærer gennem hypen. Alle modeller her evalueres på de benchmarks, der betyder noget, den hardware du faktisk får brug for, og det specifikke brugsscenarie, hvor hver enkelt skinner mest.
Hurtigt overblik: Hvilken open source-LLM skal du vælge?
Brug for det absolut bedste ræsonnement? Vælg Qwen 3 235B eller DeepSeek R1. Vil du køre noget på et enkelt GPU? Gemma 3 27B eller Phi-4 14B. Behandler enorme dokumenter? Llama 4 Scouts 10M token-kontekst er uden sidestykke.
| Plads | Model | Parametre (aktive) | Bedst til | Licens | Min. VRAM |
|---|---|---|---|---|---|
| nr. 1 | Qwen 3 235B-A22B | 235B (22B) | Ræsonnement + kodning | Apache 2.0 | ~132 GB (Q4) |
| nr. 2 | DeepSeek R1 | 671B (37B) | Dyb ræsonnering + matematik | MIT | ~136 GB (Q4) |
| nr. 3 | Llama 4 Scout | 109B (17B) | Lang kontekst (10M tokens) | Llama License | ~55 GB (Q4) |
| nr. 4 | DeepSeek V3 | 671B (37B) | Generel brug + kodning | MIT | ~136 GB (Q4) |
| nr. 5 | Mistral Large 3 | 675B (41B) | Flersproget + enterprise | Apache 2.0 | ~140 GB (Q4) |
| nr. 6 | Gemma 3 27B | 27B (27B, dense) | Single-GPU-udrulning | Open weights | ~16 GB (Q4) |
| nr. 7 | Phi-4 Reasoning | 14B (14B, dense) | Edge + mobilenheder | MIT | ~8 GB (Q4) |
| nr. 8 | GLM-4.7 | 355B (32B) | Agentiske kodningsworkflows | MIT | ~130 GB (Q4) |
VRAM-tallene forudsætter Q4-kvantisering. Kravene ved fuld præcision er 2-4x højere. Hvis du er ny i at køre modeller lokalt, så start med Gemma 3 eller Phi-4 -- de er de mest hardwarevenlige muligheder på denne liste.
Open source-LLM-rangliste: juli 2026-placeringer
Pr. juli 2026 topper Qwen 3 235B-A22B vores open source-LLM-rangliste for alsidigt ræsonnement og kodning, med DeepSeek R1 som nummer to inden for dyb matematik og Llama 4 Scout som nummer tre inden for lang kontekst. Den fulde rangering nedenfor dækker alle otte modeller scoret i denne guide, fra datacenter-rigs til bærbaregnede valg.
| Plads | Model | Licens | Bedst til | Min. VRAM |
|---|---|---|---|---|
| nr. 1 | Qwen 3 235B-A22B | Apache 2.0 | Ræsonnement + kodning | ~132 GB (Q4) |
| nr. 2 | DeepSeek R1 | MIT | Dyb ræsonnering + matematik | ~136 GB (Q4) |
| nr. 3 | Llama 4 Scout | Llama License | Lang kontekst (10M tokens) | ~55 GB (Q4) |
| nr. 4 | DeepSeek V3 | MIT | Generel brug + kodning | ~136 GB (Q4) |
| nr. 5 | Mistral Large 3 | Apache 2.0 | Flersproget + enterprise | ~140 GB (Q4) |
| nr. 6 | Gemma 3 27B | Open weights | Single-GPU-udrulning | ~16 GB (Q4) |
| nr. 7 | Phi-4 Reasoning | MIT | Edge + mobilenheder | ~8 GB (Q4) |
| nr. 8 | GLM-4.7 | MIT | Agentiske kodningsworkflows | ~130 GB (Q4) |
Disse placeringer afspejler vores månedlige gennemtjek af benchmarks, hardwarekrav og licensvilkår.
Lad os nu bryde ned, hvad der gør hver model værd at lægge mærke til.
1. Qwen 3 235B-A22B, bedste open source-LLM samlet set
Alibabas Qwen 3 235B-A22B er modellen, man skal slå lige nu. Det er en Mixture-of-Experts-arkitektur med 235 milliarder parametre i alt, men kun 22 milliarder aktiveres per token, hvilket skærer beregningen ned med cirka 90 % sammenlignet med en dense-model af tilsvarende kvalitet.
Det, der adskiller Qwen 3, er dens dual-mode tænkning. Du kan skifte mellem en "tænketilstand" til komplekse matematik- og kodningsproblemer (hvor modellen viser sin tankekæde) og en hurtig "ikke-tænketilstand" til hurtige chatsvar. Den fleksibilitet betyder noget i produktion.
Benchmark-højdepunkter:
| Benchmark | Qwen 3 235B-score | Kontekst |
|---|---|---|
| AIME 2024 | 85,7 % | Matematik på konkurrenceniveau |
| AIME 2025 | 81,5 % | Sværere matematikopgaver |
| LiveCodeBench v5 | 70,7 % | Reelle kodningsopgaver |
| CodeForces | 2.056 | Konkurrenceprogrammering |
| BFCL v3 | 70,8 % | Funktionskald |
Disse tal placerer den i samme klasse som DeepSeek R1, OpenAIs o1 og Gemini 2.5 Pro — bortset fra at du kan downloade den, finjustere den og udrulle den, hvor du vil, under Apache 2.0.
Hardwarekrav: Den fulde model kræver cirka 132 GB VRAM ved Q4-kvantisering. Det er en multi-GPU-opsætning — tænk fem RTX 3090'ere, tre A40'er eller en dual-H100-rig. Ikke billigt, men inden for rækkevidde for en startup eller et forskningslab. Qwen 3-familien inkluderer også mindre varianter (32B, 14B, 8B, 4B), der kører på forbrugerhardware.
Hvem bør bruge den: Teams, der har brug for ræsonnement og kodning på frontier-niveau, men som vil eje deres infrastruktur. Den er særligt stærk til flersprogede workloads med 256K-kontekst og understøttelse af 100+ sprog. Hvis du planlægger at finjustere en model til dit specifikke domæne, giver Qwen 3's Apache 2.0-licens dig fuld frihed.
2. DeepSeek R1 -- bedst til dyb ræsonnering
DeepSeek R1 ændrede spillet, da den udkom i begyndelsen af 2025, og beviste, at open source-modeller kunne matche OpenAIs o1 på ræsonneringsopgaver. R1-0528-opdateringen skubbede tingene endnu længere — AIME 2025-nøjagtigheden sprang fra 70 % til 87,5 %.
Modellens hemmelige våben er dens træningsmetodik. DeepSeek skabte først R1-Zero ved hjælp af ren reinforcement learning uden supervised fine-tuning-opvarmning. Modellen udviklede spontant tankekæde-ræsonnement, selvverifikation og backtracking-adfærd. Den lærte bogstaveligt talt sig selv at tjekke sit eget arbejde.
Benchmark-højdepunkter:
| Benchmark | DeepSeek R1-score | Kontekst |
|---|---|---|
| AIME 2025 | 87,5 % (R1-0528) | Matematikolympiade |
| GPQA Diamond | 71,5 % | Videnskab på kandidatniveau |
| SWE-bench | 49,2 % | Reel software engineering |
| HumanEval | 92,4 % | Kodegenerering |
Hardwarekrav: Samme 671B MoE-arkitektur som DeepSeek V3, så du kigger på ~136 GB VRAM ved Q4. Men her er den praktiske vinkel: DeepSeek udgav også destillerede varianter på 1,5B, 7B, 14B, 32B og 70B parametre. 32B-destillatet kører på en enkelt RTX 4090 og overgår stadig mange større modeller på ræsonneringsopgaver.
Hvem bør bruge den: Alle, der bygger applikationer, der kræver trin-for-trin-ræsonnement, teorembevis, kompleks kodefejlfinding, videnskabelig analyse. De destillerede varianter er særligt nyttige, hvis du har brug for ræsonneringsevner på et budget. Tjek de bedste værktøjer til at køre LLM'er lokalt, hvis du vil udrulle de mindre destillater på din egen hardware.
3. Llama 4 Scout, bedst til lang kontekst
Metas Llama 4 Scout bragte noget ægte nyt til open source-verdenen: et kontekstvindu på 10 millioner tokens. Det er ikke en tastefejl. Du kan fodre den en hel kodebase, en hylde af forskningsartikler eller 20 timers videotransskription i en enkelt prompt.
Scout bruger 16 MoE-eksperter med kun 2 aktive per token, hvilket giver den 109B parametre i alt, men kun 17B aktive. Meta hævder, at den passer på en enkelt H100 med INT4-kvantisering, selvom 10M-kontekstvinduet selvfølgelig kræver mere hukommelse til KV-cachen.
Benchmark-højdepunkter:
| Benchmark | Llama 4 Scout-score | Kontekst |
|---|---|---|
| Needle-in-a-Haystack (10M) | 100 % | Perfekt genfinding |
| MMLU | 79,6 % | Generel viden |
| HumanEval | 81,2 % | Kodegenerering |
| DocVQA | 85,1 % | Dokumentforståelse |
Den perfekte Needle-in-a-Haystack-score ved 10M tokens er bemærkelsesværdig. De fleste modeller begynder at miste information længe før 128K. Scout bruger en ny tilgang til inter-dokument attention-masking, der opretholder grænser mellem dokumenter selv inden for dens enorme kontekstvindu.
Hardwarekrav: Ved Q4 kræver modelvægtene cirka 55 GB VRAM. En enkelt H100 (80 GB) håndterer det komfortabelt. Til forbrugerhardware kan to RTX 4090'ere (48 GB i alt) klare kortere kontekstlængder. Hagen: at faktisk bruge det fulde 10M-kontekstvindu kræver enorm KV-cache-hukommelse oven i modelvægtene. I praksis topper de fleste self-hostede udrulninger ved 128K-256K tokens.
Hvem bør bruge den: Teams, der arbejder med enorme dokumenter, juridisk analyse, kodebase-Q&A, syntese af forskningsartikler. De multimodale evner (tekst + billede-input) er også stærke. Vær bare realistisk om kontekstlængden: 10M-loftet er reelt, men du får brug for hardware i serverklassen for at nå det.
4. DeepSeek V3 -- bedste generelle open source-LLM
Mens DeepSeek R1 får overskrifterne for ræsonnement, er DeepSeek V3 nok den mere praktiske model til hverdagsbrug. Den er arbejdshesten — hurtig, alsidig på tværs og bemærkelsesværdigt effektiv af sin størrelse.
V3 deler den samme 671B MoE / 37B aktive-arkitektur som R1, men bytter dybe ræsonneringskæder ud med hurtigere svartider og bredere generelle evner. V3-0324-opdateringen inkorporerede reinforcement learning-teknikker fra R1's træning, hvilket booster ræsonnement uden latenstabet ved eksplicit tankekæde.
Benchmark-højdepunkter:
| Benchmark | DeepSeek V3-score | Kontekst |
|---|---|---|
| MMLU | 87,1 % | Generel viden |
| HumanEval | 82,6 % | Kodegenerering |
| MATH | 90,2 % | Matematisk ræsonnement |
| Kontekstvindu | 128K | Understøttelse af lange dokumenter |
DeepSeek V3 overgår GPT-4.5 i kodnings- og matematik-benchmarks. Dens træningseffektivitet er legendarisk — kun 2,788 millioner H800 GPU-timer for den fulde prætræningskørsel, en brøkdel af hvad sammenlignelige modeller kræver.
Hardwarekrav: Identiske med R1 (~136 GB VRAM ved Q4). Til praktisk udrulning kører de GGUF-kvantiserede versioner via llama.cpp eller Ollama på multi-GPU-forbrugeropsætninger.
Hvem bør bruge den: Hvis du har brug for én model, der håndterer alt — chat, kodning, analyse, oversættelse, opsummering — er V3 det mest afbalancerede valg. Den slår ikke R1 på hård ræsonnering eller Scout på kontekstlængde, men den overgår begge på typiske produktionsworkloads, hvor hastighed og alsidighed betyder mere end top-benchmark-score.
5. Mistral Large 3 -- bedst til flersproget og enterprise-brug
Mistral Large 3 bragte Mistral tilbage til fronten. Med 675B parametre i alt (41B aktive) er det en fuld MoE-model udgivet under Apache 2.0 -- et kæmpe skift fra Mistral Large 2's restriktive forskningslicens.
Modellen blev trænet fra bunden på 3.000 NVIDIA H200 GPU'er, og det kan ses. På LMSYS Chatbot Arena rangerede den som nr. 2 blandt åbne modeller og nr. 6 samlet (inklusive proprietære). Det, der gør den særligt interessant for europæiske teams, er dens flersprogede styrke — cirka 85,5 % nøjagtighed på en afbalanceret flersproget MMLU-test.
Benchmark-højdepunkter:
| Benchmark | Mistral Large 3-score | Kontekst |
|---|---|---|
| Flersproget MMLU | 85,5 % | Viden på tværs af sprog |
| LMSYS Arena | nr. 6 samlet | Menneskelig præference-rangering |
| AIME 2025 (14B-variant) | 85 % | Matematisk ræsonnement |
| Kontekstvindu | 128K | Understøttelse af lange dokumenter |
Et træk, der adskiller Mistral-modeller: de er trænet til at sige "jeg ved det ikke" frem for at hallucinere. Det gør Mistral Large 3 til et stærkt match til RAG-pipelines og enterprise-applikationer, hvor faktuel nøjagtighed betyder mere end kreativt output.
Hardwarekrav: Med 675B parametre i alt minder VRAM-behovet om DeepSeek (~140 GB ved Q4). Mistral tilbyder også 14B Small 3-varianten, som passer på et enkelt forbruger-GPU og slår langt over sin vægtklasse på ræsonnement og kodning.
Hvem bør bruge den: Europæiske virksomheder, der har brug for flersprogede evner og datasuverænitet. Enterprise-teams, der bygger RAG-systemer, hvor reduktion af hallucinationer er afgørende. Apache 2.0-licensen fjerner kommerciel friktion helt.
6. Gemma 3 27B, bedst til single-GPU-udrulning
Googles Gemma 3 27B er det søde punkt mellem evner og tilgængelighed. Med 27 milliarder parametre i en dense-arkitektur kører den på en enkelt RTX 4090 med Q4-kvantisering. Ingen multi-GPU-rigs, ingen serverklasse-hardware — bare et almindeligt gaming-kort.
Lad dig ikke narre af det beskedne parameterantal. Gemma 3 27B slår langt over sin vægtklasse, især på multimodale opgaver. Den håndterer både tekst- og billede-input, understøtter 140+ sprog, og dens 130K-kontekstvindu er generøst for en model i denne størrelse.
Benchmark-højdepunkter:
| Benchmark | Gemma 3 27B-score | Kontekst |
|---|---|---|
| MMLU | 78,6 % | Generel viden |
| DocVQA | 85,6 % | Dokumentforståelse |
| MGSM | 74,3 % | Flersproget matematik |
| ChartQA | 76,3 % | Visuelt ræsonnement |
De multimodale scorer (DocVQA 85,6 %, ChartQA 76,3 %) konkurrerer med modeller, der er 3-5x større. For udviklere, der har brug for billedforståelse uden en GPU-klynge, er Gemma 3 det oplagte valg.
Hardwarekrav: Cirka 16 GB VRAM ved Q4-kvantisering, 32 GB ved Q8. En enkelt RTX 4090 (24 GB) håndterer det komfortabelt. Selv en M2 MacBook Pro med 32 GB forenet hukommelse kan køre den. Hvis du følger vores guide til at køre LLM'er lokalt, er Gemma 3 en af de nemmeste modeller at starte med.
Hvem bør bruge den: Soloudviklere, små teams og alle, der vil have en alsidig multimodal model uden at leje cloud-GPU'er. Den er også fremragende til prototyping — test din pipeline på Gemma 3 lokalt, og opskalér derefter til en større model i produktion om nødvendigt. For Googles nyere lille model, se vores Gemma 4 12B-guide.
7. Phi-4 Reasoning, bedst til edge og ressourcebegrænset udrulning
Microsofts Phi-4 Reasoning beviser, at parameterantal ikke er alt. Med blot 14 milliarder parametre overgår den DeepSeek R1's 70B-destillat på adskillige ræsonneringsbenchmarks. Den nyligt udgivne Phi-4-reasoning-vision-15B tilføjer multimodale evner og scorer 17 % højere end Gemma 3 12B på matematisk-visuelle ræsonneringsopgaver.
Phi-4-familiens hemmelighed er træningsdatakvalitet. Microsofts tilgang prioriterer kuraterede data af høj kvalitet frem for rå skala, og det virker — Phi-4 scorer over 80 % på MATH- og MGSM-benchmarks og overgår Googles Gemini Pro og GPT-4o-mini på matematisk ræsonnement.
Benchmark-højdepunkter:
| Benchmark | Phi-4-score | Kontekst |
|---|---|---|
| MATH | 82,6 % | Matematisk ræsonnement |
| HumanEval | 82,6 % | Kodegenerering |
| MGSM | 80 %+ | Flersproget matematik |
| MathVista (vision) | +17 % vs. Gemma 12B | Visuel matematik |
Hardwarekrav: Omkring 8 GB VRAM ved Q4 -- det er en bærbar-GPU eller endda et ældre desktop-kort. Modellen kører komfortabelt på Apple Silicon MacBooks, hvilket gør den ægte portabel. Til edge-udrulning er den en af de få modeller, der kan køre on-device med rimelig latenstid.
Hvem bør bruge den: Mobil- og edge-udviklere, teams, der bygger on-device AI-funktioner, og alle, der har brug for stærk ræsonnering på minimal hardware. Phi-4 er også et godt valg til evaluering af finjusterede modeller, da dens lille størrelse gør træningsiterationer hurtige og billige. MIT-licensen betyder ingen kommercielle begrænsninger.
8. GLM-4.7 -- bedst til agentisk kodning
Z.ais GLM-4.7 er specialbygget til et specifikt brugsscenarie: agentiske kodningsworkflows, hvor modellen skal ræsonnere, bruge værktøjer og opretholde kontekst på tværs af lange multitrins-interaktioner.
Dens arkitektur er en 355B MoE med 32B aktive parametre, men den fremtrædende funktion er dens tre-trins tænkesystem. I modsætning til de fleste modeller, der genstarter deres ræsonneringsproces hver tur, bevarer GLM-4.7 tankeblokke på tværs af hele samtalen. Den vedvarende ræsonneringskontekst gør en reel forskel, når modellen orkestrerer komplekse multitrins-kodningsopgaver.
Benchmark-højdepunkter:
| Benchmark | GLM-4.7-score | Kontekst |
|---|---|---|
| SWE-bench | 73,8 % | Reel software engineering |
| HumanEval | 94,2 % | Kodegenerering |
| Kontekstvindu | 200K | Lange interaktioner |
| Maks. output | 131K tokens | Udvidet generering |
Den 73,8 % SWE-bench-score er konkurrencedygtig med Claude Sonnet 4.5 -- på reelle software engineering-opgaver, ikke syntetiske benchmarks. Og 94,2 % HumanEval er den højeste af alle modeller på denne liste.
Hardwarekrav: Minder om andre store MoE-modeller (~130 GB VRAM ved Q4). 200K-kontekstvinduet og 131K maks. output gør den hukommelsessulten under lange agentiske sessioner.
Hvem bør bruge den: AI-assisterede udviklingsteams, der bygger kodningsagenter, automatiserede fejlfindingsværktøjer eller kodegennemgangssystemer. Hvis du vælger finjusteringsværktøjer til en kodningsfokuseret model, er GLM-4.7 en stærk base. MIT-licensen betyder fuld kommerciel brug.
Bedste open source-LLM til kodning (juli 2026)
Til kodning i juli 2026 er GLM-4.7 det bedste open source-valg med en score på 94,2 % på HumanEval og 73,8 % på SWE-bench — konkurrencedygtig med Claude Sonnet 4.5 på reelle softwareopgaver. Vil du have en stærk kodningsmodel på forbrugerhardware? DeepSeek R1 32B-destillatet kører på en enkelt RTX 4090.
Overvejer du den nyere GLM-udgivelse? Se vores GLM 5.2-gennemgang for, hvordan den sammenligner.
Sådan vælger du: Beslutningsramme
Den "bedste" model afhænger helt af dine begrænsninger. Brug denne matrix til at indsnævre din beslutning.
| Hvis du har brug for... | Vælg | Hvorfor |
|---|---|---|
| Bedste overordnede ræsonnement | Qwen 3 235B | Top-matematik, kode og generelle benchmarks |
| Dyb tankekæde | DeepSeek R1 | Selvkorrigerende ræsonnement, 87,5 % AIME |
| Enormt kontekstvindu | Llama 4 Scout | 10M tokens, perfekt genfinding |
| Hurtig generel | DeepSeek V3 | Bedste hastighed-til-kvalitet-forhold |
| Flersproget enterprise | Mistral Large 3 | 85,5 % flersproget MMLU, anti-hallucination |
| Enkelt forbruger-GPU | Gemma 3 27B | 16 GB VRAM, stærk multimodal |
| Bærbar eller edge-enhed | Phi-4 14B | 8 GB VRAM, MIT-licens |
| Kodningsagenter | GLM-4.7 | 94,2 % HumanEval, vedvarende ræsonnement |
Stadig usikker? Start her: Har du multi-GPU-hardware? Hvis nej, er dine valg Gemma 3 og Phi-4. Hvis ja, bygger du så en kodningsagent? Vælg GLM-4.7 eller DeepSeek R1. Brug for lang kontekst? Llama 4 Scout. Alt andet? Qwen 3 235B er det sikreste standardvalg.
Sådan rangerede vi disse modeller
Rangeringer er ikke baseret på en enkelt benchmark. Hver model blev evalueret på tværs af fem dimensioner:
- Benchmark-ydelse -- MMLU, HumanEval, AIME, SWE-bench og domænespecifikke test
- Hardwaretilgængelighed -- Kan reelle teams faktisk udrulle den?
- Licensfrihed -- Apache 2.0 og MIT scorer højere end restriktive licenser
- Økosystemmodenhed -- Tilgængelig på Hugging Face, Ollama, vLLM og større inferensmotorer
- Reel adoption -- Aktivt fællesskab, produktionsudrulninger, løbende opdateringer
Modeller, der scorer godt på benchmarks, men kræver en GPU-klynge, ingen har (vi kigger på dig, 671B fuld præcision), straffes. Modeller med restriktive licenser, der blokerer kommerciel brug, mister også point. Målet er praktisk værdi, ikke rangliste-praleri.
Hvis du selv vil teste disse modeller, gennemgår vores LLM-evalueringsguide opsætning af systematiske benchmarks, og de bedste evalueringsværktøjer-rundskriv dækker de frameworks, du får brug for.
FAQ
Hvad er de nyeste open source-LLM'er i 2026?
2026-fronten anføres af Qwen 3 (Alibaba), DeepSeek R1 og V3, Llama 4 Scout (Meta), Mistral Large 3 og GLM-4.7 (Z.ai). Punktudgivelser som DeepSeek R1-0528 og Phi-4 reasoning-vision-varianten ankom frem til midten af 2026. Vi gennemtjekker denne liste månedligt og opdaterer ranglisten, når en ny udgivelse ændrer rangeringen.
Hvor ofte opdateres denne open source-LLM-rangliste?
Månedligt. Vi gennemtjekker benchmark-score, VRAM-krav og licenser i begyndelsen af hver måned og tilføjer nye modeller, efterhånden som de udkommer. "Senest opdateret"-datoen under titlen afspejler den seneste gennemgang.
Hvad er den bedste open source-LLM i 2026?
Qwen 3 235B-A22B fører i øjeblikket på det bredeste udvalg af benchmarks og kombinerer ræsonnement, kodning og flersprogede evner i topklasse under en Apache 2.0-licens. Til specifikke brugsscenarier kan DeepSeek R1 (ræsonnement) og Llama 4 Scout (lang kontekst) være bedre valg.
Kan jeg køre open source-LLM'er på forbrugerhardware?
Ja. Gemma 3 27B kører på en enkelt RTX 4090 (24 GB VRAM), og Phi-4 14B passer på en bærbar-GPU med 8 GB. Kvantiserede versioner (Q4, Q8) af større modeller virker også på multi-GPU-forbrugeropsætninger med værktøjer som Ollama og llama.cpp.
Er open source-LLM'er lige så gode som ChatGPT eller Claude?
På kodnings- og matematik-benchmarks matcher eller slår de bedste open source-modeller GPT-4.5 og nærmer sig Claude Sonnet 4.5-ydelse. Kløften er mindst på strukturerede opgaver (kode, matematik, ræsonnement) og størst på kreativ skrivning og nuanceret instruktionsfølge.
Hvad betyder MoE (Mixture-of-Experts) for hardware?
MoE-modeller har et stort samlet parameterantal, men aktiverer kun en brøkdel per token. Hele modellen skal dog indlæses i hukommelsen, så routeren kan vælge eksperter. En 235B MoE-model med 22B aktive kræver stadig VRAM svarende til 235B — du sparer ikke hukommelse, du sparer beregning.
Hvilken open source-LLM er bedst til kodning?
GLM-4.7 fører med 94,2 % HumanEval og 73,8 % SWE-bench. Til ren kodegenerering ligger DeepSeek R1 og Qwen 3 235B tæt bag. Til kodning på forbrugerhardware er DeepSeek R1 32B-destillatet det bedste forhold mellem evner og omkostninger.
Har Llama 4 Scout virkelig 10 millioner tokens kontekst?
Arkitekturen understøtter det, og Meta demonstrerede perfekt Needle-in-a-Haystack-genfinding ved 10M tokens. Men faktisk at bruge den fulde kontekst kræver enorm KV-cache-hukommelse. De fleste self-hostede udrulninger topper realistisk ved 128K-256K tokens. Cloud-udbydere som Together AI og Fireworks tilbyder længere kontekstvinduer.
Hvilken licens skal jeg kigge efter i en open source-LLM?
Apache 2.0 og MIT er de mest tilladende — fuld kommerciel brug, ændring og videredistribution. Llamas brugerdefinerede licens tillader kommerciel brug, men har begrænsninger for apps med 700M+ brugere. Nogle "open weight"-modeller (som Gemma) har specifikke vilkår — læs altid licensen før produktionsudrulning.
Hvor meget VRAM har jeg brug for til en 70B-model?
Ved Q4-kvantisering kræver en 70B dense-model cirka 35-40 GB VRAM. En enkelt A100 (80 GB) håndterer det nemt, eller to RTX 4090'ere (48 GB i alt). Ved fuld præcision (BF16) kigger du på 140+ GB, hvilket reelt kræver fire A100'er eller tilsvarende.
Kan jeg finjustere open source-LLM'er til mit brugsscenarie?
Absolut. QLoRA gør finjustering af en 70B-model mulig på et enkelt 24 GB GPU. Mindre modeller som Phi-4 og Gemma 3 er endnu mere tilgængelige for finjusteringseksperimenter. Apache 2.0- og MIT-licenserede modeller har ingen begrænsninger på afledte værker.
Hvad med open source multimodale LLM'er?
Gemma 3 27B og Llama 4 Scout håndterer begge tekst- og billede-input native. Phi-4-reasoning-vision-15B tilføjer visuelt ræsonnement i mindre skala. Til videoforståelse understøtter Llama 4 Scout op til 20 timers video-input inden for dens kontekstvindu.
Hvad er den bedste open source-LLM lige nu?
Lige nu er Qwen 3 235B-A22B den bedste open source-LLM samlet set og fører inden for ræsonnement og kodning under en Apache 2.0-licens. Til et enkelt forbruger-GPU er Gemma 3 27B (16 GB VRAM) det bedste valg, og GLM-4.7 vinder til kodningsagenter med 94,2 % HumanEval.
Findes der en open source-LLM-rangliste?
Ja. Vores juli 2026-rangliste ovenfor rangerer alle otte modeller i denne guide, og Hugging Face er vært for den fællesskabsdrevne Open LLM Leaderboard for bredere dækning. Vi gennemtjekker vores placeringer månedligt mod benchmarks som MMLU, HumanEval, AIME og SWE-bench.
At vælge et værktøj er den nemme halvdel. At få det til at køre pålideligt inde i et reelt produkt er, hvor de fleste teams går i stå, og det er præcis, hvad vores AI-integrationsteam bygger for kunder — fra RAG-pipelines til brugerdefinerede agenter. Vil du have en second opinion på dit stack? Få en gratis konsultation.