Techsy
Kontakt
Kom i gang
Tilbage til blog
ai-machine-learning

Bedste open source-LLM 2026: Vi testede 8 — kun 3 slog GPT-4-klassen

Skrevet af Mert Batur Gürbüz
Opdateret Jul 5, 2026
16 minutters læsning
Indholdsfortegnelse
Bedste open source-LLM 2026: Vi testede 8 — kun 3 slog GPT-4-klassen

Bedste open source-LLM 2026: Vi testede 8 — kun 3 slog GPT-4-klassen

Senest opdateret: 5. juli 2026. Alle benchmark-score, VRAM-tal og licenser i denne guide blev gennemtjekt igen til denne opdatering. Rangeringen nedenfor afspejler open weight-modeller udgivet frem til midten af 2026 — hvis en ny udgivelse ændrer rækkefølgen, opdateres denne side inden for en måned.

Den bedste open source-LLM i 2026 er Qwen 3 235B-A22B til overordnet ræsonnement og kodning, mens DeepSeek R1 fører inden for dyb matematisk ræsonnering og Llama 4 Scout inden for lang kontekst (10M tokens). Til et enkelt forbrugergrafikkort er Gemma 3 27B (16 GB VRAM) og Phi-4 14B (8 GB) de nemmeste at self-hoste. Alle tre topmodeller matcher GPT-4-klasse-ydelse på kode og matematik, mens de forbliver gratis at udrulle.

Førende open source-LLM'er: Benchmark-øjebliksbillede

Tabellen nedenfor dækker fem bredt udbredte open source-modeller scoret på standard offentlige benchmarks. MMLU måler bred generel viden; HumanEval måler beståelsesrate for kodegenerering.

ModelParametreUdgivelseMMLUHumanEvalLicensBedst til
Llama 3.3 70B70Bdec. 202486,088,4Llama 3.3 CommunityGenerel brug, flersproget
Qwen 2.5 72B72Bsep. 202485,0+86,6Qwen LicenseMatematik, kodning, instruktionsfølge
DeepSeek-V3671B (37B aktive)dec. 202487,182,6MITGenerel brug, kodning, omkostningseffektiv
Mistral Small 3.124Bmar. 202580,688,4Apache 2.0Agentiske workflows, vision, flersproget
Gemma 3 27B27Bmar. 2025~78,687,8Gemma Terms of UseSingle-GPU-udrulning, multimodal

Vi opdaterer denne tabel månedligt.

Open source-LLM'er "konkurrerer" ikke længere blot med proprietære modeller — inden for kodning, matematik og lang-kontekst-opgaver vinder de. Kløften mellem en API-regning på 200 $/måned og en self-hostet åben model har aldrig været mindre.

Denne rangering skærer gennem hypen. Alle modeller her evalueres på de benchmarks, der betyder noget, den hardware du faktisk får brug for, og det specifikke brugsscenarie, hvor hver enkelt skinner mest.

Hurtigt overblik: Hvilken open source-LLM skal du vælge?

Brug for det absolut bedste ræsonnement? Vælg Qwen 3 235B eller DeepSeek R1. Vil du køre noget på et enkelt GPU? Gemma 3 27B eller Phi-4 14B. Behandler enorme dokumenter? Llama 4 Scouts 10M token-kontekst er uden sidestykke.

PladsModelParametre (aktive)Bedst tilLicensMin. VRAM
nr. 1Qwen 3 235B-A22B235B (22B)Ræsonnement + kodningApache 2.0~132 GB (Q4)
nr. 2DeepSeek R1671B (37B)Dyb ræsonnering + matematikMIT~136 GB (Q4)
nr. 3Llama 4 Scout109B (17B)Lang kontekst (10M tokens)Llama License~55 GB (Q4)
nr. 4DeepSeek V3671B (37B)Generel brug + kodningMIT~136 GB (Q4)
nr. 5Mistral Large 3675B (41B)Flersproget + enterpriseApache 2.0~140 GB (Q4)
nr. 6Gemma 3 27B27B (27B, dense)Single-GPU-udrulningOpen weights~16 GB (Q4)
nr. 7Phi-4 Reasoning14B (14B, dense)Edge + mobilenhederMIT~8 GB (Q4)
nr. 8GLM-4.7355B (32B)Agentiske kodningsworkflowsMIT~130 GB (Q4)

VRAM-tallene forudsætter Q4-kvantisering. Kravene ved fuld præcision er 2-4x højere. Hvis du er ny i at køre modeller lokalt, så start med Gemma 3 eller Phi-4 -- de er de mest hardwarevenlige muligheder på denne liste.

Open source-LLM-rangliste: juli 2026-placeringer

Pr. juli 2026 topper Qwen 3 235B-A22B vores open source-LLM-rangliste for alsidigt ræsonnement og kodning, med DeepSeek R1 som nummer to inden for dyb matematik og Llama 4 Scout som nummer tre inden for lang kontekst. Den fulde rangering nedenfor dækker alle otte modeller scoret i denne guide, fra datacenter-rigs til bærbaregnede valg.

PladsModelLicensBedst tilMin. VRAM
nr. 1Qwen 3 235B-A22BApache 2.0Ræsonnement + kodning~132 GB (Q4)
nr. 2DeepSeek R1MITDyb ræsonnering + matematik~136 GB (Q4)
nr. 3Llama 4 ScoutLlama LicenseLang kontekst (10M tokens)~55 GB (Q4)
nr. 4DeepSeek V3MITGenerel brug + kodning~136 GB (Q4)
nr. 5Mistral Large 3Apache 2.0Flersproget + enterprise~140 GB (Q4)
nr. 6Gemma 3 27BOpen weightsSingle-GPU-udrulning~16 GB (Q4)
nr. 7Phi-4 ReasoningMITEdge + mobilenheder~8 GB (Q4)
nr. 8GLM-4.7MITAgentiske kodningsworkflows~130 GB (Q4)

Disse placeringer afspejler vores månedlige gennemtjek af benchmarks, hardwarekrav og licensvilkår.

Lad os nu bryde ned, hvad der gør hver model værd at lægge mærke til.

1. Qwen 3 235B-A22B, bedste open source-LLM samlet set

Alibabas Qwen 3 235B-A22B er modellen, man skal slå lige nu. Det er en Mixture-of-Experts-arkitektur med 235 milliarder parametre i alt, men kun 22 milliarder aktiveres per token, hvilket skærer beregningen ned med cirka 90 % sammenlignet med en dense-model af tilsvarende kvalitet.

Det, der adskiller Qwen 3, er dens dual-mode tænkning. Du kan skifte mellem en "tænketilstand" til komplekse matematik- og kodningsproblemer (hvor modellen viser sin tankekæde) og en hurtig "ikke-tænketilstand" til hurtige chatsvar. Den fleksibilitet betyder noget i produktion.

Benchmark-højdepunkter:

BenchmarkQwen 3 235B-scoreKontekst
AIME 202485,7 %Matematik på konkurrenceniveau
AIME 202581,5 %Sværere matematikopgaver
LiveCodeBench v570,7 %Reelle kodningsopgaver
CodeForces2.056Konkurrenceprogrammering
BFCL v370,8 %Funktionskald

Disse tal placerer den i samme klasse som DeepSeek R1, OpenAIs o1 og Gemini 2.5 Pro — bortset fra at du kan downloade den, finjustere den og udrulle den, hvor du vil, under Apache 2.0.

Hardwarekrav: Den fulde model kræver cirka 132 GB VRAM ved Q4-kvantisering. Det er en multi-GPU-opsætning — tænk fem RTX 3090'ere, tre A40'er eller en dual-H100-rig. Ikke billigt, men inden for rækkevidde for en startup eller et forskningslab. Qwen 3-familien inkluderer også mindre varianter (32B, 14B, 8B, 4B), der kører på forbrugerhardware.

Hvem bør bruge den: Teams, der har brug for ræsonnement og kodning på frontier-niveau, men som vil eje deres infrastruktur. Den er særligt stærk til flersprogede workloads med 256K-kontekst og understøttelse af 100+ sprog. Hvis du planlægger at finjustere en model til dit specifikke domæne, giver Qwen 3's Apache 2.0-licens dig fuld frihed.

2. DeepSeek R1 -- bedst til dyb ræsonnering

DeepSeek R1 ændrede spillet, da den udkom i begyndelsen af 2025, og beviste, at open source-modeller kunne matche OpenAIs o1 på ræsonneringsopgaver. R1-0528-opdateringen skubbede tingene endnu længere — AIME 2025-nøjagtigheden sprang fra 70 % til 87,5 %.

Modellens hemmelige våben er dens træningsmetodik. DeepSeek skabte først R1-Zero ved hjælp af ren reinforcement learning uden supervised fine-tuning-opvarmning. Modellen udviklede spontant tankekæde-ræsonnement, selvverifikation og backtracking-adfærd. Den lærte bogstaveligt talt sig selv at tjekke sit eget arbejde.

Benchmark-højdepunkter:

BenchmarkDeepSeek R1-scoreKontekst
AIME 202587,5 % (R1-0528)Matematikolympiade
GPQA Diamond71,5 %Videnskab på kandidatniveau
SWE-bench49,2 %Reel software engineering
HumanEval92,4 %Kodegenerering

Hardwarekrav: Samme 671B MoE-arkitektur som DeepSeek V3, så du kigger på ~136 GB VRAM ved Q4. Men her er den praktiske vinkel: DeepSeek udgav også destillerede varianter på 1,5B, 7B, 14B, 32B og 70B parametre. 32B-destillatet kører på en enkelt RTX 4090 og overgår stadig mange større modeller på ræsonneringsopgaver.

Hvem bør bruge den: Alle, der bygger applikationer, der kræver trin-for-trin-ræsonnement, teorembevis, kompleks kodefejlfinding, videnskabelig analyse. De destillerede varianter er særligt nyttige, hvis du har brug for ræsonneringsevner på et budget. Tjek de bedste værktøjer til at køre LLM'er lokalt, hvis du vil udrulle de mindre destillater på din egen hardware.

3. Llama 4 Scout, bedst til lang kontekst

Metas Llama 4 Scout bragte noget ægte nyt til open source-verdenen: et kontekstvindu på 10 millioner tokens. Det er ikke en tastefejl. Du kan fodre den en hel kodebase, en hylde af forskningsartikler eller 20 timers videotransskription i en enkelt prompt.

Scout bruger 16 MoE-eksperter med kun 2 aktive per token, hvilket giver den 109B parametre i alt, men kun 17B aktive. Meta hævder, at den passer på en enkelt H100 med INT4-kvantisering, selvom 10M-kontekstvinduet selvfølgelig kræver mere hukommelse til KV-cachen.

Benchmark-højdepunkter:

BenchmarkLlama 4 Scout-scoreKontekst
Needle-in-a-Haystack (10M)100 %Perfekt genfinding
MMLU79,6 %Generel viden
HumanEval81,2 %Kodegenerering
DocVQA85,1 %Dokumentforståelse

Den perfekte Needle-in-a-Haystack-score ved 10M tokens er bemærkelsesværdig. De fleste modeller begynder at miste information længe før 128K. Scout bruger en ny tilgang til inter-dokument attention-masking, der opretholder grænser mellem dokumenter selv inden for dens enorme kontekstvindu.

Hardwarekrav: Ved Q4 kræver modelvægtene cirka 55 GB VRAM. En enkelt H100 (80 GB) håndterer det komfortabelt. Til forbrugerhardware kan to RTX 4090'ere (48 GB i alt) klare kortere kontekstlængder. Hagen: at faktisk bruge det fulde 10M-kontekstvindu kræver enorm KV-cache-hukommelse oven i modelvægtene. I praksis topper de fleste self-hostede udrulninger ved 128K-256K tokens.

Hvem bør bruge den: Teams, der arbejder med enorme dokumenter, juridisk analyse, kodebase-Q&A, syntese af forskningsartikler. De multimodale evner (tekst + billede-input) er også stærke. Vær bare realistisk om kontekstlængden: 10M-loftet er reelt, men du får brug for hardware i serverklassen for at nå det.

4. DeepSeek V3 -- bedste generelle open source-LLM

Mens DeepSeek R1 får overskrifterne for ræsonnement, er DeepSeek V3 nok den mere praktiske model til hverdagsbrug. Den er arbejdshesten — hurtig, alsidig på tværs og bemærkelsesværdigt effektiv af sin størrelse.

V3 deler den samme 671B MoE / 37B aktive-arkitektur som R1, men bytter dybe ræsonneringskæder ud med hurtigere svartider og bredere generelle evner. V3-0324-opdateringen inkorporerede reinforcement learning-teknikker fra R1's træning, hvilket booster ræsonnement uden latenstabet ved eksplicit tankekæde.

Benchmark-højdepunkter:

BenchmarkDeepSeek V3-scoreKontekst
MMLU87,1 %Generel viden
HumanEval82,6 %Kodegenerering
MATH90,2 %Matematisk ræsonnement
Kontekstvindu128KUnderstøttelse af lange dokumenter

DeepSeek V3 overgår GPT-4.5 i kodnings- og matematik-benchmarks. Dens træningseffektivitet er legendarisk — kun 2,788 millioner H800 GPU-timer for den fulde prætræningskørsel, en brøkdel af hvad sammenlignelige modeller kræver.

Hardwarekrav: Identiske med R1 (~136 GB VRAM ved Q4). Til praktisk udrulning kører de GGUF-kvantiserede versioner via llama.cpp eller Ollama på multi-GPU-forbrugeropsætninger.

Hvem bør bruge den: Hvis du har brug for én model, der håndterer alt — chat, kodning, analyse, oversættelse, opsummering — er V3 det mest afbalancerede valg. Den slår ikke R1 på hård ræsonnering eller Scout på kontekstlængde, men den overgår begge på typiske produktionsworkloads, hvor hastighed og alsidighed betyder mere end top-benchmark-score.

5. Mistral Large 3 -- bedst til flersproget og enterprise-brug

Mistral Large 3 bragte Mistral tilbage til fronten. Med 675B parametre i alt (41B aktive) er det en fuld MoE-model udgivet under Apache 2.0 -- et kæmpe skift fra Mistral Large 2's restriktive forskningslicens.

Modellen blev trænet fra bunden på 3.000 NVIDIA H200 GPU'er, og det kan ses. På LMSYS Chatbot Arena rangerede den som nr. 2 blandt åbne modeller og nr. 6 samlet (inklusive proprietære). Det, der gør den særligt interessant for europæiske teams, er dens flersprogede styrke — cirka 85,5 % nøjagtighed på en afbalanceret flersproget MMLU-test.

Benchmark-højdepunkter:

BenchmarkMistral Large 3-scoreKontekst
Flersproget MMLU85,5 %Viden på tværs af sprog
LMSYS Arenanr. 6 samletMenneskelig præference-rangering
AIME 2025 (14B-variant)85 %Matematisk ræsonnement
Kontekstvindu128KUnderstøttelse af lange dokumenter

Et træk, der adskiller Mistral-modeller: de er trænet til at sige "jeg ved det ikke" frem for at hallucinere. Det gør Mistral Large 3 til et stærkt match til RAG-pipelines og enterprise-applikationer, hvor faktuel nøjagtighed betyder mere end kreativt output.

Hardwarekrav: Med 675B parametre i alt minder VRAM-behovet om DeepSeek (~140 GB ved Q4). Mistral tilbyder også 14B Small 3-varianten, som passer på et enkelt forbruger-GPU og slår langt over sin vægtklasse på ræsonnement og kodning.

Hvem bør bruge den: Europæiske virksomheder, der har brug for flersprogede evner og datasuverænitet. Enterprise-teams, der bygger RAG-systemer, hvor reduktion af hallucinationer er afgørende. Apache 2.0-licensen fjerner kommerciel friktion helt.

6. Gemma 3 27B, bedst til single-GPU-udrulning

Googles Gemma 3 27B er det søde punkt mellem evner og tilgængelighed. Med 27 milliarder parametre i en dense-arkitektur kører den på en enkelt RTX 4090 med Q4-kvantisering. Ingen multi-GPU-rigs, ingen serverklasse-hardware — bare et almindeligt gaming-kort.

Lad dig ikke narre af det beskedne parameterantal. Gemma 3 27B slår langt over sin vægtklasse, især på multimodale opgaver. Den håndterer både tekst- og billede-input, understøtter 140+ sprog, og dens 130K-kontekstvindu er generøst for en model i denne størrelse.

Benchmark-højdepunkter:

BenchmarkGemma 3 27B-scoreKontekst
MMLU78,6 %Generel viden
DocVQA85,6 %Dokumentforståelse
MGSM74,3 %Flersproget matematik
ChartQA76,3 %Visuelt ræsonnement

De multimodale scorer (DocVQA 85,6 %, ChartQA 76,3 %) konkurrerer med modeller, der er 3-5x større. For udviklere, der har brug for billedforståelse uden en GPU-klynge, er Gemma 3 det oplagte valg.

Hardwarekrav: Cirka 16 GB VRAM ved Q4-kvantisering, 32 GB ved Q8. En enkelt RTX 4090 (24 GB) håndterer det komfortabelt. Selv en M2 MacBook Pro med 32 GB forenet hukommelse kan køre den. Hvis du følger vores guide til at køre LLM'er lokalt, er Gemma 3 en af de nemmeste modeller at starte med.

Hvem bør bruge den: Soloudviklere, små teams og alle, der vil have en alsidig multimodal model uden at leje cloud-GPU'er. Den er også fremragende til prototyping — test din pipeline på Gemma 3 lokalt, og opskalér derefter til en større model i produktion om nødvendigt. For Googles nyere lille model, se vores Gemma 4 12B-guide.

7. Phi-4 Reasoning, bedst til edge og ressourcebegrænset udrulning

Microsofts Phi-4 Reasoning beviser, at parameterantal ikke er alt. Med blot 14 milliarder parametre overgår den DeepSeek R1's 70B-destillat på adskillige ræsonneringsbenchmarks. Den nyligt udgivne Phi-4-reasoning-vision-15B tilføjer multimodale evner og scorer 17 % højere end Gemma 3 12B på matematisk-visuelle ræsonneringsopgaver.

Phi-4-familiens hemmelighed er træningsdatakvalitet. Microsofts tilgang prioriterer kuraterede data af høj kvalitet frem for rå skala, og det virker — Phi-4 scorer over 80 % på MATH- og MGSM-benchmarks og overgår Googles Gemini Pro og GPT-4o-mini på matematisk ræsonnement.

Benchmark-højdepunkter:

BenchmarkPhi-4-scoreKontekst
MATH82,6 %Matematisk ræsonnement
HumanEval82,6 %Kodegenerering
MGSM80 %+Flersproget matematik
MathVista (vision)+17 % vs. Gemma 12BVisuel matematik

Hardwarekrav: Omkring 8 GB VRAM ved Q4 -- det er en bærbar-GPU eller endda et ældre desktop-kort. Modellen kører komfortabelt på Apple Silicon MacBooks, hvilket gør den ægte portabel. Til edge-udrulning er den en af de få modeller, der kan køre on-device med rimelig latenstid.

Hvem bør bruge den: Mobil- og edge-udviklere, teams, der bygger on-device AI-funktioner, og alle, der har brug for stærk ræsonnering på minimal hardware. Phi-4 er også et godt valg til evaluering af finjusterede modeller, da dens lille størrelse gør træningsiterationer hurtige og billige. MIT-licensen betyder ingen kommercielle begrænsninger.

8. GLM-4.7 -- bedst til agentisk kodning

Z.ais GLM-4.7 er specialbygget til et specifikt brugsscenarie: agentiske kodningsworkflows, hvor modellen skal ræsonnere, bruge værktøjer og opretholde kontekst på tværs af lange multitrins-interaktioner.

Dens arkitektur er en 355B MoE med 32B aktive parametre, men den fremtrædende funktion er dens tre-trins tænkesystem. I modsætning til de fleste modeller, der genstarter deres ræsonneringsproces hver tur, bevarer GLM-4.7 tankeblokke på tværs af hele samtalen. Den vedvarende ræsonneringskontekst gør en reel forskel, når modellen orkestrerer komplekse multitrins-kodningsopgaver.

Benchmark-højdepunkter:

BenchmarkGLM-4.7-scoreKontekst
SWE-bench73,8 %Reel software engineering
HumanEval94,2 %Kodegenerering
Kontekstvindu200KLange interaktioner
Maks. output131K tokensUdvidet generering

Den 73,8 % SWE-bench-score er konkurrencedygtig med Claude Sonnet 4.5 -- på reelle software engineering-opgaver, ikke syntetiske benchmarks. Og 94,2 % HumanEval er den højeste af alle modeller på denne liste.

Hardwarekrav: Minder om andre store MoE-modeller (~130 GB VRAM ved Q4). 200K-kontekstvinduet og 131K maks. output gør den hukommelsessulten under lange agentiske sessioner.

Hvem bør bruge den: AI-assisterede udviklingsteams, der bygger kodningsagenter, automatiserede fejlfindingsværktøjer eller kodegennemgangssystemer. Hvis du vælger finjusteringsværktøjer til en kodningsfokuseret model, er GLM-4.7 en stærk base. MIT-licensen betyder fuld kommerciel brug.

Bedste open source-LLM til kodning (juli 2026)

Til kodning i juli 2026 er GLM-4.7 det bedste open source-valg med en score på 94,2 % på HumanEval og 73,8 % på SWE-bench — konkurrencedygtig med Claude Sonnet 4.5 på reelle softwareopgaver. Vil du have en stærk kodningsmodel på forbrugerhardware? DeepSeek R1 32B-destillatet kører på en enkelt RTX 4090.

Overvejer du den nyere GLM-udgivelse? Se vores GLM 5.2-gennemgang for, hvordan den sammenligner.

Sådan vælger du: Beslutningsramme

Den "bedste" model afhænger helt af dine begrænsninger. Brug denne matrix til at indsnævre din beslutning.

Hvis du har brug for...VælgHvorfor
Bedste overordnede ræsonnementQwen 3 235BTop-matematik, kode og generelle benchmarks
Dyb tankekædeDeepSeek R1Selvkorrigerende ræsonnement, 87,5 % AIME
Enormt kontekstvinduLlama 4 Scout10M tokens, perfekt genfinding
Hurtig generelDeepSeek V3Bedste hastighed-til-kvalitet-forhold
Flersproget enterpriseMistral Large 385,5 % flersproget MMLU, anti-hallucination
Enkelt forbruger-GPUGemma 3 27B16 GB VRAM, stærk multimodal
Bærbar eller edge-enhedPhi-4 14B8 GB VRAM, MIT-licens
KodningsagenterGLM-4.794,2 % HumanEval, vedvarende ræsonnement

Stadig usikker? Start her: Har du multi-GPU-hardware? Hvis nej, er dine valg Gemma 3 og Phi-4. Hvis ja, bygger du så en kodningsagent? Vælg GLM-4.7 eller DeepSeek R1. Brug for lang kontekst? Llama 4 Scout. Alt andet? Qwen 3 235B er det sikreste standardvalg.

Sådan rangerede vi disse modeller

Rangeringer er ikke baseret på en enkelt benchmark. Hver model blev evalueret på tværs af fem dimensioner:

  1. Benchmark-ydelse -- MMLU, HumanEval, AIME, SWE-bench og domænespecifikke test
  2. Hardwaretilgængelighed -- Kan reelle teams faktisk udrulle den?
  3. Licensfrihed -- Apache 2.0 og MIT scorer højere end restriktive licenser
  4. Økosystemmodenhed -- Tilgængelig på Hugging Face, Ollama, vLLM og større inferensmotorer
  5. Reel adoption -- Aktivt fællesskab, produktionsudrulninger, løbende opdateringer

Modeller, der scorer godt på benchmarks, men kræver en GPU-klynge, ingen har (vi kigger på dig, 671B fuld præcision), straffes. Modeller med restriktive licenser, der blokerer kommerciel brug, mister også point. Målet er praktisk værdi, ikke rangliste-praleri.

Hvis du selv vil teste disse modeller, gennemgår vores LLM-evalueringsguide opsætning af systematiske benchmarks, og de bedste evalueringsværktøjer-rundskriv dækker de frameworks, du får brug for.

FAQ

Hvad er de nyeste open source-LLM'er i 2026?

2026-fronten anføres af Qwen 3 (Alibaba), DeepSeek R1 og V3, Llama 4 Scout (Meta), Mistral Large 3 og GLM-4.7 (Z.ai). Punktudgivelser som DeepSeek R1-0528 og Phi-4 reasoning-vision-varianten ankom frem til midten af 2026. Vi gennemtjekker denne liste månedligt og opdaterer ranglisten, når en ny udgivelse ændrer rangeringen.

Hvor ofte opdateres denne open source-LLM-rangliste?

Månedligt. Vi gennemtjekker benchmark-score, VRAM-krav og licenser i begyndelsen af hver måned og tilføjer nye modeller, efterhånden som de udkommer. "Senest opdateret"-datoen under titlen afspejler den seneste gennemgang.

Hvad er den bedste open source-LLM i 2026?

Qwen 3 235B-A22B fører i øjeblikket på det bredeste udvalg af benchmarks og kombinerer ræsonnement, kodning og flersprogede evner i topklasse under en Apache 2.0-licens. Til specifikke brugsscenarier kan DeepSeek R1 (ræsonnement) og Llama 4 Scout (lang kontekst) være bedre valg.

Kan jeg køre open source-LLM'er på forbrugerhardware?

Ja. Gemma 3 27B kører på en enkelt RTX 4090 (24 GB VRAM), og Phi-4 14B passer på en bærbar-GPU med 8 GB. Kvantiserede versioner (Q4, Q8) af større modeller virker også på multi-GPU-forbrugeropsætninger med værktøjer som Ollama og llama.cpp.

Er open source-LLM'er lige så gode som ChatGPT eller Claude?

På kodnings- og matematik-benchmarks matcher eller slår de bedste open source-modeller GPT-4.5 og nærmer sig Claude Sonnet 4.5-ydelse. Kløften er mindst på strukturerede opgaver (kode, matematik, ræsonnement) og størst på kreativ skrivning og nuanceret instruktionsfølge.

Hvad betyder MoE (Mixture-of-Experts) for hardware?

MoE-modeller har et stort samlet parameterantal, men aktiverer kun en brøkdel per token. Hele modellen skal dog indlæses i hukommelsen, så routeren kan vælge eksperter. En 235B MoE-model med 22B aktive kræver stadig VRAM svarende til 235B — du sparer ikke hukommelse, du sparer beregning.

Hvilken open source-LLM er bedst til kodning?

GLM-4.7 fører med 94,2 % HumanEval og 73,8 % SWE-bench. Til ren kodegenerering ligger DeepSeek R1 og Qwen 3 235B tæt bag. Til kodning på forbrugerhardware er DeepSeek R1 32B-destillatet det bedste forhold mellem evner og omkostninger.

Har Llama 4 Scout virkelig 10 millioner tokens kontekst?

Arkitekturen understøtter det, og Meta demonstrerede perfekt Needle-in-a-Haystack-genfinding ved 10M tokens. Men faktisk at bruge den fulde kontekst kræver enorm KV-cache-hukommelse. De fleste self-hostede udrulninger topper realistisk ved 128K-256K tokens. Cloud-udbydere som Together AI og Fireworks tilbyder længere kontekstvinduer.

Hvilken licens skal jeg kigge efter i en open source-LLM?

Apache 2.0 og MIT er de mest tilladende — fuld kommerciel brug, ændring og videredistribution. Llamas brugerdefinerede licens tillader kommerciel brug, men har begrænsninger for apps med 700M+ brugere. Nogle "open weight"-modeller (som Gemma) har specifikke vilkår — læs altid licensen før produktionsudrulning.

Hvor meget VRAM har jeg brug for til en 70B-model?

Ved Q4-kvantisering kræver en 70B dense-model cirka 35-40 GB VRAM. En enkelt A100 (80 GB) håndterer det nemt, eller to RTX 4090'ere (48 GB i alt). Ved fuld præcision (BF16) kigger du på 140+ GB, hvilket reelt kræver fire A100'er eller tilsvarende.

Kan jeg finjustere open source-LLM'er til mit brugsscenarie?

Absolut. QLoRA gør finjustering af en 70B-model mulig på et enkelt 24 GB GPU. Mindre modeller som Phi-4 og Gemma 3 er endnu mere tilgængelige for finjusteringseksperimenter. Apache 2.0- og MIT-licenserede modeller har ingen begrænsninger på afledte værker.

Hvad med open source multimodale LLM'er?

Gemma 3 27B og Llama 4 Scout håndterer begge tekst- og billede-input native. Phi-4-reasoning-vision-15B tilføjer visuelt ræsonnement i mindre skala. Til videoforståelse understøtter Llama 4 Scout op til 20 timers video-input inden for dens kontekstvindu.

Hvad er den bedste open source-LLM lige nu?

Lige nu er Qwen 3 235B-A22B den bedste open source-LLM samlet set og fører inden for ræsonnement og kodning under en Apache 2.0-licens. Til et enkelt forbruger-GPU er Gemma 3 27B (16 GB VRAM) det bedste valg, og GLM-4.7 vinder til kodningsagenter med 94,2 % HumanEval.

Findes der en open source-LLM-rangliste?

Ja. Vores juli 2026-rangliste ovenfor rangerer alle otte modeller i denne guide, og Hugging Face er vært for den fællesskabsdrevne Open LLM Leaderboard for bredere dækning. Vi gennemtjekker vores placeringer månedligt mod benchmarks som MMLU, HumanEval, AIME og SWE-bench.

At vælge et værktøj er den nemme halvdel. At få det til at køre pålideligt inde i et reelt produkt er, hvor de fleste teams går i stå, og det er præcis, hvad vores AI-integrationsteam bygger for kunder — fra RAG-pipelines til brugerdefinerede agenter. Vil du have en second opinion på dit stack? Få en gratis konsultation.

Kilder

  • Qwen 3 teknisk rapport - arXiv
  • Meta Llama 4 officiel side
  • DeepSeek R1 - Hugging Face
  • Gemma 3 - Google DeepMind
  • Phi-4 Reasoning teknisk rapport - Microsoft Research
  • Mistral Large 3-meddelelse
  • GLM-4.7 - Hugging Face
  • Open LLM Leaderboard - Hugging Face

Tags

bedste open source llm 2026open source llmllama 4qwen 3deepseekgemma 3phi-4self-host llmlokal llm

Del denne artikel

Relaterede artikler

Mere fra ai-machine-learning

ai-machine-learning
Jul 20, 2026

8 bedste AI web scraping-API'er i 2026 (testet på vores egen agent-stack)

Vi testede 8 AI web scraping-API'er med reelle 2026-priser hentet gennem vores egen agent-stack. Firecrawl, Bright Data, ScrapingBee og 5 flere, rangeret efter LLM-klar output, anti-bot og MCP-understøttelse.

9 min read minutters læsning
Læs
ai-machine-learning
Jul 20, 2026

Prompt Engineering til kodning: 7 mønstre, vi bruger dagligt i Claude Code og Cursor (2026)

De fleste artikler om 'AI-kodningsprompts' giver dig 50 skabeloner at kopiere. Denne artikel lærer dig de 7 mønstre, vi bruger hver dag til at drive en 16-agent Claude Code-pipeline, med ægte før-og-efter eksempler for hvert enkelt, samt hvor hvert mønster hører hjemme i Claude Code, Cursor og Copilot i 2026.

11 min read minutters læsning
Læs
ai-machine-learning
Jul 19, 2026

Fra AI-PoC til produktion: 12-punkts tjeklisten før lancering

En fungerende AI-demo er ikke et produktionssystem. Denne 12-punkts tjekliste gennemgår de tre faser, enhver AI-funktion kræver før lancering: hærd, stabiliser og udrul – med konkrete grænseværdier for omkostningslofter, hastighedsbegrænsninger, fallbacks og rollback-udløsere.

10 min read minutters læsning
Læs
Se alle indlæg
Start dit projekt

Klar til at bygge noget ekstraoordinær?

Lad os gøre din vision til virkelighed. Vores team står klar til at hjælpe dig med at skabe software, der gør en forskel.

Book et 30 min. scopemødeSe vores arbejde

Fra biblioteket

Claude Skills

Se alle
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-automatiseringer

Se alle
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Fra biblioteket

Claude Skills

Se alle
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-automatiseringer

Se alle
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Tjenester

  • Entertainmentløsninger
  • Mobilapps
  • Webapplikationer

Løsninger

  • CRM-systemer
  • AI-integration
  • ERP-løsninger
  • Stemmeargenter
  • Processautomatisering
  • Cybersikkerhed

Bibliotek

  • Blog
  • Portfolio

Fællesskab

  • AI-automatiseringer
  • Claude Skills

Værktøjer

  • Pris på mobil-app
  • OpenAI / LLM API-prisreknemaskine
  • Pris på MVP
  • Pris på stemme-AI-agent

Virksomhed

  • Om
  • Partnere
  • Kontakt

Juridisk

  • Privatlivspolitik
  • Salgsbetingelser
  • Cookiepolitik

Tjenester

  • Entertainmentløsninger
  • Mobilapps
  • Webapplikationer

Løsninger

  • CRM-systemer
  • AI-integration
  • ERP-løsninger
  • Stemmeargenter
  • Processautomatisering
  • Cybersikkerhed

Bibliotek

  • Blog
  • Portfolio

Fællesskab

  • AI-automatiseringer
  • Claude Skills

Værktøjer

  • Pris på mobil-app
  • OpenAI / LLM API-prisreknemaskine
  • Pris på MVP
  • Pris på stemme-AI-agent

Virksomhed

  • Om
  • Partnere
  • Kontakt
JuridiskPrivatlivspolitikSalgsbetingelserCookiepolitik
TECHSY
© 2026 Techsy. Alle rettigheder forbeholdes.