ai-machine-learning

Beste open-source LLM 2026: 8 getest — slechts 3 verslaan GPT-4-klasse

Geschreven door Mert Batur
Bijgewerkt Jul 5, 2026
16 leestijd
Beste open-source LLM 2026: 8 getest — slechts 3 verslaan GPT-4-klasse

De beste open-source LLM's van 2026: 8 modellen gerangschikt op echte prestaties

Laatst bijgewerkt: 5 juli 2026. Elke benchmarkscore, elk VRAM-getal en elke licentie in deze gids is voor deze update opnieuw geverifieerd. De onderstaande ranking weerspiegelt open-weight modellen uitgebracht tot medio 2026 — als een nieuwe release de volgorde verandert, wordt deze pagina binnen de maand bijgewerkt.

De beste open-source LLM van 2026 is Qwen 3 235B-A22B voor algemeen redeneren en programmeren, met DeepSeek R1 als koploper op diep wiskundig redeneren en Llama 4 Scout op lange context (10M tokens). Voor één consument-GPU zijn Gemma 3 27B (16 GB VRAM) en Phi-4 14B (8 GB) het makkelijkst zelf te hosten. Alle drie topmodellen evenaren GPT-4-prestaties op code en wiskunde terwijl ze gratis te deployen zijn.

Toonaangevende open-source LLM's: benchmark-overzicht

De onderstaande tabel bevat vijf veelgebruikte open-source modellen die zijn gescoord op standaard publieke benchmarks. MMLU meet brede algemene kennis; HumanEval meet de slaagpercentage bij codegeneratie.

ModelParametersUitgebrachtMMLUHumanEvalLicentieBeste voor
Llama 3.3 70B70BDec. 202486,088,4Llama 3.3 CommunityAlgemeen gebruik, meertalig
Qwen 2.5 72B72BSep. 202485,0+86,6Qwen LicenseWiskunde, programmeren, instructies
DeepSeek-V3671B (37B actief)Dec. 202487,182,6MITAlgemeen gebruik, programmeren, kostenefficiënt
Mistral Small 3.124BMrt. 202580,688,4Apache 2.0Agentische workflows, visie, meertalig
Gemma 3 27B27BMrt. 2025~78,687,8Gemma Terms of UseEnkele-GPU-implementatie, multimodaal

We vernieuwen deze tabel maandelijks.

Open-source LLM's "concurreren" niet meer met propriëtaire modellen -- op programmeren, wiskunde en taken met lange context winnen ze. Het verschil tussen een API-rekening van $200/maand en een zelf-gehost open model is nooit kleiner geweest.

Dit rangschikking snijdt door de hype heen. Elk model hier wordt geëvalueerd op benchmarks die er echt toe doen, op hardware die je daadwerkelijk nodig zult hebben, en op het specifieke gebruik waarbij elk model het helderst schijnt.

Snel overzicht: Welke open-source LLM moet je kiezen?

Heb je het allerbeste redeneren nodig? Kies Qwen 3 235B of DeepSeek R1. Wil je iets op één GPU draaien? Gemma 3 27B of Phi-4 14B. Verwerk je enorme documenten? Het 10M-tokenvenster van Llama 4 Scout is ongeëvenaard.

RangModelParameters (actief)Beste voorLicentieMin. VRAM
no. 1Qwen 3 235B-A22B235B (22B)Redeneren + programmerenApache 2.0~132 GB (Q4)
no. 2DeepSeek R1671B (37B)Diep redeneren + wiskundeMIT~136 GB (Q4)
no. 3Llama 4 Scout109B (17B)Lange context (10M tokens)Llama License~55 GB (Q4)
no. 4DeepSeek V3671B (37B)Algemeen + programmerenMIT~136 GB (Q4)
no. 5Mistral Large 3675B (41B)Meertalig + enterpriseApache 2.0~140 GB (Q4)
no. 6Gemma 3 27B27B (27B, dense)Enkele-GPU-implementatieOpen weights~16 GB (Q4)
no. 7Phi-4 Reasoning14B (14B, dense)Edge + mobiele apparatenMIT~8 GB (Q4)
no. 8GLM-4.7355B (32B)Agentische codeerworkflowsMIT~130 GB (Q4)

De VRAM-cijfers gaan uit van Q4-kwantisering. Vereisten voor volledige precisie zijn 2-4x hoger. Als je nieuw bent in het lokaal draaien van modellen, begin dan met Gemma 3 of Phi-4 -- dat zijn de meest hardwarevriendelijke opties op deze lijst.

Open-source LLM-leaderboard: juli 2026-rangschikking

Vanaf juli 2026 staat Qwen 3 235B-A22B bovenaan ons open-source LLM-leaderboard voor algeheel redeneren en programmeren, met DeepSeek R1 op de tweede plek voor diep wiskundig redeneren en Llama 4 Scout op de derde plek voor lange context. De volledige rangschikking hieronder omvat alle acht modellen uit deze gids, van datacenter-opstellingen tot laptopvriendelijke keuzes.

RangModelLicentieBeste voorMin. VRAM
no. 1Qwen 3 235B-A22BApache 2.0Redeneren + programmeren~132 GB (Q4)
no. 2DeepSeek R1MITDiep redeneren + wiskunde~136 GB (Q4)
no. 3Llama 4 ScoutLlama LicenseLange context (10M tokens)~55 GB (Q4)
no. 4DeepSeek V3MITAlgemeen + programmeren~136 GB (Q4)
no. 5Mistral Large 3Apache 2.0Meertalig + enterprise~140 GB (Q4)
no. 6Gemma 3 27BOpen weightsEnkele-GPU-implementatie~16 GB (Q4)
no. 7Phi-4 ReasoningMITEdge + mobiele apparaten~8 GB (Q4)
no. 8GLM-4.7MITAgentische codeerworkflows~130 GB (Q4)

Deze rangschikking weerspiegelt onze maandelijkse hercontrole van benchmarks, hardwarevereisten en licentievoorwaarden.

Laten we nu uitleggen wat elk model de moeite waard maakt.

1. Qwen 3 235B-A22B -- Beste open-source LLM overall

Alibaba's Qwen 3 235B-A22B is op dit moment het model om te verslaan. Het is een Mixture-of-Experts-architectuur met 235 miljard totale parameters, maar slechts 22 miljard worden per token geactiveerd -- waardoor de berekening met ongeveer 90% wordt verminderd vergeleken met een dense model van vergelijkbare kwaliteit.

Wat Qwen 3 onderscheidt, is zijn dubbele denkmodus. Je kunt schakelen tussen een "denkmodus" voor complexe wiskunde- en codeerproblemen (waarbij het model zijn redeneerproces toont) en een snelle "niet-denkmodus" voor snelle chatantwoorden. Die flexibiliteit doet er toe in productie.

Benchmark-hoogtepunten:

BenchmarkQwen 3 235B ScoreContext
AIME 202485,7%Wiskunde op competitieniveau
AIME 202581,5%Moeilijkere wiskundeproblemen
LiveCodeBench v570,7%Echte codeertaken
CodeForces2.056Competitief programmeren
BFCL v370,8%Functieaanroepen

Deze cijfers plaatsen het in dezelfde categorie als DeepSeek R1, OpenAI's o1 en Gemini 2.5 Pro -- behalve dat je het kunt downloaden, fine-tunen en overal inzetten onder Apache 2.0.

Hardwarevereisten: Het volledige model heeft ongeveer 132 GB VRAM nodig bij Q4-kwantisering. Dat is een multi-GPU-setup -- denk aan vijf RTX 3090's, drie A40's of een dual-H100-rig. Niet goedkoop, maar goed bereikbaar voor een startup of onderzoekslab. De Qwen 3-familie bevat ook kleinere varianten (32B, 14B, 8B, 4B) die op consumenten-hardware draaien.

Wie zou het moeten gebruiken: Teams die frontier-niveau redeneren en programmeren nodig hebben maar hun eigen infrastructuur willen beheersen. Bijzonder sterk voor meertalige workloads met 256K context en ondersteuning voor meer dan 100 talen. Als je van plan bent een model te fine-tunen voor jouw specifieke domein, geeft Qwen 3's Apache 2.0-licentie je volledige vrijheid.

2. DeepSeek R1 -- Beste voor diep redeneren

DeepSeek R1 veranderde begin 2025 het spel en bewees dat open-source modellen OpenAI's o1 konden evenaren op redeneer-taken. De R1-0528-update duwde de zaken nog verder -- AIME 2025-nauwkeurigheid sprong van 70% naar 87,5%.

Het geheim van het model is zijn trainingsmethode. DeepSeek maakte eerst R1-Zero met puur versterkt leren zonder gesuperviseerd fine-tuning-opwarmen. Het model ontwikkelde spontaan redeneren met gedachteketen, zelfverificatie en teruggrijpgedrag. Het leerde letterlijk zichzelf om zijn eigen werk te controleren.

Benchmark-hoogtepunten:

BenchmarkDeepSeek R1 ScoreContext
AIME 202587,5% (R1-0528)Wiskunde-olympiade
GPQA Diamond71,5%Wetenschap op postdoctoraal niveau
SWE-bench49,2%Echte software-engineering
HumanEval92,4%Codegeneratie

Hardwarevereisten: Dezelfde 671B MoE-architectuur als DeepSeek V3, dus je hebt ~136 GB VRAM nodig bij Q4. Maar hier is de praktische kant: DeepSeek bracht ook gedestilleerde varianten uit met 1,5B, 7B, 14B, 32B en 70B parameters. De 32B-destillatie draait op één RTX 4090 en presteert nog steeds beter dan veel grotere modellen op redeneer-taken.

Wie zou het moeten gebruiken: Iedereen die applicaties bouwt die stap-voor-stap redeneren vereisen -- stelling bewijzen, complex code debuggen, wetenschappelijke analyse. De gedestilleerde varianten zijn bijzonder nuttig als je redeneer-mogelijkheden nodig hebt met een beperkt budget. Bekijk de beste tools voor het lokaal draaien van LLM's als je de kleinere destillaties op je eigen hardware wilt inzetten.

3. Llama 4 Scout -- Beste voor lange context

Meta's Llama 4 Scout bracht iets werkelijk nieuws naar de open-source wereld: een contextvenster van 10 miljoen tokens. Dat is geen typfout. Je kunt er een volledige codebase, een plank met onderzoeksartikelen of 20 uur videotranscriptie in één enkele prompt in stoppen.

Scout gebruikt 16 MoE-experts met slechts 2 actief per token, waardoor het 109B totale parameters heeft maar slechts 17B actief. Meta beweert dat het op één H100 past met INT4-kwantisering, hoewel het 10M-tokenvenster uiteraard meer geheugen vereist voor de KV-cache.

Benchmark-hoogtepunten:

BenchmarkLlama 4 Scout ScoreContext
Needle-in-a-Haystack (10M)100%Perfecte terugvinding
MMLU79,6%Algemene kennis
HumanEval81,2%Codegeneratie
DocVQA85,1%Documentbegrip

Die perfecte Needle-in-a-Haystack-score bij 10M tokens is opmerkelijk. De meeste modellen beginnen informatie te verliezen ruim vóór 128K. Scout gebruikt een nieuwe inter-document aandachtsmaskeeringsaanpak die grenzen tussen documenten handhaaft, zelfs binnen zijn enorme contextvenster.

Hardwarevereisten: Bij Q4 hebben de modelgewichten ongeveer 55 GB VRAM nodig. Één H100 (80 GB) handelt dit comfortabel af. Voor consumenten-hardware kunnen twee RTX 4090's (48 GB totaal) kortere contextlengten beheren. Het addertje: het daadwerkelijk gebruiken van het volledige 10M-contextvenster vereist enorm veel extra KV-cache-geheugen bovenop de modelgewichten. In de praktijk begrenzen de meeste zelf-gehoste implementaties de context op 128K-256K tokens.

Wie zou het moeten gebruiken: Teams die werken met enorme documenten -- juridische analyse, Q&A over code-repositories, synthese van onderzoeksartikelen. De multimodale mogelijkheden (tekst + afbeeldinginvoer) zijn ook sterk. Wees gewoon realistisch over contextlengte: het plafond van 10M is echt, maar je hebt server-grade hardware nodig om het te bereiken.

4. DeepSeek V3 -- Beste algemene open-source LLM

Terwijl DeepSeek R1 de krantenkoppen haalt voor zijn redeneren, is DeepSeek V3 waarschijnlijk het praktischere model voor dagelijks gebruik. Het is het werkpaard -- snel, capabel op alle fronten, en opmerkelijk efficiënt voor zijn omvang.

V3 deelt dezelfde 671B MoE / 37B actieve architectuur als R1 maar ruilt diepe redeneerketens in voor snellere responstijden en bredere algemene mogelijkheden. De V3-0324-update incorporeerde versterkt-leren-technieken van R1's training, waardoor het redeneren verbeterde zonder de latentiehit van expliciete gedachteketen.

Benchmark-hoogtepunten:

BenchmarkDeepSeek V3 ScoreContext
MMLU87,1%Algemene kennis
HumanEval82,6%Codegeneratie
MATH90,2%Wiskundig redeneren
Contextvenster128KOndersteuning voor lange documenten

DeepSeek V3 overtreft GPT-4.5 op codeer- en wiskundebenchmarks. De trainingsefficiëntie is legendarisch -- slechts 2,788 miljoen H800 GPU-uren voor de volledige voortraining, een fractie van wat vergelijkbare modellen vereisen.

Hardwarevereisten: Identiek aan R1 (~136 GB VRAM bij Q4). Voor praktische inzetting draaien de GGUF-gekwantiseerde versies via llama.cpp of Ollama op multi-GPU consumenten-setups.

Wie zou het moeten gebruiken: Als je één model nodig hebt dat alles aankan -- chat, programmeren, analyse, vertaling, samenvatting -- is V3 de meest gebalanceerde keuze. Het zal R1 niet verslaan op moeilijk redeneren of Scout op contextlengte, maar het zal beide overtreffen op typische productie-workloads waar snelheid en veelzijdigheid meer tellen dan topprestaties op benchmarks.

5. Mistral Large 3 -- Beste voor meertalig en enterprise-gebruik

Mistral Large 3 bracht Mistral terug naar de frontier. Met 675B totale parameters (41B actief) is het een volledig MoE-model uitgebracht onder Apache 2.0 -- een enorme verschuiving weg van de restrictieve onderzoekslicentie van Mistral Large 2.

Het model werd van scratch getraind op 3.000 NVIDIA H200 GPU's, en dat is te zien. In de LMSYS Chatbot Arena stond het op no. 2 onder open modellen en no. 6 overall (inclusief propriëtaire modellen). Wat het bijzonder interessant maakt voor Europese teams is zijn meertalige kracht -- ongeveer 85,5% nauwkeurigheid op een gebalanceerde meertalige MMLU-test.

Benchmark-hoogtepunten:

BenchmarkMistral Large 3 ScoreContext
Meertalige MMLU85,5%Taaloverschrijdende kennis
LMSYS Arenano. 6 overallMenselijke voorkeur ranking
AIME 2025 (14B-variant)85%Wiskundig redeneren
Contextvenster128KOndersteuning voor lange documenten

Eén eigenschap die Mistral-modellen onderscheidt: ze zijn getraind om "Ik weet het niet" te zeggen in plaats van te hallucineren. Dat maakt Mistral Large 3 een sterke keuze voor RAG-pipelines en enterprise-applicaties waar feitelijke nauwkeurigheid belangrijker is dan creatieve output.

Hardwarevereisten: Met 675B totale parameters zijn VRAM-vereisten vergelijkbaar met DeepSeek (~140 GB bij Q4). Mistral biedt ook de 14B Small 3-variant, die op één consumenten-GPU past en duidelijk boven zijn gewicht presteert op redeneren en programmeren.

Wie zou het moeten gebruiken: Europese bedrijven die meertalige mogelijkheden en datasoevereiniteit nodig hebben. Enterprise-teams die RAG-systemen bouwen waarbij het verminderen van hallucinaties cruciaal is. De Apache 2.0-licentie elimineert commerciële wrijving volledig.

6. Gemma 3 27B -- Beste voor implementatie op één GPU

Google's Gemma 3 27B is het zoete midden tussen capaciteit en toegankelijkheid. Met 27 miljard parameters in een dense architectuur draait het op één enkele RTX 4090 met Q4-kwantisering. Geen multi-GPU-rigs, geen server-grade hardware -- gewoon een normale gamingkaart.

Laat je niet misleiden door het bescheiden parameteraantal. Gemma 3 27B presteert ver boven zijn gewicht, vooral op multimodale taken. Het verwerkt zowel tekst- als afbeeldinginvoer, ondersteunt meer dan 140 talen, en zijn 130K contextvenster is genereus voor een model van deze omvang.

Benchmark-hoogtepunten:

BenchmarkGemma 3 27B ScoreContext
MMLU78,6%Algemene kennis
DocVQA85,6%Documentbegrip
MGSM74,3%Meertalige wiskunde
ChartQA76,3%Visueel redeneren

Die multimodale scores (DocVQA 85,6%, ChartQA 76,3%) concurreren met modellen die 3-5 keer groter zijn. Voor ontwikkelaars die beeldbegrip nodig hebben zonder een GPU-cluster is Gemma 3 de voor de hand liggende keuze.

Hardwarevereisten: Ongeveer 16 GB VRAM bij Q4-kwantisering, 32 GB bij Q8. Één RTX 4090 (24 GB) verwerkt het comfortabel. Zelfs een M2 MacBook Pro met 32 GB unified memory kan het draaien. Als je onze gids voor het lokaal draaien van LLM's volgt, is Gemma 3 een van de makkelijkste modellen om mee te beginnen.

Wie zou het moeten gebruiken: Solo-ontwikkelaars, kleine teams en iedereen die een capabel multimodaal model wil zonder cloud-GPU's te huren. Het is ook uitstekend voor prototyping -- test je pipeline lokaal op Gemma 3, en schaal vervolgens op naar een groter model in productie als dat nodig is. Voor Google's nieuwere kleine model, zie onze Gemma 4 12B-gids.

7. Phi-4 Reasoning -- Beste voor edge en resource-beperkte implementaties

Microsoft's Phi-4 Reasoning bewijst dat parameteraantal niet alles is. Met slechts 14 miljard parameters overtreft het DeepSeek R1's 70B-destillatie op meerdere redeneer-benchmarks. De onlangs uitgebrachte Phi-4-reasoning-vision-15B voegt multimodale mogelijkheden toe en scoort 17% hoger dan Gemma 3 12B op wiskundig-visuele redeneer-taken.

Het geheim van de Phi-4-familie is de kwaliteit van de trainingsdata. Microsoft's aanpak geeft prioriteit aan gecureerde, hoogwaardige data boven ruwe schaal, en het werkt -- Phi-4 scoort meer dan 80% op MATH- en MGSM-benchmarks en overtreft Google's Gemini Pro en GPT-4o-mini op wiskundig redeneren.

Benchmark-hoogtepunten:

BenchmarkPhi-4 ScoreContext
MATH82,6%Wiskundig redeneren
HumanEval82,6%Codegeneratie
MGSM80%+Meertalige wiskunde
MathVista (vision)+17% vs Gemma 12BVisuele wiskunde

Hardwarevereisten: Ongeveer 8 GB VRAM bij Q4 -- dat is een laptop-GPU of zelfs een oudere desktopkaart. Het model draait comfortabel op Apple Silicon MacBooks, waardoor het echt draagbaar is. Voor edge-implementaties is het een van de weinige modellen die on-device kan draaien met redelijke latentie.

Wie zou het moeten gebruiken: Mobiele en edge-ontwikkelaars, teams die on-device AI-functies bouwen, en iedereen die sterk redeneren nodig heeft op minimale hardware. Phi-4 is ook een uitstekende keuze voor het evalueren van gefine-tunede modellen omdat zijn kleine omvang trainingsiteraties snel en goedkoop maakt. De MIT-licentie betekent geen commerciële beperkingen.

8. GLM-4.7 -- Beste voor agentisch programmeren

Z.ai's GLM-4.7 is doelgericht gebouwd voor een specifiek gebruik: agentische codeerworkflows waarbij het model moet redeneren, tools moet gebruiken en context moet bijhouden over lange meerstapsinteracties heen.

De architectuur is een 355B MoE met 32B actieve parameters, maar het opvallendste kenmerk is zijn drielaags denksysteem. In tegenstelling tot de meeste modellen die hun redeneerproces bij elke beurt opnieuw starten, behoudt GLM-4.7 denkblokken gedurende het hele gesprek. Die persistente redeneercontext maakt een echt verschil wanneer het model complexe meerstaps codeertaken orkestreert.

Benchmark-hoogtepunten:

BenchmarkGLM-4.7 ScoreContext
SWE-bench73,8%Echte software-engineering
HumanEval94,2%Codegeneratie
Contextvenster200KLange interacties
Max. output131K tokensUitgebreide generatie

Die 73,8% SWE-bench-score is vergelijkbaar met Claude Sonnet 4.5 -- op echte software-engineering taken, niet op synthetische benchmarks. En de 94,2% HumanEval is de hoogste score van elk model op deze lijst.

Hardwarevereisten: Vergelijkbaar met andere grote MoE-modellen (~130 GB VRAM bij Q4). Het 200K contextvenster en 131K max. output maken het geheugenintensief tijdens lange agentische sessies.

Wie zou het moeten gebruiken: AI-ondersteunde ontwikkelingsteams die codeeragenten, geautomatiseerde debugging-tools of code-review-systemen bouwen. Als je fine-tuning tools kiest voor een codeer-gericht model, is GLM-4.7 een sterke basis. De MIT-licentie staat volledig commercieel gebruik toe.

Beste open-source LLM voor programmeren (juli 2026)

Voor programmeren in juli 2026 is GLM-4.7 de beste open-source keuze, met een score van 94,2% op HumanEval en 73,8% op SWE-bench -- vergelijkbaar met Claude Sonnet 4.5 op echte softwaretaken. Op zoek naar een sterk codeermodel op consumenten-hardware? De DeepSeek R1 32B-destillatie draait op één RTX 4090.

Overweeg je de nieuwere GLM-release? Bekijk onze GLM 5.2-review voor een vergelijking.

Hoe te kiezen: beslissingsraamwerk

Het "beste" model hangt volledig af van jouw beperkingen. Gebruik deze matrix om je beslissing te verfijnen.

Als je nodig hebt...KiesWaarom
Beste overall redenerenQwen 3 235BTop wiskunde-, code- en algemene benchmarks
Diep gedankeketenDeepSeek R1Zelfcorrigerend redeneren, 87,5% AIME
Enorm contextvensterLlama 4 Scout10M tokens, perfecte terugvinding
Snel en algemeenDeepSeek V3Beste snelheid-kwaliteitsverhouding
Meertalig enterpriseMistral Large 385,5% meertalige MMLU, anti-hallucinatie
Enkele consumenten-GPUGemma 3 27B16 GB VRAM, sterk multimodaal
Laptop of edge-apparaatPhi-4 14B8 GB VRAM, MIT-licentie
CodeeragentenGLM-4.794,2% HumanEval, persistent redeneren

Nog steeds onzeker? Begin hier: Heb je multi-GPU hardware? Als nee, zijn Gemma 3 en Phi-4 je opties. Als ja, bouw je een codeeragent? Kies GLM-4.7 of DeepSeek R1. Lange context nodig? Llama 4 Scout. Al het andere? Qwen 3 235B is de veiligste standaardkeuze.

Hoe we deze modellen hebben gerangschikt

Rangschikkingen zijn niet gebaseerd op één benchmark. Elk model werd geëvalueerd op vijf dimensies:

  1. Benchmark-prestaties -- MMLU, HumanEval, AIME, SWE-bench en domeinspecifieke tests
  2. Hardware-toegankelijkheid -- Kunnen echte teams het daadwerkelijk inzetten?
  3. Licentievrijheid -- Apache 2.0 en MIT scoren hoger dan restrictieve licenties
  4. Ecosysteem-volwassenheid -- Beschikbaar op Hugging Face, Ollama, vLLM en grote inferentie-engines
  5. Praktijkadoptie -- Actieve community, productie-implementaties, doorlopende updates

Modellen die goed scoren op benchmarks maar een GPU-cluster vereisen die niemand heeft (denk aan 671B volledige precisie) worden bestraft. Modellen met restrictieve licenties die commercieel gebruik blokkeren verliezen ook punten. Het doel is praktische waarde, geen poespas over leaderboards.

Als je deze modellen zelf wilt testen, legt onze LLM-evaluatiegids uit hoe je systematische benchmarks opzet, en de samenvatting van beste evaluatietools behandelt de frameworks die je nodig hebt.

Veelgestelde vragen

Wat zijn de nieuwste open-source LLM's van 2026?

De top van 2026 wordt aangevoerd door Qwen 3 (Alibaba), DeepSeek R1 en V3, Llama 4 Scout (Meta), Mistral Large 3 en GLM-4.7 (Z.ai). Puntversies zoals DeepSeek R1-0528 en de Phi-4 reasoning-vision variant verschenen in de loop van 2026. We controleren deze lijst maandelijks en updaten de rangschikking wanneer een nieuwe release de volgorde wijzigt.

Hoe vaak wordt dit open-source LLM-leaderboard bijgewerkt?

Maandelijks. We herverifiëren benchmarkscores, VRAM-vereisten en licenties aan het begin van elke maand en voegen nieuwe modellen toe zodra ze uitkomen. De "Laatst bijgewerkt" datum onder de titel weerspiegelt de meest recente review.

Wat is de beste open-source LLM in 2026?

Qwen 3 235B-A22B leidt momenteel op het breedste bereik van benchmarks en combineert eersteklas redeneren, programmeren en meertalige mogelijkheden onder een Apache 2.0-licentie. Voor specifieke gebruiksgevallen zijn DeepSeek R1 (redeneren) en Llama 4 Scout (lange context) misschien betere keuzes.

Kan ik open-source LLM's draaien op consumenten-hardware?

Ja. Gemma 3 27B draait op één RTX 4090 (24 GB VRAM) en Phi-4 14B past op een laptop-GPU met 8 GB. Gekwantiseerde versies (Q4, Q8) van grotere modellen werken ook op multi-GPU consumenten-setups met tools als Ollama en llama.cpp.

Zijn open-source LLM's zo goed als ChatGPT of Claude?

Op programmeer- en wiskundebenchmarks evenaren of overtreffen de beste open-source modellen GPT-4.5 en benaderen ze de prestaties van Claude Sonnet 4.5. Het verschil is het kleinst bij gestructureerde taken (code, wiskunde, redeneren) en het grootst bij creatief schrijven en genuanceerd instructies opvolgen.

Wat betekent MoE (Mixture-of-Experts) voor hardware?

MoE-modellen hebben een groot totaal parameteraantal maar activeren slechts een fractie per token. Het volledige model moet echter in geheugen worden geladen zodat de router experts kan selecteren. Een 235B MoE-model met 22B actief heeft nog steeds 235B aan VRAM nodig -- je bespaart geen geheugen, je bespaart rekenwerk.

Welke open-source LLM is het beste voor programmeren?

GLM-4.7 leidt met 94,2% HumanEval en 73,8% SWE-bench. Voor pure codegeneratie staan DeepSeek R1 en Qwen 3 235B vlak achter. Voor programmeren op consumenten-hardware is de DeepSeek R1 32B-destillatie de beste verhouding van capaciteit tot kosten.

Is Llama 4 Scout's 10 miljoen tokencontext echt?

De architectuur ondersteunt het, en Meta demonstreerde perfecte Needle-in-a-Haystack-terugvinding bij 10M tokens. Maar het daadwerkelijk gebruiken van de volledige context vereist enorm KV-cache-geheugen. De meeste zelf-gehoste implementaties begrenzen de context realistisch op 128K-256K tokens. Cloudproviders zoals Together AI en Fireworks bieden langere contextvensters.

Welke licentie moet ik zoeken in een open-source LLM?

Apache 2.0 en MIT zijn de meest permissief -- volledig commercieel gebruik, aanpassing en herdistributie. Llama's aangepaste licentie staat commercieel gebruik toe maar heeft beperkingen voor apps met meer dan 700M gebruikers. Sommige "open-weight"-modellen (zoals Gemma) hebben specifieke voorwaarden -- lees altijd de licentie voor productie-implementaties.

Hoeveel VRAM heb ik nodig voor een 70B model?

Bij Q4-kwantisering heeft een dense 70B-model ongeveer 35-40 GB VRAM nodig. Één A100 (80 GB) verwerkt het gemakkelijk, of twee RTX 4090's (48 GB totaal). Bij volledige precisie (BF16) ben je boven de 140+ GB -- effectief vier A100's of equivalent vereist.

Kan ik open-source LLM's fine-tunen voor mijn gebruik?

Absoluut. QLoRA maakt het mogelijk om een 70B-model te fine-tunen op één 24 GB GPU. Kleinere modellen zoals Phi-4 en Gemma 3 zijn zelfs nog toegankelijker voor fine-tuning-experimenten. Apache 2.0 en MIT-gelicenseerde modellen hebben geen beperkingen op afgeleide werken.

Hoe zit het met open-source multimodale LLM's?

Gemma 3 27B en Llama 4 Scout verwerken beide native tekst- en afbeeldinginvoer. Phi-4-reasoning-vision-15B voegt visueel redeneren op kleinere schaal toe. Voor videobegrip ondersteunt Llama 4 Scout tot 20 uur video-invoer binnen zijn contextvenster.

Wat is op dit moment de beste open-source LLM?

Op dit moment is Qwen 3 235B-A22B de beste open-source LLM overall, met een voorsprong op redeneren en programmeren onder een Apache 2.0-licentie. Voor één consumenten-GPU is Gemma 3 27B (16 GB VRAM) de topkeuze, en GLM-4.7 wint voor codeeragenten met 94,2% HumanEval.

Bestaat er een open-source LLM-leaderboard?

Ja. Ons leaderboard van juli 2026 hierboven rangschikt alle acht modellen uit deze gids, en Hugging Face host het door de community beheerde Open LLM Leaderboard voor bredere dekking. We herverifiëren onze rangschikking maandelijks aan de hand van benchmarks zoals MMLU, HumanEval, AIME en SWE-bench.

Een tool kiezen is het makkelijke deel. Hem betrouwbaar in een echt product laten draaien, daar lopen de meeste teams vast, en dat is precies wat ons AI-integratieteam voor klanten bouwt, van RAG-pipelines tot maatwerkagents. Wil je een second opinion over je stack? Vraag een gratis adviesgesprek aan.

Bronnen

Tags

beste open source llm 2026open source llmllama 4qwen 3deepseekgemma 3phi-4zelf-gehost llmlokaal llm

Dit artikel delen

Start je project

Klaar om iets buitengewoons te bouwen?

Laten we je idee werkelijkheid maken. Ons team staat klaar om software te bouwen die het verschil maakt.