
De beste open-source LLM's van 2026: 8 modellen gerangschikt op echte prestaties
Laatst bijgewerkt: 5 juli 2026. Elke benchmarkscore, elk VRAM-getal en elke licentie in deze gids is voor deze update opnieuw geverifieerd. De onderstaande ranking weerspiegelt open-weight modellen uitgebracht tot medio 2026 — als een nieuwe release de volgorde verandert, wordt deze pagina binnen de maand bijgewerkt.
De beste open-source LLM van 2026 is Qwen 3 235B-A22B voor algemeen redeneren en programmeren, met DeepSeek R1 als koploper op diep wiskundig redeneren en Llama 4 Scout op lange context (10M tokens). Voor één consument-GPU zijn Gemma 3 27B (16 GB VRAM) en Phi-4 14B (8 GB) het makkelijkst zelf te hosten. Alle drie topmodellen evenaren GPT-4-prestaties op code en wiskunde terwijl ze gratis te deployen zijn.
Toonaangevende open-source LLM's: benchmark-overzicht
De onderstaande tabel bevat vijf veelgebruikte open-source modellen die zijn gescoord op standaard publieke benchmarks. MMLU meet brede algemene kennis; HumanEval meet de slaagpercentage bij codegeneratie.
| Model | Parameters | Uitgebracht | MMLU | HumanEval | Licentie | Beste voor |
|---|---|---|---|---|---|---|
| Llama 3.3 70B | 70B | Dec. 2024 | 86,0 | 88,4 | Llama 3.3 Community | Algemeen gebruik, meertalig |
| Qwen 2.5 72B | 72B | Sep. 2024 | 85,0+ | 86,6 | Qwen License | Wiskunde, programmeren, instructies |
| DeepSeek-V3 | 671B (37B actief) | Dec. 2024 | 87,1 | 82,6 | MIT | Algemeen gebruik, programmeren, kostenefficiënt |
| Mistral Small 3.1 | 24B | Mrt. 2025 | 80,6 | 88,4 | Apache 2.0 | Agentische workflows, visie, meertalig |
| Gemma 3 27B | 27B | Mrt. 2025 | ~78,6 | 87,8 | Gemma Terms of Use | Enkele-GPU-implementatie, multimodaal |
We vernieuwen deze tabel maandelijks.
Open-source LLM's "concurreren" niet meer met propriëtaire modellen -- op programmeren, wiskunde en taken met lange context winnen ze. Het verschil tussen een API-rekening van $200/maand en een zelf-gehost open model is nooit kleiner geweest.
Dit rangschikking snijdt door de hype heen. Elk model hier wordt geëvalueerd op benchmarks die er echt toe doen, op hardware die je daadwerkelijk nodig zult hebben, en op het specifieke gebruik waarbij elk model het helderst schijnt.
Snel overzicht: Welke open-source LLM moet je kiezen?
Heb je het allerbeste redeneren nodig? Kies Qwen 3 235B of DeepSeek R1. Wil je iets op één GPU draaien? Gemma 3 27B of Phi-4 14B. Verwerk je enorme documenten? Het 10M-tokenvenster van Llama 4 Scout is ongeëvenaard.
| Rang | Model | Parameters (actief) | Beste voor | Licentie | Min. VRAM |
|---|---|---|---|---|---|
| no. 1 | Qwen 3 235B-A22B | 235B (22B) | Redeneren + programmeren | Apache 2.0 | ~132 GB (Q4) |
| no. 2 | DeepSeek R1 | 671B (37B) | Diep redeneren + wiskunde | MIT | ~136 GB (Q4) |
| no. 3 | Llama 4 Scout | 109B (17B) | Lange context (10M tokens) | Llama License | ~55 GB (Q4) |
| no. 4 | DeepSeek V3 | 671B (37B) | Algemeen + programmeren | MIT | ~136 GB (Q4) |
| no. 5 | Mistral Large 3 | 675B (41B) | Meertalig + enterprise | Apache 2.0 | ~140 GB (Q4) |
| no. 6 | Gemma 3 27B | 27B (27B, dense) | Enkele-GPU-implementatie | Open weights | ~16 GB (Q4) |
| no. 7 | Phi-4 Reasoning | 14B (14B, dense) | Edge + mobiele apparaten | MIT | ~8 GB (Q4) |
| no. 8 | GLM-4.7 | 355B (32B) | Agentische codeerworkflows | MIT | ~130 GB (Q4) |
De VRAM-cijfers gaan uit van Q4-kwantisering. Vereisten voor volledige precisie zijn 2-4x hoger. Als je nieuw bent in het lokaal draaien van modellen, begin dan met Gemma 3 of Phi-4 -- dat zijn de meest hardwarevriendelijke opties op deze lijst.
Open-source LLM-leaderboard: juli 2026-rangschikking
Vanaf juli 2026 staat Qwen 3 235B-A22B bovenaan ons open-source LLM-leaderboard voor algeheel redeneren en programmeren, met DeepSeek R1 op de tweede plek voor diep wiskundig redeneren en Llama 4 Scout op de derde plek voor lange context. De volledige rangschikking hieronder omvat alle acht modellen uit deze gids, van datacenter-opstellingen tot laptopvriendelijke keuzes.
| Rang | Model | Licentie | Beste voor | Min. VRAM |
|---|---|---|---|---|
| no. 1 | Qwen 3 235B-A22B | Apache 2.0 | Redeneren + programmeren | ~132 GB (Q4) |
| no. 2 | DeepSeek R1 | MIT | Diep redeneren + wiskunde | ~136 GB (Q4) |
| no. 3 | Llama 4 Scout | Llama License | Lange context (10M tokens) | ~55 GB (Q4) |
| no. 4 | DeepSeek V3 | MIT | Algemeen + programmeren | ~136 GB (Q4) |
| no. 5 | Mistral Large 3 | Apache 2.0 | Meertalig + enterprise | ~140 GB (Q4) |
| no. 6 | Gemma 3 27B | Open weights | Enkele-GPU-implementatie | ~16 GB (Q4) |
| no. 7 | Phi-4 Reasoning | MIT | Edge + mobiele apparaten | ~8 GB (Q4) |
| no. 8 | GLM-4.7 | MIT | Agentische codeerworkflows | ~130 GB (Q4) |
Deze rangschikking weerspiegelt onze maandelijkse hercontrole van benchmarks, hardwarevereisten en licentievoorwaarden.
Laten we nu uitleggen wat elk model de moeite waard maakt.
1. Qwen 3 235B-A22B -- Beste open-source LLM overall
Alibaba's Qwen 3 235B-A22B is op dit moment het model om te verslaan. Het is een Mixture-of-Experts-architectuur met 235 miljard totale parameters, maar slechts 22 miljard worden per token geactiveerd -- waardoor de berekening met ongeveer 90% wordt verminderd vergeleken met een dense model van vergelijkbare kwaliteit.
Wat Qwen 3 onderscheidt, is zijn dubbele denkmodus. Je kunt schakelen tussen een "denkmodus" voor complexe wiskunde- en codeerproblemen (waarbij het model zijn redeneerproces toont) en een snelle "niet-denkmodus" voor snelle chatantwoorden. Die flexibiliteit doet er toe in productie.
Benchmark-hoogtepunten:
| Benchmark | Qwen 3 235B Score | Context |
|---|---|---|
| AIME 2024 | 85,7% | Wiskunde op competitieniveau |
| AIME 2025 | 81,5% | Moeilijkere wiskundeproblemen |
| LiveCodeBench v5 | 70,7% | Echte codeertaken |
| CodeForces | 2.056 | Competitief programmeren |
| BFCL v3 | 70,8% | Functieaanroepen |
Deze cijfers plaatsen het in dezelfde categorie als DeepSeek R1, OpenAI's o1 en Gemini 2.5 Pro -- behalve dat je het kunt downloaden, fine-tunen en overal inzetten onder Apache 2.0.
Hardwarevereisten: Het volledige model heeft ongeveer 132 GB VRAM nodig bij Q4-kwantisering. Dat is een multi-GPU-setup -- denk aan vijf RTX 3090's, drie A40's of een dual-H100-rig. Niet goedkoop, maar goed bereikbaar voor een startup of onderzoekslab. De Qwen 3-familie bevat ook kleinere varianten (32B, 14B, 8B, 4B) die op consumenten-hardware draaien.
Wie zou het moeten gebruiken: Teams die frontier-niveau redeneren en programmeren nodig hebben maar hun eigen infrastructuur willen beheersen. Bijzonder sterk voor meertalige workloads met 256K context en ondersteuning voor meer dan 100 talen. Als je van plan bent een model te fine-tunen voor jouw specifieke domein, geeft Qwen 3's Apache 2.0-licentie je volledige vrijheid.
2. DeepSeek R1 -- Beste voor diep redeneren
DeepSeek R1 veranderde begin 2025 het spel en bewees dat open-source modellen OpenAI's o1 konden evenaren op redeneer-taken. De R1-0528-update duwde de zaken nog verder -- AIME 2025-nauwkeurigheid sprong van 70% naar 87,5%.
Het geheim van het model is zijn trainingsmethode. DeepSeek maakte eerst R1-Zero met puur versterkt leren zonder gesuperviseerd fine-tuning-opwarmen. Het model ontwikkelde spontaan redeneren met gedachteketen, zelfverificatie en teruggrijpgedrag. Het leerde letterlijk zichzelf om zijn eigen werk te controleren.
Benchmark-hoogtepunten:
| Benchmark | DeepSeek R1 Score | Context |
|---|---|---|
| AIME 2025 | 87,5% (R1-0528) | Wiskunde-olympiade |
| GPQA Diamond | 71,5% | Wetenschap op postdoctoraal niveau |
| SWE-bench | 49,2% | Echte software-engineering |
| HumanEval | 92,4% | Codegeneratie |
Hardwarevereisten: Dezelfde 671B MoE-architectuur als DeepSeek V3, dus je hebt ~136 GB VRAM nodig bij Q4. Maar hier is de praktische kant: DeepSeek bracht ook gedestilleerde varianten uit met 1,5B, 7B, 14B, 32B en 70B parameters. De 32B-destillatie draait op één RTX 4090 en presteert nog steeds beter dan veel grotere modellen op redeneer-taken.
Wie zou het moeten gebruiken: Iedereen die applicaties bouwt die stap-voor-stap redeneren vereisen -- stelling bewijzen, complex code debuggen, wetenschappelijke analyse. De gedestilleerde varianten zijn bijzonder nuttig als je redeneer-mogelijkheden nodig hebt met een beperkt budget. Bekijk de beste tools voor het lokaal draaien van LLM's als je de kleinere destillaties op je eigen hardware wilt inzetten.
3. Llama 4 Scout -- Beste voor lange context
Meta's Llama 4 Scout bracht iets werkelijk nieuws naar de open-source wereld: een contextvenster van 10 miljoen tokens. Dat is geen typfout. Je kunt er een volledige codebase, een plank met onderzoeksartikelen of 20 uur videotranscriptie in één enkele prompt in stoppen.
Scout gebruikt 16 MoE-experts met slechts 2 actief per token, waardoor het 109B totale parameters heeft maar slechts 17B actief. Meta beweert dat het op één H100 past met INT4-kwantisering, hoewel het 10M-tokenvenster uiteraard meer geheugen vereist voor de KV-cache.
Benchmark-hoogtepunten:
| Benchmark | Llama 4 Scout Score | Context |
|---|---|---|
| Needle-in-a-Haystack (10M) | 100% | Perfecte terugvinding |
| MMLU | 79,6% | Algemene kennis |
| HumanEval | 81,2% | Codegeneratie |
| DocVQA | 85,1% | Documentbegrip |
Die perfecte Needle-in-a-Haystack-score bij 10M tokens is opmerkelijk. De meeste modellen beginnen informatie te verliezen ruim vóór 128K. Scout gebruikt een nieuwe inter-document aandachtsmaskeeringsaanpak die grenzen tussen documenten handhaaft, zelfs binnen zijn enorme contextvenster.
Hardwarevereisten: Bij Q4 hebben de modelgewichten ongeveer 55 GB VRAM nodig. Één H100 (80 GB) handelt dit comfortabel af. Voor consumenten-hardware kunnen twee RTX 4090's (48 GB totaal) kortere contextlengten beheren. Het addertje: het daadwerkelijk gebruiken van het volledige 10M-contextvenster vereist enorm veel extra KV-cache-geheugen bovenop de modelgewichten. In de praktijk begrenzen de meeste zelf-gehoste implementaties de context op 128K-256K tokens.
Wie zou het moeten gebruiken: Teams die werken met enorme documenten -- juridische analyse, Q&A over code-repositories, synthese van onderzoeksartikelen. De multimodale mogelijkheden (tekst + afbeeldinginvoer) zijn ook sterk. Wees gewoon realistisch over contextlengte: het plafond van 10M is echt, maar je hebt server-grade hardware nodig om het te bereiken.
4. DeepSeek V3 -- Beste algemene open-source LLM
Terwijl DeepSeek R1 de krantenkoppen haalt voor zijn redeneren, is DeepSeek V3 waarschijnlijk het praktischere model voor dagelijks gebruik. Het is het werkpaard -- snel, capabel op alle fronten, en opmerkelijk efficiënt voor zijn omvang.
V3 deelt dezelfde 671B MoE / 37B actieve architectuur als R1 maar ruilt diepe redeneerketens in voor snellere responstijden en bredere algemene mogelijkheden. De V3-0324-update incorporeerde versterkt-leren-technieken van R1's training, waardoor het redeneren verbeterde zonder de latentiehit van expliciete gedachteketen.
Benchmark-hoogtepunten:
| Benchmark | DeepSeek V3 Score | Context |
|---|---|---|
| MMLU | 87,1% | Algemene kennis |
| HumanEval | 82,6% | Codegeneratie |
| MATH | 90,2% | Wiskundig redeneren |
| Contextvenster | 128K | Ondersteuning voor lange documenten |
DeepSeek V3 overtreft GPT-4.5 op codeer- en wiskundebenchmarks. De trainingsefficiëntie is legendarisch -- slechts 2,788 miljoen H800 GPU-uren voor de volledige voortraining, een fractie van wat vergelijkbare modellen vereisen.
Hardwarevereisten: Identiek aan R1 (~136 GB VRAM bij Q4). Voor praktische inzetting draaien de GGUF-gekwantiseerde versies via llama.cpp of Ollama op multi-GPU consumenten-setups.
Wie zou het moeten gebruiken: Als je één model nodig hebt dat alles aankan -- chat, programmeren, analyse, vertaling, samenvatting -- is V3 de meest gebalanceerde keuze. Het zal R1 niet verslaan op moeilijk redeneren of Scout op contextlengte, maar het zal beide overtreffen op typische productie-workloads waar snelheid en veelzijdigheid meer tellen dan topprestaties op benchmarks.
5. Mistral Large 3 -- Beste voor meertalig en enterprise-gebruik
Mistral Large 3 bracht Mistral terug naar de frontier. Met 675B totale parameters (41B actief) is het een volledig MoE-model uitgebracht onder Apache 2.0 -- een enorme verschuiving weg van de restrictieve onderzoekslicentie van Mistral Large 2.
Het model werd van scratch getraind op 3.000 NVIDIA H200 GPU's, en dat is te zien. In de LMSYS Chatbot Arena stond het op no. 2 onder open modellen en no. 6 overall (inclusief propriëtaire modellen). Wat het bijzonder interessant maakt voor Europese teams is zijn meertalige kracht -- ongeveer 85,5% nauwkeurigheid op een gebalanceerde meertalige MMLU-test.
Benchmark-hoogtepunten:
| Benchmark | Mistral Large 3 Score | Context |
|---|---|---|
| Meertalige MMLU | 85,5% | Taaloverschrijdende kennis |
| LMSYS Arena | no. 6 overall | Menselijke voorkeur ranking |
| AIME 2025 (14B-variant) | 85% | Wiskundig redeneren |
| Contextvenster | 128K | Ondersteuning voor lange documenten |
Eén eigenschap die Mistral-modellen onderscheidt: ze zijn getraind om "Ik weet het niet" te zeggen in plaats van te hallucineren. Dat maakt Mistral Large 3 een sterke keuze voor RAG-pipelines en enterprise-applicaties waar feitelijke nauwkeurigheid belangrijker is dan creatieve output.
Hardwarevereisten: Met 675B totale parameters zijn VRAM-vereisten vergelijkbaar met DeepSeek (~140 GB bij Q4). Mistral biedt ook de 14B Small 3-variant, die op één consumenten-GPU past en duidelijk boven zijn gewicht presteert op redeneren en programmeren.
Wie zou het moeten gebruiken: Europese bedrijven die meertalige mogelijkheden en datasoevereiniteit nodig hebben. Enterprise-teams die RAG-systemen bouwen waarbij het verminderen van hallucinaties cruciaal is. De Apache 2.0-licentie elimineert commerciële wrijving volledig.
6. Gemma 3 27B -- Beste voor implementatie op één GPU
Google's Gemma 3 27B is het zoete midden tussen capaciteit en toegankelijkheid. Met 27 miljard parameters in een dense architectuur draait het op één enkele RTX 4090 met Q4-kwantisering. Geen multi-GPU-rigs, geen server-grade hardware -- gewoon een normale gamingkaart.
Laat je niet misleiden door het bescheiden parameteraantal. Gemma 3 27B presteert ver boven zijn gewicht, vooral op multimodale taken. Het verwerkt zowel tekst- als afbeeldinginvoer, ondersteunt meer dan 140 talen, en zijn 130K contextvenster is genereus voor een model van deze omvang.
Benchmark-hoogtepunten:
| Benchmark | Gemma 3 27B Score | Context |
|---|---|---|
| MMLU | 78,6% | Algemene kennis |
| DocVQA | 85,6% | Documentbegrip |
| MGSM | 74,3% | Meertalige wiskunde |
| ChartQA | 76,3% | Visueel redeneren |
Die multimodale scores (DocVQA 85,6%, ChartQA 76,3%) concurreren met modellen die 3-5 keer groter zijn. Voor ontwikkelaars die beeldbegrip nodig hebben zonder een GPU-cluster is Gemma 3 de voor de hand liggende keuze.
Hardwarevereisten: Ongeveer 16 GB VRAM bij Q4-kwantisering, 32 GB bij Q8. Één RTX 4090 (24 GB) verwerkt het comfortabel. Zelfs een M2 MacBook Pro met 32 GB unified memory kan het draaien. Als je onze gids voor het lokaal draaien van LLM's volgt, is Gemma 3 een van de makkelijkste modellen om mee te beginnen.
Wie zou het moeten gebruiken: Solo-ontwikkelaars, kleine teams en iedereen die een capabel multimodaal model wil zonder cloud-GPU's te huren. Het is ook uitstekend voor prototyping -- test je pipeline lokaal op Gemma 3, en schaal vervolgens op naar een groter model in productie als dat nodig is. Voor Google's nieuwere kleine model, zie onze Gemma 4 12B-gids.
7. Phi-4 Reasoning -- Beste voor edge en resource-beperkte implementaties
Microsoft's Phi-4 Reasoning bewijst dat parameteraantal niet alles is. Met slechts 14 miljard parameters overtreft het DeepSeek R1's 70B-destillatie op meerdere redeneer-benchmarks. De onlangs uitgebrachte Phi-4-reasoning-vision-15B voegt multimodale mogelijkheden toe en scoort 17% hoger dan Gemma 3 12B op wiskundig-visuele redeneer-taken.
Het geheim van de Phi-4-familie is de kwaliteit van de trainingsdata. Microsoft's aanpak geeft prioriteit aan gecureerde, hoogwaardige data boven ruwe schaal, en het werkt -- Phi-4 scoort meer dan 80% op MATH- en MGSM-benchmarks en overtreft Google's Gemini Pro en GPT-4o-mini op wiskundig redeneren.
Benchmark-hoogtepunten:
| Benchmark | Phi-4 Score | Context |
|---|---|---|
| MATH | 82,6% | Wiskundig redeneren |
| HumanEval | 82,6% | Codegeneratie |
| MGSM | 80%+ | Meertalige wiskunde |
| MathVista (vision) | +17% vs Gemma 12B | Visuele wiskunde |
Hardwarevereisten: Ongeveer 8 GB VRAM bij Q4 -- dat is een laptop-GPU of zelfs een oudere desktopkaart. Het model draait comfortabel op Apple Silicon MacBooks, waardoor het echt draagbaar is. Voor edge-implementaties is het een van de weinige modellen die on-device kan draaien met redelijke latentie.
Wie zou het moeten gebruiken: Mobiele en edge-ontwikkelaars, teams die on-device AI-functies bouwen, en iedereen die sterk redeneren nodig heeft op minimale hardware. Phi-4 is ook een uitstekende keuze voor het evalueren van gefine-tunede modellen omdat zijn kleine omvang trainingsiteraties snel en goedkoop maakt. De MIT-licentie betekent geen commerciële beperkingen.
8. GLM-4.7 -- Beste voor agentisch programmeren
Z.ai's GLM-4.7 is doelgericht gebouwd voor een specifiek gebruik: agentische codeerworkflows waarbij het model moet redeneren, tools moet gebruiken en context moet bijhouden over lange meerstapsinteracties heen.
De architectuur is een 355B MoE met 32B actieve parameters, maar het opvallendste kenmerk is zijn drielaags denksysteem. In tegenstelling tot de meeste modellen die hun redeneerproces bij elke beurt opnieuw starten, behoudt GLM-4.7 denkblokken gedurende het hele gesprek. Die persistente redeneercontext maakt een echt verschil wanneer het model complexe meerstaps codeertaken orkestreert.
Benchmark-hoogtepunten:
| Benchmark | GLM-4.7 Score | Context |
|---|---|---|
| SWE-bench | 73,8% | Echte software-engineering |
| HumanEval | 94,2% | Codegeneratie |
| Contextvenster | 200K | Lange interacties |
| Max. output | 131K tokens | Uitgebreide generatie |
Die 73,8% SWE-bench-score is vergelijkbaar met Claude Sonnet 4.5 -- op echte software-engineering taken, niet op synthetische benchmarks. En de 94,2% HumanEval is de hoogste score van elk model op deze lijst.
Hardwarevereisten: Vergelijkbaar met andere grote MoE-modellen (~130 GB VRAM bij Q4). Het 200K contextvenster en 131K max. output maken het geheugenintensief tijdens lange agentische sessies.
Wie zou het moeten gebruiken: AI-ondersteunde ontwikkelingsteams die codeeragenten, geautomatiseerde debugging-tools of code-review-systemen bouwen. Als je fine-tuning tools kiest voor een codeer-gericht model, is GLM-4.7 een sterke basis. De MIT-licentie staat volledig commercieel gebruik toe.
Beste open-source LLM voor programmeren (juli 2026)
Voor programmeren in juli 2026 is GLM-4.7 de beste open-source keuze, met een score van 94,2% op HumanEval en 73,8% op SWE-bench -- vergelijkbaar met Claude Sonnet 4.5 op echte softwaretaken. Op zoek naar een sterk codeermodel op consumenten-hardware? De DeepSeek R1 32B-destillatie draait op één RTX 4090.
Overweeg je de nieuwere GLM-release? Bekijk onze GLM 5.2-review voor een vergelijking.
Hoe te kiezen: beslissingsraamwerk
Het "beste" model hangt volledig af van jouw beperkingen. Gebruik deze matrix om je beslissing te verfijnen.
| Als je nodig hebt... | Kies | Waarom |
|---|---|---|
| Beste overall redeneren | Qwen 3 235B | Top wiskunde-, code- en algemene benchmarks |
| Diep gedankeketen | DeepSeek R1 | Zelfcorrigerend redeneren, 87,5% AIME |
| Enorm contextvenster | Llama 4 Scout | 10M tokens, perfecte terugvinding |
| Snel en algemeen | DeepSeek V3 | Beste snelheid-kwaliteitsverhouding |
| Meertalig enterprise | Mistral Large 3 | 85,5% meertalige MMLU, anti-hallucinatie |
| Enkele consumenten-GPU | Gemma 3 27B | 16 GB VRAM, sterk multimodaal |
| Laptop of edge-apparaat | Phi-4 14B | 8 GB VRAM, MIT-licentie |
| Codeeragenten | GLM-4.7 | 94,2% HumanEval, persistent redeneren |
Nog steeds onzeker? Begin hier: Heb je multi-GPU hardware? Als nee, zijn Gemma 3 en Phi-4 je opties. Als ja, bouw je een codeeragent? Kies GLM-4.7 of DeepSeek R1. Lange context nodig? Llama 4 Scout. Al het andere? Qwen 3 235B is de veiligste standaardkeuze.
Hoe we deze modellen hebben gerangschikt
Rangschikkingen zijn niet gebaseerd op één benchmark. Elk model werd geëvalueerd op vijf dimensies:
- Benchmark-prestaties -- MMLU, HumanEval, AIME, SWE-bench en domeinspecifieke tests
- Hardware-toegankelijkheid -- Kunnen echte teams het daadwerkelijk inzetten?
- Licentievrijheid -- Apache 2.0 en MIT scoren hoger dan restrictieve licenties
- Ecosysteem-volwassenheid -- Beschikbaar op Hugging Face, Ollama, vLLM en grote inferentie-engines
- Praktijkadoptie -- Actieve community, productie-implementaties, doorlopende updates
Modellen die goed scoren op benchmarks maar een GPU-cluster vereisen die niemand heeft (denk aan 671B volledige precisie) worden bestraft. Modellen met restrictieve licenties die commercieel gebruik blokkeren verliezen ook punten. Het doel is praktische waarde, geen poespas over leaderboards.
Als je deze modellen zelf wilt testen, legt onze LLM-evaluatiegids uit hoe je systematische benchmarks opzet, en de samenvatting van beste evaluatietools behandelt de frameworks die je nodig hebt.
Veelgestelde vragen
Wat zijn de nieuwste open-source LLM's van 2026?
De top van 2026 wordt aangevoerd door Qwen 3 (Alibaba), DeepSeek R1 en V3, Llama 4 Scout (Meta), Mistral Large 3 en GLM-4.7 (Z.ai). Puntversies zoals DeepSeek R1-0528 en de Phi-4 reasoning-vision variant verschenen in de loop van 2026. We controleren deze lijst maandelijks en updaten de rangschikking wanneer een nieuwe release de volgorde wijzigt.
Hoe vaak wordt dit open-source LLM-leaderboard bijgewerkt?
Maandelijks. We herverifiëren benchmarkscores, VRAM-vereisten en licenties aan het begin van elke maand en voegen nieuwe modellen toe zodra ze uitkomen. De "Laatst bijgewerkt" datum onder de titel weerspiegelt de meest recente review.
Wat is de beste open-source LLM in 2026?
Qwen 3 235B-A22B leidt momenteel op het breedste bereik van benchmarks en combineert eersteklas redeneren, programmeren en meertalige mogelijkheden onder een Apache 2.0-licentie. Voor specifieke gebruiksgevallen zijn DeepSeek R1 (redeneren) en Llama 4 Scout (lange context) misschien betere keuzes.
Kan ik open-source LLM's draaien op consumenten-hardware?
Ja. Gemma 3 27B draait op één RTX 4090 (24 GB VRAM) en Phi-4 14B past op een laptop-GPU met 8 GB. Gekwantiseerde versies (Q4, Q8) van grotere modellen werken ook op multi-GPU consumenten-setups met tools als Ollama en llama.cpp.
Zijn open-source LLM's zo goed als ChatGPT of Claude?
Op programmeer- en wiskundebenchmarks evenaren of overtreffen de beste open-source modellen GPT-4.5 en benaderen ze de prestaties van Claude Sonnet 4.5. Het verschil is het kleinst bij gestructureerde taken (code, wiskunde, redeneren) en het grootst bij creatief schrijven en genuanceerd instructies opvolgen.
Wat betekent MoE (Mixture-of-Experts) voor hardware?
MoE-modellen hebben een groot totaal parameteraantal maar activeren slechts een fractie per token. Het volledige model moet echter in geheugen worden geladen zodat de router experts kan selecteren. Een 235B MoE-model met 22B actief heeft nog steeds 235B aan VRAM nodig -- je bespaart geen geheugen, je bespaart rekenwerk.
Welke open-source LLM is het beste voor programmeren?
GLM-4.7 leidt met 94,2% HumanEval en 73,8% SWE-bench. Voor pure codegeneratie staan DeepSeek R1 en Qwen 3 235B vlak achter. Voor programmeren op consumenten-hardware is de DeepSeek R1 32B-destillatie de beste verhouding van capaciteit tot kosten.
Is Llama 4 Scout's 10 miljoen tokencontext echt?
De architectuur ondersteunt het, en Meta demonstreerde perfecte Needle-in-a-Haystack-terugvinding bij 10M tokens. Maar het daadwerkelijk gebruiken van de volledige context vereist enorm KV-cache-geheugen. De meeste zelf-gehoste implementaties begrenzen de context realistisch op 128K-256K tokens. Cloudproviders zoals Together AI en Fireworks bieden langere contextvensters.
Welke licentie moet ik zoeken in een open-source LLM?
Apache 2.0 en MIT zijn de meest permissief -- volledig commercieel gebruik, aanpassing en herdistributie. Llama's aangepaste licentie staat commercieel gebruik toe maar heeft beperkingen voor apps met meer dan 700M gebruikers. Sommige "open-weight"-modellen (zoals Gemma) hebben specifieke voorwaarden -- lees altijd de licentie voor productie-implementaties.
Hoeveel VRAM heb ik nodig voor een 70B model?
Bij Q4-kwantisering heeft een dense 70B-model ongeveer 35-40 GB VRAM nodig. Één A100 (80 GB) verwerkt het gemakkelijk, of twee RTX 4090's (48 GB totaal). Bij volledige precisie (BF16) ben je boven de 140+ GB -- effectief vier A100's of equivalent vereist.
Kan ik open-source LLM's fine-tunen voor mijn gebruik?
Absoluut. QLoRA maakt het mogelijk om een 70B-model te fine-tunen op één 24 GB GPU. Kleinere modellen zoals Phi-4 en Gemma 3 zijn zelfs nog toegankelijker voor fine-tuning-experimenten. Apache 2.0 en MIT-gelicenseerde modellen hebben geen beperkingen op afgeleide werken.
Hoe zit het met open-source multimodale LLM's?
Gemma 3 27B en Llama 4 Scout verwerken beide native tekst- en afbeeldinginvoer. Phi-4-reasoning-vision-15B voegt visueel redeneren op kleinere schaal toe. Voor videobegrip ondersteunt Llama 4 Scout tot 20 uur video-invoer binnen zijn contextvenster.
Wat is op dit moment de beste open-source LLM?
Op dit moment is Qwen 3 235B-A22B de beste open-source LLM overall, met een voorsprong op redeneren en programmeren onder een Apache 2.0-licentie. Voor één consumenten-GPU is Gemma 3 27B (16 GB VRAM) de topkeuze, en GLM-4.7 wint voor codeeragenten met 94,2% HumanEval.
Bestaat er een open-source LLM-leaderboard?
Ja. Ons leaderboard van juli 2026 hierboven rangschikt alle acht modellen uit deze gids, en Hugging Face host het door de community beheerde Open LLM Leaderboard voor bredere dekking. We herverifiëren onze rangschikking maandelijks aan de hand van benchmarks zoals MMLU, HumanEval, AIME en SWE-bench.
Een tool kiezen is het makkelijke deel. Hem betrouwbaar in een echt product laten draaien, daar lopen de meeste teams vast, en dat is precies wat ons AI-integratieteam voor klanten bouwt, van RAG-pipelines tot maatwerkagents. Wil je een second opinion over je stack? Vraag een gratis adviesgesprek aan.