
Die besten Open-Source-LLMs 2026: 8 Modelle im Ranking nach echter Leistung
Zuletzt aktualisiert: 5. Juli 2026. Jeder Benchmark-Wert, jede VRAM-Angabe und jede Lizenz in diesem Leitfaden wurde für dieses Update erneut überprüft. Das folgende Ranking berücksichtigt quelloffene Modelle, die bis Mitte 2026 veröffentlicht wurden — ändert eine Neuerscheinung die Reihenfolge, wird diese Seite innerhalb eines Monats aktualisiert.
Das beste Open-Source-LLM 2026 ist Qwen 3 235B-A22B für allgemeines Reasoning und Coding, mit DeepSeek R1 an der Spitze beim tiefen mathematischen Reasoning und Llama 4 Scout beim langen Kontext (10 Millionen Token). Für eine einzelne Consumer-GPU sind Gemma 3 27B (16 GB VRAM) und Phi-4 14B (8 GB) am einfachsten selbst zu hosten. Alle drei Top-Modelle erreichen bei Code und Mathematik GPT-4-Niveau, während sie kostenlos eingesetzt werden können.
Führende Open-Source-LLMs: Benchmark-Übersicht
Die folgende Tabelle zeigt fünf weit verbreitete Open-Source-Modelle, die anhand öffentlicher Standard-Benchmarks bewertet wurden. MMLU misst breites Allgemeinwissen; HumanEval misst die Erfolgsrate bei der Code-Generierung.
| Modell | Parameter | Veröffentlichung | MMLU | HumanEval | Lizenz | Am besten für |
|---|---|---|---|---|---|---|
| Llama 3.3 70B | 70B | Dez. 2024 | 86,0 | 88,4 | Llama 3.3 Community | Allgemein, mehrsprachig |
| Qwen 2.5 72B | 72B | Sep. 2024 | 85,0+ | 86,6 | Qwen License | Mathematik, Coding, Instruktionsfolge |
| DeepSeek-V3 | 671B (37B aktiv) | Dez. 2024 | 87,1 | 82,6 | MIT | Allgemein, Coding, kosteneffizient |
| Mistral Small 3.1 | 24B | März 2025 | 80,6 | 88,4 | Apache 2.0 | Agentische Workflows, Vision, mehrsprachig |
| Gemma 3 27B | 27B | März 2025 | ~78,6 | 87,8 | Gemma Terms of Use | Einzelne-GPU-Deployment, multimodal |
Diese Tabelle aktualisieren wir monatlich.
Open-Source-LLMs "konkurrieren" nicht mehr nur mit proprietären Modellen -- bei Programmierung, Mathematik und Aufgaben mit langem Kontext gewinnen sie. Der Abstand zwischen einer API-Rechnung von 200 $/Monat und einem selbst gehosteten Open-Source-Modell war noch nie kleiner.
Dieses Ranking schneidet durch den Hype hindurch. Jedes Modell hier wird nach Benchmarks bewertet, die wirklich zählen, nach der Hardware, die du tatsächlich benötigst, und nach dem spezifischen Anwendungsfall, in dem jedes Modell am stärksten glänzt.
Kurzübersicht: Welches Open-Source-LLM solltest du wählen?
Brauchst du die absolut beste Schlussfolgerungsfähigkeit? Dann ist Qwen 3 235B oder DeepSeek R1 die richtige Wahl. Willst du etwas auf einer einzelnen GPU betreiben? Gemma 3 27B oder Phi-4 14B. Verarbeitest du riesige Dokumente? Der 10-Millionen-Token-Kontext von Llama 4 Scout ist unübertroffen.
| Rang | Modell | Parameter (aktiv) | Am besten für | Lizenz | Min. VRAM |
|---|---|---|---|---|---|
| no. 1 | Qwen 3 235B-A22B | 235B (22B) | Reasoning + Coding | Apache 2.0 | ~132 GB (Q4) |
| no. 2 | DeepSeek R1 | 671B (37B) | Tiefes Reasoning + Mathematik | MIT | ~136 GB (Q4) |
| no. 3 | Llama 4 Scout | 109B (17B) | Langer Kontext (10M Token) | Llama License | ~55 GB (Q4) |
| no. 4 | DeepSeek V3 | 671B (37B) | Allgemein + Coding | MIT | ~136 GB (Q4) |
| no. 5 | Mistral Large 3 | 675B (41B) | Mehrsprachig + Enterprise | Apache 2.0 | ~140 GB (Q4) |
| no. 6 | Gemma 3 27B | 27B (27B, dicht) | Einzelne-GPU-Deployment | Open Weights | ~16 GB (Q4) |
| no. 7 | Phi-4 Reasoning | 14B (14B, dicht) | Edge- und Mobilgeräte | MIT | ~8 GB (Q4) |
| no. 8 | GLM-4.7 | 355B (32B) | Agentische Coding-Workflows | MIT | ~130 GB (Q4) |
Die VRAM-Zahlen gehen von Q4-Quantisierung aus. Der Bedarf bei voller Präzision ist 2-4x höher. Wenn du neu im Bereich lokaler Modelle bist, fange mit Gemma 3 oder Phi-4 an -- sie sind die hardware-freundlichsten Optionen auf dieser Liste.
Open-Source-LLM-Leaderboard: Ranking Juli 2026
Stand Juli 2026 führt Qwen 3 235B-A22B unser Open-Source-LLM-Leaderboard bei allgemeinem Reasoning und Coding an, mit DeepSeek R1 auf Platz zwei bei tiefer Mathematik und Llama 4 Scout auf Platz drei bei langem Kontext. Das vollständige Ranking unten umfasst alle acht in diesem Leitfaden bewerteten Modelle, von Rechenzentrums-Setups bis zu laptop-freundlichen Optionen.
| Rang | Modell | Lizenz | Am besten für | Min. VRAM |
|---|---|---|---|---|
| no. 1 | Qwen 3 235B-A22B | Apache 2.0 | Reasoning + Coding | ~132 GB (Q4) |
| no. 2 | DeepSeek R1 | MIT | Tiefes Reasoning + Mathematik | ~136 GB (Q4) |
| no. 3 | Llama 4 Scout | Llama License | Langer Kontext (10M Token) | ~55 GB (Q4) |
| no. 4 | DeepSeek V3 | MIT | Allgemein + Coding | ~136 GB (Q4) |
| no. 5 | Mistral Large 3 | Apache 2.0 | Mehrsprachig + Enterprise | ~140 GB (Q4) |
| no. 6 | Gemma 3 27B | Open Weights | Einzelne-GPU-Deployment | ~16 GB (Q4) |
| no. 7 | Phi-4 Reasoning | MIT | Edge- und Mobilgeräte | ~8 GB (Q4) |
| no. 8 | GLM-4.7 | MIT | Agentische Coding-Workflows | ~130 GB (Q4) |
Dieses Ranking spiegelt unsere monatliche Überprüfung von Benchmarks, Hardware-Anforderungen und Lizenzbedingungen wider.
Jetzt schauen wir uns an, was jedes Modell besonders macht.
1. Qwen 3 235B-A22B -- Bestes Open-Source-LLM insgesamt
Alibabas Qwen 3 235B-A22B ist derzeit das Maß aller Dinge. Es ist eine Mixture-of-Experts-Architektur mit 235 Milliarden Gesamtparametern, von denen aber nur 22 Milliarden pro Token aktiviert werden -- das reduziert den Rechenaufwand im Vergleich zu einem dichten Modell ähnlicher Qualität um rund 90 %.
Was Qwen 3 auszeichnet, ist sein dualer Denkmodus. Du kannst zwischen einem "Denkmodus" für komplexe Mathematik- und Coding-Probleme (bei dem das Modell seine Gedankenkette zeigt) und einem schnellen "Nicht-Denkmodus" für schnelle Chat-Antworten wechseln. Diese Flexibilität ist im Produktionsbetrieb wichtig.
Benchmark-Highlights:
| Benchmark | Qwen 3 235B Ergebnis | Kontext |
|---|---|---|
| AIME 2024 | 85,7 % | Mathematik auf Wettbewerbsniveau |
| AIME 2025 | 81,5 % | Schwierigere Mathematikprobleme |
| LiveCodeBench v5 | 70,7 % | Echte Coding-Aufgaben |
| CodeForces | 2.056 | Kompetitives Programmieren |
| BFCL v3 | 70,8 % | Funktionsaufrufe |
Diese Zahlen bringen es in die gleiche Liga wie DeepSeek R1, OpenAIs o1 und Gemini 2.5 Pro -- mit dem Unterschied, dass du es herunterladen, feinjustieren und überall unter Apache 2.0 deployen kannst.
Hardware-Anforderungen: Das vollständige Modell benötigt bei Q4-Quantisierung etwa 132 GB VRAM. Das ist ein Multi-GPU-Setup -- denk an fünf RTX-3090, drei A40 oder ein Dual-H100-Rig. Nicht billig, aber für ein Startup oder ein Forschungslabor gut erreichbar. Die Qwen-3-Familie umfasst auch kleinere Varianten (32B, 14B, 8B, 4B), die auf Consumer-Hardware laufen.
Wer sollte es verwenden: Teams, die Reasoning und Coding auf Frontier-Niveau benötigen, aber ihre Infrastruktur selbst besitzen wollen. Besonders stark für mehrsprachige Workloads mit 256K Kontext und Unterstützung für über 100 Sprachen. Wenn du planst, ein Modell für deine spezifische Domäne zu feintunen, gibt dir Qwen 3s Apache-2.0-Lizenz völlige Freiheit.
2. DeepSeek R1 -- Bestes Modell für tiefes Reasoning
DeepSeek R1 hat Anfang 2025 die Spielregeln verändert und bewiesen, dass Open-Source-Modelle OpenAIs o1 bei Reasoning-Aufgaben ebenbürtig sein können. Das R1-0528-Update hat die Latte noch höher gelegt -- die AIME-2025-Genauigkeit sprang von 70 % auf 87,5 %.
Das Erfolgsrezept des Modells ist seine Trainingsmethodik. DeepSeek erstellte zunächst R1-Zero mit reinem Reinforcement Learning ohne überwachtes Feintuning-Aufwärmen. Das Modell entwickelte spontan Chain-of-Thought-Reasoning, Selbstverifikation und Backtracking-Verhalten. Es brachte sich buchstäblich selbst bei, seine eigene Arbeit zu überprüfen.
Benchmark-Highlights:
| Benchmark | DeepSeek R1 Ergebnis | Kontext |
|---|---|---|
| AIME 2025 | 87,5 % (R1-0528) | Mathematik-Olympiade |
| GPQA Diamond | 71,5 % | Wissenschaft auf Postgraduiertenniveau |
| SWE-bench | 49,2 % | Echtes Software-Engineering |
| HumanEval | 92,4 % | Code-Generierung |
Hardware-Anforderungen: Gleiche 671B-MoE-Architektur wie DeepSeek V3, also benötigst du ~136 GB VRAM bei Q4. Aber hier ist der praktische Aspekt: DeepSeek veröffentlichte auch destillierte Varianten mit 1,5B, 7B, 14B, 32B und 70B Parametern. Die 32B-Destillation läuft auf einer einzelnen RTX-4090 und übertrifft bei Reasoning-Aufgaben viele größere Modelle.
Wer sollte es verwenden: Jeder, der Anwendungen entwickelt, die schrittweises Reasoning erfordern -- Beweisführung, komplexes Code-Debugging, wissenschaftliche Analyse. Die destillierten Varianten sind besonders nützlich, wenn du Reasoning-Fähigkeiten mit begrenztem Budget benötigst. Schau dir die besten Tools zum lokalen Ausführen von LLMs an, wenn du die kleineren Destillationen auf deiner eigenen Hardware deployen möchtest.
3. Llama 4 Scout -- Bestes Modell für langen Kontext
Metas Llama 4 Scout brachte etwas wirklich Neues in die Open-Source-Welt: ein 10-Millionen-Token-Kontextfenster. Das ist kein Tippfehler. Du kannst eine gesamte Codebasis, ein Regal mit Forschungsarbeiten oder 20 Stunden Videotranskription in einem einzigen Prompt eingeben.
Scout verwendet 16 MoE-Experten mit nur 2 aktiven pro Token, was ihm insgesamt 109B Parameter, aber nur 17B aktive Parameter gibt. Meta gibt an, dass es auf einem einzelnen H100 mit INT4-Quantisierung passt, obwohl das 10-Millionen-Token-Kontextfenster für den KV-Cache offensichtlich mehr Speicher benötigt.
Benchmark-Highlights:
| Benchmark | Llama 4 Scout Ergebnis | Kontext |
|---|---|---|
| Needle-in-a-Haystack (10M) | 100 % | Perfekte Wiedergabe |
| MMLU | 79,6 % | Allgemeinwissen |
| HumanEval | 81,2 % | Code-Generierung |
| DocVQA | 85,1 % | Dokumentenverständnis |
Dieser perfekte Needle-in-a-Haystack-Score bei 10M Token ist bemerkenswert. Die meisten Modelle beginnen deutlich vor 128K Informationen zu verlieren. Scout verwendet einen neuartigen Inter-Dokument-Aufmerksamkeitsmaskierungsansatz, der Grenzen zwischen Dokumenten auch in seinem riesigen Kontextfenster aufrechterhält.
Hardware-Anforderungen: Bei Q4 benötigen die Modellgewichte etwa 55 GB VRAM. Ein einzelner H100 (80 GB) handhabt das problemlos. Für Consumer-Hardware können zwei RTX-4090 (48 GB gesamt) kürzere Kontextlängen bewältigen. Der Haken: Die tatsächliche Nutzung des vollen 10M-Kontextfensters erfordert enormen zusätzlichen KV-Cache-Speicher über die Modellgewichte hinaus. In der Praxis begrenzen die meisten selbst gehosteten Deployments den Kontext auf 128K-256K Token.
Wer sollte es verwenden: Teams, die mit riesigen Dokumenten arbeiten -- Rechtsanalysen, Code-Repository-Q&A, Synthese wissenschaftlicher Arbeiten. Die multimodalen Fähigkeiten (Text- und Bildeingabe) sind ebenfalls stark. Sei einfach realistisch bezüglich der Kontextlänge: Die 10M-Grenze ist real, aber du brauchst Server-grade Hardware, um sie zu erreichen.
4. DeepSeek V3 -- Bestes allgemein einsetzbares Open-Source-LLM
Während DeepSeek R1 für sein Reasoning Schlagzeilen macht, ist DeepSeek V3 wohl das praktischere Modell für den täglichen Einsatz. Es ist das Arbeitstier -- schnell, rundum leistungsfähig und für seine Größe bemerkenswert effizient.
V3 teilt die gleiche 671B-MoE/37B-aktiv-Architektur wie R1, tauscht aber tiefe Reasoning-Ketten gegen schnellere Antwortzeiten und breitere allgemeine Fähigkeiten. Das V3-0324-Update integrierte Reinforcement-Learning-Techniken aus R1s Training und steigerte das Reasoning, ohne die Latenz durch explizite Chain-of-Thought zu erhöhen.
Benchmark-Highlights:
| Benchmark | DeepSeek V3 Ergebnis | Kontext |
|---|---|---|
| MMLU | 87,1 % | Allgemeinwissen |
| HumanEval | 82,6 % | Code-Generierung |
| MATH | 90,2 % | Mathematisches Reasoning |
| Kontextfenster | 128K | Unterstützung langer Dokumente |
DeepSeek V3 übertrifft GPT-4.5 bei Coding- und Mathematik-Benchmarks. Seine Trainingseffizienz ist legendär -- nur 2,788 Millionen H800-GPU-Stunden für den gesamten Vortraining-Lauf, ein Bruchteil dessen, was vergleichbare Modelle benötigen.
Hardware-Anforderungen: Identisch mit R1 (~136 GB VRAM bei Q4). Für das praktische Deployment laufen die GGUF-quantisierten Versionen über llama.cpp oder Ollama auf Multi-GPU-Consumer-Setups.
Wer sollte es verwenden: Wenn du ein Modell brauchst, das alles übernimmt -- Chat, Coding, Analyse, Übersetzung, Zusammenfassung -- ist V3 die ausgewogenste Wahl. Es wird R1 beim harten Reasoning oder Scout bei der Kontextlänge nicht schlagen, aber es wird bei typischen Produktions-Workloads, wo Geschwindigkeit und Vielseitigkeit wichtiger sind als Spitzen-Benchmark-Scores, beide übertreffen.
5. Mistral Large 3 -- Bestes Modell für Mehrsprachigkeit und Enterprise-Einsatz
Mistral Large 3 brachte Mistral zurück an die Frontier. Mit 675B Gesamtparametern (41B aktiv) ist es ein vollständiges MoE-Modell, das unter Apache 2.0 veröffentlicht wurde -- ein enormer Schritt weg von Mistral Large 2s restriktiver Forschungslizenz.
Das Modell wurde von Grund auf auf 3.000 NVIDIA H200 GPUs trainiert, und das merkt man. Im LMSYS Chatbot Arena belegte es Platz no. 2 unter den offenen Modellen und Platz no. 6 insgesamt (einschließlich proprietärer Modelle). Besonders interessant für europäische Teams ist seine mehrsprachige Stärke -- rund 85,5 % Genauigkeit bei einem ausgewogenen mehrsprachigen MMLU-Test.
Benchmark-Highlights:
| Benchmark | Mistral Large 3 Ergebnis | Kontext |
|---|---|---|
| Mehrsprachiges MMLU | 85,5 % | Sprachübergreifendes Wissen |
| LMSYS Arena | no. 6 gesamt | Menschliche Präferenzrangliste |
| AIME 2025 (14B-Variante) | 85 % | Mathematisches Reasoning |
| Kontextfenster | 128K | Unterstützung langer Dokumente |
Eine Eigenschaft, die Mistral-Modelle auszeichnet: Sie sind trainiert, "Ich weiß es nicht" zu sagen, anstatt zu halluzinieren. Das macht Mistral Large 3 zu einer starken Wahl für RAG-Pipelines und Enterprise-Anwendungen, bei denen sachliche Genauigkeit wichtiger ist als kreative Ausgaben.
Hardware-Anforderungen: Mit 675B Gesamtparametern sind die VRAM-Anforderungen ähnlich wie bei DeepSeek (~140 GB bei Q4). Mistral bietet auch die 14B-Small-3-Variante an, die auf einer einzelnen Consumer-GPU läuft und beim Reasoning und Coding weit über ihr Gewicht hinausschlägt.
Wer sollte es verwenden: Europäische Unternehmen, die mehrsprachige Fähigkeiten und Datensouveränität benötigen. Enterprise-Teams, die RAG-Systeme aufbauen, bei denen die Reduzierung von Halluzinationen entscheidend ist. Die Apache-2.0-Lizenz beseitigt kommerziellen Aufwand vollständig.
6. Gemma 3 27B -- Bestes Modell für Einzelne-GPU-Deployment
Googles Gemma 3 27B ist der Sweet Spot zwischen Leistungsfähigkeit und Zugänglichkeit. Mit 27 Milliarden Parametern in einer dichten Architektur läuft es auf einer einzigen RTX 4090 mit Q4-Quantisierung. Keine Multi-GPU-Rigs, keine Server-grade Hardware -- nur eine normale Gaming-Grafikkarte.
Lass dich von der bescheidenen Parameteranzahl nicht täuschen. Gemma 3 27B übertrifft seine Größe deutlich, besonders bei multimodalen Aufgaben. Es verarbeitet sowohl Text- als auch Bildeingaben, unterstützt über 140 Sprachen, und sein 130K-Kontextfenster ist für ein Modell dieser Größe großzügig.
Benchmark-Highlights:
| Benchmark | Gemma 3 27B Ergebnis | Kontext |
|---|---|---|
| MMLU | 78,6 % | Allgemeinwissen |
| DocVQA | 85,6 % | Dokumentenverständnis |
| MGSM | 74,3 % | Mehrsprachige Mathematik |
| ChartQA | 76,3 % | Visuelles Reasoning |
Diese multimodalen Scores (DocVQA 85,6 %, ChartQA 76,3 %) konkurrieren mit Modellen, die 3-5x größer sind. Für Entwickler, die Bildverständnis ohne GPU-Cluster benötigen, ist Gemma 3 die offensichtliche Wahl.
Hardware-Anforderungen: Etwa 16 GB VRAM bei Q4-Quantisierung, 32 GB bei Q8. Eine einzelne RTX 4090 (24 GB) handhabt das problemlos. Sogar ein M2 MacBook Pro mit 32 GB Unified Memory kann es ausführen. Wenn du unserem Leitfaden zum lokalen Ausführen von LLMs folgst, ist Gemma 3 eines der einfachsten Modelle zum Einstieg.
Wer sollte es verwenden: Solo-Entwickler, kleine Teams und alle, die ein leistungsfähiges multimodales Modell ohne gemietete Cloud-GPUs wollen. Es ist auch hervorragend zum Prototyping -- teste deine Pipeline lokal mit Gemma 3, und skaliere dann bei Bedarf auf ein größeres Modell in der Produktion. Für Googles neueres kleines Modell siehe unseren Gemma 4 12B-Leitfaden.
7. Phi-4 Reasoning -- Bestes Modell für Edge- und ressourcenbeschränkte Deployments
Microsofts Phi-4 Reasoning beweist, dass Parameteranzahl nicht alles ist. Mit nur 14 Milliarden Parametern übertrifft es DeepSeek R1s 70B-Destillation bei mehreren Reasoning-Benchmarks. Das kürzlich veröffentlichte Phi-4-reasoning-vision-15B fügt multimodale Fähigkeiten hinzu und erzielt 17 % bessere Ergebnisse als Gemma 3 12B bei mathematisch-visuellen Reasoning-Aufgaben.
Das Erfolgsgeheimnis der Phi-4-Familie liegt in der Trainingsqualität. Microsofts Ansatz priorisiert kuratierte, hochwertige Daten über rohe Skalierung, und es funktioniert -- Phi-4 erzielt über 80 % bei den Benchmarks MATH und MGSM und übertrifft Googles Gemini Pro und GPT-4o-mini beim mathematischen Reasoning.
Benchmark-Highlights:
| Benchmark | Phi-4 Ergebnis | Kontext |
|---|---|---|
| MATH | 82,6 % | Mathematisches Reasoning |
| HumanEval | 82,6 % | Code-Generierung |
| MGSM | 80 %+ | Mehrsprachige Mathematik |
| MathVista (Vision) | +17 % vs. Gemma 12B | Visuelles Mathe |
Hardware-Anforderungen: Etwa 8 GB VRAM bei Q4 -- das ist eine Laptop-GPU oder sogar eine ältere Desktop-Grafikkarte. Das Modell läuft komfortabel auf Apple-Silicon-MacBooks und ist damit wirklich portabel. Für Edge-Deployments ist es eines der wenigen Modelle, die On-Device mit vertretbarer Latenz laufen können.
Wer sollte es verwenden: Mobile- und Edge-Entwickler, Teams, die On-Device-KI-Funktionen entwickeln, und alle, die starkes Reasoning mit minimaler Hardware benötigen. Phi-4 ist auch eine gute Wahl für das Evaluieren feingetunter Modelle, da seine geringe Größe Trainingsiterationen schnell und günstig macht. Die MIT-Lizenz bedeutet keine kommerziellen Einschränkungen.
8. GLM-4.7 -- Bestes Modell für agentisches Coding
Z.ais GLM-4.7 ist gezielt für einen bestimmten Anwendungsfall entwickelt worden: agentische Coding-Workflows, bei denen das Modell über lange, mehrstufige Interaktionen hinweg denken, Tools verwenden und Kontext aufrechterhalten muss.
Seine Architektur ist ein 355B-MoE mit 32B aktiven Parametern, aber das herausragendste Merkmal ist sein dreistufiges Denksystem. Anders als die meisten Modelle, die ihren Reasoning-Prozess bei jedem Gesprächsschritt neu starten, behält GLM-4.7 Denkblöcke über das gesamte Gespräch hinweg bei. Dieser persistente Reasoning-Kontext macht einen echten Unterschied, wenn das Modell komplexe mehrstufige Coding-Aufgaben orchestriert.
Benchmark-Highlights:
| Benchmark | GLM-4.7 Ergebnis | Kontext |
|---|---|---|
| SWE-bench | 73,8 % | Echtes Software-Engineering |
| HumanEval | 94,2 % | Code-Generierung |
| Kontextfenster | 200K | Lange Interaktionen |
| Max. Ausgabe | 131K Token | Erweiterte Generierung |
Dieser 73,8 %-SWE-bench-Score ist mit Claude Sonnet 4.5 vergleichbar -- bei realen Software-Engineering-Aufgaben, nicht bei synthetischen Benchmarks. Und die 94,2 % bei HumanEval ist der höchste Wert aller Modelle auf dieser Liste.
Hardware-Anforderungen: Ähnlich wie bei anderen großen MoE-Modellen (~130 GB VRAM bei Q4). Das 200K-Kontextfenster und die 131K-Max-Ausgabe machen es bei langen agentischen Sitzungen speicherhungrig.
Wer sollte es verwenden: KI-unterstützte Entwicklungsteams, die Coding-Agenten, automatisierte Debugging-Tools oder Code-Review-Systeme entwickeln. Wenn du Feintuning-Tools für ein coding-fokussiertes Modell auswählst, ist GLM-4.7 eine starke Grundlage. Die MIT-Lizenz ermöglicht vollständige kommerzielle Nutzung.
Bestes Open-Source-LLM für Coding (Juli 2026)
Für Coding im Juli 2026 ist GLM-4.7 die beste Open-Source-Wahl, mit 94,2 % bei HumanEval und 73,8 % bei SWE-bench -- konkurrenzfähig mit Claude Sonnet 4.5 bei echten Software-Aufgaben. Suchst du ein starkes Coding-Modell für Consumer-Hardware? Die DeepSeek-R1-32B-Destillation läuft auf einer einzelnen RTX 4090.
Ziehst du die neuere GLM-Version in Betracht? Unser GLM-5.2-Überblick zeigt dir, wie sie im Vergleich abschneidet.
Wie du wählst: Entscheidungsrahmen
Das "beste" Modell hängt vollständig von deinen Einschränkungen ab. Verwende diese Matrix, um deine Entscheidung einzugrenzen.
| Wenn du benötigst... | Wähle | Warum |
|---|---|---|
| Bestes Gesamtreasoning | Qwen 3 235B | Top-Mathematik-, Code- und allgemeine Benchmarks |
| Tiefe Chain-of-Thought | DeepSeek R1 | Selbstkorrigierendes Reasoning, 87,5 % AIME |
| Riesiges Kontextfenster | Llama 4 Scout | 10M Token, perfekte Wiedergabe |
| Schnell und allgemein | DeepSeek V3 | Bestes Geschwindigkeit-Qualität-Verhältnis |
| Mehrsprachiges Enterprise | Mistral Large 3 | 85,5 % mehrsprachiges MMLU, Anti-Halluzination |
| Einzelne Consumer-GPU | Gemma 3 27B | 16 GB VRAM, starke Multimodalität |
| Laptop oder Edge-Gerät | Phi-4 14B | 8 GB VRAM, MIT-Lizenz |
| Coding-Agenten | GLM-4.7 | 94,2 % HumanEval, persistentes Reasoning |
Noch unsicher? Fange hier an: Hast du Multi-GPU-Hardware? Wenn nein, sind Gemma 3 und Phi-4 deine Optionen. Wenn ja, entwickelst du einen Coding-Agenten? Wähle GLM-4.7 oder DeepSeek R1. Brauchst du langen Kontext? Llama 4 Scout. Alles andere? Qwen 3 235B ist die sicherste Standardwahl.
Wie wir diese Modelle gerankt haben
Das Ranking basiert nicht auf einem einzelnen Benchmark. Jedes Modell wurde in fünf Dimensionen bewertet:
- Benchmark-Leistung -- MMLU, HumanEval, AIME, SWE-bench und domänenspezifische Tests
- Hardware-Zugänglichkeit -- Können echte Teams es tatsächlich deployen?
- Lizenzfreiheit -- Apache 2.0 und MIT werden höher bewertet als restriktive Lizenzen
- Ökosystem-Reife -- Verfügbar auf Hugging Face, Ollama, vLLM und den wichtigsten Inferenz-Engines
- Reale Akzeptanz -- Aktive Community, Produktions-Deployments, laufende Updates
Modelle, die bei Benchmarks gut abschneiden, aber einen GPU-Cluster erfordern, den niemand hat (du weißt, welche das sind, bei 671B voller Präzision), werden abgewertet. Modelle mit restriktiven Lizenzen, die die kommerzielle Nutzung blockieren, verlieren ebenfalls Punkte. Das Ziel ist praktischer Nutzen, keine Leaderboard-Prahlerei.
Wenn du diese Modelle selbst testen möchtest, erklärt unser LLM-Evaluierungsleitfaden, wie du systematische Benchmarks einrichtest, und das Roundup der besten Evaluierungstools behandelt die Frameworks, die du benötigst.
FAQ
Was sind die neuesten Open-Source-LLMs im Jahr 2026?
Die Spitze des Jahres 2026 wird von Qwen 3 (Alibaba), DeepSeek R1 und V3, Llama 4 Scout (Meta), Mistral Large 3 und GLM-4.7 (Z.ai) angeführt. Punkt-Releases wie DeepSeek R1-0528 und die Phi-4-reasoning-vision-Variante erschienen im Laufe von Mitte 2026. Wir überprüfen diese Liste monatlich und aktualisieren das Ranking, sobald eine neue Veröffentlichung die Reihenfolge ändert.
Wie oft wird dieses Open-Source-LLM-Leaderboard aktualisiert?
Monatlich. Wir verifizieren Benchmark-Werte, VRAM-Anforderungen und Lizenzen zu Beginn jedes Monats neu und fügen neue Modelle hinzu, sobald sie verfügbar sind. Das Datum "Zuletzt aktualisiert" unter dem Titel zeigt die jüngste Überprüfung an.
Was ist das beste Open-Source-LLM im Jahr 2026?
Qwen 3 235B-A22B führt derzeit beim breitesten Spektrum an Benchmarks und kombiniert erstklassiges Reasoning, Coding und mehrsprachige Fähigkeiten unter einer Apache-2.0-Lizenz. Für spezifische Anwendungsfälle könnten DeepSeek R1 (Reasoning) und Llama 4 Scout (langer Kontext) bessere Optionen sein.
Kann ich Open-Source-LLMs auf Consumer-Hardware ausführen?
Ja. Gemma 3 27B läuft auf einer einzelnen RTX 4090 (24 GB VRAM) und Phi-4 14B passt auf eine Laptop-GPU mit 8 GB. Quantisierte Versionen (Q4, Q8) größerer Modelle funktionieren auch auf Multi-GPU-Consumer-Setups mit Tools wie Ollama und llama.cpp.
Sind Open-Source-LLMs so gut wie ChatGPT oder Claude?
Bei Coding- und Mathematik-Benchmarks stimmen die besten Open-Source-Modelle mit GPT-4.5 überein oder übertreffen es sogar, und sie nähern sich der Claude-Sonnet-4.5-Leistung an. Der Abstand ist bei strukturierten Aufgaben (Code, Mathematik, Reasoning) am geringsten und bei kreativem Schreiben sowie nuanciertem Befolgen von Anweisungen am größten.
Was bedeutet MoE (Mixture-of-Experts) für die Hardware?
MoE-Modelle haben eine große Gesamtparameteranzahl, aktivieren aber pro Token nur einen Bruchteil davon. Das gesamte Modell muss jedoch in den Speicher geladen werden, damit der Router die Experten auswählen kann. Ein 235B-MoE-Modell mit 22B aktiven Parametern benötigt immer noch VRAM für 235B -- man spart keinen Speicher, sondern Rechenleistung.
Welches Open-Source-LLM ist am besten für Coding?
GLM-4.7 führt mit 94,2 % HumanEval und 73,8 % SWE-bench. Für reine Code-Generierung folgen DeepSeek R1 und Qwen 3 235B dicht dahinter. Für Coding auf Consumer-Hardware ist die DeepSeek-R1-32B-Destillation das beste Verhältnis von Fähigkeit zu Kosten.
Sind Llama 4 Scouts 10 Millionen Token Kontext wirklich real?
Die Architektur unterstützt es, und Meta demonstrierte eine perfekte Needle-in-a-Haystack-Wiedergabe bei 10M Token. Aber die tatsächliche Nutzung des vollen Kontexts erfordert enormen KV-Cache-Speicher. Die meisten selbst gehosteten Deployments begrenzen den Kontext realistisch auf 128K-256K Token. Cloud-Anbieter wie Together AI und Fireworks bieten längere Kontextfenster an.
Auf welche Lizenz sollte ich bei einem Open-Source-LLM achten?
Apache 2.0 und MIT sind die permissivsten Lizenzen -- vollständige kommerzielle Nutzung, Modifikation und Weiterverbreitung. Llamas individuelle Lizenz erlaubt die kommerzielle Nutzung, hat aber Einschränkungen für Apps mit mehr als 700M Nutzern. Einige "Open-Weight"-Modelle (wie Gemma) haben spezifische Bedingungen -- lies die Lizenz immer, bevor du mit dem Produktions-Deployment beginnst.
Wie viel VRAM benötige ich für ein 70B-Modell?
Bei Q4-Quantisierung benötigt ein dichtes 70B-Modell etwa 35-40 GB VRAM. Ein einzelner A100 (80 GB) handhabt es problemlos, oder zwei RTX-4090 (48 GB gesamt). Bei voller Präzision (BF16) sind es 140+ GB -- was effektiv vier A100 oder Äquivalent erfordert.
Kann ich Open-Source-LLMs für meinen Anwendungsfall feintunen?
Absolut. QLoRA macht das Feintuning eines 70B-Modells auf einer einzelnen 24-GB-GPU möglich. Kleinere Modelle wie Phi-4 und Gemma 3 sind noch zugänglicher für Feintuning-Experimente. Apache-2.0- und MIT-lizenzierte Modelle haben keine Einschränkungen für abgeleitete Werke.
Was ist mit Open-Source-Multimodal-LLMs?
Gemma 3 27B und Llama 4 Scout verarbeiten beide nativ Text- und Bildeingaben. Phi-4-reasoning-vision-15B fügt visuelles Reasoning in kleinerem Maßstab hinzu. Für Videoverständnis unterstützt Llama 4 Scout bis zu 20 Stunden Videoeingabe innerhalb seines Kontextfensters.
Was ist derzeit das beste Open-Source-LLM?
Derzeit ist Qwen 3 235B-A22B insgesamt das beste Open-Source-LLM und führt bei Reasoning und Coding unter einer Apache-2.0-Lizenz. Für eine einzelne Consumer-GPU ist Gemma 3 27B (16 GB VRAM) die Top-Wahl, und GLM-4.7 gewinnt bei Coding-Agenten mit 94,2 % HumanEval.
Gibt es ein Open-Source-LLM-Leaderboard?
Ja. Unser Leaderboard von Juli 2026 oben rankt alle acht Modelle in diesem Leitfaden, und Hugging Face betreibt das community-geführte Open LLM Leaderboard für eine breitere Abdeckung. Wir überprüfen unser Ranking monatlich anhand von Benchmarks wie MMLU, HumanEval, AIME und SWE-bench.
Ein Tool auszuwählen ist der einfache Teil. Es zuverlässig in einem echten Produkt zum Laufen zu bringen, daran scheitern die meisten Teams, und genau das baut unser KI-Integrationsteam für Kunden, von RAG-Pipelines bis zu individuellen Agenten. Sie möchten eine zweite Meinung zu Ihrem Stack? Fordern Sie eine kostenlose Beratung an.