ai-machine-learning

Bästa Open Source-LLM 2026: Vi Testade 8 — Bara 3 Slog GPT-4-Klassen

Skriven av Mert Batur
Uppdaterad Jul 5, 2026
16 läsning
Bästa Open Source-LLM 2026: Vi Testade 8 — Bara 3 Slog GPT-4-Klassen

De bästa open source-LLM:erna 2026: 8 modeller rankade efter verklig prestanda

Senast uppdaterad: 5 juli 2026. Varje benchmarkpoäng, varje VRAM-siffra och varje licens i den här guiden har re-verifierats för den här uppdateringen. Rankningen nedan återspeglar open-weight-modeller som släppts fram till mitten av 2026 — om en ny version ändrar ordningen uppdateras den här sidan inom en månad.

Den bästa open source-LLM:en 2026 är Qwen 3 235B-A22B för övergripande resonemang och kodning, med DeepSeek R1 i topp på djupt matematiskt resonemang och Llama 4 Scout på lång kontext (10 miljoner tokens). För ett enda konsument-GPU är Gemma 3 27B (16 GB VRAM) och Phi-4 14B (8 GB) de enklaste att självhosta. Alla tre toppmodellerna matchar GPT-4-klass prestanda på kod och matematik och förblir gratis att distribuera.

Ledande open source-LLM:er: benchmark-ögonblicksbild

Tabellen nedan täcker fem brett distribuerade open source-modeller som poängsatts på standard offentliga benchmarks. MMLU mäter bred allmänkunskap; HumanEval mäter godkännandefrekvensen för kodgenerering.

ModellParametrarUtgivningMMLUHumanEvalLicensBäst för
Llama 3.3 70B70BDec. 202486,088,4Llama 3.3 CommunityAllmänt syfte, flerspråkigt
Qwen 2.5 72B72BSep. 202485,0+86,6Qwen LicenseMatematik, kodning, instruktionsföljning
DeepSeek-V3671B (37B aktiva)Dec. 202487,182,6MITAllmänt syfte, kodning, kostnadseffektivt
Mistral Small 3.124BMar. 202580,688,4Apache 2.0Agentiska arbetsflöden, vision, flerspråkigt
Gemma 3 27B27BMar. 2025~78,687,8Gemma Terms of UseEnkelt GPU-driftsättning, multimodalt

Vi uppdaterar den här tabellen varje månad.

Open source-LLM:er "tävlar" inte längre bara med proprietära modeller -- inom kodning, matematik och uppgifter med lång kontext vinner de. Gapet mellan en API-räkning på $200/månad och en egenhostad öppen modell har aldrig varit mindre.

Den här rankningen skär igenom hypen. Varje modell utvärderas på benchmark som verkligen spelar roll, på hårdvaran du faktiskt kommer att behöva, och på det specifika användningsfallet där varje modell lyser starkast.

Snabbsammanfattning: Vilken open source-LLM bör du välja?

Behöver du absolut bästa resonemang? Välj Qwen 3 235B eller DeepSeek R1. Vill du köra något på ett enda GPU? Gemma 3 27B eller Phi-4 14B. Bearbetar du enorma dokument? Llama 4 Scouts 10M-tokenfönster är oöverträffat.

RankModellParametrar (aktiva)Bäst förLicensMin. VRAM
no. 1Qwen 3 235B-A22B235B (22B)Resonemang + kodningApache 2.0~132 GB (Q4)
no. 2DeepSeek R1671B (37B)Djupt resonemang + matematikMIT~136 GB (Q4)
no. 3Llama 4 Scout109B (17B)Lång kontext (10M tokens)Llama License~55 GB (Q4)
no. 4DeepSeek V3671B (37B)Allmänt syfte + kodningMIT~136 GB (Q4)
no. 5Mistral Large 3675B (41B)Flerspråkigt + enterpriseApache 2.0~140 GB (Q4)
no. 6Gemma 3 27B27B (27B, tät)Enkelt GPU-driftsättningÖppna vikter~16 GB (Q4)
no. 7Phi-4 Reasoning14B (14B, tät)Edge + mobila enheterMIT~8 GB (Q4)
no. 8GLM-4.7355B (32B)Agentiska kodningsarbetsflödenMIT~130 GB (Q4)

VRAM-siffrorna förutsätter Q4-kvantisering. Krav för full precision är 2-4 gånger högre. Om du är ny på att köra modeller lokalt börjar du med Gemma 3 eller Phi-4 -- de är de mest hårdvaruvänliga alternativen på den här listan.

Open source-LLM-topplista: rankningar för juli 2026

Från och med juli 2026 toppar Qwen 3 235B-A22B vår topplista för open source-LLM:er inom generellt resonemang och kodning, med DeepSeek R1 på andra plats inom djup matematik och Llama 4 Scout på tredje plats inom lång kontext. Den fullständiga rankningen nedan täcker alla åtta modeller som poängsatts i den här guiden, från datacenter-riggar ner till bärbar-vänliga val.

RankModellLicensBäst förMin. VRAM
no. 1Qwen 3 235B-A22BApache 2.0Resonemang + kodning~132 GB (Q4)
no. 2DeepSeek R1MITDjupt resonemang + matematik~136 GB (Q4)
no. 3Llama 4 ScoutLlama LicenseLång kontext (10M tokens)~55 GB (Q4)
no. 4DeepSeek V3MITAllmänt syfte + kodning~136 GB (Q4)
no. 5Mistral Large 3Apache 2.0Flerspråkigt + enterprise~140 GB (Q4)
no. 6Gemma 3 27BÖppna vikterEnkelt GPU-driftsättning~16 GB (Q4)
no. 7Phi-4 ReasoningMITEdge + mobila enheter~8 GB (Q4)
no. 8GLM-4.7MITAgentiska kodningsarbetsflöden~130 GB (Q4)

Den här topplistan återspeglar vår månatliga genomgång av benchmarks, hårdvarukrav och licensvillkor.

Låt oss nu bryta ner vad som gör varje modell värd din uppmärksamhet.

1. Qwen 3 235B-A22B -- Bästa open source-LLM totalt sett

Alibabas Qwen 3 235B-A22B är modellen att slå just nu. Det är en Mixture-of-Experts-arkitektur med 235 miljarder totala parametrar, men bara 22 miljarder aktiveras per token -- vilket minskar beräkningskraven med ungefär 90% jämfört med en tät modell av liknande kvalitet.

Det som skiljer Qwen 3 är dess dubbla tänkande-läge. Du kan växla mellan ett "tänkande-läge" för komplexa matematik- och kodningsproblem (där modellen visar sin tankegång) och ett snabbt "icke-tänkande-läge" för snabba chattsvar. Den flexibiliteten spelar roll i produktion.

Benchmark-höjdpunkter:

BenchmarkQwen 3 235B-poängKontext
AIME 202485,7%Matematik på tävlingsnivå
AIME 202581,5%Svårare matematikproblem
LiveCodeBench v570,7%Verkliga kodningsuppgifter
CodeForces2 056Tävlingsprogrammering
BFCL v370,8%Funktionsanrop

Dessa siffror placerar den i samma nivå som DeepSeek R1, OpenAI:s o1 och Gemini 2.5 Pro -- förutom att du kan ladda ner den, finjustera den och driftsätta den var du vill under Apache 2.0.

Hårdvarukrav: Den fullständiga modellen behöver ungefär 132 GB VRAM vid Q4-kvantisering. Det är en multi-GPU-uppsättning -- tänk fem RTX 3090, tre A40 eller en dubbel H100. Inte billigt, men väl inom räckhåll för ett startup eller ett forskningslabb. Qwen 3-familjen inkluderar också mindre varianter (32B, 14B, 8B, 4B) som körs på konsumenthårdvara.

Vem bör använda den: Team som behöver resonemang och kodning på gränsnivå men vill äga sin infrastruktur. Särskilt stark för flerspråkiga arbetsbelastningar med 256K kontext och stöd för 100+ språk. Om du planerar att finjustera en modell för din specifika domän ger Qwen 3:s Apache 2.0-licens dig full frihet.

2. DeepSeek R1 -- Bäst för djupt resonemang

DeepSeek R1 ändrade spelet när den lanserades i början av 2025 och bevisade att open source-modeller kunde matcha OpenAI:s o1 på resonemangsuppgifter. R1-0528-uppdateringen drev saker ännu längre -- AIME 2025-noggrannheten hoppade från 70% till 87,5%.

Modellens hemliga sås är dess träningsmetodik. DeepSeek skapade först R1-Zero med rent förstärkningslärande utan övervakat finjusteringsuppvärmning. Modellen utvecklade spontant tankekedjesresonemang, självverifiering och bakåtspårningsbeteenden. Den lärde sig bokstavligen att kontrollera sitt eget arbete.

Benchmark-höjdpunkter:

BenchmarkDeepSeek R1-poängKontext
AIME 202587,5% (R1-0528)Matematikkolympiad
GPQA Diamond71,5%Vetenskap på postgraduatnivå
SWE-bench49,2%Verklig mjukvaruutveckling
HumanEval92,4%Kodgenerering

Hårdvarukrav: Samma 671B MoE-arkitektur som DeepSeek V3, så du tittar på ~136 GB VRAM vid Q4. Men här är den praktiska vinkeln: DeepSeek släppte också destillerade varianter på 1,5B, 7B, 14B, 32B och 70B parametrar. 32B-destillationen körs på ett enda RTX 4090 och överträffar fortfarande många större modeller på resonemangsuppgifter.

Vem bör använda den: Alla som bygger applikationer som kräver steg-för-steg-resonemang -- satssatsbevisning, komplex kodfelsökning, vetenskaplig analys. De destillerade varianterna är särskilt användbara om du behöver resonemangsförmåga med en begränsad budget. Kolla in de bästa verktygen för att köra LLM:er lokalt om du vill driftsätta de mindre destillationerna på din egen hårdvara.

3. Llama 4 Scout -- Bäst för lång kontext

Metas Llama 4 Scout förde med sig något genuint nytt till open source-världen: ett kontextfönster på 10 miljoner tokens. Det är inte ett skrivfel. Du kan mata in en hel kodbas, en hylla med forskningsartiklar eller 20 timmars videotranskription i en enda prompt.

Scout använder 16 MoE-experter med bara 2 aktiva per token, vilket ger den 109B totala parametrar men bara 17B aktiva. Meta hävdar att den passar på ett enda H100 med INT4-kvantisering, även om 10M-tokenkontextfönstret uppenbarligen kräver mer minne för KV-cachen.

Benchmark-höjdpunkter:

BenchmarkLlama 4 Scout-poängKontext
Needle-in-a-Haystack (10M)100%Perfekt återhämtning
MMLU79,6%Allmänkunskap
HumanEval81,2%Kodgenerering
DocVQA85,1%Dokumentförståelse

Den perfekta Needle-in-a-Haystack-poängen på 10M tokens är anmärkningsvärd. De flesta modeller börjar förlora information långt före 128K. Scout använder en ny inter-dokument-uppmärksamhetsmaskningsmetod som upprätthåller gränser mellan dokument även inom sitt massiva kontextfönster.

Hårdvarukrav: Vid Q4 behöver modellvikterna ungefär 55 GB VRAM. Ett enda H100 (80 GB) hanterar det bekvämt. För konsumenthårdvara kan två RTX 4090 (48 GB totalt) hantera kortare kontextlängder. Problemet: att faktiskt använda det fulla 10M-kontextfönstret kräver enormt KV-cacheminne utöver modellvikterna. I praktiken begränsar de flesta egenhostade driftsättningar kontexten till 128K-256K tokens.

Vem bör använda den: Team som arbetar med enorma dokument -- juridisk analys, Q&A om kodrepositorier, syntes av forskningsartiklar. De multimodala funktionerna (text + bildinmatning) är också starka. Var bara realistisk om kontextlängden: 10M-taket är verkligt, men du behöver hårdvara i serverklass för att nå det.

4. DeepSeek V3 -- Bästa allmänna open source-LLM

Medan DeepSeek R1 får rubrikerna för sitt resonemang är DeepSeek V3 förmodligen den mer praktiska modellen för vardagsbruk. Det är arbetshästen -- snabb, kapabel på alla fronter och anmärkningsvärt effektiv för sin storlek.

V3 delar samma 671B MoE / 37B aktiva arkitektur som R1 men byter djupa resonemangskedjor mot snabbare svarstider och bredare allmänna förmågor. V3-0324-uppdateringen inkorporerade förstärkningsteknikerna från R1:s träning och förbättrade resonemanget utan latensträffen från explicita tankekedjor.

Benchmark-höjdpunkter:

BenchmarkDeepSeek V3-poängKontext
MMLU87,1%Allmänkunskap
HumanEval82,6%Kodgenerering
MATH90,2%Matematiskt resonemang
Kontextfönster128KStöd för långa dokument

DeepSeek V3 överträffar GPT-4.5 i kodnings- och matematikbenchmarks. Dess träningseffektivitet är legendarisk -- bara 2,788 miljoner H800 GPU-timmar för hela förträningskörningen, en bråkdel av vad jämförbara modeller kräver.

Hårdvarukrav: Identiska med R1 (~136 GB VRAM vid Q4). För praktisk driftsättning körs GGUF-kvantiserade versioner via llama.cpp eller Ollama på multi-GPU-konsumentkonfigurationer.

Vem bör använda den: Om du behöver en modell som hanterar allt -- chatt, kodning, analys, översättning, sammanfattning -- är V3 det mest balanserade valet. Den kommer inte att slå R1 på svårt resonemang eller Scout på kontextlängd, men den kommer att överträffa båda på typiska produktionsarbetsbelastningar där hastighet och mångsidighet spelar mer roll än toppbenchmarkpoäng.

5. Mistral Large 3 -- Bäst för flerspråkig och enterprise-användning

Mistral Large 3 förde tillbaka Mistral till fronten. Med 675B totala parametrar (41B aktiva) är det en fullständig MoE-modell som släppts under Apache 2.0 -- ett enormt skifte från Mistral Large 2:s restriktiva forskningslicens.

Modellen tränades från grunden på 3 000 NVIDIA H200 GPU:er, och det märks. På LMSYS Chatbot Arena rankade den no. 2 bland öppna modeller och no. 6 totalt (inklusive proprietära). Det som gör den särskilt intressant för europeiska team är dess flerspråkiga styrka -- ungefär 85,5% noggrannhet på ett balanserat flerspråkigt MMLU-test.

Benchmark-höjdpunkter:

BenchmarkMistral Large 3-poängKontext
Flerspråkigt MMLU85,5%Tvärlinguistisk kunskap
LMSYS Arenano. 6 totaltMänsklig preferensranking
AIME 2025 (14B-variant)85%Matematiskt resonemang
Kontextfönster128KStöd för långa dokument

Ett drag som skiljer Mistral-modellerna: de är tränade att säga "Jag vet inte" snarare än att hallucinera. Det gör Mistral Large 3 till ett starkt val för RAG-pipelines och enterprise-applikationer där faktanoggrannhet spelar mer roll än kreativ output.

Hårdvarukrav: Med 675B totala parametrar är VRAM-kraven liknande DeepSeek (~140 GB vid Q4). Mistral erbjuder också 14B Small 3-varianten, som passar på ett enda konsument-GPU och presterar långt över sin vikteklass på resonemang och kodning.

Vem bör använda den: Europeiska företag som behöver flerspråkiga förmågor och datasuveränitet. Enterprise-team som bygger RAG-system där hallucineringsreducering är kritisk. Apache 2.0-licensen eliminerar kommersiell friktion helt.

6. Gemma 3 27B -- Bäst för enkelt GPU-driftsättning

Googles Gemma 3 27B är den söta mittpunkten mellan förmåga och tillgänglighet. Med 27 miljarder parametrar i en tät arkitektur körs den på ett enda RTX 4090 med Q4-kvantisering. Inga multi-GPU-riggar, ingen hårdvara i serverklass -- bara ett vanligt spelkort.

Låt inte det blygsamma parameterantalet lura dig. Gemma 3 27B presterar långt över sin vikteklass, särskilt på multimodala uppgifter. Den hanterar både text- och bildinmatning, stöder 140+ språk och dess 130K kontextfönster är generöst för en modell av denna storlek.

Benchmark-höjdpunkter:

BenchmarkGemma 3 27B-poängKontext
MMLU78,6%Allmänkunskap
DocVQA85,6%Dokumentförståelse
MGSM74,3%Flerspråkig matematik
ChartQA76,3%Visuellt resonemang

De multimodala poängen (DocVQA 85,6%, ChartQA 76,3%) tävlar med modeller som är 3-5 gånger större. För utvecklare som behöver bildförståelse utan ett GPU-kluster är Gemma 3 det självklara valet.

Hårdvarukrav: Ungefär 16 GB VRAM vid Q4-kvantisering, 32 GB vid Q8. Ett enda RTX 4090 (24 GB) hanterar det bekvämt. Även en M2 MacBook Pro med 32 GB enhetligt minne kan köra det. Om du följer vår guide för att köra LLM:er lokalt är Gemma 3 en av de enklaste modellerna att börja med.

Vem bör använda den: Enskilda utvecklare, små team och alla som vill ha en kapabel multimodal modell utan att hyra moln-GPU:er. Det är också utmärkt för prototypframtagning -- testa din pipeline på Gemma 3 lokalt och skala sedan upp till en större modell i produktion om det behövs. För Googles nyare lilla modell, se vår guide om Gemma 4 12B.

7. Phi-4 Reasoning -- Bäst för edge och resursbegränsade driftsättningar

Microsofts Phi-4 Reasoning bevisar att parameterantal inte är allt. Med bara 14 miljarder parametrar överträffar den DeepSeek R1:s 70B-destillation på flera resonemangs-benchmarks. Den nyligen lanserade Phi-4-reasoning-vision-15B lägger till multimodala förmågor och skoring 17% högre än Gemma 3 12B på matematisk-visuella resonemangsuppgifter.

Phi-4-familjens hemlighet är kvaliteten på träningsdata. Microsofts metod prioriterar kuraterad, högkvalitativ data framför rå skala, och det fungerar -- Phi-4 skoring över 80% på MATH- och MGSM-benchmarks och överträffar Googles Gemini Pro och GPT-4o-mini på matematiskt resonemang.

Benchmark-höjdpunkter:

BenchmarkPhi-4-poängKontext
MATH82,6%Matematiskt resonemang
HumanEval82,6%Kodgenerering
MGSM80%+Flerspråkig matematik
MathVista (vision)+17% vs Gemma 12BVisuell matematik

Hårdvarukrav: Ungefär 8 GB VRAM vid Q4 -- det är ett laptop-GPU eller till och med ett äldre skrivbordskort. Modellen körs bekvämt på Apple Silicon MacBooks, vilket gör den genuint portabel. För edge-driftsättning är den en av de få modellerna som kan köras on-device med rimlig latens.

Vem bör använda den: Mobil- och edge-utvecklare, team som bygger AI-funktioner on-device och alla som behöver starkt resonemang på minimal hårdvara. Phi-4 är också ett utmärkt val för att utvärdera finjusterade modeller eftersom dess lilla storlek gör träningsiterationer snabba och billiga. MIT-licensen innebär inga kommersiella restriktioner.

8. GLM-4.7 -- Bäst för agentisk kodning

Z.ai:s GLM-4.7 är specialbyggd för ett specifikt användningsfall: agentiska kodningsarbetsflöden där modellen behöver resonera, använda verktyg och bibehålla kontext över långa flerstegsinteraktioner.

Dess arkitektur är en 355B MoE med 32B aktiva parametrar, men den utmärkande egenskapen är dess trevårstänkarsystem. Till skillnad från de flesta modeller som startar om sin resonemangsprocess varje tur behåller GLM-4.7 tankeblockar under hela konversationen. Det ihållande resonemangssammanhanget gör en verklig skillnad när modellen orkestrerar komplexa flerstegskodningsuppgifter.

Benchmark-höjdpunkter:

BenchmarkGLM-4.7-poängKontext
SWE-bench73,8%Verklig mjukvaruutveckling
HumanEval94,2%Kodgenerering
Kontextfönster200KLånga interaktioner
Max. output131K tokensUtökad generering

Den 73,8% SWE-bench-poängen är konkurrenskraftig med Claude Sonnet 4.5 -- på verkliga mjukvaruingenjörsuppgifter, inte syntetiska benchmarks. Och 94,2% HumanEval är den högsta för någon modell på den här listan.

Hårdvarukrav: Liknande andra stora MoE-modeller (~130 GB VRAM vid Q4). 200K kontextfönstret och 131K max. output gör det minneshungert under långa agentiska sessioner.

Vem bör använda den: AI-stödda utvecklingsteam som bygger kodningsagenter, automatiserade felsökningsverktyg eller kodgranskningssystem. Om du väljer finjusteringsverktyg för en kodningsfokuserad modell är GLM-4.7 en stark bas. MIT-licensen tillåter full kommersiell användning.

Bästa open source-LLM för kodning (juli 2026)

För kodning i juli 2026 är GLM-4.7 det bästa open source-valet, med 94,2% på HumanEval och 73,8% på SWE-bench -- konkurrenskraftigt med Claude Sonnet 4.5 på verkliga mjukvaruuppgifter. Letar du efter en stark kodningsmodell för konsumenthårdvara? DeepSeek R1 32B-destillationen körs på ett enda RTX 4090.

Funderar du på den nyare GLM-versionen? Se vår genomgång av GLM 5.2 för hur den jämför sig.

Hur du väljer: beslutsramverk

Den "bästa" modellen beror helt på dina begränsningar. Använd den här matrisen för att begränsa ditt beslut.

Om du behöver...VäljVarför
Bästa totala resonemangQwen 3 235BTopp matematik, kod och generella benchmarks
Djup tankekjedjaDeepSeek R1Självkorrigerande resonemang, 87,5% AIME
Enormt kontextfönsterLlama 4 Scout10M tokens, perfekt återhämtning
Snabbt och allmäntDeepSeek V3Bästa hastighets-kvalitetsförhållande
Flerspråkigt enterpriseMistral Large 385,5% flerspråkigt MMLU, anti-hallucination
Enstaka konsument-GPUGemma 3 27B16 GB VRAM, stark multimodal
Laptop eller edge-enhetPhi-4 14B8 GB VRAM, MIT-licens
KodningsagenterGLM-4.794,2% HumanEval, ihållande resonemang

Fortfarande osäker? Börja här: Har du multi-GPU-hårdvara? Om nej är dina val Gemma 3 och Phi-4. Om ja, bygger du en kodningsagent? Välj GLM-4.7 eller DeepSeek R1. Behöver du lång kontext? Llama 4 Scout. Allt annat? Qwen 3 235B är det säkraste standardvalet.

Hur vi rankade dessa modeller

Rankingarna baseras inte på ett enda benchmark. Varje modell utvärderades på fem dimensioner:

  1. Benchmark-prestanda -- MMLU, HumanEval, AIME, SWE-bench och domänspecifika tester
  2. Hårdvarutillgänglighet -- Kan riktiga team faktiskt driftsätta den?
  3. Licensfrihet -- Apache 2.0 och MIT poängsätts högre än restriktiva licenser
  4. Ekosystemsmognad -- Tillgänglig på Hugging Face, Ollama, vLLM och stora inferensmotorer
  5. Verklig adoption -- Aktiv community, produktionsdriftsättningar, pågående uppdateringar

Modeller som presterar bra på benchmarks men kräver ett GPU-kluster som ingen har (du vet vilka, 671B full precision) straffas. Modeller med restriktiva licenser som blockerar kommersiell användning förlorar också poäng. Målet är praktiskt värde, inte skryta med leaderboard-positioner.

Om du vill testa dessa modeller själv förklarar vår LLM-utvärderingsguide hur du sätter upp systematiska benchmarks och sammanfattningen av bästa utvärderingsverktyg täcker de ramverk du behöver.

Att välja verktyg är den enkla delen. Att få det att rulla stabilt i en riktig produkt är där de flesta team fastnar, och det är precis vad vårt AI-integrationsteam bygger åt kunder, från RAG-pipelines till skräddarsydda agenter. Vill du ha en second opinion på er stack? Boka en kostnadsfri konsultation.

Vanliga frågor

Vilka är de nyaste open source-LLM:erna 2026?

2026 års front leds av Qwen 3 (Alibaba), DeepSeek R1 och V3, Llama 4 Scout (Meta), Mistral Large 3 och GLM-4.7 (Z.ai). Punktversioner som DeepSeek R1-0528 och Phi-4 reasoning-vision-varianten anlände under första halvåret 2026. Vi kontrollerar den här listan varje månad och uppdaterar rankningen när en ny version ändrar ordningen.

Hur ofta uppdateras det här open source-LLM-leaderboardet?

Varje månad. Vi re-verifierar benchmarkpoäng, VRAM-krav och licenser i början av varje månad och lägger till nya modeller när de släpps. Datumet "Senast uppdaterad" under titeln återspeglar den senaste granskningen.

Vilken är den bästa open source-LLM:en 2026?

Qwen 3 235B-A22B leder för närvarande på det bredaste spektrat av benchmarks och kombinerar förstklassigt resonemang, kodning och flerspråkiga förmågor under en Apache 2.0-licens. För specifika användningsfall kan DeepSeek R1 (resonemang) och Llama 4 Scout (lång kontext) vara bättre val.

Kan jag köra open source-LLM:er på konsumenthårdvara?

Ja. Gemma 3 27B körs på ett enda RTX 4090 (24 GB VRAM) och Phi-4 14B passar på ett laptop-GPU med 8 GB. Kvantiserade versioner (Q4, Q8) av större modeller fungerar också på multi-GPU-konsumentkonfigurationer med verktyg som Ollama och llama.cpp.

Är open source-LLM:er lika bra som ChatGPT eller Claude?

På kodnings- och matematikbenchmarks matchar eller överträffar de bästa open source-modellerna GPT-4.5 och närmar sig Claude Sonnet 4.5:s prestanda. Gapet är minst på strukturerade uppgifter (kod, matematik, resonemang) och störst på kreativt skrivande och nyanserat instruktionsföljande.

Vad innebär MoE (Mixture-of-Experts) för hårdvaran?

MoE-modeller har ett stort totalt parameterantal men aktiverar bara en bråkdel per token. Hela modellen måste dock laddas i minnet så att routern kan välja experter. En 235B MoE-modell med 22B aktiva behöver fortfarande 235B:s värde av VRAM -- du sparar inte minne, du sparar beräkning.

Vilken open source-LLM är bäst för kodning?

GLM-4.7 leder med 94,2% HumanEval och 73,8% SWE-bench. För ren kodgenerering är DeepSeek R1 och Qwen 3 235B strax bakom. För kodning på konsumenthårdvara är DeepSeek R1 32B-destillationen det bästa förhållandet av förmåga till kostnad.

Är Llama 4 Scouts 10 miljoner tokens kontext verkligen sant?

Arkitekturen stöder det, och Meta demonstrerade perfekt Needle-in-a-Haystack-återhämtning vid 10M tokens. Men att faktiskt använda den fulla kontexten kräver enormt KV-cacheminne. De flesta egenhostade driftsättningar begränsar kontexten realistiskt till 128K-256K tokens. Molnleverantörer som Together AI och Fireworks erbjuder längre kontextfönster.

Vilken licens ska jag leta efter i en open source-LLM?

Apache 2.0 och MIT är de mest tillåtande -- full kommersiell användning, modifiering och omdistribution. Llamas anpassade licens tillåter kommersiell användning men har restriktioner för appar med 700M+ användare. Vissa "open-weight"-modeller (som Gemma) har specifika villkor -- läs alltid licensen innan produktionsdriftsättning.

Hur mycket VRAM behöver jag för en 70B-modell?

Vid Q4-kvantisering behöver en tät 70B-modell ungefär 35-40 GB VRAM. Ett enda A100 (80 GB) hanterar det enkelt, eller två RTX 4090 (48 GB totalt). Vid full precision (BF16) tittar du på 140+ GB -- vilket effektivt kräver fyra A100 eller motsvarande.

Kan jag finjustera open source-LLM:er för mitt användningsfall?

Absolut. QLoRA gör det möjligt att finjustera en 70B-modell på ett enda 24 GB GPU. Mindre modeller som Phi-4 och Gemma 3 är ännu mer tillgängliga för finjusteringsexperiment. Apache 2.0 och MIT-licensierade modeller har inga restriktioner på derivatverk.

Vad gäller open source multimodala LLM:er?

Gemma 3 27B och Llama 4 Scout hanterar båda text och bildinmatning native. Phi-4-reasoning-vision-15B lägger till visuellt resonemang i en mindre skala. För videoförståelse stöder Llama 4 Scout upp till 20 timmars videoinmatning inom sitt kontextfönster.

Vilken är den bästa open source-LLM:en just nu?

Just nu är Qwen 3 235B-A22B den bästa open source-LLM:en totalt sett, med ledande resonemang och kodning under en Apache 2.0-licens. För ett enda konsument-GPU är Gemma 3 27B (16 GB VRAM) förstahandsvalet, och GLM-4.7 vinner för kodningsagenter med 94,2% HumanEval.

Finns det en topplista för open source-LLM:er?

Ja. Vår topplista för juli 2026 ovan rankar alla åtta modeller i den här guiden, och Hugging Face driver det community-drivna Open LLM Leaderboard för bredare täckning. Vi re-verifierar våra rankningar varje månad mot benchmarks som MMLU, HumanEval, AIME och SWE-bench.

Källor

Taggar

bästa open source llm 2026open source llmllama 4qwen 3deepseekgemma 3phi-4egenhostad llmlokal llm

Dela denna artikel

Starta ditt projekt

Redo att bygga något utöver det vanliga?

Låt oss göra verklighet av din idé. Vårt team hjälper dig gärna att bygga mjukvara som gör skillnad.