
Nejlepší open-source LLM 2026: Otestovali jsme 8 modelů — jen 3 porazily třídu GPT-4
Naposledy aktualizováno: 5. července 2026. Každé benchmarkové skóre, každý údaj o VRAM i každá licence v tomto průvodci byly pro tuto aktualizaci znovu ověřeny. Níže uvedené pořadí odráží open-weight modely vydané do poloviny roku 2026 — pokud nové vydání pořadí změní, tuto stránku do měsíce aktualizujeme.
Nejlepší open-source LLM roku 2026 je Qwen 3 235B-A22B pro celkové uvažování a programování, přičemž DeepSeek R1 vede v hlubokém matematickém uvažování a Llama 4 Scout v dlouhém kontextu (10M tokenů). Pro jednu spotřebitelskou grafickou kartu jsou nejsnadněji self-hostovatelné Gemma 3 27B (16 GB VRAM) a Phi-4 14B (8 GB). Všechny tři špičkové modely se v kódu a matematice vyrovnají výkonu třídy GPT-4, a přitom zůstávají zdarma k nasazení.
Přední open-source LLM: Benchmarkový přehled
Níže uvedená tabulka pokrývá pět široce nasazovaných open-source modelů hodnocených na standardních veřejných benchmarcích. MMLU měří široké obecné znalosti; HumanEval měří úspěšnost generování kódu.
| Model | Parametry | Vydání | MMLU | HumanEval | Licence | Nejlepší pro |
|---|---|---|---|---|---|---|
| Llama 3.3 70B | 70B | prosinec 2024 | 86,0 | 88,4 | Llama 3.3 Community | Univerzální použití, vícejazyčnost |
| Qwen 2.5 72B | 72B | září 2024 | 85,0+ | 86,6 | Qwen License | Matematika, programování, plnění instrukcí |
| DeepSeek-V3 | 671B (37B aktivních) | prosinec 2024 | 87,1 | 82,6 | MIT | Univerzální použití, programování, nákladová efektivita |
| Mistral Small 3.1 | 24B | březen 2025 | 80,6 | 88,4 | Apache 2.0 | Agentické workflow, vize, vícejazyčnost |
| Gemma 3 27B | 27B | březen 2025 | ~78,6 | 87,8 | Gemma Terms of Use | Nasazení na jedné GPU, multimodalita |
Tuto tabulku obnovujeme měsíčně.
Open-source LLM už s proprietárními modely jen „nesoutěží" — v programování, matematice a úlohách s dlouhým kontextem vyhrávají. Rozdíl mezi API účtem za 200 $/měsíc a self-hostovaným otevřeným modelem nikdy nebyl menší.
Toto pořadí prořezává humbuk. Každý model zde je hodnocen podle benchmarků, na kterých záleží, hardwaru, který skutečně budete potřebovat, a konkrétního případu užití, kde každý z nich září nejvíce.
Rychlé shrnutí: Kterou open-source LLM si vybrat?
Potřebujete absolutně nejlepší uvažování? Zvolte Qwen 3 235B nebo DeepSeek R1. Chcete něco spustit na jedné GPU? Gemma 3 27B nebo Phi-4 14B. Zpracováváte obrovské dokumenty? Kontext 10M tokenů u Llama 4 Scout nemá konkurenci.
| Pořadí | Model | Parametry (aktivní) | Nejlepší pro | Licence | Min. VRAM |
|---|---|---|---|---|---|
| 1. | Qwen 3 235B-A22B | 235B (22B) | Uvažování + programování | Apache 2.0 | ~132 GB (Q4) |
| 2. | DeepSeek R1 | 671B (37B) | Hluboké uvažování + matematika | MIT | ~136 GB (Q4) |
| 3. | Llama 4 Scout | 109B (17B) | Dlouhý kontext (10M tokenů) | Llama License | ~55 GB (Q4) |
| 4. | DeepSeek V3 | 671B (37B) | Univerzální použití + programování | MIT | ~136 GB (Q4) |
| 5. | Mistral Large 3 | 675B (41B) | Vícejazyčnost + enterprise | Apache 2.0 | ~140 GB (Q4) |
| 6. | Gemma 3 27B | 27B (27B, dense) | Nasazení na jedné GPU | Open weights | ~16 GB (Q4) |
| 7. | Phi-4 Reasoning | 14B (14B, dense) | Edge + mobilní zařízení | MIT | ~8 GB (Q4) |
| 8. | GLM-4.7 | 355B (32B) | Agentické programovací workflow | MIT | ~130 GB (Q4) |
Údaje o VRAM počítají s Q4 kvantizací. Nároky v plné přesnosti jsou 2–4× vyšší. Pokud jste v spouštění modelů lokálně začátečník, začněte s Gemma 3 nebo Phi-4 — jsou to hardwarově nejpřívětivější možnosti na tomto seznamu.
Žebříček open-source LLM: Pořadí červenec 2026
K červenci 2026 vede našemu žebříčku open-source LLM v celkovém uvažování a programování Qwen 3 235B-A22B, druhý je DeepSeek R1 v hluboké matematice a třetí Llama 4 Scout v dlouhém kontextu. Kompletní pořadí níže pokrývá všech osm modelů hodnocených v tomto průvodci, od data-centrových sestav až po varianty vhodné pro notebook.
| Pořadí | Model | Licence | Nejlepší pro | Min. VRAM |
|---|---|---|---|---|
| 1. | Qwen 3 235B-A22B | Apache 2.0 | Uvažování + programování | ~132 GB (Q4) |
| 2. | DeepSeek R1 | MIT | Hluboké uvažování + matematika | ~136 GB (Q4) |
| 3. | Llama 4 Scout | Llama License | Dlouhý kontext (10M tokenů) | ~55 GB (Q4) |
| 4. | DeepSeek V3 | MIT | Univerzální použití + programování | ~136 GB (Q4) |
| 5. | Mistral Large 3 | Apache 2.0 | Vícejazyčnost + enterprise | ~140 GB (Q4) |
| 6. | Gemma 3 27B | Open weights | Nasazení na jedné GPU | ~16 GB (Q4) |
| 7. | Phi-4 Reasoning | MIT | Edge + mobilní zařízení | ~8 GB (Q4) |
| 8. | GLM-4.7 | MIT | Agentické programovací workflow | ~130 GB (Q4) |
Toto pořadí odráží naši měsíční kontrolu benchmarků, hardwarových nároků a licenčních podmínek.
Nyní si rozeberme, co dělá každý model hodným vaší pozornosti.
1. Qwen 3 235B-A22B, nejlepší open-source LLM celkově
Qwen 3 235B-A22B od Alibaby je modelem, který je teď třeba porazit. Jde o architekturu Mixture-of-Experts s celkem 235 miliardami parametrů, ale na token se aktivuje jen 22 miliard, což oproti dense modelu srovnatelné kvality snižuje výpočty zhruba o 90 %.
Co Qwen 3 odlišuje, je jeho dvourežimové uvažování. Můžete přepínat mezi „režimem uvažování" pro složité matematické a programovací problémy (kde model ukazuje svůj řetězec úvah) a rychlým „režimem bez uvažování" pro svižné odpovědi v chatu. Na produkci na této flexibilitě záleží.
Výsledky v benchmarcích:
| Benchmark | Skóre Qwen 3 235B | Kontext |
|---|---|---|
| AIME 2024 | 85,7 % | Matematika soutěžní úrovně |
| AIME 2025 | 81,5 % | Těžší matematické úlohy |
| LiveCodeBench v5 | 70,7 % | Reálné programovací úlohy |
| CodeForces | 2 056 | Soutěžní programování |
| BFCL v3 | 70,8 % | Volání funkcí |
Tyto číslice ho řadí do stejné ligy jako DeepSeek R1, o1 od OpenAI a Gemini 2.5 Pro — s tím rozdílem, že si ho můžete stáhnout, doladit a nasadit kdekoli chcete pod licencí Apache 2.0.
Hardwarové nároky: Plný model potřebuje při Q4 kvantizaci zhruba 132 GB VRAM. To je multi-GPU sestava — představte si pět RTX 3090, tři A40 nebo dual-H100 sestavu. Není to levné, ale pro startup nebo výzkumnou laboratoř zcela dosažitelné. Rodina Qwen 3 zahrnuje i menší varianty (32B, 14B, 8B, 4B), které běží na spotřebitelském hardwaru.
Kdo by ho měl použít: Týmy, které potřebují uvažování a programování na špičkové úrovni, ale chtějí vlastnit svou infrastrukturu. Obzvlášť silný je pro vícejazyčné zátěže s kontextem 256K a podporou více než 100 jazyků. Pokud plánujete doladit model pro svou konkrétní doménu, licence Apache 2.0 u Qwen 3 vám dává plnou volnost.
2. DeepSeek R1 -- nejlepší pro hluboké uvažování
DeepSeek R1 změnil hru, když na začátku roku 2025 vyšel a dokázal, že open-source modely se v úlohách uvažování vyrovnají o1 od OpenAI. Aktualizace R1-0528 to posunula ještě dál — přesnost na AIME 2025 vyskočila ze 70 % na 87,5 %.
Tajnou zbraní modelu je jeho metodika tréninku. DeepSeek nejprve vytvořil R1-Zero pomocí čistého posilovaného učení bez zahřívací fáze supervizovaného doladění. Model spontánně vyvinul uvažování formou řetězce úvah, sebeověřování a chování s návraty. Doslova se naučil kontrolovat vlastní práci.
Výsledky v benchmarcích:
| Benchmark | Skóre DeepSeek R1 | Kontext |
|---|---|---|
| AIME 2025 | 87,5 % (R1-0528) | Matematická olympiáda |
| GPQA Diamond | 71,5 % | Věda na úrovni postgraduálu |
| SWE-bench | 49,2 % | Reálné softwarové inženýrství |
| HumanEval | 92,4 % | Generování kódu |
Hardwarové nároky: Stejná 671B MoE architektura jako DeepSeek V3, takže počítejte s ~136 GB VRAM při Q4. Ale tady je ten praktický úhel: DeepSeek vydal i destilované varianty s 1,5B, 7B, 14B, 32B a 70B parametry. 32B destil běží na jedné RTX 4090 a v úlohách uvažování stále překonává mnoho větších modelů.
Kdo by ho měl použít: Kdokoli, kdo staví aplikace vyžadující uvažování krok za krokem, dokazování vět, ladění složitého kódu či vědeckou analýzu. Destilované varianty jsou obzvlášť užitečné, pokud potřebujete schopnosti uvažování s omezeným rozpočtem. Pokud chcete menší destily nasadit na vlastním hardwaru, podívejte se na nejlepší nástroje pro lokální běh LLM.
3. Llama 4 Scout, nejlepší pro dlouhý kontext
Llama 4 Scout od Mety přinesla do open-source světa něco opravdu nového: kontextové okno 10 milionů tokenů. To není překlep. Můžete jí v jednom promptu předat celý kódový základ, regál výzkumných prací nebo 20 hodin přepisu videa.
Scout používá 16 MoE expertů, z nichž na token jsou aktivní jen 2, takže má celkem 109B parametrů, ale aktivních jen 17B. Meta tvrdí, že se vejde na jednu H100 s INT4 kvantizací, ačkoli 10M kontextové okno samozřejmě vyžaduje více paměti pro KV cache.
Výsledky v benchmarcích:
| Benchmark | Skóre Llama 4 Scout | Kontext |
|---|---|---|
| Needle-in-a-Haystack (10M) | 100 % | Dokonalé vyhledání |
| MMLU | 79,6 % | Obecné znalosti |
| HumanEval | 81,2 % | Generování kódu |
| DocVQA | 85,1 % | Porozumění dokumentům |
Ten dokonalý výsledek Needle-in-a-Haystack při 10M tokenech je pozoruhodný. Většina modelů začíná ztrácet informace dávno před 128K. Scout využívá nový přístup k maskování pozornosti mezi dokumenty, který udržuje hranice mezi dokumenty i v rámci svého obrovského kontextového okna.
Hardwarové nároky: Při Q4 potřebují váhy modelu asi 55 GB VRAM. Jedna H100 (80 GB) to zvládne s přehledem. Na spotřebitelském hardwaru to zvládnou dvě RTX 4090 (celkem 48 GB) pro kratší délky kontextu. Háček: skutečné využití plného 10M kontextového okna vyžaduje obrovskou paměť KV cache navíc k vahám modelu. V praxi se většina self-hostovaných nasazení zastavuje na 128K–256K tokenech.
Kdo by ho měl použít: Týmy pracující s obrovskými dokumenty, právní analýzou, dotazováním nad kódovými repozitáři, syntézou výzkumných prací. Multimodální schopnosti (text + obraz na vstupu) jsou rovněž silné. Jen buďte realistickí ohledně délky kontextu: 10M strop je reálný, ale k jeho dosažení budete potřebovat serverový hardware.
4. DeepSeek V3 -- nejlepší univerzální open-source LLM
Zatímco DeepSeek R1 sbírá titulky za uvažování, DeepSeek V3 je pravděpodobně praktičtějším modelem pro každodenní použití. Je to pracovní kůň — rychlý, schopný napříč obory a na svou velikost pozoruhodně efektivní.
V3 sdílí stejnou 671B MoE / 37B aktivní architekturu jako R1, ale vyměňuje hluboké řetězce úvah za rychlejší doby odezvy a širší obecné schopnosti. Aktualizace V3-0324 převzala techniky posilovaného učení z tréninku R1 a posílila uvažování bez latence navíc spojené s explicitním řetězcem úvah.
Výsledky v benchmarcích:
| Benchmark | Skóre DeepSeek V3 | Kontext |
|---|---|---|
| MMLU | 87,1 % | Obecné znalosti |
| HumanEval | 82,6 % | Generování kódu |
| MATH | 90,2 % | Matematické uvažování |
| Kontextové okno | 128K | Podpora dlouhých dokumentů |
DeepSeek V3 překonává GPT-4.5 v benchmarcích programování a matematiky. Jeho tréninková efektivita je legendární — jen 2,788 milionu H800 GPU hodin na celý běh předtrénování, zlomek toho, co vyžadují srovnatelné modely.
Hardwarové nároky: Shodné s R1 (~136 GB VRAM při Q4). Pro praktické nasazení běží GGUF kvantizované verze přes llama.cpp nebo Ollama na multi-GPU spotřebitelských sestavách.
Kdo by ho měl použít: Pokud potřebujete jeden model, který zvládne vše — chat, programování, analýzu, překlad, sumarizaci — V3 je nejvyváženější volbou. Na těžkém uvažování neporazí R1 ani Scouta na délce kontextu, ale překoná oba na typických produkčních zátěžích, kde na rychlosti a všestrannosti záleží více než na špičkových benchmarkových skóre.
5. Mistral Large 3 -- nejlepší pro vícejazyčnost a enterprise použití
Mistral Large 3 vrátil Mistral zpět na špici. S celkem 675B parametry (41B aktivních) jde o plný MoE model vydaný pod Apache 2.0 — obrovský posun oproti restriktivní výzkumné licenci Mistral Large 2.
Model byl trénován od nuly na 3 000 NVIDIA H200 GPU a je to znát. Na LMSYS Chatbot Arena se umístil jako 2. mezi otevřenými modely a 6. celkově (včetně proprietárních). Co ho dělá obzvlášť zajímavým pro evropské týmy, je jeho vícejazyčná síla — zhruba 85,5% přesnost na vyváženém vícejazyčném testu MMLU.
Výsledky v benchmarcích:
| Benchmark | Skóre Mistral Large 3 | Kontext |
|---|---|---|
| Vícejazyčné MMLU | 85,5 % | Znalosti napříč jazyky |
| LMSYS Arena | 6. celkově | Žebříček lidských preferencí |
| AIME 2025 (14B varianta) | 85 % | Matematické uvažování |
| Kontextové okno | 128K | Podpora dlouhých dokumentů |
Jedna vlastnost, která modely Mistral odlišuje: jsou trénovány říct „nevím", místo aby halucinovaly. Díky tomu je Mistral Large 3 skvělou volbou pro RAG pipeline a enterprise aplikace, kde na faktické přesnosti záleží více než na kreativním výstupu.
Hardwarové nároky: S celkem 675B parametry jsou nároky na VRAM podobné jako u DeepSeek (~140 GB při Q4). Mistral nabízí i 14B variantu Small 3, která se vejde na jednu spotřebitelskou GPU a v uvažování a programování výrazně převyšuje svou váhovou kategorii.
Kdo by ho měl použít: Evropské společnosti, které potřebují vícejazyčné schopnosti a datovou suverenitu. Enterprise týmy stavící RAG systémy, kde je kritické omezení halucinací. Licence Apache 2.0 zcela odstraňuje komerční třecí plochy.
6. Gemma 3 27B, nejlepší pro nasazení na jedné GPU
Gemma 3 27B od Googlu je sladkým bodem mezi schopnostmi a dostupností. S 27 miliardami parametrů v dense architektuře běží na jedné RTX 4090 s Q4 kvantizací. Žádné multi-GPU sestavy, žádný serverový hardware — jen běžná herní karta.
Nenechte se zmást skromným počtem parametrů. Gemma 3 27B výrazně převyšuje svou váhovou kategorii, zejména v multimodálních úlohách. Zvládá text i obraz na vstupu, podporuje více než 140 jazyků a její 130K kontextové okno je na model této velikosti štědré.
Výsledky v benchmarcích:
| Benchmark | Skóre Gemma 3 27B | Kontext |
|---|---|---|
| MMLU | 78,6 % | Obecné znalosti |
| DocVQA | 85,6 % | Porozumění dokumentům |
| MGSM | 74,3 % | Vícejazyčná matematika |
| ChartQA | 76,3 % | Vizuální uvažování |
Tyto multimodální výsledky (DocVQA 85,6 %, ChartQA 76,3 %) konkurují modelům 3–5× větším. Pro vývojáře, kteří potřebují porozumění obrazu bez GPU clusteru, je Gemma 3 jasnou volbou.
Hardwarové nároky: Asi 16 GB VRAM při Q4 kvantizaci, 32 GB při Q8. Jedna RTX 4090 (24 GB) to zvládne s přehledem. Zvládne to i M2 MacBook Pro se 32 GB jednotné paměti. Pokud postupujete podle našeho průvodce lokálním během LLM, Gemma 3 je jedním z nejsnadnějších modelů pro začátek.
Kdo by ho měl použít: Sóloví vývojáři, malé týmy a kdokoli, kdo chce schopný multimodální model bez pronájmu cloudových GPU. Je také skvělá pro prototypování — otestujte svou pipeline lokálně na Gemma 3 a v produkci v případě potřeby přejděte na větší model. Pro novější malý model od Googlu viz náš průvodce Gemma 4 12B.
7. Phi-4 Reasoning, nejlepší pro edge a nasazení s omezenými zdroji
Phi-4 Reasoning od Microsoftu dokazuje, že počet parametrů není vše. S pouhými 14 miliardami parametrů překonává 70B destil DeepSeek R1 v několika benchmarcích uvažování. Nedávno vydaný Phi-4-reasoning-vision-15B přidává multimodální schopnosti a v úlohách matematicko-vizuálního uvažování boduje o 17 % výše než Gemma 3 12B.
Tajemstvím rodiny Phi-4 je kvalita tréninkových dat. Přístup Microsoftu upřednostňuje kurátovaná, vysoce kvalitní data před surovým měřítkem — a funguje to. Phi-4 dosahuje přes 80 % v benchmarcích MATH a MGSM a v matematickém uvažování překonává Gemini Pro od Googlu i GPT-4o-mini.
Výsledky v benchmarcích:
| Benchmark | Skóre Phi-4 | Kontext |
|---|---|---|
| MATH | 82,6 % | Matematické uvažování |
| HumanEval | 82,6 % | Generování kódu |
| MGSM | 80 %+ | Vícejazyčná matematika |
| MathVista (vize) | +17 % oproti Gemma 12B | Vizuální matematika |
Hardwarové nároky: Kolem 8 GB VRAM při Q4 — to je GPU notebooku nebo i starší desktopová karta. Model pohodlně běží na MacBookech s Apple Silicon, takže je opravdu přenosný. Pro edge nasazení je jedním z mála modelů, které dokážou běžet na zařízení s rozumnou latencí.
Kdo by ho měl použít: Vývojáři mobilních a edge aplikací, týmy stavící AI funkce na zařízení a kdokoli, kdo potřebuje silné uvažování na minimálním hardwaru. Phi-4 je také skvělou volbou pro vyhodnocování doladěných modelů, protože jeho malá velikost dělá tréninkové iterace rychlými a levnými. Licence MIT znamená žádné komerční restrikce.
8. GLM-4.7 -- nejlepší pro agentické programování
GLM-4.7 od Z.ai je účelově postaven pro konkrétní případ užití: agentické programovací workflow, kde model potřebuje uvažovat, používat nástroje a udržovat kontext napříč dlouhými vícekrokovými interakcemi.
Jeho architektura je 355B MoE s 32B aktivními parametry, ale vynikající funkcí je jeho tříúrovňový systém uvažování. Na rozdíl od většiny modelů, které každé kolo restartují svůj proces uvažování, si GLM-4.7 uchovává bloky uvažování napříč celou konverzací. Tento perzistentní kontext uvažování dělá reálný rozdíl, když model orchestrací složité vícekrokové programovací úlohy.
Výsledky v benchmarcích:
| Benchmark | Skóre GLM-4.7 | Kontext |
|---|---|---|
| SWE-bench | 73,8 % | Reálné softwarové inženýrství |
| HumanEval | 94,2 % | Generování kódu |
| Kontextové okno | 200K | Dlouhé interakce |
| Max. výstup | 131K tokenů | Rozšířená generace |
Toto skóre 73,8 % na SWE-bench je konkurenceschopné Claude Sonnet 4.5 — na reálných úlohách softwarového inženýrství, ne na syntetických benchmarcích. A 94,2 % na HumanEval je nejvyšší ze všech modelů na tomto seznamu.
Hardwarové nároky: Podobné jako u ostatních velkých MoE modelů (~130 GB VRAM při Q4). Kontextové okno 200K a max. výstup 131K z něj během dlouhých agentických relací dělají žrouta paměti.
Kdo by ho měl použít: Týmy vývoje s asistencí AI, které staví programovací agenty, automatizované ladicí nástroje nebo systémy pro code review. Pokud vybíráte nástroje pro doladění pro model zaměřený na programování, GLM-4.7 je silným základem. Licence MIT znamená plné komerční využití.
Nejlepší open-source LLM pro programování (červenec 2026)
Pro programování v červenci 2026 je GLM-4.7 špičkovou open-source volbou se skóre 94,2 % na HumanEval a 73,8 % na SWE-bench — konkurenceschopný Claude Sonnet 4.5 na reálných softwarových úlohách. Chcete silný programovací model na spotřebitelském hardwaru? 32B destil DeepSeek R1 běží na jedné RTX 4090.
Zvažujete novější vydání GLM? Podívejte se na náš rozbor GLM 5.2, jak si stojí v porovnání.
Jak si vybrat: Rozhodovací rámec
„Nejlepší" model závisí zcela na vašich omezeních. Použijte tuto matici k zúžení rozhodnutí.
| Pokud potřebujete... | Zvolte | Proč |
|---|---|---|
| Nejlepší celkové uvažování | Qwen 3 235B | Špičkové benchmarky matematiky, kódu i obecné |
| Hluboký řetězec úvah | DeepSeek R1 | Sebeopravující uvažování, 87,5 % AIME |
| Obrovské kontextové okno | Llama 4 Scout | 10M tokenů, dokonalé vyhledání |
| Rychlý univerzální | DeepSeek V3 | Nejlepší poměr rychlosti a kvality |
| Vícejazyčný enterprise | Mistral Large 3 | 85,5 % vícejazyčné MMLU, proti halucinacím |
| Jednu spotřebitelskou GPU | Gemma 3 27B | 16 GB VRAM, silná multimodalita |
| Notebook nebo edge zařízení | Phi-4 14B | 8 GB VRAM, licence MIT |
| Programovací agenty | GLM-4.7 | 94,2 % HumanEval, perzistentní uvažování |
Stále si nejste jisti? Začněte zde: Máte multi-GPU hardware? Pokud ne, vaše volby jsou Gemma 3 a Phi-4. Pokud ano, stavíte programovacího agenta? Vyberte GLM-4.7 nebo DeepSeek R1. Potřebujete dlouhý kontext? Llama 4 Scout. Vše ostatní? Qwen 3 235B je nejbezpečnější výchozí volbou.
Jak jsme tyto modely seřadili
Pořadí nezaložené na jediném benchmarku. Každý model byl hodnocen napříč pěti dimenzemi:
- Benchmarkový výkon — MMLU, HumanEval, AIME, SWE-bench a doménově specifické testy
- Hardwarová dostupnost — Dokážou ho reálné týmy skutečně nasadit?
- Licenční volnost — Apache 2.0 a MIT bodují výše než restriktivní licence
- Vyspělost ekosystému — Dostupnost na Hugging Face, Ollama, vLLM a hlavních inferenčních enginech
- Reálná adopce — Aktivní komunita, produkční nasazení, průběžné aktualizace
Modely, které si vedou dobře v benchmarcích, ale vyžadují GPU cluster, který nikdo nemá (díváme se na tebe, 671B v plné přesnosti), jsou penalizovány. Modely s restriktivními licencemi, které blokují komerční použití, také ztrácejí body. Cílem je praktická hodnota, ne chlubení se na žebříčku.
Pokud si chcete tyto modely otestovat sami, náš průvodce vyhodnocováním LLM vás provede nastavením systematických benchmarků a přehled nejlepších vyhodnocovacích nástrojů pokrývá frameworky, které budete potřebovat.
FAQ
Jaké jsou nejnovější open-source LLM v roce 2026?
Špici roku 2026 vedou Qwen 3 (Alibaba), DeepSeek R1 a V3, Llama 4 Scout (Meta), Mistral Large 3 a GLM-4.7 (Z.ai). Dílčí vydání jako DeepSeek R1-0528 a varianta Phi-4 reasoning-vision dorazila do poloviny roku 2026. Tento seznam měsíčně kontrolujeme a žebříček aktualizujeme vždy, když nové vydání změní pořadí.
Jak často se tento žebříček open-source LLM aktualizuje?
Měsíčně. Na začátku každého měsíce znovu ověřujeme benchmarková skóre, nároky na VRAM a licence a přidáváme nové modely, jakmile vyjdou. Datum „Naposledy aktualizováno" pod názvem odráží nejnovější kontrolu.
Jaká je nejlepší open-source LLM v roce 2026?
Qwen 3 235B-A22B aktuálně vede na nejširším záběru benchmarků a kombinuje špičkové uvažování, programování a vícejazyčné schopnosti pod licencí Apache 2.0. Pro konkrétní případy užití mohou být lepší volbou DeepSeek R1 (uvažování) a Llama 4 Scout (dlouhý kontext).
Mohu spouštět open-source LLM na spotřebitelském hardwaru?
Ano. Gemma 3 27B běží na jedné RTX 4090 (24 GB VRAM) a Phi-4 14B se vejde na GPU notebooku s 8 GB. Kvantizované verze (Q4, Q8) větších modelů fungují i na multi-GPU spotřebitelských sestavách pomocí nástrojů jako Ollama a llama.cpp.
Jsou open-source LLM stejně dobré jako ChatGPT nebo Claude?
V benchmarcích programování a matematiky se nejlepší open-source modely vyrovnají nebo překonají GPT-4.5 a blíží se výkonu Claude Sonnet 4.5. Rozdíl je nejmenší u strukturovaných úloh (kód, matematika, uvažování) a největší u kreativního psaní a nuancovaného plnění instrukcí.
Co znamená MoE (Mixture-of-Experts) pro hardware?
MoE modely mají velký celkový počet parametrů, ale na token aktivují jen jejich část. Celý model se však musí načíst do paměti, aby router mohl vybírat experty. 235B MoE model s 22B aktivními stále potřebuje VRAM odpovídající 235B — neušetříte paměť, ušetříte výpočty.
Která open-source LLM je nejlepší pro programování?
GLM-4.7 vede s 94,2 % na HumanEval a 73,8 % na SWE-bench. Pro čisté generování kódu jsou těsně za ním DeepSeek R1 a Qwen 3 235B. Pro programování na spotřebitelském hardwaru je 32B destil DeepSeek R1 nejlepším poměrem schopností a nákladů.
Má Llama 4 Scout opravdu 10 milionů tokenů kontextu?
Architektura to podporuje a Meta předvedla dokonalé vyhledání Needle-in-a-Haystack při 10M tokenech. Ale skutečné využití plného kontextu vyžaduje obrovskou paměť KV cache. Většina self-hostovaných nasazení reálně končí na 128K–256K tokenech. Cloudoví poskytovatelé jako Together AI a Fireworks nabízejí delší kontextová okna.
Jakou licenci bych měl u open-source LLM hledat?
Apache 2.0 a MIT jsou nejpropustnější — plné komerční využití, úpravy a redistribuce. Vlastní licence Llama umožňuje komerční použití, ale má restrikce pro aplikace s více než 700M uživateli. Některé „open-weight" modely (jako Gemma) mají specifické podmínky — před produkčním nasazením si vždy přečtěte licenci.
Kolik VRAM potřebuji pro 70B model?
Při Q4 kvantizaci potřebuje 70B dense model zhruba 35–40 GB VRAM. Jedna A100 (80 GB) to zvládne snadno, případně dvě RTX 4090 (celkem 48 GB). V plné přesnosti (BF16) počítejte se 140+ GB, což prakticky vyžaduje čtyři A100 nebo ekvivalent.
Mohu open-source LLM doladit pro svůj případ užití?
Rozhodně. QLoRA umožňuje doladit 70B model na jedné 24GB GPU. Menší modely jako Phi-4 a Gemma 3 jsou pro experimenty s doladěním ještě dostupnější. Modely s licencí Apache 2.0 a MIT nemají žádná omezení na odvozená díla.
Co open-source multimodální LLM?
Gemma 3 27B i Llama 4 Scout zvládají text i obraz na vstupu nativně. Phi-4-reasoning-vision-15B přidává vizuální uvažování v menším měřítku. Pro porozumění videu podporuje Llama 4 Scout v rámci svého kontextového okna až 20 hodin video vstupu.
Jaká je nejlepší open-source LLM právě teď?
Právě teď je Qwen 3 235B-A22B nejlepší open-source LLM celkově a vede v uvažování a programování pod licencí Apache 2.0. Pro jednu spotřebitelskou GPU je špičkovou volbou Gemma 3 27B (16 GB VRAM) a pro programovací agenty vítězí GLM-4.7 s 94,2 % na HumanEval.
Existuje žebříček open-source LLM?
Ano. Náš žebříček z července 2026 výše řadí všech osm modelů v tomto průvodci a Hugging Face hostuje komunitně spravovaný Open LLM Leaderboard pro širší pokrytí. Naše pořadí měsíčně znovu ověřujeme proti benchmarkům jako MMLU, HumanEval, AIME a SWE-bench.
Vybrat nástroj je ta snadnější polovina. Rozběhnout ho spolehlivě uvnitř reálného produktu je místo, kde většina týmů uvázne — a přesně to náš tým AI integrací pro klienty staví, od RAG pipeline po vlastní agenty. Chcete druhý názor na svůj stack? Získejte bezplatnou konzultaci.