Techsy
Kontakt
Začít
Zpět na blog
ai-machine-learning

Nejlepší open-source LLM 2026: Otestovali jsme 8 modelů — jen 3 porazily třídu GPT-4

Napsal Mert Batur Gürbüz
Aktualizováno Jul 5, 2026
16 minut čtení
Obsah
Nejlepší open-source LLM 2026: Otestovali jsme 8 modelů — jen 3 porazily třídu GPT-4

Nejlepší open-source LLM 2026: Otestovali jsme 8 modelů — jen 3 porazily třídu GPT-4

Naposledy aktualizováno: 5. července 2026. Každé benchmarkové skóre, každý údaj o VRAM i každá licence v tomto průvodci byly pro tuto aktualizaci znovu ověřeny. Níže uvedené pořadí odráží open-weight modely vydané do poloviny roku 2026 — pokud nové vydání pořadí změní, tuto stránku do měsíce aktualizujeme.

Nejlepší open-source LLM roku 2026 je Qwen 3 235B-A22B pro celkové uvažování a programování, přičemž DeepSeek R1 vede v hlubokém matematickém uvažování a Llama 4 Scout v dlouhém kontextu (10M tokenů). Pro jednu spotřebitelskou grafickou kartu jsou nejsnadněji self-hostovatelné Gemma 3 27B (16 GB VRAM) a Phi-4 14B (8 GB). Všechny tři špičkové modely se v kódu a matematice vyrovnají výkonu třídy GPT-4, a přitom zůstávají zdarma k nasazení.

Přední open-source LLM: Benchmarkový přehled

Níže uvedená tabulka pokrývá pět široce nasazovaných open-source modelů hodnocených na standardních veřejných benchmarcích. MMLU měří široké obecné znalosti; HumanEval měří úspěšnost generování kódu.

ModelParametryVydáníMMLUHumanEvalLicenceNejlepší pro
Llama 3.3 70B70Bprosinec 202486,088,4Llama 3.3 CommunityUniverzální použití, vícejazyčnost
Qwen 2.5 72B72Bzáří 202485,0+86,6Qwen LicenseMatematika, programování, plnění instrukcí
DeepSeek-V3671B (37B aktivních)prosinec 202487,182,6MITUniverzální použití, programování, nákladová efektivita
Mistral Small 3.124Bbřezen 202580,688,4Apache 2.0Agentické workflow, vize, vícejazyčnost
Gemma 3 27B27Bbřezen 2025~78,687,8Gemma Terms of UseNasazení na jedné GPU, multimodalita

Tuto tabulku obnovujeme měsíčně.

Open-source LLM už s proprietárními modely jen „nesoutěží" — v programování, matematice a úlohách s dlouhým kontextem vyhrávají. Rozdíl mezi API účtem za 200 $/měsíc a self-hostovaným otevřeným modelem nikdy nebyl menší.

Toto pořadí prořezává humbuk. Každý model zde je hodnocen podle benchmarků, na kterých záleží, hardwaru, který skutečně budete potřebovat, a konkrétního případu užití, kde každý z nich září nejvíce.

Rychlé shrnutí: Kterou open-source LLM si vybrat?

Potřebujete absolutně nejlepší uvažování? Zvolte Qwen 3 235B nebo DeepSeek R1. Chcete něco spustit na jedné GPU? Gemma 3 27B nebo Phi-4 14B. Zpracováváte obrovské dokumenty? Kontext 10M tokenů u Llama 4 Scout nemá konkurenci.

PořadíModelParametry (aktivní)Nejlepší proLicenceMin. VRAM
1.Qwen 3 235B-A22B235B (22B)Uvažování + programováníApache 2.0~132 GB (Q4)
2.DeepSeek R1671B (37B)Hluboké uvažování + matematikaMIT~136 GB (Q4)
3.Llama 4 Scout109B (17B)Dlouhý kontext (10M tokenů)Llama License~55 GB (Q4)
4.DeepSeek V3671B (37B)Univerzální použití + programováníMIT~136 GB (Q4)
5.Mistral Large 3675B (41B)Vícejazyčnost + enterpriseApache 2.0~140 GB (Q4)
6.Gemma 3 27B27B (27B, dense)Nasazení na jedné GPUOpen weights~16 GB (Q4)
7.Phi-4 Reasoning14B (14B, dense)Edge + mobilní zařízeníMIT~8 GB (Q4)
8.GLM-4.7355B (32B)Agentické programovací workflowMIT~130 GB (Q4)

Údaje o VRAM počítají s Q4 kvantizací. Nároky v plné přesnosti jsou 2–4× vyšší. Pokud jste v spouštění modelů lokálně začátečník, začněte s Gemma 3 nebo Phi-4 — jsou to hardwarově nejpřívětivější možnosti na tomto seznamu.

Žebříček open-source LLM: Pořadí červenec 2026

K červenci 2026 vede našemu žebříčku open-source LLM v celkovém uvažování a programování Qwen 3 235B-A22B, druhý je DeepSeek R1 v hluboké matematice a třetí Llama 4 Scout v dlouhém kontextu. Kompletní pořadí níže pokrývá všech osm modelů hodnocených v tomto průvodci, od data-centrových sestav až po varianty vhodné pro notebook.

PořadíModelLicenceNejlepší proMin. VRAM
1.Qwen 3 235B-A22BApache 2.0Uvažování + programování~132 GB (Q4)
2.DeepSeek R1MITHluboké uvažování + matematika~136 GB (Q4)
3.Llama 4 ScoutLlama LicenseDlouhý kontext (10M tokenů)~55 GB (Q4)
4.DeepSeek V3MITUniverzální použití + programování~136 GB (Q4)
5.Mistral Large 3Apache 2.0Vícejazyčnost + enterprise~140 GB (Q4)
6.Gemma 3 27BOpen weightsNasazení na jedné GPU~16 GB (Q4)
7.Phi-4 ReasoningMITEdge + mobilní zařízení~8 GB (Q4)
8.GLM-4.7MITAgentické programovací workflow~130 GB (Q4)

Toto pořadí odráží naši měsíční kontrolu benchmarků, hardwarových nároků a licenčních podmínek.

Nyní si rozeberme, co dělá každý model hodným vaší pozornosti.

1. Qwen 3 235B-A22B, nejlepší open-source LLM celkově

Qwen 3 235B-A22B od Alibaby je modelem, který je teď třeba porazit. Jde o architekturu Mixture-of-Experts s celkem 235 miliardami parametrů, ale na token se aktivuje jen 22 miliard, což oproti dense modelu srovnatelné kvality snižuje výpočty zhruba o 90 %.

Co Qwen 3 odlišuje, je jeho dvourežimové uvažování. Můžete přepínat mezi „režimem uvažování" pro složité matematické a programovací problémy (kde model ukazuje svůj řetězec úvah) a rychlým „režimem bez uvažování" pro svižné odpovědi v chatu. Na produkci na této flexibilitě záleží.

Výsledky v benchmarcích:

BenchmarkSkóre Qwen 3 235BKontext
AIME 202485,7 %Matematika soutěžní úrovně
AIME 202581,5 %Těžší matematické úlohy
LiveCodeBench v570,7 %Reálné programovací úlohy
CodeForces2 056Soutěžní programování
BFCL v370,8 %Volání funkcí

Tyto číslice ho řadí do stejné ligy jako DeepSeek R1, o1 od OpenAI a Gemini 2.5 Pro — s tím rozdílem, že si ho můžete stáhnout, doladit a nasadit kdekoli chcete pod licencí Apache 2.0.

Hardwarové nároky: Plný model potřebuje při Q4 kvantizaci zhruba 132 GB VRAM. To je multi-GPU sestava — představte si pět RTX 3090, tři A40 nebo dual-H100 sestavu. Není to levné, ale pro startup nebo výzkumnou laboratoř zcela dosažitelné. Rodina Qwen 3 zahrnuje i menší varianty (32B, 14B, 8B, 4B), které běží na spotřebitelském hardwaru.

Kdo by ho měl použít: Týmy, které potřebují uvažování a programování na špičkové úrovni, ale chtějí vlastnit svou infrastrukturu. Obzvlášť silný je pro vícejazyčné zátěže s kontextem 256K a podporou více než 100 jazyků. Pokud plánujete doladit model pro svou konkrétní doménu, licence Apache 2.0 u Qwen 3 vám dává plnou volnost.

2. DeepSeek R1 -- nejlepší pro hluboké uvažování

DeepSeek R1 změnil hru, když na začátku roku 2025 vyšel a dokázal, že open-source modely se v úlohách uvažování vyrovnají o1 od OpenAI. Aktualizace R1-0528 to posunula ještě dál — přesnost na AIME 2025 vyskočila ze 70 % na 87,5 %.

Tajnou zbraní modelu je jeho metodika tréninku. DeepSeek nejprve vytvořil R1-Zero pomocí čistého posilovaného učení bez zahřívací fáze supervizovaného doladění. Model spontánně vyvinul uvažování formou řetězce úvah, sebeověřování a chování s návraty. Doslova se naučil kontrolovat vlastní práci.

Výsledky v benchmarcích:

BenchmarkSkóre DeepSeek R1Kontext
AIME 202587,5 % (R1-0528)Matematická olympiáda
GPQA Diamond71,5 %Věda na úrovni postgraduálu
SWE-bench49,2 %Reálné softwarové inženýrství
HumanEval92,4 %Generování kódu

Hardwarové nároky: Stejná 671B MoE architektura jako DeepSeek V3, takže počítejte s ~136 GB VRAM při Q4. Ale tady je ten praktický úhel: DeepSeek vydal i destilované varianty s 1,5B, 7B, 14B, 32B a 70B parametry. 32B destil běží na jedné RTX 4090 a v úlohách uvažování stále překonává mnoho větších modelů.

Kdo by ho měl použít: Kdokoli, kdo staví aplikace vyžadující uvažování krok za krokem, dokazování vět, ladění složitého kódu či vědeckou analýzu. Destilované varianty jsou obzvlášť užitečné, pokud potřebujete schopnosti uvažování s omezeným rozpočtem. Pokud chcete menší destily nasadit na vlastním hardwaru, podívejte se na nejlepší nástroje pro lokální běh LLM.

3. Llama 4 Scout, nejlepší pro dlouhý kontext

Llama 4 Scout od Mety přinesla do open-source světa něco opravdu nového: kontextové okno 10 milionů tokenů. To není překlep. Můžete jí v jednom promptu předat celý kódový základ, regál výzkumných prací nebo 20 hodin přepisu videa.

Scout používá 16 MoE expertů, z nichž na token jsou aktivní jen 2, takže má celkem 109B parametrů, ale aktivních jen 17B. Meta tvrdí, že se vejde na jednu H100 s INT4 kvantizací, ačkoli 10M kontextové okno samozřejmě vyžaduje více paměti pro KV cache.

Výsledky v benchmarcích:

BenchmarkSkóre Llama 4 ScoutKontext
Needle-in-a-Haystack (10M)100 %Dokonalé vyhledání
MMLU79,6 %Obecné znalosti
HumanEval81,2 %Generování kódu
DocVQA85,1 %Porozumění dokumentům

Ten dokonalý výsledek Needle-in-a-Haystack při 10M tokenech je pozoruhodný. Většina modelů začíná ztrácet informace dávno před 128K. Scout využívá nový přístup k maskování pozornosti mezi dokumenty, který udržuje hranice mezi dokumenty i v rámci svého obrovského kontextového okna.

Hardwarové nároky: Při Q4 potřebují váhy modelu asi 55 GB VRAM. Jedna H100 (80 GB) to zvládne s přehledem. Na spotřebitelském hardwaru to zvládnou dvě RTX 4090 (celkem 48 GB) pro kratší délky kontextu. Háček: skutečné využití plného 10M kontextového okna vyžaduje obrovskou paměť KV cache navíc k vahám modelu. V praxi se většina self-hostovaných nasazení zastavuje na 128K–256K tokenech.

Kdo by ho měl použít: Týmy pracující s obrovskými dokumenty, právní analýzou, dotazováním nad kódovými repozitáři, syntézou výzkumných prací. Multimodální schopnosti (text + obraz na vstupu) jsou rovněž silné. Jen buďte realistickí ohledně délky kontextu: 10M strop je reálný, ale k jeho dosažení budete potřebovat serverový hardware.

4. DeepSeek V3 -- nejlepší univerzální open-source LLM

Zatímco DeepSeek R1 sbírá titulky za uvažování, DeepSeek V3 je pravděpodobně praktičtějším modelem pro každodenní použití. Je to pracovní kůň — rychlý, schopný napříč obory a na svou velikost pozoruhodně efektivní.

V3 sdílí stejnou 671B MoE / 37B aktivní architekturu jako R1, ale vyměňuje hluboké řetězce úvah za rychlejší doby odezvy a širší obecné schopnosti. Aktualizace V3-0324 převzala techniky posilovaného učení z tréninku R1 a posílila uvažování bez latence navíc spojené s explicitním řetězcem úvah.

Výsledky v benchmarcích:

BenchmarkSkóre DeepSeek V3Kontext
MMLU87,1 %Obecné znalosti
HumanEval82,6 %Generování kódu
MATH90,2 %Matematické uvažování
Kontextové okno128KPodpora dlouhých dokumentů

DeepSeek V3 překonává GPT-4.5 v benchmarcích programování a matematiky. Jeho tréninková efektivita je legendární — jen 2,788 milionu H800 GPU hodin na celý běh předtrénování, zlomek toho, co vyžadují srovnatelné modely.

Hardwarové nároky: Shodné s R1 (~136 GB VRAM při Q4). Pro praktické nasazení běží GGUF kvantizované verze přes llama.cpp nebo Ollama na multi-GPU spotřebitelských sestavách.

Kdo by ho měl použít: Pokud potřebujete jeden model, který zvládne vše — chat, programování, analýzu, překlad, sumarizaci — V3 je nejvyváženější volbou. Na těžkém uvažování neporazí R1 ani Scouta na délce kontextu, ale překoná oba na typických produkčních zátěžích, kde na rychlosti a všestrannosti záleží více než na špičkových benchmarkových skóre.

5. Mistral Large 3 -- nejlepší pro vícejazyčnost a enterprise použití

Mistral Large 3 vrátil Mistral zpět na špici. S celkem 675B parametry (41B aktivních) jde o plný MoE model vydaný pod Apache 2.0 — obrovský posun oproti restriktivní výzkumné licenci Mistral Large 2.

Model byl trénován od nuly na 3 000 NVIDIA H200 GPU a je to znát. Na LMSYS Chatbot Arena se umístil jako 2. mezi otevřenými modely a 6. celkově (včetně proprietárních). Co ho dělá obzvlášť zajímavým pro evropské týmy, je jeho vícejazyčná síla — zhruba 85,5% přesnost na vyváženém vícejazyčném testu MMLU.

Výsledky v benchmarcích:

BenchmarkSkóre Mistral Large 3Kontext
Vícejazyčné MMLU85,5 %Znalosti napříč jazyky
LMSYS Arena6. celkověŽebříček lidských preferencí
AIME 2025 (14B varianta)85 %Matematické uvažování
Kontextové okno128KPodpora dlouhých dokumentů

Jedna vlastnost, která modely Mistral odlišuje: jsou trénovány říct „nevím", místo aby halucinovaly. Díky tomu je Mistral Large 3 skvělou volbou pro RAG pipeline a enterprise aplikace, kde na faktické přesnosti záleží více než na kreativním výstupu.

Hardwarové nároky: S celkem 675B parametry jsou nároky na VRAM podobné jako u DeepSeek (~140 GB při Q4). Mistral nabízí i 14B variantu Small 3, která se vejde na jednu spotřebitelskou GPU a v uvažování a programování výrazně převyšuje svou váhovou kategorii.

Kdo by ho měl použít: Evropské společnosti, které potřebují vícejazyčné schopnosti a datovou suverenitu. Enterprise týmy stavící RAG systémy, kde je kritické omezení halucinací. Licence Apache 2.0 zcela odstraňuje komerční třecí plochy.

6. Gemma 3 27B, nejlepší pro nasazení na jedné GPU

Gemma 3 27B od Googlu je sladkým bodem mezi schopnostmi a dostupností. S 27 miliardami parametrů v dense architektuře běží na jedné RTX 4090 s Q4 kvantizací. Žádné multi-GPU sestavy, žádný serverový hardware — jen běžná herní karta.

Nenechte se zmást skromným počtem parametrů. Gemma 3 27B výrazně převyšuje svou váhovou kategorii, zejména v multimodálních úlohách. Zvládá text i obraz na vstupu, podporuje více než 140 jazyků a její 130K kontextové okno je na model této velikosti štědré.

Výsledky v benchmarcích:

BenchmarkSkóre Gemma 3 27BKontext
MMLU78,6 %Obecné znalosti
DocVQA85,6 %Porozumění dokumentům
MGSM74,3 %Vícejazyčná matematika
ChartQA76,3 %Vizuální uvažování

Tyto multimodální výsledky (DocVQA 85,6 %, ChartQA 76,3 %) konkurují modelům 3–5× větším. Pro vývojáře, kteří potřebují porozumění obrazu bez GPU clusteru, je Gemma 3 jasnou volbou.

Hardwarové nároky: Asi 16 GB VRAM při Q4 kvantizaci, 32 GB při Q8. Jedna RTX 4090 (24 GB) to zvládne s přehledem. Zvládne to i M2 MacBook Pro se 32 GB jednotné paměti. Pokud postupujete podle našeho průvodce lokálním během LLM, Gemma 3 je jedním z nejsnadnějších modelů pro začátek.

Kdo by ho měl použít: Sóloví vývojáři, malé týmy a kdokoli, kdo chce schopný multimodální model bez pronájmu cloudových GPU. Je také skvělá pro prototypování — otestujte svou pipeline lokálně na Gemma 3 a v produkci v případě potřeby přejděte na větší model. Pro novější malý model od Googlu viz náš průvodce Gemma 4 12B.

7. Phi-4 Reasoning, nejlepší pro edge a nasazení s omezenými zdroji

Phi-4 Reasoning od Microsoftu dokazuje, že počet parametrů není vše. S pouhými 14 miliardami parametrů překonává 70B destil DeepSeek R1 v několika benchmarcích uvažování. Nedávno vydaný Phi-4-reasoning-vision-15B přidává multimodální schopnosti a v úlohách matematicko-vizuálního uvažování boduje o 17 % výše než Gemma 3 12B.

Tajemstvím rodiny Phi-4 je kvalita tréninkových dat. Přístup Microsoftu upřednostňuje kurátovaná, vysoce kvalitní data před surovým měřítkem — a funguje to. Phi-4 dosahuje přes 80 % v benchmarcích MATH a MGSM a v matematickém uvažování překonává Gemini Pro od Googlu i GPT-4o-mini.

Výsledky v benchmarcích:

BenchmarkSkóre Phi-4Kontext
MATH82,6 %Matematické uvažování
HumanEval82,6 %Generování kódu
MGSM80 %+Vícejazyčná matematika
MathVista (vize)+17 % oproti Gemma 12BVizuální matematika

Hardwarové nároky: Kolem 8 GB VRAM při Q4 — to je GPU notebooku nebo i starší desktopová karta. Model pohodlně běží na MacBookech s Apple Silicon, takže je opravdu přenosný. Pro edge nasazení je jedním z mála modelů, které dokážou běžet na zařízení s rozumnou latencí.

Kdo by ho měl použít: Vývojáři mobilních a edge aplikací, týmy stavící AI funkce na zařízení a kdokoli, kdo potřebuje silné uvažování na minimálním hardwaru. Phi-4 je také skvělou volbou pro vyhodnocování doladěných modelů, protože jeho malá velikost dělá tréninkové iterace rychlými a levnými. Licence MIT znamená žádné komerční restrikce.

8. GLM-4.7 -- nejlepší pro agentické programování

GLM-4.7 od Z.ai je účelově postaven pro konkrétní případ užití: agentické programovací workflow, kde model potřebuje uvažovat, používat nástroje a udržovat kontext napříč dlouhými vícekrokovými interakcemi.

Jeho architektura je 355B MoE s 32B aktivními parametry, ale vynikající funkcí je jeho tříúrovňový systém uvažování. Na rozdíl od většiny modelů, které každé kolo restartují svůj proces uvažování, si GLM-4.7 uchovává bloky uvažování napříč celou konverzací. Tento perzistentní kontext uvažování dělá reálný rozdíl, když model orchestrací složité vícekrokové programovací úlohy.

Výsledky v benchmarcích:

BenchmarkSkóre GLM-4.7Kontext
SWE-bench73,8 %Reálné softwarové inženýrství
HumanEval94,2 %Generování kódu
Kontextové okno200KDlouhé interakce
Max. výstup131K tokenůRozšířená generace

Toto skóre 73,8 % na SWE-bench je konkurenceschopné Claude Sonnet 4.5 — na reálných úlohách softwarového inženýrství, ne na syntetických benchmarcích. A 94,2 % na HumanEval je nejvyšší ze všech modelů na tomto seznamu.

Hardwarové nároky: Podobné jako u ostatních velkých MoE modelů (~130 GB VRAM při Q4). Kontextové okno 200K a max. výstup 131K z něj během dlouhých agentických relací dělají žrouta paměti.

Kdo by ho měl použít: Týmy vývoje s asistencí AI, které staví programovací agenty, automatizované ladicí nástroje nebo systémy pro code review. Pokud vybíráte nástroje pro doladění pro model zaměřený na programování, GLM-4.7 je silným základem. Licence MIT znamená plné komerční využití.

Nejlepší open-source LLM pro programování (červenec 2026)

Pro programování v červenci 2026 je GLM-4.7 špičkovou open-source volbou se skóre 94,2 % na HumanEval a 73,8 % na SWE-bench — konkurenceschopný Claude Sonnet 4.5 na reálných softwarových úlohách. Chcete silný programovací model na spotřebitelském hardwaru? 32B destil DeepSeek R1 běží na jedné RTX 4090.

Zvažujete novější vydání GLM? Podívejte se na náš rozbor GLM 5.2, jak si stojí v porovnání.

Jak si vybrat: Rozhodovací rámec

„Nejlepší" model závisí zcela na vašich omezeních. Použijte tuto matici k zúžení rozhodnutí.

Pokud potřebujete...ZvolteProč
Nejlepší celkové uvažováníQwen 3 235BŠpičkové benchmarky matematiky, kódu i obecné
Hluboký řetězec úvahDeepSeek R1Sebeopravující uvažování, 87,5 % AIME
Obrovské kontextové oknoLlama 4 Scout10M tokenů, dokonalé vyhledání
Rychlý univerzálníDeepSeek V3Nejlepší poměr rychlosti a kvality
Vícejazyčný enterpriseMistral Large 385,5 % vícejazyčné MMLU, proti halucinacím
Jednu spotřebitelskou GPUGemma 3 27B16 GB VRAM, silná multimodalita
Notebook nebo edge zařízeníPhi-4 14B8 GB VRAM, licence MIT
Programovací agentyGLM-4.794,2 % HumanEval, perzistentní uvažování

Stále si nejste jisti? Začněte zde: Máte multi-GPU hardware? Pokud ne, vaše volby jsou Gemma 3 a Phi-4. Pokud ano, stavíte programovacího agenta? Vyberte GLM-4.7 nebo DeepSeek R1. Potřebujete dlouhý kontext? Llama 4 Scout. Vše ostatní? Qwen 3 235B je nejbezpečnější výchozí volbou.

Jak jsme tyto modely seřadili

Pořadí nezaložené na jediném benchmarku. Každý model byl hodnocen napříč pěti dimenzemi:

  1. Benchmarkový výkon — MMLU, HumanEval, AIME, SWE-bench a doménově specifické testy
  2. Hardwarová dostupnost — Dokážou ho reálné týmy skutečně nasadit?
  3. Licenční volnost — Apache 2.0 a MIT bodují výše než restriktivní licence
  4. Vyspělost ekosystému — Dostupnost na Hugging Face, Ollama, vLLM a hlavních inferenčních enginech
  5. Reálná adopce — Aktivní komunita, produkční nasazení, průběžné aktualizace

Modely, které si vedou dobře v benchmarcích, ale vyžadují GPU cluster, který nikdo nemá (díváme se na tebe, 671B v plné přesnosti), jsou penalizovány. Modely s restriktivními licencemi, které blokují komerční použití, také ztrácejí body. Cílem je praktická hodnota, ne chlubení se na žebříčku.

Pokud si chcete tyto modely otestovat sami, náš průvodce vyhodnocováním LLM vás provede nastavením systematických benchmarků a přehled nejlepších vyhodnocovacích nástrojů pokrývá frameworky, které budete potřebovat.

FAQ

Jaké jsou nejnovější open-source LLM v roce 2026?

Špici roku 2026 vedou Qwen 3 (Alibaba), DeepSeek R1 a V3, Llama 4 Scout (Meta), Mistral Large 3 a GLM-4.7 (Z.ai). Dílčí vydání jako DeepSeek R1-0528 a varianta Phi-4 reasoning-vision dorazila do poloviny roku 2026. Tento seznam měsíčně kontrolujeme a žebříček aktualizujeme vždy, když nové vydání změní pořadí.

Jak často se tento žebříček open-source LLM aktualizuje?

Měsíčně. Na začátku každého měsíce znovu ověřujeme benchmarková skóre, nároky na VRAM a licence a přidáváme nové modely, jakmile vyjdou. Datum „Naposledy aktualizováno" pod názvem odráží nejnovější kontrolu.

Jaká je nejlepší open-source LLM v roce 2026?

Qwen 3 235B-A22B aktuálně vede na nejširším záběru benchmarků a kombinuje špičkové uvažování, programování a vícejazyčné schopnosti pod licencí Apache 2.0. Pro konkrétní případy užití mohou být lepší volbou DeepSeek R1 (uvažování) a Llama 4 Scout (dlouhý kontext).

Mohu spouštět open-source LLM na spotřebitelském hardwaru?

Ano. Gemma 3 27B běží na jedné RTX 4090 (24 GB VRAM) a Phi-4 14B se vejde na GPU notebooku s 8 GB. Kvantizované verze (Q4, Q8) větších modelů fungují i na multi-GPU spotřebitelských sestavách pomocí nástrojů jako Ollama a llama.cpp.

Jsou open-source LLM stejně dobré jako ChatGPT nebo Claude?

V benchmarcích programování a matematiky se nejlepší open-source modely vyrovnají nebo překonají GPT-4.5 a blíží se výkonu Claude Sonnet 4.5. Rozdíl je nejmenší u strukturovaných úloh (kód, matematika, uvažování) a největší u kreativního psaní a nuancovaného plnění instrukcí.

Co znamená MoE (Mixture-of-Experts) pro hardware?

MoE modely mají velký celkový počet parametrů, ale na token aktivují jen jejich část. Celý model se však musí načíst do paměti, aby router mohl vybírat experty. 235B MoE model s 22B aktivními stále potřebuje VRAM odpovídající 235B — neušetříte paměť, ušetříte výpočty.

Která open-source LLM je nejlepší pro programování?

GLM-4.7 vede s 94,2 % na HumanEval a 73,8 % na SWE-bench. Pro čisté generování kódu jsou těsně za ním DeepSeek R1 a Qwen 3 235B. Pro programování na spotřebitelském hardwaru je 32B destil DeepSeek R1 nejlepším poměrem schopností a nákladů.

Má Llama 4 Scout opravdu 10 milionů tokenů kontextu?

Architektura to podporuje a Meta předvedla dokonalé vyhledání Needle-in-a-Haystack při 10M tokenech. Ale skutečné využití plného kontextu vyžaduje obrovskou paměť KV cache. Většina self-hostovaných nasazení reálně končí na 128K–256K tokenech. Cloudoví poskytovatelé jako Together AI a Fireworks nabízejí delší kontextová okna.

Jakou licenci bych měl u open-source LLM hledat?

Apache 2.0 a MIT jsou nejpropustnější — plné komerční využití, úpravy a redistribuce. Vlastní licence Llama umožňuje komerční použití, ale má restrikce pro aplikace s více než 700M uživateli. Některé „open-weight" modely (jako Gemma) mají specifické podmínky — před produkčním nasazením si vždy přečtěte licenci.

Kolik VRAM potřebuji pro 70B model?

Při Q4 kvantizaci potřebuje 70B dense model zhruba 35–40 GB VRAM. Jedna A100 (80 GB) to zvládne snadno, případně dvě RTX 4090 (celkem 48 GB). V plné přesnosti (BF16) počítejte se 140+ GB, což prakticky vyžaduje čtyři A100 nebo ekvivalent.

Mohu open-source LLM doladit pro svůj případ užití?

Rozhodně. QLoRA umožňuje doladit 70B model na jedné 24GB GPU. Menší modely jako Phi-4 a Gemma 3 jsou pro experimenty s doladěním ještě dostupnější. Modely s licencí Apache 2.0 a MIT nemají žádná omezení na odvozená díla.

Co open-source multimodální LLM?

Gemma 3 27B i Llama 4 Scout zvládají text i obraz na vstupu nativně. Phi-4-reasoning-vision-15B přidává vizuální uvažování v menším měřítku. Pro porozumění videu podporuje Llama 4 Scout v rámci svého kontextového okna až 20 hodin video vstupu.

Jaká je nejlepší open-source LLM právě teď?

Právě teď je Qwen 3 235B-A22B nejlepší open-source LLM celkově a vede v uvažování a programování pod licencí Apache 2.0. Pro jednu spotřebitelskou GPU je špičkovou volbou Gemma 3 27B (16 GB VRAM) a pro programovací agenty vítězí GLM-4.7 s 94,2 % na HumanEval.

Existuje žebříček open-source LLM?

Ano. Náš žebříček z července 2026 výše řadí všech osm modelů v tomto průvodci a Hugging Face hostuje komunitně spravovaný Open LLM Leaderboard pro širší pokrytí. Naše pořadí měsíčně znovu ověřujeme proti benchmarkům jako MMLU, HumanEval, AIME a SWE-bench.

Vybrat nástroj je ta snadnější polovina. Rozběhnout ho spolehlivě uvnitř reálného produktu je místo, kde většina týmů uvázne — a přesně to náš tým AI integrací pro klienty staví, od RAG pipeline po vlastní agenty. Chcete druhý názor na svůj stack? Získejte bezplatnou konzultaci.

Zdroje

  • Technická zpráva Qwen 3 - arXiv
  • Oficiální stránka Meta Llama 4
  • DeepSeek R1 - Hugging Face
  • Gemma 3 - Google DeepMind
  • Technická zpráva Phi-4 Reasoning - Microsoft Research
  • Oznámení Mistral Large 3
  • GLM-4.7 - Hugging Face
  • Open LLM Leaderboard - Hugging Face

Štítky

nejlepší open source llm 2026open source llmllama 4qwen 3deepseekgemma 3phi-4self-host llmlokální llm

Sdílet článek

Související články

Více z kategorie ai-machine-learning

ai-machine-learning
Jul 20, 2026

8 nejlepších API pro AI web scraping v roce 2026 (otestováno na našem vlastním agentním stacku)

Otestovali jsme 8 API pro AI web scraping s reálnými cenami pro rok 2026 staženými přes náš vlastní agentní stack. Firecrawl, Bright Data, ScrapingBee a 5 dalších, seřazené podle výstupu připraveného pro LLM, anti-bot a podpory MCP.

9 min read minut čtení
Číst
ai-machine-learning
Jul 20, 2026

Prompt Engineering pro kódování: 7 vzorů, které denně používáme v Claude Code a Cursor (2026)

Většina článků o „promptech pro AI kódování“ vám nabídne 50 šablon ke kopírování. Tento článek učí 7 vzorů, které každý den používáme k provozu pipeline s 16 agenty v Claude Code, včetně skutečných příkladů před a po úpravě pro každý z nich, a ukazuje, kde se každý vzor nachází v nástrojích Claude Code, Cursor a Copilot v roce 2026.

11 min read minut čtení
Číst
ai-machine-learning
Jul 19, 2026

AI PoC do produkce: 12bodový kontrolní seznam před nasazením

Funkční AI demo není produkční systém. Tento 12bodový kontrolní seznam prochází tři fáze, které každá AI funkce před spuštěním potřebuje: zpevnit, stabilizovat a nasadit – s konkrétními prahy pro cenové stropy, omezení rychlosti, záložní řešení a spouštěče rollbacku.

10 min read minut čtení
Číst
Zobrazit všechny články
Začněte svůj projekt

Pojďme něco postavit nevšedního?

Proměňme vaši vizi ve skutečnost. Náš tým je připraven vám pomoct vytvořit software, který dělá rozdíl.

Rezervovat 30minutový úvodní hovorNaše projekty

Než z knihovny

Claude dovednosti

Zobrazit vše
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI automatizace

Zobrazit vše
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Než z knihovny

Claude dovednosti

Zobrazit vše
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI automatizace

Zobrazit vše
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Služby

  • Podniková řešení
  • Mobilní aplikace
  • Webové aplikace

Řešení

  • CRM systémy
  • Integrace AI
  • ERP systémy
  • Hlasoví agenti
  • Automatizace procesů
  • Kybernetická bezpečnost

Knihovna

  • Blog
  • Reference

Komunita

  • AI automatizace
  • Claude dovednosti

Nástroje

  • Kalkulátor ceny mobilní aplikace
  • Kalkulátor ceny OpenAI / LLM API
  • Kalkulátor ceny MVP
  • Kalkulátor ceny hlasového AI agenta

Společnost

  • O projektu
  • Partneři
  • Kontakt

Právní informace

  • Zásady ochrany osobních údajů
  • Podmínky poskytování služeb
  • Zásady používání cookies

Služby

  • Podniková řešení
  • Mobilní aplikace
  • Webové aplikace

Řešení

  • CRM systémy
  • Integrace AI
  • ERP systémy
  • Hlasoví agenti
  • Automatizace procesů
  • Kybernetická bezpečnost

Knihovna

  • Blog
  • Reference

Komunita

  • AI automatizace
  • Claude dovednosti

Nástroje

  • Kalkulátor ceny mobilní aplikace
  • Kalkulátor ceny OpenAI / LLM API
  • Kalkulátor ceny MVP
  • Kalkulátor ceny hlasového AI agenta

Společnost

  • O projektu
  • Partneři
  • Kontakt
Právní informaceZásady ochrany osobních údajůPodmínky poskytování služebZásady používání cookies
TECHSY
© 2026 Techsy. Všechna práva vyhrazena.