Techsy
Kontakt
Začít
Zpět na blog
ai-machine-learning

Qwen3.8-Max je tu: 2.4T parametrů, kontext 1M tokenů a váhy pořád nejsou venku

Napsal Mert Batur
Aktualizováno Aug 4, 2026
16 minut čtení
Obsah
Qwen3.8-Max je tu: 2.4T parametrů, kontext 1M tokenů a váhy pořád nejsou venku

Qwen3.8-Max je tu: 2.4T parametrů, kontext 1M tokenů a váhy pořád nejsou venku

$1.4728. Tolik nás 2026-08-04, den po vydání od Alibaby, stálo 40 živých API volání napříč modelem Qwen3.8-Max a jeho dvěma předchůdci. Překvapením nebylo 2.4 bilionu parametrů. Bylo to tohle: 3.8-Max účtuje o 35.6% více za token než Qwen3.7-Max, a přesto vyšel zhruba 4x levněji na odpověď, protože přestal tolik „přemýšlet". Ještě jedna věc, kterou většina zpráv o uvedení modelu píše špatně. Není open source. Zatím ne.

Tento článek byl poprvé publikován 2026-07-19, kdy byl Qwen3.8 pouze v předběžné verzi bez zveřejněných specifikací. Byl přepsán 2026-08-04 podle ostrého vydání (GA) a našeho vlastního testování API.

Klíčové poznatky

  • K 2026-08-04 je Qwen3.8-Max dostupný pouze přes API. Alibaba slíbila váhy „příští týden", tedy v týdnu od 2026-08-10, na Hugging Face a ModelScope.
  • Naměřili jsme $0.001592 za krátké volání oproti $0.006428 u Qwen3.7-Max, a to i přes vyšší cenu za token.
  • Pět Alibaby vlastních benchmarkových skóre pochází od výrobce. K 2026-08-04 jsme nenašli žádné nezávisle publikované hodnocení.
  • Vstup obrázků a videa je skutečný a nový. Ověřili jsme oboje přímo přes API a porovnali s odmítnutím ze strany 3.7-Max.

Co se změnilo mezi předběžnou verzí a ostrým vydáním

Qwen3.8-Max byl ostře vydán (GA) 2026-08-03, a toto vydání zodpovědělo všechny otevřené otázky, které tato stránka uváděla před dvěma týdny. Éra předběžné verze nám dala počet parametrů a slib. Ostré vydání přidalo potvrzené kontextové okno 1M tokenů, vstup formou textu, obrázku a videa, pět publikovaných benchmarkových skóre a cenu za token.

Zde je starý seznam neznámých, nyní vyřešených:

Co tato stránka uváděla 2026-07-19Stav k 2026-08-04
Jakékoli publikované benchmarkové skóre: žádnéPublikováno pět skóre reportovaných Alibabou
Aktivní parametry / konfigurace MoE: nezveřejněnoŠiroce reportováno jako ~95B aktivních, řídké MoE. Reportování se rozchází, viz níže
Kontextové okno a maximální výstup: neoznámeno1M na vstupu, 131,072 na výstupu, potvrzeno živým API
Modalita: neoznámenotext + obrázek + video na vstupu, text na výstupu. Ověřili jsme si to sami
Cena za token: nerozepsáno$2.00 / M vstup, $6.00 / M výstup
Datum vydání otevřených vah: „brzy", bez data„Příští týden", jmenovitě Hugging Face a ModelScope
Qwen3.8-Max-Preview je nyní dostupnýPředběžná verze skončila. Ostré vydání je venku

Jedna věc se nevyřešila. Rozdělení parametrů je stále sporné. Článek MarkTechPost o vydání jasně uvádí, že Alibaba počet aktivních parametrů nezveřejnila, zatímco SiliconANGLE, The Decoder a Coursiv shodně uvádějí ~95 miliard aktivních. Článek MarkTechPost jsme si znovu přečetli 2026-08-04 a stále uvádí „nezveřejněno". Něčí zdroje jsou špatně a poctivé je říct, že reportování k tomuto konkrétnímu číslu se v den vydání rozcházelo.

Nemohli jsme to ověřit ani jedním směrem. Odpověď OpenRouter /models vůbec neobsahuje pole s počtem parametrů, takže nic v našem testování nepotvrzuje ani nevyvrací 2.4T celkových nebo 95B aktivních.

Je Qwen3.8-Max open source? Ne 4. srpna

Ne. K 2026-08-04 je Qwen3.8-Max dostupný pouze přes API. Alibaba naplánovala vydání vah na „příští týden" na Hugging Face a ModelScope a nezveřejnila žádnou licenci. Zpravodajství neustále slučuje slova „dostupné" a „otevřené" do jednoho, a právě v tom rozdílu je celý příběh. Dnes nejsou žádné váhy ke stažení, ať titulky tvrdí cokoli.

Tři různé stavy se slučují do jednoho slova. Nejsou to ale ta samá věc:

StavQwen3.8-Max k 2026-08-04
Dostupné přes APIAno. Alibaba Cloud Model Studio, plus prodejci a routery
Váhy ke staženíNe. Slíbeno „příští týden", bez konkrétního data
Licenční podmínkyNezveřejněno. Žádný text k přečtení neexistuje

Neopírali jsme se o ničí slovo a ověřili jsme nejtvrdší dostupný důkaz: vyhledávání Qwen3.8 na Hugging Face k 2026-08-04 nevrací žádnou model kartu od Alibaby. Vrací ale čtyři komunitní nahrávky s názvem Qwen3.8_4B_Distilled a jejich varianty — jde o destiláty třetích stran, ne o vlajkovou loď. Pokud tuto stránku jen zběžně proletíte, snadno je zaměníte za skutečné vydání.

Ještě poznámka k licenci, protože precedens se pořád vydává za závazek. Qwen 3.5 i Qwen 3.6 byly vydány pod licencí Apache 2.0. Restriktivní komunitní licence u modelu s 2.4T parametry by technicky pořád byla „otevřenými vahami", zároveň by ale měnila, co s nimi smíte stavět. Dokud neexistuje text licence, kdokoli vám říká, co s těmito vahami můžete dělat, jen hádá. I proto Qwen3.8-Max není v našem přehledu open-source LLM, které stojí za spuštění v roce 2026: zatím se nekvalifikuje.

Co jsme naměřili: 4x levněji za volání i přes zdražení o 35.6%

Provedli jsme 40 zpoplatněných volání proti qwen3.8-max, qwen3.7-max a qwen3-max přes OpenRouter, 2026-08-04, celkem za $1.4728. Každou cenu níže jsme spočítali z vráceného objektu usage a porovnali s vlastní fakturovanou částkou OpenRouter. Všechny se shodovaly. Hlavní zjištění jde přesně proti změně ceny.

Začněme cenou. Živé ceny z GET /models k 2026-08-04 udávají u 3.8-Max $2.00 vstup / $6.00 výstup za milion tokenů, oproti 3.7-Max s $1.475 / $4.425. To je nárůst o 35.6% na obou stranách, a poměr je v obou případech stejný (2.000/1.475 = 6.000/4.425 = 1.3559). Aktuální čísla si můžete ověřit na stránce modelu OpenRouter.

Teď stejný triviální prompt poslaný všem třem modelům, po třech bězích, temperature: 0, streamovaně:

ModelPrvní token (3 běhy)První viditelný obsahCelkový čas (3 běhy)Tokeny odpovědiz toho reasoningMedián ceny/volání
qwen3.8-max2.249s / 0.874s / 1.054s5.414s / 5.058s / 4.209s6.338s / 6.734s / 5.130s242 / 287 / 243156 / 194 / 157$0.001592
qwen3.7-max4.871s / 1.157s / 1.670snikdy / 22.358s / 25.998s31.147s / 24.013s / 27.661s1502 / 1281 / 14431500 / 1174 / 1346$0.006428
qwen3-max2.617s / 2.892s / 2.386s2.617s / 2.892s / 2.386s4.401s / 4.601s / 4.081s105 / 105 / 1070 / 0 / 0$0.000431

Dva oddělené sloupce pro první token jsou nutné, protože oba reasoning modely streamují skrytý reasoning ještě před samotným textem odpovědi. U 3.8-Max dorazí token pod jednu sekundu ve dvou ze tří běhů, ale první slovo, které si uživatel skutečně přečte, přistane až o čtyři až pět sekund později. U 3.7-Max se v běhu 1 nedostavilo vůbec. Pokud stavíte streamovací UI nad reasoning modelem, spinner se točí ještě dlouho poté, co je spojení prokazatelně živé.

Sloupec reasoning si přečtěte dvakrát. U promptu žádajícího třívětové vysvětlení Bloomova filtru spotřeboval 3.7-Max mezi 1,174 a 1,500 reasoning tokeny. 3.8-Max spotřeboval 156 až 194. To je zhruba 7x méně přemýšlení za stejnou odpověď, a reasoning tokeny se účtují sazbou za výstup. Výsledek: 3.8-Max vychází přibližně 4x levněji na volání a je 4 až 5x rychlejší v reálném čase z našeho stroje, včetně síťové odezvy, přestože stojí o 35.6% více za token. Cenovka šla nahoru a účet šel dolů.

To se otočí s rostoucí délkou promptu. Podle modelace z živých cen, ne z měření, stojí volání s 30,000 vstupními tokeny a 500 výstupními $63.00 za tisíc volání u 3.8-Max oproti $46.46 u 3.7-Max. Při 100,000 vstupních tokenech je to $203.00 oproti $149.71. Jakmile většinu vašich tokenů tvoří vstup, výhoda efektivnějšího reasoningu přestává vyvažovat zdražení a 3.8-Max se stává nejdražším ze všech tří. Který model je nejlevnější, opravdu závisí na poměru vstupu k výstupu — ke stejnému závěru dochází i naše srovnání cen API pro LLM.

reasoning_effort je novinka a 3.7-Max ho tiše ignoruje

reasoning_effort se objevuje mezi podporovanými parametry 3.8-Max, ale ne u 3.7-Max. U 3.8-Max hýbe jehlou jen mírně: napříč třemi běhy vygenerovalo minimal 67, 108 a 124 reasoning tokenů oproti high s 163, 136 a 173. Medián 108 proti 163, u stejného promptu, při teplotě 0.

Zjištění, které vás může stát peníze, se týká staršího modelu. Odeslání reasoning_effort: "low" na 3.7-Max je přijato, nikoli odmítnuto, a pak ignorováno: dané volání přesto spálilo 1,401 reasoning tokenů a naúčtovalo stejných $0.006689 jako shodně tvarované volání, které jsme zaznamenali. Žádná chyba, žádné varování, žádný efekt. Pokud ladíte náklady snižováním reasoning effort, ověřte, že to na modelu, který skutečně voláte, něco dělá — nepodporovaný parametr tu totiž selhává potichu, ne nahlas.

Past prázdné odpovědi, kterou byste měli prověřit před migrací

Náš první testovací běh použil max_tokens: 400 a spadl nám vlastní skript. Důvod se ukázal být cennější než samotný test. Qwen3.7-Max dokáže utratit celý rozpočet tokenů na reasoning a vrátit prázdný řetězec, s finish_reason: "length", naúčtovaný v plné výši.

Narazili jsme na to třikrát. Při max_tokens: 400: 402 tokenů odpovědi, z toho 400 reasoning, nula znaků odpovědi, naúčtováno $0.001822. Při max_tokens: 1500: 1,502 tokenů, 1,500 reasoning, nula znaků, $0.006689 za nic. A ještě jednou u pozdějšího volání, $0.006735. Žádná chyba, žádná výjimka, jen navenek plynulý objekt odpovědi s prázdným řetězcem obsahu.

Pokud migrujete stávající integraci s 3.7-Max a váš kód nastavuje skromný max_tokens, počítejte s časem na otestování této cesty. Výrazně kratší reasoning u 3.8-Max ho vůči tomu dělá znatelně méně zranitelným. Není ale imunní.

Malá režie tokenů, o které nikdo nemluví

Identický prompt o 12 slovech napočítal 67 promptových tokenů u 3.8-Max a 29 u 3.7-Max, konzistentně napříč všemi běhy (27 u qwen3-max). To je zhruba 38 tokenů pevné režie, pravděpodobně kvůli většímu systémovému nebo chat šablonovému promptu. U 100,000tokenového RAG volání se to zaokrouhlí na nulu. U vysoko-objemového klasifikátoru odpalujícího krátké prompty vám to víc než zdvojnásobí účet za vstup ještě předtím, než napíšete jediné slovo.

Přijímá Qwen3.8-Max opravdu obrázky a video?

Ano, a multimodální vstup je v této generaci opravdu nový, ne jen přeznačený. API u 3.8-Max hlásí text+image+video->text, u 3.7-Max jen text. Rozdíl jsme ověřili odesláním stejného obrázku oběma modelům — starší model ho odmítl už na úrovni routingu.

Testovací obrázek jsme si vygenerovali lokálně vlastnoručně napsaným PNG enkodérem, takže jsme ground truth znali už z konstrukce: 750x270 pixelů, černé blokové číslice 4739 na bílém pozadí, s červeným vodorovným pruhem nahoře. Odesláno jako base64, qwen3.8-max vrátil DIGITS: 4739 a TOPBAR: red. Správně v obou bodech, 6.99s, $0.002146. Identický požadavek na qwen3.7-max se vrátil jako HTTP 404 {"error":{"message":"No endpoints found that support image input"}}.

Video funguje také, s výhradou, kterou jsme málem nahlásili jako chybu. Dvě ze tří veřejných MP4 URL, které jsme zkusili, vrátily HTTP 400 "Failed to download multimodal content". To je selhání Alibaby při stažení souboru, ne odmítnutí videa na úrovni routy. S URL, kterou dokázala stáhnout, popsal 3.8-Max klip Big Buck Bunny přesně, včetně jména postavy, za 24.24s a $0.006528.

Dvě praktické poznámky, než na tom začnete stavět. Video se naúčtovalo jako 696 běžných promptových tokenů za zhruba 10sekundový klip a usage.prompt_tokens_details.video_tokens hlásilo 0, takže z tohoto pole náklady na video nevydělíte. A chybně sestavená část obsahu selže potichu: odeslání {"type": "video", "video": [url]} místo video_url vrátilo HTTP 200, přičemž model zdvořile oznámil, že žádné video nevidí — a přesto vám to naúčtoval. Používejte video_url.

Stojí za zmínku: když jsme 3.8-Max požádali, aby popsal své vlastní schopnosti, odpověděl Input modalities: text. To je špatně, jak dokázal hned další test v našem vlastním běhu. Sebepopis modelu je výstup jazykového modelu, ne technický list.

Jak dobře obstojí kontextové okno 1M tokenů?

Zasadili jsme tři unikátní fakta v hloubce 10%, 50% a 90% do vygenerovaného výplňového textu a v jednom volání jsme žádali všechna tři. 18 z 18 „jehel" se vrátilo správně napříč šesti běhy na dvou modelech, u velikostí promptu od 5,723 po 247,911 tokenů, hodnoceno přesnou shodou podřetězce v kódu, ne ručním čtením odpovědí.

Naše běhy qwen3.8-max (dva běhy qwen3.7-max při 83,380 a 247,873 tokenech a jeden běh qwen3-max při 78,255 také vrátily každou jehlu):

Promptové tokeny (qwen3.8-max)LatenceCenaNalezené jehly
5,7239.24s$0.014093 ze 3
25,70313.43s$0.054533 ze 3
83,41817.63s$0.169653 ze 3
247,91138.54s$0.498283 ze 3

Latence roste sublineárně, a to je ta prakticky užitečná část: 43x více vstupních tokenů stojí jen 4.2x více reálného času.

Teď k poctivým limitům, protože tohle je snadný konec spektra hodnocení dlouhého kontextu. Doslovné vytažení zasazeného faktu vypovídá jen málo o reasoningu napříč velkým dokumentem, a každou velikost jsme testovali jen jednou. Neprovedli jsme volání s 1M tokeny. Při $2.00 za milion vstupních tokenů by jedno takové volání stálo zhruba $2.00, víc než celý tento testovací běh, a jediný vzorek by nám stejně moc neřekl. Uváděný strop 1M je tedy z naší strany neověřený. A 3.7-Max se u obou porovnávaných velikostí shodoval s 3.8-Max přesně, takže vyhledávání v dlouhém kontextu není tam, kde se tato generace odlišuje.

Vyplavila se tu jedna cenová past, kterou zpravodajství o vydání úplně přehlíží. qwen3-max má vrstvené cenové přepisy, které zdvojnásobí sazbu nad 32,000 promptových tokenů a znovu ji zvednou nad 128,000, zatímco 3.8-Max a 3.7-Max mají paušální sazbu na jakoukoli délku. Vrstvu jsme potvrdili ze skutečné fakturace: naše 78,255tokenové volání na qwen3-max bylo naúčtováno $0.12227, sazbou $1.56/M, ne inzerovanou $0.78/M. Při této délce to stojí téměř přesně tolik co 3.7-Max ($0.12523). Jeho inzerovaná cena je méně než poloviční. Jeho reálná cena při 80k tokenech je od toho vzdálená jen o zaokrouhlovací chybu.

Pět benchmarkových skóre Alibaby a proč žádné z nich není ověřené

Alibaba s ostrým vydáním publikovala pět benchmarkových skóre. Každé z nich pochází z vlastních interních běhů Alibaby a k 2026-08-04 jsme nenašli žádné nezávisle publikované hodnocení. Tahle věta si zaslouží stát hned vedle čísel, ne o tři odstavce níž.

BenchmarkSkóre reportované AlibabouOvěřeno třetí stranou?
Terminal-Bench 2.186.6Ne, k 2026-08-04
GPQA Diamond92.6Ne, k 2026-08-04
PaperBench93.0Ne, k 2026-08-04
OSWorld-Verified86.1Ne, k 2026-08-04
DeepSWE 1.156.6 (předchůdce: 21.6)Ne, k 2026-08-04

Alibaba také reportovala interní agregát 0.725, nárůst z 0.474, a pozicovala model jako srovnatelný nebo lepší než Claude Opus 4.8, Fable 5 a GPT-5.6 Sol. Kolovala i umístění v arénách: 5. místo v Text Arena a 2. místo ve Vision Arena podle vlastního oznámení Alibaby z 2026-08-03, které jsme na živém žebříčku znovu neověřili. Pořadí v arénách se mění denně. Jakékoli pořadí, které tento týden přečtete, berte jako snímek s datem na sobě.

Co dosud nikdo nezměřil, včetně nás: propustnost při souběžném zatížení, výkon v jiných jazycích než angličtině, hodnocení bezpečnosti a alignmentu a spolehlivost volání nástrojů. Naše vlastní čísla pokrývají latenci, cenu, modalitu a vyhledávání v dlouhém kontextu na jedné trase, a nic víc. Zpráva Bloombergu o vydání opakovala benchmarkové tvrzení bez nezávislého testování, a přesně tam se momentálně nachází v podstatě veškeré zpravodajství.

Pro čísla, která byla ověřena, je lepším zdrojem naše srovnání Qwen vs DeepSeek vs GLM, a Kimi K3 s přibližně 2.8T je velikostní rival, ke kterému se to všude porovnává.

Qwen3.8 vs Qwen3-8B a obrat v otevřenosti vah za tímto vydáním

Qwen3.8 je vlajková loď Alibaby s 2.4 bilionu parametrů. Qwen3-8B je hustý model s 8 miliardami parametrů z řady Qwen3, ke stažení už od roku 2025. Podobně vypadající jména, ale rozdíl ve velikosti zhruba 300x. Vyhledávače je pořád pletou dohromady a stejně tak překvapivé množství odpovědí na fórech.

Problém s pojmenováním se tento týden zhoršil, ne zlepšil. Jediné, co na Hugging Face v tuto chvíli nese jméno „Qwen3.8", jsou komunitní 4B destiláty. Pokud budete hledat váhy a stáhnete si jeden z nich, stahujete něco, co s modelem o 2.4T nemá nic společného.

Dvě uzavřené vlajkové lodě a pak tohle

Skutečnou novinkou je tu slib otevřených vah, a ten vyznívá jinak, jakmile znáte historii celé rodiny. Alibaba dvě generace záměrně udržovala rozdělení: otevřené pracovní modely pro všechny, uzavřená vlajková loď nahoře.

GeneraceVáhyPoznámky
Qwen 3.5 (0.8B až 397B-A17B)Otevřené, Apache 2.0Celá rodina vydána veřejně
Qwen 3.6 (27B husté, 35B-A3B MoE)Otevřené, Apache 2.0Stejný vzorec se udržel
Qwen3.7-MaxUzavřenéPouze přes API. Žádné GGUF, žádný checkpoint na Hugging Face
Qwen3.8-MaxSlíbeno otevřené, zatím nedodáno„Příští týden" k 2026-08-03. Licence nezveřejněna

Alibaba držela vlajkovou úroveň uzavřenou dvě generace po sobě a teď tvrdí, že otevře největší model, jaký kdy postavila. Pokud váhy dorazí podle slibu, jde o skutečný obrat, a vyvíjí to tlak na každou laboratoř, která bere „nejvyšší úroveň zůstává uzavřená" jako hotovou věc. Pokud se to posune, stane se to třetím uzavřeným vydáním Max v řadě. Obě varianty jsou k 2026-08-04 stále otevřené. Stejnou dynamiku jsme viděli u GLM 5.2, kde na oznámení nezáleželo tolik jako na tom, s jakou licencí to nakonec vyšlo.

Můžete si Qwen3.8-Max spustit sami? (Stále ne)

Ne, a specifikace z ostrého vydání to jen potvrzují. Při 2.4 bilionu celkových parametrů to není model, který si nasadíte na vlastní hardware, ani až váhy vyjdou. DeepSeek-V3.2 s 685B už lidé, kteří to zkusili, popisují jako pořádný infrastrukturní projekt. Tohle je toho několikanásobek.

Co vám tedy otevřený model s 2.4T parametry vlastně přinese?

  • Poskytovatelé inference ho můžou hostovat, což znamená cenovou konkurenci, což znamená pokles vaší ceny za token
  • Suverénní, regulovaná a fyzicky izolovaná (air-gapped) nasazení se na této úrovni poprvé stávají možnými
  • Výzkumníci a lidé dolaďující modely dostávají základní model špičkové velikosti, ze kterého mohou vycházet
  • Neznamená to, že poběží na vašem stroji, na jediné A100, nebo v rámci GPU rozpočtu vašeho startupu

Pokud chcete přesnou aritmetiku toho, co provoz velkých otevřených modelů skutečně vyžaduje, náš průvodce nároky na VRAM u LLM to počítá pořádně. Krátká verze pro tento model: nedělejte to.

Přepnout, otestovat, nebo počkat?

Vaše situaceCo bychom udělali k 2026-08-04
Máte Qwen3.7-Max v produkciNejdřív otestujte 3.8-Max na provozu s krátkými prompty. Tam se projevil náš 4x rozdíl v ceně. Pak zkontrolujte, jak vaše zpracování max_tokens řeší případ prázdné odpovědi
Provoz s dlouhým kontextem nebo náročným RAGZatím zůstaňte, kde jste. 3.8-Max stojí o 35.6% více za token a v našem testu vyhledávání se přesně shodoval s 3.7-Max
Potřebujete vstup obrázků nebo videaTohle je důvod k přechodu. 3.7-Max obrázek nepřijme vůbec, a chybu 404 jsme potvrdili
Čekáte na otevřené váhyPoznamenejte si 2026-08-10. Do té doby, než bude existovat model karta a licence k přečtení, není co dělat
Jste spokojení s Claude nebo GPTDnes se nic nemění. Benchmarková skóre Alibaby jsou neověřená a neověřená čísla nejsou důvod k migraci

Na metodě záleží víc než na verdiktu. Každý model, který jsme testovali v produkčních podmínkách, se choval jinak, než by odpovídalo jeho pozici v žebříčku, protože vaše prompty, váš kód a vaše tolerance k opakovaným pokusům nejsou v žádném benchmarku. Dva úkoly s kódem z našeho běhu to dokládají: 3.8-Max i 3.7-Max dosáhly 11 z 11 v úloze na ořezávání šířky řetězce a oba prošly 5,000 z 5,000 fuzzovaných případů na aritmetice s daty. Ve správnosti jsme mezi nimi nenašli rozdíl. Rozdíl, který jsme naměřili, žije v latenci a útratě za tokeny u snadných promptů, ne ve schopnostech u těžkých.

Zvažujete migraci a chcete druhý pár očí na cenový model? Nechte náš tým prověřit ho na vaší zátěži.

Všechna čísla ověřena k 2026-08-04. Ceny, umístění v arénách a časový plán vydání vah se mění často. Naše měření pochází z jediné trasy (OpenRouter na Alibabu), jednoho stroje, jednoho dne, s n=3 pro latenci a n=1 pro většinu funkčních sond.

Často kladené otázky

Je Qwen3.8-Max open source?

K 2026-08-04 ne. Je dostupný pouze přes API. Alibaba naplánovala váhy na „příští týden" na Hugging Face a ModelScope a nezveřejnila žádnou licenci. Titulky, které ho označují za open source, jsou před fakty. Vyhledávání na Hugging Face vrací jen destiláty třetích stran o 4B, ne model kartu od Alibaby.

Kolik stojí Qwen3.8-Max?

$2.00 za milion vstupních tokenů a $6.00 za milion výstupních, s cachovaným vstupem uváděným na $0.25. To je o 35.6% více než u Qwen3.7-Max na obou stranách. Naměřili jsme medián $0.001592 za krátké volání, zhruba 4x levněji než 3.7-Max na stejném promptu, protože produkuje mnohem méně reasoning tokenů.

Kolik parametrů má Qwen3.8-Max?

2.4 bilionu celkem, podle oznámení Alibaby a všech médií, která o tom informovala. Počet aktivních parametrů je sporný: SiliconANGLE, The Decoder a Coursiv uvádějí ~95 miliard aktivních, zatímco MarkTechPost tvrdí, že to Alibaba nezveřejnila. API neobsahuje žádné pole s parametry, takže jsme žádné z čísel nemohli ověřit.

Jaké kontextové okno má Qwen3.8-Max?

Živé API hlásí kontext 1,000,000 tokenů a maximálně 131,072 tokenů odpovědi. Vyhledávání jsme testovali až do 247,911 tokenů bez jediného selhání. Volání s 1M tokeny jsme neprovedli, protože by stálo zhruba $2.00 a přesáhlo náš testovací rozpočet, takže horní hranice tohoto okna je z naší strany neověřená.

Podporuje Qwen3.8-Max vstup obrázků a videa?

Ano u obou a oboje jsme ověřili. Správně přečetl číslice a barvu z lokálně vygenerovaného PNG a přesně popsal video, když dostal URL, kterou Alibaba dokázala stáhnout. Qwen3.7-Max obrázky rovnou odmítá chybou 404. Dvě ze tří testovacích video URL selhaly na kroku stažení u poskytovatele.

Jsou benchmarková skóre Qwen3.8-Max nezávisle ověřená?

Ne. Terminal-Bench 2.1 s 86.6, GPQA Diamond s 92.6, PaperBench s 93.0, OSWorld-Verified s 86.1 a DeepSWE 1.1 s 56.6 pocházejí všechny z interních běhů Alibaby. K 2026-08-04 jsme pro žádné z nich nenašli publikované hodnocení třetí strany.

Můžu Qwen3.8-Max spustit lokálně?

Realisticky ne, ani až váhy vyjdou. Při 2.4 bilionu parametrů je to několikanásobek velikosti DeepSeek-V3.2, který už sám o sobě je při vlastním hostování skutečným infrastrukturním projektem. Počítejte s tím, že ho budete využívat přes poskytovatele inference, ne na vlastních GPU, pokud neprovozujete datacentrum.

Mám migrovat z Qwen3.7-Max na Qwen3.8-Max?

Záleží na vašem mixu tokenů. U krátkých promptů jsme naměřili u 3.8-Max zhruba čtvrtinovou cenu a čtyř až pětinásobnou rychlost. U provozu s dlouhým vstupem stojí o 35.6% více a v našem testu vyhledávání dopadl identicky. Pokud potřebujete vstup obrázků nebo videa, 3.7-Max to vůbec neumí.

Kdy budou uvolněny váhy Qwen3.8-Max?

Alibaba ve svém oznámení z 2026-08-03 řekla „příští týden" a jmenovala Hugging Face a ModelScope jako cíle. Žádné přesné datum, žádný text licence. Podle zpráv by po jejich boku měl vyjít i doprovodný otevřený model Qwen3.8-27B. Plánujeme to znovu zkontrolovat 2026-08-10.

Štítky

qwen-3-8qwen3-8-maxopen-weight-llmalibaba-qwenllm-tooling

Sdílet článek

Související články

Více z kategorie ai-machine-learning

ai-machine-learning
Aug 4, 2026

Gitar AI Code Review: Co Sonar Skutečně Koupil (Recenze 2026)

Sonar koupil Gitar 21. května 2026. Tato recenze popisuje, co skutečně dělá autofix Gitar ověřený přes CI, tarify za $20 a $40, kde předčí CodeRabbit a Greptile, a poctivé důvody, proč jej případně přeskočit.

10 min čtení minut čtení
Číst
ai-machine-learning
Aug 3, 2026

Volání nástrojů agentem: proč váš agent vybírá špatný nástroj

Váš agent volá špatný nástroj, protože selhání se skrývá na čtyřech konkrétních místech: výběr, argumenty, smyčky a velikost odpovědi. Tento průvodce nejprve diagnostikuje každý režim selhání a poté k nim přiřazuje osm osvědčených postupů volání nástrojů agentem, včetně kódu, schémat a evaluační smyčky, kterou můžete spustit při každé změně.

14 min čtení minut čtení
Číst
ai-machine-learning
Aug 3, 2026

RAG vs. doladění: kdy použít co (s reálnými čísly)

RAG načítá fakta v čase dotazu; doladění vkládá znalosti přímo do vah modelu. Studie z arXiv se 162 citacemi otestovala oba přístupy na stejném úkolu a vítěz většinu týmů překvapí. Zde je rozhodovací rámec s reálnými náklady podle veřejných ceníků.

14 min čtení minut čtení
Číst
Zobrazit všechny články
Začněte svůj projekt

Pojďme něco postavit nevšedního?

Proměňme vaši vizi ve skutečnost. Náš tým je připraven vám pomoct vytvořit software, který dělá rozdíl.

Rezervovat 30minutový úvodní hovorNaše projekty

Než z knihovny

Claude dovednosti

Zobrazit vše
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI automatizace

Zobrazit vše
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Než z knihovny

Claude dovednosti

Zobrazit vše
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI automatizace

Zobrazit vše
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Služby

  • Podniková řešení
  • Mobilní aplikace
  • Webové aplikace

Řešení

  • CRM systémy
  • Integrace AI
  • ERP systémy
  • Hlasoví agenti
  • Automatizace procesů
  • Kybernetická bezpečnost

Knihovna

  • Blog
  • Reference

Komunita

  • AI automatizace
  • Claude dovednosti

Nástroje

  • Kalkulátor ceny mobilní aplikace
  • Kalkulátor ceny OpenAI / LLM API
  • Kalkulátor ceny MVP
  • Kalkulátor ceny hlasového AI agenta

Společnost

  • O projektu
  • Partneři
  • Kontakt

Právní informace

  • Zásady ochrany osobních údajů
  • Podmínky poskytování služeb
  • Zásady používání cookies

Služby

  • Podniková řešení
  • Mobilní aplikace
  • Webové aplikace

Řešení

  • CRM systémy
  • Integrace AI
  • ERP systémy
  • Hlasoví agenti
  • Automatizace procesů
  • Kybernetická bezpečnost

Knihovna

  • Blog
  • Reference

Komunita

  • AI automatizace
  • Claude dovednosti

Nástroje

  • Kalkulátor ceny mobilní aplikace
  • Kalkulátor ceny OpenAI / LLM API
  • Kalkulátor ceny MVP
  • Kalkulátor ceny hlasového AI agenta

Společnost

  • O projektu
  • Partneři
  • Kontakt
Právní informaceZásady ochrany osobních údajůPodmínky poskytování služebZásady používání cookies
TECHSY
© 2026 Techsy. Všechna práva vyhrazena.