
Qwen3.8-Max вже тут: 2,4 трлн параметрів, 1M контексту, а вагів досі немає
$1.4728. Саме стільки коштували нам 40 живих API-викликів до Qwen3.8-Max та двох її попередниць 2026-08-04, на другий день після релізу від Alibaba. Здивували не 2,4 трильйона параметрів. Здивувало ось що: 3.8-Max бере на 35.6% більше за токен, ніж Qwen3.7-Max, і при цьому виходить приблизно у 4x дешевшою за відповідь, бо перестала «передумувати». І ще одна річ, яку більшість матеріалів про запуск подає неправильно. Це не open source. Не сьогодні.
Цей пост уперше опублікували 2026-07-19, коли Qwen3.8 була превʼю без опублікованих характеристик. Ми переписали його 2026-08-04 за фактами GA-релізу та власним тестуванням API.
Ключові висновки
- Станом на 2026-08-04 Qwen3.8-Max доступна лише через API. Alibaba пообіцяла ваги «наступного тижня», тобто на тижні 2026-08-10, на Hugging Face та ModelScope.
- Ми виміряли $0.001592 за короткий виклик проти $0.006428 на Qwen3.7-Max, попри вищу ціну за токен.
- П'ять бенчмарк-показників Alibaba — це дані виробника. Ми не знайшли жодної незалежної оцінки, опублікованої станом на 2026-08-04.
- Вхід зображеннями та відео — реальна й нова функція. Ми перевірили це і через API, і порівнявши з відмовою 3.7-Max.
Що змінилося між превʼю і GA
Qwen3.8-Max вийшла у загальний доступ 2026-08-03, і цей реліз закрив кожне відкрите питання, яке ми фіксували два тижні тому на цій сторінці. Ера превʼю дала нам кількість параметрів і обіцянку. GA-реліз додав підтверджене вікно контексту 1M токенів, вхід текстом плюс зображенням плюс відео, п'ять опублікованих бенчмарк-показників і ціну за токен.
Ось старий перелік невідомого, тепер розвʼязаного:
| Що писала ця сторінка 2026-07-19 | Статус на 2026-08-04 |
|---|---|
| Опублікований бенчмарк-показник: жодного | Опубліковано пʼять показників від Alibaba |
| Активні параметри / конфігурація MoE: не розкрито | Широко повідомляють про ~95 млрд активних, розрідженою MoE. Джерела розходяться, деталі нижче |
| Вікно контексту та макс. вихід: не оголошено | 1M на вході, 131,072 на виході, підтверджено живим API |
| Модальність: не оголошено | текст + зображення + відео на вході, текст на виході. Перевірили самі |
| Ціна за токен: не деталізована | $2.00 / M вхід, $6.00 / M вихід |
| Дата виходу open-weight: «скоро», без дати | «Наступного тижня», названо Hugging Face та ModelScope |
| Qwen3.8-Max-Preview зараз доступна | Превʼю завершилося. Вийшов GA |
Одне питання так і не розв'язалося. Розподіл параметрів досі оспорюють. Стаття MarkTechPost про запуск прямо стверджує, що кількість активних параметрів Alibaba не розкрила, тоді як SiliconANGLE, The Decoder і Coursiv усі пишуть про ~95 мільярдів активних. Ми перечитали статтю MarkTechPost 2026-08-04, і вона й досі каже «не розкрито». Чиєсь джерело помиляється, і чесно кажучи, звітність щодо цієї конкретної цифри розходилася вже в день запуску.
Ми не змогли перевірити це в жодну зі сторін. Відповідь OpenRouter /models взагалі не містить поля з кількістю параметрів, тож ніщо в нашому тестуванні не підтверджує і не спростовує ані 2,4T загалом, ані 95B активних.
Чи є Qwen3.8-Max open source? Не станом на 4 серпня
Ні. Станом на 2026-08-04 Qwen3.8-Max доступна лише через API. Alibaba запланувала випуск ваг «наступного тижня» на Hugging Face та ModelScope, ліцензію ще не оголосили. У матеріалах постійно змішують «доступна» і «відкрита», і саме в цій різниці вся суть історії. Сьогодні завантажити ваги неможливо, хоч би що писали в заголовках.
Тут змішують три різні стани в одне слово. А вони не однакові:
| Стан | Qwen3.8-Max на 2026-08-04 |
|---|---|
| Доступна через API | Так. Alibaba Cloud Model Studio, а також реселери й роутери |
| Ваги для завантаження | Ні. Обіцяно «наступного тижня», без конкретної дати |
| Умови ліцензії | Не оголошено. Тексту ліцензії не існує |
Ми перевірили найтвердіший з доступних доказів, а не повірили комусь на слово: пошук Qwen3.8 на Hugging Face станом на 2026-08-04 не показує жодної картки моделі від Alibaba. Натомість там є чотири завантаження від спільноти під назвою Qwen3.8_4B_Distilled та варіанти: це сторонні дистиляції, не флагманська модель. Якщо швидко переглядати цю сторінку, їх легко сплутати зі справжнім релізом.
Ще одна деталь про ліцензію, бо прецедент постійно видають за обіцянку. Qwen 3.5 і Qwen 3.6 обидві вийшли під Apache 2.0. Обмежувальна ліцензія спільноти для моделі на 2,4T технічно все одно могла б називатися «відкритими вагами», хоч би що це змінило у правилах використання. Поки не з'явиться текст ліцензії, будь-хто, хто каже вам, що можна робити з цими вагами, просто вгадує. Саме тому Qwen3.8-Max поки немає в нашому огляді open-source LLM, вартих запуску 2026 року: вона ще не відповідає критеріям.
Що ми виміряли: у 4 рази дешевше за виклик попри зростання ціни на 35,6%
Ми провели 40 оплачених викликів до qwen3.8-max, qwen3.7-max та qwen3-max через OpenRouter 2026-08-04, загальні витрати $1.4728. Кожну вартість нижче обчислено з обʼєкта usage, що повертає API, і звірено з фактично виставленим рахунком OpenRouter. Усе збіглося. Головний висновок суперечить зміні ціни.
Почнімо з ціни. Актуальні тарифи з GET /models станом на 2026-08-04 показують: у 3.8-Max $2.00 вхід / $6.00 вихід за мільйон токенів проти 3.7-Max із $1.475 / $4.425. Це зростання на 35.6% з обох боків, і співвідношення однакове в обох випадках (2.000/1.475 = 6.000/4.425 = 1.3559). Актуальні цифри можна звірити на сторінці моделі OpenRouter.
Тепер той самий тривіальний запит до всіх трьох моделей, по три прогони кожна, temperature: 0, зі стрімінгом:
| Модель | Перший токен (3 прогони) | Перший видимий контент | Загальний час (3 прогони) | Токенів у відповіді | з них токенів роздумів | Медіанна вартість/виклик |
|---|---|---|---|---|---|---|
| qwen3.8-max | 2.249s / 0.874s / 1.054s | 5.414s / 5.058s / 4.209s | 6.338s / 6.734s / 5.130s | 242 / 287 / 243 | 156 / 194 / 157 | $0.001592 |
| qwen3.7-max | 4.871s / 1.157s / 1.670s | ніколи / 22.358s / 25.998s | 31.147s / 24.013s / 27.661s | 1502 / 1281 / 1443 | 1500 / 1174 / 1346 | $0.006428 |
| qwen3-max | 2.617s / 2.892s / 2.386s | 2.617s / 2.892s / 2.386s | 4.401s / 4.601s / 4.081s | 105 / 105 / 107 | 0 / 0 / 0 | $0.000431 |
Два окремі стовпці «перший токен» потрібні, бо обидві reasoning-моделі спершу стрімлять приховані роздуми, а вже потім текст відповіді. У 3.8-Max токен приходить менш ніж за секунду у двох прогонах з трьох, але перше слово, яке користувач справді може прочитати, зʼявляється через чотири-пʼять секунд. У 3.7-Max в прогоні 1 воно не зʼявилося взагалі. Якщо ви будуєте стрімінговий інтерфейс поверх reasoning-моделі, спінер може крутитися ще довго після того, як з'єднання вже давно активне.
Прочитайте стовпець «роздуми» ще раз, уважно. На запиті пояснити фільтр Блума у трьох реченнях 3.7-Max витратила від 1,174 до 1,500 токенів на роздуми. 3.8-Max: від 156 до 194. Це приблизно у 7 разів менше «мислення» на ту саму відповідь, а токени роздумів тарифікуються за ставкою виходу. Результат: 3.8-Max виходить приблизно у 4 рази дешевшою за виклик і у 4-5 разів швидшою за загальним часом з нашої машини, включно з мережевою затримкою, при цьому коштуючи на 35.6% більше за токен. Ціна за одиницю виросла, а рахунок упав.
Це змінюється, коли запити стають довшими. За модельованим (не виміряним) розрахунком з живих тарифів, виклик на 30,000 токенів вхідних даних із 500 токенами виходу коштує $63.00 за тисячу викликів на 3.8-Max проти $46.46 на 3.7-Max. При 100,000 вхідних токенів це вже $203.00 проти $149.71. Коли більшість токенів вхідні, перевага в ефективності роздумів перестає компенсувати підвищення ціни, і 3.8-Max стає найдорожчою з трьох. Яка модель дешевша, реально залежить від вашого співвідношення вхід/вихід, той самий висновок, до якого постійно приходить наше порівняння цін на API LLM.
reasoning_effort: нова опція, і 3.7-Max мовчки її ігнорує
reasoning_effort є серед підтримуваних параметрів 3.8-Max, але відсутній у 3.7-Max. У 3.8-Max цей параметр змінює результат помірно: за трьома прогонами кожен, minimal дав 67, 108 і 124 токени роздумів проти high зі 163, 136 і 173. Медіани 108 проти 163 на тому самому запиті, при температурі 0.
Знахідка, яка коштує грошей, стосується старішої моделі. Якщо надіслати reasoning_effort: "low" до 3.7-Max, параметр приймається, а не відхиляється, і просто ігнорується: цей виклик усе одно спалив 1,401 токен роздумів, виставивши той самий рахунок $0.006689, що й ідентичний за формою виклик, який ми залогували. Жодної помилки, жодного попередження, жодного ефекту. Якщо ви оптимізуєте витрати, знижуючи зусилля на роздуми, перевірте, чи параметр справді щось робить саме на тій моделі, яку ви викликаєте, бо непідтримуваний параметр тут провалюється тихо, а не з помилкою.
Пастка з порожньою відповіддю, яку варто перевірити перед міграцією
Наш перший тестовий прогін використовував max_tokens: 400 і зламав власний скрипт. Причина виявилася вартою окремого розгляду. Qwen3.7-Max може витратити весь бюджет токенів на роздуми і повернути порожній рядок, з finish_reason: "length", оплачений повністю.
Ми зловили це тричі. При max_tokens: 400: 402 токени відповіді, з них 400 роздумів, нуль символів відповіді, $0.001822 виставлено. При max_tokens: 1500: 1,502 токени, 1,500 роздумів, нуль символів, $0.006689 нізащо. І ще раз, у пізнішому виклику, $0.006735. Жодної помилки, жодного винятку, просто на вигляд цілком робочий обʼєкт відповіді з порожнім рядком контенту.
Якщо ви мігруєте наявну інтеграцію з 3.7-Max, а ваш код виставляє скромний max_tokens, закладіть час на тестування саме цього сценарію. У 3.8-Max набагато коротші роздуми, тож вона значно менш вразлива до цього. Але не застрахована повністю.
Невеликий токен-оверхед, про який ніхто не згадує
Той самий 12-словний запит порахувало як 67 токенів на 3.8-Max і 29 на 3.7-Max, стабільно в кожному прогоні (27 на qwen3-max). Це приблизно 38 токенів фіксованого оверхеду, ймовірно, від більшого системного або чат-шаблону. На виклику RAG на 100,000 токенів це округлюється до нуля. Але на високооб'ємному класифікаторі, що обробляє короткі запити, це більш ніж подвоює ваш вхідний рахунок ще до того, як ви написали хоч слово.
Чи справді Qwen3.8-Max приймає зображення та відео?
Так, і мультимодальний вхід у цьому поколінні дійсно новий, а не просто перейменування. API повертає text+image+video->text для 3.8-Max і лише текст для 3.7-Max. Ми перевірили різницю, надіславши те саме зображення обом моделям: старша модель відхилила його ще на рівні маршрутизації.
Ми згенерували тестове зображення локально власним PNG-енкодером, тож наперед точно знали правильну відповідь: 750×270 пікселів, чорні блокові цифри 4739 на білому тлі, з червоною горизонтальною смугою вгорі. Надіслане у base64, qwen3.8-max повернула DIGITS: 4739 та TOPBAR: red. Правильно за обома пунктами, 6.99s, $0.002146. Такий самий запит до qwen3.7-max повернувся як HTTP 404 {"error":{"message":"No endpoints found that support image input"}}.
Відео теж працює, з одним застереженням, яке ми мало не записали як провал. Два з трьох публічних MP4-URL, які ми пробували, повернули HTTP 400 "Failed to download multimodal content". Це Alibaba не змогла завантажити файл, а не маршрут, що відхиляє відео. З URL, який вдалося завантажити, 3.8-Max точно описала кліп Big Buck Bunny, включно з назвою персонажа, за 24.24s і $0.006528.
Дві практичні деталі перед тим, як будувати щось на цьому. Відео тарифікувалося як 696 звичайних токенів запиту за приблизно 10-секундний кліп, а usage.prompt_tokens_details.video_tokens показав 0, тож окремо виділити вартість відео з цього поля не вийде. І неправильно сформований елемент контенту провалюється тихо: надсилання {"type": "video", "video": [url]} замість video_url повернуло HTTP 200, де модель ввічливо повідомила, що не бачить жодного відео, плюс рахунок. Використовуйте video_url.
Варто знати: коли ми попросили 3.8-Max описати власні можливості, вона відповіла Input modalities: text. Це неправда, як показав наступний тест у тому самому нашому прогоні. Опис можливостей моделі є виходом мовної моделі, а не специфікацією.
Наскільки добре тримає вікно контексту в 1M токенів?
Ми заклали три унікальні факти на глибині 10%, 50% і 90% у згенеровану заповнюючу масу тексту й попросили назвати всі три в одному виклику. 18 із 18 «голок» знайдено правильно за шість прогонів на двох моделях, при розмірах запиту від 5,723 до 247,911 токенів, оцінка точним пошуком підрядка в коді, без ручного читання відповідей.
Наші прогони qwen3.8-max (два прогони qwen3.7-max на 83,380 та 247,873 токенах і один прогон qwen3-max на 78,255 також повернули кожну голку):
| Токенів запиту (qwen3.8-max) | Затримка | Вартість | Знайдено голок |
|---|---|---|---|
| 5,723 | 9.24s | $0.01409 | 3 з 3 |
| 25,703 | 13.43s | $0.05453 | 3 з 3 |
| 83,418 | 17.63s | $0.16965 | 3 з 3 |
| 247,911 | 38.54s | $0.49828 | 3 з 3 |
Затримка масштабується сублінійно, і саме це практично цінно: у 43 рази більше вхідних токенів коштує лише у 4.2 рази більше загального часу.
Тепер чесно про межі, бо це найлегший рівень оцінки довгого контексту. Пошук дослівно закладеного факту мало що говорить про здатність міркувати на великому документі, а ми тестували кожен розмір лише один раз. Ми не запускали виклик на 1M токенів. За $2.00 за мільйон вхідних токенів такий виклик коштував би близько $2.00, більше, ніж увесь цей тестовий прогін, а один-єдиний зразок мало що показав би. Заявлену стелю в 1M токенів ми, відповідно, не перевірили. І 3.7-Max точно збіглася з 3.8-Max на обох порівнюваних розмірах, тож пошук у довгому контексті не та точка, де це покоління показує різницю.
Тут спливла ще одна тарифна пастка, яку матеріали про запуск повністю проґавили. У qwen3-max діють тарифні перевищення: ставка подвоюється понад 32,000 токенів запиту й ще раз зростає понад 128,000, тоді як 3.8-Max і 3.7-Max мають фіксовану ставку на будь-якій довжині. Ми підтвердили цей поріг фактичним рахунком: наш виклик на 78,255 токенів до qwen3-max оплачено за $0.12227, за ставкою $1.56/M, а не заявленою $0.78/M. На цій довжині це коштує майже точно стільки ж, скільки 3.7-Max ($0.12523). Заявлена ціна вдвічі нижча за реальну. Реальна ціна на 80 тис. токенів — це різниця в межах округлення.
Пʼять бенчмарк-показників Alibaba, і чому жоден із них не підтверджений
Alibaba опублікувала пʼять бенчмарк-показників разом із GA-релізом. Кожен із них — це власні внутрішні прогони Alibaba, і ми не знайшли жодної незалежної оцінки, опублікованої станом на 2026-08-04. Це речення варто розмістити поруч із цифрами, а не через три абзаци після них.
| Бенчмарк | Показник за версією Alibaba | Підтверджено третьою стороною? |
|---|---|---|
| Terminal-Bench 2.1 | 86.6 | Ні, станом на 2026-08-04 |
| GPQA Diamond | 92.6 | Ні, станом на 2026-08-04 |
| PaperBench | 93.0 | Ні, станом на 2026-08-04 |
| OSWorld-Verified | 86.1 | Ні, станом на 2026-08-04 |
| DeepSWE 1.1 | 56.6 (попередниця: 21.6) | Ні, станом на 2026-08-04 |
Alibaba також повідомила про внутрішній агрегований показник 0.725, порівняно з 0.474 раніше, і позиціонувала модель як близьку або таку, що перевершує Claude Opus 4.8, Fable 5 та GPT-5.6 Sol. Циркулювали й місця в арені: 5-те у Text Arena та 2-ге у Vision Arena за власним оголошенням Alibaba від 2026-08-03, яке ми не перевіряли повторно на живому лідерборді. Місця в арені змінюються щодня. До будь-якого рейтингу, який ви читаєте цього тижня, варто ставитися як до знімка з датою.
Чого ще ніхто не виміряв, включно з нами: пропускну здатність при паралельних навантаженнях, продуктивність не англійською мовою, оцінки безпеки й узгодженості, надійність виклику інструментів. Наші власні цифри охоплюють затримку, вартість, модальність і пошук у довгому контексті на одному маршруті, і більше нічого. Матеріал про запуск від Bloomberg повторив заявлені бенчмарк-показники без незалежного тестування, саме там зараз перебуває практично вся преса.
Для перевірених цифр краще звернутися до нашого порівняння Qwen проти DeepSeek проти GLM, а Kimi K3 з приблизно 2,8T параметрів є тим суперником за розміром, з яким усі зіставляють цю модель.
Qwen3.8 проти Qwen3-8B, і розворот навколо open-weight у цьому релізі
Qwen3.8 — це флагманська модель Alibaba на 2,4 трильйона параметрів. Qwen3-8B — це щільна модель на 8 мільярдів параметрів із серії Qwen3, доступна для завантаження з 2025 року. Схожі на вигляд назви, розбіжність приблизно у 300x за розміром. Пошукові системи досі плутають їх, як і чимало відповідей на форумах.
Проблема з назвами цього тижня лише погіршилася. Єдине на Hugging Face з назвою «Qwen3.8» просто зараз: дистиляції на 4B від спільноти. Якщо ви шукаєте ваги і завантажите одну з них, ви отримаєте щось, що не має жодного стосунку до моделі на 2,4T.
Два закриті флагмани, а тепер ось це
Обіцянка open-weight — справжня новина тут, і вона читається інакше, якщо знати історію цієї сімʼї моделей. Alibaba два покоління поспіль тримала свідомий розподіл: відкриті ваги для робочих коней, закритий флагман на вершині.
| Покоління | Ваги | Примітки |
|---|---|---|
| Qwen 3.5 (0.8B–397B-A17B) | Відкриті, Apache 2.0 | Уся сімʼя опублікована публічно |
| Qwen 3.6 (27B dense, 35B-A3B MoE) | Відкриті, Apache 2.0 | Та сама схема утрималась |
| Qwen3.7-Max | Закрита | Лише API. Немає GGUF, немає чекпоінта на Hugging Face |
| Qwen3.8-Max | Обіцяно відкрити, ще не вийшла | «Наступного тижня» станом на 2026-08-03. Ліцензія не оголошена |
Alibaba два покоління поспіль тримала флагман закритим, а тепер каже, що відкриє найбільшу модель, яку коли-небудь будувала. Якщо ваги зʼявляться, як обіцяно, це справжній розворот, і він тисне на кожну лабораторію, що вважає «фронтир-рівень залишається закритим» усталеним правилом. Якщо термін зірветься, це стане вже третім поспіль закритим релізом Max. Обидва результати досі можливі станом на 2026-08-04. Ми бачили ту саму динаміку в GLM 5.2, де реальна ліцензія важила більше за саму заяву.
Чи можна запустити Qwen3.8-Max самостійно? (Досі ні)
Ні, і специфікації GA роблять це ще очевиднішим, а не менш. При 2,4 трильйона загальних параметрів це не та модель, яку розгортають на власному залізі, навіть після виходу ваг. DeepSeek-V3.2 на 685B ті, хто вже це робив, описують як серйозний інфраструктурний проєкт. Тут — у кілька разів більше.
Тож що насправді дає open-weight модель на 2,4T?
- Провайдери інференсу зможуть її хостити, а це означає цінову конкуренцію, а отже й падіння вашої вартості за токен
- Уперше на цьому рівні стають можливими суверенні, регульовані та ізольовані (air-gapped) розгортання
- Дослідники й ті, хто донавчає моделі, отримують базову модель фронтир-рівня для роботи
- Це не означає, що вона запуститься на вашій машині, вашому одному A100 чи GPU-бюджеті вашого стартапу
Якщо хочете точну арифметику того, чого насправді вимагає запуск великих open-weight моделей, наш гайд з вимог до VRAM для LLM робить ці розрахунки правильно. Коротка відповідь для цієї моделі: не варто.
Перемикатися, тестувати чи чекати?
| Ваша ситуація | Що б зробили ми станом на 2026-08-04 |
|---|---|
| Використовуєте Qwen3.7-Max у продакшені | Спершу протестуйте 3.8-Max на трафіку з короткими запитами: саме там проявився наш розрив у 4x вартості. Потім перевірте обробку max_tokens на випадок порожньої відповіді |
| Навантаження з довгим контекстом чи важким RAG | Поки що залишайтеся на місці. 3.8-Max коштує на 35.6% більше за токен і точно збіглася з 3.7-Max на нашому тесті пошуку |
| Потрібен вхід зображеннями чи відео | Це і є причина перейти. 3.7-Max узагалі не приймає зображення, ми підтвердили 404 |
| Чекаєте на відкриті ваги | Позначте у календарі 2026-08-10. Робити нічого, поки не з'явиться картка моделі й текст ліцензії |
| Задоволені Claude чи GPT | Сьогодні нічого не змінюється. Бенчмарк-показники Alibaba не підтверджені, а неперевірені цифри не привід для міграції |
Метод важливіший за вердикт. Кожна модель, яку ми тестували в продакшені, поводилася інакше, ніж передбачало її місце в лідерборді, бо ваші запити, ваш кодбейз і ваша толерантність до повторів не входять у жоден бенчмарк. Два завдання з кодування в нашому прогоні підтверджують думку: 3.8-Max і 3.7-Max обидві набрали 11 з 11 у завданні на обрізання рядків за шириною і обидві пройшли 5,000 із 5,000 фаззинг-тестів на арифметику дат. За коректністю ми не змогли їх відрізнити. Розрив, який ми виміряли, живе в затримці та витраті токенів на легких запитах, а не у можливостях на складних.
Зважуєте міграцію і хочете, щоб хтось збоку перевірив розрахунок вартості для вашого навантаження? Дайте нашій команді перевірити це на вашому кейсі.
Усі цифри перевірено 2026-08-04. Ціни, місця в арені та терміни виходу ваг змінюються часто. Наші вимірювання зроблено на одному маршруті (OpenRouter до Alibaba), одній машині, за один день, n=3 для затримки і n=1 для більшості функціональних перевірок.
Часті запитання
Чи є Qwen3.8-Max open source?
Не станом на 2026-08-04. Модель доступна лише через API. Alibaba запланувала випуск ваг «наступного тижня» на Hugging Face і ModelScope, ліцензія ще не оголошена. Заголовки, що називають її open source, випереджають факти. Пошук на Hugging Face повертає лише сторонні дистиляції на 4B, а не картку моделі від Alibaba.
Скільки коштує Qwen3.8-Max?
$2.00 за мільйон вхідних токенів і $6.00 за мільйон вихідних, кешований вхід заявлено за $0.25. Це на 35.6% більше, ніж у Qwen3.7-Max з обох боків. Ми виміряли медіанну вартість $0.001592 за короткий виклик, приблизно у 4 рази дешевше за 3.7-Max на тому самому запиті, бо модель випускає значно менше токенів роздумів.
Скільки параметрів у Qwen3.8-Max?
2,4 трильйона загалом, за оголошенням Alibaba й усіма виданнями, що це висвітлювали. Кількість активних параметрів оспорюють: SiliconANGLE, The Decoder і Coursiv повідомляють про ~95 мільярдів активних, тоді як MarkTechPost стверджує, що Alibaba цього не розкрила. API не показує поля з кількістю параметрів, тож ми не змогли підтвердити жодну з цифр.
Яке вікно контексту в Qwen3.8-Max?
Живий API показує 1,000,000 токенів контексту й 131,072 максимальних токенів завершення. Ми протестували пошук до 247,911 токенів без жодного збою. Ми не запускали виклик на 1M токенів, бо це коштувало б близько $2.00 і вийшло б за межі нашого тестового бюджету, тож верхню межу цього вікна ми не перевірили.
Чи підтримує Qwen3.8-Max вхід зображеннями та відео?
Так, обидва варіанти, і ми їх перевірили. Модель правильно прочитала цифри й колір з локально згенерованого PNG і точно описала відео, коли отримала URL, який Alibaba змогла завантажити. Qwen3.7-Max прямо відхиляє зображення з помилкою 404. Два з наших трьох тестових відео-URL не завантажилися на етапі провайдера.
Чи незалежно підтверджені бенчмарк-показники Qwen3.8-Max?
Ні. Terminal-Bench 2.1 на 86.6, GPQA Diamond на 92.6, PaperBench на 93.0, OSWorld-Verified на 86.1 та DeepSWE 1.1 на 56.6: усі це внутрішні прогони Alibaba. Станом на 2026-08-04 ми не знайшли незалежної оцінки, опублікованої для жодного з них.
Чи можна запустити Qwen3.8-Max локально?
Реалістично — ні, навіть коли вийдуть ваги. При 2,4 трильйона параметрів це в кілька разів більше за DeepSeek-V3.2, а самостійний хостинг цієї моделі вже є серйозним інфраструктурним проєктом. Очікуйте, що споживатимете модель через провайдерів інференсу, а не власні GPU, якщо тільки не керуєте власним дата-центром.
Чи варто мігрувати з Qwen3.7-Max на Qwen3.8-Max?
Залежить від співвідношення токенів у ваших запитах. На коротких запитах ми виміряли, що 3.8-Max коштує приблизно чверть ціни й працює у чотири-п'ять разів швидше. На навантаженнях із довгим вхідним контекстом вона коштує на 35.6% більше і показала однаковий результат на нашому тесті пошуку. Якщо потрібен вхід зображеннями чи відео, 3.7-Max узагалі на це не здатна.
Коли вийдуть ваги Qwen3.8-Max?
Alibaba сказала «наступного тижня» у своєму оголошенні від 2026-08-03, назвавши Hugging Face і ModelScope місцями випуску. Точної дати немає, тексту ліцензії теж. Повідомляється, що разом із ними вийде супутня open-weight модель Qwen3.8-27B. Ми плануємо перевірити ще раз 2026-08-10.