Techsy
Kontakt
Rozpocznij
Powrót do bloga
ai-machine-learning

Qwen3.8-Max już jest: 2.4T parametrów, kontekst 1M, a wag wciąż brak

Napisane przez Mert Batur
Zaktualizowano Aug 4, 2026
16 min
Spis treści
Qwen3.8-Max już jest: 2.4T parametrów, kontekst 1M, a wag wciąż brak

Qwen3.8-Max już jest: 2.4T parametrów, kontekst 1M, a wag wciąż brak

$1.4728. Tyle kosztowały nas 40 realnych wywołań API na Qwen3.8-Max i jego dwóch poprzednikach w dniu 2026-08-04, dzień po tym, jak Alibaba go wypuściła. Zaskoczeniem nie było 2.4T parametrów. Zaskoczeniem było to: 3.8-Max liczy sobie 35.6% więcej za token niż Qwen3.7-Max, a i tak wyszedł około 4x taniej za odpowiedź, bo przestał się nad sobą zastanawiać. Jest jeszcze jedna rzecz, którą większość relacji z premiery podaje błędnie. To nie jest open source. Nie dzisiaj.

Ten wpis został pierwotnie opublikowany 2026-07-19, gdy Qwen3.8 był wersją przedpremierową bez opublikowanej specyfikacji. Został przepisany 2026-08-04 na podstawie wydania GA i naszych własnych testów API.

Najważniejsze wnioski

  • Na 2026-08-04 Qwen3.8-Max działa wyłącznie przez API. Alibaba obiecała wagi „w przyszłym tygodniu", czyli w tygodniu od 2026-08-10, na Hugging Face i ModelScope.
  • Zmierzyliśmy $0.001592 za krótkie zapytanie wobec $0.006428 na Qwen3.7-Max, mimo wyższej ceny za token.
  • Pięć wyników benchmarkowych Alibaby to dane od dostawcy. Nie znaleźliśmy niezależnej ewaluacji opublikowanej na dzień 2026-08-04.
  • Wejście obrazowe i wideo są prawdziwe i nowe. Zweryfikowaliśmy oba względem API oraz odmowy ze strony 3.7-Max.

Co się zmieniło między wersją przedpremierową a GA

Qwen3.8-Max stał się ogólnie dostępny 2026-08-03, a wydanie GA odpowiedziało na każde pytanie otwarte, które ta strona wymieniała dwa tygodnie temu. Era przedpremierowa dała nam liczbę parametrów i obietnicę. Wydanie GA dodało potwierdzone okno kontekstowe 1M tokenów, wejście tekst plus obraz plus wideo, pięć opublikowanych wyników benchmarkowych oraz cenę za token.

Oto stara lista niewiadomych, teraz rozwiązanych:

Co ta strona mówiła 2026-07-19Stan na 2026-08-04
Jakikolwiek opublikowany wynik benchmarku: żadenPięć wyników zgłoszonych przez Alibabę
Aktywne parametry / konfiguracja MoE: nieujawnionePowszechnie podawane jako ~95B aktywnych, rzadkie MoE. Doniesienia są sprzeczne, patrz niżej
Okno kontekstowe i maksymalny output: niezapowiedziane1M wejścia, 131,072 wyjścia, potwierdzone przez działające API
Modalność: niezapowiedzianatekst + obraz + wideo na wejściu, tekst na wyjściu. Zweryfikowaliśmy to sami
Cennik za token: nierozbity$2.00 / M wejście, $6.00 / M wyjście
Data wydania otwartych wag: „wkrótce", bez daty„W przyszłym tygodniu", wymienione Hugging Face i ModelScope
Qwen3.8-Max-Preview działa już terazWersja przedpremierowa się skończyła. GA wystartowało

Jedna kwestia nie została rozstrzygnięta. Podział parametrów wciąż budzi spory. Artykuł MarkTechPost o premierze mówi wprost, że liczba aktywnych parametrów nie została ujawniona przez Alibabę, podczas gdy SiliconANGLE, The Decoder i Coursiv podają wszystkie ~95 miliardów aktywnych. Ponownie przeczytaliśmy artykuł MarkTechPost 2026-08-04 i wciąż jest tam napisane „nieujawnione". Czyjeś źródła się mylą, i uczciwie trzeba powiedzieć, że doniesienia na temat tej konkretnej liczby były sprzeczne w dniu premiery.

Nie mogliśmy zweryfikować tego w żadną stronę. Odpowiedź endpointu /models w OpenRouter w ogóle nie ujawnia pola liczby parametrów, więc nic w naszych testach nie potwierdza ani nie obala liczby 2.4T łącznie czy 95B aktywnych.

Czy Qwen3.8-Max jest open source? Nie na dzień 4 sierpnia

Nie. Na dzień 2026-08-04 Qwen3.8-Max działa wyłącznie przez API. Alibaba zaplanowała wydanie wag „w przyszłym tygodniu" na Hugging Face i ModelScope, i nie ogłosiła jeszcze licencji. Doniesienia medialne wciąż zlewają „dostępne" z „otwarte" w jedno, a to rozróżnienie jest sednem całej sprawy. Dziś nie ma żadnych wag do pobrania, cokolwiek mówi nagłówek.

Trzy różne stany są zlewane w jedno słowo. To nie to samo:

StanQwen3.8-Max na 2026-08-04
Dostępny przez APITak. Alibaba Cloud Model Studio, plus resellerzy i routery
Wagi do pobraniaNie. Obiecane „w przyszłym tygodniu", bez podanej daty
Warunki licencjiNieogłoszone. Nie istnieje żaden tekst do przeczytania

Sprawdziliśmy najtwardszy dostępny dowód, zamiast wierzyć komukolwiek na słowo: wyszukiwanie Qwen3.8 na Hugging Face na 2026-08-04 nie zwraca żadnej karty modelu od Alibaby. To, co zwraca, to cztery uploady społecznościowe o nazwie Qwen3.8_4B_Distilled i podobne warianty, które są destylacjami stron trzecich, a nie flagowym modelem. Jeśli przeglądasz tę stronę szybko, łatwo pomylić je z prawdziwym wydaniem.

Jedna uwaga na temat licencji, bo precedens jest wciąż raportowany jako zobowiązanie. Qwen 3.5 i Qwen 3.6 zostały wydane na licencji Apache 2.0. Restrykcyjna licencja społecznościowa przy 2.4T wciąż technicznie byłaby „otwartymi wagami", jednocześnie zmieniając to, co wolno ci z nimi zrobić. Dopóki nie ma tekstu licencji, każdy, kto mówi ci, co możesz zrobić z tymi wagami, zgaduje. Dlatego też Qwen3.8-Max nie znajduje się w naszym zestawieniu najlepszych modeli open source wartych uruchomienia w 2026 roku: jeszcze się nie kwalifikuje.

Co zmierzyliśmy: 4x taniej za wywołanie mimo wzrostu ceny o 35.6%

Wykonaliśmy 40 płatnych wywołań na qwen3.8-max, qwen3.7-max i qwen3-max przez OpenRouter na 2026-08-04, łączny koszt $1.4728. Każdy koszt poniżej został obliczony z zwróconego obiektu usage i skrzyżowany z rzeczywistą kwotą naliczoną przez OpenRouter. Wszystkie się zgadzały. Główne odkrycie idzie w kierunku odwrotnym niż zmiana ceny.

Zacznijmy od ceny. Aktualny cennik z GET /models na 2026-08-04 stawia 3.8-Max na $2.00 wejście / $6.00 wyjście za milion tokenów wobec 3.7-Max przy $1.475 / $4.425. To wzrost o 35.6% po obu stronach, a stosunek jest identyczny w obie strony (2.000/1.475 = 6.000/4.425 = 1.3559). Aktualne liczby możesz sprawdzić na stronie modelu w OpenRouter.

Teraz to samo trywialne zapytanie wysłane do wszystkich trzech modeli, po trzy przebiegi każdy, temperature: 0, streamowane:

ModelPierwszy token (3 przebiegi)Pierwsza widoczna treśćCzas trwania (3 przebiegi)Tokeny wyjściowez czego rozumowanieMediana kosztu/wywołanie
qwen3.8-max2.249s / 0.874s / 1.054s5.414s / 5.058s / 4.209s6.338s / 6.734s / 5.130s242 / 287 / 243156 / 194 / 157$0.001592
qwen3.7-max4.871s / 1.157s / 1.670snigdy / 22.358s / 25.998s31.147s / 24.013s / 27.661s1502 / 1281 / 14431500 / 1174 / 1346$0.006428
qwen3-max2.617s / 2.892s / 2.386s2.617s / 2.892s / 2.386s4.401s / 4.601s / 4.081s105 / 105 / 1070 / 0 / 0$0.000431

Dwie osobne kolumny pierwszego tokena są konieczne, bo oba modele rozumujące streamują ukryte rozumowanie, zanim pojawi się jakikolwiek tekst odpowiedzi. Na 3.8-Max token pojawia się w mniej niż sekundę w dwóch z trzech przebiegów, ale pierwsze słowo, które użytkownik faktycznie może przeczytać, ląduje cztery do pięciu sekund później. Na 3.7-Max w przebiegu 1 w ogóle się nie pojawiło. Jeśli budujesz interfejs streamingowy na modelu rozumującym, spinner kręci się dalej długo po tym, jak połączenie już udowodniło, że żyje.

Przeczytaj kolumnę rozumowania dwa razy. Przy poleceniu proszącym o trzyzdaniowe wyjaśnienie filtra Blooma, 3.7-Max zużył od 1,174 do 1,500 tokenów rozumowania. 3.8-Max zużył od 156 do 194. To mniej więcej 7x mniej myślenia dla tej samej odpowiedzi, a tokeny rozumowania są rozliczane według stawki za output. Wynik: 3.8-Max jest o około 4x tańszy za wywołanie i 4 do 5 razy szybszy pod względem czasu z naszej maszyny, wliczając ruch sieciowy, kosztując przy tym 35.6% więcej za token. Cena z metki poszła w górę, a rachunek w dół.

To się odwraca wraz ze wzrostem promptów. Modelowane na podstawie aktualnego cennika, a nie zmierzone, zapytanie na 30,000 tokenów z 500 tokenami wyjściowymi kosztuje $63.00 za tysiąc wywołań na 3.8-Max wobec $46.46 na 3.7-Max. Przy 100,000 tokenów wejściowych to $203.00 wobec $149.71. Gdy większość twoich tokenów to wejście, przewaga wydajności rozumowania przestaje kompensować wzrost ceny i 3.8-Max staje się najdroższym z trzech. To, który model jest najtańszy, naprawdę zależy od twojego stosunku wejścia do wyjścia, co jest tą samą lekcją, do której wciąż wraca nasze porównanie cen API LLM.

reasoning_effort jest nowy, a 3.7-Max cicho go ignoruje

reasoning_effort pojawia się wśród obsługiwanych parametrów 3.8-Max, a nie ma go u 3.7-Max. Na 3.8-Max przesuwa wskaźnik umiarkowanie: w trzech przebiegach każda, minimal dało 67, 108 i 124 tokeny rozumowania wobec high przy 163, 136 i 173. Mediany 108 wobec 163, na tym samym prompcie, przy temperature 0.

Odkrycie, które kosztuje pieniądze, dotyczy starszego modelu. Wysłanie reasoning_effort: "low" do 3.7-Max jest akceptowane, a nie odrzucane, a następnie ignorowane: to wywołanie i tak spaliło 1,401 tokenów rozumowania, naliczając ten sam koszt $0.006689 co identycznie ukształtowane wywołanie, które zalogowaliśmy. Bez błędu, bez ostrzeżenia, bez efektu. Jeśli dostrajasz koszty poprzez obniżanie poziomu rozumowania, sprawdź, czy faktycznie coś to robi na modelu, którego rzeczywiście używasz, bo nieobsługiwany parametr zawodzi tutaj po cichu, a nie głośno.

Pułapka pustej odpowiedzi, którą warto sprawdzić przed migracją

Nasz pierwszy przebieg testowy użył max_tokens: 400 i wysypał nasz własny skrypt. Powód okazał się wart więcej niż sam test. Qwen3.7-Max może wydać cały budżet tokenów na rozumowanie i zwrócić pusty ciąg znaków, z finish_reason: "length", rozliczony w całości.

Trafiliśmy na to trzy osobne razy. Przy max_tokens: 400: 402 tokeny wyjściowe, 400 z nich to rozumowanie, zero znaków odpowiedzi, $0.001822 naliczone. Przy max_tokens: 1500: 1,502 tokeny, 1,500 rozumowania, zero znaków, $0.006689 za nic. I jeszcze raz przy późniejszym wywołaniu, $0.006735. Bez błędu, bez wyjątku, tylko płynnie wyglądający obiekt odpowiedzi z pustym ciągiem treści.

Jeśli migrujesz istniejącą integrację z 3.7-Max, a twój kod ustawia skromny max_tokens, zarezerwuj czas na przetestowanie tej ścieżki. Znacznie krótsze rozumowanie 3.8-Max sprawia, że jest on wyraźnie mniej narażony. Ale nie jest odporny.

Mały narzut tokenów, o którym nikt nie wspomina

Identyczny 12-słowowy prompt naliczył 67 tokenów wejściowych na 3.8-Max i 29 na 3.7-Max, konsekwentnie w każdym przebiegu (27 na qwen3-max). To mniej więcej 38 tokenów stałego narzutu, prawdopodobnie z większego szablonu systemowego lub czatowego. Przy zapytaniu RAG na 100,000 tokenów to zaokrągla się do zera. Przy klasyfikatorze wysokiej przepustowości strzelającym krótkimi promptami, więcej niż podwaja twój rachunek za wejście, zanim napiszesz choć jedno słowo.

Czy Qwen3.8-Max naprawdę przyjmuje obrazy i wideo?

Tak, a wejście multimodalne jest w tej generacji naprawdę nowe, nie przeetykietowane. API zgłasza text+image+video->text dla 3.8-Max i tylko tekst dla 3.7-Max. Zweryfikowaliśmy tę różnicę, wysyłając ten sam obraz do obu, a starszy model odrzucił go na poziomie routingu.

Wygenerowaliśmy obraz testowy lokalnie za pomocą ręcznie napisanego enkodera PNG, więc prawda wzorcowa była znana z konstrukcji: 750x270 pikseli, czarne cyfry blokowe 4739 na białym tle, z czerwonym poziomym paskiem na górze. Wysłany zakodowany base64, qwen3.8-max zwrócił DIGITS: 4739 i TOPBAR: red. Poprawnie w obu przypadkach, 6.99s, $0.002146. Identyczne żądanie do qwen3.7-max wróciło jako HTTP 404 {"error":{"message":"No endpoints found that support image input"}}.

Wideo też działa, z zastrzeżeniem, które omal nie zgłosiliśmy jako awarię. Dwa z trzech publicznych adresów URL MP4, które wypróbowaliśmy, zwróciły HTTP 400 "Failed to download multimodal content". To Alibaba nie potrafi pobrać pliku, a nie trasa odmawia obsługi wideo. Przy URL-u, który udało się pobrać, 3.8-Max dokładnie opisał klip Big Buck Bunny, wliczając nazwanie postaci, w 24.24s za $0.006528.

Dwie praktyczne uwagi, zanim zaczniesz na tym budować. Wideo naliczyło 696 zwykłych tokenów wejściowych za klip trwający około 10 sekund, a usage.prompt_tokens_details.video_tokens zgłosiło 0, więc nie da się wyodrębnić kosztu wideo z tego pola. A błędnie sformułowana część treści zawodzi po cichu: wysłanie {"type": "video", "video": [url]} zamiast video_url zwróciło HTTP 200, w którym model grzecznie stwierdził, że nie widzi żadnego wideo, plus rachunek. Używaj video_url.

Warto wiedzieć: gdy poprosiliśmy 3.8-Max, by opisał własne możliwości, odpowiedział Input modalities: text. To błędne, co pokazał kolejny test w naszym własnym przebiegu. Autoopis modelu jest wynikiem działania modelu językowego, nie arkuszem specyfikacji.

Jak radzi sobie okno kontekstowe 1M tokenów?

Umieściliśmy trzy unikalne fakty na 10%, 50% i 90% głębokości w wygenerowanym wypełniaczu i poprosiliśmy o wszystkie trzy w jednym wywołaniu. 18 z 18 „igieł" wróciło poprawnie w sześciu przebiegach na dwóch modelach, przy wielkościach promptu od 5,723 do 247,911 tokenów, ocenianych przez dokładne dopasowanie podciągu w kodzie, a nie przez czytanie odpowiedzi.

Nasze przebiegi qwen3.8-max (dwa przebiegi qwen3.7-max przy 83,380 i 247,873 tokenach oraz jeden przebieg qwen3-max przy 78,255 również zwróciły każdą igłę):

Tokeny promptu (qwen3.8-max)OpóźnienieKosztZnalezione igły
5,7239.24s$0.014093 z 3
25,70313.43s$0.054533 z 3
83,41817.63s$0.169653 z 3
247,91138.54s$0.498283 z 3

Opóźnienie rośnie sublinearnie, co jest praktycznie użyteczną częścią: 43x więcej tokenów wejściowych kosztuje tylko 4.2x więcej czasu.

Teraz uczciwe ograniczenia, bo to najłatwiejszy koniec ewaluacji długiego kontekstu. Odzyskanie dosłownie zaszytego faktu bardzo niewiele mówi o rozumowaniu na dużym dokumencie, a każdy rozmiar testowaliśmy tylko raz. Nie wykonaliśmy wywołania na 1M tokenów. Przy $2.00 za milion tokenów wejściowych, jedno takie wywołanie kosztowałoby około $2.00, więcej niż cały ten przebieg testowy, a pojedyncza próbka niewiele by nam powiedziała. Reklamowany pułap 1M jest więc przez nas niezweryfikowany. A 3.7-Max dorównał 3.8-Max dokładnie przy obu porównywanych rozmiarach, więc odzyskiwanie z długiego kontekstu nie jest tym, co odróżnia tę generację.

Tutaj wyszła na jaw jedna pułapka cenowa, którą doniesienia z premiery całkowicie pomijają. qwen3-max ma warstwowe nadpisania cennika, które podwajają jego stawkę powyżej 32,000 tokenów promptu i podnoszą ją ponownie powyżej 128,000, podczas gdy 3.8-Max i 3.7-Max mają płaską stawkę przy każdej długości. Potwierdziliśmy tę warstwę na podstawie rzeczywistego rozliczenia: nasze wywołanie na 78,255 tokenów do qwen3-max zostało obciążone kwotą $0.12227, czyli stawką $1.56/M, a nie reklamowanym $0.78/M. Przy tej długości kosztuje niemal dokładnie tyle, co 3.7-Max ($0.12523). Jego cena z nagłówka jest niższa niż o połowę. Jego rzeczywista cena przy 80k tokenów to zaokrąglenie w granicach błędu.

Pięć wyników benchmarkowych Alibaby i dlaczego żaden z nich nie jest zweryfikowany

Alibaba opublikowała pięć wyników benchmarkowych wraz z wydaniem GA. Każdy z nich pochodzi z wewnętrznych przebiegów Alibaby i nie znaleźliśmy żadnej niezależnej ewaluacji opublikowanej na dzień 2026-08-04. To zdanie zasługuje na to, by stać obok tych liczb, a nie trzy akapity pod nimi.

BenchmarkWynik zgłoszony przez AlibabęZweryfikowany przez stronę trzecią?
Terminal-Bench 2.186.6Nie, na dzień 2026-08-04
GPQA Diamond92.6Nie, na dzień 2026-08-04
PaperBench93.0Nie, na dzień 2026-08-04
OSWorld-Verified86.1Nie, na dzień 2026-08-04
DeepSWE 1.156.6 (poprzednik: 21.6)Nie, na dzień 2026-08-04

Alibaba zgłosiła też wewnętrzny agregat 0.725, wzrost z 0.474, i pozycjonuje model jako bliski lub przewyższający Claude Opus 4.8, Fable 5 i GPT-5.6 Sol. Pojawiły się też pozycje w rankingach Arena: 5. miejsce w Text Arena i 2. miejsce w Vision Arena według własnego ogłoszenia Alibaby z 2026-08-03, czego nie potwierdziliśmy ponownie na żywym rankingu. Pozycje w Arenie zmieniają się codziennie. Każdą pozycję, którą przeczytasz w tym tygodniu, traktuj jako migawkę z datą.

To, czego nikt jeszcze nie zmierzył, łącznie z nami: przepustowość pod obciążeniem współbieżnym, wydajność w językach innych niż angielski, ewaluacje bezpieczeństwa i dopasowania oraz niezawodność wywoływania narzędzi. Nasze własne liczby obejmują opóźnienie, koszt, modalność i odzyskiwanie z długiego kontekstu na jednej trasie i nic więcej. Raport z premiery Bloomberga powtórzył twierdzenia benchmarkowe bez niezależnego testowania, co jest tam, gdzie zasadniczo znajduje się cała reszta relacji medialnych w tej chwili.

Jeśli chodzi o liczby, które zostały sprawdzone, nasze porównanie Qwen vs DeepSeek vs GLM jest lepszym punktem odniesienia, a Kimi K3 przy około 2.8T jest rywalem wielkościowym, z którym wszyscy porównują ten model.

Qwen3.8 vs Qwen3-8B i odwrócenie polityki otwartych wag stojące za tym wydaniem

Qwen3.8 to flagowy model Alibaby o 2.4 biliona parametrów. Qwen3-8B to gęsty model o 8 miliardach parametrów z serii Qwen3, dostępny do pobrania od 2025 roku. Podobnie brzmiące nazwy, różnica w rozmiarze mniej więcej 300x. Wyszukiwarki wciąż je mylą, podobnie jak zaskakująca liczba odpowiedzi na forach.

Problem z nazewnictwem pogorszył się w tym tygodniu, a nie poprawił. Jedyne rzeczy na Hugging Face noszące nazwę „Qwen3.8" w tej chwili to społecznościowe destylacje 4B. Jeśli szukasz wag i pobierzesz jedną z nich, pobierasz coś, co nie ma żadnego związku z modelem 2.4T.

Dwa zamknięte modele flagowe, a potem to

Obietnica otwartych wag jest tu prawdziwą wiadomością i czyta się ją inaczej, gdy poznasz historię tej rodziny modeli. Alibaba przez dwie generacje z rozmysłem utrzymywała podział: otwarte modele robocze dla wszystkich, zamknięty model flagowy na szczycie.

GeneracjaWagiUwagi
Qwen 3.5 (0.8B do 397B-A17B)Otwarte, Apache 2.0Cała rodzina wydana publicznie
Qwen 3.6 (27B gęsty, 35B-A3B MoE)Otwarte, Apache 2.0Ten sam wzorzec się utrzymał
Qwen3.7-MaxZamkniętyTylko API. Brak GGUF, brak checkpointu na Hugging Face
Qwen3.8-MaxObiecane otwarte, jeszcze nie wydane„W przyszłym tygodniu" według stanu na 2026-08-03. Licencja nieogłoszona

Alibaba zamknęła warstwę flagową przez dwie generacje z rzędu, a teraz twierdzi, że otworzy największy model, jaki kiedykolwiek zbudowała. Jeśli wagi pojawią się zgodnie z obietnicą, to prawdziwe odwrócenie polityki i wywiera presję na każde laboratorium, które traktuje „warstwa frontier zostaje zamknięta" jako sprawę rozstrzygniętą. Jeśli się poślizgną, to będzie trzecie z rzędu zamknięte wydanie Max. Oba scenariusze są na 2026-08-04 wciąż możliwe. Widzieliśmy tę samą dynamikę przy GLM 5.2, gdzie wydana licencja liczyła się bardziej niż ogłoszenie.

Czy możesz uruchomić Qwen3.8-Max samodzielnie? (Wciąż nie)

Nie, a specyfikacja GA czyni to jaśniejszym, a nie mniej jasnym. Przy 2.4 biliona parametrów łącznie to nie jest model, który uruchomisz na własnym sprzęcie, nawet po wydaniu wag. DeepSeek-V3.2 przy 685B jest już opisywany przez ludzi, którzy to zrobili, jako poważny projekt infrastrukturalny. To jest kilka razy większe.

Więc co tak naprawdę daje ci otwarty model 2.4T?

  • Dostawcy inferencji mogą go hostować, co oznacza konkurencję cenową, co oznacza spadek twojego kosztu za token
  • Suwerenne, regulowane i odizolowane od sieci wdrożenia stają się możliwe na tym poziomie po raz pierwszy
  • Badacze i osoby dostrajające modele dostają bazowy model klasy frontier, na którym mogą pracować
  • To nie oznacza, że uruchomisz go na swojej maszynie, swoim jednym A100 czy budżecie GPU swojego startupu

Jeśli chcesz zobaczyć wyliczenia, czego naprawdę wymaga uruchamianie dużych modeli z otwartymi wagami, nasz przewodnik po wymaganiach VRAM dla LLM robi tę matematykę porządnie. Krótka wersja dla tego modelu: nie rób tego.

Czy powinieneś przełączyć się, przetestować czy poczekać?

Twoja sytuacjaCo byśmy zrobili na 2026-08-04
Uruchamiasz Qwen3.7-Max produkcyjniePrzetestuj najpierw 3.8-Max na ruchu z krótkimi promptami. Tam pojawiła się nasza różnica kosztowa 4x. Potem sprawdź obsługę max_tokens pod kątem przypadku pustej odpowiedzi
Obciążenie długiego kontekstu lub ciężkie RAGNa razie zostań przy obecnym rozwiązaniu. 3.8-Max kosztuje 35.6% więcej za token i w naszym teście odzyskiwania dorównał dokładnie 3.7-Max
Potrzebujesz wejścia obrazowego lub wideoTo jest powód, by się przenieść. 3.7-Max w ogóle nie przyjmuje obrazu, a my potwierdziliśmy błąd 404
Czekasz na otwarte wagiZaznacz w kalendarzu 2026-08-10. Nic do zrobienia, dopóki nie ma karty modelu i licencji do przeczytania
Jesteś zadowolony z Claude lub GPTDziś nic się nie zmienia. Wyniki benchmarkowe Alibaby są niezweryfikowane, a niezweryfikowane liczby nie są powodem do migracji

Metoda liczy się bardziej niż werdykt. Każdy model, który testowaliśmy produkcyjnie, zachowywał się inaczej niż wskazywała jego pozycja w rankingu, bo twoje prompty, twoja baza kodu i twoja tolerancja na ponowne próby nie znajdują się w żadnym benchmarku. Dwa zadania kodowe w naszym przebiegu to potwierdzają: 3.8-Max i 3.7-Max oba zdobyły 11 z 11 w zadaniu obcinania szerokości ciągu znaków i oba przeszły 5,000 z 5,000 fuzzowanych przypadków w arytmetyce dat. Pod względem poprawności nie potrafiliśmy ich odróżnić. Różnica, którą zmierzyliśmy, mieści się w opóźnieniu i zużyciu tokenów przy łatwych promptach, a nie w zdolnościach przy trudnych.

Rozważasz migrację i chcesz drugiej pary oczu na model kosztowy? Niech nasz zespół przetestuje go pod presją na twoim obciążeniu.

Wszystkie liczby zweryfikowane 2026-08-04. Cennik, pozycje w rankingach i harmonogram wag zmieniają się często. Nasze pomiary pochodzą z jednej trasy (OpenRouter do Alibaby), jednej maszyny, jednego dnia, przy n=3 dla opóźnień i n=1 dla większości sond funkcjonalnych.

Najczęściej zadawane pytania

Czy Qwen3.8-Max jest open source?

Nie na dzień 2026-08-04. Działa wyłącznie przez API. Alibaba zaplanowała wydanie wag „w przyszłym tygodniu" na Hugging Face i ModelScope i nie ogłosiła jeszcze licencji. Nagłówki nazywające go open source wyprzedzają fakty. Wyszukiwanie na Hugging Face zwraca wyłącznie destylacje 4B stron trzecich, a nie kartę modelu od Alibaby.

Ile kosztuje Qwen3.8-Max?

$2.00 za milion tokenów wejściowych i $6.00 za milion wyjściowych, przy czym cache wejścia raportowany jest jako $0.25. To o 35.6% więcej niż Qwen3.7-Max po obu stronach. Zmierzyliśmy medianę $0.001592 za krótkie zapytanie, mniej więcej 4x taniej niż 3.7-Max na tym samym prompcie, bo emituje znacznie mniej tokenów rozumowania.

Ile parametrów ma Qwen3.8-Max?

2.4 biliona łącznie, według ogłoszenia Alibaby i każdego medium, które to relacjonuje. Liczba aktywnych parametrów jest sporna: SiliconANGLE, The Decoder i Coursiv podają ~95 miliardów aktywnych, podczas gdy MarkTechPost twierdzi, że Alibaba jej nie ujawniła. API nie udostępnia pola z liczbą parametrów, więc nie mogliśmy zweryfikować żadnej z tych liczb.

Jakie okno kontekstowe ma Qwen3.8-Max?

Działające API zgłasza 1,000,000 tokenów kontekstu i maksymalnie 131,072 tokeny odpowiedzi. Testowaliśmy odzyskiwanie do 247,911 tokenów bez żadnych błędów. Nie wykonaliśmy wywołania na 1M tokenów, bo kosztowałoby to około $2.00 i przekroczyło nasz budżet testowy, więc szczyt tego okna jest przez nas niezweryfikowany.

Czy Qwen3.8-Max obsługuje wejście obrazowe i wideo?

Tak, oba, i zweryfikowaliśmy to. Poprawnie odczytał cyfry i kolor z lokalnie wygenerowanego PNG oraz dokładnie opisał wideo, gdy podano URL, który Alibaba mogła pobrać. Qwen3.7-Max całkowicie odrzuca obrazy błędem 404. Dwa z naszych trzech testowych URL-i wideo zawiodły na etapie pobierania przez dostawcę.

Czy wyniki benchmarkowe Qwen3.8-Max są niezależnie zweryfikowane?

Nie. Terminal-Bench 2.1 na poziomie 86.6, GPQA Diamond na 92.6, PaperBench na 93.0, OSWorld-Verified na 86.1 i DeepSWE 1.1 na 56.6 wszystkie pochodzą z wewnętrznych przebiegów Alibaby. Na dzień 2026-08-04 nie znaleźliśmy żadnej ewaluacji od strony trzeciej opublikowanej dla żadnego z nich.

Czy mogę uruchomić Qwen3.8-Max lokalnie?

Realistycznie nie, nawet po wydaniu wag. Przy 2.4 biliona parametrów to kilka razy więcej niż DeepSeek-V3.2, który już sam w sobie jest poważnym projektem infrastrukturalnym do samodzielnego hostowania. Spodziewaj się korzystania z niego przez dostawców inferencji, a nie własne GPU, chyba że prowadzisz centrum danych.

Czy powinienem migrować z Qwen3.7-Max do Qwen3.8-Max?

Zależy od twojej mieszanki tokenów. Przy krótkich promptach zmierzyliśmy 3.8-Max na poziomie mniej więcej jednej czwartej kosztu i cztery do pięciu razy szybciej. Przy obciążeniach z długim wejściem kosztuje o 35.6% więcej i wypadł identycznie w naszym teście odzyskiwania. Jeśli potrzebujesz wejścia obrazowego lub wideo, 3.7-Max w ogóle tego nie potrafi.

Kiedy zostaną wydane wagi Qwen3.8-Max?

Alibaba powiedziała „w przyszłym tygodniu" w swoim ogłoszeniu z 2026-08-03, wskazując Hugging Face i ModelScope jako miejsca docelowe. Brak dokładnej daty i brak tekstu licencji. Towarzyszący model z otwartymi wagami, Qwen3.8-27B, ma zostać wydany razem z nimi, według doniesień. Planujemy ponownie sprawdzić sprawę 2026-08-10.

Tagi

qwen-3-8qwen3-8-maxopen-weight-llmalibaba-qwenllm-tooling

Udostępnij artykuł

Powiązane artykuły

Więcej w ai-machine-learning

ai-machine-learning
Aug 4, 2026

Gitar AI Code Review: Co Naprawdę Kupiła Sonar (Recenzja 2026)

Sonar przejęła Gitar 21 maja 2026 roku. Ta recenzja opisuje, co naprawdę robi autofix Gitar zweryfikowany przez CI, plany za $20 i $40, gdzie wygrywa z CodeRabbit i Greptile oraz szczere powody, by ją pominąć.

10 min czytania min
Czytaj
ai-machine-learning
Aug 3, 2026

Najlepsze praktyki wywoływania narzędzi przez agenta: dlaczego Twój agent wybiera złe narzędzie

Twój agent wybiera złe narzędzie, ponieważ awaria kryje się w czterech konkretnych miejscach: wybór, argumenty, pętle i rozmiar odpowiedzi. Ten przewodnik najpierw diagnozuje każdy tryb awarii, a następnie przypisuje do nich osiem najlepszych praktyk wywoływania narzędzi przez agenta, z kodem, schematami i pętlą ewaluacji, którą uruchomisz przy każdej zmianie.

14 min czytania min
Czytaj
ai-machine-learning
Aug 3, 2026

RAG vs dostrajanie: kiedy użyć którego (z realnymi liczbami)

RAG pobiera fakty w momencie zapytania; dostrajanie wypieka wiedzę w wagach modelu. Badanie arXiv cytowane 162 razy przepuściło oba przez to samo zadanie, a zwycięzca zaskakuje większość zespołów. Oto ramy decyzyjne z prawdziwą matematyką kosztów na publicznych cennikach.

14 min czytania min
Czytaj
Zobacz wszystkie artykuły
Rozpocznij swój projekt

Gotowi, by zbudować coś co Cię wyróżnia?

Zamieńmy Twoją wizję w rzeczywistość. Nasz zespół jest gotowy, by pomóc Ci stworzyć oprogramowanie, które robi różnicę.

Umów 30-minutowe spotkanie wstępneZobacz nasze realizacje

Z naszej biblioteki

Umiejętności Claude

Zobacz wszystkie
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automatyzacje AI

Zobacz wszystkie
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Z naszej biblioteki

Umiejętności Claude

Zobacz wszystkie
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automatyzacje AI

Zobacz wszystkie
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Usługi

  • Rozwiązania Enterprise
  • Aplikacje mobilne
  • Aplikacje webowe

Rozwiązania

  • Systemy CRM
  • Integracja AI
  • Rozwiązania ERP
  • Agenci głosowi
  • Automatyzacja procesów
  • Cyberbezpieczeństwo

Biblioteka

  • Blog
  • Portfel realizacji

Społeczność

  • Automatyzacje AI
  • Umiejętności Claude

Narzędzia

  • Kalkulator kosztów aplikacji mobilnej
  • Kalkulator kosztów API OpenAI / LLM
  • Kalkulator kosztów MVP
  • Kalkulator kosztów agenta Voice AI

Firma

  • O nas
  • Partnerzy
  • Kontakt

Prawne

  • Polityka prywatności
  • Regulamin
  • Polityka cookies

Usługi

  • Rozwiązania Enterprise
  • Aplikacje mobilne
  • Aplikacje webowe

Rozwiązania

  • Systemy CRM
  • Integracja AI
  • Rozwiązania ERP
  • Agenci głosowi
  • Automatyzacja procesów
  • Cyberbezpieczeństwo

Biblioteka

  • Blog
  • Portfel realizacji

Społeczność

  • Automatyzacje AI
  • Umiejętności Claude

Narzędzia

  • Kalkulator kosztów aplikacji mobilnej
  • Kalkulator kosztów API OpenAI / LLM
  • Kalkulator kosztów MVP
  • Kalkulator kosztów agenta Voice AI

Firma

  • O nas
  • Partnerzy
  • Kontakt
PrawnePolityka prywatnościRegulaminPolityka cookies
TECHSY
© 2026 Techsy. Wszystkie prawa zastrzeżone.