
Qwen3.8-Max on julkaistu: 2.4 biljoonaa parametria, 1M konteksti, painot yhä puuttuvat
$1.4728. Sen verran maksoivat 40 live-API-kutsua Qwen3.8-Maxille ja sen kahdelle edeltäjälle 2026-08-04, päivä sen jälkeen kun Alibaba julkaisi mallin. Yllätys ei ollut 2.4 biljoonaa parametria. Yllätys oli tämä: 3.8-Max veloittaa 35.6 % enemmän per token kuin Qwen3.7-Max, mutta on silti noin 4x halvempi per vastaus, koska se lopetti liikaa pohtimisen. Vielä yksi asia, jonka suurin osa julkaisu-uutisoinnista saa väärin. Se ei ole avoimen lähdekoodin malli. Ei vielä tänään.
Tämä artikkeli julkaistiin ensimmäisen kerran 2026-07-19, jolloin Qwen3.8 oli esikatseluversio ilman julkaistuja teknisiä tietoja. Se kirjoitettiin uudelleen 2026-08-04 GA-julkaisun ja omien API-testiemme pohjalta.
Keskeiset havainnot
- 2026-08-04 tilanteen mukaan Qwen3.8-Max on saatavilla vain API:n kautta. Alibaba lupasi painot "ensi viikolla", eli viikolla 2026-08-10, Hugging Faceen ja ModelScopeen.
- Mittasimme $0.001592 per lyhyt kutsu verrattuna $0.006428:aan Qwen3.7-Maxilla, korkeammasta token-hinnasta huolimatta.
- Alibaban viisi vertailuarvoa ovat valmistajan itsensä raportoimia. Emme löytäneet yhtään riippumatonta arviointia julkaistuna 2026-08-04 mennessä.
- Kuva- ja videosyötteet ovat aitoja ja uusia. Vahvistimme molemmat API:a vasten sekä sen kautta, että 3.7-Max kieltäytyi niistä.
Mikä muuttui esikatselusta GA-julkaisuun
Qwen3.8-Max tuli yleisesti saataville 2026-08-03, ja julkaisu vastasi jokaiseen avoimeen kysymykseen, jonka tämä sivu listasi kaksi viikkoa sitten. Esikatseluaika antoi meille parametrimäärän ja lupauksen. GA-julkaisu toi mukanaan vahvistetun 1M-tokenin kontekstiikkunan, teksti- ja kuva- sekä videosyötteen, viisi julkaistua vertailuarvoa ja token-kohtaisen hinnan.
Tässä on vanha lista avoimista kysymyksistä, nyt ratkaistuna:
| Mitä tämä sivu sanoi 2026-07-19 | Tilanne 2026-08-04 |
|---|---|
| Julkaistuja vertailuarvoja: ei yhtään | Viisi Alibaban raportoimaa tulosta julkaistu |
| Aktiiviset parametrit / MoE-kokoonpano: ei paljastettu | Laajalti raportoitu noin 95 miljardia aktiivista, harva MoE. Raportointi on ristiriitaista, katso alla |
| Kontekstiikkuna ja maksimitulos: ei ilmoitettu | 1M sisään, 131,072 ulos, vahvistettu live-API:lla |
| Modaliteetti: ei ilmoitettu | teksti + kuva + video sisään, teksti ulos. Vahvistimme tämän itse |
| Token-kohtainen hinnoittelu: ei eritelty | $2.00 / M syöte, $6.00 / M tuloste |
| Avoimien painojen julkaisupäivä: "pian", ei päivämäärää | "Ensi viikolla", Hugging Face ja ModelScope nimetty |
| Qwen3.8-Max-Preview on nyt käytössä | Esikatselu on ohi. GA julkaistu |
Yksi asia jäi ratkaisematta. Parametrijako on yhä kiistanalainen. MarkTechPostin julkaisu-uutinen toteaa suoraan, ettei Alibaba paljastanut aktiivista parametrimäärää, kun taas SiliconANGLE, The Decoder ja Coursiv kaikki mainitsevat noin 95 miljardia aktiivista. Luimme MarkTechPostin artikkelin uudelleen 2026-08-04, ja siinä sanotaan yhä, ettei tietoa ole paljastettu. Jonkun lähde on väärässä, ja rehellinen tapa kertoa asia on, että tämän tietyn luvun raportointi oli ristiriitaista julkaisupäivänä.
Emme pystyneet vahvistamaan sitä kumpaankaan suuntaan. OpenRouterin /models-vastauksessa ei ole lainkaan parametrimäärä-kenttää, joten mikään testauksessamme ei vahvista tai kumoa lukuja 2.4T yhteensä tai 95B aktiivista.
Onko Qwen3.8-Max avoimen lähdekoodin malli? Ei 2026-08-04
Ei. 2026-08-04 tilanteen mukaan Qwen3.8-Max on saatavilla vain API:n kautta. Alibaba on aikatauluttanut painojen julkaisun "ensi viikolla" Hugging Faceen ja ModelScopeen, eikä ole ilmoittanut lisenssiä. Uutisointi sekoittaa jatkuvasti sanat "saatavilla" ja "avoin", ja juuri tämä ero on koko jutun ydin. Painoja ei ole ladattavissa tänään, mitä otsikot sitten väittävätkin.
Kolme eri tilaa sekoitetaan yhdeksi sanaksi. Ne eivät ole sama asia:
| Tila | Qwen3.8-Max 2026-08-04 |
|---|---|
| Saatavilla API:n kautta | Kyllä. Alibaba Cloud Model Studio sekä jälleenmyyjät ja reitittimet |
| Painot ladattavissa | Ei. Luvattu "ensi viikolla", ei tarkkaa päivämäärää |
| Lisenssiehdot | Ei ilmoitettu. Tekstiä ei ole olemassa luettavaksi |
Tarkistimme kovimman saatavilla olevan todisteen sen sijaan, että olisimme uskoneet ketään sanasta: Hugging Facen haku Qwen3.8:lle 2026-08-04 ei palauta yhtään Alibaban mallikorttia. Sen sijaan se palauttaa neljä yhteisön lataamaa mallia nimeltä Qwen3.8_4B_Distilled ja niiden variantit, jotka ovat kolmannen osapuolen tislauksia, eivät lippulaivamalli. Jos selaat sivua nopeasti, ne on helppo erehtyä luulemaan oikeaksi julkaisuksi.
Vielä huomio lisenssistä, koska ennakkotapaus raportoidaan jatkuvasti sitoumuksena. Sekä Qwen 3.5 että Qwen 3.6 julkaistiin Apache 2.0 -lisenssillä. Rajoittava yhteisölisenssi 2.4T-mallissa olisi teknisesti yhä "avoimet painot", mutta muuttaisi sitä, mitä niillä saa rakentaa. Ennen kuin lisenssitekstiä on olemassa, kuka tahansa joka kertoo mitä näillä painoilla saa tehdä, arvailee. Siksi Qwen3.8-Max ei myöskään ole mukana koosteessamme avoimen lähdekoodin LLM-malleista, joita kannattaa ajaa 2026: se ei vielä täytä ehtoja.
Mitä mittasimme: 4x halvempi per kutsu 35.6 %:n hinnannoususta huolimatta
Ajoimme 40 laskutettua kutsua malleille qwen3.8-max, qwen3.7-max ja qwen3-max OpenRouterin kautta 2026-08-04, kokonaiskulu $1.4728. Jokainen alla oleva kustannus laskettiin palautetusta usage-objektista ja tarkistettiin ristiin OpenRouterin omaa laskutuslukua vasten. Kaikki täsmäsivät. Päälöydös menee hinnanmuutokseen nähden päinvastaiseen suuntaan.
Aloitetaan hinnasta. GET /models-osoitteen live-hinnoittelu 2026-08-04 asettaa 3.8-Maxin hinnaksi $2.00 sisään / $6.00 ulos miljoonaa tokenia kohti, kun 3.7-Max on $1.475 / $4.425. Tämä on 35.6 %:n nousu molemmilla puolilla, ja suhde on identtinen kummallakin tavalla laskettuna (2.000/1.475 = 6.000/4.425 = 1.3559). Voit tarkistaa nykyiset luvut OpenRouterin mallisivulta.
Seuraavaksi sama yksinkertainen kehote lähetettynä kaikille kolmelle mallille, kolme ajoa kummallekin, temperature: 0, striimattuna:
| Malli | Ensimmäinen token (3 ajoa) | Ensimmäinen näkyvä sisältö | Kokonaisaika (3 ajoa) | Tulostetokenit | joista päättelyä | Mediaanihinta/kutsu |
|---|---|---|---|---|---|---|
| qwen3.8-max | 2.249s / 0.874s / 1.054s | 5.414s / 5.058s / 4.209s | 6.338s / 6.734s / 5.130s | 242 / 287 / 243 | 156 / 194 / 157 | $0.001592 |
| qwen3.7-max | 4.871s / 1.157s / 1.670s | ei koskaan / 22.358s / 25.998s | 31.147s / 24.013s / 27.661s | 1502 / 1281 / 1443 | 1500 / 1174 / 1346 | $0.006428 |
| qwen3-max | 2.617s / 2.892s / 2.386s | 2.617s / 2.892s / 2.386s | 4.401s / 4.601s / 4.081s | 105 / 105 / 107 | 0 / 0 / 0 | $0.000431 |
Kaksi erillistä ensimmäinen token -saraketta tarvitaan, koska molemmat päättelymallit striimaavat piilotettua päättelyä ennen mitään varsinaista vastaustekstiä. 3.8-Maxilla token saapuu alle sekunnissa kahdessa kolmesta ajosta, mutta ensimmäinen sana, jonka käyttäjä oikeasti pystyy lukemaan, ilmestyy vasta neljän tai viiden sekunnin päästä. 3.7-Maxin ajossa 1 se ei ilmestynyt lainkaan. Jos rakennat striimaavan käyttöliittymän päättelymallin päälle, latausikoni pyörii kauan sen jälkeen kun yhteys on jo todistetusti elossa.
Lue päättely-sarake kahteen kertaan. Kehotteessa, joka pyysi kolmen lauseen selitystä Bloom-suodattimesta, 3.7-Max käytti 1,174–1,500 päättelytokenia. 3.8-Max käytti 156–194. Se on karkeasti 7x vähemmän pohdintaa samasta vastauksesta, ja päättelytokenit laskutetaan tulostushinnalla. Lopputulos: 3.8-Max on noin 4x halvempi per kutsu ja 4–5 kertaa nopeampi kokonaisajassa meidän koneeltamme mitattuna, verkon edestakainen viive mukaan lukien, vaikka se maksaa 35.6 % enemmän per token. Hintalappu nousi ja lasku laski.
Tämä kääntyy toisin päin, kun kehotteet kasvavat. Live-hinnoittelusta mallinnettuna, ei mitattuna, 30,000 tokenin kutsu 500 tulostetokenilla maksaa $63.00 tuhatta kutsua kohti 3.8-Maxilla ja $46.46 3.7-Maxilla. 100,000 syötetokenilla se on $203.00 vastaan $149.71. Kun suurin osa tokeneistasi on syötettä, päättelytehokkuuden etu ei enää kata hinnannousua, ja 3.8-Maxista tulee kolmesta kallein. Mikä malli on halvin, riippuu aidosti syöte-tuloste-suhteestasi, ja se on sama opetus, johon LLM API -hinnoitteluvertailumme päätyy toistuvasti.
reasoning_effort on uusi, ja 3.7-Max jättää sen hiljaa huomiotta
reasoning_effort löytyy 3.8-Maxin tuetuista parametreista, mutta ei 3.7-Maxin. 3.8-Maxilla se vaikuttaa maltillisesti: kolmen ajon yli minimal tuotti 67, 108 ja 124 päättelytokenia, kun high tuotti 163, 136 ja 173. Mediaanit 108 vastaan 163, samalla kehotteella, lämpötilassa 0.
Se löydös, joka maksaa rahaa, koskee vanhempaa mallia. reasoning_effort: "low"-arvon lähettäminen 3.7-Maxille hyväksytään pikemminkin kuin hylätään, ja sitten se jätetään huomiotta: kyseinen kutsu poltti silti 1,401 päättelytokenia ja laskutti saman $0.006689 kuin identtisen muotoinen kutsu, jonka kirjasimme. Ei virhettä, ei varoitusta, ei vaikutusta. Jos säädät kustannuksia laskemalla päättelyn tehoa, varmista että se todella tekee jotain sillä mallilla, jota oikeasti kutsut, koska tukematon parametri epäonnistuu täällä hiljaa eikä äänekkäästi.
Tyhjän vastauksen ansa, joka kannattaa tarkistaa ennen migraatiota
Ensimmäinen testiajomme käytti arvoa max_tokens: 400 ja kaatoi oman skriptimme. Syy osoittautui testiä arvokkaammaksi. Qwen3.7-Max voi käyttää koko token-budjettinsa päättelyyn ja palauttaa tyhjän merkkijonon, arvolla finish_reason: "length", täysimääräisesti laskutettuna.
Törmäsimme siihen kolme erillistä kertaa. Arvolla max_tokens: 400: 402 tulostetokenia, joista 400 päättelyä, nolla vastausmerkkiä, $0.001822 laskutettu. Arvolla max_tokens: 1500: 1,502 tokenia, 1,500 päättelyä, nolla merkkiä, $0.006689 tyhjästä. Ja vielä kerran myöhemmässä kutsussa, $0.006735. Ei virhettä, ei poikkeusta, vain sujuvan näköinen vastausobjekti jossa on tyhjä content-merkkijono.
Jos olet migroimassa olemassa olevaa 3.7-Max-integraatiota ja koodisi asettaa vaatimattoman max_tokens-arvon, varaa aikaa tämän polun testaamiseen. 3.8-Maxin huomattavasti lyhyempi päättely tekee siitä merkittävästi vähemmän altis tälle. Se ei kuitenkaan ole immuuni.
Pieni token-yleiskulu, josta kukaan ei puhu
Sama 12 sanan kehote laski 67 syötetokenia 3.8-Maxilla ja 29 3.7-Maxilla, johdonmukaisesti joka ajossa (27 mallilla qwen3-max). Se on karkeasti 38 tokenia kiinteää yleiskulua, oletettavasti suuremman järjestelmä- tai chat-mallipohjan takia. 100,000 tokenin RAG-kutsulla se pyöristyy olemattomaksi. Suurivolyymisessä luokittelijassa, joka ampuu lyhyitä kehotteita, se enemmän kuin tuplaa syötelaskusi ennen kuin olet kirjoittanut sanaakaan.
Hyväksyykö Qwen3.8-Max todella kuvia ja videota?
Kyllä, ja multimodaalinen syöte on aidosti uutta tässä sukupolvessa, ei vain uudelleenmerkintää. API ilmoittaa text+image+video->text 3.8-Maxille ja pelkän tekstin 3.7-Maxille. Vahvistimme eron lähettämällä saman kuvan molemmille, ja vanhempi malli hylkäsi sen jo reititystasolla.
Generoimme testikuvan paikallisesti itse kirjoitetulla PNG-enkooderilla, jotta oikea vastaus tiedettiin jo rakenteen perusteella: 750x270 pikseliä, mustat lohkonumerot 4739 valkoisella pohjalla, punainen vaakapalkki yläreunassa. Base64-koodattuna lähetettynä qwen3.8-max palautti DIGITS: 4739 ja TOPBAR: red. Oikein molemmilta osin, 6.99s, $0.002146. Identtinen pyyntö mallille qwen3.7-max palautti vastauksen HTTP 404 {"error":{"message":"No endpoints found that support image input"}}.
Video toimii myös, mutta yhdellä varauksella, jonka lähes raportoimme virheenä. Kaksi kolmesta kokeilemastamme julkisesta MP4-osoitteesta palautti HTTP 400 "Failed to download multimodal content". Kyse on siitä, että Alibaba ei onnistunut hakemaan tiedostoa, ei siitä, että reitti kieltäytyisi videosta. Osoitteella, jonka se pystyi hakemaan, 3.8-Max kuvaili Big Buck Bunny -pätkän tarkasti, hahmon nimeäminen mukaan lukien, ajassa 24.24s hintaan $0.006528.
Kaksi käytännön huomiota ennen kuin rakennat tämän varaan. Video laskutettiin 696 tavallisena syötetokenina noin 10 sekunnin pätkästä, ja usage.prompt_tokens_details.video_tokens ilmoitti arvon 0, joten et pysty erottamaan videokustannusta siitä kentästä. Ja väärin muotoiltu sisältöosa epäonnistuu hiljaa: {"type": "video", "video": [url]}:n lähettäminen video_url:n sijaan palautti HTTP 200:n, jossa malli kohteliaasti kertoi ettei nähnyt mitään videota, sekä laskun. Käytä video_url.
Hyvä tietää: kun pyysimme 3.8-Maxia kuvailemaan omia kykyjään, se vastasi Input modalities: text. Se on väärin, kuten seuraava testi omassa ajossamme osoitti. Mallin oma kuvaus itsestään on kielimallin tuloste, ei tekninen tietolomake.
Kuinka hyvin 1M-tokenin kontekstiikkuna kestää?
Istutimme kolme yksilöllistä faktaa syvyyksille 10 %, 50 % ja 90 % generoituun täytetekstiin ja pyysimme kaikkia kolmea yhdessä kutsussa. 18 neulasta 18:sta palautui oikein kuudessa ajossa kahdella mallilla, kehotekoossa 5,723:sta aina 247,911 tokeniin, arvioituna koodissa tehtävällä tarkalla merkkijonovastaavuudella eikä lukemalla vastauksia.
qwen3.8-max-ajomme (myös kaksi qwen3.7-max-ajoa 83,380 ja 247,873 tokenilla, sekä yksi qwen3-max-ajo 78,255 tokenilla, palauttivat jokaisen neulan):
| Syötetokenit (qwen3.8-max) | Viive | Kustannus | Löydetyt neulat |
|---|---|---|---|
| 5,723 | 9.24s | $0.01409 | 3/3 |
| 25,703 | 13.43s | $0.05453 | 3/3 |
| 83,418 | 17.63s | $0.16965 | 3/3 |
| 247,911 | 38.54s | $0.49828 | 3/3 |
Viive skaalautuu alilineaarisesti, mikä on käytännössä hyödyllisin osa: 43x enemmän syötetokeneita maksaa vain 4.2x enemmän kokonaisaikaa.
Nyt rehelliset rajoitukset, koska tämä on pitkän kontekstin arvioinnin helpoin pää. Sanatarkan istutetun faktan hakeminen kertoo hyvin vähän päättelystä laajan dokumentin yli, ja testasimme jokaisen koon vain kerran. Emme ajaneet 1M-tokenin kutsua. $2.00 hinnalla miljoonaa syötetokenia kohti yksi olisi maksanut noin $2.00, enemmän kuin koko tämä testiajo, eikä yksi näyte olisi kertonut meille paljon. Mainostettu 1M-katto on siis meidän puoleltamme vahvistamaton. Ja 3.7-Max vastasi 3.8-Maxia tarkalleen molemmissa vertailemissamme kooissa, joten pitkän kontekstin haku ei ole se, missä tämä sukupolvi erottuu.
Tässä paljastui yksi hinnoitteluansa, jonka julkaisu-uutisointi ohittaa täysin. qwen3-max:lla on porrastettuja hinnoittelun ylikirjoituksia, jotka tuplaavat sen hinnan yli 32,000 syötetokenin ja nostavat sitä taas yli 128,000:n kohdalla, kun taas 3.8-Max ja 3.7-Max ovat tasahintaisia jokaisella pituudella. Vahvistimme portaan todellisesta laskutuksesta: 78,255 tokenin kutsumme mallille qwen3-max laskutettiin $0.12227, eli $1.56/M-hinnalla, ei $0.78/M-otsikkohinnalla. Tuolla pituudella se maksaa lähes tarkalleen saman kuin 3.7-Max ($0.12523). Sen otsikkohinta on alle puolet. Sen todellinen hinta 80k tokenin kohdalla on pyöristysvirheen päässä.
Alibaban viisi vertailuarvoa, ja miksi yhtäkään niistä ei ole vahvistettu
Alibaba julkaisi viisi vertailuarvoa GA-julkaisun yhteydessä. Jokainen niistä tulee Alibaban omista sisäisistä ajoista, ja emme löytäneet yhtään riippumatonta arviointia julkaistuna 2026-08-04 mennessä. Tämä lause ansaitsee paikkansa lukujen vieressä, ei kolme kappaletta niiden alapuolella.
| Vertailuarvo | Alibaban raportoima tulos | Kolmannen osapuolen vahvistama? |
|---|---|---|
| Terminal-Bench 2.1 | 86.6 | Ei, 2026-08-04 tilanteen mukaan |
| GPQA Diamond | 92.6 | Ei, 2026-08-04 tilanteen mukaan |
| PaperBench | 93.0 | Ei, 2026-08-04 tilanteen mukaan |
| OSWorld-Verified | 86.1 | Ei, 2026-08-04 tilanteen mukaan |
| DeepSWE 1.1 | 56.6 (edeltäjä: 21.6) | Ei, 2026-08-04 tilanteen mukaan |
Alibaba raportoi myös sisäisen kokonaisarvon 0.725, nousten arvosta 0.474, ja asemoi mallin lähelle tai yli Claude Opus 4.8:n, Fable 5:n ja GPT-5.6 Sol:n tason. Myös areenasijoituksia kierteli: 5. sija Text Arenassa ja 2. sija Vision Arenassa Alibaban oman 2026-08-03 ilmoituksen mukaan, jota emme ole vahvistaneet uudelleen live-tulostaulusta. Areenasijoitukset muuttuvat päivittäin. Suhtaudu mihin tahansa tällä viikolla lukemaasi sijoitukseen hetkellisenä tilannekuvana, jolla on päivämäärä.
Mitä kukaan ei ole vielä mitannut, meidät mukaan lukien: läpimeno rinnakkaiskuormituksessa, suoriutuminen muilla kielillä kuin englanniksi, turvallisuus- ja alignment-arvioinnit sekä työkalukutsujen luotettavuus. Omat lukumme kattavat viiveen, kustannuksen, modaliteetin ja pitkän kontekstin haun yhdellä reitillä, eikä mitään muuta. Bloombergin julkaisuraportti toisti vertailuarvoväitteet ilman riippumatonta testausta, ja siihen käytännössä koko uutisointi tällä hetkellä pysähtyy.
Tarkistettuja lukuja varten Qwen vs. DeepSeek vs. GLM -vertailumme on parempi lähde, ja Kimi K3, noin 2.8T kokoinen, on se kokorivali johon tätä verrataan lähes aina.
Qwen3.8 vs. Qwen3-8B, ja tämän julkaisun taustalla oleva avoimien painojen käänne
Qwen3.8 on Alibaban 2.4 biljoonan parametrin lippulaivamalli. Qwen3-8B on tiheä 8 miljardin parametrin malli Qwen3-sarjasta, ladattavissa vuodesta 2025 lähtien. Samannäköiset nimet, mutta koossa ero on karkeasti 300x. Hakukoneet sekoittavat ne yhä keskenään, kuten myös yllättävän moni foorumivastaus.
Nimeämisongelma paheni tällä viikolla, ei parantunut. Ainoat asiat Hugging Facessa, joilla on tällä hetkellä "Qwen3.8"-nimi, ovat yhteisön 4B-tislaukset. Jos etsit painoja ja nappaat yhden niistä, lataat jotain, jolla ei ole mitään yhteyttä 2.4T-malliin.
Kaksi suljettua lippulaivaa, ja sitten tämä
Avoimien painojen lupaus on tämän jutun oikea uutinen, ja se näyttäytyy toisin, kun näkee mallisukupolven historian. Alibaba on ajanut kahden sukupolven ajan tietoista kahtiajakoa: avoimien painojen työjuhtia kaikille, suljettu lippulaiva huipulla.
| Sukupolvi | Painot | Huomiot |
|---|---|---|
| Qwen 3.5 (0.8B - 397B-A17B) | Avoin, Apache 2.0 | Koko malliperhe julkaistiin julkisesti |
| Qwen 3.6 (27B tiheä, 35B-A3B MoE) | Avoin, Apache 2.0 | Sama kaava piti |
| Qwen3.7-Max | Suljettu | Vain API. Ei GGUF:ia, ei Hugging Face -tarkistuspistettä |
| Qwen3.8-Max | Luvattu avoimeksi, ei vielä julkaistu | "Ensi viikolla" 2026-08-03 tilanteen mukaan. Lisenssi ei ilmoitettu |
Alibaba piti lippulaivatason suljettuna kaksi sukupolvea putkeen, ja väittää nyt avaavansa suurimman koskaan rakentamansa mallin. Jos painot ilmestyvät luvatusti, se on todellinen käänne ja asettaa paineita jokaiselle laboratoriolle, joka on pitänyt "kärkitaso pysyy suljettuna" -ajattelua itsestäänselvyytenä. Jos ne myöhästyvät, tästä tulee kolmas suljettu Max-julkaisu peräkkäin. Molemmat lopputulokset ovat mahdollisia 2026-08-04. Näimme saman dynamiikan GLM 5.2:n kohdalla, jossa toteutunut lisenssi merkitsi lopulta enemmän kuin itse ilmoitus.
Voitko ajaa Qwen3.8-Maxia itse? (Ei yhä edelleenkään)
Ei, ja GA-tekniset tiedot tekevät siitä selvempää, ei epäselvempää. 2.4 biljoonan kokonaisparametrin kokoisena tämä ei ole malli, jota ajat omalla laitteistollasi, edes sen jälkeen kun painot julkaistaan. DeepSeek-V3.2:ta, 685B kokoista, kuvailevat sen itse ajaneet jo vakavaksi infrastruktuuriprojektiksi. Tämä on useita kertoja sitä suurempi.
Mitä avoimien painojen 2.4T-malli sitten oikeasti tuo tullessaan?
- Inferenssipalveluntarjoajat voivat isännöidä sitä, mikä tarkoittaa hintakilpailua, mikä tarkoittaa alenevaa token-kohtaista kustannusta sinulle
- Suvereenit, säännellyt ja verkosta eristetyt käyttöönotot tulevat mahdollisiksi tällä tasolla ensimmäistä kertaa
- Tutkijat ja hienosäätäjät saavat kärkitason perustamallin, josta lähteä liikkeelle
- Se ei tarkoita, että se toimisi omalla koneellasi, yhdellä A100:llasi tai startupisi GPU-budjetilla
Jos haluat laskelmat siitä, mitä suurten avoimien painojen mallien ajaminen todella vaatii, LLM VRAM -vaatimusoppaamme tekee sen laskun kunnolla. Lyhyt versio tälle mallille: älä.
Kannattaako vaihtaa, testata vai odottaa?
| Tilanteesi | Mitä me tekisimme 2026-08-04 |
|---|---|
| Ajat Qwen3.7-Maxia tuotannossa | Testaa 3.8-Maxia ensin lyhyiden kehotteiden liikenteellä. Siellä 4x kustannusero näkyi. Tarkista sen jälkeen max_tokens-käsittelysi tyhjän vastauksen tapausta varten |
| Pitkän kontekstin tai raskas RAG-kuorma | Pysy toistaiseksi paikallasi. 3.8-Max maksaa 35.6 % enemmän per token ja vastasi 3.7-Maxia tarkalleen hakutestissämme |
| Tarvitset kuva- tai videosyötettä | Tämä on syy vaihtaa. 3.7-Max ei ota kuvaa vastaan lainkaan, ja vahvistimme 404:n |
| Odotat avoimia painoja | Merkitse kalenteriin 2026-08-10. Ei mitään tehtävää ennen kuin on mallikortti ja luettava lisenssi |
| Tyytyväinen Claudeen tai GPT:hen | Mikään ei muutu tänään. Alibaban vertailuarvot ovat vahvistamattomia, eivätkä vahvistamattomat luvut ole syy migraatiolle |
Menetelmä merkitsee enemmän kuin lopputulos. Jokainen malli, jonka olemme tuotannossa testanneet, on käyttäytynyt eri tavalla kuin sen tulostaulusijoitus antaisi olettaa, koska omat kehotteesi, koodikantasi ja sietokykysi uusintayrityksille eivät ole kenenkään vertailuarvossa. Kaksi koodaustehtävää ajossamme havainnollistavat asian: sekä 3.8-Max että 3.7-Max saivat 11/11 merkkijonon leveyden katkaisutehtävässä, ja molemmat läpäisivät 5,000/5,000 satunnaistettua tapausta päivämäärälaskennassa. Oikeellisuudessa emme pystyneet erottamaan niitä toisistaan. Mittaamamme ero asuu viiveessä ja token-kulutuksessa helpoilla kehotteilla, ei kyvykkyydessä vaikeilla.
Punnitsetko migraatiota ja haluat toisen parin silmiä kustannusmalliin? Anna tiimimme rasitustestata se sinun kuormallasi.
Kaikki luvut vahvistettu 2026-08-04. Hinnoittelu, areenasijoitukset ja painojen aikataulu muuttuvat usein. Mittauksemme tulevat yhdeltä reitiltä (OpenRouterista Alibabaan), yhdeltä koneelta, yhdeltä päivältä, n=3 viiveelle ja n=1 useimmille toiminnallisille kokeille.
Usein kysytyt kysymykset
Onko Qwen3.8-Max avoimen lähdekoodin malli?
Ei 2026-08-04. Se on saatavilla vain API:n kautta. Alibaba on aikatauluttanut painot "ensi viikolle" Hugging Faceen ja ModelScopeen, eikä ole ilmoittanut lisenssiä. Otsikot, jotka kutsuvat sitä avoimen lähdekoodin malliksi, ovat faktojen edellä. Hugging Facen haku palauttaa vain kolmannen osapuolen 4B-tislauksia, ei Alibaban mallikorttia.
Paljonko Qwen3.8-Max maksaa?
$2.00 miljoonaa syötetokenia kohti ja $6.00 miljoonaa tulostetokenia kohti, ja välimuistiin tallennettu syöte on ilmoitettu hintaan $0.25. Se on 35.6 % enemmän kuin Qwen3.7-Max molemmilla puolilla. Mittasimme mediaanikustannukseksi $0.001592 lyhyttä kutsua kohti, karkeasti 4x halvemman kuin 3.7-Max samalla kehotteella, koska se tuottaa huomattavasti vähemmän päättelytokeneita.
Kuinka monta parametria Qwen3.8-Maxissa on?
2.4 biljoonaa yhteensä, Alibaban ilmoituksen ja kaikkien aiheesta uutisoineiden mukaan. Aktiivinen määrä on kiistanalainen: SiliconANGLE, The Decoder ja Coursiv raportoivat noin 95 miljardia aktiivista, kun taas MarkTechPost sanoo, ettei Alibaba paljastanut sitä. API ei paljasta parametrikenttää, joten emme pystyneet vahvistamaan kumpaakaan lukua.
Millainen kontekstiikkuna Qwen3.8-Maxissa on?
Live-API ilmoittaa 1,000,000 tokenin kontekstin ja 131,072 tokenin maksimitulosteen. Testasimme hakua aina 247,911 tokeniin asti ilman epäonnistumisia. Emme ajaneet 1M-tokenin kutsua, koska se olisi maksanut noin $2.00 ja ylittänyt testibudjettimme, joten ikkunan yläraja on meidän puoleltamme vahvistamaton.
Tukeeko Qwen3.8-Max kuva- ja videosyötettä?
Kyllä molempiin, ja vahvistimme molemmat. Se luki numerot ja värin oikein paikallisesti generoidusta PNG-kuvasta, ja kuvaili videon tarkasti, kun sille annettiin osoite, jonka Alibaba pystyi hakemaan. Qwen3.7-Max hylkää kuvat suoralta kädeltä 404-virheellä. Kaksi kolmesta testivideo-osoitteestamme epäonnistui palveluntarjoajan latausvaiheessa.
Onko Qwen3.8-Maxin vertailuarvot vahvistettu riippumattomasti?
Ei. Terminal-Bench 2.1:n tulos 86.6, GPQA Diamondin 92.6, PaperBenchin 93.0, OSWorld-Verifiedin 86.1 ja DeepSWE 1.1:n 56.6 tulevat kaikki Alibaban sisäisistä ajoista. 2026-08-04 mennessä emme löytäneet yhdellekään niistä julkaistua kolmannen osapuolen arviointia.
Voinko ajaa Qwen3.8-Maxia paikallisesti?
Realistisesti et, edes sen jälkeen kun painot julkaistaan. 2.4 biljoonan parametrin kokoisena se on useita kertoja DeepSeek-V3.2:n kokoinen, joka on jo itsessään aito infrastruktuuriprojekti itse isännöitäväksi. Odota käyttäväsi sitä inferenssipalveluntarjoajien kautta oman GPU-kalustosi sijaan, ellet operoi konesalia.
Kannattaako minun migroida Qwen3.7-Maxista Qwen3.8-Maxiin?
Riippuu token-jakaumastasi. Lyhyillä kehotteilla mittasimme 3.8-Maxin noin neljäsosaan kustannuksesta ja neljä-viisi kertaa nopeammaksi. Pitkän syötteen kuormissa se maksaa 35.6 % enemmän ja suoriutui identtisesti hakutestissämme. Jos tarvitset kuva- tai videosyötettä, 3.7-Max ei pysty siihen lainkaan.
Milloin Qwen3.8-Maxin painot julkaistaan?
Alibaba sanoi "ensi viikolla" 2026-08-03-ilmoituksessaan ja nimesi Hugging Facen ja ModelScopen kohteiksi. Ei tarkkaa päivämäärää, ei lisenssitekstiä. Rinnakkaisen avoimien painojen mallin, Qwen3.8-27B, kerrotaan julkaistavan niiden ohella. Aiomme tarkistaa tilanteen uudelleen 2026-08-10.