
$1.4728. Det er hva 40 live API-kall mot Qwen3.8-Max og dens to forgjengere kostet oss 2026-08-04, dagen etter at Alibaba lanserte den. Overraskelsen var ikke de 2.4 billioner parameterne. Det var dette: 3.8-Max tar 35.6% mer per token enn Qwen3.7-Max og endte likevel opp rundt 4x billigere per svar, fordi den sluttet å overtenke. Én ting til som mesteparten av lanseringsdekningen får feil. Den er ikke åpen kildekode. Ikke i dag.
Dette innlegget ble først publisert 2026-07-19, da Qwen3.8 var en forhåndsvisning uten publiserte spesifikasjoner. Det ble skrevet om 2026-08-04 mot GA-lanseringen og våre egne API-tester.
Viktige punkter
- Per 2026-08-04 er Qwen3.8-Max kun tilgjengelig via API. Alibaba lovet vektene «neste uke», altså uken som starter 2026-08-10, på Hugging Face og ModelScope.
- Vi målte $0.001592 per kort kall mot $0.006428 på Qwen3.7-Max, til tross for en høyere pris per token.
- Alibabas fem benchmarkscorer er leverandørrapporterte. Vi fant ingen uavhengig evaluering publisert per 2026-08-04.
- Bilde- og videoinput er ekte og nytt. Vi verifiserte begge deler mot API-et og mot 3.7-Maxs avvisning.
Hva som endret seg mellom forhåndsvisningen og GA
Qwen3.8-Max ble allment tilgjengelig 2026-08-03, og lanseringen besvarte hvert åpne spørsmål denne siden listet for to uker siden. Forhåndsvisnings-æraen ga oss et parametertall og et løfte. GA-lanseringen la til et bekreftet kontekstvindu på 1M tokens, tekst pluss bilde pluss video som input, fem publiserte benchmarkscorer og en pris per token.
Her er det gamle registeret over ukjente, nå løst:
| Hva denne siden sa 2026-07-19 | Status 2026-08-04 |
|---|---|
| Enhver publisert benchmarkscore: ingen | Fem Alibaba-rapporterte scorer publisert |
| Aktive parametere / MoE-konfigurasjon: ikke opplyst | Bredt rapportert som ~95B aktive, sparsom MoE. Rapporteringen spriker, se under |
| Kontekstvindu og maks output: ikke annonsert | 1M inn, 131,072 ut, bekreftet av det live API-et |
| Modalitet: ikke annonsert | tekst + bilde + video inn, tekst ut. Vi verifiserte dette selv |
| Pris per token: ikke spesifisert | $2.00 / M inn, $6.00 / M ut |
| Dato for åpne vekter: «snart», ingen dato | «Neste uke», Hugging Face og ModelScope navngitt |
| Qwen3.8-Max-Preview er live nå | Forhåndsvisningen er over. GA er lansert |
Ett punkt ble ikke løst. Fordelingen av parametere er fortsatt omstridt. MarkTechPosts lanseringsartikkel sier rett ut at det aktive parametertallet ikke ble opplyst av Alibaba, mens SiliconANGLE, The Decoder og Coursiv alle oppgir ~95 milliarder aktive. Vi leste MarkTechPost-artikkelen på nytt 2026-08-04, og den sier fortsatt ikke opplyst. Noens kildegrunnlag er feil, og det ærlige svaret er at rapporteringen om dette spesifikke tallet sprikte på lanseringsdagen.
Vi kunne ikke verifisere det i noen retning. OpenRouters /models-respons eksponerer ikke noe felt for parametertall i det hele tatt, så ingenting i testingen vår bekrefter eller avkrefter 2.4T totalt eller 95B aktive.
Er Qwen3.8-Max åpen kildekode? Ikke per 4. august
Nei. Per 2026-08-04 er Qwen3.8-Max kun tilgjengelig via API. Alibaba har planlagt vektene for utgivelse «neste uke» på Hugging Face og ModelScope, og har ikke annonsert noen lisens. Dekningen fortsetter å smelte «tilgjengelig» sammen med «åpen», og det skillet er hele saken. Det finnes ingen vekter å laste ned i dag, uansett hva en overskrift sier.
Tre tilstander blir smeltet sammen til ett ord. De er ikke det samme:
| Tilstand | Qwen3.8-Max per 2026-08-04 |
|---|---|
| Tilgjengelig via API | Ja. Alibaba Cloud Model Studio, pluss forhandlere og rutere |
| Vekter nedlastbare | Nei. Lovet «neste uke», ingen dato oppgitt |
| Lisensvilkår | Ikke annonsert. Ingen tekst finnes å lese |
Vi sjekket det hardeste tilgjengelige beviset i stedet for å ta noens ord for det: et Hugging Face-søk etter Qwen3.8 på 2026-08-04 returnerer ingen Alibaba-modellkort. Det som kommer opp, er fire fellesskapsopplastninger kalt Qwen3.8_4B_Distilled og varianter, som er tredjeparts-destillater, ikke flaggskipet. Hvis du skanner den siden raskt, er det lett å forveksle dem med den faktiske utgivelsen.
Et notat om lisensen, fordi presedens fortsetter å bli rapportert som forpliktelse. Qwen 3.5 og Qwen 3.6 ble begge levert under Apache 2.0. En restriktiv fellesskapslisens på 2.4T ville fortsatt teknisk sett være «åpne vekter», samtidig som den endrer hva du faktisk får lov til å bygge med dem. Frem til det finnes lisenstekst, gjetter alle som forteller deg hva du kan gjøre med disse vektene. Det er også grunnen til at Qwen3.8-Max ikke er med i vår oversikt over åpen kildekode-LLM-er verdt å kjøre i 2026: den kvalifiserer ikke ennå.
Hva vi målte: 4x billigere per kall til tross for en prisøkning på 35.6%
Vi kjørte 40 fakturerte kall mot qwen3.8-max, qwen3.7-max og qwen3-max gjennom OpenRouter 2026-08-04, totalt forbruk $1.4728. Hver kostnad under er beregnet fra det returnerte usage-objektet og krysssjekket mot OpenRouters eget fakturerte tall. Alle stemte. Hovedfunnet går motsatt vei av prisendringen.
Start med prisen. Live priser fra GET /models 2026-08-04 setter 3.8-Max til $2.00 inn / $6.00 ut per million tokens mot 3.7-Max på $1.475 / $4.425. Det er en økning på 35.6% på begge sider, og forholdstallet er identisk begge veier (2.000/1.475 = 6.000/4.425 = 1.3559). Du kan krysssjekke de gjeldende tallene på OpenRouters modellside.
Nå den samme trivielle prompten sendt til alle tre modellene, tre kjøringer hver, temperature: 0, strømmet:
| Modell | Første token (3 kjøringer) | Første synlige innhold | Klokketid (3 kjøringer) | Fullførings-tokens | herav resonnering | Median kostnad/kall |
|---|---|---|---|---|---|---|
| qwen3.8-max | 2.249s / 0.874s / 1.054s | 5.414s / 5.058s / 4.209s | 6.338s / 6.734s / 5.130s | 242 / 287 / 243 | 156 / 194 / 157 | $0.001592 |
| qwen3.7-max | 4.871s / 1.157s / 1.670s | aldri / 22.358s / 25.998s | 31.147s / 24.013s / 27.661s | 1502 / 1281 / 1443 | 1500 / 1174 / 1346 | $0.006428 |
| qwen3-max | 2.617s / 2.892s / 2.386s | 2.617s / 2.892s / 2.386s | 4.401s / 4.601s / 4.081s | 105 / 105 / 107 | 0 / 0 / 0 | $0.000431 |
To separate kolonner for første token er nødvendige fordi begge resonneringsmodellene strømmer skjult resonnering før noen svartekst. På 3.8-Max ankommer et token på under ett sekund i to av tre kjøringer, men det første ordet en bruker faktisk kan lese, lander fire til fem sekunder senere. På 3.7-Max kjøring 1 landet det aldri i det hele tatt. Bygger du et strømmende grensesnitt mot en resonneringsmodell, fortsetter spinneren å spinne lenge etter at forbindelsen har bevist at den er i live.
Les resonneringskolonnen to ganger. På en prompt som ber om en tresetnings forklaring av et Bloom-filter, brukte 3.7-Max mellom 1,174 og 1,500 resonnerings-tokens. 3.8-Max brukte 156 til 194. Det er omtrent 7x mindre tenking for det samme svaret, og resonnerings-tokens faktureres til utrate. Resultatet: 3.8-Max er omtrent 4x billigere per kall og 4 til 5 ganger raskere på klokketid fra vår maskin, nettverksrundtur inkludert, samtidig som den koster 35.6% mer per token. Listeprisen gikk opp, og regningen gikk ned.
Det snur når promptene vokser. Modellert fra live priser fremfor målt, koster et kall på 30,000 input-tokens med 500 output-tokens $63.00 per tusen kall på 3.8-Max mot $46.46 på 3.7-Max. Ved 100,000 input-tokens er det $203.00 mot $149.71. Når mesteparten av tokenene dine er input, slutter resonneringseffektiviteten å betale for prisøkningen, og 3.8-Max blir den dyreste av de tre. Hvilken modell som er billigst, avhenger genuint av forholdet ditt mellom input og output, som er samme lærdom vår sammenligning av LLM API-priser fortsetter å lande på.
reasoning_effort er nytt, og 3.7-Max ignorerer det stille
reasoning_effort finnes blant 3.8-Maxs støttede parametere, men ikke blant 3.7-Maxs. På 3.8-Max flytter den nålen moderat: over tre kjøringer hver ga minimal 67, 108 og 124 resonnerings-tokens mot high på 163, 136 og 173. Median 108 mot 163, på samme prompt, ved temperatur 0.
Funnet som koster penger, er på den eldre modellen. Å sende reasoning_effort: "low" til 3.7-Max aksepteres i stedet for å avvises, og blir så ignorert: det kallet brukte fortsatt 1,401 resonnerings-tokens, og fakturerte de samme $0.006689 som det identisk formede kallet vi loggførte. Ingen feil, ingen advarsel, ingen effekt. Justerer du kostnad ved å senke resonneringsinnsatsen, verifiser at det faktisk gjør noe på modellen du kaller, for her feiler en ustøttet parameter stille i stedet for høylytt.
Tom-svar-fellen du bør sjekke før du migrerer
Vår første testkjøring brukte max_tokens: 400 og krasjet vårt eget skript. Årsaken viste seg å være verdt mer enn testen. Qwen3.7-Max kan bruke hele token-budsjettet sitt på resonnering og returnere en tom streng, med finish_reason: "length", fakturert i sin helhet.
Vi traff den tre separate ganger. Ved max_tokens: 400: 402 fullførings-tokens, 400 av dem resonnering, null svartegn, $0.001822 fakturert. Ved max_tokens: 1500: 1,502 tokens, 1,500 resonnering, null tegn, $0.006689 for ingenting. Og enda en gang på et senere kall, $0.006735. Ingen feil, intet unntak, bare et flytende utseende svarobjekt med en tom innholdsstreng.
Migrerer du en eksisterende 3.7-Max-integrasjon, og koden din setter en beskjeden max_tokens, sett av tid til å teste denne stien. 3.8-Maxs mye kortere resonnering gjør den betydelig mindre utsatt. Den er ikke immun.
En liten token-overhead ingen nevner
Den identiske 12-ords prompten talte 67 prompt-tokens på 3.8-Max og 29 på 3.7-Max, konsekvent over hver kjøring (27 på qwen3-max). Det er omtrent 38 tokens fast overhead, antagelig en større system- eller chat-mal. På et RAG-kall på 100,000 tokens rundes det til null. På en høyvolums klassifiserer som fyrer av korte prompter, mer enn dobler det inputregningen din før du har skrevet et ord.
Godtar Qwen3.8-Max virkelig bilder og video?
Ja, og multimodal input er genuint nytt i denne generasjonen, ikke en omdøping. API-et rapporterer text+image+video->text for 3.8-Max og kun tekst for 3.7-Max. Vi verifiserte forskjellen ved å sende det samme bildet til begge, og den eldre modellen avviste det på rutingsnivå.
Vi genererte testbildet lokalt med en håndskrevet PNG-enkoder slik at fasiten var kjent ved konstruksjon: 750x270 piksler, svarte blokksiffer 4739 på hvitt, med en rød horisontal stripe over toppen. Sendt base64-kodet returnerte qwen3.8-max DIGITS: 4739 og TOPBAR: red. Korrekt på begge punkter, 6.99s, $0.002146. Den identiske forespørselen til qwen3.7-max kom tilbake som HTTP 404 {"error":{"message":"No endpoints found that support image input"}}.
Video fungerer også, med et forbehold vi nesten rapporterte som en feil. To av de tre offentlige MP4-URL-ene vi prøvde, returnerte HTTP 400 "Failed to download multimodal content". Det er Alibaba som ikke klarer å hente filen, ikke ruten som avviser video. Med en URL den kunne hente, beskrev 3.8-Max en Big Buck Bunny-klipp nøyaktig, inkludert å navngi karakteren, på 24.24s for $0.006528.
To praktiske notater før du bygger på dette. Videoen ble fakturert som 696 ordinære prompt-tokens for en klipp på rundt 10 sekunder, og usage.prompt_tokens_details.video_tokens rapporterte 0, så du kan ikke skille ut videokostnaden fra det feltet. Og en feilformet innholdsdel feiler stille: å sende {"type": "video", "video": [url]} i stedet for video_url returnerte HTTP 200 med modellen som høflig sa at den ikke kunne se noen video, pluss en regning. Bruk video_url.
Verdt å vite: da vi ba 3.8-Max beskrive sine egne evner, svarte den Input modalities: text. Det er feil, som den neste testen i vår egen kjøring viste. En modells selvbeskrivelse er en språkmodell-output, ikke et spesifikasjonsark.
Hvor godt holder 1M-token kontekstvinduet stand?
Vi plantet tre unike fakta ved 10%, 50% og 90% dybde i generert fyllstoff og ba om alle tre i ett kall. 18 av 18 nåler kom tilbake korrekt over seks kjøringer på to modeller, ved prompt-størrelser fra 5,723 opp til 247,911 tokens, vurdert ved eksakt delstreng-treff i kode fremfor ved å lese svarene.
Våre qwen3.8-max-kjøringer (de to qwen3.7-max-kjøringene på 83,380 og 247,873 tokens, og én qwen3-max-kjøring på 78,255, returnerte også hver nål):
| Prompt-tokens (qwen3.8-max) | Latens | Kostnad | Nåler funnet |
|---|---|---|---|
| 5,723 | 9.24s | $0.01409 | 3 av 3 |
| 25,703 | 13.43s | $0.05453 | 3 av 3 |
| 83,418 | 17.63s | $0.16965 | 3 av 3 |
| 247,911 | 38.54s | $0.49828 | 3 av 3 |
Latensen skalerer sublineært, som er den praktisk nyttige delen: 43x mer input-tokens koster bare 4.2x mer klokketid.
Nå til de ærlige begrensningene, for dette er den enkle enden av langkontekst-evaluering. Å hente en ordrett plantet fakta sier veldig lite om resonnering på tvers av et stort dokument, og vi testet hver størrelse én gang. Vi kjørte ikke et kall på 1M tokens. Ved $2.00 per million input-tokens ville ett kostet omtrent $2.00, mer enn hele denne testkjøringen, og et enkelt utvalg ville ikke fortalt oss mye. Det annonserte 1M-taket er derfor uverifisert av oss. Og 3.7-Max matchet 3.8-Max nøyaktig ved begge størrelsene vi sammenlignet, så langkontekst-henting er ikke der denne generasjonen skiller seg ut.
Én prisfelle dukket opp her som lanseringsdekningen fullstendig går glipp av. qwen3-max har trinnvise prisoverstyringer som dobler raten over 32,000 prompt-tokens og hever den igjen over 128,000, mens 3.8-Max og 3.7-Max er flat rate ved enhver lengde. Vi bekreftet trinnet fra faktisk fakturering: vårt 78,255-token kall til qwen3-max ble belastet $0.12227, $1.56/M-raten, ikke $0.78/M-overskriftsraten. Ved den lengden koster det nesten nøyaktig det 3.7-Max koster ($0.12523). Overskriftsprisen er under halvparten. Den faktiske prisen ved 80k tokens er en avrundingsfeil unna.
Alibabas fem benchmarkscorer, og hvorfor ingen av dem er verifisert
Alibaba publiserte fem benchmarkscorer med GA-lanseringen. Hver eneste av dem kommer fra Alibabas egne interne kjøringer, og vi fant ingen uavhengig evaluering publisert per 2026-08-04. Den setningen fortjener å stå ved siden av tallene i stedet for tre avsnitt under dem.
| Benchmark | Alibaba-rapportert score | Verifisert av en tredjepart? |
|---|---|---|
| Terminal-Bench 2.1 | 86.6 | Nei, per 2026-08-04 |
| GPQA Diamond | 92.6 | Nei, per 2026-08-04 |
| PaperBench | 93.0 | Nei, per 2026-08-04 |
| OSWorld-Verified | 86.1 | Nei, per 2026-08-04 |
| DeepSWE 1.1 | 56.6 (forgjenger: 21.6) | Nei, per 2026-08-04 |
Alibaba rapporterte også et internt aggregat på 0.725, opp fra 0.474, og posisjonerte modellen som nær eller over Claude Opus 4.8, Fable 5 og GPT-5.6 Sol. Arena-plasseringer sirkulerte også: 5. plass i Text Arena og 2. plass i Vision Arena ifølge Alibabas egen annonsering fra 2026-08-03, som vi ikke har bekreftet på nytt på den live rangeringslisten. Arena-rangeringer beveger seg daglig. Behandle enhver rangering du leser denne uken som et øyeblikksbilde med en dato på seg.
Det ingen har målt ennå, oss inkludert: gjennomstrømming under samtidighet, ytelse på ikke-engelsk, sikkerhets- og samsvarsevalueringer, og pålitelighet ved verktøykall. Våre egne tall dekker latens, kostnad, modalitet og langkontekst-henting på én rute, og ingenting annet. Bloombergs lanseringsrapport gjengav benchmark-påstandene uten uavhengig testing, som er der så godt som all dekning befinner seg akkurat nå.
For tall som er sjekket, er vår Qwen mot DeepSeek mot GLM-sammenligning den bedre referansen, og Kimi K3 på omtrent 2.8T er størrelsesrivalen alle benchmarker dette mot.
Qwen3.8 mot Qwen3-8B, og den åpne-vekt-reverseringen bak denne lanseringen
Qwen3.8 er Alibabas flaggskip på 2.4 billioner parametere. Qwen3-8B er en tett modell med 8 milliarder parametere fra Qwen3-serien, nedlastbar siden 2025. Navn som ser like ut, men rundt 300x fra hverandre i størrelse. Søkemotorer blander dem fortsatt sammen, og det gjør overraskende mange svar i fora også.
Navneproblemet ble verre denne uken, ikke bedre. Det eneste på Hugging Face som bærer et «Qwen3.8»-navn akkurat nå, er fellesskapets 4B-destillater. Går du på jakt etter vekter og griper en av dem, laster du ned noe uten sammenheng med 2.4T-modellen.
To lukkede flaggskip, så dette
Det åpne-vekt-løftet er den egentlige nyheten her, og det leser annerledes når du ser familiehistorien. Alibaba brukte to generasjoner på et bevisst skille: åpne-vekt-arbeidshester for alle, lukket flaggskip på toppen.
| Generasjon | Vekter | Merknader |
|---|---|---|
| Qwen 3.5 (0.8B til 397B-A17B) | Åpen, Apache 2.0 | Hele familien utgitt offentlig |
| Qwen 3.6 (27B tett, 35B-A3B MoE) | Åpen, Apache 2.0 | Samme mønster holdt seg |
| Qwen3.7-Max | Lukket | Kun API. Ingen GGUF, ingen Hugging Face-sjekkpunkt |
| Qwen3.8-Max | Lovet åpen, ikke levert ennå | «Neste uke» per 2026-08-03. Lisens ikke annonsert |
Alibaba lukket flaggskip-nivået i to generasjoner på rad og sier nå at de vil åpne den største modellen de noensinne har bygget. Lander vektene som lovet, er det en reell reversering, og den legger press på hvert laboratorium som har behandlet «frontier-nivå forblir lukket» som avgjort. Sklir de, blir dette den tredje lukkede Max-lanseringen på rad. Begge utfall er levende per 2026-08-04. Vi så samme dynamikk utspille seg med GLM 5.2, der den leverte lisensen betydde mer enn annonseringen.
Kan du kjøre Qwen3.8-Max selv? (fortsatt nei)
Nei, og GA-spesifikasjonene gjør det klarere, ikke mindre klart. Ved 2.4 billioner totale parametere er dette ikke en modell du serverer på egen maskinvare, selv etter at vektene slippes. DeepSeek-V3.2 på 685B beskrives allerede av dem som har gjort det, som et seriøst infrastrukturprosjekt. Dette er flere ganger det.
Så hva gir en åpen-vekt-modell på 2.4T deg egentlig?
- Inferensleverandører kan hoste den, som betyr priskonkurranse, som betyr at kostnaden din per token faller
- Suverene, regulerte og luftgapte distribusjoner blir mulig på dette nivået for første gang
- Forskere og finjusterere får en grunnmodell i frontier-skala å jobbe fra
- Det betyr ikke at den kjører på maskinen din, din enkelte A100, eller oppstartsselskapets GPU-budsjett
Vil du ha regnestykket på hva det faktisk krever å kjøre store åpne-vekt-modeller, gjør vår guide til LLM VRAM-krav den matematikken skikkelig. Den korte versjonen for denne modellen: ikke gjør det.
Bør du bytte, teste, eller vente?
| Din situasjon | Hva vi ville gjort 2026-08-04 |
|---|---|
| Kjører Qwen3.7-Max i produksjon | Test 3.8-Max på trafikk med korte prompter først. Det er der 4x-kostnadsgapet vårt dukket opp. Sjekk deretter max_tokens-håndteringen din for tom-svar-tilfellet |
| Langkontekst eller tung RAG-arbeidsmengde | Bli der du er foreløpig. 3.8-Max koster 35.6% mer per token og matchet 3.7-Max nøyaktig på vår hentetest |
| Du trenger bilde- eller videoinput | Dette er grunnen til å flytte. 3.7-Max kan ikke ta imot et bilde i det hele tatt, og vi bekreftet 404-en |
| Venter på åpne vekter | Merk deg 2026-08-10. Ingenting å gjøre før det finnes et modellkort og en lisens å lese |
| Fornøyd med Claude eller GPT | Ingenting endres i dag. Alibabas benchmarkscorer er uverifiserte, og uverifiserte tall er ikke en migrasjonssak |
Metoden betyr mer enn dommen. Hver modell vi har produksjonstestet, har oppført seg annerledes enn sin plassering på rangeringslisten, fordi promptene dine, kodebasen din og toleransen din for nye forsøk ikke er en del av noen andres benchmark. To kodeoppgaver i vår kjøring understreker poenget: 3.8-Max og 3.7-Max scoret begge 11 av 11 på en oppgave med strengbredde-avkorting og begge besto 5,000 av 5,000 fuzzede tilfeller på datoaritmetikk. På korrekthet kunne vi ikke skille dem. Gapet vi målte, ligger i latens og token-forbruk på enkle prompter, ikke i evne på vanskelige.
Vurderer du en migrasjon og vil ha et ekstra sett øyne på kostnadsmodellen? La teamet vårt stressteste den mot arbeidsmengden din.
Alle tall verifisert 2026-08-04. Priser, arena-rangeringer og vektenes tidslinje endrer seg ofte. Målingene våre kommer fra én rute (OpenRouter til Alibaba), én maskin, én dag, med n=3 for latens og n=1 for de fleste funksjonelle prober.
Ofte stilte spørsmål
Er Qwen3.8-Max åpen kildekode?
Ikke per 2026-08-04. Den er kun tilgjengelig via API. Alibaba har planlagt vektene for «neste uke» på Hugging Face og ModelScope, og har ikke annonsert noen lisens. Overskrifter som kaller den åpen kildekode, ligger foran fakta. Et Hugging Face-søk returnerer bare tredjeparts 4B-destillater, ikke et Alibaba-modellkort.
Hvor mye koster Qwen3.8-Max?
$2.00 per million input-tokens og $6.00 per million output, med cachet input rapportert til $0.25. Det er 35.6% mer enn Qwen3.7-Max på begge sider. Vi målte en median på $0.001592 per kort kall, rundt 4x billigere enn 3.7-Max på samme prompt, fordi den avgir langt færre resonnerings-tokens.
Hvor mange parametere har Qwen3.8-Max?
2.4 billioner totalt, ifølge Alibabas annonsering og alle medier som dekker den. Det aktive tallet er omstridt: SiliconANGLE, The Decoder og Coursiv rapporterer ~95 milliarder aktive, mens MarkTechPost sier at Alibaba ikke opplyste det. API-et eksponerer ikke noe parameterfelt, så vi kunne ikke verifisere noen av tallene.
Hvilket kontekstvindu har Qwen3.8-Max?
Det live API-et rapporterer 1,000,000 tokens kontekst og 131,072 maks fullførings-tokens. Vi testet henting opp til 247,911 tokens uten feil. Vi kjørte ikke et kall på 1M tokens, fordi ett ville kostet omtrent $2.00 og oversteget testbudsjettet vårt, så toppen av det vinduet er uverifisert av oss.
Støtter Qwen3.8-Max bilde- og videoinput?
Ja til begge deler, og vi verifiserte dem. Den leste sifre og en farge korrekt fra en lokalt generert PNG, og beskrev en video nøyaktig når den fikk en URL Alibaba kunne hente. Qwen3.7-Max avviser bilder helt med en 404. To av våre tre test-video-URL-er feilet ved leverandørens nedlastingssteg.
Er Qwen3.8-Maxs benchmarkscorer uavhengig verifisert?
Nei. Terminal-Bench 2.1 på 86.6, GPQA Diamond på 92.6, PaperBench på 93.0, OSWorld-Verified på 86.1 og DeepSWE 1.1 på 56.6 kommer alle fra Alibabas interne kjøringer. Per 2026-08-04 fant vi ingen tredjepartsevaluering publisert for noen av dem.
Kan jeg kjøre Qwen3.8-Max lokalt?
Realistisk sett nei, selv når vektene slippes. Ved 2.4 billioner parametere er den flere ganger størrelsen på DeepSeek-V3.2, som allerede er et genuint infrastrukturprosjekt å selvhoste. Forvent å konsumere den gjennom inferensleverandører fremfor dine egne GPU-er, med mindre du driver et datasenter.
Bør jeg migrere fra Qwen3.7-Max til Qwen3.8-Max?
Det avhenger av token-miksen din. På korte prompter målte vi 3.8-Max til omtrent en fjerdedel av kostnaden og fire til fem ganger farten. På arbeidsmengder med lang input koster den 35.6% mer og presterte identisk på vår hentetest. Trenger du bilde- eller videoinput, kan 3.7-Max ikke gjøre det i det hele tatt.
Når blir Qwen3.8-Max-vektene utgitt?
Alibaba sa «neste uke» i sin annonsering fra 2026-08-03, og navnga Hugging Face og ModelScope som destinasjonene. Ingen eksakt dato, og ingen lisenstekst. En følgesvenn åpen-vekt-modell, Qwen3.8-27B, er rapportert å skulle lanseres samtidig med dem. Vi planlegger å sjekke på nytt 2026-08-10.