ai-machine-learning

Qwen3.8-Max Is Er: 2,4T Parameters, 1M Context, en de Gewichten Zijn Er Nog Steeds Niet

Geschreven door Mert Batur
Bijgewerkt Aug 4, 2026
17 leestijd
Qwen3.8-Max Is Er: 2,4T Parameters, 1M Context, en de Gewichten Zijn Er Nog Steeds Niet

Qwen3.8-Max Is Er: 2,4T Parameters, 1M Context, en de Gewichten Zijn Er Nog Steeds Niet

$1.4728. Dat is wat 40 live API-calls op Qwen3.8-Max en zijn twee voorgangers ons kostten op 2026-08-04, de dag nadat Alibaba het uitbracht. De verrassing zat niet in de 2,4 biljoen parameters. Die zat hierin: 3.8-Max rekent 35.6% meer per token dan Qwen3.7-Max en kwam toch zo'n 4x goedkoper per antwoord uit de test, omdat het is gestopt met overdenken. Nog iets dat vrijwel alle lanceringsberichtgeving verkeerd heeft. Het is geen open source. Niet vandaag.

Dit artikel werd voor het eerst gepubliceerd op 2026-07-19, toen Qwen3.8 nog een preview was zonder gepubliceerde specificaties. Het is op 2026-08-04 herschreven op basis van de GA-release en onze eigen API-tests.

Belangrijkste Inzichten

  • Op 2026-08-04 is Qwen3.8-Max uitsluitend via de API beschikbaar. Alibaba beloofde de gewichten "volgende week", wat neerkomt op de week van 2026-08-10, op Hugging Face en ModelScope.
  • We maten $0.001592 per korte call tegenover $0.006428 bij Qwen3.7-Max, ondanks een hogere prijs per token.
  • Alibaba's vijf benchmarkscores zijn door de leverancier zelf gerapporteerd. We vonden geen onafhankelijke evaluatie die gepubliceerd is per 2026-08-04.
  • Afbeelding- en video-invoer zijn echt en nieuw. We hebben beide geverifieerd tegen de API en tegen de weigering van 3.7-Max.

Wat Er Is Veranderd Tussen de Preview en de GA-release

Qwen3.8-Max werd op 2026-08-03 algemeen beschikbaar (GA), en die release beantwoordde elke open vraag die deze pagina twee weken geleden nog had. Het preview-tijdperk gaf ons een parameteraantal en een belofte. De GA-release voegde een bevestigd contextvenster van 1M tokens toe, tekst plus afbeelding plus video als invoer, vijf gepubliceerde benchmarkscores, en een prijs per token.

Hier is het oude overzicht van onbekenden, nu opgelost:

Wat deze pagina zei op 2026-07-19Status op 2026-08-04
Gepubliceerde benchmarkscore: geenVijf door Alibaba gerapporteerde scores gepubliceerd
Actieve parameters / MoE-configuratie: niet bekendgemaaktOp grote schaal gemeld als ~95B actief, sparse MoE. Berichtgeving spreekt elkaar tegen, zie hieronder
Contextvenster en max. output: niet aangekondigd1M in, 131,072 uit, bevestigd door de live API
Modaliteit: niet aangekondigdtekst + afbeelding + video in, tekst uit. We hebben dit zelf geverifieerd
Prijs per token: niet uitgesplitst$2.00 / M input, $6.00 / M output
Releasedatum open gewichten: "binnenkort", geen datum"Volgende week", Hugging Face en ModelScope genoemd
Qwen3.8-Max-Preview is nu livePreview is voorbij. GA uitgebracht

Eén punt bleef onopgelost. De verdeling van de parameters is nog steeds omstreden. MarkTechPost's lanceringsartikel stelt expliciet dat het aantal actieve parameters niet door Alibaba is bekendgemaakt, terwijl SiliconANGLE, The Decoder en Coursiv allemaal ~95 miljard actief noemen. We hebben het MarkTechPost-artikel op 2026-08-04 opnieuw gelezen en het zegt nog steeds niet bekendgemaakt. Bij iemand klopt de bronvermelding niet, en het eerlijke antwoord is dat de berichtgeving over dit specifieke getal op lanceringsdag tegenstrijdig was.

We konden het geen van beide bevestigen. De respons van OpenRouter's /models bevat helemaal geen veld voor het aantal parameters, dus niets in onze tests bevestigt of weerlegt 2.4T totaal of 95B actief.

Is Qwen3.8-Max Open Source? Niet op 2026-08-04

Nee. Op 2026-08-04 is Qwen3.8-Max uitsluitend via de API beschikbaar. Alibaba heeft de release van de gewichten gepland voor "volgende week" op Hugging Face en ModelScope, en heeft nog geen licentie aangekondigd. Berichtgeving blijft "beschikbaar" verwarren met "open," en dat onderscheid is het hele verhaal. Er zijn vandaag geen gewichten te downloaden, wat een kop ook beweert.

Drie toestanden worden tot één woord samengevoegd. Het zijn niet dezelfde dingen:

StatusQwen3.8-Max op 2026-08-04
Beschikbaar via APIJa. Alibaba Cloud Model Studio, plus resellers en routers
Gewichten downloadbaarNee. Beloofd voor "volgende week", geen datum gegeven
LicentievoorwaardenNiet aangekondigd. Er bestaat geen tekst om te lezen

We hebben het hardste beschikbare bewijs gecontroleerd in plaats van iemands woord aan te nemen: een zoekopdracht op Hugging Face naar Qwen3.8 levert op 2026-08-04 geen Alibaba-modelkaart op. Wat het wel oplevert, zijn vier community-uploads met de naam Qwen3.8_4B_Distilled en varianten, wat third-party distills zijn, niet het vlaggenschip. Als je die pagina snel doorscant, is het gemakkelijk om ze voor de echte release aan te zien.

Eén kanttekening bij de licentie, want precedent wordt steeds als toezegging gerapporteerd. Qwen 3.5 en Qwen 3.6 verschenen allebei onder Apache 2.0. Een restrictieve community-licentie op 2.4T zou technisch nog steeds "open weights" heten, terwijl het wel verandert wat je ermee mag bouwen. Tot er licentietekst is, gokt iedereen die je vertelt wat je met deze gewichten mag doen. Daarom staat Qwen3.8-Max ook niet in ons overzicht van open-source LLM's die het waard zijn om in 2026 te draaien: het komt er nog niet voor in aanmerking.

Wat We Hebben Gemeten: 4x Goedkoper Per Call Ondanks een Prijsstijging van 35.6%

We hebben op 2026-08-04 40 gefactureerde calls uitgevoerd tegen qwen3.8-max, qwen3.7-max en qwen3-max via OpenRouter, totale uitgave $1.4728. Elke kostenpost hieronder is berekend op basis van het geretourneerde usage-object en gecontroleerd tegen OpenRouter's eigen gefactureerde bedrag. Ze kwamen allemaal overeen. De belangrijkste bevinding gaat lijnrecht in tegen de prijswijziging.

Begin met de prijs. Live prijzen van GET /models op 2026-08-04 zetten 3.8-Max op $2.00 in / $6.00 uit per miljoen tokens tegenover 3.7-Max op $1.475 / $4.425. Dat is een stijging van 35.6% aan beide kanten, en de verhouding is in beide gevallen identiek (2.000/1.475 = 6.000/4.425 = 1.3559). Je kunt de actuele cijfers controleren op de OpenRouter-modelpagina.

Nu dezelfde triviale prompt naar alle drie de modellen, drie runs elk, temperature: 0, gestreamd:

ModelEerste token (3 runs)Eerste zichtbare inhoudWall time (3 runs)Completion tokenswaarvan reasoningMediane kosten/call
qwen3.8-max2.249s / 0.874s / 1.054s5.414s / 5.058s / 4.209s6.338s / 6.734s / 5.130s242 / 287 / 243156 / 194 / 157$0.001592
qwen3.7-max4.871s / 1.157s / 1.670snooit / 22.358s / 25.998s31.147s / 24.013s / 27.661s1502 / 1281 / 14431500 / 1174 / 1346$0.006428
qwen3-max2.617s / 2.892s / 2.386s2.617s / 2.892s / 2.386s4.401s / 4.601s / 4.081s105 / 105 / 1070 / 0 / 0$0.000431

Twee aparte eerste-token-kolommen zijn nodig omdat beide reasoning-modellen verborgen redenering streamen voordat er antwoordtekst komt. Bij 3.8-Max arriveert een token in twee van de drie runs binnen een seconde, maar het eerste woord dat een gebruiker daadwerkelijk kan lezen, landt vier tot vijf seconden later. Bij 3.7-Max run 1 landde het helemaal nooit. Als je een streaming-UI bouwt tegen een reasoning-model, blijft de spinner draaien lang nadat de verbinding al bewezen actief is.

Lees de reasoning-kolom twee keer. Bij een prompt die om een uitleg van een Bloom filter in drie zinnen vroeg, gebruikte 3.7-Max tussen de 1,174 en 1,500 reasoning tokens. 3.8-Max gebruikte 156 tot 194. Dat is ruwweg 7x minder denkwerk voor hetzelfde antwoord, en reasoning tokens worden gefactureerd tegen het output-tarief. Het resultaat: 3.8-Max is ongeveer 4x goedkoper per call en 4 tot 5 keer sneller in wall time vanaf onze machine, netwerk-roundtrip inbegrepen, terwijl het 35.6% meer kost per token. De adviesprijs ging omhoog en de rekening ging omlaag.

Dat draait om naarmate prompts groter worden. Gemodelleerd op basis van live prijzen in plaats van gemeten, kost een call van 30,000 tokens met 500 output-tokens $63.00 per duizend calls bij 3.8-Max tegenover $46.46 bij 3.7-Max. Bij 100,000 input-tokens is dat $203.00 tegenover $149.71. Zodra het merendeel van je tokens input is, weegt het reasoning-efficiëntievoordeel niet meer op tegen de prijsstijging en wordt 3.8-Max de duurste van de drie. Welk model het goedkoopst is, hangt echt af van je verhouding input-tot-output, en dat is precies de les waar onze LLM API-prijsvergelijking steeds weer op uitkomt.

reasoning_effort Is Nieuw, en 3.7-Max Negeert Het Stilzwijgend

reasoning_effort staat wel bij de ondersteunde parameters van 3.8-Max en niet bij die van 3.7-Max. Bij 3.8-Max heeft het een bescheiden effect: over drie runs elk produceerde minimal 67, 108 en 124 reasoning tokens tegenover high op 163, 136 en 173. Medianen van 108 tegenover 163, op dezelfde prompt, bij temperature 0.

De bevinding die geld kost, zit bij het oudere model. Het sturen van reasoning_effort: "low" naar 3.7-Max wordt geaccepteerd in plaats van geweigerd, en vervolgens genegeerd: die call verbruikte alsnog 1,401 reasoning tokens, met dezelfde facturering van $0.006689 als de identiek gevormde call die we logden. Geen foutmelding, geen waarschuwing, geen effect. Als je kosten bijstuurt door de reasoning effort te verlagen, controleer dan of dat daadwerkelijk iets doet bij het model dat je aanroept, want een niet-ondersteunde parameter faalt hier stilletjes in plaats van luidruchtig.

De Lege-Respons-Valkuil Die Je Moet Controleren Vóór Je Migreert

Onze eerste testrun gebruikte max_tokens: 400 en liet ons eigen script crashen. De reden bleek meer waard dan de test zelf. Qwen3.7-Max kan zijn hele tokenbudget aan reasoning besteden en een lege string retourneren, met finish_reason: "length", volledig gefactureerd.

We liepen er drie keer apart tegenaan. Bij max_tokens: 400: 402 completion tokens, waarvan 400 reasoning, nul antwoordkarakters, $0.001822 gefactureerd. Bij max_tokens: 1500: 1,502 tokens, 1,500 reasoning, nul karakters, $0.006689 voor niets. En nog een keer bij een latere call, $0.006735. Geen foutmelding, geen exception, gewoon een vlot ogend response-object met een lege content-string.

Als je een bestaande 3.7-Max-integratie migreert en je code stelt een bescheiden max_tokens in, reserveer dan tijd om dit pad te testen. Het veel kortere reasoning van 3.8-Max maakt het aanzienlijk minder kwetsbaar. Immuun is het niet.

Een Kleine Token-Overhead Die Niemand Noemt

Dezelfde prompt van 12 woorden telde 67 prompt tokens bij 3.8-Max en 29 bij 3.7-Max, consistent over elke run (27 bij qwen3-max). Dat is ruwweg 38 tokens vaste overhead, vermoedelijk een groter system- of chat-template. Bij een RAG-call van 100,000 tokens valt dat weg in de afronding. Bij een high-volume classifier die korte prompts afvuurt, meer dan verdubbelt het je input-rekening nog voordat je een woord hebt geschreven.

Accepteert Qwen3.8-Max Echt Afbeeldingen en Video?

Ja, en multimodale invoer is echt nieuw in deze generatie, geen herlabeling. De API meldt text+image+video->text voor 3.8-Max en text-only voor 3.7-Max. We hebben het verschil geverifieerd door dezelfde afbeelding naar beide te sturen, en het oudere model weigerde die al op het routeringsniveau.

We hebben de testafbeelding lokaal gegenereerd met een handgeschreven PNG-encoder, zodat de grondwaarheid al vast lag door de constructie: 750x270 pixels, zwarte blokcijfers 4739 op wit, met een rode horizontale balk over de bovenkant. Base64-gecodeerd verstuurd, qwen3.8-max retourneerde DIGITS: 4739 en TOPBAR: red. Beide correct, 6.99s, $0.002146. Hetzelfde verzoek naar qwen3.7-max kwam terug als HTTP 404 {"error":{"message":"No endpoints found that support image input"}}.

Video werkt ook, met een kanttekening die we bijna als een fout hadden gerapporteerd. Twee van de drie publieke MP4-URL's die we probeerden, gaven HTTP 400 "Failed to download multimodal content" terug. Dat is Alibaba die het bestand niet kan ophalen, niet de route die video weigert. Met een URL die het wél kon ophalen, beschreef 3.8-Max een Big Buck Bunny-clip nauwkeurig, inclusief het benoemen van het personage, in 24.24s voor $0.006528.

Twee praktische kanttekeningen voordat je hierop bouwt. De video werd gefactureerd als 696 gewone prompt tokens voor een clip van ongeveer 10 seconden, en usage.prompt_tokens_details.video_tokens meldde 0, dus je kunt de videokosten niet uit dat veld halen. En een verkeerd gevormd content-onderdeel faalt stilletjes: het sturen van {"type": "video", "video": [url]} in plaats van video_url leverde HTTP 200 op, met het model dat beleefd zei geen video te kunnen zien, plus een rekening. Gebruik video_url.

Goed om te weten: toen we 3.8-Max vroegen zijn eigen mogelijkheden te beschrijven, antwoordde het Input modalities: text. Dat is onjuist, zoals de volgende test in onze eigen run aantoonde. De zelfbeschrijving van een model is een taalmodel-output, geen specificatieblad.

Hoe Goed Houdt het 1M-Token-Contextvenster Stand?

We hebben drie unieke feiten geplant op 10%, 50% en 90% diepte in gegenereerde vulinhoud, en in één call om alle drie gevraagd. 18 van de 18 naalden kwamen correct terug over zes runs op twee modellen, bij promptgroottes van 5,723 tot 247,911 tokens, beoordeeld op exacte substring-match in code in plaats van door de antwoorden te lezen.

Onze qwen3.8-max-runs (de twee qwen3.7-max-runs op 83,380 en 247,873 tokens, en één qwen3-max-run op 78,255, leverden ook elke naald correct terug):

Prompt tokens (qwen3.8-max)LatencyKostenGevonden naalden
5,7239.24s$0.014093 van 3
25,70313.43s$0.054533 van 3
83,41817.63s$0.169653 van 3
247,91138.54s$0.498283 van 3

Latency schaalt sublineair, en dat is het praktisch bruikbare deel: 43x meer input-tokens kosten slechts 4.2x meer wall time.

Nu de eerlijke beperkingen, want dit is het gemakkelijke uiteinde van long-context-evaluatie. Het letterlijk terughalen van een geplant feit zegt heel weinig over redeneren over een groot document, en we hebben elke grootte één keer getest. We hebben geen call van 1M tokens uitgevoerd. Bij $2.00 per miljoen input-tokens zou die ongeveer $2.00 hebben gekost, meer dan deze hele testrun, en één enkel monster zou ons weinig hebben verteld. Het geadverteerde plafond van 1M is daarom door ons niet geverifieerd. En 3.7-Max presteerde bij beide groottes die we vergeleken precies gelijk aan 3.8-Max, dus long-context-retrieval is niet waar deze generatie zich onderscheidt.

Hier kwam een prijsvalkuil naar boven die de lanceringsberichtgeving volledig mist. qwen3-max heeft getrapte prijsoverschrijvingen die het tarief verdubbelen boven 32,000 prompt tokens en het nogmaals verhogen boven 128,000, terwijl 3.8-Max en 3.7-Max op elke lengte een vlak tarief hanteren. We hebben de trap bevestigd aan de hand van de daadwerkelijke facturering: onze call van 78,255 tokens naar qwen3-max werd gefactureerd op $0.12227, het $1.56/M-tarief, niet de kop-prijs van $0.78/M. Bij die lengte kost het bijna precies hetzelfde als 3.7-Max ($0.12523). De kop-prijs is minder dan de helft. De echte prijs bij 80k tokens scheelt een rekenkundige afronding.

Alibaba's Vijf Benchmarkscores, en Waarom Geen Enkele Ervan Geverifieerd Is

Alibaba publiceerde vijf benchmarkscores bij de GA-release. Elke daarvan komt uit Alibaba's eigen interne runs, en we vonden geen onafhankelijke evaluatie die gepubliceerd is per 2026-08-04. Die zin verdient het om naast de cijfers te staan, niet drie alinea's eronder.

BenchmarkDoor Alibaba gerapporteerde scoreGeverifieerd door een derde partij?
Terminal-Bench 2.186.6Nee, per 2026-08-04
GPQA Diamond92.6Nee, per 2026-08-04
PaperBench93.0Nee, per 2026-08-04
OSWorld-Verified86.1Nee, per 2026-08-04
DeepSWE 1.156.6 (voorganger: 21.6)Nee, per 2026-08-04

Alibaba rapporteerde ook een interne aggregaatscore van 0.725, omhoog van 0.474, en positioneerde het model als vergelijkbaar met of beter dan Claude Opus 4.8, Fable 5 en GPT-5.6 Sol. Ook arena-plaatsingen deden de ronde: 5e in Text Arena en 2e in Vision Arena volgens Alibaba's eigen aankondiging van 2026-08-03, wat we niet opnieuw hebben bevestigd op het live leaderboard. Arena-ranks veranderen dagelijks. Behandel elke rang die je deze week leest als een momentopname met een datum erop.

Wat nog niemand heeft gemeten, ons inbegrepen: throughput onder concurrency, prestaties in andere talen dan het Engels, veiligheids- en alignment-evaluaties, en betrouwbaarheid van tool-calling. Onze eigen cijfers dekken alleen latency, kosten, modaliteit en long-context-retrieval op één route, en niets anders. Bloombergs lanceringsbericht herhaalde de benchmarkclaims zonder onafhankelijk testwerk, en daar bevindt vrijwel alle berichtgeving zich op dit moment.

Voor cijfers die wél gecontroleerd zijn, is onze Qwen vs DeepSeek vs GLM-vergelijking de betere referentie, en Kimi K3 op ruwweg 2.8T is de qua omvang vergelijkbare rivaal waar iedereen dit tegen benchmarkt.

Qwen3.8 vs Qwen3-8B, en de Open-Weight-Ommekeer Achter Deze Release

Qwen3.8 is Alibaba's vlaggenschip met 2,4 biljoen parameters. Qwen3-8B is een dense model met 8 miljard parameters uit de Qwen3-serie, al sinds 2025 te downloaden. Vergelijkbaar klinkende namen, ruwweg 300x uit elkaar qua omvang. Zoekmachines gooien ze nog steeds op één hoop, en een verrassend aantal forumantwoorden ook.

Het naamgevingsprobleem is deze week erger geworden, niet beter. De enige dingen op Hugging Face die momenteel een "Qwen3.8"-naam dragen, zijn community 4B-distills. Als je op zoek gaat naar gewichten en er eentje daarvan pakt, download je iets zonder enige relatie tot het 2.4T-model.

Twee Gesloten Vlaggenschepen, en Dan Dit

De open-weight-belofte is hier het echte nieuws, en die leest anders zodra je de familiegeschiedenis ziet. Alibaba hield twee generaties lang een bewuste tweedeling aan: open-weight werkpaarden voor iedereen, een gesloten vlaggenschip aan de top.

GeneratieGewichtenToelichting
Qwen 3.5 (0.8B tot 397B-A17B)Open, Apache 2.0Volledige familie publiekelijk uitgebracht
Qwen 3.6 (27B dense, 35B-A3B MoE)Open, Apache 2.0Zelfde patroon aangehouden
Qwen3.7-MaxGeslotenAlleen via API. Geen GGUF, geen Hugging Face-checkpoint
Qwen3.8-MaxOpen beloofd, nog niet uitgebracht"Volgende week" per 2026-08-03. Licentie niet aangekondigd

Alibaba hield de vlaggenschip-laag twee generaties op rij gesloten en zegt nu het grootste model dat het ooit heeft gebouwd, te gaan openstellen. Als de gewichten landen zoals beloofd, is dat een echte ommekeer en zet het druk op elk lab dat "de frontier-laag blijft gesloten" als een vaststaand gegeven beschouwt. Als het uitloopt, wordt dit de derde gesloten Max-release op rij. Beide uitkomsten zijn nog open op 2026-08-04. We zagen dezelfde dynamiek eerder bij GLM 5.2, waar de daadwerkelijk uitgebrachte licentie zwaarder woog dan de aankondiging.

Kun Je Qwen3.8-Max Zelf Draaien? (Nog Steeds Nee)

Nee, en de GA-specificaties maken dat duidelijker, niet minder duidelijk. Met 2,4 biljoen parameters in totaal is dit geen model dat je op je eigen hardware draait, zelfs niet nadat de gewichten uitkomen. DeepSeek-V3.2 met 685B wordt door mensen die het zelf hebben gedaan al omschreven als een serieus infrastructuurproject. Dit is meerdere keren zo groot.

Dus wat levert een open-weight-model van 2.4T je eigenlijk op?

  • Inference-providers kunnen het hosten, wat prijsconcurrentie oplevert, wat je kosten per token laat dalen
  • Soevereine, gereguleerde en air-gapped implementaties worden voor het eerst mogelijk op dit niveau
  • Onderzoekers en fine-tuners krijgen een basismodel op frontier-schaal om mee te werken
  • Het betekent niet dat het draait op jouw machine, je ene A100, of het GPU-budget van je startup

Wil je de rekensom weten van wat het draaien van grote open-weight-modellen daadwerkelijk vergt, dan doet onze LLM VRAM-vereistengids die berekening grondig. De korte versie voor dit model: niet doen.

Moet Je Overstappen, Testen of Wachten?

Jouw situatieWat wij zouden doen op 2026-08-04
Draait Qwen3.7-Max in productieTest 3.8-Max eerst op verkeer met korte prompts. Daar zat ons 4x-kostenverschil. Controleer daarna je max_tokens-afhandeling voor het geval van een lege respons
Long-context- of zware RAG-workloadBlijf voorlopig waar je bent. 3.8-Max kost 35.6% meer per token en presteerde in onze retrieval-test precies gelijk aan 3.7-Max
Je hebt afbeelding- of video-invoer nodigDit is de reden om over te stappen. 3.7-Max kan helemaal geen afbeelding verwerken, en we hebben de 404 bevestigd
Wacht je op de open gewichtenNoteer 2026-08-10 in je agenda. Niets te doen tot er een modelkaart en een licentie te lezen zijn
Tevreden met Claude of GPTVandaag verandert er niets. Alibaba's benchmarkscores zijn ongeverifieerd, en ongeverifieerde cijfers zijn geen migratiereden

De methode telt zwaarder dan het oordeel. Elk model dat we in productie hebben getest, gedroeg zich anders dan zijn positie op het scorebord deed vermoeden, omdat jouw prompts, jouw codebase en jouw tolerantie voor herhaalpogingen in niemands benchmark voorkomen. Twee codeertaken in onze run maken dat duidelijk: 3.8-Max en 3.7-Max scoorden allebei 11 van 11 op een string-width-truncatietaak en slaagden allebei voor 5,000 van 5,000 fuzzed cases op datumrekenkunde. Op correctheid konden we ze niet uit elkaar houden. Het verschil dat we maten zit in latency en tokenverbruik bij makkelijke prompts, niet in capaciteit bij moeilijke.

Weeg je een migratie af en wil je een tweede paar ogen op het kostenmodel? Laat ons team het onder druk testen op jouw workload.

Alle cijfers geverifieerd op 2026-08-04. Prijzen, arena-ranglijsten en de tijdlijn van de gewichten veranderen regelmatig. Onze metingen komen van één enkele route (OpenRouter naar Alibaba), één machine, één dag, met n=3 voor latency en n=1 voor de meeste functionele tests.

Veelgestelde Vragen

Is Qwen3.8-Max Open Source?

Niet op 2026-08-04. Het is uitsluitend via de API beschikbaar. Alibaba heeft de gewichten gepland voor "volgende week" op Hugging Face en ModelScope, en heeft nog geen licentie aangekondigd. Koppen die het open source noemen, lopen op de feiten vooruit. Een zoekopdracht op Hugging Face levert alleen third-party 4B-distills op, geen Alibaba-modelkaart.

Hoeveel Kost Qwen3.8-Max?

$2.00 per miljoen input-tokens en $6.00 per miljoen output, met cached input gerapporteerd op $0.25. Dat is aan beide kanten 35.6% meer dan Qwen3.7-Max. We maten een mediaan van $0.001592 per korte call, ruwweg 4x goedkoper dan 3.7-Max op dezelfde prompt, omdat het veel minder reasoning tokens uitstoot.

Hoeveel Parameters Heeft Qwen3.8-Max?

2,4 biljoen in totaal, volgens Alibaba's aankondiging en elk medium dat erover berichtte. Het actieve aantal is omstreden: SiliconANGLE, The Decoder en Coursiv melden ~95 miljard actief, terwijl MarkTechPost stelt dat Alibaba dit niet heeft bekendgemaakt. De API bevat geen veld voor het aantal parameters, dus we konden geen van beide cijfers verifiëren.

Welk Contextvenster Heeft Qwen3.8-Max?

De live API meldt 1,000,000 tokens context en 131,072 max. completion tokens. We hebben retrieval getest tot 247,911 tokens zonder fouten. We hebben geen call van 1M tokens uitgevoerd, omdat die ongeveer $2.00 zou hebben gekost en ons testbudget zou hebben overschreden, dus de bovenkant van dat venster is door ons niet geverifieerd.

Ondersteunt Qwen3.8-Max Afbeelding- en Video-invoer?

Ja op beide, en we hebben ze geverifieerd. Het las cijfers en een kleur correct af van een lokaal gegenereerde PNG, en beschreef een video nauwkeurig wanneer het een URL kreeg die Alibaba kon ophalen. Qwen3.7-Max weigert afbeeldingen categorisch met een 404. Twee van onze drie test-video-URL's faalden bij de downloadstap van de provider.

Zijn de Benchmarkscores van Qwen3.8-Max Onafhankelijk Geverifieerd?

Nee. Terminal-Bench 2.1 op 86.6, GPQA Diamond op 92.6, PaperBench op 93.0, OSWorld-Verified op 86.1 en DeepSWE 1.1 op 56.6 komen allemaal uit Alibaba's interne runs. Per 2026-08-04 vonden we voor geen enkele ervan een gepubliceerde evaluatie door een derde partij.

Kan Ik Qwen3.8-Max Lokaal Draaien?

Realistisch gezien niet, zelfs niet zodra de gewichten uitkomen. Met 2,4 biljoen parameters is het meerdere keren zo groot als DeepSeek-V3.2, wat al een echt infrastructuurproject is om zelf te hosten. Verwacht dat je het gebruikt via inference-providers in plaats van je eigen GPU's, tenzij je een datacenter runt.

Moet Ik Migreren van Qwen3.7-Max naar Qwen3.8-Max?

Dat hangt af van je tokenmix. Bij korte prompts maten we 3.8-Max op ongeveer een kwart van de kosten en vier tot vijf keer de snelheid. Bij workloads met lange input kost het 35.6% meer en presteerde het identiek in onze retrieval-test. Als je afbeelding- of video-invoer nodig hebt, kan 3.7-Max dat helemaal niet.

Wanneer Worden de Gewichten van Qwen3.8-Max Uitgebracht?

Alibaba zei "volgende week" in zijn aankondiging van 2026-08-03, met Hugging Face en ModelScope als genoemde bestemmingen. Geen exacte datum, en geen licentietekst. Een begeleidend open-weight-model, Qwen3.8-27B, zou er volgens berichten tegelijk mee worden uitgebracht. We zijn van plan opnieuw te controleren op 2026-08-10.

Tags

qwen-3-8qwen3-8-max-previewopen-gewichten-llmalibaba-qwenllm-tools

Dit artikel delen

Start je project

Klaar om iets buitengewoons te bouwen?

Laten we je idee werkelijkheid maken. Ons team staat klaar om software te bouwen die het verschil maakt.