
Qwen3.8-Max är här: 2,4T parametrar, 1M kontext – vikterna är fortfarande inte ute
$1.4728. Det är vad 40 skarpa API-anrop mot Qwen3.8-Max och dess två föregångare kostade oss 2026-08-04, dagen efter att Alibaba släppte modellen. Överraskningen var inte de 2,4 biljoner parametrarna. Det var det här: 3.8-Max tar 35.6% mer betalt per token än Qwen3.7-Max och landade ändå på ungefär 4x billigare per svar, eftersom den slutade övertänka. En sak till som det mesta av lanseringsbevakningen får fel. Den är inte open source. Inte idag.
Det här inlägget publicerades först 2026-07-19, när Qwen3.8 var en förhandsversion utan publicerade specifikationer. Det skrevs om 2026-08-04 utifrån GA-lanseringen och våra egna API-tester.
Viktigaste Slutsatserna
- Per 2026-08-04 är Qwen3.8-Max endast tillgänglig via API. Alibaba utlovade vikterna "nästa vecka", det vill säga veckan som börjar 2026-08-10, på Hugging Face och ModelScope.
- Vi mätte $0.001592 per kort anrop mot $0.006428 för Qwen3.7-Max, trots ett högre pris per token.
- Alibabas fem benchmarkresultat är leverantörsrapporterade. Vi hittade ingen oberoende utvärdering publicerad per 2026-08-04.
- Bild- och videoindata är verkliga och nya. Vi verifierade båda mot API:et och mot att 3.7-Max nekar dem.
Vad Som Ändrades Mellan Förhandsversionen Och GA
Qwen3.8-Max blev allmänt tillgänglig 2026-08-03, och lanseringen besvarade varje öppen fråga den här sidan listade för två veckor sedan. Förhandsversionsperioden gav oss ett antal parametrar och ett löfte. GA-lanseringen lade till ett bekräftat kontextfönster på 1M tokens, text plus bild plus video som indata, fem publicerade benchmarkresultat och ett pris per token.
Här är den gamla listan över okända, nu lösta:
| Vad den här sidan sa 2026-07-19 | Status 2026-08-04 |
|---|---|
| Publicerat benchmarkresultat: inget | Fem Alibaba-rapporterade resultat publicerade |
| Aktiva parametrar / MoE-konfiguration: ej offentliggjort | Brett rapporterat som ~95B aktiva, gles MoE. Rapporteringen går isär, se nedan |
| Kontextfönster och maximal utdata: ej tillkännagivet | 1M in, 131,072 ut, bekräftat av det skarpa API:et |
| Modalitet: ej tillkännagivet | text + bild + video in, text ut. Vi verifierade detta själva |
| Prissättning per token: ej specificerat | $2.00 / M indata, $6.00 / M utdata |
| Datum för öppna vikter: "snart", inget datum | "Nästa vecka", Hugging Face och ModelScope namngivna |
| Qwen3.8-Max-Preview är live nu | Förhandsversionen är över. GA har lanserats |
En punkt löstes inte. Uppdelningen av parametrar är fortfarande omtvistad. MarkTechPosts lanseringsartikel säger rakt ut att antalet aktiva parametrar inte offentliggjordes av Alibaba, medan SiliconANGLE, The Decoder och Coursiv alla anger ~95 miljarder aktiva. Vi läste om MarkTechPost-artikeln 2026-08-04 och den säger fortfarande ej offentliggjort. Någons källor är fel, och det ärliga att säga är att rapporteringen kring just den här siffran gick isär på lanseringsdagen.
Vi kunde inte verifiera det åt något håll. OpenRouters /models-svar exponerar inget fält för antal parametrar överhuvudtaget, så inget i våra tester bekräftar eller motbevisar 2,4T totalt eller 95B aktiva.
Är Qwen3.8-Max Open Source? Inte Den 4 Augusti
Nej. Per 2026-08-04 är Qwen3.8-Max endast tillgänglig via API. Alibaba har schemalagt vikterna för release "nästa vecka" på Hugging Face och ModelScope, och har inte tillkännagivit någon licens. Bevakningen fortsätter att slå ihop "tillgänglig" med "öppen", och den distinktionen är hela poängen. Det finns inga vikter att ladda ner idag, oavsett vad en rubrik säger.
Tre olika tillstånd slås ihop till ett enda ord. De är inte samma sak:
| Tillstånd | Qwen3.8-Max 2026-08-04 |
|---|---|
| Tillgänglig via API | Ja. Alibaba Cloud Model Studio, plus återförsäljare och routrar |
| Vikter nedladdningsbara | Nej. Utlovat "nästa vecka", inget datum angivet |
| Licensvillkor | Ej tillkännagivet. Ingen text finns att läsa |
Vi kontrollerade de starkaste tillgängliga bevisen istället för att ta någons ord för det: en sökning på Hugging Face efter Qwen3.8 den 2026-08-04 ger inget Alibaba-modellkort. Det den ger är fyra community-uppladdningar med namnet Qwen3.8_4B_Distilled och varianter, som är tredjepartsdistillationer, inte flaggskeppet. Om du snabbt skummar den sidan är det lätt att förväxla dem med den riktiga releasen.
En notering om licensen, eftersom prejudikat ständigt rapporteras som ett löfte. Qwen 3.5 och Qwen 3.6 släpptes båda under Apache 2.0. En restriktiv community-licens vid 2,4T skulle tekniskt fortfarande vara "öppna vikter" samtidigt som den förändrar vad du får bygga med dem. Tills det finns licenstext gissar alla som säger vad du kan göra med de här vikterna. Det är också varför Qwen3.8-Max inte finns med i vår sammanställning av open source-LLM:er värda att köra 2026: den kvalificerar sig ännu inte.
Vad Vi Mätte: 4x Billigare Per Anrop Trots En Prisökning På 35.6%
Vi körde 40 fakturerade anrop mot qwen3.8-max, qwen3.7-max och qwen3-max via OpenRouter 2026-08-04, total kostnad $1.4728. Varje kostnad nedan beräknades från det returnerade usage-objektet och stämdes av mot OpenRouters egen fakturerade siffra. Alla stämde. Huvudfyndet går tvärtemot prisförändringen.
Börja med priset. Skarp prissättning från GET /models 2026-08-04 sätter 3.8-Max på $2.00 in / $6.00 ut per miljon tokens mot 3.7-Max på $1.475 / $4.425. Det är en 35.6% ökning på båda sidor, och kvoten är identisk oavsett håll (2.000/1.475 = 6.000/4.425 = 1.3559). Du kan stämma av de aktuella siffrorna på OpenRouters modellsida.
Nu samma triviala prompt skickad till alla tre modeller, tre körningar vardera, temperature: 0, strömmad:
| Modell | Första token (3 körningar) | Första synliga innehåll | Väggtid (3 körningar) | Completion-tokens | varav resonemang | Median kostnad/anrop |
|---|---|---|---|---|---|---|
| qwen3.8-max | 2.249s / 0.874s / 1.054s | 5.414s / 5.058s / 4.209s | 6.338s / 6.734s / 5.130s | 242 / 287 / 243 | 156 / 194 / 157 | $0.001592 |
| qwen3.7-max | 4.871s / 1.157s / 1.670s | aldrig / 22.358s / 25.998s | 31.147s / 24.013s / 27.661s | 1502 / 1281 / 1443 | 1500 / 1174 / 1346 | $0.006428 |
| qwen3-max | 2.617s / 2.892s / 2.386s | 2.617s / 2.892s / 2.386s | 4.401s / 4.601s / 4.081s | 105 / 105 / 107 | 0 / 0 / 0 | $0.000431 |
Två separata kolumner för första token behövs eftersom båda resonemangsmodellerna strömmar dolt resonemang innan någon svarstext kommer. På 3.8-Max anländer en token på under en sekund i två av tre körningar, men det första ordet en användare faktiskt kan läsa landar fyra till fem sekunder senare. På 3.7-Max körning 1 landade det aldrig alls. Om du bygger ett strömmande UI mot en resonemangsmodell fortsätter spinnaren att snurra långt efter att anslutningen bevisligen är aktiv.
Läs resonemangskolumnen två gånger. På en prompt som bad om en förklaring av ett Bloom-filter på tre meningar spenderade 3.7-Max mellan 1,174 och 1,500 resonemangstokens. 3.8-Max spenderade 156 till 194. Det är ungefär 7x mindre tänkande för samma svar, och resonemangstokens faktureras till utdata-priset. Resultatet: 3.8-Max är ungefär 4x billigare per anrop och 4 till 5 gånger snabbare i väggtid från vår maskin, inklusive nätverkets tur-och-retur, samtidigt som den kostar 35.6% mer per token. Katalogpriset gick upp och notan gick ner.
Det vänder när prompterna växer. Modellerat utifrån skarp prissättning snarare än uppmätt kostar ett anrop på 30,000 tokens med 500 utdatatokens $63.00 per tusen anrop på 3.8-Max mot $46.46 på 3.7-Max. Vid 100,000 indatatokens är det $203.00 mot $149.71. När merparten av dina tokens är indata slutar resonemangseffektiviteten kompensera för prisökningen och 3.8-Max blir den dyraste av de tre. Vilken modell som är billigast beror helt på din kvot mellan in- och utdata, vilket är samma lärdom vår LLM API-prisjämförelse fortsätter landa i.
reasoning_effort Är Nytt, Och 3.7-Max Ignorerar Det Tyst
reasoning_effort finns bland 3.8-Max stödda parametrar men inte bland 3.7-Max. På 3.8-Max flyttar den nålen måttligt: över tre körningar vardera gav minimal 67, 108 och 124 resonemangstokens mot high på 163, 136 och 173. Medianer på 108 mot 163, på samma prompt, vid temperature 0.
Fyndet som kostar pengar gäller den äldre modellen. Att skicka reasoning_effort: "low" till 3.7-Max accepteras istället för att avvisas, och ignoreras sedan: det anropet brände ändå 1,401 resonemangstokens och fakturerade samma $0.006689 som det identiskt formade anropet vi loggade. Inget fel, ingen varning, ingen effekt. Om du justerar kostnad genom att sänka resonemangsnivån, verifiera att det faktiskt gör något på modellen du anropar, för en icke-stödd parameter här misslyckas tyst istället för högljutt.
Fällan Med Tomma Svar Du Bör Kontrollera Innan Du Migrerar
Vår första testkörning använde max_tokens: 400 och kraschade vårt eget skript. Anledningen visade sig vara värd mer än testet. Qwen3.7-Max kan spendera hela sin tokenbudget på resonemang och returnera en tom sträng, med finish_reason: "length", fullt fakturerad.
Vi råkade ut för det tre separata gånger. Vid max_tokens: 400: 402 completion-tokens, 400 av dem resonemang, noll svarstecken, $0.001822 fakturerat. Vid max_tokens: 1500: 1,502 tokens, 1,500 resonemang, noll tecken, $0.006689 för ingenting. Och en gång till på ett senare anrop, $0.006735. Inget fel, inget undantag, bara ett svarsobjekt som ser flytande ut med en tom content-sträng.
Om du migrerar en befintlig 3.7-Max-integration och din kod sätter ett måttligt max_tokens, avsätt tid för att testa den här vägen. 3.8-Max betydligt kortare resonemang gör den märkbart mindre exponerad. Den är inte immun.
En Liten Tokenoverhead Ingen Nämner
Den identiska prompten på 12 ord räknades till 67 prompt-tokens på 3.8-Max och 29 på 3.7-Max, konsekvent i varje körning (27 på qwen3-max). Det är ungefär 38 tokens fast overhead, förmodligen en större system- eller chattmall. På ett RAG-anrop på 100,000 tokens rundas det till noll. På en högvolymklassificerare som avfyrar korta prompter mer än fördubblar det din indatafaktura innan du har skrivit ett ord.
Tar Qwen3.8-Max Verkligen Emot Bilder Och Video?
Ja, och multimodal indata är genuint nytt i den här generationen, inte en omdöpning. API:et rapporterar text+image+video->text för 3.8-Max och enbart text för 3.7-Max. Vi verifierade skillnaden genom att skicka samma bild till båda, och den äldre modellen avvisade den på routinglagret.
Vi genererade testbilden lokalt med en handskriven PNG-encoder så att facit var känt genom konstruktion: 750x270 pixlar, svarta blocksiffror 4739 på vitt, med en röd horisontell stapel över toppen. Skickad base64-kodad, qwen3.8-max returnerade DIGITS: 4739 och TOPBAR: red. Korrekt på båda punkterna, 6.99s, $0.002146. Den identiska begäran till qwen3.7-max kom tillbaka som HTTP 404 {"error":{"message":"No endpoints found that support image input"}}.
Video fungerar också, med ett förbehåll vi nästan rapporterade som ett fel. Två av de tre offentliga MP4-URL:erna vi testade returnerade HTTP 400 "Failed to download multimodal content". Det är Alibaba som misslyckas hämta filen, inte routen som avvisar video. Med en URL den kunde hämta beskrev 3.8-Max ett Big Buck Bunny-klipp korrekt, inklusive att namnge karaktären, på 24.24s för $0.006528.
Två praktiska noteringar innan du bygger på det här. Videon fakturerades som 696 vanliga prompt-tokens för ett klipp på ungefär 10 sekunder, och usage.prompt_tokens_details.video_tokens rapporterade 0, så du kan inte bryta ut videokostnaden från det fältet. Och en felformad content-del misslyckas tyst: att skicka {"type": "video", "video": [url]} istället för video_url returnerade HTTP 200 där modellen artigt sa att den inte kunde se någon video, plus en faktura. Använd video_url.
Värt att veta: när vi bad 3.8-Max beskriva sina egna förmågor svarade den Input modalities: text. Det är fel, vilket nästa test i vår egen körning visade. En modells självbeskrivning är en språkmodells output, inte ett datablad.
Hur Bra Håller Kontextfönstret På 1M Tokens?
Vi planterade tre unika fakta på 10%, 50% och 90% djup i genererad utfyllnad och bad om alla tre i ett anrop. 18 av 18 nålar kom tillbaka korrekta över sex körningar på två modeller, vid promptstorlekar från 5,723 upp till 247,911 tokens, bedömt genom exakt strängmatchning i kod snarare än genom att läsa svaren.
Våra qwen3.8-max-körningar (de två qwen3.7-max-körningarna på 83,380 och 247,873 tokens, och en qwen3-max-körning på 78,255, returnerade också varje nål):
| Prompt-tokens (qwen3.8-max) | Latens | Kostnad | Nålar hittade |
|---|---|---|---|
| 5,723 | 9.24s | $0.01409 | 3 av 3 |
| 25,703 | 13.43s | $0.05453 | 3 av 3 |
| 83,418 | 17.63s | $0.16965 | 3 av 3 |
| 247,911 | 38.54s | $0.49828 | 3 av 3 |
Latensen skalar sublinjärt, vilket är den praktiskt användbara delen: 43x fler indata-tokens kostar bara 4.2x mer väggtid.
Nu de ärliga begränsningarna, för det här är den enkla änden av långkontext-utvärdering. Att hämta ett ordagrant planterat faktum säger väldigt lite om resonemang över ett stort dokument, och vi testade varje storlek en gång. Vi körde inget anrop på 1M tokens. Vid $2.00 per miljon indatatokens skulle ett sådant ha kostat cirka $2.00, mer än hela den här testkörningen, och ett enda prov skulle inte ha berättat mycket. Det utlovade taket på 1M är därför overifierat av oss. Och 3.7-Max matchade 3.8-Max exakt vid båda storlekarna vi jämförde, så långkontext-hämtning är inte där den här generationen skiljer sig åt.
En prisfälla dök upp här som lanseringsbevakningen helt missar. qwen3-max har trappade prisöverstyrningar som fördubblar priset över 32,000 prompt-tokens och höjer det igen över 128,000, medan 3.8-Max och 3.7-Max är fastprissatta oavsett längd. Vi bekräftade trappan från faktisk fakturering: vårt anrop på 78,255 tokens till qwen3-max debiterades $0.12227, $1.56/M-taxan, inte rubrikens $0.78/M. Vid den längden kostar det nästan exakt vad 3.7-Max kostar ($0.12523). Rubrikpriset är mindre än hälften. Det verkliga priset vid 80k tokens är en avrundningsfelmarginal bort.
Alibabas Fem Benchmarkresultat, Och Varför Inget Av Dem Är Verifierat
Alibaba publicerade fem benchmarkresultat i samband med GA-lanseringen. Varenda ett av dem kommer från Alibabas egna interna körningar, och vi hittade ingen oberoende utvärdering publicerad per 2026-08-04. Den meningen förtjänar att stå bredvid siffrorna istället för tre stycken under dem.
| Benchmark | Alibaba-rapporterat resultat | Verifierat av tredje part? |
|---|---|---|
| Terminal-Bench 2.1 | 86.6 | Nej, per 2026-08-04 |
| GPQA Diamond | 92.6 | Nej, per 2026-08-04 |
| PaperBench | 93.0 | Nej, per 2026-08-04 |
| OSWorld-Verified | 86.1 | Nej, per 2026-08-04 |
| DeepSWE 1.1 | 56.6 (föregångare: 21.6) | Nej, per 2026-08-04 |
Alibaba rapporterade också ett internt aggregat på 0.725, upp från 0.474, och positionerade modellen som nära eller över Claude Opus 4.8, Fable 5 och GPT-5.6 Sol. Arena-placeringar cirkulerade också: 5:e i Text Arena och 2:a i Vision Arena enligt Alibabas eget tillkännagivande 2026-08-03, vilket vi inte har omverifierat mot den skarpa topplistan. Arena-rankningar rör sig dagligen. Betrakta varje rankning du läser den här veckan som en ögonblicksbild med ett datum på sig.
Det ingen har mätt ännu, oss inräknat: genomströmning under samtidighet, prestanda på andra språk än engelska, säkerhets- och alignment-utvärderingar, samt tillförlitlighet vid tool-calling. Våra egna siffror täcker latens, kostnad, modalitet och långkontext-hämtning på en enda väg, och inget annat. Bloombergs lanseringsrapport upprepade benchmarkpåståendena utan oberoende testning, vilket är där i princip all bevakning befinner sig just nu.
För siffror som faktiskt har kontrollerats är vår jämförelse Qwen vs DeepSeek vs GLM den bättre referensen, och Kimi K3 på ungefär 2.8T är storleksrivalen alla benchmarkar det här mot.
Qwen3.8 vs Qwen3-8B, Och Vändningen Kring Öppna Vikter Bakom Den Här Lanseringen
Qwen3.8 är Alibabas flaggskepp med 2,4 biljoner parametrar. Qwen3-8B är en tät modell med 8 miljarder parametrar från Qwen3-serien, nedladdningsbar sedan 2025. Namn som ser lika ut, men skiljer sig ungefär 300x i storlek. Sökmotorer blandar fortfarande ihop dem, och det gör förvånansvärt många forumsvar också.
Namnproblemet blev värre den här veckan, inte bättre. Det enda på Hugging Face som just nu bär namnet "Qwen3.8" är community-4B-distillationer. Om du letar efter vikter och tar en av dem laddar du ner något som saknar koppling till 2,4T-modellen.
Två Stängda Flaggskepp, Sedan Detta
Löftet om öppna vikter är den egentliga nyheten här, och det läses annorlunda när du ser familjehistoriken. Alibaba spenderade två generationer på att driva en medveten uppdelning: öppna vikt-arbetshästar för alla, stängt flaggskepp i toppen.
| Generation | Vikter | Anteckningar |
|---|---|---|
| Qwen 3.5 (0.8B till 397B-A17B) | Öppna, Apache 2.0 | Hela familjen släpptes offentligt |
| Qwen 3.6 (27B tät, 35B-A3B MoE) | Öppna, Apache 2.0 | Samma mönster höll i sig |
| Qwen3.7-Max | Stängda | Endast API. Ingen GGUF, ingen Hugging Face-checkpoint |
| Qwen3.8-Max | Utlovat öppen, ännu ej levererad | "Nästa vecka" per 2026-08-03. Licens ej tillkännagiven |
Alibaba höll flaggskeppsnivån stängd i två generationer i rad och säger nu att de kommer öppna den största modell de någonsin byggt. Om vikterna landar som utlovat är det en verklig kursändring, och det sätter press på varje labb som behandlar "frontier-nivån förblir stängd" som en självklarhet. Om de dröjer blir det här den tredje stängda Max-lanseringen i rad. Båda utfallen är fortfarande möjliga per 2026-08-04. Vi såg samma dynamik utspela sig med GLM 5.2, där den levererade licensen spelade större roll än tillkännagivandet.
Kan Du Köra Qwen3.8-Max Själv? (Fortfarande Nej)
Nej, och GA-specifikationerna gör det tydligare snarare än mindre tydligt. Med 2,4 biljoner parametrar totalt är det här ingen modell du serverar på egen hårdvara, ens efter att vikterna släppts. DeepSeek-V3.2 på 685B beskrivs redan av folk som faktiskt gjort det som ett seriöst infrastrukturprojekt. Det här är flera gånger så stort.
Så vad ger en öppen vikt-modell på 2,4T dig egentligen?
- Inferensleverantörer kan hosta den, vilket innebär priskonkurrens, vilket innebär att din kostnad per token sjunker
- Suveräna, reglerade och luftgapade driftsättningar blir möjliga på den här nivån för första gången
- Forskare och finjusterare får en basmodell i frontier-skala att arbeta med
- Det betyder inte att den körs på din maskin, din enda A100, eller din startups GPU-budget
Om du vill ha aritmetiken för vad det faktiskt krävs för att köra stora öppen vikt-modeller gör vår guide till VRAM-krav för LLM den matematiken ordentligt. Kortversionen för den här modellen: låt bli.
Ska Du Byta, Testa Eller Vänta?
| Din situation | Vad vi skulle göra 2026-08-04 |
|---|---|
| Kör Qwen3.7-Max i produktion | Testa 3.8-Max på kortprompts-trafik först. Det är där vår 4x kostnadsskillnad visade sig. Kontrollera sedan din max_tokens-hantering för fallet med tomma svar |
| Långkontext- eller tung RAG-arbetsbelastning | Sitt still för nu. 3.8-Max kostar 35.6% mer per token och matchade 3.7-Max exakt i vårt hämtningstest |
| Du behöver bild- eller videoindata | Det här är anledningen att byta. 3.7-Max kan inte ta emot en bild alls, och vi bekräftade 404:an |
| Väntar på öppna vikter | Notera 2026-08-10 i kalendern. Inget att göra förrän det finns ett modellkort och en licens att läsa |
| Nöjd med Claude eller GPT | Inget förändras idag. Alibabas benchmarkresultat är overifierade, och overifierade siffror är inget skäl att migrera |
Metoden spelar större roll än domslutet. Varje modell vi har produktionstestat har betett sig annorlunda än dess topplisteplacering, eftersom dina prompter, din kodbas och din tolerans för omförsök inte finns med i någons benchmark. Två kodningsuppgifter i vår körning visar poängen: 3.8-Max och 3.7-Max fick båda 11 av 11 på en strängbreddsavkortningsuppgift och klarade båda 5,000 av 5,000 fuzzade fall på datumaritmetik. På korrekthet kunde vi inte skilja dem åt. Gapet vi mätte finns i latens och tokenförbrukning på enkla prompter, inte i förmåga på svåra.
Väger du en migrering och vill ha ett andra par ögon på kostnadsmodellen? Låt vårt team stresstesta den på din arbetsbelastning.
Alla siffror verifierade 2026-08-04. Prissättning, arena-rankningar och tidslinjen för vikterna ändras ofta. Våra mätningar kommer från en enda väg (OpenRouter till Alibaba), en maskin, en dag, med n=3 för latens och n=1 för de flesta funktionella tester.
Vanliga Frågor
Är Qwen3.8-Max open source?
Inte per 2026-08-04. Den är endast tillgänglig via API. Alibaba har schemalagt vikterna för "nästa vecka" på Hugging Face och ModelScope, och har inte tillkännagivit någon licens. Rubriker som kallar den open source ligger före fakta. En sökning på Hugging Face ger bara tredjeparts-4B-distillationer, inget Alibaba-modellkort.
Hur mycket kostar Qwen3.8-Max?
$2.00 per miljon indatatokens och $6.00 per miljon utdata, med cachad indata rapporterad till $0.25. Det är 35.6% mer än Qwen3.7-Max på båda sidor. Vi mätte en median på $0.001592 per kort anrop, ungefär 4x billigare än 3.7-Max på samma prompt, eftersom den avger betydligt färre resonemangstokens.
Hur många parametrar har Qwen3.8-Max?
2,4 biljoner totalt, enligt Alibabas tillkännagivande och alla som rapporterar om det. Det aktiva antalet är omtvistat: SiliconANGLE, The Decoder och Coursiv rapporterar ~95 miljarder aktiva, medan MarkTechPost anger att Alibaba inte offentliggjorde det. API:et exponerar inget parameterfält, så vi kunde inte verifiera någon av siffrorna.
Vilket kontextfönster har Qwen3.8-Max?
Det skarpa API:et rapporterar 1,000,000 tokens kontext och 131,072 maximala completion-tokens. Vi testade hämtning upp till 247,911 tokens utan några fel. Vi körde inget anrop på 1M tokens, eftersom ett sådant skulle ha kostat cirka $2.00 och överstigit vår testbudget, så toppen av det fönstret är overifierad av oss.
Stödjer Qwen3.8-Max bild- och videoindata?
Ja till båda, och vi verifierade dem. Den läste siffror och en färg korrekt från en lokalt genererad PNG, och beskrev en video korrekt när den fick en URL Alibaba kunde hämta. Qwen3.7-Max avvisar bilder rakt av med en 404. Två av våra tre testade video-URL:er misslyckades vid leverantörens hämtningssteg.
Är Qwen3.8-Max benchmarkresultat oberoende verifierade?
Nej. Terminal-Bench 2.1 på 86.6, GPQA Diamond på 92.6, PaperBench på 93.0, OSWorld-Verified på 86.1 och DeepSWE 1.1 på 56.6 kommer alla från Alibabas interna körningar. Per 2026-08-04 hittade vi ingen tredjepartsutvärdering publicerad för någon av dem.
Kan jag köra Qwen3.8-Max lokalt?
Realistiskt sett nej, även när vikterna väl släpps. Med 2,4 biljoner parametrar är den flera gånger storleken av DeepSeek-V3.2, som redan är ett genuint infrastrukturprojekt att självhosta. Räkna med att konsumera den via inferensleverantörer snarare än dina egna GPU:er, om du inte driver ett datacenter.
Bör jag migrera från Qwen3.7-Max till Qwen3.8-Max?
Det beror på din tokenmix. På korta prompter mätte vi 3.8-Max till ungefär en fjärdedel av kostnaden och fyra till fem gånger hastigheten. På arbetsbelastningar med lång indata kostar den 35.6% mer och presterade identiskt i vårt hämtningstest. Om du behöver bild- eller videoindata kan 3.7-Max inte göra det alls.
När släpps Qwen3.8-Max vikter?
Alibaba sa "nästa vecka" i sitt tillkännagivande 2026-08-03, och namngav Hugging Face och ModelScope som destinationer. Inget exakt datum, och ingen licenstext. En kompletterande öppen vikt-modell, Qwen3.8-27B, rapporteras släppas tillsammans med dem. Vi planerar att kontrollera igen 2026-08-10.