Techsy
Kontakt
Kom i gang
Tilbage til blog
ai-machine-learning

Qwen3.8-Max Er Her: 2.4T Parametre, 1M Kontekst, Og Vægtene Er Her Stadig Ikke

Skrevet af Mert Batur
Opdateret Aug 4, 2026
16 minutters læsning
Indholdsfortegnelse
Qwen3.8-Max Er Her: 2.4T Parametre, 1M Kontekst, Og Vægtene Er Her Stadig Ikke

Qwen3.8-Max Er Her: 2.4T Parametre, 1M Kontekst, Og Vægtene Er Her Stadig Ikke

$1.4728. Det er, hvad 40 levende API-kald på tværs af Qwen3.8-Max og dens to forgængere kostede os den 2026-08-04, dagen efter Alibaba udgav den. Overraskelsen var ikke de 2.4 billioner parametre. Det var dette: 3.8-Max opkræver 35.6% mere pr. token end Qwen3.7-Max og endte alligevel med at være omkring 4x billigere pr. svar, fordi den holdt op med at overtænke. Endnu en ting, som det meste lanceringsdækning får galt. Den er ikke open source. Ikke i dag.

Dette indlæg blev først udgivet 2026-07-19, da Qwen3.8 var en preview uden offentliggjorte specifikationer. Det blev omskrevet 2026-08-04 op mod GA-udgivelsen og vores egne API-tests.

Nøglepointer

  • Fra og med 2026-08-04 er Qwen3.8-Max kun tilgængelig via API. Alibaba har lovet vægtene "i næste uge", hvilket betyder ugen omkring 2026-08-10, på Hugging Face og ModelScope.
  • Vi målte $0.001592 pr. kort kald mod $0.006428 på Qwen3.7-Max, på trods af en højere pris pr. token.
  • Alibabas fem benchmark-scorer er leverandørrapporterede. Vi fandt ingen uafhængig evaluering offentliggjort pr. 2026-08-04.
  • Billed- og videoinput er reelle og nye. Vi verificerede begge dele mod API'et og mod 3.7-Max's afvisning.

Hvad Ændrede Sig Mellem Preview Og GA

Qwen3.8-Max blev generelt tilgængelig den 2026-08-03, og udgivelsen besvarede ethvert åbent spørgsmål, denne side listede for to uger siden. Preview-æraen gav os et parametertal og et løfte. GA-udgivelsen tilføjede et bekræftet kontekstvindue på 1M tokens, tekst plus billede plus videoinput, fem offentliggjorte benchmark-scorer og en pris pr. token.

Her er den gamle liste over ubekendte, nu afklaret:

Hvad denne side sagde den 2026-07-19Status den 2026-08-04
Offentliggjort benchmark-score: ingenFem Alibaba-rapporterede scorer offentliggjort
Aktive parametre / MoE-konfiguration: ikke offentliggjortBredt rapporteret som ~95B aktive, sparse MoE. Rapporteringen er modstridende, se nedenfor
Kontekstvindue og maks. output: ikke annonceret1M ind, 131,072 ud, bekræftet af det levende API
Modalitet: ikke annoncerettekst + billede + video ind, tekst ud. Vi verificerede dette selv
Pris pr. token: ikke specificeret$2.00 / M input, $6.00 / M output
Dato for open-weight-udgivelse: "snart", ingen dato"Næste uge", Hugging Face og ModelScope nævnt
Qwen3.8-Max-Preview er live nuPreview er slut. GA er udgivet

Ét punkt blev ikke afklaret. Fordelingen af parametre er stadig omstridt. MarkTechPosts lanceringsartikel siger ligeud, at det aktive parametertal ikke blev offentliggjort af Alibaba, mens SiliconANGLE, The Decoder og Coursiv alle skriver ~95 milliarder aktive. Vi genlæste MarkTechPost-artiklen den 2026-08-04, og den siger stadig ikke offentliggjort. Nogens kilder er forkerte, og det ærlige er at fortælle dig, at rapporteringen om netop dette tal var modstridende på lanceringsdagen.

Vi kunne ikke verificere det den ene eller den anden vej. OpenRouters /models-svar afslører slet ikke noget parametertal-felt, så intet i vores test bekræfter eller afkræfter 2.4T totalt eller 95B aktive.

Er Qwen3.8-Max Open Source? Ikke Den 4. August

Nej. Fra og med 2026-08-04 er Qwen3.8-Max kun tilgængelig via API. Alibaba har planlagt vægtene til udgivelse "næste uge" på Hugging Face og ModelScope, og har ikke annonceret nogen licens. Dækningen bliver ved med at slå "tilgængelig" sammen med "åben", og netop den forskel er hele historien. Der er ingen vægte at downloade i dag, uanset hvad en overskrift siger.

Tre tilstande bliver slået sammen til ét ord. De er ikke det samme:

TilstandQwen3.8-Max den 2026-08-04
Tilgængelig via APIJa. Alibaba Cloud Model Studio, plus forhandlere og routere
Vægte til downloadNej. Lovet "næste uge", ingen dato givet
LicensvilkårIkke annonceret. Ingen tekst findes at læse

Vi tjekkede det hårdeste tilgængelige bevis i stedet for at tage nogens ord for det: en Hugging Face-søgning efter Qwen3.8 den 2026-08-04 returnerer intet Alibaba-modelkort. Det, den returnerer, er fire community-uploads ved navn Qwen3.8_4B_Distilled og varianter, som er tredjeparts-destillater, ikke flagskibet. Hvis du scanner den side hurtigt, er det let at forveksle dem med den rigtige udgivelse.

En bemærkning om licensen, fordi præcedens bliver ved med at blive rapporteret som løfte. Qwen 3.5 og Qwen 3.6 blev begge udgivet under Apache 2.0. En restriktiv community-licens ved 2.4T ville stadig teknisk set være "åbne vægte", mens det ændrer, hvad du må bygge med dem. Indtil der findes licenstekst, gætter alle, der fortæller dig, hvad du kan gøre med disse vægte. Det er også derfor, Qwen3.8-Max ikke er med i vores oversigt over open source-LLM'er, det er værd at køre i 2026: den kvalificerer sig ikke endnu.

Hvad Vi Målte: 4x Billigere Pr. Kald Trods En Prisstigning På 35.6%

Vi kørte 40 fakturerede kald mod qwen3.8-max, qwen3.7-max og qwen3-max gennem OpenRouter den 2026-08-04, samlet forbrug $1.4728. Hver omkostning nedenfor blev beregnet ud fra det returnerede usage-objekt og krydstjekket mod OpenRouters egne fakturerede tal. Alle stemte overens. Hovedfundet peger den modsatte vej af prisændringen.

Start med prisen. Live-priser fra GET /models den 2026-08-04 sætter 3.8-Max til $2.00 ind / $6.00 ud pr. million tokens mod 3.7-Max til $1.475 / $4.425. Det er en stigning på 35.6% på begge sider, og forholdet er identisk uanset hvordan man regner (2.000/1.475 = 6.000/4.425 = 1.3559). Du kan selv tjekke de aktuelle tal på OpenRouters modelside.

Nu den samme trivielle prompt sendt til alle tre modeller, tre kørsler hver, temperature: 0, streamet:

ModelFørste token (3 kørsler)Første synlige indholdVentetid (3 kørsler)Completion-tokensheraf reasoningMedian omkostning/kald
qwen3.8-max2.249s / 0.874s / 1.054s5.414s / 5.058s / 4.209s6.338s / 6.734s / 5.130s242 / 287 / 243156 / 194 / 157$0.001592
qwen3.7-max4.871s / 1.157s / 1.670saldrig / 22.358s / 25.998s31.147s / 24.013s / 27.661s1502 / 1281 / 14431500 / 1174 / 1346$0.006428
qwen3-max2.617s / 2.892s / 2.386s2.617s / 2.892s / 2.386s4.401s / 4.601s / 4.081s105 / 105 / 1070 / 0 / 0$0.000431

To separate kolonner for første token er nødvendige, fordi begge reasoning-modeller streamer skjult ræsonnement, før der kommer noget svartekst. På 3.8-Max ankommer et token på under et sekund i to af tre kørsler, men det første ord, en bruger faktisk kan læse, lander fire til fem sekunder senere. På 3.7-Max kørsel 1 landede det slet ikke. Bygger du en streaming-UI mod en reasoning-model, bliver spinneren ved med at spinne længe efter, at forbindelsen har bevist, den er i live.

Læs reasoning-kolonnen to gange. På en prompt om en tre-sætnings forklaring af et Bloom-filter brugte 3.7-Max mellem 1,174 og 1,500 reasoning-tokens. 3.8-Max brugte 156 til 194. Det er cirka 7x mindre tænkning for det samme svar, og reasoning-tokens faktureres til output-taksten. Resultatet: 3.8-Max er omkring 4x billigere pr. kald og 4 til 5 gange hurtigere i ventetid fra vores maskine, netværks-roundtrip inklusive, mens den koster 35.6% mere pr. token. Mærkatprisen gik op, og regningen gik ned.

Det vender, når prompts vokser. Modelleret ud fra live-priser snarere end målt: et kald på 30,000 tokens med 500 output-tokens koster $63.00 pr. tusind kald på 3.8-Max mod $46.46 på 3.7-Max. Ved 100,000 input-tokens er det $203.00 mod $149.71. Når de fleste af dine tokens er input, holder reasoning-effektivitetsfordelen op med at betale for prisstigningen, og 3.8-Max bliver den dyreste af de tre. Hvilken model der er billigst, afhænger reelt af dit forhold mellem input og output, hvilket er samme lære, vores sammenligning af LLM API-priser bliver ved med at lande på.

reasoning_effort Er Ny, Og 3.7-Max Ignorerer Den Stiltiende

reasoning_effort optræder i 3.8-Max's understøttede parametre og ikke i 3.7-Max's. På 3.8-Max flytter den nålen moderat: på tværs af tre kørsler hver gav minimal 67, 108 og 124 reasoning-tokens mod high med 163, 136 og 173. Median 108 mod 163, på samme prompt, ved temperature 0.

Det fund, der koster penge, findes på den ældre model. At sende reasoning_effort: "low" til 3.7-Max bliver accepteret i stedet for afvist, og bliver derefter ignoreret: det kald brugte stadig 1,401 reasoning-tokens og fakturerede de samme $0.006689 som det identisk formede kald, vi loggede. Ingen fejl, ingen advarsel, ingen effekt. Justerer du omkostninger ved at sænke reasoning-effort, skal du verificere, at det rent faktisk gør noget på den model, du kalder, for en ikke-understøttet parameter fejler her stille i stedet for højlydt.

Fælden Med Tomme Svar, Du Bør Tjekke Før En Migrering

Vores første testkørsel brugte max_tokens: 400 og crashede vores eget script. Årsagen viste sig at være mere værd end selve testen. Qwen3.7-Max kan bruge hele sit token-budget på ræsonnement og returnere en tom streng, med finish_reason: "length", faktureret fuldt ud.

Vi ramte det tre separate gange. Ved max_tokens: 400: 402 completion-tokens, 400 af dem reasoning, nul svartegn, $0.001822 faktureret. Ved max_tokens: 1500: 1,502 tokens, 1,500 reasoning, nul tegn, $0.006689 for ingenting. Og endnu en gang på et senere kald, $0.006735. Ingen fejl, ingen exception, bare et flydende-udseende svarobjekt med en tom content-streng.

Migrerer du en eksisterende 3.7-Max-integration, og din kode sætter en beskeden max_tokens, så afsæt tid til at teste denne sti. 3.8-Max's markant kortere ræsonnement gør den meget mindre udsat. Immun er den ikke.

En Lille Token-Overhead, Ingen Nævner

Den identiske 12-ords-prompt talte 67 prompt-tokens på 3.8-Max og 29 på 3.7-Max, konsekvent på tværs af hver kørsel (27 på qwen3-max). Det er cirka 38 tokens fast overhead, formodentlig en større system- eller chat-skabelon. På et RAG-kald på 100,000 tokens runder det til ingenting. På en klassifikator med høj volumen, der affyrer korte prompts, mere end fordobler det din input-regning, før du har skrevet et ord.

Accepterer Qwen3.8-Max Virkelig Billeder Og Video?

Ja, og multimodalt input er ægte nyt i denne generation, ikke en omdøbning. API'et rapporterer text+image+video->text for 3.8-Max og kun tekst for 3.7-Max. Vi verificerede forskellen ved at sende det samme billede til begge, og den ældre model afviste det på routing-laget.

Vi genererede testbilledet lokalt med en håndskrevet PNG-encoder, så facit var kendt ved konstruktion: 750x270 pixels, sorte blokcifre 4739 på hvid baggrund, med en rød vandret bjælke øverst. Sendt base64-kodet returnerede qwen3.8-max DIGITS: 4739 og TOPBAR: red. Korrekt på begge punkter, 6.99s, $0.002146. Den identiske forespørgsel til qwen3.7-max kom tilbage som HTTP 404 {"error":{"message":"No endpoints found that support image input"}}.

Video virker også, med et forbehold, vi nær havde rapporteret som en fejl. To af de tre offentlige MP4-URL'er, vi prøvede, returnerede HTTP 400 "Failed to download multimodal content". Det er Alibaba, der ikke kan hente filen, ikke ruten, der afviser video. Med en URL, den kunne hente, beskrev 3.8-Max et Big Buck Bunny-klip nøjagtigt, inklusive at navngive karakteren, på 24.24s for $0.006528.

To praktiske noter, før du bygger på dette. Videoen blev faktureret som 696 almindelige prompt-tokens for et klip på cirka 10 sekunder, og usage.prompt_tokens_details.video_tokens rapporterede 0, så du kan ikke udspecificere videoomkostningen fra det felt. Og en fejlformet content-del fejler stille: at sende {"type": "video", "video": [url]} i stedet for video_url returnerede HTTP 200, hvor modellen høfligt sagde, den ikke kunne se nogen video, plus en regning. Brug video_url.

Værd at vide: da vi bad 3.8-Max beskrive sine egne evner, svarede den Input modalities: text. Det er forkert, som den næste test i vores egen kørsel demonstrerede. En models selvbeskrivelse er et sprogmodel-output, ikke et specifikationsark.

Hvor Godt Holder Kontekstvinduet På 1M Tokens?

Vi plantede tre unikke fakta ved 10%, 50% og 90% dybde i genereret fyldtekst og bad om alle tre i ét kald. 18 ud af 18 nåle kom korrekt tilbage på tværs af seks kørsler på to modeller, ved prompt-størrelser fra 5,723 op til 247,911 tokens, bedømt ved eksakt substreng-match i kode fremfor ved at læse svarene.

Vores qwen3.8-max-kørsler (de to qwen3.7-max-kørsler ved 83,380 og 247,873 tokens, og én qwen3-max-kørsel ved 78,255, returnerede også alle nåle):

Prompt-tokens (qwen3.8-max)VentetidOmkostningNåle fundet
5,7239.24s$0.014093 af 3
25,70313.43s$0.054533 af 3
83,41817.63s$0.169653 af 3
247,91138.54s$0.498283 af 3

Ventetiden skalerer sub-lineært, hvilket er den praktisk nyttige del: 43x flere input-tokens koster kun 4.2x mere ventetid.

Nu de ærlige begrænsninger, for dette er den lette ende af evaluering af lang kontekst. At hente et ordret plantet faktum siger meget lidt om ræsonnement på tværs af et stort dokument, og vi testede hver størrelse én gang. Vi kørte ikke et kald på 1M tokens. Ved $2.00 pr. million input-tokens ville ét have kostet omkring $2.00, mere end hele denne testkørsel, og én enkelt stikprøve ville ikke have fortalt os meget. Det annoncerede loft på 1M er derfor ikke verificeret af os. Og 3.7-Max matchede 3.8-Max nøjagtigt ved begge størrelser, vi sammenlignede, så hentning i lang kontekst er ikke der, hvor denne generation skiller sig ud.

En prisfælde dukkede op her, som lanceringsdækningen helt overser. qwen3-max har trin-baserede prisoverstyringer, der fordobler taksten over 32,000 prompt-tokens og hæver den igen over 128,000, mens 3.8-Max og 3.7-Max har fast takst uanset længde. Vi bekræftede trinnet ud fra faktisk fakturering: vores kald på 78,255 tokens til qwen3-max blev faktureret $0.12227, altså $1.56/M-taksten, ikke $0.78/M-mærkatprisen. Ved den længde koster den næsten præcis det samme som 3.7-Max ($0.12523). Dens mærkatpris er mindre end det halve. Dens reelle pris ved 80k tokens er en afrundingsfejl fra.

Alibabas Fem Benchmark-Scorer, Og Hvorfor Ingen Af Dem Er Verificeret

Alibaba offentliggjorde fem benchmark-scorer med GA-udgivelsen. Hver eneste af dem kommer fra Alibabas egne interne kørsler, og vi fandt ingen uafhængig evaluering offentliggjort pr. 2026-08-04. Den sætning fortjener at stå lige ved siden af tallene i stedet for tre afsnit nedenunder.

BenchmarkAlibaba-rapporteret scoreVerificeret af tredjepart?
Terminal-Bench 2.186.6Nej, pr. 2026-08-04
GPQA Diamond92.6Nej, pr. 2026-08-04
PaperBench93.0Nej, pr. 2026-08-04
OSWorld-Verified86.1Nej, pr. 2026-08-04
DeepSWE 1.156.6 (forgænger: 21.6)Nej, pr. 2026-08-04

Alibaba rapporterede også et internt aggregat på 0.725, op fra 0.474, og placerede modellen nær eller over Claude Opus 4.8, Fable 5 og GPT-5.6 Sol. Arena-placeringer cirkulerede også: 5. plads i Text Arena og 2. plads i Vision Arena ifølge Alibabas egen annoncering fra 2026-08-03, som vi ikke har bekræftet igen på det levende leaderboard. Arena-placeringer flytter sig dagligt. Betragt enhver placering, du læser i denne uge, som et øjebliksbillede med en dato på.

Hvad ingen har målt endnu, os inklusive: gennemløb under samtidighed, ikke-engelsk ydeevne, sikkerheds- og alignment-evalueringer, og pålidelighed ved tool-calling. Vores egne tal dækker ventetid, omkostning, modalitet og hentning ved lang kontekst på én rute, og intet andet. Bloombergs lanceringsartikel gentog benchmark-påstandene uden uafhængig test, hvilket er der, hvor stort set al dækning befinder sig lige nu.

For tal, der rent faktisk er tjekket, er vores sammenligning af Qwen mod DeepSeek mod GLM den bedre reference, og Kimi K3 på cirka 2.8T er den størrelsesrival, alle benchmarker den her op imod.

Qwen3.8 Vs Qwen3-8B, Og Vendingen Om Åbne Vægte Bag Denne Udgivelse

Qwen3.8 er Alibabas 2.4-billion-parameter flagskib. Qwen3-8B er en tæt model på 8 milliarder parametre fra Qwen3-serien, downloadbar siden 2025. Ens-lydende navne, cirka 300x fra hinanden i størrelse. Søgemaskiner blander stadig de to sammen, og det gør et overraskende antal foruminlæg også.

Navneforvirringen blev værre denne uge, ikke bedre. De eneste ting på Hugging Face med et "Qwen3.8"-navn lige nu er community 4B-destillater. Går du på jagt efter vægte og griber en af dem, downloader du noget uden relation til 2.4T-modellen.

To Lukkede Flagskibe, Så Dette

Løftet om åbne vægte er den egentlige nyhed her, og det læser anderledes, når man ser familiehistorien. Alibaba brugte to generationer på en bevidst opdeling: åben-vægt-arbejdsheste til alle, lukket flagskib i toppen.

GenerationVægteNoter
Qwen 3.5 (0.8B til 397B-A17B)Åben, Apache 2.0Hele familien udgivet offentligt
Qwen 3.6 (27B tæt, 35B-A3B MoE)Åben, Apache 2.0Samme mønster holdt
Qwen3.7-MaxLukketKun API. Ingen GGUF, intet Hugging Face-checkpoint
Qwen3.8-MaxLovet åben, endnu ikke udgivet"Næste uge" pr. 2026-08-03. Licens ikke annonceret

Alibaba lukkede flagskibs-niveauet i to generationer i træk og siger nu, at de vil åbne den største model, de nogensinde har bygget. Lander vægtene som lovet, er det en reel vending, og det lægger pres på hvert eneste laboratorium, der behandler "topmodellen forbliver lukket" som afgjort. Glipper de, bliver dette den tredje lukkede Max-udgivelse i træk. Begge udfald er stadig i spil den 2026-08-04. Vi så samme dynamik udspille sig med GLM 5.2, hvor den udgivne licens betød mere end annonceringen.

Kan Du Selv Køre Qwen3.8-Max? (Stadig Nej)

Nej, og GA-specifikationerne gør det tydeligere snarere end mindre tydeligt. Ved 2.4 billioner parametre i alt er dette ikke en model, du serverer på dit eget hardware, selv efter vægtene er udgivet. DeepSeek-V3.2 ved 685B er allerede beskrevet af folk, der har gjort det, som et seriøst infrastrukturprojekt. Dette er flere gange så meget.

Så hvad giver en åben-vægt 2.4T-model dig egentlig?

  • Inference-udbydere kan hoste den, hvilket betyder priskonkurrence, hvilket betyder din pris pr. token falder
  • Suveræne, regulerede og air-gappede implementeringer bliver mulige på dette niveau for første gang
  • Forskere og fine-tunere får en base-model i topklasse at arbejde ud fra
  • Det betyder ikke, at den kører på din maskine, din ene A100 eller din startups GPU-budget

Vil du have regnestykket på, hvad det reelt kræver at køre store åben-vægt-modeller, gør vores guide til LLM VRAM-krav det regnestykke ordentligt. Den korte version for denne model: lad være.

Skal Du Skifte, Teste Eller Vente?

Din situationHvad vi ville gøre den 2026-08-04
Kører Qwen3.7-Max i produktionTest 3.8-Max på kort-prompt-trafik først. Det er der, vores 4x-omkostningsforskel viste sig. Tjek derefter din max_tokens-håndtering for det tomme-svar-scenarie
Lang-kontekst eller tung RAG-arbejdsbelastningBliv, hvor du er, for nu. 3.8-Max koster 35.6% mere pr. token og matchede 3.7-Max nøjagtigt på vores hentningstest
Du har brug for billed- eller videoinputDette er grunden til at skifte. 3.7-Max kan slet ikke tage et billede, og vi bekræftede 404'en
Venter på åbne vægteNotér dig 2026-08-10. Intet at gøre, før der findes et modelkort og en licens at læse
Tilfreds med Claude eller GPTIntet ændrer sig i dag. Alibabas benchmark-scorer er ikke verificerede, og ikke-verificerede tal er ikke et migreringsargument

Metoden betyder mere end konklusionen. Hver eneste model, vi har produktionstestet, har opført sig anderledes end sin leaderboard-placering, fordi dine prompts, din kodebase og din tolerance for gentagne forsøg ikke findes i nogens benchmark. To kodeopgaver i vores kørsel understreger pointen: 3.8-Max og 3.7-Max scorede begge 11 ud af 11 på en opgave om strengbredde-afkortning og bestod begge 5,000 af 5,000 fuzzede tilfælde af datoregning. Med hensyn til korrekthed kunne vi ikke skelne dem fra hinanden. Forskellen, vi målte, ligger i ventetid og token-forbrug på lette prompts, ikke i evne på svære.

Overvejer du en migrering og vil have et ekstra sæt øjne på omkostningsmodellen? Lad vores team stresteste den mod din arbejdsbelastning.

Alle tal verificeret den 2026-08-04. Priser, arena-placeringer og tidsplanen for vægtene ændrer sig hyppigt. Vores målinger stammer fra én rute (OpenRouter til Alibaba), én maskine, én dag, med n=3 for ventetid og n=1 for de fleste funktionelle tests.

Ofte Stillede Spørgsmål

Er Qwen3.8-Max Open Source?

Ikke den 2026-08-04. Den er kun tilgængelig via API. Alibaba har planlagt vægtene til "næste uge" på Hugging Face og ModelScope, og har ikke annonceret nogen licens. Overskrifter, der kalder den open source, er foran fakta. En Hugging Face-søgning returnerer kun tredjeparts-4B-destillater, ikke et Alibaba-modelkort.

Hvor Meget Koster Qwen3.8-Max?

$2.00 pr. million input-tokens og $6.00 pr. million output, med cachet input rapporteret til $0.25. Det er 35.6% mere end Qwen3.7-Max på begge sider. Vi målte en median på $0.001592 pr. kort kald, omkring 4x billigere end 3.7-Max på samme prompt, fordi den udsender langt færre reasoning-tokens.

Hvor Mange Parametre Har Qwen3.8-Max?

2.4 billioner i alt, ifølge Alibabas annoncering og alle medier, der dækker den. Det aktive antal er omstridt: SiliconANGLE, The Decoder og Coursiv rapporterer ~95 milliarder aktive, mens MarkTechPost siger, Alibaba ikke offentliggjorde det. API'et afslører intet parameterfelt, så vi kunne ikke verificere nogen af tallene.

Hvilket Kontekstvindue Har Qwen3.8-Max?

Det levende API rapporterer 1,000,000 tokens kontekst og 131,072 maks. completion-tokens. Vi testede hentning op til 247,911 tokens uden fejl. Vi kørte ikke et kald på 1M tokens, fordi ét ville have kostet omkring $2.00 og overskredet vores testbudget, så toppen af det vindue er ikke verificeret af os.

Understøtter Qwen3.8-Max Billed- Og Videoinput?

Ja til begge, og vi verificerede dem. Den læste cifre og en farve korrekt fra en lokalt genereret PNG, og beskrev en video nøjagtigt, når den fik en URL, Alibaba kunne hente. Qwen3.7-Max afviser billeder helt med en 404. To af vores tre test-video-URL'er fejlede ved udbyderens downloadtrin.

Er Qwen3.8-Max's Benchmark-Scorer Uafhængigt Verificerede?

Nej. Terminal-Bench 2.1 på 86.6, GPQA Diamond på 92.6, PaperBench på 93.0, OSWorld-Verified på 86.1 og DeepSWE 1.1 på 56.6 kommer alle fra Alibabas interne kørsler. Pr. 2026-08-04 fandt vi ingen tredjepartsevaluering offentliggjort for nogen af dem.

Kan Jeg Køre Qwen3.8-Max Lokalt?

Realistisk set nej, selv når vægtene udgives. Ved 2.4 billioner parametre er den flere gange så stor som DeepSeek-V3.2, som allerede er et reelt infrastrukturprojekt at selv-hoste. Forvent at forbruge den gennem inference-udbydere frem for dine egne GPU'er, medmindre du driver et datacenter.

Bør Jeg Migrere Fra Qwen3.7-Max Til Qwen3.8-Max?

Det afhænger af din token-blanding. På korte prompts målte vi 3.8-Max til omkring en fjerdedel af omkostningen og fire til fem gange hastigheden. På arbejdsbelastninger med langt input koster den 35.6% mere og præsterede identisk på vores hentningstest. Har du brug for billed- eller videoinput, kan 3.7-Max slet ikke gøre det.

Hvornår Bliver Qwen3.8-Max's Vægte Udgivet?

Alibaba sagde "næste uge" i sin annoncering fra 2026-08-03 og nævnte Hugging Face og ModelScope som destinationerne. Ingen præcis dato, og ingen licenstekst. En følgemodel med åbne vægte, Qwen3.8-27B, rapporteres at skulle udgives samtidig med dem. Vi planlægger at tjekke igen den 2026-08-10.

Tags

qwen-3-8qwen3-8-maxopen-weight-llmalibaba-qwenllm-tooling

Del denne artikel

Relaterede artikler

Mere fra ai-machine-learning

ai-machine-learning
Aug 4, 2026

Gitar AI Code Review: Hvad Sonar Egentlig Købte (Anmeldelse 2026)

Sonar overtog Gitar den 21. maj 2026. Denne anmeldelse dækker, hvad Gitars CI-validerede autofix egentlig gør, $20- og $40-planerne, hvor det slår CodeRabbit og Greptile, og de ærlige grunde til at springe det over.

10 min læsning minutters læsning
Læs
ai-machine-learning
Aug 3, 2026

Agent Tool Calling-bedste praksis: Derfor vælger din agent det forkerte værktøj

Din agent vælger det forkerte værktøj, fordi fejlen sidder fire bestemte steder: valg, argumenter, løkker og svarstørrelse. Denne guide diagnosticerer hver fejltype først og kobler derefter otte bedste praksisser for agent tool calling på dem, med kode, skemaer og en evalueringsløkke, du kan køre ved hver ændring.

14 minutters læsning minutters læsning
Læs
ai-machine-learning
Aug 3, 2026

RAG vs finjustering: Hvornår skal du vælge hvad (med rigtige tal)

RAG henter fakta ved forespørgselstidspunktet; finjustering bager viden ind i modellens vægte. En arXiv-undersøgelse med 162 citeringer kørte begge dele på samme opgave, og vinderen overrasker de fleste teams. Her er beslutningsrammen med rigtigt omkostningsregnskab på offentlige listepriser.

14 min læsning minutters læsning
Læs
Se alle indlæg
Start dit projekt

Klar til at bygge noget ekstraoordinær?

Lad os gøre din vision til virkelighed. Vores team står klar til at hjælpe dig med at skabe software, der gør en forskel.

Book et 30 min. scopemødeSe vores arbejde

Fra biblioteket

Claude Skills

Se alle
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-automatiseringer

Se alle
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Fra biblioteket

Claude Skills

Se alle
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-automatiseringer

Se alle
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Tjenester

  • Entertainmentløsninger
  • Mobilapps
  • Webapplikationer

Løsninger

  • CRM-systemer
  • AI-integration
  • ERP-løsninger
  • Stemmeargenter
  • Processautomatisering
  • Cybersikkerhed

Bibliotek

  • Blog
  • Portfolio

Fællesskab

  • AI-automatiseringer
  • Claude Skills

Værktøjer

  • Pris på mobil-app
  • OpenAI / LLM API-prisreknemaskine
  • Pris på MVP
  • Pris på stemme-AI-agent

Virksomhed

  • Om
  • Partnere
  • Kontakt

Juridisk

  • Privatlivspolitik
  • Salgsbetingelser
  • Cookiepolitik

Tjenester

  • Entertainmentløsninger
  • Mobilapps
  • Webapplikationer

Løsninger

  • CRM-systemer
  • AI-integration
  • ERP-løsninger
  • Stemmeargenter
  • Processautomatisering
  • Cybersikkerhed

Bibliotek

  • Blog
  • Portfolio

Fællesskab

  • AI-automatiseringer
  • Claude Skills

Værktøjer

  • Pris på mobil-app
  • OpenAI / LLM API-prisreknemaskine
  • Pris på MVP
  • Pris på stemme-AI-agent

Virksomhed

  • Om
  • Partnere
  • Kontakt
JuridiskPrivatlivspolitikSalgsbetingelserCookiepolitik
TECHSY
© 2026 Techsy. Alle rettigheder forbeholdes.