
Qwen3.8-Max a Sosit: 2.4T Parametri, Context de 1M și Ponderile Tot Nu Sunt Disponibile
$1.4728. Atât au costat 40 de apeluri API live pe Qwen3.8-Max și cei doi predecesori ai săi pe 2026-08-04, a doua zi după ce Alibaba l-a lansat. Surpriza n-a fost cei 2.4 trilioane de parametri. A fost aceasta: 3.8-Max percepe cu 35.6% mai mult per token decât Qwen3.7-Max și tot a ieșit cu aproximativ 4x mai ieftin per răspuns, pentru că a renunțat să „gândească" excesiv. Încă un lucru pe care majoritatea presei de lansare îl greșește. Nu este open source. Nu astăzi.
Acest articol a fost publicat inițial pe 2026-07-19, când Qwen3.8 era o previzualizare fără specificații publicate. A fost rescris pe 2026-08-04 pe baza lansării GA și a propriilor noastre teste API.
Concluzii Cheie
- Începând cu 2026-08-04, Qwen3.8-Max este disponibil doar prin API. Alibaba a promis ponderile „săptămâna viitoare", adică săptămâna de 2026-08-10, pe Hugging Face și ModelScope.
- Am măsurat $0.001592 per apel scurt, față de $0.006428 pentru Qwen3.7-Max, în ciuda unui preț per token mai mare.
- Cele cinci scoruri de benchmark ale Alibaba sunt raportate de vendor. Nu am găsit nicio evaluare independentă publicată până la 2026-08-04.
- Introducerea de imagini și video este reală și nouă. Am verificat ambele funcții față de API și față de refuzul lui 3.7-Max.
Ce S-a Schimbat Între Previzualizare Și Lansarea GA
Qwen3.8-Max a devenit disponibil general (GA) pe 2026-08-03, iar lansarea a răspuns la toate întrebările deschise pe care această pagină le enumera acum două săptămâni. Era previzualizării ne-a oferit un număr de parametri și o promisiune. Lansarea GA a adăugat o fereastră de context confirmată de 1M tokeni, intrare text plus imagine plus video, cinci scoruri de benchmark publicate și un preț per token.
Iată vechiul registru al necunoscutelor, rezolvate:
| Ce spunea această pagină pe 2026-07-19 | Status pe 2026-08-04 |
|---|---|
| Orice scor de benchmark publicat: niciunul | Cinci scoruri raportate de Alibaba publicate |
| Parametri activi / configurație MoE: nedivulgat | Raportat pe scară largă ca ~95B activi, MoE rar. Rapoartele sunt contradictorii, vezi mai jos |
| Fereastră de context și ieșire maximă: neanunțate | 1M la intrare, 131,072 la ieșire, confirmat de API-ul live |
| Modalitate: neanunțată | text + imagine + video la intrare, text la ieșire. Am verificat noi înșine |
| Preț per token: nedetaliat | $2.00 / M intrare, $6.00 / M ieșire |
| Data lansării ponderilor deschise: „în curând", fără dată | „Săptămâna viitoare", Hugging Face și ModelScope numite |
| Qwen3.8-Max-Preview este live acum | Previzualizarea s-a încheiat. GA a fost lansat |
Un element nu s-a rezolvat. Împărțirea parametrilor rămâne contestată. Articolul de lansare al MarkTechPost afirmă clar că numărul de parametri activi nu a fost divulgat de Alibaba, în timp ce SiliconANGLE, The Decoder și Coursiv scriu toate ~95 de miliarde activi. Am recitit articolul MarkTechPost pe 2026-08-04 și tot spune „nedivulgat". Cineva are o sursă greșită, iar lucrul onest de spus este că raportarea despre acest număr specific a fost contradictorie în ziua lansării.
Nu am putut verifica în niciun sens. Răspunsul /models al OpenRouter nu expune niciun câmp pentru numărul de parametri, așa că nimic din testele noastre nu confirmă sau infirmă 2.4T total sau 95B activi.
Este Qwen3.8-Max Open Source? Nu Pe 4 August
Nu. Începând cu 2026-08-04, Qwen3.8-Max este disponibil doar prin API. Alibaba a programat lansarea ponderilor „săptămâna viitoare" pe Hugging Face și ModelScope, și nu a anunțat nicio licență. Presa continuă să comprime „disponibil" în „deschis", iar această distincție este toată povestea. Nu există ponderi de descărcat astăzi, indiferent ce spune un titlu.
Trei stări sunt comprimate într-un singur cuvânt. Nu sunt același lucru:
| Stare | Qwen3.8-Max pe 2026-08-04 |
|---|---|
| Disponibil prin API | Da. Alibaba Cloud Model Studio, plus reselleri și routere |
| Ponderi descărcabile | Nu. Promise pentru „săptămâna viitoare", fără dată precizată |
| Termeni de licență | Neanunțați. Nu există niciun text de citit |
Am verificat cea mai solidă dovadă disponibilă, în loc să ne bazăm pe cuvântul cuiva: o căutare pe Hugging Face pentru Qwen3.8 pe 2026-08-04 nu returnează niciun model card Alibaba. Ce returnează sunt patru încărcări comunitare numite Qwen3.8_4B_Distilled și variante, care sunt distilări terțe, nu modelul flagship. Dacă parcurgi rapid acea pagină, e ușor să le confunzi cu lansarea reală.
O notă despre licență, pentru că precedentul continuă să fie raportat drept angajament. Qwen 3.5 și Qwen 3.6 au fost lansate ambele sub Apache 2.0. O licență comunitară restrictivă la 2.4T ar fi în continuare tehnic „ponderi deschise", dar ar schimba ce ai voie să construiești cu ele. Până nu există text de licență, oricine îți spune ce poți face cu aceste ponderi ghicește. De aceea Qwen3.8-Max nici nu apare în selecția noastră de LLM-uri open-source demne de rulat în 2026: încă nu se califică.
Ce Am Măsurat: De 4x Mai Ieftin Per Apel, Cu Toate Că Prețul A Crescut Cu 35.6%
Am rulat 40 de apeluri facturate pe qwen3.8-max, qwen3.7-max și qwen3-max prin OpenRouter pe 2026-08-04, cheltuială totală $1.4728. Fiecare cost de mai jos a fost calculat din obiectul usage returnat și verificat încrucișat cu cifra facturată de OpenRouter. Toate s-au potrivit. Concluzia principală merge în direcția opusă schimbării de preț.
Să începem cu prețul. Prețurile live din GET /models pe 2026-08-04 plasează 3.8-Max la $2.00 intrare / $6.00 ieșire per milion de tokeni, față de 3.7-Max la $1.475 / $4.425. Aceasta este o creștere de 35.6% pe ambele părți, iar raportul este identic în ambele cazuri (2.000/1.475 = 6.000/4.425 = 1.3559). Poți verifica cifrele actuale pe pagina modelului OpenRouter.
Acum același prompt banal trimis la toate cele trei modele, trei rulări fiecare, temperature: 0, în stream:
| Model | Primul token (3 rulări) | Primul conținut vizibil | Timp total (3 rulări) | Tokeni de completare | din care raționament | Cost median/apel |
|---|---|---|---|---|---|---|
| qwen3.8-max | 2.249s / 0.874s / 1.054s | 5.414s / 5.058s / 4.209s | 6.338s / 6.734s / 5.130s | 242 / 287 / 243 | 156 / 194 / 157 | $0.001592 |
| qwen3.7-max | 4.871s / 1.157s / 1.670s | niciodată / 22.358s / 25.998s | 31.147s / 24.013s / 27.661s | 1502 / 1281 / 1443 | 1500 / 1174 / 1346 | $0.006428 |
| qwen3-max | 2.617s / 2.892s / 2.386s | 2.617s / 2.892s / 2.386s | 4.401s / 4.601s / 4.081s | 105 / 105 / 107 | 0 / 0 / 0 | $0.000431 |
Sunt necesare două coloane separate pentru primul token, pentru că ambele modele de raționament transmit raționament ascuns înainte de orice text de răspuns. La 3.8-Max, un token sosește în mai puțin de o secundă în două din trei rulări, dar primul cuvânt pe care un utilizator îl poate citi efectiv ajunge patru până la cinci secunde mai târziu. La rularea 1 a lui 3.7-Max, acesta nu a ajuns niciodată. Dacă construiești o interfață de streaming pe un model de raționament, indicatorul de încărcare continuă să se rotească mult după ce conexiunea și-a dovedit că e activă.
Citește de două ori coloana de raționament. La un prompt care cerea o explicație în trei propoziții a unui filtru Bloom, 3.7-Max a cheltuit între 1,174 și 1,500 de tokeni de raționament. 3.8-Max a cheltuit 156 până la 194. Asta înseamnă cu aproximativ 7x mai puțină „gândire" pentru același răspuns, iar tokenii de raționament sunt facturați la rata de ieșire. Rezultatul: 3.8-Max este cu aproximativ 4x mai ieftin per apel și de 4 până la 5 ori mai rapid ca timp total, măsurat de pe mașina noastră, incluzând round-trip-ul de rețea, în timp ce costă cu 35.6% mai mult per token. Prețul afișat a crescut, iar factura a scăzut.
Asta se inversează pe măsură ce prompturile cresc. Modelat din prețurile live, nu măsurat, un apel de 30,000 de tokeni de intrare cu 500 de tokeni de ieșire costă $63.00 la mia de apeluri pe 3.8-Max, față de $46.46 pe 3.7-Max. La 100,000 de tokeni de intrare, este $203.00 față de $149.71. Odată ce majoritatea tokenilor tăi sunt de intrare, avantajul eficienței de raționament încetează să compenseze creșterea de preț, iar 3.8-Max devine cel mai scump dintre cele trei. Care model este cel mai ieftin depinde cu adevărat de raportul tău intrare-ieșire, ceea ce este exact lecția pe care comparația noastră de prețuri API pentru LLM-uri o repetă mereu.
reasoning_effort Este Nou, Iar 3.7-Max Îl Ignoră În Tăcere
reasoning_effort apare printre parametrii suportați de 3.8-Max, dar nu și la 3.7-Max. La 3.8-Max mișcă acul modest: pe trei rulări fiecare, minimal a produs 67, 108 și 124 de tokeni de raționament, față de high la 163, 136 și 173. Mediane de 108 față de 163, pe același prompt, la temperature 0.
Descoperirea care costă bani e la modelul mai vechi. Trimiterea reasoning_effort: "low" către 3.7-Max este acceptată, nu respinsă, și apoi ignorată: acel apel tot a ars 1,401 tokeni de raționament, facturând aceiași $0.006689 ca apelul cu aceeași formă pe care l-am înregistrat. Fără eroare, fără avertisment, fără efect. Dacă ajustezi costul reducând efortul de raționament, verifică dacă are vreun efect pe modelul pe care îl apelezi de fapt, pentru că aici un parametru nesuportat eșuează în tăcere, nu zgomotos.
Capcana Răspunsului Gol Pe Care Ar Trebui S-o Verifici Înainte De Migrare
Prima noastră rulare de test a folosit max_tokens: 400 și ne-a blocat propriul script. Motivul s-a dovedit a fi mai valoros decât testul în sine. Qwen3.7-Max își poate cheltui tot bugetul de tokeni pe raționament și poate returna un șir gol, cu finish_reason: "length", facturat integral.
Am întâlnit asta de trei ori separat. La max_tokens: 400: 402 tokeni de completare, 400 dintre ei raționament, zero caractere de răspuns, $0.001822 facturați. La max_tokens: 1500: 1,502 tokeni, 1,500 raționament, zero caractere, $0.006689 pentru nimic. Și încă o dată, la un apel ulterior, $0.006735. Fără eroare, fără excepție, doar un obiect de răspuns cu aspect fluent și un șir de conținut gol.
Dacă migrezi o integrare existentă cu 3.7-Max și codul tău setează un max_tokens modest, alocă timp să testezi acest scenariu. Raționamentul mult mai scurt al lui 3.8-Max îl face semnificativ mai puțin expus. Nu e imun.
Un Mic Overhead De Tokeni Pe Care Nimeni Nu-l Menționează
Același prompt de 12 cuvinte a numărat 67 de tokeni de intrare la 3.8-Max și 29 la 3.7-Max, constant la fiecare rulare (27 la qwen3-max). Asta înseamnă aproximativ 38 de tokeni de overhead fix, probabil un system prompt sau template de chat mai mare. La un apel RAG de 100,000 de tokeni, se rotunjește la nimic. La un clasificator de volum mare care trimite prompturi scurte, îți dublează factura de intrare înainte să scrii vreun cuvânt.
Acceptă Qwen3.8-Max Cu Adevărat Imagini Și Video?
Da, iar intrarea multimodală e chiar nouă în această generație, nu o simplă redenumire. API-ul raportează text+image+video->text pentru 3.8-Max și doar text pentru 3.7-Max. Am verificat diferența trimițând aceeași imagine la ambele, iar modelul mai vechi a respins-o la nivelul de rutare.
Am generat local imaginea de test cu un encoder PNG scris de mână, astfel încât adevărul de referință era cunoscut prin construcție: 750x270 pixeli, cifre bloc negre 4739 pe fundal alb, cu o bară orizontală roșie în partea de sus. Trimisă codificată base64, qwen3.8-max a returnat DIGITS: 4739 și TOPBAR: red. Corect pe ambele criterii, 6.99s, $0.002146. Cererea identică la qwen3.7-max a revenit cu HTTP 404 {"error":{"message":"No endpoints found that support image input"}}.
Video-ul funcționează și el, cu o avertizare pe care am fost aproape s-o raportăm drept eșec. Două din cele trei URL-uri MP4 publice pe care le-am încercat au returnat HTTP 400 "Failed to download multimodal content". Asta e Alibaba care nu reușește să descarce fișierul, nu ruta care refuză video-ul. Cu un URL pe care l-a putut prelua, 3.8-Max a descris corect un clip Big Buck Bunny, inclusiv numele personajului, în 24.24s pentru $0.006528.
Două note practice înainte să construiești pe asta. Video-ul a fost facturat ca 696 de tokeni obișnuiți de prompt pentru un clip de aproximativ 10 secunde, iar usage.prompt_tokens_details.video_tokens a raportat 0, deci nu poți separa costul video din acest câmp. Iar o parte de conținut malformată eșuează în tăcere: trimiterea {"type": "video", "video": [url]} în loc de video_url a returnat HTTP 200 cu modelul spunând politicos că nu poate vedea niciun video, plus o factură. Folosește video_url.
Merită știut: când i-am cerut lui 3.8-Max să-și descrie propriile capabilități, a răspuns Input modalities: text. Asta e greșit, după cum a demonstrat următorul test din propria noastră rulare. Auto-descrierea unui model este o ieșire de model de limbaj, nu o fișă tehnică.
Cât De Bine Rezistă Fereastra De Context De 1M Tokeni?
Am plantat trei fapte unice la 10%, 50% și 90% adâncime în text de umplutură generat și am cerut toate trei într-un singur apel. 18 din 18 „ace" au revenit corecte în șase rulări pe două modele, la dimensiuni de prompt de la 5,723 până la 247,911 tokeni, evaluate prin potrivire exactă de substring în cod, nu prin citirea răspunsurilor.
Rulările noastre pentru qwen3.8-max (cele două rulări qwen3.7-max la 83,380 și 247,873 tokeni, și o rulare qwen3-max la 78,255, au returnat de asemenea fiecare ac):
| Tokeni de prompt (qwen3.8-max) | Latență | Cost | Ace găsite |
|---|---|---|---|
| 5,723 | 9.24s | $0.01409 | 3 din 3 |
| 25,703 | 13.43s | $0.05453 | 3 din 3 |
| 83,418 | 17.63s | $0.16965 | 3 din 3 |
| 247,911 | 38.54s | $0.49828 | 3 din 3 |
Latența scalează sub-liniar, ceea ce este partea cu adevărat utilă: 43x mai mulți tokeni de intrare costă doar 4.2x mai mult timp total.
Acum limitele oneste, pentru că asta e partea ușoară a evaluării de context lung. Recuperarea unui fapt plantat verbatim spune foarte puțin despre raționamentul pe un document mare, iar noi am testat fiecare dimensiune o singură dată. Nu am rulat un apel de 1M tokeni. La $2.00 per milion de tokeni de intrare, unul ar fi costat aproximativ $2.00, mai mult decât întreaga noastră rulare de test, iar un singur eșantion nu ne-ar fi spus prea multe. Plafonul anunțat de 1M este așadar neverificat de noi. Iar 3.7-Max a egalat exact 3.8-Max la ambele dimensiuni comparate, deci recuperarea de context lung nu este locul unde această generație se diferențiază.
O capcană de preț a ieșit la iveală aici, pe care presa de lansare o ratează complet. qwen3-max are praguri de preț diferențiate care îi dublează rata peste 32,000 de tokeni de prompt și o măresc din nou peste 128,000, în timp ce 3.8-Max și 3.7-Max au preț fix la orice lungime. Am confirmat pragul din facturarea reală: apelul nostru de 78,255 tokeni către qwen3-max a fost taxat cu $0.12227, rata de $1.56/M, nu rata afișată de $0.78/M. La această lungime, costă aproape exact cât costă 3.7-Max ($0.12523). Prețul lui afișat este mai mic de jumătate. Prețul lui real la 80k tokeni e la o eroare de rotunjire distanță.
Cele Cinci Scoruri De Benchmark Ale Alibaba, Și De Ce Niciunul Nu E Verificat
Alibaba a publicat cinci scoruri de benchmark odată cu lansarea GA. Fiecare dintre ele provine din rulările interne proprii ale Alibaba, iar noi nu am găsit nicio evaluare independentă publicată până la 2026-08-04. Această propoziție merită să stea lângă cifre, nu la trei paragrafe mai jos.
| Benchmark | Scor raportat de Alibaba | Verificat de o terță parte? |
|---|---|---|
| Terminal-Bench 2.1 | 86.6 | Nu, până la 2026-08-04 |
| GPQA Diamond | 92.6 | Nu, până la 2026-08-04 |
| PaperBench | 93.0 | Nu, până la 2026-08-04 |
| OSWorld-Verified | 86.1 | Nu, până la 2026-08-04 |
| DeepSWE 1.1 | 56.6 (predecesor: 21.6) | Nu, până la 2026-08-04 |
Alibaba a mai raportat un agregat intern de 0.725, în creștere de la 0.474, și a poziționat modelul aproape de sau peste Claude Opus 4.8, Fable 5 și GPT-5.6 Sol. Au circulat și clasamente de arenă: locul 5 în Text Arena și locul 2 în Vision Arena conform anunțului propriu al Alibaba din 2026-08-03, pe care nu l-am reconfirmat pe clasamentul live. Clasamentele de arenă se mișcă zilnic. Tratează orice clasament pe care îl citești săptămâna asta drept o instantanee cu o dată pe ea.
Ce nimeni n-a măsurat încă, inclusiv noi: throughput sub concurență, performanță non-engleză, evaluări de siguranță și aliniere, și fiabilitatea apelurilor de unelte. Cifrele noastre acoperă doar latența, costul, modalitatea și recuperarea de context lung pe o singură rută, și nimic altceva. Raportul de lansare al Bloomberg a repetat afirmațiile de benchmark fără testare independentă, ceea ce e locul unde se află practic toată presa în acest moment.
Pentru cifre care au fost verificate, comparația noastră Qwen vs DeepSeek vs GLM e referința mai bună, iar Kimi K3, la aproximativ 2.8T, e rivalul de dimensiune cu care toată lumea îl compară.
Qwen3.8 vs Qwen3-8B, Și Inversarea De Ponderi Deschise Din Spatele Acestei Lansări
Qwen3.8 este modelul flagship al Alibaba, cu 2.4 trilioane de parametri. Qwen3-8B este un model dens cu 8 miliarde de parametri din seria Qwen3, descărcabil din 2025. Nume asemănătoare, aproximativ 300x diferență ca mărime. Motoarele de căutare tot le confundă, la fel și un număr surprinzător de răspunsuri de pe forumuri.
Problema de denumire s-a înrăutățit săptămâna asta, nu s-a îmbunătățit. Singurele lucruri de pe Hugging Face care poartă numele „Qwen3.8" acum sunt distilări comunitare de 4B. Dacă mergi să cauți ponderi și iei una dintre ele, descarci ceva fără nicio legătură cu modelul de 2.4T.
Două Modele Flagship Închise, Apoi Acesta
Promisiunea de ponderi deschise e adevărata veste aici, și se citește diferit odată ce vezi istoricul familiei. Alibaba a petrecut două generații rulând o separare deliberată: modele de lucru cu ponderi deschise pentru toată lumea, flagship închis în vârf.
| Generație | Ponderi | Note |
|---|---|---|
| Qwen 3.5 (0.8B până la 397B-A17B) | Deschise, Apache 2.0 | Întreaga familie lansată public |
| Qwen 3.6 (27B dens, 35B-A3B MoE) | Deschise, Apache 2.0 | Același model s-a menținut |
| Qwen3.7-Max | Închis | Doar API. Fără GGUF, fără checkpoint pe Hugging Face |
| Qwen3.8-Max | Promis deschis, încă nelansat | „Săptămâna viitoare" începând cu 2026-08-03. Licență neanunțată |
Alibaba a ținut închis nivelul flagship timp de două generații la rând și acum spune că va deschide cel mai mare model pe care l-a construit vreodată. Dacă ponderile ajung conform promisiunii, aceasta e o inversare reală și pune presiune pe orice laborator care tratează „nivelul de frontieră rămâne închis" ca pe ceva decis. Dacă întârzie, aceasta devine a treia lansare Max închisă la rând. Ambele rezultate sunt încă posibile la 2026-08-04. Am văzut aceeași dinamică la GLM 5.2, unde licența efectiv lansată a contat mai mult decât anunțul.
Poți Rula Qwen3.8-Max Singur? (Tot Nu)
Nu, iar specificațiile GA fac asta mai clar, nu mai puțin clar. La 2.4 trilioane de parametri totali, nu e un model pe care să-l servești pe hardware-ul propriu, nici măcar după ce ponderile apar. DeepSeek-V3.2, la 685B, e deja descris drept un proiect serios de infrastructură de cei care l-au rulat. Ăsta e de câteva ori mai mare.
Deci ce-ți aduce de fapt un model deschis de 2.4T?
- Furnizorii de inferență îl pot găzdui, ceea ce înseamnă concurență de preț, ceea ce înseamnă că costul tău per token scade
- Implementările suverane, reglementate și izolate (air-gapped) devin posibile la acest nivel pentru prima dată
- Cercetătorii și cei care fac fine-tuning primesc un model de bază de nivel frontieră cu care să lucreze
- Nu înseamnă că rulează pe mașina ta, pe un singur A100 al tău, sau pe bugetul de GPU al startup-ului tău
Dacă vrei aritmetica pentru ce cere efectiv rularea modelelor mari cu ponderi deschise, ghidul nostru de cerințe VRAM pentru LLM-uri face bine acest calcul. Varianta scurtă pentru acest model: nu.
Ar Trebui Să Treci, Să Testezi Sau Să Aștepți?
| Situația ta | Ce am face noi pe 2026-08-04 |
|---|---|
| Rulezi Qwen3.7-Max în producție | Testează 3.8-Max mai întâi pe trafic cu prompturi scurte. Acolo a apărut diferența noastră de cost de 4x. Apoi verifică gestionarea max_tokens pentru cazul răspunsului gol |
| Workload cu context lung sau RAG intens | Rămâi pe loc deocamdată. 3.8-Max costă cu 35.6% mai mult per token și a egalat exact 3.7-Max la testul nostru de recuperare |
| Ai nevoie de intrare de imagine sau video | Acesta e motivul să te muți. 3.7-Max nu poate accepta o imagine deloc, iar noi am confirmat eroarea 404 |
| Aștepți ponderile deschise | Notează-ți 2026-08-10. Nimic de făcut până nu există un model card și o licență de citit |
| Mulțumit cu Claude sau GPT | Nimic nu se schimbă astăzi. Scorurile de benchmark ale Alibaba sunt neverificate, iar cifrele neverificate nu sunt un motiv de migrare |
Metoda contează mai mult decât verdictul. Fiecare model pe care l-am testat în producție s-a comportat diferit față de poziția lui în clasament, pentru că prompturile tale, codebase-ul tău și toleranța ta la reîncercări nu apar în niciun benchmark. Două sarcini de coding din rularea noastră ilustrează asta: 3.8-Max și 3.7-Max au obținut amândoi 11 din 11 la o sarcină de trunchiere a lățimii unui șir de caractere și au trecut amândoi 5,000 din 5,000 de cazuri fuzzate la aritmetica datelor. Din punct de vedere al corectitudinii, nu am putut face diferența. Diferența pe care am măsurat-o trăiește în latență și cheltuială de tokeni la prompturi ușoare, nu în capabilitate pe cele grele.
Cântărești o migrare și vrei o a doua pereche de ochi pe modelul de cost? Lasă echipa noastră să-l testeze sub presiune pe workload-ul tău.
Toate cifrele verificate pe 2026-08-04. Prețurile, clasamentele de arenă și calendarul ponderilor se schimbă frecvent. Măsurătorile noastre provin dintr-o singură rută (OpenRouter către Alibaba), o mașină, o zi, cu n=3 pentru latență și n=1 pentru majoritatea testelor funcționale.
Întrebări Frecvente
Este Qwen3.8-Max open source?
Nu, pe 2026-08-04. E disponibil doar prin API. Alibaba a programat ponderile pentru „săptămâna viitoare" pe Hugging Face și ModelScope, și nu a anunțat nicio licență. Titlurile care îl numesc open source sunt înaintea faptelor. O căutare pe Hugging Face returnează doar distilări terțe de 4B, nu un model card Alibaba.
Cât costă Qwen3.8-Max?
$2.00 per milion de tokeni de intrare și $6.00 per milion de ieșire, cu intrare cache raportată la $0.25. Asta e cu 35.6% mai mult decât Qwen3.7-Max pe ambele părți. Am măsurat un cost median de $0.001592 per apel scurt, cu aproximativ 4x mai ieftin decât 3.7-Max pe același prompt, pentru că emite mult mai puțini tokeni de raționament.
Câți parametri are Qwen3.8-Max?
2.4 trilioane în total, conform anunțului Alibaba și fiecărei surse care îl acoperă. Numărul activ e contestat: SiliconANGLE, The Decoder și Coursiv raportează ~95 de miliarde activi, în timp ce MarkTechPost afirmă că Alibaba nu l-a divulgat. API-ul nu expune niciun câmp de parametri, așa că nu am putut verifica nicio cifră.
Ce fereastră de context are Qwen3.8-Max?
API-ul live raportează 1,000,000 de tokeni de context și 131,072 de tokeni maximi de completare. Am testat recuperarea până la 247,911 tokeni fără eșecuri. Nu am rulat un apel de 1M tokeni, pentru că unul ar fi costat aproximativ $2.00 și ar fi depășit bugetul nostru de test, deci vârful acelei ferestre e neverificat de noi.
Acceptă Qwen3.8-Max intrare de imagine și video?
Da, la ambele, și le-am verificat. A citit corect cifre și o culoare dintr-un PNG generat local, și a descris corect un video atunci când i s-a dat un URL pe care Alibaba l-a putut prelua. Qwen3.7-Max respinge imaginile total, cu o eroare 404. Două din cele trei URL-uri video de test au eșuat la pasul de descărcare al furnizorului.
Sunt scorurile de benchmark ale Qwen3.8-Max verificate independent?
Nu. Terminal-Bench 2.1 la 86.6, GPQA Diamond la 92.6, PaperBench la 93.0, OSWorld-Verified la 86.1 și DeepSWE 1.1 la 56.6 provin toate din rulările interne ale Alibaba. Până la 2026-08-04, nu am găsit nicio evaluare terță publicată pentru niciuna dintre ele.
Pot rula Qwen3.8-Max local?
Realist, nu, nici măcar odată ce ponderile apar. La 2.4 trilioane de parametri, e de câteva ori mai mare decât DeepSeek-V3.2, care e deja un proiect serios de infrastructură pentru auto-găzduire. Așteaptă-te să-l consumi prin furnizori de inferență, nu pe propriile tale GPU-uri, decât dacă operezi un datacenter.
Ar trebui să migrez de la Qwen3.7-Max la Qwen3.8-Max?
Depinde de mixul tău de tokeni. La prompturi scurte, am măsurat 3.8-Max la aproximativ un sfert din cost și de patru până la cinci ori mai rapid. La workload-uri cu intrare lungă, costă cu 35.6% mai mult și a performat identic la testul nostru de recuperare. Dacă ai nevoie de intrare de imagine sau video, 3.7-Max nu o poate face deloc.
Când sunt lansate ponderile Qwen3.8-Max?
Alibaba a spus „săptămâna viitoare" în anunțul din 2026-08-03, numind Hugging Face și ModelScope drept destinații. Fără dată exactă și fără text de licență. Se raportează că un model însoțitor cu ponderi deschise, Qwen3.8-27B, va fi lansat alături de ele. Plănuim să reverificăm pe 2026-08-10.