ai-machine-learning

Qwen3.8-Max è arrivato: 2.4T di parametri, 1M di contesto, e i pesi ancora non ci sono

Scritto da Mert Batur
Aggiornato Aug 4, 2026
18 lettura
Qwen3.8-Max è arrivato: 2.4T di parametri, 1M di contesto, e i pesi ancora non ci sono

Qwen3.8-Max è arrivato: 2.4T di parametri, 1M di contesto, e i pesi ancora non ci sono

$1.4728. È quanto ci sono costate 40 chiamate API dal vivo su Qwen3.8-Max e i suoi due predecessori il 2026-08-04, il giorno dopo il lancio di Alibaba. La sorpresa non erano i 2.4 trilioni di parametri. Era questo: 3.8-Max fa pagare il 35.6% in più per token rispetto a Qwen3.7-Max, eppure risulta circa 4x più economico per risposta, perché ha smesso di pensare troppo. Un'altra cosa che gran parte della copertura del lancio sta sbagliando: non è open source. Non oggi.

Questo articolo è stato pubblicato per la prima volta il 2026-07-19, quando Qwen3.8 era in preview senza specifiche pubblicate. È stato riscritto il 2026-08-04 sulla base del rilascio GA e dei nostri test API.

Punti chiave

  • Al 2026-08-04, Qwen3.8-Max è disponibile solo via API. Alibaba ha promesso i pesi "la prossima settimana", cioè la settimana del 2026-08-10, su Hugging Face e ModelScope.
  • Abbiamo misurato $0.001592 per chiamata breve contro $0.006428 su Qwen3.7-Max, nonostante un prezzo per token più alto.
  • I cinque punteggi benchmark di Alibaba sono dichiarati dal fornitore. Non abbiamo trovato alcuna valutazione indipendente pubblicata al 2026-08-04.
  • L'input di immagini e video è reale ed è una novità. Abbiamo verificato entrambi contro l'API e contro il rifiuto di 3.7-Max.

Cosa è cambiato tra la preview e la GA

Qwen3.8-Max è diventato disponibile in modalità GA il 2026-08-03, e il rilascio ha risposto a ogni domanda aperta che questa pagina elencava due settimane fa. L'era della preview ci aveva dato un numero di parametri e una promessa. Il rilascio GA ha aggiunto una finestra di contesto confermata da 1M token, input testo più immagine più video, cinque punteggi benchmark pubblicati e un prezzo per token.

Ecco il vecchio elenco delle incognite, ora risolte:

Cosa diceva questa pagina il 2026-07-19Stato al 2026-08-04
Qualsiasi punteggio benchmark pubblicato: nessunoCinque punteggi dichiarati da Alibaba pubblicati
Parametri attivi / configurazione MoE: non divulgatiAmpiamente riportato come ~95B attivi, MoE sparso. Le fonti sono in conflitto, vedi sotto
Finestra di contesto e output massimo: non annunciati1M in ingresso, 131,072 in uscita, confermato dall'API dal vivo
Modalità: non annunciatatesto + immagine + video in ingresso, testo in uscita. Lo abbiamo verificato noi stessi
Prezzo per token: non specificato$2.00 / M in ingresso, $6.00 / M in uscita
Data di rilascio dei pesi aperti: "presto", nessuna data"La prossima settimana", indicati Hugging Face e ModelScope
Qwen3.8-Max-Preview è attiva oraLa preview è finita. La GA è stata rilasciata

Un elemento non si è risolto. La suddivisione dei parametri resta contestata. L'articolo di lancio di MarkTechPost afferma chiaramente che il numero di parametri attivi non è stato divulgato da Alibaba, mentre SiliconANGLE, The Decoder e Coursiv riportano tutti ~95 miliardi attivi. Abbiamo riletto l'articolo di MarkTechPost il 2026-08-04 e dice ancora "non divulgato". Le fonti di qualcuno sono sbagliate, e la cosa onesta da dirvi è che la copertura su questo numero specifico era in conflitto il giorno del lancio.

Non siamo riusciti a verificarlo in nessuna delle due direzioni. La risposta di OpenRouter /models non espone alcun campo per il conteggio dei parametri, quindi nulla nei nostri test conferma o smentisce i 2.4T totali o i 95B attivi.

Qwen3.8-Max è open source? Non al 2026-08-04

No. Al 2026-08-04, Qwen3.8-Max è disponibile solo via API. Alibaba ha programmato il rilascio dei pesi "la prossima settimana" su Hugging Face e ModelScope, e non ha annunciato alcuna licenza. La copertura mediatica continua a confondere "disponibile" con "aperto", e quella distinzione è tutta la storia. Non ci sono pesi da scaricare oggi, qualunque cosa dica un titolo.

Tre stati vengono ridotti a una sola parola. Non sono la stessa cosa:

StatoQwen3.8-Max al 2026-08-04
Disponibile via APISì. Alibaba Cloud Model Studio, oltre a rivenditori e router
Pesi scaricabiliNo. Promessi "la prossima settimana", nessuna data indicata
Termini di licenzaNon annunciati. Non esiste alcun testo da leggere

Abbiamo verificato la prova più solida disponibile invece di fidarci della parola di chiunque: una ricerca su Hugging Face per Qwen3.8 al 2026-08-04 non restituisce alcuna model card di Alibaba. Ciò che restituisce sono quattro upload della community chiamati Qwen3.8_4B_Distilled e varianti, che sono distillazioni di terze parti, non il modello di punta. Se scorrete quella pagina velocemente, è facile scambiarli per il rilascio vero.

Una nota sulla licenza, perché il precedente continua a essere riportato come un impegno. Qwen 3.5 e Qwen 3.6 sono usciti entrambi sotto Apache 2.0. Una licenza community restrittiva a 2.4T soddisferebbe comunque tecnicamente la definizione di "pesi aperti" pur cambiando cosa siete autorizzati a costruirci sopra. Finché non esiste un testo di licenza, chiunque vi dica cosa potete fare con questi pesi sta indovinando. È anche per questo che Qwen3.8-Max non compare nella nostra rassegna degli LLM open source che vale la pena eseguire nel 2026: non si qualifica ancora.

Cosa abbiamo misurato: 4x più economico per chiamata nonostante un aumento di prezzo del 35.6%

Abbiamo eseguito 40 chiamate fatturate contro qwen3.8-max, qwen3.7-max e qwen3-max tramite OpenRouter il 2026-08-04, spesa totale $1.4728. Ogni costo qui sotto è stato calcolato dall'oggetto usage restituito e verificato incrociando la cifra fatturata da OpenRouter stessa. Corrispondevano tutte. Il risultato principale va nella direzione opposta rispetto alla variazione di prezzo.

Partiamo dal prezzo. Il pricing dal vivo da GET /models il 2026-08-04 colloca 3.8-Max a $2.00 in / $6.00 out per milione di token contro i $1.475 / $4.425 di 3.7-Max. È un aumento del 35.6% su entrambi i lati, e il rapporto è identico in entrambi i casi (2.000/1.475 = 6.000/4.425 = 1.3559). Potete verificare le cifre attuali sulla pagina del modello su OpenRouter.

Ora lo stesso prompt banale inviato a tutti e tre i modelli, tre esecuzioni ciascuno, temperature: 0, in streaming:

ModelloPrimo token (3 run)Primo contenuto visibileTempo totale (3 run)Token di completamentodi cui reasoningCosto mediano/chiamata
qwen3.8-max2.249s / 0.874s / 1.054s5.414s / 5.058s / 4.209s6.338s / 6.734s / 5.130s242 / 287 / 243156 / 194 / 157$0.001592
qwen3.7-max4.871s / 1.157s / 1.670smai / 22.358s / 25.998s31.147s / 24.013s / 27.661s1502 / 1281 / 14431500 / 1174 / 1346$0.006428
qwen3-max2.617s / 2.892s / 2.386s2.617s / 2.892s / 2.386s4.401s / 4.601s / 4.081s105 / 105 / 1070 / 0 / 0$0.000431

Servono due colonne separate per il primo token perché entrambi i modelli con reasoning trasmettono in streaming il ragionamento nascosto prima di qualsiasi testo di risposta. Su 3.8-Max un token arriva in meno di un secondo in due delle tre esecuzioni, ma la prima parola effettivamente leggibile arriva quattro o cinque secondi dopo. Sulla run 1 di 3.7-Max non è mai arrivata. Se costruite un'interfaccia in streaming contro un modello con reasoning, lo spinner continua a girare ben oltre il momento in cui la connessione si dimostra attiva.

Leggete due volte la colonna del reasoning. Su un prompt che chiedeva una spiegazione in tre frasi di un Bloom filter, 3.7-Max ha speso tra 1,174 e 1,500 token di reasoning. 3.8-Max ne ha spesi tra 156 e 194. Sono circa 7x meno pensiero per la stessa risposta, e i token di reasoning vengono fatturati alla tariffa dell'output. Il risultato: 3.8-Max costa circa 4x meno per chiamata ed è da 4 a 5 volte più veloce in tempo totale dalla nostra macchina, round-trip di rete incluso, pur costando il 35.6% in più per token. Il prezzo di listino è salito e il conto è sceso.

La situazione si ribalta quando i prompt crescono. Modellato dal pricing dal vivo anziché misurato, una chiamata da 30,000 token con 500 token di output costa $63.00 ogni mille chiamate su 3.8-Max contro $46.46 su 3.7-Max. A 100,000 token di input è $203.00 contro $149.71. Quando la maggior parte dei vostri token è in ingresso, il vantaggio di efficienza del reasoning smette di compensare l'aumento di prezzo e 3.8-Max diventa il più costoso dei tre. Quale modello sia più economico dipende davvero dal vostro rapporto input/output, che è la stessa lezione a cui arriva sempre il nostro confronto prezzi API LLM.

reasoning_effort è nuovo, e 3.7-Max lo ignora silenziosamente

reasoning_effort compare tra i parametri supportati di 3.8-Max e non tra quelli di 3.7-Max. Su 3.8-Max sposta l'ago in modo modesto: su tre run ciascuno, minimal ha prodotto 67, 108 e 124 token di reasoning contro i 163, 136 e 173 di high. Mediane di 108 contro 163, sullo stesso prompt, a temperature 0.

Il risultato che costa denaro riguarda il modello più vecchio. Inviare reasoning_effort: "low" a 3.7-Max viene accettato invece che rifiutato, e poi ignorato: quella chiamata ha comunque bruciato 1,401 token di reasoning, fatturando gli stessi $0.006689 della chiamata dalla forma identica che abbiamo registrato. Nessun errore, nessun avviso, nessun effetto. Se state ottimizzando i costi abbassando il reasoning effort, verificate che stia facendo davvero qualcosa sul modello che state chiamando, perché qui un parametro non supportato fallisce silenziosamente invece che in modo evidente.

La trappola della risposta vuota da controllare prima di migrare

La nostra prima run di test usava max_tokens: 400 e ha mandato in crash il nostro stesso script. Il motivo si è rivelato più interessante del test stesso. Qwen3.7-Max può spendere l'intero budget di token in reasoning e restituire una stringa vuota, con finish_reason: "length", fatturata per intero.

Ci siamo imbattuti tre volte separate. A max_tokens: 400: 402 token di completamento, 400 dei quali reasoning, zero caratteri di risposta, $0.001822 fatturati. A max_tokens: 1500: 1,502 token, 1,500 reasoning, zero caratteri, $0.006689 per niente. E ancora una volta su una chiamata successiva, $0.006735. Nessun errore, nessuna eccezione, solo un oggetto risposta dall'aspetto fluente con una stringa content vuota.

Se state migrando un'integrazione esistente con 3.7-Max e il vostro codice imposta un max_tokens modesto, mettete in conto del tempo per testare questo percorso. Il reasoning molto più breve di 3.8-Max lo rende decisamente meno esposto. Non è immune.

Un piccolo overhead di token di cui nessuno parla

Lo stesso prompt di 12 parole ha contato 67 token di prompt su 3.8-Max e 29 su 3.7-Max, in modo coerente in ogni run (27 su qwen3-max). Sono circa 38 token di overhead fisso, presumibilmente un template di sistema o di chat più grande. Su una chiamata RAG da 100,000 token si arrotonda a zero. Su un classificatore ad alto volume che spara prompt brevi, più che raddoppia la vostra bolletta di input prima ancora di aver scritto una parola.

Qwen3.8-Max accetta davvero immagini e video?

Sì, e l'input multimodale è davvero una novità di questa generazione, non una semplice rietichettatura. L'API riporta text+image+video->text per 3.8-Max e solo testo per 3.7-Max. Abbiamo verificato la differenza inviando la stessa immagine a entrambi, e il modello più vecchio l'ha rifiutata a livello di routing.

Abbiamo generato l'immagine di test localmente con un encoder PNG scritto a mano, così la verità di riferimento era nota per costruzione: 750x270 pixel, cifre nere in blocco 4739 su sfondo bianco, con una barra orizzontale rossa in alto. Inviata codificata in base64, qwen3.8-max ha restituito DIGITS: 4739 e TOPBAR: red. Corretto su entrambi i conteggi, 6.99s, $0.002146. La richiesta identica a qwen3.7-max è tornata come HTTP 404 {"error":{"message":"No endpoints found that support image input"}}.

Anche il video funziona, con un avvertimento che stavamo quasi per riportare come un fallimento. Due dei tre URL MP4 pubblici che abbiamo provato hanno restituito HTTP 400 "Failed to download multimodal content". Si tratta di Alibaba che non riesce a scaricare il file, non della rotta che rifiuta il video. Con un URL che riusciva a recuperare, 3.8-Max ha descritto accuratamente una clip di Big Buck Bunny, nominando persino il personaggio, in 24.24s per $0.006528.

Due note pratiche prima di costruirci sopra qualcosa. Il video è stato fatturato come 696 normali token di prompt per una clip di circa 10 secondi, e usage.prompt_tokens_details.video_tokens riportava 0, quindi non potete scorporare il costo del video da quel campo. E una parte di contenuto malformata fallisce silenziosamente: inviare {"type": "video", "video": [url]} invece di video_url ha restituito HTTP 200 con il modello che diceva educatamente di non riuscire a vedere alcun video, più una fattura. Usate video_url.

Vale la pena saperlo: quando abbiamo chiesto a 3.8-Max di descrivere le proprie capacità, ha risposto Input modalities: text. È sbagliato, come ha dimostrato il test successivo nella nostra stessa run. L'auto-descrizione di un modello è un output da modello linguistico, non una scheda tecnica.

Quanto regge la finestra di contesto da 1M token?

Abbiamo piantato tre fatti unici al 10%, 50% e 90% di profondità in testo di riempimento generato e chiesto tutti e tre in un'unica chiamata. 18 aghi su 18 sono tornati corretti su sei run su due modelli, a dimensioni di prompt da 5,723 fino a 247,911 token, valutati tramite corrispondenza esatta di sottostringa nel codice piuttosto che leggendo le risposte.

Le nostre run su qwen3.8-max (le due run su qwen3.7-max a 83,380 e 247,873 token, e una run su qwen3-max a 78,255, hanno anch'esse restituito ogni ago):

Token di prompt (qwen3.8-max)LatenzaCostoAghi trovati
5,7239.24s$0.014093 su 3
25,70313.43s$0.054533 su 3
83,41817.63s$0.169653 su 3
247,91138.54s$0.498283 su 3

La latenza scala in modo sub-lineare, ed è questa la parte praticamente utile: 43x più token di input costano solo 4.2x più tempo totale.

Ora i limiti onesti, perché questo è il lato facile della valutazione a lungo contesto. Recuperare un fatto piantato alla lettera dice molto poco sul ragionamento attraverso un documento ampio, e abbiamo testato ogni dimensione una sola volta. Non abbiamo eseguito una chiamata da 1M token. A $2.00 per milione di token di input, ne sarebbe costata circa $2.00, più di questa intera run di test, e un singolo campione non ci avrebbe detto molto. Il tetto pubblicizzato di 1M resta quindi non verificato da noi. E 3.7-Max ha eguagliato esattamente 3.8-Max in entrambe le dimensioni che abbiamo confrontato, quindi il recupero a lungo contesto non è dove questa generazione fa la differenza.

È emersa qui una trappola di pricing che la copertura del lancio manca del tutto. qwen3-max porta con sé override di prezzo a livelli che raddoppiano la sua tariffa sopra i 32,000 token di prompt e la rialzano di nuovo sopra i 128,000, mentre 3.8-Max e 3.7-Max hanno tariffa fissa a qualsiasi lunghezza. Abbiamo confermato il livello dalla fatturazione reale: la nostra chiamata da 78,255 token a qwen3-max è stata addebitata $0.12227, la tariffa da $1.56/M, non i $0.78/M da titolo. A quella lunghezza costa quasi esattamente quanto costa 3.7-Max ($0.12523). Il suo prezzo da titolo è meno della metà. Il suo prezzo reale a 80k token è a un errore di arrotondamento di distanza.

I cinque punteggi benchmark di Alibaba, e perché nessuno di essi è verificato

Alibaba ha pubblicato cinque punteggi benchmark con il rilascio GA. Ognuno di essi proviene dalle run interne di Alibaba stessa, e non abbiamo trovato alcuna valutazione indipendente pubblicata al 2026-08-04. Questa frase merita di stare accanto ai numeri, non tre paragrafi più sotto.

BenchmarkPunteggio dichiarato da AlibabaVerificato da terze parti?
Terminal-Bench 2.186.6No, al 2026-08-04
GPQA Diamond92.6No, al 2026-08-04
PaperBench93.0No, al 2026-08-04
OSWorld-Verified86.1No, al 2026-08-04
DeepSWE 1.156.6 (predecessore: 21.6)No, al 2026-08-04

Alibaba ha anche riportato un aggregato interno di 0.725, in salita da 0.474, e ha posizionato il modello vicino o sopra Claude Opus 4.8, Fable 5 e GPT-5.6 Sol. Sono circolati anche piazzamenti in arena: 5° in Text Arena e 2° in Vision Arena secondo l'annuncio di Alibaba stessa del 2026-08-03, che non abbiamo riconfermato sulla classifica dal vivo. I piazzamenti in arena si muovono ogni giorno. Trattate qualsiasi piazzamento che leggete questa settimana come uno scatto fotografico con una data sopra.

Ciò che nessuno ha ancora misurato, noi compresi: il throughput sotto concorrenza, le prestazioni in lingue diverse dall'inglese, le valutazioni di sicurezza e allineamento, e l'affidabilità del tool-calling. I nostri numeri coprono latenza, costo, modalità e recupero a lungo contesto su un'unica rotta, e nient'altro. Il report di lancio di Bloomberg ha ripetuto le affermazioni sui benchmark senza test indipendenti, che è dove si trova sostanzialmente tutta la copertura in questo momento.

Per numeri che sono stati verificati, il nostro confronto Qwen vs DeepSeek vs GLM è il riferimento migliore, e Kimi K3, con circa 2.8T, è il rivale per dimensione contro cui tutti lo confrontano.

Qwen3.8 contro Qwen3-8B, e l'inversione open-weight dietro questo rilascio

Qwen3.8 è il modello di punta di Alibaba da 2.4 trilioni di parametri. Qwen3-8B è un modello denso da 8 miliardi di parametri della serie Qwen3, scaricabile dal 2025. Nomi dall'aspetto simile, ma circa 300x di distanza in termini di dimensione. I motori di ricerca continuano a confonderli, e lo stesso fa un numero sorprendente di risposte nei forum.

Il problema di denominazione è peggiorato questa settimana, non migliorato. Le uniche cose su Hugging Face che portano un nome "Qwen3.8" in questo momento sono distillazioni community da 4B. Se andate a cercare i pesi e ne prendete una, state scaricando qualcosa che non ha alcuna relazione con il modello da 2.4T.

Due modelli di punta chiusi, poi questo

La promessa open-weight è la vera notizia qui, e si legge diversamente una volta vista la storia della famiglia. Alibaba ha portato avanti per due generazioni una divisione deliberata: modelli operativi open-weight per tutti, modello di punta chiuso al vertice.

GenerazionePesiNote
Qwen 3.5 (0.8B a 397B-A17B)Aperti, Apache 2.0Intera famiglia rilasciata pubblicamente
Qwen 3.6 (27B denso, 35B-A3B MoE)Aperti, Apache 2.0Stesso schema mantenuto
Qwen3.7-MaxChiusoSolo API. Nessun GGUF, nessun checkpoint su Hugging Face
Qwen3.8-MaxAperto promesso, non ancora rilasciato"La prossima settimana" al 2026-08-03. Licenza non annunciata

Alibaba ha tenuto chiusa la fascia di punta per due generazioni consecutive e ora dice che aprirà il modello più grande che abbia mai costruito. Se i pesi arriveranno come promesso, è un'inversione reale e mette pressione su ogni laboratorio che tratta "la fascia di frontiera resta chiusa" come una cosa acquisita. Se slitteranno, questo diventa il terzo rilascio Max chiuso di fila. Entrambi gli esiti sono ancora aperti al 2026-08-04. Abbiamo visto la stessa dinamica con GLM 5.2, dove la licenza effettivamente rilasciata ha contato più dell'annuncio.

Potete eseguire Qwen3.8-Max da soli? (Ancora no)

No, e le specifiche GA lo rendono più chiaro, non meno. Con 2.4 trilioni di parametri totali, non è un modello che servite sul vostro hardware, nemmeno dopo il rilascio dei pesi. DeepSeek-V3.2, con i suoi 685B, è già descritto da chi lo ha fatto come un vero progetto infrastrutturale. Questo è diverse volte quello.

Quindi cosa vi porta davvero un modello open-weight da 2.4T?

  • I provider di inferenza possono ospitarlo, il che significa concorrenza sui prezzi, il che significa che il vostro costo per token scende
  • Diventano possibili per la prima volta a questa fascia deployment sovrani, regolamentati e air-gapped
  • Ricercatori e chi fa fine-tuning ottengono un modello base di scala frontiera su cui lavorare
  • Non significa che gira sulla vostra macchina, sulla vostra singola A100, o sul budget GPU della vostra startup

Se volete l'aritmetica su cosa serve davvero per eseguire grandi modelli open-weight, la nostra guida ai requisiti VRAM per gli LLM fa bene questi calcoli. La versione breve per questo modello: non fatelo.

Dovreste passare, testare, o aspettare?

La vostra situazioneCosa faremmo noi al 2026-08-04
State usando Qwen3.7-Max in produzioneTestate prima 3.8-Max sul traffico con prompt brevi. È lì che è emerso il nostro divario di costo 4x. Poi controllate la gestione di max_tokens per il caso della risposta vuota
Carico di lavoro a lungo contesto o RAG pesanteRestate fermi per ora. 3.8-Max costa il 35.6% in più per token e ha eguagliato esattamente 3.7-Max nel nostro test di recupero
Vi serve input di immagini o videoQuesto è il motivo per passare. 3.7-Max non può accettare alcuna immagine, e abbiamo confermato il 404
State aspettando i pesi apertiSegnate in agenda il 2026-08-10. Niente da fare finché non ci sono una model card e una licenza da leggere
Siete soddisfatti con Claude o GPTNiente cambia oggi. I punteggi benchmark di Alibaba non sono verificati, e numeri non verificati non sono un motivo per migrare

Il metodo conta più del verdetto. Ogni modello che abbiamo testato in produzione si è comportato diversamente rispetto alla sua posizione in classifica, perché i vostri prompt, il vostro codebase e la vostra tolleranza ai retry non sono nel benchmark di nessuno. Due task di coding nella nostra run lo dimostrano: sia 3.8-Max che 3.7-Max hanno ottenuto 11 su 11 su un task di troncamento della larghezza delle stringhe ed entrambi hanno superato 5,000 casi su 5,000 casi fuzzati sull'aritmetica delle date. Sulla correttezza non siamo riusciti a distinguerli. Il divario che abbiamo misurato vive nella latenza e nella spesa di token sui prompt facili, non nella capacità su quelli difficili.

State valutando una migrazione e volete un secondo parere sul modello di costo? Fate mettere alla prova il vostro workload dal nostro team.

Tutte le cifre verificate al 2026-08-04. Il pricing, i piazzamenti in arena e la tempistica dei pesi cambiano frequentemente. Le nostre misurazioni provengono da un'unica rotta (OpenRouter verso Alibaba), una macchina, un giorno, con n=3 per la latenza e n=1 per la maggior parte delle prove funzionali.

Domande frequenti

Qwen3.8-Max è open source?

Non al 2026-08-04. È disponibile solo via API. Alibaba ha programmato i pesi per "la prossima settimana" su Hugging Face e ModelScope, e non ha annunciato alcuna licenza. I titoli che lo definiscono open source sono avanti rispetto ai fatti. Una ricerca su Hugging Face restituisce solo distillazioni di terze parti da 4B, non una model card di Alibaba.

Quanto costa Qwen3.8-Max?

$2.00 per milione di token di input e $6.00 per milione di output, con l'input in cache riportato a $0.25. È il 35.6% in più di Qwen3.7-Max su entrambi i lati. Abbiamo misurato una mediana di $0.001592 per chiamata breve, circa 4x più economico di 3.7-Max sullo stesso prompt, perché emette molti meno token di reasoning.

Quanti parametri ha Qwen3.8-Max?

2.4 trilioni totali, secondo l'annuncio di Alibaba e ogni testata che ne ha parlato. Il conteggio attivo è contestato: SiliconANGLE, The Decoder e Coursiv riportano ~95 miliardi attivi, mentre MarkTechPost afferma che Alibaba non l'ha divulgato. L'API non espone alcun campo per i parametri, quindi non siamo riusciti a verificare nessuna delle due cifre.

Che finestra di contesto ha Qwen3.8-Max?

L'API dal vivo riporta 1,000,000 di token di contesto e 131,072 token massimi di completamento. Abbiamo testato il recupero fino a 247,911 token senza fallimenti. Non abbiamo eseguito una chiamata da 1M token, perché ne sarebbe costata circa $2.00 e avrebbe superato il nostro budget di test, quindi il vertice di quella finestra resta non verificato da noi.

Qwen3.8-Max supporta input di immagini e video?

Sì a entrambi, e li abbiamo verificati. Ha letto correttamente cifre e un colore da un PNG generato localmente, e ha descritto accuratamente un video quando gli è stato fornito un URL che Alibaba riusciva a recuperare. Qwen3.7-Max rifiuta le immagini a priori con un 404. Due dei nostri tre URL video di test sono falliti al passaggio di download del provider.

I punteggi benchmark di Qwen3.8-Max sono verificati in modo indipendente?

No. Terminal-Bench 2.1 a 86.6, GPQA Diamond a 92.6, PaperBench a 93.0, OSWorld-Verified a 86.1 e DeepSWE 1.1 a 56.6 provengono tutti dalle run interne di Alibaba. Al 2026-08-04 non abbiamo trovato alcuna valutazione di terze parti pubblicata per nessuno di essi.

Posso eseguire Qwen3.8-Max in locale?

Realisticamente no, anche una volta rilasciati i pesi. Con 2.4 trilioni di parametri è diverse volte più grande di DeepSeek-V3.2, che è già un vero progetto infrastrutturale da autogestire. Aspettatevi di consumarlo tramite provider di inferenza piuttosto che sulle vostre GPU, a meno che non gestiate un data center.

Dovrei migrare da Qwen3.7-Max a Qwen3.8-Max?

Dipende dal vostro mix di token. Sui prompt brevi abbiamo misurato 3.8-Max a circa un quarto del costo e da quattro a cinque volte la velocità. Sui carichi di lavoro a input lungo costa il 35.6% in più e ha ottenuto risultati identici nel nostro test di recupero. Se vi serve input di immagini o video, 3.7-Max non può proprio farlo.

Quando saranno rilasciati i pesi di Qwen3.8-Max?

Alibaba ha detto "la prossima settimana" nel suo annuncio del 2026-08-03, indicando Hugging Face e ModelScope come destinazioni. Nessuna data esatta, e nessun testo di licenza. Un modello open-weight complementare, Qwen3.8-27B, è riportato in uscita insieme a loro. Abbiamo in programma di riverificare il 2026-08-10.

Tag

qwen-3-8qwen3-8-max-previewllm-open-weightalibaba-qwenllm-tooling

Condividi questo articolo

Il Tuo Prossimo Passo

Hai un progetto in mente? Parliamone.

Prenota una call di 30 minuti. Ti ascoltiamo, capiamo il problema e ti diciamo se possiamo aiutarti.