ai-machine-learning

Qwen3.8-Max est arrivé : 2 400 milliards de paramètres, 1M de contexte, et les poids ne sont toujours pas sortis

Écrit par Mert Batur
Mis à jour Aug 4, 2026
20 lecture
Qwen3.8-Max est arrivé : 2 400 milliards de paramètres, 1M de contexte, et les poids ne sont toujours pas sortis

Qwen3.8-Max est arrivé : 2 400 milliards de paramètres, 1M de contexte, et les poids ne sont toujours pas sortis

$1.4728. Voilà ce qu'ont coûté 40 appels API en direct sur Qwen3.8-Max et ses deux prédécesseurs, le 2026-08-04, au lendemain du jour où Alibaba l'a lancé. La surprise n'était pas les 2 400 milliards de paramètres. C'était ceci : 3.8-Max facture 35.6% de plus par jeton que Qwen3.7-Max et revient malgré tout environ 4x moins cher par réponse, parce qu'il a arrêté de trop réfléchir. Autre point que la majorité de la couverture du lancement se trompe : ce n'est pas open source. Pas aujourd'hui.

Cet article a été publié pour la première fois le 2026-07-19, lorsque Qwen3.8 n'était qu'un aperçu sans spécifications publiées. Il a été réécrit le 2026-08-04 à partir de la version GA et de nos propres tests API.

Points clés

  • Au 2026-08-04, Qwen3.8-Max est disponible uniquement via API. Alibaba a promis les poids « la semaine prochaine », c'est-à-dire la semaine du 2026-08-10, sur Hugging Face et ModelScope.
  • Nous avons mesuré $0.001592 par appel court contre $0.006428 sur Qwen3.7-Max, malgré un prix par jeton plus élevé.
  • Les cinq scores de benchmark d'Alibaba sont rapportés par le fournisseur lui-même. Nous n'avons trouvé aucune évaluation indépendante publiée au 2026-08-04.
  • L'entrée image et vidéo est réelle et nouvelle. Nous avons vérifié les deux via l'API et via le refus de 3.7-Max.

Ce qui a changé entre l'aperçu et la disponibilité générale

Qwen3.8-Max est passé en disponibilité générale le 2026-08-03, et cette sortie a répondu à toutes les questions ouvertes que cette page listait il y a deux semaines. L'ère de l'aperçu nous avait donné un nombre de paramètres et une promesse. La sortie GA a ajouté une fenêtre de contexte confirmée à 1M de jetons, une entrée texte plus image plus vidéo, cinq scores de benchmark publiés, et un tarif par jeton.

Voici l'ancien tableau des inconnues, désormais résolues :

Ce que cette page disait le 2026-07-19Statut au 2026-08-04
Tout score de benchmark publié : aucunCinq scores rapportés par Alibaba publiés
Paramètres actifs / configuration MoE : non communiquésLargement rapporté à ~95 milliards actifs, MoE sparse. Les sources divergent, voir plus bas
Fenêtre de contexte et sortie max : non annoncées1M en entrée, 131,072 en sortie, confirmé par l'API en direct
Modalité : non annoncéetexte + image + vidéo en entrée, texte en sortie. Nous l'avons vérifié nous-mêmes
Tarification par jeton : non détaillée$2.00 / M en entrée, $6.00 / M en sortie
Date de sortie des poids ouverts : « bientôt », sans date« La semaine prochaine », Hugging Face et ModelScope nommés
Qwen3.8-Max-Preview est disponible dès maintenantL'aperçu est terminé. La GA est sortie

Un point n'a pas été résolu. La répartition des paramètres reste contestée. L'article de lancement de MarkTechPost affirme clairement que le nombre de paramètres actifs n'a pas été communiqué par Alibaba, alors que SiliconANGLE, The Decoder et Coursiv annoncent tous ~95 milliards actifs. Nous avons relu l'article de MarkTechPost le 2026-08-04 et il continue de dire que ce chiffre n'a pas été communiqué. Le sourcing de l'un des deux camps est erroné, et la chose honnête à vous dire, c'est que la couverture de ce chiffre précis s'est contredite dès le jour du lancement.

Nous n'avons pu vérifier ni l'un ni l'autre. La réponse de /models d'OpenRouter n'expose aucun champ de nombre de paramètres, donc rien dans nos tests ne confirme ni ne réfute les 2 400 milliards au total ou les 95 milliards actifs.

Qwen3.8-Max est-il open source ? Pas le 4 août

Non. Au 2026-08-04, Qwen3.8-Max est disponible uniquement via API. Alibaba a programmé la sortie des poids « la semaine prochaine » sur Hugging Face et ModelScope, et n'a annoncé aucune licence. La couverture médiatique n'arrête pas de confondre « disponible » et « ouvert », et cette distinction, c'est toute l'histoire. Il n'y a aucun poids à télécharger aujourd'hui, quoi qu'en dise un titre.

Trois états distincts sont réduits à un seul mot. Ce ne sont pas la même chose :

ÉtatQwen3.8-Max au 2026-08-04
Disponible via APIOui. Alibaba Cloud Model Studio, plus revendeurs et routeurs
Poids téléchargeablesNon. Promis « la semaine prochaine », sans date précisée
Conditions de licenceNon annoncées. Aucun texte à lire n'existe

Nous avons vérifié la preuve la plus solide disponible plutôt que de croire quiconque sur parole : une recherche Hugging Face pour Qwen3.8 au 2026-08-04 ne retourne aucune fiche modèle d'Alibaba. Ce qu'elle retourne, ce sont quatre uploads communautaires nommés Qwen3.8_4B_Distilled et variantes, qui sont des distillations tierces, pas le modèle phare. Si vous parcourez cette page rapidement, il est facile de les confondre avec la vraie sortie.

Une note sur la licence, parce que le précédent est constamment présenté comme un engagement. Qwen 3.5 et Qwen 3.6 sont tous deux sortis sous Apache 2.0. Une licence communautaire restrictive sur un modèle à 2 400 milliards resterait techniquement des « poids ouverts » tout en changeant radicalement ce que vous êtes autorisé à en faire. Tant qu'il n'existe pas de texte de licence, quiconque vous dit ce que vous pouvez faire avec ces poids devine. C'est aussi pour ça que Qwen3.8-Max ne figure pas dans notre panorama des LLM open source qui valent le coup en 2026 : il n'est pas encore éligible.

Ce que nous avons mesuré : 4x moins cher par appel malgré une hausse de prix de 35.6%

Nous avons exécuté 40 appels facturés sur qwen3.8-max, qwen3.7-max et qwen3-max via OpenRouter le 2026-08-04, pour une dépense totale de $1.4728. Chaque coût ci-dessous a été calculé à partir de l'objet usage retourné et recoupé avec le chiffre facturé par OpenRouter lui-même. Tous correspondaient. Le résultat principal va à l'inverse de la variation de prix.

Commençons par le prix. La tarification en direct via GET /models au 2026-08-04 place 3.8-Max à $2.00 en entrée / $6.00 en sortie par million de jetons, contre 3.7-Max à $1.475 / $4.425. C'est une hausse de 35.6% des deux côtés, et le ratio est identique dans les deux sens (2.000/1.475 = 6.000/4.425 = 1.3559). Vous pouvez recouper ces chiffres actuels sur la page du modèle OpenRouter.

Voici maintenant le même prompt trivial envoyé aux trois modèles, trois exécutions chacun, temperature: 0, en streaming :

ModèlePremier jeton (3 exéc.)Premier contenu visibleTemps réel (3 exéc.)Jetons de complétiondont raisonnementCoût médian/appel
qwen3.8-max2.249s / 0.874s / 1.054s5.414s / 5.058s / 4.209s6.338s / 6.734s / 5.130s242 / 287 / 243156 / 194 / 157$0.001592
qwen3.7-max4.871s / 1.157s / 1.670sjamais / 22.358s / 25.998s31.147s / 24.013s / 27.661s1502 / 1281 / 14431500 / 1174 / 1346$0.006428
qwen3-max2.617s / 2.892s / 2.386s2.617s / 2.892s / 2.386s4.401s / 4.601s / 4.081s105 / 105 / 1070 / 0 / 0$0.000431

Deux colonnes distinctes pour le premier jeton sont nécessaires parce que les deux modèles de raisonnement diffusent un raisonnement caché avant tout texte de réponse. Sur 3.8-Max, un jeton arrive en moins d'une seconde sur deux exécutions sur trois, mais le premier mot réellement lisible par l'utilisateur n'arrive que quatre à cinq secondes plus tard. Sur l'exécution 1 de 3.7-Max, il n'est jamais arrivé du tout. Si vous construisez une interface en streaming autour d'un modèle de raisonnement, le spinner continue de tourner bien après que la connexion a prouvé qu'elle était vivante.

Relisez la colonne raisonnement deux fois. Sur un prompt demandant une explication en trois phrases d'un filtre de Bloom, 3.7-Max a dépensé entre 1,174 et 1,500 jetons de raisonnement. 3.8-Max en a dépensé 156 à 194. C'est environ 7x moins de réflexion pour la même réponse, et les jetons de raisonnement sont facturés au tarif de sortie. Résultat : 3.8-Max revient environ 4x moins cher par appel et est 4 à 5 fois plus rapide en temps réel depuis notre machine, aller-retour réseau compris, tout en coûtant 35.6% de plus par jeton. Le prix affiché a augmenté et la facture a baissé.

Cela s'inverse à mesure que les prompts grossissent. Modélisé à partir de la tarification en direct plutôt que mesuré, un appel de 30,000 jetons avec 500 jetons de sortie revient à $63.00 pour mille appels sur 3.8-Max contre $46.46 sur 3.7-Max. À 100,000 jetons en entrée, c'est $203.00 contre $149.71. Une fois que la majorité de vos jetons sont en entrée, l'avantage d'efficacité du raisonnement cesse de compenser la hausse de prix et 3.8-Max devient le plus cher des trois. Quel modèle est le moins cher dépend réellement de votre ratio entrée/sortie, ce qui est exactement la leçon que notre comparatif des tarifs API des LLM répète sans cesse.

reasoning_effort est nouveau, et 3.7-Max l'ignore silencieusement

reasoning_effort apparaît dans les paramètres pris en charge par 3.8-Max, mais pas dans ceux de 3.7-Max. Sur 3.8-Max, son effet est modeste : sur trois exécutions chacun, minimal a produit 67, 108 et 124 jetons de raisonnement contre 163, 136 et 173 pour high. Médianes de 108 contre 163, sur le même prompt, à température 0.

Le constat qui coûte de l'argent concerne l'ancien modèle. Envoyer reasoning_effort: "low" à 3.7-Max est accepté plutôt que rejeté, puis ignoré : cet appel a quand même brûlé 1,401 jetons de raisonnement, facturant les mêmes $0.006689 que l'appel de forme identique que nous avons enregistré. Aucune erreur, aucun avertissement, aucun effet. Si vous ajustez vos coûts en réduisant l'effort de raisonnement, vérifiez que cela fait bien quelque chose sur le modèle que vous appelez réellement, car un paramètre non pris en charge échoue ici silencieusement plutôt que bruyamment.

Le piège de la réponse vide à vérifier avant de migrer

Notre premier test utilisait max_tokens: 400 et a fait planter notre propre script. La raison s'est révélée plus intéressante que le test lui-même. Qwen3.7-Max peut dépenser tout son budget de jetons en raisonnement et retourner une chaîne vide, avec finish_reason: "length", facturée intégralement.

Nous sommes tombés dessus trois fois séparément. Avec max_tokens: 400 : 402 jetons de complétion, dont 400 de raisonnement, zéro caractère de réponse, $0.001822 facturés. Avec max_tokens: 1500 : 1,502 jetons, 1,500 de raisonnement, zéro caractère, $0.006689 pour rien. Et encore une fois sur un appel ultérieur, $0.006735. Aucune erreur, aucune exception, juste un objet de réponse d'apparence fluide avec une chaîne de contenu vide.

Si vous migrez une intégration existante de 3.7-Max et que votre code fixe un max_tokens modeste, prévoyez du temps pour tester ce cas. Le raisonnement bien plus court de 3.8-Max le rend nettement moins exposé. Il n'y est pas immunisé pour autant.

Un petit surcoût en jetons dont personne ne parle

Le même prompt de 12 mots comptait 67 jetons de prompt sur 3.8-Max et 29 sur 3.7-Max, de façon constante sur chaque exécution (27 sur qwen3-max). C'est environ 38 jetons de surcoût fixe, sans doute un template système ou de chat plus volumineux. Sur un appel RAG de 100,000 jetons, ça ne compte pour rien. Sur un classifieur à haut volume qui envoie des prompts courts, ça fait plus que doubler votre facture d'entrée avant même d'avoir écrit un mot.

Qwen3.8-Max accepte-t-il vraiment les images et la vidéo ?

Oui, et l'entrée multimodale est réellement nouvelle sur cette génération, pas un simple ré-étiquetage. L'API rapporte text+image+video->text pour 3.8-Max et texte uniquement pour 3.7-Max. Nous avons vérifié la différence en envoyant la même image aux deux, et l'ancien modèle l'a rejetée au niveau du routage.

Nous avons généré l'image de test localement avec un encodeur PNG écrit à la main, de sorte que la vérité terrain était connue par construction : 750x270 pixels, chiffres en bloc noir 4739 sur fond blanc, avec une barre horizontale rouge en haut. Envoyée encodée en base64, qwen3.8-max a retourné DIGITS: 4739 et TOPBAR: red. Correct sur les deux points, 6.99s, $0.002146. La requête identique envoyée à qwen3.7-max est revenue avec HTTP 404 {"error":{"message":"No endpoints found that support image input"}}.

La vidéo fonctionne aussi, avec une réserve que nous avons failli signaler comme un échec. Deux des trois URL MP4 publiques que nous avons essayées ont retourné HTTP 400 "Failed to download multimodal content". C'est Alibaba qui échoue à récupérer le fichier, pas la route qui refuse la vidéo. Avec une URL qu'elle a pu récupérer, 3.8-Max a décrit un clip Big Buck Bunny avec précision, y compris en nommant le personnage, en 24.24s pour $0.006528.

Deux notes pratiques avant de construire là-dessus. La vidéo a été facturée comme 696 jetons de prompt ordinaires pour un clip d'environ 10 secondes, et usage.prompt_tokens_details.video_tokens a rapporté 0, donc vous ne pouvez pas isoler le coût vidéo à partir de ce champ. Et une partie de contenu mal formée échoue silencieusement : envoyer {"type": "video", "video": [url]} au lieu de video_url a retourné HTTP 200, avec le modèle disant poliment qu'il ne voyait aucune vidéo, plus une facture. Utilisez video_url.

Bon à savoir : quand nous avons demandé à 3.8-Max de décrire ses propres capacités, il a répondu Input modalities: text. C'est faux, comme l'a démontré le test suivant de notre propre run. L'auto-description d'un modèle est une sortie de modèle de langage, pas une fiche technique.

La fenêtre de contexte de 1M jetons tient-elle vraiment la route ?

Nous avons placé trois faits uniques à 10%, 50% et 90% de profondeur dans du remplissage généré, et demandé les trois en un seul appel. 18 aiguilles sur 18 sont revenues correctes sur six exécutions et deux modèles, à des tailles de prompt allant de 5,723 à 247,911 jetons, notées par correspondance exacte de sous-chaîne en code plutôt qu'en lisant les réponses.

Nos exécutions qwen3.8-max (les deux exécutions qwen3.7-max à 83,380 et 247,873 jetons, et une exécution qwen3-max à 78,255, ont elles aussi retrouvé chaque aiguille) :

Jetons de prompt (qwen3.8-max)LatenceCoûtAiguilles trouvées
5,7239.24s$0.014093 sur 3
25,70313.43s$0.054533 sur 3
83,41817.63s$0.169653 sur 3
247,91138.54s$0.498283 sur 3

La latence évolue de façon sous-linéaire, ce qui est la partie concrètement utile : 43x plus de jetons en entrée ne coûtent que 4.2x plus de temps réel.

Passons maintenant aux limites honnêtes, parce que c'est le côté facile de l'évaluation en long contexte. Retrouver un fait planté mot pour mot ne dit pas grand-chose sur le raisonnement à travers un grand document, et nous avons testé chaque taille une seule fois. Nous n'avons pas exécuté d'appel à 1M de jetons. À $2.00 par million de jetons en entrée, un tel appel aurait coûté environ $2.00, plus que l'intégralité de cette série de tests, et un seul échantillon ne nous aurait pas appris grand-chose. Le plafond annoncé de 1M reste donc non vérifié par nous. Et 3.7-Max a exactement égalé 3.8-Max aux deux tailles que nous avons comparées, donc ce n'est pas sur la récupération en long contexte que cette génération se distingue.

Un piège tarifaire est apparu ici, que la couverture du lancement rate complètement. qwen3-max applique des paliers de tarification qui doublent son taux au-delà de 32,000 jetons de prompt et l'augmentent encore au-delà de 128,000, alors que 3.8-Max et 3.7-Max sont à tarif fixe quelle que soit la longueur. Nous avons confirmé ce palier via la facturation réelle : notre appel de 78,255 jetons à qwen3-max a été facturé $0.12227, soit le taux de $1.56/M, pas le $0.78/M affiché en tête. À cette longueur, il coûte presque exactement ce que coûte 3.7-Max ($0.12523). Son prix affiché est moins de la moitié. Son prix réel à 80k jetons n'en est qu'à une erreur d'arrondi.

Les cinq scores de benchmark d'Alibaba, et pourquoi aucun n'est vérifié

Alibaba a publié cinq scores de benchmark avec la sortie GA. Chacun d'eux provient des propres tests internes d'Alibaba, et nous n'avons trouvé aucune évaluation indépendante publiée au 2026-08-04. Cette phrase mérite d'être placée juste à côté des chiffres plutôt que trois paragraphes plus bas.

BenchmarkScore rapporté par AlibabaVérifié par un tiers ?
Terminal-Bench 2.186.6Non, au 2026-08-04
GPQA Diamond92.6Non, au 2026-08-04
PaperBench93.0Non, au 2026-08-04
OSWorld-Verified86.1Non, au 2026-08-04
DeepSWE 1.156.6 (prédécesseur : 21.6)Non, au 2026-08-04

Alibaba a également rapporté un agrégat interne de 0.725, en hausse depuis 0.474, et a positionné le modèle proche ou au-dessus de Claude Opus 4.8, Fable 5 et GPT-5.6 Sol. Des classements d'arène ont aussi circulé : 5ᵉ en Text Arena et 2ᵉ en Vision Arena selon l'annonce d'Alibaba elle-même du 2026-08-03, que nous n'avons pas reconfirmée sur le classement en direct. Les classements d'arène bougent quotidiennement. Traitez tout classement que vous lisez cette semaine comme une capture avec une date dessus.

Ce que personne n'a encore mesuré, nous y compris : le débit en concurrence, la performance en dehors de l'anglais, les évaluations de sécurité et d'alignement, et la fiabilité de l'appel d'outils. Nos propres chiffres couvrent la latence, le coût, la modalité et la récupération en long contexte sur une seule route, et rien d'autre. Le rapport de lancement de Bloomberg a repris les affirmations de benchmark sans test indépendant, ce qui est essentiellement là où en est toute la couverture actuelle.

Pour des chiffres qui ont été vérifiés, notre comparatif Qwen vs DeepSeek vs GLM est une meilleure référence, et Kimi K3, à environ 2 800 milliards, est le rival de taille auquel tout le monde le compare.

Qwen3.8 contre Qwen3-8B, et le revirement open-weight derrière cette sortie

Qwen3.8 est le modèle phare d'Alibaba à 2 400 milliards de paramètres. Qwen3-8B est un modèle dense de 8 milliards de paramètres de la série Qwen3, téléchargeable depuis 2025. Des noms qui se ressemblent, pour une taille environ 300x différente. Les moteurs de recherche les confondent encore, et un nombre surprenant de réponses sur les forums aussi.

Le problème de nommage s'est aggravé cette semaine, pas amélioré. Les seuls éléments sur Hugging Face portant un nom « Qwen3.8 » en ce moment sont des distillations communautaires de 4B. Si vous cherchez les poids et récupérez l'un de ces fichiers, vous téléchargez quelque chose qui n'a aucun rapport avec le modèle de 2 400 milliards.

Deux modèles phares fermés, puis ceci

La promesse de poids ouverts, c'est ça la vraie information ici, et elle se lit différemment une fois qu'on connaît l'historique de la famille. Alibaba a passé deux générations à maintenir une séparation délibérée : des modèles de travail open-weight pour tout le monde, un modèle phare fermé au sommet.

GénérationPoidsRemarques
Qwen 3.5 (0.8B à 397B-A17B)Ouverts, Apache 2.0Famille complète publiée publiquement
Qwen 3.6 (27B dense, 35B-A3B MoE)Ouverts, Apache 2.0Le même schéma s'est maintenu
Qwen3.7-MaxFermésAPI uniquement. Pas de GGUF, pas de checkpoint Hugging Face
Qwen3.8-MaxOuverture promise, pas encore livrée« La semaine prochaine » au 2026-08-03. Licence non annoncée

Alibaba a fermé le niveau phare pendant deux générations consécutives, et affirme maintenant qu'elle va ouvrir le plus grand modèle qu'elle ait jamais construit. Si les poids arrivent comme promis, c'est un véritable revirement, et ça met la pression sur tous les laboratoires qui traitaient le « le niveau frontier reste fermé » comme acquis. S'ils sont en retard, ce serait la troisième sortie Max fermée d'affilée. Les deux issues sont encore possibles au 2026-08-04. Nous avons observé la même dynamique avec GLM 5.2, où la licence effectivement livrée a compté plus que l'annonce.

Pouvez-vous faire tourner Qwen3.8-Max vous-même ? (Toujours non)

Non, et les spécifications de la sortie GA rendent ça plus clair, pas moins. Avec 2 400 milliards de paramètres au total, ce n'est pas un modèle que vous servez sur votre propre matériel, même une fois les poids sortis. DeepSeek-V3.2, avec ses 685 milliards, est déjà décrit par ceux qui s'y sont essayés comme un véritable projet d'infrastructure. Celui-ci en représente plusieurs fois la taille.

Alors, qu'est-ce qu'un modèle open-weight de 2 400 milliards vous apporte réellement ?

  • Les fournisseurs d'inférence peuvent l'héberger, ce qui crée de la concurrence sur les prix, et donc fait baisser votre coût par jeton
  • Les déploiements souverains, réglementés et isolés (air-gapped) deviennent possibles à ce niveau pour la première fois
  • Les chercheurs et les personnes qui font du fine-tuning obtiennent un modèle de base à l'échelle frontier pour travailler
  • Cela ne signifie pas qu'il tournera sur votre machine, sur votre unique A100, ou sur le budget GPU de votre startup

Si vous voulez l'arithmétique précise de ce qu'exige réellement le fonctionnement de grands modèles open-weight, notre guide des besoins en VRAM pour les LLM fait ce calcul correctement. La version courte pour ce modèle : n'essayez pas.

Faut-il changer, tester, ou attendre ?

Votre situationCe que nous ferions au 2026-08-04
Vous faites tourner Qwen3.7-Max en productionTestez d'abord 3.8-Max sur du trafic à prompts courts. C'est là que notre écart de coût de 4x s'est manifesté. Vérifiez ensuite votre gestion de max_tokens pour le cas de réponse vide
Charge de travail en long contexte ou RAG intensifRestez sur place pour l'instant. 3.8-Max coûte 35.6% de plus par jeton et a exactement égalé 3.7-Max sur notre test de récupération
Vous avez besoin d'entrée image ou vidéoC'est la raison de migrer. 3.7-Max ne peut pas du tout accepter une image, et nous avons confirmé le 404
Vous attendez les poids ouvertsNotez le 2026-08-10. Rien à faire tant qu'il n'y a pas de fiche modèle et de licence à lire
Vous êtes satisfait sur Claude ou GPTRien ne change aujourd'hui. Les scores de benchmark d'Alibaba ne sont pas vérifiés, et des chiffres non vérifiés ne constituent pas un argument de migration

La méthode compte plus que le verdict. Chaque modèle que nous avons testé en production s'est comporté différemment de sa position au classement, parce que vos prompts, votre codebase et votre tolérance aux retries ne figurent dans aucun benchmark. Deux tâches de code dans notre série illustrent le propos : 3.8-Max et 3.7-Max ont tous deux obtenu 11 sur 11 sur une tâche de troncature de largeur de chaîne, et tous deux réussi 5,000 cas sur 5,000 sur de l'arithmétique de dates en fuzzing. Sur la justesse, impossible de les distinguer. L'écart que nous avons mesuré se situe dans la latence et la dépense en jetons sur des prompts faciles, pas dans la capacité sur des prompts difficiles.

Vous pesez une migration et voulez un second avis sur le modèle de coûts ? Faites tester votre charge de travail par notre équipe →.

Tous les chiffres ont été vérifiés le 2026-08-04. La tarification, les classements d'arène et le calendrier des poids changent fréquemment. Nos mesures proviennent d'une seule route (OpenRouter vers Alibaba), une seule machine, une seule journée, avec n=3 pour la latence et n=1 pour la plupart des sondes fonctionnelles.

Questions fréquentes

Qwen3.8-Max est-il open source ?

Pas au 2026-08-04. Il est disponible uniquement via API. Alibaba a programmé les poids pour « la semaine prochaine » sur Hugging Face et ModelScope, et n'a annoncé aucune licence. Les titres qui le qualifient d'open source vont plus vite que les faits. Une recherche Hugging Face ne retourne que des distillations tierces de 4B, pas de fiche modèle Alibaba.

Combien coûte Qwen3.8-Max ?

$2.00 par million de jetons en entrée et $6.00 par million en sortie, avec une entrée en cache rapportée à $0.25. C'est 35.6% de plus que Qwen3.7-Max des deux côtés. Nous avons mesuré une médiane de $0.001592 par appel court, environ 4x moins cher que 3.7-Max sur le même prompt, parce qu'il émet beaucoup moins de jetons de raisonnement.

Combien de paramètres compte Qwen3.8-Max ?

2 400 milliards au total, selon l'annonce d'Alibaba et tous les médias qui en ont parlé. Le nombre de paramètres actifs est contesté : SiliconANGLE, The Decoder et Coursiv rapportent ~95 milliards actifs, tandis que MarkTechPost affirme qu'Alibaba ne l'a pas communiqué. L'API n'expose aucun champ de paramètres, donc nous n'avons pu vérifier ni l'un ni l'autre chiffre.

Quelle fenêtre de contexte a Qwen3.8-Max ?

L'API en direct rapporte 1,000,000 de jetons de contexte et 131,072 jetons de complétion max. Nous avons testé la récupération jusqu'à 247,911 jetons sans aucun échec. Nous n'avons pas exécuté d'appel à 1M de jetons, car il aurait coûté environ $2.00 et dépassé notre budget de test, donc le sommet de cette fenêtre reste non vérifié par nous.

Qwen3.8-Max prend-il en charge l'entrée image et vidéo ?

Oui aux deux, et nous les avons vérifiées. Il a lu correctement des chiffres et une couleur depuis un PNG généré localement, et a décrit une vidéo avec précision lorsqu'on lui a donné une URL qu'Alibaba pouvait récupérer. Qwen3.7-Max rejette purement et simplement les images avec un 404. Deux de nos trois URL vidéo de test ont échoué au niveau du téléchargement côté fournisseur.

Les scores de benchmark de Qwen3.8-Max sont-ils vérifiés de façon indépendante ?

Non. Terminal-Bench 2.1 à 86.6, GPQA Diamond à 92.6, PaperBench à 93.0, OSWorld-Verified à 86.1 et DeepSWE 1.1 à 56.6 proviennent tous des tests internes d'Alibaba. Au 2026-08-04, nous n'avons trouvé aucune évaluation tierce publiée pour aucun d'entre eux.

Puis-je faire tourner Qwen3.8-Max en local ?

Réalistement non, même une fois les poids sortis. Avec 2 400 milliards de paramètres, il représente plusieurs fois la taille de DeepSeek-V3.2, qui est déjà un véritable projet d'infrastructure à auto-héberger. Attendez-vous à le consommer via des fournisseurs d'inférence plutôt que sur vos propres GPU, sauf si vous exploitez un datacenter.

Dois-je migrer de Qwen3.7-Max vers Qwen3.8-Max ?

Ça dépend de votre mix de jetons. Sur des prompts courts, nous avons mesuré 3.8-Max à environ un quart du coût et quatre à cinq fois la vitesse. Sur des charges de travail à forte entrée, il coûte 35.6% de plus et a obtenu des performances identiques sur notre test de récupération. Si vous avez besoin d'entrée image ou vidéo, 3.7-Max ne peut tout simplement pas le faire.

Quand les poids de Qwen3.8-Max seront-ils publiés ?

Alibaba a dit « la semaine prochaine » dans son annonce du 2026-08-03, nommant Hugging Face et ModelScope comme destinations. Aucune date exacte, et aucun texte de licence. Un modèle open-weight compagnon, Qwen3.8-27B, serait livré en même temps qu'eux. Nous prévoyons de revérifier le 2026-08-10.

Tags

qwen-3-8qwen3-8-max-previewopen-weight-llmalibaba-qwenllm-tooling

Partager cet article

Démarrez Votre Projet

Prêt à construire quelque chose d'extraordinaire ?

Transformons votre vision en réalité. Notre équipe est prête à vous aider à créer un logiciel qui fait la différence.