ai-machine-learning

Qwen3.8-Max ist da: 2.4 Bio. Parameter, 1M Kontext – und die Gewichte fehlen noch

Geschrieben von Mert Batur
Aktualisiert Aug 4, 2026
16 Lesezeit
Qwen3.8-Max ist da: 2.4 Bio. Parameter, 1M Kontext – und die Gewichte fehlen noch

$1.4728. So viel haben uns 40 Live-API-Aufrufe über Qwen3.8-Max und seine beiden Vorgänger am 2026-08-04 gekostet, dem Tag nach Alibabas Release. Die Überraschung waren nicht die 2.4 Billionen Parameter. Es war das hier: 3.8-Max verlangt 35.6% mehr pro Token als Qwen3.7-Max und kam trotzdem auf rund 4x günstiger pro Antwort, weil es aufgehört hat, sich zu Tode zu überlegen. Noch etwas, das die meiste Launch-Berichterstattung falsch macht: Es ist nicht Open Source. Noch nicht.

Dieser Beitrag wurde erstmals am 2026-07-19 veröffentlicht, als Qwen3.8 noch eine Preview ohne veröffentlichte Spezifikationen war. Er wurde am 2026-08-04 anhand des GA-Release und unserer eigenen API-Tests überarbeitet.

Die wichtigsten Erkenntnisse

  • Stand 2026-08-04 ist Qwen3.8-Max ausschließlich per API verfügbar. Alibaba hat die Gewichte für „nächste Woche" versprochen, also die Woche ab 2026-08-10, auf Hugging Face und ModelScope.
  • Wir haben $0.001592 pro kurzem Aufruf gemessen gegenüber $0.006428 bei Qwen3.7-Max – trotz höherem Preis pro Token.
  • Alibabas fünf Benchmark-Werte stammen vom Anbieter selbst. Eine unabhängig veröffentlichte Evaluierung haben wir Stand 2026-08-04 nicht gefunden.
  • Bild- und Video-Eingabe sind echt und neu. Wir haben beides gegen die API und gegen die Ablehnung von 3.7-Max verifiziert.

Was sich zwischen Preview und GA geändert hat

Qwen3.8-Max wurde am 2026-08-03 allgemein verfügbar, und der Release hat jede offene Frage beantwortet, die diese Seite vor zwei Wochen noch aufgelistet hat. Die Preview-Ära lieferte eine Parameteranzahl und ein Versprechen. Der GA-Release brachte ein bestätigtes 1M-Token-Kontextfenster, Text- plus Bild- plus Video-Eingabe, fünf veröffentlichte Benchmark-Werte und einen Preis pro Token.

Hier ist das alte Register der Unbekannten, aufgelöst:

Was diese Seite am 2026-07-19 sagteStatus am 2026-08-04
Veröffentlichter Benchmark-Wert: keinerFünf Alibaba-eigene Werte veröffentlicht
Aktive Parameter / MoE-Konfiguration: nicht offengelegtVielfach als ~95B aktiv, sparse MoE gemeldet. Berichterstattung widerspricht sich, siehe unten
Kontextfenster und maximale Ausgabe: nicht angekündigt1M Eingabe, 131,072 Ausgabe, von der Live-API bestätigt
Modalität: nicht angekündigtText + Bild + Video als Eingabe, Text als Ausgabe. Wir haben das selbst verifiziert
Preis pro Token: nicht aufgeschlüsselt$2.00 / M Eingabe, $6.00 / M Ausgabe
Datum für offene Gewichte: „bald", kein Datum„Nächste Woche", Hugging Face und ModelScope genannt
Qwen3.8-Max-Preview läuft jetztPreview ist vorbei. GA ist gelauncht

Ein Punkt hat sich nicht aufgelöst. Die Parameter-Aufteilung ist weiter umstritten. MarkTechPosts Launch-Artikel schreibt unmissverständlich, dass Alibaba die aktive Parameteranzahl nicht offengelegt hat, während SiliconANGLE, The Decoder und Coursiv alle ~95 Milliarden aktiv nennen. Wir haben den MarkTechPost-Artikel am 2026-08-04 erneut gelesen, und dort steht weiterhin „nicht offengelegt". Irgendjemandes Quellenlage ist falsch, und ehrlich gesagt hat sich die Berichterstattung zu dieser konkreten Zahl am Launch-Tag widersprochen.

Wir konnten es in keiner Richtung verifizieren. Die /models-Antwort von OpenRouter enthält überhaupt kein Feld für die Parameteranzahl, also bestätigt oder widerlegt nichts in unseren Tests die 2.4T gesamt oder die 95B aktiv.

Ist Qwen3.8-Max Open Source? Nicht am 4. August

Nein. Stand 2026-08-04 ist Qwen3.8-Max ausschließlich per API verfügbar. Alibaba hat die Gewichte für „nächste Woche" auf Hugging Face und ModelScope angekündigt, aber keine Lizenz genannt. In der Berichterstattung wird „verfügbar" ständig mit „offen" gleichgesetzt, und genau diese Unterscheidung ist die eigentliche Geschichte. Heute gibt es keine Gewichte zum Herunterladen, was auch immer eine Schlagzeile behauptet.

Drei Zustände werden hier zu einem Wort zusammengefasst. Sie sind nicht dasselbe:

ZustandQwen3.8-Max am 2026-08-04
Über API verfügbarJa. Alibaba Cloud Model Studio, plus Reseller und Router
Gewichte herunterladbarNein. „Nächste Woche" versprochen, kein Datum genannt
LizenzbedingungenNicht angekündigt. Es existiert kein Text zum Lesen

Wir haben den härtesten verfügbaren Beleg geprüft, statt jemandem sein Wort zu glauben: eine Hugging-Face-Suche nach Qwen3.8 liefert am 2026-08-04 keine Alibaba-Modellkarte. Was sie liefert, sind vier Community-Uploads namens Qwen3.8_4B_Distilled und Varianten davon – Drittanbieter-Destillate, nicht das Flaggschiff. Wer diese Seite schnell überfliegt, verwechselt sie leicht mit dem echten Release.

Eine Anmerkung zur Lizenz, denn Präzedenzfall wird hier ständig als Zusage verkauft. Qwen 3.5 und Qwen 3.6 erschienen beide unter Apache 2.0. Eine restriktive Community-Lizenz bei 2.4T würde den Begriff „offene Gewichte" trotzdem technisch erfüllen, während sie grundlegend ändert, was Sie damit bauen dürfen. Bis es Lizenztext gibt, rät jeder, der Ihnen sagt, was Sie mit diesen Gewichten tun dürfen, nur. Deshalb steht Qwen3.8-Max auch nicht in unserer Übersicht der Open-Source-LLMs, die 2026 einen Blick wert sind: Es qualifiziert sich noch nicht.

Was wir gemessen haben: 4x günstiger pro Aufruf trotz 35.6%-Preisanstieg

Wir haben 40 kostenpflichtige Aufrufe gegen qwen3.8-max, qwen3.7-max und qwen3-max über OpenRouter am 2026-08-04 gefahren, Gesamtausgabe $1.4728. Jede Kostenangabe unten wurde aus dem zurückgegebenen usage-Objekt berechnet und gegen OpenRouters eigene abgerechnete Zahl abgeglichen. Alle stimmten überein. Der Hauptbefund läuft dem Preisanstieg entgegen.

Zuerst der Preis. Live-Preise von GET /models am 2026-08-04 setzen 3.8-Max bei $2.00 Eingabe / $6.00 Ausgabe pro Million Token, gegenüber 3.7-Max bei $1.475 / $4.425. Das ist ein Anstieg von 35.6% auf beiden Seiten, und das Verhältnis ist auf beiden Seiten identisch (2.000/1.475 = 6.000/4.425 = 1.3559). Die aktuellen Zahlen können Sie auf der OpenRouter-Modellseite gegenprüfen.

Jetzt derselbe triviale Prompt an alle drei Modelle geschickt, drei Läufe je Modell, temperature: 0, gestreamt:

ModellErstes Token (3 Läufe)Erster sichtbarer InhaltWall-Time (3 Läufe)Completion-Tokendavon ReasoningMedian-Kosten/Aufruf
qwen3.8-max2.249s / 0.874s / 1.054s5.414s / 5.058s / 4.209s6.338s / 6.734s / 5.130s242 / 287 / 243156 / 194 / 157$0.001592
qwen3.7-max4.871s / 1.157s / 1.670snie / 22.358s / 25.998s31.147s / 24.013s / 27.661s1502 / 1281 / 14431500 / 1174 / 1346$0.006428
qwen3-max2.617s / 2.892s / 2.386s2.617s / 2.892s / 2.386s4.401s / 4.601s / 4.081s105 / 105 / 1070 / 0 / 0$0.000431

Zwei getrennte Spalten für „erstes Token" sind nötig, weil beide Reasoning-Modelle verstecktes Nachdenken streamen, bevor irgendein Antworttext kommt. Bei 3.8-Max trifft in zwei von drei Läufen ein Token innerhalb einer Sekunde ein, aber das erste tatsächlich lesbare Wort landet vier bis fünf Sekunden später. Bei 3.7-Max, Lauf 1, kam es überhaupt nicht an. Wer eine Streaming-UI gegen ein Reasoning-Modell baut, sieht den Spinner lange weiterdrehen, nachdem die Verbindung längst als aktiv erwiesen ist.

Die Reasoning-Spalte verdient einen zweiten Blick. Bei einem Prompt, der eine Drei-Satz-Erklärung eines Bloom-Filters verlangt, verbrauchte 3.7-Max zwischen 1,174 und 1,500 Reasoning-Token. 3.8-Max brauchte 156 bis 194. Das ist rund 7x weniger Nachdenken für dieselbe Antwort, und Reasoning-Token werden zum Ausgabepreis abgerechnet. Das Ergebnis: 3.8-Max ist etwa 4x günstiger pro Aufruf und 4 bis 5 Mal schneller in der Wall-Time von unserer Maschine aus, inklusive Netzwerk-Roundtrip, bei gleichzeitig 35.6% höherem Preis pro Token. Der Listenpreis stieg, die Rechnung sank.

Das kippt, wenn Prompts größer werden. Aus Live-Preisen modelliert, nicht gemessen: Ein 30,000-Token-Aufruf mit 500 Ausgabe-Token kostet $63.00 pro tausend Aufrufe bei 3.8-Max gegenüber $46.46 bei 3.7-Max. Bei 100,000 Eingabe-Token sind es $203.00 gegenüber $149.71. Sobald der Großteil Ihrer Token Eingabe ist, zahlt sich der Reasoning-Effizienzvorteil den Preisanstieg nicht mehr aus, und 3.8-Max wird zum teuersten der drei. Welches Modell am günstigsten ist, hängt tatsächlich von Ihrem Verhältnis aus Eingabe zu Ausgabe ab – dieselbe Lehre, bei der auch unser LLM-API-Preisvergleich immer wieder landet.

reasoning_effort ist neu, und 3.7-Max ignoriert es lautlos

reasoning_effort taucht bei 3.8-Max in den unterstützten Parametern auf, bei 3.7-Max nicht. Bei 3.8-Max bewegt es die Nadel moderat: über drei Läufe je Einstellung produzierte minimal 67, 108 und 124 Reasoning-Token gegenüber high bei 163, 136 und 173. Median 108 gegenüber 163, beim gleichen Prompt, bei Temperatur 0.

Der Befund, der Geld kostet, betrifft das ältere Modell. reasoning_effort: "low" an 3.7-Max zu schicken wird akzeptiert statt abgelehnt – und dann ignoriert: Der Aufruf verbrannte trotzdem 1,401 Reasoning-Token und berechnete dieselben $0.006689 wie der identisch geformte Aufruf, den wir protokolliert hatten. Kein Fehler, keine Warnung, keine Wirkung. Wer die Kosten über eine niedrigere Reasoning-Stufe steuern will, sollte prüfen, ob das beim tatsächlich aufgerufenen Modell überhaupt etwas bewirkt, denn ein nicht unterstützter Parameter scheitert hier lautlos statt laut.

Die Leere-Antwort-Falle, die Sie vor der Migration prüfen sollten

Unser erster Testlauf nutzte max_tokens: 400 und ließ unser eigenes Skript abstürzen. Der Grund war mehr wert als der Test selbst. Qwen3.7-Max kann sein gesamtes Token-Budget fürs Nachdenken verbrauchen und einen leeren String zurückgeben, mit finish_reason: "length", voll berechnet.

Uns ist das dreimal separat passiert. Bei max_tokens: 400: 402 Completion-Token, davon 400 Reasoning, null Antwortzeichen, $0.001822 berechnet. Bei max_tokens: 1500: 1,502 Token, 1,500 Reasoning, null Zeichen, $0.006689 für nichts. Und noch einmal bei einem späteren Aufruf, $0.006735. Kein Fehler, keine Ausnahme, nur ein flüssig wirkendes Antwortobjekt mit leerem Inhalts-String.

Wer eine bestehende 3.7-Max-Integration migriert und im Code ein moderates max_tokens gesetzt hat, sollte diesen Pfad testen. Das deutlich kürzere Reasoning von 3.8-Max macht es spürbar weniger anfällig. Immun ist es nicht.

Ein kleiner Token-Overhead, den kaum jemand erwähnt

Derselbe 12-Wörter-Prompt zählte 67 Prompt-Token bei 3.8-Max und 29 bei 3.7-Max, durchgehend über jeden Lauf hinweg (27 bei qwen3-max). Das sind rund 38 Token fester Overhead, vermutlich ein größeres System- oder Chat-Template. Bei einem 100,000-Token-RAG-Aufruf fällt das nicht ins Gewicht. Bei einem hochfrequenten Klassifikator mit kurzen Prompts verdoppelt es die Eingabekosten mehr als, bevor Sie ein Wort geschrieben haben.

Nimmt Qwen3.8-Max wirklich Bilder und Videos an?

Ja, und multimodale Eingabe ist in dieser Generation wirklich neu, keine Umetikettierung. Die API meldet text+image+video->text für 3.8-Max und nur Text für 3.7-Max. Wir haben den Unterschied verifiziert, indem wir dasselbe Bild an beide geschickt haben – das ältere Modell hat es bereits auf Routing-Ebene abgelehnt.

Wir haben das Testbild lokal mit einem selbstgeschriebenen PNG-Encoder erzeugt, damit die Ground Truth durch Konstruktion feststand: 750x270 Pixel, schwarze Blockziffern 4739 auf Weiß, mit einem roten horizontalen Balken oben. Base64-kodiert gesendet, antwortete qwen3.8-max mit DIGITS: 4739 und TOPBAR: red. Beides korrekt, 6.99s, $0.002146. Die identische Anfrage an qwen3.7-max kam als HTTP 404 {"error":{"message":"No endpoints found that support image input"}} zurück.

Video funktioniert ebenfalls, mit einem Vorbehalt, den wir fast als Fehler gemeldet hätten. Zwei der drei öffentlichen MP4-URLs, die wir ausprobiert haben, lieferten HTTP 400 "Failed to download multimodal content". Das ist Alibaba, das die Datei nicht abrufen konnte, nicht die Route, die Video ablehnt. Mit einer URL, die abrufbar war, beschrieb 3.8-Max einen Big-Buck-Bunny-Clip zutreffend, inklusive Namensnennung der Figur, in 24.24s für $0.006528.

Zwei praktische Hinweise, bevor Sie darauf aufbauen. Das Video wurde als 696 normale Prompt-Token für einen rund 10-sekündigen Clip abgerechnet, und usage.prompt_tokens_details.video_tokens meldete 0 – Sie können die Videokosten also nicht aus diesem Feld herauslesen. Und ein fehlerhaftes Content-Teil scheitert lautlos: {"type": "video", "video": [url]} statt video_url zu senden lieferte HTTP 200, wobei das Modell höflich mitteilte, es könne kein Video sehen – plus Rechnung. Nutzen Sie video_url.

Wissenswert: Als wir 3.8-Max baten, seine eigenen Fähigkeiten zu beschreiben, antwortete es Input modalities: text. Das ist falsch, wie der nächste Test in unserem eigenen Lauf zeigte. Die Selbstbeschreibung eines Modells ist eine Sprachmodell-Ausgabe, kein Datenblatt.

Wie gut hält das 1M-Token-Kontextfenster?

Wir haben drei einzigartige Fakten bei 10%, 50% und 90% Tiefe in generiertem Füllmaterial platziert und in einem einzigen Aufruf nach allen drei gefragt. 18 von 18 Nadeln kamen über sechs Läufe auf zwei Modellen korrekt zurück, bei Prompt-Größen von 5,723 bis 247,911 Token, geprüft per exaktem Substring-Abgleich im Code, nicht durch Lesen der Antworten.

Unsere qwen3.8-max-Läufe (die beiden qwen3.7-max-Läufe bei 83,380 und 247,873 Token sowie ein qwen3-max-Lauf bei 78,255 lieferten ebenfalls jede Nadel zurück):

Prompt-Token (qwen3.8-max)LatenzKostenGefundene Nadeln
5,7239.24s$0.014093 von 3
25,70313.43s$0.054533 von 3
83,41817.63s$0.169653 von 3
247,91138.54s$0.498283 von 3

Die Latenz skaliert unterproportional, was praktisch der nützliche Teil ist: 43x mehr Eingabe-Token kosten nur 4.2x mehr Wall-Time.

Nun die ehrlichen Grenzen, denn das ist die leichte Übung bei Long-Context-Evaluierung. Einen wortwörtlich platzierten Fakt wiederzufinden sagt sehr wenig über Reasoning in einem großen Dokument aus, und wir haben jede Größe nur einmal getestet. Wir haben keinen 1M-Token-Aufruf gefahren. Bei $2.00 pro Million Eingabe-Token hätte das rund $2.00 gekostet, mehr als dieser gesamte Testlauf, und eine einzelne Stichprobe hätte kaum etwas ausgesagt. Die beworbene 1M-Obergrenze ist von uns daher unverifiziert. Und 3.7-Max traf bei beiden Größen, die wir verglichen haben, exakt dasselbe Ergebnis wie 3.8-Max, sodass Long-Context-Retrieval nicht der Punkt ist, an dem sich diese Generation absetzt.

Eine Preisfalle kam hier zum Vorschein, die die Launch-Berichterstattung komplett übersieht. qwen3-max hat gestaffelte Preisaufschläge, die den Satz über 32,000 Prompt-Token verdoppeln und über 128,000 nochmal anheben, während 3.8-Max und 3.7-Max bei jeder Länge Flat-Rate bleiben. Wir haben die Staffelung anhand der tatsächlichen Abrechnung bestätigt: Unser 78,255-Token-Aufruf an qwen3-max wurde mit $0.12227 berechnet, dem $1.56/M-Satz, nicht dem Schlagzeilen-$0.78/M-Satz. Bei dieser Länge kostet es fast exakt so viel wie 3.7-Max ($0.12523). Sein Schlagzeilenpreis liegt bei weniger als der Hälfte. Sein tatsächlicher Preis bei 80k Token ist einen Rundungsfehler davon entfernt.

Alibabas fünf Benchmark-Werte, und warum keiner davon verifiziert ist

Alibaba hat mit dem GA-Release fünf Benchmark-Werte veröffentlicht. Jeder einzelne stammt aus Alibabas eigenen internen Läufen, und eine unabhängig veröffentlichte Evaluierung haben wir Stand 2026-08-04 nicht gefunden. Dieser Satz gehört direkt neben die Zahlen, nicht drei Absätze darunter.

BenchmarkAlibaba-eigener WertVon Dritten verifiziert?
Terminal-Bench 2.186.6Nein, Stand 2026-08-04
GPQA Diamond92.6Nein, Stand 2026-08-04
PaperBench93.0Nein, Stand 2026-08-04
OSWorld-Verified86.1Nein, Stand 2026-08-04
DeepSWE 1.156.6 (Vorgänger: 21.6)Nein, Stand 2026-08-04

Alibaba hat außerdem einen internen Aggregatwert von 0.725 gemeldet, hoch von 0.474, und das Modell nahe oder über Claude Opus 4.8, Fable 5 und GPT-5.6 Sol positioniert. Auch Arena-Platzierungen kursierten: 5. Platz in Text Arena und 2. Platz in Vision Arena laut Alibabas eigener Ankündigung vom 2026-08-03, was wir auf dem Live-Leaderboard nicht erneut bestätigt haben. Arena-Ränge bewegen sich täglich. Behandeln Sie jeden Rang, den Sie diese Woche lesen, als Momentaufnahme mit Datum.

Was bislang niemand gemessen hat, uns eingeschlossen: Durchsatz unter Last, nicht-englische Performance, Sicherheits- und Alignment-Evaluierungen sowie die Verlässlichkeit von Tool-Calling. Unsere eigenen Zahlen decken Latenz, Kosten, Modalität und Long-Context-Retrieval auf einer einzigen Route ab, und sonst nichts. Bloombergs Launch-Bericht hat die Benchmark-Behauptungen ohne eigene Tests wiederholt – dort steht praktisch die gesamte aktuelle Berichterstattung.

Für Zahlen, die tatsächlich geprüft wurden, ist unser Vergleich Qwen vs. DeepSeek vs. GLM die bessere Referenz, und Kimi K3 mit rund 2.8T ist der Größenrivale, an dem sich alle messen.

Qwen3.8 vs. Qwen3-8B, und die Open-Weight-Kehrtwende hinter diesem Release

Qwen3.8 ist Alibabas 2.4-Billionen-Parameter-Flaggschiff. Qwen3-8B ist ein dichtes Modell mit 8 Milliarden Parametern aus der Qwen3-Serie, herunterladbar seit 2025. Ähnlich klingende Namen, rund das 300x Unterschied in der Größe. Suchmaschinen werfen die beiden noch immer in einen Topf, und erstaunlich viele Forumsantworten auch.

Das Namensproblem wurde diese Woche schlimmer, nicht besser. Alles, was auf Hugging Face aktuell den Namen „Qwen3.8" trägt, sind Community-4B-Destillate. Wer dort nach Gewichten sucht und eines davon herunterlädt, hat etwas ohne jeden Bezug zum 2.4T-Modell.

Zwei geschlossene Flaggschiffe, und dann das hier

Das Versprechen offener Gewichte ist hier die eigentliche Nachricht, und es liest sich anders, sobald man die Familiengeschichte kennt. Alibaba hat zwei Generationen lang eine bewusste Trennung gefahren: offene Arbeitspferde für alle, geschlossenes Flaggschiff an der Spitze.

GenerationGewichteAnmerkungen
Qwen 3.5 (0.8B bis 397B-A17B)Offen, Apache 2.0Komplette Familie öffentlich veröffentlicht
Qwen 3.6 (27B dense, 35B-A3B MoE)Offen, Apache 2.0Gleiches Muster beibehalten
Qwen3.7-MaxGeschlossenNur per API. Kein GGUF, kein Hugging-Face-Checkpoint
Qwen3.8-MaxOffen versprochen, noch nicht ausgeliefert„Nächste Woche" Stand 2026-08-03. Lizenz nicht angekündigt

Alibaba hat die Flaggschiff-Stufe zwei Generationen lang geschlossen gehalten und kündigt nun an, das größte je gebaute Modell zu öffnen. Falls die Gewichte wie versprochen kommen, ist das eine echte Kehrtwende, und sie setzt jedes Labor unter Druck, das „Frontier-Modelle bleiben geschlossen" bisher als feststehende Sache behandelt hat. Falls es sich verschiebt, wird das der dritte geschlossene Max-Release in Folge. Beide Ausgänge sind am 2026-08-04 noch offen. Dieselbe Dynamik haben wir bei GLM 5.2 erlebt, wo die tatsächlich ausgelieferte Lizenz am Ende mehr zählte als die Ankündigung.

Können Sie Qwen3.8-Max selbst betreiben? (Immer noch nein)

Nein, und die GA-Spezifikationen machen das eher klarer als weniger klar. Bei 2.4 Billionen Parametern gesamt ist das kein Modell, das Sie auf eigener Hardware servieren – auch nicht, sobald die Gewichte da sind. DeepSeek-V3.2 mit 685B wird schon von Leuten, die es selbst gehostet haben, als ernsthaftes Infrastrukturprojekt beschrieben. Dieses Modell ist ein Vielfaches davon.

Was bringt Ihnen also ein offenes 2.4T-Modell tatsächlich?

  • Inferenzanbieter können es hosten, das bedeutet Preiswettbewerb, das senkt Ihre Kosten pro Token
  • Souveräne, regulierte und air-gapped Deployments werden auf dieser Stufe erstmals möglich
  • Forscher und Fine-Tuner erhalten ein Basismodell auf Frontier-Niveau zum Arbeiten
  • Es bedeutet nicht, dass es auf Ihrer Maschine läuft, auf einer einzelnen A100 oder im GPU-Budget Ihres Startups

Wenn Sie die Rechnung sehen wollen, was der Betrieb großer offener Modelle wirklich verlangt, macht unser LLM-VRAM-Bedarf-Leitfaden genau diese Mathematik. Die Kurzversion für dieses Modell: lassen Sie es.

Wechseln, testen oder abwarten?

Ihre SituationWas wir am 2026-08-04 tun würden
Sie betreiben Qwen3.7-Max in ProduktionTesten Sie 3.8-Max zuerst auf Traffic mit kurzen Prompts. Dort zeigte sich unser 4x-Kostenvorteil. Prüfen Sie danach Ihr max_tokens-Handling für den Leere-Antwort-Fall
Long-Context oder schwere RAG-WorkloadBleiben Sie erstmal, wo Sie sind. 3.8-Max kostet 35.6% mehr pro Token und traf bei unserem Retrieval-Test exakt dasselbe Ergebnis wie 3.7-Max
Sie brauchen Bild- oder Video-EingabeDas ist der Grund zu wechseln. 3.7-Max kann überhaupt kein Bild verarbeiten, und wir haben den 404 bestätigt
Sie warten auf offene GewichteMerken Sie sich 2026-08-10. Bis es eine Modellkarte und eine Lizenz zum Lesen gibt, gibt es nichts zu tun
Sie sind zufrieden mit Claude oder GPTHeute ändert sich nichts. Alibabas Benchmark-Werte sind unverifiziert, und unverifizierte Zahlen sind kein Migrationsgrund

Die Methode zählt mehr als das Urteil. Jedes Modell, das wir in Produktion getestet haben, hat sich anders verhalten als seine Leaderboard-Position vermuten ließ, denn Ihre Prompts, Ihre Codebasis und Ihre Toleranz für Wiederholungsversuche stehen in keinem Benchmark. Zwei Coding-Aufgaben in unserem Lauf verdeutlichen das: 3.8-Max und 3.7-Max erzielten beide 11 von 11 bei einer String-Breiten-Truncation-Aufgabe und bestanden beide 5,000 von 5,000 gefuzzten Fällen bei Datumsarithmetik. Bei der Korrektheit konnten wir sie nicht unterscheiden. Die Lücke, die wir gemessen haben, liegt bei Latenz und Token-Verbrauch auf leichten Prompts, nicht bei der Fähigkeit auf schweren.

Sie planen eine Migration und möchten einen zweiten Blick auf das Kostenmodell? Lassen Sie unser Team es an Ihrer Workload stresstesten.

Alle Zahlen am 2026-08-04 verifiziert. Preise, Arena-Ränge und der Zeitplan für die Gewichte ändern sich häufig. Unsere Messungen stammen von einer einzigen Route (OpenRouter zu Alibaba), einer Maschine, einem Tag, mit n=3 für Latenz und n=1 für die meisten funktionalen Prüfungen.

Häufig gestellte Fragen

Ist Qwen3.8-Max Open Source?

Nicht am 2026-08-04. Es ist ausschließlich per API verfügbar. Alibaba hat die Gewichte für „nächste Woche" auf Hugging Face und ModelScope angekündigt, aber keine Lizenz genannt. Schlagzeilen, die es als Open Source bezeichnen, sind den Fakten voraus. Eine Hugging-Face-Suche liefert nur Drittanbieter-4B-Destillate, keine Alibaba-Modellkarte.

Wie viel kostet Qwen3.8-Max?

$2.00 pro Million Eingabe-Token und $6.00 pro Million Ausgabe, mit zwischengespeicherter Eingabe zu $0.25 gemeldet. Das ist 35.6% mehr als bei Qwen3.7-Max auf beiden Seiten. Wir haben einen Median von $0.001592 pro kurzem Aufruf gemessen, rund 4x günstiger als 3.7-Max beim gleichen Prompt, weil es deutlich weniger Reasoning-Token ausgibt.

Wie viele Parameter hat Qwen3.8-Max?

2.4 Billionen gesamt, laut Alibabas Ankündigung und jedem Medium, das darüber berichtet. Die aktive Anzahl ist umstritten: SiliconANGLE, The Decoder und Coursiv melden ~95 Milliarden aktiv, während MarkTechPost schreibt, Alibaba habe sie nicht offengelegt. Die API bietet kein Parameterfeld, wir konnten also keine der beiden Zahlen verifizieren.

Welches Kontextfenster hat Qwen3.8-Max?

Die Live-API meldet 1,000,000 Token Kontext und 131,072 maximale Completion-Token. Wir haben Retrieval bis 247,911 Token ohne Fehler getestet. Einen 1M-Token-Aufruf haben wir nicht gefahren, weil er rund $2.00 gekostet und unser Testbudget gesprengt hätte, sodass das obere Ende dieses Fensters von uns unverifiziert bleibt.

Unterstützt Qwen3.8-Max Bild- und Video-Eingabe?

Ja zu beidem, und wir haben es verifiziert. Es hat Ziffern und eine Farbe korrekt aus einem lokal erzeugten PNG gelesen und ein Video zutreffend beschrieben, wenn eine abrufbare URL vorlag. Qwen3.7-Max lehnt Bilder rundweg mit einem 404 ab. Zwei unserer drei Test-Video-URLs scheiterten beim Download-Schritt des Anbieters.

Sind Qwen3.8-Max' Benchmark-Werte unabhängig verifiziert?

Nein. Terminal-Bench 2.1 mit 86.6, GPQA Diamond mit 92.6, PaperBench mit 93.0, OSWorld-Verified mit 86.1 und DeepSWE 1.1 mit 56.6 stammen alle aus Alibabas internen Läufen. Stand 2026-08-04 haben wir für keinen davon eine Evaluierung Dritter gefunden.

Kann ich Qwen3.8-Max lokal betreiben?

Realistisch nein, selbst sobald die Gewichte ausgeliefert sind. Bei 2.4 Billionen Parametern ist es ein Vielfaches der Größe von DeepSeek-V3.2, das schon ein echtes Infrastrukturprojekt zum Selbst-Hosten ist. Rechnen Sie damit, es über Inferenzanbieter zu nutzen statt über eigene GPUs, es sei denn, Sie betreiben ein Rechenzentrum.

Sollte ich von Qwen3.7-Max auf Qwen3.8-Max migrieren?

Kommt auf Ihren Token-Mix an. Bei kurzen Prompts haben wir 3.8-Max bei rund einem Viertel der Kosten und vier- bis fünffacher Geschwindigkeit gemessen. Bei Workloads mit langer Eingabe kostet es 35.6% mehr und lieferte bei unserem Retrieval-Test identisch ab. Wenn Sie Bild- oder Video-Eingabe brauchen, kann 3.7-Max das überhaupt nicht.

Wann werden die Gewichte von Qwen3.8-Max veröffentlicht?

Alibaba sagte in seiner Ankündigung vom 2026-08-03 „nächste Woche" und nannte Hugging Face und ModelScope als Ziele. Kein genaues Datum, kein Lizenztext. Ein begleitendes offenes Modell, Qwen3.8-27B, soll Berichten zufolge parallel dazu erscheinen. Wir planen, am 2026-08-10 erneut zu prüfen.

Tags

qwen-3-8qwen3-8-max-previewopen-weight-llmalibaba-qwenllm-tooling

Diesen Artikel teilen

Ihr Projekt starten

Bereit, etwas Außergewöhnliches zu bauen?

Machen wir aus Ihrer Vision ein fertiges Produkt. Unser Team baut mit Ihnen Software, die spürbar etwas bewegt.