
$1.4728. So viel haben uns 40 Live-API-Aufrufe über Qwen3.8-Max und seine beiden Vorgänger am 2026-08-04 gekostet, dem Tag nach Alibabas Release. Die Überraschung waren nicht die 2.4 Billionen Parameter. Es war das hier: 3.8-Max verlangt 35.6% mehr pro Token als Qwen3.7-Max und kam trotzdem auf rund 4x günstiger pro Antwort, weil es aufgehört hat, sich zu Tode zu überlegen. Noch etwas, das die meiste Launch-Berichterstattung falsch macht: Es ist nicht Open Source. Noch nicht.
Dieser Beitrag wurde erstmals am 2026-07-19 veröffentlicht, als Qwen3.8 noch eine Preview ohne veröffentlichte Spezifikationen war. Er wurde am 2026-08-04 anhand des GA-Release und unserer eigenen API-Tests überarbeitet.
Die wichtigsten Erkenntnisse
- Stand 2026-08-04 ist Qwen3.8-Max ausschließlich per API verfügbar. Alibaba hat die Gewichte für „nächste Woche" versprochen, also die Woche ab 2026-08-10, auf Hugging Face und ModelScope.
- Wir haben $0.001592 pro kurzem Aufruf gemessen gegenüber $0.006428 bei Qwen3.7-Max – trotz höherem Preis pro Token.
- Alibabas fünf Benchmark-Werte stammen vom Anbieter selbst. Eine unabhängig veröffentlichte Evaluierung haben wir Stand 2026-08-04 nicht gefunden.
- Bild- und Video-Eingabe sind echt und neu. Wir haben beides gegen die API und gegen die Ablehnung von 3.7-Max verifiziert.
Was sich zwischen Preview und GA geändert hat
Qwen3.8-Max wurde am 2026-08-03 allgemein verfügbar, und der Release hat jede offene Frage beantwortet, die diese Seite vor zwei Wochen noch aufgelistet hat. Die Preview-Ära lieferte eine Parameteranzahl und ein Versprechen. Der GA-Release brachte ein bestätigtes 1M-Token-Kontextfenster, Text- plus Bild- plus Video-Eingabe, fünf veröffentlichte Benchmark-Werte und einen Preis pro Token.
Hier ist das alte Register der Unbekannten, aufgelöst:
| Was diese Seite am 2026-07-19 sagte | Status am 2026-08-04 |
|---|---|
| Veröffentlichter Benchmark-Wert: keiner | Fünf Alibaba-eigene Werte veröffentlicht |
| Aktive Parameter / MoE-Konfiguration: nicht offengelegt | Vielfach als ~95B aktiv, sparse MoE gemeldet. Berichterstattung widerspricht sich, siehe unten |
| Kontextfenster und maximale Ausgabe: nicht angekündigt | 1M Eingabe, 131,072 Ausgabe, von der Live-API bestätigt |
| Modalität: nicht angekündigt | Text + Bild + Video als Eingabe, Text als Ausgabe. Wir haben das selbst verifiziert |
| Preis pro Token: nicht aufgeschlüsselt | $2.00 / M Eingabe, $6.00 / M Ausgabe |
| Datum für offene Gewichte: „bald", kein Datum | „Nächste Woche", Hugging Face und ModelScope genannt |
| Qwen3.8-Max-Preview läuft jetzt | Preview ist vorbei. GA ist gelauncht |
Ein Punkt hat sich nicht aufgelöst. Die Parameter-Aufteilung ist weiter umstritten. MarkTechPosts Launch-Artikel schreibt unmissverständlich, dass Alibaba die aktive Parameteranzahl nicht offengelegt hat, während SiliconANGLE, The Decoder und Coursiv alle ~95 Milliarden aktiv nennen. Wir haben den MarkTechPost-Artikel am 2026-08-04 erneut gelesen, und dort steht weiterhin „nicht offengelegt". Irgendjemandes Quellenlage ist falsch, und ehrlich gesagt hat sich die Berichterstattung zu dieser konkreten Zahl am Launch-Tag widersprochen.
Wir konnten es in keiner Richtung verifizieren. Die /models-Antwort von OpenRouter enthält überhaupt kein Feld für die Parameteranzahl, also bestätigt oder widerlegt nichts in unseren Tests die 2.4T gesamt oder die 95B aktiv.
Ist Qwen3.8-Max Open Source? Nicht am 4. August
Nein. Stand 2026-08-04 ist Qwen3.8-Max ausschließlich per API verfügbar. Alibaba hat die Gewichte für „nächste Woche" auf Hugging Face und ModelScope angekündigt, aber keine Lizenz genannt. In der Berichterstattung wird „verfügbar" ständig mit „offen" gleichgesetzt, und genau diese Unterscheidung ist die eigentliche Geschichte. Heute gibt es keine Gewichte zum Herunterladen, was auch immer eine Schlagzeile behauptet.
Drei Zustände werden hier zu einem Wort zusammengefasst. Sie sind nicht dasselbe:
| Zustand | Qwen3.8-Max am 2026-08-04 |
|---|---|
| Über API verfügbar | Ja. Alibaba Cloud Model Studio, plus Reseller und Router |
| Gewichte herunterladbar | Nein. „Nächste Woche" versprochen, kein Datum genannt |
| Lizenzbedingungen | Nicht angekündigt. Es existiert kein Text zum Lesen |
Wir haben den härtesten verfügbaren Beleg geprüft, statt jemandem sein Wort zu glauben: eine Hugging-Face-Suche nach Qwen3.8 liefert am 2026-08-04 keine Alibaba-Modellkarte. Was sie liefert, sind vier Community-Uploads namens Qwen3.8_4B_Distilled und Varianten davon – Drittanbieter-Destillate, nicht das Flaggschiff. Wer diese Seite schnell überfliegt, verwechselt sie leicht mit dem echten Release.
Eine Anmerkung zur Lizenz, denn Präzedenzfall wird hier ständig als Zusage verkauft. Qwen 3.5 und Qwen 3.6 erschienen beide unter Apache 2.0. Eine restriktive Community-Lizenz bei 2.4T würde den Begriff „offene Gewichte" trotzdem technisch erfüllen, während sie grundlegend ändert, was Sie damit bauen dürfen. Bis es Lizenztext gibt, rät jeder, der Ihnen sagt, was Sie mit diesen Gewichten tun dürfen, nur. Deshalb steht Qwen3.8-Max auch nicht in unserer Übersicht der Open-Source-LLMs, die 2026 einen Blick wert sind: Es qualifiziert sich noch nicht.
Was wir gemessen haben: 4x günstiger pro Aufruf trotz 35.6%-Preisanstieg
Wir haben 40 kostenpflichtige Aufrufe gegen qwen3.8-max, qwen3.7-max und qwen3-max über OpenRouter am 2026-08-04 gefahren, Gesamtausgabe $1.4728. Jede Kostenangabe unten wurde aus dem zurückgegebenen usage-Objekt berechnet und gegen OpenRouters eigene abgerechnete Zahl abgeglichen. Alle stimmten überein. Der Hauptbefund läuft dem Preisanstieg entgegen.
Zuerst der Preis. Live-Preise von GET /models am 2026-08-04 setzen 3.8-Max bei $2.00 Eingabe / $6.00 Ausgabe pro Million Token, gegenüber 3.7-Max bei $1.475 / $4.425. Das ist ein Anstieg von 35.6% auf beiden Seiten, und das Verhältnis ist auf beiden Seiten identisch (2.000/1.475 = 6.000/4.425 = 1.3559). Die aktuellen Zahlen können Sie auf der OpenRouter-Modellseite gegenprüfen.
Jetzt derselbe triviale Prompt an alle drei Modelle geschickt, drei Läufe je Modell, temperature: 0, gestreamt:
| Modell | Erstes Token (3 Läufe) | Erster sichtbarer Inhalt | Wall-Time (3 Läufe) | Completion-Token | davon Reasoning | Median-Kosten/Aufruf |
|---|---|---|---|---|---|---|
| qwen3.8-max | 2.249s / 0.874s / 1.054s | 5.414s / 5.058s / 4.209s | 6.338s / 6.734s / 5.130s | 242 / 287 / 243 | 156 / 194 / 157 | $0.001592 |
| qwen3.7-max | 4.871s / 1.157s / 1.670s | nie / 22.358s / 25.998s | 31.147s / 24.013s / 27.661s | 1502 / 1281 / 1443 | 1500 / 1174 / 1346 | $0.006428 |
| qwen3-max | 2.617s / 2.892s / 2.386s | 2.617s / 2.892s / 2.386s | 4.401s / 4.601s / 4.081s | 105 / 105 / 107 | 0 / 0 / 0 | $0.000431 |
Zwei getrennte Spalten für „erstes Token" sind nötig, weil beide Reasoning-Modelle verstecktes Nachdenken streamen, bevor irgendein Antworttext kommt. Bei 3.8-Max trifft in zwei von drei Läufen ein Token innerhalb einer Sekunde ein, aber das erste tatsächlich lesbare Wort landet vier bis fünf Sekunden später. Bei 3.7-Max, Lauf 1, kam es überhaupt nicht an. Wer eine Streaming-UI gegen ein Reasoning-Modell baut, sieht den Spinner lange weiterdrehen, nachdem die Verbindung längst als aktiv erwiesen ist.
Die Reasoning-Spalte verdient einen zweiten Blick. Bei einem Prompt, der eine Drei-Satz-Erklärung eines Bloom-Filters verlangt, verbrauchte 3.7-Max zwischen 1,174 und 1,500 Reasoning-Token. 3.8-Max brauchte 156 bis 194. Das ist rund 7x weniger Nachdenken für dieselbe Antwort, und Reasoning-Token werden zum Ausgabepreis abgerechnet. Das Ergebnis: 3.8-Max ist etwa 4x günstiger pro Aufruf und 4 bis 5 Mal schneller in der Wall-Time von unserer Maschine aus, inklusive Netzwerk-Roundtrip, bei gleichzeitig 35.6% höherem Preis pro Token. Der Listenpreis stieg, die Rechnung sank.
Das kippt, wenn Prompts größer werden. Aus Live-Preisen modelliert, nicht gemessen: Ein 30,000-Token-Aufruf mit 500 Ausgabe-Token kostet $63.00 pro tausend Aufrufe bei 3.8-Max gegenüber $46.46 bei 3.7-Max. Bei 100,000 Eingabe-Token sind es $203.00 gegenüber $149.71. Sobald der Großteil Ihrer Token Eingabe ist, zahlt sich der Reasoning-Effizienzvorteil den Preisanstieg nicht mehr aus, und 3.8-Max wird zum teuersten der drei. Welches Modell am günstigsten ist, hängt tatsächlich von Ihrem Verhältnis aus Eingabe zu Ausgabe ab – dieselbe Lehre, bei der auch unser LLM-API-Preisvergleich immer wieder landet.
reasoning_effort ist neu, und 3.7-Max ignoriert es lautlos
reasoning_effort taucht bei 3.8-Max in den unterstützten Parametern auf, bei 3.7-Max nicht. Bei 3.8-Max bewegt es die Nadel moderat: über drei Läufe je Einstellung produzierte minimal 67, 108 und 124 Reasoning-Token gegenüber high bei 163, 136 und 173. Median 108 gegenüber 163, beim gleichen Prompt, bei Temperatur 0.
Der Befund, der Geld kostet, betrifft das ältere Modell. reasoning_effort: "low" an 3.7-Max zu schicken wird akzeptiert statt abgelehnt – und dann ignoriert: Der Aufruf verbrannte trotzdem 1,401 Reasoning-Token und berechnete dieselben $0.006689 wie der identisch geformte Aufruf, den wir protokolliert hatten. Kein Fehler, keine Warnung, keine Wirkung. Wer die Kosten über eine niedrigere Reasoning-Stufe steuern will, sollte prüfen, ob das beim tatsächlich aufgerufenen Modell überhaupt etwas bewirkt, denn ein nicht unterstützter Parameter scheitert hier lautlos statt laut.
Die Leere-Antwort-Falle, die Sie vor der Migration prüfen sollten
Unser erster Testlauf nutzte max_tokens: 400 und ließ unser eigenes Skript abstürzen. Der Grund war mehr wert als der Test selbst. Qwen3.7-Max kann sein gesamtes Token-Budget fürs Nachdenken verbrauchen und einen leeren String zurückgeben, mit finish_reason: "length", voll berechnet.
Uns ist das dreimal separat passiert. Bei max_tokens: 400: 402 Completion-Token, davon 400 Reasoning, null Antwortzeichen, $0.001822 berechnet. Bei max_tokens: 1500: 1,502 Token, 1,500 Reasoning, null Zeichen, $0.006689 für nichts. Und noch einmal bei einem späteren Aufruf, $0.006735. Kein Fehler, keine Ausnahme, nur ein flüssig wirkendes Antwortobjekt mit leerem Inhalts-String.
Wer eine bestehende 3.7-Max-Integration migriert und im Code ein moderates max_tokens gesetzt hat, sollte diesen Pfad testen. Das deutlich kürzere Reasoning von 3.8-Max macht es spürbar weniger anfällig. Immun ist es nicht.
Ein kleiner Token-Overhead, den kaum jemand erwähnt
Derselbe 12-Wörter-Prompt zählte 67 Prompt-Token bei 3.8-Max und 29 bei 3.7-Max, durchgehend über jeden Lauf hinweg (27 bei qwen3-max). Das sind rund 38 Token fester Overhead, vermutlich ein größeres System- oder Chat-Template. Bei einem 100,000-Token-RAG-Aufruf fällt das nicht ins Gewicht. Bei einem hochfrequenten Klassifikator mit kurzen Prompts verdoppelt es die Eingabekosten mehr als, bevor Sie ein Wort geschrieben haben.
Nimmt Qwen3.8-Max wirklich Bilder und Videos an?
Ja, und multimodale Eingabe ist in dieser Generation wirklich neu, keine Umetikettierung. Die API meldet text+image+video->text für 3.8-Max und nur Text für 3.7-Max. Wir haben den Unterschied verifiziert, indem wir dasselbe Bild an beide geschickt haben – das ältere Modell hat es bereits auf Routing-Ebene abgelehnt.
Wir haben das Testbild lokal mit einem selbstgeschriebenen PNG-Encoder erzeugt, damit die Ground Truth durch Konstruktion feststand: 750x270 Pixel, schwarze Blockziffern 4739 auf Weiß, mit einem roten horizontalen Balken oben. Base64-kodiert gesendet, antwortete qwen3.8-max mit DIGITS: 4739 und TOPBAR: red. Beides korrekt, 6.99s, $0.002146. Die identische Anfrage an qwen3.7-max kam als HTTP 404 {"error":{"message":"No endpoints found that support image input"}} zurück.
Video funktioniert ebenfalls, mit einem Vorbehalt, den wir fast als Fehler gemeldet hätten. Zwei der drei öffentlichen MP4-URLs, die wir ausprobiert haben, lieferten HTTP 400 "Failed to download multimodal content". Das ist Alibaba, das die Datei nicht abrufen konnte, nicht die Route, die Video ablehnt. Mit einer URL, die abrufbar war, beschrieb 3.8-Max einen Big-Buck-Bunny-Clip zutreffend, inklusive Namensnennung der Figur, in 24.24s für $0.006528.
Zwei praktische Hinweise, bevor Sie darauf aufbauen. Das Video wurde als 696 normale Prompt-Token für einen rund 10-sekündigen Clip abgerechnet, und usage.prompt_tokens_details.video_tokens meldete 0 – Sie können die Videokosten also nicht aus diesem Feld herauslesen. Und ein fehlerhaftes Content-Teil scheitert lautlos: {"type": "video", "video": [url]} statt video_url zu senden lieferte HTTP 200, wobei das Modell höflich mitteilte, es könne kein Video sehen – plus Rechnung. Nutzen Sie video_url.
Wissenswert: Als wir 3.8-Max baten, seine eigenen Fähigkeiten zu beschreiben, antwortete es Input modalities: text. Das ist falsch, wie der nächste Test in unserem eigenen Lauf zeigte. Die Selbstbeschreibung eines Modells ist eine Sprachmodell-Ausgabe, kein Datenblatt.
Wie gut hält das 1M-Token-Kontextfenster?
Wir haben drei einzigartige Fakten bei 10%, 50% und 90% Tiefe in generiertem Füllmaterial platziert und in einem einzigen Aufruf nach allen drei gefragt. 18 von 18 Nadeln kamen über sechs Läufe auf zwei Modellen korrekt zurück, bei Prompt-Größen von 5,723 bis 247,911 Token, geprüft per exaktem Substring-Abgleich im Code, nicht durch Lesen der Antworten.
Unsere qwen3.8-max-Läufe (die beiden qwen3.7-max-Läufe bei 83,380 und 247,873 Token sowie ein qwen3-max-Lauf bei 78,255 lieferten ebenfalls jede Nadel zurück):
| Prompt-Token (qwen3.8-max) | Latenz | Kosten | Gefundene Nadeln |
|---|---|---|---|
| 5,723 | 9.24s | $0.01409 | 3 von 3 |
| 25,703 | 13.43s | $0.05453 | 3 von 3 |
| 83,418 | 17.63s | $0.16965 | 3 von 3 |
| 247,911 | 38.54s | $0.49828 | 3 von 3 |
Die Latenz skaliert unterproportional, was praktisch der nützliche Teil ist: 43x mehr Eingabe-Token kosten nur 4.2x mehr Wall-Time.
Nun die ehrlichen Grenzen, denn das ist die leichte Übung bei Long-Context-Evaluierung. Einen wortwörtlich platzierten Fakt wiederzufinden sagt sehr wenig über Reasoning in einem großen Dokument aus, und wir haben jede Größe nur einmal getestet. Wir haben keinen 1M-Token-Aufruf gefahren. Bei $2.00 pro Million Eingabe-Token hätte das rund $2.00 gekostet, mehr als dieser gesamte Testlauf, und eine einzelne Stichprobe hätte kaum etwas ausgesagt. Die beworbene 1M-Obergrenze ist von uns daher unverifiziert. Und 3.7-Max traf bei beiden Größen, die wir verglichen haben, exakt dasselbe Ergebnis wie 3.8-Max, sodass Long-Context-Retrieval nicht der Punkt ist, an dem sich diese Generation absetzt.
Eine Preisfalle kam hier zum Vorschein, die die Launch-Berichterstattung komplett übersieht. qwen3-max hat gestaffelte Preisaufschläge, die den Satz über 32,000 Prompt-Token verdoppeln und über 128,000 nochmal anheben, während 3.8-Max und 3.7-Max bei jeder Länge Flat-Rate bleiben. Wir haben die Staffelung anhand der tatsächlichen Abrechnung bestätigt: Unser 78,255-Token-Aufruf an qwen3-max wurde mit $0.12227 berechnet, dem $1.56/M-Satz, nicht dem Schlagzeilen-$0.78/M-Satz. Bei dieser Länge kostet es fast exakt so viel wie 3.7-Max ($0.12523). Sein Schlagzeilenpreis liegt bei weniger als der Hälfte. Sein tatsächlicher Preis bei 80k Token ist einen Rundungsfehler davon entfernt.
Alibabas fünf Benchmark-Werte, und warum keiner davon verifiziert ist
Alibaba hat mit dem GA-Release fünf Benchmark-Werte veröffentlicht. Jeder einzelne stammt aus Alibabas eigenen internen Läufen, und eine unabhängig veröffentlichte Evaluierung haben wir Stand 2026-08-04 nicht gefunden. Dieser Satz gehört direkt neben die Zahlen, nicht drei Absätze darunter.
| Benchmark | Alibaba-eigener Wert | Von Dritten verifiziert? |
|---|---|---|
| Terminal-Bench 2.1 | 86.6 | Nein, Stand 2026-08-04 |
| GPQA Diamond | 92.6 | Nein, Stand 2026-08-04 |
| PaperBench | 93.0 | Nein, Stand 2026-08-04 |
| OSWorld-Verified | 86.1 | Nein, Stand 2026-08-04 |
| DeepSWE 1.1 | 56.6 (Vorgänger: 21.6) | Nein, Stand 2026-08-04 |
Alibaba hat außerdem einen internen Aggregatwert von 0.725 gemeldet, hoch von 0.474, und das Modell nahe oder über Claude Opus 4.8, Fable 5 und GPT-5.6 Sol positioniert. Auch Arena-Platzierungen kursierten: 5. Platz in Text Arena und 2. Platz in Vision Arena laut Alibabas eigener Ankündigung vom 2026-08-03, was wir auf dem Live-Leaderboard nicht erneut bestätigt haben. Arena-Ränge bewegen sich täglich. Behandeln Sie jeden Rang, den Sie diese Woche lesen, als Momentaufnahme mit Datum.
Was bislang niemand gemessen hat, uns eingeschlossen: Durchsatz unter Last, nicht-englische Performance, Sicherheits- und Alignment-Evaluierungen sowie die Verlässlichkeit von Tool-Calling. Unsere eigenen Zahlen decken Latenz, Kosten, Modalität und Long-Context-Retrieval auf einer einzigen Route ab, und sonst nichts. Bloombergs Launch-Bericht hat die Benchmark-Behauptungen ohne eigene Tests wiederholt – dort steht praktisch die gesamte aktuelle Berichterstattung.
Für Zahlen, die tatsächlich geprüft wurden, ist unser Vergleich Qwen vs. DeepSeek vs. GLM die bessere Referenz, und Kimi K3 mit rund 2.8T ist der Größenrivale, an dem sich alle messen.
Qwen3.8 vs. Qwen3-8B, und die Open-Weight-Kehrtwende hinter diesem Release
Qwen3.8 ist Alibabas 2.4-Billionen-Parameter-Flaggschiff. Qwen3-8B ist ein dichtes Modell mit 8 Milliarden Parametern aus der Qwen3-Serie, herunterladbar seit 2025. Ähnlich klingende Namen, rund das 300x Unterschied in der Größe. Suchmaschinen werfen die beiden noch immer in einen Topf, und erstaunlich viele Forumsantworten auch.
Das Namensproblem wurde diese Woche schlimmer, nicht besser. Alles, was auf Hugging Face aktuell den Namen „Qwen3.8" trägt, sind Community-4B-Destillate. Wer dort nach Gewichten sucht und eines davon herunterlädt, hat etwas ohne jeden Bezug zum 2.4T-Modell.
Zwei geschlossene Flaggschiffe, und dann das hier
Das Versprechen offener Gewichte ist hier die eigentliche Nachricht, und es liest sich anders, sobald man die Familiengeschichte kennt. Alibaba hat zwei Generationen lang eine bewusste Trennung gefahren: offene Arbeitspferde für alle, geschlossenes Flaggschiff an der Spitze.
| Generation | Gewichte | Anmerkungen |
|---|---|---|
| Qwen 3.5 (0.8B bis 397B-A17B) | Offen, Apache 2.0 | Komplette Familie öffentlich veröffentlicht |
| Qwen 3.6 (27B dense, 35B-A3B MoE) | Offen, Apache 2.0 | Gleiches Muster beibehalten |
| Qwen3.7-Max | Geschlossen | Nur per API. Kein GGUF, kein Hugging-Face-Checkpoint |
| Qwen3.8-Max | Offen versprochen, noch nicht ausgeliefert | „Nächste Woche" Stand 2026-08-03. Lizenz nicht angekündigt |
Alibaba hat die Flaggschiff-Stufe zwei Generationen lang geschlossen gehalten und kündigt nun an, das größte je gebaute Modell zu öffnen. Falls die Gewichte wie versprochen kommen, ist das eine echte Kehrtwende, und sie setzt jedes Labor unter Druck, das „Frontier-Modelle bleiben geschlossen" bisher als feststehende Sache behandelt hat. Falls es sich verschiebt, wird das der dritte geschlossene Max-Release in Folge. Beide Ausgänge sind am 2026-08-04 noch offen. Dieselbe Dynamik haben wir bei GLM 5.2 erlebt, wo die tatsächlich ausgelieferte Lizenz am Ende mehr zählte als die Ankündigung.
Können Sie Qwen3.8-Max selbst betreiben? (Immer noch nein)
Nein, und die GA-Spezifikationen machen das eher klarer als weniger klar. Bei 2.4 Billionen Parametern gesamt ist das kein Modell, das Sie auf eigener Hardware servieren – auch nicht, sobald die Gewichte da sind. DeepSeek-V3.2 mit 685B wird schon von Leuten, die es selbst gehostet haben, als ernsthaftes Infrastrukturprojekt beschrieben. Dieses Modell ist ein Vielfaches davon.
Was bringt Ihnen also ein offenes 2.4T-Modell tatsächlich?
- Inferenzanbieter können es hosten, das bedeutet Preiswettbewerb, das senkt Ihre Kosten pro Token
- Souveräne, regulierte und air-gapped Deployments werden auf dieser Stufe erstmals möglich
- Forscher und Fine-Tuner erhalten ein Basismodell auf Frontier-Niveau zum Arbeiten
- Es bedeutet nicht, dass es auf Ihrer Maschine läuft, auf einer einzelnen A100 oder im GPU-Budget Ihres Startups
Wenn Sie die Rechnung sehen wollen, was der Betrieb großer offener Modelle wirklich verlangt, macht unser LLM-VRAM-Bedarf-Leitfaden genau diese Mathematik. Die Kurzversion für dieses Modell: lassen Sie es.
Wechseln, testen oder abwarten?
| Ihre Situation | Was wir am 2026-08-04 tun würden |
|---|---|
| Sie betreiben Qwen3.7-Max in Produktion | Testen Sie 3.8-Max zuerst auf Traffic mit kurzen Prompts. Dort zeigte sich unser 4x-Kostenvorteil. Prüfen Sie danach Ihr max_tokens-Handling für den Leere-Antwort-Fall |
| Long-Context oder schwere RAG-Workload | Bleiben Sie erstmal, wo Sie sind. 3.8-Max kostet 35.6% mehr pro Token und traf bei unserem Retrieval-Test exakt dasselbe Ergebnis wie 3.7-Max |
| Sie brauchen Bild- oder Video-Eingabe | Das ist der Grund zu wechseln. 3.7-Max kann überhaupt kein Bild verarbeiten, und wir haben den 404 bestätigt |
| Sie warten auf offene Gewichte | Merken Sie sich 2026-08-10. Bis es eine Modellkarte und eine Lizenz zum Lesen gibt, gibt es nichts zu tun |
| Sie sind zufrieden mit Claude oder GPT | Heute ändert sich nichts. Alibabas Benchmark-Werte sind unverifiziert, und unverifizierte Zahlen sind kein Migrationsgrund |
Die Methode zählt mehr als das Urteil. Jedes Modell, das wir in Produktion getestet haben, hat sich anders verhalten als seine Leaderboard-Position vermuten ließ, denn Ihre Prompts, Ihre Codebasis und Ihre Toleranz für Wiederholungsversuche stehen in keinem Benchmark. Zwei Coding-Aufgaben in unserem Lauf verdeutlichen das: 3.8-Max und 3.7-Max erzielten beide 11 von 11 bei einer String-Breiten-Truncation-Aufgabe und bestanden beide 5,000 von 5,000 gefuzzten Fällen bei Datumsarithmetik. Bei der Korrektheit konnten wir sie nicht unterscheiden. Die Lücke, die wir gemessen haben, liegt bei Latenz und Token-Verbrauch auf leichten Prompts, nicht bei der Fähigkeit auf schweren.
Sie planen eine Migration und möchten einen zweiten Blick auf das Kostenmodell? Lassen Sie unser Team es an Ihrer Workload stresstesten.
Alle Zahlen am 2026-08-04 verifiziert. Preise, Arena-Ränge und der Zeitplan für die Gewichte ändern sich häufig. Unsere Messungen stammen von einer einzigen Route (OpenRouter zu Alibaba), einer Maschine, einem Tag, mit n=3 für Latenz und n=1 für die meisten funktionalen Prüfungen.
Häufig gestellte Fragen
Ist Qwen3.8-Max Open Source?
Nicht am 2026-08-04. Es ist ausschließlich per API verfügbar. Alibaba hat die Gewichte für „nächste Woche" auf Hugging Face und ModelScope angekündigt, aber keine Lizenz genannt. Schlagzeilen, die es als Open Source bezeichnen, sind den Fakten voraus. Eine Hugging-Face-Suche liefert nur Drittanbieter-4B-Destillate, keine Alibaba-Modellkarte.
Wie viel kostet Qwen3.8-Max?
$2.00 pro Million Eingabe-Token und $6.00 pro Million Ausgabe, mit zwischengespeicherter Eingabe zu $0.25 gemeldet. Das ist 35.6% mehr als bei Qwen3.7-Max auf beiden Seiten. Wir haben einen Median von $0.001592 pro kurzem Aufruf gemessen, rund 4x günstiger als 3.7-Max beim gleichen Prompt, weil es deutlich weniger Reasoning-Token ausgibt.
Wie viele Parameter hat Qwen3.8-Max?
2.4 Billionen gesamt, laut Alibabas Ankündigung und jedem Medium, das darüber berichtet. Die aktive Anzahl ist umstritten: SiliconANGLE, The Decoder und Coursiv melden ~95 Milliarden aktiv, während MarkTechPost schreibt, Alibaba habe sie nicht offengelegt. Die API bietet kein Parameterfeld, wir konnten also keine der beiden Zahlen verifizieren.
Welches Kontextfenster hat Qwen3.8-Max?
Die Live-API meldet 1,000,000 Token Kontext und 131,072 maximale Completion-Token. Wir haben Retrieval bis 247,911 Token ohne Fehler getestet. Einen 1M-Token-Aufruf haben wir nicht gefahren, weil er rund $2.00 gekostet und unser Testbudget gesprengt hätte, sodass das obere Ende dieses Fensters von uns unverifiziert bleibt.
Unterstützt Qwen3.8-Max Bild- und Video-Eingabe?
Ja zu beidem, und wir haben es verifiziert. Es hat Ziffern und eine Farbe korrekt aus einem lokal erzeugten PNG gelesen und ein Video zutreffend beschrieben, wenn eine abrufbare URL vorlag. Qwen3.7-Max lehnt Bilder rundweg mit einem 404 ab. Zwei unserer drei Test-Video-URLs scheiterten beim Download-Schritt des Anbieters.
Sind Qwen3.8-Max' Benchmark-Werte unabhängig verifiziert?
Nein. Terminal-Bench 2.1 mit 86.6, GPQA Diamond mit 92.6, PaperBench mit 93.0, OSWorld-Verified mit 86.1 und DeepSWE 1.1 mit 56.6 stammen alle aus Alibabas internen Läufen. Stand 2026-08-04 haben wir für keinen davon eine Evaluierung Dritter gefunden.
Kann ich Qwen3.8-Max lokal betreiben?
Realistisch nein, selbst sobald die Gewichte ausgeliefert sind. Bei 2.4 Billionen Parametern ist es ein Vielfaches der Größe von DeepSeek-V3.2, das schon ein echtes Infrastrukturprojekt zum Selbst-Hosten ist. Rechnen Sie damit, es über Inferenzanbieter zu nutzen statt über eigene GPUs, es sei denn, Sie betreiben ein Rechenzentrum.
Sollte ich von Qwen3.7-Max auf Qwen3.8-Max migrieren?
Kommt auf Ihren Token-Mix an. Bei kurzen Prompts haben wir 3.8-Max bei rund einem Viertel der Kosten und vier- bis fünffacher Geschwindigkeit gemessen. Bei Workloads mit langer Eingabe kostet es 35.6% mehr und lieferte bei unserem Retrieval-Test identisch ab. Wenn Sie Bild- oder Video-Eingabe brauchen, kann 3.7-Max das überhaupt nicht.
Wann werden die Gewichte von Qwen3.8-Max veröffentlicht?
Alibaba sagte in seiner Ankündigung vom 2026-08-03 „nächste Woche" und nannte Hugging Face und ModelScope als Ziele. Kein genaues Datum, kein Lizenztext. Ein begleitendes offenes Modell, Qwen3.8-27B, soll Berichten zufolge parallel dazu erscheinen. Wir planen, am 2026-08-10 erneut zu prüfen.