
Το Qwen3.8-Max Είναι Εδώ: 2.4T Παράμετροι, 1M Context, και τα Βάρη Δεν Έχουν Κυκλοφορήσει Ακόμα
$1.4728. Αυτό μας κόστισαν 40 ζωντανές κλήσεις API στο Qwen3.8-Max και στους δύο προκατόχους του στις 2026-08-04, την επόμενη μέρα από την κυκλοφορία του από την Alibaba. Η έκπληξη δεν ήταν οι 2.4 τρισεκατομμύρια παράμετροι. Ήταν το εξής: το 3.8-Max χρεώνει 35.6% περισσότερο ανά token από το Qwen3.7-Max και παρόλα αυτά βγήκε περίπου 4x φθηνότερο ανά απάντηση, επειδή σταμάτησε να «σκέφτεται» υπερβολικά. Κάτι ακόμα που τα περισσότερα δημοσιεύματα για την κυκλοφορία λένε λάθος. Δεν είναι open source. Όχι σήμερα.
Αυτό το άρθρο δημοσιεύτηκε αρχικά στις 2026-07-19, όταν το Qwen3.8 ήταν σε preview χωρίς δημοσιευμένα specs. Ξαναγράφτηκε στις 2026-08-04, με βάση την κυκλοφορία GA και τις δικές μας δοκιμές API.
Βασικά Συμπεράσματα
- Από τις 2026-08-04, το Qwen3.8-Max είναι διαθέσιμο μόνο μέσω API. Η Alibaba υποσχέθηκε τα βάρη «την επόμενη εβδομάδα», δηλαδή την εβδομάδα της 2026-08-10, στο Hugging Face και στο ModelScope.
- Μετρήσαμε $0.001592 ανά σύντομη κλήση έναντι $0.006428 στο Qwen3.7-Max, παρά την υψηλότερη τιμή ανά token.
- Οι πέντε βαθμολογίες benchmark της Alibaba είναι αναφορές του ίδιου του κατασκευαστή. Δεν βρήκαμε καμία ανεξάρτητη αξιολόγηση δημοσιευμένη έως τις 2026-08-04.
- Η είσοδος εικόνας και βίντεο είναι πραγματική και νέα. Επαληθεύσαμε και τα δύο απευθείας στο API, καθώς και την άρνηση του 3.7-Max να τα δεχτεί.
Τι Άλλαξε Μεταξύ του Preview και της Κυκλοφορίας GA
Το Qwen3.8-Max έγινε γενικά διαθέσιμο (GA) στις 2026-08-03, και η κυκλοφορία απάντησε σε κάθε ανοιχτό ερώτημα που αυτή η σελίδα κατέγραφε πριν από δύο εβδομάδες. Η εποχή του preview μάς έδωσε έναν αριθμό παραμέτρων και μια υπόσχεση. Η κυκλοφορία GA πρόσθεσε ένα επιβεβαιωμένο context window 1M tokens, είσοδο κειμένου συν εικόνας συν βίντεο, πέντε δημοσιευμένες βαθμολογίες benchmark, και τιμή ανά token.
Ακολουθεί η παλιά λίστα των αγνώστων, πλέον διευκρινισμένη:
| Τι έλεγε αυτή η σελίδα στις 2026-07-19 | Κατάσταση στις 2026-08-04 |
|---|---|
| Οποιαδήποτε δημοσιευμένη βαθμολογία benchmark: καμία | Δημοσιεύτηκαν πέντε βαθμολογίες από την Alibaba |
| Ενεργές παράμετροι / διαμόρφωση MoE: μη γνωστοποιημένες | Αναφέρεται ευρέως ως ~95B ενεργές, αραιό MoE. Οι αναφορές έρχονται σε αντίθεση, δείτε παρακάτω |
| Context window και μέγιστη έξοδος: μη ανακοινωμένα | 1M είσοδος, 131,072 έξοδος, επιβεβαιωμένο από το ζωντανό API |
| Modality: μη ανακοινωμένη | κείμενο + εικόνα + βίντεο ως είσοδος, κείμενο ως έξοδος. Το επαληθεύσαμε οι ίδιοι |
| Τιμολόγηση ανά token: μη αναλυμένη | $2.00 / M είσοδος, $6.00 / M έξοδος |
| Ημερομηνία κυκλοφορίας open-weight: «σύντομα», χωρίς ημερομηνία | «Την επόμενη εβδομάδα», με ονομαστική αναφορά στο Hugging Face και στο ModelScope |
| Το Qwen3.8-Max-Preview είναι live τώρα | Το preview τελείωσε. Κυκλοφόρησε το GA |
Ένα σημείο δεν διευκρινίστηκε. Ο διαχωρισμός των παραμέτρων παραμένει αμφιλεγόμενος. Το άρθρο κυκλοφορίας του MarkTechPost αναφέρει ξεκάθαρα ότι ο αριθμός ενεργών παραμέτρων δεν γνωστοποιήθηκε από την Alibaba, ενώ οι SiliconANGLE, The Decoder και Coursiv γράφουν όλοι ~95 δισεκατομμύρια ενεργές παραμέτρους. Ξαναδιαβάσαμε το άρθρο του MarkTechPost στις 2026-08-04 και εξακολουθεί να λέει «μη γνωστοποιημένο». Κάποιου η πηγή είναι λανθασμένη, και η ειλικρινής απάντηση είναι ότι οι αναφορές γι' αυτόν τον συγκεκριμένο αριθμό έρχονταν σε αντίθεση την ημέρα της κυκλοφορίας.
Δεν μπορέσαμε να το επαληθεύσουμε προς καμία κατεύθυνση. Η απόκριση του OpenRouter στο /models δεν εκθέτει κανένα πεδίο αριθμού παραμέτρων, οπότε τίποτα στις δοκιμές μας δεν επιβεβαιώνει ούτε διαψεύδει τα 2.4T σύνολο ή τα 95B ενεργές.
Είναι το Qwen3.8-Max Open Source; Όχι στις 4 Αυγούστου
Όχι. Από τις 2026-08-04, το Qwen3.8-Max είναι διαθέσιμο μόνο μέσω API. Η Alibaba έχει προγραμματίσει την κυκλοφορία των βαρών «την επόμενη εβδομάδα» στο Hugging Face και στο ModelScope, και δεν έχει ανακοινώσει καμία άδεια χρήσης. Τα δημοσιεύματα εξακολουθούν να συγχέουν το «διαθέσιμο» με το «open», και ακριβώς αυτή η διάκριση είναι όλη η ουσία της ιστορίας. Δεν υπάρχουν βάρη για λήψη σήμερα, ό,τι κι αν λέει κάποιος τίτλος.
Τρεις διαφορετικές καταστάσεις συμπτύσσονται σε μία λέξη. Δεν είναι το ίδιο πράγμα:
| Κατάσταση | Qwen3.8-Max στις 2026-08-04 |
|---|---|
| Διαθέσιμο μέσω API | Ναι. Alibaba Cloud Model Studio, καθώς και μεταπωλητές και routers |
| Βάρη διαθέσιμα για λήψη | Όχι. Υποσχέθηκαν «την επόμενη εβδομάδα», χωρίς συγκεκριμένη ημερομηνία |
| Όροι άδειας χρήσης | Μη ανακοινωμένοι. Δεν υπάρχει κείμενο για ανάγνωση |
Ελέγξαμε το πιο άμεσο διαθέσιμο στοιχείο αντί να βασιστούμε στον λόγο κάποιου: μια αναζήτηση στο Hugging Face για Qwen3.8 στις 2026-08-04 δεν επιστρέφει καμία κάρτα μοντέλου της Alibaba. Αυτό που επιστρέφει είναι τέσσερα community uploads με το όνομα Qwen3.8_4B_Distilled και παραλλαγές, τα οποία είναι distills τρίτων, όχι το ναυαρχίδα μοντέλο. Αν σαρώνετε γρήγορα αυτή τη σελίδα, είναι εύκολο να τα μπερδέψετε με την πραγματική κυκλοφορία.
Μια σημείωση για την άδεια χρήσης, γιατί το προηγούμενο συνεχίζει να αναφέρεται σαν δέσμευση. Τα Qwen 3.5 και Qwen 3.6 κυκλοφόρησαν και τα δύο με άδεια Apache 2.0. Μια περιοριστική community άδεια σε ένα μοντέλο 2.4T θα εξακολουθούσε τεχνικά να είναι «open weights», αλλάζοντας όμως τι επιτρέπεται να χτίσετε με αυτά. Μέχρι να υπάρξει κείμενο άδειας, όποιος σας λέει τι μπορείτε να κάνετε με αυτά τα βάρη απλώς μαντεύει. Γι' αυτό, άλλωστε, το Qwen3.8-Max δεν βρίσκεται στη λίστα μας με τα open-source LLM που αξίζει να τρέξετε το 2026: δεν πληροί ακόμα τις προϋποθέσεις.
Τι Μετρήσαμε: 4x Φθηνότερο ανά Κλήση Παρά την Αύξηση Τιμής 35.6%
Τρέξαμε 40 χρεωμένες κλήσεις στα qwen3.8-max, qwen3.7-max και qwen3-max μέσω OpenRouter στις 2026-08-04, με συνολική δαπάνη $1.4728. Κάθε κόστος παρακάτω υπολογίστηκε από το επιστρεφόμενο αντικείμενο usage και επαληθεύτηκε σταυρωτά με το επίσημο χρεωμένο ποσό του OpenRouter. Όλα ταίριαζαν. Το κύριο εύρημα πηγαίνει αντίθετα από την αλλαγή τιμής.
Ξεκινώντας από την τιμή. Η ζωντανή τιμολόγηση από το GET /models στις 2026-08-04 τοποθετεί το 3.8-Max στα $2.00 είσοδος / $6.00 έξοδος ανά εκατομμύριο tokens, έναντι του 3.7-Max στα $1.475 / $4.425. Πρόκειται για αύξηση 35.6% και στις δύο πλευρές, και η αναλογία είναι πανομοιότυπη και στις δύο περιπτώσεις (2.000/1.475 = 6.000/4.425 = 1.3559). Μπορείτε να επαληθεύσετε τα τρέχοντα νούμερα στη σελίδα μοντέλου του OpenRouter.
Τώρα το ίδιο απλό prompt στάλθηκε και στα τρία μοντέλα, τρεις εκτελέσεις το καθένα, temperature: 0, με streaming:
| Μοντέλο | Πρώτο token (3 εκτελέσεις) | Πρώτο ορατό περιεχόμενο | Wall time (3 εκτελέσεις) | Tokens ολοκλήρωσης | εκ των οποίων reasoning | Μέσο κόστος/κλήση |
|---|---|---|---|---|---|---|
| qwen3.8-max | 2.249s / 0.874s / 1.054s | 5.414s / 5.058s / 4.209s | 6.338s / 6.734s / 5.130s | 242 / 287 / 243 | 156 / 194 / 157 | $0.001592 |
| qwen3.7-max | 4.871s / 1.157s / 1.670s | ποτέ / 22.358s / 25.998s | 31.147s / 24.013s / 27.661s | 1502 / 1281 / 1443 | 1500 / 1174 / 1346 | $0.006428 |
| qwen3-max | 2.617s / 2.892s / 2.386s | 2.617s / 2.892s / 2.386s | 4.401s / 4.601s / 4.081s | 105 / 105 / 107 | 0 / 0 / 0 | $0.000431 |
Χρειάζονται δύο ξεχωριστές στήλες πρώτου token επειδή και τα δύο reasoning μοντέλα στέλνουν κρυφό reasoning με streaming πριν από οποιοδήποτε κείμενο απάντησης. Στο 3.8-Max ένα token φτάνει σε λιγότερο από ένα δευτερόλεπτο σε δύο από τις τρεις εκτελέσεις, αλλά η πρώτη λέξη που μπορεί πραγματικά να διαβάσει ο χρήστης εμφανίζεται τέσσερα με πέντε δευτερόλεπτα αργότερα. Στο 3.7-Max, στην εκτέλεση 1 δεν εμφανίστηκε ποτέ. Αν χτίζετε ένα streaming UI πάνω σε ένα reasoning μοντέλο, το spinner συνεχίζει να γυρίζει πολύ αφότου η σύνδεση έχει ήδη αποδειχθεί ενεργή.
Διαβάστε τη στήλη reasoning δύο φορές. Σε ένα prompt που ζητούσε μια εξήγηση τριών προτάσεων για ένα Bloom filter, το 3.7-Max ξόδεψε μεταξύ 1,174 και 1,500 reasoning tokens. Το 3.8-Max ξόδεψε 156 έως 194. Αυτό είναι περίπου 7x λιγότερη «σκέψη» για την ίδια απάντηση, και τα reasoning tokens χρεώνονται με τον ρυθμό εξόδου. Το αποτέλεσμα: το 3.8-Max είναι περίπου 4x φθηνότερο ανά κλήση και 4 έως 5 φορές πιο γρήγορο σε wall time από το μηχάνημά μας, συμπεριλαμβανομένου του round-trip δικτύου, ενώ κοστίζει 35.6% περισσότερο ανά token. Η τιμή στην ετικέτα ανέβηκε και ο λογαριασμός κατέβηκε.
Αυτό αντιστρέφεται καθώς μεγαλώνουν τα prompts. Με μοντελοποίηση από τη ζωντανή τιμολόγηση, όχι με μέτρηση, μια κλήση 30,000 tokens με 500 tokens εξόδου κοστίζει $63.00 ανά χίλιες κλήσεις στο 3.8-Max έναντι $46.46 στο 3.7-Max. Στα 100,000 tokens εισόδου είναι $203.00 έναντι $149.71. Μόλις τα περισσότερα από τα tokens σας γίνουν είσοδος, το πλεονέκτημα αποδοτικότητας του reasoning σταματά να αντισταθμίζει την αύξηση τιμής και το 3.8-Max γίνεται το ακριβότερο από τα τρία. Ποιο μοντέλο είναι φθηνότερο εξαρτάται γνήσια από την αναλογία εισόδου προς έξοδο, το ίδιο δίδαγμα στο οποίο καταλήγει συνεχώς η δική μας σύγκριση τιμολόγησης API για LLM.
Το reasoning_effort Είναι Νέο, και το 3.7-Max το Αγνοεί Σιωπηλά
Το reasoning_effort εμφανίζεται στις υποστηριζόμενες παραμέτρους του 3.8-Max και όχι σε αυτές του 3.7-Max. Στο 3.8-Max μετακινεί τη βελόνα μετρίως: σε τρεις εκτελέσεις η καθεμία, το minimal παρήγαγε 67, 108 και 124 reasoning tokens έναντι του high στα 163, 136 και 173. Διάμεσοι 108 έναντι 163, στο ίδιο prompt, σε temperature 0.
Το εύρημα που κοστίζει χρήματα βρίσκεται στο παλαιότερο μοντέλο. Η αποστολή reasoning_effort: "low" στο 3.7-Max γίνεται δεκτή αντί να απορριφθεί, και στη συνέχεια αγνοείται: εκείνη η κλήση κατανάλωσε ούτως ή άλλως 1,401 reasoning tokens, χρεώνοντας τα ίδια $0.006689 με την ισόμορφη κλήση που είχαμε καταγράψει. Κανένα σφάλμα, καμία προειδοποίηση, καμία επίδραση. Αν ρυθμίζετε το κόστος μειώνοντας το reasoning effort, επαληθεύστε ότι κάνει κάτι πραγματικά στο μοντέλο που καλείτε, γιατί μια μη υποστηριζόμενη παράμετρος εδώ αποτυγχάνει σιωπηλά και όχι φανερά.
Η Παγίδα της Κενής Απάντησης που Πρέπει να Ελέγξετε Πριν Μεταναστεύσετε
Η πρώτη μας δοκιμαστική εκτέλεση χρησιμοποίησε max_tokens: 400 και έκανε crash το δικό μας script. Ο λόγος αποδείχθηκε πιο σημαντικός από τη δοκιμή. Το Qwen3.7-Max μπορεί να ξοδέψει ολόκληρο τον προϋπολογισμό tokens του σε reasoning και να επιστρέψει ένα κενό string, με finish_reason: "length", χρεωμένο στο ακέραιο.
Το πετύχαμε τρεις ξεχωριστές φορές. Στο max_tokens: 400: 402 tokens ολοκλήρωσης, 400 από αυτά reasoning, μηδέν χαρακτήρες απάντησης, $0.001822 χρεωμένα. Στο max_tokens: 1500: 1,502 tokens, 1,500 reasoning, μηδέν χαρακτήρες, $0.006689 για το τίποτα. Και άλλη μία φορά σε μια μεταγενέστερη κλήση, $0.006735. Κανένα σφάλμα, καμία εξαίρεση, μόνο ένα αντικείμενο απόκρισης που έμοιαζε άψογο με ένα κενό content string.
Αν μεταναστεύετε μια υπάρχουσα ενσωμάτωση 3.7-Max και ο κώδικάς σας ορίζει μέτριο max_tokens, προβλέψτε χρόνο για να δοκιμάσετε αυτό το σενάριο. Το πολύ μικρότερο reasoning του 3.8-Max το κάνει σημαντικά λιγότερο εκτεθειμένο. Δεν είναι όμως άτρωτο.
Ένα Μικρό Overhead σε Tokens που Κανείς δεν Αναφέρει
Το ίδιο prompt των 12 λέξεων μετρήθηκε στα 67 prompt tokens στο 3.8-Max και 29 στο 3.7-Max, σταθερά σε κάθε εκτέλεση (27 στο qwen3-max). Αυτό είναι περίπου 38 tokens σταθερού overhead, μάλλον από ένα μεγαλύτερο system ή chat template. Σε μια κλήση RAG των 100,000 tokens στρογγυλοποιείται στο τίποτα. Σε έναν ταξινομητή υψηλού όγκου που στέλνει σύντομα prompts, υπερδιπλασιάζει τον λογαριασμό εισόδου σας προτού γράψετε έστω και μία λέξη.
Δέχεται Πράγματι το Qwen3.8-Max Εικόνες και Βίντεο;
Ναι, και η πολυτροπική είσοδος είναι πραγματικά νέα σε αυτή τη γενιά, όχι απλή επανεπωνυμία. Το API αναφέρει text+image+video->text για το 3.8-Max και μόνο κείμενο για το 3.7-Max. Επαληθεύσαμε τη διαφορά στέλνοντας την ίδια εικόνα και στα δύο, και το παλαιότερο μοντέλο την απέρριψε στο επίπεδο routing.
Δημιουργήσαμε την εικόνα δοκιμής τοπικά με έναν δικό μας γραμμένο PNG encoder, ώστε η αληθινή απάντηση να είναι γνωστή εξ αρχής: 750x270 pixels, μαύρα block ψηφία 4739 σε λευκό φόντο, με μια κόκκινη οριζόντια μπάρα στο πάνω μέρος. Στάλθηκε κωδικοποιημένη σε base64, το qwen3.8-max επέστρεψε DIGITS: 4739 και TOPBAR: red. Σωστό και στα δύο, 6.99s, $0.002146. Το ίδιο ακριβώς αίτημα στο qwen3.7-max επέστρεψε HTTP 404 {"error":{"message":"No endpoints found that support image input"}}.
Το βίντεο δουλεύει επίσης, με μια επιφύλαξη που παραλίγο να αναφέρουμε ως αποτυχία. Δύο από τα τρία δημόσια MP4 URLs που δοκιμάσαμε επέστρεψαν HTTP 400 "Failed to download multimodal content". Αυτό σημαίνει ότι η Alibaba απέτυχε να ανακτήσει το αρχείο, όχι ότι το route αρνήθηκε το βίντεο. Με ένα URL που μπόρεσε να ανακτήσει, το 3.8-Max περιέγραψε με ακρίβεια ένα κλιπ Big Buck Bunny, ονομάζοντας μάλιστα σωστά τον χαρακτήρα, σε 24.24s για $0.006528.
Δύο πρακτικές σημειώσεις πριν χτίσετε πάνω σε αυτό. Το βίντεο χρεώθηκε ως 696 συνηθισμένα prompt tokens για ένα κλιπ περίπου 10 δευτερολέπτων, και το usage.prompt_tokens_details.video_tokens ανέφερε 0, άρα δεν μπορείτε να ξεχωρίσετε το κόστος του βίντεο από αυτό το πεδίο. Και ένα κακοδιατυπωμένο content part αποτυγχάνει σιωπηλά: η αποστολή {"type": "video", "video": [url]} αντί για video_url επέστρεψε HTTP 200 με το μοντέλο να λέει ευγενικά ότι δεν μπορούσε να δει κανένα βίντεο, με τη χρέωση να γίνεται κανονικά. Χρησιμοποιήστε video_url.
Αξίζει να το ξέρετε: όταν ζητήσαμε από το 3.8-Max να περιγράψει τις δικές του δυνατότητες, απάντησε Input modalities: text. Αυτό είναι λάθος, όπως απέδειξε η επόμενη δοκιμή στη δική μας εκτέλεση. Η αυτοπεριγραφή ενός μοντέλου είναι έξοδος γλωσσικού μοντέλου, όχι φύλλο προδιαγραφών.
Πόσο Καλά Αντέχει το Context Window του 1M Tokens;
Τοποθετήσαμε τρία μοναδικά γεγονότα σε βάθος 10%, 50% και 90% μέσα σε τεχνητό filler κείμενο και ζητήσαμε και τα τρία σε μία κλήση. 18 στα 18 «βελόνες» επιστράφηκαν σωστά σε έξι εκτελέσεις πάνω σε δύο μοντέλα, σε μεγέθη prompt από 5,723 έως 247,911 tokens, με βαθμολόγηση μέσω ακριβούς αντιστοίχισης substring σε κώδικα, όχι με ανάγνωση των απαντήσεων.
Οι εκτελέσεις μας στο qwen3.8-max (οι δύο εκτελέσεις στο qwen3.7-max στα 83,380 και 247,873 tokens, και μία εκτέλεση στο qwen3-max στα 78,255, επίσης επέστρεψαν κάθε «βελόνα»):
| Tokens prompt (qwen3.8-max) | Καθυστέρηση | Κόστος | Βελόνες που βρέθηκαν |
|---|---|---|---|
| 5,723 | 9.24s | $0.01409 | 3 στα 3 |
| 25,703 | 13.43s | $0.05453 | 3 στα 3 |
| 83,418 | 17.63s | $0.16965 | 3 στα 3 |
| 247,911 | 38.54s | $0.49828 | 3 στα 3 |
Η καθυστέρηση κλιμακώνεται υπο-γραμμικά, κάτι πρακτικά χρήσιμο: 43x περισσότερα tokens εισόδου κοστίζουν μόλις 4.2x περισσότερο wall time.
Τώρα τα ειλικρινή όρια, γιατί αυτό είναι το εύκολο άκρο της αξιολόγησης long-context. Η ανάκτηση ενός αυτολεξεί τοποθετημένου γεγονότος λέει πολύ λίγα για τη συλλογιστική πάνω σε ένα μεγάλο έγγραφο, και δοκιμάσαμε κάθε μέγεθος μία φορά. Δεν τρέξαμε κλήση 1M tokens. Στα $2.00 ανά εκατομμύριο tokens εισόδου, μία τέτοια κλήση θα κόστιζε περίπου $2.00, περισσότερο από ολόκληρη αυτή τη δοκιμαστική εκτέλεση, και ένα μεμονωμένο δείγμα δεν θα μας έλεγε πολλά. Το διαφημιζόμενο όριο του 1M παραμένει επομένως ανεπιβεβαίωτο από εμάς. Και το 3.7-Max ταίριαξε ακριβώς με το 3.8-Max και στα δύο μεγέθη που συγκρίναμε, οπότε η ανάκτηση long-context δεν είναι εκεί που ξεχωρίζει αυτή η γενιά.
Εδώ αναδύθηκε μια παγίδα τιμολόγησης που τα δημοσιεύματα κυκλοφορίας χάνουν εντελώς. Το qwen3-max έχει διαβαθμισμένες υπερισχύουσες τιμές που διπλασιάζουν τον ρυθμό του πάνω από 32,000 tokens prompt και τον ανεβάζουν ξανά πάνω από 128,000, ενώ τα 3.8-Max και 3.7-Max έχουν σταθερή τιμή σε κάθε μήκος. Επιβεβαιώσαμε τη διαβάθμιση από την πραγματική χρέωση: η κλήση μας 78,255 tokens στο qwen3-max χρεώθηκε $0.12227, δηλαδή τον ρυθμό $1.56/M, όχι τον διαφημιζόμενο $0.78/M. Σε αυτό το μήκος κοστίζει σχεδόν ακριβώς όσο το 3.7-Max ($0.12523). Η διαφημιζόμενη τιμή του είναι λιγότερο από το μισό. Η πραγματική του τιμή στα 80k tokens απέχει ένα σφάλμα στρογγυλοποίησης.
Οι Πέντε Βαθμολογίες Benchmark της Alibaba, και Γιατί Καμία Δεν Είναι Επαληθευμένη
Η Alibaba δημοσίευσε πέντε βαθμολογίες benchmark με την κυκλοφορία GA. Κάθε μία από αυτές προέρχεται από εσωτερικές δοκιμές της ίδιας της Alibaba, και δεν βρήκαμε καμία ανεξάρτητη αξιολόγηση δημοσιευμένη έως τις 2026-08-04. Αυτή η πρόταση αξίζει να βρίσκεται δίπλα στους αριθμούς, όχι τρεις παραγράφους πιο κάτω.
| Benchmark | Βαθμολογία (αναφορά Alibaba) | Επαληθευμένο από τρίτο; |
|---|---|---|
| Terminal-Bench 2.1 | 86.6 | Όχι, έως τις 2026-08-04 |
| GPQA Diamond | 92.6 | Όχι, έως τις 2026-08-04 |
| PaperBench | 93.0 | Όχι, έως τις 2026-08-04 |
| OSWorld-Verified | 86.1 | Όχι, έως τις 2026-08-04 |
| DeepSWE 1.1 | 56.6 (προκάτοχος: 21.6) | Όχι, έως τις 2026-08-04 |
Η Alibaba ανέφερε επίσης έναν εσωτερικό συγκεντρωτικό δείκτη 0.725, ανεβασμένο από το 0.474, και τοποθέτησε το μοντέλο κοντά ή πάνω από τα Claude Opus 4.8, Fable 5 και GPT-5.6 Sol. Κυκλοφόρησαν επίσης θέσεις σε arena: 5η θέση στο Text Arena και 2η στο Vision Arena, σύμφωνα με τη δική της ανακοίνωση της Alibaba στις 2026-08-03, την οποία δεν έχουμε επιβεβαιώσει ξανά στον ζωντανό πίνακα κατάταξης. Οι θέσεις στα arena αλλάζουν καθημερινά. Αντιμετωπίστε οποιαδήποτε κατάταξη διαβάζετε αυτή την εβδομάδα ως ένα στιγμιότυπο με ημερομηνία επάνω του.
Αυτό που κανείς δεν έχει μετρήσει ακόμα, ούτε κι εμείς: throughput υπό ταυτόχρονο φόρτο, απόδοση σε μη αγγλικές γλώσσες, αξιολογήσεις ασφάλειας και alignment, και αξιοπιστία στο tool-calling. Τα δικά μας νούμερα καλύπτουν καθυστέρηση, κόστος, modality και ανάκτηση long-context σε ένα route, και τίποτα άλλο. Η αναφορά κυκλοφορίας του Bloomberg επανέλαβε τους ισχυρισμούς των benchmark χωρίς ανεξάρτητο έλεγχο, κάτι στο οποίο βρίσκεται ουσιαστικά όλη η κάλυψη αυτή τη στιγμή.
Για αριθμούς που έχουν ελεγχθεί, η δική μας σύγκριση Qwen vs DeepSeek vs GLM είναι η καλύτερη πηγή αναφοράς, και το Kimi K3, στα περίπου 2.8T, είναι ο αντίπαλος ίδιου μεγέθους με τον οποίο όλοι το συγκρίνουν.
Qwen3.8 vs Qwen3-8B, και η Αντιστροφή Open-Weight Πίσω από Αυτή την Κυκλοφορία
Το Qwen3.8 είναι το ναυαρχίδα μοντέλο της Alibaba με 2.4 τρισεκατομμύρια παραμέτρους. Το Qwen3-8B είναι ένα πυκνό (dense) μοντέλο 8 δισεκατομμυρίων παραμέτρων από τη σειρά Qwen3, διαθέσιμο για λήψη από το 2025. Ονόματα που μοιάζουν, αλλά απέχουν περίπου 300x σε μέγεθος. Οι μηχανές αναζήτησης εξακολουθούν να τα συγχέουν, όπως και ένας εκπληκτικά μεγάλος αριθμός απαντήσεων σε forums.
Το πρόβλημα ονοματοδοσίας χειροτέρεψε αυτή την εβδομάδα, δεν βελτιώθηκε. Τα μόνα πράγματα στο Hugging Face που φέρουν αυτή τη στιγμή το όνομα «Qwen3.8» είναι community distills 4B. Αν ψάχνετε βάρη και κατεβάσετε ένα από αυτά, κατεβάζετε κάτι που δεν έχει καμία σχέση με το μοντέλο 2.4T.
Δύο Κλειστά Ναυαρχίδα Μοντέλα, και Μετά Αυτό
Η υπόσχεση open-weight είναι το πραγματικό νέο εδώ, και διαβάζεται διαφορετικά μόλις δείτε το ιστορικό της οικογένειας μοντέλων. Η Alibaba πέρασε δύο γενιές διατηρώντας έναν σκόπιμο διαχωρισμό: open-weight μοντέλα δουλειάς για όλους, κλειστό ναυαρχίδα μοντέλο στην κορυφή.
| Γενιά | Βάρη | Σημειώσεις |
|---|---|---|
| Qwen 3.5 (0.8B έως 397B-A17B) | Open, Apache 2.0 | Ολόκληρη η οικογένεια κυκλοφόρησε δημόσια |
| Qwen 3.6 (27B dense, 35B-A3B MoE) | Open, Apache 2.0 | Το ίδιο μοτίβο διατηρήθηκε |
| Qwen3.7-Max | Κλειστό | Μόνο API. Χωρίς GGUF, χωρίς checkpoint στο Hugging Face |
| Qwen3.8-Max | Υποσχέθηκε open, δεν έχει κυκλοφορήσει ακόμα | «Την επόμενη εβδομάδα» σύμφωνα με ανακοίνωση της 2026-08-03. Άδεια χρήσης μη ανακοινωμένη |
Η Alibaba κράτησε κλειστό το επίπεδο ναυαρχίδα για δύο συνεχόμενες γενιές και τώρα λέει ότι θα ανοίξει το μεγαλύτερο μοντέλο που έχει φτιάξει ποτέ. Αν τα βάρη έρθουν όπως υποσχέθηκε, πρόκειται για πραγματική αντιστροφή και ασκεί πίεση σε κάθε εργαστήριο που θεωρεί δεδομένο ότι «το frontier επίπεδο μένει κλειστό». Αν καθυστερήσουν, αυτό γίνεται η τρίτη συνεχόμενη κλειστή κυκλοφορία Max. Και τα δύο ενδεχόμενα παραμένουν ανοιχτά στις 2026-08-04. Είδαμε την ίδια δυναμική να εκτυλίσσεται με το GLM 5.2, όπου η άδεια που τελικά κυκλοφόρησε μέτρησε περισσότερο από την ανακοίνωση.
Μπορείτε να Τρέξετε το Qwen3.8-Max Μόνοι Σας; (Ακόμα Όχι)
Όχι, και οι προδιαγραφές GA το κάνουν πιο ξεκάθαρο, όχι λιγότερο. Με 2.4 τρισεκατομμύρια συνολικές παραμέτρους, αυτό δεν είναι ένα μοντέλο που σερβίρετε στο δικό σας hardware, ακόμα και μετά την κυκλοφορία των βαρών. Το DeepSeek-V3.2, στα 685B, περιγράφεται ήδη από όσους το έχουν κάνει ως ένα σοβαρό έργο υποδομής. Αυτό είναι αρκετές φορές μεγαλύτερο.
Άρα τι σας προσφέρει πραγματικά ένα open-weight μοντέλο 2.4T;
- Πάροχοι inference μπορούν να το φιλοξενήσουν, κάτι που σημαίνει ανταγωνισμό τιμών, που σημαίνει ότι το κόστος σας ανά token πέφτει
- Εθνικά, ρυθμιζόμενα και απομονωμένα (air-gapped) deployments γίνονται δυνατά σε αυτό το επίπεδο για πρώτη φορά
- Ερευνητές και όσοι κάνουν fine-tuning αποκτούν ένα base μοντέλο κλίμακας frontier για να δουλέψουν πάνω του
- Δεν σημαίνει ότι τρέχει στο δικό σας μηχάνημα, στο μοναδικό σας A100, ή στον προϋπολογισμό GPU της startup σας
Αν θέλετε την αριθμητική για το τι πραγματικά απαιτεί η εκτέλεση μεγάλων open-weight μοντέλων, ο δικός μας οδηγός απαιτήσεων VRAM για LLM κάνει σωστά αυτούς τους υπολογισμούς. Η σύντομη εκδοχή για αυτό το μοντέλο: μην το κάνετε.
Να Αλλάξετε, να Δοκιμάσετε ή να Περιμένετε;
| Η κατάστασή σας | Τι θα κάναμε εμείς στις 2026-08-04 |
|---|---|
| Τρέχετε το Qwen3.7-Max σε production | Δοκιμάστε πρώτα το 3.8-Max στην κίνηση με σύντομα prompts. Εκεί εμφανίστηκε το χάσμα κόστους 4x που μετρήσαμε. Μετά ελέγξτε τον χειρισμό του max_tokens σας για την περίπτωση κενής απάντησης |
| Φόρτος εργασίας long-context ή βαρύ RAG | Μείνετε προς το παρόν εκεί που είστε. Το 3.8-Max κοστίζει 35.6% περισσότερο ανά token και ταίριαξε ακριβώς με το 3.7-Max στη δοκιμή ανάκτησής μας |
| Χρειάζεστε είσοδο εικόνας ή βίντεο | Αυτός είναι ο λόγος να μεταβείτε. Το 3.7-Max δεν δέχεται καθόλου εικόνα, και επιβεβαιώσαμε το 404 |
| Περιμένετε τα open weights | Σημειώστε στο ημερολόγιό σας τις 2026-08-10. Δεν υπάρχει τίποτα να κάνετε μέχρι να υπάρξει κάρτα μοντέλου και άδεια χρήσης για ανάγνωση |
| Είστε ικανοποιημένοι με Claude ή GPT | Τίποτα δεν αλλάζει σήμερα. Οι βαθμολογίες benchmark της Alibaba είναι ανεπιβεβαίωτες, και ανεπιβεβαίωτοι αριθμοί δεν αποτελούν λόγο μετάβασης |
Η μέθοδος μετράει περισσότερο από την τελική κρίση. Κάθε μοντέλο που έχουμε δοκιμάσει σε production έχει συμπεριφερθεί διαφορετικά από τη θέση του στο leaderboard, γιατί τα δικά σας prompts, ο κώδικάς σας και η ανοχή σας σε retries δεν βρίσκονται σε κανένα benchmark. Δύο εργασίες κώδικα στην εκτέλεσή μας αποδεικνύουν το σημείο: το 3.8-Max και το 3.7-Max σκόραραν και τα δύο 11 στα 11 σε μια εργασία περικοπής πλάτους string και πέρασαν και τα δύο 5,000 στα 5,000 fuzzed περιπτώσεις σε αριθμητική ημερομηνιών. Ως προς την ορθότητα δεν μπορέσαμε να τα ξεχωρίσουμε. Το χάσμα που μετρήσαμε βρίσκεται στην καθυστέρηση και στη δαπάνη tokens σε εύκολα prompts, όχι στην ικανότητα σε δύσκολα.
Ζυγίζετε μια μετάβαση και θέλετε ένα δεύτερο ζευγάρι ματιών στο μοντέλο κόστους; Ζητήστε από την ομάδα μας να το δοκιμάσει στον δικό σας φόρτο εργασίας.
Όλα τα στοιχεία επαληθεύτηκαν στις 2026-08-04. Η τιμολόγηση, οι κατατάξεις arena και το χρονοδιάγραμμα των βαρών αλλάζουν συχνά. Οι μετρήσεις μας προέρχονται από ένα μόνο route (OpenRouter προς Alibaba), ένα μηχάνημα, μία ημέρα, με n=3 για την καθυστέρηση και n=1 για τους περισσότερους λειτουργικούς ελέγχους.
Συχνές Ερωτήσεις
Είναι το Qwen3.8-Max open source;
Όχι, στις 2026-08-04. Είναι διαθέσιμο μόνο μέσω API. Η Alibaba έχει προγραμματίσει τα βάρη για «την επόμενη εβδομάδα» στο Hugging Face και στο ModelScope, και δεν έχει ανακοινώσει καμία άδεια χρήσης. Οι τίτλοι που το αποκαλούν open source προηγούνται των γεγονότων. Μια αναζήτηση στο Hugging Face επιστρέφει μόνο distills τρίτων 4B, όχι κάρτα μοντέλου της Alibaba.
Πόσο κοστίζει το Qwen3.8-Max;
$2.00 ανά εκατομμύριο tokens εισόδου και $6.00 ανά εκατομμύριο εξόδου, με cached input στα $0.25. Αυτό είναι 35.6% περισσότερο από το Qwen3.7-Max και στις δύο πλευρές. Μετρήσαμε διάμεσο $0.001592 ανά σύντομη κλήση, περίπου 4x φθηνότερο από το 3.7-Max στο ίδιο prompt, επειδή εκπέμπει πολύ λιγότερα reasoning tokens.
Πόσες παραμέτρους έχει το Qwen3.8-Max;
2.4 τρισεκατομμύρια συνολικά, σύμφωνα με την ανακοίνωση της Alibaba και κάθε μέσο που το κάλυψε. Ο αριθμός ενεργών παραμέτρων είναι αμφιλεγόμενος: οι SiliconANGLE, The Decoder και Coursiv αναφέρουν ~95 δισεκατομμύρια ενεργές, ενώ το MarkTechPost δηλώνει ότι η Alibaba δεν το γνωστοποίησε. Το API δεν εκθέτει κανένα πεδίο παραμέτρων, οπότε δεν μπορέσαμε να επαληθεύσουμε κανέναν από τους δύο αριθμούς.
Τι context window έχει το Qwen3.8-Max;
Το ζωντανό API αναφέρει context 1,000,000 tokens και μέγιστα 131,072 tokens ολοκλήρωσης. Δοκιμάσαμε ανάκτηση έως 247,911 tokens χωρίς αποτυχίες. Δεν τρέξαμε κλήση 1M tokens, γιατί θα κόστιζε περίπου $2.00 και θα ξεπερνούσε τον προϋπολογισμό δοκιμών μας, οπότε το ανώτατο όριο αυτού του context παραμένει ανεπιβεβαίωτο από εμάς.
Υποστηρίζει το Qwen3.8-Max είσοδο εικόνας και βίντεο;
Ναι και στα δύο, και τα επαληθεύσαμε. Διάβασε σωστά ψηφία και χρώμα από ένα τοπικά δημιουργημένο PNG, και περιέγραψε με ακρίβεια ένα βίντεο όταν του δόθηκε ένα URL που μπορούσε να ανακτήσει η Alibaba. Το Qwen3.7-Max απορρίπτει εξαρχής τις εικόνες με 404. Δύο από τα τρία δοκιμαστικά URL βίντεο απέτυχαν στο βήμα λήψης του παρόχου.
Είναι επαληθευμένες ανεξάρτητα οι βαθμολογίες benchmark του Qwen3.8-Max;
Όχι. Το Terminal-Bench 2.1 στο 86.6, το GPQA Diamond στο 92.6, το PaperBench στο 93.0, το OSWorld-Verified στο 86.1 και το DeepSWE 1.1 στο 56.6 προέρχονται όλα από εσωτερικές δοκιμές της Alibaba. Έως τις 2026-08-04 δεν βρήκαμε καμία δημοσιευμένη αξιολόγηση τρίτου μέρους για κανένα από αυτά.
Μπορώ να τρέξω το Qwen3.8-Max τοπικά;
Ρεαλιστικά όχι, ακόμα και όταν κυκλοφορήσουν τα βάρη. Με 2.4 τρισεκατομμύρια παραμέτρους είναι αρκετές φορές μεγαλύτερο από το DeepSeek-V3.2, το οποίο είναι ήδη ένα γνήσιο έργο υποδομής για self-hosting. Περιμένετε να το χρησιμοποιήσετε μέσω παρόχων inference και όχι από τις δικές σας GPU, εκτός αν διαχειρίζεστε δικό σας datacenter.
Πρέπει να μεταναστεύσω από το Qwen3.7-Max στο Qwen3.8-Max;
Εξαρτάται από τον συνδυασμό tokens σας. Σε σύντομα prompts μετρήσαμε το 3.8-Max στο περίπου ένα τέταρτο του κόστους και τέσσερις έως πέντε φορές πιο γρήγορο. Σε φόρτους εργασίας με μεγάλη είσοδο κοστίζει 35.6% περισσότερο και είχε πανομοιότυπη απόδοση στη δοκιμή ανάκτησής μας. Αν χρειάζεστε είσοδο εικόνας ή βίντεο, το 3.7-Max δεν το κάνει καθόλου.
Πότε κυκλοφορούν τα βάρη του Qwen3.8-Max;
Η Alibaba είπε «την επόμενη εβδομάδα» στην ανακοίνωσή της στις 2026-08-03, ονομάζοντας το Hugging Face και το ModelScope ως προορισμούς. Χωρίς ακριβή ημερομηνία, και χωρίς κείμενο άδειας χρήσης. Ένα συνοδευτικό open-weight μοντέλο, το Qwen3.8-27B, αναφέρεται ότι θα κυκλοφορήσει μαζί τους. Σχεδιάζουμε να το ελέγξουμε ξανά στις 2026-08-10.