
Qwen3.8-Max Sudah Hadir: Parameter 2.4T, Konteks 1M, dan Bobotnya Masih Belum Dirilis
$1.4728. Itulah biaya 40 panggilan API langsung ke Qwen3.8-Max dan dua model pendahulunya pada 2026-08-04, sehari setelah Alibaba merilisnya. Kejutannya bukan pada 2.4 triliun parameternya. Kejutannya di sini: 3.8-Max membebankan biaya 35.6% lebih tinggi per token dibanding Qwen3.7-Max, namun tetap sekitar 4x lebih murah per jawaban, karena model ini berhenti "berpikir berlebihan". Satu hal lagi yang banyak diberitakan secara keliru: model ini bukan open source. Belum, hari ini.
Artikel ini pertama kali dipublikasikan pada 2026-07-19, saat Qwen3.8 masih berstatus preview tanpa spesifikasi resmi. Artikel ini ditulis ulang pada 2026-08-04 berdasarkan rilis GA dan pengujian API kami sendiri.
Poin-Poin Penting
- Per 2026-08-04, Qwen3.8-Max hanya tersedia lewat API. Alibaba menjanjikan bobotnya "minggu depan", yakni minggu 2026-08-10, di Hugging Face dan ModelScope.
- Kami mengukur $0.001592 per panggilan singkat dibanding $0.006428 pada Qwen3.7-Max, meski harga per token lebih tinggi.
- Lima skor benchmark Alibaba dilaporkan oleh vendor sendiri. Kami tidak menemukan evaluasi independen yang dipublikasikan per 2026-08-04.
- Input gambar dan video benar-benar baru. Kami memverifikasi keduanya lewat API, dan membandingkannya dengan penolakan 3.7-Max.
Apa yang Berubah Antara Preview dan GA
Qwen3.8-Max resmi tersedia untuk umum (GA) pada 2026-08-03, dan rilis ini menjawab semua pertanyaan yang belum terjawab di halaman ini dua minggu lalu. Era preview hanya memberi kita jumlah parameter dan sebuah janji. Rilis GA menambahkan jendela konteks 1M token yang terkonfirmasi, input teks plus gambar plus video, lima skor benchmark resmi, dan harga per token.
Berikut daftar lama hal-hal yang belum jelas, kini terjawab:
| Apa yang tertulis di halaman ini pada 2026-07-19 | Status pada 2026-08-04 |
|---|---|
| Skor benchmark yang dipublikasikan: tidak ada | Lima skor Alibaba-reported dipublikasikan |
| Parameter aktif / konfigurasi MoE: tidak diungkap | Dilaporkan luas sekitar ~95B aktif, MoE sparse. Laporan saling bertentangan, lihat di bawah |
| Jendela konteks dan output maksimum: belum diumumkan | Input 1M, output 131,072, terkonfirmasi lewat API langsung |
| Modalitas: belum diumumkan | Input teks + gambar + video, output teks. Kami verifikasi sendiri |
| Harga per token: belum dirinci | $2.00 / M input, $6.00 / M output |
| Tanggal rilis bobot terbuka: "segera", tanpa tanggal | "Minggu depan", Hugging Face dan ModelScope disebutkan |
| Qwen3.8-Max-Preview aktif sekarang | Preview sudah berakhir. GA sudah dirilis |
Satu hal belum terjawab. Pembagian parameter masih diperdebatkan. Artikel peluncuran MarkTechPost secara jelas menyatakan bahwa jumlah parameter aktif tidak diungkap oleh Alibaba, sementara SiliconANGLE, The Decoder, dan Coursiv semuanya mencantumkan angka ~95 miliar aktif. Kami membaca ulang artikel MarkTechPost pada 2026-08-04 dan tetap tertulis "tidak diungkap". Salah satu sumber ini pasti keliru, dan yang jujur untuk disampaikan adalah bahwa pelaporan tentang angka spesifik ini saling bertentangan pada hari peluncuran.
Kami tidak bisa memverifikasinya ke arah mana pun. Respons /models dari OpenRouter sama sekali tidak menampilkan field jumlah parameter, sehingga tidak ada satu pun dari pengujian kami yang mengonfirmasi atau membantah angka 2.4T total maupun 95B aktif.
Apakah Qwen3.8-Max Open Source? Belum per 4 Agustus
Tidak. Per 2026-08-04, Qwen3.8-Max hanya tersedia lewat API. Alibaba menjadwalkan rilis bobotnya "minggu depan" di Hugging Face dan ModelScope, dan belum mengumumkan lisensi apa pun. Banyak liputan terus mencampuradukkan "tersedia" dengan "terbuka", dan perbedaan itulah inti dari seluruh cerita ini. Belum ada bobot yang bisa diunduh hari ini, apa pun yang dikatakan judul berita.
Tiga kondisi berbeda sedang dicampuradukkan menjadi satu kata. Padahal ketiganya tidak sama:
| Kondisi | Qwen3.8-Max pada 2026-08-04 |
|---|---|
| Tersedia lewat API | Ya. Alibaba Cloud Model Studio, ditambah reseller dan router |
| Bobot bisa diunduh | Tidak. Dijanjikan "minggu depan", tanpa tanggal pasti |
| Ketentuan lisensi | Belum diumumkan. Tidak ada teks yang bisa dibaca |
Kami memeriksa bukti paling kuat yang tersedia alih-alih hanya mempercayai klaim orang lain: pencarian Hugging Face untuk Qwen3.8 pada 2026-08-04 tidak menampilkan model card resmi dari Alibaba. Yang muncul justru empat unggahan komunitas bernama Qwen3.8_4B_Distilled dan variannya, yang merupakan distilasi pihak ketiga, bukan model flagship-nya. Jika Anda memindai halaman itu dengan cepat, mudah sekali salah mengira keduanya sebagai rilis asli.
Satu catatan soal lisensi, karena preseden terus dilaporkan seolah-olah sudah menjadi komitmen. Qwen 3.5 dan Qwen 3.6 sama-sama dirilis di bawah Apache 2.0. Lisensi komunitas yang lebih restriktif pada model 2.4T tetap saja secara teknis bisa disebut "bobot terbuka", tetapi mengubah apa yang boleh Anda bangun dengannya. Sampai teks lisensinya keluar, siapa pun yang memberi tahu Anda apa yang boleh dilakukan dengan bobot ini hanya menebak. Itu juga sebabnya Qwen3.8-Max belum masuk ke daftar LLM open-source terbaik yang layak dijalankan pada 2026 versi kami: model ini belum memenuhi syarat.
Yang Kami Ukur: 4x Lebih Murah per Panggilan Meski Harga Naik 35.6%
Kami menjalankan 40 panggilan berbayar terhadap qwen3.8-max, qwen3.7-max, dan qwen3-max lewat OpenRouter pada 2026-08-04, total pengeluaran $1.4728. Setiap biaya di bawah ini dihitung dari objek usage yang dikembalikan API dan dicocokkan silang dengan angka tagihan resmi OpenRouter. Semuanya cocok. Temuan utamanya justru berlawanan arah dengan perubahan harga.
Mulai dari harga. Harga langsung dari GET /models pada 2026-08-04 menempatkan 3.8-Max di $2.00 in / $6.00 out per juta token, dibanding 3.7-Max di $1.475 / $4.425. Itu kenaikan 35.6% di kedua sisi, dan rasionya sama persis di keduanya (2.000/1.475 = 6.000/4.425 = 1.3559). Anda bisa mengecek sendiri angka terkininya di halaman model OpenRouter.
Sekarang, prompt sepele yang sama dikirim ke ketiga model, tiga kali percobaan masing-masing, temperature: 0, streaming:
| Model | Token pertama (3 percobaan) | Konten terlihat pertama | Waktu total (3 percobaan) | Token completion | dari jumlah itu, reasoning | Median biaya/panggilan |
|---|---|---|---|---|---|---|
| qwen3.8-max | 2.249s / 0.874s / 1.054s | 5.414s / 5.058s / 4.209s | 6.338s / 6.734s / 5.130s | 242 / 287 / 243 | 156 / 194 / 157 | $0.001592 |
| qwen3.7-max | 4.871s / 1.157s / 1.670s | tidak pernah / 22.358s / 25.998s | 31.147s / 24.013s / 27.661s | 1502 / 1281 / 1443 | 1500 / 1174 / 1346 | $0.006428 |
| qwen3-max | 2.617s / 2.892s / 2.386s | 2.617s / 2.892s / 2.386s | 4.401s / 4.601s / 4.081s | 105 / 105 / 107 | 0 / 0 / 0 | $0.000431 |
Dua kolom token pertama yang terpisah diperlukan karena kedua model reasoning ini men-stream reasoning tersembunyi sebelum teks jawaban muncul. Pada 3.8-Max, satu token muncul dalam waktu kurang dari satu detik pada dua dari tiga percobaan, tetapi kata pertama yang benar-benar bisa dibaca pengguna baru muncul empat hingga lima detik kemudian. Pada percobaan pertama 3.7-Max, kata itu tidak pernah muncul sama sekali. Jika Anda membangun UI streaming di atas model reasoning, spinner-nya akan terus berputar lama setelah koneksi terbukti hidup.
Baca kolom reasoning dua kali. Pada prompt yang meminta penjelasan tiga kalimat tentang Bloom filter, 3.7-Max menghabiskan antara 1,174 hingga 1,500 token reasoning. 3.8-Max menghabiskan 156 hingga 194. Itu kira-kira 7x lebih sedikit "berpikir" untuk jawaban yang sama, dan token reasoning ditagih dengan tarif output. Hasilnya: 3.8-Max sekitar 4x lebih murah per panggilan dan 4 hingga 5 kali lebih cepat dari sisi waktu total, dari mesin kami, termasuk round-trip jaringan, sambil tetap membebankan biaya 35.6% lebih tinggi per token. Harga per token naik, tapi tagihannya turun.
Kondisi ini berbalik seiring bertambahnya panjang prompt. Berdasarkan pemodelan dari harga langsung, bukan pengukuran, panggilan 30,000-token dengan 500 token output menghabiskan $63.00 per seribu panggilan pada 3.8-Max dibanding $46.46 pada 3.7-Max. Pada 100,000 token input, angkanya $203.00 berbanding $149.71. Begitu sebagian besar token Anda adalah input, keunggulan efisiensi reasoning berhenti menutupi kenaikan harga, dan 3.8-Max justru menjadi yang termahal dari ketiganya. Model mana yang paling murah benar-benar bergantung pada rasio input-ke-output Anda, pelajaran yang sama yang terus muncul di perbandingan harga API LLM kami.
reasoning_effort Baru, dan 3.7-Max Diam-Diam Mengabaikannya
reasoning_effort muncul di daftar parameter yang didukung 3.8-Max, tetapi tidak pada 3.7-Max. Pada 3.8-Max, parameter ini memberi pengaruh sedang: dari tiga percobaan masing-masing, minimal menghasilkan 67, 108, dan 124 token reasoning, dibanding high di 163, 136, dan 173. Median 108 berbanding 163, pada prompt yang sama, temperature 0.
Temuan yang justru merugikan ada di model lama. Mengirim reasoning_effort: "low" ke 3.7-Max diterima, bukan ditolak, lalu diabaikan begitu saja: panggilan itu tetap membakar 1,401 token reasoning, dengan tagihan sama seperti $0.006689 pada panggilan berbentuk identik yang kami catat sebelumnya. Tidak ada error, tidak ada peringatan, tidak ada efek. Jika Anda mengatur biaya dengan menurunkan reasoning effort, pastikan itu benar-benar berpengaruh pada model yang sedang Anda panggil, karena parameter yang tidak didukung di sini gagal secara diam-diam, bukan dengan peringatan.
Jebakan Respons Kosong yang Harus Diperiksa Sebelum Migrasi
Percobaan pertama kami menggunakan max_tokens: 400 dan membuat skrip kami sendiri crash. Ternyata alasannya lebih penting dari sekadar bug pengujian. Qwen3.7-Max bisa menghabiskan seluruh anggaran token-nya untuk reasoning dan mengembalikan string kosong, dengan finish_reason: "length", dan tetap ditagih penuh.
Kami mengalaminya tiga kali terpisah. Pada max_tokens: 400: 402 token completion, 400 di antaranya reasoning, nol karakter jawaban, tagihan $0.001822. Pada max_tokens: 1500: 1,502 token, 1,500 reasoning, nol karakter, $0.006689 untuk sesuatu yang kosong. Dan sekali lagi pada panggilan berikutnya, $0.006735. Tidak ada error, tidak ada exception, hanya objek respons yang terlihat mulus dengan string konten kosong.
Jika Anda sedang bermigrasi dari integrasi 3.7-Max yang ada dan kode Anda mengatur max_tokens yang cukup kecil, sisihkan waktu untuk menguji jalur ini. Reasoning 3.8-Max yang jauh lebih singkat membuatnya jauh lebih kecil kemungkinannya terkena masalah ini. Tapi bukan berarti kebal sepenuhnya.
Overhead Token Kecil yang Jarang Dibahas
Prompt 12 kata yang identik dihitung sebagai 67 token prompt pada 3.8-Max dan 29 pada 3.7-Max, konsisten di setiap percobaan (27 pada qwen3-max). Itu setara dengan sekitar 38 token overhead tetap, kemungkinan besar dari template sistem atau chat yang lebih besar. Pada panggilan RAG 100,000-token, angka ini nyaris tidak berpengaruh. Pada classifier bervolume tinggi yang menembakkan prompt-prompt pendek, overhead ini bisa lebih dari dua kali lipat tagihan input Anda sebelum Anda menulis satu kata pun.
Apakah Qwen3.8-Max Benar-Benar Menerima Gambar dan Video?
Ya, dan input multimodal ini benar-benar baru di generasi ini, bukan sekadar relabeling. API melaporkan text+image+video->text untuk 3.8-Max dan hanya teks untuk 3.7-Max. Kami memverifikasi perbedaan ini dengan mengirim gambar yang sama ke keduanya, dan model lama menolaknya di lapisan routing.
Kami membuat gambar uji secara lokal dengan encoder PNG buatan sendiri sehingga ground truth-nya diketahui pasti sejak awal: 750x270 piksel, digit blok hitam 4739 di atas latar putih, dengan bar horizontal merah melintasi bagian atas. Dikirim dalam bentuk base64, qwen3.8-max mengembalikan DIGITS: 4739 dan TOPBAR: red. Benar pada kedua hal itu, 6.99s, $0.002146. Permintaan identik ke qwen3.7-max kembali sebagai HTTP 404 {"error":{"message":"No endpoints found that support image input"}}.
Video juga berfungsi, dengan satu catatan yang nyaris kami laporkan sebagai kegagalan. Dua dari tiga URL MP4 publik yang kami coba mengembalikan HTTP 400 "Failed to download multimodal content". Itu adalah kegagalan Alibaba mengambil file, bukan penolakan jalur video. Dengan URL yang bisa diambil, 3.8-Max mendeskripsikan klip Big Buck Bunny secara akurat, termasuk menyebut nama karakternya, dalam 24.24s dengan biaya $0.006528.
Dua catatan praktis sebelum Anda membangun sesuatu di atas fitur ini. Video ditagih sebagai 696 token prompt biasa untuk klip berdurasi sekitar 10 detik, dan usage.prompt_tokens_details.video_tokens melaporkan 0, sehingga Anda tidak bisa memisahkan biaya video dari field itu. Dan sebuah content part yang salah format gagal secara diam-diam: mengirim {"type": "video", "video": [url]} alih-alih video_url menghasilkan HTTP 200 dengan model sopan menjawab bahwa ia tidak bisa melihat video apa pun, plus tagihan tetap keluar. Gunakan video_url.
Perlu diketahui: saat kami meminta 3.8-Max mendeskripsikan kemampuannya sendiri, ia menjawab Input modalities: text. Itu jawaban yang salah, seperti dibuktikan oleh pengujian berikutnya dalam sesi kami sendiri. Deskripsi diri sebuah model adalah output bahasa, bukan lembar spesifikasi.
Seberapa Baik Jendela Konteks 1M Token Ini Bertahan?
Kami menanamkan tiga fakta unik pada kedalaman 10%, 50%, dan 90% dalam teks pengisi yang dihasilkan, lalu meminta ketiganya dalam satu panggilan. 18 dari 18 "jarum" berhasil ditemukan dengan benar dalam enam percobaan pada dua model, pada ukuran prompt dari 5,723 hingga 247,911 token, dinilai lewat exact substring match di kode, bukan dengan membaca jawabannya secara manual.
Percobaan qwen3.8-max kami (dua percobaan qwen3.7-max pada 83,380 dan 247,873 token, dan satu percobaan qwen3-max pada 78,255, juga menemukan semua "jarum"-nya):
| Token prompt (qwen3.8-max) | Latensi | Biaya | Jarum ditemukan |
|---|---|---|---|
| 5,723 | 9.24s | $0.01409 | 3 dari 3 |
| 25,703 | 13.43s | $0.05453 | 3 dari 3 |
| 83,418 | 17.63s | $0.16965 | 3 dari 3 |
| 247,911 | 38.54s | $0.49828 | 3 dari 3 |
Latensi bertambah sub-linear, dan itulah bagian yang praktis bermanfaat: 43x lebih banyak token input hanya menghasilkan 4.2x lebih banyak waktu total.
Sekarang batasan yang jujur, karena ini adalah sisi termudah dari evaluasi konteks panjang. Mengambil kembali fakta yang ditanam secara verbatim sangat sedikit bercerita tentang penalaran lintas dokumen besar, dan kami hanya menguji tiap ukuran satu kali. Kami tidak menjalankan panggilan 1M-token. Dengan harga $2.00 per juta token input, satu panggilan itu akan menghabiskan sekitar $2.00, lebih mahal dari seluruh pengujian ini, dan satu sampel saja tidak akan banyak bercerita. Batas atas 1M yang diklaim karenanya belum terverifikasi oleh kami. Dan 3.7-Max cocok persis dengan 3.8-Max pada kedua ukuran yang kami bandingkan, jadi retrieval konteks panjang bukan area yang membedakan generasi ini.
Satu jebakan harga muncul di sini yang luput sama sekali dari liputan peluncuran. qwen3-max memiliki tiered pricing override yang menggandakan tarifnya di atas 32,000 token prompt dan menaikkannya lagi di atas 128,000, sementara 3.8-Max dan 3.7-Max flat-rate di panjang berapa pun. Kami mengonfirmasi tier ini dari tagihan sebenarnya: panggilan 78,255-token kami ke qwen3-max ditagih $0.12227, tarif $1.56/M, bukan harga headline $0.78/M. Pada panjang itu, biayanya nyaris sama persis dengan 3.7-Max ($0.12523). Harga headline-nya kurang dari separuh. Harga sebenarnya pada 80 ribu token nyaris tidak ada bedanya.
Lima Skor Benchmark Alibaba, dan Mengapa Tak Satu Pun Terverifikasi
Alibaba mempublikasikan lima skor benchmark bersamaan dengan rilis GA. Setiap satunya berasal dari pengujian internal Alibaba sendiri, dan kami tidak menemukan evaluasi independen yang dipublikasikan per 2026-08-04. Kalimat itu layak diletakkan tepat di samping angka-angkanya, bukan tiga paragraf di bawahnya.
| Benchmark | Skor yang dilaporkan Alibaba | Diverifikasi pihak ketiga? |
|---|---|---|
| Terminal-Bench 2.1 | 86.6 | Tidak, per 2026-08-04 |
| GPQA Diamond | 92.6 | Tidak, per 2026-08-04 |
| PaperBench | 93.0 | Tidak, per 2026-08-04 |
| OSWorld-Verified | 86.1 | Tidak, per 2026-08-04 |
| DeepSWE 1.1 | 56.6 (pendahulu: 21.6) | Tidak, per 2026-08-04 |
Alibaba juga melaporkan agregat internal 0.725, naik dari 0.474, dan memposisikan model ini setara atau di atas Claude Opus 4.8, Fable 5, dan GPT-5.6 Sol. Peringkat arena pun beredar: peringkat 5 di Text Arena dan peringkat 2 di Vision Arena menurut pengumuman Alibaba sendiri pada 2026-08-03, yang belum kami konfirmasi ulang di leaderboard langsung. Peringkat arena berubah setiap hari. Anggap peringkat mana pun yang Anda baca minggu ini sebagai snapshot bertanggal.
Yang belum diukur oleh siapa pun, termasuk kami: throughput di bawah beban konkuren, performa non-Inggris, evaluasi safety dan alignment, serta keandalan tool-calling. Angka kami sendiri hanya mencakup latensi, biaya, modalitas, dan retrieval konteks panjang pada satu jalur saja, tidak lebih. Laporan peluncuran Bloomberg mengulangi klaim benchmark tanpa pengujian independen, dan itulah kondisi hampir seluruh liputan saat ini.
Untuk angka yang sudah diperiksa, perbandingan Qwen vs DeepSeek vs GLM kami adalah referensi yang lebih baik, dan Kimi K3 di sekitar 2.8T adalah rival seukuran yang paling sering dijadikan pembanding untuk model ini.
Qwen3.8 vs Qwen3-8B, dan Pembalikan Kebijakan Bobot Terbuka di Balik Rilis Ini
Qwen3.8 adalah flagship 2.4 triliun parameter milik Alibaba. Qwen3-8B adalah model dense 8 miliar parameter dari seri Qwen3, sudah bisa diunduh sejak 2025. Nama yang mirip, namun ukurannya berbeda sekitar 300x. Mesin pencari masih sering mencampuradukkan keduanya, begitu pula sejumlah jawaban di forum.
Masalah penamaan ini justru makin parah minggu ini, bukan membaik. Satu-satunya hal di Hugging Face yang membawa nama "Qwen3.8" saat ini hanyalah distilasi komunitas 4B. Jika Anda mencari bobotnya dan mengambil salah satunya, Anda sedang mengunduh sesuatu yang tidak ada hubungannya dengan model 2.4T tersebut.
Dua Flagship Tertutup, Lalu Ini
Janji bobot terbuka inilah berita sebenarnya di sini, dan artinya berbeda begitu Anda melihat riwayat keluarganya. Alibaba menjalani dua generasi dengan pemisahan yang disengaja: workhorse bobot terbuka untuk semua orang, flagship tertutup di puncak.
| Generasi | Bobot | Catatan |
|---|---|---|
| Qwen 3.5 (0.8B hingga 397B-A17B) | Terbuka, Apache 2.0 | Seluruh keluarga dirilis ke publik |
| Qwen 3.6 (27B dense, 35B-A3B MoE) | Terbuka, Apache 2.0 | Pola yang sama tetap berlaku |
| Qwen3.7-Max | Tertutup | Hanya lewat API. Tidak ada GGUF, tidak ada checkpoint Hugging Face |
| Qwen3.8-Max | Dijanjikan terbuka, belum dirilis | "Minggu depan" per 2026-08-03. Lisensi belum diumumkan |
Alibaba menutup tier flagship-nya selama dua generasi berturut-turut, dan kini mengatakan akan membuka model terbesar yang pernah mereka bangun. Jika bobotnya benar-benar rilis sesuai janji, ini adalah pembalikan nyata dan menekan setiap lab lain yang menganggap "tier frontier tetap tertutup" sudah jadi hal yang mapan. Jika terlambat, ini akan menjadi rilis Max tertutup ketiga berturut-turut. Kedua kemungkinan itu masih terbuka pada 2026-08-04. Kami melihat dinamika serupa terjadi pada GLM 5.2, di mana lisensi yang benar-benar dirilis ternyata lebih penting daripada pengumumannya.
Bisakah Anda Menjalankan Qwen3.8-Max Sendiri? (Masih Tidak)
Tidak, dan spesifikasi GA justru membuat jawabannya makin jelas, bukan makin kabur. Pada 2.4 triliun total parameter, ini bukan model yang bisa Anda jalankan di hardware sendiri, bahkan setelah bobotnya keluar. DeepSeek-V3.2 di 685B saja sudah digambarkan oleh orang-orang yang pernah menjalankannya sebagai proyek infrastruktur yang serius. Model ini beberapa kali lipat lebih besar dari itu.
Jadi, apa gunanya model 2.4T yang bobotnya terbuka?
- Penyedia inferensi bisa meng-hosting-nya, artinya kompetisi harga, artinya biaya per token Anda turun
- Deployment sovereign, teregulasi, dan air-gapped menjadi mungkin di tier ini untuk pertama kalinya
- Peneliti dan fine-tuner mendapat base model berskala frontier untuk dikembangkan
- Bukan berarti model ini bisa jalan di mesin Anda, satu A100 Anda, atau anggaran GPU startup Anda
Jika Anda ingin hitungan pastinya soal apa yang sebenarnya dibutuhkan untuk menjalankan model open-weight besar, panduan kebutuhan VRAM LLM kami membahas hitungannya secara tepat. Versi singkatnya untuk model ini: jangan.
Haruskah Anda Beralih, Menguji, atau Menunggu?
| Situasi Anda | Yang akan kami lakukan pada 2026-08-04 |
|---|---|
| Menjalankan Qwen3.7-Max di produksi | Uji dulu 3.8-Max pada traffic prompt pendek. Di situlah selisih biaya 4x kami muncul. Lalu periksa penanganan max_tokens Anda untuk kasus respons kosong |
| Beban kerja konteks panjang atau RAG berat | Bertahan dulu untuk saat ini. 3.8-Max 35.6% lebih mahal per token dan hasilnya identik dengan 3.7-Max di pengujian retrieval kami |
| Anda butuh input gambar atau video | Ini alasan untuk pindah. 3.7-Max sama sekali tidak bisa menerima gambar, dan kami mengonfirmasi error 404-nya |
| Menunggu bobot terbuka | Catat tanggal 2026-08-10. Belum ada yang perlu dilakukan sampai ada model card dan lisensi untuk dibaca |
| Nyaman dengan Claude atau GPT | Tidak ada yang berubah hari ini. Skor benchmark Alibaba belum terverifikasi, dan angka yang belum terverifikasi bukan alasan untuk migrasi |
Metodenya lebih penting daripada vonisnya. Setiap model yang pernah kami uji di produksi berperilaku berbeda dari posisi leaderboard-nya, karena prompt Anda, codebase Anda, dan toleransi Anda terhadap retry tidak ada dalam benchmark siapa pun. Dua tugas coding dalam pengujian kami membuktikan hal ini: 3.8-Max dan 3.7-Max sama-sama meraih skor 11 dari 11 pada tugas string-width truncation dan sama-sama lolos 5,000 dari 5,000 kasus fuzzed pada aritmetika tanggal. Dari sisi ketepatan, kami tidak bisa membedakan keduanya. Selisih yang kami ukur ada pada latensi dan pengeluaran token untuk prompt mudah, bukan pada kemampuan di tugas sulit.
Sedang mempertimbangkan migrasi dan ingin pasangan mata kedua untuk menguji model biayanya? Minta tim kami menguji tekanan pada beban kerja Anda.
Semua angka diverifikasi pada 2026-08-04. Harga, peringkat arena, dan linimasa bobot bisa berubah sewaktu-waktu. Pengukuran kami berasal dari satu jalur (OpenRouter ke Alibaba), satu mesin, satu hari, dengan n=3 untuk latensi dan n=1 untuk sebagian besar pengujian fungsional.
Pertanyaan yang Sering Diajukan
Apakah Qwen3.8-Max open source?
Belum, per 2026-08-04. Model ini hanya tersedia lewat API. Alibaba menjadwalkan rilis bobotnya "minggu depan" di Hugging Face dan ModelScope, dan belum mengumumkan lisensi apa pun. Judul berita yang menyebutnya open source mendahului fakta yang ada. Pencarian di Hugging Face hanya menampilkan distilasi 4B pihak ketiga, bukan model card resmi Alibaba.
Berapa biaya Qwen3.8-Max?
$2.00 per juta token input dan $6.00 per juta output, dengan input yang di-cache dilaporkan $0.25. Itu 35.6% lebih mahal dari Qwen3.7-Max di kedua sisi. Kami mengukur median $0.001592 per panggilan singkat, sekitar 4x lebih murah dari 3.7-Max pada prompt yang sama, karena model ini menghasilkan jauh lebih sedikit token reasoning.
Berapa banyak parameter yang dimiliki Qwen3.8-Max?
2.4 triliun total, menurut pengumuman Alibaba dan setiap media yang meliputnya. Jumlah parameter aktifnya masih diperdebatkan: SiliconANGLE, The Decoder, dan Coursiv melaporkan sekitar ~95 miliar aktif, sementara MarkTechPost menyatakan Alibaba tidak mengungkapkannya. API tidak menampilkan field parameter apa pun, sehingga kami tidak bisa memverifikasi salah satu angka.
Jendela konteks apa yang dimiliki Qwen3.8-Max?
API langsung melaporkan konteks 1,000,000 token dan maksimum 131,072 token completion. Kami menguji retrieval hingga 247,911 token tanpa kegagalan. Kami tidak menjalankan panggilan 1M-token, karena satu panggilan itu akan menghabiskan sekitar $2.00 dan melampaui anggaran pengujian kami, sehingga batas atas jendela itu belum terverifikasi oleh kami.
Apakah Qwen3.8-Max mendukung input gambar dan video?
Ya untuk keduanya, dan kami memverifikasinya. Model ini membaca digit dan warna dengan benar dari PNG yang dibuat secara lokal, dan mendeskripsikan video secara akurat saat diberi URL yang bisa diambil Alibaba. Qwen3.7-Max menolak gambar sepenuhnya dengan error 404. Dua dari tiga URL video uji kami gagal pada tahap pengambilan di sisi provider.
Apakah skor benchmark Qwen3.8-Max sudah diverifikasi secara independen?
Tidak. Terminal-Bench 2.1 di 86.6, GPQA Diamond di 92.6, PaperBench di 93.0, OSWorld-Verified di 86.1, dan DeepSWE 1.1 di 56.6 semuanya berasal dari pengujian internal Alibaba. Per 2026-08-04, kami tidak menemukan evaluasi pihak ketiga yang dipublikasikan untuk satu pun di antaranya.
Bisakah saya menjalankan Qwen3.8-Max secara lokal?
Secara realistis, tidak, bahkan setelah bobotnya dirilis. Pada 2.4 triliun parameter, model ini beberapa kali lebih besar dari DeepSeek-V3.2, yang saja sudah menjadi proyek infrastruktur serius untuk di-host sendiri. Perkirakan Anda akan mengonsumsinya lewat penyedia inferensi, bukan GPU Anda sendiri, kecuali Anda mengoperasikan datacenter.
Haruskah saya bermigrasi dari Qwen3.7-Max ke Qwen3.8-Max?
Tergantung campuran token Anda. Pada prompt pendek, kami mengukur 3.8-Max sekitar seperempat biayanya dan empat hingga lima kali lebih cepat. Pada beban kerja input panjang, biayanya 35.6% lebih mahal dan hasilnya identik di pengujian retrieval kami. Jika Anda butuh input gambar atau video, 3.7-Max sama sekali tidak bisa melakukannya.
Kapan bobot Qwen3.8-Max akan dirilis?
Alibaba menyebutkan "minggu depan" dalam pengumumannya pada 2026-08-03, menyebut Hugging Face dan ModelScope sebagai tujuan rilisnya. Belum ada tanggal pasti, dan belum ada teks lisensi. Model pendamping berbobot terbuka, Qwen3.8-27B, dilaporkan akan dirilis bersamaan. Kami berencana mengecek ulang pada 2026-08-10.