
Qwen3.8-Max 正式登場:2.4T 參數、1M 上下文,權重仍未釋出
$1.4728。這是我們在 2026-08-04(阿里巴巴發布隔天)對 Qwen3.8-Max 及其兩款前代機型進行 40 次實際 API 呼叫的總花費。真正令人意外的不是 2.4 兆參數,而是這件事:3.8-Max 每個 token 的價格比 Qwen3.7-Max 貴 35.6%,但每次回答的成本卻大約便宜 4x,原因是它不再「想太多」。多數發布報導還搞錯了一件事:它並非開源。至少現在還不是。
本文首次發布於 2026-07-19,當時 Qwen3.8 仍處於預覽階段,尚無公開規格。文章已於 2026-08-04 根據正式發布(GA)版本及我們自己的 API 測試重新改寫。
重點摘要
- 截至 2026-08-04,Qwen3.8-Max 僅提供 API 存取。阿里巴巴承諾權重將於「下週」釋出,也就是 2026-08-10 那一週,發布在 Hugging Face 與 ModelScope 上。
- 儘管每個 token 的單價更高,我們實測短呼叫的成本為 $0.001592,而 Qwen3.7-Max 則是 $0.006428。
- 阿里巴巴公布的五項基準測試分數皆為廠商自行提供的數據。截至 2026-08-04,我們並未找到任何已發表的獨立評測。
- 圖片與影片輸入是真實且全新的功能。我們透過 API 實測驗證了這兩點,並對照 3.7-Max 的拒絕反應。
從預覽版到 GA 正式版,改變了什麼
Qwen3.8-Max 於 2026-08-03 正式發布(GA),這次發布解答了本文兩週前列出的所有未知問題。預覽階段只給了我們一個參數量與一句承諾。正式發布則新增了確認的 1M token 上下文視窗、文字加圖片加影片輸入、五項公開的基準測試分數,以及每 token 的定價。
以下是過去未解問題的最新解答:
| 本頁在 2026-07-19 的說法 | 2026-08-04 的現況 |
|---|---|
| 公開基準測試分數:無 | 已公布五項阿里巴巴自報分數 |
| 啟用參數量/MoE 配置:未揭露 | 多方報導約 95B 啟用參數,稀疏 MoE。報導存在分歧,詳見下文 |
| 上下文視窗與最大輸出:未公布 | 輸入 1M,輸出 131,072,經即時 API 確認 |
| 模態:未公布 | 輸入為文字+圖片+影片,輸出為文字。我們自行驗證屬實 |
| 每 token 定價:未拆分公布 | 輸入 $2.00 / M,輸出 $6.00 / M |
| 開放權重釋出日期:「即將」,無明確日期 | 「下週」,指名 Hugging Face 與 ModelScope |
| Qwen3.8-Max-Preview 目前上線中 | 預覽已結束。GA 版已發布 |
有一項問題仍未解決:啟用參數量的分歧至今仍存在爭議。MarkTechPost 的發布報導明確指出阿里巴巴並未揭露啟用參數量,而 SiliconANGLE、The Decoder 與 Coursiv 則都寫著約 95 billion 啟用參數。我們在 2026-08-04 重新閱讀了 MarkTechPost 的文章,內容仍然寫著「未揭露」。某一方的消息來源出了錯,誠實地說,這個特定數字在發布當天的報導確實存在分歧。
我們無法從任一方向驗證這個數字。OpenRouter 的 /models 回應中完全沒有參數量欄位,因此我們的測試結果無法確認或推翻 2.4T 總參數或 95B 啟用參數的說法。
Qwen3.8-Max 是開源的嗎?8 月 4 日還不是
**不是。截至 2026-08-04,Qwen3.8-Max 僅提供 API 存取。**阿里巴巴已排定於「下週」在 Hugging Face 與 ModelScope 上釋出權重,但尚未公布任何授權條款。許多報導一直把「可取得」與「開源」混為一談,而這個區別正是整件事的關鍵。無論標題怎麼寫,今天都沒有權重可供下載。
三種不同的狀態正被混為一談,它們並不相同:
| 狀態 | Qwen3.8-Max 在 2026-08-04 的情況 |
|---|---|
| 可透過 API 使用 | 是。透過 Alibaba Cloud Model Studio,以及轉售商與路由服務 |
| 權重可下載 | 否。承諾「下週」釋出,但未給出確切日期 |
| 授權條款 | 尚未公布。目前沒有任何條款文字可供閱讀 |
我們沒有輕信任何一方的說法,而是自己查證了最直接的證據:在 2026-08-04,於 Hugging Face 搜尋 Qwen3.8 沒有找到任何阿里巴巴的模型卡。搜尋結果只有四個社群上傳的模型,命名為 Qwen3.8_4B_Distilled 及其變體,這些是第三方蒸餾模型,並非旗艦模型本身。如果你快速瀏覽那個頁面,很容易誤把它們當成正式版本。
關於授權條款還有一點要說明,因為過去的先例一直被誤報成既定承諾。Qwen 3.5 與 Qwen 3.6 都是以 Apache 2.0 授權釋出。若 2.4T 模型改用限制性的社群授權,技術上仍可稱為「開放權重」,但你能拿這些權重做什麼將完全不同。在授權條款文字公布之前,任何人告訴你可以用這些權重做什麼,都只是在猜測。這也是為什麼 Qwen3.8-Max 沒有被列入我們的2026 年值得使用的開源 LLM 整理:它目前還不符合資格。
我們實測的結果:漲價 35.6%,但每次呼叫卻便宜 4x
**我們在 2026-08-04 透過 OpenRouter 對 qwen3.8-max、qwen3.7-max 與 qwen3-max 執行了 40 次計費呼叫,總花費 $1.4728。**以下每項成本都是根據回傳的 usage 物件計算,並與 OpenRouter 自身的計費數字交叉核對,結果全部吻合。最主要的發現,恰好與價格變動的方向相反。
先看價格。根據 2026-08-04 GET /models 的即時定價,3.8-Max 每百萬 token 為輸入 $2.00 / 輸出 $6.00,而 3.7-Max 則是 $1.475 / $4.425。這是兩邊都上漲 35.6%,且不論輸入或輸出,漲幅比例完全一致(2.000/1.475 = 6.000/4.425 = 1.3559)。你可以在OpenRouter 的模型頁面上核對目前的數字。
以下是對三個模型送出相同簡單提示的結果,每個模型各執行三次,temperature: 0,以串流方式回傳:
| 模型 | 首個 token(3 次執行) | 首個可見內容 | 總耗時(3 次執行) | 完成 token 數 | 其中推理 token | 每次呼叫成本中位數 |
|---|---|---|---|---|---|---|
| qwen3.8-max | 2.249s / 0.874s / 1.054s | 5.414s / 5.058s / 4.209s | 6.338s / 6.734s / 5.130s | 242 / 287 / 243 | 156 / 194 / 157 | $0.001592 |
| qwen3.7-max | 4.871s / 1.157s / 1.670s | 從未出現 / 22.358s / 25.998s | 31.147s / 24.013s / 27.661s | 1502 / 1281 / 1443 | 1500 / 1174 / 1346 | $0.006428 |
| qwen3-max | 2.617s / 2.892s / 2.386s | 2.617s / 2.892s / 2.386s | 4.401s / 4.601s / 4.081s | 105 / 105 / 107 | 0 / 0 / 0 | $0.000431 |
之所以需要兩個不同的「首個 token」欄位,是因為兩款推理模型都會先串流輸出隱藏的推理內容,再輸出實際答案文字。在 3.8-Max 上,三次執行中有兩次在一秒內就收到 token,但使用者實際能讀到的第一個字要再等 4 到 5 秒才出現。在 3.7-Max 的第 1 次執行中,可讀內容甚至從未出現。如果你針對推理模型建立串流 UI,連線明明已經建立,轉圈圈的載入動畫卻還會持續轉很久。
推理 token 欄位值得多看一次。在一個要求用三句話解釋 Bloom filter 的提示中,3.7-Max 花費了 1,174 到 1,500 個推理 token,而 3.8-Max 只用了 156 到 194 個。也就是說,面對同樣的答案,思考量大約少了 7x,而推理 token 是以輸出價格計費的。結果就是:3.8-Max 每次呼叫大約便宜 4x,從我們的機器實測(含網路來回時間)來看速度也快了 4 到 5 倍,即便每個 token 的價格貴了 35.6%。標價漲了,帳單卻降了。
隨著提示長度增加,這個結論會反過來。以下是根據即時定價推算(而非實測)的結果:一次 30,000 token 輸入、500 token 輸出的呼叫,每千次呼叫在 3.8-Max 上要價 $63.00,3.7-Max 則是 $46.46。在 100,000 輸入 token 時則是 $203.00 對 $149.71。一旦大部分 token 都是輸入而非輸出,推理效率帶來的優勢就不足以彌補漲價,3.8-Max 反而成為三者中最貴的一個。哪個模型最便宜,真正取決於你的輸入輸出比例,這正是我們的LLM API 定價比較一直在強調的結論。
reasoning_effort 是全新參數,3.7-Max 會靜默忽略它
reasoning_effort 出現在 3.8-Max 支援的參數清單中,但 3.7-Max 並不支援。在 3.8-Max 上,這個參數的影響幅度不大:各執行三次,minimal 產生了 67、108 與 124 個推理 token,而 high 則是 163、136 與 173 個。在相同提示、temperature 0 的條件下,中位數是 108 對 163。
真正會讓人多花錢的發現,出現在舊模型上。對 3.7-Max 送出 reasoning_effort: "low" 會被接受而非拒絕,然後被直接忽略:該次呼叫依然消耗了 1,401 個推理 token,計費 $0.006689,與我們記錄的同形狀呼叫完全一樣。沒有錯誤、沒有警告、也沒有任何效果。如果你打算靠降低推理強度來控制成本,務必確認這個參數在你實際呼叫的模型上真的有作用,因為一個不受支援的參數在這裡是靜默失敗,而不是明顯報錯。
遷移前務必檢查的「空白回應」陷阱
我們第一次測試時使用 max_tokens: 400,結果讓自己的測試腳本當掉了。而原因本身比這次測試更有價值:Qwen3.7-Max 可能把整個 token 額度都花在推理上,最後回傳空字串,finish_reason 為 "length",而且照樣全額計費。
我們一共遇到三次。在 max_tokens: 400 時:完成 token 為 402,其中 400 個是推理 token,答案字元數為零,計費 $0.001822。在 max_tokens: 1500 時:共 1,502 個 token,1,500 個是推理 token,字元數同樣為零,白白花了 $0.006689。稍後又發生一次,計費 $0.006735。沒有錯誤、沒有例外,只有一個看似正常、內容卻是空字串的回應物件。
如果你正在遷移現有的 3.7-Max 整合,而你的程式碼設定了不算太高的 max_tokens,請務必留時間測試這個情境。3.8-Max 的推理長度短得多,因此暴露在這個風險下的程度也明顯較低,但並非完全免疫。
一個沒人提起的小額 token 開銷
同樣一段 12 個英文字的提示,在每次執行中都穩定地計為 3.8-Max 上 67 個提示 token、3.7-Max 上 29 個(qwen3-max 則是 27 個)。這相當於約 38 個固定開銷 token,很可能是系統或對話範本變大了。在一次 100,000-token 的 RAG 呼叫中,這個差距幾乎可以忽略。但在高頻率發送短提示的分類器場景中,還沒寫下任何一個字之前,輸入帳單就已經翻了超過一倍。
Qwen3.8-Max 真的能接受圖片與影片輸入嗎?
**沒錯,而且多模態輸入是這一代真正新增的功能,不是換個名字而已。**API 對 3.8-Max 回報的模態為 text+image+video->text,而 3.7-Max 則僅支援純文字。我們透過對兩者送出同一張圖片來驗證這個差異,結果較舊的模型在路由層就直接拒絕了。
我們用自己寫的 PNG 編碼器在本機產生測試圖片,因此正確答案在建構時就已知:750x270 像素,白底黑色粗體數字 4739,頂部有一條紅色橫條。以 base64 編碼送出後,qwen3.8-max 回傳 DIGITS: 4739 與 TOPBAR: red,兩項都正確,耗時 6.99s,成本 $0.002146。對 qwen3.7-max 送出完全相同的請求,則回傳 HTTP 404 {"error":{"message":"No endpoints found that support image input"}}(意即找不到支援圖片輸入的端點)。
影片輸入也可以正常運作,但有一個我們差點誤判為失敗的狀況。我們嘗試的三個公開 MP4 網址中,有兩個回傳了 HTTP 400 "Failed to download multimodal content"(意即下載多模態內容失敗)。這其實是阿里巴巴那端抓取檔案失敗,而不是這條路由拒絕影片輸入。換成一個能成功抓取的網址後,3.8-Max 準確描述了一段 Big Buck Bunny 的影片內容,甚至說出了角色名稱,耗時 24.24s,成本 $0.006528。
在你真正拿這個功能來做產品之前,有兩個實務要點。這段大約 10 秒的影片,計費時被算成 696 個普通提示 token,而 usage.prompt_tokens_details.video_tokens 回報的數字是 0,所以你無法從這個欄位單獨拆出影片成本。另外,格式錯誤的內容區塊會靜默失敗:送出 {"type": "video", "video": [url]} 而非 video_url,會得到 HTTP 200,模型只是禮貌地表示它看不到任何影片,而且照樣計費。請務必使用 video_url。
還有一點值得知道:當我們請 3.8-Max 描述自己的能力時,它回覆 Input modalities: text。這是錯的,我們自己接下來的測試就證明了這一點。模型對自己的描述,終究是一個語言模型的輸出,而不是規格表。
1M-Token 上下文視窗的實際表現如何?
我們在生成的填充文字中,分別於 10%、50% 與 90% 的深度埋入三個獨一無二的事實,並在同一次呼叫中要求模型全部找出。在兩個模型共六次執行中,18 個埋藏事實全部找到,一個不漏,提示長度介於 5,723 到 247,911 token 之間,以程式碼進行精確子字串比對評分,而非人工閱讀答案。
以下是我們的 qwen3.8-max 執行結果(另外,qwen3.7-max 在 83,380 與 247,873 token 的兩次執行,以及 qwen3-max 在 78,255 token 的一次執行,同樣找出了全部事實):
| 提示 token 數(qwen3.8-max) | 延遲 | 成本 | 找到的事實數量 |
|---|---|---|---|
| 5,723 | 9.24s | $0.01409 | 3/3 |
| 25,703 | 13.43s | $0.05453 | 3/3 |
| 83,418 | 17.63s | $0.16965 | 3/3 |
| 247,911 | 38.54s | $0.49828 | 3/3 |
延遲呈次線性成長,這是實務上最有用的部分:輸入 token 數增加了 43x,但總耗時只增加了 4.2x。
接下來要誠實說明限制,因為這只是長上下文評測中較容易的一端。精準找回一個埋藏的事實,並不能說明模型在大型文件中的推理能力,而且我們每個長度只測試了一次。**我們沒有執行 1M-token 的呼叫。**以每百萬輸入 token $2.00 計算,單次呼叫成本約 $2.00,比整個測試流程的花費還高,而且單一樣本也說明不了太多。因此,官方宣稱的 1M 上限我們並未親自驗證。而 3.7-Max 在我們比較的兩個長度上,結果都與 3.8-Max 完全相同,可見長上下文檢索並非這一代模型的差異所在。
這裡浮現了一個發布報導完全沒提到的定價陷阱。qwen3-max 採用分級定價覆寫,提示超過 32,000 token 時單價會翻倍,超過 128,000 token 時再次調漲,而 3.8-Max 與 3.7-Max 在任何長度下都是固定費率。我們透過實際帳單確認了這個分級:我們對 qwen3-max 送出 78,255-token 的呼叫,被收取 $0.12227,對應的是 $1.56/M 的費率,而非官網標榜的 $0.78/M。在這個長度下,它的成本幾乎與 3.7-Max($0.12523)一模一樣。它的標榜價格不到實際價格的一半,而在 80k token 時的真實價格,與 3.7-Max 幾乎只差一個捨入誤差。
阿里巴巴的五項基準測試分數,以及為何無一經過驗證
**阿里巴巴在正式發布時公布了五項基準測試分數,每一項都來自阿里巴巴自己內部執行的結果,而截至 2026-08-04,我們並未找到任何已發表的獨立評測。**這句話應該緊貼著這些數字放在一起,而不是擺在三段之後才提。
| 基準測試 | 阿里巴巴自報分數 | 是否經第三方驗證? |
|---|---|---|
| Terminal-Bench 2.1 | 86.6 | 否,截至 2026-08-04 |
| GPQA Diamond | 92.6 | 否,截至 2026-08-04 |
| PaperBench | 93.0 | 否,截至 2026-08-04 |
| OSWorld-Verified | 86.1 | 否,截至 2026-08-04 |
| DeepSWE 1.1 | 56.6(前代:21.6) | 否,截至 2026-08-04 |
阿里巴巴同時公布了一個內部綜合分數 0.725,較前代的 0.474 有所提升,並將這款模型定位為接近或超越 Claude Opus 4.8、Fable 5 與 GPT-5.6 Sol。Arena 排名數字也隨之流傳:根據阿里巴巴自己在 2026-08-03 的公告,文字 Arena 第 5 名、視覺 Arena 第 2 名,而我們尚未在即時排行榜上重新確認這個數字。Arena 排名每天都在變動,你這週讀到的任何排名,都應該視為附帶日期的一張快照,而不是定論。
目前還沒有人測量過,包括我們自己在內:高併發下的吞吐量、非英語表現、安全與對齊評估,以及工具呼叫的可靠性。我們自己的數字僅涵蓋單一路由上的延遲、成本、模態與長上下文檢索,僅此而已。彭博社的發布報導只是複述了這些基準測試說法,並未進行獨立測試,而目前幾乎所有報導都停留在這個層次。
如果你想找經過查證的數字,我們的Qwen vs DeepSeek vs GLM 比較是更可靠的參考,而規模約 2.8T、幾乎所有人都拿來對比的競爭對手則是Kimi K3。
Qwen3.8 對比 Qwen3-8B,以及這次發布背後的開放權重大逆轉
**Qwen3.8 是阿里巴巴 2.4 兆參數的旗艦模型。Qwen3-8B 則是 Qwen3 系列中一款 80 億參數的密集模型,自 2025 年起就可下載。**兩者名字看起來很像,規模卻相差約 300x。搜尋引擎至今仍會把兩者搞混,不少論壇回答也一樣。
這週,命名混淆的問題非但沒有改善,反而更嚴重了。目前 Hugging Face 上唯一帶有「Qwen3.8」名稱的,只有社群的 4B 蒸餾模型。如果你在找權重時抓到了其中一個,下載到的東西其實跟那個 2.4T 模型毫無關係。
兩代封閉旗艦之後,才輪到這一次
開放權重的承諾才是這次真正的新聞,而一旦你了解這個系列的歷史,這件事的意義就會完全不同。阿里巴巴過去兩代都刻意採取分裂策略:一般大眾用的是開放權重的主力機型,頂端的旗艦則保持封閉。
| 世代 | 權重 | 備註 |
|---|---|---|
| Qwen 3.5(0.8B 至 397B-A17B) | 開放,Apache 2.0 | 完整系列全數公開釋出 |
| Qwen 3.6(27B 密集模型,35B-A3B MoE) | 開放,Apache 2.0 | 延續相同模式 |
| Qwen3.7-Max | 封閉 | 僅提供 API,無 GGUF、無 Hugging Face 檢查點 |
| Qwen3.8-Max | 承諾開放,尚未釋出 | 截至 2026-08-03 為「下週」。授權條款未公布 |
阿里巴巴連續兩代都封閉了旗艦層級,如今卻表示要開放自己有史以來打造過最大的模型。如果權重真的如承諾釋出,這將是一次真正的路線逆轉,並會對所有把「前沿層級維持封閉」視為既定事實的實驗室造成壓力。如果承諾跳票,這就會是連續第三次封閉的 Max 發布。截至 2026-08-04,這兩種結果都還有可能發生。我們在 GLM 5.2 身上也見過同樣的動態:最終真正釋出的授權條款,遠比宣布時說的話更重要。
你能自己架設 Qwen3.8-Max 嗎?(依然不行)
**不行,而且正式發布的規格讓這件事變得更清楚,而不是更模糊。**以 2.4 兆總參數量來說,即使權重釋出後,這也不是一個你能用自己的硬體來服務的模型。685B 的 DeepSeek-V3.2,已經被實際自建過的人形容為一項不小的基礎設施工程。而這個模型的規模是那個的好幾倍。
那麼,一個開放權重的 2.4T 模型,實際上能帶來什麼好處?
- 推論服務商可以架設它,意味著會出現價格競爭,也意味著你每個 token 的成本會下降
- 主權級、受監管與氣隙隔離(air-gapped)的部署,在這個規模上首次成為可能
- 研究人員與微調團隊能拿到一個前沿等級的基礎模型來使用
- 但這不代表它能跑在你的機器上、你的單張 A100 上,或是你新創公司的 GPU 預算裡
如果你想知道實際架設大型開放權重模型需要多少硬體資源,我們的LLM VRAM 需求指南有完整的計算。針對這款模型的簡短結論就是:別自己架。
該切換、測試,還是等待?
| 你的情況 | 我們在 2026-08-04 會怎麼做 |
|---|---|
| 正在生產環境使用 Qwen3.7-Max | 先在短提示流量上測試 3.8-Max,我們測到的 4x 成本差距就出現在這裡。接著檢查你的 max_tokens 處理邏輯是否能應付空白回應的狀況 |
| 長上下文或高強度 RAG 工作負載 | 目前先按兵不動。3.8-Max 每個 token 貴 35.6%,而在我們的檢索測試中表現與 3.7-Max 完全相同 |
| 你需要圖片或影片輸入 | 這是值得切換的理由。3.7-Max 完全無法接受圖片,我們也確認了那個 404 錯誤 |
| 正在等待開放權重 | 把 2026-08-10 標記起來。在有模型卡與可讀的授權條款之前,沒什麼好做的 |
| 目前用 Claude 或 GPT 就很滿意 | 今天沒有任何理由改變。阿里巴巴的基準測試分數尚未驗證,而未驗證的數字不足以構成遷移的理由 |
方法比結論更重要。我們實際在生產環境測試過的每一個模型,表現都跟排行榜上的位置不太一樣,因為你的提示、你的程式碼庫,以及你能容忍多少次重試,沒有出現在任何人的基準測試裡。我們這次測試中的兩項程式任務就說明了這一點:3.8-Max 與 3.7-Max 在字串寬度截斷任務上都拿到 11/11,在日期運算的模糊測試中也都通過了 5,000/5,000 個測試案例。就正確性而言,我們完全分不出兩者的差異。我們測到的差距,存在於簡單提示上的延遲與 token 花費,而不是困難任務上的能力。
正在評估是否要遷移,想找人幫你重新檢視成本模型嗎?讓我們的團隊針對你的工作負載進行壓力測試。
所有數字皆於 2026-08-04 驗證。定價、Arena 排名與權重釋出時間表都會頻繁變動。我們的測量結果來自單一路由(OpenRouter 對接阿里巴巴)、單一台機器、單一天,延遲測試 n=3,大多數功能性測試則為 n=1。
常見問題
Qwen3.8-Max 是開源的嗎?
截至 2026-08-04 還不是。它目前僅提供 API 存取。阿里巴巴已排定於「下週」在 Hugging Face 與 ModelScope 上釋出權重,但尚未公布任何授權條款。稱它為開源的標題,已經走在事實前面了。在 Hugging Face 搜尋只會找到第三方的 4B 蒸餾模型,而非阿里巴巴的模型卡。
Qwen3.8-Max 的價格是多少?
每百萬輸入 token $2.00,每百萬輸出 token $6.00,快取輸入則為 $0.25。這在輸入與輸出兩邊都比 Qwen3.7-Max 貴 35.6%。我們實測短呼叫的成本中位數為 $0.001592,在相同提示下大約比 3.7-Max 便宜 4x,原因是它產生的推理 token 少得多。
Qwen3.8-Max 有多少參數?
根據阿里巴巴的公告以及所有相關報導,總參數量為 2.4 兆。啟用參數量則存在爭議:SiliconANGLE、The Decoder 與 Coursiv 都表示約 95 billion 啟用參數,而 MarkTechPost 則表示阿里巴巴並未揭露這個數字。API 沒有公開參數量欄位,因此我們無法驗證任何一方的數字。
Qwen3.8-Max 的上下文視窗有多大?
即時 API 回報的上下文長度為 1,000,000 token,最大完成 token 數為 131,072。我們測試檢索能力最高到 247,911 token,結果全數成功。我們沒有執行 1M-token 的呼叫,因為單次成本約 $2.00,超出了我們的測試預算,因此這個視窗的上限我們並未親自驗證。
Qwen3.8-Max 支援圖片與影片輸入嗎?
兩者皆支援,而且我們都親自驗證過。它能從本機產生的 PNG 圖片中正確讀出數字與顏色,也能在給定一個阿里巴巴能成功抓取的網址時準確描述影片內容。Qwen3.7-Max 則會直接以 404 拒絕圖片輸入。我們測試的三個影片網址中,有兩個在服務商的下載步驟就失敗了。
Qwen3.8-Max 的基準測試分數有經過獨立驗證嗎?
沒有。Terminal-Bench 2.1 的 86.6、GPQA Diamond 的 92.6、PaperBench 的 93.0、OSWorld-Verified 的 86.1,以及 DeepSWE 1.1 的 56.6,全部都來自阿里巴巴的內部測試。截至 2026-08-04,我們並未找到任何一項的第三方評測公開發表。
我能在本機運行 Qwen3.8-Max 嗎?
現實上不行,即使權重釋出後也一樣。以 2.4 兆參數來說,它的規模是 DeepSeek-V3.2 的好幾倍,而後者本身自架就已經是一項貨真價實的基礎設施工程。除非你自己經營資料中心,否則應該預期是透過推論服務商來使用它,而不是靠自己的 GPU。
我該從 Qwen3.7-Max 遷移到 Qwen3.8-Max 嗎?
這取決於你的 token 組成比例。在短提示情境下,我們測到 3.8-Max 的成本約為四分之一,速度則快了 4 到 5 倍。在長輸入的工作負載下,它貴了 35.6%,而在我們的檢索測試中表現與 3.7-Max 完全相同。如果你需要圖片或影片輸入,3.7-Max 完全無法做到。
Qwen3.8-Max 的權重什麼時候會釋出?
阿里巴巴在 2026-08-03 的公告中表示是「下週」,並指名 Hugging Face 與 ModelScope 為釋出平台。目前沒有確切日期,也沒有授權條款文字。據報導,一款配套的開放權重模型 Qwen3.8-27B 將與其一同釋出。我們計畫在 2026-08-10 重新查證。