Techsy
Liên hệ
Bắt đầu
Quay lại Blog
ai-machine-learning

Qwen3.8-Max Đã Ra Mắt: 2,4 Nghìn Tỷ Tham Số, Ngữ Cảnh 1M Token, Nhưng Trọng Số Vẫn Chưa Công Bố

Viết bởi Mert Batur
Cập nhật lần cuối Aug 4, 2026
24 phút đọc
Mục lục
Qwen3.8-Max Đã Ra Mắt: 2,4 Nghìn Tỷ Tham Số, Ngữ Cảnh 1M Token, Nhưng Trọng Số Vẫn Chưa Công Bố

Qwen3.8-Max Đã Ra Mắt: 2,4 Nghìn Tỷ Tham Số, Ngữ Cảnh 1M Token, Nhưng Trọng Số Vẫn Chưa Công Bố

$1.4728. Đó là số tiền chúng tôi trả cho 40 lệnh gọi API trực tiếp trên Qwen3.8-Max và hai phiên bản tiền nhiệm vào ngày 2026-08-04, một ngày sau khi Alibaba ra mắt mô hình này. Điều bất ngờ không phải là 2,4 nghìn tỷ tham số. Mà là: 3.8-Max tính phí cao hơn 35.6% mỗi token so với Qwen3.7-Max, nhưng vẫn rẻ hơn khoảng 4x mỗi câu trả lời, vì nó đã ngừng "suy nghĩ" quá nhiều. Còn một điều nữa mà phần lớn tin tức ra mắt đang nói sai. Đây không phải mã nguồn mở. Ít nhất là chưa, tính đến hôm nay.

Bài viết này được đăng lần đầu vào ngày 2026-07-19, khi Qwen3.8 mới chỉ là bản xem trước chưa có thông số công bố. Bài đã được viết lại vào ngày 2026-08-04 dựa trên bản GA chính thức và các bài test API của chính chúng tôi.

Những Điểm Chính

  • Tính đến 2026-08-04, Qwen3.8-Max chỉ khả dụng qua API. Alibaba hứa phát hành trọng số "tuần tới", tức là tuần của ngày 2026-08-10, trên Hugging Face và ModelScope.
  • Chúng tôi đo được $0.001592 cho một lệnh gọi ngắn, so với $0.006428 trên Qwen3.7-Max, dù giá mỗi token cao hơn.
  • Năm điểm benchmark của Alibaba đều do chính hãng tự công bố. Chúng tôi không tìm thấy đánh giá độc lập nào được công bố tính đến 2026-08-04.
  • Đầu vào ảnh và video là tính năng thật và mới. Chúng tôi đã xác minh cả hai qua API, cũng như xác minh việc 3.7-Max từ chối chúng.

Điều Gì Đã Thay Đổi Giữa Bản Xem Trước Và Bản GA

Qwen3.8-Max chính thức phát hành rộng rãi (GA) vào ngày 2026-08-03, và bản phát hành này đã trả lời mọi câu hỏi bỏ ngỏ mà trang này liệt kê hai tuần trước. Thời kỳ xem trước chỉ cho chúng ta một con số tham số và một lời hứa. Bản GA bổ sung cửa sổ ngữ cảnh 1M token đã được xác nhận, đầu vào văn bản cộng ảnh cộng video, năm điểm benchmark đã công bố, và mức giá theo từng token.

Dưới đây là danh sách các ẩn số cũ, nay đã được giải đáp:

Trang này viết gì vào 2026-07-19Tình trạng vào 2026-08-04
Điểm benchmark đã công bố: không cóNăm điểm do Alibaba báo cáo đã được công bố
Tham số đang hoạt động / cấu hình MoE: chưa tiết lộĐược báo cáo rộng rãi là ~95B tham số hoạt động, MoE thưa (sparse). Các nguồn tin mâu thuẫn nhau, xem bên dưới
Cửa sổ ngữ cảnh và đầu ra tối đa: chưa công bố1M đầu vào, 131,072 đầu ra, được xác nhận bởi API trực tiếp
Phương thức đầu vào: chưa công bốvăn bản + ảnh + video đầu vào, văn bản đầu ra. Chúng tôi đã tự xác minh điều này
Giá theo từng token: chưa tách chi tiết$2.00 / triệu token đầu vào, $6.00 / triệu token đầu ra
Ngày phát hành trọng số mở: "sắp tới", không có ngày cụ thể"Tuần tới", nêu rõ Hugging Face và ModelScope
Qwen3.8-Max-Preview đang hoạt độngBản xem trước đã kết thúc. Bản GA đã ra mắt

Một mục vẫn chưa được giải quyết. Cách chia tham số vẫn còn gây tranh cãi. Bài viết ra mắt của MarkTechPost khẳng định rõ ràng rằng Alibaba chưa tiết lộ số tham số đang hoạt động, trong khi SiliconANGLE, The Decoder và Coursiv đều đăng con số ~95 tỷ tham số hoạt động. Chúng tôi đã đọc lại bài viết của MarkTechPost vào 2026-08-04 và nó vẫn ghi là chưa tiết lộ. Ai đó đang lấy nguồn sai, và điều trung thực nhất chúng tôi có thể nói là việc đưa tin về con số cụ thể này đã mâu thuẫn ngay trong ngày ra mắt.

Chúng tôi không thể xác minh theo cả hai chiều. Phản hồi /models của OpenRouter không hề chứa trường số tham số nào, nên không có gì trong quá trình test của chúng tôi xác nhận hay bác bỏ con số 2,4T tổng hoặc 95B hoạt động.

Qwen3.8-Max Có Phải Mã Nguồn Mở Không? Không Phải Vào Ngày 4 Tháng 8

Không. Tính đến 2026-08-04, Qwen3.8-Max chỉ khả dụng qua API. Alibaba đã lên lịch phát hành trọng số "tuần tới" trên Hugging Face và ModelScope, nhưng chưa công bố bất kỳ giấy phép nào. Các bài đưa tin cứ liên tục gộp "khả dụng" với "mở" thành một, và chính sự khác biệt đó mới là cả câu chuyện. Hôm nay không hề có trọng số nào để tải xuống, dù tiêu đề nào có nói gì đi nữa.

Ba trạng thái đang bị gộp thành một từ. Chúng không phải là một:

Trạng tháiQwen3.8-Max vào 2026-08-04
Khả dụng qua APICó. Alibaba Cloud Model Studio, cùng các bên bán lại và router
Trọng số có thể tải xuốngKhông. Hứa hẹn "tuần tới", chưa có ngày cụ thể
Điều khoản giấy phépChưa công bố. Không có văn bản nào để đọc

Chúng tôi kiểm tra bằng chứng chắc chắn nhất có sẵn thay vì tin lời ai đó: một lượt tìm kiếm Qwen3.8 trên Hugging Face vào 2026-08-04 không trả về bất kỳ model card nào của Alibaba. Thứ nó trả về là bốn bản tải lên của cộng đồng mang tên Qwen3.8_4B_Distilled và các biến thể, tức là các bản chưng cất (distill) của bên thứ ba, không phải mô hình chủ lực. Nếu bạn lướt qua trang đó nhanh, rất dễ nhầm chúng với bản phát hành thật.

Một lưu ý về giấy phép, vì tiền lệ cứ bị đưa tin như thể là một lời cam kết. Qwen 3.5 và Qwen 3.6 đều phát hành theo giấy phép Apache 2.0. Một giấy phép cộng đồng hạn chế cho mô hình 2,4T vẫn có thể về mặt kỹ thuật được gọi là "trọng số mở" trong khi vẫn thay đổi những gì bạn được phép xây dựng với chúng. Chừng nào chưa có văn bản giấy phép, bất kỳ ai nói cho bạn biết bạn có thể làm gì với những trọng số này đều đang đoán mò. Đó cũng là lý do Qwen3.8-Max chưa có mặt trong bài tổng hợp các LLM mã nguồn mở đáng chạy năm 2026 của chúng tôi: nó chưa đủ tiêu chuẩn.

Những Gì Chúng Tôi Đo Được: Rẻ Hơn 4 Lần Mỗi Lệnh Gọi Dù Giá Tăng 35.6%

Chúng tôi thực hiện 40 lệnh gọi có tính phí đối với qwen3.8-max, qwen3.7-max và qwen3-max qua OpenRouter vào ngày 2026-08-04, tổng chi tiêu $1.4728. Mỗi chi phí bên dưới được tính từ đối tượng usage trả về và đối chiếu chéo với số liệu tính phí thực tế của chính OpenRouter. Tất cả đều khớp nhau. Phát hiện chính lại đi ngược với thay đổi giá.

Bắt đầu với giá. Giá trực tiếp lấy từ GET /models vào 2026-08-04 cho thấy 3.8-Max ở mức $2.00 đầu vào / $6.00 đầu ra trên mỗi triệu token, so với 3.7-Max ở mức $1.475 / $4.425. Đó là mức tăng 35.6% ở cả hai phía, và tỷ lệ giống hệt nhau theo cả hai cách tính (2.000/1.475 = 6.000/4.425 = 1.3559). Bạn có thể đối chiếu con số hiện tại trên trang mô hình của OpenRouter.

Bây giờ là cùng một câu lệnh đơn giản gửi đến cả ba mô hình, ba lượt chạy mỗi mô hình, temperature: 0, phát trực tuyến (streamed):

Mô hìnhToken đầu tiên (3 lượt)Nội dung hiển thị đầu tiênThời gian thực (3 lượt)Token hoàn thànhtrong đó token suy luậnChi phí trung vị/lệnh gọi
qwen3.8-max2.249s / 0.874s / 1.054s5.414s / 5.058s / 4.209s6.338s / 6.734s / 5.130s242 / 287 / 243156 / 194 / 157$0.001592
qwen3.7-max4.871s / 1.157s / 1.670skhông bao giờ / 22.358s / 25.998s31.147s / 24.013s / 27.661s1502 / 1281 / 14431500 / 1174 / 1346$0.006428
qwen3-max2.617s / 2.892s / 2.386s2.617s / 2.892s / 2.386s4.401s / 4.601s / 4.081s105 / 105 / 1070 / 0 / 0$0.000431

Cần đến hai cột token-đầu-tiên riêng biệt vì cả hai mô hình suy luận đều phát trực tuyến phần suy luận ẩn trước khi có bất kỳ văn bản trả lời nào. Với 3.8-Max, một token đến trong chưa đầy một giây ở hai trên ba lượt chạy, nhưng từ đầu tiên mà người dùng thực sự đọc được lại xuất hiện sau bốn đến năm giây. Ở lượt chạy 1 của 3.7-Max, nó không bao giờ xuất hiện. Nếu bạn xây dựng giao diện streaming trên một mô hình suy luận, biểu tượng tải vẫn tiếp tục quay rất lâu sau khi kết nối đã chứng minh là còn sống.

Hãy đọc lại cột token suy luận lần nữa. Với một câu hỏi yêu cầu giải thích Bloom filter trong ba câu, 3.7-Max tiêu tốn từ 1,174 đến 1,500 token suy luận. 3.8-Max chỉ tốn từ 156 đến 194. Đó là khoảng ít suy luận hơn 7 lần cho cùng một câu trả lời, và token suy luận được tính phí theo giá đầu ra. Kết quả: 3.8-Max rẻ hơn khoảng 4x mỗi lệnh gọi và nhanh hơn 4 đến 5 lần về thời gian thực đo từ máy của chúng tôi, đã tính cả thời gian đi-về mạng, trong khi vẫn đắt hơn 35.6% mỗi token. Giá niêm yết tăng, nhưng hóa đơn lại giảm.

Điều này đảo ngược khi câu lệnh dài hơn. Được mô hình hóa từ giá trực tiếp chứ không phải đo thực tế, một lệnh gọi 30,000 token đầu vào với 500 token đầu ra tốn $63.00 cho mỗi nghìn lệnh gọi trên 3.8-Max, so với $46.46 trên 3.7-Max. Ở mức 100,000 token đầu vào, con số này là $203.00 so với $149.71. Khi phần lớn token của bạn là đầu vào, lợi thế về hiệu quả suy luận không còn đủ bù cho mức giá tăng, và 3.8-Max trở thành mô hình đắt nhất trong ba mô hình. Mô hình nào rẻ nhất thực sự phụ thuộc vào tỷ lệ đầu vào/đầu ra của bạn, đó cũng chính là bài học mà bài so sánh giá API LLM của chúng tôi liên tục rút ra.

reasoning_effort Là Tham Số Mới, Và 3.7-Max Âm Thầm Bỏ Qua Nó

reasoning_effort xuất hiện trong danh sách tham số được hỗ trợ của 3.8-Max nhưng không có ở 3.7-Max. Trên 3.8-Max, nó tạo ra thay đổi vừa phải: qua ba lượt chạy mỗi mức, minimal cho ra 67, 108 và 124 token suy luận, còn high cho ra 163, 136 và 173. Trung vị 108 so với 163, trên cùng một câu lệnh, ở nhiệt độ 0.

Phát hiện tốn tiền lại nằm ở mô hình cũ hơn. Gửi reasoning_effort: "low" đến 3.7-Max được chấp nhận thay vì bị từ chối, rồi bị bỏ qua: lệnh gọi đó vẫn tiêu tốn 1,401 token suy luận, tính phí $0.006689 giống hệt lệnh gọi có hình dạng tương tự mà chúng tôi đã ghi lại. Không có lỗi, không có cảnh báo, không có tác dụng gì. Nếu bạn đang điều chỉnh chi phí bằng cách giảm mức độ suy luận, hãy xác minh rằng nó thực sự có tác dụng trên mô hình bạn đang gọi, vì một tham số không được hỗ trợ ở đây sẽ thất bại âm thầm chứ không hề báo lỗi.

Cái Bẫy Phản Hồi Rỗng Bạn Nên Kiểm Tra Trước Khi Chuyển Đổi

Lượt test đầu tiên của chúng tôi dùng max_tokens: 400 và làm sập chính đoạn script của chúng tôi. Lý do hóa ra còn đáng giá hơn cả bài test. Qwen3.7-Max có thể tiêu hết toàn bộ ngân sách token vào suy luận và trả về một chuỗi rỗng, kèm finish_reason: "length", và vẫn bị tính phí đầy đủ.

Chúng tôi gặp trường hợp này ba lần riêng biệt. Ở max_tokens: 400: 402 token hoàn thành, trong đó 400 token là suy luận, không có ký tự trả lời nào, tính phí $0.001822. Ở max_tokens: 1500: 1,502 token, 1,500 token là suy luận, không có ký tự nào, $0.006689 cho không gì cả. Và một lần nữa ở lệnh gọi sau đó, $0.006735. Không có lỗi, không có ngoại lệ, chỉ là một đối tượng phản hồi trông trôi chảy với chuỗi nội dung rỗng.

Nếu bạn đang chuyển từ một hệ thống tích hợp 3.7-Max hiện có và code của bạn đặt max_tokens ở mức khiêm tốn, hãy dành thời gian test tình huống này. Việc 3.8-Max suy luận ngắn hơn nhiều khiến nó ít gặp rủi ro này hơn đáng kể. Nhưng nó không hề miễn nhiễm.

Một Khoản Chi Phí Token Nhỏ Mà Không Ai Nhắc Đến

Cùng một câu lệnh 12 từ được đếm là 67 token câu lệnh trên 3.8-Max và 29 token trên 3.7-Max, nhất quán qua từng lượt chạy (27 trên qwen3-max). Đó là khoảng 38 token chi phí cố định, có lẽ đến từ một hệ thống hoặc template hội thoại lớn hơn. Với một lệnh gọi RAG 100,000 token, con số đó gần như không đáng kể. Với một bộ phân loại tần suất cao gửi các câu lệnh ngắn, nó khiến hóa đơn đầu vào của bạn tăng hơn gấp đôi trước khi bạn kịp gõ một từ nào.

Qwen3.8-Max Có Thực Sự Nhận Ảnh Và Video Không?

Có, và đầu vào đa phương thức (multimodal) thực sự là tính năng mới trong thế hệ này, không phải chỉ đổi tên. API báo cáo text+image+video->text đối với 3.8-Max và chỉ văn bản đối với 3.7-Max. Chúng tôi xác minh sự khác biệt này bằng cách gửi cùng một ảnh cho cả hai, và mô hình cũ từ chối nó ngay ở tầng định tuyến (routing).

Chúng tôi tự tạo ảnh test tại chỗ bằng một bộ mã hóa PNG viết tay để biết chắc kết quả đúng ngay từ đầu: 750x270 pixel, các chữ số khối màu đen 4739 trên nền trắng, kèm một thanh ngang màu đỏ ở trên cùng. Gửi dưới dạng mã hóa base64, qwen3.8-max trả về DIGITS: 4739 và TOPBAR: red. Đúng ở cả hai điểm, mất 6.99s, tốn $0.002146. Cùng yêu cầu đó gửi đến qwen3.7-max lại trả về HTTP 404 {"error":{"message":"No endpoints found that support image input"}}.

Video cũng hoạt động, kèm theo một điều mà chúng tôi suýt báo cáo nhầm là lỗi. Hai trong ba URL MP4 công khai mà chúng tôi thử đều trả về HTTP 400 "Failed to download multimodal content". Đó là do Alibaba không tải được file, chứ không phải do tuyến này từ chối video. Với một URL mà nó tải được, 3.8-Max mô tả chính xác một clip Big Buck Bunny, kể cả tên nhân vật, trong 24.24s, tốn $0.006528.

Hai lưu ý thực tế trước khi bạn dựa vào tính năng này. Video được tính phí như 696 token câu lệnh thông thường cho một clip khoảng 10 giây, và usage.prompt_tokens_details.video_tokens báo cáo 0, nên bạn không thể tách riêng chi phí video từ trường đó. Và một phần nội dung viết sai định dạng sẽ thất bại âm thầm: gửi {"type": "video", "video": [url]} thay vì video_url vẫn trả về HTTP 200 với việc mô hình lịch sự nói rằng nó không thấy video nào, kèm theo một hóa đơn. Hãy dùng video_url.

Đáng chú ý: khi chúng tôi hỏi 3.8-Max mô tả năng lực của chính nó, nó trả lời Input modalities: text. Điều đó sai, như bài test tiếp theo trong chính lượt chạy của chúng tôi đã chứng minh. Việc một mô hình tự mô tả bản thân là một đầu ra của mô hình ngôn ngữ, không phải một bảng thông số kỹ thuật.

Cửa Sổ Ngữ Cảnh 1M Token Hoạt Động Tốt Đến Đâu?

Chúng tôi cài ba dữ kiện riêng biệt ở độ sâu 10%, 50% và 90% trong văn bản đệm được tạo tự động, rồi yêu cầu trả lại cả ba trong một lệnh gọi. 18 trên 18 "cây kim" đều được tìm thấy chính xác qua sáu lượt chạy trên hai mô hình, với kích thước câu lệnh từ 5,723 đến 247,911 token, được chấm điểm bằng cách khớp chuỗi con chính xác trong code, chứ không phải đọc câu trả lời.

Các lượt chạy qwen3.8-max của chúng tôi (hai lượt chạy qwen3.7-max ở mức 83,380 và 247,873 token, cùng một lượt chạy qwen3-max ở mức 78,255, cũng đều trả về đầy đủ mỗi cây kim):

Token câu lệnh (qwen3.8-max)Độ trễChi phíSố cây kim tìm được
5,7239.24s$0.014093/3
25,70313.43s$0.054533/3
83,41817.63s$0.169653/3
247,91138.54s$0.498283/3

Độ trễ tăng theo kiểu dưới tuyến tính, đây là phần thực sự hữu dụng: đầu vào nhiều hơn 43x chỉ khiến thời gian thực tăng thêm 4.2x.

Bây giờ đến những giới hạn thành thật, vì đây là phần dễ nhất của việc đánh giá ngữ cảnh dài. Việc lấy lại đúng một dữ kiện đã cài sẵn nói lên rất ít về khả năng suy luận trên một tài liệu lớn, và chúng tôi chỉ test mỗi kích thước một lần. Chúng tôi chưa chạy một lệnh gọi 1M token. Với giá $2.00 mỗi triệu token đầu vào, một lệnh như vậy sẽ tốn khoảng $2.00, nhiều hơn toàn bộ đợt test này cộng lại, và một mẫu duy nhất cũng sẽ không cho chúng tôi biết được nhiều. Vì vậy giới hạn 1M được quảng cáo vẫn chưa được chúng tôi xác minh. Và 3.7-Max khớp chính xác với 3.8-Max ở cả hai kích thước chúng tôi so sánh, nghĩa là khả năng truy xuất ngữ cảnh dài không phải là điểm phân biệt của thế hệ này.

Một cái bẫy về giá xuất hiện ở đây mà tin tức ra mắt hoàn toàn bỏ sót. qwen3-max áp dụng giá theo bậc, tăng gấp đôi mức giá khi vượt quá 32,000 token câu lệnh và tăng thêm lần nữa khi vượt quá 128,000, trong khi 3.8-Max và 3.7-Max có giá cố định ở mọi độ dài. Chúng tôi xác nhận bậc giá này từ hóa đơn thực tế: lệnh gọi 78,255 token của chúng tôi đến qwen3-max bị tính phí $0.12227, theo mức $1.56/M, không phải mức giá niêm yết $0.78/M. Ở độ dài này, nó tốn gần bằng chi phí của 3.7-Max ($0.12523). Giá niêm yết của nó chưa bằng một nửa. Giá thực tế ở mốc 80 nghìn token thì chỉ chênh nhau một chút do làm tròn.

Năm Điểm Benchmark Của Alibaba, Và Vì Sao Không Điểm Nào Được Xác Minh

Alibaba công bố năm điểm benchmark cùng với bản GA. Tất cả đều đến từ các lượt chạy nội bộ của chính Alibaba, và chúng tôi không tìm thấy đánh giá độc lập nào được công bố tính đến 2026-08-04. Câu này xứng đáng nằm ngay cạnh các con số, chứ không phải ba đoạn văn bên dưới chúng.

BenchmarkĐiểm do Alibaba báo cáoCó được bên thứ ba xác minh không?
Terminal-Bench 2.186.6Không, tính đến 2026-08-04
GPQA Diamond92.6Không, tính đến 2026-08-04
PaperBench93.0Không, tính đến 2026-08-04
OSWorld-Verified86.1Không, tính đến 2026-08-04
DeepSWE 1.156.6 (phiên bản trước: 21.6)Không, tính đến 2026-08-04

Alibaba còn báo cáo một điểm tổng hợp nội bộ là 0.725, tăng từ 0.474, và định vị mô hình này ngang bằng hoặc vượt qua Claude Opus 4.8, Fable 5 và GPT-5.6 Sol. Các xếp hạng Arena cũng được lan truyền: hạng 5 tại Text Arena và hạng 2 tại Vision Arena, theo chính thông báo ngày 2026-08-03 của Alibaba, và chúng tôi chưa xác minh lại trên bảng xếp hạng trực tiếp. Xếp hạng Arena thay đổi hằng ngày. Hãy xem bất kỳ thứ hạng nào bạn đọc tuần này như một ảnh chụp nhanh có gắn ngày tháng.

Điều mà chưa ai đo được, kể cả chúng tôi: thông lượng (throughput) dưới tải đồng thời, hiệu suất với các ngôn ngữ ngoài tiếng Anh, các đánh giá về an toàn và căn chỉnh, và độ tin cậy khi gọi công cụ (tool-calling). Các con số của riêng chúng tôi chỉ bao phủ độ trễ, chi phí, phương thức đầu vào và khả năng truy xuất ngữ cảnh dài trên một tuyến duy nhất, không hơn. Bài báo cáo ra mắt của Bloomberg chỉ lặp lại các tuyên bố benchmark mà không tự kiểm chứng độc lập, và đó cũng là nơi hầu hết các bài đưa tin hiện đang dừng lại.

Với những con số đã được kiểm chứng, bài so sánh Qwen với DeepSeek và GLM của chúng tôi là nguồn tham khảo tốt hơn, và Kimi K3, với khoảng 2.8T tham số, là đối thủ cùng cỡ mà mọi người thường so sánh với mô hình này.

Qwen3.8 So Với Qwen3-8B, Và Cú Đảo Chiều Trọng Số Mở Đằng Sau Bản Phát Hành Này

Qwen3.8 là mô hình chủ lực 2,4 nghìn tỷ tham số của Alibaba. Qwen3-8B là một mô hình dense 8 tỷ tham số thuộc dòng Qwen3, đã có thể tải xuống từ năm 2025. Tên gọi trông giống nhau, nhưng chênh lệch kích thước khoảng 300x. Các công cụ tìm kiếm vẫn nhầm lẫn hai mô hình này, và đáng ngạc nhiên là một số lượng không nhỏ các câu trả lời trên diễn đàn cũng vậy.

Vấn đề đặt tên tuần này không tốt hơn, mà còn tệ hơn. Thứ duy nhất mang tên "Qwen3.8" trên Hugging Face hiện tại là các bản chưng cất (distill) 4B của cộng đồng. Nếu bạn đi tìm trọng số và tải một trong số đó, bạn đang tải về thứ chẳng liên quan gì đến mô hình 2,4T.

Hai Mô Hình Chủ Lực Đóng, Rồi Đến Lần Này

Lời hứa về trọng số mở mới là tin tức thực sự ở đây, và nó đọc khác hẳn khi bạn nhìn vào lịch sử của cả dòng sản phẩm. Alibaba đã duy trì một sự phân tách có chủ đích suốt hai thế hệ: các mô hình trọng số mở dùng làm "ngựa thồ" cho mọi người, còn mô hình chủ lực trên cùng thì đóng.

Thế hệTrọng sốGhi chú
Qwen 3.5 (0.8B đến 397B-A17B)Mở, Apache 2.0Toàn bộ dòng sản phẩm được phát hành công khai
Qwen 3.6 (27B dense, 35B-A3B MoE)Mở, Apache 2.0Cùng khuôn mẫu được giữ nguyên
Qwen3.7-MaxĐóngChỉ qua API. Không có GGUF, không có checkpoint trên Hugging Face
Qwen3.8-MaxĐược hứa mở, chưa phát hành"Tuần tới" tính đến 2026-08-03. Giấy phép chưa công bố

Alibaba đã đóng tầng mô hình chủ lực suốt hai thế hệ liên tiếp, và giờ tuyên bố sẽ mở mô hình lớn nhất mà họ từng xây dựng. Nếu trọng số ra mắt đúng như đã hứa, đây là một cú đảo chiều thực sự, và nó tạo áp lực lên mọi phòng thí nghiệm đang coi "tầng frontier phải đóng" là điều mặc định. Nếu chậm trễ, đây sẽ là bản Max đóng thứ ba liên tiếp. Cả hai kết cục vẫn còn đang bỏ ngỏ tính đến 2026-08-04. Chúng tôi từng thấy cùng động lực này diễn ra với GLM 5.2, nơi mà giấy phép thực sự được phát hành quan trọng hơn nhiều so với bản thân lời tuyên bố.

Bạn Có Thể Tự Chạy Qwen3.8-Max Không? (Vẫn Là Không)

Không, và các thông số kỹ thuật của bản GA càng làm điều đó rõ ràng hơn, chứ không mờ nhạt đi. Với 2,4 nghìn tỷ tham số tổng cộng, đây không phải là mô hình bạn phục vụ trên phần cứng của riêng mình, ngay cả khi trọng số đã được phát hành. DeepSeek-V3.2 với 685B tham số đã được những người từng làm việc này mô tả là một dự án hạ tầng nghiêm túc. Mô hình này lớn hơn gấp nhiều lần.

Vậy một mô hình trọng số mở 2,4T thực sự mang lại điều gì cho bạn?

  • Các nhà cung cấp dịch vụ suy luận (inference) có thể lưu trữ nó, dẫn đến cạnh tranh về giá, từ đó chi phí mỗi token của bạn giảm xuống
  • Các triển khai chủ quyền (sovereign), theo quy định và cách ly hoàn toàn với mạng ngoài (air-gapped) lần đầu tiên trở nên khả thi ở tầng này
  • Các nhà nghiên cứu và người tinh chỉnh (fine-tune) mô hình có được một mô hình nền tảng cấp frontier để làm việc cùng
  • Điều đó không có nghĩa là nó chạy được trên máy của bạn, trên một GPU A100 duy nhất, hay trong ngân sách GPU của startup của bạn

Nếu bạn muốn biết chính xác con số cần thiết để chạy các mô hình trọng số mở lớn, hướng dẫn yêu cầu VRAM cho LLM của chúng tôi tính toán đầy đủ điều đó. Câu trả lời ngắn gọn cho mô hình này: đừng.

Bạn Nên Chuyển Sang, Thử Nghiệm, Hay Chờ Đợi?

Tình huống của bạnĐiều chúng tôi sẽ làm vào 2026-08-04
Đang chạy Qwen3.7-Max trong môi trường productionTrước tiên hãy test 3.8-Max trên lưu lượng câu lệnh ngắn. Đó là nơi chênh lệch chi phí 4x của chúng tôi xuất hiện. Sau đó kiểm tra cách xử lý max_tokens cho trường hợp phản hồi rỗng
Khối lượng công việc ngữ cảnh dài hoặc RAG nặngCứ giữ nguyên hiện tại. 3.8-Max đắt hơn 35.6% mỗi token và khớp chính xác với 3.7-Max trong bài test truy xuất của chúng tôi
Bạn cần đầu vào ảnh hoặc videoĐây chính là lý do để chuyển đổi. 3.7-Max không thể nhận ảnh dưới bất kỳ hình thức nào, và chúng tôi đã xác nhận lỗi 404
Đang chờ trọng số mởĐánh dấu ngày 2026-08-10. Chưa có gì để làm cho đến khi có model card và giấy phép để đọc
Đang hài lòng với Claude hoặc GPTHôm nay chưa có gì thay đổi. Điểm benchmark của Alibaba vẫn chưa được xác minh, và những con số chưa được xác minh không phải là lý do để chuyển đổi

Phương pháp quan trọng hơn kết luận cuối cùng. Mọi mô hình chúng tôi từng test trong môi trường production đều thể hiện khác với vị trí trên bảng xếp hạng, vì câu lệnh của bạn, codebase của bạn và mức độ chịu đựng thử lại của bạn không nằm trong bất kỳ bộ benchmark nào của ai cả. Hai tác vụ lập trình trong lượt chạy của chúng tôi minh họa rõ điều này: cả 3.8-Max và 3.7-Max đều đạt 11 trên 11 ở tác vụ cắt ngắn độ rộng chuỗi, và cả hai đều vượt qua 5,000 trên 5,000 trường hợp fuzz test về tính toán ngày tháng. Về độ chính xác, chúng tôi không thể phân biệt được hai mô hình này. Khoảng cách chúng tôi đo được nằm ở độ trễ và chi phí token trên các câu lệnh dễ, không nằm ở năng lực trên các câu lệnh khó.

Đang cân nhắc chuyển đổi và muốn có thêm một góc nhìn để kiểm tra kỹ mô hình chi phí? Hãy để đội ngũ của chúng tôi kiểm tra áp lực nó trên chính khối lượng công việc của bạn.

Mọi số liệu được xác minh vào 2026-08-04. Giá cả, xếp hạng arena và lịch trình phát hành trọng số thay đổi thường xuyên. Các phép đo của chúng tôi đến từ một tuyến duy nhất (OpenRouter đến Alibaba), một máy duy nhất, một ngày duy nhất, với n=3 cho độ trễ và n=1 cho hầu hết các bài kiểm tra chức năng.

Câu Hỏi Thường Gặp

Qwen3.8-Max có phải mã nguồn mở không?

Không, ít nhất là chưa tính đến 2026-08-04. Nó chỉ khả dụng qua API. Alibaba đã lên lịch phát hành trọng số "tuần tới" trên Hugging Face và ModelScope, nhưng chưa công bố bất kỳ giấy phép nào. Các tiêu đề gọi nó là mã nguồn mở đang đi trước sự thật. Một lượt tìm kiếm trên Hugging Face chỉ trả về các bản chưng cất 4B của bên thứ ba, không phải model card của Alibaba.

Qwen3.8-Max có giá bao nhiêu?

$2.00 cho mỗi triệu token đầu vào và $6.00 cho mỗi triệu token đầu ra, với giá đầu vào được cache báo cáo là $0.25. Đó là mức tăng 35.6% so với Qwen3.7-Max ở cả hai phía. Chúng tôi đo được mức trung vị $0.001592 cho một lệnh gọi ngắn, rẻ hơn khoảng 4x so với 3.7-Max trên cùng câu lệnh, vì nó phát ra ít token suy luận hơn nhiều.

Qwen3.8-Max có bao nhiêu tham số?

Tổng cộng 2,4 nghìn tỷ, theo thông báo của Alibaba và mọi hãng tin đưa tin về nó. Con số tham số hoạt động vẫn còn tranh cãi: SiliconANGLE, The Decoder và Coursiv báo cáo khoảng 95 tỷ tham số hoạt động, trong khi MarkTechPost khẳng định Alibaba chưa tiết lộ con số này. API không hề công khai trường tham số nào, nên chúng tôi không thể xác minh được con số nào.

Qwen3.8-Max có cửa sổ ngữ cảnh bao lớn?

API trực tiếp báo cáo 1,000,000 token ngữ cảnh và 131,072 token hoàn thành tối đa. Chúng tôi đã test khả năng truy xuất lên đến 247,911 token mà không gặp thất bại nào. Chúng tôi chưa chạy một lệnh gọi 1M token, vì một lệnh như vậy sẽ tốn khoảng $2.00 và vượt quá ngân sách test của chúng tôi, nên đỉnh của cửa sổ đó vẫn chưa được chúng tôi xác minh.

Qwen3.8-Max có hỗ trợ đầu vào ảnh và video không?

Có cả hai, và chúng tôi đã xác minh chúng. Nó đọc đúng các chữ số và một màu sắc từ một ảnh PNG được tạo tại chỗ, và mô tả chính xác một video khi được cung cấp URL mà Alibaba tải được. Qwen3.7-Max từ chối thẳng ảnh với lỗi 404. Hai trong ba URL video test của chúng tôi thất bại ngay ở bước tải xuống của nhà cung cấp.

Điểm benchmark của Qwen3.8-Max có được xác minh độc lập không?

Không. Terminal-Bench 2.1 với 86.6, GPQA Diamond với 92.6, PaperBench với 93.0, OSWorld-Verified với 86.1 và DeepSWE 1.1 với 56.6 đều đến từ các lượt chạy nội bộ của Alibaba. Tính đến 2026-08-04, chúng tôi không tìm thấy đánh giá bên thứ ba nào được công bố cho bất kỳ điểm nào trong số đó.

Tôi có thể chạy Qwen3.8-Max cục bộ không?

Thực tế là không, ngay cả khi trọng số đã được phát hành. Với 2,4 nghìn tỷ tham số, nó lớn hơn nhiều lần so với DeepSeek-V3.2, vốn đã là một dự án hạ tầng thực thụ để tự lưu trữ. Hãy chuẩn bị tinh thần sử dụng nó thông qua các nhà cung cấp dịch vụ suy luận thay vì GPU của riêng bạn, trừ khi bạn đang vận hành một trung tâm dữ liệu.

Tôi có nên chuyển từ Qwen3.7-Max sang Qwen3.8-Max không?

Điều đó phụ thuộc vào tỷ lệ token của bạn. Với câu lệnh ngắn, chúng tôi đo được 3.8-Max chỉ tốn khoảng một phần tư chi phí và nhanh hơn bốn đến năm lần. Với khối lượng công việc đầu vào dài, nó lại đắt hơn 35.6% và cho kết quả giống hệt trong bài test truy xuất của chúng tôi. Nếu bạn cần đầu vào ảnh hoặc video, 3.7-Max hoàn toàn không làm được điều đó.

Khi nào trọng số của Qwen3.8-Max sẽ được phát hành?

Alibaba nói "tuần tới" trong thông báo ngày 2026-08-03, nêu đích danh Hugging Face và ModelScope là nơi phát hành. Không có ngày cụ thể, và cũng không có văn bản giấy phép. Một mô hình trọng số mở đi kèm, Qwen3.8-27B, được cho là sẽ phát hành cùng lúc. Chúng tôi dự định kiểm tra lại vào ngày 2026-08-10.

Thẻ

qwen-3-8qwen3-8-maxopen-weight-llmalibaba-qwenllm-tooling

Chia sẻ bài viết này

Bài viết liên quan

Thêm từ chuyên mục ai-machine-learning

ai-machine-learning
Aug 4, 2026

Gitar AI Code Review: Sonar Thực Sự Mua Được Gì (Đánh Giá 2026)

Sonar mua lại Gitar vào ngày 21 tháng 5 năm 2026. Bài đánh giá này nói về việc tính năng autofix được xác thực qua CI của Gitar thực sự làm gì, các gói $20 và $40, nơi nó vượt trội hơn CodeRabbit và Greptile, và những lý do trung thực để bỏ qua nó.

10 phút đọc phút đọc
Đọc
ai-machine-learning
Aug 3, 2026

Best Practices Gọi Tool Cho Agent: Vì Sao Agent Chọn Sai Tool

Agent của bạn chọn sai tool vì lỗi nằm ở bốn điểm cụ thể: lựa chọn, tham số, vòng lặp và kích thước phản hồi. Hướng dẫn này chẩn đoán từng chế độ lỗi trước, rồi ghép tám best practices gọi tool cho agent vào từng lỗi, kèm code, schema và một vòng eval bạn chạy được cho mọi thay đổi.

14 phút đọc phút đọc
Đọc
ai-machine-learning
Aug 3, 2026

RAG vs Fine-Tuning: Khi Nào Dùng Cái Nào? (Kèm Số Liệu Thực Tế)

RAG truy xuất sự kiện tại thời điểm truy vấn; fine-tuning ghi kiến thức vào trọng số mô hình. Một nghiên cứu arXiv được trích dẫn 162 lần đã chạy cả hai trên cùng một bài toán, và kết quả làm hầu hết các team bất ngờ. Đây là khung ra quyết định kèm bài toán chi phí thực tế theo bảng giá công khai.

14 phút đọc phút đọc
Đọc
Xem tất cả bài viết
Khởi động dự án của bạn

Sẵn sàng tạo nên điều gì đó đột phá?

Hãy biến tầm nhìn của bạn thành hiện thực. Đội ngũ của chúng tôi sẵn sàng đồng hành cùng bạn tạo ra phần mềm tạo nên sự khác biệt.

Đặt lịch gọi ý tưởng 30 phútXem dự án của chúng tôi

Công cụ hot trong kho

Claude Skills

Xem tất cả
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Tự động hoá AI

Xem tất cả
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Công cụ hot trong kho

Claude Skills

Xem tất cả
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Tự động hoá AI

Xem tất cả
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Dịch vụ

  • Giải pháp doanh nghiệp
  • Ứng dụng di động
  • Ứng dụng web

Giải pháp

  • Hệ thống CRM
  • Tích hợp AI
  • Giải pháp ERP
  • Voice Agent
  • Tự động hóa quy trình
  • Bảo mật thông tin

Thư viện

  • Blog
  • Dự án

Cộng đồng

  • Tự động hoá AI
  • Claude Skills

Công cụ

  • Tính phí làm ứng dụng mobile
  • Tính phí dùng OpenAI / LLM API
  • Tính phí làm MVP
  • Tính phí làm Voice AI Agent

Công ty

  • Giới thiệu
  • Cộng sự
  • Liên hệ

Pháp lý

  • Chính sách quyền riêng tư
  • Điều khoản dịch vụ
  • Chính sách cookie

Dịch vụ

  • Giải pháp doanh nghiệp
  • Ứng dụng di động
  • Ứng dụng web

Giải pháp

  • Hệ thống CRM
  • Tích hợp AI
  • Giải pháp ERP
  • Voice Agent
  • Tự động hóa quy trình
  • Bảo mật thông tin

Thư viện

  • Blog
  • Dự án

Cộng đồng

  • Tự động hoá AI
  • Claude Skills

Công cụ

  • Tính phí làm ứng dụng mobile
  • Tính phí dùng OpenAI / LLM API
  • Tính phí làm MVP
  • Tính phí làm Voice AI Agent

Công ty

  • Giới thiệu
  • Cộng sự
  • Liên hệ
Pháp lýChính sách quyền riêng tưĐiều khoản dịch vụChính sách cookie
TECHSY
© 2026 Techsy. Bảo lưu mọi quyền.