
Claude Opus 4.8 Đã Ra Mắt: Có Gì Mới, Điểm Mạnh (Và Một Điểm Thua)
Anthropic phát hành Claude Opus 4.8 vào ngày 28 tháng 5, 2026, chỉ 41 ngày sau 4.7. Đây là nhịp ra mắt Opus nhanh nhất mà chúng tôi từng thấy. Con số tiêu đề, 69,2% trên SWE-Bench Pro, là thật, và điểm trừ cũng thật: nó thua một benchmark outright. Đây là những gì đã thay đổi, và liệu bạn nên chuyển mô hình mặc định ngay hôm nay hay chờ.
Điểm chính:
- Claude Opus 4.8 ra mắt ngày 28 tháng 5, 2026, 41 ngày sau 4.7, trên Claude.ai, Claude Code, và API.
- Dẫn đầu 6 trên 7 benchmark của Anthropic nhưng thua Terminal-Bench 2.1 trước GPT-5.5 (74,6% so với 78,2%).
- Giá không đổi ở mức $5/$25 mỗi triệu token; Fast Mode mới chạy nhanh hơn ~2,5 lần với giá $10/$50.
Hôm Nay Có Gì: Claude Opus 4.8 Trong Một Phút
Claude Opus 4.8 là mô hình tiên phong của Anthropic, phát hành ngày 28 tháng 5, 2026, và có sẵn ngay hôm nay trên Claude.ai, Claude Code, và API. Model ID là claude-opus-4-8, với biến thể ngữ cảnh 1M token claude-opus-4-8[1m]. Giá tiêu chuẩn không đổi so với 4.7 ở mức $5/$25 mỗi triệu token. Nhận định ngắn: một bản nâng cấp thực sự cho lập trình và công việc tri thức, với một ngoại lệ trung thực.
Đây là bản phát hành tăng dần, không phải xây lại từ đầu. Nếu bạn đang dùng Claude Opus 4.7, hầu hết những gì bạn đã biết vẫn giữ nguyên: cấu trúc API, khái niệm effort-control, tích hợp Claude Code. Điểm khác biệt là trần benchmark cao hơn, Fast Mode rẻ hơn, và một tính năng research-preview mới cho công việc ở quy mô codebase.
Opus 4.8 ra mắt chỉ 41 ngày sau 4.7, nhịp Opus nhanh nhất mà Anthropic từng phát hành. Biến thể ngữ cảnh 1M token tồn tại dưới dạng claude-opus-4-8[1m], mặc dù trang tài liệu Models-overview công khai có thể vẫn đang cập nhật. Theo thông báo của Anthropic, đây là mô hình "trung thực nhất" của họ cho đến nay, một tuyên bố mà chúng ta sẽ quay lại sau.
Thực Sự Có Gì Mới Ở Opus 4.8 So Với 4.7?
Những thay đổi lớn nhất từ 4.7 lên 4.8 là alignment, hiệu quả gọi tool, và một tính năng orchestration mới. Anthropic cho biết Opus 4.8 ít có khả năng hơn khoảng 4 lần so với 4.7 trong việc bỏ qua lỗi trong chính code của nó mà không đánh dấu, hoàn thành tác vụ agentic với ít bước hơn, và giới thiệu Dynamic Workflows cho các cuộc di cư lớn. Giá và API cốt lõi giữ nguyên.
Trung thực và alignment
Theo thông báo của họ, Opus 4.8 có xu hướng đánh dấu sự không chắc chắn, tránh các tuyên bố không có cơ sở, và chỉ ra vấn đề trong code mà nó vừa viết. Anthropic cho biết tỷ lệ hành vi không đồng nhất "thấp hơn đáng kể so với Opus 4.7," và trích dẫn lời chứng thực từ Bridgewater về việc mô hình chủ động nêu vấn đề. Với bất kỳ ai dựa vào AI để bắt lỗi trong code, con số "ít có khả năng bỏ qua lỗi hơn 4 lần" là dòng đáng chú ý. Hãy coi đó là tuyên bố của nhà cung cấp cho đến khi bạn tự kiểm tra trên pull request của mình.
Effort control và thay đổi Messages API
Mức effort giờ đây có thể chọn trực tiếp trên Claude.ai, để bạn có thể đánh đổi chi phí token lấy độ sâu mà không cần chuyển sang mô hình nhỏ hơn. Cũng có một thay đổi nhỏ nhưng thực sự về trải nghiệm nhà phát triển: Messages API giờ chấp nhận các mục system bên trong mảng messages, không chỉ dưới dạng tham số system cấp cao nhất. Nếu bạn xây agent, điều này giúp quản lý hướng dẫn hệ thống giữa cuộc hội thoại gọn gàng hơn.
Gọi tool hiệu quả hơn
Anthropic mô tả việc gọi tool là "hiệu quả hơn đáng kể, ít bước hơn cho cùng mức thông minh," đo trên CursorBench qua các mức effort. Trên benchmark Super-Agent nội bộ của họ, họ cho biết Opus 4.8 là mô hình duy nhất hoàn thành mọi case từ đầu đến cuối với chi phí ngang bằng GPT-5.5. Ít lần gọi tool hơn mỗi tác vụ là đòn bẩy chi phí trực tiếp cho người xây agent, nên điều này quan trọng hơn vẻ bề ngoài.
Benchmark Opus 4.8: Điểm Mạnh (Và Một Điểm Thua)
Opus 4.8 dẫn đầu 6 trên 7 benchmark của Anthropic, bao gồm SWE-Bench Pro (69,2%) và GDPval-AA (1890 Elo). Ngoại lệ, và điểm cần trung thực: GPT-5.5 vẫn thắng ở lập trình terminal agentic trên Terminal-Bench 2.1, đạt 78,2% so với 74,6% của Opus 4.8. Vậy nếu công việc của bạn nằm trong terminal, mô hình tốt nhất tổng thể không phải mô hình tốt nhất cho bạn.
| Benchmark | Opus 4.8 | Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| Lập trình agentic, SWE-Bench Pro | 69,2% | 64,3% | 58,6% | 54,2% |
| Lập trình terminal agentic, Terminal-Bench 2.1 | 74,6% | 66,1% | 78,2% | 70,3% |
| Suy luận đa ngành, Humanity's Last Exam (không tool) | 49,8% | 46,9% | 41,4% | 44,4% |
| Suy luận đa ngành, Humanity's Last Exam (có tool) | 57,9% | 54,7% | 52,2% | 51,4% |
| Sử dụng máy tính agentic, OSWorld-Verified | 83,4% | 82,8% | 78,7% | 76,2% |
| Công việc tri thức, GDPval-AA (Elo) | 1890 | 1753 | 1769 | 1314 |
| Phân tích tài chính agentic, Finance Agent v2 | 53,9% | 51,5% | 51,8% | 43,0% |

Hãy đọc mức chênh, không chỉ điểm tuyệt đối. SWE-Bench Pro tăng +4,9 điểm (64,3 lên 69,2), mức tăng lập trình tiêu đề. Terminal-Bench 2.1 tăng +8,5 điểm (66,1 lên 74,6), bước nhảy lớn nhất từ 4.7 lên 4.8, nhưng vẫn xếp sau GPT-5.5. GDPval-AA tăng +137 Elo (1753 lên 1890), bước nhảy công việc tri thức lớn cũng vượt GPT-5.5 (1769) với khoảng cách rộng. OSWorld-Verified chỉ tăng +0,6 (82,8 lên 83,4); computer use đã gần trần trên 4.7, nên đừng kỳ vọng khác biệt cảm nhận được ở đó. Finance Agent v2 thêm +2,4 điểm.
Kết luận rõ ràng: Opus 4.8 thắng sáu trên bảy benchmark, và điểm nó thua, lập trình terminal agentic, vẫn thuộc về GPT-5.5. Các con số được xác nhận bởi thông báo của Anthropic và bài tổng hợp benchmark của OfficeChai.
Fast Mode Là Gì, Và Nó Có Rẻ Hơn Không?
Fast Mode chạy Opus 4.8 nhanh hơn khoảng 2,5 lần với giá $10 đầu vào / $50 đầu ra mỗi triệu token, kích hoạt bằng /fast trong Claude Code. Anthropic cho biết nó "rẻ hơn ba lần so với các mô hình trước." Giá tiêu chuẩn giữ ở mức $5/$25 mỗi Mtok, không đổi so với 4.7. Điểm mấu chốt: Fast Mode giữ bạn trên mô hình Opus đầy đủ, không hạ cấp xuống mô hình nhỏ hơn.
Vậy điều đó có nghĩa gì mỗi tác vụ? Bạn trả phí cao gấp 2 lần cho tốc độ khoảng 2,5 lần, trên cùng mức thông minh mô hình. Với các phiên Claude Code tương tác nơi bạn đang chờ đầu ra, sự đánh đổi đó thường tự hoàn vốn. Với các batch job dài nơi thời gian thực không quan trọng, giá tiêu chuẩn là lựa chọn rẻ hơn.
# In a Claude Code session, switch the current task to Fast Mode:
/fast
# Output streams ~2.5x faster on the same claude-opus-4-8 model.
# Standard pricing ($5/$25) resumes on your next normal task.Quyền truy cập API rộng hơn cho Fast Mode được triển khai qua account manager hoặc danh sách chờ. Nếu bạn đã đụng trần rate limit, hướng dẫn của chúng tôi về giới hạn sử dụng Claude giải thích cách các bậc tương tác với chi phí. Một lưu ý trung thực: "rẻ hơn 3 lần so với trước" nghĩa là bản thân Fast Mode đã rẻ hơn so với bậc Fast cũ, không phải rẻ hơn giá Opus tiêu chuẩn. Nó không rẻ hơn.
Dynamic Workflows: Di Cư Quy Mô Codebase Với Subagent Song Song
Dynamic Workflows là tính năng research-preview trên các gói Enterprise, Team, và Max, điều phối "bầy subagent," hàng trăm subagent song song trong một phiên duy nhất. Kết hợp với Claude Code và Opus 4.8, Anthropic cho biết nó có thể chạy di cư quy mô codebase trên hàng trăm nghìn dòng code, từ khởi động đến merge, với tối thiểu can thiệp.
Dynamic Workflows cho phép một phiên Claude Code phân nhánh thành hàng trăm subagent song song để di cư toàn bộ codebase. Hãy nghĩ đến nâng cấp framework, đại tu dependency, hoặc refactor toàn repo mà bình thường sẽ ngốn một tuần của kỹ sư. Nếu bạn đã làm việc với agent lập trình song song trước đây, đây là ý tưởng đó được mở rộng và điều phối bởi mô hình thay vì bởi bạn.
Hai lưu ý trung thực. Thứ nhất, đây là research preview, nên hãy kỳ vọng còn lỗi và đừng chĩa nó vào các cuộc di cư quan trọng trong production mà không review. Thứ hai, nó bị giới hạn theo gói, bạn cần truy cập Enterprise, Team, hoặc Max. TechCrunch mô tả Dynamic Workflows là câu trả lời của Anthropic trước áp lực cạnh tranh từ các phòng lab đối thủ, và nhận định đó hợp lý: đây là tính năng nhà phát triển tiêu đề của bản phát hành này.
Chúng Tôi Chạy Opus 4.8 Trong Claude Code: Đây Là Những Gì Đo Được
Chúng tôi chuyển mô hình mặc định của repo content-pipeline từ claude-opus-4-7 sang claude-opus-4-8 và chạy lại cùng các tác vụ agentic mà chúng tôi dùng hàng ngày. Đây là những gì chúng tôi có thể nói trung thực sau khi sử dụng thực tế sớm, mang tính định tính ở những chỗ chưa có số liệu trước/sau cụ thể, và cụ thể ở những chỗ có.
Đầu tiên, việc chuyển đổi thực sự đơn giản. Đổi model ID sang claude-opus-4-8 và bắt đầu phiên hoạt động mà không cần thay đổi cấu hình nào từ phía chúng tôi. Biến thể ngữ cảnh 1M có thể gọi bằng claude-opus-4-8[1m] nếu bạn cần cửa sổ ngữ cảnh lớn hơn. Chúng tôi xác nhận Fast Mode với /fast giữ bạn trên mô hình Opus đầy đủ thay vì âm thầm định tuyến sang mô hình nhỏ hơn, rẻ hơn, đây là hành vi chúng tôi muốn nhưng không mặc định giả định.
Điều nổi bật khi sử dụng sớm: Opus 4.8 rõ ràng sẵn sàng phản biện hơn. Trong một tác vụ refactor, nó đánh dấu một giả định trong code hiện tại của chúng tôi là rủi ro thay vì lặng lẽ xây tiếp trên đó, đúng kiểu hành vi mà tuyên bố "ít có khả năng bỏ qua lỗi hơn 4 lần" của Anthropic dự đoán. Chúng tôi không định biến nó thành benchmark, đó là một quan sát trên một tác vụ. Nhưng đó là điều đầu tiên chúng tôi nhận thấy, và nó khớp với câu chuyện alignment.
Tốc độ Fast Mode nhanh hơn là thật và rõ ràng trong các phiên tương tác, đầu ra bắt đầu stream nhanh hơn, mặc dù chúng tôi chưa công bố con số độ trễ chính xác cho đến khi chạy một bài test thời gian sạch, lặp lại được. Nếu bạn tự chạy so sánh, phương pháp trung thực là: cùng prompt, cùng trạng thái repo, chế độ tiêu chuẩn rồi /fast, và đo cả thời gian thực lẫn chi phí token theo cả hai cách. Chúng tôi sẽ cập nhật phần này với số liệu cụ thể khi bài test đó hoàn tất.
Có Nên Nâng Cấp Từ 4.7? (Chuyển Ngay / Chờ / Ở Lại)
Việc có nâng cấp hay không phụ thuộc hoàn toàn vào workload của bạn, không phải mô hình nào "thắng" tổng thể. Mức tăng SWE-Bench Pro và GDPval-AA lớn và thực, nên người dùng lập trình và công việc tri thức nên chuyển. Các team nặng terminal có lý do chính đáng để chờ. Người dùng nhạy cảm chi phí trên các tác vụ gần trần có thể ở lại 4.7 mà hầu như không mất gì.
Chuyển ngay nếu: công việc của bạn dựa vào lập trình agentic (SWE-Bench Pro +4,9) hoặc tác vụ tri thức (GDPval-AA +137 Elo). Đây là những mức tăng thực lớn nhất, và trong thử nghiệm của chúng tôi, bước nhảy SWE-Bench thể hiện trên PR thực tế bằng ít lần rẽ sai hơn. Giá không đổi, nên không có hình phạt chi phí khi nâng cấp.
Chờ nếu: workflow của bạn nặng terminal, GPT-5.5 vẫn dẫn Terminal-Bench 2.1 (78,2% so với 74,6%), nên khung "mô hình tốt nhất" chưa áp dụng cho bạn. Cũng chờ nếu bạn đang giữa dự án và việc đổi mô hình sẽ làm mờ đánh giá của bạn.
Ở lại 4.7 nếu: bạn nhạy cảm chi phí và use case của bạn đã gần trần, như computer use, nơi OSWorld-Verified chỉ tăng +0,6. Bạn sẽ trả chi phí chuyển đổi sự chú ý cho một mức chênh mà bạn không cảm nhận được.
Nếu công việc của bạn dựa vào lập trình kiểu SWE-Bench hoặc tác vụ tri thức, 4.8 là bản nâng cấp rõ ràng; nếu nặng terminal, GPT-5.5 có thể vẫn nhỉnh hơn. Để xem bức tranh rộng hơn, hãy xem Opus 4.8 nằm ở đâu trong số agent lập trình AI tốt nhất, và kiểm tra bản phát hành 4.7 nếu bạn muốn bức tranh chênh lệch đầy đủ.
Chuyển Sang Opus 4.8 Trong Claude Code Và API Như Thế Nào?
Việc chuyển đổi gần như chỉ là đổi model ID. Đặt mô hình mặc định thành claude-opus-4-8 (hoặc claude-opus-4-8[1m] cho cửa sổ ngữ cảnh 1M), chọn mức effort nếu client của bạn có, và xong. Nếu bạn xây bằng Messages API, giờ bạn có thể đặt các mục system bên trong mảng messages thay vì chỉ trường system cấp cao nhất.
# Claude Code: set the default model
/model claude-opus-4-8
# API request body (model ID swap):
{
"model": "claude-opus-4-8",
"messages": [
{ "role": "system", "content": "You are a senior engineer." },
{ "role": "user", "content": "Refactor this module." }
]
}Đó là toàn bộ cuộc di cư cho hầu hết các team. Nếu bạn chạy mô hình trên nhiều nhà cung cấp và muốn test 4.8 so với GPT-5.5 hoặc Gemini 3.1 Pro trên tác vụ của riêng bạn, một proxy cho phép bạn định tuyến giữa các mô hình mà không cần viết lại app. Bắt đầu ở chế độ tiêu chuẩn, xác nhận chất lượng đầu ra trên workload thực của bạn, rồi quyết định xem đánh đổi tốc độ lấy giá của Fast Mode có đáng không.
Chúng tôi xây agent AI production trên chính stack này tại Techsy. Nếu bạn đang chọn mô hình cho một bản build agent, nhận tư vấn miễn phí và chúng tôi sẽ giúp bạn chọn đúng mô hình cho workload của bạn.
Về Tác Giả
Mert Batur Gurbuz là Đồng sáng lập của Techsy.io, nơi team phát hành AI agent, hệ thống tự động hóa, và pipeline voice/SDR cho khách hàng B2B. Anh học tại University of Birmingham và viết về stack công cụ LLM mà team Techsy thực sự dùng trong production.
Đồng sáng lập, Techsy.io, University of Birmingham · LinkedIn
Câu Hỏi Thường Gặp
Claude Opus 4.8 là gì?
Claude Opus 4.8 là mô hình tiên phong của Anthropic, phát hành ngày 28 tháng 5, 2026, với model ID claude-opus-4-8 và biến thể ngữ cảnh 1M claude-opus-4-8[1m]. Anthropic định vị nó là mô hình trung thực nhất của họ cho đến nay, dẫn đầu 6 trên 7 benchmark đã công bố và có sẵn trên Claude.ai, Claude Code, và API.
Claude Opus 4.8 ra mắt khi nào?
Claude Opus 4.8 được phát hành vào ngày 28 tháng 5, 2026, chỉ 41 ngày sau Opus 4.7, nhịp Opus nhanh nhất mà Anthropic từng phát hành. Nó lên sóng cùng ngày trên Claude.ai, Claude Code, và Anthropic API, không có triển khai theo giai đoạn, nên bạn có thể chuyển mô hình mặc định ngay lập tức.
Claude Opus 4.8 có tốt hơn Opus 4.7 không?
Với hầu hết công việc, có. Opus 4.8 dẫn SWE-Bench Pro 69,2% so với 64,3%, tăng +137 Elo trên GDPval-AA, và thắng 6 trên 7 benchmark so với 4.7. Ngoại lệ là lập trình terminal agentic, nơi GPT-5.5 vẫn đạt điểm cao hơn cả hai. Giá không đổi, nên không có hình phạt chi phí khi nâng cấp.
Opus 4.8 có đáng nâng cấp từ 4.7 không?
Tùy vào workload của bạn. Chuyển ngay nếu bạn làm lập trình agentic hoặc công việc tri thức, nơi mức tăng lớn nhất. Chờ nếu công việc của bạn nặng terminal, vì GPT-5.5 vẫn dẫn ở đó. Ở lại 4.7 nếu bạn nhạy cảm chi phí trên các tác vụ gần trần như computer use, nơi mức chênh chỉ +0,6 điểm.
Claude Opus 4.8 giá bao nhiêu?
Giá tiêu chuẩn là $5 mỗi triệu token đầu vào và $25 mỗi triệu token đầu ra, giống hệt Opus 4.7, nên không tăng giá. Fast Mode có giá $10/$50 mỗi triệu token và chạy nhanh hơn khoảng 2,5 lần trên cùng mô hình. Anthropic cho biết Fast Mode rẻ hơn ba lần so với bậc Fast-Mode trước.
Fast Mode trong Claude Opus 4.8 là gì?
Fast Mode là bậc tốc độ cao hơn, chạy Opus 4.8 nhanh hơn khoảng 2,5 lần với giá $10 đầu vào / $50 đầu ra mỗi triệu token, kích hoạt bằng /fast trong Claude Code. Quan trọng là nó giữ bạn trên mô hình claude-opus-4-8 đầy đủ thay vì hạ cấp xuống mô hình nhỏ hơn. Anthropic cho biết nó rẻ hơn ba lần so với bậc Fast-Mode trước.
Dynamic workflows trong Claude Code là gì?
Dynamic Workflows là tính năng research-preview trên các gói Enterprise, Team, và Max, điều phối hàng trăm subagent song song trong một phiên duy nhất. Kết hợp với Claude Code và Opus 4.8, nó có thể chạy di cư quy mô codebase trên hàng trăm nghìn dòng code từ khởi động đến merge. Hãy kỳ vọng còn lỗi vì nó vẫn là bản preview.
Opus 4.8 có hỗ trợ cửa sổ ngữ cảnh 1M token không?
Có, qua biến thể claude-opus-4-8[1m]. Bạn gọi nó bằng model ID đó khi cần cửa sổ ngữ cảnh lớn hơn. Lưu ý trang tài liệu Models-overview công khai có thể vẫn đang cập nhật và có thể chưa liệt kê mục 4.8, nhưng biến thể này có thể gọi được tại runtime ngay hôm nay.
Claude Opus 4.8 có thực sự thắng GPT-5.5 ở mọi thứ không?
Không. GPT-5.5 vẫn thắng lập trình terminal agentic trên Terminal-Bench 2.1, đạt 78,2% so với 74,6% của Opus 4.8. Opus 4.8 dẫn sáu benchmark đã công bố còn lại, bao gồm SWE-Bench Pro và GDPval-AA, nhưng nếu workflow của bạn nặng terminal, GPT-5.5 vẫn là lựa chọn mạnh hơn cho tác vụ cụ thể đó.
Chuyển sang Opus 4.8 trong Claude Code như thế nào?
Đặt mô hình thành claude-opus-4-8 (dùng /model claude-opus-4-8 trong Claude Code) và chọn mức effort nếu client của bạn có. Với cửa sổ ngữ cảnh 1M, dùng claude-opus-4-8[1m]. Đây là việc chuyển đổi gần như đơn giản, không cần thay đổi cấu hình nào khác cho hầu hết các team.