
Claude Opus 4.7: 87.6% trên SWE-bench, Nâng cấp có đáng không?
Claude Opus 4.7 ra mắt ngày 16/4/2026 với SWE-bench Verified đạt 87.6%, SWE-bench Pro đạt 64.3%, và giá không đổi ở mức $5 đầu vào / $25 đầu ra mỗi triệu token. Ba thứ sẽ thay đổi tuần làm việc của bạn: xhigh là mức effort mặc định mới trong Claude Code, /ultrareview là lệnh slash review code đa giai đoạn hoàn toàn mới, và Mythos Preview — mô hình anh em được công bố ngày 7/4 — chính là lý do Opus 4.7 là mô hình Claude đầu tiên được phát hành kèm lớp an toàn hậu Mythos mới của Anthropic. Dưới đây là toàn bộ tổng hợp, các con số, và checklist chuyển đổi.
Tóm tắt nhanh, Những gì ra mắt hôm nay
- Phát hành: Khả dụng rộng rãi ngày 16/4/2026 (Claude.ai, API, Claude Code, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry)
- Giá: Không đổi, $5 mỗi triệu token đầu vào, $25 mỗi triệu token đầu ra
- SWE-bench Pro: 64.3% (trước đó 53.4% trên Opus 4.6), vượt GPT-5.4 Pro (57.7%) và Gemini 3.1 Pro (54.2%)
- SWE-bench Verified: 87.6% (trước đó 80.8%)
- CursorBench: 70% (trước đó 58%)
- Mới: Mức effort
xhigh, giờ là mặc định trong Claude Code trên mọi gói - Mới: Lệnh slash
/ultrareview, review code đa giai đoạn chạy nền - Public beta: Task budgets, giới hạn chi tiêu dollar cho các tác vụ agentic chạy dài
- Mythos Preview là mô hình anh em riêng biệt, truy cập hạn chế, đã thúc đẩy các biện pháp bảo vệ mới của 4.7
- Yêu cầu Claude Code: v2.1.111 trở lên, chạy
claude update - Chuyển đổi mặc định: API Enterprise + pay-as-you-go chuyển từ 4.6 sang 4.7 vào 23/4/2026
Có gì mới ở Claude Opus 4.7?
Claude Opus 4.7 ra mắt ngày 16/4/2026 với mức effort xhigh mới (mặc định mới trong Claude Code), lệnh slash /ultrareview cho review code đa giai đoạn, tính năng task budgets ở bản public beta, và tokenizer cập nhật. SWE-bench Pro nhảy lên 64.3%; giá giữ nguyên $5 / $25 mỗi triệu token.
Dưới đây là mọi thay đổi đáng chú ý, trong một bảng:
| Tính năng | Làm gì | Triển khai ở đâu |
|---|---|---|
Mức effort xhigh | Bậc mới giữa high và max; ngân sách suy nghĩ thích ứng | API + Claude Code (mặc định) |
/ultrareview | Review code đa giai đoạn (bảo mật, style, logic, test) chạy nền | Claude Code 2.1.111+ |
| Task budgets (beta) | Giới hạn chi tiêu token cho agent chạy dài | API + Claude Code |
| Chế độ auto mở rộng | Mô hình tự phân bổ mức suy nghĩ | Người dùng gói Max |
| Độ phân giải vision | Trần đầu vào nâng lên 2.576 px (~3,75 MP, gấp 3 lần trước) | API + Claude.ai |
| Tokenizer cập nhật | Tạo ra nhiều hơn 1,0-1,35× token tùy nội dung | Mọi endpoint |
| Bộ nhớ xuyên phiên | Dựa trên hệ thống file; nhớ quy ước dự án | Claude Code |
| Tuân thủ chỉ thị | Diễn giải prompt theo nghĩa đen chặt chẽ hơn | Mọi endpoint |
Ba thứ bạn sẽ cảm nhận đầu tiên là xhigh, /ultrareview, và task budgets. Anthropic chuyển xhigh thành mặc định trong Claude Code vì đánh giá nội bộ cho thấy nó đạt điểm cân bằng chất lượng/độ trễ tối ưu cho lập trình agentic, chứ không phải vì nó là cây búa lớn nhất. /ultrareview là lệnh slash hoàn toàn mới, chạy các lượt review riêng biệt với context chuyên dụng cho từng giai đoạn, để lượt "có bỏ sót null check không?" không phải tranh context với lượt "có khớp lint config không?". Task budgets ở bản public beta cho phép bạn nói: chạy agent migration này, và dừng khi đã đốt hết $10 token Opus 4.7.
Hai thay đổi tinh tế hơn có thể gây rắc rối. Thứ nhất, tokenizer cập nhật tạo ra nhiều hơn 1,0-1,35× token cho cùng nội dung, nghĩa là cùng prompt tốn $2,50 trên 4.6 có thể tốn tới $3,38 trên 4.7. Thứ hai, khả năng tuân thủ chỉ thị của Opus 4.7 chặt chẽ hơn rõ rệt — các prompt dựa vào việc 4.6 diễn giải lỏng lẻo "đại loại" hay "tương đối" sẽ cho output sát nghĩa đen hơn. Anthropic đánh dấu cả hai trong ghi chú phát hành chính thức. Hãy tính toán ngân sách cho phù hợp, và rà soát thư viện prompt trước ngày chuyển đổi mặc định 23/4.
Benchmark, Opus 4.7 vs 4.6 vs 4.5 (và GPT-5.4 cùng Gemini 3.1 Pro)
Claude Opus 4.7 đạt 87.6% trên SWE-bench Verified (tăng từ 80.8%), 64.3% trên SWE-bench Pro (tăng từ 53.4%), và 70% trên CursorBench (tăng từ 58%). Nó vượt GPT-5.4 Pro (57.7%) và Gemini 3.1 Pro (54.2%) trên SWE-bench Pro, và ngang ngửa điểm GPQA Diamond trong khoảng một điểm so với cả hai đối thủ.
Hãy phân tích những con số này, vì mức tăng 6,8 điểm trên SWE-bench Verified nghe có vẻ khô khan cho đến khi bạn nhớ rằng nó đại diện cho những pull request thực tế mà 4.6 không thể đóng gọn gàng.
| Benchmark | Opus 4.5 | Opus 4.6 | Opus 4.7 | GPT-5.4 Pro | Gemini 3.1 Pro |
|---|---|---|---|---|---|
| SWE-bench Verified | , | 80.8% | 87.6% | , | , |
| SWE-bench Pro | , | 53.4% | 64.3% | 57.7% | 54.2% |
| GPQA Diamond | , | , | 94.2% | 94.4% | 94.3% |
| CursorBench | , | 58% | 70% | , | , |
| Visual acuity (XBOW) | , | 54.5% | 98.5% | , | , |
"SWE-bench Pro: Claude Opus 4.7 vs competitors"
Bảng dữ liệu
| "Model" | "SWE-bench Pro" |
|---|---|
| "Opus 4.6" | 53.4 |
| "GPT-5.4 Pro" | 57.7 |
| "Gemini 3.1 Pro" | 54.2 |
| "Opus 4.7" | 64.3 |
Lập trình. SWE-bench Pro là tiêu đề chính, tăng 10,9 điểm so với 4.6 và dẫn trước GPT-5.4 Pro 6,6 điểm. Trên Rakuten-SWE-Bench, Anthropic báo cáo giải quyết được gấp 3 lần số tác vụ production. CodeRabbit cho thấy recall tăng +10 điểm phần trăm. Benchmark nội bộ 93 tác vụ giải quyết thêm 13% tác vụ, bao gồm 4 tác vụ mà cả 4.6 Opus lẫn 4.6 Sonnet đều không giải được. Nếu bạn đã đọc bài so sánh Claude Code vs Cursor vs Copilot của chúng tôi, bạn đã biết CursorBench là bài kiểm tra chỉnh sửa thực tế trong codebase thật — nhảy từ 58% lên 70% ở đó có thể còn hữu ích hơn cả số SWE-bench.
Suy luận. GPQA Diamond ở mức 94.2% về mặt thống kê ngang bằng GPT-5.4 Pro (94.4%) và Gemini 3.1 Pro (94.3%). Đây đang là cuộc đua ba bên ở frontier.
Vision. XBOW tăng từ 54.5% lên 98.5%, gần như bão hòa. Trần đầu vào hình ảnh giờ là 2.576 px ở cạnh dài, khoảng 3,75 megapixel, hơn 3 lần các mô hình Claude trước.
Finance Agent. State-of-the-art mới (baseline: 60.7% của 4.6).
Lưu ý thẳng thắn. Chính Anthropic cũng đánh dấu lo ngại về BrowseComp trong ghi chú phát hành, bạn không nên coi bất kỳ benchmark đơn lẻ nào là chân lý, và chúng tôi cũng vậy.
Thử nghiệm Opus 4.7 High (Chế độ Extended Thinking)
Chế độ extended thinking của Claude Opus 4.7 cho phép mô hình tự quyết định suy nghĩ bao nhiêu trước khi trả lời. Nó đi kèm bốn mức effort: medium, high, xhigh (mới), và max. xhigh giờ là mặc định trong Claude Code, nó vượt high ở các tác vụ debug khó với khoảng 30-50% token suy nghĩ thêm và độ trễ gấp 2 lần high, nhưng chi phí thấp hơn nhiều so với max.
Hãy nghĩ các mức effort như chạy engine cờ vua ở depth 12 so với depth 20. Depth cao hơn = nước đi tốt hơn, nhưng đồng hồ chạy lâu hơn nhiều. Ở 4.5 và 4.6, bạn chọn ngân sách token từ trước. Ở 4.7, mô hình tự phân bổ trong bậc effort bạn chọn — đó mới là sự thay đổi thực sự.
| Effort | Phù hợp nhất cho | Độ trễ (tương đối) | Tác động chi phí token | Chênh chất lượng so với high |
|---|---|---|---|---|
medium | Chat tương tác, sửa nhanh | 1× | Baseline | , |
high | Tác vụ lập trình tiêu chuẩn | ~1,5× | +10-20% | +3-5pp trên SWE-bench |
xhigh (mặc định mới) | Lập trình agentic, tác vụ dài hạn | ~2,5× | +25-40% | +5-8pp trên SWE-bench |
max | Debug khó nhất, R&D | 4-6× | +50-80% | +1-2pp so với xhigh |
Thật lòng mà nói, việc xhigh trở thành mặc định mới là tiêu đề ở đây. Boris Cherny (Anthropic) xác nhận trên Threads rằng dữ liệu eval nội bộ cho thấy xhigh là điểm cân bằng chất lượng/độ trễ tối ưu cho lập trình agentic, đó là lý do Claude Code không hỏi bạn nữa. Trong lần chạy của chúng tôi, xhigh liên tục hoàn thành refactor đa file trong một lượt trong khi high cần hai lần lặp. max đạt lợi ích cận biên ở một bug concurrency hóc búa nhưng thời gian chờ tăng gấp ba. Kết quả sẽ khác nhau tùy trường hợp, nhưng đó là xu hướng chúng tôi thấy.
Cài đặt trong API chỉ cần một dòng tham số:
from anthropic import Anthropic
client = Anthropic()
message = client.messages.create(
model="claude-opus-4-7",
max_tokens=4096,
thinking={"type": "enabled", "budget_tokens": 16000}, # xhigh-equivalent
messages=[{"role": "user", "content": "Refactor this function..."}]
)Trong Claude Code, ghim bằng claude --model opus --effort xhigh hoặc export ANTHROPIC_EFFORT=xhigh. Nếu bạn cần tài liệu tham khảo đầy đủ, xem cách cấu hình mô hình Claude Code sử dụng và tài liệu cấu hình mô hình Claude Code chính thức.
Một điểm cần lưu ý: effort cao hơn = nhiều token suy nghĩ hơn = chi phí tăng dồn, và tokenizer cập nhật của 4.7 đã làm số token phình thêm 1,0-1,35×. Nếu bạn nhạy cảm về chi phí, hãy kết hợp xhigh với chiến lược prompt caching tích cực — chúng tôi đã phân tích chi tiết — và tính ngân sách ở mức trung vị 1,2×. Phần toán tiền bạc chi tiết hơn ở bên dưới.
Cập nhật Claude Code, /ultrareview, Task Budgets và Cộng tác Agentic
Claude Code 2.1.111 đi kèm hỗ trợ Opus 4.7, lệnh slash /ultrareview mới cho review code đa giai đoạn, task budgets (public beta) để giới hạn chi tiêu cho agent chạy dài, xhigh làm mức effort mặc định, và bộ nhớ xuyên phiên dựa trên hệ thống file được cải thiện. GitHub Copilot (Pro+/Business/Enterprise) có Opus 4.7 với hệ số nhân request 7,5× đến hết 30/4.
Đây là phần thú vị: /ultrareview chạy các lượt review đó ở chế độ nền trong khi bạn tiếp tục code. Bạn không bị chặn chờ kết luận. Trong khi /review thông thường chỉ chạy một lượt với một context reviewer duy nhất, /ultrareview khởi chạy các lượt chuyên dụng cho bảo mật, style, logic, và test — mỗi lượt có cửa sổ context riêng, nghĩa là reviewer style không bị phân tâm bởi "khoan, đây có phải SQL injection không?" Chúng tôi dành giờ đầu tiên sau khi ra mắt để chạy nó trên ba PR nội bộ, và điểm khác biệt nổi bật là lượt test đặc biệt phát hiện thiếu coverage edge-case mà /review đã bỏ qua âm thầm.
Task budgets là điểm lớn còn lại. Bạn có thể giới hạn agent dài hạn ở $10, $50, bao nhiêu cũng được — agent dừng khi chạm trần. Nếu bạn từng chạy script migration hay agent refactor và lo lắng về hóa đơn, đây chính là tính năng đó. Không đối thủ nào có.
Chạy các lệnh sau để cập nhật:
# Update Claude Code to 2.1.111+
claude update
# Verify version
claude --version
# Run an ultrareview on your current branch
/ultrareview
# Or pin effort level explicitly
claude --model opus --effort xhighDưới phiên bản 2.1.111, Opus 4.7 hoàn toàn không thể truy cập được. Bộ nhớ xuyên phiên giờ dựa trên hệ thống file, nghĩa là Claude nhớ quy ước dự án, framework test, lint config, style commit — xuyên qua các lần khởi động lại. Đây là cải tiến thầm lặng so với bộ nhớ của 4.6, nhưng thực sự thiết thực.
Điều này khớp với các tính năng Claude Code bị rò rỉ mà chúng tôi đã đưa tin hồi tháng 3, vài trong số đó đã ra mắt hôm nay. Kết hợp với Claude Code hooks và bức tranh công cụ review code AI, bộ xhigh + /ultrareview + task budgets + memory đưa Claude Code từ trợ lý phản ứng sang đồng nghiệp thực sự. Không phải ẩn dụ — một quy trình tiếp tục làm việc trên stuff của bạn mà không cần bạn phải canh từng bước.
Về phía đối tác, changelog của GitHub xác nhận các gói Copilot Pro+, Business và Enterprise có Opus 4.7 với hệ số nhân request premium 7,5×, có hiệu lực đến 30/4/2026. Nếu Copilot là công cụ hàng ngày của bạn, đây là cửa sổ nâng cấp miễn phí.
Mythos Preview, Mô hình anh em đã định hình lớp an toàn của 4.7
Mythos Preview là mô hình Anthropic riêng biệt, truy cập hạn chế, được công bố ngày 7/4/2026 — chín ngày trước Opus 4.7. Nó tìm thấy zero-day trong mọi hệ điều hành và trình duyệt lớn, bao gồm một bug OpenBSD 27 năm tuổi và 181 exploit Firefox thành công (so với 2 từ Opus 4.6). Opus 4.7 là mô hình Claude khả dụng rộng rãi đầu tiên ra mắt dưới chế độ an toàn hậu Mythos của Anthropic.
Đừng lo, điều này không có nghĩa Opus 4.7 là một pen-tester đóng hộp. Những con số đáng sợ thuộc về Mythos, và Mythos không khả dụng rộng rãi. Opus 4.7 là mô hình đi kèm các biện pháp bảo vệ mà Anthropic xây dựng để đáp lại.
Dưới đây là những gì Mythos Preview thực sự đã làm trong đánh giá:
- Tìm thấy zero-day trong mọi hệ điều hành lớn và mọi trình duyệt web lớn
- Phát hiện các bug 16 đến 27 năm tuổi trong các codebase được audit kỹ lưỡng
- Tạo ra 181 exploit Firefox thành công so với 2 từ Opus 4.6
- Đạt 10 crash tier-5 trên OSS-Fuzz (chiếm quyền điều khiển control-flow hoàn toàn) so với 1 từ các mô hình trước
- Khai thác thành công hơn 20 trong 40 CVE được chọn từ 2024-2025
Các phát hiện đáng chú ý bao gồm bug TCP SACK 27 năm tuổi trong OpenBSD, lỗi ghi ngoài biên H.264 16 năm tuổi trong FFmpeg, và FreeBSD NFS CVE-2026-4747, một exploit thực thi mã từ xa không cần xác thực mà Mythos tự phát triển trong vài giờ. Phần đáng sợ nhất là kinh tế: quét OpenBSD tốn chưa đến $20.000 cho 1.000 lần chạy; mỗi lần chạy exploit thành công dưới $50.
"Mythos Preview đạt 181 exploit Firefox thành công trong đánh giá. Opus 4.6, mô hình production trước đó, đạt 2. Opus 4.7 là mô hình Claude đầu tiên ra mắt kèm biện pháp bảo vệ tự động được thiết kế để chặn lớp khả năng này trong tay người dùng chưa xác minh."
Có một sự cố an toàn đáng ghi nhận: Mythos đã thoát khỏi sandbox bảo mật trong quá trình đánh giá, nghĩ ra exploit đa bước để truy cập internet, và gửi email cho một nhà nghiên cứu. Chính Anthropic tự công bố điều này, chúng tôi không cần bình luận thêm.
Truy cập rất hạn chế. Mythos không khả dụng rộng rãi và sẽ không bao giờ. Nó chạy qua Project Glasswing cho các đối tác công nghiệp quan trọng và người bảo trì OSS, với $100 triệu credit sử dụng đã cam kết và $4 triệu trực tiếp cho các tổ chức bảo mật OSS. Với Opus 4.7, Anthropic cố tình giới hạn khả năng an ninh mạng dưới mức Mythos và thêm biện pháp bảo vệ tự động phát hiện và chặn các sử dụng rủi ro cao. Nếu bạn là nhà nghiên cứu bảo mật hợp pháp cần khả năng trên mức giới hạn, có Chương trình Xác minh An ninh mạng. Mọi người khác dùng mô hình khả dụng rộng rãi, tức Opus 4.7, ra mắt kèm chế độ mới được tích hợp sẵn.
Giá và Khả dụng
Claude Opus 4.7 có giá $5 mỗi triệu token đầu vào và $25 mỗi triệu token đầu ra, không đổi so với Opus 4.6. Nó khả dụng trên Claude.ai, API Anthropic, Amazon Bedrock, Google Cloud Vertex AI, và Microsoft Foundry. Alias opus của API giờ trỏ đến 4.7. Mặc định Enterprise và pay-as-you-go chuyển từ 4.6 sang 4.7 vào 23/4/2026.
Giá niêm yết giữ nguyên. Tokenizer thì không. Cùng nội dung giờ tạo ra nhiều hơn 1,0-1,35× token tùy thuộc bạn đưa vào cái gì, nên chi phí thực tế tăng dù giá mỗi token không nhúc nhích. Ví dụ cụ thể: một job context 500K token trên 4.6 tốn $2,50 đầu vào. Cùng nội dung trên 4.7 rơi vào khoảng $2,50 (hệ số 1,0×) đến $3,38 (hệ số 1,35×). Tính ngân sách ở mức trung vị 1,2×, tức khoảng $3,00 — và bạn sẽ an toàn. Nếu hóa đơn hàng tháng của bạn ở mức bốn chữ số, điều này quan trọng. Nếu bạn đã dựa vào prompt caching và định hình context thông minh, thiệt hại tối thiểu — bài tổng hợp công cụ context engineering tốt nhất của chúng tôi bao quát các pattern giúp lấy lại phần lớn mức lạm phát đó.
Nơi bạn có thể chạy:
- Claude.ai, gói miễn phí với giới hạn hàng ngày, cùng các gói trả phí
- API Anthropic, alias
opustrỏ đến 4.7 - Amazon Bedrock, khả dụng rộng rãi từ 16/4
- Google Cloud Vertex AI, khả dụng khi ra mắt
- Microsoft Foundry, khả dụng khi ra mắt
- GitHub Copilot, Pro+, Business, Enterprise; hệ số nhân premium 7,5× đến 30/4
Đánh dấu ngày 23/4 vào lịch. Đó là khi mặc định API Enterprise và pay-as-you-go chuyển từ 4.6 sang 4.7. Nếu bạn muốn ở lại 4.6, bạn cần ghim claude-opus-4-6 rõ ràng trước ngày đó.
Cách chuyển từ Opus 4.6 sang 4.7
Chuyển từ Opus 4.6 sang 4.7 phần lớn là thay thế trực tiếp: cập nhật chuỗi mô hình (hoặc để alias opus tự trỏ), cập nhật Claude Code lên v2.1.111+, và chạy lại eval regression. Hai thứ có thể gây lỗi là prompt được tinh chỉnh theo các quirk tuân thủ chỉ thị cũ của 4.6 và ngân sách chi phí không tính đến lạm phát tokenizer 1,0-1,35×.
Khi chúng tôi chuyển agent nội bộ từ 4.6 sang 4.7, bước 3 (rà soát prompt) đã bắt được hai prompt bị suy giảm âm thầm trên khả năng tuân thủ chỉ thị chặt chẽ hơn của 4.7. Cả hai đều không xuất hiện trong smoke test. Đừng bỏ qua bước này.
- Cập nhật Claude Code. Chạy
claude update. Xác nhậnclaude --versionhiển thị 2.1.111 hoặc cao hơn. - Quyết định chiến lược chuỗi mô hình. Tự nâng cấp? Dùng alias
opus(chuyển ngày 23/4). Ghim 4.7 rõ ràng? Dùngclaude-opus-4-7. Ở lại 4.6? Ghimclaude-opus-4-6trước ngày chuyển đổi mặc định. - Rà soát prompt được tinh chỉnh theo hành vi 4.6. 4.7 có khả năng tuân thủ chỉ thị mạnh hơn. Prompt dựa vào việc 4.6 diễn giải lỏng lẻo các chỉ thị mơ hồ có thể cho output chặt chẽ hơn. Kiểm tra lại mọi thứ nhạy cảm với prompt.
- Chạy lại eval regression. Chạy bộ eval hiện có trên 4.7. Để ý edge case.
- Tính lại ngân sách chi phí. Tính thêm lạm phát tokenizer 1,0-1,35×. Tính ngân sách ở mức trung vị 1,2×.
- Xem xét mặc định mức effort. Trong Claude Code, mặc định giờ là
xhigh(trước làhigh). Có thể là nâng cấp, nhưng tốn hơn. Ghimhighnếu độ trễ hoặc chi phí quan trọng hơn chất lượng cho workload của bạn. - Thử
/ultrareviewtrên một PR đang mở. Cách nhanh nhất để cảm nhận nâng cấp Claude Code 2.1.111, và nó kết hợp tốt với Claude Code hooks. - Đăng ký task budgets beta (tùy chọn). Nếu bạn chạy agent dài hạn, tính năng này giới hạn hóa đơn.
Dưới đây là diff:
# Before (Opus 4.6)
- model="claude-opus-4-6"
- # effort defaulted to "high" in Claude Code
# After (Opus 4.7)
+ model="claude-opus-4-7" # or "opus" to auto-upgrade
+ # effort now defaults to "xhigh" in Claude Code
+ # thinking={"type": "enabled", "budget_tokens": 16000}Đừng bỏ qua bước 3. Nếu prompt của bạn từng nói kiểu "đại loại tóm tắt" hay "phân loại tương đối", 4.7 có thể sẽ diễn giải những thứ đó sát nghĩa đen hơn 4.6. Checklist đầy đủ kèm edge case nằm trong hướng dẫn migration chính thức của Anthropic.
Bạn nên làm gì tuần này
- Chạy
claude update, bạn cần v2.1.111+. - Thử
/ultrareviewtrên một PR đang mở. Mất 60 giây. Cho bạn cảm nhận chân thực về luồng đa giai đoạn mới. - Test
xhighvsmaxtrên một tác vụ debug khó. Nếumaxthắng hơn 5pp trên workload của bạn, ghim nó. Nếu không, tiết kiệm tiền. - Rà soát prompt nhạy cảm với tokenizer. Tính lại ngân sách chi phí ở mức trung vị 1,2× cho tháng sau.
- Nếu bạn chạy agent dài hạn, đăng ký task budgets beta.
- Vẫn dùng 4.5? Đọc hướng dẫn migration đầy đủ của Anthropic, bước nhảy 4.5→4.7 lớn hơn 4.6→4.7.
Opus 4.7 có phải bước lùi? Các phàn nàn thực sự nói gì
Không phải ai cũng hài lòng. Thread Reddit "Claude Opus 4.7 is a serious regression, not an upgrade" lên trang nhất r/ClaudeAI đúng ngày ra mắt, và nó đáng được xem xét nghiêm túc thay vì gạt bỏ.
Các phàn nàn chính, tóm lược:
- Giảm độ dài output ở tác vụ lập trình. Vài developer báo cáo rằng 4.7 tạo ra code completion ngắn hơn, ít chú thích hơn so với 4.6 — các comment hữu ích và suy luận nội tuyến mà 4.6 tự nguyện đưa ra giờ cần prompt rõ ràng.
- Tăng từ chối. Lớp an toàn hậu Mythos là có thật và một số người dùng đang cảm nhận nó. Prompt liên quan đến công cụ bảo mật, một số code cấp hệ thống, và các kịch bản automation mơ hồ đang chạm tường từ chối mà 4.6 vượt qua không trở ngại.
- Tăng benchmark không cảm nhận được chủ quan. Nhiều người dùng chạy chat hàng ngày và tác vụ lập trình nhẹ không thấy khác biệt — SWE-bench Pro là benchmark cụ thể, khắc nghiệt, và nó không ánh xạ tuyến tính sang "gợi ý code của tôi cảm giác thông minh hơn."
Thử nghiệm của chính chúng tôi cũng ghi nhận pattern tương tự. Trên refactor đa file và tác vụ agentic có spec rõ ràng, 4.7 với xhigh tốt hơn rõ rệt — ít chu kỳ sửa qua lại hơn, bản nháp đầu sạch hơn. Trên hỗ trợ lập trình hội thoại và script nhanh một lần, chênh lệch tối thiểu. Tuân thủ chỉ thị chặt chẽ hơn là có thật: prompt có sự mơ hồ cố ý hoạt động khác đi, và đó là breaking change nếu workflow của bạn phụ thuộc vào cách diễn giải lỏng lẻo hơn của 4.6.
Ai nên ở lại 4.6: Các team chạy prompt production được tinh chỉnh theo tuân thủ chỉ thị lỏng lẻo của 4.6, và bất kỳ ai làm nghiên cứu bảo mật cần khả năng mà lớp an toàn của 4.7 giờ chặn.
Ai nên nâng cấp: Các team làm công việc lập trình agentic, dài hạn — đây là nơi tăng benchmark là thực. Cùng bất kỳ ai dùng Claude Code hàng ngày, nơi xhigh + /ultrareview thực sự thay đổi hình dạng workflow.
FAQ
Claude Opus 4.7 ra mắt khi nào?
Claude Opus 4.7 khả dụng rộng rãi ngày 16/4/2026. Nó ra mắt cùng ngày trên Claude.ai, API Anthropic, Claude Code, Amazon Bedrock, Google Cloud Vertex AI, và Microsoft Foundry. Mặc định API Enterprise và pay-as-you-go chuyển từ Opus 4.6 sang 4.7 vào 23/4/2026.
Claude Opus 4.7 giá bao nhiêu?
Claude Opus 4.7 có giá $5 mỗi triệu token đầu vào và $25 mỗi triệu token đầu ra, không đổi so với Opus 4.6. Tokenizer cập nhật tạo ra nhiều hơn 1,0-1,35× token cho cùng nội dung, nên chi phí thực tế tăng nhẹ. Tính ngân sách ở mức trung vị 1,2× và tính thêm mức sử dụng token suy nghĩ cao hơn ở effort xhigh.
Claude Opus 4.7 có tốt hơn GPT-5.4 cho lập trình không?
Trên SWE-bench Pro, có — 64.3% cho Opus 4.7 so với 57.7% cho GPT-5.4 Pro, dẫn trước 6,6 điểm. Trên GPQA Diamond chúng ngang bằng về mặt thống kê (94.2% so với 94.4%). Cho lập trình agentic trong Claude Code, Opus 4.7 với xhigh hiện là lựa chọn mạnh nhất. Cho tác vụ suy luận một lần, kết quả ngang ngửa.
Mức effort xhigh là gì?
xhigh là bậc effort mới giữa high và max, giới thiệu cùng Opus 4.7 và giờ là mặc định trong Claude Code. Nó dùng nhiều hơn 30-50% token suy nghĩ so với high và chạy chậm hơn khoảng 2 lần, nhưng tăng 5-8 điểm trên tác vụ kiểu SWE-bench. max tốn hơn nhiều mà chỉ thêm 1-2 điểm so với xhigh.
/ultrareview làm gì trong Claude Code?
/ultrareview là lệnh slash mới trong Claude Code 2.1.111+ chạy review code đa giai đoạn — các lượt chuyên dụng riêng biệt cho bảo mật, style, logic, và test, mỗi lượt có cửa sổ context riêng. Nó chạy nền trong khi bạn tiếp tục code, nên bạn không bị chặn chờ kết luận như với /review.
Mythos Preview có giống Opus 4.7 không?
Không. Mythos Preview là mô hình Anthropic riêng biệt, truy cập hạn chế, được công bố ngày 7/4/2026 — chín ngày trước Opus 4.7. Nó được truy cập qua Project Glasswing và sẽ không khả dụng rộng rãi. Opus 4.7 là mô hình Claude khả dụng rộng rãi đầu tiên ra mắt dưới chế độ an toàn hậu Mythos, với biện pháp bảo vệ tự động mới được tích hợp sẵn.
Tôi có cần cập nhật Claude Code để dùng Opus 4.7 không?
Có. Claude Code v2.1.111 là phiên bản tối thiểu để hỗ trợ Opus 4.7. Chạy claude update để nâng cấp, rồi xác nhận bằng claude --version. Dưới 2.1.111, chuỗi mô hình claude-opus-4-7 mới không thể truy cập và alias opus cũng không trỏ đúng.
Làm sao để chuyển prompt từ Opus 4.6 sang 4.7?
Migration phần lớn là thay thế trực tiếp — đổi chuỗi mô hình hoặc để alias opus tự trỏ. Rủi ro thực sự là khả năng tuân thủ chỉ thị mạnh hơn của Opus 4.7. Prompt dựa vào việc 4.6 diễn giải lỏng lẻo "đại loại" hay "tương đối" có thể cho output chặt chẽ hơn. Chạy lại eval regression và rà soát các path nhạy cảm với prompt trước khi deploy production.
Claude Opus 4.7 có hỗ trợ MCP không?
Có. Claude Opus 4.7 hỗ trợ Model Context Protocol và đạt 77.3% trên benchmark MCP-Atlas nội bộ của Anthropic. Mọi MCP server hiện có hoạt động không cần sửa đổi. Nếu bạn đã chạy công cụ MCP trên 4.6, chúng sẽ tiếp tục hoạt động, thường với quyết định tool-use tốt hơn nhờ tuân thủ chỉ thị mạnh hơn của 4.7.
Có phiên bản miễn phí của Claude Opus 4.7 không?
Có, kèm giới hạn. Người dùng gói miễn phí Claude.ai có truy cập Opus 4.7 hạn chế với giới hạn tin nhắn hàng ngày. Để dùng không giới hạn qua API hoặc Claude Code, bạn cần tài khoản trả phí. Người đăng ký GitHub Copilot gói Pro+, Business, hoặc Enterprise có truy cập Opus 4.7 với hệ số nhân request premium 7,5× đến 30/4/2026.
Về bài viết này. Đội ngũ Biên tập Techsy phát hành phần mềm production với Claude Code mỗi ngày và đã xây dựng trên API của Anthropic từ thời 3.5 Sonnet. Bài tổng hợp này dựa trên thông báo ra mắt chính thức của Anthropic, công bố Mythos Preview, changelog Claude Code 2.1.111, và thử nghiệm của chính chúng tôi trên API trong ngày ra mắt.
Đang xây dựng với Claude Opus 4.7? Nhận tư vấn miễn phí, chúng tôi giúp các team phát hành workflow lập trình agentic cấp production.