
Claude Opus 4.8 登場:變了什麼、哪裡變強(以及唯一落敗的一項)
Anthropic 於 2026 年 5 月 28 日推出 Claude Opus 4.8,距離 4.7 僅 41 天。這是我們見過最快的 Opus 更新節奏。 headline 數字——SWE-Bench Pro 的 69.2%——是真實的,但代價也真實存在:它在一項基準測試中徹底落敗。以下是實際變化,以及你該今天就切換預設模型,還是再等等。
重點整理:
- Claude Opus 4.8 於 2026 年 5 月 28 日推出,距 4.7 僅 41 天,已登陸 Claude.ai、Claude Code 與 API。
- 它在 Anthropic 的 7 項基準測試中領先 6 項,但在 Terminal-Bench 2.1 輸給 GPT-5.5(74.6% 對 78.2%)。
- 定價維持不變,每百萬 token 為 $5/$25;全新的 Fast Mode 速度快約 2.5 倍,定價 $10/$50。
今天发布了什麼:一分鐘認識 Claude Opus 4.8
Claude Opus 4.8 是 Anthropic 的旗艦模型,於 2026 年 5 月 28 日發布,今天即可在 Claude.ai、Claude Code 與 API 上使用。模型 ID 為 claude-opus-4-8,另有 100 萬 token 上下文版本 claude-opus-4-8[1m]。標準定價與 4.7 相同,維持每百萬 token $5/$25。簡短結論:對程式設計與知識工作而言是實質升級,只有一個誠實的例外。
這是一次增量式發布,而非從零重建。如果你從 Claude Opus 4.7 過來,你已熟悉的大部分都沿用:API 結構、effort-control 概念、Claude Code 整合。不同的是基準測試的上限、更便宜的 Fast Mode,以及一項針對程式碼庫規模工作的全新研究預覽功能。
Opus 4.8 距離 4.7 僅 41 天,是 Anthropic 歷來最快的 Opus 更新節奏。100 萬 token 上下文版本以 claude-opus-4-8[1m] 存在,不過公開的 Models-overview 文件頁面可能還在更新中。根據 Anthropic 的公告,這是他們迄今「最誠實」的模型——這個說法我們稍後會再談。
Opus 4.8 相較 4.7 到底新在哪裡?
4.7 到 4.8 最大的變化在於對齊、工具呼叫效率,以及一項全新的協同編排功能。Anthropic 表示,Opus 4.8 放過自身程式碼缺陷而不標記的機率約為 4.7 的 四分之一,能以更少步驟完成代理式任務,並引入用於大規模遷移的 Dynamic Workflows。定價與核心 API 維持不變。
誠實度與對齊
根據其公告,Opus 4.8 更願意標記不確定性、避免無根據的宣稱,並指出它剛寫出的程式碼中的問題。Anthropic 表示不對齊行為的發生率「大幅低於 Opus 4.7」,並引用 Bridgewater 的客戶見證,提到該模型會主動提出問題。對任何依賴 AI 來發現程式碼缺陷的人而言,「放過缺陷的機率降低 4 倍」這個數字最值得關注。在你用自己的 pull request 測試之前,先把它視為廠商的宣稱。
Effort control 與 Messages API 的變更
Effort 等級現在可直接在 Claude.ai 上由使用者選擇,讓你無須降級到較小的模型,就能以 token 花費換取深度。此外還有一項小但實際的開發者體驗變更:Messages API 現在接受在 messages 陣列內放入 system 項目,而不僅限於頂層的 system 參數。如果你在建置代理,這會讓對話中的 system 指令更易管理。
更有效率的工具呼叫
Anthropic 將工具呼叫描述為「明顯更有效率——同樣的智慧,更少的步驟」,這是在 CursorBench 上跨各 effort 等級測得的結果。在他們內部的 Super-Agent 基準測試中,他們表示 Opus 4.8 是唯一能在與 GPT-5.5 成本相當的情況下,端到端完成所有案例的模型。每個任務更少的工具呼叫,對代理開發者而言是直接的コスト槓桿,所以這件事比聽起來更重要。
Opus 4.8 基準測試:哪裡獲勝(以及唯一落敗的一項)
Opus 4.8 在 7 項中的 6 項 Anthropic 基準測試中領先,包括 SWE-Bench Pro(69.2%)與 GDPval-AA(1890 Elo)。唯一的例外,也是必須誠實面對的一項:GPT-5.5 仍在 Terminal-Bench 2.1 的代理式終端程式設計中勝出,以 78.2% 擊敗 Opus 4.8 的 74.6%。所以如果你的工作都在終端機裡,整體最佳的模型對你而言並非最佳。
| 基準測試 | Opus 4.8 | Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| 代理式程式設計,SWE-Bench Pro | 69.2% | 64.3% | 58.6% | 54.2% |
| 代理式終端程式設計,Terminal-Bench 2.1 | 74.6% | 66.1% | 78.2% | 70.3% |
| 多學科推理,Humanity's Last Exam(無工具) | 49.8% | 46.9% | 41.4% | 44.4% |
| 多學科推理,Humanity's Last Exam(有工具) | 57.9% | 54.7% | 52.2% | 51.4% |
| 代理式電腦操作,OSWorld-Verified | 83.4% | 82.8% | 78.7% | 76.2% |
| 知識工作,GDPval-AA(Elo) | 1890 | 1753 | 1769 | 1314 |
| 代理式財務分析,Finance Agent v2 | 53.9% | 51.5% | 51.8% | 43.0% |

要看差距,而不只是絕對分數。SWE-Bench Pro 躍升 +4.9 分(64.3 到 69.2),是 headline 級的程式設計增益。Terminal-Bench 2.1 上升 +8.5 分(66.1 到 74.6),是 4.7 到 4.8 之間最大的單項躍升,卻仍然落後 GPT-5.5。GDPval-AA 增加 +137 Elo(1753 到 1890),是知識工作上的大幅躍升,也以明顯差距超越 GPT-5.5(1769)。OSWorld-Verified 僅移動 +0.6(82.8 到 83.4);電腦操作在 4.7 上已接近上限,所以別期待在那裡感受到差異。Finance Agent v2 增加 +2.4 分。
結論很乾淨:Opus 4.8 贏得七項基準中的六項,而它輸掉的那一項——代理式終端程式設計——仍由 GPT-5.5 拿下。這些數字經 Anthropic 公告與 OfficeChai 基準測試匯整證實。
Fast Mode 是什麼,比較便宜嗎?
Fast Mode 讓 Opus 4.8 以每百萬 token $10 輸入 / $50 輸出的價格,跑出約 2.5 倍的速度,在 Claude Code 中以 /fast 啟用。Anthropic 表示它「比先前模型便宜三倍」。標準定價維持每百萬 token $5/$25,與 4.7 相同。關鍵重點:Fast Mode 讓你留在完整的 Opus 模型上,不會把你降級到較小的模型。
那麼這對每個任務代表什麼?你以 2 倍的價格溢價,換取約 2.5 倍的速度,模型智慧相同。對需要等待輸出的互動式 Claude Code 工作階段而言,這筆交易往往划算。對實際耗時無關緊要的長時間批次作業而言,標準定價是較便宜的選擇。
# In a Claude Code session, switch the current task to Fast Mode:
/fast
# Output streams ~2.5x faster on the same claude-opus-4-8 model.
# Standard pricing ($5/$25) resumes on your next normal task.Fast Mode 更廣泛的 API 存取會透過你的客戶經理或候補名單推出。如果你已經碰到速率上限,我們的 Claude 用量限制指南說明了各方案等級如何與成本交互作用。一個誠實的提醒:「比之前便宜 3 倍」指的是 Fast Mode 本身相較於舊的 Fast 方案變便宜了,而不是說它比標準 Opus 定價便宜。它並沒有。
Dynamic Workflows:以平行子代理進行程式碼庫規模的遷移
Dynamic Workflows 是 Enterprise、Team 與 Max 方案上的研究預覽功能,可協調「子代理群」——單一工作階段中數百個平行子代理。搭配 Claude Code 與 Opus 4.8,Anthropic 表示它能跨數十萬行程式碼執行程式碼庫規模的遷移,從啟動一路到合併,幾乎無須人工看管。
Dynamic Workflows 讓單一 Claude Code 工作階段能展開為數百個平行子代理,遷移整個程式碼庫。想像框架升級、依賴全面翻新,或通常會吃掉工程師一整週的全倉庫重構。如果你用過平行程式設計代理,這就是那個概念的規模化版本,而且由模型而非你來協同編排。
兩個誠實的提醒。第一,它是研究預覽,所以要有碰到毛邊的預期,未經審查別把它指向關鍵生產環境的遷移。第二,它有方案限制——你需要 Enterprise、Team 或 Max 存取權。TechCrunch 將 Dynamic Workflows 描述為 Anthropic 對競爭實驗室壓力的回應,這個解讀合理:它是本次發布的 headline 開發者功能。
我們在 Claude Code 實測 Opus 4.8:以下是我們測到的結果
我們將內容產線倉庫的預設模型從 claude-opus-4-7 切換為 claude-opus-4-8,並重新執行我們日常使用的相同代理式任務。以下是早期實際使用後我們能誠實說的部分——沒有明確前後數據的地方屬質性描述,有數據的地方則具體說明。
首先,切換真的輕而易舉。將模型 ID 改為 claude-opus-4-8 並啟動工作階段,在我們這邊完全無須任何設定變更即可運作。如果你需要更大的上下文視窗,100 萬上下文版本可透過 claude-opus-4-8[1m] 指定。我們確認以 /fast 啟用 Fast Mode 會讓你留在完整的 Opus 模型上,而非悄悄路由到較小、較便宜的模型——這是我們想要的行為,但我們並未事先假設它如此。
早期使用中脫穎而出的一點:Opus 4.8 明顯更願意反駁。在一項重構任務中,它將我們既有程式碼中的一個假設標記為有風險,而非默默在其上繼續建置——這正是 Anthropic「放過缺陷的機率降低 4 倍」宣稱所預測的那類行為。我們不會把它包裝成基準測試,那只是單一任務上的一次觀察。但它是我們第一個注意到的事,而且與對齊的敘述一致。
Fast Mode 的加速在互動式工作階段中真實且明顯——輸出開始串流的速度更快,不過在我們完成乾淨、可重複的計時測試之前,不會發布精確的延遲數字。如果你要自己做比較,誠實的方法是:相同提示、相同倉庫狀態,先標準模式再 /fast,並同時測量兩種方式的實際耗時與 token 成本。一旦該測試定案,我們會用實際數字更新這一節。
該從 4.7 升級嗎?(立即切換/觀望/留下)
是否升級完全取決於你的工作負載,而非哪個模型「整體獲勝」。SWE-Bench Pro 與 GDPval-AA 的躍升幅度大且真實,所以程式設計與知識工作使用者應該切換。重度使用終端的團隊有充分理由觀望。對成本敏感、處理接近上限任務的使用者,可以留在 4.7,幾乎沒有損失。
立即切換,如果: 你的工作依賴代理式程式設計(SWE-Bench Pro +4.9)或知識任務(GDPval-AA +137 Elo)。這些是最大的實質增益,而在我們的測試中,SWE-Bench 的躍升在實際 PR 上表現為更少的錯誤方向。定價沒變,所以升級沒有成本代價。
觀望,如果: 你的工作流程重度使用終端——GPT-5.5 仍在 Terminal-Bench 2.1 領先(78.2% 對 74.6%),所以「最佳模型」的框架還不適用於你。如果你正處於專案中途,切換模型會混淆你的評估,也該觀望。
留在 4.7,如果: 你對成本敏感,而你的使用情境已接近上限,例如電腦操作——OSWorld-Verified 僅移動 +0.6。你會為了感受不到的差距,付出切換注意力的成本。
如果你的工作依賴 SWE-Bench 類型的程式設計或知識任務,4.8 是明確的升級;如果重度使用終端,GPT-5.5 可能仍略勝一籌。要看更廣泛的格局,請見 Opus 4.8 在最佳 AI 程式設計代理中的位置,並查看 4.7 發布以了解完整的差距全貌。
如何在 Claude Code 與 API 中切換到 Opus 4.8?
切換是近乎輕而易舉的模型 ID 替換。將預設模型設為 claude-opus-4-8(或 100 萬上下文視窗的 claude-opus-4-8[1m]),如果你的用戶端有顯示 effort 等級就選一個,然後就完成了。如果你用 Messages API 建置,現在可以將 system 項目放在 messages 陣列內,而不僅限於頂層的 system 欄位。
# Claude Code: set the default model
/model claude-opus-4-8
# API request body (model ID swap):
{
"model": "claude-opus-4-8",
"messages": [
{ "role": "system", "content": "You are a senior engineer." },
{ "role": "user", "content": "Refactor this module." }
]
}對多數團隊而言,這就是整個遷移。如果你跨多個供應商執行模型,並想在自己的任務上測試 4.8 對上 GPT-5.5 或 Gemini 3.1 Pro,代理伺服器能讓你在模型之間路由,無須重寫你的應用程式。先從標準模式開始,在你的真實工作負載上確認輸出品質,再決定 Fast Mode 以價換速的交易是否值得。
我們在 Techsy 正是用這套技術建置生產環境的 AI 代理。如果你正在為代理建置選擇模型,預約免費諮詢,我們會幫你為工作負載挑出合適的模型。
關於作者
Mert Batur Gurbuz 是 Techsy.io 的共同創辦人,團隊為 B2B 客戶建置 AI 代理、自動化系統與語音/SDR 流程。他就讀於 University of Birmingham,並撰寫 Techsy 團隊在生產環境中實際使用的 LLM 工具技術文章。
共同創辦人,Techsy.io,University of Birmingham · LinkedIn
常見問題
Claude Opus 4.8 是什麼?
Claude Opus 4.8 是 Anthropic 的旗艦模型,於 2026 年 5 月 28 日發布,模型 ID 為 claude-opus-4-8,另有 100 萬上下文版本 claude-opus-4-8[1m]。Anthropic 將其定位為迄今最誠實的模型,在其公布的 7 項基準測試中領先 6 項,並可在 Claude.ai、Claude Code 與 API 上使用。
Claude Opus 4.8 何時發布?
Claude Opus 4.8 於 2026 年 5 月 28 日發布,距離 Opus 4.7 僅 41 天,是 Anthropic 歷來最快的 Opus 更新節奏。它在同一天於 Claude.ai、Claude Code 與 Anthropic API 全面上線,沒有分階段推出,所以你可以立即切換預設模型。
Claude Opus 4.8 比 Opus 4.7 更好嗎?
對多數工作而言,是的。Opus 4.8 在 SWE-Bench Pro 以 69.2% 領先 64.3%,在 GDPval-AA 增加 +137 Elo,並在對上 4.7 的 7 項基準中贏得 6 項。例外是代理式終端程式設計,GPT-5.5 的分數仍高於兩者。定價維持不變,所以升級沒有成本代價。
從 4.7 升級到 Opus 4.8 值得嗎?
取決於你的工作負載。如果你做代理式程式設計或知識工作,立即切換——那裡的增益最大。如果你的工作重度使用終端,就觀望,因為 GPT-5.5 仍在那裡領先。如果你對成本敏感、處理接近上限的任務(如電腦操作,差距僅 +0.6 分),就留在 4.7。
Claude Opus 4.8 多少錢?
標準定價為每百萬輸入 token $5、每百萬輸出 token $25,與 Opus 4.7 相同,所以沒有漲價。Fast Mode 每百萬 token 為 $10/$50,在同一模型上跑出約 2.5 倍的速度。Anthropic 表示 Fast Mode 比先前的 Fast-Mode 方案便宜三倍。
Claude Opus 4.8 的 Fast Mode 是什麼?
Fast Mode 是高速方案,讓 Opus 4.8 以每百萬 token $10 輸入 / $50 輸出的價格跑出約 2.5 倍的速度,在 Claude Code 中以 /fast 啟用。關鍵是,它讓你留在完整的 claude-opus-4-8 模型上,而非降級到較小的模型。Anthropic 表示它比先前的 Fast-Mode 方案便宜三倍。
Claude Code 中的 dynamic workflows 是什麼?
Dynamic Workflows 是 Enterprise、Team 與 Max 方案上的研究預覽功能,可在單一工作階段中協調數百個平行子代理。搭配 Claude Code 與 Opus 4.8,它能跨數十萬行程式碼執行程式碼庫規模的遷移,從啟動到合併。由於仍是預覽版,要有碰到毛邊的預期。
Opus 4.8 支援 100 萬 token 上下文視窗嗎?
支援,透過 claude-opus-4-8[1m] 版本。當你需要更大的上下文視窗時,以該模型 ID 指定即可。請注意,公開的 Models-overview 文件頁面可能還在更新中,尚未列出 4.8 項目,但該版本今天即可在執行時指定。
Claude Opus 4.8 真的在所有項目都擊敗 GPT-5.5 嗎?
沒有。GPT-5.5 仍在 Terminal-Bench 2.1 的代理式終端程式設計中勝出,以 78.2% 擊敗 Opus 4.8 的 74.6%。Opus 4.8 領先其他六項公布的基準測試,包括 SWE-Bench Pro 與 GDPval-AA,但如果你的工作流程重度使用終端,對該特定任務而言 GPT-5.5 仍是較強的選擇。
如何在 Claude Code 中切換到 Opus 4.8?
將模型設為 claude-opus-4-8(在 Claude Code 中使用 /model claude-opus-4-8),如果你的用戶端有提供就選一個 effort 等級。100 萬上下文視窗請使用 claude-opus-4-8[1m]。對多數團隊而言,這是近乎輕而易舉的替換,無須其他設定變更。