
Claude Opus 5 正式登場:以半價逼近 Fable 5 的智慧
Anthropic 於 2026 年 7 月 24 日發布了 Claude Opus 5,訴求直截了當:以一半的價格,提供接近 Fable 5 的前沿智慧。最有力的證據是 Frontier-Bench v0.1,Opus 5 拿下 43.3%,將 Opus 4.8 的 21.1% 翻倍有餘。但總有但書:它並非全面制霸。GPT-5.6 Sol 仍在一項代理式編碼測試中險勝,而在健康與生物領域,桂冠屬於 Mythos 5。以下是實際改變了什麼、完整的基準測試表,以及你今天是否該把預設模型換掉。
重點整理:
- Claude Opus 5 於 2026 年 7 月 24 日在 Claude API、Claude.ai、Claude Code 和 Claude Cowork 上線,模型 ID 為
claude-opus-5。 - 它在 Anthropic 公布的多數基準測試中領先(Frontier-Bench、GDPval-AA、ARC-AGI-3、OSWorld 2.0、AutomationBench),但在幾項編碼、法律與科學測試中落後。
- 定價與 Opus 4.8 相同,為每百萬 token $5/$25,另有 Fast 模式,約以 2 倍價格換取約 2.5 倍速度。
今日發布內容:一分鐘看懂 Claude Opus 5
Claude Opus 5 是 Anthropic 的全新前沿模型,於 2026 年 7 月 24 日發布,同日即可透過 API、Claude.ai、Claude Code 和 Claude Cowork 使用。模型 ID 為 claude-opus-5。根據官方公告,Anthropic 的定位是它「以一半的價格,逼近 Claude Fable 5 的前沿智慧」。標準定價維持每百萬 token 輸入 $5/輸出 $25,與 Opus 4.8 相同。
這對代理式工作而言是實實在在的世代躍進,而非小幅更新。如果你從 Claude Opus 4.8 遷移過來,API 結構與 Claude Code 整合完全沿用,因此遷移只需替換模型 ID。不同的是上限:Anthropic 表示,在 Frontier-Bench v0.1 上,Opus 5 以較低的單任務成本將 4.8 的分數翻倍有餘,並在 GDPval-AA 和 ARC-AGI-3 上寫下最先進的成績。
這個定位至關重要。Fable 5 是 Anthropic 最昂貴的前沿模型。能以 Opus 的價格逼近它,正是這次發布的全部故事,也是為什麼「半價」這句話是 Anthropic 主打的口號。
Opus 5 相較 4.8 究竟新在哪裡?
從 4.8 到 5 最大的轉變在於判斷力:Opus 5 在驗證自身工作、反覆迭代直到任務真正完成(而非看似完成)方面明顯更強。Anthropic 也提到更強的軟體工程、知識工作與科學研究能力,以及更佳的視覺輸出。定價與核心 API 維持不變。
更佳的判斷力與自我驗證
最明顯的行為變化是 Opus 5 會自我檢查。Anthropic 引用技術人員 Zimu Li 的描述,稱這個模型「會驗證分支、檢查範本」,而非一味猛衝。對於任何依賴代理在生產環境中捕捉自身錯誤的人來說,這正是真正改變局勢的特質。它也是最難在基準測試圖表上推銷的東西,所以請把它當作一個需要在自己任務上驗證的說法。
以 Opus 成本取得前沿智慧
Cursor 共同創辦人 Sualeh Asif 將這次發布總結為「以 Opus 的速度與成本,取得接近 Fable 5 的智慧」。這就是務實的解讀:想要 Fable 5 級推理能力卻無法合理化其價格的團隊,現在有了中間選項。在 OSWorld 2.0 上,Anthropic 表示 Opus 5 以約三分之一的成本超越 Fable 5,這是價值論點最乾淨的單一例證。
對齊與安全姿態
Anthropic 報告 Opus 5 擁有迄今最低的不對齊行為分數(2.3),並稱它是與其憲法最為對齊的模型。在安全方面,網路安全分類器被描述為比 Fable 5 的限制少約 85%,並為有需要的團隊提供企業版 Cyber Verification Program。與任何供應商的安全宣稱一樣,值得了解,但仍值得對照你自己的紅隊案例進行驗證。
Opus 5 基準測試:贏在哪裡(又輸在哪裡)
Opus 5 在 Anthropic 公布的多數基準測試中領先,而對代理開發者至關重要的勝出更是壓倒性的:Frontier-Bench v0.1(43.3%)、GDPval-AA(1861 Elo)、ARC-AGI-3(30.2%)、OSWorld 2.0(70.6%),以及 Zapier 的 AutomationBench(26.0%)。誠實的例外:GPT-5.6 Sol 贏得 DeepSWE v1.1,Fable 5 在 FrontierCode 和法律測試中險勝,Mythos 5 則拿下健康與生物。
| 基準測試 | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|
| 代理式終端編碼,Frontier-Bench v0.1 | 43.3% | 33.7% | 21.1% | 34.4% |
| 知識工作,GDPval-AA v2(Elo) | 1861 | 1747 | 1593 | 1736 |
| 新問題求解,ARC-AGI-3 | 30.2% | — | 1.5% | 7.8% |
| 代理式搜尋,BrowseComp | 90.8% | 87.4% | 84.3% | 90.4% |
| 多學科推理,Humanity's Last Exam(含工具) | 64.7% | 63.9% | 57.9% | — |
| 代理式電腦操作,OSWorld 2.0 | 70.6% | 66.1% | 55.7% | 62.6% |
| 代理式編碼,DeepSWE v1.1 | 68.8% | 69.7% | 59.0% | 72.7% |
| 代理式編碼,FrontierCode v1.1(Main) | 53.4% | 53.5% | 46.5% | 47.5% |
| 商業工作流程,AutomationBench | 26.0% | 17.4% | 17.0% | 18.1% |
| Legal Agent Benchmark(held-out) | 11.7% | 13.3% | 10.4% | 2.5% |
| 健康,HealthBench Professional | 59.8% | 66.0% | 57.4% | 60.5% |
| 生物,BioMysteryBench(困難) | 49.4% | 46.5% | 42.4% | — |

要看差值,而非只看絕對分數。Frontier-Bench 較 Opus 4.8 躍升 +22.2 個百分點(21.1 到 43.3),是單次最大幅度的飛躍,也是 Anthropic 稱此為編碼與代理發布的原因。GDPval-AA 增加了 +268 Elo(1593 到 1861),在知識工作上超越表中所有模型。ARC-AGI-3 最引人注目:30.2% 對比 GPT-5.6 Sol 的 7.8% 和 Opus 4.8 的 1.5%,Anthropic 將此定位為在新問題求解上約為次佳公開模型的 3 倍。在 AutomationBench 上,26.0% 約為整體水準的 1.5 倍,對任何打造商業流程代理的人都是直接訊號。
關於落敗,有兩點誠實的說明。第一,Fable 5 欄位在健康(66.0%)和生物人類求解拆分上的領先者其實是 Mythos 5——Anthropic 的科學專用模型,而非 Fable 5,因此這些並非同級通用模型的勝利。第二,編碼版圖確實分裂:GPT-5.6 Sol 拿下 DeepSWE v1.1(72.7% 對 68.8%),Fable 5 以毫釐之差贏得 FrontierCode(53.5% 對 53.4%)。如果你的工作是純 SWE-bench 式編碼,「整體最佳」的標籤不會自動指向 Opus 5。
Opus 5 要多少錢?定價與 Fast 模式
Opus 5 的標準定價為每百萬輸入 token $5、每百萬輸出 token $25,根據 Anthropic 公布的定價與 Opus 4.8 完全相同,因此升級沒有漲價。「半價」的說法是相對於 Fable 5,而非 4.8:你以 Opus 費率取得接近 Fable 5 的智慧,無須支付 Fable 5 的價格。Fast 模式約以 2 倍基礎價格運行,換取約 2.5 倍的預設速度,且 API 支援後援路由。
那麼每個任務代表什麼?以標準定價計算,你相較 4.8 不多付任何費用,卻獲得大幅能力躍升,這使升級對多數工作負載幾乎是免費的。Fast 模式是互動式工作階段的槓桿:你以 2 倍價格溢價,換取同一模型上快約 2.5 倍的串流輸出——當你坐在那裡等待時很划算,當你跑過夜批次、實際耗時無關緊要時則不划算。如果速率限制才是你真正的瓶頸,我們的 Claude 使用限制指南說明了各方案與成本如何交互作用。
# Claude Code: point your default model at Opus 5
/model claude-opus-5
# API request body (model ID swap):
{
"model": "claude-opus-5",
"messages": [
{ "role": "user", "content": "Refactor this module and verify the tests pass." }
]
}Opus 5 對生產環境代理的意義
增益恰好集中在生產環境代理的所在:終端編碼(Frontier-Bench)、電腦操作(OSWorld 2.0)、代理式搜尋(BrowseComp)和多步驟商業工作流程(AutomationBench)。這四項正是實際部署中最常出問題的工作負載,因此一個在四項上同時躍升的模型,改變了「什麼能上線」的界線。
這正是值得細想的部分。像 AutomationBench 這樣的基準測試,衡量的是代理能否從頭到尾完成一個真實的多工具工作流程,而 Opus 5 的 26.0% 對比整體約 17%,正是「示範效果好」與「撐得過雜亂 CRM 的實戰」之間的差距。OSWorld 2.0 的結果(70.6%,以三分之一成本擊敗 Fable 5)對那些在真實軟體中點擊操作的電腦操作代理說明了同樣的事。對於部署面向客戶的 AI 代理的團隊,這些數字意味著凌晨兩點的故障更少。
它也降低了我們倚重的一種設計模式的成本:低成本的自我驗證。當模型真的更擅長檢查自己的分支時,你可以花更少的 token 在獨立的評論者步驟上,卻仍能捕捉相同的錯誤。對任何大量運行代理的人來說,這是一條實實在在的預算項目。
我們如何將 Opus 5 整合進自己的技術棧
我們在 Techsy 以 Claude 技術棧打造並運行生產環境的 AI 代理,因此前沿發布對我們來說是當天的評估,而非讀過就放的新聞。以下是我們誠實的第一手解讀——在還沒有乾淨的前後對比數據處採定性描述,在有數據處則給出具體說明。
替換本身輕而易舉,而這正是重點。我們的內容與自動化管線在設定中固定預設模型;將 claude-opus-4-8 改為 claude-opus-5 並重新啟動工作階段,不需要任何其他變更,與近期每次 Opus 升級相同。如果你跨供應商路由,想在自己的任務上將 Opus 5 與 Fable 5 或 GPT-5.6 Sol 進行 A/B 測試,代理伺服器能讓你無需重寫應用程式即可切換模型。
我們最先關注的是自我驗證的宣稱,因為它是唯一真正會改變我們架構的一項。我們目前的代理會執行明確的評論者步驟,在壞編輯落地前加以捕捉;如果 Opus 5 能可靠地標記自己的弱分支,我們就能精簡該步驟並省下 token。在對一組可重複的任務集跑完之前,我們不會公布這方面的數字——這正是我們對任何引用代理指標的人所要求的同等紀律。如果你想知道方法,就是我們在生產環境評估 AI 代理指南中的那套:相同的提示、相同的儲存庫狀態,數錯誤的轉彎次數,而非憑感覺。
該從 Opus 4.8 切換嗎?(切換/觀望/留下)
是否遷移取決於你的工作負載,而非哪個模型「整體獲勝」。代理式與知識工作的躍升幅度大且真實,因此多數團隊應該切換。擁有 GPT 或 Fable 管線的純編碼團隊有理由先測試再承諾,而在廉價任務上已接近上限的使用者可以原地不動,幾乎毫無損失。
立即切換,如果: 你的工作倚重代理式任務、電腦操作、商業流程自動化或知識工作。Frontier-Bench(較 4.8 +22.2)、AutomationBench(約 1.5 倍整體水準)和 GDPval-AA(+268 Elo)是最大的實質增益,而定價未變,因此升級沒有成本懲罰。
觀望,如果: 你的工作流程是純代理式編碼,且已為此使用 GPT-5.6 Sol 或 Fable 5。GPT-5.6 Sol 仍領先 DeepSWE v1.1,Fable 5 在 FrontierCode 險勝,因此在重新指向之前先跑自己的編碼評估。如果你正處於專案中途,而切換模型會攪渾你正在進行的評估,也該觀望。
留在 4.8,如果: 你對那些對你而言已接近上限的任務在意成本,且不碰 Opus 5 領先的代理式工作負載。你會為一個感覺不出來的差值支付切換成本。若想了解更廣泛的格局,請參閱我們的 Claude Sonnet 5 解析與 Fable 5 和 Mythos 5 概覽。
我們每週都在為客戶的代理建置挑選並接線這類模型。如果你正在決定生產環境代理要標準化採用哪個模型,預約免費諮詢,我們會協助你讓模型對齊工作負載,而非對齊行銷話術。
關於作者
Mert Batur Gurbuz 是 Techsy.io 的共同創辦人,團隊在此為 B2B 客戶交付 AI 代理、自動化系統與語音/SDR 管線。他就讀於 University of Birmingham,並撰寫 Techsy 團隊實際在生產環境運行的 LLM 工具棧相關文章。
共同創辦人,Techsy.io,University of Birmingham · LinkedIn
常見問題
什麼是 Claude Opus 5?
Claude Opus 5 是 Anthropic 的前沿模型,於 2026 年 7 月 24 日發布,模型 ID 為 claude-opus-5。Anthropic 將它定位為以半價逼近 Fable 5 的智慧,並在其公布的多數基準測試中領先,包括 Frontier-Bench、GDPval-AA 和 ARC-AGI-3。它可在 Claude API、Claude.ai、Claude Code 和 Claude Cowork 上使用。
Claude Opus 5 何時發布?
Claude Opus 5 於 2026 年 7 月 24 日發布。它在同日於整個 Claude API、Claude.ai、Claude Code 和 Claude Cowork 上線,沒有分階段推出,因此你可以立即將預設模型重新指向 claude-opus-5。
Claude Opus 5 比 Opus 4.8 更好嗎?
對多數工作而言,是的。Opus 5 在 Frontier-Bench v0.1 上將 Opus 4.8 翻倍有餘(43.3% 對 21.1%),在 GDPval-AA 增加 268 Elo,並在 ARC-AGI-3 從 1.5% 躍升至 30.2%。定價未變,因此沒有成本懲罰。例外是幾項編碼與科學測試,GPT-5.6 Sol、Fable 5 或 Mythos 5 仍領先。
Claude Opus 5 要多少錢?
標準定價為每百萬輸入 token $5、每百萬輸出 token $25,與 Opus 4.8 相同。「半價」這句話指的是 Fable 5,而非 4.8:Opus 5 以 Opus 費率提供接近 Fable 5 的智慧。Fast 模式約為基礎價格的 2 倍,在同一模型上運行速度快約 2.5 倍。
Claude Opus 5 打得過 Fable 5 嗎?
並非全面獲勝。Opus 5 在 OSWorld 2.0、BrowseComp、GDPval-AA 和 Frontier-Bench 上超越 Fable 5,而且只花 Fable 5 價格的一小部分。但 Fable 5 仍在 FrontierCode 和法律基準測試中險勝,而 Mythos 5(Anthropic 的科學模型)領先健康與生物。訴求是「以半價逼近 Fable 5」,而非「在每件事上都優於 Fable 5」。
Opus 5 輸在哪裡?
GPT-5.6 Sol 在 DeepSWE v1.1 的代理式編碼獲勝(72.7% 對 68.8%),Fable 5 以 0.1 分之差贏得 FrontierCode v1.1 和 held-out 法律基準測試(13.3% 對 11.7%),Mythos 5 則領先 HealthBench Professional 和生物測試。如果你的工作負載由其中任何一項主導,切換前先做基準測試。
Claude Opus 5 適合打造 AI 代理嗎?
它正是為此而生。最大的增益落在代理式終端編碼(Frontier-Bench)、電腦操作(OSWorld 2.0)、代理式搜尋(BrowseComp)和多步驟商業工作流程(AutomationBench),這些正是生產環境代理運行的工作負載。它更強的自我驗證也讓你能在獨立評論者步驟上花更少的 token。
如何在 Claude Code 和 API 中切換到 Opus 5?
將模型設為 claude-opus-5(在 Claude Code 中使用 /model claude-opus-5),對多數團隊就完成了。在 API 中,將 model 欄位改為 claude-opus-5;請求結構與 Opus 4.8 相同,因此不需要其他程式碼變更。
Claude Opus 5 的 Fast 模式是什麼?
Fast 模式是一個高速方案,以約 2 倍標準價格讓 Opus 5 以約 2.5 倍預設速度運行。它讓你留在完整的 claude-opus-5 模型上,而非將你路由到較小的模型,這使它適合你在等待輸出的互動式工作階段,而對延遲不敏感的批次作業則不值得。