Techsy
聯絡我們
立即開始
回到部落格
ai-machine-learning

Claude Opus 5 正式登場:以半價逼近 Fable 5 的智慧

作者: Mert Batur Gürbüz
Jul 24, 2026
4 分鐘閱讀
目錄
Claude Opus 5 正式登場:以半價逼近 Fable 5 的智慧

Claude Opus 5 正式登場:以半價逼近 Fable 5 的智慧

Anthropic 於 2026 年 7 月 24 日發布了 Claude Opus 5,訴求直截了當:以一半的價格,提供接近 Fable 5 的前沿智慧。最有力的證據是 Frontier-Bench v0.1,Opus 5 拿下 43.3%,將 Opus 4.8 的 21.1% 翻倍有餘。但總有但書:它並非全面制霸。GPT-5.6 Sol 仍在一項代理式編碼測試中險勝,而在健康與生物領域,桂冠屬於 Mythos 5。以下是實際改變了什麼、完整的基準測試表,以及你今天是否該把預設模型換掉。

重點整理:

  • Claude Opus 5 於 2026 年 7 月 24 日在 Claude API、Claude.ai、Claude Code 和 Claude Cowork 上線,模型 ID 為 claude-opus-5。
  • 它在 Anthropic 公布的多數基準測試中領先(Frontier-Bench、GDPval-AA、ARC-AGI-3、OSWorld 2.0、AutomationBench),但在幾項編碼、法律與科學測試中落後。
  • 定價與 Opus 4.8 相同,為每百萬 token $5/$25,另有 Fast 模式,約以 2 倍價格換取約 2.5 倍速度。

今日發布內容:一分鐘看懂 Claude Opus 5

Claude Opus 5 是 Anthropic 的全新前沿模型,於 2026 年 7 月 24 日發布,同日即可透過 API、Claude.ai、Claude Code 和 Claude Cowork 使用。模型 ID 為 claude-opus-5。根據官方公告,Anthropic 的定位是它「以一半的價格,逼近 Claude Fable 5 的前沿智慧」。標準定價維持每百萬 token 輸入 $5/輸出 $25,與 Opus 4.8 相同。

這對代理式工作而言是實實在在的世代躍進,而非小幅更新。如果你從 Claude Opus 4.8 遷移過來,API 結構與 Claude Code 整合完全沿用,因此遷移只需替換模型 ID。不同的是上限:Anthropic 表示,在 Frontier-Bench v0.1 上,Opus 5 以較低的單任務成本將 4.8 的分數翻倍有餘,並在 GDPval-AA 和 ARC-AGI-3 上寫下最先進的成績。

這個定位至關重要。Fable 5 是 Anthropic 最昂貴的前沿模型。能以 Opus 的價格逼近它,正是這次發布的全部故事,也是為什麼「半價」這句話是 Anthropic 主打的口號。

Opus 5 相較 4.8 究竟新在哪裡?

從 4.8 到 5 最大的轉變在於判斷力:Opus 5 在驗證自身工作、反覆迭代直到任務真正完成(而非看似完成)方面明顯更強。Anthropic 也提到更強的軟體工程、知識工作與科學研究能力,以及更佳的視覺輸出。定價與核心 API 維持不變。

更佳的判斷力與自我驗證

最明顯的行為變化是 Opus 5 會自我檢查。Anthropic 引用技術人員 Zimu Li 的描述,稱這個模型「會驗證分支、檢查範本」,而非一味猛衝。對於任何依賴代理在生產環境中捕捉自身錯誤的人來說,這正是真正改變局勢的特質。它也是最難在基準測試圖表上推銷的東西,所以請把它當作一個需要在自己任務上驗證的說法。

以 Opus 成本取得前沿智慧

Cursor 共同創辦人 Sualeh Asif 將這次發布總結為「以 Opus 的速度與成本,取得接近 Fable 5 的智慧」。這就是務實的解讀:想要 Fable 5 級推理能力卻無法合理化其價格的團隊,現在有了中間選項。在 OSWorld 2.0 上,Anthropic 表示 Opus 5 以約三分之一的成本超越 Fable 5,這是價值論點最乾淨的單一例證。

對齊與安全姿態

Anthropic 報告 Opus 5 擁有迄今最低的不對齊行為分數(2.3),並稱它是與其憲法最為對齊的模型。在安全方面,網路安全分類器被描述為比 Fable 5 的限制少約 85%,並為有需要的團隊提供企業版 Cyber Verification Program。與任何供應商的安全宣稱一樣,值得了解,但仍值得對照你自己的紅隊案例進行驗證。

Opus 5 基準測試:贏在哪裡(又輸在哪裡)

Opus 5 在 Anthropic 公布的多數基準測試中領先,而對代理開發者至關重要的勝出更是壓倒性的:Frontier-Bench v0.1(43.3%)、GDPval-AA(1861 Elo)、ARC-AGI-3(30.2%)、OSWorld 2.0(70.6%),以及 Zapier 的 AutomationBench(26.0%)。誠實的例外:GPT-5.6 Sol 贏得 DeepSWE v1.1,Fable 5 在 FrontierCode 和法律測試中險勝,Mythos 5 則拿下健康與生物。

基準測試Opus 5Fable 5Opus 4.8GPT-5.6 Sol
代理式終端編碼,Frontier-Bench v0.143.3%33.7%21.1%34.4%
知識工作,GDPval-AA v2(Elo)1861174715931736
新問題求解,ARC-AGI-330.2%—1.5%7.8%
代理式搜尋,BrowseComp90.8%87.4%84.3%90.4%
多學科推理,Humanity's Last Exam(含工具)64.7%63.9%57.9%—
代理式電腦操作,OSWorld 2.070.6%66.1%55.7%62.6%
代理式編碼,DeepSWE v1.168.8%69.7%59.0%72.7%
代理式編碼,FrontierCode v1.1(Main)53.4%53.5%46.5%47.5%
商業工作流程,AutomationBench26.0%17.4%17.0%18.1%
Legal Agent Benchmark(held-out)11.7%13.3%10.4%2.5%
健康,HealthBench Professional59.8%66.0%57.4%60.5%
生物,BioMysteryBench(困難)49.4%46.5%42.4%—

Claude Opus 5 與 Fable 5、Opus 4.8 和 GPT-5.6 Sol 在 Frontier-Bench、GDPval-AA、ARC-AGI-3、OSWorld 2.0、AutomationBench 等項目的基準測試比較
來源:Anthropic

要看差值,而非只看絕對分數。Frontier-Bench 較 Opus 4.8 躍升 +22.2 個百分點(21.1 到 43.3),是單次最大幅度的飛躍,也是 Anthropic 稱此為編碼與代理發布的原因。GDPval-AA 增加了 +268 Elo(1593 到 1861),在知識工作上超越表中所有模型。ARC-AGI-3 最引人注目:30.2% 對比 GPT-5.6 Sol 的 7.8% 和 Opus 4.8 的 1.5%,Anthropic 將此定位為在新問題求解上約為次佳公開模型的 3 倍。在 AutomationBench 上,26.0% 約為整體水準的 1.5 倍,對任何打造商業流程代理的人都是直接訊號。

關於落敗,有兩點誠實的說明。第一,Fable 5 欄位在健康(66.0%)和生物人類求解拆分上的領先者其實是 Mythos 5——Anthropic 的科學專用模型,而非 Fable 5,因此這些並非同級通用模型的勝利。第二,編碼版圖確實分裂:GPT-5.6 Sol 拿下 DeepSWE v1.1(72.7% 對 68.8%),Fable 5 以毫釐之差贏得 FrontierCode(53.5% 對 53.4%)。如果你的工作是純 SWE-bench 式編碼,「整體最佳」的標籤不會自動指向 Opus 5。

Opus 5 要多少錢?定價與 Fast 模式

Opus 5 的標準定價為每百萬輸入 token $5、每百萬輸出 token $25,根據 Anthropic 公布的定價與 Opus 4.8 完全相同,因此升級沒有漲價。「半價」的說法是相對於 Fable 5,而非 4.8:你以 Opus 費率取得接近 Fable 5 的智慧,無須支付 Fable 5 的價格。Fast 模式約以 2 倍基礎價格運行,換取約 2.5 倍的預設速度,且 API 支援後援路由。

那麼每個任務代表什麼?以標準定價計算,你相較 4.8 不多付任何費用,卻獲得大幅能力躍升,這使升級對多數工作負載幾乎是免費的。Fast 模式是互動式工作階段的槓桿:你以 2 倍價格溢價,換取同一模型上快約 2.5 倍的串流輸出——當你坐在那裡等待時很划算,當你跑過夜批次、實際耗時無關緊要時則不划算。如果速率限制才是你真正的瓶頸,我們的 Claude 使用限制指南說明了各方案與成本如何交互作用。

bash
# Claude Code: point your default model at Opus 5
/model claude-opus-5

# API request body (model ID swap):
{
  "model": "claude-opus-5",
  "messages": [
    { "role": "user", "content": "Refactor this module and verify the tests pass." }
  ]
}

Opus 5 對生產環境代理的意義

增益恰好集中在生產環境代理的所在:終端編碼(Frontier-Bench)、電腦操作(OSWorld 2.0)、代理式搜尋(BrowseComp)和多步驟商業工作流程(AutomationBench)。這四項正是實際部署中最常出問題的工作負載,因此一個在四項上同時躍升的模型,改變了「什麼能上線」的界線。

這正是值得細想的部分。像 AutomationBench 這樣的基準測試,衡量的是代理能否從頭到尾完成一個真實的多工具工作流程,而 Opus 5 的 26.0% 對比整體約 17%,正是「示範效果好」與「撐得過雜亂 CRM 的實戰」之間的差距。OSWorld 2.0 的結果(70.6%,以三分之一成本擊敗 Fable 5)對那些在真實軟體中點擊操作的電腦操作代理說明了同樣的事。對於部署面向客戶的 AI 代理的團隊,這些數字意味著凌晨兩點的故障更少。

它也降低了我們倚重的一種設計模式的成本:低成本的自我驗證。當模型真的更擅長檢查自己的分支時,你可以花更少的 token 在獨立的評論者步驟上,卻仍能捕捉相同的錯誤。對任何大量運行代理的人來說,這是一條實實在在的預算項目。

我們如何將 Opus 5 整合進自己的技術棧

我們在 Techsy 以 Claude 技術棧打造並運行生產環境的 AI 代理,因此前沿發布對我們來說是當天的評估,而非讀過就放的新聞。以下是我們誠實的第一手解讀——在還沒有乾淨的前後對比數據處採定性描述,在有數據處則給出具體說明。

替換本身輕而易舉,而這正是重點。我們的內容與自動化管線在設定中固定預設模型;將 claude-opus-4-8 改為 claude-opus-5 並重新啟動工作階段,不需要任何其他變更,與近期每次 Opus 升級相同。如果你跨供應商路由,想在自己的任務上將 Opus 5 與 Fable 5 或 GPT-5.6 Sol 進行 A/B 測試,代理伺服器能讓你無需重寫應用程式即可切換模型。

我們最先關注的是自我驗證的宣稱,因為它是唯一真正會改變我們架構的一項。我們目前的代理會執行明確的評論者步驟,在壞編輯落地前加以捕捉;如果 Opus 5 能可靠地標記自己的弱分支,我們就能精簡該步驟並省下 token。在對一組可重複的任務集跑完之前,我們不會公布這方面的數字——這正是我們對任何引用代理指標的人所要求的同等紀律。如果你想知道方法,就是我們在生產環境評估 AI 代理指南中的那套:相同的提示、相同的儲存庫狀態,數錯誤的轉彎次數,而非憑感覺。

該從 Opus 4.8 切換嗎?(切換/觀望/留下)

是否遷移取決於你的工作負載,而非哪個模型「整體獲勝」。代理式與知識工作的躍升幅度大且真實,因此多數團隊應該切換。擁有 GPT 或 Fable 管線的純編碼團隊有理由先測試再承諾,而在廉價任務上已接近上限的使用者可以原地不動,幾乎毫無損失。

立即切換,如果: 你的工作倚重代理式任務、電腦操作、商業流程自動化或知識工作。Frontier-Bench(較 4.8 +22.2)、AutomationBench(約 1.5 倍整體水準)和 GDPval-AA(+268 Elo)是最大的實質增益,而定價未變,因此升級沒有成本懲罰。

觀望,如果: 你的工作流程是純代理式編碼,且已為此使用 GPT-5.6 Sol 或 Fable 5。GPT-5.6 Sol 仍領先 DeepSWE v1.1,Fable 5 在 FrontierCode 險勝,因此在重新指向之前先跑自己的編碼評估。如果你正處於專案中途,而切換模型會攪渾你正在進行的評估,也該觀望。

留在 4.8,如果: 你對那些對你而言已接近上限的任務在意成本,且不碰 Opus 5 領先的代理式工作負載。你會為一個感覺不出來的差值支付切換成本。若想了解更廣泛的格局,請參閱我們的 Claude Sonnet 5 解析與 Fable 5 和 Mythos 5 概覽。

我們每週都在為客戶的代理建置挑選並接線這類模型。如果你正在決定生產環境代理要標準化採用哪個模型,預約免費諮詢,我們會協助你讓模型對齊工作負載,而非對齊行銷話術。

關於作者

Mert Batur Gurbuz 是 Techsy.io 的共同創辦人,團隊在此為 B2B 客戶交付 AI 代理、自動化系統與語音/SDR 管線。他就讀於 University of Birmingham,並撰寫 Techsy 團隊實際在生產環境運行的 LLM 工具棧相關文章。

共同創辦人,Techsy.io,University of Birmingham · LinkedIn

常見問題

什麼是 Claude Opus 5?

Claude Opus 5 是 Anthropic 的前沿模型,於 2026 年 7 月 24 日發布,模型 ID 為 claude-opus-5。Anthropic 將它定位為以半價逼近 Fable 5 的智慧,並在其公布的多數基準測試中領先,包括 Frontier-Bench、GDPval-AA 和 ARC-AGI-3。它可在 Claude API、Claude.ai、Claude Code 和 Claude Cowork 上使用。

Claude Opus 5 何時發布?

Claude Opus 5 於 2026 年 7 月 24 日發布。它在同日於整個 Claude API、Claude.ai、Claude Code 和 Claude Cowork 上線,沒有分階段推出,因此你可以立即將預設模型重新指向 claude-opus-5。

Claude Opus 5 比 Opus 4.8 更好嗎?

對多數工作而言,是的。Opus 5 在 Frontier-Bench v0.1 上將 Opus 4.8 翻倍有餘(43.3% 對 21.1%),在 GDPval-AA 增加 268 Elo,並在 ARC-AGI-3 從 1.5% 躍升至 30.2%。定價未變,因此沒有成本懲罰。例外是幾項編碼與科學測試,GPT-5.6 Sol、Fable 5 或 Mythos 5 仍領先。

Claude Opus 5 要多少錢?

標準定價為每百萬輸入 token $5、每百萬輸出 token $25,與 Opus 4.8 相同。「半價」這句話指的是 Fable 5,而非 4.8:Opus 5 以 Opus 費率提供接近 Fable 5 的智慧。Fast 模式約為基礎價格的 2 倍,在同一模型上運行速度快約 2.5 倍。

Claude Opus 5 打得過 Fable 5 嗎?

並非全面獲勝。Opus 5 在 OSWorld 2.0、BrowseComp、GDPval-AA 和 Frontier-Bench 上超越 Fable 5,而且只花 Fable 5 價格的一小部分。但 Fable 5 仍在 FrontierCode 和法律基準測試中險勝,而 Mythos 5(Anthropic 的科學模型)領先健康與生物。訴求是「以半價逼近 Fable 5」,而非「在每件事上都優於 Fable 5」。

Opus 5 輸在哪裡?

GPT-5.6 Sol 在 DeepSWE v1.1 的代理式編碼獲勝(72.7% 對 68.8%),Fable 5 以 0.1 分之差贏得 FrontierCode v1.1 和 held-out 法律基準測試(13.3% 對 11.7%),Mythos 5 則領先 HealthBench Professional 和生物測試。如果你的工作負載由其中任何一項主導,切換前先做基準測試。

Claude Opus 5 適合打造 AI 代理嗎?

它正是為此而生。最大的增益落在代理式終端編碼(Frontier-Bench)、電腦操作(OSWorld 2.0)、代理式搜尋(BrowseComp)和多步驟商業工作流程(AutomationBench),這些正是生產環境代理運行的工作負載。它更強的自我驗證也讓你能在獨立評論者步驟上花更少的 token。

如何在 Claude Code 和 API 中切換到 Opus 5?

將模型設為 claude-opus-5(在 Claude Code 中使用 /model claude-opus-5),對多數團隊就完成了。在 API 中,將 model 欄位改為 claude-opus-5;請求結構與 Opus 4.8 相同,因此不需要其他程式碼變更。

Claude Opus 5 的 Fast 模式是什麼?

Fast 模式是一個高速方案,以約 2 倍標準價格讓 Opus 5 以約 2.5 倍預設速度運行。它讓你留在完整的 claude-opus-5 模型上,而非將你路由到較小的模型,這使它適合你在等待輸出的互動式工作階段,而對延遲不敏感的批次作業則不值得。

標籤

Claude Opus 5claude-opus-5anthropicopus 5 vs opus 4.8opus 5 基準測試

分享這篇文章

相關文章

更多「%s」主題文章 ai-machine-learning

ai-machine-learning
Jul 20, 2026

2026 年 8 大 AI 網頁爬蟲 API(在我們自己的 Agent 架構上實測)

我們透過自己的 Agent 架構抓取真實 2026 年定價,實測了 8 款 AI 網頁爬蟲 API。Firecrawl、Bright Data、ScrapingBee 等 5 家以上業者,依 LLM 就緒輸出、反爬蟲能力與 MCP 支援進行排名。

9 min read 分鐘閱讀
繼續閱讀
ai-machine-learning
Jul 20, 2026

程式碼提示工程:我們在 Claude Code 與 Cursor 中每日使用的 7 種模式(2026)

大多數「AI 程式碼提示」文章只會給你 50 個可複製的範本。本文將教導我們每天用於運行 16 個代理人的 Claude Code 流水線的 7 種模式,每種模式都附有真實的前後對比,並說明在 2026 年這些模式如何應用於 Claude Code、Cursor 和 Copilot。

11 min read 分鐘閱讀
繼續閱讀
ai-machine-learning
Jul 19, 2026

從 AI PoC 到正式上線:出貨前必過的 12 項檢查清單

一個能運作的 AI 示範並不等同於正式上線系統。這份 12 項檢查清單涵蓋每個 AI 功能上線前必經的三個階段:強化、穩定化與部署,並提供成本上限、速率限制、備援機制與回滾觸發條件的具體門檻。

10 min read 分鐘閱讀
繼續閱讀
查看全部文章
啟動專案

準備好創造點什麼了嗎 非凡體驗?

讓我們將你的願景化為現實。團隊已準備好,助你打造真正有影響力的軟體。

預約 30 分鐘需求討論查看作品

精選上架

Claude 技能

查看全部
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI 自動化作業

查看全部
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

精選上架

Claude 技能

查看全部
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI 自動化作業

查看全部
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

服務項目

  • 企業級解決方案
  • 手機應用程式
  • 網頁應用

解決方案

  • CRM 系統
  • AI 整合應用
  • ERP 整合系統
  • 語音助理代理
  • 工作流程自動化
  • 網路資安

資源庫

  • 部落格
  • 專案作品

社群

  • AI 自動化作業
  • Claude 技能

工具

  • 手機應用程式開發費用計算器
  • OpenAI / LLM API 費率計算器
  • MVP 開發費用計算器
  • 語音 AI 助理費用計算器

關於 TECHSY

  • 瀏覽
  • 合作夥伴
  • 聯絡我們

法律聲明

  • 私隱政策
  • 服務條款
  • Cookies說明

服務項目

  • 企業級解決方案
  • 手機應用程式
  • 網頁應用

解決方案

  • CRM 系統
  • AI 整合應用
  • ERP 整合系統
  • 語音助理代理
  • 工作流程自動化
  • 網路資安

資源庫

  • 部落格
  • 專案作品

社群

  • AI 自動化作業
  • Claude 技能

工具

  • 手機應用程式開發費用計算器
  • OpenAI / LLM API 費率計算器
  • MVP 開發費用計算器
  • 語音 AI 助理費用計算器

關於 TECHSY

  • 瀏覽
  • 合作夥伴
  • 聯絡我們
法律聲明私隱政策服務條款Cookies說明
TECHSY
© 2026 Techsy.保留所有權利。