
Claude Fable 5 對決 Opus 4.8:你真的該換嗎?(Mythos 級、附基準測試)
Anthropic 在今天(2026 年 6 月 9 日)正式推出了 Claude Fable 5。它在 SWE-Bench Pro 上拿下 80.3%,這個代理式編碼基準測試中,Opus 4.8 只有 69.2%,GPT-5.5 則落後至 58.6%。這可不是誤差範圍內的差距。而且還有個轉折:Fable 5 是全新「Mythos 級」模型中公開、帶有安全防護的那一半,另有一個名為 Claude Mythos 5 的受限版本,被鎖在限制存取計畫後面。以下是這次到底改了什麼、在每百萬 token $10/$50 的定價下一個真實任務要花多少錢,以及你到底該不該把整個技術棧從 Opus 4.8 遷移過來。
快速解答
- Fable 5 在 SWE-Bench Pro 上拿下 80.3%,對比 Opus 4.8 的 69.2% 與 GPT-5.5 的 58.6%。
- 定價為每百萬 token 輸入 $10/輸出 $50,不到 Mythos Preview 的一半。
- Fable 5 會對高風險的網路/生物/化學查詢自動退回 Opus 4.8(不到 5% 的對話會觸發)。
- 在 Pro/Max/Team/Enterprise 方案上免費使用至 2026 年 6 月 22 日;6 月 23 日起開始扣用量額度。
到底發佈了什麼:Fable 5、Mythos 5,以及「Mythos 級」產品線
Mythos 級是 Anthropic 全新的最高能力等級,以兩個模型的形式推出。Claude Fable 5 是你今天就能呼叫的公開、帶安全防護版本。Claude Mythos 5 是同一個前沿模型,但移除了安全防護,被鎖在限制存取後面。同樣的大腦,兩種發佈姿態。
這個拆分就是整個故事的核心。根據 Anthropic 新聞室的公告,Mythos 5 保留了完整的前沿能力,包括可能造成真實損害的攻擊性網路技能,所以 Anthropic 不會把它交給所有人。Fable 5 拿的是同一個模型,但在外面包了一層分類器,偵測高風險請求,然後悄悄把它們轉交給 Opus 4.8。
所以當你呼叫 Fable 5 時,所有不危險的部分你都能得到 Mythos 級的推理能力,而那一小塊危險的部分則由更安全的備援模型接手。CNBC 的報導把它描述成 Anthropic 向公眾發佈了一個「類 Mythos 的 AI」,這說法沒問題,但精確的運作機制比標題更重要。
Fable 5 和 Mythos 5 是同一個前沿模型拆分成的兩半:一個你今天就能用,一個 Anthropic 把它鎖著。關於命名,如果你只記一件事,就記這個。Mythos 級是等級;Fable 和 Mythos 是通往它的兩扇門。
相較 Opus 4.x 系列改了什麼
在 Anthropic 公佈的每一項編碼和推理評估中,Fable 5 都超越了 Opus 4.8,而且不是贏一點點,是兩位數的差距。SWE-Bench Pro 從 69.2% 跳到 80.3%。FrontierCode Diamond 從 13.4 升到 29.3。定價也降了,而且模型多了一個新的推理強度旋鈕可以調整。相較 Opus 4.x 系列,這是真正的前沿躍進,不是一次小版本更新。

上面這張涵蓋 13 項基準測試的總表是一覽版。以下是對上多數團隊實際會比較的三個模型的重點子集:
| 基準測試 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|
| SWE-Bench Pro(代理式編碼) | 80.3% | 69.2% | 58.6% |
| FrontierCode Diamond(最難編碼) | 29.3 | 13.4 | 5.7 |
| Terminal-Bench 2.1(代理式 shell) | 88.0% | n/a | n/a |
| GPQA-AA(研究所級推理,Elo) | 1932 | n/a | n/a |
| ExploitBench | 78.0% | n/a | n/a |
這裡的比較錨點是 Claude Opus 4.8,也就是 Fable 5 在前沿位置上取代的模型,同時也是 Fable 5 在高風險查詢時退回的同一個模型。如果你一路追蹤了過去兩個版本的 Opus 4.x 系列,你會發現模式是漸進式提升。Fable 5 打破了這個模式。
在你把這張表當成鐵律之前,有兩件事要先講清楚。第一,這些是 Anthropic 自己公佈的評估,不是獨立測試。第二,推理強度旋鈕意味著單一基準數字背後藏著一條成本曲線。這點在定價那節會再講,因為它會改變整個計算。
對開發者真正重要的基準
有四個數字承載了實際的重量:SWE-Bench Pro 80.3%、FrontierCode Diamond 29.3、Terminal-Bench 2.1 88.0%,以及 GPQA-AA 1932 Elo。加在一起,它們涵蓋了真實 repo 工作、最難的合成編碼問題、代理式 shell 任務,以及研究所級的推理能力。如果你的工作負載碰到其中任何一項,這一節會告訴你這些數字是否對應到你的工作。
本文開頭那張主圖就是證據:SWE-Bench Pro 80.3 對 69.2 對 58.6,FrontierCode 29.3 對 13.4 對 5.7。那這些到底在量什麼?
- SWE-Bench Pro 測試模型能不能對一個真實 repo 提交真實的 pull request:clone、理解、修補、通過測試。SWE-Bench Pro 量的是模型能不能對真實 repo 提交真實的 pull request,而 Fable 5 十次中能做對八次。這是最接近「它能不能做我實際工作」的指標。
- Terminal-Bench 2.1 評分代理式 shell 任務:執行指令、讀取輸出、從錯誤中恢復。如果你在建活在終端機裡的 AI 編碼代理,88.0% 就很重要。
- FrontierCode Diamond 是最難的那一級編碼問題,多數模型在這裡只能拿到個位數分數。29.3 以絕對值來說不算高,但已經是 Opus 4.8 的 13.4 的兩倍多。
- GPQA-AA 是研究所級的科學推理,以 Elo 評分。1932 代表在程式碼之外有強勁的多步驟推理能力。
在我們整個 Opus 4.x 系列的 Claude Code 工作流程中,反覆撞到的天花板是長程代理式任務:模型會在多檔案修改進行到一半時斷線。Fable 5 的 Terminal-Bench 和 SWE-Bench Pro 數字顯示這個天花板被抬高了。它有沒有為你的 repo 抬高,才是唯一算數的測試,但這些已公佈的數字是那種你該在乎的正確數字。
真實測試案例:Fable 5 能做到而先前模型做不到的事
Anthropic 公佈了三個具體範例,展示 Fable 5 現在能處理的問題等級:一個從數個月壓縮到一天的 Stripe 程式碼遷移、一個純靠視覺完成的遊戲,以及一個透過自我驗證達成 3 倍效能躍升的案例。每一個都指向先前模型搆不到的能力。三個都是 Anthropic 提供的;我們引用的是他們的公告,不是我們自己的測試。
以下是每一個案例證明了什麼:
-
Stripe Ruby 遷移。 Anthropic 報告 Fable 5 把一個 Ruby 程式碼遷移從大約兩個月壓縮到約一天。Stripe 把一個 Ruby 遷移從兩個月壓縮到一天,這就是這個模型改變的問題規模。這類長程重構,以前需要一整個團隊把整個程式碼庫裝在腦袋裡才能做。
-
純靠視覺完成 Pokémon FireRed。 根據 Anthropic 的說法,Fable 5 只用視覺就完成了 Pokémon FireRed,而先前的模型需要複雜的自訂框架把遊戲狀態以文字形式餵進去。這是空間和視覺推理的飛躍:模型讀取畫面然後行動,不需要任何鷹架。
-
Slay the Spire,3 倍。 Anthropic 表示,在最大推理強度下,Fable 5 會自我驗證自己的動作,並透過持久記憶達成 3 倍的效能提升。重點不是遊戲本身;而是模型能在長程規劃中檢查自己的工作,並從中改進。
這些都不是你該對自己的工作負載照單全收的東西。但它們和上表的基準躍升乾淨地對應上了:長程編碼(SWE-Bench Pro)、空間推理(視覺)、自我驗證(推理強度旋鈕)。定性上的勝利和定量上的勝利說的是同一個故事。
定價與每任務成本的現實
Fable 5 的價格是每百萬輸入 token $10,每百萬輸出 token $50。Anthropic 把它定位成「不到 Claude Mythos Preview 價格的一半」。同時大約是 Opus 4.8 每 token 的 2 倍。兩個都是事實。問題在於,token 價格是錯誤的單位。你實際付錢買的是完成的任務,而這就是 Fable 5 的數學變得有趣的地方。

推理強度是你每次請求可以設定的旋鈕。低強度意味著更少的內部推理 token,答案更便宜、更快;最大強度意味著模型想更久、花更多輸出 token、分數更高。上圖顯示 Fable 5 在 FrontierCode 上從約 11% 爬到約 31%,隨強度從低到最大擴展,而 Opus 4.8 在約 13% 見頂,GPT-5.5 則平躺在 5-6% 附近。所以每任務成本不是一個數字;它是一條曲線,你在上面選一個點。
讓我們用已公佈的 $10/$50 定價算一個具體範例。這是根據 Anthropic 公佈的費率做的算術,不是基準測試結果。
假設一次代理式呼叫有 50,000 個輸入 token 和 15,000 個輸出 token,高強度:
Input: 50,000 / 1,000,000 × $10 = $0.50
Output: 15,000 / 1,000,000 × $50 = $0.75
Per call: $1.25一個真實的代理式任務會串接很多這樣的呼叫:讀 repo、規劃、編輯、跑測試、修、重複。假設這個迴圈以這種形式跑了 12 次呼叫:完成的任務大約 $15。在最大推理強度、更重的 context 下,Anthropic 自己的成本曲線把困難的 FrontierCode 任務放在接近每任務 $20 的範圍。同樣的任務跑 GPT-5.5,你每 token 付的錢更少。但如果它在任何強度下都完成不了任務,你的每完成任務成本就是無限大。Fable 5 每 token 比 GPT-5.5 貴,但在每完成任務成本上還是贏,因為它能完成 GPT-5.5 做不了的工作。
以下是一個最小呼叫。Anthropic 的公告給的模型 id 是 claude-fable-5;在你正式上線前,請對照 Anthropic API 文件確認精確的版本字串,因為帶日期的別名有時會不同:
import anthropic
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-fable-5", # verify exact dated id in API docs
max_tokens=4096,
thinking={"type": "enabled", "budget_tokens": 8000}, # reasoning effort
messages=[
{"role": "user", "content": "Migrate this module from Ruby 2.7 to 3.3 and run the tests."}
],
)
print(message.content)一句話總結經濟論點:你每 token 付的錢比 GPT-5.5 多,但你能完成 GPT-5.5 在任何價格下都完成不了的任務。對低風險、高量的工作,這筆帳有利於更便宜的模型。對困難的代理式編碼,它有利於 Fable 5。
安全防護的拆分:為什麼 Fable 會退回 Opus 4.8
Fable 5 對每個請求都跑分類器。當它偵測到高風險查詢(攻擊性網路、生物、化學,或模型蒸餾嘗試),它會退回 Opus 4.8,而不是用完整的 Mythos 級能力回答。Anthropic 表示這個退回在不到 5% 的對話中觸發,所以多數使用者永遠不會碰到。重點是把危險能力鎖在門後,同時讓日常工作不受影響。

更硬的數字是攻擊成功率:自動化攻擊者能越獄模型、讓它做不該做的事的頻率。越低越好。Anthropic 的紅隊結果顯示各版本間急劇下降,從 Opus 4.6 的 83.2%,到 Opus 4.7 的 72.7%,到 Opus 4.8 的 56.6%,一路降到 Fable 5 的 5.4%。在自動化紅隊測試下,攻擊對 Fable 5 的成功率只有 5.4%,從 Opus 4.8 的 56.6% 大幅下降。
為什麼你該在乎?如果你部署一個有工具存取權的代理(shell、檔案系統、網路),越獄不是一則糟糕的聊天回覆,而是模型在執行攻擊者引導它去執行的真實指令。5.4% 的攻擊成功率代表它被武器化的難度大約是 Opus 4.8 的十倍。IT Pro 的報導正是以此為頭條:這個退回機制就是讓前沿模型安全到足以交給公眾的功能。
代價是延遲。如果你的工作流程合理地碰到安全工具,退回可能在任務中途觸發,當場幫你換模型,這點要事先規劃。
Claude Mythos 5 與雙重用途問題
Claude Mythos 5 是那個被鎖著的兄弟版本,同一個模型但沒有安全防護退回。它保留了 Fable 5 封鎖的攻擊性網路能力,這正是 Anthropic 不公開釋出它的原因。存取透過 Project Glasswing 進行,這是一個給需要完整能力的防禦者和研究者的審查計畫。同一個模型,兩種發佈姿態:一個開放,一個受限。

這張圖讓限制存取變得可見。在攻擊性網路評估(Firefox、OSS-Fuzz、CyberGym、CyScenarioBench)上,Mythos 5 分別拿下 88.4、24.0、83.8 和 38.7。Fable 5 在四項上全部回傳平坦的 0.0。在攻擊性網路評估上,Mythos 5 最高拿到 88.4,而 Fable 5 回傳平坦的 0.0:安全防護的拆分,就這樣被看見了。
那個零不是能力差距。它是退回每次都觸發,在 Mythos 級模型回答之前就把請求擋下來。TechCrunch 注意到了時間點:Anthropic 在警告 AI 已經危險到不該開放釋出之後沒幾天,就推出了這個。Fable/Mythos 的拆分就是對那個警告的政策回應——發佈能力,鎖住危險。
對多數開發者來說,Mythos 5 跟你無關。你永遠不會符合 Project Glasswing 的資格,你也不需要。重要的是要知道,你呼叫的這個模型在一小塊任務上是被刻意設限的,這是設計使然。
這代表什麼:你該切換嗎?
為了困難的代理式編碼、長程多步驟任務,以及視覺或空間推理,切換到 Fable 5——任何完成任務比省每 token 幾毛錢更重要的場景。為了成本敏感的高量工作,或任何反正會觸發退回的東西,留在 Opus 4.8。這就是整個框架。剩下的就是把你的工作負載對到正確的那一邊。
Fable 5 贏的場景:
- Opus 4.8 會卡住的困難代理式編碼;SWE-Bench Pro 的差距是真的
- 自我驗證有回報的長程任務(多檔案重構、遷移)
- 視覺和空間推理工作負載
- 任何一個完成的任務比 token 溢價更值錢的工作
Opus 4.8 仍然贏的場景:
- 每 token 價格主導的高量、成本敏感工作
- 網路/生物/化學工作負載,Fable 5 反正會退回 Opus 4.8,所以直接呼叫它
- 不能容忍任務中途換模型的延遲敏感流程
| 使用場景 | 建議模型 |
|---|---|
| 困難代理式編碼/遷移 | Claude Fable 5 |
| 視覺/空間推理 | Claude Fable 5 |
| 高量低成本分類 | Claude Opus 4.8 |
| 安全/紅隊工具 | Claude Opus 4.8(直接呼叫) |
關於可用性:Fable 5 在 Pro/Max/Team/Enterprise 方案上免費使用至 2026 年 6 月 22 日,6 月 23 日起開始扣用量額度。它在 API、AWS Bedrock、GitHub Copilot(根據 GitHub 更新日誌)和 Harvey 上全面可用。所以你今天就能在你的編輯器裡測試切換,不用動你的帳單。
關於作者
Mert Batur Gurbuz 是 Techsy.io 的共同創辦人,團隊為 B2B 客戶打造 AI 代理、自動化系統和語音/SDR 流水線。他就讀於 University of Birmingham,撰寫關於 Techsy 團隊在生產環境中實際使用的 LLM 工具棧的文章。在 LinkedIn 上聯繫。
共同創辦人,Techsy.io · University of Birmingham
常見問題
Claude Fable 5 是什麼?
Claude Fable 5 是 Anthropic 第一個公開可用的 Mythos 級模型,於 2026 年 6 月 9 日推出。它在 SWE-Bench Pro 上拿下 80.3%,並運行安全分類器,在高風險查詢時退回 Opus 4.8。定價為每百萬 token 輸入 $10/輸出 $50。
Fable 5 和 Mythos 5 有什麼不同?
它們是同一個前沿模型,只是發佈姿態不同。Fable 5 是公開的、帶安全防護的;它在危險查詢時退回 Opus 4.8。Mythos 5 是受限的完整能力版本,只能透過 Anthropic 的 Project Glasswing 計畫存取,對象是經過審查的防禦者和研究者。
Claude Fable 5 真的比 Opus 4.8 好嗎?
在困難代理式編碼、視覺和空間推理上是的:Fable 5 在 SWE-Bench Pro 上拿下 80.3%,對比 Opus 4.8 的 69.2%。但 Opus 4.8 在成本敏感的高量工作上仍然贏,而且 Fable 5 在高風險的網路/生物/化學主題上反正會退回 Opus 4.8。「更好」取決於你的工作負載。
Claude Fable 5 多少錢?
Claude Fable 5 每百萬輸入 token $10,每百萬輸出 token $50。Anthropic 的定位是「不到 Mythos Preview 價格的一半」。大約是 Opus 4.8 每 token 的 2 倍,但價值主張是每完成任務的成本,因為 Fable 5 能完成更便宜的模型做不了的工作。
「Mythos 級」模型是什麼?
Mythos 級是 Anthropic 全新的最高能力等級,隨 Fable 5 和 Mythos 5 一同推出。它代表在編碼和推理基準上相較 Opus 4.x 系列的前沿躍進。Fable 5 和 Mythos 5 是同一個 Mythos 級模型的兩個發佈版本:一個公開帶安全防護,一個受限。
為什麼 Fable 5 會退回 Opus 4.8?
Fable 5 運行分類器偵測高風險請求(攻擊性網路、生物、化學,或模型蒸餾),並把它們轉交給 Opus 4.8,而不是用完整的 Mythos 級能力回答。這在不到 5% 的對話中觸發。它把對抗性攻擊成功率從 56.6%(Opus 4.8)降到 5.4%。
我能存取 Claude Mythos 5 嗎?
大概不行。Mythos 5 被鎖在 Project Glasswing 後面,這是 Anthropic 給需要 Fable 5 所封鎖的完整攻擊性網路能力的防禦者和安全研究者的審查存取計畫。多數開發者不會符合資格,也不需要,因為 Fable 5 涵蓋了日常的代理式和編碼工作。
我可以在哪裡使用 Claude Fable 5?
Claude Fable 5 在 Anthropic API、AWS Bedrock、GitHub Copilot 和 Harvey 上全面可用。在 Pro、Max、Team 和按席位計費的 Enterprise 方案上免費使用至 2026 年 6 月 22 日;6 月 23 日起開始扣用量額度。你今天就能在你的編輯器或透過 API 測試它。
底線
Claude Fable 5 是相較 Opus 4.8 的真正前沿躍進:SWE-Bench Pro 80.3% 對 69.2%,FrontierCode 分數翻倍,攻擊成功率 5.4% 讓它搭配工具部署時安全得多。為了困難代理式編碼、長程任務和視覺工作而切換。為了成本敏感的量或任何反正會觸發退回的東西,留在 Opus 4.8。6 月 22 日之前免費,所以你可以在花任何錢之前測試切換。Techsy 團隊正是在這個技術棧上打造生產環境的代理,如果你需要幫忙,聯繫我們。