Techsy
聯絡我們
立即開始
回到部落格
ai-machine-learning

Claude Opus 4.8 登場:變了什麼、哪裡變強(以及唯一落敗的一項)

作者: Mert Batur Gürbüz
May 28, 2026
4 分鐘閱讀
目錄
Claude Opus 4.8 登場:變了什麼、哪裡變強(以及唯一落敗的一項)

Claude Opus 4.8 登場:變了什麼、哪裡變強(以及唯一落敗的一項)

Anthropic 於 2026 年 5 月 28 日推出 Claude Opus 4.8,距離 4.7 僅 41 天。這是我們見過最快的 Opus 更新節奏。 headline 數字——SWE-Bench Pro 的 69.2%——是真實的,但代價也真實存在:它在一項基準測試中徹底落敗。以下是實際變化,以及你該今天就切換預設模型,還是再等等。

重點整理:

  • Claude Opus 4.8 於 2026 年 5 月 28 日推出,距 4.7 僅 41 天,已登陸 Claude.ai、Claude Code 與 API。
  • 它在 Anthropic 的 7 項基準測試中領先 6 項,但在 Terminal-Bench 2.1 輸給 GPT-5.5(74.6% 對 78.2%)。
  • 定價維持不變,每百萬 token 為 $5/$25;全新的 Fast Mode 速度快約 2.5 倍,定價 $10/$50。

今天发布了什麼:一分鐘認識 Claude Opus 4.8

Claude Opus 4.8 是 Anthropic 的旗艦模型,於 2026 年 5 月 28 日發布,今天即可在 Claude.ai、Claude Code 與 API 上使用。模型 ID 為 claude-opus-4-8,另有 100 萬 token 上下文版本 claude-opus-4-8[1m]。標準定價與 4.7 相同,維持每百萬 token $5/$25。簡短結論:對程式設計與知識工作而言是實質升級,只有一個誠實的例外。

這是一次增量式發布,而非從零重建。如果你從 Claude Opus 4.7 過來,你已熟悉的大部分都沿用:API 結構、effort-control 概念、Claude Code 整合。不同的是基準測試的上限、更便宜的 Fast Mode,以及一項針對程式碼庫規模工作的全新研究預覽功能。

Opus 4.8 距離 4.7 僅 41 天,是 Anthropic 歷來最快的 Opus 更新節奏。100 萬 token 上下文版本以 claude-opus-4-8[1m] 存在,不過公開的 Models-overview 文件頁面可能還在更新中。根據 Anthropic 的公告,這是他們迄今「最誠實」的模型——這個說法我們稍後會再談。

Opus 4.8 相較 4.7 到底新在哪裡?

4.7 到 4.8 最大的變化在於對齊、工具呼叫效率,以及一項全新的協同編排功能。Anthropic 表示,Opus 4.8 放過自身程式碼缺陷而不標記的機率約為 4.7 的 四分之一,能以更少步驟完成代理式任務,並引入用於大規模遷移的 Dynamic Workflows。定價與核心 API 維持不變。

誠實度與對齊

根據其公告,Opus 4.8 更願意標記不確定性、避免無根據的宣稱,並指出它剛寫出的程式碼中的問題。Anthropic 表示不對齊行為的發生率「大幅低於 Opus 4.7」,並引用 Bridgewater 的客戶見證,提到該模型會主動提出問題。對任何依賴 AI 來發現程式碼缺陷的人而言,「放過缺陷的機率降低 4 倍」這個數字最值得關注。在你用自己的 pull request 測試之前,先把它視為廠商的宣稱。

Effort control 與 Messages API 的變更

Effort 等級現在可直接在 Claude.ai 上由使用者選擇,讓你無須降級到較小的模型,就能以 token 花費換取深度。此外還有一項小但實際的開發者體驗變更:Messages API 現在接受在 messages 陣列內放入 system 項目,而不僅限於頂層的 system 參數。如果你在建置代理,這會讓對話中的 system 指令更易管理。

更有效率的工具呼叫

Anthropic 將工具呼叫描述為「明顯更有效率——同樣的智慧,更少的步驟」,這是在 CursorBench 上跨各 effort 等級測得的結果。在他們內部的 Super-Agent 基準測試中,他們表示 Opus 4.8 是唯一能在與 GPT-5.5 成本相當的情況下,端到端完成所有案例的模型。每個任務更少的工具呼叫,對代理開發者而言是直接的コスト槓桿,所以這件事比聽起來更重要。

Opus 4.8 基準測試:哪裡獲勝(以及唯一落敗的一項)

Opus 4.8 在 7 項中的 6 項 Anthropic 基準測試中領先,包括 SWE-Bench Pro(69.2%)與 GDPval-AA(1890 Elo)。唯一的例外,也是必須誠實面對的一項:GPT-5.5 仍在 Terminal-Bench 2.1 的代理式終端程式設計中勝出,以 78.2% 擊敗 Opus 4.8 的 74.6%。所以如果你的工作都在終端機裡,整體最佳的模型對你而言並非最佳。

基準測試Opus 4.8Opus 4.7GPT-5.5Gemini 3.1 Pro
代理式程式設計,SWE-Bench Pro69.2%64.3%58.6%54.2%
代理式終端程式設計,Terminal-Bench 2.174.6%66.1%78.2%70.3%
多學科推理,Humanity's Last Exam(無工具)49.8%46.9%41.4%44.4%
多學科推理,Humanity's Last Exam(有工具)57.9%54.7%52.2%51.4%
代理式電腦操作,OSWorld-Verified83.4%82.8%78.7%76.2%
知識工作,GDPval-AA(Elo)1890175317691314
代理式財務分析,Finance Agent v253.9%51.5%51.8%43.0%

Claude Opus 4.8 與 Opus 4.7、GPT-5.5、Gemini 3.1 Pro 在 SWE-Bench Pro、Terminal-Bench 2.1、Humanity's Last Exam、OSWorld-Verified、GDPval-AA 與 Finance Agent v2 上的基準測試比較
Source: Anthropic

要看差距,而不只是絕對分數。SWE-Bench Pro 躍升 +4.9 分(64.3 到 69.2),是 headline 級的程式設計增益。Terminal-Bench 2.1 上升 +8.5 分(66.1 到 74.6),是 4.7 到 4.8 之間最大的單項躍升,卻仍然落後 GPT-5.5。GDPval-AA 增加 +137 Elo(1753 到 1890),是知識工作上的大幅躍升,也以明顯差距超越 GPT-5.5(1769)。OSWorld-Verified 僅移動 +0.6(82.8 到 83.4);電腦操作在 4.7 上已接近上限,所以別期待在那裡感受到差異。Finance Agent v2 增加 +2.4 分。

結論很乾淨:Opus 4.8 贏得七項基準中的六項,而它輸掉的那一項——代理式終端程式設計——仍由 GPT-5.5 拿下。這些數字經 Anthropic 公告與 OfficeChai 基準測試匯整證實。

Fast Mode 是什麼,比較便宜嗎?

Fast Mode 讓 Opus 4.8 以每百萬 token $10 輸入 / $50 輸出的價格,跑出約 2.5 倍的速度,在 Claude Code 中以 /fast 啟用。Anthropic 表示它「比先前模型便宜三倍」。標準定價維持每百萬 token $5/$25,與 4.7 相同。關鍵重點:Fast Mode 讓你留在完整的 Opus 模型上,不會把你降級到較小的模型。

那麼這對每個任務代表什麼?你以 2 倍的價格溢價,換取約 2.5 倍的速度,模型智慧相同。對需要等待輸出的互動式 Claude Code 工作階段而言,這筆交易往往划算。對實際耗時無關緊要的長時間批次作業而言,標準定價是較便宜的選擇。

bash
# In a Claude Code session, switch the current task to Fast Mode:
/fast

# Output streams ~2.5x faster on the same claude-opus-4-8 model.
# Standard pricing ($5/$25) resumes on your next normal task.

Fast Mode 更廣泛的 API 存取會透過你的客戶經理或候補名單推出。如果你已經碰到速率上限,我們的 Claude 用量限制指南說明了各方案等級如何與成本交互作用。一個誠實的提醒:「比之前便宜 3 倍」指的是 Fast Mode 本身相較於舊的 Fast 方案變便宜了,而不是說它比標準 Opus 定價便宜。它並沒有。

Dynamic Workflows:以平行子代理進行程式碼庫規模的遷移

Dynamic Workflows 是 Enterprise、Team 與 Max 方案上的研究預覽功能,可協調「子代理群」——單一工作階段中數百個平行子代理。搭配 Claude Code 與 Opus 4.8,Anthropic 表示它能跨數十萬行程式碼執行程式碼庫規模的遷移,從啟動一路到合併,幾乎無須人工看管。

Dynamic Workflows 讓單一 Claude Code 工作階段能展開為數百個平行子代理,遷移整個程式碼庫。想像框架升級、依賴全面翻新,或通常會吃掉工程師一整週的全倉庫重構。如果你用過平行程式設計代理,這就是那個概念的規模化版本,而且由模型而非你來協同編排。

兩個誠實的提醒。第一,它是研究預覽,所以要有碰到毛邊的預期,未經審查別把它指向關鍵生產環境的遷移。第二,它有方案限制——你需要 Enterprise、Team 或 Max 存取權。TechCrunch 將 Dynamic Workflows 描述為 Anthropic 對競爭實驗室壓力的回應,這個解讀合理:它是本次發布的 headline 開發者功能。

我們在 Claude Code 實測 Opus 4.8:以下是我們測到的結果

我們將內容產線倉庫的預設模型從 claude-opus-4-7 切換為 claude-opus-4-8,並重新執行我們日常使用的相同代理式任務。以下是早期實際使用後我們能誠實說的部分——沒有明確前後數據的地方屬質性描述,有數據的地方則具體說明。

首先,切換真的輕而易舉。將模型 ID 改為 claude-opus-4-8 並啟動工作階段,在我們這邊完全無須任何設定變更即可運作。如果你需要更大的上下文視窗,100 萬上下文版本可透過 claude-opus-4-8[1m] 指定。我們確認以 /fast 啟用 Fast Mode 會讓你留在完整的 Opus 模型上,而非悄悄路由到較小、較便宜的模型——這是我們想要的行為,但我們並未事先假設它如此。

早期使用中脫穎而出的一點:Opus 4.8 明顯更願意反駁。在一項重構任務中,它將我們既有程式碼中的一個假設標記為有風險,而非默默在其上繼續建置——這正是 Anthropic「放過缺陷的機率降低 4 倍」宣稱所預測的那類行為。我們不會把它包裝成基準測試,那只是單一任務上的一次觀察。但它是我們第一個注意到的事,而且與對齊的敘述一致。

Fast Mode 的加速在互動式工作階段中真實且明顯——輸出開始串流的速度更快,不過在我們完成乾淨、可重複的計時測試之前,不會發布精確的延遲數字。如果你要自己做比較,誠實的方法是:相同提示、相同倉庫狀態,先標準模式再 /fast,並同時測量兩種方式的實際耗時與 token 成本。一旦該測試定案,我們會用實際數字更新這一節。

該從 4.7 升級嗎?(立即切換/觀望/留下)

是否升級完全取決於你的工作負載,而非哪個模型「整體獲勝」。SWE-Bench Pro 與 GDPval-AA 的躍升幅度大且真實,所以程式設計與知識工作使用者應該切換。重度使用終端的團隊有充分理由觀望。對成本敏感、處理接近上限任務的使用者,可以留在 4.7,幾乎沒有損失。

立即切換,如果: 你的工作依賴代理式程式設計(SWE-Bench Pro +4.9)或知識任務(GDPval-AA +137 Elo)。這些是最大的實質增益,而在我們的測試中,SWE-Bench 的躍升在實際 PR 上表現為更少的錯誤方向。定價沒變,所以升級沒有成本代價。

觀望,如果: 你的工作流程重度使用終端——GPT-5.5 仍在 Terminal-Bench 2.1 領先(78.2% 對 74.6%),所以「最佳模型」的框架還不適用於你。如果你正處於專案中途,切換模型會混淆你的評估,也該觀望。

留在 4.7,如果: 你對成本敏感,而你的使用情境已接近上限,例如電腦操作——OSWorld-Verified 僅移動 +0.6。你會為了感受不到的差距,付出切換注意力的成本。

如果你的工作依賴 SWE-Bench 類型的程式設計或知識任務,4.8 是明確的升級;如果重度使用終端,GPT-5.5 可能仍略勝一籌。要看更廣泛的格局,請見 Opus 4.8 在最佳 AI 程式設計代理中的位置,並查看 4.7 發布以了解完整的差距全貌。

如何在 Claude Code 與 API 中切換到 Opus 4.8?

切換是近乎輕而易舉的模型 ID 替換。將預設模型設為 claude-opus-4-8(或 100 萬上下文視窗的 claude-opus-4-8[1m]),如果你的用戶端有顯示 effort 等級就選一個,然後就完成了。如果你用 Messages API 建置,現在可以將 system 項目放在 messages 陣列內,而不僅限於頂層的 system 欄位。

bash
# Claude Code: set the default model
/model claude-opus-4-8

# API request body (model ID swap):
{
  "model": "claude-opus-4-8",
  "messages": [
    { "role": "system", "content": "You are a senior engineer." },
    { "role": "user", "content": "Refactor this module." }
  ]
}

對多數團隊而言,這就是整個遷移。如果你跨多個供應商執行模型,並想在自己的任務上測試 4.8 對上 GPT-5.5 或 Gemini 3.1 Pro,代理伺服器能讓你在模型之間路由,無須重寫你的應用程式。先從標準模式開始,在你的真實工作負載上確認輸出品質,再決定 Fast Mode 以價換速的交易是否值得。

我們在 Techsy 正是用這套技術建置生產環境的 AI 代理。如果你正在為代理建置選擇模型,預約免費諮詢,我們會幫你為工作負載挑出合適的模型。

關於作者

Mert Batur Gurbuz 是 Techsy.io 的共同創辦人,團隊為 B2B 客戶建置 AI 代理、自動化系統與語音/SDR 流程。他就讀於 University of Birmingham,並撰寫 Techsy 團隊在生產環境中實際使用的 LLM 工具技術文章。

共同創辦人,Techsy.io,University of Birmingham · LinkedIn

常見問題

Claude Opus 4.8 是什麼?

Claude Opus 4.8 是 Anthropic 的旗艦模型,於 2026 年 5 月 28 日發布,模型 ID 為 claude-opus-4-8,另有 100 萬上下文版本 claude-opus-4-8[1m]。Anthropic 將其定位為迄今最誠實的模型,在其公布的 7 項基準測試中領先 6 項,並可在 Claude.ai、Claude Code 與 API 上使用。

Claude Opus 4.8 何時發布?

Claude Opus 4.8 於 2026 年 5 月 28 日發布,距離 Opus 4.7 僅 41 天,是 Anthropic 歷來最快的 Opus 更新節奏。它在同一天於 Claude.ai、Claude Code 與 Anthropic API 全面上線,沒有分階段推出,所以你可以立即切換預設模型。

Claude Opus 4.8 比 Opus 4.7 更好嗎?

對多數工作而言,是的。Opus 4.8 在 SWE-Bench Pro 以 69.2% 領先 64.3%,在 GDPval-AA 增加 +137 Elo,並在對上 4.7 的 7 項基準中贏得 6 項。例外是代理式終端程式設計,GPT-5.5 的分數仍高於兩者。定價維持不變,所以升級沒有成本代價。

從 4.7 升級到 Opus 4.8 值得嗎?

取決於你的工作負載。如果你做代理式程式設計或知識工作,立即切換——那裡的增益最大。如果你的工作重度使用終端,就觀望,因為 GPT-5.5 仍在那裡領先。如果你對成本敏感、處理接近上限的任務(如電腦操作,差距僅 +0.6 分),就留在 4.7。

Claude Opus 4.8 多少錢?

標準定價為每百萬輸入 token $5、每百萬輸出 token $25,與 Opus 4.7 相同,所以沒有漲價。Fast Mode 每百萬 token 為 $10/$50,在同一模型上跑出約 2.5 倍的速度。Anthropic 表示 Fast Mode 比先前的 Fast-Mode 方案便宜三倍。

Claude Opus 4.8 的 Fast Mode 是什麼?

Fast Mode 是高速方案,讓 Opus 4.8 以每百萬 token $10 輸入 / $50 輸出的價格跑出約 2.5 倍的速度,在 Claude Code 中以 /fast 啟用。關鍵是,它讓你留在完整的 claude-opus-4-8 模型上,而非降級到較小的模型。Anthropic 表示它比先前的 Fast-Mode 方案便宜三倍。

Claude Code 中的 dynamic workflows 是什麼?

Dynamic Workflows 是 Enterprise、Team 與 Max 方案上的研究預覽功能,可在單一工作階段中協調數百個平行子代理。搭配 Claude Code 與 Opus 4.8,它能跨數十萬行程式碼執行程式碼庫規模的遷移,從啟動到合併。由於仍是預覽版,要有碰到毛邊的預期。

Opus 4.8 支援 100 萬 token 上下文視窗嗎?

支援,透過 claude-opus-4-8[1m] 版本。當你需要更大的上下文視窗時,以該模型 ID 指定即可。請注意,公開的 Models-overview 文件頁面可能還在更新中,尚未列出 4.8 項目,但該版本今天即可在執行時指定。

Claude Opus 4.8 真的在所有項目都擊敗 GPT-5.5 嗎?

沒有。GPT-5.5 仍在 Terminal-Bench 2.1 的代理式終端程式設計中勝出,以 78.2% 擊敗 Opus 4.8 的 74.6%。Opus 4.8 領先其他六項公布的基準測試,包括 SWE-Bench Pro 與 GDPval-AA,但如果你的工作流程重度使用終端,對該特定任務而言 GPT-5.5 仍是較強的選擇。

如何在 Claude Code 中切換到 Opus 4.8?

將模型設為 claude-opus-4-8(在 Claude Code 中使用 /model claude-opus-4-8),如果你的用戶端有提供就選一個 effort 等級。100 萬上下文視窗請使用 claude-opus-4-8[1m]。對多數團隊而言,這是近乎輕而易舉的替換,無須其他設定變更。

標籤

Claude Opus 4.8claude-opus-4-8claude codeanthropicopus 4.8 vs 4.7

分享這篇文章

相關文章

更多「%s」主題文章 ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 正式登場:以半價逼近 Fable 5 的智慧

Anthropic 於 2026 年 7 月 24 日發布 Claude Opus 5。它在 Frontier-Bench 上將 Opus 4.8 的成績翻倍有餘,並維持 Opus 定價,但在部分測試中敗給 Fable 5 與 Mythos 5。以下是基準測試表、定價,以及切換/觀望/留下的建議。

10 min read 分鐘閱讀
繼續閱讀
ai-machine-learning
Jul 20, 2026

2026 年 8 大 AI 網頁爬蟲 API(在我們自己的 Agent 架構上實測)

我們透過自己的 Agent 架構抓取真實 2026 年定價,實測了 8 款 AI 網頁爬蟲 API。Firecrawl、Bright Data、ScrapingBee 等 5 家以上業者,依 LLM 就緒輸出、反爬蟲能力與 MCP 支援進行排名。

9 min read 分鐘閱讀
繼續閱讀
ai-machine-learning
Jul 20, 2026

程式碼提示工程:我們在 Claude Code 與 Cursor 中每日使用的 7 種模式(2026)

大多數「AI 程式碼提示」文章只會給你 50 個可複製的範本。本文將教導我們每天用於運行 16 個代理人的 Claude Code 流水線的 7 種模式,每種模式都附有真實的前後對比,並說明在 2026 年這些模式如何應用於 Claude Code、Cursor 和 Copilot。

11 min read 分鐘閱讀
繼續閱讀
查看全部文章
啟動專案

準備好創造點什麼了嗎 非凡體驗?

讓我們將你的願景化為現實。團隊已準備好,助你打造真正有影響力的軟體。

預約 30 分鐘需求討論查看作品

精選上架

Claude 技能

查看全部
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI 自動化作業

查看全部
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

精選上架

Claude 技能

查看全部
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI 自動化作業

查看全部
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

服務項目

  • 企業級解決方案
  • 手機應用程式
  • 網頁應用

解決方案

  • CRM 系統
  • AI 整合應用
  • ERP 整合系統
  • 語音助理代理
  • 工作流程自動化
  • 網路資安

資源庫

  • 部落格
  • 專案作品

社群

  • AI 自動化作業
  • Claude 技能

工具

  • 手機應用程式開發費用計算器
  • OpenAI / LLM API 費率計算器
  • MVP 開發費用計算器
  • 語音 AI 助理費用計算器

關於 TECHSY

  • 瀏覽
  • 合作夥伴
  • 聯絡我們

法律聲明

  • 私隱政策
  • 服務條款
  • Cookies說明

服務項目

  • 企業級解決方案
  • 手機應用程式
  • 網頁應用

解決方案

  • CRM 系統
  • AI 整合應用
  • ERP 整合系統
  • 語音助理代理
  • 工作流程自動化
  • 網路資安

資源庫

  • 部落格
  • 專案作品

社群

  • AI 自動化作業
  • Claude 技能

工具

  • 手機應用程式開發費用計算器
  • OpenAI / LLM API 費率計算器
  • MVP 開發費用計算器
  • 語音 AI 助理費用計算器

關於 TECHSY

  • 瀏覽
  • 合作夥伴
  • 聯絡我們
法律聲明私隱政策服務條款Cookies說明
TECHSY
© 2026 Techsy.保留所有權利。