
Claude Opus 5が登場:Fable 5に迫る知能を半額で
Anthropicは2026年7月24日にClaude Opus 5をリリースした。その売り文句は率直だ。Fable 5のフロンティア知能にほぼ匹敵し、価格は半分。決定的な証拠はFrontier-Bench v0.1で、Opus 5は43.3%を記録し、Opus 4.8の21.1%を2倍以上上回った。ただし、常にそうであるように落とし穴がある。すべてに勝てるわけではない。GPT-5.6 Solはエージェント型コーディングテストの1つで依然として上回り、健康・生物学ではMythos 5が王座を握る。実際に何が変わったのか、完全なベンチマーク表、そして今すぐデフォルトモデルを切り替えるべきかを整理する。
要点:
- Claude Opus 5は2026年7月24日にClaude API、Claude.ai、Claude Code、Claude Coworkでリリースされ、モデルIDは
claude-opus-5。 - Anthropicが公開するベンチマークの大半(Frontier-Bench、GDPval-AA、ARC-AGI-3、OSWorld 2.0、AutomationBench)でトップだが、コーディング・法律・科学テストの一部では劣後。
- 価格はOpus 4.8から据え置きの100万トークンあたり5ドル/25ドル。Fastモードは約2倍の価格で約2.5倍の速度。
今日何がリリースされたか:Claude Opus 5を1分で
Claude Opus 5はAnthropicの新しいフロンティアモデルで、2026年7月24日にリリースされ、同日中にAPI、Claude.ai、Claude Code、Claude Coworkで利用可能になった。モデルIDはclaude-opus-5。発表によれば、Anthropicの位置づけは「Claude Fable 5のフロンティア知能に半額でほぼ匹敵する」というもの。標準価格は入力100万トークンあたり5ドル/出力25ドルで、Opus 4.8と同じ。
これはポイントリリースではなく、エージェントワークにおける本物の世代交代だ。Claude Opus 4.8から移行する場合、APIの形状とClaude Code統合はそのまま引き継がれるため、移行はモデルIDの差し替えだけ。違うのは天井だ。Frontier-Bench v0.1でAnthropicはOpus 5が4.8のスコアを2倍以上に引き上げ、タスクあたりのコストも低いと述べており、GDPval-AAとARC-AGI-3では最高水準の数値を記録している。
ポジショニングが重要だ。Fable 5はAnthropicで最も高価なフロンティアモデル。それにOpus価格で肉薄できることがこのリリースの全物語であり、だからこそ「半額」という言葉がAnthropicの筆頭メッセージになっている。
Opus 5 vs 4.8:実際に何が新しいのか?
4.8から5への最大の変化は判断力だ。Opus 5は自分の作業を検証し、タスクが本当に完了するまで反復する能力が著しく向上した。もっともらしく仕上がっただけで終わらない。Anthropicはソフトウェアエンジニアリング、ナレッジワーク、科学研究の強化に加え、視覚出力の改善も挙げている。価格とコアAPIは据え置き。
判断力と自己検証の向上
最も明確な行動変化は、Opus 5が自分自身をチェックすることだ。AnthropicはテクニカルスタッフのZimu Li氏の言葉を引用し、このモデルを「分岐を検証し、テンプレートを確認する」と表現している。猛進するのではなく、だ。本番環境でエージェントが自分のミスを検出することに依存している誰にとっても、これが針を動かす特性だ。ただし、ベンチマークチャートで最も売りにくい特性でもあるため、自分のタスクで検証すべき主張として扱うのがよい。
Opusコストでフロンティア知能を
Cursorの共同創業者Sualeh Asif氏はこのリリースを「Opusの速度とコストでFable 5に近い知能」と要約した。それが実用的な読み方だ。Fable 5クラスの推論力を求めながら価格を正当化できなかったチームに、中間の選択肢ができた。OSWorld 2.0では、AnthropicによればOpus 5はFable 5の約3分の1のコストで上回っており、これが価値の主張を最も端的に示す単一の例だ。
アライメントと安全性の姿勢
AnthropicはOpus 5が過去最低の非整合行動スコア(2.3)を記録し、Constitutionに最も整合したモデルだと報告している。セキュリティ面では、サイバーセキュリティ分類器はFable 5のものと比べて約85%制限が緩いと説明され、必要なチーム向けにエンタープライズCyber Verification Programが用意されている。あらゆるベンダーの安全性主張と同様、知っておく価値はあるが、自社のレッドチームケースで検証する価値もある。
Opus 5のベンチマーク:勝つ場所(と負ける場所)
Opus 5はAnthropicが公開するベンチマークの大半でリードしており、エージェントビルダーにとって重要な勝利は圧勝だ。Frontier-Bench v0.1(43.3%)、GDPval-AA(1861 Elo)、ARC-AGI-3(30.2%)、OSWorld 2.0(70.6%)、ZapierのAutomationBench(26.0%)。正直な例外:GPT-5.6 SolがDeepSWE v1.1で勝ち、Fable 5がFrontierCodeと法律テストで僅差で上回り、Mythos 5が健康・生物学を取る。
| ベンチマーク | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|
| エージェント型ターミナルコーディング、Frontier-Bench v0.1 | 43.3% | 33.7% | 21.1% | 34.4% |
| ナレッジワーク、GDPval-AA v2(Elo) | 1861 | 1747 | 1593 | 1736 |
| 新規問題解決、ARC-AGI-3 | 30.2% | — | 1.5% | 7.8% |
| エージェント型検索、BrowseComp | 90.8% | 87.4% | 84.3% | 90.4% |
| 学際的推論、Humanity's Last Exam(ツール使用) | 64.7% | 63.9% | 57.9% | — |
| エージェント型コンピュータ操作、OSWorld 2.0 | 70.6% | 66.1% | 55.7% | 62.6% |
| エージェント型コーディング、DeepSWE v1.1 | 68.8% | 69.7% | 59.0% | 72.7% |
| エージェント型コーディング、FrontierCode v1.1(Main) | 53.4% | 53.5% | 46.5% | 47.5% |
| ビジネスワークフロー、AutomationBench | 26.0% | 17.4% | 17.0% | 18.1% |
| Legal Agent Benchmark(ホールドアウト) | 11.7% | 13.3% | 10.4% | 2.5% |
| 健康、HealthBench Professional | 59.8% | 66.0% | 57.4% | 60.5% |
| 生物学、BioMysteryBench(高難度) | 49.4% | 46.5% | 42.4% | — |

絶対スコアだけでなく差分を読め。Frontier-BenchはOpus 4.8から**+22.2ポイント**(21.1から43.3へ)跳躍し、これが最大の単一飛躍であり、Anthropicがこれをコーディング・エージェントのリリースと呼ぶ理由だ。GDPval-AAは**+268 Elo**(1593から1861へ)上昇し、ナレッジワークで表内の全モデルをクリアした。ARC-AGI-3は目を引く。GPT-5.6 Solの7.8%、Opus 4.8の1.5%に対して30.2%で、Anthropicは新規問題解決で公開モデル中次点の約3倍と位置づけている。AutomationBenchでは26.0%がフィールドの約1.5倍で、ビジネスプロセスエージェントを構築する誰にとっても直接的なシグナルだ。
敗北について正直に2点。第一に、健康(66.0%)と生物学の人間解決スプリットでFable 5欄のリーダーは実際にはMythos 5——Anthropicの科学特化モデル——であり、Fable 5ではないため、これらは同条件の汎用モデル間の勝利ではない。第二に、コーディングの状況は genuinely 分かれている。GPT-5.6 SolがDeepSWE v1.1を取り(72.7% vs 68.8%)、Fable 5がFrontierCodeを僅差で制する(53.5% vs 53.4%)。あなたの作業が純粋なSWE-benchスタイルのコーディングなら、「総合最高」のラベルは自動的にOpus 5を選ばない。
Opus 5のコストは?価格とFastモード
Opus 5の標準価格は入力100万トークンあたり5ドル、出力100万トークンあたり25ドルで、Anthropicの公開価格によればOpus 4.8と同一。アップグレードによる値上げはない。「半額」の主張はFable 5に対するもので、4.8に対するものではない。Fable 5の料金を払わずにFable 5級の知能が得られるということだ。Fastモードは基本価格の約2倍でデフォルト速度の約2.5倍で動作し、APIはフォールバックルーティングをサポートする。
ではタスクあたり何を意味するか?標準価格では4.8に対して追加コストゼロで大幅な能力向上が得られ、ほとんどのワークロードでアップグレードはほぼ無料になる。Fastモードはインタラクティブセッションのレバーだ。同じモデルで出力が約2.5倍速くストリームされる代わりに2倍の価格プレミアムを払う。待っているときには報われるが、実時間性能が関係ない夜間バッチでは痛い。レート制限が本当の制約なら、Claudeの使用制限ガイドがティアとコストの相互作用をカバーしている。
# Claude Code: point your default model at Opus 5
/model claude-opus-5
# API request body (model ID swap):
{
"model": "claude-opus-5",
"messages": [
{ "role": "user", "content": "Refactor this module and verify the tests pass." }
]
}本番エージェントにとってOpus 5はどこに位置するか
ゲインは本番エージェントが生きる場所に正確に集中している。ターミナルコーディング(Frontier-Bench)、コンピュータ操作(OSWorld 2.0)、エージェント型検索(BrowseComp)、マルチステップのビジネスワークフロー(AutomationBench)。この4つは実際の本番環境で最も頻繁に壊れるワークロードであり、4つすべてで同時に跳躍するモデルは、出荷可能なものの範囲を変える。
そこが腰を据えて考える価値のある部分だ。AutomationBenchのようなベンチマークは、エージェントが実際のマルチツールワークフローをエンドツーエンドで完了できるかを測定する。Opus 5の26.0%対フィールドの約17%は、「デモでは映える」と「散らかったCRMとの接触に耐える」の差だ。OSWorld 2.0の結果(70.6%、Fable 5の3分の1のコストで上回る)は、実際のソフトウェアをクリックして操作するコンピュータ操作エージェントでも同じことを語る。顧客向けAIエージェントを出荷するチームにとって、これらは深夜2時の障害を減らす数字だ。
また、私たちが重視する設計パターンのコストも下げる。安価な自己検証だ。モデルが自分の分岐をチェックする能力が本当に向上すれば、別の批評家パスに使うトークンを減らしても同じエラーを捕捉できる。大量にエージェントを運用する誰にとっても、これは実際の予算項目だ。
私たちのスタックにOpus 5をどう組み込んでいるか
私たちはTechsyでClaudeスタック上に本番AIエージェントを構築・運用しているため、フロンティアリリースは同日評価の対象であり、読んで終わるニュースではない。正直な第一印象を、クリーンな前後比較の数値がまだない部分は定性的に、ある部分は具体的に述べる。
差し替え自体は些細で、それが要点だ。私たちのコンテンツ・自動化パイプラインは設定でデフォルトモデルを固定している。claude-opus-4-8をclaude-opus-5に変えてセッションを再起動するだけで、他に必要な変更はゼロ。最近のすべてのOpus更新と同じ。複数プロバイダー間でルーティングし、自分のタスクでOpus 5とFable 5やGPT-5.6 SolをA/Bテストしたいなら、プロキシを使えばアプリを書き換えずにモデルを切り替えられる。
最初に注視しているのは自己検証の主張だ。これが実際に私たちのアーキテクチャを変えるものだから。現在のエージェントは、悪い編集が反映される前に捕捉するための明示的な批評家ステップを実行している。Opus 5が自分の弱い分岐を確実にフラグ付けできれば、そのステップを薄くしてトークンを節約できる。再現可能なタスクセットで実行するまで数値は公開しない。エージェント指標を引用する誰にでも求めたいのと同じ規律だ。方法が知りたいなら、本番環境でのAIエージェント評価ガイドにあるものと同じだ。同じプロンプト、同じリポジトリ状態、間違いの数を数える。感触ではなく。
Opus 4.8から切り替えるべきか?(切り替え/待機/据え置き)
移行すべきかはワークロード次第であり、どのモデルが「総合で勝つ」かではない。エージェント・ナレッジワークの跳躍は大きく本物なので、ほとんどのチームは切り替えるべきだ。GPTやFableのパイプラインを持つ純粋なコーディングショップはコミット前にテストする理由があり、安価なタスクで天井付近にいるユーザーはほぼ何も失わずに据え置ける。
今すぐ切り替える場合: 作業がエージェントタスク、コンピュータ操作、ビジネスプロセス自動化、ナレッジワークに依存している場合。Frontier-Bench(4.8比+22.2)、AutomationBench(フィールドの約1.5倍)、GDPval-AA(+268 Elo)が最大の実質的ゲインであり、価格は据え置きなので、アップグレードにコストペナルティはない。
待機する場合: ワークフローが純粋なエージェント型コーディングで、すでにGPT-5.6 SolやFable 5を使っている場合。GPT-5.6 Solは依然としてDeepSWE v1.1でリードし、Fable 5はFrontierCodeで僅差で上回るため、切り替え前に自分のコーディング評価を実行すること。また、プロジェクトの途中で、モデル差し替えが進行中の評価を曖昧にする場合も待機。
4.8に据え置く場合: すでに天井付近だったタスクでコストに敏感で、Opus 5が引き離すエージェントワークロードに触れない場合。感じられない差分に切り替えコストを払うことになる。より広いフィールドについては、Claude Sonnet 5の解説とFable 5・Mythos 5の概要でモデルの比較を確認してほしい。
私たちは毎週、クライアントのエージェント構築でこうしたモデルの選定と接続を行っている。本番エージェントで標準化するモデルを決めているなら、無料コンサルテーションを受けてほしい。マーケティングではなくワークロードに合ったモデル選びを支援する。
著者について
Mert Batur GurbuzはTechsy.ioの共同創業者。チームはB2Bクライアント向けにAIエージェント、自動化システム、音声/SDRパイプラインを出荷している。バーミンガム大学に在学中で、Techsyチームが実際に本番で運用するLLMツールスタックについて執筆している。
共同創業者、Techsy.io、バーミンガム大学 · LinkedIn
よくある質問
Claude Opus 5とは?
Claude Opus 5はAnthropicのフロンティアモデルで、2026年7月24日にリリースされ、モデルIDはclaude-opus-5。AnthropicはFable 5の知能に半額でほぼ匹敵すると位置づけ、Frontier-Bench、GDPval-AA、ARC-AGI-3を含む公開ベンチマークの大半でリードしている。Claude API、Claude.ai、Claude Code、Claude Coworkで利用可能。
Claude Opus 5はいつリリースされた?
Claude Opus 5は2026年7月24日にリリースされた。同日中にClaude API、Claude.ai、Claude Code、Claude Coworkのすべてで利用可能になり、段階的ロールアウトはないため、デフォルトモデルを即座にclaude-opus-5に切り替えられる。
Claude Opus 5はOpus 4.8より優れているか?
ほとんどの作業でイエス。Opus 5はFrontier-Bench v0.1でOpus 4.8を2倍以上上回り(43.3% vs 21.1%)、GDPval-AAで268 Elo上昇、ARC-AGI-3で1.5%から30.2%へ跳躍した。価格は据え置きでコストペナルティはない。例外はGPT-5.6 Sol、Fable 5、Mythos 5が依然リードする一部のコーディング・科学テスト。
Claude Opus 5の価格は?
標準価格は入力100万トークンあたり5ドル、出力100万トークンあたり25ドルで、Opus 4.8と同一。「半額」はFable 5に対するもので、4.8に対するものではない。Opus 5はFable 5級の知能をOpus料金で提供する。Fastモードは基本価格の約2倍で、同じモデルで約2.5倍速く動作する。
Claude Opus 5はFable 5に勝てるか?
全面的には勝てない。Opus 5はOSWorld 2.0、BrowseComp、GDPval-AA、Frontier-BenchでFable 5を上回り、それをFable 5の価格のごく一部で達成している。しかしFable 5は依然としてFrontierCodeと法律ベンチマークで僅差で上回り、Mythos 5(Anthropicの科学モデル)が健康・生物学でリードする。売り文句は「Fable 5に半額でほぼ匹敵」であり、「すべてでFable 5に勝る」ではない。
Opus 5は何に負けるのか?
GPT-5.6 SolがDeepSWE v1.1のエージェント型コーディングで勝ち(72.7% vs 68.8%)、Fable 5がFrontierCode v1.1を0.1ポイント差で、ホールドアウト法律ベンチマークを(13.3% vs 11.7%)で制し、Mythos 5がHealthBench Professionalと生物学テストでリードする。ワークロードがこれらのいずれかに支配されているなら、切り替え前にベンチマークを取ること。
Claude Opus 5はAIエージェント構築に向いているか?
そのために作られている。最大のゲインはエージェント型ターミナルコーディング(Frontier-Bench)、コンピュータ操作(OSWorld 2.0)、エージェント型検索(BrowseComp)、マルチステップのビジネスワークフロー(AutomationBench)にあり、これらは本番エージェントが実行するワークロードだ。自己検証の強化により、別の批評家パスに使うトークンも減らせる。
Claude CodeとAPIでOpus 5にどう切り替えるか?
モデルをclaude-opus-5に設定すれば(Claude Codeでは/model claude-opus-5を使用)、ほとんどのチームで完了だ。APIではmodelフィールドをclaude-opus-5に変更する。リクエストの形状はOpus 4.8から変わらないため、他のコード変更は不要。
Claude Opus 5のFastモードとは?
Fastモードは、Opus 5をデフォルト速度の約2.5倍で標準価格の約2倍で実行する高速ティアだ。より小さいモデルにルーティングされるのではなく、完全なclaude-opus-5モデルに留まるため、出力を待っているインタラクティブセッションに有用で、レイテンシが問題にならないバッチジョブには向かない。