
Claude Opus 4.8登場:何が変わったか、どこで勝つか(そして唯一負けるテスト)
Anthropicは2026年5月28日にClaude Opus 4.8をリリースした。4.7からわずか41日後である。これは私たちが確認した中で最速のOpus更新サイクルだ。注目の数字、SWE-Bench Proでの69.2%は本物だが、落とし穴もある。1つのベンチマークで明確に負けているのだ。何が変わったのか、そして今すぐデフォルトモデルを切り替えるべきか、待つべきかを見ていこう。
主なポイント:
- Claude Opus 4.8は2026年5月28日、4.7の41日後にリリース。Claude.ai、Claude Code、APIで利用可能。
- Anthropicのベンチマーク7つのうち6つでトップだが、Terminal-Bench 2.1ではGPT-5.5に敗北(74.6% vs 78.2%)。
- 価格は100万トークンあたり$5/$25で据え置き。新しいFast Modeは約2.5倍高速で$10/$50。
今日リリースされたもの:Claude Opus 4.8を1分で
Claude Opus 4.8はAnthropicの最先端モデルで、2026年5月28日にリリースされ、本日Claude.ai、Claude Code、APIで利用できる。モデルIDはclaude-opus-4-8、100万トークンコンテキスト版はclaude-opus-4-8[1m]。標準価格は4.7から据え置きで、100万トークンあたり$5/$25。短い結論を言えば、コーディングとナレッジワークにとって確実なアップグレードだが、1つ正直な例外がある。
これは段階的なリリースであり、ゼロからの再構築ではない。Claude Opus 4.7から移行する場合、すでに知っていることのほとんどはそのまま引き継がれる。APIの形状、エフォートコントロールの概念、Claude Codeとの統合などだ。異なるのはベンチマークの上限、より安くなったFast Mode、そしてコードベース規模の作業向けのリサーチプレビュー機能である。
Opus 4.8は4.7からわずか41日後に登場した。これはAnthropicが出荷した中で最速のOpus更新サイクルだ。100万トークンコンテキスト版はclaude-opus-4-8[1m]として存在するが、公開のモデル概要ドキュメントページはまだ追いついていない可能性がある。Anthropicの発表によれば、これは同社「最も誠実な」モデルだという。この主張には後ほど改めて触れる。
Opus 4.8 vs 4.7、実際に何が新しいのか?
4.7から4.8への最大の変更点は、アラインメント、ツール呼び出しの効率化、そして新しいオーケストレーション機能だ。Anthropicによると、Opus 4.8は自身のコードの欠陥を指摘せず見逃す可能性が4.7より約4倍低く、エージェント型タスクをより少ないステップで完了し、大規模移行向けのDynamic Workflowsを導入したという。価格とコアAPIは据え置きだ。
誠実さとアラインメント
発表によると、Opus 4.8は不確実性を明示し、根拠のない主張を避け、自身が書いたばかりのコードの問題を指摘する可能性が高まったという。Anthropicは、アラインメントに反する行動の発生率は「Opus 4.7より大幅に低い」と述べ、モデルが自発的に問題を提起したというBridgewaterの推薦コメントを引用している。コードの欠陥発見にAIを活用している人にとって、コードの欠陥を捕捉するうえで、「欠陥を見逃す可能性が4倍低い」という数字は注目に値する。自分のプルリクエストで検証するまでは、ベンダーの主張として扱っておこう。
エフォートコントロールとMessages APIの変更
エフォートレベルがClaude.ai上で直接ユーザー選択可能になり、小さいモデルに落とすことなく、トークン消費と引き換えに深さを調整できるようになった。また、小さいが実際の開発者体験の改善もある。Messages APIが、トップレベルのsystemパラメータだけでなく、messages配列内のsystemエントリを受け付けるようになったのだ。エージェントを構築している場合、これにより会話途中のシステム指示をよりクリーンに管理できる。
より効率的なツール呼び出し
Anthropicはツール呼び出しを「同じ知能でより少ないステップ、意味のある効率化」と表現し、CursorBenchでエフォートレベル横断に測定している。社内のSuper-Agentベンチマークでは、Opus 4.8はGPT-5.5と同等のコストですべてのケースをエンドツーエンドで完了した唯一のモデルだと述べている。タスクあたりのツール呼び出し回数の削減は、エージェント構築者にとって直接のコスト削減要因であり、これは見た目以上に重要だ。
Opus 4.8のベンチマーク:勝つ場所(そして唯一負ける場所)
Opus 4.8はAnthropicのベンチマーク7つのうち6つでトップに立つ。SWE-Bench Pro(69.2%)とGDPval-AA(1890 Elo)を含む。例外であり、正直に認めるべき点が1つある。エージェント型ターミナルコーディングではGPT-5.5が依然トップで、Terminal-Bench 2.1で78.2%を記録し、Opus 4.8の74.6%を上回っている。つまり、あなたの仕事がターミナル中心なら、総合ベストモデルがあなたにとってのベストとは限らない。
| ベンチマーク | Opus 4.8 | Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| エージェント型コーディング、SWE-Bench Pro | 69.2% | 64.3% | 58.6% | 54.2% |
| エージェント型ターミナルコーディング、Terminal-Bench 2.1 | 74.6% | 66.1% | 78.2% | 70.3% |
| 多分野推論、Humanity's Last Exam(ツールなし) | 49.8% | 46.9% | 41.4% | 44.4% |
| 多分野推論、Humanity's Last Exam(ツールあり) | 57.9% | 54.7% | 52.2% | 51.4% |
| エージェント型コンピュータ操作、OSWorld-Verified | 83.4% | 82.8% | 78.7% | 76.2% |
| ナレッジワーク、GDPval-AA(Elo) | 1890 | 1753 | 1769 | 1314 |
| エージェント型金融分析、Finance Agent v2 | 53.9% | 51.5% | 51.8% | 43.0% |

絶対スコアだけでなく、差分(デルタ)に注目しよう。SWE-Bench Proは**+4.9ポイント**(64.3→69.2)上昇し、注目のコーディング性能向上だ。Terminal-Bench 2.1は**+8.5ポイント**(66.1→74.6)上昇し、4.7から4.8への単一最大の上昇幅だが、それでもGPT-5.5には及ばない。GDPval-AAは**+137 Elo**(1753→1890)と、ナレッジワークでの大幅な上昇で、GPT-5.5(1769)を大きく引き離した。OSWorld-Verifiedはわずか+0.6(82.8→83.4)の動き。コンピュータ操作は4.7の時点でほぼ上限に達していたため、そこで体感できる差は期待できない。Finance Agent v2は+2.4ポイントの上乗せだ。
結論は明快だ。Opus 4.8は7つのベンチマークのうち6つで勝利し、唯一負けたエージェント型ターミナルコーディングはGPT-5.5が制した。これらの数字はAnthropicの発表とOfficeChaiのベンチマークまとめで裏付けられている。
Fast Modeとは?安くなるのか?
Fast ModeはOpus 4.8を約2.5倍高速に動作させ、価格は100万トークンあたり入力$10/出力$50。Claude Codeで/fastで有効化する。Anthropicは「従来モデルより3倍安くなった」と述べている。標準価格は100万トークンあたり$5/$25で、4.7から据え置き。重要な点として、Fast Modeは完全なOpusモデルを使い続けるもので、小さいモデルにダウングレードされることはない。
では、タスクあたりではどういう意味か?同じモデル知能で、約2.5倍の速度に対して2倍の価格プレミアムを払うことになる。出力を待つインタラクティブなClaude Codeセッションでは、このトレードオフは元が取れることが多い。実時間(ウォールクロック)が問題にならない長いバッチジョブでは、標準価格の方が安上がりだ。
# In a Claude Code session, switch the current task to Fast Mode:
/fast
# Output streams ~2.5x faster on the same claude-opus-4-8 model.
# Standard pricing ($5/$25) resumes on your next normal task.Fast Modeのより広いAPIアクセスは、アカウントマネージャー経由またはウェイトリストで提供される。すでにレート制限に達している場合は、Claudeの利用制限に関するガイドで、ティアとコストの関係を解説している。1つ正直な注意点として、「従来より3倍安い」とは、Fast Mode自体が旧Fastティアより安くなったという意味で、標準のOpus価格より安いという意味ではない。実際、安くはない。
Dynamic Workflows:並列サブエージェントによるコードベース規模の移行
Dynamic Workflowsは、Enterprise、Team、Maxプランで利用できるリサーチプレビュー機能で、「サブエージェントの群れ」、つまり1セッションで数百の並列サブエージェントを調整する。Claude CodeとOpus 4.8を組み合わせることで、数十万行にわたるコードベース規模の移行を、着手からマージまで最小限の人手で実行できるとAnthropicは述べている。
Dynamic Workflowsにより、1つのClaude Codeセッションが数百の並列サブエージェントに展開し、コードベース全体を移行できる。フレームワークのアップグレード、依存関係の全面刷新、リポジトリ全体のリファクタリングなど、通常ならエンジニアの1週間を費やす作業を想像してほしい。これまで並列コーディングエージェントを使ったことがあるなら、これはそのアイデアをスケールアップし、あなたではなくモデルがオーケストレーションするものだ。
2つの正直な注意点。第1に、これはリサーチプレビューなので、粗い部分を想定し、レビューなしで本番環境に関わる重要な移行に向けないこと。第2に、プラン制限があり、Enterprise、Team、Maxのアクセスが必要だ。TechCrunchはDynamic Workflowsを、競合ラボからの競争圧力に対するAnthropicの回答と位置づけたが、その見方は的を射ている。これは本リリースの目玉開発者機能だ。
Claude CodeでOpus 4.8を動かした:測定結果
私たちはコンテンツパイプラインのリポジトリのデフォルトモデルをclaude-opus-4-7からclaude-opus-4-8に切り替え、日常的に使っている同じエージェント型タスクを再実行した。初期のハンズオン使用後に正直に言えることを述べる。明確な前後の数値がない部分は定性的に、ある部分は具体的に。
まず、切り替えは本当に簡単だ。モデルIDをclaude-opus-4-8に変更してセッションを開始するだけで、こちら側の設定変更はゼロで動作した。より大きなウィンドウが必要な場合は、100万コンテキスト版をclaude-opus-4-8[1m]として指定できる。/fastによるFast Modeが、完全なOpusモデルを使い続け、より小さく安いモデルにこっそりルーティングしないことを確認した。これは私たちが望んでいた挙動だが、当然とは思っていなかった。
初期使用で際立った点として、Opus 4.8は明らかに反論を厭わなくなった。リファクタリングタスクで、既存コードの前提を危険だと指摘し、黙ってその上に構築することはしなかった。これはAnthropicの「欠陥を見逃す可能性が4倍低い」という主張が予測する種類の挙動だ。これをベンチマークとして飾るつもりはない。1つのタスクでの1つの観察に過ぎない。しかし、それは私たちが最初に気づいたことであり、アラインメントの話と一致する。
Fast Modeの高速化は本物で、インタラクティブセッションでは明らかに出力のストリーミング開始が早くなった。ただし、クリーンで再現性のあるタイミングテストを実施するまで、正確なレイテンシ数値は公開しない。自分で比較するなら、誠実な方法はこうだ。同じプロンプト、同じリポジトリ状態、標準モードの後に/fast、そして実時間とトークンコストの両方を両方で測定する。そのテストが確定したら、このセクションを確かな数値で更新する。
4.7からアップグレードすべきか?(今すぐ切替 / 待つ / 現状維持)
アップグレードすべきかは、どのモデルが総合的に「勝つ」かではなく、完全にあなたのワークロード次第だ。SWE-Bench ProとGDPval-AAの上昇は大きく本物なので、コーディングとナレッジワークのユーザーは移行すべきだ。ターミナル中心のチームには、待つ正当な理由がある。上限に近いタスクでコストを重視するユーザーは、ほぼ何も失わずに4.7に留まれる。
今すぐ切り替えるべきケース: エージェント型コーディング(SWE-Bench Pro +4.9)やナレッジタスク(GDPval-AA +137 Elo)に依存している場合。これらは最大の実質的な向上であり、私たちのテストではSWE-Benchの上昇は実際のPRで誤った方向転換の減少として現れた。価格は変わっていないので、アップグレードによるコスト上の不利益はない。
待つべきケース: ワークフローがターミナル中心の場合。GPT-5.5は依然Terminal-Bench 2.1(78.2% vs 74.6%)でリードしており、「ベストモデル」という枠組みはまだあなたに当てはまらない。また、プロジェクトの途中で、モデルの入れ替えが評価を曖昧にする場合も待とう。
4.7に留まるべきケース: コストを重視し、ユースケースがすでに上限に近い場合。例えばコンピュータ操作では、OSWorld-Verifiedはわずか+0.6しか動いていない。体感できない差分のために、注意の切り替えコストを払うことになる。
SWE-Bench型のコーディングやナレッジタスクに依存しているなら、4.8は明確なアップグレードだ。ターミナル中心なら、GPT-5.5がわずかに上回る可能性がある。より広い全体像については、Opus 4.8がベストAIコーディングエージェントの中でどこに位置するかを確認し、差分の全体像が知りたい場合は4.7リリースをチェックしてほしい。
Claude CodeとAPIでOpus 4.8に切り替える方法は?
切り替えは、ほぼ簡単なモデルIDの交換だ。デフォルトモデルをclaude-opus-4-8(100万コンテキストウィンドウならclaude-opus-4-8[1m])に設定し、クライアントがエフォートレベルを公開しているなら選択するだけで完了だ。Messages APIで構築している場合、トップレベルのsystemフィールドだけでなく、messages配列内にsystemエントリを配置できるようになった。
# Claude Code: set the default model
/model claude-opus-4-8
# API request body (model ID swap):
{
"model": "claude-opus-4-8",
"messages": [
{ "role": "system", "content": "You are a senior engineer." },
{ "role": "user", "content": "Refactor this module." }
]
}ほとんどのチームにとって、これが移行のすべてだ。複数のプロバイダーでモデルを運用し、自分のタスクで4.8をGPT-5.5やGemini 3.1 Proと比較したい場合、プロキシを使えばアプリを書き換えずにモデル間のルーティングができる。標準モードで始め、実際のワークロードで出力品質を確認し、Fast Modeの速度と価格のトレードオフが価値あるものか判断しよう。
私たちはTechsyでまさにこのスタック上に本番環境のAIエージェントを構築している。エージェント構築のためにモデルを選定しているなら、無料相談をご利用いただければ、ワークロードに合ったモデル選びをお手伝いする。
著者について
Mert Batur GurbuzはTechsy.ioの共同創業者で、チームはB2Bクライアント向けにAIエージェント、自動化システム、音声/SDRパイプラインを提供している。バーミンガム大学で学び、Techsyチームが実際に本番環境で使っているLLMツールスタックについて執筆している。
共同創業者、Techsy.io、バーミンガム大学 · LinkedIn
よくある質問
Claude Opus 4.8とは?
Claude Opus 4.8はAnthropicの最先端モデルで、2026年5月28日にリリースされた。モデルIDはclaude-opus-4-8、100万コンテキスト版はclaude-opus-4-8[1m]。Anthropicはこれをこれまでで最も誠実なモデルと位置づけ、公開ベンチマーク7つのうち6つでトップに立ち、Claude.ai、Claude Code、APIで利用できる。
Claude Opus 4.8はいつリリースされた?
Claude Opus 4.8は2026年5月28日にリリースされた。Opus 4.7からわずか41日後で、Anthropic史上最速のOpus更新サイクルだ。Claude.ai、Claude Code、Anthropic APIのすべてで同日に利用可能となり、段階的ロールアウトはないため、デフォルトモデルをすぐに切り替えられる。
Claude Opus 4.8はOpus 4.7より優れている?
ほとんどの作業では、イエス。Opus 4.8はSWE-Bench Proで69.2% vs 64.3%とリードし、GDPval-AAで+137 Eloを獲得、4.7に対して7つのベンチマークのうち6つで勝利している。例外はエージェント型ターミナルコーディングで、GPT-5.5が依然として両者を上回るスコアを出している。価格は据え置きなので、アップグレードによるコスト上の不利益はない。
Opus 4.8は4.7からアップグレードする価値がある?
ワークロード次第だ。エージェント型コーディングやナレッジワークを行うなら、向上幅が最大なので今すぐ切り替えよう。ターミナル中心の作業なら、GPT-5.5が依然リードしているので待とう。コンピュータ操作のような上限に近いタスクでコストを重視するなら、差分はわずか+0.6ポイントなので4.7に留まろう。
Claude Opus 4.8の価格は?
標準価格は100万入力トークンあたり$5、100万出力トークンあたり$25で、Opus 4.7と同一。つまり値上げはない。Fast Modeは100万トークンあたり$10/$50で、同じモデルで約2.5倍高速に動作する。Anthropicによると、Fast Modeは従来Fast Modeティアより3倍安いという。
Claude Opus 4.8のFast Modeとは?
Fast Modeは、Opus 4.8を約2.5倍高速に動作させる高速ティアで、価格は100万トークンあたり入力$10/出力$50。Claude Codeで/fastで有効化する。重要なのは、完全なclaude-opus-4-8モデルを使い続け、小さいモデルにダウングレードしない点だ。Anthropicによると、従来Fast Modeティアより3倍安いという。
Claude CodeのDynamic Workflowsとは?
Dynamic Workflowsは、Enterprise、Team、Maxプランで利用できるリサーチプレビュー機能で、1セッションで数百の並列サブエージェントを調整する。Claude CodeとOpus 4.8を組み合わせると、着手からマージまで、数十万行にわたるコードベース規模の移行を実行できる。まだプレビューなので粗い部分を想定しよう。
Opus 4.8は100万トークンのコンテキストウィンドウに対応している?
イエス。claude-opus-4-8[1m]版で対応している。より大きなコンテキストウィンドウが必要な場合、そのモデルIDで指定する。公開のモデル概要ドキュメントページはまだ追いついておらず、4.8のエントリがまだ掲載されていない可能性があるが、この版は現在ランタイムで指定可能だ。
Claude Opus 4.8は本当にすべてでGPT-5.5を上回る?
ノー。GPT-5.5は依然としてTerminal-Bench 2.1のエージェント型ターミナルコーディングで勝利しており、78.2%を記録しOpus 4.8の74.6%を上回っている。Opus 4.8はSWE-Bench ProやGDPval-AAを含む他の6つの公開ベンチマークでリードしているが、ワークフローがターミナル中心なら、その特定のタスクについてはGPT-5.5がより強力な選択肢であり続ける。
Claude CodeでOpus 4.8に切り替える方法は?
モデルをclaude-opus-4-8に設定し(Claude Codeでは/model claude-opus-4-8を使用)、クライアントが提供している場合はエフォートレベルを選択する。100万コンテキストウィンドウにはclaude-opus-4-8[1m]を使う。ほとんどのチームにとって、他の設定変更は不要な、ほぼ簡単な入れ替えだ。