
Codex版GPT-5.6 Sol Ultra:サブエージェントモードの実際の機能(とコスト)
2026年7月時点で、GPT-5.6 Sol Ultraは政府承認済みの約20社パートナー限定のクローズドプレビュー段階にあり、OpenAI APIとCodex経由で利用できます。まだ一般提供はされていません。OpenAIは一般提供日を発表しておらず、広く引用されている91.9%というTerminal-BenchスコアもOpenAI自身のプレビューページには掲載されていません。
2026年6月26日、OpenAIはGPT-5.6 Solファミリーをプレビュー公開し、その数日後にはThibault Sottiaux氏がCodexユーザーに向けて、Sol Ultraティアのために「最も難しいプロンプトを取っておいてくれ」と呼びかけました。このたった一言のティーザーがベンチマークスクリーンショットの嵐を引き起こしました。その多くが、OpenAIが一度も公表していない数字を繰り返しています。そこで、GPT-5.6 Sol Ultraを中心にCodexのワークフローを設計する前に、実際に確認できていること、サブエージェントモードの仕組み、そして導入の可否を左右するトークン計算を押さえておきましょう。
主要ポイント:
- Sol UltraはGPT-5.6の最高エフォートティアであり、単一タスク内で互いにやり取りする協調型サブエージェントを備える。
- 2026年7月時点で、APIとCodex経由で政府承認済みの約20社パートナー向けにクローズドプレビュー中であり、一般提供はされていない。
- 報道ではTerminal-Bench 2.1で91.9%とされるが、OpenAIはこの数値を公表しておらず、未検証として扱うべき。
- Solの料金は入力トークン100万あたり5ドル/出力30ドル。サブエージェントにより呼び出し回数が増えるため、Ultraはシングルエージェント実行の数倍のコストになり得る。
Codex版GPT-5.6 Sol Ultra:実際に確認できていること
整理すると、次のように分かれます。確認済み: OpenAIは2026年6月26日にSolファミリー(Sol、Terra、Luna)をプレビュー公開し、Sol Ultraは最上位の推論ティアであり、Codex向けにティーザーされています。未確認: Terminal-Bench 2.1での91.9%というスコアと、一般提供日です。それ以外に見かけた情報はすべて、一次情報ではなく報道ベースのものです。
この区別は重要です。今回のローンチは性急かつ曖昧に進んだからです。OpenAIのプレビューページでは、ティア構成とセーフティゲートが定性的な表現で説明されているだけです。Xやガイド記事で出回っている目を引くベンチマーク表は、OpenAI自身のページではなく二次報道由来のものです。ローンチ前の段階で、私たちは事前の噂の真偽を判定し、実際にリリースされたものと憶測に終わったものを整理しました。同じ姿勢が今も必要です。
したがって、UltraをCodexのループに組み込むべきか検討している開発者は、まずハイプ由来の数字を脇に置いてください。確認済みの事実(仕組み、料金、プレビューステータス)だけで、コストと適合性を判断するには十分です。未確認の項目(正確なスコア、ローンチ時期)は、まだいかなる判断の根拠にすべきではありません。出典:OpenAIのGPT-5.6 Solプレビューページおよび9to5Macのローンチ報道。
Sol Ultraとは? 協調型サブエージェント vs Proの並列エージェント
Sol UltraはGPT-5.6の最上位推論ティアであり、その最大の特徴は協調型サブエージェントです。コーディネーターがタスクを分割し、各部分をサブエージェントに委ね、それらのサブエージェントが作業進行中に互いへメッセージをやり取りします。このタスク中のコミュニケーションこそが本質であり、Ultraを下位ティアと分けるものです。
わかりやすく言えば、少人数のエンジニアリングポッドとフリーランスの寄せ集めの違いです。GPT-5.5 Proの並列エージェントは、3つの別々のチケットを渡すフリーランスのようなものです。それぞれが離れて孤立して自分の部分をこなし、結果を机に置いて去ります。誰も会話しません。Sol Ultraのサブエージェントは、同じ部屋にいるポッドのように動きます。一人がデータベーススキーマの変更を察知したら他に伝え、全員が作業を完了する前に調整します。この協調性こそ、OpenAIがSol Ultraを簡単な編集ではなく、長く難しいマルチステップタスク向けに位置づけている理由です。
Proのエージェントが別々のレーンで作業するのに対し、Sol Ultraのサブエージェントはタスク実行中に互いへメモを渡す。

この仕組み自体は確認済みです。OpenAIが説明し、DataCampやdeeplearning.aiの報道もそれを裏付けています。問題は——後述しますが——サブエージェントを起動するたびに、それがトークンを消費する別のモデル呼び出しになることです。協調は無料ではありません。
「最大推論エフォート」とは? いつオンにすべきか?
「最大推論エフォート」は、GPT-5.6のエフォート段階の最上位です。lowからhighまであり、Sol Ultraが使うmax設定が最上位にあります。エフォートが高いほど、モデルは回答前により多くのコンピュートを使って思考します。これは難しい問題には有効ですが、簡単な問題では金の無駄です。これはダイヤルであり、全開のまま放置するスイッチではありません。
チェスプレイヤーを想像してください。lowエフォートでは直感で素早く指します。明白な駒の取り合いにはそれで十分です。maxエフォートでは腰を据えて10手先まで読みます。難しいエンドゲームにはまさにそれが必要ですが、ドアを開けるのにはまったく無意味です。推論エフォートも同じです。コンピュート(そして請求額)は、モデルにどれだけ深く考えさせるかに比例します。
では、いつ使う価値があるか? 長期ホライズンのマルチファイルのエージェンティック作業でmaxエフォートをオンにしてください。20ファイルにまたがるマイグレーション、厄介なリファクタリング、3サービスにまたがるバグ。これこそ、深い推論が実際に結果を変える長期ホライズンのエージェンティックコーディングの領域です。変数のリネーム、単一テストの作成、タイプミス修正ではオフのままにしてください。プレミアムトークンを払ってゼロのリターンでは割に合いません。
最大推論エフォートがコストに見合うのは、最初の試行の失敗が追加トークン以上のコストになるほどタスクが難しい場合だけ。
正直なルール:そのタスクがなぜ難しいのかを言葉にできないなら、おそらくmaxエフォートは不要です。
Terminal-Bench 2.1の数値:91.9%は本当に検証済みか?
いいえ。91.9%という数値は二次報道が伝えたもので、OpenAI自身のプレビューページには掲載されておらず、プレビューはクローズドで、評価手法も開示されていません。したがって、独立検証はされていません。検証不能な報道ベースの主張として扱い、確定した結果と見なすべきではありません。
正確な状況はこうです。OpenAI寄りの報道(DataCamp、AI Weekly、deeplearning.ai)は、Sol UltraがTerminal-Bench 2.1で91.9%としています。しかしプレビューは約20社パートナーに限定され、OpenAIはその数値もテスト条件も公表していないため、その圏外の誰も再現できません。また、Claude Mythos 5の数値は報道元によって異なる点にも注意してください。あるソースは84.3%、別のソースは88.0%としています。比較表の数値自体がソース間で食い違うなら、それは鵜呑みにするなというサインです。
| モデル | Terminal-Bench 2.1(報道値、独立検証なし) |
|---|---|
| Sol Ultra | 91.9% |
| Sol(ベース) | 88.8% |
| GPT-5.5 | 88.0% |
| Claude Mythos 5 | 84.3〜88.0%(ソースにより異なる) |
| Gemini 3.1 Pro Preview | 70.7% |
皆が引用している91.9%はOpenAI自身のプレビューページには掲載されていない。確定した結果ではなく、報道ベースの主張として扱うべき。
だからといってSol Ultraが弱いわけではありません。OpenAIが正式な手法を公開すれば、チャートのトップに立つ可能性は十分あります。ただ、検証できない数値をもとに本番トラフィックをルーティングすべきではないということです。出典:DataCampのGPT-5.6 Solガイド、deeplearning.aiのThe Batch、AI Weekly。
CodexでSol Ultra+最大推論エフォートを使う方法
Sol Ultra自体はゲートされているため、組織がプレビューに入っていない限りオンにできません。しかし、Sol Ultraが乗っているエフォート段階は、現在のCodex CLIで手持ちのモデルに対してすでに機能しています。ここでは設定方法と、アクセス取得後にUltraがどこに位置するかを説明します。
- 設定を見つける。 推論エフォートはCodexの設定ファイル
~/.codex/config.toml、または実行ごとのフラグとして指定します。メニューの奥に埋もれておらず、キー1つです。 - モデルとエフォートを設定する。 Codexにモデル文字列を指定し、エフォートレベルを設定します。現時点ではlowからhighまで設定可能で、「max」段階とSol Ultraのサブエージェントティアは、組織がプレビューに入るとアンロックされます。
- タスクごとにオーバーライドする。
-cフラグを使えば、設定ファイルを編集せずに、難しい実行1回だけエフォートを引き上げられます。 - 選んでオンにする。 maxエフォートは上記セクションの長期マルチファイルタスク用にとっておき、デフォルトはmediumかhighにしておきましょう。
# ~/.codex/config.toml
model = "gpt-5.6-sol"
model_reasoning_effort = "high" # minimal | low | medium | high (available today)
# "max" effort + the Sol Ultra cooperating-subagent tier
# activate once your org is in the closed preview:
# model = "gpt-5.6-sol-ultra"
# model_reasoning_effort = "max"
# per-run override, no config edit needed:
# codex -c model_reasoning_effort="high" "refactor the auth module"プロのヒント: プロジェクトのデフォルトはmaxではなくhighに設定してください。そして、本当に必要な実行のときだけmaxにオーバーライドします。この習慣ひとつでベースラインの請求額を健全に保ち、高価なティアを実際に報われるタスクに温存できます。提供状況の詳細はOpenAIのヘルプセンターのプレビュー記事にあります。
Ultraの実際のコスト:サブエージェントによるトークン倍増
ここが誰もモデル化しない部分です。Ultraは協調型サブエージェントを起動するため、1タスクでモデル呼び出しが1回ではなく複数回発生し、呼び出しごとにトークンが課金されます。Solの確認済み料金は、入力トークン100万あたり5ドル、キャッシュ時0.50ドル、出力100万あたり30ドルです。出力が高価な側であり、Ultraはそれを大量に生みます。
具体的な例で計算しましょう。ベースSolで中程度に複雑なエージェンティックタスクをシングルエージェントで実行する場合:
| モデル | 項目 | トークン | レート / 1M | コスト |
|---|---|---|---|---|
| Sol(ベース) | 入力 | 40,000 | $5 | $0.20 |
| Sol(ベース) | 出力 | 15,000 | $30 | $0.45 |
| Sol(ベース) | 合計 | $0.65 |
同じタスクをUltraで、コーディネーター1体と協調型サブエージェント3体で実行する場合。共有コンテキストは0.50ドルで安価にキャッシュされますが、各サブエージェントは30ドルで独自の出力を生成します:
| モデル | 項目 | トークン | レート / 1M | コスト |
|---|---|---|---|---|
| Sol Ultra(推定) | コーディネーター入力 | 40,000 | $5 | $0.20 |
| Sol Ultra(推定) | サブエージェント入力(キャッシュ) | 90,000 | $0.50 | $0.045 |
| Sol Ultra(推定) | サブエージェント入力(新規) | 30,000 | $5 | $0.15 |
| Sol Ultra(推定) | コーディネーター+エージェント間出力 | 20,000 | $30 | $0.60 |
| Sol Ultra(推定) | サブエージェント出力(3 x 15K) | 45,000 | $30 | $1.35 |
| Sol Ultra(推定) | 合計 | ~$2.35 |
同じタスクでベースSolの約3.6倍のコストです。サブエージェントの起動数とコンテキストのキャッシュ量次第で、2倍から4倍の幅になります。この倍率は公開料金からの推定モデルであり、Ultraの実測ベンチマークではありませんが、料金と仕組みの両方が確認済みなので、全体像は現実的です。
Ultraの隠れたコストはトークン単価ではなく、1タスクが気づけば4回のモデル呼び出しになること。
これを緩和する要素は2つあります。共有コンテキストに対するプロンプトキャッシング(例の0.50ドルのキャッシュレート)と、Ultra料金が必要なタスクにだけ払う規律あるルーティングです。請求額を本気で抑えたいなら、LLM APIコストを抑えるガイドで、クライアントパイプラインで使っているルーティングパターンを解説しています。料金はDataCampおよびdeeplearning.ai出典、2026年6月〜7月時点。
もう使えるのか? 限定プレビュー、約20社パートナー、そしてタイムライン
政府承認済みの信頼できる約20社パートナーの1社でない限り、使えません。Sol UltraはOpenAI APIとCodex経由でアクセスできるクローズドプレビュー段階にあり、 broader releaseの前には政府のセーフティレビューがゲートになっています。OpenAIはより広いアクセスが「数週間以内に来る」と述べていますが、それ以上の具体性はありません。
「7月7日」という日付が流れているのを見たかもしれません。無視してください。OpenAIはローンチ日を提示しておらず、特定の日付はすべて計画の根拠になる事実ではなく、未確認の噂として扱うべきです。確認済みなのは「数週間以内」という表現と、Cerebrasが7月からSolを最大750トークン/秒でサービング予定であること(deeplearning.aiによる)だけです。
では、パートナーでない場合はどうするか? 今から準備しましょう。今日の手持ちのモデルでCodexの設定とエフォート段階を調整しておけば、Ultraが開放されたとき、変更はモデル文字列の差し替え1つで済みます。判断のポイント:あなたは信頼済みパートナーですか? いいえ? なら、今日中にエフォートレベルのルーティングをセットアップし、1行の差し替えだけで済むように準備しておきましょう。出典:OpenAIヘルプセンターおよびdeeplearning.ai。
Sol Ultra vs Sol vs GPT-5.5 vs Claude Mythos 5:どれを選ぶべきか?
リーダーボードではなくタスクでルーティングしてください。特に、リーダーボードの数値が検証されていない場合はなおさらです。日常的なエージェンティックコーディングの大半にはベースSolを使い、本当に難しい長期ホライズンタスクにはSol Ultraを取っておき、GPT-5.5がすでにスタックに組み込まれているなら維持し、ワークフローでClaudeの最新モデルをすでに信頼しているならClaude Mythos 5を検討してください。
実践的なフレームワークはこうです:
- ベースSolを選ぶのは、タスクが並の難易度のとき:機能追加、範囲の決まったリファクタリング、テストスイート。報道値88.8%を備え、Ultraの何分の一かのコストで済む。
- Sol Ultraを選ぶのは、タスクが長期にわたり、多数のファイルにまたがり、最初の試行の失敗が実際の時間を浪費するとき。協調型サブエージェントがその倍率コストに見合うのは、ここをおいて他にない。
- GPT-5.5を選ぶのは、すでに統合済みで、Solとの差がマイグレーションを正当化しないとき。
- Claude Mythos 5を選ぶのは、チームの既存ツールがそれを優遇するとき。報道スコアはソースにより異なり(84.3%〜88.0%)、数値だけで乗り換えるべきではない。
ツール間のモデルルーティングのトレードオフをより深く知りたいなら、コーディングエージェント比較でそれぞれの適所を解説しています。短く言えば:タスクの難易度バーをクリアする最安ティアを選んでください。
開発者はRedditで実際に何を言っているのか
ベンチマークは一面にすぎません。人々が自分のターミナルで報告していることは別の話であり、現時点でr/codexのスレッドが最も正直なシグナルです。私たちの読みでは、慎重に感心しつつ、深く懐疑的で、 mostly 価格について言い争っています。
初期のハンズオンの称賛は具体的です。335アップボートのr/codexスレッドで、自分のプロンプトが5.6にルーティングされているのに気づいた開発者は、「2倍速い」感触で「プロンプトをワンショットで仕留めて」おり、5.5では数ラウンドかかっていたエッジケースを「先回りして」修正していると語りました。彼の比較は的を射ていました。「Claudeで少し使えたFable 5の感触そのもの。ただしずっと速い」。内部アクセスを主張するコメンターは、「最大推論レベルでのタスク」は「5.5よりずっと短い」時間で済むと付け加えました。
そこにベテランが現れます。最大の反論は、私たちが「ハネムーン→ナーフ」の冷笑と呼んでいるものです。「いつもこうだ。2週間もすればナーフされる」と一人が書きました。別の者はもっと率直でした。「2週間だけ全力で使い倒せ。アインシュタインみたいに賢いのは2週間だけだからな」。数人はいかにもタイミングが良すぎる点を指摘し、5.5の性能低下への不満がピークに達したまさにその時に、5.6の絶賛ポストが現れると述べました。象徴的なのは、そのスレッドの最多投票リプライが分析ではなくジョークだったことです(「もうgpt 6使ってるし」)。これは、開発者がバージョンハイプの churn にどれだけ疲れているかを物語っています。
Sol Ultra Codex発表スレッドでは、会話はほぼ完全にコストに移り、矛先はもっぱらClaudeに向いていました。開発者はOpenAIの200ドルのCodexティアとAnthropicのFableプロモを天秤にかけており、数人はClaude Max 20xを解約すると語りました。 mostly Fableが「クレジットの消費が2倍速い」ためです。繰り返し出てくる期待:「Claude Fableへの本物の競合だ。ユーザーにとってはありがたい」。繰り返し出てくる懸念——私たちもまったく同感です:「OpenAIが発表しておいて、後から上位ティアにゲートするやり方には以前痛い目に遭わされてる。ローカルで動いてるのを見るまで信じない」。
Techsyとしての私たちの見解: 速度の報告は、より高スループットのサービングスタックが提供するはずのものと一致しており、これは信じます。ワンショットの主張は有望だが大規模では未証明として扱います。「2週間後にバカになった」パターンは実在し、過去のローンチで実際に目にしてきたからです。そしてコストへの懐疑はまさに正しい。Sol UltraがあなたのCLIに入り、安定し、完全な請求サイクルを通過するまで、この盛り上がりを評決ではなくプレビューとして扱ってください。
Codexのエージェンティックタスクを回してわかったこと
率直に言います。私たちはSol Ultraを動かせません。約20社パートナーにゲートされており、私たちはその1社ではないため、自分で測定していないトークン数やスコアは引用しません。できるのは、次に正直なことです。現在のティアでCodex CLIを通じてエージェンティックタスクを実行し、OpenAIが公表している5ドル/30ドルの料金から正確なサブエージェントコスト計算を導き出しました。
テストしたティアでは、エフォート段階はまさに予想通りに振る舞います。lowとmediumエフォートでは、Codexは速く戻り、範囲の決まった編集を mostly 正しくこなします。難しいマルチファイルタスクをlowエフォートで押すと、途中で止まるかファイル間の依存を見落としがちです。同じタスクをhighエフォートにすると、行動前に明らかに長く思考し、より多くの変更を1パスで着地させます。この実時間と品質のトレードオフこそ、max段階が存在する理由です。
上記のコストモデリング(約3.6倍の例)は、私たちが責任を持てる純粋な一次分析です。確認済みの料金と確認済みのサブエージェントの仕組みに対する算術であり、実測ではなくモデルとして明示しています。クライアントのエージェンティックパイプラインではすでにコストでモデルティアをルーティングしており、これはUltraを誰かのためにオンにする前に実行するまさにその計算です。
重要な設定変更は1つだけ、前述のconfig.tomlのmodel_reasoning_effort行です。プロジェクトのデフォルトはhighに保ち、実行ごとにmaxへオーバーライドします。まさに上記のプロのヒントの通りです。Ultraがプレビューを超えて開放されれば、このセットアップにより変更はモデル文字列の差し替えだけで済み、上記のコスト計算はすでにオンにする前に実行する計算になっています。本物のアクセスを得た瞬間に、このセクションを実測のUltra数値で更新します。それ以前にはしません。
著者について
Mert Batur GurbuzはTechsy.ioのCo-Founder。同社ではB2Bクライアント向けにAIエージェント、自動化システム、音声/SDRパイプラインを提供しています。University of Birminghamで学ぶかたわら、Techsyチームが本番環境で実際に使っているLLMツールスタックについて執筆しています。LinkedInでつながりましょう。
Co-Founder、Techsy.io、University of Birmingham。
よくある質問
GPT-5.6 Sol Ultraとは?
Sol UltraはGPT-5.6の最上位推論エフォートティアです。その最大の特徴は協調型サブエージェントで、コーディネーターがタスクを分割し、サブエージェントが作業中に互いへメッセージをやり取りします。OpenAIはこれを簡単な編集ではなく、長く難しいマルチステップのエージェンティックタスク向けに位置づけ、2026年6月26日にSolファミリーの一部としてプレビュー公開しました。
Sol Ultraは今すぐCodexで使えるのか?
大半の人には使えません。2026年7月時点で、Sol UltraはOpenAI APIとCodex経由でアクセスできるクローズドプレビュー段階にあり、セーフティレビューを経た政府承認済みの信頼できる約20社パートナーに限定されています。OpenAIはより広いアクセスが「数週間以内に来る」と述べていますが、具体的な日付は公表しておらず、今日すぐに切り替えることはできません。
Sol Ultraの協調型サブエージェントはどう動くのか?
コーディネーターがタスクを分割し、各部分をサブエージェントに割り当てます。独立した並列エージェントと異なり、これらのサブエージェントはタスク中にコミュニケーションし、学んだことを共有して他が完了前に調整できるようにします。この協調は複雑なマルチファイル作業に有効ですが、各サブエージェントは独自のトークンを消費する別のモデル呼び出しです。
GPT-5.6の「最大推論エフォート」とは?
最大推論エフォートは、GPT-5.6のエフォート段階(low、medium、high、そしてmax)の最上位です。エフォートが高いほど、モデルは回答前により多くのコンピュートを使って推論します。難しい長期ホライズンタスクには有効で、単純なタスクでは金の無駄になるため、タスクが本当に難しいときだけ上げるダイヤルとして扱ってください。
Sol Ultraの実行コストはどれくらいか?
ベースSolの料金は入力トークン100万あたり5ドル、キャッシュ時0.50ドル、出力100万あたり30ドルです(DataCampおよびdeeplearning.ai出典、2026年中頃時点)。Ultraは協調型サブエージェントを起動するため、1タスクでモデル呼び出しが複数回発生します。私たちの推定例では、単一タスクがベースSol実行の約2倍〜4倍のコストになり、 mostly 追加の出力トークンが要因です。
Sol Ultraは本当にClaude Mythos 5より優れているのか?
報道値では、Sol Ultra(91.9%)がTerminal-Bench 2.1でClaude Mythos 5をリードしていますが、これは未検証です。OpenAIはその数値を公表しておらず、プレビューはクローズドで、Mythos 5自身の報道スコアもソースにより84.3%〜88.0%と異なります。したがって正直な答えは、まだわからず、それをもとに本番トラフィックをルーティングすべきではないということです。
Sol Ultraはいつ一般提供されるのか?
OpenAIは、ChatGPT、Codex、API全体でのSolファミリーのより広いアクセスが「数週間以内に来る」と述べていますが、一般提供日は公表していません。ネットで流れている特定の日付(「7月7日」を含む)はすべて未確認の噂であり、公式発表ではありません。確認済みのタイムラインはOpenAI自身のプレビューページを注視してください。
Terminal-Bench 2.1の91.9%スコアは検証済みか?
いいえ。91.9%という数値は二次報道由来であり、OpenAI自身のプレビューページには掲載されていません。プレビューは約20社パートナーにクローズドで、評価手法も開示されていないため、その圏外の誰も再現できません。後に正確と判明する可能性はありますが、現時点では未検証の報道ベースの主張であり、確定したベンチマーク結果ではありません。
Sol UltraはGPT-5.5 Proの並列エージェントとどう違うのか?
Proの並列エージェントは別々のレーンで独立して動作します。各自が孤立して自分の部分をこなし、結果を返すだけで、コミュニケーションはありません。Sol Ultraのサブエージェントは協調し、タスク中に互いへメッセージをやり取りして、学びに応じて調整します。この協調はより難しいマルチステップ作業に向きますが、呼び出し全体でトークン使用量も倍増します。
Sol Ultraは必要か、ベースSolで十分か?
大半のエージェンティックコーディングには、ベースSolまたはhigh推論エフォートで十分であり、はるかに安価です。Ultraは、最初の試行の失敗が追加トークン以上の時間を浪費する、長期マルチファイルタスク用にとっておいてください。タスクがなぜ難しいのかを明確に説明できないなら、Ultraは不要です。リーダーボードではなく難易度でルーティングしてください。
開発者はRedditでGPT-5.6 Solについて何を言っているのか?
初期のr/codexの報告は、速度(「2倍速い」)とプロンプトのワンショット処理に肯定的で、数人の開発者がその感触をClaudeのFable 5に例えています。しかしベテランは、ローンチ後にモデルが劣化する「ハネムーン→ナーフ」パターンを警告しており、議論の多くは純粋な性能よりも、Anthropicのプランに対するコストに集中しています。