
Codex 中的 GPT-5.6 Sol Ultra:子代理模式實際能做什麼(與成本)
截至 2026 年 7 月,GPT-5.6 Sol Ultra 仍處於封閉預覽階段,僅開放給約 20 家經政府核准的合作夥伴,可透過 OpenAI API 與 Codex 使用。目前尚未全面開放。OpenAI 並未公布正式上線日期,而廣為流傳的 91.9% Terminal-Bench 成績也未出現在 OpenAI 自家的預覽頁面上。
2026 年 6 月 26 日,OpenAI 預覽了 GPT-5.6 Sol 系列,幾天後 Thibault Sottiaux 告訴 Codex 使用者,要為 Sol Ultra 這個等級「把你最難的提示詞留著」。這則預告掀起了一波基準測試截圖的熱潮,但其中多數都在重複一個 OpenAI 從未公布過的數字。因此,在你圍繞 GPT-5.6 Sol Ultra 規劃 Codex 工作流程之前,先來看看哪些是真正獲得證實的、子代理模式如何運作,以及決定它是否值得開啟的 token 試算。
重點整理:
- Sol Ultra 是 GPT-5.6 的最高強度等級:由多個協作子代理在單一任務進行中彼此溝通。
- 目前以封閉預覽形式透過 API 與 Codex 開放給約 20 家經政府核准的合作夥伴,尚未全面開放(截至 2026 年 7 月)。
- 媒體報導其在 Terminal-Bench 2.1 拿下 91.9%,但 OpenAI 並未公布該數字,因此應視為未經驗證。
- Sol 的價格為每 100 萬 token 輸入 5 美元、輸出 30 美元;子代理會讓呼叫次數倍增,因此 Ultra 的成本可能是單一代理執行的好幾倍。
Codex 中的 GPT-5.6 Sol Ultra:哪些是真正獲得證實的
以下是清楚的區分。已證實: OpenAI 於 2026 年 6 月 26 日預覽了 Sol 系列(Sol、Terra、Luna),Sol Ultra 是最高推理等級,且已預告將登陸 Codex。未證實: 91.9% 的 Terminal-Bench 2.1 成績,以及任何正式上線日期。你看到的其他一切都屬於媒體報導,而非第一手資料。
這個區分之所以重要,是因為這次發布節奏快且資訊混雜。OpenAI 的預覽頁面以質化方式描述各個等級與安全把關機制。那份在 X 與各類指南中流傳、引人注目的基準測試表格,來自二手報導,而非 OpenAI 自家頁面。早在發布前的階段,我們就為發布前的傳聞做過評分,以下是真正落地的內容,以及哪些仍停留在傳聞階段。同樣的嚴謹標準現在依然適用。
所以,如果你是正在評估 Ultra 是否該納入 Codex 流程的開發者,先暫時忽略那些被炒作的數字。已證實的事實(機制、定價、預覽狀態)已足以讓你推估成本與適用性。未證實的部分(確切成績、上線日期)目前還不該左右任何決策。來源:OpenAI 的 Previewing GPT-5.6 Sol 頁面,以及 9to5Mac 的發布報導。
什麼是 Sol Ultra?協作子代理與 Pro 平行代理的差異
Sol Ultra 是 GPT-5.6 的最高推理等級,其核心特色是協作子代理:由一個協調者將你的任務拆分成多個部分,把每一部分交給一個子代理,而這些子代理會在任務仍在進行時彼此傳遞訊息。這種任務中的溝通正是關鍵所在,也是 Ultra 與所有較低等級的根本差異。
可以把它想像成一個小型工程小組,對上一群自由接案者。GPT-5.5 Pro 的平行代理就像你交給三位接案者三張各自獨立的工單。他們各自離開、孤立地完成自己的部分,再把結果丟回你桌上。彼此之間毫無溝通。Sol Ultra 的子代理則像同一個房間裡的小組:其中一個發現資料庫 schema 變了,告訴其他人,他們在完成前先做出調整。正是這種協調能力,讓 OpenAI 把它定位用於漫長、困難、多步驟的任務,而非快速修改。
Pro 的代理在各自獨立的軌道上運作,而 Sol Ultra 的子代理會在任務仍在執行時彼此傳遞訊息。

這個機制本身已獲證實,由 OpenAI 描述,並獲得 DataCamp 與 deeplearning.ai 報導的呼應。但問題在於(我們稍後會談到),你每產生一個子代理,就是多一次消耗 token 的模型呼叫。協調並非免費。
什麼是「最大推理強度」?什麼時候該開啟它?
「最大推理強度(max reasoning effort)」是 GPT-5.6 強度梯級的最高一級,該梯級從 low 到 high,再到 Sol Ultra 所使用的 max 設定。強度越高,代表模型在回答前會花更多算力思考,這通常對困難問題有幫助,但在簡單問題上只是浪費錢。它是一個旋鈕,而不是一個開了就放著不管的開關。
想像一位棋手。在低強度下,他們憑直覺快速落子,這對明顯的吃子沒問題。在最大強度下,他們會坐下來往後推算十步,這正是困難殘局所需要的,但對開門這種事完全毫無意義。推理強度的運作方式相同。算力(以及帳單)會隨著你要求模型思考得多深入而等比增加。
那麼什麼時候值得?針對長時程、跨多檔案的代理式工作開啟最大強度:一個牽動二十個檔案的遷移、一個棘手的重構、一個橫跨三項服務的 bug。這正是長時程代理式編碼的領域,更深層的推理確實能改變結果。重新命名變數、撰寫單一測試或修正錯字時就別開,因為你會為零效益付出高價 token。
只有當任務困難到「第一次嘗試出錯所付出的代價會超過額外 token」時,最大推理強度才值回它的成本。
一個誠實的判斷法則:如果你說不清楚這個任務難在哪裡,大概就不需要為它開啟最大強度。
Terminal-Bench 2.1 的數字:91.9% 真的經過驗證了嗎?
沒有。91.9% 這個數字由二手媒體報導,並未出現在 OpenAI 自家的預覽頁面上,預覽屬於封閉性質,且未揭露任何評估方法論。因此它並未獲得獨立驗證。請把它視為一個你無法查證的媒體說法,而非定論。
以下是確切的情況。與 OpenAI 相關的報導(DataCamp、AI Weekly、deeplearning.ai)將 Sol Ultra 在 Terminal-Bench 2.1 的成績列為 91.9%。但由於預覽僅限約 20 家合作夥伴,且 OpenAI 未公布該數字或測試條件,圈外沒有人能重現它。另外也要注意,Claude Mythos 5 的數字會因報導來源而異:有些來源說是 84.3%,有些則說是 88.0%。當一張比較表裡的數字在不同來源間互相矛盾時,那就是你該對它保留彈性看待的訊號。
| 模型 | Terminal-Bench 2.1(媒體報導,未經獨立驗證) |
|---|---|
| Sol Ultra | 91.9% |
| Sol(基礎版) | 88.8% |
| GPT-5.5 | 88.0% |
| Claude Mythos 5 | 84.3-88.0%(依來源而異) |
| Gemini 3.1 Pro Preview | 70.7% |
大家都在引用的 91.9% 並未出現在 OpenAI 自家的預覽頁面上,因此請把它視為媒體說法,而非定論。
這些都不代表 Sol Ultra 弱。一旦 OpenAI 公布真正的方法論,它很可能登上排行榜首位。這只是意味著,你不該根據一個無法驗證的數字來導流生產環境的流量。來源:DataCamp 的 GPT-5.6 Sol 指南、deeplearning.ai 的 The Batch,以及 AI Weekly。
如何在 Codex 中使用 Sol Ultra + 最大推理強度
Sol Ultra 本身受到限制,因此除非你的組織在預覽名單中,否則無法開啟它。但它所屬的強度梯級如今已能在 Codex CLI 中、在你現有的模型上運作。以下是這個設定的運作方式,以及一旦你取得存取權限後 Ultra 會在哪裡就位。
- 找到設定。 推理強度位於你的 Codex 設定檔
~/.codex/config.toml中,或作為單次執行的旗標。它不是埋在選單裡,而是一個鍵值。 - 設定模型與強度。 將 Codex 指向你的模型字串並設定強度等級。目前你可以設定 low 到 high;「max」這一級加上 Sol Ultra 子代理等級,會在你的組織進入預覽後解鎖。
- 逐任務覆寫。 使用
-c旗標為單次困難執行提高強度,無需修改你的設定檔。 - 選擇性開啟。 將最大強度保留給上一節提到的長時程、跨多檔案任務。讓你的預設維持在 medium 或 high。
# ~/.codex/config.toml
model = "gpt-5.6-sol"
model_reasoning_effort = "high" # minimal | low | medium | high (available today)
# "max" effort + the Sol Ultra cooperating-subagent tier
# activate once your org is in the closed preview:
# model = "gpt-5.6-sol-ultra"
# model_reasoning_effort = "max"
# per-run override, no config edit needed:
# codex -c model_reasoning_effort="high" "refactor the auth module"專業提示: 將你的專案預設設為 high,而非 max。然後只在確實需要的那次特定執行時覆寫為 max。這一個習慣就能讓你的基本帳單維持合理,並把昂貴的等級留給真正值得的任務。可用性的詳細資訊請見 OpenAI 說明中心的預覽文章。
Ultra 實際的成本:子代理的 token 倍增效應
以下是沒有人建模的部分:由於 Ultra 會產生協作子代理,一個任務會觸發多次模型呼叫而非一次,而每次呼叫都計收 token 費用。Sol 已證實的定價為每 100 萬輸入 token 5 美元、快取 0.50 美元、每 100 萬輸出 30 美元。輸出是較貴的一側,而 Ultra 會產生多得多的輸出。
我們來算一個實際範例。以基礎版 Sol、單一代理執行一個中等複雜度的代理式任務:
| 模型 | 組成 | Token 數 | 每 100 萬費率 | 成本 |
|---|---|---|---|---|
| Sol(基礎版) | 輸入 | 40,000 | $5 | $0.20 |
| Sol(基礎版) | 輸出 | 15,000 | $30 | $0.45 |
| Sol(基礎版) | 合計 | $0.65 |
現在以 Ultra 執行同一個任務,由一個協調者加上三個協作子代理。共享上下文以 0.50 美元的低價快取,但每個子代理仍會以 30 美元產生自己的輸出:
| 模型 | 組成 | Token 數 | 每 100 萬費率 | 成本 |
|---|---|---|---|---|
| Sol Ultra(估算) | 協調者輸入 | 40,000 | $5 | $0.20 |
| Sol Ultra(估算) | 子代理輸入,快取 | 90,000 | $0.50 | $0.045 |
| Sol Ultra(估算) | 子代理輸入,全新 | 30,000 | $5 | $0.15 |
| Sol Ultra(估算) | 協調者 + 代理間輸出 | 20,000 | $30 | $0.60 |
| Sol Ultra(估算) | 子代理輸出(3 x 15K) | 45,000 | $30 | $1.35 |
| Sol Ultra(估算) | 合計 | ~$2.35 |
對同一個任務而言,這大約是基礎版 Sol 成本的 3.6 倍,而視產生的子代理數量與有多少上下文被快取而定,你會看到 2 倍到 4 倍不等。這個倍數是我們根據已公布定價做出的估算,而非實測的 Ultra 基準,但定價與機制都已獲證實,因此這個輪廓是真實的。
Ultra 的隱藏成本不在於每 token 的費率,而在於一個任務會悄悄變成四次模型呼叫。
有兩件事能減緩這一點:針對共享上下文的提示詞快取(也就是 0.50 美元的快取費率),以及有紀律的路由,讓你只在需要的任務上支付 Ultra 費率。如果你認真看待帳單,我們的指南如何將 LLM API 成本控制在合理範圍涵蓋了我們在客戶端管線所使用的路由模式。定價來源為 DataCamp 與 deeplearning.ai,時間為 2026 年 6 月至 2026 年 7 月。
你現在能用嗎?限量預覽、約 20 家合作夥伴,以及時程
除非你是約 20 家受信任、經政府核准的合作夥伴之一,否則不行。Sol Ultra 處於封閉預覽階段,可透過 OpenAI API 與 Codex 存取,在更廣泛發布前須先通過政府安全審查。OpenAI 表示更廣泛的存取「數週內到來」,除此之外沒有更具體的說法。
你可能看過「7 月 7 日」這個日期在流傳。忽略它。OpenAI 並未給出上線日期,因此任何具體日期都應視為未經證實的傳聞,而非可用來規劃的事實。已證實的是「數週內到來」這個說法,以及 Cerebras 將於 7 月起以每秒最高 750 token 的速度提供 Sol 服務(根據 deeplearning.ai)。
那麼,如果你不是合作夥伴該怎麼辦?現在就做好準備。在你現有的模型上把 Codex 設定與強度梯級調整到位,這樣當 Ultra 開放時,切換模型字串就會是你唯一需要做的變更。決策框:你是受信任的合作夥伴嗎? 不是?那就今天就設定好你的強度等級路由,並準備好隨時換上一行即可。來源:OpenAI 說明中心與 deeplearning.ai。
Sol Ultra、Sol、GPT-5.5 與 Claude Mythos 5:你該選哪個?
依任務來路由,而非依排行榜,尤其當排行榜數字未經驗證時更是如此。大多數日常的代理式編碼使用基礎版 Sol,把 Sol Ultra 留給真正困難的長時程任務,如果 GPT-5.5 已整合進你的技術棧就繼續保留,並在你已經信任 Claude 最新版本的工作流程場景中考慮 Claude Mythos 5。
以下是實用的判斷框架:
- 選基礎版 Sol:當任務屬於一般難度時——一個功能、一個範圍受限的重構、一個測試套件。它的報導成績為 88.8%,成本只是 Ultra 的一小部分。
- 選 Sol Ultra:當任務漫長、橫跨多個檔案,且第一次做錯會耗費可觀時間時。協作子代理的倍增效應若有任何值得之處,就是在這裡。
- 選 GPT-5.5:當它已整合完成,且相對於 Sol 的差距不足以合理化遷移時。
- 選 Claude Mythos 5:當你團隊現有的工具鏈偏向它時。它的報導成績依來源而異(84.3% 到 88.0%),因此別只憑數字就切換。
若要深入了解跨工具的模型路由取捨,我們的編碼代理比較剖析了各自適合的場景。簡短版本:選擇能通過你任務難度門檻的最便宜等級。
開發者在 Reddit 上實際怎麼說
基準測試是一回事,人們在自己終端機裡回報的又是另一回事,而目前 r/codex 的討論串是我們能掌握最誠實的訊號。我們對氣氛的解讀是:謹慎地感到驚艷、深度懷疑,而且大多在爭論價格。
早期的實測好評相當具體。在一個獲 335 讚的 r/codex 討論串中,一位注意到自己的提示被路由到 5.6 的開發者表示,感覺「快了兩倍」,而且「一次就搞定我的提示」,甚至「搶先」修復了過去用 5.5 要好幾輪才能處理的邊緣案例。他的類比相當到位:「感覺完全就像我在 Claude 短暫用過的 Fable 5,但快得多。」一位自稱有內部存取權限的留言者補充說,執行「最大推理等級的任務」所花的時間「比 5.5 少得多」。
接著老鳥們現身了。最響亮的反向聲浪是我們所說的「蜜月後削弱」式犬儒心態:「每次都是這樣,大概撐兩週就會被削弱,」有人寫道。另一位更直白:「趁這兩週狠狠用,因為它只會當兩週的愛因斯坦。」有幾位點出了時機本身的蹊蹺,指出對 5.6 的盛讚貼文恰好出現在對 5.5 退步的抱怨達到高峰之際。耐人尋味的是,該討論串中獲最高票的回覆根本不是分析,而是玩笑(「我已經在用 gpt 6 了」),這充分說明了開發者對版本炒作輪迴有多麼疲憊。
在 Sol Ultra Codex 公告討論串中,對話幾乎完全轉向成本,矛頭直指 Claude。開發者正在衡量 OpenAI 200 美元的 Codex 等級與 Anthropic 的 Fable 促銷,有幾位表示他們正在取消 Claude Max 20x,主要因為 Fable「消耗額度的速度快了一倍」。反覆出現的期望是:「Claude Fable 終於有了真正的競爭對手。對我們使用者是好事。」反覆出現的擔憂——而我們恰好也有同感:「之前被 OpenAI 燙過,他們宣布東西然後把它們鎖在更高級的方案後面,所以等我親眼看到它在本地端跑起來我才信。」
Techsy 的看法: 關於速度的回報與一個更高吞吐量的服務棧應有的表現相符,因此我們相信這些。對於「一次搞定」的說法,我們視為有潛力但在規模化上尚未獲證實,因為「兩週後變笨」的模式確實存在,我們也在過去的發布中親眼見過它上演。而對成本的懷疑完全正確。在 Sol Ultra 真正進入你的 CLI、穩定運行並走完一個完整帳單週期之前,請把這份興奮視為預覽,而非定論。
我們執行 Codex 代理式任務時觀察到的
坦白說:我們無法執行 Sol Ultra。它僅限約 20 家合作夥伴,而我們不在其中,因此我們不會引用自己未實測的 token 數或成績。我們能做的是次佳但仍誠實的事。我們在現有的等級上透過 Codex CLI 執行了代理式任務,並根據 OpenAI 公布的 5 美元/30 美元定價推算出確切的子代理成本。
在我們測試的等級上,強度梯級的表現完全符合預期。在 low 與 medium 強度下,Codex 回應快速,且大多能正確完成範圍受限的修改。在低強度下推入一個困難的跨多檔案任務,它往往會中途停下或漏掉跨檔案的相依性;同樣的任務在高強度下會明顯花更長時間思考才行動,並在一次通過中完成更多變更。這種實際耗時與品質之間的取捨,正是 max 這一級存在的全部理由。
上述的成本建模(約 3.6 倍的範例)是我們能背書的真正第一手分析:它是對已證實定價與已證實子代理機制所做的算術運算,並明確標示為模型估算而非實測。在客戶端的代理式管線上,我們本就依成本路由模型等級,而這正是我們在為任何人開啟 Ultra 之前會進行的確切計算。
唯一重要的設定變更,就是前面 config.toml 中顯示的 model_reasoning_effort 那一行:我們將專案預設維持在 high,並逐次執行覆寫為 max,正如上方專業提示所述。當 Ultra 開放超出預覽範圍時,這樣的設定意味著切換模型字串將是我們唯一要做的修改,而上方的成本試算早已是我們在開啟它之前會進行的計算。一旦我們取得真正的存取權限,我們會立即以實測的 Ultra 數字更新本節,在此之前不會。
關於作者
Mert Batur Gurbuz 是 Techsy.io 的共同創辦人,團隊為 B2B 客戶交付 AI 代理、自動化系統以及語音/SDR 管線。他就讀於伯明罕大學,並撰寫關於 Techsy 團隊在生產環境中實際使用的 LLM 工具棧的文章。歡迎在 LinkedIn 上聯繫。
Techsy.io 共同創辦人,伯明罕大學。
常見問題
什麼是 GPT-5.6 Sol Ultra?
Sol Ultra 是 GPT-5.6 的最高推理強度等級。其核心特色是協作子代理:由一個協調者拆分任務,子代理在工作時彼此傳遞訊息。OpenAI 將它定位用於漫長、困難、多步驟的代理式任務,而非快速修改,並於 2026 年 6 月 26 日將其作為 Sol 系列的一部分進行預覽。
Sol Ultra 現在能在 Codex 中使用嗎?
對多數人來說還不行。截至 2026 年 7 月,Sol Ultra 處於封閉預覽階段,可透過 OpenAI API 與 Codex 存取,僅限約 20 家受信任、經政府核准的合作夥伴,並須通過安全審查。OpenAI 表示更廣泛的存取「數週內到來」,但未公布具體日期,因此你今天無法直接開啟它。
Sol Ultra 中的協作子代理如何運作?
協調者將你的任務拆分成多個部分,並將每一部分指派給一個子代理。與各自獨立的平行代理不同,這些子代理會在任務進行中溝通,分享所學,讓其他子代理在完成前做出調整。這種協調對複雜的跨多檔案工作有幫助,但每個子代理都是一次獨立的模型呼叫,會消耗自己的 token。
GPT-5.6 中的「最大推理強度」是什麼?
最大推理強度是 GPT-5.6 強度梯級的最高一級,該梯級依序為 low、medium、high,再到 max。強度越高,代表模型在回答前會花更多算力進行推理。它對困難的長時程任務有幫助,但在簡單任務上只是浪費錢,因此請把它視為一個旋鈕,只在任務真正困難時才轉高。
執行 Sol Ultra 的成本是多少?
基礎版 Sol 的定價為每 100 萬輸入 token 5 美元、快取 0.50 美元、每 100 萬輸出 30 美元(來源為 DataCamp 與 deeplearning.ai,時間為 2026 年中)。Ultra 會產生協作子代理,因此一個任務會觸發多次模型呼叫。我們的估算範例顯示,單一任務的成本約為基礎版 Sol 執行的 2 倍到 4 倍,主要由額外的輸出 token 驅動。
Sol Ultra 真的比 Claude Mythos 5 強嗎?
就報導數字而言,Sol Ultra(91.9%)在 Terminal-Bench 2.1 上領先 Claude Mythos 5,但這未經驗證。OpenAI 未公布該數字,預覽屬於封閉性質,而 Mythos 5 自身的報導成績也依來源不同而從 84.3% 到 88.0% 不等。因此誠實的答案是:我們還不知道,而且你不該據此導流生產環境的流量。
Sol Ultra 何時會全面開放?
OpenAI 表示,Sol 系列在 ChatGPT、Codex 與 API 上更廣泛的存取「數週內到來」,但並未公布正式上線日期。網路上流傳的任何具體日期(包括「7 月 7 日」)都是未經證實的傳聞,而非官方公告。請關注 OpenAI 自家的預覽頁面以取得確切的時程。
91.9% 的 Terminal-Bench 2.1 成績經過驗證了嗎?
沒有。91.9% 這個數字來自二手媒體,而非 OpenAI 自家的預覽頁面。該預覽僅限約 20 家合作夥伴,且未揭露任何評估方法論,因此圈外沒有人能重現它。它日後可能被證實準確,但目前它是未經驗證的媒體說法,而非定論的基準測試結果。
Sol Ultra 與 GPT-5.5 Pro 的平行代理有何不同?
Pro 的平行代理在各自獨立的軌道上獨立運作:每一個都孤立地完成自己的部分並回傳結果,彼此之間沒有溝通。Sol Ultra 的子代理則相互協作,在任務進行中彼此傳遞訊息,以便在獲知新資訊時做出調整。這種協調適合更困難的多步驟工作,但它也會讓各次呼叫的 token 用量倍增。
我需要 Sol Ultra,還是基礎版 Sol 就夠了?
對大多數代理式編碼而言,基礎版 Sol 或高推理強度就綽綽有餘,而且便宜得多。把 Ultra 保留給那些「第一次嘗試出錯所花的時間會超過額外 token」的長時程、跨多檔案任務。如果你無法清楚說明一個任務難在哪裡,就不需要為它使用 Ultra。依難度來路由,而非依排行榜。
開發者在 Reddit 上怎麼評價 GPT-5.6 Sol?
早期 r/codex 的回報對速度(「快了兩倍」)與一次搞定提示給予正面評價,有幾位開發者將其手感與 Claude 的 Fable 5 相比。但老鳥警告有一種「蜜月後削弱」的模式,模型在發布後會退化,而許多辯論聚焦在成本與 Anthropic 方案的比較,而非純粹的能力。