
GPT-5.5 Pro 基準測試:OpenAI 公布的數字(以及沒公布的)
OpenAI 在 2026 年 4 月 23 日推出 GPT-5.5 Pro,定價為每百萬輸入 token 30 美元、每百萬輸出 token 180 美元,是基礎版 GPT-5.5(5 美元/30 美元)的 6 倍。花這個錢,你得到的是一個算力更高的變體,在 BrowseComp 上拿下 90.1%。但標題不會告訴你的是:OpenAI 自己的評測表把 GPT-5.5 Pro 的程式開發欄位留白了。電腦操作也是。長文本也是。所以當你搜尋這個模型的 SWE-Bench Pro 分數時,根本找不到。我們把官方公布的表格拉出來,逐一核對每個數字。
快速解答:
- GPT-5.5 Pro 是 OpenAI 旗下 GPT-5.5 的高算力變體(2026 年 4 月 23 日發布),不是一個新模型。
- 它在瀏覽能力(BrowseComp 90.1%)和前沿數學上領先,但 OpenAI 把程式開發、電腦操作和長文本的欄位留白了。
- 在有數據的程式開發項目上,基礎版 GPT-5.5 落後 Claude Fable 5(SWE-Bench Pro 58.6% vs 80.3%)。
- Claude Fable 5 目前已被暫停(美國出口管制指令,約 2026 年 6 月 12 日),所以它的勝出帶有一個「現在買不到」的附註。
先說明一下方法,因為在基準測試的文章裡,準確比速度重要:以下數字都與 OpenAI 和 Anthropic 公布的表格,以及 SWE-Bench Pro 論文(arXiv 2509.16941)交叉比對過。如果只有單一廠商報告某個數字,我們會註明。如果 OpenAI 從未公布 Pro 的分數,我們會寫「未公布」,而不是悄悄拿基礎版的數字來充數。
GPT-5.5 Pro 基準測試:OpenAI 實際公布了什麼
GPT-5.5 Pro 公布的基準測試涵蓋範圍很窄:瀏覽、前沿數學、專業知識工作、基因學和廣泛推理。OpenAI 在研究環境中以推理強度 xhigh 執行所有評測,這與正式版 ChatGPT 的預設值不同。最亮眼的數字是 BrowseComp 90.1%,明顯高於基礎版 GPT-5.5 的 84.4%。
以下是總表,其中一欄標示 OpenAI 是否為每項測試公布了獨立的 Pro 分數:
| 基準測試 | 測試內容 | GPT-5.5 Pro | GPT-5.5 基礎版 | Pro 是否公布? | 備註 |
|---|---|---|---|---|---|
| BrowseComp | 高難度網頁瀏覽/資訊檢索 | 90.1% | 84.4% | 是 | Pro 對基礎版最明確的勝出 |
| FrontierMath T1-3 | 高難度數學 | 52.4% | 51.7% | 是 | 勝過已報告的 Opus 4.7(43.8%) |
| FrontierMath T4 | 前沿數學 | 39.6% | 35.4% | 是 | 最難的數學層級 |
| GDPval | 專業知識工作 | 82.3%(宣稱) | 84.9% | 是(歸屬廠商) | OpenAI 的表格中 Pro 低於基礎版 |
| GeneBench | 多階段基因學 | 33.2%(宣稱) | 25.0% | 是(歸屬廠商) | 「OpenAI 報告」大幅躍升 |
| HLE(無工具) | 廣泛高難度推理 | 43.1% | 41.4% | 是 | 低於已報告的 Opus 4.7(46.9%) |
| HLE(有工具) | 工具輔助推理 | 57.2%(宣稱) | 52.2% | 部分 | 基礎版 52.2% 已確認;Pro 57.2% 為宣稱 |
| 投資銀行建模 | 財務建模 | 88.6%(內部) | 88.5% | 內部評測 | OpenAI 標註為 INTERNAL;視為參考 |
| SWE-Bench Pro | 自主程式開發 | 未公布 | 58.6% | 否 | 最大的缺口 |
| OSWorld-Verified | 電腦操作 | 未公布 | 78.7% | 否 | Pro 欄位空白 |
| 網路安全 | 安全任務 | 未公布 | 未顯示 | 否 | Pro 欄位空白 |
| 長文本 | 長文件記憶 | 未公布 | 未顯示 | 否 | Pro 欄位空白 |
請仔細看底部那幾列。OpenAI 公布了 GPT-5.5 Pro 在瀏覽和數學上的分數,但把程式開發、電腦操作、網路安全和長文本的欄位留白了。BrowseComp、FrontierMath 和 GDPval 基礎版的數字已與第三方追蹤平台核實;GDPval Pro 的 82.3%、GeneBench 的 33.2% 以及投資銀行建模的數字是 OpenAI 報告的,但未經獨立驗證,所以我們以歸屬方式呈現,而非直接斷言。
「Pro」到底是什麼意思:平行測試時算力,不是新模型
GPT-5.5 Pro 是同一個 GPT-5.5 模型,只是用更多的推理算力來跑,不是不同的架構。與其把它想成新引擎,不如想成同一顆引擎在回答前跑得更久、平行探索更多路徑。OpenAI 把這個設定叫做推理強度,Pro 把它釘在最高檔:xhigh。
GPT-5.5 Pro 和 GPT-5.5 是不同的模型嗎?
不是。相同的權重、相同的訓練。當大家搜尋 gpt 5.5 pro vs gpt 5.5 thinking 或 vs xhigh 時,其實問的是同一個旋鈕:模型在回覆前思考多深。「平行測試時算力」代表模型同時探索多條推理路徑,然後挑最好的那條,這會消耗更多 token 和更多實際時間。你付的 6 倍價格,買的就是這些額外算力。
其他規格完全相同。GPT-5.5 Pro 的上下文窗口大約是輸入 110 萬 token、輸出 12.8 萬 token。所以你買的不是更大的記憶體或更聰明的基礎模型,而是在你已經熟悉的模型上買更多思考時間。
GPT-5.5 Pro vs GPT-5.5(標準版):6 倍價格買到什麼
GPT-5.5 Pro 在最難的任務上勝過基礎版 GPT-5.5:瀏覽、前沿數學和基因學。在日常工作上,它的加成最小。最乾淨的增益是 BrowseComp 90.1% vs 84.4%,在深度網頁研究上提升 5.7 個百分點。FrontierMath Tier 4 從 35.4% 爬升到 39.6%。
但更多算力不一定代表更高分數。在 GDPval 上,OpenAI 的表格實際上把 Pro 列得比基礎版 GPT-5.5 還低(宣稱 82.3% vs 已確認 84.9%)。這很反直覺,據報導是 Pro 用部分原始勝出換取了校準。重點不變:花更多錢不是保證。
Pro 領先的項目:
- BrowseComp:90.1% vs 84.4%(+5.7)
- FrontierMath T4:39.6% vs 35.4%(+4.2)
- GeneBench:33.2% vs 25.0%(OpenAI 宣稱)
- HLE 有工具:57.2%(宣稱)vs 52.2%(基礎版已確認)
持平或更差的項目:
- GDPval:82.3%(宣稱)vs 基礎版 84.9%
- HLE 無工具:43.1% vs 41.4%,幾乎沒動
如果你的工作主要是日常撰寫、程式碼審查和摘要,6 倍的溢價很難合理化。只有當任務真的很难時,這筆帳才翻得過來。既然談到成本:如果帳單是問題,我們的降低 LLM API 成本指南有說明怎麼把簡單的 80% 工作路由給較便宜的模型,把 Pro 留給最難的 20%。
GPT-5.5 Pro vs Claude Fable 5
在兩家廠商都有報告的程式開發基準測試上,Claude Fable 5 決定性地勝過基礎版 GPT-5.5。但 Fable 5 目前已被暫停,所以這個勝出帶有附註。而且這個比較比表面看起來更複雜,因為 OpenAI 根本沒有公布 GPT-5.5 Pro 的程式開發分數。所以誠實的對照其實是 Fable 5 vs 基礎版 GPT-5.5 的程式開發能力,Pro 缺席。
以下是三方對照表。Fable 5 的數字歸屬於 Anthropic 公布的表格;空白的 Pro 欄位就是空白:
| 測試 | GPT-5.5 基礎版 | GPT-5.5 Pro | Claude Fable 5 | 勝出 |
|---|---|---|---|---|
| SWE-Bench Pro | 58.6% | 未公布 | 80.3% | Fable 5 |
| FrontierCode Diamond | 5.7% | 未公布 | 29.3% | Fable 5 |
| Terminal-Bench | 83.4%(v2.1) | 未公布 | 88.0%(v2.1) | Fable 5 |
| OSWorld-Verified | 78.7% | 未公布 | 85.0% | Fable 5 |
| HLE(無工具) | 41.4% | 43.1% | 56.8-59.0% | Fable 5 |
| HLE(有工具) | 52.2% | 57.2%(宣稱) | 64.5% | Fable 5 |
| BrowseComp | 84.4% | 90.1% | 未公布 | GPT-5.5 Pro |
| FrontierMath T4 | 35.4% | 39.6% | 未報告 | GPT-5.5 Pro |
| GDPval-AA | 1769 | 未公布 | 1932 | Fable 5 |
這張表有兩個注意事項。第一,Terminal-Bench:基礎版 GPT-5.5 在 v2.0 上是 82.7%,v2.1 上是 83.4%,而 Fable 的 88.0% 是 v2.1,所以在判定差距之前,請確認你看的是同一個版本。第二,GDPval-AA 不是百分比,而是 Elo 式分數(Fable 1932 vs 基礎版 GPT-5.5 1769),完全是不同的量表,不要在心里把它跟百分比欄位對齊。HLE 無工具的 Fable 數字也因來源而浮動:CodingFleet 列 56.8%,其他摘要寫 59.0%,所以我們報告區間。
SWE-Bench Pro 是自主程式開發最值得錨定的基準測試。它包含 41 個活躍儲存庫中的 1,865 道題目(根據 arXiv 2509.16941),任務需要資深工程師花數小時甚至數天,且涉及多檔案修補。在這項測試上,Fable 5 的 80.3% 對基礎版 GPT-5.5 的 58.6%,差距很大。
現在說那個附註。Claude Fable 5 在 2026 年 6 月被暫停,依據美國出口管制指令(約 6 月 12 日)。所以「Fable 贏在程式開發」在數字上屬實,但在結帳時目前沒有意義。如果你想看 Anthropic 那邊更完整的分析,這是我們的 Claude Fable 5 完整解析。至於 GPT-5.5 表格在數學上對比的模型,請看 Claude Opus 4.8。
OpenAI 沒有為 Pro 公布的基準測試
OpenAI 從未發布 GPT-5.5 Pro 在程式開發(SWE-Bench Pro)、電腦操作(OSWorld-Verified)、網路安全、長文本記憶或抽象推理上的分數。這些欄位在官方表格中是空白的。空白不代表模型在這些方面差,而是代表沒有公布的數字,任何引用數字的人不是在猜測,就是誤引了基礎版的分數。
這很重要,因為這是最多人搜尋的缺口。如果你搜過 GPT-5.5 Pro 的 SWE-Bench Pro 分數,答案是沒有。OpenAI 從未公布。GPT-5.5 系列在這個基準測試上唯一存在的數字是基礎版的 58.6%,那是基礎版的數字,不是 Pro 的。我們刻意這樣標註。
我們能負責任地說的:
- 程式開發(SWE-Bench Pro):Pro 未公布。基礎版 GPT-5.5 = 58.6%(基礎版,非 Pro)。
- 電腦操作(OSWorld-Verified):Pro 未公布。基礎版 = 78.7%(基礎版,非 Pro)。
- 網路安全:Pro 未公布,表格中沒有可用的基礎版代理數字。
- 長文本:Pro 未公布,沒有可用的基礎版代理數字。
- 抽象推理:Pro 未公布。
Pro 的平行算力能不能拉高那些基礎版數字?根據瀏覽和數學上的模式,很可能。但「很可能」不是基準測試,我們不會印出 OpenAI 沒給的數字。這份克制正是這個章節存在的原因。
定價:$5/$30 vs $30/$180 vs $10/$50——Pro 值 6 倍嗎?
GPT-5.5 Pro 大約是基礎版 GPT-5.5 的 6 倍:每百萬 token 輸入 30 美元、輸出 180 美元,基礎版是 5 美元/30 美元。Claude Fable 5 落在中間,10 美元/50 美元。對高難度研究和前沿數學值得,對日常工作幾乎不值得。
| 模型 | 輸入/百萬 | 輸出/百萬 | 相對成本 |
|---|---|---|---|
| GPT-5.5 基礎版 | $5 | $30 | 1×(基準) |
| Claude Fable 5 | $10 | $50 | 輸入約 2×,輸出約 1.7× |
| GPT-5.5 Pro | $30 | $180 | 約 6× 基礎版 |
那誰真的該付這個溢價?依工作類型的粗略判斷:
- 高難度研究、前沿數學、深度多步驟瀏覽:GPT-5.5 Pro 值得。基準測試的增益是真實的,任務價值也高。
- 大型儲存庫的自主程式開發:能取得 Fable 5 就用 Fable 5,否則用基礎版 GPT-5.5 搭配程式開發框架。為一個未公布的程式開發分數付 Pro 的價格是一筆爛賭注。
- 日常撰寫、摘要、程式碼審查、客服:基礎版 GPT-5.5。6 倍的開銷在這裡幾乎買不到什麼。
陷阱是把所有東西都預設走 Pro「以防萬一」。在輸出量大的工作負載上,那個 180 美元會快速複利累積。依難度路由,你就能用一小部分帳單保住大部分品質(詳見我們的 LLM API 成本指南)。
我們怎麼核對這些數字(以及來源在哪裡不一致)
在這些數字進入文章之前,我們做了不那麼光鮮的部分:拉出 OpenAI 公布的 GPT-5.5 評測表,把每一列 Pro 的數據跟獨立追蹤平台核對,而不是只信一張截圖。我們交叉比對的來源包括 llm-stats、BenchLM、DataCamp 的 Fable 5 分析、CodingFleet,以及 arXiv 上的 SWE-Bench Pro 論文(2509.16941)。以下是站得住腳的和站不住的。
大部分亮眼的 Pro 數字都能乾淨地對上。BrowseComp 90.1%、FrontierMath Tier 1–3 的 52.4% 和 Tier 4 的 39.6%,以及 30 美元/180 美元的定價,在我們查過的每個來源都一致。SWE-Bench Pro 的 Fable 5 80.3% 對基礎版 GPT-5.5 58.6%,以及 FrontierCode Diamond 的 29.3% 對 5.7%,也都對得上——而 SWE-Bench Pro 的題目數量(41 個儲存庫中的 1,865 道)直接來自論文,不是廠商部落格。
有三件事對不上,你應該知道:
- Humanity's Last Exam 有工具版,Fable 5 的數字依來源不同落在 56.8% 到 59.0% 之間。我們引用區間,而非挑一個喜歡的。
- Terminal-Bench 的數字在 OpenAI 和 Anthropic 的表格之間於 2.0 版和 2.1 版之間浮動,所以 GPT-5.5(83.4%)vs Fable(88.0%)的差距不是乾淨的同版本比較。
- 投資銀行建模分數(Pro 88.6%)被 OpenAI 標為「內部」,代表沒有獨立追蹤平台能證實。我們每次提到都標為廠商宣稱。
這是誠實的版本。我們當做事實呈現的數字,至少在兩個獨立來源間對得上;其他一切都歸屬於報告者。我們沒有自己跑過 GPT-5.5 Pro——以每百萬 token 30 美元/180 美元的價格,一場認真的正面對決不是我們會假裝做過的,所以我們不會假裝有我們沒有的實驗結果。
廠商報告的實際成果
這些是廠商宣稱,不是獨立實驗室結果,所以請當作接近行銷的證據來讀。OpenAI 和 Anthropic 各自發布了案例研究,描繪了一幅漂亮的圖景。我們以歸屬方式列出,附註是我們均未驗證。
OpenAI 方面,該公司表示一個財務團隊用 Codex 搭配 GPT-5.5 審查了 24,771 份 K-1 稅表(71,637 頁),比前一年的流程快了大約兩週。OpenAI 也報告了一個從單一提示詞在 11 分鐘內建出的代數幾何應用程式,以及 GPT-5.5 Pro 對一個涵蓋 62 個樣本、約 28,000 個基因的基因表達資料集的分析。
Anthropic 方面,Stripe(經 Anthropic 報告)用 Fable 5 在一天內對一個 5,000 萬行的 Ruby 程式碼庫執行了全面遷移,而人工估計需要兩個多月。Anthropic 也表示 Fable 5 從原始截圖完成了 Pokémon FireRed,早期的 Claude 模型需要額外的鷹架工具,而且搭配持久化檔案記憶,它玩 Slay the Spire 的表現比 Opus 4.8 好約 3 倍。
都是令人印象深刻的展示。只要記得,這些是廠商挑選的,而且光靠新聞稿無法重現。
你到底該用哪個模型?
把工作跟模型配對,不是跟熱度配對。程式開發代理和大型儲存庫,如果你用得到 Claude Fable 5 就用它,用不到就用基礎版 GPT-5.5 搭配程式開發框架。研究、前沿數學和深度瀏覽,選 GPT-5.5 Pro。日常工作和成本效率,基礎版 GPT-5.5 幾乎每次都在性價比上勝出。
如果你是在選技術棧而不是單一呼叫,這裡有幾個指引。如果你真的想要一個自主程式開發系統,你要的是工具,不是裸模型,所以從 2026 年最佳 AI 程式開發代理和背景程式開發代理比較開始,了解 Codex 和 Devin 的背景。好奇這個系列接下來會走向哪裡?這是 GPT-5.6 的洩漏消息。
在 Techsy,我們在代理管線中依任務路由——最難的判斷用頂級推理模型,其餘用較便宜的模型——而不是每個請求都付溢價。如果你想對自己的模型組合聽聽第二意見,預約免費諮詢。
關於作者
Mert Batur Gurbuz 是 Techsy.io 的共同創辦人,團隊為 B2B 客戶打造 AI 代理、自動化系統和語音/SDR 管線。他就讀於伯明罕大學,撰寫 Techsy 團隊在生產環境中實際使用的 LLM 工具棧相關文章。歡迎在 LinkedIn 上連結。
常見問題
GPT-5.5 Pro 值得嗎?
取決於工作。對高難度研究、前沿數學和深度瀏覽,GPT-5.5 Pro 相對基礎版的增益(BrowseComp 90.1% vs 84.4%)足以合理化每百萬 token 30 美元/180 美元、約 6 倍的價格。對日常撰寫、程式碼審查和摘要,基礎版 GPT-5.5 用六分之一的成本給你幾乎相同的品質。
GPT-5.5 Pro 比 Claude Fable 5 強嗎?
在已公布的程式開發基準測試上,不是:Claude Fable 5 在 SWE-Bench Pro 上勝過基礎版 GPT-5.5(80.3% vs 58.6%),而 OpenAI 從未公布可供比較的 Pro 程式開發分數。GPT-5.5 Pro 在瀏覽和前沿數學上勝出。有一個陷阱:Fable 5 目前因美國出口管制指令被暫停,所以可用性跟基準測試一樣重要。
GPT-5.5 Pro 的程式開發能力如何?
老實說,從 OpenAI 的數字我們無法判斷,因為 OpenAI 沒有公布 GPT-5.5 Pro 的程式開發分數。這個系列唯一的程式開發數字是基礎版 GPT-5.5 的 SWE-Bench Pro 結果 58.6%,落後 Claude Fable 5 的 80.3%。任何引用「Pro 程式開發基準測試」的人,很可能是在誤引基礎版的數字。
GPT-5.5 Pro vs GPT-5.5 標準版——我該用哪個?
把 GPT-5.5 Pro 用在高難度研究、前沿數學和深度多步驟瀏覽上,它的額外平行算力值得 6 倍價格。把基礎版 GPT-5.5 用在日常工作、程式碼審查和摘要上,溢價在這些地方買不到什麼。在某些測試上,例如 GDPval,OpenAI 的表格甚至把 Pro 列得比基礎版略低。
GPT-5.5 Pro 多少錢?
GPT-5.5 Pro 每百萬輸入 token 30 美元、每百萬輸出 token 180 美元,大約是基礎版 GPT-5.5(5 美元/30 美元)的 6 倍。作為比較,Claude Fable 5 是 10 美元/50 美元。在輸出量大的工作負載上,Pro 的溢價會快速複利累積,所以依任務難度路由而非預設走 Pro,能省下真金白銀。
推理強度「xhigh」是什麼?
推理強度是控制 GPT-5.5 在回答前思考多深的旋鈕。「xhigh」是最高檔,模型使用平行測試時算力探索多條推理路徑,然後挑最好的。OpenAI 在研究環境中以 xhigh 執行其公布的 GPT-5.5 Pro 評測,這與正式版 ChatGPT 的預設值不同。
GPT-5.5 Pro 可以在 Codex 中使用嗎?
可以。你可以在 Codex CLI 中用模型字串 gpt-5.5-pro 呼叫 GPT-5.5 Pro,並將推理強度設為 xhigh 以取得最高算力行為。預期延遲會更高,token 成本也會明顯高於基礎版 GPT-5.5,所以把它留給真正困難的任務,而不是當作預設的程式開發模型。
GPT-5.5 Pro 是新模型嗎?
不是。GPT-5.5 Pro 是同一個 GPT-5.5 模型,以更高的推理強度和平行測試時算力在 xhigh 設定下運行,不是獨立的架構。它共享相同的權重,以及大約 110 萬輸入和 12.8 萬輸出 token 的相同上下文窗口。你付的是更多思考時間,不是更聰明的基礎模型。
GPT-5.5 Pro 的上下文窗口多大?
GPT-5.5 Pro 的上下文窗口大約是輸入 110 萬 token、輸出 12.8 萬 token,與基礎版 GPT-5.5 相同。這足以在單次呼叫中載入大型程式碼庫或長文件。Pro 和基礎版的差別不在記憶體大小,而在模型回答前花多少推理算力。