
Benchmark GPT-5.5 Pro: Những con số OpenAI đã công bố (và những con số họ không công bố)
OpenAI phát hành GPT-5.5 Pro vào ngày 23 tháng 4 năm 2026, với mức giá $30 cho mỗi triệu token đầu vào và $180 cho mỗi triệu token đầu ra. Gấp 6 lần mức $5/$30 của GPT-5.5 cơ sở. Với số tiền đó, bạn nhận được một biến thể có sức tính toán cao hơn, đạt 90.1% trên BrowseComp. Nhưng đây là phần không ai đưa lên tiêu đề: bảng eval của chính OpenAI bỏ trống hàng lập trình của GPT-5.5 Pro. Tương tự với sử dụng máy tính. Tương tự với ngữ cảnh dài. Vì vậy khi bạn tìm điểm SWE-Bench Pro của mô hình này, chẳng có con số nào để tìm. Chúng tôi đã kéo bảng đã công bố và tự đánh giá từng con số.
Câu trả lời nhanh:
- GPT-5.5 Pro là biến thể sức tính toán cao hơn của GPT-5.5 (phát hành 23/4/2026), không phải mô hình mới.
- Nó dẫn đầu về duyệt web (BrowseComp 90.1%) và toán tiên phong, nhưng OpenAI bỏ trống các hàng lập trình, sử dụng máy tính và ngữ cảnh dài.
- Trên các hàng lập trình có tồn tại, GPT-5.5 cơ sở thua Claude Fable 5 (SWE-Bench Pro 58.6% vs 80.3%).
- Claude Fable 5 hiện đang bị đình chỉ (chỉ thị kiểm soát xuất khẩu của Mỹ, khoảng 12/6/2026), nên các chiến thắng của nó đi kèm dấu sao "không thể mua được lúc này".
Một ghi chú nhanh về phương pháp, vì độ chính xác quan trọng hơn tốc độ trong một bài benchmark: các con số bên dưới được đối chiếu chéo với bảng công bố của OpenAI và Anthropic cùng bài báo SWE-Bench Pro (arXiv 2509.16941). Khi chỉ một nhà cung cấp báo cáo một con số, chúng tôi nói rõ. Khi OpenAI chưa từng công bố điểm Pro, chúng tôi viết "chưa công bố" thay vì âm thầm thay bằng con số của bản cơ sở.
Benchmark GPT-5.5 Pro: OpenAI thực sự đã công bố những gì
Benchmark đã công bố của GPT-5.5 Pro chỉ bao phủ một lát cắt hẹp: duyệt web, toán tiên phong, công việc tri thức chuyên nghiệp, di truyền học và suy luận rộng. OpenAI chạy mọi eval ở mức reasoning effort xhigh trong môi trường nghiên cứu, khác với mặc định ChatGPT trong sản xuất. Con số tiêu đề là BrowseComp 90.1%, vượt xa mức 84.4% của GPT-5.5 cơ sở.
Đây là bảng tổng hợp, với một cột cho biết OpenAI có công bố điểm Pro riêng cho từng bài kiểm tra hay không:
| Benchmark | Kiểm tra gì | GPT-5.5 Pro | GPT-5.5 cơ sở | Pro đã công bố? | Ghi chú |
|---|---|---|---|---|---|
| BrowseComp | Duyệt web khó / tìm thông tin | 90.1% | 84.4% | Có | Chiến thắng rõ nhất của Pro so với bản cơ sở |
| FrontierMath T1-3 | Toán khó | 52.4% | 51.7% | Có | Vượt Opus 4.7 được báo cáo (43.8%) |
| FrontierMath T4 | Toán tiên phong | 39.6% | 35.4% | Có | Bậc toán khó nhất |
| GDPval | Công việc tri thức chuyên nghiệp | 82.3% (tuyên bố) | 84.9% | Có (quy kết) | Bảng OpenAI xếp Pro dưới bản cơ sở |
| GeneBench | Di truyền học đa giai đoạn | 33.2% (tuyên bố) | 25.0% | Có (quy kết) | "OpenAI báo cáo" bước nhảy lớn |
| HLE (không công cụ) | Suy luận khó tổng quát | 43.1% | 41.4% | Có | Dưới Opus 4.7 được báo cáo (46.9%) |
| HLE (có công cụ) | Suy luận có công cụ hỗ trợ | 57.2% (tuyên bố) | 52.2% | Một phần | Bản cơ sở 52.2% đã xác nhận; Pro 57.2% là tuyên bố |
| Mô hình hóa Ngân hàng Đầu tư | Mô hình hóa tài chính | 88.6% (nội bộ) | 88.5% | Eval nội bộ | OpenAI đánh dấu INTERNAL; xem là tham khảo |
| SWE-Bench Pro | Lập trình agentic | chưa công bố | 58.6% | Không | Khoảng trống tiêu đề |
| OSWorld-Verified | Sử dụng máy tính | chưa công bố | 78.7% | Không | Trống cho Pro |
| An ninh mạng | Tác vụ bảo mật | chưa công bố | không hiển thị | Không | Trống cho Pro |
| Ngữ cảnh dài | Ghi nhớ tài liệu dài | chưa công bố | không hiển thị | Không | Trống cho Pro |
Hãy đọc kỹ khối dưới cùng. OpenAI công bố điểm GPT-5.5 Pro cho duyệt web và toán, nhưng bỏ trống các hàng lập trình, sử dụng máy tính, an ninh mạng và ngữ cảnh dài. Các con số BrowseComp, FrontierMath và GDPval bản cơ sở đã được xác nhận đối chiếu với các tracker độc lập; GDPval-Pro 82.3%, GeneBench 33.2% và con số Mô hình hóa Ngân hàng Đầu tư do OpenAI báo cáo nhưng chưa được xác minh độc lập, nên chúng tôi quy kết nguồn thay vì khẳng định trực tiếp.
"Pro" thực sự nghĩa là gì: Sức tính toán song song lúc kiểm tra, không phải mô hình mới
GPT-5.5 Pro là cùng mô hình GPT-5.5 chạy với reasoning effort cao hơn rất nhiều, không phải kiến trúc khác. Hãy nghĩ nó không giống một động cơ mới mà giống cùng động cơ đó chạy lâu hơn và song song trước khi trả lời. OpenAI gọi cài đặt này là reasoning effort, và Pro ghim nó ở bậc cao nhất: xhigh.
GPT-5.5 Pro có phải mô hình khác với GPT-5.5 không?
Không. Cùng trọng số, cùng quá trình huấn luyện. Khi mọi người tìm gpt 5.5 pro vs gpt 5.5 thinking hoặc vs xhigh, họ thực sự đang hỏi về một nút vặn duy nhất: mô hình suy nghĩ kỹ đến mức nào trước khi trả lời. "Sức tính toán song song lúc kiểm tra" nghĩa là mô hình khám phá nhiều đường suy luận cùng lúc và chọn đường tốt nhất, tốn nhiều token hơn và nhiều thời gian thực hơn. Sức tính toán thêm đó chính là thứ bạn trả gấp 6 lần.
Các thông số kỹ thuật còn lại được chia sẻ chung. GPT-5.5 Pro có cửa sổ ngữ cảnh khoảng 1.1M token đầu vào và 128K đầu ra. Vậy bạn không mua bộ nhớ lớn hơn hay mô hình cơ sở thông minh hơn. Bạn mua thêm thời gian suy nghĩ trên mô hình bạn đã biết.
GPT-5.5 Pro vs GPT-5.5 (Tiêu chuẩn): Mức giá gấp 6 lần mua được gì cho bạn
GPT-5.5 Pro vượt GPT-5.5 cơ sở trên các tác vụ khó nhất: duyệt web, toán tiên phong và di truyền học. Nó mua được ít nhất cho bạn ở công việc thường ngày. Mức tăng rõ ràng nhất là BrowseComp 90.1% vs 84.4%, tăng 5.7 điểm trên nghiên cứu web sâu. Trên FrontierMath Bậc 4, nó leo lên 39.6% từ 35.4%.
Nhưng nhiều sức tính toán hơn không phải lúc nào cũng đồng nghĩa điểm cao hơn. Trên GDPval, bảng của OpenAI thực tế xếp Pro thấp hơn GPT-5.5 cơ sở (82.3% tuyên bố vs 84.9% đã xác nhận). Điều này ngược trực giác, và được báo cáo là Pro đánh đổi một số chiến thắng thô để lấy hiệu chuẩn. Điểm mấu chốt vẫn đúng: trả nhiều hơn không đảm bảo kết quả tốt hơn.
Nơi Pro vượt lên:
- BrowseComp: 90.1% vs 84.4% (+5.7)
- FrontierMath T4: 39.6% vs 35.4% (+4.2)
- GeneBench: 33.2% vs 25.0% (OpenAI tuyên bố)
- HLE có công cụ: 57.2% (tuyên bố) vs 52.2% (bản cơ sở đã xác nhận)
Nơi nó ngang hoặc kém hơn:
- GDPval: 82.3% (tuyên bố) vs 84.9% bản cơ sở
- HLE không công cụ: 43.1% vs 41.4%, hầu như không nhúc nhích
Nếu công việc của bạn chủ yếu là soạn thảo hàng ngày, review code và tóm tắt, mức phí gấp 6 lần khó mà biện minh. Bài toán chỉ đảo chiều khi tác vụ thực sự khó. Nhân tiện nói về chi phí: nếu hóa đơn là vấn đề, hướng dẫn của chúng tôi về cắt giảm chi phí API LLM bao gồm việc định tuyến mô hình rẻ hơn cho 80% tác vụ dễ và dành Pro cho 20% tác vụ khó.
GPT-5.5 Pro vs Claude Fable 5
Trên các benchmark lập trình mà cả hai nhà cung cấp đều báo cáo, Claude Fable 5 thắng GPT-5.5 cơ sở một cách quyết định. Nhưng Fable 5 hiện đang bị đình chỉ, nên chiến thắng đi kèm dấu sao. Và phép so sánh rối hơn vẻ bề ngoài, vì OpenAI hoàn toàn không công bố điểm lập trình của GPT-5.5 Pro. Vậy cuộc đối đầu trung thực thực sự là Fable 5 vs GPT-5.5 cơ sở trên mảng lập trình, với Pro vắng mặt.
Đây là bảng ba bên. Các con số Fable 5 được quy kết từ bảng công bố của Anthropic; các ô Pro trống chính xác là trống:
| Bài kiểm tra | GPT-5.5 cơ sở | GPT-5.5 Pro | Claude Fable 5 | Người thắng |
|---|---|---|---|---|
| SWE-Bench Pro | 58.6% | chưa công bố | 80.3% | Fable 5 |
| FrontierCode Diamond | 5.7% | chưa công bố | 29.3% | Fable 5 |
| Terminal-Bench | 83.4% (v2.1) | chưa công bố | 88.0% (v2.1) | Fable 5 |
| OSWorld-Verified | 78.7% | chưa công bố | 85.0% | Fable 5 |
| HLE (không công cụ) | 41.4% | 43.1% | 56.8-59.0% | Fable 5 |
| HLE (có công cụ) | 52.2% | 57.2% (tuyên bố) | 64.5% | Fable 5 |
| BrowseComp | 84.4% | 90.1% | chưa công bố | GPT-5.5 Pro |
| FrontierMath T4 | 35.4% | 39.6% | không báo cáo | GPT-5.5 Pro |
| GDPval-AA | 1769 | chưa công bố | 1932 | Fable 5 |
Hai lưu ý nằm trong bảng đó. Thứ nhất, Terminal-Bench: GPT-5.5 cơ sở đạt 82.7% trên v2.0 và 83.4% trên v2.1, trong khi 88.0% của Fable là trên v2.1, nên hãy chắc chắn bạn đang đọc cùng phiên bản trước khi tuyên bố khoảng cách. Thứ hai, GDPval-AA không phải phần trăm. Nó là điểm kiểu Elo (1932 cho Fable vs 1769 cho GPT-5.5 cơ sở), một thang đo hoàn toàn khác, nên đừng xếp nó ngang hàng với các hàng phần trăm trong đầu. Con số HLE không công cụ của Fable cũng dao động theo nguồn: CodingFleet ghi 56.8% trong khi các bản tổng hợp khác nói 59.0%, nên chúng tôi báo cáo khoảng dao động.
SWE-Bench Pro là benchmark để neo vào cho lập trình agentic. Nó chạy 1,865 bài toán trên 41 kho lưu trữ đang hoạt động (theo arXiv 2509.16941), với các tác vụ mất hàng giờ hoặc hàng ngày của một kỹ sư cấp cao và yêu cầu bản vá đa tệp. Trên bài kiểm tra đó, 80.3% của Fable 5 so với 58.6% của GPT-5.5 cơ sở là một khoảng cách rộng.
Giờ đến dấu sao. Claude Fable 5 bị đình chỉ vào tháng 6 năm 2026 theo chỉ thị kiểm soát xuất khẩu của Mỹ (khoảng ngày 12/6). Vậy "Fable thắng mảng lập trình" đúng trên con số và hiện tại vô nghĩa ở quầy thanh toán. Nếu bạn muốn bức tranh sâu hơn từ phía Anthropic, đây là bản phân tích đầy đủ về Claude Fable 5 của chúng tôi. Về mô hình mà bảng benchmark của GPT-5.5 đối đầu trên mảng toán, xem Claude Opus 4.8.
Những benchmark OpenAI KHÔNG công bố cho Pro
OpenAI chưa từng phát hành điểm GPT-5.5 Pro cho lập trình (SWE-Bench Pro), sử dụng máy tính (OSWorld-Verified), an ninh mạng, ghi nhớ ngữ cảnh dài, hay suy luận trừu tượng. Những hàng đó trống trong bảng chính thức. Trống không có nghĩa mô hình kém ở những mảng đó. Nó nghĩa là không có con số được công bố, và bất kỳ ai trích dẫn một con số đều đang đoán hoặc đang trích dẫn nhầm điểm của bản cơ sở.
Điều này quan trọng vì đây là khoảng trống được tìm kiếm nhiều nhất. Nếu bạn tìm điểm SWE-Bench Pro của GPT-5.5 Pro, không có con số nào. OpenAI chưa từng công bố nó. Con số duy nhất tồn tại cho benchmark đó trong họ GPT-5.5 là 58.6% của mô hình cơ sở, và đó là con số của bản cơ sở, không phải của Pro. Chúng tôi cố ý đánh dấu nó theo cách đó.
Những gì chúng tôi có thể nói một cách có trách nhiệm:
- Lập trình (SWE-Bench Pro): Pro chưa công bố. GPT-5.5 cơ sở = 58.6% (bản cơ sở, không phải Pro).
- Sử dụng máy tính (OSWorld-Verified): Pro chưa công bố. Bản cơ sở = 78.7% (bản cơ sở, không phải Pro).
- An ninh mạng: Pro chưa công bố, không có proxy bản cơ sở nào dùng được trong bảng.
- Ngữ cảnh dài: Pro chưa công bố, không có proxy bản cơ sở nào dùng được.
- Suy luận trừu tượng: Pro chưa công bố.
Sức tính toán song song của Pro có thể nâng những con số bản cơ sở đó lên không? Có thể, dựa trên mô hình ở duyệt web và toán. Nhưng "có thể" không phải benchmark, và chúng tôi sẽ không in một con số mà OpenAI không đưa ra. Sự kiềm chế đó chính là toàn bộ lý do phần này tồn tại.
Giá cả: $5/$30 vs $30/$180 vs $10/$50 — Pro có đáng gấp 6 lần?
GPT-5.5 Pro có giá khoảng 6 lần GPT-5.5 cơ sở: $30 đầu vào và $180 đầu ra cho mỗi triệu token, so với bản cơ sở ở mức $5/$30. Claude Fable 5 nằm giữa hai mức đó ở $10/$50. Đáng giá cho nghiên cứu khó và toán tiên phong, hiếm khi đáng cho công việc hàng ngày.
| Mô hình | Đầu vào / 1M | Đầu ra / 1M | Chi phí tương đối |
|---|---|---|---|
| GPT-5.5 cơ sở | $5 | $30 | 1× (mốc) |
| Claude Fable 5 | $10 | $50 | ~2× đầu vào, ~1.7× đầu ra |
| GPT-5.5 Pro | $30 | $180 | ~6× bản cơ sở |
Vậy ai thực sự nên trả mức phí cao? Phán quyết sơ bộ theo công việc:
- Nghiên cứu khó, toán tiên phong, duyệt web đa bước sâu: GPT-5.5 Pro xứng đáng. Mức tăng benchmark là thật và giá trị tác vụ cao.
- Lập trình agentic trên kho lớn: Fable 5 nếu bạn có thể tiếp cận, nếu không thì GPT-5.5 cơ sở bọc trong một scaffold lập trình. Trả giá Pro cho một điểm lập trình chưa công bố là một cược tệ.
- Soạn thảo hàng ngày, tóm tắt, review code, hỗ trợ: GPT-5.5 cơ sở. Chi phí gấp 6 lần hầu như không mua được gì ở đây.
Cái bẫy là mặc định mọi thứ sang Pro "cho chắc". Trên các workload nặng đầu ra, con số $180 đó cộng dồn rất nhanh. Định tuyến theo độ khó và bạn giữ được phần lớn chất lượng với một phần nhỏ hóa đơn (chi tiết hơn trong hướng dẫn chi phí API LLM của chúng tôi).
Cách chúng tôi kiểm tra những con số này (và nơi các nguồn không khớp)
Trước khi bất kỳ con số nào trong số này được đưa vào bài, chúng tôi đã làm phần không hào nhoáng: kéo bảng eval GPT-5.5 đã công bố của OpenAI và kiểm tra từng hàng Pro đối chiếu với các tracker độc lập thay vì tin một ảnh chụp màn hình. Các nguồn chúng tôi đối chiếu là llm-stats, BenchLM, bài viết về Fable 5 của DataCamp, CodingFleet, và bài báo SWE-Bench Pro trên arXiv (2509.16941). Đây là những gì đứng vững và những gì không.
Hầu hết các con số Pro tiêu đề khớp sạch. BrowseComp 90.1%, FrontierMath Bậc 1–3 52.4% và Bậc 4 39.6%, cùng mức giá $30/$180 đều khớp trên mọi nguồn chúng tôi kiểm tra. SWE-Bench Pro ở mức 80.3% cho Fable 5 so với 58.6% cho GPT-5.5 cơ sở, và FrontierCode Diamond ở mức 29.3% so với 5.7%, cũng đứng vững — và số lượng tác vụ SWE-Bench Pro (1,865 bài toán trên 41 kho lưu trữ) lấy thẳng từ bài báo, không phải từ blog nhà cung cấp.
Ba điều không khớp, và bạn nên biết về chúng:
- Humanity's Last Exam, có công cụ, cho Fable 5 xuất hiện ở bất kỳ đâu từ 56.8% đến 59.0% tùy nguồn. Chúng tôi trích dẫn khoảng dao động thay vì chọn một con số ưa thích.
- Con số Terminal-Bench dao động giữa phiên bản 2.0 và 2.1 trên bảng của OpenAI và Anthropic, nên khoảng cách GPT-5.5 (83.4%) vs Fable (88.0%) không phải phép đọc táo-với-táo sạch sẽ.
- Điểm Mô hình hóa Ngân hàng Đầu tư (88.6% Pro) được OpenAI gắn nhãn "nội bộ", nghĩa là không tracker độc lập nào có thể xác nhận. Chúng tôi đánh dấu nó là tuyên bố của nhà cung cấp mỗi lần nó xuất hiện.
Đó là phiên bản trung thực. Những con số chúng tôi trình bày như sự thật đã khớp trên ít nhất hai nguồn độc lập; mọi thứ khác được quy kết cho ai đã báo cáo nó. Chúng tôi không tự chạy GPT-5.5 Pro — ở mức $30/$180 cho mỗi triệu token, một cuộc đối đầu nghiêm túc không phải thứ chúng tôi sẽ giả vờ, nên chúng tôi sẽ không giả bộ có kết quả phòng thí nghiệm mà chúng tôi không có.
Kết quả thực tế mà các nhà cung cấp đang báo cáo
Đây là tuyên bố của nhà cung cấp, không phải kết quả phòng thí nghiệm độc lập, nên hãy đọc chúng như bằng chứng gần với marketing. OpenAI và Anthropic mỗi bên công bố các case study vẽ nên bức tranh đẹp. Chúng tôi liệt kê chúng có quy kết nguồn, với lưu ý rằng không có cái nào được chúng tôi xác minh.
Về phía OpenAI, công ty nói rằng một đội tài chính đã dùng Codex với GPT-5.5 để review 24,771 mẫu thuế K-1 (71,637 trang), hoàn thành nhanh hơn khoảng hai tuần so với quy trình năm trước. OpenAI cũng báo cáo một ứng dụng hình học đại số hoạt động được xây từ một prompt duy nhất trong 11 phút, và một phân tích GPT-5.5 Pro trên bộ dữ liệu biểu hiện gen trải rộng 62 mẫu và khoảng 28,000 gen.
Về phía Anthropic, Stripe (được báo cáo qua Anthropic) đã dùng Fable 5 để chạy migration toàn bộ codebase trên một codebase Ruby 50 triệu dòng trong một ngày, so với ước tính hơn 2 tháng làm thủ công. Anthropic cũng nói Fable 5 đã hoàn thành Pokémon FireRed từ ảnh chụp màn hình thô, trong khi các mô hình Claude trước đó cần thêm công cụ scaffolding, và với bộ nhớ dựa trên tệp bền vững, nó chơi Slay the Spire tốt hơn khoảng 3 lần so với Opus 4.8.
Những demo ấn tượng, tất cả chúng. Chỉ cần nhớ rằng chúng được chọn bởi các nhà cung cấp và không thể tái tạo chỉ từ thông cáo báo chí.
Bạn thực sự nên dùng mô hình nào?
Ghép mô hình với công việc, không phải với hype. Cho agent lập trình và kho lớn, hãy chọn Claude Fable 5 nếu nó khả dụng với bạn, và GPT-5.5 cơ sở bọc trong scaffold lập trình nếu không. Cho nghiên cứu, toán tiên phong và duyệt web sâu, GPT-5.5 Pro là lựa chọn. Cho công việc hàng ngày và hiệu quả chi phí, GPT-5.5 cơ sở thắng về giá trị gần như mọi lúc.
Một vài gợi ý nếu bạn đang chọn một stack thay vì một cuộc gọi duy nhất. Nếu bạn thực sự muốn một hệ thống lập trình tự động, bạn cần một công cụ, không phải một mô hình thô, nên bắt đầu với các AI coding agent tốt nhất năm 2026 và bài tổng hợp so sánh background coding agent để có bối cảnh về Codex và Devin. Tò mò họ mô hình này đi về đâu tiếp theo? Đây là những gì đang rò rỉ về GPT-5.6.
Tại Techsy, chúng tôi định tuyến theo từng tác vụ trên các pipeline agent của mình, mô hình suy luận hàng đầu cho các quyết định khó và mô hình rẻ hơn cho phần còn lại, thay vì trả giá cao cấp cho mọi yêu cầu. Nếu bạn muốn ý kiến thứ hai về hỗn hợp mô hình của chính mình, nhận tư vấn miễn phí.
Về tác giả
Mert Batur Gurbuz là Đồng sáng lập của Techsy.io, nơi đội ngũ triển khai AI agent, hệ thống tự động hóa, và pipeline voice/SDR cho khách hàng B2B. Anh học tại Đại học Birmingham và viết về stack công cụ LLM mà đội Techsy thực sự dùng trong sản xuất. Kết nối trên LinkedIn.
Câu hỏi thường gặp
GPT-5.5 Pro có đáng không?
Tùy vào công việc. Cho nghiên cứu khó, toán tiên phong và duyệt web sâu, mức tăng của GPT-5.5 Pro so với bản cơ sở (BrowseComp 90.1% vs 84.4%) biện minh cho mức giá khoảng 6 lần là $30/$180 cho mỗi triệu token. Cho soạn thảo hàng ngày, review code và tóm tắt, GPT-5.5 cơ sở cho bạn chất lượng gần như tương đương với một phần sáu chi phí.
GPT-5.5 Pro có tốt hơn Claude Fable 5 không?
Trên các benchmark lập trình đã công bố, không: Claude Fable 5 thắng GPT-5.5 cơ sở trên SWE-Bench Pro (80.3% vs 58.6%), và OpenAI chưa từng công bố điểm lập trình Pro để so sánh. GPT-5.5 Pro thắng ở duyệt web và toán tiên phong. Một điểm cần lưu ý: Fable 5 hiện đang bị đình chỉ theo chỉ thị kiểm soát xuất khẩu của Mỹ, nên khả năng tiếp cận quan trọng ngang benchmark.
GPT-5.5 Pro giỏi lập trình đến mức nào?
Thành thật mà nói, chúng tôi không thể kết luận từ con số của OpenAI, vì OpenAI không công bố điểm lập trình của GPT-5.5 Pro. Con số lập trình duy nhất cho họ mô hình này là kết quả SWE-Bench Pro 58.6% của GPT-5.5 cơ sở, thua 80.3% của Claude Fable 5. Bất kỳ ai trích dẫn "benchmark lập trình Pro" đều có thể đang trích dẫn nhầm con số của bản cơ sở.
GPT-5.5 Pro vs GPT-5.5 tiêu chuẩn — nên dùng cái nào?
Dùng GPT-5.5 Pro cho nghiên cứu khó, toán tiên phong và duyệt web đa bước sâu, nơi sức tính toán song song thêm của nó xứng đáng mức giá gấp 6 lần. Dùng GPT-5.5 cơ sở cho công việc hàng ngày, review code và tóm tắt, nơi mức phí cao mua được rất ít. Trên một số bài kiểm tra, như GDPval, bảng của OpenAI thậm chí xếp Pro hơi dưới bản cơ sở.
GPT-5.5 Pro giá bao nhiêu?
GPT-5.5 Pro có giá $30 cho mỗi triệu token đầu vào và $180 cho mỗi triệu token đầu ra, khoảng 6 lần mức $5/$30 của GPT-5.5 cơ sở. Để so sánh, Claude Fable 5 ở mức $10/$50. Trên các workload nặng đầu ra, mức phí Pro cộng dồn rất nhanh, nên định tuyến theo độ khó tác vụ thay vì mặc định sang Pro sẽ tiết kiệm tiền thực sự.
Reasoning effort "xhigh" là gì?
Reasoning effort là nút vặn kiểm soát mức độ suy nghĩ kỹ của GPT-5.5 trước khi trả lời. "xhigh" là bậc cao nhất, nơi mô hình dùng sức tính toán song song lúc kiểm tra để khám phá nhiều đường suy luận và chọn đường tốt nhất. OpenAI chạy các eval GPT-5.5 Pro đã công bố ở mức xhigh trong môi trường nghiên cứu, khác với mặc định ChatGPT trong sản xuất.
GPT-5.5 Pro có khả dụng trong Codex không?
Có. Bạn có thể gọi GPT-5.5 Pro trong Codex CLI bằng chuỗi mô hình gpt-5.5-pro, và đặt reasoning effort thành xhigh cho hành vi sức tính toán cao nhất. Hãy kỳ vọng độ trễ cao hơn và chi phí token cao hơn đáng kể so với GPT-5.5 cơ sở, nên dành nó cho các tác vụ thực sự khó thay vì chạy nó làm mô hình lập trình mặc định.
GPT-5.5 Pro có phải mô hình mới không?
Không. GPT-5.5 Pro là cùng mô hình GPT-5.5 chạy với reasoning effort cao hơn và sức tính toán song song lúc kiểm tra ở cài đặt xhigh, không phải kiến trúc riêng biệt. Nó chia sẻ cùng trọng số và cùng cửa sổ ngữ cảnh khoảng 1.1M đầu vào và 128K token đầu ra. Bạn đang trả tiền cho thêm thời gian suy nghĩ, không phải mô hình cơ sở thông minh hơn.
Cửa sổ ngữ cảnh của GPT-5.5 Pro là bao nhiêu?
GPT-5.5 Pro có cửa sổ ngữ cảnh khoảng 1.1M token đầu vào và 128K token đầu ra, giống với GPT-5.5 cơ sở. Đủ để nạp các codebase lớn hoặc tài liệu dài trong một cuộc gọi duy nhất. Sự khác biệt giữa Pro và bản cơ sở không nằm ở kích thước bộ nhớ; mà ở lượng sức tính toán suy luận mà mô hình bỏ ra trước khi trả lời.