
GPT-5.6 Sol Ultra trong Codex: Chế độ Subagent thực sự làm gì (và tốn bao nhiêu)
Tính đến tháng 7 năm 2026, GPT-5.6 Sol Ultra đang ở giai đoạn xem trước kín dành cho một nhóm nhỏ khoảng 20 đối tác được chính phủ phê duyệt, có thể truy cập qua OpenAI API và Codex. Nó vẫn chưa được phát hành rộng rãi. OpenAI chưa công bố ngày phát hành chính thức, và điểm số 91,9% trên Terminal-Bench được trích dẫn rộng rãi không hề xuất hiện trên trang xem trước của chính OpenAI.
Vào ngày 26-06-2026, OpenAI đã xem trước dòng GPT-5.6 Sol, và vài ngày sau đó Thibault Sottiaux đã bảo người dùng Codex hãy "để dành những prompt khó nhất của bạn" cho hạng Sol Ultra. Chỉ một lời hé lộ đó đã châm ngòi cho một làn sóng ảnh chụp màn hình benchmark. Phần lớn trong số chúng lặp lại một con số mà OpenAI chưa bao giờ công bố. Vì vậy, trước khi bạn lên kế hoạch cho quy trình làm việc Codex của mình xoay quanh GPT-5.6 Sol Ultra, đây là những gì thực sự đã được xác nhận, cách chế độ subagent hoạt động, và bài toán token quyết định liệu nó có đáng để bật lên hay không.
Những điểm chính:
- Sol Ultra là hạng có mức nỗ lực cao nhất của GPT-5.6: các subagent hợp tác trò chuyện với nhau trong suốt một tác vụ duy nhất.
- Nó đang ở giai đoạn xem trước kín dành cho khoảng 20 đối tác được chính phủ phê duyệt qua API và Codex, chưa phát hành rộng rãi (tính đến tháng 7 năm 2026).
- Báo chí đưa tin mức 91,9% trên Terminal-Bench 2.1, nhưng OpenAI chưa công bố con số đó, vì vậy hãy coi nó là chưa được xác minh.
- Sol có giá $5 đầu vào / $30 đầu ra cho mỗi 1 triệu token; các subagent nhân số lượng lời gọi lên nhiều lần, nên Ultra có thể tốn kém gấp vài lần so với một lần chạy đơn agent.
GPT-5.6 Sol Ultra trong Codex: Những gì thực sự đã được xác nhận
Đây là ranh giới rõ ràng. Đã xác nhận: OpenAI đã xem trước dòng Sol (Sol, Terra, Luna) vào ngày 26-06-2026, Sol Ultra là hạng suy luận cao nhất, và nó đã được hé lộ cho Codex. Chưa xác nhận: điểm số 91,9% trên Terminal-Bench 2.1 và bất kỳ ngày phát hành chính thức nào. Mọi thứ khác mà bạn thấy đều là tin tức đưa lại, không phải dữ liệu từ chính chủ.
Sự phân biệt đó rất quan trọng vì đợt ra mắt này diễn ra nhanh chóng và thiếu chặt chẽ. Trang xem trước của OpenAI mô tả các hạng và cơ chế kiểm duyệt an toàn bằng những thuật ngữ định tính. Bảng benchmark bắt mắt đang lan truyền trên X và trong các bài hướng dẫn đến từ nguồn tin thứ cấp, không phải từ trang của chính OpenAI. Quay lại giai đoạn trước ra mắt, chúng tôi đã đánh giá các tin đồn trước ra mắt, và đây là những gì thực sự được phát hành so với những gì chỉ dừng ở mức suy đoán. Nguyên tắc kỷ luật đó giờ vẫn đúng.
Vì vậy, nếu bạn là một nhà phát triển đang cố quyết định xem Ultra có thuộc về vòng lặp Codex của mình hay không, hãy tạm gác những con số thổi phồng sang một bên. Các sự thật đã được xác nhận (cơ chế, giá cả, trạng thái xem trước) là đủ để suy luận về chi phí và mức độ phù hợp. Những điều chưa được xác nhận (điểm số chính xác, ngày ra mắt) chưa nên chi phối bất kỳ quyết định nào. Nguồn: trang Previewing GPT-5.6 Sol của OpenAI và bài đưa tin ra mắt của 9to5Mac.
Sol Ultra là gì? Subagent hợp tác so với agent song song của Pro
Sol Ultra là hạng suy luận cao nhất của GPT-5.6, và tính năng đặc trưng của nó là các subagent hợp tác: một coordinator chia tác vụ của bạn thành nhiều phần, giao mỗi phần cho một subagent, và các subagent đó truyền tin nhắn cho nhau trong khi công việc vẫn đang diễn ra. Chính việc giao tiếp giữa chừng tác vụ đó là toàn bộ điểm mấu chốt, và nó là thứ phân biệt Ultra với mọi hạng thấp hơn.
Hãy tưởng tượng nó giống như một nhóm kỹ thuật nhỏ so với một nhóm freelancer. Các agent song song của GPT-5.5 Pro hoạt động như những freelancer mà bạn giao cho ba ticket riêng biệt. Mỗi người tự đi làm phần của mình một cách biệt lập, rồi đặt kết quả trở lại bàn của bạn. Không ai nói chuyện với ai. Các subagent của Sol Ultra hoạt động như một nhóm trong cùng một phòng: một người nhận ra schema cơ sở dữ liệu đã thay đổi, báo cho những người khác, và họ điều chỉnh trước khi hoàn thành. Chính sự phối hợp đó là lý do OpenAI định vị nó cho các tác vụ dài, khó, nhiều bước thay vì những chỉnh sửa nhanh.
Trong khi các agent của Pro làm việc ở những làn riêng biệt, các subagent của Sol Ultra chuyền tay nhau những mẩu ghi chú trong khi tác vụ vẫn đang chạy.

Bản thân cơ chế này đã được xác nhận, được OpenAI mô tả và được DataCamp cùng deeplearning.ai nhắc lại trong các bài đưa tin của họ. Vấn đề nằm ở chỗ, và chúng ta sẽ bàn đến, mỗi subagent mà bạn tạo ra là thêm một lời gọi mô hình đốt token. Sự phối hợp không hề miễn phí.
"Mức suy luận tối đa" là gì và khi nào nên bật nó lên?
"Mức suy luận tối đa" là nấc cao nhất trên thang nỗ lực của GPT-5.6, thang này chạy từ thấp đến cao và lên tới mức tối đa mà Sol Ultra sử dụng. Nỗ lực cao hơn nghĩa là mô hình dành nhiều sức tính toán hơn để suy nghĩ trước khi trả lời, điều thường giúp ích cho các bài toán khó và lãng phí tiền bạc cho những bài dễ. Nó là một nút vặn, không phải công tắc để bạn cứ bật mãi.
Hãy tưởng tượng một kỳ thủ cờ vua. Ở mức nỗ lực thấp, họ đi nhanh theo bản năng, điều này ổn cho những nước ăn quân hiển nhiên. Ở mức tối đa, họ ngồi tính toán sâu mười nước, đó chính xác là điều bạn muốn cho một tàn cuộc khó và hoàn toàn vô nghĩa cho việc mở một cánh cửa. Mức suy luận hoạt động theo cách tương tự. Sức tính toán (và hóa đơn) tăng theo mức độ bạn bảo mô hình suy nghĩ khó đến đâu.
Vậy khi nào thì nó đáng giá? Hãy bật mức tối đa cho công việc agentic dài hạn, nhiều file: một cuộc migration đụng chạm đến hai mươi file, một lần refactor hóc búa, một con bug trải dài ba service. Đó là lãnh địa của lập trình agentic dài hạn, nơi suy luận sâu hơn thực sự thay đổi kết quả. Hãy tắt nó đi khi đổi tên một biến, viết một test đơn lẻ, hay sửa một lỗi chính tả, vì bạn sẽ trả token giá cao mà chẳng được lợi gì.
Mức suy luận tối đa chỉ xứng đáng với chi phí của nó khi tác vụ đủ khó để một lần thử sai đầu tiên sẽ khiến bạn tốn kém hơn cả số token bỏ thêm.
Quy tắc thành thật: nếu bạn không thể nói rõ vì sao tác vụ lại khó, có lẽ bạn không cần mức tối đa cho nó.
Các con số trên Terminal-Bench 2.1: Mức 91,9% có thực sự được xác minh?
Không. Con số 91,9% do báo chí thứ cấp đưa tin, nó không xuất hiện trên trang xem trước của chính OpenAI, bản xem trước là kín, và không có phương pháp đánh giá nào được công bố. Vì vậy nó không được xác minh độc lập. Hãy coi nó như một tuyên bố báo chí mà bạn không thể kiểm chứng, chứ không phải một kết quả đã ngã ngũ.
Đây là tình hình chính xác. Các nguồn tin thân cận với OpenAI (DataCamp, AI Weekly, deeplearning.ai) đặt Sol Ultra ở mức 91,9% trên Terminal-Bench 2.1. Nhưng vì bản xem trước chỉ giới hạn cho khoảng 20 đối tác và OpenAI chưa công bố con số hay điều kiện kiểm tra, nên không ai ngoài vòng tròn đó có thể tái tạo lại nó. Cũng cần lưu ý rằng con số của Claude Mythos 5 thay đổi tùy theo nguồn đưa tin: một số nguồn nói 84,3%, những nguồn khác nói 88,0%. Khi chính các con số trong một bảng so sánh lại mâu thuẫn giữa các nguồn, đó là tín hiệu để bạn đừng quá tin vào nó.
| Mô hình | Terminal-Bench 2.1 (được báo cáo, chưa được xác minh độc lập) |
|---|---|
| Sol Ultra | 91,9% |
| Sol (cơ bản) | 88,8% |
| GPT-5.5 | 88,0% |
| Claude Mythos 5 | 84,3-88,0% (thay đổi theo nguồn) |
| Gemini 3.1 Pro Preview | 70,7% |
Con số 91,9% mà ai cũng trích dẫn không xuất hiện trên trang xem trước của chính OpenAI, vì vậy hãy coi nó như một tuyên bố báo chí, chứ không phải một kết quả đã ngã ngũ.
Không điều nào trong số này có nghĩa là Sol Ultra yếu. Nó rất có thể sẽ đứng đầu bảng xếp hạng một khi OpenAI công bố phương pháp luận thực sự. Nó chỉ có nghĩa là bạn không nên định tuyến lưu lượng production dựa trên một con số mà bạn không thể xác minh. Nguồn: hướng dẫn GPT-5.6 Sol của DataCamp, The Batch của deeplearning.ai, và AI Weekly.
Cách sử dụng Sol Ultra + Mức suy luận tối đa trong Codex
Bản thân Sol Ultra bị giới hạn, nên bạn không thể bật nó trừ khi tổ chức của bạn nằm trong bản xem trước. Nhưng thang nỗ lực mà nó dựa trên đã hoạt động trong Codex CLI ngay hôm nay, trên các mô hình mà bạn đang có. Đây là cách cài đặt này hoạt động, và Ultra sẽ nằm ở đâu một khi bạn có quyền truy cập.
- Tìm cài đặt. Mức suy luận nằm trong file cấu hình Codex của bạn tại
~/.codex/config.toml, hoặc dưới dạng một cờ cho mỗi lần chạy. Nó không bị chôn trong một menu nào cả; nó là một khóa duy nhất. - Đặt mô hình và mức nỗ lực. Trỏ Codex vào chuỗi mô hình của bạn và đặt mức nỗ lực. Hiện tại bạn có thể đặt từ thấp đến cao; nấc "max" cùng hạng subagent Sol Ultra sẽ mở khóa khi tổ chức của bạn có mặt trong bản xem trước.
- Ghi đè theo từng tác vụ. Dùng cờ
-cđể tăng mức nỗ lực cho một lần chạy khó duy nhất mà không cần chỉnh sửa cấu hình. - Bật nó một cách chọn lọc. Dành mức tối đa cho các tác vụ dài, nhiều file ở phần trên. Giữ mặc định của bạn ở mức trung bình hoặc cao.
# ~/.codex/config.toml
model = "gpt-5.6-sol"
model_reasoning_effort = "high" # minimal | low | medium | high (available today)
# "max" effort + the Sol Ultra cooperating-subagent tier
# activate once your org is in the closed preview:
# model = "gpt-5.6-sol-ultra"
# model_reasoning_effort = "max"
# per-run override, no config edit needed:
# codex -c model_reasoning_effort="high" "refactor the auth module"Mẹo hay: hãy đặt mặc định dự án của bạn ở high, không phải max. Sau đó chỉ ghi đè lên max ở lần chạy cụ thể cần đến nó. Thói quen đó giữ cho hóa đơn cơ bản của bạn ở mức hợp lý và dành hạng đắt đỏ cho những tác vụ thực sự xứng đáng. Chi tiết về tính khả dụng nằm trong bài viết xem trước trên Trung tâm Trợ giúp của OpenAI.
Ultra thực sự tốn bao nhiêu: Hệ số nhân token của subagent
Đây là phần mà không ai mô hình hóa: vì Ultra sinh ra các subagent hợp tác, một tác vụ sẽ kích hoạt vài lời gọi mô hình thay vì một, và mỗi lời gọi đều tính phí token. Mức giá đã được xác nhận của Sol là $5 cho mỗi 1 triệu token đầu vào, $0,50 nếu được cache, và $30 cho mỗi 1 triệu token đầu ra. Đầu ra là phía đắt đỏ, và Ultra tạo ra nhiều đầu ra hơn hẳn.
Hãy làm một ví dụ thực tế. Lấy một tác vụ agentic phức tạp vừa phải trên Sol cơ bản, đơn agent:
| Mô hình | Thành phần | Token | Giá / 1 triệu | Chi phí |
|---|---|---|---|---|
| Sol (cơ bản) | Đầu vào | 40.000 | $5 | $0,20 |
| Sol (cơ bản) | Đầu ra | 15.000 | $30 | $0,45 |
| Sol (cơ bản) | Tổng | $0,65 |
Giờ cũng tác vụ đó trên Ultra với một coordinator cộng ba subagent hợp tác. Ngữ cảnh dùng chung được cache với giá rẻ $0,50, nhưng mỗi subagent vẫn tạo ra đầu ra riêng của nó với giá $30:
| Mô hình | Thành phần | Token | Giá / 1 triệu | Chi phí |
|---|---|---|---|---|
| Sol Ultra (mô hình hóa) | Đầu vào coordinator | 40.000 | $5 | $0,20 |
| Sol Ultra (mô hình hóa) | Đầu vào subagent, đã cache | 90.000 | $0,50 | $0,045 |
| Sol Ultra (mô hình hóa) | Đầu vào subagent, mới | 30.000 | $5 | $0,15 |
| Sol Ultra (mô hình hóa) | Đầu ra coordinator + liên agent | 20.000 | $30 | $0,60 |
| Sol Ultra (mô hình hóa) | Đầu ra subagent (3 x 15K) | 45.000 | $30 | $1,35 |
| Sol Ultra (mô hình hóa) | Tổng | ~$2,35 |
Con số đó xấp xỉ 3,6 lần chi phí của Sol cơ bản cho cùng một tác vụ, và tùy thuộc vào số lượng subagent được sinh ra và bao nhiêu ngữ cảnh được cache, bạn sẽ thấy từ 2 lần đến 4 lần. Hệ số nhân này là ước tính mô hình hóa của chúng tôi từ mức giá đã công bố, không phải một benchmark Ultra đo được, nhưng cả giá lẫn cơ chế đều đã được xác nhận, nên hình dạng chung là thật.
Chi phí ẩn của Ultra không nằm ở mức giá mỗi token, mà ở chỗ một tác vụ lặng lẽ biến thành bốn lời gọi mô hình.
Có hai thứ làm giảm bớt điều này: prompt caching (mức giá $0,50 khi cache) trên ngữ cảnh dùng chung, và việc định tuyến kỷ luật để bạn chỉ trả giá Ultra cho những tác vụ cần đến nó. Nếu bạn thực sự quan tâm đến hóa đơn, hướng dẫn của chúng tôi về cách kiểm soát chi phí LLM API bao quát các mẫu định tuyến mà chúng tôi dùng trên các pipeline cho khách hàng. Mức giá được lấy từ DataCamp và deeplearning.ai, ghi nhận từ tháng 06-2026 đến 07-2026.
Bạn đã dùng được chưa? Bản xem trước giới hạn, khoảng 20 đối tác, và mốc thời gian
Chưa, trừ khi bạn là một trong khoảng 20 đối tác tin cậy được chính phủ phê duyệt. Sol Ultra đang ở bản xem trước kín, truy cập được qua OpenAI API và Codex, bị chặn sau một cuộc đánh giá an toàn của chính phủ trước khi phát hành rộng rãi hơn. OpenAI đã nói rằng quyền truy cập rộng hơn sẽ đến "trong vài tuần tới", và không có gì cụ thể hơn.
Có thể bạn đã thấy một ngày "7 tháng 7" trôi nổi đâu đó. Hãy bỏ qua nó. OpenAI không đưa ra ngày ra mắt nào, nên hãy coi bất kỳ ngày cụ thể nào là tin đồn chưa được xác nhận, chứ không phải sự thật để lên kế hoạch. Điều được xác nhận là khung "vài tuần tới" và việc Cerebras dự kiến phục vụ Sol với tốc độ lên đến 750 token mỗi giây bắt đầu từ tháng 7 (theo deeplearning.ai).
Vậy bạn làm gì nếu không phải là đối tác? Hãy chuẩn bị ngay từ bây giờ. Hãy tinh chỉnh cấu hình Codex và thang nỗ lực của bạn trên các mô hình bạn đang có hôm nay, để khi Ultra mở ra, việc đổi chuỗi mô hình là thay đổi duy nhất bạn phải làm. Ô quyết định: Bạn có phải là đối tác tin cậy không? Không? Vậy thì hãy thiết lập định tuyến theo mức nỗ lực ngay hôm nay và sẵn sàng thay thế bằng một dòng duy nhất. Nguồn: Trung tâm Trợ giúp của OpenAI và deeplearning.ai.
Sol Ultra vs Sol vs GPT-5.5 vs Claude Mythos 5: Bạn nên chọn cái nào?
Hãy định tuyến theo tác vụ, không theo bảng xếp hạng, đặc biệt khi các con số trên bảng xếp hạng chưa được xác minh. Hãy chọn Sol cơ bản cho phần lớn công việc lập trình agentic hằng ngày, dành Sol Ultra cho những tác vụ dài hạn thực sự khó, giữ GPT-5.5 lại nếu nó đã được tích hợp vào stack của bạn, và cân nhắc Claude Mythos 5 ở những nơi bạn đã tin tưởng phiên bản mới nhất của Claude cho quy trình làm việc của mình.
Đây là cách nhìn thực tế:
- Chọn Sol cơ bản khi tác vụ khó ở mức bình thường: một tính năng, một lần refactor gọn gàng, một bộ test. Nó mang mức 88,8% theo báo cáo và chỉ tốn một phần nhỏ so với Ultra.
- Chọn Sol Ultra khi tác vụ dài, trải rộng nhiều file, và một lần làm sai đầu tiên sẽ ngốn thời gian thật. Các subagent hợp tác xứng đáng với hệ số nhân của chúng ở đây, nếu có ở đâu đó.
- Chọn GPT-5.5 khi nó đã được tích hợp và mức chênh lệch so với Sol không đủ để biện minh cho một cuộc migration.
- Chọn Claude Mythos 5 khi bộ công cụ hiện có của nhóm bạn thiên về nó. Điểm số được báo cáo của nó thay đổi theo nguồn (84,3% đến 88,0%), nên đừng chuyển đổi chỉ vì con số.
Để hiểu sâu hơn về những đánh đổi trong định tuyến mô hình giữa các công cụ, bài so sánh coding-agent của chúng tôi phân tích nơi mỗi công cụ phù hợp. Phiên bản ngắn gọn: hãy chọn hạng rẻ nhất vượt qua được ngưỡng độ khó của tác vụ.
Các nhà phát triển thực sự đang nói gì trên Reddit
Benchmark là một chuyện. Những gì mọi người báo cáo trong chính terminal của họ lại là chuyện khác, và lúc này các thread trên r/codex là tín hiệu trung thực nhất mà chúng tôi có. Nhận định của chúng tôi về tâm lý chung: ấn tượng một cách thận trọng, hoài nghi sâu sắc, và chủ yếu là tranh cãi về giá.
Những lời khen trải nghiệm sớm rất cụ thể. Trong một thread r/codex có 335 upvote, một nhà phát triển nhận thấy các prompt của mình được định tuyến sang 5.6 nói rằng nó có cảm giác "nhanh gấp đôi" và "xử lý gọn prompt của tôi trong một lần", thậm chí sửa "trước" cả những edge case mà trước đây phải mất vài vòng với 5.5. Lời so sánh của anh ấy rất đắt giá: nó "có cảm giác y hệt Fable 5 khi tôi dùng thử nó trong Claude, nhưng nhanh hơn nhiều." Một người bình luận tự nhận có quyền truy cập nội bộ nói thêm rằng việc chạy "các tác vụ ở mức suy luận tối đa" tốn "ít thời gian hơn nhiều so với 5.5."
Rồi những người kỳ cựu xuất hiện. Làn sóng phản đối ồn ào nhất là thứ mà chúng tôi gọi là sự hoài nghi kiểu "trăng mật rồi bị nerf": "Lúc nào cũng thế và sẽ kéo dài khoảng 2 tuần trước khi bị nerf," một người viết. Một người khác thẳng thừng hơn: "Cứ cày nó thật lực trong 2 tuần đi vì nó chỉ là Einstein trong 2 tuần thôi." Một vài người để ý đến chính thời điểm, lưu ý rằng những bài khen 5.6 nồng nhiệt xuất hiện đúng lúc những lời phàn nàn về sự sa sút của 5.5 lên đỉnh điểm. Đáng nói là, những phản hồi được vote cao nhất trong thread đó hoàn toàn không phải phân tích; chúng là những câu đùa ("tôi đang dùng gpt 6 rồi"), điều đó nói lên rất nhiều về việc các nhà phát triển đã mệt mỏi thế nào với vòng xoáy thổi phồng phiên bản.
Trong thread thông báo Sol Ultra Codex, cuộc trò chuyện chuyển gần như hoàn toàn sang chi phí, nhắm thẳng vào Claude. Các nhà phát triển đang cân nhắc hạng Codex $200 của OpenAI so với chương trình khuyến mãi Fable của Anthropic, và vài người nói rằng họ đang hủy Claude Max 20x, chủ yếu vì Fable "đốt credit nhanh gấp đôi." Niềm hy vọng lặp đi lặp lại: "đối thủ thực sự cho Claude Fable. Tốt hơn cho người dùng chúng ta." Nỗi lo sợ lặp đi lặp lại, một nỗi lo mà chúng tôi cũng đồng tình: "đã từng bị OpenAI cho ăn quả lừa khi công bố mọi thứ rồi chặn chúng sau những hạng cao hơn, nên tôi sẽ tin khi thấy nó chạy cục bộ."
Góc nhìn của chúng tôi tại Techsy: các báo cáo về tốc độ khớp với những gì mà một stack phục vụ có thông lượng cao hơn phải mang lại, nên chúng tôi tin những điều đó. Những tuyên bố về xử lý gọn trong một lần, chúng tôi coi là đầy hứa hẹn nhưng chưa được chứng minh ở quy mô lớn, bởi vì mô típ "nó ngu đi sau hai tuần" là có thật và chúng tôi đã chứng kiến nó diễn ra trong các lần ra mắt trước. Và sự hoài nghi về chi phí là hoàn toàn đúng đắn. Cho đến khi Sol Ultra nằm trong CLI của bạn, ổn định, qua trọn một chu kỳ thanh toán, hãy coi sự hào hứng như một bản xem trước, chứ không phải một phán quyết.
Những gì chúng tôi thấy khi chạy các tác vụ agentic trên Codex
Nói thẳng: chúng tôi không thể chạy Sol Ultra. Nó bị giới hạn cho khoảng 20 đối tác và chúng tôi không nằm trong số đó, nên chúng tôi sẽ không trích dẫn số lượng token hay điểm số mà mình không đo. Điều chúng tôi có thể làm là điều trung thực tốt nhất tiếp theo. Chúng tôi đã chạy các tác vụ agentic qua Codex CLI trên hạng hiện tại của mình và tính ra bài toán chi phí subagent chính xác từ mức giá $5/$30 mà OpenAI công bố.
Thang nỗ lực hoạt động đúng như bạn kỳ vọng trên hạng mà chúng tôi đã thử. Ở mức nỗ lực thấp và trung bình, Codex trả về nhanh và hầu như xử lý đúng các chỉnh sửa gọn gàng. Đẩy một tác vụ khó, nhiều file ở mức nỗ lực thấp và nó có xu hướng dừng giữa chừng hoặc bỏ sót một phụ thuộc liên file; cùng tác vụ đó ở mức nỗ lực cao sẽ tốn thời gian suy nghĩ lâu hơn rõ rệt trước khi hành động, và hoàn thành nhiều thay đổi hơn trong một lần. Sự đánh đổi giữa thời gian thực và chất lượng đó chính là toàn bộ lý do nấc tối đa tồn tại.
Việc mô hình hóa chi phí ở trên (ví dụ xấp xỉ 3,6 lần) là phân tích trực tiếp thực sự mà chúng tôi có thể đứng ra bảo chứng: đó là phép số học trên mức giá đã được xác nhận và cơ chế subagent đã được xác nhận, được gắn nhãn là một mô hình, không phải một phép đo. Trên các pipeline agentic cho khách hàng, chúng tôi đã định tuyến các hạng mô hình theo chi phí, và đây chính xác là phép tính mà chúng tôi sẽ chạy trước khi bật Ultra cho bất kỳ ai.
Thay đổi cấu hình duy nhất quan trọng là dòng model_reasoning_effort trong config.toml được nêu ở trước: chúng tôi giữ mặc định dự án ở high và ghi đè lên max theo từng lần chạy, đúng như mẹo hay ở trên mô tả. Khi Ultra mở ra ngoài bản xem trước, thiết lập đó có nghĩa là việc đổi chuỗi mô hình sẽ là chỉnh sửa duy nhất chúng tôi thực hiện, và bài toán chi phí ở trên đã là phép tính mà chúng tôi sẽ chạy trước khi bật nó. Chúng tôi sẽ cập nhật phần này với những con số Ultra đo được ngay khi chúng tôi có quyền truy cập thực sự, không sớm hơn.
Về tác giả
Mert Batur Gurbuz là Đồng sáng lập của Techsy.io, nơi nhóm cung cấp các AI agent, hệ thống tự động hóa, và pipeline giọng nói/SDR cho khách hàng B2B. Anh theo học tại Đại học Birmingham và viết về stack công cụ LLM mà nhóm Techsy thực sự sử dụng trong production. Kết nối trên LinkedIn.
Đồng sáng lập, Techsy.io, Đại học Birmingham.
Câu hỏi thường gặp
GPT-5.6 Sol Ultra là gì?
Sol Ultra là hạng có mức nỗ lực suy luận cao nhất của GPT-5.6. Tính năng đặc trưng của nó là các subagent hợp tác: một coordinator chia nhỏ tác vụ và các subagent truyền tin nhắn cho nhau trong khi làm việc. OpenAI định vị nó cho các tác vụ agentic dài, khó, nhiều bước thay vì những chỉnh sửa nhanh, và đã xem trước nó như một phần của dòng Sol vào ngày 26-06-2026.
Sol Ultra hiện có sẵn trong Codex chưa?
Chưa với hầu hết mọi người. Tính đến tháng 7 năm 2026, Sol Ultra đang ở bản xem trước kín, truy cập được qua OpenAI API và Codex, giới hạn cho khoảng 20 đối tác tin cậy được chính phủ phê duyệt sau một cuộc đánh giá an toàn. OpenAI nói rằng quyền truy cập rộng hơn sẽ đến "trong vài tuần tới" nhưng chưa công bố ngày cụ thể nào, nên bạn không thể đơn giản bật nó lên ngay hôm nay.
Các subagent hợp tác hoạt động thế nào trong Sol Ultra?
Một coordinator chia tác vụ của bạn thành nhiều phần và giao mỗi phần cho một subagent. Không giống các agent song song độc lập, những subagent này giao tiếp giữa chừng tác vụ, chia sẻ những gì chúng học được để những subagent khác điều chỉnh trước khi hoàn thành. Sự phối hợp đó giúp ích cho công việc phức tạp, nhiều file, nhưng mỗi subagent là một lời gọi mô hình riêng tiêu thụ token của chính nó.
"Mức suy luận tối đa" trong GPT-5.6 là gì?
Mức suy luận tối đa là nấc cao nhất trên thang nỗ lực của GPT-5.6, thang này chạy từ thấp, trung bình, cao, rồi đến tối đa. Nỗ lực cao hơn nghĩa là mô hình dành nhiều sức tính toán hơn để suy luận trước khi trả lời. Nó giúp ích cho các tác vụ khó, dài hạn và lãng phí tiền bạc cho những tác vụ đơn giản, vì vậy hãy coi nó như một nút vặn mà bạn chỉ tăng lên khi một tác vụ thực sự khó.
Chạy Sol Ultra tốn bao nhiêu?
Sol cơ bản có giá $5 cho mỗi 1 triệu token đầu vào, $0,50 khi cache, và $30 cho mỗi 1 triệu token đầu ra (lấy từ DataCamp và deeplearning.ai, ghi nhận giữa năm 2026). Ultra sinh ra các subagent hợp tác, nên một tác vụ kích hoạt vài lời gọi mô hình. Ví dụ mô hình hóa của chúng tôi cho thấy một tác vụ đơn lẻ tốn khoảng 2 đến 4 lần so với một lần chạy Sol cơ bản, chủ yếu do token đầu ra tăng thêm.
Sol Ultra có thực sự tốt hơn Claude Mythos 5 không?
Theo các con số được báo cáo, Sol Ultra (91,9%) dẫn trước Claude Mythos 5 trên Terminal-Bench 2.1, nhưng điều đó chưa được xác minh. OpenAI chưa công bố con số này, bản xem trước là kín, và điểm số được báo cáo của chính Mythos 5 dao động từ 84,3% đến 88,0% tùy theo nguồn. Vì vậy câu trả lời thành thật là: chúng tôi chưa biết, và bạn không nên định tuyến lưu lượng production dựa trên nó.
Khi nào Sol Ultra sẽ khả dụng rộng rãi?
OpenAI đã nói rằng quyền truy cập rộng hơn vào dòng Sol trên ChatGPT, Codex và API sẽ đến "trong vài tuần tới", nhưng họ chưa công bố ngày phát hành chính thức. Bất kỳ ngày cụ thể nào lan truyền trên mạng (kể cả "7 tháng 7") đều là tin đồn chưa được xác nhận, không phải thông báo chính thức. Hãy theo dõi trang xem trước của chính OpenAI để biết mốc thời gian đã được xác nhận.
Điểm số 91,9% trên Terminal-Bench 2.1 có được xác minh không?
Không. Con số 91,9% đến từ báo chí thứ cấp, không phải từ trang xem trước của chính OpenAI. Bản xem trước chỉ mở cho khoảng 20 đối tác, và không có phương pháp đánh giá nào được công bố, nên không ai ngoài vòng tròn đó có thể tái tạo lại nó. Nó có thể chứng minh là chính xác sau này, nhưng hiện tại nó là một tuyên bố báo chí chưa được xác minh, không phải một kết quả benchmark đã ngã ngũ.
Sol Ultra khác với các agent song song của GPT-5.5 Pro như thế nào?
Các agent song song của Pro hoạt động độc lập trong những làn riêng biệt: mỗi agent làm phần của mình một cách biệt lập và trả về kết quả, không có giao tiếp. Các subagent của Sol Ultra hợp tác, truyền tin nhắn cho nhau giữa chừng tác vụ để chúng có thể điều chỉnh khi học được điều mới. Sự phối hợp đó phù hợp với công việc nhiều bước khó hơn, nhưng nó cũng làm tăng gấp bội mức sử dụng token qua các lời gọi.
Tôi có cần Sol Ultra không, hay Sol cơ bản là đủ?
Với phần lớn lập trình agentic, Sol cơ bản hoặc mức suy luận cao là đủ và rẻ hơn nhiều. Dành Ultra cho các tác vụ dài, nhiều file, nơi một lần thử sai đầu tiên sẽ ngốn nhiều thời gian hơn cả số token bỏ thêm. Nếu bạn không thể giải thích rõ vì sao một tác vụ lại khó, bạn không cần Ultra cho nó. Hãy định tuyến theo độ khó, không theo bảng xếp hạng.
Các nhà phát triển đang nói gì về GPT-5.6 Sol trên Reddit?
Các báo cáo sớm trên r/codex rất tích cực về tốc độ ("nhanh gấp đôi") và về việc xử lý gọn prompt trong một lần, với vài nhà phát triển so sánh cảm giác đó với Fable 5 của Claude. Nhưng những người kỳ cựu cảnh báo về mô típ "trăng mật rồi bị nerf", trong đó các mô hình sa sút sau khi ra mắt, và phần lớn cuộc tranh luận xoay quanh chi phí so với các kế hoạch của Anthropic thay vì năng lực thuần túy.