
GPT-5.5 Pro 벤치마크: OpenAI가 공개한 수치(와 공개하지 않은 수치)
OpenAI는 2026년 4월 23일 GPT-5.5 Pro를 출시하고 입력 토큰 백만 개당 $30, 출력 백만 개당 $180으로 가격을 책정했다. 기본 GPT-5.5의 $5/$30보다 6배 비싸다. 그 돈을 내면 BrowseComp에서 90.1%를 기록하는 더 높은 컴퓨팅 변형을 손에 넣는다. 하지만 아무도 헤드라인에 싣지 않는 부분이 있다. OpenAI 자체 평가표는 GPT-5.5 Pro의 코딩 항목을 비워뒀다. 컴퓨터 사용도 마찬가지고, 장문 컨텍스트도 마찬가지다. 그래서 이 모델의 SWE-Bench Pro 점수를 검색해 봐도 찾을 수 있는 수치가 없다. 우리는 공개된 표를 가져와 모든 수치를 직접 등급 매겼다.
빠른 답변:
- GPT-5.5 Pro는 GPT-5.5의 더 높은 컴퓨팅 변형이지(2026년 4월 23일 출시) 새로운 모델이 아니다.
- 브라우징(BrowseComp 90.1%)과 프론티어 수학에서 선두지만, OpenAI는 코딩, 컴퓨터 사용, 장문 컨텍스트 항목을 비워뒀다.
- 존재하는 코딩 항목에서는 기본 GPT-5.5가 Claude Fable 5에 뒤처진다(SWE-Bench Pro 58.6% vs 80.3%).
- Claude Fable 5는 현재 중단된 상태(미국 수출 통제 지침, 2026년 6월 12일경)라 그 승리는 "지금은 살 수 없다"는 단서가 붙는다.
방법론에 대한 짧은 참고. 벤치마크 글에서는 속도보다 정확성이 더 중요하기 때문이다. 아래 수치는 OpenAI와 Anthropic의 공개 표, 그리고 SWE-Bench Pro 논문(arXiv 2509.16941)과 교차 검증했다. 한 벤더만 수치를 보고한 경우 그렇게 명시한다. OpenAI가 Pro 점수를 공개하지 않은 경우, 기본 수치를 슬쩍 끼워 넣는 대신 "미공개"라고 적는다.
GPT-5.5 Pro 벤치마크: OpenAI가 실제로 공개한 것
GPT-5.5 Pro의 공개 벤치마크는 좁은 영역만 다룬다. 브라우징, 프론티어 수학, 전문 지식 업무, 유전학, 광범위한 추론이다. OpenAI는 모든 평가를 연구 환경에서 추론 노력 xhigh로 실행했으며, 이는 프로덕션 ChatGPT 기본값과 다르다. 헤드라인 수치는 **BrowseComp 90.1%**로, 기본 GPT-5.5의 84.4%를 확실히 앞선다.
아래는 마스터 표로, 각 테스트에 대해 OpenAI가 별도의 Pro 점수를 공개했는지 여부를 보여주는 열이 있다.
| 벤치마크 | 측정 항목 | GPT-5.5 Pro | GPT-5.5 기본 | Pro 공개 여부 | 비고 |
|---|---|---|---|---|---|
| BrowseComp | 어려운 웹 브라우징 / 정보 탐색 | 90.1% | 84.4% | 예 | 기본 대비 Pro의 가장 확실한 우위 |
| FrontierMath T1-3 | 어려운 수학 | 52.4% | 51.7% | 예 | 보고된 Opus 4.7(43.8%)을 앞섬 |
| FrontierMath T4 | 프론티어 수학 | 39.6% | 35.4% | 예 | 가장 어려운 수학 단계 |
| GDPval | 전문 지식 업무 | 82.3%(주장) | 84.9% | 예(귀속) | OpenAI 표에서 Pro가 기본보다 낮음 |
| GeneBench | 다단계 유전학 | 33.2%(주장) | 25.0% | 예(귀속) | "OpenAI 보고" 큰 상승 |
| HLE(도구 없음) | 광범위한 어려운 추론 | 43.1% | 41.4% | 예 | 보고된 Opus 4.7(46.9%)보다 낮음 |
| HLE(도구 사용) | 도구 활용 추론 | 57.2%(주장) | 52.2% | 부분 | 기본 52.2% 확인됨; Pro 57.2% 주장 |
| Investment Banking Modeling | 금융 모델링 | 88.6%(내부) | 88.5% | 내부 평가 | OpenAI가 INTERNAL로 표시; 참고용으로 취급 |
| SWE-Bench Pro | 에이전트 코딩 | 미공개 | 58.6% | 아니오 | 헤드라인 격차 |
| OSWorld-Verified | 컴퓨터 사용 | 미공개 | 78.7% | 아니오 | Pro는 비어 있음 |
| Cybersecurity | 보안 작업 | 미공개 | 미표시 | 아니오 | Pro는 비어 있음 |
| Long-context | 장문 문서 회상 | 미공개 | 미표시 | 아니오 | Pro는 비어 있음 |
아래쪽 블록을 주의 깊게 읽어라. OpenAI는 브라우징과 수학에 대한 GPT-5.5 Pro 점수를 공개했지만, 코딩, 컴퓨터 사용, 사이버 보안, 장문 컨텍스트 항목은 비워뒀다. BrowseComp, FrontierMath, GDPval 기본 수치는 2차 추적기와 확인됐다. GDPval-Pro 82.3%, GeneBench 33.2%, Investment Banking 수치는 OpenAI가 보고했지만 독립적으로 검증되지 않았으므로, 단정하지 않고 귀속 처리한다.
"Pro"의 실제 의미: 병렬 테스트 타임 컴퓨팅, 새 모델이 아님
GPT-5.5 Pro는 동일한 GPT-5.5 모델이 훨씬 더 많은 추론 노력으로 실행되는 것이지 다른 아키텍처가 아니다. 새 엔진이라기보다는 같은 엔진이 응답 전에 더 오래, 그리고 병렬로 돌아가는 것에 가깝다. OpenAI는 이 설정을 **추론 노력(reasoning effort)**이라 부르며, Pro는 이를 최상위 단계인 xhigh로 고정한다.
GPT-5.5 Pro는 GPT-5.5와 다른 모델인가?
아니다. 같은 가중치, 같은 학습이다. 사람들이 gpt 5.5 pro vs gpt 5.5 thinking이나 vs xhigh를 검색할 때, 실제로 묻는 것은 하나의 다이얼이다. 모델이 응답 전에 얼마나 깊게 생각하느냐다. "병렬 테스트 타임 컴퓨팅"이란 모델이 여러 추론 경로를 동시에 탐색하고 가장 좋은 것을 고른다는 뜻이며, 더 많은 토큰과 더 많은 실제 시간이 든다. 그 추가 컴퓨팅이 바로 6배를 내는 이유다.
그 외 사양은 공유된다. GPT-5.5 Pro는 대략 입력 1.1M 토큰, 출력 128K 토큰의 컨텍스트 윈도우를 가진다. 즉 더 큰 메모리나 더 똑똑한 기본 모델을 사는 게 아니다. 이미 아는 모델에 더 많은 생각 시간을 사는 것이다.
GPT-5.5 Pro vs GPT-5.5(표준): 6배 가격이 무언가를 사주는 곳
GPT-5.5 Pro는 가장 어려운 작업, 즉 브라우징, 프론티어 수학, 유전학에서 기본 GPT-5.5를 이긴다. 일상적인 작업에서는 가장 적게 사준다. 가장 깔끔한 이득은 **BrowseComp 90.1% vs 84.4%**로, 심층 웹 리서치에서 5.7포인트 상승이다. FrontierMath Tier 4에서는 35.4%에서 39.6%로 오른다.
하지만 더 많은 컴퓨팅이 항상 더 높은 점수를 뜻하지는 않는다. GDPval에서는 OpenAI 표가 실제로 Pro를 기본 GPT-5.5보다 낮게 올렸다(주장 82.3% vs 확인 84.9%). 이는 직관에 반하며, Pro가 일부 원시 승리를 희생하는 대신 캘리브레이션을 취한 것으로 보고된다. 요점은 변하지 않는다. 더 낸다고 보장되지 않는다.
Pro가 앞서는 곳:
- BrowseComp: 90.1% vs 84.4% (+5.7)
- FrontierMath T4: 39.6% vs 35.4% (+4.2)
- GeneBench: 33.2% vs 25.0% (OpenAI 주장)
- HLE 도구 사용: 57.2%(주장) vs 52.2%(확인된 기본)
비슷하거나 더 나쁜 곳:
- GDPval: 82.3%(주장) vs 기본 84.9%
- HLE 도구 없음: 43.1% vs 41.4%, 거의 움직임 없음
업무가 대부분 일상적인 초안 작성, 코드 리뷰, 요약이라면 6배 프리미엄은 정당화하기 어렵다. 계산이 뒤집히는 건 작업이 정말로 어려울 때뿐이다. 비용 이야기가 나온 김에: 청구서가 문제라면, 쉬운 80%에는 더 저렴한 모델을 라우팅하고 어려운 20%에 Pro를 아끼는 방법을 다룬 LLM API 비용 절감 가이드를 참고하라.
GPT-5.5 Pro vs Claude Fable 5
양쪽 벤더가 모두 보고한 코딩 벤치마크에서 Claude Fable 5는 기본 GPT-5.5를 결정적으로 이긴다. 하지만 Fable 5는 현재 중단된 상태라 그 승리에는 단서가 붙는다. 그리고 이 비교는 보이는 것보다 더 지저분하다. OpenAI가 GPT-5.5 Pro 코딩 점수를 아예 공개하지 않았기 때문이다. 그래서 정직한 매치업은 사실상 코딩에서 Fable 5 vs 기본 GPT-5.5이며, Pro는 빠져 있다.
아래는 3자 비교 표다. Fable 5 수치는 Anthropic의 공개 표에 귀속되며, 빈 Pro 셀은 정확히 그대로다.
| 테스트 | GPT-5.5 기본 | GPT-5.5 Pro | Claude Fable 5 | 승자 |
|---|---|---|---|---|
| SWE-Bench Pro | 58.6% | 미공개 | 80.3% | Fable 5 |
| FrontierCode Diamond | 5.7% | 미공개 | 29.3% | Fable 5 |
| Terminal-Bench | 83.4%(v2.1) | 미공개 | 88.0%(v2.1) | Fable 5 |
| OSWorld-Verified | 78.7% | 미공개 | 85.0% | Fable 5 |
| HLE(도구 없음) | 41.4% | 43.1% | 56.8-59.0% | Fable 5 |
| HLE(도구 사용) | 52.2% | 57.2%(주장) | 64.5% | Fable 5 |
| BrowseComp | 84.4% | 90.1% | 미공개 | GPT-5.5 Pro |
| FrontierMath T4 | 35.4% | 39.6% | 미보고 | GPT-5.5 Pro |
| GDPval-AA | 1769 | 미공개 | 1932 | Fable 5 |
이 표에는 두 가지 주의사항이 있다. 첫째, Terminal-Bench: 기본 GPT-5.5는 v2.0에서 82.7%, v2.1에서 83.4%를 기록하고, Fable의 88.0%는 v2.1 기준이므로, 격차를 선언하기 전에 같은 버전을 보고 있는지 확인하라. 둘째, GDPval-AA는 백분율이 아니다. 엘로 스타일 점수(Fable 1932 vs 기본 GPT-5.5 1769)로 완전히 다른 척도이므로, 백분율 행과 머릿속에서 나란히 놓지 마라. HLE 도구 없음 Fable 수치도 출처에 따라 흔들린다. CodingFleet은 56.8%로, 다른 요약은 59.0%로 표기하므로 우리는 범위를 보고한다.
SWE-Bench Pro는 에이전트 코딩의 기준점으로 삼을 벤치마크다. 41개 활성 리포지토리에 걸친 1,865개 문제(arXiv 2509.16941 기준)를 실행하며, 시니어 엔지니어가 수 시간에서 수일이 걸리고 다중 파일 패치가 필요한 작업을 다룬다. 그 테스트에서 Fable 5의 80.3% 대 기본 GPT-5.5의 58.6%는 큰 격차다.
이제 단서다. Claude Fable 5는 2026년 6월 미국 수출 통제 지침(6월 12일경)에 따라 중단됐다. 그래서 "Fable이 코딩에서 이긴다"는 수치상으로는 사실이지만, 현재 결제 시점에서는 무의미하다. Anthropic 쪽의 더 깊은 그림을 원한다면 우리의 Claude Fable 5 전체 분석을 보라. GPT-5.5 표가 수학에서 비교 대상으로 삼는 모델은 Claude Opus 4.8을 참고하라.
OpenAI가 Pro에 대해 공개하지 않은 벤치마크
OpenAI는 코딩(SWE-Bench Pro), 컴퓨터 사용(OSWorld-Verified), 사이버 보안, 장문 컨텍스트 회상, 추상 추론에 대한 GPT-5.5 Pro 점수를 공개하지 않았다. 해당 행은 공식 표에서 비어 있다. 비어 있다고 모델이 그것에 약하다는 뜻은 아니다. 공개된 수치가 없다는 뜻이며, 수치를 인용하는 사람은 추측하거나 기본 점수를 실수로 인용하는 것이다.
이게 중요한 이유는 가장 많이 검색되는 격차이기 때문이다. GPT-5.5 Pro의 SWE-Bench Pro 점수를 검색했다면, 그런 건 없다. OpenAI가 공개하지 않았다. GPT-5.5 계열에서 그 벤치마크에 존재하는 유일한 수치는 기본 모델의 58.6%이며, 이는 기본 수치이지 Pro 수치가 아니다. 우리는 의도적으로 그렇게 표시한다.
책임 있게 말할 수 있는 것:
- 코딩(SWE-Bench Pro): Pro 미공개. 기본 GPT-5.5 = 58.6%(기본, Pro 아님).
- 컴퓨터 사용(OSWorld-Verified): Pro 미공개. 기본 = 78.7%(기본, Pro 아님).
- 사이버 보안: Pro 미공개, 표에 쓸 만한 기본 대용치 없음.
- 장문 컨텍스트: Pro 미공개, 쓸 만한 기본 대용치 없음.
- 추상 추론: Pro 미공개.
Pro의 병렬 컴퓨팅이 그 기본 수치를 끌어올릴 수 있을까? 브라우징과 수학의 패턴을 보면 아마 그럴 것이다. 하지만 "아마"는 벤치마크가 아니며, 우리는 OpenAI가 내놓지 않은 수치를 찍지 않을 것이다. 그 절제가 바로 이 섹션이 존재하는 이유 전체다.
가격: $5/$30 vs $30/$180 vs $10/$50 — Pro는 6배 값어치를 하는가?
GPT-5.5 Pro는 기본 GPT-5.5보다 대략 6배 비싸다. 토큰 백만 개당 입력 $30, 출력 $180으로, 기본은 $5/$30이다. Claude Fable 5는 그 사이인 $10/$50에 자리한다. 어려운 리서치와 프론티어 수학에는 값어치를 하지만, 일상 업무에는 거의 값어치를 하지 못한다.
| 모델 | 입력 / 1M | 출력 / 1M | 상대 비용 |
|---|---|---|---|
| GPT-5.5 기본 | $5 | $30 | 1×(기준선) |
| Claude Fable 5 | $10 | $50 | 입력 ~2×, 출력 ~1.7× |
| GPT-5.5 Pro | $30 | $180 | 기본 ~6× |
그럼 실제로 누가 프리미엄을 내야 하나? 작업별 대략적인 판정:
- 어려운 리서치, 프론티어 수학, 깊은 다단계 브라우징: GPT-5.5 Pro가 값어치를 한다. 벤치마크 이득은 실재하고 작업 가치가 높다.
- 대형 리포지토리에서의 에이전트 코딩: 구할 수 있다면 Fable 5, 그렇지 않으면 코딩 스캐폴드로 감싼 기본 GPT-5.5. 공개되지도 않은 코딩 점수에 Pro 가격을 내는 건 나쁜 베팅이다.
- 일상 초안, 요약, 코드 리뷰, 지원: 기본 GPT-5.5. 여기서 6배 지출은 거의 아무것도 사지 못한다.
함정은 "안전하게" 하려고 모든 것을 Pro로 기본 설정하는 것이다. 출력 비중이 큰 워크로드에서는 그 $180 수치가 빠르게 불어난다. 난이도별로 라우팅하면 청구서의 일부만으로 품질 대부분을 유지할 수 있다(자세한 내용은 LLM API 비용 가이드 참고).
이 수치를 어떻게 검증했는가(그리고 출처가 엇갈리는 곳)
이 수치들이 글에 들어가기 전에, 우리는 매력 없어 보이는 작업을 했다. OpenAI의 공개된 GPT-5.5 평가표를 가져와 스크린샷 하나를 믿는 대신 모든 Pro 행을 독립 추적기와 대조했다. 교차 참고한 출처는 llm-stats, BenchLM, DataCamp의 Fable 5 분석, CodingFleet, 그리고 arXiv SWE-Bench Pro 논문(2509.16941)이다. 다음은 버텨낸 것과 그렇지 못한 것이다.
헤드라인 Pro 수치 대부분은 깔끔하게 맞아떨어진다. BrowseComp 90.1%, FrontierMath Tier 1–3 52.4%와 Tier 4 39.6%, 그리고 $30/$180 가격은 우리가 확인한 모든 출처에서 일치했다. SWE-Bench Pro에서 Fable 5의 80.3% 대 기본 GPT-5.5의 58.6%, FrontierCode Diamond의 29.3% 대 5.7%도 버텼다. 그리고 SWE-Bench Pro 작업 개수(41개 리포지토리에 걸친 1,865개 문제)는 벤더 블로그가 아닌 논문에서 그대로 가져왔다.
세 가지는 맞아떨어지지 않았고, 당신은 그것을 알아야 한다.
- Humanity's Last Exam 도구 사용 Fable 5 수치는 출처에 따라 56.8%에서 59.0%까지 나온다. 우리는 하나를 고르기보다 범위를 인용한다.
- Terminal-Bench 수치는 OpenAI와 Anthropic 표 사이에서 버전 2.0과 2.1 사이를 떠다니므로, GPT-5.5(83.4%) vs Fable(88.0%) 격차는 깔끔한 동등 비교가 아니다.
- Investment Banking Modeling 점수(Pro 88.6%)는 OpenAI가 "internal"로 표시했으며, 이는 어떤 독립 추적기도 확인할 수 없음을 뜻한다. 나타날 때마다 벤더 주장으로 표시한다.
이게 정직한 버전이다. 사실로 제시한 수치는 최소 두 개의 독립 출처에서 맞아떨어졌다. 그 외 모든 것은 보고한 주체에 귀속된다. 우리는 GPT-5.5 Pro를 직접 실행하지 않았다. 토큰 백만 개당 $30/$180으로는 진지한 정면 대결 실행을 꾸며낼 수 없으므로, 우리는 갖고 있지 않은 실험 결과를 가진 척하지 않을 것이다.
벤더가 보고하는 실전 결과
이것들은 독립 실험 결과가 아닌 벤더 주장이므로, 마케팅에 가까운 증거로 읽어라. OpenAI와 Anthropic은 각각 유리한 그림을 그리는 사례 연구를 공개했다. 우리는 귀속 처리해 나열하며, 어느 것도 우리가 검증하지 않았다는 단서를 붙인다.
OpenAI 쪽에서, 회사는 한 재무 팀이 Codex와 GPT-5.5로 24,771건의 K-1 세금 양식(71,637페이지)을 검토해 전년 프로세스보다 약 2주 빠르게 끝냈다고 말한다. OpenAI는 또한 단일 프롬프트로 11분 만에 만든 작동하는 대수기하 앱, 그리고 62개 샘플과 약 28,000개 유전자에 걸친 유전자 발현 데이터셋에 대한 GPT-5.5 Pro 분석도 보고한다.
Anthropic 쪽에서, Stripe(Anthropic 경유로 보고)는 Fable 5로 5,000만 줄 Ruby 코드베이스의 코드베이스 전체 마이그레이션을 하루 만에 실행했다고 하며, 수작업 추정치는 2개월 이상이었다. Anthropic은 또한 Fable 5가 원본 스크린샷만으로 Pokémon FireRed를 완료했다고 말하며, 이전 Claude 모델은 추가 스캐폴딩 도구가 필요했고, 영속적인 파일 기반 메모리로 Slay the Spire를 Opus 4.8보다 약 3배 잘 플레이했다고 한다.
모두 인상적인 데모다. 다만 이것들은 벤더가 고른 것이고 보도 자료만으로는 재현할 수 없다는 점을 기억하라.
실제로 어떤 모델을 써야 하나?
모델을 과대광고가 아닌 작업에 맞춰라. 코딩 에이전트와 대형 리포지토리에는, 구할 수 있다면 Claude Fable 5를, 그렇지 않으면 코딩 스캐폴드로 감싼 기본 GPT-5.5를 손에 들어라. 리서치, 프론티어 수학, 깊은 브라우징에는 GPT-5.5 Pro가 선택이다. 일상 업무와 비용 효율에는 기본 GPT-5.5가 거의 매번 가치에서 이긴다.
단일 호출이 아닌 스택을 고르는 중이라면 몇 가지 pointers다. 정말로 자율 코딩 시스템을 원한다면, 원시 모델이 아닌 도구를 원하므로 2026년 최고의 AI 코딩 에이전트와 Codex 및 Devin 맥락을 위한 백그라운드 코딩 에이전트 비교 라운드업부터 시작하라. 이 계열이 다음에 어디로 가는지 궁금한가? GPT-5.6 유출 정보를 보라.
Techsy에서는 에이전트 파이프라인 전반에서 작업별로 라우팅한다. 어려운 판단에는 최상위 추론 모델을, 나머지에는 더 저렴한 모델을 써서 모든 요청에 프리미엄 요금을 내지 않는다. 당신만의 모델 조합에 대한 세컨드 오피니언을 원한다면 무료 상담을 받아라.
저자 소개
Mert Batur Gurbuz는 Techsy.io의 공동 창업자로, 팀은 B2B 클라이언트를 위해 AI 에이전트, 자동화 시스템, 음성/SDR 파이프라인을 구축한다. 그는 University of Birmingham에서 공부하며 Techsy 팀이 실제로 프로덕션에서 사용하는 LLM 도구 스택에 대해 쓴다. LinkedIn에서 연결하라.
자주 묻는 질문
GPT-5.5 Pro는 값어치를 하는가?
작업에 달렸다. 어려운 리서치, 프론티어 수학, 깊은 브라우징에서는 기본 대비 GPT-5.5 Pro의 이득(BrowseComp 90.1% vs 84.4%)이 토큰 백만 개당 $30/$180의 약 6배 가격을 정당화한다. 일상 초안, 코드 리뷰, 요약에서는 기본 GPT-5.5가 6분의 1 비용으로 거의 같은 품질을 준다.
GPT-5.5 Pro는 Claude Fable 5보다 나은가?
공개된 코딩 벤치마크에서는 아니다: Claude Fable 5는 SWE-Bench Pro에서 기본 GPT-5.5를 이기고(80.3% vs 58.6%), OpenAI는 비교할 Pro 코딩 점수를 공개하지 않았다. GPT-5.5 Pro는 브라우징과 프론티어 수학에서 이긴다. 한 가지 함정: Fable 5는 현재 미국 수출 통제 지침으로 중단된 상태라, 가용성이 벤치마크만큼 중요하다.
GPT-5.5 Pro는 코딩을 얼마나 잘하는가?
솔직히 OpenAI의 수치로는 말할 수 없다. OpenAI가 GPT-5.5 Pro 코딩 점수를 공개하지 않았기 때문이다. 이 계열의 유일한 코딩 수치는 기본 GPT-5.5의 SWE-Bench Pro 결과 58.6%이며, 이는 Claude Fable 5의 80.3%에 뒤처진다. "Pro 코딩 벤치마크"를 인용하는 사람은 아마 기본 수치를 실수로 인용하는 것이다.
GPT-5.5 Pro vs GPT-5.5 표준 — 어떤 걸 써야 하나?
어려운 리서치, 프론티어 수학, 깊은 다단계 브라우징에는 GPT-5.5 Pro를 써라. 추가 병렬 컴퓨팅이 6배 가격을 값어치 있게 만든다. 일상 업무, 코드 리뷰, 요약에는 기본 GPT-5.5를 써라. 프리미엄이 거의 사지 못한다. GDPval 같은 일부 테스트에서는 OpenAI 표가 Pro를 기본보다 약간 낮게 올리기도 한다.
GPT-5.5 Pro는 얼마인가?
GPT-5.5 Pro는 입력 토큰 백만 개당 $30, 출력 토큰 백만 개당 $180으로, 기본 GPT-5.5의 $5/$30보다 약 6배다. 비교하자면 Claude Fable 5는 $10/$50이다. 출력 비중이 큰 워크로드에서는 Pro 프리미엄이 빠르게 불어나므로, Pro를 기본으로 삼지 않고 작업 난이도별로 라우팅하면 실제 돈을 아낀다.
추론 노력 "xhigh"란 무엇인가?
추론 노력은 GPT-5.5가 응답 전에 얼마나 깊게 생각하는지 제어하는 다이얼이다. "xhigh"는 최상위 단계로, 모델이 병렬 테스트 타임 컴퓨팅으로 여러 추론 경로를 탐색하고 가장 좋은 것을 고른다. OpenAI는 공개된 GPT-5.5 Pro 평가를 연구 환경에서 xhigh로 실행했으며, 이는 프로덕션 ChatGPT 기본값과 다르다.
GPT-5.5 Pro는 Codex에서使えるか?
예. 모델 문자열 gpt-5.5-pro로 Codex CLI에서 GPT-5.5 Pro를 호출할 수 있고, 최고 컴퓨팅 동작을 위해 추론 노력을 xhigh로 설정할 수 있다. 기본 GPT-5.5보다 높은 지연 시간과 눈에 띄게 높은 토큰 비용을 예상하라. 그래서 기본 코딩 모델로 돌리지 말고 정말로 어려운 작업에 아껴라.
GPT-5.5 Pro는 새로운 모델인가?
아니다. GPT-5.5 Pro는 동일한 GPT-5.5 모델이 xhigh 설정에서 더 많은 추론 노력과 병렬 테스트 타임 컴퓨팅으로 실행되는 것이지 별도의 아키텍처가 아니다. 같은 가중치와 대략 입력 1.1M, 출력 128K 토큰의 같은 컨텍스트 윈도우를 공유한다. 더 똑똑한 기본 모델이 아니라 더 많은 생각 시간을 사는 것이다.
GPT-5.5 Pro의 컨텍스트 윈도우는?
GPT-5.5 Pro는 대략 입력 1.1M 토큰, 출력 128K 토큰의 컨텍스트 윈도우를 가지며 기본 GPT-5.5와 같다. 이는 대형 코드베이스나 긴 문서를 단일 호출로 불러오기에 충분하다. Pro와 기본의 차이는 메모리 크기가 아니다. 응답 전에 모델이 얼마나 많은 추론 컴퓨팅을 쓰느냐다.