
Claude Opus 4.8 공개: 무엇이 바뀌었고, 어디서 이기며(그리고 지는 한 가지)
Anthropic은 2026년 5월 28일, 4.7 이후 단 41일 만에 Claude Opus 4.8을 출시했습니다. 이는 우리가 본 가장 빠른 Opus 출시 주기입니다. 핵심 수치인 SWE-Bench Pro 69.2%는 사실이지만, 함정도 있습니다. 벤치마크 한 개에서는 완전히 지고 있다는 점입니다. 무엇이 바뀌었는지, 그리고 지금 바로 기본 모델을 바꿔야 할지 아니면 기다려야 할지 알아봅니다.
핵심 요약:
- Claude Opus 4.8은 2026년 5월 28일, 4.7 이후 41일 만에 Claude.ai, Claude Code, API에서 출시되었습니다.
- Anthropic 벤치마크 7개 중 6개에서 선두를 차지했지만, Terminal-Bench 2.1에서는 GPT-5.5에 패했습니다(74.6% 대 78.2%).
- 가격은 백만 토큰당 $5/$25로 변동이 없으며, 새로운 Fast Mode는 약 2.5배 빠른 속도로 $10/$50입니다.
오늘 출시된 것: Claude Opus 4.8을 1분 만에 정리
Claude Opus 4.8은 Anthropic의 프론티어 모델로, 2026년 5월 28일에 출시되어 오늘부터 Claude.ai, Claude Code, API에서 사용할 수 있습니다. 모델 ID는 claude-opus-4-8이며, 1M 토큰 컨텍스트 변형은 claude-opus-4-8[1m]입니다. 표준 가격은 4.7과 동일한 백만 토큰당 $5/$25입니다. 짧게 결론을 내리자면, 코딩과 지식 작업에서 실질적인 업그레이드이며, 솔직한 예외가 하나 있습니다.
이번 출시는 점진적인 릴리스이지 처음부터 다시 만든 것이 아닙니다. Claude Opus 4.7에서 넘어오셨다면, 이미 알고 계신 대부분이 그대로 유지됩니다. API 형태, effort control 개념, Claude Code 통합이 그것입니다. 달라진 점은 벤치마크 상한선, 더 저렴해진 Fast Mode, 그리고 코드베이스 규모의 작업을 위한 새로운 리서치 프리뷰 기능입니다.
Opus 4.8은 4.7 이후 단 41일 만에 출시되었으며, 이는 Anthropic이 선보인 가장 빠른 Opus 출시 주기입니다. 1M 토큰 컨텍스트 변형은 claude-opus-4-8[1m]으로 존재하지만, 공개 Models overview 문서 페이지에는 아직 반영되지 않았을 수 있습니다. Anthropic의 발표에 따르면, 이는 지금까지 나온 모델 중 "가장 솔직한" 모델이라고 하며, 이 주장은 뒤에서 다시 다룹니다.
Opus 4.8에서 4.7 대비 실제로 새로워진 것은?
4.7에서 4.8로 넘어오며 가장 크게 바뀐 점은 정렬(alignment), 도구 호출 효율성, 그리고 새로운 오케스트레이션 기능입니다. Anthropic에 따르면 Opus 4.8은 자체 코드의 결함을 표시하지 않고 넘길 가능성이 4.7보다 약 4배 낮으며, 에이전트 작업을 더 적은 단계로 완료하고, 대규모 마이그레이션을 위한 Dynamic Workflows를 도입했습니다. 가격과 핵심 API는 그대로입니다.
솔직함과 정렬
발표에 따르면, Opus 4.8은 불확실성을 표시하고, 근거 없는 주장을 피하며, 방금 작성한 코드의 문제를 지적할 가능성이 더 높아졌습니다. Anthropic은 정렬되지 않은 행동의 비율이 "Opus 4.7보다 상당히 낮다"고 말하며, 모델이 능동적으로 문제를 제기했다는 Bridgewater의 고객 후기를 인용합니다. 코드의 결함을 잡아내는 데 AI를 활용하는 분이라면, "결함을 통과시킬 가능성이 4배 낮다"는 수치가 주목할 만한 부분입니다. 직접 풀 리퀘스트에서 테스트하기 전까지는 벤더의 주장으로 받아들이세요.
Effort control과 Messages API 변경
이제 effort level을 Claude.ai에서 직접 사용자가 선택할 수 있어, 더 작은 모델로 내리지 않고도 토큰 소비와 깊이를 맞바꿀 수 있습니다. 작지만 실질적인 개발자 경험 변화도 있습니다. Messages API가 이제 최상위 system 파라미터뿐 아니라 messages 배열 내부의 system 항목도 받아들입니다. 에이전트를 만든다면, 대화 중간에 system 명령어를 관리하기가 더 깔끔해집니다.
더 효율적인 도구 호출
Anthropic은 도구 호출을 "의미 있게 더 효율적 — 같은 지능에 더 적은 단계"라고 설명하며, effort level 전반에 걸쳐 CursorBench에서 측정했습니다. 자체 Super-Agent 벤치마크에서, Opus 4.8은 GPT-5.5와 비용 동등성을 유지하면서 모든 케이스를 끝까지 완료한 유일한 모델이었다고 합니다. 작업당 도구 호출이 줄어드는 것은 에이전트 빌더에게 직접적인 비용 레버이므로, 이 부분은 들리는 것보다 중요합니다.
Opus 4.8 벤치마크: 이기는 곳(그리고 지는 한 곳)
Opus 4.8은 SWE-Bench Pro(69.2%)와 GDPval-AA(1890 Elo)를 포함해 Anthropic 벤치마크 7개 중 6개에서 선두입니다. 예외이자 솔직하게 짚어야 할 한 가지: GPT-5.5는 여전히 Terminal-Bench 2.1의 에이전트 터미널 코딩에서 이기며, 78.2%로 Opus 4.8의 74.6%를 앞섭니다. 따라서 작업이 터미널에서 이루어진다면, 전체적으로 가장 좋은 모델이 당신에게 가장 좋은 모델은 아닙니다.
| 벤치마크 | Opus 4.8 | Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| 에이전트 코딩, SWE-Bench Pro | 69.2% | 64.3% | 58.6% | 54.2% |
| 에이전트 터미널 코딩, Terminal-Bench 2.1 | 74.6% | 66.1% | 78.2% | 70.3% |
| 다학제 추론, Humanity's Last Exam(도구 없음) | 49.8% | 46.9% | 41.4% | 44.4% |
| 다학제 추론, Humanity's Last Exam(도구 사용) | 57.9% | 54.7% | 52.2% | 51.4% |
| 에이전트 컴퓨터 사용, OSWorld-Verified | 83.4% | 82.8% | 78.7% | 76.2% |
| 지식 작업, GDPval-AA (Elo) | 1890 | 1753 | 1769 | 1314 |
| 에이전트 금융 분석, Finance Agent v2 | 53.9% | 51.5% | 51.8% | 43.0% |

절대 점수뿐 아니라 변화폭을 읽으세요. SWE-Bench Pro는 +4.9포인트(64.3에서 69.2) 뛰었으며, 이것이 핵심 코딩 향상입니다. Terminal-Bench 2.1은 +8.5포인트(66.1에서 74.6) 상승해 4.7에서 4.8로 넘어오며 가장 큰 단일 도약을 이루었지만, 여전히 GPT-5.5에 뒤집니다. GDPval-AA는 +137 Elo(1753에서 1890)를 얻어 지식 작업에서 큰 폭으로 올랐고, GPT-5.5(1769)도 큰 차이로 제쳤습니다. OSWorld-Verified는 단 +0.6(82.8에서 83.4)만 움직였습니다. 컴퓨터 사용은 이미 4.7에서 상한선에 가까웠으므로, 체감 차이는 기대하지 마세요. Finance Agent v2는 +2.4포인트를 더했습니다.
결론은 깔끔합니다. Opus 4.8은 7개 벤치마크 중 6개에서 이기고, 지는 한 가지인 에이전트 터미널 코딩은 여전히 GPT-5.5가 가져갑니다. 이 수치는 Anthropic의 발표와 OfficeChai 벤치마크 라운드업에서 확인되었습니다.
Fast Mode란 무엇이며, 더 저렴한가?
Fast Mode는 Opus 4.8을 약 2.5배 빠르게 실행하며, 백만 토큰당 입력 $10 / 출력 $50이고, Claude Code에서 /fast로 활성화합니다. Anthropic은 "이전 모델 대비 3배 저렴하다"고 말합니다. 표준 가격은 백만 토큰당 $5/$25로 4.7과 동일하게 유지됩니다. 핵심은 이렇습니다. Fast Mode는 완전한 Opus 모델을 유지하며, 더 작은 모델로 다운그레이드하지 않습니다.
그렇다면 작업당 이것이 의미하는 바는? 같은 모델 지능에서 약 2.5배의 속도를 위해 2배의 가격 프리미엄을 지불합니다. 출력을 기다리는 대화형 Claude Code 세션에서는, 그 트레이드가 종종 스스로 비용을 상쇄합니다. 실제 소요 시간이 중요하지 않은 긴 배치 작업에는 표준 가격이 더 저렴한 선택입니다.
# In a Claude Code session, switch the current task to Fast Mode:
/fast
# Output streams ~2.5x faster on the same claude-opus-4-8 model.
# Standard pricing ($5/$25) resumes on your next normal task.Fast Mode의 더 넓은 API 접근은 계정 매니저나 대기자 명단을 통해 순차 제공됩니다. 이미 속도 제한에 걸리고 있다면, Claude 사용량 제한 가이드에서 티어가 비용과 어떻게 상호작용하는지 설명합니다. 솔직한 주의사항 하나: "이전보다 3배 저렴"은 Fast Mode 자체가 이전 Fast 티어 대비 저렴해졌다는 뜻이지, 표준 Opus 가격보다 저렴하다는 뜻이 아닙니다. 그렇지 않습니다.
Dynamic Workflows: 병렬 서브에이전트로 코드베이스 규모 마이그레이션
Dynamic Workflows는 Enterprise, Team, Max 플랜의 리서치 프리뷰 기능으로, "서브에이전트 스웜"을 조율합니다 — 단일 세션에서 수백 개의 병렬 서브에이전트를 돌립니다. Claude Code와 Opus 4.8을 결합하면, Anthropic은 수십만 줄에 걸친 코드베이스 규모 마이그레이션을 시작부터 머지까지 최소한의 개입으로 실행할 수 있다고 말합니다.
Dynamic Workflows를 사용하면 하나의 Claude Code 세션이 수백 개의 병렬 서브에이전트로 분기되어 코드베이스 전체를 마이그레이션할 수 있습니다. 프레임워크 업그레이드, 의존성 대대적 개편, 또는 보통 엔지니어의 일주일을 잡아먹을 리포지토리 전체 리팩터링을 떠올려 보세요. 병렬 코딩 에이전트를 다뤄본 적이 있다면, 이것은 그 아이디어를 확장하고 당신이 아닌 모델이 오케스트레이션하는 것입니다.
솔직한 주의사항 두 가지. 첫째, 리서치 프리뷰이므로 거친 부분이 있을 수 있고, 검토 없이 프로덕션 핵심 마이그레이션에 들이대지 마세요. 둘째, 플랜 제한이 있어 Enterprise, Team, Max 접근이 필요합니다. TechCrunch는 Dynamic Workflows를 경쟁 연구실들의 경쟁 압력에 대한 Anthropic의 답변으로 프레이밍했으며, 그 해석은 들어맞습니다. 이 릴리스의 간판 개발자 기능입니다.
Claude Code에서 Opus 4.8을 돌려봤습니다: 측정한 결과
저희는 콘텐츠 파이프라인 리포지토리의 기본 모델을 claude-opus-4-7에서 claude-opus-4-8로 바꾸고, 매일 사용하는 동일한 에이전트 작업을 다시 실행했습니다. 초기 직접 사용 후 솔직하게 말할 수 있는 부분은 이렇습니다. 명확한 전후 수치가 없는 부분은 정성적으로, 있는 부분은 구체적으로 말씀드립니다.
먼저, 전환은 정말 사소합니다. 모델 ID를 claude-opus-4-8로 바꾸고 세션을 시작하는 것이 저희 측에서는 설정 변경 제로로 작동했습니다. 더 큰 창이 필요하다면 1M 컨텍스트 변형을 claude-opus-4-8[1m]으로 지정할 수 있습니다. /fast로 Fast Mode를 확인한 결과, 더 작고 저렴한 모델로 조용히 라우팅하지 않고 완전한 Opus 모델을 유지했습니다. 이는 우리가 원했지만 당연하다고 가정하지는 않았던 동작입니다.
초기 사용에서 눈에 띈 점: Opus 4.8은 반박하는 것을 확실히 더 꺼리지 않습니다. 리팩터링 작업에서, 기존 코드의 가정 하나를 위험하다고 표시하고 그 위에 조용히 쌓는 대신 지적했습니다 — Anthropic의 "결함을 통과시킬 가능성이 4배 낮다"는 주장이 예측하는 바로 그 종류의 행동입니다. 이를 벤치마크로 포장하지는 않겠습니다. 하나의 작업에서 나온 하나의 관찰일 뿐입니다. 하지만 가장 먼저 알아챈 부분이며, 정렬 이야기와 들어맞습니다.
Fast Mode의 속도 향상은 실제였고 대화형 세션에서 분명했습니다. 출력 스트리밍이 더 빨리 시작되었습니다. 다만, 깨끗하고 반복 가능한 타이밍 테스트를 돌리기 전까지는 정확한 지연 시간 수치를 공개하지 않겠습니다. 직접 비교를 돌린다면, 솔직한 방법은 이렇습니다. 같은 프롬프트, 같은 리포지토리 상태, 표준 모드 다음 /fast, 그리고 실제 소요 시간과 토큰 비용을 양쪽 모두 측정하세요. 그 테스트가 확정되면 이 섹션을 확정 수치로 업데이트하겠습니다.
4.7에서 업그레이드해야 하나? (지금 전환 / 대기 / 유지)
업그레이드 여부는 전적으로 워크로드에 달려 있으며, 어떤 모델이 전반적으로 "이기는지"에 달려 있지 않습니다. SWE-Bench Pro와 GDPval-AA의 도약은 크고 실질적이므로, 코딩 및 지식 작업 사용자는 옮겨야 합니다. 터미널 중심 팀은 기다릴 정당한 이유가 있습니다. 상한선 근처 작업의 비용 민감 사용자는 거의 잃는 것 없이 4.7에 머물러도 됩니다.
지금 전환하세요: 작업이 에이전트 코딩(SWE-Bench Pro +4.9)이나 지식 작업(GDPval-AA +137 Elo)에 치우쳐 있다면. 이것이 가장 큰 실질적 이득이며, 저희 테스트에서 SWE-Bench 도약은 실제 PR에서 잘못된 방향 전환이 줄어드는 것으로 나타났습니다. 가격은 바뀌지 않았으므로, 업그레이드에 비용 불이익은 없습니다.
기다리세요: 워크플로가 터미널 중심이라면, GPT-5.5가 여전히 Terminal-Bench 2.1에서 선두(78.2% 대 74.6%)이므로, "최고 모델"이라는 프레이밍은 아직 당신에게 적용되지 않습니다. 또한 프로젝트 중간이라 모델 전환이 평가를 흐릴 수 있다면 기다리세요.
4.7에 머무르세요: 비용에 민감하고 사용 사례가 이미 상한선 근처라면, 예를 들어 컴퓨터 사용처럼 OSWorld-Verified가 단 +0.6만 움직인 경우입니다. 체감하지 못할 차이를 위해 전환 비용(주의력)을 지불하게 됩니다.
작업이 SWE-Bench 스타일 코딩이나 지식 작업에 치우쳐 있다면, 4.8은 명확한 업그레이드입니다. 터미널 중심이라면, GPT-5.5가 여전히 근소하게 앞설 수 있습니다. 더 넓은 지형은 최고의 AI 코딩 에이전트에서 Opus 4.8의 위치를 확인하고, 전체 변화상을 원한다면 4.7 릴리스를 확인하세요.
Claude Code와 API에서 Opus 4.8로 전환하려면?
전환은 거의 사소한 모델 ID 교체입니다. 기본 모델을 claude-opus-4-8로 설정하고(1M 컨텍스트 창은 claude-opus-4-8[1m]), 클라이언트가 노출한다면 effort level을 고르면 끝입니다. Messages API로 빌드한다면, 이제 system 항목을 최상위 system 필드뿐 아니라 messages 배열 내부에도 배치할 수 있습니다.
# Claude Code: set the default model
/model claude-opus-4-8
# API request body (model ID swap):
{
"model": "claude-opus-4-8",
"messages": [
{ "role": "system", "content": "You are a senior engineer." },
{ "role": "user", "content": "Refactor this module." }
]
}대부분의 팀에게 이것이 마이그레이션의 전부입니다. 여러 프로바이더에서 모델을 실행하면서 자체 작업에서 4.8을 GPT-5.5나 Gemini 3.1 Pro와 비교 테스트하고 싶다면, 프록시를 사용하면 앱을 다시 작성하지 않고도 모델 간 라우팅이 가능합니다. 표준 모드로 시작해 실제 워크로드에서 출력 품질을 확인한 다음, Fast Mode의 속도-가격 트레이드가 가치가 있을지 결정하세요.
저희 Techsy는 바로 이 스택으로 프로덕션 AI 에이전트를 빌드합니다. 에이전트 빌드를 위해 모델을 고르는 중이라면, 무료 상담을 받으세요. 워크로드에 맞는 모델을 고르도록 도와드립니다.
저자 소개
Mert Batur Gurbuz는 Techsy.io의 공동 창업자로, 팀은 B2B 고객을 위해 AI 에이전트, 자동화 시스템, 음성/SDR 파이프라인을 출시합니다. University of Birmingham에서 공부하며, Techsy 팀이 실제로 프로덕션에서 사용하는 LLM 도구 스택에 대해 글을 씁니다.
공동 창업자, Techsy.io, University of Birmingham · LinkedIn
자주 묻는 질문
Claude Opus 4.8이란?
Claude Opus 4.8은 Anthropic의 프론티어 모델로, 2026년 5월 28일에 출시되었으며, 모델 ID는 claude-opus-4-8이고 1M 컨텍스트 변형은 claude-opus-4-8[1m]입니다. Anthropic은 이를 지금까지 가장 솔직한 모델로 포지셔닝하며, 공개된 벤치마크 7개 중 6개에서 선두이고 Claude.ai, Claude Code, API에서 사용할 수 있습니다.
Claude Opus 4.8은 언제 출시되었나?
Claude Opus 4.8은 2026년 5월 28일에 출시되었으며, Opus 4.7 이후 단 41일 만으로, Anthropic이 선보인 가장 빠른 Opus 출시 주기입니다. Claude.ai, Claude Code, Anthropic API 전반에 걸쳐 같은 날 라이브로 전환되었고, 단계적 롤아웃은 없었으므로 기본 모델을 즉시 바꿀 수 있습니다.
Claude Opus 4.8은 Opus 4.7보다 나은가?
대부분의 작업에서는 그렇습니다. Opus 4.8은 SWE-Bench Pro에서 69.2% 대 64.3%로 선두이고, GDPval-AA에서 +137 Elo를 얻었으며, 4.7 대비 7개 벤치마크 중 6개에서 이깁니다. 예외는 에이전트 터미널 코딩으로, GPT-5.5가 여전히 둘 다보다 높은 점수를 냅니다. 가격은 변동이 없으므로, 업그레이드에 비용 불이익은 없습니다.
Opus 4.8은 4.7에서 업그레이드할 가치가 있나?
워크로드에 따라 다릅니다. 에이전트 코딩이나 지식 작업을 한다면 지금 전환하세요. 이득이 가장 큰 영역입니다. 작업이 터미널 중심이라면 기다리세요. GPT-5.5가 여전히 그곳에서 선두이기 때문입니다. 컴퓨터 사용처럼 상한선 근처 작업에 비용 민감하다면 4.7에 머무르세요. 차이가 단 +0.6포인트에 불과합니다.
Claude Opus 4.8의 가격은?
표준 가격은 백만 입력 토큰당 $5, 백만 출력 토큰당 $25로, Opus 4.7과 동일하므로 가격 인상은 없습니다. Fast Mode는 백만 토큰당 $10/$50이며 같은 모델에서 약 2.5배 빠르게 실행됩니다. Anthropic은 Fast Mode가 이전 Fast-Mode 티어보다 3배 저렴하다고 말합니다.
Claude Opus 4.8의 Fast Mode란?
Fast Mode는 Opus 4.8을 약 2.5배 빠르게 실행하는 고속 티어로, 백만 토큰당 입력 $10 / 출력 $50이며, Claude Code에서 /fast로 활성화합니다. 중요한 것은, 더 작은 모델로 다운그레이드하지 않고 완전한 claude-opus-4-8 모델을 유지한다는 점입니다. Anthropic은 이전 Fast-Mode 티어보다 3배 저렴하다고 말합니다.
Claude Code의 dynamic workflows란?
Dynamic Workflows는 Enterprise, Team, Max 플랜의 리서치 프리뷰 기능으로, 단일 세션에서 수백 개의 병렬 서브에이전트를 조율합니다. Claude Code와 Opus 4.8을 결합하면, 수십만 줄에 걸친 코드베이스 규모 마이그레이션을 시작부터 머지까지 실행할 수 있습니다. 아직 프리뷰이므로 거친 부분을 예상하세요.
Opus 4.8은 1M 토큰 컨텍스트 창을 지원하나?
네, claude-opus-4-8[1m] 변형을 통해 지원합니다. 더 큰 컨텍스트 창이 필요할 때 해당 모델 ID로 지정합니다. 공개 Models overview 문서 페이지에는 아직 반영 중이라 4.8 항목이 나열되지 않았을 수 있지만, 해당 변형은 지금 런타임에서 지정 가능합니다.
Claude Opus 4.8은 실제로 GPT-5.5를 모든 면에서 이기나?
아닙니다. GPT-5.5는 여전히 Terminal-Bench 2.1의 에이전트 터미널 코딩에서 이기며, 78.2%로 Opus 4.8의 74.6%를 앞섭니다. Opus 4.8은 SWE-Bench Pro와 GDPval-AA를 포함해 나머지 6개 공개 벤치마크에서 선두이지만, 워크플로가 터미널 중심이라면 그 특정 작업에서는 GPT-5.5가 여전히 더 강한 선택입니다.
Claude Code에서 Opus 4.8로 전환하려면?
모델을 claude-opus-4-8로 설정하고(Claude Code에서 /model claude-opus-4-8 사용), 클라이언트가 제공한다면 effort level을 고르세요. 1M 컨텍스트 창은 claude-opus-4-8[1m]을 사용하세요. 대부분의 팀에게 다른 설정 변경이 필요 없는 거의 사소한 교체입니다.