
Claude Opus 5 출시: Fable 5에 근접한 지능, 가격은 절반
Anthropic이 2026년 7월 24일 Claude Opus 5를 출시했고, 메시지는 직설적입니다. Fable 5의 프론티어 지능에 근접하면서 가격은 절반이라는 것. 핵심 근거는 Frontier-Bench v0.1로, Opus 5가 43.3%를 기록하며 Opus 4.8의 21.1%를 두 배 이상 앞섭니다. 단, 항상 있듯 함정이 있습니다. 전부 이기지는 못합니다. GPT-5.6 Sol이 에이전트 코딩 테스트 하나에서 여전히 근소하게 앞서고, 건강·생물학 분야에서는 Mythos 5가 왕좌를 차지합니다. 실제로 무엇이 바뀌었는지, 전체 벤치마크 표, 그리고 지금 기본 모델을 바꿔야 하는지 정리했습니다.
핵심 요약:
- Claude Opus 5는 2026년 7월 24일 Claude API, Claude.ai, Claude Code, Claude Cowork에서 출시되었으며, 모델 ID는
claude-opus-5입니다. - Anthropic이 공개한 대부분의 벤치마크(Frontier-Bench, GDPval-AA, ARC-AGI-3, OSWorld 2.0, AutomationBench)에서 선두지만, 코딩·법률·과학 테스트 일부에서는 뒤처집니다.
- 가격은 Opus 4.8과 동일한 백만 토큰당 $5/$25이며, 약 2.5배 속도를 위해 약 2배 가격의 Fast 모드를 제공합니다.
오늘 출시된 것: Claude Opus 5를 1분 만에
Claude Opus 5는 Anthropic의 새로운 프론티어 모델로, 2026년 7월 24일 출시되어 같은 날 API, Claude.ai, Claude Code, Claude Cowork에서 사용할 수 있습니다. 모델 ID는 claude-opus-5입니다. 공식 발표에 따른 Anthropic의 프레이밍은 "Claude Fable 5의 프론티어 지능에 근접하면서 가격은 절반"이라는 것입니다. 표준 가격은 백만 토큰당 입력 $5 / 출력 $25로 Opus 4.8과 동일합니다.
이것은 에이전트 작업에서의 진정한 세대교체이지, 마이너 업데이트가 아닙니다. Claude Opus 4.8에서 넘어온다면 API 형태와 Claude Code 통합은 그대로 유지되므로 마이그레이션은 모델 ID 교체뿐입니다. 달라진 것은 천장입니다. Frontier-Bench v0.1에서 Anthropic은 Opus 5가 4.8의 점수를 두 배 이상 넘기면서 작업당 비용은 더 낮다고 밝히며, GDPval-AA와 ARC-AGI-3에서 최고 수준의 수치를 기록합니다.
포지셔닝이 중요합니다. Fable 5는 Anthropic의 가장 비싼 프론티어 모델입니다. Opus 가격으로 그 수준에 근접하는 것이 이번 릴리스의 전부이며, 그래서 "절반 가격"이라는 문구가 Anthropic이 내세우는 핵심입니다.
Opus 5에서 4.8 대비 실제로 새로운 것은?
4.8에서 5로의 가장 큰 변화는 판단력입니다. Opus 5는 자신의 작업을 검증하고, 작업이 그럴듯하게 끝난 것이 아니라 실제로 완료될 때까지 반복하는 능력이 눈에 띄게 향상되었습니다. Anthropic은 더 강력해진 소프트웨어 엔지니어링, 지식 작업, 과학 연구 능력과 개선된 시각 출력도 언급합니다. 가격과 핵심 API는 그대로입니다.
향상된 판단력과 자기 검증
가장 명확한 행동 변화는 Opus 5가 스스로를 점검한다는 것입니다. Anthropic은 기술 스태프 Zimu Li를 인용하여, 이 모델을 "가지를 검증하고, 템플릿을 확인하는" 모델로 묘사합니다. 프로덕션에서 에이전트가 자신의 실수를 잡아내는 것에 의존하는 사람에게는, 이것이 판도를 바꾸는 특성입니다. 동시에 벤치마크 차트에서 가장 팔기 어려운 것이기도 하므로, 자신의 작업에서 직접 테스트해볼 주장으로 취급하세요.
Opus 비용으로 프론티어 지능
Cursor의 공동 창립자 Sualeh Asif는 이번 릴리스를 "Opus 속도와 비용으로 Fable 5에 근접한 지능"이라고 요약했습니다. 이것이 실용적인 해석입니다. Fable 5급 추론을 원했지만 가격을 정당화할 수 없었던 팀에게 이제 중간 선택지가 생겼습니다. OSWorld 2.0에서 Anthropic은 Opus 5가 약 3분의 1 비용으로 Fable 5를 능가한다고 밝히며, 이것이 가치 주장의 가장 깔끔한 단일 사례입니다.
정렬 및 안전 태세
Anthropic은 Opus 5가 역대 최저 비정렬 행동 점수(2.3)를 기록했으며, 자사의 헌법에 가장 잘 정렬된 모델이라고 부릅니다. 보안 측면에서 사이버보안 분류기는 Fable 5의 것보다 약 85% 덜 제한적이라고 설명하며, 필요한 팀을 위한 엔터프라이즈 Cyber Verification Program을 제공합니다. 모든 벤더의 안전 주장과 마찬가지로, 알아두면 좋지만 자신의 레드팀 사례로 검증할 가치는 있습니다.
Opus 5 벤치마크: 이기는 곳(과 지는 곳)
Opus 5는 Anthropic이 공개한 대부분의 벤치마크에서 선두이며, 에이전트 빌더에게 중요한 승리는 압도적입니다. Frontier-Bench v0.1(43.3%), GDPval-AA(1861 Elo), ARC-AGI-3(30.2%), OSWorld 2.0(70.6%), Zapier의 AutomationBench(26.0%). 솔직한 예외: GPT-5.6 Sol이 DeepSWE v1.1에서 이기고, Fable 5가 FrontierCode와 법률 테스트에서 근소하게 앞서며, Mythos 5가 건강과 생물학을 가져갑니다.
| 벤치마크 | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|
| 에이전트 터미널 코딩, Frontier-Bench v0.1 | 43.3% | 33.7% | 21.1% | 34.4% |
| 지식 작업, GDPval-AA v2 (Elo) | 1861 | 1747 | 1593 | 1736 |
| 새로운 문제 해결, ARC-AGI-3 | 30.2% | — | 1.5% | 7.8% |
| 에이전트 검색, BrowseComp | 90.8% | 87.4% | 84.3% | 90.4% |
| 다학제 추론, Humanity's Last Exam (도구 사용) | 64.7% | 63.9% | 57.9% | — |
| 에이전트 컴퓨터 사용, OSWorld 2.0 | 70.6% | 66.1% | 55.7% | 62.6% |
| 에이전트 코딩, DeepSWE v1.1 | 68.8% | 69.7% | 59.0% | 72.7% |
| 에이전트 코딩, FrontierCode v1.1 (Main) | 53.4% | 53.5% | 46.5% | 47.5% |
| 비즈니스 워크플로, AutomationBench | 26.0% | 17.4% | 17.0% | 18.1% |
| Legal Agent Benchmark (held-out) | 11.7% | 13.3% | 10.4% | 2.5% |
| 건강, HealthBench Professional | 59.8% | 66.0% | 57.4% | 60.5% |
| 생물학, BioMysteryBench (hard) | 49.4% | 46.5% | 42.4% | — |

절대 점수만 보지 말고 차이를 읽으세요. Frontier-Bench는 Opus 4.8 대비 +22.2포인트 상승(21.1에서 43.3)했으며, 이것이 가장 큰 단일 도약이자 Anthropic이 이번을 코딩·에이전트 릴리스라고 부르는 이유입니다. GDPval-AA는 +268 Elo 상승(1593에서 1861)하여 표의 모든 모델을 지식 작업에서 제쳤습니다. ARC-AGI-3가 눈길을 끕니다. GPT-5.6 Sol의 7.8%, Opus 4.8의 1.5% 대비 30.2%로, Anthropic은 이를 새로운 문제 해결에서 차선 공개 모델의 약 3배라고 프레이밍합니다. AutomationBench에서 26.0%는 필드의 약 1.5배로, 비즈니스 프로세스 에이전트를 만드는 사람에게 직접적인 신호입니다.
패배에 대한 솔직한 두 가지 참고. 첫째, 건강(66.0%)과 생물학 인간 해결 분할에서 Fable 5 열의 선두는 실제로 Anthropic의 과학 특화 모델인 Mythos 5이지 Fable 5가 아니므로, 동등한 일반 모델 간 승리가 아닙니다. 둘째, 코딩 그림은 실제로 나뉘어 있습니다. GPT-5.6 Sol이 DeepSWE v1.1(72.7% vs 68.8%)을 가져가고, Fable 5가 FrontierCode를 간발의 차로 이깁니다(53.5% vs 53.4%). 작업이 순수 SWE-bench 스타일 코딩이라면, "종합 최고"라는 라벨이 자동으로 Opus 5를 선택하지 않습니다.
Opus 5 가격은? 가격과 Fast 모드
Opus 5의 표준 가격은 백만 입력 토큰당 $5, 백만 출력 토큰당 $25로, Anthropic의 공개 가격에 따라 Opus 4.8과 동일하므로 업그레이드에 대한 가격 인상이 없습니다. "절반 가격" 주장은 Fable 5에 대한 것이지 4.8에 대한 것이 아닙니다. Fable 5급 요금을 내지 않고 Fable 5에 근접한 지능을 얻는 것입니다. Fast 모드는 기본 가격의 약 2배로 기본 속도의 약 2.5배를 실행하며, API는 폴백 라우팅을 지원합니다.
그렇다면 작업당 무슨 의미일까요? 표준 가격에서는 4.8 대비 추가 비용 없이 큰 기능 향상을 얻으므로, 대부분의 워크로드에서 업그레이드는 사실상 무료입니다. Fast 모드는 대화형 세션의 레버입니다. 같은 모델에서 약 2.5배 빠르게 스트리밍되는 출력을 위해 2배 가격 프리미엄을 지불하는 것으로, 앉아서 기다릴 때는 가치가 있고, 실행 시간이 중요하지 않은 야간 배치 작업에서는 아픕니다. 속도 제한이 실제 제약이라면, Claude 사용 제한 가이드에서 티어가 비용과 어떻게 상호작용하는지 다룹니다.
# Claude Code: point your default model at Opus 5
/model claude-opus-5
# API request body (model ID swap):
{
"model": "claude-opus-5",
"messages": [
{ "role": "user", "content": "Refactor this module and verify the tests pass." }
]
}프로덕션 에이전트에서 Opus 5의 위치
이득은 정확히 프로덕션 에이전트가 사는 곳에 집중됩니다. 터미널 코딩(Frontier-Bench), 컴퓨터 사용(OSWorld 2.0), 에이전트 검색(BrowseComp), 다단계 비즈니스 워크플로(AutomationBench). 이 네 가지는 실제 배포에서 가장 자주 깨지는 워크로드이므로, 네 가지 모두에서 도약하는 모델은 배포 가능한 것의 범위를 바꿉니다.
곱씹어볼 가치가 있는 부분입니다. AutomationBench 같은 벤치마크는 에이전트가 실제 멀티툴 워크플로를 처음부터 끝까지 완료할 수 있는지를 측정하며, Opus 5의 26.0% 대 필드의 약 17%는 "데모는 잘 된다"와 "지저분한 CRM과의 접촉에서 살아남는다"의 차이입니다. OSWorld 2.0 결과(70.6%, 3분의 1 비용으로 Fable 5를 능가)는 실제 소프트웨어를 클릭하는 컴퓨터 사용 에이전트에 대해 같은 이야기를 합니다. 고객 대면 AI 에이전트를 배포하는 팀에게, 이 수치들은 새벽 2시 장애 감소로 직결됩니다.
또한 우리가 의존하는 설계 패턴의 비용을 낮춥니다. 저렴한 자기 검증입니다. 모델이 자신의 가지를 점검하는 능력이 진정으로 향상되면, 별도의 비평가 패스에 더 적은 토큰을 쓰면서도 같은 오류를 잡을 수 있습니다. 대량으로 에이전트를 운영하는 모든 사람에게 이것은 실제 예산 항목입니다.
우리 스택에 Opus 5를 적용하는 방법
Techsy에서 우리는 Claude 스택으로 프로덕션 AI 에이전트를 구축하고 운영하므로, 프론티어 릴리스는 읽고 넘기는 헤드라인이 아니라 당일 평가입니다. 아직 깔끔한 전/후 수치가 없는 부분은 정성적으로, 있는 부분은 구체적으로 솔직한 첫인상을 전합니다.
교체 자체는 사소하며, 그것이 핵심입니다. 우리의 콘텐츠 및 자동화 파이프라인은 설정에서 기본 모델을 고정합니다. claude-opus-4-8을 claude-opus-5로 바꾸고 세션을 재시작하는 데 다른 변경이 전혀 필요 없었습니다. 최근 모든 Opus 업그레이드와 마찬가지입니다. 프로바이더 간 라우팅을 하면서 자체 작업에서 Opus 5를 Fable 5나 GPT-5.6 Sol과 A/B 테스트하고 싶다면, 프록시로 앱을 다시 작성하지 않고 모델을 전환할 수 있습니다.
가장 먼저 지켜보는 것은 자기 검증 주장입니다. 실제로 우리 아키텍처를 바꿀 수 있는 것이기 때문입니다. 현재 우리 에이전트는 잘못된 편집이 적용되기 전에 잡기 위해 명시적 비평가 단계를 실행합니다. Opus 5가 자신의 약한 가지를 안정적으로 표시한다면, 그 단계를 줄이고 토큰을 절약할 수 있습니다. 반복 가능한 작업 세트에서 실행하기 전에는 수치를 공개하지 않을 것입니다. 에이전트 지표를 인용하는 누구에게나 원하는 것과 같은 규율입니다. 방법이 궁금하다면, 프로덕션 AI 에이전트 평가 가이드에 있는 것입니다. 같은 프롬프트, 같은 리포 상태, 분위가 아닌 잘못된 분기를 셉니다.
Opus 4.8에서 전환해야 하나? (전환 / 대기 / 유지)
전환 여부는 어떤 모델이 "종합 우승"이냐가 아니라 워크로드에 달려 있습니다. 에이전트와 지식 작업의 도약은 크고 실질적이므로, 대부분의 팀은 전환해야 합니다. GPT나 Fable 파이프라인이 있는 순수 코딩 조직은 커밋 전에 테스트할 이유가 있고, 저렴한 작업에서 천장에 가까운 사용자는 거의 잃을 것 없이 유지할 수 있습니다.
지금 전환하세요: 작업이 에이전트 작업, 컴퓨터 사용, 비즈니스 프로세스 자동화, 지식 작업에 의존하는 경우. Frontier-Bench(4.8 대비 +22.2), AutomationBench(필드의 약 1.5배), GDPval-AA(+268 Elo)가 가장 큰 실질적 이득이며, 가격이 변하지 않았으므로 업그레이드에 비용 페널티가 없습니다.
대기하세요: 워크플로가 순수 에이전트 코딩이고 이미 GPT-5.6 Sol이나 Fable 5를 사용하는 경우. GPT-5.6 Sol이 여전히 DeepSWE v1.1에서 선두이고 Fable 5가 FrontierCode에서 근소하게 앞서므로, 전환 전에 자체 코딩 평가를 실행하세요. 프로젝트 중간이고 모델 교체가 이미 진행 중인 평가를 흐릴 수 있다면 역시 대기하세요.
4.8에 유지하세요: 이미 천장에 가까웠던 작업에서 비용에 민감하고, Opus 5가 앞서는 에이전트 워크로드를 건드리지 않는 경우. 체감하지 못할 차이를 위해 전환 비용을 지불하는 것입니다. 더 넓은 필드는 Claude Sonnet 5 분석과 Fable 5와 Mythos 5 개요에서 모델 비교를 확인하세요.
우리는 매주 클라이언트 에이전트 구축에 이런 모델을 선택하고 연결합니다. 프로덕션 에이전트에 표준화할 모델을 결정 중이라면, 무료 상담을 받으세요. 마케팅이 아닌 워크로드에 모델을 맞춰드리겠습니다.
저자 소개
Mert Batur Gurbuz는 Techsy.io의 공동 창립자로, 팀이 B2B 클라이언트를 위해 AI 에이전트, 자동화 시스템, 음성/SDR 파이프라인을 배포합니다. University of Birmingham에서 공부하며, Techsy 팀이 실제로 프로덕션에서 운영하는 LLM 도구 스택에 대해 씁니다.
공동 창립자, Techsy.io, University of Birmingham · LinkedIn
자주 묻는 질문
Claude Opus 5란?
Claude Opus 5는 Anthropic의 프론티어 모델로, 2026년 7월 24일 출시되었으며 모델 ID는 claude-opus-5입니다. Anthropic은 이를 Fable 5의 지능에 근접하면서 가격은 절반이라고 포지셔닝하며, Frontier-Bench, GDPval-AA, ARC-AGI-3를 포함한 대부분의 공개 벤치마크에서 선두입니다. Claude API, Claude.ai, Claude Code, Claude Cowork에서 사용할 수 있습니다.
Claude Opus 5는 언제 출시되었나요?
Claude Opus 5는 2026년 7월 24일 출시되었습니다. 같은 날 Claude API, Claude.ai, Claude Code, Claude Cowork 전체에서 즉시 사용 가능해졌으며, 단계적 롤아웃 없이 바로 claude-opus-5로 기본 모델을 전환할 수 있습니다.
Claude Opus 5는 Opus 4.8보다 나은가요?
대부분의 작업에서 그렇습니다. Opus 5는 Frontier-Bench v0.1에서 Opus 4.8을 두 배 이상 앞서고(43.3% vs 21.1%), GDPval-AA에서 268 Elo를 얻으며, ARC-AGI-3에서 1.5%에서 30.2%로 도약합니다. 가격은 변하지 않아 비용 페널티가 없습니다. 예외는 GPT-5.6 Sol, Fable 5, Mythos 5가 여전히 선두인 일부 코딩 및 과학 테스트입니다.
Claude Opus 5의 가격은 얼마인가요?
표준 가격은 백만 입력 토큰당 $5, 백만 출력 토큰당 $25로 Opus 4.8과 동일합니다. "절반 가격"이라는 표현은 Fable 5를 가리키며 4.8이 아닙니다. Opus 5는 Opus 요금으로 Fable 5에 근접한 지능을 제공합니다. Fast 모드는 기본 가격의 약 2배이며 같은 모델에서 약 2.5배 빠르게 실행됩니다.
Claude Opus 5가 Fable 5를 이기나요?
전반적으로는 아닙니다. Opus 5는 OSWorld 2.0, BrowseComp, GDPval-AA, Frontier-Bench에서 Fable 5를 능가하며, Fable 5 가격의 일부로 이를 달성합니다. 그러나 Fable 5가 여전히 FrontierCode와 법률 벤치마크에서 근소하게 앞서고, Mythos 5(Anthropic의 과학 모델)가 건강과 생물학에서 선두입니다. 메시지는 "절반 가격으로 Fable 5에 근접"이지, "모든 것에서 Fable 5보다 우수"가 아닙니다.
Opus 5가 지는 것은 무엇인가요?
GPT-5.6 Sol이 DeepSWE v1.1에서 에이전트 코딩을 이기고(72.7% vs 68.8%), Fable 5가 FrontierCode v1.1에서 0.1포인트, held-out 법률 벤치마크에서 이기며(13.3% vs 11.7%), Mythos 5가 HealthBench Professional과 생물학 테스트에서 선두입니다. 워크로드가 이 중 하나에 집중된다면, 전환 전에 벤치마크하세요.
Claude Opus 5는 AI 에이전트 구축에 좋은가요?
그것을 위해 만들어졌습니다. 가장 큰 이득은 에이전트 터미널 코딩(Frontier-Bench), 컴퓨터 사용(OSWorld 2.0), 에이전트 검색(BrowseComp), 다단계 비즈니스 워크플로(AutomationBench)에 있으며, 이는 프로덕션 에이전트가 실행하는 워크로드입니다. 향상된 자기 검증으로 별도의 비평가 패스에 더 적은 토큰을 쓸 수도 있습니다.
Claude Code와 API에서 Opus 5로 어떻게 전환하나요?
모델을 claude-opus-5로 설정하면(Claude Code에서 /model claude-opus-5 사용) 대부분의 팀은 완료입니다. API에서는 model 필드를 claude-opus-5로 변경합니다. 요청 형태는 Opus 4.8과 동일하므로 다른 코드 변경이 필요 없습니다.
Claude Opus 5의 Fast 모드란?
Fast 모드는 표준 가격의 약 2배로 기본 속도의 약 2.5배로 Opus 5를 실행하는 고속 티어입니다. 더 작은 모델로 라우팅하지 않고 완전한 claude-opus-5 모델을 유지하므로, 출력을 기다리는 대화형 세션에 유용하고, 지연 시간에 민감하지 않은 배치 작업에는 가치가 없습니다.