
Claude Fable 5 vs Opus 4.8: 정말 갈아타야 할까? (Mythos급, 벤치마크 분석)
Anthropic이 오늘, 2026년 6월 9일에 Claude Fable 5를 출시했습니다. **SWE-Bench Pro에서 80.3%**를 기록했는데, 이는 에이전틱 코딩 벤치마크로 Opus 4.8이 69.2%, GPT-5.5가 58.6%에 머무는 성적입니다. 반올림 오차 수준의 차이가 아닙니다. 그리고 반전이 하나 있습니다. Fable 5는 새로운 "Mythos급" 모델의 공개된, 안전장치가 적용된 절반이며, 제한된 액세스 프로그램 뒤에 Claude Mythos 5라는 비공개 형제 모델이 있습니다. 무엇이 바뀌었는지, 토큰 100만 개당 $10/$50에서 실제 작업 비용은 얼마인지, 그리고 정말 Opus 4.8에서 스택을 옮겨야 하는지 살펴봅니다.
빠른 답변
- Fable 5는 SWE-Bench Pro에서 80.3%를 기록해 Opus 4.8의 69.2%, GPT-5.5의 58.6%를 앞섭니다.
- 가격 책정은 토큰 100만 개당 입력 $10 / 출력 $50으로, Mythos Preview의 절반도 안 됩니다.
- Fable 5는 고위험 사이버/바이오/화학 쿼리에 대해 자동으로 Opus 4.8로 폴백합니다(세션의 5% 미만).
- 2026년 6월 22일까지 Pro/Max/Team/Enterprise 요금제에서 무료이며, 6월 23일부터 사용량 크레딧이 적용됩니다.
실제로 출시된 것: Fable 5, Mythos 5, 그리고 "Mythos급" 라인
Mythos급은 Anthropic의 새로운 최상위 성능 등급이며, 두 개의 모델로 출시됩니다. Claude Fable 5는 오늘 바로 호출할 수 있는 공개된 안전장치 적용 버전입니다. Claude Mythos 5는 안전장치를 제거한 동일한 프론티어 모델로, 비공개 액세스 뒤에 유지됩니다. 같은 두뇌에, 두 가지 출시 형태입니다.
이 분리가 바로 이 이야기의 핵심입니다. Anthropic 뉴스룸 발표에 따르면, Mythos 5는 실제 피해를 줄 수 있는 공격용 사이버 기술을 포함한 완전한 프론티어 성능을 유지하므로 Anthropic은 이를 모두에게 제공하지 않습니다. Fable 5는 그 동일한 모델을 가져와 고위험 요청을 감지하는 분류기를 감싸고, 이를 조용히 Opus 4.8로 라우팅합니다.
따라서 Fable 5를 호출하면 위험하지 않은 모든 것에서는 Mythos급 추론을, 위험한 소수의 부분에서는 더 안전한 폴백 모델을 얻게 됩니다. CNBC는 이를 Anthropic이 "Mythos급 AI를 대중에게 공개"한 것으로 표현했는데, 정확한 표현이지만 헤드라인보다 정확한 메커니즘이 더 중요합니다.
Fable 5와 Mythos 5는 둘로 나뉜 동일한 프론티어 모델입니다. 하나는 오늘 사용할 수 있고, 하나는 Anthropic이 비공개로 유지합니다. 네이밍에 대해 딱 하나만 기억한다면 이것을 기억하세요. Mythos급은 등급이고, Fable과 Mythos는 그 등급으로 들어가는 두 개의 문입니다.
Opus 4.x 라인 대비 달라진 점
Anthropic이 공개한 모든 코딩 및 추론 평가에서 Fable 5는 Opus 4.8을 간발의 차가 아니라 두 자릿수 격차로 넘어섭니다. SWE-Bench Pro는 69.2%에서 80.3%로 뛰어오릅니다. FrontierCode Diamond는 13.4에서 29.3으로 갑니다. 가격도 내려갔고, 모델은 새로운 추론 노력 다이얼로 스케일됩니다. 이는 Opus 4.x 라인을 넘어서는 진정한 프론티어 도약이지, 포인트 릴리스가 아닙니다.

위의 13개 벤치마크 종합은 한눈에 보는 버전입니다. 실제로 대부분의 팀이 비교하는 세 모델을 상대로 한 핵심 항목은 다음과 같습니다.
| 벤치마크 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|
| SWE-Bench Pro (에이전틱 코딩) | 80.3% | 69.2% | 58.6% |
| FrontierCode Diamond (최고난도 코딩) | 29.3 | 13.4 | 5.7 |
| Terminal-Bench 2.1 (에이전틱 셸) | 88.0% | 해당 없음 | 해당 없음 |
| GPQA-AA (대학원 수준 추론, Elo) | 1932 | 해당 없음 | 해당 없음 |
| ExploitBench | 78.0% | 해당 없음 | 해당 없음 |
여기서 비교 기준점은 Claude Opus 4.8입니다. Fable 5가 프론티어에서 대체하는 모델이자, Fable 5가 고위험 쿼리에서 폴백하는 바로 그 모델입니다. 지난 두 릴리스에 걸쳐 Opus 4.x 라인을 추적해 왔다면, 패턴은 점진적인 향상이었습니다. Fable 5는 그 패턴을 깹니다.
표를 절대적 진리로 받아들이기 전에 짚을 것이 두 가지 있습니다. 첫째, 이는 Anthropic이 자체 공개한 평가이지 독립적인 테스트가 아닙니다. 둘째, 추론 노력 다이얼 때문에 단일 벤치마크 수치 뒤에는 비용 곡선이 숨어 있습니다. 이는 계산식을 바꾸기 때문에 가격 정책 섹션에서 더 다루겠습니다.
빌더에게 중요한 벤치마크
실질적인 무게를 지닌 수치는 네 가지입니다. SWE-Bench Pro 80.3%, FrontierCode Diamond 29.3, Terminal-Bench 2.1 88.0%, 그리고 GPQA-AA 1932 Elo입니다. 이 네 가지는 함께 실제 리포지토리 작업, 가장 어려운 합성 코딩 문제, 에이전틱 셸 작업, 대학원 수준 추론을 다룹니다. 여러분의 워크로드가 이 중 하나라도 건드린다면, 이 수치가 여러분의 작업에 해당하는지 알려주는 섹션이 바로 여기입니다.
이 글 상단의 히어로 차트가 그 증거입니다. SWE-Bench Pro 80.3 대 69.2 대 58.6, 그리고 FrontierCode 29.3 대 13.4 대 5.7입니다. 그렇다면 이것들은 실제로 무엇을 측정할까요?
- SWE-Bench Pro는 모델이 실제 리포지토리에 실제 풀 리퀘스트를 제출할 수 있는지 테스트합니다. 클론, 이해, 패치, 테스트 통과까지. SWE-Bench Pro는 모델이 실제 리포지토리에 실제 풀 리퀘스트를 제출할 수 있는지를 측정하며, Fable 5는 10개 중 8개를 성공시킵니다. 이것은 "실제 내 일을 할 수 있는가"에 가장 가까운 대리지표입니다.
- Terminal-Bench 2.1은 에이전틱 셸 작업을 평가합니다. 명령 실행, 출력 읽기, 오류 복구 등. 터미널에서 동작하는 AI 코딩 에이전트를 만들고 있다면 88.0%는 중요합니다.
- FrontierCode Diamond는 코딩 문제 중 가장 어려운 등급으로, 대부분의 모델이 한 자릿수 점수를 받는 문제들입니다. 29.3은 절대적으로는 낮지만 Opus 4.8의 13.4의 두 배가 넘습니다.
- GPQA-AA는 대학원 수준의 과학 추론으로, Elo 평점으로 채점됩니다. 1932는 코드를 넘어선 강력한 다단계 추론을 시사합니다.
Opus 4.x 라인 전반에 걸친 저희 Claude Code 워크플로우에서 반복적으로 맞던 천장은 장기 에이전틱 작업이었습니다. 모델이 다중 파일 변경 중간쯤에서 맥락을 잃곤 했죠. Fable 5의 Terminal-Bench와 SWE-Bench Pro 수치는 그 천장이 움직였음을 시사합니다. 여러분의 리포지토리에서도 움직였는지가 유일한 진짜 테스트지만, 공개된 수치는 관심을 기울일 만한 올바른 종류의 수치입니다.
실제 테스트 사례: 이전 모델은 못 했던 Fable 5의 능력
Anthropic은 Fable 5가 이제 다룰 수 있게 된 문제의 종류를 보여주는 구체적인 사례 세 가지를 공개했습니다. 수개월 걸리던 Stripe 코드베이스 마이그레이션을 하루로 압축한 것, 시각만으로 완성한 비디오 게임, 그리고 자기 검증으로 이뤄낸 3배 성능 향상입니다. 각각은 이전 모델이 도달하지 못했던 능력을 가리킵니다. 세 가지 모두 Anthropic 출처이며, 저희는 그들의 발표를 인용하는 것이지 자체 테스트가 아닙니다.
각각이 증명하는 것은 다음과 같습니다.
-
Stripe Ruby 마이그레이션. Anthropic은 Fable 5가 Ruby 코드베이스 마이그레이션을 대략 두 달에서 약 하루로 압축했다고 보고합니다. Stripe는 Ruby 마이그레이션을 두 달에서 단 하루로 압축했으며, 이것이 바로 이 모델이 바꾸는 문제의 규모입니다. 이는 예전에는 인간 팀이 코드베이스 전체를 머릿속에 담고 있어야 했던 종류의 장기 리팩터링입니다.
-
시각만으로 Pokémon FireRed. Anthropic에 따르면, Fable 5는 시각만 사용해 Pokémon FireRed를 완성했는데, 이전 모델은 게임 상태를 텍스트로 주입하기 위해 복잡한 커스텀 하네스가 필요했습니다. 이는 공간 및 시각 추론의 도약입니다. 모델이 화면을 읽고 행동하며, 스캐폴딩이 필요 없습니다.
-
Slay the Spire, 3배. 최대 추론 노력에서, Anthropic은 Fable 5가 자신의 수를 자기 검증하며 지속적 메모리를 통해 3배 더 나은 성능에 도달했다고 말합니다. 핵심은 게임이 아닙니다. 모델이 긴 계획 지평에 걸쳐 자신의 작업을 점검하고 거기서 개선할 수 있다는 것입니다.
이 중 어떤 것도 여러분의 워크로드에 대해 맹신해야 할 것은 아닙니다. 하지만 이는 위 표의 벤치마크 도약과 깔끔하게 대응합니다. 장기 코딩(SWE-Bench Pro), 공간 추론(시각), 자기 검증(추론 노력 다이얼). 질적인 성과와 양적인 성과가 같은 이야기를 합니다.
가격 정책과 작업당 비용의 현실
Fable 5는 입력 토큰 100만 개당 $10, 출력 토큰 100만 개당 $50입니다. Anthropic은 이를 "Claude Mythos Preview 가격의 절반 미만"으로 표현합니다. 또한 토큰당으로는 대략 Opus 4.8의 2배입니다. 둘 다 사실입니다. 함정은 토큰 가격이 잘못된 단위라는 것입니다. 실제로 비용을 지불하는 것은 완성된 작업이며, 바로 여기서 Fable 5의 계산이 흥미로워집니다.

추론 노력은 요청별로 설정하는 다이얼입니다. 낮은 노력은 내부 추론 토큰이 적어 더 저렴하고 빠른 답변을 의미하고, 최대 노력은 모델이 더 오래 생각하며 출력 토큰을 더 쓰고 더 높은 점수를 냅니다. 위 차트는 노력이 낮음에서 최대로 스케일됨에 따라 Fable 5가 FrontierCode에서 약 11%에서 약 31%로 오르는 모습을 보여주며, Opus 4.8은 약 13%에서 정점을 찍고 GPT-5.5는 5-6% 근처에서 평평합니다. 따라서 작업당 비용은 하나의 수치가 아니라, 여러분이 그 위의 한 점을 선택하는 곡선입니다.
공개된 $10/$50 가격으로 구체적인 예를 계산해 보겠습니다. 이는 Anthropic이 게시한 요금에서 나온 산수이지 벤치마크 결과가 아닙니다.
높은 노력에서 입력 토큰 50,000개, 출력 토큰 15,000개의 단일 에이전틱 호출을 예로 들면:
Input: 50,000 / 1,000,000 × $10 = $0.50
Output: 15,000 / 1,000,000 × $50 = $0.75
Per call: $1.25실제 에이전틱 작업은 이런 호출을 여러 개 연결합니다. 리포지토리 읽기, 계획, 편집, 테스트 실행, 수정, 반복. 그 루프가 이런 형태로 12회 호출을 실행한다고 하면, 완성된 작업에 대략 $15입니다. 더 무거운 컨텍스트의 최대 추론 노력에서는, Anthropic의 자체 비용 곡선이 어려운 FrontierCode 작업을 작업당 $20 범위에 가깝게 놓습니다. 같은 작업을 GPT-5.5에서 실행하면 토큰당 비용은 덜 냅니다. 하지만 어떤 노력 수준에서도 작업을 끝내지 못한다면, 완성된 작업당 비용은 무한대입니다. Fable 5는 GPT-5.5보다 토큰당 비용이 더 들면서도, GPT-5.5가 할 수 없는 작업을 완성하기 때문에 완성된 작업당 비용에서는 이깁니다.
최소 호출 예시입니다. Anthropic 발표는 모델 id로 claude-fable-5를 제시합니다. 날짜가 붙은 별칭이 때로 다를 수 있으므로, 배포 전에 정확한 버전 문자열을 Anthropic API 문서에서 확인하세요.
import anthropic
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-fable-5", # verify exact dated id in API docs
max_tokens=4096,
thinking={"type": "enabled", "budget_tokens": 8000}, # reasoning effort
messages=[
{"role": "user", "content": "Migrate this module from Ruby 2.7 to 3.3 and run the tests."}
],
)
print(message.content)경제학적 논지를 한 줄로 요약하면, GPT-5.5보다 토큰당 더 내지만, GPT-5.5가 어떤 가격으로도 끝내지 못하는 작업을 완성합니다. 저위험 대량 작업에서는 그 계산이 더 저렴한 모델에 유리합니다. 어려운 에이전틱 코딩에서는 Fable 5에 유리합니다.
안전장치 분리: Fable이 Opus 4.8로 폴백하는 이유
Fable 5는 모든 요청에 분류기를 실행합니다. 고위험 쿼리(공격용 사이버, 바이오, 화학, 또는 모델 증류 시도)를 감지하면, 완전한 Mythos급 성능으로 답변하는 대신 Opus 4.8로 폴백합니다. Anthropic은 이 폴백이 세션의 5% 미만에서 발동한다고 밝혀, 대부분의 사용자는 이를 전혀 발동하지 않습니다. 요점은 일상 작업은 손대지 않으면서 위험한 성능은 게이트 뒤에 두는 것입니다.

더 어려운 수치는 공격 성공률입니다. 자동화 공격자가 모델을 속겨 해서는 안 될 일을 시키는 빈도입니다. 낮을수록 좋습니다. Anthropic의 레드팀 결과는 릴리스를 거듭할수록 급격한 하락을 보여줍니다. Opus 4.6의 83.2%에서, Opus 4.7의 72.7%, Opus 4.8의 56.6%를 거쳐 **Fable 5는 5.4%**까지 내려갑니다. 자동화 레드팀에서 Fable 5에 대한 공격은 단 5.4%만 성공했으며, Opus 4.8의 56.6%에서 내려왔습니다.
왜 신경 써야 할까요? 도구 액세스(셸, 파일 시스템, 네트워크)가 있는 에이전트를 배포한다면, 제일브레이크는 나쁜 채팅 답변이 아니라 공격자가 조종한 실제 명령을 모델이 실행하는 것입니다. 공격 성공률 5.4%는 무기화시키기가 Opus 4.8보다 대략 10배 더 어렵다는 뜻입니다. IT Pro의 보도가 정확히 이 이유 때문에 폴백 메커니즘을 헤드라인으로 올렸습니다. 이것이 프론티어 모델을 대중에게 넘겨도 될 만큼 안전하게 만드는 기능이기 때문입니다.
트레이드오프는 지연 시간입니다. 워크플로우가 정당하게 보안 도구를 건드린다면, 폴백이 작업 중간에 발동해 모델을 교체할 수 있으므로 이를 염두에 두고 계획해야 합니다.
Claude Mythos 5와 이중 용도의 문제
Claude Mythos 5는 비공개 형제 모델로, 안전장치 폴백이 없는 동일한 모델입니다. Fable 5가 차단하는 공격용 사이버 성능을 유지하며, 이것이 바로 Anthropic이 이를 공개적으로 출시하지 않는 이유입니다. 액세스는 Project Glasswing을 통해 이루어지며, 완전한 성능이 필요한 방어자와 연구자를 위한 검증된 프로그램입니다. 같은 모델, 두 가지 출시 형태. 하나는 공개, 하나는 비공개.

차트는 비공개를 시각화합니다. 공격용 사이버 평가(Firefox, OSS-Fuzz, CyberGym, CyScenarioBench)에서 Mythos 5는 88.4, 24.0, 83.8, 38.7을 기록합니다. Fable 5는 네 항목 모두에서 평평하게 0.0을 반환합니다. 공격용 사이버 평가에서 Mythos 5는 Fable 5가 평평하게 0.0을 반환하는 곳에서 최대 88.4를 기록합니다. 안전장치 분리가 시각화된 것입니다.
그 0은 성능 격차가 아닙니다. 매번 폴백이 발동해, Mythos급 모델이 답변하기 전에 요청을 차단하는 것입니다. TechCrunch는 시점을 지적했습니다. Anthropic은 AI가 공개적으로 출시하기에 너무 위험해지고 있다고 경고한 지 며칠 만에 이를 출시했습니다. Fable/Mythos 분리는 그 경고에 대한 정책적 답변입니다. 성능은 공개하고, 위험은 비공개로 두는 것이죠.
대부분의 개발자에게 Mythos 5는 무관합니다. Project Glasswing 자격을 얻을 일은 없으며 그럴 필요도 없습니다. 중요한 것은 여러분이 호출하는 모델이 설계상 의도적으로 좁은 범위의 작업에서 제한된다는 사실을 아는 것입니다.
이것이 의미하는 것: 갈아타야 할까?
어려운 에이전틱 코딩, 장기 다단계 작업, 시각 또는 공간 추론에는 Fable 5로 갈아타세요. 작업을 끝내는 것이 토큰당 몇 푼 아끼는 것보다 중요한 모든 곳에 해당합니다. 비용에 민감한 대량 작업, 또는 어차피 폴백을 발동시키는 작업에는 Opus 4.8에 머무르세요. 이것이 프레임워크의 전부입니다. 나머지는 여러분의 워크로드를 그 올바른 쪽에 맞추는 것입니다.
Fable 5가 이기는 경우:
- Opus 4.8이 멈추는 어려운 에이전틱 코딩. SWE-Bench Pro 격차는 실재합니다
- 자기 검증이 효과를 발휘하는 장기 작업(다중 파일 리팩터링, 마이그레이션)
- 시각 및 공간 추론 워크로드
- 완성된 작업 하나가 토큰 프리미엄보다 가치 있는 모든 작업
Opus 4.8이 여전히 이기는 경우:
- 토큰당 가격이 지배적인 대량·비용 민감 작업
- 사이버/바이오/화학 워크로드. Fable 5가 어차피 Opus 4.8로 폴백하므로 직접 호출하세요
- 작업 중간 모델 교체를 허용할 수 없는 지연 시간 민감 플로우
| 사용 사례 | 권장 모델 |
|---|---|
| 어려운 에이전틱 코딩 / 마이그레이션 | Claude Fable 5 |
| 시각 / 공간 추론 | Claude Fable 5 |
| 대량 저비용 분류 | Claude Opus 4.8 |
| 보안 / 레드팀 도구 | Claude Opus 4.8 (직접) |
가용성에 대해: Fable 5는 2026년 6월 22일까지 Pro/Max/Team/Enterprise 요금제에서 무료이며, 6월 23일부터 사용량 크레딧이 적용됩니다. API, AWS Bedrock, GitHub Copilot(GitHub 변경 로그 기준), 그리고 Harvey에서 일반 사용 가능합니다. 따라서 청구 방식을 바꾸지 않고도 오늘 에디터에서 전환을 테스트할 수 있습니다.
저자 소개
Mert Batur Gurbuz는 Techsy.io의 공동 창업자로, 팀은 B2B 클라이언트를 위한 AI 에이전트, 자동화 시스템, 음성/SDR 파이프라인을 구축합니다. University of Birmingham에서 공부하며, Techsy 팀이 실제 프로덕션에서 사용하는 LLM 도구 스택에 대해 글을 씁니다. LinkedIn에서 연결하세요.
공동 창업자, Techsy.io · University of Birmingham
자주 묻는 질문
Claude Fable 5란 무엇인가요?
Claude Fable 5는 Anthropic의 첫 공개 Mythos급 모델로, 2026년 6월 9일에 출시되었습니다. SWE-Bench Pro에서 80.3%를 기록하며, 고위험 쿼리에서 Opus 4.8로 폴백하는 안전장치 분류기를 실행합니다. 토큰 100만 개당 입력 $10 / 출력 $50입니다.
Fable 5와 Mythos 5의 차이점은 무엇인가요?
동일한 프론티어 모델에 출시 형태가 다릅니다. Fable 5는 공개되고 안전장치가 적용되어 위험한 쿼리에서 Opus 4.8로 폴백합니다. Mythos 5는 비공개 완전 성능 버전으로, 검증된 방어자와 연구자를 위한 Anthropic의 Project Glasswing 프로그램으로만 접근할 수 있습니다.
Claude Fable 5는 정말 Opus 4.8보다 나은가요?
어려운 에이전틱 코딩, 시각, 공간 추론에서는 그렇습니다. Fable 5는 SWE-Bench Pro에서 80.3%로 Opus 4.8의 69.2%를 앞섭니다. 하지만 Opus 4.8은 여전히 비용 민감 대량 작업에서 이기며, Fable 5는 어차피 고위험 사이버/바이오/화학 주제에서 Opus 4.8로 폴백합니다. "더 나은" 여부는 워크로드에 달렸습니다.
Claude Fable 5의 비용은 얼마인가요?
Claude Fable 5는 입력 토큰 100만 개당 $10, 출력 토큰 100만 개당 $50입니다. Anthropic의 표현은 "Mythos Preview 가격의 절반 미만"입니다. 토큰당으로는 대략 Opus 4.8의 2배지만, 가치 논리는 완성된 작업당 기준입니다. Fable 5가 더 저렴한 모델이 할 수 없는 작업을 완성하기 때문입니다.
"Mythos급" 모델이란 무엇인가요?
Mythos급은 Anthropic의 새로운 최상위 성능 등급으로, Fable 5와 Mythos 5와 함께 출시되었습니다. 코딩 및 추론 벤치마크에서 Opus 4.x 라인을 넘어서는 프론티어 도약을 나타냅니다. Fable 5와 Mythos 5는 동일한 Mythos급 모델의 두 출시 버전입니다. 하나는 공개·안전장치 적용, 하나는 비공개입니다.
Fable 5는 왜 Opus 4.8로 폴백하나요?
Fable 5는 고위험 요청(공격용 사이버, 바이오, 화학, 또는 모델 증류)을 감지하는 분류기를 실행하고, 완전한 Mythos급 성능으로 답변하는 대신 이를 Opus 4.8로 라우팅합니다. 이는 세션의 5% 미만에서 발동합니다. 적대적 공격 성공률을 56.6%(Opus 4.8)에서 5.4%로 낮췄습니다.
Claude Mythos 5에 접근할 수 있나요?
아마도 어렵습니다. Mythos 5는 Project Glasswing 뒤에 비공개되어 있으며, Fable 5가 차단하는 완전한 공격용 사이버 성능이 필요한 방어자와 보안 연구자를 위한 Anthropic의 검증된 액세스 프로그램입니다. 대부분의 개발자는 자격이 되지 않으며 그럴 필요도 없습니다. Fable 5가 일상적인 에이전틱 및 코딩 작업을 다루기 때문입니다.
어디서 Claude Fable 5를 사용할 수 있나요?
Claude Fable 5는 Anthropic API, AWS Bedrock, GitHub Copilot, Harvey에서 일반 사용 가능합니다. 2026년 6월 22일까지 Pro, Max, Team, 시트 기반 Enterprise 요금제에서 무료이며, 6월 23일부터 사용량 크레딧이 적용됩니다. 오늘 에디터에서 또는 API로 테스트할 수 있습니다.
결론
Claude Fable 5는 Opus 4.8을 넘어서는 진정한 프론티어 도약입니다. SWE-Bench Pro에서 80.3% 대 69.2%, FrontierCode 점수 두 배, 그리고 도구와 함께 배포하기에 훨씬 안전한 공격 성공률 5.4%입니다. 어려운 에이전틱 코딩, 장기 작업, 시각 작업에는 갈아타세요. 비용 민감 대량 작업이나 어차피 폴백을 발동시키는 작업에는 Opus 4.8에 머무르세요. 6월 22일까지 무료이니 비용 부담 없이 전환을 테스트할 수 있습니다. Techsy 팀은 바로 이 스택으로 프로덕션 에이전트를 구축하므로, 도움이 필요하면 연락하세요.