Techsy
문의하기
시작하기
블로그로 돌아가기
ai-machine-learning

Claude Fable 5 vs Opus 4.8: 정말 갈아타야 할까? (Mythos급, 벤치마크 분석)

작성자 Mert Batur Gürbüz
Jun 9, 2026
12 분 읽기
목차
Claude Fable 5 vs Opus 4.8: 정말 갈아타야 할까? (Mythos급, 벤치마크 분석)

Claude Fable 5 vs Opus 4.8: 정말 갈아타야 할까? (Mythos급, 벤치마크 분석)

Anthropic이 오늘, 2026년 6월 9일에 Claude Fable 5를 출시했습니다. **SWE-Bench Pro에서 80.3%**를 기록했는데, 이는 에이전틱 코딩 벤치마크로 Opus 4.8이 69.2%, GPT-5.5가 58.6%에 머무는 성적입니다. 반올림 오차 수준의 차이가 아닙니다. 그리고 반전이 하나 있습니다. Fable 5는 새로운 "Mythos급" 모델의 공개된, 안전장치가 적용된 절반이며, 제한된 액세스 프로그램 뒤에 Claude Mythos 5라는 비공개 형제 모델이 있습니다. 무엇이 바뀌었는지, 토큰 100만 개당 $10/$50에서 실제 작업 비용은 얼마인지, 그리고 정말 Opus 4.8에서 스택을 옮겨야 하는지 살펴봅니다.

빠른 답변

  • Fable 5는 SWE-Bench Pro에서 80.3%를 기록해 Opus 4.8의 69.2%, GPT-5.5의 58.6%를 앞섭니다.
  • 가격 책정은 토큰 100만 개당 입력 $10 / 출력 $50으로, Mythos Preview의 절반도 안 됩니다.
  • Fable 5는 고위험 사이버/바이오/화학 쿼리에 대해 자동으로 Opus 4.8로 폴백합니다(세션의 5% 미만).
  • 2026년 6월 22일까지 Pro/Max/Team/Enterprise 요금제에서 무료이며, 6월 23일부터 사용량 크레딧이 적용됩니다.

실제로 출시된 것: Fable 5, Mythos 5, 그리고 "Mythos급" 라인

Mythos급은 Anthropic의 새로운 최상위 성능 등급이며, 두 개의 모델로 출시됩니다. Claude Fable 5는 오늘 바로 호출할 수 있는 공개된 안전장치 적용 버전입니다. Claude Mythos 5는 안전장치를 제거한 동일한 프론티어 모델로, 비공개 액세스 뒤에 유지됩니다. 같은 두뇌에, 두 가지 출시 형태입니다.

이 분리가 바로 이 이야기의 핵심입니다. Anthropic 뉴스룸 발표에 따르면, Mythos 5는 실제 피해를 줄 수 있는 공격용 사이버 기술을 포함한 완전한 프론티어 성능을 유지하므로 Anthropic은 이를 모두에게 제공하지 않습니다. Fable 5는 그 동일한 모델을 가져와 고위험 요청을 감지하는 분류기를 감싸고, 이를 조용히 Opus 4.8로 라우팅합니다.

따라서 Fable 5를 호출하면 위험하지 않은 모든 것에서는 Mythos급 추론을, 위험한 소수의 부분에서는 더 안전한 폴백 모델을 얻게 됩니다. CNBC는 이를 Anthropic이 "Mythos급 AI를 대중에게 공개"한 것으로 표현했는데, 정확한 표현이지만 헤드라인보다 정확한 메커니즘이 더 중요합니다.

Fable 5와 Mythos 5는 둘로 나뉜 동일한 프론티어 모델입니다. 하나는 오늘 사용할 수 있고, 하나는 Anthropic이 비공개로 유지합니다. 네이밍에 대해 딱 하나만 기억한다면 이것을 기억하세요. Mythos급은 등급이고, Fable과 Mythos는 그 등급으로 들어가는 두 개의 문입니다.

Opus 4.x 라인 대비 달라진 점

Anthropic이 공개한 모든 코딩 및 추론 평가에서 Fable 5는 Opus 4.8을 간발의 차가 아니라 두 자릿수 격차로 넘어섭니다. SWE-Bench Pro는 69.2%에서 80.3%로 뛰어오릅니다. FrontierCode Diamond는 13.4에서 29.3으로 갑니다. 가격도 내려갔고, 모델은 새로운 추론 노력 다이얼로 스케일됩니다. 이는 Opus 4.x 라인을 넘어서는 진정한 프론티어 도약이지, 포인트 릴리스가 아닙니다.

Mythos Preview, Opus 4.8, GPT-5.5, Gemini 3.1 Pro와 비교한 Claude Mythos 5 / Fable 5 벤치마크 표(13개 평가)
13개 벤치마크에서 Opus 4.8, GPT-5.5, Gemini 3.1 Pro와 비교한 Claude Mythos 5 / Fable 5. 출처: Anthropic.

위의 13개 벤치마크 종합은 한눈에 보는 버전입니다. 실제로 대부분의 팀이 비교하는 세 모델을 상대로 한 핵심 항목은 다음과 같습니다.

벤치마크Claude Fable 5Claude Opus 4.8GPT-5.5
SWE-Bench Pro (에이전틱 코딩)80.3%69.2%58.6%
FrontierCode Diamond (최고난도 코딩)29.313.45.7
Terminal-Bench 2.1 (에이전틱 셸)88.0%해당 없음해당 없음
GPQA-AA (대학원 수준 추론, Elo)1932해당 없음해당 없음
ExploitBench78.0%해당 없음해당 없음

여기서 비교 기준점은 Claude Opus 4.8입니다. Fable 5가 프론티어에서 대체하는 모델이자, Fable 5가 고위험 쿼리에서 폴백하는 바로 그 모델입니다. 지난 두 릴리스에 걸쳐 Opus 4.x 라인을 추적해 왔다면, 패턴은 점진적인 향상이었습니다. Fable 5는 그 패턴을 깹니다.

표를 절대적 진리로 받아들이기 전에 짚을 것이 두 가지 있습니다. 첫째, 이는 Anthropic이 자체 공개한 평가이지 독립적인 테스트가 아닙니다. 둘째, 추론 노력 다이얼 때문에 단일 벤치마크 수치 뒤에는 비용 곡선이 숨어 있습니다. 이는 계산식을 바꾸기 때문에 가격 정책 섹션에서 더 다루겠습니다.

빌더에게 중요한 벤치마크

실질적인 무게를 지닌 수치는 네 가지입니다. SWE-Bench Pro 80.3%, FrontierCode Diamond 29.3, Terminal-Bench 2.1 88.0%, 그리고 GPQA-AA 1932 Elo입니다. 이 네 가지는 함께 실제 리포지토리 작업, 가장 어려운 합성 코딩 문제, 에이전틱 셸 작업, 대학원 수준 추론을 다룹니다. 여러분의 워크로드가 이 중 하나라도 건드린다면, 이 수치가 여러분의 작업에 해당하는지 알려주는 섹션이 바로 여기입니다.

이 글 상단의 히어로 차트가 그 증거입니다. SWE-Bench Pro 80.3 대 69.2 대 58.6, 그리고 FrontierCode 29.3 대 13.4 대 5.7입니다. 그렇다면 이것들은 실제로 무엇을 측정할까요?

  • SWE-Bench Pro는 모델이 실제 리포지토리에 실제 풀 리퀘스트를 제출할 수 있는지 테스트합니다. 클론, 이해, 패치, 테스트 통과까지. SWE-Bench Pro는 모델이 실제 리포지토리에 실제 풀 리퀘스트를 제출할 수 있는지를 측정하며, Fable 5는 10개 중 8개를 성공시킵니다. 이것은 "실제 내 일을 할 수 있는가"에 가장 가까운 대리지표입니다.
  • Terminal-Bench 2.1은 에이전틱 셸 작업을 평가합니다. 명령 실행, 출력 읽기, 오류 복구 등. 터미널에서 동작하는 AI 코딩 에이전트를 만들고 있다면 88.0%는 중요합니다.
  • FrontierCode Diamond는 코딩 문제 중 가장 어려운 등급으로, 대부분의 모델이 한 자릿수 점수를 받는 문제들입니다. 29.3은 절대적으로는 낮지만 Opus 4.8의 13.4의 두 배가 넘습니다.
  • GPQA-AA는 대학원 수준의 과학 추론으로, Elo 평점으로 채점됩니다. 1932는 코드를 넘어선 강력한 다단계 추론을 시사합니다.

Opus 4.x 라인 전반에 걸친 저희 Claude Code 워크플로우에서 반복적으로 맞던 천장은 장기 에이전틱 작업이었습니다. 모델이 다중 파일 변경 중간쯤에서 맥락을 잃곤 했죠. Fable 5의 Terminal-Bench와 SWE-Bench Pro 수치는 그 천장이 움직였음을 시사합니다. 여러분의 리포지토리에서도 움직였는지가 유일한 진짜 테스트지만, 공개된 수치는 관심을 기울일 만한 올바른 종류의 수치입니다.

실제 테스트 사례: 이전 모델은 못 했던 Fable 5의 능력

Anthropic은 Fable 5가 이제 다룰 수 있게 된 문제의 종류를 보여주는 구체적인 사례 세 가지를 공개했습니다. 수개월 걸리던 Stripe 코드베이스 마이그레이션을 하루로 압축한 것, 시각만으로 완성한 비디오 게임, 그리고 자기 검증으로 이뤄낸 3배 성능 향상입니다. 각각은 이전 모델이 도달하지 못했던 능력을 가리킵니다. 세 가지 모두 Anthropic 출처이며, 저희는 그들의 발표를 인용하는 것이지 자체 테스트가 아닙니다.

각각이 증명하는 것은 다음과 같습니다.

  1. Stripe Ruby 마이그레이션. Anthropic은 Fable 5가 Ruby 코드베이스 마이그레이션을 대략 두 달에서 약 하루로 압축했다고 보고합니다. Stripe는 Ruby 마이그레이션을 두 달에서 단 하루로 압축했으며, 이것이 바로 이 모델이 바꾸는 문제의 규모입니다. 이는 예전에는 인간 팀이 코드베이스 전체를 머릿속에 담고 있어야 했던 종류의 장기 리팩터링입니다.

  2. 시각만으로 Pokémon FireRed. Anthropic에 따르면, Fable 5는 시각만 사용해 Pokémon FireRed를 완성했는데, 이전 모델은 게임 상태를 텍스트로 주입하기 위해 복잡한 커스텀 하네스가 필요했습니다. 이는 공간 및 시각 추론의 도약입니다. 모델이 화면을 읽고 행동하며, 스캐폴딩이 필요 없습니다.

  3. Slay the Spire, 3배. 최대 추론 노력에서, Anthropic은 Fable 5가 자신의 수를 자기 검증하며 지속적 메모리를 통해 3배 더 나은 성능에 도달했다고 말합니다. 핵심은 게임이 아닙니다. 모델이 긴 계획 지평에 걸쳐 자신의 작업을 점검하고 거기서 개선할 수 있다는 것입니다.

이 중 어떤 것도 여러분의 워크로드에 대해 맹신해야 할 것은 아닙니다. 하지만 이는 위 표의 벤치마크 도약과 깔끔하게 대응합니다. 장기 코딩(SWE-Bench Pro), 공간 추론(시각), 자기 검증(추론 노력 다이얼). 질적인 성과와 양적인 성과가 같은 이야기를 합니다.

가격 정책과 작업당 비용의 현실

Fable 5는 입력 토큰 100만 개당 $10, 출력 토큰 100만 개당 $50입니다. Anthropic은 이를 "Claude Mythos Preview 가격의 절반 미만"으로 표현합니다. 또한 토큰당으로는 대략 Opus 4.8의 2배입니다. 둘 다 사실입니다. 함정은 토큰 가격이 잘못된 단위라는 것입니다. 실제로 비용을 지불하는 것은 완성된 작업이며, 바로 여기서 Fable 5의 계산이 흥미로워집니다.

작업당 비용 대비 FrontierCode 정확도 — Claude Fable 5는 낮은 추론 노력에서 최대까지 스케일하며 Opus 4.8과 GPT-5.5를 앞섬
추론 노력이 낮음→최대로 스케일함에 따른 FrontierCode 점수 대 평균 작업당 비용. 출처: Anthropic.

추론 노력은 요청별로 설정하는 다이얼입니다. 낮은 노력은 내부 추론 토큰이 적어 더 저렴하고 빠른 답변을 의미하고, 최대 노력은 모델이 더 오래 생각하며 출력 토큰을 더 쓰고 더 높은 점수를 냅니다. 위 차트는 노력이 낮음에서 최대로 스케일됨에 따라 Fable 5가 FrontierCode에서 약 11%에서 약 31%로 오르는 모습을 보여주며, Opus 4.8은 약 13%에서 정점을 찍고 GPT-5.5는 5-6% 근처에서 평평합니다. 따라서 작업당 비용은 하나의 수치가 아니라, 여러분이 그 위의 한 점을 선택하는 곡선입니다.

공개된 $10/$50 가격으로 구체적인 예를 계산해 보겠습니다. 이는 Anthropic이 게시한 요금에서 나온 산수이지 벤치마크 결과가 아닙니다.

높은 노력에서 입력 토큰 50,000개, 출력 토큰 15,000개의 단일 에이전틱 호출을 예로 들면:

text
Input:  50,000 / 1,000,000 × $10 = $0.50
Output: 15,000 / 1,000,000 × $50 = $0.75
Per call:                          $1.25

실제 에이전틱 작업은 이런 호출을 여러 개 연결합니다. 리포지토리 읽기, 계획, 편집, 테스트 실행, 수정, 반복. 그 루프가 이런 형태로 12회 호출을 실행한다고 하면, 완성된 작업에 대략 $15입니다. 더 무거운 컨텍스트의 최대 추론 노력에서는, Anthropic의 자체 비용 곡선이 어려운 FrontierCode 작업을 작업당 $20 범위에 가깝게 놓습니다. 같은 작업을 GPT-5.5에서 실행하면 토큰당 비용은 덜 냅니다. 하지만 어떤 노력 수준에서도 작업을 끝내지 못한다면, 완성된 작업당 비용은 무한대입니다. Fable 5는 GPT-5.5보다 토큰당 비용이 더 들면서도, GPT-5.5가 할 수 없는 작업을 완성하기 때문에 완성된 작업당 비용에서는 이깁니다.

최소 호출 예시입니다. Anthropic 발표는 모델 id로 claude-fable-5를 제시합니다. 날짜가 붙은 별칭이 때로 다를 수 있으므로, 배포 전에 정확한 버전 문자열을 Anthropic API 문서에서 확인하세요.

python
import anthropic

client = anthropic.Anthropic()

message = client.messages.create(
    model="claude-fable-5",          # verify exact dated id in API docs
    max_tokens=4096,
    thinking={"type": "enabled", "budget_tokens": 8000},  # reasoning effort
    messages=[
        {"role": "user", "content": "Migrate this module from Ruby 2.7 to 3.3 and run the tests."}
    ],
)

print(message.content)

경제학적 논지를 한 줄로 요약하면, GPT-5.5보다 토큰당 더 내지만, GPT-5.5가 어떤 가격으로도 끝내지 못하는 작업을 완성합니다. 저위험 대량 작업에서는 그 계산이 더 저렴한 모델에 유리합니다. 어려운 에이전틱 코딩에서는 Fable 5에 유리합니다.

안전장치 분리: Fable이 Opus 4.8로 폴백하는 이유

Fable 5는 모든 요청에 분류기를 실행합니다. 고위험 쿼리(공격용 사이버, 바이오, 화학, 또는 모델 증류 시도)를 감지하면, 완전한 Mythos급 성능으로 답변하는 대신 Opus 4.8로 폴백합니다. Anthropic은 이 폴백이 세션의 5% 미만에서 발동한다고 밝혀, 대부분의 사용자는 이를 전혀 발동하지 않습니다. 요점은 일상 작업은 손대지 않으면서 위험한 성능은 게이트 뒤에 두는 것입니다.

사이버 대항 견고성 — 자동화 레드팀에서 Claude Fable 5 공격 성공률 5.4%, Opus 4.8은 56.6%
자동화 레드팀에서의 공격 성공률(낮을수록 좋음): Fable 5 5.4% 대 Opus 4.8 56.6%. 출처: Anthropic.

더 어려운 수치는 공격 성공률입니다. 자동화 공격자가 모델을 속겨 해서는 안 될 일을 시키는 빈도입니다. 낮을수록 좋습니다. Anthropic의 레드팀 결과는 릴리스를 거듭할수록 급격한 하락을 보여줍니다. Opus 4.6의 83.2%에서, Opus 4.7의 72.7%, Opus 4.8의 56.6%를 거쳐 **Fable 5는 5.4%**까지 내려갑니다. 자동화 레드팀에서 Fable 5에 대한 공격은 단 5.4%만 성공했으며, Opus 4.8의 56.6%에서 내려왔습니다.

왜 신경 써야 할까요? 도구 액세스(셸, 파일 시스템, 네트워크)가 있는 에이전트를 배포한다면, 제일브레이크는 나쁜 채팅 답변이 아니라 공격자가 조종한 실제 명령을 모델이 실행하는 것입니다. 공격 성공률 5.4%는 무기화시키기가 Opus 4.8보다 대략 10배 더 어렵다는 뜻입니다. IT Pro의 보도가 정확히 이 이유 때문에 폴백 메커니즘을 헤드라인으로 올렸습니다. 이것이 프론티어 모델을 대중에게 넘겨도 될 만큼 안전하게 만드는 기능이기 때문입니다.

트레이드오프는 지연 시간입니다. 워크플로우가 정당하게 보안 도구를 건드린다면, 폴백이 작업 중간에 발동해 모델을 교체할 수 있으므로 이를 염두에 두고 계획해야 합니다.

Claude Mythos 5와 이중 용도의 문제

Claude Mythos 5는 비공개 형제 모델로, 안전장치 폴백이 없는 동일한 모델입니다. Fable 5가 차단하는 공격용 사이버 성능을 유지하며, 이것이 바로 Anthropic이 이를 공개적으로 출시하지 않는 이유입니다. 액세스는 Project Glasswing을 통해 이루어지며, 완전한 성능이 필요한 방어자와 연구자를 위한 검증된 프로그램입니다. 같은 모델, 두 가지 출시 형태. 하나는 공개, 하나는 비공개.

공격용 사이버 평가 결과 — Claude Mythos 5 고성능, Claude Fable은 안전장치 발동 지점에서 0.0 반환
공격용 사이버 평가: Mythos 5는 성능 유지, Fable은 차단 안전장치가 발동하는 곳에서 0.0 반환. 출처: Anthropic.

차트는 비공개를 시각화합니다. 공격용 사이버 평가(Firefox, OSS-Fuzz, CyberGym, CyScenarioBench)에서 Mythos 5는 88.4, 24.0, 83.8, 38.7을 기록합니다. Fable 5는 네 항목 모두에서 평평하게 0.0을 반환합니다. 공격용 사이버 평가에서 Mythos 5는 Fable 5가 평평하게 0.0을 반환하는 곳에서 최대 88.4를 기록합니다. 안전장치 분리가 시각화된 것입니다.

그 0은 성능 격차가 아닙니다. 매번 폴백이 발동해, Mythos급 모델이 답변하기 전에 요청을 차단하는 것입니다. TechCrunch는 시점을 지적했습니다. Anthropic은 AI가 공개적으로 출시하기에 너무 위험해지고 있다고 경고한 지 며칠 만에 이를 출시했습니다. Fable/Mythos 분리는 그 경고에 대한 정책적 답변입니다. 성능은 공개하고, 위험은 비공개로 두는 것이죠.

대부분의 개발자에게 Mythos 5는 무관합니다. Project Glasswing 자격을 얻을 일은 없으며 그럴 필요도 없습니다. 중요한 것은 여러분이 호출하는 모델이 설계상 의도적으로 좁은 범위의 작업에서 제한된다는 사실을 아는 것입니다.

이것이 의미하는 것: 갈아타야 할까?

어려운 에이전틱 코딩, 장기 다단계 작업, 시각 또는 공간 추론에는 Fable 5로 갈아타세요. 작업을 끝내는 것이 토큰당 몇 푼 아끼는 것보다 중요한 모든 곳에 해당합니다. 비용에 민감한 대량 작업, 또는 어차피 폴백을 발동시키는 작업에는 Opus 4.8에 머무르세요. 이것이 프레임워크의 전부입니다. 나머지는 여러분의 워크로드를 그 올바른 쪽에 맞추는 것입니다.

Fable 5가 이기는 경우:

  • Opus 4.8이 멈추는 어려운 에이전틱 코딩. SWE-Bench Pro 격차는 실재합니다
  • 자기 검증이 효과를 발휘하는 장기 작업(다중 파일 리팩터링, 마이그레이션)
  • 시각 및 공간 추론 워크로드
  • 완성된 작업 하나가 토큰 프리미엄보다 가치 있는 모든 작업

Opus 4.8이 여전히 이기는 경우:

  • 토큰당 가격이 지배적인 대량·비용 민감 작업
  • 사이버/바이오/화학 워크로드. Fable 5가 어차피 Opus 4.8로 폴백하므로 직접 호출하세요
  • 작업 중간 모델 교체를 허용할 수 없는 지연 시간 민감 플로우
사용 사례권장 모델
어려운 에이전틱 코딩 / 마이그레이션Claude Fable 5
시각 / 공간 추론Claude Fable 5
대량 저비용 분류Claude Opus 4.8
보안 / 레드팀 도구Claude Opus 4.8 (직접)

가용성에 대해: Fable 5는 2026년 6월 22일까지 Pro/Max/Team/Enterprise 요금제에서 무료이며, 6월 23일부터 사용량 크레딧이 적용됩니다. API, AWS Bedrock, GitHub Copilot(GitHub 변경 로그 기준), 그리고 Harvey에서 일반 사용 가능합니다. 따라서 청구 방식을 바꾸지 않고도 오늘 에디터에서 전환을 테스트할 수 있습니다.

저자 소개

Mert Batur Gurbuz는 Techsy.io의 공동 창업자로, 팀은 B2B 클라이언트를 위한 AI 에이전트, 자동화 시스템, 음성/SDR 파이프라인을 구축합니다. University of Birmingham에서 공부하며, Techsy 팀이 실제 프로덕션에서 사용하는 LLM 도구 스택에 대해 글을 씁니다. LinkedIn에서 연결하세요.

공동 창업자, Techsy.io · University of Birmingham

자주 묻는 질문

Claude Fable 5란 무엇인가요?

Claude Fable 5는 Anthropic의 첫 공개 Mythos급 모델로, 2026년 6월 9일에 출시되었습니다. SWE-Bench Pro에서 80.3%를 기록하며, 고위험 쿼리에서 Opus 4.8로 폴백하는 안전장치 분류기를 실행합니다. 토큰 100만 개당 입력 $10 / 출력 $50입니다.

Fable 5와 Mythos 5의 차이점은 무엇인가요?

동일한 프론티어 모델에 출시 형태가 다릅니다. Fable 5는 공개되고 안전장치가 적용되어 위험한 쿼리에서 Opus 4.8로 폴백합니다. Mythos 5는 비공개 완전 성능 버전으로, 검증된 방어자와 연구자를 위한 Anthropic의 Project Glasswing 프로그램으로만 접근할 수 있습니다.

Claude Fable 5는 정말 Opus 4.8보다 나은가요?

어려운 에이전틱 코딩, 시각, 공간 추론에서는 그렇습니다. Fable 5는 SWE-Bench Pro에서 80.3%로 Opus 4.8의 69.2%를 앞섭니다. 하지만 Opus 4.8은 여전히 비용 민감 대량 작업에서 이기며, Fable 5는 어차피 고위험 사이버/바이오/화학 주제에서 Opus 4.8로 폴백합니다. "더 나은" 여부는 워크로드에 달렸습니다.

Claude Fable 5의 비용은 얼마인가요?

Claude Fable 5는 입력 토큰 100만 개당 $10, 출력 토큰 100만 개당 $50입니다. Anthropic의 표현은 "Mythos Preview 가격의 절반 미만"입니다. 토큰당으로는 대략 Opus 4.8의 2배지만, 가치 논리는 완성된 작업당 기준입니다. Fable 5가 더 저렴한 모델이 할 수 없는 작업을 완성하기 때문입니다.

"Mythos급" 모델이란 무엇인가요?

Mythos급은 Anthropic의 새로운 최상위 성능 등급으로, Fable 5와 Mythos 5와 함께 출시되었습니다. 코딩 및 추론 벤치마크에서 Opus 4.x 라인을 넘어서는 프론티어 도약을 나타냅니다. Fable 5와 Mythos 5는 동일한 Mythos급 모델의 두 출시 버전입니다. 하나는 공개·안전장치 적용, 하나는 비공개입니다.

Fable 5는 왜 Opus 4.8로 폴백하나요?

Fable 5는 고위험 요청(공격용 사이버, 바이오, 화학, 또는 모델 증류)을 감지하는 분류기를 실행하고, 완전한 Mythos급 성능으로 답변하는 대신 이를 Opus 4.8로 라우팅합니다. 이는 세션의 5% 미만에서 발동합니다. 적대적 공격 성공률을 56.6%(Opus 4.8)에서 5.4%로 낮췄습니다.

Claude Mythos 5에 접근할 수 있나요?

아마도 어렵습니다. Mythos 5는 Project Glasswing 뒤에 비공개되어 있으며, Fable 5가 차단하는 완전한 공격용 사이버 성능이 필요한 방어자와 보안 연구자를 위한 Anthropic의 검증된 액세스 프로그램입니다. 대부분의 개발자는 자격이 되지 않으며 그럴 필요도 없습니다. Fable 5가 일상적인 에이전틱 및 코딩 작업을 다루기 때문입니다.

어디서 Claude Fable 5를 사용할 수 있나요?

Claude Fable 5는 Anthropic API, AWS Bedrock, GitHub Copilot, Harvey에서 일반 사용 가능합니다. 2026년 6월 22일까지 Pro, Max, Team, 시트 기반 Enterprise 요금제에서 무료이며, 6월 23일부터 사용량 크레딧이 적용됩니다. 오늘 에디터에서 또는 API로 테스트할 수 있습니다.

결론

Claude Fable 5는 Opus 4.8을 넘어서는 진정한 프론티어 도약입니다. SWE-Bench Pro에서 80.3% 대 69.2%, FrontierCode 점수 두 배, 그리고 도구와 함께 배포하기에 훨씬 안전한 공격 성공률 5.4%입니다. 어려운 에이전틱 코딩, 장기 작업, 시각 작업에는 갈아타세요. 비용 민감 대량 작업이나 어차피 폴백을 발동시키는 작업에는 Opus 4.8에 머무르세요. 6월 22일까지 무료이니 비용 부담 없이 전환을 테스트할 수 있습니다. Techsy 팀은 바로 이 스택으로 프로덕션 에이전트를 구축하므로, 도움이 필요하면 연락하세요.

태그

Claude Fable 5와 Claude Mythos 5Claude Opus 4.8SWE-Bench ProMythos급에이전틱 코딩

이 기사 공유하기

관련 글

더 많은 글 보기 ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 출시: Fable 5에 근접한 지능, 가격은 절반

Anthropic이 2026년 7월 24일 Claude Opus 5를 출시했습니다. Frontier-Bench에서 Opus 4.8을 두 배 이상 앞서면서도 Opus 가격을 유지하지만, 일부 테스트에서는 Fable 5와 Mythos 5에 뒤처집니다. 벤치마크 표, 가격, 전환/대기/유지 판단을 정리했습니다.

10 min read 분 읽기
읽어보기
ai-machine-learning
Jul 20, 2026

2026년 최고의 AI 웹 스크래핑 API 8선 (자체 에이전트 스택으로 직접 테스트)

자체 에이전트 스택으로 실제 2026년 요금을 확인하며 AI 웹 스크래핑 API 8종을 테스트했습니다. Firecrawl, Bright Data, ScrapingBee 외 5종을 LLM 최적화 출력, 안티봇, MCP 지원 기준으로 순위를 매겼습니다.

9 min read 분 읽기
읽어보기
ai-machine-learning
Jul 20, 2026

코딩을 위한 프롬프트 엔지니어링: Claude Code와 Cursor에서 매일 사용하는 7가지 패턴 (2026)

대부분의 'AI 코딩 프롬프트' 글은 복사해서 쓸 수 있는 템플릿 50개를 제시합니다. 이 글은 우리가 16개 에이전트 Claude Code 파이프라인을 운영하는 데 매일 사용하는 7가지 패턴을 가르쳐주며, 각 패턴별 실제 Before/After 예시와 2026년 기준 Claude Code, Cursor, Copilot에서 각 패턴이 어떻게 적용되는지 설명합니다.

11 min read 분 읽기
읽어보기
모든 글 보기
프로젝트 시작하기

새로운 것을 만들 준비가 되었다면 특별함은?

여러분의 비전을 현실로 만들어 보세요. 차이를 만드는 소프트웨어, 우리 팀이 함께 만들겠습니다.

30분 스코핑 미팅 예약프로젝트 보기

라이브러리에서 인기 있는 도구

Claude 스킬

전체 보기
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI 자동화

전체 보기
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

라이브러리에서 인기 있는 도구

Claude 스킬

전체 보기
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI 자동화

전체 보기
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

서비스

  • 엔터프라이즈 솔루션
  • 모바일 앱
  • 웹 애플리케이션

솔루션

  • CRM 시스템
  • AI 통합
  • ERP 솔루션
  • 음성 에이전트
  • 프로세스 자동화
  • 사이버 보안

라이브러리

  • 블로그
  • 포트폴리오

커뮤니티

  • AI 자동화
  • Claude 스킬

도구

  • 모바일 앱 비용 계산기
  • OpenAI / LLM API 비용 계산기
  • MVP 비용 계산기
  • 음성 AI 에이전트 비용 계산기

회사 소개

  • 소개
  • 파트너
  • 문의하기

법적 고지사항

  • 개인정보 처리방침
  • 서비스 약관
  • 쿠키 정책

서비스

  • 엔터프라이즈 솔루션
  • 모바일 앱
  • 웹 애플리케이션

솔루션

  • CRM 시스템
  • AI 통합
  • ERP 솔루션
  • 음성 에이전트
  • 프로세스 자동화
  • 사이버 보안

라이브러리

  • 블로그
  • 포트폴리오

커뮤니티

  • AI 자동화
  • Claude 스킬

도구

  • 모바일 앱 비용 계산기
  • OpenAI / LLM API 비용 계산기
  • MVP 비용 계산기
  • 음성 AI 에이전트 비용 계산기

회사 소개

  • 소개
  • 파트너
  • 문의하기
법적 고지사항개인정보 처리방침서비스 약관쿠키 정책
TECHSY
© 2026 Techsy. 무단전재 및 재배포 금지.