6월 9일 Anthropic이 Opus 윗급 모델 Claude Fable 5를 공개했다. 격차는 길고 복잡한 작업에서 벌어지고, 값은 출력 100만 토큰당 50달러다. 구독 플랜 무료 포함은 6월 22일까지이며, 그 전에 가장 긴 작업 하나를 옮겨 본다.
기업 강의장에서 자주 받는 질문이 "Opus면 제일 좋은 거죠?"다. 2026년 6월 11일 기준으로 이 답이 바뀌었다. Anthropic이 현지시간 6월 9일 Fable 5를 발표했고, 이 글은 6월 11일 네이버 블로그에 정리한 글을 사이트용으로 다시 쓴 것이다.
Haiku, Sonnet, Opus 세 단이던 라인업 위에 Mythos 클래스가 생겼고, Fable 5는 그 등급에서 일반 사용자가 처음 쓰는 모델이다. 격차는 짧은 질문이 아니라 긴 작업에서만 벌어지므로, 시험도 그 조건에서 해야 한다.
Fable 5는 Mythos 5와 같은 모델이고, 다른 것은 접근 제어뿐이다
Anthropic 6월 9일 발표를 거슬러 올라가면 4월의 Claude Mythos Preview가 있다. 사이버보안 능력 때문에 Project Glasswing에 참여한 정부·보안기관 몇 곳에만 열려 있던 모델이다. 이후 두 달은 분류기(classifier) 보강에 썼고, Fable 5는 그 분류기를 앞에 세운 Mythos의 일반 공개판이다.
다른 점은 접근 제어다. 사이버보안, 생물·화학, 모델 증류(distillation)로 분류된 요청은 Opus 4.8이 대신 받고 그 사실이 알림으로 뜬다. Anthropic은 폴백 세션이 전체의 5% 미만이라고 밝혔다. 보존 정책도 하나 붙는다. Mythos 등급으로 오간 요청과 응답은 예외 없이 30일 동안 서버에 남는다. 안전 목적이고 학습에는 안 쓴다지만, 내부 문서를 넣는 조직은 보안팀 검토가 먼저다.
격차는 점수가 아니라 작업의 길이에서 벌어진다
Anthropic의 주장은 하나다. 작업이 길어지고 복잡해질수록 이전 모델과 Fable 5 사이의 거리가 벌어진다는 것이다. Stripe가 보고한 건은 Ruby 코드베이스 5,000만 줄의 전체 마이그레이션인데, 팀이 손으로 하면 두 달을 넘기는 일을 하루에 마쳤다. 코딩 평가 쪽 대표 사례는 Cognition의 FrontierCode로, 오픈소스 메인테이너가 그 PR을 머지할지를 기준으로 채점한다.
| 평가 | 결과 (원문 정리, 2026-06 기준) |
|---|---|
| FrontierCode (Cognition, xhigh) | Opus 4.7 5.2% → Opus 4.8 13.4% → Fable 5 29.3% (커뮤니티 집계) |
| Hebbia 금융 추론 | 전 모델 중 최고점. 문서 추론·차트·표 해석 향상 |
| Hex 분석 | 최초 90% 돌파, Opus 대비 10점 상승 |
| CursorBench (Cursor) | SOTA, 기존 모델로 불가능했던 장기 과제 해결 |
| ViBench (바이브코딩) | 역대 최고 성능, 더 적은 토큰·시간으로 앱 완성 |
| IMC 자사 평가 | 사실 조회·개념 추론·근본원인 분석·기댓값 분석 거의 전 영역 통과 |
| 법률 블라인드 리뷰 | 변호사들이 계약서 수정안(redline)을 기존 모델과 같거나 낫다고 매번 판단 |
| 비전 | 지도·게임 상태 정보 없이 스크린샷만으로 포켓몬 파이어레드 완주 |
| 메모리 (Slay the Spire) | 파일 기반 메모리를 줬을 때 향상폭이 Opus 4.8의 3배 |
| 에이전틱 코딩 (커뮤니티 집계) | Opus 4.8 대비 약 +11%p, GPT-5.5 대비 약 +22%p |
표의 공통 조건은 한 번의 응답이 아니라 수백만 토큰짜리 완주다. 완주의 근거로 공식 문서가 드는 말은 '능동적 자기 검증(proactive self-verification)'이고, Anthropic 발표와 AWS 블로그가 같은 표현을 쓴다. 작업 도중 익힌 것을 자기 스킬에 반영하고, 작업 환경(harness)과 채점 기준을 직접 세우고, 낸 결과물을 스스로 다시 검사한다. 우리가 강의에서 프롬프트, 컨텍스트, 하니스, 스킬 순으로 설명해 온 단계 일부를 모델이 스스로 밟는 셈이다.
외부 평가기관 METR이 인정한 범위는 가장 어려운 R&D 과제 일부를 풀었다는 데까지다. 수 주짜리 프런티어 R&D를 통째로 자동화하는 단계는 "아직 아니다"라고 못 박았다. 해커뉴스에는 Opus 4.6 이후 코드 생성에서 달라진 것을 못 느낀다는 글과, 이제야 자율 코딩 루프를 맡길 만하다는 글이 함께 올라와 있다. 이 간격은 자기 업무로 재야 좁혀진다.
값은 가장 비싼 축이고, 무료 창은 6월 22일에 닫힌다
쓸 수 있는 경로는 셋이다. API는 발표 당일 열렸고 모델 문자열은 claude-fable-5다. 기업 환경이라면 AWS 발표가 안내하는 Amazon Bedrock이나 Claude Platform on AWS가 있고, 둘 다 첫날부터 GA(정식 출시)다. 셋째가 구독 플랜이다. Pro, Max, Team, 시트형 Enterprise 이용자는 6월 22일까지 추가 요금 없이 Fable 5를 쓴다. 23일이 되면 구독에서 빠지며, 그 뒤로는 usage credits를 따로 사서 쓰는 방식이다. 용량이 확보되면 다시 넣겠다는 것이 Anthropic의 설명이지만, 해커뉴스에는 "맛보여주고 끊는 거 아니냐"는 비판도 있었다.
단가표는 출력 쪽이 무겁다. 100만 토큰 기준으로 입력은 10달러, 출력은 그 다섯 배인 50달러다. Mythos Preview의 절반 아래지만 주요 모델 가운데 가장 높은 단가대이고, thinking이 항상 켜져 있어 복잡한 세션 하나가 50만~100만 토큰을 쓴다는 초기 사용기가 여럿이다. 안전장치도 아직 거칠다. "자외선 지수가 선글라스 착용 기준으로 적절한가" 같은 질문에 필터가 걸렸다는 사용기가 나왔고, Anthropic은 분류기를 보수적으로 튜닝했다고 인정했다. 세부는 시스템 카드에 있다.
가져갈 것
- Pro·Max·Team·시트형 Enterprise 플랜에서 6월 22일 전에 Fable 5를 돌려 봤는가
- Opus로 하던 가장 긴 작업 하나(마이그레이션, 장문 재무 분석, 멀티에이전트)를 같은 지시로 Fable 5에 넘겼는가
- 차이가 났다면 계획 수립, 중간 점검, 완주 지구력 중 어디서 났는지 적었는가
- 그 세션의 토큰 수를 단가로 환산해 Opus 대비 월 비용을 냈는가
- 업무 요청 중 사이버보안·생물·화학·증류 건에서 Opus 4.8 폴백 알림이 뜨는지 확인했는가
- 30일 트래픽 의무 보존이 사내 민감 데이터 규정과 충돌하는지 보안팀에 물었는가
안 되는 경우
- 단순 질의응답과 요약이 대부분인 팀. Sonnet으로 충분하고 비용 차이가 크다.
- 사이버보안·바이오 실무자. Opus 4.8로 폴백되므로 당장 체감할 이득이 제한된다.
- 수치의 전제. FrontierCode 29.3%와 에이전틱 코딩 +11%p·+22%p는 커뮤니티 집계이고, 폴백 5% 미만의 모수와 Opus 4.8 단가는 원문이 밝히지 않았다.
- 주 단위 R&D를 통째로 맡기려는 조직. METR은 아직 그 수준이 아니라고 봤다.
이번 주에 바꿀 것은 모델 선택 규칙 한 줄이다. "제일 좋은 모델"을 기본값으로 두는 대신 짧은 작업은 Sonnet·Opus, 긴 작업만 Fable 5로 보내고, 6월 22일 전에 그 하나로 차이를 확인한다. 강의장 질문의 답도 이제 모델명이 아니라 작업 길이다. 사업영역 →