Ai

Claude Fable 5.1 — Opus 5 · Fable 5 · GPT-5.6 Sol 비교

목차

오늘(9/1) Claude Fable 5.1 과 Mythos 5.1 이 같이 나왔다. 7월에 Opus 5 를 놓고 비교한 글을 썼었는데, 그때 “몇 주 지나고 다시 봐야 할듯” 이라고 적어둔게 딱 이 시점이 됐다.

이번 릴리스는 성능보다 가격 구조와 breaking change 쪽이 실무에 더 영향이 크다. 그리고 벤더 표와 제3자 측정이 서로 다른 방향을 가리키는 구간이 꽤 있다.

Claude Fable 5.1
claude-fable-5-1
입력
$10 / MTok
출력
$50 / MTok
캐시 읽기
$0.25 / MTok
컨텍스트
1M
Claude Opus 5
claude-opus-5
입력
$5 / MTok
출력
$25 / MTok
캐시 읽기
$0.50 / MTok
컨텍스트
1M
Claude Fable 5
claude-fable-5
입력
$10 / MTok
출력
$50 / MTok
캐시 읽기
$1.00 / MTok
컨텍스트
1M
GPT-5.6 Sol
gpt-5.6-sol
입력
$5 / MTok
출력
$30 / MTok
캐시 읽기
컨텍스트
1.05M

스펙부터 정리

Fable 5.1Opus 5Fable 5GPT-5.6 Sol
출시2026-09-012026-07-242026-06-092026-07-09
입력 $/MTok105105
출력 $/MTok50255030
캐시 읽기 $/MTok0.250.501.00
컨텍스트1M1M1M1.05M
최대 출력128k128k128k128k
지식 컷오프2026-062026-052026-012026-02
레이턴시느림보통느림

기본 입출력 단가는 Fable 5 와 똑같다. $10 / $50 그대로다. 컨텍스트도 1M 이 기본이자 최대. 바뀐건 캐시 읽기 하나다. 지식 컷오프가 2026-06 으로 이 중에 제일 최신인건 덤이다.

Batch API 는 절반이라 $5 / $25. 모델 ID 는 Bedrock 이 anthropic.claude-fable-5-1, Vertex 랑 Foundry 는 claude-fable-5-1 로 그냥 같다.

캐시 읽기가 4분의 1로

이번 릴리스에서 제일 실질적인 변화다.

캐시 읽기가 $1.00 → $0.25 / MTok. 75% 인하다. 문서에는 “이 모델들에서는 캐시 읽기가 기본 입력 단가의 0.025 배” 라고 적혀 있다. 다른 Claude 모델은 0.1 배다.

캐시 쓰기는 안 바뀌었다. 5분 $12.50, 1시간 $20 그대로. 최소 캐시 길이 512 토큰도 그대로다. 그러니까 긴 프리픽스를 여러 번 재사용하는 구조에서만 이득이 온다.

Anthropic 이 말한 절감폭은 두 가지다.

  • 일반적인 워크로드: Fable 5 대비 약 25% 저렴
  • 에이전틱하게 오래 굴리는 워크로드: 최대 45%

이 두 숫자의 근거가 되는 벤치마크나 데이터셋은 발표 페이지에 안 나온다. 한 제3자 분석은 8월 실사용 청구서 4주치를 블렌딩한 값이라고 적었는데, 이 주장 자체를 Anthropic 페이지에서 확인하진 못했다. 같은 분석의 분해는 이렇다.

워크로드절감
툴 많이 쓰는 긴 에이전틱 세션약 45%
혼합 프로덕션약 25%
재사용 프리픽스 없는 단발 호출0%

단발 호출은 아예 이득이 없다. 캐시를 안 타니까 당연하다.

반대 방향 자료도 있다

Artificial Analysis 는 max effort 기준으로 Fable 5.1 이 태스크당 $3.69, Fable 5 가 $3.14 라고 측정했다. 20% 정도 더 비싸다.

이유는 출력 토큰이다. 같은 인덱스를 도는데 Fable 5.1 이 140M, Fable 5 가 83M 을 썼다. 1.7배다. 출력은 $50/MTok 이고 여기엔 할인이 없다.

둘 다 맞는 얘기다. Anthropic 은 입력 쪽 캐시 경제학을 말하는거고, AA 는 출력 물량을 말하는거다. 본인 워크로드가 입력 재사용이 많은지 출력이 긴지에 따라 방향이 갈린다. 같은 제3자 분석 기준으로, 턴당 캐시 토큰이 14만~21만개 넘어가는 지점부터 Fable 5.1 이 Opus 5 보다 싸진다고 한다. 캐시 쓰기를 비용에 넣느냐에 따라 그 지점이 달라진다.

Breaking change 세 가지

Fable 5 코드를 그대로 5.1 로 올리면 깨지는게 있다.

1. 강제 툴 사용이 없어졌다

tool_choice{"type":"any"}{"type":"tool","name":...}400 이다.

1
2
400 invalid_request_error
tool_choice: type "tool" and "any" are not supported for this model.

count_tokens 에서도 똑같이 막힌다. autonone 은 그대로 된다. 구조화된 출력을 뽑으려고 특정 툴을 강제로 물리던 패턴이 꽤 흔한데, 그게 전부 걸린다.

2. thinking 블록이 모델에 묶인다

Fable 5.1 은 이전 모델이 만든 thinking 블록을 읽을 수 있다. 반대는 안 된다. 이전 모델은 Fable 5.1 의 thinking 블록을 못 읽는다.

못 읽는 블록은 조용히 버려진다. 과금도 안 된다. 대신 뭐가 버려졌는지도 모른다. thinking-binding-controls-2026-08-01 헤더를 주면 input_transformations 에 드러난다. 모델을 섞어 쓰는 파이프라인이라면 이 헤더를 켜두는게 맞을듯

3. 이전 턴을 수정하면 thinking 블록이 무효가 된다

“preserved thinking” 이라고 부른다. 아래를 하면 400 이다.

  • system 이나 tools 를 재구성
  • 이전 턴을 재정렬하거나 제거
  • 턴별 텍스트를 넣었다 지우기
1
400 The block is bound to a different conversation

2026-08-31 이후에 만든 계정에 강제 적용된다. 그 전에 만든 계정은 thinking.block_binding.prefix_mismatch_behavior 를 직접 설정할 때만 걸린다. 대화 히스토리를 매 턴 새로 조립하는 구현이 많은데, 그런 코드가 정면으로 걸린다.

참고로 Mythos 5.1 은 이 검사를 안 한다. 같은 세대인데 여기서 갈린다.

추가된 것들

  • 대화 중간에 effort 변경mid-conversation-output-config-2026-07-01 베타. 프롬프트 캐시를 안 깬다. Fable 5.1 / Mythos 5.1 / Opus 5 에서 된다
  • 턴 한정 시스템 메시지clear_at: "next_user_message", mid-conversation-system-clear-at-2026-08-21 베타
  • thinking.display: "updates" — 툴콜 사이에 읽을 수 있는 진행 메모가 나온다. thinking-display-updates-2026-08-18 베타
  • 콘텐츠 출처 표시 — 모든 출력에 통계적 텍스트 워터마크가 들어간다. Files API 로 받은 이미지·비디오에는 C2PA Content Credentials 가 붙는다

thinking 은 adaptive 로 항상 켜져 있다. {"type":"disabled"}budget_tokens 도 400 이다. Opus 5 는 effort 가 high 이하일 때 끌 수 있었는데 여기선 아예 못 끈다. API 기본 effort 는 high 다.

거절 시 폴백으로 지정 가능한 모델은 Opus 4.8 과 Opus 5 다. 폴백이 걸리면 전환에 든 프롬프트 캐시 비용을 크레딧으로 돌려준다.

벤치마크를 보기 전에

7월 글에도 같은 얘기를 적었는데 이번엔 조건이 하나 더 붙는다.

Anthropic 의 발표 표는 프로덕션 세이프가드를 켠 채로 돌렸고, 세이프가드가 개입한 태스크는 다른 모델이 대신 수행했다. 각주에 그대로 적혀 있다.

세이프가드가 개입한 태스크에서 Fable 5.1 과 Fable 5 는 OSWorld 2.0 에서 0점, Fable 5 는 AutomationBench 에서 0점을 받았다. 그 외 개입 건에서는 사이버보안 태스크를 Claude Opus 4.8 이, 생물학 태스크를 Claude Opus 5 가 수행했다.

즉 헤드라인 숫자에 모델 교체가 섞여 있다. 순수한 모델 단독 측정이 아니라 스캐폴드 차이가 포함된 값이다. 이건 벤더가 숨긴게 아니라 직접 각주에 써놨다.

나머지 조건도 몇 가지.

  • Terminal-Bench-Science 0.1 은 모델당 표준오차가 ±3.5~4.5%p 다. 공개 리더보드는 Opus 5 30.0% / Fable 5 21.4% 인데, Anthropic 자체 실행은 29.0% / 24.7% 다. Anthropic 은 둘 다 노이즈 범위라고 설명한다
  • OSWorld 2.0 은 벤치마크 저자의 2026년 8월 태스크 릴리스 기준이다. 태스크 파일이 달라져서 이전에 공개된 OSWorld 2.0 수치와 직접 비교가 안 된다. 그래서 표에 경쟁사 점수가 아예 없다
  • 표에 Sonnet 5 열도, Gemini 열도 없다

Anthropic 발표 표

전부 벤더 자체 발표 수치다.

벤치마크Fable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.152.6%24.7%29.0%22.4%
Terminal-Bench 4.055.8%42.0%52.3%37.3%
GDPval-AA v2 (점수)1853172318241711
OSWorld 2.0 (partial)77.9%72.9%75.4%
OSWorld 2.0 (strict)41.7%36.1%39.6%
HLE (툴 없음)60.9%57.8%56.6%
HLE (툴 사용)65.0%63.8%63.6%
AutomationBench31.4%17.1%26.9%19.6%
CursorBench 3.2.073.4%70.5%70.0%67.2%

Terminal-Bench 4.0 은 Mythos 5.1 이 60.9% 로 Fable 5.1(55.8%)보다 위다. 발표 표에서 Mythos 를 따로 떼어 적은 유일한 항목이다.

제일 눈에 띄는건 Terminal-Bench-Science 다. 24.7% → 52.6% 면 두 배가 넘는다. AutomationBench 도 17.1% → 31.4% 로 거의 두 배다. 7월에 Opus 5 가 AutomationBench 26.0% 로 격차를 벌렸다고 적었는데, 두 달 만에 다시 넘어갔다.

반대로 나머지 항목은 폭이 작다. HLE 는 3.1%p, CursorBench 는 2.9%p 차이다. 에이전틱·터미널 계열에서만 크게 벌어지고 나머지는 소폭 개선이라고 보는게 맞을듯

SWE-bench 는 이번에 안 나왔다

Anthropic 은 Fable 5.1 의 SWE-bench Verified 도 SWE-bench Pro 도 발표하지 않았다.

검색하면 95.0% / 80.3% 같은 숫자가 Fable 5.1 것처럼 나오는데, 그건 Fable 5 수치다. ARC-AGI-1 98.5%, ARC-AGI-2 89.2%, MMMU 74.3% 도 전부 Fable 5 것이다. 집계 사이트들이 버전을 섞어놨다. 한 곳이 Fable 5.1 SWE-bench Pro 81.2% 를 적어놨는데 출처도 방법론도 없어서 여기 안 적었다.

GPQA Diamond, AIME, BrowseComp, MRCR 도 마찬가지로 Fable 5.1 공식 수치가 없다.

제3자 측정 — Artificial Analysis

Intelligence Index v4.1.1 기준, 66점으로 192개 모델 중 1위다.

모델Index
Claude Fable 5.166
Claude Opus 563
Claude Fable 562
GPT-5.6 Sol61
xAI Grok 4.6 (high)61
Moonshot Kimi K3 (max)60
Zhipu GLM-5.1 (max)60
Google Gemini 3.7 Flash (high)56

여기서 주의할게 있다. Fable 5 는 출시 당시 이 인덱스에서 64.9 로 1위였다. 지금 페이지에는 62 로 적혀 있다. 인덱스 버전이 올라가면서 재조정된 것으로 보인다. 그러니까 66 과 64.9 를 나란히 놓고 “1.1점 올랐다” 고 읽으면 안 된다.

측정 설정도 봐야 한다. AA 가 쓴 구성은 “Adaptive Reasoning, Max Effort, Default Fallback” 이다. max effort 에 폴백 켠 상태다.

AA 가 같은 페이지에 적어둔 평은 우호적이지 않다. “비슷한 가격대 모델과 비교하면 특히 비싸다”, “평균보다 느리고 매우 장황하다”.

Fable 5.1Fable 5
태스크당 비용$3.69$3.14
인덱스 총 실행 비용$8,523$5,455
출력 토큰140M83M
출력 속도66.0 tok/s66.9 tok/s
첫 토큰까지285초122초

첫 토큰까지 285초다. 4분 45초 동안 아무것도 안 나온다는 뜻이다.

제3자 측정 — Vals AI

Vals Index 67.87% 로 51개 모델 중 1위다. 9/1 실행이다.

모델Vals Index
Fable 5.167.87% (±1.10)
Opus 567.21%
Fable 566.04%
GPT-5.6 Sol63.71%

개별 벤치마크는 1위가 많다. ProofBench 100%, MMLU Pro 92.38%, MMMU Pro 90.64%, LiveCodeBench 90.52%, MedScribe 91.29%. Terminal-Bench 2.1 은 85.02% 로 2위다.

폴백을 실패로 치면 순위가 뒤집힌다

Vals 가 방법론에 직접 적어둔 문장이다.

생물·사이버 인접 태스크에서 거절이 여전히 잦아서, Fable 5.1 은 Claude Opus 5 와 Claude Opus 4.8 을 서버측 폴백으로 두고 실행했다.

그리고 폴백이 걸린 태스크를 실패로 계산한 값을 같이 공개했다.

실행값폴백=실패
Vals Index67.87%66.85%
Terminal-Bench 2.185.02%79.03% (267개 중 23개)
Legal Research Bench55.29%54.33%
Harvey’s Legal Agent6.67%5.83%

폴백 보정한 66.85% 는 Opus 5 의 67.21% 보다 낮다. 1위냐 아니냐가 계산 방식 하나로 갈린다. Anthropic 각주의 모델 교체와 같은 얘기다.

유독 낮은 항목

Harvey’s Legal Agent 6.67%, 55개 중 18위. 다른 데서는 거의 1~3위인데 여기만 유독 낮다. Fable 5 는 같은 벤치마크에서 55개 중 6위였다. 이전 버전보다 떨어졌다.

비용과 시간도 만만치 않다. 테스트당 $28.40, 지연 72분 25초다. Fable 5 는 $28.80 에 37분 51초였다. 값은 비슷한데 시간이 1.9배다.

제3자 측정 — CodeRabbit 코드 리뷰

실제 코드 리뷰 도구가 돌린 값이다.

모델재현율정밀도
GPT-5.6 Sol69.7%31.6%
Fable 561.9%32.8%
Fable 5.161.0%37.3%
Opus 555.2%39.3%

재현율은 Fable 5 보다 0.9%p 낮고, 정밀도는 4.5%p 높다. 알려진 이슈를 찾는 능력은 그대로인데 오탐이 줄었다는 쪽에 가깝다. 전체 코멘트가 166개로 Fable 5 보다 87개 적고, 사소한 지적은 70.2% 줄어 79개다.

대신 태스크당 18분 38초로 Fable 5 보다 6분 6초(48.7%) 느리다.

그리고 재밌는 결과가 하나 있다. low effort 가 high effort 를 이겼다. 재현율 61.0% / 18분 38초(low) 대 57.1% / 21분 36초(high). 느린데 못했다.

7월 Opus 5 글에서도 maxxhigh 보다 낮은 점수를 냈다고 적었는데 같은 현상이 여기서도 나온다. effort 를 무조건 올리는건 답이 아니다. 한 분석은 effort 이름이 모델마다 같은 양의 사고를 뜻하지 않아서 이전 모델에서 튜닝한 effort 값이 그대로 안 넘어온다고 지적한다. Fable 5.1 은 medium 에서 “Fable 5 를 더 싼 비용으로 대략 따라잡는다” 는 얘기도 있다.

Anthropic 이 직접 적어둔 퇴보

문서의 “Fable 5 에서 달라진 점” 섹션이 이번엔 꽤 솔직하다. 좋아진 것만 적어둔게 아니라 나빠진 것도 같이 있다.

  • 병렬 툴 호출이 더 불규칙해졌다. Fable 5 가 여러개를 묶어 던지던 자리에서 턴당 하나씩 던질 수 있다. 토큰·왕복·시간이 다 는다. 답변 품질이 떨어지는건 아니다
  • 긴 툴 실행 중 진행 상황을 덜 알려준다. 특히 effort 가 높을 때
  • low effort 에서 기억에 의존해 답하는 빈도가 늘었다. 검색·조회 툴을 덜 부른다
  • 문장이 더 빽빽해졌다. 길어지고 문단 나눔이 줄었다
  • 채팅에서 서식을 덜 쓴다. 굵게·헤더·목록을 이전 모델보다 덜 쓴다
  • 요약에서 인용 표시를 안 한다. 원문 문장을 그대로 가져오면서 인용이라고 안 밝힌다
  • 작은 수정에도 파일 전체를 다시 쓴다. 출력 토큰과 시간이 더 든다

마지막 항목이 앞의 출력 토큰 1.7배와 이어지는 얘기 같다. 요약에서 인용 표시를 안 한다는건 좀 신경쓰이는 부분이다.

Mythos 5.1

같이 나왔는데 성격이 다르다.

  • 문서에 “Claude Fable 5.1 과 동일한 능력” 이라고 적혀 있다. 스펙도 가격도 같다. 캐시 읽기 $0.25 도 같다
  • 초대 전용이다. Project Glasswing 참가자만 쓸 수 있다. Cyber Verification Program, Life Sciences Verification Program 을 통해 접근한다
  • 한 매체는 미국 기업·개인으로 제한된다고 전한다. Life Sciences 는 공개 접수 예정
  • preserved thinking 검사를 안 한다. Fable 5.1 과 여기서 갈린다
  • 검증된 방어자용으로 사이버 세이프가드가 완화돼 있다

시스템 카드 요약으로는 Anthropic 모델 중 사이버 능력이 제일 강하고, ExploitBench·OSS-Fuzz·Firefox 147·ExploitGym 등 거의 모든 사이버 평가에서 Opus 5 를 크게 앞선다고 한다. 화생 쪽은 CB-1 수준이고 CB-2 기준 아래다. 구체적 점수는 확인하지 못했다. 시스템 카드 PDF 가 커서 본문을 못 읽었다.

과학 쪽 주장은 이렇다. 결합 친화도가 기존 최고 설계보다 10배 높은 단백질 바인더, 12개 타깃에서 적중률 약 50%(통상 1015%), 딥러닝 모델 최적화 최대 2.5배 가속과 GPU 비용 3060% 절감 추정, 금성 고도 지도 해상도 23km(기존 1020km). 다만 각주에 경쟁 출품작 하나가 자기들 최고 바인더와 비슷했다고 직접 적어놨다.

커뮤니티 반응

Hacker News 스레드에서 제일 많이 나온 불만은 성능이 아니라 문체다.

“purple prose”, 없는 용어를 지어낸다, 아부하는 말투, 코드 주석에 존재하지 않는 문서를 날짜까지 지어내서 참조한다는 지적이 있다. 가독성 때문에 Opus 4.8 로 되돌아갔거나 GPT-5.6 Sol 로 옮겼다는 얘기도 여럿 나온다.

일반적인 CRUD 웹 개발에서 세이프가드가 걸린다는 불만, 기본 ZDR 모드가 없어서 학계에서 쓰기 어렵다는 얘기도 있다. 실제로 Fable 5.1 은 30일 보존이 필수고 별도 승인 없이는 ZDR 로 못 쓴다.

세대 전반의 품질 퇴보를 주장하는 GitHub 이슈도 있는데, 본문을 직접 읽지 못해서 내용을 여기 옮기진 않았다.

총평

Fable 5.1 은 큰 폭의 성능 향상이 아니라 특정 축의 개선 + 가격 구조 변경이다.

터미널·에이전틱 계열에서는 확실히 올랐다. Terminal-Bench-Science 24.7% → 52.6%, AutomationBench 17.1% → 31.4% 는 두 배 수준이다. 반면 HLE 3.1%p, CursorBench 2.9%p, 코드 리뷰 재현율은 오히려 0.9%p 하락이다. 영역별로 편차가 크다.

1위 타이틀은 조건부다. AA Intelligence Index 1위(66), Vals Index 1위(67.87%) 둘 다 맞는데, Vals 는 폴백을 실패로 치면 66.85% 로 Opus 5 아래고, Anthropic 자체 표도 거절 태스크를 Opus 4.8 / Opus 5 가 대신 수행한 값이다. “Fable 5.1 이 1위” 보다 “Fable 5.1 + Opus 폴백 조합이 1위” 가 정확한 표현이다.

가격은 방향이 두 개다. 캐시 읽기 75% 인하는 진짜다. 근데 그건 입력 쪽 얘기고, 출력 토큰을 1.7배 쓰면 총액은 오히려 는다. AA 측정에선 태스크당 20% 더 비쌌다. 긴 프리픽스를 반복해서 읽는 구조면 이득, 출력이 긴 작업이면 손해로 갈린다.

속도는 확실히 나빠졌다. Vals 72분(1.9배), CodeRabbit +48.7%, AA 첫 토큰 285초. 어느 측정에서도 빨라진 데가 없다. 대화형으로 쓰기엔 부담스럽다.

언제 뭘 쓸까.

상황추천
긴 시스템 프롬프트·컨텍스트를 반복 재사용하는 에이전트Fable 5.1
터미널 작업, 과학 계열 에이전트Fable 5.1
컴퓨터 사용 자동화Fable 5.1 (다만 벤더 표 조건 감안)
비용 대비 프론티어 성능, 대화형Opus 5
단발 호출 위주, 캐시 재사용 없음Opus 5 (Fable 5.1 은 절감이 0%)
코드 리뷰에서 놓치는걸 줄이고 싶을 때GPT-5.6 Sol (재현율 69.7%)
법률 에이전트Fable 5.1 은 피하는게 나을듯
사이버·생명과학 연구 (초대 필요)Mythos 5.1

마이그레이션 전에 볼 것.

  1. tool_choiceany / tool 쓰던 코드 전부 — 400 난다. 가장 흔하게 걸릴 부분이다
  2. 대화 히스토리를 매 턴 재조립하는 코드 — preserved thinking 으로 400. 8/31 이후 만든 계정은 강제다
  3. 모델 섞어 쓰는 파이프라인 — thinking-binding-controls-2026-08-01 로 버려지는 블록을 보이게 해두는게 낫다
  4. effort 재조정 — 이전 모델 값이 안 넘어온다. medium 부터 재보는게 낫다. 코드 리뷰는 low 가 더 나았다는 측정도 있다
  5. thinking: disabled 쓰던 코드 — 아예 못 끈다

이 숫자들은 대부분 벤더 자체 발표거나 출시 당일 측정이다. 7월 Opus 5 때랑 같은 상황이다. 독립 검증이 쌓이면 그림이 또 바뀔 수 있다.

참고