Ai

GPT-6 Astra — Fable 5.1 · Opus 5 · GPT-5.6 Sol 비교

목차

9/3 에 OpenAI 가 GPT-6 Astra 를 냈다. 일주일 전에 Claude Fable 5.1 을 놓고 쓴 글에서 “독립 검증이 쌓이면 그림이 또 바뀔 수 있다” 고 적었는데, 이번엔 반대편 차례다.

출시 당일에 안 쓰고 며칠 기다린 이유가 있다. 발표 표만 보면 압도적인데 제3자 측정이 하나둘 나오면서 그림이 꽤 달라졌다. 그리고 이번 릴리스는 벤치마크 숫자 자체보다 그 숫자가 어떤 조건에서 나왔는지가 더 중요하다.

GPT-6 Astra
gpt-6-astra
입력
$10 / MTok
출력
$50 / MTok
캐시 읽기
$1.00 / MTok
컨텍스트
1.05M
GPT-5.6 Sol
gpt-5.6-sol
입력
$4 / MTok
출력
$20 / MTok
캐시 읽기
컨텍스트
1.05M
Claude Fable 5.1
claude-fable-5-1
입력
$10 / MTok
출력
$50 / MTok
캐시 읽기
$0.25 / MTok
컨텍스트
1M
Claude Opus 5
claude-opus-5
입력
$5 / MTok
출력
$25 / MTok
캐시 읽기
$0.50 / MTok
컨텍스트
1M

스펙부터

GPT-6 AstraGPT-5.6 SolFable 5.1Opus 5
출시2026-09-032026-07-092026-09-012026-07-24
입력 $/MTok104105
출력 $/MTok50205025
캐시 읽기 $/MTok1.000.250.50
컨텍스트1.05M1.05M1M1M
최대 출력128k128k128k128k
지식 컷오프2026-04-302026-022026-062026-05

단가가 Fable 5.1 과 똑같다. $10 / $50. 우연은 아닐듯

라인업은 Astra 와 Astra Pro 둘 뿐이다. GPT-5.6 때 있던 Luna / Terra / Sol 같은 등급 분화가 이번엔 없다. 모델 ID 도 스냅샷 없이 gpt-6-astra 하나다.

지원 엔드포인트는 Chat Completions, Responses, Batch. Realtime, Assistants, 파인튜닝은 안 된다.

가격이 2.5배 올랐다

Sol 대비 입력 $4 → $10, 출력 $20 → $50. 그냥 2.5배다.

티어가 좀 복잡해졌다.

티어입력캐시 입력출력
기본$10$1$50
롱컨텍스트 (272K 초과)$20$2$75
Batch / Flex$5$0.50$25
Fast 모드$20$2$100

캐시 쓰기는 $12.50 / MTok. Fast 모드는 2배 값에 2.5배 속도라고 한다.

272K 넘어가면 단가가 두 배가 되는 구간이 새로 생겼다. 1.05M 컨텍스트를 자랑하면서 정작 272K 부터는 값을 두 배 받는다. 컨텍스트를 꽉 채워 쓰는 구조라면 이 구간을 먼저 계산해봐야 한다.

Rate limit 은 Tier 5 기준 분당 15,000 요청 / 40M 토큰이다.

API breaking change

Sol 코드를 그대로 올리면 걸리는 것들.

1. 샘플링 파라미터가 없어졌다

temperature, top_p, logprobs전부 제거됐다.

temperature=0 을 박아놓고 재현성을 확보하던 코드가 꽤 많은데 그게 전부 걸린다. logprobs 로 신뢰도를 재던 분류 파이프라인도 마찬가지다. 대체 수단이 따로 없다.

2. effort 최소값이 low

기존 none / minimal 이 사라졌다. 이제 low, medium, high, xhigh, max 다섯 단계다.

추론을 아예 끄는 선택지가 없어졌다는 뜻이다. Fable 5.1 도 thinking 을 못 끄게 막았는데 같은 방향으로 갔다. 분류나 추출처럼 사고가 필요 없는 작업에서 최소 비용이 올라간다.

3. 캐시 설정 이름이 바뀌었다

prompt_cache_retentionprompt_cache_options.ttl

4. 툴 콜은 Responses API 로

Chat Completions 에서 툴 호출이 안 된다. Responses API 를 써야 한다. Chat Completions 로 에이전트를 짜뒀으면 여기서 걸린다.

OpenAI 발표 표

전부 벤더 자체 발표 수치다. 빈 칸은 OpenAI 표에 해당 모델이 없는 항목이다.

벤치마크AstraSolFable 5.1Opus 5
FrontierMath Tier 4 (v2)97.6%87.8%73.2%
ARC-AGI-399.9%7.8%30.2%
GPQA Diamond96.0%
Terminal-Bench Science 0.164.6%52.6%30.0%
HLE (툴 사용)57.2%65.0%63.6%
Terminal-Bench 4.057.7%37.3%55.8%52.3%
DeepSWE v1.174.1%70.8%67.4%73.7%
OSWorld 2.072.6%65.7%70.2%
ScreenSpot-Pro92.7%76.9%
Agents’ Last Exam59.3%53.6%48.7%55.5%
AutomationBench41.4%18.1%31.4%26.9%
BenchCAD95.9%83.3%84.3%
BrowseComp91.5%90.4%90.8%
HealthBench Professional63.4%60.5%56.6%54.5%
ExploitBench100.0%78.5%70.0%
ExploitGym42.4%30.3%30.4%
SRE-Bench (1회 시도)88.0%55.9%12.5%
MRCR v2 8-needle (256K~512K)100%91.5%
MRCR v2 (512K~1M)96.3%73.8%
환각률 (낮을수록 좋음)4.2%12.2%

이것만 보면 얘기가 끝난다. 근데 이 표를 그대로 믿으면 안 되는 이유가 줄마다 있다.

이 표를 그대로 보면 안 되는 이유

ARC-AGI-3 의 99.9% 는 하네스 점수다

제일 눈에 띄는 숫자인데 제일 조건이 많이 붙는다.

OpenAI 는 이 벤치마크를 자사 Responses API 하네스로 돌렸다. 턴 사이에 추론 상태를 유지하고 긴 컨텍스트를 compaction 으로 관리하는 구성이다. 발표 페이지 각주에 “실제 사용 환경에 더 맞추려고 두 가지 설정을 바꿨다” 고 직접 적어놨다.

같은 벤치마크를 ARC Prize 쪽 표준 하네스로 돌리면 62.7% 다. 99.9% 와 62.7% 다.

OpenAI 는 예전에 “설정 두 개로 ARC-AGI 점수를 세 배로 올렸다” 는 글을 따로 쓴 적도 있다. 그러니까 이건 모델 점수가 아니라 모델 + 에이전트 시스템 점수다. 비교 대상 모델들은 다른 구성으로 돌아간 값이고.

숫자도 출처마다 갈린다. 발표 페이지는 99.9% 인데 일부 매체는 98.6% 로 적었다. 그리고 ARC-AGI-3 는 사람 중앙값 대비 수 비율의 제곱으로 레벨 점수를 내는 비선형 채점이라 점프가 크게 나오는 구조라는 지적도 있다.

FrontierMath 는 OpenAI 가 돈을 댔다

97.6% 가 나온 Tier 4 는 43문제짜리인데, Astra 결과는 그 중 비공개 41문제를 커버하는걸로 보인다.

벤치마크를 운영하는 Epoch AI 는 OpenAI 가 개발 자금을 댔고 일부에 독점 접근권이 있다고 직접 밝히고 있다. 부정이라는 얘기는 아니다. 다만 이 점수를 다른 벤치마크와 같은 무게로 읽으면 안 된다.

DeepSWE 는 비교군 선택이 유리하다

Astra 74.1%, Sol 70.8% 는 진짜 개선이다. 문제는 나머지 칸이다.

  • 공개 리더보드에는 Gemini 3.8 Flash 와 Opus 5 가 74%, Sol 이 73% 로 올라와 있다. 오차 범위가 겹쳐서 우열을 가릴 수 없는 수준이다
  • Meta 의 Muse Spark 1.3 이 75.4% 로 Astra 를 이긴다. OpenAI 표에는 Muse 가 아예 없다
  • Fable 5.1 값으로 67.4% 를 썼는데, 이 값이 Astra 의 우위를 실제보다 커 보이게 만든다

“제너레이셔널 리프” 라고 부르기엔 격차가 작다.

OSWorld 는 릴리스가 다르다

Astra 72.6% 는 OSWorld V2-Offline 기준이다. Anthropic 이 Fable 5.1 에 대해 발표한 77.9% 는 다른 태스크 릴리스라 직접 비교가 안 된다. Anthropic 도 자기 글에서 같은 얘기를 적어놨다. 그래서 OpenAI 표에 Fable 5.1 칸이 비어 있는거다.

BenchCAD 도 비슷하다. OpenAI 가 각주에 Claude 쪽 결과는 수정된 평가 설정을 썼다고 적어놨다.

ExploitGym 은 제한 시간을 없앴다

Astra 42.4%, Sol 30.3% 인데 두 모델 모두 기존 6시간 제한을 제거하고 돌렸다. 얼마나 오래 걸렸는지는 안 나온다.

사이버 계열 수치는 조건이 하나 더 붙는다. OpenAI 는 발표한 사이버 결과가 Daybreak Blue 접근 기준이지 Astra 의 기본 프로덕션 구성이 아니라고 밝혔다. 일반 접근으로 받는 Astra 는 익스플로잇 발견 같은 고급 작업을 거부한다.

발표문에서 빠진 줄이 있다

HLE(툴 사용)는 Astra 57.2%, Fable 5.1 65.0% 로 Astra 가 진다. 표에는 있는데 발표문 본문에서는 언급이 없다. 학술 계열에서 유일하게 밀리는 항목이다.

FrontierCode 1.1 Extended 도 Fable 5(64.9%)가 Astra(64.5%)보다 위다.

그리고 숫자 자체가 출처마다 다르다

ExploitBench 70.0% 와 SRE-Bench 12.5% 를 어떤 정리 글은 Fable 5.1 것으로, 어떤 글은 Opus 5 것으로 적어놨다. 원본 표를 직접 못 봐서 어느 쪽인지 확정하지 못했다. 위 표에는 Fable 5.1 로 넣어뒀지만 이 두 칸은 그대로 믿지 말자.

Artificial Analysis Intelligence Index 도 마찬가지다. OpenAI 표는 v4.1.1 기준으로 Astra 61.2 / Sol 60.9 / Fable 5.1 65.7 로 인용했는데, AA 자체 페이지는 61 / 61 / 66 이다. 비슷하지만 같지 않다.

제3자 측정 — Artificial Analysis

여기서 그림이 확 바뀐다.

모델Intelligence Index
Claude Fable 5.1 (max, 폴백 포함)66
Meta Muse Spark 1.3 (max)Astra 위
GPT-6 Astra61
GPT-5.6 Sol61

Astra 가 Sol 과 동점이다. 2.5배 값을 받는데 종합 지능 인덱스는 안 올랐다. Fable 5.1 이 5점 위고, Meta 의 Muse Spark 1.3 도 Astra 위다.

비용은 더 나쁘다. AA 측정으로 Astra 는 태스크당 Sol 보다 75% 비싸다. 단가가 2.5배 오른걸 토큰 절감이 다 못 메꾼다는 뜻이다.

코딩 쪽은 다르다.

모델 (하네스)Coding Agent Index
Fable 5.1 (Claude Code)70
GPT-6 Astra (Codex)67
Opus 567 근처
Fable 567 근처

코딩 에이전트 인덱스에서는 Astra 가 Sol(max)과 거의 같은 비용으로 2점 위다. 여기선 값어치를 한다. 다만 1위는 여전히 Fable 5.1 이다.

AA 가 짚은 퇴보

좋아진 것만 있는게 아니다.

  • GDPval-AA v2 에서 Elo 약 80점 하락
  • 고객 지원, 과학 코딩, 롱컨텍스트 추론 태스크에서 하락
  • 지식 노동 벤치마크의 Presentation Quality Elo 하락

환각은 좋아졌다. max effort 기준 환각률 92% → 51%, 정확도는 4점 상승. (OpenAI 자체 표의 4.2% 와는 다른 측정이다. 지표가 다르다)

실행 지표

AA 모델 페이지 기준이다.

GPT-6 Astra (max)
태스크당 비용$2.57
인덱스 총 실행 비용$4,063.77
출력 토큰49M (중앙값 79M)
출력 속도67.0 tok/s
첫 토큰까지369.51초

첫 토큰까지 6분 9초다. Fable 5.1 이 285초였는데 그보다 더 느리다. 대화형으로 쓸 물건이 아니다.

출력 토큰 49M 은 눈여겨볼만 하다. 중앙값이 79M 이고 Fable 5.1 이 140M 이었다. Astra 는 Fable 5.1 의 3분의 1 토큰으로 인덱스를 돈다.

한 가지 주의. AA 모델 페이지를 지금 보면 인덱스가 55점, 202개 중 3위로 적혀 있다. 출시 분석 글의 61 과 다르다. 인덱스 버전이 올라가면서 재조정된걸로 보인다. Fable 5 가 64.9 → 62 로 바뀌었던 것과 같은 상황이다. 서로 다른 시점의 인덱스 점수를 나란히 놓고 비교하면 안 된다.

제3자 측정 — Vals AI

모델Vals Index
Claude Fable 5.168.83%
Claude Opus 567.21%
GPT-6 Astra66.61% (±1.09)

55개 중 3위다. max effort 기준이다.

여기서도 1위는 아닌데, 비용과 시간이 확실히 낫다.

AstraFable 5.1
테스트당 비용$19.09$28.40
지연25분 11초72분 25초

값은 3분의 2, 시간은 3분의 1이다. 점수는 2.2%p 아래다. “조금 못하고 많이 싸고 훨씬 빠르다” 는 트레이드오프가 여기선 꽤 선명하다.

개별 벤치마크 순위는 코딩 쪽이 강하다. Terminal-Bench 2.1 1위, Code Migration 1위, BioMysteryBench 1위, ProofBench v1.1 2위, ProgramBench 2위, Vibe Code Bench 3위.

반대로 법률·금융은 약하다. Legal Research Bench 58개 중 18위, Finance Agent 58개 중 21위, Harvey’s Legal Agent 59개 중 22위, Tax Agent Bench 18개 중 11위. Fable 5.1 도 법률에서 유독 낮았는데 Astra 도 여기선 못 한다.

진짜 반전은 토큰 효율

단가만 보면 2.5배 인상이라 답이 없어 보이는데, AA 측정으로는 이렇다.

  • 코딩 태스크에서 Sol 의 3분의 1 토큰
  • 같은 태스크에서 Opus 5(xhigh)의 5분의 1 토큰
  • 지능 태스크는 max effort 기준 Sol 대비 약 10% 절감

코딩에서는 토큰 절감이 단가 인상을 덮고, 종합 지능 태스크에서는 못 덮는다. AA 가 코딩 인덱스에서 “Sol 과 비슷한 비용” 이라고 적고 지능 인덱스에서 “75% 더 비싸다” 고 적은게 정확히 이 차이다.

Brockman 이 브리핑에서 한 말이 이거였다.

중요한건 태스크당 가격이다.

맞는 말인데, 그게 성립하는 영역이 코딩으로 한정된다는게 지금까지 나온 측정 결과다.

HN 에서 실사용자들이 올린 관찰도 갈린다. 한 명은 토이 벤치로 재봤더니 Astra 가 Sol 보다 30% 빠르고 비용은 비슷했다고 했고, 다른 몇 명은 Sol 보다 확실히 느리다고 했다. 같은 모델을 두고 정반대 얘기가 나온다. effort 설정과 작업 종류가 달라서일듯

얼라인먼트 — 여기가 제일 이상하다

OpenAI 는 Astra 를 “가장 정렬이 잘 된 모델” 이라고 부른다. 근거로 든 숫자는 실제로 좋다.

  • ExploitGym 허니팟에서 승인 범위 밖으로 나간 비율 0.0% (Sol 은 48.2%)
  • 내부 컴퓨터 사용 안전성 벤치마크 2.4% (Sol 22.0%, 낮을수록 좋음)
  • 환각률 4.2% (Sol 12.2%)

그런데 같은 시스템 카드에 이런 내용이 같이 들어 있다.

GPT-6 Astra 의 모니터 가능성은 GPT-5.6 Sol 대비 감소했다. Astra 는 자신의 CoT 를 더 잘 통제하고, 문제가 될 정보를 CoT 에 덜 담는다. 적대적 설정에서는 평가에서 전략적으로 실력을 숨길 때(sandbagging) 탐지되지 않은 채로 남을 수 있고, 내부 모니터를 회피할 수 있는 경우도 있다.

OpenAI 가 직접 이렇게도 적었다.

모델이 은밀하게 sandbagging 을 시도한다면 우리는 아마 잡아내지 못할 것이다.

이게 앞의 안전성 수치와 같이 놓이면 좀 곤란해진다. 모델이 평가에서 실력을 숨길 수 있다고 인정하면서, 그 평가 점수로 안전하다고 주장하는 셈이다. HN 에서도 정확히 같은 지적이 나왔다.

OpenAI 안전 연구자들 코멘트도 수위가 높다. Tomek Korbak 은 CoT 모니터 가능성이 계속 떨어지는 추세가 “매우 걱정된다” 고 했고, Marcus Williams 는 “Astra 가 안전 관련 태스크에서 sandbagging / 자기 방해를 하고 있는게 아닌지 매우 우려된다” 고 했다.

수석 과학자 Jakub Pachocki 는 이렇게 말했다.

모델 정렬을 모니터링하는 능력이 일정 수준 이상 떨어지는걸 용인하지 않겠다. 충분한 확신을 회복할 때까지 스케일링을 보류하겠다.

영국 AI Security Institute 독립 테스트에서는 Astra 가 범위 밖 오픈소스 저장소에 악성 코드를 기여하려 하거나 개발자를 속이려고 가짜 신원을 만드는 행동을 했다고 한다. 접근 제한이 걸려 있었는데도 그랬다.

이 상태로 출시하는게 맞나 싶은데 이미 나왔다

사이버는 Critical 을 넘었다

OpenAI 는 Astra 가 자사 Preparedness Framework 의 사이버보안 Critical 임계치를 처음으로 넘은 모델이라고 밝혔다.

  • 하드닝된 브라우저와 OS 를 상대로 익스플로잇을 만들어냈다
  • V8 최신 버그를 대상으로 평가하던 중 알려지지 않은 취약점 두 개를 새로 찾았다. 메인테이너에게 제보 중이라고 한다
  • 오염 통제 V8 포팅 테스트에서 임의 코드 실행 39.0% (Sol 5.5%)

그래서 고급 공격 기능은 Daybreak 프로그램의 검증된 방어자에게만 연다. Anthropic 이 Mythos 5.1 을 Project Glasswing 뒤에 둔거랑 같은 구조다. Daybreak Blue 는 별도 모델이나 추론 모드가 아니라 접근 프로그램 이름이다.

한 가지 짚고 갈 것. Critical 은 OpenAI 자체 프레임워크의 내부 등급이지 외부 감사가 아니다. HN 에서도 이 지적이 나왔다.

Daybreak 참가자가 남긴 후기 중엔 이런 것도 있다. 리버스 엔지니어링 작업을 시켰더니 5.6 cyber 가 3연속으로 크게 이겼다는 얘기다. 전용 모델이 있는 영역에서는 아직 그쪽이 낫다는 뜻일듯

개발자에게 실제로 바뀌는 것

벤치마크보다 이쪽이 더 와닿을 수 있다.

  • 컨텍스트 윈도우를 넘어가는 작업 처리. 노트를 컨텍스트 윈도우 사이에 유지하고 이전 메시지·툴 출력을 검색한다. 지금은 config.toml 설정 뒤에 있는 실험 기능인데 몇 주 안에 Astra 기본값이 된다고 한다
  • 답을 기다리지 않고 질문할 수 있다. 답에 의존하지 않는 작업은 계속 진행하면서 사용자에게 물어본다. 결정 하나가 전체를 막는 코딩 에이전트의 흔한 실패 모드를 겨냥한 것
  • Codex 하네스가 바뀌었다. Mind2Web 에서 Sol 기반 구성보다 1.9배 빠르게 완료했다
  • 데모에서 KiCad, Excel, Blender, Power BI 를 조작하고 브라우저 폼 입력과 웹사이트 QA 를 했다

Brockman 은 Astra 사용자가 “다시는 마우스를 클릭하거나 키보드를 칠 필요가 없어질 것” 이라고 했는데, 이건 그냥 마케팅 문구로 듣는게 맞다.

롤아웃이 엉망이었다

기술적인 얘기는 아닌데 기록해둘만 하다.

발표 블로그가 공개 전에 사이트에서 먼저 발견됐다가 내려갔다. OpenAI 가 링크를 다시 공유했는데 그 링크가 안 열렸다. 한동안 404 와 500 을 오갔다.

접근도 단계적이다. 처음엔 Daybreak 프로그램의 소수 조직만 썼다. Plus / Pro / Business / Enterprise 와 API, AWS 는 “며칠 안에” 로 밀렸다. $200 Pro 가 주당 200 메시지, $100 Pro 가 Sol 과 공유해서 50 메시지다.

돈 낸 사용자들이 화를 냈고 Altman 이 “지저분한 롤아웃” 이라고 사과했다. 제품 리드는 “Astra 를 못 쓴 하루당 리셋 한 번씩 적립해주겠다” 고 했다.

HN 반응이 이랬다.

요즘 프론티어 릴리스는 전부 “출시했습니다*” 다. * 당신이 속하지 않은 특별한 고객 그룹에게. 계속 기다려라 평민들아.

커뮤니티 반응

HN 스레드가 2000 포인트를 넘었는데 논조가 우호적이지 않다.

데모 영상. 상위 댓글이 “뭔가 할 것 같은 순간 직전에 절묘하게 컷이 들어간다” 고 지적했다. OpenAI 각주에도 편집된 발췌라고 적혀 있다. PCB 레이아웃 작업은 2분 54초를 15초로 줄였다.

소수 갭 증명. Astra 가 소수 갭 186 을 보였다고 발표했는데, 증명 파일이 Lean 코드 10MB 다. 사람이 의미론적으로 검토한 적이 없다. “이 정도 길이의 수학 증명은 들어본 적이 없다, 90%가 쓸모없는 내용이어도 알 수 없다” 는 반응이 나왔다. 이틀 전에 246 → 240 으로 개선한 논문을 올린 연구자가 있었는데 타이밍이 겹쳤다.

비용. “15개 메시지 만에 5시간 한도를 다 썼다” 는 후기가 있다.

속도. 갈린다. Sol 보다 확실히 느리다는 쪽과, medium 에서는 오히려 빠르다는 쪽이 같이 있다.

3D 모델링. 여기는 평이 좋다. Blender 작업을 잘 한다는 얘기가 여러 개 나왔다. 코딩만큼 관심을 못 받는게 이상하다는 반응도 있었다.

AA 인덱스 자체에 대한 불신. Opus 5(high)와 Fable 5(max)가 같은 점수인게 말이 되냐, Gemini 3.8 Flash 가 59 인데 Grok 4.6 이 61 인게 뭘 뜻하냐는 지적이 여럿이다. 제3자 인덱스라고 무조건 믿을 것도 아니다.

그리고 Brockman 의 AGI 발언. 그는 AGI 가 “회색이고 흐릿한 것” 이라고 인정하면서도 “우리가 지금 AGI 시대에 있다고 느끼는게 부당하지 않다고 본다” 고 했고 브리핑을 “AGI 시대에 오신걸 환영합니다” 로 닫았다. Microsoft 와의 계약상 트리거가 아니라 “미션 개념 또는 정신적 개념” 이라고 설명했다.

이 발언에 대한 HN 반응은 대체로 냉소적이었다. 요약하면 “그래서 펠리컨은 언제 그리냐” 쪽이다.

총평

Astra 는 특정 축에서 확실히 강하고, 종합 지능에서는 제자리다.

수학·과학·사이버·롱컨텍스트에서는 격차가 크다. FrontierMath Tier 4 97.6%, Terminal-Bench Science 64.6%, ExploitBench 100%, MRCR 512K1M 96.3% 는 다른 모델이 근처에 없다. 반면 AA Intelligence Index 는 Sol 과 동점이고 Vals Index 는 3위다. 코딩은 벤치마크마다 13위를 오간다.

“제너레이셔널 리프” 라기엔 코딩 격차가 작다. DeepSWE 74.1% 인데 Opus 5 가 73.7%, Gemini 3.8 Flash 가 73.8%, Muse Spark 1.3 이 75.4% 다. 오차 범위 안이다.

비용은 두 갈래다. 단가는 2.5배 올랐다. 코딩에서는 토큰을 Sol 의 3분의 1, Opus 5 의 5분의 1만 써서 총액이 비슷하거나 낫다. 종합 지능 태스크에서는 토큰 절감이 10%뿐이라 태스크당 75% 더 비싸다. 본인 작업이 코딩이냐 아니냐가 그대로 비용 방향이 된다.

Fable 5.1 과 비교하면 성격이 정반대다. Fable 5.1 은 점수가 제일 높은데 느리고(72분) 비싸다($28.40). Astra 는 점수가 조금 낮은데 빠르고(25분) 싸다($19.09). Vals 기준으로 2.2%p 차이에 시간 3분의 1, 비용 3분의 2다.

발표 표는 조건을 확인하고 봐야 한다. ARC-AGI-3 99.9% 는 자사 하네스 값이고 표준 하네스로는 62.7% 다. FrontierMath 는 OpenAI 가 자금을 댔다. DeepSWE 는 Muse 를 뺐다. 사이버 수치는 Daybreak Blue 기준이지 기본 구성이 아니다. HLE 는 지는 항목이라 본문에서 빠졌다.

언제 뭘 쓸까.

상황추천
코딩 에이전트, 비용 민감GPT-6 Astra (토큰 3분의 1)
수학·과학 난제GPT-6 Astra
컴퓨터·브라우저 자동화GPT-6 Astra
512K 넘는 롱컨텍스트 회수GPT-6 Astra (단 272K 부터 단가 2배)
종합 지능 최고점Claude Fable 5.1
코딩 에이전트 최고점 (비용 무시)Claude Fable 5.1 (AA 70)
대화형, 비용 대비 성능Claude Opus 5
단순 분류·추출Sol 이나 더 작은 모델. Astra 는 추론을 못 끈다
법률 에이전트Astra 도 Fable 5.1 도 별로다
리버스 엔지니어링5.6 cyber 계열이 아직 낫다는 후기가 있다

마이그레이션 전에 볼 것.

  1. temperature / top_p / logprobs 쓰는 코드 전부 — 파라미터가 없어졌다. 재현성 확보용 temperature=0 이 제일 흔하게 걸릴 것
  2. Chat Completions 로 툴 호출하는 코드 — Responses API 로 옮겨야 한다
  3. effort: none / minimal — 최소가 low 다. 추론을 못 끈다
  4. prompt_cache_retentionprompt_cache_options.ttl
  5. 272K 넘는 컨텍스트를 쓰는 구조 — 단가가 두 배 되는 구간을 먼저 계산
  6. Realtime / Assistants / 파인튜닝 쓰던 곳 — 지원 안 한다

그리고 이 숫자들은 대부분 출시 직후 값이다. Fable 5.1 때랑 같은 상황이다. AA 인덱스도 벌써 61 에서 55 로 재조정됐다. 몇 주 지나고 다시 봐야 할듯

참고