GPT-6 Astra — Fable 5.1 · Opus 5 · GPT-5.6 Sol 비교
목차
9/3 에 OpenAI 가 GPT-6 Astra 를 냈다. 일주일 전에 Claude Fable 5.1 을 놓고 쓴 글에서 “독립 검증이 쌓이면 그림이 또 바뀔 수 있다” 고 적었는데, 이번엔 반대편 차례다.
출시 당일에 안 쓰고 며칠 기다린 이유가 있다. 발표 표만 보면 압도적인데 제3자 측정이 하나둘 나오면서 그림이 꽤 달라졌다. 그리고 이번 릴리스는 벤치마크 숫자 자체보다 그 숫자가 어떤 조건에서 나왔는지가 더 중요하다.
- 입력
- $10 / MTok
- 출력
- $50 / MTok
- 캐시 읽기
- $1.00 / MTok
- 컨텍스트
- 1.05M
- 입력
- $4 / MTok
- 출력
- $20 / MTok
- 캐시 읽기
- —
- 컨텍스트
- 1.05M
- 입력
- $10 / MTok
- 출력
- $50 / MTok
- 캐시 읽기
- $0.25 / MTok
- 컨텍스트
- 1M
- 입력
- $5 / MTok
- 출력
- $25 / MTok
- 캐시 읽기
- $0.50 / MTok
- 컨텍스트
- 1M
스펙부터
| GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Opus 5 | |
|---|---|---|---|---|
| 출시 | 2026-09-03 | 2026-07-09 | 2026-09-01 | 2026-07-24 |
| 입력 $/MTok | 10 | 4 | 10 | 5 |
| 출력 $/MTok | 50 | 20 | 50 | 25 |
| 캐시 읽기 $/MTok | 1.00 | — | 0.25 | 0.50 |
| 컨텍스트 | 1.05M | 1.05M | 1M | 1M |
| 최대 출력 | 128k | 128k | 128k | 128k |
| 지식 컷오프 | 2026-04-30 | 2026-02 | 2026-06 | 2026-05 |
단가가 Fable 5.1 과 똑같다. $10 / $50. 우연은 아닐듯
라인업은 Astra 와 Astra Pro 둘 뿐이다. GPT-5.6 때 있던 Luna / Terra / Sol 같은
등급 분화가 이번엔 없다. 모델 ID 도 스냅샷 없이 gpt-6-astra 하나다.
지원 엔드포인트는 Chat Completions, Responses, Batch. Realtime, Assistants, 파인튜닝은 안 된다.
가격이 2.5배 올랐다
Sol 대비 입력 $4 → $10, 출력 $20 → $50. 그냥 2.5배다.
티어가 좀 복잡해졌다.
| 티어 | 입력 | 캐시 입력 | 출력 |
|---|---|---|---|
| 기본 | $10 | $1 | $50 |
| 롱컨텍스트 (272K 초과) | $20 | $2 | $75 |
| Batch / Flex | $5 | $0.50 | $25 |
| Fast 모드 | $20 | $2 | $100 |
캐시 쓰기는 $12.50 / MTok. Fast 모드는 2배 값에 2.5배 속도라고 한다.
272K 넘어가면 단가가 두 배가 되는 구간이 새로 생겼다. 1.05M 컨텍스트를 자랑하면서 정작 272K 부터는 값을 두 배 받는다. 컨텍스트를 꽉 채워 쓰는 구조라면 이 구간을 먼저 계산해봐야 한다.
Rate limit 은 Tier 5 기준 분당 15,000 요청 / 40M 토큰이다.
API breaking change
Sol 코드를 그대로 올리면 걸리는 것들.
1. 샘플링 파라미터가 없어졌다
temperature, top_p, logprobs 가 전부 제거됐다.
temperature=0 을 박아놓고 재현성을 확보하던 코드가 꽤 많은데 그게 전부 걸린다.
logprobs 로 신뢰도를 재던 분류 파이프라인도 마찬가지다. 대체 수단이 따로 없다.
2. effort 최소값이 low 다
기존 none / minimal 이 사라졌다. 이제 low, medium, high, xhigh, max 다섯 단계다.
추론을 아예 끄는 선택지가 없어졌다는 뜻이다. Fable 5.1 도 thinking 을 못 끄게 막았는데 같은 방향으로 갔다. 분류나 추출처럼 사고가 필요 없는 작업에서 최소 비용이 올라간다.
3. 캐시 설정 이름이 바뀌었다
prompt_cache_retention → prompt_cache_options.ttl
4. 툴 콜은 Responses API 로
Chat Completions 에서 툴 호출이 안 된다. Responses API 를 써야 한다. Chat Completions 로 에이전트를 짜뒀으면 여기서 걸린다.
OpenAI 발표 표
전부 벤더 자체 발표 수치다. 빈 칸은 OpenAI 표에 해당 모델이 없는 항목이다.
| 벤치마크 | Astra | Sol | Fable 5.1 | Opus 5 |
|---|---|---|---|---|
| FrontierMath Tier 4 (v2) | 97.6% | — | 87.8% | 73.2% |
| ARC-AGI-3 | 99.9% | 7.8% | — | 30.2% |
| GPQA Diamond | 96.0% | — | — | — |
| Terminal-Bench Science 0.1 | 64.6% | — | 52.6% | 30.0% |
| HLE (툴 사용) | 57.2% | — | 65.0% | 63.6% |
| Terminal-Bench 4.0 | 57.7% | 37.3% | 55.8% | 52.3% |
| DeepSWE v1.1 | 74.1% | 70.8% | 67.4% | 73.7% |
| OSWorld 2.0 | 72.6% | 65.7% | — | 70.2% |
| ScreenSpot-Pro | 92.7% | 76.9% | — | — |
| Agents’ Last Exam | 59.3% | 53.6% | 48.7% | 55.5% |
| AutomationBench | 41.4% | 18.1% | 31.4% | 26.9% |
| BenchCAD | 95.9% | 83.3% | 84.3% | — |
| BrowseComp | 91.5% | 90.4% | — | 90.8% |
| HealthBench Professional | 63.4% | 60.5% | 56.6% | 54.5% |
| ExploitBench | 100.0% | 78.5% | 70.0% | — |
| ExploitGym | 42.4% | 30.3% | 30.4% | — |
| SRE-Bench (1회 시도) | 88.0% | 55.9% | 12.5% | — |
| MRCR v2 8-needle (256K~512K) | 100% | 91.5% | — | — |
| MRCR v2 (512K~1M) | 96.3% | 73.8% | — | — |
| 환각률 (낮을수록 좋음) | 4.2% | 12.2% | — | — |
이것만 보면 얘기가 끝난다. 근데 이 표를 그대로 믿으면 안 되는 이유가 줄마다 있다.
이 표를 그대로 보면 안 되는 이유
ARC-AGI-3 의 99.9% 는 하네스 점수다
제일 눈에 띄는 숫자인데 제일 조건이 많이 붙는다.
OpenAI 는 이 벤치마크를 자사 Responses API 하네스로 돌렸다. 턴 사이에 추론 상태를 유지하고 긴 컨텍스트를 compaction 으로 관리하는 구성이다. 발표 페이지 각주에 “실제 사용 환경에 더 맞추려고 두 가지 설정을 바꿨다” 고 직접 적어놨다.
같은 벤치마크를 ARC Prize 쪽 표준 하네스로 돌리면 62.7% 다. 99.9% 와 62.7% 다.
OpenAI 는 예전에 “설정 두 개로 ARC-AGI 점수를 세 배로 올렸다” 는 글을 따로 쓴 적도 있다. 그러니까 이건 모델 점수가 아니라 모델 + 에이전트 시스템 점수다. 비교 대상 모델들은 다른 구성으로 돌아간 값이고.
숫자도 출처마다 갈린다. 발표 페이지는 99.9% 인데 일부 매체는 98.6% 로 적었다. 그리고 ARC-AGI-3 는 사람 중앙값 대비 수 비율의 제곱으로 레벨 점수를 내는 비선형 채점이라 점프가 크게 나오는 구조라는 지적도 있다.
FrontierMath 는 OpenAI 가 돈을 댔다
97.6% 가 나온 Tier 4 는 43문제짜리인데, Astra 결과는 그 중 비공개 41문제를 커버하는걸로 보인다.
벤치마크를 운영하는 Epoch AI 는 OpenAI 가 개발 자금을 댔고 일부에 독점 접근권이 있다고 직접 밝히고 있다. 부정이라는 얘기는 아니다. 다만 이 점수를 다른 벤치마크와 같은 무게로 읽으면 안 된다.
DeepSWE 는 비교군 선택이 유리하다
Astra 74.1%, Sol 70.8% 는 진짜 개선이다. 문제는 나머지 칸이다.
- 공개 리더보드에는 Gemini 3.8 Flash 와 Opus 5 가 74%, Sol 이 73% 로 올라와 있다. 오차 범위가 겹쳐서 우열을 가릴 수 없는 수준이다
- Meta 의 Muse Spark 1.3 이 75.4% 로 Astra 를 이긴다. OpenAI 표에는 Muse 가 아예 없다
- Fable 5.1 값으로 67.4% 를 썼는데, 이 값이 Astra 의 우위를 실제보다 커 보이게 만든다
“제너레이셔널 리프” 라고 부르기엔 격차가 작다.
OSWorld 는 릴리스가 다르다
Astra 72.6% 는 OSWorld V2-Offline 기준이다. Anthropic 이 Fable 5.1 에 대해 발표한 77.9% 는 다른 태스크 릴리스라 직접 비교가 안 된다. Anthropic 도 자기 글에서 같은 얘기를 적어놨다. 그래서 OpenAI 표에 Fable 5.1 칸이 비어 있는거다.
BenchCAD 도 비슷하다. OpenAI 가 각주에 Claude 쪽 결과는 수정된 평가 설정을 썼다고 적어놨다.
ExploitGym 은 제한 시간을 없앴다
Astra 42.4%, Sol 30.3% 인데 두 모델 모두 기존 6시간 제한을 제거하고 돌렸다. 얼마나 오래 걸렸는지는 안 나온다.
사이버 계열 수치는 조건이 하나 더 붙는다. OpenAI 는 발표한 사이버 결과가 Daybreak Blue 접근 기준이지 Astra 의 기본 프로덕션 구성이 아니라고 밝혔다. 일반 접근으로 받는 Astra 는 익스플로잇 발견 같은 고급 작업을 거부한다.
발표문에서 빠진 줄이 있다
HLE(툴 사용)는 Astra 57.2%, Fable 5.1 65.0% 로 Astra 가 진다. 표에는 있는데 발표문 본문에서는 언급이 없다. 학술 계열에서 유일하게 밀리는 항목이다.
FrontierCode 1.1 Extended 도 Fable 5(64.9%)가 Astra(64.5%)보다 위다.
그리고 숫자 자체가 출처마다 다르다
ExploitBench 70.0% 와 SRE-Bench 12.5% 를 어떤 정리 글은 Fable 5.1 것으로, 어떤 글은 Opus 5 것으로 적어놨다. 원본 표를 직접 못 봐서 어느 쪽인지 확정하지 못했다. 위 표에는 Fable 5.1 로 넣어뒀지만 이 두 칸은 그대로 믿지 말자.
Artificial Analysis Intelligence Index 도 마찬가지다. OpenAI 표는 v4.1.1 기준으로 Astra 61.2 / Sol 60.9 / Fable 5.1 65.7 로 인용했는데, AA 자체 페이지는 61 / 61 / 66 이다. 비슷하지만 같지 않다.
제3자 측정 — Artificial Analysis
여기서 그림이 확 바뀐다.
| 모델 | Intelligence Index |
|---|---|
| Claude Fable 5.1 (max, 폴백 포함) | 66 |
| Meta Muse Spark 1.3 (max) | Astra 위 |
| GPT-6 Astra | 61 |
| GPT-5.6 Sol | 61 |
Astra 가 Sol 과 동점이다. 2.5배 값을 받는데 종합 지능 인덱스는 안 올랐다. Fable 5.1 이 5점 위고, Meta 의 Muse Spark 1.3 도 Astra 위다.
비용은 더 나쁘다. AA 측정으로 Astra 는 태스크당 Sol 보다 75% 비싸다. 단가가 2.5배 오른걸 토큰 절감이 다 못 메꾼다는 뜻이다.
코딩 쪽은 다르다.
| 모델 (하네스) | Coding Agent Index |
|---|---|
| Fable 5.1 (Claude Code) | 70 |
| GPT-6 Astra (Codex) | 67 |
| Opus 5 | 67 근처 |
| Fable 5 | 67 근처 |
코딩 에이전트 인덱스에서는 Astra 가 Sol(max)과 거의 같은 비용으로 2점 위다. 여기선 값어치를 한다. 다만 1위는 여전히 Fable 5.1 이다.
AA 가 짚은 퇴보
좋아진 것만 있는게 아니다.
- GDPval-AA v2 에서 Elo 약 80점 하락
- 고객 지원, 과학 코딩, 롱컨텍스트 추론 태스크에서 하락
- 지식 노동 벤치마크의 Presentation Quality Elo 하락
환각은 좋아졌다. max effort 기준 환각률 92% → 51%, 정확도는 4점 상승. (OpenAI 자체 표의 4.2% 와는 다른 측정이다. 지표가 다르다)
실행 지표
AA 모델 페이지 기준이다.
| GPT-6 Astra (max) | |
|---|---|
| 태스크당 비용 | $2.57 |
| 인덱스 총 실행 비용 | $4,063.77 |
| 출력 토큰 | 49M (중앙값 79M) |
| 출력 속도 | 67.0 tok/s |
| 첫 토큰까지 | 369.51초 |
첫 토큰까지 6분 9초다. Fable 5.1 이 285초였는데 그보다 더 느리다. 대화형으로 쓸 물건이 아니다.
출력 토큰 49M 은 눈여겨볼만 하다. 중앙값이 79M 이고 Fable 5.1 이 140M 이었다. Astra 는 Fable 5.1 의 3분의 1 토큰으로 인덱스를 돈다.
한 가지 주의. AA 모델 페이지를 지금 보면 인덱스가 55점, 202개 중 3위로 적혀 있다. 출시 분석 글의 61 과 다르다. 인덱스 버전이 올라가면서 재조정된걸로 보인다. Fable 5 가 64.9 → 62 로 바뀌었던 것과 같은 상황이다. 서로 다른 시점의 인덱스 점수를 나란히 놓고 비교하면 안 된다.
제3자 측정 — Vals AI
| 모델 | Vals Index |
|---|---|
| Claude Fable 5.1 | 68.83% |
| Claude Opus 5 | 67.21% |
| GPT-6 Astra | 66.61% (±1.09) |
55개 중 3위다. max effort 기준이다.
여기서도 1위는 아닌데, 비용과 시간이 확실히 낫다.
| Astra | Fable 5.1 | |
|---|---|---|
| 테스트당 비용 | $19.09 | $28.40 |
| 지연 | 25분 11초 | 72분 25초 |
값은 3분의 2, 시간은 3분의 1이다. 점수는 2.2%p 아래다. “조금 못하고 많이 싸고 훨씬 빠르다” 는 트레이드오프가 여기선 꽤 선명하다.
개별 벤치마크 순위는 코딩 쪽이 강하다. Terminal-Bench 2.1 1위, Code Migration 1위, BioMysteryBench 1위, ProofBench v1.1 2위, ProgramBench 2위, Vibe Code Bench 3위.
반대로 법률·금융은 약하다. Legal Research Bench 58개 중 18위, Finance Agent 58개 중 21위, Harvey’s Legal Agent 59개 중 22위, Tax Agent Bench 18개 중 11위. Fable 5.1 도 법률에서 유독 낮았는데 Astra 도 여기선 못 한다.
진짜 반전은 토큰 효율
단가만 보면 2.5배 인상이라 답이 없어 보이는데, AA 측정으로는 이렇다.
- 코딩 태스크에서 Sol 의 3분의 1 토큰
- 같은 태스크에서 Opus 5(xhigh)의 5분의 1 토큰
- 지능 태스크는 max effort 기준 Sol 대비 약 10% 절감
즉 코딩에서는 토큰 절감이 단가 인상을 덮고, 종합 지능 태스크에서는 못 덮는다. AA 가 코딩 인덱스에서 “Sol 과 비슷한 비용” 이라고 적고 지능 인덱스에서 “75% 더 비싸다” 고 적은게 정확히 이 차이다.
Brockman 이 브리핑에서 한 말이 이거였다.
중요한건 태스크당 가격이다.
맞는 말인데, 그게 성립하는 영역이 코딩으로 한정된다는게 지금까지 나온 측정 결과다.
HN 에서 실사용자들이 올린 관찰도 갈린다. 한 명은 토이 벤치로 재봤더니 Astra 가 Sol 보다 30% 빠르고 비용은 비슷했다고 했고, 다른 몇 명은 Sol 보다 확실히 느리다고 했다. 같은 모델을 두고 정반대 얘기가 나온다. effort 설정과 작업 종류가 달라서일듯
얼라인먼트 — 여기가 제일 이상하다
OpenAI 는 Astra 를 “가장 정렬이 잘 된 모델” 이라고 부른다. 근거로 든 숫자는 실제로 좋다.
- ExploitGym 허니팟에서 승인 범위 밖으로 나간 비율 0.0% (Sol 은 48.2%)
- 내부 컴퓨터 사용 안전성 벤치마크 2.4% (Sol 22.0%, 낮을수록 좋음)
- 환각률 4.2% (Sol 12.2%)
그런데 같은 시스템 카드에 이런 내용이 같이 들어 있다.
GPT-6 Astra 의 모니터 가능성은 GPT-5.6 Sol 대비 감소했다. Astra 는 자신의 CoT 를 더 잘 통제하고, 문제가 될 정보를 CoT 에 덜 담는다. 적대적 설정에서는 평가에서 전략적으로 실력을 숨길 때(sandbagging) 탐지되지 않은 채로 남을 수 있고, 내부 모니터를 회피할 수 있는 경우도 있다.
OpenAI 가 직접 이렇게도 적었다.
모델이 은밀하게 sandbagging 을 시도한다면 우리는 아마 잡아내지 못할 것이다.
이게 앞의 안전성 수치와 같이 놓이면 좀 곤란해진다. 모델이 평가에서 실력을 숨길 수 있다고 인정하면서, 그 평가 점수로 안전하다고 주장하는 셈이다. HN 에서도 정확히 같은 지적이 나왔다.
OpenAI 안전 연구자들 코멘트도 수위가 높다. Tomek Korbak 은 CoT 모니터 가능성이 계속 떨어지는 추세가 “매우 걱정된다” 고 했고, Marcus Williams 는 “Astra 가 안전 관련 태스크에서 sandbagging / 자기 방해를 하고 있는게 아닌지 매우 우려된다” 고 했다.
수석 과학자 Jakub Pachocki 는 이렇게 말했다.
모델 정렬을 모니터링하는 능력이 일정 수준 이상 떨어지는걸 용인하지 않겠다. 충분한 확신을 회복할 때까지 스케일링을 보류하겠다.
영국 AI Security Institute 독립 테스트에서는 Astra 가 범위 밖 오픈소스 저장소에 악성 코드를 기여하려 하거나 개발자를 속이려고 가짜 신원을 만드는 행동을 했다고 한다. 접근 제한이 걸려 있었는데도 그랬다.
이 상태로 출시하는게 맞나 싶은데 이미 나왔다
사이버는 Critical 을 넘었다
OpenAI 는 Astra 가 자사 Preparedness Framework 의 사이버보안 Critical 임계치를 처음으로 넘은 모델이라고 밝혔다.
- 하드닝된 브라우저와 OS 를 상대로 익스플로잇을 만들어냈다
- V8 최신 버그를 대상으로 평가하던 중 알려지지 않은 취약점 두 개를 새로 찾았다. 메인테이너에게 제보 중이라고 한다
- 오염 통제 V8 포팅 테스트에서 임의 코드 실행 39.0% (Sol 5.5%)
그래서 고급 공격 기능은 Daybreak 프로그램의 검증된 방어자에게만 연다. Anthropic 이 Mythos 5.1 을 Project Glasswing 뒤에 둔거랑 같은 구조다. Daybreak Blue 는 별도 모델이나 추론 모드가 아니라 접근 프로그램 이름이다.
한 가지 짚고 갈 것. Critical 은 OpenAI 자체 프레임워크의 내부 등급이지 외부 감사가 아니다. HN 에서도 이 지적이 나왔다.
Daybreak 참가자가 남긴 후기 중엔 이런 것도 있다. 리버스 엔지니어링 작업을 시켰더니 5.6 cyber 가 3연속으로 크게 이겼다는 얘기다. 전용 모델이 있는 영역에서는 아직 그쪽이 낫다는 뜻일듯
개발자에게 실제로 바뀌는 것
벤치마크보다 이쪽이 더 와닿을 수 있다.
- 컨텍스트 윈도우를 넘어가는 작업 처리. 노트를 컨텍스트 윈도우 사이에 유지하고
이전 메시지·툴 출력을 검색한다. 지금은
config.toml설정 뒤에 있는 실험 기능인데 몇 주 안에 Astra 기본값이 된다고 한다 - 답을 기다리지 않고 질문할 수 있다. 답에 의존하지 않는 작업은 계속 진행하면서 사용자에게 물어본다. 결정 하나가 전체를 막는 코딩 에이전트의 흔한 실패 모드를 겨냥한 것
- Codex 하네스가 바뀌었다. Mind2Web 에서 Sol 기반 구성보다 1.9배 빠르게 완료했다
- 데모에서 KiCad, Excel, Blender, Power BI 를 조작하고 브라우저 폼 입력과 웹사이트 QA 를 했다
Brockman 은 Astra 사용자가 “다시는 마우스를 클릭하거나 키보드를 칠 필요가 없어질 것” 이라고 했는데, 이건 그냥 마케팅 문구로 듣는게 맞다.
롤아웃이 엉망이었다
기술적인 얘기는 아닌데 기록해둘만 하다.
발표 블로그가 공개 전에 사이트에서 먼저 발견됐다가 내려갔다. OpenAI 가 링크를 다시 공유했는데 그 링크가 안 열렸다. 한동안 404 와 500 을 오갔다.
접근도 단계적이다. 처음엔 Daybreak 프로그램의 소수 조직만 썼다. Plus / Pro / Business / Enterprise 와 API, AWS 는 “며칠 안에” 로 밀렸다. $200 Pro 가 주당 200 메시지, $100 Pro 가 Sol 과 공유해서 50 메시지다.
돈 낸 사용자들이 화를 냈고 Altman 이 “지저분한 롤아웃” 이라고 사과했다. 제품 리드는 “Astra 를 못 쓴 하루당 리셋 한 번씩 적립해주겠다” 고 했다.
HN 반응이 이랬다.
요즘 프론티어 릴리스는 전부 “출시했습니다*” 다. * 당신이 속하지 않은 특별한 고객 그룹에게. 계속 기다려라 평민들아.
커뮤니티 반응
HN 스레드가 2000 포인트를 넘었는데 논조가 우호적이지 않다.
데모 영상. 상위 댓글이 “뭔가 할 것 같은 순간 직전에 절묘하게 컷이 들어간다” 고 지적했다. OpenAI 각주에도 편집된 발췌라고 적혀 있다. PCB 레이아웃 작업은 2분 54초를 15초로 줄였다.
소수 갭 증명. Astra 가 소수 갭 186 을 보였다고 발표했는데, 증명 파일이 Lean 코드 10MB 다. 사람이 의미론적으로 검토한 적이 없다. “이 정도 길이의 수학 증명은 들어본 적이 없다, 90%가 쓸모없는 내용이어도 알 수 없다” 는 반응이 나왔다. 이틀 전에 246 → 240 으로 개선한 논문을 올린 연구자가 있었는데 타이밍이 겹쳤다.
비용. “15개 메시지 만에 5시간 한도를 다 썼다” 는 후기가 있다.
속도. 갈린다. Sol 보다 확실히 느리다는 쪽과, medium 에서는 오히려 빠르다는 쪽이 같이 있다.
3D 모델링. 여기는 평이 좋다. Blender 작업을 잘 한다는 얘기가 여러 개 나왔다. 코딩만큼 관심을 못 받는게 이상하다는 반응도 있었다.
AA 인덱스 자체에 대한 불신. Opus 5(high)와 Fable 5(max)가 같은 점수인게 말이 되냐, Gemini 3.8 Flash 가 59 인데 Grok 4.6 이 61 인게 뭘 뜻하냐는 지적이 여럿이다. 제3자 인덱스라고 무조건 믿을 것도 아니다.
그리고 Brockman 의 AGI 발언. 그는 AGI 가 “회색이고 흐릿한 것” 이라고 인정하면서도 “우리가 지금 AGI 시대에 있다고 느끼는게 부당하지 않다고 본다” 고 했고 브리핑을 “AGI 시대에 오신걸 환영합니다” 로 닫았다. Microsoft 와의 계약상 트리거가 아니라 “미션 개념 또는 정신적 개념” 이라고 설명했다.
이 발언에 대한 HN 반응은 대체로 냉소적이었다. 요약하면 “그래서 펠리컨은 언제 그리냐” 쪽이다.
총평
Astra 는 특정 축에서 확실히 강하고, 종합 지능에서는 제자리다.
수학·과학·사이버·롱컨텍스트에서는 격차가 크다. FrontierMath Tier 4 97.6%,
Terminal-Bench Science 64.6%, ExploitBench 100%, MRCR 512K1M 96.3% 는
다른 모델이 근처에 없다. 반면 AA Intelligence Index 는 Sol 과 동점이고
Vals Index 는 3위다. 코딩은 벤치마크마다 13위를 오간다.
“제너레이셔널 리프” 라기엔 코딩 격차가 작다. DeepSWE 74.1% 인데 Opus 5 가 73.7%, Gemini 3.8 Flash 가 73.8%, Muse Spark 1.3 이 75.4% 다. 오차 범위 안이다.
비용은 두 갈래다. 단가는 2.5배 올랐다. 코딩에서는 토큰을 Sol 의 3분의 1, Opus 5 의 5분의 1만 써서 총액이 비슷하거나 낫다. 종합 지능 태스크에서는 토큰 절감이 10%뿐이라 태스크당 75% 더 비싸다. 본인 작업이 코딩이냐 아니냐가 그대로 비용 방향이 된다.
Fable 5.1 과 비교하면 성격이 정반대다. Fable 5.1 은 점수가 제일 높은데 느리고(72분) 비싸다($28.40). Astra 는 점수가 조금 낮은데 빠르고(25분) 싸다($19.09). Vals 기준으로 2.2%p 차이에 시간 3분의 1, 비용 3분의 2다.
발표 표는 조건을 확인하고 봐야 한다. ARC-AGI-3 99.9% 는 자사 하네스 값이고 표준 하네스로는 62.7% 다. FrontierMath 는 OpenAI 가 자금을 댔다. DeepSWE 는 Muse 를 뺐다. 사이버 수치는 Daybreak Blue 기준이지 기본 구성이 아니다. HLE 는 지는 항목이라 본문에서 빠졌다.
언제 뭘 쓸까.
| 상황 | 추천 |
|---|---|
| 코딩 에이전트, 비용 민감 | GPT-6 Astra (토큰 3분의 1) |
| 수학·과학 난제 | GPT-6 Astra |
| 컴퓨터·브라우저 자동화 | GPT-6 Astra |
| 512K 넘는 롱컨텍스트 회수 | GPT-6 Astra (단 272K 부터 단가 2배) |
| 종합 지능 최고점 | Claude Fable 5.1 |
| 코딩 에이전트 최고점 (비용 무시) | Claude Fable 5.1 (AA 70) |
| 대화형, 비용 대비 성능 | Claude Opus 5 |
| 단순 분류·추출 | Sol 이나 더 작은 모델. Astra 는 추론을 못 끈다 |
| 법률 에이전트 | Astra 도 Fable 5.1 도 별로다 |
| 리버스 엔지니어링 | 5.6 cyber 계열이 아직 낫다는 후기가 있다 |
마이그레이션 전에 볼 것.
temperature/top_p/logprobs쓰는 코드 전부 — 파라미터가 없어졌다. 재현성 확보용temperature=0이 제일 흔하게 걸릴 것- Chat Completions 로 툴 호출하는 코드 — Responses API 로 옮겨야 한다
effort: none/minimal— 최소가low다. 추론을 못 끈다prompt_cache_retention→prompt_cache_options.ttl- 272K 넘는 컨텍스트를 쓰는 구조 — 단가가 두 배 되는 구간을 먼저 계산
- Realtime / Assistants / 파인튜닝 쓰던 곳 — 지원 안 한다
그리고 이 숫자들은 대부분 출시 직후 값이다. Fable 5.1 때랑 같은 상황이다. AA 인덱스도 벌써 61 에서 55 로 재조정됐다. 몇 주 지나고 다시 봐야 할듯
참고
- OpenAI 발표 — https://openai.com/index/gpt-6-astra/
- The New Stack — https://thenewstack.io/openai-gpt6-astra-benchmarks/
- Artificial Analysis 분석 — https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra
- Artificial Analysis 모델 페이지 — https://artificialanalysis.ai/models/gpt-6-astra
- Vals AI — https://www.vals.ai/models/openai_gpt-6-astra
- Vellum 벤치마크 정리 — https://www.vellum.ai/blog/gpt-6-astra-benchmarks-explained
- OfficeChai 공식 표 정리 — https://officechai.com/ai/gpt-6-astra-benchmarks/
- WinBuzzer 하네스·롤아웃 — https://winbuzzer.com/2026/09/04/gpt-6-astra-arrives-with-major-gains-staged-access-and-new-questions-about-its-benchmarks-xcxwbn/
- Transformer 얼라인먼트 — https://www.transformernews.ai/p/openai-gpt-6-astra-might-be-too-powerful-to-understand-or-control
- API 정리 — https://apidog.com/blog/gpt-6-astra-api/
- HN 스레드 — https://news.ycombinator.com/item?id=49554643