Claude Opus 5.5 vs GPT-6 Sol — 비용 · 성능 · 코딩 에이전트
목차
9/22 에 Anthropic 이 Opus 5.5 를 냈고, 한 시간 반쯤 뒤에 OpenAI 가 GPT-6 Sol 과 Luna 를 냈다. 누가 봐도 맞불이다.
Astra 글 쓸 때처럼 이번에도 이틀 기다렸다. 출시 당일엔 양쪽 다 자기 표만 있고, 그 표도 상대 이전 모델이랑 비교해놔서 볼게 별로 없었다. Anthropic 표에는 GPT-5.6 Sol 이 있고 OpenAI 표에는 Opus 5 가 있다. 서로 신모델은 안 넣었다. 그 사이 Artificial Analysis 쪽 측정이 나와서 이제 좀 나란히 놓고 볼 수 있게 됐다.
이번 글은 세 가지만 본다. 비용, 종합 성능, 코딩 에이전트.
- 입력
- $4 / MTok
- 출력
- $20 / MTok
- 캐시 읽기
- $0.20 / MTok
- 컨텍스트
- 1M
- 입력
- $2 / MTok
- 출력
- $10 / MTok
- 캐시 읽기
- $0.20 / MTok
- 컨텍스트
- 1.05M
스펙
| Opus 5.5 | GPT-6 Sol | |
|---|---|---|
| 출시 | 2026-09-22 | 2026-09-22 |
| 입력 $/MTok | 4 | 2 |
| 출력 $/MTok | 20 | 10 |
| 캐시 읽기 $/MTok | 0.20 | 0.20 |
| 캐시 쓰기 $/MTok | 5 | 2.50 |
| Batch | 2 / 10 | 1 / 5 |
| Fast 모드 | 8 / 40 | 4 / 20 |
| 컨텍스트 | 1M | 1.05M (입력 최대 922K) |
| 최대 출력 | 128k | 128k |
| 지식 컷오프 | 2026-06 | 2026-04-20 |
| 기본 effort | medium | medium |
| 추론 끄기 | 불가 | none 가능 |
Sol 이 거의 모든 칸에서 딱 절반이다. 캐시 읽기만 같다.
Opus 5.5 는 Opus 5 보다 단가 20%, 캐시 읽기 60% 내렸다. Sol 은 GPT-5.6 Sol 에서 그냥 반값이 됐다. 양쪽 다 값을 내렸는데 OpenAI 가 더 크게 내렸다.
같이 나온 Luna 는 $0.10 / $0.50 이다. 이건 체급이 달라서 이 글에선 뺀다.
비용 — 반값이 반값이 아니다
단가표만 보면 Sol 이 무조건 반값인데 실제로 돌려보면 그렇게 안 된다. 이유가 두 개 있다.
캐시 읽기가 같은 값이다
에이전트는 같은 컨텍스트를 계속 다시 읽는다. 토큰 대부분이 캐시 읽기다. 그런데 그 칸이 $0.20 으로 똑같다. 캐시 비중이 높을수록 차이가 줄어든다.
272K 넘으면 Sol 은 할증이 붙는다
입력이 272K 를 넘으면 요청 전체에 입력 2배, 출력 1.5배가 붙는다. Opus 5.5 는 1M 까지 할증이 없다.
Digital Applied 에서 같은 토큰량을 넣고 계산한 예시가 있다. 입력 400K, 캐시 읽기 8M, 캐시 쓰기 600K, 출력 300K 짜리 에이전트 작업이다.
| 비용 | |
|---|---|
| Opus 5.5 | $12.20 |
| GPT-6 Sol (기본 단가) | $6.90 |
| GPT-6 Sol (272K 할증) | $12.30 |
할증 구간에 들어가면 Sol 이 오히려 조금 더 비싸다. 할증이 없어도 50% 가 아니라 57% 정도다. 긴 레포를 통째로 물려서 돌리는 에이전트라면 이 부분부터 계산해봐야 할듯
하나 더 있다. Opus 5.5 는 대화 중간에 top-level effort 를 바꾸면 캐시가 깨진다. Sol 은 effort 를 바꾸거나 툴을 켰다 꺼도 캐시가 유지된다고 한다. Opus 쪽도 메시지 단위 effort 베타가 있긴 한데 아직 베타다.
태스크당 비용 — effort 별로 보면
단가보다 이게 더 중요하다. AA Intelligence Index(v4.3.2)를 effort 단계별로 돌린 값이다.
| effort | Opus 5.5 점수 | 태스크당 | Sol 점수 | 태스크당 |
|---|---|---|---|---|
| low | 42.3 | $0.55 | 33.9 | $0.13 |
| medium (기본) | 51.2 | $1.34 | 39.8 | $0.25 |
| high | 53.6 | $1.82 | 42.8 | $0.37 |
| xhigh | 56.0 | $3.46 | 44.1 | $0.53 |
| max | 57.6 | $5.98 | 47.5 | $1.06 |
같은 effort 끼리 놓으면 Sol 이 5배 정도 싸다. 토큰 단가는 2배 차이인데 태스크당은 5배다. Opus 5.5 가 토큰을 훨씬 많이 쓴다는 얘기다.
근데 같은 돈끼리 놓으면 그림이 바뀐다.
- $0.5 근처: Sol xhigh 44.1 ($0.53) vs Opus low 42.3 ($0.55). 비슷한 돈에 Sol 이 조금 위
- $1 근처: Sol max 47.5 ($1.06) vs Opus medium 51.2 ($1.34). 30센트 더 내면 Opus 가 4점 위
대충 태스크당 50센트 아래 구간은 Sol 이 먹고, 1달러 넘어가면 Opus 가 먹는 구조다. Sol 은 max 까지 올려도 47.5 에서 멈춘다. Opus 의 기본값보다 낮다.
반대로 Opus 도 xhigh → max 는 효율이 별로다. 1.6점 올리는데 $2.5 더 든다.
max 는 그냥 벤치마크용 설정 같다
종합 성능
벤더 표
앞에서 말한 대로 서로 신모델은 안 넣었다. 그래도 겹치는 항목만 뽑으면 이렇다.
| 벤치마크 | Opus 5.5 | GPT-6 Sol | 비고 |
|---|---|---|---|
| AutomationBench | 40.0% | 33.2% | Sol 은 xhigh, 태스크당 $0.27 |
| OSWorld 2.0 | 81.8% | 60.5% | Sol 은 Offline 셋. 릴리스가 다를 수 있다 |
둘 다 Opus 5.5 가 앞선다. OSWorld 는 Astra 글에서도 적었지만 태스크 릴리스가 다르면 직접 비교가 안 된다. 21점 차이를 그대로 믿기는 어렵다.
Anthropic 표 나머지는 Terminal-Bench 4.0 66.4%, FrontierCode 54.4%, CursorBench 57.8%, HLE 67.7%, GDPval-AA 1846. 전부 max effort 값이다.
OpenAI 표는 DeepSWE 68.8%, Agents’ Last Exam 56.4%. 발표문에서 제일 밀어준 문장은 “Fable 5 xhigh(69.9%)에 1.1점 차이까지 왔는데 비용은 80% 적다” 였다.
그리고 OpenAI 자기 차트에서도 DeepSWE, OSWorld 는 GPT-5.6 Sol 이 GPT-6 Sol 보다 높게 찍혀 있다는 지적이 있다. 반값으로 내리면서 일부 워크로드는 뒤로 간걸로 보인다.
제3자 — Artificial Analysis
| Opus 5.5 | GPT-6 Sol | |
|---|---|---|
| Intelligence Index (max) | 58 (1위) | 48 |
| 인덱스 태스크당 (max) | $5.98 | $1.06 |
| 출력 속도 (high) | 90 tok/s | 103 tok/s |
10점 차이다. 작지 않다.
Opus 5.5 는 AA 인덱스 1위로 올라갔다. Fable 5.1 보다 위다. Anthropic 이 “Fable 5.1 급을 싸게” 라고 한게 여기선 맞는 말이었다.
항목별로 보면 (Opus medium vs Sol max 기준):
| 항목 | Opus 5.5 | Sol | |
|---|---|---|---|
| Terminal-Bench 4.0 | 52.5% | 43.9% | Opus |
| GDPval-AA (Elo) | 1576 | 1487 | Opus |
| AA-Briefcase (Elo) | 1642 | 1483 | Opus |
| SciCode | 59.3% | 57.6% | 비슷 |
| AA-LCR (롱컨텍스트) | 84.3% | 83.7% | 비슷 |
| CritPt (물리) | 27.7% | 30.9% | Sol |
| AA-Omniscience 정답률 | 64.5% | 54.5% | Opus |
| 환각률 (낮을수록 좋음) | 68.4% | 60.1% | Sol |
Opus 는 medium 이고 Sol 은 max 다. 그래도 Opus 가 대부분 이긴다.
재밌는건 마지막 두 줄이다. 정답은 Opus 가 더 많이 맞히는데, 모를 때 지어내는건 Opus 가 더 많이 한다. Sol 은 GPT-5.6 Sol 때 환각률 92% 에서 60% 로 크게 내려왔다. 모르면 모른다고 하는 쪽으로 튜닝한듯
코딩 에이전트
제일 궁금했던 부분이다.
AA Coding Agent Index (v1.5)
각자 자기 하네스에서 max effort 로 돌린 값이다.
| 모델 (하네스) | 점수 | 태스크당 |
|---|---|---|
| Opus 5.5 (Claude Code) | 66 | $13.04 |
| Fable 5.1 | 62 | — |
| Opus 5 | 60 | $10.79 |
| GPT-6 Sol (Codex) | 57 | $2.99 |
9점 차이에 4.4배 가격이다.
세부 항목은 이렇다.
| Opus 5.5 | GPT-6 Sol | |
|---|---|---|
| Terminal-Bench 4.0 | 63.1% | 43% |
| SWE-Atlas-QnA | 66.4% | 58% |
| DeepSWE v1.1 | 68.4% | 68.8% (OpenAI 발표) |
터미널 작업에서 차이가 크다. 20점이다. DeepSWE 는 거의 같은데 Sol 쪽은 OpenAI 가 직접 잰 값이라 하네스가 다르다. 같다고 보긴 애매하다.
참고로 지난 Astra 글에서 Fable 5.1 코딩 인덱스를 70 이라고 적었는데, v1.5 로 바뀌면서 62 가 됐다. 인덱스 버전이 다른 숫자끼리는 비교하면 안 된다. 매번 적는 얘긴데 매번 걸린다..
Opus 5.5 는 단가를 내렸는데 태스크당은 올랐다
이게 좀 웃긴데, Opus 5 → 5.5 로 토큰 단가가 20% 내렸는데 코딩 인덱스 태스크당 비용은 $10.79 → $13.04 로 21% 올랐다.
출력 토큰이 태스크당 137K → 333K 로 2.4배가 됐다. 더 오래, 더 많이 생각한다. 점수가 6점 오른 값이다. 싸진게 아니라 같은 돈에 더 일을 하는 쪽으로 바뀐거다.
Anthropic 이 말한 “일반 워크로드 40% 절감” 은 기본값인 medium 기준일듯. Claude Code 에서 max 로 돌리면 청구서는 오히려 늘어날 수 있다.
Sol 은 5.6 보다 2점 올랐다
Sol 은 GPT-5.6 Sol 대비 코딩 인덱스 +2점, 태스크당 비용은 절반이다. Terminal-Bench 4.0 이 37% → 43%, SWE-Atlas-QnA 54% → 58%.
성능을 크게 올린 릴리스가 아니고 같은 성능을 반값에 파는 릴리스다. AA 도 그렇게 요약했다.
벤더가 내세운 사례
전부 벤더가 고른 고객 사례라 걸러서 봐야 한다.
Opus 5.5 쪽
- 68만 줄 코드 마이그레이션을 하루 안에 끝냈다
- 20만 줄 코드베이스 감사·수정을 3시간 안에. Opus 5 는 20시간 넘게 걸렸고 토큰은 2.5배
- HAProxy C → Rust 변환을 9.5시간에. Fable 5.1 은 12시간, 비용은 51% 적게
- FrontierCode 에서 medium 으로 Astra max 를 이겼는데 비용은 20% 수준
Sol 쪽
- GitHub Copilot 에서 캐시 개선으로 새로 처리하는 프롬프트 토큰이 50% 이상 줄었다
- 뭘 검증했고 뭘 안 했는지 먼저 말하고, 서론 없이 diff 부터 준다는게 OpenAI 설명이다
직접 돌려본 비교 하나
DataCamp 에서 같은 프롬프트로 테트리스 클론을 시켜봤다. 20초마다 중력이 뒤집히는 단일 HTML 파일이다. high effort.
| GPT-6 Sol | Opus 5.5 | |
|---|---|---|
| 턴 | 6 | 3 |
| 툴 호출 | 9 | 2 |
| 비용 | $0.26 | $0.87 |
| 총 토큰 | 120,226 | 107,958 |
| 루브릭 점수 | 5.0 | 4.3 |
둘 다 중력 반전 로직은 제대로 짰다. 완성도랑 UI 에서 Sol 이 이겼다. Sol 은 여러 번 나눠서 고치고, Opus 는 한 번에 크게 쓰는 스타일이다. 토큰은 Opus 가 더 적게 썼는데 단가 때문에 비용은 3배 넘게 나왔다.
테스트 하나라 일반화하긴 어렵다. 다만 작고 닫힌 작업에서는 Sol 로 충분하다는 쪽에 힘을 싣는 결과인듯
하네스 얘기
두 모델 다 자기 에이전트 안에서 제일 잘 돈다. Opus 5.5 는 Claude Code, Sol 은 Codex. GitHub Copilot 에서는 둘 다 고를 수 있다.
Opus 5.5 는 Claude Code, Claude 앱, Cowork 에서 Pro / Max / Team 기본 모델이 됐다. 나도 이 블로그를 Claude Code 로 관리하는데 업데이트하고 보니 이미 바뀌어 있었다.
Codex 쪽은 이슈가 하나 올라와 있다. Codex CLI 에서 Sol 의 실효 컨텍스트가 828.4K 로 잘린다는 내용이다. 스펙은 1.05M 인데. GPT-5.6 Sol 때도 컨텍스트가 잘렸다는 이슈가 몇 번 있었다.
사용량 한도는 Plus 기준 5시간에 Sol 15150 메시지다. 5.6 Sol 때 10100 보다는 늘었다.
HN 에서는 5.6 Sol 의 말투랑 엔지니어링 감각이 좋았다는 사람들이 꽤 있었다.
6 으로 오면서 그 느낌이 달라졌다는 얘기도 같이 나온다.
API 바꿀 때 걸리는 것
Opus 5 → Opus 5.5
- thinking 을 못 끈다.
{type: "disabled"}도budget_tokens도 400 이다. effort 로만 조절한다 - 기본 effort 가
medium이다. Opus 5 는high였다. 그냥 모델명만 바꾸면 한 단계 낮게 돈다. 명시하자 tool_choice의any/tool이 400 이다.auto에strict: true쓰고 프롬프트로 유도하거나 structured output 으로- thinking 블록이 모델·대화에 묶인다. 폴백으로 Opus 5 가 받으면 thinking 없이 돈다
- computer use 는
computer_toolset_20260801만 된다.computer_20251124는 400 - 툴 호출 사이 텍스트가 progress update 로
thinking블록에 들어온다. 보려면display: "updates"
2번이 제일 조용하게 걸릴듯. 에러도 안 나고 점수만 떨어진다.
GPT-5.6 Sol → GPT-6 Sol
- Chat Completions 에서 툴 호출은
reasoning_effort: none일 때만 된다. 추론 켜고 툴 쓰려면 Responses API - effort 는
none~max. 기본medium - 272K 넘는 요청은 할증. 컨텍스트 꽉 채우는 구조면 다시 계산
Sol 은 추론을 끌 수 있다. 분류나 추출 같은 단순 작업에선 이게 꽤 크다. Opus 5.5 는 low 가 최소라서 가벼운 작업에도 기본 비용이 깔린다.
안전 쪽은 짧게
Opus 5.5 는 시스템 카드랑 METR 외부 평가가 같이 나왔다.
경계를 우회하려는 시도가 Opus 5 대비 85% 줄었다고 한다.
분류기가 넓어져서 bio, reasoning_extraction 카테고리가 새로 붙었다. 오탐으로 거절당하는 경우가 좀 늘 수 있다.
Sol / Luna 는 출시 시점에 시스템 카드가 없었다. 경고를 무시하고 우회를 시도한 비율이 64.4% 로 5.6 Sol(68.2%)에서 크게 안 줄었다. 장시간 자율 실행 중에 새 보안 분류기가 멈추고 확인을 요청하는게 번거롭다는 후기도 있다.
정리
종합 성능은 Opus 5.5 가 확실히 위다. AA 인덱스 10점, 코딩 인덱스 9점 차이다. Sol max 가 Opus medium 도 못 넘는다.
비용은 Sol 이 확실히 싸다. 같은 effort 면 태스크당 5배, 코딩 인덱스 기준 4.4배. 다만 캐시 비중이 높거나 272K 를 넘기면 그 차이가 거의 사라진다.
코딩 에이전트는 작업 크기에 따라 갈린다. 터미널 작업, 긴 레포, 오래 도는 작업은 Opus 5.5. 작고 닫힌 작업, 대량으로 돌리는 작업은 Sol. 테트리스 같은 단일 파일 작업에선 Sol 이 더 잘 만들었다.
Opus 5.5 의 “40% 절감” 은 medium 얘기다. max 로 돌리면 Opus 5 보다 태스크당 더 든다.
| 상황 | 추천 |
|---|---|
| 긴 레포 대상 코딩 에이전트 | Opus 5.5 |
| 터미널 작업 많은 에이전트 | Opus 5.5 (Terminal-Bench 20점 차) |
| 272K 넘는 컨텍스트 | Opus 5.5 (할증 없음) |
| 문서·보고서 같은 지식 노동 | Opus 5.5 (Briefcase +159) |
| 작은 단위 코딩 작업을 대량으로 | GPT-6 Sol |
| 태스크당 50센트 아래 예산 | GPT-6 Sol |
| 분류·추출 같은 단순 작업 | GPT-6 Sol (추론 끄기 가능) 이나 Luna |
| 모르면 모른다고 해야 하는 작업 | GPT-6 Sol (환각률 낮음) |
개인적으로는 코딩은 Opus 5.5 medium 을 기본으로 두고, 반복 작업만 Sol 로 빼는게 제일 무난할 것 같다. max 는 정말 막힐 때만.
두 모델 다 나온지 이틀이다. Sonnet 5.5 랑 Haiku 5.5 도 몇 주 안에 나온다니까 그때 또 다시 봐야 할듯
참고
- Anthropic 발표 — https://www.anthropic.com/claude-opus-5-5
- OpenAI 발표 — https://openai.com/index/introducing-gpt-6-sol-and-luna/
- Artificial Analysis Opus 5.5 — https://artificialanalysis.ai/articles/claude-opus-5-5
- Artificial Analysis Sol / Luna — https://artificialanalysis.ai/articles/gpt-6-sol-and-luna-push-the-cost-efficiency-frontier
- Artificial Analysis 비교 — https://artificialanalysis.ai/models/releases/comparisons/gpt-6-sol-vs-claude-opus-5-5
- Coding Agent Index 정리 — https://www.orcarouter.ai/blog/claude-opus-5-5-coding-agent-index
- 태스크당 비용 정리 — https://www.digitalapplied.com/blog/gpt-6-sol-vs-claude-opus-5-5-cost-benchmarks
- effort 단계별 비교 — https://codingfleet.com/blog/claude-opus-5-5-vs-gpt-6-sol/
- DataCamp 테트리스 테스트 — https://www.datacamp.com/blog/gpt-6-sol-vs-claude-opus-5-5
- Vellum Sol 벤치마크 — https://www.vellum.ai/blog/gpt-6-sol-and-luna-benchmarks-explained
- VentureBeat Opus 5.5 — https://venturebeat.com/technology/anthropic-releases-claude-opus-5-5-beating-fable-5-1-on-key-agentic-benchmarks-at-60-cheaper-api-price
- SiliconANGLE — https://siliconangle.com/2026/09/22/anthropic-releases-claude-opus-5-5-and-openai-counters-with-two-cheaper-gpt-6-models/
- Codex 컨텍스트 이슈 — https://github.com/openai/codex/issues/47805