Ai

Claude Opus 5.5 vs GPT-6 Sol — 비용 · 성능 · 코딩 에이전트

목차

9/22 에 Anthropic 이 Opus 5.5 를 냈고, 한 시간 반쯤 뒤에 OpenAI 가 GPT-6 Sol 과 Luna 를 냈다. 누가 봐도 맞불이다.

Astra 글 쓸 때처럼 이번에도 이틀 기다렸다. 출시 당일엔 양쪽 다 자기 표만 있고, 그 표도 상대 이전 모델이랑 비교해놔서 볼게 별로 없었다. Anthropic 표에는 GPT-5.6 Sol 이 있고 OpenAI 표에는 Opus 5 가 있다. 서로 신모델은 안 넣었다. 그 사이 Artificial Analysis 쪽 측정이 나와서 이제 좀 나란히 놓고 볼 수 있게 됐다.

이번 글은 세 가지만 본다. 비용, 종합 성능, 코딩 에이전트.

Claude Opus 5.5
claude-opus-5-5
입력
$4 / MTok
출력
$20 / MTok
캐시 읽기
$0.20 / MTok
컨텍스트
1M
GPT-6 Sol
gpt-6-sol
입력
$2 / MTok
출력
$10 / MTok
캐시 읽기
$0.20 / MTok
컨텍스트
1.05M

스펙

Opus 5.5GPT-6 Sol
출시2026-09-222026-09-22
입력 $/MTok42
출력 $/MTok2010
캐시 읽기 $/MTok0.200.20
캐시 쓰기 $/MTok52.50
Batch2 / 101 / 5
Fast 모드8 / 404 / 20
컨텍스트1M1.05M (입력 최대 922K)
최대 출력128k128k
지식 컷오프2026-062026-04-20
기본 effortmediummedium
추론 끄기불가none 가능

Sol 이 거의 모든 칸에서 딱 절반이다. 캐시 읽기만 같다.

Opus 5.5 는 Opus 5 보다 단가 20%, 캐시 읽기 60% 내렸다. Sol 은 GPT-5.6 Sol 에서 그냥 반값이 됐다. 양쪽 다 값을 내렸는데 OpenAI 가 더 크게 내렸다.

같이 나온 Luna 는 $0.10 / $0.50 이다. 이건 체급이 달라서 이 글에선 뺀다.

비용 — 반값이 반값이 아니다

단가표만 보면 Sol 이 무조건 반값인데 실제로 돌려보면 그렇게 안 된다. 이유가 두 개 있다.

캐시 읽기가 같은 값이다

에이전트는 같은 컨텍스트를 계속 다시 읽는다. 토큰 대부분이 캐시 읽기다. 그런데 그 칸이 $0.20 으로 똑같다. 캐시 비중이 높을수록 차이가 줄어든다.

272K 넘으면 Sol 은 할증이 붙는다

입력이 272K 를 넘으면 요청 전체에 입력 2배, 출력 1.5배가 붙는다. Opus 5.5 는 1M 까지 할증이 없다.

Digital Applied 에서 같은 토큰량을 넣고 계산한 예시가 있다. 입력 400K, 캐시 읽기 8M, 캐시 쓰기 600K, 출력 300K 짜리 에이전트 작업이다.

비용
Opus 5.5$12.20
GPT-6 Sol (기본 단가)$6.90
GPT-6 Sol (272K 할증)$12.30

할증 구간에 들어가면 Sol 이 오히려 조금 더 비싸다. 할증이 없어도 50% 가 아니라 57% 정도다. 긴 레포를 통째로 물려서 돌리는 에이전트라면 이 부분부터 계산해봐야 할듯

하나 더 있다. Opus 5.5 는 대화 중간에 top-level effort 를 바꾸면 캐시가 깨진다. Sol 은 effort 를 바꾸거나 툴을 켰다 꺼도 캐시가 유지된다고 한다. Opus 쪽도 메시지 단위 effort 베타가 있긴 한데 아직 베타다.

태스크당 비용 — effort 별로 보면

단가보다 이게 더 중요하다. AA Intelligence Index(v4.3.2)를 effort 단계별로 돌린 값이다.

effortOpus 5.5 점수태스크당Sol 점수태스크당
low42.3$0.5533.9$0.13
medium (기본)51.2$1.3439.8$0.25
high53.6$1.8242.8$0.37
xhigh56.0$3.4644.1$0.53
max57.6$5.9847.5$1.06

같은 effort 끼리 놓으면 Sol 이 5배 정도 싸다. 토큰 단가는 2배 차이인데 태스크당은 5배다. Opus 5.5 가 토큰을 훨씬 많이 쓴다는 얘기다.

근데 같은 끼리 놓으면 그림이 바뀐다.

  • $0.5 근처: Sol xhigh 44.1 ($0.53) vs Opus low 42.3 ($0.55). 비슷한 돈에 Sol 이 조금 위
  • $1 근처: Sol max 47.5 ($1.06) vs Opus medium 51.2 ($1.34). 30센트 더 내면 Opus 가 4점 위

대충 태스크당 50센트 아래 구간은 Sol 이 먹고, 1달러 넘어가면 Opus 가 먹는 구조다. Sol 은 max 까지 올려도 47.5 에서 멈춘다. Opus 의 기본값보다 낮다.

반대로 Opus 도 xhigh → max 는 효율이 별로다. 1.6점 올리는데 $2.5 더 든다. max 는 그냥 벤치마크용 설정 같다

종합 성능

벤더 표

앞에서 말한 대로 서로 신모델은 안 넣었다. 그래도 겹치는 항목만 뽑으면 이렇다.

벤치마크Opus 5.5GPT-6 Sol비고
AutomationBench40.0%33.2%Sol 은 xhigh, 태스크당 $0.27
OSWorld 2.081.8%60.5%Sol 은 Offline 셋. 릴리스가 다를 수 있다

둘 다 Opus 5.5 가 앞선다. OSWorld 는 Astra 글에서도 적었지만 태스크 릴리스가 다르면 직접 비교가 안 된다. 21점 차이를 그대로 믿기는 어렵다.

Anthropic 표 나머지는 Terminal-Bench 4.0 66.4%, FrontierCode 54.4%, CursorBench 57.8%, HLE 67.7%, GDPval-AA 1846. 전부 max effort 값이다.

OpenAI 표는 DeepSWE 68.8%, Agents’ Last Exam 56.4%. 발표문에서 제일 밀어준 문장은 “Fable 5 xhigh(69.9%)에 1.1점 차이까지 왔는데 비용은 80% 적다” 였다.

그리고 OpenAI 자기 차트에서도 DeepSWE, OSWorld 는 GPT-5.6 Sol 이 GPT-6 Sol 보다 높게 찍혀 있다는 지적이 있다. 반값으로 내리면서 일부 워크로드는 뒤로 간걸로 보인다.

제3자 — Artificial Analysis

Opus 5.5GPT-6 Sol
Intelligence Index (max)58 (1위)48
인덱스 태스크당 (max)$5.98$1.06
출력 속도 (high)90 tok/s103 tok/s

10점 차이다. 작지 않다.

Opus 5.5 는 AA 인덱스 1위로 올라갔다. Fable 5.1 보다 위다. Anthropic 이 “Fable 5.1 급을 싸게” 라고 한게 여기선 맞는 말이었다.

항목별로 보면 (Opus medium vs Sol max 기준):

항목Opus 5.5Sol
Terminal-Bench 4.052.5%43.9%Opus
GDPval-AA (Elo)15761487Opus
AA-Briefcase (Elo)16421483Opus
SciCode59.3%57.6%비슷
AA-LCR (롱컨텍스트)84.3%83.7%비슷
CritPt (물리)27.7%30.9%Sol
AA-Omniscience 정답률64.5%54.5%Opus
환각률 (낮을수록 좋음)68.4%60.1%Sol

Opus 는 medium 이고 Sol 은 max 다. 그래도 Opus 가 대부분 이긴다.

재밌는건 마지막 두 줄이다. 정답은 Opus 가 더 많이 맞히는데, 모를 때 지어내는건 Opus 가 더 많이 한다. Sol 은 GPT-5.6 Sol 때 환각률 92% 에서 60% 로 크게 내려왔다. 모르면 모른다고 하는 쪽으로 튜닝한듯

코딩 에이전트

제일 궁금했던 부분이다.

AA Coding Agent Index (v1.5)

각자 자기 하네스에서 max effort 로 돌린 값이다.

모델 (하네스)점수태스크당
Opus 5.5 (Claude Code)66$13.04
Fable 5.162
Opus 560$10.79
GPT-6 Sol (Codex)57$2.99

9점 차이에 4.4배 가격이다.

세부 항목은 이렇다.

Opus 5.5GPT-6 Sol
Terminal-Bench 4.063.1%43%
SWE-Atlas-QnA66.4%58%
DeepSWE v1.168.4%68.8% (OpenAI 발표)

터미널 작업에서 차이가 크다. 20점이다. DeepSWE 는 거의 같은데 Sol 쪽은 OpenAI 가 직접 잰 값이라 하네스가 다르다. 같다고 보긴 애매하다.

참고로 지난 Astra 글에서 Fable 5.1 코딩 인덱스를 70 이라고 적었는데, v1.5 로 바뀌면서 62 가 됐다. 인덱스 버전이 다른 숫자끼리는 비교하면 안 된다. 매번 적는 얘긴데 매번 걸린다..

Opus 5.5 는 단가를 내렸는데 태스크당은 올랐다

이게 좀 웃긴데, Opus 5 → 5.5 로 토큰 단가가 20% 내렸는데 코딩 인덱스 태스크당 비용은 $10.79 → $13.04 로 21% 올랐다.

출력 토큰이 태스크당 137K → 333K 로 2.4배가 됐다. 더 오래, 더 많이 생각한다. 점수가 6점 오른 값이다. 싸진게 아니라 같은 돈에 더 일을 하는 쪽으로 바뀐거다.

Anthropic 이 말한 “일반 워크로드 40% 절감” 은 기본값인 medium 기준일듯. Claude Code 에서 max 로 돌리면 청구서는 오히려 늘어날 수 있다.

Sol 은 5.6 보다 2점 올랐다

Sol 은 GPT-5.6 Sol 대비 코딩 인덱스 +2점, 태스크당 비용은 절반이다. Terminal-Bench 4.0 이 37% → 43%, SWE-Atlas-QnA 54% → 58%.

성능을 크게 올린 릴리스가 아니고 같은 성능을 반값에 파는 릴리스다. AA 도 그렇게 요약했다.

벤더가 내세운 사례

전부 벤더가 고른 고객 사례라 걸러서 봐야 한다.

Opus 5.5 쪽

  • 68만 줄 코드 마이그레이션을 하루 안에 끝냈다
  • 20만 줄 코드베이스 감사·수정을 3시간 안에. Opus 5 는 20시간 넘게 걸렸고 토큰은 2.5배
  • HAProxy C → Rust 변환을 9.5시간에. Fable 5.1 은 12시간, 비용은 51% 적게
  • FrontierCode 에서 medium 으로 Astra max 를 이겼는데 비용은 20% 수준

Sol 쪽

  • GitHub Copilot 에서 캐시 개선으로 새로 처리하는 프롬프트 토큰이 50% 이상 줄었다
  • 뭘 검증했고 뭘 안 했는지 먼저 말하고, 서론 없이 diff 부터 준다는게 OpenAI 설명이다

직접 돌려본 비교 하나

DataCamp 에서 같은 프롬프트로 테트리스 클론을 시켜봤다. 20초마다 중력이 뒤집히는 단일 HTML 파일이다. high effort.

GPT-6 SolOpus 5.5
63
툴 호출92
비용$0.26$0.87
총 토큰120,226107,958
루브릭 점수5.04.3

둘 다 중력 반전 로직은 제대로 짰다. 완성도랑 UI 에서 Sol 이 이겼다. Sol 은 여러 번 나눠서 고치고, Opus 는 한 번에 크게 쓰는 스타일이다. 토큰은 Opus 가 더 적게 썼는데 단가 때문에 비용은 3배 넘게 나왔다.

테스트 하나라 일반화하긴 어렵다. 다만 작고 닫힌 작업에서는 Sol 로 충분하다는 쪽에 힘을 싣는 결과인듯

하네스 얘기

두 모델 다 자기 에이전트 안에서 제일 잘 돈다. Opus 5.5 는 Claude Code, Sol 은 Codex. GitHub Copilot 에서는 둘 다 고를 수 있다.

Opus 5.5 는 Claude Code, Claude 앱, Cowork 에서 Pro / Max / Team 기본 모델이 됐다. 나도 이 블로그를 Claude Code 로 관리하는데 업데이트하고 보니 이미 바뀌어 있었다.

Codex 쪽은 이슈가 하나 올라와 있다. Codex CLI 에서 Sol 의 실효 컨텍스트가 828.4K 로 잘린다는 내용이다. 스펙은 1.05M 인데. GPT-5.6 Sol 때도 컨텍스트가 잘렸다는 이슈가 몇 번 있었다.

사용량 한도는 Plus 기준 5시간에 Sol 15150 메시지다. 5.6 Sol 때 10100 보다는 늘었다. HN 에서는 5.6 Sol 의 말투랑 엔지니어링 감각이 좋았다는 사람들이 꽤 있었다. 6 으로 오면서 그 느낌이 달라졌다는 얘기도 같이 나온다.

API 바꿀 때 걸리는 것

Opus 5 → Opus 5.5

  1. thinking 을 못 끈다. {type: "disabled"}budget_tokens 도 400 이다. effort 로만 조절한다
  2. 기본 effort 가 medium 이다. Opus 5 는 high 였다. 그냥 모델명만 바꾸면 한 단계 낮게 돈다. 명시하자
  3. tool_choiceany / tool 이 400 이다. autostrict: true 쓰고 프롬프트로 유도하거나 structured output 으로
  4. thinking 블록이 모델·대화에 묶인다. 폴백으로 Opus 5 가 받으면 thinking 없이 돈다
  5. computer use 는 computer_toolset_20260801 만 된다. computer_20251124 는 400
  6. 툴 호출 사이 텍스트가 progress update 로 thinking 블록에 들어온다. 보려면 display: "updates"

2번이 제일 조용하게 걸릴듯. 에러도 안 나고 점수만 떨어진다.

GPT-5.6 Sol → GPT-6 Sol

  1. Chat Completions 에서 툴 호출은 reasoning_effort: none 일 때만 된다. 추론 켜고 툴 쓰려면 Responses API
  2. effort 는 none ~ max. 기본 medium
  3. 272K 넘는 요청은 할증. 컨텍스트 꽉 채우는 구조면 다시 계산

Sol 은 추론을 끌 수 있다. 분류나 추출 같은 단순 작업에선 이게 꽤 크다. Opus 5.5 는 low 가 최소라서 가벼운 작업에도 기본 비용이 깔린다.

안전 쪽은 짧게

Opus 5.5 는 시스템 카드랑 METR 외부 평가가 같이 나왔다. 경계를 우회하려는 시도가 Opus 5 대비 85% 줄었다고 한다. 분류기가 넓어져서 bio, reasoning_extraction 카테고리가 새로 붙었다. 오탐으로 거절당하는 경우가 좀 늘 수 있다.

Sol / Luna 는 출시 시점에 시스템 카드가 없었다. 경고를 무시하고 우회를 시도한 비율이 64.4% 로 5.6 Sol(68.2%)에서 크게 안 줄었다. 장시간 자율 실행 중에 새 보안 분류기가 멈추고 확인을 요청하는게 번거롭다는 후기도 있다.

정리

종합 성능은 Opus 5.5 가 확실히 위다. AA 인덱스 10점, 코딩 인덱스 9점 차이다. Sol max 가 Opus medium 도 못 넘는다.

비용은 Sol 이 확실히 싸다. 같은 effort 면 태스크당 5배, 코딩 인덱스 기준 4.4배. 다만 캐시 비중이 높거나 272K 를 넘기면 그 차이가 거의 사라진다.

코딩 에이전트는 작업 크기에 따라 갈린다. 터미널 작업, 긴 레포, 오래 도는 작업은 Opus 5.5. 작고 닫힌 작업, 대량으로 돌리는 작업은 Sol. 테트리스 같은 단일 파일 작업에선 Sol 이 더 잘 만들었다.

Opus 5.5 의 “40% 절감” 은 medium 얘기다. max 로 돌리면 Opus 5 보다 태스크당 더 든다.

상황추천
긴 레포 대상 코딩 에이전트Opus 5.5
터미널 작업 많은 에이전트Opus 5.5 (Terminal-Bench 20점 차)
272K 넘는 컨텍스트Opus 5.5 (할증 없음)
문서·보고서 같은 지식 노동Opus 5.5 (Briefcase +159)
작은 단위 코딩 작업을 대량으로GPT-6 Sol
태스크당 50센트 아래 예산GPT-6 Sol
분류·추출 같은 단순 작업GPT-6 Sol (추론 끄기 가능) 이나 Luna
모르면 모른다고 해야 하는 작업GPT-6 Sol (환각률 낮음)

개인적으로는 코딩은 Opus 5.5 medium 을 기본으로 두고, 반복 작업만 Sol 로 빼는게 제일 무난할 것 같다. max 는 정말 막힐 때만.

두 모델 다 나온지 이틀이다. Sonnet 5.5 랑 Haiku 5.5 도 몇 주 안에 나온다니까 그때 또 다시 봐야 할듯

참고