Claude Opus 5.5 vs GPT-5.6 Sol을 위한 히어로 타이틀 카드로, 제목은 거의 겹치지 않는 두 개의 출시 테이블이며, 배지에는 각각 $4.00 vs $5.00, 66.4% vs 37.3%, 기준 시점 6월 vs 2월이 적혀 있고, 오른쪽 아래 모서리에 OrcaRouter 로고가 있습니다.
Guides & Insights

Claude Opus 5.5 vs GPT-5.6 Sol: 거의 겹치지 않는 두 개의 출시표

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

맞대어 놓아 보자.Claude Opus 5.5GPT-5.6 Sol을 이번 주에 나란히 세워 두면, 가장 먼저 눈에 띄는 것은 승자가 아니다. 두 벤더가 내놓은 벤치마크 표가 겨우 한 행도 서로 겹치지 않는다는 사실이다. 2026년 9월 22일 공개된 Claude Opus 5.5의 발표 자료는 Terminal-Bench 4.0에서 이 모델이 GPT-5.6 Sol보다 29점 앞선다고 내세운다. 반면 2026년 7월 9일부터 정식 제공된 Sol의 발표 자료는 대신 Terminal-Bench 2.1(Sol Ultra가 91.9%를 기록)과 Artificial Analysis Coding Agent Index(80으로 1위 차지)를 앞세운다. 두 표 모두 실제다. 둘 다 그 표에서 이기는 벤더가 직접 돌린 것이다. 유용한 질문은 추상적으로 어느 모델이 더 나은가가 아니라, 어떤 벤치마크가, 누구의 하네스에서 돌아간 것이, 당신의 워크로드에 대해 무엇을 알려주는가이다. 그것은 어느 발표 글도 당신이 던지길 바라지 않는 더 어려운 질문이며, 이 비교가 중심에 두고 있는 바로 그 질문이다.

두 모델, 나란히

A two-column scoreboard for Claude Opus 5.5 and GPT-5.6 Sol. Left column: price $4.00 / $20.00, 1M-token context, knowledge cutoff June 2026, Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.4%, GDPval-AA 1846 Elo. Right column: price $5.00 / $30.00, 1M-token context, knowledge cutoff February 16 2026, Terminal-Bench 2.1 91.9% Ultra, FrontierCode v1.1 47.5%, GDPval-AA 1588 Elo. A sourcing footer notes the Opus rows are vendor-reported by Anthropic and the Sol rows come from OpenAI's launch material.

• 공급업체 — Anthropic vs OpenAI

• 출시 — 2026년 9월 22일 Claude Opus 5.5 vs 2026년 7월 9일 GPT-5.6 Sol

• 백만 토큰당 가격 — 입력 $4.00 / 출력 $20.00 대 입력 $5.00 / 출력 $30.00

• 캐시 읽기 — Opus 5.5에서 백만 토큰당 $0.20; Sol의 캐시 요금은 플랫폼별로 설정되며 단일 비교 수치로 공개되지 않습니다

• 컨텍스트 윈도우 — 양쪽 모두 1M 토큰

• 최대 출력 — 두 가지 모두 128K 토큰이며, Anthropic의 Batch API에서는 베타 헤더를 붙이면 300K

• 지식 컷오프 — Opus 5.5는 2026년 6월, Sol은 2026년 2월 16일

• 추론 제어 — 적응형 사고는 항상 켜져 있으며 기본값은 중간 수준의 노력이고, 범위는 낮음에서 최대까지 조절되는 한편 최대 추론 노력 설정과 병렬 서브 에이전트를 조율하는 Ultra 모드도 있습니다

• 라인업 — Opus 5.5는 5.5 패밀리의 첫 번째 제품이며, Sonnet 5.5와 Haiku 5.5는 앞으로 몇 주 내에 선보일 예정입니다. 반면 Sol은 Terra, Luna와 함께 3단계 제품군의 플래그십입니다.

그 행들 중 두 개는 나머지보다 더 많은 일을 한다. 지식 컷오프 격차는 네 달이나 벌어져 있는데, 이는 당신의 프롬프트가 이번 봄에 일어난 일을 다룬다면 중요하다. 그리고 Opus 5.5는 이제 입력과 출력 가격 모두에서 Sol을 밑돈다 — 3개월 전과는 정반대인데, 당시에는 Sol이 프런티어급 출력에 도달하는 더 저렴한 방법이었고 Claude Opus 5는 $5/$25에 머물렀다.

두 모델이 모두 실제로 나타나는 유일한 행

두 모델을 모두 포함하는 공개된 표는 단 하나뿐이며, 그것은 Anthropic의 것입니다. 그 안의 모든 수치는 공급업체가 보고한 것으로, 두 모델 중 하나를 판매하는 회사가 산출한 것입니다:

• Terminal-Bench 4.0 — Claude Opus 5.5 66.4% 대 GPT-5.6 Sol 37.3%

• Terminal-Bench-Science 0.1 — 58.7% 대 22.4%

• FrontierCode v1.1 (메인) — 54.4% vs 47.5%

• CursorBench 4.0 — 57.8% vs 41.7%

• AutomationBench — 40.0% 대비 28.8%

• GDPval-AA v2.1 — 1846 Elo vs 1588

그것은 완승이며, 두 Terminal-Bench 행의 격차는 받아들이기보다 면밀히 검토할 가치가 있을 만큼 큽니다. Anthropic 자체의 각주가 그중 일부를 대신 해줍니다: Opus 5.5의 Terminal-Bench 실행은 기본값이 아닌 xhigh effort를 사용했고, 기본 medium effort에서는 FrontierCode의 우위가 54.6% 대 47.5%로 좁혀집니다 — 헤드라인 수치가 아니라 7포인트 격차입니다. Anthropic은 또한 전체 표에 일반적인 주의를 덧붙이면서, 이 능력 수준에서 벤치마크 격차는 "현실 세계의 차이를 판단하는 데 덜 신뢰할 만한 지침"이며 Claude Fable 5.1과의 내부 격차는 점수가 시사하는 것보다 좁다고 말합니다. 자사 표를 평가절하하는 벤더의 문장이 그 안에서 가장 신뢰할 수 있는 문장입니다.

또한 그 표에서 빠져 있는 것에 주목하십시오: OpenAI의 모델이 승리하는 벤치마크는 하나도 없습니다. 유리한 행만 담긴 벤더 표는 완승의 증거가 아니라 행 선택의 증거입니다.

OpenAI 자체 수치가 말해주는 것

Sol의 출시 자료는 다른 벤치마크, 다른 하네스에서 또 다른 이야기를 들려줍니다. 7월 출시 당시 보고된 내용은 다음과 같습니다:

• Terminal-Bench 2.1 — Sol Ultra는 91.9%, 표준 Sol은 88.8%인 반면, Claude Mythos 5는 88.0%, Claude Fable 5는 84.3%입니다.

• Artificial Analysis Coding Agent Index — 80, 당시 Claude Fable 5보다 2.8점 높은 최첨단으로 설명되었습니다.

• Agents' Last Exam, 장시간 실행되는 전문 워크플로 — 53.6점으로, OpenAI가 Claude Fable 5보다 13.1점 앞선다고 보고한 수치

• BrowseComp — 92.2%; OSWorld 2.0 — 62.6%; SWE-Bench Pro — 64.6%

그 행들 중 어느 것도 Claude Opus 5.5를 포함하지 않습니다. 7월 당시에는 존재하지 않았기 때문입니다. Sol의 표는 Fable 5와 Mythos 5를 이기기 위해 만들어진 것이고, 실제로 그렇게 합니다. 그것이 Opus 5.5를 이기는지 여부는 어느 벤더의 자료로도 답이 나오지 않습니다 — 두 표는 서로 다른 상대를 기준으로 두 달의 간격을 두고 작성되었기 때문입니다.

SWE-Bench Pro 행은 특히 주목할 만하다. 왜냐하면 OpenAI의 출시 자료에서 자사 모델이 뒤지는 모습이 드러나는 유일한 지점이기 때문이다. Sol은 64.6%인 반면 Claude Fable 5는 80%를 기록했다. OpenAI는 벤치마크의 타당성에 의문을 제기하며, 해당 과제의 약 30%가 결함이 있다고 추정했다. 그 말이 사실일 수도 있다. 이는 또한 “이 벤치마크에는 결함이 있다”는 주장이 두 연구소 모두가 하는 주장이며, 언제나 자신들이 지는 벤치마크에 관한 것이라는 점을 유용하게 상기시켜 준다.

누구의 테이블도 해결하지 못하는 하네스 문제

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

두 표가 서로 맞지 않는 이유는 한쪽 벤더가 거짓말을 하고 있어서가 아니다. 그것은 에이전트형 코딩 벤치마크가 모델과 스캐폴드를 함께 측정하고, 그 스캐폴드가 서로 다르기 때문이다. Terminal-Bench 4.0과 Terminal-Bench 2.1은 같은 아이디어의 서로 다른 리비전이며, 서로 다른 사람들이 운영하고, 도구 예산과 재시도 규칙도 다르다. Anthropic의 Opus 5.5 수치는 Anthropic의 하네스에서 산출되었고, OpenAI의 Sol 수치는 Codex 스타일 도구 환경에서 산출되었다. 어느 모델이든 상대방의 하네스로 옮기면 점수도 달라진다.

독립적인 데이터가 존재하는 경우, 그것은 두 표보다 더 접전인 경쟁을 보여준다. 2026년 8월의 한 제3자 에이전트 벤치마크는 실제 애플리케이션 작업에서 여러 모델을 대상으로 실행되었으며, GPT-5.6 Sol을 정확도, 비용, 속도의 최상의 조합으로 꼽았다 — 실행당 약 $0.52와 5분 — 반면 Claude Opus 5(5.5가 아님)가 실행의 92%에서 가장 정확했다. 기업용 코드 작업을 다루는 별도의 리더보드에서는 Claude Opus 5가 96.4%로 1위, GPT-5.6 Sol이 86.5%로 3위에 올랐는데, 이 역시 Sol을 새로운 Opus가 아니라 이전 Opus와 비교한 것이다. 둘 다 Opus 5.5와의 직접 맞대결이 아니며, 어느 것도 무엇을 확정하지 못한다. 다만 이들은 벤더가 아닌 누군가가 비교를 수행할 때 격차가 작아진다는 점은 보여준다.

실용적인 핵심은 표를 순위로 읽는 것을 멈추고 가설 목록으로 읽기 시작하는 것이다. 당신의 업무가 장기적인 터미널 자동화라면, Anthropic의 Terminal-Bench 격차는 당신의 작업에서 직접 시험해 볼 가치가 있는 가설이다. 여러 단계의 전문 연구라면, Sol의 Agents' Last Exam 결과도 같은 종류의 가설이다. 어느 수치도 실행해 보지 않고서는 당신의 워크로드에 그대로 전이되지 않는다.

완료된 작업당 비용, 이것이 유일하게 중요한 비용이다

요금표에서 Claude Opus 5.5는 이제 입력과 출력 양쪽 모두에서 더 저렴합니다: 입력은 $5.00 대비 $4.00, 출력은 $30.00 대비 $20.00이며, 캐시 읽기 요금은 Claude Opus 5가 부과했던 것보다 60% 낮은 $0.20입니다. 매 턴마다 긴 시스템 프롬프트를 다시 보내는 에이전트에게 그 캐시 항목은 지배적인 비용이며, 프롬프트를 전혀 변경하지 않고도 장시간 실행되는 세션이 실질적으로 더 저렴해질 수 있는 이유입니다.

하지만 토큰당 가격이 에이전트의 청구서를 결정한 적은 없습니다. 출시 당시 Sol에 대한 OpenAI의 주장은 정가보다는 토큰 효율성에 기반했습니다. 코딩 토큰 효율성이 54% 향상되었다고 보고했으며, 출력 토큰과 경과 시간은 Claude Fable 5의 절반 이하이면서 비용은 약 3분의 1 더 낮았습니다. Anthropic은 Opus 5.5에 대해 정반대의 주장을 펼칩니다. 일반적인 워크로드에서 Claude Opus 5보다 약 40% 낮은 실행 비용인데, 요금표는 20%만 인하되었으며, Box, Kiro, Factory, GitHub의 고객 성명은 모두 토큰이나 단계의 큰 감소를 언급했습니다. 두 주장은 같은 방향을 가리킵니다. 더 적은 턴으로 끝내는 모델이 승리한다는 것이며, 어느 쪽도 독립적으로 감사되지 않았습니다.

독립적인 작업당 비용 계산이 실제로 존재하는 경우, 현재로서는 Sol에 유리하다. 9월에 발표된 한 분석에서는 SWE-bench Verified에서 GPT-5.6 Sol이 96.2% 성공률로 해결된 이슈당 $1.56인 반면, Claude Opus 4.8은 88.6%였다. 이는 Opus 5.5가 아니라 더 오래된 Anthropic 모델을 기준으로 측정한 Sol의 수치이므로, 결론이라기보다 출발점이다. 하지만 이는 첫 시도에서 이슈를 해결하는 모델이 세 번의 시도가 필요한 더 저렴한 모델보다 더 저렴하다는 점을 상기시켜 준다. 이것을 당신에게 확실히 정해 주는 유일한 측정은, 토큰 수를 눈앞에 두고 양쪽 방식으로 실행한 당신 자신의 작업이다.

그것은 조달 문제라기보다 라우팅 문제이며, 그중 어느 쪽이 이미 해결 가능한지 분명히 하는 것이 좋습니다. GPT-5.6 Sol은 오늘 OrcaRouter에서 OpenAI 자체 정가에 0% 마진으로 이용할 수 있습니다 — 공급자 정가가 그대로 전달되므로, 공급업체 요율 변경이 동기화 이후가 아니라 당일 바로 우리 쪽에 반영됩니다. Claude Opus 5.5는 아직 우리의 라우트 중 하나가 아닙니다. Anthropic 자체 API와 주요 클라우드를 통해 이용할 수 있습니다. 그것이 들어오면 동일한 키로 둘 다 처리할 수 있게 되며, 바로 이것이 실험을 두 번째 계약과 두 번째 SDK 대신 라우팅 규칙으로 바꿔 줍니다: 워크로드를 여러분 자신의 수치가 더 유리하게 보는 모델로 보내고, 자동 페일오버는 다른 쪽을 향하도록 두고, 라우팅 DSL 한 줄이 분기별이 아니라 요청별로 결정하게 하십시오. 어느 쪽이든 가격 인하는 마이그레이션이 아니라 구성 변경입니다.

Screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, and the attribution 'by OpenAI - 2026-07-09'.

둘이 진정으로 다른 지점

벤치마크를 걷어내면 네 가지 차이점이 남는데, 모두 검증 가능하다:

• 지식 컷오프. Opus 5.5는 2026년 6월, Sol은 2026년 2월 16일입니다. 최신 라이브러리, 최근 사건, 최근에 변경된 API와 관련된 어떤 것이든 넉 달은 실질적인 격차이며, 이를 포착하는 벤치마크는 없습니다.

• 라우팅 안전장치. Opus 5.5는 Fable 5.1급 안전장치와 함께 제공됩니다. 대부분의 사이버보안 요청은 Claude Opus 4.8로 다시 라우팅되고, 생물학 관련 작업은 계정이 인증되지 않은 경우 Claude Opus 5로 폴백됩니다. 여러분의 제품이 이 두 영역 중 하나에 속한다면, 트래픽의 일부가 더 작은 모델에 의해 응답되고 있는 것입니다. Sol에는 이에 상응하는 문서화된 라우팅이 없지만, OpenAI는 자체적인 사이버 관련 안전성 평가에 대해서는 언급하고 있습니다.

• 오케스트레이션. Sol은 여러 병렬 하위 에이전트를 조정하는 Ultra 모드를 제공하며, 기본값은 네 개이고, 최대 추론 effort 설정도 제공합니다. Opus 5.5에는 이 두 가지가 플랫폼 기능으로 없습니다. Opus 5.5의 수단은 effort 파라미터이며, 멀티모델 구성은 벤더가 제공해 주는 것이 아니라 직접 구축하거나 라우팅해야 하는 것입니다.

• 패밀리 경제성. Sol은 세 가지 등급 중 하나이며, 그 아래에는 Terra와 Luna가 있습니다 — 7월 30일 업데이트에서 Luna의 가격은 80%, Terra의 가격은 20% 인하되었습니다. Anthropic의 더 저렴한 형제 모델인 Sonnet 5.5와 Haiku 5.5는 발표되었지만 아직 출시되지 않았습니다. 워크로드가 혼합형이라면, 현재 OpenAI가 더 저렴한 등급을 제공하고 있습니다.

그것들 중에서 선택하기

장시간 실행되는 에이전트형 코딩이나 지식 작업을 한다면, 토큰당 가격이 중요하다면, 프롬프트가 지난 4개월 이내의 무엇이든 다룬다면, 또는 캐시된 100만 토큰당 $0.20인 1M 토큰 컨텍스트가 당신의 아키텍처를 감당 가능하게 만드는 것이라면 Claude Opus 5.5를 선택하세요. 시작점은 중간 노력에서, 상속된 높음 설정이 아니라, 그리고 다음을 측정하세요: 낮음이 버티는지.

GPT-5.6 Sol은 벤더가 함께 묶어 제공하는 오케스트레이션 모드를 원하거나, 몇 주 뒤가 아니라 오늘 바로 플래그십 아래의 더 저렴한 티어가 필요하거나, 또는 귀하의 워크로드가 Sol 자체의 출시 근거가 가장 잘 뒷받침하는 종류 — 장기적 관점의 전문 워크플로와 컴퓨터 사용 — 에 해당한다면 선택하세요. Sol은 이 영역에서 가장 강력한 결과를 보고했습니다.

이미 Claude Opus 5를 사용 중이라면, Opus 5.5는 그대로 갈아끼울 수 있는 버전이 아니라는 점에 유의하세요: 사고를 더 이상 비활성화할 수 없고, 강제 도구 사용은 오류를 반환하며, 사고 블록은 모델과 대화에 묶이고, 이전 computer_20251124 컴퓨터 사용 도구는 Claude API나 Google Cloud에서 허용되지 않습니다. 처음 세 가지는 Claude Fable 5.1에도 적용됩니다. Sol로 전환하는 것은 완전히 다른 통합입니다.

이 비교를 실제로 결판낼 것은 두 모델을 동일한 effort, 동일한 harness, 같은 작업 세트에서 한 번 독립적으로 실행한 결과다. 이번 주 기준으로 아무도 그런 결과를 공개하지 않았다. 누군가 그렇게 하기 전까지, 정직한 입장은 증거가 뒷받침하는 입장이다: Anthropic의 표는 Opus 5.5에 유리하며 Anthropic이 만들었다; OpenAI의 표는 Sol에 유리하며 OpenAI가 만들었다; 존재하는 독립 결과들은 Sol을 이전 Opus와 비교하며 훨씬 접전인 경쟁을 묘사한다; 그리고 여러분의 청구서를 결정할 두 행 — 완료된 작업당 토큰과 캐시 읽기 볼륨 — 은 어느 벤더도 공개하지 않는 두 행이다.

이 글에서 비교한 모델4

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트