Claude Sonnet 5.5 vs Claude Opus 5.5를 위한 히어로 타이틀 카드를 생성했습니다. 부제는 '벤치마크는 수렴하지만, 청구서는 그렇지 않다'이며, 왼쪽에는 백만 토큰당 $2.00와 $10.00, 오른쪽에는 $4.00와 $20.00를 보여주고, 오른쪽 아래 모서리에는 OrcaRouter 로고가 합성되어 있습니다.
Guides & Insights

Claude Sonnet 5.5 vs Claude Opus 5.5: 벤치마크는 수렴하지만, 청구서는 그렇지 않다

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Claude Sonnet 5.5는 2026년 9월 28일 정식 출시되었으며, 가격은 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $10.00입니다. Anthropic의 플래그십 모델인 Claude Opus 5.5는 그보다 엿새 앞선 9월 22일에 출시되었고 가격은 $4.00과 $20.00 — 두 항목 모두 정확히 두 배입니다. 당연한 해석은 Opus 5.5가 최상위이고 Sonnet 5.5는 예산이 현실적으로 중요한 상황에서 타협하는 선택이라는 것입니다. Anthropic이 직접 공개한 출시 표는 그런 해석을 뒷받침하지 않습니다. 회사가 발표한 수치를 보면, Claude Sonnet 5.5는 GDPval-AA v2.1에서 Opus 5.5의 1846에 맞서 1844를 기록하고, AA-Briefcase v1.1에서는 1822에 맞서 1811을, Terminal-Bench 4.0에서는 66.4%에 맞서 70.6%를 기록합니다 — 즉 실제로 터미널 안에서 수행된 작업을 측정하는 유일한 벤치마크에서는 앞서는 것입니다. 그 수치에서 두 줄 아래, Anthropic이 직접 붙인 설명에는 Opus 5.5가 "복잡하고 개방형인 작업에서 여전히 확실히 더 강하다"고 적혀 있습니다. 두 진술 모두 사실이며, 이 둘을 동시에 어떻게 받아들일지 따져보는 것이 바로 이 비교의 주된 목적입니다.

출시 일정표가 말하는 것, 그리고 말하기를 꺼리는 것

Anthropic의 벤치마크 블록에서 나타나는 패턴은 선두를 차지한 모델이라기보다 격차를 대부분 좁힌 모델의 모습이다. 경제적으로 가중된 작업 세트인 GDPval-AA v2.1은 2점 차 접전이다. 문서 및 산출물 평가인 AA-Briefcase v1.1은 11점 차 접전이다. CursorBench 4.0은 반대 방향이다. Sonnet 5.5는 55.5%, Opus 5.5는 57.8%다. OSWorld 2.1은 80.1% 대 81.8%에 머물고, Humanity's Last Exam은 도구 사용 시 64.5% 대 67.7%다. 오직 Terminal-Bench 4.0만 이 패턴을 깨뜨리는데, 그것도 크게 깬다 — 70.6% 대 66.4%로, 에이전트형 명령줄 작업에서 Sonnet이 4점 우위다.

숫자가 아니라 행 레이블을 읽어 보면 다른 것이 나타난다. 그 Opus 5.5 항목 중 여러 개에는 effort 주석이 붙어 있다 — Xhigh에서 66.4% — 그리고 각주에는 Max 구성이 FrontierCode에서 더 낮은 점수를 받는다고, Xhigh보다 더 높은 게 아니라, 명시되어 있다. 더 높은 effort가 단조 증가하는 것은 아니다. "최대 effort"가 공짜 업그레이드라고 가정하는 예산을 중시하는 팀은 Anthropic 자체 테스트 중 최소 하나에서 더 나쁜 답을 얻기 위해 토큰을 사는 셈이다. 그리고 FrontierCode 1.1에서 같은 각주는 Max 구성의 Sonnet 5.5를 46.2%로, Opus 5.5의 54.4%와 대비시켜 놓는데, 이는 플래그십이 여전히 앞서 나가는 지점을 보여 주는 가장 명확한 단일 숫자다: 지속성을 보상하는 과제 정의 아래에서 이루어지는 장기 호라이즌 코드 작업.

묻어두기보다 분명히 밝혀둘 만한 유의점이 하나 더 있다. Anthropic은 자사가 공개한 GDPval-AA 및 AA-Briefcase 실행이 구조화 출력 버그를 안고 있는 출시 전 배포 환경에서 수행되었다고 밝힌다. 이는 같은 표에 있는 두 모델 모두에 영향을 미치므로 비교 자체가 무효가 되지는 않지만, 절대 수치는 확정된 결과가 아니라 스냅샷으로 취급해야 함을 의미한다. 벤더 벤치마크 표는 방법론 부록이 딸린 마케팅 산출물이며, 이번 표에도 그 부록이 함께 붙어 있다.

독립적인 측정이 어디에 도달하는지

Artificial Analysis는 두 모델 모두를 단일 하네스에서, 자사가 "Adaptive Reasoning, Max Effort, Default Fallback"이라고 부르는 동일한 구성으로, Intelligence Index v4.3에서 채점한다. Claude Opus 5.5는 58점에 자리한다. Claude Sonnet 5.5는 56점에 자리한다. 이는 같은 평가자가 Opus 5를 51점, Sonnet 5를 38점, DeepSeek V4 Pro를 36점, Gemini 3.1 Pro Preview를 30점에 놓는 척도에서 2점 차이다. 새로운 Sonnet이 플래그십보다 2점 낮고 이전 Opus 세대보다 5점 높게 등장한 것이 이번 릴리스의 실질적 주장이며, 이는 벤더 주장이 아니라 제3자 주장이다.

그러고 나서 같은 페이지에서 그 경제성은 뒤집힌다. Artificial Analysis는 Sonnet 5.5 평가 실행이 작업당 $7.60의 비용이 든다고 보고하는데, Opus 5.5의 $5.98과 대비된다. Sonnet 5.5의 토큰당 가격이 절반인데도 그렇다. 원인은 바로 그 페이지에 나와 있다. Sonnet 5.5는 인덱스 스위트 전반에서 4억 1천만 토큰을 생성했으며, 이는 추적 대상 모델들의 중앙값인 8,800만 토큰과 대비된다. 평가자의 표현대로 "매우 장황하다"는 것이다. Opus 5.5는 같은 스위트에서 2억 6천만 토큰을 생성했다. 출력 토큰 100만 개당 $10 대 $20인 상황에서, 약 1.6의 장황함 계수는 여전히 Sonnet 5.5가 완료된 작업당 약 27% 더 지불하게 만든다.

이것은 토큰당 가격표가 보여줄 수 없는 비교의 한 부분이며, 두 수치가 모순 없이 공존하는 이유입니다. 토큰당으로는 Sonnet 5.5가 절반 더 저렴합니다. 완료된 작업당으로는, 개방형 프롬프트와 출력 길이 규율이 없는 평가 스위트에서 더 비쌀 수 있습니다. 이 중 어느 쪽이 당신의 워크로드를 설명하는지가 실제 결정입니다.

노력 수준, 출력 상한, 그리고 통합의 형태

구매자 입장에서는 기계적으로 중요한 특성들이 이 두 모델 간에 거의 동일합니다.

• 컨텍스트 — 양쪽 모두 동일한 제공자의 1,000,000토큰이므로, 프롬프트 엔지니어링 가정이 변경 없이 그대로 전이됩니다

• 최대 출력 — 양쪽 모두 128,000 토큰; 대량 생성은 여기서 차별화 요소가 아님

• 모달리티 — 양쪽 모두 텍스트, 이미지, 파일 입력을 지원하며, 어느 쪽도 오디오나 비디오는 지원하지 않음

• 추론 제어 — 두 환경 모두에서 적응형 사고를 사용하며, 깊이는 사고 토큰 예산이 아니라 effort 파라미터로 설정됩니다. Claude Platform에서는 기본값이 high이고, Claude 앱에서는 medium입니다.

• 캐시 쓰기 — Claude Opus 5.5는 백만당 $5.00, Claude Sonnet 5.5는 $2.50으로, 더 저렴한 모델이 재구성된 프리픽스를 공급하는 데에도 더 저렴한 유일한 항목

• 캐시 읽기 — 양쪽 모두 백만 토큰당 $0.20, 장시간 에이전트 실행을 지배하는 항목에서 정확히 동점

표면이 일치하기 때문에, 이들 사이의 마이그레이션은 통합 프로젝트가 아니라 모델 문자열 변경과 작업량 재측정입니다. 이는 여러 공급업체를 통틀어 이례적인 일이며, 바로 이 특정 조합을 굳이 비교해 볼 가치가 있는 이유입니다: 두 후보는 가격과 깊이에서 다를 뿐, 작성해야 하는 API에서는 다르지 않습니다.

운영상의 한 가지 차이점은 별도로 언급할 가치가 있습니다. Anthropic에 따르면 Claude Sonnet 5.5는 최상위 모델과 동일한 수준의 사이버 보호 장치와 폴백을 갖추고 출시된 첫 Sonnet입니다. 즉, 더 높은 위험의 사이버 보안 요청은 사용자가 지정한 모델이 응답하는 대신 이전 Sonnet으로 눈에 띄게 라우팅됩니다. 워크로드가 해당 영역을 건드린다면, 모델 문자열은 어느 등급에서든 어떤 모델이 응답했는지를 보장하지 않습니다. Anthropic은 또한 thinking을 비활성화한 상태로 Sonnet을 실행하는 경우 between-tools 동작으로 전환해야 한다고 언급합니다. 이는 구성 플래그가 아니라 코드 변경입니다. 이 둘 중 어느 것도 해당 모델을 피할 이유는 아닙니다. 둘 다 출시하기 전에 알아야 할 이유입니다.

OrcaRouter에서 Claude Opus 5.5는 카탈로그에 있는 다른 모든 모델과 동일한 자격 증명으로 오늘 바로 라우팅할 수 있으며, 제공업체의 정가에 0% 마크업으로, 그 아래에서 자동 페일오버를 사용할 수 있습니다. Claude Sonnet 5.5는 아직 우리 플랫폼의 라우트가 아닙니다 — 이 모델은 출시된 지 하루밖에 되지 않았고, 목록에 등재되기 전까지는 Anthropic 자체 API를 통해 접근하게 된다고 말하는 것이 정직한 설명입니다. 현재 우리를 통해 Opus 5.5를 실행 중인 분이라면 통합의 다른 어떤 부분도 바꾸지 않고 전환이 이루어지는 날 가격을 산정할 수 있습니다.

어느 것을 어디에 둘까요

숫자에서 따라 나오는 구분은 다음과 같습니다: 터미널 기반 에이전트 작업에는 Claude Sonnet 5.5가 적합합니다. Anthropic 자체의 Terminal-Bench 4.0 수치에서 둘 중 더 강력하고 가격도 절반이기 때문입니다; 처리량 중심의 모든 작업에도 Claude Sonnet 5.5가 적합합니다. 비용 차이는 작업이 긴 출력을 강제할 때만 좁아지기 때문입니다; FrontierCode급 작업, 대규모 코드베이스 전반에 걸친 장기 리팩터링, 그리고 54.4% 대 46.2%의 격차가 리더보드의 한 줄이 아니라 실제 문제의 형태를 반영하는 모든 워크로드에는 Claude Opus 5.5가 적합합니다.

작업이 개방형이고 출력 길이를 예측할 수 없다면, 토큰당 가격은 완전히 잘못된 숫자로 취급하세요. 어느 쪽으로든 결정을 내리기 전에 일주일 동안 자체 트래픽에서 완료된 작업당 토큰을 측정하세요. $7.60 대 $5.98이라는 artificial-analysis 수치는 저렴한 모델이 실제로 비용을 지불하는 지표에서 손해를 볼 수 있다는 경고입니다.

솔직한 결론: 이것은 더 이상 능력 대 비용의 트레이드오프가 아니다. 그것은 당신의 작업이 경계를 가지는지의 문제다. 경계가 정해진, 대량의, 도구 기반 작업에서는 이용 가능한 증거에 비추어 더 저렴한 모델이 더 나은 모델이기도 하며, 플래그십은 두 배의 가격을 지불할 가치가 없다. 개방형의 장기적 작업에서는 Opus 5.5가 여전히 확실히 더 강력하다는 Anthropic 자신의 문장을 믿어야 하며, 아직은 어떤 벤치마크 수렴도 그것을 바꾸지 않는다.

A two-column scoreboard for Claude Sonnet 5.5 and Claude Opus 5.5 across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, AA Intelligence Index v4.3 score 56 at $7.60 per task, Terminal-Bench 4.0 (vendor) 70.6%, GDPval-AA v2.1 (vendor) 1844. Right column Claude Opus 5.5: input $4.00, output $20.00, cache read $0.20, cache write $5.00, 1M context with 128K max output, AA Intelligence Index v4.3 score 58 at $5.98 per task, Terminal-Bench 4.0 (vendor) 66.4%, GDPval-AA v2.1 (vendor) 1846. The card heading reads "Claude Sonnet 5.5 against Claude Opus 5.5: eight rows, two of them on a different instrument", and a footer line reads "Per-token prices per the OrcaRouter catalogue; index and per-task figures per Artificial Analysis, Intelligence Index v4.3. Terminal-Bench and GDPval-AA rows are Anthropic's own launch table, run on a pre-release deployment, and are not the same instrument as the index."Screenshot of Anthropic's newsroom page for Claude Sonnet 5.5, showing the site navigation bar, the publication date September 28, 2026, the model heading "Claude Sonnet 5.5", and an image-led marketing hero beneath it that carries no machine-readable specification figures.Screenshot of the OrcaRouter model page for Anthropic Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with 128K maximum output, text, image and file input, the Vision, Tools, JSON and Reasoning capability tags, a 4.57-second p50 time to first token, and the $4.00 input and $20.00 output prices per million tokens.