Claude Sonnet 5.5 대 Claude Opus 5용 히어로 타이틀 카드를 생성했습니다. 부제는 '60% 가격 인하와 5포인트 격차'이며, 백만 토큰당 $2.00와 $10.00을 $5.00와 $25.00과 대비하여 보여주고, 오른쪽 아래 모서리에 OrcaRouter 로고가 합성되어 있습니다.
Guides & Insights

Claude Sonnet 5.5 vs Claude Opus 5: 모든 항목에서 더 저렴하고, 지수에서도 앞선다

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Claude Opus 5는 2026년 7월 24일 출시되었으며, 입력 토큰 100만 개당 $5.00, 출력 토큰 100만 개당 $25.00입니다. Claude Sonnet 5.5는 2026년 9월 28일 정식 출시되었으며, 각각 $2.00와 $10.00입니다. 이는 두 세대 더 새로운 모델에서 입력 60%, 출력 60% 인하된 것이며, Artificial Analysis가 두 모델 모두에 적용하는 하네스에서 Intelligence Index v4.3 기준 56점을 기록해 Claude Opus 5의 51점과 대비됩니다. 이는 더 새롭고 더 저렴한 모델이 제3자 지수에서 더 높은 점수를 받는 드문 비교이며, 기존 모델을 선택할 남은 근거가 벤치마크 순위가 아니라 특정 유형의 작업이라는 점을 보여줍니다. 두 모델 모두 1M 토큰의 컨텍스트를 지원하고, 최대 128K 토큰을 출력하며, 텍스트, 이미지, 파일을 읽고, 사고 토큰 예산이 아닌 effort 파라미터를 통해 추론을 구성합니다. 표면적 사양이 동일하기 때문에, 둘 중 하나를 선택하는 것은 완료된 작업에 드는 비용과 어떤 작업이 실패하는지의 문제일 뿐입니다.

두 개의 릴리스, 하나의 인터페이스

대부분의 세대 도약보다 더 크니까, 변화가 얼마나 적은지부터 시작해 보세요.

• 컨텍스트 윈도우 — 양쪽 모두 1,000,000 토큰

• 최대 출력 — 양쪽 모두 128,000 토큰

• 입력 모달리티 — 양쪽 모두 텍스트, 이미지, 파일 지원, 어느 쪽에도 오디오와 비디오는 없음

• 추론 — 양쪽 모두에서 설정 가능한 강도를 갖춘 적응형 사고를 지원하므로, 깊이는 별도의 모델 문자열이 아니라 요청 파라미터입니다

• 기능 — OrcaRouter 카탈로그에 등록된 다음 두 항목 모두 비전, 도구, JSON, 추론을 지원합니다: anthropic/claude-opus-5 및 Sonnet 라인

실질적인 결과는 Claude Opus 5용으로 작성된 프롬프트를 Claude Sonnet 5.5에서 실행하기 위해 다시 작성할 필요가 없으며, 128K 출력 상한에 맞춰 조정된 에이전트 루프에 새 티어가 필요하지 않다는 것입니다. 마이그레이션은 모델 문자열 교체와 어떤 effort 설정을 고정해 두었는지 다시 확인하는 것뿐입니다 — 그 이상은 없습니다. 지난 2년간의 멀티모달, 멀티파라미터 전환을 겪은 팀들에게 이것이 헤드라인이며, 벤치마크가 아닙니다.

정말로 달라지는 단 하나는 가격이며, 그것도 마케팅 슬라이드에 나온 두 개만이 아니라 모든 라인에서 달라집니다.

• 입력 — $5.00 대비 60% 인하된 백만당 $2.00

• 출력 — 백만 개당 $10.00, $25.00 대비 60% 인하

• 캐시 읽기 — 백만 건당 $0.20, $0.50 대비 60% 인하

• 캐시 쓰기 — 5분짜리 $10.00 대비 백만 토큰당 $2.50, 75% 인하

매 턴마다 긴 접두사를 다시 읽는 에이전트를 운영한다면, 마이그레이션 비용을 정당화하는 항목은 바로 캐시 읽기 라인이다. $0.50 대비 $0.20이라면, 긴 세션에서 캐시된 모든 토큰의 비용이 이전의 40%로 떨어지며, 대부분의 에이전트 루프에서 토큰 수의 대부분을 차지하는 것은 캐시 읽기다. 그 절감 효과는 토큰당 수치라는 헤드라인이 포착하지 못하는 방식으로 복리처럼 쌓인다.

다섯 점은 어디에서 오는가

Artificial Analysis는 Intelligence Index v4.3에서 Claude Sonnet 5.5에 56점, Claude Opus 5에 51점을 부여했으며, 둘 다 "Adaptive Reasoning, Max Effort" 구성에서 측정되었습니다. 그 척도에서 5점 차이는 반올림 오차가 아닙니다 — 참고로, 같은 평가자는 Sonnet 5를 38점, Gemini 3.1 Pro Preview를 30점에 위치시킵니다. 따라서 Claude Opus 5와 Claude Sonnet 5.5 사이의 격차는 Claude Opus 5와 이전 Sonnet 세대 사이의 격차의 3분의 1입니다.

Anthropic이 자체 발표한 Claude Sonnet 5.5의 출시 수치도 다른 측정 도구를 사용했지만 같은 방향을 가리킨다. 이 회사는 Terminal-Bench 4.0에서 70.6%를 보고하는데, 같은 테스트에서 Claude Opus 5는 이전 Anthropic 표에 89.1%로 기록되어 있다. 이 수치는 다른 하네스 리비전을 사용한 것이므로 더 새로운 수치에서 빼서는 안 된다. 이것이 이 글에서 가장 중요한 출처 관련 주의사항이다. Terminal-Bench는 2026년 중반에 4.0으로 넘어갔고, 이를 담은 지수는 그에 맞춰 v4.3으로 개정되었으며, 해당 벤치마크의 버전 간 비교는 단순 산술이 아니다. 숫자에 버전이 붙어 있으면 그 버전을 함께 인용하라.

깔끔하게 비교할 수 있는 것은 벤더 자체의 Sonnet 측 진전 — Sonnet 5의 Terminal-Bench 4.0에서 10.3%에서 Sonnet 5.5의 70.6%로 — 그리고 제3자 지수 수치인데, 여기서 두 수치는 같은 날 같은 하네스에서 나온 것이다. 그 증거에 따르면 후속 모델은 일반 추론에서 7월 플래그십을 실제로 앞질렀으며, 이는 어떤 벤더 슬라이드가 내세우는 것보다 더 강한 주장이다.

출력 길이 함정

바로 여기서부터 산술은 신형 모델에게 더 이상 호의적이지 않다.

Artificial Analysis는 자사 인덱스 스위트에서 Claude Sonnet 5.5를 평가하는 데 작업당 7.60달러가 든다고 보고합니다. 같은 스위트에서 Claude Opus 5는 작업당 5.86달러가 듭니다. 더 새로운 모델은 요금표의 모든 항목에서 60% 할인된 가격임에도, 작업을 완료하는 데 약 30% 더 비쌉니다. 그 이유는 같은 보고서에 나옵니다: Sonnet 5.5는 해당 스위트 전반에서 4억 1천만 개의 토큰을 출력했는데, 추적된 모델들의 중앙값은 8,800만 개였으며, 평가자는 이를 "매우 장황함"이라고 표시합니다. Claude Opus 5는 같은 스위트에서 1억 4천만 개를 출력했습니다.

나눠보면 메커니즘은 단순하다. Sonnet 5.5는 동일한 작업에서 Claude Opus 5의 약 세 배에 달하는 출력 토큰을 출력 가격의 40%로 생산한다. 3 곱하기 0.4는 1.2, 즉 캐시 효과를 고려하기 전 20%의 페널티이며, 이는 $7.60 대 $5.86이라는 결과에 근접한 범위다. 토큰당 가격이 틀린 것은 아니다. 다만 청구서를 좌우하는 숫자가 아닐 뿐이다.

이것이 더 새로운 모델이 더 나쁜 선택이 된다는 뜻은 아니다. 이는 그 결정이 대부분의 비교가 빠뜨리는 무언가에 달려 있게 만든다. 바로 당신의 워크로드가 출력을 제한할 수 있게 해주는지 여부다. 길이 지침이 있는 요약 작업, JSON을 생성하는 구조화 추출 파이프라인, 레이블을 반환하는 분류기 — 이 모든 경우에는 장황함이 전혀 나타나지 않으며, 60% 요율표 인하는 실질적인 이득이다. 출력 규율 없이 "리포를 고쳐" 달라는 요청을 받는 개방형 에이전트는 Sonnet 5.5에게 세 배의 여지를 안겨준다.

Effort 설정과 아무도 예산을 배정하지 않는 마이그레이션

두 모델 모두 여러 수준을 가진 effort 파라미터를 통해 추론 깊이를 노출하며, 둘 다 고정값이 아니라 기본값을 제공합니다 — Claude Platform에서는 high, Claude 앱 내에서는 medium입니다. 마이그레이션을 할 때 유혹은 예전 모델에 있던 설정을 그대로 두고 작업을 끝냈다고 하는 것입니다.

그것은 측정 가능한 이유로 잘못된 선택입니다. Claude Sonnet 5.5에 관한 Anthropic 자체 각주에는 Max effort 구성이 FrontierCode에서 Xhigh보다 낮은 점수를 받는다고 나와 있습니다. 이는 effort가 단조 증가 다이얼이 아니며 최상위 설정이 공짜 업그레이드가 아니라는 뜻입니다. 사용 가능한 가장 비싼 옵션을 선택하는 대신 작업을 측정하여 effort를 설정하세요.

Sonnet 쪽에는 배포 전에 알아둘 만한 확고한 행동 차이가 하나 더 있습니다. Anthropic에 따르면 Claude Sonnet 5.5는 자사의 최상위 모델에 맞먹는 사이버 보호 장치와 폴백을 갖춰 출시된 최초의 Sonnet입니다. 따라서 고위험 보안 요청은 사용자가 지정한 모델이 처리하는 대신 눈에 띄게 이전 Sonnet으로 폴백됩니다. 워크로드가 그 영역에 속한다면 로그에는 요청하지 않은 모델이 표시될 것입니다. Claude Opus 5는 Sonnet 라인의 그러한 조치보다 먼저 나왔지만, 동일한 계열의 라우팅은 Anthropic의 최상위 등급 제품 전반에서 생물학 및 사이버보안 작업을 위해 존재합니다.

OrcaRouter에서는 현재 두 엔드포인트가 모두 라이브 상태입니다 — anthropic/claude-opus-5와 anthropic/claude-sonnet-5는 다른 모든 항목과 동일한 카탈로그에 자리하고 있으며, 제공업체 정가에 0% 마크업으로 책정됩니다 — 그리고 Claude Sonnet 5.5는 목록에 등재되는 즉시 동일한 자격 증명으로 접근할 수 있게 됩니다. 그동안 관련된 기능은 자동 페일오버입니다: Anthropic 등급 중 하나가 속도 제한에 걸리거나 오류를 반환하면, 코드 변경 없이 요청을 다른 쪽으로 다시 지정할 수 있으며, 이는 이 비교에 대해 잘못 판단했을 경우에 대비할 수 있는 가장 저렴한 헤지 수단입니다.

규칙으로 제시된 결정

당신의 작업이 한정적이라면 — 출력 형태를 직접 통제하고, 프롬프트가 구조화되어 있으며, 작업당 토큰 수를 예측할 수 있다면 — Claude Sonnet 5.5로 이동해 60% 절감을 받아들여라. 지수도 동의하고, 요금표도 동의하며, 반대편에는 더 이상 성능 논거가 남아 있지 않다.

업무가 개방형이고 에이전트 기반이라면, 어느 가격표든 믿기 전에 실험을 먼저 실행하십시오. 각 모델에서 일주일 동안 자체 트래픽을 기준으로 완료된 작업당 토큰을 측정하십시오. $7.60 대 $5.86이라는 제3자 결과는 더 저렴한 요율표가 오히려 더 큰 청구서를 만들 수 있다는 구체적인 경고입니다. 그 수치를 확보할 때까지 Claude Opus 5는 장기적 자율 작업에 더 안전한 기본값으로 남아 있습니다.

솔직한 평가: 이번이 플래그십의 명분이 순수 역량이 아니라 작업 형태에 달려 있는 첫 Sonnet 세대이며, 여전히 모델 이름만으로 결정을 내리는 사람은 이제 어느 쪽으로 추측하느냐에 따라 60%를 그냥 놓치거나 완료된 작업당 30%를 더 지불하고 있는 셈이다.

A two-column scoreboard for Claude Sonnet 5.5 and Claude Opus 5 across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run, 410M output tokens on the index suite. Right column Claude Opus 5: input $5.00, output $25.00, cache read $0.50, cache write $10.00, 1M context with 128K max output, AA Intelligence Index v4.3 score 51, $5.86 per task on the index run, 140M output tokens on the index suite. A footer line reads "Prices per the OrcaRouter catalogue; index and per-task figures per Artificial Analysis, Intelligence Index v4.3. Sonnet 5.5 is 60% cheaper on input, output and cache reads and 75% cheaper on cache writes, and still costs about 30% more per finished task."Screenshot of the OrcaRouter model page for Anthropic Claude Opus 5 (anthropic/claude-opus-5), showing the model header, a 1M-token context window with 128K maximum output, text, image and file input, the Vision, Tools, JSON and Reasoning capability tags, a 5.19-second p50 time to first token, a "Public benchmarks by Anthropic · 2026-07-24" line, and the $5.00 input and $25.00 output prices per million tokens.Screenshot of Artificial Analysis's model page for Claude Sonnet 5.5, named in full as "Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)" and marked released September 2026, showing the In $2.00 and Out $10.00 rates, the Intelligence Index score of 56, the $7.60 average cost per task, and the 410M output tokens described as very verbose against a median of 88M.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트