
Claude Sonnet 5.5 vs Claude Sonnet 5: 동일한 가격, 다른 청구서
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 984 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 195 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
같은 공급사의 두 모델, 같은 등급, 같은 이름, 그리고 — 공개된 요금표의 모든 줄에서 — 같은 가격. Claude Sonnet 5는 2026년 6월 30일에 출시되었으며 입력 토큰 백만 개당 $2.00, 출력 토큰 백만 개당 $10.00이었습니다. Claude Sonnet 5.5는 2026년 9월 28일 정식 제공되기 시작했으며 $2.00 및 $10.00이었고, 캐시 읽기는 $0.20, 5분 캐시 쓰기는 두 모델 모두 $2.50이었습니다. 가격에 관해 달라진 것은 없었습니다. 달라진 것은 요금표가 측정하지 않는 모든 것이며, 그 결과 이 두 모델 중 하나는 토큰당 비용이 정확히 같음에도 다른 하나보다 운영 비용이 상당히 저렴합니다. Anthropic이 이번 출시에 내건 자체 헤드라인도 이를 대놓고 말하지는 않으면서 그만큼을 시사합니다: 변경되지 않은 요금표에서, 대부분의 작업에 대해 최대 30% 더 낮은 비용. 두 문장이 모두 참이 되는 유일한 방법은 더 새로운 모델이 같은 작업을 더 적은 토큰으로 끝내는 경우이며, 이는 벤치마크가 보여주는 바이고 독립적인 작업별 수치가 확인하는 바입니다.
Claude Sonnet 5.5가 Claude Sonnet 5보다 더 비싼가요?
아니요 — 그리고 어쨌든 그 질문은 진지하게 받아들일 가치가 있습니다. 수많은 마이그레이션이 정액 요율표를 정액 청구서로 취급하다가 잘못되어 왔으니까요.
토큰당 두 모델은 동일합니다: 입력 $2.00, 출력 $10.00, 캐시된 토큰 읽기 $0.20, 쓰기 $2.50. 계층형 구간도, 장문맥 할증도 없습니다. 더 새로운 모델이 무엇이든, 그것은 세대 업그레이드로 포장된 가격 인상이 아닙니다.
완료된 작업당 비용을 보면, 누구의 워크로드를 설명하느냐에 따라 그림이 뒤집힌다. Artificial Analysis는 동일한 Intelligence Index v4.3 스위트에서 Claude Sonnet 5의 작업당 비용을 $5.09, Claude Sonnet 5.5의 작업당 비용을 $7.60으로 보고한다. 즉, 더 새로운 모델은 동일한 단가에서 작업을 완료하는 데 49% 더 비쌉니다. 같은 보고서는 Sonnet 5.5가 스위트 전체에서 4억 1,000만 토큰을 생성한 반면 Sonnet 5는 3억 7,000만 토큰을 생성했으며, 두 수치 모두 추적 대상 분야의 중앙값인 8,800만 토큰과 대비된다고 지적한다. 평가자의 개방형 프롬프트에서 더 새로운 모델은 단순히 더 많이 작성하며, 동일한 가격에서는 토큰이 많을수록 청구서가 더 커진다.
Anthropic의 30% 더 저렴하다는 주장은 자사가 선택한 워크로드에 관한 공급업체 주장이다. 제3자의 $7.60 대 $5.09는 다른 세트에 대한 측정값이다. 어느 쪽도 틀리지 않았으며, 이 불일치가 바로 핵심이다. 그리고 결정적 요인은 당신의 작업이 자체 출력을 제한하는지 여부다.
두 사람 사이에서 실제로 무엇이 이동했나요
요율표는 정적이지만, 모델은 그렇지 않다. 하나의 목록으로 나열하면, 차이는 크고 대부분 한 방향이다.
• Terminal-Bench 4.0 — Claude Sonnet 5.5의 70.6% 대 Claude Sonnet 5의 10.3%, Anthropic이 이 테스트에서 발표한 단일 세대 최대 상승폭
• CursorBench 4.0 — 55.5% 대 34.1%
• 차트 작성, 도구 없이 — 61.6% 대 15.6%
• GDPval-AA v2.1 — 1844 대 1449
• AA-Briefcase v1.1 — 1811 대 1359
• Humanity's Last Exam, 도구 사용 시 — 64.5% 대 54.9%
• OSWorld 2.1, 부분 완료 — 57.0% 대비 80.1%
• Artificial Analysis Intelligence Index v4.3 — 56 대 38, 동일한 "Adaptive Reasoning, Max Effort" 구성에서 측정된 제3자 척도상의 18점 격차
그 목록의 양상은 균일한 진전이 아니다. Chartography가 15.6%에서 61.6%로, Terminal-Bench가 10.3%에서 70.6%로 움직인 것은 개선된 능력이라기보다 없었는데 이제 존재하게 된 능력처럼 보인다. 가격은 그대로인 채 Humanity's Last Exam이 10점, OSWorld가 23점 오른 것은 일반적으로 더 똑똑해진 세대가 아니라 특정 격차를 메운 세대의 패턴이다. 18점의 지수 격차는 그것의 산술평균이다. 실제이고 크며, 도구 사용, 코드 실행, 시각 작업에 집중되어 있다.
벤더 표를 꼼꼼히 들여다보는 사람이라면 누구나 주목해야 할 각주가 하나 있다. Anthropic은 FrontierCode에서 Max effort 구성이 Xhigh보다 더 낮은 점수를 기록한다고 밝히고 있으며, GDPval-AA와 AA-Briefcase 실행이 구조화된 출력 버그가 있는 사전 출시 배포판에서 수행되었다는 점을 지적한다. 위 수치는 여전히 이용 가능한 최선의 값이지만, 모델의 영구적인 속성이 아니라 하나의 배포판에서 얻은 스냅샷으로 취급해야 한다.
가격은 같은데 청구서는 왜 다를까
실제 청구서에 얼마나 큰 영향을 미치는지에 따라 내림차순으로 나열한 세 가지 메커니즘.
첫 번째는 출력 길이 규율이다. Sonnet 5.5는 더 유능한 에이전트이므로 답하기 전에 더 많은 일을 처리하며, 길이 제약이 없는 스위트에서는 토큰당 비용은 같으면서 Sonnet 5보다 약 11% 더 많이 작성한다. 출력에 상한을 두는 워크로드, 즉 고정 스키마로의 추출, 분류, 범위가 정해진 요약에서는 그 11%가 결코 실현되지 않고 30% 주장은 믿을 만해진다. 왜냐하면 그 이득은 턴당 토큰 수가 아니라 더 적은 턴 수로 답에 도달하는 데서 나오기 때문이다.
두 번째는 캐시 동작 방식이며, 이것이 캐시 읽기 가격이 그대로라고 해서 캐시 비용도 그대로라는 뜻은 아닌 이유입니다. 두 모델 모두에서 캐시 읽기와 쓰기 가격이 동일하므로, 캐시된 토큰 볼륨의 변화는 청구서에 곧바로 반영됩니다. 에이전트 작업을 완료하는 데 더 적은 턴이 걸리는 모델은 프리픽스를 더 적은 횟수로 읽습니다. 이는 가격 변동이 전혀 뒷받침하지 않는 절감이며, 요금표 항목만 나열하는 모든 비교 표에서는 보이지 않습니다.
세 번째는 대부분의 팀이 마이그레이션 당일에 가장 많이 틀리는 항목입니다: effort 기본값입니다. Claude Sonnet 5.5는 low, medium, high, xhigh, max 설정이 있는 effort 매개변수를 통해 추론을 구성하며, Claude Platform에서는 high가, Claude apps 내부에서는 medium이 기본값입니다. 추론 예산을 고정해 두었던 Sonnet 5 배포에서 마이그레이션했다면, 새 기본값은 지불하던 깊이와 다른 깊이일 수 있습니다. 절감인지 증가인지 가정하기 전에 측정하세요.
배포 후가 아니라 배포 전에 짚고 넘어갈 만한 동작상의 결과도 있습니다. Anthropic에 따르면 Claude Sonnet 5.5는 최상위 모델과 동일한 수준의 사이버 안전장치와 폴백을 갖추고 출시되는 첫 Sonnet이므로, 위험도가 더 높은 사이버보안 요청은 이전 Sonnet으로 눈에 띄게 폴백됩니다. 로그에는 요청하지 않은 모델이 표시될 것입니다. 이와 관련해, thinking을 비활성화한 상태로 Sonnet을 실행한다면 도구 간(between-tools) 동작으로 전환해야 합니다 — 플래그가 아니라 코드 변경입니다.
OrcaRouter에서 anthropic/claude-sonnet-5오늘 하나의 자격 증명으로 제공자의 정가에 0% 마크업으로 라우팅할 수 있으며, Claude Opus 5.5, Claude Opus 5, DeepSeek V4 Pro, Gemini 3.1 Pro Preview와 함께 사용할 수 있습니다. Claude Sonnet 5.5 자체는 아직 우리 플랫폼의 라우트가 아니므로, 따라서 지금 이 비교의 실질적인 형태는 이미 Sonnet 5를 실행 중인 팀이 API 키를 건드리지 않고 Sonnet 5.5가 목록에 등록되는 날 델타를 측정할 수 있고, 그동안 문자열을 변경하여 티어 간에 페일오버할 수 있다는 것입니다.
전환하기 전에 사람들이 묻는 질문
두 모델을 동시에 실행해서 제 트래픽으로 비교할 수 있나요? 아직 하나의 OrcaRouter 자격 증명으로는 안 됩니다. Claude Sonnet 5.5가 등록된 라우트가 아니기 때문입니다. 우회 방법은 더 새로운 모델은 Anthropic 자체 API에서, 더 오래된 모델은 저희를 통해 실행한 다음, 토큰당 비용이 아니라 완료된 작업당 토큰을 비교하는 것입니다. 두 모델이 실제로 차이를 보이는 수치가 바로 그것이기 때문입니다.
가격이 그대로라는 것이 Anthropic이 새로운 기능에 대한 요금을 부과하지 않는다는 뜻인가? 그것은 모델이 개선되는 동안 정가가 그대로 유지된다는 뜻이며, 이는 이전 두 세대의 Sonnet과 같은 패턴이다. 그것이 계속될지 여부는 기술적 문제가 아니라 상업적 문제이며, 공개된 지원 종료 시점 — 2027년 9월보다 이르지 않음 — 이 유일하게 명시된 약속이다.
어느 숫자를 믿어야 할까요, Anthropic의 30%와 제3자의 49% 중에서? 일반적인 주장으로서는 어느 쪽도 아닙니다. Anthropic의 수치는 모델이 더 적은 턴으로 답에 도달하는 워크로드를 설명하고, Artificial Analysis의 수치는 장황함이 자유롭게 늘어날 수 있는 제약 없는 인덱스 제품군을 설명합니다. 여러분의 프롬프트 세트와 비슷한 쪽을 고르세요. 그리고 그것이 어느 쪽인지 분간할 수 없다면, 그 모호함 자체가 답입니다 — 측정하세요.
결론
Claude Sonnet 5.5는 가격 인상이 아니지만, 자동으로 절약이 되는 것도 아니다. Anthropic은 요율표의 모든 항목을 그대로 유지한 채 그 아래에 들어가는 모델을 바꿨다. 즉 전체 경제성은 완료된 작업당 토큰 수에 달려 있으며, 이 수치는 벤더가 선택한 워크로드에서는 30% 더 낫고 독립 평가자가 선택한 테스트 스위트에서는 49% 더 나쁘다. 작업이 자체 출력량을 제한한다면 전환해서 이득을 누려라. 그렇지 않다면, 가격이 그대로라는 점은 측정을 건너뛸 이유가 되지 않는다. 왜냐하면 해당 작업을 명백히 더 잘 수행하는 모델에 대해 작업당 1.5배를 지불할 수도 있기 때문이다.



