Claude Sonnet 5.5의 타이틀 카드. 제목은 '같은 가격, 더 적은 작업'이고, 부제는 '백만 토큰당 $2 / $10, Sonnet 5와 동일'이며, 세 개의 통계 카드는 56(AA Intelligence Index), #3 / 216(해당 지수에서의 순위), $7.60(최대 노력 시 작업당 비용)을 보여줍니다.
Guides & Insights

Claude Sonnet 5.5: 30% 비용 주장과 Sonnet 5 코드를 망가뜨리는 여섯 가지 변경 사항

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Claude Sonnet 5.5 shipped on September 28, 2026 at exactly the same rates as Claude Sonnet 5 — $2 per million input tokens, $10 per million output tokens, $0.20 per million cached reads — while Anthro​pic's announcement leads with "runs 30%+ faster and costs up to 30% less for most work." Both statements are true, and the distance between them is the whole story. The savings are not in the rate card, because the rate card did not move. They come from running the model at a lower effort setting than its predecessor needed, which means the 30% figure is a claim about an operating point you have to choose, not a price you inherit. Independent measurement makes the fork sharp: on Artificial Analysis, Claude Sonnet 5.5 at max effort costs $7.60 per task on the Intelligence Index against $5.09 for Claude Sonnet 5 at max — roughly 49% more, not 30% less. That is not a contradiction of Anthro​pic's number. It is the other end of the same curve, and it is where most migrations will land by default if nobody re-runs their effort sweep.

하나의 숫자를 쓰고 있는 두 개의 주장

Anthropic의 게시물은 작업당 주장을 세 곳에서 펼치며, 각각은 노력에 기댄다. 가장 강력한 버전: Terminal-Bench 4.0에서, 중간 노력에서 — Claude 앱의 기본값 — Sonnet 5.5는 "작업당 비용의 10분의 1도 안 되는 비용으로 Sonnet 5의 최고 점수를 훨씬 뛰어넘는다." AA-Briefcase v1.1에서, 중간 노력에서, 그것은 약 9분의 1의 비용으로 Sonnet 5의 최고 점수를 앞선다. CursorBench 4.0에서, 낮은 노력에서, 그것은 10분의 1 미만으로 Sonnet 5의 최고 점수를 초과한다.

이것들을 하나의 세트로 읽으면 메커니즘은 명백하다. Sonnet 5.5의 하한은 Sonnet 5의 상한보다 여러 평가에서 위에 있다. 토큰당 더 적게 지불함으로써 30%를 얻는 것이 아니다. 더 이상 비싼 설정이 필요 없어짐으로써 얻는 것이다. Anthropic은 마케팅 문서에서 한 페이지 건너편에 있는 마이그레이션 문서에서 이를 그대로 말한다: "노력 수준은 재보정됩니다. 노력 수준은 Claude Sonnet 5에서와 같은 양의 사고를 만들어내지 않습니다. 설정을 그대로 이어받지 말고 노력 스윕을 다시 실행하십시오."

그 문장은 Anthropic이 이번 주에 발표한 것 중 운영상 가장 중요한 문장이며, 대부분의 출시 보도에 포함되지 않은 문장이기도 하다.

Anthropic이 공개한 내용 — 공급업체 보고, 재현되지 않음

이 섹션의 모든 내용은 Anthropic 자체 측정치로, Sonnet 5.5 발표와 시스템 카드에서 나온 것입니다. 이는 독립적인 결과가 아니라 공급업체의 주장이며, 각주로 이어지는 맥락도 헤드라인 수치만큼 중요합니다.

• Terminal-Bench 4.0 (에이전트 코딩) — Sonnet 5.5 70.6% 대 Sonnet 5 10.3%. 이는 가장 많이 인용된 단일 행에서 7배 도약이며, 대부분의 보도가 앞세운 수치입니다.

• FrontierCode 1.1 (Main) — Sonnet 5.5는 Xhigh에서 52.1%, Max에서 46.2%; Sonnet 5는 42.4%; Claude Opus 5.5는 54.4%; GPT-6 Sol은 49.3%. 역전에 주목하세요: Sonnet 5.5는 더 낮은 Max에서 Xhigh에서보다

• CursorBench 4.0 — Sonnet 5.5는 55.5%, Sonnet 5는 34.1%, Opus 5.5는 57.8%입니다. CursorBench 4.0은 GPT-6 Sol을 공개적으로 보고하지 않습니다.

• GDPval-AA v2.1(지식 노동) — Sonnet 5.5 1844 Elo, Sonnet 5 1449, Opus 5.5 1846, GPT-6 Sol 1487.

• AA-Briefcase v1.1 — 동일한 네 모델에서 1811 / 1359 / 1822 / 1483.

• Humanity's Last Exam (도구 사용) — 64.5% / 54.9% / 67.7%.

• OSWorld 2.1(컴퓨터 사용, 부분 점수) — 80.1% / 57.0% / 81.8%.

• Chartography (도구 없이 시각적 차트 인식) — 61.6% / 15.6% / 64.4% / 53.6%.

세 개의 각주는 그 행들 아래가 아니라 그 행들과 함께 따라다닐 자격이 있다. 첫째, Terminal-Bench 4.0의 Opus 5.5 수치인 66.4%는 Opus 5.5의 최고 득점 구성인 Xhigh effort에서 보고된 값이다. 둘째, FrontierCode Max의 역전은 이렇게 설명된다. Max에서는 Sonnet 5.5가 Claude Code의 코드 리뷰 스킬을 더 자주 실행했는데, 이 스킬은 리뷰를 여러 서브에이전트로 분산하며, 두 사례에서는 타임아웃이 발생하거나 작업 범위를 벗어난 수정이 이루어졌다 — FrontierCode는 범위를 벗어난 변경이 좋은 변경이라도 페널티를 부과한다. 셋째, 그리고 벤더에게 가장 불편한 점인데, Artificial Analysis는 GDPval-AA와 AA-Briefcase를 출시 전 Sonnet 5.5 배포본에서 실행했으며, Anthropic에 따르면 이 배포본에는 구조화된 출력 요청에 대한 응답을 저하시키는 버그가 있었다. Anthropic은 그 영향이 작을 것이고 Sonnet 5.5를 실제보다 낮게 평가하게 만들었을 것이라고 예상하며, 버그는 수정되었다고 말한다. 또한 OpenAI가 최근 GPT-6 Sol의 이미지 이해 버그를 수정했으므로, 해당 행에 있는 GPT-6 Sol 수치는 아직 현재 모델을 반영하지 않을 수 있다는 점도 언급한다.

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56 at rank #3 of 216, $2.00 input and $10.00 output per 1M tokens, and a $7.60 average cost per index task with 410M tokens generated.

같은 모델에 대해 독립 실행이 말하는 것

Artificial Analysis는 Sonnet 5.5를 측정해 두었으며, 해당 페이지에는 정확한 구성이 명시되어 있습니다: "Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)". 동일한 버전의 인덱스에서, 같은 클래스에 속한 모델은 216개입니다:

• Claude Sonnet 5.5 — 인텔리전스 지수 56, 216개 중 3위. 지수 작업당 비용 $7.60. 지수 실행 중 410M의 출력 토큰을 생성했으며, 이는 중앙값 88M과 비교됩니다.

• Claude Sonnet 5 — 지수 38, 216개 중 58위, 자체 페이지에 "(Adaptive Reasoning, Max Effort)"로 표기됨. 작업당 비용 $5.09. 출력 토큰 3억 7천만 개.

• Claude Opus 5.5 — 인덱스 58, 216개 중 1위. 작업당 $5.98. 초당 출력 토큰 95.3개.

• GPT-6 Sol — 지수 48, 216개 중 20위, 정가 $2/$10. 작업당 $1.06, 초당 출력 토큰 89.8개.

Intelligence Index 격차 — 56 대 38, 18포인트 — 는 이 글에서 가장 강력한 독립적 확인이며, 독자가 실제로 가져가야 할 숫자다. 비용 수치는 단서를 달아야 하는 쪽이고, 정확히 말할 가치가 있다: 두 지점 모두 최대 추론 노력 설정이며, 더 오래 추론하는 모델에서 최대 추론 노력은 의도적으로 비용이 많이 드는 자리다. Sonnet 5.5는 해당 인덱스 실행에서 410M 토큰을 소모했고, Sonnet 5는 370M을 소모했으며, 둘 다 88M 중앙값을 훨씬 웃돈다. 최고 설정에서 더 오래 생각하는 모델은 최고 설정에서 더 많은 비용이 든다. 이 숫자가 반증하는 것은 "작업당 더 저렴함"이 아니라, 그것을 설정이 아니라 모델의 속성으로 읽는 모든 해석이다.

Artificial Analysis는 아직 Sonnet 5.5의 출력 속도 수치를 공개하지 않았습니다. 해당 페이지의 초당 출력 토큰 항목은 N/A로 표시되어 있는데, Sonnet 5는 78.7, Opus 5.5는 95.3입니다. 따라서 Anthropic의 주장 중 "30% 이상 더 빠르다"는 부분은 현시점에서는 벤더가 보고한 것일 뿐입니다. 제3자가 측정할 때까지는 이를 방향성 정보로 취급하십시오.

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Sonnet 5 - the cost-per-task fork'. The left column, Claude Sonnet 5.5, reads AA Intelligence Index 56, rank #3 of 216, cost per task at max effort $7.60, 410M output tokens on the index run, $2 / $10 input and output price, default effort high. The right column, Claude Sonnet 5, reads 38, #58 of 216, $5.09, 370M, $2 / $10, high.

절감이 실제로 어디에서 비롯되는지, 그리고 그것을 얻는 방법

메커니즘을 받아들인다면, 마이그레이션 지침은 스스로 작성되며, Anthropic은 이를 공개했습니다:

• 기본적으로는 high에서 시작하세요. Sonnet 5 설정이 어땠든 그대로 따라 하지 마세요. Anthropic의 권장 설정은 워크로드가 에이전트형이거나 지연 시간에 민감한 경우가 아니라면 high입니다.

• 에이전트형 코딩 및 다단계 도구 사용 — 잘 정의된 작업에는 중간부터 시작하고, 더 어렵거나 긴 작업에는 높음으로 올리세요.

• 채팅 및 기타 지연에 민감한 작업 — 중간 또는 낮음에서 시작하세요. 여기가 '비용의 10분의 1'이라는 주장이 존재하는 구간입니다.

더 낮은 설정이 효과가 있는 데에는 일관된 설명이 있으며, 그것은 마케팅이 아니다. Anthropic의 초기 테스터들은 Sonnet 5.5가 Sonnet 5보다 도구 호출을 더 많이 묶어 처리하여 작업당 단계 수가 줄어든다고 보고했다. CodeRabbit이 발표문에서 남긴 설명은 출시 인용문치고는 이례적으로 구체적이다: Sonnet 5의 "웹 검색에 너무 자주 의존하려는 경향과 높은 토큰 사용량은 이 새 모델에서 모두 사라졌다." Sonnet 5.5는 또한 Sonnet 5와 동일한 토크나이저를 유지했으므로, 동일한 텍스트는 동일한 토큰 비용이 든다 — 감소는 더 적은 턴과 더 적은 중복 호출에서 비롯된 것이지, 더 저렴한 어휘 때문이 아니다. 이는 또한 업그레이드 전반에 걸쳐 로그의 토큰 수가 비교 가능하게 유지된다는 뜻이며, 따라서 전후 측정이 간단해진다.

Sonnet 5 코드를 깨뜨리거나 변경하는 여섯 가지 변화

이것은 릴리스에서 엔지니어링 시간을 소모하게 만드는 부분이며, 바로 이 지점에서 마이그레이션 가이드가 벤치마크 차트보다 더 가치가 있습니다. 여섯 개 중 다섯 개는 하드 오류를 반환하고, 여섯 번째는 조용히 실패합니다.

• thinking: {"type": "disabled"}은 이제 400을 반환합니다. 대체 항목은 thinking: {"type": "between_tools"}이며, 이는 사전 사고를 끄고 이 모델에서 가장 낮은 thinking 설정입니다. low, medium, high effort에서 작동하고, 베타 헤더가 필요 없으며, Sonnet 5.5를 제공하는 모든 플랫폼에서 사용할 수 있습니다. xhigh 또는 max effort에서는 between_tools 자체가 400을 반환합니다 — 해당 수준이 필요하다면 adaptive thinking을 사용하세요(필드를 생략하거나 {"type": "adaptive"}를 전송). between_tools를 사용하면 대화 중간에 effort를 변경할 수도 없습니다.

• 강제 도구 사용은 지원되지 않습니다. tool_choice를 {"type": "any"} 또는 {"type": "tool", "name": "..."}로 설정하면 400이 반환되며 메시지는 "tool_choice: type 'tool' and 'any' are not supported for this model."입니다. 동일한 검사가 토큰 계산 엔드포인트에도 적용됩니다. 스키마에 유효한 입력에 대해 문서화된 대체 방법은 tool_choice: {"type": "auto"}와 도구의 strict: true를 함께 사용하거나, 스키마를 구조화된 출력으로 옮기는 것입니다.

• 사고 블록은 모델과 대화에 바인딩됩니다. Sonnet 5.5는 Sonnet 5, Opus 4.8, Haiku 4.5 및 그 이전 모델의 사고 블록을 읽습니다 — Opus 5, Opus 5.5 또는 Fable이나 Mythos 모델에서는 읽지 않습니다. 다른 모델은 Sonnet 5.5의 블록을 읽지 않습니다. 대화를 Sonnet 5에서 5.5로 옮기면 추론이 유지되지만, Sonnet 5.5에서 다른 모델로 옮기면 이후 턴은 그것 없이 실행됩니다. 별도로, API는 이제 사고 블록이 생성된 이후 시스템 프롬프트, 도구 목록 또는 이전 메시지가 변경되었는지 확인하며, 2026년 8월 31일 이후에 생성된 계정에서는 변경된 경우 400을 반환합니다. 대화를 추가 전용으로 유지하거나, prefix_mismatch_behavior: "drop_block"과 함께 thinking-binding-controls-2026-08-01 베타 헤더를 보내세요.

• computer_20251124는 Claude API와 Google Cloud에서 거부됩니다. 그곳에서 컴퓨터 사용 기능을 쓰려면 computer_toolset_20260801 툴셋이 필요합니다. Amazon Bedrock은 여전히 이전 도구를 허용합니다 — 동일한 에이전트를 두 플랫폼에서 모두 실행한다면 짚고 넘어갈 만한 플랫폼 차이입니다.

• 일부 어드바이저 조합은 더 이상 지원되지 않습니다. Sonnet 5.5 실행기는 Mythos 5.1, Fable 5.1, Mythos 5, Fable 5, Opus 5.5, Opus 5 또는 Sonnet 5.5 자체를 어드바이저로 받습니다. Sonnet 5 실행기와 함께 작동하는 Opus 4.8, Opus 4.7 및 Sonnet 5 어드바이저는 Sonnet 5.5 실행기에서 400을 반환합니다. Sonnet 5.5가 받는 모든 어드바이저는 조언을 암호화된 상태로 반환하므로, 클라이언트에서는 조언 텍스트를 읽을 수 없습니다.

• 이제 도구 호출 사이의 텍스트는 thinking 블록 안으로 들어오며, 기본 display인 "omitted"에서는 비어 있습니다. 이것은 조용한 쪽입니다. 도구 호출 사이에 한두 문장보다 긴 메모는 텍스트가 아니라 진행 상황 업데이트 thinking 블록으로 반환됩니다. 그 내레이션을 사용자에게 스트리밍하는 애플리케이션은 도구 호출 사이에 오류도 없고 로그에도 아무것도 없이 조용해집니다. 해결책은 텍스트가 반환되도록 thinking.display를 설정하거나, between_tools로 전환하는 것입니다. 후자의 경우 텍스트는 일반 텍스트로 돌아옵니다.

마이그레이션이 건드리는 두 가지가 더 있는데, 둘 다 오류는 아니다. 거부 모니터링: Sonnet 5.5는 stop_reason: "refusal"을 반환하며, stop_details 객체가 다섯 가지 정책 영역 중 하나를 명시한다 — cyber, bio, frontier_llm, reasoning_extraction, general_harms — 그리고 Anthropic의 서버 측 폴백은 Sonnet 5에서 cyber와 frontier_llm 거부를 재시도하지만 나머지 셋은 재시도하지 않는다. 그리고 보안 태세는 실제로 달라졌다: Sonnet 5.5는 Opus 등급처럼 사이버 안전장치와 폴백을 갖추고 출시된 첫 Sonnet 모델이며, 이는 더 높은 위험의 사이버보안 요청이 눈에 띄게 Sonnet 5로 폴백된다는 뜻이고, 추론 추출에 대응하는 분류기를 갖춘 첫 Sonnet이기도 하다. 제품의 가치 제안이 보안 도구라면, 모델 교체를 출시하기 전에 그 경계를 테스트하라.

가격 책정, 그리고 오늘 우리 경로에 실제로 있는 것

요금표는 Sonnet 5와 동일하며, 공개된 전체 형태는 간단히 밝힐 수 있을 만큼 짧습니다:

• 입력 — 백만 토큰당 $2.00. 출력 — 백만 토큰당 $10.00. 둘 다 Sonnet 5와 동일하며, Sonnet 5.5 관련 Anthropic 모델 페이지에서 확인되었습니다.

• 캐시 읽기 — 백만당 $0.20, 입력 대비 90% 할인; 5분 캐시 쓰기 백만당 $2.50; 1시간 캐시 쓰기 백만당 $4.00. 최소 캐시 가능 프롬프트는 Sonnet 5.5에서 512토큰이며, Sonnet 5의 1,024토큰에서 감소했습니다.

• Batch — 양방향 모두 50% 할인되어 백만 토큰당 $1.00 / $5.00입니다. Message Batches API에서는 output-300k-2026-03-24 베타 헤더를 사용하면 출력이 300K 토큰까지 가능합니다.

• Opus 5.5와 비교하면 — Sonnet 5.5는 정확히 절반입니다: $2/$10 대 $4/$20이며, 캐시 쓰기는 절반이고 캐시 읽기는 $0.20로 동일합니다. 이는 이득이 되는 마이그레이션이며, Anthropic은 이를 분명히 밝힙니다: 두 모델은 Sonnet이 더 낮은 노력으로 실행될 때 서로를 가장 잘 보완하며, Opus는 "지속적인 판단이 필요한 복잡하고 개방형 작업에서 분명히 더 강력합니다."

• 컨텍스트 및 출력 — 1M 토큰 컨텍스트, 최대 128K 출력, 적응형 사고 기본 활성화, 기본 노력 수준 높음, 안정적인 지식 컷오프 2026년 6월, 제로 데이터 보존 사용 가능, 2027년 9월 28일 이전에는 지원 종료되지 않음.

저희가 암시하기보다 차라리 명시하고자 하는 가용성 관련 참고 사항이 하나 있습니다: Claude Sonnet 5.5는 2026년 9월 29일 기준으로 저희 모델 카탈로그에 없습니다. 그 전신인 anthropic/claude-sonnet-5와 더 큰 형제 모델인 anthropic/claude-opus-5.5는 둘 다 등재되어 있으며, 저희 쪽의 요금은 제공사 자체의 요금입니다 — Sonnet 5의 경우 입력 $2.00, 출력 $10.00, 캐시 읽기 $0.20, 캐시 쓰기 $2.50이고 마크업이 전혀 붙지 않으므로, 공급사의 가격 변경은 다음 청구 주기가 아니라 적용되는 당일 바로 여기에 반영됩니다. 바로 이 마지막 특성 덕분에 요금표를 읽는 일이 장식이 아니라 유용한 것이 됩니다.

OrcaRouter model page for anthropic/claude-sonnet-5, attributed to Anthropic and dated 2026-06-30, showing a 1M-token context window, up to 128K output tokens, and the unchanged rates of $2.00 per million input tokens and $10.00 per million output tokens. The page carries a link reading 'the Claude Sonnet 5 API'.

오늘 이걸로 무엇을 할 수 있는지

이미 프로덕션에서 Claude Sonnet 5를 실행하고 있는 팀을 위한 정직한 진행 순서는 세 단계이며, 그중 어느 것도 "모델 문자열을 바꾸고 그래프를 지켜보는 것"이 아니다.

먼저, 에포트 스윕을 다시 실행하세요. Sonnet 5에서 품질 기준이 그걸 요구했기 때문에 high 또는 max 설정을 그대로 이어 왔다면, 이제는 더 이상 구매할 필요 없는 추론에 비용을 지불하고 있는 셈입니다. 독립적인 작업당 비용 수치에 따르면 사다리 꼭대기는 더 비싸졌지 저렴해지지 않았으며, 벤더 자체의 비용 주장은 모두 사다리 중간만을 설명합니다. 둘째, 배포 전에 두 가지 오류 경로, 즉 비활성화된 사고와 강제 도구 사용을 수정하세요. 둘 다 크게 그리고 즉시 실패하기 때문인데, 이는 좋은 소식입니다. 셋째, 내레이션 경로를 주시하세요. 조용히 실패하기 때문입니다.

모델이 아직 사용 중인 경로에 없다면, 이를 평가하는 저위험 방식은 대체가 아니라 나란히 실행하는 것입니다. 즉 Sonnet 5를 같은 키의 폴백으로 고정해 두면 거부, 타임아웃 또는 잘못된 평가가 발생할 때 이미 신뢰하는 모델로 요청이 전달되고, 자동 장애 조치가 두 번째 통합 없이 루프를 닫아줍니다. 이것이 검증되지 않은 모델을 사용자 앞이 아니라 하나의 엔드포인트 뒤에서 평가해야 하는 전체 논거이며, 여기서는 두 배로 적용됩니다. Sonnet 5.5의 거부 범주가 새롭고 그 추론 노력 보정이 이전 모델과 명시적으로 동일하지 않기 때문입니다. 기본값을 옮길 준비가 되면, 하나의 키에 있는 로스터는 200개 이상의 모델에 이르므로, 비교는 두 번째 계약이 아니라 구성 변경이 됩니다.

볼 만한 것

이 글의 미해결 질문들은 세 가지 사실로 판가름 날 텐데, 그중 어느 것도 아직 일어나지 않았다.

독립적인 출력 속도 측정이 첫 번째다. Anthropic은 Sonnet 5보다 30% 이상 빠르다고 주장한다. Artificial Analysis는 Sonnet 5.5에 대한 수치를 발표하지 않았으며, 이 주장은 비용 논증에서 실질적인 역할을 하고 있다. 더 빠른 모델은 같은 작업을 더 짧은 실제 시간에, 흔히 더 적은 토큰으로 끝내기 때문이다. Claude Haiku 5.5는 두 번째다 — Anthropic은 그것이 "몇 주 안에" 출시될 것이며 Sonnet 5.5 아래에 위치할 것이라고 말하는데, 이는 중간 및 낮은 effort가 이미 Sonnet 5.5를 경쟁력 있게 만드는 대량 채팅 영역의 계산법을 바꾼다. 세 번째는 정정 패스다: Artificial Analysis는 구조화 출력 버그가 있는 사전 출시 빌드에서 GDPval-AA와 AA-Briefcase를 실행했고, Anthropic은 그 점수들이 모델을 과소평가할 것으로 예상하며, 두 수치 모두 다시 실행되지 않았다. 만약 그 수치들이 상향되면, Opus 5.5와의 지식 노동 격차는 더 좁아지고 "절반 가격" 논거는 더 강해진다.

그때까지는, 방어 가능한 요약이 발표보다 범위가 좁고 벤치마크 차트보다 유용하다. Claude Sonnet 5.5는 독립 지수에서 Sonnet 5 대비 18포인트의 지능 향상을 보이며, 공개된 동일 요금으로, 노력 사다리를 내려가는 사람이라면 누구나 누릴 수 있는 실질적이고 측정 가능한 절감을 제공한다 — 그리고 그렇게 하지 않는 사람에게는 실질적이고 측정 가능한 불이익을 준다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트