Claude Opus 5.5의 히어로 타이틀 카드로, ‘모든 점수, 그 점수가 나온 effort 설정, 그리고 누가 측정했는지’라는 문구와 두 개의 통계 칩을 표시합니다: xhigh effort에서 Terminal-Bench 4.0 66.4%, 공급업체 보고, 그리고 동일 벤치마크에서 59.6%, 독립 측정.
Guides & Insights

Claude Opus 5.5 벤치마크: 모든 점수, 각 점수가 나온 에포트 설정, 그리고 누가 측정했는가

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Ant​hropic의 Claude Opus 5.5에 대한 Terminal-Bench 4.0에서의 대표 수치는 66.4%, 이는 52.3%Claude Opus 5와 동일 표에서 비교됩니다 — 그리고 그 66.4%는 xhigh 노력으로 산출되었으며, 모델의 기본값인 medium이 아닙니다. 이 모델은 2026년 9월 22일에 출시되었으며, 이 페이지가 작성되기 이틀 전이므로, GA 모델로서 GA 모델의 가격과 GA 모델의 벤치마크 표를 갖추고 있습니다. 동일 벤치마크에 대한 독립적인 수치는 Artificial Analysis에서 제공한 것으로, 59.6%이며, 이는 Ant​hropic의 서버 측 안전장치 라우팅을 내부에 포함하는 구성입니다. 이 두 수치 사이에는 하네스 차이, 노력 차이, 라우팅 차이가 있으며, 누구도 — 우리를 포함하여 — 각 차이가 격차의 얼마를 설명하는지 아직 말할 수 없습니다. 이 페이지가 할 수 있는 일은 Claude Opus 5.5에 대해 발표된 모든 수치를 한곳에 모으고, 누가 생산했는지, 어떤 설정에서 생산되었는지 명시하며, GPT-6 AstraClaude Fable 5.1이 앞서는 행을 포함하는 것입니다.

에포트 설정부터 시작하세요. 모델보다 수치를 더 많이 움직이기 때문입니다.

Claude Opus 5.5는 기본적으로 medium effort를 Claude API에서 사용합니다. Claude Opus 5의 기본값은 high. 동일한 이름의 레벨이 두 모델에서 동일한 사고 예산을 의미하는 것도 아니므로, "둘 다 high로 실행했다"는 것은 레이블이 일치하더라도 통제된 비교가 아닙니다. Opus 5.5에서는 적응형 사고(Adaptive thinking)가 항상 켜져 있으며 끌 수 없습니다. effort 매개변수는 깊이, 지연 시간, 비용을 조정할 뿐 다른 것은 바꾸지 않습니다.

Anthropic의 Terminal-Bench 4.0 수치는 xhigh로 실행되었습니다. 이 단 하나의 사실이 이 페이지에서 가장 중요한 주의 사항입니다. 왜냐하면 그것이 헤드라인으로 내세우는 벤치마크가 이전 모델 대비 보고된 격차가 가장 큰 벤치마크이고, 같은 표가 그 설정을 그대로 두면 무슨 일이 일어나는지를 보여주기 때문입니다:

FrontierCode v1.1 Main — xhigh에서 54.4%, 기본 medium에서 54.6%. 벤더 보고 기준. medium 실행은 더 높다 xhigh 실행보다. 이 워크로드에서 effort 다이얼이 얻어준 측정 가능한 이득은 없었다; 두 숫자는 같은 숫자다.

CursorBench 4.0 — xhigh에서 57.8%, medium에서 52.5%. 벤더 보고 수치. 같은 모델, 같은 하네스, 같은 주: 5.3포인트로, 이 표에서 가장 큰 에포트 격차입니다.

한 벤더의 표 안에 나란히 놓인 그 두 행이 바로 논증의 전부입니다. 한 워크로드는 effort에 둔감하고 다른 하나는 effort에 강하게 민감한데, 모델 카드는 당신의 워크로드가 어느 쪽인지 미리 알려주지 못합니다. 데이터가 뒷받침하는 결론은 좁고, 좁게 말할 가치가 있습니다: 올바른 effort 수준은 이제 워크로드별 측정값이며, 물려받는 기본값이 아닙니다. 이것은 "Opus 5.5가 벤치마크가 시사하는 것보다 빠르다"거나 "Anthropic이 기본값을 일부러 낮췄다"를 뒷받침하지 않습니다 — 그러려면 다섯 가지 설정 전반에 걸친 워크로드별 스윕이 필요하고, 아무도 그것을 공개하지 않았습니다. 다만 이것이 뜻하는 바는, Opus 5에서 마이그레이션하면서 이미 쓰던 effort 설정을 그대로 유지한다면, 모델만 바꾼 것이 아니라 실험 자체를 바꾼 것이라는 점입니다.

또 하나의 비대칭이 있는데, 이번에는 반대 방향으로 작용한다. Anthropic의 Terminal-Bench 행에서 경쟁사 열은 GPT-6 Astra의 57.9%다 — Anthropic 자체 차트 주석에 따르면 high 노력도로 실행된 반면, Opus 5.5의 66.4%는 xhigh로 실행되었다. 자사 모델은 한 설정으로, 경쟁 모델은 다른 설정으로 실행한 벤더 표는, 두 수치가 나란히 어떻게 보이든 간에 정면 대결이 아니다.

모든 행에 소스와 설정이 있는 벤더 테이블

이 섹션의 모든 내용은 벤더 보고입니다: Anthropic의 출시 자료, Anthropic의 하네스, 프로덕션 안전장치 활성화, 그리고 해당 행에 달리 명시되지 않는 한 최대 강도의 적응형 사고. 이는 Anthropic이 Anthropic을 측정한 것으로 읽으십시오.

Terminal-Bench 4.0 — 66.4%, xhigh 노력 수준에서. 벤더 보고 기준, 표준오차 약 ±2.6포인트. 같은 행에는 Claude Opus 5 52.3%, Claude Fable 5.1 55.8%, GPT-6 Astra 57.9%(high 노력 수준), GPT-5.6 Sol 37.3%가 있습니다. Terminal-Bench 4.0은 벤더가 실제 터미널 작업을 완벽히 대변하지는 못하는 지표임을 인정한 벤치마크이며, 이 모델의 대표 수치입니다.

FrontierCode v1.1 Main — xhigh에서 54.4%, 기본 medium에서 54.6%. 벤더 보고 기준. Opus 5 48.0%, Fable 5.1 50.3%, GPT-6 Astra 53.3%, GPT-5.6 Sol 47.5%. Anthropic의 시스템 카드에는 Extended 변형이 63.6%로, medium에서의 최고 Extended 수치가 65.3%로 기재되어 있습니다.

CursorBench 4.0 — xhigh에서 57.8%, medium에서 52.5%.공급업체 보고. Opus 5 46.6%, Fable 5.1 51.8%, GPT-5.6 Sol 41.7%. Fable 5.1과 Opus 5의 CursorBench 행은 max effort 기준이므로, medium의 Opus 5.5는 max의 자신의 형제 모델과 비교된다는 점에 유의하세요.

GDPval-AA v2.1 — 1,846 Elo. 이것은 벤더 표에서 벤더가 직접 실행하지 않은 유일한 행입니다. GDPval-AA는 Artificial Analysis의 평가이며, Opus 5.5에 관한 Artificial Analysis 자체 보고서에도 동일한 1,846이 기재되어 있고, Fable 5.1은 1,735, Opus 5는 1,708입니다. 벤더 표에서는 Fable 5.1 1,735, Opus 5 1,708, GPT-5.6 Sol 1,588, GPT-6 Astra 1,542입니다. 이곳에서 두 조직이 같은 수치에 합의한 유일한 행이며, 그것은 동일한 측정이기 때문입니다.

AutomationBench(Zapier) — 40.0%. 벤더 보고 수치이며, 폴백 모델 없이 실행되었기 때문에 모든 안전장치 개입이 실패로 채점되었습니다. GPT-6 Astra 41.4%, Fable 5.1 31.4%, GPT-5.6 Sol 28.8%, Opus 5 26.9%.

Humanity's Last Exam, 도구 사용 시 — 67.7%. 벤더 보고 수치. Fable 5.1 65.6%, Opus 5 63.6%, GPT-6 Astra 57.2%. Anthropic의 시스템 카드는 별도로 도구 없이 64.4%를 보고하는데, 이는 모델에 도구 접근 권한을 부여하지 않는 출처와 비교할 때 참고해야 할 수치입니다.

Terminal-Bench-Science 0.1 — 58.7%. 벤더 보고 수치이며 표준오차가 대략 ±3.5~±5점이므로, 이는 하나의 점이 아니라 범위로 보아야 합니다. GPT-6 Astra 64.6%, Fable 5.1 52.6%, Opus 5 29.0%, GPT-5.6 Sol 22.4%.

OSWorld 2.0 — 81.8%는 부분 점수. 벤더가 보고한 수치이며, 그 문장에서 "부분"이라는 말은 상당한 역할을 톡톡히 하고 있다: Anthropic의 시스템 카드는 동일한 모델, 동일한 평가에서 엄격한 완료율 48.7%를 제시한다. 둘 다 공개되어 있지만, 인용되는 것은 부분 수치 쪽이다. Fable 5.1 80.7%, Opus 5 74.0%.

Chartography, 도구 사용 — 89.0%. 벤더 보고 기준. Fable 5.1 88.4%, Opus 5 83.4%.

Scoreboard for Claude Opus 5.5 with six rows: Terminal-Bench 4.0 66.4% at xhigh effort (vendor-reported); Artificial Analysis Intelligence Index 58 at max effort (independent); Humanity's Last Exam 67.7% with tools (vendor-reported); Terminal-Bench-Science 0.1 58.7% (vendor-reported); about 119k output tokens per task at max (independent); price $4.00 input / $20.00 output per 1M. A footer separates the Anthropic launch table from Artificial Analysis.

독립적인 숫자들, 그리고 "Default Fallback"이 실제로 의미하는 것

Artificial Analysis는 복합 지수에서 Claude Opus 5.5에 대한 공개된 최신 평가를 보유한 유일한 제3자이며, 그 수치들은 Anthropic의 수치와 나란히 비교해야 할 바로 그 수치입니다. 2026년 9월 24일 기준으로 확인한 내용은 다음과 같습니다:

인텔리전스 지수 — "Adaptive Reasoning, Max Effort, Default Fallback"이라는 레이블이 붙은 구성에서 최대 노력 시 58. 독립적이며, Artificial Analysis가 측정했다. 해당 기관의 기사에서는 58을 "우리가 측정한 최고 점수보다 몇 점 더 높은 점수"라고 부른다. 같은 지수는 다른 모든 노력 설정에서의 Opus 5.5도 공개하며, 그 편차가 유용한 부분이다: xhigh에서 56, high에서 54, medium에서 51, low에서 42. 이는 단일 모델에서 노력 다이얼 전체에 걸쳐 16점 변동이다 — 해당 보드의 대부분 모델 간 격차보다 크다.

Terminal-Bench 4.0 — 59.6%. 독립적 평가입니다. Artificial Analysis는 이를 "선두 주자인 GPT-6 Astra(xhigh)와 동급"이며 Claude Opus 5보다 약 11점 높다고 보고합니다.

Humanity's Last Exam — 61.4%.독립적인 평가이며, 같은 리더보드에서 이전 최고 기록은 Claude Fable 5.1이 보유한 59.1%였습니다.

SciCode — 66.9%. 독립 평가, Claude Fable 5.1의 63.1%와 비교.

이제 인용하기보다 설명이 필요한 조항입니다. "Default Fallback"은 벤치마크 아티팩트가 아니며 Artificial Analysis의 설정도 아닙니다 — 그것은 Anthropic의 서버 측 안전장치 라우팅이며, 켜진 상태로 남아 있습니다. Claude Opus 5.5에는 이전에 Fable 5.1에만 적용되던 안전장치 등급이 함께 적용됩니다: 대부분의 사이버보안 요청은 투명하게 Claude Opus 4.8로 다시 라우팅되고, 생물학 작업은 계정이 인증되지 않은 경우 Claude Opus 5로 폴백됩니다. Artificial Analysis가 기본 폴백을 활성화한 상태로 이 지수를 실행할 때 측정하는 것은 배포된 시스템 — 인증되지 않은 API 키가 실제로 도달하는 대상 — 이며, Opus 5.5 가중치의 깨끗한 체크포인트가 아닙니다. 이는 구매자에게는 더 정직한 측정이고, 벤치마크로서는 덜 깨끗한 측정입니다. Anthropic은 자사의 표에 대해서도 같은 취지를 밝힙니다: Terminal-Bench 4.0 실행에 대한 개입으로 사이버 작업은 Opus 4.8이, 생물학 작업은 Opus 5가 완료했으며, 회사는 그러한 개입이 낮췄을보고된 점수를 {{6}}낮췄을{{/6}} 가능성이 있다고 밝힙니다. 따라서 안전장치 라우팅은 양방향 모두에서 실제 운영상의 사실이며, 이 페이지의 어떤 수치도 기반 모델을 그 라우팅으로부터 분리해내지 못합니다.

두 테이블이 서로 어긋나는 부분과 그 이유

Terminal-Bench 4.0의 두 수치를 나란히 놓으면 같은 벤치마크, 같은 모델에서 66.4% 대 59.6% — 6.8포인트 차이다. 그 이유들은 이미 알려져 있으며, 각각 그 자체로 중요할 만큼 크다:

서로 다른 하네스. Anthropic은 자체 에이전트 스캐폴드를 사용했고, Artificial Analysis는 자체 참조 에이전트 하네스를 사용했습니다. 터미널 벤치마크 점수는 모델 단독의 속성이 아니라 스캐폴드와 모델을 합친 것의 속성이며, 어느 조직도 스캐폴드 교체 실험을 공개하지 않았습니다.

서로 다른 에포트 설정. Anthropic의 66.4%는 xhigh에서 측정된 값입니다. Artificial Analysis의 59.6%에 적용된 에포트 설정은 해당 수치가 등장하는 문장에 명시되어 있지 않으며, 보고된 벤치마크 수치는 일반적으로 최대 에포트 기준입니다.

두 경우 모두 안전장치를 켠 상태였지만, 집계 방식은 달랐다. Anthropic은 폴백을 켜고 실행했으며, 개입을 점수 감소 요인으로 처리했지만 여전히 점수를 부여했다. AutomationBench에서는 폴백 없이 실행했고 개입을 완전한 실패로 집계했다. Artificial Analysis는 전반적으로 폴백을 활성화한 상태로 실행한다.

숫자는 한 공급업체의 자체 표 안에서도 달라진다. Anthropic은 Terminal-Bench 4.0에서 Claude Opus 5를 52.3%로 표기하며, 같은 모델에 대한 공개 리더보드의 51.8%는 "오차 범위 내"라고 언급한다.

그다음은 이 페이지에서 하네스의 가치가 얼마나 큰지를 보여주는 가장 강력한 증거입니다. 2026년 9월 24일에 캡처된 공개 Terminal-Bench 4.0 리더보드에는 Claude Opus 5.5 행이 전혀 없습니다. 최상위 항목은 max effort의 GPT-6 Astra, Codex 에이전트, 58.2% ±2.8입니다. 두 번째는 Claude Code를 통한 max effort의 Claude Fable 5.1, 57.9% ±3.8입니다. 세 번째는 Claude Code를 통한 xhigh의 Claude Opus 5, 53.9% ±3.2입니다. 따라서 66.4%는 독립적인 59.6%와 단지 다른 숫자인 것이 아닙니다 — 그것은 공개 보드에 없으며, 보드 자체의 Claude Opus 5 버전은 53.9%이고, 출시 표에 기재된 52.3%가 아닙니다. Terminal-Bench가 Opus 5.5 제출을 받아들이고 게시할 때까지, 66.4%는 아무도 재현하지 못한 벤더 하네스 결과이며, 59.6%는 외부 당사자가 실제로 보증할 숫자입니다. 또한 바로 그 보드에서 Artificial Analysis의 Terminal-Bench 4.0 리더와 Anthropic의 Opus 5.5는 동일한 59.6%에 도달합니다 — 이는 하나의 하네스에서는 동점이며, 다른 하나에 대해서는 아무것도 알려주지 않습니다.

Effort-dial infographic for Claude Opus 5.5 showing the Artificial Analysis Intelligence Index moving from 42 at low effort through 51 at medium (the product default), 54 at high, 56 at xhigh and 58 at max - a 16-point swing on one model - with two comparison cards: FrontierCode v1.1 at 54.4 xhigh against 54.6 medium (effort-insensitive) and CursorBench 4.0 at 57.8 xhigh against 52.5 medium (effort-sensitive).

Opus 5.5가 지는 행들

손실을 빼놓은 정리는 정리가 아니며, Anthropic 자체의 표에는 그 둘 모두가 들어 있다.

Terminal-Bench-Science 0.1 — GPT-6 Astra의 64.6% 대비 58.7%. 공급업체 보고 기준, Anthropic의 표에서 과학적 추론에 가장 가까운 행에서 이름이 명시된 경쟁사에 5.9포인트 뒤진 결과다. 공급업체 자체의 표준오차 주석(±3.5~±5)은 그 격차가 잡음 범위 안에 넉넉히 들어 있다기보다 잡음의 경계에 가깝다는 뜻이다 — 하지만 그것은 공급업체 자체 페이지에서의 패배이며, 그 오차 범위가 그것을 승리로 만들어 주지는 않는다. Claude Opus 5는 같은 행에서 29.0%에 머물러, 경쟁사가 앞서는 부분에서도 세대 간 향상은 실재한다.

AutomationBench — GPT-6 Astra의 41.4%에 맞선 40.0%. 벤더 보고 기준 1.4포인트 차이이며, 해당 실행에는 폴백 모델이 없었기 때문에 보호 조치 개입이 실패로 채점되었습니다. 즉 이 특정 비교는 라우팅 페널티가 포함된 Opus 5.5를, 라우팅 페널티가 무엇이든 그것이 설명되지 않은 경쟁자와 맞세운 것입니다. 이는 어느 방향으로 보든 이 페이지에서 가장 해석하기 어려운 항목입니다.

헤드라인이 시사하는 것보다 우위가 더 작은 곳이 두 군데 더 있는데, 둘 다 벤더가 보고한 수치다. 도구를 사용한 Humanity's Last Exam에서 Claude Fable 5.1에 대한 격차는 2.1점(67.7% 대 65.6%)이고, 도구를 사용한 Chartography에서는 0.6점(89.0% 대 88.4%)이며, OSWorld 2.0 부분에서는 1.1점(81.8% 대 80.7%)이다. 바로 이런 항목들에서 "Opus 5.5가 최고의 에이전트형 모델"이라는 주장은 측정된 격차가 아니라 순위에 관한 주장이 되며, 0.6점짜리 차트 읽기 차이가 조달 결정을 좌우해서는 안 된다.

다른 지수 개정판 기준 Claude Fable 5.1의 독자적 위상

Opus 5.5를 같은 제품군의 형제 모델과 맞세우는 일에는 별도의 섹션이 필요하고, 경고 문구도 함께 붙여야 합니다. 그 비교는 보기보다 어렵기 때문입니다.

2026년 9월 1일 Artificial Analysis가 Claude Fable 5.1에 관한 분석 글을 발표했을 때, 그것은 최대 노력에서 66점을 Intelligence Index에서 기록했고, 자사가 측정한 최고 점수라고 불렀다 — 63점의 Claude Opus 5와 61점의 GPT-5.6 Sol을 앞선다. 2026년 9월 24일 자로 게시된 지수에서는 같은 모델이 폴백을 포함한 최대 노력에서 53, 그리고 Opus 5.5는 58로 나타나는데, 이는 동일한 구성에서다. Opus 5.5에 관한 9월 22일 분석 글은 58점을 "몇 점 차이로 우리가 측정한 최고 점수"라고 부른다.

그 두 진술은 하나의 척도 위에서 동시에 참일 수 없으며, 그 해답은 두 진술이 같은 척도 위에 있지 않다는 것이다. 그 지수는 Artificial Analysis가 개정하는 살아 있는 대상이며, 그곳에 게재된 두 글은 5주 간격을 두고 동일한 형제 모델 쌍을 1위 자리의 반대편에 놓는다. 이는 어느 한 모델이 퇴보했다는 진술이 아니라 지수 개정에 관한 진술이며, 이는 다음을 뜻한다 66과 58은 결코 나란히 표기되어서는 안 된다. 같은 날, 같은 목록, 같은 라벨이 붙은 구성을 기준으로 읽으면, 현재 순위에서는 Opus 5.5가 Fable 5.1보다 5점 앞서 있다 — 그리고 그것조차 감사를 거친 정면 대결이 아니라 동일 지수, 동일 지수 제공자에 의한 비교다. 안전하게 말할 수 있는 것은 그보다 더 좁다: 두 모델을 모두 측정하는 단 하나의 독립적 종합 지수의 현재 개정판에서 Opus 5.5는 두 Anthropic 모델 중 더 강한 쪽이며, Fable 5.1의 더 잘 알려진 66은 그 지수의 이전 개정판에 속한다.

설정은 혼동하기 쉬우므로 한 문장 더 짚고 넘어갈 가치가 있습니다. Fable 5.1의 66과 Opus 5.5의 58은 둘 다 최대 노력 행이지만, Fable 5.1의 다섯 가지 노력 설정은 출력 토큰 사용량에서 11배 범위에 걸쳐 있습니다. 낮음에서 13.1M, 최대에서 143.7M이며, 지수 점수는 58에서 66까지입니다. 내부 편차가 그렇게 큰 모델에 대한 단일 지수 점수는 실제로 실행하게 될 행을 대신하기에는 부족합니다.

토큰 비용은 그 자체로 하나의 벤치마크 축입니다

위의 모든 숫자는 점수입니다. 그중 어느 것도 부리가 아니며, 이 모형에서는 흥미로운 움직임이 바로 부리에서 일어납니다.

Artificial Analysis는 최대 노력 설정에서 Claude Opus 5.5를 측정하며 대략 Intelligence Index 작업당 119,000개의 출력 토큰을 사용합니다 — 이는 해당 지수에서 가장 높은 수치입니다. 비교하자면, 같은 보드의 같은 설정에서: Claude Opus 5는 약 73,000개, Claude Fable 5.1은 약 78,000개, 그리고 GPT-6 Astra는 약 27,000개입니다. 사고 토큰은 출력 토큰으로 청구되며, Opus 5.5에서는 적응형 사고를 끌 수 없으므로 모델이 숙고하는 데 소비하는 토큰은 가격의 각주가 아닙니다 — 그것이 가격의 대부분입니다.

계산을 해 보세요. 정가만으로는 오해의 소지가 있으니까요. Opus 5.5는 입력 $4.00 / 출력 $20.00로 책정되어 있는데, 이는 Opus 5의 $5.00 / $25.00에서 20% 인하된 가격입니다. Artificial Analysis는 여전히 최대 노력 설정에서 Opus 5.5의 비용을 인덱스 작업당 약 $5.98이며, Opus 5의 $5.86 같은 설정에서 — 약간 비싸다고 측정합니다. 덜한 게 아니라, 출력 토큰이 약 1.6배라서 20% 요금 인하를 전부 상쇄하고도 남기 때문입니다. 전체 인덱스에서 Opus 5.5는 다음을 생산했습니다: 2억 6천만 개의 출력 토큰 보드 중앙값 88M과 대비되는데, 평가자는 이를 "매우 장황함"이라고 부릅니다.

따라서 비용 이야기는 전적으로 effort 설정에 달려 있으며, 그것을 사용할 때만 효과가 있다. 최대 effort에서 Opus 5.5는 완료된 작업당 대체하는 모델보다 더 비싼 모델이다. medium에서는 — 실제 제품 기본값이며 Anthropic의 "일반적인 워크로드에서 실행 비용 약 40% 절감" 주장이 적용되는 범위 — 절감이 실재하기는 하지만, 이는 공급업체가 선정한 워크로드 전반의 평균에 관한 진술일 뿐 감사된 작업당 결과가 아니다. 실용적으로 읽자면: 20% 가격 인하는 요율표상의 할인이자 effort 다이얼의 옵션이지, 자동적인 절감이 아니다. 마이그레이션 계획이 "모델 id를 바꾸고 설정은 그대로 둔다"라면, 당신은 비싼 버전을 사는 것이다.

전혀 확립되지 않은 것은 무엇인가?

이 섹션은 페이지의 나머지 부분이 뒷받침하기 위해 존재하는 핵심입니다.

Claude Opus 5.5를 이름이 명시된 어떤 경쟁 모델과 비교하더라도, 노력 수준과 하네스를 맞춘 독립적인 직접 비교는 공개된 바 없습니다.이 페이지의 모든 벤더 간 비교 — Opus 5.5 대 GPT-6 Astra, 대 GPT-5.6 Sol, 대 Claude Fable 5.1 — 는 서로 다른 두 회사가, 서로 다른 두 하네스에서, 서로 다른 두 노력 설정으로 산출한 두 표를 비교한 것입니다. 그중 하나는 보통 해당 벤더 자체 모델을 유리한 설정에 놓은 것입니다. 두 벤더에 걸쳐 스캐폴드와 노력 수준을 일정하게 유지하고 둘 모두를 보고하는 실험은 공개 기록 어디에도 없습니다.

문제별 토큰 분할은 공개되지 않았습니다. 총 출력 토큰 수치는 독립적으로 측정되지만, 그중 얼마가 사고 과정이고 얼마가 답변 텍스트인지는 우리가 찾아볼 수 있는 누구도 공개하지 않았습니다. 이 모델의 정확한 사고 토큰 수치를 알려주는 페이지가 있다면, 그것은 아무도 측정하지 않은 숫자를 알려주는 것입니다.

시스템 카드의 대부분은 제3자가 벤치마크하지 않았습니다. SWE-bench Pro 89.9%, Multilingual 93.9%, DeepSWE v1.1 74.2%, ProgramBench 91.2%, OfficeQA 78.9%, HealthBench Professional 65.6%(길이 조정), GMMLU 94.3%, ArXivMath 96.9%(도구 사용 시) — 모두 공급업체가 보고한 수치이며, 작성 시점 기준으로 어느 것도 독립적으로 재현되지 않았습니다.

Terminal-Bench 4.0의 대표 수치는 공개 게시판에 없습니다. 위에서 다뤘으며, 이 목록에도 포함되어야 합니다. 이 모델에 대해 가장 많이 인용되는 단일 수치는 벤더 외부의 누구도 실행해 본 적 없는 수치입니다.

Anthropic은 Claude Opus 5.5가 "자주 자신이 평가받고 있다고 의심한다"고 보고한다 — 회사 스스로 한 말이며, 자사의 안전성 평가에서 한계로 제시한 것이다. 이것을 흥미로운 일화가 아니라 측정 문제로 진지하게 받아들여야 한다. 모델이 시험받고 있다고 믿을 때 다르게 행동한다면, 이 페이지의 모든 벤치마크 수치는 벤더든 독립적이든 관계없이 관찰 중인 모델을 측정한 값이며, 그것이 실제 배포 환경의 행동과 얼마나 다른지는 알려져 있지도, 정량화되어 있지도 않다. 이는 좋은 행에도 나쁜 행에도 똑같이 적용된다. 이것은 아무리 조건을 맞춘 방법론으로도 해결되지 않는 단 하나의 단서다.

Sonnet 5.5와 Haiku 5.5는 사용할 수 없습니다. Anthropic은 이들을 "앞으로 몇 주 안에" 공개하겠다고 발표했습니다. 아직 출시되지 않았고, 공개된 벤치마크도 없으며, 이 페이지의 어떤 내용도 이들에게 적용되지 않습니다.

가격, 엔벨로프, 그리고 코드를 바꾸는 사양의 부분들

2026년 9월 24일 Anthropic의 공개 요금표에서 확인한 내용: 입력 토큰 100만 개당 $4.00, 출력 100만 개당 $20.00, 캐시 읽기 100만 개당 $0.20, 5분 캐시 쓰기 100만 개당 $5.00, 1시간 캐시 쓰기 100만 개당 $8.00, 그리고 Batch API에서는 양방향 모두 50% 할인. 캐시 읽기 요금은 눈에 덜 띄는 항목이다 — 이는 기본 입력의 5%인데, 대부분의 Claude 모델은 10%이고 Fable 5.1은 2.5%이다. Fast 모드는 $8.00 / $40.00로 별도 책정되며, Anthropic은 이를 일반 등급이 아닌 연구 프리뷰라고 설명한다.

이 섹션에서 요금표는 더 이상 흥미로운 잡학거리가 아니라, 라우터가 대신 계산해 줄 수 있는 산수가 됩니다. Claude Opus 5.5는 OrcaRouter에서 anthropic/claude-opus-5.5로 동일한 $4.00 / $20.00에 제공되며, 정가가 0% 마크업으로 그대로 전달됩니다 — 따라서 Anthropic이 요금을 변경하는 순간, 그 요금이 같은 날 이곳의 요금이 되며, 모델링해야 할 재가격 지연은 없습니다. 실제 청구액을 결정하는 요소는 카탈로그가 가격 옆에 함께 표기하는 것들입니다: 기본 입력의 5%에 해당하는 $0.20 캐시 읽기 대 Fable 5.1의 2.5%, 1M 토큰 컨텍스트 창, 그리고 128K 출력 상한입니다. 이 모델의 비용이 실제로 움직이는 곳이 바로 effort 파라미터이기 때문에 — 16포인트 지수 변동과 최대 설정 시 작업당 약 119,000 출력 토큰 대 Opus 5의 약 73,000 — 비용을 절약하는 마이그레이션은 계정 단위가 아니라 워크로드별로 effort를 조정할 수 있게 하고, 트래픽이 어떤 설정을 원하는지 측정하는 동안 Opus 5.5 경로를 자동 페일오버 뒤에 두는 것입니다.

Envelope — 1M 토큰 컨텍스트, 최대 출력 128K, output-300k-2026-03-24 베타 헤더를 사용하는 Batch API에서는 출력 300K, 지식 컷오프 2026년 6월, 지원 종료는 2027년 9월 22일 이전은 아님. 출력 속도는 Claude Opus 5보다 30% 이상 빠릅니다.

Opus 5 대비 주요 변경 사항 — 이제 사고를 비활성화할 수 없으며, 강제 도구 사용(특정 도구를 지정하는 tool_choice)은 오류를 반환합니다; 사고 블록은 이를 생성한 모델과 대화에 묶입니다; 이전 computer_20251124 computer-use 도구는 Claude API 또는 Google Cloud에서 허용되지 않습니다. 처음 세 가지는 Fable 5.1에도 적용됩니다. 조용한 다섯 번째 변경 사항이 있습니다: 도구 호출 사이의 텍스트는 이제 기본 표시 설정에서 텍스트가 비어 있는 사고 블록 내부에 도착하므로, 해당 텍스트를 진행 표시기로 스트리밍하는 UI는 아무 오류 없이 조용해집니다.

세이프가드 라우팅을 다시 한 번 유의하세요. 이는 각주가 아니라 스펙 항목이기 때문입니다 — 대부분의 사이버보안 요청은 Claude Opus 4.8로 전달되고, 생물학 작업은 계정이 인증되지 않은 경우 Claude Opus 5로 폴백됩니다. 그러한 평가에서 받는 답변은 Opus 5.5에서 온 것이 전혀 아닐 수 있으므로, 사이버 및 생물학 인접 벤치마크의 공개 점수는 이 모델에 대한 깨끗한 측정치가 아닙니다.

효율성 주장, 모두 벤더 보고 기준 — 일반적인 워크로드에서 20% 가격 인하 대비 약 40% 낮은 실행 비용, Opus 5.5에서 63분이 걸린 작업이 Opus 5에서는 93분이 걸렸고 비용은 50% 더 낮았다는 합병 분석 예시, 그리고 Box(토큰 3분의 1, 답변 길이 약 40% 감소), Kiro(토큰 약 절반, 호출 40% 감소), Factory(출력 토큰 20~25% 감소), GitHub(자사가 측정한 것 중 토큰과 단계가 가장 적은 축에 속함)의 고객 발언입니다. 이는 벤더와 출시 파트너가 선정한 워크로드 전반의 평균치입니다. 감사된 결과가 아니라 인용된 주장이며, 위의 독립적인 작업별 비용 수치와 눈에 띄게 충돌합니다. 그 수치 역시 기본값이 아닌 최대 노력 설정에서의 측정값입니다. 둘 다 사실일 수 있으며, 어느 쪽도 귀하의 워크로드에 대한 일반적인 주장은 아닙니다.

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the NEW, FLAGSHIP and FEATURED badges, a 1M-token context window, 128K max output, text plus image plus file input, and the $4.00 input / $20.00 output per 1M token rate with pricing passed through from Anthropic.

증거의 현황

Claude Opus 5.5는 실제 모델입니다. 실제 요금 인하가 적용되었고, 1M 토큰 컨텍스트와 128K 출력이라는 실제 범위를 갖추었으며, 사고와 에포트가 구성되는 방식에도 실제적이고 중대한 변화가 있습니다. 또한 주로 Anthropic을 측정하는 벤치마크 표, 체크포인트가 아니라 라우팅된 배포를 주로 측정하는 독립적인 표, 그리고 둘 모두를 약화시키는 문서화된 자기 인식 문제를 함께 내놓습니다. Claude Opus 5.5를 이름이 명시된 경쟁 모델과 동일 에포트, 동일 하네스 조건으로 일대일 비교한 독립적인 결과는 아직 발표되지 않았습니다. 그런 비교가 발표되기 전까지는, 이 페이지의 모든 벤더 간 비교를 있는 그대로 받아들이십시오: 서로 다른 두 회사가 서로 다른 두 설정에서 내놓은 두 개의 벤더 표를 우리가 나란히 배열한 것 — 그리고 모델을 다시 측정하기 전에 자신의 에포트 설정부터 다시 측정하십시오.

이 글에서 비교한 모델4

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트