제목이 '레벨 165'인 생성된 타이틀 카드, 부제는 'Epoch Capabilities Index, 2026년 10월 1일자 파일', 165(Claude Sonnet 5.5), 165(Claude Fable 5.1), 11 vs 20(각 수치를 뒷받침하는 벤치마크 평가)을 표시하는 세 장의 통계 카드, 그리고 오른쪽 아래 모서리에 OrcaRouter 로고.
Guides & Insights

Claude Sonnet 5.5, Epoch Capabilities Index에서 Claude Fable 5.1과 동률을 기록하다

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

리더보드 정상에서의 동점은 대개 그 리더보드에서 가장 흥미롭지 않은 부분이다. 이번 경우는 예외인데, 정상에 나란히 오른 두 모델의 비용이 같지 않기 때문이다. 2026년 10월 1일에 갱신된 Epoch Capabilities Index 파일에서 Claude Sonnet 5.5와 Claude Fable 5.1은 모두 165를 기록했으며 — 추적 중인 253개 모델 가운데 세 번째와 네 번째 행이다 — 2점 차로 뒤처지는 상대는 Claude Opus 5.5와 GPT-6 Astra이며, 이들 역시 167에서 동점이고, 2점 차로 앞서는 상대는 Claude Opus 5이며 그 기록은 163이다. Claude Sonnet 5.5는 2026년 9월 28일 입력 토큰 백만 개당 2달러, 출력 토큰 백만 개당 10달러로 출시됐다. Claude Fable 5.1은 9월 1일 10달러와 50달러로 출시됐다. 숫자 하나만 보면 두 모델은 일반 역량에서 서로 바꿔 쓸 수 있다는 뜻이다. 출력 가격이 다섯 배라는 사실은 그렇지 않다고 말한다. 둘 다 성립하며, 둘이 함께 성립하는 이유는 아무도 인용하지 않는 표의 한 부분에 있다.

지수란 실제로 무엇이며, 누가 측정하는가

The ECI is not a vendor scoreboard. It is built by Epoch AI, an independent research organisation, as a composite that stitches scores from more than fifty distinct benchmarks into one general-capability scale, inferring each benchmark's relative difficulty from the models that happen to appear on several of them at once. The methodology is set out in a paper, “A Rosetta Stone for AI Benchmarks”, funded by Go​ogle DeepMind and written with researchers from its AGI Safety & Alignment team — but Epoch states plainly that the index is its own product and that it holds full rights over it, and the fitting code is public. That distinction matters when the funder of the research and the publisher of the score are not the same party.

이 척도의 두 가지 속성이 척도 위의 숫자를 어떻게 읽을 수 있는지 결정한다. 첫 번째는 ECI가 절대적이라기보다 기준점에 고정되어 있다는 점이다. 원시 값은 Claude 3.5 Sonnet이 130, GPT-5가 150에 오도록 다시 조정되므로, 어떤 수치는 같은 파일에 있는 다른 수치 옆에 있을 때만 의미가 있다. 두 번째는 상한선이 없다는 점이다. 다가갈 100이 없으므로, “지수의 최상단”은 누군가가 도달한 한계가 아니라 날짜에 관한 진술이다.

세 번째 속성은 무승부를 하나의 이야기로 바꾸는 바로 그 속성이다. 각 점수 옆에 함께 공개된 구간 — 각 모델이 스스로 관측한 벤치마크 결과를 500번 재표본추출하여 구성한 90% 부트스트랩 구간 — 은 두 모델 모두 165에서 동일하다: Claude Sonnet 5.5의 경우 162에서 169, Claude Fable 5.1의 경우 162에서 169다. 그러나 그것들을 산출한 횟수는 다르다. Claude Sonnet 5.5의 165는 11개의 벤치마크 평가로부터 적합된 값이다. Claude Fable 5.1의 값은 20개로부터 적합된 값이다.

동일한 구간이 동일한 증거를 의미하지 않는 이유

ECI는 모델이 점수를 받으려면 최소 네 건의 벤치마크 평가가 필요하므로, 두 수치 모두 최소 기준을 여유 있게 넘습니다. 하지만 그 구간은 모델 자체의 결과가 얼마나 흩어지는지에 대한 진술이지, 결과가 몇 개인지에 대한 진술이 아닙니다 — 그래서 두 모델이 동일한 점추정치 주위에 같은 밴드를 표시하면서도, 그중 하나는 대략 절반의 증거에 기대고 있을 수 있습니다. 두 165를 똑같이 견고한 것으로 취급한다면, 그 구간을 표본 크기 보정으로 읽어 버린 것입니다. 실제로는 그렇지 않은데도요.

비대칭성은 타이밍에 실질적인 영향을 미칩니다. Epoch는 새로운 평가가 들어올 때마다 모든 데이터에 걸쳐 전체 모델을 공동으로 재적합하므로, 해당 모델 자체에는 아무 변화가 없어도 모델의 수치가 움직일 수 있습니다. 관측치 11개를 가진 모델이 20개를 가진 모델보다 움직일 여지가 더 크기 때문에, 다음 개정에서 둘 중 Claude Sonnet 5.5가 — 어느 방향으로든 — 바뀔 가능성이 더 큽니다.

Epoch가 현재 측정값을 자체적으로 프레이밍하는 방식은 그것이 만들어낸 헤드라인보다 좁다. 이 기관의 업데이트 요약은 Claude Opus 5.5가 167점으로 GPT-6 Astra를 근소하게 앞서며 1위를 차지했다는 내용으로 시작하고, 두 번째 문장은 Claude Sonnet 5.5가 165점으로 Claude Fable 5.1과 “거의 맞먹었다”는 사실에 할애한다. “거의 맞먹었다”가 핵심 표현이며, 공개된 구간이 바로 그것이 적절한 표현인 이유다.

두 프로필이 실제로 갈리는 지점

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Fable 5.1 - the scoreboard'. Left column 'Claude Sonnet 5.5': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 11', 'Mystery Game Puzzles: 65%', 'Furniture Assembly: 75%', 'Price: $2 / $10'. Right column 'Claude Fable 5.1': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 20', 'Mystery Game Puzzles: 58%', 'Furniture Assembly: 70%', 'Price: $10 / $50'. A footer line reads 'Epoch Capabilities Index, file updated 1 October 2026; prices per the vendors' own rate cards.'

종합 지표에서의 수준이 개별 구성 요소에서의 수준을 의미하지는 않는다. Epoch는 각 모델 페이지에 벤치마크별 패널을 게시하는데, Claude Sonnet 5.5 페이지와 Claude Fable 5.1 페이지 모두에 여섯 개의 벤치마크가 등장한다 — 이로써 이 여섯 개가 인덱스 자체에서 동일 조건 비교가 가능한 유일한 벤치마크가 된다.

• 미스터리 게임 퍼즐 — Claude Sonnet 5.5 65% vs Claude Fable 5.1 58%

• FrontierMath 티어 1–3 (v2) — Claude Sonnet 5.5 89% 대 Claude Fable 5.1 90%

• 프런티어매스 티어 4(v2) — Claude Sonnet 5.5 80% 대 Claude Fable 5.1 88%

• OTIS 모의 AIME 2024–2025 — Claude Sonnet 5.5 100% 대 Claude Fable 5.1 100%

• 가구 조립 벤치마크 — Claude Sonnet 5.5 75% 대 Claude Fable 5.1 70%

• SimpleQA Verified — Claude Sonnet 5.5 47% vs Claude Fable 5.1 71%

이렇게 빽빽한 종합 지표에서 어느 방향으로든 4점의 이동이 있고, 그 밑에 깔린 분포는 대칭에 가깝지 않다. Claude Sonnet 5.5는 작업이 게임 같고 멀티모달한 영역—퍼즐 풀이, 물리적 조립—에서 앞서며, 수학 경시에서는 동률이다. Claude Fable 5.1은 FrontierMath의 가장 어려운 구간에서 8점, SimpleQA Verified에서 24점 앞선다. SimpleQA Verified는 세계 지식 세트로, 47% 대 71%라는 점수 차는 공유 패널에서 가장 큰 단일 격차다. 이 두 모델 중에서 고르는 구매자는 같은 능력을 두 가지로 읽은 것 중에서 고르는 것이 아니다. 일부 작업에서는 더 강한 더 저렴한 모델과 다른 작업에서는 더 강한 더 비싼 모델 중에서 고르는 것이며, 일반 능력 지수는 이 둘을 분리해 주지 않는다.

Epoch의 인덱스는 벤치마크별 선두가 종합 지표에 반드시 나타나야 하는 것은 아니라는 점도 분명히 한다. 벤치마크는 정확도에 따라 가중치가 부여되지 않으며, 특화된 모델은 개별 테스트에서 앞서면서도 다른 형태의 경쟁 모델보다 낮은 점수를 받을 수 있다 — 그 문서는 이를 직접 말한다. 그것은 변명되는 결함이 아니다; 그것이 바로 50여 개가 넘는 테스트를 아우르는 종합 지표의 목적이다.

두 개의 독립적인 계기는 서로 반대 방향을 가리킨다.

A capture of the Epoch AI model page for Claude Sonnet 5.5, headed ECI #3, Anthropic, Sep. 28, 2026, Closed weights, and the line that it has an ECI score of 165 and ranks 3rd of 253 tracked models. Beneath it a comparison table headed 'Claude Sonnet 5.5 vs select alternatives' carries four columns - Claude Sonnet 5.5, Claude Opus 5.5, GPT-6 Astra and Kimi K3 - with an ECI score row reading 165, 167, 167 and 158, a ranking row reading #3, #1 - Best, #2 and #13, and per-benchmark rows for Mystery Game Puzzles, FrontierMath Tiers 1-3 (v2), FrontierMath Tier 4 (v2), OTIS Mock AIME 2024-2025, Furniture Assembly Benchmark, SciCode, GPQA Diamond, Text Arena (Coding) and SimpleQA Verified.

두 번째 독립 측정치가 나와 있는데, 이 두 모델 중 어느 쪽이 앞서는지에 관해서는 첫 번째 측정치와 일치하지 않습니다. Artificial Analysis Intelligence Index에서 우리 자체 카탈로그가 두 모델에 대해 제시하는 수치는 Claude Sonnet 5.5가 56, Claude Fable 5.1이 53.4이며, 이는 해당 지수의 동일한 개정판에서 가져온 것이므로 동일한 평가 모델 표본을 반영합니다. 더 저렴한 모델에 유리한 3점 차이입니다 — Epoch가 두 모델을 동일하게 판단하는 것과는 달리요.

두 해석 중 어느 것도 틀리지 않으며, 이를 활용하는 방법은 두 해석이 무엇에 대해 서로 어긋나는지를 알아차리는 것이다. 두 지수는 서로 다른 벤치마크 세트를 다루고 각각 다른 가중치를 부여한다. Epoch 종합 지수는 벤치마크가 포화되는 상황에서도 견디도록 만들어졌고, Artificial Analysis 지수는 다른 묶음을 단순 집계한 것이다. 두 모델이 이렇게 근접해 있을 때는 측정되는 격차보다 측정 도구의 선택이 더 중요하다. 인접한 두 수치 중 더 강한 쪽을 원하는 독자는 양쪽 대표 수치가 아니라 위에 있는 공통 개별 벤치마크 패널을 봐야 한다. 그곳이 두 모델이 동일한 테스트에서 서로 비교되는 유일한 곳이기 때문이다.

종합 지표가 담지 못하는 맥락이 하나 더 있는데, Epoch는 그것을 담고 있습니다: 바로 출시일입니다. Claude Fable 5.1은 오늘 추적 중인 253개 모델 가운데 4위입니다. 2026년 9월 1일 자체 출시 당시에는 당시 추적되던 247개 모델 가운데 1위였습니다. 가중치는 변하지 않았습니다. 최전선이 한 달 만에 이 모델을 여섯 계단 앞질러 간 것뿐입니다. 이것이 전체 표의 모양이며, 월간 지수 수치가 평결이 아니라 스냅샷인 이유입니다.

그 차이가 무엇을 대가로 치르게 하는지, 그리고 저렴한 쪽은 어디인지

A capture of the OrcaRouter model page for Claude Sonnet 5.5, listed under anthropic/claude-sonnet-5.5, showing a 1M-token context window with up to 128K output tokens, input pricing at $2.00 per million tokens and output at $10.00 per million tokens, and the catalogue's capability tags for the model.

일반 능력에서는 동일한 수준이고 입력에서는 2.5배, 출력에서는 5배 차이가 난다는 점, 이것이 이 글의 실질적 내용 전부입니다. 두 모델 모두 우리 자체 카탈로그에서 취급합니다 — anthropic/claude-sonnet-5.5은 백만 입력당 $2.00, 백만 출력당 $10.00, 캐시 읽기 $0.20이고, anthropic/claude-fable-5.1은 $10.00 및 $50.00, 캐시 읽기 $0.25입니다 — 두 모델 모두 제공업체의 자체 정가로 마크업 없이 그대로 적용되므로, 공급업체 요금 변경은 그쪽에 적용되는 날 우리 쪽에도 같은 날 반영됩니다.

반복적으로 발생하는 비용이 헤드라인 숫자보다 더 중요합니다. 캐시에서 120,000토큰 프리픽스를 보내고 8,000토큰의 출력을 생성하는 워크로드를 한 달 동안 하루에 한 번 실행한다고 가정해 보겠습니다. Claude Sonnet 5.5에서는 그 프리픽스가 100만 토큰당 $0.20로 120,000토큰에 약 2.4센트이고, 여기에 100만 토큰당 $10로 8,000토큰에 8센트가 더해집니다 — 실행당 대략 10.4센트, 30일 동안 약 $3.12입니다. Claude Fable 5.1에서는 같은 프리픽스가 120,000토큰에 $0.25로 3센트이고, 여기에 8,000토큰에 $50로 40센트가 더해집니다 — 실행당 약 43센트, 한 달 동안 $12.90입니다. 두 모델 모두 최대 128K 출력과 동일한 1M 토큰 창을 제공하므로, 차이는 한도가 아니라 가격표에 있습니다.

그와 대조적으로, 여섯 가지 공통 벤치마크는 추가 비용이 어느 방향으로 무엇을 사 주는지 말해 준다. 작업이 FrontierMath Tier 4나 개방형 사실 회상처럼 보이는 팀은 네 배를 지불함으로써 그 테스트에서 실제 8~24점 격차를 사는 셈이다. 작업이 퍼즐 풀이나 멀티모달 조립처럼 보이는 팀은 더 적은 금액을 지불하면서 반대 방향으로 5~7점을 사는 셈이다. 단일 플랫폼에서 이것들은 두 번의 조달 결정이 아니다. 두 모델 모두200개가 넘는 모델 중 하나의 API 키 뒤에 있으므로, 자체 트래픽에서 두 모델을 비교하는 것은 두 번째 계약이 아니라 구성 변경이며, 두 모델이 모두 라우팅되는 곳에서는 자동 장애 조치가 그 아래에 자리한다 — 이는 두 개의 독립적인 측정 도구가 어느 쪽이 더 앞서는지에 대해 엇갈릴 때 중요하다.

무엇이 이 판독값을 움직이게 할까

세 가지가 그것을 바꿀 텐데, 그중 하나만이 두 모델 중 어느 한쪽과 관련됩니다.

첫 번째는 더 많은 벤치마크 평가입니다. Claude Sonnet 5.5는 4일 전 11개를 뒤에 두고 지수에 진입했으며, 추가 평가가 있을 때마다 그 구간은 좁아지고 점 추정값은 움직일 수 있고, 공동 재적합은 그 움직임이 새 행에만 국한되지 않음을 의미합니다.

두 번째는 또 다른 프런티어 모델의 등장이다. 상위 네 행은 4점 범위에 걸쳐 있고 그 범위 안에 두 개의 동점이 있으므로, 잘 평가된 신규 진입자 하나가 그 아래가 아니라 이 클러스터 안에 들어온다. 그리고 네 개 모두에서 겹치는 공개 구간들은 이들 사이의 순서가 측정이 아니라 동점 처리 기준임을 의미한다.

세 번째는 모델 자체의 가격인데, 어떤 지수도 이를 추적하지 않는다. 이 글에서 핵심으로 삼는 격차는 요금표 격차다: $2와 $10 대 오늘날의 $10와 $50. 어느 쪽 요금표가 바뀌어도 단 하나의 능력 점수도 움직이지 않은 채 결정을 바꾼다.

정당화할 수 있는 요약은 좁은 쪽이다. Epoch AI의 종합 지표에서, 2026년 10월 1일 갱신된 파일에 따르면, Claude Sonnet 5.5와 Claude Fable 5.1은 같은 숫자, 즉 165로 공동 3위이며, 공표된 동일한 구간이 서로 다른 양의 증거에 기대고 있다. Artificial Analysis의 별도 측정 도구에서는 같은 두 모델이 3점 차이다. 지수가 두 모델을 직접 비교하는 여섯 개의 벤치마크에서는 둘이 동률로 머무르기보다 영역별로 선두를 주고받는다. 그리고 요금표에서는 둘이 전혀 근접하지 않다. 이 해석이 뒷받침하지 않을 단 하나는, 바로 이 해석이 가장 인용될 가능성이 높은 문장, 즉 두 모델이 동등하다는 문장이다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트