'Claude Haiku 5.5 vs Claude Sonnet 5.5'라는 제목의 히어로 카드, 부제는 '6일, 한 티어 차이'. 둥근 카드 두 장이 나란히 놓여 있다: 왼쪽은 'Claude Haiku 5.5'라는 제목 아래 Index 43, 작업당 $0.21, 출시 2026년 10월 7일 행이 있고, 오른쪽은 'Claude Sonnet 5.5'라는 제목 아래 Index 56, 작업당 $7.60, 출시 2026년 9월 28일 행이 있다. 그 사이 중앙에 놓인 배지에는 '측정된 비용 격차 36배'라고 적혀 있다. 하단 문구에는 '작업당 비용 및 Artificial Analysis 기준 Intelligence Index; 두 모델 모두 1M 컨텍스트.'라고 적혀 있다.
Guides & Insights

Claude Haiku 5.5 대 Claude Sonnet 5.5: 20배 요율표, 36배 실측 청구서

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Claude Haiku 5.5와 Claude Sonnet 5.5는 같은 패밀리 안에서 출시가 엿새 차이, 티어가 한 단계 차이로 자리하며, 100만 토큰 컨텍스트 윈도우를 공유하고 동일한 API 형태로 응답한다. 공개된 요금표에서 더 저렴한 쪽은 대부분의 요청이 몰리는 구간에서 더 비싼 쪽의 5분의 1 비용이다. 독립적인 Artificial Analysis 리더보드에서는 격차가 그보다 더 크다. Claude Haiku 5.5로 인텔리전스 지수 과제 하나를 끝내는 데 $0.21이 드는 반면 Claude Sonnet 5.5는 $7.60이 들며, 인텔리전스 지수는 43 대 56이다. 이 글의 출발점이 된 신호는 Claude Haiku 5.5가 "GPT-6 Luna보다 훨씬 낫다" 그리고 "Sonnet 5.5에 (더) 가깝다"라고 표현한 것이었다. 그중 앞부분은 대체로 벤더 자체의 비교 세트가 보여주는 것과 일치한다. 뒷부분은 측정치가 마케팅과 어긋나기 시작하는 지점이며, 어느 쪽인지 정확히 짚을 가치가 있다.

두 모델, 6일과 한 티어 차이

Claude Haiku 5.5는 2026년 10월 7일 모델 ID claude-haiku-5-5로 출시되었습니다. Claude Haiku 4.5를 직접 대체하는 모델로, 텍스트와 이미지를 입력받아 텍스트를 반환하며, Anthropic이 조정 가능한 effort 설정을 제공한 최초의 Haiku급 모델입니다. 설정 단계는 Low, Medium, High, Xhigh, Max이고 API 기본값은 medium입니다. Anthropic은 이를 "지금까지 출시한 것 중 가장 저렴하고, 가장 빠르며, 가장 뛰어난 소형 모델"이라고 부르며, 각주에서 이는 각 모델의 표준 속도 기준으로 가장 빠르다는 의미이고 Opus 모델이 Fast Mode로 실행될 때는 여전히 그보다 뒤처진다고 단서를 달았습니다.

Claude Sonnet 5.5는 6일 먼저, 2026년 9월 28일에 claude-sonnet-5-5로 출시되었습니다. Anthropic이 속도와 지능의 최고 조합으로 내세우는 등급이자, 복잡한 에이전트 코딩에 권장하는 모델입니다. 100만 토큰 윈도우는 동일합니다. Claude Haiku 5.5와 달리 프롬프트 길이에 따른 가격 구간이 없는데, 이는 6일 먼저 출시된 이점보다 더 중요하다는 것이 드러납니다.

둘 다 이제 Amazon Web Services, Google Cloud, Microsoft Azure를 포함한 모든 플랫폼에서 사용할 수 있으며, 두 모델 모두 출시 후 최소 1년이 지나기 전에는 서비스를 종료하지 않겠다는 약속을 포함합니다 — Claude Haiku 5.5는 2027년 10월 7일, Claude Sonnet 5.5는 2027년 9월 28일입니다. Anthropic은 Claude Sonnet 5.5가 제로 데이터 보존으로 제공되며, 이는 Claude Opus 5.5 및 Claude Sonnet 5와 동일하다고 밝혔습니다.

요금표, 양면 모두, 한곳에서

백만 토큰당, 미국 달러 기준, Anthropic이 공개한 요율로:

• 입력 — Claude Haiku 5.5는 최대 100,000토큰 프롬프트에 $0.10, 그 이상은 $0.50; Claude Sonnet 5.5는 $2.00 정액, 구간 없음.

• 출력 — Claude Haiku 5.5는 최대 100,000토큰까지 $0.50, 그 이상은 $2.50; Claude Sonnet 5.5는 $10.00 정액.

• 캐시 읽기 — Claude Haiku 5.5는 하위 구간에서 $0.01, 그 이상에서는 $0.05; Claude Sonnet 5.5는 $0.10. Anthropic은 Haiku 출시와 동시에 Claude Sonnet 5.5의 캐시 읽기를 $0.20에서 절반으로 인하했으며, 캐시 읽기가 에이전트형 토큰 사용에서 큰 비중을 차지하기 때문에 Claude Sonnet 5.5가 이제 대부분의 에이전트형 작업에서 약 20% 더 저렴하다고 말합니다.

• 캐시 쓰기 — Claude Haiku 5.5는 낮은 구간에서 5분 쓰기에 $0.125, 1시간 쓰기에 $0.20이며, 그보다 높은 구간에서는 $0.625와 $1.00입니다. Claude Sonnet 5.5는 5분 쓰기에 $2.50, 1시간 쓰기에 $4.00입니다.

• 배치 — Batch API는 입력과 출력 모두 50% 할인됩니다. 그 결과 Claude Haiku 5.5는 100,000토큰 기준 미만에서 $0.05와 $0.25, 기준 초과에서 $0.25와 $1.25가 되며, 이는 Claude Sonnet 5.5의 $1.00 및 $5.00과 대비됩니다.

그 줄들을 쭉 읽어 보면 패턴은 일관됩니다. 아래쪽 구간에서는 입력 격차 20배와 출력 격차 20배를 보게 되고, 기준선 위에서는 4배와 4배입니다. Anthropic의 대표 문구는 Claude Haiku 4.5 대비 평균적으로 “실행 비용이 약 75% 더 적다”는 것이며, 각주에서는 100,000 토큰 미만에서는 90% 더 저렴하고 그 이상에서는 50% 더 저렴하다고 정교화하는데, 토크나이저 변경도 그 평균에 포함되어 있습니다.

100,000토큰 단계는 산술이 바뀌는 지점이다

두 가지 요인이 서로 반대 방향으로 작용하는데, 그중 요금표에 올라 있는 것은 하나뿐이다. Claude Haiku 4.5 대비 가격은 크게 떨어진다. 동시에 Claude Haiku 5.5에는 Claude Sonnet 5.5와 Claude Opus 5.5에 들어간 것과 유사한 업데이트된 토크나이저가 탑재되는데, Anthropic은 이것이 "작업당 토큰을 약간 더 사용한다"고 말한다. 따라서 동일한 프롬프트도 이전 세대에서보다 더 많은 수의 청구 대상 토큰으로 처리된다. 75%라는 평균은 이 두 가지의 순효과이며, 이는 벤더가 제시한 수치다.

100,000토큰 기준선은 사람들이 특히 걸리는 부분입니다. Anthropic은 Claude Haiku 5.5의 가격을 프롬프트 길이에 따라 책정합니다. 프롬프트가 100,000토큰을 초과하는 요청은 임계값을 넘는 토큰에만이 아니라 요청 전체에 더 높은 가격을 지불합니다. 프롬프트 길이는 캐시 읽기와 캐시 쓰기를 포함한 모든 입력 토큰을 집계하며, 각 요청은 개별적으로 가격이 책정됩니다. 즉, 긴 요청은 프롬프트의 일부가 캐시 적중이더라도 더 높은 구간을 지불하고, 이전 요청은 청구된 가격을 그대로 유지합니다. 90,000토큰에 여유롭게 머무는 검색 파이프라인은 $0.10과 $0.50을 지불합니다. 창을 한 칸만 밀어도 전체 요청이 $0.50과 $2.50로 재책정됩니다. Claude Sonnet 5.5는 이렇게 하지 않습니다. 전체 100만 토큰 창이 표준 가격으로 청구되기 때문입니다.

두 가지 결과가 뒤따르는데, 서로 반대 방향을 가리킨다. 첫째, 사람들이 기대하는 교차점—긴 컨텍스트가 비싼 모델을 더 저렴한 모델로 만드는 현상—은 일어나지 않는다: 위에 나온 Claude Haiku 5.5는 요금표상 여전히 Claude Sonnet 5.5의 4분의 1이다. 둘째, 당신이 기대했던 격차는 당신의 워크로드가 무거워질 때, 즉 절대 수치가 중요해지기 시작하는 바로 그때 20배에서 4배로 좁아진다. 이 계단식 변화가 비용에 민감한 파이프라인에 토큰당 요율이 아니라 자체 예산 항목이 필요한 이유다.

각 공급업체가 보고하는 자체 점수

이 섹션의 모든 내용은 공급업체가 보고한 것이며 제3자가 재현한 것이 아닙니다. Anthropic은 자사의 Claude Haiku 5.5 및 Claude Sonnet 5.5 페이지에 동일한 비교 세트를 게시하며, 두 페이지가 겹치는 부분에서는 일치합니다:

• GDPval-AA v2.1, 지식 노동 — Claude Haiku 5.5의 경우 1,620, Claude Sonnet 5.5의 경우 1,840, Claude Haiku 4.5의 경우 735, GPT-6 Luna의 경우 1,437.

• AA-Briefcase v1.1 — Claude Haiku 5.5는 1,578로, Claude Sonnet 5.5의 1,824와 대비되며, Claude Haiku 4.5는 614, GPT-6 Luna는 1,336입니다.

• OSWorld 2.1, 컴퓨터 사용, 오프라인 하위 집합 — Claude Haiku 5.5는 72.4%로, Claude Sonnet 5.5의 83.9%, Claude Haiku 4.5의 15.7%, GPT-6 Luna의 48.9%와 대비됩니다.

• Terminal-Bench 4.0, 에이전트형 코딩 — Claude Haiku 5.5는 39.2%로, Claude Sonnet 5.5의 70.6%와 대비되며, Claude Haiku 4.5는 0.0%, GPT-6 Luna는 16.4%입니다.

• FrontierCode 1.1, Main — Claude Haiku 5.5는 46.4%를 기록했으며, Xhigh effort에서 Claude Sonnet 5.5는 52.1%, GPT-6 Luna는 42.4%였습니다. Anthropic은 또한 Claude Sonnet 5.5가 이 항목에서 Max effort에서 Xhigh보다 낮은 점수를 받는다고 지적하는데, 이는 코드 리뷰 스킬을 더 자주 사용하여 타임아웃이나 범위를 벗어난 편집을 초래하기 때문이라고 설명합니다.

• Chartography, 도구 없이 수행하는 시각적 추론 — Claude Haiku 5.5는 46.4%인 반면, Claude Sonnet 5.5는 61.6%, Claude Haiku 4.5는 6.4%, GPT-6 Luna는 29.1%를 기록했습니다.

• Humanity's Last Exam — Claude Haiku 5.5의 경우 도구 없이 45.9%, 도구 사용 시 57.4%입니다. 같은 페이지에서 Claude Sonnet 5.5는 도구 사용 시 64.5%, Claude Haiku 4.5는 18.7%, Claude Sonnet 5.5는 도구 없이 56.9%입니다. Anthropic은 OpenAI가 이미지 이해 버그를 수정했고 타사 점수가 모두 업데이트되지 않았기 때문에 GPT-6 제품군 수치가 오래되었을 수 있다고 언급합니다.

그중 두 줄은 두 번 읽을 가치가 있다. FrontierCode에서는 두 모델이 그나마 가깝다 — 46.4% 대 52.1% — 그리고 숨을 수 있는 도구가 없는 Chartography에서는 격차가 15포인트다. Terminal-Bench 4.0은 전혀 가깝지 않다: 39.2% 대 70.6%는 다른 역량 계층이며, 그래서 Anthropic의 Claude Sonnet 5.5 페이지는 여전히 복잡한 에이전트형 코딩에는 Claude Sonnet 5.5와 Claude Opus 5.5를 가리키고 Claude Haiku 5.5는 범위가 좁고 처리량이 많은 작업을 위한 모델로 규정한다.

독립 이사회가 더하는 것

Anthropic이 내놓은 수치는 자사 모델들을 서로, 그리고 한 경쟁사와 비교한 것이다. 독립적인 리더보드는 둘 모두를 전체 분야와 견주며, 이 리더보드가 보고하지만 공급업체들은 보고하지 않는 수치는 완료된 작업당 비용이다.

Artificial Analysis는 Claude Haiku 5.5를 Max effort에서 평가해 Intelligence Index 43점을 부여했으며, 이는 비교 가능한 모델들의 중앙값 13을 훨씬 웃도는 수치입니다. 이 모델은 해당 Index에서 4억 4천만 개의 출력 토큰을 생성했고, 이는 중앙값 1억 개와 대비됩니다 — 매우 장황함 — 백만 토큰당 입력 $0.10, 출력 $0.50이며, 초당 242개의 출력 토큰을 냅니다. 측정된 비용은 Intelligence Index 작업당 $0.21입니다.

동일한 리더보드에서 Claude Sonnet 5.5는 중앙값 26에 비해 56점을 기록했고, 중앙값 8,800만 개에 비해 4억 1,000만 개의 출력 토큰을 생성했으며, 입력 $2.00, 출력 $10.00에 90% 캐시 할인이 적용됩니다. 측정된 비용은 Intelligence Index 작업당 $7.60입니다.

A headless capture of the Artificial Analysis model page for Claude Haiku 5.5 at Max effort, showing the header 'Claude Haiku 5.5 (Max)' with the Anthropic vendor label and release month October 2026, a rank strip reading Intelligence #2/182, Speed #8/182, Cost #46/182 and Verbosity #62/182, the price strip In $0.10, Out $0.50 and $0.21 per task, a Comparison Summary stating an Artificial Analysis Intelligence Index of 43 against a median of 13 with 440M output tokens generated, and an output-token speed of 242 tokens per second described as notably fast. A specification panel confirms a 1M-token context window, reasoning enabled, text and image input and text output.A headless capture of the Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), showing the Anthropic vendor label and release month September 2026, a rank strip reading Intelligence #3/216, Cost #98/216 and Verbosity #102/216, the price strip In $2.00, Out $10.00, a 90% cache discount and $7.60 per task, a Comparison Summary stating an Intelligence Index of 56 against a median of 26 with 410M output tokens generated against a median of 88M, and a specification panel showing a 1M-token context window and text and image input.

그 두 줄을 나란히 놓으면 그 비율이 핵심이다. $0.21 대 $7.60은 36배를 조금 넘는데, 두 모델은 장황함 면에서 거의 같은 수준이다 — 출력 토큰 440M 대 410M — 따라서 그 배수는 거의 전적으로 요금표가 예고한 대로 작동한 결과다. 공급업체 자체 요금표에서 같은 비교는 20배다. 그 추가분은 토큰당 가격이 보여줄 수 없는 것들에서 나온다: 더 저렴한 모델은 이 에포트 설정에서 작업당 청구되는 토큰이 더 적게 답에 도달하며, 캐시 읽기는 Claude Sonnet 5.5 요금의 10분의 1로 청구된다. 동일한 하네스, 동일한 작업, 독립적으로 측정.

A generated two-column comparison scoreboard titled 'Claude Haiku 5.5 vs Claude Sonnet 5.5 - the scoreboard'. The left column, headed Claude Haiku 5.5, reads AA Intelligence Index: 43; Cost per Index task: $0.21; Input / output per 1M: $0.10 / $0.50; Output speed: 242 tok/s; Context window: 1M; Terminal-Bench 4.0: 39.2%. The right column, headed Claude Sonnet 5.5, reads AA Intelligence Index: 56; Cost per Index task: $7.60; Input / output per 1M: $2.00 / $10.00; Output speed: not published; Context window: 1M; Terminal-Bench 4.0: 70.6%. A footer line reads 'Index, cost per task and speed per Artificial Analysis; Terminal-Bench vendor-reported.'

저렴한 등급이 실제로 한계에 도달하는 지점

Anthropic이 공개하는 고객 수치가 벤치마크보다 더 자주 승부를 가르며, 그 수치들은 모두 같은 방향을 가리킨다. Asana는 작업 완료 시 지연 시간이 30% 이상 낮아졌고 에이전트 턴당 추론 속도는 최대 2.5배 더 빠르다고 보고한다. Box는 약 절반의 지연 시간으로 Claude Haiku 4.5보다 11점 높은 점수를 보고한다. HubSpot은 자사 제품군에서 본 최고 점수인 92.8%를 세 번의 실행 평균으로 보고하며, 가장 높은 적중률과 가장 낮은 오탐률을 기록했다. AlphaSense는 "Ask in Document"를 통해 주당 약 800만 건의 호출을 처리하며 Claude Haiku 4.5 대비 통계적으로 유의미한 개선을 보고하는데, 0.84 대 0.76이다. Cognition은 Claude Haiku 5.5를 사이드킥으로 사용할 때 자사의 Fusion 에이전트가 FrontierCode 점수 66.2를 유지한다고 보고한다.

그중 어느 것도 장기 호라이즌 에이전트가 아니다. 그것들은 포인트 솔루션, 즉 잘 정의된 단 하나의 단계로 점점 더 빠르고 저렴해지는 것들이다. Claude Haiku 5.5가 바로 그런 형태를 위해 만들어졌고, 36배 비용 우위가 반올림 오차가 아니라 실제 돈이 되는 것도 바로 그런 형태다. 이 우위는 호출량이 늘수록 복리로 불어나고, 호출 깊이가 깊어질수록 증발한다. 하루 10만 건의 분류 호출이 입력 $0.10, 출력 $0.50이라면 사라지는 것을 체감하게 되는 비용 항목이고, 세션당 100번의 에이전트 턴이 각각 누적된 컨텍스트를 다시 읽는 경우는 임계값을 넘는 모든 턴이 더 높은 요금 구간을 지불하기 때문에 초선형적으로 커지는 비용 항목이다.

Claude Sonnet 5.5의 반론은 토큰당 비용이 아니라 시도당 비용이라는 것이다. Anthropic은 Claude Sonnet 5보다 30% 이상 빠르게 실행되고 대부분의 작업에서 최대 30% 더 저렴하다고 말하며, 그 절감은 더 낮은 요율이 아니라 더 적은 토큰이 필요하다는 데서 나온다. 제3자 테스터들은 여기에 수치를 붙였다: Slack은 출력 토큰이 대략 14% 더 적다고 보고했고, Balyasny는 답변당 약 121k 토큰으로 497k와 대비되며, Box는 12% 더 적은 토큰으로 2.4배 더 빠르고, Lovable은 도구 호출이 대략 3분의 1 더 적고 셸 실행은 약 절반이며, Atlassian은 Rovo Agents가 최대 30% 더 빠르고, Base44는 빌드당 3.6회 반복으로 Claude Opus 5의 7.7회와 대비된다. 성공하는 한 번의 턴이 그렇지 않은 네 번을 이긴다.

반대 방향으로 작용하는 세 번째 요인이 있습니다. Anthropic은 이 세대에서 effort를 모델 수준의 다이얼로 옮겼습니다 — Claude Haiku 5.5의 effort 설정은 요청별 사고 예산으로 산정되는 대신 요청당 한 번 설정되며, 예전 budget_tokens 모드는 4.6 모델에서 더 이상 사용되지 않고 이후 모델에서는 허용되지 않습니다. 여러 서비스에서 하나의 모델 ID를 호출하는 플릿에게 이는 단순화입니다. 호출마다 자체적으로 추론 규모를 산정하던 무엇에게는 재작성입니다.

둘 모두를 하나의 엔드포인트 뒤에서 실행하기

이 결정을 제대로 내리는 것이 중요한 이유는, 잘못된 쪽을 선택하면 되돌리는 비용이 크기 때문입니다. 프로덕션 경로를 한 모델 ID에서 다른 모델 ID로 재배선한다는 것은 이전 모델의 동작을 전제로 한 모든 호출 지점을 손봐야 한다는 뜻입니다. 어떤 워크로드가 어느 티어에 속하는지 알아내는 더 저렴한 방법은 두 모델을 하나의 엔드포인트 뒤에서 함께 실행하고, 리팩터링이 아니라 구성만으로 둘 사이의 트래픽을 옮기는 것입니다.

그것이 바로 OrcaRouter가 존재하는 이유입니다. Claude Sonnet 5.5는 카탈로그에 anthropic/claude-sonnet-5.5(으)로 등록되어 있으며, Claude Sonnet 5, Claude Opus 5.5, Claude Haiku 4.5도 나란히 있습니다 — 이전 Haiku 티어는 여기서 벗어나는 동안 기준점으로 계속 사용할 수 있습니다. 플랫폼은 제공자 정가를 마크업 없이 그대로 전달하므로, 위의 $2.00과 $10.00이 바로 지불하는 요금이며, 반대의 경우도 마찬가지입니다. 벤더가 가격을 다시 책정하면 새 가격이 같은 날 여기에 반영되는데, Claude Sonnet 5.5의 캐시 읽기 인하가 우리에게 전해진 방식이 바로 그렇습니다. 이 특정한 결정에 필요한 일은 두 가지 기능이 해냅니다. 자동 페일오버는 아직 평가 중인 모델을 자동으로 핵심 경로에서 벗어나 있게 해주고, 라우팅 DSL을 사용하면 100,000토큰 미만의 호출은 저렴한 티어로 보내고 장문 컨텍스트나 장기 실행 호출은 더 비싼 티어로 같은 요청 흐름 안에서 넘길 수 있습니다 — 별도의 계약이나 별도의 SDK 없이 말이죠.

정확히 무엇이 호스팅되고 무엇이 호스팅되지 않는지 말하자면: Claude Sonnet 5.5는 오늘부터 우리를 통해 라우팅할 수 있습니다. Claude Haiku 5.5는 아직 카탈로그에 없습니다. 그때까지는 Anthropic 자체 API와 위에 나열된 세 개의 클라우드 플랫폼에 있습니다.

결정하는 방법

작업이 범위가 좁고, 처리량이 많고, 검증 가능한 경우 — 분류, 추출, 라우팅, 요약, 이미 구축한 에이전트 내부의 턴별 작업 — 에는 Claude Haiku 5를 선택하세요. 그곳에서는 20배 격차가 핵심이며, 100,000토큰 단계는 설계상 피할 수 있고, 독립적으로 측정된 작업당 $0.21은 그 이점이 벤더 자체의 것 바깥에서도 살아남는다는 것을 보여줍니다. effort를 기본값으로 두지 말고 작업 클래스별로 설정하세요. Haiku급 모델에서 Low와 Max의 차이는 품질 선호가 아니라 비용 배수입니다.

작업이 장기적이고 자율적(에이전트형)이거나 검증 불가능할 때 — 컴파일되어야 하는 코드, 화면을 알려진 상태로 남겨야 하는 컴퓨터 사용, 오답의 비용이 호출 비용보다 큰 모든 경우 — Claude Sonnet 5.5를 선택하세요. Terminal-Bench 4.0의 70.6% 대 39.2%는 미묘한 차이가 아니라 완전히 다른 역량 등급이며, 정액 요금표는 긴 컨텍스트가 전체 요청 가격을 조용히 다시 매기지 않는다는 뜻입니다. 워크로드가 정말 중간에 걸쳐 있다면, 솔직한 답은 두 모델 모두 아직 폭넓은 제3자 재현 결과를 갖추지 못했고, 지수 점수는 단일 하네스에서 나온 것이며, 위에 인용된 공급업체 수치는 공급업체 자체의 것이라는 점입니다.

이 답변을 바꾸려면 무엇이 필요할까요?

주목할 만한 세 가지가 있는데, 그중 어느 것도 벤치마크 릴리스가 아니다. 첫째는 Low, High, Xhigh effort에서의 Claude Haiku 5.5에 대한 독립 평가가—Max만이 아니라—동일한 작업당 비용 비율을 보여주는지 여부다. 왜냐하면 effort 다이얼은 비교에서 가장 저렴한 지렛대이면서 가장 적게 측정되기 때문이다. 둘째는 100,000-token 단계가 살아남는지 여부다. 다음 세대에서 세 번째 밴드가 생기거나 아예 밴드가 없어지면, 단일 벤치마크 점수보다 라인에 있는 모든 검색 파이프라인의 계산을 더 많이 바꿀 것이다. 셋째는 토크나이저다. 만약 이후 체크포인트가 동일한 텍스트를 이전 비율로 토큰화한다면, Anthropic의 75% 평균은 목표가 아니라 하한이 되고, 두 가격이 모두 움직이지 않아도 Claude Sonnet 5.5와의 격차는 벌어진다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트