생성된 타이틀 카드에는 ‘Claude Haiku 5.5 출시’라고 적혀 있고, 릴리스 배지에는 ‘GA 2026년 10월 7일’, 두 장의 팩트 카드에는 ‘입력 $0.10 / 1M 최대 100K 토큰’과 ‘출력 $0.50 / 1M 최대 100K 토큰’, 그리고 하단 문구에는 ‘헤드라인 하나 잘라내고, 각주 두 개: 임계값 아래 90퍼센트, 임계값 위 50퍼센트, 약 30퍼센트 더 많은 토큰을 기준으로’라고 적혀 있습니다. 실제 OrcaRouter 로고는 오른쪽 아래에 합성되어 있습니다.
Guides & Insights

Claude Haiku 5.5, 백만 토큰당 $0.10으로 출시: 75% 주장과 두 가지 각주

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Anthropic은 Claude Haiku 5.5를 2026년 10월 7일 정식 출시했으며, 입력 토큰 100만 개당 0.10달러, 출력 100만 개당 0.50달러다. 이는 OpenAI가 GPT-6 Luna에 청구하는 것과 똑같은 두 숫자이며, Claude Haiku 4.5가 2025년 1.00달러와 5.00달러로 출시된 이후 계속 받아온 가격의 5분의 1에 해당한다. Anthropic의 출시 게시글에서 헤드라인은 새 모델이 이전 모델보다 평균적으로 "실행 비용이 약 75% 더 적게" 든다는 것이고, 이후 모든 요약이 반복한 수치가 바로 그것이다. 여기에는 대부분의 요약이 빼먹은 두 개의 각주가 따라붙는다. 10만 토큰 미만에서는 90% 인하, 그 이상에서는 50% 인하이며, Claude Haiku 5.5는 Claude 4.7 이후 버전과 공유하는 최신 토크나이저를 사용하므로 동일한 텍스트가 약 30% 더 많은 토큰으로 집계된다 — Claude Haiku 4.5와 비교할 때. 그래서 75%는 요금표가 아니라 청구서에 관한 진술이며, 프롬프트가 긴 사람에게는 그 둘이 서로 다른 것이다. 벤더 자체의 비교표 역시 GPT-6 Luna와 Claude Sonnet 5.5를 나란히 열로 배치하는데, 이는 출시 문서를 유난히 반박하기 쉽게 만든다.

‘75% 덜’ 뒤에 숨은 산수

먼저 요금표를 확인하세요. 요금이 균일하지 않기 때문입니다. 입력은 100,000 토큰까지 100만 토큰당 $0.10이고, 그 이상은 100만 토큰당 $0.50입니다. 즉 5배입니다. 출력은 $0.50이고 그다음은 $2.50입니다. 캐싱도 같은 단계를 따릅니다. 5분 캐시 쓰기는 기준 이하에서 100만 토큰당 $0.125, 기준 초과에서는 $0.625이고, 1시간 쓰기는 $0.20, $1.00이며, 캐시 읽기는 $0.01, $0.05입니다. Message Batches API는 두 요금 항목 모두 50% 할인하며, 배치 경로에서는 모델이 output-300k-2026-03-24 베타 헤더

이제 그 위에 토크나이저를 얹어 보자. 대표적인 주장이 흥미로워지는 지점이 바로 여기이기 때문이다. Claude Haiku 4.5 토크나이저에서 90,000토큰으로 측정된 프롬프트는 새 토크나이저에서 대략 117,000토큰으로 측정된다. 크기는 변하지 않았지만 100,000토큰 선을 넘었기 때문에 입력 100만 토큰당 $0.10이 아니라 $0.50로 청구된다. Claude Haiku 4.5에서는 같은 콘텐츠의 입력 비용이 $0.09였다(100만 토큰당 $1.00 × 0.09백만). Claude Haiku 5.5에서는 $0.0585가 든다. 이는 35% 인하이다 — 실제이며, 90%에는 전혀 못 미친다. 90%라는 수치는 토크나이저가 요청을 확장한 뒤에도 그 선 아래에 머무는 요청에 적용되는데, 상당량의 짧은 호출 트래픽이 바로 여기에 있다. 20,000토큰 분류 호출은 26,000토큰이 되고 첫 번째 티어에 머물며, 그곳에서는 입력 가격이 정말로 예전의 10분의 1이다.

그로부터 세 가지가 따라 나오는데, 이는 평균을 내기보다 따로 분리해 볼 가치가 있습니다:

• 짧은 호출은 전체 할인을 받습니다. 한도 내에 들어오는 문서의 추출, 라우팅, 분류, 요약에는 입력과 출력 모두 90%가 적용되며, 여기서 토크나이저의 확장분은 제외됩니다.

• 긴 호출은 약 3분의 1 할인되며, 4분의 3 할인되지 않는다. 재토큰화 후 100,000토큰을 초과하는 요청은 백만 개당 $0.50와 $2.50를 지불한다 — 여전히 Claude Haiku 4.5 요율의 절반이지만, 그것이 속한 티어는 스티커가 광고하는 티어의 다섯 배다.

• "평균 75% 절감"은 트래픽 가중치가 적용된 수치이며, Anthropic의 것입니다. 이는 벤더가 자체적으로 예상하는 자체 구성 비율에 대한 설명이며, Anthropic은 임계값 미만의 프롬프트가 이전 Haiku에 대한 요청의 약 90%를 차지했다고 분명히 밝히고 있습니다. 여러분의 구성 비율이 그 비율과 다르다면, 여러분의 평균도 그 평균과 다를 것입니다. 그리고 어느 쪽인지 알 수 있는 유일한 방법은 예산을 설정하기 전에 새 토크나이저에서 여러분의 트래픽 토큰을 직접 세어보는 것입니다.

A generated one-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' with six rows reading 'Input: $0.10 / 1M up to 100K, then $0.50', 'Output: $0.50 / 1M up to 100K, then $2.50', 'Context: 1,000,000 tokens', 'Independent score: 43 at Max effort, rank 2 of 182', 'Cost per task: $0.21', and 'Throughput: 241.9 tokens per second', with a footer reading 'Independent figures per Artificial Analysis; pricing per Anthropic.' The real OrcaRouter logo is composited bottom-right.

그것과 함께 또 무엇이 출시되었나요?

이 모델은 가격만의 문제가 아니다. 출시 관련 세부 사항 몇 가지는 이 모델을 대상으로 코드를 작성하는 방식을 바꾸며, 그중 하나는 기존 클라이언트를 망가뜨릴 것이다.

• Adaptive thinking은 기본적으로 켜져 있으며, 노력 다이얼은 Low에서 Max까지이고 기본값은 medium입니다. 조정 가능한 노력 설정을 갖춘 최초의 Haiku급 모델이며, 답변당 품질과 비용을 모두 좌우하는 핵심 지렛대입니다.

• 샘플링 파라미터가 거부됩니다. 기본값이 아닌 temperature, top_p 또는 top_k를 전송하면 400을 반환합니다. 해당 인수를 그대로 이어받은 마이그레이션은 조용히 성능이 저하되는 대신 첫 요청에서 곧바로 실패합니다. 이는 적어도 정직한 실패 방식입니다.

• 동기 Messages API에서 100만 토큰 컨텍스트와 최대 128,000 출력 토큰, 2026년 6월 지식 컷오프, 그리고 2027년 10월 7일보다 이르지 않은 시점까지 서비스를 유지하겠다는 약속을 제공합니다.

• 첫날부터 다섯 개 플랫폼: Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry, 그리고 AWS의 Claude Platform. 이는 이런 출시들이 흔히 거치는 단계적 제공 방식이 아니라 같은 날 동시 출시입니다.

• 툴링도 이동했습니다. Anthropic의 Python 및 TypeScript SDK가 이제 베타에서 컴퓨터 사용과 브라우저 사용을 지원하며, 회사는 Max 5x($100), Max 20x($200), Team(최대 $500 풀링) 구독자에게 월간 API 크레딧을 추가했습니다.

• 안전성 태세는 가격이 시사하는 것보다 더 좁습니다. Anthropic에 따르면 Claude Haiku 5.5의 사이버 안전장치는 Claude Haiku 4.5보다 더 제한적이지만 최근 프런티어 모델보다는 덜 제한적입니다. 즉, Claude Sonnet 5.5가 허용하는 것보다 방어적 사용 범위가 넓고, 침투 테스트는 여전히 차단됩니다. 또한 생물학 안전장치는 Claude Sonnet 5, Claude Sonnet 5.5, Claude Opus 5와 동일합니다. 정렬 평가는 Anthropic 자체 스위트에서 이전 모델보다 전반적으로 개선되었습니다.

공급업체의 표가 말하는 것, 그리고 독립 이사회가 말하는 것

Anthropic은 세 개의 비교 열로 구성된 벤치마크 표를 공개했는데, 이는 공급업체들이 어떻게 주장하는지에 관한 문서로서 읽을 가치가 있다. 아래의 모든 수치는 공급업체가 보고한 것이며, Anthropic의 하네스에서 산출되었고, 그중 어느 것도 독립적으로 재현된 바 없다. GPT-6 Luna가 등장하는 항목은 Anthropic이 경쟁사 모델을 상대로 자체 평가를 실행한 결과다.

• 지식 노동 — GDPval-AA v2.1에서 Claude Haiku 5.5는 1620, Claude Haiku 4.5는 735, GPT-6 Luna는 1437, Claude Sonnet 5.5는 1840입니다. AA-Briefcase v1.1은 1578, 614, 1336, 1824입니다.

• 컴퓨터 사용 — OSWorld 2.1 오프라인 기준 72.4%로, 15.7%, 48.9%, 83.9%와 대비됩니다.

• 추론 — Humanity's Last Exam에서 도구 없이 45.9%, 도구 사용 시 57.4%를 기록했으며, Claude Haiku 4.5의 10.2% 및 18.7%, Claude Sonnet 5.5의 56.9% 및 64.5%와 대비됩니다.

• 에이전트형 코딩 — Terminal-Bench 4.0은 0.0%, 16.4%, 70.6% 대비 39.2%. FrontierCode 1.1 (Main)은 GPT-6 Luna의 42.4%, Claude Sonnet 5.5의 52.1% 대비 46.4%.

• 차트 읽기 — Chartography는 도구 없이 46.4%로, 6.4%, 29.1%, 61.6%와 대비됩니다.

그 표에서 Claude Haiku 5.5는 이전 Haiku와 GPT-6 Luna 모두를 상대로 모든 행에서 승리하고, 대부분의 행에서 Claude Sonnet 5.5에게 패한다 — 이는 소형 티어의 솔직한 형태다: 큰 세대적 도약이지만, 가장 어려운 작업에서는 여전히 중간 모델보다 한 티어 아래다. Anthropic은 게시물에서 그렇게 말하며, 복잡한 에이전트 코딩에는 Claude Sonnet 5.5와 Claude Opus 5.5를 권장하고, Haiku를 압축, 요약, 분류 및 하위 에이전트 역할에 포지셔닝한다.

독립적인 평가는 더 미묘하며 더 많은 주의를 요한다. Artificial Analysis는 Claude Haiku 5.5를 Max 노력 설정에서 Intelligence Index v4.3.2 기준 43점으로 측정했는데, 이는 182개 모델 중 2위이며 초당 출력 토큰 241.9개로, 광고한 대로 빠르다. 또한 완료된 Index 과제당 비용을 0.21달러로 측정했는데, 이는 이 모델이 전체 스위트를 실행하면서 출력 토큰 4억 4천만 개를 생성한 데 따른 것으로 중앙값 1억 개와 대비된다. 평가자는 이를 매우 장황하다고 표현한다. 같은 지수에서 38점인 GPT-6 Luna는 과제당 0.07달러가 든다. 같은 정가, 세 배의 청구서. 이는 출시 당시의 주장과 모순되는 것이 아니라, 그 주장이 말하는 바로 그 현상을 반대쪽 끝에서 본 것이다. 즉 요금표는 토큰당 지불하는 가격이고, 실제로 지불하는 금액은 요율 곱하기 토큰이며, Claude Haiku 5.5는 경쟁 모델보다 답변당 토큰을 더 많이 소비한다. 노력 설정이 지렛대이며, 이 모델의 기본값은 medium이며 Max가 아니다. 이 값을 더 낮게 고정하는 팀은 더 작은 청구서와 더 낮은 점수를 모두 보게 될 것이다.

한 곳에서 호출하기

이번 출시로 생기는 마이그레이션 질문은 "더 나은가"가 아니라 "내 트래픽에 얼마가 드는가"이며, 그 답은 프롬프트 길이, 캐시 적중률, 그리고 선택한 effort 설정에 달려 있습니다. 거기까지 가려면 자체 프롬프트 세트를 두 세대 모두에 돌려봐야 하는데, 이는 하나의 엔드포인트 뒤에서 하면 저렴하고 두 곳에 걸쳐서 하면 번거롭습니다.

Claude Haiku 5.5 자체는 아직 OrcaRouter의 카탈로그에 없으며, 그 점을 솔직히 밝히는 편이 다르게 암시하는 것보다 더 유용합니다. Anthropic 라인의 나머지는 다음과 같습니다. Claude Haiku 4.5, Claude Sonnet 5.5, Claude Opus 5.5는 모두 오늘부터 제공업체 정가로 저희를 통해 호출할 수 있으며, 0% 마크업이 그대로 전가된 조건입니다. 따라서 마이그레이션 테스트의 "before" 구간은 나중에도 그대로 유지할 동일한 키로 실행되고, 그 구간에 대한 공급업체의 가격 인하는 같은 날 저희 쪽에도 반영됩니다. "after" 구간은 새 모델이 저희가 라우팅하는 런타임에 도달할 때까지 Anthropic의 API입니다. 그동안 공유 엔드포인트가 제공하는 것은 호출 아래에서 작동하는 자동 페일오버, 즉 새 모델이 그 경로에 의존하지 않고도 프로덕션 트래픽을 처리할 수 있게 해주는 것이며, Haiku에서 Sonnet으로의 에스컬레이션이 애플리케이션 코드가 아니라 라우트에 속하는 경우를 위한 라우팅 DSL이기도 합니다.

A screenshot of OrcaRouter's model page for anthropic/claude-haiku-4.5, showing the model card and its list pricing of $1.00 per million input tokens and $5.00 per million output tokens, captured in English.

출시에 포함된 두 가지 고객 결과는 증거라기보다는 단서로서 계속 활용할 가치가 있다. Asana는 지연 시간이 30% 넘게 감소했고 에이전트 턴당 추론 속도가 최대 2.5배 빨라졌다고 보고한다. HubSpot은 자사 스위트에서 세 번 실행한 평균 92.8%를 보고한다. AlphaSense는 400개 쿼리에서 0.76 대비 0.84를 보고한다. 이는 벤더가 자사 발표에서 선택한 고객 수치이며, 그 가치는 어떤 워크로드를 먼저 테스트할지 알려주는 데 있지, 여러분이 무엇을 얻게 될지 알려주는 데 있지 않다.

무엇이 상황을 바꿀까요?

75%라는 수치는 모든 트래픽 가중 공급업체 주장이 정산되는 것과 똑같은 방식, 즉 여러분 자신의 청구서로 정산될 것이다. 독립적인 측면에서 진정으로 미정인 것은 작업당 비용 수치다. 더 많은 실행이 누적되면서도 그 수치가 유지된다면, 이번 출시에 대한 정직한 요약은 Anthropic이 요율표를 80% 인하했고 답변당 더 많은 토큰을 소비하는 모델을 만들었다는 것이다. 따라서 실질적 절감은 실제이고, 크며, 워크로드에 따라 달라지고, 포스터에 적힌 숫자인 경우는 드물다. 에포트 설정과 캐싱으로 그 수치가 내려간다면, 이 티어는 더욱 좋아 보인다. 어느 쪽이든, 전환 전에 확인해야 할 숫자는 새 토크나이저 아래에서의 여러분 자신의 작업당 토큰이다 — 그것이 출시 글이 여러분에게 줄 수 없는 단 하나의 수치다.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 at maximum effort, showing an Intelligence Index of 43 on v4.3.2 at rank 2 of 182 models, a 1,000,000-token context window, 241.9 output tokens per second at rank 8 of 182, a cost of $0.21 per Intelligence Index task, and 440 million output tokens against a 100 million median.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트