'요율의 10분의 1은 청구서의 10분의 1이 아니다'를 위한 생성된 히어로 카드로, '세대 격차' 배지가 붙고, 킥커는 '두 개의 Haiku 모델, 11개월 차이', 부제는 '가격, 토큰, 그리고 새로운 100,000토큰 단계에서 Claude Haiku 5.5 대 Claude Haiku 4.5.'입니다. 네 개의 칩에는 '$0.10 / $0.50', '$1.00 / $5.00', '1M 컨텍스트', '토큰 30% 더 많음'이 적혀 있습니다. 아래 두 카드에는 '요율이 말하는 것'(100,000토큰 미만에서 입력과 출력이 90% 더 저렴)과 '청구서가 말하는 것'(약 30% 더 많은 토큰으로 실행 비용은 약 75% 더 적음)이라는 라벨이 붙어 있습니다. 푸터에는 '2026년 10월 8일에 확인한 공급업체 가격 문서.'라고 적혀 있습니다. OrcaRouter 로고가 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

Claude Haiku 5.5 vs Claude Haiku 4.5: 90% 가격 인하가 90% 절감은 아니다

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Claude Haiku 5.5는 최대 100,000토큰의 프롬프트에 대해 백만 입력 토큰당 $0.10, 백만 출력 토큰당 $0.50으로 책정됩니다. Claude Haiku 4.5는 원래부터 갖고 있던 200,000토큰 전체 창에 대해 $1과 $5의 정액 요금이 부과됩니다. Ant​hropic은 그 차이를 한 각주에서는 "90% 더 낮다"라고, 그 위 문장에서는 "실행하는 데 약 75% 덜 든다"라고 제시합니다 — 그리고 두 모델 사이의 11개월 간격은 바로 그 두 숫자 사이의 거리와 정확히 같습니다.

그것은 마케팅상의 속임수가 아니다. 그것은 가격과 동시에 토크나이저와 사고 기본값, 컨텍스트 윈도우를 바꾼 한 모델 세대의 정직한 모습이며, 이는 모델 ID만 바꾸고 청구서가 10분의 1로 줄어들기를 기대하는 사람이라면 누구든 제품이 아니라 산술 때문에 실망하게 된다는 뜻이다.

두 모델 모두, 출하 상태 그대로

아래의 모든 내용은 별도 표시가 없는 한 백만 토큰당 미국 달러 기준이며, 2026-10-08에 Anthropic 자체 가격 및 모델 문서에서 확인한 내용입니다.

A generated scoreboard titled 'Claude Haiku 5.5 vs Claude Haiku 4.5 - as shipped'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cache read $0.01 and $0.05, context 1M tokens, maximum output 128,000 tokens, thinking adaptive with an effort dial. Claude Haiku 4.5 reads input $1.00 flat, output $5.00 flat, cache read $0.10, context 200,000 tokens, maximum output 64,000 tokens, thinking manual with no effort dial. A footer reads 'Vendors' published list rates and model documentation.'

• 입력 — Claude Haiku 5.5는 최대 100,000 토큰까지 $0.10, 초과 시 $0.50; Claude Haiku 4.5는 길이에 관계없이 $1.00.

• 출력 — Claude Haiku 5.5는 최대 100,000 토큰까지 $0.50, 초과분은 $2.50; Claude Haiku 4.5는 길이에 관계없이 $5.00.

• 캐시 읽기 — Claude Haiku 5.5는 100,000토큰까지 $0.01, 그 이상은 $0.05; Claude Haiku 4.5는 $0.10. 캐시 쓰기 — $1.25 대비 $0.125 및 $0.625.

• 컨텍스트 — 200,000 대비 1M 토큰. 최대 출력 — 64,000 대비 128,000 토큰.

• 사고 — Claude Haiku 5.5는 적응형이며 기본적으로 켜져 있고, effort 다이얼은 기본값이 medium입니다. Claude Haiku 4.5는 이전의 수동 방식을 따르며 effort 매개변수가 전혀 없습니다.

• 독립 점수 — Artificial Analysis Intelligence Index v4.3.2에서 Claude Haiku 5.5 (Max)는 43.40으로 182개 모델 중 2위, Claude 4.5 Haiku는 16.88로 61개 중 30위를 기록했으며, 평가자는 4.5 점수를 추정치로 표시했습니다.

• 속도 — 동일한 출처에서 Claude Haiku 5.5는 초당 242개의 출력 토큰을 기록한 반면, 4.5 세대는 89.7개를 기록했는데, 이는 구형 모델이 여전히 편안해 보이는 유일한 부분이다.

가격의 10분의 1이라는 이야기가 무너지는 지점

세 가지가 그 삭감을 갉아먹는데, 그중 첫 번째만이 Anthropic 자신의 경고다.

토크나이저가 가장 큰 변수입니다. Claude Haiku 5.5는 Claude 4.7과 함께 도입된 최신 토크나이저를 사용하는데, Ant​hropic의 문서에 따르면 동일한 텍스트가 "Claude Haiku 4.5에서보다 약 30% 더 많은 토큰으로 계산됩니다." 즉, 같은 토큰 수에 대해 10분의 1의 요금을 내는 것이 아니라 약 1.3배의 토큰에 대해 10분의 1의 요금을 내는 셈입니다. 벤더 자체의 마이그레이션 가이드에서도 이 항목을 체크리스트의 두 번째 항목으로, 모든 코드 변경보다 앞에 배치합니다. 프롬프트의 토큰 수를 다시 계산한 다음, max_tokens와 비용 추정치를 다시 검토하십시오.

사고 토큰은 출력 토큰으로 청구되며, Claude Haiku 5.5는 기본적으로 사고한다. Ant​hropic의 출시 페이지는 이 모델이 차트상에서 그 자체로 "매우 장황하다"고 분명히 밝히고 있으며, 독립적인 측정은 벤더가 하는 것보다 더 날카롭게 이를 뒷받침한다: Intelligence Index를 평가하면서 Artificial Analysis는 Claude Haiku 5.5로부터 4억 4천만 개의 출력 토큰을 기록했는데, 이는 전체적으로 1억 개의 중앙값과 대비되며, 해당 모델을 매우 장황하다고 표시했다. 저렴한 입력 단가가 청구서 대부분이 출력인 워크로드에 도움이 되지는 않는다.

100,000토큰 구간은 세 번째입니다. 그 위의 요금은 $0.50과 $2.50입니다 — 이는 Claude Haiku 4.5가 동일한 요청에 대해 청구한 금액의 절반으로, 좋은 조건이지만 대부분의 독자가 읽었을 조건은 아닙니다. Anthropic에 따르면 임계값 미만의 프롬프트가 이전 Haiku 모델에 대한 요청의 약 90%를 차지했으며, 이는 이 기준을 헤드라인으로 견딜 수 있게 만드는 수치입니다. 이는 또한 공급업체 자체의 트래픽 구성이지, 귀하의 것이 아닙니다.

A screenshot of Anthropic's model documentation showing the Claude Haiku 5.5 row in the models table and the published rate card beneath it, with the input, output, cache read and cache write rates and the prompt-length thresholds set out per million tokens.

같은 작업이 두 모델에 얼마의 비용을 초래하는지

완료된 작업당 비용은 위의 세 가지 효과를 모두 견뎌내는 지표입니다. 왜냐하면 이는 여러분이 보낸 것뿐만 아니라 모델이 내보낸 모든 것에 대해서도 비용을 청구하기 때문입니다.

Artificial Analysis는 Claude Haiku 5.5 (Max)를 Intelligence Index 작업당 $0.21로 책정합니다 — 이는 $0.10 입력 및 $0.50 출력 요율과 함께 공개하는 수치입니다. 4.5 세대에 대해서는 작업당 비용 수치를 전혀 공개하지 않습니다. 타일에는 unknown이라고 표시되는데, 해당 모델이 추론 구성으로 Index에서 실행된 적이 없기 때문입니다. 페이지가 공개하는 것은 $1.00와 $5.00의 가공되지 않은 스티커 가격과, 그와 다른 더 낮은 측정 점수입니다.

따라서 구매자에게 정직한 비교는 토큰 기준 10배가 아니라 이에 더 가깝습니다: 30% 더 많은 토큰에 대해 입력 요율은 10분의 1, 100K를 넘으면 출력 요율은 절반, 그리고 답변당 이전 모델보다 더 많은 출력 토큰을 소비하는 모델 — 같은 독립 리더보드에서 역량이 16.88에서 43.40으로 뛰어오른 것과 대비됩니다. Ant​hropic이 평균 워크로드에 대해 제시하는 75%라는 수치는 합리적인 계획 수치입니다. 그것은 또한 당신이 통제하지 않는 트래픽 구성에 대한 공급업체의 혼합 추정치이기도 합니다.

마이그레이션은 모델 ID 교체가 아닙니다

Anthropic의 마이그레이션 가이드는 Claude Haiku 4.5에서 이전하는 모든 사용자를 위해 열 가지 항목으로 구성되어 있으며, 그중 몇 가지는 조언이 아니라 확실한 실패 요인입니다.

• Manual thinking은 더 이상 작동하지 않습니다 — thinking: {"type": "enabled", "budget_tokens": N}는 오류를 반환합니다. Adaptive thinking이 이를 대체하며, thinking.display를 "summarized"로 설정해야 합니다, 추론을 조금이라도 보려면.

• 샘플링 매개변수가 문제를 일으킵니다 — temperature, top_p 및 top_k 모두 요청에서 빠져야 합니다.

• 어시스턴트 프리필이 깨집니다 — 어시스턴트 턴으로 끝나는 대화는 오류를 반환하므로, 사용자 턴으로 끝내세요.

• 블록 순서 변경 — 응답이 thinking 블록으로 시작할 수 있으므로, 첫 번째 콘텐츠 블록을 답변으로 읽는 코드는 그 대신 타입으로 선택해야 합니다.

• 거부는 새로운 현상입니다 — 모델은 안전 분류기를 실행하며, 다음을 반환할 수 있습니다: stop_reason: "refusal", 그리고 서버 측 폴백은 없습니다.

• 리플레이는 제한됩니다 — 사고 블록은 이를 생성한 계정에서, 또는 그 계정에 연결된 계정에서만 작동합니다.

• Priority Tier는 이월되지 않습니다 — Claude Haiku 4.5에서 Priority Tier 약정을 보유한 조직은 용량을 별도로 계획해야 합니다. 해당 티어는 Claude Haiku 5.5에서 지원되지 않기 때문입니다.

그중 두 가지는 나머지보다 더 주의를 기울일 가치가 있다. 거부(refusal) 중단 이유는 모든 응답에 콘텐츠가 있다고 가정한 모든 루프에서 제어 흐름 변경을 일으키고, 계정에 종속된 thinking 블록은 대화를 저장하고 자격 증명 풀을 통해 재생하는 모든 큐를 깨뜨린다. 둘 다 프로덕션에 이르러서야 드러난다.

하나의 키로 두 티어 모두 실행하기

대부분의 팀에게 실질적인 질문은 이 두 모델 중 어느 것이 더 나은가가 아니다. 그 답은 전적으로 여러분이 어떤 호출을 하고 있는지에 달려 있기 때문이다. 문제는 캐스케이드의 저렴한 구간을 주변의 모든 요소와 독립적으로 업그레이드할 수 있는가이다.

Claude Haiku 4.5는 오늘 OrcaRouter 카탈로그에 Anthropic의 정가 그대로, 0% 마크업으로 올라와 있습니다, 따라서 제공업체의 요금이 그대로 전달되며 Anthropic이 이 요금을 변경하면 같은 날 우리 쪽에도 반영됩니다. Claude Sonnet 5.5와 Claude Opus 5.5도 있으므로, 일상적인 대부분의 작업에는 소형 모델을, 에스컬레이션에는 대형 모델을 쓰는 2단계 파이프라인을 이제 하나의 키, 하나의 SDK와 그 아래에서 자동으로 동작하는 페일오버로 구축할 수 있습니다. 나중에 소형 단계를 Claude Haiku 5.5로 교체할 때도 재작성이 아니라 모델 ID만 바꾸면 됩니다.

Claude Haiku 5.5는 아직 카탈로그에 없으며, 이를 암시적으로 남겨두기보다 분명히 말하는 것이 좋습니다. 모델이 출시되는 것과 모델이 라우팅 가능해지는 것 사이의 출시일 격차는 정상이며, 그것이 언제 해소될지에 대한 약속은 아닙니다. 오늘 아침 우리 쪽에서 호출할 수 있는 모델은 위에 명시된 것들입니다.

A screenshot of the OrcaRouter catalogue page for Claude Haiku 4.5, showing the model identifier, the provider Anthropic, the model description and a stat strip carrying the $1.00 per million input and $5.00 per million output rates alongside the context window and maximum output.

누가 전환해야 하며, 어떤 통화를 먼저 전환해야 합니까?

Haiku 4.5 트래픽이 100,000 토큰 미만의 프롬프트를 사용하는 분류, 추출, 라우팅, 압축 또는 요약 작업이라면 지금 옮기세요 — 요율은 10분의 1이고, 컨텍스트 창은 5배 더 넓으며, effort 다이얼은 기존 모델에는 없던 비용 조절 레버를 제공합니다. 예산은 약 75% 낮게 잡고, 일주일 후 자체 토큰 사용량과 대조해 확인하세요.

프롬프트가 정기적으로 100,000 토큰을 넘는다면, 당신은 90% 할인이 아니라 50% 할인을 사는 셈이며, 두 번째 구간은 비교를 바꿔 놓아 여러 곳을 알아볼 가치가 있게 합니다: 100K 초과 출력 요금 $2.50은 여러 경쟁 소형 모델이 전체 윈도에 대해 부과하는 요금보다 높습니다.

그리고 200,000토큰 문서에 맞는 유일한 저렴한 옵션이라서 Haiku 4.5를 쓰고 있다면, 무엇이 달라졌는지 주목하세요. 이제 컨텍스트 창은 100만 토큰이며, 이는 다른 제품입니다. 그리고 예전 모델을 유지할 이유는 그것이 저렴했던 이유와 함께 조용히 사라졌습니다.