
Claude Haiku 5.5의 진짜 이야기는 100K 절벽이다: 새 Haiku가 100,000 토큰을 넘어서면 무엇을 청구하는가
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Claude Haiku 5.5는 2026년 10월 7일, 백만 입력 토큰당 0.10달러, 백만 출력 토큰당 0.50달러라는 대표 가격으로 출시되었고, 어디서나 반복된 숫자는 Anthropic이 발표문에 직접 넣은 숫자였다. 동일한 두 항목에 대한 Haiku 4.5 요율 대비 90% 인하라는 숫자다. 그 90%는 사실이다. 하지만 이는 청구서의 한 차원 중 절반에만 적용되는 범위이며, 요청이 100,000 토큰을 넘는 순간 그 안의 모든 요율은 출시 보도가 대부분 건너뛴 변화를 겪는다. 이 글은 그 경계선에 관한 것이다. 경계선을 넘는 데 드는 비용, 어떤 워크로드가 실제로 그 선에 닿는지, 그리고 왜 "90% 더 저렴하다"가 여러분의 청구서가 아니라 청구서의 한 조각에 관한 주장인지.
두 가지 가격, 그리고 그것들이 바뀌는 지점
Anthropic은 모델에 대해 두 개의 열을 게시하며, 두 열 사이의 전환은 사용자가 선택한 모델 설정이 아니라 요청 크기에 대한 단일 임계값입니다:
• 단기 티어, 100,000 토큰 이하 — 입력 토큰 100만 개당 $0.10, 출력 토큰 100만 개당 $0.50 (Anthropic 요금표) • 장기 티어, 100,000 토큰 초과 — 입력 토큰 100만 개당 $0.50, 출력 토큰 100만 개당 $2.50 (Anthropic 요금표) • 캐시 읽기 — 100만 개당 $0.01(단기 티어), 100만 개당 $0.05(장기 티어) • Batch API — 어느 열이든 50% 할인, 최대 출력 길이 300,000 토큰 • 표준 최대 출력 — 128,000 토큰, 두 티어 모두 100만 토큰 컨텍스트 창

그것들은 Anthropic이 자체적으로 공개한 요율이며, 측정된 요율이 아닙니다. 그리고 그것들이 현재의 요율표입니다: 이렇게 새로운 모델의 가격은 아직 움직일 시간이 없었지만, Anthropic이 그것을 유지할 어떤 의무를 지고 있는 것은 아닙니다.
저 네 숫자를 순서대로 읽어 보면 이 사안의 윤곽이 분명해진다. 롱컨텍스트 등급의 모든 요금은 숏컨텍스트 요금의 정확히 다섯 배이고, 임계값은 그 모두에 한꺼번에 적용되는 동일한 100,000 토큰이다. 점진적인 곡선도, 보간도, 중간 구간도 없다 — 99,000 토큰 요청과 101,000 토큰 요청은 경계를 넘어간 2,000 토큰에서만이 아니라 청구서의 모든 토큰에서 5배 차이가 난다. 바로 그 부분이 이것을 경사가 아니라 절벽으로 만든다. 그리고 그것은 "90퍼센트 더 저렴하다"는 프레이밍이 보지 못하는 부분이다.

왜 상처가 실제보다 더 크게 보이는가
Haiku 4.5에 대비해 Anthropic이 수행한 비교에서, 숏 티어는 입력과 출력 모두에서 진정한 90퍼센트 절감입니다 — Haiku 4.5는 동일한 두 열에 대해 백만 토큰당 $1.00와 $5.00였습니다. 롱 티어는 사정이 다릅니다: 동일한 $1.00와 $5.00에 비해 $0.50와 $2.50는 90퍼센트가 아니라 50퍼센트 인하입니다. 따라서 출시 주장의 정직한 버전은 Claude Haiku 5.5가 100,000 토큰 미만에서는 Haiku 4.5보다 90퍼센트 더 저렴하고, 그 이상에서는 50퍼센트 더 저렴하다는 것입니다. 이는 한쪽 열이 아니라 두 열을 모두 읽으면 Anthropic 자체 문서가 제시하는 바로 그 구분입니다. 그 단일 퍼센트는 틀린 것이 아닙니다. 그것은 해당 조건 없이 제시된 숏 티어 퍼센트입니다.
반대 방향으로 작용하는 두 번째 요인이 있으며, 이쪽이 더 흥미롭습니다. 놓치기 쉽고 피해 가기 어렵기 때문입니다. Claude Haiku 5.5에는 새로운 토크나이저가 탑재되어 있는데, Anthropic 자체 지침은 특정 텍스트에 대한 토큰 수를 같은 내용에 대해 Haiku 4.5가 산출한 것보다 약 30퍼센트 더 높게 잡습니다. 토큰당 지불하던 금액은 내려갔지만, *당신의* 텍스트 토큰당 지불하는 금액은 예전 모델의 계산 방식에 비해 약 3분의 1 올랐습니다. Anthropic이 밝힌 순 수치, 즉 이 모델이 평균적으로 약 75퍼센트 더 저렴하게 실행된다는 수치는 이미 이를 반영하고 있습니다 — 90퍼센트의 정가 인하에서 약 30퍼센트의 토큰 부풀림을 빼면 짧은 컨텍스트 트래픽에서 그 근방에 놓입니다 — 하지만 두 효과는 분리 가능하며 분리해 볼 가치가 있습니다. 가격 변동은 페이지에서 읽어낼 수 있는 정가 변경입니다. 토크나이저 변동은 기존 프롬프트가 그 가격의 단위를 얼마나 많이 소비하는지를 바꾸며, 다른 어디에서보다 먼저 당신 자신의 토큰 집계에서 드러납니다.
호출당 100,000토큰 미만에서 이미 여유롭게 운영되어 온 워크로드라면, 실질적인 효과는 호출당 비용의 곧바른 절감이며, 이는 토크나이저로 인해 부분적으로 상쇄됩니다. 그렇지 않은 워크로드라면, 긴 절반에서는 계산이 두 번 반대 방향으로 흘러갑니다.
실제로 100,000 토큰 위에는 무엇이 있나요
롱컨텍스트 가격 책정을 "에이전트 코딩과 RAG, 우리 것은 아님"으로 분류하는 반사적 반응이 든다. 하지만 그건 너무 성급하다. 100,000토큰 기준선은 요청당 기준선이고, 요청당 크기는 작업 크기와 같은 것이 아니기 때문이다. 몇몇 패턴은 일상적으로 이 선을 넘는다:
• 단계마다 다시 검색하는 대신 세션 전반에 걸쳐 큰 작업 집합을 컨텍스트에 유지하는 코드베이스 읽기 에이전트
• 입력이 긴 PDF와 그 자체의 지침 및 퓨샷 예시인 문서 및 계약 분석 — 누군가 예시를 추가하기 전에는 60,000토큰이었던 종류의 프롬프트
• 많은 작은 항목을 한 번의 호출로 배치 처리하여 호출당 오버헤드를 분산시키고, 그렇게 함으로써 전체 배치를 임계값 너머로 넘겨버리는 수집 파이프라인
• 전체 대화 기록을 요약하지 않고 인라인으로 유지하여, 요청이 무언가에 의해 잘릴 때까지 단조 증가하는 채팅 제품
• 오디오 및 장시간 비디오 전사 스타일 입력 — 이는 바로 100만 토큰 윈도우가 지원한다고 홍보되는 바로 그 트래픽이다
100만 토큰 컨텍스트 윈도우는 이 스펙 시트에서 그 절벽을 이야기할 가치가 있게 만드는 부분이다. Anthropic은 모델에 아주 큰 요청을 건넬 수 있는 능력을 판매하고 있으며, 가격은 그 요청의 마지막 900,000개 토큰이 처음 100,000개 토큰에 드는 비용의 5배가 들도록 구조화되어 있다. 두 사실 모두 의도된 것이며, 단지 서로 다른 곳에서 발표되었을 뿐이다. 롱 컨텍스트 윈도우 때문에 애초에 이 모델을 보고 있는 것이라면, 롱 컨텍스트 열이 당신의 열이고, 출시 비율은 다른 누군가의 것이다.
가격이 Flash tier에 가하는 압박
Anthropic이 이 모델에 대해 밝힌 의도는 스택에서 저렴하고 처리량이 높은 쪽을 담당하겠다는 것이며, 가격표는 그 의도를 분명히 반영한다. Bloomberg의 출시 관련 보도는 이를 Anthropic이 더 저렴한 오픈웨이트 경쟁자들에 맞서 자사의 저비용 위치를 지키는 것으로 묘사했고, 벤더 측의 표현은 더 나아가 — 새로운 Haiku가 직접 경쟁사들을 큰 폭으로 밑도는 가격으로 책정되었다는 것이었다.
비교는 단기 구간에서만 명확한데, 여기서 $0.10과 $0.50은 공격적으로 낮은 수준이다. 100,000 토큰을 넘으면 $0.50과 $2.50 요율은 더 이상 누구의 단기 구간 요금도 밑돌지 않는다. 그저 평범한 중간 구간 숫자일 뿐이다. 공급업체의 "넓은 마진" 주장은 요금표의 첫 번째 열에 대한 진술이며, Anthropic은 거기에서 그렇게 주장할 자격이 있다. 그것은 자사가 공개하는 숫자에 대한 정확한 해석이다. 이는 장문 컨텍스트 워크로드가 지불하는 금액에 대한 주장이 아니며, 그렇게 인용되어서는 안 된다.
모델의 나머지 부분, 간략히
Claude Haiku 5.5는 크기 등급에 맞춰 기능을 축소하는 대신 Sonnet 및 Opus 라인에 탑재된 기능을 그대로 유지합니다. 기본 effort 설정이 medium인 적응형 사고가 포함되어 있으며, Low부터 Max까지 조절 가능한 effort 다이얼을 갖춘 Haiku 등급 최초의 모델입니다. 지식 컷오프는 2026년 6월이고 모델 ID는 claude-haiku-5-5입니다. Anthropic은 지원 종료일을 2027년 10월 7일보다 이르지 않은 날로 명시하며 — 출시일과 같은 날짜에서 1년 뒤입니다 — 이 모델은 Anthropic 자체 API와 함께 Amazon Bedrock, Google Cloud, Microsoft Azure에 등록되어 있습니다.

벤치마크 측면에서는, 출시 게시물의 모든 내용이 동일한 출처 표기를 달고 있으며 그럴 만합니다: 이는 공급업체가 보고한 수치이고, 모델을 판매하는 회사가 측정한 것이며, 작성 시점 기준으로 독립적인 재현 결과는 공개되지 않았습니다.
• GDPval-AA v2.1 — Claude Haiku 5.5는 공급업체 보고 기준 1,620으로, 동일한 하네스에서 Haiku 4.5의 735와 대비됩니다
• AA-Briefcase v1.1 — 공급업체 보고 기준 1,578건, 이전 세대는 614건
• OSWorld 2.1 — 공급업체 보고 기준 72.4퍼센트, 15.7퍼센트와 대비
• Terminal-Bench 4.0 — 공급업체 보고 기준 39.2, 0.0 대비
• Humanity's Last Exam — 밴더 보고 기준 45.9퍼센트, 도구 사용 시 57.4
그 델타의 크기야말로 그것을 그대로 인용하기보다 주의 표시를 달아야 하는 이유다. 모델 자체 벤더가 측정한 OS 에이전트 벤치마크에서 15.7에서 72.4로의 도약은, 제3자가 동일한 하네스를 돌리기 전까지는 느슨하게 붙잡아야 할 수치다. Artificial Analysis는 2026년 10월 초 기준으로 해당 모델에 대한 자체 지수를 발표했다 — 독립적인 수치 43.395이며, Terminal-Bench Hard에서 0.329, HLE에서 0.444를 기록했다 — 그리고 그 주장이 반박을 견뎌야 할 때 인용해야 하는 것은 바로 이 수치 집합이다. 벤더 수치와 독립 수치는 서로 충돌하지 않는다. 그것들은 그저 서로 다른 하네스일 뿐이며, 이 둘을 한 문장에 섞는 것이 바로 블로그 글이 벤더 평가를 사실이라고 단언하게 되는 방식이다.
인프라 관련 노트는, 우리가 하나를 운영하고 있으니
Anthropic은 Claude Haiku 5.5를 자체 API와 Bedrock, Google Cloud, Azure를 통해 판매합니다. 그중 어디로 호출할지 결정 중이거나, 이미 스택에 있는 다른 모델 옆에 이것을 추가하려는 경우, 판매처가 어디든 공급업체 정가가 동일하며, OrcaRouter는 해당 정가를 마크업 없이 그대로 전달하도록 만들어졌습니다. 따라서 이 모델에 대한 Anthropic의 가격 변동은 지연이 아니라 같은 날 우리 쪽에서도 반영됩니다. 우리 카탈로그에는 또한 qwen/qwen3.8-flash가 백만 토큰당 $0.15 및 $0.47, z-ai/glm-5.3-flash가 $0.15 및 $0.50에 제공되며, 이 둘은 Haiku급 모델 옆자리에 가장 자주 들어가는 조합으로, 동일한 키와 동일한 청구서로 이용할 수 있습니다. 이는 혼합 스택의 비용을 세 개가 아닌 하나의 계약으로 처리하게 해줍니다. 우리는 Claude Haiku 5.5 자체는 제공하지 않습니다. 그 모델이 필요하면 Anthropic을 직접 호출하세요.
절벽(cliff)의 한 가지 실용적 귀결은, 둘 이상의 모델로 라우팅할 경우 100,000토큰 경계가 바로, 요청 내용에는 아무것도 달라진 게 없는데도 예전에는 저렴했던 요청이 비싸지는 지점이라는 점입니다. 라우팅 계층이 장애 조치를 할 수 있다면, 임계값 위에서는 저렴한 모델로 긴 컨텍스트 트래픽을 계속 보내고 임계값 아래에서는 저렴한 모델로 짧은 컨텍스트 트래픽을 흘려보내는 구성이 바람직합니다. 한 모델의 대표 요금이 두 경우 모두에 적용된다고 가정하기보다는요.
런칭에서 얻을 수 있는 것
가격 인하는 실재하며, 100,000 토큰 미만에서는 그 폭도 크다. 이 모델은 완전히 출시된 기능 세트와 에포트 다이얼을 갖춘 첫 Haiku이며, 이는 에이전트 사용에서 가격보다 더 중요하다. 벤치마크 차이는 벤더가 보고한 수치이므로, 언급할 때마다 그렇게 표기해야 한다. 그리고 가격표에는 100,000 토큰에서 모든 요율을 한꺼번에 5배로 곱하는 단계가 있다 — 이는 이번 출시에 관해 보도자료를 읽는 사람이 아니라 여러분의 스택을 읽는 사람이 다음 스프린트의 토큰 예산이 정해지기 전에 가장 알아야 할 바로 그 한 가지다.
자체 트래픽과 계산을 대조해 확인하고 싶다면, 확인해야 할 두 숫자는 요청 크기의 95번째 백분위수와 100,000 토큰 초과 요청에 대한 지출 비중입니다. 첫 번째가 기준선 아래라면 90퍼센트가 당신에게 적용되며, 출시 관련 보도는 당신의 상황을 정확히 짚은 것입니다. 두 번째가 청구서에서 의미 있는 부분을 차지한다면, 중요한 숫자는 50이며, 스택에서 선택한 모델이 무엇이든 90을 가정하고 비용 추정을 다시 실행해 볼 가치가 있습니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
