'Daily AI Brief — 2026년 10월 8일'이라고 적힌 생성된 히어로 카드에 NEWS 배지, 'Claude Haiku 5.5 출시, Sonnet 5.5 캐시 읽기 절반으로'라는 헤드라인, 그리고 1M당 $0.10 / $0.50, 1M 토큰 컨텍스트, 기본 Medium 노력 수준, 캐시 읽기 $0.20 → $0.10이라고 적힌 네 개의 칩이 있습니다.
Engineering & Research

일일 AI 브리핑, 10월 8일: Claude Haiku 5.5, $0.10에 출시, Sonnet 5.5 캐시 읽기 절반으로 감소

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Claude Haiku 5.5는 2026년 10월 7일에 출시되었으며, 회사가 API로 제공한 것 중 가장 저렴한 제품입니다: 최대 100,000 토큰의 프롬프트에서 백만 입력 토큰당 $0.10, 백만 출력 토큰당 $0.50이며, 1M 토큰 컨텍스트 창과 Low에서 Max까지 조절 가능한 노력 다이얼을 갖추고 있습니다. 같은 날, 자체 출시 게시물 없이 Claude Sonnet 5.5의 프롬프트 캐시 읽기 가격이 백만 토큰당 $0.20에서 $0.10으로 인하되었습니다. 그중 하나는 제품이고 다른 하나는 비용 항목이며, 이번 분기에 더 많은 돈을 움직일 것은 바로 그 비용 항목입니다.

먼저 가격입니다. 오늘 당장 조치할 수 있는 부분이니까요. 그다음은 노력입니다. 가격을 조용히 결정하는 요소죠. 그다음은 캐시 요금 인하입니다. Sonnet 5.5에 비용을 지불하는 사람들 중 절반은 다음 청구서를 받을 때까지 이 얘기를 듣지 못할 겁니다.

Claude Haiku 5.5란 무엇인지, 중요한 순서대로

벤더 측의 설명은 "우리가 지금까지 출시한 것 중 가장 저렴하고 가장 빠르며 가장 뛰어난 성능의 소형 모델"이며, 출시일은 이 브리핑 하루 전인 2026년 10월 7일입니다. 모델 ID는 claude-haiku-5-5입니다. 텍스트와 이미지를 입력받아 텍스트를 출력합니다. 컨텍스트 윈도우는 Claude Haiku 4.5의 200,000개에서 늘어난 1,000,000 토큰이며, 최대 출력은 128,000 토큰이고, Batch API에서 베타 헤더를 사용하면 300,000까지 늘어납니다. 학습 데이터 기준 시점은 2026년 6월이며, Anthropic은 2027년 10월 7일 이전에는 이 모델을 지원 종료하지 않겠다고 약속합니다.

트래픽을 라우팅하는 사람에게 가장 중요한 부분은 컨텍스트 윈도우가 아니다. 바로 이 모델이 조정 가능한 effort를 갖춘 최초의 Haiku급 모델이라는 점이다. Effort는 Low, Medium, High, Xhigh, Max로 작동하며 기본값은 Medium이고, 적응형 사고가 기본으로 켜져 있다 — Sonnet과 Opus의 기능이 한 단계 아래 등급으로 내려온 것이다. 출시 게시물에는 구축보다 구매에 관한 두 가지 내용도 담겨 있다: Claude Max 및 Team 플랜을 위한 월간 API 크레딧으로, Max 5x에서는 $100, Max 20x에서는 $200이며 Team의 경우 최대 $500까지 합산된다. 그리고 SDK의 베타 computer-use 및 browser-use 지원이다. 안전성도 이 등급에 발맞춘다: 사이버 보호 조치는 Claude Haiku 4.5의 것보다 더 엄격하며 침투 테스트 요청은 여전히 차단되고, 생물학 보호 조치는 Claude Sonnet 5, Claude Sonnet 5.5, Claude Opus 5의 것과 동일하다.

A capture of Anthropic's Claude Haiku 5.5 announcement page showing the October 7, 2026 date, the headline framing Claude Haiku 5.5 as a performance, pricing and safety upgrade, and the on-page sections for Performance, Pricing, Safety and Further updates.

가격, 그리고 그 한가운데에 있는 100,000토큰 절벽

대표 요금은 입력 토큰 백만 개당 $0.10, 출력 토큰 백만 개당 $0.50입니다. 별표를 확인하세요: 이는 100,000 토큰 이하의 프롬프트에 적용되는 요금입니다. 100,000을 초과하면 두 수치 모두 5배가 되어 입력 $0.50, 출력 $2.50이 됩니다. 캐시 쓰기는 저렴한 구간 내에서 5분 등급이 백만 개당 $0.125, 1시간 등급이 $0.20이며, 캐시 읽기는 백만 개당 $0.01입니다 — 입력 요금의 10분의 1로, 이는 Anthropic이 어떤 모델에서든 공개한 가장 큰 캐시 할인입니다. 배치는 모든 요금을 다시 절반으로 줄입니다: 저렴한 구간 내에서는 $0.05와 $0.25, 그 이상에서는 $0.25와 $1.25입니다.

그것을 Claude Haiku 4.5와 비교해 보세요. Claude Haiku 4.5는 여전히 가격표에 입력 $1.00, 출력 $5.00의 고정 요율로 올라 있고, 컨텍스트 기반 계층화가 없으며, 캐시 읽기는 $0.10, 창은 200,000토큰입니다. 새 모델은 동일한 프롬프트 형태에서 가격이 10분의 1이고, 컨텍스트는 5배입니다. 여기에는 마이그레이션 계산을 돌릴 필요가 없습니다. 산수는 비교가 되지 않습니다.

절벽은 설계에서 반드시 고려해야 할 부분이다. 99,000토큰 프롬프트는 입력 요율로 천 회 호출당 99센트가 든다. 101,000토큰 프롬프트는 천 회당 $5.05가 든다. 2,000토큰 차이가 청구액 5배를 만드는 것이므로, 저렴한 구간에서 구축하는 것은 무엇이든 100,000토큰보다 넉넉히 낮게 유지하거나, 의도적으로 일관되게 초과해야 한다. 최악의 결과는 그 경계에 걸쳐 있어 트래픽의 절반에 높은 요율을 지불하는 파이프라인이다.

Effort는 이제 가격 책정 매개변수이며, 기본값은 가장 저렴한 옵션이 아닙니다.

effort는 기본값이 Medium이고 thinking은 기본적으로 켜져 있기 때문에, 표시 가격과 실제 가격은 같은 숫자가 아니다. 추론 토큰은 출력 토큰으로 청구된다. Anthropic이 자체 공개한 Artificial Analysis Intelligence Index 실행에서 — 벤더가 보고한 것이며, 우리가 재현한 것은 아님 — Claude Haiku 5.5는 작업당 약 162,000개의 토큰을 출력하며, 그중 약 129,000개가 추론이다. 이 지수의 중앙값 모델은 전체 스위트에서 약 1억 개의 토큰을 출력한다. Haiku 5.5는 4억 4천만 개를 소비한다. 출력 토큰 100만 개당 $0.50라면 그 장황함은 감당할 만하며, 바로 그게 핵심이다. Haiku 5.5의 요율에서는 출력에 $5.00을 청구하는 모델에서 조금 생각하는 것보다 많이 생각하는 편이 여전히 더 저렴하다.

빠른 답변을 원하고 신중한 답변은 원하지 않는 분류, 추출 및 라우팅 결정에는 effort를 Low로 설정하고, 사용자가 읽을 모든 항목에는 Medium으로 두세요. Low로 낮추는 것은 또한 장황한 에이전트를 100,000 토큰 범위 내로 유지하는 신뢰할 수 있는 방법입니다. 왜냐하면 답변 품질을 떨어뜨리기 전에 추론 토큰을 줄이기 때문입니다.

더 조용한 소식: Sonnet 5.5 캐시 읽기 절반으로 감소

Claude Sonnet 5.5는 10월 7일 기준으로 백만 토큰당 $0.10에 캐시된 프롬프트를 읽으며, 이는 $0.20에서 인하된 것이다. Sonnet 5.5의 입력 가격은 $2.00이고 출력은 $10.00이므로, 0.05x 캐시 읽기 배수는 이제 Haiku 5.5가 가진 것과 동일한 배수이며, 20배 더 큰 입력 요율에 적용된다. Anthropic 자체 추정에 따르면 이는 대부분의 에이전트 작업 비용을 약 20% 절감하는데, 이는 벤치마크가 아니라 워크로드 형태에 관한 주장이다: 입력의 상당 부분이 매 턴마다 다시 보내는 안정적인 프리픽스일 때만 성립한다. 프롬프트가 호출할 때마다 고유하다면, 이 변경은 비용을 들이지도, 절약해 주지도 않는다.

이번 인하가 무엇을 의미하는지 주목할 만하다. Anthropic은 아주 저렴한 소형 모델을 출시하는 바로 그 시점에 중간 등급 모델에서 장기 지속 프리픽스에 공격적으로 가격을 책정하고 있는데, 이는 두 모델 아키텍처, 즉 판단이 필요한 작업을 위한 핫 캐시가 달린 Sonnet 5.5 레그와 그렇지 않은 물량을 위한 Haiku 5.5 레그를 지지하는 논거로 읽힌다.

독립적인 수치가 보여주는 것, 하루 만에

Artificial Analysis는 Claude Haiku 5.5를 출시 다음 날 평가했다. Intelligence Index는 전체 43을 기록했으며, Max-effort 구성은 43.40으로 보고되어 리더보드에서 243개 모델 중 2위를 차지했다. 인덱스 작업당 비용은 $0.21로 46번째로 저렴하다. 입력 대 캐시된 입력 대 출력의 7:2:1 혼합 비율에서 혼합 가격은 백만 토큰당 $0.08이며, 이는 앞선 티어 비교가 다른 모든 것에 불공평하게 느껴지게 만드는 수치다. 출력 속도는 초당 243.4 토큰으로 리더보드에서 9번째로 빠르며, 보고된 첫 토큰 지연 시간은 약 0.3초이고 90% 캐시 할인이 적용된다.

그 4억 4천만 토큰 출력 수치는 43점에 딸린 단서다. 점수는 실제이며 독립적으로 실행된 것이고, 장황함도 마찬가지다. 이만큼 생각하는 모델은 토큰당으로는 저렴하지만 작업당으로는 항상 저렴하지는 않으며, 그 두 숫자 사이의 간극이 바로 라우팅 결정이 실제로 자리하는 곳이다.

규모를 가늠하기 위해 말하자면, Anthropic이 직접 공개한 비교에서 Claude Haiku 5.5는 GDPval-AA v2.1에서 1620을 기록한 반면 Claude Haiku 4.5는 735였고, OSWorld 2.1에서는 72.4% 대 15.7%, 도구 없이 치른 Humanity's Last Exam에서는 45.9% 대 10.2%, Terminal-Bench 4.0에서는 39.2% 대 0.0%였습니다. 이는 벤더가 보고한 수치이며 벤더가 선택한 평가에 기반하므로 방향성으로 읽어야 하지만, 그 방향은 결코 미묘하지 않습니다 — 이것은 작은 모델에 대한 작은 업그레이드가 아닙니다.

A generated single-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' listing an Artificial Analysis Intelligence Index of 43 ranked second of 182, a cost per index task of $0.21, a blended price of $0.08 per million tokens, output speed of 243.4 tokens per second, a 1M-token context window and a $0.01-per-million cache read.

두 번째 계약 없이 이 모델들에 접근하기

Claude Haiku 5.5는 Anthropic 자체 API를 통해 제공되며, 그곳을 시작으로 Anthropic 모델이 재판매되는 모든 곳에서 이용할 수 있습니다. OrcaRouter 카탈로그에서 현재 Anthropic 라인업은 anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 그리고 anthropic/claude-fable-5.1 — 저희는 Claude Haiku 5.5를 호스팅하지 않으며, 이 글에서 그런 척할 생각도 없습니다. 저희가 실제로 제공하는 것은 그보다 한 단계 위 티어이며, OrcaRouter는 제공업체 정가를 0% 마크업으로 그대로 전달합니다. 그래서 Sonnet 5.5 캐시 읽기 가격 인하가 저희 가격표에 반영된 것은 예정된 가격 재조정 주기가 아니라 Anthropic이 발표한 바로 그날이었습니다.

실용적인 관점에서 보면, 분류 작업에는 Haiku 5.5를 써 보고 판단은 Claude Sonnet 5.5에 맡기고 싶다면, 키를 하나가 아니라 두 개를 들고 있는 셈이며, A/B는 라우팅 계층에서 결정됩니다. 이것이 바로 직접 통합 대신 게이트웨이를 쓰는 이유의 전부입니다 — 하나의 엔드포인트, 모델 문자열, 그리고 제공자가 흔들릴 때의 페일오버입니다.

A capture of the OrcaRouter models catalogue showing the filterable model list with input-modality, context-length, input-price, status and series filters, the line counting the model list and providers on one API key and one bill, and model cards carrying per-million input and output prices.

앞으로 지켜봐야 할 것

세 가지입니다. 제3자 제공업체들이 Haiku 5.5를 $0.10 미만의 블렌디드 요율로 재판매하기 시작하는지 여부입니다. 이는 라우팅 계층이 단순히 조달을 간소화하는 데 그치지 않고 제값을 하는 지점입니다. Anthropic이 100,000토큰 티어 경계를 확장하는지 여부입니다. 1M 토큰 창을 가진 모델이 정확히 100,000에 절벽을 두는 것은 이상한 일이기 때문입니다. 그리고 4억 4천만 토큰이라는 장황성 수치가 포인트 릴리스에서 내려가는지 여부입니다. 그 단일 숫자가 Haiku 5.5가 프로덕션 스택의 하위 절반 전체에서 확실한 기본값이 되는 것을 가로막고 있기 때문입니다.