
Claude Haiku 5.5는 중국의 플래시 티어를 겨냥했다. 그 주장은 검증에서 절반만 살아남았다.
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
중국어로 글을 쓴 한 독자가 이번 주에 날카로운 주장을 펼쳤습니다: Claude Haiku 5.5는 중간급 중국 시장을 차지하기 위해 만들어진 것으로 보입니다. 왜냐하면 그것은 DeepSeek V4.1 Flash와 GLM 5.3 Flash를 가격 면에서 밑돌고 Terminal Bench 4.0과 Artificial Analysis Intelligence Index에서 GLM 5.3 Flash보다 높은 점수를 받기 때문입니다. 이는 대부분의 출시 관련 논평보다 더 날카로운 분석입니다. 또한 이는 하나의 외투를 입은 두 가지 주장이며, 두 주장은 같은 정도의 진실성을 지니고 있지 않습니다.
Anthropic은 2026년 10월 7일 Claude Haiku 5.5를 출시했습니다 — 날짜가 명시된 발표와 시스템 카드, 공개된 요금표를 갖춘 전면 공개 출시였습니다. 이는 그 주장에 간접적인 시장 논평이 좀처럼 얻지 못하는 것을 제공합니다: 바로 확인할 수 있는 숫자입니다.
아래 감사는 한쪽 절반이 독자가 말한 것보다 더 강하고, 다른 쪽 절반은 감사가 인용하는 특정 벤치마크에서 틀렸다고 본다. 두 발견 모두 알아 둘 가치가 있는데, 서로 반대 방향을 가리키기 때문이다.
정확하게 진술된 주장
구성 요소만 남기고 보면, 그 논증은 세 가지 부분으로 이루어져 있다.
• 가격 — Claude Haiku 5.5는 DeepSeek V4.1 Flash보다 저렴하고, GLM 5.3 Flash보다도 저렴합니다.
• 독립 점수 — Artificial Analysis Intelligence Index에서 GLM 5.3 Flash보다 약 1점 위에 있습니다.
• 코딩 벤치마크 — 또한 Terminal Bench 4.0에서 GLM 5.3 Flash보다 1점 더 높은 점수를 기록합니다.
그중 두 가지는 공표된 표와 대조해 확인할 수 있으며, 조정을 가하면 그대로 성립한다. 세 번째는 같은 표와 대조해 확인할 수 있지만, 설명된 것과는 다르게 나온다.

가격 부분은: 사실이며, 한 방향으로는 축소되어 있고 다른 방향으로는 과장되어 있다
Anthropic이 공개한 Claude Haiku 5.5의 요금은 최대 100,000토큰 프롬프트까지 입력 토큰 100만 개당 $0.10, 출력 토큰 100만 개당 $0.50이며, 해당 임계값을 초과하면 각각 $0.50와 $2.50로 상승합니다. 캐시된 입력은 읽기 $0.01, 쓰기 $0.125입니다. 컨텍스트 윈도는 100만 토큰이고 최대 출력은 128,000입니다.
Z.ai의 GLM 5.3 Flash는 $0.15 및 $0.50로 책정되어 있으며, 캐시된 입력은 $0.026입니다. DeepSeek V4.1 Flash는 $0.30 및 $1.20로 책정되어 있으며, 캐시된 입력은 $0.006입니다.
대표 요금만 놓고 보면 독자의 지적이 맞다. 입력 요금 $0.10은 GLM 5.3 Flash보다 3분의 1 낮고 DeepSeek V4.1 Flash보다 3분의 2 낮으며, 출력 요금 $0.50은 GLM 5.3 Flash와 정확히 일치하면서 DeepSeek의 출력 요금 절반에도 훨씬 못 미친다. 이는 의도적으로 보이는 안착이다. 더 저렴한 경쟁자의 출력을 맞추고, 입력에서 앞서며, 비율이 알아서 말하게 하는 것이다.
주장에 더 유리해지는 부분은 완료된 작업당 측정된 비용이다. Artificial Analysis의 Intelligence Index v4.3.2에서 전체 작업 비용은 Claude Haiku 5.5의 경우 $0.21, GLM 5.3 Flash는 $0.25, DeepSeek V4.1 Flash는 $0.27로 나온다. 요금표는 Claude Haiku 5.5가 입력 기준으로 GLM 5.3 Flash보다 1.5배 더 저렴하다고 말하지만, 측정 결과로는 완료된 작업이 약 6분의 1 더 저렴하다. 여전히 셋 중 가장 저렴하다 — 다만 가격표가 시사하는 만큼의 차이는 아니다.
그 이유는 대부분의 가격 비교가 빠뜨리는 바로 그것이다. Claude Haiku 5.5는 장황하다. Artificial Analysis는 Index를 실행하는 동안 이 모델의 출력 토큰을 162,164개로 기록했는데, 이는 GLM 5.3 Flash의 68,673개, DeepSeek V4.1 Flash의 88,574개와 대비된다. Anthropic의 자체 문서는 두 번째 효과를 덧붙인다: 이 모델은 Claude 4.7 및 이후 모델과 공유되는 더 새로운 토크나이저를 사용하므로, 같은 텍스트가 대체하는 모델보다 대략 30% 더 많은 토큰으로 집계된다. 더 저렴한 단가가 더 많은 토큰에 적용되는 것은 더 저렴한 단가가 더 많은 토큰에 적용되는 것이다.
라우팅된 청구서에서만 드러나는 한 가지 변수: 자체 카탈로그에는 DeepSeek V4.1 Flash가 입력 $0.15, 출력 $0.60으로 등재되어 있으며, 하루 두 개의 시간대인 UTC 01:00–04:00와 06:00–10:00에 2× 배수가 적용됩니다. 하루 18시간 동안은 이것이 기본 요금이고, 하루 6시간 동안은 출력 요금이 $1.20입니다. 해당 시간대를 피해 스케줄할 수 있는 배치 트래픽은 공급업체의 대표 정가가 시사하는 것보다 실질적으로 더 나은 DeepSeek 가격을 받지만, 대화형 트래픽은 그렇지 않습니다. 이 비교를 실제로 모델링한다면, 요금표만큼이나 달력도 중요합니다.

점수 절반: "약 1점"은 1.6이다
Artificial Analysis Intelligence Index v4.3.2에서 Claude Haiku 5.5는 Max 구성으로 43.40으로 측정됩니다. GLM 5.3 Flash는 41.81로 측정됩니다. DeepSeek V4.1 Flash는 39.46을 기록합니다.
그래서 주장에서 지수 부분은 방향상 맞고 내림 처리된다: 격차는 1점이 아니라 1.59점이다. 그것은 60대까지 올라가는 지수에서 실제 우위이며, 이 맞대결의 모든 요약에서 인용되는 숫자다.
이것이 아닌 것은 그 아래에 깔린 벤치마크에 대한 주장이다. 두 공급업체는 모두 자체 평가 세트를 공개하며, 그 세트들은 서로 같지 않다 — Anthropic은 Claude Haiku 5.5에 대해 GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 및 FrontierCode를 보고한다; Z.ai는 GLM 5.3 Flash에 대해 자체 스위트를 보고한다. 독립 보드는 이용 가능한 유일한 동일 기준 비교 행이며, 바로 이 점 때문에 지수 격차에 그토록 크게 의존하게 되고 다음 섹션이 중요해진다.
코딩 쪽은: 이건 완전한 무승부이며, 승리가 아닙니다.
Terminal Bench 4.0은 공유된 독립 측정에서 Claude Haiku 5.5에 대해 0.32828, GLM 5.3 Flash에 대해 0.32828을 기록합니다. 소수점 다섯 자리까지 동일합니다.
이 대결에서 단연 가장 인용하기 좋은 숫자가 바로 이것인데, 그 주장은 이 숫자에 대해 틀렸습니다. 혼동의 유력한 원인은 바로 옆 줄입니다. Flash가 아닌 형제 모델인 정식 GLM-5.3은 같은 벤치마크에서 0.4192점을 기록합니다. "GLM"과 "Terminal Bench"가 Claude Haiku 5.5보다 1점 높은 숫자 옆에 한 문장으로 함께 보였다면, 그것은 Flash가 아니라 형제 모델입니다.
Artificial Analysis가 두 모델 모두에 대해 공개하는 나머지 세 행은 동점보다 더 흥미롭고, 어느 한쪽을 가리키지도 않습니다:
• SciCode — Claude Haiku 5.5가 0.5498, GLM 5.3 Flash가 0.5162를 기록했습니다. Anthropic에 3.4포인트 우위입니다.
• Humanity's Last Exam — 0.4439 대 0.3985. Anthropic이 4.5점 우위.
• AutomationBench, 부분 점수 — 0.3541 대 0.6037. GLM 5.3 Flash에 25점 우위이며, 이 세트에서 단연 가장 큰 격차입니다.
마지막 행은 조달 팀이 가장 주목할 항목입니다. 에이전트형 자동화야말로 중간급 모델이 실제로 배포되는 분야이기 때문입니다. 모델이 여러 단계로 이루어진 작업을 끝까지 완수할 수 있는지를 측정하는 지표에서는, 실행 비용이 더 저렴한 오픈 웨이트 모델이 반대 방향의 1.6포인트 지수 차이를 무색하게 만들 만큼 큰 격차로 앞섭니다.
속도는 가격이 갈리는 방식과 똑같이, 아니 그보다 더 극명하게 갈린다. Artificial Analysis가 측정한 Index 작업당 소요 시간은 Claude Haiku 5.5가 424.6초, GLM 5.3 Flash가 1035.4초였다. Anthropic의 모델은 절반도 안 되는 실제 경과 시간에 도달하는데, 이는 에이전트 루프에서 토큰 속도보다 더 큰 운영상 수치다.
주장이 완전히 빠뜨리고 있는 것
이 비교는 가격과 점수에 관한 이야기로 짜여져 있어, 두 모델이 가장 서로 닮지 않은 측면을 조용히 건너뛴다. GLM 5.3 Flash는 오픈 웨이트이며 MIT 라이선스로 공개되었고, 총 파라미터 수는 3,200억 개, 활성 파라미터는 180억 개다. DeepSeek V4.1 Flash 역시 오픈 웨이트로 총 5,520억 개, 활성 160억 개다. Claude Haiku 5.5는 독점 모델이며 API 전용이고, 공개된 파라미터 수와 리포지토리가 없다.
그것은 많은 구매자에게 각주가 아니라 요구사항 문서의 첫 줄이다. 자체 테넌시에서 추론을 실행하거나, 파인튜닝하거나, 모델 버전을 수년간 고정해야 하는 팀은 애초에 지수 점수로 이 셋 중에서 고르는 것이 아니다 — 셋 중 둘은 가격 열을 읽기도 전에 탈락한다. 독자의 프레이밍은 시장 포지셔닝에 관한 관찰이며 타당하다. 다만 그 프레이밍이 옹호하는 모델에 구조적 차이가 불리하게 작용할 뿐이다.
직접 비교 실행하기
GLM 5.3 Flash와 DeepSeek V4.1 Flash는 모두 OrcaRouter 카탈로그에 공급자 정가, 0% 마크업으로 올라 있습니다. 따라서 이 비교의 중국 쪽은 스프레드시트에서 모델링할 대상이 아니라 오늘 바로 호출할 수 있는 대상이 됩니다. 요율이 블렌딩되지 않고 그대로 전달되기 때문에, 공급자의 가격 변동은 그쪽에 반영되는 당일에 우리 쪽에도 그대로 반영됩니다. 그리고 위에서 설명한 달력 기반 DeepSeek 윈도우는 라우팅 기준으로 삼게 될 동일한 가격 블록에서 확인할 수 있습니다. 키 하나, SDK 하나, 자동 페일오버가 그 아래에 있으며, 비용 상한을 애플리케이션 코드가 아니라 라우트에서 표현하고 싶다면 라우팅 DSL을 쓰면 됩니다.
Claude Haiku 5.5는 우리 카탈로그에 없습니다. Anthropic 자체 API를 통해 접근할 수 있으며, 이를 암시로 남기기보다 분명히 밝히는 편이 낫습니다.

독자가 제대로 짚은 것, 그리고 그것을 어떻게 다룰 것인가
본능은 타당하다. 값싸고 유능한 중국 중급 모델의 물결을 비싸 보이게 만들고 싶었다면, 대략 이런 카드를 꺼내 들었을 것이다: 더 저렴한 경쟁 모델의 출력 요금을 맞추고, 입력 요금은 절반으로 줄이고, 지수에서 1.6포인트 앞서며, 완료된 작업당 가격 수치가 논거를 이끌게 하는 것. Claude Haiku 5.5는 그렇게 한다. 그리고 목표로 삼은 모델보다 작업당 두 배 이상 빠르면서 그렇게 해낸다.
독자가 잘못 짚은 부분은 더 좁고 더 흥미롭다. Terminal Bench 4.0은 승리가 아니라 정확히 무승부다. 토큰이 아니라 작업 전체에 값을 매기고 나면 가격 우위는 요율표가 시사하는 1.5배가 아니라 약 6분의 1이다. 그리고 두 모델의 격차가 가장 큰 벤치마크는 에이전트형 벤치마크로, 여기서 GLM 5.3 Flash가 25점 앞선다.
그러니 그 주장의 정직한 버전은 이렇다: Claude Haiku 5.5는 중국 플래시 등급을 겨냥하고 있으며, 종합 지수, 완료된 작업당 비용, 지연 시간에서는 그 비교에서 앞서지만, 에이전트형 자동화나 개방성에서는 앞서지 못하며, 그 논증을 결정적인 것처럼 느껴지게 했던 특정 코딩 벤치마크 우위는 존재하지 않는다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
