'0.32828에서 동점'이라는 제목의 히어로 카드가 있고, 숫자 양옆에는 Claude Haiku 5.5와 GLM 5.3 Flash가 있으며, Terminal Bench 4.0 0.32828이라고 적힌 행, 43.40 대 41.81이라고 적힌 Index 행, 그리고 '같은 숫자, 다른 머신'이라는 부제가 있습니다.
Guides & Insights

Claude Haiku 5.5 vs GLM 5.3 Flash: 두 공급업체가 인용한 벤치마크에서 막상막하

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Run Claude Haiku 5.5 and GLM 5.3 Flash through Terminal Bench 4.0 and you get the same number: 0.32828 for both. Not close — identical, to five decimal places, on the benchmark that the vendor leads with in its own launch materials and that Z.ai's launch materials lead with too. For two models built on entirely different stacks, by vendors in different countries, released six weeks apart, that is a coincidence worth stopping on.

그것은 또한 결정을 내릴 때 기준으로 삼기에 잘못된 숫자다. 두 모델은 다른 모든 면에서 뚜렷하게 갈리고, 그 갈림의 패턴은 충분히 이례적이어서 어느 업체의 대표 주장을 읽든 그 방식을 바꿔야 할 정도다. 둘 중 하나는 종합 지수와 작업당 비용 수치에서 이긴다. 다른 하나는 실제 배포처럼 보이는 거의 모든 항목에서 이긴다.

그것들은 능력에 따라 구분되는 것이 아니다. 그것들은 형태에 따라 구분된다.

이것들이 같은 부류의 모델이라는 걸 알려주는 단 하나의 숫자부터 시작하세요.

• SciCode — Claude Haiku 5.5의 0.5498 대 GLM 5.3 Flash의 0.5162. Anthropic에 2점이 돌아가지만, 2점은 노이즈에 불과한 벤치마크에서다.

• Terminal Bench 4.0 — 0.32828 대 0.32828. 정확히 동점입니다.

• 컨텍스트 윈도우 — 둘 다 100만 토큰.

• 출력 가격, 첫 번째 구간 — 두 가지 모두 백만 토큰당 $0.50

네 개의 행, 네 개의 근사 일치. 여기서 멈췄다면 이 모델들이 서로 바꿔 쓸 수 있다고 결론 내리고 가격을 기준으로 선택했을 것이다. 그 결론은 틀렸을 것이며, 그 이유는 다음 행 묶음에 있다.

그들이 갈라지는 곳에서, 그 방향은

그들을 구분하는 행들은 흩어져 있지 않다. 그것들은 두 그룹으로 뭉치며, 각 모델이 한 그룹씩 완전히 차지한다.

에이전트 그룹은 GLM 5.3 Flash에 속한다. AutomationBench 부분 점수는 GLM 5.3 Flash가 0.6037, Claude Haiku 5.5가 0.3541로, 25포인트 차이이며, 이는 두 모델이 공유하는 어떤 측정 항목에서도 가장 큰 단일 차이다. Tau-Bench Banking은 GLM 5.3 Flash가 0.4722를 기록했고, Claude Haiku 5.5는 해당 항목에 공개된 수치가 없다. GPQA는 GLM 5.3 Flash가 0.9121이며, 여기서도 비교할 Anthropic 수치가 없다. 모델이 다단계 작업을 일관되게 유지하고 구조화된 영역 안에서 도구를 안정적으로 사용할 수 있는지를 측정하는 지표에서는, Z.ai의 모델이 반대 방향으로 나타나는 종합 지수 차이를 압도하는 격차로 앞서 있다.

종합 및 비용 부문은 Claude Haiku 5.5의 몫입니다. Artificial Analysis Intelligence Index v4.3.2는 43.40 대 41.81로, 1.59점 차이이며, 이 맞대결을 요약한 모든 자료에서 인용하는 수치입니다. 완료된 Index 작업당 비용은 $0.21 대 $0.25입니다. Index 작업당 실제 경과 시간은 424.6초 대 1,035.4초로, Anthropic의 모델이 절반도 안 되는 시간에 끝냅니다.

그것이 이 선택의 구도입니다. Claude Haiku 5.5는 더 빠르고, 완료된 작업당 더 저렴하며, 종합 점수에서 더 높습니다. GLM 5.3 Flash는 저렴한 모델이 구매되는 특정 작업 유형에서 더 안정적입니다.

A two-column scoreboard titled 'Claude Haiku 5.5 vs GLM 5.3 Flash - the scoreboard' with rows Terminal Bench 4.0 0.32828 against 0.32828, SciCode 0.5498 against 0.5162, Humanity's Last Exam 0.4439 against 0.3985, AutomationBench 0.3541 against 0.6037, Index v4.3.2 43.40 against 41.81 and cost per task $0.21 against $0.25, footed 'Both figures per Artificial Analysis v4.3.2; Terminal Bench 4.0 is an exact tie.'

어느 쪽을 믿어야 하나요?

어느 쪽도 그 자체만으로는 아니다 — 그리고 그 불일치 자체가 정보이다.

인텔리전스 인덱스는 추론, 과학, 코딩, 에이전트 범주를 가중 혼합한 지표입니다. 이는 "이 모델이 대략 얼마나 유능한가"를 하나의 숫자로 답하도록 설계되었고, 그 역할은 해냅니다. 하지만 이 지표가 할 수 없는 일은 1.59점 차이가 당신의 워크로드가 속한 범주에서 나온 것인지, 전혀 건드리지 않는 범주에서 나온 것인지 알려주는 것입니다. 여기서 앞선 점수는 상당 부분 SciCode와 Humanity's Last Exam 같은 항목에서 나옵니다 — 0.5498 대 0.5162, 그리고 0.4439 대 0.3985 — 반면 AutomationBench에서는 부호가 반대인 25점 격차가 있습니다.

터미널 루프에서 코딩 어시스턴트를 만드는 팀은 SciCode의 우위를 알아차릴 것이다. 은행 업무 워크플로를 처음부터 끝까지 완료해야 하는 에이전트를 만드는 팀은 AutomationBench의 격차를 알아차릴 것이고, 그것을 매일 알아차릴 것이다. 두 팀은 같은 지표를 보고 있으면서 상반된 결론에 도달해야 한다.

실용적인 접근은 종합 지표를 순위가 아니라 필터로 읽는 것입니다. 두 모델이 약 2 지수 포인트 이내에 있다면, 그 종합 지표는 두 모델이 같은 구간에 있다는 것만 알려줄 뿐 어느 쪽을 선택해야 하는지는 전혀 알려주지 않습니다. 그 시점에서 읽을 가치가 있는 행은 자신의 워크로드와 일치하는 행뿐이며, 벤더가 필요한 행을 공개하지 않았다면 그 부재 자체가 하나의 데이터 포인트이지, 가정으로 메워야 할 공백이 아닙니다.

비교표에 아무도 넣지 않는 토크나이저 항목

Anthropic의 자체 문서에는 Claude Haiku 5.5와 관련된 모든 가격 비교를 바꿔 놓는 한 문장이 있으며, 이는 쉽게 지나치기 쉽습니다. 이 모델은 Claude 4.7 및 이후 모델과 공유되는 최신 토크나이저를 사용하므로, 동일한 텍스트를 자신이 대체하는 모델보다 약 30% 더 많은 토큰으로 계산합니다.

그것을 요금표에 대조해 보면 계산은 스티커가 시사하는 것보다 덜 매력적이다. Claude Haiku 5.5의 입력 요금은 백만 토큰당 $0.10이고 GLM 5.3 Flash는 $0.15로, 1.5배의 우위다. 같은 프롬프트에 30% 더 많은 토큰이 필요하면 동일한 텍스트에 대한 실질적 우위는 상당히 줄어들지만 사라지지는 않는다. 출력 요금은 첫 번째 티어에서 $0.50으로 동일하므로, 토크나이저 효과가 상쇄할 것 없이 그대로 적용된다.

측정된 결과는 그 주장의 정직한 버전이다: Artificial Analysis 자체 산정에 따르면, Claude Haiku 5.5는 Index 작업당 162,164개의 출력 토큰을 생성했고 GLM 5.3 Flash는 68,673개였다 — 2.4배나 많다 — 그런데도 완료된 작업당 $0.21 대 $0.25로 나왔다. 요율 우위는 장황함을 견뎌내고, 그 남은 우위는 요율표가 말하는 것보다 작다.

이 둘 중 요율이 균일 요율로 명시된 것은 하나뿐이다. Claude Haiku 5.5의 가격은 프롬프트가 100,000 토큰을 넘으면 입력 $0.50, 출력 $2.50로 한 단계 올라가지만, GLM 5.3 Flash는 이에 상응하는 임계값이 공개되어 있지 않다. 대부분의 채팅 및 코드 지원 트래픽에서는 그 단계가 결코 적용되지 않는다. 장문 문서나 대형 컨텍스트 에이전트 작업에서는 그 단계가 늘 적용되며, 그 시점이 되면 비교는 1차 구간 수치가 시사하는 바를 훨씬 뛰어넘어 역전된다.

A capture of Anthropic's models-overview documentation table headed 'Lifecycle and reference', listing Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 with context windows, maximum outputs, prices per million tokens, latency and default effort, and showing Claude Haiku 5.5 as 'This model' at 1M context, 128K maximum output and 'From $0.10/$0.50'.

어떤 숫자들보다도 먼저 판가름하는 그 한 줄

위의 모든 내용은 이 두 모델 중에서 자유롭게 선택할 수 있다고 가정합니다. 상당수 팀은 그럴 수 없으며, 그 이유는 벤치마크 논의가 흔히 묻어 두는 단 하나의 스펙 표 행에 있습니다.

GLM 5.3 Flash는 오픈 웨이트이며 MIT 라이선스로 배포되었고, 총 파라미터 수는 3,200억 개에 활성 파라미터는 180억 개입니다. 다운로드, 자체 호스팅, 미세 조정, 양자화, 버전 고정이 가능하며 직접 통제하는 테넌시 안에서 실행할 수 있습니다. Claude Haiku 5.5는 독점 모델이자 API 전용으로, 공개된 파라미터 수와 라이선스, 리포지토리가 없습니다.

요구사항 문서에 모델이 자체 하드웨어에서 실행되어야 한다거나, 특정 체크포인트가 향후 3년 동안 호출 가능한 상태로 남아 있어야 한다고 적혀 있다면, 이 비교는 가격 열을 읽기도 전에 끝난 것입니다. 그것은 단순한 형식적 문제가 아닙니다. 그것은 팀들이 애초에 오픈 웨이트 중급 모델로 결국 가게 되는 가장 흔한 이유이며, AutomationBench에서의 25점 우위만이 Z.ai 쪽으로 끌어당기는 유일한 요인이 아닌 이유이기도 합니다.

이는 반대 방향으로도 작용하며, 여기에도 같은 정직함이 적용된다. Anthropic은 Claude Haiku 5.5에 대해 2027년 10월 이전에는 서비스를 종료하지 않겠다는 약속을 공개하고, 시스템 카드와 문서화된 평가 세트를 갖춘 퍼스트파티 API에서 이 모델을 제공한다. 오픈 웨이트 릴리스가 자동으로 더 오래 지속되는 것은 아니다 — 가중치와 함께 운영 부담도 물려받으며, 라이선스 파일은 지원 계약이 아니다. 그 둘 중 무엇을 원하는지는 모델에 관한 질문이 아니라 팀에 관한 질문이다.

경험적으로 결판내고 싶다면, 양쪽 모두 한 키에

GLM 5.3 Flash는 OrcaRouter 카탈로그에 Z.ai의 정가 그대로, 0% 마크업으로 등록되어 있으며, 혼합되지 않고 그대로 전달됩니다. 따라서 위 요율은 청구서에 적용되는 요율이며, Z.ai가 변경하는 사항은 같은 날 우리 쪽에 반영됩니다. Claude Haiku 5.5는 우리 카탈로그에 없으며 — Anthropic 자체 API를 통해 접근할 수 있습니다 — 이 점은 암시로 남겨두기보다 명확히 밝히는 편이 낫습니다.

카탈로그가 정말로 쉽게 만들어 주는 것은 이 맞대결이 실제로 요구하는 테스트의 형태다. 종합 지수와 에이전트 작업 행 사이의 불일치는 귀하의 워크로드에 대한 하나의 가설이며, 이를 해결하는 유일한 방법은 동일한 트레이스에서 두 모델을 모두 실행해 보는 것이다. GLM 5.3 Flash가 경로에 있고 같은 게이트웨이 반대편에 Anthropic 레그가 있으면, 이는 두 개의 통합이 아니라 설정 변경 하나가 된다 — 200개 이상의 모델을 위한 하나의 API, 하나의 키, 그 아래에서 작동하는 자동 페일오버, 그리고 작업 클래스별로 트래픽을 분할하고 비용을 단일 인보이스에서 확인하고 싶을 때 쓰는 라우팅 DSL까지.

A capture of the OrcaRouter model page for GLM 5.3 Flash under z-ai/glm-5.3-flash, showing a 1M-token context window, 128K maximum output, text, image and video input, benchmarks published by Z.ai on 2026-08-26, the description of its 320B total and 18B active parameters, and a price strip of $0.15 input, $0.50 output and $0.030 cache read per million tokens.

숫자가 뒷받침하는 방식으로 진술된 평결

당신의 작업이 텍스트 입력, 텍스트 출력 방식이고, 프롬프트가 첫 번째 가격 구간을 벗어나지 않으며, 실제 대량 사용량에 대해 토큰당 비용을 지불한다면, Claude Haiku 5.5가 여기서 더 나은 모델입니다: 종합 점수가 더 높고, 완료된 작업당 비용이 더 저렴하며, 작업당 두 배 이상 빠릅니다. 터미널 벤치마크 헤드라인 수치는 차이가 없으므로 무엇을 결정하는 데에도 사용해서는 안 됩니다.

당신의 작업이 감독 없이 여러 단계의 워크플로를 완료해야 하는 에이전트라면, 바로 그것을 측정하는 유일한 공통 벤치마크에서 GLM 5.3 Flash가 25점 앞서 있으며, 가중치를 보유할 수 있기 때문에 둘 중 수정 비용이 더 저렴합니다.

0.32828에서의 동점은 이 쌍에 맞는 이미지다. 하지만 그것은 두 모델이 동등하기 때문이 아니다. 그것은 다른 어떤 공통점도 거의 없는 두 모델이 우연히 같은 숫자에 도달한 유일한 행이며, 그 숫자를 비교의 요약으로 취급하는 것이야말로 조달 결정이 표에서 가장 정보가 적은 숫자를 근거로 내려지는 방식이다.