
GLM-5.3-Flash, 5주 후: 독립적 42, Mythos급 익스플로잇 런, 그리고 자체 서빙 스택을 재구축한 GLM 에이전트
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100만 토큰당 · 87 tok/s
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
GLM-5.3-Flash는 5주 동안 프로덕션 트래픽을 처리해 왔으며, 2026년 9월 17일 Zhipu AI는 어디에서 실행되는지에 대해 밝혔습니다. 회사는 이제 GLM-5.3-Flash에 대한 모든 프로덕션 요청이 10만 대 이상의 중국 국내 생산 AI 가속기 플릿에서 실행된다고 공개했습니다. 또한 해당 하드웨어에서 첫 부팅을 한 후 2주 이내에 전체 라이브 워크로드를 처리하게 되었으며, 같은 기간 동안 엔드투엔드 처리량이 3.2배 증가했다고 밝혔습니다. 가장 큰 반향을 불러일으킨 부분은 누가 그 일을 했는가입니다. 그 일의 상당 부분은 인프라 팀이 아니라 GLM-5.3 자체가 구동하는 에이전트에 의해 수행되었습니다. 이 에이전트는 병목 현상을 읽고, 수정 사항을 제안하고, 추론 시스템 코드를 작성했으며, 엔지니어들은 목표를 설정하고, 피드백 환경을 구축하고, 수치적 의미론, 동시성 또는 프로덕션 위험과 관련된 모든 것을 검토했습니다. GLM-5.3-Flash는 Zhipu가 2026년 8월 26일에 출시하고 오픈소스로 공개한 총 3,200억 개, 활성 180억 개(320B-A18B)의 멀티모달 모델입니다. — 그날 회사가 공개한 익명의 "Ox Alpha"입니다 — 그리고 더 큰 형제 모델인 GLM-5.3은 가격이 대비되어 책정된 743B 플래그십입니다. 오늘 공개된 세 가지 수치 중 어느 것도 우리나 다른 누구로부터 나온 것이 아닙니다. 이는 Zhipu 자체의 것입니다. 플래그십이 더 이상 유일하게 중요한 비교 대상이 아닙니다. 실제 Chrome 익스플로잇 사다리를 모델이 얼마나 오르는지에 대한 독립적인 평가인 ExploitBench에서, GLM-5.3-Flash는 이제 시도당 훨씬 적은 비용으로, 개발자가 검증된 방어자에게만 공개한 폐쇄형 프런티어 모델인 Claude Mythos Preview와 동등한 수준으로 측정되었습니다.
그것은 좋은 소식이며, 사실이지만 공급업체가 주장한 것입니다. 이 글이 출시일에 처음 게재된 이후 세 가지 다른 변화가 있었고, 그중 두 가지는 반대 방향으로 작용했습니다. Artificial Analysis는 이제 이 모델에 대한 자체 측정 결과를 발표했으며, 그 수치는 Zhipu의 수치가 아닙니다. 이 모델을 시장에서 가장 저렴한 유능한 모델로 만들어 준 출시 할인은 예정대로 9월 9일에 만료되었고 연장되지 않았습니다. 그리고 제3자 평가 기관인 Generality Labs는 자체 ExploitBench 실행 결과를 발표했는데, 여기서 GLM-5.3-Flash는 동일한 래더에서 Claude Mythos Preview의 세 번 실행 평균보다 높은 점수를 기록했습니다 — 대략 1달러당 6센트의 비용으로. 8월 말에 이 모델을 “저렴한 모델”로 북마크해 둔 사람이라면, 오늘의 계산은 그때와 다르고, 솔직한 헤드라인은 혼합된 것입니다: 서빙 경제성은 진정으로 개선되었고, 가격은 프로모션이 끝나서 올랐으며, 널리 인용된 지능 수치는 독립적인 하네스와의 첫 접촉에서 살아남지 못했고, 모델에 유리하게 나온 능력 비교는 단 한 번의 비심사 실행으로, 그 저자들 스스로 과대 해석하지 말아야 한다고 말합니다.
Zhipu는 클러스터 규모, 2주 일정, 3.2배라는 수치의 유일한 출처다. 이 중 어느 것도 독립적인 감사를 받은 적이 없으며, 회사 스스로도 재귀적 자기 개선을 달성하지 못했다고 말하면서 그 결과를 진짜가 아니라 최소 규모 루프라고 설명한다. 확인할 수 있는 것은 확인했다. 이 설명에서 Zhipu의 영역 밖에 존재하는 단 하나의 구체적 산출물, 즉 Flash Linear Attention 커널의 정밀도 수정은 실제로 업스트림에 병합되었고, 우리는 이를 확인했다. 아래 수치가 Zhipu에서 나온 경우에는 그렇게 명시한다. Artificial Analysis에서 나온 경우에는 대신 그렇게 명시한다. Generality Labs — 이 글의 익스플로잇 수치 뒤에 있는 안전 평가 조직 — 에서 나온 경우에는 그렇게 명시하며, 저자들이 스스로 덧붙인 주의 사항도 함께 제시한다. 단일 실행, 41개 버그, 자체 공개 방법, 제3자 재현 없음, 그리고 그들이 자발적으로 제기한 오염 문제다. 숫자가 Anthropic의 것인 경우 — 여기서 답에 경쟁적 이해관계가 있는 연구소에서 나온 유일한 수치들 — 본문은 그것이 실제로 어느 모델을 측정한 것인지 밝힌다. 그 수치 모두가 이 모델을 측정한 것은 아니기 때문이다.
실제로 출시된 것
GLM-5.3-Flash는 45개 레이어를 갖춘 총 320B / 활성 18B 규모의 전문가 혼합(mixture-of-experts) 모델로, 활성 파라미터가 GLM-5.2의 약 32B의 절반을 조금 넘는 수준입니다. 가장 눈에 띄는 기능은 모달리티로, 별도의 어댑터를 통해 비전을 라우팅하는 대신 텍스트, 이미지, 비디오 입력을 네이티브로 받아들이는 첫 번째 GLM-5 모델입니다. 컨텍스트는 최대 100만 토큰까지 지원하며, Zhipu는 장문 컨텍스트 서빙 비용이 GLM-5.3의 약 3분의 1 수준이라고 주장합니다.
아키텍처와 관련해 Zhipu는 이를 확장을 위해 하이브리드 희소+선형 어텐션을 Manifold-Constrained Hyper-Connections(mHC)와 결합하고, 네 개의 인덱서 키 벡터를 하나의 가중 풀로 압축해 긴 문맥 지연 시간을 줄이는 IndexPool 메커니즘을 갖춘 최초의 오픈소스 프런티어 모델이라고 설명한다. 사전 학습은 30조 토큰의 멀티모달 코퍼스에서 진행됐다. 그중 어느 것도 독립적으로 검증된 것은 아니다 — 이는 Zhipu가 자사 모델을 설명한 것이다 — 하지만 서빙 효율성 주장은 가중치가 오픈소스 추론 스택 앞에 놓인 지금 테스트할 만큼 구체적이며, 9월 17일의 설명은 서빙 측이 실제로 어떻게 구축되었는지에 대한 첫 번째 상세한 그림을 더한다.
출시일 사양표, 한눈에 보기:
• 파라미터 — 총 320B / 활성 18B, 45개 레이어, MoE.
• 모달리티 — 네이티브 텍스트, 이미지 및 비디오 입력, 텍스트 출력.
• 컨텍스트 창 — 최대 1,000,000개의 토큰.
• 라이선스 — MIT, 출시 당일부터 Hugging Face에서 오픈 웨이트 공개.
• 가격 — 백만 토큰당 $0.15 / $0.50 (입력 / 출력), 캐시된 입력 백만 토큰당 $0.03.

그 카드는 출시일 스냅샷이며, 그 안의 두 행은 8월 26일 이후로 바뀌었다. AA Index 수치는 여전히 Zhipu의 자체 주장이며, 이제 독립적인 측정과 모순된다 — 자세한 내용은 아래에서 다룬다. 그것이 보여주는 할인 가격은 사라졌다; 프로모션은 9월 9일에 끝났다. 파라미터 수, 컨텍스트 윈도, 라이선스, 모달리티는 변함없는 현재 사실이며, 그 그림이 주로 보여주려는 것이 바로 이것들이다.
Ox Alpha 주간, 그리고 무료 증정이 실제로 무엇을 테스트하고 있었는지
이번 공개로 일주일간의 추측이 마무리됐다. 8월 20일, 100만 토큰 컨텍스트 윈도와 텍스트/이미지/비디오 입력, 가격 0을 갖춘 익명 모델이 제3자 AI API 플랫폼에 등장했고, 곧바로 그 플랫폼의 주간 차트에서 가장 많이 호출된 모델이 되었다. 커뮤니티는 48시간 안에 이를 Zhipu의 GLM 계열로 특정했다 — 이전에 다른 중국 연구소들의 모델을 식별해 냈던 것과 같은, 익명으로 등장한 뒤 나중에 정체가 밝혀지는 패턴 — 그리고 분석가들은 Flash 변형 GLM-5.3일 것이라고 널리 추측했다. 8월 26일 발표는 그 추측을 확인해 주었다. 무료 주간은 의도된 테스트였으며, 회사는 익명 실행이 제공된 코딩 플랫폼 전반에서 6일 동안 62조 개가 넘는 토큰을 처리했고, 그 전부가 중국 자국산 칩에서 서빙됐다고 말한다.
그 마지막 조항은 당시에는 각주처럼 보였다. 알고 보니 그것이 핵심이었다. 무료 주간은 일차적으로 마케팅용 이벤트도, 심지어 모델의 부하 테스트도 아니었다. 그것은 그 아래에 있는 가속기 플릿의 부하 테스트였으며, 실패가 공개적이고 무료였을 규모로 실행되었다. 3주 후 Zhipu는 같은 플릿이 해당 모델의 프로덕션 트래픽 100%를 처리하고 있다고 설명하고 있다.

그 주의 가격 책정 논리는 한 가지 정정만 반영하면 여전히 유효하다. 한 모델이 일주일 동안 $0에 제공된 뒤 플래그십 요금의 10분의 1 가격에 추가 50% 할인을 붙여 출시된 것은 보급형 등급에서의 의도적인 마켓메이킹 조치였고, "기간 한정"이라는 단서는 언제나 지켜봐야 할 부분이었다. 우리는 그것을 되돌려질 수 있는 사안으로 지적했다. 그것은 예정대로 철회되었다 — 이 점은 분명히 말할 가치가 있다. 이 이야기에서 청구서에 실제로 드러나는 유일한 변화가 바로 할인 만료이기 때문이다.
에이전트가 재구축한 서빙 스택
Zhipu의 9월 17일 기술 글은 GLM-5.3-Flash가 중국산 실리콘에서 어떻게 서빙되는지에 관한 첫 상세 설명이며, 그 핵심 주장은 한 모델이 자신을 실행하는 시스템을 최적화하는 데 도움을 주었다는 것이다. 이 회사는 그 메커니즘을 dense feedback이라고 부른다. 정확성 테스트, 실행 로그, 트레이스, 마이크로벤치마크, 엔드투엔드 지표가 연결되어, 에이전트가 변경할 때마다 전체 배포와 부하 테스트를 기다리는 대신 국소적으로 가설을 검증할 수 있게 했다. Zhipu에 따르면 그것이 작동하려면 피드백이 국소적이고 저렴하며 객관적으로 확인 가능해야 했다. 즉, 특정 커널이나 코드 경로에 묶여 있고, 반복 작업을 하기에 충분히 빠르며, 사람이 개입하지 않고도 참인지 거짓인지 판별할 수 있어야 했다.
그 루프가 갖춰진 상태에서, 에이전트는 회사가 자세히 설명한 세 가지를 발견하고 수정했습니다:
• KDA 커널의 컨텍스트 병렬 경로는 시퀀스가 길어질수록 정밀도를 잃고 있었습니다. FP32 입력에도 불구하고 tl.dot이 기본적으로 TF32를 사용했기 때문에, 컨텍스트 길이에 따라 반올림 오차가 누적되었기 때문입니다. 이 수정은 입력 정밀도를 tf32x3로 고정하고, TF32를 지원하지 않는 플랫폼에서는 ieee로 폴백합니다. 이 항목은 세 가지 중 가장 흥미로운데, 이 계정의 내용 중 Zhipu 자체 인프라를 벗어나는 유일한 주장이기 때문입니다. 이 변경은 Flash Linear Attention의 업스트림에 PR #1180으로 병합되었으며, 우리가 확인한 결과 2026년 8월 27일에 병합된 것으로 확인되었습니다.
• KV 전송이 DeepEP의 스케줄링과 겹치지 않고 있었다. 사용 중인 DeepEP 버전에서는 노드 내 디스패치와 노드 내 컴바인 모두 Python GIL을 해제하지 않아, 그 뒤에 있는 전송 스레드가 정체되었다. 같은 글을 다룬 영어판과 중국어판 설명에서는 그로 인한 오버헤드를 각각 20% 초과, 30% 초과로 제시했다. 수정 후 Zhipu에 따르면 프리필 전용 기준선 대비 격차가 1% 아래로 떨어졌다.
• 디코드 커널이 동일한 FP32 정규화와 게이팅을 V 차원 타일마다 한 번씩, 총 네 번 다시 계산하고 있었습니다. 나눗셈 작업을 분할하자 커널 시간이 9.6% 단축되었고, 타일들을 하나의 스레드 블록으로 병합하여 정규화가 한 번만 실행되게 하자 1.71배의 속도 향상이 발생했습니다.
이러한 수정들 주변에는 구조적 변화가 있습니다: 원래 스택이 작성된 GPU보다 가속기가 온칩 메모리를 덜 가지고 있기 때문에 연산을 온칩 메모리와 맞바꾸는 ReplaySSM; 동일한 압박을 완화하기 위한 노드 내 텐서 병렬성; 용량을 확장하기 위한 INT8, FP8, BF16 혼합 캐싱; 그리고 세 가지 추론 단계를 하나의 파이프라인으로가 아니라 별도로 스케줄링하는 Encode-Prefill-Decode 분리형 아키텍처입니다. Zhipu는 또한 제약을 솔직히 밝힙니다 — 제한된 온칩 메모리와 인터커넥트 대역폭, 미성숙한 소프트웨어, 불완전한 커널 커버리지, 부족한 문서화 — 그리고 재귀적 자기 개선을 달성하지 못했다고 말하며, 그 결과를 최소 규모 루프라고 설명합니다.
이 이야기는 회의적으로 읽어야 한다. 이해관계가 너무 뻔하기 때문이다. Zhipu는 그 작업 중 에이전트가 얼마나 했고 엔지니어가 얼마나 했는지 밝히지 않을 것이며, 처리량 수치와 2주 일정, 클러스터 규모에 대한 외부 감사도 없다. 조밀한 피드백이라는 프레이밍도 특정한 방식으로 자기에게 유리하다: 가장 인상적으로 들리는 주장("우리 모델이 스스로 개선되었다")을 가장 검증하기 어려운 증거(아무도 들여다볼 수 없는 내부 루프)에 기대게 만든다. 이 이야기가 순수 마케팅에 그치지 않게 하는 것은, 가장 구체적인 주장이 반증 가능하면서 실제로 사실로 드러난다는 점이다 — tf32x3 커널 수정은 정말로 업스트림 저장소에 있으며, 날짜는 8월 27일로, 이를 둘러싼 언론 보도 주기보다 3주 앞선다.
실제 달러 기준으로 드는 비용
요금표는 Zhipu의 것이며 단순합니다: 입력 토큰 백만 개당 $0.15, 출력 토큰 백만 개당 $0.50, 캐시된 입력 토큰 백만 개당 $0.03입니다. 이것이 오늘 기준 정가입니다. 50% 할인 출시 프로모션은 2026년 9월 9일까지 진행되었고 연장되지 않았으므로, 8월 말에 널리 퍼진 $0.075 / $0.25 / $0.015 수치는 이제 공급업체 자체 API에서 더 이상 이용할 수 없습니다. GLM-5.3의 공개된 $1.40 / $4.40과 비교하면, Flash는 정가 기준으로 여전히 약 10분의 1 수준입니다 — 할인은 이미 핵심이었던 가격 위에 얹힌 보너스였지, 가격 그 자체는 아니었습니다. Artificial Analysis는 캐시 적중/입력/출력이 7:2:1인 구성에서 백만 토큰당 약 $0.10의 혼합 요율을 산출하며, 출력 속도를 초당 약 117토큰으로 제시하는데, 이를 눈에 띄게 빠르다고 설명합니다. 다만 AA는 이 속도 수치가 AA가 실행한 테스트가 아니라 해당 모델의 퍼스트파티 API를 설명하는 것이라고 밝힙니다.
Zhipu의 더 넓은 비용 이야기가 그 가격이 그 수준에 머물 수 있는 이유다. 8월 31일 발표된 반기 실적에서 회사는 10만 가속기 규모의 자국산 플릿에서 토큰 단위 추론 비용이 2026년 초 이후 80% 하락했으며, 규모, 가격 책정, 더 저렴해진 서빙 덕분에 API 매출총이익률이 -0.4%에서 24.6%로 올랐다고 밝혔다. 이는 주주에게 보고하는 회사의 회사 수치이며, 우리가 감사하지 않은 수치다. 정확한 수치라기보다 방향성이 명확한 것으로 받아들여야 한다. 위의 서빙 설명은 그 주장 뒤의 메커니즘이다 — 중복 커널 패스 감소, 메모리 압박 완화, 더 나은 오버랩 — 이는 단순한 백분율보다 더 신빙성 있는 이야기다. 설령 인용될 것은 그 백분율일지라도.
플래그십 대비 효율성 주장은 변함없다: 어텐션 연산은 GLM-5.3 대비 3.0배 감소하고 KV 캐시는 4.4배 감소했다는 공급업체 보고이며, Zhipu는 자사의 KV 캐시가 DeepSeek V4 Flash와 Kimi K3의 것보다 여전히 약간 더 크다는 점을 인정했다. 자국 칩에서의 엔드투엔드 서빙 3배 개선이라는 출시 당시 주장은 이제 최초 부팅부터 전체 프로덕션 트래픽까지 측정한 3.2배로 제시된다. 두 수치 모두 Zhipu의 것이며, 이를 담은 두 자료는 3주 차이가 난다 — 여기서 회사 외부에서 재현된 것은 아무것도 없다.
공개가 중요한 이유 — 그리고 헤드라인 숫자는 어디로 갔나
출시 보도를 읽고 그 수치를 기억해 둔 사람이라면 누구에게나 가장 중요한 정정은 이것이다. 즈푸(Zhipu)의 자료는 GLM-5.3-Flash를 Artificial Analysis Intelligence Index에서 57로 제시했으며, 이는 Claude Opus 4.8과 일치하는 수치다. 그 이후 Artificial Analysis는 Intelligence Index v4.3에서 이 모델을 자체 측정한 결과를 발표했는데, 그 값은 42이며, 같은 버전에서 GPT-5.6 Sol (max)의 47과 대비된다. 57은 결코 독립적인 수치가 아니었고 즈푸의 수치였으며, 독립 측정은 이 모델을 프런티어에 인접한 구간보다 대략 5점 낮은 곳에, 그리고 벤더의 대표 수치보다도 훨씬 낮은 곳에 놓는다. 같은 최신 지수에서 GLM-5.3 자체는 45로 측정되므로, 우리 출시 보도에 등장했던 플래그십의 60이라는 수치는 이제 Artificial Analysis가 오늘 발표하는 값과 일치하지 않는다. 주장과 측정 사이의 15점 격차는 반올림 차이가 아니며, 이 업데이트에서 독자가 얻을 수 있는 가장 유용한 단 하나의 사실이다 — 다만 아래 섹션이 덧붙이는 단서가 하나 있는데, 이 이야기에서 두 번째 독립 측정은 반대 방향을 가리키기 때문이다.
그 정정에도 살아남는 것은 더 좁지만 여전히 실재한다. GLM-5.3-Flash는 1M 컨텍스트와 네이티브 이미지 및 비디오 입력을 갖춘 오픈 웨이트 멀티모달 모델로, 가격은 플래그십 형제 모델 정가의 약 10분의 1이다 — 미국 프런티어 랩에서는 직접적인 대응물을 찾을 수 없는 조합이며, 이들의 비슷한 멀티모달 모델은 훨씬 더 비싸고 폐쇄형으로 출시된다. Zhipu의 자체적인 표현인 "프런티어 지능, 플래시 비용"이 바로 타격을 입은 부분이다: 측정된 42점에서 이 모델은 강력한 보급형 모델이지, 할인된 프런티어 모델이 아니다. 독립적인 측정은 또한 이 모델이 비슷한 규모의 오픈 웨이트 모델 중앙값을 여유 있게 웃돈다는 것을 보여주는데, 이는 추론 비용이 10분의 1인 18B 활성 모델로서는 실질적인 성과다 — 다만 출시 당시 보도가 시사한 것과는 다른 성과일 뿐이다.
다른 독립적인 수치 — 그리고 그것은 모델의 편이었다
Artificial Analysis 결과가 GLM-5.3-Flash을 한 단계 끌어내렸다면, 이번 것은 반대 방향으로 가며, 이것이 이 이야기에서 가장 기이한 사실이다. 카네기멜런에서 만든 ExploitBench는 모델이 대상을 크래시시킬 수 있는지를 묻지 않는다. 그것은 상승 경로를 점수화한다: 취약한 코드에 도달하고, 버그를 트리거하고, 재사용 가능한 프리미티브를 만들고, 마지막으로 보안 샌드박스가 켜진 프로덕션 V8을 대상으로 기계적으로 채점되는, 임의 코드 실행을 동반한 완전한 제어 흐름 하이재킹에 이르기까지. Generality Labs는 벤치마크의 통상적인 300턴 상한 대신 버그당 10억 토큰 예산으로 41개 버그 전반에 걸쳐 GLM-5.3-Flash를 실행했는데, 그 근거는 턴이 구매자가 실제로 지출하는 금액을 잘 대변하지 못하며 달러가 정직한 제약이라는 것이었다. GLM-5.3-Flash는 41개 중 13개에서 완전한 임의 코드 실행에 도달했고, 사다리 최대치의 64.8%에 해당하는 평균 역량 점수를 기록했다. Claude Mythos Preview의 공개된 세 차례 실행은 같은 사다리에서 9, 10, 11점을 받았으며, 평균 10, 즉 62.2%였다. 차트 아래에 인쇄된 Generality 자체의 설명은 이 측정에서 GLM-5.3-Flash가 “사이버 분야에서 Mythos급일 수 있다”라는 것이다. 9월 29일 공개된 Anthropic 자체의 ExploitBench 실행은 훨씬 낮은 절대 비율로 같은 순서를 보고한다. 다만 Flash가 아니라 플래그십 GLM-5.3에 대한 것이다. 이 실행은 사다리 진행도가 아니라 시도당 엔드투엔드 익스플로잇을 세며, GLM-5.3을 410개 중 50개, Mythos Preview를 410개 중 56개로 집계한다. 다른 집계 규칙, 유사한 순서 — 바로 이 때문에 ExploitBench 수치는 그 규칙을 함께 밝히지 않고는 결코 인용해서는 안 된다.
중요한 이유는 그 아래에 있는 분모입니다. 이 실행은 GLM-5.3-Flash의 출력 토큰 가격을 백만 개당 $0.25로 책정했습니다 — 50% 할인된 출시 요금이었고 이후 만료된 가격입니다 — 반면 Claude Mythos Preview의 과거 백만 개당 $125와 비교하면 500배 차이입니다. 비용을 같은 잣대로 비교하면, 이 실행은 취약점당 $16.81을 쓴 반면 Mythos는 $297.17을 썼습니다. 대략 6%라는 수치는 여기서 나옵니다. 그 주장을 주의 깊게 읽으세요. 널리 퍼진 버전은 잘못된 것이기 때문입니다. GLM-5.3-Flash가 Claude Mythos Preview보다 더 뛰어난 익스플로잇 개발자라는 뜻이 아닙니다. 이 특정 작업에서 GLM-5.3-Flash 토큰 1달러어치가 사는 것은 Mythos 토큰 1달러어치가 사는 것과 비슷하다는 뜻이며, 전자에는 훨씬 더 많은 달러를 쓸 수 있다는 뜻입니다.
Generality의 자체적인 주의사항은 헤드라인보다 더 가치가 있다. 그들은 단일 실행이 사이버 전체에 걸친 동등성을 입증하지는 않으며, 오염이 미해결 문제이고 — ExploitBench가 어떤 방식으로든 학습에 사용되었을 수 있다 — 41개 샘플 중 4개가 오류가 발생해 마지막으로 관찰된 결과를 이월하여 점수가 매겨졌는데, 이는 오히려 모델을 과소평가한다고 분명히 밝힌다. 그들은 또한 9월 28일 전체 비교를 복잡하게 만드는 후속 자료를 발표했다. GLM-5.3-Flash를 2억 5천만 토큰 예산으로 일곱 가지 다른 에이전트 하네스를 통해, 난이도 범위를 아우르도록 선택된 10개 샘플에서 실행했을 때, 동일한 가중치가 Codex 하네스에서는 10.6점을 기록했고 — Claude Mythos Preview의 10.02 기준점보다 높다 — Claude Code 하네스에서는 6.2점을 기록해, 벤치마크의 원래 턴 제한 구성인 6.4점보다도 낮았다. 하네스가 점수를 움직인 폭이 모델 비교가 움직인 폭보다 컸으며, 저자들은 10개 샘플 부분집합이 아마 대표성이 없을 것이라고 말한다. 그 그래프가 10월 2일 테스트 시점 컴퓨팅 확장이 모델 계층 간 격차를 지우고 있다는 주장과 함께 널리 퍼진 것은 산업에 대한 주장이지 평가의 결과가 아니다: 평가가 발견한 것은 저렴한 오픈 모델이 턴 제한 대신 예산을 부여받으면 하나의 사다리에서 프론티어 연구소의 익스플로잇 전문가에 도달할 수 있다는 것이다.
더 이상 한 연구소의 이야기가 아니다. 9월 29일 발표된 Anthropic 자체의 Frontier Red Team 평가는 더 작은 형제 모델인 GLM-5.3-Flash를 휴먼 인 더 루프 세션에서 실행했다. 패치된 Chrome 취약점의 공개 세부 정보와 또 하나를 넘겨받고, 별다른 지시 없이, 모델은 이들을 연결해 포인터 인증 강화를 우회하는 안정적인 ARM64 익스플로잇을 만들어냈다. 20분의 인간 주의와 8시간의 모델 작업으로, Zhipu의 API 요율로 $20.40이었다. 같은 평가는 위의 410개 중 50개라는 ExploitBench 수치의 출처이며, 그 부분은 Flash가 아니라 743B 플래그십인 GLM-5.3을 측정한 것이다. 이는 해당 보고서 보도가 대체로 평탄화해버린 구분이다. 두 개의 독립적 주체, 다른 하네스, 다른 예산, 같은 방향. 둘 다 또한 단일 연구소 실행이며 어느 것도 재현된 결과가 아니고, Flash에 대해 달러 수치를 보고하는 것은 플래그십이 아니라 Generality 실행뿐이다. 실용적인 해석은 Anthropic이 명시하는 그대로다. 가중치는 다운로드 가능하고, abliterating GLM-5.3-Flash에는 약 600 GPU 시간이 걸렸으며, 실행 비용이 시간당 1달러 미만인 모델은 심사 프로그램 뒤에 있는 모델과는 다른 종류의 가용성 문제다.
시도해 보세요. 그리고 라우팅 레이어가 어떻게 맞는지.
접근 방식은 간단합니다. Zhipu 자체 API가 위의 정가 요율로 이를 제공하며, MIT 라이선스 가중치는 Hugging Face의 zai-org/GLM-5.3-Flash에서 FP8 및 BF16으로 제공되고, Zhipu의 코딩 제품인 ZCode와 GLM Coding Plan에도 번들로 포함되어 있습니다. 셀프 호스팅의 경우 vLLM과 SGLang 모두 이를 지원합니다. 그 경로를 택할 경우 실질적인 참고 사항 두 가지: SGLang의 쿡북에는 5.13 이전 transformers 빌드에서 비전 입력이 조용히 누락될 수 있다는 미해결 변경 경고가 있으며, 이는 오류를 발생시키지 않고 이미지 요청을 단순히 텍스트 전용으로만 읽게 만듭니다; 그리고 AMD 경로는 여전히 레시피가 아닙니다. 최초 출시일 gfx950 지원 PR(sgl-project/sglang #37653)은 9월 6일 병합되지 않은 채 닫혔고, 더 광범위한 gfx950 데이제로 풀 리퀘스트 세트 — AITER를 통한 mHC, k-pool DSA 인덱서, FP8 및 MXFP4 서빙 — 로 대체되었으며, 그중 여러 건은 9월 17일에도 여전히 열려 있었습니다. MI350X급 하드웨어에서의 지원은 진행 중이며 아직 출시되지 않았고, 독립적인 AMD 처리량 수치도 아직 없습니다.
라우팅 측면에서는 출시 이후 상황이 바뀌었습니다: GLM-5.3-Flash는 이제 OrcaRouter의 라인업에 GLM 라인의 나머지 모델들과 함께 이름을 올렸습니다. 우리는 공급자 정가를 0% 마크업으로 그대로 전달하며 라우터 추가 요금이 없습니다. 이는 가격이 막 움직인 모델에 중요한 바로 그 메커니즘입니다 — Zhipu 측에서 할인이 만료되는 것은 여기서 지불하는 가격이며, 같은 날, 재협상할 두 번째 계약도 없고 코드 변경도 없습니다. 그 전달 방식은 양방향으로 작용하며, 이 점은 분명히 짚고 넘어갈 가치가 있습니다: 만료된 프로모션은 청구서에 실제 가격 인상이며, 업스트림에서 일어나는 바로 그 순간에 여기서도 일어납니다. Flash를 GLM-5.3 또는 다른 저예산 모델과 저울질하고 있다면, 둘 다 제공업체 간 자동 장애 조치와 함께 하나의 키 뒤에 있으므로, 독립적인 점수가 아직 정리되지 않은 모델을 프로덕션 경로에 걸지 않고 시험해 볼 수 있는 저렴한 방법입니다. 이는 또한 위 결과에 맞는 형태이며, 편의성보다 더 직설적인 이유에서 그렇습니다: 동일한 가중치가 동일한 벤치마크에서 어떤 에이전트 하네스가 구동했는지에 따라 10.6 또는 6.2를 기록했습니다. 따라서 구매자가 실제로 테스트하는 것은 스캐폴드+모델 조합이며, 고정된 스캐폴드 뒤의 모델을 하나의 키로 교체하는 것이 어느 쪽에든 전념하는 것보다 저렴합니다.

다음에 볼 콘텐츠
이 이야기의 나머지 부분을 결정짓는 네 가지가 있다. 첫째, 42가 움직이는지 여부다. 이 모델은 8월부터 널리 공개적으로 사용되어 왔기 때문에, Zhipu의 내부 평가와 AA의 하네스가 구조적 이유 — 추론 토큰 계산, 장황함, 벤더가 비중 있게 반영한 평가 — 로 불일치한다면, 그것은 일회성 격차가 아니라 지수가 개정되면서 드러나야 한다. 둘째, 익스플로잇 결과가 재현되는지 여부다. Generality Labs는 자체 하네스에서 41개 버그를 한 번 실행했고 그렇게 말한다. 하네스 후속 실험은 동일 가중치가 하네스 선택만으로 4점 움직인다는 것을 보여주므로, 이를 결정할 수치는 예산을 달러로 고정하고 하네스를 일정하게 유지한 채 두 번째 팀이 41개를 다시 실행한 결과다. 셋째, 국산 실리콘 관련 설명이 두 번째 출처를 확보하는지 여부다. Zhipu는 클러스터 규모, 2주 일정, 3.2배를 말할 수 있는 유일한 당사자이며, 그 안에서 독립적으로 검증 가능한 단 하나의 주장 — 병합된 커널 수정 — 은 작은 것이다. 넷째, 가격: 할인은 사라졌고, 흥미로운 질문은 Zhipu가 물량을 필요로 할 때 프로모션으로 할인이 돌아오는지, 아니면 이제 정가가 하한인지다.
관통하는 흐름은 GLM-5.3-Flash가 동시에 두 가지 서로 다른 것을 입증하라는 요구를 받고 있다는 점이다 — 값싼 모델도 충분히 좋을 수 있다는 것, 그리고 중국산 가속기가 이를 대규모로 서비스할 수 있다는 것 — 그리고 9월 17일 공개는 두 번째 질문에 대한 Zhipu의 답이며, 그 답을 작성하는 데 도움을 준 모델에 의해 전달된다. 첫 번째 질문에는 이제 두 개의 독립적인 숫자가 붙어 있고, 그것들은 서로 반대 방향을 가리킨다: 지능 지수에서 42, 이는 벤더의 대표 수치보다 훨씬 낮다, 그리고 비용은 20분의 1에 불과하면서 프런티어 연구소의 전문가와 동급에 도달하는 익스플로잇 실행. 둘 다 동시에 사실일 수 있으며, 둘 사이의 간극 — 어느 한쪽 숫자가 아니라 — 이 바로 결정이 실제로 내려지는 곳이다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
