GLM-5.3과 GLM-5.2 비교를 위한 히어로 타이틀 카드로, '같은 두뇌, 두 배의 벤치마크'라는 부제가 있다. 두 모델 카드가 하나로 연결된 743B MoE 베이스 블록을 공유하며, GLM-5.2에서 GLM-5.3을 가리키는 '포스트 트레이닝만'이라는 라벨이 붙은 곡선형 업그레이드 화살표가 있다.
Guides & Insights

GLM-5.3 vs GLM-5.2: 같은 두뇌, 두 배로 뛴 벤치마크

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Zhipu AI가 GLM-5.2에서 G​LM-5.3으로의 업그레이드에 대해 내놓은 자체 설명이야말로 정직합니다. 교과서는 바뀌지 않았고, 학생의 훈련만 바뀌었을 뿐입니다. 2026년 8월 14일에 출시된 G​LM-5.3은 6월에 Artificial Analysis Intelligence Index에서 오픈 웨이트 부문 정상에 오른 GLM-5.2와 정확히 동일한 7,430억 파라미터 MoE 기반 위에 구축되었습니다. 아키텍처도, 풋프린트도, 백만 개당 $1.40 / $4.40이라는 가격도 변하지 않았습니다. 그런데도 Z.ai는 재훈련된 모델이 두 버전 모두가 공개하는 여러 코딩 및 보안 벤치마크에서 전작의 두 배 이상의 성능을 낸다고 보고합니다. 그것이 G​LM-5.3을 반드시 업그레이드해야 할 버전으로 만들지, 지켜봐야 할 버전으로 만들지는, 자체 아키텍처를 바꾸지 않고도 이토록 크게 개선된 모델을 얼마나 신뢰하는지, 그리고 새롭게 등장한 사이버 역량이 2주간의 안전 검증 기간(safety window)을 거친 뒤에 공개되기를 원하는 기능인지에 달려 있습니다.

같은 뇌, 재훈련

GLM-5.2를 실용적인 서버로 만든 모든 것은 그대로 유지됩니다: 약 40B의 활성 파라미터를 가진 743B MoE, 1M 컨텍스트에서 FLOPs를 줄인 IndexShare 희소 어텐션, MIT 라이선스, 1M 컨텍스트 윈도우, 그리고 독립적인 관찰에서 약 145~168 tokens/sec로 측정된 날렵한 토큰 처리량입니다. G​LM-5.3은 단 한 가지 차원에서만 다릅니다 — 바로 사후 학습(post-training)입니다. Z.ai는 IndexShare, SAO, Slime 프레임워크로 강화 학습 단계를 확장하고, 수십 배 더 많은 장기 과제 환경을 추가했으며, 이를 코드 디버깅에서 보안 취약점 발견 및 시스템 엔지니어링으로 확대했습니다. 그 결과는 동일한 하드웨어에서 다르게 작동하는 모델이며, 이것이 바로 업그레이드 질문이 "새 GPU가 필요한가"가 아니라 "새 동작이 필요한가"인 이유입니다.

양방향 모두에서의 벤치마크 델타

Z.ai가 공개한 수치를 전후 비교로 읽어보면, 이 점프는 오픈 가중치 역사상 가장 큰 것이다. 두 모델 모두가 평가된 더 어려운 개정판인 Terminal-Bench 3.0에서는 4.6에서 28.3으로, 6배 점프다. DeepSWE v1.1은 46.2에서 66.9로 올랐는데, 이는 {{1}}"좋은 오픈 모델"과 "폐쇄형 선두 주자들과 경쟁력 있는 수준"{{/1}} 사이의 차이다. Agents' Last Exam CLI 하위 집합은 23.8에서 28.5로 이동했다. CyberGym 취약점 발견은 77.2에서 84.5로 상승했다. ExploitBench는 24.4에서 54.4로 두 배 이상 늘었고, ExploitGym 처리량은 (2시간 및 6시간 동안) 완료된 작업 29개와 39개에서 105개와 130개로 증가했다. Z.ai는 이를 {{2}}대략 50%의 코딩 개선{{/2}}으로 요약하며, 이러한 성과의 형태(장기 코딩, 터미널 자동화, 보안에 집중)는 사후 훈련 전용 모델과 일치한다. 즉, 원시 지식은 동일하지만 실제로 다단계 작업을 수행하는 능력이 더 강해진 것이다.

• Terminal-Bench 3.0 — GLM-5.2 4.6 대 G​LM-5.3 28.3

• DeepSWE v1.1 — GLM-5.2 46.2 vs GLM-5.3 66.9

• Agents' Last Exam (CLI) — GLM-5.2 23.8 대 GLM-5.3 28.5

• CyberGym 취약점 발견 — GLM-5.2 77.2 vs G​LM-5.3 84.5

• ExploitBench — GLM-5.2 24.4 대 GLM-5.3 54.4

The OrcaRouter GLM-5.2 model page showing Z.ai's open-weights flagship with its per-million-token pricing, context window and model ID.Scoreboard contrasting GLM-5.2 (Terminal-Bench 3.0 4.6, DeepSWE v1.1 46.2, Agents' Last Exam CLI 23.8, CyberGym 77.2, ExploitBench 24.4, Price $1.40/$4.40 per M) with GLM-5.3 (Terminal-Bench 3.0 28.3, DeepSWE v1.1 66.9, Agents' Last Exam CLI 28.5, CyberGym 84.5, ExploitBench 54.4, Price $1.40/$4.40 per M).

아무도 예약하지 않은 능력

보안 성과는 Z.ai가 계획한 것이 아니었다는 점에서 별도의 문단으로 다룰 가치가 있다. 포스트트레이닝 팀은 약간의 개선을 기대하며 취약점 발견 환경을 추가했다. 그러나 모델은 오히려 완전한 익스플로잇을 잇달아 구성하기 시작했고, 이 창발적 행동으로 인해 Z.ai는 안전성 강화를 위해 약 2주간 가중치 공개를 보류해야 했다. 보안 팀과 함께한 실제 테스트에서 G​LM-5.3은 269개 프로젝트의 2,436개 취약점을 발견하는 데 기여했으며, 그중 1,097개는 중간 또는 높은 위험도였다. 여기에는 널리 배포된 소프트웨어에서 수십 년간 발견되지 않았던 결함도 포함됐다. GLM-5.2는 평범한 의미의 보안 역량을 가졌다. 코드에서 버그를 읽어낼 수 있다는 의미였다. G​LM-5.3은 다른 의미에서 그 역량을 가진다. G​LM-5.3은 안전성 유예 기간의 대상 그 자체다. 이는 정도의 차이가 아니라 종류의 차이다. 그리고 공통된 베이스를 공유함에도 두 모델을 서로 다른 제품으로 봐야 하는 가장 강력한 이유다.

Infographic titled 'The upgrade delta' showing a two-column before-and-after comparison of GLM-5.2 vs GLM-5.3 across five benchmarks with upward arrows: Terminal-Bench 3.0 4.6 to 28.3, DeepSWE v1.1 46.2 to 66.9, Agents' Last Exam CLI 23.8 to 28.5, CyberGym 77.2 to 84.5, ExploitBench 24.4 to 54.4.

일관성 주의사항

위 수치들에 대한 상쇄 요소는 {{1}}초기 서드파티 테스트가 GLM-5.3을 GLM-5.2에서는 볼 수 없었던 방식으로 일관성이 없다고 평가한다는 점입니다.{{/1}} 독립 검토자들은 동일한 모델이 일부 작업에서는 {{2}}간신히 통과선을 넘는 외주 엔지니어{{/2}}처럼 작동하고, 다른 작업에서는 {{3}}전문가급 결과{{/3}}를 제공한다고 보고하며, 그 차이는 요구사항이 얼마나 명확하게 명시되었는지에 따라 달라집니다. 이는 이득이 전적으로 {{4}}환경 중심 사후 훈련{{/4}}에서 비롯된 모델에서 예측할 수 있는 바로 그 실패 패턴입니다. 즉, 훈련된 작업 형태에서 일반화되며, 불명확하게 작성된 프롬프트는 그 범위 밖에 놓입니다. {{5}}독립적 결과 중 어느 것도 Z.ai가 발표한 표만큼 깔끔하지 않으며{{/5}}, Z.ai의 수치 중 어느 것도 아직 독립적으로 재현되지 않았습니다. 프로덕션 도입을 위해서는 마이그레이션 전에 {{6}}자체 워크로드에 대한 명시적 평가{{/6}}가 필요하다는 결론이 나옵니다. 이는 {{7}}GLM-5.2가 요구했던 것과 동일한 주의사항{{/7}}이되, 이제 최상의 경우와 최악의 경우 사이의 격차가 더 넓어졌습니다.

가격, 접근성, 그리고 대기 문제

가격은 동일하여 일반적인 업그레이드 마찰이 없습니다. 두 모델 모두 토큰 백만 개당 $1.40 / $4.40이며, G​LM-5.3은 thinking 모드를 활성화해야 합니다. 진정한 차이는 접근성입니다. GLM-5.2는 오늘 MIT 라이선스로 다운로드할 수 있고, FP8 기준 1TB 미만 용량으로 자체 호스팅이 가능하며, OrcaRouter를 통해 마크업 없이 정가로 호출할 수 있습니다. 지금 바로 라우팅할 수 있는, 안정적이고 독립적으로 평가된 모델입니다. G​LM-5.3은 현재 Z.ai의 ZCode / AutoClaw 및 G​LM Coding Plan을 통해 사용할 수 있지만, 공개 API와 가중치는 모두 안전 검토 기간 동안 접근이 제한되어 있으며, 벤치마크 수치는 모두 공급업체가 보고한 것으로 제3자 재실행을 기다리고 있습니다. 그러므로 '기다려야 할까요?'에 대한 솔직한 답은 두 가지입니다. 성능 저하가 용납되지 않는 프로덕션 트래픽의 경우, 오늘날 GLM-5.2가 여전히 안전한 오픈 가중치 선택지입니다. 그리고 G​LM-5.3의 API가 개방되고 독립적인 실행 결과가 검증되는 순간, 그 전환은 재작성이 아닌 경로 변경입니다. 동일한 단일 키 설정을 유지한 채 경로만 바꾸면 됩니다. 탐색적 작업과 보안 평가 작업의 경우, G​LM-5.3은 Z.ai의 도구를 통해 지금 시도해 볼 가치가 있습니다. 다만 발표된 우위는 검증되지 않았고, 그 동작은 이전 모델보다 더 변동적이라는 점을 인지해야 합니다.

정직한 평결

{{1}}G​LM-5.3{{/1}}은 Z.ai 자체 수치상 더 나은 모델입니다. 장기 코딩에서는 극적으로 우수하고, 보안에서는 범주적으로 다른 수준입니다. 베이스, 설치 공간, 가격이 변하지 않았으므로 워크플로에 무료로 적용할 수 있습니다. 하지만 '벤더 평가에서 더 낫다'와 '파이프라인에서 더 낫다' 사이에는 GLM-5.2에는 이미 있지만 {{2}}G​LM-5.3{{/2}}에는 아직 없는 두 가지, 즉 독립적 재현과 출시용 가중치가 자리합니다. 이미 GLM-5.2를 실행 중이라면 업그레이드 경로는 오픈 가중치 역사상 가장 저렴합니다. 동일한 하드웨어, 동일한 가격, 동일한 API 표면, 그리고 가중치가 나올 때까지 2주를 기다리면 됩니다. 결정의 핵심은 {{3}}G​LM-5.3{{/3}}이 GLM-5.2보다 나은지 여부가 아니라, 개선 사항과 새롭게 드러난 보안 역량이 아직 Z.ai 외부의 누구에게도 확인되지 않은 모델에 프로덕션을 걸 의향이 있는지입니다.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube