GLM-5.2 리뷰: 오픈 웨이트 가격으로 최전선에 가까운 코딩?

GLM-5.2 리뷰: 오픈 웨이트 가격으로 최전선에 가까운 코딩?

작성자

Fengya Tian

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Z.ai는 2026년 6월 16일 GLM-5.2를 출시하며 장기적 과제를 위해 설계된 플래그십 모델이라고 발표했습니다. 이번에는 그 평가가 실제로 맞아떨어집니다. GLM-5.2는 100만 토큰의 컨텍스트 윈도우를 갖추고 있으며, 이는 긴 코딩 에이전트 세션을 위해 실제로 훈련되었습니다. 또한 현재까지 공개 가중치 모델 중 가장 높은 코딩 점수를 기록했습니다. 이 모델은 Z.ai API, GLM 코딩 플랜, 그리고 허깅페이스에 완전한 MIT 라이선스 가중치와 함께 지역 제한 없이 한꺼번에 제공됩니다.

이 리뷰는 대부분의 팀이 실제로 궁금해하는 질문에 답합니다: 오픈 웨이트 모델이 마침내 기본 코딩 모델로 사용하기에 충분히 좋아졌는지, 그리고 폐쇄형 최첨단 플래그십이 여전히 프리미엄을 정당화하는 부분은 무엇인지. 우리는 진정으로 새로운 점, GLM-5.2의 실제 비용(대부분의 글에서 생략되는 캐시된 입력 할인 포함), GLM-5.1 및 폐쇄형 최첨단 모델과의 비교, 그리고 오늘 당장 전환해야 할 대상을 다룰 것입니다.

간략 평결

만약 당신이…라면 GLM-5.2를 고려하세요.

- 대용량 코딩 또는 에이전트 워크로드를 실행하고, 최첨단급에 가까운 품질을 토큰 백만 개당 $1.40 / $4.40에 원한다면 — 플래그십 가격의 극히 일부입니다.

- 장시간 실행되는 코딩 에이전트 구축 — Z.ai가 공개한 FrontierSWE 결과에 따르면, GLM-5.2는 Claude Opus 4.8에 단 1포인트 차이로 근접하며 GPT-5.5를 앞지릅니다.

- 1M 토큰 컨텍스트 창과 최대 128K 출력 토큰이 필요하며, 단순히 사양서에 명시된 것보다는 길고 복잡한 에이전트 궤적을 위해 특별히 훈련된 것입니다.

- 오픈 가중치: MIT 라이선스, 자체 호스팅, 파인튜닝, 제로 공급업체 종속

보류하세요 (또는 폐쇄된 플래그십에 머무르세요) 만약 당신이…

- 가장 까다로운 에이전트 작업의 절대적인 상한선을 원한다면 — Claude Opus 4.8이 도구 오케스트레이션과 장기 자율 작업에서 여전히 명확하게 선두를 달리고 있습니다.

- 이미지 또는 파일 입력 필요: GLM-5.2는 텍스트 전용입니다; 비전 기능은 Z.ai의 별도 GLM-V 라인에 있습니다.

- 지연 시간에 엄격한 제약이 있습니다 — GLM-5.2는 사고 우선 모델이며, 공용 게이트웨이 통계에 따르면 첫 번째 토큰까지의 중간 시간이 수초 범위입니다.

GLM-5.2는 무엇인가요?

GLM-5.2는 Z.ai(구 Zhipu AI)의 GLM 제품군 최신 플래그십 모델로, 오픈 웨이트 모델을 프론티어 스케일로 제공하는 몇 안 되는 연구소 중 하나입니다. 공개 모델 문서에 따르면 총 약 7,500억 개의 파라미터를 가진 Mixture-of-Experts 설계로, 토큰당 약 400억 개의 파라미터가 활성화됩니다. 모델 ID는 `glm-5.2`이며, 오늘부터 일반적으로 사용할 수 있습니다: Z.ai에서 채팅하거나, Z.ai API를 통해 호출하거나, GLM 코딩 플랜 구독 내에서 사용하거나(공개 출시 며칠 전에 등장), Hugging Face에서 가중치를 다운로드하여 직접 실행할 수 있습니다.

이번 세대에서 주목할 점은 포지셔닝입니다. Z.ai는 GLM-5.2를 더 저렴한 경쟁 후보로 판매하는 것이 아니라, 공개된 수치를 바탕으로 폐쇄형 최첨단 모델과 단 몇 포인트 차이를 보이는 가장 강력한 오픈소스 코딩 모델로 내세우고 있습니다. 이는 현재 대부분의 개발자 지출이 집중되는 바로 그 워크로드(장기 코딩 및 에이전트)에 해당합니다.

GLM-5.2의 새로운 기능은 무엇인가요?

장기적인 코딩 도약이지, 포인트 릴리스가 아닙니다.가장 큰 변화입니다. Z.ai가 발표한 벤치마크 표에서 GLM-5.2는 Terminal-Bench 2.1에서 81.0점을 기록했으며, GLM-5.1은 63.5점을 기록했습니다. 그리고 SWE-bench Pro에서는 62.1점 대 58.4점을 기록했습니다. 가장 극적인 수치는 FrontierSWE인데, 이는 수 시간에서 수십 시간이 소요되는 개방형 엔지니어링 프로젝트를 측정합니다: GLM-5.2가 74.4점, GLM-5.1이 30.5점입니다.

견고한 1M-토큰 컨텍스트GLM-5.2는 백만 토큰 윈도우(GLM-5.1의 200K의 5배)를 대상으로 한 훈련과 결합한 최초의 GLM 모델입니다: Z.ai는 코딩 에이전트 시나리오(대규모 구현, 자동화된 연구, 성능 최적화, 복잡한 디버깅)에서 1M-컨텍스트 훈련을 대폭 확장했다고 말합니다. 응답당 최대 출력은 128K 토큰입니다.

노력 수준 제어.이번 세대의 새로운 기능: 모든 요청에 대해 고정된 추론 깊이를 제공하는 대신, 사고 노력 수준을 설정하여 성능을 실행 속도 및 계산 비용과 명시적으로 절충할 수 있습니다.

더 저렴한 아키텍처가 내부에 있습니다.Z.ai의 새로운 IndexShare 기술은 4개의 sparse-attention 레이어마다 동일한 인덱서를 재사용하여, 전체 1M 컨텍스트 길이에서 토큰당 연산량을 2.9배 줄이며, 개선된 MTP 레이어는 수용 길이를 최대 20%까지 증가시켜 추론적 디코딩 속도를 높입니다.

순수 오픈. 가중치는 MIT 라이선스 하에 제공되며, Z.ai의 말에 따르면 지역적 제한이 없습니다 — 상업적 사용, 미세 조정, 그리고 개인 호스팅 모두 허용됩니다.

가격: 실제 비용

자사 GLM 5.2 API의 가격은 입력 토큰 100만 개당 $1.40, 출력 토큰 100만 개당 $4.40입니다 — GLM-5.1과 동일한 가격표이므로, 이미 GLM API를 사용 중이라면 성능 향상이 무료로 제공됩니다. 캐시된 입력은 100만 개당 $0.26으로 인하되며, Z.ai는 현재 한정 기간 동안 캐시 저장 요금을 면제하고 있으며, 이는 동일한 프로젝트 컨텍스트를 수백 번 다시 읽는 에이전트 루프에 중요합니다.

참고: Claude Opus 4.8은 백만 토큰당 $5 / $25에 책정되어 있습니다. Z.ai의 벤치마크 표가 대략적인 방향성이라도 맞다면, GLM-5.2는 플래그십 출력 가격의 5분의 1도 안 되는 비용으로 최첨단 장기 코딩 능력의 대부분을 제공합니다. 두 가지 주의사항: 노력 수준이 실제 지출을 결정하며(더 높은 노력은 더 많은 사고 토큰을 의미함), 타사 호스트는 각자의 요금을 게시합니다(일부는 자사보다 저렴함). 따라서 예산을 세우기 전에 현재 가격을 확인하세요.

리뷰 점수

아래 점수는 Z.ai의 공개된 벤치마크와 모델 문서를 기반으로 한 저희 편집 평가입니다 — 벤치마크 테이블은 공급업체 자체 제공 자료입니다. 독립적인 결과가 나오면 다시 검토하겠습니다.

- 코딩: 9/10

- 에이전트적/도구 사용: 8/10 — MCP-Atlas에서 최첨단에 가깝지만, 도구 오케스트레이션에서는 Opus 4.8이 확실히 앞서 있습니다.

- 추론: 8/10 — 최고 수준의 수학 (AIME 2026: 99.2, Z.ai의 표에서 가장 높은 점수), 그러나 가장 광범위한 추론 테스트는 여전히 폐쇄형 프론티어를 선호한다

비용 효율성: 10/10

- 컨텍스트 및 긴 문서: 9/10

- 속도 및 지연 시간: 7/10 — 사고 우선 모델; 빠른 작업에는 더 낮은 노력 수준을 사용하십시오

종합: ~8.5/10 — 최첨단에 충분히 가까워 기본값이지 타협이 아닌 최초의 오픈웨이트 모델.

장점

- 최전선에 가까운 장기 코딩: 백만 토큰당 $1.40 / $4.40 — GLM-5.1과 동일한 가격, 폐쇄형 플래그십보다 훨씬 낮음

- 견고한 1M 토큰 컨텍스트와 128K 출력, 실제 코딩 에이전트 궤적으로 훈련됨

- 요청별 비용/지연 시간/품질 트레이드오프를 조정하는 노력 수준 제어

- MIT 오픈 가중치: 자체 호스팅, 미세 조정, 또는 개인 대비책 유지 — 종속 없음, 지역 제한 없음

- 캐시된 입력은 백만 개당 $0.26이며, 캐시 저장소는 현재 무료입니다 — 에이전트 루프에 큰 도움이 됩니다

단점

- Claude Opus 4.8은 여전히 가장 까다로운 에이전틱 벤치마크에서 선두를 지키고 있습니다 — 도구 오케스트레이션과 장시간 작업은 아직 GLM-5.2의 전유물이 아닙니다.

- 텍스트 전용: 이미지 입력이 없으므로 스크린샷 기반 또는 문서 비전 워크플로우는 다른 모델이 필요합니다.

- Thinking-first design means noticeable time-to-first-token; latency-critical UX needs lower effort settings or a faster fallback

셀프 호스팅은 주말 프로젝트가 아니라 데이터 센터 프로젝트입니다 — 전체 체크포인트는 클러스터 규모의 GPU 메모리가 필요하다고 합니다.

- 벤치마크 이야기는 현재 Z.ai 자체 테이블에 기반하고 있습니다; 독립적인 복제는 아직 진행 중입니다.

GLM-5.2 비교

GLM-5.1 대비.동일한 $1.40/$4.40 가격표, 5배 더 큰 컨텍스트 윈도우, 그리고 세대를 건너뛰는 듯한 장기 도약: FrontierSWE 74.4 대비 30.5, Terminal-Bench 2.1 81.0 대비 63.5, SWE-Marathon 13.0 대비 1.0. GLM-5.1을 사용 중이라면, 이번이 올해 가장 쉬운 업그레이드 결정입니다. Z.ai는 전용 마이그레이션 가이드까지 제공합니다.

비공개 프론티어 대비 (Claude Opus 4.8, GPT-5.5). Z.ai의 표에서 GLM-5.2는 Terminal-Bench 2.1에서 Opus 4.8과 4점 차이(81.0 vs 85.0), FrontierSWE에서 1점 차이(74.4 vs 75.1)를 보이며, 실제로 SWE-bench Pro(62.1 vs 58.6)와 FrontierSWE(74.4 vs 72.6)에서는 GPT-5.5를 능가합니다. 프론티어는 작업이 가장 길고 도구 사용이 많은 부분에서 우위를 유지합니다: Opus 4.8은 SWE-Marathon(26.0 vs 13.0)에서 GLM-5.2를 두 배로 앞서며 Tool-Decathlon에서 큰 차이로 앞섭니다. 실용적인 규칙: 볼륨 작업에는 GLM-5.2, 정상에는 플래그십 모델.

다른 오픈 웨이트 모델과 비교.Qwen3.7-Max, MiniMax M3, DeepSeek-V4-Pro와 비교했을 때, GLM-5.2가 게시된 표의 모든 코딩 항목에서 1위를 차지했습니다. 현재 기준, 오픈 웨이트 코딩 분야의 왕관은 Z.ai가 차지하고 있습니다.

GLM-5.2는 누가 사용해야 하나요?

- 대규모로 코딩 에이전트를 운영하는 팀 — CI 봇, 자동 리팩토링, 코드 리뷰 — 여기서 작업당 비용이 경제적으로 가능한 범위를 결정합니다

프론티어에 가까운 품질을 프론티어 수준의 비용 없이 원하는 개발자 도구 구축자들

- 장기 컨텍스트 워크로드: 모노레포 분석, 다중 문서 엔지니어링 사양, 실제로 1M 토큰을 채우는 장시간 에이전트 세션

- 공개 가중치가 필요한 조직 — 규정 준수, 폐쇄망 배포, 미세 조정, 또는 단순히 API 공급업체에 대한 협상력을 위해

누가 폐쇄형 플래그십을 고수해야 할까?

- 가장 어려운 작업이 마라톤 길이의 자율 실행 또는 대규모 도구 오케스트레이션인 팀들의 경우, 벤치마크에 따르면 프론티어 프리미엄은 여전히 실제로 존재합니다.

- 시각 의존 워크플로우: GLM-5.2는 이미지를 받지 않습니다.

- 사용자에게 첫 토큰 지연 시간의 매 초가 비용이 드는 제품들

GLM-5.2는 가치가 있나요?

대부분의 코딩 및 에이전트 워크로드에 대해, 그렇습니다 — 단호히 말씀드리자면요. 솔직하게 말하자면: GLM-5.2는 프런티어의 장기 코딩 능력 중 약 90~95%를 가격의 5분의 1 이하로 제공하며, 오픈 웨이트를 보험으로 제공합니다. 클로즈드 플래그십은 여전히 가장 어려운 5%의 작업에서 우위를 점합니다. 이것이 GLM-5.2를 건너뛸 이유가 아닙니다. 오히려 경로를 설정할 이유입니다: 대량 작업은 GLM-5.2로 보내고, 최정상급 문제는 플래그십으로 에스컬레이션하세요.

최종 평결

GLM-5.2는 오늘날 사용할 수 있는 가장 강력한 오픈 웨이트 코딩 모델이며, 예산 타협이 아닌 기본 선택으로 읽히는 최초의 모델입니다 — 저희 점수: ~8.5/10. 난이도 상위 영역에서 Claude Opus 4.8을 제치지는 못하지만, 플래그십을 일상적인 기본 답변이 아닌 전문가 도구로 만듭니다. GLM-5.1을 사용 중이라면 지금 업그레이드하세요. 일상적인 에이전트 작업에 플래그십 가격을 지불하고 있다면, 이는 재측정 신호입니다.

OrcaRouter를 통해 GLM-5.2 사용

스마트한 선택은 "GLM-5.2 for the volume, a flagship for the hardest tasks"이기 때문에, 아마도 하나 이상의 모델을 프로덕션에서 사용하고 싶을 것입니다 — 하나 이상의 제공업체로부터요. 그 마찰이 OrcaRouter가 제거하는 것입니다.

OrcaRouter는 이미 하나의 OpenAI 호환 엔드포인트를 통해 GLM-5.2(모델 ID `z-ai/glm-5.2`)를 제공하며, Z.ai의 자체 요금인 $1.40 / $4.40에 토큰 마크업 없이 서비스합니다. 대량의 코딩 및 에이전트 트래픽을 GLM-5.2로 라우팅하고, 가장 어려운 추론은 Claude Opus 4.8이나 다른 플래그십 모델로 에스컬레이션하며, 출시 기간의 용량 급증에 대비해 자동 장애 조치를 유지하세요—모델을 변경할 때마다 통합을 다시 작성할 필요 없이 말이죠.

자주 묻는 질문

GLM-5.2가 지금 사용 가능한가요?

네. 2026년 6월 16일에 출시되었으며, 현재 Z.ai의 채팅 및 API(모델 ID glm-5.2), GLM 코딩 플랜 내부, OrcaRouter 같은 게이트웨이, 그리고 Hugging Face에서 MIT 라이선스의 오픈 가중치로 일반적으로 사용 가능합니다.

GLM-5.2의 가격은 얼마인가요?

자사 API 가격은 입력 토큰 100만 개당 $1.40, 출력 토큰 100만 개당 $4.40으로 GLM-5.1과 동일합니다. 캐시된 입력은 100만 개당 $0.26이며, 캐시 저장소는 제한된 기간 동안 무료로 제공됩니다.

GLM-5.2가 GLM-5.1보다 더 나은가요?

장기 프로젝트에서 큰 차이로: Terminal-Bench 2.1에서 81.0 대 63.5, FrontierSWE에서 74.4 대 30.5, 그리고 동일한 가격에 1M 컨텍스트 대 200K.

GLM-5.2 vs Claude Opus 4.8 — 어떤 것을 사용해야 할까요?

기본적으로 고용량 코딩 및 에이전트 작업에는 GLM-5.2를 사용하고, 장시간 자율 작업과 무거운 도구 오케스트레이션은 여전히 선도적인 Opus 4.8로 에스컬레이션하세요. 둘 사이의 라우팅은 하나를 선택하는 것보다 더 효과적입니다.

컨텍스트 윈도우란 무엇인가요?

1M 토큰, 응답당 최대 128K 출력 토큰 — 그리고 Z.ai는 긴 윈도우가 단순히 확장된 것이 아니라 코딩 에이전트 시나리오에 특별히 학습되었다고 말합니다.

GLM-5.2는 정말 오픈소스인가요?

네 — 가중치는 지역 제한 없이 MIT 라이선스로 공개되어 있으며, 상업적 사용과 파인튜닝이 무료입니다. 단, 자체 호스팅에 대한 현실적인 예산을 고려하세요: 약 750B 파라미터의 MoE 체크포인트는 클러스터 규모의 GPU 메모리가 필요합니다.

GLM-5.2가 이미지 입력을 지원합니까?

아니요. GLM-5.2는 텍스트 입력, 텍스트 출력입니다. 비전 작업의 경우 Z.ai는 별도의 GLM-V 모델 라인을 유지하거나, 이미지 요청을 멀티모달 모델로 라우팅할 수 있습니다.

OrcaRouter를 통해 GLM-5.2를 사용할 수 있나요?

네 — GLM-5.2가 OrcaRouter에서 z-ai/glm-5.2로 퍼스트파티 요금(마크업 없음)으로 제공되며, Claude, GPT, Gemini 및 기타 모델들과 함께 하나의 OpenAI 호환 엔드포인트를 통해 사용할 수 있습니다.

GLM-5.2를 프로덕션에 투입할 준비가 되셨나요? 몇 분 안에 실행하세요 — OrcaRouter 계정을 만들고 GLM-5.2, Claude Opus 4.8 및 기타 모든 주요 모델을 하나의 OpenAI 호환 엔드포인트를 통해 호출하세요. 프론티어급 코딩이 훨씬 저렴해졌습니다; 라우팅 레이어가 절약된 비용을 수집하는 방법입니다.



© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube