Qwen 3.8 vs GLM-5.2: 둘이 실제로 겹치는 첫 번째 벤치마크
Guides & Insights

Qwen 3.8 vs GLM-5.2: 둘이 실제로 겹치는 첫 번째 벤치마크

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 두 모델은 중국 오픈웨이트 AI 분야에서 정반대의 승부수를 가장 명확하게 보여줍니다. Zhipu의 GLM-5.2는 간결하고 검증된 모델로, 총 753B 파라미터 중 40B만 활성이며, 감사를 거친 Artificial Analysis Intelligence Index는 51이고, 2026년 6월부터 가중치를 다운로드할 수 있으며, 공개 가격은 $0.95 / $3.00입니다. AlibabaQwen3.8-Max는 극대주의적 승부수입니다: 약 2.4T 파라미터, 비공개 활성 파라미터 수, 그리고 — 최근까지는 — 아무런 수치도 없었습니다.

2026년 8월 3일 정식 출시는 이 시리즈의 다른 어떤 글도 갖지 못한 요소를 이 맞대결에 부여했다: 바로 두 모델 모두 점수가 있는 벤치마크다. Alibaba는 보고한다: Terminal-Bench 2.1에서 86.6; Artificial Analysis는 GLM-5.2를 82.7로 감사했다 (동일한 테스트에서). 처음으로 Qwen의 주장은 동일한 조건에서 독립적으로 측정된 경쟁사 수치와 나란히 놓일 수 있게 되었습니다. — 중요한 주의점: 두 수치 중 오직 하나만 심판에 의해 생성되었다는 점입니다.

빌더를 위한 참고 사항 — 이 문제를 가장 빠르게 해결하는 방법은 두 가지를 자신의 프롬프트에서 실행해 보는 것입니다. OrcaRouter는 200개 이상의 모델을 하나의 OpenAI 호환 엔드포인트 뒤에 배치하므로, 두 개의 SDK를 연결하지 않고도 동일한 작업에서 Qwen 3.8 Max와 GLM-5.2를 겨룰 수 있습니다.

TL;DR 요약. 유일하게 공유된 벤치마크에서 Qwen의 주장은 Terminal-Bench 2.1에서 3.9포인트 앞선다는 것이다 (86.6 vs 82.7). — 재현된다면 실질적인 결과이며, Qwen의 수치는 자체 보고이고 GLM의 수치는 감사를 받았다. 다른 모든 면에서 GLM-5.2는 실질적인 이점을 갖는다: 그것은 ~2배 저렴하고, $0.95 / $3.00에 Qwen의 $2 / $6과 대비하여, 가중치는 오늘 다운로드할 수 있고, 400억 개의 활성 파라미터로 실제 배포가 가능하며, 독립적인 인덱스 점수 51점을 보유한다 (Qwen은 없다). Qwen은 100만 토큰의 고정 요금 컨텍스트, GLM에는 없는 네이티브 멀티모달, 그리고 더 높은 잠재적 상한선으로 응답한다. 검증된 실용성은 검증되지 않은 큰 규모보다 프로덕션에서 여전히 우세하지만, 격차는 8월 3일에 좁혀졌다.

주요 시사점

이번 시리즈에서 처음으로 직접 겹치는 벤치마크:Terminal-Bench 2.1에서 Qwen3.8-Max는86.6(Alibaba 보고)을 기록했고, GLM-5.2는82.7(Artificial Analysis, 검증됨)을 기록했습니다. Qwen이 3.9점 앞서지만, 두 수치의 신뢰도는 동일하지 않습니다.

GLM-5.2는 대략 절반 가격입니다: $0.95 / $3.00 (1M당, AA 혼합 ~$0.90) 반면 Qwen3.8-Max의 $2 / $6.

활성 파라미터가 진정한 아키텍처의 핵심입니다: GLM-5.2 실행 시 활성 파라미터는 40B이며, 총 753B 중이다. 알리바바는 아직 Qwen의 활성 파라미터 수를 공개하지 않았으며, 이로 인해 서비스 비용을 모델링할 수 없습니다.

GLM의 가중치는 오늘 다운로드할 수 있으며; Qwen의 것은 이번 주 내로 약속되어 있고, 아직 라이선스나 저장소가 없습니다.

GLM-5.2는 감사된 지수 51을 보유하고 있습니다. Qwen3.8-Max는 미평가 상태입니다 — 비록 이전 모델인 Qwen3.7-Max는 46점을 기록했지만, 아래 GLM.

Qwen의 독특한 제공 사항: 1M 토큰 윈도우를 장문 프롬프트 추가 요금 없이 정액제로 제공하며, 기본 텍스트/이미지/비디오 입력 및 OmniDocBench 1.5 92.1을 지원합니다. GLM-5.2는 텍스트 중심입니다.

정확도 참고: 모든 Qwen3.8-Max 품질 수치는 Alibaba가 보고한 수치이며 제3자에 의해 검증되지 않았습니다. GLM-5.2 수치는 Artificial Analysis에서 제공한 것입니다. 동일한 벤치마크에서 자체 보고된 점수와 감사된 점수를 비교하는 것은 유익하지만 결정적이지는 않습니다. 공급업체 하네스와 평가 하네스가 다르기 때문입니다. Qwen 요금은 GA 요금표를 기준으로 하며 7월 미리보기 할인을 대체합니다.

사양과 가격, 나란히

여기 확실한 데이터가 있습니다. 각 수치에는 출처가 표기되어 있습니다.

• 제조사 / 상태 — Qwen3.8-Max: Alibaba; GA (2026년 8월 3일); GLM-5.2: Zhipu; 2026년 6월 출시

• 아키텍처 — Qwen3.8-Max: 총 ~2.4T, 희소 MoE; GLM-5.2: 총 753B, 희소 MoE (Artificial Analysis)

• 활성 매개변수 — Qwen3.8-Max: 알리바바가 아직 공개하지 않음; GLM-5.2: 활성 400억 (Artificial Analysis)

• 컨텍스트 창 — Qwen3.8-Max: 1M 토큰, 고정 요금 (추론 포함 983,616; 최대 출력 131,072); GLM-5.2: 1M 토큰 (Artificial Analysis)

Terminal-Bench 2.1 — Qwen3.8-Max: 86.6 (Alibaba 보고 기준); GLM-5.2: 82.7 (Artificial Analysis, 검증 완료)

• AA Intelligence Index — Qwen3.8-Max: 아직 평가되지 않음; GLM-5.2: 51 (Artificial Analysis)

• 기타 벤더 보고 점수 — Qwen3.8-Max: GPQA Diamond 92.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (Alibaba 보고); GLM-5.2: 기록은 타사 측정 결과임

• 모달리티 — Qwen3.8-Max: 텍스트, 이미지, 비디오 입력 → 텍스트 출력; GLM-5.2: 텍스트 중심

• 가격 (입력/출력) — Qwen3.8-Max: $2.00 / $6.00 (1M 기준, 고정); 캐시 입력 $0.25; GLM-5.2: $0.95 / $3.00 (1M 기준, AA 혼합 ~$0.90)

• 오픈 가중치 — Qwen3.8-Max: 이번 주 내 약속됨 (아직 라이선스 없음); GLM-5.2: 예 — 오늘 다운로드 가능

이 비교를 구성하는 두 가지 요소가 있는데, 첫 번째가 전체 시리즈에서 가장 유용한 데이터 포인트입니다.

첫째, Terminal-Bench가 겹친다는 점은 정말 유익한 정보를 줍니다. Terminal-Bench 2.1은 모델이 실제 셸을 완료까지 작동할 수 있는지 — 명령을 실행하고, 출력을 읽고, 오류에서 복구하는지 — 를 측정합니다. 이는 '코드 제안기가 아닌 코딩 에이전트로 기능할 수 있는가'에 대한 가장 근접한 대리 지표이며, 두 공급업체가 모두 보고하기로 선택한 벤치마크입니다. Qwen의 86.6과 GLM의 검증된 82.7을 비교하면 Qwen이 3.9포인트 앞섭니다.

주의할 점은 중요하지만 과장되어서는 안 됩니다. 벤더 하네스와 평가자 하네스는 스캐폴딩, 재시도 정책, 프롬프트 구성에서 차이가 있으며, 이러한 선택에 따라 Terminal-Bench 점수는 4점 이상 달라질 수 있습니다. 따라서 이것이 Qwen이 더 나은 에이전틱 모델이라는 증거는 아닙니다. 이 결과가 확립하는 것은 Qwen이 자체 보고한 주장이 터무니없는 영역이 아니라, 감사를 거친 최첨단 오픈웨이트 모델과 동일한 경쟁 범위에 들어간다는 것입니다. 이는 "점수 없음"보다 훨씬 더 유의미하게 강력한 위치입니다.

둘째, 아키텍처 비교는 GLM이 조용히 승리하는 부분입니다. GLM-5.2는 400억 개의 파라미터를 753B 중에서 활성화합니다. 그 숫자 하나가 서빙 비용, 지연 시간 프로파일, 그리고 제대로 갖춰진 팀이 실제로 실행할 수 있다는 사실을 말해줍니다. 알리바바는 여전히 Qwen의 활성 파라미터 수를 공개하지 않았습니다. 이는 2.4T라는 헤드라인 수치가 전달하는 모든 것에도 불구하고, 알리바바 외부의 누구도 Qwen3.8-Max의 서빙 비용이나 자체 호스팅 시 동작 방식을 추정할 수 없다는 뜻입니다. Mixture-of-Experts 비교에서 이것은 각주에 불과한 것이 아니라 가장 중요한 누락된 숫자입니다.

날렵하고 검증된 것 vs 크고 검증되지 않은 것

GLM-5.2의 사례는 일관된 엔지니어링 입장 위에 세워져 있다. 즉, 적은 자원으로 더 많은 것을 해내고, 수치를 공개하며, 가중치를 배포하는 것이다. 40B 활성 모델은 서빙 비용이 저렴하고, 구조적으로 빠르며, 상당하지만 터무니없지는 않은 GPU 예산을 가진 팀이라면 배포할 수 있다. 감사된 지수 51과 감사된 Terminal-Bench 82.7은 구매자가 어떤 것도 그저 믿고 받아들일 필요가 없다는 뜻이다. 그리고 $0.95 / $3.00이라는 가격은 Qwen 가격의 약 절반이다.

Qwen3.8-Max의 사례는 반대의 내기입니다: 가능한 한 가장 큰 모델을 만들고 성능이 비용을 정당화하게 하는 것입니다. GA는 마침내 숫자가 붙었기 때문에 그 주장을 훨씬 더 강하게 만들었습니다 — GPQA Diamond 92.6은 대학원 수준 과학에서, OSWorld-Verified 86.1은 GUI 조작에서, FrontierSWE 73.5는 이전 모델의 40.7과 비교되며, 앞서 논의된 Terminal-Bench 86.6도 있습니다. 그것들은 프런티어급 수치이며, FrontierSWE에서의 거의 두 배에 가까운 증가는 완전히 조작하기 어려운 세대적 도약입니다.

하지만 두 가지 공백이 남아 있으며, 그것은 7월에 중요했던 바로 그 두 가지입니다. 문제는 독립적인 점수가 없다는 것 — Artificial Analysis와 LMArena는 Qwen3.8-Max에 대해 아직 점수가 매겨지지 않았으므로, 모든 품질 주장은 Alibaba의 자체 주장입니다. 그리고 문제는 라이선스가 없다는 것, 그래서 오픈웨이트 약속은 아직 상업적으로 평가될 수 없습니다.

역사적 기준점은 대부분의 대결에서보다 여기서 Qwen에게 더 불리하게 작용합니다. 전작인 Qwen3.7-Max는 46점을 AA 지수에서 기록하여 GLM-5.2의 51점보다 낮았습니다. 따라서 Alibaba의 암묵적 주장은 Qwen3.8-Max가 단지 좋다는 것만이 아니라, 한 세대 만에 GLM보다 아래에서 그보다 훨씬 위로 도약했다는 것입니다. FrontierSWE 개선은 그 주장에 일부 신뢰성을 부여합니다. 독립적인 점수가 이를 판가름할 것입니다.

실제 비용: 2배가 어디에 해당하는가

에이전트 기반 코딩 파이프라인을 예로 들어 보세요: 180,000개의 리포지토리 컨텍스트 토큰, 실행당 10,000개의 출력 토큰.

GLM-5.2: 0.18M × $0.95 = $0.171, 더하기 0.01M × $3.00 = $0.03. ≈ 회당 $0.20.

Qwen3.8-Max: 0.18M × $2 = $0.36, 더하기 0.01M × $6 = $0.06. ≈ 실행당 $0.42.

• 하루 3,000회 실행 시: GLM ≈ $603/일; Qwen ≈ $1,260/일 — 대략 월 $20,000 차이.

• 안정적인 저장소에서 Qwen의 캐시된 입력이 $0.25/1M일 때, 실행 비용은 약 $0.11까지 떨어지며, 이는 실제로 GLM의 캐시되지 않은 비용보다 낮습니다.

마지막 줄은 이 비교에서 가장 실질적으로 유용한 내용입니다. Qwen의 공시 가격은 GLM의 두 배이지만, 캐시 적중률이 1M당 $0.25로 공격적이어서 잘 캐시된 파이프라인은 순위를 뒤집을 수 있습니다. 에이전트가 매 턴마다 거의 변경되지 않은 컨텍스트를 다시 읽는다면(대부분의 코딩 에이전트가 여기에 해당) 요금표가 더 나쁨에도 불구하고 실제로는 Qwen이 더 저렴한 선택일 수 있습니다. 캐싱을 구성하지 않는 팀은 아무 이득 없이 두 배를 지불하게 됩니다.

두 모델 모두 추론 토큰을 출력으로 청구하므로, 추론이 많은 구성은 양쪽 모두에서 이러한 추정치보다 비용이 더 많이 듭니다.

배포 용이성: GLM이 소유한 축

둘 다 1M 토큰 컨텍스트를 주장하는 중국의 오픈 가중치 MoE 모델로, 배포 용이성이 가장 뚜렷한 실질적 차이를 만든다.

GLM-5.2의 가중치는 6월부터 다운로드할 수 있었으며, 40B 활성 파라미터 기준으로 현실적인 자체 호스팅 대상입니다 — 양자화가 가능하고, 적절한 수의 GPU에서 서빙할 수 있으며, 이미 커뮤니티에서 검증되었습니다.

Qwen3.8-Max의 가중치는 이번 주 안에 공개될 예정이지만, 플래그십 모델은 누구에게도 현실적인 목표가 아니다: 대략 4비트 기준 1.2TB는 H200당 약 141GB와 비교하면 상위급 가속기 8개 이상이 필요하며, 공개되지 않은 활성 파라미터 수로 인해 결과적인 처리량을 예측할 수 없다. 여기에 라이선스도 빠져 있으므로, 지금으로서는 플래그십 자체 호스팅은 계획이 아니다.

동시에 발표된 Qwen3.8-27B는 이 축에 대한 알리바바의 진정한 답변입니다. 또한 오픈 가중치로 공개되며 약 17GB의 VRAM에서 실행되는 것으로 알려졌습니다. 단일 하이엔드 카드로, GLM-5.2의 메모리 사용량보다 훨씬 낮은 수준이며, 배포 용이성에서 직접적으로 경쟁합니다. 두 모델 중 어느 쪽에 관심이 있든 직접 실행하는 것이라면, Qwen 27B와 GLM-5.2의 비교가 실제로 중요해질 것이며, 2.4T 대 753B보다 훨씬 더 치열한 경쟁입니다.

자주 묻는 질문

Qwen 3.8이 GLM-5.2보다 더 좋은가요?

두 모델이 공유하는 유일한 벤치마크에서 Qwen은 우위를 주장한다 — Terminal-Bench 2.1에서 86.6으로, 감사된 GLM의 82.7에 맞서서. 하지만 Qwen의 수치는 자체 보고된 수치이고 GLM의 수치는 Artificial Analysis가 측정한 것이며, 하네스 차이는 4점 차이를 초과할 수 있다. GLM-5.2는 또한 감사된 지수 51을 보유하고 있는 반면, Qwen은 독립적인 점수가 전혀 없다. GLM이 더 안전한 선택이고, Qwen은 검증되지 않은 더 높은 상한선을 가지고 있다.

Terminal-Bench 2.1에서 어떻게 비교되나요?

Qwen3.8-Max는 86.6을 보고했고, Artificial Analysis는 GLM-5.2를 82.7로 측정했습니다. 이는 Qwen이 3.9포인트의 명목상 우위를 차지한 것이며, 두 모델 간의 첫 동일 벤치마크 겹침입니다. 이는 Qwen이 그 대역에서 경쟁력이 있다는 증거로 읽어야지, 앞서 있다는 증명으로 읽어서는 안 됩니다. 오직 GLM의 수치만 독립적으로 산출되었기 때문입니다.

어느 게 더 싸요?

GLM-5.2의 요금표 기준 — 1M당 $0.95 / $3.00 (AA 블렌드 ~$0.90) 대비 Qwen의 $2 / $6, 대략 절반입니다. 하지만 Qwen의 캐시된 입력은 1M당 $0.25로 공격적이어서, 캐시 사용률이 높은 파이프라인은 캐시되지 않은 GLM보다 Qwen에서 더 저렴해질 수 있습니다.

Qwen 3.8 Max는 몇 개의 활성 파라미터를 사용하나요?

알리바바는 일반 공급(general availability) 시점에도 그 수치를 공개한 적이 없다. 그 수치는 Mixture-of-Experts 모델에서 서빙 비용과 지연 시간을 결정하는 숫자이므로, 그 부재는 실질적인 공백이다. 반면 GLM-5.2는 총 753B 중 40B 활성(active)으로 문서화되어 있다.

실제로 어떤 것을 셀프 호스팅할 수 있나요?

오늘 GLM-5.2가 공개됐다. 가중치가 공개되었고 40B 활성 파라미터로 실행 가능한 수준이다. Qwen3.8-Max의 가중치는 이번 주 안에 공개될 예정이지만, 플래그십 모델은 4비트 기준 약 1.2TB 용량으로 H200급 GPU 8개 이상이 필요하며 아직 라이선스도 공개되지 않았다. 함께 발표된 Qwen3.8-27B는 VRAM 약 17GB로 알려져 있으며, 배포 가능한 Qwen 옵션이자 GLM의 틈새에 더 부합하는 모델이다.

Qwen 3.8 Max가 프리뷰를 벗어났나요?

네, 2026년 8월 3일에 게시된 요금표와 OpenAI 및 DashScope 호환 엔드포인트를 갖추고 있습니다. 7월의 90% 할인 Qoder 크레딧 캠페인은 더 이상 판매 방식을 설명하지 않습니다.

{{1}}Qwen{{/1}}이 제공하지만 {{2}}GLM-5.2{{/2}}가 제공하지 않는 것은 무엇인가?

네이티브 멀티모달리티 — 이미지 및 비디오 입력, 문서 파싱에서 자체 보고된 OmniDocBench 92.1 — 및 장문 프롬프트 추가 요금 없이 고정 요금으로 청구되는 1M 토큰 컨텍스트. GLM-5.2는 텍스트 중심이므로 문서, 스크린샷, 비디오 파이프라인의 경우 Qwen은 GLM-5.2와 경쟁하기보다는 다른 작업을 수행하는 셈이다.

결론

Qwen 3.8 대 GLM-5.2는 일반 공개가 가장 진정으로 새로운 정보를 제공한 매치업입니다. 처음으로 Qwen은 독립 평가자도 실행한 벤치마크에서 점수를 기록했으며, GLM보다 높은 점수를 받았습니다: Terminal-Bench 2.1에서 86.6 대 82.7. 이로써 Qwen은 '미평가(unscored)' 상태에서 '측정된 기준에서 그럴듯하게 경쟁적'인 상태로 이동했으며, 이는 자체 보고라는 한계를 감안하더라도 실질적인 진전입니다.

하지만 GLM-5.2는 실용성의 왕좌를 유지하며, 그 이유는 화려하지 않은 강점들 덕분이다: 절반 가격, 감사를 거친 지수 51, 예측 가능한 경제성과 달성 가능한 배포를 보장하는 40B 활성 파라미터, 그리고 지금 바로 다운로드할 수 있는 가중치. Qwen의 답변(정액제 백만 토큰 컨텍스트, 네이티브 멀티모달리티, 더 높은 상한)은 의미가 있지만 조건부이며, 7월의 두 가지 공백은 그대로다: 독립 점수와 라이선스가 없다. 세 가지를 주목하라: Qwen3.8-Max의 첫 독립 Intelligence Index 점수, 평가자가 그 86.6 Terminal-Bench 수치를 재현하는지 여부, 그리고 Qwen3.8-27B 출시 — 이 두 철학이 진정으로 충돌하는 지점이다. 그때까지 GLM-5.2는 당신이 배포하는 모델이고 Qwen3.8-Max는 평가하는 모델이다 — 캐싱을 켠 상태로.

이 글에서 비교한 모델3

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트