GLM-5.3 대 Kimi K3 비교를 위한 타이틀 카드: 왼쪽의 더 작은 큐브는 GLM-5.3으로 표시되어 있고 '743B 베이스 사후 훈련'이라는 라벨이 붙어 있으며, 오른쪽의 더 큰 큐브는 Kimi K3로 표시되어 있고 '2.8T 베이스 처음부터 구축'이라는 라벨이 붙어 있다.
Guides & Insights

GLM-5.3 vs Kimi K3: 743B 기본 모델에서 성능 짜내기 vs 2.8T 모델 구축 — 어느 내기가 이득일까?

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

중국 오픈 웨이트 경쟁은 방금 같은 질문에 대한 두 가지 답으로 갈라졌습니다. Moonshot AI는 Kimi K3를 처음부터 구축했습니다. — 2.8조 파라미터의 mixture-of-experts(MoE) 기반 모델로, 지금까지 공개된 오픈 웨이트 모델 중 가장 큰 규모이며, 2026년 7월 16일에 발표되었고 가중치는 7월 27일에 뒤이어 공개되었습니다. G​L M-5.3은 정반대의 베팅입니다. Z.ai는 GLM-5.2를 구동했던 바로 그 7,430억 파라미터 기반 모델을 유지한 채 출시 주기 전체를 포스트 트레이닝에 투자했으며, 기반 모델의 지능 한계는 결코 문제가 아니었다고 주장합니다. 두 모델 모두 1M 컨텍스트를 갖춘 코딩 및 에이전트 중심의 플래그십 모델이며, 둘 다 시장 최고의 오픈 코딩 모델이라고 주장합니다. 둘 다 같은 예산을 쓰는 최선의 방법일 수는 없으며, 벤치마크는 실제로 정확히 반으로 갈립니다. 따라서 이는 비교라기보다 차세대 프론티어 모델을 어떻게 구축할지에 대한 국민투표에 가깝습니다.

프론티어 모델을 구축하는 방법에 대한 두 가지 베팅

Z.ai는 GLM-5.3을 세대교체형 업그레이드라기보다 "deep dig"라고 부른다. 베이스는 GLM-5.2와 바이트 단위로 동일한 743B 모델이며, 그 차이는 전적으로 사후 훈련에 있다. 오픈소스 slime 프레임워크를 통해 실제 클러스터, 스토리지 시스템, 코드베이스에 걸쳐 진단, 수정, 검증, 배포를 아우르는 전체 엔지니어링 세션 단위의 작업들이 수행되었으며, 일부는 선임 엔지니어의 며칠치 작업이 필요하다. 벤더가 보고한 개선 폭은 크다. 자체 Code Bench에서 50% 점프, Terminal-Bench 3.0은 4.6에서 28.3으로, DeepSWE v1.1은 46.2에서 66.9로, 그리고 가중치가 공개되기 전에 안전 검토를 강제한 사이버 역량까지. Moonshot은 반대 방향으로 갔다. Kimi K3는 완전히 새로운 베이스다. 총 2.8T 파라미터에 토큰당 약 104B의 활성 파라미터(896개 전문가 중 16개), Kimi Delta Attention 아키텍처, 기본 제공되는 이미지·비디오 입력, 끌 수 없는 상시 추론, 그리고 입력과 출력 모두에 걸친 1M 컨텍스트 윈도우를 갖추고 있다. Z.ai가 같은 모델을 더 많이 쓰는 것으로 충분하다고 베팅하는 반면, Moonshot은 베이스 자체가 한계였다고 베팅한다.

The Z.ai research blog post announcing GLM-5.3, dated August 14 2026, titled GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, with a Coding Plan / Code with ZCode call to action and a HuggingFace (Coming Soon) button.

일대일 비교, 출처가 첨부된

두 모델이 같은 페이지에 등장하는 유일한 곳은 Z.ai 자체 출시 표이므로, 나란히 제시된 수치의 출처가 바로 그것입니다. 해당 수치는 공급업체 보고 기준으로 표시되었으며 독립적으로 검증된 것은 아닙니다. Kimi K3의 단독 수치는 Moonshot이 7월에 발표한 수치 및 Artificial Analysis가 측정한 수치와 일치하지만, 아직 어느 중립 연구소도 두 모델을 모두 실행한 적은 없습니다.

Terminal-Bench 3.0 — G​LM-5.3이 28.3, Kimi K3가 17.4 (Z.ai의 표). 매치업에서 가장 큰 코딩 격차는 가장 새롭고 어려운 버전에서 나타났습니다.

Terminal-Bench 2.1 — G​LM-5.3은 88.2, Kimi K3는 88.3. 접전이다.

DeepSWE v1.1 — G​LM-5.3이 66.9점, Kimi K3가 67.5점. Kimi가 근소한 차이로 앞섬.

SWE-Marathon v1.1 — G​LM-5.3은 42.5, Kimi K3는 48.1. Kimi의 최고의 코딩 승리.

ExploitGym — G​LM-5.3은 105/130, Kimi K3는 36/70을 기록했다. G​LM의 거의 완벽한 싹쓸이다.

GDPval-AA v2 (지식 작업) — G​LM-5.3은 1,769이며 Kimi K3는 1,682입니다.

접근 — GLM-5.3: Coding Plan 구독 필요, 가중치는 약 8월 28일까지 제한됨. Kimi K3: API $3/$15로 제공 중, 가중치는 7월 27일부터 다운로드 가능.

A comparison scoreboard for GLM-5.3 and Kimi K3: GLM-5.3 shows Terminal-Bench 3.0 of 28.3, Terminal-Bench 2.1 of 88.2, DeepSWE v1.1 of 66.9, ExploitGym of 105/130, GDPval-AA v2 of 1,769 and weights around August 28, versus Kimi K3s 17.4, 88.3, 67.5, 36/70, 1,682, weights live since July 27 and $3/$15 API pricing.

보안 해자가 진정한 분리입니다.

코딩 벤치마크를 제외하면 결정적 차이는 사이버 보안이다. G​LM-5.3은 CyberGym에서 84.5를 기록해 Kimi K3의 80.0을 앞섰고, ExploitBench 점수는 54.4로 Kimi K3의 32.2의 거의 두 배다. ExploitGym에서는 그 격차가 단순한 차이가 아니라 완전히 다른 범주다. 2시간 및 6시간 실행에서 각각 105와 130 대 36과 70을 기록했다. 그래서 두 출시가 실제로는 매우 다르게 느껴진다. Kimi K3의 가중치는 수정된 MIT 라이선스 아래 공개되어 있는 반면, G​LM-5.3의 가중치는 안전성 강화를 위해 보류되고 있다. 이는 Z.ai가 이 모델이 취약점을 찾아내고 악용하는 데 충분히 능숙해서 가중치를 즉시 공개하는 것이 무책임하다고 느꼈기 때문이다. 여러분의 작업이 다른 사람의 코드를 감사하거나, 자동화된 취약점 사냥으로부터 자신의 코드를 방어하는 것과 관련이 있다면, 이것은 전체 비교에서 가장 관련성이 높은 부분이면서 동시에 가장 독립적으로 검증되지 않은 부분이기도 하다.

Kimi K3가 반격하는 곳

Kimi K3의 강점은 G​LM-5.3이 가장 취약한 분야, 즉 장기적 저장소 작업에서 두드러진다. DeepSWE와 SWE-Marathon에서 우위를 유지하고, Toolathlon Verified에서 선두를 달린다. 또한 1M-토큰 출력 창 덕분에 코드베이스 전체나 긴 에이전트 추적(trace)을 단 한 번에 작성할 수 있다. 상시 작동하는 추론 기능은 전체 추적을 API로 스트리밍하는데, 개발자들은 이것이 불투명한 요약 설명보다 에이전트 디버깅에 훨씬 유용하다고 평가해 왔다. 다만 운영상의 제약으로 추론 필드를 도구 호출 간에 그대로 다시 전달해야 하며, 어시스턴트 프리필은 지원되지 않는다. Artificial Analysis의 Intelligence Index에서 Kimi K3는 57점으로 전체 4위를 기록했고, 표준 세트 기준 작업당 비용은 약 $0.94다. 또한 이 모델은 중국 연구소가 출시한 모델 중 가장 비싸다: 입력 토큰 100만 개당 $3, 출력 토큰 100만 개당 $15로 Sonnet급 가격이다. 반면 G​LM-5.3은 구독 요금제 안에서만 제공되므로 토큰 단위로는 아직 가격이 책정될 수조차 없다.

접근과 비용의 현실

Kimi K3가 지금 OrcaRouter에서 Moonshot 자체 정가 — 백만 토큰당 3달러/15달러, 캐시 읽기 0.30달러, 마크업 0% — 로 제공되므로, 1M 컨텍스트 에이전트 작업을 나머지 스택과 동일한 키로 호출할 수 있고, 오픈 가중치는 자체 호스팅을 원할 때의 탈출 옵션입니다. G​LM-5.3은 구하기 어려운 모델입니다: 월 18~168달러 구독제에 포인트 시스템이 적용되며, 입력 시 6.9배, 출력 시 24배로 크레딧을 소모합니다. 중국 시간 기준 14:00~18:00 외 시간대에는 소모량이 절반이 되는 비수기 요금제가 적용되고, 안전성 검토가 끝날 때까지 토큰 단위 API는 없습니다. 라우팅 레이어는 실제로 2주간의 기간 동안 이러한 비대칭성을 완화합니다: G​LM-5.3의 API가 동일한 키에 도착하면, 패널 호출로 두 {{1}}오픈 코딩 플래그십{{/1}}을 자체 작업에 대해 실행하고 판정기가 이를 중재하게 할 수 있습니다. 기다릴 수 없다면, 이미 출시된 가중치를 가진 Kimi K3가 오늘 완전히 {{2}}온프레미스{{/2}}로 가져갈 수 있는 유일한 모델입니다.

The OrcaRouter model page for MoonshotAI Kimi K3, showing the New and Featured badges, the kimi/kimi-k3 slug, $3.00 per million input and $15.00 per million output pricing, and text plus image input.

어떤 베팅이 배당되고 있나요?

일주일을 사용해 본 솔직한 평가는 두 선택 모두 효과가 있지만, 워크로드에 따라 다르다는 것이다. 업무가 터미널 중심이고 보안과 관련이 깊으며 에이전트가 오케스트레이션하는 작업이라면, Z.ai가 공개한 증거에 따르면 G​LM-5.3이 더 유력한 방향이다. 사이버보안 격차가 충분히 크기 때문에, 직접 확인하기 위해 가중치를 2주 기다릴 가치가 있다. 업무가 긴 저장소 세션이나 멀티모달 입력, 또는 오늘 당장 가중치가 필요한 작업이라면, Kimi K3가 이 둘 중 실제로 이용 가능한 유일한 모델이다. 그리고 deep-repo에서의 우위는 라이브 API에서 지금 바로 검증할 수 있는 부분이다. 한 가지 명심할 점은, 이 비교의 맞대결 수치는 모두 Z.ai 자체 표에서 나온 것이므로, 독립 연구소가 두 모델을 모두 실행하기 전까지는 코딩 성능 차이를 방향성 지표로만 취급해야 한다는 것이다. 2주간의 기다림이 가져다줄 검증이 바로 그것이다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube