GLM-5.2 vs Kimi K3의 히어로 타이틀 카드로, 부제는 '더 저렴하고 빠르게, 아니면 더 크고 더 좋게', 세 개의 둥근 알약형 배지에는 각각 '1M 토큰 컨텍스트', 'AA Index 34 vs 44', '$1.40 / $4.40 vs $3.00 / $15.00'이라고 적혀 있고, 하단 줄에는 '벤더 요금표 및 Artificial Analysis, 2026-09-23'이 표시되며, 오른쪽 하단 모서리에는 OrcaRouter 로고가 있습니다.
Guides & Insights

GLM-5.2 vs Kimi K3: 더 저렴하고 빠른가, 아니면 더 크고 더 나은가

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

GLM-5.2Kimi K3는 2026년 중반에 한 달 간격으로 등장했고, 서로 거의 완벽하게 반대다. 2026-07-16에 공개되고 2026-07-27에 오픈 웨이트가 뒤따른 Kimi K3는 더 크고 서류상으로는 더 나은 모델이다: 2.8조 개의 파라미터 중 1040억 개가 활성이며, 두 모델이 비교된 거의 모든 벤치마크에서 더 높은 점수를 기록했다. GLM-5.2는 2026-06-16부터 출시되어 있으며, 7530억 개의 파라미터에 400억 개가 활성인 둘 중 더 작은 모델이고, 출력 토큰당 비용이 약 3분의 1이며, 중간값에서 더 빠르게 응답하고, 수익 트리거가 있는 맞춤형 라이선스가 아닌 MIT로 배포된다.

그것이 한 문단으로 정리된 결정입니다. 이어지는 내용은 그 결정을 뒷받침하는 근거입니다 — 실제로 실행할 법한 작업에 대한 가격 계산, 두 값이 차이가 잡음에 불과할 만큼 가까운 측정치들, 그리고 바로 옆에 인쇄된 숫자와 비교할 수 없는 널리 알려진 숫자 하나.

두 사람이 서 있는 곳

둘 다 일반적으로 각 공급업체 자체 API를 통해 이용할 수 있고, 둘 다 OrcaRouter에서 라우팅할 수 있으며, 둘 다 다운로드 가능한 가중치를 제공합니다. 벤치마크를 들여다보기도 전에 중요한 차이점은 다음과 같습니다:

• 출시 — GLM-5.2는 2026-06-16, Kimi K3는 2026-07-16 (Artificial Analysis 모델 페이지 기준. OrcaRouter 자체 Kimi K3 모델 페이지에서는 하루 이른 2026-07-15로 기재)

• 가중치 — MIT 라이선스로 공개된 GLM-5.2 vs Kimi K3 라이선스로 공개된 Kimi K3. 후자는 연간 모델-서비스(Model-as-a-Service) 매출 2천만 달러 초과 시 별도 계약이 필요하며, 월간 사용자 1억 명 초과 시 저명한 출처 표시가 요구됨(내부 연구 및 개발은 예외)

• 규모 — GLM-5.2 전체 753B / 활성 40B vs Kimi K3 전체 2.8T / 활성 104B

• 컨텍스트 — GLM-5.2 1,000,000 토큰 vs Kimi K3 1,048,576 토큰

• 입력 — GLM-5.2는 텍스트 입력, 텍스트 출력 vs Kimi K3는 텍스트 및 이미지 입력, 텍스트 출력

• 공개된 최대 출력 — GLM-5.2 128,000토큰 vs Kimi K3의 OrcaRouter 페이지에는 미공개

OrcaRouter에서는 둘 다 https://api.orcarouter.ai/v1의 하나의 OpenAI 호환 엔드포인트에서 하나의 키 뒤에 있으며, 저희는 공급자의 정가를 마크업 없이 그대로 전달합니다. 따라서 아래의 모든 수치는 저희 것이 아니라 공급업체의 수치입니다.

무언가 대가를 치러야 하는 작업에서 백만 토큰에 드는 비용

먼저 공급업체 요금표는 2026년 9월 23일에 공급업체 자체 가격 페이지에서 읽은 내용입니다. Z.ai는 GLM-5.2를 백만 입력 토큰당 $1.40으로 표시하며, 백만 캐시된 입력 토큰당 $0.26, 백만 출력 토큰당 $4.40입니다. Moonshot은 Kimi K3를 입력 $3.00, 캐시 읽기 $0.30, 출력 $15.00으로 표시합니다 — 추가로 캐시 쓰기 요금은 5분 캐시의 경우 백만당 $3.00, 1시간 캐시의 경우 백만당 $6.00입니다. 이는 공개된 가격이며 독립적으로 감사된 가격이 아니며, 어느 공급업체든 이를 변경할 수 있습니다.

그들을 대부분 읽기인 작업에 투입하세요: 600,000토큰 코드베이스 리뷰와 8,000토큰의 서면 답변을 포함하는 작업입니다. GLM-5.2에서는 0.6 x $1.40 = $0.84의 입력에 0.008 x $4.40 = $0.035의 출력을 더해 약 $0.88입니다. Kimi K3에서는 0.6 x $3.00 = $1.80에 0.008 x $15.00 = $0.12를 더해 약 $1.92입니다. 동일한 작업에 대해 대략 2.2배의 비용입니다.

이제 코드베이스가 이미 제공업체의 캐시에 들어 있는 상태에서 다시 실행해 보자. 입력 라인은 캐시 읽기 요율로 줄어들고, 2.1배 차이가 나던 두 가격은 백만 토큰당 $0.26 대 $0.30가 된다 — 15% 차이다. 이것은 비교에서 가장 덜 논의되는 숫자이면서, 매 턴마다 같은 컨텍스트를 다시 읽는 에이전트에게 가장 중요한 숫자다. 여기에는 별표도 붙는다: Kimi K3는 캐시를 쓰는 데 별도로 과금하고, GLM-5.2의 페이지는 쓰기 요금을 전혀 명시하지 않는다. 따라서 콜드 스타트는 Kimi K3에서 $3.00이라는 대표 수치가 시사하는 것보다 상당히 더 든다.

• 60만 토큰 읽기, 8천 토큰 답변 기준 — GLM-5.2 약 $0.88 vs Kimi K3 약 $1.92

• 동일한 캐시된 입력 라인 — 600k 토큰당 GLM-5.2 $0.16 vs Kimi K3 $0.18

A self-built two-column scoreboard for GLM-5.2 vs Kimi K3. Left column 'GLM-5.2' (753B total / 40B active, MIT, $1.40 / $4.40): Intelligence Index 34, blended price per million $0.902, cost per task $0.96, output speed 68.2 tok/s, long context AA-LCR 78%, agentic AutomationBench 28%. Right column 'Kimi K3' (2.8T total / 104B active, Kimi K3 License, $3.00 / $15.00): Intelligence Index 44, blended price per million $2.31, cost per task $2.00, output speed 36.7 tok/s, long context AA-LCR 89%, agentic AutomationBench 58%. Footer reads 'Benchmark, speed and cost figures per Artificial Analysis (Intelligence Index v4.3.2, read 2026-09-23), both models in their maximum-reasoning configuration. Vendor list prices per Z.ai and Moonshot. OrcaRouter passes provider list price through at 0% markup.'

독립 모델은 방향에는 동의하지만 규모에는 동의하지 않는다. Artificial Analysis는 캐시 적중, 입력 및 출력 토큰을 7:2:1 비율로 혼합하고 모델이 실제로 소모하는 추론 토큰을 더하는데, v4.3.2 지수 기준으로 2026-09-23에 확인한 이 둘에 대한 수치는 GLM-5.2를 백만 혼합 토큰당 $0.902로, Kimi K3를 $2.31로 제시하며, 자체 평가 작업 하나를 완료하는 비용은 $0.96 대 $2.00이다. 전체 Intelligence Index를 한 번 실행하는 비용은 GLM-5.2에서 $1,559, Kimi K3에서 $3,658이다.

그 비용 모델에는 직관에 반하는 세부 사항이 숨어 있다. Kimi K3는 더 적은 작업당 출력 토큰을 GLM-5.2보다 사용한다 — 48,000 대 64,000 — 그리고 추론 토큰도 더 적게, 32,000 대 51,000을 사용한다. 이 모델은 단위 작업당 더 경제적이면서도 작업당 비용은 대략 두 배나 된다. 토큰당 가격이 입력에서 2.1배, 출력에서 3.4배이기 때문이다. 작업당 저렴함과 토큰당 저렴함은 서로 다른 속성이며, 이는 두 속성이 반대 방향을 가리키는 조합이다.

컨텍스트 윈도우, 그리고 실제로 그 안에 들어가는 것

이 둘은 수치상 서로 5% 이내의 차이다: 1,000,000 토큰 대 1,048,576 토큰. 그것을 Kimi K3의 승리로 보고하는 것은 우스운 일일 것이다. 둘 다 백만 토큰 모델이고 컨텍스트 창은 차별화 요소가 아니다; 솔직한 질문은 각 모델이 중간에 파묻힌 텍스트를 상대로 여전히 무엇을 할 수 있는가이다.

그것이 바로 Artificial Analysis의 장문맥 추론 평가가 측정하는 내용이며, 데이터셋에서 더 큰 격차 중 하나입니다: Kimi K3는 89%를 기록한 반면 GLM-5.2는 78%입니다. 대규모 코퍼스를 불러와 그 양끝에서 온 사실들을 연결해야 하는 질문을 던지는 것이 당신의 일이라면, Kimi K3를 선택할 이유는 추가된 48,576 토큰이 아니라 11포인트의 장문맥 격차입니다.

창 아래의 바닥도 다릅니다. GLM-5.2는 128,000토큰의 최대 출력을 공개합니다. Kimi K3의 페이지는 이에 상응하는 수치를 공개하지 않으므로, 우리는 그 수치를 제공하지 않겠습니다. 긴 문서를 읽는 것이 아니라 생성하는 경우라면, 둘 중 하나를 구매하기 전에 그 비대칭성을 자신의 워크로드와 대조해 확인해 볼 가치가 있습니다.

속도: GLM-5.2가 독보적으로 장악한 단 하나의 축

여기서 두 개의 독립적인 측정이 같은 방향을 가리킨다는 점은, 그것들이 모든 면에서 일치하지는 않기 때문에 바로 말할 가치가 있다.

2026-09-23까지의 7일 동안 자체 라우팅 데이터에 따르면, GLM-5.2는 첫 토큰까지 중앙값 3.28초를 기록한 반면 Kimi K3는 8.09초였고, 스트리밍 속도는 초당 68.1토큰 대 43.4토큰이었습니다. 두 모델의 첫 토큰까지 걸리는 p95 시간은 정확히 10.00초입니다. 별도로 측정한 Artificial Analysis에서는 GLM-5.2가 초당 출력 토큰 68.2개로 Kimi K3의 36.7개를 앞섰고, 종단 간 시간은 41.29초 대 72.13초, 첫 답변까지 걸리는 시간은 33.95초 대 58.52초였습니다.

A screenshot of the OrcaRouter model page for GLM 5.2 (z-ai/glm-5.2) captured 2026-09-23, showing the FEATURED badge, the byline 'by Z.ai · 2026-06-16', a 1M-token context with 128K maximum output and text in / text out, rate cards of $1.40 input and $4.40 output per 1M tokens with a $0.260 cache read, a p50 time to first token of 3.28 s against a p95 of 10.00 s, 29.4M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 68.1 tokens per second and a 9.2% error rate.

두 출처는 한 지점에서 서로 엇갈리며, 이는 덮어 두기보다 짚고 넘어갈 만하다. Artificial Analysis는 원시 첫 토큰까지의 시간에서 Kimi K3를 4.08초 대 4.62초로 약간 앞선다고 본다. 반면 우리 자체 라우팅에서는 GLM-5.2가 p50 기준으로 거의 2.5배 더 빠르다. 서로 다른 엔드포인트, 서로 다른 업스트림 제공자, 서로 다른 측정 구간이다. 처리량 방향성 — GLM-5.2가 확실히 더 빠르다는 점 — 은 견고한 것으로 받아들이고, 첫 토큰까지의 시간 수치는 우리 것이든 그쪽 것이든 특정 한 주의 속성으로 받아들이자.

우리 GLM-5.2 페이지에도 조용히 빼놓지 않을 수치가 하나 있습니다: 같은 7일 동안 9.2%의 오류율을 보였는데, Kimi K3는 0.26%였습니다. 그 정도 격차는 GLM-5.2를 제공하는 업스트림 공급자에게 나쁜 한 주였을 가능성과 모델 자체의 특성일 가능성이 비슷하며, 7일은 그 차이를 가려내기에는 충분히 긴 기간이 아닙니다. 이는 라우팅이 해결하기 위해 존재하는 종류의 문제입니다 — 공급자가 11건 중 1건의 요청을 실패할 때, 자동 장애 조치가 누구도 온콜 담당자를 호출하지 않은 채 트래픽을 옮깁니다.

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) captured 2026-09-23, showing the FEATURED badge, the byline 'by MoonshotAI · 2026-07-15', text-and-image input with text output, a 1,048,576-token context, rate cards of $3.00 input and $15.00 output per 1M tokens with a $0.300 cache read, a p50 time to first token of 8.09 s against a p95 of 10.00 s, 1116.2M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 43.4 tokens per second and a 0.26% error rate.

벤치마크: 진짜 완승, 다만 헤드라인보다는 좁은

Kimi K3는 두 모델이 모두 실행된 거의 모든 항목에서 승리합니다. 다음은 인덱스 리비전 v4.3.2 기준의 Artificial Analysis 수치이며, 두 모델 모두 최대 추론 구성으로 2026-09-23에 조회한 값입니다:

• 지능 지수 — Kimi K3 44 vs GLM-5.2 34

• AA-Briefcase v1.1 — 1510 대 1233

• GDPval-AA v2.1 — 1524 대 1358

• AutomationBench-AA — 58% 대 28%

• Terminal-Bench 4.0 — 13% vs 1%

• SciCode — 59% 대 51%

• Humanity's Last Exam — 47% vs 41%

• GDP.pdf — 22% 대 10%

• AA-LCR v1.1 — 89% 대 78%

• CritPt — 23% 대 21%

누구든 그 목록을 스크린샷 찍기 전에 두 가지 주의할 점이 있습니다.

먼저, 지수 개정입니다. Kimi K3의 7월 출시 당시 보도에서는 Intelligence Index에서 Kimi K3를 57, GLM-5.2를 51로 언급했습니다. 오늘자 라이브 페이지에는 44와 34로 나옵니다. 이 둘은 같은 측정값이 아닙니다 — Artificial Analysis는 지수를 개정하고 그에 맞춰 모델 점수를 다시 매기며, 7월 수치를 9월 수치 옆에 놓는 것이 이 조합에서 저지르기 가장 쉬운 실수입니다. 방향성은 모든 스냅샷에서 안정적이지만, 절대 수치는 개정 간에 비교할 수 없습니다.

둘째, 수준입니다. Terminal-Bench 4.0에서 13%와 1%는 까다로운 평가이며, 그 수준에서는 비율이 두 숫자 중 어느 하나보다 더 많은 것을 알려줍니다. 모델이 자기 지식의 한계를 아는지 탐구하는 AA-Omniscience에서는 GLM-5.2가 4로 Kimi K3의 20과 대비되는데, 둘 중 하나를 감독 없이 실행할 계획이라면 알아둘 만한 하한선입니다.

Artificial Analysis가 GLM-5.2 리스팅에 관해 기록한 한 가지 더: 더 새로운 GLM-5.3을 권장하며 최대 추론 구성을 지원 중단(deprecated)으로 표시합니다. 이는 위 수치를 전혀 바꾸지 않습니다. 위 수치는 측정된 그대로의 GLM-5.2 스냅샷이기 때문입니다. 하지만 Z.ai의 로드맵이 이 모델을 지나 다음으로 넘어갔다는 뜻이기는 합니다. 라우팅된 엔드포인트에서는 마이그레이션이 아니라 모델 문자열을 바꾸는 비용만 드는데, 이것이 이 두 이름 중 어느 것도 애플리케이션에 하드코딩하지 말아야 하는 주된 이유입니다.

에이전트와 도구 사용: 격차가 가장 큰 지점

그 표에서 한 블록이 구매를 결정해야 한다면, 바로 이 블록입니다. 장기 호라이즌 에이전트 작업은 Kimi K3의 격차가 가장 크고 가장 일관되게 나타나는 분야입니다:

• AutomationBench-AA — 58% 대 28%, 30포인트 격차

• GDPval-AA v2.1 — 1524 대 1358

• AA-Briefcase v1.1 — 1510 대 1233

• Terminal-Bench 4.0 — 13% vs 1%

Moonshot의 자체 릴리스 자료도 같은 이야기에 기대고 있다 — K3 가중치 공개는 해당 벤더의 전문가 병렬 학습 스택과 에이전트 환경 하네스를 다룬 기술 보고서와 함께 나왔다는 — 하지만 벤더 자료는 벤더 자료일 뿐이고, 위에 나온 수치들은 독립적인 출처의 것이다.

제3자 집계기관인 LLM Stats는 공유 벤치마크 세트에 대해 자체 종합 점수를 산출하는데, 다른 방향에서 같은 결론에 도달한다. 두 모델 모두에 대해 점수를 매기는 11개 벤치마크 중 Kimi K3가 11개를 모두 가져가며, 범주 점수에서는 도구 사용(30.8 대 19.6), 에이전트(38.3 대 29.6), 코딩(42.3 대 34.8)에서 Kimi K3를 앞세운다. 이는 LLM Stats 자체 가중치에 따른 자체 종합 점수이고, 크지 않은 공유 세트를 대상으로 한 것이므로, 실험실 결과가 아니라 보강 증거로 취급하라. 그래도 11개 중 11개는 여전히 접전이 아니다.

코딩

방향은 같지만 격차는 더 작다. 코딩 평가에서 Artificial Analysis가 두 모델 모두에 대해 산출한 점수에서 Kimi K3는 SciCode에서 59% 대 51%로 앞서고, LLM Stats의 공유 세트에서는 DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench, Terminal-Bench 2.1을 차지한다. GLM-5.2의 듣기 좋은 수치 — 서드파티 애그리게이터가 전하는 AIME 2026 99.2%, HMMT 2025 94.4%, GPQA 91.2% — 는 벤더가 보고한 것이고 재현되지 않았으며, 그중 대부분은 소프트웨어 엔지니어링보다 경시 수학을 측정한다.

실용적인 판단: 오랫동안 실행되고 많은 파일을 편집하며 스스로의 실수에서 복구해야 하는 코딩 에이전트에게는 Kimi K3가 에이전트 작업에서 갖는 우위가 두 모델 중 어느 쪽의 수학 점수보다도 더 관련성 높은 신호다. 빠르고 저렴하며 대체로 단일 시도로 처리하는 코드 어시스턴트에게는 GLM-5.2의 처리량 우위가 벤치마크 격차가 초래하는 비용보다 더 가치가 있다.

그것들이 충분히 가까워서 문제가 되지 않을 정도라면

• 캐시된 입력 가격 — 백만 개당 $0.26 vs $0.30, 출력의 3.4배 격차에 비해 15% 격차

• 컨텍스트 윈도우 — 1,000,000 vs 1,048,576 토큰

• p95 첫 토큰까지 걸리는 시간 — 자체 라우팅에서 10.00초 vs 10.00초

• CritPt — 23% 대 21%

• 수학 — LLM Stats는 수학 종합 점수에서 GLM-5.2를 근소하게 앞세우며(41.4 대 40.9), Kimi K3는 이미지 포함 수학에서 앞선다; 이용 가능한 증거로 볼 때 어느 모델도 산술을 완전히 장악하지는 못한다

이 모델들 중 하나가 전반적으로 다른 하나보다 두 배라고 말하는 사람은 표의 단 한 행만 보고 있는 것이다.

GLM-5.2를 선택하세요, 만약…

당신은 청구서를 지불하고 있고, 청구서가 제약 조건입니다. GLM-5.2는 출력 가격이 대략 3분의 1이고, 캐시된 라인에서도 더 저렴하며, MIT 라이선스라 확인할 수익 트리거가 없고, 중앙값에서 더 빠르며 스트리밍할 때 훨씬 더 빠르고, 백만 토큰 창은 Kimi K3의 것과 충분히 가까워 그 차이가 무엇도 결정하지 못할 정도입니다. 워크로드가 텍스트 입력 및 텍스트 출력이고, 긴 도구 호출 체인보다는 대부분 읽기라면, Kimi K3의 추가 벤치마크 점수는 애플리케이션이 결코 얻을 수 없는 점수입니다.

다음의 경우 Kimi K3를 선택하세요…

이 작업은 에이전트적이고 오래 걸린다. 30점의 AutomationBench 격차, GDPval과 AA-Briefcase에서의 우위, 11점 차 장문맥 추론 우위, 그리고 LLM Stats의 공유 세트 석권은 모두 같은 방향을 가리킨다: Kimi K3는 다단계 작업을 맡기고 자리를 떠나기에 더 나은 모델이다. 또한 둘 중 이미지를 받아들이는 유일한 모델이기도 하다. 그 대가로 작업당 대략 두 배를 지불하게 되며, 작업 세트가 많이 캐시되어 있다면 두 배 미만을 지불하게 된다 — 하지만 그것을 택하는 이유는 가격이 아니며, 속도도 아니다.

둘 다 OrcaRouter에서 하나의 키로 하나의 OpenAI 호환 엔드포인트를 통해 라우팅할 수 있으며, 제공업체의 정가로 아무것도 더 얹지 않고, 둘 다 동일한 자동 페일오버 뒤에 있습니다. 워크로드가 실제로 어느 쪽을 원하는지 알아내는 가장 저렴한 방법입니다. 둘 사이를 전환하는 것은 계약이 아니라 모델 문자열이기 때문입니다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트