
MiMo-V2.6-Pro vs GLM-5.2: 두 개의 오픈 웨이트 MoE, 그리고 절대 빼서는 안 되는 벤치마크
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
이 비교의 가장 게으른 버전은 Xiaomi MiMo-V2.6-Pro의 72.57을 GLM-5.2의 46.2 옆에 놓고, 26점 차 승리라고 부르며, 그대로 발표한다. 그것이 틀린 이유는 어느 모델이 더 나은지와는 아무 관련이 없다: 그 두 숫자는 같은 측정값이 아니다. Xiaomi의 72.57은 mini-swe-agent를 사용한 자체 하네스에서 세 번 실행한 평균이며 공개 보드에 제출된 적이 없다; 46.2는 완전히 다른 하네스에서 나온 Pass@1 수치다. Xiaomi MiMo-V2.6-Pro와 GLM-5.2 사이의 정직한 비교는 다른 것이다, 둘 모두 실제로 실행된 척도에서 이루어진 — 그리고 그 척도에서 격차는 실재하지만 26점이 아니라 12점이다.
Artificial Analysis Intelligence Index v4.3.2에서, 2026년 9월 22일 기준으로 확인했을 때 Xiaomi MiMo-V2.6-Pro는 46점을 기록합니다. GLM-5.2는 34점을 기록합니다. 둘 다 중국 연구소에서 나온 오픈 웨이트 전문가 혼합(mixture-of-experts) 모델이고, 둘 다 100만 토큰 컨텍스트 창을 실행하며, 둘 다 가격이 충분히 저렴해서 두 모델 중 선택은 예산이 아니라 성능과 서빙에 관한 것입니다. 유사점은 거기서 끝납니다. 왜냐하면 GLM-5.2는 자체 제작사에 의해 대체되었고, 이 비교가 작성된 페이지에는 사용 중단 공지가 실려 있기 때문입니다.
각 모델이 무엇인지, 그리고 어떤 상태인지
GLM-5.2는 Z.ai의 플래그십 모델로, 2026년 6월 16일에 출시되었습니다. 이는 총 파라미터가 약 7,530억 개에 달하고 토큰당 약 400억 개가 활성화되는 전문가 혼합(MoE) 트랜스포머이며, Nvidia 하드웨어가 아닌 화웨이 Ascend 가속기에서 전적으로 학습된 것으로 보고되었습니다. MIT 라이선스에 따라 FP8 및 INT4 양자화된 오픈 가중치로 제공되며, 최대 131,072 토큰의 출력과 함께 100만 토큰의 컨텍스트를 지원합니다. Z.ai 자체 API에서는 입력 토큰 100만 개당 $1.40, 출력 토큰 100만 개당 $4.40에 책정되어 있고, 캐시된 입력은 $0.26, 혼합 요금은 $0.90입니다. Artificial Analysis는 이를 초당 72.6 출력 토큰, 첫 토큰까지 5.98초로 측정했으며, 전체 인덱스를 실행하는 데 드는 비용은 $1,559.05였습니다.
샤오미 MiMo-V2.6-Pro는 2026년 9월 22일에 일반 공개되었고, 강화학습 체크포인트 저장소는 하루 전에 등장했습니다. 이 모델은 총 파라미터 1조 2,000억 개, 토큰당 활성 파라미터 420억 개의 희소 전문가 혼합(MoE) 모델로, GLM-5.2보다 총량이 더 크고 활성 수는 거의 동일하며, 100만 토큰 컨텍스트 창, 텍스트·이미지·비디오·오디오 전반에 걸친 네이티브 멀티모달리티, MIT 라이선스 가중치를 갖추고 있습니다. 샤오미는 이전 세대의 가격을 유지하고 상향 재책정하지 않아, 100만 토큰당 $0.43 및 $0.87, 99% 캐시 할인, 블렌디드 $0.18로 책정되어 있습니다.
• 가중치 — 둘 다 MIT 라이선스이며 다운로드 가능; 이 둘이 진정으로 동등한 유일한 범주입니다
• 활성 파라미터 — MiMo-V2.6-Pro는 토큰당 42B, GLM-5.2는 약 40B. 거의 동일하므로, 점수 차이는 규모 때문이라기보다 학습의 결과다.
• 총 파라미터 — MiMo-V2.6-Pro 1.02T; GLM-5.2 약 753B
• 지수 점수 — MiMo-V2.6-Pro 46; GLM-5.2 34, 둘 다 Artificial Analysis v4.3.2 기준
• 정가 — MiMo-V2.6-Pro 100만 개당 $0.43 / $0.87; GLM-5.2 $1.40 / $4.40, 혼합 $0.18 대 $0.90
• 인덱스 실행 비용 — MiMo-V2.6-Pro $206.66; GLM-5.2 $1,559.05
• 속도 — MiMo-V2.6-Pro 초당 출력 토큰 134.3개; GLM-5.2 72.6
• 첫 토큰까지 걸리는 시간 — MiMo-V2.6-Pro 2.15초; GLM-5.2 5.98초
• 상태 — MiMo-V2.6-Pro는 현재 제공 중이며 GA; GLM-5.2는 Artificial Analysis에서 사용 중단되었으며, 해당 기관은 이제 기본 10k 입력 워크로드에서만 이를 벤치마크합니다.

지원 중단 공지가 헤드라인입니다
Z.ai는 그 후 GLM-5.3을 출시했고, GLM-5.2에 관한 Artificial Analysis 페이지는 이를 직접 밝히며 해당 모델을 deprecated로 표시하고 지속적인 벤치마크 작업을 단일 기본 워크로드로 제한하고 있습니다. 이는 이 페이지의 용도를 바꿔 놓습니다. 오늘 새 모델을 선택한다면 실제로 신경 쓰이는 맞대결은 GLM-5.2가 아니라 MiMo-V2.6-Pro 대 GLM-5.3입니다. 그리고 동일한 v4.3.2 인덱스에서 최대 노력의 GLM-5.3은 MiMo-V2.6-Pro의 46점에 맞서 45점을 기록합니다. 1점 차. 이는 진짜 승부이며, 완전히 다른 기사입니다.
GLM-5.2 비교는 여전히 해볼 가치가 있다. 한 가지 특정한 이유 때문이다. 그것은 2026년 6월과 9월 사이에 오픈 웨이트 최전선이 얼마나 빠르게 움직였는지를 보여주는 가장 저렴한 예시다. 약 14주 동안 12 지수 포인트, 활성 파라미터 수는 사실상 그대로인 채로. 그 상승을 만들어낸 것이 무엇이든, 그것은 규모가 아니었다.
GLM-5.2가 잘했던 점, 그리고 지금도 여전히 그러한지
GLM-5.2의 출시 자료는 코딩과 장시간 실행되는 에이전트 작업을 앞세웠으며, 그 수치들은 여전히 이 모델을 설명하는 데 유효하다: SWE-bench Pro는 62.1로 GLM-5.1의 58.4를 앞섰고, Terminal-Bench 2.1은 81.0으로 63.5를, FrontierSWE는 74.4로 30.5를 앞섰다. 지식과 수학 부문에서는 GPQA-Diamond 91.2, AIME 2026 99.2, Humanity's Last Exam 40.5를 보고했다. 당시 하나의 장기 호라이즌 에이전트 코딩 벤치마크에서 모든 모델을 앞섰고, 공개 웹 개발 리더보드에서 2위를 차지했다. 이는 공급업체가 자체 하네스에서 보고한 수치이며, 그 모든 수치에는 늘 그렇듯 주의가 필요하다.
샤오미가 자체 공개한 MiMo-V2.6-Pro 수치는 그것들과 비교할 수 없으며, 이를 두루뭉술하게 넘기기보다 그 이유를 정확히 짚을 가치가 있다. 샤오미는 해당 모델이 자사의 강화학습 실행에서 DeepSWE v1.1 기준 58.4에서 72.57로 향상되었다고 보고하는데, 이는 mini-swe-agent로 3회 평균, 자체 채점기로 평가한 것이며, 해당 실행은 30스텝, 약 6일 이내에 완료된 약 750,000개의 트래젝터리로 문서화되어 있고, Pro 모델의 공개된 지출은 약 262만 달러다. 그중 어느 것도 리더보드 항목이 아니다. 리더보드 항목이란 제3자가 재실행할 수 있는, 명시된 조건하의 특정 구성에 대한 주장이며, 샤오미의 것은 그런 것이 아니다. 별도의 트래커는 GLM-5.2를 DeepSWE — Pass@1에서 46.2로 기재하는데, 이는 같은 태스크 계열의 다른 지표다. 그리고 72.57을 46.2 옆에 놓아 26점 차이를 만들어내는 것은 서로 다른 두 척도에 대한 산수다. 그렇게 해서는 안 되며, 이는 이 조합에 관해 유통되는 가장 흔한 오류다.

그것들 중에서 결정하기, 그리고 그것을 저렴하게 만드는 라우팅
둘 다 동일한 라이선스 아래의 오픈 웨이트라면, 결정적인 기준은 무엇을 실행할 수 있는지 그리고 어디에서 호출할 수 있는지입니다. GLM-5.2는 OrcaRouter에 z-ai/glm-5.2로 올라와 있습니다 — 하나의 OpenAI 호환 엔드포인트이며, 제공사 목록 가격이 0% 마크업으로 그대로 전달되므로 Z.ai의 가격이 바뀌면 같은 날 우리 쪽에도 반영됩니다. Xiaomi MiMo-V2.6-Pro는 OrcaRouter에 없습니다. Xiaomi 모델은 어느 것도 없으며, 그 모델을 이용하려면 Xiaomi 자체 플랫폼이나 이를 취급하는 제3자 카탈로그 중 하나를 거쳐야 합니다. 모델 페이지가 그렇지 않은 듯이 암시하도록 두기보다는 이렇게 분명히 밝히는 편이 낫습니다.
유용한 결과는 하나의 키로 기존 모델들을 계속 쓰면서 두 번째 계약 없이 신규 모델을 그들과 비교 평가할 수 있다는 점입니다. MiMo-V2.6-Pro가 당신의 프롬프트에서 이긴다면, 그 사실을 저렴하게 알게 된 것입니다. 그렇지 않다면 — 12포인트의 지수 격차는 토큰당 가격 격차가 큰 것에 비하면 작은 편이므로, 결과는 정말로 당신의 워크로드에 달려 있습니다 — 테스트 외에는 아무것도 잃지 않은 것입니다. 두 모델을 자동 페일오버와 함께 하나의 엔드포인트 뒤에 라우팅하는 것은 이번 주에 출시된 모델에 대한 실질적인 반대 의견에도 답이 됩니다. 단일 서빙 경로는 단일 장애점이며, 폴백할 수 있는 레인이 바로 신규 모델을 실제 트래픽 앞에 안전하게 배치할 수 있게 하는 것입니다.

짧은 대답
오늘 GLM-5.2를 쓰고 있고 그것이 잘 작동한다면, 업그레이드 질문의 답은 MiMo-V2.6-Pro가 아니라 같은 계보에 있으면서 Xiaomi 모델과 1점 차이이고 마이그레이션 비용이 전혀 없는 GLM-5.3입니다. 처음부터 갈래를 고르는 중이고 세 모델 중 측정 점수가 가장 높은 오픈 웨이트를 원한다면, MiMo-V2.6-Pro의 46이 바로 그 숫자이며, 초당 134.3토큰과 인덱스 작업당 $0.13이 이것이 근소한 승리가 아닌 이유입니다. 세 모델 중 가장 안전한 것을 원한다면, GLM-5.2는 6월에 얼마나 좋았는지와는 아무 관련이 없는 이유 때문에 잘못된 답입니다: 그것은 세 모델 중 자체 공급업체가 개발을 중단한 유일한 모델입니다.
OrcaRouter는 200개 이상의 모델을 하나의 OpenAI 호환 엔드포인트 뒤에 공급자 정가에 0% 마크업으로 제공하므로, 공급업체의 가격 변경이 같은 날 바로 반영됩니다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
