
Xiaomi MiMo-V2.6-Pro, 오픈 웨이트 지수에서 46점으로 1위 — 그리고 학습 비용을 공개하다
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro는 이제 Artificial Analysis Intelligence Index에서 최고 순위의 오픈 웨이트 모델이며, v4.3.2에서 46점으로 — GLM-5.3보다 1점 앞서고 Kimi K3보다 2점 앞서며, 이전 지수 척도에서 전신인 MiMo-V2.5-Pro가 기록한 26점보다 20점 높다. 그 수치는 Xiaomi가 아니라 Artificial Analysis가 자체 하네스를 실행해 산출한 것이며, 이번 발표에서 가장 유용한 단 하나의 사실이다. 두 번째로 유용한 사실은 그 옆에 적힌 가격이다: 입력 토큰 100만 개당 $0.43, 출력 100만 개당 $0.87, 이에 비해 Claude Opus 5는 $5.00와 $25.00 — 지수에서 5점 더 높은 모델이다. 세 번째는 아무도 Xiaomi가 내놓을 것이라 예상하지 못한 것이다: MiMo-V2.6-Pro를 만들어낸 강화학습 실행이 실제로 얼마가 들었는지에 대한 공개 내역.
점수는 측정값이지 주장이 아니다
중국 모델 출시에 관해 공개되는 거의 모든 내용은 벤더가 내놓은 수치로 전달되며, 독자들은 그것을 깎아서 받아들이는 법을 배웠다. 이번 것은 다르다. 그리고 그 차이는 정확히 짚을 가치가 있다. 출시 보도가 이미 그 차이를 흐려 놓았기 때문이다.
Artificial Analysis는 v4.3.2 종합 평가에서 MiMo-V2.6-Pro 자체를 평가했습니다. 이는 추론, 지식, 수학, 코딩을 아우르는 10개 평가로, AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1이 포함됩니다. 46은 해당 평가 모음이 내놓은 결과입니다. 또한 이 평가는 모델이 단지 우수한지를 넘어 실제로 사용 가능한지를 결정하는 운영 특성도 기록했습니다. 초당 출력 토큰 134.3개, 첫 토큰까지 2.15초, 99% 캐시 할인, 그리고 Intelligence Index 작업당 측정 비용 $0.13입니다.
그중 두 가지는 특히 강조할 만합니다. 초당 134.3토큰은 MiMo-V2.6-Pro를 속도 부문에서 114개 모델 중 11위에 올려놓습니다. 1조 매개변수 전문가 혼합(MoE) 모델로서 이는 단순한 훈련 결과가 아니라 서빙 결과입니다. 그리고 작업당 $0.13은 예산과 맞닥뜨려도 살아남는 숫자입니다. 이는 이 모델을 대상으로 인덱스를 실행하는 데 실제로 든 비용으로, 보드의 모든 모델에 걸쳐 동일한 방식으로 측정되었기에, 대표적으로 내세우는 토큰당 요금이 갖지 못한 방식으로 비교 가능하게 합니다.

인덱스가 다루는 내용과 다루지 않는 내용
오픈 웨이트 왕관은 실재하지만, 읽히는 것보다 범위가 좁습니다. 46점으로 MiMo-V2.6-Pro는 오픈 웨이트 부문을 선도합니다. 하지만 지수 전체를 선도하지는 않습니다. v4.3의 최상위는 기본 폴백을 사용하는 최대 에포트의 Claude Fable 5.1과 최대 에포트의 GPT-6 Astra이며, 둘 다 53점이고, Claude Opus 5가 51점, Claude Fable 5가 50점입니다. 따라서 솔직한 해석은 폭을 중시하는 종합 지표에서 최전선과 5점 차이가 난다는 것, 그리고 Xiaomi 자체의 이전 세대보다 20점 향상되었다는 것입니다.
• 오픈 웨이트 부문 선두 — Xiaomi MiMo-V2.6-Pro 46, GLM-5.3 (max) 45, Kimi K3 (max) 44
• 동일 지수 최상위 — Claude Fable 5.1 (max, fallback) 53, GPT-6 Astra (max) 53, Claude Opus 5 (max) 51
• 속도 — 초당 134.3 출력 토큰, 측정된 114개 모델 중 11위; 해당 크기 등급의 중앙값은 77.9
• 첫 토큰까지의 시간 — 2.15초, 2.34초 중앙값 대비
• Intelligence Index 작업당 비용 — $0.13, 전체 평가를 실행하는 데 드는 비용은 $206.66
• 공시된 요금 — 백만 입력 토큰당 $0.43, 백만 출력당 $0.87, 99% 캐시 할인, 그리고 7:2:1 캐시 적중/입력/출력 비율에서 혼합 $0.18
Artificial Analysis 페이지의 숫자 하나는 자랑이 아니라 진짜 주의사항입니다. 작성 시점에 MiMo-V2.6-Pro에 대해 단 하나의 API 공급자만 집계했습니다. 그것이 현재 이 모델의 실질적인 병목이며, 품질 문제가 아니라 가용성 문제입니다. 단일 경로로만 접근할 수 있는 모델에는 페일오버가 없습니다. 그 경로가 저하되면 애플리케이션도 함께 저하되며, 페일오버 이야기는 바로 라우터가 제공하기 위해 존재하는 것입니다. 이번 릴리스를 염두에 두고 계획하는 모든 분에게 관련된 관찰은 우리가 MiMo-V2.6-Pro를 호스팅하지 않는다는 점이며, 그렇지 않은 척하지 않겠습니다. 오늘날 그 모델로 가는 경로는 Xiaomi 자체 플랫폼과 이를 목록에 올린 소수의 서드파티 카탈로그입니다.

혼동해서는 안 되는 두 숫자
Xiaomi는 또한 자체 벤치마크 수치를 공개했는데, 그것들은 46과는 다른 종류의 것이다. 이 회사의 대시보드는 MiMo-V2.6-Pro가 강화학습 실행 전반에 걸쳐 DeepSWE v1.1에서 58.4에서 72.57로 상승했다고 보고하며, 이는 mini-swe-agent로 세 번 평균을 내어 평가한 것이다. 그것은 Xiaomi의 하네스, Xiaomi의 채점기, Xiaomi의 오프라인 실행이다. 그것은 공개 DeepSWE 리더보드에 제출되지 않았고, 누구에 의해서도 재현되지 않았다.
두 수치를 나란히 놓고 보면 72.57을 공개 DeepSWE 보드가 최상위 티어에 올려 둔 74%와 동급의 점수로 취급하고 싶은 유혹이 든다. 하지만 둘은 같은 척도가 아니다. 리더보드 수치는 제출된 구성인 Pass@1로, 공개된 신뢰 구간과 작업당 평균 비용이 함께 제공된다. 반면 벤더 수치는 그런 것이 전혀 붙지 않은 내부 평가다. 우리가 9월 21일 작성한 글에서도 이 점을 지적했는데, 당시 수치는 아직 대시보드 판독값에 불과했고, 이제 가중치가 공개된 지금도 그 지적은 여전히 유효하다. 벤더 하네스는 완전히 정직할 수 있지만 그렇다고 해서 리더보드 항목이 되지는 않는다. 왜냐하면 리더보드 항목은 제3자가 재실행할 수 있는 특정 조건에서의 특정 구성에 대한 주장이기 때문이다.
동일한 원칙이 훈련 지출에도 적용됩니다. 샤오미는 Pro와 Flash 실행 전반에 걸쳐 대략 $3,474,715를 보고합니다 — Pro는 $2,620,670, Flash는 $854,044 — 각각 30회가 넘는 강화학습 단계와 약 750,000개의 트래젝터리를 6일 이내에 완료했습니다. 이는 회사 자체의 컴퓨팅 회계 수치입니다. 이 수치가 흥미로운 이유는 연구소들이 이를 거의 공개하지 않는다는 점이며, API 가격도, 여러분이 지불하게 될 비용도, 제3자가 감사한 숫자도 아닙니다.
샤오미가 실제로 출시한 것
이번 공개는 총 매개변수 1조 200억 개, 토큰당 420억 개 활성화, 100만 토큰 컨텍스트 창, 그리고 텍스트·이미지·비디오·오디오 전반에 걸친 네이티브 멀티모달리티를 갖춘 희소 전문가 혼합 모델이다. 그 형제 모델인 Xiaomi MiMo-V2.6-Flash는 동일한 아키텍처를 더 작은 규모로 구현한 것으로, 총 3,090억 개, 활성 150억 개다. 공개된 가중치에는 MIT 라이선스 태그가 붙어 있으며, 공개 번들에는 기술 보고서, 배포 지침, 그리고 샤오미에 따르면 사후 학습을 검토하고 재현하는 데 필요한 강화 학습 훈련 환경과 코드가 포함된다.
마지막 항목은 이번 출시와 일반적인 API 발표 사이의 실질적인 차이이며, 마케팅과 분리해서 볼 가치가 있습니다. RL 환경을 공개하는 것은 훈련 설정을 검토할 수 있다는 주장입니다. 공개된 환경이 72.57을 재현하기에 충분한지 여부는 이를 시도하는 사람들이 판단할 별개의 문제이며, 릴리스 노트가 판단할 문제가 아닙니다. Xiaomi 자체 훈련 노트는 코딩, 일반 에이전트, 시각 및 사이버보안 작업을 단일 패스로 혼합한 실행을 설명하며, 성공적인 궤적의 순위를 매기고 더 나은 경로로 보상을 재분배하는 평가자가 있습니다. 또한 실패도 기록합니다: 전문가 부하 불균형으로 인한 GPU 메모리 부족 재시작, 훈련 클러스터와 평가자 배포 사이의 네트워크 장애, 그리고 인프라 오류가 약 3시간 동안 감지되지 않은 후의 Flash 재시작입니다. 승리와 함께 결함을 공개하는 것이 나머지 공개 내용을 신뢰할 수 있게 만드는 부분입니다.
통화 비용은 얼마인지, 라우팅 문제는 어디에 있는지
100만 토큰당 0.43달러와 0.87달러로, MiMo-V2.6-Pro는 중급 모델처럼 가격이 책정되었고 프런티어 오픈 웨이트 모델처럼 벤치마크됩니다. Xiaomi는 새 체크포인트의 가격을 올리기보다 이전 MiMo-V2.5 세대의 표준 가격을 유지했으며, 그래서 이 요금은 파라미터 수에 비해 낮아 보입니다. 99% 캐시 할인은 캐시를 많이 쓰는 에이전트 루프가 컨텍스트를 사실상 무료로 읽는다는 뜻이며, 장기 호라이즌 에이전트의 청구서가 실제로 쌓이는 지점이 바로 여기입니다.
이 거래에는 깔끔하게 라우팅되는 버전과 그렇지 않은 버전이 있습니다. 깔끔하게 되는 버전은 이렇습니다. MiMo-V2.6-Pro와 비교하게 될 프런티어 모델들, 즉 $5.00/$25.00의 Claude Opus 5, GPT-6 Astra, Gemini 3.8 Flash, GLM-5.3은 모두 하나의 OrcaRouter 키를 통해 0% 마크업으로 공급사 정가에 도달할 수 있습니다. 따라서 이들 중 어느 하나에 대한 공급사의 가격 인하는 같은 날 우리 쪽에서도 적용되며, 라우팅 규칙은 첫 번째 모델이 느리거나 사용할 수 없을 때 요청을 두 번째 모델로 보낼 수 있습니다. 이 점은 여기서 평소보다 더 중요합니다. 왜냐하면 최고의 오픈 웨이트 점수를 가진 모델이 바로 그 모델로 가는 경로가 가장 얇은 모델이기도 하기 때문입니다. 이 둘을 조합하는 것, 즉 대량 작업을 위한 저렴한 오픈 웨이트 레인과 까다로운 롱테일을 위한 프런티어 레인을 함께 구성하는 것은 라우팅 결정이며, 두 레인이 같은 키 위에 올라가는 순간 더 이상 베팅이 아니게 되는 종류의 결정입니다.
모델과 혼동하기 쉬우니 헷갈리지 않게 정리해 둘 제품이 하나 더 있습니다. Xiaomi는 동일한 체크포인트로 구축된 호스팅 서빙 티어인 MiMo-V2.6-Pro-UltraSpeed도 제공하고 있습니다. Xiaomi 자체 자료에서는 같은 품질로 표준 Pro 서비스 대비 최대 20배의 출력 속도를 주장하지만, 제3자 카탈로그 목록에서는 대략 10배라고 설명합니다. 이는 같은 티어를 설명하는 서로 다른 두 숫자이며, 이 둘을 조화시킬 요청별 지연 시간 분포를 공개한 곳은 없고, 이 티어에는 실질적으로 더 높은 요금이 부과됩니다. UltraSpeed는 가중치가 할 수 있는 일을 바꾸지 않습니다 — 다른 누군가의 서버가 그 가중치를 얼마나 빠르게 실행할지를 바꿀 뿐입니다.
이 그림을 바꿀 수 있는 것은 무엇일까요?
세 가지, 중요한 순서대로.
두 번째와 세 번째 서빙 경로. Artificial Analysis의 단일 제공자 수치는 다른 모든 것의 제약 조건이다. 더 많은 경로는 페일오버를 의미하고, 서빙 계층에서의 가격 경쟁을 의미하며, 모델이 실험이 아니라 프로덕션 경로에 투입될 수 있음을 의미한다.
DeepSWE 수치의 독립적 재현. 46은 이미 독립적이며, 72.57은 그렇지 않다. 외부 실행 결과가 그 근처에 나온다면, 그 모델을 뒷받침하는 근거는 상당히 강화된다. 만약 실질적으로 그보다 낮게 나온다면, Artificial Analysis의 수치가 여전히 신뢰할 만한 값으로 남고, 벤더의 수치는 검증을 견디지 못한 수많은 출시 주장 명단에 합류하게 된다.

평가별 세부 결과. 종합 점수는 그저 종합 점수일 뿐이다. MiMo-V2.6-Pro가 10개 평가 중 어느 것을 이기고 어느 것을 지는지는 에이전트형 코딩용으로 배포할 모델과 검색 비중이 높은 질의응답용으로 배포할 모델을 가르는 차이이며, 지수만으로는 알 수 없다. 그 세부 정보가 다음에 주목해야 할 부분이고, 라우팅 구성을 적어 둘 가치가 있기 전에 필요한 바로 그것이다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
