기사 'Xiaomi MiMo-V2.6-Pro: DeepSWE에서 72.57'의 히어로 타이틀 카드로, 키커는 'OrcaRouter · 모델 레이더 — 미출시', 부제는 '멈춰버린 실행, 아직 출시되지 않은 모델 — 무엇이 확인되었고, 무엇이 아닌가.' 그 아래 두 개의 카드가 있다. 왼쪽은 'Xiaomi 자체 대시보드 기준'으로, 'DeepSWE v1.1: 72.57 — 9월 20일, 30단계에서 실행 중단'이라고 적혀 있다. 오른쪽은 '여전히 미공개'로, '모델 카드 없음, API ID 없음, 가격 없음, 가중치 없음'이라고 적혀 있다. 네 개의 칩은 '플래시 형제 모델: 65.68', '총 지출: $3,474,715', '보드 최상위: 74%', '벤더 실행 평가, 제출되지 않음'이라고 표시된다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있다.
Guides & Insights

Xiaomi MiMo-V2.6-Pro: 72.57 DeepSWE 점수, 중단된 실행, 그리고 여전히 출시일 없음

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Xiaomi MiMo-V2.6-Pro는 9월 20일 공개 스트리밍되던 강화학습 실행을 중단했고, DeepSWE v1.1 점수 72.57이 샤오미 자체 대시보드에 남아 있었다 — 같은 리더보드 상단에서 GPT-6 Astra, Gemini 3.8 Flash, Claude Opus 5가 공유하는 74%보다 1.4점 낮은 수치다. 함께 훈련된 더 작은 모델인 Xiaomi MiMo-V2.6-Flash는 9월 19일 65.68로 중단됐다. 두 실행 모두 30스텝에서 종료됐고, 샤오미가 함께 공개한 합산 청구액은 $3,474,715 였다 — 오늘 아침 우리가 그 페이지를 캡처했을 당시의 수치다.

그것이 좋은 소식의 전부이며, 정말로 좋은 소식이다. 나머지 이야기는 숫자와 제품 사이의 간극이다. Xiaomi MiMo-V2.6-Pro에도 Xiaomi MiMo-V2.6-Flash에도 출시일, 모델 카드, API 식별자, 공개된 가격, 다운로드 가능한 가중치 세트가 없다. 호출할 엔드포인트도 없다. 존재하는 것은 누구나 볼 수 있는 학습 대시보드, Xiaomi 자체 하네스가 산출한 벤치마크 수치, 그리고 사람들이 예전에 찻잎을 읽듯이 6일 동안 텔레메트리 페이지를 읽어 온 커뮤니티뿐이다.

그래서 이것은 지금까지 우리가 아는 내용을 정리한 글이며, 이를 정직하게 풀어낸 버전은 지난 한 주의 보도가 조용히 뒤섞어 온 세 가지를 구분한다: Xiaomi가 공식적으로 밝힌 것, 한 명의 관찰자가 그것에 대해 보고한 것, 그리고 그것이 오늘 코딩 모델을 선택하는 사람에게 의미하는 바다.

샤오미가 실제로 온라인에 공개한 것

9월 16일, 뤄푸리가 이끄는 MiMo 팀은 샤오미 자체 도메인에 라이브 페이지를 열고 아직 공개되지 않은 두 모델의 포스트 트레이닝 과정을 실시간으로 보여주었습니다. 여기에는 스텝 수, 보상 곡선, 토큰 처리량, 샌드박스 수, GPU 장애 알림, 그리고 지켜보는 동안 계속 올라가는 비용 카운터가 포함되었습니다. 보도에 따르면 샤오미의 설명은, 강화 학습을 어디까지 확장할 수 있는지라는 한 가지 질문에 약 6개월을 쏟았으며, 결과를 발표하기보다 그 실험을 공개적으로 진행하기로 했다는 것입니다.

이 대시보드는 벤더 산출물치고는 이례적으로 솔직하다. 공지 피드에 자체 실패를 나열한다: 전문가 부하 불균형으로 인한 GPU 메모리 부족 오류로 17단계에서 발생한 Pro 재시작(팀은 학습 병렬화 전략을 조정해 해결했다고 밝힘); Pro 학습 클러스터와 채점 배포 간의 네트워크 연결 장애로 재시작이 강제되었고 "롤아웃 로그의 나쁜 패턴" 이후 다가오는 Pro 실행에서 사이버 데이터셋을 제외하기로 결정한 일; 한 부류의 인프라 오류가 약 3시간 동안 감지되지 않은 뒤 15단계에서 발생한 Flash 재시작; 그리고 단일 노드의 VRAM 오류로 인한 Pro 재시작. 또한 "현재 pro 모델에 상대적으로 쉬운" 것으로 판단된 작업들은 필터링되었다고 언급한다 — 대부분의 포스트트레이닝 보고서가 말하지 않고 넘어가는 인정이다.

Screenshot of Xiaomi's public MiMo-V2.6 reinforcement-learning dashboard captured September 21, 2026. A total-cost counter reads $3,474,715, and a notices feed lists a Pro restart at step 17 from a GPU out-of-memory fault caused by expert load imbalance, a network connectivity fault between the Pro training cluster and the grader deployment, a Flash restart from step 15 after an infrastructure error went undetected for about three hours, a Pro restart from a node VRAM fault, and a note that tasks relatively easy for the current Pro model were filtered out. Two run cards show mimo-v2.6-pro stopped at step 30 — started 2026-09-15 10:32 UTC, stopped 2026-09-20, $2,620,670 spent, 75B tokens, 753k samples, batch 1,568 x 16 — and mimo-v2.6-flash stopped at step 30 — started 2026-09-15 15:16 UTC, stopped 2026-09-19, $854,044 spent, 81.4B tokens. Three benchmark panels read DeepSWE v1.1 mini-swe-agent avg@3: mimo-v2.6-pro 72.57, mimo-v2.6-flash 65.68; an in-house coding bench at 65.43 and 62.87; and AutomationBench v1.0.6 at 53.10 and 52.70.

두 개의 실행 카드는 타이밍을 추적하는 사람이라면 누구에게나 중요한 부분입니다. 두 모델 모두 중단됨으로 표시되어 있습니다: MiMo-V2.6-Pro는 월클록 기준 5일 7시간 후, MiMo-V2.6-Flash는 3일 11시간 후, 둘 다 30단계에서, 날짜는 각각 9월 20일과 9월 19일입니다. Pro는 $2.62M를 들여 75B 토큰과 753k 샘플을 소비했고, Flash는 $854k로 81.4B 토큰을 소비했습니다. 각 단계는 프롬프트당 16회의 롤아웃으로 1,568개 프롬프트 배치를 뽑습니다 — 단계당 25,088개의 트래젝터리이며, 완전히 비동기적으로 실행됩니다.

분명히 말해 두자면: Xiaomi는 “중단됨”이 실행이 끝난 것인지, 일시 중지된 것인지, 체크포인트가 저장된 것인지 말하지 않았다. 중단된 카드는 완료 알림이 아니며, 팀 외부의 누구도 그것이 어느 것인지 알지 못한다.

무엇이 확인되었고, 무엇이 확인되지 않았는가

72.57은 소문이 아니다. 그것은 Xiaomi의 대시보드에, DeepSWE v1.1, mini-swe-agent, avg@3이라고 라벨이 붙은 차트에, Pro 실행의 주황색 곡선 옆에 인쇄되어 있다. Flash 모델의 65.68은 같은 차트에 놓여 있다. 이 수치는 또한 — 62.24로, 그리고 나중에는 65.97로 — 같은 패널의 이전 스냅샷들에도 나타나며, 이것이 그 곡선의 형태를 만든다: 단 한 번의 운 좋은 평가가 아니라 30단계에 걸친 꾸준한 상승이다.

리포트 전용이라는 점이 출발점이다. 9월 21일 X에서 @nrehiew_ 계정으로부터 퍼진 주장은 Pro 모델이 DeepSWE에서 "58.41에서 72.57로" 올랐으며 실행이 완료되었다는 것이다. 종료 지점은 벤더의 대시보드와 정확히 일치한다. 58.41 기준선은 그 계정이 곡선이 시작되는 지점을 읽은 값이다 — 차트의 가장 왼쪽 Pro 점은 실제로 50대 후반에 위치한다 — 그리고 Xiaomi는 1단계 수치를 공개하지 않았다. 완료 주장 역시 중지됨으로 표시된 두 카드에 대한 해석이며, 이는 합리적인 독해이지 Xiaomi의 진술이 아니다. 14포인트 개선은 방향성 측면에서는 견고하고 수치적으로는 근사치로 취급하라.

A two-column scoreboard titled 'MiMo-V2.6-Pro vs the DeepSWE top tier', subtitled 'What Xiaomi published about its own checkpoint, against what the public leaderboard lists — September 21, 2026'. The left column, badged VENDOR-REPORTED and headed 'MiMo-V2.6-Pro', reads: DeepSWE v1.1 — 72.57; Basis — Xiaomi's own offline eval, mini-swe-agent avg@3; Confidence — not published; Cost per task — not published; Release — not announced; Independent runs — none. The right column, badged PUBLIC LEADERBOARD and headed 'Top tier — three-way tie', reads: DeepSWE v1.1 — 74%; Basis — submitted configs, Pass@1, GPT-6 Astra · Gemini 3.8 Flash · Claude Opus 5; Confidence — plus or minus 1 to 4 points; Cost per task — $2.36 to $11.84; Release — shipping today; Independent runs — on the public board. A footer reads 'MiMo-V2.6-Pro is Xiaomi's own offline evaluation, read from the vendor's public RL dashboard on 2026-09-21 and not submitted to the leaderboard. Top-tier figures per Datacurve's DeepSWE v1.1 leaderboard, updated 2026-09-03.' The OrcaRouter logo is composited in the bottom-right corner.

커버리지가 건너뛴 구분이 하나 더 있는데, 바로 그 숫자의 가치를 결정하는 구분이다. 대시보드의 벤치마크 패널은 샤오미 자체 평가다. 즉 회사가 자사 체크포인트에서 하네스를 실행하고 결과를 공개한 것이다. 그 하네스는 공개 리더보드가 사용하는 것과 동일하다 — mini-swe-agent, DeepSWE v1.1 — 따라서 이 수치는 벤더가 자체 제작한 벤치마크보다 더 비교 가능하다. 그러나 자체 실행 평가는 리더보드 등재가 아니며, 72.57은 Datacurve의 보드에 나타나지 않는다. 아무도 제출하지 않았기 때문이다.

74% 상한은 헤드라인이 시사하는 것보다 더 빡빡하다

이로써 비교가 선명해진다. 2026년 9월 3일에 마지막으로 업데이트된 Datacurve의 DeepSWE v1.1 리더보드는 5개 언어에 걸쳐 91개 리포지토리의 113개 태스크를 나열하고 있으며, 상위 세 가지 구성은 74% Pass@1로 동률이다. xhigh 추론 노력도의 GPT-6 Astra, high의 Gemini 3.8 Flash, max의 Claude Opus 5다. 흥미로운 것은 바로 그 점수들 옆에 놓인 숫자들이다.

• 신뢰도 — GPT-6 Astra 74% ±3, Gemini 3.8 Flash 74% ±1, Claude Opus 5 74% ±4. 같은 리더보드에서 GPT-5.6 Sol은 73% ±3에, GLM-5.3Kimi K3은 69%에 있습니다. 구간들은 소수점 둘째 자리를 훨씬 지나서도 겹칩니다.

• 작업당 비용 — Gemini 3.8 Flash는 평균 $2.36, GPT-6 Astra는 $6.52, Claude Opus 5는 $11.84입니다. 리더보드 자체 차트는 Gemini 3.8 Flash를 보드에서 가장 효율적인 구성으로 표시하며, 그 세 가지 사이의 격차는 벤치마크가 구분할 수 없는 통과율에 대해 대략 5대 1입니다.

• 단계 — Gemini 3.8 Flash는 작업당 평균 166개의 에이전트 단계가 필요했고, Claude Opus 5는 99개, GPT-6 Astra는 29개였다. 동점 점수는 세 가지 매우 다른 작업 방식을 감추고 있으며, 가장 저렴한 쪽이 가장 열심히 일하는 쪽이다.

Screenshot of Datacurve's DeepSWE v1.1 leaderboard captured September 21, 2026, showing 113 tasks, 91 repositories, five languages and 28 models, with the v1.1 and Best tabs selected and the board marked 'updated September 3, 2026'. The Pass@1 table lists gpt-6-astra (xhigh) at 74 percent plus or minus 3 with an average cost of $6.52, 30k output tokens and 29 steps; gemini-3.8-flash (high) at 74 percent plus or minus 1 at $2.36, 143k tokens and 166 steps; claude-opus-5 (max) at 74 percent plus or minus 4 at $11.84, 118k tokens and 99 steps; gpt-5.6-sol at 73 percent; claude-fable-5 at 70 percent; glm-5.3 and kimi-k3 at 69 percent; and grok-4.6 and gpt-5.6-luna at 67 percent. The score-versus-average-cost chart above the table labels gemini-3.8-flash as the most efficient configuration. No Xiaomi MiMo model appears on the board.

따라서 보고된 72.57이 “보드 최상위권에 접근하는 중”이라고 설명될 때, 정확한 표현은 더 좁고 덜 극적이다. 이는 3자 동점과 약 1.5점 차이 이내이며, 그 동점자들은 벤치마크 자체의 오차 막대로는 서로 구분할 수 없다. 이는 아직 포스트트레이닝 단계에 있는 모델이, 벤치마크 유지관리자가 아니라 공급업체에 의해 산출된, 그 모델이 아직 제출되지 않은 보드에서 얻은 강력한 결과다. 리더보드의 마지막 업데이트는 Xiaomi의 실행보다 완전히 앞서므로, 아직 MiMo는 그 위에 전혀 나타나지 않는다.

왜 샤오미는 공개적으로 훈련하는가

투명성은 부차적인 것이 아니다. 샤오미의 마지막 오픈 웨이트 공개는 4월 말의 Xiaomi MiMo-V2.5와 Xiaomi MiMo-V2.5-Pro였으며, 둘 다 MIT 라이선스 하에 있었다 — 상업적 사용, 파인튜닝, 재배포가 가능하다. MiMo-V2.5-Pro는 활성 매개변수 42B에 하이브리드 어텐션 아키텍처와 100만 토큰 컨텍스트 윈도우를 갖춘 1.02조 매개변수 전문가 혼합(mixture-of-experts) 모델이며, 출시 자료는 에이전트 관련 주장을 명시적으로 내세웠다: 수백 번의 도구 호출을 거쳐 Rust로 처음부터 작성된 컴파일러, 11시간에 걸친 에이전트 작업으로 만들어진 8천 줄짜리 데스크톱 애플리케이션.

차세대의 포스트 트레이닝을 스트리밍하는 것은 또 다른 종류의 주장이다. 보상 곡선, 샌드박스 수치, GPU 장애를 실시간으로 공개하는 연구소는 출시 발표 자료가 아니라 과정으로 평가받기를 요청하는 것이며, 동시에 일정을 시사하는 것이다. 뤄푸리는 RL 작업의 기술적 세부 사항을 앞으로 몇 주에 걸쳐 하나씩 오픈소스로 공개할 것이라고 말했다. 그것이 누군가가 제시한 일정에 가장 가까운 것이다: 방법론이 먼저, 모델은 나중이다.

또한 이는 샤오미가 이전에 사용했던 패턴과도 맞아떨어지는데, 모델이 회사가 공식적으로 발표하기 전에 다른 이름으로 공개적으로 등장하는 경우입니다. 이 회사의 습관은 조용히 훈련하고, 공개적으로 테스트한 다음, 가중치와 함께 공개하는 것입니다.

오늘 실행할 수 있는 것

MiMo-V2.6 제품군에는 아무것도 없습니다. 지금 당장 Xiaomi MiMo 모델을 원한다면, 현재 존재하는 것은 V2.5 세대입니다 — Xiaomi 자체 채널과 여러 서드파티 플랫폼을 통해 공개 가중치가 제공되며, 모델 카드와 가격도 공개되어 있습니다. MiMo-V2.6 API도, 모델 식별자도, 가격표도 없습니다. MiMo-V2.6 식별자나 토큰당 요금을 언급하는 페이지는 Xiaomi가 비워 둔 빈칸을 채우는 것일 뿐입니다. 대시보드에 있는 `mimo-v2.6-pro` 및 `mimo-v2.6-flash` 문자열은 공개된 엔드포인트가 아니라 학습 작업 이름입니다.

또 하나의 실질적인 결과는 그 사이에 무엇을 해야 하느냐입니다. MiMo-V2.6-Pro가 흥미로운 이유가 최전선 수준의 코딩 성능에 도달하는 더 저렴한 방법일지도 모른다는 점이라면, 이 모델이 비교 측정되는 대상 구성들은 이미 호출 가능하며, 리더보드는 그 저렴한 쪽이 경쟁력 있다고 말해줍니다: Gemini 3.8 Flash는 과제당 $2.36으로 최고 통과율과 동률을 이루며 보드에서 가장 효율적인 구성으로 표시됩니다. Gemini 3.8 Flash, Claude Opus 5, GPT-6 Astra는 모두 하나의 OrcaRouter API 키를 통해 공급자 정가에 0% 마크업이 그대로 전달된 가격으로 이용할 수 있으며 — 따라서 공급업체의 가격 변경이 다음 청구 주기가 아니라 같은 날 우리 쪽에 반영됩니다 — 장애 조치는 공급업체 단위가 아니라 모델 단위로 구성됩니다. 그리고 어떤 연구소가 이와 같은 모델을 공개할 때, 같은 키 뒤에 라우팅하는 것이 그것을 평가하는 부담 없는 방법입니다: 아무도 특성을 파악하지 못한 체크포인트에 프로덕션 경로를 걸지 않고도 실제 트래픽 앞에 배치할 수 있습니다.

무엇이 실제로 이 이야기를 바꿀까

네 가지 신호, 대략 그것들이 얼마나 판가름해 줄지에 따른 순서로:

• 명시된 라이선스 하에 Hugging Face에 공개된 가중치 — 이는 V2.5 세대가 등장한 방식이자, RL 실행이 끝난 실험이 아니라 출시 가능한 모델을 만들어냈다는 가장 강력한 증거다.

• 파라미터 수, 컨텍스트 길이, 아키텍처를 담은 모델 카드 — V2.6의 수치는 어느 것도 공개되지 않았고, 대시보드에도 표시되지 않는다. V2.6-Pro가 V2.5-Pro의 1.02T/42B 형태를 계승한다고 가정하는 것은 추측에 불과할 것이다.

• API 식별자와 가격표, 바로 이 순간에 DeepSWE의 수치는 관전용 스포츠가 아니라 구매 결정이 된다.

• Datacurve의 DeepSWE 보드에 제출하는 것은 MiMo-V2.6-Pro를 비교 대상 모델들과 같은 표에, 같은 오차 범위 아래에 올리는 일입니다. 벤더가 직접 실행한 평가와 리더보드 제출은 같은 주장이 아니며, 그 둘 사이의 간극은 바로 그 표의 한 행입니다.

그때까지는, 솔직한 요약은 이렇습니다: Xiaomi는 아직 출시하지 않은 두 모델에 대해, 주요 연구소가 공개한 포스트트레이닝 실행 중 가장 투명한 것을 보여줬고, 자체 보고한 벤치마크 수치 하나는 리더보드 최상위에 근접하지만 — 그 대열에 합류하지는 — 않습니다. 방법론 문서는 앞으로 몇 주 안에 공개하겠다고 약속했습니다. 출시일은 전혀 약속하지 않았습니다.