
MiMo-V2.6-Pro vs MiMo-V2.6-Flash: 두 벤치마크로는 설명되지 않는 3배의 가격 차이
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
샤오미 자체 평가 표에서 MiMo-V2.6-Flash는 MiMo-V2.6-Pro를 앞선다. 해당 행은 CyberGym이고, 격차는 95.1 대 94.0이다. 이는 열다섯 개 행 중 하나일 뿐이며, 플래그십이 항상 정답이라고 가정하기보다 이 비교의 나머지를 주의 깊게 읽어야 하는 이유다 — MiMo-V2.6-Flash의 비용은 MiMo-V2.6-Pro의 약 3분의 1이고, 대부분의 행에서 두 모델은 서로 몇 점 차이 안에 있기 때문이다.
두 모델 모두 2026년 9월 21일, MIT 라이선스로, 18초 간격을 두고 Hugging Face 저장소로 공개되었으며, 하나의 사다리 위의 단계가 아니라 각각 별개의 학습 실행이었습니다. Xiaomi MiMo-V2.6-Pro는 1조 파라미터 등급입니다. MiMo-V2.6-Flash는 효율성 등급입니다. 이 페이지가 답하려는 질문은 이 둘 중 어느 것이 여러분의 프로덕션 경로에 속하는가이며, 솔직한 답은 두 릴리스 어디에도 존재하지 않는 하나의 숫자에 달려 있습니다.
각각이 무엇인지
• 파라미터 — Xiaomi MiMo-V2.6-Pro는 총 1.02T에 토큰당 활성 42B이고, Xiaomi MiMo-V2.6-Flash는 총 약 309B에 활성 15B입니다
• 아키텍처 — 둘 다 네이티브 옴니모달 입력을 갖춘 희소 전문가 혼합이며, Flash는 48개 레이어, 39개 슬라이딩 윈도우 및 9개 전체 어텐션, 히든 크기 4096, 8개 활성 및 공유 전문가 없음인 256개 라우팅 전문가, 그리고 681M 비전 트랜스포머, 308M 오디오 토크나이저, 127M 오디오 패치 인코더로 문서화되어 있습니다
• 컨텍스트 — 둘 다 1M 토큰이며, 둘 다 최대 128,000 출력 토큰을 지원합니다
• 라이선스 — 둘 다 MIT이며, 둘 다 가중치에 게이트가 없습니다
• 가격 — Pro는 백만 토큰당 입력 $0.435, 출력 $0.87이며, Flash는 $0.14와 $0.28입니다: 스펙 카드의 양쪽에서 3.1배 차이
• 캐시 적중 입력 — Pro는 백만 토큰당 $0.0036, Flash는 $0.0028
• 훈련 비용 — Xiaomi는 Pro RL 실행에 약 $2.62M, Flash에 $854K를 보고했으며, 각각은 30개 강화 학습 단계와 약 750,000개 궤적에 걸쳐 6일 이내에 완료되었습니다
• 독립 지수 점수 — Artificial Analysis Intelligence Index v4.3.2에서 Xiaomi MiMo-V2.6-Pro는 46이며, MiMo-V2.6-Flash에 대해서는 공개된 점수가 없습니다
마지막 줄은 꼭 기억해 둬야 할 부분입니다. 그 위에 있는 내용은 Pro 점수를 제외하고 모두 Xiaomi가 밝힌 것입니다.
세 배의 가격으로 거의 아무것도 얻을 수 없는 곳
Xiaomi의 표 3은 시리즈가 학습된 하네스 전반에서 두 모델을 나란히 보여주며, 장기적(long-horizon) 에이전트 작업에서는 격차가 미미합니다:
• DeepSWE v1.1 — Pro 71.9, Flash 67.9
• MiMo Code Bench — Pro 63.2, Flash 61.2
• AutomationBench v1.0.6 — Pro 53.1, Flash 52.3
• Toolathlon-Verified — Pro 76.9, Flash 73.6
• Terminal Bench 2.1 — Pro 89.9, Flash 87.6
• OSWorld-Verified — Pro 82.0, Flash 80.8
• JobBench — Pro 62.0, Flash 61.2
• MiMo Visual Coding — Pro 72.3, Flash 71.5
• CyberGym — Pro 94.0, Flash 95.1
• MiMo Cyber Bench — Pro 80.2, Flash 77.2
그 열을 쭉 읽어보면 플래그십의 우위는 대부분 1점에서 4점 사이이고, 한 행에서는 완전히 뒤진다. 67.9와 71.9의 차이가 작업 완료와 작업 실패를 가르는 워크플로에서는 세 배의 가격이 싸다. 그 차이가 두 가지 수용 가능한 답변 사이의 차이인 워크플로에서는 그렇지 않다. 이런 소수점 자리가 있는 공급업체 표는 거짓 정밀도를 부추긴다 — Xiaomi 외부에서는 아무도 그것들을 실행해 본 적이 없고, 내부적으로 채점된 하네스에서의 2점 차이는 다른 채점자나 다른 재시도 정책이 바꿀 수 있는 범위 안에 충분히 들어온다.

그것이 많이 구매하는 곳
격차가 더 이상 반올림 탓으로 돌릴 수 없는 행들이 한데 모여 있습니다. 그 하나하나가 모두 보안 작업입니다:
• ExploitGym — Pro 17.8, Flash 6.0
• ExploitBench — Pro 47.9, Flash 25.3
• SEC Bench Pro — Pro 66.3, Flash 47.5
• Agents' Last Exam — Pro 31.6, Flash 27.6
• Terminal Bench 4.0 — Pro 34.9, Flash 28.8
ExploitGym에서 플래그십은 더 저렴한 모델의 세 배이며, 이는 가격과 같은 배수이고, SEC Bench Pro에서는 1.4배다. 이 패턴은 42B 활성 파라미터를 가진 모델을 15B 모델과 비교할 때 예상할 수 있는 것이다. 부분 점수 없이 긴 추론 연쇄가 필요한 작업은 여분의 용량이 드러나는 유형의 작업이며, CyberGym이 반대 방향에 놓인 것은 두 실행이 서로 다른 크기에서 같은 것을 학습한 것이 아니라 서로 다른 것을 학습했음을 입증하는 예외다.
그래서 이 구분은 마케팅상의 경계가 아니라 실제 워크로드 경계에 대응한다. 성공 기준이 관대한 대량의 에이전트 작업 — 검색, 분류, 일상적인 편집, 재시도로 구제할 수 있는 호출 — 은 Flash의 영역이다. 잘못된 답변이 비용이 많이 들고 부분적인 답변이 무가치한 작업 — 익스플로잇 개발, 보안 검토, 다단계 상태를 가진 터미널 세션 — 은 Pro 등급이 그 배수의 값을 입증하는 영역이다.
존재하지 않는 숫자
MiMo-V2.6-Flash에는 Artificial Analysis 모델 페이지가 없다. 형제 모델에는 있다. 이 비대칭성은 이 페이지에서 단연 가장 중요한 점이다. 왜냐하면 그것은 MiMo-V2.6 시리즈 어디에서든 독립적으로 측정된 유일한 수치가 Xiaomi MiMo-V2.6-Pro 옆의 46이라는 뜻이기 때문이다. 위의 모든 Flash 수치 — Flash가 이기는 CyberGym 행을 포함해 — 는 Xiaomi 하네스, Xiaomi 채점기, Xiaomi 오프라인 실행에서 나온 것이다.
이것이 일시적이라는 합리적인 근거가 있습니다. 이 글을 쓰는 시점에서 이 모델은 나온 지 하루밖에 되지 않았고, 제3자 평가에는 시간이 걸리기 때문입니다. 이것이 구조적이라는 합리적인 근거도 있습니다. Flash는 볼륨 티어이고, 볼륨 티어는 벤치마킹의 관심을 덜 받기 때문입니다. 어느 쪽이든 오늘날 실질적인 결과는, Pro를 비교할 때와 같은 확신을 가지고 Flash를 그 자체 패밀리 밖의 무엇과도 비교할 수 없다는 것입니다. 가격 대비 품질을 기준으로 Flash와 비(非)Xiaomi 모델 중에서 고르고 있다면, 당신은 벤더가 제시한 수치를 다른 누군가가 측정한 수치와 비교하고 있는 것입니다.
두 모델 카드에는 동일한 두 번째 주의 사항이 담겨 있습니다. 어느 저장소도 어떤 추론 제공자에 의해서도 배포되지 않습니다. Hugging Face는 각 페이지에서 이를 명시적으로 밝히고 있으며, Artificial Analysis는 Pro에 대해 단일 API 제공자를 집계했습니다. 우리는 어느 체크포인트도 호스팅하지 않으므로, 둘 다 우리를 통해 라우팅될 수 없습니다. 두 모델로 가는 경로는 Xiaomi 자체 플랫폼과 이를 제공하는 타사 카탈로그입니다.

당신이 지불하는 대가는 토큰이 아니라 하드웨어입니다.
토큰당 가격 책정은 체크포인트에 드는 비용의 절반에 불과하며, 이 둘은 요금표에서보다 디스크에서 훨씬 더 극명하게 차이난다. MiMo-V2.6-Flash는 65개 샤드에 걸쳐 172.9GB의 FP8 가중치를 공개한다. Xiaomi MiMo-V2.6-Pro는 약 3배의 파라미터를 보유하고 있어, 양자화를 적용하기 전 원시 다운로드 용량이 0.5테라바이트대에 이른다. 그리고 자체 저장소는 Safetensors 모델 크기를 524B 파라미터로 보고하는데, 이 수치는 1.02T 총계와도, 42B 활성 파라미터 수와도 들어맞지 않는다.
그 격차는 결정의 성격을 바꿉니다. 172.9 GB의 Flash는 소규모 팀이 임대 컴퓨팅 자원에 자체 호스팅하고 범용품처럼 다룰 수 있는 모델입니다. 그 약 세 배에 달하는 Pro는 클러스터 결정입니다. 출시 무렵의 보도에서는 두 훈련 실행을 각각 약 4,000개와 8,000개의 H200 상당 GPU로 추산했습니다. 오픈 웨이트를 검토하는 이유가 토큰당 비용 지불을 중단할 수 있는 선택지를 원하는 것이라면, 두 체크포인트는 매우 다른 약정 규모로 그 선택지를 제공합니다.
그것들 중에서 선택하기
위의 단서들에도 불구하고 살아남는 규칙은 벤치마크 평균이 아니라 워크로드 클래스로 선택하는 것입니다. 다시 시도해도 괜찮은 작업에는 Flash를, 재시도로 구제되지 않는 작업에는 Pro를 사용하세요. 그런 다음 측정하세요. 실제로 중요한 벤치마크에서 두 모델 모두 독립적인 점수를 갖고 있지 않기 때문입니다.
두 체크포인트를 나란히 측정하는 것이 바로 라우터가 모델별 계약으로는 할 수 없는 일을 해내는 지점입니다. 트래픽의 대부분에는 저렴한 티어를 배정하고 까다로운 케이스만 비싼 티어로 끌어올리는 것은 이 페이지와 같은 결정을, 재작성이 아니라 설정으로 표현한 것입니다. 그리고 바로 그런 조합이 라우팅 계층이 존재하는 이유입니다. 이는 가격 자체에도 중요합니다: 저희는 제공사 정가를 0% 마크업으로 그대로 전달합니다. 따라서 Xiaomi가 두 체크포인트 중 하나의 요금을 인하하면, 저희 쪽 숫자는 다음 계약 갱신 때가 아니라 같은 날 바로 움직입니다. 이는 저희가 취급하는 모델에 적용됩니다. 특히 MiMo-V2.6 두 모델의 경우, 현재로서는 여전히 Xiaomi에서 직접 구매하시는 것입니다.
무엇이 그것을 해결할까요?
두 가지만 있으면 이것은 주관적 판단의 문제가 아니라 산술의 문제로 바뀔 것이다. MiMo-V2.6-Flash에 대한 Artificial Analysis 페이지가 있다면, 현재 Pro를 Intelligence Index 작업당 $0.133에 위치시키는 동일한 작업당 비용 축 위에 두 체크포인트를 나란히 올려놓을 것이고, 비교는 스스로 해결될 것이다. 보안 클러스터 — ExploitGym, ExploitBench, SEC Bench Pro — 에 대한 제3자 재현은 해당 행들의 3배 격차가 모델의 속성인지 채점자의 속성인지 확인해 줄 것이다.
그때까지 방어 가능한 입장은 Xiaomi MiMo-V2.6-Flash가 대부분의 팀에게 대부분의 경우 더 나은 선택이고, Xiaomi MiMo-V2.6-Pro는 실패가 비용이 큰 결과로 이어지는 좁은 부류의 작업에 더 나은 선택이라는 것입니다. Flash가 우세한 단 하나의 행이 그 입장을 뒤집지는 못합니다 — 하지만 이는 플래그십의 프리미엄이 모델에 대한 주장이 아니라 워크로드에 대한 주장이라는 유용한 알림입니다.

