
Xiaomi MiMo-V2.6-Flash 출시: 직접 서빙하는 309B 오픈 모델
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiMo-V2.6-Flash의 훈련 작업은 2026년 9월 21일 15:39 UTC에 중단되었습니다. 그때 Xiaomi의 MiMo 팀이 체크포인트를 XiaomiMiMo/MiMo-V2.6-Flash-RL로 Hugging Face에 공개했습니다 — 게이트 없이, MIT 라이선스, 기술 보고서 첨부, 인덱스에 65개의 가중치 샤드. XiaomiMiMo/MiMo-V2.6-Pro-RL은 18초 뒤에 이어졌습니다. 일주일 전, 두 모델은 공개 훈련 대시보드에서 "중단됨"으로 표시된 두 개의 카드였고, 이들에 관해 널리 반복되던 말은 가중치가 존재하지 않는다는 것이었습니다. 이제 이들은 누구나 다운로드하고 서빙할 수 있는 파일입니다. 그것은 모델로 할 수 있는 일의 실질적인 변화이며, 모델에 대한 발표와는 다른 것입니다.
타임스탬프부터 짚고 시작하자. 이번 릴리스는 여느 벤더의 의례적인 연출 없이 도착했기 때문이다. 9월 22일에 확인한 샤오미 자체 블로그에는 2025년 12월 MiMo-V2-Flash 출시 글이 여전히 최신 게시물로 표시된다. V2.6 출시 에세이도 없고, 새 세대를 위한 공개된 가격표도 없으며, 샤오미가 두 체크포인트 중 어느 것에 대해서도 발표한 호출 가능한 모델 식별자도 없다. 존재하는 것은 저장소, 기술 보고서, 배포 레시피, 그리고 벤더가 실행한 벤치마크 표 세트뿐이다. 게다가 실제로 이걸 로드할 계획인 사람들에게만 중요한, 모델 카드 속의 적대적인 작은 디테일 하나가 있다.
당신이 들 수 있는 두 장의 카드
두 체크포인트 모두 네이티브 옴니모달이며 100만 토큰 컨텍스트를 주장하고, 둘 다 MIT 라이선스를 따릅니다 — 상업적 사용, 파인튜닝, 재배포가 가능하고 수익 게이트나 연구 조항이 없습니다. 카드에서는 Flash를 이 시리즈의 "효율 균형형 체크포인트", Pro를 플래그십이라고 부르는데, 흥미로운 부분은 마케팅 문구가 아니라 설정을 들여다볼 때 두 모델이 어떻게 달라지는가입니다.
• 파라미터 수 — MiMo-V2.6-Flash는 총 309B에 토큰당 15B 활성화, MiMo-V2.6-Pro는 총 1.02T에 42B 활성화. 둘 다 희소 전문가 혼합(mixture-of-experts) 방식.
• Backbone — Flash는 48개 레이어(슬라이딩 윈도우 39개, 글로벌 어텐션 9개), 히든 크기 4096, 라우팅된 전문가 256개(8개 활성화), 128토큰 슬라이딩 윈도우, 공유 전문가 없음으로 구성됩니다. 첫 번째 블록은 밀집 피드포워드 네트워크를 사용하는 글로벌 어텐션이며, 그 이후의 모든 것은 교차 배치됩니다.
• 인코더 — 681M 파라미터의 MiMo ViT(28개 레이어, 슬라이딩 윈도우 24개 + 전체 4개), 308M 오디오 토크나이저, 127M 오디오 패치 인코더로, 텍스트, 이미지, 비디오, 오디오가 모두 억지로 이어 붙인 세 개의 파이프라인이 아니라 동일한 하나의 모델로 들어갑니다.
• 추측 디코딩 — 5계층 다중 토큰 예측 드래프터로, DFlash 스타일이며, 카드에서는 순방향 패스당 7개 토큰을 미리 예측하여 병렬 검증을 수행한다고 설명합니다.
• 스토리지 — 공개된 인덱스는 동적 활성화 방식을 사용하는 FP8(e4m3)으로, 65개 샤드에 걸쳐 172.9GB의 가중치 데이터를 보고합니다. 이는 파라미터당 대략 9바이트로 해석할 수 있습니다: Xiaomi는 그것을 노트북 크기로 양자화한 것이 아니라, 대형 모델을 출시한 것입니다.
일치하지 않는 세 개의 숫자
이 점은 분명히 짚고 넘어갈 가치가 있습니다. 세 가지 모두 벤치마크 논쟁이 아니라 배포 결정에 영향을 미치며, 그중 어느 것도 수상한 것은 아닙니다. 그것들은 작성 문서와 저장소 페이지, 그리고 배포된 파일 사이의 문서 불일치처럼 보입니다.
첫 번째는 추측 디코더입니다. 모델 요약에는 MTP 헤드가 패스당 7개 토큰을 예측하는 5계층 드래프터라고 나옵니다. config.json은 같은 저장소에서 num_nextn_predict_layers를 3으로 설정합니다. 두 숫자가 모두 같은 아티팩트를 설명할 수는 없으며, 런타임이 읽게 될 것은 config입니다. 추측 디코딩을 위해 메모리 크기를 산정하고 있다면 config를 신뢰하고 로딩 후 검증하십시오.
두 번째는 더 미묘하며, 오류라기보다는 오류처럼 읽히는 명명 규칙에 가깝습니다. 저장소 이름은 MiMo-V2.6-Flash-RL인데, 이는 이것이 모델이 아니라 강화학습 어댑터라는 가정을 불러일으킵니다. 이것이 바로 모델입니다. -RL 접미사는 포스트 트레이닝 계보를 나타냅니다 — 이 체크포인트는 샤오미가 스트리밍한 혼합 RL 실행의 결과물이며, 다른 어떤 베이스 위에 얹힌 LoRA가 아닙니다. 가중치 인덱스가 이를 확인해 줍니다: 전체 백본, 비전 인코더, 오디오 스택, 그리고 드래프터를 아우르는 수만 개의 텐서.
세 번째는 카드가 아니라 저장소 페이지에서 하드웨어를 산정할 때 가장 먼저 마주치게 되는 숫자입니다. 그 페이지의 Safetensors 블록에는 159B 파라미터가 표시됩니다. 이는 카드의 두 숫자 중 어느 것도 아닙니다 — 309B 총계도, 15B 활성도 아니며, 다운로드 버튼 바로 옆에 자리하기 때문에 용량 계획 담당자가 가장 베끼기 쉬운 수치입니다. Xiaomi는 그 차이를 설명하지 않았고, 우리가 외부에서 그것을 확정할 수는 없습니다. 가장 그럴듯한 해석은 다른 모델이 아니라 양자화된 텐서에 대한 계수 관례라는 것입니다. 안전한 방법은 대신 공개된 가중치 데이터를 기준으로 산정하는 것입니다. 65개 샤드에 걸친 172.9 GB의 FP8은 파라미터가 어떻게 계수되든 VRAM으로 반드시 지불해야 하는 숫자입니다.
벤치마크가 말하는 바, 그리고 누가 그것을 실행했는지
아래의 모든 수치는 Xiaomi가 모델 카드에 실은 자체 평가 표에서 나온 것입니다. 그중 어느 것도 독립적으로 재현된 적이 없고, 공개 리더보드에 오른 적도 없으며, 비교 열은 벤더가 다른 회사들의 모델을 상대로 동일한 하네스를 자체 실행한 결과입니다. 결과의 형태는 유의미한 정보로, 소수점 자릿수는 장식으로 여기세요.
• 코드 에이전트 — DeepSWE v1.1: Flash 67.9, Pro 71.9 대비 Claude Opus 5 74.0, GPT-5.6 Sol 73.0, Claude Fable 5는 70.0입니다. Terminal Bench 2.1에서 Flash는 Opus 5의 89.1에 맞서 87.6을 기록했는데, 이 격차는 모델이 아니라 하네스가 판가름하고 있을 만큼 작습니다.
• 범용 에이전트 — AutomationBench v1.0.6에서 Flash는 52.3을 기록하며, Xiaomi의 실행에서 GPT-5.6 Sol(45.8)과 Claude Opus 5(50.3)를 모두 앞섰습니다. Toolathlon-Verified: Flash 73.6, Pro 76.9, Opus 5 80.6.
• 사이버 보안 — 표에서 가장 한쪽으로 치우친 항목. CyberGym: Flash 95.1로, 더 큰 형제 모델의 94.0보다 높고, MiMo-V2.5-Pro는 40.0이다. 그러다 바닥이 꺼진다: ExploitGym은 Flash 6.0 대 Opus 5의 22.1, ExploitBench는 25.3 대 70.0, SEC Bench Pro는 47.5 대 GPT-5.6 Sol의 79.1이다.
• 비주얼 에이전트 — MiMo VisualCoding: Flash 71.5, Pro 72.3, Opus 5 70.0.
꼭 짚고 넘어갈 만한 숫자가 하나 있는데, 그것은 출시 글이 보통 숨기는 종류의 것이다. Xiaomi의 RL 대시보드는 Flash가 65.68을 DeepSWE v1.1에서 기록했다고 발표했으며 — 그리고 모델 카드는 이제 67.9를 동일한 벤치마크에 대해 완성된 체크포인트에서 표기한다. 이 둘은 같은 측정치가 아니다. 대시보드 수치는 훈련 스냅샷에 대해 mini-swe-agent, avg@3로 표기된 것이고, 카드의 표는 공개된 가중치에 대한 벤더의 오프라인 평가다. 2포인트 차이는 실행의 마지막 부분에서 얻은 이득에 평가 설정에서 바뀐 부분을 더한 것이며, 현재 Xiaomi 외부의 누구도 이 둘을 분리할 수 없다. 지난주부터 65.68을 인용해 왔다면, 그것은 이제 다른 아티팩트에 대한 낡은 숫자다.

실제로 운영하는 데 드는 비용
오픈 웨이트는 라이선스이지 청구서가 아니며, 바로 이 지점에서 이번 릴리스는 덜 축하할 만해진다. 모델 카드의 배포 섹션 자체가 SGLang(텐서 병렬 16, 데이터 병렬 2, EAGLE 스타일 다중 계층 추측 경로 활성화) 또는 텐서 병렬 8의 vLLM 레시피를 권장하며, 안정 버전 vLLM이 이 아키텍처를 따라가지 못할 수 있다고 언급한다. 이는 가중치만 해도 1M 토큰 컨텍스트를 위한 KV 캐시를 추가하기 전에 약 173 GB를 차지하는 309B 모델을 위한 멀티노드 서빙 작업이다. 권장 샘플링은 temperature 1.0, top_p 0.95다.
그래서 여기서 "오픈 소스"를 솔직하게 규정하자면 이렇습니다: Xiaomi는 라이선스 장벽은 없앴지만 하드웨어 장벽은 있던 그대로 남겨 두었습니다. 이제 자체 트레이스로 Flash를 파인튜닝하는 것은 합법적이고 가능합니다. 하지만 제대로 된 GPU 노드보다 작은 환경에서 하는 것은 불가능합니다. 이는 호스티드 엔드포인트와는 실제로 다른 제안이며, 이것이 이 세대를 사용하는 두 가지 방식이 경쟁하지 않는 이유입니다 — 두 방식은 서로 다른 예산을 감당합니다.
노드 없이 그 기능을 원한다면, 샤오미가 해당 표에서 벤치마크 대상으로 삼은 모델들이 실질적인 대안입니다. GPT-5.6 Sol, Claude Opus 5, Claude Fable 5는 모두 지금 바로 호출할 수 있고, 이들은 API 키 하나로 OrcaRouter에서 0% 마크업이 그대로 전달되는 공급자 정가에 이용할 수 있습니다. 따라서 여러분이 실제로 내리는 결정은 "노드를 살까" 대 "호출한 만큼 과금될까"입니다. 어느 쪽으로든 결정하기 전에 호출 가능한 등급이 동일한 코딩 작업에서 어떻게 비교되는지 보고 싶다면, 코딩 보드가 벤더 표보다 더 빠르게 훑어볼 수 있는 자료입니다. 오늘날 어떤 라우터에서도 할 수 없는 일은 MiMo-V2.6-Flash 자체를 호출하는 것입니다 — 저희는 샤오미 모델을 라우팅하지 않으며, 샤오미 자체 카드의 가용성 항목은 샤오미 자체 채널, 즉 MiMo API 플랫폼, AI Studio, MiMo Code, 데스크톱 앱을 가리킵니다.

가격 책정 문제는 아직 미해결이다
샤오미는 MiMo-V2.6-Flash의 토큰당 요금을 공개하지 않았다. 출시를 다룬 보도에서는 이 시리즈가 MiMo-V2.5의 API 가격을 유지할 것이라고 하는데, 이는 벤더의 가격표가 아니라 언론의 주장이다. V2.5 세대의 공개된 해외 요금은 입력 토큰 백만 개당 약 0.1달러였고 캐시 입력은 그보다 한 자릿수 더 저렴했지만, 샤오미 사이트 어디에도 새 체크포인트가 그 요금을 이어받는다는 점을 확인해 주는 내용은 없다. 가격표가 나오기 전까지 MiMo-V2.6 엔드포인트에 대해 보게 되는 어떤 수치든 그것은 누군가의 추론일 뿐이다.
아직 두 가지가 더 빠져 있는데, 둘 다 다른 누구도 아닌 샤오미 자체의 할 일 목록에 있습니다. RL 라이브스트림에서 뤄푸리는 학습 환경과 RL 코드를 오픈소스로 공개하겠다고 밝혔고, 출시 자료에서도 이 약속을 반복합니다. 현재 저장소에는 가중치, 기술 보고서, 배포 지침만 제공될 뿐 학습 스택은 없습니다. 그리고 독립적인 평가도 없습니다: 리더보드 제출도, DeepSWE나 CyberGym 항목에 대한 제3자 재실행도 없습니다. 309B 모델이 15B 활성 예산으로 노드 하나를 쓸 가치가 있는지 판단하려는 사람에게 가장 중요한 격차가 바로 이것입니다.
무엇이 상황을 바꿀까요?
주목할 만한 세 가지 신호가 있는데, 이는 의사 결정을 얼마나 크게 흔들 수 있는지의 대략적인 순서대로다. 공개된 가격표는 이것을 셀프 호스팅 프로젝트에서 호스팅 최전선과 비교할 수 있는 비용 항목으로 바꿔 준다. 동일한 하네스 — DeepSWE 또는 Terminal Bench — 에서 자체 보고가 아니라 제출 방식으로 이루어진 제3자 실행은 67.9가 실제 위치인지 아니면 유리한 구성인지를 판가름해 줄 것이다. 그리고 RL 환경이 실제로 등장한다면, 대부분의 팀에게 더 흥미로운 산출물이 될 텐데, 그것은 자신의 데이터로 자기 개선 루프를 재현하는 데 필요한 것이기 때문이다.
그때까지, 이번 릴리스에 대한 실질적인 해석은 좁고 명확하다. MiMo-V2.6-Flash는 합법적인 오픈 웨이트, MIT 라이선스의 옴니모달 에이전트 모델로, 클러스터를 전제로 하는 규모이며 — 그리고 그것은 당신이 직접 손에 쥘 수 있는 MiMo-V2.6 세대의 첫 체크포인트다. 이는 지난주에는 그것에 대해 할 수 없었던 말이다.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
