
MiMo-V2.6-Flash vs Qwen3.8-Max: 다운로드 대 측정기, 그리고 그중 오직 하나만 점수를 갖는다
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
이 비교가 보통 어떻게 작성되는지를 결정하는 것은 하나의 숫자이며, 그것은 벤치마크가 아니다. Qwen3.8-Max는 Artificial Analysis가 지속적으로 측정하는 호스팅 모델이므로, 재보정된 v4.3 척도에서 현재 Intelligence Index 45, 초당 39.2토큰의 출력 속도, 그리고 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $6.00의 정가를 갖는다. MiMo-V2.6-Flash는 Xiaomi가 2026년 9월 21일에 다운로드 가능한 가중치로 공개한 모델로, 그런 것들 중 어느 것도 갖지 않는다: 제공자 요금표도, Xiaomi가 발표한 모델 식별자도, Artificial Analysis 페이지도 전혀 없다. MiMo-V2.6-Flash의 성능에 관해 공개된 모든 것은 Xiaomi 자체 모델 카드의 평가 표에서 나온다. Xiaomi에서 일하지 않는 사람이 단 하나의 수치도 다시 실행한 적이 없다.
그 비대칭성은 그 모델에 대한 흠이 아니다. 그것은 각각이 어떤 종류의 구매인지에 관한 사실이며, 일대일 비교로부터 실제로 무엇을 결론 내릴 수 있는지를 바꾼다. 이 글의 나머지는 당신이 진정으로 비교할 수 있는 세 가지 — 주장의 형태, 토큰의 비용, 그리고 라이선스 — 와, 실제이고 독립적으로 측정되었으며 헤드라인에 등장하는 어느 모델에도 속하지 않는 한 가지 수치를 다룬다.
먼저, 어떤 Qwen 3.8이고, 어떤 MiMo인가요?
그 헤드라인의 두 이름은 모두 체크포인트인 척하는 패밀리이며, 그 대체는 무해하지 않다.
• Qwen3.8-Max — 알리바바의 호스팅 플래그십 모델로, 2026년 8월 3일에 공개되었다. 토큰당 약 950억 개의 파라미터가 활성화되는 2.4조 파라미터 규모의 희소 전문가 혼합(MoE) 모델이며, 100만 토큰 컨텍스트와 텍스트·이미지·영상 입력을 지원한다. 이 글의 나머지 부분에서는 이 모델을 상대역으로 다룬다.
• Qwen3.8-Max (0902) — 동일 모델의 9월 2일자 스냅샷으로, 동일한 $2.00 및 $6.00 가격과 131,072토큰 출력 상한을 가진 자체 항목으로 제공됩니다. 현재 Artificial Analysis 페이지는 이 빌드에 대한 것이며, 이는 지수 점수를 인용할 때 중요합니다.
• Qwen3.8-2.4T-A95B — 동일한 코어의 오픈 웨이트 체크포인트로, 2026년 8월 12일부터 Qwen3.8-Max 라이선스에 따라 다운로드할 수 있습니다. 텍스트 전용이며 사고는 항상 켜져 있고, 기본 컨텍스트는 100만이 아니라 262K입니다. 헤드라인에 나온 모델은 아닙니다.
• MiMo-V2.6-Flash — Xiaomi의 총 309B, 활성 15B 희소 전문가 혼합(mixture-of-experts) 체크포인트로, Hugging Face에서 MIT 라이선스로 게이팅 없이 공개되었으며, 네이티브 옴니모달이고 1M 토큰 컨텍스트를 표방합니다. 이는 두 개의 체크포인트 릴리스 중 효율성 멤버로, 플래그십은 총 1.02T, 활성 42B의 MiMo-V2.6-Pro입니다.
• MiMo-V2-Flash — 2025년 12월 모델. 총 309B, 활성 15B, 128토큰 슬라이딩 윈도우는 동일합니다. 하지만 학습 실행이 다르고, 벤치마크 표가 다르며, 256K 컨텍스트를 갖췄습니다. "MiMo-V2-Flash"를 Qwen 모델과 비교해 순위를 매기는 페이지는 잘못된 세대를 비교하는 것이며, 스펙 시트만으로는 이를 알 수 없습니다.
MiMo 충돌은 두 함정 중 더 날카로운 쪽이다. 모델을 식별하는 숫자가 2025년과 2026년 체크포인트 사이에서 동일한 숫자이기도 하기 때문이다. Qwen 충돌은 더 온건하지만 대가가 따른다. 공개된 2.4T 가중치와 호스팅된 API는 서로 다른 조건을 지닌 서로 다른 아티팩트이며, 이 둘을 맞바꾸는 비교는 능력과 라이선스를 모두 잘못 판단하게 된다.
색인이 재구축되었고, 대부분의 페이지가 여전히 인쇄하는 그 번호는 사라졌다.
점수가 나타나기 전에 주의해야 할 실패 모드는 다음과 같습니다.
Artificial Analysis는 2026년 9월 7일 Intelligence Index를 v4.3으로 재조정했습니다. 그 날짜 이전 점수는 이후 점수와 비교할 수 없으며, 라이브 Qwen3.8-Max 페이지에는 업데이트됨 배지가 있어 재산정된 결과를 나타냅니다. Qwen3.8-Max에 대해 널리 퍼진 58이라는 수치는 구 척도에 속합니다. 현재 Qwen3.8-Max(0902)는 45로, Artificial Analysis가 해당 등급에 배치한 202개 모델 중 19위입니다.
이것은 지나친 세세함이 아니다. 58 옆의 46은 12점 차이로 읽힌다. 같은 현재 척도에서 같은 두 모델은 단 1점 차이이며 — 게다가 46은 이 글에서 다루는 모델조차 아니다:
• Qwen3.8-Max (0902), 독립적으로 측정됨 — v4.3에서 Intelligence Index 45. 출력 속도 초당 39.2토큰으로 202개 중 151위이며, 페이지 자체에서도 이는 느리다고 언급합니다. Intelligence Index 작업당 비용 $5.41. 지수를 완료하기 위해 생성된 출력 토큰: 190M.
• MiMo-V2.6-Pro, 독립적으로 측정 — Intelligence Index 46, 오픈 웨이트 부문 114개 모델 중 1위. 출력 속도 초당 134.3 토큰. Intelligence Index 작업당 비용 $0.13. 지수를 완료하는 데 필요한 출력 토큰: 140M.
• MiMo-V2.6-Flash, 실제 주제 — Artificial Analysis 페이지가 존재하지 않음. 인용할 내용 없음.
그 세 가지를 함께 읽으면 두 벤더 모두에게 솔직한 요약은 불편하다. 모두가 원하는 비교 지점 — 중립적 척도에서 Flash 대 Qwen3.8-Max — 은 존재하지 않고, 벤더 표에서 구성할 수도 없다. 왜냐하면 두 벤더는 서로 다른 시점에 서로 다른 체크포인트에서 서로 다른 평가 하네스를 실행한 다음, 자신들 역시 실행했던 다른 회사들의 모델과 자신들을 비교했기 때문이다. 실제로 존재하는 것은 플래그십 Qwen과 Xiaomi의 더 큰 체크포인트 사이의 1점 차이뿐이며, 인덱스 작업당 비용은 대략 40분의 1이다. 그것이 이번 맞대결에서 가장 흥미로운 실제 숫자이며, 이는 헤드라인 어느 쪽도 이름을 언급하지 않은 모델에 관한 것이다.

벤더 테이블이 알려주는 것과 알려주지 않는 것
두 업체 모두 수치를 공개한다. 그 수치들은 같은 종류가 아니어서, 항목별로 나란히 놓아 봐야 결론이 아니라 도표가 나올 뿐이다. 그래도 각 주장의 형태는 여전히 읽어볼 가치가 있다. 각 연구소가 무엇에 최적화했는지를 알려주기 때문이다.
• 코드 에이전트 — Xiaomi는 MiMo-V2.6-Flash가 DeepSWE v1.1에서 67.9, Terminal Bench 2.1에서 87.6, ProgramBench에서 26.0, MiMo Code Bench에서 61.2를 기록했다고 보고한다. Alibaba는 Qwen3.8-Max가 SWE-bench Pro에서 67.7, Terminal-Bench 2.1에서 86.6을 기록했다고 보고한다. Terminal-Bench 수치들은 서로 충분히 가까워서, 모델이 아니라 하네스가 순위를 결정하고 있을 가능성이 있다.
• 범용 에이전트 — Xiaomi는 Flash에 대해 AutomationBench v1.0.6 52.3, Toolathlon-Verified 73.6, OSWorld-Verified 80.8, Agents' Last Exam 27.6을 보고했습니다. Alibaba는 Qwen3.8-Max에 대해 OSWorld-Verified 86.1, WideSearch 81.9, Agent's Last Exam 52.4를 보고했습니다. 두 연구소가 모두 실행한 두 벤치마크에서 Qwen이 보고한 수치가 더 앞서 있습니다 — Alibaba 자체 하네스에서요.
• 지식 및 보안 — Xiaomi는 CyberGym (Flash 95.1), MiMo Cyber Bench (77.2), ExploitGym (6.0), ExploitBench (25.3) 및 SEC Bench Pro (47.5)를 운영합니다. Alibaba는 GPQA Diamond (92.6), Humanity's Last Exam (43.6) 및 PaperBench (93.0)를 운영합니다. 거의 겹치지 않으므로 비교할 것이 거의 없습니다.
벤더 표가 보여줄 수 있는 진정으로 유용한 한 가지는 내부적 불일치이며, 샤오미의 표에는 그것이 하나 있다. 9월까지 학습 실행을 스트리밍한 샤오미의 공개 RL 대시보드는 mini-swe-agent 하네스를 사용해 세 번 평균을 낸 DeepSWE v1.1에서 MiMo-V2.6-Flash를 65.68로 게시했다. 완성된 모델 카드는 공개된 가중치에 대해 67.9를 표기한다. 이 둘은 각각 학습 스냅샷과 배포된 결과물을 설명하는 것이며, 그 2점 차이는 샤오미의 두 체크포인트 사이의 격차와 같은 크기다. 지난주부터 대시보드 수치를 인용해 왔다면, 그것은 이미 낡은 것이다.
청구서, 즉 두 모델이 더 이상 비교할 수 없게 되는 지점
배포를 결정짓는 부분이며, 그 차이는 크다.
• Qwen3.8-Max는 종량제입니다. 알리바바의 국제 요금표에 따르면 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $6.00이며, Artificial Analysis가 측정한 캐시 할인은 88%이고 Intelligence Index 작업당 비용은 $5.41입니다. 알리바바의 중국 지역 문서에는 동일한 조합에 대해 100만 개당 CNY 12와 CNY 36이 나와 있습니다. 오늘 오후에 호출하면 청구서를 받을 수 있습니다.
• MiMo-V2.6-Flash는 다운로드 항목입니다. Xiaomi는 자사 사이트에 MiMo-V2.6 세대의 토큰당 요금을 공개하지 않았고, 두 체크포인트 중 어느 것에 대해서도 호출 가능한 식별자를 발표하지 않았으므로, 과금할 대상이 없습니다. 대신 있는 것은 1M 토큰 컨텍스트용 KV 캐시를 제외하고도 65개 샤드에 걸친 172.9GB의 FP8 가중치 데이터와, 텐서 병렬 16 및 데이터 병렬 계수 2의 SGLang을 권장하거나 텐서 병렬 8의 vLLM 레시피를 권장하는 배포 섹션입니다 — 다중 노드 서빙 작업입니다.
제3자 목록은 요금표가 아닙니다. 카탈로그 페이지에는 MiMo-V2.6 시리즈에 대한 수치가 실제로 실려 있으며, Artificial Analysis는 MiMo-V2.6-Pro를 백만 개당 $0.435 및 $0.87에 제공하는 단 하나의 API 제공업체를 집계합니다. 이는 더 큰 체크포인트에 대한 한 제공업체의 목록일 뿐 Xiaomi의 가격이 아니며, Flash의 경우에는 아예 존재하지 않습니다.
그래서 이 계산은 자본 결정에 맞서는 종량제 청구 항목입니다. 월 수억 토큰 수준에서 Qwen3.8-Max는 예측할 수 있는 청구서이고, Flash는 Xiaomi 외부에서는 아무도 측정한 적 없는 모델을 서빙하기 위해 구매하게 될 노드입니다. 월 수십억 토큰 수준이 되면 오픈 경로가 비용에서 이기기 시작하며, 바로 이 지점에서 라이선스는 법적 각주 역할을 그만두고 조달 입력 요소가 됩니다.
라이선스는 동일한 허가가 아닙니다.
MIT는 오픈 웨이트 중에서도 가장 관대한 축에 속한다. Qwen3.8-Max 라이선스는 MIT가 아니며, 그 차이는 결코 가볍지 않다.
MiMo-V2.6-Flash는 수익 기준, 사용자 수 트리거, 별도의 상업적 계약, 연구 조항 없이 MIT 라이선스로 배포됩니다. 상업적 배포, 수정, 재배포, 추가 학습이 모두 허용되며, 저장소는 제한 없이 접근할 수 있습니다.
Qwen3.8-Max 라이선스는 두 가지 조건 아래 사용, 수정, 배포, 재라이선스, 판매, 배치, 호스팅 및 파인튜닝을 허용합니다. 월간 활성 사용자 수가 1억 명을 초과하거나또는 월 매출이 2천만 달러를 초과하는 제품 또는 서비스는 자사 인터페이스에 모델 이름을 눈에 띄게 표시해야 합니다. 또한 연속된 12개월 동안 총 매출이 5천만 달러를 초과하는 모델 서비스(MaaS) 또는 AI 업무 지원 사업은 상업적으로 사용하기 전에 Alibaba로부터 별도의 라이선스를 받아야 합니다. 단, 모델이나 그 기능이 제3자에게 노출되지 않는 경우 내부 사용은 예외로 인정됩니다.
대부분의 팀에게는 두 조건 중 어느 것도 구속력을 갖지 않는다. 성공한 플랫폼 비즈니스라면 그중 하나가 구속력을 갖는데, 그것도 바로 모델이 핵심 지지대가 된 바로 그 순간에 구속력을 발휘한다. 또한 이 조건들은 다운로드 가능한 2.4T 가중치에 적용되는 것이지, 대신 제공업체의 약관이 적용되는 호스팅 API에 적용되는 것이 아니라는 점도 유의하라. 두 경로는 서로 다른 의무를 지니며, 이는 오픈 체크포인트를 마치 같은 제품인 것처럼 호스팅 버전과 비교해서는 안 되는 또 하나의 이유다.
OrcaRouter가 적합한 경우와 그렇지 않은 경우
Qwen3.8-Max는 OrcaRouter에서 기본 항목과 날짜가 지정된 0902 스냅샷 모두에 대해 라우팅할 수 있으며, 공급자 정가에 0% 마크업이 그대로 전달되는 하나의 API 키를 통해. 이 점이 여기서 특히 중요한 이유는 두 가지입니다. 첫째, 0902 빌드는 조용한 대체가 아니라 별도의 항목이므로 라우팅 DSL이 재현성에 민감한 트래픽을 날짜가 지정된 스냅샷에 고정할 수 있고 나머지 모든 트래픽은 기본 티어를 따릅니다 — 추가 통합도, 코드 변경도 필요 없습니다. 둘째, 정가가 마크업되지 않고 그대로 전달되므로 알리바바의 요율표 변경이 다음 계약 갱신 시점이 아니라 같은 날 귀하 쪽에 반영되며, 이것이 가격이 변동할 때 위의 종량제 대 노드 산술을 정직하게 유지해 줍니다. 또한 캐시 비중이 높은 워크로드는 캐시 할인의 일부를 재판매업체의 마진으로 잃지 않고 공급자의 캐시 할인을 그대로 유지합니다.

MiMo-V2.6-Flash는 어디에서도 라우팅할 수 없습니다, 저희 쪽을 포함해서요. 저희는 어떤 Xiaomi 모델도 라우팅하지 않으며, Xiaomi 자체 카드의 가용성 안내는 Xiaomi 자체 채널, 즉 MiMo API 플랫폼, AI Studio, MiMo Code 및 데스크톱 앱을 가리킵니다. 이 체크포인트를 원하신다면, 172.9GB를 다운로드하고 노드를 찾아야 합니다.

어느 것이며, 언제인가요?
하드웨어 없이 성능을 원하거나, 사용량이 불확실하거나, 도입을 확정하기 전에 독립적인 수치를 확인할 선택지를 원한다면 Qwen3.8-Max를 선택하세요. 현재 인덱스에서 45는 최상위가 아니라 프런티어 중간 위치라는 점, 초당 39.2토큰은 에이전트 루프 안에서 문제가 될 만큼 느리다는 점, Intelligence Index를 끝내는 데 190M 출력 토큰이 필요하다는 것은 중앙값의 약 두 배라는 점을 받아들이세요 — 장황함은 출력 요금이 부과되는 쪽에서 비용을 발생시킵니다.
제약 조건이 라이선스, 데이터 경로, 또는 상각할 수 있는 장기 청구서라면 — 그리고 노드가 있다면 — MiMo-V2.6-Flash를 선택하세요. 수익 게이트가 없는 MIT 조건은 MAU 임계값과 수익 공유 트리거가 있는 라이선스와는 진정으로 다른 허가이며, 규모가 커질 것으로 예상하는 회사라면 바로 그 점이 이것을 선택하는 이유입니다. 다중 노드 서빙에 대한 예산을 책정하고, 저장소 페이지가 아니라 공개된 가중치 데이터를 기준으로 규모를 산정하며, 연구소 외부의 누군가가 이를 다시 실행할 때까지 Xiaomi의 카드에 있는 모든 숫자를 벤더 보고로 취급하세요.
그리고 다음 분기가 아니라 오늘 선택하려는 거라면, 먼저 종량제 옵션을 돌려보세요. Qwen3.8-Max로 한 달을 써보면 워크로드에 실제로 무엇이 필요한지 알 수 있습니다. 노드는 당신이 바랐던 것만 알려줄 뿐입니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
