
MiMo-V2.6-Pro vs Qwen3.8-Max: 지수 1포인트 차이, 가격은 6배
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-Max는 2.4조 개 파라미터 모델로, 토큰당 950억 개를 활성화하며 단일 공급자에서 실행됩니다. Xiaomi MiMo-V2.6-Pro는 1.02조 개 파라미터 모델로 토큰당 420억 개를 활성화하고, 동일한 독립 지수에서 1점 더 높은 점수를 받으며, 호출 비용은 약 6분의 1에 불과합니다. 이 사실들은 함께 놓으면 어색하게 맞물리고, 이를 어떻게 해석하느냐가 곧 두 모델 사이의 선택 그 자체입니다. 짧게 요약하면: Artificial Analysis Intelligence Index v4.3.2에서 Xiaomi MiMo-V2.6-Pro는 46점, Qwen3.8-Max는 45점으로 — 오차 범위 안의 동점 — 이며, 가격표에는 백만 토큰당 $0.43와 $0.87이 $2.00와 $6.00에 맞서는 것으로 적혀 있습니다.
각 모델이 실제로 무엇인지
Qwen3.8-Max는 알리바바의 플래그십으로 2026년 8월 3일부터 정식 제공되었으며, 출시 당시 Qwen 라인이 선보인 가장 큰 모델이었습니다. 이 모델은 Qwen 3.5 아키텍처를 기반으로 구축된 희소 전문가 혼합(MoE) 모델로, 총 파라미터가 2조 4,000억 개에 달하고 토큰당 약 950억 개가 활성화되며, 100만 토큰 컨텍스트 윈도우, 최대 131,000 토큰의 출력, 텍스트·이미지·비디오 전반에 걸친 멀티모달 입력을 지원합니다. 알리바바는 국제 요금을 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $6.00으로 인하하고 캐시된 입력은 $0.25로 책정했으며, 이를 Claude Opus 5의 입력 가격 대비 약 40% 수준이라고 홍보했습니다. 후속 포인트 업데이트인 Qwen3.8-Max-0902가 2026년 9월 2일에 이어졌으며, 현재 Artificial Analysis가 45점으로 벤치마킹하는 모델입니다.
Xiaomi MiMo-V2.6-Pro는 이 비교 글이 작성되기 사흘 전인 2026년 9월 22일에 정식 출시되었으며, 강화 학습 체크포인트 저장소는 그 전날 공개되었습니다. 이 모델은 총 1.02조 개 매개변수와 토큰당 420억 개 활성 매개변수를 가진 희소 전문가 혼합(MoE) 모델로, 동일한 100만 토큰 컨텍스트 창, 텍스트·이미지·비디오·오디오 전반에 걸친 네이티브 멀티모달리티를 갖추고 있으며 가중치는 MIT 라이선스로 공개되었습니다. Xiaomi는 새 체크포인트의 가격을 인상하는 대신 이전 세대의 가격을 유지했으며, 그렇기 때문에 99% 캐시 할인과 혼합 $0.18로 $0.43 및 $0.87에 책정되어 있습니다.
• 토큰당 활성 연산 — Qwen3.8-Max 95B; Xiaomi MiMo-V2.6-Pro 42B, 절반 미만
• 총 파라미터 — Qwen3.8-Max 2.4T; Xiaomi MiMo-V2.6-Pro 1.02T
• 지수 점수 — Xiaomi MiMo-V2.6-Pro 46; Qwen3.8-Max 45, 둘 다 Artificial Analysis v4.3.2 기준
• 출력 속도 — Xiaomi MiMo-V2.6-Pro 134.3토큰/초; Qwen3.8-Max 39.2, 티어 중앙값 72.5 대비
• 첫 토큰까지의 시간 — Xiaomi MiMo-V2.6-Pro 2.15초; Qwen3.8-Max 2.93
• 정가 — Xiaomi MiMo-V2.6-Pro 1M당 $0.43 / $0.87; Qwen3.8-Max $2.00 / $6.00
• 블렌디드 요금 — Xiaomi MiMo-V2.6-Pro 100만 토큰당 $0.18, 캐시 적중/입력/출력 7:2:1 기준; Qwen3.8-Max $1.18
• 가중치 — Xiaomi MiMo-V2.6-Pro는 MIT 라이선스로 제공되며 다운로드 가능; Qwen3.8-Max는 독점 엔드포인트로 제공되었고, 1M 컨텍스트와 비전 입력을 제거한 텍스트 전용 오픈 웨이트 릴리스가 함께 제공됩니다.
• 도달 가능성 — Artificial Analysis에서 각각 하나의 API 제공업체로 집계
점수는 동점이다. 속도는 그렇지 않다.
10개 평가 종합 점수에서 1점 차이는 누구도 그에 따라 행동할 만한 차이는 아니며, 더 유용한 신호는 그 이면에서 일어난 일입니다. 토큰당 활성 파라미터가 절반도 안 되는 모델이 근소하게 더 높은 점수를 받았고 출력을 3.5배 더 빠르게 생성했습니다. 초당 134.3 토큰 대 39.2 토큰이며, 비교 가능한 추론 모델의 중앙값은 72.5입니다. Qwen3.8-Max는 해당 페이지에서 측정된 프런티어급 모델 중 가장 느리며, 이는 서빙상의 우연이 아니라 토큰당 950억 개의 파라미터를 활성화하는 데 따른 설계상의 결과입니다.
지연 시간은 파라미터 수가 시사하는 것과는 정반대의 이야기를 들려준다. Qwen3.8-Max는 첫 토큰에 도달하는 데 2.93초가 걸리는 반면 Xiaomi는 2.15초이며, 그 격차는 처리량 격차보다 훨씬 작다 — Qwen3.8-Max는 일단 쓰기 시작하면 느린 것이지, 시작이 느린 것은 아니다. 답변이 짧은 채팅 인터페이스에서는 그 차이가 거의 드러나지 않는다. 수만 개의 출력 토큰을 생성하는 에이전트 루프에서는 처리량이 곧 전체 소요 시간이며, 3.4배의 격차는 실행의 매 턴마다 누적된다.

공급업체 테이블이 서로 불일치하는 지점, 그리고 그것이 모순이 아닌 이유
Alibaba는 Qwen3.8-Max를 위한 광범위한 표를 공개했으며, 그것은 정말 강력하다: Terminal-Bench 2.1은 86.6, SWE-bench Pro는 67.7, PaperBench는 93.0, GPQA Diamond는 92.6, IFBench는 82.8, OSWorld-Verified는 86.1, Humanity's Last Exam은 43.6이다. 이는 Alibaba 자체 하네스에서 공급업체가 실행한 수치이고, 일부는 Alibaba 자체 벤치마크에서 나온 것이므로, 측정값이라기보다는 주장이다. 그러나 널리 사용되는 벤치마크에 대한 주장이므로, 맞춤형 하네스 결과보다 여러 연구소 간에 더 비교 가능하게 한다.
샤오미의 대표 수치는 DeepSWE v1.1에서 72.57로, 58.4 기준선에서 상승한 값이며, 샤오미 자체 채점기에서 mini-swe-agent로 3회 평균을 측정한 것이고, 샤오미가 30단계와 약 750,000개의 궤적으로 문서화한 강화학습 실행에 걸쳐 공개된 지출 약 262만 달러로 이루어졌다. 이는 공개 DeepSWE 리더보드에 제출되지 않았고 제3자가 재현한 적도 없다. 72.57을 Qwen의 67.7 SWE-bench Pro와 맞세우고 샤오미가 5점 차로 이겼다고 선언하는 것은 서로 다른 두 벤치마크, 서로 다른 두 하네스, 서로 다른 두 채점 관행을 가로질러 읽는 것이다. 두 모델 모두 제작자가 아닌 누군가에 의해 실행된 자는 정확히 하나뿐이며, 그것은 46 대 45를 말한다.
Qwen3.8-Max에 관한 더 중대한 수치 두 가지는 점수가 전혀 아니다. 알리바바는 가중치가 Qwen3.8-27B와 함께 오픈소스로 공개될 것이라고 발표했지만, 실제로 공개된 체크포인트는 텍스트 전용이며, 서비스되는 Max 엔드포인트가 가진 전체 1M 토큰 컨텍스트나 비전 입력을 갖추지 않는다. 따라서 "Qwen3.8-Max는 오픈 가중치다"와 "Qwen3.8-Max는 멀티모달 1M 컨텍스트 엔드포인트다"는 서로 다른 아티팩트에 관한 진술로서 둘 다 참이며, 전자를 전제로 세우면서 후자를 기대하는 배포 계획은 현실과 맞닥뜨려도 살아남지 못할 것이다. 한편 0902 포인트 릴리스는 버전 번호 변경 없이 모델을 한 공개 웹 개발 아레나의 정상으로 끌어올렸다. 이는 8월에 벤치마크한 모델이 9월에 여러분의 요청을 처리하는 모델과 반드시 같지는 않다는 점을 일깨워준다.
오픈 웨이트(open weights)라는 건 둘 중 하나를 자체 호스팅할 수 있다는 뜻인가요?
Xiaomi MiMo-V2.6-Pro의 경우, 원칙적으로는 그렇습니다: MIT 라이선스이며, 상업적 계약이 필요하지 않습니다. 실제로는 42B 활성 상태의 1.02T 매개변수 체크포인트에는 다중 노드 서빙 클러스터가 필요하며, 이는 API를 호출하는 것과는 차원이 다른 투자입니다. 가중치를 공개하면 자체 호스팅이 합법이 될 뿐, 저렴해지는 것은 아닙니다.
Qwen3.8-Max의 경우, 답은 평판이 시사하는 것보다 더 좁습니다. 공개 릴리스는 텍스트 전용이며 전체 컨텍스트 윈도우도 없으므로, 이를 셀프 호스팅하면 45가 측정 대상으로 삼은 모델보다 실질적으로 더 작은 모델을 얻게 됩니다. 원하는 것이 벤치마크된 구성이라면, 서빙되는 엔드포인트가 곧 제품이며, 그 엔드포인트는 독점입니다.
둘 중 하나를 호출하는 것, 그리고 그것을 결정하는 산술
Artificial Analysis는 두 모델 모두를 단일 API 제공업체에서 집계하고 있는데, 이는 두 플래그십 모델로서는 이례적인 일이며, 따라서 페일오버는 있으면 좋은 것이 아니라 실질적인 과제가 됩니다. Qwen3.8-Max는 OrcaRouter에 qwen/qwen3.8-max — Alibaba 자체 정가에 0% 마크업이 붙은 하나의 OpenAI 호환 엔드포인트로 제공되므로, 위의 $2.00과 $6.00은 변경 없이 그대로 전달되며 Alibaba 측 가격이 바뀌면 같은 날 우리 쪽에도 반영됩니다. 자체 측정 결과 이 엔드포인트의 p50은 약 3.3초로, 이는 이론상 최선의 경우가 아니라 계획의 기준으로 삼아야 할 수치이며, 폴백 체인 덕분에 지연된 요청은 응답이 시작되기 전에 다른 업스트림으로 재시도됩니다. Xiaomi MiMo-V2.6-Pro는 OrcaRouter에 없습니다. Xiaomi 모델은 하나도 없으며, 현재 이 모델로 가는 경로는 Xiaomi 자체 플랫폼과 이를 등재한 서드파티 카탈로그들입니다.
비용 계산이야말로 이 맞대결이 실제로 판가름 나는 지점이며, 그것은 헤드라인 요율이 시사하는 계산이 아니다. 7:2:1 캐시 적중/입력/출력 혼합에서 혼합 요율은 백만 토큰당 $0.18과 $1.18입니다 — 6.6배 격차로, 4.6배의 입력 및 6.9배의 출력 격차보다 더 큰데, 이는 Xiaomi의 99% 캐시 할인이 Alibaba의 88%보다 더 깊기 때문입니다. Artificial Analysis는 또한 Xiaomi MiMo-V2.6-Pro에 대해 Intelligence Index 작업당 $0.13의 비용을 기록하는데, 이는 리더보드의 모든 모델에 걸쳐 동일하게 측정된 것입니다. 동일한 워크로드를 둘 다에 실행해 보면 더 저렴한 모델이 더 높은 점수를 받은 모델이며, 이는 쓸 수 있다는 것 자체가 이례적인 일이고 이 비교가 형식적인 것이 아닌 이유입니다.

누가 전환해야 하고, 누가 전환하지 말아야 할까
오늘 Qwen3.8-Max를 쓰고 있고 잘 작동한다면, 서둘러 옮겨야 할 이유는 없습니다. 지수 격차는 한 점에 불과하고, 비전과 롱컨텍스트 동작은 이미 여러분의 워크로드에서 입증되었으며, 알리바바는 여전히 이 라인을 개발 중입니다 — 0902 업데이트가 이를 보여줍니다. 옮겨야 할 이유는 처리량과 혼합 비용이며, 이는 여러분의 트래픽이 출력 위주이거나 장기 지평형일 때만 강력한 명분이 됩니다: 에이전트, 코드 생성, 읽는 양보다 훨씬 많이 쓰는 모든 것 말입니다.
새로 시작하는 경우라면, 공개된 증거만 놓고 볼 때 이 순위에 이의를 제기하기는 어렵다. Xiaomi 모델은 더 빠르고, 모든 측면에서 더 저렴하며, MIT 라이선스이고, 둘 모두를 포괄하는 유일한 독립 실행 종합 평가에서도 근소하게 앞서 있다. 반대 근거는 실재하고 구체적이다: 3일의 프로덕션 이력, 단일 서빙 경로, 그리고 확인할 수 있는 공개 벤치마크 항목이 없다는 점이다. 그 조합은 기존 모델을 대체하기보다 기존 모델 옆의 레인에서 평가하라고 말해 준다 — 그것이 바로 라우팅 구성의 용도이며, 점수판에서 승자를 고르기보다 후보와 기존 모델을 하나의 키 뒤에 두는 것이 유용한 움직임인 이유다.

이 답변을 바꾸려면 무엇이 필요할까요?
세 가지입니다. Xiaomi MiMo-V2.6-Pro에 두 번째, 세 번째 제공자가 생기면 그것에 대한 유일한 구조적 반대 이유가 사라지고, 가격 격차는 매력적인 선택지가 아니라 실제로 고려해야 할 결정 사항이 될 것입니다. DeepSWE 구성의 독립적 실행은 72.57을 확인해 주거나 폐기하게 만들 것이며, 어느 결과든 그 숫자 자체보다 더 가치가 있습니다. 그리고 v4.3.2의 평가별 세부 분석은 각 모델이 열 가지 평가 중 무엇에서 앞서는지 보여 줄 것입니다 — 종합 점수는 종합일 뿐이고, 에이전트형 코딩에서 앞서는 모델과 검색 비중이 큰 질의응답에서 앞서는 모델이 서로의 용도에는 맞지 않으면서도 같은 지수 점수를 낼 수 있습니다.
