OrcaRouter 모델 레이더 히어로 카드: MiMo-V2.6-Pro와 DeepSeek V4 Pro 비교, 부제 '두 오픈 플래그십, 인덱스 10포인트 차이.', 모델별 패널 하나씩, 그리고 둘 다 MIT 라이선스이며 1M 토큰 컨텍스트 윈도우를 제공하고 점수는 v4.3.2로 이전 인덱스 버전과 비교할 수 없다는 점을 명시한 푸터 포함.
Guides & Insights

MiMo-V2.6-Pro vs DeepSeek V4 Pro: 두 오픈 플래그십, 인덱스 점수 10점 차이

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Xiaomi MiMo-V2.6-Pro와 DeepSeek V4 Pro는 같은 부류의 모델이다. 둘 다 1조 매개변수급 중국산 전문가 혼합(MoE) 플래그십이며, MIT 라이선스, 100만 토큰 컨텍스트, 오늘 바로 다운로드할 수 있는 오픈 웨이트를 갖췄다. 그런데 Artificial Analysis Intelligence Index v4.3.2에서는 46 대 36으로 10점 차이다. 두 모델은 플래그십이 무엇을 위한 것인지에 대해서도 의견을 달리한다. 2026년 8월 13일 공개된 DeepSeek V4 Pro는 텍스트 전용 추론 모델로, 1조 6,000억 개 매개변수 중 490억 개가 활성화되며 공개된 스펙 어디에도 비전, 오디오, 비디오 입력이 없다. 2026년 9월 21일 공개된 Xiaomi MiMo-V2.6-Pro는 1조 200억 개 매개변수 중 420억 개가 활성화되고 텍스트, 이미지, 비디오, 오디오를 입력받는다. 그 차이는 그 10점보다 더 많은 배포를 좌우하며, 다른 무엇을 비교하기 전에 가장 먼저 확정해야 할 사항이다.

동일한 라이선스, 다른 기기

진짜로 동일한 것부터 시작하자. 두 경쟁 연구소를 놓고 보면 예상보다 많기 때문이다. 둘 다 공개 저장소에서 MIT 라이선스 태그로 배포되며, 이는 매출 게이트나 사용 분야 조항 없이 상업적 배포, 수정, 추가 학습을 할 수 있음을 의미한다. 둘 다 1M 토큰 컨텍스트 윈도우를 내세운다. 둘 다 희소 전문가 혼합(mixture-of-experts) 설계다. 이 규모에서 그 아키텍처는 차별화 요소가 아니라 기본값이 되었다. 그리고 둘 다 방법론에 관해 서구 최전선 연구소들보다 덜 공개하는 연구소들에 의해 학습되었다.

• 매개변수 — MiMo-V2.6-Pro 총 1.02T / 활성 42B; DeepSeek V4 Pro 총 1.6T / 활성 49B

• 입력 모달리티 — MiMo-V2.6-Pro 텍스트, 이미지, 비디오, 오디오; DeepSeek V4 Pro 텍스트 전용

• 컨텍스트 — 양쪽 모두 1M 토큰; DeepSeek V4 Pro는 출력을 384K 토큰으로 제한

• 지수 점수 — MiMo-V2.6-Pro는 Intelligence Index v4.3.2에서 46점, DeepSeek V4 Pro는 동일 버전에서 36점

• Index 작업당 비용 — MiMo-V2.6-Pro $0.13, DeepSeek V4 Pro $0.67

• 표시 요율 — MiMo-V2.6-Pro는 100만 토큰당 $0.43 / $0.87; DeepSeek V4 Pro는 Artificial Analysis가 명시한 대로 $1.32 / $3.96이며, 이는 DeepSeek 자체의 피크/오프피크 요금제 적용 전 기준

• 속도 — MiMo-V2.6-Pro 초당 출력 토큰 134.3개; DeepSeek V4 Pro 97.4개

• 첫 토큰 생성까지 걸린 시간 — MiMo-V2.6-Pro 2.15초; DeepSeek V4 Pro 1.62초

그 목록을 두 번 읽어 보세요, 두 개의 행이 직관에 반하기 때문입니다. 더 작은 모델이 10점 더 높습니다 — 420억 활성 매개변수가 490억을 앞서는 것은 반올림 차이가 아니라 사후 학습 결과이며, 이 비교에서 강화학습 품질이 지렛대로서 원시 규모를 추월했다는 가장 명확한 단일 신호입니다. 그리고 더 저렴한 모델이 처리량과 작업당 비용 모두에서 더 빠른 모델이기도 한데, 이는 일반적인 맞바꿈과 반대입니다. Xiaomi는 인내를 대가로 할인을 파는 것이 아닙니다. DeepSeek의 강점은 첫 토큰까지 걸리는 시간으로, 1.62초 대 2.15초입니다 — 실재하지만, V4 Pro가 앞서는 유일한 항목입니다.

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists 1.02T total and 42B active parameters, text, image, video and audio input, a 1M-token context window, Intelligence Index v4.3.2 score 46, a listed rate of $0.43 / $0.87 per million tokens, $0.13 per index task, 134.3 tokens per second with 2.15 seconds to first token, and a release date of 21 September 2026. The DeepSeek V4 Pro column lists 1.6T total and 49B active parameters, text-only input, a 1M-token context window with output capped at 384K, index score 36, a listed rate of $1.32 / $3.96, $0.67 per index task, 97.4 tokens per second with 1.62 seconds to first token, and a release date of 13 August 2026.

여기서 동일한 인덱스 버전이 중요한 이유

인덱스 개정판을 넘나들며 오픈 웨이트 모델을 비교하는 것이 바로 대부분의 공개된 비교가 잘못되는 방식이므로, 버전 번호는 각주가 아닙니다. Artificial Analysis는 2026년 9월에 Intelligence Index를 v4.3으로 재구축했고, 그 경계를 넘으면서 점수는 크게 움직였습니다 — Claude Opus 5는 v4.2와 v4.3 사이에서 3점을 잃었고, 오픈 웨이트 진영의 순위는 재편되었습니다. 위의 두 수치는 모두 v4.3.2이므로, 46과 36은 서로 직접 비교할 수 있습니다. 이 둘은 두 모델 중 어느 쪽이든 다른 곳에서 인용된 더 오래된 수치와는 비교할 수 없습니다.

그것은 가설이 아니다. DeepSeek V4 Pro는 2026년 8월에 이전 지수 척도에서 53으로 널리 보도되었고, 그 시기에 대한 우리 자체 보도도 그 수치를 실었다. v4.3.2에서는 같은 모델이 36으로 읽힌다. 모델에 대해 달라진 것은 아무것도 없다. 바뀐 것은 자(척도)다. 스프레드시트에 53이 있고 그 옆에 MiMo-V2.6-Pro의 46이 있다면, 당신은 잘못된 모델을 가리키게 될 비교를 갖고 있는 것이다. 올바른 짝은 46 대 36이며, 올바른 결론은 다섯 주 뒤에, 파라미터 수는 3분의 2로 출시된 모델이 실질적으로 앞서 있다는 것이다.

두 실험실 간의 보고 격차

두 번째로 더 미묘한 차이가 있는데, 그것은 각 실험실이 무엇을 검사받고자 하는지에 관한 것입니다.

MiMo-V2.6-Pro의 46은 Artificial Analysis의 측정치입니다. 해당 평가 기관은 공개된 모델을 대상으로 추론, 지식, 수학, 코딩에 걸친 10개의 평가로 구성된 자체 평가 제품군을 실행하고 그 결과를 발표했으며, 함께 운용 수치도 공개했습니다: 초당 134.3 토큰, 첫 토큰까지 2.15초, 99% 캐시 할인, 인덱스 작업당 $0.13, 총 평가 비용 $206.66. 이는 샤오미 모델에 관한 제3자의 수치입니다.

DeepSeek V4 Pro의 대표적인 에이전트 수치는 DeepSeek 자체 측정치이며, 그것들과 독립 측정치 사이의 격차는 문서화되어 있다. 이 회사의 출시 자료는 Terminal-Bench 2.1을 87.9, DeepSWE를 62.7, CyberGym을 83.3, SWE-bench Verified를 80.6으로 보고한다. 독립 실행 결과는 Terminal-Bench 2.1을 78.7로 — 벤더 수치보다 약 9점 낮게 — 그리고 Artificial Analysis Coding Index를 68.8로 제시한다. 그 벤더 수치 중 어느 것도 재현되지 않았으며, Terminal-Bench 격차의 크기가 나머지 수치 묶음을 측정치가 아닌 주장으로 취급해야 하는 이유다.

Xiaomi도 같은 문제의 자체 버전을 가지고 있다. Xiaomi의 대시보드는 MiMo-V2.6-Pro가 자사의 강화학습 실행 전반에서 DeepSWE v1.1에서 58.4에서 72.57로 상승했다고 보고하는데, 이는 Xiaomi 자체 하네스에서 mini-swe-agent를 사용해 3회 평균으로 평가한 것이다. 이는 리더보드 제출이 아니며 어떤 외부 주체도 이를 재실행하지 않았다. 따라서 어느 모델도 공급업체 벤치마크에서 문제없다는 보증을 받고 오지는 않는다. 차이라면 MiMo-V2.6-Pro는 DeepSeek의 출시 당시에는 없었던 독립적인 종합 점수도 함께 가지고 나온다는 점이다. 그리고 마케팅이 아니라 증거를 근거로 둘 중 하나를 고른다면, 무게를 실어야 할 비대칭성은 바로 그것이다.

Screenshot of the Artificial Analysis model page for DeepSeek V4 Pro, showing the Intelligence Index score of 36 on version 4.3.2, an open-weights model under the MIT licence, text-only input, 1.6 trillion total and 49 billion active parameters, a 1M-token context window, a listed price of $1.32 per million input tokens and $3.96 per million output tokens, output speed of 97.4 tokens per second and time to first token of 1.62 seconds.

실제 운영 환경에서 이것이 어떻게 보이는지

모달리티 차이는 실질적인 분기점이며, 10점 격차가 시사하는 것보다 DeepSeek에 유리하게 작용하는 경우는 적다. 파이프라인이 스크린샷, 이미지로 렌더링된 PDF, 비디오 프레임 또는 오디오를 입력으로 받는다면, MiMo-V2.6-Pro는 하나의 모델에서 이를 네이티브로 처리하는 반면 DeepSeek V4 Pro는 전혀 처리하지 못한다 — 앞단에 별도의 비전 모델을 두어야 하며, 이는 두 번째 계약, 두 번째 실패 모드, 두 번째 청구서를 의미한다. 워크로드가 텍스트 전용 추론이라면, 추가 모달리티는 당신이 아무 비용도 지불하지 않는 불필요한 무게일 뿐이다.

인덱스 작업당 비용은 함께 고려해야 할 또 다른 수치입니다. 통제된 동일 작업 세트에서 $0.13 대 $0.67은 다섯 배 격차이며, 두 경우 모두 같은 방식으로 측정했습니다. DeepSeek는 호출 시점에 따라 실효 요율을 상당히 낮출 수 있는 피크/오프피크 청구 일정을 운영하므로, 실제 비율은 오프피크 시간에는 좁아지고 피크에는 벌어집니다 — 트래픽이 버스트성이 강하고 언제 들어올지 선택할 수 없다면 중요한 세부 사항입니다.

바로 여기서 DeepSeek 쪽이 모델 자체와는 아무 관련이 없는 진정한 이점을 갖습니다. 바로 우리 플랫폼에 있다는 점입니다. DeepSeek V4 Pro는 deepseek/deepseek-v4-pro OrcaRouter 키를 통해 공급자 정가에 0% 마크업으로, 공급자 전반에 걸친 자동 페일오버와 그 위에 사용할 수 있는 라우팅 DSL을 갖추고 있어 접근할 수 있습니다. 따라서 피크/비피크 계산, 공급자 간 스프레드, 폴백 경로는 모두 직접 구축하는 대상이 아니라 설정하는 대상입니다. MiMo-V2.6-Pro는 우리 플랫폼에 없으며, 이 점은 분명히 말씀드리겠습니다. 오늘 이 모델에 접근하려면 샤오미 자체 플랫폼이나 이를 목록에 올린 서드파티 카탈로그 중 하나를 이용해야 하며, Artificial Analysis는 캡처 시점에 이 모델을 제공하는 API 공급자를 단 하나로 집계했습니다. 하나의 경로는 프로덕션 경로가 아니며, 이것이 바로 MiMo-V2.6-Pro를 지금 평가하고 신중하게 라우팅하되 그 뒤에 다른 무언가를 두어야 한다는 가장 강력한 근거입니다.

어느 것이며, 언제인가요?

텍스트 전용 작업이라면, 384K 출력 한도가 필요하다면, 둘 중 첫 토큰까지 걸리는 시간이 가장 빠른 쪽을 원한다면, 또는 이미 우리 플랫폼을 쓰고 있고 페일오버가 지원되며 새로운 통합이 필요 없는 1조 파라미터 오픈 웨이트 라인을 원한다면 DeepSeek V4 Pro를 선택하세요. 이 모델이 기존의 기본 선택인 데에는 이유가 있습니다. 다섯 주 더 앞서 있다는 것은 9월에 나온 모델이 아직 쌓지 못한 다섯 주 분량의 툴링, 양자화, 서빙 레시피를 뜻합니다.

작업이 멀티모달이거나, 작업당 비용이 단위 경제성을 좌우하거나, 0.5초의 지연보다 처리량이 더 중요하거나, 독립적으로 측정된 지표에서 현재 오픈 웨이트 선두 주자를 원한다면 MiMo-V2.6-Pro를 선택하세요. 둘 모두에 적용된 MIT 라이선스는 어느 쪽이든 웨이트 문제가 해결되었음을 의미합니다 — 자체 하드웨어에서 어느 쪽이든 실행하고, 미세 조정하고, 상업적으로 출시할 수 있습니다.

고려해 볼 만한 구성은 애초에 하나를 선택하는 문제가 아니다. 라우터를 사용하면 비피크 요금으로 텍스트 전용 추론을 위한 DeepSeek 레인을 유지하고, 멀티모달 요청을 위한 MiMo 레인을 추가할 수 있으며, 더 얇은 경로 앞에 폴백을 둘 수 있다. 이는 헤지가 아니다. 각 요청을 실제로 처리하는 모델에 맞추는 것이며, 이는 하나의 승자를 선택하고 워크로드의 형태가 결코 바뀌지 않기를 바라는 것보다 더 저렴하고 지속 가능한 답이다.

Decision card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the decision', with two columns. 'Choose MiMo-V2.6-Pro when' lists a multimodal task with screenshots, rendered PDFs, video frames or audio in the same request; cost per task dominating unit economics at $0.13 against $0.67 on an identical task set; throughput mattering more than latency at 134.3 against 97.4 tokens per second; and wanting the current open-weights leader on an independently measured index at 46 against 36. 'Choose DeepSeek V4 Pro when' lists text-only reasoning work; needing the 384K output ceiling; first-token latency being the binding constraint at 1.62s against 2.15s; and wanting a route with failover behind it.

이 비교가 아직 답할 수 없는 질문

두 모델 모두 가장 많이 인용되는 벤치마크는 벤더가 직접 실행한 것이며 재현되지 않았다. DeepSeek V4 Pro의 경우 그 격차는 8월부터 이어져 왔고, 이것이 독립 점수가 출시 당시 수치보다 낮게 나오는 이유다. MiMo-V2.6-Pro의 경우 독립 종합 점수는 존재하지만 에이전트 관련 세부 분석은 없다 — Artificial Analysis는 46을 발표할 뿐 그 아래에 있는 평가별 편차는 공개하지 않는데, 이 세부 정보가 모델이 에이전트 루프에 속하는지 아니면 질의응답 파이프라인에 속하는지를 알려준다.

그 격차가 공개되고 누군가 Xiaomi의 DeepSWE 하네스를 다시 실행하기 전까지, 방어 가능한 입장은 어느 연구소의 마케팅보다도 좁다: MiMo-V2.6-Pro는 독립적인 종합 지표와 과제당 측정 비용에서 앞서고, DeepSeek V4 Pro는 성숙도, 출력 길이, 첫 토큰 지연 시간, 그리고 뒤에 중복성이 갖춰진 경로를 통해 접근할 수 있다는 점에서 앞선다. 5주는 짧은 선점이며, 그것이 DeepSeek이 가진 유일한 선점이다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트