Xiaomi MiMo-V2.6-Pro와 Grok 4.6을 높은 추론 노력도에서 비교하는 생성된 타이틀 카드. 왼쪽 카드에는 Intelligence Index v4.3.2: 46, 컨텍스트 윈도우: 1M 토큰, 1M당 입력 $0.43 / 출력 $0.87, 초당 134.3 토큰이 표시되어 있고, 오른쪽 카드에는 Intelligence Index v4.3.2: 44, 컨텍스트 윈도우: 500K 토큰, 1M당 입력 $2.00 / 출력 $6.00, 초당 63.0 토큰이 표시되어 있다. 하단에는 이렇게 적혀 있다: 두 점수 모두 Artificial Analysis Intelligence Index v4.3.2 기준. DeepSWE 수치는 벤더가 실행한 것이며 비교할 수 없음. OrcaRouter 로고가 오른쪽 아래 모서리에 합성되어 있다.
Guides & Insights

MiMo-V2.6-Pro vs Grok 4.6: 두 업체 모두 DeepSWE 수치를 공개했지만, 어느 쪽도 보드에 올라 있지 않다

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

벤더 두 곳, 하나의 벤치마크, 서로 뺄 수 없는 두 숫자. SpaceXAI의 Grok 4.6 출시 자료는 DeepSWE v1.1에서 65.9%를 보고한다. Xiaomi의 MiMo-V2.6-Pro 자료는 DeepSWE v1.1에서 72.57을 보고한다. 함께 읽으면 더 저렴한 오픈 웨이트 모델이 독점 프런티어 모델을 거의 7점 차로 앞선다고 시사한다. 주의 깊게 읽으면 거의 아무것도 말해주지 않는다. 하나는 벤더 자체 하네스에서 나온 출시 발표용 백분율이고, 다른 하나는 Xiaomi 자체 채점기에서의 강화학습 실행에서 나온 3회 평균이며, 어느 쪽도 공개 DeepSWE 보드에 제출되지 않았기 때문이다. 면밀한 검토를 견뎌 내는 MiMo-V2.6-Pro와 Grok 4.6의 비교는 독립 지수에 있으며, 거기서 답은 벤더 숫자와 반대다: 46 대 44, Xiaomi의 우세, 2점 차이다.

Grok 4.6은 2026년 8월 12일 SpaceXAI가 출시했으며 이 비교에서 기존 강자입니다 — 문서화된 가격표와 수개월에 걸친 독립적 측정 결과를 갖춘, 이미 출시되어 폭넓게 서비스되는 프런티어 모델이죠. Xiaomi MiMo-V2.6-Pro는 2026년 9월 22일 정식 출시되었고, 강화학습 체크포인트 저장소는 그 전날 등장했으며, 신규 진입자입니다. 둘 다 추론 능력을 갖추고 있고, 둘 다 장시간 실행되는 에이전트 작업을 위해 만들어졌으며, 두 모델 간의 가격 격차는 신규 진입자의 경험 부족만이 이 비교를 가로막는 유일한 요인일 정도로 큽니다.

각 모델이 실제로 무엇인지

Grok 4.6은 독점적이며, 텍스트와 이미지 입력을 받아 텍스트를 출력하고, 2026년 2월 1일 기준의 지식 컷오프를 갖습니다. 컨텍스트 윈도우는 500,000 토큰으로, 주요 경쟁사들의 절반 크기이며, 사양표에서 가장 중대한 단일 스펙입니다. 정가 요금은 200,000 프롬프트 토큰 미만에서 백만 입력 토큰당 $2.00, 백만 캐시 입력당 $0.50, 백만 출력당 $6.00이며, 그 경계에서 가격 절벽이 있습니다: 200K 이상에서는 요금이 $4.00, $1.00, $12.00이 되고, 상위 등급은 기준 초과분이 아니라 전체 요청에 청구됩니다. 우선 처리는 표준 요금의 두 배입니다. Artificial Analysis는 최대 노력에서 초당 63.0 출력 토큰과 첫 토큰까지 42.79초, 그리고 전체 인덱스 실행에 $2,351.83을 측정했습니다.

Xiaomi MiMo-V2.6-Pro는 총 파라미터 1.02조 개, 토큰당 42억 개가 활성화되는 희소 전문가 혼합(mixture-of-experts) 모델로, 100만 토큰 컨텍스트 윈도우와 텍스트, 이미지, 비디오, 오디오 전반에 걸친 네이티브 멀티모달리티를 갖추고 있습니다. MIT 라이선스로 제공되며 가중치를 다운로드할 수 있고, Xiaomi는 새 체크포인트의 가격을 인상하는 대신 이전 세대의 가격을 유지했습니다 — 입력 토큰 100만 개당 $0.43, 출력 100만 개당 $0.87, 99% 캐시 할인, 그리고 캐시 적중/입력/출력 7:2:1 비율에서 블렌디드 $0.18입니다. Artificial Analysis는 초당 출력 토큰 134.3개, 첫 토큰까지 2.15초, 인덱스 실행 비용 $206.66 — 작업당 $0.13을 측정했습니다.

• 가중치 — MiMo-V2.6-Pro는 MIT 라이선스로 다운로드 가능하며, Grok 4.6은 독점 모델로 API 전용입니다

• 파라미터 — MiMo-V2.6-Pro 전체 1.02T / 활성 42B; Grok 4.6 비공개

• 컨텍스트 — MiMo-V2.6-Pro 1M 토큰; Grok 4.6 500K, 입력 200K에서 가격 급등

• 모달리티 — MiMo-V2.6-Pro는 텍스트, 이미지, 동영상, 오디오를 입력으로 받으며, Grok 4.6의 공개된 입력 범위는 텍스트와 이미지입니다.

• 인덱스 점수 — MiMo-V2.6-Pro 46; Grok 4.6 44, 둘 다 Artificial Analysis v4.3.2

• 정가 — MiMo-V2.6-Pro 1M당 $0.43 / $0.87; Grok 4.6 $2.00 / $6.00, 200K 입력 초과 시 2배

• 혼합 요금 — MiMo-V2.6-Pro 1M당 $0.18; Grok 4.6 $1.35

• 인덱스 실행 비용 — MiMo-V2.6-Pro $206.66; Grok 4.6 $2,351.83

• 속도 — MiMo-V2.6-Pro 초당 134.3 출력 토큰; Grok 4.6 63.0

• 첫 토큰까지의 시간 — MiMo-V2.6-Pro 2.15초; Grok 4.6 42.79초

• 지식 컷오프 — MiMo-V2.6-Pro 미공개, Grok 4.6 2026년 2월 1일

A two-column scoreboard titled MiMo-V2.6-Pro vs Grok 4.6, subtitled Two vendor DeepSWE figures, neither submitted to the public board. The left column, Xiaomi MiMo-V2.6-Pro, reads Intelligence Index v4.3.2 46; list price $0.43 / $0.87 per 1M; context window 1M tokens; speed 134.3 tokens per second; DeepSWE v1.1 72.57 vendor-run, avg@3; public DeepSWE entry none. The right column, Grok 4.6 (high), reads Intelligence Index v4.3.2 44; list price $2.00 / $6.00 per 1M; context window 500K tokens; speed 63.0 tokens per second; DeepSWE v1.1 65.9% vendor-reported; public DeepSWE entry ~67% submitted. A footer notes the two DeepSWE figures come from different vendor harnesses with different metrics and must not be subtracted, and that Grok 4.6 list rates double at or above 200K input tokens. The OrcaRouter logo is composited in the bottom-right corner.

두 공급업체가 실행한 벤치마크와 그것이 비교가 되지 않는 이유

DeepSWE v1.1은 Datacurve가 운영하는 실제 공개 제3자 코딩 에이전트 평가이며, 두 회사 모두가 결과를 공개하기 위해 선택한 단 하나의 태스크 패밀리다. 그래서 사용하고 싶은 유혹이 생긴다. 이것을 일대일 비교로 사용해서는 안 되며, 그 이유는 어느 한쪽 공급업체가 거짓말을 하고 있어서가 아니라 두 수치가 동일한 태스크 이름에 대한 서로 다른 측정값을 나타내기 때문이다.

Xiaomi의 72.57은 mini-swe-agent를 사용한 자체 하네스에서 세 번 평균한 값으로, 동결된 릴리스 후보에서가 아니라 강화학습 실행 중에 산출되었으며, 시작 수치인 58.4와 함께 보고되었다. 이 실행은 30단계와 모델당 약 750,000개의 트래젝터리로 문서화되어 있으며, Pro 모델에 대해 공개된 약 262만 달러의 비용으로 6일 이내에 완료되었다. 이는 Datacurve의 보드에 제출되지 않았다. Grok 4.6에 대한 SpaceXAI의 65.9%는 벤더 자체 평가 세트에서 나온 출시 발표 자료상의 수치로, 동일 벤치마크에서 Grok 4.5 대비 11.9포인트 향상과 나란히 보고되었다 — 그리고 공개 보드에는 약 67%의 제출된 Grok 4.6 구성이 있어, 이는 벤더 수치와 충분히 가까워 하네스가 적어도 대략적으로 정렬되어 있음을 시사한다. 이는 Xiaomi 수치에는 해당되지 않으며, 그 수치에는 공개된 대응 수치가 전혀 없다.

그래서 솔직한 진술은 이렇습니다: 공개 리더보드에서는 Grok 4.6이 있고 MiMo-V2.6-Pro는 없습니다. 독립적인 종합 평가에서는 둘 다 실제로 동일한 평가자에 의해 테스트되었으며, Xiaomi의 모델이 2점 앞섭니다. 이 두 사실은 서로 충돌하지 않습니다. 그것들은 단지 서로 다른 것을 측정할 뿐이며, 인용해야 할 것은 두 번째입니다.

500K 컨텍스트는 실제 워크로드를 결정하는 사양이다

50만 토큰은 일반적인 기준으로 보면 큰 컨텍스트 윈도우이고, 2026년 기준으로는 작은 편이다. MiMo-V2.6-Pro가 함께 묶이는 모델들은 모두 1M에 있으며, 실질적인 결과는 Grok 4.6이 마케팅하는 바로 그 워크로드에서 나타난다. 리포지토리, 도구 트랜스크립트, 누적된 계획을 들고 있는 장기 실행 코딩 에이전트는 한 세션에서 프롬프트 토큰 20만 개를 넘게 된다. 그리고 그 지점에서 Grok 4.6의 요금은 두 배로 오르며 전체 요청에 소급 적용된다. MiMo-V2.6-Pro에서 같은 세션은 티어 변경 없이 100만 토큰까지 실행된다.

그것은 동시에 사양 차이이자 가격 구조 차이이며, 두 번째 차이는 대표 요금을 비교할 때 놓치기 쉽습니다. Grok 4.6의 혼합 $1.35와 MiMo-V2.6-Pro의 $0.18을 비교하면 7.5배 차이입니다. 200K를 넘는 프롬프트에서는 Grok 요금이 두 배가 되고 Xiaomi 쪽은 움직이지 않기 때문에 15배에 더 가까운 수준으로 벌어집니다.

반론도 공식 기록에 남아 있으며, 그럴 만하다. Grok 4.6의 출시 논지는 원시 컨텍스트가 아니라 턴 효율성이었다. 동일한 작업에서 Claude Opus 5와 비교 측정된 에이전트 평가에서 Grok 4.6은 약 53턴과 약 5억 입력 토큰으로 끝낸 반면, 다른 모델은 약 103턴과 20억 토큰을 기록했고, 작업당 추정 비용은 0.84달러로 그 비교에서 프런티어 모델 가운데 가장 낮은 수치였다. 루프를 절반 횟수만 도는 모델은 그만큼 많은 컨텍스트가 필요하지 않고, 그만큼 많은 토큰을 태우지도 않는다. 이는 진정한 아키텍처적 이점이며, 이 대안을 포함해 토큰당 더 저렴한 어떤 대안에 맞서는 Grok 4.6의 가장 강력한 논거다.

Screenshot of the Artificial Analysis model page for Xiaomi MiMo-V2.6-Pro, captured 22 September 2026. The header reads 46 Artificial Analysis Intelligence Index, ranked first of 114 in its class; 134.3 output tokens per second, ranked eleventh of 114; $0.435 input and $0.87 output per 1M tokens with a 99% cache discount; $0.13 cost per Intelligence Index task, ranked twelfth of 114; and 140M output tokens from the Intelligence Index. Technical specifications list reasoning Yes, input modality text, image, speech and video, output modality text, a 1M-token context window, 1.0T total parameters, 42B active parameters, an MIT licence and Hugging Face model weights, under a breadcrumb reading Xiaomi, Open weights model, Released September 2026. A comparison summary notes it cost $206.66 to evaluate MiMo-V2.6-Pro on the Intelligence Index.

각각에 도달하기

Grok 4.6은 OrcaRouter에 grok/grok-4.6이라는 이름으로 제공되며, 하나의 OpenAI 호환 엔드포인트를 통해 공급자 정가에 0% 마크업으로 이용할 수 있습니다 — 따라서 SpaceXAI 가격 변경이, 그 200K 절벽에 대한 변경을 포함해, 같은 날 우리 쪽에도 반영됩니다. Xiaomi MiMo-V2.6-Pro는 OrcaRouter에 없습니다. Xiaomi 모델은 어느 것도 없으며, 현재 그것으로 가는 경로는 Xiaomi 자체 플랫폼이거나 이를 목록에 올린 서드파티 카탈로그 중 하나입니다. 이를 분명히 말하는 것이 모델 페이지가 그렇지 않은 듯이 암시하게 두는 것보다 더 유용합니다.

그 비대칭성이 실제로 얼마나 가치가 있는지는 값싼 실험으로 확인할 수 있다. Grok 4.6은 이미 비용을 지불하고 있을 수도 있는 모델이다. MiMo-V2.6-Pro는 이번 주에 출시되었고, 그 뒤에 단일 서빙 경로만 있는 상태에서 훨씬 낮은 요율로 지수 2포인트 향상을 제공한다. 답할 가치가 있는 질문은 추상적으로 어느 쪽이 더 나은가가 아니라, Xiaomi 모델이 당신의 자체 프롬프트에서 Grok 트래픽 중 얼마나 많은 부분을 감당할 수 있는가이다 — 그리고 두 번째 계약, 두 번째 키, 두 번째 결제 관계를 열어 그 답을 구하는 것은 테스트가 아예 일어나지 못하게 막는 마찰이다. 하나의 엔드포인트와 제공자 간 자동 페일오버가 있으면 비교는 설정 변경에 불과하며, 여기서는 페일오버 쪽이 평소보다 더 중요하다: 이번 주에 출시되었고 Artificial Analysis가 포착했을 당시 하나의 API 제공자에만 등록되어 있던 모델은 돌아갈 레인이 없이 프로덕션 경로에 넣을 만한 것이 아니다.

Screenshot of the OrcaRouter model page for Grok 4.6, captured 22 September 2026, showing the breadcrumb Home > Models > SpaceXAI > Grok 4.6, the model id grok/grok-4.6 dated 2026-08-12, the Vision, Tools, JSON and Reasoning capability badges, and the on-this-page index for code samples, pricing, performance, public benchmarks, community buzz, comparisons and FAQ. The rate card sits below the visible area of the capture.

어느 것을 선택할까

턴 효율성이 최적화 대상일 때 — 모델이 절반의 단계로 끝내는 능력이 토큰당 단가보다 더 가치 있는 긴 에이전트 루프에서 — 또는 일주일이 아니라 수개월간의 독립적 측정 이력을 갖춘 모델을 원할 때 Grok 4.6을 선택하세요. 초당 63토큰과 42.79초의 첫 토큰 지연 시간은 대화형 기준에서 이 모델을 배치 및 오프라인 워크로드용 모델로 만들며, 200K에서 가격이 급등하는 500K 컨텍스트는 프롬프트를 짧게 유지해야 한다는 점을 시사합니다.

Grok의 200K 한계를 넘어설 만큼 컨텍스트가 많고 반복적인 루프를 실행할 때, 사람이 기다릴 수 있을 만큼 첫 토큰 지연 시간이 낮아야 할 때, 가중치를 자체 인프라에 두고 싶을 때, 또는 사용량 때문에 7.5배 혼합 요율 격차가 결정적 수치가 될 때 MiMo-V2.6-Pro를 선택하세요. 2포인트 인덱스 우위는 그 자체만으로 선택 이유가 되기에는 너무 작습니다. 동일한 평가 스위트를 실행하는 비용이 $2,351.83인 데 비해 $206.66이라는 점이 더 나은 이유입니다.

미해결 질문을 매듭지을 것은 MiMo-V2.6-Pro에 대해 제출된 DeepSWE 구성이다. Grok 4.6에는 이미 그런 구성이 있다. 샤오미의 모델이 명시된 하네스, 신뢰 구간, 작업당 비용과 함께 공개 보드에 등장하는 순간, 72.57은 더 이상 제조사가 내놓은 숫자에 그치지 않게 되고 위의 비교는 실제 비교가 된다. 그리고 지수에서의 2포인트 차이를 고려하면, 결과는 어느 쪽으로도 기울 수 있다.

OrcaRouter는 200개 이상의 모델을 하나의 OpenAI 호환 엔드포인트 뒤에 공급자 정가에 0% 마크업으로 제공하므로, 공급업체의 가격 변경이 같은 날 바로 반영됩니다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트