
MiMo-V2.6-Pro vs Gemini 3.1 Pro: 단 하나의 인덱스 버전에서만 존재하는 16포인트 격차
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro와 Gemini 3.1 Pro Preview를 Artificial Analysis Intelligence Index에서 나란히 놓으면 46 대 30, 즉 입력 비용이 5분의 1에 불과한 모델이 16점 앞선다는 결과가 나온다. 두 공급사가 각자 출시 당시 공개한 수치로 나란히 놓으면 Gemini 3.1 Pro가 11점 차로 이긴다. 두 결과 모두 같은 평가자에서 나온 것이다. 이 둘이 서로 어긋나는 이유는 2026년 9월에 모델을 비교할 때 이해해야 할 가장 유용한 단 하나의 사실이다: 지수가 두 모델 모두의 밑에서 재구축되었고, 점수는 그것을 산출한 버전 번호 옆에서만 의미가 있다.
v4.3.2 컴포지트가 현재 기준입니다. 여기에는 열 가지 평가 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1 — 가 포함되며, 이 기준으로 2026년 9월 22일에 확인한 결과 Xiaomi의 모델은 46점, Google은 30점을 기록합니다. 2026년 2월 19일 출시 당시 Gemini 3.1 Pro Preview는 당시의 척도에서 57점으로 보고되었고, 이는 순위표 1위였습니다. 이 두 Gemini 수치는 하락이 아닙니다. 서로 다른 두 개의 척도입니다.
각 모델이 실제로 무엇인지
Gemini 3.1 Pro Preview는 2026년 2월 19일에 출시된 Google의 최전선 추론 모델로, 7개월이 지난 지금도 여전히 프리뷰 라벨을 달고 있습니다. 100만 토큰 컨텍스트 윈도우를 갖추고 있으며 출력은 65,536 토큰으로 제한됩니다 — Artificial Analysis에서는 64K, 자사 모델 페이지에서는 65K로 표기 — 그리고 텍스트, 이미지, PDF, 오디오, 비디오를 입력받아 텍스트를 출력합니다. 독점 모델로, 파라미터 수는 공개되지 않았고 지식 컷오프는 2025년 1월입니다. Google 자체 API는 입력 20만 토큰 미만 기준으로 100만 입력 토큰당 $2.00, 100만 출력 토큰당 $12.00를 부과하며, 이를 초과하면 $4.00와 $18.00로 인상되고, 캐시된 입력은 $0.20입니다.
샤오미 MiMo-V2.6-Pro는 2026년 9월 22일 정식 출시(GA)되었으며, 강화학습 체크포인트 저장소는 하루 전에 공개되었다. 이 모델은 총 파라미터 1조 200억 개, 토큰당 활성 파라미터 420억 개의 희소 전문가 혼합(MoE) 모델로, 100만 토큰 컨텍스트 윈도우, 텍스트·이미지·비디오·오디오에 걸친 네이티브 멀티모달리티, MIT 라이선스로 다운로드 가능한 가중치를 갖추고 있다. 샤오미는 새 체크포인트의 가격을 인상하는 대신 이전 MiMo-V2.5 세대의 가격을 그대로 유지했다: 입력 토큰 100만 개당 $0.43, 출력 토큰 100만 개당 $0.87이며, 99% 캐시 할인과 캐시 적중/입력/출력 7:2:1 비율에서 $0.18의 혼합 요율이 적용된다.
• 가중치 — Xiaomi MiMo-V2.6-Pro는 MIT 라이선스로 다운로드 가능, Gemini 3.1 Pro Preview는 독점적이며 API 전용
• 파라미터 — MiMo-V2.6-Pro 총 1.02T / 활성 42B; Gemini 3.1 Pro Preview 비공개
• 컨텍스트 — 둘 다 1M 토큰; Gemini 3.1 Pro Preview는 출력을 65,536 토큰으로 제한하며, MiMo-V2.6-Pro는 이에 상응하는 제한을 공개하지 않음
• 모달리티 — MiMo-V2.6-Pro는 텍스트, 이미지, 비디오, 오디오를 지원하고, Gemini 3.1 Pro Preview는 텍스트, 이미지, PDF, 오디오, 비디오를 지원한다
• 정가 — MiMo-V2.6-Pro 100만 토큰당 $0.43 / $0.87; Gemini 3.1 Pro Preview 입력 200K 미만 $2.00 / $12.00, 200K 초과 $4.00 / $18.00
• 캐시 — MiMo-V2.6-Pro 99% 할인; Gemini 3.1 Pro Preview 캐시 읽기 100만 건당 $0.20
• 속도 — MiMo-V2.6-Pro 초당 134.3 출력 토큰; Gemini 3.1 Pro Preview 121.8
• 첫 토큰까지의 시간 — MiMo-V2.6-Pro 2.15초; Gemini 3.1 Pro Preview 63.62초
• 인덱스 실행에 측정된 비용 — MiMo-V2.6-Pro $206.66, 작업당 $0.13; Gemini 3.1 Pro Preview $1,310.21, 작업당 $0.67

미리보기 라벨이 진짜 차이점입니다
위의 모든 내용은 하나의 명세입니다. 전체 비교를 읽는 방식을 바꾸는 단 한 줄은 "preview"라는 단어입니다. preview 모델은 Google이 해당 엔드포인트에 계속 유지하겠다고 약속하지 않은 후보입니다. 이는 16포인트 지수 격차가 갖지 못하는 방식으로 비교 페이지에서 중요합니다. 왜냐하면 6개월 후에도 거기에 있을 것이라고 믿을 수 없는 모델은 표준화할 모델이 아니며, Google 자체 제품군도 이미 그 모델을 지나쳤기 때문입니다. Gemini 3.6 Flash와 Gemini 3.8 Flash는 더 낮은 비용으로 코딩 및 에이전트 작업에서 Gemini 3.1 Pro보다 위에 있으며, 이것이 3.1 Pro 출시에 대한 한 기술 리뷰가 그것을 단연 이전 세대라고 묘사한 이유입니다. AA 페이지 자체에서는 지능 부문에서 202개 중 71위로 기재하고 있습니다.
Xiaomi의 모델은 정반대 위치에 있습니다. 이번 주에 출시됐고, 가중치는 MIT 라이선스로 공개됐으며, 서빙 특성이 이 모델의 가장 강력한 점입니다. 초당 출력 토큰 134.3개는 속도 측정 대상 114개 모델 중 11위에 올려놓으며, 첫 토큰까지 2.15초는 Gemini 3.1 Pro Preview의 63.62초보다 약 30배 빠릅니다. 대화형 애플리케이션에서 이것은 단순한 타이브레이커가 아닙니다. 제품과 데모의 차이이며, 벤치마크 표에서는 가장 눈에 띄지 않을 가능성이 큰 숫자입니다.
돈이 실제로 어디로 가는가
토큰당 계산은 이 둘 사이의 격차를 과소평가한다. 두 모델이 같은 작업을 끝내는 데 같은 수의 토큰을 소모하지는 않기 때문이다. 더 명확한 수치는 Artificial Analysis가 각 모델에 대해 전체 Intelligence Index를 실행하기 위해 측정한 값이다: MiMo-V2.6-Pro는 $206.66, Gemini 3.1 Pro Preview는 $1,310.21. 동일한 스위트, 동일한 하네스, 동일한 방식으로 측정한 결과 — 동일한 작업 세트에서 6.3배 차이이며, 이는 추론 모델이 생각하면서 많은 토큰을 출력한다는 사실을 이미 반영한 수치다. Gemini 3.1 Pro Preview는 인덱스 전반에서 6,700만 개의 출력 토큰을 생성했다. 같은 가격대 모델의 중앙값은 9,000만 개이므로, 실제로는 동급 모델보다 점수당 더 경제적이며, 그럼에도 평가 비용은 Xiaomi 모델보다 여섯 배 더 많이 든다.
그런 다음 여기에 프로덕션 루프를 적용해 보세요. 각 단계마다 컨텍스트 200,000토큰을 읽고 각 단계마다 2,000토큰을 쓰는 30단계 에이전트 실행은 실행당 입력 600만 토큰, 출력 60,000토큰입니다. Gemini 3.1 Pro Preview의 200K 티어 미만에서는 입력 $12.00, 출력 $0.72, 즉 실행당 $12.72입니다. MiMo-V2.6-Pro에서는 $2.58와 $0.05 — $2.63입니다. Google 모델에서 입력 200,000토큰을 넘기면 입력 요율이 두 배인 $4.00가 되고, 그러면 동일한 루프는 출력 비용을 제외하고도 $24.00가 듭니다. 캐싱은 두 숫자를 모두 바꾸지만, 저렴한 모델의 99% 할인과 비싼 모델의 $0.20 캐시 읽기를 맞세워 보면 컨텍스트가 많은 루프에서는 비싼 모델의 비용이 10배가량 더 높아집니다.

라우팅 질문, 솔직하게 말하자면
여기서 쉽게 틀리기 쉬운 부분이 바로 이것입니다. Gemini 3.1 Pro Preview는 OrcaRouter에 google/gemini-3.1-pro-preview로 제공되며, OpenAI 호환 키 하나를 통해 공급자 정가에 0% 마크업으로 접근할 수 있습니다 — 따라서 Google 가격이 변경되면 다음 청구 주기가 아니라 같은 날 저희 쪽에도 반영됩니다. Xiaomi MiMo-V2.6-Pro는 OrcaRouter에 없습니다. Xiaomi 모델은 어느 것도 없으며, 이를 분명히 말하는 것이 모델 페이지가 그렇지 않은 듯이 암시하도록 두는 것보다 더 유용합니다. 오늘 이 모델에 접근하려면 Xiaomi 자체 플랫폼이나 이를 목록에 올린 서드파티 카탈로그 중 하나를 이용해야 합니다.
그 비대칭성은 바로 이 비교에서 라우터가 각주가 아니라 제자리를 차지하는 이유입니다. 두 모델은 같은 요청을 두고 경쟁하지 않습니다. Gemini 3.1 Pro Preview는 이미 비용을 지불하고 있을 수 있는 기존 모델이며, 이 페이지가 답하려는 질문은 새롭고 저렴한 모델이 그 트래픽의 일부를 가져갈 수 있는지입니다. 그 테스트를 제대로 실행한다는 것은 인덱스를 읽는 것이 아니라 여러분의 프롬프트를 두 모델 모두에 보내고 답변을 비교하는 것을 뜻하며, 이를 위해 두 번째 계약, 두 번째 키, 두 번째 결제 관계를 여는 것은 테스트가 아예 일어나지 못하게 만드는 마찰입니다. 키 하나, 우리가 라우팅하는 두 레인, 그러면 비교는 구성 변경이 됩니다. 자동 페일오버가 나머지 절반을 담당합니다: 프리뷰 모델은 예고 없이 철회되거나 속도 제한될 수 있으며, 같은 엔드포인트 뒤의 두 번째 레인이 바로 그것을 장애에서 라우팅 결정으로 바꿔 줍니다.

어느 것을 선택할까
작업에 PDF와 오디오 입력이 네이티브로 필요할 때, 이미 Google 생태계 안에 있을 때, 또는 그 모델의 동작이 특별히 필요하고 프리뷰 엔드포인트의 지원 중단 위험을 감수할 수 있을 때 Gemini 3.1 Pro Preview를 선택하세요. 첫 토큰까지 63초라는 점은 마케팅에서 상호작용성을 어떻게 말하든, 실제로는 배치 및 오프라인 워크로드용 모델이라는 뜻입니다.
볼륨이 제약 조건일 때, 루프가 컨텍스트가 많고 반복적일 때, 가중치를 자체 하드웨어에 두고 싶을 때 — MIT는 상업적 배포, 수정 및 추가 훈련을 허용합니다 — 또는 첫 토큰 지연 시간이 제품의 일부일 때 MiMo-V2.6-Pro를 선택하세요. 저렴하면서도 빠른 모델이라는 드문 사례이며, 그 조합은 16개의 지수 포인트가 시사하는 것보다 더 가치가 있습니다.
이 그림을 바꿀 것은 Gemini 3.1 Pro의 프리뷰가 아닌 후속 모델이거나, Xiaomi가 자체 하네스에서 발표한 DeepSWE 수치의 독립적 재현이다. Pro의 경우 72.57, Flash의 경우 65.68이며, 강화학습 실행 과정에서 각각 58.4와 48.8에서 이동한 값이다. 이 수치들은 벤더가 보고한 것으로, Xiaomi의 채점기에서 mini-swe-agent로 3회 평균으로 평가되었고 공개 리더보드에 제출되지 않았다. 누군가 이들을 다시 실행하기 전까지는 인용해야 할 수치는 Artificial Analysis 46이며, 이는 30과 동일한 잣대로 측정된다.
OrcaRouter는 200개 이상의 모델을 하나의 OpenAI 호환 엔드포인트 뒤에 공급자 정가에 0% 마크업으로 제공하므로, 공급업체의 가격 변경이 같은 날 바로 반영됩니다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
