
MiMo-V2.6-Pro vs Claude Opus 5: 21배 더 저렴, 지수는 5포인트 뒤처짐
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 632 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 187 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 112 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
Xiaomi MiMo-V2.6-Pro와 Claude Opus 5는 하나의 트레이드오프의 양 극단이며, 그 트레이드오프에는 대가가 따른다. Artificial Analysis Intelligence Index v4.3.2에서 Claude Opus 5(max effort)는 51점, Xiaomi MiMo-V2.6-Pro는 46점을 기록한다. 요금표를 보면 Claude Opus 5는 백만 입력 토큰당 $5.00, 백만 출력 토큰당 $25.00이고, MiMo-V2.6-Pro는 $0.43와 $0.87이다. 나눗셈을 해 보면 답은 입력에서 11.6배, 출력에서 28.7배이며, Artificial Analysis가 각각에 대해 공개하는 혼합 요율로는 21배다. 지수 5점 차이에 21배의 비용이 든다. 그것이 이득인지 낭비인지는 전적으로 여러분의 워크로드가 다섯 번째 점수로 무엇을 해내는지에 달려 있으며, 대부분의 팀은 결정을 내리기 전에 그것을 계산해 보지 않는다.
두 모델, 간단히 말하면
Claude Opus 5는 2026년 7월 24일에 출시된 Anthropic의 독점 플래그십으로, 100만 토큰 컨텍스트 창과 공개되지 않은 파라미터 수를 갖습니다. Xiaomi MiMo-V2.6-Pro는 총 1조 2천억 개의 파라미터와 420억 개의 활성화 파라미터를 가진 희소 전문가 혼합 모델로, 100만 토큰 컨텍스트 창, 텍스트·이미지·비디오·오디오 전반에 걸친 네이티브 멀티모달리티, MIT 라이선스로 공개된 가중치를 갖습니다.
• 가중치 — MiMo-V2.6-Pro는 MIT 라이선스이며 다운로드 가능, Claude Opus 5는 독점이며 API 전용
• 파라미터 — MiMo-V2.6-Pro 총 1.02T / 활성 42B; Claude Opus 5 비공개
• 컨텍스트 — 양쪽 모두 1M 토큰; Claude Opus 5는 Messages API에서 출력을 128K로, Batch API에서는 300K로 제한합니다
• 모달리티 — MiMo-V2.6-Pro는 텍스트, 이미지, 비디오, 오디오를 입력으로 받으며, Claude Opus 5의 공개된 입력 표면은 텍스트와 이미지입니다.
• 정가 — MiMo-V2.6-Pro 100만 토큰당 $0.43 / $0.87; Claude Opus 5 $5.00 / $25.00
• 캐시 — MiMo-V2.6-Pro는 99% 캐시 할인을 제시합니다; Claude Opus 5는 5분 TTL에서 1M당 $0.50에 캐시를 읽고 $6.25에 씁니다
• Intelligence Index 작업당 측정 비용 — MiMo-V2.6-Pro $0.13; Claude Opus 5 $5.86
• 서빙 — MiMo-V2.6-Pro 초당 출력 토큰 134.3개, 첫 토큰까지 2.15초; Claude Opus 5 초당 57.9토큰
그 마지막 쌍이 바로 놓치기 쉬운 부분입니다. 더 저렴한 모델이 더 빠른 모델이기도 합니다 — 출력 처리량 기준 2.3배입니다 — 왜냐하면 Xiaomi와 그 파트너들이 통제하는 하드웨어에서 서빙되며 공격적으로 배치 처리할 수 있기 때문입니다. 최대 노력으로 실행되는 Claude Opus 5는 토큰당 더 많은 작업을 수행하는 추론 모델입니다. 속도 격차는 결함이 아니라 서로 다른 제품입니다. 하지만 그것은 저렴한 경로가 지연 시간으로 할인 비용을 치르지 않는다는 뜻입니다. 그 대가는 인덱스 5점과, 그 다섯 번째 점이 깃들어 있는 작업들의 꼬리에서 치르고 있습니다.

다섯 지점이 실제로 어디에 있는지
열 개 평가를 종합한 점수에서의 5점 격차는 고르게 퍼져 있지 않으며, 그 종합 점수는 정작 중요한 것을 가린다. 두 모델 모두 동일한 v4.3.2 스위트에서 실행되었는데, 여기에는 AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1이 포함된다. 공개된 페이지에는 두 모델 중 어느 쪽에 대해서도 평가별 점수가 분리되어 제시되어 있지 않은데, 이는 이 비교의 양쪽 모두에 해당하는 실제 한계이며 얼버무리기보다 짚고 넘어갈 만하다.
공식 기록상 수치는 방향성을 보여준다. Claude Opus 5는 최대 노력 설정에서 v4.3 스위트 내 Terminal-Bench 4.0에서 49.0%를 기록했으며, GPT-6 Astra의 59.1%와 Claude Fable 5.1의 52.0%에 뒤졌다. AutomationBench-AA에서 Opus 5는 28.3%의 워크플로에서 가드레일 위반 없이 모든 목표를 완수했지만, GPT-6 Astra는 41.6%, Fable 5.1은 32.1%를 기록했다. 이는 구체적인 에이전트 수치이며, 5점 종합 격차가 균등하게 분포될 가능성이 가장 낮은 범주에 정확히 해당한다 — MiMo-V2.6-Pro 자체의 지수 항목은 비교 가능한 에이전트 부문 세부 결과를 공개하지 않는다.
한편 두 회사가 공개하는 벤더 수치는 서로 비교할 수 없으며, 그 이유를 솔직하게 말할 가치가 있습니다. Anthropic의 출시 자료는 SWE-bench Verified를 96.0%, SWE-bench Pro를 79.2%로 보고합니다. 한 트래커는 Opus 5가 독립형 SWE-bench 항목 없이 출시되었으며, 이에 대한 독립적으로 감사된 SWE-bench Verified 수치가 없다고 지적합니다. Xiaomi의 자료는 MiMo-V2.6-Pro가 자체 RL 실행 동안 DeepSWE v1.1에서 58.4에서 72.57로 향상되었다고 보고하는데, 이는 Xiaomi 자체 하네스에서 mini-swe-agent를 사용해 3회 평균으로 측정한 것이며, 공개 DeepSWE 보드에 제출된 것은 아닙니다. 두 벤더 하네스, 두 가지 서로 다른 과제, 겹치는 부분 없음. 96.0%를 72.57 옆에 놓고 결론을 내리는 것은 존재하지 않는 비교를 만들어내는 것입니다.

제대로 된 비용 비교
토큰당 산술 계산은 격차를 과소평가한다. 두 모델이 같은 작업을 끝내는 데 소비하는 토큰 수가 같지 않기 때문이다. Artificial Analysis는 전체 Intelligence Index를 실행하는 데 각각 실제로 얼마가 들었는지 측정했다. MiMo-V2.6-Pro는 $0.13, Claude Opus 5는 $5.86이었다. 이는 통제된 동일 작업 세트에서 45배 격차이며, 둘 다 같은 방식으로 측정되었기 때문에 이용 가능한 가장 공정한 단일 수치다.
이제 여기에 그럴듯한 프로덕션 루프를 대입해 보자. 단계당 200,000토큰의 컨텍스트를 읽고 2,000토큰을 쓰는 30단계 에이전트 실행은 실행당 600만 입력 토큰과 60,000 출력 토큰이다. Claude Opus 5의 정가 기준으로는 입력 $30.00, 출력 $1.50, 즉 캐싱을 전혀 적용하기 전 실행당 $31.50이다. MiMo-V2.6-Pro에서는 입력 $2.58, 출력 $0.05로 $2.63이다. 두 공급업체가 모두 제공하는 캐시 할인을 적용하면 입력 쪽은 어느 모델에서든 급락하고, 비율은 사라지는 게 아니라 이동한다. 저렴한 모델의 99% 캐시 할인과 비싼 모델의 $0.50 캐시 읽기를 비교해도, 컨텍스트가 많은 루프에서는 비싼 모델이 여전히 10배가량 앞서게 된다.
이는 저렴한 레인을 택하고 전면 전환에는 반대하는 전체 논거입니다. 워크로드가 동일한 컨텍스트를 수백 번 다시 읽는 장기 실행 에이전트 루프라면, 실행당 비용 차이는 반올림 오차가 아닙니다 — 사용자당 실행할 여유가 있는 기능과 그렇지 않은 기능을 가르는 차이입니다. 바로 이 때문에 MiMo-V2.6-Pro를 트래픽 대부분 앞에 두는 것입니다. 그렇다고 Claude Opus 5를 삭제하자는 것은 아닙니다. 왜냐하면 다섯 번째 지수 포인트가 그 자체로 값을 하는 작업은, 구조상 저렴한 모델의 실패가 비싸게 치러지는 작업이기 때문입니다.

여기에서 라우팅 결정이 어떤 모습인지
Claude Opus 5는 단일 OrcaRouter 키를 통해 공급사 정가에 0% 마크업으로 이용할 수 있으며, anthropic/claude-opus-5로 접근할 수 있습니다. 비교 대상으로 삼을 만한 프런티어 모델들도 같은 키에 나란히 올라 있습니다. 저희는 공급사 정가를 마크업 없이 그대로 전달하기 때문에, 어느 쪽에서든 벤더 가격이 바뀌면 재견적을 기다릴 필요 없이 같은 날 바로 저희 쪽에도 반영됩니다. 흥미로운 부분은 라우팅 DSL에 있습니다. 두 모델 중 하나를 고르는 대신 하나의 호출로 두 모델을 조합할 수 있고, 워크로드의 대부분은 저렴한 레인으로 보내고 나머지 — 자체 검사에 실패한 작업이나 복잡도 조건에 해당하는 작업 — 는 비싼 레인으로 라우팅할 수 있습니다. 나머지 절반은 페일오버입니다. Claude Opus 5는 공급사 커버리지가 넓습니다. MiMo-V2.6-Pro는 Artificial Analysis가 포착했을 당시 단일 API 공급사만 등록하고 있었는데, 이는 프로덕션 경로에 넣을 만한 모델치고는 빈약한 경로입니다. 폴백이 가능한 라우터가 있어야 저렴한 레인을 안심하고 도입할 수 있습니다.
분명히 말해 둘 만합니다. 그렇지 않다고 쉽게 가정하기 때문입니다. 우리는 MiMo-V2.6-Pro를 호스팅하지 않습니다. 오늘날 이 모델에 접근하려면 Xiaomi 자체 플랫폼이나 이를 목록에 올린 제3자 카탈로그 중 하나를 이용해야 합니다. 여기서의 라우팅 논점은 이런 모델을 우리가 실제로 제공하는 모델들과 함께 어떻게 사용하는가에 관한 것이지, 이것이 우리 모델 중 하나라는 주장이 아닙니다.
어느 걸 고를까?
작업의 실패 비용이 토큰 비용을 초과하여 5 인덱스 포인트가 저렴한 보험이 될 정도라면 Claude Opus 5를 선택하세요 — 실제 사이드 이펙트가 있는 장기적인 에이전트 작업, 잘못된 호출이 느린 호출보다 더 나쁜 도구 사용, 이미 사람에게 비용을 지불하고 출력을 확인하는 모든 경우. $5.86-per-index-task 수치는 그것을 피할 이유가 아니다; 그것은 해당 티어의 가격이며, 그 티어는 존재할 이유가 있다.
볼륨이 제약 조건일 때, 워크로드가 컨텍스트가 많고 반복적일 때, 가중치를 자체 인프라에 두고 싶을 때 — MIT 라이선스는 상업적 배포, 수정, 추가 학습을 허용합니다 — 또는 단위 경제성이 1,000토큰당 0.2센트에서만 성립하는 무언가를 만들고 있을 때 MiMo-V2.6-Pro를 선택하세요. 초당 134.3토큰의 속도 덕분에 대부분의 1조 매개변수 오픈 모델과 달리 대화형 사용이 가능합니다.
라우터가 있다면 둘 다 선택하세요. '어느 쪽이 더 나은가'에 대한 솔직한 답은 그들이 같은 요청을 두고 경쟁하지 않는다는 것입니다. 피해야 할 실패 모드는 가장 큰 비용을 초래하는 것입니다: 헤드라인 비율이 21x라는 이유로 저렴한 모델로 표준화했다가, 3개월 차에 특정 유형의 요청에는 비싼 모델이 필요하다는 것을 발견하고, 그쪽으로 라우팅할 경로가 없는 경우입니다. 두 번째 실패 모드는 그 거울상입니다 — 46-index 모델이 동일하게 끝내는 요약 작업에 Opus 5 요금을 지불하는 것입니다. 둘 다 모델 문제가 아닙니다. 둘 다 구성 문제이며, 구성은 화요일 오후에 바꿀 수 있는 부분입니다.
