기사 'MiMo-V2.6-Pro-UltraSpeed vs MiMo-V2.6-Pro'의 히어로 타이틀 카드로, 킥커 'OrcaRouter · model radar — serving tiers'로 시작하며, 부제 '하나의 1T 체크포인트, 두 가지 구매 방식: 백만 토큰당 $0.435/$0.87, 또는 10배 속도를 주장하며 $4.35/$8.70.'가 있습니다. 그 아래에 두 개의 카드가 있습니다: 왼쪽은 'Standard tier'로, 'Artificial Analysis가 측정한 초당 출력 토큰 134.3개; 1M 컨텍스트; Hugging Face의 MIT 가중치'라고 표시됩니다; 오른쪽은 'UltraSpeed tier'로, '1M당 $4.35 입력 / $8.70 출력; 동일한 체크포인트, 동일한 품질 주장; 호스팅 전용'이라고 표시됩니다. 네 개의 칩은 'AA Index: 46', '총 파라미터: 1.0T', '활성 파라미터: 42B', 'DeepSWE: 72.57 공급업체 보고'라고 표시됩니다. OrcaRouter 로고가 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

Xiaomi MiMo-V2.6-Pro-UltraSpeed vs Xiaomi MiMo-V2.6: 하나의 체크포인트, 열 배의 가격

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Xiaomi MiMo-V2.6-Pro-UltraSpeed와 Xiaomi MiMo-V2.6-Pro는 두 개의 모델이 아닙니다. 이들은 하나의 모델을 두 가지 방식으로 판매하는 것입니다. 둘 다 Xiaomi가 2026년 9월에 공개한 동일한 1조 매개변수 MiMo-V2.6 체크포인트에서 제공됩니다 — Xiaomi MiMo-V2.6 시리즈의 Pro 등급이며, 그 더 작은 형제는 Xiaomi MiMo-V2.6-Flash입니다. 두 Pro 제공 간의 차이는 전적으로 토큰이 나오는 속도와 그에 대해 지불하는 금액에 있습니다. 표준 등급은 백만 입력 토큰당 $0.435, 백만 출력 토큰당 $0.87을 요구합니다. UltraSpeed 등급은 $4.35와 $8.70을 요구합니다. 이는 미터의 양쪽에서 깔끔하게 10대 1이며, 약 10배의 출력 속도라는 주장을 제공합니다 — Xiaomi가 자사의 서빙 스택에 대해 하는 주장이며, 아직 어떤 독립 벤치마크도 이에 대한 수치를 발표하지 않았습니다.

그래서 흥미로운 질문은 어느 모델이 더 나은가가 아니다. 그것은 10배의 속도에 10배 멀티플이 적정한 가격인가 하는 문제이며, 그 문제에는 프로덕션 경로를 그것에 확정하기 전에 읽어볼 만한 선례가 있는 것으로 밝혀진다.

패스트 티어는 모델 결정이 아니라 서빙 결정입니다

Xiaomi가 UltraSpeed 라인에 대해 내세우는 설명은 품질 면에서는 표준 모델과 동일하고 처리량에서만 다르다는 것입니다. 이는 들리는 것보다 더 중요합니다. 왜냐하면 새로운 등급을 두고 망설이게 만드는 흔한 이유를 없애주기 때문입니다. 여러분은 다른 체크포인트의 성격, 거부 행동, 서식 특성에 걸고 있는 것이 아닙니다. 동일한 가중치를 더 공격적인 서빙 구성으로 실행하면 여러분의 프롬프트에서도 동일하게 작동할 것이라고 거는 것입니다. 그것이 사실이라면, 두 등급 사이를 전환하는 것은 마이그레이션이 아니라 구성 변경입니다.

해당 서빙 구성 안에 무엇이 들어 있는지는 이 세대에 대해 문서화되지 않았습니다. 2026년 6월의 MiMo-V2.5-Pro 체크포인트를 기반으로 구축된 이전 UltraSpeed 티어에 대해 Xiaomi는 전문가 레이어에만 FP4 양자화를 사용하고, DFlash라는 블록 병렬 추측 디코딩 기법과 TileRT라는 런타임을 사용하며, 단일 8-GPU 노드에서 실행되었다고 설명했습니다. Xiaomi는 V2.6 티어에 대해 이에 상응하는 세부 정보를 공개하지 않았습니다. 이전 스택은 속도가 어떻게 확보되는지에 대한 맥락으로 간주하고, 현재 실행 중인 내용에 대한 설명으로 간주하지 마십시오.

이 제품이 속한 라인업은 짧습니다. 두 개의 Pro 티어와 함께, 총 파라미터 3,090억 개, 활성 파라미터 150억 개의 더 작은 형제 모델인 MiMo-V2.6-Flash가 있습니다. Pro는 희소 전문가 혼합(MoE) 플래그십입니다. Artificial Analysis는 이를 총 1조 개 파라미터, 토큰당 활성 파라미터 420억 개, 100만 토큰 컨텍스트 윈도, 그리고 Hugging Face에 가중치가 공개된 MIT 라이선스로 기재합니다. 이 수치들을 기억해 두어야 합니다. 전체 비교가 바로 이 수치들에 달려 있기 때문입니다.

실제로 검증된 것은 무엇이며, 검증되지 않은 것은 무엇인가

A two-column scoreboard titled 'MiMo-V2.6-Pro-UltraSpeed vs MiMo-V2.6-Pro — the scoreboard'. The left column, badged VENDOR-REPORTED, is headed 'MiMo-V2.6-Pro-UltraSpeed' and reads: Output speed — about 10x the standard tier, Xiaomi's claim; Price in — $4.35 per 1M tokens; Price out — $8.70 per 1M tokens; Context — 1M tokens; Weights — hosted only, none published; Independent speed test — none published. The right column, badged INDEPENDENTLY MEASURED, is headed 'MiMo-V2.6-Pro' and reads: Output speed — 134.3 tokens/sec per Artificial Analysis; Price in — $0.435 per 1M tokens; Price out — $0.87 per 1M tokens; Context — 1M tokens; Weights — MIT, on Hugging Face; Independent speed test — Artificial Analysis, 114-model class. A footer reads 'UltraSpeed figures are Xiaomi's own serving claims with no independent verification. MiMo-V2.6-Pro figures per Artificial Analysis, read 2026-09-22.' The OrcaRouter logo is composited in the bottom-right corner.

위의 두 열 사이의 비대칭은 이 글에서 가장 중요한 단 하나의 사항입니다. 이 쌍에 대해 측정 가능한 거의 모든 것이느린 쪽에서 측정되었습니다.

Artificial Analysis는 MiMo-V2.6-Pro를 벤치마크했으며, 이 모델에 대해 Intelligence Index 46을 발표했습니다 — 이는 해당 모델을 분류한 114개 모델 클래스에서 최고 점수입니다. Xiaomi의 API를 통해 초당 출력 토큰 134.3개를 측정했는데, 이는 클래스 중앙값 77.9에 대비되며, 첫 청크까지 걸리는 시간은 2.15초로 중앙값 2.34초에 대비됩니다. Intelligence Index 작업당 비용은 $0.13, 입력 가격에 대한 99% 캐시 할인, 출력 장황성은 1억 4천만 토큰으로 기재되어 있습니다. 이는 명명된 구성에 대한 독립적인 수치이며, 이 비교가 가진 유일한 확실한 처리량 기준점입니다.

UltraSpeed의 경우, 검증된 목록은 훨씬 짧습니다:

• 출력 속도 — 표준 등급의 약 10배로, Xiaomi가 밝혔고 이를 소개하는 플랫폼들도 그대로 반복했다. 제3자가 이 특정 등급에 대한 초당 토큰 측정치를 발표한 적은 없다.

• 가격 — 백만 입력 토큰당 $4.35, 백만 출력 토큰당 $8.70이며, 두 항목 모두 표준 티어의 10배입니다. 이 두 요금과 함께 명시된 캐시 티어는 없습니다.

• 품질 — "원본과 일치한다"는 역시 공급업체의 주장입니다. UltraSpeed 엔드포인트에 대한 독립적인 평가가 발표된 적이 없으므로, 품질이 변하지 않았다는 주장은 반증된 것이 아니라 검증되지 않은 것입니다.

• 컨텍스트 및 모달리티 — 1,048,576 토큰과 텍스트, 이미지, 비디오, 오디오 네이티브 입력, 베이스 체크포인트에서 상속됨.

정확히 언급할 가치가 있는 벤더 벤치마크도 있습니다. 그 이유는 그것이 얼마나 퍼져 나갔는지에 있습니다. Xiaomi의 공개 강화학습 대시보드는 2026년 9월 V2.6 포스트트레이닝 실행을 스트리밍했으며, Pro 실행의 DeepSWE v1.1 점수를 72.57, Flash의 점수를 65.68로 보고합니다. 이는 Xiaomi 자체 오프라인 평가에서 mini-swe-agent 하네스를 사용해 3회 평균으로 산출한 값이며, 공개 리더보드에 제출된 적이 없고, 연구실 외부에서 재현된 적도 없습니다. 72.57이 리더보드 점수로 인용된 것을 보셨다면, 그것은 리더보드의 옷을 입은 벤더 숫자입니다.

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro captured September 22, 2026, headed 'MiMo-V2.6-Pro Intelligence, Performance & Price Analysis' with the labels 'Open weights model' and 'Released September 2026'. The metric strip reads Intelligence #1/114, Speed #11/114, Cost #12/114 and Verbosity #18/114. The cost panel reads $0.435 in and $0.87 out per million tokens, a 99% cache discount, and $0.13 per Intelligence Index task; the speed panel reads 134.3 output tokens per second, ranked eleventh of 114 against a median of 77.9, with a first-chunk time of 2.15 seconds; verbosity reads 140M output tokens. The comparison summary states the model scores 46 on the Artificial Analysis Intelligence Index against a class median of 18, is notably fast at 134 tokens per second against a median of 78, is somewhat verbose, supports text, image, speech and video input and outputs text, and has a 1M-token context window. Technical specifications list reasoning enabled, input modalities text and image, output text, a 1M context window, 1.0T total parameters, 42B active parameters, an MIT licence, and model weights on Hugging Face.

선례: 지난번에 샤오미는 열 배가 아니라 세 배를 청구했다

이것은 샤오미의 첫 번째 속도 등급이 아니며, 이전 등급이 이 전체 이야기에서 가장 유용한 비교 대상이다 — 배수가 바뀌었기 때문이다.

MiMo-V2.5-Pro-UltraSpeed는 2026년 6월에 출시되었으며, V2.5-Pro 체크포인트를 기반으로 구축되었고, 표준 모델의 출력 요금의 약 3배로 책정되었습니다. Xiaomi의 당시 주장은 지금의 주장과 같았습니다: 약 10배의 출력 속도. 당시 보도에서는 단일 8-GPU 노드에서 초당 약 1,000토큰의 지속 처리량과 1,200에 가까운 피크를 보고했지만, 모델 페이지 자체에는 500~1,000의 더 넓은 범위가 기재되어 있었으며 — 그중 어느 것도 독립적으로 검증되지 않았습니다. 접근은 공개 가입이 아니라 신청서를 통해 제한되었습니다.

둘을 나란히 놓고 보면, 그 변화가 바로 핵심이다. 속도 배수는 대략 10에 머물렀다. 가격 배수는 3에서 10으로 바뀌었다. 이는 같은 종류의 업그레이드에 대해 사뭇 다른 조건이며, Xiaomi는 그 변경에 대한 설명을 공개하지 않았다. 이는 실제로 더 비싸진 서빙을 반영할 수 있다 — 더 큰 체크포인트, 더 공격적인 디코딩 구성, 또는 출시 시점의 더 빠듯한 용량을. 단 하루 동안만 제공된 한 티어의 출시 기간 가격을 반영할 수도 있다. 아직 그것이 갖추지 못한 것은 확인할 수 있는 공개적 근거다.

V2.5 티어를 사용해 본 사람이라면 누구나 짚어 둘 만한 실질적인 차이가 하나 있습니다. 그 티어는 접근이 제한된 시험판이었습니다. V2.6 티어는 Xiaomi 자체 API와 여러 서드파티 플랫폼을 통해 공개된 요금으로, 별도 신청 절차 없이 일반 제공되는 것으로 안내되어 있습니다. 그 밖에 무엇이 바뀌었든, 시도해 볼 때의 허들은 낮아졌습니다.

실제 워크로드에서 10배의 비용

백분율은 이것의 형태를 감추기 때문에, 구체적인 에이전트 실행 하나에 대한 계산을 여기에 제시한다 — 수명 동안 2천만 개의 입력 토큰을 읽고 200만 개의 출력 토큰을 내보내는 실행 말이다. 이는 무겁지만 이국적인 것은 아닌 에이전트 워크로드, 즉 모델이 도구 호출을 반복하고 자체 컨텍스트를 다시 읽는 종류다.

• 스탠다드 티어, 입력 — 2,000만 토큰, 백만 개당 $0.435: $8.70.

• 표준 등급, 출력 — 2M 토큰, 백만 개당 $0.87: $1.74.

• 표준 등급, 합계 — 실행당 $10.44

• UltraSpeed 등급, 입력 — 백만 토큰당 $4.35로 20M 토큰: $87.00.

• UltraSpeed 등급, 출력 — 200만 토큰, 백만 개당 $8.70: $17.40.

• UltraSpeed 등급, 총계 — 실행당 $104.40.

차액은 $93.96이며, 이는 청구서의 한 항목이 아니라 청구서 전체의 정확히 열 배입니다. 두 요율이 함께 증가하기 때문입니다. 이제 장부의 다른 쪽을 보겠습니다. Artificial Analysis가 standard 티어에서 측정한 초당 출력 토큰 134.3개 기준으로, 200만 출력 토큰을 생성하는 데는 순수 생성 시간만 4시간이 조금 넘게 걸립니다. 그 열 배 속도라면 약 25분이 걸립니다. 따라서 추가 $94는 이번 실행에서 실제 경과 시간을 약 3시간 반가량 되돌려주는 셈입니다. 그렇게 표현하자면, 절약된 1시간당 약 $27인 셈입니다.

그 거래가 좋은지는 전적으로 월 클록이 당신에게 얼마나 가치가 있는지에 달려 있으며, 순진한 해석을 무너뜨리는 한 가지 변수가 있습니다. 표준 티어의 입력 가격에는 Artificial Analysis 페이지에서 99% 캐시 할인이 적용되는데, 이는 동일한 컨텍스트를 다시 읽는 워크로드에서 청구서의 입력 절반이 거의 0에 가깝게 줄어들 수 있음을 의미합니다. UltraSpeed의 목록에는 두 가지 대표 요금이 표시되고 캐시 티어는 없습니다. 워크로드가 캐시 중심이라면 실효 배수는 10이 아니라 훨씬 더 나쁩니다. 거의 아무것도 지불하지 않던 쪽에서 할인을 잃기 때문입니다. 워크로드가 출력 중심이고 캐시 비중이 낮다면 10배가 실제 숫자에 가깝습니다. 어느 쪽 수치든 믿기 전에 자신의 워크로드 구성을 측정하세요.

오픈 웨이트 비대칭성

두 등급 사이에는 가격이나 속도와는 아무 관련이 없는 구조적 차이가 있으며, 이는 어느 쪽보다 더 중요할 수 있습니다.

MiMo-V2.6-Pro는 MIT 라이선스로 출시되며 가중치는 Hugging Face에 공개되어 있다. 이는 상업적 배포, 수정 및 추가 학습을 허용하며, 표준 모델의 가격에는 어떤 공급업체도 없앨 수 없는 하한선이 생긴다는 뜻이다: 호스팅 요금이 더 이상 합리적이지 않게 되면 체크포인트를 직접 서빙할 수 있다. 자체 하드웨어에서 Xiaomi의 처리량을 따라가지는 못할 것이고 GPU 비용도 지불해야 하겠지만, 선택지는 존재하며 이는 호스팅 등급이 청구할 수 있는 금액에 상한을 둔다.

UltraSpeed에는 그런 하한선이 없다. UltraSpeed 가중치는 존재하지 않는다. 그 티어는 모델이 아니라 서빙 스택이기 때문이다. 체크포인트는 이미 공개된 것과 동일하며, 당신이 빌리는 것은 Xiaomi가 그것을 빠르게 실행하는 능력이다. 그것은 판매해도 정당한 것이고, 시장의 다른 모든 속도 티어와 같은 형태다. 그렇다고 해서 10배 요율에 동일한 오픈 가중치를 돌리는 다른 제공자 외에는 경쟁적 견제가 없다는 뜻이며, 가격이 다시 움직여도 자체 호스팅이라는 탈출구가 없다는 뜻이다.

Screenshot of Xiaomi's MiMo homepage captured September 22, 2026, headed 'HELLO, I'M MiMo'. Two product cards are visible: 'Xiaomi MiMo-V2.6-Series', subtitled 'Frontier intelligence, all the modalities, built in public', and 'Xiaomi MiMo-V2.5-TTS Series'. Below them a 'Build with MiMo' section lists two numbered routes, '01 Web Demo' and '02 API Access', with the lines 'Interact with MiMo directly through the web' and 'Developer portal for quick integration of MiMo capabilities'.

그 내용을 가용성 상황과 견주어 보라. 표준 체크포인트는 Xiaomi 자체 채널과 여러 서드파티 플랫폼을 통해 접근할 수 있으며, 다운로드로도 제공된다. UltraSpeed 등급은 Xiaomi 자체 API와 여러 서드파티 플랫폼을 통해 접근할 수 있으며, 그것이 이 등급을 얻는 유일한 방법이다. 장기적으로 의존할 대상을 저울질하는 사람이라면, 이러한 선택 가능성의 차이는 토큰당 요금과 함께 따져볼 가치가 있다.

누가 무엇을 수강해야

그 결정은 비용 중 얼마가 출력 토큰인지, 그리고 지연 예산 중 얼마가 큐 대기가 아니라 생성에 쓰이는지에 따라 명확히 갈린다.

• UltraSpeed는 워크로드가 출력 중심이고, 캐시 의존도가 낮으며, 상호작용적일 때 사용하세요 — 장문 생성, 모델이 도구 호출 사이에 많은 추론을 작성하는 에이전트 루프, 또는 요청의 다른 쪽에서 사람이 기다리고 있는 모든 상황에 적합합니다.

• 워크로드가 캐시 의존도가 높거나, 배치 처리를 허용할 수 있거나, 한계 비용에 민감할 때는 표준 티어를 선택하세요 — 대량 분류, 고정 코퍼스에 대한 검색 증강 응답, 야간 평가 실행, 아무도 지켜보지 않기 때문에 4시간의 생성이 괜찮은 모든 작업이 여기에 해당합니다.

• 셀프 호스팅 옵션을 원할 때는 스탠더드 티어를 선택하세요. 컴플라이언스 요건상 직접 보유할 수 있는 가중치가 필요하다면, UltraSpeed는 어떤 가격에도 이용할 수 없습니다.

• 측정하기 전에는 어느 쪽도 택하지 마세요. 10배라는 주장이 여기서 핵심을 떠받치는 숫자인데, 현재로선 공급업체가 제시한 수치일 뿐입니다. 두 티어 모두에 직접 자신의 프롬프트를 돌려 보는 반나절이면 공개된 그 어떤 수치보다 더 많은 것을 알 수 있습니다. 독립적으로 검증된 유일한 처리량 수치가 비교 대상 중 느린 쪽의 것이기 때문입니다.

마지막 요점에 대해 말하자면, 서빙 티어를 테스트하는 메커니즘은 모델을 테스트하는 것과 동일하며, 바로 이 지점에서 라우팅 계층이 존재 가치를 발휘합니다. OrcaRouter는 0% 마크업이 그대로 전달되는 제공업체 정가로 단일 API 키 하나로 200개 이상의 모델을 제공하며, 따라서 벤더 가격 변경이 다음 계약 갱신 시점이 아니라 같은 날 귀하 쪽에 반영됩니다. 자동 페일오버 덕분에 아직 평가 중인 티어가 단독으로 프로덕션 경로에 놓이는 일은 없으며, 라우팅 DSL을 사용하면 두 개의 통합을 유지하지 않고도 한 종류의 요청은 빠른 엔드포인트로, 나머지는 모두 표준 엔드포인트로 보낼 수 있습니다. 이 모든 것에 Xiaomi의 모델이 특별히 필요한 것은 아닙니다 — 요점은, 티어가 하나의 키 뒤에 자리할 때 이와 같은 티어 수준의 결정을 되돌리기가 저렴하다는 것입니다.

이 문제를 해결할 수 있는 방법은 무엇일까요?

MiMo-V2.6-Pro-UltraSpeed 대 MiMo-V2.6-Pro 질문의 솔직한 현황은 절반은 측정된 것이고 절반은 주장된 것이다. 표준 티어에는 독립적인 인텔리전스 인덱스, 독립적인 처리량 수치, 그리고 공개된 오픈 웨이트가 있다. 고속 티어에는 가격, 컨텍스트 윈도우, 그리고 동일한 모델이 더 빨라진 것이라는 공급업체의 약속이 있다.

UltraSpeed 엔드포인트에 대한 독립적인 처리량 측정 — Artificial Analysis는 Xiaomi의 API를 통해 표준 티어를 측정했으므로, 동일한 처리가 가능하며 단지 아직 이루어지지 않았을 뿐이다. 빠른 티어를 위한 캐시 정책 — 그것의 부재가 캐시 의존도가 높은 작업에서 10배 청구서를 더 심각한 상황으로 만드는 원인이기 때문이다. 그리고 Xiaomi가 V2.5 세대를 위해 FP4 experts, DFlash, TileRT를 문서화했던 방식으로, V2.6 서빙 스택에 관해 공개된 모든 세부 정보.

그때까지는 열 배의 가격이 현실이고, 열 배의 속도는 주장일 뿐이다. 워크로드가 출력 위주이고 누군가 기다리고 있다면, 그 주장은 자신의 프롬프트로 직접 시험해 볼 가치가 있다 — 그리고 그것이 성립하지 않을 경우 같은 날 오후에 바로 되돌릴 수 있게 해 주는 레이어 뒤에서 시험해 볼 가치도 있다.