
MiMo-V2.6-Pro vs GPT-5.6 Sol: 인덱스 1점의 대가로 작업당 비용이 15배 더 든다
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 36 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 181 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
2026년 9월 25일에 확인한 Artificial Analysis Intelligence Index v4.3.2에서, GPT-5.6 Sol은 최대 노력으로 47점을, Xiaomi의 MiMo-V2.6-Pro는 46점을 기록합니다. 1점 차이입니다. 실제로 이 둘을 구분하는 숫자는 점수가 아니고 토큰당 요금도 아닙니다 — 바로 단일 인덱스 작업의 비용이며, Artificial Analysis는 이를 GPT-5.6 Sol의 경우 $1.99, MiMo-V2.6-Pro의 경우 $0.13으로 공개합니다. 1점을 위해 15배의 비용이 듭니다. 그리고 이 확인 시점에, 해당 모델에 대한 평가자의 자체 페이지에는 사용 중단 공지가 실려 있는데, 이는 GPT-6 Sol이 이를 대체했기 때문입니다.
샤오미는 2026년 9월 21일, 이 글을 쓰기 나흘 전에 MiMo-V2.6-Pro의 가중치와 기술 보고서를 공개했다. OpenAI는 2026년 7월 9일 GPT-5.6 Sol을 출시했다. 위의 두 사실 모두 이 조합이 마지막으로 다뤄진 이후 새로 생긴 것이며, 서로 반대 방향으로 작용한다. 지원 중단 공지는 이 비교가 OpenAI가 이미 지나쳐 버린 모델을 상대로 한 것이라고 말한다. 작업별 수치는 두 모델이 모두 정가로 제시됐을 때 반올림 오차처럼 보였던 것이 실제 워크로드에서는 결정 전체를 좌우한다는 것을 보여준다. 두 가지 중 무엇이 중요한지는 모델을 구매하는지, 아니면 교체하는지에 달려 있다.
두 사람이 말하는 것
GPT-5.6 Sol은 2026년 7월 9일 GPT-5.6 제품군의 플래그십으로 출시되었습니다. OpenAI의 퍼스트파티 API에서 정가는 입력 토큰 100만 개당 $4.00, 출력 토큰 100만 개당 $20.00이며 90% 캐시 할인이 적용됩니다. 또한 해당 페이지에는 인덱스 실행 전반에서 생성된 출력 토큰이 9,000만 개로 기록되어 있으며, 이는 중앙값 8,800만 개와 비교됩니다. 초당 출력 토큰 73개를 측정했는데, 같은 페이지에서는 이를 중앙값 72 t/s 대비 평균보다 빠르다고 평가합니다. 해당 모델의 인덱스 항목은 동급 210개 모델 중 19위입니다.
Xiaomi MiMo-V2.6-Pro는 총 1.02조 개의 파라미터와 420억 개의 활성 파라미터를 가진 희소 전문가 혼합(mixture-of-experts) 체크포인트로, MIT 라이선스이며, 1M 토큰 컨텍스트 윈도우를 갖추고 텍스트, 이미지, 음성, 비디오 입력을 받아 텍스트를 출력합니다. 가격은 백만 토큰당 $0.43 및 $0.87로 책정되어 있으며 99% 캐시 할인이 적용됩니다 — 이는 Sol의 입력 요금의 10분의 1이고 출력 요금의 23분의 1입니다. 이 모델은 인덱스 실행에서 1억 4천만 개의 출력 토큰을 생성했으며, 초당 43.6개의 출력 토큰을 측정했는데, 이는 67.1 t/s 중앙값에 비해 눈에 띄게 느리다고 해당 페이지에서 설명합니다.
• 인덱스 작업 비용 — MiMo-V2.6-Pro $0.13; GPT-5.6 Sol $1.99 — 격차는 15배 • 정가 — MiMo-V2.6-Pro 100만 토큰당 $0.43 / $0.87; GPT-5.6 Sol $4.00 / $20.00 • 캐시 할인 — MiMo-V2.6-Pro 99%; GPT-5.6 Sol 90% • 인덱스 실행 시 출력 토큰 — MiMo-V2.6-Pro 1억 4,000만; GPT-5.6 Sol 9,000만 • 출력 속도 — MiMo-V2.6-Pro 43.6 t/s, 중간값 67.1과 비교; GPT-5.6 Sol 73 t/s, 중간값 72와 비교 • 컨텍스트와 가중치 — MiMo-V2.6-Pro 1M, MIT 라이선스; GPT-5.6 Sol 1M, 독점

사용 중단 공지가 더 중대한 문구입니다
Artificial Analysis는 이제 GPT-5.6 Sol 페이지를 열면 박스형 공지를 함께 표시한다: “이 모델은 지원 중단되었습니다. 우리는 기본 10k 입력 토큰 워크로드에 대해서만 성능 벤치마킹을 계속합니다”라는 문구와, 그 뒤에 OpenAI가 더 새로운 모델인 GPT-6 Sol (max)을 출시했으며 대신 그것을 고려해야 한다는 문장이 이어진다. 따라서 지수에서의 47은 더 이상 구매할 대상이 아닌 모델에 대한 판독값이다. 그렇다고 해서 그 판독값이 틀린 것은 아니다 — 그것은 46과 같은 지수, 같은 날, 같은 effort 설정에서 측정되었다 — 하지만 그것은 비교의 목적을 바꾼다. 그것은 더 이상 “어떤 플래그십을 사용해야 하는가”가 아니다. 그것은 “독점 모델 보드의 최상단은, 그것이 최상단이던 순간에 얼마의 비용을 치르게 하는가”이다.
그런 재구성은 들리는 것보다 더 중요하다. 평가자 페이지의 지원 중단 공지는 벤더의 제품 주기가 보도자료가 아니라 데이터 변경으로 드러나는 몇 안 되는 곳 중 하나이기 때문이다. 점수는 고정되어 있고, 모델은 제공되지 않는다. 47을 상대로 무엇을 구축하든, 그것은 a를 상대로 구축하는 것이다.

왜 작업별 숫자를 기준으로 모델링해야 하는가
토큰당 요율은 저렴한 모델을 실제보다 좋아 보이게 하고, 토큰 중립적이지 않은 워크로드에서는 오해를 불러일으킨다. 인덱스 작업 비용은 다른 측정치다: 이는 평가자가 각 모델에서 답 하나를 얻기 위해 실제로 지출한 비용으로, 요율과 모델이 출력하기로 선택한 토큰 수를 모두 반영한다. MiMo-V2.6-Pro는 인덱스 실행에서 Sol보다 더 많은 토큰을 출력한다 — 1억 4천만 개 대 9천만 개, 약 1.6배 — 그러면서도 작업당 $0.13로 $1.99에 맞선다. 요율 우위는 출력에서 약 23배이고, 장황함 페널티는 1.6배이며, 그 곱이 작업당 15배 격차다.
그것이 비용 모델이 기반으로 삼아야 할 산술이며, $0.87과 $20.00을 비교하고 멈추면 보이지 않게 되는 산술이다. 또한 그것은 결론을 무너뜨릴 수 있는 것이 무엇인지 알려준다. 워크로드가 매우 짧은 출력 위주라면 Sol의 토큰 수는 당신의 토큰 수 쪽으로 급감하고 23배의 요율 격차가 대부분의 역할을 하므로, 실제 배수는 요율 격차에서 멀어지기보다 그쪽으로 이동한다. 워크로드가 긴 추론 트레이스 위주라면 MiMo-V2.6-Pro의 1.6배 장황함이 누적되어 $0.13이 추정치라기보다 상한이 된다. 공개된 수치는 한 벤치마크의 형태를 측정한 것이지, 재무팀에 넘길 수 있는 견적이 아니다.
지연 시간 선은 정직한 균형추다
초당 출력 토큰 43.6개에서 MiMo-V2.6-Pro는 같은 날 측정된 GPT-5.6 Sol의 73보다 느리고, 자사 페이지가 비교하는 모델들보다도 느린데, 그중앙값은 67.1이다. 그 페이지에서도 “눈에 띄게 느림”이라고 분명히 말한다. 배치 파이프라인이라면 이는 비용으로 환산할 수 있는 처리량 비용이다. 대화형 에이전트라면 이는 제품 결정이며, 작업당 15배 더 저렴하다고 해서 느린 모델이 빨라지는 것은 아니다. 제약이 월 청구서가 아니라 턴당 예산이라면, 중요한 비율은 43.6 대 73이고 MiMo-V2.6-Pro는 여기서 진다.
라우터에서 이것이 어디에 위치하는지
이 조합의 유용한 형태는 “하나를 고르라”가 아니다. 두 모델 모두 같은 인덱스에 응답하고 평가자가 각 모델의 작업별 비용을 공개한다는 점이다. 따라서 분담은 벤더 등급이 아니라 측정된 비용을 기준으로 정할 수 있다. OrcaRouter에서 카탈로그는 200+개 모델에 이르며, 각 공급자의 정가로 0% 마크업으로 하나의 키 뒤에 있다 — 벤더 가격 인하가 재협상할 두 번째 계약 없이 같은 날 청구서에 반영된다 — 그리고 라우팅 DSL을 사용하면 워크로드가 저렴하고 대량인 호출은 한 모델로, 어려운 호출은 다른 모델로 브랜드가 아니라 작업 기준으로 보낼 수 있다. 자동 장애 조치는 더 저렴한 경로가 저하된 경우를 처리한다. Xiaomi MiMo-V2.6-Pro는 우리 경로에 없다 — 우리는 공급자가 모델을 온보딩하기 전에는 모델을 등록하지 않는다 — 따라서 비교의 그쪽에 대한 솔직한 답은 벤더 자체 API 또는 이미 관계를 맺고 있는 호스팅 플랫폼이다.

다음 주까지 이걸 어떻게 해야 할까요?
2026년 9월 25일에 두 가지가 바뀌었고, 그중 가격에 관한 것은 하나뿐이다. GPT-5.6 Sol은 47로 측정된 지수에서 사용 중단 공지가 붙어 있으며, 이는 이를 구매 결정 대상에서 물러나게 하고 벤치마크 참조로만 남긴다. MiMo-V2.6-Pro는 지수 작업당 $0.13로 측정되는데, Sol의 $1.99와 대비되며, Sol 쪽이 지수 1점당 15배의 비용이다 — 그리고 이 모델은 초당 43.6토큰으로, 비교 대상 모델보다 느리고 자기 클래스 중앙값보다도 느리다. 두 수치 중 어느 하나가 결정이 되기 전에 두 수치를 자신의 트래픽에 대입해 보라: 작업당 비용은 측정값이지 요율이 아니며, 지연 시간은 측정값이지 의견이 아니다. 출력이 짧고 비대화형이라면, 오픈 체크포인트를 선택할 근거는 지수 격차가 시사하는 것보다 더 강하다. 출력이 길거나 사용자가 기다리고 있다면, 15배 절감은 더 느린 제품을 사는 것이며, 그것은 오직 당신의 워크로드만이 값을 매길 수 있는 트레이드오프다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
