
Xiaomi MiMo-V2.6-Pro vs Grok 4.7: 30× mais barato por tarefa, e nenhum dos dois é rápido
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 181 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Xiaomi MiMo-V2.6-Pro e Grok 4.7 foram lançados em 21 de setembro de 2026, ambos ficam em 46 no Artificial Analysis Intelligence Index v4.3.2, e ambos são chamados de lentos pela página que os mediu — 43,6 tokens de saída por segundo para o MiMo-V2.6-Pro contra uma mediana de 67,1, 40 para o Grok 4.7 com esforço xhigh. O que os separa é quanto custa uma resposta. O valor por tarefa do avaliador é de US$ 0,13 para o checkpoint aberto chinês e US$ 3,74 para o modelo Grok 4.7, um fator de aproximadamente 29. Isso não é uma diferença de tarifa, ou não apenas uma: a tarifa de saída do Grok 4.7 é de US$ 6,00 por milhão de tokens contra US$ 0,87, o que é sete vezes, e o restante do múltiplo vem de quantos tokens cada modelo queima para chegar a uma resposta.
Dois modelos no mesmo mês, no mesmo índice, com a mesma pontuação, com preços como se pertencessem a décadas diferentes do mercado. A pergunta interessante não é qual deles vence. É qual parte desse 29× você consegue de fato contornar — porque, neste emparelhamento, exatamente um dos dois é uma rota que você pode comprar hoje, e é a mais cara.
Mesmo dia, mesmo placar, animais diferentes
Grok 4.7 foi lançado em 21 de setembro de 2026 por US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, com uma janela de contexto de 500.000 tokens, data de corte de conhecimento em maio de 2026, desconto de cache de 75% e entrada de texto e imagem com saída de texto. Ele registrou 46 no índice com esforço xhigh, 56 no Coding Agent Index no harness Grok Build e 1.657 Elo no AA-Briefcase — quarto lugar nesse ranking, atrás de três entradas da Anthropic, a aproximadamente metade do custo por tarefa do Claude Opus 5.
Xiaomi MiMo-V2.6-Pro é um checkpoint esparso de mistura de especialistas, com 1,02 trilhão de parâmetros totais e 42 bilhões ativos, com licença MIT, contexto de 1M tokens, entrada de texto, imagem, fala e vídeo com saída de texto, US$ 0,43 e US$ 0,87 por milhão de tokens, com um desconto de cache de 99% que reduz a taxa efetiva de entrada a quase nada em um prompt quente. A Artificial Analysis o coloca em primeiro lugar entre 114 modelos de pesos abertos no índice e em 12º entre 114 em custo. Ele é acessível por meio de três provedores de API. Ele não está nas nossas rotas, e não listamos um modelo antes que um provedor o tenha integrado.
A única linha que decide isso
• Custo por tarefa de índice — MiMo-V2.6-Pro $0,13; Grok 4.7 $3,74 — 29× • Preço de saída — MiMo-V2.6-Pro $0,87 / 1M; Grok 4.7 $6,00 / 1M — 6,9× • Tokens de saída na execução do índice — MiMo-V2.6-Pro 140M; Grok 4.7 240M, em comparação com uma mediana de 88M • Velocidade de saída — MiMo-V2.6-Pro 43,6 t/s; Grok 4.7 40 t/s — ambas abaixo da mediana • Janela de contexto — MiMo-V2.6-Pro 1M; Grok 4.7 500K • Pesos — MiMo-V2.6-Pro com licença MIT e disponível para download; Grok 4.7 proprietário, apenas via API
Leia os dois primeiros tópicos em conjunto e a forma da diferença fica clara. Ao preço de tabela, os dois estão a 6,9× de distância em termos de saída. Na execução do índice, estão a 29× de distância no que custa uma resposta. O fator multiplicador entre eles é a verbosidade: o Grok 4.7 gerou 240 milhões de tokens de saída contra uma mediana de 88 milhões para a sua classe, e o MiMo-V2.6-Pro gerou 140 milhões. Isso é uma penalização de 1,71× em tokens que se soma à penalização de 6,9× na tarifa, e 1,71 × 6,9 é 11,8 — o resto da distância até 29 vem do lado da entrada, onde o desconto de cache de 99% e a tarifa de entrada de $0,43 do MiMo-V2.6-Pro fazem o trabalho pesado numa carga de trabalho com qualquer prefixo repetido que seja.

A verbosidade é o número que as pessoas deixam de fora da estimativa.
Modelos de custo geralmente são construídos a partir de uma tabela de preços e uma contagem de tokens presumida. Ambas as metades disso estão erradas aqui. A tabela de preços está errada porque o desconto de cache não é uma nota de rodapé — 99% contra 75% é a diferença entre um prompt de sistema custar dinheiro a cada chamada e custar quase nada. A contagem de tokens está errada porque os dois modelos não emitem o mesmo número de tokens para o mesmo trabalho, e o avaliador mediu a diferença: 240 milhões contra 140 milhões, uma variação de 1,71× em um benchmark idêntico.
Nenhum desses é um proxy que você possa ler em uma ficha técnica. O ranking de verbosidade do Grok 4.7 é #94 de 210 modelos em sua classe; o ranking de custo do MiMo-V2.6-Pro é #12 de 114 na dele. Uma equipe que cita a tabela de preços do Grok 4.7 e assume uma carga de trabalho neutra em tokens preverá aproximadamente um quarto do que o índice realmente gastou por tarefa. A correção não é, tampouco, usar o custo do índice como sua estimativa — ele é uma medição da forma de um único benchmark. É medir suas próprias contagens de tokens em ambos os lados antes de se comprometer, porque a diferença entre os dois modelos é de 6,9× no papel e 29× na prática, e apenas um desses números é real para o seu tráfego.

Ambos são lentos, e isso não é um empate
A Artificial Analysis mediu o Grok 4.7 em 40 tokens de saída por segundo e o classifica como “um dos mais lentos”; o MiMo-V2.6-Pro em 43,6 e o classifica como “notavelmente lento”. Essas duas leituras são próximas o suficiente para que a velocidade não deva ser o critério de desempate entre eles. Mas as medianas por trás delas não são: 67,1 para o campo de pesos abertos no qual o MiMo-V2.6-Pro se insere. Ambos os modelos estão bem abaixo dela, e o MiMo-V2.6-Pro também carrega um tempo até o primeiro token de 3,17 segundos contra uma mediana de 2,31 segundos, que é o número que dói em um ciclo interativo, e não em um de lote.
Portanto, o resumo honesto do lado da latência é que 29× mais barato não lhe proporciona um produto mais rápido; proporciona um mais lento que custa menos — e, se os seus usuários estiverem olhando para um cursor, a espera de 3,17 segundos pode custar mais do que os tokens economizados. Para trabalho em lote durante a noite, avaliação offline ou qualquer pipeline em que o relógio seja medido em horas, a troca é direta e o 29× é praticamente de graça.
O que um roteador pode e não pode fazer com este pareamento
Este é o pareamento em que nosso próprio catálogo é genuinamente unilateral, e vale a pena ser franco sobre isso. Grok 4.7 está disponível no OrcaRouter como grok/grok-4.7 ao preço de $2.00 / $6.00 do próprio provedor, com saída máxima de 450K e um endpoint compatível com o SDK da OpenAI em https://api.orcarouter.ai/v1 — então, se a comparação fizer você querer o modelo da xAI por trás da mesma chave usada por todo o resto, essa rota existe hoje. Xiaomi MiMo-V2.6-Pro não está nas nossas rotas; para esse lado, a API do próprio fornecedor ou qualquer um dos seus três provedores listados que você já usa é a resposta, e não vamos fingir o contrário.
Onde um roteador justifica o seu lugar numa comparação como esta é nas partes que não são o modelo. Uma única chave para mais de 200 modelos ao preço de tabela de cada fornecedor, com 0% de margem, significa que um corte de preço do fornecedor chega à sua fatura no mesmo dia, em vez de só na próxima renovação de contrato. O failover automático significa que a degradação da rota de 40 t/s não leva o seu pipeline junto. A DSL de roteamento permite que a divisão seja feita com base no custo publicado por tarefa, em vez de na fidelidade à marca — modelo barato para o alto volume, modelo potente para as chamadas difíceis, decidido por solicitação. E, para as cargas de trabalho em que nenhum dos modelos é totalmente adequado, a fusão de modelos pode executar vários por trás de uma única chamada.

Perguntas que esta comparação costuma levantar
O 29× se mantém para minha carga de trabalho? Somente se seu mix de tokens se assemelhar ao da execução do índice. Se suas saídas forem curtas e seus prompts forem longos e armazenados em cache, o múltiplo colapsa em direção à diferença de taxa de 6,9× na saída e aumenta na entrada, onde o desconto de 99% do MiMo-V2.6-Pro é o termo decisivo. Se suas saídas forem traços de raciocínio longos, ele se amplia além de 29×, porque a penalidade de verbosidade do Grok 4.7 é proporcional ao comprimento da saída.
O 46 de cada lado é o mesmo 46? É o mesmo índice, a mesma versão e a mesma escala — as subpontuações subjacentes eram 46,32 e 46,45, uma diferença de 0,13 ponto, e o índice arredonda ambos para 46. A Artificial Analysis não publica detalhamentos por avaliação para nenhum dos modelos, então o composto é o nível mais granular disponível e uma diferença de 0,13 ponto não deve ser interpretada como uma classificação de capacidade.
Qual deles um novo projeto deve usar por padrão? Se a carga de trabalho for em lote, tolerante à latência e sensível a custos, o MiMo-V2.6-Pro a $0,13 por tarefa é o padrão, e os pesos abertos significam que você não fica exposto ao preço de um único provedor. Se você precisa especificamente do modelo da xAI — os resultados do Grok Build harness, a colocação no AA-Briefcase, os 500K de contexto com data de corte em maio de 2026 —, o Grok 4.7 é uma rota ativa no OrcaRouter hoje, e o prêmio por tarefa é o preço dessa capacidade específica. Não há modelo aqui que vença nos dois casos.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
