Um cartão de título gerado com os dizeres MiMo-V2.6-Pro vs Grok 4.7, com o subtítulo 29x mais barato por tarefa e mais lento, em ambos os lados abaixo dele, e três ícones de linha plana acima do título sugerindo pilhas de moedas comparadas, um mostrador de velocidade e um cadeado aberto. O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

Xiaomi MiMo-V2.6-Pro vs Grok 4.7: 30× mais barato por tarefa, e nenhum dos dois é rápido

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Xiaomi MiMo-V2.6-Pro e Grok 4.7 foram lançados em 21 de setembro de 2026, ambos ficam em 46 no Artificial Analysis Intelligence Index v4.3.2, e ambos são chamados de lentos pela página que os mediu — 43,6 tokens de saída por segundo para o MiMo-V2.6-Pro contra uma mediana de 67,1, 40 para o Grok 4.7 com esforço xhigh. O que os separa é quanto custa uma resposta. O valor por tarefa do avaliador é de US$ 0,13 para o checkpoint aberto chinês e US$ 3,74 para o modelo Grok 4.7, um fator de aproximadamente 29. Isso não é uma diferença de tarifa, ou não apenas uma: a tarifa de saída do Grok 4.7 é de US$ 6,00 por milhão de tokens contra US$ 0,87, o que é sete vezes, e o restante do múltiplo vem de quantos tokens cada modelo queima para chegar a uma resposta.

Dois modelos no mesmo mês, no mesmo índice, com a mesma pontuação, com preços como se pertencessem a décadas diferentes do mercado. A pergunta interessante não é qual deles vence. É qual parte desse 29× você consegue de fato contornar — porque, neste emparelhamento, exatamente um dos dois é uma rota que você pode comprar hoje, e é a mais cara.

Mesmo dia, mesmo placar, animais diferentes

Grok 4.7 foi lançado em 21 de setembro de 2026 por US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, com uma janela de contexto de 500.000 tokens, data de corte de conhecimento em maio de 2026, desconto de cache de 75% e entrada de texto e imagem com saída de texto. Ele registrou 46 no índice com esforço xhigh, 56 no Coding Agent Index no harness Grok Build e 1.657 Elo no AA-Briefcase — quarto lugar nesse ranking, atrás de três entradas da Anthropic, a aproximadamente metade do custo por tarefa do Claude Opus 5.

Xiaomi MiMo-V2.6-Pro é um checkpoint esparso de mistura de especialistas, com 1,02 trilhão de parâmetros totais e 42 bilhões ativos, com licença MIT, contexto de 1M tokens, entrada de texto, imagem, fala e vídeo com saída de texto, US$ 0,43 e US$ 0,87 por milhão de tokens, com um desconto de cache de 99% que reduz a taxa efetiva de entrada a quase nada em um prompt quente. A Artificial Analysis o coloca em primeiro lugar entre 114 modelos de pesos abertos no índice e em 12º entre 114 em custo. Ele é acessível por meio de três provedores de API. Ele não está nas nossas rotas, e não listamos um modelo antes que um provedor o tenha integrado.

A única linha que decide isso

• Custo por tarefa de índice — MiMo-V2.6-Pro $0,13; Grok 4.7 $3,74 — 29× • Preço de saída — MiMo-V2.6-Pro $0,87 / 1M; Grok 4.7 $6,00 / 1M — 6,9× • Tokens de saída na execução do índice — MiMo-V2.6-Pro 140M; Grok 4.7 240M, em comparação com uma mediana de 88M • Velocidade de saída — MiMo-V2.6-Pro 43,6 t/s; Grok 4.7 40 t/s — ambas abaixo da mediana • Janela de contexto — MiMo-V2.6-Pro 1M; Grok 4.7 500K • Pesos — MiMo-V2.6-Pro com licença MIT e disponível para download; Grok 4.7 proprietário, apenas via API

Leia os dois primeiros tópicos em conjunto e a forma da diferença fica clara. Ao preço de tabela, os dois estão a 6,9× de distância em termos de saída. Na execução do índice, estão a 29× de distância no que custa uma resposta. O fator multiplicador entre eles é a verbosidade: o Grok 4.7 gerou 240 milhões de tokens de saída contra uma mediana de 88 milhões para a sua classe, e o MiMo-V2.6-Pro gerou 140 milhões. Isso é uma penalização de 1,71× em tokens que se soma à penalização de 6,9× na tarifa, e 1,71 × 6,9 é 11,8 — o resto da distância até 29 vem do lado da entrada, onde o desconto de cache de 99% e a tarifa de entrada de $0,43 do MiMo-V2.6-Pro fazem o trabalho pesado numa carga de trabalho com qualquer prefixo repetido que seja.

A two-column scoreboard titled MiMo-V2.6-Pro vs Grok 4.7 - the scoreboard, subtitled Same index score, same month, 29x apart per task. The left column, Xiaomi MiMo-V2.6-Pro, reads Intelligence Index v4.3.2 46; cost per index task $0.13; list price $0.43 / $0.87 per 1M; output speed 43.6 tokens per second; 140M output tokens on the index run; 1M context; weights downloadable, and carries a tag reading Open weights - MIT. The right column, Grok 4.7 (xhigh), reads Intelligence Index v4.3.2 46; cost per index task $3.74; list price $2.00 / $6.00 per 1M; output speed 40 tokens per second; 240M output tokens; 500K context; weights not released, and carries a tag reading Proprietary - API only. A footer line reads that index scores, per-task cost, speed and token counts are per Artificial Analysis Intelligence Index v4.3.2, read 25 September 2026, and that both models shipped 21 September 2026. The OrcaRouter logo is composited in the bottom-right corner.

A verbosidade é o número que as pessoas deixam de fora da estimativa.

Modelos de custo geralmente são construídos a partir de uma tabela de preços e uma contagem de tokens presumida. Ambas as metades disso estão erradas aqui. A tabela de preços está errada porque o desconto de cache não é uma nota de rodapé — 99% contra 75% é a diferença entre um prompt de sistema custar dinheiro a cada chamada e custar quase nada. A contagem de tokens está errada porque os dois modelos não emitem o mesmo número de tokens para o mesmo trabalho, e o avaliador mediu a diferença: 240 milhões contra 140 milhões, uma variação de 1,71× em um benchmark idêntico.

Nenhum desses é um proxy que você possa ler em uma ficha técnica. O ranking de verbosidade do Grok 4.7 é #94 de 210 modelos em sua classe; o ranking de custo do MiMo-V2.6-Pro é #12 de 114 na dele. Uma equipe que cita a tabela de preços do Grok 4.7 e assume uma carga de trabalho neutra em tokens preverá aproximadamente um quarto do que o índice realmente gastou por tarefa. A correção não é, tampouco, usar o custo do índice como sua estimativa — ele é uma medição da forma de um único benchmark. É medir suas próprias contagens de tokens em ambos os lados antes de se comprometer, porque a diferença entre os dois modelos é de 6,9× no papel e 29× na prática, e apenas um desses números é real para o seu tráfego.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 25 September 2026. The header shows Intelligence rank 21 of 210, Speed 159 of 210, Cost 210 of 210, Verbosity 94 of 210, 46 on the Artificial Analysis Intelligence Index, $2.00 input and $6.00 output per 1M tokens with a 75% cache discount, $3.74 per task to evaluate on the Intelligence Index, and 500K context; the summary paragraph calls the model notably slow and very verbose, and the verbosity line shows 240M output tokens generated on the index run against a median of 88M.

Ambos são lentos, e isso não é um empate

A Artificial Analysis mediu o Grok 4.7 em 40 tokens de saída por segundo e o classifica como “um dos mais lentos”; o MiMo-V2.6-Pro em 43,6 e o classifica como “notavelmente lento”. Essas duas leituras são próximas o suficiente para que a velocidade não deva ser o critério de desempate entre eles. Mas as medianas por trás delas não são: 67,1 para o campo de pesos abertos no qual o MiMo-V2.6-Pro se insere. Ambos os modelos estão bem abaixo dela, e o MiMo-V2.6-Pro também carrega um tempo até o primeiro token de 3,17 segundos contra uma mediana de 2,31 segundos, que é o número que dói em um ciclo interativo, e não em um de lote.

Portanto, o resumo honesto do lado da latência é que 29× mais barato não lhe proporciona um produto mais rápido; proporciona um mais lento que custa menos — e, se os seus usuários estiverem olhando para um cursor, a espera de 3,17 segundos pode custar mais do que os tokens economizados. Para trabalho em lote durante a noite, avaliação offline ou qualquer pipeline em que o relógio seja medido em horas, a troca é direta e o 29× é praticamente de graça.

O que um roteador pode e não pode fazer com este pareamento

Este é o pareamento em que nosso próprio catálogo é genuinamente unilateral, e vale a pena ser franco sobre isso. Grok 4.7 está disponível no OrcaRouter como grok/grok-4.7 ao preço de $2.00 / $6.00 do próprio provedor, com saída máxima de 450K e um endpoint compatível com o SDK da OpenAI em https://api.orcarouter.ai/v1 — então, se a comparação fizer você querer o modelo da xAI por trás da mesma chave usada por todo o resto, essa rota existe hoje. Xiaomi MiMo-V2.6-Pro não está nas nossas rotas; para esse lado, a API do próprio fornecedor ou qualquer um dos seus três provedores listados que você já usa é a resposta, e não vamos fingir o contrário.

Onde um roteador justifica o seu lugar numa comparação como esta é nas partes que não são o modelo. Uma única chave para mais de 200 modelos ao preço de tabela de cada fornecedor, com 0% de margem, significa que um corte de preço do fornecedor chega à sua fatura no mesmo dia, em vez de só na próxima renovação de contrato. O failover automático significa que a degradação da rota de 40 t/s não leva o seu pipeline junto. A DSL de roteamento permite que a divisão seja feita com base no custo publicado por tarefa, em vez de na fidelidade à marca — modelo barato para o alto volume, modelo potente para as chamadas difíceis, decidido por solicitação. E, para as cargas de trabalho em que nenhum dos modelos é totalmente adequado, a fusão de modelos pode executar vários por trás de uma única chamada.

Screenshot of the OrcaRouter model page for Grok 4.7, captured 25 September 2026. The page shows the model id grok/grok-4.7, a maximum output of 450K, output text, public benchmarks by grok dated 2026-09-21, a price of $2.00 per 1M input and $6.00 per 1M output, and an OpenAI-SDK-compatible code sample whose base URL is https://api.orcarouter.ai/v1 and whose model field is grok/grok-4.7.

Perguntas que esta comparação costuma levantar

O 29× se mantém para minha carga de trabalho? Somente se seu mix de tokens se assemelhar ao da execução do índice. Se suas saídas forem curtas e seus prompts forem longos e armazenados em cache, o múltiplo colapsa em direção à diferença de taxa de 6,9× na saída e aumenta na entrada, onde o desconto de 99% do MiMo-V2.6-Pro é o termo decisivo. Se suas saídas forem traços de raciocínio longos, ele se amplia além de 29×, porque a penalidade de verbosidade do Grok 4.7 é proporcional ao comprimento da saída.

O 46 de cada lado é o mesmo 46? É o mesmo índice, a mesma versão e a mesma escala — as subpontuações subjacentes eram 46,32 e 46,45, uma diferença de 0,13 ponto, e o índice arredonda ambos para 46. A Artificial Analysis não publica detalhamentos por avaliação para nenhum dos modelos, então o composto é o nível mais granular disponível e uma diferença de 0,13 ponto não deve ser interpretada como uma classificação de capacidade.

Qual deles um novo projeto deve usar por padrão? Se a carga de trabalho for em lote, tolerante à latência e sensível a custos, o MiMo-V2.6-Pro a $0,13 por tarefa é o padrão, e os pesos abertos significam que você não fica exposto ao preço de um único provedor. Se você precisa especificamente do modelo da xAI — os resultados do Grok Build harness, a colocação no AA-Briefcase, os 500K de contexto com data de corte em maio de 2026 —, o Grok 4.7 é uma rota ativa no OrcaRouter hoje, e o prêmio por tarefa é o preço dessa capacidade específica. Não há modelo aqui que vença nos dois casos.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente