Um cartão de título gerado comparando Xiaomi MiMo-V2.6-Pro e Grok 4.6 em alto esforço. O cartão da esquerda exibe Intelligence Index v4.3.2: 46, janela de contexto: 1M tokens, $0,43 entrada / $0,87 saída por 1M, e 134,3 tokens por segundo; o cartão da direita exibe Intelligence Index v4.3.2: 44, janela de contexto: 500K tokens, $2,00 entrada / $6,00 saída por 1M, e 63,0 tokens por segundo. Um rodapé exibe: Ambas as pontuações no Artificial Analysis Intelligence Index v4.3.2. Os números do DeepSWE são executados pelo fornecedor e não são comparáveis. O logotipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

MiMo-V2.6-Pro vs Grok 4.6: Ambos os fornecedores publicaram números do DeepSWE, e nenhum deles está no quadro

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois fornecedores, um benchmark, dois números que não podem ser subtraídos. O material de lançamento da SpaceXAI para o Grok 4.6 relata 65,9% no DeepSWE v1.1. O material da Xiaomi para o MiMo-V2.6-Pro relata 72,57 no DeepSWE v1.1. Lidos juntos, eles sugerem que o modelo mais barato de pesos abertos supera o modelo proprietário de fronteira em quase sete pontos. Lidos com atenção, eles não dizem quase nada, porque um é uma porcentagem de apresentação de lançamento no harness do próprio fornecedor e o outro é uma média de três de uma execução de aprendizado por reforço no avaliador da própria Xiaomi, e nenhum dos dois foi submetido ao painel público do DeepSWE. A comparação entre MiMo-V2.6-Pro e Grok 4.6 que resiste ao escrutínio está no índice independente, e aí a resposta é o inverso dos números dos fornecedores: 46 contra 44, a favor da Xiaomi, por dois pontos.

O Grok 4.6 foi lançado em 12 de agosto de 2026 pela SpaceXAI e é o incumbente aqui — um modelo de fronteira já lançado e amplamente disponibilizado, com uma tabela de preços documentada e meses de medição independente por trás dele. O Xiaomi MiMo-V2.6-Pro passou a estar disponível em geral em 22 de setembro de 2026, com seus repositórios de checkpoint de aprendizado por reforço surgindo no dia anterior, e é o recém-chegado. Ambos são capazes de raciocínio, ambos são construídos para trabalho agêntico de longa duração, e a diferença de preço entre eles é grande o suficiente para que a inexperiência do recém-chegado seja a única coisa que impede a comparação de avançar.

O que cada modelo realmente é

Grok 4.6 é proprietário, aceita entrada de texto e imagem e devolve texto, e tem uma data de corte de conhecimento em 1º de fevereiro de 2026. A sua janela de contexto é de 500.000 tokens, o que corresponde a metade da dos seus principais concorrentes e é a especificação mais decisiva da sua ficha técnica. As suas tarifas de tabela são $2,00 por milhão de tokens de entrada, $0,50 por milhão de tokens de entrada em cache e $6,00 por milhão de tokens de saída abaixo de 200.000 tokens de prompt, com um salto abrupto nesse limite: em 200K ou acima, as tarifas passam a $4,00, $1,00 e $12,00, e o nível mais elevado cobra a solicitação inteira, em vez da parte que ultrapassa o limite. O processamento prioritário duplica a tarifa padrão. A Artificial Analysis mediu 63,0 tokens de saída por segundo e 42,79 segundos até o primeiro token com esforço máximo, e $2.351,83 para executar o índice completo.

Xiaomi MiMo-V2.6-Pro é um modelo esparso de mistura de especialistas com 1,02 trilhão de parâmetros totais e 42 bilhões ativados por token, com uma janela de contexto de 1M tokens e multimodalidade nativa em texto, imagem, vídeo e áudio. Ele tem licença MIT e pesos disponíveis para download, e a Xiaomi manteve o preço da geração anterior em vez de reajustar o novo checkpoint para cima — US$ 0,43 por milhão de tokens de entrada e US$ 0,87 por milhão de saída, desconto de cache de 99%, e um custo combinado de US$ 0,18 em uma proporção de 7:2:1 de acerto de cache/entrada/saída. A Artificial Analysis mediu 134,3 tokens de saída por segundo, 2,15 segundos até o primeiro token e US$ 206,66 para executar o índice — US$ 0,13 por tarefa.

• Pesos — MiMo-V2.6-Pro com licença MIT e disponível para download; Grok 4.6 proprietário, somente via API

• Parâmetros — MiMo-V2.6-Pro 1,02T no total / 42B ativos; Grok 4.6 não divulgado

• Contexto — MiMo-V2.6-Pro 1M tokens; Grok 4.6 500K, com um salto abrupto de preço ao atingir 200K de entrada

• Modalidade — MiMo-V2.6-Pro aceita texto, imagem, vídeo e áudio; a superfície de entrada publicada do Grok 4.6 é texto e imagem

• Pontuação do índice — MiMo-V2.6-Pro 46; Grok 4.6 44, ambos Artificial Analysis v4.3.2

• Preço de tabela — MiMo-V2.6-Pro $0,43 / $0,87 por 1M; Grok 4.6 $2,00 / $6,00, dobrando acima de 200K de entrada

• Taxa combinada — MiMo-V2.6-Pro $0,18 por 1M; Grok 4.6 $1,35

• Custo para executar o índice — MiMo-V2.6-Pro US$ 206,66; Grok 4.6 US$ 2.351,83

• Velocidade — MiMo-V2.6-Pro 134,3 tokens de saída/segundo; Grok 4.6 63,0

• Tempo até o primeiro token — MiMo-V2.6-Pro 2,15 segundos; Grok 4.6 42,79 segundos

• Data de corte do conhecimento — MiMo-V2.6-Pro não publicado; Grok 4.6 1 de fevereiro de 2026

A two-column scoreboard titled MiMo-V2.6-Pro vs Grok 4.6, subtitled Two vendor DeepSWE figures, neither submitted to the public board. The left column, Xiaomi MiMo-V2.6-Pro, reads Intelligence Index v4.3.2 46; list price $0.43 / $0.87 per 1M; context window 1M tokens; speed 134.3 tokens per second; DeepSWE v1.1 72.57 vendor-run, avg@3; public DeepSWE entry none. The right column, Grok 4.6 (high), reads Intelligence Index v4.3.2 44; list price $2.00 / $6.00 per 1M; context window 500K tokens; speed 63.0 tokens per second; DeepSWE v1.1 65.9% vendor-reported; public DeepSWE entry ~67% submitted. A footer notes the two DeepSWE figures come from different vendor harnesses with different metrics and must not be subtracted, and that Grok 4.6 list rates double at or above 200K input tokens. The OrcaRouter logo is composited in the bottom-right corner.

O benchmark que ambos os fornecedores executaram, e por que ele não é comparável

DeepSWE v1.1 é uma avaliação de agente de codificação real, pública e de terceiros, conduzida pela Datacurve, e é a família de tarefas em relação à qual as duas empresas optaram por publicar. Isso a torna tentadora. Ela não deve ser usada como uma comparação direta, e o motivo não é que algum dos fornecedores esteja mentindo — é que os dois números descrevem medições diferentes da mesma tarefa.

O 72,57 da Xiaomi é uma média de três em seu próprio harness com mini-swe-agent, produzido durante uma execução de aprendizado por reforço, e não a partir de um candidato de lançamento congelado, e relatado junto com um número inicial de 58,4. A execução está documentada como 30 etapas e cerca de 750.000 trajetórias por modelo, concluída em menos de seis dias a um gasto publicado de cerca de US$ 2,62 milhões para o modelo Pro. Não foi submetido ao painel da Datacurve. Os 65,9% da SpaceXAI para o Grok 4.6 são um número de deck de lançamento do próprio conjunto de avaliação do fornecedor, relatado ao lado de ganhos sobre o Grok 4.5 de 11,9 pontos no mesmo benchmark — e o painel público contém uma configuração submetida do Grok 4.6 em torno de 67%, o que é próximo o suficiente do número do fornecedor para sugerir que o harness está pelo menos aproximadamente alinhado. Isso não é verdade para o número da Xiaomi, que não tem nenhuma contraparte pública.

Então a declaração honesta é esta: no ranking público, o Grok 4.6 está presente e o MiMo-V2.6-Pro está ausente. No composto independente, ambos foram de fato avaliados pelo mesmo avaliador, e o modelo da Xiaomi lidera por dois pontos. Esses dois fatos não estão em conflito. Eles simplesmente medem coisas diferentes, e o segundo é o que deve ser citado.

O contexto de 500K é a especificação que decide cargas de trabalho reais

Meio milhão de tokens é uma janela de contexto grande segundo qualquer padrão normal e pequena para 2026. Os modelos com os quais o MiMo-V2.6-Pro é agrupado estão todos em 1M, e a consequência prática aparece exatamente nas cargas de trabalho para as quais o Grok 4.6 é comercializado. Um agente de programação de longa duração que mantém um repositório, um registro de ferramentas e um plano acumulado ultrapassará 200.000 tokens de prompt numa sessão — e, nesse limite, as tarifas do Grok 4.6 dobram e se aplicam retroativamente a toda a solicitação. A mesma sessão no MiMo-V2.6-Pro chega a um milhão de tokens sem mudança de faixa.

Isso é uma diferença de especificação e uma diferença na estrutura de preços ao mesmo tempo, e a segunda é fácil de passar despercebida ao comparar tarifas anunciadas. Um preço combinado de US$ 1,35 para o Grok 4.6 contra US$ 0,18 para o MiMo-V2.6-Pro representa uma diferença de 7,5x. Em um prompt que ultrapassa 200K, ela se amplia para algo mais próximo de 15x, porque a tarifa do Grok dobra e a da Xiaomi não se altera.

O contra-argumento também está registrado, e merece estar. A tese de lançamento do Grok 4.6 era a eficiência de turnos, e não o contexto bruto: na avaliação agêntica em que foi comparado ao Claude Opus 5 em tarefas idênticas, ele terminou em cerca de 53 turnos e aproximadamente 500 milhões de tokens de entrada, contra cerca de 103 turnos e dois bilhões de tokens do outro modelo, a um custo estimado de US$ 0,84 por tarefa — o menor valor entre os modelos de fronteira naquela comparação. Um modelo que percorre o ciclo metade das vezes não precisa de tanto contexto, e não queima tantos tokens. Essa é uma vantagem arquitetural genuína e é o argumento mais forte a favor do Grok 4.6 contra qualquer alternativa mais barata por token, incluindo esta.

Screenshot of the Artificial Analysis model page for Xiaomi MiMo-V2.6-Pro, captured 22 September 2026. The header reads 46 Artificial Analysis Intelligence Index, ranked first of 114 in its class; 134.3 output tokens per second, ranked eleventh of 114; $0.435 input and $0.87 output per 1M tokens with a 99% cache discount; $0.13 cost per Intelligence Index task, ranked twelfth of 114; and 140M output tokens from the Intelligence Index. Technical specifications list reasoning Yes, input modality text, image, speech and video, output modality text, a 1M-token context window, 1.0T total parameters, 42B active parameters, an MIT licence and Hugging Face model weights, under a breadcrumb reading Xiaomi, Open weights model, Released September 2026. A comparison summary notes it cost $206.66 to evaluate MiMo-V2.6-Pro on the Intelligence Index.

Chegando a cada um deles

O Grok 4.6 está no OrcaRouter como grok/grok-4.6, acessível por meio de um único endpoint compatível com OpenAI ao preço de tabela do provedor, com 0% de markup — assim, uma mudança de preço da SpaceXAI, incluindo uma alteração naquele limiar de 200K, entra em vigor do nosso lado no mesmo dia. O Xiaomi MiMo-V2.6-Pro não está no OrcaRouter. Nenhum modelo Xiaomi está, e a rota até ele hoje é a própria plataforma da Xiaomi ou um dos catálogos de terceiros que o listam. Dizer isso com clareza é mais útil do que deixar uma página de modelo sugerir o contrário.

O que essa assimetria vale na prática é um experimento barato. O Grok 4.6 é o modelo pelo qual você talvez já esteja pagando. O MiMo-V2.6-Pro é uma melhoria de dois pontos no índice a uma fração do preço, lançado esta semana, com uma única rota de serviço por trás dele. A pergunta que vale a pena responder não é qual é melhor em abstrato, mas quanto do seu tráfego do Grok o modelo da Xiaomi consegue assumir com os seus próprios prompts — e responder a isso abrindo um segundo contrato, uma segunda chave e uma segunda relação de faturamento é o atrito que impede o teste de acontecer. Com um único endpoint e failover automático entre provedores, a comparação é uma mudança de configuração, e a metade do failover importa mais do que o habitual aqui: um modelo que foi lançado esta semana e estava listado por um único provedor de API quando o Artificial Analysis o registrou não é algo para colocar num caminho de produção sem uma via para a qual recorrer.

Screenshot of the OrcaRouter model page for Grok 4.6, captured 22 September 2026, showing the breadcrumb Home > Models > SpaceXAI > Grok 4.6, the model id grok/grok-4.6 dated 2026-08-12, the Vision, Tools, JSON and Reasoning capability badges, and the on-this-page index for code samples, pricing, performance, public benchmarks, community buzz, comparisons and FAQ. The rate card sits below the visible area of the capture.

Qual escolher

Escolha o Grok 4.6 quando a eficiência de turnos for o que você está otimizando — loops longos de agente, em que a capacidade do modelo de terminar na metade das etapas vale mais do que sua taxa por token — ou quando você quiser um modelo com meses de medição independente por trás dele, em vez de uma semana. Seus 63 tokens por segundo e tempo até o primeiro token de 42,79 segundos o tornam um modelo para cargas de trabalho em lote e offline em termos interativos, e seu contexto de 500K com um salto de preço em 200K argumenta em favor de manter os prompts curtos.

Escolha o MiMo-V2.6-Pro quando estiver executando loops repetitivos e com muito contexto que ultrapassariam o limite de 200K do Grok, quando precisar de latência do primeiro token baixa o suficiente para um humano esperar, quando quiser os pesos na sua própria infraestrutura, ou quando o volume fizer a diferença de taxa combinada de 7,5x ser o número decisivo. Sua vantagem de dois pontos no índice é pequena o suficiente para que não deva ser o motivo por si só; o custo de US$ 206,66 contra US$ 2.351,83 para executar a mesma suíte de avaliação é um motivo melhor.

O que resolveria a questão em aberto é uma configuração DeepSWE submetida para o MiMo-V2.6-Pro. O Grok 4.6 já tem uma. No momento em que o modelo da Xiaomi aparecer no ranking público com um harness declarado, um intervalo de confiança e um custo por tarefa, o 72,57 deixa de ser um número de fornecedor e a comparação acima se torna real — e, dada a diferença de dois pontos no índice, ela pode pender para qualquer um dos lados.

O OrcaRouter coloca mais de 200 modelos por trás de um único endpoint compatível com OpenAI pelo preço de tabela do provedor, com 0% de markup, então uma mudança de preço do fornecedor entra em vigor no mesmo dia.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente