
MiMo-V2.6-Pro vs Grok 4.6: Ambos os fornecedores publicaram números do DeepSWE, e nenhum deles está no quadro
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dois fornecedores, um benchmark, dois números que não podem ser subtraídos. O material de lançamento da SpaceXAI para o Grok 4.6 relata 65,9% no DeepSWE v1.1. O material da Xiaomi para o MiMo-V2.6-Pro relata 72,57 no DeepSWE v1.1. Lidos juntos, eles sugerem que o modelo mais barato de pesos abertos supera o modelo proprietário de fronteira em quase sete pontos. Lidos com atenção, eles não dizem quase nada, porque um é uma porcentagem de apresentação de lançamento no harness do próprio fornecedor e o outro é uma média de três de uma execução de aprendizado por reforço no avaliador da própria Xiaomi, e nenhum dos dois foi submetido ao painel público do DeepSWE. A comparação entre MiMo-V2.6-Pro e Grok 4.6 que resiste ao escrutínio está no índice independente, e aí a resposta é o inverso dos números dos fornecedores: 46 contra 44, a favor da Xiaomi, por dois pontos.
O Grok 4.6 foi lançado em 12 de agosto de 2026 pela SpaceXAI e é o incumbente aqui — um modelo de fronteira já lançado e amplamente disponibilizado, com uma tabela de preços documentada e meses de medição independente por trás dele. O Xiaomi MiMo-V2.6-Pro passou a estar disponível em geral em 22 de setembro de 2026, com seus repositórios de checkpoint de aprendizado por reforço surgindo no dia anterior, e é o recém-chegado. Ambos são capazes de raciocínio, ambos são construídos para trabalho agêntico de longa duração, e a diferença de preço entre eles é grande o suficiente para que a inexperiência do recém-chegado seja a única coisa que impede a comparação de avançar.
O que cada modelo realmente é
Grok 4.6 é proprietário, aceita entrada de texto e imagem e devolve texto, e tem uma data de corte de conhecimento em 1º de fevereiro de 2026. A sua janela de contexto é de 500.000 tokens, o que corresponde a metade da dos seus principais concorrentes e é a especificação mais decisiva da sua ficha técnica. As suas tarifas de tabela são $2,00 por milhão de tokens de entrada, $0,50 por milhão de tokens de entrada em cache e $6,00 por milhão de tokens de saída abaixo de 200.000 tokens de prompt, com um salto abrupto nesse limite: em 200K ou acima, as tarifas passam a $4,00, $1,00 e $12,00, e o nível mais elevado cobra a solicitação inteira, em vez da parte que ultrapassa o limite. O processamento prioritário duplica a tarifa padrão. A Artificial Analysis mediu 63,0 tokens de saída por segundo e 42,79 segundos até o primeiro token com esforço máximo, e $2.351,83 para executar o índice completo.
Xiaomi MiMo-V2.6-Pro é um modelo esparso de mistura de especialistas com 1,02 trilhão de parâmetros totais e 42 bilhões ativados por token, com uma janela de contexto de 1M tokens e multimodalidade nativa em texto, imagem, vídeo e áudio. Ele tem licença MIT e pesos disponíveis para download, e a Xiaomi manteve o preço da geração anterior em vez de reajustar o novo checkpoint para cima — US$ 0,43 por milhão de tokens de entrada e US$ 0,87 por milhão de saída, desconto de cache de 99%, e um custo combinado de US$ 0,18 em uma proporção de 7:2:1 de acerto de cache/entrada/saída. A Artificial Analysis mediu 134,3 tokens de saída por segundo, 2,15 segundos até o primeiro token e US$ 206,66 para executar o índice — US$ 0,13 por tarefa.
• Pesos — MiMo-V2.6-Pro com licença MIT e disponível para download; Grok 4.6 proprietário, somente via API
• Parâmetros — MiMo-V2.6-Pro 1,02T no total / 42B ativos; Grok 4.6 não divulgado
• Contexto — MiMo-V2.6-Pro 1M tokens; Grok 4.6 500K, com um salto abrupto de preço ao atingir 200K de entrada
• Modalidade — MiMo-V2.6-Pro aceita texto, imagem, vídeo e áudio; a superfície de entrada publicada do Grok 4.6 é texto e imagem
• Pontuação do índice — MiMo-V2.6-Pro 46; Grok 4.6 44, ambos Artificial Analysis v4.3.2
• Preço de tabela — MiMo-V2.6-Pro $0,43 / $0,87 por 1M; Grok 4.6 $2,00 / $6,00, dobrando acima de 200K de entrada
• Taxa combinada — MiMo-V2.6-Pro $0,18 por 1M; Grok 4.6 $1,35
• Custo para executar o índice — MiMo-V2.6-Pro US$ 206,66; Grok 4.6 US$ 2.351,83
• Velocidade — MiMo-V2.6-Pro 134,3 tokens de saída/segundo; Grok 4.6 63,0
• Tempo até o primeiro token — MiMo-V2.6-Pro 2,15 segundos; Grok 4.6 42,79 segundos
• Data de corte do conhecimento — MiMo-V2.6-Pro não publicado; Grok 4.6 1 de fevereiro de 2026

O benchmark que ambos os fornecedores executaram, e por que ele não é comparável
DeepSWE v1.1 é uma avaliação de agente de codificação real, pública e de terceiros, conduzida pela Datacurve, e é a família de tarefas em relação à qual as duas empresas optaram por publicar. Isso a torna tentadora. Ela não deve ser usada como uma comparação direta, e o motivo não é que algum dos fornecedores esteja mentindo — é que os dois números descrevem medições diferentes da mesma tarefa.
O 72,57 da Xiaomi é uma média de três em seu próprio harness com mini-swe-agent, produzido durante uma execução de aprendizado por reforço, e não a partir de um candidato de lançamento congelado, e relatado junto com um número inicial de 58,4. A execução está documentada como 30 etapas e cerca de 750.000 trajetórias por modelo, concluída em menos de seis dias a um gasto publicado de cerca de US$ 2,62 milhões para o modelo Pro. Não foi submetido ao painel da Datacurve. Os 65,9% da SpaceXAI para o Grok 4.6 são um número de deck de lançamento do próprio conjunto de avaliação do fornecedor, relatado ao lado de ganhos sobre o Grok 4.5 de 11,9 pontos no mesmo benchmark — e o painel público contém uma configuração submetida do Grok 4.6 em torno de 67%, o que é próximo o suficiente do número do fornecedor para sugerir que o harness está pelo menos aproximadamente alinhado. Isso não é verdade para o número da Xiaomi, que não tem nenhuma contraparte pública.
Então a declaração honesta é esta: no ranking público, o Grok 4.6 está presente e o MiMo-V2.6-Pro está ausente. No composto independente, ambos foram de fato avaliados pelo mesmo avaliador, e o modelo da Xiaomi lidera por dois pontos. Esses dois fatos não estão em conflito. Eles simplesmente medem coisas diferentes, e o segundo é o que deve ser citado.
O contexto de 500K é a especificação que decide cargas de trabalho reais
Meio milhão de tokens é uma janela de contexto grande segundo qualquer padrão normal e pequena para 2026. Os modelos com os quais o MiMo-V2.6-Pro é agrupado estão todos em 1M, e a consequência prática aparece exatamente nas cargas de trabalho para as quais o Grok 4.6 é comercializado. Um agente de programação de longa duração que mantém um repositório, um registro de ferramentas e um plano acumulado ultrapassará 200.000 tokens de prompt numa sessão — e, nesse limite, as tarifas do Grok 4.6 dobram e se aplicam retroativamente a toda a solicitação. A mesma sessão no MiMo-V2.6-Pro chega a um milhão de tokens sem mudança de faixa.
Isso é uma diferença de especificação e uma diferença na estrutura de preços ao mesmo tempo, e a segunda é fácil de passar despercebida ao comparar tarifas anunciadas. Um preço combinado de US$ 1,35 para o Grok 4.6 contra US$ 0,18 para o MiMo-V2.6-Pro representa uma diferença de 7,5x. Em um prompt que ultrapassa 200K, ela se amplia para algo mais próximo de 15x, porque a tarifa do Grok dobra e a da Xiaomi não se altera.
O contra-argumento também está registrado, e merece estar. A tese de lançamento do Grok 4.6 era a eficiência de turnos, e não o contexto bruto: na avaliação agêntica em que foi comparado ao Claude Opus 5 em tarefas idênticas, ele terminou em cerca de 53 turnos e aproximadamente 500 milhões de tokens de entrada, contra cerca de 103 turnos e dois bilhões de tokens do outro modelo, a um custo estimado de US$ 0,84 por tarefa — o menor valor entre os modelos de fronteira naquela comparação. Um modelo que percorre o ciclo metade das vezes não precisa de tanto contexto, e não queima tantos tokens. Essa é uma vantagem arquitetural genuína e é o argumento mais forte a favor do Grok 4.6 contra qualquer alternativa mais barata por token, incluindo esta.

Chegando a cada um deles
O Grok 4.6 está no OrcaRouter como grok/grok-4.6, acessível por meio de um único endpoint compatível com OpenAI ao preço de tabela do provedor, com 0% de markup — assim, uma mudança de preço da SpaceXAI, incluindo uma alteração naquele limiar de 200K, entra em vigor do nosso lado no mesmo dia. O Xiaomi MiMo-V2.6-Pro não está no OrcaRouter. Nenhum modelo Xiaomi está, e a rota até ele hoje é a própria plataforma da Xiaomi ou um dos catálogos de terceiros que o listam. Dizer isso com clareza é mais útil do que deixar uma página de modelo sugerir o contrário.
O que essa assimetria vale na prática é um experimento barato. O Grok 4.6 é o modelo pelo qual você talvez já esteja pagando. O MiMo-V2.6-Pro é uma melhoria de dois pontos no índice a uma fração do preço, lançado esta semana, com uma única rota de serviço por trás dele. A pergunta que vale a pena responder não é qual é melhor em abstrato, mas quanto do seu tráfego do Grok o modelo da Xiaomi consegue assumir com os seus próprios prompts — e responder a isso abrindo um segundo contrato, uma segunda chave e uma segunda relação de faturamento é o atrito que impede o teste de acontecer. Com um único endpoint e failover automático entre provedores, a comparação é uma mudança de configuração, e a metade do failover importa mais do que o habitual aqui: um modelo que foi lançado esta semana e estava listado por um único provedor de API quando o Artificial Analysis o registrou não é algo para colocar num caminho de produção sem uma via para a qual recorrer.

Qual escolher
Escolha o Grok 4.6 quando a eficiência de turnos for o que você está otimizando — loops longos de agente, em que a capacidade do modelo de terminar na metade das etapas vale mais do que sua taxa por token — ou quando você quiser um modelo com meses de medição independente por trás dele, em vez de uma semana. Seus 63 tokens por segundo e tempo até o primeiro token de 42,79 segundos o tornam um modelo para cargas de trabalho em lote e offline em termos interativos, e seu contexto de 500K com um salto de preço em 200K argumenta em favor de manter os prompts curtos.
Escolha o MiMo-V2.6-Pro quando estiver executando loops repetitivos e com muito contexto que ultrapassariam o limite de 200K do Grok, quando precisar de latência do primeiro token baixa o suficiente para um humano esperar, quando quiser os pesos na sua própria infraestrutura, ou quando o volume fizer a diferença de taxa combinada de 7,5x ser o número decisivo. Sua vantagem de dois pontos no índice é pequena o suficiente para que não deva ser o motivo por si só; o custo de US$ 206,66 contra US$ 2.351,83 para executar a mesma suíte de avaliação é um motivo melhor.
O que resolveria a questão em aberto é uma configuração DeepSWE submetida para o MiMo-V2.6-Pro. O Grok 4.6 já tem uma. No momento em que o modelo da Xiaomi aparecer no ranking público com um harness declarado, um intervalo de confiança e um custo por tarefa, o 72,57 deixa de ser um número de fornecedor e a comparação acima se torna real — e, dada a diferença de dois pontos no índice, ela pode pender para qualquer um dos lados.
O OrcaRouter coloca mais de 200 modelos por trás de um único endpoint compatível com OpenAI pelo preço de tabela do provedor, com 0% de markup, então uma mudança de preço do fornecedor entra em vigor no mesmo dia.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
