Cartão hero do radar de modelos OrcaRouter para a comparação entre MiMo-V2.6-Pro e DeepSeek V4 Pro, com o subtítulo 'Dois flagships abertos, dez pontos de índice de diferença.', com um painel por modelo e um rodapé indicando que ambos têm licença MIT e uma janela de contexto de 1M tokens, e que as pontuações são da v4.3.2 e não são comparáveis a versões anteriores do índice.
Guides & Insights

MiMo-V2.6-Pro vs DeepSeek V4 Pro: Dois Flagships Abertos, Separados por Dez Pontos no Índice

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Xiaomi MiMo-V2.6-Pro e DeepSeek V4 Pro são o mesmo tipo de objeto — flagships chineses de mistura de especialistas com trilhões de parâmetros, licença MIT, contexto de 1M de tokens, pesos abertos que você pode baixar hoje — e estão a dez pontos de distância no Artificial Analysis Intelligence Index v4.3.2, 46 contra 36. Eles também discordam sobre para que serve um flagship. DeepSeek V4 Pro, lançado em 13 de agosto de 2026, é um modelo de raciocínio apenas de texto: 1,6 trilhão de parâmetros com 49 bilhões ativos, e nenhuma entrada de visão, áudio ou vídeo em qualquer lugar de sua superfície publicada. Xiaomi MiMo-V2.6-Pro, lançado em 21 de setembro de 2026, tem 1,02 trilhão de parâmetros com 42 bilhões ativos e aceita texto, imagem, vídeo e áudio. Essa diferença determina mais implantações do que os dez pontos, e é a primeira coisa a resolver antes de comparar qualquer outra coisa.

Mesma licença, máquinas diferentes

Comece pelo que é genuinamente idêntico, porque é mais do que você esperaria entre dois laboratórios concorrentes. Ambos são distribuídos sob uma etiqueta de licença MIT em repositórios públicos, o que significa implantação comercial, modificação e treinamento adicional sem uma barreira de receita ou uma cláusula de campo de uso. Ambos alegam uma janela de contexto de 1M de tokens. Ambos são designs de mistura esparsa de especialistas — a arquitetura tornou-se o padrão nessa escala, não um diferencial. E ambos foram treinados por laboratórios que publicam menos sobre método do que os laboratórios de fronteira ocidentais.

• Parâmetros — MiMo-V2.6-Pro 1,02T no total / 42B ativos; DeepSeek V4 Pro 1,6T no total / 49B ativos

• Modalidade de entrada — MiMo-V2.6-Pro texto, imagem, vídeo, áudio; DeepSeek V4 Pro somente texto

• Contexto — 1M de tokens em ambos; o DeepSeek V4 Pro limita a saída a 384K tokens

• Pontuação do índice — MiMo-V2.6-Pro 46 no Intelligence Index v4.3.2; DeepSeek V4 Pro 36 na mesma versão

• Custo por tarefa do Index — MiMo-V2.6-Pro $0.13; DeepSeek V4 Pro $0.67

• Tarifa listada — MiMo-V2.6-Pro $0.43 / $0.87 por 1M de tokens; DeepSeek V4 Pro $1.32 / $3.96 conforme listado pela Artificial Analysis, antes do próprio cronograma de pico/fora de pico da DeepSeek

• Velocidade — MiMo-V2.6-Pro 134,3 tokens de saída/segundo; DeepSeek V4 Pro 97,4

• Tempo até o primeiro token — MiMo-V2.6-Pro 2,15 s; DeepSeek V4 Pro 1,62 s

Leia essa lista duas vezes, porque duas linhas são contra-intuitivas. O modelo menor pontua dez pontos a mais — 42 bilhões de parâmetros ativos superando 49 bilhões não é uma diferença de arredondamento, é um resultado de pós-treinamento, e é o sinal mais claro nesta comparação de que a qualidade do aprendizado por reforço ultrapassou a escala bruta como alavanca. E o modelo mais barato também é o mais rápido, tanto em throughput quanto em custo por tarefa, o que é o oposto da troca usual. A Xiaomi não está vendendo um desconto em troca de paciência. A vantagem da DeepSeek é o tempo até o primeiro token, 1,62 segundos contra 2,15 — real, mas a única categoria em que o V4 Pro lidera.

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists 1.02T total and 42B active parameters, text, image, video and audio input, a 1M-token context window, Intelligence Index v4.3.2 score 46, a listed rate of $0.43 / $0.87 per million tokens, $0.13 per index task, 134.3 tokens per second with 2.15 seconds to first token, and a release date of 21 September 2026. The DeepSeek V4 Pro column lists 1.6T total and 49B active parameters, text-only input, a 1M-token context window with output capped at 384K, index score 36, a listed rate of $1.32 / $3.96, $0.67 per index task, 97.4 tokens per second with 1.62 seconds to first token, and a release date of 13 August 2026.

Por que a mesma versão do índice importa aqui

Comparar modelos de pesos abertos entre revisões do índice é o motivo pelo qual a maioria das comparações publicadas dá errado, portanto o número da versão não é um detalhe sem importância. A Artificial Analysis reconstruiu o Intelligence Index como v4.3 em setembro de 2026, e as pontuações mudaram substancialmente nessa transição — o Claude Opus 5 perdeu três pontos entre v4.2 e v4.3, e o campo de pesos abertos se reordenou. Ambos os valores acima são v4.3.2, o que significa que o 46 e o 36 são diretamente comparáveis entre si. Eles não são comparáveis aos números mais antigos que você encontrará citados em outros lugares para qualquer um dos dois modelos.

Isso não é uma hipótese. O DeepSeek V4 Pro foi amplamente noticiado com 53 em uma escala de índice anterior, em agosto de 2026, e nossa própria cobertura desse período o trazia assim. Na v4.3.2, o mesmo modelo marca 36. Nada mudou no modelo; a régua mudou. Se você tem uma planilha com 53 ao lado de um 46 para o MiMo-V2.6-Pro, você tem uma comparação que vai apontar para o modelo errado. O pareamento correto é 46 contra 36, e a conclusão correta é que o modelo lançado cinco semanas depois, com dois terços do número de parâmetros, está materialmente à frente.

A lacuna de relatórios entre os dois laboratórios

Existe uma segunda diferença, mais sutil, e ela diz respeito ao que cada laboratório está disposto a permitir que seja verificado.

O 46 do MiMo-V2.6-Pro é uma medição da Artificial Analysis. A empresa de avaliação executou sua própria suíte — dez avaliações abrangendo raciocínio, conhecimento, matemática e programação — no modelo lançado e publicou o resultado, junto com os números operacionais: 134,3 tokens por segundo, 2,15 segundos para o primeiro token, um desconto de cache de 99%, US$ 0,13 por tarefa de índice e um custo total de avaliação de US$ 206,66. Esse é o número de um terceiro sobre o modelo da Xiaomi.

Os principais números agênticos do DeepSeek V4 Pro são da própria DeepSeek, e a diferença entre eles e os de fontes independentes foi documentada. O material de lançamento da empresa informa Terminal-Bench 2.1 em 87,9, DeepSWE em 62,7, CyberGym em 83,3 e SWE-bench Verified em 80,6. Execuções independentes situam o Terminal-Bench 2.1 em 78,7 — cerca de nove pontos abaixo do número divulgado pela empresa — e o Artificial Analysis Coding Index em 68,8. Nenhum desses números divulgados pela empresa foi reproduzido, e o tamanho da diferença do Terminal-Bench é o motivo para tratar o restante do conjunto como alegações, e não como medições.

A Xiaomi tem a sua própria versão do mesmo problema. O seu painel relata que o MiMo-V2.6-Pro passou de 58,4 para 72,57 no DeepSWE v1.1 ao longo da sua execução de aprendizagem por reforço, avaliado no harness da própria Xiaomi com o mini-swe-agent, com média de três. Isso não é uma submissão a um ranking e nenhuma entidade externa o reexecutou. Por isso, nenhum dos modelos chega com um atestado de boa saúde nos benchmarks dos fornecedores. A diferença é que o MiMo-V2.6-Pro também chega com uma pontuação composta independente que o lançamento da DeepSeek não tinha no momento equivalente — e, se está a escolher entre eles com base em evidências e não em marketing, é essa a assimetria que deve ter peso.

Screenshot of the Artificial Analysis model page for DeepSeek V4 Pro, showing the Intelligence Index score of 36 on version 4.3.2, an open-weights model under the MIT licence, text-only input, 1.6 trillion total and 49 billion active parameters, a 1M-token context window, a listed price of $1.32 per million input tokens and $3.96 per million output tokens, output speed of 97.4 tokens per second and time to first token of 1.62 seconds.

Como isso fica em produção

A diferença de modalidade é a bifurcação prática, e ela favorece a DeepSeek com menos frequência do que a diferença de dez pontos sugere. Se o seu pipeline ingere capturas de tela, PDFs renderizados como imagens, quadros de vídeo ou áudio, o MiMo-V2.6-Pro lida com isso nativamente em um único modelo, e o DeepSeek V4 Pro não consegue lidar com isso de forma alguma — você precisaria de um modelo de visão separado na frente, o que significa um segundo contrato, um segundo modo de falha e uma segunda conta. Se a sua carga de trabalho é raciocínio apenas de texto, a modalidade extra é peso morto pelo qual você não está pagando nada.

O custo por tarefa de indexação é o outro número a levar em conta. $0,13 contra $0,67 é uma diferença de cinco vezes em um conjunto de tarefas controlado e idêntico, medido da mesma forma para ambos. O DeepSeek opera um cronograma de cobrança de pico/fora de pico que pode reduzir substancialmente sua taxa efetiva dependendo de quando você faz a chamada, então a proporção no mundo real diminui nos horários fora de pico e aumenta nos de pico — um detalhe que importa se seu tráfego é em rajadas e você não pode escolher quando ele chega.

É aqui que o lado do DeepSeek tem uma vantagem genuína que nada tem a ver com o modelo: está na nossa plataforma. O DeepSeek V4 Pro está acessível como deepseek/deepseek-v4-pro através de uma chave OrcaRouter ao preço de tabela do fornecedor, com 0% de margem, com failover automático entre fornecedores e o DSL de encaminhamento disponível por cima — por isso, a aritmética de pico/fora de pico, a dispersão entre fornecedores e o caminho de fallback são tudo coisas que configura em vez de coisas que constrói. O MiMo-V2.6-Pro não está na nossa plataforma, e dizemo-lo claramente: chegar a ele hoje significa usar a própria plataforma da Xiaomi ou um dos catálogos de terceiros que o listam, e a Artificial Analysis contabilizou um único fornecedor de API para ele no momento da recolha. Uma rota não é uma rota de produção, o que é o argumento mais forte para tratar o MiMo-V2.6-Pro como um modelo a avaliar agora e a encaminhar com cuidado, com algo diferente por trás dele.

Qual deles, e quando?

Escolha o DeepSeek V4 Pro se o seu trabalho for apenas de texto, se você precisar do teto de saída de 384K, se quiser o tempo até o primeiro token mais rápido dos dois, ou se já estiver na nossa plataforma e quiser uma via de pesos abertos com um trilhão de parâmetros, com failover e sem nova integração. Ele é o incumbente por um motivo, e ter cinco semanas a mais significou cinco semanas de ferramentas, quantização e receitas de serving que um modelo de setembro ainda não acumulou.

Escolha o MiMo-V2.6-Pro se a tarefa for multimodal, se o custo por tarefa dominar a sua economia unitária, se a taxa de transferência importar mais do que meio segundo de latência, ou se você quiser o atual líder de pesos abertos em um índice medido de forma independente. A licença MIT em ambos significa que a questão dos pesos está resolvida de qualquer maneira — você pode executar qualquer um deles no seu próprio hardware, fazer ajuste fino nele e lançá-lo comercialmente.

A configuração que vale a pena considerar não é escolha nenhuma. Um roteador permite manter a via do DeepSeek para raciocínio somente de texto com tarifas fora de pico e adicionar uma via do MiMo para as solicitações multimodais, com um fallback à frente da rota mais estreita. Isso não é hedge; é fazer cada solicitação corresponder ao modelo que de fato a processa, o que é uma resposta mais barata e mais duradoura do que escolher um vencedor e torcer para que a carga de trabalho nunca mude de forma.

Decision card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the decision', with two columns. 'Choose MiMo-V2.6-Pro when' lists a multimodal task with screenshots, rendered PDFs, video frames or audio in the same request; cost per task dominating unit economics at $0.13 against $0.67 on an identical task set; throughput mattering more than latency at 134.3 against 97.4 tokens per second; and wanting the current open-weights leader on an independently measured index at 46 against 36. 'Choose DeepSeek V4 Pro when' lists text-only reasoning work; needing the 384K output ceiling; first-token latency being the binding constraint at 1.62s against 2.15s; and wanting a route with failover behind it.

A pergunta que esta comparação ainda não consegue responder

Os benchmarks mais citados de ambos os modelos são executados pelos fornecedores e não foram replicados. Para o DeepSeek V4 Pro, essa lacuna permanece em aberto desde agosto e é a razão pela qual as suas pontuações independentes são inferiores aos seus números de lançamento. Para o MiMo-V2.6-Pro, o compósito independente existe, mas a desagregação agêntica não — a Artificial Analysis publica um 46 e não a dispersão por avaliação que lhe está subjacente, que é o detalhe que lhe diz se um modelo pertence a um ciclo de agentes ou a um pipeline de perguntas e respostas.

Até que essa diferença seja publicada e até que alguém execute novamente o harness DeepSWE da Xiaomi, a posição defensável é mais estreita do que o marketing de qualquer um dos laboratórios: o MiMo-V2.6-Pro lidera em um índice composto independente e no custo medido por tarefa, o DeepSeek V4 Pro lidera em maturidade, comprimento da saída, latência do primeiro token e por ser acessível através de uma rota que tem redundância por trás. Cinco semanas é uma vantagem inicial curta, e é a única que a DeepSeek tem.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente