Um cartão de título gerado comparando Xiaomi MiMo-V2.6-Pro e Kimi K3 com esforço máximo. O cartão da esquerda exibe Intelligence Index v4.3.2: 46, 1,02T de parâmetros totais, $206,66 para executar o índice e 134,3 tokens por segundo; o cartão da direita exibe Intelligence Index v4.3.2: 44, 2,8T de parâmetros totais, $3.658,07 para executar o índice e 42,8 tokens por segundo. Um rodapé diz: Ambas as pontuações no Artificial Analysis Intelligence Index v4.3.2, lidas em 22 de setembro de 2026. O logotipo do OrcaRouter está composto no canto inferior direito.
Guides & Insights

MiMo-V2.6-Pro vs Kimi K3: Dois Pesos Abertos de Dois Triliões de Parâmetros, Catorze Vezes de Diferença no Custo por Tarefa

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Ambos são modelos de mistura de especialistas com pesos abertos de laboratórios chineses, com uma janela de contexto de 1 milhão de tokens. Ambos estão disponíveis para download. No Artificial Analysis Intelligence Index v4.3.2, lido em 22 de setembro de 2026, o Kimi K3 da MoonshotAI marca 44 e o MiMo-V2.6-Pro da Xiaomi marca 46. Dois pontos. O custo medido de executar essa mesma suíte de avaliação para cada um é de US$ 3.658,07 para o Kimi K3 e US$ 206,66 para o MiMo-V2.6-Pro — um fator de dezessete. Se você já decidiu que quer pesos abertos nessa classe, essa proporção, e não os dois pontos, é a decisão.

Kimi K3 é o modelo consolidado deste par: lançado em 16 de julho de 2026, com os pesos completos chegando em 27 de julho, e meses de avaliação independente por trás dele. O Xiaomi MiMo-V2.6-Pro foi disponibilizado para o público em 22 de setembro de 2026, com seus repositórios de checkpoints de aprendizado por reforço surgindo no dia anterior. A comparação é, portanto, entre um modelo aberto comprovado a preço premium e um modelo novíssimo a preço de commodity, e a parte interessante é quão estreita se revelou a lacuna de capacidade medida.

O que cada modelo realmente é

Kimi K3 é um modelo de raciocínio multimodal de pesos abertos com 2,8 trilhões de parâmetros, descrito no lançamento como o primeiro modelo aberto da classe dos três trilhões. Ele ativa 16 de 896 especialistas por token — cerca de 104 bilhões de parâmetros ativos — e usa Kimi Delta Attention e Attention Residuals para manter um contexto de 1M de tokens com eficiência, com saída de até 1M de tokens por solicitação. É raciocínio sempre ativo com visão nativa. A API própria da Moonshot cobra US$ 3,00 por milhão de tokens de entrada, US$ 0,30 por milhão de tokens de entrada em cache e US$ 15,00 por milhão de saída, sem faixas por comprimento de contexto, e a Artificial Analysis relata um desconto de cache de 90% e uma taxa combinada de US$ 2,31. Ele mediu 42,8 tokens de saída por segundo — notavelmente lento em relação à mediana de 77,9 para modelos de tamanho comparável — e 3,93 segundos até o primeiro token.

Xiaomi MiMo-V2.6-Pro é um modelo esparso de mistura de especialistas com 1,02 trilhão de parâmetros totais e 42 bilhões ativados por token, com uma janela de contexto de 1 milhão de tokens e multimodalidade nativa em texto, imagem, vídeo e áudio. Seus pesos têm uma etiqueta de licença MIT. A Xiaomi manteve o preço da geração anterior em vez de reajustar o novo checkpoint para cima, e é por isso que ele é listado a US$ 0,43 por milhão de tokens de entrada e US$ 0,87 por milhão de tokens de saída, com 99% de desconto de cache e um valor combinado de US$ 0,18. Ele registrou 134,3 tokens de saída por segundo — décimo primeiro entre 114 modelos em velocidade — e 2,15 segundos até o primeiro token.

• Parâmetros ativos — MiMo-V2.6-Pro 42B por token; Kimi K3 cerca de 104B, ativando 16 de 896 especialistas

• Parâmetros totais — MiMo-V2.6-Pro 1,02T; Kimi K3 2,8T

• Pontuação do índice — MiMo-V2.6-Pro 46; Kimi K3 44, ambos Artificial Analysis v4.3.2

• Preço de tabela — MiMo-V2.6-Pro $0.43 / $0.87 por 1M; Kimi K3 $3.00 / $15.00, entrada em cache $0.30

• Taxa combinada — MiMo-V2.6-Pro $0,18 por 1M; Kimi K3 $2,31

• Custo para executar o índice — MiMo-V2.6-Pro $206.66; Kimi K3 $3,658.07

• Velocidade — MiMo-V2.6-Pro 134,3 tokens de saída/segundo; Kimi K3 42,8, em comparação com uma mediana de 77,9 para a classe de tamanho

• Tempo até o primeiro token — MiMo-V2.6-Pro 2,15 segundos; Kimi K3 3,93 segundos

• Contexto — 1M de tokens em ambos; o Kimi K3 publica saída de até 1M de tokens por solicitação

• Pesos — ambos disponíveis para download; MiMo-V2.6-Pro possui uma tag MIT

A two-column scoreboard titled MiMo-V2.6-Pro vs Kimi K3, subtitled Two open-weight MoEs tied on the only index both were run against. The left column, Xiaomi MiMo-V2.6-Pro, reads Intelligence Index v4.3.2 46; total parameters 1.02T; list price $0.43 / $0.87 per 1M; cost to run the index $206.66; speed 134.3 tokens per second; time to first token 2.15 s. The right column, Kimi K3 (max), reads Intelligence Index v4.3.2 44; total parameters 2.8T; list price $3.00 / $15.00 per 1M; cost to run the index $3,658.07; speed 42.8 tokens per second; time to first token 3.93 s. A footer notes both models are open-weights, that MiMo-V2.6-Pro carries an MIT licence tag, and that blended rates per 1M tokens are $0.18 and $2.31. The OrcaRouter logo is composited in the bottom-right corner.

A velocidade é a diferença que o índice esconde.

A diferença composta de dois pontos é o número menos interessante aqui, e o de 134,3 contra 42,8 tokens por segundo é o mais interessante. Um modelo que gera três vezes mais rápido não é três vezes melhor, mas é a diferença entre uma classe de aplicação que funciona e uma que não funciona — e a própria página do Kimi K3 no Artificial Analysis o aponta como notavelmente lento para a sua classe de tamanho. Para um loop de agente de horizonte longo que faz dezenas de chamadas sequenciais, a vazão tem efeito cumulativo da mesma forma que a latência: uma diferença de três vezes por chamada não é uma diferença de três vezes de ponta a ponta, mas é a diferença entre uma sessão que o usuário aguenta esperar e uma que ele abandona.

A vantagem do Kimi K3 está no lado da entrada da conta. Seus 3,93 segundos até o primeiro token são mais lentos que os 2,15 do MiMo-V2.6-Pro, mas não pela ordem de magnitude que separa qualquer um deles de um modelo de raciocínio de fronteira com esforço máximo. Onde o K3 paga por seu tamanho é na geração, e é pela geração que você é cobrado.

Os números do fornecedor, e o que costuma ser lido errado.

Ambos os laboratórios publicaram números do DeepSWE v1.1 a partir de seus próprios harnesses, e os dois estão em circulação como se fossem comparáveis. Não são, e é justamente neste par que esse erro causa mais danos, porque os números parecem tão próximos entre si.

A Xiaomi relata que o MiMo-V2.6-Pro passou de 58,4 para 72,57 no DeepSWE v1.1 ao longo de sua execução de aprendizado por reforço, avaliado com o mini-swe-agent em média de três execuções no próprio avaliador da Xiaomi. A execução está documentada como tendo 30 etapas e cerca de 750.000 trajetórias por modelo, concluída em menos de seis dias com um gasto publicado de aproximadamente US$ 2,62 milhões para o modelo Pro e US$ 854.044 para o Flash, menor. Uma leitura amplamente difundida dessa execução coloca o Kimi K3 em 68,51 no mesmo benchmark, o que tornaria o modelo da Xiaomi o vencedor por quatro pontos. Essa leitura é um número da comunidade, não um dado da Moonshot, e as duas medições usam métricas diferentes — média de três contra uma taxa de aprovação —, de modo que subtraí-las é fazer aritmética com escalas incompatíveis. Nenhum dos fornecedores submeteu uma configuração ao quadro público da Datacurve para esses modelos.

O número que é genuinamente comparável é o índice, porque a própria Artificial Analysis executou ambos: 46 para o MiMo-V2.6-Pro e 44 para o Kimi K3, na v4.3.2, sem que o detalhamento por avaliação tenha sido publicado para nenhum dos dois. Essa margem de dois pontos é pequena o suficiente para estar dentro do ruído de um composto de dez avaliações, e a conclusão honesta é que, em termos de capacidade medida, esses dois modelos estão efetivamente empatados.

O que o premium do Kimi K3 oferece

Seria errado interpretar a diferença de custo como margem pura. O Kimi K3 é um modelo de 2,8 trilhões de parâmetros, contra 1,02 trilhão da Xiaomi, e ativa aproximadamente duas vezes e meia mais parâmetros por token. Foi o primeiro modelo aberto em sua classe de tamanho e detém um conjunto de resultados independentes que o MiMo-V2.6-Pro simplesmente não teve tempo de acumular: segundo os próprios relatórios da Artificial Analysis, ficou em terceiro lugar no Intelligence Index, atrás do Claude Fable 5 e do GPT-5.6 Sol, na época de seu lançamento, com GDPval-AA v2 em Elo 1668, primeiro lugar no AutomationBench-AA com 53%, segundo no AA-Briefcase em Elo 1547 e primeiro na Frontend Code Arena com 1679. Essas são medições independentes, não alegações de lançamento, e descrevem um modelo com uma amplitude que uma margem composta de dois pontos não captura.

Há também uma questão de capacidade associada. A demanda pelo Kimi K3, segundo relatos, sobrecarregou a capacidade de serviço no lançamento, causando pausas temporárias nas assinaturas de API e limites de capacidade upstream em alguns gateways. Um modelo difícil de obter é um modelo sobre o qual é difícil construir, e isso é um problema de disponibilidade, não de qualidade.

Screenshot of the Artificial Analysis model page for Xiaomi MiMo-V2.6-Pro, captured 22 September 2026. The header reads 46 Artificial Analysis Intelligence Index, ranked first of 114 in its class; 134.3 output tokens per second, ranked eleventh of 114; $0.435 input and $0.87 output per 1M tokens with a 99% cache discount; $0.13 cost per Intelligence Index task, ranked twelfth of 114; and 140M output tokens from the Intelligence Index. Technical specifications list reasoning Yes, input modality text, image, speech and video, output modality text, a 1M-token context window, 1.0T total parameters, 42B active parameters, an MIT licence and Hugging Face model weights, under a breadcrumb reading Xiaomi, Open weights model, Released September 2026. A comparison summary notes it cost $206.66 to evaluate MiMo-V2.6-Pro on the Intelligence Index.

Um único endpoint e uma resposta direta sobre o que roteamos

O Kimi K3 está no OrcaRouter como kimi/kimi-k3 — uma única chave compatível com OpenAI, preço de tabela do provedor repassado com 0% de margem, então uma mudança de preço da Moonshot entra em vigor do nosso lado no mesmo dia, e o failover automático entre provedores cobre os limites de capacidade que assombram este modelo desde o lançamento. O Xiaomi MiMo-V2.6-Pro não está no OrcaRouter. Nenhum modelo Xiaomi está, e a rota para ele hoje é a própria plataforma da Xiaomi ou um dos catálogos de terceiros que o disponibilizam. Vale a pena dizer isso claramente em vez de deixar uma página de modelo insinuar o contrário.

O que faz deste emparelhamento um bom exemplo daquilo para que serve a camada de roteamento. Dois modelos abertos, empatados na única medida independente em que ambos foram avaliados, separados por um fator de dezassete no custo medido por tarefa — isso não é uma escolha, é uma configuração de duas faixas. Coloque a maior parte do seu tráfego na faixa barata e encaminhe a cauda para a outra com base num predicado que você definir, ou faça failover quando uma rota se degradar. Com os modelos atrás de uma única chave, a experiência que lhe diz qual a fatia que cada um deve receber é uma alteração de configuração nos seus próprios prompts, em vez de uma conversa de procurement — e se a Xiaomi reajustar o preço do MiMo-V2.6-Pro assim que a janela de lançamento fechar, ou a Moonshot cortar as tarifas do K3 em resposta à concorrência, ambos os movimentos chegam ao nosso lado no mesmo dia, e não no próximo ciclo de faturação.

Screenshot of the OrcaRouter model page for Kimi K3, captured 22 September 2026, showing the breadcrumb Home > Models > MoonshotAI > Kimi K3, the model id kimi/kimi-k3 dated 2026-07-15, the Vision, Tools, JSON and Reasoning capability badges, and the opening of the model description, which calls Kimi K3 MoonshotAI's flagship and most capable release to date and a 2.8-trillion-parameter mixture-of-experts model. The rate card sits below the visible area of the capture.

Qual escolher

Escolha o Kimi K3 quando você precisar da amplitude que acompanha um modelo deste tamanho e medido de forma independente como este — visão, codificação de longo horizonte em grandes repositórios, uso de ferramentas agênticas — ou quando já o estiver executando e o custo de migração for real. É o modelo mais minuciosamente caracterizado dos dois, e seu teto de saída de 1M de tokens é incomum. Leve em conta a velocidade de geração: a 42,8 tokens por segundo, em termos interativos ele é um modelo para processamento em lote e cargas de trabalho offline, independentemente do que sua qualidade de raciocínio sugira.

Escolha o MiMo-V2.6-Pro quando o throughput e a economia unitária forem a restrição, quando o ciclo for carregado de contexto e repetitivo, quando a latência do primeiro token importar, ou quando quiser os pesos no seu próprio hardware sob uma licença permissiva. É o caso raro de um modelo barato que também é o rápido e, na única pontuação independente que ambos os modelos compartilham, está à frente por uma margem pequena o suficiente para ser um empate.

Escolha os dois se você tiver um roteador. O modo de falha a evitar é padronizar em um dos dois por causa de uma proporção de manchete: pagar tarifas do Kimi K3 por uma tarefa de sumarização que um modelo de índice 46 conclui de forma idêntica, ou descobrir que uma tarefa de programação em escala de repositório precisa do modelo de 2,8 T depois de ter migrado tudo para a faixa barata. Nenhum dos dois é um problema de modelo, e ambos são configuração.

O OrcaRouter coloca mais de 200 modelos por trás de um único endpoint compatível com OpenAI pelo preço de tabela do provedor, com 0% de markup, então uma mudança de preço do fornecedor entra em vigor no mesmo dia.