{{1}}Um cartão de título hero gerado para {{2}}'Nex-N2.5 Pro vs Kimi K3'{{/2}} com o subtítulo {{3}}'O confronto em que o próprio cartão de benchmark do recém-chegado arbitra'{{/3}}, um documento grande de cantos arredondados rotulado como {{KEEP}}'VENDOR BENCHMARK CARD'{{/KEEP}} com duas colunas de modelos e a linha {{4}}'Pro fica atrás de K3 na maioria das linhas compartilhadas'{{/4}} acima dele, com o logotipo da OrcaRouter composto no canto inferior direito.{{/1}}
Guides & Insights

Nex-N2.5 Pro vs Kimi K3: o confronto em que o próprio cartão de benchmark do novato arbitra

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Compare os números que o Nex-N2.5 Pro e o Kimi K3 têm em comum e você perceberá quem os forneceu. O Nex-N2.5 Pro da Nex-AGI — o agente multimodal de 397 bilhões de parâmetros, com cerca de 17 bilhões ativos, apresentado em 8 de setembro de 2026, com pesos ainda marcados como "em breve" — publica uma tabela de benchmarks que lista o Kimi K3 da Moonshot AI diretamente nas mesmas colunas. O Kimi K3 é o carro-chefe open-weight de 2,8 trilhões de parâmetros que a Moonshot lançou em 16 de julho de 2026, com contexto de um milhão de tokens, pesos completos sob uma licença MIT Modificada onze dias depois e 57 no Artificial Analysis Intelligence Index, o que o torna o principal modelo open-weight do ranking. E, linha após linha dessa tabela, o Nex-N2.5 Pro fica atrás do Kimi K3: Terminal-Bench 2.1 com 82,7 contra 88,3 do K3, BrowseComp 89,7 contra 91,2, SWE-Bench Pro 61,2 contra 63,3, AutomationBench 44,2 contra 46,7. Quando um fornecedor publica os números do próprio modelo ao lado do atual líder open-weights e o próprio modelo perde a maioria das linhas, o mais interessante no confronto é que a tabela provavelmente está dizendo a verdade.

Essa é a forma incomum desta comparação. Normalmente, a ficha de um recém-chegado é onde se espera encontrar viés. Aqui, a ficha é a coisa mais próxima que qualquer um dos modelos tem de um árbitro honesto, porque a Nex-AGI não tinha razão para publicar uma tabela que rebaixa seu próprio nível Pro — e as linhas em que o Pro vence o K3 são exatamente as linhas em que um pequeno modelo especializado em uso de computador deveria vencer um generalista muito maior. Portanto, a verdadeira questão que esta página responde é mais restrita e mais útil do que "qual é melhor": o suposto nicho do Nex-N2.5 Pro — desempenho agêntico próximo ao K3 com cerca de um sexto dos parâmetros ativos — sobrevive ao confronto com o fato de que o Kimi K3 já existe, já tem seus pesos disponíveis e já é o modelo a ser batido?

O oponente, por completo

O Kimi K3 não é um modelo de nicho, e é exatamente por isso que ele é a referência certa. É o carro-chefe da Moonshot: 2,8 trilhões de parâmetros no total, com 104 bilhões ativos sob uma arquitetura Stable LatentMoE, contexto de 1 milhão de tokens com um orçamento de saída à altura, compreensão nativa de texto, imagem e vídeo, raciocínio sempre ativo e pesos abertos que qualquer pessoa com hardware suficiente consegue de fato executar. Seu desempenho independente é forte — a nota 57 no Intelligence Index (Artificial Analysis) é a mais alta entre todos os modelos de pesos abertos, e ele registrou 1.679 de Elo no Frontend Code Arena, à frente do Claude Fable 5 e do GPT-5.6 Sol — ao passo que seu preço, US$ 3,00 por milhão de tokens de entrada e US$ 15,00 por milhão de tokens de saída, com US$ 0,30 por milhão para entrada em cache, fica no extremo premium da faixa de pesos abertos. O Kimi K3 é o que “fronteira e aberto” significa quando o fornecedor não abre mão da escala: custa mais por token de saída do que rivais fechados como o GPT-5.6 Sol, é caro de servir e é muito difícil argumentar contra ele nas leaderboards.

A aritmética do desafiante

O Nex-N2.5 Pro não está tentando superar o Kimi K3 em escala. Está tentando superá-lo em serviço. A Nex-AGI fez pós-treinamento do nível Pro a partir de uma base da linhagem Qwen3.5, transformando-o em um agente nativo de visão para operar computadores e navegadores, e seu argumento é eficiência: 397B no total / ~17B ativos, um contexto de 262K e uma receita de implantação em um único nó com 8×H100, contra os 2.8T / 104B ativos do K3 e o tipo de frota de servidores que um modelo desse tamanho exige. O argumento implícito é que um especialista com 17B ativos, treinado especificamente para o loop de agente com feedback visual, pode entregar a maior parte do desempenho agêntico de um generalista com 104B ativos a uma fração do custo de serviço. Na própria ficha da Nex-AGI, a alegação é plausível, mas parcial: o Pro supera ou empata com o K3 em OSWorld-G (87,4 contra 79,6) e OmniDoc (92,2 contra 91,1), e perde o restante das linhas compartilhadas por dígitos únicos — um modelo de 397B perdendo para um modelo de 2.8T por 3 a 6 pontos em codificação e navegação é, se for verdade, exatamente a história de eficiência que a Nex quer contar.

Se for verdade. Todos esses números são da própria Nex-AGI, produzidos ao menos em parte pelo seu harness interno NexCUA, e o Nex-N2.5 Pro não pode ser verificado de forma independente hoje porque seus pesos não podem ser baixados — o repositório do Hugging Face contém um README, uma pasta de figuras e um banner com “pesos em breve”, nada mais. A mesma ressalva se aplica aos números relativos à K3 que o card apresenta, a maioria dos quais a Nex compilou a partir de relatórios publicados pela Moonshot, em vez de medi-los ela mesma. O que a tabela da Nex-AGI estabelece não é quem vence; é que os engenheiros da própria Nex-AGI, ao escolherem os benchmarks e o harness, não conseguiram fazer sua versão Pro superar a Kimi K3 na maioria dos pontos em comum. Esse é um dado mais útil do que qualquer pontuação individual, porque estabelece um limite superior para o quanto o marketing pode estar exagerando.

A comparison scoreboard for Nex-N2.5 Pro and Kimi K3: Nex-N2.5 Pro rows 'Total / active: 397B / ~17B', 'Weights: coming soon', 'Context: 262K', 'Price: no rate card (free preview)', 'Terminal-Bench 2.1: 82.7 (Nex-reported)', 'OSWorld-2: 56.4 (Nex-reported)'; Kimi K3 rows 'Total / active: 2.8T / 104B', 'Weights: open, Modified MIT', 'Context: 1M', 'Price: $3 / $15, cache $0.30', 'Terminal-Bench 2.1: 88.3 (Moonshot)', 'OSWorld-2: 58.3 (Nex-compiled)'; footer 'All figures vendor-reported; Kimi K3 AA Index 57 per Artificial Analysis.'

As linhas que importam, lado a lado

Escala — Nex-N2.5 Pro: 397B total / ~17B ativos, multimodal da linhagem Qwen3.5. Kimi K3: 2.8T total / 104B ativos, Stable LatentMoE, multimodal.

Pesos — Nex-N2.5 Pro: prometido, não enviado ("em breve" no cartão). Kimi K3: publicado em 27 de julho sob Modified MIT — disponível para download hoje.

Contexto — Nex-N2.5 Pro: 262K. Kimi K3: 1M tokens, preço fixo.

Preço — Nex-N2.5 Pro: ainda sem tabela de preços; preview hospedado gratuito. Kimi K3: US$ 3,00 / US$ 15,00 por milhão, entrada em cache US$ 0,30.

Classificação independente — Nex-N2.5 Pro: ainda sem posição. Kimi K3: AA Intelligence Index 57, melhor modelo de peso aberto no ranking.

Codificação (cartões de fornecedores) — Nex-N2.5 Pro: Terminal-Bench 2.1 82.7, SWE-Bench Pro 61.2. Kimi K3: 88.3 e 63.3 nas mesmas linhas.

GUI / uso de computador — Nex-N2.5 Pro: OSWorld-G 87.4 (supera o K3 no próprio cartão dele), OSWorld-2 56.4. Kimi K3: OSWorld-G 79.6, OSWorld-2 58.3 (compilado pela Nex).

Pegada de self-hosting — Nex-N2.5 Pro: receita para nó único com 8×H100 quando os pesos forem disponibilizados. Kimi K3: 2.8T — uma frota de inferência, não um único nó.

O que "aberto" significa de forma diferente em cada coluna

A palavra "aberto" exerce papéis bem diferentes nos dois lados, e isso decide essa disputa mais do que qualquer benchmark. O Kimi K3 é aberto no sentido que importa na prática: os pesos estão no hub sob uma licença MIT modificada, de caráter permissivo; os traces de raciocínio ficam expostos na API de streaming; e uma empresa com restrições de governança de dados pode executá-lo em hardware que controla e auditar no que o modelo estava pensando. Ele é aberto de uma forma que custa caro — um modelo de 2.8T exige infraestrutura séria — mas a opção existe hoje. O Nex-N2.5 Pro é aberto no sentido de intenção: a Nex-AGI afirma que os pesos da família serão lançados como código aberto, e o irmão menor Nex-N2.5 Mini realmente lançou pesos sob licença Apache-2.0 no dia do lançamento. Os pesos do Pro não foram divulgados; sua licença está anunciada na ficha técnica, mas ainda não vincula nada que possa ser baixado; e, até que exista um checkpoint, "aberto" é item de roadmap, não uma propriedade do modelo. Para uma equipe que escolhe entre os dois, isso não é uma nota de rodapé — é a diferença entre um modelo que você pode possuir neste mês e um modelo que prometem que você poderá possuir.

Avaliando sem esperar por um botão de download

Você não precisa congelar essa decisão até o lançamento dos pesos do Nex-N2.5 Pro, e a camada de roteamento é onde você roda o experimento de forma barata. Kimi K3 está no OrcaRouter ao preço de tabela da Moonshot — US$ 3,00 / US$ 15,00, margem de 0%, repassado e atualizado no dia em que a Moonshot o alterar — portanto o líder de pesos abertos está a uma chave de distância ao lado dos outros 200+ modelos do catálogo. O Nex-N2.5 Pro não é oferecido por nós; testá-lo hoje significa usar a prévia hospedada da Nex-AGI e, mais tarde, sua própria pilha com oito H100. O padrão que funciona: coloque as tarefas de contexto longo e auditoria pesada no Kimi K3 pelo endpoint único que você já usa, aponte um branch de teste para a prévia do Nex-N2.5 Pro e deixe o failover automático contornar qualquer um que degrade — é exatamente assim que você compara um modelo de fronteira já lançado com um desafiante de pesos pendentes sem apostar seu caminho de produção em nenhum dos dois. Quando os pesos do Pro enfim forem lançados, a verificação é simples: rode as linhas compartilhadas que um laboratório independente consegue reproduzir e veja se a história de eficiência com 17B ativos sobrevive fora do harness da própria Nex-AGI.

A screenshot of the Hugging Face 'Files and versions' tab for nex-agi/Nex-N2.5-Pro (captured September 9, 2026), showing the model header with Text Generation and Transformers tags, 'License: apache-2.0', and a file tree listing only figures, .gitattributes and README.md - no model weight shards, confirming the Pro checkpoint is not yet published.A screenshot of the OrcaRouter model page for kimi/kimi-k3 (captured September 9, 2026), showing the Kimi K3 card under vendor MoonshotAI with model id kimi/kimi-k3, a 1M-token context, text + image input and text output, vision/tools/reasoning chips, and a 'Public benchmarks by MoonshotAI' note dated 2026-07-15.

Onde o confronto termina

Contra o maior modelo de pesos abertos já lançado, o Nex-N2.5 Pro não precisa vencer a guerra dos generalistas para merecer atenção — precisa vencer o argumento do custo de servir, e sua própria ficha sugere que esse argumento é real, porém não comprovado. O Kimi K3 é a escolha segura e genuinamente forte hoje: pesos abertos, topo do índice de pesos abertos, contexto de um milhão de tokens e um preço que dá para planejar — ao custo de uma infraestrutura que só fica mais difícil à medida que o modelo cresce. O Nex-N2.5 Pro é a aposta em eficiência: desempenho agêntico próximo ao K3 com um sexto dos parâmetros ativos em um único nó, segundo uma tabela do fornecedor sobre um modelo que ainda não foi lançado. Escolha o Kimi K3 quando quiser o modelo de fronteira que você pode realmente possuir e auditar agora. Fique de olho no Nex-N2.5 Pro para o dia em que seus pesos forem publicados e alguém independente rodar os benchmarks compartilhados — porque se um agente com 17B ativos realmente ficar a poucos pontos de um carro-chefe com 104B ativos em uso de computador, esse é o resultado que muda a matemática de custo de servir para todo agente aberto depois dele.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente