Hero Nex-N2.5 Pro vs Claude Opus 5 — um cartão de título gerado com os dizeres 'Nex-N2.5 Pro vs Claude Opus 5', o subtítulo 'A prévia gratuita e aberta de uso de computador vs o líder de benchmark que você pode rotear hoje' e uma linha superior 'Anthropic vs Nex-AGI — Setembro de 2026'.
Guides & Insights

Nex-N2.5 Pro vs Claude Opus 5: a Nex-AGI escolheu a régua, e a régua venceu

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Nex-AGI escolheu a régua, e a régua venceu. Quando a aliança de modelos abertos com sede em Xangai apresentou o Nex-N2.5 Pro em 8 de setembro de 2026, a tabela de uso de computador do cartão do modelo colocou o Claude Opus 5 na coluna de comparação e o Nex-N2.5 Pro na posição de desafiante: 68,3 para o Claude Opus 5 contra 56,4 para o Nex-N2.5 Pro no OSWorld-2, ambos os números exatamente como a Nex-AGI os imprimiu em seu próprio cartão. Os rankings independentes desde então ampliaram, em vez de reduzir, a diferença — o snapshot do OSWorld 2.0 da BenchLM de 29 de agosto classifica o Claude Opus 5 em primeiro lugar entre os quinze modelos que lista, com 70,6. Conceder doze pontos ao líder da disputa no benchmark que você escolheu publicar não é a coreografia de lançamento habitual, e é por isso que a parte interessante de Nex-N2.5 Pro vs Claude Opus 5 não é a pontuação. É o que os dois lados dessa pontuação realmente são: um modelo aberto de uso de computador com 397 bilhões de parâmetros que ninguém fora da aliança conseguiu executar ou verificar ainda, e o carro-chefe fechado da Anthropic que lidera o benchmark e sustenta tráfego de produção desde o final de julho.

O resumo honesto de antemão: esta não é uma rivalidade entre duas quantidades medidas, porque apenas um lado dela foi medido por alguém além de seu fabricante. O Nex-N2.5 Pro é um modelo esparso de mistura de especialistas (mixture-of-experts), com cerca de 17 bilhões de parâmetros ativos em um total de 397B, pós-treinado a partir da linhagem Qwen3.5, voltado diretamente para operação computacional e de navegador de longo horizonte com um ciclo de feedback visual. Ele está sendo servido hoje por meio de endpoints hospedados gratuitamente, com links Nex-AGI a partir da ficha técnica do modelo, enquanto os pesos Apache-2.0 sobre os quais a família se baseia permanecem marcados como "em breve", sem data. O Claude Opus 5 é o carro-chefe de produção da Anthropic para raciocínio exigente, codificação e trabalho agêntico — um modelo fechado com contexto de 1 milhão de tokens, um dial de pensamento adaptativo, preço documentado e semanas de entradas públicas em rankings e tráfego de produção por trás dele. Cada vantagem neste confronto pertence a um desses dois fatos: um modelo é executável e verificável, e o outro não é nenhum dos dois.

A referência com a qual ambos os lados concordam

Os benchmarks de uso de computador recompensam o mesmo comportamento que esses modelos são feitos para vender: um agente que olha para a tela, decide uma ação, executa-a e lê a tela alterada para verificar se a ação funcionou. O Nex-N2.5 Pro é arquitetado exatamente em torno desse ciclo — a visão não é uma modalidade de entrada acoplada a ele, e sim o canal de feedback com base no qual o agente confere o resultado das ações. O Claude Opus 5 trata o mesmo ciclo como uma carga de trabalho entre muitas, mas acontece que ele é muito bom nisso, e foi por isso que a Nex-AGI o usou como ponto de referência em primeiro lugar.

Os dois números não provêm, estritamente, do mesmo arcabouço de avaliação. A Nex-AGI produziu suas métricas do OSWorld-2 por meio de seu próprio arcabouço de avaliação NexCUA, que afirma que vai disponibilizar como código aberto, mas ainda não lançou, e o 56,4 do Nex-N2.5 Pro é um resultado não reproduzido do fornecedor. O 70,6 do Claude Opus 5 no BenchLM é uma medição de terceiros do OSWorld 2.0, datada de 29 de agosto de 2026, e é consistente com o 68,3 que a própria Nex-AGI cita de fontes do leaderboard. Arcabouços diferentes e versões ligeiramente diferentes do benchmark significam que a diferença exata — doze pontos na ficha da própria Nex-AGI, mais perto de catorze no BenchLM — deve ser interpretada como direcional. Mas não está em disputa que o Nex-N2.5 Pro, pelos melhores números disponíveis de ambos os lados, está abaixo do atual agente de uso de computador de ponta.

A two-column scoreboard titled 'Nex-N2.5 Pro vs Claude Opus 5 — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; Params 397B total / ~17B active; Focus computer use; OSWorld 2.0 56.4 vendor-reported; Weights Apache-2.0 pending; Price free hosted / no list price. Right column Claude Opus 5: Released Jul 24 2026; Params undisclosed; Focus general plus computer use; OSWorld 2.0 70.6 per BenchLM; Weights closed; Price $5.00 / $25.00 per 1M. Footer: 'Nex figures vendor-reported via NexCUA harness; Opus OSWorld per BenchLM Aug 29.'

Duas respostas para "posso rodar isso hoje"

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

Esta é a bifurcação que de fato decide a disputa para uma equipe em atividade — e ela não favorece o recém-chegado. A ficha do Nex-N2.5 Pro no Hugging Face ainda exibe um aviso de que os pesos estão por vir sob licença Apache-2.0, sem data de lançamento associada. As únicas versões no ar são os endpoints hospedados gratuitos que a Nex-AGI disponibiliza a partir da ficha — chamáveis, porém de propriedade de terceiros, sem preço tabelado, sem termos de serviço em que uma equipe possa se basear e sem a menor possibilidade de reproduzir uma única métrica de benchmark no seu próprio hardware. Quando os pesos enfim forem lançados, a receita documentada de implantação é um único nó com oito H100s em uma imagem SGLang personalizada — um requisito real, ainda que rotineiro, para um MoE de 397B, e é exatamente por isso que o design com 17B ativos é interessante. Até que isso aconteça, o Nex-N2.5 Pro é uma prévia que você pode consultar, não um modelo sobre o qual você pode construir.

Claude Opus 5 é o oposto em cada uma dessas linhas. Ele tem sido servido por meio da API da Anthropic e em plataformas roteadas desde 24 de julho; seu preço é público e estável, seus pesos são fechados e permanecerão fechados, e qualquer um de seus números pode ser verificado hoje executando-o. O ecossistema ao redor — Claude Code, ferramentas MCP e o enxame de agentes de produção que o bombardearam durante seis semanas — é exatamente o registro acumulado que um modelo de um dia não pode reivindicar. Para uma equipe cujo requisito é "o modelo tem que funcionar no próximo trimestre", esse registro é tudo.

A ficha técnica, tal como está.

Coloque os dois envelopes lado a lado:

Lançado — Nex-N2.5 Pro: 8 de setembro de 2026 (endpoints hospedados ativos, pesos pendentes). Claude Opus 5: 24 de julho de 2026, disponível em geral.

Escala — Nex-N2.5 Pro: 397B no total / ~17B MoE ativo. Claude Opus 5: contagem de parâmetros não divulgada.

Modalidade — Nex-N2.5 Pro: texto e imagem na entrada, texto na saída, visão central em seu loop de uso de computador. Claude Opus 5: texto e imagem na entrada, texto na saída, com forte análise visual.

Contexto / saída — Nex-N2.5 Pro: contexto de 262.144 tokens, comprimento de serviço documentado. Claude Opus 5: contexto de 1M de tokens, teto de saída de 128K tokens.

Controle de raciocínio — Nex-N2.5 Pro: um seletor de reasoning_effort com as opções nenhum / médio (adaptativo, padrão) / alto. Claude Opus 5: pensamento adaptativo por padrão, com um controle de esforço explícito que vai de baixo ao máximo.

Pesos — Nex-N2.5 Pro: Apache-2.0, em breve, sem data. Claude Opus 5: fechado.

Preço por 1M tokens — Nex-N2.5 Pro: camada gratuita hospedada, sem preço de tabela publicado. Claude Opus 5: $5,00 entrada / $25,00 saída, $0,50 leituras em cache, $6,25 gravações em cache.

Os envelopes são diferentes o suficiente para que a ficha técnica faça um trabalho real: o Opus 5 traz uma janela de um milhão de tokens e um teto de saída de 128K para longas sessões de agente, enquanto o contexto de 262K e o plano gratuito do Nex-N2.5 Pro atendem a automações de menor escopo, voltadas para tela. Nenhuma especificação torna a outra redundante; os modelos discordam sobre em que um agente gasta seu contexto.

Lendo o placar da própria Nex-AGI honestamente.

O restante do cartão merece ser lido com o mesmo filtro. As outras linhas de uso de computador do Nex-N2.5 Pro — OSWorld-G 87.4, OSWorld-Verified 82.2, WebArena-Verified 67.6, WebTest 52.8, Vision2Web 68.2 — e suas linhas de codificação — Terminal-Bench 2.1 em 82.7, SWE-Bench Pro em 61.2, BrowseComp em 89.7 — são todas medições do fornecedor feitas por meio do próprio harness da aliança, sem reprodução nas primeiras 48 horas. A única conclusão que um leitor neutro pode extrair do cartão é que a Nex-AGI acredita que o Nex-N2.5 Pro é um modelo forte de uso de computador de nível médio, que fica atrás do agente de fronteira justamente na linha que mais importa. Esse é um posicionamento coerente — até conservador — para um modelo aberto de 397B. É também uma afirmação que aguarda um segundo laboratório.

O dinheiro, quando um lado não tem preço.

Não há comparação de preços honesta a ser feita aqui, porque apenas um lado tem um preço. O nível gratuito hospedado do Nex-N2.5 Pro não diz nada sobre o valor do modelo — endpoints gratuitos de pré-visualização são como os fornecedores coletam tráfego e feedback, e a Nex-AGI não publicou nenhuma taxa paga por token para a família. O Claude Opus 5 custa US$ 5,00 por milhão de tokens de entrada e US$ 25,00 por milhão de tokens de saída no preço de tabela da Anthropic, com leituras de cache a US$ 0,50 — e é esse número que um orçamento precisa absorver. Se você está pagando essa conta hoje por agentes de uso de computador e quer saber se um modelo aberto com 17B ativos poderia fazer o mesmo trabalho por menos, a resposta é: possivelmente, mas você não vai descobrir até que os pesos sejam disponibilizados e alguém independente execute o modelo. A comparação de preços fica adiada, não resolvida — e tratar um endpoint gratuito como evidência de baixo custo seria um erro de categoria.

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5) showing the header stats $5.00 input and $25.00 output per million tokens and the byline 'by Anthropic - 2026-07-24'.

O que você pode fazer hoje é configurar o teste A/B para o dia em que isso se tornar possível. O Claude Opus 5 está no OrcaRouter pelo preço de tabela da Anthropic — os mesmos US$ 5,00 / US$ 25,00, repassados sem nenhum acréscimo —, de modo que a fatura aqui corresponde à da Anthropic e muda no dia em que a Anthropic mudar. Uma única chave de API o coloca no mesmo endpoint de 200+ outros modelos, com failover automático se um provedor apresentar problemas e o DSL de roteamento se você quiser o Opus nas chamadas difíceis e um modelo mais barato nas rotineiras. O Nex-N2.5 Pro não está no OrcaRouter — verificamos nosso diretório de modelos antes de escrever, e nenhum modelo nex-agi está listado lá ainda. No momento em que um provedor o oferecer pelo preço de tabela, ele aparecerá aqui no mesmo dia, e a comparação honesta que este artigo ainda não pode executar se torna uma regra de roteamento em vez de uma migração.

Quem deve agir, e quem deve esperar

Se a sua equipe executa hoje cargas de trabalho de computer-use ou agentic-coding em produção e precisa de um modelo com preço conhecido, perfil de falha conhecido e histórico independente, o Claude Opus 5 é a escolha racional neste confronto, e nada nas primeiras 48 horas do Nex-N2.5 Pro muda isso. Se a sua equipe está avaliando modelos abertos de computer-use para uma futura implementação, o Nex-N2.5 Pro merece estar na lista de observação — um MoE multimodal de 397B, com uma pegada de auto-hospedagem razoável e uma história de benchmark de nível intermediário plausível, é exatamente o tipo de modelo aberto que remodela a curva de custos, desde que os pesos realmente cheguem e os números da ficha técnica sobrevivam a uma rodada independente. A postura racional é adotar as duas ao mesmo tempo: manter o líder comprovado no caminho crítico e deixar que o dia em que os pesos forem disponibilizados decida se o recém-chegado merece um teste. Essa é a única comparação neste confronto que ainda não aconteceu — e é a que de fato importará.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente