
Nex-N2.5 Pro vs Claude Opus 5: a Nex-AGI escolheu a régua, e a régua venceu
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0455Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0247Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0247Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0157Inteligência82Código
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2646Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Inteligência75Código
- obsidianQwen3.8 27B2026-08-1541Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1251Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0547Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Inteligência49Código
Nex-AGI escolheu a régua, e a régua venceu. Quando a aliança de modelos abertos com sede em Xangai apresentou o Nex-N2.5 Pro em 8 de setembro de 2026, a tabela de uso de computador do cartão do modelo colocou o Claude Opus 5 na coluna de comparação e o Nex-N2.5 Pro na posição de desafiante: 68,3 para o Claude Opus 5 contra 56,4 para o Nex-N2.5 Pro no OSWorld-2, ambos os números exatamente como a Nex-AGI os imprimiu em seu próprio cartão. Os rankings independentes desde então ampliaram, em vez de reduzir, a diferença — o snapshot do OSWorld 2.0 da BenchLM de 29 de agosto classifica o Claude Opus 5 em primeiro lugar entre os quinze modelos que lista, com 70,6. Conceder doze pontos ao líder da disputa no benchmark que você escolheu publicar não é a coreografia de lançamento habitual, e é por isso que a parte interessante de Nex-N2.5 Pro vs Claude Opus 5 não é a pontuação. É o que os dois lados dessa pontuação realmente são: um modelo aberto de uso de computador com 397 bilhões de parâmetros que ninguém fora da aliança conseguiu executar ou verificar ainda, e o carro-chefe fechado da Anthropic que lidera o benchmark e sustenta tráfego de produção desde o final de julho.
O resumo honesto de antemão: esta não é uma rivalidade entre duas quantidades medidas, porque apenas um lado dela foi medido por alguém além de seu fabricante. O Nex-N2.5 Pro é um modelo esparso de mistura de especialistas (mixture-of-experts), com cerca de 17 bilhões de parâmetros ativos em um total de 397B, pós-treinado a partir da linhagem Qwen3.5, voltado diretamente para operação computacional e de navegador de longo horizonte com um ciclo de feedback visual. Ele está sendo servido hoje por meio de endpoints hospedados gratuitamente, com links Nex-AGI a partir da ficha técnica do modelo, enquanto os pesos Apache-2.0 sobre os quais a família se baseia permanecem marcados como "em breve", sem data. O Claude Opus 5 é o carro-chefe de produção da Anthropic para raciocínio exigente, codificação e trabalho agêntico — um modelo fechado com contexto de 1 milhão de tokens, um dial de pensamento adaptativo, preço documentado e semanas de entradas públicas em rankings e tráfego de produção por trás dele. Cada vantagem neste confronto pertence a um desses dois fatos: um modelo é executável e verificável, e o outro não é nenhum dos dois.
A referência com a qual ambos os lados concordam
Os benchmarks de uso de computador recompensam o mesmo comportamento que esses modelos são feitos para vender: um agente que olha para a tela, decide uma ação, executa-a e lê a tela alterada para verificar se a ação funcionou. O Nex-N2.5 Pro é arquitetado exatamente em torno desse ciclo — a visão não é uma modalidade de entrada acoplada a ele, e sim o canal de feedback com base no qual o agente confere o resultado das ações. O Claude Opus 5 trata o mesmo ciclo como uma carga de trabalho entre muitas, mas acontece que ele é muito bom nisso, e foi por isso que a Nex-AGI o usou como ponto de referência em primeiro lugar.
Os dois números não provêm, estritamente, do mesmo arcabouço de avaliação. A Nex-AGI produziu suas métricas do OSWorld-2 por meio de seu próprio arcabouço de avaliação NexCUA, que afirma que vai disponibilizar como código aberto, mas ainda não lançou, e o 56,4 do Nex-N2.5 Pro é um resultado não reproduzido do fornecedor. O 70,6 do Claude Opus 5 no BenchLM é uma medição de terceiros do OSWorld 2.0, datada de 29 de agosto de 2026, e é consistente com o 68,3 que a própria Nex-AGI cita de fontes do leaderboard. Arcabouços diferentes e versões ligeiramente diferentes do benchmark significam que a diferença exata — doze pontos na ficha da própria Nex-AGI, mais perto de catorze no BenchLM — deve ser interpretada como direcional. Mas não está em disputa que o Nex-N2.5 Pro, pelos melhores números disponíveis de ambos os lados, está abaixo do atual agente de uso de computador de ponta.

Duas respostas para "posso rodar isso hoje"

Esta é a bifurcação que de fato decide a disputa para uma equipe em atividade — e ela não favorece o recém-chegado. A ficha do Nex-N2.5 Pro no Hugging Face ainda exibe um aviso de que os pesos estão por vir sob licença Apache-2.0, sem data de lançamento associada. As únicas versões no ar são os endpoints hospedados gratuitos que a Nex-AGI disponibiliza a partir da ficha — chamáveis, porém de propriedade de terceiros, sem preço tabelado, sem termos de serviço em que uma equipe possa se basear e sem a menor possibilidade de reproduzir uma única métrica de benchmark no seu próprio hardware. Quando os pesos enfim forem lançados, a receita documentada de implantação é um único nó com oito H100s em uma imagem SGLang personalizada — um requisito real, ainda que rotineiro, para um MoE de 397B, e é exatamente por isso que o design com 17B ativos é interessante. Até que isso aconteça, o Nex-N2.5 Pro é uma prévia que você pode consultar, não um modelo sobre o qual você pode construir.
Claude Opus 5 é o oposto em cada uma dessas linhas. Ele tem sido servido por meio da API da Anthropic e em plataformas roteadas desde 24 de julho; seu preço é público e estável, seus pesos são fechados e permanecerão fechados, e qualquer um de seus números pode ser verificado hoje executando-o. O ecossistema ao redor — Claude Code, ferramentas MCP e o enxame de agentes de produção que o bombardearam durante seis semanas — é exatamente o registro acumulado que um modelo de um dia não pode reivindicar. Para uma equipe cujo requisito é "o modelo tem que funcionar no próximo trimestre", esse registro é tudo.
A ficha técnica, tal como está.
Coloque os dois envelopes lado a lado:
• Lançado — Nex-N2.5 Pro: 8 de setembro de 2026 (endpoints hospedados ativos, pesos pendentes). Claude Opus 5: 24 de julho de 2026, disponível em geral.
• Escala — Nex-N2.5 Pro: 397B no total / ~17B MoE ativo. Claude Opus 5: contagem de parâmetros não divulgada.
• Modalidade — Nex-N2.5 Pro: texto e imagem na entrada, texto na saída, visão central em seu loop de uso de computador. Claude Opus 5: texto e imagem na entrada, texto na saída, com forte análise visual.
• Contexto / saída — Nex-N2.5 Pro: contexto de 262.144 tokens, comprimento de serviço documentado. Claude Opus 5: contexto de 1M de tokens, teto de saída de 128K tokens.
• Controle de raciocínio — Nex-N2.5 Pro: um seletor de reasoning_effort com as opções nenhum / médio (adaptativo, padrão) / alto. Claude Opus 5: pensamento adaptativo por padrão, com um controle de esforço explícito que vai de baixo ao máximo.
• Pesos — Nex-N2.5 Pro: Apache-2.0, em breve, sem data. Claude Opus 5: fechado.
• Preço por 1M tokens — Nex-N2.5 Pro: camada gratuita hospedada, sem preço de tabela publicado. Claude Opus 5: $5,00 entrada / $25,00 saída, $0,50 leituras em cache, $6,25 gravações em cache.
Os envelopes são diferentes o suficiente para que a ficha técnica faça um trabalho real: o Opus 5 traz uma janela de um milhão de tokens e um teto de saída de 128K para longas sessões de agente, enquanto o contexto de 262K e o plano gratuito do Nex-N2.5 Pro atendem a automações de menor escopo, voltadas para tela. Nenhuma especificação torna a outra redundante; os modelos discordam sobre em que um agente gasta seu contexto.
Lendo o placar da própria Nex-AGI honestamente.
O restante do cartão merece ser lido com o mesmo filtro. As outras linhas de uso de computador do Nex-N2.5 Pro — OSWorld-G 87.4, OSWorld-Verified 82.2, WebArena-Verified 67.6, WebTest 52.8, Vision2Web 68.2 — e suas linhas de codificação — Terminal-Bench 2.1 em 82.7, SWE-Bench Pro em 61.2, BrowseComp em 89.7 — são todas medições do fornecedor feitas por meio do próprio harness da aliança, sem reprodução nas primeiras 48 horas. A única conclusão que um leitor neutro pode extrair do cartão é que a Nex-AGI acredita que o Nex-N2.5 Pro é um modelo forte de uso de computador de nível médio, que fica atrás do agente de fronteira justamente na linha que mais importa. Esse é um posicionamento coerente — até conservador — para um modelo aberto de 397B. É também uma afirmação que aguarda um segundo laboratório.
O dinheiro, quando um lado não tem preço.
Não há comparação de preços honesta a ser feita aqui, porque apenas um lado tem um preço. O nível gratuito hospedado do Nex-N2.5 Pro não diz nada sobre o valor do modelo — endpoints gratuitos de pré-visualização são como os fornecedores coletam tráfego e feedback, e a Nex-AGI não publicou nenhuma taxa paga por token para a família. O Claude Opus 5 custa US$ 5,00 por milhão de tokens de entrada e US$ 25,00 por milhão de tokens de saída no preço de tabela da Anthropic, com leituras de cache a US$ 0,50 — e é esse número que um orçamento precisa absorver. Se você está pagando essa conta hoje por agentes de uso de computador e quer saber se um modelo aberto com 17B ativos poderia fazer o mesmo trabalho por menos, a resposta é: possivelmente, mas você não vai descobrir até que os pesos sejam disponibilizados e alguém independente execute o modelo. A comparação de preços fica adiada, não resolvida — e tratar um endpoint gratuito como evidência de baixo custo seria um erro de categoria.

O que você pode fazer hoje é configurar o teste A/B para o dia em que isso se tornar possível. O Claude Opus 5 está no OrcaRouter pelo preço de tabela da Anthropic — os mesmos US$ 5,00 / US$ 25,00, repassados sem nenhum acréscimo —, de modo que a fatura aqui corresponde à da Anthropic e muda no dia em que a Anthropic mudar. Uma única chave de API o coloca no mesmo endpoint de 200+ outros modelos, com failover automático se um provedor apresentar problemas e o DSL de roteamento se você quiser o Opus nas chamadas difíceis e um modelo mais barato nas rotineiras. O Nex-N2.5 Pro não está no OrcaRouter — verificamos nosso diretório de modelos antes de escrever, e nenhum modelo nex-agi está listado lá ainda. No momento em que um provedor o oferecer pelo preço de tabela, ele aparecerá aqui no mesmo dia, e a comparação honesta que este artigo ainda não pode executar se torna uma regra de roteamento em vez de uma migração.
Quem deve agir, e quem deve esperar
Se a sua equipe executa hoje cargas de trabalho de computer-use ou agentic-coding em produção e precisa de um modelo com preço conhecido, perfil de falha conhecido e histórico independente, o Claude Opus 5 é a escolha racional neste confronto, e nada nas primeiras 48 horas do Nex-N2.5 Pro muda isso. Se a sua equipe está avaliando modelos abertos de computer-use para uma futura implementação, o Nex-N2.5 Pro merece estar na lista de observação — um MoE multimodal de 397B, com uma pegada de auto-hospedagem razoável e uma história de benchmark de nível intermediário plausível, é exatamente o tipo de modelo aberto que remodela a curva de custos, desde que os pesos realmente cheguem e os números da ficha técnica sobrevivam a uma rodada independente. A postura racional é adotar as duas ao mesmo tempo: manter o líder comprovado no caminho crítico e deixar que o dia em que os pesos forem disponibilizados decida se o recém-chegado merece um teste. Essa é a única comparação neste confronto que ainda não aconteceu — e é a que de fato importará.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
