Um cartão hero de título para o 'Nex-N2.5 Mini', com o subtítulo 'Pesos abertos no lançamento — o pequeno agente de uso de computador', chips com 'APACHE-2.0', '35B TOTAL / ~3B ATIVOS' e '262K DE CONTEXTO', e uma faixa com 'ENTRADA DE IMAGEM + TEXTO - REFERÊNCIA 2x H100', com o logo da OrcaRouter composto no canto inferior direito.
Guides & Insights

Nex-N2.5 Mini: Pesos Abertos Já no Lançamento — O Menor Agente de Uso de Computador da Nex-AGI é o Ponto de Entrada

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A maneira de descobrir se agentes abertos de uso de computador estão prontos é agora um modelo que você pode baixar no mesmo dia em que foi anunciado. A Nex-AGI introduziu sua família Nex-N2.5 em 8 de setembro de 2026 — três níveis agênticos, Nex-N2.5 Mini, Nex-N2.5 Pro e Nex-N2.5 Max — e o nível com a proposta de baixar e rodar é o menor. O Nex-N2.5 Mini tem seus pesos Apache-2.0 disponíveis no Hugging Face em dezesseis shards BF16, aproximadamente 35 bilhões de parâmetros, com cerca de 3 bilhões ativos por token, segundo relatos, e uma implantação de referência com duas H100. Seu irmão multimodal maior, o Nex-N2.5 Pro, ainda está marcado como "em breve" até o momento em que escrevo, enquanto o Nex-N2.5 Max, somente texto e com 1,6 trilhão de parâmetros, também já está disponível, mas exige dezesseis H200s em dois nós para rodar. Para qualquer pessoa que esteja testando a tese por trás da família — de que modelos agênticos abertos podem se sustentar em uso de computador de longo horizonte, em vez de apenas responder perguntas — o Mini é a porta de entrada.

Quem é a Nex-AGI? O nome é novo, e o lançamento tem o sabor de uma primeira estreia pública. A cobertura do anúncio descreve o esforço como uma colaboração entre várias organizações de Xangai — o Instituto de Inovação de Xangai, a Xangai Qiji Zhifeng, a Mosi Intelligence e a Kuafu Technology — com a família posicionada como open-source e a equipe operando sob o identificador @NexEcosystem. A ficha do modelo credita o Nex-N2.5-mini e o Nex-N2.5-Pro por darem continuidade "às bases multimodais do Nex-N2", o lançamento anterior da Nex cujos pesos já estão abertos. O que é genuinamente novo aqui é o enquadramento: a Nex-AGI afirma ter construído esses modelos para tarefas de longo horizonte em ambientes do mundo real — operar um computador, dirigir um navegador, executar e testar código e corrigir o curso a partir do que vê na tela — e publicou os pesos para tornar essa afirmação testável.

Três níveis, um anúncio

A família se divide por escala e por modalidade, e as diferenças importam mais do que o nome compartilhado:

• Nex-N2.5 Mini — cerca de 35B no total / ~3B ativos, um modelo multimodal que aceita imagens e texto, voltado para uso visual de computador, navegação e tarefas que precisam de feedback de uma interface. A implantação de referência é um único nó com dois H100.

• Nex-N2.5 Pro — {{1}}relatados 397B de parâmetros totais / ~17B ativos{{/1}}, {{2}}também multimodal{{/2}}, {{3}}para workloads mais pesados de uso de computador{{/3}}. {{4}}A implantação de referência é oito H100s{{/4}}. {{5}}Seus pesos não estavam disponíveis para download no lançamento{{/5}}.

• Nex-N2.5 Max — 1,6T total / ~49B ativos, somente texto e, segundo a Nex-AGI, seu "primeiro esforço completo de pós-treinamento em escala de trilhão de parâmetros". A ficha técnica diz que ele é construído sobre uma base DeepSeek-V4-Pro-Base. A implantação de referência é 16×H200 em dois nós.

Todos os três são mixture-of-experts. O Mini e o Pro fazem parte da família de modelos Qwen3.5 — os materiais de lançamento da Nex-AGI descrevem ambos como pós-treinados a partir de variantes do Qwen3.5, e a configuração do próprio Mini traz a tag de arquitetura qwen3_5_moe — enquanto o Max é a exceção baseada no DeepSeek. Portanto, a família não é uma única receita em três tamanhos; são duas receitas, com as versões multimodais de "fazer coisas na tela" compartilhando uma linhagem e o gigante de raciocínio textual em outra.

O que realmente é o Nex-N2.5 Mini que foi enviado.

O repositório Hugging Face de nex-agi/Nex-N2.5-mini é um checkpoint real, baixável, não um espaço reservado — 16 shards safetensors com cerca de 70 GB no total, BF16, licença Apache-2.0, criado pela primeira vez em 8 de setembro. O arquivo de configuração é específico o suficiente para projetar com base nele:

Arquitetura — Qwen3_5MoeForConditionalGeneration, da família qwen3_5_moe, com uma pilha de visão: o card a classifica como image-text-to-text, e o repositório inclui o preprocessor_config.json juntamente com o config de texto.

• Formato — 40 camadas, tamanho oculto 2048, atenção de consulta agrupada com 16 cabeças de consulta e 2 cabeças KV, um vocabulário de 248.320.

MoE — 256 especialistas roteados com 8 ativos por token, além de um especialista compartilhado, tamanho intermediário de 512 — o perfil de ativação esparsa que torna um modelo "classe 35B" com ~3B ativos executável em duas H100s.

• Contexto — max_position_embeddings de 262.144 tokens na configuração lançada, o mesmo valor de 262K que aparece nas receitas de implantação da família.

• Pesos e licença — BF16, Apache-2.0, sem gating; o repositório também aponta para um espelho do ModelScope e para uma organização no GitHub (nex-agi) que contém as receitas de implantação da família.

A documentação de implantação do Nex-AGI é a parte em que a maioria dos lançamentos de código aberto erra, e esta acerta de forma incomum. O Mini é servido por meio de uma imagem Docker personalizada do SGLang (nexagi/sglang:v0.5.18-nex-patch) em um único nó com duas GPUs H100 usando paralelismo de tensor 2. A amostragem recomendada é temperatura 0,7, top_p 0,95 e top_k 40. A chamada de ferramentas é executada pelo parser qwen3_coder do SGLang, e o modelo expõe três modos de raciocínio por meio de um campo reasoning_effort — “none” para pensamento desativado, “medium” (o padrão adaptativo) e “high” para pensamento sempre ativo. Para um pequeno modelo agêntico, esse controle do modo de pensamento é a diferença entre um loop de agente utilizável e um lento, e está embutido na receita de implantação em vez de ser deixado para o usuário.

A single-column scoreboard titled 'Nex-N2.5 Mini - the scoreboard' with rows 'Params: 35B total / ~3B active (vendor-reported)', 'Architecture: qwen3_5_moe MoE - 256 experts / 8 active', 'Context: 262,144 tokens', 'Input: image + text', 'License: Apache-2.0 - BF16 weights live' and 'OSWorld-Verified: 71.2 (vendor-reported)', with a footer 'Specs from the HF config; benchmarks are Nex-AGI-reported, no independent run yet.'

Pesos: o que é realmente baixável

O status no dia do lançamento das três versões merece ser declarado com precisão, porque o anúncio e os repositórios não estão totalmente alinhados. No momento em que este artigo foi escrito, o Mini está totalmente disponível para download sob a licença Apache-2.0 — é nele que este artigo se baseia. O Nex-N2.5 Max também já está no ar, com seu repositório no Hugging Face contendo 644 fragmentos safetensors, embora reproduzir seu escopo de trilhão de parâmetros seja um projeto que exige 16×H200. O Nex-N2.5 Pro é o pendente: seu repositório no Hugging Face existe, mas contém apenas o README e as figuras, sem fragmentos de modelo, e a ficha técnica ainda informa que os pesos estão por vir. Se a versão que lhe interessa é a multimodal maior, é essa a lacuna a observar — os materiais de lançamento descrevem o Pro como o modelo mais forte da família para uso em computador, e é exatamente o que você ainda não consegue executar localmente.

A screenshot of the Hugging Face repository page for nex-agi/Nex-N2.5-mini (captured September 9, 2026), showing the model header with Text Generation / Transformers / Safetensors / qwen3_5_moe / image-text-to-text / conversational tags and 'License: apache-2.0', and the Files & versions tree for the main branch listing config.json, README.md, chat_template.jinja and the figures directory.

Os números que a Nex-AGI reportou — e a ressalva que os acompanha

A ficha do modelo da Nex-AGI inclui uma tabela completa de benchmarks para o Mini, e todos os números nela são do próprio fornecedor. Nenhuma execução independente havia sido publicada até a data desta redação, e a ficha é explícita ao afirmar que as pontuações vêm de leaderboards oficiais de benchmarks e dos relatórios de avaliação mais recentes, quando disponíveis, e das próprias avaliações da Nex-AGI nos demais casos. Os resultados de codificação foram produzidos com o harness NexAU da equipe; os resultados de uso de computador e navegador usaram o harness NexCUA, que, segundo a ficha, será open-source. Trate as linhas de destaque como o melhor cenário do fornecedor até que uma parte neutra as reproduza.

Com esse enquadramento, as linhas relatadas do Mini são: em trabalho de texto e código, Terminal-Bench 2.1 em 73.4, SWE-Bench Pro em 43.8, DeepSWE v1.1 em 36.1, AutomationBench v1.0.6 em 32.3, Toolathlon Verified em 54.6, BrowseComp em 83.4 e uma pontuação GDPval-AA v2 de 1446. No lado multimodal/uso de computador, os destaques são OSWorld-Verified em 71.2, WebArena-Verified em 63.4, WebTest em 48.6 (executado em modo oracle contra listas de verificação de ground truth), OSWorld-G em 82.9 e OmniDoc em 89.7, juntamente com resultados mais modestos de OSWorld-2 (30.5) e Vision2Web (52.9).

Duas notas de leitura. Primeiro, OSWorld-Verified e OSWorld-2 são suítes diferentes — uma é um subconjunto verificado, avaliado a partir do estado resultante do ambiente; a outra é uma execução mais recente e geralmente mais severa — portanto, um 71.2 em uma e um 30.5 na outra não são contraditórios: são testes diferentes, e a própria tabela da Nex os mantém em colunas separadas. Segundo, em cada linha da tabela da família, o Mini pontua abaixo do Pro e do Max, e o topo de cada coluna pertence a um modelo de fronteira já estabelecido, como o Claude Opus 5 ou o GPT-5.6 Sol. A história do Mini não é que ele supere os modelos de fronteira; é que um modelo aberto com ~3B de parâmetros ativos apresenta pontuações competitivas em benchmarks de uso de computador com uma pegada de dois H100. Se isso se sustenta, é exatamente a pergunta que os pesos abertos permitem que você responda por si mesmo.

Executando Nex-N2.5 Mini hoje

A receita de dois H100 faz do Mini a forma mais barata de colocar a mão na massa com a afirmação central da família. Como a arquitetura é Qwen3.5-MoE padrão com um parser de chamada de ferramentas qwen3_coder, ela carrega no fork do SGLang da Nex-AGI sem código de inferência personalizado, e as configurações recomendadas são publicadas em vez de deixadas para engenharia reversa. A expectativa honesta a se definir antes de começar é que um checkpoint de um dia com um harness novinho em folha é um experimento, não uma dependência. Os downloads no repositório do Mini ainda estão em dígitos únicos e nenhum terceiro havia publicado uma avaliação independente quando isto foi escrito — o que é o estado normal para um modelo lançado ontem, e a razão pela qual o footprint de dois H100 importa: você pode executar o experimento você mesmo esta semana, em vez de esperar que outra pessoa o faça.

A screenshot of the nex-agi collections page on Hugging Face (captured September 9, 2026), showing the Nex-N2.5 collection 'updated about 7 hours ago' with the three model entries nex-agi/Nex-N2.5-Max (Text Generation, 1.6T), nex-agi/Nex-N2.5-Pro and nex-agi/Nex-N2.5-mini, alongside the earlier Nex-N2, Nex-N1.1 and Nex-N1 collections listed on the left.

Se preferir comparar o Mini com os agentes de fronteira na própria tabela de benchmark dele em vez de ajustar manualmente uma única implantação, é aí que uma camada de roteamento mostra seu valor. Quando um provedor hospedado lista o Nex-N2.5 Mini — e os concorrentes estabelecidos com os quais ele é medido já são acessíveis por meio de roteadores — uma API com mais de 200 modelos, com preços de tabela dos provedores repassados com margem de 0% e failover automático, é o jeito barato de rodar a mesma tarefa contra vários deles sem uma segunda integração. No OrcaRouter, essa é a configuração padrão para todo modelo que roteamos: a mesma chave, o mesmo formato de chamada, o preço do próprio fornecedor sem nada acrescentado. Isso é o que mais importa para um modelo ainda não comprovado como este, porque é o failover que permite testá-lo em um caminho real sem apostar o caminho nele.

Quem deve puxar esses pesos?

Baixe-os se o seu trabalho envolve agentes de computer-use, automação de navegador ou uso de ferramentas com base visual, e você quiser um modelo com licença permissiva e auto-hospedável para comparar com os líderes hospedados. A licença Apache-2.0 elimina o atrito habitual em um lançamento de laboratório chinês, o requisito de dois H100 está ao alcance de uma equipe séria de agentes, e o controle de esforço de raciocínio, somado a um parser real de chamadas de ferramenta, faz dele uma bancada de testes confiável, não um brinquedo. Espere se você precisar do modelo mais forte de computer-use da família — esse é o papel do Pro, e os pesos do Pro são justamente os que ainda estão pendentes. E mantenha o rótulo do fornecedor em cada linha de benchmark até que uma execução independente os confirme; um 71,2 no OSWorld-Verified vindo de um modelo aberto com ~3B ativos é uma alegação impressionante — exatamente o tipo de alegação que vale a pena verificar no seu próprio harness antes de construir sobre ela.

O que assistir a seguir. A redução de peso do Pro é o maior sinal isolado — ela transforma a família de "Mini mais um gigante de trilhão de parâmetros" na linha completa que os materiais de lançamento descrevem. A segunda é a disponibilização em código aberto do harness NexCUA, sem o qual os números de uso de computador não podem ser reproduzidos de forma independente sob o mesmo protocolo. A terceira é a primeira execução neutra, da Artificial Analysis, de um laboratório universitário ou de um profissional que publique sua reprodução verificada pelo OSWorld. Quando qualquer uma dessas três ocorrer, a questão que este lançamento apresenta — se os modelos agênticos abertos realmente fecharam a lacuna em relação às pilhas hospedadas de uso de computador — deixa de ser uma questão de tabelas do fornecedor.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente