Hero 'Nex-N2.5 Pro vs GPT-5.6 Sol' — um cartão de título gerado exibindo 'Nex-N2.5 Pro vs GPT-5.6 Sol' com o subtítulo 'Um modelo aberto com apenas um dia de vida contra o registro de produção mais profundo da indústria' e um overline 'OpenAI vs Nex-AGI — setembro de 2026'.
Guides & Insights

Nex-N2.5 Pro vs GPT-5.6 Sol: O Número do Fornecedor do Novato Fica Atrás do Número Independente do Líder Atual

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque o único benchmark em que ambos têm um número lado a lado e a ordem das operações está errada para um lançamento. A ficha da Nex-AGI dá ao Nex-N2.5 Pro 56,4 no OSWorld-2, medido no harness NexCUA da própria aliança, que o público não viu. O leaderboard OSWorld 2.0 da BenchLM, atualizado em 29 de agosto, coloca o GPT-5.6 Sol em 62,6 — um número independente que vence de forma inequívoca o número do fabricante do recém-chegado. No território do modelo de um dia — uso de computador por leitura de tela, a única coisa para a qual ele foi criado — o generalista maduro com o qual ele está sendo comparado não precisa nem de um asterisco para sair na frente. Nex-N2.5 Pro vs GPT-5.6 Sol não é uma disputa próxima em nenhuma dimensão medida por alguém além do fabricante do recém-chegado. É um estudo de caso sobre o que vale um histórico de produção, e vale a pena ser lido por esse motivo.

Os dois modelos mal são rivais em intenção. O Nex-N2.5 Pro, anunciado em 8 de setembro de 2026, é um modelo de mistura esparsa de especialistas com 397 bilhões de parâmetros, dos quais cerca de 17 bilhões são ativos, multimodal (texto e imagem na entrada, texto na saída), pós-treinado a partir da linhagem Qwen3.5 e desenvolvido para operar computadores e navegadores por meio de um ciclo de feedback visual. Seus pesos sob licença Apache-2.0 ainda estão marcados como "em breve" no Hugging Face, e suas únicas versões ativas são endpoints hospedados gratuitos que o Nex-AGI linka a partir de sua ficha. O GPT-5.6 Sol é o carro-chefe da OpenAI para "o trabalho mais difícil" — raciocínio profundo em múltiplas etapas, engenharia de software em grande escala e fluxos de trabalho agênticos de longo horizonte — disponível na API desde 9 de julho, com pesos fechados, e agora carregando o peso de ter sido a referência de fronteira até a OpenAI lançar o GPT-6 Astra em 3 de setembro. Enquanto o Nex-N2.5 Pro é um especialista que ainda não disponibilizou seus próprios pesos, o GPT-5.6 Sol é um generalista comprovado que opera há dois meses sob o tráfego de produção mais exigente da indústria.

GPT-5.6 Sol é o modelo com um arquivo

Comece pelo que a Sol tem e a Nex-N2.5 Pro não tem: um histórico. Desde 9 de julho, a GPT-5.6 Sol vem sendo submetida a bancadas de teste independentes, atacada por pesquisadores de segurança e integrada a frameworks de agentes e fluxos de trabalho do Codex. Suas medições independentes são amplas e públicas: 61 no Artificial Analysis Intelligence Index com raciocínio máximo, 88,0 no Terminal-Bench 2.1 e 73,0 no DeepSWE, medidos pela mesma bancada independente, além de uma velocidade de saída medida em torno de 71 tokens por segundo, a um custo de aproximadamente US$ 0,95 por tarefa do Intelligence Index. Nada disso a torna imbatível — a OpenAI, desde então, posicionou a GPT-6 Astra acima dela —, mas cada um desses números é uma medição produzida por alguém que não seja a OpenAI. A Nex-N2.5 Pro não tem nenhuma entrada independente em lugar nenhum, por uma razão estrutural: ninguém fora da aliança pode executá-la.

O único benchmark onde ambos têm um número.

A comparação do OSWorld é a leitura mais limpa disponível, então merece que suas ressalvas sejam declaradas antes de ser usada. O 56,4 da Nex-N2.5 Pro é a própria medição da Nex-AGI no OSWorld-2 por meio de seu harness NexCUA. O 62,6 da GPT-5.6 Sol vem do leaderboard OSWorld 2.0 da BenchLM, um instantâneo de terceiros datado de 29 de agosto de 2026, que lista quinze modelos e coloca Claude Opus 5 em primeiro com 70,6, GPT-5.6 Sol em segundo com 62,6 e GPT-5.6 Terra em terceiro com 50,2. "OSWorld-2" e "OSWorld 2.0" são parentes próximos, mas não se provou que sejam idênticos; portanto, a diferença exata de quatro a seis pontos deve ser lida como direcional, não precisa. O que sobrevive às ressalvas é a ordem: pelo melhor número que cada lado pode apresentar, um número independente da Sol supera um número da Nex divulgado pela fornecedora no benchmark que a Nex escolheu publicar. Um recém-chegado cujo próprio número é mais baixo do que o número independente do incumbente não apresentou um argumento convincente para a mudança.

A two-column scoreboard titled 'Nex-N2.5 Pro vs GPT-5.6 Sol — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; Weights Apache-2.0 pending; OSWorld 2.0 56.4 vendor-reported; AA Index no score yet; Context 262,144; Price free hosted / no list. Right column GPT-5.6 Sol: Released Jul 9 2026; Weights closed; OSWorld 2.0 62.6 independent; AA Index 61 (max); Context ~1.05M; Price $4.00 / $20.00 per 1M. Footer: 'Nex figures vendor-reported via NexCUA harness; Sol OSWorld per BenchLM Aug 29 and Index per Artificial Analysis.'

Envelopes de especificação

O restante da ficha técnica segue na mesma direção:

Lançado — Nex-N2.5 Pro: 8 de setembro de 2026 (endpoints hospedados ativos, pesos pendentes). GPT-5.6 Sol: 9 de julho de 2026, disponível de forma geral.

Escala — Nex-N2.5 Pro: 397B no total / ~17B ativos (MoE). GPT-5.6 Sol: número de parâmetros não divulgado.

Modalidade — Nex-N2.5 Pro: entrada de texto e imagem, saída de texto, loop de visão para uso por computador. GPT-5.6 Sol: entrada de texto, imagem e arquivo, saída de texto, com chamada de ferramentas e modo JSON.

Contexto / saída — Nex-N2.5 Pro: contexto de 262.144 tokens. GPT-5.6 Sol: contexto de ~1,05M de tokens, com teto de saída de 128K.

Controlo de raciocínio — Nex-N2.5 Pro: nenhum / médio (adaptativo, predefinido) / alto. GPT-5.6 Sol: esforço de raciocínio até ao máximo, mais um nível de processamento rápido separado.

Pesos — Nex-N2.5 Pro: Apache-2.0, em breve. GPT-5.6 Sol: fechado.

Preço por 1 milhão de tokens — Nex-N2.5 Pro: nível gratuito hospedado, sem preço de tabela. GPT-5.6 Sol: US$ 4,00 / US$ 20,00 como preço promocional de tabela desde 21 de agosto, US$ 0,40 para entrada em cache, com nova faixa de preço de US$ 8,00 / US$ 30,00 acima de 272 mil tokens de entrada.

O contexto de ~1,05M de tokens da Sol e o teto de saída de 128K ofuscam a janela de 262K da Nex-N2.5 Pro para trabalhos de longo horizonte, e o preço da Sol, embora longe de ser barato, é um número fixo que um orçamento consegue modelar. O nível gratuito da Nex-N2.5 Pro é o único número a seu favor, e não é um preço.

Quanto vale uma pontuação de um dia

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

Toda alegação de benchmark associada ao Nex-N2.5 Pro — OSWorld-2 com 56,4, Terminal-Bench 2.1 com 82,7, SWE-Bench Pro com 61,2, BrowseComp com 89,7 — tem uma propriedade em comum: foi produzida pela Nex-AGI, por meio de um harness de avaliação que a aliança afirma que vai disponibilizar como código aberto, mas ainda não disponibilizou. Nenhum desses números foi reproduzido de forma independente, porque nenhum pode ser: os pesos não estão disponíveis para download e não há nenhuma data associada ao banner “em breve”. Isso importa mais neste confronto do que na maioria dos casos, porque o modelo contra o qual o Nex-N2.5 Pro está sendo comparado tem o histórico independente mais longo da indústria. Quando toda a base de evidências do desafiante é autorrelatada e a do atual líder não é, o ônus da prova recai inteiramente sobre o desafiante — e um endpoint gratuito não elimina esse ônus. No momento em que os shards forem disponibilizados e um laboratório independente rodar o Nex-N2.5 Pro, os números deste artigo se tornarão verificáveis e a comparação se tornará real. Até lá, “pontuação de ontem” é a expressão exata — uma pontuação que não pode ser inspecionada em um modelo que não pode ser executado.

Preço, rota e a forma da decisão

O custo é onde os dois lados são menos comparáveis, pois apenas um dos lados tem um custo. A tarifa de US$ 4,00 / US$ 20,00 do GPT-5.6 Sol é o preço promocional de tabela da OpenAI em vigor desde 21 de agosto, com validade anunciada ao menos até 21 de novembro, abaixo dos US$ 5,00 / US$ 30,00 — um corte que tornou o modelo carro-chefe dramaticamente mais acessível para trabalhos agênticos de alto volume e que um roteador de repasse reflete no mesmo dia em que a OpenAI o aplica. O Sol está no OrcaRouter por esse preço de tabela, sem margem, com o nível batch e o nível rápido disponíveis com a mesma chave de API usada por 200+ outros modelos, de modo que uma equipe pode rotear as solicitações que precisam da profundidade da OpenAI para o Sol e modelos mais baratos para todo o resto. O Nex-N2.5 Pro não tem preço de tabela, apenas endpoints hospedados gratuitamente — o que é uma boa forma de avaliar um modelo e uma base pobre para um orçamento de produção. Não é possível planejar gastos em torno de um número que não existe, nem planejar uma arquitetura em torno de pesos que não foram lançados.

Screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), marked FEATURED, showing the header stats $4.00 input and $20.00 output per million tokens and the byline 'by OpenAI - 2026-07-09'.

A decisão que este confronto de fato impõe é sobre risco, não capacidade. Se você precisa de um modelo que ainda estará disponível no próximo trimestre, com preço conhecido, perfil de falhas conhecido e meses de testes adversariais por trás, o GPT-5.6 Sol é a escolha racional — e o lançamento do GPT-6 Astra pela OpenAI acima dele só reforça o argumento, porque o Sol agora é o cavalo de batalha comprovado, com o corte de preço mirado diretamente no volume de produção. Se você está construindo agentes de uso de computador com pesos abertos e pode se dar ao luxo de esperar por algo verificável, o Nex-N2.5 Pro vale a pena observar — um especialista multimodal com 17B de parâmetros ativos é exatamente o formato de modelo que repetidamente subcotou a fronteira fechada em custo. Mas observar é a palavra-chave. Em todas as dimensões medidas por qualquer pessoa além de seu criador, o Nex-N2.5 Pro fica atrás do modelo que detém o arquivo, e até que os pesos sejam divulgados, é aí que a comparação termina.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente