
Nex-N2.5 Pro vs GPT-5.6 Sol: O Número do Fornecedor do Novato Fica Atrás do Número Independente do Líder Atual
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0455Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0247Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0247Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0157Inteligência82Código
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2646Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Inteligência75Código
- obsidianQwen3.8 27B2026-08-1541Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1251Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0547Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Inteligência49Código
Coloque o único benchmark em que ambos têm um número lado a lado e a ordem das operações está errada para um lançamento. A ficha da Nex-AGI dá ao Nex-N2.5 Pro 56,4 no OSWorld-2, medido no harness NexCUA da própria aliança, que o público não viu. O leaderboard OSWorld 2.0 da BenchLM, atualizado em 29 de agosto, coloca o GPT-5.6 Sol em 62,6 — um número independente que vence de forma inequívoca o número do fabricante do recém-chegado. No território do modelo de um dia — uso de computador por leitura de tela, a única coisa para a qual ele foi criado — o generalista maduro com o qual ele está sendo comparado não precisa nem de um asterisco para sair na frente. Nex-N2.5 Pro vs GPT-5.6 Sol não é uma disputa próxima em nenhuma dimensão medida por alguém além do fabricante do recém-chegado. É um estudo de caso sobre o que vale um histórico de produção, e vale a pena ser lido por esse motivo.
Os dois modelos mal são rivais em intenção. O Nex-N2.5 Pro, anunciado em 8 de setembro de 2026, é um modelo de mistura esparsa de especialistas com 397 bilhões de parâmetros, dos quais cerca de 17 bilhões são ativos, multimodal (texto e imagem na entrada, texto na saída), pós-treinado a partir da linhagem Qwen3.5 e desenvolvido para operar computadores e navegadores por meio de um ciclo de feedback visual. Seus pesos sob licença Apache-2.0 ainda estão marcados como "em breve" no Hugging Face, e suas únicas versões ativas são endpoints hospedados gratuitos que o Nex-AGI linka a partir de sua ficha. O GPT-5.6 Sol é o carro-chefe da OpenAI para "o trabalho mais difícil" — raciocínio profundo em múltiplas etapas, engenharia de software em grande escala e fluxos de trabalho agênticos de longo horizonte — disponível na API desde 9 de julho, com pesos fechados, e agora carregando o peso de ter sido a referência de fronteira até a OpenAI lançar o GPT-6 Astra em 3 de setembro. Enquanto o Nex-N2.5 Pro é um especialista que ainda não disponibilizou seus próprios pesos, o GPT-5.6 Sol é um generalista comprovado que opera há dois meses sob o tráfego de produção mais exigente da indústria.
GPT-5.6 Sol é o modelo com um arquivo
Comece pelo que a Sol tem e a Nex-N2.5 Pro não tem: um histórico. Desde 9 de julho, a GPT-5.6 Sol vem sendo submetida a bancadas de teste independentes, atacada por pesquisadores de segurança e integrada a frameworks de agentes e fluxos de trabalho do Codex. Suas medições independentes são amplas e públicas: 61 no Artificial Analysis Intelligence Index com raciocínio máximo, 88,0 no Terminal-Bench 2.1 e 73,0 no DeepSWE, medidos pela mesma bancada independente, além de uma velocidade de saída medida em torno de 71 tokens por segundo, a um custo de aproximadamente US$ 0,95 por tarefa do Intelligence Index. Nada disso a torna imbatível — a OpenAI, desde então, posicionou a GPT-6 Astra acima dela —, mas cada um desses números é uma medição produzida por alguém que não seja a OpenAI. A Nex-N2.5 Pro não tem nenhuma entrada independente em lugar nenhum, por uma razão estrutural: ninguém fora da aliança pode executá-la.
O único benchmark onde ambos têm um número.
A comparação do OSWorld é a leitura mais limpa disponível, então merece que suas ressalvas sejam declaradas antes de ser usada. O 56,4 da Nex-N2.5 Pro é a própria medição da Nex-AGI no OSWorld-2 por meio de seu harness NexCUA. O 62,6 da GPT-5.6 Sol vem do leaderboard OSWorld 2.0 da BenchLM, um instantâneo de terceiros datado de 29 de agosto de 2026, que lista quinze modelos e coloca Claude Opus 5 em primeiro com 70,6, GPT-5.6 Sol em segundo com 62,6 e GPT-5.6 Terra em terceiro com 50,2. "OSWorld-2" e "OSWorld 2.0" são parentes próximos, mas não se provou que sejam idênticos; portanto, a diferença exata de quatro a seis pontos deve ser lida como direcional, não precisa. O que sobrevive às ressalvas é a ordem: pelo melhor número que cada lado pode apresentar, um número independente da Sol supera um número da Nex divulgado pela fornecedora no benchmark que a Nex escolheu publicar. Um recém-chegado cujo próprio número é mais baixo do que o número independente do incumbente não apresentou um argumento convincente para a mudança.

Envelopes de especificação
O restante da ficha técnica segue na mesma direção:
• Lançado — Nex-N2.5 Pro: 8 de setembro de 2026 (endpoints hospedados ativos, pesos pendentes). GPT-5.6 Sol: 9 de julho de 2026, disponível de forma geral.
• Escala — Nex-N2.5 Pro: 397B no total / ~17B ativos (MoE). GPT-5.6 Sol: número de parâmetros não divulgado.
• Modalidade — Nex-N2.5 Pro: entrada de texto e imagem, saída de texto, loop de visão para uso por computador. GPT-5.6 Sol: entrada de texto, imagem e arquivo, saída de texto, com chamada de ferramentas e modo JSON.
• Contexto / saída — Nex-N2.5 Pro: contexto de 262.144 tokens. GPT-5.6 Sol: contexto de ~1,05M de tokens, com teto de saída de 128K.
• Controlo de raciocínio — Nex-N2.5 Pro: nenhum / médio (adaptativo, predefinido) / alto. GPT-5.6 Sol: esforço de raciocínio até ao máximo, mais um nível de processamento rápido separado.
• Pesos — Nex-N2.5 Pro: Apache-2.0, em breve. GPT-5.6 Sol: fechado.
• Preço por 1 milhão de tokens — Nex-N2.5 Pro: nível gratuito hospedado, sem preço de tabela. GPT-5.6 Sol: US$ 4,00 / US$ 20,00 como preço promocional de tabela desde 21 de agosto, US$ 0,40 para entrada em cache, com nova faixa de preço de US$ 8,00 / US$ 30,00 acima de 272 mil tokens de entrada.
O contexto de ~1,05M de tokens da Sol e o teto de saída de 128K ofuscam a janela de 262K da Nex-N2.5 Pro para trabalhos de longo horizonte, e o preço da Sol, embora longe de ser barato, é um número fixo que um orçamento consegue modelar. O nível gratuito da Nex-N2.5 Pro é o único número a seu favor, e não é um preço.
Quanto vale uma pontuação de um dia

Toda alegação de benchmark associada ao Nex-N2.5 Pro — OSWorld-2 com 56,4, Terminal-Bench 2.1 com 82,7, SWE-Bench Pro com 61,2, BrowseComp com 89,7 — tem uma propriedade em comum: foi produzida pela Nex-AGI, por meio de um harness de avaliação que a aliança afirma que vai disponibilizar como código aberto, mas ainda não disponibilizou. Nenhum desses números foi reproduzido de forma independente, porque nenhum pode ser: os pesos não estão disponíveis para download e não há nenhuma data associada ao banner “em breve”. Isso importa mais neste confronto do que na maioria dos casos, porque o modelo contra o qual o Nex-N2.5 Pro está sendo comparado tem o histórico independente mais longo da indústria. Quando toda a base de evidências do desafiante é autorrelatada e a do atual líder não é, o ônus da prova recai inteiramente sobre o desafiante — e um endpoint gratuito não elimina esse ônus. No momento em que os shards forem disponibilizados e um laboratório independente rodar o Nex-N2.5 Pro, os números deste artigo se tornarão verificáveis e a comparação se tornará real. Até lá, “pontuação de ontem” é a expressão exata — uma pontuação que não pode ser inspecionada em um modelo que não pode ser executado.
Preço, rota e a forma da decisão
O custo é onde os dois lados são menos comparáveis, pois apenas um dos lados tem um custo. A tarifa de US$ 4,00 / US$ 20,00 do GPT-5.6 Sol é o preço promocional de tabela da OpenAI em vigor desde 21 de agosto, com validade anunciada ao menos até 21 de novembro, abaixo dos US$ 5,00 / US$ 30,00 — um corte que tornou o modelo carro-chefe dramaticamente mais acessível para trabalhos agênticos de alto volume e que um roteador de repasse reflete no mesmo dia em que a OpenAI o aplica. O Sol está no OrcaRouter por esse preço de tabela, sem margem, com o nível batch e o nível rápido disponíveis com a mesma chave de API usada por 200+ outros modelos, de modo que uma equipe pode rotear as solicitações que precisam da profundidade da OpenAI para o Sol e modelos mais baratos para todo o resto. O Nex-N2.5 Pro não tem preço de tabela, apenas endpoints hospedados gratuitamente — o que é uma boa forma de avaliar um modelo e uma base pobre para um orçamento de produção. Não é possível planejar gastos em torno de um número que não existe, nem planejar uma arquitetura em torno de pesos que não foram lançados.

A decisão que este confronto de fato impõe é sobre risco, não capacidade. Se você precisa de um modelo que ainda estará disponível no próximo trimestre, com preço conhecido, perfil de falhas conhecido e meses de testes adversariais por trás, o GPT-5.6 Sol é a escolha racional — e o lançamento do GPT-6 Astra pela OpenAI acima dele só reforça o argumento, porque o Sol agora é o cavalo de batalha comprovado, com o corte de preço mirado diretamente no volume de produção. Se você está construindo agentes de uso de computador com pesos abertos e pode se dar ao luxo de esperar por algo verificável, o Nex-N2.5 Pro vale a pena observar — um especialista multimodal com 17B de parâmetros ativos é exatamente o formato de modelo que repetidamente subcotou a fronteira fechada em custo. Mas observar é a palavra-chave. Em todas as dimensões medidas por qualquer pessoa além de seu criador, o Nex-N2.5 Pro fica atrás do modelo que detém o arquivo, e até que os pesos sejam divulgados, é aí que a comparação termina.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
