Um cartão de título hero para o artigo de comparação 'NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max' com a frase 'A semana em que os pesos abertos ficaram sérios', com um ícone de capelo de graduação em forma de caixa aberta à esquerda, um ícone de globo e chip à direita, um selo COMPARAÇÃO DE MODELOS e o logotipo do OrcaRouter composto no canto inferior direito.
Guides & Insights

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max: A Semana em que os Pesos Abertos Ficaram Sérios

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Pesos abertos tiveram uma semana e tanto. Em ou por volta de 12 de agosto de 2026, a Alibaba lançou o primeiro Qwen da classe Max com pesos abertos da história — o Qwen3.8 Max, um carro-chefe de 2,4 trilhões de parâmetros, publicado como Qwen3.8-2.4T-A95B no Hugging Face e no ModelScope. Dois dias depois, em 14 de agosto, a NVIDIA publicou o NVIDIA-Nemotron-Labs-Teacher-General-Reasoning — um professor de raciocínio com 550B de parâmetros e 55B ativos, do pipeline de treinamento do Nemotron 3 Ultra — também no Hugging Face. Ambos são checkpoints enormes, recém-abertos, de laboratórios de fronteira, e a semelhança termina aí. O Qwen3.8 Max é aberto para que você mesmo execute um modelo de fronteira; o NVIDIA-Nemotron-Labs-Teacher-General-Reasoning é aberto para que você treine com ele. Compará-los é, na verdade, perguntar que tipo de equipe você é — mas o fato de ambos terem chegado dentro de 72 horas é um sinal de para onde a indústria está caminhando.

O que cada versão contém de fato

Qwen3.8 Max é o modelo implantável. É um modelo esparso de mistura de especialistas com 2,4 trilhões de parâmetros no total, cerca de 95 bilhões ativos por token em 512 especialistas, construído sobre a arquitetura híbrida da família Qwen3.5. Em sua forma de pesos abertos, é somente texto, com contexto nativo de 262 mil tokens (estendível além de 1M) e — notavelmente — o raciocínio é obrigatório: o modelo emite conteúdo de raciocínio entre as tags `<think>` e não pode ser desativado. A versão de API hospedada que a Alibaba lançou em 3 de agosto adiciona entrada de imagem e vídeo, contexto padrão de 1M e raciocínio opcional. A licença de pesos abertos é uma Licença Qwen3.8 Max personalizada, permissiva, mas com condições baseadas em receita para implantações comerciais de grande porte. Se você tiver hardware multinó, poderá executar um modelo de classe de fronteira em sua própria infraestrutura.

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning é o modelo da fase de treinamento. É um dos mais de dez professores especializados por domínio da receita Multi-Teacher On-Policy Distillation (MOPD) por trás do Nemotron 3 Ultra, derivado do estudante Ultra pós-treinado por meio de um estágio adicional de SFT especializado em raciocínio e aprendizado por reforço. Seu papel nesse pipeline é gerar longas trilhas de raciocínio nos problemas mais difíceis de matemática, lógica e raciocínio abstrato, e atuar como o juiz que avalia respostas de formato livre. Ele é distribuído sob a licença OpenMDW-1.1, amigável para uso comercial, com os dados de pós-treinamento divulgados, e não traz nenhum número de benchmark — a NVIDIA aponta para um gráfico de precisão e o relatório técnico do Ultra em vez disso. Seus clientes são execuções de destilação, não tráfego de produção.

Qwen3.8 Max, o primeiro carro-chefe aberto da classe Max

O lançamento da Alibaba é importante porque os modelos da classe Max Qwen historicamente foram exclusivos de API. O Qwen3.8 Max quebra esse padrão: os pesos podem ser baixados e o modelo é genuinamente de fronteira — a Artificial Analysis lhe atribui um Índice de Inteligência de 58 e um Índice Agêntico de 58, empatando com os melhores generalistas fechados em cenários agênticos. Os destaques divulgados pelo fornecedor são fortes: 93,0 no PaperBench (à frente do GPT-5.6 Sol e do Fable 5), 92,6 no GPQA Diamond, 86,1 no OSWorld-Verified. Os pontos fracos são igualmente reais — 67,7 no SWE-bench Pro e 43,6 no Humanity's Last Exam ficam atrás dos líderes, e testes independentes o consideraram caro por tarefa concluída, com média de 64 turnos por tarefa em execuções agênticas. Na API da Alibaba, o preço é de US$ 2,00 por milhão de tokens de entrada, US$ 6,00 por milhão de saída e US$ 0,25 por milhão de entrada em cache, uma redução de 20% em relação ao preço de preview.

O professor: infraestrutura de treinamento com um cartão de modelo

O NVIDIA-Nemotron-Labs-Teacher-General-Reasoning não está competindo em nenhum desses números porque não publicou nenhum. O que ele oferece, em vez disso, é a mesma arquitetura híbrida LatentMoE Mamba-2 + Transformer do estudante Ultra, até 1M de tokens de contexto e um dial de raciocínio — enable_thinking true/false, um modo medium_effort e um teto rígido de reasoning_budget — que um pipeline de destilação precisa para gastar raciocínio profundo em amostras difíceis e pulá-lo nas fáceis. O hardware mínimo é 4×B200 (ou 8×H100), com serving via vLLM, SGLang ou TensorRT-LLM, e o checkpoint é um download de 1,12 terabyte. Não é implantado por nenhum provedor de inferência, e a NVIDIA não anunciou hospedagem NIM. Este é um lançamento somente de pesos, voltado para laboratórios que já operam grandes frotas de GPUs.

Especificações, lado a lado

• Propósito — Professor: especialista em raciocínio em tempo de treinamento e juiz. Qwen3.8 Max: carro-chefe de fronteira implantável.

• Escala — Professor: 550B total / 55B ativos, LatentMoE com MTP. Qwen3.8 Max: 2.4T total / ~95B ativos, 512 especialistas, Qwen3.5 híbrido.

• Contexto — Teacher: até 1M de tokens, 256K padrão. Qwen3.8 Max: contexto nativo de pesos abertos de 262K, extensível além de 1M; versão de API com 1M padrão.

• Pesos — Professor: OpenMDW-1.1, lançado em 14 de agosto de 2026. Qwen3.8 Max: Licença Qwen3.8 Max, lançada por volta de 12 de agosto de 2026.

• Evidência independente — Professor: nenhuma ainda. Qwen3.8 Max: AA Intelligence Index 58, Agentic Index 58, Coding Index 71.8.

• Raciocínio — Professor: alternância enable_thinking, medium_effort, teto de reasoning_budget. Qwen3.8 Max: obrigatório-ativado em pesos abertos, não pode ser desativado.

• Preço — Teacher: sem preço de tabela, capex de auto-hospedagem. Qwen3.8 Max: $2,00 / $6,00 por milhão de tokens, $0,25 de entrada em cache.

A two-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max. Left column (Nemotron Teacher): training-time reasoning teacher, 55B active (550B total), up to 1M context, OpenMDW-1.1 weights, no independent score yet, self-hosted capex. Right column (Qwen3.8-Max): deployable frontier, 95B active (2.4T total), 262K native context extendable past 1M, Qwen3.8-Max License weights, AA Intelligence Index 58, $2.00/$6.00 per million tokens. Footer notes Qwen figures per Alibaba (vendor-reported) + Artificial Analysis and teacher specs unaudited. OrcaRouter logo composited bottom-right.A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP, up to 1M token context, 10 languages, the OpenMDW-1.1 license tag, and the files and versions listing.

A assimetria de evidências é toda a história.

Qwen3.8 Max foi testado; o professor não. Isso se deve em parte à idade — o Qwen3.8 Max foi lançado em 3 de agosto e já teve duas semanas de execuções em leaderboards, enquanto o professor foi disponibilizado ontem — e em parte à intenção, porque o card do professor nunca teve a pretensão de competir em pontuações. Mas a assimetria tem uma consequência real para a comparação: todo número concreto nesta página com uma fonte atribuída pertence ao Qwen3.8 Max, e todo número atribuído ao professor é uma especificação de arquitetura. A qualidade de raciocínio do professor não foi verificada por ninguém fora da NVIDIA, e os números de nível de família (os valores reportados pelo fornecedor para o aluno Ultra: SWE-Bench Verified 71,9, MMLU-Pro 86,8, LiveCodeBench v6 89,0) descrevem um modelo diferente. Qualquer pessoa que tome uma decisão com base em "qual pontua melhor" precisa esperar por execuções independentes do professor — que é exatamente a lacuna que as próximas semanas devem fechar.

Dois mostradores de pensamento, definidos de forma diferente.

O contraste técnico mais interessante entre estes dois lançamentos é o que acontece quando você pede que eles raciocinem. O Qwen3.8 Max, em sua forma de pesos abertos, não tem escolha: o pensamento está sempre ativo, e o trace de raciocínio faz parte de toda resposta. Isso é ótimo para a qualidade das respostas e para a transparência, mas é caro para geração em massa. O professor trata o raciocínio como um dial: enable_thinking o ativa, medium_effort o limita, e um teto de reasoning_budget o limita. Para um pipeline de destilação, a diferença é decisiva — gerar milhões de traces de raciocínio com um modelo com pensamento sempre ativo multiplica sua conta de tokens, enquanto o interruptor do professor permite pagar por raciocínio profundo somente quando uma amostra difícil o exige. Não são filosofias de design concorrentes; são duas ferramentas otimizadas para extremos opostos do mesmo problema, e cada uma é a ferramenta certa para o seu extremo.

A screenshot of the OrcaRouter model page for Qwen3.8-Max (Qwen) showing the model header, the qwen/qwen3.8-max slug, and the pricing, performance, and public-benchmarks tabs.

A conclusão

Se você quiser rodar um modelo de fronteira no seu próprio hardware — ou consumir um a um preço razoável — Qwen3.8 Max é o lançamento que importa, e ele está no OrcaRouter pelo preço de tabela da Alibaba, repassado com markup de 0%, então o corte de preço que a Alibaba anunciou no lançamento entra em vigor do nosso lado no mesmo dia. Se você quiser treinar ou destilar um modelo de raciocínio — ou auditar o sinal que moldou o Nemotron 3 Ultra — NVIDIA-Nemotron-Labs-Teacher-General-Reasoning é o lançamento que importa, e ele é apenas auto-hospedado por enquanto. A novidade maior é que ambos chegaram na mesma semana: pesos abertos acabaram de passar de "abertos o suficiente para olhar" para "abertos o suficiente para construir em cima", em dois pontos diferentes da cadeia de suprimentos de modelos. Equipes que mantêm sua camada de modelo intercambiável atrás de uma única interface — treinamento auto-hospedado de um lado, inferência de fronteira gerenciada do outro — são as mais bem posicionadas para usar ambos.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente