
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max: A Semana em que os Pesos Abertos Ficaram Sérios
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 114 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 367 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Pesos abertos tiveram uma semana e tanto. Em ou por volta de 12 de agosto de 2026, a Alibaba lançou o primeiro Qwen da classe Max com pesos abertos da história — o Qwen3.8 Max, um carro-chefe de 2,4 trilhões de parâmetros, publicado como Qwen3.8-2.4T-A95B no Hugging Face e no ModelScope. Dois dias depois, em 14 de agosto, a NVIDIA publicou o NVIDIA-Nemotron-Labs-Teacher-General-Reasoning — um professor de raciocínio com 550B de parâmetros e 55B ativos, do pipeline de treinamento do Nemotron 3 Ultra — também no Hugging Face. Ambos são checkpoints enormes, recém-abertos, de laboratórios de fronteira, e a semelhança termina aí. O Qwen3.8 Max é aberto para que você mesmo execute um modelo de fronteira; o NVIDIA-Nemotron-Labs-Teacher-General-Reasoning é aberto para que você treine com ele. Compará-los é, na verdade, perguntar que tipo de equipe você é — mas o fato de ambos terem chegado dentro de 72 horas é um sinal de para onde a indústria está caminhando.
O que cada versão contém de fato
Qwen3.8 Max é o modelo implantável. É um modelo esparso de mistura de especialistas com 2,4 trilhões de parâmetros no total, cerca de 95 bilhões ativos por token em 512 especialistas, construído sobre a arquitetura híbrida da família Qwen3.5. Em sua forma de pesos abertos, é somente texto, com contexto nativo de 262 mil tokens (estendível além de 1M) e — notavelmente — o raciocínio é obrigatório: o modelo emite conteúdo de raciocínio entre as tags `<think>` e não pode ser desativado. A versão de API hospedada que a Alibaba lançou em 3 de agosto adiciona entrada de imagem e vídeo, contexto padrão de 1M e raciocínio opcional. A licença de pesos abertos é uma Licença Qwen3.8 Max personalizada, permissiva, mas com condições baseadas em receita para implantações comerciais de grande porte. Se você tiver hardware multinó, poderá executar um modelo de classe de fronteira em sua própria infraestrutura.
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning é o modelo da fase de treinamento. É um dos mais de dez professores especializados por domínio da receita Multi-Teacher On-Policy Distillation (MOPD) por trás do Nemotron 3 Ultra, derivado do estudante Ultra pós-treinado por meio de um estágio adicional de SFT especializado em raciocínio e aprendizado por reforço. Seu papel nesse pipeline é gerar longas trilhas de raciocínio nos problemas mais difíceis de matemática, lógica e raciocínio abstrato, e atuar como o juiz que avalia respostas de formato livre. Ele é distribuído sob a licença OpenMDW-1.1, amigável para uso comercial, com os dados de pós-treinamento divulgados, e não traz nenhum número de benchmark — a NVIDIA aponta para um gráfico de precisão e o relatório técnico do Ultra em vez disso. Seus clientes são execuções de destilação, não tráfego de produção.
Qwen3.8 Max, o primeiro carro-chefe aberto da classe Max
O lançamento da Alibaba é importante porque os modelos da classe Max Qwen historicamente foram exclusivos de API. O Qwen3.8 Max quebra esse padrão: os pesos podem ser baixados e o modelo é genuinamente de fronteira — a Artificial Analysis lhe atribui um Índice de Inteligência de 58 e um Índice Agêntico de 58, empatando com os melhores generalistas fechados em cenários agênticos. Os destaques divulgados pelo fornecedor são fortes: 93,0 no PaperBench (à frente do GPT-5.6 Sol e do Fable 5), 92,6 no GPQA Diamond, 86,1 no OSWorld-Verified. Os pontos fracos são igualmente reais — 67,7 no SWE-bench Pro e 43,6 no Humanity's Last Exam ficam atrás dos líderes, e testes independentes o consideraram caro por tarefa concluída, com média de 64 turnos por tarefa em execuções agênticas. Na API da Alibaba, o preço é de US$ 2,00 por milhão de tokens de entrada, US$ 6,00 por milhão de saída e US$ 0,25 por milhão de entrada em cache, uma redução de 20% em relação ao preço de preview.
O professor: infraestrutura de treinamento com um cartão de modelo
O NVIDIA-Nemotron-Labs-Teacher-General-Reasoning não está competindo em nenhum desses números porque não publicou nenhum. O que ele oferece, em vez disso, é a mesma arquitetura híbrida LatentMoE Mamba-2 + Transformer do estudante Ultra, até 1M de tokens de contexto e um dial de raciocínio — enable_thinking true/false, um modo medium_effort e um teto rígido de reasoning_budget — que um pipeline de destilação precisa para gastar raciocínio profundo em amostras difíceis e pulá-lo nas fáceis. O hardware mínimo é 4×B200 (ou 8×H100), com serving via vLLM, SGLang ou TensorRT-LLM, e o checkpoint é um download de 1,12 terabyte. Não é implantado por nenhum provedor de inferência, e a NVIDIA não anunciou hospedagem NIM. Este é um lançamento somente de pesos, voltado para laboratórios que já operam grandes frotas de GPUs.
Especificações, lado a lado
• Propósito — Professor: especialista em raciocínio em tempo de treinamento e juiz. Qwen3.8 Max: carro-chefe de fronteira implantável.
• Escala — Professor: 550B total / 55B ativos, LatentMoE com MTP. Qwen3.8 Max: 2.4T total / ~95B ativos, 512 especialistas, Qwen3.5 híbrido.
• Contexto — Teacher: até 1M de tokens, 256K padrão. Qwen3.8 Max: contexto nativo de pesos abertos de 262K, extensível além de 1M; versão de API com 1M padrão.
• Pesos — Professor: OpenMDW-1.1, lançado em 14 de agosto de 2026. Qwen3.8 Max: Licença Qwen3.8 Max, lançada por volta de 12 de agosto de 2026.
• Evidência independente — Professor: nenhuma ainda. Qwen3.8 Max: AA Intelligence Index 58, Agentic Index 58, Coding Index 71.8.
• Raciocínio — Professor: alternância enable_thinking, medium_effort, teto de reasoning_budget. Qwen3.8 Max: obrigatório-ativado em pesos abertos, não pode ser desativado.
• Preço — Teacher: sem preço de tabela, capex de auto-hospedagem. Qwen3.8 Max: $2,00 / $6,00 por milhão de tokens, $0,25 de entrada em cache.


A assimetria de evidências é toda a história.
Qwen3.8 Max foi testado; o professor não. Isso se deve em parte à idade — o Qwen3.8 Max foi lançado em 3 de agosto e já teve duas semanas de execuções em leaderboards, enquanto o professor foi disponibilizado ontem — e em parte à intenção, porque o card do professor nunca teve a pretensão de competir em pontuações. Mas a assimetria tem uma consequência real para a comparação: todo número concreto nesta página com uma fonte atribuída pertence ao Qwen3.8 Max, e todo número atribuído ao professor é uma especificação de arquitetura. A qualidade de raciocínio do professor não foi verificada por ninguém fora da NVIDIA, e os números de nível de família (os valores reportados pelo fornecedor para o aluno Ultra: SWE-Bench Verified 71,9, MMLU-Pro 86,8, LiveCodeBench v6 89,0) descrevem um modelo diferente. Qualquer pessoa que tome uma decisão com base em "qual pontua melhor" precisa esperar por execuções independentes do professor — que é exatamente a lacuna que as próximas semanas devem fechar.
Dois mostradores de pensamento, definidos de forma diferente.
O contraste técnico mais interessante entre estes dois lançamentos é o que acontece quando você pede que eles raciocinem. O Qwen3.8 Max, em sua forma de pesos abertos, não tem escolha: o pensamento está sempre ativo, e o trace de raciocínio faz parte de toda resposta. Isso é ótimo para a qualidade das respostas e para a transparência, mas é caro para geração em massa. O professor trata o raciocínio como um dial: enable_thinking o ativa, medium_effort o limita, e um teto de reasoning_budget o limita. Para um pipeline de destilação, a diferença é decisiva — gerar milhões de traces de raciocínio com um modelo com pensamento sempre ativo multiplica sua conta de tokens, enquanto o interruptor do professor permite pagar por raciocínio profundo somente quando uma amostra difícil o exige. Não são filosofias de design concorrentes; são duas ferramentas otimizadas para extremos opostos do mesmo problema, e cada uma é a ferramenta certa para o seu extremo.

A conclusão
Se você quiser rodar um modelo de fronteira no seu próprio hardware — ou consumir um a um preço razoável — Qwen3.8 Max é o lançamento que importa, e ele está no OrcaRouter pelo preço de tabela da Alibaba, repassado com markup de 0%, então o corte de preço que a Alibaba anunciou no lançamento entra em vigor do nosso lado no mesmo dia. Se você quiser treinar ou destilar um modelo de raciocínio — ou auditar o sinal que moldou o Nemotron 3 Ultra — NVIDIA-Nemotron-Labs-Teacher-General-Reasoning é o lançamento que importa, e ele é apenas auto-hospedado por enquanto. A novidade maior é que ambos chegaram na mesma semana: pesos abertos acabaram de passar de "abertos o suficiente para olhar" para "abertos o suficiente para construir em cima", em dois pontos diferentes da cadeia de suprimentos de modelos. Equipes que mantêm sua camada de modelo intercambiável atrás de uma única interface — treinamento auto-hospedado de um lado, inferência de fronteira gerenciada do outro — são as mais bem posicionadas para usar ambos.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
