
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning: O professor de raciocínio de 550B por trás do Nemotron 3 Ultra acabou de se tornar open weights
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
Em 14 de agosto de 2026, a NVIDIA publicou o NVIDIA-Nemotron-Labs-Teacher-General-Reasoning no Hugging Face — um modelo de raciocínio de 550 bilhões de parâmetros que, até ontem, existia apenas dentro do pipeline de treinamento de seu principal modelo, o Nemotron 3 Ultra. Ele é o "teacher" de raciocínio geral da receita de Destilação On-Policy Multi-Teacher (MOPD) que a NVIDIA usou para treinar o "student" Ultra de 550B-A55B, e o lançamento importa por um motivo simples: no relatório técnico do Nemotron 3 Ultra que a NVIDIA publicou em junho, a receita de treinamento afirmava claramente que os checkpoints de cada teacher não seriam disponibilizados em código aberto. Agora este está — pesos, tokenizer, template de chat e configurações de servidor incluídos, sob a licença OpenMDW-1.1, amigável ao uso comercial. Um modelo irmão, o NVIDIA-Nemotron-Labs-Teacher-STEM, foi lançado no mesmo dia, o que soa menos como algo pontual e mais como o início da liberação do painel de teachers.
O que um modelo professor realmente é
MOPD é a técnica de pós-treinamento que dá ao Nemotron 3 Ultra seu raciocínio agêntico. Em vez de destilar um único professor grande em um aluno, a NVIDIA treinou mais de dez professores especializados em domínios — para raciocínio, pesquisa, análise jurídica, engenharia de software, uso de ferramentas e outras áreas — e depois deixou o aluno gerar seus próprios rollouts e usou cada professor para pontuar esses rollouts em sua área de especialização. Como a pontuação ocorre nas saídas on-policy do próprio aluno, em vez de um conjunto de dados offline fixo, o sinal de treinamento permanece alinhado com o que o aluno realmente produz no momento da inferência. A NVIDIA chama o loop de co-evolução: novas rodadas de professores são inicializadas a partir de checkpoints atualizados do aluno, de modo que ambos os lados continuam melhorando.
Este checkpoint é o membro de raciocínio geral desse painel. Ele é produzido a partir do aluno Nemotron 3 Ultra pós-treinado através de uma rodada extra de SFT e aprendizado por reforço intensivos em raciocínio, e o model card o descreve como otimizado para trilhas de raciocínio longas e de alta qualidade nos problemas multi-etapa mais difíceis em matemática, lógica e raciocínio abstrato — incluindo provas formais e programação competitiva. Dentro do MOPD ele desempenha vários papéis ao mesmo tempo, um checkpoint, muitos papéis: geração de trilhas de raciocínio, julgamento matemático e o juiz de equivalência que avalia respostas curtas de formato livre contra uma referência. A NVIDIA também o distribui de forma independente porque é um raciocinador forte por si só — destinado a geração de trilhas de raciocínio de longo horizonte, resolução de problemas difíceis e atuar como professor ou avaliador dentro do seu próprio pipeline de destilação.
As especificações em uma única passada.
• Parâmetros — 550B total / 55B ativos, LatentMoE esparso
• Arquitetura — mistura-de-especialistas latente híbrida Mamba2-Transformer com Previsão Multi-Token (MTP)
• Janela de contexto — até 1M tokens; padrão de 256K nas configurações de serviço de referência
• Idiomas — 10: Inglês, Francês, Espanhol, Italiano, Alemão, Japonês, Hindi, Coreano, Português do Brasil, Chinês
• Licença — OpenMDW-1.1, uso comercial e não comercial permitido
• Hardware mínimo — 4×B200 (pesos NVFP4); GB200/GB300 e classe H100 também suportados
A arquitetura é da mesma família do próprio Nemotron 3 Ultra: o formato 550B-A55B com camadas intercaladas de Mamba-2 e MoE, camadas de atenção selecionadas e cabeçotes MTP para decodificação especulativa nativa. O professor não é um aluno menor — é uma variante da mesma pilha, treinada de forma diferente, especializada em raciocínio de horizonte longo em vez de trabalho agêntico geral.

Por que é importante abrir o código de um professor
Checkpoints de professores são o tipo mais raro de lançamento de modelo aberto. As empresas publicam alunos — os modelos que você implanta — e conjuntos de dados o tempo todo; quase nunca publicam os modelos que avaliaram o trabalho dos alunos. É por isso que a frase do relatório de junho de que checkpoints por professor não seriam lançados foi lida como fechando a porta para a reprodução do pipeline MOPD de ponta a ponta. Este lançamento abre essa porta, pelo menos para o professor de raciocínio.
{{1}}Para equipes que constroem seus próprios modelos de raciocínio, isso é valor concreto.{{/1}} {{2}}O sinal de recompensa que moldou o raciocínio do Nemotron 3 Ultra foi parcialmente escrito por este checkpoint,{{/2}} e agora ele pode ser estudado diretamente, usado como avaliador ou para gerar traces de raciocínio de longo horizonte para dados de SFT. {{3}}Combinado com os dados de pós-treinamento já abertos (nvidia/nemotron-post-training-v3) e as receitas de treinamento publicadas, ele reduz a lacuna entre "a NVIDIA treinou um ótimo modelo" e "podemos treinar um igual."{{/3}}

O mostrador de pensamento
Um recurso distintivo é herdado da família Nemotron 3: o raciocínio é uma chave, não um padrão. O modelo de chat aceita enable_thinking=true/false, uma opção medium_effort e um teto de tokens reasoning_budget, para que um chamador possa forçar raciocínio profundo de longo horizonte quando um problema precisar dele e obter respostas diretas — mais rápidas e baratas — quando não precisar. Para um modelo professor, isso importa mais do que parece: execuções de destilação querem passes de avaliação baratos em amostras fáceis e traços de raciocínio caros em amostras difíceis, e um único checkpoint que suporta ambos os modos elimina a necessidade de trocar modelos no meio do pipeline.
Executando.
Não é um modelo que você vai chamar casualmente. A configuração mínima sensata de serviço é 4×B200 com pesos NVFP4 e um cache KV fp8; as configurações de referência também cobrem caixas multi-nó GB200/GB300 e da classe H100. A NVIDIA publica guias de preparo para três motores — vLLM (0.22), SGLang (0.5.13) e TensorRT-LLM (1.3.0rc17) — todos expondo uma API compatível com OpenAI na porta 8000, com decodificação especulativa MTP ou EAGLE e um backend Mamba flashinfer. O contexto de 1M tokens exige um sinalizador de permissão explícito em cada motor (VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 e equivalentes); o teto padrão é 256K.
Até o momento em que este texto foi escrito, o modelo não é implantado por nenhum provedor de inferência no Hugging Face e a NVIDIA não anunciou hospedagem NIM — este é um lançamento apenas com pesos. Isso o torna um modelo para laboratórios que já operam grandes frotas de GPUs, ou para equipes cujo pipeline de destilação precisa especificamente do sinal exato do professor. Quando ele for disponibilizado em uma API gerenciada, a matemática de preços é simples: este é um MoE com 55B ativos, e quem o hospeda cobra o que as GPUs custam. Em uma camada de roteamento que opera com markup de 0%, você paga o preço de tabela do provedor, sem taxa de plataforma adicional — e a mesma chave que acessa este modelo acessa os modelos de fronteira com os quais você compara seus traces, com failover automático se um host cair. É para isso que serve um roteador como o OrcaRouter; o professor em si é a parte que você hospeda por conta própria.
As advertências honestas
Este é um checkpoint de 24 horas, e o card do modelo contém zero números de benchmark. Isso não é uma omissão neste texto — é o estado do lançamento. A NVIDIA publicou detalhes de arquitetura e treinamento, mas nenhuma tabela de avaliação, e nenhum laboratório independente teve tempo de executá-lo ainda. O ponto de referência mais próximo são os números relatados pelo fornecedor para o aluno: Nemotron 3 Ultra reporta 71,9 no SWE-Bench Verified, 86,8 no MMLU-Pro, 89,0 no LiveCodeBench v6, e aproximadamente 95 no RULER em contexto de 1M. Esses descrevem o aluno Ultra, não este professor, e são números da própria NVIDIA. Qualquer pessoa que planeje uma execução de destilação neste checkpoint deve tratar sua qualidade de raciocínio como não verificada até que pontuações independentes apareçam.
Mais duas ressalvas estão embutidas no card. O corpus pós-treinamento é fortemente ponderado para o inglês — cerca de 8,6 milhões de amostras em inglês contra aproximadamente 138.000 para cada um dos outros nove idiomas — portanto, a qualidade do raciocínio multilíngue não deve ser presumida com base no rótulo de 10 idiomas. E o próprio card chama a atenção para o desequilíbrio de representação nos dados base de treinamento e recomenda auditorias de viés antes do uso downstream.
Quem deveria se importar
Três grupos obtêm valor real aqui. Pesquisadores de destilação finalmente têm um professor MOPD real para dissecar, não apenas uma receita que descreve um. Laboratórios que treinam seus próprios modelos de raciocínio obtêm um gerador de rastros de longo horizonte e um avaliador que veio da mesma linhagem de pós-treinamento do modelo que tentam igualar. E qualquer pessoa que execute RL on-policy pode usá-lo como a NVIDIA fez — como um pontuador para os problemas mais difíceis, com o pensamento ativado apenas onde ele se paga.
Se você não está em nenhum desses grupos, esta versão muda pouco para você hoje: o modelo é grande, não comprovado e apenas para auto-hospedagem, e a maneira mais rápida de agir sobre a tendência subjacente — o surgimento de mais professores de raciocínio abertos — é manter a camada de modelo do seu pipeline intercambiável atrás de uma única interface, em vez de soldada a um único checkpoint.

O que assistir em seguida
Três coisas dirão se isto é um caso isolado ou se o painel está por vir. Primeiro, se professores irmãos seguem o mesmo caminho — NVIDIA-Nemotron-Labs-Teacher-STEM já chegou no mesmo dia, então a questão é quais especialistas de domínio virão a seguir e se eles são ponderados da mesma forma. Segundo, se a NVIDIA NIM ou um host gerenciado começa a servi-los, o que transformaria um lançamento exclusivo para laboratórios em algo que o resto da indústria pode realmente invocar. Terceiro, se benchmarks independentes aparecem — uma entrada no Artificial Analysis ou uma execução no LMArena seria a primeira verificação real sobre se a qualidade de raciocínio do professor corresponde à do aluno que ele treinou.
