Cartão de título em destaque para o Nemotron-3-Labs-Ultra-Math-RL, com o subtítulo 'O checkpoint de RL da IMO 2026, disponibilizado em código aberto sem alarde', e com chips de especificação que exibem '550B total / 55B ativo', 'Licença OpenMDW-1.1', 'Lançado em setembro de 2026'.
Engineering & Research

Nemotron-3-Labs-Ultra-Math-RL: NVIDIA disponibilizou silenciosamente o checkpoint de RL por trás de sua participação na IMO 2026

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A NVIDIA disponibilizou Nemotron-3-Labs-Ultra-Math-RL no Hugging Face entre os dias 2 e 3 de setembro de 2026, sem post de blog, sem anúncio no X e sem comunicado à imprensa — a ficha do modelo simplesmente aparece, datada de 3 de setembro, e se explica em uma linha: é o checkpoint de aprendizado por reforço, referido como "Nemotron-3-Ultra-RL" no relatório técnico da NVIDIA que acompanha o modelo, que foi "implantado como parte de um sistema de ensemble que alcançou uma pontuação em nível de medalha de ouro na Olimpíada Internacional de Matemática de 2026." A pontuação oficial desse sistema — 30 de 42 pontos, acima do limite de ouro de 29 pontos — foi amplamente noticiada no final de julho, quando os pesos do modelo base já eram públicos desde junho. O que não estava disponível para download na época era o par de especialistas pós-treinados que foram de fato usados na execução da competição. Um deles agora está em um repositório público do Hugging Face com zero curtidas e uma contagem de downloads quase zero.

Esta é a história de um lançamento discreto, portanto vale a pena ser preciso sobre o que é possível saber e o que não é. O que se sabe, a partir do repositório e do relatório: a arquitetura do checkpoint, sua receita de treinamento, o papel que desempenhou na submissão da IMO 2026 e os conjuntos de dados e benchmarks que a NVIDIA lançou juntamente com ele. Ainda não confirmado: nenhum anúncio de fornecedor, nenhum benchmark independente de terceiros deste checkpoint e nenhuma API hospedada — este é um lançamento de pesos para auto-hospedagem sob a licença OpenMDW-1.1, e executá-lo significa provisionar aproximadamente 1,5 TB de HBM de classe Blackwell.

O que realmente foi lançado esta semana

O repositório nvidia/Nemotron-3-Labs-Ultra-Math-RL foi criado no Hugging Face em 2 de setembro de 2026 (19:11 UTC) e modificado pela última vez em 8 de setembro. Ele é um item em um lançamento coordenado reunido sob nvidia/nemotron-labs-imo-2026, que contém:

• Os dois checkpoints de competição pós-treinados — Nemotron-3-Labs-Ultra-Math-RL (este assunto) e seu irmão ajustado por supervisão Nemotron-3-Labs-Ultra-Math-SFT, ambos sob OpenMDW-1.1.

• Os dois corpora de treinamento por trás deles — Nemotron-Math-Proofs-v3-SFT e Nemotron-Math-Proofs-v3-RL, ambos CC-BY-4.0.

• Nemotron-IMO-Bench, um novo benchmark de avaliação com 200 problemas inéditos de nível olímpico (50 de álgebra, 50 de combinatória, 50 de geometria, 50 de teoria dos números), cada um acompanhado de uma prova de referência curada por humanos, criado com o matemático Titu Andreescu especificamente para que os problemas não possam aparecer em nenhum conjunto de treinamento.

• O checkpoint base NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, a partir do qual todos são fine-tunados.

A descrição da coleção aponta para o relatório técnico que amarra tudo: "An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics" (o PDF no repositório NeMo-Skills da NVIDIA está datado de 8 de setembro de 2026). Junto com os checkpoints, a NVIDIA disponibilizou o pipeline de inferência, as provas submetidas, a receita de treinamento por RL e um registro completo dos custos computacionais da execução da competição. O enquadramento é explicitamente de ciência reproduzível: é a NVIDIA dizendo, aqui está tudo o que é necessário para reconstruir o sistema.

O que é Nemotron-3-Labs-Ultra-Math-RL

Arquiteturalmente, este não é um novo modelo base — é um fine-tuning do modelo de disponibilidade geral NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, o checkpoint híbrido de Mamba2–Transformer com Latent Mixture-of-Experts que a NVIDIA lançou pela primeira vez em 4 de junho de 2026. O checkpoint Math-RL mantém essa arquitetura e escala: 550B de parâmetros totais com 55B ativos, predição multi-token e suporte a janelas de contexto de até 1M de tokens. O que o treinamento RL muda é a especialização, e ela é deliberadamente restrita:

• Objetivo — resolver problemas difíceis de matemática competitiva e atuar como juiz de provas: o modelo é treinado para produzir uma solução rigorosa, autoavaliá-la de acordo com uma rubrica de 0 / 0,5 / 1 e identificar erros em provas.

• Não é um chatbot de propósito geral — o cartão e o relatório descrevem um trabalhador especializado para um pipeline de busca de provas, não um assistente que segue instruções.

{{1}}Licença{{/1}} — OpenMDW-1.1, a licença permissiva de modelo aberto da NVIDIA que permite uso comercial e não comercial, assim como a versão base e os lançamentos anteriores de professores do Nemotron Labs.

• Implantação — não há preço de tabela para versão hospedada em lugar nenhum; você baixa os safetensors e faz auto-hospedagem. A configuração de referência da NVIDIA é um único nó de 8× B200 (~1,5 TB de HBM agregado), com opções multinó em H100/H200/GB200/GB300. O vLLM é o runtime recomendado, com um parser de raciocínio, o parser de chamada de ferramentas Qwen3-Coder, configurações de cache SSM do Mamba e decodificação especulativa MTP em 5 tokens, todos destacados na ficha técnica.

Single-column scoreboard for Nemotron-3-Labs-Ultra-Math-RL: Released Sep 2026 quiet drop; Base Nemotron-3-Ultra-550B-A55B; 550B total / 55B active; IMO 2026 system 30/42 with gold cutoff 29; RL data 9,597 proof prompts; License OpenMDW-1.1. Footer: the IMO 2026 score is NVIDIA's system result, not this checkpoint alone; no independent scores yet.

Por que este checkpoint é importante: ele estava dentro do sistema IMO 2026

O resultado da IMO 2026 é o motivo pelo qual qualquer pessoa está olhando para este modelo, então a distinção que importa é: o 30/42 é uma pontuação de sistema, não uma pontuação de modelo único. A submissão da NVIDIA foi um pipeline de dois estágios com múltiplos checkpoints, e o Nemotron-3-Labs-Ultra-Math-RL era um componente com duas funções.

De acordo com o relatório, a primeira etapa executou uma busca iterativa de gerar–verificar–refinar por até oito rodadas por problema. A primeira rodada amostrou 384 tentativas de prova — 16 de cada um de oito prompts de estratégia de solução diferentes, de cada um dos três checkpoints: o modelo de disponibilidade geral, o especialista SFT e o especialista RL. A verificação em tempo de busca usou os checkpoints RL e SFT como um painel de dois modelos: oito julgamentos independentes de cada um, e uma prova era aceita somente se todos os 16 julgamentos a pontuassem como 1. Uma etapa posterior de alto poder computacional reavaliou cada finalista com todos os três checkpoints (16 julgamentos estilo IMO cada, em uma escala de 0 a 7) e selecionou a única submissão por problema.

O resultado oficial, conforme relatado no artigo e coincidindo com a cobertura do fim de julho: 30 de 42 pontos na prova do IMO 2026, acima do corte de 29 pontos para a medalha de ouro, com pontuação máxima nos Problemas 1, 2, 4 e 5 e um ponto em cada um dos Problemas 3 e 6, avaliados pelos avaliadores oficiais do IMO. O próprio registro de recursos da NVIDIA afirma que todas as seis provas submetidas foram encontradas dentro de aproximadamente 707 milhões de tokens gerados e 1.464 horas de GPU GB200; a conclusão das rodadas em andamento elevou a execução completa para cerca de 2,31 bilhões de tokens e 4.800 horas de GPU GB200.

Dois números internos do relatório ajudam a entender por que o checkpoint de RL conquistou seu lugar no ensemble. No conjunto de desenvolvimento de 30 problemas da NVIDIA, avaliado por um júri independente composto por GPT-5.5, Gemini 3.1 Pro e Claude Opus 4.8 seguindo um procedimento no estilo MathArena, o especialista em RL foi o melhor pipeline de checkpoint único de ponta a ponta (180 de um total possível de 210 pontos do júri, contra 165 para o especialista em SFT e 162 para o modelo base), embora o checkpoint de SFT tenha resolvido mais problemas na primeira rodada. E em um conjunto de auditoria de 300 provas, o painel de verificação RL+SFT implantado reduziu a taxa de falsa aceitação — a falha que encerra a busca em uma prova inválida — para cerca de 1,1%, contra 12,4% para o checkpoint de RL julgando sozinho e 31,6% para o modelo base. O argumento do relatório é que os dois especialistas seletivos capturam os erros um do outro sob uma regra de unanimidade.

Estas são ablações da própria NVIDIA em seu próprio conjunto de desenvolvimento, relatadas no artigo da NVIDIA — vale a pena tratá-las como evidência relatada pelo fornecedor de por que o design funciona, não como pontuações independentes. O conjunto de desenvolvimento em si tem apenas 30 problemas, e nenhum laboratório externo executou este checkpoint ainda.

A receita de RL, em resumo.

Os dados de treinamento e o método são totalmente abertos, o que é a notícia real para qualquer pessoa que faça pesquisa em RL com raciocínio matemático. Os destaques do relatório:

• Dados — os problemas são extraídos do subconjunto AoPS de Nemotron-Math-Proofs-v1, filtrados para aqueles que o modelo Ultra base resolve em uma a três de quatro tentativas (conforme avaliado pelo DeepSeek-V3.2-Speciale) — problemas de currículo difíceis, porém tratáveis. Esse filtro produz 9.597 prompts de geração de provas, lançados como Nemotron-Math-Proofs-v3-RL.

• Recompensa — segue o design do DeepSeekMath-V2, mas elimina o termo de recompensa de autoanálise; o sinal do avaliador vem de um serviço de avaliação de provas durante o treinamento.

Algoritmo — RL assíncrono construído sobre NeMo-RL, semelhante em espírito ao PipelineRL: um conjunto fixo de prompts mantidos em andamento, sequências concluídas alimentando o treinador à medida que os lotes se preenchem, amostragem por importância truncada e tokens de baixa probabilidade mascarados em amostras positivas quando a entropia sobe. A configuração usava um contexto de 131.072 tokens e aproximadamente 128 nós de treinamento, 128 nós de inferência e 16 nós de avaliação, cada um com 4× GB200.

O checkpoint SFT irmão, para contraste, era um fine-tune supervisionado de contexto longo a partir da mesma base, treinado sobre um corpus filtrado por qualidade de 414.890 rastros de prova, refinamento, verificação e meta-verificação, abrangendo 15.818 problemas, executado em 512 GPUs GB200.

Screenshot of NVIDIA's NeMo-Skills GitHub repository at recipes/nemotron-imo-tts, showing the released contents: configs, imo-proofs, nemotron_imo_tts, prompts, scripts, README.md, paper.pdf and run.py.

O que ainda não se sabe

O jornalismo honesto tem implicações de mão dupla aqui, e um leitor que decide se deve dar importância a esta divulgação deve considerar quatro ressalvas:

Nenhum anúncio. Até o momento em que este texto foi escrito, a NVIDIA não anunciou formalmente a coleção; ela apareceu no Hugging Face. O PDF do relatório técnico tem data de 8 de setembro, então a receita escrita está efetivamente sendo publicada também esta semana.

Sem benchmarks independentes.Todos os números de desempenho associados a este checkpoint — as ablações do dev-set, a auditoria do verificador, a pontuação do sistema IMO 2026 — vêm do próprio relatório da NVIDIA. A própria pontuação IMO tem a procedência mais sólida do conjunto porque foi avaliada sob condições oficiais de competição, mas é um resultado em nível de sistema, e a contribuição do checkpoint para ele não é algo que um laboratório externo tenha reproduzido.

Sem API hospedada, sem preço de tabela. Esta é uma versão auto-hospedada. Qualquer pessoa que queira chamar isso precisa do hardware. A cobertura de julho noticiando "NVIDIA Nemotron 3 Ultra conquistou ouro na IMO 2026" pode facilmente ser mal interpretada como "baixe isto e ele resolve problemas de olimpíada" — a versão honesta é "baixe os componentes do sistema que resolveu."

O enquadramento de ouro. A própria linguagem da NVIDIA é "atingir o patamar de medalha de ouro", e o artigo tem o cuidado de notar que o modelo fazia parte de um ensemble. Trate como infundada qualquer alegação de que este único checkpoint, sozinho, seja "de nível de medalha de ouro".

Para quem é este

Este lançamento é direcionado a um leitor específico: um laboratório ou pesquisador que trabalha com raciocínio matemático, geração de provas ou RL com recompensas verificáveis e que busca uma implementação de referência de um sistema que ultrapassou o limiar de ouro em uma olimpíada em linguagem natural — sem provador formal, sem ferramentas, sem internet. Para esse leitor, o valor está no pacote completo: pesos, corpora de SFT e RL, os prompts formatados no padrão NeMo-Gym, o pipeline de inferência, as provas submetidas e o detalhamento do uso computacional que mostra quanto uma execução de competição realmente custa em horas de GPU.

Para todos os demais, a nota prática é que a busca de provas de nível olímpico é exagero para a maioria das cargas de trabalho matemáticas reais. Problemas de nível AIME e de competição, e essencialmente todo o trabalho de matemática aplicada em código, são tratados com folga por modelos muito menores — o que importa porque um checkpoint de 550B não é algo que você aciona para um job em lote. Os modelos matemáticos abertos menores e os modelos de API de fronteira são acessíveis por meio de uma única API no OrcaRouter pelos preços de tabela dos provedores (sem margem de nossa parte, então um corte de preço do fornecedor entra em vigor no mesmo dia), com failover automático se você quiser testar um modelo não comprovado sem apostar um caminho de produção nele. Comece por aí; vá auto-hospedar um 550B somente quando a carga de trabalho realmente exigir busca de provas em escala de fronteira.

A questão em aberto a observar é se esta divulgação discreta recebe um anúncio oficial e uma nota de lançamento formal, e se alguém fora da NVIDIA executa a receita de ponta a ponta e reporta uma pontuação independente no IMO-Bench. Esse benchmark — 200 problemas de olimpíada novos e inéditos — é possivelmente o artefato mais útil da coleção: é exatamente o tipo de avaliação resistente a contaminação que faltava na área. Se a receita se reproduzir, o upload silencioso desta semana no Hugging Face acabará sendo um dos lançamentos de modelos abertos mais relevantes do ano. Se não se reproduzir, a coleção ainda assim é um relato detalhado e honesto do que uma execução em escala de fronteira de gerar–verificar–refinar realmente exigiu.

Screenshot of the Hugging Face collection page 'Nemotron Labs IMO 2026' listing the six released artifacts: the Nemotron-3-Labs-Ultra-Math-SFT and Nemotron-3-Labs-Ultra-Math-RL checkpoints, the NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 base model, the Nemotron-Math-Proofs-v3-SFT and Nemotron-Math-Proofs-v3-RL datasets, and the Nemotron-IMO-Bench benchmark.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente