Hero card del titolo per Nemotron-3-Labs-Ultra-Math-RL, con sottotitolo 'Il checkpoint RL per le IMO 2026, rilasciato open source in sordina', con chip delle specifiche che riportano '550B totali / 55B attivi', 'licenza OpenMDW-1.1', 'Rilasciato a settembre 2026'.
Engineering & Research

Nemotron-3-Labs-Ultra-Math-RL: NVIDIA ha reso open-source in silenzio il checkpoint RL alla base della sua partecipazione alle IMO 2026

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

NVIDIA dropped Nemotron-3-Labs-Ultra-Math-RL on Hugging Face on September 2–3, 2026, with no blog post, no X announcement and no press release — the model card simply appears, dated September 3, and explains itself in one line: it is the reinforcement-learning checkpoint, referred to as "Nemotron-3-Ultra-RL" in NVIDIA's accompanying technical report, that was "deployed as part of an ensemble system that achieved a gold-medal level score at the International Mathematical Olympiad 2026." That system's official score — 30 out of 42 points, above the 29-point gold threshold — was widely reported back in late July, when the base model's weights had been public since June. What was not downloadable then was the pair of post-trained specialists the competition run actually used. One of them is now sitting in a public Hugging Face repo with zero likes and a near-zero download count.

Questa è una storia di rilascio silenzioso, quindi vale la pena essere precisi su cosa è conoscibile e cosa no. Conoscibile dal repository e dal report: l'architettura del checkpoint, la sua ricetta di addestramento, il ruolo che ha svolto nella submission IMO 2026, e i dataset e benchmark che NVIDIA ha rilasciato insieme ad esso. Non ancora confermato: qualsiasi annuncio da parte di vendor, qualsiasi benchmark indipendente di terze parti di questo checkpoint, e qualsiasi API hosted — si tratta di un rilascio self-host dei pesi sotto licenza OpenMDW-1.1, e eseguirlo significa mettere in piedi circa 1,5 TB di HBM classe Blackwell.

Cosa è stato effettivamente pubblicato questa settimana

Il repository nvidia/Nemotron-3-Labs-Ultra-Math-RL è stato creato su Hugging Face il 2 settembre 2026 (19:11 UTC) e modificato l'ultima volta l'8 settembre. È uno degli elementi di un rilascio coordinato raccolto sotto nvidia/nemotron-labs-imo-2026, che contiene:

• I due checkpoint post-addestrati per la competizione — Nemotron-3-Labs-Ultra-Math-RL (questo soggetto) e la sua controparte con fine-tuning supervisionato Nemotron-3-Labs-Ultra-Math-SFT, entrambi sotto OpenMDW-1.1.

• I due corpus di addestramento alla base — Nemotron-Math-Proofs-v3-SFT e Nemotron-Math-Proofs-v3-RL, entrambi CC-BY-4.0.

• Nemotron-IMO-Bench, un nuovo benchmark di valutazione composto da 200 problemi inediti di livello olimpico (50 di algebra, 50 di combinatoria, 50 di geometria, 50 di teoria dei numeri), ciascuno abbinato a una dimostrazione di riferimento curata manualmente, creato con il matematico Titu Andreescu specificamente affinché i problemi non possano apparire in alcun set di addestramento.

• Il checkpoint di base NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 da cui sono tutti finetunati.

La descrizione della collezione rimanda al rapporto tecnico che tiene tutto insieme: "An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics" (il PDF nel repository NeMo-Skills di NVIDIA è datato 8 settembre 2026). Insieme ai checkpoint, NVIDIA ha rilasciato la pipeline di inferenza, le dimostrazioni presentate, la ricetta di training RL e una contabilità completa del calcolo impiegato per la competizione. L'impostazione è esplicitamente quella della scienza riproducibile: è NVIDIA che dice, ecco tutto ciò che serve per ricostruire il sistema.

Cos'è Nemotron-3-Labs-Ultra-Math-RL

Architetturalmente non è un nuovo modello base — è un fine-tuning della versione di disponibilità generale del NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, il checkpoint ibrido Mamba2–Transformer Latent Mixture-of-Experts che NVIDIA ha rilasciato per la prima volta il 4 giugno 2026. Il checkpoint Math-RL mantiene la stessa architettura e la stessa scala: 550B parametri totali con 55B attivi, predizione multi-token e supporto per finestre di contesto fino a 1M token. Ciò che l'addestramento RL cambia è la specializzazione, ed è volutamente ristretta:

• Scopo — risolvere problemi di matematica competitiva difficili e fungere da giudice di dimostrazioni: il modello è addestrato a produrre una soluzione rigorosa, autovalutarla secondo una rubrica da 0 / 0.5 / 1 e identificare errori nelle dimostrazioni.

• Non è un chatbot generico — la scheda e il report descrivono un agente specializzato per una pipeline di ricerca di dimostrazioni, non un assistente che segue istruzioni.

• Licenza — OpenMDW-1.1, la licenza open-model permissiva di NVIDIA che consente l'uso commerciale e non commerciale, come la base e le precedenti versioni teacher di Nemotron Labs.

• Distribuzione — nessun prezzo di listino per una versione hosted; si scaricano i safetensors e si fa self-hosting. La configurazione di riferimento di NVIDIA è un singolo nodo con 8× B200 (~1,5 TB di HBM aggregata), con opzioni multi-nodo su H100/H200/GB200/GB300. vLLM è il runtime consigliato: nella scheda sono indicati un parser per il reasoning, il parser per le tool-call di Qwen3-Coder, le impostazioni della cache SSM di Mamba e la decodifica speculativa MTP su 5 token.

Single-column scoreboard for Nemotron-3-Labs-Ultra-Math-RL: Released Sep 2026 quiet drop; Base Nemotron-3-Ultra-550B-A55B; 550B total / 55B active; IMO 2026 system 30/42 with gold cutoff 29; RL data 9,597 proof prompts; License OpenMDW-1.1. Footer: the IMO 2026 score is NVIDIA's system result, not this checkpoint alone; no independent scores yet.

Perché questo checkpoint è importante: era all'interno del sistema IMO 2026

Il risultato delle IMO 2026 è il motivo per cui tutti guardano questo modello, quindi la distinzione che conta è: il 30/42 è un punteggio di sistema, non di un singolo modello. Il sistema presentato da NVIDIA era una pipeline a due fasi con più checkpoint, e Nemotron-3-Labs-Ultra-Math-RL era un componente con due compiti.

Secondo il rapporto, la prima fase ha eseguito una ricerca iterativa genera–verifica–affina per un massimo di otto round per problema. Il primo round ha campionato 384 tentativi di dimostrazione — 16 da ciascuno di otto diversi prompt di strategia risolutiva, per ciascuno dei tre checkpoint: il modello di disponibilità generale, lo specialista SFT e lo specialista RL. La verifica in fase di ricerca ha utilizzato i checkpoint RL e SFT come una giuria di due modelli: otto giudizi indipendenti per ciascuno, e una dimostrazione veniva accettata solo se tutti i 16 giudizi le assegnavano un punteggio di 1. Una successiva fase ad alto carico computazionale ha rivalutato ogni dimostrazione finalista con tutti e tre i checkpoint (16 giudizi in stile IMO ciascuno, su una scala da 0 a 7) e ha selezionato l’unica soluzione per problema.

L'esito ufficiale, come riportato nell'articolo e in linea con quanto diffuso a fine luglio, è di 30 punti su 42 nella prova IMO 2026, al di sopra della soglia per la medaglia d'oro di 29 punti, con punteggio pieno nei Problemi 1, 2, 4 e 5 e un punto nei Problemi 3 e 6, valutati dai correttori ufficiali IMO. Secondo la contabilità delle risorse di NVIDIA, tutte e sei le dimostrazioni presentate sono state trovate in circa 707 milioni di token generati e 1.464 ore GPU GB200; completando i round in corso, l'intera esecuzione ha raggiunto circa 2,31 miliardi di token e 4.800 ore GPU GB200.

Due cifre interne del rapporto danno un'idea del perché il checkpoint RL si sia guadagnato un posto nell'ensemble. Sul set di sviluppo di 30 problemi di NVIDIA, valutato da una giuria indipendente composta da GPT-5.5, Gemini 3.1 Pro e Claude Opus 4.8 seguendo una procedura in stile MathArena, lo specialista RL è risultato la migliore pipeline end-to-end a checkpoint singolo (180 dei possibili 210 punti della giuria, contro 165 per lo specialista SFT e 162 per il modello base), anche se il checkpoint SFT ha risolto più problemi al primo round. E su un set di audit di 300 dimostrazioni, il pannello di verifica RL+SFT in produzione ha ridotto il tasso di falsa accettazione — l'errore che interrompe la ricerca su una dimostrazione non valida — a circa l'1,1%, contro il 12,4% del solo checkpoint RL come giudice e il 31,6% del modello base. Il punto del rapporto è che i due specialisti selettivi intercettano gli errori reciproci con una regola di unanimità.

Questi sono gli studi di ablazione condotti da NVIDIA stessa sul proprio set di sviluppo, riportati nel paper di NVIDIA — da considerare come evidenza dichiarata dal fornitore del perché il design funziona, non come punteggi indipendenti. Il set di sviluppo stesso consiste in soli 30 problemi, e nessun laboratorio esterno ha ancora eseguito questo checkpoint.

La ricetta RL, in breve

I dati di addestramento e il metodo sono completamente aperti, ed è questa la vera notizia per chiunque faccia ricerca sul ragionamento matematico con RL. I punti salienti del report:

• Dati — i problemi sono tratti dal sottoinsieme AoPS di Nemotron-Math-Proofs-v1, filtrati per quelli che il modello Ultra di base risolve in 1-3 tentativi su 4 (come giudicato da DeepSeek-V3.2-Speciale) — problemi curriculari difficili ma trattabili. Questo filtro produce 9.597 prompt di generazione di dimostrazioni, rilasciati come Nemotron-Math-Proofs-v3-RL.

• Reward — segue il design di DeepSeekMath-V2 ma elimina il termine di reward per l'auto-analisi; il segnale del giudice proviene da un servizio di proof-judge durante l'addestramento.

• Algoritmo — RL asincrono costruito su NeMo-RL, simile nello spirito a PipelineRL: un pool fisso di prompt mantenuti in elaborazione, sequenze completate inviate al trainer man mano che i batch si riempiono, campionamento per importanza troncato e token a bassa probabilità mascherati sui campioni positivi quando l’entropia aumenta. La configurazione utilizzava un contesto di 131.072 token e circa 128 nodi trainer, 128 nodi di inferenza e 16 nodi giudice, ciascuno composto da 4× GB200.

Il checkpoint SFT gemello, per contrasto, era un fine-tuning supervisionato a contesto lungo dalla stessa base su un corpus filtrato per qualità di 414.890 tracce di dimostrazione, raffinamento, verifica e meta-verifica riguardanti 15.818 problemi, eseguito su 512 GPU GB200.

Screenshot of NVIDIA's NeMo-Skills GitHub repository at recipes/nemotron-imo-tts, showing the released contents: configs, imo-proofs, nemotron_imo_tts, prompts, scripts, README.md, paper.pdf and run.py.

Ciò che non è ancora noto

La trasparenza delle fonti è a doppio taglio qui, e un lettore che decide se interessarsi a questo rilascio dovrebbe tenere presenti quattro avvertenze:

Nessun annuncio. Al momento della stesura, NVIDIA non ha annunciato formalmente la raccolta; è apparsa su Hugging Face. Il PDF del rapporto tecnico è datato 8 settembre, quindi la ricetta scritta viene di fatto pubblicata anche questa settimana.

Nessun benchmark indipendente. Ogni dato relativo alle prestazioni associato a questo checkpoint — le ablazioni sul dev-set, l'audit del verificatore, il punteggio di sistema all'IMO 2026 — proviene dal rapporto di NVIDIA stessa. Il punteggio IMO in sé è quello con la provenienza più solida dell'intero set, poiché è stato valutato in condizioni ufficiali di competizione, ma si tratta di un risultato a livello di sistema, e il contributo del checkpoint non è qualcosa che un laboratorio esterno abbia riprodotto.

No hosted API, no list price. This is a self-host release. Anyone wanting to call it needs the hardware. The "NVIDIA Nemotron 3 Ultra reached gold at IMO 2026" coverage from July can easily be misread as "download this and it solves olympiad problems" — the honest version is "download the components of the system that did."

L'inquadratura dell'oro. L'espressione usata da NVIDIA stessa è "raggiungere la soglia della medaglia d'oro", e il paper ha cura di precisare che il modello faceva parte di un ensemble. Va considerata infondata qualsiasi affermazione secondo cui questo singolo checkpoint da solo sia "a livello di medaglia d'oro".

A chi è rivolto

Questo rilascio è pensato per un lettore specifico: un laboratorio o un ricercatore che lavora su ragionamento matematico, generazione di dimostrazioni o RL con ricompense verificabili, e che desidera un'implementazione di riferimento di un sistema che ha superato la soglia dell'oro olimpico in linguaggio naturale — senza prover formali, senza strumenti, senza internet. Per quel lettore, il valore risiede nell'intero pacchetto: pesi, corpora SFT e RL, i prompt in formato NeMo-Gym, la pipeline di inferenza, le dimostrazioni presentate e la contabilità computazionale che indica quanto costa realmente una corsa competitiva in termini di GPU-ore.

Per tutti gli altri, il punto pratico è che la ricerca di dimostrazioni di livello olimpico è eccessiva per la maggior parte dei carichi di lavoro matematici reali. I problemi di livello AIME e da gara, e praticamente tutto il lavoro di matematica applicata nel codice, sono gestiti con facilità da modelli molto più piccoli — il che è importante, perché un checkpoint da 550B non è qualcosa che puoi avviare al volo per un lavoro batch. I modelli open di matematica più piccoli e i modelli API di frontiera sono accessibili tramite un'unica API su OrcaRouter ai prezzi di listino dei fornitori (nessun ricarico da parte nostra, quindi un taglio di prezzo del fornitore è attivo lo stesso giorno), con failover automatico se vuoi provare un modello non ancora collaudato senza scommettere un percorso di produzione su di esso. Inizia da lì; passa al self-hosting di un modello da 550B solo quando il carico di lavoro richiede davvero una ricerca di dimostrazioni su scala di frontiera.

La domanda aperta da osservare è se questo rilascio silenzioso riceverà un annuncio ufficiale e una nota di rilascio formale, e se qualcuno al di fuori di NVIDIA eseguirà la ricetta dall'inizio alla fine e riporterà un punteggio IMO-Bench indipendente. Quel benchmark — 200 problemi olimpici nuovi e inediti — è probabilmente l'elemento più utile della collezione: è esattamente il tipo di valutazione resistente alla contaminazione che manca al settore. Se la ricetta si riproduce, il silenzioso caricamento su Hugging Face di questa settimana si rivelerà uno dei rilasci di modelli aperti più significativi dell'anno. In caso contrario, la collezione rimane comunque un resoconto dettagliato e onesto di ciò che un'esecuzione su scala avanzata del ciclo generate–verify–refine ha effettivamente richiesto.

Screenshot of the Hugging Face collection page 'Nemotron Labs IMO 2026' listing the six released artifacts: the Nemotron-3-Labs-Ultra-Math-SFT and Nemotron-3-Labs-Ultra-Math-RL checkpoints, the NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 base model, the Nemotron-Math-Proofs-v3-SFT and Nemotron-Math-Proofs-v3-RL datasets, and the Nemotron-IMO-Bench benchmark.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno