Tarjeta de título principal para Nemotron-3-Labs-Ultra-Math-RL, con subtítulo 'El checkpoint de RL de IMO 2026, publicado en código abierto discretamente', con chips de especificaciones que indican '550B total / 55B activo', 'Licencia OpenMDW-1.1', 'Publicado en septiembre de 2026'.
Engineering & Research

Nemotron-3-Labs-Ultra-Math-RL: NVIDIA liberó silenciosamente en código abierto el checkpoint de RL detrás de su participación en la IMO 2026

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

NVIDIA dropped Nemotron-3-Labs-Ultra-Math-RL on Hugging Face on September 2–3, 2026, with no blog post, no X announcement and no press release — the model card simply appears, dated September 3, and explains itself in one line: it is the reinforcement-learning checkpoint, referred to as "Nemotron-3-Ultra-RL" in NVIDIA's accompanying technical report, that was "deployed as part of an ensemble system that achieved a gold-medal level score at the International Mathematical Olympiad 2026." That system's official score — 30 out of 42 points, above the 29-point gold threshold — was widely reported back in late July, when the base model's weights had been public since June. What was not downloadable then was the pair of post-trained specialists the competition run actually used. One of them is now sitting in a public Hugging Face repo with zero likes and a near-zero download count.

Esta es una historia de lanzamiento silencioso, por lo que conviene ser precisos sobre lo que se puede saber y lo que no. Lo que se puede saber a partir del repositorio y del informe: la arquitectura del checkpoint, su receta de entrenamiento, el papel que desempeñó en la presentación de la IMO 2026, y los conjuntos de datos y benchmarks que NVIDIA publicó junto con él. Aún no confirmado: cualquier anuncio de proveedor, cualquier benchmark independiente de terceros de este checkpoint, y cualquier API alojada — esto es una publicación de pesos autoalojada bajo la licencia OpenMDW-1.1, y ejecutarlo implica levantar aproximadamente 1.5 TB de HBM de clase Blackwell.

Lo que realmente se lanzó esta semana

El repositorio nvidia/Nemotron-3-Labs-Ultra-Math-RL fue creado en Hugging Face el 2 de septiembre de 2026 (19:11 UTC) y modificado por última vez el 8 de septiembre. Es uno de los elementos de un lanzamiento coordinado recopilado bajo nvidia/nemotron-labs-imo-2026, que contiene:

• Los dos checkpoints de competencia post-entrenados — Nemotron-3-Labs-Ultra-Math-RL (este modelo) y su modelo hermano con ajuste fino supervisado Nemotron-3-Labs-Ultra-Math-SFT, ambos bajo OpenMDW-1.1.

• Los dos corpus de entrenamiento que hay detrás de ellos — Nemotron-Math-Proofs-v3-SFT y Nemotron-Math-Proofs-v3-RL, ambos CC-BY-4.0.

Nemotron-IMO-Bench, un nuevo benchmark de evaluación de 200 problemas inéditos de nivel olímpico (50 de álgebra, 50 de combinatoria, 50 de geometría, 50 de teoría de números), cada uno acompañado de una demostración de referencia curada por humanos, desarrollado junto al matemático Titu Andreescu específicamente para que los problemas no puedan aparecer en ningún conjunto de entrenamiento.

• El checkpoint base NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, del que todos se obtienen mediante fine-tuning.

La descripción de la colección remite al informe técnico que da unidad al conjunto: «An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics» (el PDF del repositorio NeMo-Skills de NVIDIA está fechado el 8 de septiembre de 2026). Junto con los checkpoints, NVIDIA publicó el pipeline de inferencia, las demostraciones presentadas, la receta de entrenamiento con RL y una contabilidad completa del cómputo empleado en la competición. El enfoque es explícitamente el de la ciencia reproducible: NVIDIA dice que aquí está todo lo necesario para reconstruir el sistema.

Qué es Nemotron-3-Labs-Ultra-Math-RL

Arquitectónicamente, no se trata de un modelo base nuevo — es un ajuste fino de la versión de disponibilidad general NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, el checkpoint híbrido Mamba2–Transformer Latent Mixture-of-Experts que NVIDIA lanzó por primera vez el 4 de junio de 2026. El checkpoint Math-RL conserva esa arquitectura y escala: 550B de parámetros totales con 55B activos, predicción multi-token y soporte para ventanas de contexto de hasta 1M tokens. Lo que el entrenamiento con RL cambia es la especialización, y es deliberadamente acotada:

• Propósito — resolver problemas difíciles de matemáticas de competición y actuar como juez de demostraciones: el modelo está entrenado para producir una solución rigurosa, autoevaluarla con una rúbrica de 0 / 0.5 / 1 e identificar errores en las demostraciones.

No es un chatbot general: la tarjeta y el informe describen un trabajador especializado para un pipeline de búsqueda de pruebas, no un asistente que sigue instrucciones.

• Licencia — OpenMDW-1.1, la licencia permisiva de modelo abierto de NVIDIA que permite el uso comercial y no comercial, igual que la versión base y los lanzamientos anteriores de modelos teacher de Nemotron Labs.

• Despliegue — no hay un precio de lista alojado en ningún lugar; descargas safetensors y te autoalojas. La configuración de referencia de NVIDIA es un único nodo de 8× B200 (~1,5 TB de HBM agregado), con opciones de varios nodos en H100/H200/GB200/GB300. vLLM es el entorno de ejecución recomendado, con un analizador de razonamiento, el analizador de llamadas a herramientas Qwen3-Coder, la configuración de caché SSM de Mamba y decodificación especulativa MTP en 5 tokens, todo ello señalado en la ficha.

Single-column scoreboard for Nemotron-3-Labs-Ultra-Math-RL: Released Sep 2026 quiet drop; Base Nemotron-3-Ultra-550B-A55B; 550B total / 55B active; IMO 2026 system 30/42 with gold cutoff 29; RL data 9,597 proof prompts; License OpenMDW-1.1. Footer: the IMO 2026 score is NVIDIA's system result, not this checkpoint alone; no independent scores yet.

Por qué este punto de control es importante: estaba dentro del sistema IMO 2026

El resultado de la IMO 2026 es la razón por la que cualquiera está mirando este modelo, así que la distinción que importa es: el 30/42 es una puntuación del sistema, no una puntuación de un solo modelo. La propuesta de NVIDIA fue un pipeline de dos etapas con múltiples checkpoints, y Nemotron-3-Labs-Ultra-Math-RL fue un componente con dos funciones.

Según el informe, la primera etapa ejecutó una búsqueda iterativa de generar–verificar–refinar durante hasta ocho rondas por problema. La ronda uno muestreó 384 intentos de prueba — 16 de cada uno de ocho prompts de estrategia de solución diferentes, de cada uno de los tres puntos de control: el modelo de disponibilidad general, el especialista SFT y el especialista RL. La verificación durante la búsqueda utilizó los puntos de control RL y SFT como un panel de dos modelos: ocho juicios independientes de cada uno, y una prueba se aceptaba solo si los 16 juicios la calificaban con 1. Una etapa posterior de alto cómputo recalificó a cada finalista con los tres puntos de control (16 juicios estilo IMO cada uno, en una escala de 0 a 7) y seleccionó la única presentación por problema.

El resultado oficial, tal como se informa en el artículo y en consonancia con la cobertura de finales de julio: 30 de 42 puntos en el examen de la OMI 2026, por encima del umbral de 29 puntos para la medalla de oro; obtuvo la máxima puntuación en los Problemas 1, 2, 4 y 5, y un punto en cada uno de los Problemas 3 y 6, calificado por los evaluadores oficiales de la OMI. El propio registro de recursos de NVIDIA afirma que las seis demostraciones presentadas se encontraron con aproximadamente 707 millones de tokens generados y 1.464 horas de GPU GB200; completar las rondas en curso elevó la ejecución total a unos 2.310 millones de tokens y 4.800 horas de GPU GB200.

Dos cifras internas del informe dan una idea de por qué el checkpoint de RL se ganó su lugar en el conjunto. En el conjunto de desarrollo de 30 problemas de NVIDIA, evaluado por un jurado independiente compuesto por GPT-5.5, Gemini 3.1 Pro y Claude Opus 4.8 siguiendo un procedimiento al estilo MathArena, el especialista de RL fue el mejor pipeline de un solo checkpoint de extremo a extremo (180 de los 210 puntos posibles del jurado, frente a 165 para el especialista de SFT y 162 para el modelo base), aunque el checkpoint de SFT resolvió más problemas en la primera ronda. Y en un conjunto de auditoría de 300 pruebas, el panel de verificación desplegado RL+SFT redujo la tasa de falsa aceptación —el fallo que da por terminada la búsqueda ante una prueba inválida— a alrededor del 1.1%, frente al 12.4% cuando el checkpoint de RL juzga solo y al 31.6% para el modelo base. El punto del informe es que los dos especialistas selectivos se detectan mutuamente los errores bajo una regla de unanimidad.

Estas son las propias ablaciones de NVIDIA sobre su propio conjunto de desarrollo, reportadas en el artículo de NVIDIA — cabe tratarlas como evidencia reportada por el proveedor de por qué el diseño funciona, no como puntuaciones independientes. El conjunto de desarrollo en sí tiene solo 30 problemas, y ningún laboratorio externo ha ejecutado este checkpoint todavía.

La receta del RL, en resumen.

Los datos de entrenamiento y el método son completamente abiertos, lo cual es la noticia real para cualquiera que haga investigación en RL para razonamiento matemático. Los puntos destacados del informe:

• Datos: los problemas se extraen del subconjunto de AoPS de Nemotron-Math-Proofs-v1, filtrados a aquellos que el modelo Ultra base resuelve en uno a tres de cuatro intentos (según lo evaluado por DeepSeek-V3.2-Speciale) — problemas curriculares difíciles pero tratables. Ese filtro produce 9,597 indicaciones de generación de demostraciones, publicadas como Nemotron-Math-Proofs-v3-RL.

• Recompensa — sigue el diseño de DeepSeekMath-V2 pero elimina el término de recompensa de autoanálisis; la señal del juez proviene de un servicio de evaluación de pruebas durante el entrenamiento.

— Algoritmo — RL asíncrono construido sobre NeMo-RL, similar en espíritu a PipelineRL: un conjunto fijo de prompts mantenidos en vuelo, las secuencias completadas se alimentan al entrenador a medida que se llenan los lotes, muestreo de importancia truncado y tokens de baja probabilidad enmascarados en muestras positivas cuando la entropía aumenta. La configuración utilizaba un contexto de 131,072 tokens y aproximadamente 128 nodos de entrenamiento, 128 nodos de inferencia y 16 nodos evaluadores de 4× GB200 cada uno.

El checkpoint SFT hermano, en contraste, fue un ajuste fino supervisado de contexto largo a partir de la misma base sobre un corpus filtrado por calidad de 414.890 trazas de demostración, refinamiento, verificación y meta-verificación que cubren 15.818 problemas, ejecutado en 512 GPU GB200.

Screenshot of NVIDIA's NeMo-Skills GitHub repository at recipes/nemotron-imo-tts, showing the released contents: configs, imo-proofs, nemotron_imo_tts, prompts, scripts, README.md, paper.pdf and run.py.

Lo que aún no se sabe

La honestidad en las fuentes es un arma de doble filo aquí, y un lector que decida si le importa este lanzamiento debería considerar cuatro salvedades:

Sin anuncio. Al momento de escribir esto, NVIDIA no ha anunciado formalmente la colección; apareció en Hugging Face. El PDF del informe técnico está fechado el 8 de septiembre, por lo que la receta escrita se está publicando efectivamente también esta semana.

Sin benchmarks independientes. Cada cifra de rendimiento asociada a este checkpoint — las ablaciones del conjunto de desarrollo, la auditoría del verificador, la puntuación del sistema IMO 2026 — proviene del informe de la propia NVIDIA. La puntuación de la IMO en sí tiene la procedencia más sólida del conjunto porque fue calificada en condiciones oficiales de competición, pero es un resultado a nivel de sistema, y la contribución del checkpoint a dicho resultado no es algo que un laboratorio externo haya reproducido.

Sin API alojada ni precio de lista. Esta es una versión autohospedada. Cualquiera que quiera llamarlo necesita el hardware. La cobertura de julio sobre «NVIDIA Nemotron 3 Ultra alcanzó el oro en la IMO 2026» puede malinterpretarse fácilmente como «descarga esto y resolverá problemas de olimpiada» — la versión honesta es «descarga los componentes del sistema que lo hizo».

El encuadre de la medalla de oro. La propia expresión de NVIDIA es "alcanzar el umbral de la medalla de oro", y el artículo se cuida de señalar que el modelo formaba parte de un conjunto. Trate cualquier afirmación de que este único punto de control por sí solo tiene "nivel de medalla de oro" como no respaldada.

Para quién es esto

Esta versión está dirigida a un lector específico: un laboratorio o investigador que trabaja en razonamiento matemático, generación de demostraciones o RL con recompensas verificables, y que quiere una implementación de referencia de un sistema que superó el umbral de oro de una olimpiada en lenguaje natural — sin demostrador formal, sin herramientas, sin internet. Para ese lector, el valor es el paquete completo: pesos, corpus de SFT y RL, los prompts con formato NeMo-Gym, el pipeline de inferencia, las demostraciones enviadas y la contabilidad de cómputo que indica cuánto cuesta realmente una ejecución de competición en horas de GPU.

Para todos los demás, la nota práctica es que la búsqueda de demostraciones de nivel olimpiada es excesiva para la mayoría de las cargas de trabajo matemáticas reales. Los problemas de nivel AIME y de concurso, y prácticamente todo el trabajo de matemáticas aplicadas mediante código, se manejan cómodamente con modelos mucho más pequeños — lo cual importa porque un checkpoint de 550B no es algo que se levante para un trabajo por lotes. Los modelos matemáticos abiertos más pequeños y los modelos API de frontera son accesibles a través de una única API en OrcaRouter a los precios de lista de los proveedores (sin margen de nuestra parte, por lo que un recorte de precio del proveedor se aplica el mismo día), con conmutación automática por error si quieres probar un modelo no comprobado sin arriesgar una ruta de producción en él. Empieza ahí; ve a autoalojar un 550B solo cuando la carga de trabajo realmente exija una búsqueda de demostraciones a escala de frontera.

{{1}}La cuestión abierta que conviene vigilar es si este lanzamiento discreto recibe un anuncio oficial y una nota de versión formal, y si alguien ajeno a NVIDIA ejecuta la receta de principio a fin y reporta una puntuación independiente en IMO-Bench.{{/1}} {{2}}Ese benchmark — 200 problemas de olimpiada nuevos e inéditos — es posiblemente el artefacto más útil de la colección: es exactamente el tipo de evaluación resistente a la contaminación que faltaba en el campo.{{/2}} {{3}}Si la receta se reproduce, la silenciosa subida de esta semana a Hugging Face resultará ser uno de los lanzamientos de modelos abiertos más trascendentes del año.{{/3}} {{4}}Si no es así, la colección sigue siendo un relato detallado y honesto de lo que realmente requirió una ejecución a escala de frontera de generar–verificar–refinar.{{/4}}

Screenshot of the Hugging Face collection page 'Nemotron Labs IMO 2026' listing the six released artifacts: the Nemotron-3-Labs-Ultra-Math-SFT and Nemotron-3-Labs-Ultra-Math-RL checkpoints, the NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 base model, the Nemotron-Math-Proofs-v3-SFT and Nemotron-Math-Proofs-v3-RL datasets, and the Nemotron-IMO-Bench benchmark.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario