Una tarjeta de título principal para el artículo de noticias 'NVIDIA-Nemotron-Labs-Teacher-General-Reasoning' que dice 'El profesor de razonamiento de 550B detrás de Nemotron 3 Ultra ahora es de pesos abiertos', con un icono de caja de pesos abiertos, un glifo de chip de GPU, etiquetas de motor vLLM / SGLang / TensorRT-LLM, una insignia de fecha 'Publicado el 14 de agosto de 2026', y el logotipo de OrcaRouter superpuesto en la esquina inferior derecha.
Engineering & Research

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning: El maestro de razonamiento de 550B detrás de Nemotron 3 Ultra acaba de abrir sus pesos

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El 14 de agosto de 2026, NVIDIA publicó NVIDIA-Nemotron-Labs-Teacher-General-Reasoning en Hugging Face: un modelo de razonamiento de 550 mil millones de parámetros que, hasta ayer, existía únicamente dentro del pipeline de entrenamiento de su buque insignia Nemotron 3 Ultra. Es el profesor de «razonamiento general» de la receta Multi-Teacher On-Policy Distillation (MOPD) que NVIDIA usó para entrenar al estudiante Ultra de 550B-A55B, y el lanzamiento importa por una razón sencilla: en el informe técnico de Nemotron 3 Ultra que NVIDIA publicó en junio, la receta de entrenamiento indicaba claramente que los checkpoints de cada profesor no se liberarían como código abierto. Este ahora sí —con pesos, tokenizador, plantilla de chat y configuraciones de serving incluidas— bajo la licencia OpenMDW-1.1, favorable para uso comercial. Un modelo hermano, NVIDIA-Nemotron-Labs-Teacher-STEM, se lanzó el mismo día, lo que se lee menos como un caso aislado y más como el panel de profesores que empieza a salir a la luz.

Lo que en realidad es un modelo de maestro

MOPD es la técnica de post-entrenamiento que le otorga a Nemotron 3 Ultra su razonamiento agéntico. En lugar de destilar un único profesor grande en un estudiante, NVIDIA entrenó a más de diez profesores especializados en dominios —para razonamiento, investigación, análisis legal, ingeniería de software, uso de herramientas y otras áreas— y luego dejó que el estudiante generara sus propios rollouts y usó cada profesor para puntuar esos rollouts en su área de especialización. Dado que la puntuación ocurre en las salidas on-policy del propio estudiante, en lugar de en un conjunto de datos offline fijo, la señal de entrenamiento se mantiene alineada con lo que el estudiante realmente produce en el momento de la inferencia. NVIDIA llama a este bucle co-evolución: nuevas rondas de profesores se inicializan a partir de checkpoints actualizados del estudiante, por lo que ambas partes siguen mejorando.

Este checkpoint es el miembro de razonamiento general de ese panel. Se produce a partir del estudiante Nemotron 3 Ultra post-entrenado mediante una ronda adicional de SFT y aprendizaje por refuerzo intensivos en razonamiento, y la ficha del modelo lo describe como optimizado para trazas de razonamiento extensas y de alta calidad en los problemas multi-paso más difíciles de matemáticas, lógica y razonamiento abstracto, incluyendo pruebas formales y programación competitiva. Dentro de MOPD desempeña varios roles a la vez: un checkpoint, muchos roles: generación de trazas de razonamiento, juez de matemáticas y juez de equivalencia que califica respuestas cortas de formato libre contra una referencia. NVIDIA también lo distribuye de forma independiente porque es un razonador sólido por derecho propio, destinado a la generación de trazas de razonamiento de largo horizonte, la resolución de problemas difíciles y a actuar como profesor o evaluador dentro de tu propio pipeline de destilación.

Las especificaciones en una sola pasada.

• Parámetros — 550B total / 55B activos, LatentMoE disperso

• Arquitectura — híbrido Mamba2-Transformer con mezcla latente de expertos y Predicción Multi-Token (MTP)

• Ventana de contexto — hasta 1M de tokens; 256K por defecto en las configuraciones de servicio de referencia

• Idiomas — 10: Inglés, Francés, Español, Italiano, Alemán, Japonés, Hindi, Coreano, Portugués brasileño, Chino

• Licencia — OpenMDW-1.1, uso comercial y no comercial permitido

Hardware mínimo — 4×B200 (pesos NVFP4); también son compatibles GB200/GB300 y la clase H100

La arquitectura es de la misma familia que el propio Nemotron 3 Ultra: la forma 550B-A55B con capas intercaladas de Mamba-2 y MoE, capas de atención selectivas y cabezas MTP para decodificación especulativa nativa. El profesor no es un alumno más pequeño — es una variante del mismo stack entrenada de forma diferente, especializada en razonamiento de horizonte largo en lugar de trabajo agéntico general.

A single-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning listing 550B total / 55B active parameters, LatentMoE Mamba2-Transformer hybrid + MTP architecture, up to 1M token context, 10 languages, OpenMDW-1.1 commercial license, and vLLM / SGLang / TensorRT-LLM serving, with a footer noting the specs are per NVIDIA's model card and no independent benchmarks exist yet, and the OrcaRouter logo composited in the corner.

Por qué es importante abrir el código de un maestro

Los checkpoints de profesor son el tipo más raro de lanzamiento de modelo abierto. Las empresas publican estudiantes —los modelos que despliegas— y conjuntos de datos todo el tiempo; casi nunca publican los modelos que calificaron el trabajo de los estudiantes. Por eso la línea del informe de junio de que no se liberarían checkpoints por maestro se leyó como un cierre de puerta para reproducir el pipeline de MOPD de extremo a extremo. Este lanzamiento entreabre esa puerta, al menos para el profesor de razonamiento.

Para los equipos que construyen sus propios modelos de razonamiento, eso es un valor concreto. {{1}}La señal de recompensa que moldeó el razonamiento de Nemotron 3 Ultra{{/1}} {{2}}fue escrita en parte por este checkpoint,{{/2}} {{3}}y ahora puede estudiarse directamente, usarse como juez o emplearse para generar trazas de razonamiento de largo horizonte para datos de SFT.{{/3}} {{4}}Combinado con los datos de post-entrenamiento ya publicados (nvidia/nemotron-post-training-v3){{/4}} {{5}}y las recetas de entrenamiento publicadas,{{/5}} {{6}}reduce la brecha{{/6}} {{7}}entre "NVIDIA entrenó un gran modelo"{{/7}} {{8}}y "podemos entrenar uno similar".{{/8}}

A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card summary: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP architecture, up to 1M token context, minimum GPU requirements, supported languages, the openmdw-1.1 license tag, and the files and versions listing.

El dial de pensamiento

Una característica distintiva se hereda de la familia Nemotron 3: el razonamiento es un interruptor, no un comportamiento por defecto. La plantilla de chat acepta enable_thinking=true/false, una opción medium_effort y un tope de tokens de reasoning_budget, de modo que el llamador puede forzar un razonamiento profundo de largo horizonte cuando un problema lo necesita y obtener respuestas directas —más rápidas y baratas— cuando no. Para un modelo profesor, esto importa más de lo que parece: las ejecuciones de destilación requieren pasadas de calificación baratas en muestras fáciles y trazas de razonamiento costosas en las difíciles, y un único checkpoint que admite ambos modos elimina la necesidad de intercambiar modelos a mitad del pipeline.

Ejecutándolo

Este no es un modelo que se invoque casualmente. La configuración de servidor mínima sensata es 4×B200 con pesos NVFP4 y una caché KV fp8; las configuraciones de referencia también cubren servidores GB200/GB300 multinodo y de clase H100. NVIDIA publica guías de cocina para tres motores: vLLM (0.22), SGLang (0.5.13) y TensorRT-LLM (1.3.0rc17); todos exponen una API compatible con OpenAI en el puerto 8000, con decodificación especulativa MTP o EAGLE y un backend Mamba de flashinfer. El contexto de 1M de tokens requiere un indicador de permiso explícito en cada motor (VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 y equivalentes); el límite máximo predeterminado es 256K.

Al momento de escribir esto, el modelo no está desplegado por ningún proveedor de inferencia en Hugging Face y NVIDIA no ha anunciado alojamiento NIM — esta es una versión solo de pesos. Eso lo convierte en un modelo para laboratorios que ya operan grandes flotas de GPU, o para equipos cuyo pipeline de destilación necesita específicamente la señal exacta del maestro. Cuando llegue a una API gestionada, la matemática de precios es simple: este es un MoE con 55B activos, y quien lo aloje cobrará lo que cuesten las GPU. En una capa de enrutamiento que opera con un margen del 0%, pagas el precio de lista del proveedor sin tarifa de plataforma adicional — y la misma clave que accede a este modelo accede a los modelos de frontera con los que comparas sus trazas, con conmutación automática por error si un host cae. Eso es la parte para la que sirve un enrutador como OrcaRouter; el maestro en sí es la parte que autoalojas.

Las advertencias honestas

Este es un checkpoint de hace 24 horas, y la tarjeta del modelo contiene cero cifras de referencia. Eso no es una omisión en este informe: es el estado del lanzamiento. NVIDIA publicó detalles de arquitectura y entrenamiento, pero ninguna tabla de evaluación, y ningún laboratorio independiente ha tenido tiempo de ejecutarlo todavía. El punto de referencia más cercano son las cifras reportadas por el proveedor para el estudiante: Nemotron 3 Ultra reporta 71.9 en SWE-Bench Verified, 86.8 en MMLU-Pro, 89.0 en LiveCodeBench v6, y aproximadamente 95 en RULER con contexto de 1M. Esas describen al estudiante Ultra, no a este maestro, y son cifras propias de NVIDIA. Cualquiera que planee una ejecución de destilación en este checkpoint debe tratar su calidad de razonamiento como no verificada hasta que aparezcan puntajes independientes.

Dos advertencias adicionales están integradas en la tarjeta. El corpus de post-entrenamiento está fuertemente ponderado hacia el inglés — aproximadamente 8,6 millones de muestras en inglés frente a unas 138.000 para cada uno de los otros nueve idiomas —, por lo que la calidad del razonamiento multilingüe no debe asumirse a partir de la etiqueta de 10 idiomas. Y la propia tarjeta señala el sesgo de representación en los datos base de entrenamiento y recomienda auditorías de sesgo antes de su uso posterior.

¿A quién le debería importar?

Tres grupos obtienen un valor real aquí. Los investigadores de destilación finalmente tienen un maestro MOPD real para diseccionar, no solo una receta que lo describe. Los laboratorios que entrenan sus propios modelos de razonamiento obtienen un generador de trazas de horizonte largo y un juez que provienen del mismo linaje post-entrenamiento que el modelo que intentan igualar. Y cualquiera que ejecute RL on-policy puede usarlo de la manera en que NVIDIA lo hizo: como un puntuador para los problemas más difíciles, con el pensamiento activado solo donde se amortiza.

Si no estás en ninguno de esos grupos, este lanzamiento cambia poco para ti hoy: el modelo es grande, no está probado y es solo de autoalojamiento, y la forma más rápida de actuar sobre la tendencia subyacente —la aparición de más profesores de razonamiento abiertos— es mantener la capa de modelos de tu pipeline intercambiable tras una única interfaz en lugar de soldarla a un único checkpoint.

A flow diagram titled 'How Multi-Teacher On-Policy Distillation works' showing a Student (Nemotron 3 Ultra) node sending rollouts to a Teacher panel of 10+ domain specialist cards, one highlighted as the General Reasoning teacher released Aug 14, 2026, with reward signals flowing back to the student, and the OrcaRouter logo composited in the corner.

Qué ver a continuación

Tres cosas indicarán si esto es un caso aislado o si el panel está saliendo. Primero, si los profesores hermanos siguen el mismo camino — NVIDIA-Nemotron-Labs-Teacher-STEM ya apareció el mismo día, así que la pregunta es qué especialistas de dominio vienen después y si están ponderados de la misma manera. Segundo, si NVIDIA NIM o un host administrado comienza a servirlos, lo que convertiría un lanzamiento exclusivo de laboratorios en algo que el resto de la industria pueda realmente utilizar. Tercero, si aparecen benchmarks independientes — una entrada en Artificial Analysis o una ejecución en LMArena sería la primera verificación real de si la calidad de razonamiento del profesor coincide con la del estudiante al que entrenó.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube