
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning : le professeur de raisonnement à 550B derrière Nemotron 3 Ultra vient de passer en poids ouverts
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
Le 14 août 2026, NVIDIA a publié NVIDIA-Nemotron-Labs-Teacher-General-Reasoning sur Hugging Face — un modèle de raisonnement de 550B de paramètres qui, jusqu'à hier, n'existait qu'à l'intérieur du pipeline d'entraînement de son produit phare Nemotron 3 Ultra. Il s'agit de l'enseignant « general reasoning » de la recette de distillation on-policy multi-enseignants (MOPD) que NVIDIA a utilisée pour entraîner l'étudiant Ultra 550B-A55B, et cette publication importe pour une raison simple : dans le rapport technique de Nemotron 3 Ultra que NVIDIA a publié en juin, la recette d'entraînement indiquait clairement que les checkpoints par enseignant ne seraient pas open-sourcés. Or, celui-ci l'est désormais — poids, tokenizer, modèle de chat et configurations de service compris, sous la licence OpenMDW-1.1, adaptée aux usages commerciaux. Un modèle frère, NVIDIA-Nemotron-Labs-Teacher-STEM, est sorti le même jour, ce qui ressemble moins à un coup unique qu'au début de la mise à disposition du panel d'enseignants.
Ce qu'est réellement un modèle enseignant
MOPD est la technique de post-entraînement qui confère à Nemotron 3 Ultra son raisonnement agentique. Plutôt que de distiller un unique grand enseignant dans un étudiant, NVIDIA a entraîné plus de dix enseignants spécialisés par domaine — pour le raisonnement, la recherche, l'analyse juridique, l'ingénierie logicielle, l'utilisation d'outils et d'autres domaines — puis a laissé l'étudiant générer ses propres déploiements et a utilisé chaque enseignant pour évaluer ces déploiements dans son domaine d'expertise. Comme l'évaluation porte sur les sorties sur politique du propre étudiant plutôt que sur un jeu de données hors ligne fixe, le signal d'entraînement reste aligné sur ce que l'étudiant produit réellement au moment de l'inférence. NVIDIA appelle cette boucle la co-évolution : de nouvelles rondes d'enseignants sont initialisées à partir de points de contrôle actualisés de l'étudiant, si bien que les deux parties continuent de s'améliorer.
Ce checkpoint est le membre chargé du raisonnement général de ce panel. Il est produit à partir de l'élève Nemotron 3 Ultra post-entraîné, via une série supplémentaire de SFT intensive en raisonnement et d'apprentissage par renforcement, et la fiche du modèle le décrit comme optimisé pour des traces de raisonnement longues et de haute qualité sur les problèmes multi-étapes les plus difficiles en mathématiques, logique et raisonnement abstrait — y compris les preuves formelles et le codage compétitif. Au sein de MOPD, il joue plusieurs rôles à la fois, un seul checkpoint, de nombreux rôles : génération de traces de raisonnement, évaluation mathématique, et juge d'équivalence qui note des réponses courtes en texte libre par rapport à une référence. NVIDIA le propose également en version autonome car c'est un raisonneur puissant à part entière — conçu pour la génération de traces de raisonnement à long horizon, la résolution de problèmes difficiles, et pour servir d'enseignant ou de correcteur dans votre propre pipeline de distillation.
Les spécifications en une seule passe.
• Paramètres — 550B au total / 55B actifs, LatentMoE sparse
• Architecture — hybride Mamba2-Transformer avec mélange latent d'experts et prédiction multi-token (MTP)
• Fenêtre de contexte — jusqu'à 1M de jetons ; 256K par défaut dans les configurations de service de référence.
• Langues — 10 : anglais, français, espagnol, italien, allemand, japonais, hindi, coréen, portugais brésilien, chinois
• Licence — OpenMDW-1.1, utilisation commerciale et non commerciale autorisée
• Matériel minimum — 4×B200 (poids NVFP4) ; GB200/GB300 et classe H100 également pris en charge
L'architecture est de la même famille que Nemotron 3 Ultra lui-même : la forme 550B-A55B avec des couches Mamba-2 et MoE entrelacées, des couches d'attention sélectives et des têtes MTP pour le décodage spéculatif natif. L'enseignant n'est pas un élève plus petit — c'est une variante du même empilement, entraînée différemment, spécialisée dans le raisonnement à long horizon plutôt que dans le travail d'agent général.

Pourquoi l'open sourcing d'un enseignant est important
Les points de contrôle des enseignants sont le type de publication de modèles ouverts le plus rare. Les entreprises publient en permanence les élèves — les modèles que vous déployez — ainsi que des jeux de données ; elles ne publient presque jamais les modèles qui ont évalué le travail des élèves. C'est pourquoi la phrase du rapport de juin indiquant que les points de contrôle par enseignant ne seraient pas publiés a été interprétée comme une porte fermée à la reproduction complète du pipeline MOPD. Cette publication entrouvre cette porte, du moins pour l'enseignant de raisonnement.
Pour les équipes qui construisent leurs propres modèles de raisonnement, c'est une valeur concrète. Le signal de récompense qui a façonné le raisonnement de Nemotron 3 Ultra a été en partie écrit par ce point de contrôle, et il peut désormais être étudié directement, utilisé comme juge, ou pour générer des traces de raisonnement à long horizon pour les données SFT. Combiné avec les données de post-entraînement déjà ouvertes (nvidia/nemotron-post-training-v3) et les recettes d'entraînement publiées, cela réduit l'écart entre « NVIDIA a entraîné un excellent modèle » et « nous pouvons en entraîner un similaire ».

Le cadran de réflexion
Une caractéristique distinctive est héritée de la famille Nemotron 3 : le raisonnement est un interrupteur, pas une valeur par défaut. Le gabarit de chat accepte enable_thinking=true/false, une option medium_effort, et un plafond de jetons reasoning_budget, de sorte qu'un appelant peut forcer un raisonnement approfondi à long horizon quand un problème l'exige, et obtenir des réponses directes — plus rapides et moins chères — quand ce n'est pas le cas. Pour un modèle enseignant, cela compte plus qu'il n'y paraît : les exécutions de distillation veulent des passes d'évaluation peu coûteuses sur des échantillons faciles et des traces de raisonnement coûteuses sur les échantillons difficiles, et un seul point de contrôle prenant en charge les deux modes élimine le besoin de changer de modèle en cours de pipeline.
En train de l'exécuter.
Ce n'est pas un modèle que l'on invoque à la légère. La configuration de service minimale raisonnable est de 4×B200 avec des poids NVFP4 et un cache KV fp8 ; les configurations de référence couvrent également les machines multi-nœuds GB200/GB300 et de classe H100. NVIDIA publie des guides de préparation pour trois moteurs — vLLM (0.22), SGLang (0.5.13) et TensorRT-LLM (1.3.0rc17) — exposant tous une API compatible OpenAI sur le port 8000, avec décodage spéculatif MTP ou EAGLE et un backend Mamba flashinfer. Le contexte de 1M de tokens nécessite un indicateur d'autorisation explicite dans chaque moteur (VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 et équivalents) ; le plafond par défaut est de 256K.
Au moment où j'écris ces lignes, le modèle n'est déployé par aucun fournisseur d'inférence sur Hugging Face, et NVIDIA n'a pas annoncé d'hébergement NIM — il s'agit d'une publication des poids uniquement. Cela en fait un modèle destiné aux laboratoires qui exploitent déjà de grands parcs de GPU, ou aux équipes dont le pipeline de distillation a spécifiquement besoin du signal enseignant exact. Lorsqu'il arrivera sur une API managée, le calcul du prix est simple : c'est un MoE à 55B de paramètres actifs, et celui qui l'héberge facture ce que coûtent les GPU. Sur une couche de routage qui fonctionne avec une marge de 0 %, vous payez le prix catalogue du fournisseur, sans frais de plateforme par-dessus — et la même clé qui donne accès à ce modèle donne aussi accès aux modèles de pointe auxquels vous comparez ses traces, avec basculement automatique si un hôte tombe. C'est à cela que sert un routeur comme OrcaRouter ; l'enseignant, lui, est la partie que vous hébergez vous-même.
Les honnêtes mises en garde
Ce checkpoint a 24 heures, et la fiche du modèle ne contient aucun chiffre de benchmark. Ce n'est pas une omission dans ce document — c'est l'état de la publication. NVIDIA a publié les détails de l'architecture et de l'entraînement, mais aucun tableau d'évaluation, et aucun laboratoire indépendant n'a encore eu le temps de le faire tourner. Le point de référence le plus proche est constitué par les chiffres rapportés par le fournisseur pour l'étudiant : Nemotron 3 Ultra rapporte 71,9 sur SWE-Bench Verified, 86,8 sur MMLU-Pro, 89,0 sur LiveCodeBench v6, et environ 95 sur RULER avec un contexte de 1M. Ces chiffres décrivent l'étudiant Ultra, pas ce professeur, et ce sont des données propres à NVIDIA. Quiconque prévoit une exécution de distillation sur ce checkpoint doit considérer sa qualité de raisonnement comme non vérifiée jusqu'à l'apparition de scores indépendants.
Deux autres mises en garde sont intégrées à la fiche. Le corpus de post-entraînement est fortement pondéré en anglais — environ 8,6 millions d’échantillons en anglais contre environ 138 000 pour chacune des neuf autres langues — de sorte que la qualité du raisonnement multilingue ne doit pas être déduite de l’étiquette des 10 langues. Et la fiche elle-même signale un déséquilibre de représentation dans les données d’entraînement de base et recommande des audits de biais avant une utilisation en aval.
Qui devrait s'en soucier
Trois groupes en tirent une réelle valeur. Les chercheurs en distillation ont enfin un véritable enseignant MOPD à disséquer, et non pas seulement une recette qui en décrit un. Les laboratoires qui entraînent leurs propres modèles de raisonnement obtiennent un générateur de traces à long horizon et un juge issus de la même lignée post-entraînement que le modèle qu'ils cherchent à égaler. Et quiconque fait du RL on-policy peut l'utiliser comme NVIDIA l'a fait — comme un scoreur pour les problèmes les plus difficiles, avec la réflexion activée uniquement là où cela s'avère rentable.
Si vous n'appartenez à aucun de ces groupes, cette version change peu de choses pour vous aujourd'hui : le modèle est volumineux, non éprouvé, et réservé à l'auto-hébergement, et le moyen le plus rapide d'agir sur la tendance sous-jacente — l'apparition de davantage d'enseignants de raisonnement ouverts — est de maintenir la couche de modèle de votre pipeline interchangeable derrière une interface unique plutôt que soudée à un seul point de contrôle.

Que regarder ensuite
Trois éléments indiqueront s'il s'agit d'un cas isolé ou de la sortie du panel. Premièrement, si les modèles enseignants frères suivent la même voie — {{1}}NVIDIA-Nemotron-Labs-Teacher-STEM{{/1}} est déjà sorti le jour même, donc la question est de savoir quels spécialistes de domaine viendront ensuite et s'ils sont pondérés de la même manière. Deuxièmement, si {{2}}NVIDIA NIM{{/2}} ou un hôte géré commence à les servir, ce qui transformerait une sortie réservée aux laboratoires en quelque chose que le reste de l'industrie peut réellement invoquer. Troisièmement, si des benchmarks indépendants apparaissent — une entrée dans {{3}}Artificial Analysis{{/3}} ou un passage sur {{4}}LMArena{{/4}} serait le premier véritable test pour vérifier si la qualité de raisonnement de l'enseignant correspond à celle de l'élève qu'il a formé.
