
Nemotron-3-Labs-Ultra-Math-RL : NVIDIA a discrètement publié en open source le checkpoint RL derrière son parcours à l'IMO 2026
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0455Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0247Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0247Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0157Intelligence82Code
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2646Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligence75Code
- obsidianQwen3.8 27B2026-08-1541Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1251Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0547Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligence49Code
NVIDIA a publié Nemotron-3-Labs-Ultra-Math-RL sur Hugging Face les 2 et 3 septembre 2026, sans billet de blog, sans annonce sur X ni communiqué de presse — la fiche du modèle apparaît tout simplement, datée du 3 septembre, et se résume en une ligne : il s’agit du checkpoint d’apprentissage par renforcement, désigné sous le nom de « Nemotron-3-Ultra-RL » dans le rapport technique d’accompagnement de NVIDIA, qui a été « déployé dans le cadre d’un système d’ensemble ayant obtenu un score de niveau médaille d’or à l’Olympiade internationale de mathématiques 2026 ». Le score officiel de ce système — 30 points sur 42, au-dessus du seuil de 29 points pour l’or — avait été largement rapporté fin juillet, lorsque les poids du modèle de base étaient déjà publics depuis juin. Ce qui n’était pas téléchargeable à l’époque, c’était la paire de modèles spécialisés post-entraînés réellement utilisée lors de la compétition. L’un d’eux se trouve aujourd’hui dans un dépôt Hugging Face public avec zéro like et un nombre de téléchargements quasi nul.
Cette histoire est celle d’une publication discrète, il vaut donc la peine d’être précis sur ce qui est connaissable et ce qui ne l’est pas. Ce qui est connaissable à partir du dépôt et du rapport : l’architecture du checkpoint, sa recette d’entraînement, le rôle qu’il a joué dans la soumission IMO 2026, ainsi que les ensembles de données et le benchmark publiés par NVIDIA à ses côtés. Non encore confirmé : toute annonce de fournisseur, tout benchmark tiers indépendant de ce checkpoint, et toute API hébergée — il s’agit d’une publication de poids auto-hébergée sous la licence OpenMDW-1.1, et son exécution implique la mise en place d’environ 1,5 To de HBM de classe Blackwell.
Ce qui a réellement été livré cette semaine
Le dépôt nvidia/Nemotron-3-Labs-Ultra-Math-RL a été créé sur Hugging Face le 2 septembre 2026 (19:11 UTC) et modifié pour la dernière fois le 8 septembre. Il fait partie d'une publication coordonnée regroupée sous nvidia/nemotron-labs-imo-2026, qui contient :
• Les deux points de contrôle de compétition post-entraînés — Nemotron-3-Labs-Ultra-Math-RL (ce sujet) et son homologue affiné par apprentissage supervisé Nemotron-3-Labs-Ultra-Math-SFT, tous deux sous OpenMDW-1.1.
• Les deux corpus d'entraînement qui les sous-tendent — Nemotron-Math-Proofs-v3-SFT et Nemotron-Math-Proofs-v3-RL, tous deux sous licence CC-BY-4.0.
• Nemotron-IMO-Bench, un nouveau benchmark d'évaluation composé de 200 problèmes inédits de niveau olympiade (50 en algèbre, 50 en combinatoire, 50 en géométrie, 50 en théorie des nombres), chacun associé à une preuve de référence validée par un expert humain, créé avec le mathématicien Titu Andreescu afin que ces problèmes ne puissent apparaître dans aucun ensemble d'entraînement.
• Le checkpoint de base NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 à partir duquel ils sont tous affinés.
La description de la collection renvoie au rapport technique qui fait le lien entre tous les éléments : « An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics » (le PDF dans le dépôt NeMo-Skills de NVIDIA est daté du 8 septembre 2026). Parallèlement aux points de contrôle, NVIDIA a publié le pipeline d'inférence, les preuves soumises, la recette d'entraînement par apprentissage par renforcement et un bilan complet des ressources de calcul de l'exécution de la compétition. Le cadrage est explicitement celui d'une science reproductible : c'est NVIDIA qui dit : voici tout ce qu'il faut pour reconstruire le système.
Ce qu'est Nemotron-3-Labs-Ultra-Math-RL
Sur le plan architectural, il ne s'agit pas d'un nouveau modèle de base — c'est un finetune de la version généralement disponible NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, le checkpoint hybride Mamba2–Transformer Latent Mixture-of-Experts que NVIDIA a initialement publié le 4 juin 2026. Le checkpoint Math-RL conserve cette architecture et cette échelle : 550B paramètres au total avec 55B actifs, prédiction multi-tokens et prise en charge de fenêtres de contexte allant jusqu'à 1M tokens. Ce que l'entraînement RL modifie, c'est la spécialisation, et elle est étroite de manière délibérée :
• Objectif — résoudre des problèmes difficiles de mathématiques de compétition et agir comme juge des preuves : le modèle est entraîné à produire une solution rigoureuse, à l'auto-évaluer selon un barème de 0 / 0,5 / 1, et à identifier les erreurs dans les preuves.
Ce n'est pas un chatbot général — la fiche et le rapport décrivent un travailleur spécialisé pour un pipeline de recherche de preuves, et non un assistant qui suit des instructions.
• Licence — OpenMDW-1.1, la licence de modèle ouvert permissive de NVIDIA qui autorise une utilisation commerciale et non commerciale, comme pour le modèle de base et les versions précédentes des modèles enseignants de Nemotron Labs.
• Déploiement — aucun prix catalogue hébergé où que ce soit ; vous téléchargez les safetensors et auto-hébergez. La configuration de référence de NVIDIA est un nœud unique de 8× B200 (~1,5 To de HBM agrégé), avec des options multi-nœuds sur H100/H200/GB200/GB300. vLLM est le runtime recommandé, avec un analyseur de raisonnement, l’analyseur d’appels d’outils Qwen3-Coder, les paramètres de cache Mamba SSM et le décodage spéculatif MTP sur 5 jetons, tous mentionnés dans la fiche.

Pourquoi ce point de contrôle est important : il se trouvait dans le système IMO 2026
Le résultat de l'IMO 2026 est la raison pour laquelle on s'intéresse à ce modèle, donc la distinction qui compte est : le 30/42 est un score de système, pas un score de modèle unique. La soumission de NVIDIA était un pipeline en deux étapes avec plusieurs points de contrôle, et Nemotron-3-Labs-Ultra-Math-RL était un composant qui y jouait deux rôles.
Selon le rapport, la première étape a exécuté une recherche itérative de type générer–vérifier–affiner pendant jusqu'à huit tours par problème. Le premier tour a échantillonné 384 tentatives de preuve — 16 pour chacun des huit invites de stratégie de solution différentes, pour chacun des trois points de contrôle : le modèle de disponibilité générale, le spécialiste SFT et le spécialiste RL. La vérification en cours de recherche a utilisé les points de contrôle RL et SFT comme un panel de deux modèles : huit jugements indépendants de chacun, et une preuve n'était acceptée que si les 16 jugements lui attribuaient la note 1. Une étape ultérieure à forte intensité de calcul a réévalué chaque finaliste avec les trois points de contrôle (16 jugements de type IMO chacun, sur une échelle de 0 à 7) et a sélectionné l'unique soumission par problème.
Le résultat officiel, tel que rapporté dans l'article et conforme à ce qui avait été annoncé fin juillet : 30 points sur 42 à l'épreuve de l'IMO 2026, au-dessus du seuil de 29 points pour la médaille d'or, avec une note complète aux problèmes 1, 2, 4 et 5 et un point chacun aux problèmes 3 et 6, le tout évalué par les correcteurs officiels de l'IMO. Le propre décompte des ressources de NVIDIA indique que les six preuves soumises ont été trouvées en environ 707 millions de jetons générés et 1 464 heures GPU GB200 ; l'achèvement des sessions en cours a porté l'exécution complète à environ 2,31 milliards de jetons et 4 800 heures GPU GB200.
Deux chiffres internes du rapport donnent une idée de la raison pour laquelle le checkpoint RL a mérité sa place dans l’ensemble. Sur l’ensemble de développement de 30 problèmes de NVIDIA, évalué par un jury indépendant composé de GPT-5.5, Gemini 3.1 Pro et Claude Opus 4.8 suivant une procédure de type MathArena, le spécialiste RL était le meilleur pipeline à checkpoint unique de bout en bout (180 points sur 210 possibles, contre 165 pour le spécialiste SFT et 162 pour le modèle de base), bien que le checkpoint SFT ait résolu davantage de problèmes au premier tour. Et sur un ensemble d’audit de 300 preuves, le panel de vérification RL+SFT déployé a réduit le taux de fausse acceptation — l’échec qui met fin à la recherche sur une preuve invalide — à environ 1,1 %, contre 12,4 % pour le checkpoint RL jugeant seul et 31,6 % pour le modèle de base. Le point du rapport est que, sous une règle d’unanimité, chacun des deux spécialistes sélectifs détecte les erreurs de l’autre.
Ce sont les propres ablations de NVIDIA sur son propre ensemble de développement, rapportées dans l'article de NVIDIA — à considérer comme des preuves rapportées par le fournisseur, qui montrent pourquoi la conception fonctionne, et non comme des scores indépendants. L'ensemble de développement lui-même ne compte que 30 problèmes, et aucun laboratoire externe n'a encore exécuté ce checkpoint.
La recette du RL, en bref
Les données d'entraînement et la méthode sont entièrement ouvertes, ce qui est la véritable nouvelle pour toute personne menant des recherches en RL sur le raisonnement mathématique. Les points clés du rapport :
• Données — les problèmes proviennent du sous-ensemble AoPS de Nemotron-Math-Proofs-v1, filtré pour ne conserver que ceux que le modèle Ultra de base résout en une à trois tentatives sur quatre (selon l’évaluation de DeepSeek-V3.2-Speciale) — des problèmes de programme d’apprentissage difficiles mais traitables. Ce filtre produit 9 597 invites de génération de preuves, publiées sous le nom de Nemotron-Math-Proofs-v3-RL.
• Récompense — suit la conception de DeepSeekMath-V2 mais abandonne le terme de récompense d’auto-analyse ; le signal de jugement provient d’un service de jugement de preuves pendant l’entraînement.
• Algorithme — RL asynchrone construit sur NeMo-RL, dans le même esprit que PipelineRL : un pool fixe de prompts maintenus en vol, des séquences terminées injectées dans l’entraîneur à mesure que les lots se remplissent, un échantillonnage d’importance tronqué et des tokens à faible probabilité masqués sur les échantillons positifs lorsque l’entropie grimpe. La configuration utilisait un contexte de 131 072 tokens et environ 128 nœuds d’entraînement, 128 nœuds d’inférence et 16 nœuds de jugement de 4× GB200 chacun.
Le checkpoint SFT frère, par contraste, était un affinage supervisé à contexte long issu de la même base, entraîné sur un corpus filtré qualitativement de 414 890 traces de preuve, de raffinement, de vérification et de méta-vérification couvrant 15 818 problèmes, exécuté sur 512 GPU GB200.

Ce qui n'est pas encore connu
La sincérité des sources joue dans les deux sens ici, et un lecteur qui décide de s'intéresser à cette sortie devrait garder quatre réserves à l'esprit :
• Aucune annonce. Au moment de la rédaction, NVIDIA n'a pas encore officiellement annoncé la collection ; elle est apparue sur Hugging Face. Le rapport technique en PDF est daté du 8 septembre, donc la recette écrite est elle aussi publiée cette semaine.
• Aucun benchmark indépendant.Chaque chiffre de performance associé à ce checkpoint — les ablations sur l'ensemble de développement, l'audit du vérificateur, le score système IMO 2026 — provient du rapport de NVIDIA lui-même. Le score IMO lui-même est celui dont la provenance est la plus solide de l'ensemble, car il a été évalué dans des conditions officielles de compétition, mais il s'agit d'un résultat au niveau du système, et la contribution du checkpoint à ce résultat n'a pas été reproduite par un laboratoire externe.
• Pas d'API hébergée, pas de prix catalogue. C'est une version à auto-héberger. Quiconque souhaite l'appeler a besoin du matériel. La couverture de juillet annonçant « NVIDIA Nemotron 3 Ultra a décroché l'or aux IMO 2026 » peut facilement être interprétée à tort comme « téléchargez-le et il résout les problèmes des Olympiades » — la version honnête étant « téléchargez les composants du système qui l'a fait. »
• Le cadrage « médaille d'or ». La formulation de NVIDIA est « atteindre le seuil de la médaille d'or », et l'article prend soin de préciser que le modèle faisait partie d'un ensemble. Toute affirmation selon laquelle ce seul checkpoint serait à lui seul « au niveau d'une médaille d'or » doit être considérée comme non étayée.
À qui cela s’adresse
Cette publication s'adresse à un lecteur précis : un laboratoire ou un chercheur travaillant sur le raisonnement mathématique, la génération de preuves, ou l'apprentissage par renforcement avec des récompenses vérifiables, qui souhaite une implémentation de référence d'un système ayant franchi le seuil de l'or aux olympiades en langage naturel — sans prouveur formel, sans outils, sans internet. Pour ce lecteur, la valeur réside dans l'ensemble du package : les poids, les corpus SFT et RL, les invites au format NeMo-Gym, le pipeline d'inférence, les preuves soumises, et le décompte des calculs qui indique ce que coûte réellement une exécution de compétition en heures GPU.
Pour tous les autres, la remarque pratique est que la recherche de preuves de niveau olympiade est disproportionnée pour la plupart des charges de travail mathématiques réelles. Les problèmes de niveau AIME et de concours, ainsi que pratiquement tout le travail de mathématiques appliquées dans le code, sont traités confortablement par des modèles bien plus petits — ce qui importe, car un checkpoint de 550B ne se lance pas pour un travail par lots. Les plus petits modèles de mathématiques ouverts et les modèles API de pointe sont accessibles via une seule API sur OrcaRouter au prix catalogue des fournisseurs (aucune marge de notre côté, donc une baisse de prix d’un fournisseur est effective le jour même), avec bascule automatique si vous voulez essayer un modèle non éprouvé sans engager un chemin de production. Commencez par là ; n’hébergez vous-même un 550B que lorsque la charge de travail exige réellement une recherche de preuves à l’échelle de la frontière.
La question ouverte à suivre est de savoir si cette mise en ligne discrète fera l’objet d’une annonce officielle et d’une note de version formelle, et si quelqu’un en dehors de NVIDIA exécutera la recette de bout en bout et rapportera un score IMO-Bench indépendant. Ce benchmark — 200 problèmes d’olympiade récents et inédits — est sans doute l’artefact le plus utile de la collection : c’est exactement le type d’évaluation résistante à la contamination qui manquait au domaine. Si la recette se reproduit, la mise en ligne silencieuse de cette semaine sur Hugging Face se révélera être l’une des publications de modèles ouverts les plus importantes de l’année. Si elle ne se reproduit pas, la collection reste un compte-rendu détaillé et honnête de ce qu’une exécution à l’échelle frontière du cycle générer–vérifier–affiner a réellement exigé.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
