
Nemotron-3-Labs-Ultra-Math-RL: NVIDIA heeft in alle stilte de RL-checkpoint achter zijn IMO 2026-run open source gemaakt
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0455Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0247Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0247Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0157Intelligentie82Coderen
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2646Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1541Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1251Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0547Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligentie49Coderen
NVIDIA plaatste Nemotron-3-Labs-Ultra-Math-RL op Hugging Face op 2–3 september 2026, zonder blogpost, zonder X-aankondiging en zonder persbericht — de modelkaart verschijnt gewoon, gedateerd 3 september, en legt zichzelf in één regel uit: het is de reinforcement-learning-checkpoint, in NVIDIA’s begeleidende technische rapport aangeduid als "Nemotron-3-Ultra-RL", die "werd ingezet als onderdeel van een ensemblesysteem dat een score op gouden-medaille-niveau behaalde bij de Internationale Wiskunde Olympiade 2026." De officiële score van dat systeem — 30 van de 42 punten, boven de gouden drempel van 29 punten — werd eind juli breed gerapporteerd, toen de basismodelgewichten al sinds juni openbaar waren. Wat toen niet downloadbaar was, was het paar verder getrainde specialisten dat de competitierun daadwerkelijk gebruikte. Eén ervan staat nu in een openbare Hugging Face-repo met nul likes en een nagenoeg nul downloadaantal.
Dit is een verhaal over een stille release, dus het is de moeite waard om precies te zijn over wat we wel en niet weten. Uit de repository en het rapport weten we de architectuur van het checkpoint, het trainingsrecept, de rol die het speelde in de IMO 2026-inzending, en de datasets en de benchmark die NVIDIA er samen mee heeft uitgebracht. Nog niet bevestigd: een leveranciersaankondiging, onafhankelijke benchmarks van derden voor dit checkpoint, of een gehoste API — dit is een self-host-release van gewichten onder de OpenMDW-1.1-licentie, en om het te draaien moet je ruwweg 1,5 TB aan Blackwell-klasse HBM opzetten.
Wat er deze week daadwerkelijk is uitgebracht
Het repository nvidia/Nemotron-3-Labs-Ultra-Math-RL is op 2 september 2026 (19:11 UTC) op Hugging Face aangemaakt en voor het laatst gewijzigd op 8 september. Het is een item in een gecoördineerde release die is verzameld onder nvidia/nemotron-labs-imo-2026, en die bevat:
• De twee competitiecheckpoints die via post-training zijn verkregen — Nemotron-3-Labs-Ultra-Math-RL (dit onderwerp) en zijn door supervised fine-tuning getrainde zustermodel Nemotron-3-Labs-Ultra-Math-SFT, beide onder OpenMDW-1.1.
• De twee trainingscorpora erachter — Nemotron-Math-Proofs-v3-SFT en Nemotron-Math-Proofs-v3-RL, beide CC-BY-4.0.
• Nemotron-IMO-Bench, een nieuwe evaluatiebenchmark met 200 niet-gepubliceerde problemen op olympiadeniveau (50 algebra, 50 combinatoriek, 50 meetkunde, 50 getaltheorie), elk gekoppeld aan een door experts samengesteld referentiebewijs, ontwikkeld samen met wiskundige Titu Andreescu, specifiek zodat de problemen niet in enige trainingsset kunnen voorkomen.
• Het basis-checkpoint NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 waarvan ze allemaal zijn gefinetuned.
De collectiebeschrijving verwijst naar het technisch rapport dat alles met elkaar verbindt: 'An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics' (de pdf in NVIDIA's NeMo-Skills-repo is gedateerd 8 september 2026). Naast de checkpoints heeft NVIDIA ook de inferentiepipeline, de ingediende bewijzen, het RL-trainingsrecept en een volledige verantwoording van de gebruikte rekenkracht voor de competitierun vrijgegeven. De opzet is expliciet reproduceerbare wetenschap: hiermee zegt NVIDIA: hier is alles wat nodig is om het systeem opnieuw op te bouwen.
Wat Nemotron-3-Labs-Ultra-Math-RL is
Architectonisch is dit geen nieuw basismodel — het is een finetune van de algemeen beschikbare NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, het hybride Mamba2–Transformer Latent-Mixture-of-Experts-checkpoint dat NVIDIA op 4 juni 2026 voor het eerst uitbracht. Het Math-RL-checkpoint behoudt die architectuur en schaal: 550B totale parameters met 55B actief, multi-token-predictie en ondersteuning voor contextvensters tot 1M tokens. Wat RL-training verandert, is de specialisatie, en die is bewust smal gehouden:
• Doel — moeilijke wiskundewedstrijdproblemen oplossen en optreden als bewijsbeoordelaar: het model wordt getraind om een rigoureuze oplossing te produceren, deze zelf te beoordelen aan de hand van een rubric met de scores 0 / 0.5 / 1, en fouten in bewijzen te identificeren.
Het is geen algemene chatbot — de kaart en het rapport beschrijven een gespecialiseerde werker voor een bewijszoekpijplijn, geen assistent die instructies opvolgt.
• Licentie — OpenMDW-1.1, NVIDIA's permissieve open-modellicentie die commercieel en niet-commercieel gebruik toestaat, net als de basis- en de eerdere Nemotron Labs-teacherreleases.
• Implementatie — nergens een gepubliceerde prijs voor een gehoste versie; je downloadt safetensors en host zelf. NVIDIA's referentieconfiguratie is een enkele node met 8× B200 (~1,5 TB totaal HBM), met multi-node opties voor H100/H200/GB200/GB300. vLLM is de aanbevolen runtime, met een reasoning-parser, de Qwen3-Coder tool-call-parser, Mamba SSM-cache-instellingen en MTP-speculatieve decodering op 5 tokens, allemaal vermeld op de kaart.

Waarom dit controlepunt belangrijk is: het bevond zich in het IMO 2026-systeem.
Het IMO 2026-resultaat is de reden waarom men naar dit model kijkt, dus het onderscheid dat telt is: de 30/42 is een systeemscore, geen score van één model. De inzending van NVIDIA was een pipeline met twee fasen en meerdere checkpoints, en Nemotron-3-Labs-Ultra-Math-RL was een component met twee taken.
Volgens het rapport voerde de eerste fase een iteratieve generate–verify–refine-zoektocht uit met maximaal acht rondes per probleem. In ronde één werden 384 bewijspogingen bemonsterd — 16 van elk van acht verschillende prompts voor oplossingsstrategieën, uit elk van de drie checkpoints: het algemeen beschikbare model, de SFT-specialist en de RL-specialist. De verificatie tijdens het zoeken gebruikte de RL- en SFT-checkpoints als een panel van twee modellen: acht onafhankelijke oordelen van elk, en een bewijs werd alleen geaccepteerd als alle 16 oordelen het een score van 1 gaven. Een latere fase met hoge rekenkracht herbeoordeelde elke finalist met alle drie checkpoints (16 beoordelingen in IMO-stijl elk, op een schaal van 0–7) en selecteerde één enkele inzending per probleem.
Het officiële resultaat, zoals gerapporteerd in het artikel en in lijn met de berichtgeving van eind juli: 30 van de 42 punten op het IMO 2026-examen, boven de 29-punts afkapgrens voor een gouden medaille, met volledige punten voor de problemen 1, 2, 4 en 5 en één punt voor de problemen 3 en 6, beoordeeld door officiële IMO-beoordelaars. De eigen resource-accounting van NVIDIA stelt dat alle zes ingediende bewijzen zijn gevonden binnen ongeveer 707 miljoen gegenereerde tokens en 1.464 GB200 GPU-uren; het afronden van de lopende rondes bracht de volledige run op ongeveer 2,31 miljard tokens en 4.800 GB200 GPU-uren.
Twee interne cijfers uit het rapport maken duidelijk waarom het RL-checkpoint zijn plek in het ensemble verdiende. Op de ontwikkelset van NVIDIA met 30 problemen, beoordeeld door een onafhankelijke jury van GPT-5.5, Gemini 3.1 Pro en Claude Opus 4.8 volgens een procedure in MathArena-stijl, was de RL-specialist end-to-end de beste pipeline met één checkpoint (180 van de maximaal 210 jurypunten, tegenover 165 voor de SFT-specialist en 162 voor het basismodel), alhoewel het SFT-checkpoint in ronde één meer problemen oploste. En op een auditset met 300 bewijzen verlaagde het ingezette RL+SFT-verificatiepanel het percentage onterechte acceptaties — de fout die een zoektocht naar een ongeldig bewijs beëindigt — tot ongeveer 1,1%, tegenover 12,4% voor het RL-checkpoint dat alleen oordeelde en 31,6% voor het basismodel. Het punt van het rapport is dat de twee selectieve specialisten elkaars fouten opvangen onder een unanimiteitsregel.
Dit zijn NVIDIA's eigen ablatiestudies op NVIDIA's eigen ontwikkelset, zoals gerapporteerd in NVIDIA's paper — te beschouwen als door de leverancier gerapporteerd bewijs van waarom het ontwerp werkt, niet als onafhankelijke scores. De ontwikkelset zelf omvat slechts 30 problemen, en geen enkel extern lab heeft dit checkpoint nog gedraaid.
Het RL-recept, in het kort.
De trainingsdata en de methode zijn volledig open, wat het echte nieuws is voor iedereen die onderzoek doet naar RL voor wiskundig redeneren. De hoogtepunten uit het rapport:
• Data — de problemen worden ontleend aan de AoPS-deelverzameling van Nemotron-Math-Proofs-v1, gefilterd op die welke het basismodel Ultra in één tot drie van de vier pogingen oplost (beoordeeld door DeepSeek-V3.2-Speciale) — moeilijke maar hanteerbare curriculumproblemen. Dat filter levert 9.597 prompts voor bewijsgeneratie op, uitgebracht als Nemotron-Math-Proofs-v3-RL.
• Beloning — volgt het ontwerp van DeepSeekMath-V2, maar laat de beloningsterm voor zelfanalyse weg; tijdens de training wordt het beoordelaarssignaal geleverd door een service die bewijzen beoordeelt.
• Algoritme — asynchrone RL gebaseerd op NeMo-RL, in dezelfde geest als PipelineRL: een vaste pool van prompts die in omloop worden gehouden, voltooide sequenties die aan de trainer worden gevoerd zodra batches zich vullen, getrunceerde importance sampling, en tokens met een lage waarschijnlijkheid die worden gemaskeerd op positieve samples wanneer de entropie stijgt. De configuratie gebruikte een context van 131.072 tokens en ruwweg 128 trainerknooppunten, 128 inferentieknooppunten en 16 beoordelaarsknooppunten van elk 4× GB200.
Het zuster-SFT-checkpoint was daarentegen een long-context supervised fine-tune van dezelfde basis over een kwaliteitsgefilterd corpus van 414.890 bewijs-, verfijnings-, verificatie- en metaverificatietraces die 15.818 problemen bestrijken, uitgevoerd op 512 GB200-GPU's.

Wat is nog niet bekend
Eerlijke bronvermelding snijdt hier aan twee kanten, en een lezer die moet bepalen of hij deze release belangrijk vindt, dient vier kanttekeningen in acht te nemen:
• Geen aankondiging. Op het moment van schrijven heeft NVIDIA de collectie niet formeel aangekondigd; deze verscheen op Hugging Face. De pdf van het technisch rapport is gedateerd op 8 september, dus het geschreven recept wordt deze week ook feitelijk gepubliceerd.
• Geen onafhankelijke benchmarks. Elk prestatiecijfer dat aan dit checkpoint is gekoppeld — de dev-set-ablatiestudies, de verifier-audit, de IMO 2026-systeemscore — is afkomstig uit NVIDIA's eigen rapport. De IMO-score zelf heeft de meest solide herkomst van de set, omdat deze onder officiële wedstrijdomstandigheden is beoordeeld, maar het is een resultaat op systeemniveau, en de bijdrage van het checkpoint daaraan is niet iets wat een extern laboratorium heeft gereproduceerd.
• Geen gehoste API, geen catalogusprijs.Dit is een self-host release. Iedereen die het wil aanroepen heeft de hardware nodig. De berichtgeving van juli over "NVIDIA Nemotron 3 Ultra behaalde goud op IMO 2026" kan gemakkelijk verkeerd worden gelezen als "download dit en het lost olympiadeproblemen op" — de eerlijke versie is "download de componenten van het systeem dat dat deed."
• De gouden framing.NVIDIA's eigen bewoording is "het bereiken van de gouden-medaille-drempel", en het artikel wijst er zorgvuldig op dat het model deel uitmaakte van een ensemble. Beschouw elke bewering dat dit ene checkpoint op zichzelf "gouden-medaille-niveau" is, als ongegrond.
Voor wie dit bedoeld is
Deze release is gericht op een specifieke lezer: een lab of onderzoeker die werkt aan wiskundig redeneren, bewijzengeneratie of RL met verifieerbare beloningen, en die een referentie-implementatie wil van een systeem dat de drempel voor olympiadegoud in natuurlijke taal heeft gehaald — geen formele prover, geen tools, geen internet. Voor die lezer zit de waarde in het hele pakket: gewichten, SFT- en RL-corpora, de NeMo-Gym-geformatteerde prompts, de inferentiepijplijn, de ingediende bewijzen en de rekenkrachtverantwoording die aangeeft wat een competitierun daadwerkelijk kost in GPU-uren.
Voor alle anderen is de praktische noot dat bewijszocken op olympiadeniveau overkill is voor de meeste echte wiskundige workloads. Problemen op AIME-niveau en wedstrijdniveau, en vrijwel al het toegepaste wiskundige werk in code, kunnen gemakkelijk door veel kleinere modellen worden afgehandeld — wat ertoe doet omdat een 550B-checkpoint niet iets is dat je even opstart voor een batchjob. De kleinere open wiskundemodellen en de frontier-API-modellen zijn bereikbaar via één API op OrcaRouter tegen de lijstprijzen van de leveranciers (geen opslag aan onze kant, dus een prijsverlaging van de leverancier is dezelfde dag van kracht), met automatische failover als je een onbewezen model wilt testen zonder je productiepad ervan afhankelijk te maken. Begin daar; stap pas over op self-hosting van een 550B wanneer de workload werkelijk bewijszocken op frontierschaal vereist.
De open vraag om in de gaten te houden is of deze stille publicatie een officiële aankondiging en een formele release note krijgt, en of iemand buiten NVIDIA het recept end-to-end uitvoert en een onafhankelijke IMO-Bench-score rapporteert. Die benchmark — 200 verse, niet-gepubliceerde olympiade-opgaven — is zonder twijfel het nuttigste artefact in de collectie: het is precies het soort contaminatiebestendige evaluatie waar het veld behoefte aan had. Als het recept reproduceerbaar blijkt, zal deze stille Hugging Face-upload van deze week een van de belangrijkste open-model releases van het jaar blijken te zijn. Zo niet, dan blijft de collectie een gedetailleerd en eerlijk verslag van wat een run op frontniveau van generate–verify–refine daadwerkelijk vereiste.

Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
