
Nemotron-3-Labs-Ultra-Math-RL: NVIDIA har i det tysta släppt RL-checkpointen bakom sin IMO 2026-satsning som öppen källkod
- openaiNYOpenAI: GPT-6 Astra2026-09-0455Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0247Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0247Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0157Intelligens82Kodning
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2646Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1541Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1251Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0547Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligens49Kodning
NVIDIA släppte Nemotron-3-Labs-Ultra-Math-RL på Hugging Face den 2–3 september 2026, utan blogginlägg, utan tillkännagivande på X och utan pressmeddelande – modellkortet dyker helt enkelt upp, daterat den 3 september, och förklarar sig självt på en enda rad: det är checkpointen från förstärkningsinlärningen, kallad "Nemotron-3-Ultra-RL" i NVIDIAs medföljande tekniska rapport, som "användes som en del av ett ensemblesystem som uppnådde ett resultat på guldmedaljnivå vid International Mathematical Olympiad 2026." Systemets officiella poäng – 30 av 42 poäng, över guldgränsen på 29 poäng – rapporterades flitigt redan i slutet av juli, då basmodellens vikter hade varit offentliga sedan juni. Det som inte gick att ladda ner då var de två eftertränade specialisterna som tävlingskörningen faktiskt använde. En av dem ligger nu i ett offentligt Hugging Face-repo med noll gillningar och ett nedladdningsantal på nära noll.
Detta är en lågmäld release-historia, så det är värt att vara precis om vad som är känt och vad som inte är det. Vad som går att få fram från repot och rapporten: checkpointens arkitektur, dess träningsrecept, den roll den spelade i IMO 2026-inskickningen samt de datamängder och riktmärken som NVIDIA släppte tillsammans med den. Ännu inte bekräftat: något leverantörstillkännagivande, något oberoende tredjepartsriktmärke av denna checkpoint och någon värdbaserad API – detta är en self-host-viktutgåva under OpenMDW-1.1-licensen, och att köra den innebär att man sätter upp ungefär 1,5 TB Blackwell-klassat HBM.
Vad som faktiskt levererades den här veckan
Repositoryt nvidia/Nemotron-3-Labs-Ultra-Math-RL skapades på Hugging Face den 2 september 2026 (19:11 UTC) och ändrades senast den 8 september. Det är en post i en koordinerad utgivning som samlats under nvidia/nemotron-labs-imo-2026, vilken innehåller:
• De två post-tränade tävlingscheckpoints – Nemotron-3-Labs-Ultra-Math-RL (detta ämne) och dess övervakat finjusterade syskon Nemotron-3-Labs-Ultra-Math-SFT, båda under OpenMDW-1.1.
• De två träningskorpusarna bakom dem — Nemotron-Math-Proofs-v3-SFT och Nemotron-Math-Proofs-v3-RL, båda CC-BY-4.0.
• Nemotron-IMO-Bench, ett nytt utvärderingsriktmärke med 200 opublicerade problem på olympiadnivå (50 algebra, 50 kombinatorik, 50 geometri, 50 talteori), där varje problem är parat med ett mänskligt granskat referensbevis, skapat tillsammans med matematikern Titu Andreescu specifikt för att problemen inte ska kunna förekomma i någon träningsuppsättning.
• Bascheckpointen NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 som de alla är finjusterade från.
Beskrivningen av samlingen pekar på den tekniska rapport som knyter ihop allt: "An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics" (PDF:en i NVIDIA:s NeMo-Skills-repo är daterad den 8 september 2026). Utöver checkpoints släppte NVIDIA inferenspipelinen, de inlämnade bevisen, RL-träningsreceptet och en fullständig redovisning av beräkningsresurserna för tävlingskörningen. Det hela är uttryckligen inramat som reproducerbar vetenskap – det är NVIDIA som säger: här finns allt som behövs för att bygga om systemet.
Vad Nemotron-3-Labs-Ultra-Math-RL är
Arkitekturmässigt är detta inte en ny basmodell — det är en finjustering av den allmänt tillgängliga NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, den Mamba2–Transformer-hybrid med latent Mixture-of-Experts som NVIDIA först släppte den 4 juni 2026. Math-RL-checkpointen behåller arkitekturen och skalan: 550B totala parametrar med 55B aktiva, multi-token-prediktion och stöd för kontextfönster på upp till 1M token. Det RL-träningen förändrar är specialiseringen, och den är medvetet snäv:
• Syfte — lösa svåra tävlingsproblem i matematik och agera som bevisgranskare: modellen är tränad att producera en rigorös lösning, självutvärdera den mot en bedömningsmatris med poängen 0 / 0,5 / 1, och identifiera fel i bevis.
Det är inte en allmän chatbot — kortet och rapporten beskriver en specialiserad arbetare för en bevissökningspipeline, inte en instruktionsföljande assistent.
• Licens — OpenMDW-1.1, NVIDIAs permissiva licens för öppna modeller som tillåter kommersiell och icke-kommersiell användning, samma som basmodellen och de tidigare teacher-versionerna från Nemotron Labs.
• Driftsättning — det finns inga listpriser för värdbaserad drift någonstans; du laddar ner safetensors och hostar själv. NVIDIAs referenskonfiguration är en enda nod med 8× B200 (~1,5 TB sammanlagd HBM), med flernodsalternativ för H100/H200/GB200/GB300. vLLM är den rekommenderade körningsmiljön, med en resonemangsparser, Qwen3-Coders verktygsanropsparser, cacheinställningar för Mamba SSM och spekulativ avkodning med MTP över 5 tokens — allt detta anges i modellkortet.

Varför denna kontrollpunkt är viktig: den var inuti IMO 2026-systemet.
IMO 2026-resultatet är anledningen till att någon alls tittar på den här modellen, så den avgörande skillnaden är: 30/42 är en systempoäng, inte en poäng för en enskild modell. NVIDIAs bidrag var en pipeline i två steg med flera kontrollpunkter, och Nemotron-3-Labs-Ultra-Math-RL var en komponent med två uppgifter.
Enligt rapporten körde det första steget en iterativ generera–verifiera–förfina-sökning i upp till åtta omgångar per problem. Omgång ett samplade 384 bevisförsök – 16 från var och en av åtta olika promptar med lösningsstrategier och från var och en av de tre kontrollpunkterna: den allmänt tillgängliga modellen, SFT-specialisten och RL-specialisten. Verifieringen under sökningen använde RL- och SFT-kontrollpunkterna som en panel med två modeller: åtta oberoende bedömningar från vardera, och ett bevis accepterades endast om alla 16 bedömningarna gav det betyget 1. Ett senare steg med hög beräkningskapacitet omgraderade varje finalist med alla tre kontrollpunkterna (16 bedömningar i IMO-stil vardera, på en skala 0–7) och valde ut det enda bidraget per problem.
Det officiella utfallet, som rapporterats i rapporten och överensstämmer med bevakningen från slutet av juli: 30 av 42 poäng på IMO 2026-provet, över guldmedaljgränsen på 29 poäng, med full poäng på problem 1, 2, 4 och 5 samt en poäng vardera på problem 3 och 6, bedömda av officiella IMO-rättare. NVIDIAs egen resursredovisning uppger att alla sex inlämnade bevis hittades inom cirka 707M genererade tokens och 1 464 GB200 GPU-timmar; att slutföra de pågående omgångarna förde hela körningen till cirka 2.31B tokens och 4 800 GB200 GPU-timmar.
Två interna siffror i rapporten ger en uppfattning om varför RL-checkpointen förtjänade sin plats i ensemblen. På NVIDIAs utvecklingsset med 30 problem, bedömt av en oberoende jury bestående av GPT-5.5, Gemini 3.1 Pro och Claude Opus 4.8 enligt ett förfarande i MathArena-stil, var RL-specialisten den bästa end-to-end-pipelinen med en enda checkpoint (180 av möjliga 210 jurypoäng, jämfört med 165 för SFT-specialisten och 162 för basmodellen), även om SFT-checkpointen löste fler problem i första omgången. Och på ett granskningsset med 300 bevis minskade den driftsatta RL+SFT-verifieringspanelen andelen falska godkännanden – felet som avslutar sökningen vid ett ogiltigt bevis – till cirka 1,1 %, jämfört med 12,4 % för enbart RL-checkpointens bedömning och 31,6 % för basmodellen. Rapportens poäng är att de två selektiva specialisterna fångar upp varandras fel under en enhällighetsregel.
Dessa är NVIDIAs egna ablationer på NVIDIAs eget utvecklingsset, rapporterade i NVIDIAs artikel — värda att betrakta som leverantörsrapporterade belägg för varför designen fungerar, inte som oberoende resultat. Själva utvecklingssetet innehåller bara 30 problem, och inget externt labb har ännu kört denna checkpoint.
RL-receptet, kortfattat
Träningsdatan och metoden är helt öppna, vilket är den egentliga nyheten för alla som forskar på RL för matematiska resonemang. Höjdpunkterna från rapporten:
• Data — problem hämtas från AoPS-delmängden av Nemotron-Math-Proofs-v1, filtrerade till de som basmodellen Ultra löser i en till tre av fyra försök (enligt bedömning av DeepSeek-V3.2-Speciale) — svåra men hanterbara läroplansproblem. Det filtret ger 9 597 bevisgenereringsprompter, släppta som Nemotron-Math-Proofs-v3-RL.
Belöning — följer DeepSeekMath-V2-designen men utesluter belöningskomponenten för självanalys; domarsignalen kommer från en bevisbedömningstjänst under träningen.
• Algoritm — asynkron RL byggd på NeMo-RL, i liknande anda som PipelineRL: en fast pool av prompts som hålls i omlopp, slutförda sekvenser matas till tränaren allteftersom batcher fylls, trunkerad importance sampling, och lågsannolika token maskeras på positiva sampel när entropin stiger. Konfigurationen använde en kontext på 131 072 token och ungefär 128 tränarnoder, 128 inferensnoder och 16 domarnoder med 4× GB200 vardera.
Syskon-SFT-kontrollpunkten var däremot en övervakad finjustering med lång kontext från samma bas över en kvalitetsfiltrerad korpus med 414 890 bevis-, förfinings-, verifierings- och metaverifieringsspår som täcker 15 818 problem, körd på 512 GB200 GPU:er.

Vad som ännu inte är känt
Ärlig källhantering skär åt båda hållen här, och en läsare som avgör om den här releasen är värd att bry sig om bör ha fyra förbehåll i åtanke:
• Inget tillkännagivande. När detta skrivs har NVIDIA inte formellt tillkännagett samlingen; den dök upp på Hugging Face. Den tekniska rapportens PDF är daterad den 8 september, så det skriftliga receptet publiceras i praktiken även denna vecka.
• Inga oberoende riktmärken. Varje prestandasiffra som är kopplad till denna checkpoint – ablationerna på utvecklingssetet, revisionen av verifieraren, IMO 2026-systempoängen – kommer från NVIDIAs egen rapport. Själva IMO-poängen har den starkaste härkomsten i uppsättningen eftersom den betygsattes under officiella tävlingsförhållanden, men det är ett resultat på systemnivå, och checkpointens bidrag till det är inte något som ett utomstående labb har reproducerat.
• Inget värdbaserat API, inget listpris.Det här är en självhostad utgåva. Den som vill anropa den behöver hårdvaran. Nyhetsrapporteringen från juli om att "NVIDIA Nemotron 3 Ultra tog guld vid IMO 2026" kan lätt feltolkas som "ladda ner det här så löser det olympiadproblem" — den ärliga versionen är "ladda ner komponenterna i det system som gjorde det."
• Guldinramningen.NVIDIAs eget språkbruk är att ”nå guldmedaljtröskeln”, och studien är noga med att modellen ingick i en ensemble. Behandla varje påstående om att denna enskilda kontrollpunkt ensam är ”guldmedaljnivå” som ogrundat.
Vem detta är till för
Denna utgåva riktar sig till en specifik läsare: ett labb eller en forskare som arbetar med matematiskt resonemang, bevisgenerering eller RL med verifierbara belöningar, och som vill ha en referensimplementation av ett system som klarade en olympiadguldtröskel på naturligt språk — utan formell bevisare, utan verktyg, utan internet. För den läsaren är värdet hela paketet: vikter, SFT- och RL-korpusar, de NeMo-Gym-formaterade prompterna, inferenspipelinen, de inskickade bevisen och beräkningsredovisningen som anger vad en tävlingskörning faktiskt kostar i GPU-timmar.
För alla andra är den praktiska noteringen att bevissökning på olympiadnivå är överkurs för de flesta verkliga matematikarbetsbelastningar. AIME- och tävlingsnivåproblem, och i princip allt arbete med tillämpad matematik i kod, hanteras bekvämt av betydligt mindre modeller — vilket spelar roll eftersom en 550B-checkpoint inte är något man startar upp för ett batchjobb. De mindre öppna matematikmodellerna och frontier-API-modellerna nås via ett enda API på OrcaRouter till leverantörernas listpriser (inget påslag från vår sida, så en prissänkning hos en leverantör gäller samma dag), med automatisk failover om du vill prova en oprövad modell utan att satsa en produktionsväg på den. Börja där; gå över till att självhosta en 550B bara när arbetsbelastningen verkligen kräver bevissökning i frontier-skala.
Den öppna frågan att bevaka är huruvida detta tysta släpp får ett officiellt tillkännagivande och en formell versionsanteckning, och huruvida någon utanför NVIDIA kör receptet från början till slut och rapporterar en oberoende IMO-Bench-poäng. Det riktmärket — 200 nya, opublicerade olympiadproblem — är sannolikt den mest användbara artefakten i samlingen: det är precis den typ av kontamineringsresistent utvärdering som fältet har saknat. Om receptet reproduceras, kommer veckans tysta Hugging Face-uppladdning att visa sig vara en av årets mer betydelsefulla lanseringar av öppna modeller. Om det inte gör det, är samlingen fortfarande en detaljerad, ärlig redogörelse för vad en körning av generate–verify–refine i frontlinjeskala faktiskt krävde.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
