
Nemotron-3-Labs-Ultra-Math-RL: NVIDIA po cichu udostępniło jako open source checkpoint RL, który stał za jego startem w IMO 2026
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0455Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0247Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0247Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0157Inteligencja82Kod
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2646Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1849Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1541Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1251Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0547Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Inteligencja49Kod
NVIDIA dropped Nemotron-3-Labs-Ultra-Math-RL on Hugging Face on September 2–3, 2026, with no blog post, no X announcement and no press release — the model card simply appears, dated September 3, and explains itself in one line: it is the reinforcement-learning checkpoint, referred to as "Nemotron-3-Ultra-RL" in NVIDIA's accompanying technical report, that was "deployed as part of an ensemble system that achieved a gold-medal level score at the International Mathematical Olympiad 2026." That system's official score — 30 out of 42 points, above the 29-point gold threshold — was widely reported back in late July, when the base model's weights had been public since June. What was not downloadable then was the pair of post-trained specialists the competition run actually used. One of them is now sitting in a public Hugging Face repo with zero likes and a near-zero download count.
To historia cichego wydania, więc warto być precyzyjnym co do tego, co jest poznawalne, a co nie. Z repozytorium i raportu można ustalić: architekturę checkpointu, jego recepturę treningową, rolę, jaką odegrał w zgłoszeniu do IMO 2026, oraz zbiory danych i benchmarki, które NVIDIA wydała wraz z nim. Nie zostały jeszcze potwierdzone: jakiekolwiek ogłoszenie dostawcy, jakikolwiek niezależny benchmark tego checkpointu przeprowadzony przez stronę trzecią oraz jakiekolwiek hostowane API — to wydanie wag do samodzielnego hostowania na licencji OpenMDW-1.1, a jego uruchomienie oznacza zapewnienie około 1,5 TB pamięci HBM klasy Blackwell.
Co faktycznie wypuszczono w tym tygodniu
Repozytorium nvidia/Nemotron-3-Labs-Ultra-Math-RL zostało utworzone w serwisie Hugging Face 2 września 2026 (19:11 UTC), a ostatnia modyfikacja miała miejsce 8 września. Jest ono jednym z elementów skoordynowanego wydania zebranego pod nazwą nvidia/nemotron-labs-imo-2026, które zawiera:
• Dwa punkty kontrolne z konkursu poddane dodatkowemu treningowi — Nemotron-3-Labs-Ultra-Math-RL (ten temat) i jego bliźniacza wersja poddana nadzorowanemu dostrajaniu, Nemotron-3-Labs-Ultra-Math-SFT, oba na licencji OpenMDW-1.1.
• Dwa korpusy treningowe, które za nimi stoją — Nemotron-Math-Proofs-v3-SFT i Nemotron-Math-Proofs-v3-RL, oba na licencji CC-BY-4.0.
• Nemotron-IMO-Bench to nowy benchmark ewaluacyjny obejmujący 200 niepublikowanych problemów na poziomie olimpiady (50 z algebry, 50 z kombinatoryki, 50 z geometrii, 50 z teorii liczb), z których każdy jest opatrzony opracowanym przez człowieka referencyjnym dowodem. Został stworzony z matematykiem Titu Andreescu specjalnie po to, aby problemy nie mogły pojawić się w żadnym zestawie treningowym.
NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 to bazowy checkpoint, z którego wszystkie są finetuningowane.
Opis kolekcji wskazuje na raport techniczny, który spaja całość: „An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics" (plik PDF w repozytorium NeMo-Skills firmy NVIDIA jest datowany na 8 września 2026 r.). Wraz z punktami kontrolnymi NVIDIA udostępniła potok wnioskowania, przesłane dowody, przepis na trening RL oraz pełne rozliczenie mocy obliczeniowej wykorzystanej podczas zawodów. To ujęcie jest wprost nauką odtwarzalną: NVIDIA mówi – oto wszystko, czego potrzeba, aby odtworzyć system.
Czym jest Nemotron-3-Labs-Ultra-Math-RL
Architektonicznie nie jest to nowy model bazowy — to dostrojony wariant ogólnodostępnego modelu NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, czyli hybrydowego checkpointu Mamba2–Transformer Latent Mixture-of-Experts, który NVIDIA po raz pierwszy udostępniła 4 czerwca 2026 r. Checkpoint Math-RL zachowuje tę architekturę i skalę: 550 mld parametrów ogółem (w tym 55 mld aktywnych), wielotokenowa predykcja oraz obsługa okien kontekstowych do 1 mln tokenów. Tym, co trening RL zmienia, jest specjalizacja — i jest ona celowo wąska:
• Cel — rozwiązywanie trudnych zadań z matematyki konkursowej oraz działanie jako sędzia dowodów: model jest szkolony tak, aby opracowywał rygorystyczne rozwiązanie, oceniał je według rubryki 0 / 0,5 / 1 oraz wykrywał błędy w dowodach.
• To nie jest ogólny chatbot — karta i raport opisują wyspecjalizowanego pracownika potoku wyszukiwania dowodów, a nie asystenta podążającego za instrukcjami.
• Licencja — OpenMDW-1.1, permisywna licencja otwartego modelu firmy NVIDIA, dopuszczająca użytek komercyjny i niekomercyjny, taka sama jak w przypadku wersji bazowej i wcześniejszych wydań modeli nauczycielskich Nemotron Labs.
• Wdrożenie — nigdzie nie ma ceny katalogowej hostingu; pobierasz safetensory i hostujesz we własnym zakresie. Referencyjna konfiguracja NVIDIA to pojedynczy węzeł z 8× B200 (~1.5 TB łącznej pamięci HBM), z opcjami wielowęzłowymi na H100/H200/GB200/GB300. Zalecanym środowiskiem uruchomieniowym jest vLLM, z parserem rozumowania, parserem wywołań narzędzi Qwen3-Coder, ustawieniami pamięci podręcznej SSM dla Mamby oraz spekulacyjnym dekodowaniem MTP na 5 tokenach — wszystko wymienione w karcie modelu.

Dlaczego ten punkt kontrolny ma znaczenie: znajdował się w systemie IMO 2026.
Wynik na IMO 2026 jest powodem, dla którego ktokolwiek w ogóle zwraca uwagę na ten model, więc kluczowe rozróżnienie jest takie: 30/42 to wynik systemu, a nie wynik pojedynczego modelu. Zgłoszenie NVIDIA było dwuetapowym potokiem z wieloma punktami kontrolnymi, a Nemotron-3-Labs-Ultra-Math-RL był komponentem, który miał w nim dwa zadania.
Zgodnie z raportem pierwszy etap prowadził iteracyjne przeszukiwanie typu generowanie–weryfikacja–udoskonalanie, aż do ośmiu rund na problem. W rundzie pierwszej pobrano próbki 384 prób dowodowych — po 16 z ośmiu różnych promptów dotyczących strategii rozwiązania, z każdego z trzech punktów kontrolnych: modelu ogólnej dostępności, specjalisty SFT i specjalisty RL. Weryfikacja w czasie przeszukiwania wykorzystywała punkty kontrolne RL i SFT jako panel złożony z dwóch modeli: po osiem niezależnych ocen od każdego, a dowód był akceptowany tylko wtedy, gdy wszystkie 16 ocen przyznało mu 1. W późniejszym etapie o dużej mocy obliczeniowej każdy finalista był ponownie oceniany przez wszystkie trzy punkty kontrolne (po 16 ocen w stylu IMO, w skali 0–7), a dla każdego problemu wybierano pojedyncze zgłoszenie.
Oficjalny wynik, przedstawiony w artykule i zgodny z doniesieniami z końca lipca, to 30 z 42 punktów na zestawie zadań IMO 2026, czyli powyżej progu złotego medalu wynoszącego 29 punktów. Za zadania 1, 2, 4 i 5 przyznano pełną liczbę punktów, a za zadania 3 i 6 po jednym punkcie; oceny wystawili oficjalni egzaminatorzy IMO. Według wewnętrznego rozliczenia zasobów NVIDIA wszystkie sześć przesłanych dowodów znaleziono, wykorzystując około 707 mln wygenerowanych tokenów i 1464 GB200 GPU-godzin; dokończenie trwających rund podniosło łączne zużycie całego uruchomienia do około 2,31 mld tokenów i 4800 GB200 GPU-godzin.
Dwie wewnętrzne liczby z raportu pokazują, dlaczego punkt kontrolny RL zasłużył na miejsce w zespole. Na 30-problemowym zbiorze rozwojowym NVIDIA, ocenianym przez niezależne jury złożone z GPT-5.5, Gemini 3.1 Pro i Claude Opus 4.8, według procedury wzorowanej na MathArena, specjalista RL był najlepszym potokiem z pojedynczym punktem kontrolnym w ujęciu end-to-end (180 z możliwych 210 punktów jury, wobec 165 dla specjalisty SFT i 162 dla modelu bazowego), choć punkt kontrolny SFT rozwiązał więcej problemów w pierwszej rundzie. Z kolei na audytowym zestawie liczącym 300 dowodów wdrożony panel weryfikacyjny RL+SFT obniżył wskaźnik fałszywych akceptacji — czyli błąd, który kończy poszukiwania w przypadku niepoprawnego dowodu — do około 1,1%, wobec 12,4% w przypadku oceny samego punktu kontrolnego RL i 31,6% dla modelu bazowego. Sedno raportu jest takie, że ci dwaj selektywni specjaliści wyłapują nawzajem swoje błędy dzięki zasadzie jednomyślności.
Są to własne ablacje NVIDIA na jej własnym zbiorze deweloperskim, opisane w pracy NVIDIA — należy je traktować jako pochodzące od dostawcy dowody na to, dlaczego projekt działa, a nie jako niezależne wyniki. Sam zbiór deweloperski liczy tylko 30 problemów i żadne zewnętrzne laboratorium nie uruchomiło jeszcze tego checkpointu.
Przepis na RL, w skrócie
Dane treningowe i metoda są w pełni otwarte, co jest prawdziwą nowością dla każdego, kto prowadzi badania nad RL w zakresie rozumowania matematycznego. Najważniejsze punkty z raportu:
• Dane — problemy pochodzą z podzbioru AoPS zbioru Nemotron-Math-Proofs-v1, odfiltrowane do tych, które bazowy model Ultra rozwiązuje w jednej do trzech z czterech prób (ocenianych przez DeepSeek-V3.2-Speciale) — trudnych, ale możliwych do opanowania problemów programowych. Ten filtr daje 9 597 promptów do generowania dowodów, wydanych jako Nemotron-Math-Proofs-v3-RL.
Nagroda — zgodnie z projektem DeepSeekMath-V2, ale bez składnika nagrody za samoanalizę; sygnał oceniający pochodzi z usługi oceny dowodów podczas treningu.
— Algorytm — asynchroniczne RL zbudowane na NeMo-RL, podobne w duchu do PipelineRL: stała pula promptów utrzymywanych w locie, ukończone sekwencje trafiają do trenera w miarę zapełniania się batchy, obcięte importance sampling oraz maskowanie tokenów o niskim prawdopodobieństwie na pozytywnych próbkach, gdy entropia rośnie. Konfiguracja wykorzystywała kontekst 131 072 tokenów oraz około 128 węzłów trenera, 128 węzłów inferencji i 16 węzłów sędziowskich, każde z 4× GB200.
Dla porównania, siostrzany punkt kontrolny SFT był długokontekstowym, nadzorowanym dostrajaniem tego samego modelu bazowego, przeprowadzonym na korpusie przefiltrowanym pod względem jakości, obejmującym 414 890 śladów dowodów, udoskonalania, weryfikacji i meta-weryfikacji dla 15 818 problemów, na 512 procesorach graficznych GB200.

Co jeszcze nie jest znane
Uczciwość w podawaniu źródeł działa tu w obie strony, a czytelnik, który zastanawia się, czy zainteresować się tym wydaniem, powinien pamiętać o czterech zastrzeżeniach.
• Brak ogłoszenia. Na dzień pisania tego tekstu NVIDIA nie ogłosiła formalnie kolekcji; pojawiła się ona na Hugging Face. PDF raportu technicznego ma datę 8 września, więc pisemny przepis w praktyce również zostaje opublikowany w tym tygodniu.
• Brak niezależnych benchmarków.Każda liczba dotycząca wydajności przypisana temu checkpointowi — ablacje na zbiorze deweloperskim, audyt weryfikatora, wynik systemowy IMO 2026 — pochodzi z raportu NVIDIA. Sam wynik IMO ma najlepiej udokumentowane pochodzenie spośród wszystkich, ponieważ został oceniony w oficjalnych warunkach konkursowych, ale jest to wynik na poziomie systemu, a wkład checkpointu w ten wynik nie został odtworzony przez żadne zewnętrzne laboratorium.
• Brak hostowanego API, brak ceny katalogowej.To jest wydanie do samodzielnego hostowania. Każdy, kto chce wywołać to API, potrzebuje sprzętu. Lipcowe doniesienia o tym, że „NVIDIA Nemotron 3 Ultra zdobył złoto na IMO 2026”, można łatwo błędnie odczytać jako „pobierz to, a rozwiąże zadania olimpijskie” — wersja zgodna z prawdą brzmi: „pobierz komponenty systemu, który tego dokonał”.
• Złota narracja. NVIDIA sama nazywa to „osiągnięciem progu złotego medalu”, a artykuł precyzyjnie zaznacza, że model był częścią zespołu modeli. Wszelkie twierdzenia, że ten pojedynczy checkpoint sam w sobie jest „na poziomie złotego medalu”, traktuj jako niepoparte.
Dla kogo to jest
To wydanie jest skierowane do konkretnego czytelnika: laboratorium lub badacza pracującego nad rozumowaniem matematycznym, generowaniem dowodów lub RL z weryfikowalnymi nagrodami, który chce mieć referencyjną implementację systemu, który osiągnął próg złotego medalu olimpiady w języku naturalnym — bez formalnego provera, bez narzędzi i bez internetu. Dla takiego czytelnika wartość stanowi cały pakiet: wagi, korpusy SFT i RL, prompty w formacie NeMo-Gym, potok wnioskowania, przesłane dowody oraz rozliczenie obliczeń, które pokazuje, ile naprawdę kosztuje uruchomienie konkursu w GPU-godzinach.
Dla wszystkich pozostałych praktyczna uwaga jest taka, że przeszukiwanie dowodów na poziomie olimpijskim to przesada w przypadku większości realnych zastosowań matematycznych. Problemy na poziomie AIME i innych konkursów matematycznych oraz praktycznie cała matematyka stosowana w kodzie są z łatwością obsługiwane przez znacznie mniejsze modele — co ma znaczenie, bo checkpoint 550B nie jest czymś, co odpala się do zadania wsadowego. Mniejsze otwarte modele matematyczne i czołowe modele API są dostępne na OrcaRouter za pośrednictwem jednego API, w cenach katalogowych dostawców (bez marży z naszej strony, więc obniżka cen u dostawcy jest aktywna już tego samego dnia), z automatycznym przełączaniem awaryjnym, jeśli chcesz wypróbować niezweryfikowany model bez stawiania na niego ścieżki produkcyjnej. Zacznij od tego; przejdź na własny hosting 550B tylko wtedy, gdy obciążenie naprawdę wymaga przeszukiwania dowodów na skalę frontier.
Otwartym pytaniem, na które warto patrzeć, jest to, czy ta cicha publikacja doczeka się oficjalnego ogłoszenia i formalnej noty wydania, oraz czy ktoś spoza NVIDIA uruchomi ten przepis od początku do końca i zgłosi niezależny wynik IMO-Bench. Ten benchmark — 200 świeżych, niepublikowanych zadań olimpijskich — jest prawdopodobnie najbardziej użytecznym elementem tej kolekcji: to dokładnie ten rodzaj ewaluacji odpornej na skażenie danych, jakiego brakowało w tej dziedzinie. Jeśli przepis się odtworzy, tegoroczny cichy upload na Hugging Face okaże się jednym z ważniejszych wydań otwartych modeli w roku. Jeśli nie, kolekcja wciąż stanowi szczegółowy i uczciwy zapis tego, czego naprawdę wymagał jeden na graniczną skalę przebieg procesu generuj–weryfikuj–udoskonalaj.

Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
