Karta nagłówka hero dla artykułu informacyjnego „NVIDIA-Nemotron-Labs-Teacher-General-Reasoning”, na której widnieje napis „Nauczyciel rozumowania o 550 mld parametrów stojący za Nemotron 3 Ultra ma teraz otwarte wagi”, z ikoną pudełka open-weights, glifem chipu GPU, tagami silników vLLM / SGLang / TensorRT-LLM, plakietką z datą „Opublikowano 14 sierpnia 2026” oraz logo OrcaRouter wkomponowanym w prawym dolnym rogu.
Engineering & Research

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning: Nauczyciel rozumowania o 550B parametrów stojący za Nemotron 3 Ultra właśnie udostępnił otwarte wagi

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

14 sierpnia 2026 roku NVIDIA opublikowała na Hugging Face model NVIDIA-Nemotron-Labs-Teacher-General-Reasoning — model rozumujący o parametrach 550B, który do wczoraj istniał wyłącznie wewnątrz potoku treningowego flagowego modelu Nemotron 3 Ultra. Jest to „nauczyciel ogólnego rozumowania” z przepisu Multi-Teacher On-Policy Distillation (MOPD), którego NVIDIA użyła do wytrenowania ucznia Ultra o parametrach 550B-A55B, a publikacja ta ma znaczenie z prostego powodu: w raporcie technicznym Nemotron 3 Ultra, który NVIDIA opublikowała w czerwcu, przepis treningowy wprost stwierdzał, że punkty kontrolne poszczególnych nauczycieli nie zostaną udostępnione jako open-source. Ten właśnie teraz jest — z wagami, tokenizerem, szablonem czatu i konfiguracjami serwowania, na komercyjnie przyjaznej licencji OpenMDW-1.1. Jego bliźniaczy model, NVIDIA-Nemotron-Labs-Teacher-STEM, pojawił się tego samego dnia, co wygląda mniej jak jednorazowe wydarzenie, a bardziej jak początek ujawniania całego panelu nauczycieli.

Czym właściwie jest model nauczyciel

MOPD to technika potreningowa, która zapewnia Nemotronowi 3 Ultra rozumowanie agentskie. Zamiast destylować pojedynczego dużego nauczyciela do ucznia, NVIDIA wytrenowała ponad dziesięciu wyspecjalizowanych dziedzinowo nauczycieli — do rozumowania, badań, analiz prawnych, inżynierii oprogramowania, korzystania z narzędzi i innych obszarów — a następnie pozwoliła uczniowi generować własne rollouty i użyła każdego nauczyciela do oceny tych rolloutów w jego obszarze specjalizacji. Ponieważ ocena dokonywana jest na własnych wyjściach ucznia (on-policy), a nie na stałym zbiorze danych offline, sygnał treningowy pozostaje zgodny z tym, co uczeń faktycznie generuje w czasie wnioskowania. NVIDIA nazywa tę pętlę koewolucją: nowe rundy nauczycieli są inicjowane z zaktualizowanych checkpointów ucznia, dzięki czemu obie strony stale się poprawiają.

Ten punkt kontrolny to członek panelu odpowiedzialny za ogólne rozumowanie. Powstaje z potrenowanego ucznia Nemotron 3 Ultra po dodatkowej rundzie treningu SFT i uczenia przez wzmacnianie zorientowanej na intensywne rozumowanie, a karta modelu opisuje go jako zoptymalizowany pod kątem rozbudowanych, wysokiej jakości śladów rozumowania w najtrudniejszych problemach wieloetapowych z matematyki, logiki i rozumowania abstrakcyjnego – w tym dowodów formalnych i programowania konkursowego. W MOPD pełni jednocześnie kilka ról – jeden punkt kontrolny, wiele funkcji: generowanie śladów rozumowania, ocenianie zadań matematycznych oraz sędzia równoważności, który ocenia swobodne krótkie odpowiedzi względem referencji. NVIDIA udostępnia go również jako samodzielny model, ponieważ sam w sobie jest silnym rozumującym – przeznaczonym do długohoryzontowego generowania śladów rozumowania, rozwiązywania trudnych problemów oraz pełnienia roli nauczyciela lub oceniającego we własnym potoku destylacji.

Specyfikacje w jednym przebiegu

• Parametry — 550B łącznie / 55B aktywnych, rzadki LatentMoE

• Architektura — hybrydowa latentna mieszanka ekspertów Mamba2-Transformer z przewidywaniem wielu tokenów (MTP)

• Okno kontekstu — do 1M tokenów; domyślnie 256K w referencyjnych konfiguracjach serwowania

• Języki — 10: angielski, francuski, hiszpański, włoski, niemiecki, japoński, hindi, koreański, portugalski brazylijski, chiński

• Licencja — OpenMDW-1.1, dozwolone użycie komercyjne i niekomercyjne

• Minimalny sprzęt — 4×B200 (wagi NVFP4); GB200/GB300 i klasy H100 również obsługiwane

Architektura należy do tej samej rodziny co sam Nemotron 3 Ultra: kształt 550B-A55B z przeplatanymi warstwami Mamba-2 i MoE, wybranymi warstwami atencji oraz głowicami MTP do natywnego dekodowania spekulatywnego. Nauczyciel nie jest mniejszym uczniem — to odmiennie wytrenowany wariant tego samego stosu, wyspecjalizowany w rozumowaniu długohoryzontowym, a nie w ogólnej pracy agentowej.

A single-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning listing 550B total / 55B active parameters, LatentMoE Mamba2-Transformer hybrid + MTP architecture, up to 1M token context, 10 languages, OpenMDW-1.1 commercial license, and vLLM / SGLang / TensorRT-LLM serving, with a footer noting the specs are per NVIDIA's model card and no independent benchmarks exist yet, and the OrcaRouter logo composited in the corner.

Dlaczego otwieranie źródła nauczyciela ma znaczenie

Teacher checkpoints są najrzadszym rodzajem otwartego wydania modeli. Firmy cały czas publikują uczniów — czyli modele, które wdrażasz — oraz zbiory danych; prawie nigdy nie publikują modeli, które oceniały pracę uczniów. Dlatego zdanie z czerwcowego raportu, że checkpointy poszczególnych nauczycieli nie zostaną wydane, odebrano jako zamknięcie drzwi do odtworzenia całego potoku MOPD od początku do końca. To wydanie uchyla te drzwi, przynajmniej dla nauczyciela rozumowania.

Dla zespołów budujących własne modele rozumowania to konkretna wartość. Sygnał nagrody, który ukształtował rozumowanie Nemotron 3 Ultra, został częściowo napisany przez ten checkpoint, a teraz można go bezpośrednio badać, uruchamiać jako sędziego lub używać do generowania długoterminowych śladów rozumowania do danych SFT. W połączeniu z już otwartymi danymi potreningowymi (nvidia/nemotron-post-training-v3) i opublikowanymi przepisami treningowymi zmniejsza to dystans między „NVIDIA wytrenowała świetny model" a „my możemy wytrenować podobny".

A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card summary: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP architecture, up to 1M token context, minimum GPU requirements, supported languages, the openmdw-1.1 license tag, and the files and versions listing.

Pokrętło myślenia

Jedna charakterystyczna cecha przechodzi z rodziny Nemotron 3: rozumowanie jest przełącznikiem, a nie domyślnym trybem. Szablon czatu akceptuje enable_thinking=true/false, opcję medium_effort oraz górny limit tokenów reasoning_budget, dzięki czemu wywołujący może wymusić głębokie, długoterminowe rozumowanie, gdy problem tego wymaga, a otrzymać bezpośrednie odpowiedzi — szybciej i taniej — gdy nie wymaga. Dla modelu nauczyciela ma to większe znaczenie, niż się wydaje: przebiegi destylacji wymagają tanich przejść oceniających na łatwych próbkach i kosztownych śladów rozumowania na trudnych, a pojedynczy punkt kontrolny obsługujący oba tryby eliminuje potrzebę zamiany modeli w trakcie potoku.

Uruchamianie tego.

To nie jest model, który wywołujesz od niechcenia. Minimalna rozsądna konfiguracja serwerowa to 4×B200 z wagami NVFP4 i pamięcią podręczną KV w formacie fp8; konfiguracje referencyjne obejmują również wielowęzłowe maszyny GB200/GB300 oraz klasy H100. NVIDIA publikuje przewodniki dla trzech silników — vLLM (0.22), SGLang (0.5.13) i TensorRT-LLM (1.3.0rc17) — wszystkie udostępniające kompatybilny z OpenAI interfejs API na porcie 8000, z dekodowaniem spekulatywnym MTP lub EAGLE oraz backendem Mamba opartym na flashinfer. Kontekst 1M tokenów wymaga jawnej flagi zezwalającej w każdym silniku (VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 i odpowiedników); domyślny limit to 256K.

Na dzień pisania tego tekstu model nie jest wdrożony przez żadnego dostawcę inferencji na Hugging Face, a NVIDIA nie ogłosiła hostingu NIM — to wydanie wyłącznie z wagami. To sprawia, że jest to model dla laboratoriów, które już prowadzą duże farmy GPU, lub dla zespołów, których potok destylacji potrzebuje dokładnie takiego sygnału od nauczyciela. Gdy w końcu trafi do zarządzanego API, kalkulacja cenowa jest prosta: to MoE z 55B aktywnych parametrów, a każdy, kto go hostuje, liczy sobie tyle, ile kosztują GPU. W warstwie routingu działającej z 0% marżą płacisz cenę katalogową dostawcy bez dodatkowej opłaty platformowej — a ten sam klucz, który ma dostęp do tego modelu, ma też dostęp do modeli granicznych, z którymi porównujesz jego ślady, z automatycznym przełączaniem awaryjnym, gdy host zniknie. Do tego właśnie służy router taki jak OrcaRouter; sam nauczyciel to część, którą hostujesz samodzielnie.

Uczciwe zastrzeżenia

To jest punkt kontrolny sprzed 24 godzin, a karta modelu zawiera zero liczb dotyczących benchmarków. To nie jest pominięcie w tym opisie — to stan wydania. NVIDIA opublikowała szczegóły architektury i treningu, ale nie tabelę ocen, a żadne niezależne laboratorium nie miało jeszcze czasu, aby go uruchomić. Najbliższym punktem odniesienia są liczby podane przez dostawcę dla ucznia: Nemotron 3 Ultra raportuje 71.9 w SWE-Bench Verified, 86.8 w MMLU-Pro, 89.0 w LiveCodeBench v6 i około 95 w RULER przy kontekście 1M. Te liczby opisują ucznia Ultra, nie tego nauczyciela, i są to dane samego NVIDIA. Każdy, kto planuje uruchomienie destylacji na tym punkcie kontrolnym, powinien traktować jego jakość rozumowania jako niezweryfikowaną do czasu pojawienia się niezależnych wyników.

W karcie wbudowano jeszcze dwa zastrzeżenia. Korpus po treningu jest w dużej mierze zdominowany przez angielski — około 8,6 miliona próbek angielskich wobec mniej więcej 138 000 dla każdego z pozostałych dziewięciu języków — więc jakości rozumowania wielojęzycznego nie należy wywodzić z oznaczenia 10 języków. Sama karta zwraca też uwagę na nierównowagę reprezentacji w podstawowych danych treningowych i zaleca audyty stronniczości przed wykorzystaniem w dalszych zastosowaniach.

Kogo powinno to obchodzić

Trzy grupy zyskują tu realną wartość. Badacze destylacji wreszcie mają prawdziwego nauczyciela MOPD do analizy, a nie tylko przepis na niego. Laboratoria trenujące własne modele rozumowania otrzymują generator długich trajektorii i sędziego, którzy pochodzą z tej samej linii potreningowej co model, który próbują odtworzyć. A każdy, kto prowadzi RL on-policy, może go użyć tak jak NVIDIA — jako oceniacza najtrudniejszych problemów, z włączonym myśleniem tylko tam, gdzie się to opłaca.

Jeśli nie należysz do żadnej z tych grup, to wydanie niewiele dla ciebie dziś zmienia: model jest duży, niezweryfikowany i dostępny wyłącznie do samodzielnego hostowania, a najszybszy sposób działania w obliczu leżącego u podstaw trendu — pojawiania się coraz większej liczby otwartych nauczycieli rozumowania — to utrzymanie warstwy modelu w twoim potoku jako wymienialnej za jednym interfejsem, zamiast przyklejania jej do pojedynczego punktu kontrolnego.

A flow diagram titled 'How Multi-Teacher On-Policy Distillation works' showing a Student (Nemotron 3 Ultra) node sending rollouts to a Teacher panel of 10+ domain specialist cards, one highlighted as the General Reasoning teacher released Aug 14, 2026, with reward signals flowing back to the student, and the OrcaRouter logo composited in the corner.

Co obejrzeć dalej

Trzy rzeczy wskażą, czy to jednorazowy przypadek, czy panel ujawnia się. Po pierwsze, czy bliźniacze modele nauczycieli podążą tą samą ścieżką — NVIDIA-Nemotron-Labs-Teacher-STEM pojawił się już tego samego dnia, więc pytanie brzmi, którzy specjaliści dziedzinowi pojawią się następni i czy będą ważeni w ten sam sposób. Po drugie, czy NVIDIA NIM lub zarządzany host zacznie je udostępniać, co zamieniłoby wydanie tylko dla laboratoriów w coś, co reszta branży może faktycznie wywołać. Po trzecie, czy pojawią się niezależne benchmarki — wpis w Artificial Analysis lub przebieg na LMArena byłby pierwszą prawdziwą weryfikacją tego, czy jakość rozumowania nauczyciela dorównuje uczniowi, którego wyszkolił.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube