
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning: Nauczyciel rozumowania o 550B parametrów stojący za Nemotron 3 Ultra właśnie udostępnił otwarte wagi
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
14 sierpnia 2026 roku NVIDIA opublikowała na Hugging Face model NVIDIA-Nemotron-Labs-Teacher-General-Reasoning — model rozumujący o parametrach 550B, który do wczoraj istniał wyłącznie wewnątrz potoku treningowego flagowego modelu Nemotron 3 Ultra. Jest to „nauczyciel ogólnego rozumowania” z przepisu Multi-Teacher On-Policy Distillation (MOPD), którego NVIDIA użyła do wytrenowania ucznia Ultra o parametrach 550B-A55B, a publikacja ta ma znaczenie z prostego powodu: w raporcie technicznym Nemotron 3 Ultra, który NVIDIA opublikowała w czerwcu, przepis treningowy wprost stwierdzał, że punkty kontrolne poszczególnych nauczycieli nie zostaną udostępnione jako open-source. Ten właśnie teraz jest — z wagami, tokenizerem, szablonem czatu i konfiguracjami serwowania, na komercyjnie przyjaznej licencji OpenMDW-1.1. Jego bliźniaczy model, NVIDIA-Nemotron-Labs-Teacher-STEM, pojawił się tego samego dnia, co wygląda mniej jak jednorazowe wydarzenie, a bardziej jak początek ujawniania całego panelu nauczycieli.
Czym właściwie jest model nauczyciel
MOPD to technika potreningowa, która zapewnia Nemotronowi 3 Ultra rozumowanie agentskie. Zamiast destylować pojedynczego dużego nauczyciela do ucznia, NVIDIA wytrenowała ponad dziesięciu wyspecjalizowanych dziedzinowo nauczycieli — do rozumowania, badań, analiz prawnych, inżynierii oprogramowania, korzystania z narzędzi i innych obszarów — a następnie pozwoliła uczniowi generować własne rollouty i użyła każdego nauczyciela do oceny tych rolloutów w jego obszarze specjalizacji. Ponieważ ocena dokonywana jest na własnych wyjściach ucznia (on-policy), a nie na stałym zbiorze danych offline, sygnał treningowy pozostaje zgodny z tym, co uczeń faktycznie generuje w czasie wnioskowania. NVIDIA nazywa tę pętlę koewolucją: nowe rundy nauczycieli są inicjowane z zaktualizowanych checkpointów ucznia, dzięki czemu obie strony stale się poprawiają.
Ten punkt kontrolny to członek panelu odpowiedzialny za ogólne rozumowanie. Powstaje z potrenowanego ucznia Nemotron 3 Ultra po dodatkowej rundzie treningu SFT i uczenia przez wzmacnianie zorientowanej na intensywne rozumowanie, a karta modelu opisuje go jako zoptymalizowany pod kątem rozbudowanych, wysokiej jakości śladów rozumowania w najtrudniejszych problemach wieloetapowych z matematyki, logiki i rozumowania abstrakcyjnego – w tym dowodów formalnych i programowania konkursowego. W MOPD pełni jednocześnie kilka ról – jeden punkt kontrolny, wiele funkcji: generowanie śladów rozumowania, ocenianie zadań matematycznych oraz sędzia równoważności, który ocenia swobodne krótkie odpowiedzi względem referencji. NVIDIA udostępnia go również jako samodzielny model, ponieważ sam w sobie jest silnym rozumującym – przeznaczonym do długohoryzontowego generowania śladów rozumowania, rozwiązywania trudnych problemów oraz pełnienia roli nauczyciela lub oceniającego we własnym potoku destylacji.
Specyfikacje w jednym przebiegu
• Parametry — 550B łącznie / 55B aktywnych, rzadki LatentMoE
• Architektura — hybrydowa latentna mieszanka ekspertów Mamba2-Transformer z przewidywaniem wielu tokenów (MTP)
• Okno kontekstu — do 1M tokenów; domyślnie 256K w referencyjnych konfiguracjach serwowania
• Języki — 10: angielski, francuski, hiszpański, włoski, niemiecki, japoński, hindi, koreański, portugalski brazylijski, chiński
• Licencja — OpenMDW-1.1, dozwolone użycie komercyjne i niekomercyjne
• Minimalny sprzęt — 4×B200 (wagi NVFP4); GB200/GB300 i klasy H100 również obsługiwane
Architektura należy do tej samej rodziny co sam Nemotron 3 Ultra: kształt 550B-A55B z przeplatanymi warstwami Mamba-2 i MoE, wybranymi warstwami atencji oraz głowicami MTP do natywnego dekodowania spekulatywnego. Nauczyciel nie jest mniejszym uczniem — to odmiennie wytrenowany wariant tego samego stosu, wyspecjalizowany w rozumowaniu długohoryzontowym, a nie w ogólnej pracy agentowej.

Dlaczego otwieranie źródła nauczyciela ma znaczenie
Teacher checkpoints są najrzadszym rodzajem otwartego wydania modeli. Firmy cały czas publikują uczniów — czyli modele, które wdrażasz — oraz zbiory danych; prawie nigdy nie publikują modeli, które oceniały pracę uczniów. Dlatego zdanie z czerwcowego raportu, że checkpointy poszczególnych nauczycieli nie zostaną wydane, odebrano jako zamknięcie drzwi do odtworzenia całego potoku MOPD od początku do końca. To wydanie uchyla te drzwi, przynajmniej dla nauczyciela rozumowania.
Dla zespołów budujących własne modele rozumowania to konkretna wartość. Sygnał nagrody, który ukształtował rozumowanie Nemotron 3 Ultra, został częściowo napisany przez ten checkpoint, a teraz można go bezpośrednio badać, uruchamiać jako sędziego lub używać do generowania długoterminowych śladów rozumowania do danych SFT. W połączeniu z już otwartymi danymi potreningowymi (nvidia/nemotron-post-training-v3) i opublikowanymi przepisami treningowymi zmniejsza to dystans między „NVIDIA wytrenowała świetny model" a „my możemy wytrenować podobny".

Pokrętło myślenia
Jedna charakterystyczna cecha przechodzi z rodziny Nemotron 3: rozumowanie jest przełącznikiem, a nie domyślnym trybem. Szablon czatu akceptuje enable_thinking=true/false, opcję medium_effort oraz górny limit tokenów reasoning_budget, dzięki czemu wywołujący może wymusić głębokie, długoterminowe rozumowanie, gdy problem tego wymaga, a otrzymać bezpośrednie odpowiedzi — szybciej i taniej — gdy nie wymaga. Dla modelu nauczyciela ma to większe znaczenie, niż się wydaje: przebiegi destylacji wymagają tanich przejść oceniających na łatwych próbkach i kosztownych śladów rozumowania na trudnych, a pojedynczy punkt kontrolny obsługujący oba tryby eliminuje potrzebę zamiany modeli w trakcie potoku.
Uruchamianie tego.
To nie jest model, który wywołujesz od niechcenia. Minimalna rozsądna konfiguracja serwerowa to 4×B200 z wagami NVFP4 i pamięcią podręczną KV w formacie fp8; konfiguracje referencyjne obejmują również wielowęzłowe maszyny GB200/GB300 oraz klasy H100. NVIDIA publikuje przewodniki dla trzech silników — vLLM (0.22), SGLang (0.5.13) i TensorRT-LLM (1.3.0rc17) — wszystkie udostępniające kompatybilny z OpenAI interfejs API na porcie 8000, z dekodowaniem spekulatywnym MTP lub EAGLE oraz backendem Mamba opartym na flashinfer. Kontekst 1M tokenów wymaga jawnej flagi zezwalającej w każdym silniku (VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 i odpowiedników); domyślny limit to 256K.
Na dzień pisania tego tekstu model nie jest wdrożony przez żadnego dostawcę inferencji na Hugging Face, a NVIDIA nie ogłosiła hostingu NIM — to wydanie wyłącznie z wagami. To sprawia, że jest to model dla laboratoriów, które już prowadzą duże farmy GPU, lub dla zespołów, których potok destylacji potrzebuje dokładnie takiego sygnału od nauczyciela. Gdy w końcu trafi do zarządzanego API, kalkulacja cenowa jest prosta: to MoE z 55B aktywnych parametrów, a każdy, kto go hostuje, liczy sobie tyle, ile kosztują GPU. W warstwie routingu działającej z 0% marżą płacisz cenę katalogową dostawcy bez dodatkowej opłaty platformowej — a ten sam klucz, który ma dostęp do tego modelu, ma też dostęp do modeli granicznych, z którymi porównujesz jego ślady, z automatycznym przełączaniem awaryjnym, gdy host zniknie. Do tego właśnie służy router taki jak OrcaRouter; sam nauczyciel to część, którą hostujesz samodzielnie.
Uczciwe zastrzeżenia
To jest punkt kontrolny sprzed 24 godzin, a karta modelu zawiera zero liczb dotyczących benchmarków. To nie jest pominięcie w tym opisie — to stan wydania. NVIDIA opublikowała szczegóły architektury i treningu, ale nie tabelę ocen, a żadne niezależne laboratorium nie miało jeszcze czasu, aby go uruchomić. Najbliższym punktem odniesienia są liczby podane przez dostawcę dla ucznia: Nemotron 3 Ultra raportuje 71.9 w SWE-Bench Verified, 86.8 w MMLU-Pro, 89.0 w LiveCodeBench v6 i około 95 w RULER przy kontekście 1M. Te liczby opisują ucznia Ultra, nie tego nauczyciela, i są to dane samego NVIDIA. Każdy, kto planuje uruchomienie destylacji na tym punkcie kontrolnym, powinien traktować jego jakość rozumowania jako niezweryfikowaną do czasu pojawienia się niezależnych wyników.
W karcie wbudowano jeszcze dwa zastrzeżenia. Korpus po treningu jest w dużej mierze zdominowany przez angielski — około 8,6 miliona próbek angielskich wobec mniej więcej 138 000 dla każdego z pozostałych dziewięciu języków — więc jakości rozumowania wielojęzycznego nie należy wywodzić z oznaczenia 10 języków. Sama karta zwraca też uwagę na nierównowagę reprezentacji w podstawowych danych treningowych i zaleca audyty stronniczości przed wykorzystaniem w dalszych zastosowaniach.
Kogo powinno to obchodzić
Trzy grupy zyskują tu realną wartość. Badacze destylacji wreszcie mają prawdziwego nauczyciela MOPD do analizy, a nie tylko przepis na niego. Laboratoria trenujące własne modele rozumowania otrzymują generator długich trajektorii i sędziego, którzy pochodzą z tej samej linii potreningowej co model, który próbują odtworzyć. A każdy, kto prowadzi RL on-policy, może go użyć tak jak NVIDIA — jako oceniacza najtrudniejszych problemów, z włączonym myśleniem tylko tam, gdzie się to opłaca.
Jeśli nie należysz do żadnej z tych grup, to wydanie niewiele dla ciebie dziś zmienia: model jest duży, niezweryfikowany i dostępny wyłącznie do samodzielnego hostowania, a najszybszy sposób działania w obliczu leżącego u podstaw trendu — pojawiania się coraz większej liczby otwartych nauczycieli rozumowania — to utrzymanie warstwy modelu w twoim potoku jako wymienialnej za jednym interfejsem, zamiast przyklejania jej do pojedynczego punktu kontrolnego.

Co obejrzeć dalej
Trzy rzeczy wskażą, czy to jednorazowy przypadek, czy panel ujawnia się. Po pierwsze, czy bliźniacze modele nauczycieli podążą tą samą ścieżką — NVIDIA-Nemotron-Labs-Teacher-STEM pojawił się już tego samego dnia, więc pytanie brzmi, którzy specjaliści dziedzinowi pojawią się następni i czy będą ważeni w ten sam sposób. Po drugie, czy NVIDIA NIM lub zarządzany host zacznie je udostępniać, co zamieniłoby wydanie tylko dla laboratoriów w coś, co reszta branży może faktycznie wywołać. Po trzecie, czy pojawią się niezależne benchmarki — wpis w Artificial Analysis lub przebieg na LMArena byłby pierwszą prawdziwą weryfikacją tego, czy jakość rozumowania nauczyciela dorównuje uczniowi, którego wyszkolił.
