Een hero-titelkaart voor het nieuwsartikel 'NVIDIA-Nemotron-Labs-Teacher-General-Reasoning' met de tekst 'De 550B redeneerleraar achter Nemotron 3 Ultra is nu open weights', met een open-weights-pictogram, een GPU-chipglyph, engine-tags vLLM / SGLang / TensorRT-LLM, een datumlabel 'Uitgebracht op 14 aug 2026', en het OrcaRouter-logo rechtsonder in de hoek gecomponeerd.
Engineering & Research

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning: De 550B redeneerdocent achter Nemotron 3 Ultra heeft zojuist open gewichten gekregen

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op 14 augustus 2026 publiceerde NVIDIA NVIDIA-Nemotron-Labs-Teacher-General-Reasoning op Hugging Face — een redeneermodel met 550B parameters dat tot gisteren alleen bestond in de trainingspijplijn van zijn vlaggenschip Nemotron 3 Ultra. Het is de 'general reasoning'-teacher uit het Multi-Teacher On-Policy Distillation (MOPD)-recept dat NVIDIA gebruikte om de 550B-A55B Ultra-student te trainen, en de release is om een eenvoudige reden belangrijk: in het technische rapport van Nemotron 3 Ultra dat NVIDIA in juni uitbracht, stond duidelijk dat de per-teacher checkpoints niet open-source zouden worden gemaakt. Deze is dat nu wel — inclusief gewichten, tokenizer, chat-template en serving-configuraties, onder de commercieel vriendelijke OpenMDW-1.1-licentie. Een zustermodel, NVIDIA-Nemotron-Labs-Teacher-STEM, verscheen dezelfde dag, wat minder als een eenmalige actie klinkt en meer alsof het teacher-panel naar buiten begint te komen.

Wat een teacher model eigenlijk is

MOPD is de post-trainingstechniek die Nemotron 3 Ultra zijn agentische redenering geeft. In plaats van één grote teacher in een student te distilleren, trainde NVIDIA meer dan tien domeinspecialistische teachers — voor redeneren, onderzoek, juridische analyse, software-engineering, toolgebruik en andere gebieden — en liet vervolgens de student zijn eigen rollouts genereren, waarbij elke teacher die rollouts beoordeelde op zijn eigen expertisegebied. Omdat de beoordeling plaatsvindt op de eigen on-policy outputs van de student in plaats van op een vaste offline dataset, blijft het trainingssignaal afgestemd op wat de student daadwerkelijk produceert tijdens de inferentie. NVIDIA noemt deze cyclus co-evolutie: nieuwe teacher-rondes worden geïnitialiseerd vanuit bijgewerkte student-checkpoints, zodat beide kanten blijven verbeteren.

Dit checkpoint is het algemeen redenerende lid van dat panel. Het is geproduceerd uit de post-getrainde Nemotron 3 Ultra-student via een extra ronde van redeneringsintensieve SFT en reinforcement learning, en de modelkaart beschrijft het als geoptimaliseerd voor uitgebreide, hoogwaardige redeneringstraces bij de moeilijkste meerstapsproblemen op het gebied van wiskunde, logica en abstract redeneren — inclusief formele bewijzen en competitief programmeren. Binnen MOPD vervult het meerdere rollen tegelijk, één checkpoint, vele rollen: het genereren van redeneringstraces, het beoordelen van wiskunde, en de equivalentiebeoordelaar die vrije-vorm korte antwoorden beoordeelt aan de hand van een referentie. NVIDIA levert het ook zelfstandig, omdat het op zichzelf een sterke redenaar is — bedoeld voor langetermijn-redeneringstraces, moeilijke probleemoplossing, en het fungeren als docent of beoordelaar binnen je eigen distillatiepijplijn.

De specs in één keer

• Parameters — 550B totaal / 55B actief, sparse LatentMoE

• Architectuur — Mamba2-Transformer hybride latent mengsel-van-experts met Multi-Token Voorspelling (MTP)

• Contextvenster — tot 1M tokens; 256K standaard in de referentie-servingconfiguraties

• Talen — 10: Engels, Frans, Spaans, Italiaans, Duits, Japans, Hindi, Koreaans, Braziliaans Portugees, Chinees

• Licentie — OpenMDW-1.1, commercieel en niet-commercieel gebruik toegestaan

• Minimale hardware — 4×B200 (NVFP4-gewichten); GB200/GB300 en H100-klasse worden ook ondersteund

De architectuur behoort tot dezelfde familie als Nemotron 3 Ultra zelf: de 550B-A55B-opzet met interleaved Mamba-2- en MoE-lagen, geselecteerde aandachtslagen en MTP-heads voor native speculatieve decodering. De teacher is geen kleiner studentmodel — het is een anders getrainde variant van dezelfde stack, gespecialiseerd in redeneren over lange tijdshorizons in plaats van algemeen agentisch werk.

A single-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning listing 550B total / 55B active parameters, LatentMoE Mamba2-Transformer hybrid + MTP architecture, up to 1M token context, 10 languages, OpenMDW-1.1 commercial license, and vLLM / SGLang / TensorRT-LLM serving, with a footer noting the specs are per NVIDIA's model card and no independent benchmarks exist yet, and the OrcaRouter logo composited in the corner.

Waarom het open-sourcen van een leraar belangrijk is

Docentcheckpoints zijn de zeldzaamste vorm van open modelrelease. Bedrijven publiceren studenten — de modellen die je implementeert — en datasets de hele tijd; ze publiceren bijna nooit de modellen die het werk van de studenten beoordeelden. Daarom werd de regel in het junirapport dat per-docent checkpoints niet zouden worden vrijgegeven, gelezen als het sluiten van de deur voor het end-to-end reproduceren van de MOPD-pijplijn. Deze release zet die deur op een kier, althans voor de reasoning-docent.

Voor teams die hun eigen redeneermodellen bouwen, is dat concrete waarde. Het beloningssignaal dat de redenering van Nemotron 3 Ultra vormgaf, is deels door dit checkpoint geschreven, en nu kan het direct worden bestudeerd, als judge worden gebruikt, of worden ingezet om langetermijn-redeneertraces voor SFT-data te genereren. In combinatie met de al openbaar beschikbare post-training-data (nvidia/nemotron-post-training-v3) en de gepubliceerde trainingsrecepten, verkleint het de kloof tussen "NVIDIA heeft een geweldig model getraind" en "wij kunnen er zo een trainen."

A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card summary: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP architecture, up to 1M token context, minimum GPU requirements, supported languages, the openmdw-1.1 license tag, and the files and versions listing.

De denkdraaiknop

Een kenmerkend aspect wordt overgenomen van de Nemotron 3-familie: redeneren is een schakelaar, geen standaardinstelling. Het chat-template accepteert enable_thinking=true/false, een medium_effort-optie en een reasoning_budget-tokenlimiet, zodat een aanroeper diep redeneren over lange tijdshorizon kan afdwingen wanneer een probleem dat nodig heeft, en directe antwoorden kan krijgen — sneller en goedkoper — wanneer dat niet nodig is. Voor een teachermodel is dat belangrijker dan het lijkt: distillatieruns willen goedkope beoordelingspassen op gemakkelijke samples en dure redeneertraces op moeilijke, en één enkele checkpoint die beide modi ondersteunt, maakt het wisselen van modellen midden in de pijplijn overbodig.

Het uitvoeren

Dit is geen model dat je zomaar even aanroept. De minimale zinnige serving-opstelling is 4×B200 met NVFP4-weights en een fp8-KV-cache; de referentieconfiguraties bestrijken ook multi-node GB200/GB300- en H100-klasse systemen. NVIDIA publiceert cooking guides voor drie engines — vLLM (0.22), SGLang (0.5.13) en TensorRT-LLM (1.3.0rc17) — die allemaal een OpenAI-compatibele API op poort 8000 blootstellen, met MTP- of EAGLE-speculatieve decoding en een flashinfer-Mamba-backend. De 1M-token context vereist een expliciete allow-flag in elke engine (VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 en equivalenten); de standaardlimiet is 256K.

Op het moment van schrijven wordt het model door geen enkele inferentieprovider op Hugging Face aangeboden en heeft NVIDIA geen NIM-hosting aangekondigd — dit is een release met uitsluitend gewichten. Dat maakt het een model voor labs die al grote GPU-fleets draaien, of voor teams waarvan de destillatiepipeline specifiek het exacte teacher-signaal nodig heeft. Wanneer het uiteindelijk op een managed API belandt, is de prijsberekening simpel: dit is een 55B-actieve MoE, en degene die het host rekent wat de GPU's kosten. Op een routinglaag die met 0% opslag werkt, betaal je de lijstprijs van de provider zonder platformfee bovenop — en met dezelfde sleutel waarmee je dit model bereikt, bereik je ook de frontier-modellen waarmee je de traces ervan vergelijkt, met automatische failover als een host uitvalt. Dat is waar een router als OrcaRouter voor dient; de teacher zelf is het onderdeel dat je zelf host.

De eerlijke kanttekeningen

Dit is een checkpoint van 24 uur oud, en de modelkaart bevat nul benchmarkcijfers. Dat is geen weglating in deze beschrijving — het is de staat van de release. NVIDIA heeft architectuur- en trainingsdetails gepubliceerd, maar geen evaluatietabel, en geen onafhankelijk laboratorium heeft het al kunnen draaien. Het dichtstbijzijnde referentiepunt zijn de door de leverancier gerapporteerde cijfers van de student: Nemotron 3 Ultra rapporteert 71.9 op SWE-Bench Verified, 86.8 op MMLU-Pro, 89.0 op LiveCodeBench v6 en ongeveer 95 op RULER bij 1M context. Die beschrijven de Ultra-student, niet deze teacher, en het zijn NVIDIA's eigen cijfers. Iedereen die een distillatierun op dit checkpoint plant, moet de redeneerkwaliteit ervan als ongeverifieerd beschouwen totdat er onafhankelijke scores verschijnen.

Er zijn nog twee kanttekeningen in de kaart ingebakken. Het post-trainingscorpus is zwaar naar het Engels gewogen — ongeveer 8,6 miljoen Engelstalige samples tegenover grofweg 138.000 voor elk van de andere negen talen — dus de kwaliteit van meertalig redeneren mag niet worden afgeleid uit de 10-talen-tag. En de kaart zelf wijst op de representatiescheefheid in de basistrainingsdata en beveelt bias-audits aan vóór gebruik in vervolgtoepassingen.

Wie zou het moeten schelen

Drie groepen krijgen hier echte waarde uit. Destillatieonderzoekers hebben eindelijk een echte MOPD-leraar om te ontleden, niet slechts een recept dat er een beschrijft. Laboratoria die hun eigen redeneringsmodellen trainen, krijgen een generator voor langetermijn-traceringen en een beoordelaar die afkomstig is uit dezelfde post-training-lijn als het model dat ze proberen te evenaren. En iedereen die on-policy RL draait, kan het gebruiken zoals NVIDIA deed — als scorer voor de moeilijkste problemen, met denken alleen ingeschakeld waar het zich terugverdient.

Als je in geen van die groepen valt, verandert deze release vandaag weinig voor je: het model is groot, onbewezen en alleen zelf te hosten, en de snelste manier om in te spelen op de onderliggende trend — meer open redeneerleraren die verschijnen — is om de modellaag van je pijplijn verwisselbaar te houden achter één interface, in plaats van vast te lassen aan een enkel checkpoint.

A flow diagram titled 'How Multi-Teacher On-Policy Distillation works' showing a Student (Nemotron 3 Ultra) node sending rollouts to a Teacher panel of 10+ domain specialist cards, one highlighted as the General Reasoning teacher released Aug 14, 2026, with reward signals flowing back to the student, and the OrcaRouter logo composited in the corner.

Wat nu te kijken

Drie dingen zullen uitwijzen of dit een eenmalige actie is of dat het panel naar buiten komt. Ten eerste, of zusterleraren hetzelfde pad volgen — NVIDIA-Nemotron-Labs-Teacher-STEM is al dezelfde dag verschenen, dus de vraag is welke domeinspecialisten er daarna komen en of ze op dezelfde manier worden gewogen. Ten tweede, of NVIDIA NIM of een beheerde host ze gaat aanbieden, wat een alleen-voor-labs-release zou veranderen in iets dat de rest van de industrie daadwerkelijk kan aanroepen. Ten derde, of onafhankelijke benchmarks verschijnen — een Artificial Analysis-vermelding of LMArena-run zou de eerste echte controle zijn of de redeneerkwaliteit van de leraar overeenkomt met de student die het heeft getraind.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube