
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning: De 550B redeneerdocent achter Nemotron 3 Ultra heeft zojuist open gewichten gekregen
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2658Intelligentie72Coderen
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
Op 14 augustus 2026 publiceerde NVIDIA NVIDIA-Nemotron-Labs-Teacher-General-Reasoning op Hugging Face — een redeneermodel met 550B parameters dat tot gisteren alleen bestond in de trainingspijplijn van zijn vlaggenschip Nemotron 3 Ultra. Het is de 'general reasoning'-teacher uit het Multi-Teacher On-Policy Distillation (MOPD)-recept dat NVIDIA gebruikte om de 550B-A55B Ultra-student te trainen, en de release is om een eenvoudige reden belangrijk: in het technische rapport van Nemotron 3 Ultra dat NVIDIA in juni uitbracht, stond duidelijk dat de per-teacher checkpoints niet open-source zouden worden gemaakt. Deze is dat nu wel — inclusief gewichten, tokenizer, chat-template en serving-configuraties, onder de commercieel vriendelijke OpenMDW-1.1-licentie. Een zustermodel, NVIDIA-Nemotron-Labs-Teacher-STEM, verscheen dezelfde dag, wat minder als een eenmalige actie klinkt en meer alsof het teacher-panel naar buiten begint te komen.
Wat een teacher model eigenlijk is
MOPD is de post-trainingstechniek die Nemotron 3 Ultra zijn agentische redenering geeft. In plaats van één grote teacher in een student te distilleren, trainde NVIDIA meer dan tien domeinspecialistische teachers — voor redeneren, onderzoek, juridische analyse, software-engineering, toolgebruik en andere gebieden — en liet vervolgens de student zijn eigen rollouts genereren, waarbij elke teacher die rollouts beoordeelde op zijn eigen expertisegebied. Omdat de beoordeling plaatsvindt op de eigen on-policy outputs van de student in plaats van op een vaste offline dataset, blijft het trainingssignaal afgestemd op wat de student daadwerkelijk produceert tijdens de inferentie. NVIDIA noemt deze cyclus co-evolutie: nieuwe teacher-rondes worden geïnitialiseerd vanuit bijgewerkte student-checkpoints, zodat beide kanten blijven verbeteren.
Dit checkpoint is het algemeen redenerende lid van dat panel. Het is geproduceerd uit de post-getrainde Nemotron 3 Ultra-student via een extra ronde van redeneringsintensieve SFT en reinforcement learning, en de modelkaart beschrijft het als geoptimaliseerd voor uitgebreide, hoogwaardige redeneringstraces bij de moeilijkste meerstapsproblemen op het gebied van wiskunde, logica en abstract redeneren — inclusief formele bewijzen en competitief programmeren. Binnen MOPD vervult het meerdere rollen tegelijk, één checkpoint, vele rollen: het genereren van redeneringstraces, het beoordelen van wiskunde, en de equivalentiebeoordelaar die vrije-vorm korte antwoorden beoordeelt aan de hand van een referentie. NVIDIA levert het ook zelfstandig, omdat het op zichzelf een sterke redenaar is — bedoeld voor langetermijn-redeneringstraces, moeilijke probleemoplossing, en het fungeren als docent of beoordelaar binnen je eigen distillatiepijplijn.
De specs in één keer
• Parameters — 550B totaal / 55B actief, sparse LatentMoE
• Architectuur — Mamba2-Transformer hybride latent mengsel-van-experts met Multi-Token Voorspelling (MTP)
• Contextvenster — tot 1M tokens; 256K standaard in de referentie-servingconfiguraties
• Talen — 10: Engels, Frans, Spaans, Italiaans, Duits, Japans, Hindi, Koreaans, Braziliaans Portugees, Chinees
• Licentie — OpenMDW-1.1, commercieel en niet-commercieel gebruik toegestaan
• Minimale hardware — 4×B200 (NVFP4-gewichten); GB200/GB300 en H100-klasse worden ook ondersteund
De architectuur behoort tot dezelfde familie als Nemotron 3 Ultra zelf: de 550B-A55B-opzet met interleaved Mamba-2- en MoE-lagen, geselecteerde aandachtslagen en MTP-heads voor native speculatieve decodering. De teacher is geen kleiner studentmodel — het is een anders getrainde variant van dezelfde stack, gespecialiseerd in redeneren over lange tijdshorizons in plaats van algemeen agentisch werk.

Waarom het open-sourcen van een leraar belangrijk is
Docentcheckpoints zijn de zeldzaamste vorm van open modelrelease. Bedrijven publiceren studenten — de modellen die je implementeert — en datasets de hele tijd; ze publiceren bijna nooit de modellen die het werk van de studenten beoordeelden. Daarom werd de regel in het junirapport dat per-docent checkpoints niet zouden worden vrijgegeven, gelezen als het sluiten van de deur voor het end-to-end reproduceren van de MOPD-pijplijn. Deze release zet die deur op een kier, althans voor de reasoning-docent.
Voor teams die hun eigen redeneermodellen bouwen, is dat concrete waarde. Het beloningssignaal dat de redenering van Nemotron 3 Ultra vormgaf, is deels door dit checkpoint geschreven, en nu kan het direct worden bestudeerd, als judge worden gebruikt, of worden ingezet om langetermijn-redeneertraces voor SFT-data te genereren. In combinatie met de al openbaar beschikbare post-training-data (nvidia/nemotron-post-training-v3) en de gepubliceerde trainingsrecepten, verkleint het de kloof tussen "NVIDIA heeft een geweldig model getraind" en "wij kunnen er zo een trainen."

De denkdraaiknop
Een kenmerkend aspect wordt overgenomen van de Nemotron 3-familie: redeneren is een schakelaar, geen standaardinstelling. Het chat-template accepteert enable_thinking=true/false, een medium_effort-optie en een reasoning_budget-tokenlimiet, zodat een aanroeper diep redeneren over lange tijdshorizon kan afdwingen wanneer een probleem dat nodig heeft, en directe antwoorden kan krijgen — sneller en goedkoper — wanneer dat niet nodig is. Voor een teachermodel is dat belangrijker dan het lijkt: distillatieruns willen goedkope beoordelingspassen op gemakkelijke samples en dure redeneertraces op moeilijke, en één enkele checkpoint die beide modi ondersteunt, maakt het wisselen van modellen midden in de pijplijn overbodig.
Het uitvoeren
Dit is geen model dat je zomaar even aanroept. De minimale zinnige serving-opstelling is 4×B200 met NVFP4-weights en een fp8-KV-cache; de referentieconfiguraties bestrijken ook multi-node GB200/GB300- en H100-klasse systemen. NVIDIA publiceert cooking guides voor drie engines — vLLM (0.22), SGLang (0.5.13) en TensorRT-LLM (1.3.0rc17) — die allemaal een OpenAI-compatibele API op poort 8000 blootstellen, met MTP- of EAGLE-speculatieve decoding en een flashinfer-Mamba-backend. De 1M-token context vereist een expliciete allow-flag in elke engine (VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 en equivalenten); de standaardlimiet is 256K.
Op het moment van schrijven wordt het model door geen enkele inferentieprovider op Hugging Face aangeboden en heeft NVIDIA geen NIM-hosting aangekondigd — dit is een release met uitsluitend gewichten. Dat maakt het een model voor labs die al grote GPU-fleets draaien, of voor teams waarvan de destillatiepipeline specifiek het exacte teacher-signaal nodig heeft. Wanneer het uiteindelijk op een managed API belandt, is de prijsberekening simpel: dit is een 55B-actieve MoE, en degene die het host rekent wat de GPU's kosten. Op een routinglaag die met 0% opslag werkt, betaal je de lijstprijs van de provider zonder platformfee bovenop — en met dezelfde sleutel waarmee je dit model bereikt, bereik je ook de frontier-modellen waarmee je de traces ervan vergelijkt, met automatische failover als een host uitvalt. Dat is waar een router als OrcaRouter voor dient; de teacher zelf is het onderdeel dat je zelf host.
De eerlijke kanttekeningen
Dit is een checkpoint van 24 uur oud, en de modelkaart bevat nul benchmarkcijfers. Dat is geen weglating in deze beschrijving — het is de staat van de release. NVIDIA heeft architectuur- en trainingsdetails gepubliceerd, maar geen evaluatietabel, en geen onafhankelijk laboratorium heeft het al kunnen draaien. Het dichtstbijzijnde referentiepunt zijn de door de leverancier gerapporteerde cijfers van de student: Nemotron 3 Ultra rapporteert 71.9 op SWE-Bench Verified, 86.8 op MMLU-Pro, 89.0 op LiveCodeBench v6 en ongeveer 95 op RULER bij 1M context. Die beschrijven de Ultra-student, niet deze teacher, en het zijn NVIDIA's eigen cijfers. Iedereen die een distillatierun op dit checkpoint plant, moet de redeneerkwaliteit ervan als ongeverifieerd beschouwen totdat er onafhankelijke scores verschijnen.
Er zijn nog twee kanttekeningen in de kaart ingebakken. Het post-trainingscorpus is zwaar naar het Engels gewogen — ongeveer 8,6 miljoen Engelstalige samples tegenover grofweg 138.000 voor elk van de andere negen talen — dus de kwaliteit van meertalig redeneren mag niet worden afgeleid uit de 10-talen-tag. En de kaart zelf wijst op de representatiescheefheid in de basistrainingsdata en beveelt bias-audits aan vóór gebruik in vervolgtoepassingen.
Wie zou het moeten schelen
Drie groepen krijgen hier echte waarde uit. Destillatieonderzoekers hebben eindelijk een echte MOPD-leraar om te ontleden, niet slechts een recept dat er een beschrijft. Laboratoria die hun eigen redeneringsmodellen trainen, krijgen een generator voor langetermijn-traceringen en een beoordelaar die afkomstig is uit dezelfde post-training-lijn als het model dat ze proberen te evenaren. En iedereen die on-policy RL draait, kan het gebruiken zoals NVIDIA deed — als scorer voor de moeilijkste problemen, met denken alleen ingeschakeld waar het zich terugverdient.
Als je in geen van die groepen valt, verandert deze release vandaag weinig voor je: het model is groot, onbewezen en alleen zelf te hosten, en de snelste manier om in te spelen op de onderliggende trend — meer open redeneerleraren die verschijnen — is om de modellaag van je pijplijn verwisselbaar te houden achter één interface, in plaats van vast te lassen aan een enkel checkpoint.

Wat nu te kijken
Drie dingen zullen uitwijzen of dit een eenmalige actie is of dat het panel naar buiten komt. Ten eerste, of zusterleraren hetzelfde pad volgen — NVIDIA-Nemotron-Labs-Teacher-STEM is al dezelfde dag verschenen, dus de vraag is welke domeinspecialisten er daarna komen en of ze op dezelfde manier worden gewogen. Ten tweede, of NVIDIA NIM of een beheerde host ze gaat aanbieden, wat een alleen-voor-labs-release zou veranderen in iets dat de rest van de industrie daadwerkelijk kan aanroepen. Ten derde, of onafhankelijke benchmarks verschijnen — een Artificial Analysis-vermelding of LMArena-run zou de eerste echte controle zijn of de redeneerkwaliteit van de leraar overeenkomt met de student die het heeft getraind.
