Ett hero-titelkort för nyhetsartikeln 'NVIDIA-Nemotron-Labs-Teacher-General-Reasoning' som lyder '550B-resonemangsläraren bakom Nemotron 3 Ultra har nu öppna vikter', med en lådikon för öppna vikter, en GPU-chip-glyf, motortaggar vLLM / SGLang / TensorRT-LLM, ett 'Släppt 14 aug 2026'-datummärke och OrcaRouter-logotypen kompositerad i det nedre högra hörnet.
Engineering & Research

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning: 550B-resonemangsläraren bakom Nemotron 3 Ultra har precis blivit open weights

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den 14 augusti 2026 publicerade NVIDIA NVIDIA-Nemotron-Labs-Teacher-General-Reasoning på Hugging Face — en resonemangsmodell med 550 miljarder parametrar som fram till igår bara fanns i träningspipelinen för dess flaggskepp Nemotron 3 Ultra. Det är "general reasoning"-läraren från Multi-Teacher On-Policy Distillation (MOPD)-receptet som NVIDIA använde för att träna Ultra-studenten 550B-A55B, och publiceringen är viktig av en enkel anledning: i den tekniska rapporten för Nemotron 3 Ultra som NVIDIA släppte i juni stod det tydligt att checkpointarna för respektive lärare inte skulle släppas som öppen källkod. Nu är den här det — vikter, tokenizer, chattmall och servingkonfigurationer inkluderade, under den kommersiellt vänliga licensen OpenMDW-1.1. En syskonmodell, NVIDIA-Nemotron-Labs-Teacher-STEM, släpptes samma dag, vilket känns mindre som en engångsföreteelse och mer som att lärarpanelen börjar komma ut.

Vad en lärarmodell faktiskt är

MOPD är den post-training-teknik som ger Nemotron 3 Ultra dess agentiska resonemang. I stället för att destillera en enda stor lärare till en student tränade NVIDIA mer än tio domänspecialiserade lärare – för resonemang, forskning, juridisk analys, mjukvaruteknik, verktygsanvändning och andra områden – och lät sedan studenten generera sina egna utrullningar och använde varje lärare för att poängsätta dessa utrullningar inom sitt expertområde. Eftersom poängsättningen sker på studentens egna on-policy-utdata snarare än på en fast offline-dataset, förblir träningssignalen anpassad till vad studenten faktiskt producerar vid inferenstillfället. NVIDIA kallar loopen för ko-evolution: nya läraromgångar initieras från uppdaterade studentcheckpoints, så båda sidor fortsätter att förbättras.

Den här checkpointen är den allmänna resonemangsmedlemmen i panelen. Den produceras från den posttränade Nemotron 3 Ultra-studenten genom en extra omgång resonemangsintensiv SFT och förstärkningsinlärning, och modellkortet beskriver den som optimerad för utökade resonemangsspår av hög kvalitet på de svåraste flerstegsproblemen inom matematik, logik och abstrakt resonemang — inklusive formella bevis och tävlingsprogrammering. Inuti MOPD spelar den flera roller samtidigt, en checkpoint, många roller: generering av resonemangsspår, matematikbedömning och ekvivalensbedömaren som betygsätter fritextsvar mot en referens. NVIDIA levererar den också fristående eftersom den i sig själv är en stark resonemangsmotor — avsedd för långsiktig generering av resonemangsspår, svår problemlösning och att fungera som lärare eller betygsättare i din egen destilleringspipeline.

Specifikationerna i ett enda pass

Parametrar — 550B totalt / 55B aktiva, gles LatentMoE

• Arkitektur — Mamba2-Transformer-hybrid med latent mixture-of-experts och Multi-Token Prediction (MTP)

• Kontextfönster — upp till 1M tokens; 256K standard i referensserverkonfigurationerna.

• Språk — 10: Engelska, Franska, Spanska, Italienska, Tyska, Japanska, Hindi, Koreanska, Brasiliansk portugisiska, Kinesiska

• Licens — OpenMDW-1.1, kommersiell och icke-kommersiell användning tillåten

• Minsta hårdvara — 4×B200 (NVFP4-vikter); GB200/GB300 och H100-klass stöds också

Arkitekturen är av samma familj som Nemotron 3 Ultra själv: 550B-A55B-formen med interfolierade Mamba-2- och MoE-lager, utvalda uppmärksamhetslager och MTP-huvuden för inbyggd spekulativ avkodning. Läraren är inte en mindre elev – det är en annorlunda tränad variant av samma stack, specialiserad för långsiktigt resonerande snarare än allmänt agentiskt arbete.

A single-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning listing 550B total / 55B active parameters, LatentMoE Mamba2-Transformer hybrid + MTP architecture, up to 1M token context, 10 languages, OpenMDW-1.1 commercial license, and vLLM / SGLang / TensorRT-LLM serving, with a footer noting the specs are per NVIDIA's model card and no independent benchmarks exist yet, and the OrcaRouter logo composited in the corner.

Varför det är viktigt att öppenkällkoda en lärare

Lärarcheckpoints är den sällsyntaste formen av öppen modellrelease. Företag publicerar elever – modellerna du distribuerar – och dataset hela tiden; de publicerar nästan aldrig de modeller som betygsatte elevernas arbete. Det är därför junirapportens rad om att per-lärarcheckpoints inte skulle släppas lästes som att dörren stängdes för att reproducera MOPD-pipelinen från början till slut. Den här releasen öppnar den dörren på glänt, åtminstone för resonemangsläraren.

För team som bygger egna resonemangsmodeller är det ett konkret värde. Belöningssignalen som formade Nemotron 3 Ultras resonemang skrevs delvis av den här checkpointen, och nu kan den studeras direkt, köras som domare eller användas för att generera resonemangsspår över långa horisonter för SFT-data. I kombination med de redan öppna efterträningsdata (nvidia/nemotron-post-training-v3) och de publicerade träningsrecepten minskar det gapet mellan ”NVIDIA tränade en bra modell” och ”vi kan träna en liknande.”

A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card summary: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP architecture, up to 1M token context, minimum GPU requirements, supported languages, the openmdw-1.1 license tag, and the files and versions listing.

Tänkratten

En utmärkande egenskap förs vidare från Nemotron 3-familjen: resonemang är en brytare, inte en standard. Chattmallen accepterar enable_thinking=true/false, ett medium_effort-alternativ och ett reasoning_budget-tak för token, så en anropare kan tvinga fram djupt långsiktigt resonemang när ett problem kräver det och få direkta svar — snabbare och billigare — när det inte gör det. För en teacher-modell betyder det mer än det verkar: destillationskörningar vill ha billiga bedömningspass på enkla exempel och dyra resonemangsspår på svåra, och en enda checkpoint som stödjer båda lägena eliminerar behovet av att byta modeller mitt i pipelinen.

Kör det

Detta är inte en modell man anropar i förbigående. Den minsta rimliga serveringskonfigurationen är 4×B200 med NVFP4-vikter och en fp8 KV-cache; referenskonfigurationerna täcker även multi-nods GB200/GB300 och H100-klass lådor. NVIDIA publicerar guider för tre motorer — vLLM (0.22), SGLang (0.5.13) och TensorRT-LLM (1.3.0rc17) — som alla exponerar ett OpenAI-kompatibelt API på port 8000, med MTP- eller EAGLE-spekulativ avkodning och en flashinfer Mamba-backend. 1M-tokenkontexten kräver en explicit tillåtelse-flagga i varje motor (VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 och motsvarande); standardtaket är 256K.

I skrivande stund erbjuds modellen inte av någon inferensleverantör på Hugging Face, och NVIDIA har inte meddelat NIM-värdskap — detta är en release med enbart vikter. Det gör den till en modell för labb som redan driver stora GPU-flottor, eller för team vars destillationspipeline specifikt behöver den exakta lärarsignalen. När den väl landar på ett hanterat API är prissättningen enkel: detta är en MoE med 55B aktiva parametrar, och den som är värd tar betalt för vad GPU:erna kostar. På ett routningslager som arbetar med 0 % påslag betalar du leverantörens listpris utan plattformsavgift — och samma nyckel som når denna modell når också frontmodellerna du jämför dess spår mot, med automatisk redundans om en värd faller bort. Det är det en router som OrcaRouter är till för; läraren i sig är den del du själv hostar.

De ärliga varningarna

Detta är en kontrollpunkt som är 24 timmar gammal, och modellkortet innehåller inga benchmark-siffror. Det är inte en utelämning i denna text — det är hur releasen ser ut. NVIDIA publicerade arkitektur- och träningsdetaljer men ingen utvärderingstabell, och inget oberoende labb har haft tid att köra det ännu. Den närmaste referenspunkten är studentmodellens leverantörsrapporterade siffror: Nemotron 3 Ultra rapporterar 71,9 på SWE-Bench Verified, 86,8 på MMLU-Pro, 89,0 på LiveCodeBench v6 och ungefär 95 på RULER vid 1M kontext. Dessa beskriver Ultra-studenten, inte denna lärare, och de är NVIDIAs egna siffror. Den som planerar att köra en destillering på denna kontrollpunkt bör betrakta dess resonemangskvalitet som overifierad tills oberoende resultat dyker upp.

Två ytterligare förbehåll är inbakade i kortet. Post-träningskorpusen är kraftigt engelsktung — cirka 8,6 miljoner engelska exempel mot ungefär 138 000 för vart och ett av de andra nio språken — så flerspråkig resonemangskvalitet bör inte antas utifrån tio-språkstaggen. Och kortet självt uppmärksammar representationsskevhet i basträningsdatan och rekommenderar partiskhetsrevisioner innan vidare användning.

Vem bör bry sig

Tre grupper får verkligt värde här. Distillationsforskare har äntligen en verklig MOPD-lärare att dissekera, inte bara ett recept som beskriver en sådan. Labb som tränar egna resonemangsmodeller får en långsiktig spårgenerator och en domare som kommer från samma efterträningslinje som modellen de försöker matcha. Och alla som kör on-policy RL kan använda det som NVIDIA gjorde – som en poängsättare för de svåraste problemen, med tänkande påslaget endast där det lönar sig.

Om du inte tillhör någon av dessa grupper innebär den här releasen lite för dig idag: modellen är stor, oprövad och endast för självhostning, och det snabbaste sättet att agera på den underliggande trenden – att fler öppna resonemangslärare dyker upp – är att hålla din pipelines modellager utbytbart bakom ett gränssnitt snarare än fastsvetsat vid en enda kontrollpunkt.

A flow diagram titled 'How Multi-Teacher On-Policy Distillation works' showing a Student (Nemotron 3 Ultra) node sending rollouts to a Teacher panel of 10+ domain specialist cards, one highlighted as the General Reasoning teacher released Aug 14, 2026, with reward signals flowing back to the student, and the OrcaRouter logo composited in the corner.

Vad du ska titta på härnäst

Tre saker kommer att avgöra om detta är en engångsföreteelse eller om panelen kommer ut. För det första: om syskonlärarmodellerna följer samma väg — NVIDIA-Nemotron-Labs-Teacher-STEM släpptes redan samma dag, så frågan är vilka domänexperter som kommer härnäst och om de viktas på samma sätt. För det andra: om NVIDIA NIM eller en hanterad värdplattform börjar leverera dem, vilket skulle förvandla en labbintern lansering till något som resten av branschen faktiskt kan anropa. För det tredje: om oberoende benchmarks dyker upp — en Artificial Analysis-post eller en LMArena-körning skulle vara den första riktiga kontrollen av om lärarmodellens resonemangskvalitet matchar den elevmodell som den har tränat.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube