
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning: 550B-resonemangsläraren bakom Nemotron 3 Ultra har precis blivit open weights
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2658Intelligens72Kodning
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
Den 14 augusti 2026 publicerade NVIDIA NVIDIA-Nemotron-Labs-Teacher-General-Reasoning på Hugging Face — en resonemangsmodell med 550 miljarder parametrar som fram till igår bara fanns i träningspipelinen för dess flaggskepp Nemotron 3 Ultra. Det är "general reasoning"-läraren från Multi-Teacher On-Policy Distillation (MOPD)-receptet som NVIDIA använde för att träna Ultra-studenten 550B-A55B, och publiceringen är viktig av en enkel anledning: i den tekniska rapporten för Nemotron 3 Ultra som NVIDIA släppte i juni stod det tydligt att checkpointarna för respektive lärare inte skulle släppas som öppen källkod. Nu är den här det — vikter, tokenizer, chattmall och servingkonfigurationer inkluderade, under den kommersiellt vänliga licensen OpenMDW-1.1. En syskonmodell, NVIDIA-Nemotron-Labs-Teacher-STEM, släpptes samma dag, vilket känns mindre som en engångsföreteelse och mer som att lärarpanelen börjar komma ut.
Vad en lärarmodell faktiskt är
MOPD är den post-training-teknik som ger Nemotron 3 Ultra dess agentiska resonemang. I stället för att destillera en enda stor lärare till en student tränade NVIDIA mer än tio domänspecialiserade lärare – för resonemang, forskning, juridisk analys, mjukvaruteknik, verktygsanvändning och andra områden – och lät sedan studenten generera sina egna utrullningar och använde varje lärare för att poängsätta dessa utrullningar inom sitt expertområde. Eftersom poängsättningen sker på studentens egna on-policy-utdata snarare än på en fast offline-dataset, förblir träningssignalen anpassad till vad studenten faktiskt producerar vid inferenstillfället. NVIDIA kallar loopen för ko-evolution: nya läraromgångar initieras från uppdaterade studentcheckpoints, så båda sidor fortsätter att förbättras.
Den här checkpointen är den allmänna resonemangsmedlemmen i panelen. Den produceras från den posttränade Nemotron 3 Ultra-studenten genom en extra omgång resonemangsintensiv SFT och förstärkningsinlärning, och modellkortet beskriver den som optimerad för utökade resonemangsspår av hög kvalitet på de svåraste flerstegsproblemen inom matematik, logik och abstrakt resonemang — inklusive formella bevis och tävlingsprogrammering. Inuti MOPD spelar den flera roller samtidigt, en checkpoint, många roller: generering av resonemangsspår, matematikbedömning och ekvivalensbedömaren som betygsätter fritextsvar mot en referens. NVIDIA levererar den också fristående eftersom den i sig själv är en stark resonemangsmotor — avsedd för långsiktig generering av resonemangsspår, svår problemlösning och att fungera som lärare eller betygsättare i din egen destilleringspipeline.
Specifikationerna i ett enda pass
Parametrar — 550B totalt / 55B aktiva, gles LatentMoE
• Arkitektur — Mamba2-Transformer-hybrid med latent mixture-of-experts och Multi-Token Prediction (MTP)
• Kontextfönster — upp till 1M tokens; 256K standard i referensserverkonfigurationerna.
• Språk — 10: Engelska, Franska, Spanska, Italienska, Tyska, Japanska, Hindi, Koreanska, Brasiliansk portugisiska, Kinesiska
• Licens — OpenMDW-1.1, kommersiell och icke-kommersiell användning tillåten
• Minsta hårdvara — 4×B200 (NVFP4-vikter); GB200/GB300 och H100-klass stöds också
Arkitekturen är av samma familj som Nemotron 3 Ultra själv: 550B-A55B-formen med interfolierade Mamba-2- och MoE-lager, utvalda uppmärksamhetslager och MTP-huvuden för inbyggd spekulativ avkodning. Läraren är inte en mindre elev – det är en annorlunda tränad variant av samma stack, specialiserad för långsiktigt resonerande snarare än allmänt agentiskt arbete.

Varför det är viktigt att öppenkällkoda en lärare
Lärarcheckpoints är den sällsyntaste formen av öppen modellrelease. Företag publicerar elever – modellerna du distribuerar – och dataset hela tiden; de publicerar nästan aldrig de modeller som betygsatte elevernas arbete. Det är därför junirapportens rad om att per-lärarcheckpoints inte skulle släppas lästes som att dörren stängdes för att reproducera MOPD-pipelinen från början till slut. Den här releasen öppnar den dörren på glänt, åtminstone för resonemangsläraren.
För team som bygger egna resonemangsmodeller är det ett konkret värde. Belöningssignalen som formade Nemotron 3 Ultras resonemang skrevs delvis av den här checkpointen, och nu kan den studeras direkt, köras som domare eller användas för att generera resonemangsspår över långa horisonter för SFT-data. I kombination med de redan öppna efterträningsdata (nvidia/nemotron-post-training-v3) och de publicerade träningsrecepten minskar det gapet mellan ”NVIDIA tränade en bra modell” och ”vi kan träna en liknande.”

Tänkratten
En utmärkande egenskap förs vidare från Nemotron 3-familjen: resonemang är en brytare, inte en standard. Chattmallen accepterar enable_thinking=true/false, ett medium_effort-alternativ och ett reasoning_budget-tak för token, så en anropare kan tvinga fram djupt långsiktigt resonemang när ett problem kräver det och få direkta svar — snabbare och billigare — när det inte gör det. För en teacher-modell betyder det mer än det verkar: destillationskörningar vill ha billiga bedömningspass på enkla exempel och dyra resonemangsspår på svåra, och en enda checkpoint som stödjer båda lägena eliminerar behovet av att byta modeller mitt i pipelinen.
Kör det
Detta är inte en modell man anropar i förbigående. Den minsta rimliga serveringskonfigurationen är 4×B200 med NVFP4-vikter och en fp8 KV-cache; referenskonfigurationerna täcker även multi-nods GB200/GB300 och H100-klass lådor. NVIDIA publicerar guider för tre motorer — vLLM (0.22), SGLang (0.5.13) och TensorRT-LLM (1.3.0rc17) — som alla exponerar ett OpenAI-kompatibelt API på port 8000, med MTP- eller EAGLE-spekulativ avkodning och en flashinfer Mamba-backend. 1M-tokenkontexten kräver en explicit tillåtelse-flagga i varje motor (VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 och motsvarande); standardtaket är 256K.
I skrivande stund erbjuds modellen inte av någon inferensleverantör på Hugging Face, och NVIDIA har inte meddelat NIM-värdskap — detta är en release med enbart vikter. Det gör den till en modell för labb som redan driver stora GPU-flottor, eller för team vars destillationspipeline specifikt behöver den exakta lärarsignalen. När den väl landar på ett hanterat API är prissättningen enkel: detta är en MoE med 55B aktiva parametrar, och den som är värd tar betalt för vad GPU:erna kostar. På ett routningslager som arbetar med 0 % påslag betalar du leverantörens listpris utan plattformsavgift — och samma nyckel som når denna modell når också frontmodellerna du jämför dess spår mot, med automatisk redundans om en värd faller bort. Det är det en router som OrcaRouter är till för; läraren i sig är den del du själv hostar.
De ärliga varningarna
Detta är en kontrollpunkt som är 24 timmar gammal, och modellkortet innehåller inga benchmark-siffror. Det är inte en utelämning i denna text — det är hur releasen ser ut. NVIDIA publicerade arkitektur- och träningsdetaljer men ingen utvärderingstabell, och inget oberoende labb har haft tid att köra det ännu. Den närmaste referenspunkten är studentmodellens leverantörsrapporterade siffror: Nemotron 3 Ultra rapporterar 71,9 på SWE-Bench Verified, 86,8 på MMLU-Pro, 89,0 på LiveCodeBench v6 och ungefär 95 på RULER vid 1M kontext. Dessa beskriver Ultra-studenten, inte denna lärare, och de är NVIDIAs egna siffror. Den som planerar att köra en destillering på denna kontrollpunkt bör betrakta dess resonemangskvalitet som overifierad tills oberoende resultat dyker upp.
Två ytterligare förbehåll är inbakade i kortet. Post-träningskorpusen är kraftigt engelsktung — cirka 8,6 miljoner engelska exempel mot ungefär 138 000 för vart och ett av de andra nio språken — så flerspråkig resonemangskvalitet bör inte antas utifrån tio-språkstaggen. Och kortet självt uppmärksammar representationsskevhet i basträningsdatan och rekommenderar partiskhetsrevisioner innan vidare användning.
Vem bör bry sig
Tre grupper får verkligt värde här. Distillationsforskare har äntligen en verklig MOPD-lärare att dissekera, inte bara ett recept som beskriver en sådan. Labb som tränar egna resonemangsmodeller får en långsiktig spårgenerator och en domare som kommer från samma efterträningslinje som modellen de försöker matcha. Och alla som kör on-policy RL kan använda det som NVIDIA gjorde – som en poängsättare för de svåraste problemen, med tänkande påslaget endast där det lönar sig.
Om du inte tillhör någon av dessa grupper innebär den här releasen lite för dig idag: modellen är stor, oprövad och endast för självhostning, och det snabbaste sättet att agera på den underliggande trenden – att fler öppna resonemangslärare dyker upp – är att hålla din pipelines modellager utbytbart bakom ett gränssnitt snarare än fastsvetsat vid en enda kontrollpunkt.

Vad du ska titta på härnäst
Tre saker kommer att avgöra om detta är en engångsföreteelse eller om panelen kommer ut. För det första: om syskonlärarmodellerna följer samma väg — NVIDIA-Nemotron-Labs-Teacher-STEM släpptes redan samma dag, så frågan är vilka domänexperter som kommer härnäst och om de viktas på samma sätt. För det andra: om NVIDIA NIM eller en hanterad värdplattform börjar leverera dem, vilket skulle förvandla en labbintern lansering till något som resten av branschen faktiskt kan anropa. För det tredje: om oberoende benchmarks dyker upp — en Artificial Analysis-post eller en LMArena-körning skulle vara den första riktiga kontrollen av om lärarmodellens resonemangskvalitet matchar den elevmodell som den har tränat.
