
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning: L'insegnante di ragionamento da 550B dietro Nemotron 3 Ultra è appena diventato open weights
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
Il 14 agosto 2026, NVIDIA ha pubblicato su Hugging Face NVIDIA-Nemotron-Labs-Teacher-General-Reasoning — un modello di ragionamento da 550 miliardi di parametri che, fino a ieri, esisteva solo all'interno della pipeline di addestramento del suo flagship Nemotron 3 Ultra. È il teacher di "ragionamento generale" della ricetta Multi-Teacher On-Policy Distillation (MOPD) che NVIDIA ha utilizzato per addestrare lo studente Ultra da 550B-A55B, e il rilascio conta per un motivo semplice: nel report tecnico di Nemotron 3 Ultra pubblicato da NVIDIA a giugno, la ricetta di addestramento affermava chiaramente che i checkpoint dei singoli teacher non sarebbero stati open-source. Ora questo lo è — pesi, tokenizer, chat template e configurazioni di serving inclusi, sotto la licenza commercialmente permissiva OpenMDW-1.1. Un modello gemello, NVIDIA-Nemotron-Labs-Teacher-STEM, è uscito lo stesso giorno, il che sembra meno un caso isolato e più l'inizio dell'uscita dell'intero pannello di teacher.
Che cos'è realmente un modello insegnante
MOPD è la tecnica di post-addestramento che conferisce a Nemotron 3 Ultra il suo ragionamento agentico. Invece di distillare un singolo modello teacher di grandi dimensioni in uno studente, NVIDIA ha addestrato più di dieci teacher specializzati per dominio — per ragionamento, ricerca, analisi legale, ingegneria del software, uso di strumenti e altre aree — poi ha lasciato che lo studente generasse i propri rollout e ha usato ciascun teacher per valutare quei rollout nel proprio ambito di competenza. Poiché la valutazione avviene sugli output on-policy dello studente stesso piuttosto che su un dataset offline fisso, il segnale di addestramento rimane allineato con ciò che lo studente produce effettivamente al momento dell'inferenza. NVIDIA chiama questo ciclo co-evoluzione: i nuovi round di teacher vengono inizializzati dai checkpoint aggiornati dello studente, così entrambe le parti continuano a migliorare.
Questo checkpoint è il membro del pannello dedicato al ragionamento generale. È prodotto dallo studente Nemotron 3 Ultra post-addestrato attraverso un ulteriore ciclo di SFT incentrata sul ragionamento e di apprendimento per rinforzo, e la scheda del modello lo descrive come ottimizzato per tracce di ragionamento estese e di alta qualità sui problemi multi-step più difficili in ambito matematico, logico e di ragionamento astratto — incluse dimostrazioni formali e coding competitivo. All'interno di MOPD svolge più ruoli contemporaneamente: un checkpoint, molti ruoli: generazione di tracce di ragionamento, valutazione matematica e giudice di equivalenza che valuta risposte brevi a formato libero rispetto a un riferimento. NVIDIA lo distribuisce anche come prodotto autonomo, perché è di per sé un forte ragionatore — pensato per la generazione di tracce di ragionamento a lungo orizzonte, la risoluzione di problemi complessi e il ruolo di insegnante o valutatore all'interno del proprio pipeline di distillazione.
Le specifiche in un'unica passata
• Parametri — 550B totali / 55B attivi, LatentMoE sparso
• Architettura — Mamba2-Transformer ibrido a miscela latente di esperti con predizione multi-token (MTP)
• Finestra di contesto — fino a 1 milione di token; 256K predefinito nelle configurazioni di servizio di riferimento
• Lingue — 10: Inglese, Francese, Spagnolo, Italiano, Tedesco, Giapponese, Hindi, Coreano, Portoghese brasiliano, Cinese
• Licenza — OpenMDW-1.1, uso commerciale e non commerciale consentito
• Hardware minimo — 4×B200 (pesi NVFP4); supportati anche GB200/GB300 e classe H100
L'architettura appartiene alla stessa famiglia di Nemotron 3 Ultra: la forma 550B-A55B con layer Mamba-2 e MoE interleavati, layer di attenzione selezionati e testine MTP per la decodifica speculativa nativa. Il teacher non è uno studente più piccolo — è una variante dello stesso stack addestrata in modo diverso, specializzata nel ragionamento a lungo orizzonte piuttosto che nel lavoro agente generico.

Perché è importante rendere open source un insegnante
I checkpoint dei teacher sono il tipo più raro di rilascio di modelli open. Le aziende pubblicano continuamente i modelli studenti — i modelli che distribuisci — e i dataset; quasi mai pubblicano i modelli che hanno valutato il lavoro degli studenti. Ecco perché la riga del rapporto di giugno secondo cui i checkpoint per singolo teacher non sarebbero stati rilasciati è stata letta come la chiusura della porta alla riproduzione end-to-end della pipeline MOPD. Questo rilascio apre un varco in quella porta, almeno per il teacher di ragionamento.
Per i team che costruiscono i propri modelli di ragionamento, questo è un valore concreto. Il segnale di reward che ha plasmato il ragionamento di Nemotron 3 Ultra è stato in parte scritto da questo checkpoint, e ora può essere studiato direttamente, utilizzato come giudice, o usato per generare tracce di ragionamento a lungo orizzonte per dati SFT. Combinato con i dati di post-training già aperti (nvidia/nemotron-post-training-v3) e le ricette di addestramento pubblicate, riduce il divario tra "NVIDIA ha addestrato un grande modello" e "possiamo addestrarne uno simile".

Il quadrante del pensiero
Una caratteristica distintiva viene ereditata dalla famiglia Nemotron 3: il ragionamento è un interruttore, non un'impostazione predefinita. Il template di chat accetta enable_thinking=true/false, un'opzione medium_effort e un tetto di token reasoning_budget, così un chiamante può forzare un ragionamento profondo a lungo orizzonte quando un problema lo richiede e ottenere risposte dirette — più veloci ed economiche — quando non lo richiede. Per un modello insegnante, questo conta più di quanto sembri: le esecuzioni di distillazione richiedono passaggi di valutazione economici su campioni facili e tracce di ragionamento costose su quelli difficili, e un singolo checkpoint che supporta entrambe le modalità elimina la necessità di cambiare modelli a metà pipeline.
Eseguendolo
Questo non è un modello da chiamare con leggerezza. La configurazione minima sensata per il serving è 4×B200 con pesi NVFP4 e una cache KV in fp8; le configurazioni di riferimento coprono anche cluster multi-nodo GB200/GB300 e macchine di classe H100. NVIDIA pubblica guide di configurazione per tre motori — vLLM (0.22), SGLang (0.5.13) e TensorRT-LLM (1.3.0rc17) — tutti esposti come API compatibile con OpenAI sulla porta 8000, con decodifica speculativa MTP o EAGLE e un backend Mamba flashinfer. Il contesto da 1 milione di token richiede un flag esplicito di abilitazione in ciascun motore (VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 e equivalenti); il limite predefinito è 256K.
Al momento della stesura, il modello non è distribuito da alcun provider di inferenza su Hugging Face e NVIDIA non ha annunciato l'hosting NIM — si tratta di una release di soli pesi. Questo lo rende un modello per laboratori che gestiscono già grandi parchi GPU, o per team la cui pipeline di distillazione richiede specificamente il segnale esatto del teacher. Quando arriverà su un'API gestita, il calcolo del prezzo è semplice: è un MoE con 55B di parametri attivi, e chiunque lo ospiti farà pagare quello che costano le GPU. Su un livello di routing che lavora con un markup dello 0%, paghi il prezzo di listino del provider senza commissioni di piattaforma aggiuntive — e la stessa chiave che raggiunge questo modello raggiunge anche i modelli frontier con cui confronti le sue tracce, con failover automatico se un host cade. È a questo che serve un router come OrcaRouter; il teacher stesso è la parte che ospiti da te.
Le oneste avvertenze
Questo checkpoint ha appena 24 ore e la scheda del modello non riporta alcun numero di benchmark. Non è un'omissione di questo documento: è lo stato attuale della release. NVIDIA ha pubblicato i dettagli dell'architettura e dell'addestramento, ma nessuna tabella di valutazione, e nessun laboratorio indipendente ha ancora avuto il tempo di eseguirlo. Il punto di riferimento più vicino sono i numeri dichiarati dal fornitore per lo studente: Nemotron 3 Ultra riporta 71.9 su SWE-Bench Verified, 86.8 su MMLU-Pro, 89.0 su LiveCodeBench v6 e circa 95 su RULER a 1M di contesto. Questi descrivono lo studente Ultra, non questo modello insegnante, e sono cifre di NVIDIA stessa. Chiunque pianifichi una run di distillazione su questo checkpoint dovrebbe considerare la qualità del suo ragionamento come non verificata finché non appariranno punteggi indipendenti.
Nel documento sono incorporate altre due avvertenze. Il corpus post-addestramento è fortemente sbilanciato verso l'inglese — circa 8,6 milioni di campioni in inglese contro circa 138.000 per ciascuna delle altre nove lingue — quindi la qualità del ragionamento multilingue non dovrebbe essere data per scontata in base all'etichetta delle 10 lingue. Inoltre, la scheda stessa evidenzia lo squilibrio di rappresentazione nei dati di addestramento di base e raccomanda audit sui bias prima dell'uso a valle.
A chi dovrebbe importare
Tre gruppi trovano qui un valore reale. I ricercatori di distillazione hanno finalmente un vero insegnante MOPD da sezionare, non solo una ricetta che ne descrive uno. I laboratori che addestrano i propri modelli di ragionamento ottengono un generatore di tracce a lungo orizzonte e un giudice provenienti dalla stessa stirpe di post-addestramento del modello che cercano di eguagliare. E chiunque esegua RL on-policy può usarlo come ha fatto NVIDIA — come valutatore per i problemi più difficili, con il pensiero attivato solo dove si ripaga.
Se non rientri in nessuno di questi gruppi, questa versione cambia poco per te oggi: il modello è grande, non collaudato e disponibile solo in self-host, e il modo più rapido per agire sulla tendenza di fondo — l'emergere di più insegnanti di ragionamento aperti — è mantenere il livello del modello della pipeline sostituibile dietro un'unica interfaccia, piuttosto che saldato a un singolo checkpoint.

Cosa guardare dopo
Tre cose diranno se si tratta di un caso isolato o dell'emergere del gruppo. In primo luogo, se gli insegnanti gemelli seguiranno lo stesso percorso — NVIDIA-Nemotron-Labs-Teacher-STEM è già arrivato lo stesso giorno, quindi la domanda è quali specialisti di dominio arriveranno dopo e se saranno ponderati allo stesso modo. In secondo luogo, se NVIDIA NIM o un host gestito inizierà a servirli, il che trasformerebbe un rilascio destinato solo ai laboratori in qualcosa che il resto del settore può effettivamente chiamare. In terzo luogo, se compariranno benchmark indipendenti — una voce su Artificial Analysis o una run su LMArena sarebbe la prima vera verifica se la qualità del ragionamento dell'insegnante corrisponde a quella dello studente che ha addestrato.
