
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max: La settimana in cui gli open weights sono diventati seri
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 114 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 367 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Gli open-weight hanno appena vissuto una settimana importante. Intorno al 12 agosto 2026, Alibaba ha rilasciato il primo modello Max-class open-weight della storia — Qwen3.8 Max, un modello di punta da 2,4 trilioni di parametri, pubblicato come Qwen3.8-2.4T-A95B su Hugging Face e ModelScope. Due giorni dopo, il 14 agosto, NVIDIA ha pubblicato NVIDIA-Nemotron-Labs-Teacher-General-Reasoning, un teacher di reasoning da 550 miliardi di parametri con 55 miliardi attivi, proveniente dalla pipeline di addestramento di Nemotron 3 Ultra, anche questo su Hugging Face. Entrambi sono checkpoint enormi e freschi di pubblicazione da laboratori di frontiera, e le somiglianze finiscono qui. Qwen3.8 Max è aperto così puoi eseguire un modello di frontiera tu stesso; NVIDIA-Nemotron-Labs-Teacher-General-Reasoning è aperto così puoi usarlo per addestrare. Confrontarli significa in realtà chiedersi che tipo di team sei — ma il fatto che entrambi siano arrivati nell'arco di 72 ore è un segnale sulla direzione in cui sta andando il settore.
Cosa contiene effettivamente ogni release
Qwen3.8 Max è il modello distribuibile. È un modello sparse mixture-of-experts con 2,4 trilioni di parametri totali, circa 95 miliardi attivi per token su 512 esperti, costruito sull'architettura ibrida della famiglia Qwen3.5. Nella sua forma a pesi aperti è solo testo con un contesto nativo di 262K token (estensibile oltre 1M) e — notevolmente — il pensiero è obbligatorio: il modello emette contenuti di ragionamento tra tag <think> e non può essere disattivato. La versione API ospitata che Alibaba ha lanciato il 3 agosto aggiunge input di immagini e video, un contesto predefinito di 1M e pensiero opzionale. La licenza a pesi aperti è una licenza Qwen3.8 Max personalizzata, permissiva ma con condizioni basate sui ricavi per distribuzioni commerciali molto grandi. Se disponi dell'hardware multi-nodo, puoi eseguire un modello di classe frontier sulla tua infrastruttura.
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning è il modello per la fase di addestramento. È uno dei più di dieci insegnanti specializzati per dominio del ricettario di distillazione on-policy multi-insegnante (MOPD) alla base di Nemotron 3 Ultra, derivato dallo studente Ultra post-addestrato attraverso un'ulteriore fase di SFT specializzata nel ragionamento e una fase di apprendimento per rinforzo. Il suo ruolo in quella pipeline è generare lunghe tracce di ragionamento sui problemi più difficili di matematica, logica e ragionamento astratto, e fungere da giudice che valuta le risposte a formato libero. Viene distribuito con la licenza OpenMDW-1.1, amichevole per uso commerciale, con i dati di post-addestramento divulgati, e non riporta alcun numero di benchmark: NVIDIA rimanda invece a un grafico di accuratezza e al report tecnico di Ultra. I suoi destinatari sono le esecuzioni di distillazione, non il traffico di produzione.
Qwen3.8 Max, il primo flagship open di classe Max
La pubblicazione di Alibaba è importante perché i modelli Qwen di classe Max sono stati storicamente solo API. Qwen3.8 Max rompe questo schema: i pesi sono scaricabili e il modello è genuinamente all'avanguardia — Artificial Analysis gli attribuisce un Intelligence Index di 58 e un Agentic Index di 58, pareggiando con i migliori generalisti chiusi in contesti agentici. I suoi punti salienti dichiarati dal fornitore sono solidi: 93.0 su PaperBench (davanti a GPT-5.6 Sol e Fable 5), 92.6 su GPQA Diamond, 86.1 su OSWorld-Verified. I suoi punti deboli sono altrettanto reali — 67.7 su SWE-bench Pro e 43.6 su Humanity's Last Exam restano indietro rispetto ai leader, e test indipendenti lo hanno trovato costoso per attività completata, con una media di 64 turni per attività nelle esecuzioni agentiche. Sull'API di Alibaba costa $2.00 per milione di token in input, $6.00 per milione di token in output e $0.25 per milione di token in cache, con un taglio del 20% rispetto al prezzo di anteprima.
L'insegnante: infrastruttura di addestramento con una model card
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning non compete su nessuno di quei numeri perché non ne ha pubblicati. Ciò che offre invece è la stessa architettura ibrida LatentMoE Mamba-2 + Transformer dello studente Ultra, fino a 1 milione di token di contesto, e un controllo del ragionamento — enable_thinking true/false, una modalità medium_effort e un tetto rigido per reasoning_budget — di cui una pipeline di distillazione ha bisogno per dedicare un ragionamento profondo ai campioni difficili e saltarlo su quelli facili. L'hardware minimo richiesto è 4×B200 (o 8×H100), con serving tramite vLLM, SGLang o TensorRT-LLM, e il checkpoint è un download da 1,12 terabyte. Non è distribuito da alcun provider di inferenza e NVIDIA non ha annunciato l'hosting NIM. Si tratta di una release solo pesi, pensata per laboratori che gestiscono già grandi flotte di GPU.
Specifiche a confronto
• Scopo — Insegnante: specialista e giudice del ragionamento in fase di addestramento. Qwen3.8 Max: flagship di frontiera distribuibile.
• Scale — Modello insegnante: 550B totali / 55B attivi, LatentMoE con MTP. Qwen3.8 Max: 2.4T totali / ~95B attivi, 512 esperti, Qwen3.5 ibrido.
• Contesto — Teacher: fino a 1M token, 256K predefinito. Qwen3.8 Max: 262K di contesto nativo open-weights, estendibile oltre 1M; versione API con default a 1M.
• Pesi — Insegnante: OpenMDW-1.1, rilasciato il 14 ago 2026. Qwen3.8 Max: Qwen3.8 Max License, rilasciato ~12 ago 2026.
• Evidenze indipendenti — Teacher: ancora nessuna. Qwen3.8 Max: AA Intelligence Index 58, Agentic Index 58, Coding Index 71.8.
• Pensiero — Insegnante: interruttore enable_thinking, medium_effort, tetto del reasoning_budget. Qwen3.8 Max: obbligatoriamente attivo nei pesi aperti, non disattivabile.
• Prezzo — Teacher: nessun prezzo di listino, capex per self-hosting. Qwen3.8 Max: $2,00 / $6,00 per milione di token, $0,25 per input in cache.


L'asimmetria delle prove è tutta la storia.
Qwen3.8 Max è stato testato; il teacher no. In parte è una questione di età — Qwen3.8 Max è stato lanciato il 3 agosto e ha due settimane di presenze in classifica, mentre il teacher è stato rilasciato ieri — e in parte di intenzione, perché la scheda del teacher non è mai stata pensata per competere sui punteggi. Ma l'asimmetria ha una conseguenza reale per il confronto: ogni numero concreto in questa pagina a cui è associata una fonte appartiene a Qwen3.8 Max, e ogni numero associato al teacher è una specifica architetturale. La qualità del ragionamento del teacher non è verificata da nessuno al di fuori di NVIDIA, e le sue cifre a livello di famiglia (SWE-Bench Verified 71.9, MMLU-Pro 86.8, LiveCodeBench v6 89.0, riportati dal produttore per lo studente Ultra) descrivono un modello diverso. Chiunque prenda una decisione su "quale ottiene punteggi migliori" deve attendere esecuzioni indipendenti del teacher — che è esattamente il divario che le prossime settimane dovrebbero colmare.
Due manopole di pensiero, impostate diversamente
Il contrasto tecnico più interessante tra queste due versioni è ciò che accade quando si chiede loro di ragionare. Qwen3.8 Max nella sua forma a pesi aperti non ha scelta: il pensiero è sempre attivo e la traccia di ragionamento fa parte di ogni risposta. Questo è ottimo per la qualità delle risposte e la trasparenza, ma costoso per la generazione in blocco. Il teacher tratta il ragionamento come una manopola: enable_thinking lo attiva o disattiva, medium_effort lo limita, e un tetto reasoning_budget lo vincola. Per una pipeline di distillazione la differenza è decisiva — generare milioni di tracce di ragionamento con un modello dal pensiero sempre attivo moltiplica la bolletta dei token, mentre l'interruttore del teacher ti permette di pagare per un ragionamento profondo solo dove un campione difficile lo richiede. Queste non sono filosofie di design in competizione; sono due strumenti ottimizzati per estremi opposti dello stesso problema, e ciascuno è lo strumento giusto per il proprio scopo.

Il punto cruciale
{{1}}Se vuoi eseguire un modello di frontiera sul tuo hardware — o chiamarne uno a un prezzo ragionevole — Qwen3.8 Max è il rilascio che conta, ed è su OrcaRouter al prezzo di listino di Alibaba, passato con un margine dello 0%, quindi il taglio di prezzo annunciato da Alibaba al lancio è attivo anche dalla nostra parte lo stesso giorno.{{/1}}{{2}}Se vuoi addestrare o distillare un modello di ragionamento — o verificare il segnale che ha plasmato Nemotron 3 Ultra — NVIDIA-Nemotron-Labs-Teacher-General-Reasoning è il rilascio che conta, ed è per ora solo self-hosted.{{/2}}{{3}}La notizia più importante è che entrambi sono arrivati nella stessa settimana: i pesi aperti sono passati da "abbastanza aperti da guardarli" a "abbastanza aperti da costruirci sopra," in due punti diversi della catena di fornitura dei modelli.{{/3}}{{4}}I team che mantengono il proprio livello del modello sostituibile dietro un'unica interfaccia — addestramento self-hosted da un lato, inferenza di frontiera gestita dall'altro — sono quelli nella posizione migliore per usarli entrambi.{{/4}}
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
