
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max: De week waarin open gewichten serieus werden
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 114 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 367 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
{{1}}Open gewichten beleefden net een bewogen week{{/1}}. Op of omstreeks 12 augustus 2026 bracht Alibaba de eerste open-weight Max-klasse Qwen ooit uit — {{2}}Qwen3.8 Max, een vlaggenschip met 2,4 biljoen parameters, gepubliceerd als Qwen3.8-2.4T-A95B op Hugging Face en ModelScope{{/2}}. Twee dagen later, op 14 augustus, publiceerde NVIDIA {{3}}NVIDIA-Nemotron-Labs-Teacher-General-Reasoning{{/3}}, een {{4}}550B-parameter, 55B-actieve reasoning-teacher{{/4}} uit de {{5}}Nemotron 3 Ultra-trainingpipeline{{/5}}, eveneens op {{6}}Hugging Face{{/6}}. Beide zijn enorme, vers geopende checkpoints van frontier-labs, en daarmee houdt de gelijkenis op. {{7}}Qwen3.8 Max{{/7}} is open zodat je zelf een frontier-model kunt draaien; {{8}}NVIDIA-Nemotron-Labs-Teacher-General-Reasoning{{/8}} is open zodat je ermee kunt trainen. Ze met elkaar vergelijken is eigenlijk vragen welk type team je bent — maar het feit dat beide binnen {{9}}72 uur{{/9}} landden is een signaal over waar de industrie naartoe gaat.
Wat elke release daadwerkelijk bevat
Qwen3.8 Max is de inzetbare versie. Het is een sparse mixture-of-experts-model met 2,4 biljoen totale parameters, ongeveer 95 miljard actieve parameters per token over 512 experts, gebouwd op de hybride architectuur van de Qwen3.5-familie. In zijn open-weights-vorm is het alleen-tekst met een native context van 262K tokens (uitbreidbaar tot meer dan 1M), en — opmerkelijk — denken is vereist: het model genereert redeneerinhoud tussen <think>-tags en dit kan niet worden uitgeschakeld. De gehoste API-versie die Alibaba op 3 augustus lanceerde, voegt beeld- en video-invoer, een standaardcontext van 1M en optioneel denken toe. De open-weights-licentie is een aangepaste Qwen3.8 Max-licentie, permissief maar met omzetgerelateerde voorwaarden voor zeer grote commerciële implementaties. Als je de multi-node hardware hebt, kun je een frontier-class model op je eigen infrastructuur draaien.
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning is het model voor de trainingsfase. Het is een van de meer dan tien domeingespecialiseerde teachers uit het Multi-Teacher On-Policy Distillation-recept (MOPD) achter Nemotron 3 Ultra, afgeleid van de post-trained Ultra-student via een extra op redeneren gespecialiseerde SFT- en reinforcement-learningfase. Zijn rol in die pipeline is het genereren van lange redeneertraces bij de moeilijkste wiskunde-, logica- en abstracte-redeneringsproblemen, en het fungeren als beoordelaar die vrije antwoorden beoordeelt. Het wordt uitgebracht onder de commercieel vriendelijke OpenMDW-1.1-licentie met de openbaar gemaakte post-trainingdata, en bevat nul benchmarkcijfers — NVIDIA verwijst in plaats daarvan naar een nauwkeurigheidsgrafiek en het Ultra-technisch rapport. De afnemers zijn distillatieruns, niet productieverkeer.
Qwen3.8 Max, het eerste open vlaggenschip in de Max-klasse
De release van Alibaba is belangrijk omdat Max-klasse Qwen-modellen historisch gezien uitsluitend via een API beschikbaar waren. Qwen3.8 Max doorbreekt dat: de gewichten zijn downloadbaar en het model is echt toonaangevend — Artificial Analysis geeft het een Intelligence Index van 58 en een Agentic Index van 58, waarmee het in agentische omgevingen gelijk staat aan de beste closed generalisten. De door de leverancier gerapporteerde topresultaten zijn sterk: 93,0 op PaperBench (beter dan GPT-5.6 Sol en Fable 5), 92,6 op GPQA Diamond, 86,1 op OSWorld-Verified. De zwakke punten zijn even reëel — 67,7 op SWE-bench Pro en 43,6 op Humanity's Last Exam blijven achter bij de koplopers, en onafhankelijke tests wezen uit dat het per voltooide taak duur is, met gemiddeld 64 turns per taak bij agentische runs. Op de API van Alibaba kost het $2,00 per miljoen inputtokens, $6,00 per miljoen output en $0,25 per miljoen gecachte input; dat is een prijsverlaging van 20% ten opzichte van de previewprijzen.
De leraar: trainingsinfrastructuur met een modelkaart
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning concurreert niet op die cijfers, omdat het er geen heeft gepubliceerd. Wat het in plaats daarvan biedt, is dezelfde LatentMoE Mamba-2 + Transformer hybride architectuur als de Ultra-student, tot 1M tokens aan context, en een redeneerregelaar — enable_thinking true/false, een medium_effort-modus en een harde bovengrens voor reasoning_budget — die een distillatiepijplijn nodig heeft om diep te redeneren over moeilijke samples en dit over te slaan bij makkelijke. Minimale hardware is 4×B200 (of 8×H100), inzet via vLLM, SGLang of TensorRT-LLM, en de checkpoint is een download van 1,12 terabyte. Het wordt door geen enkele inferentieprovider ingezet en NVIDIA heeft geen NIM-hosting aangekondigd. Dit is een release met alleen gewichten, gericht op labs die al over grote GPU-vloten beschikken.
Specs naast elkaar
• Doel — Teacher: specialist in redeneren tijdens de training en beoordelaar. Qwen3.8 Max: inzetbaar grensverleggend vlaggenschip.
• Schaal — Teacher: 550B totaal / 55B actief, LatentMoE met MTP. Qwen3.8 Max: 2,4T totaal / ~95B actief, 512 experts, Qwen3.5 hybride.
• Context — Teacher: tot 1M tokens, 256K standaard. Qwen3.8 Max: 262K native open-weights context, uitbreidbaar tot meer dan 1M; API-versie: 1M standaard.
• Gewichten — Leraar: OpenMDW-1.1, uitgebracht op 14 aug 2026. Qwen3.8 Max: Qwen3.8 Max License, uitgebracht ~12 aug 2026.
• Onafhankelijk bewijs — Docent: nog geen. Qwen3.8 Max: AA Intelligence Index 58, Agentic Index 58, Coding Index 71.8.
• Denken — Leraar: enable_thinking-schakelaar, medium_effort, reasoning_budget-bovengrens. Qwen3.8 Max: verplicht aan in open gewichten, kan niet worden uitgeschakeld.
• Prijs — Teacher: geen lijstprijs, zelfgehoste capex. Qwen3.8 Max: $2,00 / $6,00 per miljoen tokens, $0,25 voor gecachte invoer.


De bewijssymmetrie is het hele verhaal
{{1}}Qwen3.8 Max is getest; de teacher niet.{{/1}} {{2}}Dat is deels een kwestie van leeftijd — Qwen3.8 Max werd op 3 augustus gelanceerd en heeft twee weken aan leaderboard-runs achter de rug, terwijl de teacher gisteren uitkwam — en deels een kwestie van opzet, want de modelkaart van de teacher was nooit bedoeld om op scores te concurreren.{{/2}} {{3}}Maar de asymmetrie heeft een reële consequentie voor de vergelijking:{{/3}} elk concreet getal op deze pagina met een bron eraan hoort bij Qwen3.8 Max, en elk getal dat aan de teacher is gekoppeld, is een architectuurspecificatie. {{4}}De redeneerkwaliteit van de teacher is door niemand buiten NVIDIA geverifieerd,{{/4}} en de cijfers op familieniveau (de door de leverancier gerapporteerde SWE-Bench Verified 71.9, MMLU-Pro 86.8, LiveCodeBench v6 89.0 van de Ultra-student) beschrijven een ander model. {{5}}Iedereen die een beslissing wil baseren op 'wat scoort beter' moet wachten op onafhankelijke runs van de teacher{{/5}} — en dat is precies de kloof die de komende weken zouden moeten dichten.
Twee denkende meters, anders ingesteld.
Het interessantste technische contrast tussen deze twee releases is wat er gebeurt als je ze vraagt om te redeneren. Qwen3.8 Max heeft in zijn open-weights-vorm geen keuze: {{1}}het denken staat altijd aan, en het redeneertrace maakt deel uit van elk antwoord{{/1}}. Dat is geweldig voor antwoordkwaliteit en transparantie, maar duur voor bulkgeneratie. {{2}}De teacher behandelt redeneren als een draaiknop:{{/2}} {{3}}enable_thinking schakelt het om, medium_effort regelt het, en een reasoning_budget-plafond legt er een maximum aan op{{/3}}. {{4}}Voor een destillatiepipeline is het verschil doorslaggevend{{/4}} — {{5}}het genereren van miljoenen redeneertraces met een model waarvan het denken altijd aanstaat, vermenigvuldigt je tokenrekening{{/5}}, terwijl {{6}}de schakelaar van de teacher je alleen laat betalen voor diep redeneren waar een moeilijk sample erom vraagt{{/6}}. {{7}}Dit zijn geen concurrerende ontwerpfilosofieën{{/7}}; {{8}}het zijn twee tools die geoptimaliseerd zijn voor tegenovergestelde uiteinden van hetzelfde probleem, en elk is het juiste gereedschap voor zijn doel{{/8}}.

De bottom line
Als je een frontier-model op je eigen hardware wilt draaien — of er een tegen een redelijke prijs wilt aanroepen — is Qwen3.8 Max de release die ertoe doet, en die staat op OrcaRouter tegen de lijstprijs van Alibaba, zonder opslag doorgegeven, dus de prijsverlaging die Alibaba bij de lancering aankondigde, is dezelfde dag bij ons live. Als je een redeneermodel wilt trainen of destilleren — of het signaal wilt controleren dat Nemotron 3 Ultra heeft gevormd — is NVIDIA-Nemotron-Labs-Teacher-General-Reasoning de release die ertoe doet, en die is voorlopig alleen self-hosted beschikbaar. Het grotere verhaal: beide verschenen in dezelfde week. Open weights zijn net verschoven van 'open genoeg om te bekijken' naar 'open genoeg om op voort te bouwen', op twee verschillende punten in de model-toeleveringsketen. Teams die hun modellaag verwisselbaar houden achter één interface — self-hosted training aan de ene kant, beheerde frontier-inferentie aan de andere — zijn degenen die in staat zijn om beide te gebruiken.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
