Eine Hero-Titelkarte für den Vergleichsartikel "NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max" mit der Aufschrift "Die Woche, in der offene Gewichte ernst wurden", mit links einem Symbol aus offener Schachtel und Abschlusskappe, rechts einem Globus-und-Chip-Symbol, einem MODEL-COMPARISON-Abzeichen und dem unten rechts eingefügten OrcaRouter-Logo.
Guides & Insights

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max: Die Woche, in der Open Weights ernst wurden

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Open Weights hatten eine große Woche. Am oder um den 12. August 2026 veröffentlichte Alibaba den ersten Open-Weight-Qwe​n der Max-Klasse überhaupt — Qwen3.8 Max, ein Flaggschiff mit 2,4 Billionen Parametern, erschienen als Qwen3.8-2.4T-A95B auf Hugging Face und ModelScope. Zwei Tage später, am 14. August, veröffentlichte NVIDIA NVIDIA-Nemotron-Labs-Teacher-General-Reasoning, ein Reasoning-Lehrermodell mit 550 Milliarden Parametern und 55 Milliarden aktiven Parametern aus der Nemotron-3-Ultra-Trainingspipeline, ebenfalls auf Hugging Face. Beide sind enorme, frisch freigegebene Checkpoints von Frontier-Laboren — und damit hört die Ähnlichkeit auch schon auf. Qwen3.8 Max ist offen, damit du selbst ein Frontier-Modell ausführen kannst; NVIDIA-Nemotron-Labs-Teacher-General-Reasoning ist offen, damit du es zum Trainieren nutzen kannst. Sie zu vergleichen heißt im Grunde zu fragen, was für ein Team du bist — aber die Tatsache, dass beide innerhalb von 72 Stunden erschienen sind, ist ein Signal dafür, wohin die Branche steuert.

Was jede Version tatsächlich enthält

Qwen3.8 Max ist das einsetzbare Modell. Es ist ein Sparse-Mixture-of-Experts-Modell mit 2,4 Billionen Gesamtparametern und etwa 95 Milliarden aktiven Parametern pro Token über 512 Experten, das auf der Hybridarchitektur der Qwen3.5-Familie basiert. In seiner Open-Weights-Form ist es rein textbasiert mit einem nativen Kontext von 262K-Token (erweiterbar auf über 1M) – und bemerkenswerterweise ist Denken erforderlich: Das Modell erzeugt Reasoning-Inhalte zwischen <think>-Tags und kann nicht abgeschaltet werden. Die gehostete API-Version, die Alibaba am 3. August eingeführt hat, ergänzt Bild- und Videoeingabe, einen Standardkontext von 1M und optionales Denken. Die Open-Weights-Lizenz ist eine individuelle Qwen3.8-Max-Lizenz, permissiv, aber mit umsatzbasierten Bedingungen für sehr große kommerzielle Bereitstellungen. Wenn Sie über die Multi-Node-Hardware verfügen, können Sie ein Modell der Frontier-Klasse in Ihrer eigenen Infrastruktur ausführen.

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning ist das für das Training gedachte Modell. Es ist einer der mehr als zehn domänenspezialisierten Lehrer aus dem Multi-Teacher-On-Policy-Distillations-Rezept (MOPD) hinter Nemotron 3 Ultra, abgeleitet vom nachtrainierten Ultra-Studenten durch eine zusätzliche auf Reasoning spezialisierte SFT- und Reinforcement-Learning-Phase. Seine Rolle in dieser Pipeline besteht darin, lange Reasoning-Traces zu den schwierigsten Mathematik-, Logik- und abstrakten Denkproblemen zu erzeugen und als Bewerter zu fungieren, der frei formulierte Antworten benotet. Es wird unter der kommerziell freundlichen Lizenz OpenMDW-1.1 mit den offengelegten Post-Training-Daten ausgeliefert und weist null Benchmark-Zahlen auf – NVIDIA verweist stattdessen auf ein Genauigkeitsdiagramm und den technischen Bericht zu Ultra. Seine Kunden sind Distillationsläufe, nicht Produktionsverkehr.

Qwen3.8 Max, das erste offene Flaggschiff der Max-Klasse

Alibabas Veröffentlichung ist bedeutsam, weil Qwen-Modelle der Max-Klasse bisher nur über die API verfügbar waren. Qwen3.8 Max bricht damit: Die Gewichte sind herunterladbar, und das Modell ist wirklich Spitzenklasse – Artificial Analysis vergibt einen Intelligenz-Index von 58 und einen Agentic Index von 58, womit es in agentischen Umgebungen mit den besten geschlossenen Generalisten gleichzieht. Die vom Anbieter gemeldeten Highlights sind stark: 93,0 bei PaperBench (vor GPT-5.6 Sol und Fable 5), 92,6 bei GPQA Diamond, 86,1 bei OSWorld-Verified. Seine Schwachstellen sind ebenso real – 67,7 bei SWE-bench Pro und 43,6 bei Humanity's Last Exam hinken den Spitzenreitern hinterher, und unabhängige Tests ergaben, dass es pro abgeschlossener Aufgabe teuer ist, mit durchschnittlich 64 Turns pro Aufgabe bei agentischen Läufen. In Alibabas API kostet es 2,00 $ pro Million Input-Tokens, 6,00 $ pro Million Output-Tokens und 0,25 $ pro Million gecachter Input-Tokens, ein Preisnachlass von 20 % gegenüber dem Vorschau-Preis.

Der Lehrer: Trainingsinfrastruktur mit einer Modellkarte

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning tritt bei keiner dieser Zahlen an, da es keine veröffentlicht hat. Stattdessen bietet es dieselbe Hybridarchitektur aus LatentMoE Mamba-2 + Transformer wie der Ultra-Student, einen Kontext von bis zu 1 Million Token und einen Reasoning-Regler – enable_thinking true/false, einen medium_effort-Modus und eine feste Obergrenze für das reasoning_budget –, den eine Distillations-Pipeline benötigt, um bei schwierigen Samples tiefgehendes Reasoning aufzuwenden und es bei einfachen zu überspringen. Als Mindesthardware werden 4×B200 (oder 8×H100) benötigt, das Serving erfolgt über vLLM, SGLang oder TensorRT-LLM, und der Checkpoint ist ein Download von 1,12 Terabyte. Das Modell wird von keinem Inferenzanbieter bereitgestellt, und NVIDIA hat kein NIM-Hosting angekündigt. Dies ist eine reine Weights-Veröffentlichung, die sich an Labore richtet, die bereits große GPU-Flotten betreiben.

Technische Daten im Vergleich

• Zweck — Teacher: Spezialist für Reasoning zur Trainingszeit und Bewerter. Qwen3.8 Max: einsatzbares Flaggschiff an der Technologiefront.

• Scale — Teacher: 550B gesamt / 55B aktiv, LatentMoE mit MTP. Qwen3.8 Max: 2.4T gesamt / ~95B aktiv, 512 Experten, Qwen3.5 hybrid.

• Kontext — Teacher: bis zu 1M Token, standardmäßig 256K. Qwen3.8 Max: 262K nativer Open-Weights-Kontext, über 1M hinaus erweiterbar; API-Version standardmäßig 1M.

• Gewichte — Lehrer: OpenMDW-1.1, veröffentlicht am 14. August 2026. Qwen3.8 Max: Qwen3.8 Max-Lizenz, veröffentlicht am ~12. August 2026.

• Unabhängige Belege — Lehrer: noch keine. Qwen3.8 Max: AA Intelligence Index 58, Agentic Index 58, Coding Index 71.8.

• Denken — Teacher: enable_thinking-Umschalter, medium_effort, Obergrenze für reasoning_budget. Qwen3.8 Max: muss in Open Weights eingeschaltet sein, kann nicht deaktiviert werden.

• Preis — Teacher: kein Listenpreis, Capex für Selbsthosting. Qwen3.8 Max: 2,00 $ / 6,00 $ pro Million Tokens, 0,25 $ für gecachte Eingaben.

A two-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max. Left column (Nemotron Teacher): training-time reasoning teacher, 55B active (550B total), up to 1M context, OpenMDW-1.1 weights, no independent score yet, self-hosted capex. Right column (Qwen3.8-Max): deployable frontier, 95B active (2.4T total), 262K native context extendable past 1M, Qwen3.8-Max License weights, AA Intelligence Index 58, $2.00/$6.00 per million tokens. Footer notes Qwen figures per Alibaba (vendor-reported) + Artificial Analysis and teacher specs unaudited. OrcaRouter logo composited bottom-right.A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP, up to 1M token context, 10 languages, the OpenMDW-1.1 license tag, and the files and versions listing.

Die Beweis-Asymmetrie ist die ganze Geschichte.

Qwen3.8 Max wurde getestet; das Teacher-Modell nicht. Das liegt teils am Alter – Qwen3.8 Max startete am 3. August und hat bereits zwei Wochen Leaderboard-Läufe hinter sich, während das Teacher-Modell gestern erschien – und teils an der Absicht, denn die Modellkarte des Teachers war nie dafür gedacht, bei den Scores zu konkurrieren. Aber die Asymmetrie hat eine reale Konsequenz für den Vergleich: Jede konkrete Zahl auf dieser Seite mit zugeordneter Quelle gehört zu Qwen3.8 Max, und jede Zahl, die dem Teacher zugeordnet ist, ist eine Architekturspezifikation. Die Reasoning-Qualität des Teachers ist von niemandem außerhalb von NVIDIA verifiziert, und seine Werte auf Familienebene (die vom Anbieter gemeldeten Ergebnisse des Ultra-Studenten: SWE-Bench Verified 71,9, MMLU-Pro 86,8, LiveCodeBench v6 89,0) beschreiben ein anderes Modell. Wer eine Entscheidung darauf stützt, „welches Modell besser abschneidet“, muss auf unabhängige Läufe des Teachers warten – genau diese Lücke sollten die nächsten Wochen schließen.

Zwei Denkregler, unterschiedlich eingestellt

Der interessanteste technische Kontrast zwischen diesen beiden Releases ist, was passiert, wenn man sie zum Denken auffordert. Qwen3.8 Max hat in seiner Open-Weight-Form keine Wahl: Das Denken ist immer eingeschaltet, und die Reasoning-Trace ist Teil jeder Antwort. Das ist großartig für die Antwortqualität und Transparenz, aber teuer bei der Massengenerierung. Das Lehrer-Modell behandelt Reasoning wie einen Regler: enable_thinking schaltet es um, medium_effort drosselt es, und eine reasoning_budget-Obergrenze setzt ihm ein Limit. Für eine Destillationspipeline ist der Unterschied entscheidend — das Generieren von Millionen von Reasoning-Traces mit einem Modell, dessen Denken ständig eingeschaltet ist, vervielfacht Ihre Token-Rechnung, während der Regler des Lehrer-Modells es Ihnen ermöglicht, nur dort für tiefes Reasoning zu zahlen, wo ein schwieriges Beispiel das verlangt. Dies sind keine konkurrierenden Designphilosophien; es sind zwei Werkzeuge, die für entgegengesetzte Enden desselben Problems optimiert sind, und jedes ist das richtige Werkzeug für seinen Zweck.

A screenshot of the OrcaRouter model page for Qwen3.8-Max (Qwen) showing the model header, the qwen/qwen3.8-max slug, and the pricing, performance, and public-benchmarks tabs.

Das Fazit

Wenn Sie ein Frontier-Modell auf Ihrer eigenen Hardware ausführen möchten — oder eines zu einem vernünftigen Preis aufrufen möchten — ist Qwen3.8 Max das Release, das zählt, und es ist über OrcaRouter zum Listenpreis von Alibaba verfügbar, ohne Aufschlag durchgereicht, sodass die Preissenkung, die Alibaba beim Launch angekündigt hat, bei uns am selben Tag live ist. Wenn Sie ein Reasoning-Modell trainieren oder destillieren möchten — oder das Signal prüfen möchten, das Nemotron 3 Ultra geprägt hat — ist NVIDIA-Nemotron-Labs-Teacher-General-Reasoning das Release, das zählt, und es ist derzeit nur selbst gehostet erhältlich. Die größere Geschichte ist, dass beide in derselben Woche gelandet sind: Offene Gewichte sind gerade von „offen genug zum Anschauen“ zu „offen genug, um darauf aufzubauen“ übergegangen, an zwei verschiedenen Punkten der Modell-Lieferkette. Teams, die ihre Modellebene hinter einer Schnittstelle austauschbar halten — selbst gehostetes Training auf der einen Seite, verwaltete Frontier-Inferenz auf der anderen — sind in der Position, beide zu nutzen.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert