Une carte titre hero pour l'article de comparaison « NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max » affichant « La semaine où les poids ouverts sont devenus sérieux », avec une icône de toque de diplômé sur boîte ouverte à gauche, une icône globe-et-puce à droite, un badge COMPARAISON DE MODÈLES et le logo OrcaRouter incrusté en bas à droite.
Guides & Insights

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max : La semaine où les poids ouverts sont devenus sérieux

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La semaine a été riche pour les poids ouverts. Le 12 août 2026 ou aux alentours, Alibaba a publié le premier Qwen de classe Max en poids ouverts — Qwen3.8 Max, un modèle phare de 2,4 billions de paramètres, diffusé sous le nom Qwen3.8-2.4T-A95B sur Hugging Face et ModelScope. Deux jours plus tard, le 14 août, NVIDIA a également publié NVIDIA-Nemotron-Labs-Teacher-General-Reasoning sur Hugging Face : un enseignant en raisonnement de 550 milliards de paramètres, dont 55 milliards actifs, issu du pipeline d’entraînement Nemotron 3 Ultra. Ce sont tous deux d’énormes checkpoints fraîchement ouverts, issus de laboratoires de pointe, mais la ressemblance s’arrête là. Qwen3.8 Max est ouvert pour que vous puissiez exécuter vous-même un modèle de pointe ; NVIDIA-Nemotron-Labs-Teacher-General-Reasoning est ouvert pour que vous puissiez vous entraîner avec. Les comparer revient vraiment à se demander quel genre d’équipe vous êtes — mais le fait que les deux soient arrivés en l’espace de 72 heures est un signal sur la direction que prend l’industrie.

Ce que chaque version contient réellement

{{1}}Qwen3.8 Max est le modèle déployable.{{/1}} Il s'agit d'un modèle à mélange d'experts (mixture-of-experts) à activation éparse avec 2,4 billions de paramètres au total, dont environ 95 milliards actifs par jeton, répartis entre 512 experts, construit sur l'architecture hybride de la famille Qwen3.5. Dans sa version à poids ouverts, il est uniquement textuel, avec un contexte natif de 262 000 jetons (extensible au-delà d'un million), et — fait notable — la réflexion est obligatoire : le modèle génère un contenu de raisonnement entre les balises <think> et ne peut pas être désactivé. La version API hébergée lancée par Alibaba le 3 août ajoute la prise en charge des entrées d'images et de vidéos, un contexte par défaut d'un million de jetons, et une réflexion facultative. La licence des poids ouverts est une licence personnalisée Qwen3.8 Max, permissive mais avec des conditions basées sur les revenus pour les très grands déploiements commerciaux. Si vous disposez du matériel multi-nœuds nécessaire, vous pouvez exécuter un modèle de classe frontière sur votre propre infrastructure.

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning est le modèle de la phase d'entraînement. Il fait partie des plus de dix enseignants spécialisés par domaine issus de la recette Multi-Teacher On-Policy Distillation (MOPD) derrière Nemotron 3 Ultra, dérivé de l'élève Ultra post-entraîné via une étape supplémentaire de SFT spécialisée en raisonnement et d'apprentissage par renforcement. Son rôle dans ce pipeline est de générer de longues traces de raisonnement sur les problèmes les plus difficiles de mathématiques, de logique et de raisonnement abstrait, et de servir de juge qui note les réponses en texte libre. Il est distribué sous la licence OpenMDW-1.1, commercialement compatible, avec les données de post-entraînement divulguées, et il n'affiche aucun chiffre de benchmark — NVIDIA renvoie plutôt à un graphique de précision et au rapport technique d'Ultra. Ses clients sont des exécutions de distillation, pas du trafic de production.

Qwen3.8 Max, le premier vaisseau amiral open de classe Max

La sortie d'Alibaba est importante car les modèles Qwen de classe Max ont historiquement été exclusivement disponibles via API. Qwen3.8 Max change la donne : les poids sont téléchargeables, et le modèle est véritablement à la pointe — Artificial Analysis lui attribue un indice d'intelligence de 58 et un indice agentique de 58, ce qui le place à égalité avec les meilleurs généralistes fermés dans les environnements agentiques. Ses points forts annoncés par le fournisseur sont solides : 93,0 sur PaperBench (devant GPT-5.6 Sol et Fable 5), 92,6 sur GPQA Diamond, 86,1 sur OSWorld-Verified. Ses points faibles sont tout aussi réels — 67,7 sur SWE-bench Pro et 43,6 sur Humanity's Last Exam se situent derrière les leaders, et des tests indépendants l'ont trouvé coûteux par tâche terminée, avec une moyenne de 64 tours par tâche lors des exécutions agentiques. Sur l'API d'Alibaba, il est facturé 2,00 $ par million de jetons d'entrée, 6,00 $ par million de jetons de sortie, et 0,25 $ par million de jetons d'entrée en cache, soit une réduction de 20 % par rapport à son tarif d'aperçu.

L'enseignant : infrastructure d'entraînement avec une fiche de modèle.

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning ne rivalise sur aucun de ces chiffres, car elle n'en a publié aucun. Ce qu'elle propose à la place, c'est la même architecture hybride LatentMoE Mamba-2 + Transformer que le student Ultra, jusqu'à 1 million de jetons de contexte, et un réglage de raisonnement — enable_thinking true/false, un mode medium_effort et un plafond strict de reasoning_budget — dont un pipeline de distillation a besoin pour consacrer un raisonnement approfondi aux échantillons difficiles et s'en passer sur les faciles. Le matériel minimal est de 4×B200 (ou 8×H100), avec un déploiement via vLLM, SGLang ou TensorRT-LLM, et le checkpoint est un téléchargement de 1,12 téraoctet. Il n'est déployé par aucun fournisseur d'inférence, et NVIDIA n'a pas annoncé d'hébergement NIM. Cette publication ne contient que les poids et s'adresse aux laboratoires qui exploitent déjà de grandes flottes de GPU.

Spécifications, côte à côte

• Rôle — Teacher : spécialiste du raisonnement à l'entraînement et juge. Qwen3.8 Max : fleuron de pointe déployable.

• Échelle — Enseignant : 550B au total / 55B actifs, LatentMoE avec MTP. Qwen3.8 Max : 2.4T au total / ~95B actifs, 512 experts, Qwen3.5 hybride.

• Contexte — Teacher : jusqu'à 1M de jetons, 256K par défaut. Qwen3.8 Max : contexte natif de 262K en open-weights, extensible au-delà de 1M ; version API 1M par défaut.

• Poids — Enseignant : OpenMDW-1.1, publié le 14 août 2026. Qwen3.8 Max : Qwen3.8 Max License, publiée le ~12 août 2026.

• Preuves indépendantes — Teacher : aucune pour l'instant. Qwen3.8 Max : AA Intelligence Index 58, Agentic Index 58, Coding Index 71.8.

• Raisonnement — Teacher : interrupteur enable_thinking, medium_effort, plafond du budget de raisonnement. Qwen3.8 Max : obligatoirement activé dans les poids ouverts, ne peut pas être désactivé.

• Prix — Teacher : pas de prix catalogue, capex d'auto-hébergement. Qwen3.8 Max : 2,00 $ / 6,00 $ par million de jetons, 0,25 $ pour l'entrée en cache.

A two-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max. Left column (Nemotron Teacher): training-time reasoning teacher, 55B active (550B total), up to 1M context, OpenMDW-1.1 weights, no independent score yet, self-hosted capex. Right column (Qwen3.8-Max): deployable frontier, 95B active (2.4T total), 262K native context extendable past 1M, Qwen3.8-Max License weights, AA Intelligence Index 58, $2.00/$6.00 per million tokens. Footer notes Qwen figures per Alibaba (vendor-reported) + Artificial Analysis and teacher specs unaudited. OrcaRouter logo composited bottom-right.A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP, up to 1M token context, 10 languages, the OpenMDW-1.1 license tag, and the files and versions listing.

L'asymétrie des preuves est toute l'histoire.

Qwen3.8 Max a été testé ; le professeur ne l'a pas été. C'est en partie une question d'âge — Qwen3.8 Max est sorti le 3 août et a bénéficié de deux semaines de passages au classement, tandis que le professeur a été publié hier — et en partie d'intention, car la fiche du professeur n'a jamais été destinée à rivaliser sur les scores. Mais l'asymétrie a une conséquence réelle pour la comparaison : chaque chiffre concret sur cette page avec une source attachée appartient à Qwen3.8 Max, et chaque chiffre attaché au professeur est une spécification d'architecture. La qualité de raisonnement du professeur n'est vérifiée par personne en dehors de NVIDIA, et ses chiffres au niveau de la famille (le SWE-Bench Verified 71.9 rapporté par le fournisseur pour l'étudiant Ultra, MMLU-Pro 86.8, LiveCodeBench v6 89.0) décrivent un modèle différent. Quiconque fonde sa décision sur « lequel obtient de meilleurs scores » doit attendre des exécutions indépendantes du professeur — ce qui est exactement l'écart que les prochaines semaines devraient combler.

Deux cadrans de réflexion, réglés différemment.

Le contraste technique le plus intéressant entre ces deux versions concerne ce qui se passe lorsqu'on leur demande de raisonner. Qwen3.8 Max, dans sa forme open-weights, n'a pas le choix : la réflexion est toujours activée, et la trace de raisonnement fait partie de chaque réponse. C'est excellent pour la qualité des réponses et la transparence, mais coûteux pour la génération en masse. Le modèle enseignant traite le raisonnement comme un cadran : enable_thinking le bascule, medium_effort le régule, et un plafond reasoning_budget le limite. Pour un pipeline de distillation, la différence est décisive : générer des millions de traces de raisonnement avec un modèle à réflexion toujours activée multiplie votre facture de tokens, tandis que l'interrupteur du modèle enseignant vous permet de ne payer le raisonnement approfondi que là où un échantillon difficile l'exige. Ce ne sont pas des philosophies de conception concurrentes ; ce sont deux outils optimisés pour les deux extrémités opposées d'un même problème, et chacun est le bon outil pour son extrémité.

A screenshot of the OrcaRouter model page for Qwen3.8-Max (Qwen) showing the model header, the qwen/qwen3.8-max slug, and the pricing, performance, and public-benchmarks tabs.

En résumé

Si vous voulez exécuter un modèle de pointe sur votre propre matériel — ou en appeler un à un prix raisonnable — {{1}}Qwen3.8 Max{{/1}} est la version qui compte, et elle est disponible sur {{2}}OrcaRouter{{/2}} au prix catalogue d'Alibaba, répercuté avec une marge de 0 %, si bien que la baisse de prix annoncée par Alibaba au lancement est en vigueur chez nous le jour même. Si vous voulez entraîner ou distiller un modèle de raisonnement — ou auditer le signal qui a façonné Nemotron 3 Ultra — {{3}}NVIDIA-Nemotron-Labs-Teacher-General-Reasoning{{/3}} est la version qui compte, et elle est pour l'instant exclusivement en auto-hébergement. Le plus important, c'est que les deux sont arrivés la même semaine : les poids ouverts viennent de passer de « suffisamment ouverts pour être consultés » à « suffisamment ouverts pour construire dessus », à deux étapes différentes de la chaîne d'approvisionnement des modèles. Les équipes qui gardent leur couche de modèles interchangeable derrière une seule interface — formation auto-hébergée d'un côté, inférence de pointe gérée de l'autre — sont celles qui sont en mesure d'utiliser les deux.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement