比較記事『{{1}}NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max{{/1}}』用のヒーロータイトルカード。見出しは『{{2}}オープンウェイトが本気になった週{{/2}}』で、左側に{{3}}開封ボックスの学位帽アイコン{{/3}}、右側に{{4}}地球とチップのアイコン{{/4}}、{{5}}MODEL COMPARISONバッジ{{/5}}、右下には{{6}}OrcaRouterロゴ{{/6}}が合成されている。
Guides & Insights

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max:オープンウェイトが本気になった週

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

オープンウェイト界は波乱万丈の一週間を過ごした。2026年8月12日頃、Alibabaが初のオープンウェイトMaxクラスモデル、Qwen3.8 Maxをリリースした。2.4兆パラメータのフラッグシップモデルで、Qwen3.8-2.4T-A95BとしてHugging FaceとModelScopeで公開されている。その2日後の8月14日、NVIDIAはNVIDIA-Nemotron-Labs-Teacher-General-Reasoningを同じくHugging Faceで公開した。これはNemotron 3 Ultraトレーニングパイプラインに由来する550Bパラメータ・55Bアクティブの推論教師モデルだ。どちらもフロンティア研究所が公開したばかりの巨大なチェックポイントであり、類似点はそれだけである。Qwen3.8 Maxはフロンティアモデルを自分で実行できるように公開され、NVIDIA-Nemotron-Labs-Teacher-General-Reasoningはそれを用いてトレーニングできるように公開されている。両者を比較することは、自分たちがどのようなチームなのかを問うことにほかならない。しかし、両者が72時間以内に登場したという事実は、業界の向かう先を示すシグナルだ。

各リリースに実際に含まれるもの

Qwen3.8 Maxはデプロイ可能なモデルです。これはスパース混合エキスパート(MoE)モデルで、総パラメータ数2.4兆、512エキスパート構成でトークンごとに約950億パラメータがアクティブになり、Qwen3.5ファミリーのハイブリッドアーキテクチャを基盤としています。オープンウェイト版はテキストのみ対応で、ネイティブコンテキストは262Kトークン(100万トークン以上に拡張可能)です。特筆すべき点として、思考(thinking)が必須です。モデルは<think>タグの間に推論コンテンツを出力し、これを無効化することはできません。Alibabaが8月3日に公開したホステッドAPI版では、画像・動画入力、デフォルトの100万トークンコンテキスト、オプションの思考が追加されています。オープンウェイトのライセンスはカスタムのQwen3.8 Max Licenseで、寛容(パーミッシブ)ですが、非常に大規模な商用展開には収益ベースの条件が付きます。マルチノードのハードウェアをお持ちなら、フロンティアクラスのモデルを自社インフラ上で実行できます。

NVIDIA-Nemotron-Labs-Teacher-General-Reasoningはトレーニング時に使用するモデルです。これは、Nemotron 3 Ultraを支えるMulti-Teacher On-Policy Distillation(MOPD)レシピに含まれる10以上のドメイン特化型ティーチャーの1つであり、ポストトレーニング済みのUltra学生モデルから、推論特化の追加SFTと強化学習の段階を経て派生したものです。このパイプラインにおける役割は、最も難しい数学・論理・抽象的推論の問題に対して長い推論トレースを生成し、自由形式の回答を採点するジャッジとして機能することです。これは、開示されたポストトレーニングデータとともに、商用利用に適したOpenMDW-1.1ライセンスで提供され、ベンチマーク数値は一切付属していません。NVIDIAはその代わりに、精度プロットとUltraのテクニカルレポートを参照するよう案内しています。その利用者は、本番トラフィックではなく、蒸留(ディスティレーション)の実行です。

Qwen3.8 Max、初のオープンMax級フラッグシップ

Alibabaのリリースが重要なのは、MaxクラスのQwe​nモデルがこれまでAPI専用だったためだ。Qwen3.8 Maxはその状況を変える。重みはダウンロード可能で、モデルは確かに最先端である。Artificial Analysisは知能指数58、エージェント指数58を付与しており、エージェント環境ではトップのクローズド汎用モデルと肩を並べる。ベンダーが報告するハイライトも強力だ。PaperBenchで93.0(GPT-5.6 SolとFable 5を上回る)、GPQA Diamondで92.6、OSWorld-Verifiedで86.1。弱点もまた現実的だ。SWE-bench Proでは67.7、Humanity's Last Examでは43.6とリーダーに及ばず、独立したテストでは、完了したタスク1件あたりのコストが高く、エージェント実行ではタスクあたり平均64ターンを要することが判明している。AlibabaのAPIでは、入力トークン100万個あたり2.00ドル、出力トークン100万個あたり6.00ドル、キャッシュ入力トークン100万個あたり0.25ドルで、プレビュー価格から20%引きとなる。

教師:モデルカード付きトレーニングインフラストラクチャ

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning は、これらの数値のいずれにおいても競合していません。というのも、数値を一切公開していないからです。その代わりに提供されるのは、Ultra 学生モデルと同じ LatentMoE Mamba-2 + Transformer ハイブリッドアーキテクチャ、最大 100 万トークンのコンテキスト、そして推論ダイヤル — enable_thinking true/false、medium_effort モード、hard reasoning_budget 上限 — です。これは、蒸留パイプラインが難しいサンプルには深い推論を費やし、簡単なサンプルではそれを省略するために必要とするものです。最小ハードウェア要件は 4×B200(または 8×H100)で、vLLM、SGLang、TensorRT-LLM を介したサービングに対応し、チェックポイントのダウンロードサイズは 1.12 テラバイトです。このモデルはいかなる推論プロバイダーでもデプロイされておらず、NVIDIA も NIM ホスティングを発表していません。これは、すでに大規模な GPU フリートを運用しているラボを対象とした、ウェイトのみのリリースです。

Specs, side by side

• 目的 — 教師:トレーニング時の推論スペシャリスト兼審判。Qwen3.8 Max:デプロイ可能なフロンティア旗艦モデル。

• 規模 — Teacher: 合計550B / アクティブ55B、MTP付きLatentMoE。Qwen3.8 Max: 合計2.4T / アクティブ約95B、512エキスパート、Qwen3.5ハイブリッド。

• コンテキスト — Teacher:最大100万トークン、デフォルトは256K。Qwen3.8 Max:ネイティブのオープンウェイトコンテキストは262Kで、100万を超えて拡張可能。API版はデフォルトで100万。

• 重み — 教師: OpenMDW-1.1(2026年8月14日リリース)。Qwen3.8 Max: Qwen3.8 Max License(2026年8月12日頃リリース)。

• 独立した証拠 — 教師:まだなし。Qwen3.8 Max: AA Intelligence Index 58、Agentic Index 58、Coding Index 71.8。

• 思考 — Teacher: enable_thinkingトグル、medium_effort、reasoning_budget上限。Qwen3.8 Max: オープンウェイトでは常時オンが必須で、無効化できません。

• 価格 — Teacher:定価なし、セルフホストは設備投資(CAPEX)。Qwen3.8 Max:100万トークンあたり$2.00/$6.00、キャッシュ入力は$0.25。

A two-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max. Left column (Nemotron Teacher): training-time reasoning teacher, 55B active (550B total), up to 1M context, OpenMDW-1.1 weights, no independent score yet, self-hosted capex. Right column (Qwen3.8-Max): deployable frontier, 95B active (2.4T total), 262K native context extendable past 1M, Qwen3.8-Max License weights, AA Intelligence Index 58, $2.00/$6.00 per million tokens. Footer notes Qwen figures per Alibaba (vendor-reported) + Artificial Analysis and teacher specs unaudited. OrcaRouter logo composited bottom-right.A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP, up to 1M token context, 10 languages, the OpenMDW-1.1 license tag, and the files and versions listing.

証拠の非対称性こそがすべてだ。

Qwen3.8 Max はテスト済みだが、教師モデルはまだテストされていない。それは、一部は発表時期によるものだ。Qwen3.8 Max は8月3日にリリースされ、2週間リーダーボードに載っているが、教師モデルは昨日リリースされたばかりである。また一部は意図によるもので、教師モデルのカードはそもそもスコアで競うことを目的としていなかった。しかし、この非対称性は比較に現実的な影響を与える。このページにあるソース付きの具体的な数字はすべて Qwen3.8 Max に関するものであり、教師モデルに関する数字はすべてアーキテクチャ仕様である。教師モデルの推論品質は NVIDIA 外部の誰によっても検証されておらず、そのファミリーレベルの数値(Ultra 生徒モデルのベンダー報告による SWE-Bench Verified 71.9、MMLU-Pro 86.8、LiveCodeBench v6 89.0)は別のモデルを表している。「どちらのスコアが良いか」に基づいて判断を下そうとする人は誰でも、教師モデルの独立した実行結果を待たなければならない。それはまさに、今後数週間で埋められるべきギャップである。

二つの思考ダイヤル、それぞれ異なる設定

The most interesting technical contrast between these two releases is what happens when you ask them to reason. Qwen3.8 Max in its open-weights form has no choice: thinking is always on, and the reasoning trace is part of every answer. That is great for answer quality and transparency and expensive for bulk generation. The teacher treats reasoning as a dial: enable_thinking flips it, medium_effort throttles it, and a reasoning_budget ceiling caps it. For a distillation pipeline the difference is decisive — generating millions of reasoning traces with an always-on-thinking model multiplies your token bill, while the teacher's switch lets you pay for deep reasoning only where a hard sample demands it. These are not competing design philosophies; they are two tools optimized for opposite ends of the same problem, and each is the right tool for its end.

A screenshot of the OrcaRouter model page for Qwen3.8-Max (Qwen) showing the model header, the qwen/qwen3.8-max slug, and the pricing, performance, and public-benchmarks tabs.

結論

自前のハードウェアでフロンティアモデルを実行したい場合——あるいはリーズナブルな価格で呼び出したい場合——注目すべきリリースはQwen3.8 Maxです。OrcaRouterではAlibabaの定価のまま、マークアップ0%で提供されており、Alibabaが発表時に打ち出した値下げは、その日のうちに当社側でも有効になります。推論モデルをトレーニングまたは蒸留したい場合——あるいはNemotron 3 Ultraを形作ったシグナルを監査したい場合——注目すべきリリースはNVIDIA-Nemotron-Labs-Teacher-General-Reasoningで、現時点ではセルフホスト専用です。より大きな話題は、両方が同じ週に登場したことです。オープンウェイトはちょうど「眺めるには十分にオープン」から「構築するには十分にオープン」へと、モデル供給チェーンの異なる2つの地点で移行しました。モデル層を単一のインターフェースの背後で交換可能に保つチーム——一方にセルフホストのトレーニング、もう一方にマネージドなフロンティア推論——こそが、両方を活用できる立場にあります。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新