用于对比文章《NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max》的主标题卡片,文案为「开源权重开始认真起来的一周」,左侧为打开的学士帽图标,右侧为地球与芯片图标,带有「模型对比」徽章,OrcaRouter 标志合成在右下角。
Guides & Insights

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning 对比 Qwen3.8-Max:开源权重开始认真起来的一周

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

开放权重刚刚经历了一周。大约在2026年8月12日,阿里巴巴发布了史上首个开放权重的Max级Qwen——Qwen3.8 Max,这是一个2.4万亿参数旗舰模型,以Qwen3.8-2.4T-A95B的名称发布在Hugging Face和ModelScope上。两天后的8月14日,NVIDIA在Hugging Face上也发布了NVIDIA-Nemotron-Labs-Teacher-General-Reasoning,这是一个来自Nemotron 3 Ultra训练流程的550B参数、55B激活的推理教师模型。两者都是前沿实验室新近开放的巨型检查点,而相似之处仅此而已。Qwen3.8 Max的开放是为了让你自己运行前沿模型;NVIDIA-Nemotron-Labs-Teacher-General-Reasoning的开放是为了让你用它进行训练。比较它们,实际上是在问你是哪种团队——但这两者都在72小时内落地,这一事实本身就是一个信号,表明行业正在走向何方。

每个发布版本实际包含的内容

Qwen3.8 Max 是可部署的版本。它是一个稀疏混合专家模型,总参数达2.4万亿,每个token约激活950亿参数,分布于512个专家,基于Qwen3.5系列混合架构构建。在其开放权重形式中,它仅支持文本,原生上下文为262K token(可扩展至超过1M),而且——值得注意的是——推理是必需的:模型会在<think>标签之间输出推理内容,且无法关闭。阿里巴巴于8月3日推出的托管API版本增加了图像和视频输入、默认1M上下文以及可选的推理。开放权重许可证是自定义的Qwen3.8 Max许可证,虽然宽松,但对超大规模商业部署设有基于收入的条件。如果你拥有多节点硬件,就可以在自己的基础设施上运行前沿级模型。

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning 是训练时模型。它是 Nemotron 3 Ultra 背后的多教师在线策略蒸馏(MOPD)方案中十余个领域专精教师之一,由后训练的 Ultra 学生模型经过额外的推理专精 SFT 和强化学习阶段派生而来。它在该流程中的角色是:在难度最高的数学、逻辑和抽象推理问题上生成长推理轨迹,并充当对自由形式答案进行评分的裁判。它以对商业友好的 OpenMDW-1.1 许可证发布,并附带已公开的后训练数据;它本身没有任何基准测试数字——NVIDIA 转而引用一张准确率曲线图和 Ultra 技术报告。它的客户是蒸馏运行,而非生产流量。

Qwen3.8 Max,首款开源的Max级旗舰

阿里巴巴此次发布意义重大,因为Max级别的Qwe​n模型历来仅通过API提供。Qwen3.8 Max打破了这一惯例:权重可下载,且该模型确实处于前沿水平——Artificial Analysis给出的智能指数为58,智能体指数为58,在智能体场景中与顶尖闭源通用模型并驾齐驱。其供应商报告的优势指标十分亮眼:PaperBench得分93.0(领先于GPT-5.6 Sol和Fable 5),GPQA Diamond得分92.6,OSWorld-Verified得分86.1。其短板也同样真实存在——SWE-bench Pro得分67.7,Humanity's Last Exam得分43.6,均落后于领先者;独立测试还发现其每完成一项任务成本较高,在智能体运行中平均每项任务需64轮交互。在阿里巴巴的API上,其定价为每百万输入token 2.00美元,每百万输出token 6.00美元,每百万缓存输入token 0.25美元,较预览版定价下调了20%。

教师:配备模型卡的训练基础设施

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning 并未参与这些数字的竞争,因为它没有发布任何相关数据。它提供的反而是与 Ultra 学生模型相同的 LatentMoE Mamba-2 + Transformer 混合架构,支持高达 1M token 的上下文,以及一个推理控制旋钮——enable_thinking true/false、medium_effort 模式,以及 hard reasoning_budget 上限——这是蒸馏流水线所需要的,以便在困难样本上投入深度推理,而在简单样本上跳过推理。最低硬件配置为 4×B200(或 8×H100),通过 vLLM、SGLang 或 TensorRT-LLM 提供服务,检查点文件的下载大小为 1.12 TB。它未被任何推理服务提供商部署,NVIDIA 也未宣布 NIM 托管。这是一次仅发布权重的版本,面向已经运行大规模 GPU 集群的实验室。

规格,并排对比

• 用途——Teacher:训练时推理专家与裁判;Qwen3.8 Max:可部署的前沿旗舰。

• Scale —— Teacher:总参数550B / 激活55B,采用LatentMoE与MTP。Qwen3.8 Max:总参数2.4T / 激活约95B,512个专家,Qwen3.5混合架构。

• 上下文 — Teacher:最多 100 万 token,默认 256K。Qwen3.8 Max:262K 原生开放权重上下文,可扩展至超过 100 万;API 版本默认 100 万。

• 权重 — 教师模型:OpenMDW-1.1,发布于2026年8月14日。Qwen3.8 Max:Qwen3.8 Max许可证,发布于2026年8月12日左右。

• 独立证据 —— 教师:暂无。Qwen3.8 Max:AA 智能指数 58,智能体指数 58,编码指数 71.8。

• 思考 — 教师:enable_thinking 开关,medium_effort,reasoning_budget 上限。Qwen3.8 Max:在开放权重中必须开启,无法禁用。

• 价格 — Teacher:无公开标价,自托管资本支出。Qwen3.8 Max:每百万 tokens 2.00 美元 / 6.00 美元,缓存输入 0.25 美元。

A two-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max. Left column (Nemotron Teacher): training-time reasoning teacher, 55B active (550B total), up to 1M context, OpenMDW-1.1 weights, no independent score yet, self-hosted capex. Right column (Qwen3.8-Max): deployable frontier, 95B active (2.4T total), 262K native context extendable past 1M, Qwen3.8-Max License weights, AA Intelligence Index 58, $2.00/$6.00 per million tokens. Footer notes Qwen figures per Alibaba (vendor-reported) + Artificial Analysis and teacher specs unaudited. OrcaRouter logo composited bottom-right.A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP, up to 1M token context, 10 languages, the OpenMDW-1.1 license tag, and the files and versions listing.

证据不对称就是全部真相。

Qwen3.8 Max 已经过测试,教师模型还没有。这部分是时间问题——Qwen3.8 Max 于 8 月 3 日发布,已经在排行榜上跑了两周,而教师模型昨天才发布——部分也是刻意为之,因为教师模型的模型卡从来就不是为了在分数上竞争。但这种不对称给比较带来了实实在在的后果:本页面上每个附有来源的具体数字都属于 Qwen3.8 Max,而每个与教师模型相关的数字都是架构规格。教师模型的推理质量尚未得到 NVIDIA 以外任何人的验证,其家族级数据(Ultra 学生模型由供应商报告的 SWE-Bench Verified 71.9、MMLU-Pro 86.8、LiveCodeBench v6 89.0)描述的其实是另一个模型。任何想依据“哪个得分更高”来做决定的人,都必须等待对教师模型的独立跑分——而这正是接下来几周应当弥合的缺口。

两个思维刻度盘,设置不同

{{1}}这两个版本之间最有趣的技术对比在于,当你要求它们进行推理时会发生什么。{{/1}}{{2}}Qwen3.8 Max 的开源权重版本别无选择:思考始终开启,推理轨迹是每个答案的一部分。{{/2}}{{3}}这对于答案质量和透明度来说很棒,但对于批量生成来说成本高昂。{{/3}}{{4}}教师模型将推理视为一个旋钮:enable_thinking 切换它,medium_effort 调节它,reasoning_budget 上限为它封顶。{{/4}}{{5}}对于蒸馏流水线来说,这种差异是决定性的——用始终开启思考的模型生成数百万条推理轨迹会使你的 token 账单成倍增加,而教师模型的开关让你只在困难样本需要时才为深度推理付费。{{/5}}{{6}}这并非相互竞争的设计理念;它们是针对同一问题两端分别优化的两种工具,各自都是适合其所在端的正确工具。{{/6}}

A screenshot of the OrcaRouter model page for Qwen3.8-Max (Qwen) showing the model header, the qwen/qwen3.8-max slug, and the pricing, performance, and public-benchmarks tabs.

底线

如果你想在自己的硬件上运行前沿模型——或者以合理的价格调用一个——Qwen3.8 Max 就是那个重要的发布版本,它已经在 OrcaRouter 上以阿里官方定价上线,以 0% 加价直接转发,因此阿里在发布时宣布的降价当天就在我们这边生效。如果你想训练或蒸馏一个推理模型——或者审计塑造 Nemotron 3 Ultra 的信号——NVIDIA-Nemotron-Labs-Teacher-General-Reasoning 就是那个重要的发布版本,目前仅支持自托管。更大的故事在于两者落在同一周:开放权重刚刚从“开放到可以看”变成了“开放到可以构建”,发生在模型供应链的两个不同节点。那些将模型层保持为可通过统一接口替换的团队——一边是自托管训练,另一边是托管式前沿推理——才是能够同时利用两者的团队。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新