
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning 對決 Qwen3.8-Max:開放權重認真起來的那一週
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 114 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 367 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
開放權重模型剛度過了精彩的一週。大約在 2026 年 8 月 12 日,阿里巴巴發布了史上首個開源權重的 Max 級別 Qwen——Qwen3.8 Max,這是一款擁有 2.4 兆參數的旗艦模型,以 Qwen3.8-2.4T-A95B 的名稱發布在 Hugging Face 和 ModelScope 上。兩天後,也就是 8 月 14 日,NVIDIA 也在 Hugging Face 上發布了 NVIDIA-Nemotron-Labs-Teacher-General-Reasoning,這是來自 Nemotron 3 Ultra 訓練管線的一個 550B 參數、55B 活躍參數的推理教師模型。兩者都是來自前沿實驗室的巨大且全新開放的檢查點,但它們的相似之處僅止於此。Qwen3.8 Max 的開放是為了讓你自行運行前沿模型;NVIDIA-Nemotron-Labs-Teacher-General-Reasoning 的開放則是為了讓你能用它來訓練。比較這兩者,其實是在問你屬於哪一種團隊——但兩者都在 72 小時內登場,這個事實本身就透露了產業未來的走向。
每個版本實際包含的內容
Qwen3.8 Max 是可部署的版本。它是一個稀疏混合專家模型,總參數達 2.4 兆,在 512 個專家之間每個 token 約啟動 950 億參數,基於 Qwen3.5 系列的混合架構打造。在開放權重形式下,它僅支援文字,原生上下文長度為 262K token(可擴展至 1M 以上),而且——值得注意的是——必須進行思考:模型會在 `<think>` 標籤之間輸出推理內容,且無法關閉。阿里巴巴於 8 月 3 日推出的託管 API 版本新增了圖片和影片輸入、預設 1M 上下文,以及可選的思考功能。開放權重的授權是客製化的 Qwen3.8 Max License,雖然寬鬆,但對超大規模商業部署設有基於營收的條件。如果你擁有跨節點硬體,就可以在自己的基礎設施上運行前沿級模型。
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning 是訓練時期的模型。它是 Nemotron 3 Ultra 背後「多教師同策略蒸餾」(MOPD)配方中十多位領域專精教師之一,源自後訓練的 Ultra 學生模型,再經額外的推理專精 SFT 與強化學習階段而產生。它在該流程中的角色是為最困難的數學、邏輯與抽象推理問題生成長篇推理軌跡,並擔任評分自由形式答案的評判者。它以商業友善的 OpenMDW-1.1 授權條款發布,並附上已公開的後訓練資料,而且未附帶任何基準測試數字——NVIDIA 改為指向準確度圖表與 Ultra 技術報告。它的客戶是蒸餾運行,而非生產流量。
Qwen3.8 Max,首款開源 Max 級旗艦
阿里巴巴發布 Max 級 Qwen 模型之所以重要,是因為以往這類模型僅提供 API。Qwen3.8 Max 打破了這個局面:權重可下載,而且模型確實達到前沿水準——Artificial Analysis 給它的 Intelligence Index 為 58,Agentic Index 也為 58,在代理式(agentic)設定下與頂尖封閉通用模型並駕齊驅。其供應商公布的亮眼成績包括:PaperBench 93.0(領先 GPT-5.6 Sol 與 Fable 5)、GPQA Diamond 92.6、OSWorld-Verified 86.1。其弱點也同樣實際存在——SWE-bench Pro 67.7 與 Humanity's Last Exam 43.6 落後領先者;獨立測試也發現它每完成一項任務的成本偏高,在代理式執行中平均每項任務需 64 回合。在阿里巴巴的 API 上,定價為每百萬輸入 token 2.00 美元、每百萬輸出 token 6.00 美元、每百萬快取輸入 token 0.25 美元,較其預覽定價調降 20%。
教師:配備模型卡的訓練基礎設施
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning 並未參與這些數字的競爭,因為它沒有發布任何數據。它所提供的,是與 Ultra 學生模型相同的 LatentMoE Mamba-2 + Transformer 混合架構、最高 1M token 的上下文長度,以及一個推理調節器——enable_thinking true/false、medium_effort 模式,以及 hard reasoning_budget 上限——這是蒸餾流程在困難樣本上投入深度推理、在簡單樣本上跳過推理時所需要的。最低硬體需求為 4×B200(或 8×H100),可透過 vLLM、SGLang 或 TensorRT-LLM 提供服務,而 checkpoint 的下載大小為 1.12 TB。目前沒有任何推理供應商部署它,NVIDIA 也未宣布 NIM 託管。這是一次僅釋出權重的發布,目標對象是已經運行大規模 GPU 機群的實驗室。
規格,並排比較
• 用途 — Teacher:訓練時的推理專家與裁判。Qwen3.8 Max:可部署的前沿旗艦。
• 規模 — 教師模型:總計 550B / 啟用 55B,採用 MTP 的 LatentMoE。Qwen3.8 Max:總計 2.4T / 約 95B 啟用,512 個專家,Qwen3.5 混合模型。
• 上下文 — Teacher:最高1M tokens,預設256K。Qwen3.8 Max:262K原生開放權重上下文,可擴展超過1M;API版本預設1M。
• 權重 — 教師:OpenMDW-1.1,2026 年 8 月 14 日發布。Qwen3.8 Max:Qwen3.8 Max License,約 2026 年 8 月 12 日發布。
• 獨立證據 — 教師:尚無。Qwen3.8 Max:AA 智慧指數 58,智能體指數 58,編碼指數 71.8。
• 思考 — 教師:enable_thinking 開關、medium_effort、reasoning_budget 上限。Qwen3.8 Max:在開放權重中必須開啟,無法停用。
• 價格 — Teacher:無定價,採用自架資本支出模式。Qwen3.8 Max:每百萬個代幣 $2.00 / $6.00,快取輸入 $0.25。


證據不對稱就是全部重點。
Qwen3.8 Max 已通過測試;教師模型則尚未。這部分源於時間差——Qwen3.8 Max 於8月3日發布,已有兩週的排行榜評測記錄,而教師模型昨日才推出——部分也是刻意為之,因為教師模型的卡片從未打算在分數上一較高下。但這種不對稱對比較結果有實質影響:本頁面上所有標註來源的具體數字都屬於 Qwen3.8 Max,而所有掛在教師模型名下的數字都是架構規格。教師模型的推理品質尚未經過 NVIDIA 以外任何人的驗證,其家族級數據(Ultra 學生模型廠商回報的 SWE-Bench Verified 71.9、MMLU-Pro 86.8、LiveCodeBench v6 89.0)描述的則是另一款模型。任何想依據「誰分數更高」來做決策的人,都必須等待教師模型的獨立評測——而這正是接下來幾週應補上的缺口。
兩個思考撥盤,設定不同
這兩個版本之間最有趣的技術對比,在於你要求它們推理時會發生什麼事。Qwen3.8 Max 以開放權重形式推出時別無選擇:思考永遠開啟,每次回答都包含推理軌跡。這對答案品質和透明度來說很好,但對批量生成來說成本高昂。教師模型則把推理當成一個旋鈕:enable_thinking 切換開關,medium_effort 調節強度,reasoning_budget 設定上限。對於蒸餾管線來說,這個差異是決定性的——用永遠開啟思考的模型生成數百萬條推理軌跡,會讓你的 token 帳單成倍增加;而教師模型的開關讓你可以只在困難樣本要求時,才為深度推理付費。這不是互相競爭的設計哲學;而是針對同一問題兩端分別最佳化的兩種工具,各自在其對應的一端都是正確的選擇。

最重要的是
如果你想在自己的硬體上運行前沿模型——或者想以合理價格呼叫一個——Qwen3.8 Max 就是關鍵的發布版本:它已在 OrcaRouter 上以阿里巴巴的定價上架,並以 0% 加成原價轉發,因此阿里巴巴在發表時宣布的降價,在我們這邊當天同步生效。如果你想訓練或蒸餾推理模型——或者想檢視形塑 Nemotron 3 Ultra 的訊號——NVIDIA-Nemotron-Labs-Teacher-General-Reasoning 就是關鍵的發布版本,目前僅限自架部署。更大的重點是,兩者在同一週落地:開放權重剛從「開放得足以觀看」推進到「開放得足以建構」,而且分別落在模型供應鏈的兩個不同環節。那些讓模型層在單一介面背後保持可替換的團隊——一端是自架訓練,另一端是託管式前沿推論——才有條件同時運用兩者。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
