
Qwen3.8-Max 对比 Qwen 3.8:同一个 2.4T 核心,租用还是本地运行——0902 刷新之后
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026年9月2日,阿里巴巴发布了Qwen3.8-Max的一个带日期标注的更新版本——该构建被它固定为Qwen3.8-Max-0902——而同一周,一个独立的编程能力排行榜把这版新快照排在了第一。这个同为2.4万亿参数核心的可下载版本——也就是大多数人写不带后缀的“Qwen 3.8”时所指的那个模型——仍停留在8月12日的检查点:纯文本、推理强制开启,而且距离在小于一台GPU机架的任何设备上运行还差数百GB。托管旗舰版与开放权重之间的这种差距在8月并不存在。现在它成了比较的全部,也正是同一个模型会一直以两个名字卖给你的原因。
Qwen3.8-Max 是 Alibaba 的托管旗舰产品:一个 2.4 万亿参数的稀疏混合专家模型,每个 token 大约激活 950 亿参数;自 8 月 3 日起通过付费 API 提供,并支持 100 万 token 的多模态上下文窗口。作为独立名称,Qwen 3.8 是同一代的开源版本——其中影响最大的是 Qwen3.8-2.4T-A95B,即 Alibaba 于 8 月 12 日以自定义许可证发布的权重。它们并不是“廉价版”和“高级版”的关系,而是同一个大脑以两种方式出售。九月份的一轮后训练已开始把这两种交付方式拉开差距。这篇文章将厘清你实际看到的是哪一个“Qwen 3.8”、0902 刷新改变了什么,以及你今天应该选择哪条路线——租用 API 还是运行权重。
并非对手关系的配对
在讨论日期和费率卡之前,先讲架构:Qwen3.8-Max 与 Qwen3.8-2.4T-A95B 共享细粒度 MoE 设计——每层 512 个专家(每层含 10 个路由专家和 1 个共享专家),共 92 层,并采用混合堆栈:其中 69 层使用线性注意力(Gated DeltaNet 结合门控注意力),穿插全注意力以支持长上下文任务。这就是为什么模型卡能够宣称 API 支持百万 token 上下文,也是为什么开源版本原生支持 262K,并能在正确的服务配置下向百万扩展。这两个名称之间的差异不在权重架构上,而在边缘之处;自 9 月 2 日以来,这些边缘已经发生了变化。
• 参数 — Qwen3.8-Max:总参数2.4T / 约95B激活,MoE。Qwen3.8-2.4T-A95B:相同核心,相同激活数。
• 交付 — Qwen3.8-Max:托管 API,自8月3日起上线,9月2日更新为 Qwen3.8-Max-0902。Qwen3.8-2.4T-A95B:可下载权重,首次发布于8月12日,此后无更新检查点。
• 模态 — {{1}}Qwen3.8-Max{{/1}}:支持文本、图像和视频输入。{{2}}Qwen3.8-2.4T-A95B{{/2}}:仅支持文本。
• 推理控制 — Qwen3.8-Max:思考切换,包括非思考模式。Qwen3.8-2.4T-A95B:思考始终开启,仅提供推理强度调节(低 / 高 / 特高)。
• 工具支持 — Qwen3.8-Max:支持原生函数调用、五种内置工具和结构化输出。Qwen3.8-2.4T-A95B:没有原生工具层;其能力取决于你用来部署它的推理框架。
9月2日更新改变了什么
0902 版本属于后训练阶段的一次调优,并非新架构。阿里巴巴将其对准了 Qwen3.8-Max 原本就为人熟知的两大方向——编码,以及其称为“cowork”的长期智能体与办公类工作——而围绕该版本出现的数据,正是这次更新意义重大的原因。在独立的 Code Arena: WebDev 排行榜上,Qwen3.8-Max-0902 首次亮相即取得 1691 Elo,比上一版本高出 22 分,足以在入场时就拿下第一。阿里巴巴还将该版本描述为这一榜单成本-性能帕累托前沿上得分最高的模型,混合费率约为每百万 token 5 美元——即把 2 美元与 6 美元两档标价按输出密集的智能体流量加权后得出的价格,大约是调用同类前沿模型在其他平台所需成本的四分之一。这些数据的性质需要读者分清:1691 Elo 是独立竞技场的结果;而帕累托前沿的表述,则是阿里巴巴自己对该独立榜单的定性。
阿里巴巴针对 0902 版本的内部评估(由供应商报告、未经过复现)显示出同样的趋势:Terminal-Bench 3.0 从 11.3 升至 29.0,ProgramBench 从 10.5 升至 28.0,JobBench 从 53.4 升至 64.0,WorkArena Elo 从 1,348 升至 1,468。应将这些数据理解为“此次更新推动了智能体与编码维度的提升”,而非经过验证的分数。在通用智能方面,Artificial Analysis 的智能指数显示 Qwen3.8-Max 为 56——具有竞争力,但并非选择它的理由;编码与智能体的结果才是。
大多数报道忽略的一点是,截至本文撰写时,0902 后训练仅限 API 使用。阿里巴巴尚未发布更新模型的开源检查点——Hugging Face 上的 Qwen3.8-2.4T-A95B 权重仍可追溯到 8 月 12 日的版本。这意味着托管的 Qwen3.8-Max 与可下载的核心版本已不再像 8 月中旬那样是同一个模型。API 拥有 9 月的后训练版本,而权重没有。如果你运行开源版本的全部原因是为了精确复现旗舰模型的行为,那么这一假设已在 9 月 2 日悄然失效。

他们真正产生分歧的五个方面
暂时抛开共享架构不谈,实际差异一目了然。第一个筛选维度是模态:如果你的工作负载包含图像或视频——截图、图表、带图形的文档、视频帧——只有 Qwen3.8-Max 能处理它们,而且它的 100 万 token 上下文窗口是原生的,而非扩展而来。开放权重版本仅支持文本。第二个是推理控制:托管 API 可以关闭思维链运行,这对于延迟敏感和大规模提取场景至关重要,因为在这些场景中思维链纯属额外开销;而开放构建版本无法将其关闭。第三个是工具:函数调用、五个内置工具和 JSON 模式都是托管产品的一部分,开放构建版本则取决于你的服务层能提供什么。
上下文比规格表所暗示的要更微妙。双方都能达到大约一百万个 token,但托管模型原生就能支持多模态输入做到这一点;而开源版本的原生上下文为 262K,需要在配置中加以扩展,而且扩展窗口中的每一个 token 都是文本。输出上限也有所不同——API 允许最多约 131K 输出 token,开源版本通常也被配置为类似的上限,但开源一侧的实际上限取决于你的服务栈,而不是模型本身。
每条路线的实际费用
这就是两种交付方式完全失去可比性的地方。Qwen3.8-Max 有一个标价:每百万输入 token 2.00 美元,每百万输出 token 6.00 美元,每百万缓存输入 0.25 美元。由于 OrcaRouter 以 0% 加价传递供应商的标价,因此您在这里支付的就是这个价格;而当阿里云调整价格时,新数字会在当天生效。0902 快照被单独固定为 qwen/qwen3.8-max-0902,供想要可复现行为的团队使用——价格相同、能力相同,但使用的是固定检查点,而非滚动模型。在 OrcaRouter 的流量上,Qwen3.8-Max 的 7 天中位首 token 延迟大约为 2–4 秒;而 Artificial Analysis 测得的输出速度约为每秒 45–48 个 token:不算慢,但偏冗长,这就是为什么在该模型上运行智能体任务,尽管费率便宜,却可能消耗惊人的 token 数量。

Qwen3.8-2.4T-A95B 没有标价,因为代价就是你的基础设施。BF16 权重总计约 4.9 TB,即便是官方 FP8 版本也约 2.4 TB,所以这属于机架级硬件:有据可查的最小服务配置也要从约八块 B300 或 GB300 GPU 起步,而完整的 GB300 NVL72 机架是参考部署。激进的量化会改变下限——NVFP4 版本大约只需 1.3 TB,Unsloth 的 1-bit 分层量化能把模型压缩到约 397 GB,这才终于让单台配置充足的节点变得可行——但所有上述路径都假定你以数据中心规模运维 GPU。提供开放检查点的第三方托管商能以低于 Max 的每 token 价格向你出售 token,但你会失去多模态输入、非思考模式、原生工具和 0902 后训练成果,而且那个可下载的检查点本身也还没有任何独立基准测试发布。阿里巴巴自己的模型卡对二者关系直言不讳:它把 Qwen3.8-Max 描述为基于 Qwen3.8-2.4T-A95B 构建的官方版本,在开放核心之上增加了视觉输入、非思考支持、默认 1M 上下文和内置工具。

独立数据与厂商宣称的对比
这里的采购透明度比大多数对比都更重要,因为双方证据的时效性差异很大。Qwen3.8-Max 已有独立评分:0902 构建版本在 Code Arena: WebDev 1,691 中的结果,以及 Artificial Analysis 的 56 分智力指数,都是第三方测量数据;而让帕累托前沿说法具有说服力的定价,则来自已发布的价目表。Qwen3.8-2.4T-A95B 目前还没有这些——阿里巴巴发布的基准表描述的是 Max 级核心,并非对可下载检查点的独立运行,因此这次对比中的开源一方在很大程度上仍属于"供应商声称核心得分如此"。如果你基于能力表现在这两者之间做选择,在第三方实际运行之前,请将开源权重的主要数字视为声明而非事实。
谁应该选择哪个
这一决定源自上述清单。当您需要九月后训练、图像或视频输入、非思考模式、原生工具和结构化输出,或者希望在不搭建基础设施的情况下使用百万级 token 上下文窗口时,请使用托管的 Qwen3.8-Max——尤其是今天的 0902 版本。它代表着编码与智能体方向的前沿地位,而以 $2/$6 的价格和 $0.25 的缓存输入费用来看,就其能力而言,这个定价极具竞争力。
当控制权优先于便利性时,选择 Qwen3.8-2.4T-A95B:你需要将权重部署在自己的硬件或你已运营的提供商上,你想要一个可审计、可复现的固定检查点,或者你的持续用量使每 token 成本成为主导项,并且你准备好运行 2.4T 的 MoE。接受这份权衡清单——纯文本、思考始终开启、无原生工具、尚无 0902 后训练——并核对你所在营收区间的许可条款,因为定制的 Qwen3.8-Max 许可证并非 Apache 2.0,且对大型商业运营者附加了条件。
如果您的负载属于高吞吐量、单GPU或延迟敏感型,那么这两者可能都不是合适的赛道——该系列中拥有270亿参数的姊妹模型Qwen3.8-27B才是为此而生的,并且它在我们单独的Qwen3.8-27B与Qwen3.8-Max对比评测中已另行介绍。
如何在不押上全部筹码的情况下尝试两者
进行这种调用的干净做法是在你自己的提示词上同时运行双方,而这正是路由层证明其价值的地方,而不是事后硬加一个。Qwen3.8-Max 和固定版本快照 Qwen3.8-Max-0902 都位于 OrcaRouter 上同一个 OpenAI 兼容端点之后,因此在滚动旗舰版与可复现检查点之间切换只需更改模型 ID,而无需重新部署。当团队决定将开放权重引入内部时,路由 DSL 可以为自托管的 vLLM 或 SGLang 端点提供前端,该端点服务 Qwen3.8-2.4T-A95B,并将其置于同一调用图中——批量流量导向你自己的部署,高难度提示词和多模态请求分流至托管的 Qwen3.8-Max,并在两者之间实现自动故障切换。以这种方式试用新的检查点只需一次配置更改,而非一次迁移,当这一对比的双方仍在以不同速度演进时,这正是你所需要的。
底线
Qwen3.8-Max 和 Qwen 3.8 并不是两个争夺同一职责的模型。它们是同一个 2.4 万亿参数核心,以租用 API 和可下载权重两种形式交付,而 9 月 2 日的刷新让这两种交付形式变得意义不同。租用 API,你得到的是 0902 后训练版本——它在 Code Arena: WebDev 中夺得领先,此外还具备视觉能力、非思考模式、原生工具链和原生百万 token 上下文窗口,定价为 $2/$6,缓存输入 $0.25。运行开放权重,你得到的则是冻结在 8 月 12 日状态的同一架构——仅文本、推理锁定开启——目前尚无独立评分,而且还要承担数据中心级硬件开销。如果你在意 9 月带来的编码与智能体能力提升,那么今天只有这两个名称中的一个具备这些;如果你更看重可复现的控制力,那么也只有其中一个能被你真正握在手中。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
