
Qwen 4 Max vs Claude Opus 5:在两者脚下发生变化的基准测试
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen 4 Max 于 2026 年 9 月 22 日在杭州云栖大会上预览亮相——它是已宣布但尚未发布的四款 Qwen 4 系列中的旗舰档,没有价格、没有上下文窗口,也没有公布得分。Claude Opus 5 自 2026 年 7 月 24 日起已全面可用,每百万输入 token 5.00 美元,每百万输出 token 25.00 美元;自 Qwen3.8-Max 发布以来,每一款旗舰都以它为对标目标。写这种比较,显而易见的做法是做一张规格表,其中一栏留空。更有用的做法是注意到,2026 年 9 月 19 日,也就是公告发布前三天,Artificial Analysis 重新评分了其 Intelligence Index,Claude Opus 5 不再是位居榜首的模型。这一单一变化重新界定了 Qwen 4 Max 需要超越的对象。
9月19日发生了什么变化
Artificial Analysis 于 2026 年 9 月 19 日发布了索引修订版 v4.3.2。在当前修订版下,Claude Opus 5 在其最高推理强度下于 Intelligence Index 上得分为 51——xhigh 下为 50,high 下为 48,medium 下为 45,low 下为 39——它落后于 Claude Fable 5.1 和 GPT-6 Astra,后两者均为 53。该索引上的每任务成本为 5.86 美元。
如果这读起来像是降级,那并非降级。模型没有变。指数变了。我们自己七月和八月的报道曾引用 Claude Opus 5 为 61 至 63,并称其位居榜首,而在当时生效的修订版本下,那些数字是正确的。任何仍在不注明修订日期的情况下引用它们的人,引用的都是已作废的数字,而这是本月撰写的对比中最常见的一个错误。实际后果是,像“Claude Opus 5 是当前可用的得分最高的模型”这样的说法已不再成立,而建立在它之上的对比也会随之崩塌。
对于 Qwen 这一边,后果还要更为尖锐。2026 年 9 月宣布的一个旗舰层级,所瞄准的目标正是在 2026 年 9 月被重新定义的。无论阿里巴巴最终为 Qwen 4 Max 发布什么,人们都会拿它对照一个排行榜来解读,而在这个排行榜上,需要击败的数字是 53,而不是 63。

坦率地说,这一对比
这张桌子的一面已经完整,另一面则空空如也,假装并非如此,将是本文最大的败笔。以下是我们真正已知的情况:
• 状态 — Claude Opus 5 自 2026 年 7 月 24 日起全面可用,而 Qwen 4 Max 于 2026 年 9 月 22 日发布,但未公布上市日期
• 输入价格 — Claude Opus 5 每100万token $5.00,而Qwen 4 Max未公布
• 输出价格 — Claude Opus 5 每 100 万 tokens 25.00 美元,相比之下 Qwen 4 Max 未公布
• 缓存输入 — Claude Opus 5 缓存读取每 100 万 tokens 收费 0.50 美元,相比之下 Qwen 4 Max 未公布
• 上下文 — Claude Opus 5 在默认和最大设置下均为 1M tokens,而 Qwen 4 Max 未公布
• 输出上限——Claude Opus 5 同步模式下为 128K tokens,在 Batches API 上配合 beta 标头可达 300K,而 Qwen 4 Max 则未公布
• 模态 — Claude Opus 5 支持文本、图像和文件输入,并以文本输出;而 Qwen 4 Max 未公布
• 长上下文定价 — Claude Opus 5 不收取附加费,因此 900,000 个 token 的请求与 9,000 个 token 的请求按相同的每 token 费率计费,相比之下,Qwen 4 Max 未公布。
• 独立评分——Claude Opus 5 在最高努力档位下于 Artificial Analysis Intelligence Index v4.3.2 上得分为 51,而 Qwen 4 Max 则不存在独立评测
• 厂商报告的得分 —— Claude Opus 5 在 SWE-bench Verified 上为 96.0%,SWE-bench Pro 上为 79.2%,OSWorld 2.0 上为 70.6%,Terminal-Bench 2.1 上视测试框架不同在 85% 左右,而 Qwen 4 Max 则未报告任何数据
• 推理控制——Claude Opus 5 的自适应思考默认开启,并配有五级努力程度阶梯;相比之下,Qwen 4 Max 未予公布
十行“未发布”并非修辞手法。这就是证据的现状,而由此得出的诚实结论是:目前任何人都还无法对这两个模型进行能力比较。
缺口无法弥合的部分
定价和背景信息最终会公布。有一个差异在发布后仍会保留,值得现在就做出决定,而不是等到 Qwen 4 Max 出货的那一周:这两款模型的设计购买方式不同。
Claude Opus 5 是来自单一供应商、单一价格的单一闭源模型,并公开承诺不会早于 2027 年 7 月 24 日退役。对于容量规划而言,这是一个稳定的目标。Qwen 4 Max 是一个家族中的旗舰型号,而阿里巴巴已多次以宽得多的价格区间发布该家族的产品——Qwen 3.8 这一代既包含输入价格为 2.00 美元的前沿旗舰,也包含远低于该价位的 Flash 档位——而从历史上看,Qwen 系列中最早被更便宜的档位追平、因而有效生命周期最短的,正是旗舰档位。
另一个区别是开放权重,而它指向的是相反的方向。Qwen 3.8 这一代在其自定义的 Qwen 许可下公布了其最大模型的权重,正是这一点才让微调、量化和自托管成为可能。Claude Opus 5 没有发布权重,将来也不会有。如果你的工作负载需要一个能在你自己的边界内运行、或者可以修改的模型,那这就是阿里巴巴拥有的一项结构性优势,任何基准测试的修订都无法将其夺走——而这也是为什么值得关注这一特定对比,而不是把它当作一个旗舰模型对另一个旗舰模型来对待的最有力理由。

今天如何运行此比较
Claude Opus 5 现已上线,并且OrcaRouter 将其以 anthropic/claude-opus-5 进行路由,采用 Anthropic 的标价、0% 加价——服务商的费率原样传递、分毫未动,因此上面 $5.00 和 $25.00 的数字就是你实际被计费的金额,而不是加价后的等价数字。对于处于这一价格区间的模型来说,这一点比平时更为重要:在 $25.00 的输出费率上,10% 的平台利润率就是每百万 token $2.50,这比大多数开放权重替代方案的整个输入成本还要高。除此之外,该目录还在同一个 OpenAI 兼容端点上提供近 200 个模型,当某个服务商路径变差时可自动故障转移,并提供路由 DSL,让你显式表达策略,而不必把模型名称硬编码进应用程序。
OrcaRouter 并未收录 Qwen 4 Max,也没有任何 Qwen 4 层级。该系列在目录中的条目为零,而对于一款已公布但尚未发布的模型来说,这本就是意料之中的事。当这些层级真正上线时,它们会出现在同一位置;而在那之前,值得与 Claude Opus 5 一较高下的 Qwen 模型,是那个你真正能调用的:Qwen3.8-Max,自 2026 年 8 月 3 日起正式可用,输入每百万 token 2.00 美元、输出每百万 token 6.00 美元,权重已公开,并有记录的独立智能评分为 56、每任务 1.14 美元——该数字是在更早的指数修订版本下记录的,因此将其与 Claude Opus 5 的 51 作比较时,务必附带这一说明。
在模型卡存在之前,该如何处理这个?
这里没有什么定论可下,因为这两个模型里有一个并不是作为产品存在的。可以说的是,比较格局在2026年9月19日发生了变化,而两家厂商都没做任何事:Claude Opus 5 不再是大多数比较所依赖的那个独立指数上得分最高的模型,如今它落后另外两个模型两分。Qwen 4 Max 发布后会落到那张表里,而不是7月的那张。
因此,未来几个月的抉择不是 Qwen 4 Max 对 Claude Opus 5。而是 Claude Opus 5 对已经发布的 Qwen 模型——一个输入价格只有五分之一、权重已公开的旗舰——而且现在就能进行这一比较,双方都有真实数据。等阿里巴巴发布模型卡后再重新审视,并在那之前把任何你看到的 Qwen 4 Max 基准测试表都视为未经证实。

本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
