
Claude Sonnet 5.5 对比 Qwen 4 Max:一个模型有卡片,另一个有名字
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 931 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 192 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
这个标题的两半并不是同一类事物,而这是读者首先需要明白的一点。Claude Sonnet 5.5于2026年9月28日发布:它拥有API标识符、价目表、上下文窗口、公布的退役下限,以及在独立排行榜上的一行排名。Qwen 4 Max于2026年9月22日在杭州云栖大会上作为已公布的四模型Qwen 4系列的旗舰作了预览——而截至今天,它没有价格、没有上下文窗口、没有公布的分数、没有模型卡,在Artificial Analysis上也没有可打开的页面。这并不是什么丑闻;一个层级就是这样被公布的。但它改变了有意义的对比该是什么样子。真正值得做的对比,是在最新发布的Sonnet与你今天实际能调用的Qwen模型之间,也就是Qwen3.8 Max——因为后者有价目表,而这份价目表很能说明问题。
阿里巴巴实际上摆到桌面上的东西
Qwen 4 Max 只是在产品阵容中作为一个名称被展示,而不是作为一款产品。大会介绍了 Qwen 4 Max 的层级结构,但此后关于它的任何内容都没有被转化为开发者可用于规划的规格说明——没有每百万 token 价格,没有上下文窗口,没有最大输出,没有基准测试表,没有 Hugging Face 仓库,供应商自己的模型列表里也没有条目。它会以封闭 API 层级、开放权重,还是两种形式同时发布,供应商已发布的任何地方都没有说明。当一个层级还处于如此早期的阶段,一篇文章对其规格唯一诚实的说法就是:没有规格——而现在任何提供 Qwen 4 Max 规格表的页面,登出的都只是预测。

这份公告唯一切实确立的东西,是方向。阿里巴巴最新交付的旗舰模型 Qwen3.8 Max,在厂商自家的迁移指南中被直接对标 GPT-5.5、Claude Opus 4.7 和 Gemini 3.1 Pro,而它正是 Qwen 4 Max 旨在取代的那一档。因此,即便继任者的具体数字尚不可知,其目标依然清晰可辨;而它必须在价格上战胜的,正是眼下已在销售的那一款模型。
今天就能调用的 Qwen,价格对标全新的 Sonnet
Qwen3.8 Max 自 2026 年 8 月 3 日起正式全面可用。它是阿里巴巴迄今为止能力最强的一档:原生多模态,支持文本、图像和视频输入、文本输出,100 万 token 的上下文窗口,思考模式、函数调用、内置工具和结构化输出,并通过兼容 OpenAI、兼容 Anthropic 以及原生 DashScope 端点提供服务。阿里巴巴将其定位用于高要求的多步分析和智能体任务,这与厂商为 Claude Sonnet 5.5 所定位的场景如出一辙,而两者在标称价格上几乎完全一致——这正是这场比较变得有意思的地方。
• 输入价格 — Claude Sonnet 5.5 每百万 $2.00,对比 Qwen3.8 Max 每百万 $2.00,完全相同
• 输出价格 — Claude Sonnet 5.5 每百万 $10.00,对比 Qwen3.8 Max 每百万 $6.00
• 缓存读取 — Claude Sonnet 5.5 每百万 $0.20,对比 Qwen3.8 Max 每百万 $0.25
• 缓存写入 — Claude Sonnet 5.5 每百万 $2.50 对比 Qwen3.8 Max 每百万 $2.50
• 上下文 — 厂商规格表上,Claude Sonnet 5.5 为 1,000,000 tokens,Qwen3.8 Max 为 1,000,000 tokens;Artificial Analysis 记录的实测快照为 983,616
• 最大输出 — Claude Sonnet 5.5 同步模式 128,000,Batches 模式 300,000,而 Qwen3.8 Max 厂商未公布
• 输入模态 — Claude Sonnet 5.5 支持文本、图像和文件,对比 Qwen3.8 Max 支持文本、图像和视频
相同的输入费率,加上便宜 40% 的输出费率,确实构成了非常强的价格优势,也正因如此,Qwen3.8 Max 会不断出现在与前沿模型的对比中。可当你去看独立测评时,优势却完全转移到了别处。
独立数据如何说明价格优势
两个模型都位于同一 Artificial Analysis Intelligence Index(修订版 v4.3.2)上,而且两者都是实测得出的,而非估算。
• 智能指数 — Claude Sonnet 5.5 在最大努力下为 56,对比 Qwen3.8 Max 在 9 月 2 日快照上为 45
• 每项索引任务成本 — Claude Sonnet 5.5 为 $7.60,Qwen3.8 Max 为 $5.41
• 输出速度 — Claude Sonnet 5.5 138.7 tokens/秒 vs Qwen3.8 Max 38.2 tokens/秒
• 首个数据块耗时 — 在 Max Effort 下,Claude Sonnet 5.5 为 370.8 秒,而 Qwen3.8 Max 为 3.0 秒
• 整个指数范围内生成的输出 token 数——Claude Sonnet 5.5 为 410M,Qwen3.8 Max 为 190M,而中位数为 88M,董事会据此将二者标记为极其冗长
• GPQA Diamond — Claude Sonnet 5.5 未在当前榜单上公布,对比 Qwen3.8 Max 的 92.8%
• Humanity's Last Exam — Claude Sonnet 5.5 55.0% 对比 Qwen3.8 Max 43.1%
• 长上下文召回 — Claude Sonnet 5.5 82.7% 对比 Qwen3.8 Max 80.3%
有两点很突出,而这两点都不是价格。第一点是,一旦把 token 数量计入,低 40% 的输出费率会被压缩成低 30% 的任务成本——Qwen3.8 Max 在整个索引中输出了 1.9 亿个 token,而 Claude Sonnet 5.5 为 4.1 亿个,这确实更精简,但还没有精简到足以保住全部费率差距。第二点是速度,而在这里方向发生了急剧逆转:Claude Sonnet 5.5 的输出生成速度是 Qwen3.8 Max 的 3.6 倍,每秒 138.7 个 token,对 38.2 个。在长文本生成中,这意味着一分钟和好几分钟的差别,而且是任何按 token 计的折扣都无法弥补的差别。
首 token 数字指向的恰恰是另一面,其前提说明值得直白地讲清楚。370.8 秒是 Claude Sonnet 5.5 在 Max Effort 搭配默认回退(default fallback)下的成绩,这是一种在作答前消耗极大思考预算的推理配置;调用方若配置较低的 effort,首 token 可在数秒内返回。Qwen3.8 Max 的 3.0 秒是在一个思考行为不同的模型上测得的。这一比较是真实的,但它比较的是配置,而非厂商。

缺失的 Sonnet 迁移成本落在何处
有一个运行层面的差异没有出现在上面任何一行中,对任何有代码在运行的人来说,它比价格差距更重要。Claude Sonnet 5.5 相对于 Claude Sonnet 5 改变了六种行为,其中五种会破坏现有集成:非默认的 temperature、top_p 和 top_k 现在会返回 400;thinking: {"type": "disabled"} 会返回 400,并且必须改为 between_tools,且 effort 限制为 low、medium 或 high;强制工具选择 "any"或具名工具会被拒绝,因此循环必须改用 auto,并配合严格工具使用或结构化输出;而 computer_20251124 计算机使用工具在 Claude API 和 Google Cloud 上被拒绝;而且思考块现在绑定到生成它的模型和账户,因此推理能从 Sonnet 5 延续,但不能延续到另一个模型家族。第六项变更不会导致任何失败,因此很容易在发布时带着问题上线:工具调用之间的文本现在会在思考块内部返回,所以流式应用会在调用之间陷入静默,直到它设置显示值或禁用预先思考。
Qwen3.8 Max 对 Qwen 调用方提出的要求完全不是这些——它是一个兼容 OpenAI 的端点,具备完整的采样参数面和标准的工具调用形式——而它兼容 Anthropic 的端点的存在,恰恰是为了让针对 Claude 编写的代码只需更改 base URL 就能指向它。对于一个已经在使用 Sonnet 5 的团队来说,迁移到 Sonnet 5.5 是一天的迁移工作量,外加一份包含五项检查项的清单;而迁移到 Qwen3.8 Max 则只是一次配置变更,伴随的是另一组风险,主要围绕行为漂移,而非 API 形态。
将可访问的那一个放到同一个键上
到2026年9月下旬,一条务实的流水线不会在这两者中只挑一个。它会在智能体路径上运行 Claude 模型,而在视频输入或价格关键的地方使用 Qwen 模型,而这样一套安排的代价通常是两份合同、两把密钥、两处速率限制面,以及两处可能让请求失败的地方。OrcaRouter 把它收拢成一个兼容 OpenAI 的单一端点,横跨 200 多个模型,按供应商标价原样透传、不额外加价,因此无论哪一方的厂商费率发生变化,这里当天就会生效,而不必等到下一次续约;此外还提供上游供应商之间的自动故障转移,以及一套用于把多个模型的调用组合起来的路由 DSL。
Qwen3.8 Max 今天已可在此处路由为 qwen/qwen3.8-max,在完整的 1,000,000 token 窗口内采用阿里巴巴的 $2.00 输入价和 $6.00 输出价;而Artificial Analysis 所测得的 9 月 2 日快照可通过 qwen/qwen3.8-max-0902访问,以备你需要分数所依据的确切修订版本。无论是 Qwen 4 Max 还是其他任何 Qwen 4 层级,都不在我们的目录中,只要阿里巴巴没有发布可路由的内容,就不会有任何 Qwen 4 层级上线。Claude Sonnet 5.5 同样不在目录中——它才发布一天,通往它的路径是 Anthropic 自家的 API;与此同时,此处可用的 Claude Sonnet 5 采用 Anthropic 的 $2.00 和 $10.00 定价,作为过渡期间的故障转移目标。Qwen3.8 Max 每周通过本目录承载 5,200 万 token 的流量,而 Claude Sonnet 5 承载 790 万,这正是上述论点的现实版本:Qwen 这一层级并非只是名义上的备选。

已公布层级的规则
将已公布的档位视为排期输入,而非采购选项。Qwen 4 Max 值得关注,因为它能说明阿里巴巴旗舰系列的走向,也因为它最终会在产品线顶端取代 Qwen3.8 Max。但它不值得作为规划依据,因为根本没有什么可据以规划:没有标识符,没有价格,没有时间窗口,没有权重,也没有实测分数。让它成为现实的证据很具体,也很容易识别——出现在阿里巴巴自己的模型列表中、一行价格、公布的上下文窗口、如果权重开放则有 Hugging Face 仓库,以及 Artificial Analysis 上的页面,因为一个没人测过的模型,就不是你能拿来比较的模型。
在那之前,抉择存在于两个都已存在的模型之间。如果你的工作是智能体式的,那么你花钱买的就是那多出的 17 个 Index 分数和 3.6 倍的输出速度,而 Claude Sonnet 5.5 更高的单任务成本就是为此付出的代价。如果你的工作要接收视频输入、需要在 Qwen 的账单上使用原生兼容 Anthropic 的端点,或者根本无法为每百万 token 10 美元的输出价格找到理由,那么 Qwen3.8 Max 现在正在促销,输入价格相同,输出便宜 40%,首个 token 几秒内就能到达——而诚实的提醒是:一旦开始生成,它会让人觉得慢,这正是更低价格换来的取舍。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
