标题为 Claude Sonnet 5.5 vs Qwen3.8 Max 的主视觉卡片,副标题为「六周、两档、一个关于成本的结论」,胶囊标签显示输入 $2 两者相同、输出 $10 vs $6,以及 Index 56 vs 45,页脚标注 Artificial Analysis v4.3.2 与厂商定价。
Guides & Insights

Claude Sonnet 5.5 对比 Qwen3.8 Max:六周实测、两个档位,成本结论只有一个

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

对三个提示词做一下算术,还没到跑基准测试,对比基本就已经见分晓了。一次简短的支持回复调用:2,000 个输入 token,500 个输出。在 Qwen3.8 Max 上,按每百万输入 2 美元、每百万输出 6 美元计算,是千分之四美分;在 Claude Sonnet 5.5 上,按 2 美元和 10 美元计算,是千分之九美分。一次代码仓库重构:400,000 个输入,30,000 个输出——四十三美分对八十三美分。一次真正把预算花出去的长时智能体会话:两百万个输入 token,200,000 个输出,所以当数字大到输入侧开始占主导时,是 5.20 美元对 6.30 美元。

输出价格上最初 2.25 倍的差距,在智能体规模下缩小到约 1.2 倍,而这种规模化并非什么稀奇事。Qwen3.8 Max 和 Claude Sonnet 5.5 都是 100 万 token 模型,输出上限都很高,输入定价均为每百万 2 美元,发布时间也相隔不到八周——前者厂商于 2026 年 8 月 3 日发布,并于 9 月 2 日推出了一次标注日期的更新,Anthropic 的则于 9 月 28 日发布。两者的差异不在价目表上,而在于各自为完成任务所消耗的成本。

发布了什么,以及何时发布

Qwen3.8 Max 是阿里巴巴迄今为止能力最强的层级。在其自家的迁移指南中,阿里巴巴将它直接对标 GPT-5.5、Claude Opus 4.7 和 Gemini 3.1 Pro,并建议在任何需要最强可用推理能力的任务中使用它。它具备 100 万 token 的上下文窗口,接受文本、图像和视频输入,并输出文本——视频输入接口是这里 Claude Sonnet 5.5 所不具备的一项能力。定价为每百万输入 token 2 美元、每百万输出 token 6 美元,缓存读取为 0.25 美元,缓存写入为 2.50 美元。我们目录中 8 月 3 日的条目之外,还新增了 9 月 2 日的更新版本,列为 Qwen3.8 Max (0902),其标价相同,输出上限为 131K。

Two-column scoreboard for Claude Sonnet 5.5 and Qwen3.8 Max across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, text and image input, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column Qwen3.8 Max: input $2.00 per million, output $6.00 per million, text image and video input, AA Intelligence Index 45, cost per Index task $5.41, September 2 2026 refresh. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 是 Anthropic 5.5 代中的第二个模型,于 2026 年 9 月 28 日发布,比 Claude Opus 5.5 晚六天。它以claude-sonnet-5-5的形式在 Claude API 以及 Amazon Bedrock、Google Cloud 和 Microsoft Foundry 上提供,拥有 1M token 的上下文窗口,同步输出上限为 128K,而在 Message Batches API 上,通过output-300k-2026-03-24标头可将上限扩展至 300K,并且 Claude Sonnet 5 的费率保持不变:输入 $2、输出 $10、缓存读取 $0.20、缓存写入 $2.50。自发布起即零数据保留,退役时间不早于 2027 年 9 月 28 日。

因此,输入费率完全相同,上下文窗口大小也一样,而且两家供应商的更新相隔不到一个月。它们之间的一切差异,要么在账单的输出侧,要么在基准测试中。

基准测试:厂商表格对比独立指数

这里存在两种证据,它们不可互换。

Anthropic 的发布表格由厂商自行报告,未经任何第三方复现,涵盖八项评估。真正重要的那几行

• Terminal-Bench 4.0 — Claude Sonnet 5.5 达 70.6%,而 Claude Sonnet 5 为 10.3%

• CursorBench 4.0 — 55.5%,而 Claude Sonnet 5 为 34.1%

• GDPval-AA v2.1——1844,而 Claude Sonnet 5 为 1449,Claude Opus 5.5 为 1846,GPT-6 Sol 为 1487

• 在工具辅助下的“人类最后的考试”中——64.5% 对 54.9%;Claude Opus 5.5 为 67.7%

• OSWorld 2.1,部分 — 80.1% 对比 57.0%

• 图表学,无工具——61.6% 对 15.6%

阿里巴巴并未发布直接对应的四列表格,因此能够放在同一坐标轴上的只有独立数据。Artificial Analysis,v4.3.2 修订版

• 综合智能指数 — Claude Sonnet 5.5 56,在216个中排名第3;Qwen3.8 Max 45,排名第27

• 每项 Intelligence Index 任务成本 — $7.60,对比 $5.41

• 输出速度 — Anthropic 的模型对标 Claude Sonnet 5 基准,该基准实测为每秒 78.7 个 token;Qwen3.8 Max 实测为 39.1

• 冗长程度 — Index 上输出 4.1 亿个 token,相比之下为 1.9 亿

Qwen3.8 Max 自身在各单项评估上的成绩相当可观,而非勉强及格:GPQA Diamond 上为 92.8%,Terminal-Bench 2.1 上为 88.8%,长上下文召回上为 80.3%,tau-banking 上为 47.8%。它在综合评分上失分,是因为它没有任何一项取得决定性胜利,而更新的 Anthropic 层级则在数项上直接胜出。另需注意,Qwen3.8 Max 的独立页面标注的发布日期为 2026 年 9 月 2 日,上下文读取值为 984K——它描述的是 (0902) 版更新,而非 8 月构建版,将两者之间的数据混为一谈会是个错误。

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

两列中缺失了什么,与其中有什么同样重要。没有人独立复现过 Anthropic 的 OSWorld 或 Terminal-Bench 数值。也没有人公布过 Qwen3.8 Max 的 Chartography 或 CursorBench 数字。综合得分是唯一在两个模型上以相同方式测得的数字,这正是它下方那个每任务成本数字如此举足轻重的原因。

决定它的那个数字,并不在任何一张费率卡上

Artificial Analysis 对两个模型采用相同的计费方式:运行指数中的十项评估,统计 token 数量,再乘以标价。Claude Sonnet 5.5 每项任务为 7.60 美元,Qwen3.8 Max 为 5.41 美元;尽管 Anthropic 模型的综合得分更高,却要贵出 40%。冗长度读数解释了这一方向——4.1 亿 token 对 1.9 亿——速度读数则解释了其余部分:一个输出 token 更少、每个 token 耗时更长的模型,并不是那个以两倍费率支付输出成本的一方。

Anthropic 自己对效率的说法也符合同一个故事,而非与之矛盾。该公司表示,Claude Sonnet 5.5 生成输出的速度比 Claude Sonnet 5 快 30% 以上,并且在价格相同的情况下,“每项任务成本最多降低 30%”——这一说法针对的是每项任务的 token 数,而非费率。面对一个消耗 token 数不到其一半的模型,这一说法是否仍然成立,正是 7.60 美元这个数字要追问的问题,而一次独立运行只是一个数据点。

实际后果是:$6 对 $10 的输出费率是采购部门会看的那个数字,而它也是这篇文章里预测性最差的数字。真正有预测性的是在你自己的提示词上每个任务消耗的 token 数,而两家供应商都不会把这个数字交给你。

输入、视频以及迁移陷阱

最先显现出来的能力差异是模态。Qwen3.8 Max 除文本和图像外还接受视频;Claude Sonnet 5.5 只接受文本和图像。对于屏幕录制分析、会议录像处理流程,或任何把视频当作一等输入的场景而言,这不是基准测试上的差距——而是一个非此即彼的资格问题,且这两款模型中只有一款能够通过。

OrcaRouter model page for qwen/qwen3.8-max, attributed to Qwen and dated 2026-08-03, showing a 1M-token context window, text, image and video input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 2.25 seconds, and 53.0M tokens of traffic in the last seven days.

一周后才显现的差异是行为上的。Claude Sonnet 5.5 对运行在 Claude Sonnet 5 上的代码做了五项破坏性变更。非默认的 temperature、top_p 或 top_k 现在会返回 400。发送 thinking: {"type": "disabled"} 会返回 400,并指向 between_tools,这是新的最低思考设置,在 low、medium 和 high effort 下会被接受,而在 xhigh 或 max 下会被拒绝。强制工具使用——tool_choice 为 "any" 或指定具名工具——会直接返回 400。较旧的 computer_20251124 计算机使用工具在 Claude API 和 Google Cloud 上被拒绝。并且思考块与生成它们的模型和账户绑定,因此推理可以从 Claude Sonnet 5 向前延续,但不能传到另一个系列,而编辑过的对话前缀可能使重放变成错误。

Qwen3.8 Max 这些一概不需要。它是一个采用 OpenAI 格式的模型,请求接口十分常规,从其他 Qwen 档位迁移过来只需改动模型字符串。

诚实地权衡这两种代价。选择 Qwen 模型,代价是那十一个百分点的综合差距,以及那些你本来也无法独立核实的 Anthropic 厂商数据。选择 Anthropic 模型,代价是视频输入,还有一份四项 API 变更的清单——每一项在第一次被触发时都会以 400 大声报错——这算是好的那种失败,但无论如何都得搭进去一天的工作量。

OrcaRouter 的定位

路由而非选择的理由在于,那个起决定作用的数字——按你的流量计算每项任务的成本——无法从任何一家厂商的文档中计算出来。

OrcaRouter 是一个单一的 OpenAI 兼容端点,覆盖 200 多个模型,按供应商目录价原价透传、不加价,因此无论哪一方降价或调整档位,都能在公布当天同步生效。两个 Qwen3.8 Max 版本都已收录在目录中,价格与阿里自有的 $2 / $6 一致——包括 8 月上架的那一版以及 (0902) 更新版——同时还有 Claude Sonnet 5,也就是目前大多数 Claude API 流量仍在使用的模型,自 6 月 30 日起即可按 Anthropic 的 $2 / $10 路由,实测输出速度为每秒 150 个 token。Claude Sonnet 5.5 本身尚未进入我们的目录;在这一点仍然成立期间,通往它的可靠途径是厂商自家的 API 以及 Anthropic 列出的那三家云,而要在不迁移工作负载的前提下试用它,办法就是将一部分流量置于自动故障转移之后,转向 Claude Sonnet 5 或 Qwen3.8 Max。

哪一个,用于哪项工作?

Qwen3.8 Max 在视频输入、输出速率、每项索引任务的实测成本以及集成工作量上都更胜一筹。对于大批量、需求明确的工作——十二个百分点的综合差距并不会体现在输出质量上——它是合适的默认选择。

Claude Sonnet 5.5 在独立的综合评分上胜出,在智能体编程评测中胜出——Anthropic 的厂商数据显示,它在 Terminal-Bench 4.0 上比自家前代跃升了 60 分——在 30 万 token 的批量输出上限上胜出,也在一个价目表无法做出的、贴合实际任务的判断上胜出:当任务难到答对比省钱更重要时,它就是该选的那个模型。

对两者而言,会改变答案的其实是同一件事,而这并不是某个新基准的发布。它是在你自己的提示词、你自己的努力设置下,针对这两个模型统计出的每任务 token 数。Anthropic 的努力参数和 Qwen 的输出上限,都是影响这个数字的杠杆,而它们都由你设定,而不是由厂商的价目表决定。

这次比较真正能确定的一点是:在输入侧每百万 2 美元的价格下,账单的输入部分已不再是某款中国旗舰模型与 Anthropic 中端模型之间的区分因素。这场竞争早在几个月前就转移到了输出侧和 token 数量上。

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新