
Qwen 3.8 与 Claude Opus 4.8:廉价规模遇上推理专家
- meta新Meta: Muse Spark 1.22026-08-05$1.25 / $4.25 每百万 tokens · 819 tok/s
- qwen新Qwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 每百万 tokens · 56 tok/s
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3150智能69代码
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 198 tok/s
- orca新OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropic新Anthropic: Claude Opus 52026-07-2461智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2150智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1651智能71代码
- kimiMoonshotAI: Kimi K32026-07-1557智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0951智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0955智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0959智能77代码
- grokxAI: Grok 4.52026-07-0854智能72代码
- tencentTencent: Hy32026-07-0641智能59代码
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42代码
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39代码
- anthropicAnthropic: Claude Sonnet 52026-06-3053智能72代码
- klingKling: Kling 3.0 Turbo2026-06-1757智能52代码57数学
- z-aiZ.ai: GLM 5.22026-06-1651智能69代码60数学
阿里巴巴预览了Qwen3.8-Max,预览活动于2026年7月19日在上海举行。该模型参数规模达2.4万亿,专为规模与全面性而构建。Anthropic的Claude Opus 4.8则是截然不同的存在:一款高端的深度推理旗舰模型,当任务步骤繁多、错误的答案代价高昂时,团队会求助于它。
两周以来,这种比较很难坦诚地进行,因为 Qwen 没有公布价格,也没有公布基准测试数据。 这一情况在 2026 年 8 月 3 日发生了变化,当时 Qwen3.8-Max 正式发布,公布了每百万 tokens 2 美元 / 6 美元的费率表和完整的基准测试结果。哲学层面的问题依然如故——原始规模与开放性,对比推理可靠性——但现在双方都有了具体数字。
给构建者的一点提示——解决这类问题最快的方法是在你自己的工作流上同时运行两者。OrcaRouter 通过一个兼容 OpenAI 的端点对外提供 200+ 个模型,因此你可以在同一任务上让 Qwen 3.8 Max 与 Opus 4.8 同台竞技,而无需接入两套 SDK。
TL;DR 结论。Opus 4.8 仍然是推理专家:经审计进入 Artificial Analysis Intelligence Index 的顶级集群,并在长智能体链中被信赖,因为在这些场景中,一个自信但错误的答案的代价高于token费用。它的弱点是成本和冗长——AA 将其混合费率定为约$3.85/1M,在最大努力级别下,它消耗大量token,据报道Grok 4.5完成类似任务时使用的输出token大约少4倍。Qwen3.8-Max现在用7月份所缺乏的东西来反击:一个真正的低价格,即$2/$6 每百万token统一价,缓存输入价格为$0.25,以及一个由Terminal-Bench 2.1 86.6和OSWorld-Verified 86.1领衔的厂商基准测试表。它还在唯一可用的第三方测试中展现了真正的智能体勤勉性。但它仍然没有被任何独立评估者评分。推理方面,你必须信任Opus;成本敏感、追求彻底性的工作,则选Qwen。
关键要点
• Qwen3.8-Max 自2026年8月3日起正式发布(GA),定价为$2 / $6 每100万token,在整个100万token上下文范围内价格统一——这是一份真正的价目表,取代了7月份的临时预览折扣。
• Opus 4.8 的价格明显更高:Artificial Analysis 将其综合成本估计为接近 $3.85/1M(在最大努力下),而且它token 消耗量大——据报道,每个任务的输出 token 数约为 Grok 4.5 的 4 倍,因此长时间的智能体运行会让差距进一步扩大。
• 各来源对 Opus 4.8 的确切 AA 数值说法不一。在 AA v4.1 中,Kimi K3(57.1)据报略高于它,因此可靠的说法是“顶级集群,低于 Fable 5 / GPT-5.6 Sol 领先梯队”,而非一个确切的分数。
• Qwen 现在拥有智能体基准分数,据其自行报告:Terminal-Bench 2.186.6,OSWorld-Verified86.1,FrontierSWE73.5(前代模型为 40.7)。这些数据均未经独立验证。
• Qwen 的一个第三方智能体数据点是有利的:与 Kimi K3 相比,它产生了354 个仓库引用对比 274,使用了22 次网关请求对比 53,并记录了0 次失败的工具调用对比 2——而得分 80/100,对比 Kimi 的 83。
• 开放性永久分化: Qwen 承诺本周内开放权重,并推出约需 17GB 显存的 Qwen3.8-27B;Opus 4.8 保持闭源,仅提供 API。
准确性说明:所有 Qwen3.8-Max 质量数据均由阿里巴巴报告,未经第三方验证。Opus 4.8 的数据归因于 Artificial Analysis 及具名来源,可能与 Anthropic 自身的报告存在差异;由于各追踪机构对 Opus 的确切指数存在分歧,我们仅说明其相对位置而非单一数字。Qwen 定价采用正式发布(GA)费率表,取代了 7 月份的预览折扣。
规格与价格,并列对比
以下是硬数据,每项数据均注明其来源。
• 厂商 / 状态 — Qwen3.8-Max:阿里巴巴;GA(2026年8月3日);Claude Opus 4.8:Anthropic;GA 深度推理旗舰
• 架构 — Qwen3.8-Max:总计约2.4T,稀疏MoE(活跃参数尚未披露);Opus 4.8:闭源;架构未披露
• 上下文窗口 — Qwen3.8-Max:1M tokens(983,616 含思考;最大输出 131,072);Opus 4.8:长上下文旗舰
• AA Intelligence Index — Qwen3.8-Max:尚未评分;Opus 4.8:顶级集群,低于领先者(Artificial Analysis;Kimi K3 据报道以 57.1 分略高于此)
• 核心优势 — Qwen3.8-Max:规模、全面性、长上下文经济性;Opus 4.8:深度多步推理 + 智能体可靠性
• 厂商报告的智能体评分 — Qwen3.8-Max:Terminal-Bench 2.1 86.6,OSWorld-Verified 86.1(阿里巴巴报告);Opus 4.8:n/a —— 声誉靠生产实绩赢得
• 定价(输入/输出)— Qwen3.8-Max:$2.00 / $6.00 每 1M,固定费率;缓存输入 $0.25;Opus 4.8:Premium — AA 混合约 $3.85/1M(最大努力)
• Token 效率 — Qwen3.8-Max:冗长;IFBench 82.8 是其自报分数中最弱的一项;Opus 4.8:Token 密集 — 输出量约为 Grok 4.5 的 4 倍(自报)
• 开放权重 — Qwen3.8-Max:承诺本周内发布(尚无许可证);Opus 4.8:否 — 封闭 / 仅限 API
两件事构成了这一比较的框架,而两者都在8月3日发生了变化。
首先,成本差距现在是可衡量的,而不只是名义上的。七月时,Qwen 的优势还是一种无法编入预算的折扣。现在它变成了一个费率,而且这个差距的形态很不寻常:Opus 既昂贵又消耗大量 token,这意味着两者会相乘。如果 Opus 在相同任务上输出的 token 数量是其他模型的四倍,且每个 token 还收取溢价,那么一次长时间的智能体运行成本可能是标称费率的许多倍。Qwen 每百万 token 6 美元的输出费率、固定 100 万 token 的上下文窗口,以及 0.25 美元的缓存输入费率,恰好直击了这种复合效应。
其次,Qwen 的基准测试栏目不再空白——而且这一次,其中一部分直接相关。 Opus 4.8 的全部卖点是智能体可靠性,而阿里巴巴现已发布了智能体相关数字:Terminal-Bench 2.1 上 shell 操作得分 86.6,OSWorld-Verified 上驱动真实 GUI 得分 86.1。这些衡量的是正确的事。需要注意的地方在于来源而非相关性:阿里巴巴是用自己的测试框架得出的这些数据,尚无第三方复现。与此同时,Opus 的声誉建立在一个更难发表但可以说更有价值的东西上——在众多团队中的持续生产级使用,这是一种厂商表格无法制造的证据。

推理可靠性 vs 原始彻底性
这两者之间有趣的差异不在于一次性生成的质量——而在于当任务包含多个步骤并附带真实工具时,它们会如何表现。
Opus 4.8 的声誉建立在智能体可靠性之上:长链推理,它能在其中跟踪上下文、从死胡同中恢复,并返回无需逐步复核即可直接采纳的答案。这种特性正是团队愿意支付高溢价的原因,因为在生产环境中,一个自信但错误的多步答案的成本远超 token 账单。代价是 Opus 消耗的 token 较多——据报道,Grok 4.5 完成类似任务所需的输出 token 大约为其四分之一——因此它的可靠性伴随着真实且持续的成本。
Qwen 3.8 以另一种方式展现优势:纯粹的彻底细致,如今已有一个第三方数据点为此佐证。在 Trilogy AI 开展的架构理解测试(Qwen3.8-Max vs Kimi K3)中,Qwen 得分80/100,而 Kimi 为 83——在主要得分上落败——但它是更勤勉的智能体,生成了354 条仓库引用,而 Kimi 为 274,使用了22 次网关请求,而 Kimi 为 53,并记录了0 次失败的工具调用,而 Kimi 为 2。两个模型得出了相同的核心架构结论;Qwen 只是通过更多溯源验证工作才达到这一结论,且工具使用更干净。
零失败工具调用的结果,是Qwen所拥有的最令人鼓舞的智能体信号,因为失败的工具调用才是真正导致生产型智能体崩溃的原因。不过,这也只是由一个评估者在单个任务上做的一次测试——远不足以构成Opus口碑背后的那种证据基础。
Qwen 的周全是有代价的:延迟和 token 消耗。预览时期的评测者发现它"非常好,但非常慢"——构建一个网站需要 30 多分钟,运行一次扑克模拟需要超过一小时,是那位评测者用过的最慢的模型。现在需要说明两点。那是在预览基础设施上,而 GA 服务是另一套系统;OrcaRouter 的 7 天遥测数据目前显示p50 首 token 延迟为 1.64 秒,尽管 TTFT 和长达一小时的构建的端到端吞吐量是不同的概念。这一发现值得重新测试,而不是一再重复。
还有一个值得指出的结构性问题:阿里巴巴自身报告的最低分数是IFBench 82.8,即在约束条件下的指令遵循能力。对于在每一步都要解析模型输出的代理型流水线来说,一个超出范围、添加额外未请求工作的模型,无论它多么周全,都是一种负担。这正是Opus的纪律性体现其价值之处。

实践中成本:4倍token差距在何处显现
考虑一个多步骤的智能体运行:80,000 个输入上下文的 token,以及——这是关键变量——不同的输出量,因为据报道 Opus 产生的输出大约是其 4 倍。
• Qwen3.8-Max以 8,000 个输出 token 计算:0.08M × $2 = $0.16,加上 0.008M × $6 = $0.048。每次运行约 $0.21。
• Opus 4.8按混合价格约$3.85/1M,基于80,000输入+约32,000输出(4倍令牌数):大约每次运行$0.43按混合定价——若按高级档费率分别计算输入和输出,费用会显著更高。
• 在每天3,000次运行时:Qwen ≈ $630/天;Opus ≈ $1,290/天或更高。
• 在稳定上下文下,Qwen 的缓存输入价格为 $0.25/1M,其运行成本降至 ≈ $0.07——大约比 Opus 便宜 6 倍。
真正公允的权衡始终适用于Opus的对比:如果Opus一次尝试就能完成任务,而更便宜的模型需要两次尝试外加人工复核,那么更便宜的模型实际上并不便宜。Opus的冗长在某种程度上正是其可靠性的机制——它会把推理过程说出来,而这会消耗token。你的工作负载需要回答的问题是:你是否在为并不需要的深思熟虑买单。对于高风险、低体量的推理任务,答案是肯定的。对于高体量分析任务,反正你会在下游做验证,答案则是否定的。
开放性与本地部署问题
Opus 4.8 已永久闭源,仅限 API 使用。Qwen3.8-Max 可能并非如此——权重承诺在本周内发布——但这款旗舰模型并非现实的自托管目标:以 4 位量化计算,约 1.2TB 的规模对比每块 H200 约 141GB 的显存,意味着需要八块或更多顶级加速器;而由于活跃参数量仍未公开,你无法估算这笔投入所能换取的吞吐量。此外,目前也还没有许可证文本,因此商业可用性在形式上仍未确定。
同步发布的Qwen3.8-27B则是面向那些更关注可控性而非原始能力的团队的实际版本。同样采用开放权重,据报道它只需约17GB显存即可运行——一张高端显卡就够用。如果你是因为需要在自己的网络内部进行推理而拿它与Opus比较,那么27B就是值得评估的模型;2.4T旗舰版的开放性基本只停留在理论上。
常见问题
Qwen 3.8 比 Claude Opus 4.8 更好吗?
并非依据现有证据。Opus 4.8 位于经审计的 Artificial Analysis Intelligence Index 顶级集群中,并在生产环境中证明了其深度智能体推理能力。Qwen3.8-Max 拥有出色的自报成绩(Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1)和一项有利的第三方智能体测试,但没有独立评分。Qwen 在价格上胜出;Opus 在实证和推理可靠性上胜出。
为什么 Opus 4.8 的基准测试数字描述得如此模糊?
因为跟踪榜单的结果确实存在冲突。在 AA v4.1 上,Kimi K3(57.1)被报告为略高于 Opus 4.8,这使得 Opus 进入了顶级集群,但仍低于 Fable 5 / GPT-5.6 Sol 等领先者——不过不同来源的报告各不相同,因此引用某个单一的确切数字会误导人。其相对位置才是可靠的表述。
Qwen 3.8 比 Claude Opus 4.8 便宜多少?
意义重大,而且在长时间运行时差距会扩大。Qwen3.8-Max 的固定价格为每 1M token 2 美元 / 6 美元,缓存输入为 0.25 美元。Artificial Analysis 将 Opus 在最大努力下的混合成本定为约 3.85 美元/1M,据报道 Opus 的 token 消耗量约为 Grok 4.5 的 4 倍——因此价格差距会随着输出量成倍扩大。在典型的多步运行中,Qwen 的成本大约便宜 2–6 倍,具体取决于缓存情况。
Qwen 3.8 Max 退出预览了吗?
是的,2026年8月3日。它已有公开的价目表,并提供兼容OpenAI和DashScope的端点,所以7月的Qoder积分活动和90%折扣的说法已不再适用于其当前的销售模式。
Qwen 3.8 用于智能体任务时可靠吗?
早期信号令人鼓舞,但还很单薄。阿里巴巴报告 Terminal-Bench 2.1 得分为 86.6,OSWorld-Verified 得分为 86.1;在第三方测试中,它记录了零次失败的工具调用,而竞争对手有两次。相比之下,其自报最弱的分数是 IFBench 82.8(指令遵循),而且预览测试人员反复看到它超出范围——对于解析每一步输出的流水线来说,这是一个真正的风险。
我能自托管Qwen 3.8以避免Opus的溢价定价吗?
现实地说,它并非旗舰。权重承诺本周内公布,但尚未发布许可证,而且在4位量化下约1.2TB,你需要八块或更多H200级GPU。同时发布的Qwen3.8-27B,据报道约17GB显存,是可行的选择。Opus 4.8是封闭的,因此完全没有自托管的途径。
我今天应该用哪一个?
Opus 4.8 适用于推理关键型或智能体生产工作——这类工作必须值得信赖,因为一个错误的多步骤答案代价高昂。Qwen3.8-Max 适用于成本敏感、以彻底性为先的工作——尤其是长上下文分析,其 1M 统一定价和 0.25 美元的缓存输入价格让性价比难以被忽视。
底线
Qwen 3.8 对比 Claude Opus 4.8这仍然是理念的对撞,但经济账已不再是假设。Qwen3.8-Max 以 GA 形式发布,定价远低于 Opus,且由于 Opus 不仅价格高昂、Token 消耗量也大,差距还在持续拉大。Qwen 还发布了直指 Opus 主场的智能体(Agentic)数据,其一次第三方智能体测试显示,工具使用比强劲对手更加干净利落。
Opus 一如既往地保持着它一贯的优势:经审计稳居第一梯队,以及在可靠多步推理方面的实际生产记录——这是任何供应商表格都无法替代的。Qwen 剩余的差距仍是老样子:没有独立评分,没有披露激活参数数量,尚未获得许可证,而且它自述的指令遵循弱点,恰恰在 Opus 被选用的那些智能体流水线中至关重要。关注两件事:首个独立的 Intelligence Index 评分,以及权重携带许可证落地。在那之前,Opus 是你处理代价高昂的决策时所信任的模型,而 Qwen 3.8 则是你路由大批量任务的那一个——用你自己的工作流来验证。

本文中的对比4
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
