Qwen 3.8 对比 Claude Fable 5:阿里巴巴 2.4T 旗舰终于有了标价
Guides & Insights

Qwen 3.8 对比 Claude Fable 5:阿里巴巴 2.4T 旗舰终于有了标价

作者

jinhao song

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

当阿里巴巴于2026年7月19日在上海预览Qwen3.8-Max时,它发出的一个声明比任何其他声明都响亮:这个拥有2.4万亿参数的大模型接近前沿水平,且仅次于Claude Fable 5。当时这几乎无法评估。没有定价表、没有基准测试表、也没有许可证——只是一个定位声明。

2026年8月3日,Qwen3.8-Max正式全面可用,并且这场比较终于在双方都有了实质依据。阿里巴巴公布了每百万 token 2 美元 / 6 美元的定价,以及一份带有真实数字的基准测试表。在独立的 Artificial Analysis Intelligence Index 中,Fable 5 仍以 SWE-bench Verified 上经审计的 95.0% 的成绩位居榜首。于是问题变得更加尖锐:既然 Qwen 已经亮出了自己的数字,“仅次于 Fable 5”的说法还成立吗?

给构建者的一点提示:要验证这种说法,最快的方法就是用自己的提示词分别运行这两个模型。OrcaRouter 将 200 多个模型汇集在一个兼容 OpenAI 的端点之后,因此你可以在同一个任务上让 Qwen 3.8 Max 与 Fable 5 直接对决,而无需接入两套 SDK。

TL;DR 结论。GA 版的 Qwen3.8-Max 是一个远比其预览版所暗示的更强大的挑战者——而且价格也大幅降低。按每 100 万 token 统一 $2 / $6,它比 Fable 5 的$10 / $50在输入上便宜约 5 倍、输出上便宜约 8 倍;其自报数据也达到了前沿水平(GPQA Diamond 92.6、Terminal-Bench 2.1 86.6、FrontierSWE 73.5,而前代仅为 40.7)。但 Fable 5 保住王座的理由自 7 月以来从未改变:两者中只有它拥有裁判。Fable 的 Intelligence Index 约 60、SWE-bench 95.0% 均经第三方审计;Qwen 的所有数据均出自阿里自家,Artificial Analysis 和 LMArena 均未公布 Qwen3.8-Max 的得分。Fable 5 赢在实证;Qwen 3.8 决定性地赢在价格上——而且一旦权重发布,还赢在开放性上。

关键要点

Qwen3.8-Max 已于 2026 年 8 月 3 日正式发布 — 不再是预览版。已发布定价表、兼容 OpenAI 与 DashScope 的 API、厂商基准测试表。

价格差距巨大: Qwen 每 1M 的价格为 $2 / $6,而 Fable 5 为 $10 / $50。输入价格约为 5 倍,输出价格约为 8 倍,而且 Qwen 的费率在整个 1M-token 上下文中保持一致,没有长提示附加费。

Fable 5 仍是唯一经过审计的一方。在 Artificial Analysis 智能指数(#1)上约为 60,SWE-bench Verified 为 95.0%,而 Qwen3.8-Max 仍未获得任何独立评估者的评分。

Qwen 自报的数字确实很强:GPQA Diamond 92.6、PaperBench 93.0、Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1——但这些数字由厂商自行发布,而实验室只会公布自己胜出的基准测试。

Alibaba从未公布过活跃参数数量,因此2.4T这个宣传数字对真实服务成本的参考价值非常有限。Fable 5的架构同样未公开——在透明度方面,双方都算不上清白。

本周内将发布开放权重,此外还有一个Qwen3.8-27B,据称可在约17GB显存中运行。Fable 5已封闭,仅提供API,且永久如此。

准确性说明:{{1}}所有Qwen3.8-Max的质量数据均由阿里巴巴报告,尚未经过独立复现验证。{{/1}}{{2}}Fable 5的数据来自Artificial Analysis和Anthropic,不同追踪器之间的结果可能存在差异。{{/2}}{{3}}Qwen的定价为阿里巴巴Model Studio的GA(正式发布)价格表,不再是7月适用的临时预览折扣价。{{/3}}

规格与价格,并列对比

以下是硬数据,每项数据均注明其来源。

• 制造商 / 状态 — Qwen3.8-Max:阿里巴巴;GA(2026年8月3日);Claude Fable 5:Anthropic;GA 旗舰

• 架构 — Qwen3.8-Max:总量约2.4T,稀疏MoE(活跃参数仍未公开);Fable 5:闭源;架构未披露

• 上下文窗口 — Qwen3.8-Max:1M tokens(思考模式下为 983,616;最大输出 131,072);Fable 5:长上下文旗舰模型

• AA Intelligence Index — Qwen3.8-Max:尚未评分;Fable 5:~60 — #1(Artificial Analysis)

• SWE-bench Verified — Qwen3.8-Max:未报告(阿里巴巴报告的是 FrontierSWE 73.5);Fable 5:95.0%(Anthropic / buildfastwithai)

• 供应商报告的优势 — Qwen3.8-Max:GPQA Diamond 92.6、Terminal-Bench 2.1 86.6、PaperBench 93.0、OSWorld-Verified 86.1(均为阿里巴巴报告);Fable 5:经审计综合排名第一

• 定价(输入/输出)— Qwen3.8-Max:$2.00 / $6.00 每 1M,在 1M 上下文中统一;缓存输入 $0.25;Fable 5:$10 / $50 每 1M

• 开放权重 — Qwen3.8-Max:承诺本周内发布(尚无许可证);Fable 5:否 — 闭源/仅限 API

• 多模态 — Qwen3.8-Max:文本、图像、视频输入 → 文本输出;Fable 5:多模态旗舰

两件事构成了整个比较的框架,而这两件事都在8月3日发生了变化。

首先,价格栏现在是页面上最抢眼的东西。七月份,Qwen的成本优势是一张折扣券——额度打一折,临时性的,没有可参照的每token费率。现在它变成了一张价目表,这种差距是结构性的,而非促销性的。以6美元的输出价格对比Fable的50美元,你可以用一次Fable调用的价格运行大约八次Qwen调用。对于任何你按量付费而非为单个最难的答案买单的工作负载,这种比率会改变你构建的架构。

其次,基准测试列不再是空的——但它也不具备可比性。而这正是最关键的微妙之处。阿里巴巴报告的是FrontierSWE 73.5;Anthropic报告的是SWE-bench Verified 95.0%。这些是难度曲线各不相同的基准测试,将73.5与95.0并列对比,仿佛衡量的是同一件事,这无异于直接误导。我们能说的更为有限,也更为诚实:Fable 5的分数由第三方在他人可查验的条件下得出,而Qwen的分数由阿里巴巴在一个没有任何其他人运行过的测试框架上得出。在Artificial Analysis或LMArena发布Qwen3.8-Max的分数之前,正确的解读自7月以来就没有改变——或许接近,但仍未得到证实。

差价实际上能买到什么

抽象的倍数不如具体的示例有用,因此这里给出一个。以一个代码审查智能体为例,它每次调用发送 150,000 个 token 的代码库上下文,并生成 6,000 个 token 的审查内容。

Qwen3.8-Max:0.15M × $2 = $0.30,加上 0.006M × $6 = $0.036。≈ $0.34/次调用。

Claude Fable 5:0.15M × $10 = $1.50,加上0.006M × $50 = $0.30。≈ 每次调用$1.80。

• 按每天2,000次调用计算:Qwen ≈ $672/天;Fable ≈ $3,600/天。一个月下来大约是$20,000与$108,000。

• 在稳定的仓库上下文中启用提示缓存后,Qwen 的缓存输入价格为每 100 万 token 0.25 美元,将输入端成本从 0.30 美元降至不到 0.04 美元,使每次调用的成本降至 约 0.08 美元——比 Fable 每次调用便宜约 22 倍。

这并非边际性的节省;它是在每个拉取请求上都运行审查者与只对高风险请求运行审查者之间的差别。而且,随着提示词的增长,Qwen的固定费率上下文使这种效果更加显著:由于阿里巴巴不收取长提示词附加费,处理一个90万token的上下文与处理一个5000token的上下文,每个token的成本完全相同。

公正的权衡因素在于,每个token的价格并不等于每个已解决任务的价格。如果Fable 5在一次尝试中就能解决问题,而更便宜的模型需要三次尝试加上人工修正,那么更便宜的模型总体上可能花费更多——而在最困难的推理任务上,Fable经审计的#1排名是现有最佳证据,表明它确实能一次解决更多问题。Qwen的成本优势在批量大、容错性高的工作负载上最强,在批量小、风险高的工作负载上最弱。

证明,以及它为何仍然决定这场对局。

关于Qwen3.8-Max最常被引用的实测证据,来自一篇预览期的评测(thomas-wiegold.com),该评测让模型经历了四个真实的构建任务。结果确实令人印象深刻:Qwen 一次完成了用Go编写的扑克模拟——这是第三个仅凭单次尝试就通过该提示测试的模型,前两个分别是Fable 5Grok 4.5——而在一个咖啡烘焙商网站的提示测试中,它产出了评测者在该测试中所见过的最佳输出,还纯粹出于细致周到,主动添加了本未被要求的购物车、批发专区以及Instagram集成。

问题在于速度:在网站上花了 30 多分钟,扑克模拟又花了 1 小时 20 分钟,使它成为该评测者用过的最慢模型。如今,这一结论需要加上一个附加说明,而在七月份时并不需要。这项测量是在预览基础设施上完成的,由一位评测者在异常长的 agentic 运行中测得;GA 服务则是另一套系统。顺带一提,OrcaRouter 自身的 7 天遥测数据目前显示,Qwen3.8-Max 的p50 首令牌延迟(time-to-first-token)为 1.64 秒——这是第一方测量结果,尽管 TTFT 与长达一小时的构建任务中的端到端吞吐量属于不同指标。诚实的立场是,预览版速度慢这一发现应重新测试,而不应作为当前事实来引用。

未曾改变的,是证据的不对称性。阿里巴巴的通用基准测试表相比完全不公布是一种真正的改进,但它仍是供应商自制的产物:实验室自行选择要报告的基准,而阿里巴巴自身最弱的一项已报告数据 —— IFBench 82.8,指令遵循 —— 恰好与预览版中“模型过度执行、无视范围限制”的投诉完全吻合。与此同时,Fable 5 则由一个与结果无利害关系的评估者进行评分。在“哪个模型能处理我承担不起出错代价的工作”这一问题上,这一差异并非细枝末节,而是选择的全部依据。

开放性:Qwen 可能永久获胜的维度

Fable 5 永远不会支持自托管。Qwen3.8-Max 也许可以,阿里巴巴现在表示权重文件本周内就会发布。但有两个注意事项同样值得重视。

第一点是法律方面:仍然没有许可证文本,也没有模型卡。“开放权重即将推出”并不构成商业权利的授予,除非有文件可读,而许可证将决定该发布是否可以在产品中使用。

其次是物理层面的问题。一个2.4T参数的模型在4比特量化下大约需要1.2TB存储,而每块H200仅有约141GB——在生成第一个token之前就需要八块甚至更多顶级加速器。而且由于阿里巴巴仍未披露激活参数数量,你甚至无法估算这笔投入能换来多少吞吐量。对几乎每个团队来说,自托管这款旗舰模型都不是一个现实可行的选项。

这使得Qwen3.8-27B——与之一同发布、同样开放权重、据称仅需约17GB显存即可运行——成为更具实际意义的发布。如果你偏好 Qwen 而非 Fable 5 的理由是数据驻留或本地部署控制,而非原始能力,那么 27B 才是真正实现这一点的模型。就开放性而言,将 2.4T 旗舰与 Fable 5 比较,多半只是理论性的;而将 27B 与之比较,则是具体的。

常见问题

Qwen 3.8 比 Claude Fable 5 更好吗?

就现有证据而言,并非如此。阿里巴巴的GA基准测试榜单很亮眼(GPQA Diamond 92.6,Terminal-Bench 2.1 86.6),但每个数字都是自行报告的,没有独立评估者给该模型打过分数。Fable 5 拥有经审计的约60 Intelligence Index(排名第一)和95.0%的SWE-bench Verified。Fable 5 在实证方面领先;Qwen 3.8 在价格方面占据压倒性优势。

仅次于《神鬼寓言5》的说法是真的吗?

这仍是阿里巴巴自身的定位。GA 带来了基准测试表,但缺乏第三方验证——Artificial Analysis 和 LMArena 均尚未评分。作为参考,前代 Qwen3.7-Max 在 AA 智能指数上得分为 46,而 Fable 5 约为 60,因此该说法若要字面成立,需要极大的代际跃升。

Qwen 3.8 比 Fable 5 便宜多少?

大幅降价,而且现在这是实际费率而非折扣价。Qwen3.8-Max 每100万token的价格为2美元/6美元,而Fable 5为10美元/50美元——输入约便宜5倍,输出约便宜8倍。Qwen的费率在完整的100万上下文窗口内保持统一,缓存输入为每100万token 0.25美元,使得重复上下文的工作负载成本更低。

Qwen 3.8 Max 退出预览了吗?

是的。它已于2026年8月3日全面上市,发布了公开价目表,并提供了兼容OpenAI和DashScope的端点。7月流传的Qoder积分活动和90%折扣预览表述已不再反映该模型的销售方式。

根据早期评测,Qwen 3.8 仍然是最慢的模型吗?

这一发现来自一位评审者,在预览基础设施上运行时长一小时的智能体构建任务,并且应该针对 GA 服务重新测试,而不是视为当前事实。OrcaRouter 的 7 天遥测数据显示 p50 首令牌时间为 1.64 秒,不过该指标衡量的是首令牌延迟,而非超长构建中的吞吐量。

我能否自托管 Qwen 3.8 而无需为 Fable 5 付费?

还没有,而且可能不会是旗舰。权重预计本周内发布,但目前仍没有许可证;而且在4位量化下约1.2TB的大小,需要八块或更多H200级GPU。同期发布的Qwen3.8-27B,据报道约需17GB显存,是更现实的自托管路径。Fable 5已永久关闭。

我今天应该用哪一个?

Fable 5 适用于错误答案代价高昂且需要可审计可靠性的工作——硬推理、高风险的正式生产路径。Qwen3.8-Max 适用于大批量工作,在那些场景下 8 倍的输出-价格优势会不断累积:批量代码审查、长文档分析,以及任何你可以容忍验证的工作。许多团队应该同时运行两者,并根据任务价值进行路由。

底线

Qwen 3.8 对比 Claude Fable 5与两周前相比,这一对比已经发生了实质性的变化。Qwen3.8-Max 不再是一个附带优惠券的预览版——它现在是一个正式商用模型,其定价表在输入方面比 Fable 5 低 5 倍,在输出方面低 8 倍,在一百万 token 范围内价格恒定。其自报的数据看起来具有前沿水平,而且相较于前代产品,它在编码能力上的跃升如果能够复现,将非常引人注目。

但Fable 5保住了王冠,而且原因与七月时完全一样:它是拥有裁判的那一方。经审计的#1 Intelligence Index和95.0% SWE-bench Verified,是别人核验过的说法。阿里巴巴的榜单无论多强,终究是阿里巴巴自己的。关注两件事:Qwen3.8-Max的首个独立Intelligence Index分数,以及附有许可证的权重发布。如果两件事都对Qwen有利,"仅次于Fable 5"就不再是营销口号。在那之前,明智的答案不是选出一个赢家,而是按风险分担——Fable用于你不能出错的地方,Qwen用于你承受不起昂贵成本的地方——并在你自己的提示词上对两者进行测试。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube