
Qwen 3.8 对比 Claude Fable 5:0902 版本在编程方面领先
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
当阿里巴巴于2026年7月19日在上海预览Qwen3.8-Max时,它发出的一个声明比任何其他声明都响亮:这个拥有2.4万亿参数的大模型接近前沿水平,且仅次于Claude Fable 5。当时这几乎无法评估。没有定价表、没有基准测试表、也没有许可证——只是一个定位声明。
2026年8月3日,Qwen3.8-Max正式全面可用——一份真实的价目表,每百万token收费2美元/6美元;一张带有数字的基准测试表;一个与OpenAI和DashScope兼容的端点。9月2日,阿里巴巴在不改变版本号的情况下发布了下一步进展:Qwen3.8-Max-0902,一次针对编程和智能体任务的后训练刷新,首发即在Code Arena: WebDev排行榜上以1691 Elo登顶。而Claude Fable 5——阿里巴巴在7月一直将自己直接定位在其身后的那款模型——在同一榜单上以1628 Elo位列其后。7月的问题变得更加尖锐:Qwen 3.8是仍然“仅次于Fable 5”,还是编程这条轴已经反转?
给构建者的一点提示:要验证这种说法,最快的方法就是用自己的提示词分别运行这两个模型。OrcaRouter 将 200 多个模型汇集在一个兼容 OpenAI 的端点之后,因此你可以在同一个任务上让 Qwen 3.8 Max 与 Fable 5 直接对决,而无需接入两套 SDK。
太长不看版结论。Qwen3.8-Max-0902 是阿里巴巴 2.4T 旗舰模型迄今最强的版本,而它此番论证中新增的部分不再是自报数据:它在独立的 Code Arena: WebDev 排行榜上一亮相便以 1,691 Elo 位列第一,超过该榜第 8 名(1,628 Elo)的 Claude Fable 5。价格未变,依然是决定性优势:按每 100 万 token 计价,Qwen 输入 $2、输出 $6,Fable 5 输入 $10、输出 $50——也就是说,Qwen 的输入价格约为后者的 1/5,输出价格约为 1/8。尚未缩小的是通用能力上的差距:在 Artificial Analysis 的 Intelligence Index 中,Qwen3.8-Max 为 56 分,Claude Fable 5 为 62 分;在 Arena 综合榜最新公布的一周(8 月 24–30 日)中,Fable 5 以 1,508 Elo 守住了第一,Qwen3.8-Max 以 1,479 Elo 位列第 20。于是有两种结论:在编码上,Qwen 的 0902 新版如今有了裁判,也拿下了一场胜利;在广泛且经过核验的推理上,Claude Fable 5——以及 Anthropic 更新、以 66 分领先 AA 指数的 Claude Fable 5.1——依然守住了阵地。
关键要点
• Qwen3.8-Max 于 2026 年 8 月 3 日正式发布(GA),其 0902 刷新版于 9 月 2 日随之推出 ——版本号未变,$2 / $6 价格不变,上下文长度仍为 1M token。
• 价格差距巨大: Qwen 每 1M 的价格为 $2 / $6,而 Fable 5 为 $10 / $50。输入价格约为 5 倍,输出价格约为 8 倍,而且 Qwen 的费率在整个 1M-token 上下文中保持一致,没有长提示附加费。
• 现在双方都有独立评分,而它们的指向并不相同。Qwen3.8-Max 在 Artificial Analysis Intelligence Index 中测得 56 分(Claude Fable 5:62),其 0902 版本在 Code Arena: WebDev 中以 1691 Elo 领先于 Fable 5 的 1628。
• Qwen 自家的基准测试成绩依然亮眼,也仍然是厂商自测数据。GPQA Diamond 92.6、PaperBench 93.0、Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1——但9月2日的这次刷新,是Qwen首个被独立竞技场评为第一的成绩。
• 规格表中的架构空白已补齐。Qwen3.8-2.4T-A95B 总参数为 2.4T,其中约 95B 为活跃参数,分布在 512 个专家中——该信息随 8 月 12 日开源权重发布而披露。Fable 5 的架构仍未公开。
• 开放权重已经发布,而不仅仅是承诺。Qwen3.8-2.4T-A95B(BF16 和 FP8)于 8 月 12 日登陆 Hugging Face 和 ModelScope,采用定制的 Qwen3.8-Max 许可协议;Qwen3.8-27B 则于 8 月 14 日在 Apache 2.0 许可下紧随其后发布。Fable 5 仍保持闭源,仅提供 API 访问,且永久如此。
准确性说明:阿里巴巴自有基准测试表中的数据仍为厂商自报,且未经独立复现。本文所列的独立数据均带时间戳且来自第三方:Artificial Analysis Intelligence Index(Qwen3.8-Max 56、Claude Fable 5 62、Claude Fable 5.1 66)、Code Arena: WebDev Elo 榜单以及 Arena 常规周榜——Arena 评分会随票数累积而浮动,0902 版本居首的说法来自阿里巴巴对某一时点榜单的公告。Fable 5 的 95.0% SWE-bench Verified 成绩由 Anthropic 报告;Qwen 的定价则来自阿里云百炼(Alibaba Model Studio)的正式商用(GA)价目表。
规格与价格,并列对比
以下是硬数据,每项数据均注明其来源。
• 开发方 / 状态 — Qwen3.8-Max:阿里巴巴;GA:2026年8月3日;0902 刷新版:2026年9月2日。Claude Fable 5:Anthropic;GA 旗舰版
• 架构 — Qwen3.8-Max:总参数2.4T / 激活参数约95B,稀疏MoE,512个专家(8月12日披露);Fable 5:未披露
• 上下文窗口 — Qwen3.8-Max:1M tokens(思考模式下为 983,616;最大输出 131,072);Fable 5:长上下文旗舰模型
• AA智能指数 — Qwen3.8-Max:56;Claude Fable 5:62;Claude Fable 5.1(9月1日):66,领先
• SWE-bench Verified — Qwen3.8-Max:未报告(阿里巴巴报告的是 FrontierSWE 73.5);Fable 5:95.0%(Anthropic / buildfastwithai)
{{1}}独立测评与厂商报告优势{{/1}} — {{2}}Qwen3.8-Max:Code Arena WebDev 第 1 名,1,691 分(0902,独立测评);厂商数据表:GPQA Diamond 92.6,PaperBench 93.0,Terminal-Bench 2.1 86.6。{{/2}}{{3}}Claude Fable 5:AA 62;SWE-bench Verified 95.0%{{/3}}
• 定价(输入/输出)— Qwen3.8-Max:$2.00 / $6.00 每 1M,在 1M 上下文中统一;缓存输入 $0.25;Fable 5:$10 / $50 每 1M
• 开放权重 — Qwen3.8-Max:2026年8月12日发布(自定义许可证,非Apache);Qwen3.8-27B于8月14日采用Apache 2.0许可发布。Fable 5:否 — 封闭/仅限API
• 多模态 — Qwen3.8-Max:文本、图像、视频输入 → 文本输出;Fable 5:多模态旗舰
有两件事框定了整个比较。第一件在8月3日发生变化,至今仍然成立;第二件在9月2日又发生了变化。
首先,价格栏现在是页面上最抢眼的东西。七月份,Qwen的成本优势是一张折扣券——额度打一折,临时性的,没有可参照的每token费率。现在它变成了一张价目表,这种差距是结构性的,而非促销性的。以6美元的输出价格对比Fable的50美元,你可以用一次Fable调用的价格运行大约八次Qwen调用。对于任何你按量付费而非为单个最难的答案买单的工作负载,这种比率会改变你构建的架构。
其次,基准测试的竞争已不再一边倒。在八月的大部分时间里,老老实实地看,可读的内容很有限:阿里巴巴拿出了 FrontierSWE 73.5 和一张自行运行的数据表,Anthropic 拿出了经第三方核查的 95.0% SWE-bench Verified,而 Qwen 则根本没有独立评测机构给它评过分。0902 构建改变了这一局面。Code Arena: WebDev 是一个盲测的成对人工投票竞技场——也就是原先的 WebDev Arena,运营者与阿里巴巴毫无关系——而 Qwen3.8-Max-0902 以 1,691 Elo 登上该榜并位列第一,超过 Claude Opus 5(1,688)、Kimi K3(1,674)以及 Claude Fable 5(1,628,第 8 名)。要让这个说法保持严谨,有两点需要说明:这只是一个榜单,衡量的是智能体化前端开发能力,而非通用能力;所谓“初次上榜即第一”,也只是阿里巴巴对某一时点榜单名次的宣告。但“Qwen 没有任何裁判”这一说法已经不再成立,而这一点对竞争格局的改变,胜过榜单上任何一个孤立的数字。

差价实际上能买到什么
抽象的倍数不如具体的示例有用,因此这里给出一个。以一个代码审查智能体为例,它每次调用发送 150,000 个 token 的代码库上下文,并生成 6,000 个 token 的审查内容。
• Qwen3.8-Max:0.15M × $2 = $0.30,加上 0.006M × $6 = $0.036。≈ $0.34/次调用。
• Claude Fable 5:0.15M × $10 = $1.50,加上0.006M × $50 = $0.30。≈ 每次调用$1.80。
• 按每天2,000次调用计算:Qwen ≈ $672/天;Fable ≈ $3,600/天。一个月下来大约是$20,000与$108,000。
• 在稳定的仓库上下文中启用提示缓存后,Qwen 的缓存输入价格为每 100 万 token 0.25 美元,将输入端成本从 0.30 美元降至不到 0.04 美元,使每次调用的成本降至 约 0.08 美元——比 Fable 每次调用便宜约 22 倍。
这并非边际性的节省;它是在每个拉取请求上都运行审查者与只对高风险请求运行审查者之间的差别。而且,随着提示词的增长,Qwen的固定费率上下文使这种效果更加显著:由于阿里巴巴不收取长提示词附加费,处理一个90万token的上下文与处理一个5000token的上下文,每个token的成本完全相同。
公正的权衡因素在于,每个token的价格并不等于每个已解决任务的价格。如果Fable 5在一次尝试中就能解决问题,而更便宜的模型需要三次尝试加上人工修正,那么更便宜的模型总体上可能花费更多——而在最困难的推理任务上,Fable经审计的#1排名是现有最佳证据,表明它确实能一次解决更多问题。Qwen的成本优势在批量大、容错性高的工作负载上最强,在批量小、风险高的工作负载上最弱。
0902 命名:能力跃升,版本号却未变
9月2日真正值得注意的,是阿里巴巴没有发布 Qwen 3.9。这项改进以带日期的检查点形式发布,沿用的还是同一个模型名称——Qwen3.8-Max-0902——API 也以相同的名称和相同的价格对外提供。这正是行业正在慢慢靠拢的方向:当能力跃升不再保证带来新版本号时,“该用哪个模型”就变成了一个关于构建版本和日期的问题,而不再只是关于系列名称的问题。
这也意味着{{1}}“Qwen3.8-Max”的基准测试分数是有保质期的:在七月或八月构建版本上测得的分数,未必符合 API 今天返回的模型的实际表现。{{/1}}{{2}}请检查你实际调用的端点上的构建标识符——{{KEEP}}0902{{/KEEP}}这个编号,正是判断模型在 Code Arena: WebDev 上是落后于 Claude Fable 5、还是领先于它的关键。{{/2}}
证明,以及它为何仍然决定这场对局。
关于Qwen3.8-Max最常被引用的实测证据,来自一篇预览期的评测(thomas-wiegold.com),该评测让模型经历了四个真实的构建任务。结果确实令人印象深刻:Qwen 一次完成了用Go编写的扑克模拟——这是第三个仅凭单次尝试就通过该提示测试的模型,前两个分别是Fable 5和Grok 4.5——而在一个咖啡烘焙商网站的提示测试中,它产出了评测者在该测试中所见过的最佳输出,还纯粹出于细致周到,主动添加了本未被要求的购物车、批发专区以及Instagram集成。
问题在于速度:在网站上花了 30 多分钟,扑克模拟又花了 1 小时 20 分钟,使它成为该评测者用过的最慢模型。如今,这一结论需要加上一个附加说明,而在七月份时并不需要。这项测量是在预览基础设施上完成的,由一位评测者在异常长的 agentic 运行中测得;GA 服务则是另一套系统。顺带一提,OrcaRouter 自身的 7 天遥测数据目前显示,Qwen3.8-Max 的p50 首令牌延迟(time-to-first-token)为 1.64 秒——这是第一方测量结果,尽管 TTFT 与长达一小时的构建任务中的端到端吞吐量属于不同指标。诚实的立场是,预览版速度慢这一发现应重新测试,而不应作为当前事实来引用。
0902 更新后,有一点仍然成立:双方各自最强有力的证据依然来自不同地方。Qwen3.8-Max-0902 在 Code Arena: WebDev 上的第一名是一项独立的盲评投票结果,但它只衡量一个排行榜;阿里巴巴自己的基准测试表仍是厂商产物——各实验室自行选择报告哪些基准,而阿里巴巴报告的最弱数字(IFBench 82.8,指令跟随)仍与预览版中对该模型“过度发挥、无视范围约束”的抱怨相吻合。Claude Fable 5 的证据更广泛,且大多来自第三方:AA Intelligence Index 62 分、综合 Arena 排行榜第一名、SWE-bench Verified 95.0%——Anthropic 自家更新的 Claude Fable 5.1 自 9 月 1 日以来也以 66 分领跑 AA 指数。至于“哪款模型能胜任我承担不起出错的工作”,通用场景的答案没有改变。至于“哪款模型能以十分之一的价格交付最好的前端”,答案在 9 月 2 日发生了反转。

开放性:Qwen 已经获胜的维度
Fable 5 永远无法自托管。Qwen3.8-Max 则已实现:8 月 12 日,Qwen3.8-2.4T-A95B 的权重——BF16 及官方 FP8 变体——已上线 Hugging Face 和 ModelScope,使其成为首个任何人都能下载的 Max 级 Qwen。两个注意事项同样值得重视。
第一种是合法的。该版本采用定制的“Qwen3.8-Max”许可,而非Apache 2.0:提供模型即服务或AI工作助手业务、过往收入超过5000万美元的提供商,必须与Qwen协商单独的许可;而月活跃用户超过1亿或月收入超过2000万美元的商业产品,必须显示模型名称。对于内部使用和初创企业来说,这些门槛很少构成约束——但这并非毫无限制。
第二点是物理层面的。一个总参数2.4T的MoE模型在BF16精度下大约需要4.9TB存储(官方FP8检查点则约为其一半),而每块H200的内存约为141GB——因此,自托管这个旗舰模型意味着在你服务第一个token之前,就得先备好一整架加速器。已披露的约95B激活参数至少能让你估算这架加速器能换来什么。对几乎所有团队而言,使用托管API($2 / $6)才是切实可行的路径。
这就是为什么 Qwen3.8-27B 仍是实际意义上重要的自托管版本——其 Apache-2.0 权重随后于 8 月 14 日发布,据报道仅需约 17GB 显存即可运行。如果你偏好 Qwen 而非 Fable 5 的原因是数据驻留或本地部署控制,而不是纯粹的原始能力,那么 27B 才是真正满足这一需求的模型——而且对双方来说,开放性对比已不再是理论层面的问题。
常见问题
Qwen 3.8 比 Claude Fable 5 更好吗?
{{1}}现在这取决于衡量标准,这与八月相比是一个真正的变化。{{/1}}{{2}}在编码方面,Qwen3.8-Max-0902 领先:在 Code Arena: WebDev 上排名第一,Elo 为 1,691,而 Claude Fable 5 为 1,628;价格方面,Qwen 为 $2 / $6,而 Fable 5 为 $10 / $50。{{/2}}{{3}}在广泛且经过审计的质量方面,Fable 5 仍然领先:在 AA Intelligence Index 上以 62 分领先于 Qwen 的 56 分,SWE-bench Verified 达 95.0%,并在通用 Arena 排行榜上排名第一。{{/3}}{{4}}对于答案错误代价高昂的工作,Fable 5 是文档更完善的选择;而对于大批量编码和智能体网页任务,最新的 Qwen 既更便宜,又在竞技场排名中更靠前。{{/4}}
仅次于《神鬼寓言5》的说法是真的吗?
阿里巴巴的定位是在没有独立数据的情况下做出的,而0902版本此后已经改变了其形态。Qwen3.8-Max-0902 在 Code Arena: WebDev 上领先 Claude Fable 5(1,691 对 1,628),但在 AA Intelligence Index 上落后(56 对 62),在通用 Arena 排行榜上也落后(Qwen 第20名,Elo 1,479;Fable 5 第1名,1,508)。因此,“仅次于 Fable 5”已经变成了“在这次刷新针对的编程排行榜上领先 Fable 5,在广泛的通用排行榜上落后于它”。
Qwen 3.8 比 Fable 5 便宜多少?
大幅降价,而且现在这是实际费率而非折扣价。Qwen3.8-Max 每100万token的价格为2美元/6美元,而Fable 5为10美元/50美元——输入约便宜5倍,输出约便宜8倍。Qwen的费率在完整的100万上下文窗口内保持统一,缓存输入为每100万token 0.25美元,使得重复上下文的工作负载成本更低。
Qwen 3.8 Max 退出预览了吗?
是的。它已于2026年8月3日全面上市,发布了公开价目表,并提供了兼容OpenAI和DashScope的端点。7月流传的Qoder积分活动和90%折扣预览表述已不再反映该模型的销售方式。
根据早期评测,Qwen 3.8 仍然是最慢的模型吗?
这一发现来自一位评审者,在预览基础设施上运行时长一小时的智能体构建任务,并且应该针对 GA 服务重新测试,而不是视为当前事实。OrcaRouter 的 7 天遥测数据显示 p50 首令牌时间为 1.64 秒,不过该指标衡量的是首令牌延迟,而非超长构建中的吞吐量。
我能否自托管 Qwen 3.8 而无需为 Fable 5 付费?
对于Qwen来说,答案是肯定的,但有限定条件。Qwen3.8-2.4T-A95B自8月12日起以自定义许可证(而非Apache 2.0)提供下载,Qwen3.8-27B则自8月14日起以Apache 2.0许可证提供下载。实际门槛在于硬件:一个总参数量2.4T的MoE模型在BF16下大约需要4.9TB——相当于一整架加速器——因此大多数团队仍会以$2/$6的价格调用托管API,而不是自行部署旗舰版。Fable 5已永久关闭。
我今天应该用哪一个?
对于出错代价高昂的通用工作——高难度推理、高风险生产路径——Claude Fable 5 仍然是文档更完善的选择,而 Anthropic 的 Claude Fable 5.1 进一步扩大了这一领先优势。对于大批量编码和智能体式 Web 开发,Qwen3.8-Max-0902 如今在独立竞技场评测中占据优势,且输出价格大约低 8 倍:批量代码审查、前端生成、长文档分析。许多团队应当同时运行两种模型,并按任务进行路由。
底线
Qwen 3.8 与 Claude Fable 5 之间的对比,与一个月前已不可同日而语,与一周前相比又有了新变化。Qwen3.8-Max 是一款正式可用的模型,其费率卡在输入价格上仅为 Fable 5 的 1/5,在输出价格上仅为 1/8,且按百万 token 统一定价——自 9 月 2 日起,同一名称对应的是 0902 版本,该版本如今在独立竞技场中位列智能体网页开发第一名,在该榜单上超越了 Fable 5。
现在,没有任何一款模型能够独占全面的优势。Claude Fable 5——以及 Anthropic 的 Claude Fable 5.1,后者自9月1日以来以66分领跑 AA 智能指数——占据着广泛且经过审计的通用能力阵地,而阿里巴巴自家的基准测试表仍不过是厂商自制的产物。但这场对决在7月之所以一边倒的原因——即 Qwen 当时完全没有独立裁判——已于9月2日失效:Qwen3.8-Max-0902 已成为 Code Arena: WebDev 上排名第一的模型。明智的答案依然是按风险程度和任务类型分开选择——在出错代价高昂的通用推理场景中用 Fable 5,在大规模编码场景中用 Qwen3.8-Max,因为价格差距和竞技场优势都对后者有利——并且在你自己的提示词上对两者都进行实测。

本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
