一张标题为“Claude Haiku 5.5 vs Qwen3.8-Flash-Next”的主视觉卡片,显示 Claude Haiku 5.5 输入 $0.10、输出 $0.50,上下文 1M,对比 Qwen3.8-Flash-Next 输入 $0.15、输出 $0.47,上下文 256K,中间一行写着“3:1 混合 $0.20 vs $0.23”,底部一行写着“Index v4.3.2 - 43.40 vs 39.82 - 每任务 $0.21 vs $0.37”。
Engineering & Research

Claude Haiku 5.5 对比 Qwen3.8-Flash-Next:每 token 相差三美分,每完成一个任务却相差七十八美分

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

把两份价目表并排放在一起,它们看起来就像出自同一场会议。Claude Haiku 5.5输入 $0.10,输出 $0.50。Qwen3.8-Flash-Next输入 $0.15,输出 $0.47。这家厂商的模型输入便宜三分之一,输出贵 6%。两家厂商都不是偶然定出这样的形态,也都没有发布一份对比说明来阐述自己的目标——但按 3:1 的混合工作负载算一算,其意图便清晰可辨,而这也让这两者成为整个这一档位中定价最接近的一对。

相似之处仅止于此。Claude Haiku 5.5 是于 2026-10-07 发布的闭源 API 模型,拥有百万 token 窗口和 128,000 token 的最大输出。Qwen3.8-Flash-Next 是拥有 1800 亿参数、60 亿激活参数的开源权重模型,权重以 Qwen Community License 1.0 协议发布于 Hugging Face,而其公布的上下文窗口与其自身的 checkpoint 配置以及独立评测榜的说法并不完全一致。它于 2026-08-26 发布,对于任何在这一档位做开发的人来说,既不算新,也算不上稀奇。

这两者被放在一起定价是有意为之。费率表无法告诉你的是,它们是为不同的用途而打造的,而在电子表格上看起来更便宜的那个,运行起来反而更贵。

泄露定价的算术

将这两个费率按常见的 3:1 输入输出比例——大多数聊天和代码辅助流量所接近的比例——进行混合计算,Claude Haiku 5.5 每百万 token 为 $0.20,Qwen3.8-Flash-Next 每百万 token 为 $0.23。按这一混合比例计算,Anthropic 的模型约便宜 13%,这一差距比输入列所显示的更小,但比输出列所显示的更大。

比例一换,位置就变了。在 1:1 时,两者分别为每百万 $0.30 和 $0.31——差距落在舍入误差之内,属于平局。在 1:3、以输出为主时,Claude Haiku 5.5 为 $0.40,Qwen3.8-Flash-Next 为 $0.39,Qwen 以一分钱之差胜出,而这也是 Anthropic 的模型并非两者中更便宜一方的唯一比例。

所以,对于“哪个更便宜”并不存在一个诚实的唯一答案,任何给出唯一答案的比较,都是在替读者选定一个比例。站得住脚的说法是这样的:Claude Haiku 5.5 的定价卡是按输入密集型流量加权的,Qwen3.8-Flash-Next 的则是按输出密集型流量加权,而两者在 3:1 比例下相差的每百万 token 三美分,是这个档位上迄今最接近 Anthropic 那个数字的。无论发布会材料怎么说,这都是一种刻意的定位。

我们的价目表将 Qwen3.8-Flash-Next 列为每百万 token 输入 0.15 美元、输出 0.47 美元,缓存输入价格为 0.0184 美元。0.15 美元和 0.47 美元与 Artificial Analysis 记录的该提供商标价数字相同,而这正是转售安排本应产生的结果。

一天真实成交量究竟要付出多大代价

假设有一条流水线,每天处理 1000 万个输入 token 和 200 万个输出 token。这属于很小的生产工作负载,在典型的提示词长度下,完全可以落在第一个定价档位之内。

• 输入成本 —— 使用 Claude Haiku 5.5 每天 1.00 美元,使用 Qwen3.8-Flash-Next 每天 1.50 美元。

• 输出成本——在 Claude Haiku 5.5 上每天 1.00 美元,在 Qwen3.8-Flash-Next 上每天 0.94 美元。

• 每日总计 — $2.00 对比 $2.44。按此规模,一年相差约 $160,约合每百万 token 3.7 美分。

现在应用费率卡遗漏的两项调整,方向就会逆转。

首先,Claude Haiku 5.5 使用的是与 Claude 4.7 及之后版本共享的较新分词器;根据 Anthropic 自己的文档,对于同一段文本,它计入的 token 数比它所取代的模型多约 30%。如果你的输入是测量这些 token 计数时所采用的那类英文散文,那么有效输入价格就不是 $0.10——而是接近每百万词文本 $0.13,这使它距离 Qwen3.8-Flash-Next 仅差两美分,而不是比后者低三分之一。

第二点,也是更重要的一点:Claude Haiku 5.5 很啰嗦。Artificial Analysis 在运行 Intelligence Index 时记录到它的输出 token 数为 162,164,而 Qwen3.8-Flash-Next 为 107,884。如果这个比例在你的工作负载上成立,而不是抽象的 3:1,那么上面的输出一行就不再是 $1.00 对 $0.94,而会变成接近 $1.50 对 $0.94——每日总计也会转而有利于 Qwen。

两种调整单独来看都不起决定作用。但合在一起,它们就决定了两种模型之间究竟是只有四舍五入级别的微小差距,还是 Qwen3.8-Flash-Next 在运营成本上明显更低;而要判断究竟属于哪种情况,唯一的方法是基于你自己的流量实际统计 token 数,而不是根据价目表去推断。

A two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next - the scoreboard' with rows Index v4.3.2 43.40 against 39.82, cost per task $0.21 against $0.37, time per task 424.6s against 1,524.3s, Terminal Bench 4.0 0.3283 against 0.2525, AutomationBench 0.3541 against 0.5591 and context 1M tokens against 256K tokens, footed 'Board figures per Artificial Analysis v4.3.2; context and price per vendor documentation.'

统一费率不再显得统一之处

Claude Haiku 5.5 的价格是阶梯式的,而 Qwen3.8-Flash-Next 的则不是。

• 价格 — Claude Haiku 5.5 每百万 token 输入 $0.10 / 输出 $0.50,提示词在 100,000 token 以内适用,超过后为 $0.50 / $2.50;Qwen3.8-Flash-Next 统一 $0.15 / $0.47。

• 缓存输入 — Claude Haiku 5.5 的读取费用为 $0.01,写入费用为 $0.125;Qwen3.8-Flash-Next 的读取费用为 $0.016,写入费用为 $0.23。

• 上下文 — Claude Haiku 5.5 为一百万个 token。对于 Qwen3.8-Flash-Next,这个数字取决于你问的是谁:Qwen 公布的是 100 万 token 的窗口,该 checkpoint 自身的配置将位置嵌入上限设为 262,144,而 Artificial Analysis 记录的评估配置为 256,000。

• 最大输出量 — Claude Haiku 5.5 为 128,000 个词元;而根据我们目录中 Qwen3.8-Flash-Next 的条目,其最大输出量为 131,072 个词元。

• 输入模态 — Claude Haiku 5.5 支持文本和图像;Qwen3.8-Flash-Next 支持文本。

• 发布 — Claude Haiku 5.5 为 2026-10-07,Qwen3.8-Flash-Next 为 2026-08-26。

• 权重 — Claude Haiku 5.5 为专有、仅可通过 API 获取;Qwen3.8-Flash-Next 则在 Qwen 社区许可 1.0 下开放权重。

这些行中有三条与价格标题所指向的方向相反,而提示长度这一档的落差最为陡峭。在提示低于 100,000 个 token 时,Claude Haiku 5.5 在两条费率上都属于更便宜的模型。超过这一阈值后,Anthropic 的输入费率涨至五倍,而 Qwen3.8-Flash-Next 在输入上仍保有 3.3 倍的优势,在输出上保有 5.3 倍的优势。该阈值大致与上下文窗口本就出现分化的位置相吻合——一个模型为一百万个 token,另一个为 262,144 个——因此,需要长窗口的流水线,也正是为获得它而支付第二档费率的流水线。

那不是对定价的批评;按提示长度分档的费率,是为长上下文模型计费的一种正常方式。这是对比较本身的警告。一场在 8,000 token 提示下进行的正面比较,描述的只是一组价格。同样的两个模型在 400,000 token 提示下则完全是另一组价格,而且在第二种情况下更便宜的那个,在第一种情况下反而是更贵的那个。

供应商表格下方写了什么

两家厂商都没有运行对方的评估套件,因此共同可比的图景仅限于 Artificial Analysis 在双方上都测过的那些行。

• 智能指数 v4.3.2 — Claude Haiku 5.5(Max)为 43.40 分,Qwen3.8-Flash-Next 为 39.82 分。Anthropic 领先 3.57 分,是本系列中最大的综合分差。

• 每完成一项 Index 任务的成本——同一看板上为 $0.21,而对比之下为 $0.37。

• 任务时间——424.6 秒,对比 1,524.3 秒。

• Terminal Bench 4.0 — 0.3283 对 0.2525。Claude Haiku 5.5 领先 7.6 分。

• SciCode —— 0.5498,对比 0.5058。Claude Haiku 5.5,领先 4.4 个百分点。

• 人类最后的考试——0.4439 对 0.3804。Claude Haiku 5.5 领先 6.4 个百分点。

• AutomationBench,部分得分——0.3541 对 0.5591。Qwen3.8-Flash-Next 领先 20.5 分。

Anthropic 赢下六行,其中几行领先幅度很大;Qwen 则赢下一行,领先 20 个百分点。这种格局贯穿整个价格区间:Anthropic 的小模型在推理、科学以及获得答案的成本与延迟方面更强,但在推动多步骤任务直至完成方面更弱。Qwen3.8-Flash-Next 则恰恰相反。

这里综合行与智能体行之间的差距异常大——一边是 3.57 分,另一边是 20.5 分——这使其成为该区间内该维度上最不模糊的一组对比。如果你的工作是一个只需回答一次的难题,那么在你会在意的每一项指标上,Claude Haiku 5.5 都更领先。如果你的工作是一个必须完成任务的智能体,那么 Qwen3.8-Flash-Next 在唯一能预测这一点的行上更领先,而且领先幅度是综合差距的五倍以上。

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

你可以握住的1800亿个参数

对许多团队而言,真正决定这一比较结果的因素,根本不在基准测试表中。

Qwen3.8-Flash-Next 是一个稀疏混合专家模型,总参数量 1800 亿,激活参数量 60 亿——这一比例使得每个 token 所消耗的算力相对于模型的总容量而言保持在较低水平。它依据 Qwen 社区许可证 1.0 发布,Artificial Analysis 将其记录为商业许可证,而非宽松型许可证;在围绕它做规划之前,这个区别值得先读一读,因为社区许可证并不等同于 MIT,它在再分发和规模方面有自己的一套条款。在遵守这些条款的前提下,它可以被下载、自托管、固定到某个检查点、量化以及微调。

Claude Haiku 5.5 不可能是上述任何一种情况。它是专有模型,仅通过 API 提供,既没有公布参数规模,也没有许可证和代码仓库。Anthropic 承诺其可调用状态至少维持到 2027-10-07,这是一项真实而具体的保证——但关于可用性的保证,与权重本身完全是两回事。

实际后果是双向的,值得直白地说出来,而不是作为对任何一方的推销。需要在自有租户内进行推理、需要一个可以与之做差异对比的固定检查点,或需要基于领域数据进行微调的能力的团队,并不是在基准分数上权衡这两个模型。他们选择的是 Qwen3.8-Flash-Next,因为另一个选项无论出多少钱都无法提供他们需要的东西。需要带有已发布系统卡、有文档记录的评估集和退役承诺的托管端点的团队,则选择另一个方向,而权重并不是他们本来会使用的功能。

负责固定费率这一块

关于名称的说明。独立榜单将该模型列为Qwen3.8-Flash-Next;我们自己的目录则以更短的厂商名称 Qwen3.8 Flash 收录同一版本,价格完全相同,为 $0.15 / $0.47,缓存输入费率为 $0.0184,其仓库指向 2026-08-26 发布的 Hugging Face 权重。下文中的数字凡来自 Artificial Analysis,均属于其称为 Qwen3.8-Flash-Next 的条目。两者是同一模型;只是榜单采用了其较长的名称。

Qwen3.8-Flash-Next 已上架 OrcaRouter 目录,按供应商标价提供,0% 加价,原价透传而非混合计价——因此上文的 $0.15 和 $0.47 就是账单上的费率,Qwen 那边的价格一有变动,当天就会反映到我们这边,而不是等到之后某次重新定价。Claude Sonnet 5.5 和 Claude Opus 5.5 同样在该目录中,这让从小模型升级到 Anthropic 中端模型的路径变成一项路由配置,而非第二次集成。一个 API 覆盖 200 多个模型,一个密钥,底层自动故障转移,以及当成本上限应当写在路由里而非应用代码中时,可用的路由 DSL。

Claude Haiku 5.5 不在目录中。它可以通过 Anthropic 自家的 API 访问,而本次对比中 Anthropic 这一部分并非我们目前提供的服务——与其含糊其辞,不如直接说明。

A capture of the OrcaRouter model page for Qwen3.8 Flash under qwen/qwen3.8-flash, showing a maximum output of 131K, text, image and video input, benchmarks published by Qwen on 2026-08-26, and a price strip reading $0.15 input and $0.47 output per million tokens.

这两个中的哪一个,依据是什么?

如果你的流量以输入为主,提示词都在 100,000 个 token 以下,而且你确实在为大规模用量付费,那么 Claude Haiku 5.5 在两条费率线上都是更便宜的模型,并且在七项共同衡量指标中有六项得分更高——但需要注意的是,30% 的分词器差异和 Anthropic 的冗长特性都会侵蚀这一折扣,让它在价目表上看起来比在实际账单上更大。

如果你的流量以输出为主,或者你的提示词长到足以越过 Anthropic 的阈值,又或者你需要用固定费率来做预测,那么 Qwen3.8-Flash-Next 更便宜——在超出该档位后的输出上有时能便宜到五分之一——而且它正是在智能体任务完成度这一项上领先 20 分的模型。

如果你需要的是负重,那根本没法比,价格也从来不在考虑范围内。

在 3:1 的混合下,这两张卡每百万 token 的差距在三美分以内,这已经足够接近,价格不应该成为决定因素。真正决定的是你处在三段中的哪一段,而这是一个关于你的流水线的问题,而不是关于任一模型的问题。