
Claude Haiku 5.5 对比 Qwen3.8-Flash-Next:每 token 相差三美分,每完成一个任务却相差七十八美分
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
把两份价目表并排放在一起,它们看起来就像出自同一场会议。Claude Haiku 5.5输入 $0.10,输出 $0.50。Qwen3.8-Flash-Next输入 $0.15,输出 $0.47。这家厂商的模型输入便宜三分之一,输出贵 6%。两家厂商都不是偶然定出这样的形态,也都没有发布一份对比说明来阐述自己的目标——但按 3:1 的混合工作负载算一算,其意图便清晰可辨,而这也让这两者成为整个这一档位中定价最接近的一对。
相似之处仅止于此。Claude Haiku 5.5 是于 2026-10-07 发布的闭源 API 模型,拥有百万 token 窗口和 128,000 token 的最大输出。Qwen3.8-Flash-Next 是拥有 1800 亿参数、60 亿激活参数的开源权重模型,权重以 Qwen Community License 1.0 协议发布于 Hugging Face,而其公布的上下文窗口与其自身的 checkpoint 配置以及独立评测榜的说法并不完全一致。它于 2026-08-26 发布,对于任何在这一档位做开发的人来说,既不算新,也算不上稀奇。
这两者被放在一起定价是有意为之。费率表无法告诉你的是,它们是为不同的用途而打造的,而在电子表格上看起来更便宜的那个,运行起来反而更贵。
泄露定价的算术
将这两个费率按常见的 3:1 输入输出比例——大多数聊天和代码辅助流量所接近的比例——进行混合计算,Claude Haiku 5.5 每百万 token 为 $0.20,Qwen3.8-Flash-Next 每百万 token 为 $0.23。按这一混合比例计算,Anthropic 的模型约便宜 13%,这一差距比输入列所显示的更小,但比输出列所显示的更大。
比例一换,位置就变了。在 1:1 时,两者分别为每百万 $0.30 和 $0.31——差距落在舍入误差之内,属于平局。在 1:3、以输出为主时,Claude Haiku 5.5 为 $0.40,Qwen3.8-Flash-Next 为 $0.39,Qwen 以一分钱之差胜出,而这也是 Anthropic 的模型并非两者中更便宜一方的唯一比例。
所以,对于“哪个更便宜”并不存在一个诚实的唯一答案,任何给出唯一答案的比较,都是在替读者选定一个比例。站得住脚的说法是这样的:Claude Haiku 5.5 的定价卡是按输入密集型流量加权的,Qwen3.8-Flash-Next 的则是按输出密集型流量加权,而两者在 3:1 比例下相差的每百万 token 三美分,是这个档位上迄今最接近 Anthropic 那个数字的。无论发布会材料怎么说,这都是一种刻意的定位。
我们的价目表将 Qwen3.8-Flash-Next 列为每百万 token 输入 0.15 美元、输出 0.47 美元,缓存输入价格为 0.0184 美元。0.15 美元和 0.47 美元与 Artificial Analysis 记录的该提供商标价数字相同,而这正是转售安排本应产生的结果。
一天真实成交量究竟要付出多大代价
假设有一条流水线,每天处理 1000 万个输入 token 和 200 万个输出 token。这属于很小的生产工作负载,在典型的提示词长度下,完全可以落在第一个定价档位之内。
• 输入成本 —— 使用 Claude Haiku 5.5 每天 1.00 美元,使用 Qwen3.8-Flash-Next 每天 1.50 美元。
• 输出成本——在 Claude Haiku 5.5 上每天 1.00 美元,在 Qwen3.8-Flash-Next 上每天 0.94 美元。
• 每日总计 — $2.00 对比 $2.44。按此规模,一年相差约 $160,约合每百万 token 3.7 美分。
现在应用费率卡遗漏的两项调整,方向就会逆转。
首先,Claude Haiku 5.5 使用的是与 Claude 4.7 及之后版本共享的较新分词器;根据 Anthropic 自己的文档,对于同一段文本,它计入的 token 数比它所取代的模型多约 30%。如果你的输入是测量这些 token 计数时所采用的那类英文散文,那么有效输入价格就不是 $0.10——而是接近每百万词文本 $0.13,这使它距离 Qwen3.8-Flash-Next 仅差两美分,而不是比后者低三分之一。
第二点,也是更重要的一点:Claude Haiku 5.5 很啰嗦。Artificial Analysis 在运行 Intelligence Index 时记录到它的输出 token 数为 162,164,而 Qwen3.8-Flash-Next 为 107,884。如果这个比例在你的工作负载上成立,而不是抽象的 3:1,那么上面的输出一行就不再是 $1.00 对 $0.94,而会变成接近 $1.50 对 $0.94——每日总计也会转而有利于 Qwen。
两种调整单独来看都不起决定作用。但合在一起,它们就决定了两种模型之间究竟是只有四舍五入级别的微小差距,还是 Qwen3.8-Flash-Next 在运营成本上明显更低;而要判断究竟属于哪种情况,唯一的方法是基于你自己的流量实际统计 token 数,而不是根据价目表去推断。

统一费率不再显得统一之处
Claude Haiku 5.5 的价格是阶梯式的,而 Qwen3.8-Flash-Next 的则不是。
• 价格 — Claude Haiku 5.5 每百万 token 输入 $0.10 / 输出 $0.50,提示词在 100,000 token 以内适用,超过后为 $0.50 / $2.50;Qwen3.8-Flash-Next 统一 $0.15 / $0.47。
• 缓存输入 — Claude Haiku 5.5 的读取费用为 $0.01,写入费用为 $0.125;Qwen3.8-Flash-Next 的读取费用为 $0.016,写入费用为 $0.23。
• 上下文 — Claude Haiku 5.5 为一百万个 token。对于 Qwen3.8-Flash-Next,这个数字取决于你问的是谁:Qwen 公布的是 100 万 token 的窗口,该 checkpoint 自身的配置将位置嵌入上限设为 262,144,而 Artificial Analysis 记录的评估配置为 256,000。
• 最大输出量 — Claude Haiku 5.5 为 128,000 个词元;而根据我们目录中 Qwen3.8-Flash-Next 的条目,其最大输出量为 131,072 个词元。
• 输入模态 — Claude Haiku 5.5 支持文本和图像;Qwen3.8-Flash-Next 支持文本。
• 发布 — Claude Haiku 5.5 为 2026-10-07,Qwen3.8-Flash-Next 为 2026-08-26。
• 权重 — Claude Haiku 5.5 为专有、仅可通过 API 获取;Qwen3.8-Flash-Next 则在 Qwen 社区许可 1.0 下开放权重。
这些行中有三条与价格标题所指向的方向相反,而提示长度这一档的落差最为陡峭。在提示低于 100,000 个 token 时,Claude Haiku 5.5 在两条费率上都属于更便宜的模型。超过这一阈值后,Anthropic 的输入费率涨至五倍,而 Qwen3.8-Flash-Next 在输入上仍保有 3.3 倍的优势,在输出上保有 5.3 倍的优势。该阈值大致与上下文窗口本就出现分化的位置相吻合——一个模型为一百万个 token,另一个为 262,144 个——因此,需要长窗口的流水线,也正是为获得它而支付第二档费率的流水线。
那不是对定价的批评;按提示长度分档的费率,是为长上下文模型计费的一种正常方式。这是对比较本身的警告。一场在 8,000 token 提示下进行的正面比较,描述的只是一组价格。同样的两个模型在 400,000 token 提示下则完全是另一组价格,而且在第二种情况下更便宜的那个,在第一种情况下反而是更贵的那个。
供应商表格下方写了什么
两家厂商都没有运行对方的评估套件,因此共同可比的图景仅限于 Artificial Analysis 在双方上都测过的那些行。
• 智能指数 v4.3.2 — Claude Haiku 5.5(Max)为 43.40 分,Qwen3.8-Flash-Next 为 39.82 分。Anthropic 领先 3.57 分,是本系列中最大的综合分差。
• 每完成一项 Index 任务的成本——同一看板上为 $0.21,而对比之下为 $0.37。
• 任务时间——424.6 秒,对比 1,524.3 秒。
• Terminal Bench 4.0 — 0.3283 对 0.2525。Claude Haiku 5.5 领先 7.6 分。
• SciCode —— 0.5498,对比 0.5058。Claude Haiku 5.5,领先 4.4 个百分点。
• 人类最后的考试——0.4439 对 0.3804。Claude Haiku 5.5 领先 6.4 个百分点。
• AutomationBench,部分得分——0.3541 对 0.5591。Qwen3.8-Flash-Next 领先 20.5 分。
Anthropic 赢下六行,其中几行领先幅度很大;Qwen 则赢下一行,领先 20 个百分点。这种格局贯穿整个价格区间:Anthropic 的小模型在推理、科学以及获得答案的成本与延迟方面更强,但在推动多步骤任务直至完成方面更弱。Qwen3.8-Flash-Next 则恰恰相反。
这里综合行与智能体行之间的差距异常大——一边是 3.57 分,另一边是 20.5 分——这使其成为该区间内该维度上最不模糊的一组对比。如果你的工作是一个只需回答一次的难题,那么在你会在意的每一项指标上,Claude Haiku 5.5 都更领先。如果你的工作是一个必须完成任务的智能体,那么 Qwen3.8-Flash-Next 在唯一能预测这一点的行上更领先,而且领先幅度是综合差距的五倍以上。

你可以握住的1800亿个参数
对许多团队而言,真正决定这一比较结果的因素,根本不在基准测试表中。
Qwen3.8-Flash-Next 是一个稀疏混合专家模型,总参数量 1800 亿,激活参数量 60 亿——这一比例使得每个 token 所消耗的算力相对于模型的总容量而言保持在较低水平。它依据 Qwen 社区许可证 1.0 发布,Artificial Analysis 将其记录为商业许可证,而非宽松型许可证;在围绕它做规划之前,这个区别值得先读一读,因为社区许可证并不等同于 MIT,它在再分发和规模方面有自己的一套条款。在遵守这些条款的前提下,它可以被下载、自托管、固定到某个检查点、量化以及微调。
Claude Haiku 5.5 不可能是上述任何一种情况。它是专有模型,仅通过 API 提供,既没有公布参数规模,也没有许可证和代码仓库。Anthropic 承诺其可调用状态至少维持到 2027-10-07,这是一项真实而具体的保证——但关于可用性的保证,与权重本身完全是两回事。
实际后果是双向的,值得直白地说出来,而不是作为对任何一方的推销。需要在自有租户内进行推理、需要一个可以与之做差异对比的固定检查点,或需要基于领域数据进行微调的能力的团队,并不是在基准分数上权衡这两个模型。他们选择的是 Qwen3.8-Flash-Next,因为另一个选项无论出多少钱都无法提供他们需要的东西。需要带有已发布系统卡、有文档记录的评估集和退役承诺的托管端点的团队,则选择另一个方向,而权重并不是他们本来会使用的功能。
负责固定费率这一块
关于名称的说明。独立榜单将该模型列为Qwen3.8-Flash-Next;我们自己的目录则以更短的厂商名称 Qwen3.8 Flash 收录同一版本,价格完全相同,为 $0.15 / $0.47,缓存输入费率为 $0.0184,其仓库指向 2026-08-26 发布的 Hugging Face 权重。下文中的数字凡来自 Artificial Analysis,均属于其称为 Qwen3.8-Flash-Next 的条目。两者是同一模型;只是榜单采用了其较长的名称。
Qwen3.8-Flash-Next 已上架 OrcaRouter 目录,按供应商标价提供,0% 加价,原价透传而非混合计价——因此上文的 $0.15 和 $0.47 就是账单上的费率,Qwen 那边的价格一有变动,当天就会反映到我们这边,而不是等到之后某次重新定价。Claude Sonnet 5.5 和 Claude Opus 5.5 同样在该目录中,这让从小模型升级到 Anthropic 中端模型的路径变成一项路由配置,而非第二次集成。一个 API 覆盖 200 多个模型,一个密钥,底层自动故障转移,以及当成本上限应当写在路由里而非应用代码中时,可用的路由 DSL。
Claude Haiku 5.5 不在目录中。它可以通过 Anthropic 自家的 API 访问,而本次对比中 Anthropic 这一部分并非我们目前提供的服务——与其含糊其辞,不如直接说明。

这两个中的哪一个,依据是什么?
如果你的流量以输入为主,提示词都在 100,000 个 token 以下,而且你确实在为大规模用量付费,那么 Claude Haiku 5.5 在两条费率线上都是更便宜的模型,并且在七项共同衡量指标中有六项得分更高——但需要注意的是,30% 的分词器差异和 Anthropic 的冗长特性都会侵蚀这一折扣,让它在价目表上看起来比在实际账单上更大。
如果你的流量以输出为主,或者你的提示词长到足以越过 Anthropic 的阈值,又或者你需要用固定费率来做预测,那么 Qwen3.8-Flash-Next 更便宜——在超出该档位后的输出上有时能便宜到五分之一——而且它正是在智能体任务完成度这一项上领先 20 分的模型。
如果你需要的是负重,那根本没法比,价格也从来不在考虑范围内。
在 3:1 的混合下,这两张卡每百万 token 的差距在三美分以内,这已经足够接近,价格不应该成为决定因素。真正决定的是你处在三段中的哪一段,而这是一个关于你的流水线的问题,而不是关于任一模型的问题。
