
Claude Haiku 5.5 vs Qwen3.8-Flash-Next:两种截然不同 token 数量下的 1M 上下文
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
这两款模型宣传标题上的数字完全相同,而这恰恰正是值得认真进行比较的原因。Claude Haiku 5.5 提供 100 万 token 的上下文窗口。Qwen3.8-Flash-Next 也提供 100 万 token 的上下文窗口。但两家厂商衡量这一窗口所用的单位不同,两个模型对同一段文本的分词方式不同,两张价目表的计费形态也各异——因此,“两者都是百万 token 模型”这一说法虽然属实,作为购买标准却几乎毫无用处。真正将它们区分开来的,是各自如何花掉你文档中的 100 万 token,以及在单位换算得可比之后,独立测量结果是否支持厂商的宣传。
这些数字,并排排列,并使用相同的单位。
两家厂商都公布了百万 token 窗口;只有一家公布了在该规模下依然成立的价格。这就是第一个真正的区别:
• 上下文窗口 — Claude Haiku 5.5 1,000,000 个 token,对比 Qwen3.8-Flash-Next 1,000,000 个 token(厂商公布)
• 100K 上下文以内的价格 — Haiku 5.5 每百万 $0.10 / $0.50,对比 Qwen3.8-Flash-Next 每百万 $0.15 / $0.47(厂商价目表)
• 超过 100K 上下文的价格——Haiku 5.5 为每百万 $0.50 / $2.50,而 Qwen3.8-Flash-Next 仍为 $0.15 / $0.47(厂商价目表)
• 独立指数 — Haiku 5.5 43.395 对比 Qwen3.8-Flash-Next 39.822(Artificial Analysis)
• 每任务实测成本 —— Haiku 5.5 为 $0.2128,而 Qwen3.8-Flash-Next 为 $0.37218(Artificial Analysis)
• 每任务实测输出 token 数 —— Haiku 5.5 162,164,对比 Qwen3.8-Flash-Next 107,885(Artificial Analysis)
• 每任务实测墙钟时间——Haiku 5.5 为 426.26 秒,而 Qwen3.8-Flash-Next 为 1,530.19 秒(Artificial Analysis)
• 架构 —— Haiku 5.5 未披露;Qwen3.8-Flash-Next 是一个 180B 模型,激活参数 6B,采用混合专家(MoE)架构(厂商公布)
• 许可 — Haiku 5.5 为闭源且仅提供 API;Qwen3.8-Flash-Next 采用 Qwen 社区许可证 1.0(由厂商发布)
那份清单里影响最大的一行是第三行,而且遥遥领先,毫无悬念。Qwen3.8-Flash-Next 只收取统一的费率——0.15 美元和 0.47 美元——无论请求有多大。Claude Haiku 5.5 则不然:请求一旦超过 100,000 个 token,费率立刻变为五倍,升至 0.50 美元和 2.50 美元。因此,两个标称上下文窗口相同的模型,在整个窗口上的成本曲线却截然不同,而一份 500,000 token 的文档正是让这一点暴露无遗的情形。在 Qwen 上,这个请求的花费就是 500,000 token 请求一贯的花费。在 Haiku 上,它的花费是模型标称费率所暗示的五倍,因为请求中的每一个 token 都按长档费率计费,而不只是超过阈值的那些 token。

为什么每个任务的 token 数比窗口更重要
厂商的费率卡是按 token 对 token 来比较的,这本身没问题,直到你注意到两个模型在完成同样的工作时产生的 token 数量并不相同。Artificial Analysis 自己运行的任务让这一点变得显而易见:Claude Haiku 5.5 完成一项任务实测花费了 162,164 个输出 token,而 Qwen3.8-Flash-Next 只用 107,885 个就完成了。把这一点与每 token 价格放在一起看,Haiku 5.5 纸面上的价格优势就部分蒸发了——Haiku 每项任务的冗长度大约高出 50%,这是一个真实的成本乘数,却从不会出现在费率卡上。
反过来也同样成立,而这正是对 flash 档位而言尤为关键的一点。Qwen3.8-Flash-Next 是一个专家混合(Mixture-of-Experts)模型,拥有 1800 亿参数,其中 60 亿处于激活状态;Artificial Analysis 测得,在完成一项耗时 1,530 秒的任务时,它的输出速度为每秒 56.04 个 token。Claude Haiku 5.5 完成同类任务用了 426 秒。在独立榜单上,Haiku 不仅速度更快,而且按绝对美元计算,每项任务的成本也更低——0.2128 美元对 0.37218 美元——尽管它是两者中更啰嗦的那个。厂商的标价表明 flash 模型是更经济的选择;但完成一项任务的实际测量成本却说明了相反的情况。在把这两个模型中的任何一个纳入成本模型之前,这一差距都值得弄清楚。
Anthropic 自己对 Claude Haiku 5.5 的官方表述是:与它所取代的模型相比,其平均运行成本大约低 75%;而它新的分词器对同一段文本会多产出约 30% 的 token。这两句话都出自厂商自己,而它们在这里都很重要,因为正是第二句让第一句成为一个净额数字,而不是标价数字。就与 Qwen 的对比而言,关键在于 token 数量的差异是真实且经过测量的,而非理论上的——独立的任务运行会直接显示出这一点。
长上下文案例,精心完成
把一份真正庞大的文档同时摆在两者面前,根据你如何使用它,这两张费率卡会得出相反的结论。按每次请求 60,000 个 token 计算,Claude Haiku 5.5 在输入和输出上都更便宜——$0.10 / $0.50 对 $0.15 / $0.47,而且在以输入为主的工作负载中,Haiku 的冗长惩罚还没有大到足以扭转这一点。按每次请求 200,000 个 token 计算,Haiku 的输入费率是 $0.50,而 Qwen 是 $0.15;其输出费率是 $2.50,而 Qwen 是 $0.47。Qwen 在输入上的成本只有三分之一,在输出上约为五分之一,并且一直到百万 token 窗口结束都保持如此。
这其中的意义之所以超出算术本身,是因为这两个模型虽然宣称相同的窗口大小,用途却各不相同。Qwen3.8-Flash-Next 的卖点是统一价格下的大窗口,这也正是它成为检索密集型与文档密集型工作候选方案的原因:把整个文档喂进去,按可预测的费率付费,不必再搭建检索层。Claude Haiku 5.5 的百万 token 窗口是真实且可用的,但它的长上下文定价让它更像是一个你为特定目的才会穿越的地方,而不是你日常栖居之所。如果你的工作负载是每次调用处理一份大文档,那么仅凭定价结构就会把你推向 Qwen;如果情况是大量小调用夹杂偶尔一次大调用,那么 Haiku 的短上下文档位才是容纳那大量小调用的更便宜的家,而偶尔的大调用则是一笔你可以单独为之做预算的成本。
独立董事会如何评价能力
两者之间的能力差距确实存在,而且更有利于 Claude Haiku 5.5,但幅度小于价格结构可能暗示的程度。Artificial Analysis 在其智能指数中给 Haiku 打出 43.395,而 Qwen 为 39.822——相差约百分之九,这不容忽视,但远不到一代之差。在难度更高的子基准测试上,这一排序依然成立:Terminal-Bench Hard 上为 0.329 对 0.253,HLE 上为 0.444 对更低的数值,而且在榜单公布的智能体(agentic)指标上,Haiku 也处于领先。

相比之下,Qwen3.8-Flash-Next 在每参数成本的经济性上胜出,还胜在其权重以 Qwen Community Licence 1.0 提供——因此与 GLM 系列一样,想要自托管的团队可以自行托管。Claude Haiku 5.5 则做不到。对于推理必须在自己硬件上运行的工作负载而言,无论闭源模型得分多高,它都不是候选方案;而如果这正是你所受的约束,180B/6B 的 MoE 配置至少算得上是一个值得尝试自行运行的选择。
智能体功能则朝另一个方向打破了平衡。Claude Haiku 5.5 自带自适应思考、默认强度设置为 medium,并且——在 Haiku 系列中首次——提供从 Low 到 Max 的可调强度旋钮。Qwen3.8-Flash-Next 并未宣传有同等的控制能力。对于希望按每次调用权衡延迟与推理深度的智能体工作来说,这个旋钮是 Haiku 的一个真正差异化优势,而这是一项价格比较无法体现的能力。
从一处同时运行两者
这两个模型常常落在同一条线的两侧,以至于一个生产级技术栈最终会两者都想要——用 Haiku 处理简短、高质量的调用,用 Qwen 处理长上下文摄取。OrcaRouter 提供 qwen/qwen3.8-flash,即 Qwen3.8-Flash-Next 的同门兄弟,每百万 token 收费 0.15 美元和 0.47 美元,拥有 100 万 token 的窗口,按厂商标价、零加价,并与 200 多个模型组成的目录中其余模型共用同一个密钥和同一份账单。
Claude Haiku 5.5 和 Qwen3.8-Flash-Next 本身都不在我们的目录中——要获取它们,得去厂商自己的 API 以及若干第三方平台。在这场对比中,我们提供的是基础版 Qwen3.8-Flash 模型:它覆盖了大多数原本会为了 Next 变体而购买的长上下文场景;再加上透传定价,厂商调价当天就会在我们这边生效;还有自动故障转移,让生产路径在服务商遭遇故障时仍能持续运行。
简短的回答
如果你的请求低于 100,000 个 token,而你又想用更强的模型,那么 Claude Haiku 5.5 不仅每 token 更便宜,得分还更高,选择也就一目了然。如果你的请求经常超过 100,000 个 token——而这正是你会在意百万 token 上下文窗口的唯一原因——Qwen3.8-Flash-Next 的固定费率让它在长请求这一端便宜三到五倍,而且它实测的输出 token 数更低,所以你账单上的差距会比标价上的差异更大。

决定之前要厘清的数字,不是哪个模型的窗口更大;两者的窗口一样大。要厘清的是你的请求大小分布形态,因为正是它决定你实际适用这两份价目表中的哪一份。取请求大小的第 95 百分位数,拿它去比 100,000 token 这条线,那么上面的比较对你的流量来说就会归结为一句话。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
