生成的一张标题卡,写着“Claude Haiku 5.5 vs Qwen3.8-Flash-Next”,副标题为“开放权重模型并不是便宜的那个”,一个标有“每完成一个 Intelligence Index 任务的成本”的条形图,Claude Haiku 5.5 标为 $0.21,Qwen3.8-Flash-Next 标为 $0.37,页脚一行写着“独立数据来自 Artificial Analysis;定价来自 Anthropic 和 Alibaba。”真正的 OrcaRouter 标志合成在右下角。
Guides & Insights

Claude Haiku 5.5 对比 Qwen3.8-Flash-Next:开放权重模型并非廉价之选

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

直觉是,阿里巴巴闪速档的开放权重模型会在价格上压过 Anthropic 的闭源小型模型,而就这两个标价数字而言,确实如此:Qwen3.8-Flash-Next在阿里巴巴自家 API 上的价格为每百万输入 token 0.15 美元、每百万输出 token 0.47 美元,而 Claude Haiku 5.5则是 0.10 美元和 0.50 美元。然而,把两者放到同一套基准测试上跑,排序就反转了。Artificial Analysis 测得,Claude Haiku 5.5 在 Max 努力档下每完成一项 Intelligence Index 任务花费 0.21 美元;Qwen3.8-Flash-Next 在同一测量下的成本为 0.37 美元,得分却低三分。更便宜的标价属于账单更高的那个模型,原因也与决定大多数此类对比的因素相同:价目表不等于价格,而开放权重模型的价值体现在别处,而非托管 API 的账单上。那个“别处”,才是这场对决的真正主题。

每一个是什么

这两样东西相隔六周先后落地,它们并非同一类产物。

• Claude Haiku 5.5 — 一款闭权重模型,于 2026 年 10 月 7 日发布,可在 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 和 Claude Platform on AWS 上使用。具有 1M token 上下文,在同步 Messages API 上最多支持 128,000 个输出 token;自适应思考,具备从 Low 到 Max 的力度调节,默认值为 medium;知识截止日期为 2026 年 6 月;价目表在 100,000 个 token 处阶梯变化。

• Qwen3.8-Flash-Next——一款开放权重的专家混合模型,于 2026 年 8 月 26 日以 qwen-community-1.0 许可证发布,被阿里巴巴描述为将支撑 Qwen4 的架构的实验性预览。它存储 125B 主模型参数,外加一张独立的 51B n-gram 嵌入表——在加入 4B 多 token 预测模块之前约为 176B——每 token 激活 6B,拥有 512 个专家、top-10 路由和 48 层。其原生上下文为 262,144 tokens,可通过 YaRN 扩展至 1M,并接受文本、图像和视频输入。

• Qwen3.8-Flash——已上线的商用对应版本,同样自2026年8月26日起在阿里巴巴的QwenCloud上线,每百万输入token收费0.16美元,每百万输出token收费0.47美元,默认上下文长度为100万token。值得与Flash-Next区分开来:一个是可下载并查看的检查点,另一个是明确定价的托管端点。

最后两者之间的区别,正是这个对比之所以有趣的全部原因。Claude Haiku 5.5 与 Qwen3.8-Flash-Next 可竞争的地方很少,因为其中只有一个能在你自己的硬件上运行。

这项经过权衡的议案,指向的却是相反的方向

以下所有独立数据均来自 Artificial Analysis 的 Intelligence Index v4.3.2。Anthropic 和 Alibaba 的费率卡均为两家厂商自行公布的价格。

• 智能指数 — Claude Haiku 5.5 在 Max 努力模式下得分为 43,在 182 个模型中排名第二。Qwen3.8-Flash-Next 得分 40,在同级别 117 个模型中排名第六。两者仅相差三分,Anthropic 略胜一筹。

• 每项任务成本 — 0.21 美元对 0.37 美元。按 token 计费更贵的那个模型,每完成一项任务反而便宜 43%。

• Index 运行中的输出 token 数——Claude Haiku 5.5 为 4.4 亿,Qwen3.8-Flash-Next 为 2.4 亿,而两者的中位数均为 1 亿。Qwen 模型是更高效的写手,却仍是成本更高的任务,这说明差距并非仅来自 token 数量,而是评估器所采用的输入构成与估值方式。

• 输出速度 —— 每秒 241.9 个 token,相比之下为 56.0。在同样的测量中,Claude Haiku 5.5 的速度快出四倍以上;该次运行中 295 秒的首 token 时间,是 Max effort 思考模式造成的产物,而非网络性能指标;Qwen3.8-Flash-Next 的首 token 时间为 2.53 秒。

• 价目表形态 — Claude Haiku 5.5 在 100,000 tokens 处从 $0.10 和 $0.50 跳升至 $0.50 和 $2.50。Qwen3.8-Flash 则无论长度如何都持平在 $0.16 和 $0.47,这在长提示词上是实打实的优势,也是标价论在与长文档正面交锋时唯一还站得住脚的地方。

• 分词器 — Claude Haiku 5.5 使用的是与 Claude 4.7 及更高版本共用的新版分词器,因此同一段文本的 token 计数会比上一代 Haiku 多出约 30%。这会把提示词推向 100,000 token 的档位;这是 Anthropic 自家文档中的说法,而恰恰在 Qwen 固定费率最占优势的长提示词场景下,这一点对该模型不利。

所以这笔权衡的形态是:每个 token 花更多钱,换来更快、稍聪明一点的回答,且每完成一个任务的成本更低,但要留意长输入下的费率断崖。或者每个 token 花更少钱,得到一个更慢的模型,每完成一个任务的成本更高,但费率平稳,并拥有 262,144 token 的原生窗口。

A screenshot of OrcaRouter's model page for qwen/qwen3.8-flash, showing the model card and its list pricing of $0.15 per million input tokens and $0.47 per million output tokens, captured in English.A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 at maximum effort, showing an Intelligence Index of 43 on v4.3.2 at rank 2 of 182 models, a 1,000,000-token context window, 241.9 output tokens per second at rank 8 of 182, a cost of $0.21 per Intelligence Index task, and 440 million output tokens against a 100 million median.

开放权重实际上在哪里改变了算账方式

以上都是对两种托管 API 的比较,而这正是 Qwen3.8-Flash-Next 并非为取胜而设计的比较。它的优势在于不必租用。

• Day-zero 服务支持。 SGLang 发布了 cookbook 页面和专用镜像;vLLM 已提供对应的构建版本,而架构支持的拉取请求仍处于开放状态。NVIDIA 在 GB300 NVL72 机架上验证了二者以及 TensorRT LLM,NeMo 则负责覆盖微调。

• 对于 176B 的检查点而言,硬件门槛很低。51B 的 n-gram 嵌入表可以放在主机内存而非 VRAM 中,因为它的查找地址是预先已知的,可以被预取。正因如此,该模型才能运行在 DGX Spark 集群和 4×RTX PRO 6000 工作站上,再加上当天就能拿到的社区量化版本——1-bit 版本在约 80% 的完整精度下仅需 75GB 内存——让小团队也能用自有硬件跑起来。

• 微调功能可用。这并不是指托管的调优 API:权重归你所有,采用附带常规条件的社区许可证,架构记录在一份技术报告中,该报告公布了消融实验和负面结果。

• 这个窗口比看上去的要小。原生 262,144 个 token,借助 YaRN 可扩展至 1M——而 Claude Haiku 5.5 则是原生 1M,且没有 RoPE 缩放这一附加条件。在那些让 Qwen 的固定费率显得最具吸引力的长文档工作负载上,真正能容纳整份文档的,是另一款模型。

• 这些基准测试成绩由厂商自行报告。阿里巴巴自家的表格显示,Flash-Next 在 DeepSWE 1.1(58.7 对 54.4)、SWE-bench Pro(62.5 对 56.0)和 GPQA Diamond(91.7 对 90.8)上领先于 DeepSeek-V4-Flash-0731,而在 NL2Repo-Bench 上落后(48.1 对 54.2)——仓库级代码生成,这是较小模型唯一未能跟上的智能体维度。这些成绩均未经第三方复现,而该模型发布至今仅六周。

这就是两者之间诚实的边界。Claude Haiku 5.5 是一项按量计费的服务,有着固定的质量上限,也没有可供操作的层面。Qwen3.8-Flash-Next 则是一件产物,它的成本曲线向下弯折,趋近于电力的价格;它的质量上限取决于你能把它服务到什么程度,此外还伴随着一张尚未被复现的基准测试表,以及一套仍在被各运行时消化吸收的架构。

做出决定的现实方式

三个问题便能定论,且只有第一个与基准测试有关。

你有 GPU 吗,或者想要 GPU 吗?如果没有,自托管就只是理论上的可能,上面关于托管方案的比较就是全部结论——无论从每任务成本、速度还是得分来看,赢家都是 Claude Haiku 5.5,但需要注意的是,其 100,000 token 的步长对长提示词不利。如果你确实有加速器,只是利用率低于目标,那么 Qwen3.8-Flash-Next 是为数不多的开源模型之一:其 6B 激活参数解码在大规模运行时确实成本低廉,而每任务 0.37 美元这个数字也就不再是关键指标了。

平均提示词有多长?这是价签论点唯一站得住脚的地方。在 100,000 个 token 以下——而且这还是在经过一个会把数量放大约 30% 的分词器之后——Claude Haiku 5.5 在每一项计费上都更便宜。一旦超过这个数,固定不变的 $0.16 和 $0.47 就是更划算的那张牌,而且随着长度增加,它的优势会一路扩大到 262,144 个 token 的原生窗口;再往上,YaRN 扩展就是另一个工程问题了。

该工作负载对延迟波动的容忍度是多少? 每秒 241.9 个输出 token 对比 56.0,差距悬殊,而自托管部署还会在此基础上叠加排队开销。实时客服或浏览器驱动智能体——Anthropic 为这一层级所列举的工作负载——会明显感受到这种差异。

对于任何想直接回答第二和第三个问题、而不是对它们做推理的人来说,最廉价的手段是共享端点。Qwen3.8-Flash-Next 尚未进入 OrcaRouter 的目录,Claude Haiku 5.5 也没有;我们确实在路由的 Qwen 同门型号是Qwen3.8-Flash,按供应商标价、0% 加价原样传递,它是本次对比中该模型最接近的已服务等效版本,也是长提示词成本测试的合适基线。在 Anthropic 这边,Claude Haiku 4.5、Claude Sonnet 5.5 和 Claude Opus 5.5 如今都能用同一把密钥调用,所以跨两代的价格实验只是一项配置,而不是第二份合同——而且由于定价是原样传递而非混合计价,任何一侧的厂商降价在公布当天就会体现在我们这边。自动故障转移正是让这项实验可以安全地跑在真实流量上的原因:预览模型或无法复现的基准测试表格,恰恰正是该把一条路由指向新东西、同时让一个可信模型守在它后面的情形。

什么会改变答案

两件事,都可以核实。第一件是在同样运行 Claude Haiku 5.5 的评测框架上对 Qwen3.8-Flash-Next 进行的独立评测——厂商的对比表是针对 DeepSeek 的,而独立榜单上的 40 只是一个单点排名。仓库级编码得分才是值得关注的那一行,因为 NL2Repo 正是该模型此前已被证明落后的领域。第二件是运行时相关工作能否落地:vLLM 支持仍在通过公开的 pull request 合并之中,在合并完成之前,自托管这一架构只适合那些乐于折腾的团队,而算不上一条受支持的路径。

在此之前,摘要很短。Qwen3.8-Flash-Next 是更值得拥有的模型,也是租用起来更贵的那个。Claude Haiku 5.5 则是更便宜、更快、得分更高的托管端点,其价目表对任何长内容都毫不留情。该怎么选,取决于你买的是 token 还是 checkpoint——而如果你买的是 token,请注意:这个开放权重模型并不是你所以为的那种折扣。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next — the scoreboard'. Left column Claude Haiku 5.5: weights, closed and API-only; input price $0.10 per million up to 100,000 tokens; output price $0.50 per million up to 100,000 tokens; native context 1,000,000 tokens; independent score 43 on Intelligence Index v4.3.2 at Max effort, rank 2 of 182; cost per task $0.21; measured output speed 241.9 tokens per second. Right column Qwen3.8-Flash-Next: weights, open under the qwen-community-1.0 license; served price $0.16 per million input and $0.47 per million output, flat; native context 262,144 tokens, extensible to 1M with YaRN; independent score 40, rank 6 of 117; cost per task $0.37; measured output speed 56.0 tokens per second. A footer line reads 'Vendor pricing per Anthropic and Alibaba; independent figures per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.