
Claude Haiku 5.5 对比 Qwen3.8-Flash-Next:开放权重模型并非廉价之选
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
直觉是,阿里巴巴闪速档的开放权重模型会在价格上压过 Anthropic 的闭源小型模型,而就这两个标价数字而言,确实如此:Qwen3.8-Flash-Next在阿里巴巴自家 API 上的价格为每百万输入 token 0.15 美元、每百万输出 token 0.47 美元,而 Claude Haiku 5.5则是 0.10 美元和 0.50 美元。然而,把两者放到同一套基准测试上跑,排序就反转了。Artificial Analysis 测得,Claude Haiku 5.5 在 Max 努力档下每完成一项 Intelligence Index 任务花费 0.21 美元;Qwen3.8-Flash-Next 在同一测量下的成本为 0.37 美元,得分却低三分。更便宜的标价属于账单更高的那个模型,原因也与决定大多数此类对比的因素相同:价目表不等于价格,而开放权重模型的价值体现在别处,而非托管 API 的账单上。那个“别处”,才是这场对决的真正主题。
每一个是什么
这两样东西相隔六周先后落地,它们并非同一类产物。
• Claude Haiku 5.5 — 一款闭权重模型,于 2026 年 10 月 7 日发布,可在 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 和 Claude Platform on AWS 上使用。具有 1M token 上下文,在同步 Messages API 上最多支持 128,000 个输出 token;自适应思考,具备从 Low 到 Max 的力度调节,默认值为 medium;知识截止日期为 2026 年 6 月;价目表在 100,000 个 token 处阶梯变化。
• Qwen3.8-Flash-Next——一款开放权重的专家混合模型,于 2026 年 8 月 26 日以 qwen-community-1.0 许可证发布,被阿里巴巴描述为将支撑 Qwen4 的架构的实验性预览。它存储 125B 主模型参数,外加一张独立的 51B n-gram 嵌入表——在加入 4B 多 token 预测模块之前约为 176B——每 token 激活 6B,拥有 512 个专家、top-10 路由和 48 层。其原生上下文为 262,144 tokens,可通过 YaRN 扩展至 1M,并接受文本、图像和视频输入。
• Qwen3.8-Flash——已上线的商用对应版本,同样自2026年8月26日起在阿里巴巴的QwenCloud上线,每百万输入token收费0.16美元,每百万输出token收费0.47美元,默认上下文长度为100万token。值得与Flash-Next区分开来:一个是可下载并查看的检查点,另一个是明确定价的托管端点。
最后两者之间的区别,正是这个对比之所以有趣的全部原因。Claude Haiku 5.5 与 Qwen3.8-Flash-Next 可竞争的地方很少,因为其中只有一个能在你自己的硬件上运行。
这项经过权衡的议案,指向的却是相反的方向
以下所有独立数据均来自 Artificial Analysis 的 Intelligence Index v4.3.2。Anthropic 和 Alibaba 的费率卡均为两家厂商自行公布的价格。
• 智能指数 — Claude Haiku 5.5 在 Max 努力模式下得分为 43,在 182 个模型中排名第二。Qwen3.8-Flash-Next 得分 40,在同级别 117 个模型中排名第六。两者仅相差三分,Anthropic 略胜一筹。
• 每项任务成本 — 0.21 美元对 0.37 美元。按 token 计费更贵的那个模型,每完成一项任务反而便宜 43%。
• Index 运行中的输出 token 数——Claude Haiku 5.5 为 4.4 亿,Qwen3.8-Flash-Next 为 2.4 亿,而两者的中位数均为 1 亿。Qwen 模型是更高效的写手,却仍是成本更高的任务,这说明差距并非仅来自 token 数量,而是评估器所采用的输入构成与估值方式。
• 输出速度 —— 每秒 241.9 个 token,相比之下为 56.0。在同样的测量中,Claude Haiku 5.5 的速度快出四倍以上;该次运行中 295 秒的首 token 时间,是 Max effort 思考模式造成的产物,而非网络性能指标;Qwen3.8-Flash-Next 的首 token 时间为 2.53 秒。
• 价目表形态 — Claude Haiku 5.5 在 100,000 tokens 处从 $0.10 和 $0.50 跳升至 $0.50 和 $2.50。Qwen3.8-Flash 则无论长度如何都持平在 $0.16 和 $0.47,这在长提示词上是实打实的优势,也是标价论在与长文档正面交锋时唯一还站得住脚的地方。
• 分词器 — Claude Haiku 5.5 使用的是与 Claude 4.7 及更高版本共用的新版分词器,因此同一段文本的 token 计数会比上一代 Haiku 多出约 30%。这会把提示词推向 100,000 token 的档位;这是 Anthropic 自家文档中的说法,而恰恰在 Qwen 固定费率最占优势的长提示词场景下,这一点对该模型不利。
所以这笔权衡的形态是:每个 token 花更多钱,换来更快、稍聪明一点的回答,且每完成一个任务的成本更低,但要留意长输入下的费率断崖。或者每个 token 花更少钱,得到一个更慢的模型,每完成一个任务的成本更高,但费率平稳,并拥有 262,144 token 的原生窗口。


开放权重实际上在哪里改变了算账方式
以上都是对两种托管 API 的比较,而这正是 Qwen3.8-Flash-Next 并非为取胜而设计的比较。它的优势在于不必租用。
• Day-zero 服务支持。 SGLang 发布了 cookbook 页面和专用镜像;vLLM 已提供对应的构建版本,而架构支持的拉取请求仍处于开放状态。NVIDIA 在 GB300 NVL72 机架上验证了二者以及 TensorRT LLM,NeMo 则负责覆盖微调。
• 对于 176B 的检查点而言,硬件门槛很低。51B 的 n-gram 嵌入表可以放在主机内存而非 VRAM 中,因为它的查找地址是预先已知的,可以被预取。正因如此,该模型才能运行在 DGX Spark 集群和 4×RTX PRO 6000 工作站上,再加上当天就能拿到的社区量化版本——1-bit 版本在约 80% 的完整精度下仅需 75GB 内存——让小团队也能用自有硬件跑起来。
• 微调功能可用。这并不是指托管的调优 API:权重归你所有,采用附带常规条件的社区许可证,架构记录在一份技术报告中,该报告公布了消融实验和负面结果。
• 这个窗口比看上去的要小。原生 262,144 个 token,借助 YaRN 可扩展至 1M——而 Claude Haiku 5.5 则是原生 1M,且没有 RoPE 缩放这一附加条件。在那些让 Qwen 的固定费率显得最具吸引力的长文档工作负载上,真正能容纳整份文档的,是另一款模型。
• 这些基准测试成绩由厂商自行报告。阿里巴巴自家的表格显示,Flash-Next 在 DeepSWE 1.1(58.7 对 54.4)、SWE-bench Pro(62.5 对 56.0)和 GPQA Diamond(91.7 对 90.8)上领先于 DeepSeek-V4-Flash-0731,而在 NL2Repo-Bench 上落后(48.1 对 54.2)——仓库级代码生成,这是较小模型唯一未能跟上的智能体维度。这些成绩均未经第三方复现,而该模型发布至今仅六周。
这就是两者之间诚实的边界。Claude Haiku 5.5 是一项按量计费的服务,有着固定的质量上限,也没有可供操作的层面。Qwen3.8-Flash-Next 则是一件产物,它的成本曲线向下弯折,趋近于电力的价格;它的质量上限取决于你能把它服务到什么程度,此外还伴随着一张尚未被复现的基准测试表,以及一套仍在被各运行时消化吸收的架构。
做出决定的现实方式
三个问题便能定论,且只有第一个与基准测试有关。
你有 GPU 吗,或者想要 GPU 吗?如果没有,自托管就只是理论上的可能,上面关于托管方案的比较就是全部结论——无论从每任务成本、速度还是得分来看,赢家都是 Claude Haiku 5.5,但需要注意的是,其 100,000 token 的步长对长提示词不利。如果你确实有加速器,只是利用率低于目标,那么 Qwen3.8-Flash-Next 是为数不多的开源模型之一:其 6B 激活参数解码在大规模运行时确实成本低廉,而每任务 0.37 美元这个数字也就不再是关键指标了。
平均提示词有多长?这是价签论点唯一站得住脚的地方。在 100,000 个 token 以下——而且这还是在经过一个会把数量放大约 30% 的分词器之后——Claude Haiku 5.5 在每一项计费上都更便宜。一旦超过这个数,固定不变的 $0.16 和 $0.47 就是更划算的那张牌,而且随着长度增加,它的优势会一路扩大到 262,144 个 token 的原生窗口;再往上,YaRN 扩展就是另一个工程问题了。
该工作负载对延迟波动的容忍度是多少? 每秒 241.9 个输出 token 对比 56.0,差距悬殊,而自托管部署还会在此基础上叠加排队开销。实时客服或浏览器驱动智能体——Anthropic 为这一层级所列举的工作负载——会明显感受到这种差异。
对于任何想直接回答第二和第三个问题、而不是对它们做推理的人来说,最廉价的手段是共享端点。Qwen3.8-Flash-Next 尚未进入 OrcaRouter 的目录,Claude Haiku 5.5 也没有;我们确实在路由的 Qwen 同门型号是Qwen3.8-Flash,按供应商标价、0% 加价原样传递,它是本次对比中该模型最接近的已服务等效版本,也是长提示词成本测试的合适基线。在 Anthropic 这边,Claude Haiku 4.5、Claude Sonnet 5.5 和 Claude Opus 5.5 如今都能用同一把密钥调用,所以跨两代的价格实验只是一项配置,而不是第二份合同——而且由于定价是原样传递而非混合计价,任何一侧的厂商降价在公布当天就会体现在我们这边。自动故障转移正是让这项实验可以安全地跑在真实流量上的原因:预览模型或无法复现的基准测试表格,恰恰正是该把一条路由指向新东西、同时让一个可信模型守在它后面的情形。
什么会改变答案
两件事,都可以核实。第一件是在同样运行 Claude Haiku 5.5 的评测框架上对 Qwen3.8-Flash-Next 进行的独立评测——厂商的对比表是针对 DeepSeek 的,而独立榜单上的 40 只是一个单点排名。仓库级编码得分才是值得关注的那一行,因为 NL2Repo 正是该模型此前已被证明落后的领域。第二件是运行时相关工作能否落地:vLLM 支持仍在通过公开的 pull request 合并之中,在合并完成之前,自托管这一架构只适合那些乐于折腾的团队,而算不上一条受支持的路径。
在此之前,摘要很短。Qwen3.8-Flash-Next 是更值得拥有的模型,也是租用起来更贵的那个。Claude Haiku 5.5 则是更便宜、更快、得分更高的托管端点,其价目表对任何长内容都毫不留情。该怎么选,取决于你买的是 token 还是 checkpoint——而如果你买的是 token,请注意:这个开放权重模型并不是你所以为的那种折扣。

