一张生成的主视觉卡片,标题为“Claude Haiku 5.5 vs Qwen3.8 27B”,引题为“开放权重 vs API”,显示 Claude Haiku 5.5 的输入 $0.10、输出 $0.50、指数 43.40,对比 Qwen3.8 27B 的输入 $0.50、输出 $3.00、指数 33.70,下方条形栏显示“每项已完成任务的成本 $0.21 vs $1.01”。
Engineering & Research

Claude Haiku 5.5 对比 Qwen3.8 27B:在 API 上取得完胜,以及开放权重为何依然存在

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

本系列中的大多数对比最终都归结为一种取舍。这一次并非如此,而取舍的缺席本身就是一个发现。Claude Haiku 5.5于 2026 年 10 月 7 日发布,击败了Qwen3.8 27B——即 2026 年 8 月 14 日推出的开放权重 27B 稠密模型——在综合智能评分、每 token 成本、每完成一项任务的成本、上下文窗口、响应上限、智能体编程以及科学推理各项上全部胜出;而且这一切都来自一个无需任何硬件的单一专有 API。Qwen3.8 27B 唯一彻底取胜的一项,是视频输入,而另一项则是许可证。

这不是否定该模型的理由,因为 Apache-2.0 许可证和视频模态并非安慰奖。这恰恰是让我们精确说明为什么有人会选择开放权重阵营,并停止假装争论关乎基准测试的理由。

两个模型实际运行所依据的数字

以美元计,每百万个词元。供应商的费率来自其自身的定价文档;共用的测量指标为 Artificial Analysis Intelligence Index v4.3.2,读取于 2026-10-08,两者均采用其已发布的最高努力配置。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8 27B — the scoreboard' with rows Index v4.3.2 43.40 against 33.70, cost per task $0.21 against $1.01, input price $0.10 against $0.50, context window 1M tokens against 256K tokens, AutomationBench 0.3541 against 0.4824 and weights 'proprietary' against 'open, Apache 2.0', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; Qwen vendor-card scores are unreproduced by the board.'

• 输入 — Claude Haiku 5.5:前 100,000 个 token 为 $0.10,超出部分为 $0.50;Qwen3.8 27B 按董事会记录的第三方费率为 $0.50。

• 输出 — Claude Haiku 5.5:$0.50,最高 100,000 tokens,超出后 $2.50;Qwen3.8 27B:$3.00。

• 缓存输入 — Claude Haiku 5.5 为 $0.01 和 $0.05,折扣 90%;Qwen3.8 27B 为 $0.10,折扣 80%。

• 独立评分——Claude Haiku 5.5 (Max) 为 43.40,而 Qwen3.8 27B (Xhigh) 为 33.70。相差 9.70 分,是本批次中差距最大的一次。

• 每项已完成任务的成本——在同一轮评估中,0.21 美元对 1.01 美元。4.7 倍的差距,也是这里最大的。

• 上下文与输出 —— Claude Haiku 5.5 提供 100 万 token 的上下文和 128,000 token 的回复上限;Qwen3.8 27B 则提供 256K token 的上下文。

• 模态能力——两者均接受文本和图像输入并返回文本。Qwen3.8 27B 额外支持视频输入;Claude Haiku 5.5 则不支持。

• 权重 — Qwen3.8 27B 是 Apache 2.0 许可下的 27B 稠密参数模型,可下载。Claude Haiku 5.5 为专有 API。

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the two-tier pricing lines and 'Released October 7, 2026'.

为什么每个任务的差距是每个token差距的四倍

费率表已经显示出对供应商有利的 5 倍输入差距和 6 倍输出差距,所以方向不成问题。值得一看的是,按任务计算的数字更小——与按 token 计算的数字相比,这与本批次其他对比中出现的情况正好相反,其原因也很能说明问题。

Claude Haiku 5.5 在每项 Intelligence Index 任务中输出 162,164 个 token——其中 129,047 个为推理,33,118 个为回答。Qwen3.8 27B 输出 66,797 个,拆分为 47,711 个推理和 19,087 个回答。该厂商的模型每项任务消耗的 token 数量是前者的 2.4 倍,因此其 6 倍的输出速率优势被压缩为 4.7 倍的每任务优势。这依然十分巨大。只不过它不是价目表上所宣传的那个数字。

混合比例的计算能更清晰地看出它的形态。在输入占比高的 7:2:1 混合下——这也是大多数生产流量实际的权重分布——Claude Haiku 5.5 的价格为每百万 token $0.077,而 Qwen3.8 27B 为 $0.470。在均衡的 1:1 混合下,它是 $0.30,而后者是 $1.75。供应商的 100,000-token 断崖是唯一能拉平这一差距的因素:一旦超过它,Claude Haiku 5.5 的计价就变为对整个请求收取 $0.50 和 $2.50,两个模型的价格便大致持平——而此时你是在为 9.7 分的得分溢价白白买单。

供应商卡与独立董事会不一致之处

这组数据行值得慢下来仔细审视,因为 Qwen3.8 27B 自家模型卡的表述明显强于独立测量结果,而这一差距正是“27B 模型可与规模大得多的模型匹敌”这一说法需要第二个来源的全部原因。

供应商自行公布的数据——记录在我们该模型的产品目录页面上——包括 LiveCodeBench v6 上的 90.3、GPQA Diamond 上的 89.2、OSWorld-Verified 上的 84.3,以及 QwenSWEBench 上的 79.0。这些数据均由供应商自报,且未经复现,它们所描绘的是一款实力远超其量级的模型。

在 Artificial Analysis 的独立评测运行中,Qwen3.8 27B 在 Terminal-Bench 4.0 上得分 0.0556,在 SciCode 上为 0.4664,在 Humanity's Last Exam 上为 0.3392,在 GDPval-AA v2.1 上为 1423.21。把 0.0556 放在厂商卡片在 OSWorld 上报告的 84.3 旁边,分歧的形态就一目了然了:在计算机与终端智能体任务上,独立评测榜把这款模型放在大致符合一个 27B 稠密模型应有的位置,而厂商卡片并没有这么做。

有两行数据的结果恰好相反,出于同样的理由,它们也值得被点明。Qwen3.8 27B 的得分是 在 AutomationBench 上为 0.4824,而 Claude Haiku 5.5 为 0.3541——在两个榜单中与业务自动化基准最为接近的项目上,这是一场 12.8 分的独立胜利。这是同一次运行得出的真实数字,且出现在与人们实际部署小模型的用途最为贴近的那一行上。

诚实的解读并不是“厂商把一切都注了水”,而是:模型卡衡量的是其作者自行选定的任务,独立评测榜单衡量的则是一组固定任务,而 Qwen3.8 27B 的强项出现在厂商的清单上,却不在榜单上。

当你拥有硬件时,经济账就变了

上面引用的每一项费率都是 API 价格,而对于 Qwen3.8 27B 来说,这个框架是错的。

这是一个采用 Apache 2.0 许可的 27B 稠密模型。它能以大多数团队都接受的量化精度,装进单块现代加速卡,这意味着每 token 的边际成本不再是厂商的计价表,而是你自己的利用率。正因如此,调用它的价格会因托管方而异,而本次对比中的两个专有模型永远做不到这一点:排行榜记录其第三方费率为输入 $0.50、输出 $3.00,而 OrcaRouter 目录标出的价格是 输入 $0.33、输出 $2.40,并且完全没有缓存读取这一项,因为我们是在自己的基础设施上运行模型权重,而不是转售别人的端点。

对于一个已经在为 GPU 付费的团队来说,比较的不是每项任务 0.21 美元与 1.01 美元。而是供应商的计费费率与你自有硬件上一次请求的增量成本之间的对比,而这是两个不同的数字。这就是支持开放权重阵营的论据,也是唯一经得起与基准表对照的论据。

许可证为 Apache 2.0 还带来了第二个不那么明显的后果:模型可以内置到产品中发布,可以基于你自己的流量进行微调,可以固定到特定修订版本,并且可以一直审计到权重层面。对于一个仅提供 API 的专有模型来说,这些无论花多少钱都得不到;而对于受监管的工作负载,这往往不是偏好问题,而是决定性的约束条件。

A capture of the OrcaRouter model page for Qwen3.8 27B under qwen/qwen3.8-27b, showing a 262K-token context chip, text, image and video input, text output, a p50 time to first token of 1.84 seconds, public benchmarks by Qwen dated 2026-08-15, and the page's own description of the model as Alibaba's open-weight 27B dense multimodal model released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure.

调用其中任意一个

Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.

Claude Haiku 5.5 并未列入目录。它可以通过供应商的 API 直接访问,也可以通过 AWS、Azure 及各大云平台访问,这才是准确的表述。目录中确实收录的该供应商产品线,是Claude Sonnet 5.5 和 Claude Opus 5.5,这使得从自托管的小型模型升级到托管的中端智能体模型的路径,变成一次路由变更,而非第二次集成——自动故障转移无论如何都位于其底层。

这一裁决异常地一边倒

作为文本或图像的 API 调用,在每一项与许可无关的对比维度上,Claude Haiku 5.5 都赢得了这场比较。9.7 个指数点,每完成一项任务便宜 4.7 倍,上下文窗口是四倍,响应上限是两倍,而且在短提示词场景下价格标签低五到六倍。没有任何关于工作负载形态的论点能在价格上为 Qwen3.8 27B 挽回局面,因为该厂商的劣势——输出 token 用量大——其价值远不及其费率优势。

真正挽救它的是 API 价格无法体现的一切:允许再分发的许可证、可以持有并固定下来的权重、视频输入,以及一条自托管路径——在这条路径上,每 token 成本来自你自己的硬件,而不是供应商的卡。如果你在寻找对文本进行分类、提取、摘要和路由的最便宜方式,Claude Haiku 5.5 就是答案,而且差距一点也不接近。如果你在寻找一个能放进你自己产品里、跑在你自己硬件上、接受你自己审计的模型,那么早在几段之前,基准差距就已经不再是问题了。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新