生成的英雄卡片标题为 Claude Sonnet 5.5 vs Tencent HY4 Preview,副标题为两家实验室都在兜售 token 账单,配有三张数据卡:每 1M 输出价格 $10.00 vs $2.50、权重闭源 vs Apache 2.0、实测输出速度 138.7 vs 22.3 tokens/秒,页脚写着 Tencent HY4 Preview 的价格与速度依据 OrcaRouter 的目录,厂商列表 6 / 18 元每百万;Claude Sonnet 5.5 依据 Anthropic。
Guides & Insights

Claude Sonnet 5.5 对比 Tencent HY4 Preview:两家实验室都在兜售 token 账单

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

相隔六周推出的两次发布,用不同的话做出了同一个承诺。供应商的说法是,Claude Sonnet 5.5于 2026 年 9 月 28 日发布,与 Claude Sonnet 5 相比,在每 token 费率不变的情况下,“每个任务成本最多降低 30%”。第二个说法是,2026 年 8 月 28 日首次发布并开源的Tencent HY4 Preview托管版本,于 9 月 7 日进行的优化,能在任务质量不变的前提下,减少推理轮次和每个任务的 token 消耗。两家供应商都没有为此提高或降低价格。两者都在告诉你,如今 token 才是产品本身,而这场对比中有意思的地方在于,只有其中一个说法可以对照已公布的每任务数据加以核实——因为这两个模型中只有一个拥有可供核对的独立测量结果。

这种不对称并不是对 Tencent 的贬低。HY4 Preview 没有 Artificial Analysis 模型页面,没有独立的 Intelligence Index 评分,也没有来自任何第三方的单任务成本数据。它拥有的是厂商基准测试表——Terminal-Bench 2.1 为 85.4,DeepSWE 为 64.3,一项覆盖 203 个工程任务的内部盲测中,它平均得分 2.99,而 GLM-5.3 为 2.92、Kimi K3 为 2.94——以及在 WebDev Arena 排行榜上公开的众投首秀,Tencent 称其总排名约第五,在开放权重模型中排名第三。所有这些都是真实信号。但它们没有一个是单任务成本,这意味着两家厂商正在比拼的那个确切数字,对于 HY4 Preview 来说,无法获得。

各方实际交付了什么

Tencent HY4 Preview 是一个拥有 7700 亿参数的混合专家模型,每个 token 激活 490 亿参数,包含 78 层、256 个路由专家外加 1 个共享专家、一个用于投机解码的原生 MTP 层,以及超过 100 万 token 的上下文窗口。它在设计上仅支持文本——Tencent 为编程智能体、复杂工具调用和生产力工作而构建,并非面向图像——并且默认采用重度推理,提供三档可配置级别(高、低、无),以及厂商推荐的采样设置:temperature 0.9 和 top_p 1.0。权重采用 Apache 2.0 许可,可从 Hugging Face、GitHub、ModelScope 和 GitCode 下载。Tencent 最初指出了该预览版的两个粗糙之处:思考时间超出必要,以及过度核验自己的工作,而 9 月 7 日的更新正是针对这两点。

Claude Sonnet 5.5 是 Anthropic 的第二款 5.5 代模型,也是其定位为产品阵容中速度与智能最佳结合的模型。一百万 token 上下文,同步 128,000 输出 token,在 Message Batches API 上为 300,000,支持文本、图像和文件输入,可在可选 effort 下进行自适应思考,2026 年 6 月知识截止,发布时即可提供零数据保留,退役下限为 2027 年 9 月 28 日。价格表相较 Claude Sonnet 5 没有变动:每百万输入 $2.00,每百万输出 $10.00,缓存读取 $0.20,缓存写入 $2.50。闭源权重,Anthropic API 以及 Bedrock、Google Cloud 和 Microsoft Foundry。

将两者相互对照,位置几乎是对称的:

• 价格 — Claude Sonnet 5.5 每百万 $2.00 输入 / $10.00 输出,对比我们目录中的 Tencent HY4 Preview $0.83 输入 / $2.50 输出,供应商报价单为 ¥6 / ¥18

• 缓存读取 — 我们的价目表上,Claude Sonnet 5.5 每百万 $0.20,Tencent HY4 Preview 每百万 $0.042

• 权重 — Claude Sonnet 5.5 闭源 vs Tencent HY4 Preview Apache 2.0,可下载

• 上下文 — Claude Sonnet 5.5 的 1,000,000 tokens 对比 Tencent HY4 Preview 的 1,048,576 tokens,实际上并无二致

• 最大输出 — Claude Sonnet 5.5 同步为 128,000,Batches 为 300,000,而 Tencent HY4 Preview 在我们的目录中为 64,000

• 输入模态 — Claude Sonnet 5.5 支持文本、图像和文件,而腾讯 HY4 Preview 仅支持文本

• 独立评分 — Claude Sonnet 5.5 智能指数 56,每任务 7.60 美元,修订版 v4.3.2,对比腾讯 HY4 Preview:未公布

• 实测输出速度——在我们自己的流量上,Claude Sonnet 5.5 为 138.7 tokens/秒,腾讯 HY4 Preview 为 22.3 tokens/秒

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Tencent HY4 Preview, the scoreboard, with six matched rows: output price $10.00 vs $2.50, cache read $0.20 vs $0.042, context window 1,000,000 vs 1,048,576 tokens, maximum output 128K and 300K on Batches vs 64K, input modality text, image and file vs text only, and weights closed vs Apache 2.0, with a footer reading Tencent HY4 Preview price per OrcaRouter's catalogue, vendor list 6 / 18 yuan per million; no independent scores published. Claude Sonnet 5.5 per Anthropic.

两家实验室都在提出的主张,以及为什么其中之一是可以核查的

Anthropic 的“每任务减少 30%”和 Tencent 的“更少的推理轮次、更低的 token 消耗”,是从两个方向描述同一个工程项目:让模型用更少的 token 得出相同答案。Anthropic 明确表示费率没有变化,这意味着任何每任务节省都只能来自 token 数量——而独立榜单让你看到问题的形态,而不是解决方案的规模。Claude Sonnet 5.5 在 Intelligence Index 评估中生成了 4.1 亿个输出 token,而 MiniMax M3 为 1.17 亿,Grok 4.5 为 7700 万。它是一个冗长的模型——这是在一个会公布该数字的榜单上测出来的。无论相比 Claude Sonnet 5 的这 30% 提升最终意味着什么,它都是在应用到一个非常庞大的基数上。

对于 HY4 Preview,公开渠道并不存在对应的数字。Tencent 自己的优化说明是唯一的相关记述,而它在陈述结果时没有给出数字:更少的轮次、更低的输入和输出 token、相同的质量,并通过基准指标和人工评估进行了双重验证。严格来说,这是一种厂商声明——有所陈述、看似合理、未经复现——本文也如此标注。仅凭厂商关于 token 经济性的说法就采用一个预览模型,而 token 经济性恰恰是你无法从外部衡量的东西,这正是预览版发布要求你下的赌注。

在任何人围绕那项优化规划自托管部署之前,还有一个细节值得了解。Tencent 9 月 7 日的改动适用于 Tencent 在其自有托管端点上提供的构建。开放权重快照并未刷新——Hugging Face 仓库的最后修改日期仍为 8 月 28 日——因此,自托管的权重副本运行的仍是预览说明所标出的原始、推理更长的行为。优化后的版本与可下载的版本并非同一产物。

开源权重的用武之地,始终是在同一个地方:无法调用 API 的部署场景。一个总参数 770B、激活参数 49B 的模型,属于数据中心级别的决策,而非工作站级别的决策,所以这并不是 30B 模型所讲述的那种笔记本级故事——但对于需要把模型留在自有边界内的买家来说,这一规模上的 Apache 2.0 是 Claude Sonnet 5.5 无论出价多高都不会提供的选项。

试用预览版,而不把生产路径押在它上面

预览模型正是这样一种情况:路由不再是一种成本优化,而变成了风险控制。把预览构建放在路由器后面,而不是直接调用它,原因在于预览的本质就是它可能会在你脚下发生变化;而你希望它前面这一层提供的两样东西,是按百分比分流,以及某种能捕获故障的机制。

这就是 OrcaRouter 提供的形态:一个兼容 OpenAI 的端点,覆盖 200 多个模型,提供商标价原样透传,不额外加价,上游提供商之间的自动故障转移,以及一套用于从多个模型组合出调用的路由 DSL。 Tencent HY4 Preview 今天可在此路由为 tencent/hy4-preview,每百万 tokens 输入 $0.83、输出 $2.50,在其 1,048,576-token 窗口内缓存读取为 $0.042——同一构建,按提供商费率,可从你已用于目录中其他所有内容的同一密钥访问。 Claude Sonnet 5 也在此可路由,价格为 Anthropic 的 $2.00 和 $10.00,并且自 6 月 30 日起一直如此;当一个刚发布一天的模型还在积累生产证据时,它显然是一个合适的故障转移伙伴。

OrcaRouter model page for tencent/hy4-preview, dated 2026-08-28, showing the Tools, JSON and Reasoning badges, a 1M-token context window, text-only input, $0.83 input and $2.50 output per million tokens, a p50 time to first token of 3.71 s, and 372.4K tokens of recent traffic.

Claude Sonnet 5.5 本身并不在我们的产品目录中。它昨天才发布,通往它的路径是 Anthropic 自己的 API,而本页不会暗示别的可能——路由建议的要点在于,要在生产环境中运行一个全新层级,安全的做法是给它分配一部分流量,并让某种经过验证的东西在背后支撑,而只有在这种安排的两端都位于你能从一个地方访问到的位置时,这才会奏效。HY4 Preview 在这里每周承载 37.2 万个 token 的流量,这就是一个刚上线两天的预览版在还没有人真正投入之前的样子;Claude Sonnet 5 自 6 月 30 日以来每周承载 790 万个 token,而这就是候选者与基本盘之间的差别。

OrcaRouter model page for anthropic/claude-sonnet-5, dated 2026-06-30, showing a 1M-token context window, 128K maximum output, text, image and file input, $2.00 input and $10.00 output per million tokens, a p50 time to first token of 4.87 s, and 7.9M tokens of recent traffic.

钱到底流向何处

仅从费率上看,HY4 Preview 的输出价格比 Claude Sonnet 5.5 便宜四倍,缓存读取价格便宜近五倍,而且上下文窗口也与之持平。而在实测方面,Claude Sonnet 5.5 在我们自己的流量上生成输出的速度快了六倍——每秒 138.7 个 token,对比 22.3 个——正是这种差距,使得四倍的费率优势在实际耗时上缩水不少,一旦把排队因素考虑进去,有时甚至会变成劣势。

在这两个事实之间,决定取决于四个只有读者本人才能回答的问题。这项工作是否需要在提示词中包含图像或文件?HY4 Preview 仅支持文本,这就足以终结讨论。它是否需要完成多步骤的软件任务——而 HY4 Preview 在 Terminal-Bench 2.1 上 85.4 的分数是腾讯自己给出的数字,且未经复现?那么预览状态就是你所承担的风险,而 9 月 7 日的优化值得重新测试,而非直接采信。工作负载是否必须运行在你自己的边界之内?那么 Apache 2.0 权重就是决定性事实。而综合能力水平是否比价格更重要?那么 Claude Sonnet 5.5 经独立测得的 56 就是值得权衡的数字,每项 Index 任务 7.60 美元,但需注意腾讯一侧并不存在可与之比较的对等数字。

这两次发布真正说明的是,前沿已经不再以价目表为基准。两家实验室相隔六周发布了模型,并主打每任务 token 消耗量,而不是每百万 token 的价格;对买家而言,实际结果是那个有用的数字已不再出现在任何一方的定价页面上。它是你自己的负载在两个模型上实测产生的 token 数量,也是本文中两家供应商都无法给你的那个数字。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新