
Claude Sonnet 5.5 对比 Tencent HY4 Preview:两家实验室都在兜售 token 账单
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 931 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 192 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
相隔六周推出的两次发布,用不同的话做出了同一个承诺。供应商的说法是,Claude Sonnet 5.5于 2026 年 9 月 28 日发布,与 Claude Sonnet 5 相比,在每 token 费率不变的情况下,“每个任务成本最多降低 30%”。第二个说法是,2026 年 8 月 28 日首次发布并开源的Tencent HY4 Preview托管版本,于 9 月 7 日进行的优化,能在任务质量不变的前提下,减少推理轮次和每个任务的 token 消耗。两家供应商都没有为此提高或降低价格。两者都在告诉你,如今 token 才是产品本身,而这场对比中有意思的地方在于,只有其中一个说法可以对照已公布的每任务数据加以核实——因为这两个模型中只有一个拥有可供核对的独立测量结果。
这种不对称并不是对 Tencent 的贬低。HY4 Preview 没有 Artificial Analysis 模型页面,没有独立的 Intelligence Index 评分,也没有来自任何第三方的单任务成本数据。它拥有的是厂商基准测试表——Terminal-Bench 2.1 为 85.4,DeepSWE 为 64.3,一项覆盖 203 个工程任务的内部盲测中,它平均得分 2.99,而 GLM-5.3 为 2.92、Kimi K3 为 2.94——以及在 WebDev Arena 排行榜上公开的众投首秀,Tencent 称其总排名约第五,在开放权重模型中排名第三。所有这些都是真实信号。但它们没有一个是单任务成本,这意味着两家厂商正在比拼的那个确切数字,对于 HY4 Preview 来说,无法获得。
各方实际交付了什么
Tencent HY4 Preview 是一个拥有 7700 亿参数的混合专家模型,每个 token 激活 490 亿参数,包含 78 层、256 个路由专家外加 1 个共享专家、一个用于投机解码的原生 MTP 层,以及超过 100 万 token 的上下文窗口。它在设计上仅支持文本——Tencent 为编程智能体、复杂工具调用和生产力工作而构建,并非面向图像——并且默认采用重度推理,提供三档可配置级别(高、低、无),以及厂商推荐的采样设置:temperature 0.9 和 top_p 1.0。权重采用 Apache 2.0 许可,可从 Hugging Face、GitHub、ModelScope 和 GitCode 下载。Tencent 最初指出了该预览版的两个粗糙之处:思考时间超出必要,以及过度核验自己的工作,而 9 月 7 日的更新正是针对这两点。
Claude Sonnet 5.5 是 Anthropic 的第二款 5.5 代模型,也是其定位为产品阵容中速度与智能最佳结合的模型。一百万 token 上下文,同步 128,000 输出 token,在 Message Batches API 上为 300,000,支持文本、图像和文件输入,可在可选 effort 下进行自适应思考,2026 年 6 月知识截止,发布时即可提供零数据保留,退役下限为 2027 年 9 月 28 日。价格表相较 Claude Sonnet 5 没有变动:每百万输入 $2.00,每百万输出 $10.00,缓存读取 $0.20,缓存写入 $2.50。闭源权重,Anthropic API 以及 Bedrock、Google Cloud 和 Microsoft Foundry。
将两者相互对照,位置几乎是对称的:
• 价格 — Claude Sonnet 5.5 每百万 $2.00 输入 / $10.00 输出,对比我们目录中的 Tencent HY4 Preview $0.83 输入 / $2.50 输出,供应商报价单为 ¥6 / ¥18
• 缓存读取 — 我们的价目表上,Claude Sonnet 5.5 每百万 $0.20,Tencent HY4 Preview 每百万 $0.042
• 权重 — Claude Sonnet 5.5 闭源 vs Tencent HY4 Preview Apache 2.0,可下载
• 上下文 — Claude Sonnet 5.5 的 1,000,000 tokens 对比 Tencent HY4 Preview 的 1,048,576 tokens,实际上并无二致
• 最大输出 — Claude Sonnet 5.5 同步为 128,000,Batches 为 300,000,而 Tencent HY4 Preview 在我们的目录中为 64,000
• 输入模态 — Claude Sonnet 5.5 支持文本、图像和文件,而腾讯 HY4 Preview 仅支持文本
• 独立评分 — Claude Sonnet 5.5 智能指数 56,每任务 7.60 美元,修订版 v4.3.2,对比腾讯 HY4 Preview:未公布
• 实测输出速度——在我们自己的流量上,Claude Sonnet 5.5 为 138.7 tokens/秒,腾讯 HY4 Preview 为 22.3 tokens/秒

两家实验室都在提出的主张,以及为什么其中之一是可以核查的
Anthropic 的“每任务减少 30%”和 Tencent 的“更少的推理轮次、更低的 token 消耗”,是从两个方向描述同一个工程项目:让模型用更少的 token 得出相同答案。Anthropic 明确表示费率没有变化,这意味着任何每任务节省都只能来自 token 数量——而独立榜单让你看到问题的形态,而不是解决方案的规模。Claude Sonnet 5.5 在 Intelligence Index 评估中生成了 4.1 亿个输出 token,而 MiniMax M3 为 1.17 亿,Grok 4.5 为 7700 万。它是一个冗长的模型——这是在一个会公布该数字的榜单上测出来的。无论相比 Claude Sonnet 5 的这 30% 提升最终意味着什么,它都是在应用到一个非常庞大的基数上。
对于 HY4 Preview,公开渠道并不存在对应的数字。Tencent 自己的优化说明是唯一的相关记述,而它在陈述结果时没有给出数字:更少的轮次、更低的输入和输出 token、相同的质量,并通过基准指标和人工评估进行了双重验证。严格来说,这是一种厂商声明——有所陈述、看似合理、未经复现——本文也如此标注。仅凭厂商关于 token 经济性的说法就采用一个预览模型,而 token 经济性恰恰是你无法从外部衡量的东西,这正是预览版发布要求你下的赌注。
在任何人围绕那项优化规划自托管部署之前,还有一个细节值得了解。Tencent 9 月 7 日的改动适用于 Tencent 在其自有托管端点上提供的构建。开放权重快照并未刷新——Hugging Face 仓库的最后修改日期仍为 8 月 28 日——因此,自托管的权重副本运行的仍是预览说明所标出的原始、推理更长的行为。优化后的版本与可下载的版本并非同一产物。
开源权重的用武之地,始终是在同一个地方:无法调用 API 的部署场景。一个总参数 770B、激活参数 49B 的模型,属于数据中心级别的决策,而非工作站级别的决策,所以这并不是 30B 模型所讲述的那种笔记本级故事——但对于需要把模型留在自有边界内的买家来说,这一规模上的 Apache 2.0 是 Claude Sonnet 5.5 无论出价多高都不会提供的选项。
试用预览版,而不把生产路径押在它上面
预览模型正是这样一种情况:路由不再是一种成本优化,而变成了风险控制。把预览构建放在路由器后面,而不是直接调用它,原因在于预览的本质就是它可能会在你脚下发生变化;而你希望它前面这一层提供的两样东西,是按百分比分流,以及某种能捕获故障的机制。
这就是 OrcaRouter 提供的形态:一个兼容 OpenAI 的端点,覆盖 200 多个模型,提供商标价原样透传,不额外加价,上游提供商之间的自动故障转移,以及一套用于从多个模型组合出调用的路由 DSL。 Tencent HY4 Preview 今天可在此路由为 tencent/hy4-preview,每百万 tokens 输入 $0.83、输出 $2.50,在其 1,048,576-token 窗口内缓存读取为 $0.042——同一构建,按提供商费率,可从你已用于目录中其他所有内容的同一密钥访问。 Claude Sonnet 5 也在此可路由,价格为 Anthropic 的 $2.00 和 $10.00,并且自 6 月 30 日起一直如此;当一个刚发布一天的模型还在积累生产证据时,它显然是一个合适的故障转移伙伴。

Claude Sonnet 5.5 本身并不在我们的产品目录中。它昨天才发布,通往它的路径是 Anthropic 自己的 API,而本页不会暗示别的可能——路由建议的要点在于,要在生产环境中运行一个全新层级,安全的做法是给它分配一部分流量,并让某种经过验证的东西在背后支撑,而只有在这种安排的两端都位于你能从一个地方访问到的位置时,这才会奏效。HY4 Preview 在这里每周承载 37.2 万个 token 的流量,这就是一个刚上线两天的预览版在还没有人真正投入之前的样子;Claude Sonnet 5 自 6 月 30 日以来每周承载 790 万个 token,而这就是候选者与基本盘之间的差别。

钱到底流向何处
仅从费率上看,HY4 Preview 的输出价格比 Claude Sonnet 5.5 便宜四倍,缓存读取价格便宜近五倍,而且上下文窗口也与之持平。而在实测方面,Claude Sonnet 5.5 在我们自己的流量上生成输出的速度快了六倍——每秒 138.7 个 token,对比 22.3 个——正是这种差距,使得四倍的费率优势在实际耗时上缩水不少,一旦把排队因素考虑进去,有时甚至会变成劣势。
在这两个事实之间,决定取决于四个只有读者本人才能回答的问题。这项工作是否需要在提示词中包含图像或文件?HY4 Preview 仅支持文本,这就足以终结讨论。它是否需要完成多步骤的软件任务——而 HY4 Preview 在 Terminal-Bench 2.1 上 85.4 的分数是腾讯自己给出的数字,且未经复现?那么预览状态就是你所承担的风险,而 9 月 7 日的优化值得重新测试,而非直接采信。工作负载是否必须运行在你自己的边界之内?那么 Apache 2.0 权重就是决定性事实。而综合能力水平是否比价格更重要?那么 Claude Sonnet 5.5 经独立测得的 56 就是值得权衡的数字,每项 Index 任务 7.60 美元,但需注意腾讯一侧并不存在可与之比较的对等数字。
这两次发布真正说明的是,前沿已经不再以价目表为基准。两家实验室相隔六周发布了模型,并主打每任务 token 消耗量,而不是每百万 token 的价格;对买家而言,实际结果是那个有用的数字已不再出现在任何一方的定价页面上。它是你自己的负载在两个模型上实测产生的 token 数量,也是本文中两家供应商都无法给你的那个数字。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
