一张用于对比“Tencent HY4 Preview 与 GPT-5.6 Sol”的主标题卡片。中央高亮部分写着“Toolathlon 验证 74.1——开源权重对前沿模型的主张”,注释为“腾讯称其模型在智能体工具调用方面领先于 GPT-5.6 Sol”。左侧卡片“Tencent HY4 Preview”列出:“开放权重,770B / 49B 激活”,“每 1M ¥6 / ¥18”,“无独立评分”。右侧卡片“GPT-5.6 Sol”列出:“封闭 API,OpenAI 旗舰”,“每 1M 基础费用 $4 / $20”,“Terminal-Bench 2.1:88.8”。页脚写着“HY4 Preview 数据由供应商提供;Sol 数据已被广泛复现。”OrcaRouter 标志合成在右下角。
Guides & Insights

腾讯HY4预览版 vs GPT-5.6 Sol:工具调用之争,让开放权重叫板前沿模型

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

腾讯HY4 Preview是数月来首个在发布说明中明确宣称胜过GPT-5.6 Sol的开源权重模型。这里提到的数字是Toolathlon-Verified,一个用于评估智能体工具调用能力的基准测试,腾讯报告HY4 Preview得分74.1——领先Qwen3.8-Max,并且按照腾讯自己的对比,也领先GPT-5.6 Sol。在其他所有维度上,这两个模型并不真正对等:GPT-5.6 Sol是OpenAI闭源的旗舰级、经独立评测的前沿模型,而腾讯HY4 Preview是一个7700亿参数的开源权重预览版,今早发布,附带的是厂商自报的成绩单,没有第三方验证。

所以,有趣的问题不是“哪个模型更聪明”,而是一个输入价格仅为Sol约六分之一的开源权重挑战者,是否能够令人信服地宣称自己在前沿占有一席之地,以及一个团队面对目前无法验证的说法应该作何应对。

让这成为一场真正对决的说法

Toolathlon-Verified 衡量的是一个模型在完整智能体任务中驱动工具的能力有多可靠——读取结果、决定下一步调用、从错误中恢复——而不是它编写单个函数的能力。这一点之所以重要,是因为前沿模型真实 API 支出中最大的一部分花在了智能体循环上,而非一次性补全。腾讯在该基准上取得的 74.1 分,正是让 HY4 Preview 进入 GPT-5.6 Sol 对话的那条具体成绩,这个数字值得稍作沉思:它是那种如果能在独立复现下站得住脚,就会让开源权重与闭源前沿的成本讨论变得真实起来的数字。如果它站不住脚,它就只会成为又一份在第三方测试框架下蒸发掉的厂商成绩单。

两种购买智能的方式

A two-column scoreboard titled 'Tencent HY4 Preview vs GPT-5.6 Sol — the scoreboard'. Left column 'Tencent HY4 Preview': 'Params: 770B / 49B active, open weights', 'Context: >1M tokens', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'GPT-5.6 Sol': 'Params: undisclosed, closed API', 'Context: 1.05M tokens, 128K max output', 'Terminal-Bench 2.1: 88.8 (91.9 Ultra)', 'Agents' Last Exam: 53.6', 'Price: $4 / $20 base per 1M', 'Independent score: on all major leaderboards'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; GPT-5.6 Sol figures widely reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

• 参数 — HY4 Preview 总参数量770B / 激活49B,开放权重 vs GPT-5.6 Sol,参数量未公开,封闭API

• 上下文 — HY4 Preview 超过1M tokens,对比 GPT-5.6 Sol 1.05M tokens,128K 最大输出

• 每 1M 价格 — HY4 预览版:输入 ¥6 / 输出 ¥18(约合 $0.85 / $2.50),对比 GPT-5.6 Sol 基础档位的 $4.00 / $20.00,大上下文请求时升至 $8.00 / $30.00,缓存读取 $0.40

• 输入模态 — 此预览版中 HY4 Preview 仅支持文本,而 GPT-5.6 Sol 支持文本和图像输入

• 推理模式 — HY4 Preview 没有已发布的等效版本;GPT-5.6 Sol 则提供 Ultra 模式(最多 16 个并行子代理)和最大推理强度

• 独立验证 — HY4 Preview 尚未上榜,GPT-5.6 Sol 已出现在各大主要排行榜上,并以 1.05M 上下文在长上下文综合测试中位列顶级梯队。

价格一栏是整个对决的关键所在。在基础档位上,GPT-5.6 Sol 每百万输入 token 收费 4.00 美元,每百万输出 token 收费 20.00 美元;腾讯 HY4 Preview 按当前汇率计算,价格分别约为 0.85 美元和 2.50 美元。对于需要大量输出 token 的工作负载——智能体编码正是如此——开放权重模型的定价约为封闭模型的八分之一,而且即便考虑到 Sol 的价格数字背后有更多验证支撑,这一差距依然存在。

GPT-5.6 Sol 仍然占据优势之处

验证是首要优势。GPT-5.6 Sol 自7月9日起全面可用,并已独立测评:在 Terminal-Bench 2.1 上基础推理得分 88.8,Ultra 模式下 91.9,Agents' Last Exam 得分 53.6(发布时纪录),GPQA Diamond 得分 94.6,SWE-bench Pro 得分 64.6。OpenAI 还报告称,在智能体编程任务上,token 效率较其上一代旗舰型号提升了 54%。这些数字在 OpenAI 自家文档之外也能复现,而这正是 Tencent HY4 Preview 目前所缺乏的。

能力是第二个优势,而且是结构性的而非边际性的。GPT-5.6 Sol 接受图像输入;HY4 Preview 在此预览版中仅支持文本,腾讯也承认视觉功能要等到完整版发布。GPT-5.6 Sol 搭载 Ultra 模式——一种多智能体配置,以三到四倍的 token 成本协调并行子智能体,恰好适用于两个模型真正会展开竞争的长周期工程任务。此外,Sol 的计算机使用与程序化工具调用路径均有文档记录,并经过生产规模验证和负载测试。腾讯宣称的 Toolathlon-Verified 若经得起复现,可以缩小工具使用方面的差距;但无法弥合多模态或多智能体方面的差距,而 HY4 Preview 也并未尝试这些。

HY4 Preview 真正有趣的地方

先把基准测试的表演放在一边,真正重要的还有三件事。第一,价格:¥6/¥18——约合 0.85/2.50 美元——腾讯在输出 token 的定价上比所有西方前沿模型便宜到只有其四分之一到八分之一,在输入 token 上也低于它自己的中国开源权重同行。第二,开源权重:一个 49B 激活参数的 MoE 可以部署在单节点上,而 Sol 不公开的架构永远无法做到这一点;权重已经上传到了 HuggingFace、ModelScope 和 GitHub。第三,上下文窗口和工程路径:DeepSWE 64.3 和超过 100 万的上下文窗口,瞄准的正是 Sol 的 Ultra 模式所针对的同一类长周期智能体工作负载,而成本只是其零头。

坦诚地说,这些成果都尚未经过独立基准测试的检验。腾讯所讲述的自我优化故事——模型在其自身推理栈上迭代带来31.8%的端到端吞吐量提升——是内部测量的结果。在盲测中击败GLM 5.3Kimi K3也是内部进行的。关于HY4 Preview的一切有趣之处,目前都只是宣称而已。

决定

如果你今天要构建生产系统,{{1}}GPT-5.6 Sol 是稳妥的选择,并且可以通过 OrcaRouter 访问{{/1}},价格按 Ope​nAI 自己的分层价目表执行——{{2}}基础层为 $4.00/$20.00,更高层级为 $8.00/$30.00,零加价转售,因此任何供应商价格变动当天就会同步到我们这边{{/2}}。如果你的工作流以智能体为主且大量使用工具,那么这种分层结构意味着你应该对照 $272K token 的阈值核对自己的实际输入大小,而不是按统一费率估算。

如果你愿意做一次影子评估,HY4 Preview 的定价低到完全值得真测一轮:今天就把你的工具调用负载路由到 Sol,用同样的提示词通过腾讯自己的 API 跑一遍 HY4 Preview,再用你自己那套 Toolathlon 风格的任务来对比。如果独立评分真的落在腾讯宣称的位置,切换路径也很短——开源权重模型直接放进路由器,故障转移规则换一下端点即可,厂商的 ¥6/¥18 费率原样透传、不加任何改动。这才是这场对局最诚实的结构:一边是今天就能拿来搭建系统的、经过验证的前沿模型;另一边是尚未经过验证的开源挑战者,它便宜到足以让你去测试,并且有意把价格讨论的重心引向整个开源权重模型类别。

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback), with GPT-5.6 Sol (max) visible in the near-top rows — the only model in this matchup with an independent index. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol) showing a 1.05M-token context window, 128K max output, base pricing of $4.00 per 1M input and $20.00 per 1M output tokens, and a July 9 2026 release date.

看什么

• 首次独立复现 Toolathlon-Verified。如果第三方测试框架确认 HY4 Preview 得分在 70 多分,"开放权重无法进行智能体工具使用"的论点将不攻自破。

• 腾讯是否会在完整版 Hy4 发布之前推出视觉功能。纯文本模式将 HY4 Preview 限制为 GPT-5.6 Sol 所处理工作负载的一个严格子集。

• HY4 Preview 长思考倾向带来的实际 token 账单。按每百万输出 18 元计算,冗长的自我验证蚕食价格优势的速度比 20 美元模型更快。

• 在 Hy4 全面上线之前,Sol 的分级定价是否会再次下调。路由器的价格传导意味着降价当天即可显现。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube