
腾讯HY4预览版 vs GPT-5.6 Sol:工具调用之争,让开放权重叫板前沿模型
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
腾讯HY4 Preview是数月来首个在发布说明中明确宣称胜过GPT-5.6 Sol的开源权重模型。这里提到的数字是Toolathlon-Verified,一个用于评估智能体工具调用能力的基准测试,腾讯报告HY4 Preview得分74.1——领先Qwen3.8-Max,并且按照腾讯自己的对比,也领先GPT-5.6 Sol。在其他所有维度上,这两个模型并不真正对等:GPT-5.6 Sol是OpenAI闭源的旗舰级、经独立评测的前沿模型,而腾讯HY4 Preview是一个7700亿参数的开源权重预览版,今早发布,附带的是厂商自报的成绩单,没有第三方验证。
所以,有趣的问题不是“哪个模型更聪明”,而是一个输入价格仅为Sol约六分之一的开源权重挑战者,是否能够令人信服地宣称自己在前沿占有一席之地,以及一个团队面对目前无法验证的说法应该作何应对。
让这成为一场真正对决的说法
Toolathlon-Verified 衡量的是一个模型在完整智能体任务中驱动工具的能力有多可靠——读取结果、决定下一步调用、从错误中恢复——而不是它编写单个函数的能力。这一点之所以重要,是因为前沿模型真实 API 支出中最大的一部分花在了智能体循环上,而非一次性补全。腾讯在该基准上取得的 74.1 分,正是让 HY4 Preview 进入 GPT-5.6 Sol 对话的那条具体成绩,这个数字值得稍作沉思:它是那种如果能在独立复现下站得住脚,就会让开源权重与闭源前沿的成本讨论变得真实起来的数字。如果它站不住脚,它就只会成为又一份在第三方测试框架下蒸发掉的厂商成绩单。
两种购买智能的方式

• 参数 — HY4 Preview 总参数量770B / 激活49B,开放权重 vs GPT-5.6 Sol,参数量未公开,封闭API
• 上下文 — HY4 Preview 超过1M tokens,对比 GPT-5.6 Sol 1.05M tokens,128K 最大输出
• 每 1M 价格 — HY4 预览版:输入 ¥6 / 输出 ¥18(约合 $0.85 / $2.50),对比 GPT-5.6 Sol 基础档位的 $4.00 / $20.00,大上下文请求时升至 $8.00 / $30.00,缓存读取 $0.40
• 输入模态 — 此预览版中 HY4 Preview 仅支持文本,而 GPT-5.6 Sol 支持文本和图像输入
• 推理模式 — HY4 Preview 没有已发布的等效版本;GPT-5.6 Sol 则提供 Ultra 模式(最多 16 个并行子代理)和最大推理强度
• 独立验证 — HY4 Preview 尚未上榜,GPT-5.6 Sol 已出现在各大主要排行榜上,并以 1.05M 上下文在长上下文综合测试中位列顶级梯队。
价格一栏是整个对决的关键所在。在基础档位上,GPT-5.6 Sol 每百万输入 token 收费 4.00 美元,每百万输出 token 收费 20.00 美元;腾讯 HY4 Preview 按当前汇率计算,价格分别约为 0.85 美元和 2.50 美元。对于需要大量输出 token 的工作负载——智能体编码正是如此——开放权重模型的定价约为封闭模型的八分之一,而且即便考虑到 Sol 的价格数字背后有更多验证支撑,这一差距依然存在。
GPT-5.6 Sol 仍然占据优势之处
验证是首要优势。GPT-5.6 Sol 自7月9日起全面可用,并已独立测评:在 Terminal-Bench 2.1 上基础推理得分 88.8,Ultra 模式下 91.9,Agents' Last Exam 得分 53.6(发布时纪录),GPQA Diamond 得分 94.6,SWE-bench Pro 得分 64.6。OpenAI 还报告称,在智能体编程任务上,token 效率较其上一代旗舰型号提升了 54%。这些数字在 OpenAI 自家文档之外也能复现,而这正是 Tencent HY4 Preview 目前所缺乏的。
能力是第二个优势,而且是结构性的而非边际性的。GPT-5.6 Sol 接受图像输入;HY4 Preview 在此预览版中仅支持文本,腾讯也承认视觉功能要等到完整版发布。GPT-5.6 Sol 搭载 Ultra 模式——一种多智能体配置,以三到四倍的 token 成本协调并行子智能体,恰好适用于两个模型真正会展开竞争的长周期工程任务。此外,Sol 的计算机使用与程序化工具调用路径均有文档记录,并经过生产规模验证和负载测试。腾讯宣称的 Toolathlon-Verified 若经得起复现,可以缩小工具使用方面的差距;但无法弥合多模态或多智能体方面的差距,而 HY4 Preview 也并未尝试这些。
HY4 Preview 真正有趣的地方
先把基准测试的表演放在一边,真正重要的还有三件事。第一,价格:¥6/¥18——约合 0.85/2.50 美元——腾讯在输出 token 的定价上比所有西方前沿模型便宜到只有其四分之一到八分之一,在输入 token 上也低于它自己的中国开源权重同行。第二,开源权重:一个 49B 激活参数的 MoE 可以部署在单节点上,而 Sol 不公开的架构永远无法做到这一点;权重已经上传到了 HuggingFace、ModelScope 和 GitHub。第三,上下文窗口和工程路径:DeepSWE 64.3 和超过 100 万的上下文窗口,瞄准的正是 Sol 的 Ultra 模式所针对的同一类长周期智能体工作负载,而成本只是其零头。
坦诚地说,这些成果都尚未经过独立基准测试的检验。腾讯所讲述的自我优化故事——模型在其自身推理栈上迭代带来31.8%的端到端吞吐量提升——是内部测量的结果。在盲测中击败GLM 5.3和Kimi K3也是内部进行的。关于HY4 Preview的一切有趣之处,目前都只是宣称而已。
决定
如果你今天要构建生产系统,{{1}}GPT-5.6 Sol 是稳妥的选择,并且可以通过 OrcaRouter 访问{{/1}},价格按 OpenAI 自己的分层价目表执行——{{2}}基础层为 $4.00/$20.00,更高层级为 $8.00/$30.00,零加价转售,因此任何供应商价格变动当天就会同步到我们这边{{/2}}。如果你的工作流以智能体为主且大量使用工具,那么这种分层结构意味着你应该对照 $272K token 的阈值核对自己的实际输入大小,而不是按统一费率估算。
如果你愿意做一次影子评估,HY4 Preview 的定价低到完全值得真测一轮:今天就把你的工具调用负载路由到 Sol,用同样的提示词通过腾讯自己的 API 跑一遍 HY4 Preview,再用你自己那套 Toolathlon 风格的任务来对比。如果独立评分真的落在腾讯宣称的位置,切换路径也很短——开源权重模型直接放进路由器,故障转移规则换一下端点即可,厂商的 ¥6/¥18 费率原样透传、不加任何改动。这才是这场对局最诚实的结构:一边是今天就能拿来搭建系统的、经过验证的前沿模型;另一边是尚未经过验证的开源挑战者,它便宜到足以让你去测试,并且有意把价格讨论的重心引向整个开源权重模型类别。


看什么
• 首次独立复现 Toolathlon-Verified。如果第三方测试框架确认 HY4 Preview 得分在 70 多分,"开放权重无法进行智能体工具使用"的论点将不攻自破。
• 腾讯是否会在完整版 Hy4 发布之前推出视觉功能。纯文本模式将 HY4 Preview 限制为 GPT-5.6 Sol 所处理工作负载的一个严格子集。
• HY4 Preview 长思考倾向带来的实际 token 账单。按每百万输出 18 元计算,冗长的自我验证蚕食价格优势的速度比 20 美元模型更快。
• 在 Hy4 全面上线之前,Sol 的分级定价是否会再次下调。路由器的价格传导意味着降价当天即可显现。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
