生成的标题卡写着 GPT-6 Sol 对比腾讯 HY4 Preview,更便宜的模型承载流量,数据卡片显示输出价格为每百万 $10.00 对比 $2.50,权重为闭源对比 Apache 2.0 开放权重,输入形态为文本、图像、文件对比仅文本,页脚写着 GPT-6 Sol 的费率依据 OpenAI 的费率表;腾讯 HY4 Preview 的费率与速度依据 OrcaRouter 的目录,厂商标价每百万 6 / 18 元。
Guides & Insights

GPT-6 Sol 对比 Tencent HY4 Preview:更便宜的模型承载了六百倍的流量

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

前沿模型与廉价模型之间的比较通常止步于价格表,而这一次却可以有更好的结局。Tencent HY4 Preview与GPT-6 Sol都由 OrcaRouter 路由,这意味着同一套遥测数据覆盖两者;在同一个滚动七天窗口内,HY4 Preview 模型处理了约 24 亿 token,而 GPT-6 Sol 约为 390 万。这不是基准测试,也不是裁决;它只是某个平台流量的一个滚动窗口,下周再看就会不同。但它是一个真实信号,说明当强大的开放权重模型成本只有闭源模型的四分之一时,真正动手构建的人实际会选用什么;而且这是规格表无法给出的那种数字。

这两个模型也堪称一项关于基准测试能告诉你什么、不能告诉你什么的研究。GPT-6 Sol 于 2026 年 9 月 22 日发布,是 OpenAI GPT-6 世代中的中间层级,拥有独立的 Intelligence Index 评分。HY4 Preview 由 Tencent 于 2026 年 8 月 28 日发布并开源,却没有 Artificial Analysis 的模型页面,没有第三方指数,也完全没有独立的单任务成本数据。关于它表现如何的一切已发布信息,都出自 Tencent 自己的测量。这种不对称并不意味着 HY4 Preview 是更弱的那个模型。它意味着 HY4 Preview 是受审查更少的那个,而这是两种不同的说法。

这些规格,包括决定大多数部署的那两项

• 输出价格 — GPT-6 Sol 每百万 $10.00,对比 Tencent HY4 Preview 每百万 $2.50
• 输入价格 — GPT-6 Sol 每百万 $2.00,对比 Tencent HY4 Preview 每百万 $0.83
• 缓存输入 — GPT-6 Sol 每百万 $0.20,对比 Tencent HY4 Preview 每百万 $0.04
• 权重 — GPT-6 Sol 闭源、仅提供 API,对比 HY4 Preview 以 Apache 2.0 开源
• 输入模态 — GPT-6 Sol 支持文本、图像和文件,对比 HY4 Preview 仅支持文本
• 上下文窗口 — GPT-6 Sol 1,050,000 tokens,对比 HY4 Preview 1,048,576 tokens
• 最大输出 — GPT-6 Sol 128,000 tokens,对比 HY4 Preview 64,000 tokens
• 长请求阶梯 — GPT-6 Sol 在输入超过 272,000 tokens 时对整条请求重新定价为 $4.00 / $15.00,对比 HY4 Preview 的定价卡上没有这一阶梯
• 架构 — GPT-6 Sol 未披露,对比 HY4 Preview:总参数 770B,激活参数 49B,78 层,256 个路由专家外加一个共享专家,原生多 token 预测层
• 独立评分 — GPT-6 Sol 为 47.6 Intelligence Index,对比 HY4 Preview 未公布
• 实测输出速度 — GPT-6 Sol 约每秒 244 tokens,对比 HY4 Preview 约每秒 54 tokens,两者均为七天滚动数据

真正决定大多数实际部署的,是排在最下面的那两行。第一行是,HY4 Preview 不接受图像或文件输入,这使它无法用于任何必须查看某些内容的流程。第二行是输出上限:64,000 tokens 是 GPT-6 Sol 的 128,000 的一半,而对于一个宣称用途是编码智能体和长工具使用链的模型来说,这是团队最先撞上的约束——不是质量,而是生成文件不再能放进单个响应的那个临界点。

与这些相比,输出价格的四分之一和缓存输入价格的五分之一,就能换来大量重试。而且,HY4 Preview 的架构以 GPT-6 Sol 所没有的方式被记录在案:Tencent 公布了参数量、层数、专家布局和推测解码层,这意味着其服务特性至少可以部分地从论文中预测,而不只是通过 API 观察得到。

Generated comparison scoreboard titled GPT-6 Sol vs Tencent HY4 Preview, the scoreboard, with six matched rows. GPT-6 Sol: input $2.00 per million, output $10.00 per million, modalities text image file, weights closed, context window 1,050,000 tokens, Intelligence Index 47.6. Tencent HY4 Preview: input $0.83 per million, output $2.50 per million, modality text only, weights Apache 2.0 open, context window 1,048,576 tokens, no independent score published. A footer reads Tencent HY4 Preview rates per OrcaRouter's catalogue against a vendor list of 6 / 18 yuan per million; GPT-6 Sol figures per Artificial Analysis v4.3.2 and OpenAI.

HY4 Preview的基准测试表实际上是什么

腾讯公布的数据很亮眼,而且全部由厂商自行开展。在 Terminal-Bench 2.1 上,该模型得分 85.4;在 DeepSWE 上为 64.3;在一项覆盖 203 个工程任务的内部盲测中,它平均得分 2.99,而 GLM-5.3 为 2.92、Kimi K3 为 2.94——在腾讯设计的一项十分制研究中领先 0.07 分。它还首次登上 WebDev Arena 排行榜,腾讯称其综合排名约第五,在开放权重模型中位列第三。竞技场的结果由大众投票产生,而非厂商评分,是这组证据中最独立的一项;其余都是宣称,而只要标明是宣称,宣称就仍然值得一读。

真正要紧的差距,不在于这些数字可能偏宽松——厂商自建的评测框架通常都偏宽松,而且两个方向都可能偏。而在于,没有任何第二份测量结果可供对照。有 Artificial Analysis 页面的模型可以被核查,没有的则无从核查,而这种差别往往要等到几个月后才会显现:有人发现某个头条数字是在一个别人都无法复现的评测框架上测出来的。这里没有任何迹象表明 HY4 Preview 已经遭遇了这种情况。它只是意味着,一个建立在 85.4 之上的采用决策,仅依托于单一来源。

实际意义在于,HY4 Preview 应当基于你自己的流量来评估,而不是基于那张表,而且其成本结构让这件事变得很便宜——以 GPT-6 Sol 输出价格的四分之一计算,针对你真实提示词跑一周影子流量,成本还不到一次 API 层级评审。对于一款测量不足的模型,这才是尽职调查的正确形式,而几乎没有人真正这样做。

开放权重问题,才是真正的分界线

HY4 Preview 在 Apache 2.0 下开源,并随基础检查点一同提供采用宽松许可的 FP8 构建版本。GPT-6 Sol 是闭源的,并且没有许可证文件,因为没有什么可授权的。这场比较中的其他一切都是权衡;而这一点则是类别上的差异。

这带来的主要好处并不是更便宜的账单——以每百万输出 2.50 美元的价格,托管 API 已经低于大多数团队运行一个 7700 亿参数模型的成本;而如果成本就是全部理由,那么宽松许可证也就无关紧要了。它真正带来的是不依赖任何人的端点的部署方式:不会被限流的权重、可以量化以适配你现有硬件的检查点、可以微调的模型,以及能够留在网络边界之内的流量。GPT-6 Sol 对这四点的回答是,你本不该需要其中任何一项——这对于确有其事的一类团队来说是个成立的论点,而对于那些真正需要的团队来说则毫不相关。

模态划分和许可证这一条指向同一个方向,这一点值得注意。一个只读文本、并以 Apache 2.0 许可发布的模型,天生就是一个组件——是你放进自己控制的流水线里的东西,喂给它的应该是你已经协调好的文本。一个能读文本、图像和文件、却只能通过 API 访问的模型,天生就是入口,直接接收那些杂乱无章的输入。这是两种不同的工作,而用同一个指数给它们排名,等于在回答一个两家供应商都没问过的问题。

OrcaRouter model page for Tencent Hy4 preview (tencent/hy4-preview) by Tencent, dated 2026-08-28, tagged Tools, JSON and Reasoning, describing it as Tencent's latest mixture-of-experts flagship with 770 billion total parameters, 49 billion activated per token, 78 layers, 256 routed experts plus one shared expert and a 1M-token context window, text-only, with a list price of $0.83 per million input and $2.50 per million output and a p50 time to first token of 6.18 seconds.

将它们一起提供,以及流量数字暗示了什么

这两个模型和其他 200 多个模型一样,都挂在同一个 OrcaRouter 密钥之下,而这种搭配所暗示的路由形态,与最显而易见的做法正好相反。把 HY4 Preview 放在前面——在输出上它的价格要便宜四倍,它是有文档记录架构的那一个,在我们的路由上也是它承担着主要负载——把 GPT-6 Sol 留在它后面,用于那些需要读取图像的请求、需要输出超过 64,000 个 token 的请求,或者未通过质量检查的请求。这种组合是在路由 DSL 中表达的,而不是写在应用代码里,因此两者之间的边界是一条无需部署即可修改的规则。

这些速度数字值得先加一句说明,再给出一个结论。HY4 Preview 在我们的滚动窗口中测得约为每秒 54 个输出 token,而 GPT-6 Sol 约为 244;两者都是共享基础设施上的观察结果,而非受控基准测试——腾讯那个数字尤其反映的是一个活跃参数量极大的模型,而每个 token 有 490 亿活跃参数,意味着每个输出 token 都要进行大量算术运算。因此,更便宜的模型反而要慢得多,而这正是批处理流水线乐于接受、交互式流水线却无法接受的取舍。腾讯的托管版本还在 2026 年 9 月 7 日获得了一次性能优化,厂商称其能在相同任务质量下减少推理轮次和每任务 token 消耗——这同样是厂商声明的数字,但它预示的是更低的账单,而不是更快的流式输出。

故障转移正是让这种配对无论按哪种顺序都安全的关键。一个 7700 亿参数的开放权重模型由不止一家基础设施提供商提供服务,而一条能够回退的路由意味着,降级的主机只是一次重试,而不是一次服务中断。我们的目录不加价地直接传递提供商的标价,这也意味着你不必等待供应商以某种货币报价的费率:腾讯将 HY4 Preview 标为每百万输入 6 元、每百万输出 18 元,而我们页面显示的美元数字正是按该费率换算而来,不是经销商的加价。

Artificial Analysis model page for GPT-6 Sol (Max), a proprietary OpenAI model released September 2026, carrying a banner noting the model is deprecated and that OpenAI has launched a newer release, GPT-6.1 Sol. The page shows an Intelligence Index of 48, an output speed of 87.9 tokens per second, $2.00 per million input and $10.00 per million output, a 90% cache discount, and a 1M-token context window.

这对东西实际上是做什么用的

选择 Tencent HY4 Preview,用于大批量处理,用于你自主控制的纯文本管道,用于任何需要在自有硬件上运行的任务,也用于任何错误答案可以被捕获并重试的工作负载——其价格让重试成为你手中最廉价的质量杠杆。当输入是图像或文件时,当单次响应必须承载超过 64,000 个 token 时,或当答案将交给一个不会核实便直接行动的人时,选择 GPT-6 Sol。如果你的流量中两者兼有,那就两者都用——而你的流量几乎必然如此。

两项收尾检查。HY4 Preview 仍被标注为预览版,并且仍是我们目录中最新的腾讯模型,因此这个名称是准确的,而非过时——但预览版可能会在你不知情的情况下发生变化,而一个采用宽松许可的检查点也可能在毫无预警的情况下被其最终正式版取代。而且 GPT-6 Sol 已经被 GPT-6.1 Sol 取代,短上下文费率相同,缓存输入价格从 $0.20 减半至 $0.10,OpenAI 自己的模型页面现在也把读者引向那里。如果你权衡 Sol 而非腾讯模型的原因是那个已有八天历史的集成,那仍然成立。如果是能力,那么继任者才是你应该定价的对象。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新