标题卡上写着 GPT-6 Astra 对比腾讯 HY4 Preview,副标题为“一个模型的数字已由他人核验过。另一个则没有——而 64,000 个输出 token 正是便宜这一方止步之处”,背景是一幅生成插图:一个密封的认证方块,旁边是一个打开的、可见分层的方块。
Guides & Insights

GPT-6 Astra 对比腾讯 HY4 预览版:一个模型拥有审计追踪,另一个只有基准测试表

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Tencent HY4 Preview和GPT-6 Astra,如果看厂商自己公布的数字,是当今可获得的、通往接近前沿的智能体编程的两条最便宜路径;而如果看其他人的说法,它们又是该档位中最不可比的两个模型。Tencent HY4 Preview 于 2026 年 8 月 28 日发布,并以 Apache 2.0 协议开源,每百万输入 token 收费 0.834 美元,每百万输出 token 收费 2.501 美元,采用 7700 亿参数的混合专家架构,上下文窗口超过 100 万 token,输出上限为 64,000 token。GPT-6 Astra 自 2026 年 9 月 3 日起正式可用,输入和输出价格分别为 10.00 美元和 50.00 美元,窗口为 1,050,000 token,最大输出为 128,000 token。Astra 的优势有八项已发布的第三方评估作为支撑;HY4 Preview 的优势则只有腾讯自家的终端、工具调用和盲评测试作为支撑,别无其他。这种不对称并不意味着更便宜的模型更弱。它意味着这两个比较中有一个可以核实,另一个只能相信,因此实际决策也会相应地不同。

Apache 2.0 版本究竟为你带来了什么

许可证是这场对比中价格表无法表达的部分。腾讯 HY4 预览版并不是一个打着开放权重旗号的托管式试用产品——其权重可从 Hugging Face、GitHub、ModelScope 和 GitCode 下载,这意味着无论腾讯对其自身定价、自身端点或自身是否继续提供该服务做出何种决定,该模型都能存续下去。

• 架构 — 总计 7700 亿参数,每个 token 激活 490 亿参数,78 层,256 个路由专家外加一个共享专家,以及一个用于推测解码的原生多 token 预测层br /> • 服务特征 — 每秒 54.6 个输出 token,首 token 中位延迟 6.26 秒,基于 OrcaRouter 各路由在滚动七天窗口内的测量结果br /> • 上下文与上限 — 1,048,576 token 的窗口,最大输出 64,000 tokenbr /> • 输入形式 — 仅支持文本;不支持图像、文件、音频br /> • 推理控制 — 三个级别:high、low 和 none,默认使用 high,另有文档推荐的采样参数:temperature 0.9 和 top_p 1.0br /> • 可靠性 — 同一七天窗口内错误率为 2.8%,而 Astra 路由为 10.3%

那最后一对数字是这一页上最具行动指导意义的内容,而且是任何供应商都不会公布的自有模型数据。Astra 的独立基准分数更高,而它的路由在过去一周里大约每十次请求就失败一次;相比之下,一个完全没有独立分数的模型是每三十五次请求失败一次。这两个数字都不是关于模型本身的论断——错误率衡量的是路由、速率限制和上游,而不是权重——但它们是生产系统实际会经历到的数字。

Comparison card with two columns. GPT-6 Astra: $10.00/$50.00 per 1M, cached input $1.00, $20.00/$75.00 whole-request reprice above 272K input, 1,050,000 context / 128,000 max output, 54.7 index and 88.4 Terminal-Bench 2.1 third-party, 10.3% error and 70.6 tok/s over a rolling seven-day OrcaRouter route window. Tencent HY4 Preview: $0.834/$2.501 per 1M, cached input $0.042, 770B MoE with 49B active and Apache 2.0 weights, 1,048,576 context / 64,000 max output, 85.4 Terminal-Bench 2.1 and 74.1 Toolathlon vendor-reported with no independent index, 2.8% error and 54.6 tok/s over the same window

在哪里可以将腾讯的数据与别人的数据进行核对

就公开证据而言,这是一个真正不寻常的机会:Astra 和 HY4 Preview 都有 Terminal-Bench 2.1 的数值,而其中只有一个是厂商报告的。

• Terminal-Bench 2.1,驱动真实终端 — GPT-6 Astra 88.4,独立评测;腾讯 HY4 Preview 85.4,厂商自报br /> • 工具调用 — Astra 在 τ²-Banking 上为 41.4,独立评测;HY4 Preview 在 Toolathlon-Verified 上为 74.1,厂商自报,且测试不同br /> • 软件工程 — HY4 Preview 在 DeepSWE 上为 64.3,较其前代 Hy3 的 28.0 有所提升,厂商自报br /> • 智能体任务 — HY4 Preview 在 APEX-Agents 上 pass@1 为 37.1,厂商自报br /> • 人类偏好 — 由 163 位专家对 203 项工程任务评分,平均 2.99(满分 4.00),厂商主导,对比 GLM-5.3 的 2.92 与 Kimi K3 的 2.94br /> • 独立指数 — GPT-6 Astra 智能指数 54.7、GPQA Diamond 96.1,第三方;HY4 Preview 无对应指数

Terminal-Bench 那一行值得细究。独立测得的 88.4 与厂商报告的 85.4 之间那 3 分的差距,完全落在不同的测试框架、不同的脚手架或不同的采样温度所能造成的波动范围之内,这意味着诚实的解读不是“Astra 好三个点”,而是“这一档里最便宜的开放权重模型正宣称自己已不相上下,而这个说法至少还站得住脚”。腾讯自己在这一点上的表述颇为谨慎:它说 DeepSWE 是在“逐步缩小差距”,而非已经弥合差距;而它唯一一个干净利落的不相上下声明——在 Terminal-Bench 上与另一家厂商的顶级闭源模型打成平手——恰恰是最需要再做一次测量的那个说法。

还有一项变化值得了解,因为它改变的是经济账,而不是分数。2026年9月7日,Tencent 将一项优化推送到了实时预览版本中,并称该优化能减少复杂工作上的推理轮次和每任务 token 消耗。由于模型按 token 计费,即使每 token 费率没有变化,完成每个任务所用的 token 更少也会降低该任务的成本。这一节省的幅度是 Tencent 自己的测算,除 Tencent 外无人复现过——但该机制是真实的,也正是它让一款 8 月发布的预览版在 10 月运行时,可能比其发布时的介绍文章所暗示的要便宜得多。

64,000 个 token 的上限是决定部署的规格。

规格表往下翻到一半,就会看到最先让人卡壳的限制,而它并不是质量。HY4 Preview 的最大输出为 64,000 个 token,而 Astra 为 128,000 个,偏偏这款模型宣称的用途正是编码智能体和长工具调用链。生成的文件、跨多文件的补丁、长篇结构化报告——这些正是会撞上天花板的输出,而在智能体运行中,这种失败并不是答案稍差一点,而是输出被截断,必须由周边流水线来检测和处理。

两个模型都大约接收一百万 token 的输入,因此文档阅读场景确实是平手。差异完全在生成侧,而且是两倍之差,而非舍入误差。再加上输入面的差异——Astra 接受图像和文件,HY4 Preview 仅支持文本——浮现出的图景就是清晰的分工,而不是排名:开放权重模型适合文本输入、文本输出的智能体循环,其中交付物是工具调用或 diff;闭源模型适合任何需要查看某些内容或撰写长篇内容的任务。

20倍的产出率能带来什么,逐条说明

• 输入价格——Tencent HY4 Preview 每 1M $0.834,对比 GPT-6 Astra $10.00,约 12×br /> • 输出价格——HY4 Preview 每 1M $2.501,对比 Astra $50.00,约 20×br /> • 缓存输入——HY4 Preview 每 1M $0.042,对比 Astra $1.00,约 24×br /> • 长请求阶梯——对于超过 272,000 输入 token 的请求,Astra 会将整个请求重新定价为 $20.00 和 $75.00;HY4 Preview 的价格卡没有对应阶梯br /> • 400,000 token 提示词上的有效输入费率——HY4 Preview 保持 $0.834 不变,对比 Astra $20.00,约 24×br /> • 普通 agent 循环每百万 token 的成本,输入输出比 4:1——HY4 Preview 约 $1.17,对比 Astra 约 $18.00br /> • 相同比例下一个月 1 亿 token 的成本——HY4 Preview 约 $117,对比 Astra 约 $1,800

缓存输入这一项对昂贵一方来说是最难扩展的,因为智能体循环每一轮都会重新发送相同的系统提示和对话前缀。在 $0.042 对 $1.00 的情况下,长循环中最便宜的 token 在腾讯模型上要便宜 24 倍,而这恰恰是每 token 微小差异累积得最快的工作负载。每任务成本这个本可以干净利落解决这一问题的指标,腾讯根本没有公布——因此,要得到真正重要的数字,唯一的方法就是让两个模型都跑一遍你自己的任务集,并读取 usage 对象。

Text card headed 'The 64,000-token ceiling decides more deployments than quality does' with rows: max output 128,000 on GPT-6 Astra vs 64,000 on Tencent HY4 Preview; context 1,050,000 vs 1,048,576; input surface text image file vs text only; what breaks first is a generated file or multi-file patch; failure mode is silent truncation

手握错误率,路由器在这里的作用

这两款模型都在 OrcaRouter 目录中——tencent/hy4-preview和openai/gpt-6-astra——共用一个 OpenAI 兼容端点,各自按提供商自己的标价透传,0% 加价。最后这一点在这对模型上比在大多数情况下都更重要,因为腾讯模型的标价是以人民币公布的:上面的美元数字是你实际看到的换算价,而不是经销商价差;如果腾讯调整价格,这里当天就会生效,而不是等到下一次合同续签。

路由 DSL 正是这两个模型不再互为备选方案的地方。对这一对模型而言,自然的规则是按输出升级:把循环交给便宜的那个模型,当返回的响应触及 64,000 token 上限而被截断,或未能通过你的 schema 校验时,就针对 openai/gpt-6-astra重试那一步,它的输出空间是前者的两倍。自动故障转移是这套论点的另一半,而当两条路由中的一条在过去一周里每十个请求就有一个报错时,它绝非纸上谈兵——一次被钉在单个模型上的长时 agent 运行,会连同其累积的上下文一起死掉,而这两个模型都没有便宜到可以不小心从头再跑一遍的程度。

Text card headed 'Checked by somebody else, or checked by the vendor' with rows: GPT-6 Astra 54.7 Intelligence Index against none published for HY4 Preview; Terminal-Bench 2.1 88.4 independently evaluated vs 85.4 Tencent-reported; Tencent's 7 September reasoning-turn optimisation, unreproduced outside the vendor; and route error 10.3% on the Astra route vs 2.8% on the HY4 route over a rolling seven-day window

什么会改变这个比较?

三件事,按其能改变局面的程度排序。对 HY4 Preview 的独立评估——该模型已公开发布六周,没有第三方基准排名,没有可复现的 Terminal-Bench 分数,也没有单任务成本数据,而唯一由厂商进行的盲测评估是现存的唯一人类偏好数据。为两个模型公布每完成一个任务的成本,这将用一数字取代本文中的每一个比率。以及腾讯关于第三方推理的决定,因为 Apache 2.0 权重任何人都可以提供,而一旦竞争性托管方上线 HY4 Preview,这一比较中便宜一侧的价格就会变成市场价,而非一份报价单。

在那之前,可用的总结比任何一方的厂商发布文都更窄,却也比记分牌更诚实:GPT-6 Astra 是能力宣称已经过核验的那个模型,它的输出上限是两倍,而它的路由每十个请求就有一个失败。腾讯 HY4 Preview 是能力宣称尚未经过核验的那个模型,它公布架构、开放许可、价格只有三分之一,并且在同一个时间窗口内错误率低得多。如果你的工作是文本进、文本出,并且能装进 64,000 个生成 token 之内,那么更便宜的那个模型并不是一种妥协——它就是正确答案,而你唯一放弃的就是审计追踪。

这对组合的自然规则是按输出升级:把循环交给便宜的模型,当返回的响应撞上 64,000 token 上限而被截断,或未通过你的 schema 检查时,就针对该步骤改试 openai/gpt-6-astra,它的输出余量是前者的两倍。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新