“Tencent HY4 Preview 对比 tencent-hy3”的主标题卡片。标题为“六倍价格——这代飞跃究竟买到了什么”。左侧面板“Tencent HY4 Preview”(新旗舰,2026年8月28日),标签:“770B / 49B MoE”“1M 上下文”“DeepSWE 64.3”。右侧面板“tencent-hy3”(久经考验的可靠机型),标签:“295B / 21B MoE”“256K 上下文”“DeepSWE 28.0”。页脚文字:“价格 ¥6/¥18 对比 ¥1/¥4(每 MTok)。基准测试数据由厂商提供。”
Guides & Insights

Tencent HY4 Preview 对比 tencent-hy3:六倍价格,跃升究竟带来了什么

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

腾讯HY4 Preview是混元(Hunyuan)家族中首个有意让自家前代产品显得廉价的模型:腾讯将其输入价格定为tencent-hy3的六倍,输出价格为其四倍半,发布会资料声称这一溢价是物有所值的。 腾讯HY4 Preview于2026年8月28日发布并开源,据报道其在DeepSWE上的软件工程得分是Hy3的28.0的两倍多,在Terminal-Bench 2.1上的终端操作得分为85.4,上下文窗口从256K跃升至超过一百万个token。 tencent-hy3于7月6日正式发布,是该家族中成熟的骨干型号——总参数295B,激活参数21B,上下文长度仅为前者的四分之一,价格则低到近乎可以忽略不计。 这不是一场规格表上势均力敌的较量。问题在于,对于你实际运行的任务而言,这个差距是否值得付出这笔钱,而答案因工作负载而异。

记分牌:两者真正的分歧所在

腾讯资料中的每一项基准测试都是厂商自行报告的——在每款模型发布时于腾讯自己的评估环境中运行,未经独立实验室复现,而且旗舰模型公开亮相还不到一天。将这些分数视为腾讯自认为达到的上限,并更看重整体模式,而非任何单个数字。这一模式明确无误,且集中于智能体工程工作,而非通用知识:

• DeepSWE — Tencent HY4 预览版:64.3。tencent-hy3:28.0。这是这组对比中最大的一次跃升,在仓库级软件工程基准测试上实现了一倍以上的提升,而这个数字正是区分聊天模型与你可交付整个代码库的模型的关键分水岭。

• Terminal-Bench 2.1 — Tencent HY4 Preview:85.4,腾讯称这与 Claude Opus 5 持平,并超过了 DeepSeek V4 Pro。 • tencent-hy3:71.7,与其 7 月发布时报告的数据一致。 • 驱动真实终端完成多步骤任务,正是 Hy3 最不擅长的长周期工作。

• Toolathlon 验证 — 腾讯 HY4 预览版:74.1,腾讯称其超越了 Qwen 3.8 MaxGPT-5.6 Sol。没有发布可比较的 Hy3 数据。

• 内部盲测 — 163位专家对203项工程任务进行评分,腾讯HY4 Preview获得2.99/4.00,以微弱优势领先GLM-5.3的2.92和Kimi K3的2.94。这是腾讯评审员针对腾讯任务的评测;请视其为方向性参考。

A two-column comparison scoreboard titled 'Tencent HY4 Preview vs tencent-hy3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active params: 770B / 49B', 'Context window: 1M', 'DeepSWE: 64.3', 'Terminal-Bench 2.1: 85.4', 'Input price per MTok: ¥6 (~$0.85)', 'Output price per MTok: ¥18 (~$2.50)'. Right column 'tencent-hy3': 'Total / active params: 295B / 21B', 'Context window: 256K', 'DeepSWE: 28.0', 'Terminal-Bench 2.1: 71.7', 'Input price per MTok: ¥1 (~$0.14)', 'Output price per MTok: ¥4 (~$0.56)'. A footer reads 'Benchmarks vendor-reported by Tencent at each model's launch.'

贯穿始终的主线:提升集中在终端驱动、工具调用和仓库级任务上——这是腾讯自 Hy3 以来一直推动的生产力定位,如今有了算力作支撑。

价格溢价,逐行解析

到这里,比较就不再是炫耀资本的事了。腾讯的标价,按每百万 token 计算:

• 输入 — Tencent HY4 Preview:6元(约0.85美元)。tencent-hy3:1元(约0.14美元)。六倍。

• 输出 — Tencent HY4 Preview:18 元(约 2.50 美元)。tencent-hy3:4 元(约 0.56 美元)。四倍半。

• 缓存命中 — Tencent HY4 Preview:0.3 元。tencent-hy3:0.25 元。几乎相同,但这比表面看起来更重要,因为代理循环会不断重新发送相同的系统提示和对话前缀。

用一个真实的智能体编码工作负载来套混合价格——比如一个月内2000万输入token和400万输出token,这是一个繁忙的独立开发者智能体预算。Tencent HY4 Preview:120元加72元,约192元(约27美元)。tencent-hy3:20元加16元,约36元(约5美元)。旗舰型号在相同token混合比例下的运行成本是前者的五倍多——而且它每个任务会要求更多输出token,因为它思考得更久。

这不是回避腾讯 HY4 Preview 的理由;DeepSWE 的跃升正是溢价版存在的价值所在。而是在将工作负载路由到该模型之前,先为其定价的理由。也正是路由层发挥作用的地方:tencent-hy3 已经以提供商列出的价格上线 OrcaRouter——0% 加价,因此你看到的就是服务提供商自身的价格,而非转售加价后的版本——并具备跨提供商的自动故障转移,供应商的价格变动也会在当天同步生效到我们这边。

四倍上下文,双倍活跃计算

• 架构 — Tencent HY4 预览版:总参数量 770B,激活参数 49B MoE。tencent-hy3:总参数量 295B,激活参数 21B。旗舰模型在每个 token 上投入的计算量约为前者的 2.3 倍。

• 上下文窗口 — Tencent HY4 Preview:超过1M tokens。tencent-hy3:256K。整个仓库或一批金融文档可作为单次请求放进旗舰模型的窗口;在Hy3上,同样的任务则需要分块、检索或Agent循环。

• 推理控制 — tencent-hy3 提供按请求设置的 reasoning_effort 选项(no_think、low、high),外加一层投机解码(speculative decoding)来保持高速。Tencent HY4 Preview 正如腾讯自己所承认的,倾向于在首次输出前进行长时间思考,并在复杂任务上过度自我验证——耗费 token 去重复检查已经完成的工作。

最后一行才是对延迟敏感场景中容易被忽略的关键差异。Hy3 可以被要求直接作答;腾讯 HY4 Preview,至少在目前这个早期版本中,往往无法不进行思考。对于低延迟聊天或高吞吐量提取流水线,旗舰版的额外能力是浪费,而它的额外思考则是一种开销。对于离线批处理工程任务,这笔开销恰恰就是换取更优答案的代价。

预览税:Hy3仍然拥有的东西

“Preview”就在腾讯HY4 Preview的名字里,其表现也名副其实。没有视觉或多模态输入——模型仅支持文本,因此任何涉及图像或视频的内容仍由你目前使用的模型来处理。WorkBuddy和CodeBuddy上的两周免费试用只是尝尝鲜,并非正式方案。腾讯已明确表示,这是Hy4的早期迭代版本,预训练和后训练的改进仍将陆续推出,按照自2月以来大约每两个月推出一个大版本的节奏推进。旗舰模型的独立基准测试:目前还没有,任何地方都没有。

tencent-hy3 与此恰恰相反。它是一个官方、稳定的版本,自7月起便已投入生产。其免费额度持续到9月30日。它的推理级别提供的是可调档位,而非难以捉摸的脾气;其推测解码层和210亿活跃参数,使它成为该系列中廉价、快速、可预期的那一半——一个你指向默认路径后便可置之不理的模型。

Screenshot of Tencent's official Hugging Face model card for the Hy4 Preview release, showing the model's open-weights download options, the 770B-parameter mixture-of-experts specification, and the million-token context window.

谁应该选择哪个

当任务本身才是关键时,选择 Tencent HY4 Preview——一项艰巨的软件工程任务、仓库规模的上下文、或一个智能体工作流;在这些场景中,更好的答案抵得上五倍的 token 费用,而且你也能承受一个先思考后回答的模型带来的延迟。当约束才是关键时,选择 tencent-hy3——高吞吐、低延迟、预算紧张,或任何你希望模型直接作答而非反复斟酌的任务。

对于这样的配对,实用的模式是升级:在默认路径上路由廉价且可控的模型,只有当任务需要时才升级到旗舰模型。这正是 OrcaRouter 的路由 DSL 的用途——将多个模型组合到一次调用中,使策略成为配置而非代码——而且自动故障转移意味着即使某个提供商降级,Hy3 的路径也能继续提供服务。OrcaRouter 尚不支持路由 Tencent HY4 Preview;腾讯尚未向第三方推理开放该模型,因此目前它运行在厂商自己的腾讯云 TokenHub 端点上,以及开放权重的自托管部署上。与此同时,tencent-hy3 今天已以提供商的标价出现在目录中——一旦旗舰模型开放,它将以同样的方式接入同一个路由层,将从一个模型切换到另一个模型变成一行更改,而不是重写。

Screenshot of the OrcaRouter model page for tencent/hy3, showing its provider list price and availability through the one-API routing catalog — the half of this family that can be routed today.

这个结论以最好的方式显得平淡无奇:旗舰机型对于其定价所对应的工作来说物有所值,而主力机型对于所有只需完成的任务来说仍然是正确的选择。六倍的价格差距真实存在,28到64的DeepSWE差距也真实存在,二者并不会相互抵消——你只需要清楚自己买的是哪一款。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube