
Tencent HY4 Preview 对比 tencent-hy3:六倍价格,跃升究竟带来了什么
- google新Google: Gemini 3.8 Flash2026-09-0259智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0258智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0166智能82代码
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
腾讯HY4 Preview是混元(Hunyuan)家族中首个有意让自家前代产品显得廉价的模型:腾讯将其输入价格定为tencent-hy3的六倍,输出价格为其四倍半,发布会资料声称这一溢价是物有所值的。 腾讯HY4 Preview于2026年8月28日发布并开源,据报道其在DeepSWE上的软件工程得分是Hy3的28.0的两倍多,在Terminal-Bench 2.1上的终端操作得分为85.4,上下文窗口从256K跃升至超过一百万个token。 tencent-hy3于7月6日正式发布,是该家族中成熟的骨干型号——总参数295B,激活参数21B,上下文长度仅为前者的四分之一,价格则低到近乎可以忽略不计。 这不是一场规格表上势均力敌的较量。问题在于,对于你实际运行的任务而言,这个差距是否值得付出这笔钱,而答案因工作负载而异。
记分牌:两者真正的分歧所在
腾讯资料中的每一项基准测试都是厂商自行报告的——在每款模型发布时于腾讯自己的评估环境中运行,未经独立实验室复现,而且旗舰模型公开亮相还不到一天。将这些分数视为腾讯自认为达到的上限,并更看重整体模式,而非任何单个数字。这一模式明确无误,且集中于智能体工程工作,而非通用知识:
• DeepSWE — Tencent HY4 预览版:64.3。tencent-hy3:28.0。这是这组对比中最大的一次跃升,在仓库级软件工程基准测试上实现了一倍以上的提升,而这个数字正是区分聊天模型与你可交付整个代码库的模型的关键分水岭。
• Terminal-Bench 2.1 — Tencent HY4 Preview:85.4,腾讯称这与 Claude Opus 5 持平,并超过了 DeepSeek V4 Pro。 • tencent-hy3:71.7,与其 7 月发布时报告的数据一致。 • 驱动真实终端完成多步骤任务,正是 Hy3 最不擅长的长周期工作。
• Toolathlon 验证 — 腾讯 HY4 预览版:74.1,腾讯称其超越了 Qwen 3.8 Max 和 GPT-5.6 Sol。没有发布可比较的 Hy3 数据。
• 内部盲测 — 163位专家对203项工程任务进行评分,腾讯HY4 Preview获得2.99/4.00,以微弱优势领先GLM-5.3的2.92和Kimi K3的2.94。这是腾讯评审员针对腾讯任务的评测;请视其为方向性参考。

贯穿始终的主线:提升集中在终端驱动、工具调用和仓库级任务上——这是腾讯自 Hy3 以来一直推动的生产力定位,如今有了算力作支撑。
价格溢价,逐行解析
到这里,比较就不再是炫耀资本的事了。腾讯的标价,按每百万 token 计算:
• 输入 — Tencent HY4 Preview:6元(约0.85美元)。tencent-hy3:1元(约0.14美元)。六倍。
• 输出 — Tencent HY4 Preview:18 元(约 2.50 美元)。tencent-hy3:4 元(约 0.56 美元)。四倍半。
• 缓存命中 — Tencent HY4 Preview:0.3 元。tencent-hy3:0.25 元。几乎相同,但这比表面看起来更重要,因为代理循环会不断重新发送相同的系统提示和对话前缀。
用一个真实的智能体编码工作负载来套混合价格——比如一个月内2000万输入token和400万输出token,这是一个繁忙的独立开发者智能体预算。Tencent HY4 Preview:120元加72元,约192元(约27美元)。tencent-hy3:20元加16元,约36元(约5美元)。旗舰型号在相同token混合比例下的运行成本是前者的五倍多——而且它每个任务会要求更多输出token,因为它思考得更久。
这不是回避腾讯 HY4 Preview 的理由;DeepSWE 的跃升正是溢价版存在的价值所在。而是在将工作负载路由到该模型之前,先为其定价的理由。也正是路由层发挥作用的地方:tencent-hy3 已经以提供商列出的价格上线 OrcaRouter——0% 加价,因此你看到的就是服务提供商自身的价格,而非转售加价后的版本——并具备跨提供商的自动故障转移,供应商的价格变动也会在当天同步生效到我们这边。
四倍上下文,双倍活跃计算
• 架构 — Tencent HY4 预览版:总参数量 770B,激活参数 49B MoE。tencent-hy3:总参数量 295B,激活参数 21B。旗舰模型在每个 token 上投入的计算量约为前者的 2.3 倍。
• 上下文窗口 — Tencent HY4 Preview:超过1M tokens。tencent-hy3:256K。整个仓库或一批金融文档可作为单次请求放进旗舰模型的窗口;在Hy3上,同样的任务则需要分块、检索或Agent循环。
• 推理控制 — tencent-hy3 提供按请求设置的 reasoning_effort 选项(no_think、low、high),外加一层投机解码(speculative decoding)来保持高速。Tencent HY4 Preview 正如腾讯自己所承认的,倾向于在首次输出前进行长时间思考,并在复杂任务上过度自我验证——耗费 token 去重复检查已经完成的工作。
最后一行才是对延迟敏感场景中容易被忽略的关键差异。Hy3 可以被要求直接作答;腾讯 HY4 Preview,至少在目前这个早期版本中,往往无法不进行思考。对于低延迟聊天或高吞吐量提取流水线,旗舰版的额外能力是浪费,而它的额外思考则是一种开销。对于离线批处理工程任务,这笔开销恰恰就是换取更优答案的代价。
预览税:Hy3仍然拥有的东西
“Preview”就在腾讯HY4 Preview的名字里,其表现也名副其实。没有视觉或多模态输入——模型仅支持文本,因此任何涉及图像或视频的内容仍由你目前使用的模型来处理。WorkBuddy和CodeBuddy上的两周免费试用只是尝尝鲜,并非正式方案。腾讯已明确表示,这是Hy4的早期迭代版本,预训练和后训练的改进仍将陆续推出,按照自2月以来大约每两个月推出一个大版本的节奏推进。旗舰模型的独立基准测试:目前还没有,任何地方都没有。
tencent-hy3 与此恰恰相反。它是一个官方、稳定的版本,自7月起便已投入生产。其免费额度持续到9月30日。它的推理级别提供的是可调档位,而非难以捉摸的脾气;其推测解码层和210亿活跃参数,使它成为该系列中廉价、快速、可预期的那一半——一个你指向默认路径后便可置之不理的模型。

谁应该选择哪个
当任务本身才是关键时,选择 Tencent HY4 Preview——一项艰巨的软件工程任务、仓库规模的上下文、或一个智能体工作流;在这些场景中,更好的答案抵得上五倍的 token 费用,而且你也能承受一个先思考后回答的模型带来的延迟。当约束才是关键时,选择 tencent-hy3——高吞吐、低延迟、预算紧张,或任何你希望模型直接作答而非反复斟酌的任务。
对于这样的配对,实用的模式是升级:在默认路径上路由廉价且可控的模型,只有当任务需要时才升级到旗舰模型。这正是 OrcaRouter 的路由 DSL 的用途——将多个模型组合到一次调用中,使策略成为配置而非代码——而且自动故障转移意味着即使某个提供商降级,Hy3 的路径也能继续提供服务。OrcaRouter 尚不支持路由 Tencent HY4 Preview;腾讯尚未向第三方推理开放该模型,因此目前它运行在厂商自己的腾讯云 TokenHub 端点上,以及开放权重的自托管部署上。与此同时,tencent-hy3 今天已以提供商的标价出现在目录中——一旦旗舰模型开放,它将以同样的方式接入同一个路由层,将从一个模型切换到另一个模型变成一行更改,而不是重写。

这个结论以最好的方式显得平淡无奇:旗舰机型对于其定价所对应的工作来说物有所值,而主力机型对于所有只需完成的任务来说仍然是正确的选择。六倍的价格差距真实存在,28到64的DeepSWE差距也真实存在,二者并不会相互抵消——你只需要清楚自己买的是哪一款。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
