
腾讯Hy4 Preview正式开放:770B MoE,支持百万Token上下文,每百万输入Token仅需¥6
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
Tencent Hy4 Preview,于2026年8月28日发布并开源,是腾讯六个月内的第三款旗舰模型,也是第一款不再只是研究里程碑、而是定价事件的模型。它是一款混合专家(MoE)模型,拥有7700亿参数——每个token激活490亿参数——原生上下文窗口为100万token,以Apache License 2.0协议发布,提供BF16和FP8两种格式,今天即可从Hugging Face、GitHub、ModelScope和GitCode下载。腾讯将其定价为每百万输入token 6元人民币、每百万输出token 18元人民币,约合0.83美元和2.50美元,这使得一款顶级开源权重模型的价格低于市场上几乎所有封闭前沿模型。一次发布,三种面貌:可自行运行的开源权重、腾讯云TokenHub上的API,以及已部署在腾讯自家产品中的相同权重——WorkBuddy、CodeBuddy、元宝和ima。以下是实际发布的内容、腾讯声称的评分,以及尚未经任何人验证的部分。
工程上的门道比参数数量更重要,因为每一个组件都是影响成本的杠杆。模型共 78 层:第一层是标准稠密前馈网络,其余 77 层为 MoE 层,每层有 256 个路由专家外加 1 个共享专家,每个 token 激活 top-8 路由专家。约 16:1 的稀疏率正是让 770B 模型在服务端变得可负担的关键——每个 token 只有 49B 的切片在参与计算。专用的多 token 预测层(10B 参数,0.7B 激活)支持推测解码;注意力栈采用带 IndexCache 的门控 DeepSeek 稀疏注意力,以控制长上下文内存占用。推理可在长时间思考的code>high/code> 模式和节省 token 的code>no_think/code> 模式之间切换。这些细节决定了宣传价格能否在实际工作负载面前站得住脚,而不是模型能否写出俳句。
带注释的规格表
逐行阅读发布说明,因为每一行都在悄然改变开放权重模型被允许做的事情。
• 参数 — 总计770B,每个token激活49B,约16:1的稀疏比率,使得服务成本保持在小型团队实际可负担的范围内。
• 上下文 — 原生 1,048,576 token 窗口,是 Hy3 的 256K 的四倍。完整的代码库、多文件重构、72 文档的财务资料包——单次请求即可解决的问题。
• 许可证 — Apache License 2.0 同时适用于 BF16 原版和 FP8 量化版本,这意味着可以自行托管、微调及商业使用,无需专有条款。
• 推理栈 — 腾讯将 vLLM 和 SGLang 列为受支持的推理服务框架,这也是开放权重生态系统实际标准化的两个框架。
• API — 腾讯云 TokenHub 端点:每百万输入 token ¥6,每百万输出 token ¥18,缓存命中每百万 ¥0.3。
• 产品集成——腾讯在WorkBuddy、CodeBuddy(国内和国际版)、Yuanbao和ima中提供的相同权重,都是你可以直接拉取并运行的。CodeBuddy在发布时提供该模型的两周免费试用。
腾讯还报告了一个很少出现在发布说明中的推理工程数据:通过算子融合和通信优化,端到端吞吐量提升了31.8%。这种细节正是区分实验室作为研究产物发布的模型与公司期望承受生产流量的模型的差异所在。而在发布当天,这也恰恰是腾讯之外还没有人验证过的那类声明。
值得引用的分数
腾讯为 Tencent Hy4 Preview 发布的每一项基准测试均为厂商自报——在腾讯自己的评估环境中运行、未经任何独立实验室复现,且该模型公开还不到一天。请将其视为腾讯自认为触及的天花板。

最受瞩目的数字是 Terminal Bench 2.1——一项测试模型在编码时操控真实终端能力的基准。腾讯报告的成绩为 85.4,据称与 Claude Opus 5 持平并超越 DeepSeek V4 Pro,同时领先自家前代 Hy3 达 14.6 分。这个数字承载了太多含义:它意味着开放权重模型在艰难的智能体编码测试中与最昂贵的闭源前沿模型并驾齐驱,而这一说法最需要独立验证。内部表格其余部分:DeepSWE 从 Hy3 的 28.0 跃升至 64.3,腾讯称其与一线模型的差距正“逐步缩小”;工具调用测试 Toolathlon-Verified 得分为 74.1;APEX-Agents pass@1 为 37.1,以毫厘之差落后于 Kimi K3 的 37.2;SWE-bench Pro 为 65.7,SWE-bench Multilingual 为 82.9。在另一项内部盲测中,163 位专家对 203 项工程任务打分,结果为 4 分制中的 2.99 分,略高于 GLM-5.3 的 2.92 与 Kimi K3 的 2.94。
有两个模式尤为突出。首先,所有亮眼的成绩都集中在智能体工程工作上——终端驱动、工具调用、仓库级任务——而没有一项属于通用聊天或知识范畴,这与腾讯将该模型定位为"为生产力而生"、覆盖软件工程、办公与数据分析、游戏开发和科学研究的定位一致。其次,腾讯措辞谨慎,将DeepSWE及其他模型描述为正在缩小差距,而非消除差距。唯一一个清晰且便于营销的持平说法是Terminal Bench 2.1的并列成绩,而这正是最值得用自己的实际工作负载去验证的说法。
每百万¥6实际上能买到什么
定价才是这次发布从“有趣”转向“颠覆性”的地方。每百万输出token收费18元——约合2.5美元——一次消耗百万输出token的长时间agentic编码会话,成本大约仅为顶级闭源前沿模型同样会话的十分之一;而0.3元的缓存命中价格,则让agentic循环中反复发送的系统提示和对话前缀比大多数竞争对手的缓存方案便宜得多。腾讯自家的演示中,该模型单次处理了72份金融文档;在这样的价格下,这种批量任务成为每日可负担的常规工作,而不是一项预算开支。
这也是路由层改变这笔账的地方,值得精确说明。OrcaRouter 目前并不路由 Tencent Hy4 Preview——腾讯尚未向第三方推理平台开放这一模型,因此它运行在腾讯云 TokenHub 端点上,以及开放权重的自托管部署上;我们不声称提供我们没有的东西。但让降价有意义的那套纪律,与目录中其他模型遵循的是同一条:OrcaRouter 以零加价传递供应商的挂牌价,所以当某个供应商把一个 token 定价为 6 元时,你在我们这边支付的就是 6 元,而不是被转售和加价后的版本——而且供应商改价的当天,我们这边也会同步生效。一个 API 接入 200+ 模型,当某家供应商出问题时自动在提供商之间故障转移,以及用路由 DSL 将多个模型组合成一次调用:这套机制将在腾讯开放 Tencent Hy4 Preview 的那一刻承载它,而它也是你现在就可以用来把一个全新的、未经证实的模型放在一个经过验证的模型旁边运行的机制,而不必把你的生产路径押在任何一个上。

值得再读一遍的主张
发布材料中有两点是关于模型的构建方式,而非其得分,这两点值得单独关注。
首先是自我改进循环。腾讯表示,腾讯Hy4 Preview参与了自身的研发——它被用于优化生成它的训练方法、数据策略、评估系统和底层算子。这是一个初始的递归自我增强循环:一个模型帮助设计自己的下一个版本,而腾讯将其作为已交付的能力发布。这是一个重大声明,而且完全是自我报告的。
第二个是数学成果。腾讯报告该模型将 Blaschke–Lebesgue 问题(凸几何中一个关于恒定宽度最小体积体的长期未解问题)的已知下界从 0.380799 提高到 0.41104,使其与 Meissner 四面体猜想值相差约 2% 以内。腾讯还报告在 32,512 个原子的磷脂双分子层模拟中实现了 2.0 倍加速,每步耗时降至 54.9 毫秒。像这样的结果通常足以让一个模型单独发表论文;而在这里它们只是发布亮点,并且和第一天的一切一样,都源自腾讯自己的报告。
诚实的差距
腾讯直白地列出了已知限制。没有视觉或多模态输入——腾讯Hy4 Preview是纯文本模型,仅此而已,因此任何与图像或视频相关的内容都应交给另一个模型。腾讯还指出了复杂任务上的慢启动行为——首次输出前会思考很久——以及过度自我验证的倾向,即消耗token去反复检查已完成的工作。这种组合对延迟敏感的聊天来说恰好是硬伤,对离线批处理工程工作来说却恰好可以接受,这说明了腾讯期望你在什么场景下运行它。
而最重要的缺失是验证。目前还没有任何关于腾讯 Hy4 Preview 的独立评分——既不在公开排行榜上,也不来自第三方评测实验室。这个模型太新了。内部专家盲测是一个有用的信号,能反映腾讯自己的评审员认为它与 GLM-5.3 和 Kimi K3 相比如何,但这是腾讯的评审员在腾讯的任务上进行的测试。所有超出规格表的内容都只是有待核查的主张。

如何今天就实际试一试
实际路径很短。从 Hugging Face、GitHub、ModelScope 或 GitCode 拉取权重,并用 vLLM 或 SGLang 提供服务;如果想要按列表价格使用托管端点,可以调用腾讯云的 TokenHub API;或者在 CodeBuddy 或 WorkBuddy 中使用它,腾讯正在那里提供两周免费试用。Hy3 模型的免费访问持续到 9 月 30 日,而腾讯自己的节奏——大约每两个月一次重大迭代——表明完整的 Hy4 发布距离预览版并不遥远。
实话实说:一个开放权重、770B参数、百万上下文窗口的模型,每百万输入token定价6元人民币,截至今日确实存在;与之相关的最强基准,不过是厂商声称与某个封闭前沿模型打平,而这一说法至今无人复现。把它拉下来,跑一遍你真正关心的测试,让证据来决定价格是否依然是卖点。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
