
腾讯 Hy4 预览版从第一天起即可在 vLLM 中运行:你真正能部署的 770B 开放权重 MoE
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
2026年8月28日,腾讯Hy4 Preview正式上线时,它做了一件大多数前沿旗舰模型发布首日都做不到的事:开箱即可运行。除了开放权重,腾讯和vLLM团队还发布了预构建的Docker镜像、官方服务部署方案,并在vLLM中集成了框架支持。因此,混元系列迄今最大的开源权重模型——总参数7700亿,每个token激活490亿——在公告发布后数小时内,就能在你自己的GPU上通过OpenAI兼容的接口运行。这篇帖子要讲的就是这个“发布当天即可运行”的故事,因为对这样规模的模型来说,“能跑在vLLM上”绝不是一条脚注。它决定了这只是一个新闻稿,还是一个可以真正投入生产的东西。
这次发布的其余部分就是常见的预览版套餐,注意事项与数字同样重要。腾讯官方将Tencent Hy4 Preview称为早期迭代版本,将过长的推理和过度自我验证标记为已知行为,并发布了一份完全由自身报告的基准测试表——目前还没有独立实验室对其进行评分,截至本文撰写时,该模型才发布两天。这些都不改变实际的核心要点:模型权重采用Apache 2.0许可,上下文窗口为100万个token,而且首日即提供的vLLM支持意味着自托管路径是实实在在的,而非只停留在设想阶段。
腾讯 Hy4 Preview 实际上是什么
腾讯将 Hy4 Preview 定位为 Hy3(总参数 295B,上下文 256K)的继任者,活跃容量大约翻倍,上下文窗口扩大到四倍。这一架构值得逐行研读,因为每一行都在改变开放权重模型在自有硬件上被允许执行的操作。
{{1}}• 架构——混合专家模型(Mixture-of-Experts),总参数7700亿,每个token激活490亿参数,共78层。第一层是稠密层;其余77层将每个token路由到256个路由专家外加1个共享专家,激活排名前8的专家。正是约16:1的稀疏比,才让推理成本保持在靠谱团队实际能跑起来的范围内。{{/1}}
• 上下文窗口 — 原生 1,048,576 个token,是所有开放权重模型中最宽的上下文之一。整个代码库、多文件重构、长文档批次:单次请求即可解决的问题。
• {{1}}注意力 — 采用 IndexCache 的门控 DeepSeek 稀疏注意力(Gated DSA){{/1}}{{2}},这是一种稀疏注意力设计,{{/2}}{{3}}仅在 78 层中的 21 层计算新的稀疏索引,{{/3}}{{4}}并在其余 57 层复用该索引。{{/4}}{{5}}正因如此,服务化部署它不只是“更大的 vLLM”{{/5}}{{6}}——它需要一个理解稀疏注意力的后端。{{/6}}
• 内置投机解码——模型内部包含一个 MTP(多 token 预测)层,总参数约 10B / 激活参数约 0.7B,因此 vLLM 和 SGLang 无需你单独托管一个草稿模型即可生成草稿 token。
• 权重 — Apache 2.0 许可,提供 BF16 和 FP8 两种检查点格式,已发布至 Hugging Face、ModelScope、GitCode 和 CNB。
“day-zero vLLM”的实际含义
发布当天合并的框架支持是这一信号背后的具体事件——添加 Tencent Hy4 Preview(PR #54160)的 vLLM 变更与发布在同一窗口内落地,官方方案面向 vLLM 0.29.0 或更新版本。实际上,这意味着服务路径只需一条命令,而非一周的内核调试。
docker run --gpus all -p 8000:8000 --ipc=host -v ~/.cache/huggingface:/root/.cache/huggingface vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 --tensor-parallel-size 8 --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' --attention-backend FLASHMLA_SPARSE --tool-call-parser hy_v4 --reasoning-parser hy_v4 --enable-auto-tool-choice --served-model-name hy4-preview
这些标志很重要,每一个都映射到模型中的对应内容,而不是无意义的模板文本:
• --attention-backend FLASHMLA_SPARSE — 必需项,非可选项。腾讯 Hy4 Preview 的 Gated DSA 稀疏注意力在默认的稠密后端上无法正确运行,官方配方所设置的就是此标志。
• --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' — 启用模型内置的MTP层进行投机解码,提前三个草稿token。无需部署单独的草稿模型。
• --tool-call-parser hy_v4 和 --reasoning-parser hy_v4 —— 这些自定义解析器用于告知服务器腾讯 Hy4 Preview 如何发出工具调用及其思维链,而 --enable-auto-tool-choice 则让模型自行决定何时调用工具。
Tencent建议采样时使用temperature 0.9和top_p 1.0。推理默认采用针对数学、编程和复杂任务设计的"高"努力度思维链;如果你希望不经过长时间思考直接获得回答,可以在请求中传入no_think推理努力度,而不是调整权重。

零日支持并非 vLLM 独有,对于这样一个新发布的版本来说,这本身就值得注意。SGLang 当天就发布了预构建的多架构镜像(lmsysorg/sglang:hy4-preview),支持 NEXTN 风格的投机解码;此外,昇腾(Ascend)生态通过 vLLM-Ascend 实现了零日支持,使用 W8A8 量化权重,跨越 16 个 Atlas 800I A3 NPU。开放权重模型发布后,服务生态通常需要数周才能赶上;而这次只花了数小时。
值得引用的分数
腾讯发布的每一项Tencent Hy4 Preview基准测试都是供应商自行报告的——在腾讯自己的评估环境中运行,没有经过任何独立实验室复现,且该模型已公开两天。应将其视为腾讯自认为达到的上限,而非既定事实。在第三方运行测试之前,独立验证并不存在;公开排行榜上目前没有任何数据反映该模型。

最引人注目的数字是 Terminal Bench 2.1——一项衡量模型在编码时操作真实终端能力的测试。腾讯报告称,Tencent Hy4 Preview 的得分为 85.4,并声称这一成绩追平了 Claude Opus 5,超越了 DeepSeek V4 Pro,同时也比自家前代 Hy3 高出 14.6 分。这一数字承载了本次发布的核心卖点——它宣称一款开放权重模型在一项高难度的智能体编码测试中与最昂贵的闭源前沿模型持平——而这也是最需要独立验证的说法。
内部表格的其余部分都是腾讯自家的数据:软件工程基准DeepSWE从Hy3上的28.0跃升至64.3。SWE-bench Pro得分65.7,SWE-bench Multilingual得分82.9。在工具调用测试Toolathlon-Verified上,腾讯报告的成绩为74.1,称其超越了Qwen 3.8 Max和GPT-5.6 Sol,接近Kimi K3和Claude Opus 5。在APEX-Agents pass@1上,它取得37.1,仅比Kimi K3的37.2略低。在另一项独立的内部盲评中,腾讯招募的163位专家对203项工程任务的评分为2.99分(满分4.00),略胜GLM-5.3的2.92和Kimi K3的2.94。
有两个模式值得注意。每一个亮眼的数据都集中在智能体工程任务上——终端操作、工具调用、仓库级任务——而没有一项涉及通用知识或推理,这符合生产力定位,而非巧合。腾讯将DeepSWE及其他模型描述为缩小差距,而非弥合差距;唯一一个干净且可宣传的对等声明是Terminal Bench 2.1上的持平,而这个声明最值得用你自己的负载来测试。
实际运行成本
首先需要坦诚说明的是自托管所需的算力成本。这不是一个单 GPU 模型,也不是桌面级模型。FP8 检查点的权重接近 1 TB,官方方案假定采用 8 路张量并行——即八块配备高速互连的高带宽 GPU(腾讯用于 FP8 的参考硬件为 8×B300,而完整 BF16 则需要 16×B200)。如果你的硬件达不到这一规模,就不可能低成本地自行托管它;而且由于其稀疏注意力后端,在 100 万 token 的上下文长度下,KV 缓存的内存占用没有捷径可绕。
发布周的一个附加组件改变了部分此类计算,对那些想要开放权重却不想承担旗舰级规模负担的团队而言。腾讯Hy团队发布了Tencent Hy4 Preview的压缩GGUF构建,将约1.5 TB的BF16版本压缩至约200 GiB,采用其称为MIX-STQ1_0的逐层混合量化方案——大部分专家张量降至约1.3比特,而对残差流关键的网络层保持更高精度。在腾讯自己的评估中,精度变化很小——SWE-bench Multilingual从82.9降至81.3,MCP Atlas从83.7降至83.2,IFBench从73.5降至72.5——这一权衡被供应商称为近乎无损。这些数字来自腾讯自身的测试环境,目前尚未被独立复现。200 GiB的模型仍然不是单GPU模型,但相比近TB级的FP8检查点,它显然是一个更小的赌注,而且它让开放权重路线在较小的多GPU节点上即可实现,不再需要八块B300方案所假设的配置。
API 路径才是价格真正有趣的地方。{{1}}在腾讯云 TokenHub 上,腾讯 Hy4 Preview 的定价为每百万输入 token 6 元(约 0.83 美元)、每百万输出 token 18 元(约 2.50 美元)、每百万缓存命中 token 0.3 元(约 0.04 美元)。{{/1}}{{2}}约 2.50 美元/百万的输出价格,远低于顶级闭源前沿模型每百万 token 25 美元的输出价格,{{/2}}而低廉的缓存命中价格也让长时 agentic 循环——即同一系统提示词和对话前缀被不断重发——变得异常实惠。
腾讯还在模型新推出期间,在 WorkBuddy 和 CodeBuddy 内提供腾讯 Hy4 Preview 的两周免费访问,所以本周试用它的最便宜方式就是免费——而 WorkBuddy 正是生产力定位落到实处的地方。在任何 WorkBuddy 对话中,模型选择器都会在 Hy3 和 Hy4 预览之间切换,因此办公生产力与分析工作(一边)和编码(另一边)之间的分野是按任务的选择,而非部署决策。这种分野与腾讯对该模型的定位相吻合,而 WorkBuddy 中的上手测试显示,它能一次性生成复杂的成果物——从单条提示词生成可玩的低多边形游戏原型,从十份附件组装出完整季度业务回顾且零人工干预,以及本周流传的测试者演示中的黑洞模拟。这些是社区对腾讯自家应用的观察,而非厂商基准测试——但它们是该模型在真实多步任务上表现的首批上手信号,而且在你花任何钱之前都可以免费复现。
成本决策正是路由层改变成本计算的地方,我们也会坦承自己在其中的角色:OrcaRouter 目前尚不路由 Tencent Hy4 Preview,因为腾讯尚未将该模型开放给第三方推理平台——它运行在腾讯云自家的 TokenHub 端点上,以及开放权重的自托管部署中,而我们不能声称提供我们并未提供的东西。路由层带来的是围绕它的决策框架。如果你正在 8-GPU 节点和 API 之间做选择,目录中其他部分所遵循的同一套直通原则,也将在腾讯开放该模型的那一天生效:OrcaRouter 以零加价直通供应商的目录价格,因此供应商降价当天就会在我们这边同步生效,而不是被转售和加价。而对于一个发布仅两天、唯一依据是供应商基准测试的模型,自动故障转移是测试它的安全方式——把经过验证的模型放在关键路径上,将 Tencent Hy4 Preview 放在其旁,在成本画像占优的任务上切入,一旦不占优便立即切回,全部通过一个 API 和一个密钥完成。

规格表写不下的极限
腾讯直白地列出了已知限制,而这些限制应左右任何部署决策。腾讯 Hy4 Preview 是一个纯文本模型,仅此而已——不支持视觉或多模态输入——因此任何与图像或视频沾边的任务都应使用其他模型。腾讯还指出了复杂任务下的慢启动行为(首次输出前思考时间较长),以及过度自我验证的倾向,即消耗 token 反复检查已完成的工作。这种组合恰好不适合对延迟敏感的聊天场景,也恰好可以容忍离线批处理工程任务,这正说明了腾讯期望你在何种场景下运行它。
发布材料中有两项声明值得单独关注,因为它们关乎模型的构建方式,而非它的得分。腾讯表示,Tencent Hy4 Preview 参与了自身的开发——它帮助优化了训练方法、数据策略、评估框架以及产生自身的底层算子,这是一个早期的递归自我改进循环——并且它自主优化了自身的推理系统,相比基线实现了 31.8% 的端到端吞吐量提升。在科学方面,腾讯报告称,它将凸几何中 Blaschke–Lebesgue 问题的已知下界从 0.380799 推进到 0.41104,并在一个包含 32,512 个原子的磷脂双分子层模拟上实现了 2.0 倍的加速,每步耗时降至 54.9 毫秒。与发布首日的其他所有内容一样,这些仍是腾讯单方面的说法。
而最重要的缺失是验证。目前,腾讯 Hy4 Preview 还没有任何独立评分——公开排行榜上没有,第三方评测实验室没有,Artificial Analysis 也没有收录条目。这个模型太新了,还达不到这一步。内部专家盲测是一个有用的信号,能看出腾讯自己的评测者如何看待它与 GLM-5.3 和 Kimi K3 的对比,但这终究是腾讯的评测者在腾讯自己的任务上进行的评测。规格表之外的一切,都只是有待核实的主张。
本周应由谁运行 Tencent Hy4 Preview?
本周,诚实的答案分为三类,其中一类完全不需要硬件。如果你只是想感受 Tencent Hy4 Preview 能做什么,免费的 WorkBuddy 入口是最快的路径——无需 GPU,无需 API 密钥,打开对话,将模型选择器切到 Hy4 preview,然后交给它一个 Work 或 Coding 任务。如果你有 GPU 并批量运行工程负载——长期智能体任务、仓库级分析、离线评估——这个模型现在值得认真测一测:权重开放,上下文窗口达到仓库级,vLLM 路径只需一条命令,而且发布周的 GGUF 构建降低了试用时的硬件门槛。如果你运行的是对延迟敏感的生产环境聊天,或任何多模态应用,或任何无法接受一个只有厂商自身基准作为证据的模型,那就等一等——Tencent 自 2 月以来大约每两个月迭代一次,并且已经表示下一批 Hy4 模型即将到来,因此这个预览版明确只是早期迭代版本。
对其他人来说,有用的姿态是一种路由模式:在你已经信任的模型旁边验证它,成本低到你可以随时抽身,并且只在其数字在你自己的工作负载上依然成立的地方扩展它。这就是路由器的存在意义——当Tencent向第三方推理开放这个模型的那一天,它就会像其他任何模型一样,加入那个统一API、200多个模型、按标价直通的目录,而故障转移和组合工具届时将已就位。在那之前,权重在Hugging Face上,API在Tencent Cloud上,免费试用在WorkBuddy里——而“开放权重模型达到了智能体编码的顶级水平”这一说法,终于有了一个具体的数字作证。这个数字是Tencent的。测试是你自己的。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
