
腾讯HY4预览版对比Kimi K3:腾讯选择公布的盲测
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
腾讯HY4 Preview与Kimi K3的对比,是本次模型发布中腾讯自己选择进行的一场对决。在内部盲测中——163名工程师、203项工程任务、按四分制评分——HY4 Preview得分2.99/4.00,而Kimi K3为2.94,腾讯的标题称之为胜利。这场胜利的细则值得细读:HY4 Preview在51.2%的任务上击败了Kimi K3,在7.9%的任务上持平,在40.9%的任务上落败。10个百分点的净胜率是真实的,但相对于一个总参数量仅为三分之一、活跃参数量不足一半的模型来说,这只是微弱的优势——而且整个测试都是由腾讯自己完成的。
Kimi K3 是 Moonshot 推出的 2.8 万亿参数开源权重旗舰模型,是有史以来发布的最大开源模型,也是自 7 月 16 日以来中国各大实验室一直拿来比对的参考基准。腾讯之所以选择它作为对手,正因为它就是开源权重的标准——这使得本文的任务格外具体:读一读挑战者主动发起的这一场正面交锋,然后判断它的价值。
腾讯选择发布的基准测试
盲测是由腾讯自家工程师在腾讯自身的工程任务上评分的,这是首先要打折扣的地方。公司自选的任务集恰恰是新模型最能展现最佳表现的环境。即便承认这一点,结果的结构仍有参考价值:51.2%的胜率对40.9%的败率只是小幅领先,7.9%的平局率则说明两者在大多数任务上势均力敌。而在困难任务上——也就是前沿模型真正拉开差距的地方——差距依然如故;腾讯打出“略胜Kimi K3”的标题,措辞算是诚实,这一点并非每个实验室都能做到。
规模并非宿命。
参数对比使这一结果要么令人印象深刻,要么令人生疑,取决于你的先验立场。Kimi K3 总参数量为 2.8 万亿,其中活跃参数为 1040 亿——共 896 个专家,每个 token 激活 16 个——并且它经过训练,始终开启推理,思维链完全暴露。HY4 Preview 总参数量为 7700 亿,活跃参数为 490 亿,总规模仅为前者的三分之一,活跃算力不到其一半。在盲测中,较小的模型以微弱优势胜过较大的模型,这正是整个开源权重领域一直以来的发展趋势——Qwen3.8-Max(2.4T 参数)与 GLM-5.2(753B 参数)数月来一直在智能体基准测试上互有胜负——因此这一结果合理可信,而非荒谬离奇。但同样关键的是:除腾讯内部人员外,没有任何人验证过这一结果。
记分牌

• 规模 — HY4 Preview 770B 总参数 / 49B 激活参数 对比 Kimi K3 2.8T 总参数 / 104B 激活参数
• 上下文 — HY4 Preview >1M tokens vs Kimi K3 1M tokens
• 每 1M 价格 — HY4 Preview 输入 ¥6 / 输出 ¥18(约 $0.85 / $2.50)对比 Kimi K3 输入 $3.00 / 输出 $15.00,缓存命中 $0.30
• 模态 — HY4 预览版纯文本 vs Kimi K3 原生图像和视频输入
• 推理 — HY4 Preview 没有公开的模式,而 Kimi K3 始终开启推理,带有流式思维链
• 独立评分 — HY4 Preview 无 vs Kimi K3 AA 智能指数 57,发布时全球前三
在双方都报告数字的那些行上,模型聚集成簇。腾讯报告HY4 Preview在APEX-Agents上得分37.1,与Kimi K3的37.2基本持平——这是盲测记分板会预测到的几近平局。HY4 Preview的Toolathlon-Verified 74.1和DeepSWE 64.3在我手头没有Kimi K3的对应分数,而Kimi K3的FrontierSWE 81.2、ProgramBench 77.8和BrowseComp 91.2也没有HY4 Preview的对应分数。记分板诚实地显示出这两张卡几乎不重叠,这本身就提醒我们:不应把任何一方的各行当作对该模型的完整描述。
愿景是最大的真正差异。
对于今天要在两者之间做出选择的开发者来说,{{1}}结构性差距不在于智能——而在于输入模态{{/1}}。Kimi K3 是{{2}}原生多模态{{/2}}的:它{{3}}通过 MoonViT-V2 编码器接受图像和视频输入{{/3}},并且是视觉任务上最优秀的开源模型之一,{{4}}在视觉竞技场上排名全球第二{{/4}}。腾讯 HY4 Preview {{5}}在这个预览版中仅支持文本{{/5}},{{6}}腾讯表示视觉能力要等到完整版发布{{/6}}。任何需要{{7}}截图、UI 理解或视觉定位{{/7}}的工作负载都归 Kimi K3 所有,{{8}}默认如此,无论盲测对工程文本的评价如何{{/8}}。如果你的工作{{9}}纯粹是代码、文档和终端输出{{/9}},这个差距无关紧要;{{10}}一旦任务涉及看东西,它就决定了胜负{{/10}}。
成本问题
按 token 计费,HY4 Preview 便宜得多:输入/输出约为 $0.85/$2.50,而 Kimi K3 为 $3.00/$15.00;缓存命中价格为 ¥0.3(约四美分),相比之下 Kimi K3 是 $0.30。但这两个模型的 token 行为相反,从而缩小了差距。Kimi K3 始终在线推理,并流式输出其思维链(chain-of-thought),这会增加每次请求的输出 token 数;评测者指出该模型速度较慢——约每秒 62 个 token——并且在智能体循环中 token 消耗较大。根据 Tencent 自己的发布说明,HY4 Preview 在复杂任务上“倾向于过度思考并进行过多的自我验证”。两者都会消耗额外的输出 token;HY4 Preview 只是对这些 token 收费更低。公平的比较应该是“每完成一项任务的成本”,而 Tencent 之外还没有人测量过 HY4 Preview 的这一成本。
裁决
腾讯HY4预览版是更便宜、更小、未经验证的挑战者,声称在盲测中比开放权重标准模型略胜一筹;Kimi K3则是更大、经过验证、支持视觉的现有主流模型,每token成本高出四到五倍,独立智能指数为57。两个模型的基准测试卡都不完全独立——Kimi K3的头条分数同样由Moonshot报告,但其指数57并非如此。如果你的工作负载是多模态的,Kimi K3是这场对决中的唯一选择。如果是文本和工程类负载,HY4预览版是更具性价比的选择,它拥有真实的(尽管是供应商运营的)直接对比成绩。省钱的路径是:在生产密钥上路由Kimi K3——它已在OrcaRouter上线,按Moonshot的$3.00/$15.00标价直通、不加价——同时在影子工作负载上通过腾讯自己的API运行HY4预览版。当HY4预览版接入路由器后,同一个密钥和同样的故障转移规则将同时承载两者,腾讯的¥6/¥18费率也将原样直通。


看什么
• 独立重跑盲测任务。51.2% 的胜率是本次发布中最可检验的说法,第三方测试框架一周内就能给出定论。
• HY4 Preview 是否会在完整版 Hy4 发布前推出视觉功能。这才是能将这场仅限文本的价值对决转变为真正旗舰之争的关键。
• 在标准智能体测试框架上每完成一项任务的成本。两个模型都消耗大量 token;每完成一项任务成本更低者,将在生产部署的争论中胜出。
• Kimi K3对价格压力的回应。如果Moonshot削减15美元的输出费率,“廉价挑战者与昂贵标准”的框架就会反转。
