用于对比“Tencent HY4 Preview vs Kimi K3”的主标题卡片。中央的记分牌式卡片显示“内部盲测,4分制”,左侧为“Tencent HY4 Preview 2.99”,右侧为“Kimi K3 2.94”。左侧卡片“Tencent HY4 Preview”列出“770B / 49B 激活,开放权重”、“¥6 / ¥18 每 1M”、“纯文本预览”。右侧卡片“Kimi K3”列出“2.8T / 104B 激活,开放权重”、“$3.00 / $15.00 每 1M”、“原生视觉,AA Index 57”。页脚写道:“盲测由腾讯开展,163 名工程师参与,覆盖 203 项任务;结果为厂商自行报告。”OrcaRouter 标志合成在右下角。
Guides & Insights

腾讯HY4预览版对比Kimi K3:腾讯选择公布的盲测

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

腾讯HY4 Preview与Kimi K3的对比,是本次模型发布中腾讯自己选择进行的一场对决。在内部盲测中——163名工程师、203项工程任务、按四分制评分——HY4 Preview得分2.99/4.00,而Kimi K3为2.94,腾讯的标题称之为胜利。这场胜利的细则值得细读:HY4 Preview在51.2%的任务上击败了Kimi K3,在7.9%的任务上持平,在40.9%的任务上落败。10个百分点的净胜率是真实的,但相对于一个总参数量仅为三分之一、活跃参数量不足一半的模型来说,这只是微弱的优势——而且整个测试都是由腾讯自己完成的。

Kimi K3 是 Moonshot 推出的 2.8 万亿参数开源权重旗舰模型,是有史以来发布的最大开源模型,也是自 7 月 16 日以来中国各大实验室一直拿来比对的参考基准。腾讯之所以选择它作为对手,正因为它就是开源权重的标准——这使得本文的任务格外具体:读一读挑战者主动发起的这一场正面交锋,然后判断它的价值。

腾讯选择发布的基准测试

盲测是由腾讯自家工程师在腾讯自身的工程任务上评分的,这是首先要打折扣的地方。公司自选的任务集恰恰是新模型最能展现最佳表现的环境。即便承认这一点,结果的结构仍有参考价值:51.2%的胜率对40.9%的败率只是小幅领先,7.9%的平局率则说明两者在大多数任务上势均力敌。而在困难任务上——也就是前沿模型真正拉开差距的地方——差距依然如故;腾讯打出“略胜Kimi K3”的标题,措辞算是诚实,这一点并非每个实验室都能做到。

规模并非宿命。

参数对比使这一结果要么令人印象深刻,要么令人生疑,取决于你的先验立场。Kimi K3 总参数量为 2.8 万亿,其中活跃参数为 1040 亿——共 896 个专家,每个 token 激活 16 个——并且它经过训练,始终开启推理,思维链完全暴露。HY4 Preview 总参数量为 7700 亿,活跃参数为 490 亿,总规模仅为前者的三分之一,活跃算力不到其一半。在盲测中,较小的模型以微弱优势胜过较大的模型,这正是整个开源权重领域一直以来的发展趋势——Qwen3.8-Max(2.4T 参数)与 GLM-5.2(753B 参数)数月来一直在智能体基准测试上互有胜负——因此这一结果合理可信,而非荒谬离奇。但同样关键的是:除腾讯内部人员外,没有任何人验证过这一结果。

记分牌

A two-column scoreboard titled 'Tencent HY4 Preview vs Kimi K3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Blind test vs K3: 2.99 vs 2.94 (vendor-run)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Vision: not in preview'. Right column 'Kimi K3': 'Total / active: 2.8T / 104B', 'Context: 1M tokens', 'AA Intelligence Index: 57', 'FrontierSWE: 81.2 (vendor-reported)', 'Price: $3.00 / $15.00 per 1M', 'Vision: native, image + video'. Footer reads 'HY4 Preview figures are Tencent-reported; Kimi K3 Index 57 from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• 规模 — HY4 Preview 770B 总参数 / 49B 激活参数 对比 Kimi K3 2.8T 总参数 / 104B 激活参数

• 上下文 — HY4 Preview >1M tokens vs Kimi K3 1M tokens

• 每 1M 价格 — HY4 Preview 输入 ¥6 / 输出 ¥18(约 $0.85 / $2.50)对比 Kimi K3 输入 $3.00 / 输出 $15.00,缓存命中 $0.30

• 模态 — HY4 预览版纯文本 vs Kimi K3 原生图像和视频输入

• 推理 — HY4 Preview 没有公开的模式,而 Kimi K3 始终开启推理,带有流式思维链

• 独立评分 — HY4 Preview 无 vs Kimi K3 AA 智能指数 57,发布时全球前三

在双方都报告数字的那些行上,模型聚集成簇。腾讯报告HY4 Preview在APEX-Agents上得分37.1,与Kimi K3的37.2基本持平——这是盲测记分板会预测到的几近平局。HY4 Preview的Toolathlon-Verified 74.1和DeepSWE 64.3在我手头没有Kimi K3的对应分数,而Kimi K3的FrontierSWE 81.2、ProgramBench 77.8和BrowseComp 91.2也没有HY4 Preview的对应分数。记分板诚实地显示出这两张卡几乎不重叠,这本身就提醒我们:不应把任何一方的各行当作对该模型的完整描述。

愿景是最大的真正差异。

对于今天要在两者之间做出选择的开发者来说,{{1}}结构性差距不在于智能——而在于输入模态{{/1}}。Kimi K3 是{{2}}原生多模态{{/2}}的:它{{3}}通过 MoonViT-V2 编码器接受图像和视频输入{{/3}},并且是视觉任务上最优秀的开源模型之一,{{4}}在视觉竞技场上排名全球第二{{/4}}。腾讯 HY4 Preview {{5}}在这个预览版中仅支持文本{{/5}},{{6}}腾讯表示视觉能力要等到完整版发布{{/6}}。任何需要{{7}}截图、UI 理解或视觉定位{{/7}}的工作负载都归 Kimi K3 所有,{{8}}默认如此,无论盲测对工程文本的评价如何{{/8}}。如果你的工作{{9}}纯粹是代码、文档和终端输出{{/9}},这个差距无关紧要;{{10}}一旦任务涉及看东西,它就决定了胜负{{/10}}。

成本问题

按 token 计费,HY4 Preview 便宜得多:输入/输出约为 $0.85/$2.50,而 Kimi K3 为 $3.00/$15.00;缓存命中价格为 ¥0.3(约四美分),相比之下 Kimi K3 是 $0.30。但这两个模型的 token 行为相反,从而缩小了差距。Kimi K3 始终在线推理,并流式输出其思维链(chain-of-thought),这会增加每次请求的输出 token 数;评测者指出该模型速度较慢——约每秒 62 个 token——并且在智能体循环中 token 消耗较大。根据 Tencent 自己的发布说明,HY4 Preview 在复杂任务上“倾向于过度思考并进行过多的自我验证”。两者都会消耗额外的输出 token;HY4 Preview 只是对这些 token 收费更低。公平的比较应该是“每完成一项任务的成本”,而 Tencent 之外还没有人测量过 HY4 Preview 的这一成本。

裁决

腾讯HY4预览版是更便宜、更小、未经验证的挑战者,声称在盲测中比开放权重标准模型略胜一筹;Kimi K3则是更大、经过验证、支持视觉的现有主流模型,每token成本高出四到五倍,独立智能指数为57。两个模型的基准测试卡都不完全独立——Kimi K3的头条分数同样由Moonshot报告,但其指数57并非如此。如果你的工作负载是多模态的,Kimi K3是这场对决中的唯一选择。如果是文本和工程类负载,HY4预览版是更具性价比的选择,它拥有真实的(尽管是供应商运营的)直接对比成绩。省钱的路径是:在生产密钥上路由Kimi K3——它已在OrcaRouter上线,按Moonshot的$3.00/$15.00标价直通、不加价——同时在影子工作负载上通过腾讯自己的API运行HY4预览版。当HY4预览版接入路由器后,同一个密钥和同样的故障转移规则将同时承载两者,腾讯的¥6/¥18费率也将原样直通。

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Kimi K3 is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) showing the capability chips, a 1M-token context window, $3.00 per 1M input tokens and $15.00 per 1M output tokens, released July 15 2026 by MoonshotAI.

看什么

• 独立重跑盲测任务。51.2% 的胜率是本次发布中最可检验的说法,第三方测试框架一周内就能给出定论。

• HY4 Preview 是否会在完整版 Hy4 发布前推出视觉功能。这才是能将这场仅限文本的价值对决转变为真正旗舰之争的关键。

• 在标准智能体测试框架上每完成一项任务的成本。两个模型都消耗大量 token;每完成一项任务成本更低者,将在生产部署的争论中胜出。

• Kimi K3对价格压力的回应。如果Moonshot削减15美元的输出费率,“廉价挑战者与昂贵标准”的框架就会反转。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube