
腾讯HY4预览版 vs Qwen3.8-Max:八月开放权重对决
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
腾讯 HY4 Preview 与 Qwen3.8-Max 的碰撞是本月一直在酝酿的。阿里巴巴的 Qwen3.8-Max 于 8 月 3 日正式全面可用,并于 8 月 12 日成为首款开放权重的 Max 级 Qwen;腾讯 HY4 Preview 于今天早上推出,比 Qwen3.8-Max 晚了 25 天,其发布卡片直接点名 Qwen3.8-Max——腾讯报告称 HY4 Preview 在 Toolathlon-Verified 上得分为 74.1,在该基准测试中领先 Qwen3.8-Max。两者都是开放权重的中国旗舰模型,定价都意在走量,但其中只有一个拥有独立的评测分数。
这两个模型的差距不仅是规模上的——Qwen3.8-Max拥有2.4万亿参数,而HY4 Preview为7700亿——但在买家看重的智能体基准测试中,它们瞄准的是同一个目标:长周期任务,即模型在无人介入的情况下读取信息、调用工具并持续迭代。这正是8月开源权重一代试图证明自己能够取代闭源前沿模型的领域,而Tencent的第一步,就是向本月最大的开源发布发起冲击。
记分牌

• 规模 — HY4 Preview 总参数 770B / 激活参数 49B,对比 Qwen3.8-Max 总参数 2.4T / 激活参数 ~95B
• 上下文 — HY4 Preview 在 API 上支持 >1M tokens,对比 Qwen3.8-Max 的 1M tokens(开放权重原生 262K,可扩展至 ~1.01M)
• 每百万价格 — HY4 Preview ¥6 输入 / ¥18 输出(约 $0.85 / $2.50)对比 Qwen3.8-Max $2.00 输入 / $6.00 输出,缓存读取 $0.25
• Terminal-Bench 2.1 — HY4 Preview 85.4(厂商自报)对比 Qwen3.8-Max 86.6
• 模态 — 两者的开源权重版本均仅支持文本;Qwen3.8-Max API 增加了图像和视频输入,而 HY4 Preview 预览版则不支持。
• 独立评分 — HY4 Preview 无 vs Qwen3.8-Max AA 智能指数 58,智能体指数 58
这两张数据卡从对立的两面讲述了同一个故事。在 Terminal-Bench 2.1 上,Qwen3.8-Max 的 86.6 与 HY4 Preview 的 85.4 相差一分半——Qwen 领先一分,且 HY4 的成绩未经审计。在价格上,HY4 Preview 的每 token 输入和输出费用都更低。在验证方面,Qwen3.8-Max 拥有独立的智能指数 58 和智能体指数 58;而 HY4 Preview 只有自家的宣传。这种差距正是典型的挑战者模式:以更优惠的价格和未经证实的说法,对抗一个经过验证的既存领先者。
阅读 Toolathlon 声明
Toolathlon-Verified 衡量的是智能体工具使用可靠性——即模型在包含错误、恢复和多步调用的完整任务中始终如一地驱动工具的能力。腾讯的 74.1 直接瞄准了 Qwen3.8-Max 画像中最强的部分,因为 Qwen 的智能体指数 58 和 OSWorld-Verified 的 86.1,正是让阿里巴巴的智能体主张具有可信度的数字。Qwen3.8-Max 还在 IFBench(指令遵循)上取得 82.8,在 PaperBench(研究级智能体工作)上取得 93.0,在厂商自己的榜单上双双超越 GPT-5.6 Sol 等模型。因此,腾讯选择了它声称能直接击败本月最大开源模型的那一个基准——而这一声称目前的可验证程度,与任何其他单一厂商的数据行一样:完全无法验证。
已核实与供应商报告对比
这是最不公平的对比维度,这种不对称性值得明确点明。Qwen3.8-Max 的 Intelligence Index(智能指数)58 分来自 Artificial Analysis,其 Agentic Index(智能体指数)58 分同样来自 Artificial Analysis,而给出这些分数的同一套独立测试框架也测出了它的短板:在 AA-Omniscience 上的幻觉率为 40%,高于上一代的 23%;每项任务耗时高达 64 次智能体轮次——模型确实很努力,但每一次轮次都要你来买单。Tencent HY4 Preview 完全没有这些测试数据。它的优势只是宣称,而它的失败模式——腾讯自己指出的长思考和过度自我验证——只是承认,而非测量结果。
对于在这两者之间做出选择的团队来说,验证差距并非抽象概念。Qwen3.8-Max 每个任务 64 轮次的行为是一个真实且可衡量的成本驱动因素:在 $2/$6 的价格下,它仍然是一些第三方对比中每个完成任务成本最高的智能体,而且团队已经反馈轮次数量正在侵蚀其价格优势。HY4 Preview 的对应行为尚不可知——它每个任务的实际成本可能比其本就低廉的每 token 价格所暗示的还要便宜,或者其自我验证的习惯可能会吃掉这部分差价。目前没有人能告诉你究竟是哪种情况,因为腾讯之外还没有人运行过它。
价格与开放权重的实际考量
按 token 计费,HY4 Preview 在收支两端都更便宜:¥6/¥18,对比 Qwen3.8-Max 的 $2.00/$6.00;缓存命中价格为 ¥0.3,对比 $0.25。这使得 HY4 Preview 成为输入或输出上最便宜的开源权重旗舰,仅此而已。但“开源权重”附带两套不同的细则。Qwen3.8-Max 的开源权重版本——Qwen3.8-2.4T-A95B——仅限文本且强制开启思考,原生上下文为 262K,而非 API 版的 1M;其自定义许可证还带有规模分层条件:月活用户超过 1 亿需显示模型名称,大型模型即服务(MaaS)业务需单独许可。腾讯 HY4 Preview 的权重已于今早上线 HuggingFace、ModelScope 和 GitHub,但其确切许可条款以及权重是否与线上 API 一致,尚未得到同等程度的明确说明。两个模型均可下载;但也都不是简便的即插即用方案。
底线
{{1}}Qwen3.8-Max 在验证所能带来安全性的每个方面都是更稳妥的选择:在智能和智能体工作上都获得独立评分、已知的失败模式、已定型的许可证,以及三周的生产反馈。{{/1}}但它的每 token 成本也更高,其测得的偏多轮交互行为是已知的成本风险。{{2}}腾讯 HY4 Preview 是性价比之选:输入和输出都更便宜,Terminal-Bench 的宣称水平相当,并且直接声称在 Toolathlon 验证中击败 Qwen——但这一切在第一天都未经验证。{{/2}}如果你本周就要把开放权重模型投入生产,Qwen3.8-Max 是站得住脚的选择,而且它已在 OrcaRouter 上线,按 Alibaba 的标价——$2.00/$6.00——原价直通,不加任何加价。{{3}}HY4 Preview 是评估项目:通过腾讯自己的 API,用你自己的 Toolathlon 风格任务运行它;把生产路径留在已验证的模型上;当独立评分出炉——或者当 HY4 Preview 接入路由器、其 ¥6/¥18 费率成为当日直通价时——切换只是一条路由规则,而不是一次重写。{{/3}}


看什么
• HY4 Preview 在智能体测试框架上的首次独立运行。Toolathlon 认证的 74.1 是腾讯想要赢下的数字;第三方 Agentic Index 将是确认。
• HY4 Preview 的实测轮次数量。Qwen3.8-Max 每任务 64 轮是前车之鉴;HY4 Preview 每个完成任务是否更便宜,才是整个经济论证的全部所在。
• 权重的许可条款。它们将决定对HY4 Preview而言,“开放”是否意味着“可在你的规模下使用”,正如Qwen3.8-Max许可条款对Alibaba的模型所做的那样。
• 两家供应商是否会再次降价。在这样一个两款开放权重旗舰以激进定价发货的月份里,通过路由器进行的价格转嫁会让任何进一步降价在当天就显现出来。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
