对比“Tencent HY4 Preview vs Qwen3.8-Max”的主标题卡片:中央横幅写着“八月开源权重对决”,标注为“两款开源权重旗舰,相隔25天”。左侧卡片“Tencent HY4 Preview”列出“770B / 49B 激活参数,8月28日发布”“每百万 token ¥6 / ¥18”“无独立评分”。右侧卡片“Qwen3.8-Max”列出“2.4T / ~95B 激活参数,8月3日发布”“每百万 token $2.00 / $6.00”“AA 指数 58”。页脚写道“HY4 Preview 数据为厂商报告;Qwen3.8-Max 评分依据 Artificial Analysis。”OrcaRouter 标志合成在右下角。
Guides & Insights

腾讯HY4预览版 vs Qwen3.8-Max:八月开放权重对决

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

腾讯 HY4 Preview 与 Qwen3.8-Max 的碰撞是本月一直在酝酿的。阿里巴巴的 Qwen3.8-Max 于 8 月 3 日正式全面可用,并于 8 月 12 日成为首款开放权重的 Max 级 Qwen;腾讯 HY4 Preview 于今天早上推出,比 Qwen3.8-Max 晚了 25 天,其发布卡片直接点名 Qwen3.8-Max——腾讯报告称 HY4 Preview 在 Toolathlon-Verified 上得分为 74.1,在该基准测试中领先 Qwen3.8-Max。两者都是开放权重的中国旗舰模型,定价都意在走量,但其中只有一个拥有独立的评测分数。

这两个模型的差距不仅是规模上的——Qwen3.8-Max拥有2.4万亿参数,而HY4 Preview为7700亿——但在买家看重的智能体基准测试中,它们瞄准的是同一个目标:长周期任务,即模型在无人介入的情况下读取信息、调用工具并持续迭代。这正是8月开源权重一代试图证明自己能够取代闭源前沿模型的领域,而Tencent的第一步,就是向本月最大的开源发布发起冲击。

记分牌

A two-column scoreboard titled 'Tencent HY4 Preview vs Qwen3.8-Max — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Terminal-Bench 2.1: 85.4 (vendor-reported)', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'Qwen3.8-Max': 'Total / active: 2.4T / ~95B', 'Context: 1M tokens', 'Terminal-Bench 2.1: 86.6', 'AA Agentic Index: 58', 'Price: $2.00 / $6.00 per 1M', 'Independent score: AA Intelligence 58'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; Qwen3.8-Max scores from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• 规模 — HY4 Preview 总参数 770B / 激活参数 49B,对比 Qwen3.8-Max 总参数 2.4T / 激活参数 ~95B

• 上下文 — HY4 Preview 在 API 上支持 >1M tokens,对比 Qwen3.8-Max 的 1M tokens(开放权重原生 262K,可扩展至 ~1.01M)

• 每百万价格 — HY4 Preview ¥6 输入 / ¥18 输出(约 $0.85 / $2.50)对比 Qwen3.8-Max $2.00 输入 / $6.00 输出,缓存读取 $0.25

• Terminal-Bench 2.1 — HY4 Preview 85.4(厂商自报)对比 Qwen3.8-Max 86.6

• 模态 — 两者的开源权重版本均仅支持文本;Qwen3.8-Max API 增加了图像和视频输入,而 HY4 Preview 预览版则不支持。

• 独立评分 — HY4 Preview 无 vs Qwen3.8-Max AA 智能指数 58,智能体指数 58

这两张数据卡从对立的两面讲述了同一个故事。在 Terminal-Bench 2.1 上,Qwen3.8-Max 的 86.6 与 HY4 Preview 的 85.4 相差一分半——Qwen 领先一分,且 HY4 的成绩未经审计。在价格上,HY4 Preview 的每 token 输入和输出费用都更低。在验证方面,Qwen3.8-Max 拥有独立的智能指数 58 和智能体指数 58;而 HY4 Preview 只有自家的宣传。这种差距正是典型的挑战者模式:以更优惠的价格和未经证实的说法,对抗一个经过验证的既存领先者。

阅读 Toolathlon 声明

Toolathlon-Verified 衡量的是智能体工具使用可靠性——即模型在包含错误、恢复和多步调用的完整任务中始终如一地驱动工具的能力。腾讯的 74.1 直接瞄准了 Qwen3.8-Max 画像中最强的部分,因为 Qwen 的智能体指数 58 和 OSWorld-Verified 的 86.1,正是让阿里巴巴的智能体主张具有可信度的数字。Qwen3.8-Max 还在 IFBench(指令遵循)上取得 82.8,在 PaperBench(研究级智能体工作)上取得 93.0,在厂商自己的榜单上双双超越 GPT-5.6 Sol 等模型。因此,腾讯选择了它声称能直接击败本月最大开源模型的那一个基准——而这一声称目前的可验证程度,与任何其他单一厂商的数据行一样:完全无法验证。

已核实与供应商报告对比

这是最不公平的对比维度,这种不对称性值得明确点明。Qwen3.8-Max 的 Intelligence Index(智能指数)58 分来自 Artificial Analysis,其 Agentic Index(智能体指数)58 分同样来自 Artificial Analysis,而给出这些分数的同一套独立测试框架也测出了它的短板:在 AA-Omniscience 上的幻觉率为 40%,高于上一代的 23%;每项任务耗时高达 64 次智能体轮次——模型确实很努力,但每一次轮次都要你来买单。Tencent HY4 Preview 完全没有这些测试数据。它的优势只是宣称,而它的失败模式——腾讯自己指出的长思考和过度自我验证——只是承认,而非测量结果。

对于在这两者之间做出选择的团队来说,验证差距并非抽象概念。Qwen3.8-Max 每个任务 64 轮次的行为是一个真实且可衡量的成本驱动因素:在 $2/$6 的价格下,它仍然是一些第三方对比中每个完成任务成本最高的智能体,而且团队已经反馈轮次数量正在侵蚀其价格优势。HY4 Preview 的对应行为尚不可知——它每个任务的实际成本可能比其本就低廉的每 token 价格所暗示的还要便宜,或者其自我验证的习惯可能会吃掉这部分差价。目前没有人能告诉你究竟是哪种情况,因为腾讯之外还没有人运行过它。

价格与开放权重的实际考量

按 token 计费,HY4 Preview 在收支两端都更便宜:¥6/¥18,对比 Qwen3.8-Max 的 $2.00/$6.00;缓存命中价格为 ¥0.3,对比 $0.25。这使得 HY4 Preview 成为输入或输出上最便宜的开源权重旗舰,仅此而已。但“开源权重”附带两套不同的细则。Qwen3.8-Max 的开源权重版本——Qwen3.8-2.4T-A95B——仅限文本且强制开启思考,原生上下文为 262K,而非 API 版的 1M;其自定义许可证还带有规模分层条件:月活用户超过 1 亿需显示模型名称,大型模型即服务(MaaS)业务需单独许可。腾讯 HY4 Preview 的权重已于今早上线 HuggingFace、ModelScope 和 GitHub,但其确切许可条款以及权重是否与线上 API 一致,尚未得到同等程度的明确说明。两个模型均可下载;但也都不是简便的即插即用方案。

底线

{{1}}Qwen3.8-Max 在验证所能带来安全性的每个方面都是更稳妥的选择:在智能和智能体工作上都获得独立评分、已知的失败模式、已定型的许可证,以及三周的生产反馈。{{/1}}但它的每 token 成本也更高,其测得的偏多轮交互行为是已知的成本风险。{{2}}腾讯 HY4 Preview 是性价比之选:输入和输出都更便宜,Terminal-Bench 的宣称水平相当,并且直接声称在 Toolathlon 验证中击败 Qw​en——但这一切在第一天都未经验证。{{/2}}如果你本周就要把开放权重模型投入生产,Qwen3.8-Max 是站得住脚的选择,而且它已在 OrcaRouter 上线,按 Ali​baba 的标价——$2.00/$6.00——原价直通,不加任何加价。{{3}}HY4 Preview 是评估项目:通过腾讯自己的 API,用你自己的 Toolathlon 风格任务运行它;把生产路径留在已验证的模型上;当独立评分出炉——或者当 HY4 Preview 接入路由器、其 ¥6/¥18 费率成为当日直通价时——切换只是一条路由规则,而不是一次重写。{{/3}}

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Qwen3.8-Max is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max) showing text, image and video input chips, a 1M-token context window, $2.00 per 1M input tokens and $6.00 per 1M output tokens, released August 3 2026.

看什么

• HY4 Preview 在智能体测试框架上的首次独立运行。Toolathlon 认证的 74.1 是腾讯想要赢下的数字;第三方 Agentic Index 将是确认。

• HY4 Preview 的实测轮次数量。Qwen3.8-Max 每任务 64 轮是前车之鉴;HY4 Preview 每个完成任务是否更便宜,才是整个经济论证的全部所在。

• 权重的许可条款。它们将决定对HY4 Preview而言,“开放”是否意味着“可在你的规模下使用”,正如Qwen3.8-Max许可条款对Ali​baba的模型所做的那样。

• 两家供应商是否会再次降价。在这样一个两款开放权重旗舰以激进定价发货的月份里,通过路由器进行的价格转嫁会让任何进一步降价在当天就显现出来。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube