
Qwen 3.8 对比 GLM-5.2:首个两者真正重叠的基准测试
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
这两个模型是中国开放权重人工智能中两种对立押注的最清晰体现。智谱的GLM-5.2精简且经过验证:总参数 753B,仅40B 激活参数,经审计的 Artificial Analysis Intelligence Index 为 51,权重自 2026 年 6 月起可下载,公布价格为 $0.95 / $3.00。阿里巴巴的Qwen3.8-Max是极致主义的押注:~2.4T 参数,激活数量未公开,并且——直到最近——完全没有数字。
2026年8月3日的正式发布让这场对决拥有了本系列其他文章所没有的东西:一项两个模型都有得分的基准测试。阿里巴巴报告Terminal-Bench 2.1的成绩为86.6;而Artificial Analysis对GLM-5.2的审计成绩为82.7,来自同一测试。这是Qwen的声称首次能够在相同基础上与独立测量的竞争对手数字并列比较——但有一个重要注意事项:两者中只有一个是由裁判产生的。
给开发者的一条提示——要解决这个问题,最快的方法是在你自己的提示词上同时运行这两者。OrcaRouter 通过一个 OpenAI 兼容端点对外提供 200 多个模型,因此你可以在同一任务上让 Qwen 3.8 Max 与 GLM-5.2 直接对垒,而无需接入两套 SDK。
TL;DR 结论。在共享的基准测试中,Qwen 声称在 Terminal-Bench 2.1 上领先 3.9 分(86.6 对 82.7)——如果可复现,这是真实结果,不过 Qwen 的数据是自报的,而 GLM 的经过审计。在其他方面,GLM-5.2 拥有实际优势:它便宜约 2 倍,价格为 $0.95 / $3.00,而 Qwen 为 $2 / $6;其权重今天即可下载;其 40B 激活参数使其真正可部署,并且拥有独立的指数得分 51,而 Qwen 没有。Qwen 则以 100 万 token 的统一费率上下文、GLM 所不具备的原生多模态能力,以及更高的潜在上限作为回应。精干且久经考验仍胜过庞大但未经证实——但差距在 8 月 3 日缩小了。
关键要点
• 系列中首个直接基准重叠: Terminal-Bench 2.1 — Qwen3.8-Max 86.6(Alibaba 报告)对比 GLM-5.2 82.7(Artificial Analysis,经审计)。Qwen 领先 3.9 分,但这两个数字并非同样可信。
• GLM-5.2 的价格大约便宜一半: $0.95 / $3.00 每1M(AA blended ~$0.90),而 Qwen3.8-Max 的$2 / $6。
• 激活参数才是真正的架构关键:GLM-5.2 运行 40B激活参数,总计753B。Alibaba仍然未披露Qwen的激活参数数量,这使得其服务成本无法建模。
• GLM 的权重今日即可下载;Qwen 的权重承诺本周内发布,但目前尚无许可证或代码仓库。
• GLM-5.2 的审计指数为 51。 Qwen3.8-Max 仍未评分——尽管其前身 Qwen3.7-Max 得分为 46, 低于 GLM。
• Qwen 的独特优势:提供 1M token 上下文窗口,以统一费率计费,不收取长提示附加费,并原生支持文本/图像/视频输入,OmniDocBench 1.5 得分 92.1。GLM-5.2 则专注于文本。
准确性说明:所有Qwen3.8-Max的质量数据均由阿里巴巴自行报告,未经第三方验证。GLM-5.2的数据来自Artificial Analysis。在同一基准上,将自报分数与经审计的分数进行比较具有一定参考价值,但并非结论性的——供应商的测试框架与评估方的测试框架存在差异。Qwen定价采用GA费率表,取代了7月份的预览折扣。
规格与价格,并列对比
以下是硬数据,每项数据均注明其来源。
• 开发者 / 状态 — Qwen3.8-Max:阿里巴巴;GA(2026年8月3日);GLM-5.2:智谱;2026年6月发布
• 架构 — Qwen3.8-Max:总参数量约2.4T,稀疏MoE;GLM-5.2:总参数量753B,稀疏MoE(Artificial Analysis)
• 激活参数 — Qwen3.8-Max:阿里巴巴仍未披露;GLM-5.2:40B 激活参数(Artificial Analysis)
• 上下文窗口 —— Qwen3.8-Max:1M tokens,固定费率(思考模式下为983,616;最大输出131,072);GLM-5.2:1M tokens(Artificial Analysis)
• Terminal-Bench 2.1 — Qwen3.8-Max:86.6(阿里巴巴报告);GLM-5.2:82.7(Artificial Analysis,经审计)
• AA Intelligence Index — Qwen3.8-Max:尚未评分;GLM-5.2:51(Artificial Analysis)
• 其他厂商报告的分数 — Qwen3.8-Max:GPQA Diamond 92.6、OSWorld-Verified 86.1、FrontierSWE 73.5(阿里巴巴报告);GLM-5.2:排名由第三方评测
• 模态 — Qwen3.8-Max:文本、图像、视频输入 → 文本输出;GLM-5.2:专注于文本
• 定价(输入/输出)— Qwen3.8-Max:$2.00 / $6.00 每 1M,统一价格;缓存输入 $0.25;GLM-5.2:$0.95 / $3.00 每 1M(AA 综合约 $0.90)
• 开放权重 — Qwen3.8-Max:承诺本周内发布(尚无许可证);GLM-5.2:是的 — 今天即可下载
有两件事为这次比较设定了框架,而第一件是整个系列中最有用的数据点。
首先,Terminal-Bench 上的重叠结果确实很有参考价值。Terminal-Bench 2.1 衡量一个模型能否操作真实 shell 并完成任务——运行命令、读取输出、从错误中恢复。它是现有最接近“能否作为编码代理而非代码建议器”的衡量标准,也是两家供应商都选择报告的基准测试。Qwen 的 86.6 与 GLM 经审计的 82.7 相比,Qwen 以 3.9 分的优势领先。
这个注意事项很重要,但不应夸大。供应商的测试框架与评估方的测试框架在脚手架、重试策略和提示词构造上存在差异,这些选择可能使 Terminal-Bench 分数产生超过四分的波动。因此,这并不能证明 Qwen 是更好的智能体模型。它真正确立的是,Qwen 自我报告的成绩与经审计的前沿开放权重模型处于同一竞争区间,而非不可信的范畴。这比“未评分”这一状态要有意义得多。
其次,架构对比正是 GLM 悄然胜出的地方。 GLM-5.2 激活了 40B 参数,这些参数出自 753B 总参数。单看这一个数字,就能了解它的服务成本、延迟特征,以及一支装备精良的团队确实能够运行它。Alibaba 至今仍未公布 Qwen 的激活参数数量——这意味着,无论 2.4T 这个宣传数字多么引人注目,Alibaba 之外没有人能估算 Qwen3.8-Max 的服务成本,也无法判断它自托管时的表现。在混合专家模型的对比中,这可不是什么脚注;这是最重要的缺失数字。

精简且经过验证 vs 庞大且未经证实
GLM-5.2 的定位建立在一个连贯的工程立场上:以更少做更多,公开数据,发布权重。一个 40B 激活的模型服务成本低廉,天生快速,并且可以由一支拥有可观但不离谱的 GPU 预算的团队部署。其经审计的指数 51 和经审计的 Terminal-Bench 82.7 意味着买家无需盲目信任。而其价格 $0.95 / $3.00,大约是 Qwen 价格的一半。
Qwen3.8-Max 的情况恰恰是相反的赌注:尽可能构建最大的模型,让能力本身来证明成本的合理性。GA 让这一论点变得比以往有力得多,因为终于有数字作为支撑——GPQA Diamond 92.6(研究生科学),OSWorld-Verified 86.1(GUI 操作),FrontierSWE 73.5(相较前代的 40.7),以及前面讨论过的 Terminal-Bench 86.6。这些都是前沿水准的数字,而 FrontierSWE 上接近翻倍的表现,是那种难以完全伪造的代际飞跃。
但两个差距依然存在,与7月时一样关键。目前仍没有独立评分——Artificial Analysis 和 LMArena 均未对 Qwen3.8-Max 打分,因此所有质量声明都只是阿里巴巴自己的说法。此外也没有许可证,因此开放权重承诺尚无法从商业角度评估。
历史锚点在这里比在大多数对决中更不利于 Qwen:前代 Qwen3.7-Max 得分为 46(在 AA 指数上),低于GLM-5.2 的 51。因此,阿里巴巴的隐含主张并不仅仅是 Qwen3.8-Max 很好,而是它在一代之内从低于 GLM 跃升至远超 GLM。FrontierSWE 的改进为这一说法增添了一些可信度。独立评分将一锤定音。

实践中的成本:2× 究竟落在何处
以一个智能体编码流水线为例:每次运行包含180,000个token的仓库上下文,以及10,000个token的输出。
• GLM-5.2: 0.18M × $0.95 = $0.171,另加 0.01M × $3.00 = $0.03。≈ 每次运行 $0.20。
• Qwen3.8-Max:0.18M × $2 = $0.36,加上 0.01M × $6 = $0.06。≈ 每次运行 $0.42。
• 按每天3,000次运行计算:GLM ≈ $603/天;Qwen ≈ $1,260/天——大约每月相差$20,000。
• 在稳定仓库上,Qwen 的缓存输入价格为 $0.25/1M,其运行成本降至≈ $0.11,这实际上低于 GLM 的未缓存成本。
最后一行是这次对比中最具实际用处的一点。Qwen 的标价是 GLM 的两倍,但其每 1M 的缓存命中价格仅为 0.25 美元,力度相当激进,足以让缓存良好的流水线扭转排名。如果你的智能体在每一轮都会重新读取基本不变的上下文——大多数编程智能体正是如此——那么尽管费率表更差,Qwen 在实践中反而可能是更便宜的选择。没有配置缓存的团队等于白白多付一倍的钱。
两个模型都将思考令牌计为输出,因此推理密集型配置在任一方都会比这些估算成本更高。
可部署性:GLM 所拥有的轴
两者都是中国的开放权重MoE模型,均声称支持100万token的上下文,这使得可部署性成为最尖锐的实际分水岭。
GLM-5.2 的权重自六月起即可下载,在 40B 激活参数下,它是一个现实的自托管目标——可量化、可在合理数量的 GPU 上提供服务,并且已经被社区实践验证过。
Qwen3.8-Max 的权重承诺在本周内发布,但该旗舰模型对任何人来说都不是一个现实的目标:大约 1.2TB(4-bit 量化)对比每块 H200 的约 141GB,意味着需要八块或更多顶级加速器;而未公开的激活参数数量使得最终吞吐量无法预测。再加上许可证缺失,目前自行托管该旗舰模型并非可行方案。
同期发布的Qwen3.8-27B是阿里在这一维度上的真正回应。同样开放权重,据报道运行仅需约17GB显存——一张高端显卡即可,远低于GLM-5.2的显存占用——这使其在可部署性上直接竞争。如果你对这两款模型的兴趣在于自行运行,那么Qwen 27B与GLM-5.2的对比才是真正重要的,而且这将是一场远比2.4T对753B更接近的较量。
常见问题
Qwen 3.8 比 GLM-5.2 更好吗?
在它们共有的一个基准测试中,Qwen声称领先——Terminal-Bench 2.1 得分86.6,而GLM经审计的得分为82.7。但Qwen的数字是自行报告的,GLM的则由Artificial Analysis测量,且测试框架的差异可能超过四分的差距。GLM-5.2还拥有一个经审计的指数51,而Qwen完全没有独立评分。GLM是更安全的选择;Qwen则拥有更高但未经证实的上限。
它们在 Terminal-Bench 2.1 上如何比较?
Qwen3.8-Max 报告得分为 86.6;Artificial Analysis 测得 GLM-5.2 为 82.7。这意味着 Qwen 在名义上领先 3.9 分,也是两者首次在同一基准测试中出现可比数据。应将其视为 Qwen 在该性能区间具有竞争力的证据,而非其领先的证明,因为只有 GLM 的数据是独立产生的。
哪个更便宜?
价目表上的GLM-5.2 — 每1M为$0.95 / $3.00(AA混合约$0.90),而Qwen的为$2 / $6,大约是前者的一半。但Qwen的缓存输入价格为每1M $0.25,这个价格相当激进,以至于一个大量使用缓存的流水线在Qwen上的总费用可能比在未缓存的GLM上更便宜。
Qwen 3.8 Max 使用多少个活跃参数?
阿里巴巴从未公开过这一数字,即使在正式发布(general availability)时也是如此。在混合专家(Mixture-of-Experts)模型中,这个数字决定了服务成本和延迟,因此它的缺失是一个实实在在的空白。相比之下,GLM-5.2 的文档明确标注为总参数 753B,其中激活参数为 40B。
我实际上可以自托管哪些?
GLM-5.2 今天发布——权重已公开,40B 活跃参数使其易于部署。Qwen3.8-Max 的权重承诺本周内发布,但旗舰型号需要八块或更多 H200 级 GPU,4-bit 量化下约 1.2TB,且尚未公布许可证。同时发布的 Qwen3.8-27B,据报道约需 17GB 显存,是可部署的 Qwen 选项,也更接近 GLM 的定位。
Qwen 3.8 Max 退出预览了吗?
是的,2026年8月3日上线,提供已发布的价目表,并具备兼容OpenAI和DashScope的端点。7月份Qoder积分一折活动已不再描述其销售方式。
Qwen 提供了哪些 GLM-5.2 没有的功能?
原生多模态——支持图像和视频输入,文档解析在OmniDocBench上自报得分92.1——并提供100万token的上下文窗口,按统一费率计费,无长提示附加费。GLM-5.2专注文本,因此在文档、截图或视频处理流程中,Qwen与其说是在与它竞争,不如说是在做别的事情。
底线
Qwen 3.8 对比 GLM-5.2 是正式发布带来最多真实新信息的一场对决。Qwen 首次在一个独立评估者也运行过的基准测试上获得分数,并且超过了 GLM:Terminal-Bench 2.1 得分 86.6 对 82.7。这使得 Qwen 从“未评分”变为“在实测基础上具有合理竞争力”,即使考虑到自我报告的注意点,这也是真正的进步。
但 GLM-5.2 依然保持着实用桂冠,而且凭借的是并不光鲜的优势:半价,经审计的 51 分指数,400 亿活跃参数使其成本可预测、部署可行,还有现在就能下载的权重。Qwen 的回应——统一费率的百万 token 上下文、原生多模态能力和更高的上限——有意义但有条件,而且它两个 7 月缺口依旧未变:没有独立评分,也没有许可证。关注三件事:Qwen3.8-Max 的首个独立智能指数得分,评估者能否复现 86.6 的 Terminal-Bench 数据,以及 Qwen3.8-27B 的发布——那才是这两种理念真正交锋之处。在那之前,你要上线的是 GLM-5.2,要评估的是 Qwen3.8-Max,并开启缓存。

本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
