
Qwen 3.8 与 GLM-5.2:原始规模对比精悍、经审计的开放模型
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orca新OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropic新Anthropic: Claude Opus 52026-07-2461智能78代码
- google新Google: Gemini 3.6 Flash2026-07-2150智能69代码
- google新Google: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- meta新Meta: Muse Spark 1.12026-07-1651智能71代码
- kimiMoonshotAI: Kimi K32026-07-1557智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0951智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0955智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0959智能77代码
- grokxAI: Grok 4.52026-07-0854智能72代码
- tencentTencent: Hy32026-07-0641智能59代码
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42代码
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39代码
- anthropicAnthropic: Claude Sonnet 52026-06-3053智能72代码
- klingKling: Kling 3.0 Turbo2026-06-1757智能52代码57数学
- z-aiZ.ai: GLM 5.22026-06-1651智能69代码60数学
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242智能61代码61数学
- anthropicAnthropic: Claude Fable 52026-06-0960智能77代码
- qwenQwen: Qwen3.7 Plus2026-06-0139智能56代码59数学
2026年最受关注的两款中国模型都是稀疏专家混合系统,都承诺开放权重,并且在价格上都低于西方前沿水平——然而它们在理念上却几乎截然不同。阿里巴巴的Qwen3.8-Max,于2026年7月19日在上海世界人工智能大会上预览,押注于庞大规模:约2.4万亿参数以及早期测试者喜爱的执着彻底性。智谱的GLM-5.2则押注于相反方向——一个精简的400亿活跃参数设计,Artificial Analysis已对其评分,取得了突出的智能体结果,并且权重今日即可获取。这是效率与原始规模的较量,这两款模型使其成为一场异常清晰的竞赛。
决定以下一切的要点是:GLM-5.2 展示了全部底牌,而 Qwen 3.8 则将大部分牌面朝下隐藏。给构建者的一点提示——要诚实判断哪个更适合你的技术栈,最好在你的提示词上运行两者。OrcaRouter 将 200 多个模型部署在一个兼容 OpenAI 的端点后面,因此你可以让Qwen 3.8与 GLM-5.2 在同一任务中对抗,而无需连接两个 SDK。
简要结论。 GLM-5.2 是务实开放权重的代理型选择,你如今即可使用。据Artificial Analysis报告,它拥有经审计的智能指数51,一个强大的Terminal-Bench 2.1 成绩 82.7,廉价的$0.95 / $3.00价格,1M上下文,并且——关键的是——开放权重已发布仅基于40B活跃参数。Qwen 3.8 Max是更大的赌注:约2.4T总参数和顶级实操质量,但隐藏了活跃参数数量,并且没有独立基准测试,是最慢的模型,测试者运行过的,并且其权重仍为"coming soon"。GLM证明效率奏效;Qwen让你信任规模。
关键要点
• GLM-5.2(智谱)是一个总参数量753B/活跃参数量40B的MoE,其经审核的AA智能指数为51,Terminal-Bench 2.1得分为82.7(来源:Artificial Analysis);Qwen 3.8 Max是一个约2.4T的MoE预览版,其活跃参数数量未公开,并且没有经审核的分数。
• GLM-5.2的权重是开放并已于今日提供下载(于2026年6月发布);Qwen 3.8的权重承诺“很快”发布,但尚未发布(约1.2TB,需要8块以上H200 GPU自托管)。
• 价格对GLM有利:$0.95 / $3.00每百万令牌(AA混合约$0.90)。Qwen 3.8的预览版大幅折扣(约90% off),但没有公布的每令牌API价格且折扣是暂时的。
• 在代理/终端工作方面,GLM-5.2的 82.7 Terminal-Bench是一项具体的、经过评审的实力;Qwen 3.8的优势在于全面性和创造性的一次性输出——在实际测试中令人印象深刻,但未经审计且速度慢。
• 两者都是中国开源权重的MoE模型,宣称支持百万令牌上下文;真正的区别在于 精简且经过验证的(GLM) 与 庞大且未经证明的(Qwen)。
Qwen 3.8 的数据是供应商声明或早期、未受控的实操印象——未经独立审计。GLM-5.2 的数据来自 Artificial Analysis,可能与 Zhipu 自家的报告有所不同。Qwen 3.8 的预览定价是临时折扣;在预算前请验证每 token 费率。注意,Qwen 在政治敏感话题上设有与 CCP 对齐的内容护栏。
规格与价格,并列对比
这是硬数据,每个 GLM-5.2 的数据都注明其来源。
• 制造商/状态 — Qwen 3.8 Max: Alibaba; 预览 (2026年7月19日); GLM-5.2: Zhipu; 2026年6月发布
• 架构 — Qwen 3.8 Max:总计约2.4T,稀疏MoE;GLM-5.2:总计753B,稀疏MoE(摘自Artificial Analysis)
• 活跃参数 — Qwen 3.8 Max: 阿里巴巴未披露; GLM-5.2: 40B 活跃(Artificial Analysis)
• 上下文窗口 — Qwen 3.8 Max:据报道约100万token(未正式确认);GLM-5.2:100万token(Artificial Analysis)
• AA Intelligence Index — Qwen 3.8 Max: 暂无 — 未评分; GLM-5.2: 51 (Artificial Analysis)
• Terminal-Bench 2.1 — Qwen 3.8 Max:未公布数据;GLM-5.2: 82.7 (Artificial Analysis)
• 定价(输入/输出)— Qwen 3.8 Max:仅预览(约90%折扣;按token的API未公布);GLM-5.2:$0.95 / $3.00每1M(AA混合约$0.90)
• 开放 权重 — Qwen 3.8 Max: 承诺 "即将推出" (未发布); GLM-5.2: 是 — 已发布, 今天 可下载
• 速度 — Qwen 3.8 Max: 测试过的最慢模型(实际操作);GLM-5.2:Lean 40B 活跃 — 设计高效
有两件事定义了这场对决。首先,“活跃参数”一行是两种理念碰撞的地方。GLM-5.2 的前沿智能体工作——在 Terminal-Bench 2.1 上获得 82.7 分是一个相当高的分数——仅凭借400亿活跃参数,这是一个公开、可验证的数字。而 Qwen 3.8 拥有约 2.4 万亿总参数,但不愿透露有多少活跃参数,所以你根本无法评估其效率。一个模型证明了它的高效;另一个则要求你假设它高效。
第二,目前决定实际采用的所有指标都倾向于GLM。它有经过审计的指数(51),而Qwen这一项是空白;它有已公布且稳定的价格(0.95美元/3.00美元),而Qwen只有临时折扣,且没有API费率;它的权重已经公开,而Qwen的权重还只是承诺。Qwen 3.8的制衡点是其原始规模以及这种规模似乎带来的全面性——在质量优先的工作上确实是一个优势,但尚未得到中性评分板的确认。

效率 vs 原始规模
这场比较的核心是该领域始终绕不开的一个问题:前沿级别的工作是否需要有前沿规模的参数?GLM-5.2 是近期证明“不需要”的最有力论据。它每个 token 只进行 40B 的活跃计算,在 Terminal-Bench 2.1 上取得了 82.7 分——据 Artificial Analysis 称,这是目前最优秀的智能体/终端结果之一——并且经审计的综合指数达到 51。这是一个精干、专注的模型,其表现远超其活跃参数体量,同时又是开源权重,因此一个团队可以下载它、检查它,并能在远低于 2.4T 巨兽所要求的硬件上运行它。
Qwen 3.8 走了另一条路。它依赖规模取胜,实际测试中这种规模体现为详尽而非速度。在一项架构理解任务中,评测方(Trilogy AI)将 Qwen 3.8 与 Kimi K3 对比:Qwen 得分 80/100,Kimi 得 83,但 Qwen 明显更全面——引用仓库资源 354 次对 274 次、零次工具调用失败(Kimi 两次)——代价是更高的延迟和更多总 token 数。另一评测方(thomas-wiegold.com)称其"很好但非常慢",是他们用过的最慢模型,但仍将其归入顶级能力梯队。这正是 Qwen 的赌注缩影:挖得更深、引用更多、遗漏更少——但为此付出时间、token 和(目前而言)无法验证的主张的代价。
对于任何智能体场景——终端循环、密集工具链、自托管部署——GLM-5.2 结合了具体的 82.7 Terminal-Bench 分数、较小的活跃内存占用以及已发布的权重,在今天很难找到更好的选择。Qwen 3.8 的全面性在深度、质量优先的研究和编码中确实很有价值——前提是你能承受延迟——但你是在凭信念购买它:没有经过审计的分数、隐藏的活跃参数、权重仍待发布,以及敏感话题上的 {{KEEP}}CCP-aligned{{/KEEP}} 护栏。可衡量的效率胜过不可衡量的规模。

常见问题
Qwen 3.8 比 GLM-5.2 更好吗?
基于现有证据,GLM-5.2是更稳妥的选择。它的人工分析智能指数为51(已审计),终端基准2.1得分为82.7,并且拥有开放权重,可立即运行。Qwen 3.8可能在深度、质量优先的任务上与之匹敌或超越——早期测试者对其全面性评价很高——但它没有独立评分,隐藏了其活跃参数数量,并且在动手测试中是最慢的模型。纸面上的潜力与经过验证且可用的对比:GLM赢得了当下。
我能下载并自托管其中一个吗?
GLM-5.2 的权重已开源并发布(2026 年 6 月),且仅需 400 亿活跃参数,相比 2.4T 参数的模型,自部署要实用得多。Qwen 3.8 的开源权重承诺“即将推出”,但尚未发布;即便发布,一个约 2.4T 参数的模型在 4 位量化下也约需 1.2TB 存储,并且需要 8 块以上的 H200 GPU,大多数团队难以承担。如果当前就需要自部署,GLM 几乎是唯一现实的选择。
哪个更便宜?
GLM-5.2拥有清晰且稳定的定价:每1M tokens收费$0.95/$3.00,其Artificial Analysis混合费率约为$0.90。Qwen 3.8预览版的折扣力度很大(约90%折,夜间峰值约98%),但尚未公布每token的API价格,且折扣是临时性的——因此你可以围绕GLM制定预算计划,但Qwen尚不可靠。
对于代理工作和终端工作,哪个更好?
GLM-5.2,根据当前证据。其在Artificial Analysis的Terminal-Bench 2.1上取得82.7分,这是一个具体、经过评审的智能体结果,并且其小巧的活动占用空间和已发布的权重使其易于部署在工具密集型循环中。Qwen 3.8在实际测试中表现出强大的工具使用能力(在一次评测中零次工具调用失败),但没有可比的经过审计的智能体评分。
我今天应该用哪一个?
GLM-5.2 适用于智能体管道、自托管、对成本敏感的生产环境,以及任何需要成熟可下载模型的场景。Qwen 3.8 适用于深入、质量优先的研究或编码,在这些场景中它的全面性值得付出,且你能容忍较慢的运行速度——同时保持一个选项开放,以待其权重和首个独立评分到来。
底线
Qwen 3.8 vs GLM-5.2是效率与原始规模的较量,而目前效率在得分上处于领先。GLM-5.2 展示了全部底牌——40B 活跃参数从事前沿代理工作,经过审计的指数 51,Terminal-Bench 得分 82.7,价格低廉且稳定,以及你今天就可以下载的开放权重。Qwen 3.8 依赖其庞大的 2.4T 参数规模以及测试人员真心赞赏的全面性,但它隐藏了活跃参数数量,没有独立得分,交付速度比评审人员用过的任何产品都慢,而且其权重仍然只是个承诺。GLM-5.2 是当下可用的、务实的开放权重代理选择;Qwen 3.8 则是更大的赌注,它还需要权重和真实分数来证明自己。关注两者——在它们正式落地之前,请在您自己的提示上并排运行这两个模型,让结果(而不是参数数量)来决定胜负。

