文章《Gemini 3.7 Flash vs GLM-5.2》的主视觉标题卡片,副标题为“半价窗口对比开源权重未来”,胶囊徽章显示“$0.75 / $3.75 促销价对比 $1.40 / $4.40”、“价格于 2027 年 1 月 1 日分化”、“MIT 开源对比封闭 API”,右下角为 OrcaRouter 标志。
Guides & Insights

Gemini 3.7 Flash vs GLM-5.2:半价窗口 vs 开源权重未来

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Gemini 3.7 Flash 和 GLM-5.2是让 2026 年关于成本的讨论变得诚实的两个模型,因为每一款都只是陷阱的一半。Gemini 3.7 Flash 是谷歌于 2026 年 8 月 13 日发布的 Flash 级主力模型,定价为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元——但这个价格只持续到 2026 年 12 月 31 日,之后将翻倍至 1.50 美元 / 7.50 美元。GLM-5.2 是 Z.ai 于 2026 年 6 月 16 日发布的开放权重推理模型,在厂商自有 API 上的价格为每百万 token 1.40 美元 / 4.40 美元,采用 MIT 许可证,到 2027 年 1 月 1 日的价格仍与今天相同。大多数对这两款模型的比较都止步于促销价目表,这使 Gemini 看起来绝对更便宜。而真正经得起生产预算检验的比较,要以十二个月为周期,为整个工作负载定价,并考虑到这样一个事实:这两款模型中有一款可以迁移到你自己的硬件上运行,另一款则不能。

价格时钟

如今,每一次 Gemini 3.7 Flash 对比都带有日期,而这次对比正是由日期决定的。Google 的促销费率——$0.75 / $3.75,仅为标准费率 $1.50 / $7.50 的一半——已确认有效至 2026 年 12 月 31 日。到 2027 年 1 月 1 日,价格将翻倍。GLM-5.2 的 $1.40 / $4.40 自发布以来一直保持稳定,并提供 $0.26 的缓存命中输入费率,使得重复上下文的负载成本低廉。它没有附带任何厂商日期。任何将 Gemini 的促销费率视为永久价格的 TCO 计算,都是在把优惠券当作订阅来定价——而这个错误正是当下“Gemini vs GLM”讨论中最常见的误区。

规格对比

价格 — Gemini 3.7 Flash 促销价 $0.75 / $3.75(截至 2026 年 12 月 31 日),之后为 $1.50 / $7.50;GLM-5.2 则为 $1.40 / $4.40,缓存读取 $0.26,无过期时间。

• 上下文 / 最大输出 — Gemini 3.7 Flash 1M / 64K 对比 GLM-5.2 1M / 128K。GLM 单次响应可输出两倍的内容。

• 输入 — Gemini 3.7 Flash:文本、图像、音频、视频。GLM-5.2:仅文本。

• 权重 — Gemini 3.7 Flash 闭源,仅限 API。GLM-5.2 开源,MIT 许可证,743B 参数,其中约 40B 激活,可自行托管。

• 思考控制 — Gemini 3.7 Flash 低 / 中 / 高。GLM-5.2 默认开启思考模式,提供三档努力级别。

• 独立得分 — Gemini 3.7 Flash 在 Artificial Analysis 智能指数上获得 56 分,而 GLM-5.2 获得 53 分,是该指数上最高的开放权重得分。

• 输出速度 — Gemini 3.7 Flash 在高推理模式下约 285 tokens/秒,而 GLM-5.2 约 110 tokens/秒 — 大约快两倍半。

基准测试说明了什么(已标注)

基准测试图景在共同行上有利于Gemini 3.7 Flash,但在表面之下则变得复杂。在双方均公布了数字的三项基准测试中——DeepSWE 1.1(Gemini为65.3%)、FrontierCode 1.1(43.6%)和Terminal-Bench 2.1——Gemini领先,其在AA Intelligence Index上的56分也超过了GLM-5.2的53分,而后者仍然是开放权重模型在该指数上取得的最高分。两套组件数字均为厂商自行报告且未经复现。更实在的细节在于GLM-5.2最强的编码行:Z.ai报告Terminal-Bench 2.1为81.0——首个开源模型超过80——SWE-bench Pro为62.1,FrontierSWE为74.4,这些数据是在以长时程自主编码为全部测试内容的测试框架上测得的。两款模型非常接近,指数差距(3分)小于两家厂商选择宣传的内容差异,而且两家公司的评估套件都不是中立的裁判。

A two-column scoreboard titled 'Gemini 3.7 Flash vs GLM-5.2 — the scoreboard'. Left column 'Gemini 3.7 Flash': 'Price $0.75 / $3.75 (promo, then $1.50 / $7.50)', 'Context 1M / output 64K', 'Inputs text, image, audio, video', 'AA Index 56', 'Weights closed', 'Speed ~285 tok/s (high)'. Right column 'GLM-5.2': 'Price $1.40 / $4.40 ($0.26 cache)', 'Context 1M / output 128K', 'Inputs text only', 'AA Index 53', 'Weights MIT, self-hostable', 'Speed ~110 tok/s'. Footer: 'AA figures per Artificial Analysis; component benchmarks vendor-reported, unreproduced.'

开放权重的分叉版本

任何价格对比都无法体现的差异在于许可证。GLM-5.2 的 MIT 许可权重意味着团队可以下载模型并在自己的硬件上运行——743B 参数/40B 激活的 MoE 架构部署规模虽大,但仍在可控范围内——这将 GLM 本就低廉的 API 价格转化为一次性资本支出,首次部署后每 token 的边际成本几乎为零。这就是开放权重论点最有力的形态:大规模使用无需按 token 付费,没有供应商弃用风险,数据不会离开你的环境,并且拥有自由微调的权利。Gemini 3.7 Flash 完全没有这些优势;它是一个封闭 API,其促销价格是有期限的。对于有数据本地化要求或可预测的高吞吐量工作负载的团队来说,开放权重选项不是一种理念上的偏好——它是唯一能让边际成本不取决于他人价格表的选项。

多模态与视频的区别

两者之间的另一条硬性分界线是输入模态。Gemini 3.7 Flash 可摄取文本、图像、音频和视频,并且自 2026 年 9 月 1 日起,它搭载了 Google 的智能体视频理解模式——模型自行决定观看什么、以什么速度观看,以及通过帧、音频还是文字记录来理解,仅加载相关片段,供应商报告称可节省高达 66% 的成本和 88% 的 token。GLM-5.2 仅支持文本。任何面向 GLM 的视频或音频工作负载,都必须先由单独的工具进行预转录和预分帧,然后模型才能看到。如果你的工作负载是多模态的——会议录音、安防录像、产品视频,任何包含非文本信号的内容——比较到此为止;在这两者中,只有 Gemini 3.7 Flash 能直接接受输入。

Screenshot of the Artificial Analysis model page for Gemini 3.7 Flash at high reasoning, showing an Intelligence Index of 56 (ranked #20 of 187 models), an output speed of 285 tokens per second in the high-reasoning configuration, and a price of $0.75 per 1M input and $3.75 per 1M output tokens.

十二个月,真金白银。

将这两半合在一起看稳态工作负载——比如说每月100万输入token和100万输出token,一个适中的生产负载——那么Gemini价格上的日期就成了整个故事的关键:

• 从现在到2026年12月31日 — Gemini 3.7 Flash 促销价:$0.75 + $3.75 = 每月 $4.50(按该用量计算)。GLM-5.2:$1.40 + $4.40 = $5.80。Gemini 便宜约22%。

• 从2027年1月1日起 — Gemini标准费率:$1.50 + $7.50 = $9.00。GLM-5.2:仍为$5.80。GLM便宜约36%。

• 十二个月周期(六个月促销价,六个月标准价)——Gemini:6 × $4.50 + 6 × $9.00 = $81.00。GLM-5.2:12 × $5.80 = $69.60。算上优惠券,平均来看 GLM 全年更便宜。

• 自托管 GLM-5.2——API 账单消失,变成硬件 + 电费,而在已部署的 MoE 上,这是最便宜的一栏。

在规模上,缓存费率指向同一方向:GLM-5.2 的 $0.26 缓存命中输入价格比其未命中价格低一个数量级,这有利于那些主导真实生产流量的重复前缀工作负载——系统提示、少样本库、代码库。Gemini 3.7 Flash 有自己的缓存层级,但头条对比是未命中价格,而未命中价格在 1 月 1 日翻倍。

结论:哪一个能挺过一月的期限。

决策规则取决于时间跨度和所有权。如果你的项目本季度上线,并且主要停留在托管API上,Gemini 3.7 Flash是更值得购买的选择:到12月之前更便宜、速度更快、独立指数排名更高、支持多模态,并且会率先获得新的视频能力。如果你的项目有十二个月的预算、数据本地化约束、高容量重复上下文模式,或者对拥有你所依赖的模型感兴趣,GLM-5.2是更诚实的长期选择——而且一旦日历翻篇,它也会成为更便宜的API。促销窗口是选择Gemini的全部理由;开放权重是选择GLM的全部理由。

Screenshot of the OrcaRouter model page for z-ai/glm-5.2 showing a 1M-token context window, $1.40 per 1M input and $4.40 per 1M output tokens, and its capability chips.

对于希望在日历做出决定之前,用自己的工作负载对两者进行测试的团队来说,路由层是运行它们的理想中立平台。GLM-5.2 搭载于OrcaRouter,在 Z.ai 的标价 $1.40 / $4.40 基础上以 0% 加价直通,旁边是可路由的 Gemini 层级,统一放在一个 API 密钥之后——因此工作负载可以将文本和代码流量发送给 GLM-5.2,将多模态和视频流量发送给 Gemini 模型,并让路由 DSL 在单次调用中混合它们,同时自动故障转移可在任一供应商出现问题时保持管道运行。Gemini 3.7 Flash 本身通过 Google 自己的 API 和多个第三方平台提供服务。这两个模型是天然的 A/B 测试:价格区间相同,长期答案相反,而要知道哪一个能在你的评估中胜出,唯一的方法就是在 1 月的悬崖替你做出选择之前,将它们并排运行。

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube