《Gemini 3.7 Flash vs GLM-5.2》一文的主視覺標題卡,副標題為「半價窗口 vs 開放權重的未來」,藥丸式標籤顯示「$0.75 / $3.75 促銷 vs $1.40 / $4.40」、「價格自 2027 年 1 月 1 日起分歧」、「MIT 開放授權 vs 封閉 API」,右下角為 OrcaRouter 標誌。
Guides & Insights

Gemini 3.7 Flash 對比 GLM-5.2:半價的封閉窗口對比開源權重的未來

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Gemini 3.7 Flash 和 GLM-5.2 是讓 2026 年成本論述變得誠實的兩款模型,因為每一款都是陷阱的一半。Gemini 3.7 Flash 是 Google 於 2026 年 8 月 13 日推出的 Flash 級主力模型,定價為每百萬輸入 tokens 0.75 美元、每百萬輸出 tokens 3.75 美元——但僅限於 2026 年 12 月 31 日之前,之後翻倍至 1.50 / 7.50 美元。GLM-5.2 是 Z.ai 於 2026 年 6 月 16 日推出的開放權重推理模型,在廠商自家 API 上每百萬輸入/輸出 tokens 的費用為 1.40 / 4.40 美元,採用 MIT 授權,而且在 2027 年 1 月 1 日的價格與今天相同。大多數對這兩者的比較都止步於促銷價目表,這讓 Gemini 看起來絕對更便宜。真正經得起生產預算考驗的比較以十二個月為期、為整個工作負載計價,並考量到其中一款模型可以遷移到你自己的硬體上,而另一款不行。

價格時鐘

現在每一次 Gemini 3.7 Flash 比較都帶有日期,而這一次正是由日期所定義。Google 的促銷費率——$0.75 / $3.75,為標準費率 $1.50 / $7.50 的一半——已確認有效至 2026 年 12 月 31 日。2027 年 1 月 1 日起,價格將翻倍。GLM-5.2 的 $1.40 / $4.40 自推出以來一直保持穩定,並配有 $0.26 的快取命中輸入費率,讓重複情境的工作負載變得更便宜。它沒有附帶任何廠商日期。任何將 Gemini 促銷費率視為永久價格的 TCO 計算,都是在把折價券當作訂閱來定價——而這個錯誤正是目前「Gemini vs GLM」討論中最常見的單一錯誤。

規格對比

• 價格 — Gemini 3.7 Flash 促銷價 $0.75 / $3.75 至 2026年12月31日,之後為 $1.50 / $7.50,對比 GLM-5.2 $1.40 / $4.40,快取讀取 $0.26,無截止日期。

• 上下文/最大輸出 — Gemini 3.7 Flash 1M/64K 對比 GLM-5.2 1M/128K。GLM 在單次回應中可輸出兩倍的量。

• 輸入 — Gemini 3.7 Flash 文字、圖片、音訊、影片。GLM-5.2 僅限文字。

• 權重 — Gemini 3.7 Flash 封閉,僅限 API。GLM-5.2 開放,MIT 授權,743B 參數(約 40B 啟用),可自行託管。

• 思考控制 — Gemini 3.7 Flash 低 / 中 / 高。GLM-5.2 預設開啟思考,提供三種努力等級。

• 獨立分數 — Gemini 3.7 Flash 在 Artificial Analysis Intelligence Index 上得 56 分,GLM-5.2 得 53 分,是該指數中開源權重模型的最高分。

• 輸出速度 — Gemini 3.7 Flash 在高推理模式下約為 285 tokens/秒,而 GLM-5.2 約為 110 tokens/秒 — 大約快兩倍半。

基準測試怎麼說(帶標籤)

基準測試的整體圖景在共同項目上利好 Gemini 3.7 Flash,但表面之下更為複雜。在雙方均公布了數值的三項基準測試中——DeepSWE 1.1(Gemini 為 65.3%)、FrontierCode 1.1(43.6%)和 Terminal-Bench 2.1——Gemini 領先,其在 AA Intelligence Index 上的 56 分也高於 GLM-5.2 的 53 分;不過後者仍是開放權重模型在該指數上取得的最高分。兩組細項數據均為供應商自行報告,且未經複現驗證。更貼近真相的細節在於 GLM-5.2 最強的編碼項目:Z.ai 報告其在 Terminal-Bench 2.1 上取得 81.0——首個突破 80 分的開放模型——在 SWE-bench Pro 上為 62.1,在 FrontierSWE 上為 74.4,而這些數據是在以長期自主編碼為全部測試內容的框架上測得的。兩款模型的差距夠小,以至於指數上的三分差距還小於兩家供應商各自選擇宣傳內容的差異,而且兩家公司的評測套件都稱不上中立的裁判。

A two-column scoreboard titled 'Gemini 3.7 Flash vs GLM-5.2 — the scoreboard'. Left column 'Gemini 3.7 Flash': 'Price $0.75 / $3.75 (promo, then $1.50 / $7.50)', 'Context 1M / output 64K', 'Inputs text, image, audio, video', 'AA Index 56', 'Weights closed', 'Speed ~285 tok/s (high)'. Right column 'GLM-5.2': 'Price $1.40 / $4.40 ($0.26 cache)', 'Context 1M / output 128K', 'Inputs text only', 'AA Index 53', 'Weights MIT, self-hostable', 'Speed ~110 tok/s'. Footer: 'AA figures per Artificial Analysis; component benchmarks vendor-reported, unreproduced.'

開放權重的分支

任何價格比較都無法捕捉的差異在於授權。GLM-5.2 的 MIT 授權權重代表團隊可以下載模型並在自己的硬體上執行——743B/40B-active MoE 是項大規模部署,但仍在可行範圍內——這將 GLM 本已低廉的 API 價格轉化為資本成本,首次部署後每次 token 的邊際花費趨近於零。這就是開放權重論點最有力的形式:大量使用時沒有逐 token 帳單、沒有供應商淘汰風險、沒有資料離開你的環境,以及微調的自由。Gemini 3.7 Flash 完全不提供這些;它是封閉的 API,其促銷價格是有期限的。對於有資料落地需求或可預測的高用量工作負載的團隊來說,開放權重選項不是哲學偏好——它是唯一能讓邊際成本不取決於他人價目表的選項。

多模態與影片差異

兩者之間另一道明確的分界線在於輸入模態。Gemini 3.7 Flash 可處理文字、圖像、音訊和影片,且截至 2026 年 9 月 1 日,它已搭載 Google 的代理式影片理解模式——模型自行決定要看什麼、以何種速度觀看,並透過影格、音訊或逐字稿來理解內容,只載入相關片段;根據廠商回報,最高可節省 66% 的成本與 88% 的 Token。GLM-5.2 僅支援文字。任何指向 GLM 的影片或音訊工作負載,都必須先由獨立的工具完成轉錄與分段,模型才會看到資料。如果你的工作負載是多模態的——會議錄音、監視器畫面、產品影片,任何帶有非文字訊號的內容——比較到此為止;Gemini 3.7 Flash 是兩者中唯一能直接接受此類輸入的模型。

Screenshot of the Artificial Analysis model page for Gemini 3.7 Flash at high reasoning, showing an Intelligence Index of 56 (ranked #20 of 187 models), an output speed of 285 tokens per second in the high-reasoning configuration, and a price of $0.75 per 1M input and $3.75 per 1M output tokens.

十二個月,真金白銀

在穩定狀態的工作負載下將兩半放在一起——比如每月 1M 個輸入 token 和 1M 個輸出 token,一個適度的生產負載——然後 Gemini 價格上的日期就成為整個故事:

• 今日起至2026年12月31日 — Gemini 3.7 Flash 促銷價:$0.75 + $3.75 = 每月 $4.50(依該用量計算)。GLM-5.2:$1.40 + $4.40 = $5.80。Gemini 便宜約 22%。

• 自2027年1月1日起——Gemini 標準費率:$1.50 + $7.50 = $9.00。GLM-5.2:仍為 $5.80。GLM 便宜約36%。

• 十二個月方案(六個月促銷價、六個月標準價)— Gemini:6 × $4.50 + 6 × $9.00 = $81.00。GLM-5.2:12 × $5.80 = $69.60。將優惠券計算在內,平均下來 GLM 是較便宜的一年。

• 自行託管 GLM-5.2 —— API 帳單消失,變成硬體 + 電費,而在已部署的 MoE 上,這是最便宜的一欄。

在大規模應用下,快取費率指向相同的方向:GLM-5.2 的 $0.26 快取命中輸入價格比其未命中費率低了一個數量級,這對重複前綴的工作負載——系統提示詞、few-shot 範例庫、程式碼庫——非常有利,而這些正是真實生產流量中的主力。Gemini 3.7 Flash 有自己的快取層級,但最受矚目的比較還是未命中費率,而該費率在 1 月 1 日翻了一倍。

裁決:哪一個能挺過一月的那一天

決策規則取決於時間範圍和所有權。如果你的專案本季度上線,且主要使用受管API,那麼Gemini 3.7 Flash是更值得購買的選擇:到12月為止價格更低、速度更快、在獨立指數上排名更高、支援多模態,而且會率先獲得新的影片功能。如果你的專案有一年的預算、資料在地化限制、大量重複上下文模式,或者對擁有你所依賴的模型感興趣,那麼GLM-5.2才是更實在的長期選擇——而且一旦日曆翻篇,它也會成為更便宜的API。促銷窗口完全是選擇Gemini的理由;開放權重則完全是選擇GLM的理由。

Screenshot of the OrcaRouter model page for z-ai/glm-5.2 showing a 1M-token context window, $1.40 per 1M input and $4.40 per 1M output tokens, and its capability chips.

對於想在行事曆決定之前,用自己的工作負載測試這兩款模型的團隊來說,路由層是讓它們公平測試的中立平台。GLM-5.2 位於 OrcaRouter上,以 Z.ai 的 $1.40 / $4.40 牌價不加價直接提供,與可路由的 Gemini 方案並列,共用單一 API 金鑰——如此一來,工作負載可將文字與程式碼流量送給 GLM-5.2,多模態與影片流量送給 Gemini 模型,並讓路由 DSL 在單一呼叫中混合兩者;若任一供應商出問題,自動容錯轉移也能維持管線運作。Gemini 3.7 Flash 本身則透過 Google 自家的 API 與數個第三方平台提供服務。這兩個模型是天生的 A/B 測試組合:價格帶相同,但長期答案截然相反;要知道哪一個能在你的評測中勝出,唯一的辦法就是並排執行它們,趁一月懸崖替你做出決定之前。

本文中的比較3

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube