
Gemini 3.7 Flash vs Grok 4.6:Google 的價格戰 vs SpaceXAI 的自我檢查代理
- google新Google: Gemini 3.8 Flash2026-09-0259智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0258智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0166智能82程式
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75程式
- obsidianQwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
Gemini 3.6 Flash 大幅失利三週後,Google 將價格砍半並推出Gemini 3.7 Flash——此舉被大多數報導視為直接劍指Grok 4.6,即 SpaceXAI 前一天以 2 美元和 6 美元推出的代理調校旗艦模型。時機點就是重點:兩個接近前沿的模型相隔一天發布,瞄準同一種買家——想要代理式編碼又不想付前沿價格的團隊——定價哲學卻完全相反。Google 用五個月的促銷活動購買市場反應。SpaceXAI 則以固定牌價按任務販售信任。
Grok 4.6 於 2026 年 8 月 12 日發布,是 SpaceXAI 對其 1.5 兆參數 Grok 4.5 基礎模型的改良版本,專為可自行驗證子任務完成度的長期運行代理(agent)而設計,具備 50 萬 Token 的上下文視窗、文字與影像輸入,以及每百萬 Token 2 美元/6 美元的費率,當輸入超過 20 萬 Token 時價格加倍。Gemini 3.7 Flash 於 2026 年 8 月 13 日發布,是 Google 對 Gemini 3.6 Flash 的演算法改良版本——擁有 100 萬 Token 的上下文、支援包含視訊與音訊在內的多模態輸入,以及每百萬 Token 0.75 美元/3.75 美元的促銷價,該價格將於 2027 年 1 月 1 日加倍至 1.50 美元/7.50 美元。在獨立的 Artificial Analysis Intelligence Index 中,Grok 4.6 得分為 61,明顯高於 Gemini 3.7 Flash 初期約 56 的評測結果。
價格戰,每個維度一行
• 每1M輸入的價格 — Gemini 3.7 Flash $0.75(促銷價)對比 Grok 4.6 $2.00。Google 的價格低了超過 60%。
• 每1M輸出的價格 — Gemini 3.7 Flash $3.75(限時優惠)對比 Grok 4.6 $6.00。
• 2027年1月1日之後——Gemini 價格翻倍至 $1.50/$7.50,而 Grok 維持不變,仍為 $2/$6。
• 上下文窗口 — Gemini 3.7 Flash 1M 對比 Grok 4.6 500K.
• 長輸入計費 — Gemini 在其上下文窗口內收取固定費用;Grok 在輸入達到或超過 200K 時費用翻倍至 $4/$12。
• 思考Token——Gemini將其作為輸出計費;Grok的成本則已包含在獨立測量的每項任務約0.84美元之中。
一句話總結:今天 Gemini 3.7 Flash 在價目表的每一行都更便宜,而這個優勢大部分會在 1 月 1 日消失。Grok 4.6 在八月的價格和三月一樣。

Gemini 3.7 Flash 的錢去了哪裡
Google 自家的數據顯示,Gemini 3.7 Flash 較 3.6 Flash 有大幅成長:DeepSWE v1.1 得分 65.3%(前代為 49.0%)、FrontierCode 1.1 Main 得分 43.6%(前代為 34.4%)、Terminal-bench 2.1 得分 85.8%(前代為 78.0%),WebDev Arena Elo 積分為 1588(前代為 1538)。這些是廠商自行回報、未經複現的數字——這類數據衡量的是發展軌跡,而非跨廠商的終局判決。但軌跡正是重點:這些修正是在發表三週後便到位,而當初評論者普遍已將該發表視為失敗之作,這說明了 Google 是把 Flash 系列當作主戰場,而非旗艦產品。
Google 這次促銷的另一個作用是壓縮購買窗口。在 $0.75/$3.75 的價格下,該模式便宜到足以進行大量測試;在 $1.50/$7.50 時,它仍然具有競爭力,但不再具有價格戰武器的威力。任何在上市初期採用它的生產團隊,都應該在 12 月重新評估其經濟效益,而不是假設價格會跟著他們一起變動。
Grok 4.6 的錢去了哪裡
Grok 4.6 的賣點不同:不是更便宜的 token,而是更少被浪費的 token。它經過訓練以進行自我驗證——在繼續之前檢查子任務是否真正完成——而獨立測量也證實了這項效果:Artificial Analysis 將其成本估算為每項任務約 0.84 美元,GDPVal-AA v2 為 1,753,智能指數為 61。這些是第三方數據,也是這場對決中最有力的數字,因為它們捕捉到了每個 token 價格所遺漏的關鍵:一個模型若能以更少回合完成工作,即使 token 單價較高,每完成一項工作的成本反而更低。
權衡之處在於,較便宜的型號有其局限。{{1}}Grok 4.6 的 500K 上下文只有 Gemini 3.7 Flash 的 1M 一半,{{2}}而當輸入超過 200K 時,其 $2/$6 費率會倍增——{{3}}因此長上下文、高輸入的工作負載,{{4}}正是 Grok 4.6 的標價在與 Gemini 促銷價競爭時失去優勢的地方。{{/4}}{{/3}}{{/2}}{{/1}}
每項任務的經濟效益
以首發優惠價計算,Gemini 3.7 Flash 在 80/20 輸入/輸出比例下的混合費率約為每百萬 token 1.35 美元;Grok 4.6 在同一比例下的標價在計入其長輸入懲罰之前為每百萬 token 2.80 美元。理論上,Google 的模型看起來以壓倒性優勢成為總量贏家。複雜之處在於:Gemini 的思考型 token 是依輸出計費,其基準測試宣稱已有一週歷史,且其單任務效率尚未被獨立測量——而 Grok 4.6 的則已被測量。便宜的 token 加上浪費的回合,總成本可能超過能把任務跑完的昂貴 token;而在這組對決中,一方握有該問題的數據,另一方卻沒有。
押注新模型,卻不押注管線
Grok 4.6 在 OrcaRouter 上,價格為 SpaceXAI 的 $2/$6 標價,加價 0%,包括超過 200K 的 2 倍級距,模型頁面會即時從路由層拉取該資訊。Gemini 3.7 Flash 剛推出一天,在 Google 自己的 API 上;其前代 Gemini 3.6 Flash 則在 OrcaRouter 上,按 Google 的標價販售。


如果這個比較真正想問的是「我該不該把代理管線押在新的廉價模型上」,那麼路由層就是避險工具:一條故障轉移規則,讓代理今天跑在 Grok 4.6 上,等 Gemini 3.7 Flash 一上市就切換過去;或者一個融合面板,讓兩個模型都作答,再由裁判整合兩者結果——路由 DSL 就是為了這種設定而存在的,而且這種做法不需要在證據齊全之前就先選邊站。
誠實的解讀
如果你想要今天最便宜的 token,而且你信任三週的交付時程,Gemini 3.7 Flash 就是積極進取的賭注——價格戰是真實的,基準測試的進步已有報導,而促銷窗口確實是真正的折扣。如果你想要一個 agent 效率經過獨立測量、價格在一月不會變動、且自我驗證迴圈專為長時間運行的任務而設計的模型,Grok 4.6 就是保守的選擇,而 AA 數據讓它在每項完成任務的成本上佔有優勢。一邊是附帶倒數計時的促銷;另一邊是擁有實績的價格。兩者都站得住腳——這正是讓這場比較成為真正的對決、而非流於形式的原因。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
