
Gemini 3.7 Flash 对比 Grok 4.6:谷歌价格战对决 SpaceXAI自检智能体
- google新Google: Gemini 3.8 Flash2026-09-0259智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0258智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0166智能82代码
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
在 Gemini 3.6 Flash 基本失败三周后,Google 将价格减半并推出了 Gemini 3.7 Flash——这一举动被大多数报道解读为直接针对Grok 4.6,这是 SpaceXAI 前一天发布的、面向智能体优化的旗舰模型,定价为 2 美元和 6 美元。时机本身就是看点:两个接近前沿的模型仅相隔一天发布,瞄准同一类买家——那些无需支付前沿价格即可获得智能体编码能力的团队——且定价理念截然相反。Google 正在用五个月的促销活动来换取市场反响。SpaceXAI 则以统一标价按任务出售信任。
Grok 4.6 于2026年8月12日发布,是 SpaceXAI 对其 1.5万亿参数 Grok 4.5 基础模型的改进版本,专为长时间运行、可自行验证子任务完成情况的智能体而构建,配备50万上下文窗口,支持文本和图像输入,定价$2/$6,输入token超过20万时价格翻倍。Gemini 3.7 Flash 于2026年8月13日发布,是 Google 对 Gemini 3.6 Flash 的算法优化版本——100万上下文,支持包括视频和音频在内的多模态输入,促销价$0.75/$3.75,2027年1月1日起翻倍至$1.50/$7.50。在独立的 Artificial Analysis 智能指数中,Grok 4.6 得分61,明显高于 Gemini 3.7 Flash 早期约56分的水平。
价格战,每个维度一行
• 每百万输入价格 — Gemini 3.7 Flash $0.75(首发价)对比 Grok 4.6 $2.00。Google 价格低出超过60%。
• 每 1M 输出的价格——Gemini 3.7 Flash 为 $3.75(首发价),而 Grok 4.6 为 $6.00。
• 2027年1月1日之后 — Gemini 价格翻倍至 $1.50/$7.50,而 Grok 保持不变,仍为 $2/$6。
• 上下文窗口——Gemini 3.7 Flash 1M 对比 Grok 4.6 500K。
• 长输入计费——Gemini 在整个上下文窗口内统一收费;Grok 在输入达到或超过 200K 时价格翻倍至 $4/$12。
• 思考令牌——Gemini 将其计为输出;Grok 的成本则包含在独立测得的每项任务约 0.84 美元中。
一句话概括:Gemini 3.7 Flash 目前在价目表的每一档上都更便宜,但大部分优势将在1月1日消失。Grok 4.6 在8月的价格与3月相同。

Gemini 3.7 Flash 的钱去了哪里
Go{{1}}ogle{{/1}}自己的数据显示,Gemini 3.7 Flash 相比 3.6 Flash 有大幅跃升:DeepSWE v1.1 得分 65.3%(此前为 49.0%),FrontierCode 1.1 Main 得分 43.6%(此前为 34.4%),Terminal-bench 2.1 得分 85.8%(此前为 78.0%),WebDev Arena 的 Elo 为 1588(此前为 1538)。这些是厂商自报、未经复现的数字——这类数字衡量的是趋势,而非跨厂商的定论。但趋势才是关键:修复在发布三周后便已落地,而评测者此前普遍已不看好这次发布,这说明 Go{{2}}ogle{{/2}} 把 Flash 层级视为战场,而非旗舰。
Google促销所做的另一件事是压缩购买窗口。在0.75美元/3.75美元的价格下,该模型足够便宜,可以进行批量测试;在1.50美元/7.50美元时,它仍然具有竞争力,但已不再是价格战的武器。任何在引入窗口期采用它的生产团队都应在12月重新评估其经济性,而不是假设这一数字会随他们一同变动。
Grok 4.6 的钱都花在了哪里
Grok 4.6 的卖点不同:不是更便宜的 token,而是更少的浪费。它在训练中被要求自我验证——在继续下一步之前,检查子任务是否真正完成——而独立的测评也印证了这一效果:Artificial Analysis 将其成本定为每项任务约 0.84 美元,GDPVal-AA v2 为 1,753,Intelligence Index 为 61。这些都是第三方数据,也是这场对决中最有力的数字,因为它们捕捉到了按 token 单价衡量所遗漏的东西:一个完成工作所需轮次更少的模型,即使 token 单价更高,完成每项工作的成本也更低。
这种权衡正是更便宜型号的用武之地。Grok 4.6 的 500K 上下文是 Gemini 3.7 Flash 的 1M 的一半,而且其 $2/$6 费率在超过 200K 输入时会翻倍——因此,长上下文、高输入的工作负载正是 Grok 4.6 的标价在与 Gemini 促销费率相比时不再具有竞争力的地方。
每任务的经济性
在首发定价下,Gemini 3.7 Flash 在80/20输入/输出分配下的混合费率大约是每百万个token 1.35美元;Grok 4.6 在同一分配下的标价是每百万个token 2.80美元,且未计入其长输入罚金。从纸面数据看,Google的模型看起来是遥遥领先的量级赢家。但复杂之处在于:Gemini的思维token按输出计费,其基准测试数据已是一周前的,而且其每任务效率尚未被独立测量——而Grok 4.6的已经被测量过了。便宜的token加上浪费的轮次,可能比能完成任务的昂贵token花费更高,而在这场对决中,一方拥有关于这个问题的数据,另一方没有。
押注新模型,却不押注流水线。
Grok 4.6 在 OrcaRouter 上,按 SpaceXAI 的 $2/$6 标价提供,0% 加价,包括 200K 以上的 2 倍阶梯,模型页面会从路由层实时获取该信息。Gemini 3.7 Flash 发布仅一天,位于 Google 自己的 API 上;其前代 Gemini 3.6 Flash 在 OrcaRouter 上按 Google 的标价提供。


如果这个比较真正想问的是“我该不该把代理管道押注在新出的廉价模型上”,那么路由层就是对冲手段:一条故障转移规则,今天让代理跑在 Grok 4.6 上,等 Gemini 3.7 Flash 上线那天再切过去;或者一个融合面板,让两个模型都作答,再由一个裁判模型来调和结果——这正是路由 DSL 存在的意义,而且这种设置不需要你在证据齐全之前就站队。
诚实的解读
如果你想要今天最便宜的 token,并且信任三周的周转期,那么 Gemini 3.7 Flash 就是激进的押注——价格战是真实的,基准提升已有报告,而且推广窗口期确实是实实在在的折扣。如果你想要一个智能体效率经过独立测量、价格在一月份不会变动、自我验证循环专为长时间运行而设计的模型,那么 Grok 4.6 就是保守之选,而且 AA 数据让它在每完成一项任务的成本上占据优势。一方是带倒计时的促销,另一方是有着可靠记录的价格。两者都站得住脚——这正是让这成为真正比较、而非走过场的原因。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
