标题卡写着“Grok 4.7 vs Gemini 3.1 Pro”,副标题是“排行榜变了,模型却没变”,还有三张卡片:AA Index v4.3.2 46 vs 30,每 1M 标准价格 $2/$6 vs $2/$12,以及状态 GA vs 预览版。
Guides & Insights

Grok 4.7 对比 Gemini 3.1 Pro:排行榜变了,模型没变

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年2月19日,Artificial Analysis 发表了一篇题为《Gemini 3.1 Pro Preview:AI 领域的新领军者》的文章。它在十项评测中六项领先,并以四分的优势领先 Claude Opus 4.6。而今天再打开同一个模型的页面,那个数字变成了30,在200个模型中位列第69。厂商什么都没改。改变的是那把尺子:Artificial Analysis 于2026年9月19日将其 Intelligence Index 修订至 v4.3.2,依据一套不同的评测集为目录中的每一个模型重新打分,于是二月的领先者到了九月成了中游选手,而模型本身却原封不动地停留在预览状态。这正是与 Grok 4.7 对比的大背景——该模型由厂商于2026年9月21日发布——也正是为什么这场较量与其说关乎哪个模型更聪明,不如说关乎这两者之中,哪一个你还能指望它下个月依然是同一个东西。

这些实际上分别是什么

Gemini 3.1 Pro 是 Google 最新的 Pro 级模型,但它从未达到正式可用(GA)状态。它以 gemini-3.1-pro-preview 的名义于 2026 年 2 月 19 日发布,而 Google 的弃用表至今仍将其列为“未公布关停日期”——这个预览版如今已在预览状态下停留了七个月,而 Google 在其下方推出了一整条 Flash 产品阶梯:5 月的 3.5 Flash、7 月的 3.6、8 月的 3.7、9 月的 3.8。没有任何比 Gemini 3 Pro 更新的 GA 版 Pro 模型。它具备 1,048,576 token 的输入窗口和 65,536 token 的输出上限,可接收文本、图像、视频、音频和 PDF 输入并输出文本,还提供低、中、高三档思考级别控制,没有预算参数,也没有 minimal 设置。权重闭源。

Grok 4.7 才发布一天,同样是闭源权重。它拥有 50 万 token 的上下文——只有 Gemini 的一半——并且只接受文本和图像输入,因此完全无法处理视频或音频,这是本次对比中最显著的能力差异。在提示词 token 低于 20 万时,其标价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元;超过这一门槛则升至 4.00 美元和 12.00 美元;缓存读取为 0.50 美元和 1.00 美元。xAI 还列出了一个更快的变体,其输出速度约为原来的两倍,价格也约为原来的两倍。在此处查阅的文档中,并未公布它的最大输出数值。

尺子移动了。这就是故事。

两个模型目前均在 Artificial Analysis Intelligence Index v4.3.2 上评分,该指数用 Terminal-Bench 4.0 替换了 Terminal-Bench 2.1,用 AutomationBench-AA 替换了 tau3-Banking,并重新锚定了 GDPval-AA Elo 量表。该指数上线时,每个模型的数值都发生了变化。Gemini 3.1 Pro 的变动比大多数模型更大,因为其 2 月的优势集中在那些新指数要么已停用、要么已重新调整权重的评估上。今天将这两列并排来看:

综合 — Grok 4.7(xhigh):在 Artificial Analysis 智能指数 v4.3.2 上得分 46。Gemini 3.1 Pro Preview:在同一版本上得分 30,在 200 个模型中排名第 69。

长上下文 — Grok 4.7:500k 窗口,AA-LCR v1.1 达 77%。Gemini 3.1 Pro:1M 窗口——是前者的两倍——而 65K 的输出上限,大约只有长上下文智能体会话通常所需的一半。

输入模态 — Grok 4.7:文本和图像。Gemini 3.1 Pro:文本、图像、视频、音频和 PDF。差距悬殊,而且这不是基准测试层面的差距——而是能力上的差距。

速度 — Grok 4.7:尚无公开测量数据。Gemini 3.1 Pro:每秒输出 124.4 个 token,在 200 个模型中排名第 39,通过 Google AI Studio 的首个 token 耗时为 63.62 秒。

价格,标准档 — Grok 4.7:每 100 万输入 $2.00 / 输出 $6.00。Gemini 3.1 Pro:输入 $2.00 / 输出 $12.00。输入相同,输出翻倍。

价格:长上下文档位 — Grok 4.7:在 200k 提示词 token 时翻倍至 $4.00 / $12.00。Gemini 3.1 Pro:在同一 200k 界限处升至 $4.00 / $18.00。相同的输入,输出多出 50%。

成熟度——Grok 4.7:发布仅一天,厂商基准测试大多未获复现。Gemini 3.1 Pro:上市七个月,但仍为预览版本,既无正式版(GA)承诺,也无停用日期。

OrcaRouter model page for Gemini 3.1 Pro Preview showing the google/gemini-3.1-pro-preview identifier, a 1M-token context window, a 65K maximum output, audio, file, image, text and video input with text output, and list rates of $2.00 per 1M input and $12.00 per 1M output.

预览问题现在确实是个实实在在的问题了。

如果一切顺利,为期七个月的预览本会是件怪事,而非风险。但确实出了问题。自2026年9月18日起,用户开始报告 Gemini 3.1 Pro 已从 AI Studio 的模型选择器中消失;截至本文撰写时,Google 员工没有作出回应,没有弃用通知,也没有说明原因——这是一起尚未解决的可用性事件,而非已确认的退役。把这一点与公告历史放在一起看:Google 在2026年5月的 I/O 上表示,Gemini 3.5 Pro“将于下个月推出”,而8月底的媒体报道称,该模型已被放弃,因为内部候选模型“没有比 Flash 系列好足够多”。Google 自己的 Pro 页面仍在宣传“3.5 Pro 即将推出”,这就是同一屏上的矛盾。无论结果如何,实际解读是:Gemini 3.1 Pro 是一个没有 GA 日期、没有指定继任者、且当前可用性存疑的预览端点。

Grok 4.7 的风险恰恰相反,而且性质上更小。它问世才一天,因此相关数据还很单薄——Artificial Analysis 尚未发布任何速度或延迟测量结果,xAI 为其自有的基准测试套件也未经过独立复现。毋庸置疑的是,该模型已正式开放使用、有定价、有文档,且身份稳定。一个身份稳定而数据未经证实的模型,比一个数据已公布但可用性不明的模型,要容易作为基础来构建得多。

分裂的代价,在实践中

假设你正在为文档流水线做选择。按 10 万输入 token 和 8k 输出计算,Grok 4.7 的输入费用为 $0.20,输出为 $0.048——约合 0.25 美元。Gemini 3.1 Pro 的输入费用为 $0.20,输出为 $0.096——约合 0.30 美元。两者相差在 20% 以内,而且如果你的文档是扫描件、PDF、音频或视频,Gemini 是两者中唯一能读取它们的。这不是基准测试上的论证;对于那种工作负载,这直接终结了比较。

现在假设你要为一个长上下文智能体做选择。在 30 万输入、8 千输出的情况下,Grok 4.7 的输入费用为 $1.20,输出费用为 $0.096,总计约 $1.30。Gemini 3.1 Pro 的输入费用为 $1.20,输出费用为 $0.144,总计约 $1.35。实际效果几乎完全相同——而在这里,Gemini 的 1M 窗口和 65K 输出上限就成了决定胜负的约束条件,因为 65K 的上限正是长时间智能体运行会崩掉的地方。在这场对比中,两个模型都不是那个廉价选项,而按前沿标准来看,二者也都算不上昂贵。

Two-column scoreboard titled “Grok 4.7 vs Gemini 3.1 Pro - the scoreboard”: AA Index 46 vs 30, context 500k vs 1M, input modality “text + image” vs “text + image + video + audio + PDF”, max output “not stated” vs 65k, price per 1M $2/$6 vs $2/$12, and status GA vs preview.

绕过移动目标

OrcaRouter 提供 Gemini 3.1 Pro,并在其独立的模型页面上按提供商费率列出——输入 $2.00、输出 $12.00,具备 1M 上下文窗口和 65k 最大输出——因为我们以 0% 的加价率透传提供商目录价格。在这类情况下,这可不是一句营销话术:Google 有一个定价期限尚未确定的预览构建版本,其可用性在九月曾出现波动,而路由器真正有用的地方,正是让集成保持稳定,同时其背后的东西却在不断变化。自动故障转移意味着一个停止响应的预览端点会变成一次路由事件,而不是一次服务中断,而路由 DSL 让你可以在单次调用中把多模态模型与纯文本模型组合起来——这正是这一组合所暗示的形态:Gemini 读取视频,Grok 基于其转录文本进行推理。截至本文撰写时,Grok 4.7 尚未收录于 OrcaRouter 目录;如今要调用它,需通过 xAI 自家的 API 以及搭载它的第三方平台。

值得构建的模式:让 Gemini 3.1 Pro 继续用于任何必须摄取视频、音频或 PDF 的场景,并将其预览状态视为一种需要绕开的运营风险,而不是回避它的理由。把 Grok 4.7 用在文本与图像任务上——在这些任务中,它更低的输出价格和更高的综合得分能够发挥作用,而且你今天集成的模型,六个月后仍会是你继续调用的模型。唯一不该做的是,把第六十九名的排名解读为对该模型的裁决——它是对基准测试修订的裁决,而这次将 Gemini 3.1 Pro 降级的修订,也同样将数十个 Google 从未触碰过的模型降级了。

呼叫

在当前的指数上,Grok 4.7 领先 Gemini 3.1 Pro 十六分,而在输出价格方面,它在标准层级上的成本只有一半,在长上下文层级上便宜三分之一。如果你的工作负载是文本和图像,这就足以据此做出决定。如果你的工作负载是视频、音频或扫描文档,Gemini 3.1 Pro 是两者中唯一的候选,比较也就到此为止——你买的是一项能力,而不是一个分数。两者都应附带的一个警示与性能无关,而关乎来源:一个是已有七个月历史的预览版,没有 GA 日期,背后还有一次九月的可用性事故;另一个才发布一天,只有一个头条数字,其他任何内容都没有独立复现。两者都不是已成定论的选择。两者都值得先路由,而不是直接押注。

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新