
GPT-6.1 Sol 对比 Gemini 3.1 Pro:七个月的预览对阵八天的交付
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Gemini 3.1 Pro已在厂商价目表上挂了七个半月,始终没有脱离预览阶段。它于2026年2月19日宣布,如今文档仍挂在一个以-preview结尾的端点上,既没有正式可用(GA)的承诺,也没有——更能说明问题的是——停用日期。GPT-6.1 Sol问世才八天,于2026年9月29日发布,输入每百万token收费2.00美元,输出每百万token收费10.00美元。把它们并排放在Artificial Analysis Intelligence Index上,这个七个月大的预览版不仅具有竞争力,而且在最新一版指数修订上与新模型仅相差22分——在v4.3.2上为29.7对51.8——而每项指数任务的成本却高出1.8倍,为1.30美元对0.72美元。正是这种组合让这一比较变得有趣而非走过场:在这个榜单上,较老的模型能力落后,成本却更高,对于一个本应"毕业转正"的预览版来说,这是本末倒置。但指数修订的注意事项在这里比本组中任何地方都更重要,因为29.7和53都会被引用在同一个网站上,而它们并不是同一种测量。
两者都是具备百万级上下文窗口的大型多模态模型。Gemini 3.1 Pro 可处理文本、图像、视频、音频和 PDF,输出上限为 65,536 token,并设有 200,000 token 的定价档位,超过该档位后费率翻倍。GPT-6.1 Sol 可处理文本、图像和文件,窗口为 1,050,000 token,输出上限为 128,000 token,提供五档推理强度,并设有提示词超过 272,000 token 后的长上下文档位。一个是已正式发布、附带支持承诺的产品。另一个是生命周期不设期限的预览版,而这一差异的价值,最终超过了指数上的差距。
索引号需要附上其修订版本
Artificial Analysis 会重新运行其测试套件,并在当前指数修订版下重新发布分数,这意味着同一个模型可能因你查看的时间不同而带有两个不同的数字。对 Gemini 3.1 Pro 来说,这个差距异常大:此前本机构对该模型的报道在较旧修订版上报告的是 57,而当前页面在 v4.3.2 上显示的是 29.7;这个十次评估版本也载有 GPT-6.1 Sol 的 51.8。这两个数字都是真实的,而且都出现在同一个网站上。
这对比较而言的意义既具体又重要。只有来自同一修订版本的数值才能相减。v4.3.2 中的 29.7 和 51.8 得出 22 个百分点的差距;57 和 51.8 则得出相反方向的 5 个百分点差距。这里应当采用 22 个百分点这个数字,因为正是在这一组中,两个模型是由同一套测试套件在同一量表上测量的——也因为每任务成本数字,即 $1.30 对 $0.72,正是来自同一次运行。
• 智能指数,v4.3.2 — GPT-6.1 Sol 51.8 vs Gemini 3.1 Pro 29.7
• 每个索引任务的成本——GPT-6.1 Sol $0.72 对比 Gemini 3.1 Pro $1.30
• 运行完整套件的成本 — GPT-6.1 Sol $1,082 对比 Gemini 3.1 Pro $1,935
• 上下文窗口 — GPT-6.1 Sol 1,050,000 词元 对比 Gemini 3.1 Pro 1,000,000 词元
• 最大输出 — GPT-6.1 Sol 为 128,000 个 token,而 Gemini 3.1 Pro 为 65,536 个 token
• 输入模态——两者均支持文本、图像和文件,Gemini 3.1 Pro 还支持视频、音频和 PDF
其中两点对预览版有利,值得直说。Gemini 3.1 Pro 支持视频和音频,而 GPT-6.1 Sol 不支持;如果你的流水线要接入屏幕录制或通话内容,这就是任何分数都填补不了的能力缺口。另外,它 65,536 token 的输出上限只有 GPT-6.1 Sol 的一半,这对长文本生成很重要,但在智能体工作中很少成为瓶颈——那里的输出短、轮次多。
为什么较新的数字才是那个应该改变你决策的因素
价格问题比指数问题更有趣。
Gemini 3.1 Pro 的价目表是每百万 token 输入 $2.00、输出 $12.00,缓存输入为 $0.20,缓存写入为 $0.375,并在 200,000 个提示 token 处设有档位分界,超过后费率变为 $4.00 和 $18.00。GPT-6.1 Sol 为输入 $2.00、输出 $10.00,缓存输入为 $0.10,缓存写入为 $2.50,分界为 272,000 个 token,超过后其费率变为 $4.00 和 $15.00。标称输入价格相同。GPT-6.1 Sol 的输出价格低 20%,长上下文档位在两个维度上都更低。两张价目表拉开差距的地方在于缓存:每百万缓存输入 token 为 $0.10 对 $0.20,且预览版模型写入缓存更便宜,为 $0.375 对 $2.50。

最后一组数据反转了那种想当然的解读。如果你的工作负载是缓存密集型的——每轮都重新发送一段固定的长系统提示,或者在整个会话中反复读取同一份文档——那么 Gemini 3.1 Pro 的缓存写入项会便宜得多,而它的缓存读取项则是两倍。哪个模型胜出,取决于你重复读取自己写入内容的次数,而这个数字只有你自己的日志里才有,没有任何基准测试会公布。没有歧义的是指数成本:在完全相同的评估工作上,那个已发布八天的模型总成本便宜了 33%,而七个月前的预览版总体上比更新的模型贵了 79%。
预览徽章才是实际运行中的事实
这是评分表无法承载的那部分比较,而对于生产部署而言,它的重要性高于上面所有内容。
Gemini 3.1 Pro 自 2 月起一直处于预览状态,既没有正式可用(GA)公告,也没有停用日期。这两项缺失都很重要,而且影响方向相反。没有 GA 就意味着没有生命周期承诺:预览端点不受与正式可用端点相同的弃用通知条款约束,并且可以在不提升版本号的情况下在调用方脚下被修订——这正是生产环境中应固定确切的模型标识符、而非使用别名的标准理由。没有停用日期也意味着你无法规划迁移窗口——该模型已经撑过了所有人预期它转正的那个季度,而这个系列此前就曾关停过一款 Pro 模型。
GPT-6.1 Sol 的处境恰恰相反。它诞生仅八天,这意味着其独立评估记录只有一种配置的深度,而其故障模式尚无文档记录;当它表现异常时,也没有可供查阅的从业者语料库。它的发布本身就是新闻,并且它是在预览版所不具备的支持体系下推出的。
这些是不同的风险,而非风险大小的不同。选择预览版,你就是在赌供应商会继续提供一个它并无合同义务继续提供的端点。选择那个八天前发布的模型,你就是在赌一次基准测试运行加上八天的可用性,就足以作为你工作负载的依据。这个索引对这两种情况都帮不上忙。
唯一能让这件事变简单的东西
如果 Gemini 3.1 Pro 发布正式可用(GA)公告,提供不属于 -preview 命名空间的模型标识符,并公布生命周期承诺,就能解决这里的大部分问题。它不会弥合 22 点的指数差距或 1.8× 的单任务成本差距,但会消除目前使比较结果失衡的弃用风险,并让团队无需锁定预览标识符、寄希望于运气就能采用该模型。
七个半月过去,那份公告仍未出现,这本身就是信息。一个原本要在“很快”正式发布(GA)前验证更新的预览版——按供应商二月份的说法——已有整整两个季度来完成这件事。要么验证仍在进行,要么预览版本身就是产品——而调用方从外部无法分辨是哪一种。调用方能做的是,为这种不确定性定价,并据此进行路由。
两者共用一个键,因此答案可以按工作负载而定

Gemini 3.1 Pro 已在 OrcaRouter 上线,按其自身标价计费——$2.00 / $12.00,提示词 token 超过 200,000 后升至 $4.00 / $18.00,缓存读取为 $0.20。GPT-6.1 Sol 已在 OrcaRouter 上线,价格为 $2.00 / $10.00,提示词 token 超过 272,000 后升至 $4.00 / $15.00,缓存读取为 $0.10。两者均按供应商标价提供,不额外加价,一个密钥、一份账单。
这样一来,这项对比中那些棘手之处就能以很低的成本解决。视频和音频摄入仍留在预览版上,因为这对组合中没有其他模型能接收它;大批量的文本和编码工作则交给较新的模型,它按任务计更便宜,而且在相同的评估工作上便宜 33%。如果预览端点被修订或撤下,自动故障转移会把这些调用转到另一条路由,而不是让它们失败——这正是预览版生命周期风险所需要的特定对冲手段。而且,由于两者都位于同一个 OpenAI 兼容端点之后,真正重要的价格对比可以用你自己的流量在一个下午跑出来,而不是依据费率卡来争论。

那么,站得住脚的解读并不是哪个模型更好。而在于,这两者定价几乎相当,却在生命周期成熟度上相差七个月,在当前独立榜单上相差 22 分,并且预览版模型的真正优势——视频和音频输入、廉价的缓存写入——既狭窄又具体。如果你的工作负载需要这些模态,那么 Gemini 3.1 Pro 是两者中唯一的选择,而指数差距就是入场代价。如果不需要,那么你得到的是一个前景未定的预览端点,其单任务成本比上周发布的模型高出 80%,而举证责任则落在相反的一方。
