
GPT-6 Luna 对比 Gemini 3.1 Pro:一个已发布七个月的预览版,输入价格却是后者的二十倍
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
这个前沿推理模型一直被标注为“预览版”,从Gemini 3.1 Pro于 2026 年 2 月 19 日发布起。七个月后,它仍然是一个预览版,仍然保持每百万输入 token 2.00 美元、每百万输出 token 12.00 美元的价格,也仍然是产品页面上所说的该公司的前沿推理模型。2026 年 9 月 22 日,厂商发布了GPT-6 Luna,作为正式可用的小型层级,价格为 0.10 美元和 0.50 美元。把两张价目表并排对照,这个更新、更便宜、已正式可用的模型在输入上便宜二十倍,在输出上便宜二十四倍——而且它的得分在更高两家厂商市场部门都关心的独立指数上
最后那句话值得停下来细想。GPT-6 Luna 在最高推理强度下,于 Artificial Analysis Intelligence Index 上测得 37 分。Gemini 3.1 Pro Preview 在同一版本上测得 30 分。一个以高吞吐效率为卖点的模型,领先一个以前沿推理系统为卖点的模型整整七分,而输入价格只有后者的二十分之一。这并不是一个便宜模型追赶上了昂贵模型的情况。在这个特定维度上,便宜模型就是领先的,而昂贵模型已经预览了七个月。
自然得出的结论——Gemini 3.1 Pro 定价过高——也并不完全正确,而本文余下部分将讨论 Google 的这款模型在三个方面如何配得上它的价目表,因为这些方面真实存在,而且并不小。
决定胜负的五件事
在详述之前,先讲简短版本:
• GPT-6 Luna 在价格上胜出:输入约 20 倍、输出约 24 倍,缓存输入大幅领先,并在最大努力匹配时于通用指数上领先 7 分。
• Gemini 3.1 Pro 在输入模态上胜出——它支持音频和视频,而 GPT-6 Luna 则不支持——并且在已可供使用七个月这一点上也占优,对一款预览版而言,这已是相当长的生产实践记录。
• 输出上限在两个方向上都不接近:GPT-6 Luna 最多可输出 128,000 个 token,Gemini 3.1 Pro 最多可输出 65,000 个。
• 两者都设有一条长上下文档位分界线,一旦触及便会对整个请求重新计价:GPT-6 Luna 为 272,000 个输入 token,Gemini 3.1 Pro 则约为 200,000。
• 默认投入陷阱仅适用于 Luna:其 37 分是最大投入得分,而其默认中等设置的得分为 29,低于 Gemini 3.1 Pro 的 30。
两张费率卡及其之间的算术
每个维度一行,每行均包含两侧:
• 每 1M 输入 — GPT-6 Luna $0.10 vs Gemini 3.1 Pro $2.00
• 每 1M 输出 — GPT-6 Luna $0.50 对比 Gemini 3.1 Pro $12.00
• 缓存输入 — GPT-6 Luna 每 100 万个 $0.01,相比 Gemini 3.1 Pro 每 100 万个 $0.20 享受 90% 折扣,即 90% 的折扣
• 长上下文边界 — GPT-6 Luna 超过 272K 输入 token,而 Gemini 3.1 Pro 超过约 200K 输入 token
• 长上下文效应 — 针对整个请求,GPT-6 Luna 的输入与缓存为 2 倍、输出为 1.5 倍;相比之下,Gemini 3.1 Pro 为 $4.00 输入 / $18.00 输出,同样是针对整个请求
• 上下文窗口 — GPT-6 Luna 1,050,000 个 token,对比 Gemini 3.1 Pro 的 100 万 token
• 最大输出 — GPT-6 Luna 128,000 个词元,对比 Gemini 3.1 Pro 65,000 个词元
• 输入模态 — GPT-6 Luna 支持文本和图像,对比 Gemini 3.1 Pro 支持文本、图像、音频、视频和文件
• AA Intelligence Index — GPT-6 Luna 在最高努力程度下为 37,默认设置下为 29,而 Gemini 3.1 Pro 为 30
• 输出速度 — GPT-6 Luna 153.9 tokens/秒,而 Gemini 3.1 Pro 大约为 115-143 tokens/秒,具体取决于快照版本
• 推理关闭开关 — GPT-6 Luna 从 none 到 max,而 Gemini 3.1 Pro 则推理优先,未公开非推理模式
• 状态 — GPT-6 Luna 自 2026-09-22 起正式发布,对比 Gemini 3.1 Pro 自 2026-02-19 起处于预览阶段

有意思的那一行并不是价格,而是底部的那两行。Gemini 3.1 Pro 的预览标签并非技术细节——它改变了 Google 对你所负的责任。预览模型可以在没有正式版(GA)模型所享有的弃用通知的情况下被更改、调价或撤下;而七个月未变的定价,是一份没人以书面形式做出的承诺。下文关于 Google 的模型是更稳妥的生产之选的所有论述,都必须对照这一前提来理解,因为"稳定了七个月"和"七个月没有稳定性保证"说的是同样的七个月。
Google 的模型在哪里多赚二十倍
三个地方,而第一个对于某些队伍来说,直接就让这场比较就此终结。
模态。Gemini 3.1 Pro 支持音频和视频输入,GPT-6 Luna 支持文本和图像。如果你的流水线需要接收通话录音、屏幕截图或视频,那么在这场对比中,任何情况下价格差异都无关紧要,因为这两个模型中有一个根本无法完成这项工作。这不是那种会随某个小版本发布而缩小的基准测试差距;这是一种要么具备、要么完全不具备的能力,也是谷歌的价目表能够经受住真实采购考验的最有力理由。
输出上限,方向则相反。输出上限的较量与输入模态恰好朝着相反的方向展开,而这一项对 OpenAI 有利。GPT-6 Luna 单次响应最多可输出 128,000 个 token;Gemini 3.1 Pro 则为 65,000 个。如果你要生成较长的结构化产物——一整份文档、一次大规模重构、一个多文件补丁——Google 的上限大约只有 OpenAI 的一半,而一条会在 65,000 个 token 处截断的流水线,无论其每个 token 的单价如何,都是坏掉的。
多模态前沿工作。Gemini 3.1 Pro 的定位是一款恰好具备多模态能力的推理模型,其实际结果就是:需要对示意图、图表或屏幕录制进行推理的任务会落到它身上,而不是落在文本优先的小型档位上。GPT-6 Luna 同样接受图像,因此分界线并不只在于音频和视频——而在于 Google 的模型是以视觉与音频推理作为主要用例来打造的,而 OpenAI 的模型则是为吞吐量而打造的。
廉价档真正吃亏的地方,并不在你预想之处
在这组对比中,真正的陷阱是推理努力度的默认值,而它在这里造成的杀伤,比面对一个更弱的对手时还要大。GPT-6 Luna 那个作为宣传主打的 37 分指数得分,是在最高推理努力度下测得的。它的默认值是中等,而在中等档位下它只得 29 分——仅以一分低于 Gemini 3.1 Pro 的 30 分。所以,本文开头所说的那七分领先,其实是一个模型的上限与另一个模型的上限之间的比较;而一个团队如果安装了 GPT-6 Luna 却对配置放任不管,实际运行的就是这样一个模型:比谷歌那款略微落后一点,版本老了七个月,仍处于预览阶段,价格却只有对方的二十分之一。
对大多数工作负载而言,这依然是正确的取舍——指数上相差一个点算不上能力差异,而 20 倍的价格差距却算。但它与费率表所宣传的那种取舍并不相同,而且除非你特意去找 effort 参数,否则根本看不见它。
廉价档位失守的第二个地方是长上下文算术。两款模型一旦跨过某个门槛,就会对整个请求重新定价,而不是只对超出的部分加收费用;而两者的门槛都低到足以产生影响:GPT-6 Luna 为 272,000 个输入 token,Gemini 3.1 Pro 则约为 200,000 个。GPT-6 Luna 的条款让输入和缓存价格翻倍,输出价格提高一半。Gemini 3.1 Pro 的条款则把整次调用的价格抬到输入 $4.00、输出 $18.00。两者都不是边际性的加收费用,而对于一款以价格为主打的模型来说,这个条款本身就是价格。
第三个是啰嗦程度,这是费率卡上永远不会出现的一项成本。Artificial Analysis 测得 GPT-6 Luna 在整个索引运行中生成了 1.5 亿个输出 token,而中位数为 8500 万——这个模型话很多,按每百万输出 0.50 美元计算,这就是 75 美元的 token 开销,而一个简洁的模型本只需花费 42.50 美元。它仍然比替代方案便宜一个数量级。这也是为什么按任务计算成本和按 token 计算成本会讲出不同的故事,也是为什么在推演节省空间之前要先测量自己的输出量。
它们之间的迁移是什么样子
Google 的模型可以通过厂商自家的 API 以及多个第三方平台访问;GPT-6 Luna 则可以通过 OpenAI 自家的 API 访问,而截至本文撰写时,在这一组合中,这两者都不是更容易拿来标准化的一方。两者都提供兼容 OpenAI 的 chat completions 接口,这意味着调用形式不是问题——参数才是。GPT-6 Luna 的 effort 阶梯、其 272,000 token 的条款,以及它要求 Chat Completions 上的函数调用必须在 reasoning effort 设为 none 的情况下运行,这些行为 Gemini 3.1 Pro 都不具备,而一个只改动模型字符串的移植会产生一次能正常工作、但成本结构错误的调用。
Gemini 3.1 Pro Preview 已以 Google 的标价上线 OrcaRouter,在直通式定价模式下,这意味着 Google 一调整价格,我们这边当天即生效。截至本文撰写时,GPT-6 Luna 尚未进入我们的目录。对于同时运行两者的团队——凡是需要音频或视频的场景都用 Google 的模型,大批量文本则用 OpenAI 的——这就是一把密钥:既能用于 Gemini 3.1 Pro,也适用于你原本用于 OpenAI 的任何模型,而且路由决策以配置形式表达,而不是写成两条代码路径。这种组合恰恰最能体现其价值,因为这两个模型根本无法互换:一条需要在多模态预览版和纯文本正式版小规格档之间做选择的路由,注定会在任何一家厂商发布新版本时被重新决策。

什么会改变这一点?
就目前来看,这项比较定格了一个不同寻常的时刻:一个 9 月的 GA 模型以二十分之一的输入价格,在通用指数上击败了一个 2 月的预览模型,却在模态以及预览版永远无法真正获得的成熟度上落败。有三件事会改变这一局面,每一件都值得观察,而不是猜测。
第一件事是 Gemini 3.1 Pro 结束预览阶段。GA 正式发布将带来弃用政策、稳定的价格表,而且很可能还有价格调整——在长达七个月的预览期内,Google 一直维持着 $2.00/$12.00 的价格,而周围市场的价格却已经腰斩,这种克制更像是等着 GA 日期的发布定价,而非深思熟虑后的立场。
第二点是,OpenAI 是扩展 Luna 的 effort 阶梯,还是改动其默认值。GPT-6 Luna 在最高 effort 下的得分与默认 effort 下的得分相差 22 分,这是本文中最大的配置敏感度,而一旦改动默认值,每一位从未碰过该参数的调用方所获得的模型实际能力都将随之改变。
第三个是模态差距。这是这里唯一一个不属于程度问题的维度,也正是它使得这无法成为一场纯粹的价格比较。除非其中某个模型能做到另一个做不到的事,否则这二十倍的差距就是一个实实在在的数字,指向两项不同的工作。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
