
Gemini 4 Argon vs GPT-6 Sol:五分之一的价格,四倍的账单
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 219 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
在 Gemini 4 Argon 上运行 Artificial Analysis 指数测试套件,账单是 2,407 美元。在 GPT-6 Sol 上运行同一套件,账单是 1,546 美元。相同的指数、相同的任务、相同的一周。这两个模型的标价完全相同——每百万输入 token 2.00 美元、每百万输出 token 10.00 美元,Argon 是 Google 声明的导入期优惠价,Sol 是 OpenAI 的常规价——然而完成相同工作的最终成本却相差 56%,而且是偏向得分低五分的那个模型。这个差距正是这次比较值得一写的原因,而它与费率表毫无关系。
Google 于 2026-09-30 发布了 Gemini 4 Argon,称其为前沿智能的新时代,定价为输入 2 美元、输出 10 美元,缓存输入享 95% 折扣,并通过 Fairwind Program 向可信网络防御者逐步推出。GPT-6 Sol 自 2026-09-22 起已全面可用,当时 OpenAI 发布了 GPT-6 系列的中端层级,定价为输入 2 美元、输出 10 美元,并提供 90% 缓存折扣。其中一个今天已可在 OpenAI 兼容端点上购买,另一个则除指定群体之外任何人都无法购买,这就是本文的实际分岔点。但即使完全将可用性搁置不谈,上述成本倒挂依然成立,而理解其中原因才是有用的部分。
直白地说,这个反转
Artificial Analysis 同时发布 Intelligence Index 和运行该指数所需成本的核算。两者结合起来表明:
• 智能指数——Gemini 4 Argon 52.6 对 GPT-6 Sol 47.5。五点之差,测量时 Argon 处于其 高 努力档位,而 Sol 处于 最高,因此这一比较对 Sol 更为宽容,而非偏向 Argon。
• 每百万 token 的目录价——完全相同。两者均为输入 $2.00 / 输出 $10.00。缓存读取是唯一的差异:Argon 为 $0.10,Sol 为 $0.20。
• 每个索引任务的成本 — Gemini 4 Argon 为 $1.99,而 GPT-6 Sol 为 $1.05。尽管每 token 成本相同,Argon 每个任务的成本却大约是 GPT-6 Sol 的两倍。
• 运行完整套件的成本 — Gemini 4 Argon 为 $2,407,对比 GPT-6 Sol 的 $1,546。
• 实测输出速度——GPT-6 Sol 为每秒 77.0 个 token,Gemini 4 Argon 为 48.9,1.6 倍的差距既体现在延迟上,也体现在开销上。
那份清单里有一行能解释其余所有行,而且它不是价格。它是 token 数量。在该指数自身的任务中,Gemini 4 Argon 每个任务生成约 561,000 个输出 token;GPT-6 Sol 生成约 282,000 个。Argon 回答同一个问题时要花两倍的思考时间,而在每 token 费率相同的情况下,账单正好是两倍。

为什么代币是价格
在任何人给迁移做预算之前,这是值得内化的一个纠正性认识,因为直觉的方向是反的。当一个模型的定价与竞争对手相同,却要消耗两倍的输出 token 才能完成任务时,每 token 价格并不是真正的价格。真正的价格是每 token 价格乘以模型决定消耗的 token 数,而第二个因子是模型自身的属性,不是价目表上的费率。
不同任务的利润率差异极大,这让情况更糟——你不能套用一个固定乘数就继续往下做:
• Terminal-Bench 4.0 — Argon 每任务输出 165,330 个 token,而 Sol 为 97,372。Argon 在此每任务成本为 6.78 美元,而 Sol 为 4.00 美元,尽管 Argon 得分为 57.1%,Sol 为 43.9%。
• CritPt —— Argon 109,533 个 token,而 Sol 为 31,848 个。在一项 Sol 实际得分更高的任务上,token 比高达 3.4 倍,30.9% 对 27.1%。
• GDPval — Argon 为 74,571 个 token,Sol 为 41,567 个;每任务 1.82 美元,对比 1.32 美元。
• 全知 — 938 对 2,662 的 token 比率,Argon占优,每任务 $0.010,而 Sol 为 $0.027。唯一一个方向反转的任务族。
• 长上下文推理——{{1}}Argon{{/1}} 为 {{2}}2,197{{/2}} token,而 {{3}}Sol{{/3}} 为 {{4}}954{{/4}},且这是整个测试套件中 {{5}}Sol{{/5}} 在分数上明显胜出的唯一任务,{{6}}83.7%{{/6}} 对 {{7}}79.7%{{/7}}。
CritPt 才是那个有启发性的例子。一个模型在同一个问题上消耗三倍半的 token,却给出稍差的答案,这不是能力故事,而是花钱习惯的故事。Argon 的推理很长,在某些任务形态下,这种长度会转化为分数,在另一些任务形态下则只会转化为美元。该指数的 52.6 和 Sol 的 47.5 是汇总结果,而汇总结果恰恰掩盖了这一点。
这五个可能来自哪里
由于索引差距和成本差距指向相反的方向,因此值得了解哪些任务分别驱动二者。
• Terminal-Bench 4.0 —— Gemini 4 Argon 57.1% 对 GPT-6 Sol 43.9%。这是 Argon 取得的最大单项胜利,也是与长时程智能体编程最接近的任务族。
• 全知性 — Gemini 4 Argon 42.4 对 GPT-6 Sol 27.1。在事实覆盖度上相差十五个百分点,是整个测试套件中比例差距最大的一项。
• AutomationBench-AA — Gemini 4 Argon 77.5% 对比 GPT-6 Sol 61.6%。
• SciCode — Gemini 4 Argon 61.8% 对比 GPT-6 Sol 57.6%。
• 人类最后的考试——Gemini 4 Argon 57.1% 对比 GPT-6 Sol 47.9%。
• GDPval — Gemini 4 Argon 1,611 对比 GPT-6 Sol 1,487。
• ApexAgents / AA-Briefcase — GPT-6 Sol 的 1,482.78 Elo 对阵 Argon 的 1,493.84,11 分的差距落在已公布的置信区间内,应判定为平局。
• 长上下文推理 —— GPT-6 Sol 83.7%,对比 Gemini 4 Argon 79.7%。这是 Sol 唯一一次明显的胜出。
• CritPt — GPT-6 Sol 30.9%,Gemini 4 Argon 27.1%。Sol 再次以微弱优势胜出。
所以这个格局并不是"Argon 更好"。而是:Argon 在它发布材料主打的两个方面更强——端到端的业务任务执行和长周期软件工程——而 Sol 在偏学术风格的推理阶梯上、以及在长上下文中保持连贯性方面,与之持平或领先。对于一位工作负载是 400K token 提示词的检索流水线的读者来说,Sol 既是更好的模型,也是更便宜的那个,这是一种不寻常却又很舒服的处境。
比基准讨论更持久的规格差异
• 最大输出——Gemini 4 Argon 单次轨迹可达 1,000,000 个 token,谷歌称其为业内最大,并较上一代 64K 的上限有所提升。GPT-6 Sol 为 128,000 个 token。
• 上下文窗口 — GPT-6 Sol 的厂商规格卡标明约为 1,050,000 个 token;Argon 则为 1,000,000 个。Artificial Analysis 通过其测试框架测得 Sol 为 872,000 个 token,这是测试框架的测量结果,而非规格卡上的数字——应将规格卡视为规格说明,将测试框架给出的数字视为评测方实际测试到的值。
• 输入模态——两者都接受文本、图像和文件。Argon 的发布材料还倚重长视频理解,其中 Google 声称在 LVBench 上达到 91.7%,并将其称为最先进水平;但这是厂商报告的数字,尚无独立榜单复现该结果。
• 视频输入——可靠。Artificial Analysis 在图表中将 Argon 标注为禁用视频输入,并在发布时明确点名视频,而 Sol 的卡片则完全没有列出视频。如果视频在你的流水线中承担关键作用,那么这两张卡片都无法给出定论,你应该在做架构设计之前先进行测试。
• 推理力度——Sol 在 API 上提供可配置的力度(从 none 到 max,默认 medium),其测评档位为 max。Argon 的测评档位为 high;尚无人公布过同一套测试在其最高档位下的结果。
100 万 token 的输出上限,是真正可能改变架构、而不只是改变预算的那一项。你现在为了不超过 128K 上限而拆成十几次链式调用的任何东西——多文件补丁集、完整审计报告、一次性处理的长文档——都会变成一次调用,智能体循环丢失状态的地方也更少。这是否值得付出两倍的单任务成本,完全取决于你是否有这类工作负载。如果有,那很可能值得。如果你的调用只是分类并返回,那就是把钱花在没人会占用的余量上。
你所匹配的努力,以及它为何重要
有一点值得单独用一段来说明,因为它有悖于把这一 5 分的指数差距解读为纯粹的能力差异。Artificial Analysis 的图表中,Gemini 4 Argon 被标为其 high 推理强度设置,而 GPT-6 Sol 则被标为 max。这两者并非两条阶梯上的同一级,而且这种错位的方向颇有意思:Sol 是在其最昂贵的设置下运行的,Argon 则是在中等档位上。
接下来有两种解读,而数据无法将它们区分开来。要么 Argon 在max档位下得分会高于 52.6——但每项任务消耗的 token 也会超过 561,000,成本也会超过 1.99 美元——要么它的得分大致相当,那就意味着在这套评测集上,努力程度这个调节旋钮起不了多大作用。目前没有任何已公布的运行结果能给出定论。任何把 52.6 当作 Argon 上限来引用的人,引用的其实是一种配置,而不是一个模型,而且这个配置还是其供应商选择最先公布的那一个。
同样的逻辑也适用于 Sol 的 47.5,只不过方向相反:max是它所在阶梯的顶端,因此这个数字更接近上限而非下限。在同等投入下的一场公平较量可能会缩小差距,也可能扭转成本对比,因为max所消耗的 token,正是每百万收费 10 美元的那种 token。
可用性分叉,它决定实际答案
Gemini 4 Argon 尚未全面开放。Google 的公告称,它正通过 Fairwind Program 向一组受信任的网络防御者逐步推出,该公司参与了美国政府自愿性的发布前模型访问流程,而面向开发者、企业和消费者的普遍访问将“尽快”到来,首先从付费 API 客户和 Google AI Ultra 订阅者开始。没有模型标识符、没有端点、没有配额,也没有日期。它不在任何公共 API 上,包括我们的 API——查看目录会返回 404,因为它在那里尚不存在。
GPT-6 Sol 是一款可直接调用的产品。在 OrcaRouter 上,它是 openai/gpt-6-sol,与其他200 多款模型共用目录中同一个 OpenAI 兼容端点,价格按 OpenAI 的标价原样透传,零加价,因此上文提到的 $2/$10,以及 272,000 token 长上下文档位跳到 $4/$15,都是你实际支付的数字,而非费率卡上的标称价格。跨提供商的自动故障转移可覆盖路由在运行中途降级的情况,而路由 DSL 让单个应用无需第二个 SDK,就能把廉价的分类流量发给更小的模型,把高难度的推理流量发给 Sol。

对大多数团队来说,最后那个方案才是这个对比最诚实的答案。支持 Argon 的成本论据确实成立,但它取决于工作负载是否以长时程智能体任务为主;而在其他所有工作负载上,反对它的成本论据同样成立;况且这个月你本来也买不到它。成本最低的做法是现在就搭好评估框架——用你自己的提示词、你自己的评分标准,在几档 effort 设置下对 Sol 进行测试——这样当 Argon 面向付费 API 客户开放时,对于那个别人都将照着排行榜来回答的问题,你已经有了经过实测的答案。
什么能了结它
三件事,按它们能在多大程度上左右结论排序。Argon 以真实、非尝鲜价全面可用——“introductory”一词意味着 $2/$10 可能变动,而 Google 自己的次序把付费 API 客户放在前面,所以发布后第一个公布的费率才是要盯的。一篇已发布的 Artificial Analysis 在 Argon 最高 effort 设置下的运行结果,这会表明 52.6 是上限,还是离上限只有一线之遥。以及一次对 DeepSWE v1.1 数值的独立复现——Google 声称达到 77.9%,并称其为新的最高水平;截至今天,这仍是厂商报告的数据,在 Google 之外尚未被复现。
在那之前,这种分化清晰明确,且略带讽刺。GPT-6 Sol 是验证更充分的模型,速度更快,按每完成一项任务计算更便宜,而且是你今天下午就能调用的那个。Gemini 4 Argon 则是在其供应商选择公布的排行榜上得分更高的模型,实际使用成本大约贵一倍,而且尚未发售。在两者之间做选择,并不是对能力的判断,而是对这两句话中哪一句更能描述你这个月的判断。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
