
GPT-6.1 Sol 与 Gemini 4 Argon:仅差半分,且只有一款在售
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
你能在GPT-6.1 Sol与Gemini 4 Argon之间比较的每一项都是可测量的,但没有一项能落实到行动,因为这两款模型中只有一款买得到。Gemini 4 Argon 于 2026 年 9 月 30 日在一篇署名 Koray Kavukcuoglu 的 DeepMind 博文中发布,标称的入门价格为每百万输入 token 2.00 美元、每百万输出 token 10.00 美元,并将通过 Fairwind 计划首先向一批具名的网络防御人员推出。它没有模型标识符,没有 API 端点,没有可供计费的已公布每 token 费率,也没有任何客户能够访问的页面。GPT-6.1 Sol 于 2026 年 9 月 29 日发布,定价为 2.00 美元和 10.00 美元,现已可用。在 Artificial Analysis 智能指数上,两者相差 0.8 分——Argon 52.6,Sol 51.8——这使它们成为本批次中差距最小的一对,单看该指数可谓不分伯仲。但在决定实际部署的那把标尺上,其中一款模型根本不在候选之列。
这种不对称并非细枝末节,也不是什么独家猛料。它是应当决定这组对比如何被解读的事实:Argon 的数据所描述的,是一个面向单一群体、处于受控推送阶段的模型;而 GPT-6.1 Sol 的数据所描述的,则是价目表上的一款产品。把两者放在一起比较仍然值得——Argon 是厂商目前主推的型号,其测量结果确实反映了 Gemini 产品线顶端所处的位置——但每一个结论都必须带上“如果它买得到”这一前提,且没有哪一个结论能带上“你是否该换用”这个说法。
该指数只允许进行一次比较,而且几乎不分上下。

两个模型都出现在 Artificial Analysis 上,并且都带有一个分数,以及一份关于产生该分数所花费成本的核算。
• 智能指数,v4.3.2 — Gemini 4 Argon 52.6 对比 GPT-6.1 Sol 51.8,相差 0.8 分
• 每个索引任务的成本——Gemini 4 Argon $1.99 对比 GPT-6.1 Sol $0.72,为了这 0.8 分,差距达到 2.8 倍
• 运行完整套件的成本 — Gemini 4 Argon $2,407,对比 GPT-6.1 Sol $1,082
• 在该测试套件上生成的输出 token 数——Gemini 4 Argon 110M 对比 GPT-6.1 Sol 67M,冗长度相差 1.6 倍
• 标明的推介价——两者均为每百万 token 输入 $2.00、输出 $10.00,Argon 上的缓存输入可减免 95%
• 上下文窗口 — GPT-6.1 Sol 1,050,000 个 token;Argon 尚未公布
第四行解释了第二行。在几乎相同的标称费率下,每任务 2.8 倍的成本差异,来自以相当的输出价格写出了 1.6 倍的 token,再加上这些 token 背后推理量所带来的成本。按其规格卡来看,Argon 并不是一个昂贵的模型。它在评测中很话多,而账最终结算在输出上。
配置不同,而差异的方向对更便宜的模型有利。Artificial Analysis 把 Gemini 4 Argon 标注为高努力设置,把 GPT-6.1 Sol 标注为 max 设置——因此 Sol 是在其最昂贵的设置下被测量的,而 Argon 则是在低于其上限的某个设置下被测量的。所以,0.8 个百分点的差距是对 Sol 而言较为宽厚的比较版本:给 Argon 配上最高设置,差距很可能拉大;给 Sol 配上更低的设置,其成本则会进一步下降。这两种做法都不会改变可用性线,而这条线是唯一能终结部署决策的线。
究竟该如何解读0.8个百分点的差距
不到一分的差距在十项评估的综合得分中算不上排名。那只是处于同一水平区间的两个模型。
这个指数没有为 Argon 公布的内容,正是那种能让这一分数区间变得清晰可读的组成细节——它在哪些评测中胜出、在哪些方面较弱、在构成综合分数的各个子分数上表现如何。GPT-6.1 Sol 的页面包含这些细项;Argon 的页面则只有一个总标题分数和一项成本。仅凭标题分数构建的比较只能说两者持平,仅此而已,而它就应该准确这么说,而不是从 0.8 分的差距中硬造出一个赢家。
有一个值得补充的外部数据点,而它指向的是相反的方向。在公告发布后流传的一项第三方编程评测中,Argon 位列第三,排在 GPT-6 Astra 和 Claude Opus 5.5 之后——对于一款处于受控发布阶段的模型来说,这是相当强劲的成绩,也与综合评分 52.6 保持一致。但这也只是来自单一评测的一次观察,且发表于公告发布后的头几天,因此它只是证据,而非长期战绩。标注一下,然后继续。
这两张价格卡片实际上是做什么用的
Argon 的标示费率比索引行更需谨慎对待,因为其中包含两个数字。
优惠期费率为输入 $2.00、输出 $10.00,缓存输入享 95% 折扣;若换算到一张价目卡上,Argon 与 GPT-6.1 Sol 的同类价格正好持平。厂商自家的脚注写明,在一段其并未定义的优惠期结束后,费率将变为每百万输入 token $4.00、每百万输出 token $20.00。后一组数字并非假设——它是该模型预计最终稳定于其上的已公布数字——而它恰好落在当前前沿模型的标价上,而非低于该标价。只引用优惠期那一组数字的对比,是在为一个尚未普遍可用的模型引用促销价,这一句话里就叠了两重临时性。
GPT-6.1 Sol 的价目卡是截然相反的一类对象。$2.00 和 $10.00 是标准费率,而非促销;超过 272,000 个提示 token 后长上下文阶梯价升至 $4.00 / $15.00,这一价格已公布,并适用于界定明确的边界;$0.10 的缓存输入今天已经生效并可计费。其中没有任何内容需要就供应商拒绝界定的某个时间段添加脚注。
这就是可用性那一行背后的实质。并不是说 Argon 是更差的模型——指数显示两者不相上下——而是说,这两张卡中,一张是承诺,另一张是意向。
推出本身就是对比

Fairwind Program 是 Argon 公告中技术对比往往会略过的部分,而它正是在这里最关键的部分。
该供应商首先将模型交到一批具名的网络防御者手中,优先于其他所有人;没有宣布全面开放的日期,没有开发者等候名单,也没有任何已发布的、可供客户锁定的标识符。这是发布前沿模型的一种正当方式,对于这一能力级别的模型来说也并不罕见。这也意味着,关于 Argon 在真实流量下的成本、延迟、吞吐量和可靠性的每一项说法目前都未经测量:没有生产流量可供测量。供应商自己的基准测试运行存在,Artificial Analysis 的综合评测也存在,而这两者之间,一个是某家实验室的评估,一个是某位评估者的测试套件。这就是全部记录。
GPT-6.1 Sol 的记录只有八天,并且以另一种方式显得单薄:只有一个独立配置,没有从业者语料库,还有一个已发布的产品,其故障模式尚未在任何地方被记录下来。两个模型都没有充分证据。然而,其中一个有一张发票。
那么这个比较是做什么的
三种用途,但没有一种能促成购买决策。
首先,校准。如果你们正在追踪 Argon 相对于 GPT-6.1 Sol 的位置,那么 52.6 对 51.8、每任务成本相差 2.8 倍就是当前状况,这说明 Gemini 4 系列在能力上具有竞争力,同时仍在敲定其商业条款。留意入门费率会被 $4.00 / $20.00 这一对价格取代,这会在能力不变的情况下,把价格匹配变成价格溢价。
其次,是一个持位立场。一个已被发布、已被评测却无法接入的模型,恰恰是需要在你的应用与模型选择之间保留一层抽象的最清晰理由。本文中的两个模型,从我方这一侧看,接入方式完全相同:GPT-6.1 Sol 已在 OrcaRouter 上线,自有定价 $2.00 / $10.00,缓存输入为 $0.10,且没有任何加价,因此今天就可以按提供商目录价为其构建工作负载。如果有一天 Argon 获得了标识符和价目表,评估它应当只是一次配置变更,而不是重写——而在此之前,花在 Argon 上的工程量,正应等于能让这一点继续成立所需的量。
第三,一份可证伪的观察清单。以下任何一项都会把这篇“截至目前我们所知”的文章变成可供选购参考的对比:开发者文档中出现模型标识符、其模型卡索引中出现条目、附有公开每 token 费率的正式发布公告,或 Artificial Analysis 发布一个处于不同 effort level 的第二种配置。在其中任何一项落地之前,任何声称 Argon 在生产环境中比 GPT-6.1 Sol 更便宜、更快或更好的文章,都是在描述一个除单一群体之外无人运行过的模型。

坦诚的收尾只有一句话,而且它关乎问题的形态,而不是得分。Gemini 4 Argon 和 GPT-6.1 Sol 在二者共同出现的唯一独立榜单上足够接近,以至于该指数无法在它们之间做出选择;真正让它们分出高下的是,一个已经可用,另一个只是承诺,而承诺不是你会把生产流量导向的东西。关注 Argon,如果价格和模态适合你的工作,就采用 Sol,并把抽象层保持得足够薄,这样当 Argon 成真的那一天,它只是一行配置,而不是一个项目。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
