主视觉标题卡内容为“Gemini 4 Argon 对比 GPT-6 Astra”,配有标签显示“指数 52.6 对比 52.7”,以及标签显示“每指数任务成本 $1.99 对比 $3.26”,页脚行内容为“Argon 数据由供应商报告;指数和成本数据来自 Artificial Analysis,2026-09-30。”
Guides & Insights

Gemini 4 Argon 对比 GPT-6 Astra:指数上不分伯仲,价格下降三分之二

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

两个前沿模型,在 Artificial Analysis 的 Intelligence Index 上仅相差 0.11 分。Gemini 4 Argon 得分为 52.56。GPT-6 Astra 得分为 52.67。如果必须依据测得的通用能力在两者之间做选择,你抛硬币决定就行,而这两个分数之间的差距还小于任一分数自身的置信区间。在一个前十名模型总共只相差约十五分的市场中,这确实是一种罕见情况;这也让这场对决成为 Gemini 4 Argon 最容易分析的较量,因为能力之争还没开始就已结束,剩下的全是经济性和可及性。

不过,这两者并非双胞胎。Argon 由 Google DeepMind 于 2026-09-30 发布,正在分阶段推出,首批面向 Fairwind Program 中受信任的网络防御者。GPT-6 Astra 已于九月初上线——我们的目录卡片将其日期标为 2026-09-04,Artificial Analysis 列出的是 2026-09-03——并且是一条可用线路,你今天下午就能调用,价格为每百万 token 输入 10 美元、输出 50 美元,上下文窗口为 1,050,000 token,输出上限为 128,000 token。这两款模型中,有一款的价格今天就可以作为计费依据。

0.11个百分点的差距何时是真实的,何时只是噪音

一个指数是综合指标,因此两个在综合指标上打平的模型,其各组成部分可能仍有显著差异。这里各组成部分大体一致,但有三处例外值得点出。

• Terminal-Bench 4.0 — GPT-6 Astra 59.1% 对 Gemini 4 Argon 57.1%。Astra 以微弱优势领先。

• 长上下文推理——GPT-6 Astra 80.7%,而 Gemini 4 Argon 为 79.7%。

• GPQA Diamond — GPT-6 Astra 96.1%。Argon 未在该榜单上公布任何数据。

• CritPt — GPT-6 Astra 31.7% 对比 Gemini 4 Argon 27.1%。

• SciCode —— Gemini 4 Argon 61.8%,对比 GPT-6 Astra 56.5%。

• 人类最后的考试 — Gemini 4 Argon 57.1% 对 GPT-6 Astra 54.7%。

• AutomationBench-AA — Gemini 4 Argon 77.5%,对比 GPT-6 Astra 68.5%。

• GDPval — Gemini 4 Argon 1,611 对比 GPT-6 Astra 1,542。

• 全知——GPT-6 Astra 43.4 对比 Gemini 4 Argon 42.4。

• ITBench-SRE — GPT-6 Astra 48.6%,而 Argon 未公布任何数据。

• 输出速度——GPT-6 Astra 每秒 51.2 个 token,相比之下 Gemini 4 Argon 为 48.9。实际上持平。

• 在索引测试框架上的首token延迟——Gemini 4 Argon为2.8秒,而GPT-6 Astra为320.2秒。

Astra 在科学多项选择推理、临界点物理问题和 SRE 基准测试上具有优势。Argon 在科学编程、更难的端到端任务集以及 GDP 估值相关工作方面具有优势。任何一方的领先优势都不足以单独构成迁移的依据。

A two-column scoreboard comparing Gemini 4 Argon and GPT-6 Astra on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, first token 2.8 s, input modalities text, image, video and files. GPT-6 Astra reads: AA Intelligence Index 52.7, price $10 / $50, cost per index task $3.26, output ceiling 128K tokens, first token 320.2 s, input modalities text, image and files, with a note that its standard rate steps to $20 input and $75 output above 272K input tokens. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis.

延迟这一项则是另一回事。首个 token 需要 320 秒,意味着在输出任何内容之前有五分半钟的沉默,而 Argon 不到三秒。两者衡量的是同一件事——在 Artificial Analysis 的索引运行中到达首个分块的时间——因此这是可比的。Astra 的推理始终开启,并可从低到最高努力程度进行配置;在困难任务上以最高努力程度运行确实会在开口前思考数分钟。这是否算缺陷完全取决于你的界面。对于批处理任务,它没有任何代价。对于任何有用户盯着加载动画等待的场景,它是这两个模型之间最用户可见的差异,比页面上任何基准测试差距都更大。

价格步骤,这才是真正的主题

正是在这里,平局被打破,而打破的方式很容易被错误建模,因为 Astra 的费率表有三个看起来相似的档位。

• 标准版,最高支持 272,000 个输入 token —— GPT-6 Astra 输入 $10.00 / 输出 $50.00,缓存读取 $1.00,缓存写入 $12.50。

• 长上下文,超过 272,000 个输入 token — GPT-6 Astra 输入 $20.00 / 输出 $75.00,缓存读取 $2.00。整个请求都会按更高档位重新计价,而不仅仅是超出部分:输入 2×,输出 1.5×。

• 快速模式——适用标准费率的 2 倍,因此输入 $20.00 / 输出 $100.00。这个 $100 的数字常被引用得好像是长上下文费率;但它并不是。

• Gemini 4 Argon — 在入门定价基础上,输入 $2.00 / 输出 $10.00 为统一价,缓存输入 $0.10,且未公布阶梯价,也未公布快速档。

因此,Argon 的输入成本是 Astra 标准层级的五分之一,输出成本也是五分之一,而在超过 272K 的输入上,成本则是十分之一。两项独立的成本测算从不同角度得出了相同的结论:Artificial Analysis 估计,Argon 每项索引任务为 1.99 美元,而 Astra 为 3.26 美元;运行整个索引需要 2,407 美元,而 Astra 需要 5,324 美元。每任务比率小于每 token 比率,原因与对比 DeepSeek 时相同——Argon 完成任务所用的 token 更少——但它仍然是 1.6 倍。

Vals 的 GDP 加权榜单讲述了同一个故事的第三个版本:Argon 以 68.90% 和每次运行 15.68 美元位居第一,Astra 以 63.13% 和 18.46 美元排名第六。在那里,Astra 更贵,得分却更低。Google 的资料明确表示,该定价是 introductory rate,而 introductory 这个词意味着它可能变动;诚实的解读是,Argon 的价格优势是真实的,但其持久性并无保证。

两个比基准测试更具决定性的架构事实

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst describing frontier performance across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

先看输出上限。Gemini 4 Argon 在单次轨迹中最多可生成 1,000,000 个 token——Google 的公告指出,这是从前一代的 64K 扩展而来。GPT-6 Astra 的上限为 128,000。两者的上下文窗口都在一百万 token 左右,所以这纯粹关乎模型一次能写多少。对于长文本生成、完整补丁式代码修改或一次性文档起草来说,单次调用可产出的内容相差八倍。而在聊天、信息抽取和短智能体步骤中,两个上限实际上都近乎无限,这一差异对你没有任何成本影响。

模态方面排第二,而在这方面有一处优势是反向的。GPT-6 Astra 接受文本、图像和文件。Gemini 4 Argon 接受文本、图像、视频和文件,而且谷歌的发布材料尤其强调长视频理解——一个厂商自报的 LVBench 数值 91.7%。如果你的流水线需要接入视频,Astra 无法替代。音频也没有出现在 Argon 公布的模态清单中,所以不要想当然地认为这次升级包含音频。

实际该做什么

Astra 可用,而 Argon 不可用,这就决定了未来一个月的大部分选择。不浪费任何工作的具体路径是:如果你的工作负载需要一款常驻的推理模型,且要求强大的科学准确性和经过验证的智能体实战记录,那就基于 GPT-6 Astra 来构建;把模型名称保留在配置中;并根据 Astra 的实测行为而非乐观估计来设置客户端超时——一次五分钟才产出首个 token 的运行会触发默认的 60 秒超时,而一条在 300 秒时中断的流看起来就像服务中断。如果你在输入 token 超过 272K 时对成本敏感,请在做出承诺前明确地对重新定价进行建模,因为这一档会在同一个边界处使输入价格翻倍、输出价格提高一半。

A capture of the OrcaRouter model page for OpenAI: GPT-6 Astra, showing the OpenAI provider, a release date of 2026-09-04, a 1,050,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $10.00 input / $50.00 output per million tokens.

有趣的中庸之道在于,你并不必选定单一的默认项。Astra 和 Argon——当 Argon 正式发布时——是形态相同的模型,面向同一类工作,这使它们成为天然的故障转移搭档,而不是争抢同一位置的竞争对手。在 OrcaRouter 上,openai/gpt-6-astra以服务商标价、零加价上线,与另外 200 多个模型处于同一个 OpenAI 兼容端点,并具备跨服务商的自动故障转移,以及一套路由 DSL,可用单个密钥表达主用加备用的安排。当 Argon 以 Google 公布的任意 id 加入目录时,切换只是一个字符串——无需第二份合同,无需集成工作,也不必重建你在此期间围绕 Astra 搭建的任何东西。

什么能永久性地打破平局?

推广期结束后公布的 Argon 价格,以及对 Google 智能体相关说法的独立复现——77.9% 的 DeepSWE v1.1 数字和 68% 的 CWE-bench v1 结果均为厂商自报,二者背后都没有外部运行结果作为支撑。其中任何一项都可能大幅推高或拉低 Argon,因为如果成本优势最终只是暂时的,0.11 点的指数领先优势并不足以缓冲 1.6 倍的成本劣势;而如果 Google 维持推广费率,且 Astra 的长上下文档位在生产环境中造成的影响比预期更大,那也算不上劣势。

眼下:就实测的通用能力而言,这两个就是同一个模型套了两个外壳。Astra 有可用路由、已知的价格档位,还有五分钟的思考停顿。Argon 有更便宜的卡片,却没有端点。这种平局是真的,而且其中一方是可以买到的。