
Gemini 4 Argon 对比 GPT-6 Astra:指数上不分伯仲,价格下降三分之二
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 144 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
两个前沿模型,在 Artificial Analysis 的 Intelligence Index 上仅相差 0.11 分。Gemini 4 Argon 得分为 52.56。GPT-6 Astra 得分为 52.67。如果必须依据测得的通用能力在两者之间做选择,你抛硬币决定就行,而这两个分数之间的差距还小于任一分数自身的置信区间。在一个前十名模型总共只相差约十五分的市场中,这确实是一种罕见情况;这也让这场对决成为 Gemini 4 Argon 最容易分析的较量,因为能力之争还没开始就已结束,剩下的全是经济性和可及性。
不过,这两者并非双胞胎。Argon 由 Google DeepMind 于 2026-09-30 发布,正在分阶段推出,首批面向 Fairwind Program 中受信任的网络防御者。GPT-6 Astra 已于九月初上线——我们的目录卡片将其日期标为 2026-09-04,Artificial Analysis 列出的是 2026-09-03——并且是一条可用线路,你今天下午就能调用,价格为每百万 token 输入 10 美元、输出 50 美元,上下文窗口为 1,050,000 token,输出上限为 128,000 token。这两款模型中,有一款的价格今天就可以作为计费依据。
0.11个百分点的差距何时是真实的,何时只是噪音
一个指数是综合指标,因此两个在综合指标上打平的模型,其各组成部分可能仍有显著差异。这里各组成部分大体一致,但有三处例外值得点出。
• Terminal-Bench 4.0 — GPT-6 Astra 59.1% 对 Gemini 4 Argon 57.1%。Astra 以微弱优势领先。
• 长上下文推理——GPT-6 Astra 80.7%,而 Gemini 4 Argon 为 79.7%。
• GPQA Diamond — GPT-6 Astra 96.1%。Argon 未在该榜单上公布任何数据。
• CritPt — GPT-6 Astra 31.7% 对比 Gemini 4 Argon 27.1%。
• SciCode —— Gemini 4 Argon 61.8%,对比 GPT-6 Astra 56.5%。
• 人类最后的考试 — Gemini 4 Argon 57.1% 对 GPT-6 Astra 54.7%。
• AutomationBench-AA — Gemini 4 Argon 77.5%,对比 GPT-6 Astra 68.5%。
• GDPval — Gemini 4 Argon 1,611 对比 GPT-6 Astra 1,542。
• 全知——GPT-6 Astra 43.4 对比 Gemini 4 Argon 42.4。
• ITBench-SRE — GPT-6 Astra 48.6%,而 Argon 未公布任何数据。
• 输出速度——GPT-6 Astra 每秒 51.2 个 token,相比之下 Gemini 4 Argon 为 48.9。实际上持平。
• 在索引测试框架上的首token延迟——Gemini 4 Argon为2.8秒,而GPT-6 Astra为320.2秒。
Astra 在科学多项选择推理、临界点物理问题和 SRE 基准测试上具有优势。Argon 在科学编程、更难的端到端任务集以及 GDP 估值相关工作方面具有优势。任何一方的领先优势都不足以单独构成迁移的依据。

延迟这一项则是另一回事。首个 token 需要 320 秒,意味着在输出任何内容之前有五分半钟的沉默,而 Argon 不到三秒。两者衡量的是同一件事——在 Artificial Analysis 的索引运行中到达首个分块的时间——因此这是可比的。Astra 的推理始终开启,并可从低到最高努力程度进行配置;在困难任务上以最高努力程度运行确实会在开口前思考数分钟。这是否算缺陷完全取决于你的界面。对于批处理任务,它没有任何代价。对于任何有用户盯着加载动画等待的场景,它是这两个模型之间最用户可见的差异,比页面上任何基准测试差距都更大。
价格步骤,这才是真正的主题
正是在这里,平局被打破,而打破的方式很容易被错误建模,因为 Astra 的费率表有三个看起来相似的档位。
• 标准版,最高支持 272,000 个输入 token —— GPT-6 Astra 输入 $10.00 / 输出 $50.00,缓存读取 $1.00,缓存写入 $12.50。
• 长上下文,超过 272,000 个输入 token — GPT-6 Astra 输入 $20.00 / 输出 $75.00,缓存读取 $2.00。整个请求都会按更高档位重新计价,而不仅仅是超出部分:输入 2×,输出 1.5×。
• 快速模式——适用标准费率的 2 倍,因此输入 $20.00 / 输出 $100.00。这个 $100 的数字常被引用得好像是长上下文费率;但它并不是。
• Gemini 4 Argon — 在入门定价基础上,输入 $2.00 / 输出 $10.00 为统一价,缓存输入 $0.10,且未公布阶梯价,也未公布快速档。
因此,Argon 的输入成本是 Astra 标准层级的五分之一,输出成本也是五分之一,而在超过 272K 的输入上,成本则是十分之一。两项独立的成本测算从不同角度得出了相同的结论:Artificial Analysis 估计,Argon 每项索引任务为 1.99 美元,而 Astra 为 3.26 美元;运行整个索引需要 2,407 美元,而 Astra 需要 5,324 美元。每任务比率小于每 token 比率,原因与对比 DeepSeek 时相同——Argon 完成任务所用的 token 更少——但它仍然是 1.6 倍。
Vals 的 GDP 加权榜单讲述了同一个故事的第三个版本:Argon 以 68.90% 和每次运行 15.68 美元位居第一,Astra 以 63.13% 和 18.46 美元排名第六。在那里,Astra 更贵,得分却更低。Google 的资料明确表示,该定价是 introductory rate,而 introductory 这个词意味着它可能变动;诚实的解读是,Argon 的价格优势是真实的,但其持久性并无保证。
两个比基准测试更具决定性的架构事实

先看输出上限。Gemini 4 Argon 在单次轨迹中最多可生成 1,000,000 个 token——Google 的公告指出,这是从前一代的 64K 扩展而来。GPT-6 Astra 的上限为 128,000。两者的上下文窗口都在一百万 token 左右,所以这纯粹关乎模型一次能写多少。对于长文本生成、完整补丁式代码修改或一次性文档起草来说,单次调用可产出的内容相差八倍。而在聊天、信息抽取和短智能体步骤中,两个上限实际上都近乎无限,这一差异对你没有任何成本影响。
模态方面排第二,而在这方面有一处优势是反向的。GPT-6 Astra 接受文本、图像和文件。Gemini 4 Argon 接受文本、图像、视频和文件,而且谷歌的发布材料尤其强调长视频理解——一个厂商自报的 LVBench 数值 91.7%。如果你的流水线需要接入视频,Astra 无法替代。音频也没有出现在 Argon 公布的模态清单中,所以不要想当然地认为这次升级包含音频。
实际该做什么
Astra 可用,而 Argon 不可用,这就决定了未来一个月的大部分选择。不浪费任何工作的具体路径是:如果你的工作负载需要一款常驻的推理模型,且要求强大的科学准确性和经过验证的智能体实战记录,那就基于 GPT-6 Astra 来构建;把模型名称保留在配置中;并根据 Astra 的实测行为而非乐观估计来设置客户端超时——一次五分钟才产出首个 token 的运行会触发默认的 60 秒超时,而一条在 300 秒时中断的流看起来就像服务中断。如果你在输入 token 超过 272K 时对成本敏感,请在做出承诺前明确地对重新定价进行建模,因为这一档会在同一个边界处使输入价格翻倍、输出价格提高一半。

有趣的中庸之道在于,你并不必选定单一的默认项。Astra 和 Argon——当 Argon 正式发布时——是形态相同的模型,面向同一类工作,这使它们成为天然的故障转移搭档,而不是争抢同一位置的竞争对手。在 OrcaRouter 上,openai/gpt-6-astra以服务商标价、零加价上线,与另外 200 多个模型处于同一个 OpenAI 兼容端点,并具备跨服务商的自动故障转移,以及一套路由 DSL,可用单个密钥表达主用加备用的安排。当 Argon 以 Google 公布的任意 id 加入目录时,切换只是一个字符串——无需第二份合同,无需集成工作,也不必重建你在此期间围绕 Astra 搭建的任何东西。
什么能永久性地打破平局?
推广期结束后公布的 Argon 价格,以及对 Google 智能体相关说法的独立复现——77.9% 的 DeepSWE v1.1 数字和 68% 的 CWE-bench v1 结果均为厂商自报,二者背后都没有外部运行结果作为支撑。其中任何一项都可能大幅推高或拉低 Argon,因为如果成本优势最终只是暂时的,0.11 点的指数领先优势并不足以缓冲 1.6 倍的成本劣势;而如果 Google 维持推广费率,且 Astra 的长上下文档位在生产环境中造成的影响比预期更大,那也算不上劣势。
眼下:就实测的通用能力而言,这两个就是同一个模型套了两个外壳。Astra 有可用路由、已知的价格档位,还有五分钟的思考停顿。Argon 有更便宜的卡片,却没有端点。这种平局是真的,而且其中一方是可以买到的。
