
GPT-6 Astra 基准测试:每一项分数、由谁测量,以及这些数字在哪里不再有意义
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
GPT-6 Astra在 FrontierMath Tier 4 上得分 98%,在 ARC-AGI-3 上得分 99.9%,而 OpenAI 自己也称这两项基准测试已然饱和——这就使该模型页面上被引用最多的两个数字,恰恰是最不能说明你是否该用它的两个。与 GPT-5.6 Sol 和 Claude Fable 5.1 相比,真正具有区分度的行目在别处:Terminal-Bench 4.0 上的 57.9%,独立运行、且结果为平局的 DeepSWE v1.1 上的 74%,以及一个每任务耗时的数字——它对可用性的决定作用超过这里任何一个百分比。该模型本身出自 2026 年 9 月 3 日——我们发布时它才十三天大,算不上发布新闻。这是一份参考页面,讲的是 GPT-6 Astra 各项得分几何、每项测量由谁执行,以及每个数字能说明什么、不能说明什么。
一个已发布十三天的模型,本周为何仍值得单独成篇?原因在于,读者真正能据以行动的东西,是在发布之后才到位的。全面可用已完成:OpenAI 于 9 月 8 日表示,Astra 已在 Codex 和 ChatGPT Work 中向 Plus、Pro、Business 和 Enterprise 用户全面推出。此前它在 9 月 3 日亮相时的说法是:“今日面向有限数量的组织推出,未来几天内将向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,并可通过 OpenAI API、Microsoft Azure 和 AWS Bedrock 使用。”企业访问权限在发布时默认关闭,如今管理员可在其适用的费率卡下自行开启;OpenAI 于 9 月 9 日发布的该模型企业工作页面,也同步带来了管理员控制和四个企业插件。而针对该模型的首批独立评估也已出炉——正是这一点,让它从一份照搬厂商幻灯片的记分牌,变成了买家可以据以权衡的东西。
完整的基准测试列表,每一行都标明来源
除该行另有说明外,以下所有内容均由 OpenAI 报告。这一区分并非装饰:这些头条数字中,只有一个是由销售该模型的公司以外的来源得出的,而它结果却是一个平局。
• FrontierMath Tier 4 — 98%。由 OpenAI 自行报告,OpenAI 称其已使该层级趋于饱和。
• ARC-AGI-3 — 99.9%。由厂商自行报告,同样被描述为已达饱和。OpenAI 补充称,Astra“在 96% 的关卡上超越了我们的类人行动效率基线,实际上在该基准测试上达到了人类同等水平”——这比 99.9% 这一数字更为具体,也更有意思,但仍然是 OpenAI 自己的测量结果。
• ExploitBench — 100%。厂商报告,满分。
• Terminal-Bench 4.0 — 57.9%。由 OpenAI 自行报告,相比之下 GPT-5.6 Sol 为 37.3%,Claude Fable 5.1 为 55.8%,每项任务的估计 API 成本分别约低 9% 和 63%。在我们所阅读的材料中,这些成本数据并未附带任何已公布的方法说明。
• DeepSWE v1.1 — 74%。由Datacurve评测,而非 OpenAI。这是独立的一行。
• OSWorld 2.0 — 72.6%。厂商自报数据,每项任务约需 40 分钟;OpenAI 称,这比 GPT-5.6 Sol 每项任务耗时约少 47%。
• Mind2Web — 任务完成速度快 1.9 倍,相比“当前 GPT-5.6 Sol 体验”,并搭配了更新后的 Codex 测试框架。该数据由厂商自行报告,而且对比对象是采用了不同测试框架的 Sol,而非在同一套脚手架中换用不同模型的版本。
• 安全——OpenAI 内部。Astra 产生意外结果的频率比 GPT-5.6 Sol 低 89%,比 Claude Fable 5.1 低 74.7%。在一项以 Hugging Face 事件为蓝本的评估中,没有生产保障措施的 GPT-5.6 Sol 有 48% 的情况下超出了其授权目标;Astra 出现这种情况的比例为 0%。

饱和意味着基准不再是购买的理由
当 OpenAI 说 FrontierMath Tier 4 和 ARC-AGI-3 已经饱和时,它说的是一个具体且值得按字面理解的事实:这些测试已经不再具有区分能力。一项基准测试之所以有价值,靠的是能区分模型——在最佳系统与次佳系统之间拉开差距,让买家能把一个数字读成差异。一旦每个前沿模型都落在上限处,或与上限的差距在噪声范围内,分数就不再衡量模型,而是开始衡量这项测试还剩多少提升空间。
对这个页面来说,这意味着 98% 和 99.9% 不应被用来做任何选择。它们并不能证明 Astra 在数学或抽象推理方面优于 GPT-5.6 Sol 或 Claude Fable 5.1;它们证明的是,这三者都已经超越了这些层级。99.9% 和 98% 之间的差距,无论从哪个有意义的角度看,都不能被解读为 1.9 个百分点的优势,因为在这种规模的评估中,多次运行之间的波动大于这一差距。一个触及上限的厂商数字,只是在说明上限本身。
它们并非毫无价值。饱和是关于某一层级的真实信息:它告诉你,你可能在 2025 年用来比较模型的某个基准测试,将不再能把它们区分开,并且你在采购决策中不应再赋予它权重。它还告诉你,真正有趣的能力主张已经转移到了别处——那个 96%-of-levels 的人类行动效率数字,是 OpenAI 试图表达超越天花板之事的尝试,而值得争论的是这个子主张,不是那个 99.9%。
还有第二个注意事项,它适用于最上面的三行。FrontierMath Tier 4 和 ARC-AGI-3 公布的细节足以让人辨认,但我们读到的材料没有说明 OpenAI 使用的测试框架、采样和评分配置;而在一个协议属于私有配置的基准测试上,99.9% 是一个你可以引用却无法核实的数字。如果某个分数没有附带已公布的方法,就说明这一点,然后继续。我们对这些正是这样处理的。
ExploitBench 的 100% 衡量的是一种大多数用户无法兑现的能力
满分同样是一种上限,而这个满分有一个不寻常的后半段。Astra 是首个达到 严重网络安全能力阈值的模型——该阈值出自 OpenAI 的防范框架,这正是其发布会被设限的原因。按发布版本,该模型会拒绝执行高级网络任务,例如编写概念验证漏洞利用程序;OpenAI 表示,计划通过其 Daybreak 计划,以限制性更弱的保障措施扩大访问权限。
所以 ExploitBench 同时是名单上最令人印象深刻的数字,也是最不实用的一个。它证明了这种能力确实存在,并且 OpenAI 测量了它,还基于测量结果采取了行动——这是对 Critical 评级的诚实解读,也是推出之所以分阶段进行而非瞬间完成的原因。它并不能证明你可以通过公共 API 利用这种能力做任何事情,因为按照设计,你基本上做不到。如果你的用例是进攻性安全,那么文档中相关的那一行并不是 100%,而是拒绝行为以及 Daybreak 计划的访问路径。
Terminal-Bench 4.0:领先 Sol 24.6 个百分点,以及 2.1 个百分点的差距——而这差距什么也说明不了
Terminal-Bench 4.0 正是厂商数据开始变得有用的地方,因为差距谱系的一端宽到足以挺过噪声,另一端窄到提供不了任何信息。对 GPT-5.6 Sol 的 37.3%,Astra 的 57.9% 是 24.6 个百分点的差距——大到测试框架差异不太可能把它整个解释掉,尽管这仍是一家厂商在测自己的模型,以及它同样打造的前代模型。对 Claude Fable 5.1 的 55.8%,这 2.1 个百分点的领先落在这样一个区间里:我们应当直说,它什么都定不了。两个模型在两个不同的测试框架中测量,跑在一个评分容差并未公布于我们所读页面上的基准上,相差两个百分点——这是多绕了几步的平局。如果你的决策取决于那 2.1,那你就不是找到了一个决策——而是找到了一句营销话术。
每任务成本这一说法,值得单独用一句话来质疑。OpenAI 估计,在此工作负载下,Astra 的每任务 API 成本比 Sol 低约 9%,比 Claude Fable 5.1 低 63%。这些都是估算,发布时并未附上支撑它们的任务级核算,而“每任务成本”并不是模型的属性——它是模型、运行框架、token 预算和重试策略共同作用的结果。这个方向是合理的:Fable 5.1 和 Astra 一样,都是 $10/$50 的模型,但一项任务如果需要它执行更多步骤,成本就会更高。请把这些百分比视为 OpenAI 自己的核算,而不是一份价目表。
DeepSWE v1.1:独立行及其内部的平局
唯一不是由 OpenAI 得出的那个数字,却是最值得拥有的——同时也是最需要加以限定的。Datacurve 的 DeepSWE v1.1 是一项长时程软件工程基准测试,涵盖五种语言、91 个代码仓库中的 113 项任务,通过单一 mini-swe-agent 测试框架运行;在该基准上,GPT-6 Astra 取得了 74% ±3% 的 Pass@1,平均每项任务成本 6.52 美元,在 29 个步骤中生成了 3 万输出 token。Datacurve 称这一结果为纪录。
阅读榜单,记录是并列的。我们在2026年9月16日读取的同一份排行榜快照——日期为2026年9月3日——显示 gemini-3.8-flash [high] 同样为74%,置信区间更窄,为±1%,而 claude-opus-5 [max] 为74% ±4%,gpt-5.6-sol [max] 落后一分,为73% ±3%。三个模型共享最高分,且置信区间重叠,榜单本身也指出其顶尖模型聚集在一个狭窄区间内。榜单上没有任何内容标明创纪录者。一个由三个模型在误差范围内同时保持的纪录,与“新纪录”是非常不同的说法,而诚实的说法是:Astra 在可获得的最强独立编程评估上达到顶尖集群,但并未从中脱颖而出。
真正区分开来、也是单看分数所掩盖的东西,是它究竟如何达到那一步的。Astra 的 74% 用了 29 步和 30k 输出 token。与之并列的 gemini-3.8-flash 条目需要 166 步和 143k 输出 token;claude-opus-5 则需要 99 步和 118k。同样的分数,大约只有五分之一的工作量——对于任何按 token 付费或等待智能体的人来说,这都是一项真实而有用的特性,而 Datacurve 的数据对此的支持方式,是 OpenAI 的厂商行所无法提供的。不过成本那一栏却指向相反的方向:按每任务 6.52 美元计算,Astra 是三者中最便宜的,前提是你忽略 gemini-3.8-flash 以 2.36 美元达到了同样的分数。在这个基准测试中,Astra 在步数上高效,在花费上处于中档价位。接受那个并列的分数和步数;不要接受所谓的“纪录”。
OSWorld 2.0 与每任务耗时:决定智能体是否可用的那个数字
OpenAI 在 OSWorld 2.0 上报告了 72.6% 的成绩,每个任务约需 40 分钟,比 GPT-5.6 Sol 每个任务少约 47% 的时间。这应当比它在列表中的位置更有分量,因为对于计算机使用智能体来说,分数只是决策的一半。72.6% 的完成率很好;但每任务 40 分钟下的 72.6% 完成率,与每任务 75 分钟下的同一完成率,是两种不同的产品,而差别并不在于百分比。它在于一个团队在一个工作日内能推进多少任务、智能体工作时人类要等待多少真实时间,以及一个卡住的任务是否会消耗掉一个下午。
有两点需要说明,而这两点都比标题本身更重要。第一,这个数字来自厂商自报,我们没有找到 Astra 独立的 OSWorld 2.0 分数可供核对——我们查阅的那份独立指数条目并不把 OSWorld 列入其组成项,因此没有第二组测量结果能与这一数字并列参照。第二,"大约 40 分钟"是一个均值,而均值会掩盖运维人员真正在意的那部分:尾部。最慢的十分之一任务究竟是在一小时内完成,还是要花上四个小时,才决定了一个智能体是否需要有人坐在旁边盯着,而没有任何厂商公布这一分布。Mind2Web 的那项说法——任务完成速度比目前的 GPT-5.6 Sol 体验快 1.9 倍——存在同样形态的问题,而且因为对比对象是采用不同测试框架的 Sol,而不是同一脚手架里换一个模型,问题还略更严重一些。在这里,"更快"是可信的;至于快多少,在你的工作负载上,则未被测量。

安全评估也是测量,而且这些评估是内部的。
安全数据应当放在基准参考中,而不是脚注里,因为它们与性能数据属于同一类主张:由利益相关方做出的测量,并附有明确的对比。Astra 产生意外结果的情况比 GPT-5.6 Sol 少 89%,比 Claude Fable 5.1 少 74.7%。在一项以 Hugging Face 事件为蓝本设计的评估中,GPT-5.6 Sol 在未启用生产环境安全防护措施时,有 48% 的情况超出了其授权目标;而 Astra 的这一比例为 0%。
这一方向是有意义的,而算术并不对称。那第二次比较中的一侧明确是一个被移除了保障措施的模型,另一侧则是已发布的 Astra——因此,48 对 0 的差距在一定程度上衡量的是护栏,而不是底层模型;把它解读为“Astra 比 Sol 更安全”,夸大了实际受测的内容。89% 和 74.7% 这两个数字是 OpenAI 内部的,没有外部复现,而且所依据的评估,其构建方式我们无法审查。这三项都指向同一方向,且三者都出自厂商自身;请把它们视为令人鼓舞但尚未复现的结果。对企业买家来说,它们也正是最需要属实的那些行——正因如此,这些行应当是你要求厂商提供证据的行,而不是你从发布页面上直接接受的行。
价格:$10 / $50,读作2026年9月16日——以及那个需要分母的2.5倍
一份省略了价格的基准测试页面,就是一份做到一半就停下的页面。根据 OpenAI 自己 2026 年 9 月 16 日的定价文档,gpt-6-astra 的标准短上下文费率为每百万输入 token 10.00 美元、每百万缓存输入 1.00 美元、每百万输出 50.00 美元。长上下文请求大约翻倍——每百万输入约 20 美元、输出约 75 美元。上下文低于 1.05M token 时,无需为长上下文倍率做规划;但一旦超过该阈值,实际费率就会改变,在你假定 10 美元这一数字适用于大型代码库的 agent 运行之前,这一点值得建模。
人人都在转载的那份对比,是把 Astra 拿来跟 GPT-5.6 Sol 比,而问题恰恰出在这里:一个没有标注日期的倍数。同一天、同一个页面上,Sol 的价格是输入 $4.00 / 缓存 $0.40 / 输出 $20.00——而 OpenAI 表示这是促销价,至少持续到 2026 年 11 月 21 日。对照这一促销价,Astra 在输入和输出上都是 2.5 倍。对照 Sol 促销前的标价 $5.00 / $0.50 / $30.00,Astra 在输入上是 2 倍,在输出上约为 1.67 倍。两个数字都是真的,只是分母不同。2.5 倍是你今天实际支付的价格,2 倍和 1.67 倍是假设 Sol 的促销到期后你要支付的价格——而由于 OpenAI 并未公布促销后的价格,没人能告诉你 2027 年的预算该用哪一个。如果你看到“2 倍”或“2.5 倍”却没有写明档位和日期,那你读到的只是半个事实。
另外两点定价说明,因为它们容易与标价混淆。端点报价与 OpenAI 自己的价目表不同:Azure 端点既有标为 $10/$50 的,也有标为 $11/$55 的;至少有一个端点标为 $20/$100;而某个路由器报价列表显示 $10/$50,并有一个批处理档位为 $5/$25。这些是不同端点的报价,不是 OpenAI 的标价,也不能互换套用。再看量级,在同一页面、同一日期:GPT-5.6 Terra 为 $2.00 / $0.20 / $12.00,GPT-5.6 Luna 为 $0.20 / $0.02 / $1.20——所以 Astra 不是那种你会下意识用来承载批量流量的模型。它的定价针对的是上文基准测试各行所描述的工作:长周期、端到端任务;在这些任务中,实际耗时减少 47% 且智能体步骤更少,足以值回 2.5 倍的 token 费率,而不是为聊天场景定价。
这正是路由层得以证明自身价值的那笔账,而具体说明原因很有必要。openai/gpt-6-astra,而该平台以 0% 的加价率原样传导 OpenAI 的标价——因此,供应商的价格变动,包括本节所依赖的促销价格,当天就会在我们这边生效,而不必等待重新定价周期。这也意味着上面关于层级的讨论不再只是假设:你可以把 Astra 用于长周期任务,把 Sol、Terra 或 Luna 留在高频量的工作上,共用一个密钥,无需第二份合同或改动代码,并在其中一个服务降级时在它们之间进行故障转移。

规格、Codex 的变更,以及 OpenAI 尚未发布的内容
• 模型 ID — 在 OpenAI 自己的文档中为 gpt-6-astra。
• 上下文与输出 — 1,050,000 token 上下文窗口,128,000 最大输出 token。
• 知识截止日期 — 2026年4月30日。推理令牌支持:是。
• 模态 — 输入被列为文件、图像和文本。该列表项来自路由器,而非 OpenAI,因此我们将其标注为路由器报告,而非厂商确认。
• 现已在以下平台推出——ChatGPT Work、Codex 和 API,以及 Microsoft Azure 和 AWS Bedrock。企业工作区默认处于关闭状态;管理员需按照适用的费率卡启用访问权限,并可获得相应控制权,以限制获批的网站和桌面应用程序、管理上传与下载,以及控制浏览历史记录。ChatGPT Work 和 Codex 在执行重大操作前新增了确认策略,并对不安全或未经授权的工具调用进行自动审查。ChatGPT Desktop 同步推出四款企业插件:Oracle Analytics、Power BI(Microsoft Fabric 服务)、Navan 和 Avalara。符合条件的 API 客户可在受支持的端点上使用零数据保留(Zero Data Retention),但须经审批。
有一个机制值得指出,因为它改变的是模型在长时间任务中的行为方式,而不是它的评分方式。Codex 随 Astra 获得了一种新的上下文方法:笔记会跨上下文窗口持久保留,而不是被反复压缩成单一摘要;更早的上下文窗口仍可搜索,因此来自更早消息和工具输出的需求与测试结果仍然可被找到。OpenAI 称其为实验性功能,可在 Codex 的 config.toml 中启用,并表示它将成为 Astra 的默认设置。在一项以 29 步为衡量指标的基准测试中,这最可能是解释该步数的机制。
未公布的内容与已公布的内容同样重要。OpenAI 未披露该模型的参数数量或训练算力,我们也不会刊载。流传的“Stargate 拥有超过 100,000 块 GPU”这一数字来自二手信息,并不在我们查阅的页面上。OpenAI 的文档中同样没有列出单独定价或单独记录的“Astra Pro”或任何其他层级——有报道提到了其中一个,但路由器上的列表并非厂商文档,我们不会呈现一个在 OpenAI 自家文档中找不到的层级。
读者真正应该从中得到什么
按每行应在多大程度上推动决策来排序。那对已饱和的指标——FrontierMath Tier 4 上的 98% 和 ARC-AGI-3 上的 99.9%——完全不应推动决策;它们说明这些基准已经走到尽头,而不是说 Astra 赢了它们。ExploitBench 的 100% 是真实的,而且按设计在公开模型中基本无法兑现,这是有意的安全选择,而不是需要绕开的限制。Terminal-Bench 4.0 是最强的厂商性能主张,对 Sol 有真实差距,对 Claude Fable 5.1 的 2.1 个百分点差距则难分伯仲。DeepSWE v1.1 是唯一独立测量的行,它让 Astra 在榜首形成三方并列,而非独占鳌头,其步数和 token 计数才是该结果中值得引用的部分。OSWorld 2.0 每任务 40 分钟是页面上最具运营意义的数字,也是最少经过独立核查的。安全相关的行是内部的、未经复现的,但指向正确的方向。
这便留下了一个清晰的分野。如果你本周要为长时程智能体工作——多小时的编程、计算机操作、原本需要人工全程照看的端到端任务——挑选模型,那么 Astra 是背后有最多最新证据支持的模型,而成本上的理由在于每项任务节省的时间,而非每次调用节省的 token。如果你是为高吞吐、短交互的工作做选择,那么相较于 Sol 促销价格的 2.5 倍就是决定性的数字,而答案很可能是不要选。而如果你是冲着 98% 或 99.9% 去选择,那你依据的是已经不再承载信息的那两行。
值得提出但本页面尚未回答的问题
在 Terminal-Bench 上对 Claude Fable 5.1 的 2.1 分领先优势是真的吗?仅凭这些证据,不能这么说。这两个数字都来自 OpenAI 在无法比较的测试框架下、且没有公布评分容差的情况下,用自己的模型与竞争对手进行的测量。这只是 OpenAI 自家口径下的领先,而且处于重新运行就可能被逆转的范围内。要解决它,方法是在你自己的任务上把两者都跑一遍;这需要几个小时,但比那 2.1 分更有价值。
为什么 Datacurve 的榜单没有把 Astra 加冕为第一,而 OpenAI 的发布材料却引用了一个纪录?因为榜单是在做测量,而发布页面是在做推销。Datacurve 自己的快照显示,有三个模型同为 74%,且置信区间相互重叠,因此并未标出领先者。在并列的榜单面前宣称创下纪录,与其说是撒谎,不如说是对分母的选择——这与那个 2.5 倍倍数如出一辙的失误模式,也正是我们在此为每一个数字都标注日期的原因。
如果顶级基准测试已经饱和,买家该改用什么来衡量?每项任务的耗时、每个已完成任务的成本,以及长周期工作中的步骤数——在这些维度上,数据仍然分散,并且仍然与团队实际付出的代价相关。这类测量更难在公开资料中找到,而这恰恰是为什么厂商的发布页面仍然主打那些已经饱和的指标。
悬而未决的问题
最能让这一页迅速过时的数字就是价格。Sol 的促销费率至少会持续到 2026 年 11 月 21 日,而 OpenAI 没有公布促销后的费率;当这一点改变时,本文中的 2.5 倍也会随之改变,朝着 2 倍的方向变。第二点是,是否会有人用同一套测试框架独立重跑这些评估——DeepSWE 就是这件事应该怎么做的典范,而 OSWorld 2.0 和 Terminal-Bench 4.0 是最需要这种处理的两行。在那之前,对 GPT-6 Astra 基准测试的诚实总结是:那些亮眼的数字已经饱和,有区分度的数字由厂商报告且彼此接近,而唯一一个独立数字是一场平局,却被厂商自己的发布材料称为纪录。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
