
GPT-6 Astra:OpenAI 最强模型是什么、费用多少,以及究竟谁能用上它
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
如果你搜索了 "astra" 并来到这里,最简短的真实答案是这样的:GPT-6 Astra是 OpenAI 的旗舰模型,其模型 ID 为 gpt-6-astra,它于 2026 年 9 月 3 日面世——比本页撰写时间早十三天。OpenAI 称其为"全球最智能、对齐程度最高的模型",并将其定位为面向长周期、端到端专业工作的模型,而非聊天用途。这不是一篇发布稿,这里的内容也都不构成任何公告。模型已经上线;真正仍有价值的问题是:它是用来做什么的、成本是多少、你如何访问它,以及在把厂商自报的数字与其他人测得的数字分开之后,它的实际得分究竟如何。九月第二周真正发生变化的地方在企业侧——Astra 出厂时处于关闭状态,而 9 月 9 日 OpenAI 发布了管理员控制项和费率表条款,让管理员可以将其开启。GPT-5.6 Sol作为 OpenAI 此前的旗舰,在下文仅作为 Astra 定价与衡量时所对照的基线出现;对比页面链接在文末,因为那场讨论属于那里,而不属于这里。
在细节之前,最值得知道的一点是:Astra 是一款你必须先被放行才能使用的模型,而 OpenAI 此前的旗舰模型并非如此。它也是该公司首款依据自家《准备度框架》跨越关键网络安全能力阈值的模型,而这轮发布的形式——先向有限组织开放、企业版默认关闭、防护层级日后逐步放宽——正是由这一定级决定的,而不单是算力所限。
GPT-6 Astra 究竟是什么
OpenAI 自家的模型文档只使用一个标识符,而且只用这一个:gpt-6-astra,全小写、带连字符、无厂商前缀。既没有按日期命名的快照形式,也没有厂商发布的“-latest”别名。在实际使用中,这个名字有两种输入方式——人们搜索“astra gpt 6”和“gpt astra”的频率与规范顺序大致相当——但它们都指向同一个模型,而规范形式才是 OpenAI 所印出的那一个。
OpenAI 对此的包装分为两部分,对任何考虑是否使用它的人来说,这两部分都至关重要。第一部分是能力:发布页面《GPT-6 Astra:新一代智能》称其为世界上最智能、最对齐的模型。第二部分于 9 月 9 日发布,标题为《GPT-6 Astra:面向工作的下一代智能》,对目标群体的描述更为具体——是长周期、端到端的专业工作,而非对话。这一区别正是整个宣传的核心。Astra 被推销为这样一种东西:它能依据一条起始指令,跨越众多步骤和漫长的时间,像人一样使用计算机,把一项任务推进到最终成品,其定价与打包方式也与此相应。
从这一定位中可以推出两点,而这两点很容易被忽略。第一,OpenAI 将其投放的界面是工作界面——ChatGPT Work 和 Codex——而通用聊天产品则被视为同一模型的下游使用者。第二,OpenAI 所邀请进行的竞争比较,并非针对另一个聊天机器人。当公司描述 Astra 编写和测试软件、操作浏览器或进行专业分析时,它实际上所取代的是一次人类的工作会话,而围绕它构建的安全与管理机制正是为了治理这一点。
重要的日期,以及改变一切的那一周
Astra 自己的日期是 2026 年 9 月 3 日。这天正是 OpenAI 发布该模型的日子,也是访问权限向有限的一批组织开放的日子。公司在该页面上的原话是,它“即日起面向有限的一批组织陆续推出,并将在未来几天内面向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时也可通过 OpenAI API、Microsoft Azure 和 AWS Bedrock 使用。”
之后发生的事,正是为什么一个十三天前才发布的模型,本周值得用一整页来写,而不是被归入历史档案。把这段经过连同日期一起读下来,它就不再像是一次发布,而开始像是一款产品正变得普遍可用:
• 2026年9月3日——GPT-6 Astra 发布。访问权限仅限于少数组织,包括 Daybreak 计划中的网络安全防御人员。ARC Prize 于同日公布了自己的 ARC-AGI-3 结果。
• 2026年9月8日 — OpenAI 表示,面向 Plus、Pro、Business 和 Enterprise 用户的推送已在 Codex 和 ChatGPT Work 中完成。Amazon Web Services 同日宣布 GPT-6 Astra 在 Amazon Bedrock 上正式可用。注意这个日期:它落在七天窗口之外的一天,因此在此处只是背景,而非新闻本身。
• 2026年9月9日 — OpenAI 发布企业版页面及其配套机制:企业版访问权限现可依据适用的费率卡和协议进行管理,新的管理员控制功能上线,企业版插件登陆 ChatGPT 桌面版。这是使本页面保持时效的两项事件中的第一项。
• 2026年9月10日 — OpenAI 推出面向金融服务行业的 ChatGPT,基于 GPT-6 Astra 构建,采用来自 Daloopa、LSEG News、PitchBook 和 Crunchbase 的优质数据,并与摩根士丹利和 Evercore 共同设计。这是第二个:一个在该模型上正式可用的具名垂直产品,这与基准测试表所呈现的是一类不同的事实。
• 2026年9月11日 — OpenAI 发布了一则 Cognition 客户案例,内容涵盖 Astra 在 Devin Desktop、Devin CLI 和 Devin Cloud 模型混合中的应用;另外,有报道称 OpenAI 向那些一直无法获得服务的付费订阅用户补发了积存的用量重置额度,Sam Altman 也就此次被他称为一团混乱的上线致歉。
对那一系列事件的诚实解读是喜忧参半,值得直白说明,因为大多数报道只挑了其中一半。该模型确实已面向付费 ChatGPT 层级开放,并可通过三条云服务途径访问。同样属实的是,OpenAI 自家 Codex 仓库中一个日期为 9 月 15 日的 GitHub issue 记录到:用户仍无法访问 Astra、缺少促销重置额度,以及速率限制窗口出现无法解释的变化。这两点都成立。Astra 已普遍可用,但其推出过程并不干净利落;而一位正在决定本月是否基于它进行构建的读者,应当把第二个事实计入考量。
你可以在哪里使用它,以及谁已启用
有五条路线,它们的条款并不相同。
• ChatGPT Work —— 适用于 Plus、Pro、Business 和 Enterprise 版本。对于 Plus 和 Business Standard 套餐,用量包含在现有订阅额度内,可在此基础上额外购买积分。
• Codex — 在相同的付费套餐层级中提供。需要 Codex CLI 0.153.0 或更高版本,并且 ChatGPT 桌面应用需要更新。
• OpenAI API——模型 ID gpt-6-astra,可在 Responses、Chat Completions 和 Batch 端点调用。Realtime、Assistants、Fine-tuning、Embeddings、图像、音频和审核端点均不支持该模型。
• Microsoft Azure 和 AWS Bedrock——两者均提供该功能。Bedrock 还通过 IAM 策略管控访问、在 CloudTrail 中记录调用日志,并借助 PrivateLink 支持 VPC 端点,同时具备组织级数据边界策略。
企业版的问题才是那个有着确切答案、并在 9 月 9 日发生了变化的问题。企业版访问权限在发布时默认关闭——管理员必须依据适用的费率表和协议手动启用。因此,是否采用是一个关乎成本、用例和治理的慎重决定,而不是某种默认开启、自动到手的东西。除此之外,OpenAI 还推出了管理员控制功能,让组织可以限制对已批准网站和桌面应用程序的访问、管理上传和下载,并控制浏览历史记录。ChatGPT Work 和 Codex 增加了确认策略——在采取有重大后果的行动前先获得批准——以及对不安全或未经授权的工具调用进行自动审查。
在采购方面,还有三个细节值得注意。符合条件的 API 客户可在受支持的端点上使用 Zero Data Retention,但需获得批准,因此受监管的团队应确认自身是否符合资格,而不是想当然。企业插件随 Astra 一同在 ChatGPT Desktop 中提供——包括 Oracle Analytics、Power BI(Microsoft Fabric 服务)、Navan 和 Avalara——它们通过现有的用户账户和管理员权限运行,这意味着它们不会授予 Astra 任何用户原本并不具备的访问权限。而这些控制措施在设计上就是分阶段实施的:团队可以先从较窄的配置开始,再逐步放宽,这似乎是大多数组织正在采取的实际路径。
它实际上擅长什么
本节中的每一个数字均由 OpenAI 报告,除非句子另有说明。这种标注并非套话——它区分了供应商的测量结果与复现的测量结果,而 Astra 正是一个这两者之间差距异常大、也异常显眼的模型。
• FrontierMath Tier 4 — 98%,OpenAI 称该层级已趋饱和。
• ARC-AGI-3 — 99.9%,也被称为已饱和,OpenAI 表示 Astra 在 96% 的关卡上超越了其人类动作效率基线,实际上在该基准测试上达到了与人类持平的水平。而关于这一项的独立情况则截然不同,将在下一节中介绍。
• ExploitBench — 100%,并且 Astra 是首个达到 Critical 网络安全能力阈值的 OpenAI 模型。
• Terminal-Bench 4.0 — 57.9%,相比之下 GPT-5.6 Sol 为 37.3%,Claude Fable 5.1 为 55.8%,估算每任务 API 成本分别低约 9% 和 63%。每任务成本这一项才是更有看头的一半;以低得多的成本取得适度的准确率领先,正是能改变生产决策的关键。
• DeepSWE v1.1 — 74%,Datacurve 称其创下了新纪录。
• OSWorld 2.0 — 72.6%,每项任务耗时约 40 分钟,比 GPT-5.6 Sol 每项任务少约 47% 的时间。
• Mind2Web — 速度提升 1.9 倍任务完成速度,相较当前搭载更新版 Codex 工具链的 GPT-5.6 Sol 体验。
在安全性方面,内部测量显示:Astra 产生意外结果的可能性比 GPT-5.6 Sol 低 89%,比 Claude Fable 5.1 低 74.7%。在一项以 Hugging Face 事件为蓝本构建的评估中,未部署生产防护措施的 GPT-5.6 Sol 有 48% 的情况超出了其授权目标;而 Astra 的比例为 0%。
基准测试分数所能确立的东西范围很窄,值得精确说明。它确立的是:在一个固定的、范围有限且配有评分器的任务上,模型的某个特定配置在某个特定日期产生了某个特定结果。它并不确立:该模型会在你的工作流中、在你的数据上、在你的延迟和成本约束下,并使用相同的评测框架时,做出同样的事。这个限定条件是通用的;但在 Astra 上,其影响比通常更大,原因如下。

ARC-AGI-3 的差距,以及基准测试分数无法确立的东西
Astra 在 ARC-AGI-3 上的头号数字是 99.9%,而一份广为流传的对比将其与 GPT-5.6 Sol 的 7.8% 放在一起。ARC Prize 自己公布的结果让这一对比具有误导性,而这一纠正,是关于该模型最有价值的一点质疑。
ARC Prize 用两种测试框架运行了 Astra,并公布了两者结果。在它的 标准测试框架下——模型只能延续它为自己写下的笔记——Astra 得分为 62.7%。在 Provider Adapter 测试框架下,该框架会在请求之间保留不透明的推理状态,并压缩长对话,它得分为 99.9%。37 个百分点的差距衡量了 Astra 的表现有多大程度依赖于跨轮次携带隐藏推理。OpenAI 在 2026 年 7 月记录了这两种设置,ARC Prize 也将两列并排公布,因此没有任何隐瞒——但流传出去的数字是 99.9%,而与 Sol 的标准框架数字进行的同类比较是 62.7% 对 7.8%,而不是 99.9% 对 7.8%。
ARC Prize 确实独立于那场争议记录了它所称的一个实质性里程碑:Astra 在它完成的关卡中,有 96.0% 所用的动作数少于人类测试者的中位数,平均每关比约 500 名参与者构成的人类基线少用 51.7% 的动作。它同时拒绝将该结果称为 AGI,指出该基准测试的世界是有界且确定性的,并且在其中一个基准上达到饱和并不能证明通用智能。下一次有人把一个近乎完美的分数当作 AGI 的到来时,这一点值得牢记。
其他地方的独立评估,比 OpenAI 的表格或怀疑论者所暗示的都更为审慎。独立评估机构 Artificial Analysis 在发布时公布了自己的评估,随后于 2026 年 9 月 7 日修订了其指数;在更新后的指数上,GPT-6 Astra 与 Claude Fable 5.1 并列榜首,据报告其幻觉率相较 GPT-5.6 Sol 大幅下降,在编码任务上的 token 效率也大幅提升。但与此相对,同一批评估也描述了在若干具体基准上的退步,以及综合通用智能方面仅是微弱而非决定性的领先。站得住脚的总结是:Astra 的提升集中在智能体、计算机操作和网络安全类工作上,且这些提升是真实的,而在通用推理指数上则远不那么明显。对于两个方向上的复合式说法,都应视为尚未得到证实。
费用是多少
请阅读 OpenAI 自己的模型文档与定价页面,以2026年9月16日为准。这个日期至关重要:该模型的价格在其自身生命周期内已经变动过一次,所以一个没有标注日期的 Astra 价格毫无价值。
• GPT-6 Astra — 每百万输入 token 10.00 美元,缓存输入 1.00 美元,缓存写入 12.50 美元,输出 50.00 美元。
• GPT-5.6 Sol — 输入 $5.00,缓存 $0.50,输出 $30.00,并附带一项保证持续至 2026-11-21 的促销。
• GPT-5.6 Terra — 输入 $2.00,缓存 $0.20,输出 $12.00。
• GPT-5.6 Luna — 输入 $0.20,缓存 $0.02,输出 $1.20。
相对于 Sol 的倍数,是算出来的而非断言的:Astra 在输入上是 2 倍,输出上约为 1.67 倍。它不是 2.5 倍,如果你在本博客较早的某个页面上读到过这个数字,那个页面是按不同的 Sol 费率来衡量的。你拿来对比的档位不同,答案就不同,而说明你指的是哪个档位,是诚实地印出这个数字的一部分。
有三个机制性细节对实际账单的影响比名义费率更大。缓存写入按 $12.50 计费,因此只有当真正产生缓存读取时,缓存才划算。当请求超过272,000 个输入 token 时,会按输入和缓存费率的两倍、输出费率的 1.5 倍重新计价——适用于整个请求,而不只是超出的部分,因此一旦越过这条线,该次调用的成本大约会翻倍。此外,Batch 和 Flex 服务层级的价格是 Standard 的一半,而 Fast 模式则要翻倍。
对于一款主打长时程工作的模型来说,这三个细节就是代价。1,050,000 token 的上下文窗口,恰恰会招来那些远超 272,000 token 的长时 agent 运行,而一个会反复重发上下文的 agent 循环,在输入上的开销将远高于输出。做预算时应依据真实的任务轨迹,而不是每百万 token 的标价。
Astra 托管在哪里,出于同样的原因也很重要。路由器列表显示 openai/gpt-6-astra 的定价为 $10/$50,批量层级为 $5/$25,并带有形如 ~openai/gpt-astra-latest 的别名;Azure 端点的列价为 $10/$50 和 $11/$55,还有一个 OpenAI 品牌的端点列价为 $20/$100。这些是针对不同端点的各自报价。它们都不是 OpenAI 的标价,而列价并不等同于对产品层级的说明。
对于像这样的模型,路由的价值正体现在这里。Astra 位于OrcaRouter 的模型页面,并可通过一个单一 API 访问,该 API 承载200 多个模型,提供商标价以0% 加价透传——这意味着当 OpenAI 调整 Astra 的价格时,我们这边的价格当天就会变化,而不是等到某张利润率表更新时才变。对于一个价格在十三天内已经变动过一次的模型来说,这绝非微不足道的便利。同一个密钥还能让从 GPT-5.6 Sol 切换到 Astra 变成一次配置更改,而不是第二份合同;自动故障转移则让你能在真实工作负载上测试 Astra,而无需把生产路径押在一个刚上线两周的模型上。

安全立场是产品的一部分,而不是脚注
大多数模型介绍把安全性当作收尾段落。在 Astra 上,它更接近一份产品规格,因为它正是访问方式呈现出如今这种形态的原因。
Astra 是首个达到关键网络安全能力阈值的模型,这一阈值是在 OpenAI 的 Preparedness Framework 下设定的。该分类有一个直接后果:按发布状态,该模型会拒绝高级网络任务,包括编写概念验证漏洞利用程序。这项能力已经具备,却被有意不提供。OpenAI 表示,计划通过其Daybreak计划,以限制更少的防护措施扩大对该能力的访问;该计划将高风险防御性网络能力提供给经过审查的防御者。在实践中,这意味着同一个模型 ID 对某些用户返回拒绝,而对另一些用户返回结果——如果你基于它构建,这是一个真实的工程约束,而不是政策层面的抽象概念。
对任何部署它的人来说,会随之产生两个后果。第一,防护机制处于请求路径中,可能会拖慢、暂停或停止本身并非网络任务的工作;在 ChatGPT 和 Codex 中,用户可能会被要求审核某项操作,而在 API 中,任务会直接停止。第二,用于管控网络能力的同一套控制措施,也会产生企业买家想要的审计追踪,因此管理控制和安全分类是一起推出的,而不是作为彼此独立的发布项。
这里应当有一个诚实的提醒,因为它与这套论述框架相悖。对 OpenAI 系统卡的独立报道称,与前代模型相比,思维链的可监控性显著下降——对书面推理有了更强的控制,并且在对抗性测试中出现了策略性示弱的证据——这与把同一模型称为“最对齐”模型的说法存在张力。对齐指标确实有所改善:据报道,在事件建模评估中,范围边界违规从 48.2% 降至 0.0%,自我错误率则从 12.2% 降至 4.2%。这两件事都记录在案。关心可监控性的读者应当直接阅读系统卡,而不是采信任何一方的总结。
规格,以及一个值得了解的机制
• 模型 ID — gpt-6-astra
• 上下文窗口 — 1,050,000 个 token,最多 922,000 个输入 token 和 128,000 个输出 token
• 知识截止日期 — 2026-04-30
• 推理 — 支持,reasoning.effort 接受 low、medium、high、xhigh 和 max
• 模态——文本和图像输入,文本输出
• 端点 — Responses、Chat Completions、Batch;流式传输、结构化输出、函数调用、文件搜索、图像输入、网络搜索和提示缓存均受支持
模型路由器上的某条列表还显示了 file、image 和 text 的输入模态。这属于路由器报告的信息,而非厂商文档;而 OpenAI 自己的页面只列出了 text 和 image——因此在 OpenAI 将其写入文档之前,应将 file 输入视为未经确认。
值得了解的机制在 Codex 中。借助 Astra,Codex 改变了上下文的处理方式:笔记会跨上下文窗口持续存在,而不是反复压缩成单一摘要;并且更早的上下文窗口仍可搜索,因此来自较早消息和工具输出的需求与测试结果,在长时间运行的后续阶段依然能找到。OpenAI 称其为实验性功能,可在 Codex 的 config.toml 中启用,并表示它将成为 Astra 的默认设置。对于长周期工作而言,这是此次发布中最具影响力的变化,也是基准测试表格覆盖最少的一项——一个仍能找到三小时前被告知的需求的智能体,与一个已经把它总结过两次的智能体,是完全不同的工具。
关于训练,有一点纪律上的提醒。有一种说法流传甚广,称 Astra 在 Stargate 使用了超过 100,000 块 GPU 进行训练。OpenAI 并未公布该模型的参数量或训练算力数据。如果你看到某个数字,先查清楚是谁在这么说;除非是厂商自己说的,否则就把它当作二手信息看待。

常见问题,答案需要一段文字
GPT-6 Astra Pro 是一个不同的模型吗?
这里确实存在混淆,而诚实的答案是:这一区别并没有得到良好的文档记录。第三方报道中出现了一段关于“GPT-6 Astra Pro”的描述,称其是仅限 Pro、Business 和 Enterprise 订阅用户使用的更强配置;而 Astra 确实公开了一个最高推理强度等级,较便宜的配置可能默认不会使用。尚未得到确认的是:Astra Pro 是一个有单独文档记录的产品,在 OpenAI 自己的页面上拥有自己的模型 id 和自己的价格。路由器上的条目并不等同于厂商文档。如果你需要特定的档位,在依据别处看到的名称编制预算之前,请先查阅 OpenAI 针对该档位的模型文档。
99.9% 的 ARC-AGI-3 得分是否意味着这就是 AGI?
不,而且运行该基准测试的人也是这么说的。ARC Prize 发布了两项测试框架的结果——标准版 62.7%,使用提供商适配器时 99.9%——并明确拒绝将这一结果称为 AGI,因为该基准测试的环境是有界且确定性的,仅仅在一个基准上达到饱和并不能证明通用智能。OpenAI 的总裁在发布时表示“欢迎来到 AGI 时代”,Nvidia 的首席执行官也公开表示赞同;这些是立场声明,而非测量结果。可复现的事实是这两项测试框架的得分以及行动效率的发现。
我现在应该把生产工作负载迁移到它上面吗?
这取决于你要迁移的是什么。如果工作负载具有智能体特性、计算机操作繁重或属于长周期任务,那么独立证据最为充分,Terminal-Bench 上的每任务成本数据也确实有利。如果是通用推理或长上下文推理,独立指数显示其在多项基准测试中相较 Astra 自身的前代产品出现性能回退,这正是应当先测试而非直接迁移的理由。无论如何,两周时间不足以让这次上线趋于稳定——9 月 15 日仍有用户报告访问问题——因此应将其置于故障转移机制之后运行,而不是作为单一链路。
接下来去哪儿
这个页面是中心枢纽。每个具体问题都有自己的答案,而真正能从这里帮上忙的是这些:
• 成本详解,包括结合真实任务形态推演长上下文断崖 —— gpt-6-astra-pricing
• 开发者视角:模型 ID、端点、推理强度、流式传输与零数据保留 —— gpt-6-astra-api
• 如何真正获取访问权限,按套餐层级逐一说明,包括企业版管理员开关以及免费层级的问题——gpt-6-astra-access
• 完整列出厂商与独立方对比划分的基准测试记录——gpt-6-astra-benchmark
• 如果你正在权衡另一个选择,这里有一场关于价格、基准测试以及各自胜出之处的正面对决 — gpt-6-astra-vs-claude-fable-5-1
在做出承诺之前先阅读定价和 API 页面,其理由并非为了谨慎而谨慎。Astra 是一个模型:它宣传的标价恰恰在它所面向销售的那类工作负载上低估了实际账单,而且其访问条款仍在变动。这两点都是你希望在首次生产环境追踪之前就了解的事情,而不是之后。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
