OpenAI Astra-1
Guides & Insights

OpenAI Astra:我们所知的关于这款非GPT-6模型的一切

作者

Jim Song

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

你今天能下载的东西并不是一个模型。它是十个Lean代码文件。2026年8月1日,OpenAI发布了一篇关于数学的研究文章,其中还首次确认了其下一个前沿系统的名称:Astra。没有模型卡,没有定价页面,没有API端点,也没有日期。你目前真正可以调用的旗舰模型仍然是GPT-5.6 Sol,每百万输入token收费5美元,每百万输出token收费30美元,自7月9日以来一直如此。

如果你搜索过GPT-6,以下是简短版本:OpenAI从未宣布过以该名称命名的模型,而且截至目前,它尚未决定Astra是会以GPT-6的名义推出,还是作为GPT-5的次版本(如GPT-5.7)推出,或是作为与Sol、Terra和Luna并列的第四层级推出。这种命名上的模糊性并非对媒体的回避,而是一个内部悬而未决的问题,据The Information于7月31日报道,此后一直未得到解决。

下文将区分大多数相关报道混为一谈的三件事:OpenAI 自己公开说明了什么,可信报道补充了什么,以及在没有任何来源的情况下流传着什么。这些证据是你可以编译的真实产物。十万亿参数这个数字只是某人在网上输入的一个数字。它们理应被赋予截然不同的权重。

OpenAI 实际说了什么——以及它没说的更长清单

这一公告并非以产品发布的形式出现,而是以论文的形式出现。OpenAI的帖子描述了由“我们下一代主要模型的内部版本Astra”所产生的结果,涵盖了一些在其表述中至少十年来在主要结果上毫无进展的问题。Astra被描述为一个为长期运行而构建的系统:多个智能体在较长时间内协同处理一个大问题的不同部分,而非一次性作答。

那几乎就是全部官方技术描述。与之相比,缺失之处令人瞩目:

OpenAI 已确认 — 名称为 Astra;它是“下一代主要模型”;内部版本产生了十项结果;多智能体、长时程的设计意图;一份 249 页的手稿;公共仓库上的 Lean 4 证书;以及按 GPT-5.6 Sol 费率报价的 token 成本估算。

OpenAI未说明——发布日期;价格;上下文窗口;参数数量;任何基准测试分数;模型卡;是否上线ChatGPT或仅限API;运行了多少个智能体、运行了多长时间、使用了什么硬件;提示词;成功率;最终产品名称。

可信的报道补充了一些细节。The Information报道称,萨姆·奥尔特曼于七月下旬在华盛顿向政策制定者演示了Astra——据该报道,这场简报会的参与者包括参议员拉斐尔·沃诺克、伯尼·莫雷诺和马克·华纳,财政部长斯科特·贝森特和商务部长霍华德·卢特尼克也在场。该模型系列据称已在测试中,而"Astra"本身仍是一个暂定名称。

OpenAI以外没有人曾在任何东西上运行过这个模型。所有流传的能力声明要么追溯到十份已发布的证明,要么追溯到一场公众未曾见过的演示。

十个证明:异常可核查,却仍未定论

OpenAI Astra-2

这正是该公告真正强于普通基准测试发布的地方,值得准确说明原因。OpenAI 并没有发布一个分数并请求人们相信。它在 openai/ten-proofs 仓库中以 Apache 2.0 许可发布了可机器检查的工件——每个结果对应一个 Lean 文件,固定使用 Lean 4.32.0 并依赖 mathlib,同时还附带一个 ComparatorChallenges 目录,供独立检查使用。该仓库于 8 月 1 日以单个提交的形式上线,此后已获得数百个星标和数十个分叉。

按照仓库的命名,这十项结果涵盖了异常广泛的领域:

群论——构造了一个非sofic群,对一个自1999年以来悬而未决的问题给出了否定答案。sofic性是数学家们研究的几乎所有群都满足的性质;是否每一个可数离散群都必须满足该性质,这个问题已悬置了27年。

算子代数——一个涉及Connes刚性猜想的反例,该猜想由菲尔兹奖得主Alain Connes于1980年提出。

高维几何——对球堆积方法的一项改进,据报道是自1978年以来的首次——以及Ehrhart体积不等式的一个精确形式。

编码理论 — 二元码和球面码的新界。

复杂度——积和式的算术电路下界,以及纠缠博弈的指数级并行重复结果。

格密码学——最近向量问题的固定多项式难度。

极值组合学——多色三角形拉姆齐数的增长尺度,以及极值图论中的反例,包括对若干已编目的埃尔德什问题的工作。

数学家们的反应是感兴趣,而非不屑一顾。维护厄尔多什问题数据库的托马斯·布鲁姆称这些结果为重大新闻,并将其评级高于五月份的单位距离猜想反例。OpenAI的诺姆·布朗从内部给出了有益的降温:"可惜,(目前)还没有千禧年大奖难题。"

Lean 证书确定了什么,又留下了什么开放问题

一个通过类型检查的 Lean 证明在构造上就是有效的。你不必信任 OpenAI 的评估方法、其对基线的选择,或它对自己结果的解读——你可以编译这些文件。对于一个以“我们得了94.1%”作为标准证据单位的行业来说,这在可证伪性上是一次有意义的升级。

它也比头条新闻所暗示的范围更窄,具体体现在四个方面。Lean 会检查形式化命题的证明是否可靠。它不会检查形式化命题是否就是文章文字所声称的定理。它不会检查编码后的定义是否与领域内这些词汇所指的含义一致。它不会检查连接形式化端点与头条结果之间的非形式化归约。而且它对新颖性只字未提——即结果是否是新提出的,或者是否以不同名称已知。

这四个问题全都属于人为判断问题,而且截至公告发布时,没有一个经过同行评审。手稿中承认咨询了专家,但致谢并不等于认可每一项主张。已发布的一个存储库部分构建编译了9,007个任务中的8,820个,这看起来更像大型真实形式化项目在验证中途的状态,而非一份已完成的审计。诚实地讲,当下的状态是十个严肃且已形式化编码的研究主张——而不是数学经典中十个已定论的条目。

还有第二个更隐蔽的限制:发现过程无法被OpenAI之外的任何人复现。证明是公开的;但搜索系统、提示词、检查点和执行环境并非如此。你可以验证目的地,却无法重走这段旅程。

2000美元这个数字,以及为什么它的购买力比听起来要低

OpenAI Astra-3

流传最广的数字是成本。按GPT-5.6 Sol费率计算,OpenAI将十个解决方案背后的token花费定为约2,000美元——按其措辞最常见的解读,每个十年前的老问题约200美元。一些报道将同一句话解读为低于2,000美元个问题,相差十倍;OpenAI的帖子内容简短,两种解读都见诸报端,我们尚未看到该公司澄清这一点。

按总读取量来算。Sol 的收费是每百万输入 token 5 美元、每百万输出 token 30 美元,推理 token 按输出计费。如果这笔开销全部是输出,2,000 美元最多能买约 6,700 万输出 token——每个问题约 670 万。这是大量的思考,但并非荒唐的思考量。这是资金雄厚的研究团队在单个难题上本就可以投入的那种预算。

三个注意事项比标题更重要:

这是一个反事实价格,而非实际价格。Astra尚未发布,也没有定价。这2000美元描述的是那些代币按另一模型费率计算的成本。一个为长达数小时的多智能体运行而构建的前沿系统,没有理由定价与Sol相当,却完全有理由定价高于它。

它只统计成功的案例。没有公布成功率。我们不知道Astra被指派去解决多少问题却未能破解,也不清楚这些尝试的代价。在没有成功率的情况下发布的每次成功成本,并不是真正意义上的每次结果成本,两者之间的差距可能高达一个数量级,且方向难以预料。

代币是其中最便宜的部分。人类构思了问题、准备了手稿并推动了形式化。这些劳动并不包含在那2,000美元中。

你今天能定价的唯一部分就是基准价格。因为OrcaRouter以0%加价直接传递提供商的列表价格,所以GPT-5.6 Sol在我们API上的价格与在OpenAI上的价格相同,都是$5/$30——如果你想根据自己的工作负载核对一下这算术,公告中的费率就是你实际需要支付的费率。目前还没有人能对Astra本身定价,任何跟你说能定价的供应商都是在猜测。

发布日期由30天的倒计时决定,而非由泄露决定。

OpenAI Astra-4

关于“GPT-6何时推出”的大部分报道都只是流言式的推算。有一个更实际的制约条件就明摆在眼前,却几乎没人把它和这个问题联系起来。

2026年6月2日签署的一项行政命令指示联邦机构建立自愿审查程序,前沿开发者需在公开发布前最多30天将模型提交政府审查。该框架原定于8月1日正式生效——同一天,Astra的帖子发布。报道称,Astra预计将成为首个通过该审查的模型。

“Voluntary”在该句中承担着某层含义。事实上,政府此前已经在发布时间上施加过压力,而OpenAI自身近期的行为看起来就像一场预演:GPT-5.6在6月26日至7月9日全面开放之前,仅限约二十家经过审查的组织使用——这是一次约两周的分阶段发布。

把这两个事实叠加起来,你得到的只是一个粗略的下限,而非预测。如果Astra经历30天的发布前审查,然后重复GPT-5.6的模式,广泛可用性大约在提交后六周实现。而提交日期恰恰是我们所不知道的。这就是为什么对八月日期的笃定预期应被打折扣:门控步骤是一个有公布时长的流程,而时钟尚未明显开始计时。

预测市场已经精确地朝那个方向漂移。截至2026年8月5日,Polymarket 的“GPT-6 发布”阶梯市场显示:8月7日为1%,8月14日为3%,8月21日为13%,8月31日为25%,9月30日为68%,12月31日为89%,交易量接近一百万美元。应将其视为人群的集体猜测,而非权威来源——但请注意,人群已将重心转向第四季度。

回顾过往记录也有帮助。过去十二个月里,每一次“GPT-6下周发布”的说法都被证明是错误的。一则未经证实的消息称发布日期为2026年4月14日;但实际上,九天之后发布的却是GPT-5.5

传闻,分级

按各项实际承担的分量排序:

命名尚未确定(GPT-6 / GPT-5.7 / 一个独立的类别)。消息来源为 The Information。这是本报道中最可靠的非 OpenAI 说法,也是理应重置预期的那一条——通过数学论文发布的系统很可能根本不会被冠以“代际飞跃”的称号。

在Design Arena中发现了代号“Zinc”和“Magnesium”的条目。社区目击,据称条目已被禁用,OpenAI尚未确认。可以解读为:GPT-5.x的次版本更新很可能先于Astra发布,这既无法满足任何人对GPT-6的期待,又会占据新闻周期。

规模约为 GPT-5.6 Sol 的 2 倍;定价接近 GPT-5.6 的水平。 流传中的传闻。其背后的爆料人承认没有测试过该模型。听起来可信,但完全未经证实。

一个 150 万 token 的上下文窗口。它出现在泄露汇总中,但没有具名的消息来源。值得注意的是,Sol 已支持 1,050,000 个 token,所以这只是增量,而非飞跃——这也是对其作为头条“泄露”消息持怀疑态度的原因。

大约10万亿参数。我们无法追查到任何出处。这是整个故事中被重复最多却最缺乏依据的数字。

记忆与个性化作为核心发展方向。 基于阿尔特曼在2025年8月一次采访中的公开言论——真实,但已有一年之久,且是关于后GPT-5时代的总体方向,并非专门针对Astra。

从现在到发货之前,实际该做什么

错误的做法是围绕一个尚未发布的模型重新架构。正确的做法是留意长视野、多智能体系统会改变你的哪些问题,因为无论 OpenAI 发布什么,这些才是你技术栈中目前建设不足的部分。

其中三个现在值得针对 GPT-5.6 Sol 构建:

成本上限按任务设置,而非按调用设置。如果单个任务可能运行数小时并消耗六七百万个输出令牌,按请求设置的限制将不再能保护你。你需要一个由整个任务继承的预算,以及一个硬性停止机制。

检查点与可恢复性。一次性调用要么返回结果,要么失败。一个运行数小时的智能体任务,若在第 90 分钟崩溃且未写入任何持久化数据,便是一种大多数代码库从未需要处理的高代价失败。

在没有参考答案的问题上,你信赖的评估。这十个证明之所以有趣,部分原因在于 Lean 提供了一个预言机。而在实际生产中,几乎没有什么能做到这一点。如果你无法分辨一次良好的六小时运行与一次看似合理的糟糕运行,那么更多的算力也帮不了你。

关于切换问题:Astra在OrcaRouter上不可用,因为它目前在哪里都不可用。我们能说的是,版本更迭问题在我们这边已经基本解决。一个密钥就能调用200多个模型,所以无论它以GPT-6、GPT-5.7还是第四个GPT-5.6层级的形式发布,采用它都只是更换模型字符串,而不是一次迁移——不需要第二份合同,也不需要新的SDK。具体到未经证实的前沿模型,自动故障转移决定了你是在真实负载中评估它,还是把生产路径押注在一个除了实验室没人做过压力测试的系统上。你分流一部分流量给它,让Sol在底层作为兜底,然后看看效果。

值得回答的问题

Astra 和 GPT-6 是一样的东西吗?

不一定,而这正是这个故事中影响最深远的一个未知数。OpenAI 已确认 Astra 是其下一代重要模型,但尚未决定其发布名称;相关报道称,GPT-6、GPT-5.7 以及一个独立类别与 Sol、Terra 和 Luna 一同被列入候选方案。名为 GPT-6 的模型完全有可能永远不会出现,而人们期待已久的能力飞跃,可能会以一个无人关注的名字到来。

我今天能以任何形式访问Astra吗?

不——ChatGPT 里没有,API 里没有,任何路由服务或经销商那里也没有。公开存在的只有论文、推理演练和 Lean 仓库。如果有服务声称提供 Astra 访问,那要么是在转售别的东西,要么就是在撒谎。目前这个发布唯一真正有用的做法,就是自己去编译验证这些证明。

Astra 真的解决了人类数学家无法解决的问题吗?

它产生了对至少十年悬而未决的陈述的形式化验证证明,这是一个真实且不寻常的成果——而且其验证水平高于行业标准。但“经 Lean 检查”不等于“经同行评审”,而每个形式化陈述是否准确对应标题问题这一框架性问题,恰恰是 Lean 无法回答的部分。阅读过手稿的专家们评价积极;但其中没有任何一项经过同行评审。预计评估将在未来几个月内逐渐明朗,无论方向如何。

2000美元这个数字是否意味着前沿研究现在变得便宜了?

也就是说,获胜的 token 运行成本很低,按另一个模型的价格计算,还不包括失败的部分和人工的部分。这三项排除项每一项都可能规模很大。实事求是的解读是:成功自动化证明搜索的边际成本已经降到足够令人关注的程度,而不是说十个开放问题现在只值一台笔记本电脑的价格。

什么才能真正解决这件事

三件具体的事情,没有一件是谣言,而且所有这些事情在发生时都可以核实。

一张模型卡和一个定价页面。那一刻,Astra不再是一个研究产物,而是变成了你可以据以规划的东西——同时也是命名问题迎刃而解的时刻。

由专家对Lean仓库进行独立重建,他们审计定义和非形式化归约,而不仅仅是类型检查。ComparatorChallenges目录表明OpenAI期待这一点。如果形式化陈述经得起这种审查,其结果就更难被否定;如果十个中哪怕一个出现不匹配,整套声明都会被重新审阅。

联邦审查计时已开始的证据。在30天的预发布窗口期内,该提交是发售日期最早且最可靠的信号——远比竞技场排行榜上下一个被禁用条目的截图更具信息量。

在那之前,准确的说法范围很窄,但值得坚持:OpenAI的下一款旗舰产品有一个名字、十项机器可验证的证明、一场华盛顿演示,仅此而已。任何给你日期的人都是在猜测,任何给你参数数量的人都是在胡编。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube