
GPT-6 Sol Pro 对比 GPT-6 Astra:大家引用的价格倍数都是错的
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
GPT-6 Sol Pro 和 GPT-6 Astra 是同一家厂商的廉价档位与旗舰产品,而多数报道为这一差距所附上的倍数是 2.5×。它并不是 2.5×。GPT-6 Sol——也就是 gpt-6-sol-pro 配置所运行的该厂商模型,自 2026 年 9 月 22 日起全面可用,价格为每百万输入 token 2.00 美元、每百万输出 token 10.00 美元——其定价对标的是 GPT-6 Astra;后者是于 2026 年 9 月 3 日全面可用的旗舰产品,价格为 10.00 美元和 50.00 美元。这意味着输入上是五倍,输出上也是五倍。2.5× 这个数字属于另一组比较:Astra 相对于上一代 GPT-5.6 Sol,后者价格为 4.00 美元和 20.00 美元。
这个混淆值得首先纠正,因为它会改变决策。旗舰型号 2.5 倍的溢价在项目预算中不过是舍入误差。而 5 倍的溢价则是大多数推理方案中最大的一笔单项支出,也正是这个数字决定了旗舰型号是默认选项还是例外情况。
错误的倍数从何而来
Astra 于 9 月 3 日发布时,OpenAI 和大多数媒体拿来做比较的对象是 GPT-5.6 Sol,后者是当时在售的中端型号。Astra 的价格是那款型号的 2.5 倍。十九天后,OpenAI 推出了 GPT-6 Sol,并将中端价格减半,从 4.00 美元和 20.00 美元降至 2.00 美元和 10.00 美元,并表示新价格是永久性的,而非促销价。关于这一对比,搜索结果顶部中的每个“vs”页面都写于那十九天的窗口期内,并且将 Astra 与那款已不再占据该位置的型号进行比较。
Astra本身没有任何变化。变的是它下面那一档,而且倍数翻了一倍。
两份费率卡,逐行
两者都是 OpenAI 自己公布的数据,由托管它们的平台原样传递。
• 输入 — GPT-6 Sol 每百万 token 2.00 美元,对比 GPT-6 Astra 每百万 token 10.00 美元
• 输出 — GPT-6 Sol 每百万个token 10.00 美元,对比 GPT-6 Astra 每百万个token 50.00 美元
• 缓存输入 — GPT-6 Sol 每百万 token $0.20,而 GPT-6 Astra 每百万 token $1.00;两者均为未缓存费率的固定 10%
• 缓存写入 — GPT-6 Sol 每百万个 token $2.50,对比 GPT-6 Astra 每百万个 token $12.50,两者均为未缓存输入费率的 1.25 倍
• 长上下文处理 — 当请求超过其输入阈值时,GPT-6 Sol 会对整个请求重新定价,按输入和缓存费率的 2 倍、输出费率的 1.5 倍计费;GPT-6 Astra 在输入 token 超过 272,000 时也同样如此,价格为 $20.00、$2.00、$25.00 和 $75.00
• 批量 — GPT-6 Sol 按标准费率的一半,而 GPT-6 Astra 按其标准费率的一半,分别为 $5.00 和 $25.00,这精确保持了 5× 的比例
• 上下文窗口 — 两者均为 1,050,000 个 token
• 最大输出 — 两者均为 128,000 个 token
• 输入模态——两者均支持文本和图像,GPT-6 Astra 还接受文件输入
• 知识截止日期 — GPT-6 Sol 为 2026 年 4 月 20 日,而 GPT-6 Astra 为 2026 年 4 月 30 日,两者相差十天
这两张卡片不仅在结构上相似;它们其实是同一种结构,只是每一行都应用了五倍乘数,包括批处理层级和长上下文层级。这是有意为之的产品设计,意味着在两者之间做选择真正是一项能力决策,而不是定价策略决策。改变你的请求形态并不能找到任何折扣。

努力调节器是无人提及的不对称性
两个模型都提供了推理强度参数。这两个阶梯并不完全相同,而这一差异会对迁移产生影响。
GPT-6 Sol 文档中列出的集合为 none、low、medium、high、xhigh 和 max,默认值为 medium。GPT-6 Astra 的集合为 low、medium、high、xhigh 和 max——没有 none。你无法在旗舰模型上关闭推理。如果你的流水线中有一个对延迟敏感的分类步骤当前以 effort none 运行,那么该步骤无法原样迁移到 Astra;它必须重新调优、迁移到另一个模型,或者接受更高的延迟下限。
这是一件小事,却会消耗大量工程时间,而且在关于这一对比的每个比较页面上都看不到,因为这些页面是依据价格表而不是 API 文档编写的。
独立的数值,附带索引版本
Artificial Analysis 在 2026 年已多次重新调整其 Intelligence Index,而这一对比正是影响最大的地方,因为被重复引用最多的 Astra 分数已被弃用。
Astra 在发布时于索引版本 v4.1.1 上得分为 61 分——与 GPT-5.6 Sol 并列,这正是为什么如此多的发布报道将这款旗舰模型描述为只是小幅进步。那个 61 分是真实的,但它来自一个已不复存在的索引。在当前榜单上,Astra 在最高强度下得分为 53,每个索引任务成本 3.26 美元;在高强度下得分为 51,成本 1.73 美元。GPT-6 Sol 在最高强度下得分为 48,每个索引任务成本 1.06 美元;在高强度下得分为 43,成本 0.37 美元。
把这四行放在一起读,决策的轮廓便显现出来。
• 在两个刻度盘的顶端,Astra 相对 Sol 的优势为五个指数点,而每完成一项任务的成本约为其三倍。
• Astra 在高强度下每项任务花费 1.73 美元。Sol 在最高强度下花费 1.06 美元。旗舰模型在默认强度设置下运行,比全速运行的廉价层级更贵,而指数得分分别为 51 和 48。
• 每项任务的成本差距——大约 3 倍——小于 5 倍的费率差距,因为 Sol 是两者中每项任务更耗 token 的那一个。这是 Astra 的一个实实在在的优势,也是“2.5 倍”这一说法中唯一经得起数据检验的部分。
有两点关于诚实性的说明需要一并附上。这些是同一索引系列中的不同页面,而非一次已发布的正面直接对比测试;而且 Astra 自身的延迟数据对努力程度的依赖之大,使得任何单一数字都具误导性——同一模型在某一努力等级下报告的首 token 时间为数十秒,在另一等级下则为数分钟。引用 Astra 的延迟数据时,必须注明其设置。
旗舰机型在5倍价格下能买到什么
这些能力差异是真实存在的,而且集中在智能体和多模态工作上,而非通用推理。
• 编码智能体指数 — GPT-6 Astra 在 Codex 评测框架中得 62 分,对阵 GPT-6 Sol 的 57 分,每任务成本分别为 $7.09 和 $2.99。旗舰模型每任务消耗的 token 量约为三分之一,这正是每任务成本差距小于费率差距的原因。
• Terminal-Bench 4.0 —— 在同一个独立榜单上,Astra 为 59%,Sol 为 43%,十六个百分点的差距是两者之间最大的单项能力差距。
• 供应商报告的智能体评测项——OpenAI 自家的发布表格显示,Astra 在 OSWorld 2.0、ScreenSpot-Pro、AutomationBench 和 Agents' Last Exam 上领先,这些全部由供应商运行,且无一经过独立复现。它还显示 Sol 在 FrontierMath T1–3 和 BrowseComp 上领先,对于任何倾向于把供应商表格解读为全面横扫的人来说,这一点值得注意。
• 安全态势——Astra 是 OpenAI 首个在公司 Preparedness Framework 下被指定为关键网络安全级别的模型,其先进的攻击性网络能力被限制在单独的访问计划之后。这种限制除了权限之外,还会带来生产环境后果:失准监控器会在使用工具的请求上运行,而在 API 中,被标记的任务会停止,而不是像在消费者客户端中那样暂停等待审查。

简而言之,Astra 在那些难以替代的事情上更强——长程智能体循环、终端操作、计算机使用——而在那些容易替代的事情上,则与 Sol 大致持平。通用推理上五个指数点,不值得付出 5 倍的代价。而 Terminal-Bench 上十六个点、编码智能体上五个点的差距,放在一次失败运行就要让人花一小时收拾残局的工作上,有时就值得。
路由层改变算术之处
GPT-6 Astra 已上架OrcaRouter 目录,在 272,000 token 输入阈值以下,输入为每百万 token 10.00 美元、输出为 50.00 美元;超过该阈值则适用长上下文档位,输入 20.00 美元、输出 75.00 美元;上下文窗口为 1,050,000 token,输出上限为 128,000 token,p50 首 token 时间为 7.82 秒(基于我们自家模型页面的实测数据)。供应商目录价原样透传,不在此基础上加价。
GPT-6 Sol 不是我们提供的渠道之一,因此这里没有任何关于通过我们获取其价格的声明。

5 倍的价格比,是支持"路由"而非"二选一"的最清楚的理由。对大多数团队来说,正确答案不是"旗舰款"或"廉价档位",而是两者都要,并且这个决定是按每次请求做出的,而不是按季度。需要 Astra 的工作在调用点就能识别出来:那是智能体运行、终端任务、计算机使用步骤。不需要它的则是其余一切。把两者放在同一个密钥后面,并配合自动故障转移,就能让这件事变成一条路由规则,而不是一次迁移;这也意味着昂贵的模型只在真正为其付费的地方才会被调用。
决策规则
• 大批量文本生成、提取、分类与摘要——GPT-6 Sol。在每一行上都便宜五倍,在通用推理上落后三个指数点,却是正确的默认之选。
• 智能体编码、终端操作与计算机使用——GPT-6 Astra。在 Terminal-Bench 上拿下十六分,在编程智能体指数上拿下五分,而这类工作一旦失败,代价要以人工小时来计算。
• 目前以推理努力 none 运行某个步骤的流水线——两者皆非,且无需重新调优。Astra 没有 none 设置,该步骤无法原样移植。
• 需要同时输入文件和图像的工作——GPT-6 Astra,它是这两者中唯一接受文件的。
• 任何读到旗舰产品是 2.5 倍溢价的人——请按 5 倍重新算一遍。同样的型号,同样的价格;它下面的档位变了,而在更正后的数字下,决策会不同。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
