一个生成的双栏对比记分牌,标题为“GPT-6.1 Sol 对比 GPT-6 Astra —— 记分牌”。左栏“GPT-6.1 Sol”:各行内容为“智能指数:51.8(最高)”、“每个指数任务的成本:$0.72”、“输入:每 1M $2.00”、“缓存输入:每 1M $0.10”、“输出:每 1M $10.00”、“发布日期:2026 年 9 月 29 日”。右栏“GPT-6 Astra”:各行内容为“智能指数:52.7(最高)”、“每个指数任务的成本:$3.26”、“输入:每 1M $10.00”、“缓存输入:每 1M $1.00”、“输出:每 1M $50.00”、“发布日期:2026 年 9 月 3 日”。页脚内容为“指数数据来自 Artificial Analysis,Intelligence Index v4.3.2,读取于 2026 年 9 月 30 日;价格依据 OpenAI 公布的价目表。”
Guides & Insights

GPT-6.1 Sol 对比 GPT-6 Astra:指数领先一分,费率贵五倍

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

GPT-6.1 Sol 与 GPT-6 Astra同属一个家族的中端与旗舰型号,两者发布仅相隔四周——Sol 于 2026 年 9 月 29 日发布,Astra 于 2026 年 9 月 3 日发布——而直到本周,它们之间的对比还完全建立在 OpenAI 自家公布的数据之上。如今情况已不再如此。Artificial Analysis 已在同一指数版本上以最高推理强度对两者进行了评估,结果是 Astra 以 0.84 分的优势领先,而与此同时,单次评估运行成本上却存在 4.5 倍的差距,这一优势属于 GPT-6.1 Sol。在价目表上,这一比例更为悬殊:Astra 的输入和输出价格是 GPT-6.1 Sol 的 5 倍,缓存输入价格则是 10 倍。本页要回答的问题是:这笔溢价究竟在哪些地方买到了看得见、指得出的东西,又在哪些地方仅仅是为一个名字所付的价钱。

两个模型是什么,以及委员会测量了什么

两者均为文本和图像输入、文本输出,具备 1,050,000 token 的上下文窗口和最多 128,000 个输出 token,并且都提供五档推理努力等级——low、medium、high、xhigh 和 max——同时取消了none设置,而 GPT-6 Sol 仍然接受该设置。两者都不支持微调。真正重要的差异正是价格表所说明的:Astra 是旗舰层级,GPT-6.1 Sol 是其下一层级的更新版,而 OpenAI 对这款较新模型的自身定位是“以更低成本,为复杂工作提供接近 Astra 的性能”。

Artificial Analysis 在其 Intelligence Index 上为该说法打分——在 v4.3.2 版本中进行十项评估,两个模型均使用同一版本——并记录它为每个模型所掌握的发布日期。它会在模型页面标题中标明的最高努力配置下对两者进行评估。接下来就是这一对比,以及该指数不会替你算的成本账。

• GPT-6.1 Sol — 于 2026-09-29 发布,在最高推理强度下智能指数 51.8,每百万 token 输入 $2.00 / 缓存 $0.10 / 缓存写入 $2.50 / 输出 $10.00。
• GPT-6 Astra — 于 2026-09-03 发布,在最高推理强度下智能指数 52.7,每百万 token 输入 $10.00 / 缓存 $1.00 / 缓存写入 $12.50 / 输出 $50.00。
• 两者 — 均不接受 none 推理强度;一旦输入超过 272,000 个 token,两者都会按输入和缓存费率的 2 倍、输出费率的 1.5 倍对整个请求重新计价。Astra 的长上下文档位为 $20.00 输入 / $2.00 缓存 / $75.00 输出;GPT-6.1 Sol 的为 $4.00 / $0.20 / $15.00。
• 两者 — 均通过 Responses API 支持网页搜索、文件搜索、图像生成、代码解释器、托管 shell、应用补丁、技能、计算机使用、MCP 和工具搜索。

0.84 个指数点,是评估账单的 4.5 倍

A screenshot of the Artificial Analysis model page for GPT-6.1 Sol at maximum reasoning effort, with a class-rank strip above the summary naming the model's Intelligence, Speed, Cost and Verbosity positions out of 221 models, a summary paragraph reporting an Intelligence Index score of 52 against a class median of 26, $2.00 per million input tokens and $10.00 per million output tokens, $0.72 per task to evaluate on the Intelligence Index, and 67 tokens per second against a class average of 74. A lower band on the same page states that Intelligence Index v4.3.2 incorporates ten evaluations and lists them.

两个数字并排显示在榜单上,它们共同构成了完整的论据。GPT-6 Astra 在最大努力下得分 52.7。GPT-6.1 Sol 在最大努力下得分 51.8。每个分数旁边,榜单还公布了运行其背后指数所需的成本:Astra 每项任务 3.26 美元,GPT-6.1 Sol 为 0.72 美元。若读成一句话——多花 4.5 倍的钱换 0.84 分——这是两家公司就这两款模型发布过的最具决策相关性的数字。

两个模型还发布了努力阶梯上每个点的分数,这使得比较可以在同等支出而非同等设置下进行:

• 最大努力 — GPT-6.1 Sol 每次运行 51.8 美元,每次 0.72 美元,而 GPT-6 Astra 为 52.7,每次 3.26 美元。
• 超高 — 51.0,0.39 美元 vs 52.4,2.31 美元。
• 高 — 50.2,0.32 美元 vs 50.9,1.73 美元。
• 中 — 47.8,0.21 美元 vs 49.6,1.54 美元。
• 低 — 42.1,0.13 美元 vs 45.8,0.82 美元。

A generated two-column scoreboard titled 'GPT-6.1 Sol vs GPT-6 Astra — the scoreboard', with both columns carrying the same six labels. Left column 'GPT-6.1 Sol': Intelligence Index (max) 51.8, cost per index task $0.72, input $2.00 per 1M, cached input $0.10 per 1M, output $10.00 per 1M, released September 29, 2026. Right column 'GPT-6 Astra': Intelligence Index (max) 52.7, cost per index task $3.26, input $10.00 per 1M, cached input $1.00 per 1M, output $50.00 per 1M, released September 3, 2026. A footer reads that index figures are per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026, and prices per OpenAI's published rate cards.

把各模型的档位横向排开,一个两家厂商都不做宣传的事实便浮出水面:Astra 自身从高档到最高档的差距是 1.8 个指数点,比 Astra 最高档与 GPT-6.1 Sol 最高档之间的整个差距还多出一倍有余。换句话说,选 Astra 而非 GPT-6.1 Sol 所买到的分数,还不如把 Astra 从高档调到最高档来得多——而这两者之中,后者的成本只是前者的一小部分。任何工作负载确实对这 1.8 个点敏感的人,都该先查投入档位设置,再去看模型那一列。

Astra 的高端溢价在哪里仍能换来价值

综合评分很接近;单项评估则不然。在最高强度下逐行评分时,GPT-6 Astra 在十项中占据六项优势,而它占据优势的那些项目,正是涉及行动而非回答的项目。

• AutomationBench-AA,跨工具的多步骤工作流——Astra 得 0.685,GPT-6.1 Sol 得 0.649。Astra 领先 3.6 分。
• Terminal-Bench 4.0,真实环境中的终端操作——0.591 对 0.561。Astra 领先 3.0 分。
• SciCode——0.565 对 0.542。Astra 领先 2.3 分。
• Humanity's Last Exam——0.547 对 0.529。Astra 领先 1.8 分。
• AA-Omniscience——43.4 对 41.5,并且在同一个测试集上,Astra 的幻觉率为 0.513,而 GPT-6.1 Sol 为 0.543。Astra 既更准确,也更愿意承认自己不知道。
• AA-Briefcase v1.1,专业交付成果——Elo 1568.9 对 1564.2。Astra 领先 4.7。

这种模式足够一致,可以据此规划:当任务要求模型理清一长串动作——操作终端、运行多工具工作流、产出文档形式的交付物——Astra 的优势是真实存在的,并且在不同测试框架中都可持续复现。而当任务是一轮就能回答的知识性问题时,这一优势基本上就消失了。

更便宜的模型胜出之处,包括缓存行

GPT-6.1 Sol 并不是一个在各方面都略逊于 Astra 的模型。在那些看重长文本阅读与推理能力的评测中,它处于领先;而在价目表上,它领先的幅度更是那项指数从未体现出来的。

GDPval-AA,以专家产出评定的专业工作——GPT-6.1 Sol 的 Elo 为 1575.1,Astra 为 1541.9。成本仅为其五分之一的模型领先 33 分,这是该行中唯一一项独立的胜出。
• AA-LCR v1.1,长上下文——0.830 对 0.807。GPT-6.1 Sol 领先。
• GDP.pdf——以 0.310 打成平手,Crit 同样以 0.317 持平。
• 缓存输入——每百万 token 为 0.10 美元,而 Astra 为 1.00 美元。这正是决定智能体经济学的一行,却完全没有出现在其中。
• 输出速度——在同一评测中为每秒 66.8 个 token,而对手为每秒 56.8 个,输出的 token 用量为 6720 万,而 Astra 为 6000 万。两个模型都不快;GPT-6.1 Sol 是两者中更快的那个。

一个座席月,按两张费率卡定价

假设有一个会重新发送稳定前缀的工作负载:每月 4000 万输入 token,其中 85% 由缓存提供,外加 400 万输出 token。按 GPT-6.1 Sol 的价目表,缓存读取为 $3.40,未缓存输入为 $12.00,输出为 $40.00——$55.40每月。按 GPT-6 Astra 的计价,同样的流量缓存读取为 $34.00,未缓存输入为 $60.00,输出为 $200.00——$294.00。工作负载完全相同;账单却是 5.3 倍。

有两个阈值会改变这笔账,而且两者都值得在迁移决策之前而非之后进行成本测算。第一个是单次请求中的 272,000 个输入 token:一旦超过,整个请求的输入和缓存费率都会按两倍重新计价,输出费率按 1.5 倍计价,这会使 GPT-6.1 Sol 变为 $4.00 / $0.20 / $15.00,Astra 变为 $20.00 / $2.00 / $75.00。第二个是 effort 阶梯本身——将 GPT-6.1 Sol 从 max 降到 xhigh,可将其 index-run 成本从 $0.72 降到 $0.39,代价是 0.8 分;将 Astra 从 max 降到 high,可将 $3.26 降到 $1.73,代价是 1.8 分。在缓存密集型的 agent 循环中,effort 设置是比模型列更大的成本杠杆,这与这两个模型通常的比较方式正好相反。

运行哪一个,以及你实际能调用什么

从证据来看,这种分工比营销宣传所暗示的更清晰。把那些必须经得起一长串动作考验的工作——终端会话、工具密集型的自动化、一旦出现幻觉段落就代价高昂的文档交付物——交给 GPT-6 Astra,并考虑以 high 而非 max 档运行,除非你已实测确认多出来的 1.8 分确实落在你的任务上。把一切知识密集、缓存密集或以前读为主的工作交给 GPT-6.1 Sol:它在专业工作评分上更强,在长上下文推理上更强,速度更快,而且在真正占据账单大头的那些项目上便宜五到十倍。

A screenshot of the OrcaRouter model catalogue filtered to the query gpt-6, headed '3 models - 1 providers - one API key, one bill', showing three OpenAI cards side by side: openai/gpt-6-luna described as the fast, cost-efficient model in the GPT-6 series, openai/gpt-6-sol described as the cost-efficient high-end model positioned below the flagship, and openai/gpt-6-astra described as the flagship for demanding long-horizon work. Each card carries vision, tools and reasoning tags and a base-rate block; the GPT-6 Astra card reads $10.00 input, $50.00 output, $1.00 cache read and $12.50 cache write per million tokens.

今天你能调用到的,才是实话实说的部分。Orca 按 OpenAI 自己的目录价提供 GPT-6 Astra——输入 $10.00、输出 $50.00、缓存读取 $1.00 和 $12.50,272K 重新计价规则也完全按厂商公布的方式原样传递——同时还提供 GPT-6 Sol 和 GPT-6 Luna。它不提供 GPT-6.1 Sol:公开目录针对以下模型返回“model not found”:openai/gpt-6.1-sol,而我们不会去描述一个我们无法路由的模型。因为提供商目录价是原样传递、不额外加价的,所以等到那天该模型上线时,它在我们这边就是 OpenAI 的价格,无需重新计价步骤;今天这场对比中可用的那一半是旗舰模型,只需一个 API 密钥,同时路由 DSL也可用:如果你想将便宜模型和昂贵模型组合成单次调用,而不是每个请求都在两者之间做选择。

唯一需要留意的是这个对比所缺失的那一行。无论是厂商数字还是独立指数,都无法告诉你你自己的流量在这两个档位上会有何表现,而找出答案的唯一廉价方法,就是把同一组任务分别跑过两者,并让故障转移占据主导。当两半都可调用时,这就是一个一键实验;在它们都可调用之前,这只是一个半实验。