标题卡上写着 GPT-6 Astra 对阵 Solar Pro 4,副标题为"十二个指数点、一侧 512K 窗口,以及一个周日就会变化的价格比",背景是一幅生成的插画:两台发光的立方体机器,脚边各挂着价签
Guides & Insights

GPT-6 Astra 对比 Solar Pro 4:十二个指数点,以及一个周日就会变化的价格比

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

在这对模型共同参与的两项独立开展的评测中,GPT-6 Astra在通用知识上大幅领先Solar Pro 4,而在模型实际被使用的场景中领先幅度较小。Artificial Analysis 在其 Intelligence Index 上给 GPT-6 Astra 打出 54.7 分,在 GPQA Diamond 上打出 96.1 分;同一评测方给 Solar Pro 4 打出 42 分和 86.8 分。在智能体任务上,差距在 Terminal-Bench 2.1 和 τ²-Banking 上分别缩小到 11 分和 6 分。与此同时,价格方面还有一个几乎没人注意到的截止日期:Solar Pro 4 当前的促销活动将于 00:00 UTC 结束,日期为 2026 年 10 月 11 日星期日,届时该模型将从每百万输入 token 0.09 美元升至 0.15 美元,并从每百万输出 token 0.36 美元升至 0.60 美元。因此,这次比较必须回答的问题不是哪个模型更好,而是大约 12.5 个点的能力差距是否足以证明 42 到 139 倍的输出费率合理;而这个答案取决于你的工作负载,而不是任一模型。

费率卡,包括本周末将变动的那一张

Solar Pro 4 的标价为每百万 token 输入 0.30 美元、缓存输入 0.06 美元、输出 1.20 美元,而 Upstage 自发布以来一直以低于标价的价格运行。Upstage 自家定价页面上的价目表明确,因此无需猜测该以哪个数字来编制预算:

• Upstage 促销价,有效期至 2026 年 10 月 11 日 00:00 UTC —— 每 100 万 tokens 输入 $0.09、缓存 $0.018、输出 $0.36br /> • Upstage 促销价,自 2026 年 10 月 11 日起 —— 每 100 万 tokens 输入 $0.15、缓存 $0.03、输出 $0.60,未列出结束日期,这意味着须按此预留预算br /> • Upstage 标价 —— 每 100 万 tokens 输入 $0.30、缓存 $0.06、输出 $1.20br /> • GPT-6 Astra 输入 tokens 不超过 272,000 时 —— 每 100 万 tokens 输入 $10.00、缓存 $1.00、缓存写入 $12.50、输出 $50.00br /> • GPT-6 Astra 输入 tokens 超过 272,000 时 —— 每 100 万 tokens 输入 $20.00、缓存 $2.00、缓存写入 $25.00、输出 $75.00,一旦越过该阈值,即适用于整个请求

按比值来看,按 Solar Pro 4 促销后的费率计算,输入为 11 倍、输出为 5.6 倍;相对其标价,分别为 33 倍和 42 倍;如果两款模型按当前的促销价来衡量,则为 111 倍和 139 倍。差距之所以如此之大,是因为这个分数的两端都在变动:Astra 的卡处于市场顶端,而 Solar Pro 4 目前接近市场底部。

长上下文规则是另一条值得读两遍的条款,因为它们并不对称。Astra 的门槛设在 272,000 个 token,其规则是整次请求重新计价——长请求中的每个 token 都按两倍输入和 1.5 倍输出计费,而不仅仅是超出边界的那部分 token。Upstage 的卡片没有对应的阶梯,因此一次 400,000 token 的 Solar Pro 4 请求,其每 token 费率与一次 4,000 token 的请求完全相同。如果你的提示词经常超过 25 万个 token,Astra 的有效输入费率为 20.00 美元而非 10.00 美元,而你多付的差价恰恰会在 512K 上下文模型参与竞争的那类负载上进一步扩大。

十二分的差距从何而来

两个模型都有第三方数据,因此这次对比比这一梯队中的大多数对比都更容易。它们之间呈现出一致的模式:Solar Pro 4 相对于自身前代的提升主要集中在智能体任务上,而这也正是它最接近 Astra 的领域。

• 智能指数 — GPT-6 Astra 54.7,Solar Pro 4 42br /> • GPQA Diamond,研究生级别科学 — Astra 96.1,Solar Pro 4 86.8br /> • Terminal-Bench 2.1,驱动真实终端 — Astra 88.4,Solar Pro 4 75.1br /> • τ²-Banking,策略约束下的工具使用 — Astra 41.4,Solar Pro 4 35.0br /> • 长上下文召回,AA-LCR — Astra 80.7,Solar Pro 4 71br /> • 运行平均评估任务的成本 — Astra $0.0516,Solar Pro 4 介于 $0.0039 与 $0.0155 之间br /> • 每个评估任务的墙钟耗时 — Astra 约 8.6 分钟,而该模型每秒约返回 70 个 token

任务成本这一行才是重新框定这场争论的关键。在 Solar Pro 4 上运行单个高难度评估任务,成本在四到十三美分之间,取决于适用的是哪一档促销;而在 Astra 上按标准费率只需五美分。"输出价格是它的四十二倍"和"单任务成本是它的十三倍",说的都是同样这两个模型,两句话都没错,而后者才是会出现在账单上的那个数字。区别在于,根据 Artificial Analysis 的测量,Astra 得出答案所用的 token 比 Solar Pro 4 的前代更少——每个任务 43,000 个输出 token——而它完成一个任务的成本仍然更高,只不过远不到 42 倍。

关于 Solar Pro 4 这一列,有两点需要注意。即便它使用的 token 更少,按每项任务的实际耗时(wall-clock)计算,它仍比 Astra 慢;而且它公布的智能体评分还带有一个值得了解的特定之处:在对前代的评估中,它主要是靠拒绝作答来提高诚实度分数,只尝试回答了 41% 的问题,而 Pro 3 为 92%。对于必须采取行动的智能体来说,拒绝往往好过自信的错误答案——但这会改变你解读任何通过率对比的方式。

Comparison card with two columns. GPT-6 Astra: Intelligence Index 54.7, $10.00/$50.00 per 1M, long-context tier $20.00/$75.00 above 272K in, cached input $1.00, 1,050,000 context and 128,000 max output, Terminal-Bench 2.1 88.4. Solar Pro 4: Intelligence Index 42, promotion $0.09/$0.36 to 11 October 2026, then $0.15/$0.60, list $0.30/$1.20, 512,000 context and 128,000 max output, Terminal-Bench 2.1 75.1

这种对比,两家供应商的卡都给不了你

上面的基准测试行是匹配的:双方运行了相同的评估。缺失的行才是有意思的,因为两家供应商对于该发布什么存在分歧。

• 推理强度——Astra 公开了五个具名级别(low、medium、high、xhigh、max);Solar Pro 4 记录了一个 reasoning_effort参数,至少包含 medium 设置,而 Upstage 关于这一分级的材料十分单薄br /> • 架构——Astra 的参数规模未披露;Solar Pro 4 的参数规模同样未披露,因此双方都没有像各自更便宜的同胞型号那样公开服务经济性方面的信息br /> • 负载下的长上下文表现——Astra 公布了一个成本阈值和一份有记录的召回分数;Upstage 公布了上下文窗口,却没有自己的召回评估br /> • 输入面——Astra 接受文本、图像和文件;Solar Pro 4 是文本模型br /> • 模态上限——双方的最大输出 token 数均为 128,000,这对一款廉价模型来说达到持平并不寻常,也是 Solar Pro 4 规格表上对长文本生成工作最有用的单项规格

reasoning-effort 这一项比表面上更重要。一个允许你把思考预算调低的模型,其处理简单请求的实际单价会远低于它的标称费率,因为对于不需要那么多推理的工作,你只需为更少的推理 token 付费。两家厂商都公开了这个参数;但都没有公布各个档位会消耗多少 token,这意味着要找出这两个模型之间真实的倍数,唯一的方法就是在你自己的流量上实测。

Text card headed 'Cost per token is not cost per finished task' with rows: average evaluation task $0.0516 on GPT-6 Astra and $0.0039-$0.0155 on Solar Pro 4; input $0.09 vs $10.00 per 1M; output $0.36 vs $50.00 per 1M; roughly 8.6 minutes wall clock per task on GPT-6 Astra

盈亏平衡点,直白地说

暂时忽略指数分数,并保持工作负载不变。如果你的应用是对最长五十万 token 的文档做抽取、分类、摘要或结构化输出,Solar Pro 4 能以 Astra 无法企及的速度完成工作,而且完全不需要推理阶梯——在 JSON 抽取任务中,任何可能的质量差异都不值得为此付出 42× 的输出代价。如果你的应用是一个长时程智能体,需要规划、调用工具、从失败步骤中恢复并最终完成任务,那么 Terminal-Bench 上 11 分的差距和 τ²-Banking 上 6 分的差距,才是预测它能否完成的数字,而一次失败的智能体运行,代价是整次运行的全额费用再加上重试。

真正困难的是中间那类:短小、高难度、一次性的推理任务——Astra 在这些任务上的 GPQA 优势很大,而单任务成本仍然只有几美分。在那里,起决定作用的不是价目表,而是 token 数量——而唯一能回答这一问题的测量方式,就是把你自己的提示词分别跑过这两个模型,然后查看用量。这也正是降价冲击最大的情形,因为被拿来与昂贵模型做对比测试的,正是那个更便宜的模型,而更便宜模型费率上 67% 的变动,会改变从周一到现在这项测试的算术。

Text card headed 'Which tier gets your traffic' with rows mapping extraction and summarisation to Solar Pro 4, single-shot hard reasoning to GPT-6 Astra decided on tokens per answer, long-horizon agent runs to GPT-6 Astra on Terminal-Bench 2.1 88.4 vs 75.1, and prompts beyond 272K tokens to either with Astra repricing the whole request to $20.00/$75.00

为什么这是一个路由决策而不是采购订单

GPT-6 Astra 已列入 OrcaRouter 目录,型号为 openai/gpt-6-astra,采用 OpenAI 自身标价,以 0% 加价率原样传递,这正是此类比较最终归结为一条规则而非一份合同的原因所在。Upstage 的 Solar 系列情况不同,诚实的说法就是我们一贯采用的那句:OrcaRouter 不路由任何 Upstage 模型,因此 Solar Pro 4 在此不可用——它来自 Upstage 自家的 API 以及若干第三方平台,上方的价格表是他们的而非我们的。

在这种配对中,路由器真正的作用在于分层拆分。廉价模型和昂贵模型同处于一个兼容 OpenAI 的端点之后,由路由规则把抽取流量发送到适合它的那一层,而当较便宜的模型出错、或返回你的解析器拒绝接受的输出时,自动故障转移会把调用提升到更强的模型。后一个机制才是应对这种对比所带来的错误路由风险的务实答案:代价高昂的失败模式并不是选错模型,而是选错模型后还要为它付两次钱。

周日前要做什么

如果 Solar Pro 4 是你技术栈的候选方案,这就是你测试它的最低价一周。促销价持续到 10 月 11 日 00:00 UTC,促销后的 $0.15 和 $0.60 已经比标价低三分之一,而该模型自己发布的证据——Terminal-Bench 和 τ²-Banking 的数值——所描述的工作,你可以在一个下午内用自己的任务集复现。让两个模型在相同提示词上运行,保持推理设置不变,记录每个已完成任务的 token 数,而不是每次调用的 token 数。得出的那个数字才是唯一重要的倍数,而且它不会是 42×。然后做决定,同时要知道:如果更便宜的一方胜出,你用来测试它的价格会在周日到期——而如果更贵的一方胜出,那十二个半指数点就是你要为之付出的东西。

GPT-6 Astra 已收录在 OrcaRouter 目录中,模型标识为 openai/gpt-6-astra,按 OpenAI 自家的标价计费,以 0% 加价原样透传。