
GPT-6.1 Sol首个独立评分出炉:落后Astra 0.84分,任务成本不到其四分之一
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 397 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 195 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
在GPT-6.1 Sol于 OpenAI 2026 年 9 月 29 日 DevDay 发布后数日内出现的每一篇报道——包括本博客的这篇——都带着同样的警告:那些能力数字出自厂商,没有任何第三方对该模型进行过评分。如今这一警告已经过时。Artificial Analysis 的智能指数上已经有了 GPT-6.1 Sol 的一行数据,以最高推理强度运行,这是该模型短暂生命周期中第一个并非由 OpenAI 产出的数字。它显示为 51.8,而GPT-6 Astra为 52.7,GPT-6 Sol为 47.5——与那款 10 美元/50 美元的旗舰机型差距不到一个百分点,相比 GPT-6.1 Sol 所取代的模型则提升了 4.3 个百分点。让这一行数据真正有意思的,是它旁边的那个数字:该榜单为每个分数背后的评测运行标出了价格,GPT-6.1 Sol 的指数运行每项任务花费 0.72 美元,而 Astra 的花费为 3.26 美元。多花四倍半的钱换取 0.84 分,这一句话就是整个对比,而如今它是一条实测出来的话,而非厂商对它的某种说法。
这一行本身,以及它运行所基于的内容

Artificial Analysis 发布的 Intelligence Index 是十项评估的综合体,而在 2026 年 9 月 30 日运行的版本是 v4.3.2——AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR v1.1。本文中的三款 OpenAI 模型都基于同一版本,因此下文的比较是同类对同类的,而厂商自己的发布表格从来做不到这一点。该榜单还记录了它为该模型掌握的发布日期——2026-09-29,即 DevDay 当天——并以 max-effort 配置对其进行评估,这也是该页面在自己的标题中列出的设置。
• 智能指数 — GPT-6.1 Sol(max)为 51.8,GPT-6 Astra(max)为 52.7,GPT-6 Sol(max)为 47.5。
• 每个索引任务的成本 — GPT-6.1 Sol 为 0.72 美元,Astra 为 3.26 美元,GPT-6 Sol 为 1.05 美元。这是榜单自己给出的数字,即运行一次完整索引评估的花费,而非价目表。
• 本次运行消耗的输出 token — GPT-6.1 Sol 为 6720 万,Astra 为 6000 万,GPT-6 Sol 为 7680 万。AA 自己的评论称,相较于榜单中位数 8200 万,6700 万“相当简洁”,这是它对其所取代的模型取得的第二项、也更低调的胜利。
• 输出速度 — GPT-6.1 Sol 为每秒 66.8 个 token,Astra 为 57.0,GPT-6 Sol 为 76.2。
• 榜单列出的价格 — GPT-6.1 Sol 每百万 token 输入 2.00 美元、输出 10.00 美元,缓存输入为 0.10 美元,缓存写入为 2.50 美元。这四个数字与厂商定价页面完全一致,而这正是这一行最不引人注目、也最有价值之处:一份为我们此前已引用过的费率提供的独立清单。
先说一个框架性说明,免得这些数字被当作弹药。AA 的指数由十项评估构成,而 OpenAI 在自家发布公告开头重点主打的评估——DeepSWE v1.1、OSWorld 2.0、Terminal-Bench Science 0.1——并不在其列。AA 运行的是其自有版本的 AutomationBench,这与厂商所引用的那个 AutomationBench 版本并非同一套测试框架。因此,这份独立记录既没有证实、也没有推翻发布帖中的四项头条主张;它衡量的是一组在很大程度上不同的任务,更应被当作关于该模型总体形态的另一种参考意见,而不是对那些具体语句的定论。
Astra 仍然胜出,领先不到一分,但花的钱是四倍半。

两个模型都提供了一条努力等级阶梯,而榜单现已公布两者每一级的得分和运行成本。把它们并排放在一起,这些阶梯揭示出单一头条式比较无法说明的事情:GPT-6.1 Sol 的最佳配置并没有在与 Astra 的最佳配置竞争。它是在与 Astra 的第二佳配置竞争。
• GPT-6.1 Sol,max — 51.8,每个索引任务 $0.72。GPT-6 Astra,max — 52.7,$3.26。
• GPT-6.1 Sol,xhigh — 51.0,$0.39。GPT-6 Astra,xhigh — 52.4,$2.31。
• GPT-6.1 Sol,high — 50.2,$0.32。GPT-6 Astra,high — 50.9,$1.73。
• GPT-6.1 Sol,medium — 47.8,$0.21。GPT-6 Astra,medium — 49.6,$1.54。
• GPT-6.1 Sol,low — 42.1,$0.13。GPT-6 Astra,low — 45.8,$0.82。
Astra 在每一档都领先,这是对这场对决的诚实总结,也是最没意思的部分。有意思的部分在于兑换率。如果你想要能击败 GPT-6.1 Sol 最佳表现的最便宜 Astra 配置,那就是 xhigh 档的 Astra:52.4 对 51.8,成本为 $2.31 对 $0.72。也就是说,每次评估运行多花 $1.59,换来 0.56 个指数点——大约是以 3.2 倍的成本,换取不到百分之一的分数。反过来,把 GPT-6.1 Sol 降到 xhigh,你会放弃 0.8 分,而账单降到 $0.39;这比 Astra 的 xhigh 便宜 5.9 倍,是 Astra 最大努力运行的九分之一。
同一阶梯还有第二种解读,反对以最大投入购买 Astra。Astra 的四个较低档位都比其 max 更便宜,而它的 xhigh 比 max 低 0.29 分——分数只少略高于半个百分点,运行成本却降低 29%。任何关于这对组合的采购讨论,如果从“Astra 用 max”开始,到“Astra 贵 4.5 倍”结束,就把 Astra 自己更便宜的档位排除在比较之外了。
六项评估归Astra,两项归GPT-6.1 Sol,两项打平
综合评分掩盖了分化。在最大努力下逐项评估打分后,GPT-6 并不是一个在所有方面都略优于 Astra 的模型——它在两项上更好,在六项上更差。
• GDPval-AA — GPT-6.1 Sol 的 Elo 为 1575.1,Astra 为 1541.9,在专业工作任务上领先 33 分。这是较便宜模型取得的最大单项独立胜利。
• AA-LCR v1.1,长上下文推理 — 0.830 对 0.807。GPT-6.1 Sol 领先。
• AA-Briefcase v1.1 — Elo 1564.2 对 1568.9。Astra 领先 4.7。
• AutomationBench-AA — 0.649 对 0.685。Astra 领先 3.6 分。
• Terminal-Bench 4.0 — 0.561 对 0.591。Astra 领先 3.0 分。
• SciCode — 0.542 对 0.565。Astra 领先 2.3 分。
• Humanity's Last Exam — 0.529 对 0.547。Astra 领先 1.8 分。
• AA-Omniscience — 41.5 对 43.4。Astra 领先 1.9 分。
• GDP.pdf 和 CritPt — 在两个模型上分别以 0.310 和 0.317 完全持平。
这些行中有两行的价值超过了它们在列表中的排位。GDPval-AA 上的差距是唯一一处,较便宜模型的优势大到足以在更换评测框架后依然成立,而且它恰好落在厂商定位话术所宣称的工作负载上——专业的、文档密集型工作。而两处完全打平出现在差距最窄的评测上,这提醒人们:0.84 分的综合差距,是由各单项从 33 分的胜出到 3.6 分的落败不等的若干行拼合而成的。
与它所取代的型号相比,这一提升是真实存在的,但并不均衡。
对任何已经在生产路径上运行 GPT-6 Sol 的人来说,真正重要的比较,是 6.1 Sol 与其自身前代之间的那项比较,而独立记录在这一点上比厂商的发布文章更犀利。十项评估中有八项有所提升。两项出现退步。
• SciCode — GPT-6.1 Sol 得分为 0.542,而 GPT-6 Sol 得分为 0.576。较新的模型在科学代码方面差了 3.5 分。
• AA-LCR v1.1 — 6.1 Sol 为 0.830,而 GPT-6 Sol 为 0.837。在长上下文评估上,差距微乎其微,但方向不对。
• AA-Omniscience — 41.5 对 27.1。这是该行中最大的变动:知识评估上跃升 14.4 分,该集合上的准确率从 0.545 升至 0.621。
• 同一集合上的幻觉率 — GPT-6.1 Sol 为 0.543,低于 GPT-6 Sol 的 0.601,仍高于 GPT-6 Astra 的 0.513。AA-Omniscience 将其分数拆分为“答对了”和“自信地答错”,而这一拆分正是 6.1 更新版体现价值之处:它明显没有 Sol 那么不诚实,但仍是三者中最不诚实的。
• Terminal-Bench 4.0 — 0.561 对 0.439,提升 12.2 分。 AA-Briefcase — 1482.8 到 1564.2 Elo。 GDP.pdf — 0.248 到 0.310。
解读是,这更像是一次知识与工具层面的更新,而非推理能力的更新。提升最明显的评测,是那些奖励知道事情、而非编造事情的评测;下降的那个评测则是一个狭窄的技术性评测。任何为了节省缓存而迁移到 6.1 Sol 的人,都会把知识提升当作额外收获,并且不应假设这种提升会延伸到他们运行的每一个评测框架中。
它在榜单上的排名,以及排在它上方的是什么

在排行榜默认的 Intelligence Index 排序中,以 maximum effort 运行的 GPT-6 Astra 位列第 7,以 maximum effort 运行的 GPT-6.1 Sol 位列第 10,而以 maximum effort 运行的 GPT-6 Sol 则位列第 20。排在 GPT-6.1 Sol 之上的九行分别是两个 Astra 配置、三个 Claude Opus 5.5 配置、一个 Claude Sonnet 5.5 配置和两个 Claude Fable 5.1 配置——因此,GPT-6.1 Sol 最接近的模型是其自身家族中的旗舰,而它在该排序中实际取代的模型正是其自身的前代,后者低了十三个名次。
去掉 effort 设置后,排序的压缩方式对成本规划很重要:GPT-6.1 Sol 在 xhigh 下排第 13,在 high 下排第 15,在 medium 下排第 19,在 low 下排第 35;而 Astra 在 high 下排第 14,在 medium 下排第 16,在 low 下排第 26。换句话说,GPT-6.1 Sol 在 xhigh 下的排名高于 Astra 在 high 下的排名,而 GPT-6.1 Sol 在 medium 下的排名高于 Astra 在 low 下的排名。在这里,effort 是比模型选择更大的杠杆,至少在这两者之间是如此。
说实话,这个数字该怎么处理呢
本行所检验的厂商说法是,GPT-6.1 Sol 以大约五分之一的价格几乎媲美旗舰产品。对这句话的独立表述是:它与旗舰产品的差距在 0.84 个指数点以内,而支撑其得分的评估运行成本仅为旗舰产品的 22%。这与该说法足够接近,没有人应因此感到被误导;而且在对买家重要的每一个维度上,这都比“未经验证”更有力。
这行数据不做的,是为你的工作负载定价。一次索引运行是一组特定的任务组合,而真正决定实际账单的那个数字,是费率表对照你自己的 token 结构——这正是缓存那一行仍然是最值得拿来建模的一行的原因:GPT-6.1 Sol 的 $0.10 缓存输入价对比 Astra 的 $1.00,是十倍差距,任何索引评分都碰不到。在我们这边,同样的透传逻辑也适用:OrcaRouter 以 OpenAI 自身的标价提供 GPT-6 Astra、GPT-6 Sol 和 GPT-6 Luna,不额外加价,因此供应商费率一变,我们这边的费率也随之变化,而不必等待另一份合同。GPT-6.1 Sol 不在我们的路由中——公开目录返回“未找到模型”,针对的是openai/gpt-6.1-sol,截至目前,对于一个我们无法提供服务的模型,也不存在任何诚实的描述方式。而眼下,一把 API 密钥确实能为你买到的,正是这份基准测试真正在争论的那一对组合——用 Astra 干最难的活,用 Sol 扛量——各提供商的标价原样透传、不附加任何加价,并且当其中某家提供商报错时,可自动在提供商之间故障转移。
还有两点会进一步说明问题。针对同一模型再做一个独立的测试框架,会告诉我们 GDPval-AA 的领先究竟是模型本身的特性,还是那次评测的特性——而这是这一行里最有用却缺失的一个数据点。此外,对 272,000 token 长上下文层级做一次独立测量,其意义会超过再增加一个综合得分点,因为正是在这里,这一系列产品的定价不再便宜。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
