
GPT-6.1 Sol 对比 GPT-6 世代:独一无二的一代
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
2026 年 9 月 29 日,该厂商在其模型系列中加入了第四个名称,并将其称为一代,而这一阵容的算术才是它最有趣的地方:GPT-6.1 Sol就是这一代的全部。GPT-6 Luna和GPT-6 Sol均于 2026 年 9 月 22 日发布,保持不变;GPT-6 Astra,自 2026 年 9 月 4 日起推出,保持不变;6.1 这次更新恰好只涉及一个档位。与此同时,GPT-6.1 Sol 每百万 token 输入 $2.00、输出 $10.00,在 Artificial Analysis Intelligence Index 上得分 51.83,每项任务成本 $0.724——与 GPT-6 Astra 差距在 0.84 分以内,而后者在 $10.00/$50.00 的价格下每项任务成本为 $3.2575。标签上是同一代,底下却是四套不同的经济账。
这使得“我是否该使用 GPT-6 这一代”成了一个错误的问题。该产品线在每任务成本上跨越 48 倍的范围,在实测智能上跨越 14.6 分的范围,而答案完全取决于你指的是哪一档。以下就是实测出的阶梯。
测量所得的四个梯级

• GPT-6 Luna —— 指数 38.12,每 100 万 $0.10 / $0.50,缓存 $0.01,每任务 $0.0678,50,012 输出 token,首 token 用时 100.1 秒
• GPT-6 Sol —— 指数 47.63,$2.00 / $10.00,缓存 $0.20,每任务 $1.045,31,000 输出 token,124.3 秒
• GPT-6.1 Sol —— 指数 51.83,$2.00 / $10.00,缓存 $0.10,每任务 $0.724,38,128 输出 token,332.0 秒
• GPT-6 Astra —— 指数 52.67,$10.00 / $50.00,缓存 $1.00,每任务 $3.2575,27,206 输出 token,400.4 秒
它们每一个都拥有相同的 1,050,000-token 上下文窗口和相同的 128,000-token 最大输出,并且每一个都接受文本、图像和文件输入。这些层级并非通过能力标志来区分。它们的区别在于你愿意为多少思考量付费,而这个阶梯的两端在每个任务上相差 48 倍。
6.1 更新实际带来了哪些变化
三件事,且其中只有一件是分数。
分数变了:一周内从 47.63 升至 51.83,提高了 4.2 分。缓存输入价格减半,从每百万 $0.20 降到 $0.10,这就是为什么尽管标价完全相同,实测的每任务成本仍从 $1.045 降到 $0.724——同一张价目表,账单却不同。而输出 token 数从 31,000 升至 38,128,同时每任务的挂钟时间从 321 秒增至 640 秒,这是本次刷新唯一退步的地方,也是任何规格表上最不显眼的一处。
与 Astra 相比,这一对比才最令人意外。GPT-6.1 Sol 在指数上落后旗舰 0.84 个指数点,而每项任务成本便宜 4.5 倍。Astra 剩下的优势不在于其指数得分;而在于那些只对它单独进行测量的评估集,以及 OpenAI 所描述的其独有的一项能力——发现新型安全漏洞。正因如此,该模型在供应商自己的 Preparedness Framework 下被评为“关键”,其最强能力的设置仅限经过审核的合作伙伴使用。
OrcaRouter 为 GPT-6 Astra 提供的卡片是同一阶梯中的旗舰端:10.00 美元 / 50.00 美元,首个 token 的 p50 为 1.64 秒,七天内达到 4070 万 token,并且所有层级都共享相同的 1,050,000 token 上下文窗口。

与 6.0 Sol 相比,这次刷新几乎是一次纯粹的提升——指数更高,成本更低——但前提是,6.1 模型是一个不同的模型,而不是一个检查点,并且它会更冗长地重新输出其推理过程。与 Luna 相比,这根本算不上比较:以 10.7 倍的成本换取 13.7 个指数点,对于高难度任务来说是一笔划算的交易,对于高吞吐量任务来说则很糟糕。
我们自己的路由数据表明,市场已经做出了什么决定
这一对比比规格表多出的一点,是它呈现了实际使用情况。截至 2026 年 10 月 7 日的七天内,在我们自己的路由层上,GPT-6.1 Sol 承载了 2.842 亿个 token,而它所取代的 GPT-6 Sol 承载了 95 万个——两个上线时间仅相差一周的模型之间相差 300 倍,这正是层级替换从内部看起来的样子。廉价层级 GPT-6 Luna 承载了 6.416 亿个,超过两个 Sol 模型的总和。GPT-6 Astra 承载了 4070 万个。
把这一点理解为三种各自独立的行为。高体量工作以最大的量流向了低价档。重要工作在最新 Sol 发布后一周内集中到它身上,同时放弃了它所取代的模型。而旗舰型号仍属小众:能力最强的一档,使用得最少,使用者是那些所遇问题只有它能解决的团队。产品阵容不是人们向上攀爬的梯子;而是一组供人挑选的工具,人们按档位而非按代际来挑选。
这就是为什么层级应属于请求,而不是架构
一代产品分为四个层级,实际问题在于:正确的答案会因任务、因周次而变——正如上面的流量数据所示,市场在七天内就重新做出了决定。把某个模型名称硬编码进应用,正是把一份可选阵容变成一种承诺的原因。
这四者都可以通过同一个 OrcaRouter 端点访问:一个 API 即可调用 200 多个模型,并按 0% 加价率原样透传提供商的标价。最后这一点在这里尤为关键,因为四个档位中有三个共享同一个标价或同一个缓存费率,而后者已经变动过一次——GPT-6.1 Sol 的缓存费率在上线一周内就减半了,而正是透传计费机制让这一变化自动出现在你的账单上。

路由层有两个特性值得为这套特定的模型阵容点名。路由 DSL 让层级成为请求的一个参数,而不是一次部署——抽取阶段用便宜层级,推理阶段用 6.1 Sol,只有那些需要 Astra 独有能力的调用才用 Astra。而模型融合让它们组成一个小组共同回答同一个问题,对于一个你无力把所有请求都路由过去的旗舰模型来说,这才是诚实的用法:它成为小组中的一个声音,而不是整张账单。
如何对待只有一个人的一代
不要购买整代。买一个梯级,并在梯级移动时重新购买。
对于高吞吐量和延迟敏感型工作负载,GPT-6 Luna 每任务 $0.0678、首 token 100 秒,是已经承载最多流量的层级,而且其价格比阶梯上其他任何选项都低一个数量级。对于通用推理和编码,GPT-6.1 Sol 现在已成为 6.0 模型曾经的默认选择——相同的标价、更好的指数、一半的缓存成本,而 640 秒的任务时间是你在假定升级免费之前,需要针对自身工作负载测试的一点。对于需要前沿测量或只有旗舰型号才能完成的安全工作的任务,GPT-6 Astra 仍然是唯一能胜任的层级,其成本是下一层的 4.5 倍。
值得关注的是,6.1 更新是否会覆盖其他层级。如果 Luna 或 Astra 得到同样的待遇,阶梯的形状就会改变,本文中按任务的计算也会随之改变。在那之前,“GPT-6.1”只指一个模型,而把它当作一个系列,正是团队最终为提取任务支付旗舰价格的方式。
