一张生成的 hero 卡片,标题为“模式是常量,计量不是。”,其中三张叠加的卡片分别写着“Pro 模式 —— reasoning.mode: pro 在两个档位均启用,按模型的标准 token 费率计费”、“乘数 —— OpenAI 未公布;pro 模式的成本以额外的 token 用量体现,而非附加费”,以及“差异 —— 6.1 计费表中每一条已公布的条目都相较 5.6 减半,缓存输入一条则降至四分之一,每 1M 为 $0.10 对 $0.40”。页脚写着“OpenAI 数据为厂商自报;截至 2026 年 9 月 30 日,尚无针对 GPT-6.1 档位的独立评测发布”,OrcaRouter 标志位于右下角。
Guides & Insights

GPT-6.1 Sol Pro 对比 GPT-5.6 Sol Pro:相差一代,费率表减半

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

把名字先搁一边,看看每一个在请求里实际对应的是什么,因为这场对决正是在那里分出胜负的。GPT-6.1 Sol Pro 就是 GPT-6.1 Sol——于 2026 年 9 月 29 日发布——在 Responses API 中把 reasoning.mode 设为 pro 来运行,并按该模型自身的每百万 token 输入 2.00 美元、输出 10.00 美元为这部分额外工作计费。GPT-5.6 Sol Pro 则是早一代的同一构造:GPT-5.6 Sol,2026 年 7 月 9 日推出,以 reasoning.mode: pro 运行,其额外 token 按每百万输入 4.00 美元、输出 20.00 美元计费。两家厂商都没有为这两个层级公布 -pro 标识符,因此既没有 pro 价目表可供比较,也没有 pro 附加费可供权衡。你实际上是在比较相隔三个月的两张基础价目表,它们的标价相差两倍——而缓存费率相差四倍。模式完全相同。它下面的那台计量表却不是。

到底为什么这个对比里还会有旧款 Pro 仪表?

GPT-5.6 Sol Pro 之所以总是被当作同级产品而非前代产品提起,是因为 OpenAI 在 GPT-5 时代确实把 Pro 当作一款产品来卖,而那些标识符至今仍留在价目表上,并各自带有溢价计价标准:gpt-5.4-pro 和 gpt-5.5-pro 在短上下文下为每百万 token 输入 $30.00、输出 $180.00,超过 272,000 输入 token 后升至 $60.00 和 $270.00。它们是真实存在、单独定价的产品,也正是“Pro”一词读起来显得昂贵的原因。GPT-5.6 这一代改变了机制,却没有改变用语——pro 变成了旗舰型号的一种模式,而不是与它并列的高端模型,并按旗舰自身的费率计价。因此,从 5.6 时代的 pro 配置切换到 6.1 时代的配置,实际效果并不是“一个更便宜的 pro 模型”。它是同样的配置,建立在更便宜的基础上。

• 两边分别是什么——一个模型加上 reasoning.mode: "pro",而非单独训练或单独定价的部署

• 你发送的标识符 — gpt-6.1-sol 与 gpt-5.6-sol,模式信息携带在 reasoning 对象中

• 标准输入价格——每百万 token 2.00 美元,而另一档为 4.00 美元,因此 pro 模式的额外 token 在较新的层级上成本只有一半

• 标准输出价格 — 每百万 token 10.00 美元,相比 20.00 美元,同样的减半也适用于专业模式所推高的那部分账单

• 缓存输入 — 在 6.1 Sol 上每百万 $0.10,而 5.6 Sol 上为 $0.40,四倍之差,其影响在 pro 模式专为打造的智能体循环中体现得最为明显

• 缓存写入 — 每百万 token $2.50 对比 $5.00,再次减半

• 长提示词重新计价——两者在输入 token 超过 272,000 后都会对整个请求重新计价,输入和缓存费率为 2 倍,输出为 1.5 倍

• 上下文与输出上限 — 两者均为 1,050,000 tokens,最大输出 tokens 为 128,000,且各自的文档记录最大输入为 922,000

• 知识截止日期 —— 6.1 Sol 为 2026年4月30日,相较于 5.6 Sol 的 2026年2月16日

• 推理强度 —— 低、中、高、xhigh、max,其中 none 与 minimal 在 6.1 Sol 上不受支持;而在 5.6 Sol 上,对应的则是同一档位梯度再加 none

• Pro 模式文档——在 OpenAI 的推理指南中按名称在 gpt-6.1-sol 上进行了演示,而对照的是一项覆盖 GPT-5.6 和 GPT-6 的系列级声明,其中没有按模型划分的资格清单

那个列表里有两行比其余所有行加起来都更有价值,而这两行都不是主推价格。

缓存行正是这两代不再具有可比性之处

Pro 模式的成本以用量形式出现,而不是附加费:OpenAI 的文档称,它会“汇总为生成最终答案所执行的模型工作量,并按所选模型的标准 token 费率对这些 token 计费”,而厂商并未公布其倍率。这使得 Pro 配置的成本取决于两件你无法查阅的事——该模式在你的任务上额外做了多少工作,以及你的 token 成本是多少——而只有第二项是公开的。在这个维度上,6.1 档在每一行都以整整两倍的优势胜出,在缓存输入这一行则以四倍胜出。

来算一笔账:一个客户支持代理每一轮都会重放一段固定指令和工具架构前缀。每月发送 2 亿个输入 token,其中 95% 是前缀命中,缓存部分在 6.1 Sol 上按每百万 $0.10 计费,而在 5.6 Sol 上为 $0.40——同一个前缀是 $19 对 $76,而且还没算上一个 pro 模式 token。现在再加上 pro 模式,差距会扩大而不是缩小,因为该模式额外的推理落在输出侧,每百万为 $10.00 对 $20.00。唯一没有减半的那一行是长提示重新定价规则,它在两个档位上完全相同,并应用相同的 2× 和 1.5× 倍率——因此,一个经常超过 272,000 个输入 token 的工作负载,在对比的两侧都要支付溢价,只是在较新的档位上溢价更小。

还有一个陷阱属于该模式本身,而不属于任一模型,它会坑到天真的成本估算器。在开启 pro 模式时把 reasoning.effort 设为 none,会返回错误,而不是静默回退;而 pro 模式消耗的推理 token 会报告在 usage 对象的 output_tokens_details.reasoning_tokens 下,却从不出现在响应体中。任何根据返回文本估算花费的客户端,每次都会低估 pro 配置。

在老一辈仍然有道理的地方

A screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol) showing the header 'by OpenAI - 2026-07-09', a 1,050,000-token context window with 128,000 maximum output tokens, capability tags for vision, tools, JSON and reasoning, and pricing of $4.00 per million input tokens and $20.00 per million output tokens with a cached-input rate of $0.40 per million, alongside a long-prompt tier reading $8.00 input and $30.00 output.

更便宜并不等于更好,而 5.6 代拥有价格表上看不出来的三大优势。第一是成熟度:gpt-5.6-sol 自 2026 年 7 月 9 日起已全面可用,其行为已经稳定,而且当 OpenAI 淘汰较旧的 Pro 计量档位时,其官方弃用页面上指向的正是这个模型——这意味着从那些每百万 180 美元的档位迁出的路径落在 5.6 层级,而不是 6.1 层级。第二是促销:OpenAI 表示 GPT-5.6 Sol 的促销价格至少会持续到 2026 年 11 月 21 日,因此 4.00 美元 / 20.00 美元这一对价格是有期限的价格下限,而非标价。第三是独立证据,而如果你无法自行运行评测,这一点最为重要——Artificial Analysis 对 GPT-5.6 Sol 有完整的评测,而 6.1 层级则完全没有相应页面。

那个独立解读讲的是成本,而不是智能,而这正是有用之处。在中立榜单的智能指数上,GPT-5.6 Sol 在最高推理强度下得分为 47,在 145 个模型样本中排名第 13,编程指数为 77.4,排名第 3,GPQA Diamond 为 94.1%。其每项指数任务成本接近 2.00 美元,而 GPT-6 Sol 在相同设置下为 1.06 美元——大约翻倍——这个比例用一个数字就构成了支持较新档位的全部论据。截至 2026 年 9 月 30 日,6.1 代尚无已发布的同类数字:该榜单上 6.1 Sol 这一 slug 的模型页面返回 404,且该字符串未出现在实时排行榜中。因此,如今诚实的比较,是将经过实测的 5.6 代与厂商描述的 6.1 代相对照,而再多的制表工作也无法弥合这一差距。

使用一个键运行两种配置

这是一种罕见的对比:实验的搭建几乎不花什么成本,因为两个实验组只差一个模型字符串和一个参数。OrcaRouter 路由 openai/gpt-5.6-sol,按 OpenAI 自身的标价,没有任何加价——输入 $4.00,缓存 $0.40,输出 $20.00,长提示词档位公布为 $8.00 和 $30.00——并路由 openai/gpt-6-sol,价格为 $2.00 / $0.20 / $10.00,其自有的 272K 档位为 $4.00 和 $15.00。由于加价为零,且供应商的价目表按原样透传,任一档位的促销变动或费率下调,都会在 OpenAI 公布它的当天体现在该路由上,无需第二份合同,也无需按模型重新接入。一个 OpenAI 兼容端点和一把 API 密钥即可覆盖测试的两个实验组,因此唯一要做的是选择任务集并读取 usage 对象。

A screenshot of the OrcaRouter model page for GPT-6 Sol (openai/gpt-6-sol), showing the header 'by OpenAI - 2026-09-22', a 1,050,000-token context window with 128,000 maximum output tokens, capability tags for vision, tools, JSON and reasoning, and pricing of $2.00 per million input tokens and $10.00 per million output tokens with a cached-input rate of $0.20 per million, alongside a long-prompt tier reading $4.00 input and $15.00 output.

在同一组你自己的高难度请求上,用三种方式运行它,保持 reasoning.effort 不变,让只有一个变量移动:标准模式下的 gpt-5.6-sol、开启 pro 模式的 gpt-5.6-sol,以及在相同 effort 下的 gpt-6.1-sol。比较任务成功率、墙钟延迟和总计费 token,读取 reasoning-token 字段而不是响应正文。pro 运行相对于其标准模式对应运行的 token 总量,就是你的流量上的乘数——它不会与任何其他人的匹配,因为设计意图是额外工作量随请求难度而扩展。6.1 运行只是同一请求正文改动了一个字符串,因此在做出决定后把它保留为回归测试没有任何成本。

在下结论之前,有两点需要牢记。如果 6.1 的标识符拒绝 pro 参数而不是返回结果,那本身就是一项发现,而且你是在它触及任何面向用户的东西之前就得知了这一点。而如果你用来对比的那个实验分支是当前可路由的 gpt-6-sol,而不是某个 5.6 配置,那么请记住:6.0 与 6.1 之间的基础费率卡是完全相同的——这两者之间的差异在于缓存输入那一行以及供应商报告的任务结果,而 5.6 与 6.1 之间的差异则是整张费率卡。

常见问题

GPT-5.6 Sol Pro 是一个单独的模型、有自己的高级定价吗?不是——而这正是这个名称设下的陷阱。OpenAI 的价目表上确实有真正的高级 Pro 计费项,但它们属于更早的几代,价格在每百万 token 输入 $30.00、输出 $180.00 及以上。对于 GPT-5.6 系列,厂商售卖的是旗舰型号,并把 pro 作为 Responses API 中 reasoning.mode 的一个取值公开,按该旗舰型号的普通费率计费。一条标注为 5.6 代、报价 $4.00 和 $20.00 的 pro 条目,报的正是旗舰型号的价格卡,由此你就能看出并不存在第二套计费项。

这两个我应该把高难度、低负载的工作负载放在哪一个上?两个答案都不是没有代价的,所以决定取决于你能测量什么,而不是你能读到什么。较新的一档在每一条公开计费线上都是半价,在缓存输入上便宜四倍,但它的 pro 模式背后没有任何独立评测,其模型页面也完全没提到这个模式。较旧的一档有稳定的 GA 历史和完整的第三方评测,但每 token 的价格是两倍。如果你的任务集运行成本很低,答案就是哪一档在同等投入下在你自己的请求上胜出;如果不是,那么较旧的一档才是你至少可以拿别人的数字来核对其表现的那一个。

专业模式会改变模型所擅长的领域吗? 不会。它会在返回单一最终答案之前执行更多的模型运算,这可以提升在困难任务上的可靠性,同时也会增加延迟和 token 用量——无论哪种方式,权重都是相同的。如果你想改善的指标是准确率或幻觉率,而不是真正困难问题上的任务成功率,那么关于这一模型系列的独立证据表明,模型代次和推理强度设置才是更可靠的调节杠杆,而不是模式。

A generated comparison card titled 'One generation, two rate cards', with a left panel labelled 'GPT-5.6 Sol Pro' reading 'Released: July 9, 2026', 'Base input: $4.00 per 1M', 'Base output: $20.00 per 1M', 'Cached input: $0.40 per 1M' and 'Independent score: AA Intelligence 47', and a right panel labelled 'GPT-6.1 Sol Pro' reading 'Released: September 29, 2026', 'Base input: $2.00 per 1M', 'Base output: $10.00 per 1M', 'Cached input: $0.10 per 1M' and 'Independent score: none published'. A footer reads 'OpenAI figures vendor-reported; GPT-5.6 Sol scores per Artificial Analysis; no third-party evaluation of the GPT-6.1 tier published as of September 30, 2026.'

简而言之,也是这次对比中最值得带走的一点:Pro 模式是常量,价目表是变量。在这两种配置之间,模式的工作方式没有任何改变——模型工作的聚合方式相同,标准费率计费相同,未公开的倍率相同,如果你试图把它与 effort 搭配使用,错误也相同:无。三个月里改变的是,它下面计量表上每一个已公布的条目都减半了,而缓存输入那一行则降到了四分之一。这使得较新的档位成为任何已经在运行 Pro 配置的人在价格上的默认选择,也使得较旧的档位成为任何在迁移前需要第三方数字的人在证据上的默认选择。这两点都不构成把这两个名称当作两种产品的理由。

测试的两组都从同一个 OpenAI 兼容端点运行,供应商的价格表按原样透传,不额外加价,并在各提供商之间自动故障转移。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新