一份生成的双栏对比计分板,标题为“GPT-6.1 Sol 对比 Kimi K3——计分板”。左栏“GPT-6.1 Sol”各行内容为“智能指数:51.8”“每项指数任务成本:$0.72”“指数运行输出 token 数:67M”“AA-LCR 长上下文:0.83”“上下文窗口:1,050,000”“权重:闭源”。右栏“Kimi K3”各行内容为“智能指数:43.6”“每项指数任务成本:$2.00”“指数运行输出 token 数:160M”“AA-LCR 长上下文:0.89”“上下文窗口:1,048,576”“权重:在 Hugging Face 上开放”。页脚内容为“独立数据来自 Artificial Analysis v4.3.2,以最大努力运行。”
Guides & Insights

GPT-6.1 Sol 对比 Kimi K3:下载确实存在,但它仍然不是便宜的选择

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Kimi K3就是通常能终结这类争论的反例。Moonshot AI 于 2026 年 7 月发布了这个 2.8 万亿参数的模型,并公开了权重——moonshotai/Kimi-K3已在 Hugging Face 上,无门禁,下载量超过一百万,最近一次修订是在 9 月。所以这里没有“原则上开放,但出于安全加固而暂扣”的星号说明,也没有需要熬过去的两周延迟。GPT-6.1 Sol由 OpenAI 于 2026 年 9 月 29 日发布,是闭源且仅提供 API 的,而且永远都会如此。在独立榜单上,可下载模型得分为 43.6,而闭源模型为 51.8;前者每完成一个索引任务花费 2.00 美元,后者为 0.72 美元。开放权重本应是廉价的退路;在这一组合中,它们却是交易中昂贵的一方,而原因并不在许可证。

每个模型是什么

Kimi K3 是一款稀疏混合专家模型,总参数量达 2.8 万亿,每个 token 大约激活 1040 亿——约占 3.7%。它拥有 1,048,576 个 token 的上下文窗口,接收文本和图像作为输入,并返回文本。已发布的检查点是一个 FP8 产物,而且是一次真正意义上的大体量下载;在自有硬件上进行生产部署是集群层面的决策,而非工作站层面的决策。Moonshot 的架构主张是一种混合线性注意力方案,据其称在长上下文解码中要快得多,此外还有残差与路由方面的工作,正是这些才让一个 2.8 万亿参数的模型得以能够被服务。

GPT-6.1 Sol 是 Open​AI 的中端更新版本——定位低于 GPT-6 Astra、高于 GPT-6 Luna——拥有 1,050,000 token 的上下文窗口、128,000 token 的输出上限,支持文本、图像和文件输入,知识截止日期为 2026 年 4 月 30 日。推理档位从 low 到 max,并以 medium 为默认值;而 none 这一档此前 GPT-6 Sol 尚可接受,如今则被直接拒绝,Open​AI 自家的迁移说明建议开发者改用 low。其价格为每百万 token 输入 2.00 美元、输出 10.00 美元,缓存输入为 0.10 美元。

每个维度一行,每行均包含两侧:

• 输入 — GPT-6.1 Sol 每 1M $2.00,对比 Kimi K3 每 1M $3.00
• 输出 — GPT-6.1 Sol 每 1M $10.00,对比 Kimi K3 每 1M $15.00
• 缓存输入 — GPT-6.1 Sol 每 1M $0.10,对比 Kimi K3 每 1M $0.30
• 上下文窗口 — 1,050,000 个 token 对比 1,048,576 个 token;相差 0.1%,无关紧要
• 最大输出 — 两者均为 128,000 个 token
• 总参数与激活参数 — 未披露,对比总计 2.8 万亿,每个 token 激活 1040 亿
• 模态 — 输入文本、图像和文件,输出文本,对比输入文本和图像,输出文本
• 权重 — 闭源,仅 API,对比开源、无门槛、下载量超过 100 万
• 长上下文条款 — 当输入 token 超过 272,000 时,对整个请求重新定价,输入和缓存为 2 倍,输出为 1.5 倍;对比已发布价目卡上没有同等条款
• 智能指数,独立,最大努力 — 51.8 对比 43.6
• 每项指数任务成本,独立 — $0.72 对比 $2.00
• 指数运行中的输出 token — 6700 万对比 1.6 亿,而其对比类别的榜单中位数为 1.4 亿

K3 赢下的那一项评测,以及它为何重要

在算术之前,先说例外,因为它是真实存在的。在 Artificial Analysis v4.3.2 上以最大努力逐项评估打分,GPT-6.1 Sol 在十项中领先七项,且没有任何并列,但赢得长上下文推理评估的模型是 K3:

• AA-LCR v1.1——Kimi K3 0.887 对 GPT-6.1 Sol 0.830。在专为长输入推理构建的评测上领先六分。
• SciCode——Kimi K3 0.595 对 GPT-6.1 Sol 0.542。K3 在科学编程方面同样领先。
• Terminal-Bench 4.0——Kimi K3 0.126 对 GPT-6.1 Sol 0.561。反方向出现 43 分的差距,也是这组对比中悬殊最大的一项。
• Humanity's Last Exam——Kimi K3 0.469 对 GPT-6.1 Sol 0.529。
• AA-Omniscience——Kimi K3 19.7 对 GPT-6.1 Sol 41.5;在事实可靠性上,两者不属于同一类模型。
• GDPval-AA v2.1——Kimi K3 Elo 1536.5 对 GPT-6.1 Sol Elo 1575.1。
• MMMU-Pro——Kimi K3 0.805 对 GPT-6.1 Sol 0.860。
• AutomationBench-AA、GDP.pdf、CritPt——K3 分别为 0.583、0.22 和 0.234;Sol 分别为 0.649、0.310 和 0.317。

AA-LCR 的结果是值得认真对待的那个,因为它是唯一一个与每任务成本说法相矛盾的数字,并且它指向一种工作负载,其中看似便宜的答案在两个方向上都是错的。如果你的流量是超长输入、适度的生成答案,以及对稳定前缀的大量复用——也就是冗长从未有机会造成影响的那种形态——那么 K3 将顶级长上下文得分、图像输入和可下载检查点结合在一起,比 Sol 更合适,而且索引运行的每任务成本数字并不适用于你。这就是“开放权重值得溢价”的诚实版本:有时开放模型就是更适合这项工作的模型,而在这里,它在一个维度上就是如此。

同样值得点明的是,这两项胜利有什么共同之处。K3 在那些可以通过一次长时间的阅读或推理来回答的任务上很强,而在那些必须拆成许多小步骤来执行并加以核查的任务上则较弱。43 分的 Terminal-Bench 差距与 22 分的 omniscience 差距,是同一个发现从两个角度看到的景象:持续性的智能体式执行,并非这个 checkpoint 所优化的方向。

算术,这才是真正决定结果的东西

K3 的费率卡在每一项上都是 Sol 的 1.5 倍,而其每完成一个索引任务的实测成本是 2.8 倍,1.5 与 2.8 之间的差距完全可以用 token 量来解释。董事会自己的测量结果是,在同一套十项评估中,K3 使用了 1.6 亿个 token,而 Sol 为 6700 万个。K3 以 1.5 倍的价格产出了 2.4 倍的输出,而 2.4 × 1.5 = 3.6——董事会给出的 2.00 美元对 0.72 美元这个数字比纯比率稍微好看一些,因为输入和缓存的贡献略微抵消了它,但方向是无可争议的。

Moonsh​oot 自家的营销宣传与此相抵触,其方式值得仔细琢磨。该公司声称 K3 比其前代输出更少的 token,而架构层面的工作——注意力方案、残差设计——正是直指长上下文解码成本。这两点都可能是真的,同时该模型在通用套件上仍然比基准中位数冗长一倍。这两种说法针对的是不同的事:相对于上一代 Kimi 的效率,以及相对于整个领域的效率。只有第二种才是你被计费所依据的标准,也是独立董事会所衡量的那一个。

缓存会缓和这一点。两种缓存输入价格均为各自模型非缓存输入价格的十分之一——K3 为 $0.30,Sol 为 $0.10——因此缓存这一行并不会改变排序,但它确实意味着,请求密集、回答精简的工作负载会将差距缩小到大致相当于价目表比例,而非实测任务比例。而 Sol 的长上下文条款则走向相反:当输入超过 272,000 个 token 时,它会将整个请求重新定价为 $4.00 和 $15.00,缓存价为 $0.20,这是 K3 的固定价目表唯一完全胜出的区间。这值得了解,原因有两点,因为这也是 K3 的长上下文得分在本次对比中表现最佳的区间。

A generated hero card for a GPT-6.1 Sol versus Kimi K3 comparison, headed 'The download exists, and it is still the dearer option', with two badges reading 'Kimi K3: $2.00 per index task' and 'GPT-6.1 Sol: $0.72 per index task', and the OrcaRouter logo in the bottom-right corner.

开放权重在这里究竟有什么价值

三件事,值得把它们分开来说,因为“开放权重”通常被当作一个论点来使用,而它其实是三个。

第一点是你可以离开。如果 Moonsh​oot 被收购、更改未来版本的许可证、弃用 K3 或提高其 API 价格,你已下载的检查点仍会继续运行。这对本实验室而言并非假设:Moonsh​oot 曾在较早一次发布后的约 48 小时内暂停了新订阅,以保护现有付费客户的服务质量,这生动地证明了 API 访问权是一项政策决定,而非一种固有属性。这些都不会出现在每任务成本表格中,而这一切都是真实存在的。

第二点是,你可以固定版本。一个固定的修订版,经过微调,运行在你能控制的边界内,是能展示给审计人员看的东西,而 API 无法提供这一点。对于受监管的流量来说,这比费率卡更有价值。

第三种——通常被默认的那一种——是它会更便宜。事实并非如此。这个检查点是一个 2.8 万亿参数的 FP8 产物,而公开的部署指南是围绕多加速器配置而非单节点来设计的。已经在运营这类集群的团队在这里有一个真正的选择,而且整个账本会彻底改变,因为一个 token 的边际成本变成了电费。而没有这类集群的团队,则是在把 API 账单与一笔资本性采购做比较,而 API 账单会以很大差距胜出。诚实的总结是:这里的开放权重给你的是离开的能力,而不是廉价运行的能力。

两者都在同一个键上,而这正是让这笔交易有用的部分

Kimi 在 OpenRouter 上按 OpenRouter 自己的标价,每百万 token 为 $3.00 和 $15.00,费率未变,与厂商价目卡一致——而 GPT-5.2 也已按 OpenRouter 自己的价格在我们这边落地,每百万输入 token 为 $2.00 和 $15.00,272-token 档位完全按所列价格透传。两者都没有任何加价。OpenRouter 透传厂商标价,而不是加价,因此 Moonshot 的费率变化和 OpenAI 的费率变化都会在厂商端出现的同一天出现在我们这边,无需第二份合同,也没有中间经销商。

A screenshot of the OrcaRouter model page for kimi/kimi-k3, showing the listing dated 2026-07-15, the model described as Moonshot AI's 2.8-trillion-parameter mixture-of-experts flagship for long-horizon coding and end-to-end knowledge work, a 1M-token context with text and image input, and the list price of $3.00 input and $15.00 output per million tokens with an 8.48 s median time to first token.

对这两个模型来说,这一点比大多数组合都更重要,原因是二者属于不同的失效模式。GPT-6.1 Sol 是你在需要持续执行、工具循环和事实可靠性时运行的模型;Kimi K3 则是你在处理超长输入、想要最佳长上下文得分,并且想要一个检查点来对冲别人的商业决策时运行的模型。它们不是相互竞争的选择,而是同一条流量上的两条路线。把两者放在同一个端点后面,在它们之间自动故障转移,并制定规则将长输入工作转给 K3、执行工作转给 Sol——这才能把“我们有一个开放权重后备方案”从设计文档里的一句话,变成凌晨三点、在一次正在失败的呼叫中真正能起作用的东西。

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

每个所属的地方

• 终端智能体、仓库级编码、多步骤执行 —— GPT-6.1 Sol,在 Terminal-Bench 4.0 上领先 43 分。这差距可不小。
• 在幻觉代价高昂之处给出答案 —— GPT-6.1 Sol,在 AA-Omniscience 上领先 22 分。
• 超长输入,配以简短的生成答案 —— Kimi K3。本次对比中最高的长上下文推理得分、图像输入,以及一种根本无从发挥的冗长。
• 自托管,或是一套你必须能够冻结的推理栈 —— Kimi K3,而且前提是你已经在自行运营硬件。检查点就是交付物;运行它的经济账则是另一回事。
• 对冲供应商更改条款的风险 —— Kimi K3,而这是 GPT-6.1 Sol 无论出价多高都无法回应的一条论据。
• 按价目表来做选择 —— 在本次对比中,K3 和 Sol 都不是便宜的那个选项,而在 GPT-6 系列中,两者也都不是便宜的选项。如果决定因素是账单金额,你想要的模型在价格表上更靠下的位置,而不是在这张表上。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新