一张用于比较 GPT-6 Sol 与 Kimi K3 的文章主视觉标题卡,标题为“GPT-6 Sol vs Kimi K3”,副标题为“关于开放权重的三个假设,用一张账单来检验”,其中 GPT-6 Sol 为闭源,定价 $2.00/$10.00,指数为 48,而 Kimi K3 为开放权重,定价 $3.00/$15.00,指数为 44。
Guides & Insights

GPT-6 Sol 对阵 Kimi K3:关于开放权重的三个假设,用一张账单来检验

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

购买开放权重通常是在押注三件事:它们会更便宜、能让你拥有掌控权,以及它们是防止供应商改变主意的保险。Kimi K3——Moonshot AI 于 2026 年 7 月 27 日以开放权重发布的 2.8 万亿参数模型——与GPT-6 Sol——2026 年 9 月 22 日发布的闭源模型——为这三点提供了一个干净的测试案例,因为这两个模型在中立榜单上的表现足够接近,以至于这些假设必须独自承担论证的责任。

以下是它们的表现。K3 按任务计算并不更便宜——它大约贵一倍,每百万 token 分别为 3.00 美元和 15.00 美元,而 Sol 是 2.00 美元和 10.00 美元。控制是真实存在的,但有一个大多数团队都不会跨越的硬件下限。而保险是唯一一个完全站得住脚的假设,这也使它成为唯一值得为之付费的假设。接下来就是每一项背后的算术。

两个模型,简述

Kimi K3 是一个稀疏混合专家模型,总参数量达 2.8 万亿,而每个 token 激活约 1040 亿——约 3.7%——的参数,以 Modified MIT 许可证发布,上下文窗口为 1,048,576 个 token。Moonshot 的架构主张很具体:Kimi Delta Attention,一种混合线性注意力方案,该公司称其在长上下文解码中最高可快 6.3 倍,外加 Attention Residuals 和一个 Stable LatentMoE 框架。它接受文本和图像输入,返回文本。未蒸馏模型的大小超过 1 TB,而生产部署被描述为至少需要 64 个加速器。

GPT-6 Sol 是闭源的,采用单一标识符,统一定价为 $2.00 和 $10.00,缓存读取为 $0.20,缓存写入为 $2.50;当输入 token 超过 272,000 时,整个请求的价格会调整为 $4.00 和 $15.00。它支持文本和图像输入、文本输出,上下文窗口为 1,050,000 token,最大输入为 922,000 token,输出上限为 128,000 token,知识截止日期为 2026 年 4 月 20 日。

在实际应用中,上下文窗口的大小是一样的——相差仅 0.1%。这就消除了倾向于选择其中一个的最常见理由,也意味着这个决定完全取决于那三个假设。

假设一:开放权重更便宜。并非如此。

• 输入 — GPT-6 Sol 每百万个令牌 2.00 美元 vs Kimi K3 每百万个令牌 3.00 美元

• 输出 — GPT-6 Sol 每百万 tokens $10.00,而 Kimi K3 每百万 tokens $15.00

• 缓存输入——GPT-6 Sol 每百万个 token 0.20 美元,对比 Kimi K3 每百万个 token 0.30 美元;两者均为未缓存输入费率的十分之一

• 智能指数,独立评测 —— GPT-6 Sol 在最高推理强度下达 48,对比 Kimi K3 在最高推理强度下为 44

• Index 任务成本,独立计算 — GPT-6 Sol $1.06 vs Kimi K3 $2.00

• 索引运行的输出词元 — GPT-6 Sol 77M 对比 Kimi K3 160M

• 上下文窗口 — GPT-6 Sol 1,050,000 个 token 对比 Kimi K3 1,048,576 个 token

• 权重 — GPT-6 Sol 闭源 vs Kimi K3 开源,可下载、可自托管

• 许可证 — GPT-6 Sol 不适用,对比 Kimi K3 修改版 MIT

• 总参数量 —— GPT-6 Sol 未披露,对比 Kimi K3 的 2.8 万亿,其中每个 token 激活 1040 亿

Sol 在费率表的每一项上都更便宜,而且差距最大的地方,恰恰正是智能体工作负载花钱最多之处。独立委员会在方向上一致,在幅度上也大致认同:每完成一个任务,Sol 的成本约为一半,而指数得分却高出四个点。要运行同一指数,K3 生成的输出 token 数量是 Sol 的两倍多一点。

有一个细微之处让这还不至于变成一边倒的碾压。Moonshot 声称 K3 的输出 token 数比前代少 21%,而架构层面的工作——注意力方案、残差设计——直指长上下文解码成本。在以超长输入为主的工作负载上,K3 的效率特性可能会缩小索引运行所显示的部分差距。还没有人在可比的评测框架上公布过这项测量结果,所以应把它视为有合理机制支撑的厂商说法,而不是一项结果。

A six-row scoreboard card titled 'GPT-6 Sol vs Kimi K3 - the scoreboard', comparing the two models on input price, output price, Intelligence Index, cost per task, weight availability and context window. The left column lists GPT-6 Sol at $2.00 input and $10.00 output, an Index of 48, $1.06 per task, closed weights and a 1,050,000-token context; the right column lists Kimi K3 at $3.00 and $15.00, an Index of 44, $2.00 per task, open weights under Modified MIT and a 1,048,576-token context. A footer reads 'Vendor list prices; Index per Artificial Analysis.'Screenshot of the Artificial Analysis model page for Kimi K3 (max), captured 23 September 2026, showing an Intelligence Index score of 44 in the open-weights class, list pricing of $3.00 per million input tokens and $15.00 per million output tokens, a cost of $2.00 per Intelligence Index task, 160 million output tokens generated during the index run, a 1M-token context window, 2.8 trillion total parameters with 104 billion active, and open model weights under the Kimi K3 license.

假设二:开放权重让你拥有控制权。但受限于硬件门槛。

这种控制是真实存在的,值得精确说明,因为“开放权重”常被随意使用。可下载检查点上的 Modified MIT 许可证意味着你可以在自己的硬件上运行模型、对其进行微调、固定到特定修订版本,并将推理保持在你能控制的边界内。无论出价多少,GPT-6 Sol 都无法提供其中任何一项。

它的意思并不是:在成本上,自托管可以替代 API。已公布的数据显示,全精度检查点约为 4.9 TB,而在 1 比特量化下约为 397 GB,部署下限处于 410 GB 的组合内存范围内,生产部署则以 64 个加速器来描述。已经在运行这类集群的团队,在这里有一个真正可行的选项。而尚未运行这类集群的团队,则是在拿 API 账单与资本购置相比较,而 API 账单会以很大优势胜出。

控制论证的诚实版本比通常表述的更狭窄:开放权重赋予你离开的能力,而不是低成本运行的能力。这两者不是一回事,而大多数团队只能得到其中一种。

假设三:开放权重是一种保险。这一条成立。

第三个假设在上面的每一个数字面前都依然成立,而这就是K3之所以有市场的原因。Moonshot可以被收购,可以更改未来版本的许可证,可以弃用K3,可以提高价格,可以暂停订阅——而且它在发布后48小时内确实暂停了新订阅,以保护现有付费客户的服务质量,这生动地表明,API访问是一种政策决定,而不是一种属性。

如果 K3 被弃用,你下载的权重依然能跑。如果 Moonshot 把 API 价格提高两倍,你的自托管部署不受影响。如果你需要向审计人员证明你的推理栈冻结在某个已知版本上,检查点能给你这个证明,而 API 不能。这些都不会出现在单任务成本表上,而它们全都是实实在在的。

问题在于它值多少钱。根据上面的数字,为这份保险,你每完成一个任务大约要付双倍的钱,还要在能力上多付四个指数点。对于 API 弃用就意味着业务中断的工作负载来说,这很便宜。对于你本来就会直接切换模型的工作负载来说,这就是为一项你永远不会行使的对冲支付溢价。

如果你想让它们这样,两者都在同一个按键上。

Screenshot of OrcaRouter's model page for Kimi K3, captured 23 September 2026, showing the model id kimi/kimi-k3 from provider MoonshotAI, a 1,048,576-token context window, text and image input with text output, vision, tool, JSON and reasoning support, list pricing of $3.00 per million input tokens and $15.00 per million output tokens, a p50 time to first token of 8.11 seconds and an OpenAI-compatible API served over both /v1/chat/completions and /v1/responses.

Kimi K3 已上线 OrcaRouter 的目录,按 Moonshot 的标价提供,采用直通模式,让 Moonshot 的价格变动当天就在我们这边生效,而不是等到经销商重新议价之后。截至本文撰写时,GPT-6 Sol 尚未进入我们的目录,可通过 OpenAI 自家的 API 访问。

对于这个特定决策而言,这种组合的价值比听起来更大,因为这两个模型属于不同的失效模式。运行 K3 的理由并不是它更便宜——它并不便宜——而是它是一种对冲,而一种你无法快速切换过去的对冲,算不上了不起的对冲。把 K3 放在与其他一切相同的端点背后,配上自动故障转移和一条可在配置中更改的路由规则,才能把“我们有一个开放权重的后备方案”从演示文稿里的一页幻灯片,变成凌晨三点真正管用的东西。

每个到底是做什么用的

• 如果你想要在通用工作上每完成一项任务的成本最低——那就是 GPT-6 Sol,而且优势大约是 2 倍。

• 如果你想在两者的中立榜单上拥有最强的能力——GPT-6 Sol,领先四分。

• 如果你已经在运营一个 400 GB 以上内存级别的集群,并且需要在自有边界内进行推理——K3,那么整个权衡就完全改变了,因为模型权重的边际成本与硬件的成本并不相同。

如果你的真正需求是你的模型不能被从你身边夺走——K3,而这是对比中Sol唯一无法回答的论点。

• 如果你是因为 K3 看起来是那个更便宜的中国模型,才按每 token 价格来做选择——先看看 token 数量。索引运行中,K3 的输出 token 达到 1.6 亿,而 Sol 是 7700 万:更低的单价买到的是更多 token,而不是更小的账单。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新