
GPT-6 Sol 对阵 Kimi K3:关于开放权重的三个假设,用一张账单来检验
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
购买开放权重通常是在押注三件事:它们会更便宜、能让你拥有掌控权,以及它们是防止供应商改变主意的保险。Kimi K3——Moonshot AI 于 2026 年 7 月 27 日以开放权重发布的 2.8 万亿参数模型——与GPT-6 Sol——2026 年 9 月 22 日发布的闭源模型——为这三点提供了一个干净的测试案例,因为这两个模型在中立榜单上的表现足够接近,以至于这些假设必须独自承担论证的责任。
以下是它们的表现。K3 按任务计算并不更便宜——它大约贵一倍,每百万 token 分别为 3.00 美元和 15.00 美元,而 Sol 是 2.00 美元和 10.00 美元。控制是真实存在的,但有一个大多数团队都不会跨越的硬件下限。而保险是唯一一个完全站得住脚的假设,这也使它成为唯一值得为之付费的假设。接下来就是每一项背后的算术。
两个模型,简述
Kimi K3 是一个稀疏混合专家模型,总参数量达 2.8 万亿,而每个 token 激活约 1040 亿——约 3.7%——的参数,以 Modified MIT 许可证发布,上下文窗口为 1,048,576 个 token。Moonshot 的架构主张很具体:Kimi Delta Attention,一种混合线性注意力方案,该公司称其在长上下文解码中最高可快 6.3 倍,外加 Attention Residuals 和一个 Stable LatentMoE 框架。它接受文本和图像输入,返回文本。未蒸馏模型的大小超过 1 TB,而生产部署被描述为至少需要 64 个加速器。
GPT-6 Sol 是闭源的,采用单一标识符,统一定价为 $2.00 和 $10.00,缓存读取为 $0.20,缓存写入为 $2.50;当输入 token 超过 272,000 时,整个请求的价格会调整为 $4.00 和 $15.00。它支持文本和图像输入、文本输出,上下文窗口为 1,050,000 token,最大输入为 922,000 token,输出上限为 128,000 token,知识截止日期为 2026 年 4 月 20 日。
在实际应用中,上下文窗口的大小是一样的——相差仅 0.1%。这就消除了倾向于选择其中一个的最常见理由,也意味着这个决定完全取决于那三个假设。
假设一:开放权重更便宜。并非如此。
• 输入 — GPT-6 Sol 每百万个令牌 2.00 美元 vs Kimi K3 每百万个令牌 3.00 美元
• 输出 — GPT-6 Sol 每百万 tokens $10.00,而 Kimi K3 每百万 tokens $15.00
• 缓存输入——GPT-6 Sol 每百万个 token 0.20 美元,对比 Kimi K3 每百万个 token 0.30 美元;两者均为未缓存输入费率的十分之一
• 智能指数,独立评测 —— GPT-6 Sol 在最高推理强度下达 48,对比 Kimi K3 在最高推理强度下为 44
• Index 任务成本,独立计算 — GPT-6 Sol $1.06 vs Kimi K3 $2.00
• 索引运行的输出词元 — GPT-6 Sol 77M 对比 Kimi K3 160M
• 上下文窗口 — GPT-6 Sol 1,050,000 个 token 对比 Kimi K3 1,048,576 个 token
• 权重 — GPT-6 Sol 闭源 vs Kimi K3 开源,可下载、可自托管
• 许可证 — GPT-6 Sol 不适用,对比 Kimi K3 修改版 MIT
• 总参数量 —— GPT-6 Sol 未披露,对比 Kimi K3 的 2.8 万亿,其中每个 token 激活 1040 亿
Sol 在费率表的每一项上都更便宜,而且差距最大的地方,恰恰正是智能体工作负载花钱最多之处。独立委员会在方向上一致,在幅度上也大致认同:每完成一个任务,Sol 的成本约为一半,而指数得分却高出四个点。要运行同一指数,K3 生成的输出 token 数量是 Sol 的两倍多一点。
有一个细微之处让这还不至于变成一边倒的碾压。Moonshot 声称 K3 的输出 token 数比前代少 21%,而架构层面的工作——注意力方案、残差设计——直指长上下文解码成本。在以超长输入为主的工作负载上,K3 的效率特性可能会缩小索引运行所显示的部分差距。还没有人在可比的评测框架上公布过这项测量结果,所以应把它视为有合理机制支撑的厂商说法,而不是一项结果。


假设二:开放权重让你拥有控制权。但受限于硬件门槛。
这种控制是真实存在的,值得精确说明,因为“开放权重”常被随意使用。可下载检查点上的 Modified MIT 许可证意味着你可以在自己的硬件上运行模型、对其进行微调、固定到特定修订版本,并将推理保持在你能控制的边界内。无论出价多少,GPT-6 Sol 都无法提供其中任何一项。
它的意思并不是:在成本上,自托管可以替代 API。已公布的数据显示,全精度检查点约为 4.9 TB,而在 1 比特量化下约为 397 GB,部署下限处于 410 GB 的组合内存范围内,生产部署则以 64 个加速器来描述。已经在运行这类集群的团队,在这里有一个真正可行的选项。而尚未运行这类集群的团队,则是在拿 API 账单与资本购置相比较,而 API 账单会以很大优势胜出。
控制论证的诚实版本比通常表述的更狭窄:开放权重赋予你离开的能力,而不是低成本运行的能力。这两者不是一回事,而大多数团队只能得到其中一种。
假设三:开放权重是一种保险。这一条成立。
第三个假设在上面的每一个数字面前都依然成立,而这就是K3之所以有市场的原因。Moonshot可以被收购,可以更改未来版本的许可证,可以弃用K3,可以提高价格,可以暂停订阅——而且它在发布后48小时内确实暂停了新订阅,以保护现有付费客户的服务质量,这生动地表明,API访问是一种政策决定,而不是一种属性。
如果 K3 被弃用,你下载的权重依然能跑。如果 Moonshot 把 API 价格提高两倍,你的自托管部署不受影响。如果你需要向审计人员证明你的推理栈冻结在某个已知版本上,检查点能给你这个证明,而 API 不能。这些都不会出现在单任务成本表上,而它们全都是实实在在的。
问题在于它值多少钱。根据上面的数字,为这份保险,你每完成一个任务大约要付双倍的钱,还要在能力上多付四个指数点。对于 API 弃用就意味着业务中断的工作负载来说,这很便宜。对于你本来就会直接切换模型的工作负载来说,这就是为一项你永远不会行使的对冲支付溢价。
如果你想让它们这样,两者都在同一个按键上。

Kimi K3 已上线 OrcaRouter 的目录,按 Moonshot 的标价提供,采用直通模式,让 Moonshot 的价格变动当天就在我们这边生效,而不是等到经销商重新议价之后。截至本文撰写时,GPT-6 Sol 尚未进入我们的目录,可通过 OpenAI 自家的 API 访问。
对于这个特定决策而言,这种组合的价值比听起来更大,因为这两个模型属于不同的失效模式。运行 K3 的理由并不是它更便宜——它并不便宜——而是它是一种对冲,而一种你无法快速切换过去的对冲,算不上了不起的对冲。把 K3 放在与其他一切相同的端点背后,配上自动故障转移和一条可在配置中更改的路由规则,才能把“我们有一个开放权重的后备方案”从演示文稿里的一页幻灯片,变成凌晨三点真正管用的东西。
每个到底是做什么用的
• 如果你想要在通用工作上每完成一项任务的成本最低——那就是 GPT-6 Sol,而且优势大约是 2 倍。
• 如果你想在两者的中立榜单上拥有最强的能力——GPT-6 Sol,领先四分。
• 如果你已经在运营一个 400 GB 以上内存级别的集群,并且需要在自有边界内进行推理——K3,那么整个权衡就完全改变了,因为模型权重的边际成本与硬件的成本并不相同。
如果你的真正需求是你的模型不能被从你身边夺走——K3,而这是对比中Sol唯一无法回答的论点。
• 如果你是因为 K3 看起来是那个更便宜的中国模型,才按每 token 价格来做选择——先看看 token 数量。索引运行中,K3 的输出 token 达到 1.6 亿,而 Sol 是 7700 万:更低的单价买到的是更多 token,而不是更小的账单。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
