生成了主视觉标题卡,主标题为“GPT-6 Luna vs Kimi K3”,副标题为“四倍的吞吐量,三十分之一的价格”,页脚文字为“价格依据 OpenAI 和 Moonshot AI;指数数据依据 Artificial Analysis。”,右下角合成有 OrcaRouter 徽标。
Guides & Insights

GPT-6 Luna 对比 Kimi K3:四倍吞吐量,三十分之一价格,一个真正的例外

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

两款模型,都在过去三个月内发布,都被定位为前沿模型家族中的廉价档位,而且都以同样的方式误解了"廉价档位"的含义——其实压根就没误解。Kimi K3是 Moonshot AI 的开源权重旗舰模型,自 2026 年 7 月 27 日起以修改版 MIT 许可证公开,定价为每百万输入 token 3.00 美元、每百万输出 token 15.00 美元,缓存读取为 0.30 美元。GPT-6 Luna是该厂商的走量档位,自 2026 年 9 月 22 日起正式可用,价格为 0.10 美元和 0.50 美元,缓存读取为 1 美分。输入上贵三十倍,输出上也贵三十倍,而其中一方持有的许可证,另一方无论出什么价都拿不到。

不过,决定这一配对的并不是费率卡,因为它还没接近到需要取舍的程度。真正起决定作用的是一个两家厂商都不会写进标题里的数字:实测输出速度。Kimi K3 每秒生成 38.7 个 token。GPT-6 Luna 每秒生成 153.9 个。这是四倍的差距,而对于任何把模型当作循环内部组件、而非供人对话的终端的负载来说,四倍的吞吐量差异改变的是架构,而不只是账单。

这两个实际上是什么

Kimi K3 是一个拥有 2.8 万亿参数的混合专家模型,每个 token 激活 1040 亿参数,上下文窗口为 1,048,576 个 token,输出上限为 1,048,576 个 token,其权重以 Modified MIT 许可证在 Hugging Face 上发布。它是独立榜单上得分最高的开放权重模型——在 112 个开放权重模型中排名第一——并在 Code Arena 的 WebDev 排行榜上以 1,679 Elo 位居榜首。Moonshot 报告其在 Terminal-Bench 2.0 上达到 88.3%,这是厂商数据,未经独立复现。

GPT-6 Luna 是 OpenAI GPT-6 代中的小型档位,定位低于定价为 $2.00/$10.00 的 GPT-6 Sol,更远低于旗舰级的 GPT-6 Astra($10.00/$50.00)。支持文本与图像输入、文本输出,拥有 1,050,000 token 的上下文窗口,最大输入 922,000 token,输出上限 128,000 token,推理强度可在 none、low、medium、high、xhigh 和 max 之间选择,默认值为 medium。它是闭源的、单一标识符,任何拥有 API 密钥的人都可以使用。

一个是下载,一个是端点。两者都按用量定价。这就是对比的轮廓。

卡片,逐行

每个维度一行,每行均包含两侧:

• 每百万输入 — GPT-6 Luna $0.10 vs Kimi K3 $3.00

• 每 1M 输出 — GPT-6 Luna $0.50 vs Kimi K3 $15.00

• 每 1M 缓存输入 — GPT-6 Luna $0.01 对比 Kimi K3 $0.30,在两张卡上均为其自身输入费率的十分之一

• 长上下文条款 — GPT-6 Luna 在输入超过 272,000 个 token 时,将输入和缓存翻倍,并将输出提升 1.5 倍,且适用于整个请求;而 Kimi K3 的卡片上未发布等效条款

• 上下文窗口 — GPT-6 Luna 为 1,050,000 tokens,最大输入 922,000,对比 Kimi K3 的 1,048,576 tokens

• 最大输出 — GPT-6 Luna 128,000 tokens,对比 Kimi K3 的 1,048,576 tokens,上限高出八倍

• 智能指数(独立评测)—— GPT-6 Luna 在最高算力投入下得 37 分,对比 Kimi K3 在最高算力投入下得 44 分,基于同一版指数

• 默认推理强度得分——GPT-6 Luna 29 在其默认中等设置下,对比在最高设置下测得的 Kimi K3

• 每项 Index 任务的成本,独立计算——GPT-6 Luna 约 $0.07,而 Kimi K3 为 $2.00

• 索引运行中的输出 token 数——GPT-6 Luna 150M 对比 Kimi K3 160M,对照榜单中位数 88M;两者都比榜单的中位数模型冗长得多

• 输出速度,独立 — GPT-6 Luna 153.9 tokens/秒 vs Kimi K3 38.7 tokens/秒

• 权重 — GPT-6 Luna 闭源,仅提供 API;而 Kimi K3 自 2026 年 7 月 27 日起在 Hugging Face 上公开

• 许可证 — GPT-6 Luna 不适用,而 Kimi K3 Modified MIT 则不同:它与 MIT 并非同一法律文书

• {{1}}总参数量{{/1}} — GPT-6 Luna 未披露,而 Kimi K3 为 28,000 亿,其中每 token 激活 1,040 亿

• 突出证据 — GPT-6 Luna 的工具调用与智能体循环,每 1,000 个缓存输入 token 仅需十分之一美分,对比 Kimi K3 在 Code Arena WebDev 排名第一、Elo 达 1,679,Terminal-Bench 2.0 达 88.3%(厂商报告),并在独立榜单上获得开放权重模型最高分

• 在 OrcaRouter 上——GPT-6 Luna 不在我们的目录中,而 Kimi K3 可按 Moonshot 的标价路由

Generated two-column scoreboard titled 'GPT-6 Luna vs Kimi K3 - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index at max effort 37, Output speed 153.9 tok/s, Context 1,050,000, Weights closed. Right column Kimi K3 rows: Price in/out $3.00 / $15.00, Cached input $0.30, AA Index at max effort 44, Output speed 38.7 tok/s, Context 1,048,576, Weights Modified MIT. Footer: 'Prices per OpenAI and Moonshot AI; index and speed per Artificial Analysis.'

吞吐量是没人会拿来当头条的规格指标

每秒 38.7 个 token 的模型与每秒 153.9 个 token 的模型,并不是贴着不同价格标签的同一款产品。它们是不同的产品。

设想一个任务,模型必须生成 1,500 个 token 的回答——一份摘要、一次结构化提取、一个带解释的代码补丁。按每秒 153.9 个 token 计算,这个回答大约需要十秒。按 38.7 计算,则大约需要三十九秒。这两个数字都不包含推理时间或网络延迟,因此现实世界中的差距按比例会大于四倍,而不是更小。

现在把它放进一个循环里。一个智能体为完成一项任务要发起三十次模型调用——规划、选择工具、读取结果、决定下一步、重复——这些调用合计会产生大约 15,000 个输出 token。GPT-6 Luna 生成大约需要 97 秒。Kimi K3 大约需要 388 秒。这就是用户会等待的任务与用户会排期执行的任务之间的差别,而许可条款再宽松也改变不了这一点。

冗长只会加剧速度问题,而不是抵消它。Kimi K3 在完成独立指数时生成了 1.6 亿个输出 token,而 GPT-6 Luna 为 1.5 亿个——所以在该评测中,较慢的模型生成的 token 反而略多,而不是更少。这两个模型的啰嗦程度相当;它们只是速度不相当,而在按输出计费的方案下,啰嗦要付出双重代价。

值得直说,这不是 Kimi K3 的缺陷。一个拥有 2.8 万亿参数、其中 1040 亿活跃参数的模型,每生成一个 token 所做的工作都比小规格层级模型更多,而吞吐量数字正是对这种工作的衡量。相关的问题是,你的工作负载是否需要这些工作。如果需要,那么每秒 38.7 个 token 就是获得这种能力的代价。如果不需要,那你就是在为并未要求的深思熟虑买单,而且要多付三十倍。

K3 七点所在之处

Kimi K3 在最大努力下于独立的 Intelligence Index 上得分 44。GPT-6 Luna 在相同设置下得分 37。七分——在一个综合评分中,其中一分仍处在重跑的噪声范围内——而两者在每完成一项任务的成本上相差约二十八倍:$2.00 对约 $0.07。

这七个点的分布并不均匀。Kimi K3 的声誉集中在编程和智能体软件工作上,而这正是该模型存在的理由:在 Code Arena 的 WebDev 排行榜上,它以 1,679 Elo 位列第一,而厂商给出的 Terminal-Bench 2.0 成绩 88.3% 也是一项编程智能体指标。GPT-6 Luna 自身的编程表现是退步而非进步——其 Coding Agent Index 为 41,比它所取代的 GPT-5.6 Luna 低两个点,下滑主要集中在 SWE-Atlas-QnA 和 DeepSWE v1.1 上。如果你的工作是让智能体针对真实代码仓库编写软件,那么这就是七点的指数差距和两点的代际倒退,且都指向同一个方向,廉价档位的理由也就变得相当薄弱了。

七分差距不成立的地方,恰恰是 GPT-6 Luna 定价所面向的那类工作。分类、抽取、路由、批量摘要,以及需要快速做出是/否判断的智能体内部循环——在这些任务上,两个模型绝大多数时候都会产出同样可用的结果,而这点差异根本经不起你自己的评估集检验。该指数衡量的是一个高度偏重长时程推理和编程的复合指标,而这两者都不是路由决策所需要的。

关于两侧的指数数值,有一个值得附上的提醒:这个榜单是滚动评估,其修订很重要。同一排行榜更早的快照曾把 Kimi K3 排得显著高于我们今天抓取到的 44,因为综合指标、测试框架和模型集合都在变化。任何依赖滚动指数上两个模型之间精确差距的比较,都是在依赖某种不会保持稳定不变的东西。诚实的解读是:这两者在各自上限处处于相邻的能力区间,而该指数无法告诉你哪一个更适合你的任务。

例外情况:Modified MIT 究竟能为你带来什么

Kimi K3 的许可证是 GPT-6 Luna 无论出价多高都无法应对的一个维度,而它值得比“开放权重”这一说法通常得到的更精确的说明。

权重已在 Hugging Face 上公开,许可证是 Modified MIT,而不是 MIT。这一区别很重要:Modified MIT 许可证通常会附加条件——常见的是,当模型被用于一定规模以上的产品时,要求展示署名——任何计划基于这些权重构建商业产品的人都应阅读实际的法律文本,而不是它所相似的那类许可证名称。这不是回避它的理由。这是在采购文件中不要将其描述为 MIT 的理由。

下载所换来的东西是真实的,也是有边界的。它换来的是成本的下限:在用量足够大时,固定的 GPU 占用可以胜过按量计费的账单。它换来的是对厂商路线图的独立——你自行托管的模型,不会被别人从你脚下弃用掉。它换来的是按自己的数据分布做微调的能力。它还换来一种选择:把提示词留在自己的边界之内——对某些团队而言,这一点在还没谈到价格之前就已经让比较分出了胜负。

真正的成本在于硬件。一个拥有 2.8 万亿参数、1040 亿活跃参数的混合专家模型,并不是一台工作站就能运行的模型。要以生产级吞吐量提供服务,就需要集群级别的投入,涉及资本成本、运营成本,以及你必须自持而非租用的延迟表现。这并不是反对自托管 Kimi K3 的理由——而是说明,正确的比较不是每百万输出 token 15.00 美元对 0.00 美元,而是每百万输出 token 15.00 美元对包含芯片与人员在内的全负荷每 token 成本。对少数组织而言,这个数字更低。对大多数组织而言并非如此,而盈亏平衡点比许可证给人的感觉要远得多。

运行其中一个,或两个都运行

Kimi K3 已上线 OrcaRouter,价格为 Moonshot 的标价,采用透传定价意味着供应商费率一变,我们这边当天就会生效。自动故障转移正是尤其能为这个模型体现价值的部分:自托管或第三方 Kimi K3 端点性能下降,恰恰是你希望路由无需部署就能切换的场景,而每秒 38.7 个 token 的模型,吸收缓慢上游的余量比高速模型更少。

GPT-6 Luna 在本文撰写时尚未收录在我们的目录中,需要通过 OpenAI 自己的 API 来访问,因此想要同时使用两者的团队,要为 Kimi K3 管理一个密钥,同时还得管理它已经用于 OpenAI 的那个密钥。这也正是路由 DSL 能够做到硬编码分流所做不到的事的一种组合:一条把编码和长周期工作发给 Kimi K3、把所有由程序消费且短平快的任务发给 GPT-6 Luna 的规则,所表达的是一个每当任一厂商发布新东西就会移动的边界,而且它是作为配置而移动,而非作为代码路径。模型融合是这里另一个值得点名的配置——由一慢而审慎的模型和一快而廉价的模型组成的小组共同作答,其中廉价成员承担主要流量,昂贵成员则对有分量的案例进行裁决,而这正是这对模型格外契合的一种形态,因为二者之间的成本不对称足够大,以至于把一次 Kimi K3 调用花在一小部分流量上是负担得起的。

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

哪一个,什么时候

如果你的工作负载属于高并发、由程序消费且对延迟敏感的类型,就选 GPT-6 Luna。分类、抽取、路由、批量摘要,以及智能体的内层循环。在 $0.10/$0.50 的价格、仅一美分的缓存读取,以及四倍于 Kimi K3 的吞吐量之下,这笔账差距悬殊,延迟上的差异也绝非边际之别。请显式设置 effort 参数,因为默认值是 medium,而宣传中的 37 是最大 effort 下的数值,同时让长调用始终处在 272,000 token 这条线的正确一侧。

如果你需要权重,就选 Kimi K3;如果你的工作是在真实代码仓库上做智能体编程,而其中真正重要的证据是它的 WebDev 位次以及厂商报告的 Terminal-Bench 2.0 上 88.3% 的成绩,那就选它;如果你需要高于 128,000 个 token 的输出上限,也选它;或者如果你的组织无法向封闭端点发送提示,同样选它。把每秒 38.7 个 token 作为这笔交易的一部分接受下来,并去阅读 Modified MIT 条款,而不是想当然地理解它们。

这种比较容易诱发的错误,是把三十倍的比率当作某个关于能力的问题的答案。它其实是某个关于 token 的问题的答案。而能力问题取决于你需要的是权重还是速度,这两个答案指向的方向恰恰相反。

Screenshot of the OrcaRouter model page for Kimi K3 showing the breadcrumb Home > Models > MoonshotAI > Kimi K3, a FEATURED badge, the model id kimi/kimi-k3, Vision, Tools, JSON and Reasoning chips, a MoonshotAI attribution dated 2026-07-15, the description of a 2.8-trillion-parameter mixture-of-experts model with a 1M-token context window, input pricing of $3.00 and output of $15.00 per 1M tokens, a p50 time to first token of 8.11s, a p95 of 10.00s, and traffic of 1163.7M tokens over seven days.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新