一张为标题为“Grok 4.7 vs Kimi K3 —— 价格与上下文之争”的文章生成的主视觉标题卡,副标题为“两个前沿模型,两种不同的押注”,以及数据标签分别显示:价格 $2/$6 vs $3/$15,上下文 500K vs 1M,开放权重 否 vs 是。
Guides & Insights

Grok 4.7 与 Kimi K3 对比:价格减半,上下文减半,权重全无

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

假设有一个月消耗 3 亿 token 的智能体编程工作,按两家模型的标价分别跑一遍,这个选择就不再像是一场基准测试层面的争论了。Grok 4.7于 2026 年 9 月 21 日由 SpaceXAI 发布,每百万输入 token 收费 2 美元,每百万输出 token 收费 6 美元。Kimi K3于 2026 年 7 月 16 日由 Moonshot AI 发布,收费分别为 3 美元和 15 美元。在那样一个假设的月份里——比如 2 亿输入、1 亿输出——Grok 4.7 大约要花 1,000 美元,Kimi K3 则大约要花 2,100 美元。这个差距可不是四舍五入的零头;它相当于再多养一个模型的预算。相比之下,Kimi K3 给你的是 100 万 token 的上下文窗口,而不是 50 万;除图像外还支持原生视频输入;以及可下载的权重。Grok 4.7 给你的则是一个更快、更便宜、闭源的模型,而且是明确针对长时程终端任务训练的——Kimi K3 同样瞄准这一目标。两者都属前沿级别。但它们不是同一笔买卖。

两个模型,简述

Grok 4.7 是 SpaceXAI 的前沿编程与知识工作模型,其基础模型比 Grok 4.6 更大,并经过了更长时间的强化学习训练,专门针对可能耗时数小时的任务。它是专有模型——不开放权重,也不提供下载——支持 500,000 token 的上下文窗口,可接收文本和图像并输出文本,并支持从 low 到 xhigh 的推理强度等级。其最大卖点是速度与价格:SpaceXAI 将其定位为速度约为同类模型的两倍,价格约为其一半。

Kimi K3 是 Moonshot AI 的旗舰级开放混合专家模型,也是首个跻身三万亿参数级别的开放模型:总参数达 2.8 万亿,每个 token 激活 1040 亿参数,基于 Kimi Delta Attention 与量化感知的 MXFP4 权重构建。它可接收文本、图像和视频输入,支持 100 万 token 的上下文窗口,推理始终开启且强度可配置;其权重可在 Kimi K3 许可证下下载——允许商业使用,但附有相关限制。从设计上看,它就是那款你能带回家的模型。

这就是它们之间全部的结构性差异。一个是廉价、快速、封闭的端点。另一个是更昂贵、更缓慢、上下文长度翻倍的开放产物。下文的一切都是这一点的结果。

基准测试实际比较的是什么

这正是大多数关于 Grok 4.7 与 Kimi K3 的对比文章出错的地方,所以有必要直言不讳:这两个模型公布的数据在很大程度上衡量的并不是同样的东西,而且至少有一对看起来可比的数字其实并不可比。

先从那个真正具有误导性的对比说起。Kimi K3 的发布材料引用了 Terminal-Bench 2.1 上 88.3 的分数。Grok 4.7 的发布材料引用了 Terminal-Bench 4.0 上 38.0% 的成绩。它们是不同的基准版本,任务集不同,评分方式也不同,把它们并列会让人觉得 Kimi K3 作为智能体模型的能力是后者的两倍以上。这种解读站不住脚,任何人都不应重复。这两个数字也都是厂商自报的——都没有经过独立复现。

可以比较的是独立综合评分,而在这方面两者很接近。在当前的 Artificial Analysis Intelligence Index(版本 v4.3.2)上,Kimi K3 得分为 44——在 113 个模型中排名第二,是所有开放权重模型在该榜单上的最高名次。Grok 4.7 得分为 46,在 655 个模型中排名第十六。两者相差两分,而 Kimi K3 的名次是在最高推理努力下取得的。在混合综合评分上,这些模型不相上下。

• 独立综合评分——Grok 4.7 在 AA Intelligence Index v4.3.2 上为 46,而 Kimi K3 在同一版本上为 44。实际上打成平手。

• 上下文窗口——Grok 4.7 为 500,000 tokens,而 Kimi K3 为 1,000,000 tokens。这是 Kimi K3 真正、无条件的优势,也是唯一一项没有任何附加条件的规格差异。

• 输入模态 — Grok 4.7 支持文本和图像,而 Kimi K3 支持文本、图像和视频。如果你的工作负载涉及视频,Kimi K3 的覆盖范围更广。

• 权重——Grok 4.7 专有,不可下载,而 Kimi K3 在 Kimi K3 许可证下开放权重。对于本地部署或气隙隔离需求,这是唯一重要的一条。

• 每百万 token 价格——Grok 4.7 为输入 $2 / 输出 $6,而 Kimi K3 为输入 $3 / 输出 $15,且 Kimi 的缓存输入价格为每百万 $0.30。Grok 4.7 在每一个维度上都更便宜,在输出方面更是便宜得多。

• 推理强度控制 — Grok 4.7 支持从 low 到 xhigh,而 Kimi K3 始终开启、强度可配置。功能上类似;区别在于 Grok 4.7 允许你调低推理强度。

• 厂商报告的智能体证据——Grok 4.7 Terminal-Bench 4.0 38.0%,CursorBench 4.0 46.3%,DeepSWE v1.1 71.0%(均为厂商报告)对比 Kimi K3 Terminal-Bench 2.1 88.3%,Frontend Code Arena 以 1,679 Elo 位列第一(发布时厂商报告)。不具可比性——见上文。

A generated two-column comparison scoreboard for Grok 4.7 and Kimi K3 with six rows: price $2/$6 vs $3/$15 per million tokens, context 500K vs 1M tokens, AA Intelligence Index 46 vs 44, weights proprietary vs open, modalities text and image vs text, image and video, and speed twice as fast vs slower output, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

钱到底流向何处

费率表低估了差距,因为这两个模型消耗 token 的方式不同。Grok 4.7 是一个冗长的推理模型——Artificial Analysis 在运行其 Intelligence Index 时测得它生成了 2.4 亿个输出 token,而各模型的中位数是 9200 万个。Kimi K3 则是另一种昂贵:它是一个大型的常驻推理模型,按每百万输出 token 15 美元计算,你花钱买的就是它的冗长。

所以诚实的成本模型不是“2美元/6美元对3美元/15美元”。而是每完成一个任务所消耗的输出 token 数乘以输出单价,再加上输入 token(包括每一次重试)乘以输入单价。一个能以每百万 6 美元一次长跑就解决任务的模型,可以胜过需要三次尝试、每百万 15 美元的模型;但如果便宜模型的单次运行足够长,它也可能反胜为败。这是你必须在自己的代码仓库里实测的数据,而不是别人替你发布的数据。

在运行它之前,有一点不对称值得了解:Grok 4.6 作为 Grok 4.7 的前代,在 200,000 个输入 token 处设有一道定价悬崖,一旦请求越过这条线,整个请求就会按双倍费率重新计价。在 Grok 这边做长上下文工作,需要对照你所部署模型的当前价目表核实这一点,因为 500,000 token 的窗口与 200,000 token 的悬崖会产生糟糕的相互作用。Kimi K3 的定价是平坦的,这是两者中更为低调的优势。

每一个在哪里失效

两种模型都有一种发布材料并未首先提及的失败模式,而且它们是不同的失败。

Kimi K3 的强项是持续负载下的可靠性。发布时的社区和独立测试报告称,随着运行时间延长,其智能体性能会下降——单次运行结果强劲,持续通过率较弱——并且其输出速度约为每秒 37 到 38 个 token,这对交互式编程来说偏慢。Moonshot 在发布后不久也不得不暂停新的消费者订阅,因为需求超出了容量,这说明了其托管侧的服务余量。

Grok 4.7 则恰恰相反:它快速、便宜且闭源,这意味着你无法审查它,无法自行运行它,也无法对冲其被弃用的风险。SpaceXAI 已经公开排定了 Grok 4.8、Grok 4.9 和 Grok 5 在此版本之后的发布顺序,而 Grok 4.6 在被取代前大约只存活了五周。任何基于 Grok 4.7 构建的东西,都应把模型 ID 当作一个配置值,而不是一个想当然的前提。

还有第三个考量,它并非任何一种模型的失败:对于为期两周的自主运行而言,两者都不是正确答案,而两家厂商恰恰都演示过这样的场景。已公布的16天和48小时自主编码演示均由厂商自行运行、任务也由厂商选定,且没有经过独立复现。这些演示值得了解,但不值得作为规划依据。

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing Moonshot AI's list pricing of $3.00 per million input tokens and $15.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

两者都运行,以及为什么这才是真正的答案

成本差距和上下文差距指向相反的方向,这正是不能只选一个的理由。Kimi K3 在仓库级工作上物有所值——1M 窗口意味着你无需切分输入——对于任何必须自托管的任务也是如此。Grok 4.7 则在高吞吐量场景中物有所值——高轮次智能体循环、工具调用密集的流水线,以及速度和输出成本占主导的长时间终端会话。

Kimi K3 已上线 OrcaRouter,这使得这种分工成为一项路由决策,而非采购决策。它以 Moonshot 的标价出现在目录中,而由于 OrcaRouter 以 0% 加价透传提供商标价,厂商降价一经宣布当天就在这里生效,而不必等到下一次合同续约。对于长上下文处理与执行处理应当协作而非竞争的工作负载——一个模型将整个代码库尽收眼底,另一个模型对其采取行动——路由 DSL 可将多个模型组合进单次调用,而模型融合则能让一组模型共同作答,前提是这项任务值得这笔额外开销。一个 API 密钥即可覆盖 Kimi K3 以及 200 多款其他模型,因此这种分工中的执行部分可以来自对该任务而言最便宜、最快的模型,而不是恰好持有上下文的那个模型。

有一点需要明确:Kimi K3 的开放权重可以下载,但 OrcaRouter 路由到的是托管端点。如果你的需求确实是本地部署推理,那是一个在你自有硬件上进行的自托管项目,而不是一个路由决策——而且这是这一比较中唯一有单一正确答案的场景。

裁决结果,以及唯一需要记住的那个数字

如果你依据成本和速度来选,Grok 4.7 胜出,而且差距不小:输入价格只有一半,输出价格不到一半,服务速度更快,还有一个可以调低的推理旋钮。如果你依据上下文、模态广度,或拥有模型的能力来选,那么按同样的标准,Kimi K3 胜出。如果只看能力,独立综合评分显示两者相差两分,你应该根据自己的评估来做决定,而不是依据任何一方的发布图表。

要坚守的是最上面那个数字:$2/$6 对 $3/$15。这个对比中的其他一切都可以协商,但这个比例不行。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新