
Grok 4.7 与 Kimi K3 对比:价格减半,上下文减半,权重全无
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 219 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
假设有一个月消耗 3 亿 token 的智能体编程工作,按两家模型的标价分别跑一遍,这个选择就不再像是一场基准测试层面的争论了。Grok 4.7于 2026 年 9 月 21 日由 SpaceXAI 发布,每百万输入 token 收费 2 美元,每百万输出 token 收费 6 美元。Kimi K3于 2026 年 7 月 16 日由 Moonshot AI 发布,收费分别为 3 美元和 15 美元。在那样一个假设的月份里——比如 2 亿输入、1 亿输出——Grok 4.7 大约要花 1,000 美元,Kimi K3 则大约要花 2,100 美元。这个差距可不是四舍五入的零头;它相当于再多养一个模型的预算。相比之下,Kimi K3 给你的是 100 万 token 的上下文窗口,而不是 50 万;除图像外还支持原生视频输入;以及可下载的权重。Grok 4.7 给你的则是一个更快、更便宜、闭源的模型,而且是明确针对长时程终端任务训练的——Kimi K3 同样瞄准这一目标。两者都属前沿级别。但它们不是同一笔买卖。
两个模型,简述
Grok 4.7 是 SpaceXAI 的前沿编程与知识工作模型,其基础模型比 Grok 4.6 更大,并经过了更长时间的强化学习训练,专门针对可能耗时数小时的任务。它是专有模型——不开放权重,也不提供下载——支持 500,000 token 的上下文窗口,可接收文本和图像并输出文本,并支持从 low 到 xhigh 的推理强度等级。其最大卖点是速度与价格:SpaceXAI 将其定位为速度约为同类模型的两倍,价格约为其一半。
Kimi K3 是 Moonshot AI 的旗舰级开放混合专家模型,也是首个跻身三万亿参数级别的开放模型:总参数达 2.8 万亿,每个 token 激活 1040 亿参数,基于 Kimi Delta Attention 与量化感知的 MXFP4 权重构建。它可接收文本、图像和视频输入,支持 100 万 token 的上下文窗口,推理始终开启且强度可配置;其权重可在 Kimi K3 许可证下下载——允许商业使用,但附有相关限制。从设计上看,它就是那款你能带回家的模型。
这就是它们之间全部的结构性差异。一个是廉价、快速、封闭的端点。另一个是更昂贵、更缓慢、上下文长度翻倍的开放产物。下文的一切都是这一点的结果。
基准测试实际比较的是什么
这正是大多数关于 Grok 4.7 与 Kimi K3 的对比文章出错的地方,所以有必要直言不讳:这两个模型公布的数据在很大程度上衡量的并不是同样的东西,而且至少有一对看起来可比的数字其实并不可比。
先从那个真正具有误导性的对比说起。Kimi K3 的发布材料引用了 Terminal-Bench 2.1 上 88.3 的分数。Grok 4.7 的发布材料引用了 Terminal-Bench 4.0 上 38.0% 的成绩。它们是不同的基准版本,任务集不同,评分方式也不同,把它们并列会让人觉得 Kimi K3 作为智能体模型的能力是后者的两倍以上。这种解读站不住脚,任何人都不应重复。这两个数字也都是厂商自报的——都没有经过独立复现。
可以比较的是独立综合评分,而在这方面两者很接近。在当前的 Artificial Analysis Intelligence Index(版本 v4.3.2)上,Kimi K3 得分为 44——在 113 个模型中排名第二,是所有开放权重模型在该榜单上的最高名次。Grok 4.7 得分为 46,在 655 个模型中排名第十六。两者相差两分,而 Kimi K3 的名次是在最高推理努力下取得的。在混合综合评分上,这些模型不相上下。
• 独立综合评分——Grok 4.7 在 AA Intelligence Index v4.3.2 上为 46,而 Kimi K3 在同一版本上为 44。实际上打成平手。
• 上下文窗口——Grok 4.7 为 500,000 tokens,而 Kimi K3 为 1,000,000 tokens。这是 Kimi K3 真正、无条件的优势,也是唯一一项没有任何附加条件的规格差异。
• 输入模态 — Grok 4.7 支持文本和图像,而 Kimi K3 支持文本、图像和视频。如果你的工作负载涉及视频,Kimi K3 的覆盖范围更广。
• 权重——Grok 4.7 专有,不可下载,而 Kimi K3 在 Kimi K3 许可证下开放权重。对于本地部署或气隙隔离需求,这是唯一重要的一条。
• 每百万 token 价格——Grok 4.7 为输入 $2 / 输出 $6,而 Kimi K3 为输入 $3 / 输出 $15,且 Kimi 的缓存输入价格为每百万 $0.30。Grok 4.7 在每一个维度上都更便宜,在输出方面更是便宜得多。
• 推理强度控制 — Grok 4.7 支持从 low 到 xhigh,而 Kimi K3 始终开启、强度可配置。功能上类似;区别在于 Grok 4.7 允许你调低推理强度。
• 厂商报告的智能体证据——Grok 4.7 Terminal-Bench 4.0 38.0%,CursorBench 4.0 46.3%,DeepSWE v1.1 71.0%(均为厂商报告)对比 Kimi K3 Terminal-Bench 2.1 88.3%,Frontend Code Arena 以 1,679 Elo 位列第一(发布时厂商报告)。不具可比性——见上文。


钱到底流向何处
费率表低估了差距,因为这两个模型消耗 token 的方式不同。Grok 4.7 是一个冗长的推理模型——Artificial Analysis 在运行其 Intelligence Index 时测得它生成了 2.4 亿个输出 token,而各模型的中位数是 9200 万个。Kimi K3 则是另一种昂贵:它是一个大型的常驻推理模型,按每百万输出 token 15 美元计算,你花钱买的就是它的冗长。
所以诚实的成本模型不是“2美元/6美元对3美元/15美元”。而是每完成一个任务所消耗的输出 token 数乘以输出单价,再加上输入 token(包括每一次重试)乘以输入单价。一个能以每百万 6 美元一次长跑就解决任务的模型,可以胜过需要三次尝试、每百万 15 美元的模型;但如果便宜模型的单次运行足够长,它也可能反胜为败。这是你必须在自己的代码仓库里实测的数据,而不是别人替你发布的数据。
在运行它之前,有一点不对称值得了解:Grok 4.6 作为 Grok 4.7 的前代,在 200,000 个输入 token 处设有一道定价悬崖,一旦请求越过这条线,整个请求就会按双倍费率重新计价。在 Grok 这边做长上下文工作,需要对照你所部署模型的当前价目表核实这一点,因为 500,000 token 的窗口与 200,000 token 的悬崖会产生糟糕的相互作用。Kimi K3 的定价是平坦的,这是两者中更为低调的优势。
每一个在哪里失效
两种模型都有一种发布材料并未首先提及的失败模式,而且它们是不同的失败。
Kimi K3 的强项是持续负载下的可靠性。发布时的社区和独立测试报告称,随着运行时间延长,其智能体性能会下降——单次运行结果强劲,持续通过率较弱——并且其输出速度约为每秒 37 到 38 个 token,这对交互式编程来说偏慢。Moonshot 在发布后不久也不得不暂停新的消费者订阅,因为需求超出了容量,这说明了其托管侧的服务余量。
Grok 4.7 则恰恰相反:它快速、便宜且闭源,这意味着你无法审查它,无法自行运行它,也无法对冲其被弃用的风险。SpaceXAI 已经公开排定了 Grok 4.8、Grok 4.9 和 Grok 5 在此版本之后的发布顺序,而 Grok 4.6 在被取代前大约只存活了五周。任何基于 Grok 4.7 构建的东西,都应把模型 ID 当作一个配置值,而不是一个想当然的前提。
还有第三个考量,它并非任何一种模型的失败:对于为期两周的自主运行而言,两者都不是正确答案,而两家厂商恰恰都演示过这样的场景。已公布的16天和48小时自主编码演示均由厂商自行运行、任务也由厂商选定,且没有经过独立复现。这些演示值得了解,但不值得作为规划依据。

两者都运行,以及为什么这才是真正的答案
成本差距和上下文差距指向相反的方向,这正是不能只选一个的理由。Kimi K3 在仓库级工作上物有所值——1M 窗口意味着你无需切分输入——对于任何必须自托管的任务也是如此。Grok 4.7 则在高吞吐量场景中物有所值——高轮次智能体循环、工具调用密集的流水线,以及速度和输出成本占主导的长时间终端会话。
Kimi K3 已上线 OrcaRouter,这使得这种分工成为一项路由决策,而非采购决策。它以 Moonshot 的标价出现在目录中,而由于 OrcaRouter 以 0% 加价透传提供商标价,厂商降价一经宣布当天就在这里生效,而不必等到下一次合同续约。对于长上下文处理与执行处理应当协作而非竞争的工作负载——一个模型将整个代码库尽收眼底,另一个模型对其采取行动——路由 DSL 可将多个模型组合进单次调用,而模型融合则能让一组模型共同作答,前提是这项任务值得这笔额外开销。一个 API 密钥即可覆盖 Kimi K3 以及 200 多款其他模型,因此这种分工中的执行部分可以来自对该任务而言最便宜、最快的模型,而不是恰好持有上下文的那个模型。
有一点需要明确:Kimi K3 的开放权重可以下载,但 OrcaRouter 路由到的是托管端点。如果你的需求确实是本地部署推理,那是一个在你自有硬件上进行的自托管项目,而不是一个路由决策——而且这是这一比较中唯一有单一正确答案的场景。
裁决结果,以及唯一需要记住的那个数字
如果你依据成本和速度来选,Grok 4.7 胜出,而且差距不小:输入价格只有一半,输出价格不到一半,服务速度更快,还有一个可以调低的推理旋钮。如果你依据上下文、模态广度,或拥有模型的能力来选,那么按同样的标准,Kimi K3 胜出。如果只看能力,独立综合评分显示两者相差两分,你应该根据自己的评估来做决定,而不是依据任何一方的发布图表。
要坚守的是最上面那个数字:$2/$6 对 $3/$15。这个对比中的其他一切都可以协商,但这个比例不行。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
