一张生成的标题卡,上面写着“Kimi K4”,副标题为“泄露信息说了什么,又没说什么”,带有“泄露 / 未经验证”徽章,三行堆叠文字分别为“无模型卡”“无权重”和“无价格或路由”,页脚一行写着“截至 2026 年 9 月 25 日”,右下角合成有 OrcaRouter 标志。
Guides & Insights

Kimi K4:泄露信息究竟声称了什么,以及为什么“更少的活跃参数”才是真正的关键

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

一条帖子同时让四个尚未公布的模型名称流传开来。这份名单从K​imi K4开始,据称它是 Moonshot AI 的下一代,与GLM-5.5 Flash和GLM-5.4(来自 Z.ai)以及D​eepSeek V4.1P并列——而作者本人强调的重点并不在任何旗舰名称上,而在于对 K4 底层算术的怀疑:它可能激活更少的参数——少于它所取代的模型。该说法尚未得到证实。没有 K​imi K4 的模型卡、没有权重、没有 API 标识符、没有价格,也没有路由,名单中的每个 Z.ai 名称同样如此。现在值得做的是弄清楚这些说法中哪些可以核实、已发布的基线是什么样,以及一个更稀疏的 K4 实际意味着什么。

信号及其层级

这是一个早期信号,也应当被当作早期信号来解读。承载它的那篇帖子解读的是模型命名惯例,而不是对某个目击发现的报告:它将“GLM-5.5 Flash、GLM-5.4”点出为有趣的命名,并称 Kimi K4“非常奇怪”,随后提出了一种推测性机制——更少的激活专家——但并未声称自己看到过配置、检查点列表或暂存端点。

公开记录中没有任何内容与这些名称相矛盾,也没有任何内容能证实它们。这种不对称在发布周期的这个阶段很正常,而这正是为什么有用的做法是确定基线和测试,而不是继续猜测。帖子中的一个名称只是关于某个产品的假设,而不是该产品存在的证据。

衡量 Kimi K4 所参照的基准

Kimi K3 是真实存在的、已经发布,并且文档异常完善,这使其成为一个可靠的参照点。Moonshot 自己的模型卡描述了一个 2.8 万亿参数的混合专家(Mixture-of-Experts)模型,每个 token 激活 104B 参数,分布在 93 层中——一层稠密层和 92 层稀疏层。这种稀疏性非常激进,并且被明确说明:每个 token 从 896 个专家中激活 16 个,再加上 2 个共享专家,Moonshot 认为这相比 Kimi K2 带来了约 2.5 倍的扩展效率提升。

注意力栈正是 K3 与前代分道扬镳之处。在其 92 个稀疏层中,69 层采用 Kimi Delta Attention——一种混合线性注意力机制——24 层采用门控 MLA,形成 3:1 的分配,保留少数全注意力层,其余则走更廉价的线性路径。每 12 个块,各层会携带一次注意力残差;激活函数为 SiTU-GLU;整个模型在量化感知训练下,使用 MXFP4 权重和 MXFP8 激活进行训练。上下文长度为 1,048,576 个 token,词表规模为 163,840,视觉能力经由一个 401M 参数的 MoonViT-V2 编码器运行,这使 K3 原生具备图像能力,而非靠外挂实现多模态。

Screenshot of the Artificial Analysis model page for Kimi K3 (max), headed "Released July 2026", whose comparison summary reads In $3.00 / Out $15.00 and describes the model as leading on intelligence but expensive next to other open-weight models of similar size, notably slow and somewhat verbose, with text and image input and a 1M-token context window.

这些就是继任者必须改变的数字。请注意它们对“更少活跃参数”这一思路意味着什么:K3 已经是一个极其稀疏的模型。它每个 token 激活其总参数量的约 3.7%。一个激活参数少于 104B 的 K4 并不会是在削减过度配置设计中的冗余——它会是在回退一个 Moonshot 公开标榜为胜利的稀疏比例,而且它会在该领域其他模型都朝相反方向发展的这一代这样做。

如果属实,“更少的活跃参数”会意味着什么

目前有两种解读,它们指向相反的方向。更宽容的一种是架构层面的:Moonshot 可能正在进一步扩展 KDA 混合架构,用线性层替换更多全注意力层,并重新平衡专家预算,从而使更低的激活数量换来更长的上下文、更低的服务占用,或更优的单位 FLOP 质量比。按照这种解读,更少的激活参数是对 K3 已经提出的同一论点的精炼——稀疏性是一种扩展策略,而不是一种妥协。

另一种解读是,K4 根本不是统一的继任者。Kimi 的产品线今年已经分叉过一次,而报道也以不同方式暗示 K3.1、K3.2 和 K4 是三种不同的产品。在一个还推出了独立编码变体的产品家族中,K4 的激活量却比 K3 更少,这至少同样符合重新定位的说法,也同样符合直接升级的说法。两种解读都是猜测。无论哪种,都不是一篇帖子能下定论的。

还有一个没人触及的许可维度。K3 的权重依据 Kimi K3 License 发布,这是一种自定义的“其他”许可,而非标准的开源许可,而且它是首个开放的 3T 级模型。更稀疏的 K4 是会继承该许可,还是将其收窄,对任何基于这些权重进行构建的人来说,都比指数分数上的几个点更重要。

A generated two-column scoreboard titled "Kimi K3 vs Kimi K4 — the scoreboard", with six shared rows: Status (K3 "released 15 July 2026" vs K4 "unreleased"), Total parameters ("2.8T" vs "unverified"), Activated parameters ("104B" vs "unverified"), Experts per token ("16 of 896" vs "unverified"), Context ("1M tokens" vs "unverified") and Price ("$3 / $15" vs "none"), with the footer line "Kimi K3 figures per Moonshot's model card; Kimi K4 has no model card, weights or price."

同一帖子中的另外三个名字

GLM-5.5 Flash和GLM-5.4才是更令人意外的一对,而且原因并不在于数字本身。Z.ai 公开的天花板是 GLM-5.3,该模型于 2026 年 8 月 14 日发布,参数量为 743B;GLM-5.3-Flash 于 8 月 26 日跟进,BF16 与 Flash-BF16 权重则于 8 月 25 日发布。Z.ai 自家文档中恰好列出了三个当前模型标识符:glm-5.3、glm-5.3-flash 和 glm-5.2。根本不存在 GLM-5.4,也没有 GLM-5.5,更没有 GLM-5.5 Flash——而真正奇怪的是命名的方向,因为 5.5 一代排在 5.4 一代之前,这从来不是 Z.ai 为一个系列编号的方式。泄密信息中出现顺序错乱的版本号是一种常见的故障模式:它们往往是相邻产品、内部代号,或某个服务层级的标签,而不是新的基础模型。

DeepSeek V4.1P是信号作者表示自己最感兴趣的名称,也是四个中最容易核实的一个。DeepSeek 的 API 文档恰好列出了两个当前模型字符串:deepseek-flash和deepseek-v4-pro。“P”后缀在任何 DeepSeek 标识符中都没有对应项,而 DeepSeek 自家组织中最新的权重发布是 DeepSeek-V4.1-Flash,发布于 2026 年 9 月 10 日。V4.1P 最可能是该模型的 Pro 层级同门型号——但“最有可能”只是对一个字符串的猜测,而不是对一款产品的判断。

你怎么会知道这其中任何东西是真的?

这四个名称以同样的方式未能通过同一项检验,这让等待变得轻松直接,而非煎熬。真正的发布总会留下制品,而每一项检查起来成本都很低:

• 在厂商自己的 Hugging Face 组织中的模型卡。Moonshot 的最新条目是 Kimi-K3,创建于 2026 年 6 月 13 日;Z.ai 的最新作品是 25 日的 GLM-5.3 系列;DeepSeek 的最新作品是 9 月 10 日的 DeepSeek-V4.1-Flash。这三家中都不存在更新的东西。

• 一份能平息争论的配置。具体到 K4,要留意的字段是 num_experts 和 num_experts_per_token——K3 的读数是 896 和 16。如果某个 K4 配置的每 token 数值更低,那么这个泄漏中的说法就能在单个文件中得到证实或推翻。

• 一个可路由的模型。出现在目录中的名称,背后有价格、上下文窗口和提供商;只出现在帖子里的名称,则这些一概没有。

Screenshot of the OrcaRouter model page for kimi/kimi-k3 by MoonshotAI, dated 2026-07-15, with Vision, Tools, JSON and Reasoning capability chips and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

目前您可以路由的内容

这则泄露消息的现实意义在于,它所描述的那一代并不是你可以作为构建基础的那一代。真正在线可用的是上一代,而路由器要做的是把代际之间的差距变成一个路由决策,而不是一个迁移项目。Kimi K3 现已上线,具备完整的 100 万 token 上下文和原生视觉能力,定价为每百万输入 token 3.00 美元、每百万输出 token 15.00 美元,缓存读取为 0.30 美元——按供应商价格计费,零加价,因此 K3 的供应商价格变动会在当天就反映到你的账单上,而不是等到下一个重新定价周期。OrcaRouter 上的 Kimi K3载有完整规格表与当前费率。

其余产品线也是如此。GLM-5.3、GLM-5.3-Flash 和 DeepSeek V4.1 Flash 都可与 Kimi K3 一同路由,通过同一个兼容 OpenAI 的端点覆盖 200+ 个模型,并在提供商性能下降时自动故障转移,还提供用于表达偏好的路由 DSL——成本上限、质量下限、延迟预算——以策略形式而非逐次调用逻辑来实现。当 Kimi K4、GLM-5.5 Flash 或 DeepSeek V4.1P 真的出现时,迁移不过是路由策略中的一处字符串改动,仅此而已。模型融合让你可以在同一端点上组合多个模型的输出,以适用于能从中获益的任务。

明确说明这不是什么:目前这四个泄露的名称都不是 OrcaRouter 上的路由。我们不托管它们,也无法提供它们。

底线

这里有意思的说法不在于版本号,而在于机制——一款下一代旗舰如果激活更少的参数——比其前代更少——那将是一种表态:Moonshot 认为值得推进的方向是稀疏性,而不是原始激活数量;而 K3 的 16-of-896 专家拆分已经是朝这个方向的论据。这一说法的每一部分都未经证实:Kimi K4、GLM-5.5 Flash、GLM-5.4 和 DeepSeek V4.1P 都没有模型卡、没有权重、没有 API 标识符,也没有价格,而且这些厂商自己的产品目录各自都早停了一代。把这些名称当作一个问题的预告,而不是答案——如果你今天需要 1M 上下文的前沿级开放权重,Kimi K3 才是已经存在的模型。

当 Kimi K4 真的到来时,自动故障转移正是防止这次迁移演变成一场事故的关键