
Kimi K4:泄露信息究竟声称了什么,以及为什么“更少的活跃参数”才是真正的关键
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 506 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 183 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
一条帖子同时让四个尚未公布的模型名称流传开来。这份名单从Kimi K4开始,据称它是 Moonshot AI 的下一代,与GLM-5.5 Flash和GLM-5.4(来自 Z.ai)以及DeepSeek V4.1P并列——而作者本人强调的重点并不在任何旗舰名称上,而在于对 K4 底层算术的怀疑:它可能激活更少的参数——少于它所取代的模型。该说法尚未得到证实。没有 Kimi K4 的模型卡、没有权重、没有 API 标识符、没有价格,也没有路由,名单中的每个 Z.ai 名称同样如此。现在值得做的是弄清楚这些说法中哪些可以核实、已发布的基线是什么样,以及一个更稀疏的 K4 实际意味着什么。
信号及其层级
这是一个早期信号,也应当被当作早期信号来解读。承载它的那篇帖子解读的是模型命名惯例,而不是对某个目击发现的报告:它将“GLM-5.5 Flash、GLM-5.4”点出为有趣的命名,并称 Kimi K4“非常奇怪”,随后提出了一种推测性机制——更少的激活专家——但并未声称自己看到过配置、检查点列表或暂存端点。
公开记录中没有任何内容与这些名称相矛盾,也没有任何内容能证实它们。这种不对称在发布周期的这个阶段很正常,而这正是为什么有用的做法是确定基线和测试,而不是继续猜测。帖子中的一个名称只是关于某个产品的假设,而不是该产品存在的证据。
衡量 Kimi K4 所参照的基准
Kimi K3 是真实存在的、已经发布,并且文档异常完善,这使其成为一个可靠的参照点。Moonshot 自己的模型卡描述了一个 2.8 万亿参数的混合专家(Mixture-of-Experts)模型,每个 token 激活 104B 参数,分布在 93 层中——一层稠密层和 92 层稀疏层。这种稀疏性非常激进,并且被明确说明:每个 token 从 896 个专家中激活 16 个,再加上 2 个共享专家,Moonshot 认为这相比 Kimi K2 带来了约 2.5 倍的扩展效率提升。
注意力栈正是 K3 与前代分道扬镳之处。在其 92 个稀疏层中,69 层采用 Kimi Delta Attention——一种混合线性注意力机制——24 层采用门控 MLA,形成 3:1 的分配,保留少数全注意力层,其余则走更廉价的线性路径。每 12 个块,各层会携带一次注意力残差;激活函数为 SiTU-GLU;整个模型在量化感知训练下,使用 MXFP4 权重和 MXFP8 激活进行训练。上下文长度为 1,048,576 个 token,词表规模为 163,840,视觉能力经由一个 401M 参数的 MoonViT-V2 编码器运行,这使 K3 原生具备图像能力,而非靠外挂实现多模态。

这些就是继任者必须改变的数字。请注意它们对“更少活跃参数”这一思路意味着什么:K3 已经是一个极其稀疏的模型。它每个 token 激活其总参数量的约 3.7%。一个激活参数少于 104B 的 K4 并不会是在削减过度配置设计中的冗余——它会是在回退一个 Moonshot 公开标榜为胜利的稀疏比例,而且它会在该领域其他模型都朝相反方向发展的这一代这样做。
如果属实,“更少的活跃参数”会意味着什么
目前有两种解读,它们指向相反的方向。更宽容的一种是架构层面的:Moonshot 可能正在进一步扩展 KDA 混合架构,用线性层替换更多全注意力层,并重新平衡专家预算,从而使更低的激活数量换来更长的上下文、更低的服务占用,或更优的单位 FLOP 质量比。按照这种解读,更少的激活参数是对 K3 已经提出的同一论点的精炼——稀疏性是一种扩展策略,而不是一种妥协。
另一种解读是,K4 根本不是统一的继任者。Kimi 的产品线今年已经分叉过一次,而报道也以不同方式暗示 K3.1、K3.2 和 K4 是三种不同的产品。在一个还推出了独立编码变体的产品家族中,K4 的激活量却比 K3 更少,这至少同样符合重新定位的说法,也同样符合直接升级的说法。两种解读都是猜测。无论哪种,都不是一篇帖子能下定论的。
还有一个没人触及的许可维度。K3 的权重依据 Kimi K3 License 发布,这是一种自定义的“其他”许可,而非标准的开源许可,而且它是首个开放的 3T 级模型。更稀疏的 K4 是会继承该许可,还是将其收窄,对任何基于这些权重进行构建的人来说,都比指数分数上的几个点更重要。

同一帖子中的另外三个名字
GLM-5.5 Flash和GLM-5.4才是更令人意外的一对,而且原因并不在于数字本身。Z.ai 公开的天花板是 GLM-5.3,该模型于 2026 年 8 月 14 日发布,参数量为 743B;GLM-5.3-Flash 于 8 月 26 日跟进,BF16 与 Flash-BF16 权重则于 8 月 25 日发布。Z.ai 自家文档中恰好列出了三个当前模型标识符:glm-5.3、glm-5.3-flash 和 glm-5.2。根本不存在 GLM-5.4,也没有 GLM-5.5,更没有 GLM-5.5 Flash——而真正奇怪的是命名的方向,因为 5.5 一代排在 5.4 一代之前,这从来不是 Z.ai 为一个系列编号的方式。泄密信息中出现顺序错乱的版本号是一种常见的故障模式:它们往往是相邻产品、内部代号,或某个服务层级的标签,而不是新的基础模型。
DeepSeek V4.1P是信号作者表示自己最感兴趣的名称,也是四个中最容易核实的一个。DeepSeek 的 API 文档恰好列出了两个当前模型字符串:deepseek-flash和deepseek-v4-pro。“P”后缀在任何 DeepSeek 标识符中都没有对应项,而 DeepSeek 自家组织中最新的权重发布是 DeepSeek-V4.1-Flash,发布于 2026 年 9 月 10 日。V4.1P 最可能是该模型的 Pro 层级同门型号——但“最有可能”只是对一个字符串的猜测,而不是对一款产品的判断。
你怎么会知道这其中任何东西是真的?
这四个名称以同样的方式未能通过同一项检验,这让等待变得轻松直接,而非煎熬。真正的发布总会留下制品,而每一项检查起来成本都很低:
• 在厂商自己的 Hugging Face 组织中的模型卡。Moonshot 的最新条目是 Kimi-K3,创建于 2026 年 6 月 13 日;Z.ai 的最新作品是 25 日的 GLM-5.3 系列;DeepSeek 的最新作品是 9 月 10 日的 DeepSeek-V4.1-Flash。这三家中都不存在更新的东西。
• 一份能平息争论的配置。具体到 K4,要留意的字段是 num_experts 和 num_experts_per_token——K3 的读数是 896 和 16。如果某个 K4 配置的每 token 数值更低,那么这个泄漏中的说法就能在单个文件中得到证实或推翻。
• 一个可路由的模型。出现在目录中的名称,背后有价格、上下文窗口和提供商;只出现在帖子里的名称,则这些一概没有。

目前您可以路由的内容
这则泄露消息的现实意义在于,它所描述的那一代并不是你可以作为构建基础的那一代。真正在线可用的是上一代,而路由器要做的是把代际之间的差距变成一个路由决策,而不是一个迁移项目。Kimi K3 现已上线,具备完整的 100 万 token 上下文和原生视觉能力,定价为每百万输入 token 3.00 美元、每百万输出 token 15.00 美元,缓存读取为 0.30 美元——按供应商价格计费,零加价,因此 K3 的供应商价格变动会在当天就反映到你的账单上,而不是等到下一个重新定价周期。OrcaRouter 上的 Kimi K3载有完整规格表与当前费率。
其余产品线也是如此。GLM-5.3、GLM-5.3-Flash 和 DeepSeek V4.1 Flash 都可与 Kimi K3 一同路由,通过同一个兼容 OpenAI 的端点覆盖 200+ 个模型,并在提供商性能下降时自动故障转移,还提供用于表达偏好的路由 DSL——成本上限、质量下限、延迟预算——以策略形式而非逐次调用逻辑来实现。当 Kimi K4、GLM-5.5 Flash 或 DeepSeek V4.1P 真的出现时,迁移不过是路由策略中的一处字符串改动,仅此而已。模型融合让你可以在同一端点上组合多个模型的输出,以适用于能从中获益的任务。
明确说明这不是什么:目前这四个泄露的名称都不是 OrcaRouter 上的路由。我们不托管它们,也无法提供它们。
底线
这里有意思的说法不在于版本号,而在于机制——一款下一代旗舰如果激活更少的参数——比其前代更少——那将是一种表态:Moonshot 认为值得推进的方向是稀疏性,而不是原始激活数量;而 K3 的 16-of-896 专家拆分已经是朝这个方向的论据。这一说法的每一部分都未经证实:Kimi K4、GLM-5.5 Flash、GLM-5.4 和 DeepSeek V4.1P 都没有模型卡、没有权重、没有 API 标识符,也没有价格,而且这些厂商自己的产品目录各自都早停了一代。把这些名称当作一个问题的预告,而不是答案——如果你今天需要 1M 上下文的前沿级开放权重,Kimi K3 才是已经存在的模型。
当 Kimi K4 真的到来时,自动故障转移正是防止这次迁移演变成一场事故的关键
