一張生成的標題卡,寫著「Kimi K4」,副標題為「外洩消息說了什麼,以及沒說什麼」,帶有「外洩/未經證實」徽章,三行堆疊文字寫著「沒有模型卡」、「沒有權重」和「沒有價格或路由」,頁尾一行寫著「截至 2026 年 9 月 25 日」,右下角合成有 OrcaRouter 標誌。
Guides & Insights

Kimi K4:外洩內容實際上聲稱了什麼,以及為何「更少的活躍參數」才是真正的重點

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

一則貼文同時讓四個尚未發表的模型名稱開始流傳。這份清單以 Kimi K4 開頭,據稱是 Moonshot AI 的下一代模型,它與 GLM-5.5 Flash 以及 GLM-5.4(來自 Z.ai)並列,還有 DeepSeek V4.1P——而作者強調的重點不在任何一個旗艦名稱上,而是對 K4 背後算術的一項懷疑:它可能只啟用比它所取代的模型 更少 的參數。這項說法尚未經過驗證。沒有 Kimi K4 的模型卡,沒有權重,沒有 API 識別碼,沒有價格,也沒有取用途徑,清單中每個 Z.ai 的名稱同樣如此。現在值得做的是釐清:這些說法中有哪些是可以查核的、目前已推出的基準長什麼樣子,以及一個更稀疏的 K4 實際上會代表什麼意義。

訊號及其層級

這是個早期訊號,也應被如此解讀。承載它的那則貼文,與其說是目擊通報,不如說是對模型命名慣例的一種解讀:它把「GLM-5.5 Flash、GLM-5.4」標舉為有趣的命名,並稱 Kimi K4「非常奇怪」,接著提出一個推測性的機制——更少的啟用專家數——但並未聲稱自己見過任何設定檔、檢查點清單或測試環境端點。

公開紀錄中沒有任何內容與這些名稱相矛盾,也沒有任何內容能佐證它們。這種不對稱在發布週期的這個階段是正常的,而這正是為什麼有用的做法是確立基準與測試,而不是進一步臆測。貼文中的名稱是對某個產品的假設,而不是該產品存在的證據。

Kimi K4 會被拿來衡量的基準

Kimi K3 真實存在、已經推出,而且有異常詳盡的文件記錄,這使其成為一個明確的參考基準。Moonshot 自家的模型卡描述了一個 2.8 兆參數的混合專家模型,每個 token 啟用 1040 億個參數,分佈於 93 層——一層稠密層與 92 層稀疏層。其稀疏性相當激進,且直白地說明:每 token 有 896 個專家中的 16 個被觸發,外加 2 個共享專家,Moonshot 將此歸功於相較 Kimi K2 在擴展效率上約有 2.5 倍的提升。

注意力堆疊是 K3 與前一代分道揚鑣之處。在其 92 個稀疏層中,有 69 層採用 Kimi Delta Attention——一種混合式線性注意力機制——另有 24 層採用閘控 MLA,形成 3:1 的分配,保留少數完整注意力層,其餘則推向成本更低的線性路徑。每 12 個區塊,各層會帶有一個注意力殘差,激活函數為 SiTU-GLU,而整個模型在量化感知訓練下,以 MXFP4 權重與 MXFP8 激活進行訓練。上下文長度為 1,048,576 個 token,詞彙量為 163,840,視覺則透過一個 4.01 億參數的 MoonViT-V2 編碼器運行,使 K3 原生具備圖像能力,而非以加掛方式實現多模態。

Screenshot of the Artificial Analysis model page for Kimi K3 (max), headed "Released July 2026", whose comparison summary reads In $3.00 / Out $15.00 and describes the model as leading on intelligence but expensive next to other open-weight models of similar size, notably slow and somewhat verbose, with text and image input and a 1M-token context window.

那些是後繼者必須改寫的數字。注意這些數字對「更少活躍參數」這個構想所隱含的意義:K3 已經是一個極度稀疏的模型。它每個 token 大約只啟動其總參數量的 3.7%。若 K4 啟動的參數少於 104B,那並不是在為過度配置的設計削減贅肉——而是在走回頭路,退回一個 Moonshot 曾公開形塑為勝利的稀疏比例,而且還是在整個領域都朝相反方向前進的那一代這麼做。

如果「更少的作用中參數」為真,那會代表什麼意思

目前有兩種解讀,而它們指向相反的方向。較為寬容的一種解讀是架構層面的:Moonshot 可能正在進一步延伸 KDA 混合架構,以線性層取代更多全注意力層,並重新平衡專家預算,使得更低的激活數量能換來更長的上下文、更精簡的部署佔用,或更好的每 FLOP 品質比。在這種解讀下,更少的活躍參數是對 K3 早已提出的同一論點的提煉——稀疏性是一種擴展策略,而非妥協。

另一種解讀是,K4 根本不是一個單一的後繼產品。Kimi 的產品線今年已經分岔過一次,而報導也以不同方式暗示 K3.1、K3.2 和 K4 是三款不同產品。一個啟用參數量比 K3 更少的 K4,在一個另外推出獨立程式編碼變體的家族中,至少與其說符合直接升級,也同樣符合重新定位。兩種解讀都只是猜測。一篇貼文並不能為任一解讀下定論。

還有一個無人觸及的授權層面。K3 的權重是依 Kimi K3 License 發布,那是自訂的「其他」授權,而非標準開源授權,而且它是首個開放的 3T 級模型。更稀疏的 K4 是否會繼承該授權,或限縮它,對任何以這些權重為基礎來開發的人來說,都比指數分數的幾分更重要。

A generated two-column scoreboard titled "Kimi K3 vs Kimi K4 — the scoreboard", with six shared rows: Status (K3 "released 15 July 2026" vs K4 "unreleased"), Total parameters ("2.8T" vs "unverified"), Activated parameters ("104B" vs "unverified"), Experts per token ("16 of 896" vs "unverified"), Context ("1M tokens" vs "unverified") and Price ("$3 / $15" vs "none"), with the footer line "Kimi K3 figures per Moonshot's model card; Kimi K4 has no model card, weights or price."

同一則貼文中的另外三個名字

GLM-5.5 Flash與GLM-5.4是更令人意外的一組,而且原因不在於數字。Z.ai 對外公布的最高版本是 GLM-5.3,於 2026 年 8 月 14 日推出,參數量為 7430 億,接著 GLM-5.3-Flash 於 8 月 26 日跟進,而 BF16 與 Flash-BF16 權重則於 8 月 25 日發布。Z.ai 自家的文件正好列出三個現行模型識別碼:glm-5.3、glm-5.3-flash 和 glm-5.2。沒有 GLM-5.4,沒有 GLM-5.5,也沒有 GLM-5.5 Flash——而命名方向才是奇怪的地方,因為 5.5 世代排在 5.4 世代之前,並非 Z.ai 歷來為一個系列編號的方式。版本號在外洩資訊中出現順序錯亂,是種常見的失誤模式:它們往往是相鄰產品、內部代號,或服務層級標籤,而不是新的基礎模型。

DeepSeek V4.1P是該訊號作者表示最感興趣的名稱,也是四者中最容易查證的一個。DeepSeek 的 API 文件明確列出兩個現行模型字串:deepseek-flash與deepseek-v4-pro。「P」後綴在任何 DeepSeek 識別碼中都找不到對應,而 DeepSeek 自家組織中最新發布的權重版本是 DeepSeek-V4.1-Flash,於 2026 年 9 月 10 日發布。V4.1P 最有可能會是該模型的 Pro 層級同類產品——但「最有可能」只是對一個字串的猜測,而非對一項產品的判斷。

你怎麼會知道這其中任何一點是真的

這四個名稱以同樣的方式未通過同一項測試,這讓等待變得直接了當,而不是令人煎熬。真正的發布會留下產物,而每一項的檢查成本都很低:

• 廠商自家 Hugging Face 組織中的模型卡。Moonshot 最新的項目是 Kimi-K3,創建於 2026 年 6 月 13 日;Z.ai 最新的是 8 月 25 日的 GLM-5.3 系列;D​eepSeek 最新的是 9 月 10 日的 DeepSeek-V4.1-Flash。三者之中都沒有更新的版本。

• 一個能終結爭論的設定檔。具體針對 K4,要找的欄位是 num_experts 和 num_experts_per_token —— K3 的讀數是 896 和 16。一份每 token 數值更低的 K4 設定檔,就能在單一檔案中證實或推翻這次外洩中的說法。

• 可路由的模型。出現在型錄上的名稱,背後代表著價格、上下文視窗和供應商;只出現在貼文裡的名稱,這些東西一概沒有。

Screenshot of the OrcaRouter model page for kimi/kimi-k3 by MoonshotAI, dated 2026-07-15, with Vision, Tools, JSON and Reasoning capability chips and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

目前可路由的內容

這則外洩資訊的實際意義在於,它所描述的世代並不是你能據以建構的版本。目前正式上線的是前一個世代,而路由器的工作,就是把世代之間的落差變成一個路由決策,而不是一項遷移專案。Kimi K3 現已推出,具備完整的 100 萬 token 上下文與原生視覺能力,價格為每百萬輸入 token 3.00 美元、每百萬輸出 token 15.00 美元,快取讀取為 0.30 美元——以供應商費率計價、零加成,這正是為什麼 K3 的供應商價格變動當天就會反映到你的帳單,而不是等到下一個重新定價週期。OrcaRouter 上的 Kimi K3提供完整規格表與現行費率。

同樣的情況也適用於整個陣容的其他部分。GLM-5.3、GLM-5.3-Flash 和 DeepSeek V4.1 Flash 都能與 Kimi K3 一同路由,透過單一相容 OpenAI 的端點涵蓋200+ 個模型,並在供應商效能下降時自動容錯移轉,還有一套路由 DSL 可用來表達偏好——成本上限、品質下限、延遲預算——將其視為政策,而非每次呼叫的邏輯。當 Kimi K4、GLM-5.5 Flash 或 DeepSeek V4.1P 問世時,搬遷只是路由政策中的一個字串變更,除此之外別無其他。當任務能從中受益時,模型融合讓你能在同一端點上結合多個模型的輸出。

為了明確說明那不是什麼:這四個外洩名稱,目前都不是 Orca 上的路由。我們並未託管它們,也無法為它們提供服務。

總結來說

這裡真正有趣的說法並不是版本號,而是機制——一款下一代旗艦模型若能啟用更少的參數,那等於宣示 Moonshot 認為值得推進的軸線是稀疏性,而非原始啟用參數量,而 K3 的 896 分之 16 專家切分本身就已朝這個方向提出論據。這個說法的每一部分都未經證實:Kimi K4、GLM-5.5 Flash、GLM-5.4 與 DeepSeek V4.1P 都沒有模型卡、沒有權重、沒有 API 識別碼,也沒有定價,而且各家廠商自家的型錄在每個案例中都只到前一代為止。請把這些名稱當成一個問題的預告,而非答案——而如果你今天就需要 1M 上下文的前沿級開放權重,Kimi K3 就是那個已經存在的模型。

當 Kimi K4 真的到來時,自動容錯移轉正是避免讓遷移演變成事故的關鍵