
Kimi K4:外洩內容實際上聲稱了什麼,以及為何「更少的活躍參數」才是真正的重點
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 506 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 183 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
一則貼文同時讓四個尚未發表的模型名稱開始流傳。這份清單以 Kimi K4 開頭,據稱是 Moonshot AI 的下一代模型,它與 GLM-5.5 Flash 以及 GLM-5.4(來自 Z.ai)並列,還有 DeepSeek V4.1P——而作者強調的重點不在任何一個旗艦名稱上,而是對 K4 背後算術的一項懷疑:它可能只啟用比它所取代的模型 更少 的參數。這項說法尚未經過驗證。沒有 Kimi K4 的模型卡,沒有權重,沒有 API 識別碼,沒有價格,也沒有取用途徑,清單中每個 Z.ai 的名稱同樣如此。現在值得做的是釐清:這些說法中有哪些是可以查核的、目前已推出的基準長什麼樣子,以及一個更稀疏的 K4 實際上會代表什麼意義。
訊號及其層級
這是個早期訊號,也應被如此解讀。承載它的那則貼文,與其說是目擊通報,不如說是對模型命名慣例的一種解讀:它把「GLM-5.5 Flash、GLM-5.4」標舉為有趣的命名,並稱 Kimi K4「非常奇怪」,接著提出一個推測性的機制——更少的啟用專家數——但並未聲稱自己見過任何設定檔、檢查點清單或測試環境端點。
公開紀錄中沒有任何內容與這些名稱相矛盾,也沒有任何內容能佐證它們。這種不對稱在發布週期的這個階段是正常的,而這正是為什麼有用的做法是確立基準與測試,而不是進一步臆測。貼文中的名稱是對某個產品的假設,而不是該產品存在的證據。
Kimi K4 會被拿來衡量的基準
Kimi K3 真實存在、已經推出,而且有異常詳盡的文件記錄,這使其成為一個明確的參考基準。Moonshot 自家的模型卡描述了一個 2.8 兆參數的混合專家模型,每個 token 啟用 1040 億個參數,分佈於 93 層——一層稠密層與 92 層稀疏層。其稀疏性相當激進,且直白地說明:每 token 有 896 個專家中的 16 個被觸發,外加 2 個共享專家,Moonshot 將此歸功於相較 Kimi K2 在擴展效率上約有 2.5 倍的提升。
注意力堆疊是 K3 與前一代分道揚鑣之處。在其 92 個稀疏層中,有 69 層採用 Kimi Delta Attention——一種混合式線性注意力機制——另有 24 層採用閘控 MLA,形成 3:1 的分配,保留少數完整注意力層,其餘則推向成本更低的線性路徑。每 12 個區塊,各層會帶有一個注意力殘差,激活函數為 SiTU-GLU,而整個模型在量化感知訓練下,以 MXFP4 權重與 MXFP8 激活進行訓練。上下文長度為 1,048,576 個 token,詞彙量為 163,840,視覺則透過一個 4.01 億參數的 MoonViT-V2 編碼器運行,使 K3 原生具備圖像能力,而非以加掛方式實現多模態。

那些是後繼者必須改寫的數字。注意這些數字對「更少活躍參數」這個構想所隱含的意義:K3 已經是一個極度稀疏的模型。它每個 token 大約只啟動其總參數量的 3.7%。若 K4 啟動的參數少於 104B,那並不是在為過度配置的設計削減贅肉——而是在走回頭路,退回一個 Moonshot 曾公開形塑為勝利的稀疏比例,而且還是在整個領域都朝相反方向前進的那一代這麼做。
如果「更少的作用中參數」為真,那會代表什麼意思
目前有兩種解讀,而它們指向相反的方向。較為寬容的一種解讀是架構層面的:Moonshot 可能正在進一步延伸 KDA 混合架構,以線性層取代更多全注意力層,並重新平衡專家預算,使得更低的激活數量能換來更長的上下文、更精簡的部署佔用,或更好的每 FLOP 品質比。在這種解讀下,更少的活躍參數是對 K3 早已提出的同一論點的提煉——稀疏性是一種擴展策略,而非妥協。
另一種解讀是,K4 根本不是一個單一的後繼產品。Kimi 的產品線今年已經分岔過一次,而報導也以不同方式暗示 K3.1、K3.2 和 K4 是三款不同產品。一個啟用參數量比 K3 更少的 K4,在一個另外推出獨立程式編碼變體的家族中,至少與其說符合直接升級,也同樣符合重新定位。兩種解讀都只是猜測。一篇貼文並不能為任一解讀下定論。
還有一個無人觸及的授權層面。K3 的權重是依 Kimi K3 License 發布,那是自訂的「其他」授權,而非標準開源授權,而且它是首個開放的 3T 級模型。更稀疏的 K4 是否會繼承該授權,或限縮它,對任何以這些權重為基礎來開發的人來說,都比指數分數的幾分更重要。

同一則貼文中的另外三個名字
GLM-5.5 Flash與GLM-5.4是更令人意外的一組,而且原因不在於數字。Z.ai 對外公布的最高版本是 GLM-5.3,於 2026 年 8 月 14 日推出,參數量為 7430 億,接著 GLM-5.3-Flash 於 8 月 26 日跟進,而 BF16 與 Flash-BF16 權重則於 8 月 25 日發布。Z.ai 自家的文件正好列出三個現行模型識別碼:glm-5.3、glm-5.3-flash 和 glm-5.2。沒有 GLM-5.4,沒有 GLM-5.5,也沒有 GLM-5.5 Flash——而命名方向才是奇怪的地方,因為 5.5 世代排在 5.4 世代之前,並非 Z.ai 歷來為一個系列編號的方式。版本號在外洩資訊中出現順序錯亂,是種常見的失誤模式:它們往往是相鄰產品、內部代號,或服務層級標籤,而不是新的基礎模型。
DeepSeek V4.1P是該訊號作者表示最感興趣的名稱,也是四者中最容易查證的一個。DeepSeek 的 API 文件明確列出兩個現行模型字串:deepseek-flash與deepseek-v4-pro。「P」後綴在任何 DeepSeek 識別碼中都找不到對應,而 DeepSeek 自家組織中最新發布的權重版本是 DeepSeek-V4.1-Flash,於 2026 年 9 月 10 日發布。V4.1P 最有可能會是該模型的 Pro 層級同類產品——但「最有可能」只是對一個字串的猜測,而非對一項產品的判斷。
你怎麼會知道這其中任何一點是真的
這四個名稱以同樣的方式未通過同一項測試,這讓等待變得直接了當,而不是令人煎熬。真正的發布會留下產物,而每一項的檢查成本都很低:
• 廠商自家 Hugging Face 組織中的模型卡。Moonshot 最新的項目是 Kimi-K3,創建於 2026 年 6 月 13 日;Z.ai 最新的是 8 月 25 日的 GLM-5.3 系列;DeepSeek 最新的是 9 月 10 日的 DeepSeek-V4.1-Flash。三者之中都沒有更新的版本。
• 一個能終結爭論的設定檔。具體針對 K4,要找的欄位是 num_experts 和 num_experts_per_token —— K3 的讀數是 896 和 16。一份每 token 數值更低的 K4 設定檔,就能在單一檔案中證實或推翻這次外洩中的說法。
• 可路由的模型。出現在型錄上的名稱,背後代表著價格、上下文視窗和供應商;只出現在貼文裡的名稱,這些東西一概沒有。

目前可路由的內容
這則外洩資訊的實際意義在於,它所描述的世代並不是你能據以建構的版本。目前正式上線的是前一個世代,而路由器的工作,就是把世代之間的落差變成一個路由決策,而不是一項遷移專案。Kimi K3 現已推出,具備完整的 100 萬 token 上下文與原生視覺能力,價格為每百萬輸入 token 3.00 美元、每百萬輸出 token 15.00 美元,快取讀取為 0.30 美元——以供應商費率計價、零加成,這正是為什麼 K3 的供應商價格變動當天就會反映到你的帳單,而不是等到下一個重新定價週期。OrcaRouter 上的 Kimi K3提供完整規格表與現行費率。
同樣的情況也適用於整個陣容的其他部分。GLM-5.3、GLM-5.3-Flash 和 DeepSeek V4.1 Flash 都能與 Kimi K3 一同路由,透過單一相容 OpenAI 的端點涵蓋200+ 個模型,並在供應商效能下降時自動容錯移轉,還有一套路由 DSL 可用來表達偏好——成本上限、品質下限、延遲預算——將其視為政策,而非每次呼叫的邏輯。當 Kimi K4、GLM-5.5 Flash 或 DeepSeek V4.1P 問世時,搬遷只是路由政策中的一個字串變更,除此之外別無其他。當任務能從中受益時,模型融合讓你能在同一端點上結合多個模型的輸出。
為了明確說明那不是什麼:這四個外洩名稱,目前都不是 Orca 上的路由。我們並未託管它們,也無法為它們提供服務。
總結來說
這裡真正有趣的說法並不是版本號,而是機制——一款下一代旗艦模型若能啟用更少的參數,那等於宣示 Moonshot 認為值得推進的軸線是稀疏性,而非原始啟用參數量,而 K3 的 896 分之 16 專家切分本身就已朝這個方向提出論據。這個說法的每一部分都未經證實:Kimi K4、GLM-5.5 Flash、GLM-5.4 與 DeepSeek V4.1P 都沒有模型卡、沒有權重、沒有 API 識別碼,也沒有定價,而且各家廠商自家的型錄在每個案例中都只到前一代為止。請把這些名稱當成一個問題的預告,而非答案——而如果你今天就需要 1M 上下文的前沿級開放權重,Kimi K3 就是那個已經存在的模型。
當 Kimi K4 真的到來時,自動容錯移轉正是避免讓遷移演變成事故的關鍵
