GLM-5.3 與 Kimi K3 比較的標題卡:左側一個較小的立方體標示為 GLM-5.3,標籤為 743B 基礎後訓練;右側一個較大的立方體標示為 Kimi K3,標籤為 2.8T 基礎從零打造。
Guides & Insights

GLM-5.3 vs Kimi K3:壓榨 743B 基座,還是打造 2.8T 模型——哪個賭注更划算?

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

中國開源權重競賽剛分裂成同一個問題的兩種答案。Moonshot AI 打造了Kimi K3——一個從零開始打造的 2.8 兆參數混合專家(MoE)基礎模型,也是有史以來發布的最大開源權重模型;於 2026 年 7 月 16 日發布,權重於 7 月 27 日跟進釋出。G​LM-5.3則是完全相反的賭注:Z.ai 原封不動地保留了驅動 GLM-5.2 的那個 7430 億參數基礎模型,並將整個發布週期投入在後期訓練,主張基礎模型的智慧天花板從來就不是問題。兩者都是 1M 上下文、聚焦程式碼與代理(agent)的旗艦模型,也都宣稱自己是市場上最頂尖的開源程式碼模型。它們不可能同時是花費同一筆預算的最佳方式,而基準測試的結果也確實一分為二——這使得與其說這是一場比較,不如說是一場關於如何打造下一代前沿模型的公投。

如何建構前沿模型的兩種押注

Z.ai 稱 G​LM-5.3 為「深度挖掘」而非世代級升級。基礎模型與 GLM-5.2 逐位元組相同,同為 743B 參數模型;差異完全來自後訓練,透過開源 slime 框架,在橫跨完整工程工作階段的任務上執行——在真實叢集、儲存系統和程式碼庫中進行診斷、修復、驗證與交付,其中有些任務需要耗費資深工程師數天的工作量。該廠商宣稱的成效提升幅度相當可觀:自家 Code Bench 提升 50%,Terminal-Bench 3.0 從 4.6 上升到 28.3,DeepSWE v1.1 從 46.2 上升到 66.9,還有一項網路安全能力,迫使他們在發布權重之前先進行安全審查。Moonshot 則選擇了另一條路。Kimi K3 是全新的基礎模型——總參數 2.8T,每個 token 約啟動 104B 參數(896 個專家中的 16 個),採用 Kimi Delta Attention 架構,原生支援影像和影片輸入,具備無法關閉的常駐推理功能,輸入與輸出都支援 1M 上下文視窗。Z.ai 押注的是同款模型加大規模就已足夠,Moonshot 押注的則是基礎模型本身就是天花板。

The Z.ai research blog post announcing GLM-5.3, dated August 14 2026, titled GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, with a Coding Plan / Code with ZCode call to action and a HuggingFace (Coming Soon) button.

附有來源出處的直接對比

唯一同時出現這兩個模型的地方是 Z.ai 自家的發布表格,因此並排比較的數字就來自那裡——標示為廠商回報,而非獨立審計。Kimi K3 的獨立數據與 Moonshot 在七月發布的數據以及 Artificial Analysis 所測量的結果一致,但目前還沒有任何中立實驗室同時測試過這兩者。

Terminal-Bench 3.0GLM-5.3 以 28.3 對比 Kimi K3 的 17.4(Z.ai 的表格)。這是該對決中最大的程式設計差距,出現在最新也最難的版本上。

Terminal-Bench 2.1 — G​LM-5.3 為 88.2,而 Kimi K3 為 88.3。難分軒輊。

DeepSWE v1.1 — G​LM-5.3 得分 66.9,Kimi K3 得分 67.5。Kimi 險勝。

SWE-Marathon v1.1 — G​LM-5.3 得分 42.5,Kimi K3 則為 48.1。Kimi 在程式編寫上的最佳勝績。

ExploitGym — GLM-5.3 以 105/130 對上 Kimi K3 的 36/70。GLM 近乎全面橫掃。

GDPval-AA v2(知識工作) — G​LM-5.3 得分為 1,769,Kimi K3 得分為 1,682。

存取 — G​LM-5.3:Coding Plan 訂閱方案,權重檔約於 8 月 28 日前仍受限制。Kimi K3:API 已上線,價格為 $3 / $15,權重檔自 7 月 27 日起即可下載。

A comparison scoreboard for GLM-5.3 and Kimi K3: GLM-5.3 shows Terminal-Bench 3.0 of 28.3, Terminal-Bench 2.1 of 88.2, DeepSWE v1.1 of 66.9, ExploitGym of 105/130, GDPval-AA v2 of 1,769 and weights around August 28, versus Kimi K3s 17.4, 88.3, 67.5, 36/70, 1,682, weights live since July 27 and $3/$15 API pricing.

安全護城河才是真正的區隔。

撇開編程基準測試不談,決定性的差異在於網絡安全。G​LM-5.3 在 CyberGym 上取得 84.5,而 Kimi K3 為 80.0;其 ExploitBench 分數 54.4 幾乎是 Kimi K3 的 32.2 的兩倍。在 ExploitGym 上,差距不是差異,而是另一個檔次——2 小時和 6 小時的測試中,105 和 130 對比 36 和 70。這就是為什麼兩者的發布在實際體驗上如此不同:Kimi K3 的權重以修改版 MIT 許可證公開,而 G​LM-5.3 的權重則因安全強化而暫緩釋出——正是因為 Z.ai 表示,該模型在找出並利用漏洞方面相當擅長,以至於立即發布權重會讓人覺得不負責任。如果你的工作涉及審計他人的程式碼,或保護自己的程式碼免受自動化漏洞搜尋,那麼這是整個比較中最具關聯性的一點——同時也是最缺乏獨立驗證的一點。

Kimi K3 反擊之地

Kimi K3 的優勢集中在 G​LM-5.3 最弱之處:長時程儲存庫任務。它在 DeepSWE 與 SWE-Marathon 上保有優勢,在 Toolathlon Verified 上領先;其 100 萬 token 的輸出窗口意味著它能在單次生成中寫出整個程式碼庫或一整段代理軌跡。其常駐推理會將完整軌跡串流至 API,開發者認為這在除錯代理時遠比不透明的摘要式說明更有用——但操作上的限制是,你必須在工具呼叫之間將推理欄位原封不動地回傳,而且沒有 assistant prefill。在 Artificial Analysis 的 Intelligence Index 上,Kimi K3 得分為 57,整體排名第四,按其標準測試集量測,每次任務成本約為 0.94 美元。它也是中國實驗室迄今推出的最昂貴模型:每百萬輸入 token 3 美元、每百萬輸出 token 15 美元,屬於 Sonnet 級定價;而 G​LM-5.3 目前根本無法按 token 計價,因為它僅存在於訂閱方案之中。

取得與成本的現實

Kimi K3 現已在 OrcaRouter 上線,按 Moonshot 自家牌價計費——每百萬 tokens 輸入 $3/輸出 $15,快取讀取 $0.30,零加成——因此 1M 上下文的 agent 作業可用與你技術棧其餘部分相同的 key 來呼叫,而開放權重則是你日後想自行託管時的退出選項。G​LM-5.3 才是難以取得的那個:每月 $18 至 $168 的訂閱制,搭配點數系統,輸入端以 6.9 倍、輸出端以 24 倍消耗點數;離峰時段(中國時間 14:00–18:00 以外)定價減半,且安全審查通過之前不提供按 token 計價的 API。路由層實際上在兩週窗口內把這種不對稱給抹平了:當 G​LM-5.3 的 API 落到同一把 key 上時,一次 panel 呼叫就能讓兩個開放權重的編碼旗艦模型跑在你自己的任務上,再交由 judge 仲裁比對——如果你等不及,Kimi K3 已釋出的權重讓它成為兩者之中唯一今天就能完全就地部署(on-premises)的選擇。

The OrcaRouter model page for MoonshotAI Kimi K3, showing the New and Featured badges, the kimi/kimi-k3 slug, $3.00 per million input and $15.00 per million output pricing, and text plus image input.

哪個賭注在賠付?

經過一週後的誠實評價是,兩者都在產生回報,但適用的工作負載不同。如果你的工作高度依賴終端、與安全相關、且由代理協調,根據 Z.ai 已發布的證據,G​LM-5.3 是更強的方向——而且網路安全差距大到值得等兩週拿到權重親自驗證。如果你的工作是長篇倉庫會話、多模態輸入,或任何需要今天就拿到權重的情況,Kimi K3 是兩者中唯一實際可用的——而它在深度倉庫上的優勢,正是你現在就能透過其即時 API 驗證的部分。有一點要搞清楚:這份比較中所有直接對比的數字都來自 Z.ai 自己的表格,因此在獨立實驗室對兩者進行測試之前,請將編碼差異視為方向性參考。而那正是兩週等待會帶來的驗證。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube