
GLM-5.2 對決 Kimi K3:更便宜、更快速,還是更大、更好
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GLM-5.2 與 Kimi K3 在 2026 年中期相隔一個月問世,彼此幾乎完美地互為倒影。Kimi K3 於 2026-07-16 發布,開放權重接著在 2026-07-27 釋出,是兩者中較大、且紙面上更優秀的模型:2.8 兆參數,其中 1040 億為活躍參數,且在兩者共同受測的幾乎每一項基準測試中都取得更高分數。GLM-5.2 自 2026-06-16 起推出,是兩者中較小的,擁有 7530 億參數、其中 400 億為活躍參數,每輸出 token 的成本約為三分之一,中位數回應速度更快,並以 MIT 授權發布,而非帶有營收觸發條款的專屬授權。
這就是一句話總結的結論。接下來是支撐這個結論的證據——針對你可能實際執行的工作所做的價格推算、在兩者差距小到可視為雜訊時的實測數據,以及一個常被引用、卻不能與印在它旁邊的那個數字相提並論的數值。
兩者所處的位置
兩者通常都可透過各自廠商自家的 API 取得,兩者都能在 OrcaRouter 上路由,且兩者都有可下載的權重。在你甚至還沒接近任何基準測試之前,真正重要的差異在於:
• 發布 — GLM-5.2 於 2026-06-16,對比 Kimi K3 於 2026-07-16(Artificial Analysis 模型頁面;OrcaRouter 自家的 Kimi K3 模型頁面則標示為早一天,2026-07-15)
• 權重 — GLM-5.2 以 MIT 授權開放,對比 Kimi K3 以 Kimi K3 授權條款開放;後者要求年度模型即服務(model-as-a-service)營收超過 2,000 萬美元時須另行簽訂協議,且月活躍使用者超過 1 億時須顯著標示出處(內部研究與開發除外)
• 規模 — GLM-5.2 總計 753B/啟用 40B,對比 Kimi K3 總計 2.8T/啟用 104B
• 上下文 — GLM-5.2 1,000,000 個 token 對比 Kimi K3 1,048,576 個 token
• 輸入 — GLM-5.2 文字進、文字出,對比 Kimi K3 文字與圖像進、文字出
• 已公佈的最大輸出 — GLM-5.2 為 128,000 個 token,而 Kimi K3 的 OrcaRouter 頁面則未公佈
在 OrcaRouter 上,兩者都只要用一把金鑰,就能透過同一個 OpenAI 相容端點 https://api.orcarouter.ai/v1 取用,而我們直接將供應商的定價原封不動地轉嫁出去,不額外加價——因此以下每一項數字都是廠商的價格,不是我們的。
一百萬個 token 要價多少,在一項得付出成本的工作上
首先看供應商費率卡,資料於 2026-09-23 從供應商自家的定價頁面讀取。Z.ai 列出 GLM-5.2 為每百萬輸入權杖 $1.40、每百萬快取輸入權杖 $0.26,以及每百萬輸出權杖 $4.40。Moonshot 列出 Kimi K3 為輸入 $3.00、快取讀取 $0.30、輸出 $15.00——外加快取寫入費用:五分鐘快取為每百萬 $3.00,一小時快取為每百萬 $6.00。那些是公布的價格,並非經獨立審核的價格,且任一供應商都可能更改。
把它們用在一個主要以閱讀為主的工作上:一份 600,000 個 token 的程式碼庫審查,並附上 8,000 個 token 的書面回答。在 GLM-5.2 上,那是 0.6 x $1.40 = $0.84 的輸入,加上 0.008 x $4.40 = $0.035 的輸出,約為 $0.88。在 Kimi K3 上,則是 0.6 x $3.00 = $1.80,加上 0.008 x $15.00 = $0.12,約為 $1.92。同樣的工作,成本大約是 2.2 倍。
現在讓程式碼庫已經待在供應商的快取中,再執行一次。輸入列的價格會降至快取讀取費率,而原本相差 2.1 倍的兩個價格,會變成每百萬 $0.26 對 $0.30——差距 15%。這是比較中最少被討論、卻對每一輪都重讀相同上下文的代理最重要的數字。它還有一個星號註記:Kimi K3 會另行就寫入快取計費,而 GLM-5.2 的頁面完全沒有標示寫入費用,因此冷啟動在 Kimi K3 上的成本,會明顯高於 $3.00 這個標題價格所暗示的水準。
• 一次 600k token 的讀取,搭配 8k 回答——GLM-5.2 約 $0.88,而 Kimi K3 約 $1.92
• 相同的快取輸入列 — GLM-5.2 每 600k 個 token 為 $0.16,對比 Kimi K3 的 $0.18

獨立模型在方向上看法一致,但在幅度上並不一致。Artificial Analysis 以 7:2:1 的比例混合快取命中、輸入與輸出 token,並加上模型實際燃燒的推理 token;而其針對這兩者的數據——於 2026-09-23 在其 v4.3.2 指數下讀取——顯示 GLM-5.2 為每百萬混合 token 0.902 美元,對比 Kimi K3 的 2.31 美元;完成其中一項評估任務的成本則為 0.96 美元對比 2.00 美元。在 GLM-5.2 上完整跑一次 Intelligence Index 需花費 1,559 美元,在 Kimi K3 上則需 3,658 美元。
那個成本模型裡藏著一個違反直覺的細節。Kimi K3 每項任務使用較少輸出 token,48,000 對上 GLM-5.2 的 64,000——推理 token 也較少,32,000 對 51,000。以每單位工作量而言,它是更經濟的模型,但每項任務的成本仍約為兩倍,因為它的每 token 價格在輸入端是 2.1 倍,輸出端是 3.4 倍。「每項任務便宜」與「每 token 便宜」是兩種不同的性質,而在這個組合中,兩者指向相反的方向。
上下文視窗,以及實際上能容納什麼
這兩者在紙面上相差不到 5%:1,000,000 個 token 對上 1,048,576 個。把這說成是 Kimi K3 的勝利會很傻。兩者都是百萬 token 模型,上下文視窗並不是差異點;真正該問的問題是,對於埋在中間的文字,各自還能做到什麼。
那就是 Artificial Analysis 的長上下文推理評測所衡量的內容,而它是資料集中較大的差距之一:Kimi K3 得分 89%,GLM-5.2 則是 78%。如果你的工作是載入大量語料庫,並提出需要串連語料庫兩端事實的問題,那麼多出的 48,576 個 token 並不是選擇 Kimi K3 的理由——十一分的長上下文差距才是。
視窗下方的下限也有所不同。GLM-5.2 公布的最大輸出量為 128,000 個 token;Kimi K3 的頁面並未公布對應的數字,所以我們也不打算提供。如果你要的是生成長篇文件,而不是閱讀它們,那麼在購買任何一款之前,這個不對稱之處值得對照你自己的工作量檢查一下。
速度:GLM-5.2 徹底稱霸的唯一維度
兩項獨立的測量在這裡指向同一個方向,而這一點值得特別一提,正因為它們並非處處一致。
我們自家的路由資料顯示,截至 2026-09-23 的七天內,GLM-5.2 首個 token 的中位數回應時間為 3.28 秒,Kimi K3 則為 8.09 秒;串流速度為每秒 68.1 個 token,對上 43.4 個。兩個模型的首個 token p95 時間都正好是 10.00 秒。Artificial Analysis 另行量測的結果則是:GLM-5.2 的輸出速度為每秒 68.2 個 token,Kimi K3 為 36.7;端到端時間為 41.29 秒對上 72.13 秒;首個答案時間為 33.95 秒對上 58.52 秒。

兩個來源在一點上出現分歧,這值得特別指出,而不是粉飾過去。Artificial Analysis 認為 Kimi K3 在原始首個 token 時間上略勝一籌,4.08 秒對上 4.62 秒,而我們自己的路由則顯示 GLM-5.2 在 p50 上快了將近兩倍半。不同的端點、不同的上游供應商、不同的時間窗口。請將吞吐量方向——GLM-5.2 明顯更快——視為可靠的,並將任何單一的首個 token 時間數字,無論是我們的還是他們的,視為某一週的特性。
在我們的 GLM-5.2 頁面上還有一個數字,我們不會悄悄略過:在同一段七天期間,它顯示 9.2% 的錯誤率,而 Kimi K3 是 0.26%。這樣的差距,既可能是服務 GLM-5.2 的上游供應商遇上糟糕的一週,也可能是模型本身的特性,而七天並不足以分辨兩者。這正是路由之所以存在、要用來解決的那類問題——當某個供應商每十一個請求就有一個失敗,自動容錯移轉會把流量移開,而不需要任何人呼叫待命人員。

基準測試:一場真正的橫掃,但比標題所暗示的更狹窄
Kimi K3 在兩個模型都曾接受測試的項目中幾乎全面勝出。這些是 Artificial Analysis 在指數修訂版 v4.3.2 下的數據,兩個模型皆採用其最高推理組態,讀取日期為 2026-09-23:
• 智能指數 — Kimi K3 44 對 GLM-5.2 34
• AA-Briefcase v1.1 — 1510 對 1233
• GDPval-AA v2.1 — 1524 對 1358
• AutomationBench-AA — 58% 對比 28%
• Terminal-Bench 4.0 — 13% 對 1%
• SciCode — 59% 對 51%
• Humanity's Last Exam — 47% 對 41%
• GDP.pdf — 22% 對比 10%
• AA-LCR v1.1 — 89% 對比 78%
• CritPt — 23% 對 21%
在任何人把那份清單截圖之前,有兩點要注意。
首先,是指數修訂。Kimi K3 七月發布時的報導,在 Intelligence Index 上引用其分數為 57,GLM-5.2 則為 51。如今線上頁面顯示的是 44 與 34。這些並非同一種測量——Artificial Analysis 會修訂該指數並依此重新為模型評分,而把七月的數字與九月的數字並列,是針對這組配對最容易犯的錯誤。方向在每個快照中都保持穩定;絕對數字在不同修訂版本之間則無法互相比較。
第二,是等級。Terminal-Bench 4.0 的 13% 與 1% 是一項艱難的評估,而在那樣的高度上,這個比例告訴你的訊息比任何單一數字都多。AA-Omniscience 旨在探究一個模型是否知道自己知識的極限,其結果是 GLM-5.2 為 4,而 Kimi K3 為 20——如果你打算在無人監督的情況下運行其中任何一個,這個下限值得你了解。
關於 GLM-5.2 清單,Artificial Analysis 還記錄了一件事:它將最高推理組態標示為已棄用,建議改用較新的 GLM-5.3。這不會改變上述任何數據,那些數據是 GLM-5.2 受測當時的快照,但這確實意味著 Z.ai 的路線圖已經超越這個模型。在路由式端點上,這只需要更換一個模型字串,而不需要進行遷移,這也是不該把這兩個名稱中的任何一個硬編碼到應用程式裡的主要理由。
代理與工具使用:差距最大之處
如果那張表格中有一個區塊足以決定是否購買,那就是這一個。長時程的代理式工作,正是 Kimi K3 領先幅度最大、也最穩定一致的地方:
• AutomationBench-AA — 58% 對 28%,差距 30 個百分點
• GDPval-AA v2.1 — 1524 對 1358
• AA-Briefcase v1.1 — 1510 對 1233
• Terminal-Bench 4.0 — 13% 對 1%
Moonshot 自家的發布資料也倚賴同一套敘事——K3 權重發布時隨附了一份技術報告,內容涵蓋該廠商的專家平行訓練堆疊,以及一套代理環境測試框架——但廠商資料終究是廠商資料,而上述數字才是獨立的那一組。
第三方聚合評測機構 LLM Stats 在共享基準測試集上自行計算出一套綜合分數,從另一個方向得出相同結論:在它同時為兩個模型評分的十一項基準中,Kimi K3 全數拿下,而各類別分數顯示 Kimi K3 在工具使用(30.8 對 19.6)、代理(38.3 對 29.6)與程式編寫(42.3 對 34.8)方面領先。這些都是 LLM Stats 依自身加權方式算出的自家綜合分數,建立在規模不大的共享測試集上,因此應視為佐證,而非實驗室結果。十一項全拿,仍然稱不上是勢均力敵的較量。
編程
方向相同,差距較小。在 Artificial Analysis 為兩者所做的程式編寫評測分數中,Kimi K3 在 SciCode 以 59% 對 51% 領先;在 LLM Stats 的共用測試集上,它拿下 DeepSWE、DeepSWE 1.1、FrontierSWE、SWE-Marathon、Program Bench 和 Terminal-Bench 2.1。GLM-5.2 那些好看的數字——第三方彙整機構所引用的 AIME 2026 99.2%、HMMT 2025 94.4%、GPQA 91.2%——都是廠商自行回報且未經重現,而且其中大多衡量的是競賽數學,而非軟件工程。
務實的解讀是:對於一個長時間運行、要編輯大量檔案,還得從自身錯誤中復原的程式碼代理來說,Kimi K3 在代理任務上的領先幅度,是比兩個模型各自的數學成績更切題的訊號。至於講求快速、便宜、大多一次到位的程式碼助理,GLM-5.2 的吞吐量優勢,價值高於基準測試差距所帶來的代價。
當它們足夠接近,以至於無關緊要時
• 快取輸入價格 — 每百萬 $0.26 對比 $0.30,差距為 15%,而輸出方面的差距則為 3.4 倍
上下文視窗 — 1,000,000 對 1,048,576 個權杖
• p95 首個 token 耗時 — 10.00 秒 vs 我們自己路由上的 10.00 秒
• CritPt — 23% 對 21%
• 數學 — LLM Stats 讓 GLM-5.2 在其數學綜合評分上略微領先(41.4 對 40.9),而 Kimi K3 則在圖像數學方面領先;就現有證據來看,兩款模型在算術上都未能獨占鰲頭
任何人告訴你這些模型其中一款在所有方面都是另一款的兩倍,那他只是在看表格裡的某一列而已。
選擇 GLM-5.2 如果……
你是在付帳單的人,而帳單就是你的限制條件。GLM-5.2 的輸出價格大約只有三分之一,在快取那一項上也更便宜,採 MIT 授權、沒有營收門檻需要核對,中位數速度更快,串流時更是快得多,而且它的百萬權杖視窗與 Kimi K3 的差距小到永遠不會決定任何事情。如果你的工作負載是文字進、文字出,而且主要是閱讀,而不是一長串的工具呼叫鏈,那麼 Kimi K3 多出來的那些基準分數,是你的應用永遠收不到的分數。
選擇 Kimi K3,如果…
這項工作是代理式的,而且漫長。AutomationBench 上 30 分的差距、在 GDPval 與 AA-Briefcase 上的領先、11 分的長上下文推理領先幅度,以及對 LLM Stats 共享集的橫掃,全都指向同一方向:Kimi K3 是更適合把多步驟任務交給它、然後就放手不管的模型。它也是兩者中唯一接受圖像的模型。為此,你每項任務會支付大約兩倍的費用;而如果你的工作集被大量快取,你付的就會不到兩倍——但選擇它的理由不是價格,也不是速度。
兩者都能在 OrcaRouter 上,透過單一金鑰對單一 OpenAI 相容端點進行路由,並以供應商定價計費,不額外加收任何費用,而且兩者都位於同一套自動容錯移轉機制之後。這是找出你的工作負載實際上想要哪一個的最便宜方式,因為在兩者之間切換只需要更改模型字串,而不是簽訂合約。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
