
Nex-N2.5 Pro vs GLM-5.2:在 Terminal-Bench 上同樣拿下 82.7 分,出身背景卻截然不同
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0247智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82程式
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75程式
- obsidianQwen3.8 27B2026-08-1541智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69程式
- grokSpaceXAI: Grok 4.62026-08-1251智能77程式
- metaMeta: Muse Spark 1.22026-08-0547智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0347智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128智能49程式
兩款開放權重的代理型模型,出現一個可疑的巧合:Nex-N2.5 Pro 和 GLM-5.2 在 Terminal-Bench 2.1 上都標出 82.7。Nex-AGI 在其自家模型卡上為 Nex-N2.5 Pro 印出 82.7,該分數是在聯盟自家的 NexCUA 測試框架上測得,而這個測試框架外界從未見過。Z.ai 對 GLM-5.2 在同一套件上回報的最高分也是 82.7——然而當一個獨立測試框架重新跑該模型時,結果是 77.9,比廠商自報的分數低了約五分。一個沒人能查證的分數和一個一經查證就縮水的分數之間的完美平手,根本不是平手。這正是最乾淨利落的證明:為什麼「開放權重」與「總有一天才會出現的權重」之間的差異,能在讀任何一行基準分數之前就定下勝負。
這兩個模型坐落於同一個商業街區,但本質上卻截然不同。Nex-N2.5 Pro 於 2026 年 9 月 8 日發布,是一款多模態電腦操作模型——總參數 3970 億,其中約 170 億為活躍參數,源自 Qwen3.5 譜系,架構設計用於讀取螢幕並透過視覺回饋迴圈驅動瀏覽器或桌面工作階段。GLM-5.2 是 Z.ai(智譜AI)以 MIT 授權的旗艦模型,專攻長程推理與程式碼生成——總參數約 7430 億,其中約 400 億為活躍參數,僅支援文字,自 2026 年 6 月 16 日起全面可用,並在數月間持續作為開放權重層級獨立評測的標竿。前者透過像素觀察世界並據此行動,後者則以文字思考並產出程式碼。兩者的授權都允許你以它們為基礎建立商業服務;差別在於,其中一個的授權目前只是一項承諾。
相同的數字,兩個不同的來源
先從打成平手的地方講起,因為這能說明整場對比的關鍵。Nex-AGI 的規格表列出 Nex-N2.5 Pro 在 Terminal-Bench 2.1 得到 82.7,同時 OSWorld-2 為 56.4、SWE-Bench Pro 為 61.2、BrowseComp 為 89.7——每一項都是透過 NexCUA 測試框架產生,而在該模型上市最初幾天內沒有任何一項被獨立重現,原因很簡單:權重無法下載。Z.ai 宣稱 GLM-5.2 在 Terminal-Bench 2.1 得到 82.7,這是廠商自己最亮眼的通報數字;但這個數字所依據的模型,任何人都能從 Hugging Face 下載,今天下午就能重新跑一遍。目前已經有獨立的測試框架測得 77.9,比 Z.ai 宣稱的數字低了約五分。廠商數字在獨立測試下縮水,這不是醜聞——而是自行測量本來就要付出的正常代價。當競爭對手的數字根本無從測試時,問題反而在於少了這份代價,而不是代表那個數字多麼純淨無瑕。

以同樣方式解讀周圍的列。GLM-5.2 在開放模型層級至今產出的獨立指數讀數中最高——在 Artificial Analysis 目前的 Intelligence Index 上是 50 出頭——因此儘管它不是最亮眼的新發布,仍連續幾個月一直是開放模型的參考基準。Nex-N2.5 Pro 則完全沒有任何獨立的指數條目。在兩家廠商都宣稱數字的列中,可驗證的是既有者的數字;在只有 Nex-AGI 發布數字的列中,那些數字無法被重現。這不是對哪個模型更聰明的定論;而是對哪個模型允許你驗證的定論。
規格表之間的吻合程度超乎你的預期
撇開基準測試不談,這兩個模型在基本面上相當接近:
• 已發布 — Nex-N2.5 Pro:2026 年 9 月 8 日(託管端點已上線,權重待發布)。GLM-5.2:2026 年 6 月 16 日 GA,權重已上線。
• 授權 — Nex-N2.5 Pro:Apache-2.0,權重即將推出。GLM-5.2:MIT,現已可供下載。
• 規模 — Nex-N2.5 Pro:397B 總參數 / ~17B 活躍參數。GLM-5.2:~743B 總參數 / ~40B 活躍參數。
• 模態 — Nex-N2.5 Pro:文字與影像輸入、文字輸出,及電腦操作視覺迴圈。GLM-5.2:純文字推理模型。
• 上下文/輸出 — Nex-N2.5 Pro:262,144 token 上下文。GLM-5.2:1M token 上下文、128K 輸出上限。
• 推理控制 — Nex-N2.5 Pro:無 / 中等(自適應,預設)/ 高。GLM-5.2:在同一模型字串上進行推理努力控制。
• 每 1M tokens 的價格 — Nex-N2.5 Pro:免費託管方案,無公開定價。GLM-5.2:輸入 $1.40 / 輸出 $4.40,快取輸入 $0.26。
两份规格的差异,正如同两个模型的定位差异:GLM-5.2为长程工程任务带来完整的百万token文本上下文与128K输出上限,而Nex-N2.5 Pro则以较小、面向屏幕级工作负载的262K窗口,用上下文规模换取视觉通道。两种规格都没有错,只是针对不同任务而设计。
開放權重,兩種不同的含義

正是在這裡,雙方的比較徹底與數字無關了。GLM-5.2 的開放,採取的是你推出一個能賴以建立事業的產品時會有的開放方式:MIT 授權、權重託管於 Hugging Face、商用無限制、沒有資料共享條款、沒有廠商在你背後盯著你。你可以下載它、微調它、把它部署在自己的合規邊界後提供服務,或把它帶到任何你喜歡的主機上——而因為權重已經公開,它的價格有了一道任何單一廠商都無法抬高的地板。Nex-N2.5 Pro 則承諾以 Apache-2.0 釋出——同樣是寬鬆的授權——但它的 Hugging Face 卡片上,橫幅寫著「權重即將推出」,而且沒有標註日期。對受資料治理規則約束的團隊,或想在規模放大後徹底擺脫按 token 計價的團隊而言,這個差別就是決定的全部:GLM-5.2 是你今天就能擁有的模型,Nex-N2.5 Pro 則是別人承諾你的模型。至於自行託管,算盤同樣偏向新進者——等權重終於落地,17B 活躍參數跑在八顆 H100 的節點上,遠比 GLM-5.2 約 40B 活躍參數的機器更容易部署——但「等權重落地」這個前提,在這句話裡扛下的責任可不少。
這些家庭正往相反的方向移動。
這兩個模型都身處快速演進的產品家族中,而各自的發展軌跡卻朝向不同方向。GLM-5.2 的譜系透明且具迭代性:Z.ai 在八月推出 GLM-5.3,作為同一 5.2 基礎模型的後訓練升級版本,並於九月初推出 GLM-5.3 Flash,因此你今天建置所用的 5.2 權重,正是該家族持續改進的基石——你累積的架構知識與微調成果都能延續下去。Nex-AGI 的家族則押注於一個全新世代:35B 的 Nex-N2.5 Mini、397B 的 Nex-N2.5 Pro,以及 1.6T 純文字版的 Nex-N2.5 Max,其基礎模型為 DeepSeek-V4-Pro-Base,而足以讓任何人驗證該家族主張的 Pro 權重至今仍未公開。一個團隊若在選擇要長期建置的平台,實際上是在抉擇:一個擁有已公布更新藍圖的譜系,對上一個第二幕尚未登場的初代產品。
哪一個值得納入你的配置?
如果你的要求是「模型必須是我們自己的」——為了資料治理、為了稽核、為了你不希望由單一供應商控制的產品——那麼在這場對決中,GLM-5.2 不是比較好的選擇;它是唯一的選擇,因為它是其中唯一你可以下載的模型。它也是唯一擁有獨立評分的模型,價格是 Z.ai 的價目表:每百萬輸入 token 1.40 美元,每百萬輸出 token 4.40 美元。如果你的要求是一個最終可能削弱封閉式領導者的多模態電腦使用代理,Nex-N2.5 Pro 是更有趣的長期論點——一個來自清楚知道自己要建構什麼的聯盟、啟用 17B 參數的視覺操作器——但論點不是依賴,免費託管端點也不是基礎。

處理這一切最務實的做法,是立足於現有基礎,並在承諾落地時衡量其成效。GLM-5.2 已在 OrcaRouter 上提供,按 Z.ai 的定價——同樣是 $1.40 / $4.40,原價轉售、不加價——而且因為它是開放權重,若你想讓衡量包含自己的服務堆疊,也可以自行託管。它是你今日拿來運行實際代理型工作負載的參考基準;路由 DSL 則預先代表未來 Nex-N2.5 Pro 以定價出現在某家供應商的情況:屆時要切換比較對象,只是改一條路由規則,而非一次遷移。在結果出爐、獨立測試框架確認(或更正)那個 82.7 之前,Nex-N2.5 Pro 對上 GLM-5.2,是一場「你能驗證的模型」對上「你無法驗證的數字」的較量。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
