Qwen 3.8 對決 GLM-5.2:原始規模 vs 精簡且經審計的開放模型
Guides & Insights

Qwen 3.8 對決 GLM-5.2:原始規模 vs 精簡且經審計的開放模型

作者

jinhao song

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年最受關注的兩個中國模型都是稀疏混合專家系統,都承諾開放權重,並且在價格上都低於西方前沿——然而它們的理念可能幾乎截然不同。阿里巴巴的Qwen3.8-Max於2026年7月19日在上海舉行的世界人工智慧大會上預覽,押注於龐大規模:約2.4兆參數以及早期測試者喜愛的一種執著徹底性。智譜的GLM-5.2則押注於相反方向——一個精簡的400億活躍參數設計,Artificial Analysis已對其進行評分,具有出色的代理結果,且權重今日即可下載。這是效率與原始規模的較量,這兩個模型使得這場競賽異常清晰。

塑造以下一切的關鍵:GLM-5.2 攤開所有底牌,而 Qwen 3.8 則將大部分牌面朝下保留。給開發者的一點提示——要誠實地判斷哪一個適合你的技術棧,最佳方式是在你自己的提示上運行兩者。OrcaRouter 在一個兼容 OpenAI 的端點背後提供了 200 多個模型,因此你可以讓Qwen 3.8與 GLM-5.2 在同一個任務上對決,而無需連接兩個 SDK。

TL;DR 結論。GLM-5.2 是您現在即可實際使用的務實開放權重代理選擇。根據 Artificial Analysis,它擁有經審計的 Intelligence Index 為 51,一個強大的Terminal-Bench 2.1 得分 82.7,便宜的$0.95 / $3.00價格、1M 上下文,以及——關鍵的是——已發布的開放權重僅使用 40B 活躍參數。Qwen 3.8 Max 是更大的賭注:約 2.4T 總參數和頂級實際質量,但它隱藏了活躍參數數量,有沒有獨立基準測試,曾是最慢的模型測試者運行過,且其權重仍「即將推出」。GLM 證明了效率的可行性;Qwen 要求您信任規模。

關鍵要點

GLM-5.2 (Zhipu) 是一個 753B總參數/40B活躍參數的MoE 具有一個 經審計的AA Intelligence Index為51 以及一個 Terminal-Bench 2.1 分數為82.7 (來源:Artificial Analysis); Qwen 3.8 Max 是一個約 2.4T MoE預覽版,其活躍參數數量未公開,且具有 沒有經審計的分數.

• GLM-5.2 的權重是今日開放且可下載(2026 年 6 月發布);Qwen 3.8 的權重承諾「即將推出」但尚未發布(約 1.2TB,需要 8 個以上 H200 GPU 自行託管)。

• 价格偏向GLM:$0.95 / $3.00每1M token(AA混合约$0.90)。Qwen 3.8的预览版有大幅折扣(约90%),但没有公布的每token API价格并且折扣是暂时的。

• 在代理/终端工作方面,GLM-5.2的82.7 Terminal-Bench是一個具體、經過評審的優勢;Qwen 3.8的優勢在於全面性和創造性的一次性操作——在實際測試中令人印象深刻,但未經審計且緩慢

• 兩者都是中國的開放權重MoE模型,宣稱具有100萬token上下文;真正的分野是精實且經過驗證的(GLM)相對於龐大但未經證實的(Qwen)

Qwen 3.8 的數據是廠商聲稱或早期未經控管的實機印象 — 未經獨立審計。GLM-5.2 的數據來自 Artificial Analysis,可能與智譜自身的報告有所不同。Qwen 3.8 的預覽價格是臨時折扣;在預算前請確認每 token 的費率。請注意,Qwen 在政治敏感話題上設有與中共一致的內容護欄。

規格與價格,並列呈現

這裡是硬數據,每個GLM-5.2的數據都標明其來源。

• 製造商/狀態 — Qwen 3.8 Max: Alibaba; 預覽 (2026年7月19日); GLM-5.2: Zhipu; 發布於2026年6月

• 架構 — Qwen 3.8 Max:約2.4T總參數,稀疏MoE;GLM-5.2:753B總參數,稀疏MoE (Artificial Analysis)

• 活躍參數 — Qwen 3.8 Max: 阿里巴巴未公開; GLM-5.2: 40B 活躍 (Artificial Analysis)

• 上下文視窗 — Qwen 3.8 Max:報導約1M tokens(未正式確認);GLM-5.2:1M tokens(Artificial Analysis)

• AA Intelligence Index — Qwen 3.8 Max: 尚无 — 未评分;GLM-5.2: 51(Artificial Analysis)

• Terminal-Bench 2.1 — Qwen 3.8 Max: 尚无公布数据;GLM-5.2: 82.7 (Artificial Analysis)

• 定價(輸入/輸出)— Qwen 3.8 Max:僅預覽(約90%折扣;每Token API未公佈);GLM-5.2: $0.95 / $3.00 每100萬(AA混合約$0.90)

• 開放權重 — Qwen 3.8 Max:承諾「即將」推出(尚未發布);GLM-5.2:是的 — 已發布,今日可下載

• 速度 — Qwen 3.8 Max:測試中最慢的模型(實際操作);GLM-5.2:Lean 40B active — 設計高效

有兩件事構成了這場對決。首先,「活躍參數」這一欄是兩種理念碰撞的地方。GLM-5.2 執行其前沿代理工作——在 Terminal-Bench 2.1 上獲得 82.7 分是相當高的分數——僅使用40B 活躍參數,這是一個公開且可驗證的數字。Qwen 3.8 總參數約為 2.4T,但不會透露有多少是活躍的,因此你根本無法判斷其效率。一個模型證明了它的高效;另一個則要求你假設它高效。

其次,目前決定實際採用的每個因素都偏向GLM。它有一個經過審計的指數(51),而Qwen則是一片空白;它有一個公佈的、穩定的價格(0.95美元/3.00美元),而Qwen則有臨時折扣且無API費率;它的權重已經擺在桌面上,而Qwen的權重還只是承諾。Qwen 3.8的對應砝碼是原始規模以及規模似乎能帶來的徹底性——這在追求質量優先的工作上確實是優勢,但尚未得到中立記分牌的確認。

效率 vs 原始規模

這場比較的核心,是該領域不斷圍繞的一個問題:頂尖水準的工作是否需要頂尖規模的參數?GLM-5.2 是近期最有力的反證。它每個 token 僅需 40B 活躍運算量,便在 Terminal-Bench 2.1 上拿到 82.7 分——根據 Artificial Analysis 的資料,這是目前代理/終端領域較佳的成績之一——同時獲得經審計的整體指數 51。這是一個精簡而專注的模型,其表現遠超其實際參數量的預期,而且它是開放權重的,因此團隊可以下載、檢視它,並在遠比 2.4T 巨獸所需硬體更少的設備上執行。

Qwen 3.8 走的是另一條路。它依靠龐大的規模,在手動測試中,這種規模展現出來的是全面性而非速度。在一項架構理解任務中,一位評測者(Trilogy AI)將 Qwen 3.8 與 Kimi K3 進行比較:Qwen 得到 80/100 分,Kimi 是 83 分,但 Qwen 明顯更詳盡——354 個儲存庫引用對比 274 個,零次工具呼叫失敗對比 Kimi 的兩次——代價是更高的延遲和更多的總 token 數。另一位評測者(thomas-wiegold.com)稱它「非常好且非常慢」,是他們用過最慢的模型,但仍將其置於頂級能力層級。這就是 Qwen 的賭注縮影:挖得更深、引用更多、遺漏更少——但要在時間、token 數以及(目前)無法驗證的宣稱上付出代價。

對於任何代理型任務——終端迴圈、大量工具管道、自行託管部署——GLM-5.2 結合具體的 82.7 Terminal-Bench 分數、小巧的活躍足跡以及已釋出的權重,在今天難以反駁。Qwen 3.8 的徹底性對於深度、品質優先的研究與編碼確實有價值,前提是你承受得起延遲,但你是在憑信心購買:沒有經審計的分數、隱藏的活躍參數、權重仍待釋出,以及針對敏感話題的與中共一致的護欄。可衡量的效率勝過無法衡量的規模。

常見問題

Qwen 3.8 比 GLM-5.2 更好嗎?

根據現有證據,GLM-5.2是更安全的選擇。它擁有經過審計的人工分析智能指數51,以及強勁的Terminal-Bench 2.1分數82.7,加上開放權重,您可以立即執行。Qwen 3.8在深度、品質優先的任務上可能與之匹敵或超越——早期測試者對其全面性評價很高——但它缺乏獨立評分,隱藏其活躍參數數量,並且在實機測試中是最慢的模型。理論上的潛力對比經過驗證且可用的方案:GLM贏得當下。

我可以下載並自行託管其中任何一個嗎?

GLM-5.2 的權重已開放並於 2026 年 6 月發布,擁有 400 億活躍參數,相比 2.4T 模型,自託管更為實用。Qwen 3.8 的開放權重承諾「即將推出」,但尚未發布;即使發布後,約 2.4T 的模型在 4-bit 下約為 1.2TB,需要 8 顆以上的 H200 GPU,這對大多數團隊來說遙不可及。如果當下自託管很重要,那麼 GLM 是唯一的實際選擇。

哪個比較便宜?

GLM-5.2 有著明確且持久的價格:每百萬 tokens 收費 $0.95 / $3.00,人工分析混合費率約為 $0.90。Qwen 3.8 的預覽版享有大幅折扣(約 90% 折扣,夜間最高達 98%),但沒有公佈每 tokens 的 API 價格,且折扣是暫時的——因此你可以放心地以 GLM 為基礎進行預算規劃,但尚無法以 Qwen 為基礎。

哪一種更適合代理型和終端工作?

GLM-5.2,根據當前證據。其在Terminal-Bench 2.1中獲得82.7分(根據Artificial Analysis),這是一個具體、經過審核的代理結果,而其較小的活躍足跡加上已釋出的權重,使其易於部署在工具密集的循環中。Qwen 3.8在實際測試中展現出強大的工具使用能力(一次評測中零工具調用失敗),但沒有可比的經審計的代理分數。

我今天該用哪一個?

GLM-5.2 適用於代理流程、自託管、成本敏感的生產環境,以及任何你現在就需要一個經過驗證、可下載模型的情況。Qwen 3.8 適用於深度、品質優先的研究或編碼,其全面性能帶來回報,且你能容忍較慢的運行速度——同時保持一個選項,等待其權重和第一個獨立評分的到來。

底線

Qwen 3.8 對比 GLM-5.2是效率與原始規模之爭,而目前效率在比分上領先。GLM-5.2 完整展現實力——40B 活躍參數執行前沿智能代理任務、經審計的指數 51、Terminal-Bench 82.7 分、價格便宜且穩定,還有你今天就能下載的開放權重。Qwen 3.8 仰仗 2.4T 的龐大規模與測試者由衷讚賞的全面性測試,但它隱藏了活躍參數數量、沒有獨立評分、出貨速度比評測者用過的任何產品都慢,而它的權重仍只是承諾。GLM-5.2 是現階段務實可得的開放權重智能代理選擇;Qwen 3.8 則是更大膽的賭注,仍需權重與真實分數來證明自己。兩者都值得關注——在它們正式落地之前,請用你自己的提示詞同時測試兩者,讓結果、而非參數數量,來決定勝負。


© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube