
Qwen 3.8 vs GLM-5.2:首個兩者真正重疊的基準評測
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
這兩個模型是中國開放權重AI領域中兩種截然相反押注的最鮮明體現。智譜的GLM-5.2精簡且久經考驗:總參數753B,僅有40B活躍參數,經審計的Artificial Analysis Intelligence Index為51,權重自2026年6月起可下載,發布價格為$0.95 / $3.00。阿里巴巴的Qwen3.8-Max則是極大化押注:約2.4T參數,活躍參數數量未公開,而且——直到最近——完全沒有任何數字。
2026年8月3日的正式上市,讓這場對決擁有了本系列其他文章所沒有的元素:兩個模型皆有分數的基準測試。阿里巴巴報告Terminal-Bench 2.1成績為86.6;Artificial Analysis則有GLM-5.2在相同測試中經審計的82.7分。這是首次,Qwen的宣稱能與獨立測量的競爭對手數據並列於相同基礎之上——但有一項重要前提:兩者之中只有一個是由裁判所產出。
給開發者的一個提示——要解決這個問題,最快的方式是在自己的提示詞上同時運行兩者。OrcaRouter 將 200+ 模型整合在一個 OpenAI 相容的端點後方,因此你可以在同一任務上讓 Qwen 3.8 Max 與 GLM-5.2 對決,而無需設置兩套 SDK。
TL;DR 結論。在唯一共用的基準測試上,Qwen 聲稱於 Terminal-Bench 2.1 領先 3.9 分(86.6 對 82.7)——如果能夠重現,這確實是真實的結果,不過 Qwen 的數據是自行報告的,而 GLM 的數據經過審核。在其他所有方面,GLM-5.2 都擁有實際優勢:它便宜約 2 倍,定價為 $0.95 / $3.00,而 Qwen 為 $2 / $6,其權重今日即可下載,其 40B 活躍參數使其真正可用於部署,而且它擁有獨立指數評分 51,而 Qwen 則沒有。Qwen 則以 1M token 的固定費率上下文回應,提供 GLM 所欠缺的原生多模態能力,以及更高的潛在天花板。精簡且經過驗證的方案在生產環境中仍勝過龐大而未經驗證的方案——但差距在 8 月 3 日已縮小。
重點摘要
• 系列中首個直接基準測試重疊: Terminal-Bench 2.1 — Qwen3.8-Max 86.6(阿里巴巴報告)對比 GLM-5.2 82.7(Artificial Analysis,經審計)。Qwen 領先 3.9 分,但這兩個數字的可信度並不相同。
• GLM-5.2 的價格約為一半: $0.95 / $3.00每 1M(AA 混合約 $0.90),而 Qwen3.8-Max 的$2 / $6。
• 活躍參數才是真正的架構重點:GLM-5.2 運行時使用400億活躍參數,總計7530億參數。阿里巴巴仍然未公開 Qwen 的活躍參數數量,這使得其服務成本無法建模。
• GLM 的權重今天即可下載;Qwen 的權重則承諾本週內提供,但目前尚無授權或儲存庫。
• GLM-5.2 的經審計指數為 51。Qwen3.8-Max 仍未評分——雖然其前身 Qwen3.7-Max 得分為 46,低於 GLM。
• Qwen 的獨特優勢:提供 100 萬 token 的上下文窗口,按固定費率計費,不收取長提示附加費用,並原生支援文字/圖片/影片輸入,OmniDocBench 1.5 得分 92.1。GLM-5.2 則以文字處理為重。
準確性說明:所有 Qwen3.8-Max 的品質數據均由阿里巴巴自行報告,未經第三方驗證。GLM-5.2 的數據來自 Artificial Analysis。在同一基準上比較自行報告的分數與經審計的分數,具有參考價值但並非定論——供應商測試框架與評估測試框架有所差異。Qwen 定價以 GA 費率表為準,取代 7 月的預覽折扣。
規格與價格,並列呈現
以下是確切的數據,每一項數字皆註明其來源。
• 製造商 / 狀態 — Qwen3.8-Max:Alibaba;GA(2026年8月3日);GLM-5.2:Zhipu;2026年6月發布
• 架構 — Qwen3.8-Max:總計約 2.4T,稀疏 MoE;GLM-5.2:總計 753B,稀疏 MoE(Artificial Analysis)
• 啟用參數 — Qwen3.8-Max:阿里巴巴仍未公開;GLM-5.2:40B 啟用(Artificial Analysis)
• 上下文視窗 — Qwen3.8-Max:1M tokens,固定費率(啟用思考模式時為 983,616;最大輸出 131,072);GLM-5.2:1M tokens(Artificial Analysis)
• Terminal-Bench 2.1 — Qwen3.8-Max:86.6(Alibaba 自行報告);GLM-5.2:82.7(Artificial Analysis 審核)
• AA 智能指數 — Qwen3.8-Max:尚未評分;GLM-5.2:51(Artificial Analysis)
• 其他廠商報告的分數 — Qwen3.8-Max:GPQA Diamond 92.6、OSWorld-Verified 86.1、FrontierSWE 73.5(阿里巴巴報告);GLM-5.2:成績由第三方測得
• 模態 — Qwen3.8-Max:文本、圖像、視頻輸入 → 文本輸出;GLM-5.2:專注於文本
• 定價(輸入/輸出)— Qwen3.8-Max:$2.00 / $6.00 每 1M,固定;快取輸入 $0.25;GLM-5.2:$0.95 / $3.00 每 1M(AA 混合約 $0.90)
• 開放權重 — Qwen3.8-Max:承諾本週內發布(尚無授權);GLM-5.2:可以 — 今日即可下載
有兩件事框定了這次比較,而第一件是整個系列中最有用的數據點。
首先,Terminal-Bench 的重疊部分確實極具參考價值。 Terminal-Bench 2.1 衡量模型能否操作真實的 shell 並完成任務——執行指令、讀取輸出、從錯誤中恢復。它是最接近「能否真正作為程式設計代理運作,而不只是程式碼建議工具」的可用指標,也是兩家廠商都選擇公布的基準。Qwen 的 86.6 對上 GLM 經審計的 82.7,是 Qwen 領先 3.9 分。
這個警告很重要,但也不應過度強調。廠商測試框架與評估測試框架在支架、重試策略與提示建構上有所差異,而這些選擇可能使 Terminal-Bench 分數產生超過四分的變動。因此,這並不能證明 Qwen 是更優秀的代理模型。但它確實確立了一件事:Qwen 自行回報的成績落在與經審計的前沿開放權重模型相同的競爭區間內,而非處於不合理的水準。這比「未評分」更具實質意義的優勢地位。
第二,架構比較正是 GLM 悄悄勝出的地方。 GLM-5.2 啟動了 40B 參數(在總計 753B 之中)。這一個數字就足以說明它的服務成本、延遲特性,也說明一個配備齊全的團隊確實能運行它。阿里巴巴至今仍未公布 Qwen 的活躍參數數量——也就是說,無論 2.4T 這個標題數字多麼搶眼,阿里巴巴以外的人都無法估算 Qwen3.8-Max 的服務成本,也無法判斷它自行託管時的表現。在混合專家(Mixture-of-Experts)模型的比較中,這不是一個注腳,而是最重要的一項缺失數字。

精實且經驗證 vs 龐大且未經驗證
GLM-5.2 的案例建立在一個連貫的工程立場上:以更少做到更多、公開數據、釋出權重。一個 40B 活躍參數模型,服務成本低廉、天生快速,而且可由一支擁有可觀但非離譜 GPU 預算的團隊部署。其經審計的 51 指數與經審計的 Terminal-Bench 82.7 分,代表買家無須僅憑信任。而且以 $0.95 / $3.00 的價格,大約是 Qwen 的一半。
Qwen3.8-Max 的情況是相反的賭注:盡可能打造最大的模型,讓能力來證明成本合理。GA 讓這個論點比以往更有說服力,因為終於有具體數字佐證——GPQA Diamond 92.6(研究生科學)、OSWorld-Verified 86.1(GUI 操作)、FrontierSWE 73.5(前代為 40.7),以及前面討論過的 Terminal-Bench 86.6。這些都是前沿級別的數據,而 FrontierSWE 接近翻倍的進步,正是那種難以完全作假的世代級飛躍。
但仍有兩個差距持續存在,而這正是七月份時重要的那兩個差距。目前沒有獨立評分——Artificial Analysis 和 LMArena 尚未對 Qwen3.8-Max 進行評分,因此所有品質聲明都僅來自阿里巴巴自家。此外也沒有授權,因此開放權重的承諾尚無法進行商業評估。
歷史錨點在此對 Qwen 的打擊比多數對戰組合更甚:其前代 Qwen3.7-Max 得分為 46,在 AA 指數上,低於 GLM-5.2 的 51 分。因此,阿里巴巴的隱含主張不僅是 Qwen3.8-Max 表現好,而是說它在一個世代內從低於 GLM 躍升到遠高於它。FrontierSWE 的改進為此說法提供了一些可信度。獨立評分將能定案。

實務上的成本:2× 實際落在何處
以代理式編碼管道為例:180,000 個 token 的儲存庫上下文,每次運行 10,000 個 token 的輸出。
• GLM-5.2: 0.18M × $0.95 = $0.171,加上 0.01M × $3.00 = $0.03。 ≈ $0.20 每次運行。
• Qwen3.8-Max:0.18M × $2 = $0.36,加上 0.01M × $6 = $0.06。約為每次執行 $0.42。
• 以每天 3,000 次執行計算:GLM ≈ $603/天;Qwen ≈ $1,260/天 — 每月約相差 $20,000。
• 在穩定 repo 上,使用 Qwen 的快取輸入($0.25/1M),其運行成本降至 ≈ $0.11,這實際上低於 GLM 未快取的成本。
That last line is the most practically useful thing in this comparison. Qwen's headline price is double GLM's, but its cache-hit rate of $0.25 per 1M is aggressive enough that a well-cached pipeline can flip the ranking. If your agent re-reads a mostly-unchanged context on every turn — which describes most coding agents — Qwen may be the cheaper option in practice despite the worse rate card. Teams that do not configure caching will pay double for nothing.
兩個模型都將思考token計為輸出,因此無論是哪一方,推理密集的配置成本都會高於這些估算。
可部署性:GLM 所擅長的軸線
兩者皆為宣稱具備 100 萬 token 上下文能力的中國開放權重 MoE 模型,這使得可部署性成為最尖銳的實際分野。
GLM-5.2 的權重自六月起即可下載,在 40B 活躍參數下,它是一個實際可自行部署的目標——可量化、可在合理數量的 GPU 上提供服務,且已受到社群實際應用。
Qwen3.8-Max 的權重承諾本週內發布,但對任何人來說,這款旗艦型號都不是一個現實的目標:大約4 位元精度下 1.2TB對比每張 H200 約 141GB,意味著需要八個或更多頂級加速器,而未公開的活躍參數數量使得最終的吞吐量無法預測。再加上缺少授權,目前自行託管這款旗艦型號並非一個可行的計畫。
同時發佈的Qwen3.8-27B是阿里巴巴在此一軸線上的真正答案。它也開放權重,據報僅需約17GB的VRAM即可運行——一張高階顯示卡即可,遠低於GLM-5.2的記憶體佔用——因此在部署便利性上直接競爭。如果你對這兩款模型的興趣在於自行運行,Qwen 27B與GLM-5.2的比較才是真正重要的,而這是一場比2.4T對753B接近得多的較量。
常見問題
Qwen 3.8 比 GLM-5.2 更好嗎?
在它們共同的一項基準測試中,Qwen 聲稱領先——Terminal-Bench 2.1 成績為 86.6,而 GLM 經稽核的成績為 82.7。但 Qwen 的成績是自行申報的,GLM 的成績則是由 Artificial Analysis 測量的,而且評測框架的差異可能超過四分的差距。GLM-5.2 也擁有一項經稽核的指數 51,而 Qwen 完全沒有任何獨立分數。GLM 是更安全的選擇;Qwen 則有未經驗證的更高上限。
它们在 Terminal-Bench 2.1 上的表现如何比較?
Qwen3.8-Max 報告為 86.6;Artificial Analysis 測得 GLM-5.2 為 82.7。這是 Qwen 名義上領先 3.9 分,也是兩者首次在同一基準測試中出現重疊。應將其視為 Qwen 在該區間具有競爭力的證據,而非領先的證明,因為只有 GLM 的分數是獨立產出的。
哪個比較便宜?
GLM-5.2 在價目表上 — 每1M $0.95 / $3.00(AA混合約$0.90),相較於 Qwen 的 $2 / $6,大約一半。但 Qwen 的快取輸入每1M $0.25,價格極具競爭力,因此大量使用快取的管線在 Qwen 上可能比在 GLM 未快取情況下更便宜。
Qwen 3.8 Max 使用多少個活躍參數?
阿里巴巴從未公布過這個數字,即使在正式發布時也是如此。這個數字決定了混合專家(Mixture-of-Experts)模型中的服務成本和延遲,因此它的缺失確實是個實質缺口。相比之下,GLM-5.2 有明確記載:總參數 753B,其中 40B 為激活參數。
實際上哪些可以自行託管?
GLM-5.2 今日發布——權重已釋出,40B活躍參數使其易於部署。Qwen3.8-Max 的權重承諾本週內發布,但旗艦機型需要八顆以上的 H200 等級 GPU,4-bit 下約需 1.2TB 記憶體,且尚未公布授權條款。同期發布的 Qwen3.8-27B 據報約需 17GB 顯存,是可直接部署的 Qwen 選項,也更貼近 GLM 的定位。
Qwen 3.8 Max 是否已退出預覽?
是的,在2026年8月3日,具有已發布的費率表,以及與OpenAI和DashScope相容的端點。7月的Qoder積分90%折扣活動已不再描述其銷售方式。
Qwen 提供了哪些 GLM-5.2 沒有的功能?
原生多模態——支援圖片與影片輸入,文件解析在 OmniDocBench 自報分數 92.1——以及 100 萬 token 的上下文,採單一費率計價,長提示不另加收費。GLM-5.2 以文字為核心,因此在文件、截圖或影片處理管線上,Qwen 與其說是在跟它競爭,不如說是在做不同的事。
重點
Qwen 3.8 對比 GLM-5.2是正式發佈帶來最多真正新資訊的對決組合。Qwen 首次在獨立評估者也執行過的基準測試上獲得分數,且高於 GLM:Terminal-Bench 2.1 為 86.6 比 82.7。這讓 Qwen 從「未評分」晉升到「在實測基礎上具有合理競爭力」,即使考量到自我回報的保留條件,這仍是實質的進展。
但 GLM-5.2 依然保有實用性的王冠,而且靠的是毫不光鮮的優勢:價格只有一半、經審計的 51 指數、40B 活躍參數讓其成本可預期且部署可行,還有你現在就能下載的權重。Qwen 的答案——固定費率的百萬 token 上下文、原生多模態、更高的天花板——確實有意義,但都附帶條件,而且它在七月的兩個缺口依然如故:沒有獨立評分,也沒有授權。留意三件事:Qwen3.8-Max 的第一個獨立 Intelligence Index 評分、評測者能否重現那 86.6 的 Terminal-Bench 成績,以及 Qwen3.8-27B 的發布——那才是兩種哲學真正交鋒之處。在那之前,GLM-5.2 是你會部署的選擇,Qwen3.8-Max 是你會評估的對象——記得開啟快取。

本文中的比較3
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
