
Ling-3.1-flash 對比 GLM-5.3-Flash:四倍吞吐量,對上一點指數
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Ling-3.1-flash 與 GLM-5.3-Flash 在 Artificial Analysis Intelligence Index 上只相差一分——41 對 42——這讓它們看起來像是同一個決定做了兩次。但它們並不是。GLM-5.3-Flash 在 Z.ai 自家 API 上以每秒 53.0 個 token 產生輸出;Ling-3.1-flash 則在 InclusionAI 的 API 上以每秒 211.0 個 token 產生輸出。這是吞吐量上四倍的差距,而且遠大於該指數用來區分兩者的任何差異。其中一款在幾乎每一個品質面向上都更為強大,並以 MIT 授權開放。另一款則是先完成的那一款,封閉,且沒有公布價格、授權或檢查點。要在兩者之間做選擇,取決於你的工作負載在等什麼。
軸 Ling-3.1-flash 完勝
當你在相同能力等級的模型之間做選擇時,速度絕不是可有可無的附註,而在這裡,這正是 Ant 模型的全部理由。
• 輸出吞吐量 —— Ling-3.1-flash 在 InclusionAI 的 API 上每秒 211.0 個 token,相較於 GLM-5.3-Flash 在 Z.ai 的 API 上每秒 53.0 個 token。生成速率達四倍。
• 首個 token 時間 —— Ling-3.1-flash 1.80 秒,GLM-5.3-Flash 3.18 秒。螞蟻的模型已經開始回答,Z.ai 的模型還在思考,而在互動與串流應用中,這一點比吞吐量更為重要。
• 每個 Intelligence Index 任務的耗時 — Ling-3.1-flash 約 357 秒,而 GLM-5.3-Flash 約 979 秒。單一評估任務從頭到尾,GLM-5.3-Flash 所耗費的時間將近三倍,因為它不僅每個 token 的處理速度較慢,啟動速度也較慢。
對於一個會進行十幾次循序呼叫的代理迴圈,或是一個有人正看著 token 逐一抵達的產品,那不是決勝關鍵——而是偏好某個模型的全部理由。GLM-5.3-Flash 在紙面上是更好的模型,在請求路徑上卻是較慢的那一個。
GLM-5.3-Flash 就是更勝一籌的地方
在其他所有情況下——而這份清單之長,足以讓吞吐量的優勢必須證明自身價值。
• 知識可靠性 — GLM-5.3-Flash 在 AA-Omniscience 上得分 +7.47,是三款 Flash 級模型中表現最佳的,且在已作答問題上的幻覺率為 27.6%。Ling-3.1-flash 得分 +2.22,幻覺率為 37.9%。在一項對憑空虛構的懲罰重於拒答的衡量標準上,這一差距確實存在,且與該指數指向同一方向。
• 科學知識 — GLM-5.3-Flash 在 GPQA Diamond 上取得 0.912 的成績。Ling-3.1-flash 沒有公佈 GPQA Diamond 的數據列。DeepSeek V4.1 Flash (Max) 也是如此。一個在研究所程度科學問題上達到 0.91 的模型,與一個尚未在這些問題上受測的模型,是截然不同的工具。
• 模態 — GLM-5.3-Flash 接受文字、圖像與影片。Ling-3.1-flash 僅接受文字。這不是靠基準測試就能彌補的效能差距;而是一項根本不具備的能力。
• 權重與授權 — GLM-5.3-Flash 以 MIT 授權開放權重,可下載並自行託管。Ling-3.1-flash 未發布任何檢查點、沒有授權條款,且被歸類為專有。
• 代理式知識工作 — GLM-5.3-Flash 在 AA-Briefcase v1.1 上取得 1,453.73 Elo,對比 Ling-3.1-flash 的 1,400.35;該基準測試專門圍繞知識工作任務建構,而非終端機操作。
• 價格 — GLM-5.3-Flash 在 Z.ai 的 API 上定價為每百萬輸入 $0.15、每百萬輸出 $0.50,對比 Ling-3.1-flash 的 $0.30 與 $0.90。輸入費率只要一半,輸出費率也大約一半,而且來自一款指數分數更高、權重開放的模型。

Ant 模型回覆的列
Ling-3.1-flash 並非在所有方面都落敗。在代理式終端機工作上,它略佔上風;而在程式設計科學上則持平:
• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 對上 GLM-5.3-Flash 0.328。實際上可說是平手,而且兩者都落在前沿層級之下。
• SciCode — Ling-3.1-flash 0.541 對 GLM-5.3-Flash 0.516。微幅勝出。
• AutomationBench-AA — 0.617 對 0.604。又一次險勝。
• GDPval-AA — Ling-3.1-flash 的 1,621.75 Elo 對上 GLM-5.3-Flash 的 1,646.86。GLM 扳回一城。
將這四行放在一起讀,輪廓就很清楚。如果這兩個模型真能區分開來,那區別也落在單次評估執行的雜訊之中。它們之間一點的指數差異並不是排名;那是一場擲硬幣,只是因為可靠性列而略微偏向 GLM。不是擲硬幣的是 4× 吞吐量差距和 2× 價格差距,兩者都指向另一個方向。
還有一個值得指出的服務細節,因為它會改變那個吞吐量差距的大小,取決於你在哪裡呼叫模型。Z.ai 自家的 API 測得每秒 53.0 個 token。我們自家目錄中 GLM-5.3-Flash 在我們路由上為期七天的量測顯示,輸出為每秒 150.6 個 token,首 token 延遲中位數為 4.2 秒。同樣的權重由不同部署提供服務時,執行速度快了將近三倍。供應商的吞吐量數據是供應商的屬性,而不是模型的屬性。
規格,逐行
每行主語置前:
• 規模 — Ling-3.1-flash 總參數 560B / 啟用 25B,對比 GLM-5.3-Flash 總參數 320B / 啟用 18B。
• 宣告的上下文 —— 兩者皆為 1M tokens。GLM-5.3-Flash 的長上下文推理列在 AA-LCR 上測得 0.80;Ling-3.1-flash 為 0.83。兩者都接近 DeepSeek V4.1 Flash (Max) 的 0.84,也就是說,長上下文推理在這個層級已不再是差異化因素。
• 輸出上限 — GLM-5.3-Flash 在我們的型錄中為 128,000 個 token,對比 Ling-3.1-flash 則未公佈上限。這兩者之中,一個能為長內容生成調整規模,另一個則不能。
• 索引 — 41 對 42。
• 吞吐量 — 每秒 211.0 個 token,供應商 API 為 53.0,我們的路由實測為 150.6。
• 權重 — 專有且無授權條款,對比依 MIT 開放。
• 模態 — 僅文字,對比文字、圖像與影片輸入。
• 價格 — 每百萬輸入/輸出為 $0.30 / $0.90,相較於 Z.ai API 的 $0.15 / $0.50。
如何實際執行這項比較
GLM-5.3-Flash 現已收錄於 OrcaRouter 目錄中,標價為每百萬輸入 $0.075、每百萬輸出 $0.25,以及每百萬快取讀取 $0.0173——請以即時卡片為準,而非本段文字,因為服務費率會變動,而成本轉嫁機制意味著供應商價格一旦調整,當天就會反映在我們這一側。這項機制對這個特定組合的價值在於:GLM-5.3-Flash 的開放性與價格優勢,正是讓它成為合理預設選項的兩項條件;而一條封閉、零加價的路線,則讓你在不新增供應商關係的情況下,持續以 Ling-3.1-flash 與它對測。
Ling-3.1-flash 不在我們的目錄中——以我們的公開模型 API 查詢時,InclusionAI 底下的這個模型會回傳 not-found,而本文不會暗示我們有提供它。它透過 Ant 自家的 API 以及承載此發布的第三方平台運行,這才是其可用範圍的誠實描述。
這個比較真正有產出的形態並不是二選一。GLM-5.3-Flash 是開源的、最便宜、多模態、在知識型問題上更可靠,而且可透過 23 家供應商取用——那是一條預設路徑。Ling-3.1-flash 的立論在於代理迴圈上的吞吐量與 TTFT,而它的代價是閉源、僅支援文字、更貴,能走的門也更少。把互動式、對延遲敏感的工作導向快模型,把批次、知識密集與多模態的工作留在開源模型上,並在兩者之間設置備援,這樣上游變慢就不會拖慢產品。
該選哪一個
如果你的評估標準是能力、成本、開放性和模態,GLM-5.3-Flash 會在這場對決中勝出,而且差距並不小——更高的指數分數、同級距中最佳的知識可靠性概況、0.912 的 GPQA Diamond、MIT 授權權重、影片輸入、價格只要一半,背後還有 23 家供應商。如果你的標準包括使用者要等多久,或一項任務能進行多少次循序呼叫,Ling-3.1-flash 才是能完成任務的模型,而它四倍的生成速率在代理迴圈中絕非可忽略的捨入誤差。
真正能讓這件事有定論的,是兩家廠商都沒有以可比較形式公布的服務細節:在你的工作負載上、透過你的供應商實際交付的輸送量。兩個模型都能回應相同的 OpenAI 相容 chat-completions 格式,這意味著在它們之間切換只是設定變更,而不是遷移——而對於在指標上只相差一分、速度卻相差四倍的兩個模型來說,用自己的流量測量那一個數字,會比再讀一列基準測試結果更值得花上一個下午。


本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
