《Ling-3.1-flash 對決 GLM-5.3-Flash》主視覺標題卡,副標題為「四倍吞吐量,對上一分的索引差距」。兩張圓角卡片並排,中間留有清楚的間距:左側標示為「Ling-3.1-flash」,內容為「速度:211 tok/s」、「AA Index:41」、「授權:未公布」;右側標示為「GLM-5.3-Flash」,內容為「速度:53 tok/s」、「AA Index:42」、「授權:MIT」。頁尾一行寫著「吞吐量數據取自各廠商自家 API;索引分數依 Artificial Analysis 為準。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Ling-3.1-flash 對比 GLM-5.3-Flash:四倍吞吐量,對上一點指數

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Ling-3.1-flash 與 GLM-5.3-Flash 在 Artificial Analysis Intelligence Index 上只相差一分——41 對 42——這讓它們看起來像是同一個決定做了兩次。但它們並不是。GLM-5.3-Flash 在 Z.ai 自家 API 上以每秒 53.0 個 token 產生輸出;Ling-3.1-flash 則在 InclusionAI 的 API 上以每秒 211.0 個 token 產生輸出。這是吞吐量上四倍的差距,而且遠大於該指數用來區分兩者的任何差異。其中一款在幾乎每一個品質面向上都更為強大,並以 MIT 授權開放。另一款則是先完成的那一款,封閉,且沒有公布價格、授權或檢查點。要在兩者之間做選擇,取決於你的工作負載在等什麼。

軸 Ling-3.1-flash 完勝

當你在相同能力等級的模型之間做選擇時,速度絕不是可有可無的附註,而在這裡,這正是 Ant 模型的全部理由。

• 輸出吞吐量 —— Ling-3.1-flash 在 InclusionAI 的 API 上每秒 211.0 個 token,相較於 GLM-5.3-Flash 在 Z.ai 的 API 上每秒 53.0 個 token。生成速率達四倍。

• 首個 token 時間 —— Ling-3.1-flash 1.80 秒,GLM-5.3-Flash 3.18 秒。螞蟻的模型已經開始回答,Z.ai 的模型還在思考,而在互動與串流應用中,這一點比吞吐量更為重要。

• 每個 Intelligence Index 任務的耗時 — Ling-3.1-flash 約 357 秒,而 GLM-5.3-Flash 約 979 秒。單一評估任務從頭到尾,GLM-5.3-Flash 所耗費的時間將近三倍,因為它不僅每個 token 的處理速度較慢,啟動速度也較慢。

對於一個會進行十幾次循序呼叫的代理迴圈,或是一個有人正看著 token 逐一抵達的產品,那不是決勝關鍵——而是偏好某個模型的全部理由。GLM-5.3-Flash 在紙面上是更好的模型,在請求路徑上卻是較慢的那一個。

GLM-5.3-Flash 就是更勝一籌的地方

在其他所有情況下——而這份清單之長,足以讓吞吐量的優勢必須證明自身價值。

• 知識可靠性 — GLM-5.3-Flash 在 AA-Omniscience 上得分 +7.47,是三款 Flash 級模型中表現最佳的,且在已作答問題上的幻覺率為 27.6%。Ling-3.1-flash 得分 +2.22,幻覺率為 37.9%。在一項對憑空虛構的懲罰重於拒答的衡量標準上,這一差距確實存在,且與該指數指向同一方向。

• 科學知識 — GLM-5.3-Flash 在 GPQA Diamond 上取得 0.912 的成績。Ling-3.1-flash 沒有公佈 GPQA Diamond 的數據列。DeepSeek V4.1 Flash (Max) 也是如此。一個在研究所程度科學問題上達到 0.91 的模型,與一個尚未在這些問題上受測的模型,是截然不同的工具。

• 模態 — GLM-5.3-Flash 接受文字、圖像與影片。Ling-3.1-flash 僅接受文字。這不是靠基準測試就能彌補的效能差距;而是一項根本不具備的能力。

• 權重與授權 — GLM-5.3-Flash 以 MIT 授權開放權重,可下載並自行託管。Ling-3.1-flash 未發布任何檢查點、沒有授權條款,且被歸類為專有。

• 代理式知識工作 — GLM-5.3-Flash 在 AA-Briefcase v1.1 上取得 1,453.73 Elo,對比 Ling-3.1-flash 的 1,400.35;該基準測試專門圍繞知識工作任務建構,而非終端機操作。

• 價格 — GLM-5.3-Flash 在 Z.ai 的 API 上定價為每百萬輸入 $0.15、每百萬輸出 $0.50,對比 Ling-3.1-flash 的 $0.30 與 $0.90。輸入費率只要一半,輸出費率也大約一半,而且來自一款指數分數更高、權重開放的模型。

A two-column generated scoreboard titled 'Ling-3.1-flash vs GLM-5.3-Flash — the scoreboard'. The left column, 'Ling-3.1-flash', reads 'AA Index: 41', 'Speed: 211 tok/s', 'First token: 1.80 s', 'Omniscience: +2.22', 'Weights: closed', 'Price: $0.30 / $0.90'; the right column, 'GLM-5.3-Flash', reads 'AA Index: 42', 'Speed: 53 tok/s', 'First token: 3.18 s', 'Omniscience: +7.47', 'Weights: MIT', 'Price: $0.15 / $0.50'. A footer line reads 'Index and quality rows per Artificial Analysis; throughput per each vendor's own API.' The OrcaRouter logo is composited in the bottom-right corner.

Ant 模型回覆的列

Ling-3.1-flash 並非在所有方面都落敗。在代理式終端機工作上,它略佔上風;而在程式設計科學上則持平:

• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 對上 GLM-5.3-Flash 0.328。實際上可說是平手,而且兩者都落在前沿層級之下。

• SciCode — Ling-3.1-flash 0.541 對 GLM-5.3-Flash 0.516。微幅勝出。

• AutomationBench-AA — 0.617 對 0.604。又一次險勝。

• GDPval-AA — Ling-3.1-flash 的 1,621.75 Elo 對上 GLM-5.3-Flash 的 1,646.86。GLM 扳回一城。

將這四行放在一起讀,輪廓就很清楚。如果這兩個模型真能區分開來,那區別也落在單次評估執行的雜訊之中。它們之間一點的指數差異並不是排名;那是一場擲硬幣,只是因為可靠性列而略微偏向 GLM。不是擲硬幣的是 4× 吞吐量差距和 2× 價格差距,兩者都指向另一個方向。

還有一個值得指出的服務細節,因為它會改變那個吞吐量差距的大小,取決於你在哪裡呼叫模型。Z.ai 自家的 API 測得每秒 53.0 個 token。我們自家目錄中 GLM-5.3-Flash 在我們路由上為期七天的量測顯示,輸出為每秒 150.6 個 token,首 token 延遲中位數為 4.2 秒。同樣的權重由不同部署提供服務時,執行速度快了將近三倍。供應商的吞吐量數據是供應商的屬性,而不是模型的屬性。

規格,逐行

每行主語置前:

• 規模 — Ling-3.1-flash 總參數 560B / 啟用 25B,對比 GLM-5.3-Flash 總參數 320B / 啟用 18B。

• 宣告的上下文 —— 兩者皆為 1M tokens。GLM-5.3-Flash 的長上下文推理列在 AA-LCR 上測得 0.80;Ling-3.1-flash 為 0.83。兩者都接近 DeepSeek V4.1 Flash (Max) 的 0.84,也就是說,長上下文推理在這個層級已不再是差異化因素。

• 輸出上限 — GLM-5.3-Flash 在我們的型錄中為 128,000 個 token,對比 Ling-3.1-flash 則未公佈上限。這兩者之中,一個能為長內容生成調整規模,另一個則不能。

• 索引 — 41 對 42。

• 吞吐量 — 每秒 211.0 個 token,供應商 API 為 53.0,我們的路由實測為 150.6。

• 權重 — 專有且無授權條款,對比依 MIT 開放。

• 模態 — 僅文字,對比文字、圖像與影片輸入。

• 價格 — 每百萬輸入/輸出為 $0.30 / $0.90,相較於 Z.ai API 的 $0.15 / $0.50。

如何實際執行這項比較

GLM-5.3-Flash 現已收錄於 OrcaRouter 目錄中,標價為每百萬輸入 $0.075、每百萬輸出 $0.25,以及每百萬快取讀取 $0.0173——請以即時卡片為準,而非本段文字,因為服務費率會變動,而成本轉嫁機制意味著供應商價格一旦調整,當天就會反映在我們這一側。這項機制對這個特定組合的價值在於:GLM-5.3-Flash 的開放性與價格優勢,正是讓它成為合理預設選項的兩項條件;而一條封閉、零加價的路線,則讓你在不新增供應商關係的情況下,持續以 Ling-3.1-flash 與它對測。

Ling-3.1-flash 不在我們的目錄中——以我們的公開模型 API 查詢時,InclusionAI 底下的這個模型會回傳 not-found,而本文不會暗示我們有提供它。它透過 Ant 自家的 API 以及承載此發布的第三方平台運行,這才是其可用範圍的誠實描述。

這個比較真正有產出的形態並不是二選一。GLM-5.3-Flash 是開源的、最便宜、多模態、在知識型問題上更可靠,而且可透過 23 家供應商取用——那是一條預設路徑。Ling-3.1-flash 的立論在於代理迴圈上的吞吐量與 TTFT,而它的代價是閉源、僅支援文字、更貴,能走的門也更少。把互動式、對延遲敏感的工作導向快模型,把批次、知識密集與多模態的工作留在開源模型上,並在兩者之間設置備援,這樣上游變慢就不會拖慢產品。

該選哪一個

如果你的評估標準是能力、成本、開放性和模態,GLM-5.3-Flash 會在這場對決中勝出,而且差距並不小——更高的指數分數、同級距中最佳的知識可靠性概況、0.912 的 GPQA Diamond、MIT 授權權重、影片輸入、價格只要一半,背後還有 23 家供應商。如果你的標準包括使用者要等多久,或一項任務能進行多少次循序呼叫,Ling-3.1-flash 才是能完成任務的模型,而它四倍的生成速率在代理迴圈中絕非可忽略的捨入誤差。

真正能讓這件事有定論的,是兩家廠商都沒有以可比較形式公布的服務細節:在你的工作負載上、透過你的供應商實際交付的輸送量。兩個模型都能回應相同的 OpenAI 相容 chat-completions 格式,這意味著在它們之間切換只是設定變更,而不是遷移——而對於在指標上只相差一分、速度卻相差四倍的兩個模型來說,用自己的流量測量那一個數字,會比再讀一列基準測試結果更值得花上一個下午。

Screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash, in English, captured 2026-10-07. The header reads 'GLM 5.3 Flash', 'ctx 1M tokens', 'Max output 128K', inputs 'text + image + video' and output 'text', with vision, tools, JSON and reasoning capability icons and a release date of 2026-08-26. Four rounded stat tiles read '$0.07', '$0.25', '4.20 s' and '10.00 s' — the input and output rates rendered to two decimals, then the median first-token latency and another latency figure. The description states '320B total / 18B active parameters, 1M-token context, text + image + video in, text out.' The PRICING panel lists 'Input / 1M tokens $0.075', 'Output / 1M tokens $0.250' and 'Cache read / 1M $0.017'. A code sample shows base_url https://api.orcarouter.ai/v1 with model 'z-ai/glm-5.3-flash'.Screenshot of the Artificial Analysis model page for GLM 5.3 Flash, in English, captured 2026-10-07, marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 42, 53.0 output tokens per second, $0.25 cost per Intelligence Index task, 180M output tokens generated across the index, input $0.15 with an 83% cache discount and output $0.50 per 1M tokens, a 1M context window, text and image input, 320B total parameters with 18.8B active parameters, and a licence of MIT with weights on Hugging Face. The summary line calls the model 'notably slow (75)'.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新