
Ling-3.1-flash 對比 DeepSeek V4.1 Flash:指數多兩分,帳單卻是三倍
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Ling-3.1-flash 與 DeepSeek V4.1 Flash(Max)在 Artificial Analysis Intelligence Index 上相差兩分——41 對 39——但在價格上卻天差地遠。把組成該指數的十項評測分別拿去跑這兩個模型,Ling-3.1-flash 每項任務約需 0.99 美元,而 DeepSeek 只要 0.27 美元。兩者都是約 5,500 億參數的混合專家模型,並宣稱具備 100 萬 token 上下文。一個是來自 Ant Group 旗下 InclusionAI 實驗室的封閉、純文字模型,於 2026-10-01 發布,至今仍未公布權重或授權條款。另一個自 2026-09-10 起以 MIT 授權開源,可接受圖像與文字,能在 23 家供應商上執行,也是大多數團隊早就會放進設定檔的模型。就大多數面向而言,兩者根本沒得比。真正有趣的問題是:這兩分差距究竟為什麼會存在。
Ling-3.1-flash 真正領先之處
在衡量操作終端機與撰寫必須能執行的程式碼的評測中,它處於領先,而這個領先幅度值得精確說明,因為總體數據會掩蓋它。
• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 對上 DeepSeek V4.1 Flash(Max)0.268。就絕對值而言,兩者都只是 modest 的數字;而差距相當於 DeepSeek 得分的四分之一。
• SciCode — 0.541 對比 0.519。
• CritPt 物理推理 — 0.180 對比 0.143。
• GDPval-AA 代理式真實世界工作 — 1,621.75 Elo 對比 1,600 Elo。
那四項裡有兩項幾乎難分軒輊,一項是小幅勝出,而 Terminal-Bench 4.0 是唯一一個即使換了隨機種子、差距依然能存續的項目。把這對照到 DeepSeek 勝出的地方:AA-Briefcase v1.1 代理式知識工作以 1,420.47 Elo 對上 1,400.35,AutomationBench-AA 以 0.689 對上 0.617,AA-LCR 長脈絡推論以 0.84 對上 0.83,還有——對生產環境最要緊的那一項——AA-Omniscience 以 −5.30 對上 Ling-3.1-flash 的 +2.22,而這項指標中幻覺比拒答更糟。DeepSeek 在該項的準確率為 46.4%,且在其所回答的問題中有 96.5% 的幻覺率;Ling-3.1-flash 則答對 29.1%,幻覺率為 37.9%。這兩者都不是那種可以不搭配前置檢索、直接指向知識庫使用的模型。
價格差距比指數差距更大,而且這不僅僅是價目表。
表面費率看起來幾乎一模一樣。Artificial Analysis 記錄兩者皆為每百萬輸入 token $0.30。它們在其他兩個數字上則差異懸殊:
• 輸出 — Ling-3.1-flash 每百萬 $0.90,對比 DeepSeek V4.1 Flash (Max) 每百萬 $1.20。在此,Ling-3.1-flash 完全是更便宜的模型,便宜了 25%。
• 快取讀取 — Ling-3.1-flash 每百萬 $0.06,對比 DeepSeek V4.1 Flash (Max) 每百萬 $0.006,這是 98% 折扣對上 80% 折扣。這正是這兩個模型不再能相提並論的地方。
在 7:2:1 的快取命中/輸入/輸出混合比例下,混合費率算出來是 Ling-3.1-flash 的 $0.192,以及 DeepSeek V4.1 Flash (Max) 的 $0.184——幾乎打平。但這個混合比例是對你如何使用模型的假設,而這個假設承擔了很重的分量。任何有大量提示重複使用的工作負載——冗長的系統提示、檢索前導文字、每一輪都會重新送出累積上下文的代理迴圈——都會把實際混合比例推向快取讀取,而在那裡,快取定價 10 倍的差距就會主導一切。Token 量也會以同樣的方式產生複合影響:Ling-3.1-flash 是個話多的推理模型,在整個索引評估中產生了 2.2 億個輸出 token,而 DeepSeek 是 2.5 億個,且每個評估任務平均約 357 秒,DeepSeek 則為 285 秒。它每個答案思考得更多,耗時也更長。

實作範例:兩者上相同的代理迴圈
以一個工具驅動的代理為例,每項任務執行 1M 輸入 token,其中 90% 由快取提供,並回傳 200,000 輸出 token。在 Ling-3.1-flash 上,依上述數字:900,000 個快取輸入 token 以 $0.06 計,加上 100,000 個全新輸入以 $0.30 計,再加上 200,000 個輸出以 $0.90 計,每項任務約為 $0.26。在 DeepSeek V4.1 Flash (Max) 上,相同的迴圈約為 $0.14——大約是一半。
現在套用 DeepSeek 的排程,因為這正是大多數比較會跳過的部分。DeepSeek 的離峰費率就是上面那個,而離峰涵蓋週末與一天中的大部分時段;但在兩個平日時段,也就是 UTC 01:00–04:00 和 06:00–10:00,輸入與快取定價會加倍。把同一個迴圈移到尖峰時段,DeepSeek 的成本會落在約 $0.28——此時 Ling-3.1-flash 那張較高但固定的價目表,反而是那個小時更便宜的選擇,而 10× 快取折扣已被時鐘抵銷。
整個決策就取決於一組數字。如果你的 agent 流量以快取為主,而且你能安排排程,那麼在指數差距兩點的情況下,DeepSeek V4.1 Flash (Max) 的成本大約是 Ling-3.1-flash 的一半。如果你的流量以快取為主,且落在 DeepSeek 的尖峰時段,這兩個模型的成本大致相同,而 Ling-3.1-flash 在 terminal-agent 那一列略勝一籌,就成了決勝關鍵。
沒有可供比較的軸
這三個面向並不接近,而它們往往是在討論價格之前就決定架構的關鍵因素。
• 權重與授權 — Ling-3.1-flash 尚未發布權重,也沒有授權條款,而 Artificial Analysis 將其歸類為專有。DeepSeek V4.1 Flash (Max) 以 MIT 授權開放權重,可從 Hugging Face 下載,並允許商業使用。其中一個可自行託管、微調及氣隙部署;另一個則不能。
• 模態 — Ling-3.1-flash 是文字進、文字出。DeepSeek V4.1 Flash (Max) 可接受圖片連同文字輸入,並在多模態基準測試中接受評分。假如你的流程中有任何環節會把螢幕截圖、圖表或掃描檔交給模型,那麼這個比較就到此為止。
• 服務供應面 — DeepSeek V4.1 Flash (Max) 可透過 23 家供應商取得,包括 OrcaRouter;Ling-3.1-flash 則透過該供應商自家的 API,以及承載其發行的第三方平台運行。就正式生產路徑而言,供應商數量是一項韌性特質,而非人氣競賽。
還有一個不對稱性並未出現在上述任何清單中:DeepSeek V4.1 Flash (Max) 在單一回應中提供 384,000 個輸出 token。Ant 尚未公布 Ling-3.1-flash 的最大輸出長度,因此目前還無法以它為基準來估算長生成工作負載。沒有公布上限並不等同於上限很小,但它也不是一個你可以據以設計的數字。
同時執行兩者,以及實際上會是什麼樣子
Ling-3.1-flash 今天不在 OrcaRouter 目錄中——向我們公開的模型 API 查詢時,InclusionAI 旗下的這個模型會傳回 not-found,而本文不會假裝並非如此。DeepSeek V4.1 Flash 目前可路由,價格為供應商的定價、零加成,因此供應商調價當天,我們這邊就會同步生效,而且它和目錄其餘模型一樣,透過同一組單一 API 金鑰存取,並在上游供應商之間自動容錯移轉。
這種不對稱有其實際形態。當一個模型是閉源的、定價大約是其前代四倍,而且只能透過單一供應商取得時,要進行比較的明智做法,就是把那個開放、被廣泛服務的模型保留為預設路徑,並把挑戰者當成你可測試的東西,而非你必須投入承諾的對象。DeepSeek V4.1 Flash (Max) 今天就能承擔生產迴圈——開放權重、影像輸入、384K 輸出、98% 快取折扣——而 Ling-3.1-flash 則負責代理專屬工作,讓它的 Terminal-Bench 與 SciCode 優勢真正派上用場。因為兩者都使用 OpenAI 相容的 chat-completions 格式,這種分工是一項路由決策,而不是整合專案:一個端點、一把金鑰,以及一條規則,把各模型可量測上更擅長的任務分派出去。
裁決結果
就現有證據而言,DeepSeek V4.1 Flash(Max)贏得這場對決,而且它勝出的地方大多與兩個 Index 分數無關:MIT 授權的開放權重、圖像輸入、384,000 個輸出 token、98% 的快取折扣,以及 23 家可相互接手故障轉移的供應商。Ling-3.1-flash 的理由較狹窄但真實——它是兩者中較出色的終端與工具代理,也是這對之中唯一尚未公布內含尖峰時段倍數費率表的模型。
有兩件事會改變這項評估。如果 Ant 以寬鬆的授權條款發布權重,開放性差距就會消失,比較也會變成單純的能力與成本討論。而如果 Ant 所提供的長上下文視窗,在兩個模型都宣稱的 100 萬個 token 上獲得驗證,上下文對等性的說法就不再只是說法。在那之前,誠實的總結是:一個模型可以在代理式基準測試的某一列勝出,卻仍輸掉整體評估——而這些模型之間的兩點指數差距,大約值每項任務成本的 3.6 倍,這是一種只有特定工作負載才該做的取捨。


