「Ling-3.1-flash vs DeepSeek V4.1 Flash」的主視覺標題卡,副標題為「分數,三倍成本」。兩張卡片並排,中間留有間距:左邊標示為「Ling-3.1-flash」的卡片寫著「AA 指數:10?」、「每項任務成本:$0.99」、「權重:?」;右邊標示為「DeepSeek V4.1 Flash (Max)」的卡片寫著「AA 指數:30?」、「每項任務成本:$0.27」、「權重:?」。頁尾一行寫著「成本與指數依據 Artificial Analysis。」Or...Router 標誌合成於右下角。
Guides & Insights

Ling-3.1-flash 對比 DeepSeek V4.1 Flash:指數多兩分,帳單卻是三倍

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Ling-3.1-flash 與 DeepSeek V4.1 Flash(Max)在 Artificial Analysis Intelligence Index 上相差兩分——41 對 39——但在價格上卻天差地遠。把組成該指數的十項評測分別拿去跑這兩個模型,Ling-3.1-flash 每項任務約需 0.99 美元,而 DeepSeek 只要 0.27 美元。兩者都是約 5,500 億參數的混合專家模型,並宣稱具備 100 萬 token 上下文。一個是來自 Ant Group 旗下 InclusionAI 實驗室的封閉、純文字模型,於 2026-10-01 發布,至今仍未公布權重或授權條款。另一個自 2026-09-10 起以 MIT 授權開源,可接受圖像與文字,能在 23 家供應商上執行,也是大多數團隊早就會放進設定檔的模型。就大多數面向而言,兩者根本沒得比。真正有趣的問題是:這兩分差距究竟為什麼會存在。

Ling-3.1-flash 真正領先之處

在衡量操作終端機與撰寫必須能執行的程式碼的評測中,它處於領先,而這個領先幅度值得精確說明,因為總體數據會掩蓋它。

• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 對上 DeepSeek V4.1 Flash(Max)0.268。就絕對值而言,兩者都只是 modest 的數字;而差距相當於 DeepSeek 得分的四分之一。

• SciCode — 0.541 對比 0.519。

• CritPt 物理推理 — 0.180 對比 0.143。

• GDPval-AA 代理式真實世界工作 — 1,621.75 Elo 對比 1,600 Elo。

那四項裡有兩項幾乎難分軒輊,一項是小幅勝出,而 Terminal-Bench 4.0 是唯一一個即使換了隨機種子、差距依然能存續的項目。把這對照到 DeepSeek 勝出的地方:AA-Briefcase v1.1 代理式知識工作以 1,420.47 Elo 對上 1,400.35,AutomationBench-AA 以 0.689 對上 0.617,AA-LCR 長脈絡推論以 0.84 對上 0.83,還有——對生產環境最要緊的那一項——AA-Omniscience 以 −5.30 對上 Ling-3.1-flash 的 +2.22,而這項指標中幻覺比拒答更糟。DeepSeek 在該項的準確率為 46.4%,且在其所回答的問題中有 96.5% 的幻覺率;Ling-3.1-flash 則答對 29.1%,幻覺率為 37.9%。這兩者都不是那種可以不搭配前置檢索、直接指向知識庫使用的模型。

價格差距比指數差距更大,而且這不僅僅是價目表。

表面費率看起來幾乎一模一樣。Artificial Analysis 記錄兩者皆為每百萬輸入 token $0.30。它們在其他兩個數字上則差異懸殊:

• 輸出 — Ling-3.1-flash 每百萬 $0.90,對比 DeepSeek V4.1 Flash (Max) 每百萬 $1.20。在此,Ling-3.1-flash 完全是更便宜的模型,便宜了 25%。

• 快取讀取 — Ling-3.1-flash 每百萬 $0.06,對比 DeepSeek V4.1 Flash (Max) 每百萬 $0.006,這是 98% 折扣對上 80% 折扣。這正是這兩個模型不再能相提並論的地方。

在 7:2:1 的快取命中/輸入/輸出混合比例下,混合費率算出來是 Ling-3.1-flash 的 $0.192,以及 DeepSeek V4.1 Flash (Max) 的 $0.184——幾乎打平。但這個混合比例是對你如何使用模型的假設,而這個假設承擔了很重的分量。任何有大量提示重複使用的工作負載——冗長的系統提示、檢索前導文字、每一輪都會重新送出累積上下文的代理迴圈——都會把實際混合比例推向快取讀取,而在那裡,快取定價 10 倍的差距就會主導一切。Token 量也會以同樣的方式產生複合影響:Ling-3.1-flash 是個話多的推理模型,在整個索引評估中產生了 2.2 億個輸出 token,而 DeepSeek 是 2.5 億個,且每個評估任務平均約 357 秒,DeepSeek 則為 285 秒。它每個答案思考得更多,耗時也更長。

A two-column generated scoreboard titled 'Ling-3.1-flash vs DeepSeek V4.1 Flash — the scoreboard'. The left column, 'Ling-3.1-flash', reads 'AA Index: 41', 'Cost per task: $0.99', 'Terminal-Bench: 0.333', 'Cache read: $0.06', 'Weights: closed', 'Modality: text'; the right column, 'DeepSeek V4.1 Flash (Max)', reads 'AA Index: 39', 'Cost per task: $0.27', 'Terminal-Bench: 0.268', 'Cache read: $0.006', 'Weights: MIT', 'Modality: text + image'. A footer line reads 'Both columns per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

實作範例:兩者上相同的代理迴圈

以一個工具驅動的代理為例,每項任務執行 1M 輸入 token,其中 90% 由快取提供,並回傳 200,000 輸出 token。在 Ling-3.1-flash 上,依上述數字:900,000 個快取輸入 token 以 $0.06 計,加上 100,000 個全新輸入以 $0.30 計,再加上 200,000 個輸出以 $0.90 計,每項任務約為 $0.26。在 DeepSeek V4.1 Flash (Max) 上,相同的迴圈約為 $0.14——大約是一半。

現在套用 DeepSeek 的排程,因為這正是大多數比較會跳過的部分。DeepSeek 的離峰費率就是上面那個,而離峰涵蓋週末與一天中的大部分時段;但在兩個平日時段,也就是 UTC 01:00–04:00 和 06:00–10:00,輸入與快取定價會加倍。把同一個迴圈移到尖峰時段,DeepSeek 的成本會落在約 $0.28——此時 Ling-3.1-flash 那張較高但固定的價目表,反而是那個小時更便宜的選擇,而 10× 快取折扣已被時鐘抵銷。

整個決策就取決於一組數字。如果你的 agent 流量以快取為主,而且你能安排排程,那麼在指數差距兩點的情況下,DeepSeek V4.1 Flash (Max) 的成本大約是 Ling-3.1-flash 的一半。如果你的流量以快取為主,且落在 DeepSeek 的尖峰時段,這兩個模型的成本大致相同,而 Ling-3.1-flash 在 terminal-agent 那一列略勝一籌,就成了決勝關鍵。

沒有可供比較的軸

這三個面向並不接近,而它們往往是在討論價格之前就決定架構的關鍵因素。

• 權重與授權 — Ling-3.1-flash 尚未發布權重,也沒有授權條款,而 Artificial Analysis 將其歸類為專有。DeepSeek V4.1 Flash (Max) 以 MIT 授權開放權重,可從 Hugging Face 下載,並允許商業使用。其中一個可自行託管、微調及氣隙部署;另一個則不能。

• 模態 — Ling-3.1-flash 是文字進、文字出。DeepSeek V4.1 Flash (Max) 可接受圖片連同文字輸入,並在多模態基準測試中接受評分。假如你的流程中有任何環節會把螢幕截圖、圖表或掃描檔交給模型,那麼這個比較就到此為止。

• 服務供應面 — DeepSeek V4.1 Flash (Max) 可透過 23 家供應商取得,包括 OrcaRouter;Ling-3.1-flash 則透過該供應商自家的 API,以及承載其發行的第三方平台運行。就正式生產路徑而言,供應商數量是一項韌性特質,而非人氣競賽。

還有一個不對稱性並未出現在上述任何清單中:DeepSeek V4.1 Flash (Max) 在單一回應中提供 384,000 個輸出 token。Ant 尚未公布 Ling-3.1-flash 的最大輸出長度,因此目前還無法以它為基準來估算長生成工作負載。沒有公布上限並不等同於上限很小,但它也不是一個你可以據以設計的數字。

同時執行兩者,以及實際上會是什麼樣子

Ling-3.1-flash 今天不在 OrcaRouter 目錄中——向我們公開的模型 API 查詢時,InclusionAI 旗下的這個模型會傳回 not-found,而本文不會假裝並非如此。DeepSeek V4.1 Flash 目前可路由,價格為供應商的定價、零加成,因此供應商調價當天,我們這邊就會同步生效,而且它和目錄其餘模型一樣,透過同一組單一 API 金鑰存取,並在上游供應商之間自動容錯移轉。

這種不對稱有其實際形態。當一個模型是閉源的、定價大約是其前代四倍,而且只能透過單一供應商取得時,要進行比較的明智做法,就是把那個開放、被廣泛服務的模型保留為預設路徑,並把挑戰者當成你可測試的東西,而非你必須投入承諾的對象。DeepSeek V4.1 Flash (Max) 今天就能承擔生產迴圈——開放權重、影像輸入、384K 輸出、98% 快取折扣——而 Ling-3.1-flash 則負責代理專屬工作,讓它的 Terminal-Bench 與 SciCode 優勢真正派上用場。因為兩者都使用 OpenAI 相容的 chat-completions 格式,這種分工是一項路由決策,而不是整合專案:一個端點、一把金鑰,以及一條規則,把各模型可量測上更擅長的任務分派出去。

裁決結果

就現有證據而言,DeepSeek V4.1 Flash(Max)贏得這場對決,而且它勝出的地方大多與兩個 Index 分數無關:MIT 授權的開放權重、圖像輸入、384,000 個輸出 token、98% 的快取折扣,以及 23 家可相互接手故障轉移的供應商。Ling-3.1-flash 的理由較狹窄但真實——它是兩者中較出色的終端與工具代理,也是這對之中唯一尚未公布內含尖峰時段倍數費率表的模型。

有兩件事會改變這項評估。如果 Ant 以寬鬆的授權條款發布權重,開放性差距就會消失,比較也會變成單純的能力與成本討論。而如果 Ant 所提供的長上下文視窗,在兩個模型都宣稱的 100 萬個 token 上獲得驗證,上下文對等性的說法就不再只是說法。在那之前,誠實的總結是:一個模型可以在代理式基準測試的某一列勝出,卻仍輸掉整體評估——而這些模型之間的兩點指數差距,大約值每項任務成本的 3.6 倍,這是一種只有特定工作負載才該做的取捨。

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, in English, captured 2026-10-07. The page header reads 'DeepSeek V4.1 Flash', 'ctx 1M tokens', 'Max output 384K', inputs 'text + image' and output 'text', with vision, tools, JSON and reasoning capability icons and a release date of 2026-09-10. Four stat tiles read $0.15, $0.60, 1.81 s and 6.04 s. The description states the model 'accepts text and image input, carries a context window of 1,048,576 tokens, and can generate up to 384,000 tokens in a single response. OrcaRouter bills it at $0.15 per 1M input tokens and $0.60 per 1M output tokens.' A code sample shows base_url https://api.orcarouter.ai/v1 with model 'deepseek/deepseek-v4.1-flash'.Screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash (Max), in English, captured 2026-10-07, marked 'Open weights model' and 'Released September 2026'. It shows an Intelligence Index of 39, 227 output tokens per second, $0.27 cost per Intelligence Index task, 250M output tokens generated across the index, input $0.30 with a 98% cache discount and output $1.20 per 1M tokens, a 1M context window, text and image input, 552B total parameters, 16B active parameters, and a licence of MIT with weights on Hugging Face.