一張標題卡,對比 Ling-3.0-flash-VL 與 DeepSeek V4 Flash Vision Exp,顯示 Ling 的總參數為 124B、活躍參數為 5.5B,並具備 262K 上下文視窗;相比之下,DeepSeek V4 Flash Vision Exp 約有 305B 參數、1M token 上下文視窗與 384K 最大輸出,頁尾註明 Ling 的指數依據 Artificial Analysis,DeepSeek 的數據則為廠商自行回報。
Guides & Insights

Ling-3.0-flash-VL vs DeepSeek V4 Flash Vision Exp:開放視覺的兩大押注

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Ling-3.0-flash-VLDeepSeek V4 Flash Vision Exp是這個權重級別中,團隊如今真能實際下載並提供服務的兩個開放權重視覺模型,而打造它們的人對於視覺究竟是為了什麼,看法並不一致。來自螞蟻集團 inclusionAI 實驗室的 Ling-3.0-flash-VL,每個 token 只啟動其 124B 參數中約 5.5B,並把視覺視為要在回饋迴路中運用的東西——生成、渲染、觀看、修正——且以盡可能最低的推論成本來做。DeepSeek V4 Flash Vision Exp 是 DeepSeek 首個多模態作品,將 1M token 的上下文視窗與 384K token 的最大輸出配對,並把視覺當成代理在完成漫長工作的途中所讀取的另一項輸入。一個是為了把思考的成本壓到多低而最佳化。另一個則是為了在執行時能容納多少而最佳化。

真正該左右選擇的,是那個差異,而不是基準測試分數的落差。這兩個模型沒有共用的評估協定可供比較,而且只有其中一個有獨立評分。接下來是這場對決的真實面貌:架構上的押注、真正出現分歧的規格、基準測試的狀況(包括為何資料如此單薄)、各自的成本,以及哪一個在什麼任務上勝出——還有我們直接說明這兩款中哪一款在我們型錄上的部分。

兩個賭注,精確陳述

Ling 這一邊,押注的是把激活稀疏性當作主要的成本槓桿。Ling-3.0-flash-VL 是一個總參數量 124B 的稀疏專家混合模型——模型卡顯示約 124.8B,而 SGLang cookbook 描述為 5.1B 激活參數,模型卡則說大約 5.5B——運行一個 42 層的混合主幹,以 5:1 的比例交替使用 Kimi Delta Attention 與閘控 MLA 區塊。一個任意解析度的視覺編碼器與兩層 MLP 投影器饋入該主幹,並由 VideoRoPE 處理空間與時間位置,讓視訊幀落在連貫的順序中。其架構上的結果是,這個模型每 token 的運行成本僅為稠密 124B 模型的一小部分,而這正是它出現在智能與激活參數前沿上的全部原因。

The Deep​Seek side is a bet on context and agentic endurance. DeepSeek V4 Flash Vision Exp takes the DeepSeek-V4-Flash text architecture and adds a vision encoder and an aligner, then continues training — one source puts the result around 305B parameters, which Deep​Seek has not confirmed in detail. It carries a 1,048,576-token context window and 384,000 tokens of maximum output, supports JSON output, tool calls, the Responses API, the Anth​ropic API and conversation-prefix continuation, and Deep​Seek has been explicit that this is not a visual question-answering model. It is perception for agents: reading web screenshots, software interfaces and charts, then continuing into tool calls. Images are converted to tokens and billed as such, capped at 384 tokens per image.

把這兩段放在一起讀,決策的輪廓就會浮現。如果你的工作負載是「看一下這個、做出某個決定、採取行動、再看一次」,Ling 的活躍參數量正是讓這個迴圈變得可負擔的關鍵,而它的視覺回饋設計正是針對這一點。如果你的工作負載是「讀完這份夾帶圖表的 400 頁文件並持續下去」,DeepSeek 的上下文視窗就是重點功能,而 Ling 這邊沒有任何東西能與之匹敵。

為什麼基準比較比看起來更單薄

這是最多比較文章略過的部分,而略過它,只會得出一張毫無意義的數字表格。以下是證據的實際狀況。

Ling-3.0-flash-VL 有一項獨立測量結果:在 Artificial Analysis Intelligence Index v4.3 上為 25,在其尺寸級別中於 64 個裡排名第 2,而該級別的中位數為 8。廠商說明卡另外宣稱在 Intelligence Index protocol v4.1.1 上達到 42,但那是已淘汰的量表,無法互相比較——請將 42 視為未經重現的結果。

DeepSeek V4 Flash Vision Exp 的Artificial Analysis 頁面完全不存在。針對它公布的每一個數字都是 DeepSeek 自家的,出自發布公告,而且其中有幾個是明確相對於 Opus-4.8,而不是相對於固定協定。那不是對這些數字的批評;而是在陳述你能用它們做什麼。你不能把一個由獨立評分的模型和一個僅由廠商評分的模型放在同一欄,然後宣告勝出者,而任何這樣做的頁面都是在捏造結果。

正當的做法,是將每個模型與其自身所報告的紀錄相比較,並附上來源出處:

• Ling-3.0-flash-VL,獨立評測 — 在 v4.3 上智力指數為 25,同級 64 個模型中排名第 2,同級中位數為 8,資料來源為 Artificial Analysisbr /> • Ling-3.0-flash-VL,廠商提供 — 在已退役的 v4.1.1 協定上為 42,並以「linthium」之名在 Image-to-WebDev Arena 中取得 1,441,對比 GPT-5.4 的 1,440;兩者皆為廠商自報數據,且競技場的差距落在 Elo 雜訊範圍內br /> • DeepSeek V4 Flash Vision Exp,廠商提供 — Terminal Bench 2.1 為 83.9;DeepSWE 59.3,對比 Opus-4.8 的 58.0;Agents' Last Exam 27.3,對比 Opus-4.8 的 25.7;Toolathlon-Verified 75.9;Cybergym 75.3;Chartography 64.3;NL2Repo 57.7;DSBench-Hard 63.6;ZeroBench Pass@5 35.0;ApexBench Pass@1 36.5;AutomationBench 25.7br /> • DeepSeek V4 Flash Vision Exp,獨立評測 — 未有任何公開數據

注意 DeepSeek 清單主要由什麼組成:代理式與軟體工程評估,而非視覺評估。DeepSeek 自己的定調是,在純文字任務上,這個視覺模型與官方 DeepSeek-V4-Flash 表現相當、沒有退步,而增益在於多模態代理基準——DeepSeek 將該結果描述為接近 Opus-4.8,而非超越它,並承認在結構化資料科學與程式碼任務 NL2Repo 和 DSBench-Hard 上大約有十分的差距。這是一組異常謹慎的主張,而它告訴你,這款模型被推銷為既有代理堆疊的感知升級,而不是新的天花板。

A two-column comparison scoreboard for Ling-3.0-flash-VL and DeepSeek V4 Flash Vision Exp across six shared dimensions: Intelligence Index 25 on v4.3 versus none published, active parameters 5.5B versus undisclosed, context window 262K versus 1M tokens, max output tens of thousands versus 384K, license MIT versus MIT, and independent score yes versus none, with a footer noting the Ling figure is per Artificial Analysis and all DeepSeek figures are vendor-reported.

真正有分歧的規格

兩份規格表大部分內容一致:兩者都是以 MIT 授權的開放權重,兩者都接受文字與圖像輸入並回傳文字,兩者都提供 BF16 權重與量化版本,兩者都已發布服務部署配方,且兩者都以某種形式處理影片。分歧集中在四個地方。

• 參數 — Ling-3.0-flash-VL 總參數量為 124B,每個 token 約啟用 5.5B;DeepSeek V4 Flash Vision Exp 據報導約為 305B,但未公布啟用參數數據br /> • 上下文視窗 — 根據 Artificial Analysis,Ling-3.0-flash-VL 測得 262K tokens,而其自家模型卡標示為 256K;DeepSeek V4 Flash Vision Exp 原生支援 1,048,576 tokensbr /> • 最大輸出 — Ling-3.0-flash-VL 短得多,只有數萬個 token;DeepSeek V4 Flash Vision Exp 可達 384,000br /> • 圖片處理 — Ling-3.0-flash-VL 每次請求最多接受 40 張圖片,每張最高 16,384 × 784 像素,且僅支援 base64;DeepSeek V4 Flash Vision Exp 接受 base64、外部 URL 或 Files API 參照,並將每張圖片的成本上限設為 384 個 tokenbr /> • 啟用參數 — Ling-3.0-flash-VL 每個 token 約啟用 5.5B;DeepSeek V4 Flash Vision Exp 未公布啟用參數數據

圖片處理這一列最容易被低估。每張圖片硬性上限 384 個 token,意味著一張密集的圖表或整頁截圖會被壓縮到與縮圖差不多的預算——成本低廉,但那種失真對需要細緻判讀的任務而言是有影響的。Ling 的做法則相反:每張圖片有非常大的像素預算,只以 base64 傳輸,因此請求負載重得多。哪一種更好,完全取決於你的圖片是需要精確判讀的文件照片,還是只需大致理解的 UI 截圖。

第二個被低估的列是最大輸出量。Ling-3.0-flash-VL 數萬個 token 的上限,對於「先描述、再修正」的迴圈來說沒問題,但對任何想要產出大型成品的用途則構成限制——一份冗長的生成檔案、一次完整的文件改寫、一份數千行的 diff。Deep​Seek 的 384K 輸出之所以存在,正是因為其預期的工作負載最終會產生大型的工具呼叫結果或生成的成品。如果你的管線預期模型要交回冗長的內容,那麼在任何基準測試決定勝負之前,光是這一列就已決定了這場對決。

價格,以及免費與未定價之間的差異

DeepSeek V4 Flash Vision Exp 在我們的產品目錄上有一個實實在在的數字:每 100 萬個輸入 token 為 $0.24,每 100 萬個輸出 token 為 $0.73,具備 1,048,576 個 token 的上下文視窗,以及 384,000 個 token 的最大輸出,可透過 deepseek/deepseek-v4-flash-vision-exp 使用。這是公開的費率,計費方式與文字版 V4-Flash 相同,圖片會轉換為 token,每張圖片最多 384 個。這是你可以放進試算表的費率。

Ling-3.0-flash-VL 並沒有這項資訊。Artificial Analysis 頁面將其列為 每 100 萬輸入 token $0.00、每 100 萬輸出 token $0.00,對照同業中位數 $0.14 與 $0.40——但這反映的是在 Ant 的 Ling Studio 上運行的免費試用,並非正式收費標準。Ant 的多模態文件並未公布這款視覺模型每 token 的價格,因此沒有可供核對這個零的依據。純文字的兄弟型號 Ling-3.0-flash 標價約為每 100 萬輸入 token $0.075、每 100 萬輸出 token $0.22,而 Ant 針對特定領域推出的 Ling 版本以免費 API 形式發布,這暗示最終可能呈現類似樣貌——但暗示並非價格。

將兩者誠實地並列比較,成本對比是:一個模型有明確費率,另一個則只有促銷期與合理推測。任何人宣稱 Ling-3.0-flash-VL 比 DeepSeek V4 Flash Vision Exp 便宜,都是在把免費試用期拿來跟定價比。站得住腳的說法是:一旦正式定價,Ling-3.0-flash-VL 每 token 極可能更便宜,因為 5.5B 活躍參數是結構性優勢,任何費率變動都抹不掉——但附帶條件是 Ling-3.0-flash-VL 的冗長程度會侵蝕這個優勢。Artificial Analysis 記錄它在 Intelligence Index 上燒掉 160M 輸出 token,在 64 個模型中排名第 8,中位數為 84M,並標註為「非常冗長」。你是按輸出的 token 付費,所以一個模型為了得出相同答案而多說將近一倍的話,就會回吐部分稀疏活化所贏得的優勢。

哪一個,做什麼用的?

誠實的決策樹會先依上下文與輸出長度來分流,之後才依其他任何條件分流,因為這些正是兩個模型無法彼此替代的維度。

選擇 DeepSeek V4 Flash Vision Exp的時機,是當你的工作冗長且最終會產出成品時:包含圖表、數百頁的文件,從頭到尾完整閱讀的程式碼庫,需要輸出大量結果的代理迴圈,你想以 URL 或 Files API 參照而非 base64 交付圖片的工作負載,以及你需要 Responses API、前綴續接,或可據以編列預算的已公布每詞元費率的管線。它也是兩者之中唯一有供應商宣稱其在文字任務上能與自家文字模型匹敵的模型;如果你的技術堆疊中一個模型要取代兩個,這點就很重要。

選擇 Ling-3.0-flash-VL,當你的硬性限制是每次呼叫成本,且你的迴圈很短時:GUI 自動化、重複的螢幕截圖檢查、帶有渲染與修正循環的前端生成、需要高每張影像解析度且能接受小量輸出的醫療或財務文件抽查。5.5B 活躍參數量是選擇它的原因,MIT 授權是它可安全自行託管的原因,而視覺回饋迴圈設計正是針對觀察—行動—驗證—修正模式。請注意,你選擇的是一個未定價的模型,有免費的入門途徑,且對後續發展沒有任何承諾。

而如果你真正需要的,是一個能稱職讀取影像、又不走任何極端的模型——既沒有 5.5B 稀疏化技巧,也沒有百萬 token 的視窗——那麼這兩個都不是有意思的答案,而普通的中階視覺模型會比這兩個專門模型更好、更便宜地滿足你的需求。

執行它們,以及我們誠實地合適的位置

DeepSeek V4 Flash Vision Exp 已上架我們的目錄你可以透過 OrcaRouter 的 OpenAI 相容端點呼叫它,模型字串為 deepseek/deepseek-v4-flash-vision-exp,使用的就是你其他所有服務共用的同一把金鑰,費率是公告的 $0.24/$0.73,完全不加價——供應商的定價直接原樣傳遞,所以如果 DeepSeek 調降費率,你當天就能享受到,不必等到下一次合約續約。如果你是第一次把視覺模型導入正式環境的流程,在路由層上,這是兩者之中比較安全的起步選擇,因為你可以設定備援鏈,讓供應商發生錯誤時先重試另一條路由,之後才開始產生回應。沒有人希望自己第一次在正式環境呼叫視覺模型,就成為學到單一供應商故障教訓的那一次。

The OrcaRouter model page for DeepSeek V4 Flash Vision (Exp) showing a $0.24 per 1M input and $0.73 per 1M output token price, a 1,048,576-token context window, a 384,000-token maximum output, p50 time to first token of 1.31 seconds, the deepseek/deepseek-v4-flash-vision-exp model identifier, and Python and cURL code samples against https://api.orcarouter.ai/v1.

Ling-3.0-flash-VL is not on our catalogue, and we are not going to imply otherwise. It is reachable through Ant's own platform, which publishes an OpenAI-compatible endpoint and an Anth​ropic-compatible one, through free trial access on Ling Studio, and through the open weights on Hugging Face, which you can serve yourself with the published SGLang recipe or Ant's own vLLM fork. One thing to verify before you invest in that path: Ant's API examples use the identifier Ling-3.0-flash-VL-rc1, a release-candidate marker, and whether the served checkpoint matches the open weights has not been settled publicly. If you benchmark against the hosted API expecting the numbers to transfer to a self-hosted BF16 deployment, test that assumption first.

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3, a class rank of #2 of 64, 124B total and 5.5B active parameters, 142.9 output tokens per second, and a listed price of $0.00 per 1M tokens in and out reflecting free trial access.

經得起檢視的總結:這些並非針對同一個問題的相互競爭答案。DeepSeek V4 Flash Vision Exp 是為代理打造的長上下文感知層,具有公開定價,以及一份偏重代理式評估、由廠商自行報告的基準測試表。Ling-3.0-flash-VL 是一款服務成本低廉的視覺模型,具有一項真正的獨立評分、一個未定價的免費方案,以及針對短修正迴圈設計的架構。將你的工作負載形態與模型的形態相匹配,而兩者之中只有一個在榜上有獨立評分,這件事應該會影響你對另一個的行銷宣傳賦予多少权重。

同一把金鑰即可觸及目錄中其餘內容,而你可以瀏覽完整的模型目錄,看看單一 OpenAI 相容端點背後還有些什麼。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新