一張英雄標題卡,用於比較「Ling-3.0-flash-VL 對比 Ling 3.0 Flash」,副標題為「一顆 124B 大腦,如今長了眼睛」。主標題上方有兩個扁平線條圖示——左側是文字文件,右側是眼睛疊在相框上——副標題下方則有兩個以細分隔線隔開的標籤:「相同的混合線性 MoE 主幹」與「其中一款新增原生影像與影片輸入」。沒有出現任何圖表或價格。OrcaRouter 標誌合成於右下角。
Guides & Insights

Ling-3.0-flash-VL 對比 Ling 3.0 Flash:一個 124B 大腦,如今有了眼睛

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Ling-3.0-flash-VL 和 Ling 3.0 Flash 並非競爭對手,將這兩者視為一場模型對決會導向錯誤結論。Ling-3.0-flash-VL 是螞蟻集團 inclusionAI 實驗室本週發布的視覺語言檢查點(checkpoint)——權重自 2026 年 9 月 4 日起以 MIT 授權放上 Hugging Face——它直接建基於 Ling 3.0 Flash,也就是該實驗室自 7 月底以來支撐其快速服務層級的 124B 參數開放權重文字模型。兩者共享相同的混合線性 MoE 設計、相同的稀疏啟動經濟性、相同的 256K 上下文服務配置,以及相同的 MIT 授權。VL 檢查點所新增的,正是文字模型從未具備的一項能力:原生影像與影片輸入,透過 ViT 編碼器、兩層 MLP 投影器與 VideoRoPE 時間編碼實現。因此,比較最終歸結為一個實際問題——如果你的工作負載從來不需要看圖片,那麼這個「有眼睛」的模型是否值得你轉換過去?

這個問題之所以值得提出,是因為 inclusionAI 並未將 Ling-3.0-flash-VL 定位為一條獨立的產品線。其模型卡片稱其為「我們下一代的原生多模態模型」,建構於 Ling-3.0-flash 之上,繼承了該模型的語言、推理與長上下文能力,並以視覺能力加以延伸,使其參與理解、推理、行動與驗證的完整循環——而非作為附加式輸入的視覺。對於一個先前旗艦版本明確僅支援文字的模型家族而言,這是一個實質性的轉變,而它也會改變以文本和工具為主的團隊應標準化於哪個檢查點。

兩個檢查點,一個骨幹

Ling 3.0 Flash,本次比較中的對手,是兩者中較成熟的。它於2026年7月下旬發布,並於8月7日在MIT許可證下開源,是一個混合線性專家混合模型,總參數124B,每個token約活躍5.1B——35個KDA層和7個Gated MLA層以5:1的比例堆疊,512個路由專家中有8個被啟動,原生上下文256K,服務於262,144個token。它僅支援文字,具備工具呼叫支援,透過聊天模板預設啟用思考,並且在其規模下成本異常低。它也是這對中文件記載較完整的一方:Artificial Analysis將其列在即時排行榜上,在該類別的63個模型中排名第一,並量測到廠商API的輸出約為每秒313個token。

Ling-3.0-flash-VL 保留了該架構,並在其上加入視覺堆疊。模型卡描述了一個 ViT 視覺編碼器,其特徵透過兩層 MLP 投影器對齊至文字空間,並由 VideoRoPE 同時編碼空間位置與時間順序,使模型能夠進行事件定位與長影片推理。主幹同樣是 5:1 的 KDA 轉 MLA 混合架構,這次總參數為 124B,每個 token 啟動 5.5B,共有 42 層主體。輸入支援文字、圖片與影片,輸出為文字。官方宣稱上下文長度最高可達 1M tokens,建議的 SGLang 配置可透過 YaRN 縮放提供 256K 的服務長度。與其文字版兄弟模型相同,它預設開啟思考模式(可在個別請求中透過 chat_template_kwargs 停用),並可於 SGLang 或 inclusionAI 自訂的 vLLM 分支下執行。BF16 版本在磁碟上約佔 250 GB,分佈於 64 個 safetensor 分片中——與文字模型權重同屬四分之一 TB 等級。

這資訊有多新?在撰寫本文時,VL 儲存庫的下載次數僅有數十次,其模型卡仍在更新中,Artificial Analysis 也尚未將其列入。以下內容中,凡是未明確標明出自 Artificial Analysis 的,皆為 inclusionAI 自身的報告。

A screenshot of the Hugging Face model card for inclusionAI/Ling-3.0-flash-VL, showing the header '@inclusionAI Ling-3.0-flash-VL', the 'Model card' and 'Files and versions' tabs, the introduction text 'We are introducing Ling-3.0-flash-VL, our next-generation native multimodal model' together with the 124B total / 5.5B activated / up to 1M context summary, and the right-hand sidebar noting License: mit, 42 downloads last month, Safetensors ~125B params, and 'This model isn't deployed — ask for provider support'.

計分板

這裡的不對稱並非品質——而是模態。六個維度足以捕捉此決定:

智能(供應商卡片,AA Index v4.1.1)Ling-3.0-flash-VL:42,為供應商回報的數值。Ling 3.0 Flash:38,為卡片所引用的較早指數數值。

AA 今日實時排行榜(v4.3) — Ling-3.0-flash-VL:尚未上榜。Ling 3.0 Flash:估計為 25,在 63 款同類模型中排名第 1。

輸入 — Ling-3.0-flash-VL:文字、圖片和影片。Ling 3.0 Flash:僅限文字。

上下文——兩者皆宣稱支援高達 1M tokens;目前實際上皆以 256K (262,144) 提供服務。

價格 — Ling-3.0-flash-VL:目前尚無牌價;僅提供 MIT 開放權重。Ling 3.0 Flash:供應商第一方 API 上約為每 1M 輸入 $0.07、每 1M 輸出 $0.22。

適合 — Ling-3.0-flash-VL:文件、螢幕截圖、圖表、影片及 GUI 操作代理。Ling 3.0 Flash:文字密集型工具呼叫與長程代理流程。

A two-column scoreboard titled 'Ling-3.0-flash-VL vs Ling 3.0 Flash — the scoreboard'. Left column 'Ling-3.0-flash-VL': 'Intelligence (vendor card, AA Index v4.1.1): 42 — vendor-reported', 'AA live board today (v4.3): not listed yet', 'Inputs: text, image, video', 'Context: up to 1M; 256K recipe', 'Price: no list price — MIT open weights', 'Pick it for: documents, video, GUI agents'. Right column 'Ling 3.0 Flash': 'Intelligence (vendor card, AA Index v4.1.1): 38 — earlier AA figure', 'AA live board today (v4.3): 25 estimated, #1 of 63 in class', 'Inputs: text only', 'Context: 256K native; 1M claimed', 'Price: $0.07 / $0.22 per 1M (vendor API)', 'Pick it for: text-heavy agentic pipelines'. Footer reads 'VL figures vendor-reported; Flash figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

文本模型無法進入的記分板

這兩者真正的分歧在此,且這是結構性的分歧,而非競爭性的:在圖像與影片基準測試上,純文字的 Ling 3.0 Flash 完全沒有上榜,因為它無法接收這類輸入。Ling-3.0-flash-VL 自己的圖表——inclusionAI 的評估、未經複現、部分在內部運行、部分在官方測試設定下針對競爭對手 API 運行——在該模型卡強調的三個類別中列出了數據。在複雜圖像理解方面,它顯示 MMMU-Pro 為 79.0、MathVision 為 84.87,而在 Humanity's Last Exam-Multimodal 上則低得多,僅 19.88,反映出該測驗對所有人來說都極具難度。在文件與圖表工作上它表現強勁:OmniDocBench1.5 為 91.35、CharXiv_RQ 為 81.30。而在讓這次發布顯得有趣的代理式多模態測試套件上——ClawEval-MM 為 59.9、WebVoyager 為 90.83、Vision2Web 為 57.69——它被要求讀取介面並採取行動,這正是純文字模型無法承擔的 GUI 代理任務。

把這些放到脈絡中一起解讀,一幅連貫的圖像便會浮現:這不是一個為了贏得圖像知識問答而調校的模型,而是一個為了把像素化為行動而調校的模型——讀懂版面、跟上圖表、操作頁面。在供應商自家的圖表上,它在 OmniDocBench、WebVoyager 與 ClawEval-MM 這三項評測中,於這組三方比較(高推理強度的 Qwen3.8-27BGemini 3.5 Flash-LiteKimi-K2.6)裡居於領先;但在 MathVision 與 HLE-MM 這類高難度的知識與推理評測集上則落後。在公正的第三方實驗室證實之前,這些數字每一項都只能視為 inclusionAI 的宣稱——但調校的方向明確且一致。

唯一值得爭論的數字:42 對 38

最可能促使純文字團隊轉換的宣稱,是標題那一項:inclusionAI 報告 Ling-3.0-flash-VL 在 Artificial Analysis Intelligence Index(v4.1.1)上取得 42 分,比它對同一指數版本所歸給 Ling 3.0 Flash 的 38 分高出 4 分。請注意該指數衡量的是什麼:其 v4.1.1 綜合分數取材自文字與 agentic 套件——GDPval、Terminal-Bench、SciCode、GPQA Diamond、Humanity's Last Exam 及類似項目,其中沒有一項是影像任務。因此,該廠商聲稱的是:在共享骨幹上加入視覺訓練,使模型在文字側的智慧表現提升了 4 分,而不只是它現在能描述圖片。這是一個驚人但完全合理的宣稱——多模態指令微調通常會提升文字能力。

兩個資料來源的注意事項能讓這個數字不至於被過度解讀。首先,38是較舊一代指數的數字:Artificial Analysis其後已將即時排行榜改為較新的指數版本(v4.3),目前在該版本中將Ling 3.0 Flash列為估計25分,但仍將它排在該類別63個模型中的第一位。廠商公布的42對38這組數字是基於舊版量表,因此不應解讀成「比AA目前對該文字模型的分數高出4分」。其次,42是inclusionAI自家的數字,針對的是一個Artificial Analysis尚未列入的模型;而且inclusionAI並未公布該VL檢查點在個別文字測試集(SWE-Bench、Terminal-Bench)上的結果,而這些測試集正是其自家文字模型圖表所列出的細項。四分正是你在僅憑這點差異就把純文字流程遷移過去之前,會想先重現出來的增益幅度。

A screenshot of the Artificial Analysis model page for Ling 3.0 Flash, showing the heading 'Ling 3.0 Flash — Intelligence, Performance & Price Analysis', 'Released August 2026', an estimated 25 on the Artificial Analysis Intelligence Index with a #1-of-63 rank in its class, pricing near $0.07 per 1M input and $0.22 per 1M output tokens, roughly 313 output tokens per second, and technical specs listing text-only input, a 262k context window, and 124B total / 5.1B active parameters.

價格:一個有定價,另一個沒有

成本比較目前只是與單一價格進行的比較。Ling 3.0 Flash 現已可在供應商的第一方 API 上呼叫,大約每 100 萬輸入 token 為 $0.07、每 100 萬輸出 token 為 $0.22——這是供應商設定的價格,並已在 Artificial Analysis 的列表上確認——快取輸入更便宜,而其上市期間的折扣已結束。Ling-3.0-flash-VL 目前沒有任何已公開的 API 價格;尚無法按 token 付費使用。若你想在本週使用它,就必須自行託管:以 BF16 格式約 250 GB 的 MIT 權重,並使用與文字模型所需的相同硬體等級——4× 141GB GPU(H20-3e 或 H200),或具備 tensor-parallel 4 的 4-GPU Blackwell 節點,或採用 TP8 的 8× 80GB H100/H800。

這重新定義了純文字團隊的經濟效益。如果你是按量購買 token,價格 $0.07/$0.22 的文字模型便宜且經過實證考驗。如果你已經自行託管 124B 文字模型,VL 檢查點並非第二筆基礎設施投資——它只是同一等級機器上額外多出的約 250 GB 權重,唯有真正消耗像素的工作負載才能合理化這筆支出。有眼睛的模型,唯有當眼睛真正進入流程時,才有其價值。

該由誰來選擇哪一個

純文字、高流量——請繼續使用 Ling 3.0 Flash。你能享有經過驗證、列入 AA 清單的模型、真正按 token 計價的費用,以及成熟的工具呼叫。VL 模型那四點的指數增益無法重現,其文字側的吞吐量也未經測量;目前尚無證據顯示它是較佳的文字模型,那只是宣稱而已。

視覺進入迴圈 — 文件、螢幕截圖、圖表、照片、影片畫面,或你的代理程式需要閱讀和點擊的 UI — Ling-3.0-flash-VL 是明顯的選擇,因為它正是你已理解的推理骨幹,只是加上了視覺堆疊,而不是你必須從頭重新評估的獨立多模態模型。

混合流量,尚未定案——低風險的做法是讓兩者都維持可達,並按請求路由,而非為了單一選項重新架構。這正是模型閘道器存在的價值:單一 API 涵蓋 200+ 模型、以 0% 加成轉傳供應商牌價、供應商效能衰退時自動容錯移轉。目前 Ling 的兩個檢查點都尚未掛在 OrcaRouter 端點之後——文字模型的價格是供應商自己的定價,而 VL 模型根本沒有託管價格——但一旦 VL 有了託管價格,將一部分流量移轉過去並進行量測,只是組態變更,而非整合專案。

還缺少什麼

• 在目前的 Artificial Analysis Intelligence Index 上獨立運行 Ling-3.0-flash-VL——42 是 inclusionAI 針對較早版本指數的說法。

• 任何 VL 模型的託管 API 價格,這是休閒採用上最大的單一障礙。

• 為 VL 檢查點發布了僅文字的分割(SWE-Bench Pro、Terminal-Bench 2.1),以便以文字為主的團隊可以驗證視覺堆疊並未使其付出任何代價。

• 針對 VL 在影像負載下的端對端延遲或吞吐量數據——文字模型的速度有被測量;視覺模型的速度則沒有。

• 對視覺基準測試圖表的客觀確認,其中部分是在 inclusionAI 自家的測試框架上運行,且至少有一項內部基準測試預計於稍後發布。

裁決

這不是一場模型品質競賽,而是附帶四點主張的模態決策。如果輸入是文字,請沿用 Ling 3.0 Flash——它更便宜、已列入 AA 名單、且經實測;而 VL 模型對它的優勢,目前只是廠商在較舊指標量表上給出的數字。如果工作負載以螢幕畫面為起點——文件頁、截圖、圖表、影片影格,或你的代理程式必須操作的 GUI——Ling-3.0-flash-VL 正是你已熟悉的那個 124B 大腦,如今多了視覺;這是貨真價實的新選項,一週前 Ling 快速層級還不存在。在視覺需求真實存在之處採用它;在單憑 42 這個數據遷移任何項目之前,先加以驗證;並讓選擇在路由層維持可逆,直到獨立評分與正式定價出爐。