
Ling-3.0-flash-VL 對比 Ling 3.0 Flash:一個 124B 大腦,如今有了眼睛
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
Ling-3.0-flash-VL 和 Ling 3.0 Flash 並非競爭對手,將這兩者視為一場模型對決會導向錯誤結論。Ling-3.0-flash-VL 是螞蟻集團 inclusionAI 實驗室本週發布的視覺語言檢查點(checkpoint)——權重自 2026 年 9 月 4 日起以 MIT 授權放上 Hugging Face——它直接建基於 Ling 3.0 Flash,也就是該實驗室自 7 月底以來支撐其快速服務層級的 124B 參數開放權重文字模型。兩者共享相同的混合線性 MoE 設計、相同的稀疏啟動經濟性、相同的 256K 上下文服務配置,以及相同的 MIT 授權。VL 檢查點所新增的,正是文字模型從未具備的一項能力:原生影像與影片輸入,透過 ViT 編碼器、兩層 MLP 投影器與 VideoRoPE 時間編碼實現。因此,比較最終歸結為一個實際問題——如果你的工作負載從來不需要看圖片,那麼這個「有眼睛」的模型是否值得你轉換過去?
這個問題之所以值得提出,是因為 inclusionAI 並未將 Ling-3.0-flash-VL 定位為一條獨立的產品線。其模型卡片稱其為「我們下一代的原生多模態模型」,建構於 Ling-3.0-flash 之上,繼承了該模型的語言、推理與長上下文能力,並以視覺能力加以延伸,使其參與理解、推理、行動與驗證的完整循環——而非作為附加式輸入的視覺。對於一個先前旗艦版本明確僅支援文字的模型家族而言,這是一個實質性的轉變,而它也會改變以文本和工具為主的團隊應標準化於哪個檢查點。
兩個檢查點,一個骨幹
Ling 3.0 Flash,本次比較中的對手,是兩者中較成熟的。它於2026年7月下旬發布,並於8月7日在MIT許可證下開源,是一個混合線性專家混合模型,總參數124B,每個token約活躍5.1B——35個KDA層和7個Gated MLA層以5:1的比例堆疊,512個路由專家中有8個被啟動,原生上下文256K,服務於262,144個token。它僅支援文字,具備工具呼叫支援,透過聊天模板預設啟用思考,並且在其規模下成本異常低。它也是這對中文件記載較完整的一方:Artificial Analysis將其列在即時排行榜上,在該類別的63個模型中排名第一,並量測到廠商API的輸出約為每秒313個token。
Ling-3.0-flash-VL 保留了該架構,並在其上加入視覺堆疊。模型卡描述了一個 ViT 視覺編碼器,其特徵透過兩層 MLP 投影器對齊至文字空間,並由 VideoRoPE 同時編碼空間位置與時間順序,使模型能夠進行事件定位與長影片推理。主幹同樣是 5:1 的 KDA 轉 MLA 混合架構,這次總參數為 124B,每個 token 啟動 5.5B,共有 42 層主體。輸入支援文字、圖片與影片,輸出為文字。官方宣稱上下文長度最高可達 1M tokens,建議的 SGLang 配置可透過 YaRN 縮放提供 256K 的服務長度。與其文字版兄弟模型相同,它預設開啟思考模式(可在個別請求中透過 chat_template_kwargs 停用),並可於 SGLang 或 inclusionAI 自訂的 vLLM 分支下執行。BF16 版本在磁碟上約佔 250 GB,分佈於 64 個 safetensor 分片中——與文字模型權重同屬四分之一 TB 等級。
這資訊有多新?在撰寫本文時,VL 儲存庫的下載次數僅有數十次,其模型卡仍在更新中,Artificial Analysis 也尚未將其列入。以下內容中,凡是未明確標明出自 Artificial Analysis 的,皆為 inclusionAI 自身的報告。

計分板
這裡的不對稱並非品質——而是模態。六個維度足以捕捉此決定:
• 智能(供應商卡片,AA Index v4.1.1)Ling-3.0-flash-VL:42,為供應商回報的數值。Ling 3.0 Flash:38,為卡片所引用的較早指數數值。
• AA 今日實時排行榜(v4.3) — Ling-3.0-flash-VL:尚未上榜。Ling 3.0 Flash:估計為 25,在 63 款同類模型中排名第 1。
• 輸入 — Ling-3.0-flash-VL:文字、圖片和影片。Ling 3.0 Flash:僅限文字。
• 上下文——兩者皆宣稱支援高達 1M tokens;目前實際上皆以 256K (262,144) 提供服務。
• 價格 — Ling-3.0-flash-VL:目前尚無牌價;僅提供 MIT 開放權重。Ling 3.0 Flash:供應商第一方 API 上約為每 1M 輸入 $0.07、每 1M 輸出 $0.22。
• 適合 — Ling-3.0-flash-VL:文件、螢幕截圖、圖表、影片及 GUI 操作代理。Ling 3.0 Flash:文字密集型工具呼叫與長程代理流程。

文本模型無法進入的記分板
這兩者真正的分歧在此,且這是結構性的分歧,而非競爭性的:在圖像與影片基準測試上,純文字的 Ling 3.0 Flash 完全沒有上榜,因為它無法接收這類輸入。Ling-3.0-flash-VL 自己的圖表——inclusionAI 的評估、未經複現、部分在內部運行、部分在官方測試設定下針對競爭對手 API 運行——在該模型卡強調的三個類別中列出了數據。在複雜圖像理解方面,它顯示 MMMU-Pro 為 79.0、MathVision 為 84.87,而在 Humanity's Last Exam-Multimodal 上則低得多,僅 19.88,反映出該測驗對所有人來說都極具難度。在文件與圖表工作上它表現強勁:OmniDocBench1.5 為 91.35、CharXiv_RQ 為 81.30。而在讓這次發布顯得有趣的代理式多模態測試套件上——ClawEval-MM 為 59.9、WebVoyager 為 90.83、Vision2Web 為 57.69——它被要求讀取介面並採取行動,這正是純文字模型無法承擔的 GUI 代理任務。
把這些放到脈絡中一起解讀,一幅連貫的圖像便會浮現:這不是一個為了贏得圖像知識問答而調校的模型,而是一個為了把像素化為行動而調校的模型——讀懂版面、跟上圖表、操作頁面。在供應商自家的圖表上,它在 OmniDocBench、WebVoyager 與 ClawEval-MM 這三項評測中,於這組三方比較(高推理強度的 Qwen3.8-27B、Gemini 3.5 Flash-Lite 與 Kimi-K2.6)裡居於領先;但在 MathVision 與 HLE-MM 這類高難度的知識與推理評測集上則落後。在公正的第三方實驗室證實之前,這些數字每一項都只能視為 inclusionAI 的宣稱——但調校的方向明確且一致。
唯一值得爭論的數字:42 對 38
最可能促使純文字團隊轉換的宣稱,是標題那一項:inclusionAI 報告 Ling-3.0-flash-VL 在 Artificial Analysis Intelligence Index(v4.1.1)上取得 42 分,比它對同一指數版本所歸給 Ling 3.0 Flash 的 38 分高出 4 分。請注意該指數衡量的是什麼:其 v4.1.1 綜合分數取材自文字與 agentic 套件——GDPval、Terminal-Bench、SciCode、GPQA Diamond、Humanity's Last Exam 及類似項目,其中沒有一項是影像任務。因此,該廠商聲稱的是:在共享骨幹上加入視覺訓練,使模型在文字側的智慧表現提升了 4 分,而不只是它現在能描述圖片。這是一個驚人但完全合理的宣稱——多模態指令微調通常會提升文字能力。
兩個資料來源的注意事項能讓這個數字不至於被過度解讀。首先,38是較舊一代指數的數字:Artificial Analysis其後已將即時排行榜改為較新的指數版本(v4.3),目前在該版本中將Ling 3.0 Flash列為估計25分,但仍將它排在該類別63個模型中的第一位。廠商公布的42對38這組數字是基於舊版量表,因此不應解讀成「比AA目前對該文字模型的分數高出4分」。其次,42是inclusionAI自家的數字,針對的是一個Artificial Analysis尚未列入的模型;而且inclusionAI並未公布該VL檢查點在個別文字測試集(SWE-Bench、Terminal-Bench)上的結果,而這些測試集正是其自家文字模型圖表所列出的細項。四分正是你在僅憑這點差異就把純文字流程遷移過去之前,會想先重現出來的增益幅度。

價格:一個有定價,另一個沒有
成本比較目前只是與單一價格進行的比較。Ling 3.0 Flash 現已可在供應商的第一方 API 上呼叫,大約每 100 萬輸入 token 為 $0.07、每 100 萬輸出 token 為 $0.22——這是供應商設定的價格,並已在 Artificial Analysis 的列表上確認——快取輸入更便宜,而其上市期間的折扣已結束。Ling-3.0-flash-VL 目前沒有任何已公開的 API 價格;尚無法按 token 付費使用。若你想在本週使用它,就必須自行託管:以 BF16 格式約 250 GB 的 MIT 權重,並使用與文字模型所需的相同硬體等級——4× 141GB GPU(H20-3e 或 H200),或具備 tensor-parallel 4 的 4-GPU Blackwell 節點,或採用 TP8 的 8× 80GB H100/H800。
這重新定義了純文字團隊的經濟效益。如果你是按量購買 token,價格 $0.07/$0.22 的文字模型便宜且經過實證考驗。如果你已經自行託管 124B 文字模型,VL 檢查點並非第二筆基礎設施投資——它只是同一等級機器上額外多出的約 250 GB 權重,唯有真正消耗像素的工作負載才能合理化這筆支出。有眼睛的模型,唯有當眼睛真正進入流程時,才有其價值。
該由誰來選擇哪一個
• 純文字、高流量——請繼續使用 Ling 3.0 Flash。你能享有經過驗證、列入 AA 清單的模型、真正按 token 計價的費用,以及成熟的工具呼叫。VL 模型那四點的指數增益無法重現,其文字側的吞吐量也未經測量;目前尚無證據顯示它是較佳的文字模型,那只是宣稱而已。
• 視覺進入迴圈 — 文件、螢幕截圖、圖表、照片、影片畫面,或你的代理程式需要閱讀和點擊的 UI — Ling-3.0-flash-VL 是明顯的選擇,因為它正是你已理解的推理骨幹,只是加上了視覺堆疊,而不是你必須從頭重新評估的獨立多模態模型。
• 混合流量,尚未定案——低風險的做法是讓兩者都維持可達,並按請求路由,而非為了單一選項重新架構。這正是模型閘道器存在的價值:單一 API 涵蓋 200+ 模型、以 0% 加成轉傳供應商牌價、供應商效能衰退時自動容錯移轉。目前 Ling 的兩個檢查點都尚未掛在 OrcaRouter 端點之後——文字模型的價格是供應商自己的定價,而 VL 模型根本沒有託管價格——但一旦 VL 有了託管價格,將一部分流量移轉過去並進行量測,只是組態變更,而非整合專案。
還缺少什麼
• 在目前的 Artificial Analysis Intelligence Index 上獨立運行 Ling-3.0-flash-VL——42 是 inclusionAI 針對較早版本指數的說法。
• 任何 VL 模型的託管 API 價格,這是休閒採用上最大的單一障礙。
• 為 VL 檢查點發布了僅文字的分割(SWE-Bench Pro、Terminal-Bench 2.1),以便以文字為主的團隊可以驗證視覺堆疊並未使其付出任何代價。
• 針對 VL 在影像負載下的端對端延遲或吞吐量數據——文字模型的速度有被測量;視覺模型的速度則沒有。
• 對視覺基準測試圖表的客觀確認,其中部分是在 inclusionAI 自家的測試框架上運行,且至少有一項內部基準測試預計於稍後發布。
裁決
這不是一場模型品質競賽,而是附帶四點主張的模態決策。如果輸入是文字,請沿用 Ling 3.0 Flash——它更便宜、已列入 AA 名單、且經實測;而 VL 模型對它的優勢,目前只是廠商在較舊指標量表上給出的數字。如果工作負載以螢幕畫面為起點——文件頁、截圖、圖表、影片影格,或你的代理程式必須操作的 GUI——Ling-3.0-flash-VL 正是你已熟悉的那個 124B 大腦,如今多了視覺;這是貨真價實的新選項,一週前 Ling 快速層級還不存在。在視覺需求真實存在之處採用它;在單憑 42 這個數據遷移任何項目之前,先加以驗證;並讓選擇在路由層維持可逆,直到獨立評分與正式定價出爐。
