Ling-3.0-flash-VL 的標題卡,將該模型概述為一個 124B 參數、5.5B 啟用參數的原生多模態混合專家模型,來自螞蟻集團 inclusionAI 實驗室,於 2026 年 9 月以 MIT 授權條款發布,在 Artificial Analysis Intelligence Index v4.3 上取得 25 分,並每秒輸出 142.9 個 token。
Guides & Insights

Ling-3.0-flash-VL:螞蟻的 5.5B 活躍視覺模型在 Intelligence Index 上排名第 25

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Ling-3.0-flash-VL 現在有了一個不是螞蟻集團任何人輸入的基準分數,而這就是新聞。螞蟻集團 inclusionAI 實驗室推出的首個原生多模態模型,在 Artificial Analysis Intelligence Index 上得分為 25——這是一項獨立運行,採用當前的 v4.3 量表,並與一個列出其速度、延遲和價格的模型頁面一同發布。它是在供應商自己的模型卡聲稱 42 在同一指數上之後的三週出現的,而讀者對這兩個數字能做的最有用的事情,就是理解它們為何並不矛盾:螞蟻是根據 Intelligence Index 協議 v4.1.1 進行測量,Artificial Analysis 則是根據 v4.3 進行測量,而這些是由不同評估集構建的不同尺子。供應商數字與第三方接觸後與其說是存活下來,不如說是在它被寫下時還不存在的量表上被重新測量了。

評分背後的模型是一個稀疏專家混合架構,總參數量達 124B,每個 token 約有 5.5B 活躍參數,以 MIT 授權條款發布,提供 BF16 與 FP8 權重,可接受文字、圖像與影片並輸出文字。活躍參數這個數字,正是這整件事的立論所在。在 5.5B 活躍參數下,Ling-3.0-flash-VL 位居開放模型中如今最引人注目的一條曲線上——那是以智能前沿對比啟動參數、而非總規模的曲線——而它之所以能站上那裡,是因為它每單位推論算力能完成相當可觀的工作,而不是因為它龐大無比。

這篇文章涵蓋實際出貨的內容與時間、獨立測試的說法、為什麼 Pareto 主張比大多數同類主張更站得住腳、這個模型的成本,以及你實際上能在哪裡呼叫它。給只想要重點的人,短版是這樣:Ling-3.0-flash-VL 是真的、開放權重、服務成本異常低廉、在其規模級別中可測量地高於平均,而且明顯比原始分數所暗示的更冗長、更晚推出。其供應商聲稱的 42 從未被獨立重現,也無法與現在榜上的 25 相提並論。

實際出貨了什麼,以及那條不斷被壓平的時間軸

對這次發布的報導,往往會把幾個各自獨立的事件壓縮成同一個發布日期,而這些日期之所以重要,是因為它們說明了為何早期文章會描述一個 Ant 以外沒有人能評分的模型。Hugging Face 儲存庫 inclusionAI/Ling-3.0-flash-VL 建立於 2026 年 9 月 4 日——64 個 BF16 權重分片、MIT 授權,以及一套用於 bailing_moe_v3_vl 架構的自訂程式碼堆疊;而且有幾天幾乎沒人下載它。FP8 量化接著在 9 月 8 日,約 126 GB、橫跨 64 個分片,其中視覺塔保持比專家權重更高的精度。Artificial Analysis 將這次發布列為 2026 年 9 月 10 日,這是它自己頁面所錨定的日期,而帶有該分數的模型頁面大約在那時上線。

所以「2026 年 9 月發布」雖然準確,卻沒什麼用。實際的時序是:4 日釋出權重,8 日推出第二種精度格式,10 日進行獨立量測。這件事之所以重要,是因為一個模型即使權重已經在磁碟上,卻沒有代管端點、也沒有第三方評分,對大多數團隊而言,還稱不上是可以評估的東西——它只是一份你得先為它備妥資源的下載檔。Ling-3.0-flash-VL 是在 API 與獨立評分兩者都已到位時,才跨過了那條界線。

推論服務支援與權重一同到位,而不是在權重之後才出現。Ant 發布了一份 SGLang 部署指南,並為該架構維護一個經 Ling 調校的 vLLM 分支;在開源發布中,這通常是會落後數週的部分。這次並沒有落後。

板子上的號碼,以及卡片上的那個。

以下是來自 Artificial Analysis 的獨立概況,也就是目前唯一存在的對該模型的第三方測量:

• 智能指數 — 25 於 v4.3,在其尺寸級別中 64 個模型裡排名第 2,類別中位數為 8br /> • 總參數量 — 124Bbr /> • 活躍參數量 — 每 token 5.5Bbr /> • 輸出速度 — 每秒 142.9 個 token,64 個中排名第 10,同儕中位數為 105.1br /> • 首個 token 時間 — 2.21 秒,同儕中位數為 2.29br /> • 上下文視窗 — 依 Artificial Analysis 測量為 262K tokens,而模型卡本身標示為 256Kbr /> • 授權條款 — MIT,開放權重

而這就是那個經常被印在它旁邊的廠商數字:在 Artificial Analysis 智慧指數協定 v4.1.1 上的 42 分,比純文字版 Ling-3.0-flash 在同一協定上所得的分數高出四點。這項說法見於模型卡,沒有公開的評估軌跡,也不是 Artificial Analysis 所報告的數字。有兩件事同時為真:這個 42 從未被重現,而它也不是任何不誠實行為的證據,因為 v4.1.1 與 v4.3 測量的並不是同一件事。Artificial Analysis 於 2026 年 9 月重新闡述了其指數,並重新評分了整個榜單;v4.3 納入了十項評估,包括 AA-Briefcase、GDPval-AA v2、AutomationBench-AA、Terminal-Bench v4.0 與 Humanity's Last Exam。任何仍在 25 旁邊引用 42、卻未指明版本的報導,都是在比較兩套不同的測試,還把它稱作退步。

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class ranking of #2 of 64, 124B total and 5.5B active parameters, a 262K-token context window, 142.9 output tokens per second, a 2.21 second time to first token, 160M output tokens from the Intelligence Index ranked #8 of 64, and a listed price of $0.00 per 1M tokens in and out.

除了頭條分數之外,值得標記的細節是冗長程度。Artificial Analysis 記錄到 Ling-3.0-flash-VL 花費 1.6 億輸出 token 完成 Intelligence Index,在 64 個模型中排名第 8,相對於中位數 8,400 萬,並將其標記為「非常冗長」。對於一個賣點是透過少量活躍參數實現廉價推論的模型來說,這直接與其賣點相牴觸。你是按 token 付費,不是按參數付費。一個啟動 5.5B 參數、但回答相同問題時輸出 token 數幾乎是中位數兩倍的模型,會在結帳時把部分結構性優勢還回去——而這正是按 token 計價表所隱藏、按任務成本衡量所揭露的那種交互作用。

帕雷托主張,稍加檢驗

Ling-3.0-flash-VL 位於智慧對活躍參數帕雷托前沿的這一主張,不尋常地是獨立資料所支持、而非僅是所允許的主張。此指數上的同類中位數為 8;Ling-3.0-flash-VL 得分為 25;而且它是在每個 token 啟用 5.5B 參數的情況下做到這點。對於其決定性限制是可服務吞吐量的團隊——單一加速器、固定請求預算、邊緣部署——這個比率就是整個決策,而且這是真正強勁的表現。

兩個但書讓它無法成為一場乾淨俐落的勝利。第一點是參數數量的出入:模型卡上寫的是約 5.5B 活躍參數,而 SGLang cookbook 描述的則是 5.1B 活躍參數的模型。兩者都是 Ant 的文件,差異很小,而且它略微改變了曲線的形狀,而非方向。第二點是,「frontier」是一個關於每週都在變動的領域的相對主張。在特定規模下擁有最佳的每活躍參數智慧,是一個你只能維持到該區間的下一個模型問世為止的位置,而這個區間十分擁擠。

供應商自家頭條示範——Ling-3.0-flash-VL 以「linthium」帳號參加 Image-to-WebDev Arena,得分 1,441對上GPT-5.4的 1,440——應被理解為吸睛噱頭,而非實質結果。一分之差落在競技場 Elo 的雜訊範圍內,而且是由供應商自行回報,並不是那種能決定什麼的差距。其背後的能力主張比這個數字更有意思:該模型是為視覺回饋迴路而打造,會從版面配置生成前端程式碼、渲染自己的輸出、檢視渲染結果並修正——觀察、行動、驗證、修正,而不是只做一次圖說就停止。

A single-column scoreboard card for Ling-3.0-flash-VL listing six rows: Intelligence Index 25 on v4.3, active parameters 5.5B, total parameters 124B, context window 262K tokens, output speed 142.9 tokens per second, and license MIT open weights, with a footer noting the index figure is per Artificial Analysis and the vendor card claims 42 on the retired v4.1.1 protocol.

它的成本是多少,而這點比表面上看起來更不明確。

Artificial Analysis 頁面將 Ling-3.0-flash-VL 列為 每 1M 輸入 token $0.00、每 1M 輸出 token $0.00,相較之下,同儕中位數為 $0.14 與 $0.40。那不是價格,只是價格的表象。Artificial Analysis 是依據它能看見的端點來定價,而它能看見的端點是免費的——該模型目前以免費試用形式在 Ant 的 Ling Studio 上運行,而這份列表反映的正是免費的推廣存取。Ant 自家的多模態文件完全沒有公布這款視覺模型的每 token 價格,因此沒有供應商價目表可供核對這個零。為了有個規模概念,純文字的姊妹模型 Ling-3.0-flash 列價約為每 1M 輸入 $0.075、每 1M 輸出 $0.22,而 Ant 針對特定領域的 Ling 變體推出時也是免費 API。

把這個零視為測試窗口,而不是正式費率。新發布模型的免費方案是獲客工具,而誠實的規劃假設是:Ling-3.0-flash-VL 最終會落在與其文字版本相近的價格區間。此外還有一個付費端點上線也無法解決的現存模糊之處:螞蟻自家的 API 範例使用模型識別碼Ling-3.0-flash-VL-rc1,一個候選發布版標記,而目前仍不清楚所服務的檢查點是否與 9 月 4 日的開放權重位元組完全一致。如果你正用代管 API 對自己的提示進行基準測試,並期望結果能轉移到自架的 BF16 版本上,那是一個你在據此建構之前應該先驗證的假設。

成本樣貌會因你站在哪一側而反轉。對已經擁有加速器的團隊來說,約 126 GB 的 FP8 建置能納入八路 80GB 等級節點,而 5.5B 的活躍參數量意味著你是在支付該節點的攤銷成本,換取非常小的每 token 運算佔用——這個模型最便宜的版本,就是你自己提供服務的版本。對沒有加速器的團隊來說,問題在於付費端點是否會在免費方案關閉前到位。

在真正可以稱之為它的地方,包括我們說不的那部分

Ling-3.0-flash-VL 可透過 Ant 自家平台存取——一個 OpenAI 相容端點位於 api.ant-ling.com/v1/chat/completions,旁邊還有一個 Anthropic 相容端點——此外還能在 Ling Studio 上免費試用,以及可自行部署的開放權重。獨立閘道服務也開始將它上架,而這確實是無需佈建任何東西就能試用它的最快方式。

值得直接講清楚的是,OrcaRouter 目前並未路由 Ling-3.0-flash-VL。它不在我們的模型目錄,所以你在這裡讀到任何關於透過我們呼叫它的內容都會是虛構的,而我們寧願你一開始就知道這點。我們確實有路由的是與它最直接可比的視覺模型:DeepSeek V4 Flash Vision Exp,這是 Deep​Seek 的實驗性多模態版本,已在我們的目錄上線,具備 1M token 上下文視窗與已公佈的費率。如果你實際的需求,是在一個 OpenAI 相容端點後方使用一個能力足夠的視覺模型——並設定好備援鏈,讓供應商出狀況時能在你的回應開始前重試,而且供應商的列表定價會原樣傳遞、不額外加價,因此廠商價格一有變動,當天就會反映到你這裡——那麼在 Ling-3.0-flash-VL 仍不在目錄中的期間,這就是最該先試的模型。

A release-timeline card for Ling-3.0-flash-VL covering four dated events: the Hugging Face repository created September 4 2026 with MIT-licensed BF16 weights, FP8 weights published September 8 at roughly 126 GB, the release anchored to September 10 by Artificial Analysis, and an independent Intelligence Index score of 25 published the same week, with a footer noting the model is not carried on the OrcaRouter catalogue.

從這裡要關注什麼

有三件事將決定這次發布在六個月後是否仍顯得舉足輕重。第一是第二次獨立執行:來自單一評估者的一個分數只是一個資料點,而有趣的問題在於 Ling-3.0-flash-VL 在智慧對活躍參數曲線上的位置,是否能經得起不同測試框架的考驗。第二是真正的定價。在 Ant 公布該視覺模型的價目表之前,任何涉及它的成本比較都只是披著數字外衣的估算,而免費方案正承擔著原本應由價格來發揮的作用。第三是 FP8 品質差異——在那次建置中,視覺塔被刻意維持在比專家權重更高的精度,而量化版本在細粒度視覺任務上是否與 BF16 相符,正是那種只有當人們在生產環境中運行它、而非對其進行基準測試時才會浮現的問題。

今天能得到的結論,比發布時的報導所暗示的更狹隘,卻也比單看成績更有用。Ling-3.0-flash-VL 是一個真實、採 MIT 授權、可自行架設的視覺模型,只啟用其 124B 參數中的一小部分,在當前某個獨立指標上得分 25,而同類中位數為 8,並因冗長而回吐了部分優勢。那是一個形貌誠實的好模型。卡上的 42,是來自一把已不存在的尺的數字。