
Ling-3.0-flash-VL:螞蟻於快速Ling系列開源多模態模型
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
2026年9月4日,螞蟻集團的 inclusionAI 實驗室在 Hugging Face 上釋出了採用 MIT 授權的 Ling-3.0-flash-VL 權重,並於同一天更新螞蟻 Ling 平台開發者文件以與之對應。Ling-3.0-flash-VL 是 Ling-3.0-flash 系列中第一個具備視覺能力的檢查點:它採用與純文字版 Ling-3.0-flash 相同的約 1240 億參數稀疏混合專家(sparse mixture-of-experts)骨架,這正是讓純文字版在夏末成為最受討論的廉價推理模型之一的原因,如今它除了文字之外,也能讀取圖片與短影片片段。FP8 量化版本則於 9 月 8 日(本文撰寫當天早上)接續推出。因此,在短短四天內,該釋出便擁有了讀者可實際運用的三種面向——開放權重、螞蟻 Ling 平台上的官方 API,以及供應商回報的 Artificial Analysis Intelligence Index 協定 4.1.1 版 42 分評測成績,比純文字版獨立測得的 38 分高出 4 分。它尚未擁有的,是一份正式的公告:Hugging Face 模型卡與開發者教學就是整個釋出的全部,這也正是本文之所以要區分「供應商所宣稱」與「外部人士所能驗證」的原因。
這項發布之所以重要,在於它對 Ant 產品版圖造成的影響。直到 2026 年年中之前,Ant 模型組合中的多模態能力都集中在獨立的 Ming 產品線中,而 Ling-3.0-flash 則被定位為——包括本部落格自家文字模型說明文中——用於代理、程式編寫與深度研究的快速文字與工具層級。Ling-3.0-flash-VL 打破了這條界線:它將視覺資訊帶入一個以異常小的激活參數規模和長時代理運行見長的推理模型,並同時以三種方式將成果交付給開發者。這使它與先前的領域調校變體(Ling-3.0-flash-Fin、Ling-3.0-flash-Sante)構成完全不同的決策——那些變體以免費 API 形式發布,且未提供權重。本次這個版本則為開放式,運行於 Ant 的付費平台上,而且因為實在太新,至今還沒有任何外部人士發表過獨立運行結果。這最後一點,正是全篇最重要的關鍵。
發布了什麼,以及何時發布
以下每個日期都可從儲存庫與文件中查證;沒有任何部分依賴於一篇不存在的新聞稿。
• 9月4日 — Hugging Face 儲存庫 inclusionAI/Ling-3.0-flash-VL 於 15:24 UTC 建立,包含 64 個 bf16 權重分片、一套完整的自訂程式碼堆疊,用於 bailing_moe_v3_vl 架構、一個預設啟用思考的聊天模板,以及 MIT 授權。撰寫此文時,下載次數僅有數十次;這是一個只有儲存庫觀察者才可能在第一天就發現的上傳。
• 9月4日——蚂蚁集团Ling平台开发者门户新增多模态理解教程,在官方API上记录了该模型(该页面自身的"最后更新"时间戳显示为2026年9月4日)。次日,中国开发者媒体报道了该功能,将其描述为面向视觉问答和内容分析的图像与短视频理解能力。
從9月5日起——服務與部署支援迅速出現:一份針對該模型的SGLang部署手冊、由inclusionAI組織維護的客製化vLLM分支,以及一個自備權重的部署程式庫清單,附有現成的chat-completions端點。這些是執行環境與基礎設施,而非公告,但它們說明該模型是為了被服務而建置,而不只是被發布。
• 9月8日 — FP8量化版 inclusionAI/Ling-3.0-flash-VL-fp8 已落地(64個分片,約126 GB),其中視覺塔刻意保留較高精度,而MoE權重則壓縮為FP8 E4M3。對於在較少或較小的GPU上自行託管而言,這是多數人實際會下載的檢查點。

上方這張卡片是本次發行中最接近發佈說明的東西——模型描述、架構、指向 SGLang 與 vLLM 配方(recipes)的連結,而我們在其他地方都找不到任何公告。請注意一個值得在開頭就指出的不一致之處:模型卡寫的是「每個 token 只啟動 5.5B 參數」,而圍繞同一發行時間撰寫的 SGLang cookbook 描述的卻是「5.1B 啟動」的模型。對於一個全新 checkpoint 而言,這個差異很可能是視覺塔(vision tower)的計入方式不同,而非兩個不同的模型;但這正是那種應該標註為「尚未定論」而非含糊帶過的細節。
一個激活5.5B的124B模型——現在有眼睛了。
Ling-3.0-flash-VL 延續了其文字版孿生模型所定義的混合稀疏 MoE 配方。模型卡描述了一個 42 層的骨幹網路,以 5:1 的比例交替使用 Kimi-Delta-Attention 與 Gated-MLA 層——與 Ling-3.0-flash 具有相同的結構節奏——總參數量約為 1248 億,且每個 token 僅啟動其中一小部分。新的部分在於感知堆疊:一個 ViT 視覺編碼器,透過兩層 MLP 投影器饋入語言骨幹,再加上 VideoRoPE 同時編碼空間與時間位置,使影片幀能以模型可推理的順序抵達。輸入為文字、圖片與影片;輸出為文字。
• 參數 — 總計 124B,根據供應商規格卡,每個 token 激活約 5.5B(參見上方計數方式的注意事項)。
• Context — 標榜「高達 1M tokens」;目前現有的部署配方透過 YaRN rope scaling 實際運行 256K,這是在有人發表經驗證的更長運行之前,規劃時應依循的誠實實際數字。
• 思考 — 透過聊天模板,推理預設為開啟;官方 API 範例與服務配方都展示了逐請求的 enable_thinking: false 開關,適用於對延遲敏感的呼叫。
• 授權 — MIT,兩種精度格式皆可,無附加條款。這正是促使文字模型於八月開源而備受矚目的同一簡潔授權,也是讓自行託管成為實際可行選項而非灰色地帶的全部原因。
設計意圖與規格表一樣重要。Ant 將 Ling-3.0-flash-VL 定位為一款「將視覺資訊帶入理解、推理、行動與驗證完整流程」的模型——這是代理型工作負載的語言,而不是影像描述。一個能觀看 30 秒螢幕錄影、在上下文中維持長時間工具呼叫會話,並將啟動成本保持在接近 5B 參數的模型,瞄準的正是電腦操作與以短影音為根基的代理。這與那些針對單一影像問答最佳化的視覺語言模型是截然不同的產品,也是解讀下文所有基準測試時應抱持的框架。
官方 API 實際接受什麼
Ant Ling 平台的教學文件介紹了 Ling-3.0-flash-VL 的兩種 API 形式:一個是位於 api.ant-ling.com/v1/chat/completions 的 OpenAI 相容端點,另一個是位於 api.ant-ling.com/anthropic/v1/messages 的 Anthropic 相容端點。在針對它進行開發之前,有幾項限制值得了解:
• 圖片 — 僅限 JPEG 和 PNG、base64 格式,每個請求最多 40 張圖片,每張圖片最大 16,384 × 784 像素,每個 base64 字串最大 32 MB。與 OpenAI 相容的 image_url.detail 參數會被忽略;引擎會在內部自行決定解析度。
• 影片 — MP4、MOV 或 WMV,每個請求一個剪輯,最長 30 秒,以每秒 2 幀的固定速率取樣,最多 32 幀,base64 編碼最多 32 MB。影片僅可在 OpenAI 相容端點上使用;Anthropic 相容端點接受文字和圖片,但不接受影片。
• 模型識別碼——本教學的 curl 範例將模型稱作Ling-3.0-flash-VL-rc1,而非Ling-3.0-flash-VL。該-rc1後綴是候選版本標記,也是一個真正的未決問題:文件上完全沒有說明平台目前提供的是哪組權重,也沒有說明 API 的檢查點是否與 9月4日的開放權重版本一致。如果你是在拿 API 與開放權重進行評測,這正是你該測試的第一件事,而不是可以事先預設的假設。

上述頁面是輸入限制的所在之處——圖片與影片格式、每次請求的上限,以及兩種端點形式。此外,這裡也確認了該模型是實際運作的商業 API 服務,而非僅有文件的空殼。
這些數字——以及其通報者

卡片上唯一一個醒目的數字,是 Artificial Analysis Intelligence Index 協議 4.1.1 版的 42 分,Ant 宣稱這比純文字版 Ling-3.0-flash 的 38 分領先四分。這句話中的區別舉足輕重:38 分是 Artificial Analysis 的測量結果——由獨立機構執行、發佈在他們的排行榜上,並在業界對這款文字模型的報導中得到肯定引用;而 42 分是 Ant 自家模型卡上的宣稱,雖依 AA 指數協議計算,卻尚未被 Artificial Analysis 列入,因為截至本文撰寫時,Artificial Analysis 還沒有 Ling-3.0-flash-VL 的頁面。目前除了 Ant 以外,還沒有任何人跑過這個 checkpoint。請把 42 分視為廠商提供的數字,它出自同一體系——也就是打造出文字模型真實 38 分的那一方——值得一看,但還不該當作已確立的數據引用。
發布中其他一切內容都屬於質性或方法論範疇。模型卡以「理解、推理、行動」能力圖表描述該模型,並暗示在 AA 風格協議下進行的代理式 Terminal-Bench 評測,但並未公布我們能在這裡重現的數值文字結果;部署手冊列出了與特定服務配置相關的準確度數據(MMMU-Pro、GSM8K),值得一讀,但這些是接近基礎設施層面的測量,而非獨立評測。誠實的總結很簡短:一個看似合理、服務成本低、具視覺能力的推理模型,但目前尚無公開的獨立評分榜。
費用是多少,以及家族史所暗示的內容
Ant 的多模態教學文件並未列出 Ling-3.0-flash-VL 的逐 token 價格,因此這裡的任何內容都是推估,並已明確標示。有用的錨點是同平台上的文字版兄弟模型:Ling-3.0-flash 的第一方定價約為每 100 萬輸入 token 0.075 美元、每 100 萬輸出 token 0.22 美元,快取讀取約便宜 80%;而中國主控台在早鳥 75% 折扣(已於 8 月 31 日結束)後,以人民幣計價(每 100 萬 token 輸入 ¥0.40 / 輸出 ¥1.20)。124B-A5.5B 多模態模型比 124B-A5.1B 文字模型的服務成本更高——視覺塔是密集的,且每個影像 token 都會執行——因此落在該區間內或略高於該區間的價格,是合理的先驗預期。家族歷史則指向另一個方向:Fin 和 Sante 這兩個領域變體是以免費 API 推出,因此 Ant 已展現出它會用零定價來培育市場上它想要推廣的 Ling 變體的採用。VL 究竟會跟隨付費文字模型的定價區間,還是免費變體的模式,目前仍未公開。
就自架(self-host)路線而言,數字是具體的,因為檔案是公開的。bf16 版本約為 250 GB 的下載量、橫跨 64 個分片 — 除了最大的單一節點之外,這在任何機器上都是多 GPU 才能處理的方案 — 而 FP8 版本(約 126 GB,視覺塔保留 bf16 精度)則可輕鬆容納在配備 8 × 80 GB 級加速器的節點中,也是大多數團隊實際會跑的版本。來自 serving cookbook 的吞吐量宣稱確實存在,但偏向供應商說法;預期會有常見的但書:實際 token/s 取決於你的硬體與批次。
路由層該放在哪裡——說實話
在推出時,我們檢查的主要第三方模型閘道中,沒有任何一個列出 Ling-3.0-flash-VL,而 OrcaRouter——這個部落格所屬的路由平台——也未提供該模型。本文中的任何內容都不應被解讀為有提供。這就是一個才推出四天的模型的真實狀態,值得明說,因為讀者今天實際擁有的選項恰好有兩個:呼叫 Ant 的官方 API,或自行託管 MIT 權重。路由層面則是接下來才會發生的事。一旦像這樣的模型進入第三方服務,直通路由器的經濟學就是偏好用它來評估的原因:供應商列表價格以 0% 加價轉發,因此供應商的降價(或像 Fin 和 Sante 推出那樣的免費層級實驗)會在宣布當天生效,而自動故障轉移讓你可以將真實工作負載指向一個才推出幾天的開源模型,不必把你的技術棧押注在單一供應商的正常運行時間或單一檢查點的行為上。對於一個已經重新調整過一次價格、並在六週內分化成四個變體的模型系列來說,這不是假設——而是每次 Ant 有變動時手動重新測試,與透過一個 API 重新測試一次之間的差別。
看什麼
這個版本還太新,目前有用的訊號大多是一般人都能跑的檢查。首先,Artificial Analysis(或其他獨立實驗室)是否會列出 Ling-3.0-flash-VL,並確認或修正 42——這單一數據點就區分了「該系列最佳模型」和「另一個廠商的數字」。其次,官方 API 上的-rc1標識是否會解析到 9 月 4 日的開放權重;如果不會,API 與自架路徑就是不同的模型,而你讀到的每一份比較都得說明它用的是哪一個。第三,定價:Ling 平台上公布的 VL 費率,以及它究竟遵循文字模型的付費區間,還是 Fin/Sante 免費 API 的劇本。第四,FP8 檢查點在實際服務時是否保得住顯示卡的準確度——視覺塔維持在 bf16 是個好徵兆,但量化視覺的宣稱需要實際跑一輪,而不是看設定。第五,產品地圖的問題:既然視覺能力已整合進快速 Ling 產品線,就要觀察 Ant 是讓 Ming 繼續作為獨立的多模態品牌,還是讓兩者合流。
對開發者而言,短期答案很短。如果你今天就想在此之上建置,官方 API 是零基礎設施路徑,FP8 權重則是自架路徑,而且兩者在本週都已成真。如果你想在 42 這個數字上建置,請等 Ant 以外的人複現它。Ling-3.0-flash-VL 一切真正有用的部分——MIT 權重、合理的架構、激進的價格對活化設計,以及值得認真看待的廠商評分——都已到位;而所有能讓它成為安全預設的部分,仍懸而未決。
