一張標題卡,將 Ling-3.0-flash-VL 與 InternLumina U2 相互對比:前者是 124B 參數、5.5B 活躍參數的視覺語言模型,採 MIT 授權,獨立 Intelligence Index 為 25,並具備 NVIDIA CUDA 服務路徑;後者是 16B 參數、1B 活躍參數的多碼本擴散模型,採 Apache-2.0 授權,唯一公開發布的檢查點以 Ascend 訓練而成,涵蓋理解,以及生成、編輯與 3D。
Guides & Insights

Ling-3.0-flash-VL 對比 InternLumina U2:兩者皆已推出,但採用不同晶片

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這兩個模型如今都已真實存在、可執行且可下載,而兩週前情況並非如此——而且它們之間的差異幾乎與基準測試毫無關係。Ling-3.0-flash-VL來自螞蟻集團的 inclusionAI 實驗室,於 2026 年 9 月 4 日至 8 日期間把 BF16 與 FP8 權重放上 Hugging Face,同時發布了 SGLang 與 vLLM 的部署配置,並在 Artificial Analysis Intelligence Index v4.3 上取得 25 分的獨立評分。InternLumina U2來自上海人工智慧實驗室 InternLM 團隊,先釋出推論程式碼,接著於 9 月 10 日將其以 Ascend 訓練的模型權重發布至 Hugging Face——七個 safetensors 分片放在ascend/子資料夾中,讓整個儲存庫湊齊十六個檔案。

關鍵在於那兩次權重釋出究竟是為了什麼而打造的。Ling-3.0-flash-VL 所公布的路徑是大家早就有的 CUDA 路徑:八加速器節點執行 FP8 版本,而服務堆疊就是你已經在跑的那些。InternLumina U2 所公布的檢查點是 Ascend 版本,而 README 明確表示,你要下載與你打算如何執行推論相符的檢查點——而 NVIDIA 訓練的檢查點仍列為即將推出。兩個模型在同一週發布,而其中只有一個能在大多數團隊面前所擺放的硬體上執行。

這對這項比較做了有用的重新框定。這不再是一篇「已發布 vs. 霧件」的文章,而任何人若仍把 InternLumina U2 描述為權重待發布,都是在看一週前的 README。這是一篇關於兩種截然不同的統一視覺設計、分別登上兩個不同晶片生態系的文章,也是在談每次發布中究竟有哪些部分真正完成。

每個版本現在包含的內容

Ling-3.0-flash-VL 是一個 124B 參數的稀疏混合專家模型,每個 token 約啟用 5.5B 個參數,其 42 層混合主幹以 5:1 的比例交替使用 Kimi Delta Attention 與閘控 MLA 區塊。任意解析度的視覺編碼器與兩層 MLP 投影器饋入該主幹,並由 VideoRoPE 處理空間與時間位置。它接受文字、圖像與影片,並輸出文字。BF16(64 個分片)與 FP8(約 126 GB,視覺塔刻意維持比專家權重更高的精度)皆依 MIT 授權公開發布,而且這次發布足夠完整,讓獨立基準測試社群對它進行評分——在 Intelligence Index v4.3 上獲得 25 分,在其尺寸級別中於 64 個模型裡排名第 2,該級別的中位數為 8。它未公布的是視覺模型的每 token 價格,而其 API 範例帶有一個 -rc1 識別碼,這使人無法確定所服務的檢查點是否與公開權重相符。

InternLumina U2 是一款 16B 參數的稀疏混合專家模型,約有 1B 活躍參數,以 LLaDA-2.0 MoE 擴散語言模型為骨幹打造,在單一模型中涵蓋六大任務家族:文字問答、文字生圖、圖像理解、圖像編輯、影片理解與 3D 理解。上述所有項目的推論程式碼皆已公開於 main。經 Ascend 訓練的檢查點現已於 Hugging Face 公開。根據該儲存庫自身的發展藍圖,仍未完成的有:NVIDIA 訓練的檢查點、訓練程式碼(另一個獨立儲存庫),以及技術報告。藍圖中已勾選四項、尚有兩項未完成——推論程式碼、Ascend 權重,以及 Ascend 訓練與推論堆疊皆已完成;訓練程式碼與技術報告則尚未完成。

有一個實務細節夾在那兩段之間。執行 U2 的視覺路徑需要位於 atoken_inference/checkpoints/atoken-sod.pt 的 AToken 分詞器權重,而釋出的驅動程式預期一個分割的檢查點目錄,並將模型資源集中放在一起。這段程式碼確實存在,可安裝於 Python 3.11、PyTorch 2.6.0,而在 CUDA 路徑上還需要 flash-attn 2.7.2。Ascend 支援位於另一個 ascend-npu-support 分支上,需要 CANN 以及相符的 torch_npu 建置來取代 CUDA 工具鏈。這些都不是藏起來的;全都有文件記載。只是這條路比 pip install 加上一個模型字串要長得多。

「什麼是視覺 token」這個問題的兩個答案

這些架構在某個比參數數量更深層的地方並不一致,而這種分歧正是將這兩者並列比較時最有趣的地方。

Ling-3.0-flash-VL 維持標準契約。一張影像會透過視覺編碼器與投影器變成一串 token 序列,這些 token 進入 transformer 主幹,而一切皆以自迴歸方式運行。其新穎之處不在於視覺如何被表徵,而在於主幹運行得多麼便宜——每個 token 僅 5.5B 活躍參數,總參數則為 124B,這正是該模型得以出現在智慧對比活躍參數前沿上的全部原因。VideoRoPE 為空間與時間位置提供了一致的編碼,因此影片不需要任何額外的機制。

InternLumina U2 改變了表徵本身。它使用 Apple 的 AToken 分詞器,其中每個視覺位置由 八個互補編碼簿——局部紋理、內嵌文字、幾何與高頻細節,作為各自獨立的串流,而非收攏成單一向量。每個編碼簿在輸入時保有自己的嵌入,而八個逐位置嵌入會串接起來,並投影降維成單一主幹符元。在輸出端,預測方式則是團隊所稱的空間平行、編碼簿深度自迴歸:擴散主幹會一次對許多被遮罩的空間位置去雜訊,接著由多編碼簿自迴歸頭依序預測每個位置的八個編碼。理解與生成都經由同一套機制運作——這才是真正的主張。團隊的論點是:單一編碼簿會限制一個視覺符元能承載多少資訊,而離散-連續混合式做法會把理解與生成拆散到不同的表徵與解碼路徑上;唯有採用多編碼簿、完全離散化,才能得到真正統一的模型,而不是兩套硬鎖在一起的堆疊。

這兩種立場都前後一貫,而它們背負著相反的成本。多碼本表徵能容納更精細的視覺細節;它們也會讓每張影像的 token 預算乘以碼本數量,並使解碼變得相當複雜,這想必是選擇 16B-A1B 這個規模的部分原因。Ling 的稀疏性換來低廉的每 token 推論成本;這也意味著每次前向傳遞的活躍容量較小,而這正是智慧指數上同類中位數 8 所默默揭示的取捨——Ling-3.0-flash-VL 以 25 分輕鬆跨越,但在純粹推理上,它並未與稠密前沿模型競爭。

任務表面僅部分重疊

把兩者都歸在「多模態模型」之下,是誇大了它們的重疊程度。知道界線止於何處,能避免許多不當的比較選購。

• 輸入 — Ling-3.0-flash-VL 接受文字、圖像與影片,每次請求最多 40 張圖像,並回傳文字;InternLumina U2 接受文字、圖像、影片與 3D 資產,並回傳文字、生成的圖像或編輯過的圖像br /> • 圖像生成 — Ling-3.0-flash-VL 完全無法生成或編輯圖像;InternLumina U2 的核心主張是它能同時做到這兩件事,最高可達 1024×1024,而且用的是與讀取圖像相同的權重br /> • 3D — Ling-3.0-flash-VL 沒有任何 3D 路徑;InternLumina U2 隨附一套以 Blender 為基礎的流程,可將 GLB 與 GLTF 資產渲染成 64 組成對的色彩與深度視圖,供模型推理使用br /> • 影片 — Ling-3.0-flash-VL 透過 VideoRoPE 時間編碼處理影片;InternLumina U2 則取樣 64 個影格br /> • 上下文與輸出 — Ling-3.0-flash-VL 實測出 262K 個 token 的上下文視窗,而其模型卡記載的是 256K,且最大輸出相對較短;InternLumina U2 則兩項數據都尚未公布br /> • 啟用參數 — Ling-3.0-flash-VL 每個 token 約啟用 5.5B 參數;InternLumina U2 約啟用 1B,僅為其五分之一

讀完那份清單後,結論是:這兩個模型恰好只在一項工作上互為替代品——讀取圖像並回答相關問題——而在幾乎其他所有方面則是互補的。如果你需要一個能生成或編輯圖像的模型,Ling-3.0-flash-VL 並非候選,任何基準測試都改變不了這一點。如果你需要一個模型,能讀取圖表、生成變體,並對 3D 資產進行推理,InternLumina U2 正是為此而設,而 Ling-3.0-flash-VL 並未處理這一點。

The GitHub repository page for InternLM/InternLumina-U2 showing the Apache-2.0 license, a commit titled Document weight downloads and mark Ascend checkpoint released from two days earlier, a file listing including infer_t2i_sft.py, infer_mmu_sft.py, infer_video_sft.py and infer_3d_sft.py, 52 stars, and the Releases panel reading No releases published.

基準測試:一項獨立評分,對比一整頁的廠商數據。

證據品質的差距並不小,因此值得精確說明原因,而不是直接斷定誰勝誰負。

Ling-3.0-flash-VL 在 Intelligence Index v4.3 上拿到 25 分,這是第三方依公開協議所做的測試;作為參照,同級中位數為 8,另外實測輸出吞吐量為每秒 142.9 個 token,同儕中位數則是 105.1,首 token 時間為 2.21 秒。其廠商產品卡另行宣稱在 已退役的 v4.1.1協議上達到 42 分,那是不同的量表,不能拿來與 25 分並列,彷彿該模型退步了一般;該指數已於 2026 年 9 月重新表述,並全面重新評分。廠商也回報,在代號「linthium」下以 1,441 比 1,440 在 Image-to-WebDev Arena 擊敗 GPT-5.4——一分之差落在 Elo 雜訊範圍內,且屬廠商自行回報。

InternLumina U2 的數字是實驗室自家的,標示為初步且不完整,完整的比較表與技術報告仍待公布。這些數字目前置於儲存庫 README 的表格中,而非基準測試排行榜上,且尚無法獨立驗證,因為還沒有任何第三方公布過執行結果。按照實驗室的說法陳述如下:

• 理解能力 — ChartQA 86.52、CharXiv-DQ 83.65、HallusionBench 62.15、MMMU-Pro 36.13、MathVision 33.22、DynaMath 56.37br /> • 影片 — Video-MME 51.26、MVBench 59.74、MLVU 57.03br /> • 生成與編輯 — GenEval 0.81、DPG 87.10、TIIF Short 84.60、TIIF Long 85.95、ImgEdit 3.83br /> • 資料來源 — InternLumina U2 的每一項數據皆由廠商提供,且屬初步結果;Ling-3.0-flash-VL 的每一項數據亦皆由廠商提供,唯獨 Intelligence Index 例外,該項數據依 Artificial Analysis 的公布內容

其中有兩項值得標記。依該實驗室自家的表格,GenEval 0.81 落後於一家具名競爭對手的 0.89——這是廠商罕見公開自身落敗的例子,也讓人稍微更願意相信這份評分表其餘內容。而 ImgEdit 的 3.83 若少了隨附表格便毫無意義,而該表格正是待發布技術報告將收錄的部分內容之一。請把 InternLumina U2 清單視為該實驗室有意捍衛的結果,而不是你可以據以行動的結果。另請注意,其理解分數與 Ling-3.0-flash-VL 的指標分數並非可相互比較的量:前者是一組特定任務的廠商數字,後者則是第三方綜合指標。

A two-column comparison scoreboard for Ling-3.0-flash-VL and InternLumina U2 across six shared dimensions: Intelligence Index 25 on v4.3 versus none yet, active parameters 5.5B versus 1B, total parameters 124B versus 16B, license MIT versus Apache-2.0, published checkpoint NVIDIA CUDA versus Ascend only, and task surface understanding only versus plus generation, editing and 3D, with a footer noting the Ling figure is per Artificial Analysis and InternLumina U2 figures are vendor-reported preliminary.

授權、硬體,以及押注在各自上實際要付出多少代價

Ling-3.0-flash-VL 在兩種精度格式下皆採 MIT 授權,這差不多是開放權重所能達到的最高乾淨程度——沒有附加條款、沒有使用領域限制、商業部署也沒有任何模糊地帶。FP8 版本約 126 GB,可放進一個配備八顆 80GB 等級加速器的節點;BF16 則約為其兩倍。SGLang 以及由 Ant 維護的 vLLM 分支早已提供推論服務支援。剩下的風險屬於商業層面而非法律層面:Ant 並未公布這款視覺模型的每 token 費率,Ling Studio 上的免費取用屬於推廣性質而非正式定價,而 Artificial Analysis 之所以將其列為每 100 萬 token 輸入與輸出皆 $0.00,純粹是因為它能看到的端點是免費的那一個。

InternLumina U2 在主儲存庫採用 Apache-2.0,但有兩項值得細看的例外:隨附的VeOmni/目錄保留其上游 Apache-2.0 授權,而atoken_inference/則衍生自 Apple 的 ml-atoken,並依 Apple 原始條款重新散布。這項基礎架構主張相當認真——它同時鎖定 NVIDIA GPU 與華為昇騰 NPU,並在兩個後端之間做到運算子層級的數值對齊;團隊也回報在千卡昇騰叢集上完成端到端訓練,藉由融合運算子、調校過的 HSDP 分片與梯度檢查點,取得 1.85× 的訓練效率提升。這是實打實的工程成果。不過這與模型本身好不好是兩回事:在昇騰上的訓練效率完全說明不了輸出品質,而現今存在的檢查點,正是針對那套技術堆疊的那一個。

所以,實務上的不對稱並不是開放與閉源之別。兩者都是開放的,兩者都採用寬鬆授權,而且兩者今天都能下載。真正的差別在於:其中一個版本假設的是你很可能已經擁有的硬體,另一個假設的則是你很可能沒有的硬體。如果你的機群是 NVIDIA,Ling-3.0-flash-VL 是一個下午就能完成的事,而 InternLumina U2 則得再等等。如果你的機群是 Ascend——在這個模型所針對的中國市場裡,這正變得越來越常見——那個等式就會完全反轉,InternLumina U2 才是有現成完整路徑的那一個,而 Ling-3.0-flash-VL 的操作配方則假設你用的是 CUDA。

關於這個搭配,人們實際會問的問題

InternLumina U2 的權重現在可以下載了嗎?

是的,以 Ascend 訓練的檢查點確實已發布——於 Hugging Face 上以 ascend/ 之名發布了七個 safetensors 分片,同時還有設定檔、分詞器與模型檔案。以 NVIDIA 訓練的檢查點則是另一個子資料夾,目前仍標示為「即將推出」,而訓練程式碼與技術報告也仍付之闕如。

Ling-3.0-flash-VL 因為有獨立評分,所以嚴格來說更好嗎?

不——它是有更充分證據支持、且更容易在常見硬體上運行,而那是個不同的主張。Ling-3.0-flash-VL 無法生成或編輯影像,無法處理 3D 資產,而且沒有公布價格。如果你的任務是影像生成、影像編輯或 3D 理解,InternLumina U2 能處理,而 Ling-3.0-flash-VL 完全無法處理,不論 Ling 模型擁有多少基準測試成績。

Ling-3.0-flash-VL 模型卡上的 42 是否與 Artificial Analysis 的 25 相牴觸?

不能直接這樣說。42 是依據 Intelligence Index 協議 v4.1.1 測得,而 25 則是依據 v4.3;該指數於 2026 年 9 月重新表述,並全面重新評分,而且這兩個版本是建立在不同的評估集之上。可以說的是,42 從未被獨立複現,而 25 已被獨立產出。

在可以呼叫其中任何一個的地方

Ling-3.0-flash-VL 與 InternLumina U2 都不在我們的模型目錄上,而若說它們在,這種說法讀者十秒內就能查證。Ling-3.0-flash-VL 可透過 Ant 自家的平台取用,該平台提供 OpenAI 相容端點與 Anthropic 相容端點,也可透過 Ling Studio 的免費試用存取,若自行部署則可透過開放權重取得。InternLumina U2 則可透過 Hugging Face 檢查點與該儲存庫的推論驅動程式,在該檢查點所鎖定的硬體上取用。

我們實際上路由的,是這個組合在實務上最常被拿來衡量的視覺模型:DeepSeek V4 Flash Vision Exp,已在目錄上線,具備 1M token 的上下文視窗與公開定價,並與目錄中其他模型共用同一個相容 OpenAI 的端點。當一間實驗室釋出開放權重時,路由層通常就能提供該模型,不必等待實驗室自家的託管服務穩定下來——這正是模型「可報價」與「可呼叫」之間的實務差異。這項差異對 Ling-3.0-flash-VL 而言已經實現,而對 InternLumina U2 來說目前仍屬學術探討,因為它的發布故事是一條硬體路徑,而非託管問題。

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class rank of #2 of 64 against a class median of 8, 124B total and 5.5B active parameters, a 262K-token context window, an MIT license and 142.9 output tokens per second.

評價確實分歧,而分歧點在於硬體與任務,而非品質。Ling-3.0-flash-VL 是完整的發布:MIT 授權、兩種精度格式、第三方評分、以 CUDA 優先,且僅限於理解。InternLumina U2 是更具野心的設計,也是較未完成的發布:只發布了一個硬體堆疊的檢查點、涵蓋生成與 3D 的統一六任務介面,以及仍待補上的技術報告。如果你這週就需要在 NVIDIA 硬體上跑視覺模型,選擇不言自明。如果 InternLumina U2 的多碼本設計才是你感興趣的,那麼值得關注的是 NVIDIA 檢查點——而在那之前,誠實的立場是:它的基準測試表,包括它落敗的那一列,所描述的是一個後半部尚未發布的模型。