{{1}}一個用於比較『InternLumina-U2 與 Microsoft Mage-VL』的英雄標題卡片,副標題為『兩個低調的實驗室,兩種押注於更聰明視覺 token 的賭注』,並附有三個統計徽章——『InternLumina-U2:16B-A1B 擴散 MoE』、『Microsoft Mage-VL:約 5B codec 原生 VLM』、『兩者皆為廠商自報,未經重現』——右下角帶有 OrcaRouter 標誌。{{/1}}
Guides & Insights

InternLumina-U2 對決 Microsoft Mage-VL:兩間低調實驗室押注視覺 Token 應承載更多

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Microsoft Mage-VL 與 InternLumina-U2 的發布方式,正是研究實驗室在不確定成果能否成為產品時的典型做法:悄無聲息。微軟於 2026 年 7 月 25 日在 Hugging Face 上發布了 Mage-VL 的權重與程式碼,未作任何公告;上海人工智慧實驗室的 InternLM 組織則於 2026 年 9 月 1 日在 GitHub 上發布了 InternLumina-U2 的推論程式碼,同樣沒有任何公告。相隔五週,全球最大的兩個實驗室先後釋出模型,兩者共享一個低調的信念——我們將視覺轉化為 token 的方式才是瓶頸所在——然後便交由社群自行發現。其中一個你現在就能下載並執行,雖然過程並不順暢。另一個你則完全無法執行,因為它的權重根本還不存在。以下是兩者的如實對照,以及為何「兩者皆為廠商自述、兩者皆未經證實」這句話,對兩者而言並不代表同一回事。

五週,兩個關於表徵效率的賭注

這條主線確有其事,並非修辭上的宣稱。Mage-VL 是一款 codec 原生的影片模型:它不會將串流解碼為均勻取樣的影格,再把密集的圖塊網格送入凍結的、經網路預訓練的視覺 Transformer;而是遵循現代影片 codec 的結構,將串流區分為錨定影格,以及介於這些影格之間的壓縮動態資料,並直接攝取這種緊湊的表示形式。微軟表示,其效益是視覺 token 大幅減少,且串流感知路徑明顯加快——該公司將此定位為修復影片語言模型中的一種莫拉維克悖論(Moravec's paradox):小型即時感知任務所耗費的運算量,竟與困難的離線推理不相上下。Mage-VL 是一個觀察者:它能高效地觀看影片,並近乎即時地回答關於其所見內容的問題。

InternLumina-U2 是從另一個方向對同一瓶頸下注。如果說 Mage-VL 是沿著編解碼器來壓縮影片,InternLumina-U2 則是用八個互補的離散碼來描述每個位置,而非只用一個碼,藉此壓縮所有視覺輸入;其採用的 tokenizer 被該實驗室稱為 AToken。這個賭注的邏輯是:單一碼本會限制一個視覺 token 能承載的資訊量,因此多碼本詞彙表能讓一個 16B 參數的擴散模型透過同一介面同時進行理解與生成——閱讀圖表、回答影片問題、描述 3D 資產、由文字產生影像、依指令編輯影像——而無需額外的生成堆疊。Mage-VL 想要低成本地感知串流;InternLumina-U2 則想用同一組權重既感知又繪製。

計分板

這兩個模型的數據皆由廠商回報且未經複現驗證,因此記分板每一行均標註其來源。

• 形態 — Mage-VL:一種緊湊的 codec-native(編解碼器原生)視覺語言模型(約 5B 參數,BF16),以 Qwen 文字主幹為核心,經訓練用於影像與影片理解。InternLumina-U2:一個 16B 參數、1B 活躍參數(16B-A1B)的 MoE(混合專家)模型,屬稀疏擴散大型語言模型,涵蓋理解、生成與編輯。

• 視覺表示 — Mage-VL:採用遵循視訊編解碼器結構(錨點+運動)的codec原生token;據報告在串流視訊上可減少超過75%的視覺token。InternLumina-U2:採用AToken tokenizer產生的完全離散八碼本token。

• 功能說明 — Mage-VL:觀看圖片和影片輸入,以文字回答;專為串流感知而建。InternLumina-U2:宣稱具備文字、影像理解、文字轉圖片、圖片編輯、影片理解與3D理解能力。

• 權重 — Mage-VL:自2026年7月25日起在Hugging Face上公開(microsoft/Mage-VL,Apache-2.0)。InternLumina-U2:未公開 — Hugging Face 倉庫是一個空殼,權重標記為「即將推出」。

• 重點數字 — Mage-VL:Video-MME 64.0、NExT-QA 83.1、OVO-Bench 64.0,皆為微軟所報告。InternLumina-U2:ChartQA 86.52、MathVision 33.22、VideoMME 51.26、GenEval 0.81,皆為實驗室報告,屬初步且部分結果。

• 提供服務的現實 — Mage-VL:可下載,但沒有標準的 vLLM 或 SGLang 路徑;程式碼需要 trust_remote_code,且目前沒有任何推論供應商部署它。InternLumina-U2:任何人都無法提供服務 — 權重不存在於公開環境中,即使已發布的推論驅動程式也預期儲存庫中不存在的檢查點檔案。

A comparison scoreboard for InternLumina-U2 and Microsoft Mage-VL: InternLumina-U2 with Shape 16B-A1B sparse MoE, Visual rep. 8-codebook discrete (AToken), Weights not public 'coming soon', Job understand/generate/edit, Headline ChartQA 86.5 GenEval 0.81, Serving none — weights absent; Microsoft Mage-VL with Shape ~5B codec-native VLM, Visual rep. codec-native stream tokens, Weights public since Jul 25 2026, Job watch video answer in text, Headline Video-MME 64.0 (reported), Serving trust_remote_code DIY, with a footer noting both sets of figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

「可用但不好用」並不等於「不可用」

如果你真的想做出點什麼東西,這個區別才是最重要的。Mage-VL 在第一順位重要的意義上是真實的:權重在 Hugging Face 上,模型卡自 7 月底以來下載流量居高不下,而且圍繞它已經形成了一個由社群量化版本組成的小型生態系。「真實」不代表「容易」。模型卡上有 custom-code 標籤,視覺編碼器不是現有服務堆疊所預設的標準凍結 ViT,而微軟自己的 repo 也承載了實際後果——執行它意味著必須 `trust_remote_code`,而且沒有現成的供應商部署方案。但一個有 GPU 且意志堅定的團隊可以把它載入,對準影片串流,驗證「codec-native」論點是否適用於他們的資料。這與 InternLumina-U2 之間存在巨大差異,後者的同一句話結局不同:一個意志堅定的團隊可以閱讀推論程式碼,然後就到此為止,因為沒有權重可載入。

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page, the multi-codebook diffusion description, and the per-task inference scripts that make up the public release.

microsoft/Mage-VL 的 Hugging Face 卡片,擷取於 2026 年 8 月 27 日——codec-native 串流描述、Apache-2.0 授權、arxiv 標籤,以及一個推論提供者區段,顯示目前沒有提供者部署此模型。

基準測試的不對稱性也沿襲了同一條思路。這兩個模型的分數目前都只是廠商宣稱,尚無任何獨立重跑的結果。但 Mage-VL 的宣稱至少建立在一個可下載的成品之上,也就是說,宣稱與驗證之間的差距,只差有人真正去執行它。InternLumina-U2 的宣稱則建立在路線圖上的一個項目——「完整的比較表格將在即將發布的技術報告中出現」——而目前並不存在任何可驗證這些宣稱的成品。該實驗室自己的部分比較表甚至顯示,該模型至少在一個它所宣稱勝過的對手面前落後(GenEval 0.81,對比 LLaDA2.0-Uni 的 0.89),這正好提醒我們,應照字面意思理解其「初步、部分」的標籤。

在那裡,他們可以創作,而非競爭。

閱讀這兩者的最有用途徑,是將它們視為階梯上相鄰的橫檔,而非競爭同一份工作的對手。像 Mage-VL 這類原生編解碼器的監看模型之所以有趣,正是因為它夠便宜、可以持續運行——它監看串流的每一幀,只有當出現值得更大模型關注的內容時才升級處理。原則上,它所升級到的更大模型,可以是 InternLumina-U2 所宣稱的那種統一模型:一個永遠在線的閘門,決定要看什麼;以及一個深度模型,真正去讀圖表、追蹤 3D 場景,或產生編輯後的影像。兩者都尚未經過驗證——Mage-VL 是未經驗證但可運行,InternLumina-U2 是未經驗證且尚未發布——因此誠實的說法是:這是一個組合,要等到每一方都經獨立驗證之後你才能建立起來,而不是你今天就能進行的正面對決。

A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured August 27 2026), showing the codec-native streaming description, the Apache-2.0 license, the arxiv tag, and an inference-provider section showing no provider currently deploys the model.

InternLM/InternLumina-U2 GitHub 儲存庫,擷取於 2026 年 9 月 2 日——此儲存庫登陸頁面顯示 multi-codebook diffusion(多碼本擴散)的說明、Apache-2.0 授權徽章,以及構成公開版本之推論入口點腳本;模型權重則仍不包含於儲存庫樹中。

路由層如何處理未經驗證的檢查點

這兩個模型目前都沒有託管在 OrcaRouter 上,我們也不會暗示相反的情況——Mage-VL 在任何地方都沒有標準的服務路徑,InternLumina-U2 更是連權重都沒有。路由 DSL 在這種情況下真正的價值,在於把上述的組合表述成一次呼叫,而不是寫一堆客製化的膠水程式:一個便宜、常駐的感知模型把結果餵給更深層的模型,彼此鏈式串接,讓昂貴的模型只會在便宜模型偵測到「情況有變」時才啟動。至於未經驗證的 checkpoint 問題——這正是兩者全部的風險所在——自動容錯移轉就是讓團隊可以在真實路徑上試用像 Mage-VL 這樣的模型、卻不必把整條路徑押在它身上的機制:一旦新的 checkpoint 第一次卡住、回傳垃圾內容或拋出例外,該次呼叫便會自動落到一個經過驗證的模型上,工程師也不必在半夜被叫醒去扳動開關。單一 API 串接超過 200 個模型,供應商列表價格不加價、直接原價轉傳;新模型是在安全網之後試煉,而不是直接送上正式生產的第一線。

底線

如果你想在今天就測試codec-native-video這條技術路線,那麼只有Mage-VL存在——而這個「存在」伴隨著關於自訂程式碼和自行搭建服務的種種前提條件。如果你想測試multi-codebook統一模型這條路線,你辦不到,因為InternLumina-U2仍然只是一份等待權重釋出的規格說明;你現在能做的,是閱讀它的架構,這樣當Hugging Face上的佔位檔案真正補齊時,你就能立刻上手。把微軟的模型視為一個笨拙但真實存在的成品,把上海AI Lab的模型視為一份文件詳實的承諾,同時記得:在這場較量中,「廠商自報且未經複現」兩者皆有份——只是當有一個檔案你可以實際下載時,這句話的意義就有所不同了。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube