一張以 OrcaRouter 品牌風格生成的標題卡,寫著「PixelUMM vs Microsoft Mage-VL」,並有四塊統計圖塊:「>75%」(Mage-VL 回報的視覺 token 縮減量)、「3.5×」(其回報相對於均勻幀取樣的實際時間加速)、「15.2B vs 4B」(PixelUMM 的總參數量對比 Mage-VL 的 Qwen3-4B 主幹)以及「0 / 1」(Mage-VL 的零生成能力,對比 PixelUMM 一個模型涵蓋圖像與影片)。頁腳一行寫著「兩家實驗室各自的數據;兩個模型皆未經獨立重跑驗證。」OrcaRouter 標誌合成於右下方加襯的條帶中。
Guides & Insights

PixelUMM 對比 Microsoft Mage-VL:一個刪除視覺分詞器,另一個改寫它

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩者PixelUMM與Microsoft Mage-VL都是由深信「視覺轉換成 token 的方式才是錯誤瓶頸」的團隊打造——而他們朝相反方向解決了這個問題。Mage-VL 是 Microsoft 的編解碼器原生串流模型,保留 tokenizer,卻讓它激進得多:它遵循現代視訊編解碼器的結構,保留每一個錨定影格,以及僅限於編解碼器耗費位元的預測影格區塊,並宣稱可將視覺 token 減少超過 75%,同時相較於均勻影格取樣,獲得最高 3.5 倍的實際運行時間加速。PixelUMM 是 NVIDIA 的無編碼器統一模型,完全移除了 tokenizer——原始像素的每個 16×16 區塊都透過單一線性投影抵達主幹,任何地方都沒有 VAE,也沒有視覺 transformer。一個壓縮得更用力。另一個則完全拒絕壓縮。而只有其中一個能生成任何東西。

最後這項差異,正是讓這組配對比規格之爭更有意思的原因。Mage-VL 是個監看者——一個串流感知模型,帶有主動閘門,用來決定何時發言。PixelUMM 則是也會繪圖的閱讀者:同一組權重既能回答關於影像的問題,也能從文字提示生成新影片。對於「統一的視覺模型應該是什麼」,它們是兩種互不相容的答案,而每個實驗室的數字都是各自說的。

壓縮發生的位置

Mage-VL 的前提是一個現代版的莫拉維克悖論:視覺語言模型擅長困難的離線推理,卻在簡單的即時感知上既緩慢又耗費大量運算資源。它的解法是編解碼器對齊。Mage-VL 不將串流解碼成均勻取樣的影格,再把稠密網格送進凍結的網頁預訓練 ViT,而是將串流分成錨定(I)影格與預測(P)影格,保留所有錨定影格的圖塊,並只保留帶有真實運動或新細節的預測影格圖塊。其編碼器 Mage-ViT 是在 16×16 圖塊網格上以 3D 旋轉位置編碼從頭訓練而成,並且明確地與編解碼器無關——同一套介面可接受 H.264/AVC 或 HEVC 的運動向量與殘差能量,或神經編解碼器所學習到的率圖,無需更改架構或重新訓練。

PixelUMM 的前提是:問題出在編碼器本身,而非其效率。其論文主張,像 BAGEL 這類模型帶有兩個視覺介面——一個用於語意特徵的 ViT,以及一個用於重建潛在表徵的 VAE——這使每張條件影像的視覺上下文大致增加一倍,並迫使視覺語言預訓練流程必須圍繞第二條串流重新建構。PixelUMM 把兩者都刪除:影像變成 16×16 的空間區塊,影片變成 4 幀的時空管狀片段,而原始像素透過單層線性投影抵達僅解碼器的 Transformer。理解是自回歸文字;生成是像素空間流匹配。

• 壓縮策略 — Mage-VL:時間性、由編解碼器衍生;保留錨點,稀疏化預測幀。PixelUMM:無;保留每個原始像素區塊。

• 哪些部分是從零開始訓練的——Mage-VL:整個視覺堆疊,以約 1 億張未標註的圖像與影片訓練。PixelUMM:像素嵌入器與解碼器,建構於 Qwen3-8B 語言骨幹之上。

• 主幹 — Mage-VL:Qwen3-4B-Instruct-2507,唯一經預訓練的元件,位於兩層 MLP 投影器之後。PixelUMM:Qwen3-8B,總參數量約 15.2B。

• 串流行為 — Mage-VL:認知閘門會為每個滾動視窗評分,並保持靜默,直到值得回應的事件完成,才在此時叫用完整模型。PixelUMM:沒有串流模式;請求即為生成或理解呼叫。

A headless-browser capture of the Hugging Face model card for the Microsoft Mage-VL repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

每一項能做什麼,以及不能做什麼

Mage-VL 是單一檢查點,同時提供圖像與影片理解,以及主動式串流閘門——同樣的權重既能回答離線問題,也能驅動事件觸發的評述。它打包了編解碼器處理器、神經編解碼套件與閘門。第二個發布版本,microsoft/Mage-ViT,是來自從零開始預訓練階段的獨立視覺編碼器,可作為其他多模態訓練的即插即用前端。Mage-VL 不做的,是生成。它閱讀。

PixelUMM 涵蓋文字轉圖像、96 幀與 24 fps 的文字轉影片,以及以圖像和影片為條件的文字生成。它隨附四個檢查點——S8-F22-R05作為預設,涵蓋全部四項任務,S8-F18-R01經過調整,能在 480p 和 720p 下提供更好的文字轉影片,但無法進行影片理解,另有兩個中間階段。它不做的是串流、編輯或 3D。如果你需要一個能觀看即時串流並在事件發生時說話的模型,PixelUMM 完全不是那樣的模型,而且沒有任何基準測試欄位會告訴你這件事。

{{1}}採用落差{{/1}}是第一個{{2}}誠實的訊號{{/2}}

這兩個發行版並未同樣成熟,而下載計數器比任何發布文章都更直白地說明了這一點。

• Mage-VL — 於 2026 年 7 月 25 日在 Hugging Face 上以 Apache-2.0 發布,並有一份搭配的技術報告與 arXiv 編號。到了十月初,它已有約 13,800 次下載與 414 個讚,且圍繞它已發展出一個小型的社群成果生態系。

• PixelUMM — 於 2026 年 10 月 1 日在 Hugging Face 上以非商業檢查點授權條款發布。撰寫本文時,其下載次數為零,按讚數為三。它才發布幾天。

目前兩家實驗室都仍未針對各自的發布發布公告——Mage-VL 在七月推出時沒有發布公告,PixelUMM 在十月推出時也沒有。這種對稱性確實存在,但若把它解讀為兩者是等價的成品,那就錯了。Mage-VL 已獲得十週的社群關注;PixelUMM 則只有幾天。一個實驗室外沒有人跑過的模型,與一個已有數千人下載的模型,是截然不同的情況,而這兩者中只有一個屬於後者。

A generated scoreboard card titled “PixelUMM vs Microsoft Mage-VL — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: visual tokenizer, backbone, trained from scratch, streaming, generation and licence. Mage-VL's column shows a codec-native sparse token grid, a Qwen3-4B-Instruct-2507 backbone, a Mage-ViT pretrained from scratch on about 100M unlabeled media, proactive streaming with a cognition gate, no generation, and Apache-2.0; PixelUMM's column shows no tokenizer at all, a Qwen3-8B backbone at 15.2B total, pixel embedders and decoders trained on top of it, no streaming mode, text-to-image and text-to-video plus understanding, and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

計分板,附出處

每一個數字都是開發實驗室自家的。Mage-VL 的數字來自 Microsoft 的模型卡與技術報告;PixelUMM 的則來自其預印本。兩者都尚未被獨立重現。

• 視覺符元 — Mage-VL:相較於密集影格取樣,據報告減少超過 75%。PixelUMM:沒有減少;其論點是原始圖塊移除的是第二層編碼,而非縮小第一層編碼。

• 實際耗時速度 — Mage-VL:在準確度相同的情況下,速度最快可達均勻影格取樣的 3.5 倍,此為 Microsoft 的報告數據。PixelUMM:論文中並未提出速度比較的宣稱。

• 編碼器品質 — Mage-VM:Mage-ViT 在 256 個 token、約 100 個未標註媒體的情況下,於 CIFAR-10 達到 99.33%、ImageNet 達到 85.69%。PixelUMM:沒有對應的編碼器基準測試,因為根本沒有編碼器可供測試。

• 影片理解 — Mage-VL:在其報告的每一項影片與時序定位基準上,相較於 Qwen3-VL-4B 皆有提升,包括 QVHighlight 的 +22.5 與 ActivityNet 的 +17.1。PixelUMM:MVBench 70.53、Video-MME 無字幕 57.33、LongVideoBench 59.61、LVBench 40.41。

• 圖像理解 — Mage-VL:在靜態圖像上與 Qwen3-VL-4B 持平,Microsoft 報告。PixelUMM:MMMU 41.67、AI2D 80.12、DocVQA 90.42、ChartQA 82.96。

• 生成 — Mage-VL:無。PixelUMM:搭配提示改寫器時,GenEval 整體得分 0.83,DPG-Bench 85.74,VBench 第 1 部分品質 84.10。

• 串流 — Mage-VL:主動式事件閘控,於 SoccerNet 串流上報告頂尖的 TimVal、F1、ROC-AUC 與 PR-AUC。PixelUMM:不支援。

• 授權 — Mage-VL:Apache-2.0,程式碼與權重。PixelUMM:Apache-2.0 程式碼,檢查點採用 NVIDIA One-Way Noncommercial License。

這兩欄的重疊程度不足以進行排名。Mage-VL 報告一個高效編碼器擊敗同規模的競爭對手;PixelUMM 報告一個 15B 模型落在與其周遭專用系統相同的區間,並在其自家論文中直言,由於訓練資料不同,這些結果「無法確立哪種架構更優越」。

實務上的拆分

依工作需求挑選,而不是依分數。如果你要打造即時影片感知——一個監看串流並在事件發生時發表評論的監控器,且以 token 成本為硬性限制——Mage-VL 是兩者中唯一能做到的,它採用 Apache-2.0,而且其 4B 等級規模意味著單一節點就能提供服務。如果你需要一個既能讀取圖像與影片、又能生成它們的模型,PixelUMM 是兩者中唯一能做到的,但它是採用非商業授權的研究產物,其權重是藏在隱藏索引後方的 128 個分散式檢查點分片,而且文字轉影片預設會執行 Cosmos 護欄,閘門還需要獨立的 Python 環境。

對於同時需要這兩種能力的團隊而言,透過單一路由層而非兩個直接整合來取用它們,其理由顯而易見,儘管目前兩者都尚未託管:單一金鑰、供應商定價以 0% 加成原樣傳遞,以及容錯移轉規則,讓你能將新開源的 Apache-2.0 模型置於一部分流量之前,同時由經過驗證的模型承接其餘流量。OrcaRouter 正是為這類問題而打造——而且明確地說,我們目前並未路由 PixelUMM 或 Mage-VL,因此這是對工作流程的描述,而非清單。

什麼能讓它塵埃落定

有兩件事至關重要。第一件事是,由與其毫無利害關係的人獨立重跑 Mage-ViT 的編碼器數值,或 Mage-VL 的影片結果——十週的下載量至今仍未催生出任何一次。第二件事是 PixelUMM 檢查點授權條款的任何變動,而這正是目前區分研究產物與可部署產物的唯一關鍵事實。在上述任一件事發生之前,關於這對組合,你能說的有用說法是:微軟押注於讓視覺介面變得更便宜,而 NVIDIA 押注於將其移除,且這兩項押注都尚未經由下注實驗室以外的任何人評分。