
PixelUMM vs InternLumina-U2:兩款無編碼器 Beta 版,以及唯一決定勝負的差異
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
兩個模型,同樣公開,同樣設計異常,而其中只有一個能讓你據以打造產品。PixelUMM是 NVIDIA 的無編碼器統一模型——以 Qwen3-8B 為主幹的 152 億參數模型,透過 16×16 區塊與 4 幀 tubelet 直接讀寫原始像素,整個堆疊中既沒有 VAE,也沒有任何視覺編碼器。InternLumina-U2則是上海人工智慧實驗室的 16B 混合專家擴散模型,它透過一個名為 AToken 的符元化器,把每一筆視覺輸入壓縮成八個互補的離散碼。兩者都押注視覺介面才是瓶頸。但更關鍵的那個賭注,藏在授權檔案裡:InternLumina-U2 以 Apache-2.0 釋出權重,PixelUMM 釋出的檢查點則採用非商業授權。如果你是要在兩者之間挑一個用於任何商業用途,那句話就是全部的比較,而本頁其餘內容都只是它的背景脈絡。
下方兩組數據都來自實驗室本身。這兩個模型都沒有獨立評估、競技場 Elo,也沒有第三方重現。兩者都沒有由任何託管 API 提供服務。不同之處在於,你下載該產物後獲准用它做什麼,以及每個發布版本實際上進展到什麼程度。
目前各自的情況
那兩個發布時程以不同的速度推進,而且都是悄無聲息地。
• PixelUMM — GitHub 儲存庫建立於 2026 年 9 月 4 日;arXiv 預印本 2609.38597 日期為 2026 年 9 月 29 日;Hugging Face 模型儲存庫建立於 2026 年 10 月 1 日 21:40 UTC。針對它,並未出現任何 NVIDIA 的部落格文章、新聞稿或發布貼文串。
• InternLumina-U2 — GitHub 儲存庫建立於 2026 年 9 月 1 日;Hugging Face 存根於同日註冊;Ascend 訓練的檢查點權重於 2026 年 9 月 10 日新增;NVIDIA/CUDA 檢查點權重於 2026 年 9 月 24 日新增。每個堆疊有七個分片,兩者今日皆可下載。
九月初還存在的那個 InternLumina-U2——只有程式碼、權重「即將推出」、一個空蕩蕩的模型儲存庫——並不是如今存在的 InternLumina-U2。任何在本月初讀到相關資訊便斷定權重缺失的人,都應該重新查看;Huawei Ascend 與 NVIDIA/CUDA 的檢查點都已上線,採用 Apache-2.0 授權,並附有 tokenizer、config、聊天範本與遠端建模程式碼。

同一個問題的兩個答案
這兩個模型都始於同一個抱怨:為了理解而搭載視覺編碼器,以及為了生成而搭載 VAE,這意味著每張影像都要表示兩次,大致使視覺上下文加倍,並迫使訓練流程維護兩套介面。
PixelUMM 的答案是兩者都刪掉。原始像素透過單層線性投影直接輸入——每個影像位置一個 16×16 patch,每個視訊位置一個 4 幀 tubelet——而骨幹是一個僅解碼器的 Transformer,其 Mixture-of-Transformers 設計將共享注意力與任務專屬參數配對。文字以自迴歸方式預測;像素則以流匹配預測。論文用了八個章節探討設計研究——patch 大小、patch 假影、像素空間與 VAE 空間的動態、運算擴展——這告訴你,團隊真正的問題是這個範式到底是否成立。
InternLumina-U2 的答案,是保留離散介面,但讓每個 token 承載遠更多資訊。AToken 分詞器以八組互補的碼本描述每一個視覺位置,涵蓋紋理、內嵌文字與幾何;這八個嵌入會按位置串接,並投影成單一主幹 token。解碼則反向進行,透過空間上平行的去噪,以及一個多碼本自迴歸頭,依序預測這八個碼。主幹是屬於 LLaDA-2.0 血統的稀疏擴散 LLM,總參數 16B,其中 1B 為活躍參數。
• 視覺介面 — PixelUMM:原始像素區塊與 tubelet,完全沒有 tokenizer。InternLumina-U2:來自 AToken 的八碼簿全離散 token,沒有連續潛在表徵。
• 主幹 — PixelUMM:Qwen3-8B(總計 15.2B),單一稠密解碼器,具備理解與生成專家。InternLumina-U2:總計 16B/啟用 1B 的稀疏 MoE 擴散語言模型。
• 生成方法 — PixelUMM:像素空間流匹配加上自迴歸文字。InternLumina-U2:對離散碼進行遮罩式擴散去噪。
• 宣稱的任務 — PixelUMM:文字轉圖像、文字轉影片、圖像轉文字、影片轉文字。InternLumina-U2:前述功能再加上圖像編輯與 3D 理解。
• 權重格式 — PixelUMM:128 個 .distcp 分片(約 30 GB),位於隱藏的 .metadata 索引之後。InternLumina-U2:七個 .safetensors 分片(每個硬體堆疊),標準 Hugging Face 佈局。

計分板,附有其來源出處
請把每一列都視為該實驗室自身的說法。PixelUMM 的數據來自其預印本;InternLumina-U2 的數據則是該實驗室自己將其描述為「初步、部分」,完整的比較表則延後至一份尚未問世的技術報告。
• MMMU(圖像推理) — PixelUMM 41.67(作者自行報告)。InternLumina-U2:未報告。
• ChartQA — PixelUMM 82.96。InternLumina-U2 86.52。
• DocVQA — PixelUMM 90.42。InternLumina-U2:未報告。
• Video-MME(無字幕) — PixelUMM 57.33。InternLumina-U2 51.26。
• MVBench — PixelUMM 70.53。InternLumina-U2 59.74。
• GenEval 整體 — 搭配 LLM 提示改寫器時,PixelUMM 為 0.83;未使用時為 0.77。InternLumina-U2 為 0.81。
• DPG-Bench 整體 — PixelUMM 85.74。InternLumina-U2 87.10。
• 影片生成 — PixelUMM VBench 第 1 部分品質 84.10/語意 79.80,第 2 部分總計 83.24。InternLumina-U2:未回報。
• 3D 理解 — PixelUMM:無此任務。InternLumina-U2 回報 3D MM-Vet 41.8。
這項比較並不對等,因為兩個實驗室發布的是不同的表格,而不是因為其中一方勝出。PixelUMM 有完整的影片生成部分,但沒有編輯或 3D;InternLumina-U2 聲稱涵蓋六個任務家族,並報告了橫跨這些任務的部分表格。同一個基準名稱下的跨實驗室數字並不是同一種測量——分割、提示與取樣方式各不相同——因此把 ChartQA 和 GenEval 這兩列視為大致持平,然後就此打住。
授權就是讓這不再打成平手的地方。
這是任何基準測試表都不會顯示的部分。PixelUMM 儲存庫採用 Apache-2.0,而模型卡也醒目地如此載明。檢查點是另一個獨立產物,依 NVIDIA One-Way Noncommercial License 授權,僅限於非商業研究或評估,且其中一個原始碼檔案還額外保留了承襲自 DiT 的 CC BY-NC 4.0 聲明。研究用途:沒問題。內部產品功能:得跟法務談一談,而且可能很快就結束。
InternLumina-U2 從頭到尾都是 Apache-2.0,程式碼與兩個檢查點皆然,沒有另外的非商業例外條款。對一個需要交付產品的團隊來說,這不是微不足道的優勢——這就是整個決策的關鍵。這兩個模型在成熟度上都屬於研究級。其中只有一個在使用上不受限制。
實際上該試哪一個,以及該怎麼做
如果你的工作是影片理解,或者你想要一個能從同一組權重生成影片與影像的模型,PixelUMM 是更完整的成品,其論文也更值得一讀——但它是採用非商業授權的研究專案,因此適合放在評估測試台上,而不是放進正式流程中。如果你的工作是圖表、文件與影像生成的廣度,或者你需要編輯與 3D,InternLumina-U2 涵蓋的範圍更廣,且沒有授權上限;其代價是 16B-A1B 擴散主幹與 AToken 分詞器意味著得做真正的服務工程,而且它公布的數字明確只是部分結果。
截至本文撰寫之際,這兩者都還未登上任何代管 API,OrcaRouter 亦然——我們兩個模型都不轉送。等到情況改變時,主張透過路由層、而非直接整合來取用它們的理由,就跟適用於任何新開放模型的說法如出一轍:一組金鑰橫跨 200 多個模型、供應商定價以 0% 加成原封不動轉嫁,加上自動容錯移轉,讓某個結果證明不如供應商表列規格所暗示的模型,只要改動一條路由就能降級,而不必重寫整套部署。在那之前,誠實的建議就是那句老掉牙的話——下載任何授權條款符合你使用情境的版本,用自己的資料跑自己的評測,而且在實驗室以外有人重跑過那些數字之前,別以任何一方實驗室的數字來做規劃。
什麼會改變答案?
三件事,按影響程度排序。PixelUMM 檢查點上的商業授權會讓這項比較真正接近,並使它從「讀論文」推進到「評估權重」。一份來自 Shanghai AI Laboratory、附有完整比較表的技術報告,會把 InternLumina-U2 的部分數字變成可查核的內容,也會揭示六項任務的廣度中,有多少是表現持平,多少是 token 深度上的表現。而任一模型的首度獨立複現——由與結果無利害關係的團隊重跑 GenEval 或 MVBench——就是這兩者之中任何一個不再只是廠商表格的時刻。在那之前,一個是你只能研究的特殊架構,另一個則是你可以直接出貨的特殊架構。
