
InternLumina-U2 預覽:一個用於影像、影片與 3D 的 16B 擴散模型 — 權重即將推出
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75程式
- obsidianQwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
2026年9月1日04:03 UTC,上海人工智能實驗室建立了GitHub倉庫{{1}}InternLumina-U2{{/1}}。十三分鐘後,同一機構在Hugging Face上註冊了一個同名倉庫。沒有發布文章、沒有模型卡片、也沒有任何形式的公告——只有{{2}}InternLumina-U2{{/2}}的推理代碼。這是一個16B參數的混合專家模型(1B活躍參數),實驗室稱其為單一模型,透過統一的離散token介面涵蓋影像理解、文字轉影像生成、影像編輯、影片理解與3D理解。代碼真實且公開;模型本身則尚未發布。權重標示為「即將推出」,Hugging Face倉庫只是空佔位頁面,承諾的技術報告也尚未出現。{{3}}儘管9月1日的發布悄無聲息,這仍是目前任何地方所能見到、關於此模型最完整的公開資訊。{{/3}}
如果你第一次聽說 InternLumina-U2,那正是重點所在。這次發布沒有任何事前公告,目前似乎也不存在任何獨立報導——早期訊號的評測文章正是這類模型首次浮現之處,早於發布貼文,有時甚至早於權重檔案。以下所有內容均取自 GitHub 儲存庫、專案頁面,以及該實驗室於 9 月 1 日自行發布的 Hugging Face 佔位頁面;任何超出這些來源的資訊,皆明確標示為推測。
九月一日實際發佈了什麼
GitHub 儲存庫InternLM/InternLumina-U2創建於 2026 年 9 月 1 日,當天便有三筆提交——初始化提交、一筆將模型連結標記為「即將推出」並將基準測試結果標記為「初步結果」的提交,以及一筆導覽修正。該儲存庫以 Apache-2.0 授權,並附有標題為「Intern Lumina U2: A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing」的 README(含英文與中文版本)、完整的推論框架及路線圖。值得一提的是其中一個奇特之處:儲存庫自身的新聞條目標記為「[2026-08]」,但初始化提交與兩個儲存庫時間戳皆是 2026 年 9 月 1 日——請將 9 月初視為實際發布日期,而非 8 月。下方這個儲存庫即為全部公開內容:樹狀結構中可見的每個檔案皆屬發布內容的一部分,除此之外目前別無其他任何內容。

• GitHub — InternLM/InternLumina-U2,於 2026-09-01 建立,採用 Apache-2.0 授權,並提供文字、文字轉圖片、圖片理解、圖片編輯、影片理解與 3D 理解的推論程式碼。
• Hugging Face — internlm/InternLumina-U2,創建於 2026-09-01,目前僅有 .gitattributes 檔案和一個 28 位元組的 README,其內容全部只是 Apache-2.0 授權條款的標頭。沒有權重、沒有設定檔、也沒有 tokenizer 檔案。
• 專案頁面 — internlm.github.io/InternLumina-U2,包含架構圖、初步基準測試表格和佔位示範;技術報告標記為「即將推出」。
推論程式碼以單一驅動腳本組織,每個任務一個區段:純文字生成、最高 1024×1024 的文字轉影像(可設定 CFG 與時間步數)、對自然影像與密集圖表的影像理解、基於指令的影像編輯(可選雙 CFG 模式)、對 64 個取樣幀的影片理解,以及對 GLB/GLTF 資產的 3D 理解——這些資產在分詞前會先透過內建的 Blender 管線渲染成 64 個彩色與深度視圖。任務的廣度正是此模型的整體設計主軸,在深入架構之前值得先停下來思考。
一個模型,六種任務,一套Token詞彙
InternLumina-U2 屬於一個快速發展的研究路線,其核心賭注是語言與視覺應該共享單一的離散 token 介面,而不是分別存在於理解與生成兩套堆疊中。該實驗室先前在此方向上的成果——在 WAIC 2025 上展示的統一離散擴散模型 Lumina-DiMOO——與 LLaDA2.0-Uni、Show-o2 及 MMaDA 一同被列為 InternLumina-U2 所奠基、並宣稱要超越的先驅系統。InternLumina-U2 更具體的賭注是:這些統一模型的瓶頸不在架構,而在視覺詞彙表(visual vocabulary);單一 codebook 限制了單一視覺 token 所能承載的資訊量,而將理解與生成拆分到不同表示上的離散–連續混合模型,則仍迫使模型同時維護兩套堆疊。
InternLumina-U2 的答案是全離散、多碼本建模。視覺端採用 Apple 的 AToken tokenizer,以八個互補碼本描述每個視覺位置——這是為了在不增加序列長度的情況下,保留局部紋理、嵌入文字、幾何形狀與高頻細節。在輸入端,八個碼本各自保留自己的嵌入,八個逐位置嵌入會被拼接並投影為單一骨幹 token。在輸出端,預測在空間上是並行的,但在碼本深度上是自迴歸的:擴散骨幹會並行去噪多個被遮罩的空間位置,接著由多碼本自迴歸頭依序預測每個位置的八個碼。
• 規模 — 總參數 16B、活躍參數 1B(16B-A1B),為稀疏 MoE。
• 語言骨幹 — LLaDA-2.0 MoE 擴散語言模型,其區塊擴散目標透過聯合多任務訓練延伸至視覺任務(廠商描述)。
• 視覺化表示來自 Apple AToken 分詞器的 8 碼本完全離散 token。
• 硬體 — 同時適配 NVIDIA GPU 與華為昇騰 NPU,涵蓋訓練、評估與推論,並達成後端之間的算子級數值對齊。

如果這些宣稱屬實,那麼這在實務上實現的,是多模態領域最古老的夢想:一組權重就能讀取圖像、編輯圖像、根據文字畫出新圖像、回答關於影片的問題,並描述 3D 資產——讓理解與生成透過同一個介面相互強化,而非由專門模型拼接而成。這也是最值得以懷疑眼光看待的說法,因為它是最難實現的一項主張。
數字,雖說如此。
InternLumina-U2 所擁有的每一項基準測試,皆為廠商自行回報、初步且不完整的結果。README 與專案頁面本身就這樣說明:「初步的部分結果。完整的比較表格將於即將發布的技術報告中出現。」由於權重尚未公開,因此不存在任何獨立的評估。請將以下數字視為該實驗室自己的宣稱,而非經認證的分數。
• 圖表/文件理解 — ChartQA 86.52、CharXiv-DQ 83.65(廠商回報)。
• 視覺數學推理——MathVision 33.22、DynaMath 56.37;實驗室表示,它在兩項基準上都勝過僅具理解能力的 InternVL3-8B。
• 幻覺穩健性 — HallusionBench 62.15。
• 影片理解 — VideoMME 51.26、MVBench 59.74、MLVU 57.03(專案頁面)。
• 3D 理解 — 3D MM-Vet 41.8.
• 文生圖 — DPG-Bench 87.10、TIIF-Bench Short/Long 84.60/85.95、GenEval 0.81(項目頁面)。
• 影像編輯ImgEdit 3.83。
比較的故事正是誠實讀者應該放慢腳步的地方。README 聲稱 InternLumina-U2 在細粒度理解與生成基準上超越 InternVL-U、LLaDA2.0-Uni、Show-o2 和 Lumina-DiMOO 等統一模型——但專案頁面自己的表格顯示 InternLumina-U2 在 GenEval 得到 0.81,而 LLaDA2.0-Uni 是 0.89,因此該模型至少在某一項主要生成指標上落後於至少一個競爭對手。從不完整的表格中挑出幾個有利的數字,正是技術報告中「完整比較表格」那段但書想要淡化的事。這些數字只是來自實驗室的方向性信號,僅此而已。
什麼是真實,什麼是承諾
這次釋出的範圍異常明確,而這對任何正在判斷今天能否試用的人來說都很重要。已釋出:推論程式碼。未釋出:權重、訓練程式碼(承諾將在另一個儲存庫提供)、Ascend 訓練與推論技術堆疊,以及技術報告。最終將承載該模型的 Hugging Face 儲存庫目前只是個空殼——下方截圖正是讀者在 README 中點擊「Model (coming soon)」連結後所到達之頁面的全部現有內容。

即使是已釋出的程式碼,目前仍無法產生輸出。推論驅動程式預期會有一個分割好的 Hugging Face checkpoint 目錄,以及位於特定路徑的 AToken tokenizer 權重——但這兩者都不在儲存庫中——因此現今可下載到的,只是一份說明模型將如何運行的規格,而非真正可運行的模型。而當權重檔案真正到位時,自行託管也不會是單純 pip-install 就能完成的工作。該模型使用 block-diffusion generate API,而非標準的 Transformers generate 介面;AToken tokenizer 需要 FlashAttention;程式碼在 import 時就必須有可見的 GPU;主驅動程式是單一程序;3D 管線預期使用 Blender 4.5 進行資產編碼。這是一項真正的部署專案,不是週末實驗——而路由層的存在,正是為了替多數團隊吸收這類摩擦。
當權重落地時,就把它當作那個尚未驗證的模型來看待。
今天沒人能運行 InternLumina-U2,也沒有任何服務商能提供它,因為其權重並未公開存在。這種情況遲早會改變——Apache-2.0 授權,加上該實驗室 2026 年激進開源的一貫路線(ArchSpace「開放一切」的推動、InternVL3.5、Intern-S2 科學模型),都使得權重釋出更像是「很有可能」而非「假設性」。屆時,理性的第一步不是把生產管線押注在一個發布首日、具備不尋常部署需求且零獨立評測的擴散模型上,而是讓它與你已經信任的模型並行運行於測試路徑,並在新模型一出現異常時自動故障轉移至經過驗證的模型。這正是路由層的用途所在:一個 API 涵蓋 200+ 模型,提供商列表價格以 0% 加價直接傳遞,而故障轉移讓「試試新東西」變成一條路由規則,而非一次遷移。OrcaRouter 就是以此方式設定的——說清楚講明白,我們目前不路由 InternLumina-U2,也無法路由,因為權重尚未釋出。本節討論的是權重釋出後的工作流程,並非聲稱該模型現今已在任何地方可用。
接下來要看什麼
四個事件,依可能性粗略排序,會讓 InternLumina-U2 從預覽變成現實。第一,Hugging Face 儲存庫開始填充內容:safetensors 檔案、config、以及 AToken tokenizer 權重出現在那個空殼中,就是模型真正存在的時刻。第二,技術報告,這份報告理應載明完整比較表,把上述廠商提供的部分數據變成可查證的內容。第三,訓練程式碼儲存庫與 Ascend 技術堆疊,這對任何想在非 NVIDIA 硬體上微調或執行此模型的人都很重要。第四,第一次獨立評測——例如 arena Elo、重現 ChartQA 或 GenEval 的執行——能在沒有實驗室自身選擇偏差的情況下,檢驗「一個模型、六項工作」的承諾。程式碼在 9 月 1 日公開,代表架構已經可以得知;權重缺席,則代表關於實際品質的一切仍是宣稱。觀察模型儲存庫,而不是公告訊息流——有趣的公開部分已經出來了,而模型本身大概也不遠了。
