為 InternLumina-U2 生成的英雄標題卡,帶有 PREVIEW 藥丸徽章、標題「InternLumina-U2」、副標題「One 16B diffusion model for image, video and 3D」、標語提及上海人工智能實驗室、多碼本擴散 LLM、程式碼於 2026-09-01 發布且權重即將推出,以及 Image、Video 和 3D 的標籤;右側有抽象藍、青和琥珀色的 Understand-Generate-Edit 形狀,右下角有 OrcaRouter 標誌。
Guides & Insights

InternLumina-U2 預覽:一個用於影像、影片與 3D 的 16B 擴散模型 — 權重即將推出

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年9月1日04:03 UTC,上海人工智能實驗室建立了GitHub倉庫{{1}}InternLumina-U2{{/1}}。十三分鐘後,同一機構在Hugging Face上註冊了一個同名倉庫。沒有發布文章、沒有模型卡片、也沒有任何形式的公告——只有{{2}}InternLumina-U2{{/2}}的推理代碼。這是一個16B參數的混合專家模型(1B活躍參數),實驗室稱其為單一模型,透過統一的離散token介面涵蓋影像理解、文字轉影像生成、影像編輯、影片理解與3D理解。代碼真實且公開;模型本身則尚未發布。權重標示為「即將推出」,Hugging Face倉庫只是空佔位頁面,承諾的技術報告也尚未出現。{{3}}儘管9月1日的發布悄無聲息,這仍是目前任何地方所能見到、關於此模型最完整的公開資訊。{{/3}}

如果你第一次聽說 InternLumina-U2,那正是重點所在。這次發布沒有任何事前公告,目前似乎也不存在任何獨立報導——早期訊號的評測文章正是這類模型首次浮現之處,早於發布貼文,有時甚至早於權重檔案。以下所有內容均取自 GitHub 儲存庫、專案頁面,以及該實驗室於 9 月 1 日自行發布的 Hugging Face 佔位頁面;任何超出這些來源的資訊,皆明確標示為推測。

九月一日實際發佈了什麼

GitHub 儲存庫InternLM/InternLumina-U2創建於 2026 年 9 月 1 日,當天便有三筆提交——初始化提交、一筆將模型連結標記為「即將推出」並將基準測試結果標記為「初步結果」的提交,以及一筆導覽修正。該儲存庫以 Apache-2.0 授權,並附有標題為「Intern Lumina U2: A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing」的 README(含英文與中文版本)、完整的推論框架及路線圖。值得一提的是其中一個奇特之處:儲存庫自身的新聞條目標記為「[2026-08]」,但初始化提交與兩個儲存庫時間戳皆是 2026 年 9 月 1 日——請將 9 月初視為實際發布日期,而非 8 月。下方這個儲存庫即為全部公開內容:樹狀結構中可見的每個檔案皆屬發布內容的一部分,除此之外目前別無其他任何內容。

A screenshot of the GitHub repository InternLM/InternLumina-U2 captured September 2, 2026, showing the repo description 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', an Apache-2.0 license, 4 stars, commits dated 'yesterday' including 'init repo', and the file tree with the inference entrypoints infer_1024_sft.sh, infer_t2i_sft.py, infer_mmu_sft.py, infer_video_sft.py and infer_3d_sft.py.

GitHub — InternLM/InternLumina-U2,於 2026-09-01 建立,採用 Apache-2.0 授權,並提供文字、文字轉圖片、圖片理解、圖片編輯、影片理解與 3D 理解的推論程式碼。

Hugging Face — internlm/InternLumina-U2,創建於 2026-09-01,目前僅有 .gitattributes 檔案和一個 28 位元組的 README,其內容全部只是 Apache-2.0 授權條款的標頭。沒有權重、沒有設定檔、也沒有 tokenizer 檔案。

專案頁面 — internlm.github.io/InternLumina-U2,包含架構圖、初步基準測試表格和佔位示範;技術報告標記為「即將推出」。

推論程式碼以單一驅動腳本組織,每個任務一個區段:純文字生成、最高 1024×1024 的文字轉影像(可設定 CFG 與時間步數)、對自然影像與密集圖表的影像理解、基於指令的影像編輯(可選雙 CFG 模式)、對 64 個取樣幀的影片理解,以及對 GLB/GLTF 資產的 3D 理解——這些資產在分詞前會先透過內建的 Blender 管線渲染成 64 個彩色與深度視圖。任務的廣度正是此模型的整體設計主軸,在深入架構之前值得先停下來思考。

一個模型,六種任務,一套Token詞彙

InternLumina-U2 屬於一個快速發展的研究路線,其核心賭注是語言與視覺應該共享單一的離散 token 介面,而不是分別存在於理解與生成兩套堆疊中。該實驗室先前在此方向上的成果——在 WAIC 2025 上展示的統一離散擴散模型 Lumina-DiMOO——與 LLaDA2.0-Uni、Show-o2 及 MMaDA 一同被列為 InternLumina-U2 所奠基、並宣稱要超越的先驅系統。InternLumina-U2 更具體的賭注是:這些統一模型的瓶頸不在架構,而在視覺詞彙表(visual vocabulary);單一 codebook 限制了單一視覺 token 所能承載的資訊量,而將理解與生成拆分到不同表示上的離散–連續混合模型,則仍迫使模型同時維護兩套堆疊。

InternLumina-U2 的答案是全離散、多碼本建模。視覺端採用 Apple 的 AToken tokenizer,以八個互補碼本描述每個視覺位置——這是為了在不增加序列長度的情況下,保留局部紋理、嵌入文字、幾何形狀與高頻細節。在輸入端,八個碼本各自保留自己的嵌入,八個逐位置嵌入會被拼接並投影為單一骨幹 token。在輸出端,預測在空間上是並行的,但在碼本深度上是自迴歸的:擴散骨幹會並行去噪多個被遮罩的空間位置,接著由多碼本自迴歸頭依序預測每個位置的八個碼。

規模 — 總參數 16B、活躍參數 1B(16B-A1B),為稀疏 MoE。

語言骨幹 — LLaDA-2.0 MoE 擴散語言模型,其區塊擴散目標透過聯合多任務訓練延伸至視覺任務(廠商描述)。

視覺化表示來自 Apple AToken 分詞器的 8 碼本完全離散 token。

硬體 — 同時適配 NVIDIA GPU 與華為昇騰 NPU,涵蓋訓練、評估與推論,並達成後端之間的算子級數值對齊。

A generated single-column state-of-play scoreboard titled 'InternLumina-U2 — the state of play' listing: Size 16B MoE, 1B active; Modalities image, video, 3D + T2I + editing; Visual tokens 8-codebook discrete (AToken); Backbone LLaDA-2.0 MoE diffusion LLM; Weights not released yet; Released code and page 2026-09-01, with a footer reading 'All details vendor-reported; no independent scores yet' and the OrcaRouter logo in the bottom-right corner.

如果這些宣稱屬實,那麼這在實務上實現的,是多模態領域最古老的夢想:一組權重就能讀取圖像、編輯圖像、根據文字畫出新圖像、回答關於影片的問題,並描述 3D 資產——讓理解與生成透過同一個介面相互強化,而非由專門模型拼接而成。這也是最值得以懷疑眼光看待的說法,因為它是最難實現的一項主張。

數字,雖說如此。

InternLumina-U2 所擁有的每一項基準測試,皆為廠商自行回報、初步且不完整的結果。README 與專案頁面本身就這樣說明:「初步的部分結果。完整的比較表格將於即將發布的技術報告中出現。」由於權重尚未公開,因此不存在任何獨立的評估。請將以下數字視為該實驗室自己的宣稱,而非經認證的分數。

圖表/文件理解 — ChartQA 86.52、CharXiv-DQ 83.65(廠商回報)。

視覺數學推理——MathVision 33.22、DynaMath 56.37;實驗室表示,它在兩項基準上都勝過僅具理解能力的 InternVL3-8B。

幻覺穩健性 — HallusionBench 62.15。

影片理解 — VideoMME 51.26、MVBench 59.74、MLVU 57.03(專案頁面)。

3D 理解 — 3D MM-Vet 41.8.

文生圖 — DPG-Bench 87.10、TIIF-Bench Short/Long 84.60/85.95、GenEval 0.81(項目頁面)。

影像編輯ImgEdit 3.83。

比較的故事正是誠實讀者應該放慢腳步的地方。README 聲稱 InternLumina-U2 在細粒度理解與生成基準上超越 InternVL-U、LLaDA2.0-Uni、Show-o2 和 Lumina-DiMOO 等統一模型——但專案頁面自己的表格顯示 InternLumina-U2 在 GenEval 得到 0.81,而 LLaDA2.0-Uni 是 0.89,因此該模型至少在某一項主要生成指標上落後於至少一個競爭對手。從不完整的表格中挑出幾個有利的數字,正是技術報告中「完整比較表格」那段但書想要淡化的事。這些數字只是來自實驗室的方向性信號,僅此而已。

什麼是真實,什麼是承諾

這次釋出的範圍異常明確,而這對任何正在判斷今天能否試用的人來說都很重要。已釋出:推論程式碼。未釋出:權重、訓練程式碼(承諾將在另一個儲存庫提供)、Ascend 訓練與推論技術堆疊,以及技術報告。最終將承載該模型的 Hugging Face 儲存庫目前只是個空殼——下方截圖正是讀者在 README 中點擊「Model (coming soon)」連結後所到達之頁面的全部現有內容。

A screenshot of the Hugging Face model page internlm/InternLumina-U2 captured September 2, 2026, showing the empty placeholder: the model name under the internlm organisation, a License badge reading apache-2.0, the notice 'README.md exists but content is empty', 'Downloads are not tracked for this model', and no inference provider yet serving the model.

即使是已釋出的程式碼,目前仍無法產生輸出。推論驅動程式預期會有一個分割好的 Hugging Face checkpoint 目錄,以及位於特定路徑的 AToken tokenizer 權重——但這兩者都不在儲存庫中——因此現今可下載到的,只是一份說明模型將如何運行的規格,而非真正可運行的模型。而當權重檔案真正到位時,自行託管也不會是單純 pip-install 就能完成的工作。該模型使用 block-diffusion generate API,而非標準的 Transformers generate 介面;AToken tokenizer 需要 FlashAttention;程式碼在 import 時就必須有可見的 GPU;主驅動程式是單一程序;3D 管線預期使用 Blender 4.5 進行資產編碼。這是一項真正的部署專案,不是週末實驗——而路由層的存在,正是為了替多數團隊吸收這類摩擦。

當權重落地時,就把它當作那個尚未驗證的模型來看待。

今天沒人能運行 InternLumina-U2,也沒有任何服務商能提供它,因為其權重並未公開存在。這種情況遲早會改變——Apache-2.0 授權,加上該實驗室 2026 年激進開源的一貫路線(ArchSpace「開放一切」的推動、InternVL3.5、Intern-S2 科學模型),都使得權重釋出更像是「很有可能」而非「假設性」。屆時,理性的第一步不是把生產管線押注在一個發布首日、具備不尋常部署需求且零獨立評測的擴散模型上,而是讓它與你已經信任的模型並行運行於測試路徑,並在新模型一出現異常時自動故障轉移至經過驗證的模型。這正是路由層的用途所在:一個 API 涵蓋 200+ 模型,提供商列表價格以 0% 加價直接傳遞,而故障轉移讓「試試新東西」變成一條路由規則,而非一次遷移。OrcaRouter 就是以此方式設定的——說清楚講明白,我們目前不路由 InternLumina-U2,也無法路由,因為權重尚未釋出。本節討論的是權重釋出後的工作流程,並非聲稱該模型現今已在任何地方可用。

接下來要看什麼

四個事件,依可能性粗略排序,會讓 InternLumina-U2 從預覽變成現實。第一,Hugging Face 儲存庫開始填充內容:safetensors 檔案、config、以及 AToken tokenizer 權重出現在那個空殼中,就是模型真正存在的時刻。第二,技術報告,這份報告理應載明完整比較表,把上述廠商提供的部分數據變成可查證的內容。第三,訓練程式碼儲存庫與 Ascend 技術堆疊,這對任何想在非 NVIDIA 硬體上微調或執行此模型的人都很重要。第四,第一次獨立評測——例如 arena Elo、重現 ChartQA 或 GenEval 的執行——能在沒有實驗室自身選擇偏差的情況下,檢驗「一個模型、六項工作」的承諾。程式碼在 9 月 1 日公開,代表架構已經可以得知;權重缺席,則代表關於實際品質的一切仍是宣稱。觀察模型儲存庫,而不是公告訊息流——有趣的公開部分已經出來了,而模型本身大概也不遠了。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube