为 InternLumina-U2 生成的主视觉标题卡:带有一个“预览”(PREVIEW)胶囊徽章;标题为“InternLumina-U2”;副标题为“一个面向图像、视频和 3D 的 16B 扩散模型”;另有标语注明上海人工智能实验室、多码本扩散 LLM、代码已于 2026-09-01 发布、权重即将推出;配有图像、视频和 3D 标签;右侧为抽象的蓝、青、琥珀色“理解—生成—编辑”图形;右下角为 OrcaRouter 徽标。
Guides & Insights

InternLumina-U2 预览版:面向图像、视频和 3D 的统一 16B 扩散模型 — 权重即将发布

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年9月1日04:03 UTC,上海人工智能实验室创建了GitHub仓库InternLumina-U2。十三分钟后,同一机构在Hugging Face上注册了一个同名仓库。没有发布文章,没有模型卡,也没有任何形式的公告——只有InternLumina-U2的推理代码。这是一个160亿参数的混合专家模型(激活参数10亿),实验室称其为一个通过统一离散令牌接口覆盖图像理解、文生图、图像编辑、视频理解和3D理解的单一模型。代码真实且公开;模型本身尚未发布。权重标记为“即将推出”,Hugging Face仓库是空的占位符,承诺的技术报告也未出现。尽管9月1日的发布悄无声息,但它仍然是目前关于该模型最完整的公开信息。

如果你第一次听说InternLumina-U2,这正是关键所在。这次发布没有任何预告,目前也似乎不存在任何独立报道——这类模型正会最先出现在早期信号类评测文章中,先于发布公告,有时甚至先于权重开放。下文所有内容均来自GitHub仓库、项目主页,以及该实验室于9月1日自行发布的Hugging Face占位页面;超出这些来源的任何信息,都会明确标注为推断。

9月1日实际发布了什么

GitHub 仓库 InternLM/InternLumina-U2于 2026 年 9 月 1 日创建,当天共有三次提交——初始化提交、一次将模型链接标记为“coming soon”并将基准测试结果标记为“preliminary”的提交,以及一次导航修复。仓库采用 Apache-2.0 许可证,包含一份标题为“Intern Lumina U2: A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing”的 README(英文版和中文版各一份)、完整的推理工具链以及路线图。值得一提的是一个细节:仓库自身的新闻条目标注的日期为“[2026-08]”,但初始化提交和仓库的两处时间戳均显示为 2026 年 9 月 1 日——实际发布日期应按 9 月初计算,而非 8 月。下方展示的仓库即为全部公开发布内容:目录树中可见的每个文件都属于此次发布的一部分,除此之外目前不存在任何其他内容。

A screenshot of the GitHub repository InternLM/InternLumina-U2 captured September 2, 2026, showing the repo description 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', an Apache-2.0 license, 4 stars, commits dated 'yesterday' including 'init repo', and the file tree with the inference entrypoints infer_1024_sft.sh, infer_t2i_sft.py, infer_mmu_sft.py, infer_video_sft.py and infer_3d_sft.py.

GitHub — InternLM/InternLumina-U2,创建于 2026-09-01,遵循 Apache-2.0 许可,包含文本、文生图、图像理解、图像编辑、视频理解及 3D 理解的推理代码。

Hugging Face——internlm/InternLumina-U2,创建于2026-09-01,目前仅包含一个.gitattributes文件和一个28字节的README,其全部内容为Apache-2.0许可证头。没有权重文件、配置文件或分词器文件。

项目主页—— internlm.github.io/InternLumina-U2,包含架构图、初步基准测试表和占位演示;技术报告标注为“即将推出”。

推理代码由单个驱动程序脚本组织而成,每个任务对应一个独立部分:纯文本生成;最高 1024×1024 的文本到图像生成,支持可配置的 CFG 与时间步数;面向自然图像和密集图表的图像理解;基于指令的图像编辑,支持可选的双 CFG 模式;对 64 个采样帧的视频理解;以及对 GLB/GLTF 资产的 3D 理解——这些资产会先经捆绑的 Blender 管线渲染为 64 个彩色与深度视图,再进入分词环节。如此广泛的任务覆盖正是该模型的核心设计理念,在深入架构之前,值得先对此稍作驻足。

一个模型,六项任务,统一的词元词汇表

InternLumina-U2 属于一个推进迅速的研究方向,其押注在于:语言与视觉应当共享同一个离散词元接口,而不是分别栖身于独立的理解栈与生成栈中。该实验室此前在这一方向上的工作——在 WAIC 2025 上展示的统一离散扩散模型 Lumina-DiMOO——与 LLaDA2.0-Uni、Show-o2 和 MMaDA 一道,被视为 InternLumina-U2 所依托并宣称要超越的开创性系统。InternLumina-U2 更具体的押注是:这类统一模型的瓶颈不在架构,而在视觉词表——单一码本为单个视觉词元所能携带的信息量设定了上限;而将理解与生成拆分到不同表示之上的离散—连续混合方案,到头来仍然会迫使模型维护两套栈。

InternLumina-U2 的答案是完全离散的多码本建模。视觉侧采用 Apple 的 AToken 分词器,用八个互补的码本描述每个视觉位置——目的是在不增加序列长度的前提下保留局部纹理、嵌入文本、几何结构和高频细节。在输入侧,八个码本各自保留自己的嵌入,八个逐位置嵌入被拼接并投影为单个 backbone token。在输出侧,预测在空间上是并行的,但在码本深度上是自回归的:扩散主干并行去噪多个被掩蔽的空间位置,随后多码本自回归头按顺序预测每个位置的八个码。

规模——16B总参数,1B激活(16B-A1B),一种稀疏MoE。

语言主干——LLaDA-2.0 MoE 扩散语言模型,通过联合多任务训练将块扩散目标扩展到视觉任务(供应商描述)。

视觉表示 — 来自 Apple 的 AToken 分词器的 8 码本全离散令牌。

硬件:同时适配 NVIDIA GPU 与 Huawei Ascend NPU,覆盖训练、评估与推理,并在不同后端之间实现算子级数值对齐。

A generated single-column state-of-play scoreboard titled 'InternLumina-U2 — the state of play' listing: Size 16B MoE, 1B active; Modalities image, video, 3D + T2I + editing; Visual tokens 8-codebook discrete (AToken); Backbone LLaDA-2.0 MoE diffusion LLM; Weights not released yet; Released code and page 2026-09-01, with a footer reading 'All details vendor-reported; no independent scores yet' and the OrcaRouter logo in the bottom-right corner.

如果这些说法成立,它在实践中带来的,是多模态领域最古老的梦想:一组权重,既能读取图像、编辑图像,也能根据文字绘制新图像,还能回答关于视频的问题,并描述3D资产——理解与生成通过同一界面相互强化,而非由多个专用模型拼凑而成。这也是最值得用怀疑眼光审视的说法,因为它是实现难度最高的一个。

这些数字,也就这样了。

InternLumina-U2 的每一个基准测试结果都是由供应商报告的,且是初步且不完整的。README 和项目页面本身也如此说明:“初步的部分结果。完整的对比表将在即将发布的技术报告中出现。”由于权重未公开,不存在独立评估。请将下方数据视为实验室自身的声明,而非经过验证的分数。

图表/文档理解:ChartQA 86.52、CharXiv-DQ 83.65(厂商报告)。

视觉数学推理—MathVision 33.22、DynaMath 56.37;实验室称其在这两项上均优于仅具备理解能力的 InternVL3-8B。

幻觉鲁棒性 — HallusionBench 62.15。

视频理解VideoMME 51.26、MVBench 59.74、MLVU 57.03(项目页面)。

3D 理解 — 3D MM-Vet 41.8。

文生图 — DPG-Bench 87.10,TIIF-Bench Short/Long 84.60/85.95,GenEval 0.81(项目主页)。

图像编辑 — ImgEdit 3.83.

对比叙事是诚实的读者应当慢下来细看的地方。README 声称 InternLumina-U2 在细粒度理解与生成基准上超越了 InternVL-U、LLaDA2.0-Uni、Show-o2 和 Lumina-DiMOO 等统一模型——但项目页面自带的表格显示,InternLumina-U2 在 GenEval 上为 0.81,而 LLaDA2.0-Uni 为 0.89,可见该模型至少在某一项核心生成指标上落后于至少一个竞争对手。从不完整的表格里挑出几个有利的数字,正是“完整对比表格请见技术报告”这个附注想要缓和的问题。这些数字只是实验室给出的方向性信号,仅此而已。

什么是现实,什么又是承诺

此次发布的范围异常明确,而对于任何正在决定今天能否试用的人来说,这一点都很关键。已发布:推理代码。未发布:权重、训练代码(承诺将放在独立仓库中)、Ascend 训练与推理技术栈,以及技术报告。最终将承载该模型的 Hugging Face 仓库目前仍是一个占位页——下图展示的是读者点击 README 中 “Model (coming soon)” 链接后所到达页面的全部当前内容。

A screenshot of the Hugging Face model page internlm/InternLumina-U2 captured September 2, 2026, showing the empty placeholder: the model name under the internlm organisation, a License badge reading apache-2.0, the notice 'README.md exists but content is empty', 'Downloads are not tracked for this model', and no inference provider yet serving the model.

即便是已发布的代码,目前也无法产生输出。推理驱动程序期望在特定路径下找到切分后的 Hugging Face checkpoint 目录以及 AToken tokenizer 权重——而这两者都不在代码仓库中——因此,如今可下载到的只是模型运行方式的规范说明,而非一个可运行的模型。等到权重真正落地,自托管也绝非一次常规的 pip install 就能完成。该模型使用的是 block-diffusion generate API,而非标准的 Transformers generate 接口;AToken tokenizer 需要 FlashAttention;代码在 import 时需要可见的 GPU;根驱动程序是单进程的;3D 管线在资产编码时还需要 Blender 4.5。这是一个真正的部署工程,而不是周末随手可做的实验——而这正是路由层存在的意义:为大多数团队吸收这类摩擦。

当权重落地时,把它当作它本来的样子——一个尚未经过验证的模型。

今天没有人能运行InternLumina-U2,也没有任何服务商能提供它,因为权重并未公开存在。这种情况在某个时间点会改变——Apache-2.0许可,加上该实验室2026年积极开源的模式(ArchSpace“开放一切”的推动、InternVL3.5、Intern-S2科学模型),都使得权重发布更可能是必然而非假设。当这一切发生时,理性的第一步不是把生产管线押注在一个首日发布的、具有特殊服务要求且零独立评估的扩散模型上。而是将它与你已经信任的模型并排运行,放在测试路径上,一旦新模型出现异常,就自动故障转移到经过验证的模型上。这正是路由层所要承担的用例:一个API接入200多个模型,提供商列表价格以0%加价直接透传,而故障转移则把“试试新东西”变成一条路由规则,而非一次迁移。OrcaRouter正是这样配置的——需要说明的是,我们并不路由InternLumina-U2,也无法路由,因为权重尚未发布。这一节讨论的是当权重发布时应采用的工作流,而不是声称该模型如今已在任何地方可用。

接下来看什么

按大致可能性排序,有四个事件会让 InternLumina-U2 从预览变为现实。第一,Hugging Face 仓库开始填充内容:safetensors 文件、配置文件以及 AToken 分词器权重出现在那个占位仓库中,就是模型真正存在的时刻。第二,技术报告,它应当包含完整的对比表格,把上面零散的厂商数据变成可核查的内容。第三,训练代码仓库和 Ascend 技术栈,这对任何想在非 NVIDIA 硬件上微调或运行该模型的人都很重要。第四,第一次独立评估——一场竞技场 Elo、一次复现的 ChartQA 或 GenEval 运行——在不依赖实验室自身选择偏差的情况下检验"一个模型,六项任务"的承诺。代码已于 9 月 1 日公开,这意味着架构已经可知;权重缺失则意味着关于实际质量的一切说法仍然只是声明。关注模型仓库而非公告动态——有趣的部分已经公开,模型本身很可能也很快就会到来。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube