
InternLumina-U2 预览版:面向图像、视频和 3D 的统一 16B 扩散模型 — 权重即将发布
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
2026年9月1日04:03 UTC,上海人工智能实验室创建了GitHub仓库InternLumina-U2。十三分钟后,同一机构在Hugging Face上注册了一个同名仓库。没有发布文章,没有模型卡,也没有任何形式的公告——只有InternLumina-U2的推理代码。这是一个160亿参数的混合专家模型(激活参数10亿),实验室称其为一个通过统一离散令牌接口覆盖图像理解、文生图、图像编辑、视频理解和3D理解的单一模型。代码真实且公开;模型本身尚未发布。权重标记为“即将推出”,Hugging Face仓库是空的占位符,承诺的技术报告也未出现。尽管9月1日的发布悄无声息,但它仍然是目前关于该模型最完整的公开信息。
如果你第一次听说InternLumina-U2,这正是关键所在。这次发布没有任何预告,目前也似乎不存在任何独立报道——这类模型正会最先出现在早期信号类评测文章中,先于发布公告,有时甚至先于权重开放。下文所有内容均来自GitHub仓库、项目主页,以及该实验室于9月1日自行发布的Hugging Face占位页面;超出这些来源的任何信息,都会明确标注为推断。
9月1日实际发布了什么
GitHub 仓库 InternLM/InternLumina-U2于 2026 年 9 月 1 日创建,当天共有三次提交——初始化提交、一次将模型链接标记为“coming soon”并将基准测试结果标记为“preliminary”的提交,以及一次导航修复。仓库采用 Apache-2.0 许可证,包含一份标题为“Intern Lumina U2: A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing”的 README(英文版和中文版各一份)、完整的推理工具链以及路线图。值得一提的是一个细节:仓库自身的新闻条目标注的日期为“[2026-08]”,但初始化提交和仓库的两处时间戳均显示为 2026 年 9 月 1 日——实际发布日期应按 9 月初计算,而非 8 月。下方展示的仓库即为全部公开发布内容:目录树中可见的每个文件都属于此次发布的一部分,除此之外目前不存在任何其他内容。

• GitHub — InternLM/InternLumina-U2,创建于 2026-09-01,遵循 Apache-2.0 许可,包含文本、文生图、图像理解、图像编辑、视频理解及 3D 理解的推理代码。
• Hugging Face——internlm/InternLumina-U2,创建于2026-09-01,目前仅包含一个.gitattributes文件和一个28字节的README,其全部内容为Apache-2.0许可证头。没有权重文件、配置文件或分词器文件。
• 项目主页—— internlm.github.io/InternLumina-U2,包含架构图、初步基准测试表和占位演示;技术报告标注为“即将推出”。
推理代码由单个驱动程序脚本组织而成,每个任务对应一个独立部分:纯文本生成;最高 1024×1024 的文本到图像生成,支持可配置的 CFG 与时间步数;面向自然图像和密集图表的图像理解;基于指令的图像编辑,支持可选的双 CFG 模式;对 64 个采样帧的视频理解;以及对 GLB/GLTF 资产的 3D 理解——这些资产会先经捆绑的 Blender 管线渲染为 64 个彩色与深度视图,再进入分词环节。如此广泛的任务覆盖正是该模型的核心设计理念,在深入架构之前,值得先对此稍作驻足。
一个模型,六项任务,统一的词元词汇表
InternLumina-U2 属于一个推进迅速的研究方向,其押注在于:语言与视觉应当共享同一个离散词元接口,而不是分别栖身于独立的理解栈与生成栈中。该实验室此前在这一方向上的工作——在 WAIC 2025 上展示的统一离散扩散模型 Lumina-DiMOO——与 LLaDA2.0-Uni、Show-o2 和 MMaDA 一道,被视为 InternLumina-U2 所依托并宣称要超越的开创性系统。InternLumina-U2 更具体的押注是:这类统一模型的瓶颈不在架构,而在视觉词表——单一码本为单个视觉词元所能携带的信息量设定了上限;而将理解与生成拆分到不同表示之上的离散—连续混合方案,到头来仍然会迫使模型维护两套栈。
InternLumina-U2 的答案是完全离散的多码本建模。视觉侧采用 Apple 的 AToken 分词器,用八个互补的码本描述每个视觉位置——目的是在不增加序列长度的前提下保留局部纹理、嵌入文本、几何结构和高频细节。在输入侧,八个码本各自保留自己的嵌入,八个逐位置嵌入被拼接并投影为单个 backbone token。在输出侧,预测在空间上是并行的,但在码本深度上是自回归的:扩散主干并行去噪多个被掩蔽的空间位置,随后多码本自回归头按顺序预测每个位置的八个码。
• 规模——16B总参数,1B激活(16B-A1B),一种稀疏MoE。
• 语言主干——LLaDA-2.0 MoE 扩散语言模型,通过联合多任务训练将块扩散目标扩展到视觉任务(供应商描述)。
• 视觉表示 — 来自 Apple 的 AToken 分词器的 8 码本全离散令牌。
• 硬件:同时适配 NVIDIA GPU 与 Huawei Ascend NPU,覆盖训练、评估与推理,并在不同后端之间实现算子级数值对齐。

如果这些说法成立,它在实践中带来的,是多模态领域最古老的梦想:一组权重,既能读取图像、编辑图像,也能根据文字绘制新图像,还能回答关于视频的问题,并描述3D资产——理解与生成通过同一界面相互强化,而非由多个专用模型拼凑而成。这也是最值得用怀疑眼光审视的说法,因为它是实现难度最高的一个。
这些数字,也就这样了。
InternLumina-U2 的每一个基准测试结果都是由供应商报告的,且是初步且不完整的。README 和项目页面本身也如此说明:“初步的部分结果。完整的对比表将在即将发布的技术报告中出现。”由于权重未公开,不存在独立评估。请将下方数据视为实验室自身的声明,而非经过验证的分数。
• 图表/文档理解:ChartQA 86.52、CharXiv-DQ 83.65(厂商报告)。
• 视觉数学推理—MathVision 33.22、DynaMath 56.37;实验室称其在这两项上均优于仅具备理解能力的 InternVL3-8B。
• 幻觉鲁棒性 — HallusionBench 62.15。
• 视频理解VideoMME 51.26、MVBench 59.74、MLVU 57.03(项目页面)。
• 3D 理解 — 3D MM-Vet 41.8。
• 文生图 — DPG-Bench 87.10,TIIF-Bench Short/Long 84.60/85.95,GenEval 0.81(项目主页)。
• 图像编辑 — ImgEdit 3.83.
对比叙事是诚实的读者应当慢下来细看的地方。README 声称 InternLumina-U2 在细粒度理解与生成基准上超越了 InternVL-U、LLaDA2.0-Uni、Show-o2 和 Lumina-DiMOO 等统一模型——但项目页面自带的表格显示,InternLumina-U2 在 GenEval 上为 0.81,而 LLaDA2.0-Uni 为 0.89,可见该模型至少在某一项核心生成指标上落后于至少一个竞争对手。从不完整的表格里挑出几个有利的数字,正是“完整对比表格请见技术报告”这个附注想要缓和的问题。这些数字只是实验室给出的方向性信号,仅此而已。
什么是现实,什么又是承诺
此次发布的范围异常明确,而对于任何正在决定今天能否试用的人来说,这一点都很关键。已发布:推理代码。未发布:权重、训练代码(承诺将放在独立仓库中)、Ascend 训练与推理技术栈,以及技术报告。最终将承载该模型的 Hugging Face 仓库目前仍是一个占位页——下图展示的是读者点击 README 中 “Model (coming soon)” 链接后所到达页面的全部当前内容。

即便是已发布的代码,目前也无法产生输出。推理驱动程序期望在特定路径下找到切分后的 Hugging Face checkpoint 目录以及 AToken tokenizer 权重——而这两者都不在代码仓库中——因此,如今可下载到的只是模型运行方式的规范说明,而非一个可运行的模型。等到权重真正落地,自托管也绝非一次常规的 pip install 就能完成。该模型使用的是 block-diffusion generate API,而非标准的 Transformers generate 接口;AToken tokenizer 需要 FlashAttention;代码在 import 时需要可见的 GPU;根驱动程序是单进程的;3D 管线在资产编码时还需要 Blender 4.5。这是一个真正的部署工程,而不是周末随手可做的实验——而这正是路由层存在的意义:为大多数团队吸收这类摩擦。
当权重落地时,把它当作它本来的样子——一个尚未经过验证的模型。
今天没有人能运行InternLumina-U2,也没有任何服务商能提供它,因为权重并未公开存在。这种情况在某个时间点会改变——Apache-2.0许可,加上该实验室2026年积极开源的模式(ArchSpace“开放一切”的推动、InternVL3.5、Intern-S2科学模型),都使得权重发布更可能是必然而非假设。当这一切发生时,理性的第一步不是把生产管线押注在一个首日发布的、具有特殊服务要求且零独立评估的扩散模型上。而是将它与你已经信任的模型并排运行,放在测试路径上,一旦新模型出现异常,就自动故障转移到经过验证的模型上。这正是路由层所要承担的用例:一个API接入200多个模型,提供商列表价格以0%加价直接透传,而故障转移则把“试试新东西”变成一条路由规则,而非一次迁移。OrcaRouter正是这样配置的——需要说明的是,我们并不路由InternLumina-U2,也无法路由,因为权重尚未发布。这一节讨论的是当权重发布时应采用的工作流,而不是声称该模型如今已在任何地方可用。
接下来看什么
按大致可能性排序,有四个事件会让 InternLumina-U2 从预览变为现实。第一,Hugging Face 仓库开始填充内容:safetensors 文件、配置文件以及 AToken 分词器权重出现在那个占位仓库中,就是模型真正存在的时刻。第二,技术报告,它应当包含完整的对比表格,把上面零散的厂商数据变成可核查的内容。第三,训练代码仓库和 Ascend 技术栈,这对任何想在非 NVIDIA 硬件上微调或运行该模型的人都很重要。第四,第一次独立评估——一场竞技场 Elo、一次复现的 ChartQA 或 GenEval 运行——在不依赖实验室自身选择偏差的情况下检验"一个模型,六项任务"的承诺。代码已于 9 月 1 日公开,这意味着架构已经可知;权重缺失则意味着关于实际质量的一切说法仍然只是声明。关注模型仓库而非公告动态——有趣的部分已经公开,模型本身很可能也很快就会到来。
