
PixelUMM 与 InternLumina-U2:两个无编码器测试版,以及唯一决定成败的差异
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
两个模型,均为公开,设计都不同寻常,而其中只有一个能让你在其上构建产品。PixelUMM是 NVIDIA 的无编码器统一模型——基于 Qwen3-8B 骨干网络,拥有 152 亿参数,通过 16×16 图块和 4 帧 tubelet 读写原始像素,整个技术栈中没有任何 VAE,也没有任何视觉编码器。InternLumina-U2是上海人工智能实验室的 160 亿参数混合专家扩散模型,它通过一个名为 AToken 的分词器将每个视觉输入压缩成八个互补的离散代码。两者都押注视觉接口是瓶颈。更重要的赌注在许可证文件里:InternLumina-U2 以 Apache-2.0 许可证提供权重,PixelUMM 则以非商业许可证提供检查点。如果你要出于任何商业目的在两者之间做选择,那句话就是整个比较,而本页其余内容都只是它的背景。
下面两组数据都来自实验室自身。两个模型都没有独立评估、没有竞技场 Elo,也没有第三方复现。二者都不通过任何托管 API 提供服务。不同之处在于,你下载该制品后获准用它做什么,以及每个版本实际进展到了什么程度。
每一个目前的状况
两个发布时间表以不同的速度推进,而且都悄无声息。
• PixelUMM — GitHub 仓库创建于 2026 年 9 月 4 日;arXiv 预印本 2609.38597,日期为 2026 年 9 月 29 日;Hugging Face 模型仓库创建于 2026 年 10 月 1 日 21:40 UTC。未发现有关它的 NVIDIA 博客文章、新闻稿或发布帖。
• InternLumina-U2 — GitHub 仓库创建于 2026 年 9 月 1 日;Hugging Face 占位条目于同日注册;2026 年 9 月 10 日添加了经昇腾训练的检查点权重;2026 年 9 月 24 日添加了 NVIDIA/CUDA 检查点权重。每个堆栈有七个分片,二者今日均可下载。
九月初的那个 InternLumina-U2——只有代码,权重"即将发布",模型仓库空空如也——已不再是如今的这个 InternLumina-U2。凡是本月初读到相关消息、并据此断定权重缺失的人,都应该重新核实一下;华为昇腾和 NVIDIA/CUDA 两版检查点均已上线,采用 Apache-2.0 许可,并随附分词器、配置、对话模板和远程建模代码。

同一个问题的两个答案
这两个模型的出发点都是同一个痛点:为了理解而携带视觉编码器以及为了生成而携带 VAE,就意味着每张图像都要被表示两次,视觉上下文大致翻倍,并迫使训练流水线维护两套接口。
PixelUMM 的答案是两者都删除。原始像素通过单层线性投影直接输入——每张图像位置对应一个 16×16 的图块,每个视频位置对应一个 4 帧的小管——而主干网络是一个仅解码器的 Transformer,其 Mixture-of-Transformers 设计将共享注意力与任务特定参数配对。文本以自回归方式预测;像素通过流匹配预测。论文用了八个章节讨论设计研究——图块大小、图块伪影、像素空间与 VAE 空间动态、计算扩展——这告诉你,团队真正的问题是这一范式是否成立。
InternLumina-U2 的答案是保留离散接口,但让每个 token 承载多得多的信息。AToken 分词器用八个互补码本描述每个视觉位置,涵盖纹理、嵌入文本和几何结构;这八个嵌入按位置拼接,并投影为一个主干 token。解码则反向进行,采用空间并行去噪和多码本自回归头,按顺序预测这八个码。主干是一个属于 LLaDA-2.0 谱系的稀疏扩散 LLM,总参数 16B,激活参数 1B。
• 视觉接口 —— PixelUMM:原始像素块与 tubelet,完全不需要分词器。InternLumina-U2:来自 AToken 的八码本全离散 token,无连续潜变量。
• 骨干 — PixelUMM:Qwen3-8B(总计 15.2B),单一稠密解码器,兼具理解与生成专家。InternLumina-U2:总计 16B / 激活 1B 的稀疏 MoE 扩散语言模型。
• 生成方法 — PixelUMM:像素空间流匹配加自回归文本。InternLumina-U2:在离散码上进行掩码扩散去噪。
• 所声称的任务 —— PixelUMM:文生图、文生视频、图生文、视频转文本。InternLumina-U2:上述全部,外加图像编辑和 3D 理解。
• 权重格式 — PixelUMM:128 个 .distcp 分片(约 30 GB),位于隐藏的 .metadata 索引之后。InternLumina-U2:七个 .safetensors 分片,每个硬件栈一套,采用标准 Hugging Face 布局。

记分牌,连同其出处一并附上
把每一行都当作实验室自己的说法来读。PixelUMM 的那些来自其预印本;InternLumina-U2 的那些则是实验室自己将其描述为“初步、不完整”,而完整的对比表则被推迟到一份尚未发布的技术报告。
• MMMU(图像推理) — PixelUMM 41.67(作者自报)。InternLumina-U2:未报告。
• ChartQA — PixelUMM 82.96。InternLumina-U2 86.52。
• DocVQA — PixelUMM 90.42。InternLumina-U2:未报告。
• Video-MME(无字幕) — PixelUMM 57.33。InternLumina-U2 51.26。
• MVBench — PixelUMM 70.53。InternLumina-U2 59.74。
• GenEval 总体——使用 LLM 提示词重写器时 PixelUMM 为 0.83,不使用时为 0.77。InternLumina-U2 为 0.81。
• DPG-Bench 总体 — PixelUMM 85.74。InternLumina-U2 87.10。
• 视频生成 — PixelUMM VBench 第 1 部分质量 84.10 / 语义 79.80,第 2 部分总计 83.24。InternLumina-U2:未报告。
• 3D 理解 — PixelUMM:无此任务。InternLumina-U2 报告 3D MM-Vet 41.8。
这种比较并不对等,因为两个实验室发布的是不同的表格,而不是因为某一方胜出。PixelUMM 有一个完整的视频生成板块,却没有编辑或 3D 部分;InternLumina-U2 声称涵盖六个任务族,并报告了一张横跨这些任务的部分表格。同一基准名称下的跨实验室数字并不是同一种测量——数据划分、提示词和采样方式各不相同——因此应把 ChartQA 和 GenEval 这两行视为大致持平,并就此打住。
授权许可正是打破平局的地方
这是任何基准测试表都不会展示的部分。PixelUMM 仓库采用 Apache-2.0,卡片上也醒目地写明了这一点。检查点是一个独立的制品,受 NVIDIA One-Way Noncommercial License 约束,仅限非商业研究或评估用途,并且还有一个源文件额外保留了继承自 DiT 的 CC BY-NC 4.0 声明。研究用途:没问题。内部产品功能:需要和法务沟通,而且可能是一次简短的沟通。
InternLumina-U2 从代码到两个检查点都端到端采用 Apache-2.0,没有任何单独的非商业例外条款。对于需要交付上线的团队来说,这不是一个小优势——而是决定一切的关键。两个模型在成熟度上都属于研究级。其中只有一个可以不受限制地使用。
到底该试哪一个,以及怎么试
如果你的工作是视频理解,或者你想要一个能用同一套权重生成视频和图像的模型,那么 PixelUMM 是更完整的成果,其论文也更值得一读——但它是一个采用非商业许可的研究项目,因此它属于评估台,而不属于生产流水线。如果你的工作是图表、文档和图像生成的广度,或者你需要编辑和 3D,那么 InternLumina-U2 覆盖的范围更广,也没有许可上限;代价是 16B-A1B 扩散主干和 AToken 分词器意味着实打实的服务工程,而且其公布的数值明确是不完整的。
截至本文撰写时,这两个模型都没有上线任何托管 API,OrcaRouter 也不例外——这两个模型我们都不提供路由。等到情况有变时,选择通过路由层而非直接集成来接入它们,理由与任何新开放的模型都一样:一个密钥通行 200+ 个模型、按供应商标价 0% 加价透传,以及自动故障转移,这样一来,如果某个模型最终比其厂商表格所暗示的更差,只需更改一条路由即可将其降级,而不必重写部署。在那之前,诚实的建议还是那句乏味的——下载许可证允许你使用场景的那个模型,用你自己的数据自己跑评估,并且在实验室之外的人重新跑出结果之前,不要围绕任何一家实验室的数字做规划。
什么会改变答案
三件事,按影响力排序。PixelUMM 的检查点若采用商业许可,将使比较真正接近,并将其从“读论文”转变为“评估权重”。上海人工智能实验室发布一份包含完整对比表格的技术报告,将把 InternLumina-U2 的部分数据变为可核查的内容,并且还会揭示六项任务的广度中有多少是达到同等水平,又有多少是在 token 深度上。而对这两个模型中任何一个的首次独立复现——由一个与结果无利害关系的团队对 GenEval 或 MVBench 进行重新运行——正是这两者中任何一个不再只是厂商表格的时刻。在此之前,一个是你只能研究的不寻常架构,另一个是你可以交付的不寻常架构。
