
PixelUMM 与 Microsoft Mage-VL:一个删除视觉分词器,另一个重写它
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
两者都PixelUMM和Microsoft Mage-VL由坚信“视觉被转化为 token 的方式是错误的瓶颈”的团队构建——而他们朝着相反的方向解决了这个问题。Mage-VL 是微软的编解码器原生流式模型,它保留了一个 tokenizer,并让它激进得多:它遵循现代视频编解码器的结构,保留每一个锚定帧,并且只保留编解码器花费比特的那些预测帧图像块,并报告称,相较于均匀帧采样,视觉 token 削减超过 75%,同时最高可获得 3.5 倍的实际耗时加速。PixelUMM 是 NVIDIA 的无编码器统一模型,它完全移除了 tokenizer——原始像素的每个 16×16 图像块都通过单个线性投影到达骨干网络,任何地方都没有 VAE,也没有视觉 Transformer。一个压缩得更狠。另一个则完全拒绝压缩。而且它们中只有一个能生成任何东西。
最后这个差异,正是让这次对垒比一场规格之争更有意思的地方。Mage-VL 是一个观察者——一个带主动门控的流式感知模型,由门控决定何时开口。PixelUMM 则是一个也会作画的阅读者:同一套权重既能回答关于图像的问题,也能根据文本提示生成新的视频。对于“统一视觉模型应该是什么样”,它们给出了两种互不兼容的答案,而每家实验室的数字也只属于它自己。
压缩发生的位置
Mage-VL 的前提是一个现代版的莫拉维克悖论:视觉-语言模型在困难的离线推理上表现强劲,但在简单的实时感知上却缓慢且极度耗费算力。它的解决之道是编解码对齐。Mage-VL 不是把码流解码为均匀采样的帧、再把稠密网格送进一个冻结的、基于网络数据预训练的 ViT,而是把码流分离为锚定(I)帧和预测(P)帧,保留全部锚定帧图像块,并且只保留那些携带真实运动或新细节的预测帧图像块。其编码器 Mage-ViT 在 16×16 图像块网格上从头训练,采用三维旋转位置编码,并且明确地与编解码器无关——同一个接口既能接受 H.264/AVC 或 HEVC 的运动矢量与残差能量,也能接受神经编解码器学习得到的码率图,而无需更改架构或重新训练。
PixelUMM 的前提是:问题在于编码器本身,而不在于其效率。其论文认为,像 BAGEL 这样的模型带有两个视觉接口——一个用于语义特征的 ViT 和一个用于重建潜变量的 VAE——这使每张条件图像的视觉上下文大致翻倍,并迫使视觉-语言预训练流程围绕第二条流重建。PixelUMM 将两者都删除:图像变为 16×16 空间块,视频变为 4 帧时空管状片段,原始像素通过单层线性投影到达仅解码器 Transformer。理解为自回归文本;生成为像素空间流匹配。
• 压缩策略 —— Mage-VL:时域、源自编解码器;保留锚点,稀疏化预测帧。PixelUMM:无;保留原始像素的每个图块。
• 哪些是从零开始训练的 — Mage-VL:整个视觉栈,基于约 1 亿张/段无标注图像和视频。PixelUMM:像素嵌入器和解码器,构建在 Qwen3-8B 语言主干之上。
• 骨干网络 — Mage-VL:Qwen3-4B-Instruct-2507,是唯一经过预训练的组件,其后接一个两层 MLP 投影器。PixelUMM:Qwen3-8B,总参数量约 15.2B。
• 流式行为 —— Mage-VL:认知门控会对每个滚动窗口进行评分,并在值得响应的事件完成之前保持静默,仅在那时才调用完整模型。PixelUMM:没有流式模式;请求要么是生成调用,要么是理解调用。

每一项做什么,以及它不做什么
Mage-VL 是单一检查点,同时提供图像与视频理解能力以及主动式流式门控——同一套权重既能回答离线问题,也能驱动由事件门控的解说。它打包了编解码处理器、神经编解码软件包和门控模块。第二个版本,microsoft/Mage-ViT是从零开始预训练阶段得到的独立视觉编码器,可作为即插即用的前端用于其他多模态训练。Mage-VL 不做的事是生成。它只负责读取。
PixelUMM 涵盖文生图、96 帧和 24 fps 的文生视频,以及以图像和视频为条件的文本。它提供四个检查点——S8-F22-R05作为覆盖全部四项任务的默认检查点,S8-F18-R01经过调优,可在 480p 和 720p 下实现更好的文生视频,但无法进行视频理解,以及两个中间阶段。它不做的是流式处理、编辑或 3D。如果你需要一个能观看实时流并在有事发生时说话的模型,PixelUMM 完全不是这种形态,而且没有任何基准测试列会告诉你这一点。
采用差距是第一个诚实的信号
这两个版本成熟度并不相同,而下载计数器比任何发布公告都更直白地说明了这一点。
• Mage-VL——于 2026 年 7 月 25 日在 Hugging Face 上以 Apache-2.0 许可发布,并附有一份配套技术报告和一个 arXiv 标识符。到 10 月初,它的下载量约为 13,800 次,获得了 414 个赞,并且围绕它已经发展出一个小型的社区工作生态。
• PixelUMM——于 2026 年 10 月 1 日根据非商业检查点许可证发布于 Hugging Face。撰写本文时,其下载量为零,点赞数为三。它才刚发布几天。
两个实验室至今都仍未就各自的发布发布任何公告——Mage-VL 在 7 月发布时没有公告,PixelUMM 在 10 月发布时也没有。这种对称性确实存在,但如果据此认为两者是同等产物,那就错了。Mage-VL 已经获得了十周的社区关注;PixelUMM 才只有几天。一个实验室外无人运行过的模型,与一个已有几千人下载的模型是截然不同的情况,而这两者中只有一个属于后一类。

带有溯源信息的记分板
每个数字都是开发实验室自己的。Mage-VL 的数字来自 Microsoft 的模型卡和技术报告;PixelUMM 的数字来自其预印本。两者均未被独立复现。
• 视觉 token — Mage-VL:据报告,相较于密集帧采样,其数量减少了 75% 以上。PixelUMM:没有减少;其论点是,原始 patch 消除的是第二重编码,而非压缩第一重编码。
• 实际运行速度——Mage-VL:在精度相当的情况下,比均匀帧采样最快可提升 3.5 倍,由 Microsoft 报告。PixelUMM:论文中未给出对比性的速度声明。
• 编码器质量 — Mage-VL:Mage-ViT 在 256 个 token 的预算下,基于约 1 亿份未标注媒体,报告 CIFAR-10 达到 99.33%、ImageNet 达到 85.69%。PixelUMM:没有对应的编码器基准测试,因为根本不存在可供测试的编码器。
• 视频理解 — Mage-VL:在其报告的所有视频与时序定位基准上,相较 Qwen3-VL-4B 均有提升,包括 QVHighlight 上的 +22.5 和 ActivityNet 上的 +17.1。PixelUMM:MVBench 70.53,无字幕 Video-MME 57.33,LongVideoBench 59.61,LVBench 40.41。
• 图像理解 — Mage-VL:在静态图像方面与 Qwen3-VL-4B 持平,据微软报告。PixelUMM:MMMU 41.67,AI2D 80.12,DocVQA 90.42,ChartQA 82.96。
• 生成 — Mage-VL:无。PixelUMM:在提示词改写器的辅助下,GenEval 总体得分为 0.83,DPG-Bench 为 85.74,VBench 第 1 部分质量得分为 84.10。
• 流式 — Mage-VL:在 SoccerNet 流式数据上,采用主动式事件门控,报告了最优的 TimVal、F1、ROC-AUC 和 PR-AUC。PixelUMM:不支持。
• 许可证 — Mage-VL:Apache-2.0,代码与权重。PixelUMM:代码采用 Apache-2.0,检查点适用 NVIDIA One-Way Noncommercial License。
这两列的重叠程度不足以进行排名。Mage-VL 报告称,一款高效编码器击败了同规模的竞争对手;PixelUMM 报告称,一个 15B 模型与围绕它的专用系统落在同一区间,并在其自己的论文中直言,不同的训练数据意味着这些结果“无法确定哪种架构更优越”。
实际拆分
按任务来选,而不是按分数来选。如果你要做的是实时视频感知——一个监视视频流、在有事发生时进行评论的监控器,并且 token 成本是硬性约束——那么两者之中只有 Mage-VL 能做到,它是 Apache-2.0 许可,而且其 4B 级别的规模意味着单个节点就能提供服务。如果你需要一个既能读取图像和视频、又能生成它们的模型,那么两者之中只有 PixelUMM 能做到这一点,但它是采用非商业许可的研究性产物,其权重是藏在隐藏索引之后的 128 个分布式检查点分片,而且文本到视频默认会运行 Cosmos 护栏,该门控还需要单独的 Python 环境。
对于需要这两种能力的团队来说,通过一个路由层而不是两个直接集成来接入它们的理由很直接,尽管目前两者都未托管:单一密钥、按提供商标价以 0% 加价透传,以及故障转移规则,让你可以将新开放的 Apache-2.0 模型放在一部分流量前面,同时由经过验证的模型承接其余流量。OrcaRouter 正是为这类问题形态而构建——并且明确地说,我们目前既不路由 PixelUMM,也不路由 Mage-VL,因此这是对工作流程的描述,而不是一份列表。
什么能了结它
有两件事很重要。第一件是由与结果毫无利害关系的人对 Mage-ViT 的编码器数据或 Mage-VL 的视频结果进行独立复现——十周的下载量至今仍未催生出一次这样的复现。第二件是对 PixelUMM 的检查点许可证的任何变更,而这一事实正是目前区分研究产物与可部署产物的唯一关键。在这两件事中任何一件落地之前,关于这一对方案,你能说的有用的话是:微软押注于让视觉接口变得更便宜,而 NVIDIA 押注于消除视觉接口,而这两个押注都尚未被下注实验室之外的任何人评分。
