一张采用 OrcaRouter 品牌风格生成的标题卡,标题为“PixelUMM vs North Micro Vision Instruct”,包含四个统计图块:“2.4B”(North Micro Vision Instruct 的总参数量)、“~180k”(截至 10 月初其在 Hugging Face 上的下载量)、“0.921 / 90.42”(其 DocVQA 准确率分数,对应 PixelUMM 的百分比)以及“Apache-2.0”(其代码和权重许可,对应 PixelUMM 的非商业检查点)。页脚一行写着“厂商报告的数据;未对任一模型进行独立复跑。”。OrcaRouter 标志被合成到右下角的留白条带中。
Guides & Insights

PixelUMM vs North Micro Vision Instruct:非商业研究模型对阵可上线的 2.4B 阅读器

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

把North Micro Vision Instruct和PixelUMM并排放在一起,尺寸差异几乎令人分心:Cohere 的原生分辨率阅读器有 24 亿参数,而 NVIDIA 的统一模型有 152 亿参数。真正有趣的维度在于编码器。North Micro Vision Instruct 按传统方式构建——一个从 SigLIP 2 SO400M 初始化的 4 亿参数视觉编码器,为一个 20 亿参数的语言模型提供输入,整个模型封装在 262,144 个 token 的词表中,并以 Apache-2.0 许可发布。PixelUMM 则建立在这样一种论点之上:正是这种确切安排构成了瓶颈,因此它删掉了编码器:原始 16×16 像素块通过单层线性投影进入 Qwen3-8B 主干,而同一套权重既能生成视频,也能回答关于视频的问题。一个是专门的阅读设备,你今天就能下载并部署。另一个是附带下载链接的研究论文,其许可证使其无法用于产品。

下面两个模型的数字都出自各自的实验室。两者均未被独立复现,而且两家发布的是不同的基准测试套件,所以重叠部分比看上去要窄。

为无聊架构辩护

North Micro Vision Instruct 于 2026 年 8 月 10 日在 Hugging Face 上发布,已有八周时间积累用户,到 10 月初,其下载量约为 18 万次、点赞数约 150——关注度比 PixelUMM 那个才上线几天的仓库高出一个数量级。它的宣传点具体而朴实:大多数视觉模型会把图像缩小到固定网格,从而丢失文档所依赖的精细细节,而这个模型以原生分辨率处理图像,保留宽高比和小号文字。

• 参数 — 总计 2.4B:一个 2B 语言模型,加上一个基于 SigLIP 2 SO400M 定制训练的 400M 视觉编码器。

• 上下文——语言主干支持 128K token,但经经验证的多模态工作范围约为 8K token。模型卡明确指出,更长的多模态上下文依赖外推,且未经基准测试。

• 输入与输出——交错的文本和图像输入,文本输出。支持十一种以上语言。不进行任何形式的生成。

• 报告的分数 — DocVQA 0.921、ChartQA 0.808、OCRBench 0.792,均由 Cohere 报告且未经复现。MMMU 0.329,模型卡对此并未掩饰:这是一款阅读专才,而非推理通才。

• 部署 — Transformers 5.16.0 与一个加速器,单块现代 GPU,2.4B 参数下使用 bfloat16,Flash Attention 2 可选而非必需。

那个设计没有任何新颖之处。这也是它能在本周被下载、微调并用于处理真实文档的原因。

A headless-browser capture of the Hugging Face model card for the North Micro Vision Instruct repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

另一方针对它提出的反对理由

PixelUMM 的预印本开篇指出了这种架构的代价。一个冻结的、在网络数据上预训练的视觉 Transformer 为理解提供语义特征;一个独立的 VAE 为生成提供面向重建的潜变量;同时承载两者会使每张条件图像的视觉上下文大致翻倍,并迫使视觉-语言预训练流程围绕第二条流重建。North Micro Vision Instruct 仅通过完全拒绝第二项任务来避免这种翻倍——它不进行生成,因此只需要一个接口,而不是两个。

PixelUMM 把这一论点贯彻到底。没有编码器,没有 VAE,也没有分词器:图像用 16×16 像素块,视频用 4 帧时空 tubelet,二者都通过单层线性投影送入仅解码器 Transformer,理解由自回归文本实现,生成由像素空间流匹配实现。其八个实证章节研究的是设计选择,而非排行榜上的胜利——patch 大小、patch 伪影、像素空间与 VAE 空间的训练动态、计算扩展——这是一篇追问该范式是否成立的论文,而不是一篇宣称它已经胜出的论文。

• 视觉路径 — North Micro Vision Instruct:400M 预训练视觉编码器,原生分辨率。PixelUMM:无编码器;原始图块经线性投影。

• 功能 — North Micro Vision Instruct:读取图像和文档,以文本作答,进行目标定位与描述生成。PixelUMM:读取图像和视频,并根据文本生成图像和 4 秒视频。

• 规模——基于 Qwen3-8B 主干,稠密参数为 2.4B,总参数量约为 15.2B,在论文自身的表格中记作“8B MoT”。

• 许可证——代码和权重均采用 Apache-2.0 许可,对比之下,代码采用 Apache-2.0 许可,而检查点采用 NVIDIA One-Way Noncommercial License 许可。

A generated scoreboard card titled “PixelUMM vs North Micro Vision Instruct — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: parameters, visual path, inputs and outputs, DocVQA, MMMU and licence. North Micro Vision Instruct's column shows 2.4B total, a 400M SigLIP 2 SO400M vision encoder at native resolution, interleaved text and images in with text out, DocVQA 0.921, MMMU 0.329 and Apache-2.0; PixelUMM's column shows about 15.2B total, no encoder with raw patches through a linear projection, image and video reading plus image and video generation, DocVQA 90.42, MMMU 41.67 and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

诚实地解读两个记分牌

这两个模型公布不同的基准测试,而在两者重叠之处,评分标准也不同。

• DocVQA — North Micro Vision Instruct 为准确率分数 0.921。PixelUMM 为百分比 90.42。基准名称相同,但数据划分与提示设置不同,而且两者中只有一方以原生分辨率处理作为理由。

• ChartQA — North Micro Vision Instruct 0.808。PixelUMM 82.96。再说,一旦你不再比较原始字符串,大致还是同一个区间。

• OCRBench — North Micro Vision Instruct 0.792。PixelUMM 78.00。

• MMMU — North Micro Vision Instruct 0.329,PixelUMM 41.67。按大型视觉语言模型的标准衡量,两者均偏低,且两家实验室都如实公布,不加粉饰。

• PixelUMM-only — 在配合提示词重写器的情况下,MVBench 70.53,Video-MME 57.33,LongVideoBench 59.61,GenEval 0.83;VBench 第 1 部分质量 84.10。

• North Micro Vision Instruct-only — 定位、图像描述和多图像任务;有文档记录表明其缺少工具调用能力,且明确不具备智能体行为。

这种重合最引人注目之处在于,一个 2.4B 专家模型在文档和图表阅读上竟能如此接近一个 15.2B 通用模型。这并不能证明无编码器方法行不通——它证明的是,文档阅读是一项非常适合紧凑型原生分辨率编码器的任务,而 PixelUMM 的架构瞄准的是另一个论点。PixelUMM 自己的论文也用一句值得引用的话承认了这一点:由于不同模型的训练数据不同,其结果“无法确定哪种架构更优越”。

决策最终落定于何处

如果你有文档、图表、表单或截图,并且这个月就需要答案,那么 North Micro Vision Instruct 就是务实之选,而且优势毫无悬念:Apache-2.0、2.4B、标准 Transformers 加载路径、没有护栏环境、没有分布式检查点索引、没有第二套 Python 栈。在你自己的文档分布上微调它,你就拥有了一个专家模型。但要注意其适用范围——把它指向推理任务,MMMU 分数就会让你现形。

PixelUMM 提供的是广度与一个研究问题。它能用同一组权重读取和生成图像与视频,而且明显是更值得一读的那个。但它的检查点采用非商业许可,其权重是 128 个分布式检查点分片,藏在一个隐藏的元数据索引之后,总计约 30 GB;它需要 CUDA 13 工具包,且 FlashAttention 要从源码编译;它的文本到视频路径运行 Cosmos 防护栏,需要一个受限仓库和单独的环境。那是实验室工作台,而不是部署。

路由这一角度会晚些才出现,甚至可能根本不会出现。这两款模型目前都无法通过任何托管 API 使用——OrcaRouter 对两者都不做路由——而在其许可允许之前,也都不会。当像 North Micro Vision Instruct 这样的模型确实出现在共享端点之后时,选择它而非直接集成,理由很平常:一个密钥通行 200 多个模型、按 0% 加价转嫁提供商标价、故障转移会把表现不及自身卡片的模型降级,以及当你想要对替代方案做 A/B 测试时无需再谈第二份合同。这描述的是工作流程,而不是关于可用性的主张。

唯一能区分他们的测试

在同一文档集上以相同分辨率运行两者,并给小文本用例打分,然后改变一个变量:通过让 PixelUMM 输入其原生分辨率输入,把视觉编码器从对比中剔除。如果这个无编码器模型能以一小部分参数成本在密集文本上依然表现可靠,那就是对该论点最有力的证据——而且这是任何有一张闲置显卡的人都能运行的测试,因为两个检查点都可下载。在有人做到之前,务实的总结依然成立:小型 Apache-2.0 阅读器是你部署的那个,大型非商业通用模型是你研究的那个。