一张为“MiniCPM-V 4.7 对比 North Micro Vision Instruct”生成的英雄标题卡,副标题为“一个已被记录的 2.4B 模型,旁边是 70 GB 的空白”,左侧卡片写着“North Micro Vision Instruct:2.4B,Apache-2.0,原生分辨率”,右侧卡片写着“MiniCPM-V 4.7:35.2B 稀疏,无许可证,无模型卡”,还有一个胶囊标签写着“一个是微调目标,一个尚待定夺”,右下角是 OrcaRouter 标志。
Guides & Insights

MiniCPM-V 4.7 对比 North Micro Vision Instruct:Cohere 发布了一款有文档记录的 2.4B 模型;OpenBMB 发布了一个 70 GB 的空白

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

MiniCPM-V 4.7 和 North Micro Vision Instruct 都是小实验室对同一份需求的回答——一个你可以自行微调和部署的紧凑型视觉语言模型——但只有其中一个是完成品。Cohere 的 North Micro Vision Instruct 于 2026 年 8 月 10 日发布,是一款 24 亿参数、采用 Apache-2.0 许可的原生分辨率模型,并附有一篇解释其架构的技术博客文章和一张说明其用途的模型卡。MiniCPM-V 4.7 于 2026 年 10 月 6 日发布,是一个 352 亿参数的稀疏专家混合检查点,分为十六个分片,没有 README,没有许可证字段,也没有任何形式的基准测试。真正有趣的对比不是“哪个更聪明”,而在于这两个发布版本对不得不使用它们的社区展现出截然相反的姿态。

这两个版本,以及各自随附的内容

North Micro Vision Instruct 是来自 CohereLabs 的 2.4B 开放权重视觉语言模型,以 Apache-2.0 许可发布。它被明确地定位为一个紧凑的基础模型,用于原型开发、任务特定的微调以及专门的多模态工作。其标志性特性是原生分辨率图像处理,能够保留宽高比和精细的视觉细节,而不是重采样到固定网格中;模型卡声称其在 VQA、图像描述、定位、OCR、图表和文档方面具备能力。它支持每次对话使用多张图像,并支持十一种语言——英语、德语、法语、西班牙语、意大利语、葡萄牙语、印地语、日语、韩语、中文和阿拉伯语。模型权重为 2,484,847,856 个参数,采用 BF16;自发布以来,MLX 社区已推出 4-bit、5-bit、6-bit、8-bit、mxfp8、mxfp4、nvfp4 和 bf16 转换版本,这正是健康的小模型发布在几个月后应有的样子。它已有约 166,500 次下载和 150 个点赞。

MiniCPM-V 4.7 是 openbmb/MiniCPM-V-4.7-35B-A3B:BF16 精度下包含 35,212,875,824 个参数,分布在 16 个 safetensors 分片中,共 70.4 GB,类别为 MiniCPMV4_7ForConditionalGeneration,由 Transformers 5.2.0 保存,并于 2026 年 10 月 6 日上传。

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs North Micro Vision Instruct — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Licence none declared, Fine-tuning no recipe, Resolution 16x downsample, Languages not stated, Context 256K. Right column 'North Micro Vision Instruct' lists Parameters 2.48B dense, Licence Apache-2.0, Fine-tuning the stated purpose, Resolution native aspect preserved, Languages eleven listed, Context 2.4B deployment class. The footer reads 'North Micro Vision figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

它的文本主干是源自 Qwen3.5 的稀疏 MoE——256 个专家,每个 token 选 8 个——共 40 层,采用固定的“三个线性注意力配一个全注意力”模式,256K 上下文,外加一个自研的 27 层视觉塔,下采样倍率为 16×。没有模型卡。该仓库仅有三个点赞,零下载。

并排对比,聚焦六个关键要素

• 参数 — North Micro Vision Instruct:2.48B 稠密,每个 token 均激活全部参数。MiniCPM-V 4.7:总计 35.2B,256 选 8 稀疏。两者并非同类可比的数字。

• 许可证 — North Micro Vision Instruct:Apache-2.0,已标注并声明。MiniCPM-V 4.7:未声明,默认为保留所有权利。

• 微调基础——North Micro Vision Instruct:明确为任务特定微调而设计的基础模型,社区量化版本已可供使用。MiniCPM-V 4.7:一个 70 GB 的 BF16 检查点,既无量化版本,也未公布训练配方。

• 分辨率处理 —— North Micro Vision Instruct:原生分辨率,保持宽高比。MiniCPM-V 4.7:downsample_mode: "16x",max_slice_nums: 9,基于切片器的高分辨率路径。

• 语言覆盖范围 — North Micro Vision Instruct:卡片上列出了十一种语言。MiniCPM-V 4.7:任何地方均未说明。

• 背景 — North Micro Vision Instruct:针对其 2.4B 部署级别量身定制。MiniCPM-V 4.7:max_position_embeddings:262144,256K。

• 质量佐证 — North Micro Vision Instruct:已发布的模型卡、一篇技术博客文章、社区转换以及大量采用。MiniCPM-V 4.7:无可引用之处。

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

这种不对称性使得比较有失偏颇

这里有一种特别容易写的对比文章:从 OpenBMB 的 GitHub 上拉取 MiniCPM-V 4.6 的数据,指出它们胜过同类小型模型,并暗示 4.7 继承了这些成绩。那会是不诚实的,而原因值得精确说明。MiniCPM-V 4.7 并不是 4.6 的更大版本。它舍弃了 1.3B 的稠密 Qwen3.5-0.8B 主干,改用 35B 的稀疏 Qwen-MoE,将注意力模式改为 3:1 的线性对全注意力比例,并将视觉压缩默认值切换为 16x。其中每一项都是对模型中决定准确率的那部分的改动。家族血统并不等于基准测试。

不诚实的另一个方向更为隐蔽:把缺少一张卡片视为存在问题的证据。事实并非如此。自 2024 年以来,OpenBMB 已发布九代 MiniCPM-V,其中几代就其规模而言确实非常出色,而仓库创建与最后一次提交之间十二分钟的窗口,正是先分阶段准备、随后才完成的产物会呈现的样子,而不是损坏产物会有的样子。对 MiniCPM-V 4.7 的正确解读是“未知”,而“未知”与“糟糕”是截然不同的两回事。

Cohere 这一方有它自己的诚实要求。

A screenshot of the Hugging Face model page for CohereLabs/North-Micro-Vision-Instruct (captured 7 October 2026) showing the model header, the cohere_compass and image-text-to-text tags, the Apache-2.0 licence badge, the eleven language tags, and the opening of the card describing a 2.4B-parameter open-weight vision-language model with native-resolution image support.

North Micro Vision 模型卡中的质量声明出自 Cohere 自家的测量,技术深度解析也由同一团队撰写。社区在几天内就构建出十六个 MLX 量化版本,这是采用情况的证据,而非准确度的证据——人们转换的是容易转换的模型,而一个干净的 2.4B Apache-2.0 发布版本本就容易转换。无论是下载量还是量化版本的扩散范围,都不应被解读为评分。

每个到底是做什么用的

North Micro Vision Instruct 是一个微调目标。这就是整个设计纲要,用卡片自己的话来说:一个用于原型开发和专门应用的紧凑基础。如果你有一个范围较窄的文档解析、图表提取或多语言图像描述任务,以及几千个标注样本,那么一个 2.4B 的 Apache-2.0 模型,具备原生分辨率输入和八位及以上量化,是一个合理的起点;当它奏效时,你可以把它迁移到边缘设备或单块中端 GPU 上。

MiniCPM-V 4.7 如果最终被证明可用,那也不是这么回事。在未量化的情况下高达 70 GB,它是一款服务器级模型,而它的显著特性——256K 窗口,以及能让 KV cache 保持平坦的线性注意力——都指向长上下文多模态工作负载:长达一小时的视频转录、大规模文档集、历史记录中带有图像的长时间多轮分析。这些都是真实存在的负载,而该架构押注于它们也算合理。只是这场押注还没有分出胜负。

关于这两种压缩策略,有一个值得记住的细微之处。原生分辨率和 16× 下采样并非简单的好坏之分。原生分辨率编码器会消耗 token 来保留精细细节,而这正是 OCR 和 grounding 所需要的。16× 下采样消耗更少的 token,却有可能恰恰丢失这些细节。哪种更合适,取决于你的任务是阅读密集表单还是描述场景,而 MiniCPM-V 4.6 的可切换 4x/16x 模式之所以存在,正是因为答案会因任务而异。4.7 是否保留了这个切换,正是配置没有说明的事情之一。

路由器适合用在哪里,又不适合用在哪里

这两个模型都是需要你自己部署的权重。North Micro Vision Instruct 和 MiniCPM-V 4.7 都不是 OrcaRouter 上的托管模型,本文的任何内容都不应被理解为声称它们是托管模型。路由问题要到下一步才会出现:当那个小型自托管模型在处理日常工作时,某些更大的模型必须接手它处理失败的案例。这种交接正是单密钥路由器的用途所在——跨多家提供商提供 200 多个模型,每个都按标价计费,我们这边不加任何加价,并且当某家提供商服务质量下降时自动故障转移——而且值得在你真正需要它之前就把接口确定下来,因为你的 4.7 评估成功的那一天,就是你希望在不签第二份合同的情况下拥有第二个端点的那一天。

裁决,以及什么会改变它

Cohere 发布了一个模型。OpenBMB 发布了一个检查点。在读者能够据以采取行动的每一个维度上——许可证、许可证清晰度、有文档记录的行为、微调就绪度、量化、语言覆盖——North Micro Vision Instruct 都是当今的答案,而且遥遥领先。这并不是关于能力的断言,因为根本无法进行能力比较。MiniCPM-V 4.7 的参数量大约是其比较对象的十倍,却没有发布任何内容来证明或反驳这种规模。诚实的做法是把它视为待定:一个来自拥有真实业绩记录的实验室的真实产物,躺在一个只缺一个文件的仓库里,而这个文件会改变一切——README。