一张生成的分栏主视觉卡片,对比 NVIDIA NemotronLabs AI for Media - Sports Tennis 与 North Micro Vision Instruct,左半部分标注为 31B 网球解读器,旁边是一个仅英语标签和一个网球得分片段图标;右半部分标注为 2.4B 文档专家,旁边是一个 11+ 语言标签和一个文档与柱状图图标;OrcaRouter 标志位于右下角。
Guides & Insights

Nemotron Sports Tennis 与 North Micro Vision Instruct:一个 31B 网球阅读器对阵一个 2.4B 文档专家

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

先给简短回答:NVIDIA NemotronLabs AI for Media - Sports Tennis 和 North Micro Vision Instruct 并非彼此的替代品,而在这两者之间做选择的人,实际上并不是真的在两者之间做选择。一个是 NVIDIA 微调过的 31B 多模态模型,用于回答网球得分相关的问题,需要大约 80 GB 的 GPU 内存,并且只能阅读英语。另一个是来自 Cohere 的 2.4B 视觉语言模型,可装入单张工作站显卡,支持十一种语言,并且首要构建目的是阅读文档——页面、图表、表格、OCR。

它们同属一个宽泛的类别,除此之外几乎再无交集。接下来是这场比较的诚实版本:两者真正分歧之处、各供应商已披露与未披露的内容,以及唯一一种选择确实有意义的情形。

每个模型的构建目的

North Micro Vision Instruct 将一个 2B 语言模型——Cohere 的 North Micro LLM,遵循 Command A+ 架构——与一个基于 SigLIP 2 SO400M 定制训练的 400M 参数视觉编码器配对,总计 2.4B。其视觉路径采用原生分辨率,保留宽高比而非缩放到固定网格,并且 DeepStack 投影器会将来自多个编码器层的 patch 嵌入注入到对应的早期语言层中,而不是前置单一表示。Cohere 给出的定位是用于原型设计和任务特定微调的紧凑基础模型,以文档理解作为旗舰能力。模型卡对能力上限的说明异常坦诚:North Micro Vision Instruct 明确是推理模型,不具备工具调用能力,也未使用系统提示词进行训练。

Sports Tennis 在每个维度上都呈现出相反的形态。NVIDIA 从自家的 Nemotron 3 Nano Omni 30B-A3B-Reasoning 检查点出发——一个 Mamba2-Transformer 混合专家模型,总参数量 31B,每个 token 约 3B 活跃参数——并在一个专有的、人工标注的网球语料库上对其进行了微调。视觉编码器(C-RADIOv4-H)和语音编码器(Parakeet)都被冻结;只有语言模型参数发生了移动。结果是一个按设计就很窄的模型:它针对一整段网球分球视频片段回答结构化多项选择题和开放式问题,涵盖击球机制、场上站位、球员移动、比赛事实、规则知识和音频线索。NVIDIA 将其描述为,当把完整的一分——从发球到该回合结束——作为输入传入时效果最佳。

真正将它们区分开来的维度

• 参数量 — North Micro Vision Instruct:2.4B(2B 语言,400M 视觉)。Sports Tennis:总计 31B,每 token 约 3B 激活。

• 输入 — North Micro Vision Instruct:交错的文本和图像、原生分辨率、多图像。Sports Tennis:视频最长 2 分钟、音频最长 1 小时、图像、文本。

• 输出 — 两者均返回文本。North Micro Vision Instruct 还会额外返回基于归一化 0–1000 尺度的定位边界框。

• 语言 — North Micro Vision Instruct:十一种以上,包括英语、德语、法语、西班牙语、意大利语、葡萄牙语、印地语、日语、韩语、中文和阿拉伯语。体育网球:仅英语。

• 上下文 —— North Micro Vision Instruct:一个 128K token 的语言主干,但 Cohere 将已验证的多模态范围标记为最高 8K token,更长的多模态上下文则依赖外推,且未经基准测试。Sports Tennis:最高 256k token。

• 占用 — North Micro Vision Instruct:BF16 下约 4.97 GB,4-bit 下约 2.17 GB。Sports Tennis:BF16 下约 62 GB,需要一块 80 GB GPU。

• 许可证 — North Micro Vision Instruct:Apache 2.0。Sports Tennis:OpenMDW-1.1,其模型卡片声明可用于商业和非商业用途。

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs North Micro Vision Instruct — the scoreboard.' Left column lists Parameters 31B (about 3B active), Inputs video audio image text, Languages English only, Published benchmarks none, Footprint about 62 GB, GPU floor 1 x 80 GB. Right column lists Parameters 2.4B, Inputs interleaved text and images at native resolution, Languages eleven or more, Published benchmarks DocVQA 0.921 / ChartQA 0.808 / OCRBench 0.792 / MMMU 0.329, Footprint about 5 GB at BF16, GPU floor a single workstation card. Footer reads 'NVIDIA figures from its model card with no published results; Cohere figures vendor-reported.'

基准测试:一个模型有它们,另一个模型有协议

正是在这一点上,这两张卡在姿态上再不同不过了。

Cohere 公布了 North Micro Vision Instruct 的数据。DocVQA 0.921,ChartQA 0.808,OCRBench 0.792——以及 MMMU 0.329。全部由厂商报告,没有一项经过独立复现,而且 Cohere 自己也指出,OCR 结果会因数据划分不同而剧烈变化。最后那个数字值得停下来想一想:MMMU 得分 0.329 很低,而且这与模型卡中关于该模型设计的其他所有说法一致。这是一个专精阅读的模型,而非通用推理模型,打造它的公司也这么说。这种披露比一个好看的数字更有用。

NVIDIA 没有公布任何内容。Sports Tennis 卡片详细描述了其评估方式——一个由 12 场完全留出的比赛组成的测试划分,包含 2,689 个逐分片段和 80,872 个来自与训练无重叠比赛的问题,评分依据是自动化多项选择准确率以及 LLM-as-judge 在开放式回答上的 pass@9,并且明确将已见比赛划分排除在报告的测试之外——但随后没有报告其中任何一项的结果。训练方面同样详细:1,312,129 个问答示例,其中 1,226,081 个为多项选择,86,048 个为开放式,取自 239 场比赛中的 43,084 个逐分片段,并按 38 个标注类别进行标注。

即使 NVIDIA 公布了分数,它们也不具备可比性。没有任何一个基准测试会同时出现文档理解模型和网球得分模型。这两个评估叙事之间的重叠为零。

A screenshot of the Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, captured September 11, 2026, showing the description as a 2.4B-parameter open-weight vision-language model with native-resolution image support under Apache 2.0, model details listing a 2B language model and a 400M vision encoder custom-trained from SigLIP 2 SO400M, a 128K-token language backbone context with an 8K validated multimodal range, eleven listed languages, and the note that public vLLM support is coming soon.

部署:实际差别之所在

2.4B 模型在操作上要容易得多,且优势明显。约 5 GB 的 BF16 权重意味着单块现代工作站 GPU 就能处理,而约 2.17 GB 的 4 位版本还要更小。Apple 的 Core AI 运行时已有独立移植版本,据报道在 iPhone 17 Pro 上 int8 约为 18.2 tokens/s,而 int4 量化则彻底失败。摩擦在于软件:North Micro Vision Instruct 需要 Transformers 5.16.0——在它进入 PyPI 之前可从源码安装——并且模型卡上仍称公开的 vLLM 支持即将推出。通过 Axolotl 支持微调。没有第一方托管 API;实际路径是自托管。

Sports Tennis 才是更难运行的那个,这一点无法回避。单块 80 GB GPU、BF16,没有发布量化检查点,仅支持英语,仅支持 Linux,运行在 PyTorch/Transformers 或 NeMo 或 Megatron 上。NVIDIA 在 A100、H100、H200、B200、GB200 NVL72、RTX PRO 6000 SE、L40S、DGX Spark、Jetson Thor 和 RTX 5090 上进行了测试——这份硬件清单更多说明的是 NVIDIA 想验证什么,而不是普通团队能配置到什么。这款卡的默认推理策略也极为简陋:每秒 2 帧、最多 128 帧;256 个新 token;贪心解码。

OrcaRouter 上不提供这两个模型中的任何一个。North Micro Vision Instruct 没有第一方端点,也不在我们的目录中;Sports Tennis 在任何地方都没有端点,因为 NVIDIA 只发布了权重,没有托管服务。两者都属于自行托管的决定。

路由层真正能派上用场的地方,是它们周边的流水线——无论其中哪些是你在本地运行的,围绕其周围的转录、摘要、检索和应用模型都是托管在云端的,而把这些模型置于一个 API 密钥、并具备自动故障转移之下,就能免去为每一个模型单独搭建一套凭证和合同。对于我们确实提供的模型,我们按供应商标价以 0% 的加价率原样透传,因此技术栈中你不自行托管的部分仍保持厂商定价。

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips, and a minimum GPU of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

当选择是真实的

有一种情形,在这两者之间做选择确实是一个真正的决定,而这一点值得具体说明,因为它并不显而易见。

对于已经处理文档、并希望加入逐分(point-level)视频理解能力的媒体或体育组织来说,情况正是如此。拥有归档流水线的广播机构、拥有比赛报告和统计 PDF 的联赛、同时拥有文本和视频素材的版权方——对他们而言,North Micro Vision Instruct 很可能已经在技术栈中用于 OCR 和图表提取,而 Sports Tennis 则是他们将要新增的能力。问题不是“选哪一个”,而是“第二个会让我在基础设施上付出多少成本”,答案是:一块数据中心 GPU,以及仅支持英语的限制。

在那之外,这些模型根本不在同一赛道上竞争。如果你需要在工作站显卡上用十一种语言阅读文档,North Micro Vision Instruct 就是答案,Sports Tennis 对你来说毫无意义。如果你需要结合音频上下文对网球比分提出结构化问题,那么两者之中只有 Sports Tennis 能做到,而它缺少公开基准测试这一事实,是你将主动承担的风险,而不是选择另一个模型的理由。

该选哪个

如果你的工作涉及文档、图表、OCR、视觉定位或多语言图像理解,并且你看重一个会同时公布自身弱项指标和强项指标的厂商,那就选择 North Micro Vision Instruct。它规模小、采用 Apache 2.0、文档完善,并且坦诚自己不是推理模型。它的 MMMU 为 0.329,这不是你事后才会发现的缺陷;Cohere 一开始就会告诉你。

只有当 你特别需要带音频的、逐分(point-level)网球推理,手头能空出一块 80 GB GPU,并且愿意做第一个评估它的人时,才选择 NVIDIA NemotronLabs AI for Media - Sports Tennis。还没有人公布过这个模型的分数,所以下载它本身就是实验。这并不是避开它的理由——一个拥有精心标注的 43,084 条片段训练集的狭窄专家模型,恰恰是那种能在自身任务上击败通用模型的类型——但这是把首次部署当作试验而非承诺的理由。

你唯一不该做的事,就是因为卡片上都写着“视觉语言模型”,就把它们当成可以互换的东西。文档阅读器和网球分析师从来就不是同一种产品,而在这两者之间,它们功能上的差异远远大于它们在完成效果上的差异。