一张生成的 hero 卡片,比较 NVIDIA NemotronLabs AI for Media - Sports Tennis 与 Microsoft Mage-VL,一侧展示有界的网球单分片段,另一侧展示带有高亮事件标记的连续胶片条,三个对比标签分别写着“片段 vs 流”、“无已发布比分 vs SoccerNet 比分”和“80 GB 下限 vs 16 GB 下限”,右下角是 OrcaRouter 标志。
Guides & Insights

Nemotron Sports Tennis 与 Microsoft Mage-VL:解读体育赛事转播的两种方式

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

微软的 Mage-VL 有一个可以拿来佐证的数字:在 SoccerNet 响应时序基准上,它取得 55.54 的 TimVal 和 9.30 的 PR-AUC,尽管从未在该数据集上训练过,却在精度敏感指标上表现最佳;其作者还演示了它全程观看一场 2026 年世界杯转播,一直保持沉默直到第 29.36 秒,此时一名球员突破,模型随即触发实时解说。NVIDIA NemotronLabs AI for Media - Sports Tennis 则一个数字都没有。它是一个 310 亿参数的多模态模型,基于 43,084 个网球得分片段微调,NVIDIA 于 2026 年 9 月发布,其模型卡上载有完整的评估方案,却没有给出其中任何一项结果。

所以,这并不是一场你能打分的正面交锋。但它仍然是一次真正有用的比较,因为这两个模型以相反的架构押注,回答的是同一个问题——视觉语言模型能否跟上直播体育赛事——而其中一种押注有证据支撑,另一种则靠一份数据描述支撑。这种不对称,正是这篇文章的主题。

分岔:流,还是片段

设计差异比参数数量更重要,它几乎解释了这两个模型的其他所有方面。

Microsoft Mage-VL 围绕连续视频构建。其视觉编码器 Mage-ViT 从零开始训练,像编解码器那样读取视频:它把视频流拆分为锚定(I)帧和预测(P)帧,前者完整保留,后者只保留那些承载真实运动或新细节的图像块,二者共用 16×16 的图像块网格。这使视觉 token 减少 75% 以上,并且据 Microsoft 称,相比均匀帧采样,墙钟推理速度最高可提升 3.5 倍。在此之上还有一套 System 1 / System 2 的分工:一个轻量级的认知门控对每个滚动窗口打分,对常规内容保持沉默,只有当值得响应的事件完成时才调用完整模型。这是一个模型同时承担两项工作,而不是一条流水线。

NVIDIA 的网球模型则完全押了另一注。它的模型卡明确写道:“当输入是一整段网球分点视频片段时效果最佳”——从发球直到这一分结束,最长两分钟的 mp4,带音频。默认推理策略为每秒 2 帧、最多 128 帧,256 个新 token,贪心解码,视频加音频。没有门控,没有流式模式,没有事件触发。它是一个针对有限片段的问答模型:你交给它一个分点,你问发生了什么,它来告诉你。

这些并不是同一个想法的两种实现。流式感知和片段级推理是不同的产品。想要实时解说的广播机构需要 Mage-VL 这样的形态。想要查询包含 43,084 个数据点的存档的分析师需要 Sports Tennis 这样的形态。这两个模型都不能直接顶替对方的工作。

两者都基于混合骨干网络构建——但有一个重要区别

• 参数 — Sports Tennis:总计 31B,每个 token 约 3B 激活,Mamba2-Transformer 混合 MoE。Mage-VL:总计 4B,316M 的 Mage-ViT 搭配 Qwen3-4B-Instruct-2507 解码器。

• 编码器——Sports Tennis 冻结 C-RADIOv4-H 视觉编码器和 Parakeet 语音编码器,仅微调语言模型参数。Mage-VL 在大约 1 亿张无标注图像和视频上从头训练其整个视觉栈,其中 Qwen3 语言模型是唯一预训练的组件。

• 音频——Sports Tennis 将音频作为一等输入,并在其 38 个标注类别中列出了音频线索解读。Mage-VL 已发布的流程是视觉的;SoccerNet 的工作则关乎帧上的响应时序。

• 输出模态 — 两者均仅生成文本。

• 乘数效应——由于 Mage-ViT 的预训练成本低于网络规模的视觉塔,微软报告称,在相同预算下,视频训练时长可达原来的 8 倍。NVIDIA 的效率主张则在于架构:总参数 31B,每 token 激活 3B 参数。

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs Microsoft Mage-VL — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Design clip-at-a-time, Audio first-class input, Published scores none, GPU floor about 80 GB. Right column lists Release July 2026, Parameters 4B, Design codec-native streaming with an event gate, Audio not in the published pipeline, Published scores SoccerNet TimVal 55.54 and PR-AUC 9.30, GPU floor about 16 GB. Footer reads 'NVIDIA figures from its model card with no published results; Microsoft figures vendor-reported.'

证据所在之处

这是比较中差距悬殊的那一部分,值得直言不讳地说明。

Microsoft Mage-VL 是一个已发布模型,配有技术报告、项目页面、GitHub 仓库,以及覆盖图像理解、视频理解、时序定位、空间推理和流式处理的基准测试组合。与 Qwen3-VL-4B 相比——相同的 4B 语言主干,仅替换了视觉编码器——Mage-VL 在所有已报告的视频和时序定位基准上都有提升,其中定位密集型任务上的增益最大:Timelens-QVHighlight 上 +22.5,ActivityNet 上 +17.1,VSI-Bench 上 +11.0,VideoEval-Pro 上 +24.5。它在图像方面报告 DocVQA 95.14、MMStar 67.32 和 CrossPoint 80.00,在视频方面报告 VideoMME 64.0 和 LongVideoBench 61.3,并在流式架构中于 OVO-Bench 上取得 64.00 的总分。所有这些均由 Microsoft 报告,且没有任何一项获得独立复现——但它们确实存在,数量众多,并且在异常广泛的任务集上保持内部一致。

Sports Tennis 未报告任何内容。其卡片记录了一个由 12 场完全留出的比赛组成的测试分区,包含 2,689 个得分点级别的片段和 80,872 个问题,描述了通过自动化多项选择准确率和 LLM-as-judge pass@9 进行评分,并指出报告中测试仅使用了未见比赛划分——然后却没有公布任何结果。其训练语料真实而具体:1,312,129 个问答示例,其中 1,226,081 个为多项选择、86,048 个为开放式,来自 239 场比赛中的 43,084 个片段,并依据来自 2025 年转播和球场拍摄素材的 38 个标注类别进行标注。这些内容都无法从外部核实,而使其可核实的数字却缺失了。

有一个但书会朝相反方向发挥作用,而且值得把它点明,免得这读起来像是微软的完胜。SoccerNet 不是网球。Mage-VL 的流媒体资质来自特定协议下的足球转播数据,而它在 2026 年世界杯上的演示终究只是演示。编解码器原生的门控机制能否顺利迁移到网球——网球中每一分都短促、频繁且高度结构化——尚未得到检验。区别在于,Mage-VL 的说法至少可以被第三方证伪,而 Sports Tennis 的说法,没有 NVIDIA 的数据集,任何人都无法证伪。

A screenshot of the Hugging Face model card for microsoft/Mage-VL, captured September 11, 2026, showing the model described as a codec-native proactive-streaming multimodal foundation model at 4B scale, the claim that codec-aligned sparsity cuts visual tokens by over 75% and yields up to 3.5x wall-clock inference speedup, the pairing of Mage-ViT with a Qwen3-4B-Instruct-2507 decoder, and the SoccerNet streaming table listing Mage-VL-4B at TriggerAcc 79.21, TimVal 55.54, F1 16.35, ROC-AUC 83.14 and PR-AUC 9.30.

需要什么才能运行它们

这里的硬件差距大约有五倍,它决定了谁能实际尝试每个模型。

• Sports Tennis — 单 GPU 需约 80 GB 显存(BF16),权重约 62 GB。最低配置为 A100 80GB 或 H100 80GB,推荐 B200 或 H200。目前未发布量化检查点,因此没有更省显存的低成本方案。仅支持英文。运行环境为 PyTorch/Transformers 加 NeMo 和 Megatron。

• Mage-VL — 在 BF16 下约为 10.6 GB,这意味着 16 GB GPU 是图像任务的实际最低要求,而长视频和流式处理则需要 24 GB 或更多。Mage-VL 采用 Apache-2.0 许可,Mage-ViT 采用 MIT 许可,不过该系列仓库声明这些模型仅供研究用途发布。注意这些硬性限制:trust_remote_code 是必需的,目前还没有 vLLM 或 SGLang 服务路径,编解码器流水线需要 FFmpeg 或 ffprobe——而神经编解码器路径还需要 DCVC-RT。

如果你想本月在单张工作站显卡上评估一个体育视频模型,Mage-VL 是这两者中你实际唯一能加载的。即便还没有基准测试结论,这也是一个务实的判断。

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input and text output, and a minimum GPU of one A100 80GB or H100 80GB, with the sidebar showing two downloads last month and no inference provider deployment.

你会选择哪一个

凡是实时场景——解说、对运行中的视频流做事件检测、广播视频的低延迟告警——Microsoft Mage-VL 都是当下最站得住脚的选择:它正是为此而生,有流式基准测试成绩为其背书,而且能跑在大多数团队已经拥有的硬件上。对于以存档为主、以查询为导向的网球专项工作——构建可检索的得分索引、对数千个多拍回合进行结构化分析、提出以完整单分片段为意义单位的问题——NVIDIA 的模型是二者中唯一为此打造的。至于它能否把这件事做好,截至 2026 年 9 月,确实尚不可知。

还有第三种值得点名的选项,因为大多数真实流水线最终都会落到这里。如果你想试用这个尚未验证的专用模型,又不愿把生产路径押在它上面,就把它放在与你所信任的模型相同的接口之后。OrcaRouter 并不提供这两者中的任何一个——NVIDIA 发布了权重,但没有端点,而 Mage-VL 没有托管服务路径——因此两者都是自托管决策。一张覆盖 200 多个托管模型的单一密钥能为你换来的是技术栈的其余部分:围绕体育视频组件的转录、摘要和应用模型都留在同一个端点之后,如果某个提供商性能下降,会自动故障转移,而你自己运行的两个专用模型则是你唯一拥有的可变部分。

裁决

Microsoft Mage-VL 和 NVIDIA NemotronLabs AI for Media - Sports Tennis 并不是通常意义上的“对比”页面所说的那种竞争对手。Mage-VL 是一个已发布、经过基准测试的 4B 流式模型,可在工作站上运行,并且有事件门控体育解说的真实演示。Sports Tennis 则是一个未公布、未经基准测试的 31B 片段级专用模型,需要数据中心 GPU,且没有任何已发布的证据表明其有效。

如果按证据来评判,Mage-VL不战而胜。若按范围来评判,二者并不重叠。但有一个理由值得继续关注NVIDIA的模型:在一个包含43,084个正确标注的网球得分点的数据集上对冻结编码器进行微调,正是通用模型所不具备的那种狭窄、高质量的垂直领域训练集;如果NVIDIA有一天公布留出集结果,体育视频领域中专家模型与通用模型之争将首次得到真正的答案。在那之前,Mage-VL是有实据的模型,Sports Tennis是有承诺的模型。