
Nemotron Sports Tennis 对决 InternLumina U2:一场两个模型都输不起的对比
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 每百万 tokens
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
问哪个更好——NVIDIA NemotronLabs AI for Media - Sports Tennis 还是 InternLumina U2——诚实的答案是,这个问题无法定论。这两个仓库都在 2026 年 9 月出现在 Hugging Face 上,都是由资金充足的实验室构建的混合专家多模态模型,除此之外几乎毫无共同点。NVIDIA 的模型是一个 31B 的专用模型,读取单个网球得分点并回答相关问题。InternLumina U2 来自上海人工智能实验室的 InternLM 团队,发布为 internlm/InternLumina-U2,是一个 16B 的统一模型,能够理解图像、视频和 3D,还能 生成和编辑 图像。它们没有共享的基准、目标用户或部署场景。比较它们不太像是选手机,更像是要在听诊器和 3D 打印机之间做选择。
说到底,这一对组合之所以值得一写,是因为两个模型共享同一种模式:二者都未经独立评估,而且都被各自的厂商描述为某种尚未完成的东西。这才是真正的对比——不是哪个模型胜出,而是今天你究竟能验证其中任何一个多少。
两个不同的职位顶着同一个名称
“多模态”涵盖了这两者,却什么也没告诉你。以下是区分:
• 输入内容——Sports Tennis:视频(mp4,最长 2 分钟)、音频(wav/mp3)、图像、文本。InternLumina U2:文本、图像、视频和 3D。两者之中,只有网球模型具备实质性的音频通路,它经由 Parakeet 语音编码器接入,在读取画面的同时读取人群声与撞击声。
• 它能给出什么 —— Sports Tennis:仅文本。InternLumina U2:文本 和通过基于 AToken 构建的 8 码本全离散视觉表示生成或编辑的图像。
• 用户提出的问题——体育网球:“这一分发生了什么,球员当时站在哪里,球是否落在界内。” InternLumina U2:“描述这张图表,然后为我画出它的新版本。”
• 架构 — Sports Tennis:Mamba2-Transformer 混合 MoE,总参数量 31B,每个 token 约 3B 活跃参数,其主干网络和编码器继承自 Nemotron 3 Nano Omni。InternLumina U2:一个 16B 稀疏 MoE,具有 1B 活跃参数,构建为多码本扩散语言模型,而非传统的自回归模型。
• 上下文 — Sports Tennis 公布的最高为 256k tokens。InternLumina U2 的模型卡未标明上下文数值。
• 许可证 — Sports Tennis 以 OpenMDW-1.1 发布,其模型卡声明允许商业和非商业使用。InternLumina U2 采用 Apache 2.0 许可。

真正让它们无法相提并论的东西
并不存在一块共享的记分牌,而值得把原因说清楚,而不是含糊地耸耸肩了事。
Sports Tennis 基于 NVIDIA 专有的网球数据集微调——涵盖 239 场比赛中的 43,084 个分球级片段,共 1,312,129 个问答示例,按 38 个标注类别进行标注,全部于 2025 年采集。其测试集是留出的一个划分,包含 12 场比赛、2,689 个片段和 80,872 个问题。这些产物中的每一个都属于 NVIDIA 自己。没有任何外部团队拥有这些数据,因此没有任何外部团队能够复现分数——而事实上,NVIDIA 根本没有公布可供复现的分数。该模型卡详细记录了评估协议,却没有报告任何由此得出的结果。没有准确率,没有各类别结果,什么都没有。
InternLumina U2 位于同一堵墙的另一侧。它公布了数字,但这些数字明确是不完整的。模型卡用一句话说明了这一点:“初步的、部分的结果。完整的对比表将出现在即将发布的技术报告中。”现有的是分散的厂商报告数据,涵盖差异极大的能力——文档方面的 ChartQA 86.52 和 CharXiv-DQ 83.65,视觉数学方面的 MathVision 33.22 和 DynaMath 56.37,视频方面的 VideoMME 51.26 和 MVBench 59.74,3D MM-Vet 41.8,生成方面的 DPG-Bench 87.10 和 GenEval 0.81,编辑方面的 ImgEdit 3.83。而项目页面自己的表格显示,该模型在至少一项核心指标上落后于至少一个具名竞争对手:GenEval 0.81,而 LLaDA2.0-Uni 为 0.89。
所以,一个模型有记录在案的评估却没有结果,另一个有结果,但评估明确不完整。两者都没给你一个可以拿来彼此对照的数字。任何给这两个模型排名的页面,都是自己编造了排名。

它们真正重叠的地方,以及这说明了什么
视频理解是双方都声称拥有的领域,而即便在这一领域,两者的重叠也比表面看起来要少。InternLumina U2 报告了 VideoMME 51.26、MLVU 57.03 和 MVBench 59.74——这些是通用视频理解分数,且由厂商自行报告。Sports Tennis 则没有报告任何分数,但其说明卡描述了一项范围窄得多、也深得多的任务:在带音频的完整回合中进行逐分推理,涵盖 38 个细粒度标注类别,包括击球机制、球场站位、移动和比分状态。
合理的推断是,InternLumina U2 会是更好的通才,而 Sports Tennis 会是更好的网球解读模型,但这是从任务形态出发的推断,而不是从数据出发的推断。它很容易在任一方向上出错。并非推断的是,通用视频基准和专有的分点级网球基准不能放在同一坐标轴上,而且 16B 统一生成器和 31B 冻结编码器专家模型并不是为了回答同一个问题而构建的。
运行其中任何一个都是另一种类型的项目
部署,正是差距不再停留于哲学层面的地方。
Sports Tennis 表示硬性下限为一块 GPU,在 BF16 下约 80 GB 显存,权重约 62 GB,已在 A100、H100、H200、B200、GB200 NVL72、RTX PRO 6000 SE、L40S、DGX Spark、Jetson Thor 和 RTX 5090 上测试。没有量化检查点,因此目前 80 GB 的要求没有下调余地。它还仅限英语。
InternLumina U2 更有意思的问题不在于内存,而在于芯片。该仓库按训练硬件划分托管了多个检查点:一个完整的 ascend/目录,包含七个在华为昇腾 NPU 上训练的 safetensors 分片;而 nvidia/目录则标注为“即将推出”。如果你使用的是 NVIDIA 硬件——对于一个其同门版本是 Nemotron 网球微调版的模型来说,本文的大多数读者都属于这种情况——你想要的那个检查点恰恰是尚未发布的那一个。推理代码和安装说明位于 InternLM 的 GitHub 仓库中,而非 Hub 上,技术报告也仍未发布。
这颠覆了通常的预期。那个专有的、未经基准测试的、一体机形态的模型,才是你现在第一天就能下载并运行的。而 Apache-2.0 开放研究模型,则还在等待针对特定硬件的构建。

路由器适合用在哪里——以及不适合用在哪里
这两个模型都没有托管在 OrcaRouter 上,而且没有任何诚实的方式能绕开这一点来写。Sports Tennis 在任何地方都没有端点;NVIDIA 只发布了权重,别的什么都没有。InternLumina U2 自己的仓库指出 NVIDIA 检查点仍待发布,所以我们这边同样没有任何可供服务的内容。无论从哪一点看,这都是一个自托管决策,而不是路由决策。
路由问题出现在上一层。一个团队想要评估像 Sports Tennis 这样的专精模型与像 InternLumina U2 这样的通用模型孰优孰劣,并不会孤立地进行——他们会把它当作流水线中的一个候选,而这条流水线同时还需要语音转写、文档处理、摘要生成,以及围绕这些环节的应用逻辑。这些组件都是托管服务,而正是一个覆盖 200 多个模型的 API 密钥凭借跨提供商的自动故障转移,能省下一周的集成工作。你能调用的模型只需一个密钥,于是那些必须自己运行的模型,才是你真正要维护的东西。
悬而未决的问题
把 NVIDIA NemotronLabs AI for Media - Sports Tennis 和 InternLumina U2 并排放在一起,就能很好地说明公开推出多模态模型的两种糟糕方式。一个记录了自己的评估过程,却隐瞒了结果;另一个公布了结果,却将自己的评估标注为不完整。截至 2026 年 9 月,两者都是不可证伪的说法。
真正值得关注的,不是哪一个最终会更强——它们永远不会在同一件事上受到检验。真正值得关注的是,哪一个实验室先弥合自己的差距。如果 NVIDIA 公布网球领域的数字,那它解决的就是更难的问题,因为由 12 场未见比赛组成的专有留出基准,是给领域微调打分的唯一诚实方式,而 NVIDIA 已经构建好了这个划分。如果 InternLM 发布 NVIDIA 检查点和技术报告,那它就让自己采用 Apache-2.0 的模型真正能在用户拥有的硬件上派上用场。无论发生哪一种,这次比较都值得再读一遍——因为眼下,这两个模型卡所能支撑的最经得起推敲的结论,就是耸耸肩。
