一張為 NVIDIA NemotronLabs AI for Media - Sports Tennis 與 InternLumina U2 之間的比較而生成的主視覺卡片,一側顯示網球得分片段圖示,另一側顯示文字加圖像的輸出堆疊,標示為僅輸出文字的 31B 專用模型,對比可同時輸出文字與圖像的 16B 統一模型,右下角則有 OrcaRouter 標誌。
Guides & Insights

Nemotron Sports Tennis 對戰 InternLumina U2:一場兩款模型都輸不起的比較

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

問哪個比較好——NVIDIA NemotronLabs AI for Media - Sports Tennis 還是 InternLumina U2——誠實的答案是:這個問題無法解決。這兩個儲存庫都在 2026 年 9 月出現在 Hugging Face 上,都是由資金充裕的實驗室打造的混合專家多模態模型,除此之外幾乎沒有其他共同點。NVIDIA 的模型是 310 億參數的專門模型,能判讀單一網球分數並回答相關問題。InternLumina U2 出自上海人工智慧實驗室的 InternLM 團隊,發布名稱為 internlm/InternLumina-U2,是 160 億參數的統一模型,能理解圖像、影片和 3D,還能生成與編輯它們沒有共同的基準測試、目標使用者或部署配置。比較這兩者,與其說像在挑手機,不如說像在聽診器和 3D 印表機之間做選擇。

無論如何,這組配對之所以值得一寫,在於兩個模型共享的一個模式:兩者都未經獨立評估,而且都被各自的供應商描述為尚未完成的東西。這才是真正的比較——不是哪個模型勝出,而是今天你實際上能驗證其中任何一個到什麼程度。

兩個不同的工作,共用同一個詞

「多模態」涵蓋了這兩者,卻什麼也沒告訴你。區分如下:

• 輸入內容 — 運動網球:影片(mp4,最長 2 分鐘)、音訊(wav/mp3)、圖像、文字。InternLumina U2:文字、圖像、影片與 3D。在這兩者之中,只有網球模型具備 實質音訊路徑,透過 Parakeet 語音編碼器串接,能與畫面同步判讀群眾與擊球聲響。

• 它能回傳什麼——Sports Tennis:僅限文字。InternLumina U2:文字生成或編輯過的圖像,透過以 AToken 為基礎打造的 8 碼本全離散視覺表徵來實現。

• 使用者問的是什麼 — 運動網球:「這一分發生了什麼事、球員當時站在哪裡、球是否落在界內。」InternLumina U2:「描述這張圖表,然後幫我畫出它的新版本。」

• 架構 — Sports Tennis:Mamba2-Transformer 混合式 MoE,總計 31B,每個 token 約有 3B 活躍參數,其主幹與編碼器承襲自 Nemotron 3 Nano Omni。InternLumina U2:16B 稀疏 MoE,具 1B 活躍參數,建構為多碼本擴散語言模型,而非傳統的自迴歸模型。

• 上下文 —— Sports Tennis 公布最高達 256k tokens。InternLumina U2 的規格卡並未標示上下文數字。

• 授權 — Sports Tennis 以 OpenMDW-1.1 發佈,其卡片載明可作商業與非商業用途。InternLumina U2 為 Apache 2.0。

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs InternLumina U2 — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Inputs video audio image text, Output text only, Published benchmarks none, GPU floor 1 x 80 GB. Right column lists Release September 2026, Parameters 16B (about 1B active), Inputs text image video 3D, Output text and generated images, Published benchmarks partial and vendor-reported, GPU floor not specified. Footer reads 'NVIDIA figures from its model card; InternLumina figures vendor-reported and preliminary. No independent evaluation of either.'

真正讓它們無從比較的那一點

沒有共用的計分板,而值得把原因說清楚,而不是含糊地聳聳肩就算了。

Sports Tennis 在專有的 NVIDIA 網球資料集上微調 —— 涵蓋來自 239 場比賽的 43,084 個逐分片段、共 1,312,129 個問答範例,依 38 個標註類別標記,全部於 2025 年蒐集。其測試集是保留的劃分,包含 12 場比賽、2,689 個片段與 80,872 個問題。這些產物每一項都屬於 NVIDIA 自己。沒有任何外部團隊擁有這些資料,因此沒有任何外部團隊能重現分數 —— 而實際上,NVIDIA 並未公布任何可供重現的分數。該模型卡詳細記載了評估協定,卻未報告由此得出的任何結果。完全沒有準確率相關資訊,沒有各類別結果,什麼都沒有。

InternLumina U2 位於同一道牆的另一側。它發布數字,但這些數字明確是局部的。模型卡用一句話說明了這點:「初步、局部結果。完整比較表將在即將發布的技術報告中出現。」現有的是跨越多種非常不同能力的廠商回報數據——文件方面 ChartQA 86.52 與 CharXiv-DQ 83.65,視覺數學方面 MathVision 33.22 與 DynaMath 56.37,影片方面 VideoMME 51.26 與 MVBench 59.74,3D MM-Vet 41.8,生成方面 DPG-Bench 87.10 與 GenEval 0.81,編輯方面 ImgEdit 3.83。而專案頁面自己的表格顯示,該模型至少在一項頭條指標上落後於至少一個具名競爭對手:GenEval 0.81 對上 LLaDA2.0-Uni 的 0.89。

所以,一個模型有已記載的評估卻沒有結果,另一個則有結果,但評估明確不完整。兩者都沒給你一個能拿來與另一方並列比較的數字。任何把這兩者排名的頁面,都是自己編造出那個排名。

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table listing 31B total parameters, about 3B active per token, a 256k-token maximum context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips from 239 matches, and a minimum of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

在它們真正重疊之處,以及這顯示了什麼

影片理解是雙方唯一都宣稱涵蓋的領域,而即便在這個領域,兩者的重疊也比表面上更少。InternLumina U2 回報 VideoMME 51.26、MLVU 57.03 與 MVBench 59.74——這些是一般影片理解分數,由廠商自行提供。Sports Tennis 則什麼都沒回報,但其說明卡描述了一項狹窄得多、也深入得多的任務:在有音訊的完整來回對打中進行逐分推理,涵蓋 38 個細粒度標註類別,包括擊球機制、場上站位、移動與比分狀態。

合理的推論是,InternLumina U2 會是更好的通才,而 Sports Tennis 會是更優秀的網球判讀者,但這只是從任務型態得出的推論,並非來自資料。它很可能在任一方向上出錯。而非推論的是:通用影片基準與專有的逐分網球基準不能放在同一條軸線上,且 16B 統一生成器與 31B 凍結編碼器專家模型並非為了回答同一個問題而打造。

執行其中任何一個都是不同類型的專案

部署,就是落差不再只是哲學問題的地方。

Sports Tennis 指出,硬性最低需求為一張 GPU,在 BF16 下約需 80 GB 記憶體,權重約 62 GB,並已在 A100、H100、H200、B200、GB200 NVL72、RTX PRO 6000 SE、L40S、DGX Spark、Jetson Thor 與 RTX 5090 上測試過。目前沒有量化檢查點,因此現階段 80 GB 的需求沒有下調的空間。此外,它目前僅支援英文。

InternLumina U2 更有意思的問題不在於記憶體,而在於晶片。該儲存庫依訓練硬體分別存放檢查點:一個完整的 ascend/ 目錄,內含七個在華為 Ascend NPU 上訓練的 safetensors 分片,以及一個 nvidia/ 目錄,標示為「即將推出」。若你使用的是 NVIDIA 硬體——對於一個其姊妹模型是 Nemotron 網球微調版本的模型而言,這正是大多數讀者的情況——你想要的那個檢查點,恰恰是尚未落地的那一個。推論程式碼與安裝說明放在 InternLM 的 GitHub 儲存庫,而非 Hub 上,且技術報告仍待發布。

這顛覆了人們通常的預期。專有、未經基準測試、家電式的模型,才是你現在、第一天就能下載並執行的模型。而 Apache-2.0 的開放研究模型,則還在等待針對特定硬體的建置版本。

A screenshot of the Hugging Face model card for internlm/InternLumina-U2, captured September 11, 2026, showing the Apache 2.0 licence, the description as a 16B-parameter MoE with 1B active parameters and an 8-codebook fully-discrete visual representation, the note that the repository hosts checkpoints split by training hardware with ascend/ trained on Huawei Ascend NPUs and nvidia/ marked coming soon, and the benchmarks section stating preliminary, partial results pending the technical report.

路由器適用之處——以及不適用之處

這兩個模型都沒有託管在 OrcaRouter 上,而這件事沒有什麼誠實的寫法可以迴避。Sports Tennis 在任何地方都沒有端點;NVIDIA 只發布了權重,別無其他。InternLumina U2 自己的儲存庫指出,NVIDIA 的檢查點仍待發布,所以我們這邊也沒有任何東西可以提供。這兩者都是自行託管的決定,而不是路由的決定。

路由問題出現在再上一層。一個團隊若想拿 Sports Tennis 這類專才模型去對比 InternLumina U2 這樣的通才模型,不會把它單獨拿來評估——而是把它當成整條流水線中的一個候選項目,而這條流水線還需要語音轉錄、文件處理、摘要,以及圍繞這些功能的應用邏輯。這些元件都是託管服務,而它們正是一把涵蓋 200 多個模型、可跨供應商自動容錯切換的 API 金鑰能省下一週整合工時的地方。一把金鑰就能搞定你可以呼叫的模型,因此你得自己跑的,才是你真正要維護的東西。

未解決的問題

將 NVIDIA NemotronLabs AI for Media - Sports Tennis 和 InternLumina U2 並列來看,恰好相當程度地說明了公開推出多模態模型的兩種糟糕方式。其中一個記錄了自身的評估過程,卻隱瞞了結果;另一個公布了結果,卻將其評估標示為不完整。截至 2026 年 9 月,兩者都是無法證偽的主張。

值得關注的有趣之處,不在於哪一個結果更強——它們永遠不會在同一件事上受到測試。而在於哪個實驗室先縮小自己的差距。如果 NVIDIA 公布網球數據,那它將解決了更難的問題,因為由 12 場未見過的比賽所組成的專有保留基準,是為領域微調評分的唯一誠實方式,而 NVIDIA 已經建立好了這個劃分。如果 InternLM 發布 NVIDIA 的檢查點與技術報告,那它將使其 Apache-2.0 模型在使用者自己擁有的硬體上真正可用。無論發生哪一種情況,這份比較都值得重新細讀——因為現在,這兩個模型卡所能支持的最站得住腳的結論,就是一個聳肩。