
Nemotron Sports Tennis 與 Microsoft Mage-VL:解讀體育轉播的兩種方式
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 每百萬 tokens
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Microsoft Mage-VL 有一個你可以直接指出的數字:在 SoccerNet 回應時序基準上,它交出 55.54 的 TimVal 與 9.30 的 PR-AUC,在對精確率敏感的指標上表現最佳,儘管從未在那個資料集上受過訓練,而它的作者也展示了它全程盯著一場 2026 世界盃轉播、始終保持沉默,直到第 29.36 秒一名球員突破時,模型才即時啟動播報。NVIDIA NemotronLabs AI for Media - Sports Tennis 則完全沒有任何數字。它是一個 31B 多模態模型,以 43,084 段網球得分短片微調而成,NVIDIA 於 2026 年 9 月發布,其模型卡上載有完整的評估協議,卻沒有一項來自該協議的結果。
所以,這不是一場你能打分的正面對決。但無論如何,這仍是個真正有用的比較,因為這兩個模型用相反的架構賭注,回答了同一個問題——視覺語言模型能否跟上直播運動賽事——而其中一個賭注有證據支持,另一個則有資料描述支撐。這種不對稱,就是這篇文章。
分支:串流,還是短片
設計差異比參數量更為重要,而它也幾乎解釋了這兩個模型的其他一切。
Microsoft Mage-VL 是圍繞連續視訊打造的。它的視覺編碼器 Mage-ViT 從頭訓練,像編解碼器一樣讀取視訊:它將串流拆分為完整保留的錨定(I)幀與預測(P)幀,而在共用的 16×16 修補網格上,只保留帶有真實動作或新細節的區塊。這能將視覺 token 減少超過 75%,且根據 Microsoft 的說法,相較於均勻影格取樣,可帶來最高 3.5 倍的實際推論加速。在此之上還有 System 1 / System 2 的分工:輕量的認知閘門會為每個滾動視窗評分,對例行內容保持靜默,只有在值得回應的事件完成時才喚起完整模型。這是同一個模型同時執行這兩項工作,而不是一條管線。
NVIDIA 的網球模型完全押在另一邊。它的說明卡明確寫道,它「在以完整的網球單分片段作為輸入時效果最佳」——從發球到這一分結束,最長兩分鐘的 mp4,含音訊。預設推論策略是每秒 2 幀、最多 128 幀,256 個新 token,貪婪解碼,影片加音訊。沒有閘控、沒有串流模式、沒有事件觸發。它是一個針對有界片段的問答模型:你給它一分,你問發生了什麼,它告訴你。
那些不是同一個想法的兩種實作。串流感知與片段層級推理是不同的產品。想要即時播報的廣播業者需要 Mage-VL 這種形態。想要查詢 43,084 分檔案的分析師需要 Sports Tennis 這種形態。這兩個模型都無法直接取代彼此的工作。
兩者都建構在混合骨幹之上——但有一個重要差異
• 參數 — Sports Tennis:總計 31B,每個 token 約 3B 活躍參數,Mamba2-Transformer 混合式 MoE。Mage-VL:總計 4B,316M Mage-ViT 搭配 Qwen3-4B-Instruct-2507 解碼器。
• 編碼器 — Sports Tennis 凍結 C-RADIOv4-H 視覺編碼器與 Parakeet 語音編碼器,僅微調語言模型參數。Mage-VL 則以約 1 億張無標註圖像與影片從頭訓練其整個視覺堆疊,並以 Qwen3 語言模型作為唯一預訓練元件。
• 音訊 — Sports Tennis 將音訊視為一等輸入,並將音訊提示解讀列在其 38 個標註類別之中。Mage-VL 已發表的管線是視覺導向的;SoccerNet 的研究則是關於影格上的回應時序。
• 模態輸出 — 兩者僅產生文字。
• 乘數效應——由於 Mage-ViT 的預訓練成本低於網頁規模的視覺塔,微軟表示在相同預算下可訓練長達 8 倍的影片。NVIDIA 的效率主張則是架構層面的:總計 31B 參數中,每個 token 有 3B 活躍參數。

證據所在之處
這是這項比較中差距懸殊的部分,值得直言不諱地說清楚。
Microsoft Mage-VL 是一個已發表的模型,具備技術報告、專案頁面、GitHub 儲存庫,以及涵蓋影像理解、影片理解、時序定位、空間推理與串流的廣泛基準測試。相較於 Qwen3-VL-4B——同樣的 4B 語言主幹,只更換了視覺編碼器——Mage-VL 在每一項已報告的影片與時序定位基準上都有所提升,其中在以定位為主的任務上增益最大:Timelens-QVHighlight 上 +22.5、ActivityNet 上 +17.1、VSI-Bench 上 +11.0、VideoEval-Pro 上 +24.5。在影像方面,它報告了 DocVQA 95.14、MMStar 67.32 與 CrossPoint 80.00;影片方面則是 VideoMME 64.0 與 LongVideoBench 61.3;而在串流架構中,於 OVO-Bench 上取得 64.00 的整體分數。這些全都是 Microsoft 自行報告的數據,且沒有任何一項經過獨立重現——但它們確實存在、數量眾多,並且在異常廣泛的一組任務中保持內部一致。
Sports Tennis 未報告任何內容。其模型卡記載了一個由 12 場完全保留的比賽所組成的測試分割,內含 2,689 個球點層級片段與 80,872 道問題,描述了以自動選擇題準確率與 LLM-as-judge pass@9 進行評分,並指出所報告的測試僅使用了未見比賽分割——然後未發布任何結果。其訓練語料真實且具體:1,312,129 個問答範例,其中 1,226,081 個選擇題與 86,048 個開放式問題,來自 239 場比賽的 43,084 個片段,並依 38 個標註類別,從 2025 年轉播與球場擷取影像中標記。這些全都無法從外部驗證,而能讓其可驗證的數字則付之闕如。
有一項但書會往相反方向作用,而它值得被點名,這樣才不會讓這段讀起來像是微軟的一場完勝。SoccerNet 不是網球。Mage-VL 的串流實力證明來自特定協議下的足球轉播資料,而它在 2026 世界盃的展示也僅是一次展示。編解碼器原生閘控能否順利移轉到網球——網球的分數短、頻繁且高度結構化——尚未經過測試。差別在於,Mage-VL 的主張至少可由第三方否證,而 Sports Tennis 的主張,若沒有 NVIDIA 的資料集,任何人都無法否證。

運行它們需要什麼
這裡的硬體差距大約是五倍,而這決定了誰能實際嘗試每個模型。
• Sports Tennis — 單張 GPU 在 BF16 下約需 80 GB,權重約 62 GB。最低需 A100 80GB 或 H100 80GB,建議使用 B200 或 H200。目前未發布量化檢查點,因此沒有低成本降規途徑。僅限英文。執行環境為 PyTorch/Transformers,外加 NeMo 與 Megatron。
• Mage-VL — 在 BF16 下約 10.6 GB,這使得 16 GB 的 GPU 成為影像處理的實際門檻,而長時間影片與串流則需要 24 GB 以上。Mage-VL 採用 Apache-2.0,Mage-ViT 採用 MIT,不過該系列儲存庫聲明這些模型僅供研究用途發布。請注意幾個棘手之處:trust_remote_code 是必要項目,目前尚無 vLLM 或 SGLang 的服務途徑,而且編解碼器管道需要 FFmpeg 或 ffprobe——其中神經編解碼器途徑還額外需要 DCVC-RT。
如果你這個月想用單張工作站顯卡來評估一個運動影片模型,Mage-VL 是兩者中唯一一個你真的載得動的。即使還沒有基準測試的結論,這仍是一個務實的判斷。

你會選擇哪一個?
任何即時性質的工作——賽事解說、在進行中的串流上做事件偵測、廣播視訊的低延遲告警——Microsoft Mage-VL 都是當前站得住腳的選擇:它正是為此而設計,有串流基準測試可為它背書,而且能跑在多數團隊早已擁有的硬體上。至於以檔案為重、以查詢為導向的工作,尤其是在網球領域——建立可搜尋的得分索引、對數千個來回球進行結構化分析、提出以整段得分影片為意義單位的問題——NVIDIA 的模型是兩者之中唯一為此打造的。至於它做得好不好,截至 2026 年 9 月,仍是個未知數。
還有第三個值得點名的選項,因為大多數真實管線最後都落在這裡。如果你想試用尚未經過驗證的專用模型,又不想把正式生產路徑押在它身上,就把它留在與你信任的模型相同的介面之後。OrcaRouter 並未提供這兩者——NVIDIA 只發布權重、沒有端點,而 Mage-VL 也沒有託管服務路徑——所以兩者都屬於自行託管的決定。一把涵蓋兩百多個託管模型的單一金鑰能為你換來的是堆疊的其餘部分:運動影片元件周遭的轉錄、摘要與應用模型都留在同一個端點之後,若供應商服務品質下降還能自動容錯移轉,而你自己執行的那兩個專用模型,則是整套架構中唯一由你掌握的可變元件。
裁決
Microsoft Mage-VL 與 NVIDIA NemotronLabs AI for Media - Sports Tennis 並非一般對比頁面通常所指的那種競爭對手。Mage-VL 是一個已發表、經基準測試的 4B 串流模型,可在工作站上運行,並有事件觸發運動賽事評論的實際演示。Sports Tennis 則是一個未公布、未經基準測試的 31B 片段層級專門模型,需要資料中心 GPU,且沒有已發表的證據顯示它能運作。
以證據來評判,Mage-VL 因對手棄權而勝出。以範圍來評判,兩者並不重疊。但有一個理由值得繼續關注 NVIDIA 的模型:在 43,084 個正確標註的網球得分上進行凍結編碼器微調,正是通用型模型所沒有的那種狹窄、高品質的垂直訓練集;而如果 NVIDIA 哪天公布留出集結果,運動影片中專才與通才之爭就能首次得到真正的答案。在那之前,Mage-VL 是握有實據的模型,而 Sports Tennis 則是帶著承諾的模型。
