NVIDIA NemotronLabs AI for Media - Sports Tennis と Microsoft Mage-VL を比較する生成されたヒーローカード。片側には区切られたテニスのポイントクリップ、もう片側にはハイライトされたイベントマーカー付きの連続フィルムストリップを表示し、3つの対比チップに「クリップ vs ストリーム」「公開スコアなし vs SoccerNet スコア」「80 GB の下限 vs 16 GB の下限」と記され、右下隅には OrcaRouter のロゴがある。
Guides & Insights

Nemotron Sports Tennis vs Microsoft Mage-VL:スポーツ中継を読み解く2つの方法

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Microsoft Mage-VL には、具体的に指し示せる数値がある。SoccerNet の応答タイミングベンチマークでは、TimVal 55.54 と PR-AUC 9.30 を記録し、そのデータセットで一度も訓練されていないにもかかわらず、適合率に敏感な指標群で最良だ。また著者らは、2026年ワールドカップ中継を最後まで見ている間、29.36秒まで沈黙を保ち、選手が突破するとモデルがライブ実況を発する様子を実演している。NVIDIA NemotronLabs AI for Media - Sports Tennis には数値がまったくない。これは、NVIDIA が 2026年9月に公開した、43,084 本のテニスのポイントクリップでファインチューニングされた 31B マルチモーダルモデルであり、モデルカードに完全な評価プロトコルを記載しながら、そこから得られた結果を一つも示していない。

つまりこれは、採点できる一対一の比較ではない。それでもなお、これは実に有益な比較だ。なぜなら、2つのモデルは同じ問い——視覚言語モデルは生のスポーツを追えるのか——に、正反対のアーキテクチャ上の賭けで答えようとしており、その一方の賭けは証拠に裏付けられ、もう一方はデータの説明に裏付けられているからだ。その非対称性こそが、この記事である。

フォーク:ストリームか、それともクリップか

設計の違いはパラメータ数よりも重要であり、それがこれら2つのモデルに関する他のほとんどすべてを説明している。

Microsoft Mage-VLは連続動画を中心に構築されている。その視覚エンコーダーであるMage-ViTはゼロから学習され、コーデックのように動画を読み取る。つまり、ストリームをアンカー(I)フレーム(完全に保持)と予測(P)フレームに分割し、予測フレームでは実際の動きや新しい詳細を含むパッチだけを、共有の16×16パッチグリッド上で保持する。これにより視覚トークンが75%以上削減され、Microsoftによれば、均一なフレームサンプリングと比べて最大3.5倍の実時間推論高速化が得られる。その上にSystem 1 / System 2の分割がある。軽量な認知ゲートが各ローリングウィンドウをスコアリングし、日常的な内容には沈黙し、応答に値するイベントが完了したときにのみフルモデルを呼び出す。これはパイプラインではなく、1つのモデルが両方の役割を担っている。

NVIDIAのテニスモデルは、まったく別の賭けに出ている。そのカードには、「完全なテニスのポイントクリップを入力として渡したときに最もうまく機能する」と明記されている——サーブからラリー終了まで、音声付きの最大2分間のmp4。デフォルトの推論ポリシーは、毎秒2フレームで最大128フレーム、新規トークン256個、貪欲法によるデコーディング、映像+音声。ゲートも、ストリーミングモードも、イベントトリガーもない。これは区切られたクリップに対する質問応答モデルだ。ポイントを渡し、何が起きたのかを尋ねれば、答えてくれる。

それらは一つのアイデアの二つの実装ではない。ストリーミング知覚とクリップレベルの推論は、別々の製品だ。ライブ解説を求める放送事業者にはMage-VLの形が必要であり、43,084点のアーカイブを照会したいアナリストにはSports Tennisの形が必要だ。どちらのモデルも、相手の仕事にそのまま投入できるものではない。

どちらもハイブリッドなバックボーン上に構築されています — ただし、重要な違いが1つあります

• パラメータ — Sports Tennis:総計31B、トークンあたりおよそ3Bがアクティブ、Mamba2-TransformerハイブリッドMoE。Mage-VL:総計4B、316MのMage-ViTとQwen3-4B-Instruct-2507デコーダを組み合わせたもの。

• エンコーダ — Sports Tennis は C-RADIOv4-H ビジョンエンコーダと Parakeet 音声エンコーダの両方を凍結し、言語モデルのパラメータのみをファインチューニングする。Mage-VL は、約1億枚のラベルなし画像と動画を用いて視覚スタック全体をゼロから学習し、Qwen3 言語モデルのみを唯一の事前学習済みコンポーネントとして用いる。

• 音声 — Sports Tennis は音声を第一級の入力として扱い、その 38 のアノテーションカテゴリの一つに音声キュー解釈を挙げている。Mage-VL の公開パイプラインは視覚ベースであり、SoccerNet の取り組みはフレーム上での応答タイミングに関するものである。

• 出力モダリティ — どちらもテキストのみを生成します。

• 乗数効果 — Mage-ViT はウェブスケールのビジョンタワーよりも事前学習のコストが低く抑えられたため、マイクロソフトは同じ予算で8倍長い動画を学習できたと報告している。一方、NVIDIA の効率性の主張はアーキテクチャに基づくものだ。総パラメータ310億のうち、トークンあたり30億のアクティブパラメータである。

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs Microsoft Mage-VL — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Design clip-at-a-time, Audio first-class input, Published scores none, GPU floor about 80 GB. Right column lists Release July 2026, Parameters 4B, Design codec-native streaming with an event gate, Audio not in the published pipeline, Published scores SoccerNet TimVal 55.54 and PR-AUC 9.30, GPU floor about 16 GB. Footer reads 'NVIDIA figures from its model card with no published results; Microsoft figures vendor-reported.'

証拠の在り処

これが比較の中でも全く勝負にならない部分であり、はっきりと言っておく価値がある。

Microsoft Mage-VL は、技術レポート、プロジェクトページ、GitHub リポジトリ、および画像理解、動画理解、時間的グラウンディング、空間推論、ストリーミングをカバーするベンチマークの広がりを備えた公開モデルです。Qwen3-VL-4B と比較すると — 同じ 4B 言語バックボーンで、視覚エンコーダのみを置き換えた — Mage-VL は、報告されているすべての動画および時間的グラウンディングのベンチマークで改善し、ローカリゼーションの比重が大きいタスクで最大の向上を示します。Timelens-QVHighlight で +22.5、ActivityNet で +17.1、VSI-Bench で +11.0、VideoEval-Pro で +24.5 です。画像側では DocVQA 95.14、MMStar 67.32、CrossPoint 80.00、動画では VideoMME 64.0、LongVideoBench 61.3、ストリーミングアーキテクチャの中で OVO-Bench の総合スコア 64.00 を報告しています。これらはすべて Microsoft による報告であり、独立して再現されたものは一つもありません — しかし、それらは存在し、数多くあり、異常なほど広範なタスク群にわたって内部的に整合しています。

Sports Tennisは何も報告していない。そのカードは、完全にホールドアウトされた12試合からなるテスト分割を、2,689個のポイント単位クリップと80,872問とともに記載し、自動多肢選択精度とLLM-as-judge pass@9による採点について説明し、報告対象のテストには未見試合分割のみを使用したと注記しておきながら、結果を一切公表していない。その学習コーパスは実在し具体的だ:1,312,129件のQ&A例、1,226,081件の多肢選択と86,048件の自由回答、239試合にわたる43,084クリップからなり、2025年の放送およびコート撮影映像から38のアノテーションカテゴリに沿ってラベル付けされている。そのいずれも外部から検証することはできず、検証可能にするはずの数値が欠けている。

逆に働く注意点が一つあり、これがMicrosoftの完全な勝利のように読まれないよう、明言しておく価値がある。SoccerNetはテニスではない。Mage-VLのストリーミングに関する実績は、特定のプロトコル下でのサッカー放送データに由来しており、その2026年ワールドカップのデモンストレーションはあくまでデモンストレーションだ。コーデックネイティブのゲートが、ポイントが短く、頻繁で、高度に構造化されているテニスにきれいに転用できるかどうかは検証されていない。違いは、Mage-VLの主張は少なくとも第三者によって反証可能だが、Sports Tennisの主張はNVIDIAのデータセットなしには誰にも反証できないという点だ。

A screenshot of the Hugging Face model card for microsoft/Mage-VL, captured September 11, 2026, showing the model described as a codec-native proactive-streaming multimodal foundation model at 4B scale, the claim that codec-aligned sparsity cuts visual tokens by over 75% and yields up to 3.5x wall-clock inference speedup, the pairing of Mage-ViT with a Qwen3-4B-Instruct-2507 decoder, and the SoccerNet streaming table listing Mage-VL-4B at TriggerAcc 79.21, TimVal 55.54, F1 16.35, ROC-AUC 83.14 and PR-AUC 9.30.

それらを動かすために必要なもの

ここでの差はハードウェアでおよそ5倍であり、誰が各モデルを現実的に試せるかを決める。

• Sports Tennis — GPU 1基でBF16時におよそ80GB、重みは約62GB。最低ラインはA100 80GBまたはH100 80GB、推奨はB200またはH200。量子化済みチェックポイントは公開されていないため、低コストで済ませる道はない。英語のみ。ランタイムはPyTorch/Transformersに加えてNeMoとMegatron。

• Mage-VL — BF16で約10.6 GB。そのため、画像処理の実用的な最低ラインは16 GB GPU、長尺動画やストリーミングには24 GB以上となる。Mage-VLはApache-2.0、Mage-ViTはMITだが、ファミリーのリポジトリにはモデルは研究目的のみで公開されていると記載されている。注意すべき制約点: trust_remote_codeが必要で、vLLMやSGLangによるサービング経路はまだ存在せず、コーデックパイプラインにはFFmpegまたはffprobeが必要 — さらにニューラルコーデックの経路にはDCVC-RTも必要となる。

今月、スポーツ動画モデルをワークステーションのカード1枚で評価したいなら、実際に読み込めるのは2つのうちMage-VLだけだ。これは、ベンチマーク上の判定がなくても、実用上の判定である。

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input and text output, and a minimum GPU of one A100 80GB or H100 80GB, with the sidebar showing two downloads last month and no inference provider deployment.

どちらを手に取りますか

ライブ向けのあらゆる用途——実況、稼働中のフィードでのイベント検出、放送映像での低遅延アラート——において、Microsoft Mage-VL は現時点で正当化できる選択だ。まさにそのために設計されており、それを裏付けるストリーミングベンチマークがあり、ほとんどのチームがすでに持っているハードウェアに収まる。テニスに特化した、アーカイブの比重が大きいクエリ型の作業——ポイントの検索可能なインデックスの構築、数千のラリーにまたがる構造化分析の実行、ポイントクリップ全体が意味の単位となる問いを立てること——には、NVIDIA のモデルが、両者のうちそれ向けに作られた唯一のものである。それがその仕事をうまくこなすかどうかは、2026年9月時点では、本当に未知である。

名前を付ける価値のある第三の選択肢があります。というのも、ほとんどの実際のパイプラインが最終的に行き着くのはそこだからです。実績のない専門モデルを、本番経路をそれに賭けることなく試したいなら、信頼しているモデルと同じインターフェースの背後に置いてください。OrcaRouter はこれらのどちらも提供していません — NVIDIA はエンドポイントなしで重みを公開しており、Mage-VL にはホスト型のサービング経路がありません — そのため、どちらもセルフホスティングの判断になります。では、200以上のホスト型モデルをカバーする単一のキーがあなたにもたらすのは、スタックの残りの部分です。スポーツ動画コンポーネント周辺の文字起こし、要約、アプリケーションモデルは1つのエンドポイントの背後に留まり、プロバイダーが性能低下した場合の自動フェイルオーバーが付き、自分で運用する2つの専門モデルだけが、あなたが所有する可動部分になります。

評決

Microsoft Mage-VL と NVIDIA NemotronLabs AI for Media - Sports Tennis は、通常「対決」ページが意味するような意味でのライバルではありません。Mage-VL は、ワークステーション上で動作し、イベントゲート付きスポーツ実況の実際のデモンストレーションを備えた、公開・ベンチマーク済みの 4B ストリーミングモデルです。Sports Tennis は、未発表・未ベンチマークの 31B クリップレベル特化モデルで、データセンター GPU を必要とし、動作するという公表された証拠を一切伴っていません。

証拠で判断すれば、Mage-VLは不戦勝で勝つ。範囲で判断すれば、両者は重ならない。しかし、NVIDIAのモデルを注視し続ける理由がある。43,084個の正確にアノテーションされたテニスポイントに対する凍結エンコーダのファインチューニングは、汎用モデルが持たない、まさに狭く高品質な垂直トレーニングセットの一種であり、もしNVIDIAがいつかホールドアウト結果を公開すれば、スポーツ動画における専門特化モデル対汎用モデルという問いに初めて本当の答えが与えられる。それまでは、Mage-VLは証拠を持つモデルであり、Sports Tennisは約束を持つモデルである。