NVIDIA NemotronLabs AI for Media - Sports Tennisモデルの生成されたタイトルカード。モデル名、合計31Bで約3Bがアクティブ、256kコンテキスト、ビデオ+オーディオ+画像+テキスト入力を示す3つのチップ、フラットなテニスコートの線図、そして右下隅にOrcaRouterのロゴが表示されている。
Engineering & Research

NVIDIA NemotronLabs AI for Media - Sports Tennis はひっそりとリリース:リポジトリが語っていること、語っていないこと

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

NVIDIA NemotronLabs AI for Media - Sports Tennis は、テニスのポイントに関する質問に答える 31B のマルチモーダルモデルだが、2026年9月11日時点で、その存在に気づいている人はほとんどいない。このリポジトリは2026年9月1日に Hugging Face に登場し、モデルカードにはリリース日として 09/10/2026 が記載されている。NVIDIA のブログ投稿も、技術レポートも、報道も、リーダーボードへの登録も、価格ページも存在しない。Hub のダウンロードカウンターは2と表示されていた(私たちが確認した時点では)。これは失敗したローンチではない——NVIDIA が発表しなかったリリースであり、おそらく誰かに使ってもらうことを意図しているモデルに関するものだ。

「重みは存在する」と「ベンダーは何も語っていない」の間にあるこの隔たりこそが、ここでの話のすべてだ。だから本稿は、リポジトリが実際に文書化している内容にとどまり、どこで止まるのかを明確に示す。以下でNVIDIA自身の数値として示されているものはすべてモデルカードに由来する。このモデルについて引用できる独立した評価は存在しない。存在しないからだ。

NVIDIAが実際に公開したもの

このカードは、誰も発表していないものにしては異例なほど詳細だ。それが明らかにしているのは次のとおり:

• ベースモデル — nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 のファインチューンであり、それ自体が NVIDIA の2026年4月のオムニモーダルリリースである。テニスモデルは、ゼロから始めるのではなく、そのアーキテクチャを継承している。

• アーキテクチャ — Mamba2-Transformer ハイブリッドの Mixture of Experts。総パラメータ数は 31B で、トークンあたり約 3B がアクティブ、コンテキストは最大 256k トークン。Hub のサイドバーではモデルサイズが 33B と表示されている一方、カードの本文には 31B と記されており、カード側にその不一致を説明する記述はない。これは、ドキュメントの確認を経ずに出荷されたことを示す、いくつかのささいな兆候の一つである。

• エンコーダ — 画像および動画フレームには C-RADIOv4-H、音声には Parakeet。どちらも凍結されており、ファインチューニング中に学習されたのは言語モデルのパラメータのみだった。

• トレーニングデータ — 独自のものと説明されているNVIDIA社内のテニスデータセット:239試合にわたる43,084本のポイント単位のビデオクリップから抽出され、38のアノテーションカテゴリに沿ってラベル付けされた1,312,129件の質問応答例(1,226,081件の多肢選択式および86,048件の自由回答式)。収集は2025年。

• 評価設定 — 報告されているテストセットは「Test (unseen matches)」パーティションです。12 件の完全にホールドアウトされた試合、2,689 個のクリップ、80,872 件の Q&A 例があり、自動多肢選択の精度と、オープンエンド側では LLM-as-judge pass@9 で採点されています。カードには、「seen matches」パーティションが存在し、報告された数値には使用されることはなかった、これはほとんどのカードがわざわざ行わない、より慎重な開示であると記載されています。

• ライセンス — OpenMDW-1.1。カードには、このモデルが商用・非商用利用に対応していると記載されています。

• ランタイムとハードウェア — PyTorch と Hugging Face Transformers、さらに NeMo と Megatron。NVIDIA は、A100、H100、H200、B200、GB200 NVL72、RTX PRO 6000 SE、L40S、DGX Spark、Jetson Thor、RTX 5090 にわたるテスト用ハードウェアを挙げています。

• どのように作られたか — このカードは NVIDIA Sports Intelligence playbooks をクレジットしている。これは、スポーツ映像とアノテーションを専門的なマルチモーダルモデルに変換するために NVIDIA が公開している公開レシピ集だ。そのリンクが、今回のリリースで告知に最も近いものになっている。

A generated single-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis — the scoreboard' listing six rows: Release September 2026 unannounced, Total parameters 31B with about 3B active, Context 256k tokens, Inputs video audio image text, Published benchmark scores none, and GPU floor 1 x 80 GB, with a footer reading 'Figures per NVIDIA's model card; no independent evaluation exists.'

リポジトリが語らないこと

省略されている事柄は、含まれている事柄よりも重要だ。なぜなら、それこそが誰もこのモデルを外部から評価できないようにしているものだからだ。

数字がない。 一つも。カードは評価手法を三つの別個のセクション——トレーニングデータセット、テストデータセット、評価データセット——で説明しながら、そのどれからも結果を公表していない。MCQの精度も、ジャッジの合格率も、これら38カテゴリにわたるカテゴリ別の内訳も、主要な数値ひとつさえない。NVIDIAはモデルをどのように測定したかは正確に説明しているのに、どのようなスコアだったかは明かしていない。それは悪い結果と同じではない。単なる不明であり、このリリースを製品というより未完成なものとして扱うべき最大の理由である。

技術レポートも論文も存在しない。トレーニングの説明と照合できるものは何もなく、テニスのファインチューニングがベースのNemotron 3 Nano Omniに対して何を追加したかについてのアブレーションもなく、視覚エンコーダーと音声エンコーダーが凍結されたまま言語モデルだけが動いた理由の説明もない。

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table (31B total parameters, about 3B active, 256k context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips from 239 matches, minimum one A100 80GB or H100 80GB), the openmdw-1.1 licence, and a sidebar reading 'Downloads last month 2', 'Model size 33B params', 'This model isn't deployed by any Inference Provider', and an AI for Media collection containing one item.

APIもなく、ホスト型エンドポイントもなく、価格もありません。 これはセルフホスト専用であり、Hubはそれを明示しています。Inference Providersの項目では、ページに「このモデルはどのInference Providerによってもデプロイされていません」と表示されます。カードのデプロイセクションには、BF16では約80 GBのメモリを搭載した単一のGPUが必要で、重みは約62 GBであると記載されています。つまり最低ラインがA100 80GBまたはH100 80GBで、推奨はB200またはH200です。呼び出すものも、計測するものも何もありません。

その名前は、現時点ではモデル1つ分の深さしかないファミリーを指している。「AI for Media - Sports Tennis」は確かに実在するもの——このモデルが属するHub上の「AI for Media」コレクション——を指してはいるが、そのコレクションに含まれる項目はちょうど1つ、これだけであり、NVIDIAは兄弟モデルやロードマップについて何も語っていない。つまりこの命名は意図を示す本物のシグナルではあるが、まだ一連の製品ラインの証拠とまでは言えない。

そして、ここで「静か」が何を意味するのかについては、何も述べられていない。 完全なデータセットの説明と評価プロトコルを添えて重みを公開しながら、結果を一切示していないベンダーは、モデルを隠しているわけではない。それは、書き上げられる前に先走って出てしまった研究資料のように見える。カード自体の例示プロンプトには、2025年の試合映像に基づく実在の選手名——ジル・タイヒマンとビクトリア・ムボコ——が挙げられており、これは2025年のデータ収集期間と、それ以降の数か月をかけて構築されたモデルに符合する。

なぜそもそもテニスモデルなのか

このリリースで興味深いのは、モデルそのものではない。それが示す方向性だ。

43,084件のポイント単位クリップでファインチューニングされた31Bのマルチモーダルモデルは、バーティカル製品であり、汎用的な能力を競うものではない。最先端のチャットモデルとは何においても競合しておらず、競合することを意図してもいない。テニスの1ポイント全体を——サーブからラリーの終わりまで——音声付きで読み取り、ショットのメカニクス、コート上のポジショニング、選手の動き、試合状況、ルール、音声キューに関する構造化された質問に答える。モデルカードは、ポイントクリップ全体を入力として渡したときに最もよく機能すると明言しており、これは現実的な制約であると同時に、想定される利用者についての表明でもある。つまり、放送映像やアーカイブ映像を大規模に処理する人、あるいはコーチング/分析パイプラインだ。

NVIDIA は以前から、そのはしごを公の場で築いてきた。Sports Intelligence のプレイブックは同じ形を描いている — 選手の動き、ボールの軌道、コートの幾何構造、イベントのタイミングを保つ、ビデオとオーディオを優先したファインチューニングに加え、質問クラスごとの指標と LLM-as-judge スコアリングによるドメイン固有の評価だ。テニスモデルは、独自データセット上でそのレシピに従うと自然に得られるものだ。戦略的な読み解きとしては、NVIDIA が、オムニモーダル基盤 + 垂直データセット + プレイブック = 展開可能なスペシャリストであることを示しており、それをスポーツごと、リーグごと、放送事業者ごとに実現できることを示している。

それが計画なら、欠けているベンチマークは奇妙な省略だ——ショーケース用のモデルなのに、ショーケースとなる数字がない。だからこそ、最もありそうな説明はありきたりなものになる。つまり、成果物は公開されたが、それに付随する解説文は公開されなかったのだ。

運用にかかるコストと、それがなぜ判断を左右するのか

このモデルについて現実的に重要なのは、ハードウェアの最低ラインだ。BF16の重みが約62 GB、80 GB GPUが1基必要という明記された要件は、H100、A100 80GB、B200、H200を意味する——ワークステーション向けカードではない。カード自体のデフォルト推論ポリシーは、最大128フレームで毎秒2フレーム、新規トークン数256、貪欲デコーディング、映像と音声。BF16の重みと併せて公開された量子化チェックポイントは存在せず、これは2026年のリリースとしては異例で、4ビットビルドなら24 GBカード上で開けるはずの低コストな道を閉ざしている。

正直に言えば、こういうことだ。これは研究用の成果物で、試したいならデータセンターのハードウェア上で動かすものだ。すでに予備の H100 があるチームにとって、NVIDIA のテニスモデルがどれだけ優れているかを知るためのコストは、62 GB をダウンロードすることだけである。そして、誰もスコアを公開していないため、現時点でそれを知る唯一の方法はそのテストだけだ。

そこがまた、ルーティング層がその存在価値を発揮する場面でもある。ただし、通常の形とは限らない。OrcaRouterはこのモデルを扱っておらず、そうでないふりをするつもりもない——NVIDIAはホスト型エンドポイントを公開していないので、ルーティングする対象が存在しないのだ。200以上のモデルに対応する単一のAPIがここで実際に役立つのは、周辺の問題に対してである。テニスやスポーツ動画のパイプラインを構築している場合、ポイント単位の推論を担うモデルは構成要素の一つにすぎず、スタックの残り——文字起こし、要約、検索、アプリケーション層——はホストされているモデルによって提供される。パイプライン全体を一つのキーの背後に置き、プロバイダー間で自動フェイルオーバーを効かせることは、実証されていない31Bの専門モデルを、二つ目の契約と二つ目の認証情報の背後ではなく、すでに手にしているインターフェースの背後に置けることを意味する。

何を見るべきか

4つのことがあれば、これは静かな遺物から物語へと変わる。そして、そのどれもが再訪する価値がある。

• 評価の数値が出るのは——テクニカルレポートでであれ、カードの更新でであれ。それまでは、「機能するのか」という問いに外部から答えることはできない。

• 兄弟リポジトリ。もし「Sports Tennis」が AI-for-Media のスポーツ向けラインにおける1つのエントリーなら、次のリポジトリは製品化テーゼを裏づけ、NVIDIA がどのバーティカルを専用のファインチューニングに値すると考えているかを教えてくれるだろう。

• 発表、どんな発表でも — ブログ記事、GTCセッション、顧客事例。Sports Intelligenceのプレイブックと、ライブ映像から選手、ボール、イベントデータを抽出するStats Performの取り組みは、NVIDIAが導入事例として指し示す明白な対象となる。

• 量子化された重み、またはサービング統合。4ビットビルドやvLLMレシピがあれば、このモデルは単一のワークステーションGPUでも手が届くようになり、現実的に試せる人を変えるだろう。

A generated two-panel infographic headed 'Published' and 'Not published'. The Published panel lists weights in BF16, 1.31M Q&A over 43,084 clips, a held-out test protocol of 12 unseen matches, and the OpenMDW-1.1 licence. The Not published panel lists any benchmark score, technical report, hosted endpoint, and quantized checkpoint, with a footer reading 'Assessed from NVIDIA's model card, September 11, 2026.'

それらのうちのどれかが起きるまでは、NVIDIA NemotronLabs AI for Media - Sports Tennis を正確に説明すると、地味で華やかさのないものになる。本物のモデルで、本物の重みがあり、本物のトレーニングセットがあり、本物の評価プロトコルがあり、公開された結果はなく、発表もなく、ダウンロード数は一目で読み取れる。それが存在すると知っておく価値はある。まだそれを前提に計画を立てる価値はない。