Сгенерированная hero-карточка, сравнивающая NVIDIA NemotronLabs AI for Media - Sports Tennis и Microsoft Mage-VL, показывающая ограниченный клип теннисного розыгрыша с одной стороны и непрерывную киноплёнку с выделенным маркером события с другой, с тремя чипами-контрастами: клип против потока, отсутствие опубликованных очков против очков SoccerNet и минимальный порог 80 ГБ против минимального порога 16 ГБ, а также логотип OrcaRouter в правом нижнем углу.
Guides & Insights

Nemotron Sports Tennis против Microsoft Mage-VL: два способа чтения спортивной трансляции

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

У Microsoft Mage-VL есть цифра, на которую можно указать: в бенчмарке SoccerNet по времени отклика она показывает TimVal 55,54 и PR-AUC 9,30 — лучший результат по метрикам, чувствительным к точности, несмотря на то, что она никогда не обучалась на этом наборе данных, а ее авторы демонстрируют, как она просматривает трансляцию чемпионата мира 2026 года, храня молчание до 29,36 секунды, когда игрок совершает прорыв и модель выдает комментарий в прямом эфире. У NVIDIA NemotronLabs AI for Media - Sports Tennis нет вообще никаких цифр. Это 31-миллиардная мультимодальная модель, дообученная на 43 084 теннисных клипах, которую NVIDIA опубликовала в сентябре 2026 года, разместив полный протокол оценки на своей карточке, но не приведя ни одного результата из него.

Так что это не очное сравнение, по которому можно выставить счёт. И всё же это по-настоящему полезное сравнение, потому что две модели отвечают на один и тот же вопрос — способна ли визуально-языковая модель следить за спортивной трансляцией в реальном времени — с противоположными архитектурными ставками, и одна из этих ставок подкреплена доказательствами, а другая — описанием данных. Именно эта асимметрия и составляет суть статьи.

Развилка: поток или клип

Разница в дизайне важнее, чем количество параметров, и она объясняет почти всё остальное в этих двух моделях.

Microsoft Mage-VL построена вокруг непрерывного видео. Её визуальный энкодер Mage-ViT обучен с нуля и читает видео так, как это делает кодек: он разбивает поток на опорные (I) кадры, сохраняемые полностью, и предсказанные (P) кадры, где сохраняются только патчи, несущие реальное движение или новые детали, на общей сетке патчей 16×16. Это сокращает количество визуальных токенов более чем на 75% и, по данным Microsoft, даёт до 3,5× ускорения вывода по реальному времени по сравнению с равномерной выборкой кадров. Поверх этого находится разделение System 1 / System 2: лёгкий когнитивный шлюз оценивает каждое скользящее окно и молчит на рутинном контенте, задействуя полную модель только тогда, когда завершается событие, заслуживающее реакции. Это одна модель, выполняющая обе задачи, а не конвейер.

Теннисная модель NVIDIA делает совершенно другую ставку. В её карточке прямо указано, что она «работает лучше всего, когда на вход подаётся клип с полным теннисным розыгрышем» — от подачи до конца розыгрыша, до двух минут mp4, со звуком. Политика инференса по умолчанию — 2 кадра в секунду до 128 кадров, 256 новых токенов, жадное декодирование, видео плюс аудио. Здесь нет гейта, нет потокового режима, нет триггера событий. Это модель вопросов и ответов по ограниченному клипу: вы передаёте ей розыгрыш, спрашиваете, что произошло, и она отвечает.

Это не две реализации одной идеи. Потоковое восприятие и рассуждение на уровне клипов — это разные продукты. Вещателю, которому нужен комментарий в прямом эфире, нужна форма Mage-VL. Аналитику, которому нужно делать запросы к архиву из 43 084 очков, нужна форма Sports Tennis. Ни одна из моделей не является готовой заменой для задач другой.

Оба построены на гибридном бэкбоне — с одним важным отличием

• Параметры — Sports Tennis: всего 31B, примерно 3B активных на токен, гибридная MoE Mamba2-Transformer. Mage-VL: всего 4B, 316M Mage-ViT в паре с декодером Qwen3-4B-Instruct-2507.

• Энкодеры — Sports Tennis замораживает как энкодер зрения C-RADIOv4-H, так и речевой энкодер Parakeet и дообучает только параметры языковой модели. Mage-VL обучает весь свой визуальный стек с нуля примерно на 100 млн неразмеченных изображений и видео, при этом языковая модель Qwen3 является единственным предобученным компонентом.

• Аудио — Sports Tennis рассматривает аудио как полноценный вход и включает интерпретацию звуковых сигналов в число своих 38 категорий аннотации. Опубликованный пайплайн Mage-VL ориентирован на визуальные данные; работа SoccerNet касается времени отклика на кадрах.

• Модальность вывода — обе создают только текст.

• Мультипликативный эффект — поскольку Mage-ViT было дешевле предобучить, чем веб-масштабную башню компьютерного зрения, Microsoft сообщает об обучении на видео в 8 раз длиннее при том же бюджете. Вместо этого заявление NVIDIA об эффективности относится к архитектуре: 3 млрд активных параметров на токен из 31 млрд общих.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs Microsoft Mage-VL — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Design clip-at-a-time, Audio first-class input, Published scores none, GPU floor about 80 GB. Right column lists Release July 2026, Parameters 4B, Design codec-native streaming with an event gate, Audio not in the published pipeline, Published scores SoccerNet TimVal 55.54 and PR-AUC 9.30, GPU floor about 16 GB. Footer reads 'NVIDIA figures from its model card with no published results; Microsoft figures vendor-reported.'

Где находятся доказательства

Это та часть сравнения, где разница очевидна, и об этом стоит сказать прямо.

Microsoft Mage-VL — опубликованная модель с техническим отчётом, страницей проекта, репозиторием на GitHub и набором бенчмарков, который охватывает понимание изображений, понимание видео, временную локализацию, пространственное рассуждение и потоковую обработку. По сравнению с Qwen3-VL-4B — та же 4B языковая основа, заменён только визуальный энкодер — Mage-VL улучшает показатели на каждом заявленном бенчмарке по видео и временной локализации, причём наибольший прирост наблюдается на задачах с упором на локализацию: +22,5 на Timelens-QVHighlight, +17,1 на ActivityNet, +11,0 на VSI-Bench, +24,5 на VideoEval-Pro. На стороне изображений она сообщает DocVQA 95,14, MMStar 67,32 и CrossPoint 80,00, на видео — VideoMME 64,0 и LongVideoBench 61,3, а также общий балл 64,00 на OVO-Bench среди потоковых архитектур. Все эти результаты заявлены Microsoft, и ни один не был независимо воспроизведён — но они существуют, их много, и они внутренне согласованы на необычно широком наборе задач.

Sports Tennis ничего не сообщает. В его карточке описывается тестовая часть из 12 полностью отложенных матчей с 2 689 клипами уровня отдельных очков и 80 872 вопросами, приводится оценка по автоматической точности множественного выбора и LLM-as-judge pass@9, отмечается, что для заявленного тестирования использовалось только разбиение по невиденным матчам, — а затем не публикуется никакого результата. Его обучающий корпус реален и конкретен: 1 312 129 примеров вопросов и ответов, из них 1 226 081 с множественным выбором и 86 048 открытых, из 43 084 клипов по 239 матчам, размеченных по 38 категориям аннотации из трансляций и съёмок на корте 2025 года. Ничего из этого нельзя проверить извне, а числа, которые позволили бы это проверить, отсутствуют.

Одна оговорка работает в обратную сторону, и её стоит назвать, чтобы это не выглядело как безоговорочная победа Microsoft. SoccerNet — не теннис. Достижения Mage-VL в потоковой обработке основаны на данных футбольных трансляций в рамках определённого протокола, а её демонстрация на чемпионате мира 2026 года — это всего лишь демонстрация. Не проверено, переносится ли гейт, нативный для кодека, без потерь на теннис — где розыгрыши короткие, частые и жёстко структурированы. Разница в том, что утверждение Mage-VL по крайней мере опровержимо третьей стороной, а утверждение Sports Tennis не может опровергнуть никто без набора данных NVIDIA.

A screenshot of the Hugging Face model card for microsoft/Mage-VL, captured September 11, 2026, showing the model described as a codec-native proactive-streaming multimodal foundation model at 4B scale, the claim that codec-aligned sparsity cuts visual tokens by over 75% and yields up to 3.5x wall-clock inference speedup, the pairing of Mage-ViT with a Qwen3-4B-Instruct-2507 decoder, and the SoccerNet streaming table listing Mage-VL-4B at TriggerAcc 79.21, TimVal 55.54, F1 16.35, ROC-AUC 83.14 and PR-AUC 9.30.

Что нужно, чтобы их запустить

Разрыв здесь составляет примерно пятикратную разницу в аппаратном обеспечении, и он определяет, кто действительно может попробовать каждую модель.

• Sports Tennis — одна GPU с примерно 80 ГБ при BF16, веса — около 62 ГБ. Минимально — A100 80GB или H100 80GB, рекомендуются B200 или H200. Квантованный чекпойнт не опубликован, поэтому дешёвого пути вниз нет. Только английский. Среды выполнения — PyTorch/Transformers плюс NeMo и Megatron.

• Mage-VL — около 10,6 ГБ в BF16, из-за чего практический минимум для работы с изображениями — GPU на 16 ГБ, а для длинного видео и потоковой передачи — 24 ГБ и больше. Apache-2.0 для Mage-VL и MIT для Mage-ViT, хотя в репозитории семейства указано, что модели выпущены исключительно для исследовательских целей. Обратите внимание на подводные камни: trust_remote_codeобязателен, пути обслуживания через vLLM или SGLang пока нет, а конвейеру кодеков требуется FFmpeg или ffprobe — при этом нейрокодековому пути дополнительно нужен DCVC-RT.

Если вы хотите в этом месяце протестировать модель для спортивных видео на одной карте рабочей станции, Mage-VL — единственная из двух, которую вы действительно сможете загрузить. Это практический вердикт, даже при отсутствии вердикта по бенчмаркам.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input and text output, and a minimum GPU of one A100 80GB or H100 80GB, with the sidebar showing two downloads last month and no inference provider deployment.

К какому из них вы бы потянулись?

Для всего, что связано с прямым эфиром — комментирования, обнаружения событий в работающем потоке, оповещений с низкой задержкой по транслируемому видео, — Microsoft Mage-VL сегодня является обоснованным выбором: он создавался именно для этого, у него есть стриминговый бенчмарк, свидетельствующий в его пользу, и он запускается на оборудовании, которое уже есть у большинства команд. Для работы с большими архивами и запросами конкретно по теннису — создания поискового индекса очков, проведения структурированного анализа по тысячам розыгрышей, постановки вопросов, где единицей смысла является весь клип очка, — модель NVIDIA — единственная из двух, которая была создана для этого. Хорошо ли она справляется с задачей, по состоянию на сентябрь 2026 года доподлинно неизвестно.

Есть и третий вариант, который стоит назвать, потому что именно к нему в итоге приходит большинство реальных пайплайнов. Если вы хотите попробовать непроверенного специалиста, не ставя на него продакшн-путь, держите его за тем же интерфейсом, что и модели, которым доверяете. OrcaRouter не предоставляет ни то, ни другое — NVIDIA опубликовала веса без эндпоинта, а у Mage-VL нет пути хостингового обслуживания, — так что оба варианта становятся решениями о самостоятельном хостинге. Один ключ, покрывающий более 200 моделей на хостинге, даёт вам всё остальное: модели транскрипции, суммаризации и приложений вокруг компонента для спортивного видео остаются за одним эндпоинтом, с автоматическим переключением при деградации провайдера, а две специализированные модели, которые вы запускаете сами, — единственные движущиеся части, принадлежащие вам.

Вердикт

Microsoft Mage-VL и NVIDIA NemotronLabs AI for Media - Sports Tennis не являются соперниками в том смысле, который обычно подразумевается под страницей сравнения. Mage-VL — это опубликованная, прошедшая бенчмарки потоковая модель на 4B, работающая на рабочей станции и имеющая реальную демонстрацию спортивного комментирования, запускаемого событиями. Sports Tennis — это неанонсированная, не прошедшая бенчмарки специализированная модель на 31B клипового уровня, которой нужна GPU для дата-центров, и нет опубликованных доказательств того, что она работает.

Судите по доказательствам — и Mage-VL побеждает из-за неявки соперника. Судите по охвату — и они не пересекаются. Но есть причина продолжать следить за моделью NVIDIA: дообучение с замороженным энкодером на 43 084 правильно аннотированных теннисных розыгрышах — это именно тот тип узкого, высококачественного вертикального обучающего набора, которого нет у универсальных моделей, и если NVIDIA когда-нибудь опубликует результаты на отложенной выборке, вопрос «специалист против универсала» в спортивном видео впервые получит настоящий ответ. До тех пор Mage-VL — это модель с доказательствами, а Sports Tennis — модель с обещанием.