Сгенерированная hero-карточка для сравнения NVIDIA NemotronLabs AI for Media - Sports Tennis и InternLumina U2, показывающая иконку клипа с теннисным розыгрышем с одной стороны и стек вывода «текст + изображение» с другой, с пометкой «специализированная 31B» только с текстовым выводом против «унифицированной 16B» с выводом текста и изображений, с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Nemotron Sports Tennis против InternLumina U2: сравнение, в котором ни одна модель не может проиграть

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Спросите, что лучше — NVIDIA NemotronLabs AI for Media - Sports Tennis или InternLumina U2, — и честный ответ будет таким: этот вопрос не имеет решения. Оба репозитория появились на Hugging Face в сентябре 2026 года, оба представляют собой мультимодальные модели со смесью экспертов, созданные хорошо финансируемыми лабораториями, и почти больше ничего общего у них нет. Модель NVIDIA — это специалист на 31B, который разбирает одно теннисное очко и отвечает на вопросы о нём. InternLumina U2 от команды InternLM Шанхайской лаборатории искусственного интеллекта, опубликованная как internlm/InternLumina-U2, — это унифицированная модель на 16B, которая понимает изображения, видео и 3D, а также генерирует и редактирует изображения. У них нет ни общего бенчмарка, ни целевого пользователя, ни сценария развёртывания. Их сравнение — это не столько выбор телефона, сколько выбор между стетоскопом и 3D-принтером.

И всё же эта пара заслуживает того, чтобы о ней писали, из-за общей для обеих моделей закономерности: ни одна из них не проходила независимую оценку, и обе описываются собственным поставщиком как нечто незавершённое. Вот это и есть настоящее сравнение — не то, какая модель побеждает, а то, какую долю любой из них вы действительно можете проверить сегодня.

Две разные работы под одним и тем же словом

«Мультимодальность» охватывает и то, и другое, и ничего вам не говорит. Вот в чём разделение:

• Что принимается на вход — Sports Tennis: видео (mp4 до 2 минут), аудио (wav/mp3), изображения, текст. InternLumina U2: текст, изображения, видео и 3D. Теннисная модель — единственная из двух с существенным аудиоканалом, подключённым через речевой энкодер Parakeet, который распознаёт звуки толпы и ударов наряду с кадрами.

• Что даёт на выходе — Sports Tennis: только текст. InternLumina U2: текст и сгенерированные или отредактированные изображения, с помощью полностью дискретного визуального представления с 8 кодовыми книгами, построенного на AToken.

• Что спрашивает пользователь — Sports Tennis: «что произошло в этом розыгрыше, где стоял игрок, попал ли мяч в корт». InternLumina U2: «опиши эту диаграмму, а затем нарисуй мне её новую версию».

• Архитектура — Sports Tennis: гибридная MoE Mamba2-Transformer, всего 31B при примерно 3B активных на токен, наследует свою основу и энкодеры от Nemotron 3 Nano Omni. InternLumina U2: разреженная MoE на 16B с 1B активных параметров, построена как диффузионная языковая модель с несколькими кодовыми книгами, а не как традиционная авторегрессионная.

• Контекст — Sports Tennis заявляет до 256k токенов. В карточке InternLumina U2 объём контекста не указан.

• Лицензия — Sports Tennis поставляется под OpenMDW-1.1, при этом в карточке указано коммерческое и некоммерческое использование. InternLumina U2 — Apache 2.0.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs InternLumina U2 — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Inputs video audio image text, Output text only, Published benchmarks none, GPU floor 1 x 80 GB. Right column lists Release September 2026, Parameters 16B (about 1B active), Inputs text image video 3D, Output text and generated images, Published benchmarks partial and vendor-reported, GPU floor not specified. Footer reads 'NVIDIA figures from its model card; InternLumina figures vendor-reported and preliminary. No independent evaluation of either.'

То, что на самом деле делает их несравнимыми

Общего табло не существует, и стоит точно объяснить почему, а не ограничиваться невнятным пожатием плеч.

Sports Tennis, дообученная на проприетарном теннисном наборе данных NVIDIA, — 1 312 129 примеров вопросов и ответов по 43 084 клипам уровня очка из 239 матчей, размеченных по 38 категориям аннотаций, все собраны в 2025 году. Её тестовый набор — это отложенная часть из 12 матчей, 2 689 клипов и 80 872 вопросов. Каждый из этих артефактов принадлежит самой NVIDIA. Ни у одной внешней группы нет этих данных, поэтому ни одна внешняя группа не может воспроизвести оценку — а, как оказалось, NVIDIA не опубликовала никакой оценки, которую можно было бы воспроизвести. В карточке подробно описан протокол оценки, но затем не приводится ни одного результата по нему. Ничего о точности, ничего по категориям, ничего.

InternLumina U2 находится по другую сторону той же самой стены. Она публикует числа, но они явно частичные. В карточке модели об этом сказано одной строкой: «Предварительные, частичные результаты. Полные сравнительные таблицы появятся в предстоящем техническом отчёте». То, что есть, — это разброс заявленных вендором показателей по очень разным возможностям — по документам: ChartQA 86.52 и CharXiv-DQ 83.65, по визуальной математике: MathVision 33.22 и DynaMath 56.37, по видео: VideoMME 51.26 и MVBench 59.74, 3D MM-Vet 41.8, по генерации: DPG-Bench 87.10 и GenEval 0.81, по редактированию: ImgEdit 3.83. А собственная таблица на странице проекта показывает, что модель уступает как минимум одному названному конкуренту как минимум по одному ключевому показателю: GenEval 0.81 против 0.89 у LLaDA2.0-Uni.

Итак, у одной модели есть документированная оценка и нет результатов, а у другой есть результаты и явно неполная оценка. Ни та, ни другая не даёт числа, которое можно было бы поставить рядом с другим. Любая страница, которая ранжирует эти две, выдумала свой рейтинг.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table listing 31B total parameters, about 3B active per token, a 256k-token maximum context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips from 239 matches, and a minimum of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

Где они действительно пересекаются, и что это показывает

Понимание видео — единственная территория, на которую претендуют обе стороны, и даже там пересечение тоньше, чем кажется. InternLumina U2 сообщает VideoMME 51.26, MLVU 57.03 и MVBench 59.74 — оценки общего понимания видео, заявленные производителем. Sports Tennis ничего не сообщает, но его карточка описывает гораздо более узкую и гораздо более глубокую задачу: рассуждение на уровне очка по полному розыгрышу с аудио, по 38 мелкозернистым категориям аннотации, включая механику ударов, позиционирование на корте, перемещение и состояние счёта.

Разумный вывод состоит в том, что InternLumina U2 был бы лучшим универсалом, а Sports Tennis — лучшим теннисным ридером, но это вывод из формы задачи, а не из данных. Он легко может оказаться неверным в любую сторону. А вот что не является выводом, так это то, что общий видеобенчмарк и проприетарный теннисный бенчмарк уровня отдельных очков нельзя разместить на одной оси, и что унифицированный генератор на 16B и специалист на 31B с замороженным энкодером не создавались для ответа на один и тот же вопрос.

Запуск любого из них — это проект совсем иного рода

Развёртывание — вот где разрыв перестаёт быть философским.

Sports Tennis указывает жёсткий минимум: одна GPU с примерно 80 ГБ памяти при BF16, с весами около 62 ГБ; протестировано на A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor и RTX 5090. Квантизованного чекпоинта нет, поэтому требование в 80 ГБ сегодня нельзя снизить. Кроме того, он поддерживает только английский язык.

Более интересная проблема InternLumina U2 — не память, а кремний. В репозитории хранятся чекпойнты, разделённые по обучающему оборудованию: полный ascend/ каталог с семью шардами safetensors, обученными на NPU Huawei Ascend, и nvidia/ каталог с пометкой «скоро». Если вы работаете на оборудовании NVIDIA — а для модели, чей собрат — теннисный файнтюн Nemotron, это большинство читающих это, — нужный вам чекпойнт — тот, который ещё не появился. Код для инференса и инструкции по настройке находятся в репозитории InternLM на GitHub, а не на Hub, и технический отчёт всё ещё ожидается.

Это переворачивает привычные ожидания. Проприетарная, не прошедшая бенчмарков модель в виде готового устройства — это та, которую можно скачать и запустить прямо сейчас, с первого дня. А открытая исследовательская модель под Apache-2.0 — это та, что ждет сборки под конкретное аппаратное обеспечение.

A screenshot of the Hugging Face model card for internlm/InternLumina-U2, captured September 11, 2026, showing the Apache 2.0 licence, the description as a 16B-parameter MoE with 1B active parameters and an 8-codebook fully-discrete visual representation, the note that the repository hosts checkpoints split by training hardware with ascend/ trained on Huawei Ascend NPUs and nvidia/ marked coming soon, and the benchmarks section stating preliminary, partial results pending the technical report.

Где маршрутизатор уместен — а где нет

Ни одна из этих моделей не размещена на OrcaRouter, и нет честного способа обойти это в тексте. У Sports Tennis нигде нет эндпоинта; NVIDIA опубликовала веса и ничего больше. В собственном репозитории InternLumina U2 отмечено, что чекпоинты NVIDIA всё ещё в ожидании, так что и с нашей стороны нечего обслуживать. В обоих случаях это решение о самостоятельном хостинге, а не о маршрутизации.

Вопрос маршрутизации возникает на уровень выше. Команда, которая хочет оценить специалиста вроде Sports Tennis против универсала вроде InternLumina U2, делает это не изолированно — она делает это как одного из кандидатов в пайплайне, которому также нужны распознавание речи, обработка документов, суммаризация и прикладная логика вокруг них. Эти компоненты размещены на хостинге, и именно на них один API-ключ, охватывающий более 200 моделей, с автоматическим переключением между провайдерами при сбое экономит неделю работы по интеграции. Один ключ для моделей, которые вы можете вызывать, так что те, которые вам приходится запускать самостоятельно, — единственное, что вы действительно поддерживаете.

Открытый вопрос

Если поставить рядом, NVIDIA NemotronLabs AI for Media - Sports Tennis и InternLumina U2 — неплохая иллюстрация двух способов неудачно выпустить мультимодальную модель публично. Один задокументировал свою оценку и скрыл результаты; другой опубликовал результаты и назвал свою оценку неполной. Оба по состоянию на сентябрь 2026 года — нефальсифицируемые утверждения.

Интересно наблюдать не за тем, какая из них окажется сильнее, — их никогда не будут проверять на одном и том же. Интересно другое: какая лаборатория первой закроет свой разрыв. Если NVIDIA опубликует показатели по теннису, она решит более сложную задачу, потому что проприетарный отложенный бенчмарк из 12 невидимых матчей — единственный честный способ оценить дообучение под конкретную предметную область, и NVIDIA уже создала это разбиение. Если InternLM выпустит чекпоинты NVIDIA и технический отчёт, она сделает свою модель под Apache-2.0 по-настоящему пригодной для использования на том оборудовании, которым владеют её пользователи. Что бы ни произошло, это сравнение будет стоить перечитать — потому что прямо сейчас самое обоснованное, что позволяет сказать карточка любой из моделей, — это пожатие плечами.