
Nemotron Sports Tennis против InternLumina U2: сравнение, в котором ни одна модель не может проиграть
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 за 1 млн токенов
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Спросите, что лучше — NVIDIA NemotronLabs AI for Media - Sports Tennis или InternLumina U2, — и честный ответ будет таким: этот вопрос не имеет решения. Оба репозитория появились на Hugging Face в сентябре 2026 года, оба представляют собой мультимодальные модели со смесью экспертов, созданные хорошо финансируемыми лабораториями, и почти больше ничего общего у них нет. Модель NVIDIA — это специалист на 31B, который разбирает одно теннисное очко и отвечает на вопросы о нём. InternLumina U2 от команды InternLM Шанхайской лаборатории искусственного интеллекта, опубликованная как internlm/InternLumina-U2, — это унифицированная модель на 16B, которая понимает изображения, видео и 3D, а также генерирует и редактирует изображения. У них нет ни общего бенчмарка, ни целевого пользователя, ни сценария развёртывания. Их сравнение — это не столько выбор телефона, сколько выбор между стетоскопом и 3D-принтером.
И всё же эта пара заслуживает того, чтобы о ней писали, из-за общей для обеих моделей закономерности: ни одна из них не проходила независимую оценку, и обе описываются собственным поставщиком как нечто незавершённое. Вот это и есть настоящее сравнение — не то, какая модель побеждает, а то, какую долю любой из них вы действительно можете проверить сегодня.
Две разные работы под одним и тем же словом
«Мультимодальность» охватывает и то, и другое, и ничего вам не говорит. Вот в чём разделение:
• Что принимается на вход — Sports Tennis: видео (mp4 до 2 минут), аудио (wav/mp3), изображения, текст. InternLumina U2: текст, изображения, видео и 3D. Теннисная модель — единственная из двух с существенным аудиоканалом, подключённым через речевой энкодер Parakeet, который распознаёт звуки толпы и ударов наряду с кадрами.
• Что даёт на выходе — Sports Tennis: только текст. InternLumina U2: текст и сгенерированные или отредактированные изображения, с помощью полностью дискретного визуального представления с 8 кодовыми книгами, построенного на AToken.
• Что спрашивает пользователь — Sports Tennis: «что произошло в этом розыгрыше, где стоял игрок, попал ли мяч в корт». InternLumina U2: «опиши эту диаграмму, а затем нарисуй мне её новую версию».
• Архитектура — Sports Tennis: гибридная MoE Mamba2-Transformer, всего 31B при примерно 3B активных на токен, наследует свою основу и энкодеры от Nemotron 3 Nano Omni. InternLumina U2: разреженная MoE на 16B с 1B активных параметров, построена как диффузионная языковая модель с несколькими кодовыми книгами, а не как традиционная авторегрессионная.
• Контекст — Sports Tennis заявляет до 256k токенов. В карточке InternLumina U2 объём контекста не указан.
• Лицензия — Sports Tennis поставляется под OpenMDW-1.1, при этом в карточке указано коммерческое и некоммерческое использование. InternLumina U2 — Apache 2.0.

То, что на самом деле делает их несравнимыми
Общего табло не существует, и стоит точно объяснить почему, а не ограничиваться невнятным пожатием плеч.
Sports Tennis, дообученная на проприетарном теннисном наборе данных NVIDIA, — 1 312 129 примеров вопросов и ответов по 43 084 клипам уровня очка из 239 матчей, размеченных по 38 категориям аннотаций, все собраны в 2025 году. Её тестовый набор — это отложенная часть из 12 матчей, 2 689 клипов и 80 872 вопросов. Каждый из этих артефактов принадлежит самой NVIDIA. Ни у одной внешней группы нет этих данных, поэтому ни одна внешняя группа не может воспроизвести оценку — а, как оказалось, NVIDIA не опубликовала никакой оценки, которую можно было бы воспроизвести. В карточке подробно описан протокол оценки, но затем не приводится ни одного результата по нему. Ничего о точности, ничего по категориям, ничего.
InternLumina U2 находится по другую сторону той же самой стены. Она публикует числа, но они явно частичные. В карточке модели об этом сказано одной строкой: «Предварительные, частичные результаты. Полные сравнительные таблицы появятся в предстоящем техническом отчёте». То, что есть, — это разброс заявленных вендором показателей по очень разным возможностям — по документам: ChartQA 86.52 и CharXiv-DQ 83.65, по визуальной математике: MathVision 33.22 и DynaMath 56.37, по видео: VideoMME 51.26 и MVBench 59.74, 3D MM-Vet 41.8, по генерации: DPG-Bench 87.10 и GenEval 0.81, по редактированию: ImgEdit 3.83. А собственная таблица на странице проекта показывает, что модель уступает как минимум одному названному конкуренту как минимум по одному ключевому показателю: GenEval 0.81 против 0.89 у LLaDA2.0-Uni.
Итак, у одной модели есть документированная оценка и нет результатов, а у другой есть результаты и явно неполная оценка. Ни та, ни другая не даёт числа, которое можно было бы поставить рядом с другим. Любая страница, которая ранжирует эти две, выдумала свой рейтинг.

Где они действительно пересекаются, и что это показывает
Понимание видео — единственная территория, на которую претендуют обе стороны, и даже там пересечение тоньше, чем кажется. InternLumina U2 сообщает VideoMME 51.26, MLVU 57.03 и MVBench 59.74 — оценки общего понимания видео, заявленные производителем. Sports Tennis ничего не сообщает, но его карточка описывает гораздо более узкую и гораздо более глубокую задачу: рассуждение на уровне очка по полному розыгрышу с аудио, по 38 мелкозернистым категориям аннотации, включая механику ударов, позиционирование на корте, перемещение и состояние счёта.
Разумный вывод состоит в том, что InternLumina U2 был бы лучшим универсалом, а Sports Tennis — лучшим теннисным ридером, но это вывод из формы задачи, а не из данных. Он легко может оказаться неверным в любую сторону. А вот что не является выводом, так это то, что общий видеобенчмарк и проприетарный теннисный бенчмарк уровня отдельных очков нельзя разместить на одной оси, и что унифицированный генератор на 16B и специалист на 31B с замороженным энкодером не создавались для ответа на один и тот же вопрос.
Запуск любого из них — это проект совсем иного рода
Развёртывание — вот где разрыв перестаёт быть философским.
Sports Tennis указывает жёсткий минимум: одна GPU с примерно 80 ГБ памяти при BF16, с весами около 62 ГБ; протестировано на A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor и RTX 5090. Квантизованного чекпоинта нет, поэтому требование в 80 ГБ сегодня нельзя снизить. Кроме того, он поддерживает только английский язык.
Более интересная проблема InternLumina U2 — не память, а кремний. В репозитории хранятся чекпойнты, разделённые по обучающему оборудованию: полный ascend/ каталог с семью шардами safetensors, обученными на NPU Huawei Ascend, и nvidia/ каталог с пометкой «скоро». Если вы работаете на оборудовании NVIDIA — а для модели, чей собрат — теннисный файнтюн Nemotron, это большинство читающих это, — нужный вам чекпойнт — тот, который ещё не появился. Код для инференса и инструкции по настройке находятся в репозитории InternLM на GitHub, а не на Hub, и технический отчёт всё ещё ожидается.
Это переворачивает привычные ожидания. Проприетарная, не прошедшая бенчмарков модель в виде готового устройства — это та, которую можно скачать и запустить прямо сейчас, с первого дня. А открытая исследовательская модель под Apache-2.0 — это та, что ждет сборки под конкретное аппаратное обеспечение.

Где маршрутизатор уместен — а где нет
Ни одна из этих моделей не размещена на OrcaRouter, и нет честного способа обойти это в тексте. У Sports Tennis нигде нет эндпоинта; NVIDIA опубликовала веса и ничего больше. В собственном репозитории InternLumina U2 отмечено, что чекпоинты NVIDIA всё ещё в ожидании, так что и с нашей стороны нечего обслуживать. В обоих случаях это решение о самостоятельном хостинге, а не о маршрутизации.
Вопрос маршрутизации возникает на уровень выше. Команда, которая хочет оценить специалиста вроде Sports Tennis против универсала вроде InternLumina U2, делает это не изолированно — она делает это как одного из кандидатов в пайплайне, которому также нужны распознавание речи, обработка документов, суммаризация и прикладная логика вокруг них. Эти компоненты размещены на хостинге, и именно на них один API-ключ, охватывающий более 200 моделей, с автоматическим переключением между провайдерами при сбое экономит неделю работы по интеграции. Один ключ для моделей, которые вы можете вызывать, так что те, которые вам приходится запускать самостоятельно, — единственное, что вы действительно поддерживаете.
Открытый вопрос
Если поставить рядом, NVIDIA NemotronLabs AI for Media - Sports Tennis и InternLumina U2 — неплохая иллюстрация двух способов неудачно выпустить мультимодальную модель публично. Один задокументировал свою оценку и скрыл результаты; другой опубликовал результаты и назвал свою оценку неполной. Оба по состоянию на сентябрь 2026 года — нефальсифицируемые утверждения.
Интересно наблюдать не за тем, какая из них окажется сильнее, — их никогда не будут проверять на одном и том же. Интересно другое: какая лаборатория первой закроет свой разрыв. Если NVIDIA опубликует показатели по теннису, она решит более сложную задачу, потому что проприетарный отложенный бенчмарк из 12 невидимых матчей — единственный честный способ оценить дообучение под конкретную предметную область, и NVIDIA уже создала это разбиение. Если InternLM выпустит чекпоинты NVIDIA и технический отчёт, она сделает свою модель под Apache-2.0 по-настоящему пригодной для использования на том оборудовании, которым владеют её пользователи. Что бы ни произошло, это сравнение будет стоить перечитать — потому что прямо сейчас самое обоснованное, что позволяет сказать карточка любой из моделей, — это пожатие плечами.
