
Nemotron Sports Tennis против North Micro Vision Instruct: 31B-ридер для тенниса против 2,4B-специалиста по документам
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 за 1 млн токенов
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Короткий ответ сразу: NVIDIA NemotronLabs AI for Media - Sports Tennis и North Micro Vision Instruct не заменяют друг друга, и никто, кто выбирает между ними, на самом деле не выбирает между ними. Одна — это 31B мультимодальная модель, которую NVIDIA дообучила отвечать на вопросы о теннисных розыгрышах, требует примерно 80 ГБ памяти GPU и понимает только английский. Другая — это 2.4B визуально-языковая модель от Cohere, которая помещается на одну карту для рабочей станции, поддерживает одиннадцать языков и была создана прежде всего для чтения документов — страниц, диаграмм, таблиц, OCR.
Они относятся к одной широкой категории и почти ни к чему больше. Ниже — честная версия сравнения: где эти двое действительно расходятся, что каждый вендор опубликовал, а что нет, и единственная ситуация, в которой выбор действительно реален.
Для чего была создана каждая модель
North Micro Vision Instruct объединяет языковую модель на 2B параметров — North Micro LLM от Cohere, следующую архитектуре Command A+, — с 400M-параметрическим визуальным энкодером, обученным с нуля на основе SigLIP 2 SO400M, что в сумме даёт 2,4B. Её визуальный тракт работает в нативном разрешении, сохраняя соотношения сторон вместо приведения к фиксированной сетке, а проектор DeepStack внедряет патч-эмбеддинги из нескольких слоёв энкодера в соответствующие ранние языковые слои, а не добавляет в начало единственное представление. Cohere формулирует позиционирование так: компактная основа для прототипирования и дообучения под конкретные задачи, а флагманская возможность — понимание документов. Карточка модели на удивление откровенно говорит о потолке возможностей: North Micro Vision Instruct явно не является reasoning-моделью, не поддерживает вызов инструментов и не обучалась с системными промптами.
Sports Tennis — полная противоположность по каждому измерению. NVIDIA начала с собственного чекпоинта Nemotron 3 Nano Omni 30B-A3B-Reasoning — гибридной смеси экспертов Mamba2-Transformer, всего 31B, из которых около 3B активны на токен, — и дообучила его на проприетарном, размеченном вручную теннисном корпусе. Визуальный энкодер (C-RADIOv4-H) и речевой энкодер (Parakeet) были заморожены; обучались только параметры языковой модели. В результате получилась узкоспециализированная модель по замыслу: она отвечает на структурированные вопросы с множественным выбором и открытые вопросы по клипу с полным теннисным очком, охватывая механику ударов, позиционирование на корте, перемещение игроков, факты о матче, знание правил и аудиосигналы. NVIDIA описывает её как работающую лучше всего, когда на вход подаётся целое очко — от подачи до конца розыгрыша.
Измерения, которые на самом деле их разделяют
• Параметры — North Micro Vision Instruct: 2,4 млрд (2 млрд языковых, 400 млн визуальных). Sports Tennis: всего 31 млрд, ~3 млрд активных на токен.
• Входные данные — North Micro Vision Instruct: чередующиеся текст и изображения, нативное разрешение, несколько изображений. Sports Tennis: видео до 2 минут, аудио до одного часа, изображения, текст.
• Вывод — оба возвращают текст. North Micro Vision Instruct дополнительно возвращает ограничивающие рамки привязки в нормализованной шкале 0–1000.
• Языки — North Micro Vision Instruct: более одиннадцати, включая английский, немецкий, французский, испанский, итальянский, португальский, хинди, японский, корейский, китайский и арабский. Sports Tennis: только английский.
• Контекст — North Micro Vision Instruct: языковой бэкбон на 128K токенов, но Cohere отмечает, что валидированный мультимодальный диапазон составляет до 8K токенов, при этом более длинные мультимодальные контексты полагаются на экстраполяцию и не протестированы. Sports Tennis: до 256k токенов.
• Занимаемая память — North Micro Vision Instruct: около 4,97 ГБ в BF16, примерно 2,17 ГБ в 4-битном формате. Sports Tennis: около 62 ГБ в BF16, требуется один GPU на 80 ГБ.
• Лицензия — North Micro Vision Instruct: Apache 2.0. Sports Tennis: OpenMDW-1.1, при этом в карточке указано коммерческое и некоммерческое использование.

Бенчмарки: у одной модели они есть, у другой — протокол.
Именно здесь две карты максимально различаются по своему положению.
Cohere публикует оценки для North Micro Vision Instruct. DocVQA — 0.921, ChartQA — 0.808, OCRBench — 0.792, а MMMU — 0.329. Все заявлены производителем, ни один не воспроизведён независимо, и сама Cohere отмечает, что результаты OCR резко различаются в зависимости от разбиения. На последней цифре стоит задержаться: показатель MMMU 0.329 низок, и это согласуется со всем остальным, что карточка говорит о дизайне модели. Это специалист по чтению, а не универсальная модель рассуждений, и компания, создавшая её, сама об этом говорит. Такое раскрытие информации полезнее, чем лестная цифра.
NVIDIA не публикует ничего. В карточке Sports Tennis тщательно описывается методика оценки — тестовая часть из 12 полностью отложенных матчей, 2 689 клипов уровня отдельных очков и 80 872 вопроса из матчей, не пересекающихся с обучающей выборкой; оценка проводится по автоматизированной точности ответов на вопросы с множественным выбором и по LLM-as-judge pass@9 на открытые ответы, при этом подвыборка с уже встречавшимися матчами явно исключена из отчётного тестирования — но затем не приводится ни одного результата ни по одному из этих пунктов. Обучающая часть столь же подробна: 1 312 129 примеров вопросов и ответов, 1 226 081 пример с множественным выбором и 86 048 примеров с открытым ответом, взятых из 43 084 клипов уровня отдельных очков по 239 матчам, размеченных по 38 категориям аннотации.
Даже если бы NVIDIA опубликовала оценки, они всё равно не были бы сопоставимы. Не существует бенчмарка, в котором одновременно фигурировали бы и модель понимания документов, и модель подсчёта теннисных очков. Пересечение этих двух историй оценки равно нулю.

Развёртывание: где кроется практическая разница
Модель 2.4B с большим отрывом проще всего в эксплуатации. Примерно 5 ГБ весов BF16 означают, что с ней справится один GPU современной рабочей станции, а 4-битная сборка объёмом около 2,17 ГБ — ещё меньше. Существуют независимые порты для среды выполнения Core AI от Apple: сообщается о примерно 18,2 токена/с при int8 на iPhone 17 Pro, тогда как int4-квантование полностью не работает. Загвоздка — в программном обеспечении: North Micro Vision Instruct требует Transformers 5.16.0 — устанавливаемую из исходного кода, пока она не появится в PyPI, — а публичная поддержка vLLM на карточке модели всё ещё описывалась как «скоро». Дообучение поддерживается через Axolotl. Хостинга API от самого разработчика нет; практичный путь — самостоятельное развёртывание.
Sports Tennis — сложнее всего в эксплуатации, и с этим ничего не поделаешь. Одна 80-ГБ GPU при BF16, ни одного опубликованного квантованного чекпоинта, только английский, только Linux, на PyTorch/Transformers, NeMo или Megatron. NVIDIA тестировала на A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor и RTX 5090 — список оборудования, который говорит скорее о том, что NVIDIA хотела проверить, чем о том, что может выделить обычная команда. Политика инференса по умолчанию у этой карты тоже минималистична: 2 кадра в секунду, максимум 128 кадров, 256 новых токенов, жадное декодирование.
Ни одна из моделей не обслуживается через OrcaRouter. У North Micro Vision Instruct нет собственного endpoint, и её нет в нашем каталоге; у Sports Tennis вообще нет endpoint нигде, поскольку NVIDIA опубликовала веса, но не предоставляет хостинговый сервис. Обе — это решения в пользу самостоятельного хостинга.
Слой маршрутизации действительно помогает именно в конвейере вокруг них — какие бы из них вы ни запускали локально, модели транскрипции, суммаризации, поиска и приложений, которые его окружают, размещены на стороне провайдера, а размещение их за одним API-ключом с автоматическим переключением при сбое позволяет избежать создания отдельного набора учетных данных и договора для каждого. Мы передаем прайс-листовую цену провайдера с нулевой наценкой на модели, которые мы предлагаем, поэтому части стека, которые вы не размещаете самостоятельно, остаются по ценам вендора.

Когда выбор реален
Есть один сценарий, в котором выбор между этими двумя действительно является настоящим решением, и стоит сказать об этом конкретно, потому что это не очевидно.
Речь идёт о медиа- или спортивной организации, которая уже обрабатывает документы и хочет добавить понимание видео на уровне очков. Вещатель с конвейером обработки архива, лига с отчётами о матчах и статистическими PDF-файлами, правообладатель, у которого есть и текстовые материалы, и видеозаписи, — для них North Micro Vision Instruct, вероятно, уже входит в стек для OCR и извлечения графиков, а Sports Tennis — это новая возможность, которую они бы добавляли. Вопрос не в том, «какую из них выбрать», а в том, «во что мне обойдётся вторая с точки зрения инфраструктуры», и ответ — GPU для дата-центра и ограничение только английским языком.
Вне этого случая эти модели просто не конкурируют. Если вам нужно, чтобы документы читались на одиннадцати языках на карте для рабочей станции, ответ — North Micro Vision Instruct, а Sports Tennis для вас не имеет значения. Если вам нужно задавать структурированные вопросы о теннисных очках с аудиоконтекстом, Sports Tennis — единственная из двух, кто это умеет, и то, что у неё нет опубликованных бенчмарков, — это риск, который вы принимаете, а не причина выбирать другую модель.
Что выбрать
Выбирайте North Micro Vision Instruct, если ваша работа связана с документами, диаграммами, OCR, grounding или многоязычным пониманием изображений, и если вы цените поставщика, который публикует свои слабые показатели наряду с сильными. Это небольшая модель под Apache 2.0, хорошо документированная и честно признающая, что не является reasoning-моделью. Её MMMU 0.329 — это не недостаток, который вы обнаружите позже; Cohere сообщает вам об этом сразу.
Выбирайте NVIDIA NemotronLabs AI for Media - Sports Tennis только если вам действительно нужно рассуждение на уровне отдельных очков в теннисе с аудио, у вас есть свободная 80-гигабайтная видеокарта, и вы готовы быть первым, кто его оценит. Никто не опубликовал оценку для этой модели, так что скачивание — это и есть эксперимент. Это не причина избегать её — узкий специалист с тщательно размеченным обучающим набором из 43 084 клипов — это именно тот тип модели, который может превзойти универсала в его собственной задаче — но это причина рассматривать первое развёртывание как пробу, а не как обязательство.
Единственное, чего вам не следует делать, — это считать их взаимозаменяемыми только потому, что на карточке у обоих написано «визуально-языковая модель». Программа для чтения документов и аналитик тенниса никогда не были одним и тем же продуктом, и в этой паре разница в том, что они делают, гораздо больше, чем разница в том, насколько хорошо они это делают.
