Una tarjeta hero de panel dividido generada que compara NVIDIA NemotronLabs AI for Media - Sports Tennis y North Micro Vision Instruct, con la mitad izquierda etiquetada como lector de tenis de 31B y un chip de solo inglés junto a un icono de clip de punto de tenis, y la mitad derecha etiquetada como especialista en documentos de 2,4B y un chip de 11+ idiomas junto a un icono de documento y gráfico de barras, con el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Nemotron Sports Tennis vs North Micro Vision Instruct: un lector de tenis de 31B frente a un especialista en documentos de 2.4B

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Respuesta breve primero: NVIDIA NemotronLabs AI for Media - Sports Tennis y North Micro Vision Instruct no son sustitutos, y nadie que elija entre ellos está realmente eligiendo entre ellos. Uno es un modelo multimodal de 31B que NVIDIA ajustó para responder preguntas sobre puntos de tenis, necesita aproximadamente 80 GB de memoria de GPU y solo lee inglés. El otro es un modelo de visión-lenguaje de 2.4B de Cohere que cabe en una sola tarjeta de estación de trabajo, maneja once idiomas y fue creado, sobre todo, para leer documentos: páginas, gráficos, tablas, OCR.

Están en la misma categoría amplia y casi en ningún otro lugar. Lo que sigue es la versión honesta de la comparación: en qué se diferencian realmente los dos, qué ha publicado y qué no ha publicado cada proveedor, y la única situación en la que la elección es real.

Para qué se creó cada modelo

North Micro Vision Instruct combina un modelo de lenguaje de 2B —el North Micro LLM de Cohere, que sigue la arquitectura Command A+— con un codificador de visión de 400M parámetros entrenado a medida a partir de SigLIP 2 SO400M, para un total de 2,4B. Su ruta de visión es de resolución nativa, preservando las relaciones de aspecto en lugar de redimensionar a una cuadrícula fija, y un proyector DeepStack inyecta embeddings de parches de múltiples capas del codificador en las capas de lenguaje tempranas correspondientes, en lugar de anteponer una única representación. El planteamiento declarado de Cohere es una base compacta para la creación de prototipos y el ajuste fino específico de tareas, con la comprensión de documentos como capacidad insignia. La ficha del modelo es inusualmente franca sobre el techo: North Micro Vision Instruct es explícitamente no un modelo de razonamiento, no admite llamadas a herramientas y no se entrenó con prompts de sistema.

Sports Tennis es la forma opuesta en todas las dimensiones. NVIDIA partió de su propio checkpoint Nemotron 3 Nano Omni 30B-A3B-Reasoning —un híbrido Mamba2-Transformer de mezcla de expertos, 31B en total con unos 3B activos por token— y lo ajustó finamente con un corpus de tenis propietario y etiquetado manualmente. Tanto el codificador de visión (C-RADIOv4-H) como el codificador de voz (Parakeet) permanecieron congelados; solo se movieron los parámetros del modelo de lenguaje. El resultado es un modelo especializado por diseño: responde preguntas estructuradas de opción múltiple y de respuesta abierta sobre un clip completo de un punto de tenis, abarcando la mecánica de los golpes, el posicionamiento en la cancha, el movimiento de los jugadores, datos del partido, conocimiento de las reglas y señales de audio. NVIDIA lo describe como más eficaz cuando se pasa como entrada un punto entero —desde el saque hasta el final del peloteo—.

Las dimensiones que realmente los separan

• Parámetros — North Micro Vision Instruct: 2,4B (2B de lenguaje, 400M de visión). Sports Tennis: 31B en total, ~3B activos por token.

• Entradas — North Micro Vision Instruct: texto e imágenes intercalados, resolución nativa, múltiples imágenes. Sports Tennis: video de hasta 2 minutos, audio de hasta una hora, imágenes, texto.

• Salida — ambos devuelven texto. North Micro Vision Instruct además devuelve cuadros delimitadores de grounding en una escala normalizada de 0 a 1000.

• Idiomas — North Micro Vision Instruct: once o más, incluidos inglés, alemán, francés, español, italiano, portugués, hindi, japonés, coreano, chino y árabe. Sports Tennis: solo inglés.

• Contexto — North Micro Vision Instruct: un backbone lingüístico de 128K tokens, pero Cohere señala que el rango multimodal validado es de hasta 8K tokens, y los contextos multimodales más largos dependen de extrapolación y no han sido evaluados con benchmarks. Deportes Tenis: hasta 256k tokens.

• Huella — North Micro Vision Instruct: unos 4,97 GB en BF16, aproximadamente 2,17 GB en 4 bits. Sports Tennis: unos 62 GB en BF16, se requiere una GPU de 80 GB.

• Licencia — North Micro Vision Instruct: Apache 2.0. Sports Tennis: OpenMDW-1.1, con la tarjeta indicando uso comercial y no comercial.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs North Micro Vision Instruct — the scoreboard.' Left column lists Parameters 31B (about 3B active), Inputs video audio image text, Languages English only, Published benchmarks none, Footprint about 62 GB, GPU floor 1 x 80 GB. Right column lists Parameters 2.4B, Inputs interleaved text and images at native resolution, Languages eleven or more, Published benchmarks DocVQA 0.921 / ChartQA 0.808 / OCRBench 0.792 / MMMU 0.329, Footprint about 5 GB at BF16, GPU floor a single workstation card. Footer reads 'NVIDIA figures from its model card with no published results; Cohere figures vendor-reported.'

Benchmarks: un modelo los tiene, el otro tiene un protocolo

Aquí es donde las dos tarjetas no podrían ser más diferentes en postura.

Cohere publica cifras para North Micro Vision Instruct. DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 — y MMMU 0,329. Todas reportadas por el proveedor, ninguna reproducida de forma independiente, y la propia Cohere señala que los resultados de OCR varían drásticamente según la partición. Vale la pena detenerse en esa última cifra: una puntuación de 0,329 en MMMU es baja, y es coherente con todo lo demás que la ficha dice sobre el diseño del modelo. Este es un especialista en lectura, no un modelo de razonamiento general, y la empresa que lo construyó lo afirma. Ese tipo de divulgación es más útil que una cifra halagadora.

NVIDIA no publica nada. La ficha de Sports Tennis describe cuidadosamente su evaluación —una partición de prueba de 12 partidos totalmente reservados, 2,689 clips a nivel de punto y 80,872 preguntas de partidos sin solapamiento con el entrenamiento, puntuadas mediante precisión automatizada en opción múltiple y LLM-as-judge pass@9 en respuestas abiertas, con la división de partidos vistos explícitamente excluida de las pruebas reportadas— y luego no reporta ningún resultado de nada de ello. El lado del entrenamiento es igualmente detallado: 1,312,129 ejemplos de preguntas y respuestas, 1,226,081 de opción múltiple y 86,048 abiertas, extraídos de 43,084 clips a nivel de punto en 239 partidos, etiquetados según 38 categorías de anotación.

Aunque NVIDIA hubiera publicado puntuaciones, no serían comparables. No hay ningún benchmark en el que aparezcan a la vez un modelo de comprensión de documentos y un modelo de puntos de tenis. El solapamiento entre estas dos historias de evaluación es cero.

A screenshot of the Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, captured September 11, 2026, showing the description as a 2.4B-parameter open-weight vision-language model with native-resolution image support under Apache 2.0, model details listing a 2B language model and a 400M vision encoder custom-trained from SigLIP 2 SO400M, a 128K-token language backbone context with an 8K validated multimodal range, eleven listed languages, and the note that public vLLM support is coming soon.

Despliegue: donde radica la diferencia práctica

El modelo de 2.4B es, con amplio margen, lo más fácil de operar. Aproximadamente 5 GB de pesos BF16 significa que una sola GPU de estación de trabajo moderna puede manejarlo, y la compilación de 4 bits de alrededor de 2.17 GB es aún más pequeña. Existen ports independientes para el runtime Core AI de Apple, con un rendimiento reportado de ~18.2 tokens/s en int8 en un iPhone 17 Pro y la cuantización int4 fallando por completo. La fricción está en el software: North Micro Vision Instruct requiere Transformers 5.16.0 —instalable desde el código fuente hasta que llegue a PyPI— y el soporte público de vLLM todavía se describía como próximamente en la ficha. El ajuste fino es compatible a través de Axolotl. No hay una API alojada de primera parte; la ruta práctica es el autoalojamiento.

Sports Tennis es lo más difícil de operar y no hay forma de evitarlo. Una GPU de 80 GB en BF16, ningún checkpoint cuantizado publicado, solo en inglés, solo en Linux, sobre PyTorch/Transformers o NeMo o Megatron. NVIDIA probó en A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor y RTX 5090 — una lista de hardware que dice más sobre lo que NVIDIA quería validar que sobre lo que un equipo normal puede aprovisionar. La política de inferencia predeterminada de la tarjeta también es mínima: 2 fotogramas por segundo hasta 128 fotogramas, 256 tokens nuevos, decodificación greedy.

Ninguno de los dos modelos se sirve en OrcaRouter. North Micro Vision Instruct no tiene endpoint propio y no está en nuestro catálogo; Sports Tennis no tiene endpoint en ninguna parte, ya que NVIDIA publicó los pesos y no existe un servicio alojado. Ambas son decisiones de autoalojamiento.

Donde una capa de enrutamiento sí ayuda es en el pipeline que los rodea: cualquiera de estos que ejecutes localmente, los modelos de transcripción, resumen, recuperación y aplicación que lo rodean están alojados, y ponerlos detrás de una única clave de API con conmutación por error automática evita tener que montar un conjunto de credenciales y un contrato independientes para cada uno. Trasladamos el precio de lista del proveedor con un 0 % de margen en los modelos que sí ofrecemos, así que las partes de la pila que no autoalojas se mantienen al precio del proveedor.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips, and a minimum GPU of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

Cuando la elección es real

Hay un escenario en el que elegir entre estos dos es una decisión genuina, y vale la pena ser concreto al respecto porque no es obvio.

Es el caso de una organización de medios o deportiva que ya procesa documentos y quiere añadir comprensión de video a nivel de punto. Una emisora con un pipeline de archivo, una liga con informes de partidos y PDFs estadísticos, un titular de derechos con texto y metraje — para ellos, North Micro Vision Instruct probablemente ya está en el stack para OCR y extracción de gráficos, y Sports Tennis es la nueva capacidad que estarían añadiendo. La pregunta no es "cuál de los dos", sino "cuánto me cuesta el segundo en infraestructura", y la respuesta es una GPU de centro de datos y una restricción de solo inglés.

Fuera de ese caso, los modelos simplemente no compiten. Si necesitas que se lean documentos en once idiomas en una tarjeta para estación de trabajo, North Micro Vision Instruct es la respuesta y Sports Tennis es irrelevante para ti. Si necesitas hacer preguntas estructuradas sobre puntos de tenis con contexto de audio, Sports Tennis es el único de los dos que lo hace, y el hecho de que carezca de benchmarks publicados es un riesgo que aceptarías en lugar de una razón para elegir el otro modelo.

¿Cuál elegir?

Elige North Micro Vision Instruct si tu trabajo implica documentos, gráficos, OCR, grounding o comprensión de imágenes multilingüe, y si valoras a un proveedor que publica sus cifras débiles junto a las fuertes. Es pequeño, Apache 2.0, está bien documentado y es honesto sobre no ser un modelo de razonamiento. Su MMMU de 0.329 no es un defecto que descubras después; Cohere te lo dice desde el principio.

Elige NVIDIA NemotronLabs AI for Media - Sports Tennis solo si necesitas específicamente razonamiento de tenis a nivel de punto con audio, tienes una GPU de 80 GB de sobra y te sientes cómodo siendo la primera persona en evaluarlo. Nadie ha publicado una puntuación para este modelo, así que la descarga es el experimento. Eso no es una razón para evitarlo —un especialista de nicho con un conjunto de entrenamiento de 43.084 clips meticulosamente etiquetado es exactamente el tipo de modelo que puede superar a un generalista en su propia tarea—, pero sí es una razón para tratar el primer despliegue como una prueba en lugar de un compromiso.

Lo único que no deberías hacer es tratarlos como si fueran intercambiables porque ambos digan "modelo de visión y lenguaje" en la ficha. Un lector de documentos y un analista de tenis nunca fueron el mismo producto, y en este par la diferencia en lo que hacen es mucho mayor que la diferencia en lo bien que lo hacen.