
Nemotron Sports Tennis vs North Micro Vision Instruct: Um leitor de tênis de 31B contra um especialista em documentos de 2,4B
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 por 1M de tokens
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Resposta curta primeiro: NVIDIA NemotronLabs AI for Media - Sports Tennis e North Micro Vision Instruct não são substitutos, e ninguém que esteja escolhendo entre eles está de fato escolhendo entre eles. Um é um modelo multimodal de 31B que a NVIDIA ajustou finamente para responder a perguntas sobre pontos de tênis, precisa de aproximadamente 80 GB de memória de GPU e lê apenas inglês. O outro é um modelo de visão-linguagem de 2,4B da Cohere que cabe em uma única placa de workstation, lida com onze idiomas e foi criado acima de tudo para ler documentos — páginas, gráficos, tabelas, OCR.
Eles ficam na mesma categoria ampla e quase em nenhum outro lugar. O que se segue é a versão honesta da comparação: onde os dois realmente divergem, o que cada fornecedor publicou e não publicou, e a única situação em que a escolha é real.
O que cada modelo foi criado para fazer
North Micro Vision Instruct combina um modelo de linguagem de 2B — o North Micro LLM da Cohere, seguindo a arquitetura Command A+ — com um codificador de visão de 400M de parâmetros treinado personalizadamente a partir do SigLIP 2 SO400M, totalizando 2,4B. Seu caminho de visão é de resolução nativa, preservando proporções em vez de redimensionar para uma grade fixa, e um projetor DeepStack injeta embeddings de patches de várias camadas do codificador nas camadas iniciais correspondentes da linguagem, em vez de prefixar uma única representação. O enquadramento declarado da Cohere é uma base compacta para prototipagem e ajuste fino específico de tarefas, com compreensão de documentos como capacidade principal. O cartão do modelo é excepcionalmente franco sobre o teto: North Micro Vision Instruct explicitamente não é um modelo de raciocínio, não tem chamada de ferramentas e não foi treinado com prompts de sistema.
O Sports Tennis tem a forma oposta em todas as dimensões. A NVIDIA partiu do seu próprio checkpoint Nemotron 3 Nano Omni 30B-A3B-Reasoning — uma mistura de especialistas híbrida Mamba2-Transformer, com 31B no total e cerca de 3B ativos por token — e fez fine-tuning dele num corpus de tênis proprietário, rotulado manualmente. O codificador de visão (C-RADIOv4-H) e o codificador de fala (Parakeet) foram ambos congelados; apenas os parâmetros do modelo de linguagem foram alterados. O resultado é um modelo estreito por conceção: ele responde a perguntas estruturadas de múltipla escolha e abertas sobre um clipe completo de ponto de tênis, abrangendo mecânica de golpes, posicionamento em quadra, movimento dos jogadores, fatos da partida, conhecimento de regras e sinais de áudio. A NVIDIA o descreve como funcionando melhor quando um ponto inteiro — do saque até o fim do rali — é fornecido como entrada.
As dimensões que realmente os separam
• Parâmetros — North Micro Vision Instruct: 2,4 B (2 B de linguagem, 400 M de visão). Sports Tennis: 31 B no total, ~3 B ativos por token.
• Entradas — North Micro Vision Instruct: texto e imagens intercalados, resolução nativa, múltiplas imagens. Sports Tennis: vídeo de até 2 minutos, áudio de até uma hora, imagens, texto.
• Saída — ambos retornam texto. O North Micro Vision Instruct também retorna caixas delimitadoras de fundamentação numa escala normalizada de 0 a 1000.
• Idiomas — North Micro Vision Instruct: onze ou mais, incluindo inglês, alemão, francês, espanhol, italiano, português, híndi, japonês, coreano, chinês e árabe. Tênis Esportivo: apenas inglês.
• Contexto — North Micro Vision Instruct: um backbone de linguagem de 128K tokens, mas a Cohere sinaliza que a faixa multimodal validada é de até 8K tokens, com contextos multimodais mais longos dependendo de extrapolação e sem benchmark. Esportes Tênis: até 256k tokens.
• Pegada — North Micro Vision Instruct: cerca de 4,97 GB em BF16, aproximadamente 2,17 GB em 4 bits. Sports Tennis: cerca de 62 GB em BF16, sendo necessária uma GPU de 80 GB.
• Licença — North Micro Vision Instruct: Apache 2.0. Sports Tennis: OpenMDW-1.1, com o card indicando uso comercial e não comercial.

Benchmarks: um modelo os tem, o outro tem um protocolo
É aqui que os dois cartões não poderiam ser mais diferentes em postura.
A Cohere publica números para o North Micro Vision Instruct. DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 — e MMMU 0,329. Todos relatados pelo fornecedor, nenhum reproduzido independentemente, e a própria Cohere sinaliza que os resultados de OCR variam drasticamente por divisão. Vale a pena parar para refletir sobre esse último número: uma pontuação MMMU de 0,329 é baixa, e é consistente com tudo o mais que a ficha diz sobre o design do modelo. Este é um especialista em leitura, não um modelo de raciocínio geral, e a empresa que o construiu diz isso. Esse tipo de divulgação é mais útil do que um número lisonjeiro.
A NVIDIA não publica nada. O card do Sports Tennis descreve sua avaliação com cuidado — uma partição de teste de 12 partidas totalmente reservadas, 2.689 clipes em nível de ponto e 80.872 perguntas de partidas sem sobreposição com o treinamento, pontuadas por acurácia automatizada de múltipla escolha e pass@9 com LLM como juiz em respostas abertas, com a divisão de partidas vistas explicitamente excluída dos testes relatados — e depois não relata nenhum resultado de nada disso. O lado do treinamento é igualmente detalhado: 1.312.129 exemplos de perguntas e respostas, 1.226.081 de múltipla escolha e 86.048 abertos, extraídos de 43.084 clipes em nível de ponto de 239 partidas, rotulados segundo 38 categorias de anotação.
Mesmo que a NVIDIA tivesse publicado as pontuações, elas não seriam comparáveis. Não há nenhum benchmark no qual um modelo de compreensão de documentos e um modelo de pontos de tênis apareçam ambos. A sobreposição entre essas duas histórias de avaliação é zero.

Implantação: onde reside a diferença prática
O modelo de 2,4B é, de longe, a coisa mais fácil de operar. Aproximadamente 5 GB de pesos BF16 significam que uma única GPU de estação de trabalho moderna dá conta dele, e a versão de 4 bits, com cerca de 2,17 GB, fica ainda menor. Existem ports independentes para o runtime Core AI da Apple, com cerca de 18,2 tokens/s relatados em int8 em um iPhone 17 Pro, enquanto a quantização int4 falha completamente. A dificuldade está no software: o North Micro Vision Instruct exige o Transformers 5.16.0 — instalável a partir do código-fonte até chegar ao PyPI — e o suporte público ao vLLM ainda era descrito como "em breve" no cartão. O fine-tuning é suportado por meio do Axolotl. Não há API hospedada própria; o caminho prático é a auto-hospedagem.
O Sports Tennis é a coisa mais difícil de operar e não há como contornar isso. Uma GPU de 80 GB em BF16, nenhum checkpoint quantizado publicado, somente em inglês, somente Linux, em PyTorch/Transformers ou NeMo ou Megatron. A NVIDIA testou em A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor e RTX 5090 — uma lista de hardware que diz mais sobre o que a NVIDIA queria validar do que sobre o que uma equipe normal consegue provisionar. A política de inferência padrão da placa também é mínima: 2 quadros por segundo até 128 quadros, 256 novos tokens, decodificação gulosa.
Nenhum dos dois modelos é servido no OrcaRouter. O North Micro Vision Instruct não tem endpoint próprio e não está no nosso catálogo; o Sports Tennis não tem endpoint em lugar nenhum, já que a NVIDIA publicou os pesos, e não um serviço hospedado. Ambos são decisões de auto-hospedagem.
Onde uma camada de roteamento ajuda é no pipeline ao redor deles — seja qual for desses que você executa localmente, os modelos de transcrição, sumarização, recuperação e aplicação que o cercam são hospedados, e colocá-los atrás de uma única chave de API com failover automático evita montar um conjunto de credenciais e um contrato separados para cada um. Repassamos o preço de tabela do fornecedor com 0% de margem nos modelos que disponibilizamos, então as partes da pilha que você não hospeda por conta própria permanecem no preço do fornecedor.

Quando a escolha é real
Há um cenário em que escolher entre estes dois é uma decisão genuína, e vale a pena ser concreto quanto a isso, porque não é óbvio.
Trata-se do caso de uma organização de mídia ou de esportes que já processa documentos e quer adicionar compreensão de vídeo em nível de ponto. Uma emissora com um pipeline de arquivo, uma liga com relatórios de partidas e PDFs estatísticos, um detentor de direitos com texto e filmagens — para eles, o North Micro Vision Instruct provavelmente já está na stack para OCR e extração de gráficos, e o Sports Tennis é a nova capacidade que eles estariam adicionando. A pergunta não é "qual deles", mas "quanto o segundo me custa em infraestrutura", e a resposta é uma GPU de datacenter e uma restrição de apenas inglês.
Fora desse caso, os modelos simplesmente não competem. Se você precisa que documentos sejam lidos em onze idiomas em uma placa de workstation, North Micro Vision Instruct é a resposta, e Sports Tennis é irrelevante para você. Se você precisa fazer perguntas estruturadas sobre pontos de tênis com contexto de áudio, Sports Tennis é o único dos dois que faz isso, e o fato de ele não ter benchmarks publicados é um risco que você estaria aceitando, e não um motivo para escolher o outro modelo.
Qual escolher
Escolha o North Micro Vision Instruct se o seu trabalho envolve documentos, gráficos, OCR, grounding ou compreensão de imagens multilíngue, e se você valoriza um fornecedor que publica seus números fracos ao lado dos fortes. Ele é pequeno, Apache 2.0, bem documentado e honesto quanto a não ser um modelo de raciocínio. Seu MMMU de 0,329 não é uma falha que você descobre depois; a Cohere avisa você de antemão.
Escolha NVIDIA NemotronLabs AI for Media - Sports Tennis apenas se você precisar especificamente de raciocínio de tênis em nível de ponto com áudio, tiver uma GPU de 80 GB sobrando e estiver confortável em ser a primeira pessoa a avaliá-lo. Ninguém publicou uma pontuação para este modelo, então o download é o experimento. Isso não é motivo para evitá-lo — um especialista de nicho com um conjunto de treinamento de 43.084 clipes meticulosamente rotulado é exatamente o tipo de modelo que pode superar um generalista em sua própria tarefa —, mas é motivo para tratar a primeira implantação como um teste, e não como um compromisso.
A única coisa que você não deve fazer é tratá-los como intercambiáveis porque ambos dizem "modelo de visão-linguagem" na ficha. Um leitor de documentos e um analista de tênis nunca foram o mesmo produto e, neste par, a diferença naquilo que eles fazem é muito maior do que a diferença em quão bem eles fazem isso.
