
Nemotron Sports Tennis vs InternLumina U2: A comparação que nenhum dos modelos pode perder
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 por 1M de tokens
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Pergunte qual é melhor — NVIDIA NemotronLabs AI for Media - Sports Tennis ou InternLumina U2 — e a resposta honesta é que a pergunta não se resolve. Os dois repositórios apareceram no Hugging Face em setembro de 2026, ambos são modelos multimodais de mistura de especialistas criados por laboratórios bem financiados, e quase não têm nada mais em comum. O modelo da NVIDIA é um especialista de 31B que lê um único ponto de tênis e responde a perguntas sobre ele. O InternLumina U2, da equipe InternLM do Shanghai AI Laboratory e publicado como internlm/InternLumina-U2, é um modelo unificado de 16B que entende imagens, vídeo e 3D e também gera e edita imagens. Eles não compartilham nenhum benchmark, nenhum usuário-alvo e nenhum perfil de implantação. Compará-los é menos como escolher um telefone e mais como escolher entre um estetoscópio e uma impressora 3D.
O que torna essa dupla digna de ser tema de um texto, de todo modo, é um padrão que ambos os modelos compartilham: nenhum dos dois foi avaliado de forma independente, e ambos estão sendo descritos por seu próprio fornecedor como algo que não está pronto. Essa é a comparação de verdade — não qual modelo vence, mas quanto de qualquer um dos dois você consegue de fato verificar hoje.
Dois trabalhos diferentes vestindo a mesma palavra
"Multimodal" abrange ambos e não diz nada. Aqui está a divisão:
• O que ele aceita — Sports Tennis: vídeo (mp4 de até 2 minutos), áudio (wav/mp3), imagens, texto. InternLumina U2: texto, imagens, vídeo e 3D. O modelo de tênis é o único dos dois com um substancial caminho de áudio, conectado por meio de um codificador de fala Parakeet que lê o som da torcida e dos impactos junto com os quadros.
• O que ele entrega — Sports Tennis: apenas texto. InternLumina U2: texto eimagens geradas ou editadas, por meio de uma representação visual totalmente discreta de 8 codebooks construída sobre o AToken.
• O que o usuário pergunta — Tênis: "o que aconteceu neste ponto, onde o jogador estava posicionado, a bola caiu dentro." InternLumina U2: "descreva este gráfico e depois desenhe para mim uma nova versão dele."
• Arquitetura — Sports Tennis: MoE híbrido Mamba2-Transformer, 31B no total com cerca de 3B ativos por token, herdando seu backbone e codificadores do Nemotron 3 Nano Omni. InternLumina U2: um MoE esparso de 16B com 1B de parâmetros ativos, construído como um modelo de linguagem de difusão de múltiplos codebooks em vez de um modelo autorregressivo convencional.
• Contexto — Sports Tennis publica até 256k tokens. O card do InternLumina U2 não divulga um número de contexto.
• Licença — Sports Tennis é distribuído sob a OpenMDW-1.1, com o cartão declarando uso comercial e não comercial. InternLumina U2 é Apache 2.0.

O que realmente os torna incomparáveis
Não existe um placar compartilhado, e vale a pena ser preciso quanto ao porquê, em vez de deixar isso como um vago encolher de ombros.
O Sports Tennis foi ajustado em um conjunto de dados de tênis proprietário da NVIDIA — 1.312.129 exemplos de perguntas e respostas em 43.084 clipes em nível de ponto de 239 partidas, rotulados segundo 38 categorias de anotação, todos coletados em 2025. Seu conjunto de teste é uma partição reservada de 12 partidas, 2.689 clipes e 80.872 perguntas. Cada um desses artefatos pertence à própria NVIDIA. Nenhum grupo externo tem os dados, então nenhum grupo externo pode reproduzir uma pontuação — e, por sinal, a NVIDIA não publicou nenhuma pontuação para reproduzir. O card documenta o protocolo de avaliação em detalhes e depois não relata nenhum resultado dele. Nada sobre acurácia, nada por categoria, nada.
O InternLumina U2 fica do lado oposto dessa mesma parede. Ele publica números, mas eles são explicitamente parciais. A ficha do modelo diz isso em uma linha: "Resultados preliminares e parciais. As tabelas comparativas completas aparecerão no próximo relatório técnico." O que existe é uma variedade de números divulgados por fornecedores em capacidades muito diferentes — ChartQA 86,52 e CharXiv-DQ 83,65 em documentos, MathVision 33,22 e DynaMath 56,37 em matemática visual, VideoMME 51,26 e MVBench 59,74 em vídeo, 3D MM-Vet 41,8, DPG-Bench 87,10 e GenEval 0,81 em geração, ImgEdit 3,83 em edição. E a própria tabela da página do projeto mostra o modelo ficando atrás de pelo menos um concorrente nomeado em pelo menos uma métrica principal: GenEval 0,81 contra 0,89 do LLaDA2.0-Uni.
Portanto, um modelo tem uma avaliação documentada e nenhum resultado, e o outro tem resultados e uma avaliação explicitamente incompleta. Nenhum dos dois fornece um número que você possa colocar lado a lado com o outro. Qualquer página que classifique esses dois inventou a sua classificação.

Onde eles realmente se sobrepõem, e o que isso mostra
A compreensão de vídeo é o único território que ambos reivindicam, e mesmo aí a sobreposição é menor do que parece. O InternLumina U2 reporta VideoMME 51,26 e MLVU 57,03 e MVBench 59,74 — pontuações de compreensão geral de vídeo, relatadas pelo fornecedor. O Sports Tennis não reporta nada, mas sua ficha descreve uma tarefa muito mais estreita e muito mais profunda: raciocínio em nível de ponto ao longo de um rally completo com áudio, em 38 categorias de anotação refinada, incluindo mecânica de golpe, posicionamento em quadra, movimentação e estado do placar.
A inferência razoável é que o InternLumina U2 seria o melhor generalista e o Sports Tennis o melhor leitor de tênis, mas isso é uma inferência baseada no formato da tarefa, não nos dados. Ela poderia facilmente estar errada em qualquer direção. O que não é inferência é que um benchmark de vídeo geral e um benchmark proprietário de tênis em nível de ponto não podem ser colocados no mesmo eixo, e que um gerador unificado de 16B e um especialista de 31B com codificador congelado não foram criados para responder à mesma pergunta.
Executar qualquer um dos dois é um tipo diferente de projeto
A implantação é onde a lacuna deixa de ser filosófica.
Sports Tennis afirma um mínimo absoluto de uma GPU com cerca de 80 GB de memória em BF16, com pesos em torno de 62 GB, testado em A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor e RTX 5090. Não há checkpoint quantizado, então o requisito de 80 GB não é negociável para redução hoje. Também é somente em inglês.
O problema mais interessante do InternLumina U2 não é a memória, é o silício. O repositório hospeda checkpoints divididos por hardware de treinamento: um diretório completo ascend/ com sete shards de safetensors treinados em NPUs Ascend da Huawei, e um nvidia/ diretório marcado como "em breve". Se você está rodando hardware NVIDIA — o que, para um modelo cujo irmão é um fine-tune de tênis do Nemotron, corresponde à maioria das pessoas que lê isto —, o checkpoint que você quer é o que ainda não chegou. O código de inferência e as instruções de configuração ficam no repositório do InternLM no GitHub, em vez de no Hub, e o relatório técnico ainda está pendente.
Isso inverte a expectativa habitual. O modelo proprietário, sem benchmarks e em formato de appliance, é o que você pode baixar e executar agora mesmo, logo no primeiro dia. O modelo de pesquisa aberto Apache-2.0 é o que está esperando por uma build específica de hardware.

Onde um roteador se encaixa — e onde não se encaixa
Nenhum desses modelos está hospedado no OrcaRouter, e não há como contornar isso de forma honesta. O Sports Tennis não tem endpoint em lugar nenhum; a NVIDIA publicou pesos e nada mais. O próprio repositório do InternLumina U2 observa que os checkpoints da NVIDIA ainda estão pendentes, então também não há nada para servir do nosso lado. Esta é uma decisão de auto-hospedagem nos dois casos, não uma decisão de roteamento.
A questão do roteamento aparece uma camada acima. Uma equipe que quer avaliar um especialista como Sports Tennis contra um generalista como InternLumina U2 não faz isso de forma isolada — faz isso como um candidato em um pipeline que também precisa de transcrição de fala, tratamento de documentos, sumarização e a lógica de aplicação em torno deles. Esses componentes são hospedados, e são as partes em que uma única chave de API cobrindo mais de 200 modelos com failover automático entre provedores economiza uma semana de trabalho de integração. Uma chave para os modelos que você pode chamar, então os que você precisa executar por conta própria são a única coisa que você realmente mantém.
A questão em aberto
Colocados lado a lado, NVIDIA NemotronLabs AI for Media - Sports Tennis e InternLumina U2 são uma ilustração decente de duas maneiras de lançar um modelo multimodal de forma ruim em público. Um documentou sua avaliação e não divulgou os resultados; o outro publicou resultados e rotulou sua avaliação como incompleta. Ambos são, a partir de setembro de 2026, alegações não falseáveis.
O interessante de observar não é qual deles se mostra mais forte — eles nunca serão testados na mesma coisa. É qual laboratório fecha sua lacuna primeiro. Se a NVIDIA publicar números de tênis, terá resolvido o problema mais difícil, porque um benchmark proprietário reservado de 12 partidas não vistas é a única maneira honesta de avaliar um ajuste fino de domínio, e a NVIDIA já criou a divisão. Se a InternLM disponibilizar os checkpoints da NVIDIA e o relatório técnico, terá tornado seu modelo Apache-2.0 genuinamente utilizável no hardware que seus usuários possuem. Aconteça o que acontecer, esta comparação valerá a pena ser relida — porque, neste momento, a coisa mais defensável que o cartão de qualquer um dos modelos sustenta é um encolher de ombros.
