
InternLumina-U2 vs Microsoft Mage-VL: Dois Laboratórios Discretos Apostando que os Tokens de Visão Devem Carregar Mais Peso
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
O Microsoft Mage-VL e o InternLumina-U2 foram lançados do jeito que laboratórios de pesquisa lançam quando ainda não têm certeza de que o resultado é um produto: silenciosamente. A Microsoft publicou os pesos e o código do Mage-VL no Hugging Face em 25 de julho de 2026, sem nenhum anúncio; a organização InternLM do Shanghai AI Laboratory publicou o código de inferência do InternLumina-U2 no GitHub em 1º de setembro de 2026, também sem anúncio. Com cinco semanas de diferença, dois dos maiores laboratórios do mundo disponibilizaram modelos que compartilham uma convicção silenciosa — de que a forma como transformamos visão em tokens é o gargalo — e depois os deixaram para a comunidade notar. Um deles você pode baixar e executar hoje, de forma um tanto desajeitada. O outro você não consegue executar de jeito nenhum, porque os pesos dele ainda não existem. Este é o mapa honesto dos dois, e de por que "ambos relatados pelo fornecedor, ambos não comprovados" não é a mesma frase para os dois.
Cinco semanas, duas apostas em eficiência de representação
A linha condutora é real, não retórica. O Mage-VL é um modelo de vídeo nativo de codec: em vez de decodificar um fluxo em quadros uniformemente amostrados e alimentar um transformer de visão pré-treinado na web e congelado com uma grade densa de patches, ele segue a estrutura dos codecs de vídeo modernos, separando um fluxo em quadros-âncora e nos dados de movimento comprimidos entre eles, e consumindo diretamente essa representação compacta. O ganho relatado pela Microsoft é uma grande redução nos tokens visuais e um caminho de percepção em streaming significativamente mais rápido — a empresa enquadra isso como a correção de uma espécie de paradoxo de Moravec para modelos de linguagem de vídeo, em que pequenas tarefas de percepção em tempo real custam tanto poder computacional quanto um raciocínio offline difícil. O Mage-VL é um observador: consome vídeo com eficiência e responde a perguntas sobre o que vê, em tempo quase real.
InternLumina-U2 é uma aposta no mesmo gargalo a partir da outra direção. Enquanto o Mage-VL comprime vídeo seguindo o codec, o InternLumina-U2 comprime toda entrada visual descrevendo cada posição com oito códigos discretos complementares em vez de um, usando um tokenizador que o laboratório chama de AToken. A aposta é que um único codebook limita a quantidade de informação que um token visual pode carregar; assim, um vocabulário com múltiplos codebooks permite que um modelo de difusão de 16B parâmetros realize compreensão e geração pela mesma interface — ler um gráfico, responder a uma pergunta de vídeo, descrever um ativo 3D, gerar uma imagem a partir de texto, editar uma a partir de instrução — sem uma pilha de geração separada. O Mage-VL quer perceber fluxos de forma econômica; o InternLumina-U2 quer perceber e desenhar com um único conjunto de pesos.
O placar
Os números de ambos os modelos são informados pelo fornecedor e não reproduzidos, então o placar rotula cada linha com sua procedência.
• Shape — Mage-VL: um modelo compacto de visão-linguagem nativo de codec (cerca de 5B de parâmetros em BF16) construído em torno de um backbone de texto Qwen, treinado para compreensão de imagens e vídeos. InternLumina-U2: um MoE de 16B de parâmetros com 1B ativo (16B-A1B), um LLM de difusão esparso que abrange compreensão, geração e edição.
• Representação visual — Mage-VL: tokens nativos de codec seguindo a estrutura de codec de vídeo (âncora mais movimento); redução relatada de >75% de tokens visuais em vídeo de streaming. InternLumina-U2: tokens totalmente discretos de oito codebooks do tokenizador AToken.
• O que faz — Mage-VL: analisa entradas de imagem e vídeo, responde em texto; construído para percepção em streaming. InternLumina-U2: afirma ter capacidades de texto, compreensão de imagem, texto para imagem, edição de imagem, compreensão de vídeo e compreensão 3D.
• Pesos — Mage-VL: público no Hugging Face desde 25 de julho de 2026 (microsoft/Mage-VL, Apache-2.0). InternLumina-U2: não público — o repositório no Hugging Face é um stub vazio, com pesos marcados como "em breve".
Números de destaque — Mage-VL: Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, todos reportados pela Microsoft. InternLumina-U2: ChartQA 86.52, MathVision 33.22, VideoMME 51.26, GenEval 0.81, todos reportados pelo laboratório, preliminares e parciais.
• Realidade do serviço — Mage-VL: pode ser baixado, mas não há um caminho padrão vLLM ou SGLang; o código requer trust_remote_code, e nenhum provedor de inferência o implanta atualmente. InternLumina-U2: não pode ser servido por ninguém — os pesos não existem publicamente, e até mesmo o driver de inferência lançado espera arquivos de checkpoint que não estão no repositório.

"Disponível, mas complicado" não é o mesmo que "não disponível"
Esta é a distinção que mais importa se você está realmente tentando construir algo. O Mage-VL é real da maneira que conta primeiro: os pesos estão no Hugging Face, a ficha do modelo tem visto um tráfego intenso de downloads desde o final de julho, e um pequeno ecossistema de quantizações da comunidade surgiu ao redor dele. "Real" não significa "fácil". A ficha do modelo mostra uma tag de código personalizado, o codificador visual não é o ViT congelado padrão que as pilhas de serviço existentes assumem, e o próprio repositório da Microsoft carrega a consequência prática — executá-lo significa trust_remote_code e nenhuma implantação pronta em provedor. Mas uma equipe determinada com uma GPU pode carregá-lo, apontá-lo para um fluxo de vídeo e ver se a tese nativa do codec se sustenta para seus dados. Isso é uma diferença enorme em relação ao InternLumina-U2, onde a mesma frase termina de forma diferente: uma equipe determinada pode ler o código de inferência, e então para, porque não há pesos para carregar.

O cartão Hugging Face do microsoft/Mage-VL, capturado em 27 de agosto de 2026 — a descrição de streaming nativo de codec, a licença Apache-2.0, a tag arxiv e uma seção de provedores de inferência mostrando que nenhum provedor atualmente implanta o modelo.
A assimetria dos benchmarks segue a mesma linha. Os números de ambos os modelos são alegações dos próprios desenvolvedores, sem reexecuções independentes até agora. Mas as alegações do Mage-VL, pelo menos, estão apoiadas em um artefato baixável, o que significa que a distância entre alegação e verificação é apenas uma questão de alguém executá-lo. As alegações do InternLumina-U2, por sua vez, estão apoiadas em um item de roadmap — "as tabelas de comparação completas aparecerão no próximo relatório técnico" — e não existe nenhum artefato que possa verificá-las. A própria tabela parcial do laboratório mostra até o modelo ficando atrás de pelo menos um rival que ele afirma superar (GenEval 0,81 contra 0,89 do LLaDA2.0-Uni), o que é um lembrete útil para ler literalmente o rótulo "preliminar, parcial".
Onde pudessem compor em vez de competir.
A maneira mais útil de ler esses dois é como degraus adjacentes de uma escada, não como concorrentes para a mesma função. Um observador nativo de codec como o Mage-VL é interessante justamente porque é barato o suficiente para rodar continuamente — aquele que observa cada quadro de um fluxo e só escala quando algo que merece a atenção de um modelo maior aparece. O modelo maior para o qual ele escala poderia, em princípio, ser um modelo unificado do tipo que o modelo InternLumina-U2 afirma ser: o portão sempre ativo que decide o que observar, e o modelo profundo que de fato lê o gráfico, acompanha a cena 3D ou produz a imagem editada. Ambos ainda não foram comprovados — Mage-VL: não comprovado, porém executável; InternLumina-U2: não comprovado e não lançado — portanto, a leitura honesta é uma composição que você poderia construir assim que cada lado tiver sido validado de forma independente, não um confronto direto que você possa executar hoje.

O repositório do GitHub InternLM/InternLumina-U2, capturado em 2 de setembro de 2026 — a página inicial do repositório exibindo a descrição da difusão multi-codebook, o selo de licença Apache-2.0 e os scripts de ponto de entrada de inferência que compõem o lançamento público, enquanto os pesos permanecem fora da árvore do repositório.
O que uma camada de roteamento faz com checkpoints não comprovados
Nenhum desses modelos está hospedado no OrcaRouter, e não vamos dar a entender o contrário — o Mage-VL não tem caminho de servição padrão em lugar nenhum, e o InternLumina-U2 não tem pesos. O que o DSL de roteamento realmente oferece de útil nessa situação é expressar a composição acima como uma única chamada em vez de uma cola artesanal: um modelo de percepção barato e sempre ativo alimentando um modelo mais profundo, encadeados de modo que o modelo caro só execute quando o barato detectar que algo mudou. E quanto ao problema do checkpoint não comprovado — que é todo o perfil de risco desses dois — o failover automático é o mecanismo que permite a uma equipe testar um modelo como o Mage-VL em um caminho real sem apostar o caminho nele: na primeira vez que o novo checkpoint trava, retorna lixo ou lança erro, a chamada cai para um modelo comprovado, e nenhum engenheiro precisa ser acordado para virar uma chave. Uma única API em mais de 200 modelos, preço de tabela do provedor repassado com margem de 0%, e a novidade testada atrás de uma rede de segurança em vez de na frente da produção.
O resultado final
Se você quiser testar a tese do codec de vídeo nativo hoje, apenas o Mage-VL existe — e "existir" vem com ressalvas sobre código personalizado e serving DIY. Se você quiser testar a tese do modelo unificado de múltiplos codebooks, você não consegue, porque o InternLumina-U2 ainda é uma especificação esperando por seus pesos; o que você pode fazer é ler sua arquitetura agora para estar pronto no momento em que o stub no Hugging Face for preenchido. Trate o modelo da Microsoft como um artefato estranho, mas real, e o modelo do Shanghai AI Lab como uma promessa bem documentada, e lembre-se de que neste confronto "relatado pelo fornecedor e não reproduzido" se aplica a ambos — só significa algo diferente quando há um arquivo que você pode baixar.
