
PixelUMM vs Microsoft Mage-VL: Um Exclui o Tokenizador Visual, o Outro o Reescreve
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Ambos PixelUMM e Microsoft Mage-VL foram construídos por equipes convencidas de que a forma como a visão é transformada em tokens é o gargalo errado — e elas o corrigiram em direções opostas. O Mage-VL, o modelo de streaming nativo de codec da Microsoft, mantém um tokenizador e o torna muito mais agressivo: ele segue a estrutura dos codecs de vídeo modernos, mantém todos os quadros âncora e apenas aqueles patches de quadros previstos nos quais o codec gasta bits, e relata uma redução de mais de 75% nos tokens visuais, ao mesmo tempo que obtém aceleração de até 3,5× em tempo de relógio de parede em relação à amostragem uniforme de quadros. O PixelUMM, o modelo unificado sem codificador da NVIDIA, remove o tokenizador completamente — cada patch 16×16 de pixels brutos chega ao backbone por meio de uma única projeção linear, sem VAE e sem vision transformer em lugar algum. Um comprime com mais força. O outro se recusa a comprimir de todo. E apenas um deles consegue gerar qualquer coisa.
Essa última diferença é o que torna este par mais interessante do que uma disputa de especificações. Mage-VL é um observador — um modelo de percepção em streaming com um gate proativo que decide quando falar. PixelUMM é um leitor que também desenha: os mesmos pesos respondem a perguntas sobre uma imagem e geram novo vídeo a partir de um prompt de texto. São duas respostas incompatíveis para "o que um modelo de visão unificado deveria ser", e cada laboratório tem os seus próprios números.
Onde a compressão acontece
A premissa do Mage-VL é um paradoxo de Moravec moderno: modelos de visão-linguagem são fortes em raciocínio offline difícil, mas lentos e intensivos em computação em percepção simples em tempo real. Sua solução é o alinhamento de codec. Em vez de decodificar um fluxo em quadros amostrados uniformemente e passar uma grade densa por um ViT congelado pré-treinado na web, o Mage-VL separa um fluxo em quadros âncora (I) e quadros preditos (P), retém todos os patches dos quadros âncora e mantém apenas os patches dos quadros preditos que contêm movimento real ou novos detalhes. O codificador, Mage-ViT, é treinado do zero em uma grade de patches 16×16 com codificação de posição rotacional 3D e é explicitamente agnóstico em relação a codecs — a mesma interface aceita vetores de movimento e energia residual de H.264/AVC ou HEVC, ou o mapa de taxas aprendido de um codec neural, sem qualquer alteração de arquitetura ou retreinamento.
A premissa do PixelUMM é que o próprio codificador é o problema, não a sua eficiência. O artigo do PixelUMM argumenta que modelos como o BAGEL carregam duas interfaces visuais — uma ViT para características semânticas e uma VAE para latentes de reconstrução —, o que aproximadamente dobra o contexto visual por imagem de condicionamento e força os pipelines de pré-treinamento de visão-linguagem a serem reconstruídos em torno de um segundo fluxo. O PixelUMM elimina ambas: imagens tornam-se patches espaciais de 16×16, vídeos tornam-se tubelets espaço-temporais de 4 quadros, e pixels brutos chegam a um Transformer somente decodificador por meio de projeções lineares de camada única. A compreensão é texto autorregressivo; a geração é flow matching no espaço de pixels.
• Estratégia de compressão — Mage-VL: temporal, derivada de codec; manter âncoras, esparsificar quadros previstos. PixelUMM: nenhuma; manter cada patch de pixel bruto.
• O que é treinado do zero — Mage-VL: toda a pilha visual, em cerca de 100M de imagens e vídeos não rotulados. PixelUMM: os embedders e decodificadores de pixels, sobre um backbone de linguagem Qwen3-8B.
• Rede principal — Mage-VL: Qwen3-4B-Instruct-2507, o único componente pré-treinado, por trás de um projetor MLP de duas camadas. PixelUMM: Qwen3-8B, cerca de 15,2 bilhões de parâmetros no total.
• Comportamento de streaming — Mage-VL: um gate de cognição pontua cada janela deslizante e permanece silencioso até que um evento que mereça uma resposta seja concluído, invocando o modelo completo apenas nesse momento. PixelUMM: sem modo de streaming; os pedidos são chamadas de geração ou de compreensão.

O que cada um faz, e o que não faz
O Mage-VL é um único checkpoint que fornece simultaneamente compreensão de imagem e vídeo e o gate de streaming proativo — os mesmos pesos respondem a perguntas offline e conduzem comentários condicionados por eventos. Ele reúne o processador de codec, o pacote de codec neural e o gate. Uma segunda versão, microsoft/Mage-ViT, é o codificador visual autônomo da etapa de pré-treinamento do zero, oferecido como front end plug-and-play para outros treinamentos multimodais. O que o Mage-VL não faz é gerar. Ele lê.
O PixelUMM cobre texto para imagem, texto para vídeo com 96 quadros e 24 fps, e texto condicionado por imagem e vídeo. Ele vem com quatro checkpoints — S8-F22-R05 como o padrão que cobre todas as quatro tarefas, S8-F18-R01 ajustado para melhor texto para vídeo em 480p e 720p, mas incapaz de realizar compreensão de vídeo, e dois estágios intermediários. O que ele não faz é streaming, edição ou 3D. Se você precisa de um modelo que assista a um feed ao vivo e fale quando algo acontece, o PixelUMM é completamente inadequado, e nenhuma coluna de benchmark vai dizer isso a você.
A lacuna de adoção é o primeiro sinal honesto
Os dois lançamentos não são igualmente maduros, e os contadores de downloads dizem isso mais claramente do que qualquer post de lançamento.
• Mage-VL — publicado no Hugging Face em 25 de julho de 2026 sob a licença Apache-2.0, com um relatório técnico complementar e um identificador arXiv. No início de outubro, já registrava cerca de 13.800 downloads e 414 curtidas, e um pequeno ecossistema de trabalho da comunidade havia se formado ao seu redor.
• PixelUMM — publicado no Hugging Face em 1 de outubro de 2026 sob uma licença de checkpoint não comercial. Seu número de downloads era zero e seu número de curtidas era três quando isto foi escrito. Tem apenas alguns dias.
Ainda não há anúncio de nenhum dos dois laboratórios sobre o respectivo lançamento — Mage-VL foi lançado em julho sem anúncio, e PixelUMM foi lançado em outubro sem anúncio. Essa simetria é real, mas seria um erro interpretá-la como se os dois fossem artefatos equivalentes. Mage-VL teve dez semanas de atenção da comunidade; PixelUMM teve dias. Um modelo que ninguém fora do laboratório executou é uma proposta diferente de um modelo que alguns milhares de pessoas baixaram, e apenas um desses dois está na segunda categoria.

O placar, com proveniência
Todos os números são do próprio laboratório que os desenvolveu. Os do Mage-VL vêm do card e do relatório técnico da Microsoft; os do PixelUMM, do seu preprint. Nenhum deles foi reproduzido de forma independente.
• Tokens visuais — Mage-VL: redução relatada de mais de 75% em comparação com a amostragem densa de frames. PixelUMM: nenhuma redução; o argumento é que os patches brutos eliminam uma segunda codificação em vez de reduzir a primeira.
• Velocidade real de execução — Mage-VL: até 3,5× mais rápido que a amostragem uniforme de quadros com precisão equivalente, segundo a Microsoft. PixelUMM: nenhuma alegação comparativa de velocidade no artigo.
• Qualidade do codificador — Mage-VL: o Mage-ViT relata 99,33% no CIFAR-10 e 85,69% no ImageNet com um orçamento de 256 tokens, a partir de cerca de 100M de mídias não rotuladas. PixelUMM: nenhum benchmark de codificador equivalente, já que não há codificador a ser avaliado.
• Compreensão de vídeo — Mage-VL: ganhos relatados em relação ao Qwen3-VL-4B em todos os benchmarks de vídeo e de ancoragem temporal que ele reporta, incluindo +22,5 no QVHighlight e +17,1 no ActivityNet. PixelUMM: MVBench 70,53, Video-MME 57,33 sem legendas, LongVideoBench 59,61, LVBench 40,41.
• Compreensão de imagens — Mage-VL: ao nível do Qwen3-VL-4B em imagens estáticas, segundo a Microsoft. PixelUMM MMMU 41,67, AI2D 80,12, DocVQA 90,42, ChartQA 82,96.
• Geração — Mage-VL: nenhum. PixelUMM: GenEval geral 0,83 com um reescritor de prompts, DPG-Bench 85,74, VBench Parte 1 qualidade 84,10.
• Streaming — Mage-VL: gating proativo de eventos com os melhores valores reportados de TimVal, F1, ROC-AUC e PR-AUC no streaming do SoccerNet. PixelUMM: não suportado.
• Licença — Mage-VL: Apache-2.0, código e pesos. PixelUMM: código Apache-2.0, Licença Não Comercial Unidirecional da NVIDIA sobre o checkpoint.
As duas colunas não se sobrepõem o suficiente para permitir uma classificação. Mage-VL relata um codificador eficiente superando um concorrente da mesma escala; PixelUMM relata um modelo de 15B que fica na mesma faixa dos sistemas especializados ao seu redor, e afirma categoricamente em seu próprio artigo que dados de treinamento diferentes fazem com que os resultados "não possam estabelecer qual arquitetura é superior".
A divisão prática
Escolha pela tarefa, não pela pontuação. Se você está construindo percepção de vídeo em tempo real — um monitor que observa um stream e comenta quando algo acontece, com o custo de tokens como restrição determinante — Mage-VL é o único dos dois que faz isso, tem licença Apache-2.0, e sua escala de classe 4B significa que um único nó pode servi-lo. Se você precisa de um único modelo que leia imagens e vídeos e também os gere, PixelUMM é o único dos dois que faz isso, mas é um artefato de pesquisa sob uma licença não comercial, seus pesos são 128 fragmentos de checkpoint distribuídos atrás de um índice oculto, e o texto para vídeo executa os guardrails do Cosmos por padrão, com um ambiente Python separado para o gate.
Para uma equipe que precisa de ambas as capacidades, o argumento para acessá-las por meio de uma única camada de roteamento em vez de duas integrações diretas é simples, embora nenhuma delas esteja hospedada hoje: uma única chave, preços de tabela dos provedores repassados com 0% de markup e regras de failover que permitem colocar um modelo Apache-2.0 recém-aberto à frente de uma parcela do tráfego enquanto o modelo comprovado mantém o restante. O OrcaRouter foi criado para esse tipo de problema — e, para deixar claro, não roteamos nem o PixelUMM nem o Mage-VL neste momento, portanto esta é uma descrição do fluxo de trabalho, não uma listagem.
O que resolveria isso
Dois eventos importam. O primeiro é uma reprodução independente dos números do codificador do Mage-ViT ou dos resultados de vídeo do Mage-VL por alguém sem qualquer interesse neles — dez semanas de downloads ainda não produziram uma. O segundo é qualquer alteração na licença do checkpoint do PixelUMM, que é o único fato que atualmente separa um artefato de pesquisa de um implantável. Até que um dos dois se concretize, a coisa útil que se pode dizer sobre esse par é que a Microsoft apostou em tornar a interface visual mais barata e a NVIDIA apostou em removê-la, e nenhuma das apostas foi avaliada por ninguém fora do laboratório que a fez.
