Uma placa de título gerada no estilo visual da OrcaRouter com o texto “PixelUMM vs InternLumina-U2”, com quatro blocos de estatísticas: “41,67 / 57,33” (MMMU e Video-MME do PixelUMM), “0,81 / 51,26” (GenEval e Video-MME do InternLumina-U2), “Apache-2.0” (código do InternLumina-U2 e ambos os checkpoints) e “1-way NC” (a licença do checkpoint do PixelUMM). Uma linha de rodapé diz “Valores reportados pelo fornecedor; nenhuma reexecução independente de qualquer um dos modelos.”. O logotipo da OrcaRouter é composto na faixa com preenchimento no canto inferior direito.
Guides & Insights

PixelUMM vs InternLumina-U2: Duas Betas sem Encoder, e a Única Diferença que Decide

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois modelos, ambos públicos, ambos com um design incomum, e só com um deles você pode construir um produto. PixelUMM é o modelo unificado sem encoder da NVIDIA — 15,2 bilhões de parâmetros sobre um backbone Qwen3-8B, lendo e escrevendo pixels brutos por meio de patches 16×16 e tubelets de 4 quadros, sem VAE e sem encoder de visão em nenhum lugar da pilha. InternLumina-U2 é o modelo de difusão de mistura de especialistas de 16B do Shanghai AI Laboratory que comprime cada entrada visual em oito códigos discretos complementares por meio de um tokenizador chamado AToken. Ambos apostaram que a interface visual é o gargalo. A aposta que mais importa é a dos arquivos de licença: o InternLumina-U2 é distribuído com pesos Apache-2.0, o PixelUMM é distribuído com um checkpoint sob uma licença não comercial. Se você estiver escolhendo entre eles para qualquer coisa comercial, essa frase é a comparação inteira, e o resto desta página é contexto para ela.

Ambos os conjuntos de números abaixo vêm dos próprios laboratórios. Nenhum dos modelos tem uma avaliação independente, um Elo de arena ou uma reprodução por terceiros. Nenhum é disponibilizado por qualquer API hospedada. O que difere é o que você tem permissão para fazer com o artefato depois de baixá-lo, e em que estágio cada lançamento realmente se encontra.

Onde cada um está agora

Os cronogramas de lançamento avançaram em velocidades diferentes, e ambos silenciosamente.

• PixelUMM — Repositório do GitHub criado em 4 de setembro de 2026; pré-print do arXiv 2609.38597 datado de 29 de setembro de 2026; repositório de modelo do Hugging Face criado em 1º de outubro de 2026 às 21:40 UTC. Nenhuma postagem no blog, comunicado à imprensa ou thread de lançamento da NVIDIA surgiu sobre ele.

• InternLumina-U2 — Repositório do GitHub criado em 1 de setembro de 2026; stub do Hugging Face registrado no mesmo dia; pesos de checkpoint treinados em Ascend adicionados em 10 de setembro de 2026; pesos de checkpoint NVIDIA/CUDA adicionados em 24 de setembro de 2026. Sete shards por pilha, ambos disponíveis para download hoje.

O InternLumina-U2 que existia no início de setembro — apenas código, pesos "em breve", um repositório de modelo vazio — não é o InternLumina-U2 que existe agora. Quem leu sobre ele no começo do mês e concluiu que os pesos estavam faltando deveria verificar novamente; tanto os checkpoints para Huawei Ascend quanto os para NVIDIA/CUDA já estão disponíveis, sob Apache-2.0, com tokenizer, config, chat template e código de modelagem remota junto deles.

A headless-browser capture of the Hugging Face model card for the InternLumina-U2 repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters alongside the file listing for the checkpoint shards.

Duas respostas à mesma pergunta

Ambos os modelos partem da mesma crítica: carregar um codificador visual para a compreensão e uma VAE para geração significa representar cada imagem duas vezes, aproximadamente dobrando o contexto visual e forçando um pipeline de treinamento a manter duas interfaces.

A resposta do PixelUMM é excluir ambos. Os pixels brutos entram diretamente por meio de projeções lineares de camada única — um patch de 16×16 por posição de imagem, um tubelet de 4 quadros por posição de vídeo — e o backbone é um Transformer somente decodificador cujo design Mixture-of-Transformers combina atenção compartilhada com parâmetros específicos da tarefa. O texto é previsto de forma autorregressiva; os pixels são previstos por flow matching. O artigo dedica oito seções a estudos de design — tamanho do patch, artefatos de patch, dinâmica em espaço de pixels versus espaço VAE, escalonamento de computação — o que revela que a verdadeira pergunta da equipe era se o paradigma se sustenta.

A resposta do InternLumina-U2 é manter uma interface discreta, mas fazer com que cada token carregue muito mais. O tokenizador AToken descreve cada posição visual com oito codebooks complementares que cobrem textura, texto embutido e geometria; os oito embeddings são concatenados por posição e projetados em um único token do backbone. A decodificação funciona no sentido inverso, com denoising espacialmente paralelo e uma cabeça autorregressiva com múltiplos codebooks que prevê os oito códigos em ordem. O backbone é um LLM de difusão esparso da linhagem LLaDA-2.0, com 16B totais e 1B ativos.

• Interface visual — PixelUMM: patches de pixels brutos e tubelets, sem nenhum tokenizador. InternLumina-U2: tokens totalmente discretos de oito codebooks do AToken, sem latente contínuo.

• Backbone — PixelUMM: Qwen3-8B (15,2B no total), decodificador denso único com especialistas em compreensão e geração. InternLumina-U2: modelo de linguagem de difusão MoE esparso com 16B no total / 1B ativos.

• Método de geração — PixelUMM: correspondência de fluxo no espaço de pixels mais texto autorregressivo. InternLumina-U2: remoção de ruído por difusão mascarada sobre códigos discretos.

• Tarefas declaradas — PixelUMM: texto para imagem, texto para vídeo, imagem para texto, vídeo para texto. InternLumina-U2: essas e também edição de imagens e compreensão 3D.

• Formato dos pesos — PixelUMM: 128 .distcp fragmentos (~30 GB) atrás de um índice .metadata oculto. InternLumina-U2: sete .safetensors fragmentos por pilha de hardware, layout padrão do Hugging Face.

A generated scoreboard card titled “PixelUMM vs InternLumina-U2 — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: visual interface, backbone, generation method, video understanding, weight format and licence. PixelUMM's column shows raw pixel patches and tubelets, a Qwen3-8B backbone at 15.2B, pixel-space flow matching, Video-MME 57.33 with MVBench 70.53, 128 distributed-checkpoint shards, and a noncommercial checkpoint licence; InternLumina-U2's column shows eight-codebook discrete AToken tokens, a 16B-A1B sparse MoE diffusion backbone, masked diffusion denoising, Video-MME 51.26 with MVBench 59.74, seven safetensors shards per hardware stack, and Apache-2.0. A footer notes that the figures are vendor-reported with no independent rerun.

O placar, com sua proveniência anexada

Leia cada linha como uma alegação do próprio laboratório. As do PixelUMM vêm do seu preprint; as do InternLumina-U2 são a descrição que o próprio laboratório faz delas como "preliminares, parciais", com as tabelas comparativas completas adiadas para um relatório técnico que ainda não apareceu.

• MMMU (raciocínio de imagem) — PixelUMM 41,67 (dos próprios autores). InternLumina-U2: não reportado.

• ChartQA — PixelUMM 82,96. InternLumina-U2 86,52.

• DocVQA — PixelUMM 90,42. InternLumina-U2: não reportado.

• Video-MME (sem legendas) — PixelUMM 57,33. InternLumina-U2 51,26.

• MVBench — PixelUMM 70,53. InternLumina-U2 59,74.

• GenEval geral — PixelUMM 0,83 com um reescritor de prompt de LLM, 0,77 sem. InternLumina-U2 0,81.

• DPG-Bench geral — PixelUMM 85,74. InternLumina-U2 87,10.

• Geração de vídeo — PixelUMM VBench Parte 1 qualidade 84.10 / semântica 79.80, Parte 2 total 83.24. InternLumina-U2: não reportado.

• Compreensão 3D — PixelUMM: não existe tal tarefa. InternLumina-U2 relata 3D MM-Vet 41,8.

A comparação é desigual porque os dois laboratórios publicam tabelas diferentes, não porque um esteja vencendo. O PixelUMM tem uma seção completa de geração de vídeo e nenhuma de edição ou 3D; o InternLumina-U2 alega seis famílias de tarefas e reporta uma tabela parcial entre elas. Números entre laboratórios sob o mesmo nome de benchmark não são a mesma medição — divisões, prompts e amostragem diferem —, então trate as linhas de ChartQA e GenEval como aproximadamente equivalentes e pare por aí.

O licenciamento é onde isto deixa de ser um empate.

Esta é a parte que nenhuma tabela de benchmark mostra. O repositório PixelUMM é Apache-2.0, e o card diz isso, com destaque. O checkpoint é um artefato separado sob a NVIDIA One-Way Noncommercial License, limitado a pesquisa ou avaliação não comercial, e um arquivo-fonte também mantém um aviso CC BY-NC 4.0 herdado do DiT. Uso em pesquisa: sem problema. Funcionalidade de produto interno: uma conversa com o jurídico, e possivelmente curta.

InternLumina-U2 é Apache-2.0 de ponta a ponta, código e ambos os checkpoints, sem nenhuma ressalva separada de uso não comercial. Para uma equipe que precisa lançar, isso não é uma pequena vantagem — é a decisão inteira. Ambos os modelos têm maturidade de nível de pesquisa. Apenas um deles tem uso irrestrito.

Qual deles realmente experimentar, e como

Se o seu trabalho envolve compreensão de vídeo ou você quer um modelo que gere vídeo e imagens a partir de um único conjunto de pesos, o PixelUMM é o artefato mais completo e seu artigo é a leitura mais útil — mas é um projeto de pesquisa com licença não comercial, então pertence a uma bancada de avaliação, não a um pipeline. Se o seu trabalho envolve amplitude de gráficos, documentos e geração de imagens, ou se você precisa de edição e 3D, o InternLumina-U2 cobre mais terreno e não tem teto de licença; o custo é que o backbone de difusão 16B-A1B e o tokenizador AToken exigem verdadeira engenharia de serving, e seus números publicados são explicitamente parciais.

Até o momento em que escrevo, nenhum dos dois está em qualquer API hospedada, e isso inclui a OrcaRouter — não roteamos nenhum dos dois modelos. Quando isso mudar, o argumento para acessá-los por meio de uma camada de roteamento em vez de integração direta é o mesmo que se aplica a qualquer modelo recém-disponibilizado: uma chave para mais de 200 modelos, preços de tabela dos provedores repassados com 0% de margem, e failover automático para que um modelo que se revele pior do que a tabela do fornecedor sugeria possa ser rebaixado alterando uma rota em vez de reescrever uma implantação. Até lá, o conselho honesto é o mais entediante — baixe a licença que permita o seu caso de uso, faça sua própria avaliação com os seus próprios dados, e não planeje com base nos números de qualquer um dos laboratórios até que alguém de fora do laboratório os reproduza.

O que mudaria a resposta

Três coisas, em ordem de impacto. Uma licença comercial no checkpoint do PixelUMM tornaria a comparação genuinamente equilibrada e o faria passar de “ler o artigo” para “avaliar os pesos”. Um relatório técnico do Shanghai AI Laboratory com as tabelas comparativas completas transformaria os números parciais do InternLumina-U2 em algo verificável e também revelaria quanto da abrangência das seis tarefas está em paridade versus em profundidade de token. E a primeira reprodução independente de qualquer um dos modelos — uma nova execução do GenEval ou do MVBench por uma equipe sem interesse no resultado — é o momento em que cada um deles deixa de ser uma tabela de fornecedor. Até então, um é uma arquitetura incomum que você só pode estudar, e o outro é uma arquitetura incomum que você pode colocar em produção.