
PixelUMM vs InternLumina-U2: Duas Betas sem Encoder, e a Única Diferença que Decide
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Dois modelos, ambos públicos, ambos com um design incomum, e só com um deles você pode construir um produto. PixelUMM é o modelo unificado sem encoder da NVIDIA — 15,2 bilhões de parâmetros sobre um backbone Qwen3-8B, lendo e escrevendo pixels brutos por meio de patches 16×16 e tubelets de 4 quadros, sem VAE e sem encoder de visão em nenhum lugar da pilha. InternLumina-U2 é o modelo de difusão de mistura de especialistas de 16B do Shanghai AI Laboratory que comprime cada entrada visual em oito códigos discretos complementares por meio de um tokenizador chamado AToken. Ambos apostaram que a interface visual é o gargalo. A aposta que mais importa é a dos arquivos de licença: o InternLumina-U2 é distribuído com pesos Apache-2.0, o PixelUMM é distribuído com um checkpoint sob uma licença não comercial. Se você estiver escolhendo entre eles para qualquer coisa comercial, essa frase é a comparação inteira, e o resto desta página é contexto para ela.
Ambos os conjuntos de números abaixo vêm dos próprios laboratórios. Nenhum dos modelos tem uma avaliação independente, um Elo de arena ou uma reprodução por terceiros. Nenhum é disponibilizado por qualquer API hospedada. O que difere é o que você tem permissão para fazer com o artefato depois de baixá-lo, e em que estágio cada lançamento realmente se encontra.
Onde cada um está agora
Os cronogramas de lançamento avançaram em velocidades diferentes, e ambos silenciosamente.
• PixelUMM — Repositório do GitHub criado em 4 de setembro de 2026; pré-print do arXiv 2609.38597 datado de 29 de setembro de 2026; repositório de modelo do Hugging Face criado em 1º de outubro de 2026 às 21:40 UTC. Nenhuma postagem no blog, comunicado à imprensa ou thread de lançamento da NVIDIA surgiu sobre ele.
• InternLumina-U2 — Repositório do GitHub criado em 1 de setembro de 2026; stub do Hugging Face registrado no mesmo dia; pesos de checkpoint treinados em Ascend adicionados em 10 de setembro de 2026; pesos de checkpoint NVIDIA/CUDA adicionados em 24 de setembro de 2026. Sete shards por pilha, ambos disponíveis para download hoje.
O InternLumina-U2 que existia no início de setembro — apenas código, pesos "em breve", um repositório de modelo vazio — não é o InternLumina-U2 que existe agora. Quem leu sobre ele no começo do mês e concluiu que os pesos estavam faltando deveria verificar novamente; tanto os checkpoints para Huawei Ascend quanto os para NVIDIA/CUDA já estão disponíveis, sob Apache-2.0, com tokenizer, config, chat template e código de modelagem remota junto deles.

Duas respostas à mesma pergunta
Ambos os modelos partem da mesma crítica: carregar um codificador visual para a compreensão e uma VAE para geração significa representar cada imagem duas vezes, aproximadamente dobrando o contexto visual e forçando um pipeline de treinamento a manter duas interfaces.
A resposta do PixelUMM é excluir ambos. Os pixels brutos entram diretamente por meio de projeções lineares de camada única — um patch de 16×16 por posição de imagem, um tubelet de 4 quadros por posição de vídeo — e o backbone é um Transformer somente decodificador cujo design Mixture-of-Transformers combina atenção compartilhada com parâmetros específicos da tarefa. O texto é previsto de forma autorregressiva; os pixels são previstos por flow matching. O artigo dedica oito seções a estudos de design — tamanho do patch, artefatos de patch, dinâmica em espaço de pixels versus espaço VAE, escalonamento de computação — o que revela que a verdadeira pergunta da equipe era se o paradigma se sustenta.
A resposta do InternLumina-U2 é manter uma interface discreta, mas fazer com que cada token carregue muito mais. O tokenizador AToken descreve cada posição visual com oito codebooks complementares que cobrem textura, texto embutido e geometria; os oito embeddings são concatenados por posição e projetados em um único token do backbone. A decodificação funciona no sentido inverso, com denoising espacialmente paralelo e uma cabeça autorregressiva com múltiplos codebooks que prevê os oito códigos em ordem. O backbone é um LLM de difusão esparso da linhagem LLaDA-2.0, com 16B totais e 1B ativos.
• Interface visual — PixelUMM: patches de pixels brutos e tubelets, sem nenhum tokenizador. InternLumina-U2: tokens totalmente discretos de oito codebooks do AToken, sem latente contínuo.
• Backbone — PixelUMM: Qwen3-8B (15,2B no total), decodificador denso único com especialistas em compreensão e geração. InternLumina-U2: modelo de linguagem de difusão MoE esparso com 16B no total / 1B ativos.
• Método de geração — PixelUMM: correspondência de fluxo no espaço de pixels mais texto autorregressivo. InternLumina-U2: remoção de ruído por difusão mascarada sobre códigos discretos.
• Tarefas declaradas — PixelUMM: texto para imagem, texto para vídeo, imagem para texto, vídeo para texto. InternLumina-U2: essas e também edição de imagens e compreensão 3D.
• Formato dos pesos — PixelUMM: 128 .distcp fragmentos (~30 GB) atrás de um índice .metadata oculto. InternLumina-U2: sete .safetensors fragmentos por pilha de hardware, layout padrão do Hugging Face.

O placar, com sua proveniência anexada
Leia cada linha como uma alegação do próprio laboratório. As do PixelUMM vêm do seu preprint; as do InternLumina-U2 são a descrição que o próprio laboratório faz delas como "preliminares, parciais", com as tabelas comparativas completas adiadas para um relatório técnico que ainda não apareceu.
• MMMU (raciocínio de imagem) — PixelUMM 41,67 (dos próprios autores). InternLumina-U2: não reportado.
• ChartQA — PixelUMM 82,96. InternLumina-U2 86,52.
• DocVQA — PixelUMM 90,42. InternLumina-U2: não reportado.
• Video-MME (sem legendas) — PixelUMM 57,33. InternLumina-U2 51,26.
• MVBench — PixelUMM 70,53. InternLumina-U2 59,74.
• GenEval geral — PixelUMM 0,83 com um reescritor de prompt de LLM, 0,77 sem. InternLumina-U2 0,81.
• DPG-Bench geral — PixelUMM 85,74. InternLumina-U2 87,10.
• Geração de vídeo — PixelUMM VBench Parte 1 qualidade 84.10 / semântica 79.80, Parte 2 total 83.24. InternLumina-U2: não reportado.
• Compreensão 3D — PixelUMM: não existe tal tarefa. InternLumina-U2 relata 3D MM-Vet 41,8.
A comparação é desigual porque os dois laboratórios publicam tabelas diferentes, não porque um esteja vencendo. O PixelUMM tem uma seção completa de geração de vídeo e nenhuma de edição ou 3D; o InternLumina-U2 alega seis famílias de tarefas e reporta uma tabela parcial entre elas. Números entre laboratórios sob o mesmo nome de benchmark não são a mesma medição — divisões, prompts e amostragem diferem —, então trate as linhas de ChartQA e GenEval como aproximadamente equivalentes e pare por aí.
O licenciamento é onde isto deixa de ser um empate.
Esta é a parte que nenhuma tabela de benchmark mostra. O repositório PixelUMM é Apache-2.0, e o card diz isso, com destaque. O checkpoint é um artefato separado sob a NVIDIA One-Way Noncommercial License, limitado a pesquisa ou avaliação não comercial, e um arquivo-fonte também mantém um aviso CC BY-NC 4.0 herdado do DiT. Uso em pesquisa: sem problema. Funcionalidade de produto interno: uma conversa com o jurídico, e possivelmente curta.
InternLumina-U2 é Apache-2.0 de ponta a ponta, código e ambos os checkpoints, sem nenhuma ressalva separada de uso não comercial. Para uma equipe que precisa lançar, isso não é uma pequena vantagem — é a decisão inteira. Ambos os modelos têm maturidade de nível de pesquisa. Apenas um deles tem uso irrestrito.
Qual deles realmente experimentar, e como
Se o seu trabalho envolve compreensão de vídeo ou você quer um modelo que gere vídeo e imagens a partir de um único conjunto de pesos, o PixelUMM é o artefato mais completo e seu artigo é a leitura mais útil — mas é um projeto de pesquisa com licença não comercial, então pertence a uma bancada de avaliação, não a um pipeline. Se o seu trabalho envolve amplitude de gráficos, documentos e geração de imagens, ou se você precisa de edição e 3D, o InternLumina-U2 cobre mais terreno e não tem teto de licença; o custo é que o backbone de difusão 16B-A1B e o tokenizador AToken exigem verdadeira engenharia de serving, e seus números publicados são explicitamente parciais.
Até o momento em que escrevo, nenhum dos dois está em qualquer API hospedada, e isso inclui a OrcaRouter — não roteamos nenhum dos dois modelos. Quando isso mudar, o argumento para acessá-los por meio de uma camada de roteamento em vez de integração direta é o mesmo que se aplica a qualquer modelo recém-disponibilizado: uma chave para mais de 200 modelos, preços de tabela dos provedores repassados com 0% de margem, e failover automático para que um modelo que se revele pior do que a tabela do fornecedor sugeria possa ser rebaixado alterando uma rota em vez de reescrever uma implantação. Até lá, o conselho honesto é o mais entediante — baixe a licença que permita o seu caso de uso, faça sua própria avaliação com os seus próprios dados, e não planeje com base nos números de qualquer um dos laboratórios até que alguém de fora do laboratório os reproduza.
O que mudaria a resposta
Três coisas, em ordem de impacto. Uma licença comercial no checkpoint do PixelUMM tornaria a comparação genuinamente equilibrada e o faria passar de “ler o artigo” para “avaliar os pesos”. Um relatório técnico do Shanghai AI Laboratory com as tabelas comparativas completas transformaria os números parciais do InternLumina-U2 em algo verificável e também revelaria quanto da abrangência das seis tarefas está em paridade versus em profundidade de token. E a primeira reprodução independente de qualquer um dos modelos — uma nova execução do GenEval ou do MVBench por uma equipe sem interesse no resultado — é o momento em que cada um deles deixa de ser uma tabela de fornecedor. Até então, um é uma arquitetura incomum que você só pode estudar, e o outro é uma arquitetura incomum que você pode colocar em produção.
