Um cartão de título hero gerado para InternLumina-U2, com um selo de pílula 'PRÉVIA', o título 'InternLumina-U2', o subtítulo 'Um modelo de difusão de 16B para imagem, vídeo e 3D', uma tagline que menciona Shanghai AI Laboratory, LLM de difusão multi-codebook, código lançado em 2026-09-01 e pesos em breve, chips para Imagem, Vídeo e 3D, formas abstratas nas cores azul, ciano e âmbar de Compreender-Gerar-Editar à direita, e o logotipo OrcaRouter no canto inferior direito.
Guides & Insights

InternLumina-U2 Preview: Um Modelo de Difusão de 16B para Imagem, Vídeo e 3D — Pesos Ainda por Vir

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Às 04:03 UTC de 1º de setembro de 2026, o Shanghai AI Laboratory criou o repositório do GitHub InternLumina-U2. Treze minutos depois, a mesma organização registrou um repositório com o mesmo nome no Hugging Face. Não houve post de lançamento, nem model card, nem anúncio de qualquer tipo — apenas o código de inferência do InternLumina-U2, um modelo mixture-of-experts de 16B de parâmetros (1B ativo) que o laboratório apresenta como um único modelo que cobre compreensão de imagens, geração de texto-para-imagem, edição de imagens, compreensão de vídeos e compreensão 3D por meio de uma interface única de tokens discretos. O código é real e público; o modelo em si não é — ainda. Os pesos estão marcados como "em breve", o repositório no Hugging Face é um espaço reservado vazio, e o relatório técnico prometido não apareceu. O que foi divulgado silenciosamente em 1º de setembro é, ainda assim, o retrato público mais completo desse modelo que existe em qualquer lugar.

Se esta é a primeira vez que você ouve falar do InternLumina-U2, esse é o objetivo. Nada sobre o lançamento foi anunciado, e nenhuma cobertura independente parece existir ainda — matérias de sinal precoce são exatamente onde um modelo como este vem à tona primeiro, antes do post de lançamento e, às vezes, antes dos pesos. Tudo abaixo é extraído do repositório GitHub, da página do projeto e do stub do Hugging Face que o próprio laboratório publicou em 1º de setembro, e qualquer coisa além dessas fontes é explicitamente rotulada como inferência.

O que realmente foi lançado em 1º de setembro

O repositório GitHub InternLM/InternLumina-U2 foi criado em 1º de setembro de 2026 e recebeu três commits naquele dia — o init, uma alteração que marcava o link do modelo como "em breve" e os resultados de benchmark como "preliminares", e uma correção de navegação. É licenciado sob Apache-2.0 e traz um README intitulado "Intern Lumina U2: A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing", versões em inglês e em chinês, um harness de inferência completo e um roadmap. Uma peculiaridade digna de nota: a própria notícia do repositório traz o carimbo "[2026-08]", mas o commit init e os dois timestamps do repositório estão datados de 1º de setembro de 2026 — trate o início de setembro como a data real de lançamento, e não agosto. O repositório abaixo é todo o lançamento público: cada arquivo visível na árvore faz parte do que foi disponibilizado, e nada mais existe em nenhum lugar ainda.

A screenshot of the GitHub repository InternLM/InternLumina-U2 captured September 2, 2026, showing the repo description 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', an Apache-2.0 license, 4 stars, commits dated 'yesterday' including 'init repo', and the file tree with the inference entrypoints infer_1024_sft.sh, infer_t2i_sft.py, infer_mmu_sft.py, infer_video_sft.py and infer_3d_sft.py.

GitHub — InternLM/InternLumina-U2, criado em 2026-09-01 sob Apache-2.0, com código de inferência para texto, texto-para-imagem, compreensão de imagens, edição de imagens, compreensão de vídeos e compreensão 3D.

Hugging Face — internlm/InternLumina-U2, criado em 2026-09-01, atualmente contém apenas um arquivo .gitattributes e um README de 28 bytes cujo conteúdo inteiro é o cabeçalho de licença Apache-2.0. Sem pesos, sem config, sem arquivos de tokenizer.

Página do projeto — internlm.github.io/InternLumina-U2, com figuras de arquitetura, uma tabela preliminar de benchmarks e demonstrações provisórias; o relatório técnico está marcado como "em breve".

O código de inferência é organizado como um script de controle com uma seção por tarefa: geração de texto simples, geração de texto para imagem em até 1024×1024 com CFG e timesteps configuráveis, compreensão de imagens sobre imagens naturais e gráficos densos, edição de imagens baseada em instruções com um modo dual-CFG opcional, compreensão de vídeo sobre 64 quadros amostrados e compreensão 3D sobre ativos GLB/GLTF que são renderizados em 64 vistas de cor e profundidade por meio de um pipeline Blender embutido antes da tokenização. Essa amplitude de tarefas é toda a tese de design do modelo, e vale a pena pausar nela antes de mergulhar na arquitetura.

Um modelo, seis tarefas, um vocabulário de tokens

InternLumina-U2 pertence a uma linha de pesquisa em rápida evolução que aposta que linguagem e visão devem compartilhar uma única interface de tokens discretos, em vez de viverem em pilhas separadas de compreensão e geração. O trabalho anterior do próprio laboratório nessa direção — Lumina-DiMOO, o modelo unificado de difusão discreta apresentado na WAIC 2025 — é citado ao lado de LLaDA2.0-Uni, Show-o2 e MMaDA como os sistemas pioneiros que o InternLumina-U2 usa como base e afirma superar. A aposta específica que o InternLumina-U2 faz é que o gargalo desses modelos unificados não é a arquitetura, mas o vocabulário visual: um único codebook limita a quantidade de informação que um token visual pode carregar, enquanto híbridos discretos-contínuos, que dividem a compreensão e a geração entre diferentes representações, forçam o modelo a manter duas pilhas de qualquer forma.

A resposta do InternLumina-U2 é modelagem totalmente discreta com múltiplos codebooks. O lado visual usa o tokenizador AToken da Apple, que descreve cada posição visual com oito codebooks complementares — uma tentativa de preservar textura local, texto incorporado, geometria e detalhes de alta frequência sem inflar o comprimento da sequência. No lado de entrada, cada um dos oito codebooks possui seu próprio embedding, e os oito embeddings por posição são concatenados e projetados em um único token de backbone. No lado de saída, a predição é espacialmente paralela, mas autorregressiva em relação à profundidade do codebook: o backbone de difusão remove o ruído de muitas posições espaciais mascaradas em paralelo, e uma cabeça autorregressiva de múltiplos codebooks prevê então os oito códigos de cada posição em ordem.

Scale — 16B de parâmetros totais, 1B ativos (16B-A1B), um MoE esparso.

Backbone de linguagem — modelo de linguagem de difusão LLaDA-2.0 MoE, cujo objetivo de difusão em blocos é estendido a tarefas visuais por meio de treinamento multitarefa conjunto (descrição do fornecedor).

Representação visual — tokens totalmente discretos de 8 codebooks do tokenizador AToken da Apple.

Hardware — adaptado tanto para GPUs NVIDIA quanto para NPUs Ascend da Huawei em treinamento, avaliação e inferência, com alinhamento numérico em nível de operador entre os backends.

A generated single-column state-of-play scoreboard titled 'InternLumina-U2 — the state of play' listing: Size 16B MoE, 1B active; Modalities image, video, 3D + T2I + editing; Visual tokens 8-codebook discrete (AToken); Backbone LLaDA-2.0 MoE diffusion LLM; Weights not released yet; Released code and page 2026-09-01, with a footer reading 'All details vendor-reported; no independent scores yet' and the OrcaRouter logo in the bottom-right corner.

O que isso proporciona na prática, se as alegações se confirmarem, é o sonho mais antigo da área multimodal: um único conjunto de pesos que pode ler uma imagem, editá-la, desenhar uma nova a partir de texto, responder perguntas sobre um vídeo e descrever um ativo 3D — com compreensão e geração reforçando-se mutuamente por meio da mesma interface, em vez de serem costuradas a partir de modelos especializados. Essa também é a alegação que mais merece um olhar cético, porque é a mais difícil de tornar realidade.

Os números, tais como são.

Todos os benchmarks que a InternLumina-U2 possui são relatados pelo fornecedor, preliminares e parciais. O README e a página do projeto afirmam isso: “Preliminary, partial results. Full comparison tables will appear in the upcoming technical report.” Não existe avaliação independente, porque os pesos não são públicos. Trate os números abaixo como alegações do próprio laboratório, não como pontuações verificadas.

Compreensão de gráficos / documentos — ChartQA 86.52, CharXiv-DQ 83.65 (relatado pelo fornecedor).

Raciocínio matemático visual — MathVision 33.22, DynaMath 56.37; o laboratório afirma que isso supera o InternVL3-8B apenas de compreensão em ambos.

Robustez a alucinações — HallusionBench 62.15.

Compreensão de vídeo — VideoMME 51.26, MVBench 59.74, MLVU 57.03 (página do projeto).

Compreensão 3D — 3D MM-Vet 41,8.

Texto para imagem — DPG-Bench 87.10, TIIF-Bench Short/Long 84.60/85.95, GenEval 0.81 (página do projeto).

Edição de imagens — ImgEdit 3.83.

A história da comparação é onde um leitor honesto deve desacelerar. O README afirma que o InternLumina-U2 supera modelos unificados como InternVL-U, LLaDA2.0-Uni, Show-o2 e Lumina-DiMOO em benchmarks de compreensão de granulação fina e geração — mas a própria tabela da página do projeto mostra o InternLumina-U2 com 0,81 no GenEval, contra 0,89 do LLaDA2.0-Uni; portanto, o modelo fica atrás de pelo menos um concorrente em pelo menos uma métrica de geração de destaque. Escolher alguns números favoráveis de uma tabela parcial é exatamente o que a ressalva "tabelas de comparação completas no relatório técnico" foi criada para suavizar. Os números são um sinal direcional do laboratório, nada mais.

O que é real versus o que é prometido

O escopo do lançamento é incomumente explícito, e isso importa para quem está decidindo se pode experimentá-lo hoje. Foram disponibilizados: o código de inferência. Não foram disponibilizados: os pesos, o código de treinamento (prometido em um repositório separado), a stack de treinamento e inferência da Ascend e o relatório técnico. O repositório do Hugging Face que futuramente hospedará o modelo é um stub — a captura de tela abaixo mostra todo o conteúdo atual da página que o leitor acessa ao clicar no link "Model (coming soon)" do README.

A screenshot of the Hugging Face model page internlm/InternLumina-U2 captured September 2, 2026, showing the empty placeholder: the model name under the internlm organisation, a License badge reading apache-2.0, the notice 'README.md exists but content is empty', 'Downloads are not tracked for this model', and no inference provider yet serving the model.

Mesmo o código lançado ainda não consegue produzir saída. O driver de inferência espera um diretório de checkpoint dividido do Hugging Face e os pesos do tokenizador AToken em um caminho específico — nenhum dos quais está no repositório — portanto, o que está disponível para download hoje é uma especificação de como o modelo será executado, não um modelo em execução. E quando os pesos finalmente chegarem, o self-hosting não será um trabalho rotineiro de pip install. O modelo usa uma API de geração block-diffusion em vez da interface generate padrão do Transformers, o tokenizador AToken requer FlashAttention, o código precisa de uma GPU visível no momento da importação, o driver raiz é de processo único, e o pipeline 3D espera o Blender 4.5 para codificação de assets. Isso é um projeto de implantação real, não um experimento de fim de semana — o que é exatamente o tipo de atrito que uma camada de roteamento existe para absorver para a maioria das equipes.

Quando os pesos chegarem, trate-o como o modelo não comprovado que ele é.

Ninguém pode rodar o InternLumina-U2 hoje, e nenhum provedor pode oferecê-lo, porque os pesos não estão disponíveis publicamente. Isso vai mudar em algum momento — o licenciamento Apache-2.0 e o padrão do laboratório em 2026 de abrir código de forma agressiva (a campanha "open everything" da ArchSpace, o InternVL3.5, os modelos científicos Intern-S2) tornam a liberação dos pesos provável, e não hipotética. Quando isso acontecer, o primeiro passo racional não é apostar um pipeline de produção em um modelo de difusão recém-lançado, com requisitos de execução incomuns e zero avaliações independentes. É executá-lo lado a lado com o modelo em que você já confia, em um caminho de teste, com failover automático para o modelo comprovado no instante em que o novo se comportar mal. Esse é o caso de uso para o qual uma camada de roteamento é construída: uma API única para mais de 200 modelos, preços de tabela dos provedores repassados com markup de 0% e failover que transforma "experimentar a novidade" em uma regra de roteamento, em vez de uma migração. O OrcaRouter está configurado dessa forma — e, para deixar claro, não roteamos o InternLumina-U2 nem podemos, porque os pesos não foram liberados. Esta seção é sobre o fluxo de trabalho para quando eles forem liberados, não uma afirmação de que o modelo está disponível em algum lugar hoje.

O que assistir em seguida

Quatro eventos levariam o InternLumina-U2 da prévia à realidade, em ordem aproximada de probabilidade. Primeiro, o repositório da Hugging Face sendo populado: {{1}}os arquivos safetensors, uma configuração e os pesos do tokenizador AToken aparecendo nesse stub{{/1}} é o momento em que o modelo realmente existe. Segundo, {{2}}o relatório técnico, que deveria conter as tabelas completas de comparação e transformaria os números parciais do fornecedor acima em algo verificável{{/2}}. Terceiro, {{3}}o repositório do código de treinamento e a pilha Ascend, que importam para quem quiser fazer fine-tuning ou executar isso em hardware que não seja NVIDIA{{/3}}. Quarto, {{4}}uma primeira avaliação independente — um Elo de arena, uma execução reproduzida de ChartQA ou GenEval{{/4}} — que testa a promessa de "um modelo, seis tarefas" sem o viés de seleção do próprio laboratório. O código estar público em 1º de setembro significa que a arquitetura já pode ser conhecida; os pesos estarem ausentes significa que tudo sobre a qualidade real ainda é uma afirmação. Acompanhe o repositório do modelo em vez do feed de anúncios — as partes interessantes já estão públicas, e o modelo em si provavelmente não está muito atrás.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube