Um cartão de título principal para a comparação 'InternLumina-U2 vs Qwen2.5 Omni' com o subtítulo 'O modelo omni que a Alibaba entregou vs. aquele que ainda está prometido' e três chips de estatísticas — 'Qwen2.5 Omni: 17 meses em produção', 'InternLumina-U2: um dia de código', 'Apache-2.0 em ambos os lados' — com o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

InternLumina-U2 vs Qwen2.5 Omni: O Modelo Omni que a Alibaba Entregou vs o que o Shanghai AI Lab Ainda Promete

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

InternLumina-U2 e Qwen2.5 Omni são ambos respostas à mesma ambição — um modelo que lida com todas as modalidades em vez de um zoológico de especialistas — com duas gerações de diferença. Qwen2.5 Omni é a resposta que realmente foi lançada: um modelo de pesos abertos com 7 bilhões de parâmetros, disponibilizado em março de 2025, dezessete meses no momento em que este texto foi escrito, que aceita texto, imagens, áudio e vídeo como entrada e responde em texto ou em fala natural em streaming. InternLumina-U2 é a resposta do Laboratório de Inteligência Artificial de Xangai, publicada como código de inferência em 1 de setembro de 2026: um modelo de difusão esparso com 16 bilhões de parâmetros que afirma perceber imagens, vídeo e 3D, e gerar e editar imagens por meio de uma interface compartilhada de tokens discretos. Uma geração da ideia omni está em produção há um ano e meio; a outra tem um dia de vida e não pode ser executada por ninguém, porque seus pesos ainda não existem. A distância entre elas é a diferença entre uma promessa cumprida e uma promessa feita.

O Omni que foi lançado: Qwen2.5 Omni

Qwen2.5 Omni merece ser levado a sério como referência porque é o raro modelo aberto que realmente cumpriu a proposta de "perceber tudo, responder em qualquer formato". Sua arquitetura Thinker-Talker combina um pensador de texto com um falante que gera fala, usando uma codificação posicional multimodal alinhada ao tempo para que áudio e vídeo permaneçam sincronizados; a entrada abrange texto, imagens, áudio e vídeo, e a saída pode ser texto mais voz na mesma rodada, com quatro vozes integradas. As limitações são tão documentadas quanto as capacidades: o contexto é de 32 mil tokens, não há chamada de funções nem saída estruturada, e ele é um conversador omni em vez de um agente. O que ele não faz é algo que vale a pena destacar nesta comparação — ele percebe imagens, áudio e vídeo, mas não os gera. O "omni" no Qwen2.5 Omni é onipercepção com síntese de fala no lado da saída; os pixels entram, e as palavras saem.

O histórico é real. O modelo foi baixado centenas de milhares de vezes, tem uma API hospedada por meio da plataforma do próprio desenvolvedor e de várias plataformas de terceiros, e passou dezessete meses acumulando quantizações, ferramentas da comunidade e um preço conhecido — listagens de agregadores colocam o texto em cerca de US$ 0,09 por milhão de tokens de entrada e US$ 0,34 por milhão de saída, com áudio cobrado separadamente. Dezessete meses é tempo suficiente para que seus pontos fortes e seus limites sejam bem mapeados. É isso que a maturidade compra: não a perfeição, mas a previsibilidade.

O omni que é prometido: InternLumina-U2

O InternLumina-U2 está tentando ir um passo além do Qwen2.5 Omni, e esse passo é exatamente onde reside a dificuldade. Sua tese de design é que percepção e geração devem compartilhar uma única interface de tokens discretos: em vez de um modelo de linguagem que percebe vídeo e um modelo de difusão separado que desenha, um único backbone de difusão MoE esparso — 16B no total, 1B ativo — leria uma imagem, um gráfico, um vídeo ou um ativo 3D e escreveria uma nova imagem ou uma edição, usando um vocabulário visual totalmente discreto de oito codebooks, de modo que cada posição visual carregue informação suficiente para suportar ambas as direções. Essa é uma afirmação materialmente maior do que a do Qwen2.5 Omni. Uma coisa é rotear toda modalidade de entrada para texto e fala; outra é fazer um único conjunto de pesos gerar pixels com a mesma fluência com que raciocina sobre eles.

É também, neste momento, uma afirmação impossível de verificar. O laboratório publicou código de inferência, uma página de projeto com uma tabela de benchmark "preliminar, parcial" e um stub vazio do Hugging Face; os pesos, o código de treinamento, o relatório técnico e a pilha Ascend-NPU estão todos marcados como "em breve". Não existe avaliação independente porque não há nada para avaliar. A arquitetura do Qwen2.5 Omni pôde ser verificada na semana em que foi lançada, porque os pesos foram lançados junto; a arquitetura do InternLumina-U2 é legível hoje, e sua qualidade ainda é uma promessa do fornecedor.

O placar

Porque um desses modelos tem dezessete meses de histórico e o outro tem um dia de código, as linhas carregam proveniência em vez de fingir que as colunas são simétricas.

• Idade — Qwen2.5 Omni: lançado em março de 2025, dezessete meses em circulação, centenas de milhares de downloads. InternLumina-U2: código de inferência publicado em 1º de setembro de 2026, zero downloads, zero execuções independentes.

• Formato — Qwen2.5 Omni: ~7B end-to-end, Thinker-Talker com codificação posicional multimodal alinhada ao tempo. InternLumina-U2: 16B no total / 1B ativo, LLM de difusão MoE esparso com tokenizador visual discreto de oito codebooks.

• Entrada — ambos aceitam texto e imagens; o Qwen2.5 Omni também aceita áudio e vídeo para chat omni; o InternLumina-U2 alega adicionalmente compreensão de vídeo em 64 quadros amostrados e compreensão 3D em visualizações GLB/GLTF renderizadas no Blender.

• Saída — Qwen2.5 Omni: texto e fala em streaming, quatro vozes. InternLumina-U2: texto, text-to-image até 1024×1024 e edição de imagem baseada em instruções.

• Fronteira de geração — Qwen2.5 Omni: gera palavras e voz, não pixels. InternLumina-U2: tenta geração e edição de pixels dentro do mesmo modelo de tokens discretos que lê.

• Pesos e licença — ambos são pesos abertos Apache-2.0 em princípio; os do Qwen2.5 Omni estão disponíveis para download hoje, os do InternLumina-U2 ainda não são públicos.

• Servindo — Qwen2.5 Omni: API hospedada mais auto-hospedagem (uma implantação pesada de precisão total); contexto conhecido de 32K, sem chamada de função. InternLumina-U2: não servível — o driver lançado espera checkpoints que não existem.

• Números principais — Qwen2.5 Omni: estabelecido há muito tempo no ranking OmniBench (pontuação em torno de 0,561 nas tabelas atuais); InternLumina-U2: ChartQA 86,52, MathVision 33,22, GenEval 0,81 — todos divulgados pelo fornecedor, preliminares e parciais.

A comparison scoreboard for InternLumina-U2 and Qwen2.5 Omni: InternLumina-U2 with Age 1 day code only, Size 16B-A1B diffusion MoE, Input image/video/3D (claims), Output text image gen & edits, Weights not yet public, Frontier reads AND draws; Qwen2.5 Omni with Age 17 months in production, Size ~7B Thinker-Talker, Input text/image/audio/video, Output text & streaming speech, Weights public since Mar 2025, Frontier reads speaks no pixels, with a footer noting InternLumina figures are vendor-reported and Qwen figures are Alibaba-reported, and the OrcaRouter logo in the bottom-right corner.

Por que o abismo geracional é a verdadeira história

Deixando as idades de lado, a diferença substancial é a fronteira em que cada modelo para. O Qwen2.5 Omni escolheu uma versão tratável de omni: perceber amplamente, responder em linguagem ou voz, e deixar a síntese de imagens e vídeos para modelos de geração dedicados em outras partes da pilha. Essa divisão de trabalho é como essencialmente todo sistema multimodal de produção em 2026 é construído, e é por isso que o Qwen2.5 Omni pôde ser lançado em 2025 e continuar útil em 2026 — ele faz bem a sua parte e se integra com o resto. O InternLumina-U2 é uma aposta de que a divisão de trabalho é o problema: que um modelo forçado a representar tudo — percepção e geração — em um único vocabulário discreto compartilhado aprenderá uma compreensão mais profunda da visão do que um modelo que só precisa descrevê-la. Essa aposta, se der certo, é o resultado mais importante. Se não der, o InternLumina-U2 acaba sendo um Qwen2.5 Omni mais lento e mais faminto, com um gerador de imagens acoplado de forma desajeitada nos mesmos pesos. Todo o concurso — e é um concurso entre um design já lançado e uma hipótese, não entre dois modelos executáveis — é se a arquitetura mais difícil se justifica.

A screenshot of the Hugging Face model page for Qwen/Qwen2.5-Omni-7B (captured August 27 2026), showing the Thinker-Talker overview, the Apache-2.0 license, and the model's text, image, audio and video modality tags.

O cartão Hugging Face do Qwen/Qwen2.5-Omni-7B, capturado em 27 de agosto de 2026 — a visão geral Thinker-Talker, a licença Apache-2.0 e as tags de modalidade de texto, imagem, áudio e vídeo do modelo.

O que um ano e meio de downloads realmente compra

Maturidade não é uma vibe; é uma lista de coisas que você sabe. Com o Qwen2.5 Omni, você sabe que o contexto de 32K é uma restrição rígida e consegue contorná-la. Você sabe que não há caminho de chamada de função e não vai fingir que há. Você tem uma boa ideia de quanto custa uma implantação — seja via API hospedada, seja em suas próprias GPUs — porque o modelo já foi precificado e executado por pessoas suficientes para que os números se estabilizassem. Você sabe que a posição no OmniBench é real porque leaderboards independentes vêm acompanhando isso há mais de um ano. Com o InternLumina-U2, nenhum desses verbos se aplica — você não sabe, não pode saber, porque não há artefato. Quando um modelo tem um dia de existência e nenhum peso, toda afirmação sobre ele é uma declaração de intenção. Essa assimetria não é uma crítica à ciência; é a postura epistêmica correta para qualquer pessoa que esteja escolhendo sobre o que construir.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the multi-codebook diffusion description and the inference scripts that make the architecture public while weights stay out of the tree.

O repositório GitHub InternLM/InternLumina-U2, capturado em 2 de setembro de 2026 — a página inicial do repositório que torna a arquitetura pública — descrição, licença e os scripts de inferência — enquanto os próprios pesos estão ausentes da árvore.

A decisão de roteamento, honestamente enquadrada.

Vamos declarar a disponibilidade com clareza: o OrcaRouter não hospeda o InternLumina-U2, porque não há pesos para ninguém hospedar, e também não temos atualmente o Qwen2.5 Omni — ele roda pela API do próprio desenvolvedor e por plataformas de terceiros. Portanto, a lição de roteamento aqui é sobre postura, não sobre chamar esses dois por uma única chave hoje. O padrão duradouro é aquele com o qual toda decisão entre modelo maduro e novato acaba se deparando: manter o modelo comprovado no caminho principal, onde uma API que abrange mais de 200 modelos e o repasse com 0% de margem significam que você paga o preço de tabela do provedor e nada mais; direcionar o novato não comprovado para um caminho de teste com failover automático, para que, na primeira vez em que ele travar, divagar ou retornar algo sem sentido, a chamada seja repassada ao modelo com dezessete meses de histórico comprovado. É assim que você consegue avaliar uma arquitetura nova e ambiciosa como o InternLumina-U2 no dia em que os pesos forem disponibilizados — sem arriscar o caminho de produção do qual você já depende.

O veredito

Qwen2.5 Omni é o modelo omni sobre o qual se pode construir hoje: {{1}}entregue, disponível para download, documentado, com limites conhecidos e preço definido{{/1}}. InternLumina-U2 é o modelo omni a observar: {{2}}um passo arquitetônico genuíno além da percepção e rumo à criação, Apache-2.0, com o código-fonte público e os pesos pendentes{{/2}}. Se a aposta do laboratório em múltiplos codebooks se sustentar {{3}}em testes independentes{{/3}}, InternLumina-U2 não será tanto rival da Qwen2.5 Omni quanto a próxima geração da mesma ideia. Se não se sustentar, {{4}}o generalista de dezessete meses que de fato foi lançado ainda estará lá, fazendo o trabalho que sempre fez{{/4}}. Acompanhe a página provisória do Hugging Face; o veredito está à espera dos arquivos safetensors, não deste artigo.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube