Um cartão de destaque gerado com o título 'Qwen3.8-Omni-Flash vs InternLumina U2' sob o antetítulo 'Sentidos alugados vs pesos próprios', com o subtítulo 'Uma API fechada de mídia longa contra um modelo de difusão de 16B que você pode baixar.' e quatro chips: 'Pesos: fechado vs Apache 2.0', 'Gera imagens: apenas um dos lados', 'Contexto: 1M vs não divulgado', 'Roteável aqui: nenhum dos dois'. O logotipo do OrcaRouter está composto no canto inferior direito.
Guides & Insights

Qwen3.8-Omni-Flash vs InternLumina U2: Sentidos alugados vs pesos próprios

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A forma útil de comparar Qwen3.8-Omni-Flash e InternLumina U2 não é por linha de benchmark, porque eles não aparecem nas mesmas. É perguntando quem tem permissão para executá-los. O Qwen3.8-Omni-Flash, aberto a clientes de API desde 18 de setembro de 2026, é um modelo fechado nas próprias plataformas do fornecedor: um milhão de tokens de contexto, até uma hora de áudio e vídeo contínuos por chamada, saída somente de texto e nenhum peso. O InternLumina U2 do Shanghai AI Laboratory é um modelo de difusão de mistura de especialistas 16B-A1B sob Apache 2.0 cujos checkpoints para Ascend podem ser baixados do Hugging Face agora mesmo, com os checkpoints para NVIDIA e o relatório técnico ainda listados como em breve. Um é um serviço que você aluga por token. O outro é um arquivo que você pode ter em mãos, com uma ressalva sobre em qual hardware ele atualmente roda. Essa diferença decide mais implantações reais do que qualquer pontuação na tabela de qualquer um dos fornecedores.

O que o InternLumina U2 realmente é

A arquitetura é a parte interessante e é genuinamente incomum. InternLumina U2 é um MoE esparso com 16 bilhões de parâmetros totais e 1 bilhão ativos, e é um modelo de linguagem de difusão em vez de autorregressivo — ele refina uma sequência inteira em paralelo em vez de emitir tokens da esquerda para a direita. Sua representação visual é totalmente discreta: oito codebooks de tokens visuais construídos sobre o AToken da Apple, e é isso que permite que um único modelo tanto leia uma imagem quanto produza uma sem um decodificador separado acoplado ao final. Perguntas e respostas em texto, geração de texto para imagem, compreensão de imagem, edição de imagem, compreensão de vídeo e compreensão 3D são todas o mesmo modelo fazendo o mesmo tipo de trabalho sobre o mesmo vocabulário.

• Tamanho e formato — o InternLumina U2 tem 16B no total, 1B ativos, MoE esparso; a contagem de parâmetros do Qwen3.8-Omni-Flash não foi divulgada.

• Geração — InternLumina U2 gera e edita imagens e lida com compreensão 3D; Qwen3.8-Omni-Flash não gera nenhuma mídia e retorna texto.

• Decodificação — InternLumina U2 é um LLM de difusão que decodifica em paralelo; Qwen3.8-Omni-Flash é autorregressivo.

Contexto e duração — Qwen3.8-Omni-Flash possui uma janela de 1 milhão de tokens e até uma hora de áudio e vídeo contínuos em uma única chamada; os materiais publicados do InternLumina U2 não descrevem nada disso, e áudio de longa duração não está entre as capacidades listadas.

• Pesos — InternLumina U2 está sob a licença Apache 2.0, com checkpoints Ascend publicados e checkpoints NVIDIA pendentes; Qwen3.8-Omni-Flash não tem pesos nem plano anunciado para nenhum.

• Como você o obtém — InternLumina U2 é um download do Hugging Face com código de inferência no GitHub; Qwen3.8-Omni-Flash é uma chamada de API para o Alibaba Cloud Model Studio ou a plataforma Qianwen.

• Pontuações independentes — nenhuma para nenhum deles. O próprio cartão do InternLumina U2 rotula sua tabela de benchmark como "resultados preliminares e parciais"; as do Qwen são todas contra seu próprio antecessor e não reproduzidas.

A generated two-column scoreboard titled 'Qwen3.8-Omni-Flash vs InternLumina U2 - the scoreboard'. Six shared dimension labels, left column Qwen3.8-Omni-Flash: 'Weights: not released', 'Size: undisclosed', 'Context: 1M tokens', 'Output: text only', 'Generates images: no', 'Access: vendor API only'; right column InternLumina U2: 'Weights: Apache 2.0 on Ascend', 'Size: 16B total, 1B active', 'Context: not published', 'Output: text and images', 'Generates images: yes', 'Access: download from Hugging Face'. The footer reads 'Qwen figures vendor-reported; InternLumina card says preliminary, partial results.' The OrcaRouter logo is composited in the bottom-right corner.

A questão dos pesos mudou desde a cobertura da prévia.

Se você leu nosso texto anterior sobre InternLumina U2 quando o código apareceu pela primeira vez, o estado das coisas mudou em uma direção e permaneceu igual em outra, e as duas partes importam. O repositório do Hugging Face não é mais um stub: a pasta ascend/ agora contém sete shards safetensors mais a configuração, o tokenizador e o código de modelagem, o que significa que o modelo é genuinamente baixável e executável por qualquer pessoa com o hardware certo. A pasta nvidia/ ainda está marcada como "em breve", o relatório técnico ainda está por vir, e a própria seção de benchmarks do repositório ainda diz "resultados preliminares, parciais". Portanto, a afirmação precisa hoje não é "os pesos saíram" nem "os pesos estão faltando" — é que os checkpoints de uma pilha de hardware estão publicados e os da outra não, o que é uma restrição real para qualquer pessoa cujo cluster seja NVIDIA.

Duas outras coisas se moveram discretamente. O repositório do GitHub continuou recebendo commits muito depois do lançamento inicial de 1º de setembro, então o código divulgado está sendo mantido, e não engavetado. E o contador de downloads do repositório no Hugging Face ainda marca zero, o que diz menos sobre o modelo do que sobre o público: um modelo de difusão 16B-A1B com checkpoints prioritários para Ascend é voltado para um laboratório, e não para uma equipe de produto em busca de um endpoint hospedado neste trimestre.

Onde os dois genuinamente se sobrepõem, e onde não

A compreensão de imagens é a interseção, e é mais estreita do que parece. Ambos os modelos conseguem olhar para uma imagem e responder a perguntas sobre ela, o que é a tarefa inteira do Qwen3.8-Omni-Flash e uma de seis tarefas do InternLumina U2. Tudo o que vem depois disso diverge radicalmente. O InternLumina U2 pode então editar essa imagem ou gerar uma nova a partir de um prompt, no mesmo modelo, usando o mesmo vocabulário visual que usou para lê-la. O Qwen3.8-Omni-Flash não consegue produzir um único pixel, mas aceita uma hora de áudio e vídeo numa única chamada e diz quem falou, quando e o que foi decidido — algo que os materiais publicados do InternLumina U2 não afirmam fazer de forma alguma.

A sobreposição que importa menos do que as pessoas supõem é o vídeo. Ambos são descritos como lidando com vídeo, mas fazem coisas diferentes com ele: um está entendendo uma gravação longa como um documento, o outro está lidando com vídeo como uma modalidade visual ao lado de 3D. Uma equipe que precisa que uma hora de filmagem seja resumida não é atendida pelo segundo, e uma equipe que precisa que um quadro seja gerado não é atendida pelo primeiro.

A headless screenshot of the Hugging Face model page for InternLumina-U2 showing the Apache 2.0 licence badge, the tags for diffusion, multimodal, image-generation, image-editing and vision-language, the model card heading 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', and the 'Technical Report (Coming Soon)' note.

Custo, controle e o que você está realmente comprando

A comparação de preços não é nem de longe do mesmo tipo. Qwen3.8-Omni-Flashcobra por token — US$ 0,15 por milhão de entrada, US$ 0,016 em cache, US$ 0,47 de saída na tabela internacional, com uma tabela de preços separada para a China continental que não é comparável — e seu anúncio de lançamento foi um corte de mais de 98% no custo de uma hora de entrada de áudio, relatado pelo fornecedor, calculado ao precificar uma amostra de dois minutos e multiplicá-la por trinta, com vídeo amostrado em 720p e um quadro por segundo. InternLumina U2não cobra nada, porque não há nada a cobrar: o custo é o seu hardware e o seu tempo, e a própria ficha do modelo não publica um número de throughput que permita transformar isso em um valor por token.

Esse é o trade-off em uma linha. A API oferece capacidade que você não pode hospedar e um custo por hora que escala com o uso; os pesos abertos oferecem um custo fixo e controle total sobre o caminho dos dados, ao preço de uma pilha de inferência que você precisa construir e um conjunto de checkpoints que, atualmente, significa hardware Ascend. Para cargas de trabalho regulamentadas em que a mídia não pode sair do prédio, a segunda não é uma preferência — é a única opção nesta página. Para uma equipe que precisa de análise de áudio de longa duração neste mês, a primeira é a única opção nesta página.

A OrcaRouter não hospeda nenhum dos dois modelos hoje, e preferimos dizer isso com toda a clareza a sugerir uma rota de roteamento que não existe: Qwen3.8-Omni-Flash roda apenas nas próprias plataformas da Alibaba, e InternLumina U2 é um download, e não um endpoint. O que nós executamos é o restante da linha Qwen3.8 — Qwen3.8-Flash e Qwen3.8-Max — por meio de uma única API ao preço de tabela do provedor, com 0% de markup, que é a forma prática de manter uma linha de base funcional para o lado dos modelos fechados desta comparação enquanto o lado dos pesos abertos ainda está colocando em ordem seus checkpoints da NVIDIA.

A headless screenshot of the OrcaRouter model page for Qwen3.8 Flash at www.orcarouter.ai/models/qwen/qwen3.8-flash, showing the model header, the code sample, the input modalities and capabilities, the published pricing and the p50 TTFT figure.

Qual deles você deveria realmente escolher

Escolha o InternLumina U2 se você precisa de um modelo que leia, gere e edite imagens e está disposto a assumir a stack de inferência — e se seus aceleradores forem Ascend, ou se puder esperar pelos checkpoints da NVIDIA. É o único dos dois modelos capaz de criar uma imagem, e o único que você pode executar sem enviar dados a um fornecedor. Considere seus números de benchmark como não comprovados até que o relatório técnico seja publicado, porque o cartão do modelo diz exatamente isso.

Escolha o Qwen3.8-Omni-Flash se o seu problema for horas de áudio e vídeo em vez de pixels de saída — inteligência de reuniões, análise de gravações longas, trabalho agêntico com uso intenso de áudio em chinês e inglês — e se você puder aceitar uma dependência de fonte única e saída apenas em texto. O custo é vantajoso em horas de áudio de entrada e bem mais fraco na fatura total; seus benchmarks são relatados pelo fornecedor e não reproduzidos; e as primeiras execuções de terceiros a surgir o colocam no 28º percentil em raciocínio, com uma amostra pequena o bastante para que isso deva motivar um teste, e não uma decisão.

Se você precisa dos dois, eles são complementares, não alternativas: um modelo de imagem de pesos abertos que você hospeda e um modelo fechado de mídia longa que você invoca. Nenhum dos dois é roteável por nós hoje. O que observar de um lado é o checkpoint da NVIDIA e o relatório técnico; do outro, a primeira avaliação independente, que ainda não existe e que é a maior lacuna em tudo o que foi escrito sobre Qwen3.8-Omni-Flash até agora.