Um cartão hero de título para a comparação 'InternLumina-U2 vs Gemini Omni 1.1 Flash' com o subtítulo 'O modelo que você ainda não pode executar vs aquele pelo qual você paga por segundo' e três chips de estatísticas — 'InternLumina-U2: apenas código, pesos em breve', 'Gemini Omni 1.1 Flash: GA em 27 de agosto de 2026', 'de US$ 0,03 a US$ 0,30 por segundo de vídeo' — com o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

InternLumina-U2 vs Gemini Omni 1.1 Flash: O modelo que você ainda não pode executar versus aquele pelo qual você paga por segundo

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Se o seu prazo é esta semana, esta comparação tem uma resposta de uma frase. O Gemini Omni 1.1 Flash é o modelo de geração de vídeo do Google disponível de forma geral — você o chama por meio de uma API, ele retorna um clipe com áudio sincronizado e você paga por segundo de saída. O InternLumina-U2 é o modelo de pesquisa Apache-2.0 publicado silenciosamente pelo Shanghai AI Laboratory — você pode baixar seu código de inferência, mas não seus pesos, que o laboratório ainda marca como "em breve". Um é um produto que você pode comprar agora; o outro é uma aposta em forma de artigo que você não consegue executar de jeito nenhum. A questão interessante é por que alguém os colocaria na mesma frase em primeiro lugar, e o que cada um revela sobre para onde o trabalho multimodal aberto está caminhando no final de 2026.

Tudo abaixo é rotulado por fonte. Os detalhes do InternLumina-U2 vêm do repositório GitHub e da página do projeto que o laboratório publicou em 1º de setembro de 2026 — no mesmo dia em que o stub vazio do Hugging Face apareceu — e todos os seus números de benchmark são relatados pelo fornecedor, preliminares e não reproduzidos. Os detalhes do Gemini Omni 1.1 Flash vêm dos materiais de lançamento e da página de preços do próprio Google para o modelo que ficou geralmente disponível em 27 de agosto de 2026.

Duas respostas à mesma pergunta “multimodal”

Ambos os modelos vivem sob a bandeira vaga de "um modelo, muitas modalidades", e esse rótulo compartilhado é a única razão pela qual são comparados. Sob essa bandeira, eles não têm quase nada em comum. Gemini Omni 1.1 Flash é um serviço fechado e hospedado de geração com foco em vídeo: você fornece texto, uma imagem, um clipe curto de referência ou áudio, e ele produz até dez segundos de vídeo em 720p com fala, música e efeitos sonoros incorporados, extensível em incrementos de dez segundos até uma cena de quarenta segundos. Ele entende o clipe que você já tem — a passagem de extensão agora examina até dez segundos de contexto anterior, em vez do antigo — e suporta controle de primeiro/último quadro, para que você possa fixar o início e o fim de um plano e deixar o modelo preencher o meio. É uma ferramenta para criar imagens em movimento, vendida por segundo.

InternLumina-U2 é uma aposta na direção oposta: um único modelo esparso de mistura de especialistas, com 16B de parâmetros totais e 1B ativos, que afirma compreender imagens, vídeo e ativos 3D e gerar e editar imagens por meio de uma interface compartilhada de tokens discretos. Seu lado visual é totalmente discreto — oito codebooks complementares de um tokenizador que o laboratório chama de AToken, de modo que cada posição visual é descrita por oito códigos em vez de um — e seu lado linguístico é uma espinha dorsal de difusão que o laboratório estende do LLaDA-2.0. A proposta é que compreensão e geração devem se reforçar mutuamente em um único conjunto de pesos, em vez de serem costuradas a partir de modelos especialistas. Se isso funciona é atualmente impossível de responder: o modelo não é executável em nenhum lugar, porque os pesos não existem publicamente.

O placar, tal como está.

O placar honesto para este par tem de carregar proveniência em cada linha, porque uma coluna é um produto em envio com preços publicados e a outra é uma alegação de pesquisa não lançada, sem preço algum.

• O que é — Gemini Omni 1.1 Flash: um modelo hospedado de geração e edição de vídeo (ID do modelo gemini-omni-1.1-flash), GA em 27 de agosto de 2026. InternLumina-U2: um LLM de difusão de ciência aberta para compreensão omni-visual, geração e edição de imagens, código lançado em 1º de setembro de 2026.

• Pesos — Gemini Omni 1.1 Flash: nenhum, fechado e somente hospedado. InternLumina-U2: também ainda nenhum, mas licenciado sob Apache-2.0 e explicitamente marcado como "em breve".

• Saída que você obtém — Gemini Omni 1.1 Flash: clipes de 720p com 10 segundos e áudio, extensíveis até 40 segundos; upscales para 1080p e 4K; texto ao lado. InternLumina-U2: nada ainda — código de inferência e um roteiro.

• O que aceita — Gemini Omni 1.1 Flash: texto, imagem, vídeo (até ~131 mil tokens de entrada; três clipes de 10 segundos por prompt), áudio. InternLumina-U2: afirma aceitar texto, imagens naturais, gráficos densos, vídeo com mais de 64 quadros amostrados e ativos 3D GLB/GLTF renderizados em 64 visualizações de cor e profundidade.

• Como executá-lo — Gemini Omni 1.1 Flash: API Gemini do Google por meio da API Interactions com estado; acesso do consumidor pelo Google Flow para assinantes de AI Plus, Pro e Ultra. InternLumina-U2: apenas auto-hospedado, e somente após a divulgação dos pesos; o código espera um diretório de checkpoint dividido, os pesos do tokenizador AToken, FlashAttention e Blender 4.5 para o caminho 3D.

• Quanto custa — Gemini Omni 1.1 Flash: US$ 0,03/seg em modo rascunho 360p, US$ 0,10/seg em 720p, US$ 0,15/seg em 1080p, US$ 0,30/seg em 4K, com uma tabela de preços de tokens de US$ 1,50 por milhão de entrada e US$ 9,00 por milhão de saída de texto. InternLumina-U2: o que os seus próprios GPUs custarem, quando existir.

A comparison scoreboard for InternLumina-U2 and Gemini Omni 1.1 Flash: InternLumina-U2 with Type 16B-A1B diffusion MoE, Weights Apache-2.0 not yet public, Core job Understand & generate stills, Status code only weights 'soon', Price none yet, Run it no one can today; Gemini Omni 1.1 Flash with Type closed hosted video model, Weights none Google API only, Core job video gen & edit with audio, Status GA Aug 27 2026, Price $0.03–$0.30 per second, Run it Gemini API (Interactions), with a footer noting InternLumina figures are vendor-reported and Gemini pricing is per Google, and the OrcaRouter logo in the bottom-right corner.

As duas colunas não medem o mesmo eixo. O lado Gemini é precificado, servido e imediatamente útil; o lado InternLumina é uma especificação de um modelo que ainda não é um modelo.

A parte que está realmente atual: o GA do Gemini Omni 1.1 Flash

O Gemini Omni 1.1 Flash importa por seus próprios méritos esta semana, porque é o momento em que a linha de vídeo omni do Google deixou de ser uma prévia. O endpoint de prévia do Gemini Omni Flash anterior está programado para ser desativado em 30 de setembro de 2026, e este modelo GA é o substituto para o qual os desenvolvedores estão sendo migrados. A lista de atualizações é concreta: extensão de cena de quarenta segundos construída em incrementos de dez segundos, controle de keyframe que permite especificar um primeiro e um último frame e fazer o modelo gerar o vídeo de conexão, clipes de referência de até três segundos para manter um personagem ou cenário consistente, e um nível de rascunho em 360p com preço de um terço do 720p que roda até 60% mais rápido para iterar nos prompts antes do render final caro. Se você cria pipelines de vídeo, a tabela de preços — US$ 0,10 por segundo de 720p, US$ 1,01 por um clipe de dez segundos, cerca de US$ 4 por uma cena de quarenta segundos em 720p construída a partir de quatro chamadas de extensão — é o número que muda seu modelo de custo.

Nada disso faz dela uma concorrente da InternLumina-U2 em qualquer sentido operacional. O Gemini Omni 1.1 Flash gera movimento; a InternLumina-U2, se suas alegações sobreviverem ao contato com os pesos, entenderá o movimento e gerará imagens estáticas. Uma equipe que precisa de vídeo de produto neste trimestre não está escolhendo entre os dois — o modelo Gemini é o único do par que sequer pode ser chamado, e está disponível por meio da API própria do Google e de várias plataformas de terceiros.

A screenshot of the Gemini API Models documentation on Google's AI developer site (captured September 2 2026), showing the sidebar navigation listing the current Gemini model family including the Gemini Omni line.

A documentação "Models" da API Gemini no site de desenvolvedores de IA do Google, capturada em 2 de setembro de 2026 — a página que lista a família Gemini atual, com a linha Gemini Omni na navegação da barra lateral.

A parte que não está nem um pouco atual: InternLumina-U2

O lançamento da InternLumina-U2 em 1º de setembro foi do tipo mais discreto: três commits em um repositório do GitHub, uma página de projeto, um stub de 28 bytes no Hugging Face cujo conteúdo inteiro é um cabeçalho de licença Apache-2.0, e nenhum anúncio. O que é genuinamente público é o harness de inferência e a arquitetura, e eles merecem uma leitura cuidadosa justamente porque ninguém conseguiu testar o modelo em si. O repositório mostra um driver com um ponto de entrada por tarefa — texto, text-to-image (texto para imagem) até 1024×1024, compreensão de imagens em imagens naturais e gráficos densos, edição de imagens baseada em instruções com um modo dual-CFG opcional, compreensão de vídeo em 64 quadros amostrados e compreensão 3D em visualizações GLB/GLTF renderizadas no Blender. A aposta do design é que um vocabulário visual discreto de múltiplos codebooks permite que um único backbone faça tudo isso sem inflar o comprimento da sequência — o mesmo instinto de que "tokens visuais devem carregar mais informação" que impulsiona modelos de vídeo nativos de codec, aplicado a uma interface unificada de compreensão e geração.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page, the 'Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing' description, three commits, and the per-task inference scripts.

O repositório do GitHub InternLM/InternLumina-U2, capturado em 2 de setembro de 2026 — a página inicial do repositório Apache-2.0 com a descrição "Multi-Codebook Diffusion Large Language Model", três commits e os scripts de inferência por tarefa que são tudo o que foi disponibilizado publicamente até agora.

A tabela de benchmarks na página do projeto é rotulada como "resultados preliminares e parciais" pelo próprio laboratório, e os números ali presentes apontam nos dois sentidos: números fortes de gráficos e documentos (ChartQA 86,52, CharXiv-DQ 83,65, informados pelo fornecedor) aparecem ao lado de um GenEval de 0,81 que fica atrás do 0,89 de pelo menos um modelo que o laboratório afirma superar. Não há avaliação independente, porque não há modelo para avaliar. Tudo sobre a qualidade real continua sendo uma afirmação até que arquivos safetensors apareçam naquele stub vazio do Hugging Face.

O que uma camada de roteamento faz quando existe apenas um lado

Esta é uma daquelas comparações em que o aspecto do roteamento é realmente sobre tempo, não escolha. Não vamos fingir que o OrcaRouter atende o InternLumina-U2 — ninguém pode, os pesos não foram liberados — e o Gemini Omni 1.1 Flash também não está no nosso catálogo; você o acessa pela própria API do Google. Para que uma camada de roteamento serve, de fato, nessa lacuna, é para manter suas opções abertas sem reconstruir seu pipeline duas vezes. O modelo de repasse é o mecanismo: quando um modelo hospedado de fornecedor chega a um catálogo, o preço de tabela do provedor é repassado com margem de 0%, então a taxa por segundo que o fornecedor publica é a taxa por segundo que você paga por uma única chave, em vez de um contrato por provedor. E quando um lançamento de pesos Apache-2.0 como o InternLumina-U2 finalmente chega, a atitude racional não é arrancar seu stack de vídeo que já funciona — é colocar o novo modelo em um caminho de teste atrás de failover automático, para que na primeira vez que o modelo de difusão não comprovado se comporte mal, a chamada volte para o modelo em que você já confia, sem mudança de código. Experimente o novo onde ele não pode te prejudicar; roteie o que paga as contas.

O veredito

Se você precisa de vídeo neste mês, a decisão já está tomada: o Gemini Omni 1.1 Flash é real, tem preço definido e está em disponibilidade geral, e o InternLumina-U2 não pode ser chamado por ninguém. Se você acompanha para onde a pesquisa multimodal aberta está indo, o InternLumina-U2 é o artefato mais interessante — uma rara aposta totalmente discreta, com múltiplos codebooks, de um grande laboratório, sob licença Apache-2.0, com a arquitetura já pública e os pesos provavelmente não muito longe. Trate o repositório como uma prévia de uma direção de pesquisa, trate o modelo de vídeo GA como uma ferramenta sobre a qual você pode construir hoje e não deixe que o rótulo compartilhado de “multimodal” o convença de que eles estão competindo pela mesma função.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube