
InternLumina-U2 vs Gemini Omni 1.1 Flash: O modelo que você ainda não pode executar versus aquele pelo qual você paga por segundo
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
Se o seu prazo é esta semana, esta comparação tem uma resposta de uma frase. O Gemini Omni 1.1 Flash é o modelo de geração de vídeo do Google disponível de forma geral — você o chama por meio de uma API, ele retorna um clipe com áudio sincronizado e você paga por segundo de saída. O InternLumina-U2 é o modelo de pesquisa Apache-2.0 publicado silenciosamente pelo Shanghai AI Laboratory — você pode baixar seu código de inferência, mas não seus pesos, que o laboratório ainda marca como "em breve". Um é um produto que você pode comprar agora; o outro é uma aposta em forma de artigo que você não consegue executar de jeito nenhum. A questão interessante é por que alguém os colocaria na mesma frase em primeiro lugar, e o que cada um revela sobre para onde o trabalho multimodal aberto está caminhando no final de 2026.
Tudo abaixo é rotulado por fonte. Os detalhes do InternLumina-U2 vêm do repositório GitHub e da página do projeto que o laboratório publicou em 1º de setembro de 2026 — no mesmo dia em que o stub vazio do Hugging Face apareceu — e todos os seus números de benchmark são relatados pelo fornecedor, preliminares e não reproduzidos. Os detalhes do Gemini Omni 1.1 Flash vêm dos materiais de lançamento e da página de preços do próprio Google para o modelo que ficou geralmente disponível em 27 de agosto de 2026.
Duas respostas à mesma pergunta “multimodal”
Ambos os modelos vivem sob a bandeira vaga de "um modelo, muitas modalidades", e esse rótulo compartilhado é a única razão pela qual são comparados. Sob essa bandeira, eles não têm quase nada em comum. Gemini Omni 1.1 Flash é um serviço fechado e hospedado de geração com foco em vídeo: você fornece texto, uma imagem, um clipe curto de referência ou áudio, e ele produz até dez segundos de vídeo em 720p com fala, música e efeitos sonoros incorporados, extensível em incrementos de dez segundos até uma cena de quarenta segundos. Ele entende o clipe que você já tem — a passagem de extensão agora examina até dez segundos de contexto anterior, em vez do antigo — e suporta controle de primeiro/último quadro, para que você possa fixar o início e o fim de um plano e deixar o modelo preencher o meio. É uma ferramenta para criar imagens em movimento, vendida por segundo.
InternLumina-U2 é uma aposta na direção oposta: um único modelo esparso de mistura de especialistas, com 16B de parâmetros totais e 1B ativos, que afirma compreender imagens, vídeo e ativos 3D e gerar e editar imagens por meio de uma interface compartilhada de tokens discretos. Seu lado visual é totalmente discreto — oito codebooks complementares de um tokenizador que o laboratório chama de AToken, de modo que cada posição visual é descrita por oito códigos em vez de um — e seu lado linguístico é uma espinha dorsal de difusão que o laboratório estende do LLaDA-2.0. A proposta é que compreensão e geração devem se reforçar mutuamente em um único conjunto de pesos, em vez de serem costuradas a partir de modelos especialistas. Se isso funciona é atualmente impossível de responder: o modelo não é executável em nenhum lugar, porque os pesos não existem publicamente.
O placar, tal como está.
O placar honesto para este par tem de carregar proveniência em cada linha, porque uma coluna é um produto em envio com preços publicados e a outra é uma alegação de pesquisa não lançada, sem preço algum.
• O que é — Gemini Omni 1.1 Flash: um modelo hospedado de geração e edição de vídeo (ID do modelo gemini-omni-1.1-flash), GA em 27 de agosto de 2026. InternLumina-U2: um LLM de difusão de ciência aberta para compreensão omni-visual, geração e edição de imagens, código lançado em 1º de setembro de 2026.
• Pesos — Gemini Omni 1.1 Flash: nenhum, fechado e somente hospedado. InternLumina-U2: também ainda nenhum, mas licenciado sob Apache-2.0 e explicitamente marcado como "em breve".
• Saída que você obtém — Gemini Omni 1.1 Flash: clipes de 720p com 10 segundos e áudio, extensíveis até 40 segundos; upscales para 1080p e 4K; texto ao lado. InternLumina-U2: nada ainda — código de inferência e um roteiro.
• O que aceita — Gemini Omni 1.1 Flash: texto, imagem, vídeo (até ~131 mil tokens de entrada; três clipes de 10 segundos por prompt), áudio. InternLumina-U2: afirma aceitar texto, imagens naturais, gráficos densos, vídeo com mais de 64 quadros amostrados e ativos 3D GLB/GLTF renderizados em 64 visualizações de cor e profundidade.
• Como executá-lo — Gemini Omni 1.1 Flash: API Gemini do Google por meio da API Interactions com estado; acesso do consumidor pelo Google Flow para assinantes de AI Plus, Pro e Ultra. InternLumina-U2: apenas auto-hospedado, e somente após a divulgação dos pesos; o código espera um diretório de checkpoint dividido, os pesos do tokenizador AToken, FlashAttention e Blender 4.5 para o caminho 3D.
• Quanto custa — Gemini Omni 1.1 Flash: US$ 0,03/seg em modo rascunho 360p, US$ 0,10/seg em 720p, US$ 0,15/seg em 1080p, US$ 0,30/seg em 4K, com uma tabela de preços de tokens de US$ 1,50 por milhão de entrada e US$ 9,00 por milhão de saída de texto. InternLumina-U2: o que os seus próprios GPUs custarem, quando existir.

As duas colunas não medem o mesmo eixo. O lado Gemini é precificado, servido e imediatamente útil; o lado InternLumina é uma especificação de um modelo que ainda não é um modelo.
A parte que está realmente atual: o GA do Gemini Omni 1.1 Flash
O Gemini Omni 1.1 Flash importa por seus próprios méritos esta semana, porque é o momento em que a linha de vídeo omni do Google deixou de ser uma prévia. O endpoint de prévia do Gemini Omni Flash anterior está programado para ser desativado em 30 de setembro de 2026, e este modelo GA é o substituto para o qual os desenvolvedores estão sendo migrados. A lista de atualizações é concreta: extensão de cena de quarenta segundos construída em incrementos de dez segundos, controle de keyframe que permite especificar um primeiro e um último frame e fazer o modelo gerar o vídeo de conexão, clipes de referência de até três segundos para manter um personagem ou cenário consistente, e um nível de rascunho em 360p com preço de um terço do 720p que roda até 60% mais rápido para iterar nos prompts antes do render final caro. Se você cria pipelines de vídeo, a tabela de preços — US$ 0,10 por segundo de 720p, US$ 1,01 por um clipe de dez segundos, cerca de US$ 4 por uma cena de quarenta segundos em 720p construída a partir de quatro chamadas de extensão — é o número que muda seu modelo de custo.
Nada disso faz dela uma concorrente da InternLumina-U2 em qualquer sentido operacional. O Gemini Omni 1.1 Flash gera movimento; a InternLumina-U2, se suas alegações sobreviverem ao contato com os pesos, entenderá o movimento e gerará imagens estáticas. Uma equipe que precisa de vídeo de produto neste trimestre não está escolhendo entre os dois — o modelo Gemini é o único do par que sequer pode ser chamado, e está disponível por meio da API própria do Google e de várias plataformas de terceiros.

A documentação "Models" da API Gemini no site de desenvolvedores de IA do Google, capturada em 2 de setembro de 2026 — a página que lista a família Gemini atual, com a linha Gemini Omni na navegação da barra lateral.
A parte que não está nem um pouco atual: InternLumina-U2
O lançamento da InternLumina-U2 em 1º de setembro foi do tipo mais discreto: três commits em um repositório do GitHub, uma página de projeto, um stub de 28 bytes no Hugging Face cujo conteúdo inteiro é um cabeçalho de licença Apache-2.0, e nenhum anúncio. O que é genuinamente público é o harness de inferência e a arquitetura, e eles merecem uma leitura cuidadosa justamente porque ninguém conseguiu testar o modelo em si. O repositório mostra um driver com um ponto de entrada por tarefa — texto, text-to-image (texto para imagem) até 1024×1024, compreensão de imagens em imagens naturais e gráficos densos, edição de imagens baseada em instruções com um modo dual-CFG opcional, compreensão de vídeo em 64 quadros amostrados e compreensão 3D em visualizações GLB/GLTF renderizadas no Blender. A aposta do design é que um vocabulário visual discreto de múltiplos codebooks permite que um único backbone faça tudo isso sem inflar o comprimento da sequência — o mesmo instinto de que "tokens visuais devem carregar mais informação" que impulsiona modelos de vídeo nativos de codec, aplicado a uma interface unificada de compreensão e geração.

O repositório do GitHub InternLM/InternLumina-U2, capturado em 2 de setembro de 2026 — a página inicial do repositório Apache-2.0 com a descrição "Multi-Codebook Diffusion Large Language Model", três commits e os scripts de inferência por tarefa que são tudo o que foi disponibilizado publicamente até agora.
A tabela de benchmarks na página do projeto é rotulada como "resultados preliminares e parciais" pelo próprio laboratório, e os números ali presentes apontam nos dois sentidos: números fortes de gráficos e documentos (ChartQA 86,52, CharXiv-DQ 83,65, informados pelo fornecedor) aparecem ao lado de um GenEval de 0,81 que fica atrás do 0,89 de pelo menos um modelo que o laboratório afirma superar. Não há avaliação independente, porque não há modelo para avaliar. Tudo sobre a qualidade real continua sendo uma afirmação até que arquivos safetensors apareçam naquele stub vazio do Hugging Face.
O que uma camada de roteamento faz quando existe apenas um lado
Esta é uma daquelas comparações em que o aspecto do roteamento é realmente sobre tempo, não escolha. Não vamos fingir que o OrcaRouter atende o InternLumina-U2 — ninguém pode, os pesos não foram liberados — e o Gemini Omni 1.1 Flash também não está no nosso catálogo; você o acessa pela própria API do Google. Para que uma camada de roteamento serve, de fato, nessa lacuna, é para manter suas opções abertas sem reconstruir seu pipeline duas vezes. O modelo de repasse é o mecanismo: quando um modelo hospedado de fornecedor chega a um catálogo, o preço de tabela do provedor é repassado com margem de 0%, então a taxa por segundo que o fornecedor publica é a taxa por segundo que você paga por uma única chave, em vez de um contrato por provedor. E quando um lançamento de pesos Apache-2.0 como o InternLumina-U2 finalmente chega, a atitude racional não é arrancar seu stack de vídeo que já funciona — é colocar o novo modelo em um caminho de teste atrás de failover automático, para que na primeira vez que o modelo de difusão não comprovado se comporte mal, a chamada volte para o modelo em que você já confia, sem mudança de código. Experimente o novo onde ele não pode te prejudicar; roteie o que paga as contas.
O veredito
Se você precisa de vídeo neste mês, a decisão já está tomada: o Gemini Omni 1.1 Flash é real, tem preço definido e está em disponibilidade geral, e o InternLumina-U2 não pode ser chamado por ninguém. Se você acompanha para onde a pesquisa multimodal aberta está indo, o InternLumina-U2 é o artefato mais interessante — uma rara aposta totalmente discreta, com múltiplos codebooks, de um grande laboratório, sob licença Apache-2.0, com a arquitetura já pública e os pesos provavelmente não muito longe. Trate o repositório como uma prévia de uma direção de pesquisa, trate o modelo de vídeo GA como uma ferramenta sobre a qual você pode construir hoje e não deixe que o rótulo compartilhado de “multimodal” o convença de que eles estão competindo pela mesma função.
