Cartão de título principal com o texto 'Ming-Image-0.1-Design vs Gemini Omni 1.1 Flash', subtítulo 'Um devolve um design em camadas, o outro não consegue devolver sequer uma imagem estática', com dois cartões de ícones minimalistas. O logótipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

Ming-Image-0.1-Design vs Gemini Omni 1.1 Flash: Um Entregável de Design Precisa das Duas Metades

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Peça ao Ming-Image-0.1-Design um vídeo e você recebe uma imagem estática. Peça ao Gemini Omni 1.1 Flash uma imagem estática e você recebe um erro — a própria documentação dele lista geração de imagens, edição de imagens e saída intercalada de imagem e texto como capacidades não suportadas para o modelo. Então, uma página que coloca esses dois em duas colunas está comparando um renderizador a um projetor. O que realmente vale a pena comparar é aquilo que as equipes de design continuam errando: um entregável final geralmente precisa de uma tela e de um elemento em movimento, e esses dois modelos detêm cada um metade disso, com uma passagem no meio que destrói o trabalho silenciosamente.

Ming-Image-0.1-Design é o modelo de texto para imagem de 6B da inclusionAI, lançado sob a licença MIT com pesos publicados em 17 de setembro de 2026, criado para design gráfico denso em texto. Gemini Omni 1.1 Flash é o modelo de vídeo de produção do Google, disponível em geral desde 27 de agosto de 2026, criado para movimento de formato curto com áudio sincronizado. Nenhum dos dois é substituto do outro, e a pergunta interessante é o que acontece entre eles.

As duas metades, ditas sem rodeios

Comece pelo que cada um retorna fisicamente, porque todo o resto decorre disso.

• Saída — Ming-Image-0.1-Design retorna uma imagem estática, de até 2048 x 2048 com 12 etapas de amostragem e CFG 1,0, ou 1024 x 1024 para maior velocidade; Gemini Omni 1.1 Flash retorna vídeo, de até 40 segundos, montado a partir de chamadas de geração e extensão de 10 segundos

• Transparência — Ming-Image-0.1-Design emite RGBA nativo quando o prompt começa com uma frase de transparência documentada, então o alfa sai do sampler; o Gemini Omni 1.1 Flash não tem saída transparente, e também não existe formato de vídeo transparente no pipeline

• Estrutura — o modelo Layer complementar do Ming-Image-0.1-Design decompõe um design achatado em 2–9 PNGs RGBA separados que se recompõem no original; o Gemini Omni 1.1 Flash retorna um único clipe achatado

• Entrada de referência — Ming-Image-0.1-Design gera a partir de apenas um prompt, sem exigir imagem de referência; o Gemini Omni 1.1 Flash aceita até 10 imagens por prompt e até três clipes de vídeo de referência de 3 segundos, e lê até 10 segundos de filmagem anterior ao estender uma cena

• Limite de resolução — Ming-Image-0.1-Design é nativo em 2048; Gemini Omni 1.1 Flash renderiza nativamente em 720p e faz upscale para 1080p e 4K, com um nível de rascunho de 360p

• Custo — Ming-Image-0.1-Design não tem preço de serviço hospedado porque não há endpoint hospedado, então o custo é o tempo da sua própria GPU em uma placa de 80 GiB; Gemini Omni 1.1 Flash cobra US$ 0,10 por segundo em 720p, com o nível de rascunho em 360p em torno de US$ 0,03 por segundo

• Licença — MIT para Ming-Image-0.1-Design, uso comercial permitido; uma API comercial para Gemini Omni 1.1 Flash cuja saída possui marca d'água SynthID

A rendered two-column scoreboard headed 'Two halves', titled 'Ming-Image-0.1-Design vs Gemini Omni 1.1 Flash'. The Ming-Image-0.1-Design column reads: returns a still to 2048 x 2048; 12 steps, CFG 1.0; transparency native RGBA; structure 2-9 editable RGBA layers; cost your own 80 GiB GPU; independent placement #1 open weights in the UI/UX slice. The Gemini Omni 1.1 Flash column reads: returns video to 40 seconds; 10-second calls with 10s lookback; transparency none and no alpha video; structure one flattened clip; cost $0.10 per second at 720p; independent placement top of the video arenas with no audio.

Onde a transferência falha

Se você está construindo um pipeline de design que produz os dois, a direção é apenas uma: Ming-Image-0.1-Design cria o frame, e o Gemini Omni 1.1 Flash o anima. O inverso não existe. E é na emenda entre eles que o trabalho de design se perde.

A primeira vítima é o canal alfa. Um ativo de UI gerado com fundo transparente é a razão para se usar um amostrador que emite RGBA, para começar — ele se encaixa em um layout existente sem um passe de recorte. Alimente esse quadro em um caminho de vídeo e a transparência se vai, porque não há saída de vídeo transparente para preservá-la. A transparência sobrevive no seu compositor, aplicada depois que o clipe retorna, não na cadeia de modelos. Equipes que planejam a composição antes de o clipe existir acabam refazendo-a.

A segunda perda é a resolução. Ming-Image-0.1-Design renderiza nativamente em 2048. Gemini Omni 1.1 Flash renderiza nativamente em 720p e faz upscale para cima. Um frame de design de 2048 pixels alimentado em um caminho de renderização de 720p é majoritariamente detalhe descartado, e o upscale que se segue é uma etapa do lado do fornecedor que você não controla.

O terceiro é texto. Toda a premissa do Ming-Image-0.1-Design é que o texto renderizado permaneça legível no tamanho em que será lido — é esse o eixo que seus 1.084 Elo na fatia de UI/UX Design do Artificial Analysis medem. Um modelo de vídeo que anima esse quadro não renderiza novamente o texto; ele move os pixels que recebeu. Qualquer movimento que altere a perspectiva, a escala ou a iluminação do quadro moverá a tipografia junto, e textos pequenos que eram legíveis em uma imagem estática não sobreviverão à transformação.

Nada disso é um defeito em nenhum dos modelos. É o que acontece quando um entregável é dividido entre dois sistemas que nunca foram concebidos para fazer a transferência um para o outro, e a solução é uma decisão de produção, não uma escolha de modelo: decida qual camada do entregável pode ser achatada e achate-a deliberadamente.

No que cada metade é realmente boa

A evidência do Ming-Image-0.1-Design é uma arena de terceiros. Ele ocupa a 45ª posição de 104 no leaderboard Text to Image da Artificial Analysis, com um Elo de 995 em 21.342 votos, e é o primeiro entre modelos open-weights no recorte de UI/UX Design desse leaderboard, com 1.084 de Elo em 2.100 votos no recorte. A diferença entre esses dois números é a descrição honesta do modelo: um especialista mensurado, não um generalista. Os números de seu companheiro Layer — erro L1 de RGB de 0,0574 e IoU suave de alfa de 0,8923 em 1024 no conjunto de teste Crello — são relatados pelo fornecedor e não reproduzidos, e devem ser rotulados como tal.

As evidências do Gemini Omni 1.1 Flash também são independentes, mas em outro ranking. No Artificial Analysis, ele ocupava o primeiro lugar tanto na arena de texto para vídeo quanto na de imagem para vídeo na categoria sem áudio em 2 de setembro de 2026, com Elo 1.324 e 1.364. Com áudio ativado, cai para 1.237 e 1.180 — segundo e quarto. Essa lacuna de áudio é um detalhe que uma ficha técnica esconde e um ranking expõe, e vale a pena saber antes de orçar uma campanha em torno de uma alegação de liderança no topo do ranking.

Os dois quadros não se sobrepõem, e é exatamente essa a questão. Não existe nenhuma arena onde uma imagem fixa de design e um clipe de dez segundos sejam julgados um contra o outro, e qualquer artigo que insinue o contrário está inventando um placar.

Screenshot of Google's Gemini API models documentation at ai.google.dev/gemini-api/docs/models, captured 24 September 2026 in English. The left navigation lists Gemini 3, Nano Banana, Veo, Gemini Omni Flash, Lyria 3.5 & Lyria Clip, Text-to-speech, Transcribe and other model families. The body shows the Models guide heading, a Gemini 3 section with Gemini 3.8 Flash, Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking cards marked New and Stable, and a Generative media models entry in the on-this-page rail.

Quanto custa a divisão, por tentativa

A economia das duas metades não é comparável e não deve ser nivelada por média numa única rubrica orçamental.

Do lado das imagens estáticas, o Ming-Image-0.1-Design não custa nada por imagem depois que o hardware existe. Isso torna a iteração gratuita da forma que importa: você pode gerar vinte variantes de dashboard em uma tarde e descartar dezenove. Do lado do movimento, um clipe de 10 segundos em 720p no Gemini Omni 1.1 Flash cobra cerca de US$ 1,00; os mesmos 10 segundos no nível de rascunho de 360p custam aproximadamente US$ 0,30; uma cena completa de 40 segundos em 720p — uma geração mais três chamadas de extensão — fica perto de US$ 4,00. O Google não publicou tarifas por segundo para os níveis de 1080p e 4K, e anúncios de revendedores que citam US$ 0,15 e US$ 0,30 por segundo são estimativas de mercado, e não números do fornecedor, portanto, qualquer orçamento de produção em alta resolução permanece provisório.

A consequência prática é que as duas metades exigem estilos de trabalho opostos. Itere na imagem estática, onde as novas tentativas são gratuitas. Comprometa-se no vídeo, onde cada nova tentativa é contabilizada. Uma equipe que itera na metade do vídeo é a equipe que se surpreende com a fatura, porque o primeiro frame não custa nada e as novas tomadas custam tudo.

O espaço para uma camada de roteamento aqui é mais estreito do que um discurso de vendas sugeriria, e vale a pena enunciá-lo com precisão. Ming-Image-0.1-Design é um download MIT — o OrcaRouter não roteia nenhum modelo da inclusionAI, portanto ou ele roda no seu hardware ou não roda de jeito nenhum. O Gemini Omni 1.1 Flash é uma API de fornecedor com a sua própria chave e o seu próprio medidor por segundo, e nós também não o roteamos; o Google não abriu a API de vídeo Omni para roteamento de terceiros. O que de fato oferecemos no lado de movimento é a linha de vídeo da Kling, incluindo kling-v3, kling-v3-omni e kling-video-o1, além do MiniMax H3 — então, se a metade animada de uma entrega precisa de uma rota hospedada em vez de um segundo contrato com fornecedor, isso existe do nosso lado. No lado de imagem, oferecemos a família GPT-Image da OpenAI, os níveis do Imagen 4 do Google e as prévias de imagem do Gemini, e o endpoint de imagem Grok Imagine da xAI. Como o preço de tabela do fornecedor é repassado com 0% de margem em vez de receber margem acrescentada, um corte de preço do fornecedor em qualquer um deles entra em vigor do nosso lado no mesmo dia.

A rendered summary card headed 'The handoff', titled 'What a still loses on the way to motion', listing four losses: the alpha channel (Ming-Image-0.1-Design emits it from the sampler, Gemini Omni 1.1 Flash has no transparent video output); resolution (2048 x 2048 in against a path that renders natively at 720p and upscales); typography (the video model moves the pixels it is given and does not re-render the copy); and working style (stills iterate for free, video bills about $1.00 per 10 seconds at 720p and about $0.30 at the 360p draft tier).

A decisão, de uma só vez

• Você precisa de recursos de design editáveis — Ming-Image-0.1-Design —, e a decomposição em camadas é o motivo. Recortes transparentes, ícones, sprites e composições em camadas são onde um sampler que emite RGBA elimina uma etapa inteira do pipeline.

• Você precisa de movimento, medido — Gemini Omni 1.1 Flash. É o único dos dois com resultados de arena independentes no topo de um ranking, e o único com um preço por segundo publicado que você pode colocar em uma previsão.

• Você precisa dos dois — reserve metade do orçamento de vídeo por tentativa, e não por asset, não presuma que o canal alfa sobrevive, e planeje a composição depois que o clipe retornar.

• Você precisa vender o resultado — o Gemini Omni 1.1 Flash é, sem ambiguidade, a metade mais segura, já que a licença MIT cobre os pesos do Ming-Image-0.1-Design e os termos da API do Google cobrem o vídeo. As marcas d'água são a contrapartida: todo clipe Omni carrega SynthID, e nenhuma saída do Ming-Image-0.1-Design o faz.

O que vale a pena acompanhar a seguir não é mais um confronto direto. É se a inclusionAI vai acoplar um endpoint hospedado ao Ming-Image-0.1-Design — o que eliminaria o custo de entrada de 80 GiB e mudaria inteiramente esta comparação — e se o Google fecha a lacuna de áudio nos placares de vídeo do Omni. Esses dois fatos, e não mais um placar, decidem qual metade de um entregável de design recebe o orçamento.