
Ming-Image-0.1-Design lidera o ranking de design de UI de pesos abertos — e o número confere
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
A alegação que circula com Ming-Image-0.1-Design é que o modelo de 6B da inclusionAI é o melhor modelo de texto para imagem de pesos abertos para trabalhos de UI e UX, ocupando o primeiro lugar na visão de pesos abertos do ranking de Design UI/UX da Artificial Analysis, com 1.082 Elo. Capturas de tela de rankings de fornecedores são geralmente o tipo mais fraco de evidência, então a primeira coisa que vale a pena fazer é ler o quadro ao vivo. Em 24 de setembro de 2026, isso se confirma, com uma qualificação importante que a captura de tela não carrega: 1.082 é um recorte de caso de uso, não o quadro, e no ranking completo de Texto para Imagem o mesmo modelo está na posição 45, com um Elo de 995.
Ambos os números são reais, vêm da mesma arena e descrevem os mesmos pesos. O que os separa é em quais prompts os votos foram dados.
O que o painel ao vivo realmente diz
Artificial Analysis executa uma arena pareada cega e, em seguida, filtra o mesmo conjunto de votos em segmentos por caso de uso. O segmento de Design de UI/UX é o que importa para um modelo criado para dashboards, telas de aplicativos, pôsteres e infográficos, e é onde o Ming-Image-0.1-Design faz seu melhor trabalho:
• Ranking geral de Texto para Imagem — Ming-Image-0.1-Design em #45, Elo 995, IC de 95% ±8, 21.342 amostras, listado em setembro de 2026, US$ 30,00 por 1.000 imagens, sinalizado como Open Weights
• Fatia de Design UI/UX — Ming-Image-0.1-Design em #16, Elo 1.084, 2.100 amostras na fatia
• Entrada de pesos abertos mais bem colocada nesse segmento — Ming-Image-0.1-Design; os próximos modelos de pesos abertos atrás dela são Ideogram 4.0 (Quality) em #22 e 1.047, Ideogram 4.0 em #31 e 1.018, e HunyuanImage 3.0 Instruct em #40 e 1.005
• Topo do segmento de UI/UX — GPT Image 2.5 Flare (max) com 1.226, GPT Image 2.5 Sunburst (max) com 1.215, GPT Image 2 (high) com 1.204, Grok Imagine Image 2.0 com 1.183
• Em contraste com a própria captura de tela do fornecedor — a inclusionAI publicou 1.082 para Ming, contra 1.052 do Ideogram 4.0 (Quality) e 1.000 do FLUX.2 [dev]; o recorte ao vivo agora mostra 1.084, 1.047 e 1.000, respectivamente
Então a manchete é precisa nos seus próprios termos. O Ming-Image-0.1-Design é o modelo de pesos abertos mais bem avaliado na categoria de Design UI/UX, e é o único modelo de pesos abertos entre os vinte primeiros dessa categoria. Ele também está 142 Elo atrás do líder dessa categoria, e fica no meio do pelotão quando o prompt não é de design. Um modelo que se destaca em dashboards e chega a 995 no geral é um especialista, não um generalista, e os dois números só são contraditórios se você ler um deles como a história completa.
Também vale a pena notar as 21.342 amostras no placar completo pelo que elas não são. Essa é uma contagem de votos grande, e é por isso que o intervalo de confiança é estreito, em ±8 Elo, mas número de amostras não é o mesmo que independência de método. A arena é preferência humana às cegas, então ninguém na inclusionAI escreveu a pontuação — essa parte é autêntica. O que a pontuação mede é “qual destas duas imagens um votante preferiu”, e votantes chamados a avaliar uma captura de tela de UI tendem a recompensar texto legível e layout coerente. Esse é precisamente o eixo no qual este modelo foi treinado.

O que é o Ming-Image-0.1-Design
Ming-Image-0.1-Design é um modelo de texto para imagem da inclusionAI, o laboratório de IA associado ao Ant Group, lançado sob a licença MIT, com os pesos publicados a 17 de setembro de 2026 e o pacote de lançamento completo a chegar a 22 de setembro. Gera a partir de um único prompt — não é necessária qualquer imagem de referência — e destina-se a design gráfico com muito texto, em vez de fotografia: maquetes de UI, painéis de controlo, infográficos, cartazes e tudo aquilo em que o texto renderizado tem de se manter legível no tamanho em que será lido.
A configuração de inferência documentada é específica e excepcionalmente barata por etapa:
• Resolução — 2048 x 2048 recomendada, ou 1024 x 1024 para geração mais rápida, com tamanhos intermediários encaixados em uma dessas duas categorias
• Passos de amostragem — 12
• Orientação — CFG scale 1.0
• Precisão — BF16
Hardware — uma GPU CUDA com 80 GiB de VRAM, descrita como a configuração validada
Doze passos com uma escala de orientação de 1,0 são a assinatura de um amostrador destilado ou sem orientação. É isso que torna viável uma saída de 2048 pixels em um número de passos que a maioria dos modelos de difusão não tentaria, e é o principal motivo pelo qual este modelo é interessante para quem executa geração de imagens em grande volume, em vez de uma imagem de cada vez.
A outra característica estrutural é a transparência. O Ming-Image-0.1-Design pode emitir RGBA nativo; assim, quando o prompt começa com uma das frases de transparência documentadas, um fundo transparente sai do amostrador, e não de uma etapa de matting. Um modelo companheiro, Ming-Image-0.1-Design-Layer, vai além: ele recebe um design achatado mais um plano de camadas e retorna PNGs RGBA separados — texto, cartões, sujeito principal, fundo — que se recombinam para recriar o original. Essa é a diferença entre um modelo de design e um modelo de imagem. Um PNG plano é uma imagem de um layout; camadas separadas são um layout que você ainda pode editar.
![Screenshot of the inclusionAI/Ming-Image-0.1-Design model card on Hugging Face, captured 24 September 2026. The header shows 188 likes, 3,067 followers, tags including text-to-image, difusers, safetensors, image-generation, graphic-design, text-rendering and License: mit, and a safetensors panel reading Model size 6B params, Tensor type BF16. The card's UI/UX Design leaderboard image is embedded in the body, showing Ming-Image-0.1-Design first at 1,082 above Ideogram 4.0 (Quality) at 1,052 and FLUX.2 [dev] at 1,000. The right rail states 'This model isn't deployed by any Inference Provider', and the Quick Start block shows the infer.py command with --resolution 2048 and a note that prompt enhancement can use Ling-3.0-flash-VL or qwen3.8-27B.](https://cms.orcarouter.ai/api/media/file/3-1273.png)
O rótulo 6B e o download 26B
"6B" é preciso quanto à parte que a maioria das pessoas quer dizer e enganoso quanto à parte que decide se você consegue executá-lo. O transformer de difusão tem 6,15 B de parâmetros. O pacote que você realmente baixa tem cerca de 52,88 GB, porque o codificador de texto multimodal tem 17,01 B de parâmetros e o conector acrescenta 3,09 B — cerca de 26 B de parâmetros no total em BF16. O transformer do modelo Layer tem o dobro do modelo base, com 12,31 B, e seu pacote é ainda maior, com cerca de 65,20 GB.
Isso importa por duas razões práticas. Primeiro, o requisito de 80 GiB de VRAM não diz respeito ao transformer de 6B; diz respeito a tudo o que precisa estar residente junto com ele. Segundo, qualquer comparação com um modelo descrito como "6B" precisa verificar qual 6B está em questão. Um transformer de difusão de 6B com um codificador de texto de 20B é um problema de implantação muito diferente de um modelo de 6B de ponta a ponta.
O tratamento de prompts é a outra coisa que o card torna explícita em vez de esconder: a receita recomendada executa primeiro uma etapa de reescrita, usando um modelo de visão e linguagem para expandir um prompt curto em uma descrição de layout JSON estruturada, no estilo Figma, com coordenadas, hierarquia, especificações de cores e texto literal. Os cards dos modelos indicam Ling-3.0-flash-VL ou Qwen3.8-27B para essa tarefa. Em outras palavras, o pipeline que o fornecedor usa como benchmark é um pipeline de dois modelos. Se você chamar Ming-Image-0.1-Design com um prompt de uma linha e sem etapa de reescrita, você não estará executando a configuração que produziu 1.084 na fatia de UI/UX.
Onde isso deixa um pipeline de design
O resumo honesto do Ming-Image-0.1-Design é que ele resolve um problema específico e caro — gerar layouts densos em texto que sobrevivem ao escrutínio visual — e o faz no topo do campo de pesos abertos no único ranking que mede esse problema. Ele não lidera o ranking geral de imagens, não elimina a necessidade de um VLM à sua frente, e exige uma GPU séria.
O que isso muda é o meio de um fluxo de trabalho de design. Se o seu pipeline atualmente gera uma imagem plana e depois paga a um humano ou a um modelo de segmentação para recortá-la, um modelo que emite RGBA nativamente e um complemento que emite 2–9 camadas nomeadas remove uma etapa. Isso vale mais do que uma coluna de Elo, e é a parte que nenhum ranking mede.
Para equipes que querem testá-lo sem assumir compromisso com infraestrutura, vale a pena ser preciso sobre a separação. Ming-Image-0.1-Design é um download licenciado sob MIT, então ele roda no seu hardware ou não roda de jeito nenhum — o OrcaRouter não roteia nenhum modelo da inclusionAI de nenhuma versão, e dizer o contrário seria uma afirmação que não podemos honrar. O que uma camada de roteamento oferece é a superfície ao redor: um endpoint compatível com OpenAI para mais de 200 modelos, failover automático entre provedores e preço de tabela do provedor repassado com 0% de markup, então uma mudança de preço do fornecedor em qualquer modelo que você de fato use entra em vigor do nosso lado no mesmo dia. Se você está montando um pipeline de design e quer fazer um teste A/B deste modelo contra um hospedado em que já confia, essa comparação roda em uma única chave em vez de dois contratos.

O que mudaria o cenário?
Três coisas fariam o Ming-Image-0.1-Design passar de um forte especialista em pesos abertos para uma opção padrão. Uma primeira reprodução independente dos números Crello do modelo Layer — o card informa um erro RGB L1 de 0,0574 e alpha soft IoU de 0,8923 em 1024, e nenhum grupo externo os executou. Um endpoint hospedado que elimina o requisito de 80 GiB. E um segundo recorte de caso de uso em que o modelo se posiciona tão bem quanto em UI/UX Design, porque um modelo que vence apenas em um recorte de um único board é um modelo cuja generalidade ainda não foi comprovada.
Até então, a frase precisa é a mais restrita: no recorte de Design UI/UX do Artificial Analysis, conforme leitura de 24 de setembro de 2026, o Ming-Image-0.1-Design da inclusionAI é o modelo de texto para imagem de pesos abertos mais bem avaliado, com 1.084 Elo em 2.100 votos — e, no placar completo da mesma arena, ele está em 45º lugar com 995. Ambos são o modelo. Nenhum deles é uma alegação de lançamento, porque este modelo não teve um lançamento; teve um repositório.
