Um cartão de título principal para "Ming-Image-0.1-Design vs Qwen-Image 3.0" com o subtítulo "Quem mostra como o texto é desenhado.", contrastando Ming-Image-0.1-Design (6,15 bilhões de parâmetros, licença MIT, pesos que você pode ler, publicado em 17 de setembro de 2026) com Qwen-Image 3.0 (modelo fechado hospedado, número de parâmetros não publicado, sem licença ou relatório, disponibilidade geral em 5 de agosto de 2026), com o logotipo do OrcaRouter no canto inferior direito.
Guides & Insights

Ming-Image-0.1-Design vs Qwen-Image 3.0: Quem Mostra Como o Texto É Desenhado

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A coisa mais interessante sobre Ming-Image-0.1-Design não está na ficha do modelo. Está em um commit de um framework de inferência. Em algum momento próximo ao upload silencioso do modelo para o Hugging Face em 17 de setembro de 2026, o vLLM-Omni mesclou uma alteração intitulada feat: adicionar suporte a byte5 para Ming que conecta um codificador de glifos ByT5 a um novo ming_flash_omni pipeline — um componente dedicado cujo único trabalho é olhar para os caracteres que você pediu para serem renderizados, e não para a imagem que você pediu. Esse é o tipo de detalhe que só se encontra lendo código, e é exatamente o detalhe que Qwen-Image 3.0 — o modelo de imagem fechado e hospedado do fornecedor, lançado em 21 de julho de 2026 e disponibilizado em geral em 5 de agosto — não deixa ninguém ler de forma alguma. Ambos os modelos são voltados para trabalho de design em que tipografia legível é a parte difícil. Só um deles vai lhe dizer como faz isso.

O que cada um deles diz sobre texto

A história de renderização de texto do Qwen-Image 3.0 é inteiramente uma alegação de lançamento, e é boa no papel. O material da Alibaba descreve prompts de até aproximadamente 4.500 tokens, texto legível até cerca de 10 pixels, cobertura de 12 idiomas em mais de 20 fontes, saída de até 2048×2048 e até seis imagens por chamada, entregue nas edições Pro e Standard por meio de uma única API hospedada. Não há liberação de pesos, licença declarada, model card, relatório técnico nem tabela de benchmark publicada para verificar qualquer um desses pontos. O número amplamente repetido de ~20B parâmetros do MMDiT é reportado, e não confirmado.

A história do Ming-Image-0.1-Design é um repositório. 6.154.901.056 parâmetros, licença MIT, uma diffusers tag de pipeline, todos os pesos em safetensors BF16, aproximadamente 71,5 GB distribuídos entre connector/, mllm/, mlp/, scheduler/, transformer/ e vae/. A inferência recomendada é 2048×2048 com 12 etapas de amostragem e orientação em 1,0 em uma única GPU CUDA de 80 GiB, ou 1024 para velocidade, com o vLLM-Omni indicado para implantação e um modelo de visão-linguagem separado indicado para aprimoramento de prompt. O card o descreve como um modelo de texto para imagem para UI, infográficos, pôsteres e outros designs visuais ricos em texto, com saída RGBA para fundos transparentes.

Esses dois parágrafos não são o mesmo tipo de afirmação, e vale a pena ser franco sobre o motivo. Um é uma descrição de um produto escrita pelas pessoas que o vendem. O outro é uma descrição de um artefato que qualquer pessoa pode baixar e verificar.

O codificador de glifos é a parte que explica a categoria.

A renderização de texto em modelos de imagem costuma falhar de uma maneira específica: o modelo gera algo que parece escrita sem ser escrita. As formas das letras são plausíveis, mas a palavra está errada. A razão é arquitetural antes de qualquer outra coisa — a maioria dos modelos de imagem não tem nenhum componente que enxergue caracteres como caracteres, então a tipografia é reconstruída a partir de estatísticas visuais da mesma forma que a grama.

O commit do vLLM-Omni é interessante precisamente porque aponta para isso. Os arquivos adicionados — byte5_encoder.py, pipeline_ming.py, t5_block_mapper.py e um processador de entrada de estágio — descrevem um caminho no qual um codificador byte-level ByT5 lê o texto que deve aparecer na imagem, o vocabulário do tokenizador é estendido com marcadores de fonte e cor, e as características resultantes são anexadas ao longo da dimensão da sequência, com o lado negativo recebendo zeros. Esse último detalhe é o indício de que esta é uma decisão de design real e não mera infraestrutura: se o ramo negativo carregasse as mesmas características de glifo, a orientação livre de classificador seria puxada para renderizar o texto e para longe do prompt, então os zeros existem para evitar que os dois objetivos entrem em conflito. O codificador carrega apenas quando o checkpoint realmente contém uma byte5/ subpasta.

Duas notas de honestidade. Este é um commit de um framework de inferência de terceiros, não uma declaração do Ant Group, e a leitura do que esses arquivos significam é nossa, e não do fornecedor. E isso corrobora uma intenção de design, não um resultado: a presença de um codificador de glifos é consistente com uma boa renderização de texto, e não é evidência de que a renderização de texto seja boa. A única evidência independente de qualidade é uma única posição numa tabela de classificação, discutida abaixo.

A pipeline diagram titled "How the glyph encoder enters the pipeline", showing prompt text passing through a tokenizer extended with font and colour markers into a ByT5 glyph encoder whose features are appended along the sequence dimension, with the negative branch receiving zeros so guidance is not pulled away from rendered text, and the result emerging as an RGBA image.

O contraste com o Qwen-Image 3.0 não está em o modelo da Alibaba renderizar texto mal — ninguém fora da Alibaba pode dizer quão bem ele renderiza texto, e é justamente esse o ponto. Está em que a pergunta “como esse modelo desenha letras” tem uma resposta para um desses modelos e uma alegação de marketing para o outro, e é na lacuna entre uma resposta e uma alegação que as decisões de engenharia são tomadas.

O único número, e o quadro no qual ele não está.

Ming-Image-0.1-Design está em primeiro lugar no Artificial Analysis Text to Image Leaderboard for UI/UX Design, visão de pesos abertos, com Elo de 1.082 — à frente de Ideogram 4.0 (Quality) com 1.052, Ideogram 4.0 com 1.015, HunyuanImage 3.0 Instruct com 1.005, FLUX.2 [dev] com 1.000, FLUX.2 [dev] Flash com 999 e FLUX.2 [dev] Turbo com 994. A cópia desse ranking é a reproduzida no próprio card do modelo, e traz a marca Artificial Analysis; ninguém reproduziu a pontuação de forma independente.

The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.

É um ranking de pesos abertos, então o Qwen-Image 3.0 não tem entrada e sua ausência não diz nada sobre sua qualidade. O que ela diz é estrutural: um ranking de preferência cega só pode classificar modelos cujos pesos são públicos. Isso dá a um lançamento aberto uma posição mensurável meses antes de ele ter um produto, e dá a um lançamento fechado um número de marketing e nada mais. As alegações do Qwen-Image 3.0 — legibilidade de 10 pixels, prompts de 4.500 tokens, mais de 20 fontes — não têm nenhuma medição independente por trás delas.

A two-column scoreboard titled "Ming-Image-0.1-Design vs Qwen-Image 3.0 - the scoreboard". Left column Ming-Image-0.1-Design: Weights downloadable, 6.15B; Licence MIT; Text rendering glyph encoder visible; Independent score Elo 1,082; Price self-host; Internals readable. Right column Qwen-Image 3.0: Weights none; Licence not published; Text rendering 10px claim, vendor-reported; Independent score none; Price about $0.04 per image; Internals black box. Footer reads "Qwen-Image 3.0 claims vendor-reported; Ming score per the Artificial Analysis board on its model card.", with the OrcaRouter logo bottom-right.

Como você realmente testaria isso, e quanto custa tentar

Se a legibilidade da tipografia é o motivo pelo qual você está lendo isto, o teste não é um ranking. É a sua própria fonte, o seu próprio idioma e as suas próprias strings, passadas pelos dois candidatos e lidas por uma pessoa. Esse teste exige que um desses modelos seja acessível e barato, e que o outro seja baixável, e eles têm preços baseados em princípios opostos.

• Qwen-Image 3.0 — cerca de $0,04 por imagem na edição Pro e cerca de $0,03 na Standard, com preços para consumidores domésticos a partir de cerca de ¥0,18 por imagem. Esses são números de lançamento e não foram auditados. Você pode executar uma matriz de prompts esta tarde e pagar por chamada.

• Ming-Image-0.1-Design — sem preço publicado, porque não há endpoint hospedado. O custo é um download de 71,5 GB, uma placa de 80 GiB e seu próprio tempo, e o benefício é que você pode direcionar o mesmo teste para o caminho do codificador de glifos e ver se é esse componente que faz o trabalho.

Esta é a situação para a qual uma camada de roteamento foi criada, e vale a pena ser preciso sobre qual parte dela se aplica. Nem o Qwen-Image 3.0 nem o Ming-Image-0.1-Design estão na nossa plataforma, portanto uma camada de roteamento não pode colocar nenhum dos dois por trás de uma chave hoje. O que ela pode fazer é manter a comparação honesta enquanto você a executa: O OrcaRouter disponibiliza mais de 200 modelos por trás de um único endpoint compatível com OpenAI, ao preço de tabela do fornecedor e sem qualquer margem, com failover automático entre fornecedores, para que o modelo em que você já confia possa manter o caminho de produção — e seu custo permaneça atrelado ao preço de tabela do fornecedor, de modo que uma mudança de tarifa do fornecedor chegue ao nosso lado no mesmo dia — enquanto um modelo de design ainda não medido é avaliado ao lado dele, e não à frente dele.

Dois releases abertos, um fechado, e um padrão

Vale a pena notar o que o lançamento Ming evidencia, para além de si mesmo. O Ant Group publicou um modelo de design de 6,15 bilhões de parâmetros sob licença MIT sem anúncio, ao lado de um segundo modelo para decomposição de camadas sob a mesma licença. A Alibaba publicou um modelo hospedado fechado sem licença, sem cartão de modelo e sem relatório, voltado para a mesma classe de trabalho, e o precificou por imagem.

Essas são duas apostas diferentes sobre onde reside o valor nos modelos de design. Uma diz que o modelo é o produto e os pesos são o canal de distribuição. A outra diz que o modelo é um serviço e os pesos são aquilo que você mantém. Ambas as apostas podem estar certas no mesmo mercado, e produzem respostas muito diferentes para a única pergunta que importa no momento da avaliação: consigo descobrir como isto funciona antes de depender disso?

• Se você precisa saber como o texto é renderizado, e por que às vezes não é — Ming-Image-0.1-Design é o único dos dois que permite que você veja, e a licença MIT significa que você pode agir com base no que encontrar.

• Se você precisa hoje de um endpoint de produção com um preço por imagem e sem infraestrutura — o Qwen-Image 3.0 é o único dos dois que oferece um, e os seus componentes internos fazem parte do preço.

• Se precisar de evidências independentes antes de se comprometer — nenhum dos dois tem o suficiente. Um tem uma única posição não reproduzida em um ranking; o outro tem uma ficha de alegações do fornecedor sem números associados.

O que observar é se o padrão se mantém. Um lançamento não anunciado do MIT com um codificador de glifos é uma declaração sobre como seus autores esperam que o modelo seja usado — inspecionado, executado localmente, modificado. Se o próximo lançamento da mesma equipe for anunciado, avaliado por benchmarks e hospedado, foi algo pontual. Se for outro repositório silencioso, a categoria de modelos de design tem um segundo concorrente aberto, e a metade fechada do mercado tem um problema de preço que não tinha em julho.