
Ming-Image-0.1-Design vs Qwen-Image 3.0: Quem Mostra Como o Texto É Desenhado
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
A coisa mais interessante sobre Ming-Image-0.1-Design não está na ficha do modelo. Está em um commit de um framework de inferência. Em algum momento próximo ao upload silencioso do modelo para o Hugging Face em 17 de setembro de 2026, o vLLM-Omni mesclou uma alteração intitulada feat: adicionar suporte a byte5 para Ming que conecta um codificador de glifos ByT5 a um novo ming_flash_omni pipeline — um componente dedicado cujo único trabalho é olhar para os caracteres que você pediu para serem renderizados, e não para a imagem que você pediu. Esse é o tipo de detalhe que só se encontra lendo código, e é exatamente o detalhe que Qwen-Image 3.0 — o modelo de imagem fechado e hospedado do fornecedor, lançado em 21 de julho de 2026 e disponibilizado em geral em 5 de agosto — não deixa ninguém ler de forma alguma. Ambos os modelos são voltados para trabalho de design em que tipografia legível é a parte difícil. Só um deles vai lhe dizer como faz isso.
O que cada um deles diz sobre texto
A história de renderização de texto do Qwen-Image 3.0 é inteiramente uma alegação de lançamento, e é boa no papel. O material da Alibaba descreve prompts de até aproximadamente 4.500 tokens, texto legível até cerca de 10 pixels, cobertura de 12 idiomas em mais de 20 fontes, saída de até 2048×2048 e até seis imagens por chamada, entregue nas edições Pro e Standard por meio de uma única API hospedada. Não há liberação de pesos, licença declarada, model card, relatório técnico nem tabela de benchmark publicada para verificar qualquer um desses pontos. O número amplamente repetido de ~20B parâmetros do MMDiT é reportado, e não confirmado.
A história do Ming-Image-0.1-Design é um repositório. 6.154.901.056 parâmetros, licença MIT, uma diffusers tag de pipeline, todos os pesos em safetensors BF16, aproximadamente 71,5 GB distribuídos entre connector/, mllm/, mlp/, scheduler/, transformer/ e vae/. A inferência recomendada é 2048×2048 com 12 etapas de amostragem e orientação em 1,0 em uma única GPU CUDA de 80 GiB, ou 1024 para velocidade, com o vLLM-Omni indicado para implantação e um modelo de visão-linguagem separado indicado para aprimoramento de prompt. O card o descreve como um modelo de texto para imagem para UI, infográficos, pôsteres e outros designs visuais ricos em texto, com saída RGBA para fundos transparentes.
Esses dois parágrafos não são o mesmo tipo de afirmação, e vale a pena ser franco sobre o motivo. Um é uma descrição de um produto escrita pelas pessoas que o vendem. O outro é uma descrição de um artefato que qualquer pessoa pode baixar e verificar.
O codificador de glifos é a parte que explica a categoria.
A renderização de texto em modelos de imagem costuma falhar de uma maneira específica: o modelo gera algo que parece escrita sem ser escrita. As formas das letras são plausíveis, mas a palavra está errada. A razão é arquitetural antes de qualquer outra coisa — a maioria dos modelos de imagem não tem nenhum componente que enxergue caracteres como caracteres, então a tipografia é reconstruída a partir de estatísticas visuais da mesma forma que a grama.
O commit do vLLM-Omni é interessante precisamente porque aponta para isso. Os arquivos adicionados — byte5_encoder.py, pipeline_ming.py, t5_block_mapper.py e um processador de entrada de estágio — descrevem um caminho no qual um codificador byte-level ByT5 lê o texto que deve aparecer na imagem, o vocabulário do tokenizador é estendido com marcadores de fonte e cor, e as características resultantes são anexadas ao longo da dimensão da sequência, com o lado negativo recebendo zeros. Esse último detalhe é o indício de que esta é uma decisão de design real e não mera infraestrutura: se o ramo negativo carregasse as mesmas características de glifo, a orientação livre de classificador seria puxada para renderizar o texto e para longe do prompt, então os zeros existem para evitar que os dois objetivos entrem em conflito. O codificador carrega apenas quando o checkpoint realmente contém uma byte5/ subpasta.
Duas notas de honestidade. Este é um commit de um framework de inferência de terceiros, não uma declaração do Ant Group, e a leitura do que esses arquivos significam é nossa, e não do fornecedor. E isso corrobora uma intenção de design, não um resultado: a presença de um codificador de glifos é consistente com uma boa renderização de texto, e não é evidência de que a renderização de texto seja boa. A única evidência independente de qualidade é uma única posição numa tabela de classificação, discutida abaixo.

O contraste com o Qwen-Image 3.0 não está em o modelo da Alibaba renderizar texto mal — ninguém fora da Alibaba pode dizer quão bem ele renderiza texto, e é justamente esse o ponto. Está em que a pergunta “como esse modelo desenha letras” tem uma resposta para um desses modelos e uma alegação de marketing para o outro, e é na lacuna entre uma resposta e uma alegação que as decisões de engenharia são tomadas.
O único número, e o quadro no qual ele não está.
Ming-Image-0.1-Design está em primeiro lugar no Artificial Analysis Text to Image Leaderboard for UI/UX Design, visão de pesos abertos, com Elo de 1.082 — à frente de Ideogram 4.0 (Quality) com 1.052, Ideogram 4.0 com 1.015, HunyuanImage 3.0 Instruct com 1.005, FLUX.2 [dev] com 1.000, FLUX.2 [dev] Flash com 999 e FLUX.2 [dev] Turbo com 994. A cópia desse ranking é a reproduzida no próprio card do modelo, e traz a marca Artificial Analysis; ninguém reproduziu a pontuação de forma independente.
![The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.](https://cms.orcarouter.ai/api/media/file/3-1124.png)
É um ranking de pesos abertos, então o Qwen-Image 3.0 não tem entrada e sua ausência não diz nada sobre sua qualidade. O que ela diz é estrutural: um ranking de preferência cega só pode classificar modelos cujos pesos são públicos. Isso dá a um lançamento aberto uma posição mensurável meses antes de ele ter um produto, e dá a um lançamento fechado um número de marketing e nada mais. As alegações do Qwen-Image 3.0 — legibilidade de 10 pixels, prompts de 4.500 tokens, mais de 20 fontes — não têm nenhuma medição independente por trás delas.

Como você realmente testaria isso, e quanto custa tentar
Se a legibilidade da tipografia é o motivo pelo qual você está lendo isto, o teste não é um ranking. É a sua própria fonte, o seu próprio idioma e as suas próprias strings, passadas pelos dois candidatos e lidas por uma pessoa. Esse teste exige que um desses modelos seja acessível e barato, e que o outro seja baixável, e eles têm preços baseados em princípios opostos.
• Qwen-Image 3.0 — cerca de $0,04 por imagem na edição Pro e cerca de $0,03 na Standard, com preços para consumidores domésticos a partir de cerca de ¥0,18 por imagem. Esses são números de lançamento e não foram auditados. Você pode executar uma matriz de prompts esta tarde e pagar por chamada.
• Ming-Image-0.1-Design — sem preço publicado, porque não há endpoint hospedado. O custo é um download de 71,5 GB, uma placa de 80 GiB e seu próprio tempo, e o benefício é que você pode direcionar o mesmo teste para o caminho do codificador de glifos e ver se é esse componente que faz o trabalho.
Esta é a situação para a qual uma camada de roteamento foi criada, e vale a pena ser preciso sobre qual parte dela se aplica. Nem o Qwen-Image 3.0 nem o Ming-Image-0.1-Design estão na nossa plataforma, portanto uma camada de roteamento não pode colocar nenhum dos dois por trás de uma chave hoje. O que ela pode fazer é manter a comparação honesta enquanto você a executa: O OrcaRouter disponibiliza mais de 200 modelos por trás de um único endpoint compatível com OpenAI, ao preço de tabela do fornecedor e sem qualquer margem, com failover automático entre fornecedores, para que o modelo em que você já confia possa manter o caminho de produção — e seu custo permaneça atrelado ao preço de tabela do fornecedor, de modo que uma mudança de tarifa do fornecedor chegue ao nosso lado no mesmo dia — enquanto um modelo de design ainda não medido é avaliado ao lado dele, e não à frente dele.
Dois releases abertos, um fechado, e um padrão
Vale a pena notar o que o lançamento Ming evidencia, para além de si mesmo. O Ant Group publicou um modelo de design de 6,15 bilhões de parâmetros sob licença MIT sem anúncio, ao lado de um segundo modelo para decomposição de camadas sob a mesma licença. A Alibaba publicou um modelo hospedado fechado sem licença, sem cartão de modelo e sem relatório, voltado para a mesma classe de trabalho, e o precificou por imagem.
Essas são duas apostas diferentes sobre onde reside o valor nos modelos de design. Uma diz que o modelo é o produto e os pesos são o canal de distribuição. A outra diz que o modelo é um serviço e os pesos são aquilo que você mantém. Ambas as apostas podem estar certas no mesmo mercado, e produzem respostas muito diferentes para a única pergunta que importa no momento da avaliação: consigo descobrir como isto funciona antes de depender disso?
• Se você precisa saber como o texto é renderizado, e por que às vezes não é — Ming-Image-0.1-Design é o único dos dois que permite que você veja, e a licença MIT significa que você pode agir com base no que encontrar.
• Se você precisa hoje de um endpoint de produção com um preço por imagem e sem infraestrutura — o Qwen-Image 3.0 é o único dos dois que oferece um, e os seus componentes internos fazem parte do preço.
• Se precisar de evidências independentes antes de se comprometer — nenhum dos dois tem o suficiente. Um tem uma única posição não reproduzida em um ranking; o outro tem uma ficha de alegações do fornecedor sem números associados.
O que observar é se o padrão se mantém. Um lançamento não anunciado do MIT com um codificador de glifos é uma declaração sobre como seus autores esperam que o modelo seja usado — inspecionado, executado localmente, modificado. Se o próximo lançamento da mesma equipe for anunciado, avaliado por benchmarks e hospedado, foi algo pontual. Se for outro repositório silencioso, a categoria de modelos de design tem um segundo concorrente aberto, e a metade fechada do mercado tem um problema de preço que não tinha em julho.
