
Ming-Image-0.1-Design vs GPT Image 2.5: O próprio número de um laboratório contra um painel de votos de estranhos
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Coloque Ming-Image-0.1-Design e GPT Image 2.5 na mesma frase e a comparação óbvia é a qualidade. A comparação útil é a procedência. O GPT Image 2.5 ocupa o primeiro e o segundo lugar no ranking ao vivo de Design UI/UX da Artificial Analysis, com 1.227 e 1.218 Elo, em 1.287 e 1.303 votos humanos cegos, respectivamente — ou seja, um ranking produzido por pessoas que não criaram o modelo e não foram informadas de qual resultado era de quem. O Ming-Image-0.1-Design tem exatamente uma pontuação atribuída a ele, 1.082 Elo, e essa pontuação aparece em um gráfico de leaderboard incluído no próprio repositório Hugging Face da inclusionAI, em um quadro que não conseguimos encontrar em nenhum outro lugar, para um modelo com zero downloads. Um desses números é evidência. O outro é uma alegação com uma fonte tipográfica. Essa lacuna, e não os 145 Elo entre eles, é o que deveria moldar uma decisão sobre qualquer um dos modelos.
Os dois números lado a lado, e a armadilha em compará-los
Os números são suficientemente próximos para parecerem comparáveis e suficientemente diferentes em natureza para que não sejam. Aqui está o conjunto, declarado com precisão.
• GPT Image 2.5, no placar ao vivo — primeiro lugar, com 1.227,0 de Elo na configuração Flare (max), e segundo lugar, com 1.218,1, na Sunburst (max), com contagens de amostras de 1.287 e 1.303 e um preço monitorado de US$ 210,72 por 1.000 imagens. O modelo foi listado nesse placar como lançado em 8 de setembro de 2026.
• Ming-Image-0.1-Design, em seu próprio card — primeiro lugar com 1.082 Elo, à frente do Ideogram 4.0 (Quality) com 1.052 e das variantes dev do FLUX.2 entre 994 e 1.000, em um gráfico com o título "Ranking de Texto para Imagem: Design de UI/UX" e o rodapé "Pontuações Elo de votos de preferência às cegas em nossa Image Arena". Nenhuma contagem de amostras é exibida. Nenhuma metodologia é publicada. O próprio ranking não está na web pública, até onde conseguimos encontrar.
• A armadilha — o Elo é calculado por ranking. Uma pontuação só é significativa em relação às outras pontuações no mesmo ranking, e é por isso que o mesmo lançamento do FLUX.2 marca 1.026 no ranking geral de texto para imagem e 1.065 na visualização da categoria UI/UX Design. Subtraia 1.082 de 1.227 e você não terá medido uma diferença de qualidade entre dois modelos. Você subtraiu um número de um número diferente.

O que faz um voto cego ser um voto cego
A Artificial Analysis publica o suficiente de seu método para que ele possa ser verificado. Sua arena de imagens coloca frente a frente duas gerações de modelos anônimos, pede a um votante que escolha um vencedor e converte os resultados em um rating Elo — as contagens de amostras no placar são o número dessas comparações que cada modelo acumulou. É essa estrutura que torna uma pontuação resistente aos próprios autores do modelo: as pessoas que treinaram o GPT Image 2.5 não aparecem no processo, e um modelo não pode ser classificado em primeiro lugar por ser o preferido de seu criador. Não é um instrumento perfeito — o conjunto de votantes é autosselecionado e os prompts não são uma suíte de benchmark controlada — mas é um instrumento que está nas mãos de alguém que não é o fornecedor.
O gráfico dentro do repositório Ming-Image-0.1-Design pega esse formato emprestado sem as partes que o tornam verificável. A alegação é "votos cegos de preferência". "Our Image Arena" é o operador, e o operador é a inclusionAI. Não há contagem de votos publicada, nem distribuição de prompts visível, nem forma de inspecionar os emparelhamentos. É inteiramente possível que a avaliação por trás desse gráfico seja honesta e rigorosa — a equipe do modelo saberia. Também é totalmente impossível de verificar de fora, o que é a única coisa que importa se você for quem está decidindo se deve construir sobre ele.
Vale a pena acrescentar, porque contraria a narrativa fácil: o Ming-Image-0.1-Design não está no quadro ao vivo do Artificial Analysis. Nem na categoria UI/UX Design, nem no quadro geral de texto para imagem, nem na visualização de pesos abertos. A ausência dele não é evidência de que seja pior — um modelo com zero downloads e sem endpoint hospedado não tem como acumular votos. É evidência de que ainda não existe nenhum número independente, o que é uma afirmação diferente.
O preço é a parte que não é ambígua.
Em termos de custo, os dois modelos não estão nem perto, e não há nada a discutir.
• GPT Image 2.5 é um endpoint comercial. A Artificial Analysis o acompanha a $210,72 por 1.000 imagens na categoria UI/UX — aproximadamente 21 centavos por imagem, o que o coloca no topo da faixa de preço do setor. Para contexto, no mesmo quadro, o Grok Imagine Image 2.0 é acompanhado a $60 por 1.000, o MAI-Image-2.6 a $38,9, e o Muse Image a $10.
• Ming-Image-0.1-Design não tem preço porque não tem endpoint. Os pesos têm licença MIT e são gratuitos para download; executá-los custa o que uma GPU CUDA de 80 GiB custar por hora. A configuração validada do model card é uma única placa dessa classe, em resolução de 2048 x 2048 e 12 etapas de amostragem.
• Nenhum dos valores é estável. Ambos os fornecedores revisam tarifas, e uma comparação por imagem feita hoje tem um prazo de validade medido em semanas. Este é o único ponto em que a economia do OrcaRouter vale a pena ser declarada sem rodeios: repassamos os preços de tabela dos fornecedores com 0% de margem, portanto uma alteração de tarifa de um fornecedor entra em vigor do nosso lado no mesmo dia, em vez de após um ciclo de reprecificação nosso — o que importa quando a diferença entre dois candidatos é de 21 centavos contra 6 centavos por imagem e ambos podem mudar.
O que você pode realmente chamar, hoje, e onde nos posicionamos nisso
A disponibilidade é o ponto em que esta comparação deixa de ser um exercício mental.
O GPT Image 2.5 é um produto real com uma API real por trás dele, vendido pela OpenAI nos seus próprios termos. Não é encaminhável através do OrcaRouter — o nosso catálogo não contém qualquer entrada de GPT Image 2.5 a partir de 23 de setembro de 2026 — e não vamos descrever uma rota que não temos. O que o catálogo inclui da mesma linha é a geração anterior, openai/gpt-image-2 a US$ 8,00 por milhão de tokens de entrada e US$ 30,00 por milhão de tokens de saída, a par de openai/gpt-image-1.5, e estes ficam atrás da mesma chave que tudo o resto que encaminhamos.
Ming-Image-0.1-Design não é roteável em lugar nenhum. O repositório tem a inferência desativada, o Hugging Face informa que não há implantação de provedor de inferência, e o Início Rápido aponta para um repositório complementar no GitHub que retorna 404. Nenhum modelo da inclusionAI de qualquer tipo está em nosso catálogo. A única maneira de executá-lo é baixar os shards e servi-los por conta própria.
Então, o formato da escolha é: uma opção que você pode comprar hoje pelo preço máximo do mercado, e uma opção que você pode executar hoje pelo preço de uma GPU e do seu próprio tempo de engenharia, sem nenhuma evidência independente de que ela funcione. Qualquer pessoa que lhe diga que Ming-Image-0.1-Design é uma alternativa mais barata ao GPT Image 2.5 não levou em conta o custo da segunda opção.

Como manter ambos sem apostar em nenhum
O conselho prático aqui é mais restrito do que um veredito, porque os dois modelos ainda não são substitutos um do outro.
Se você precisa de geração de imagens com qualidade de UI ou de design em produção, o GPT Image 2.5 é a escolha defensável, e o preço é o ponto a negociar consigo mesmo, não a qualidade — ele lidera o quadro independente por uma margem ampla o suficiente para que a classificação não esteja em questão. Se você quer saber se o Ming-Image-0.1-Design é bom, tem duas opções e apenas uma delas está livre de suposições: puxar os pesos MIT para um cartão de 80 GiB e rodar seu próprio conjunto de avaliação, ou esperar que outra pessoa o faça. Não trate o 1.082 como um resultado enquanto isso. E se a sua exigência real é opcionalidade, e não um desses modelos especificamente, a disciplina que compensa é manter a chamada de geração atrás de uma única interface — uma chave para mais de 200 modelos, uma mudança de ID de modelo em vez de uma reescrita, failover automático quando um endpoint se comporta mal — de modo que, seja qual for dos dois que publique um número independente primeiro, adotá-lo custe uma linha de configuração e não um sprint.
Uma nota final sobre o que mudaria este artigo. Uma linha Ming-Image-0.1-Design aparecendo no painel Artificial Analysis UI/UX Design, com uma contagem de amostras ao lado, converteria o 1.082 do fornecedor de uma alegação em um ponto de dados — e seria a primeira vez que alguém fora da inclusionAI diria algo mensurável sobre o modelo. Esse é o evento a ser observado, e é algo mais útil de monitorar do que o contador de downloads.

