Cartão hero gerado para o artigo Qwen-Image-2.1 versus Hy Image3.5, com o título Qwen-Image-2.1 vs Hy Image3.5, o subtítulo Os rankings os ranqueiam em ordens opostas, chips exibindo Edição: Hy Image3.5 lidera 1.088 a 1.074 e Texto para imagem: Qwen-Image-2.1 lidera 1.034 a 975, e o rodapé Ambos os modelos foram pontuados conforme a Artificial Analysis, setembro de 2026, com o logotipo da OrcaRouter composto no canto inferior direito
Guides & Insights

Qwen-Image-2.1 vs Hy Image3.5: Os Conselhos Independentes os Classificam em Ordens Opostas

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque Qwen-Image-2.1 e Hy Image3.5frente a frente nos dois rankings de imagens do Artificial Analysis, e os rankings discordam sobre qual dos dois é melhor. Em texto para imagem, Qwen-Image-2.1 está 59 Elo à frente de Hy Image3.5 — 1.034 contra 975, posição 18 contra posição 66. Em edição de imagens, os mesmos dois modelos trocam de lugar: Hy Image3.5 ocupa 1.088 Elo e a posição 14, Qwen-Image-2.1 com 1.074 e posição 18. Uma diferença de 14 pontos no sentido oposto. Os dois modelos se tornaram públicos com dois dias de diferença — Qwen-Image-2.1 com pesos abertos em 20 de setembro de 2026, Hy Image3.5 em prévia pública em 22 de setembro de 2026 — e esta é a primeira vez que qualquer um dos dois tem uma pontuação no mesmo instrumento, que é o que torna a discordância digna de ser lida em vez de apenas noticiada.

A jogada óbvia é dizer que o conselho editorial é ruidoso e seguir em frente. Isso está meio certo. A outra metade é que as duas linhas não são igualmente sólidas, o preço de uma delas não é o preço da outra, e um desses modelos detém direitos sobre os pesos, enquanto o outro nunca terá.

Dois conselhos, duas ordens

A Artificial Analysis realiza comparações pareadas cegas — o mesmo prompt para dois modelos, um avaliador escolhe o vencedor, o Elo se acumula — e publica um quadro separado por tarefa. O quadro de texto para imagem tem 166 linhas; o quadro de edição tem 97. As linhas de ambos os modelos vêm do mesmo snapshot do provedor, portanto não se trata de uma incompatibilidade de versão.

• Texto para imagem — Qwen-Image-2.1 com 1.034 Elo (intervalo de 1.024 a 1.044) de 5.286 comparações, 18º de 166. Hy Image3.5 com 975 Elo (intervalo de 966 a 984) de 5.334 comparações, 66º de 166. Os intervalos não se sobrepõem. Uma separação de 59 pontos em amostras de tamanho semelhante é uma ordenação real, não um artefato de arredondamento.

• Edição de imagens — Hy Image3.5 com 1.088 Elo (intervalo de 1.079 a 1.097) em 5.550 comparações, 14º de 97. Qwen-Image-2.1 com 1.074 Elo (intervalo de 1.065 a 1.083) em 5.536 comparações, 18º de 97. Esses intervalos se sobrepõem em uma faixa de quatro pontos, de 1.079 a 1.083. A ordenação é direcional, não estabelecida.

• Os tamanhos das amostras são próximos nos dois rankings — 5.286 contra 5.334 em texto para imagem, 5.536 contra 5.550 em edição —, portanto, a diferença na confiança não é uma questão de um modelo ter recebido menos votos.

• O quadro rotula os modelos de forma diferente, e isso importa: as linhas do Qwen-Image-2.1 trazem o marcador Open Weights, as linhas do Hy Image3.5 não.

Então, a leitura honesta é assimétrica. Texto para imagem: o Qwen-2.1 vence claramente. Imagem: o Hy Image3 está à frente, por uma margem dentro do ruído da medição.

De onde vem a assimetria

A força de edição do Hy Image3.5 não é surpresa quando se olha para aquilo com que a Tencent o lançou. A prévia chegou ao público com até cinco imagens de referência por pedido, texto-para-imagem e imagem-para-imagem no mesmo modelo, e edição multiturno — a vertente de edição recebeu a ênfase do lançamento. O Qwen-Image-2.1 foi construído com uma stack unificada de geração e edição que também lida com imagens de referência, mas as suas linhas de ranking mostram o lado de edição a terminar dois pontos de Elo abaixo do próprio Qwen-Image-3.0-Pro da Alibaba, o que é um resultado mais estreito do que a narrativa do lançamento sugeria.

A própria alegação da Tencent também não é o que o ranking mostra. O fornecedor cita que a prévia tem uma taxa de vitória de cerca de 30% em avaliação cega sobre o Hy Image3.0. Esse número não foi reproduzido por ninguém fora da Tencent, e o ranking independente não o corrobora em texto para imagem — onde o Hy Image3.5 preview, com 975, está 20 Elo abaixo do HunyuanImage 3.0 Instruct de pesos abertos, com 995. Em edição, a mesma comparação vai para o lado do fornecedor: o Hy Image3.5 preview, com 1.088, está 22 Elo acima do HunyuanImage 3.0 Instruct, com 1.066. Uma geração de progresso em um ranking e um passo atrás no outro, na própria sucessão da Tencent.

Screenshot of the Artificial Analysis image editing leaderboard, AA-Image-Editing v2.0, captured in English and cropped from the top row down through the Ideogram 4.5 row, showing GPT Image 2.5 Sunburst (max) first at 1,182 Elo from 17,899 samples, the Hunyuanimage 3.5 (Preview) row at rank 14 with 1,088 Elo and 5,550 appearances, the Qwen-Image-2.1 row at rank 18 with 1,074 Elo and 5,536 appearances and a No API available note, and the Hunyuanimage 3.0 Instruct row at 1,066 with No API available

O eixo de preço, onde os dois não são comparáveis de forma alguma

Hy Image3.5 preview é uma API com cobrança por uso. A Tencent Cloud cobra ¥ 0,15 por uma imagem 2K no endpoint da China continental e US$ 0,024 no internacional, cobrando apenas pelas imagens que a API retorna. A coluna de preços da Artificial Analysis registra US$ 24,00 por 1.000 imagens, que é o mesmo valor nas unidades usadas pelo painel — e, em comparação com os US$ 210,70 que a linha superior do ranking de texto para imagem apresenta para o mesmo milhar de imagens, é menos de um nono do preço.

O Qwen-Image-2.1 não tem linha de preço, porque não tem endpoint. As duas linhas dele no quadro trazem, de forma explícita, Nenhuma API disponível como nota. Você não compra esse modelo; você o baixa e paga por ele em horas de GPU e na questão da licença abaixo. Os 5.286 e 5.536 votos em suas linhas vieram de pessoas que rodam os pesos por conta própria. Esse fato também dá ao ranking uma ressalva que vale a pena manter: um Elo independente para um modelo apenas auto-hospedado mede uma população diferente de um Elo para algo que qualquer um pode chamar.

Se o plano é colocar qualquer um destes num produto, a divisão prática agora está clara, e é a mesma divisão que o preço implica: o modelo com a melhor pontuação de edição é o que se aluga, e o modelo com a melhor pontuação de texto-para-imagem é o que se executa. O OrcaRouter é o lado do aluguer disso — uma API sobre mais de 200 modelos com o preço de tabela do fornecedor repassado sem margem, failover automático entre fornecedores, e uma DSL de encaminhamento para compor vários modelos numa única chamada. Não encaminhamos o Hy Image3.5 preview nem o Qwen-Image-2.1; as linhas de imagem na plataforma são os níveis Imagen da Google e as pré-visualizações de imagem Gemini, o endpoint de imagem Grok Imagine da xAI e a família GPT-Image da OpenAI. Nenhum destes dois é a primeira escolha dessa lista só pela força de uma linha de tabela, que é exatamente por isso que a questão da licença abaixo é a que decide.

O eixo para o qual nenhum dos dois quadros tem uma coluna

Generated comparison scoreboard for Qwen-Image-2.1 and Hy Image3.5, listing editing Elo 1,074 against 1,088 with ranks 18 and 14, editing intervals 1,065 to 1,083 against 1,079 to 1,097, text-to-image Elo 1,034 against 975 with ranks 18 and 66, and the board labels Open Weights, no API for Qwen-Image-2.1 against no Open Weights and $24.00 per 1,000 images for Hy Image3.5

O Qwen-Image-2.1 foi lançado sob o Qwen Research License Agreement, datado de 20 de setembro de 2026, que concede direitos apenas para fins não comerciais e exige uma licença separada do fornecedor para uso comercial. Os repositórios do Hugging Face indicam a licença como outra por esse motivo — não é uma licença OSI e não deve ser lida como tal. O marcador Open Weights em ambas as linhas do quadro está correto e não diz nada sobre isso.

O Hy Image3.5 preview não tem pesos para licenciar. A Tencent não os publicou; a preview é servida na própria plataforma da Tencent e não há uma versão desta geração disponível para download. O que você obtém é uma tabela de preços, um limite de imagens de referência e um serviço que você pode iniciar e parar. Nada para auditar, nada para hospedar, nada para negociar — e nada que você mantém se a Tencent mudar o preço ou descontinuar a preview.

A comparação que realmente resolve a questão dos pesos abertos é o próprio antecessor da Tencent, e não o modelo da Qwen. HunyuanImage 3.0 Instruct está em ambas as classificações com o marcador Open Weights — 1.066 em edição, 995 em texto para imagem. O Qwen-Image-2.1 supera-o em ambas. Portanto, se o requisito for "pesos descarregáveis que posso executar no meu próprio hardware", a melhor opção neste confronto é a da Alibaba, em qualquer das classificações, sob uma licença que ainda proíbe vender o resultado.

Não existe nenhuma versão disto em que a papelada se resolva sozinha. Você pode ficar com a melhor pontuação de edição, sem pesos e com cobrança por uso, ou com a melhor pontuação de texto para imagem com pesos que talvez você não possa comercializar. Escolha com qual restrição você consegue conviver e depois vá medir as duas com seus próprios prompts — a diferença de edição entre elas é de quatro pontos dentro de intervalos sobrepostos, que é o tipo de margem que um único conjunto de prompts reservado consegue apagar.