Cartão hero para a comparação entre o Qwen-Image 2.1, um modelo de pesos abertos com licença de pesquisa que você mesmo hospeda, e o Nano Banana 2, um modelo com licença comercial com preço por imagem publicado
Guides & Insights

Qwen-Image 2.1 vs Nano Banana 2: Quanto Você Paga por Imagem e Quanto Você Paga para Tê-lo

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Apenas um destes dois modelos tem um preço que você pode colocar numa planilha. Nano Banana 2 — o modelo Gemini 3.1 Flash Image, disponível em geral desde 28 de maio de 2026 — custa cerca de US$ 0,067 por imagem de 1024×1024, US$ 0,101 em 2048×2048 e aproximadamente US$ 0,151 na faixa 4K, com o modo em lote por cerca de metade do preço e a entrada de texto cobrada separadamente a US$ 0,25 por milhão de tokens. Qwen-Image 2.1, disponibilizado como código aberto pela equipe Qwen-Image em 20 de setembro de 2026, não tem preço por imagem algum, porque não há endpoint hospedado para comprar: é um download de pesos de 33 GB sob uma licença de pesquisa que proíbe uso comercial. Portanto, a primeira pergunta nesta comparação não é qual modelo é melhor. É se você está comprando imagens ou comprando uma máquina que as produz, e essas duas compras não são comparáveis da forma como uma ficha técnica sugere.

A previsibilidade é o que um preço por imagem realmente compra.

A precificação do Google é incomum na categoria de imagens pela clareza com que se converte. O modelo cobra $60 por milhão de tokens de saída e, como a saída de imagem é tokenizada de forma previsível, isso se traduz em valores por imagem que você pode avaliar antes de gerar qualquer coisa.

Nano Banana 2 — cerca de US$ 0,067 para 1024×1024, US$ 0,101 para 2048×2048, aproximadamente US$ 0,151 em 4K, cerca de metade desses valores no modo em lote, além de US$ 0,25 por milhão de tokens para entrada de texto. Mil imagens em 2K custam cerca de US$ 101, previsível com precisão de dólar.

Qwen-Image 2.1 — sem preço publicado. O custo é o seu próprio tempo de GPU com um pacote de 33 GB, e o conselho da ficha do modelo para hardware com restrições é fazer offload para a CPU via pipe.enable_model_cpu_offload(), que é mais uma válvula de escape do que uma solução.

O que o preço por consumo oferece não são apenas as imagens. É a capacidade de responder a "quanto nos custa esta funcionalidade com dez mil imagens por mês" sem primeiro fazer benchmarking do seu próprio hardware. Essa é uma vantagem real e é fácil subestimá-la, porque a alternativa — a auto-hospedagem — tem um custo genuinamente difícil de calcular: depende da sua utilização, da sua placa, da sua eletricidade e de se a máquina estaria de outra forma ociosa. A comparação honesta não é $101 por mil contra grátis. É $101 por mil contra um valor amortizado que você tem de calcular sozinho, e a maioria das equipes que faz as contas descobre que o preço por consumo é competitivo até a utilização ficar muito alta.

A licença é onde os "pesos livres" deixam de ser livres.

Esta é a diferença mais marcante entre os dois modelos, e não é nem de perto.

Nano Banana 2 é um produto comercial com termos comerciais. Você paga por imagem e distribui o que cria. O Qwen-Image 2.1 é distribuído sob o Qwen Research License Agreement, datado de 20 de setembro de 2026, que concede direitos "SOMENTE PARA FINALIDADES NÃO COMERCIAIS" e afirma que o uso comercial exige uma licença separada solicitada ao fornecedor. Isso representa uma mudança em relação à linha Qwen-Image anterior, que era distribuída sob Apache 2.0 — portanto, a opção aberta nesta comparação é aberta no sentido de que você pode lê-la e executá-la, não no sentido de que você pode construir um negócio sobre ela.

Para uma equipe de pesquisa, um hobbista, ou qualquer pessoa fazendo benchmarking, essa é uma licença adequada e o download é genuinamente gratuito. Para uma equipe de produto, isso significa que o modelo nesta comparação sem preço por imagem também não tem caminho comercial, o que invalida completamente a comparação de custos: você não está escolhendo entre $101 e algo mais barato, você está escolhendo entre um modelo cuja saída você pode vender e um que você não pode.

Resolução e proporções de aspeto, onde o modelo aberto tem uma vantagem real

Deixe a licença de lado e o Qwen-Image 2.1 faz algo que o Nano Banana 2 não faz, de uma forma que importa para fluxos de trabalho específicos.

Qwen-Image 2.1 — 2K nativo com 2048×2048 como padrão documentado em 40 etapas de inferência, sete predefinições de proporção, até 10 imagens de referência e saída RGBA: um canal alfa real, edição em camada transparente e extração de sujeito a partir de fotos RGB.

Nano Banana 2 — saída em 4K com suporte a proporções incomuns, incluindo extremos de 1:4 e 1:8, um alcance maior do que a maioria dos modelos oferece em qualquer direção, e divulga índices de consistência de cinco personagens e catorze objetos em uma única geração.

O canal alfa é o que merece atenção. O modelo do Google não está documentado como capaz de produzir transparência, e o Qwen-Image 2.1 o faz nativamente, o que significa que a etapa de composição que, de outro modo, seria trabalho manual — recortar o sujeito, manter as bordas suaves, colocá-lo sobre outra coisa — está dentro do modelo, e não depois dele. Se você cria assets em camadas profissionalmente, isso é uma diferença de fluxo de trabalho, e não uma alegação de qualidade. Também vale dizer claramente que ambos os modelos renderizam em tamanhos maiores do que a maioria dos trabalhos precisa: 4K e 2048×2048 já ultrapassaram o ponto em que a restrição é o modelo, e não o destino.

Two-column scoreboard for Qwen-Image 2.1 and Nano Banana 2: Qwen-Image 2.1 rows read Released 20 Sept 2026 / Licence research-only, non-commercial / Output 2048x2048 native with RGBA transparency / Aspect ratios seven presets / Reference images up to 10 / Price self-host, no hosted endpoint; Nano Banana 2 rows read GA 28 May 2026 / Licence commercial / Output up to 4K plus 1:4 and 1:8 ratios / Consistency five characters, fourteen objects, Google-reported / Independent score AA top five, both boards / Price about $0.067 per 1K image, $0.101 per 2K; footer reads 'Nano Banana 2 figures per Google and Artificial Analysis; Qwen-Image 2.1 figures vendor-reported, no independent score yet.'

Um número publicado contra uma promessa

O modelo da Google tem estado em ambos os rankings de imagens da Artificial Analysis desde a primavera e está entre os cinco primeiros em texto para imagem e edição de imagens no snapshot de setembro, com cerca de Elo 1.320 em texto para imagem. Suas métricas de consistência — cinco personagens, catorze objetos — são da própria Google, mas ficam ao lado de um placar independente, o que significa que podem passar por uma verificação de sanidade em relação ao desempenho real do modelo em comparações cegas.

Qwen-Image 2.1 não possui pontuação independente. Ele tem um post de blog do fornecedor com um gráfico do Qwen-Image-Bench que nenhum terceiro reproduziu, e um relatório prático de acesso antecipado de um testador do programa Qwen Ambassador que executou os pesos finais por meio de uma interface do ModelScope Studio: aproximadamente 10–15 segundos para texto para imagem, 18–23 segundos para edição, forte manipulação de posição de câmera e de papéis de múltiplos personagens, e consistência de múltiplas referências degradando a partir de cerca de três imagens de entrada em diante. Um revisor, nenhum cronômetro exibido, nenhum conjunto de prompts publicado. É a única observação externa do modelo que existe publicamente, e deve ser lida como uma dica, e não como uma medição.

Circula também, em coberturas de terceiros, um número que descreve o Qwen-Image 2.1 como um transformer de 20 camadas. Isso contradiz o model card, que documenta um transformer de difusão single-stream de 32 camadas com 7B parâmetros no componente de geração visual, um codificador de texto Qwen3-VL 8B e um VAE RGBA de 64 canais com compressão espacial de 16×. Use o model card.

A única coisa que você pode fazer com ambos

Este é o único artigo deste lote em que o oponente é um modelo que nós realmente roteamos. O Nano Banana 2 está no OrcaRouter como google/gemini-3.1-flash-image-preview, ao lado do restante da linha de imagens — a família GPT-Image da OpenAI, os níveis do Imagen 4 do Google, as outras pré-visualizações de imagem do Gemini e o endpoint de imagem Grok Imagine da xAI — tudo por trás de um único endpoint compatível com OpenAI, ao preço de tabela do provedor, com zero markup. O Qwen-Image 2.1 não está entre os modelos que roteamos, e este artigo não vai dar a entender que está.

O que isto significa, na prática, para esta decisão é mais restrito do que um discurso de vendas e mais útil do que ele. Se quiser comparar os dois modelos com os seus próprios prompts, o lado da Google custa-lhe uma chave de API e cerca de um décimo de cêntimo por imagem em 2K, e fica no mesmo endpoint que tudo o resto que utiliza. O lado da Alibaba custa-lhe um download de 33 GB, uma GPU e uma revisão da licença de investigação antes de poder fazer seja o que for de comercial com o resultado. O failover automático entre fornecedores é a outra peça que aqui importa: uma rota pode transportar tráfego de produção num modelo medido enquanto um modelo não medido é avaliado ao lado dele, para que a avaliação nunca fique no caminho crítico.

Screenshot of the Artificial Analysis text-to-image leaderboard captured September 9 2026, showing Nano Banana 2 inside the top group of hosted image models at around Elo 1,320 behind GPT Image 2 (high), MAI-Image-2.6 and Reve 2.1, with no Qwen-Image 2.1 entry on the boardScreenshot of the OrcaRouter model page for google/gemini-3.1-flash-image-preview, the route that serves Nano Banana 2, captured in English and showing the model listed on the platform's OpenAI-compatible endpoint

Qual deles, para quem

Escolha o Nano Banana 2 se você está lançando o produto. Ele tem licença comercial, um preço que você pode prever ao dólar, uma pontuação independente entre as cinco melhores nos dois rankings, saída em 4K e a maior variedade de proporções desta comparação. O custo de mil imagens em 2K é de cerca de US$ 101, e você pode começar a gerá-las hoje à tarde.

Escolha Qwen-Image 2.1 se você está pesquisando. É gratuito para baixar, a arquitetura e o prompt de sistema de reescrita de prompt são totalmente inspecionáveis, ele renderiza nativamente em 2048×2048 com transparência real, e aceita até 10 imagens de referência com edições locais por círculo, anotação pintada ou máscara. Você não pode vender o que ele produz, e ninguém mediu se ele é bom.

A lacuna entre esses dois parágrafos é a lacuna entre os modelos, e não é uma lacuna de qualidade — é uma lacuna de maturidade, e está se fechando conforme um cronograma. Pediu-se aos testadores de acesso antecipado da Qwen que publicassem amostras ou análises até 29 de setembro de 2026. Quando forem publicados, o modelo aberto deixa de ser uma incógnita e passa a ser comparável, e a única questão que restará será a licença. Esse é o número a acompanhar, e é um arquivo de licença, não um benchmark.