
Qwen-Image 2.1 vs Nano Banana 2: Quanto Você Paga por Imagem e Quanto Você Paga para Tê-lo
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Apenas um destes dois modelos tem um preço que você pode colocar numa planilha. Nano Banana 2 — o modelo Gemini 3.1 Flash Image, disponível em geral desde 28 de maio de 2026 — custa cerca de US$ 0,067 por imagem de 1024×1024, US$ 0,101 em 2048×2048 e aproximadamente US$ 0,151 na faixa 4K, com o modo em lote por cerca de metade do preço e a entrada de texto cobrada separadamente a US$ 0,25 por milhão de tokens. Qwen-Image 2.1, disponibilizado como código aberto pela equipe Qwen-Image em 20 de setembro de 2026, não tem preço por imagem algum, porque não há endpoint hospedado para comprar: é um download de pesos de 33 GB sob uma licença de pesquisa que proíbe uso comercial. Portanto, a primeira pergunta nesta comparação não é qual modelo é melhor. É se você está comprando imagens ou comprando uma máquina que as produz, e essas duas compras não são comparáveis da forma como uma ficha técnica sugere.
A previsibilidade é o que um preço por imagem realmente compra.
A precificação do Google é incomum na categoria de imagens pela clareza com que se converte. O modelo cobra $60 por milhão de tokens de saída e, como a saída de imagem é tokenizada de forma previsível, isso se traduz em valores por imagem que você pode avaliar antes de gerar qualquer coisa.
• Nano Banana 2 — cerca de US$ 0,067 para 1024×1024, US$ 0,101 para 2048×2048, aproximadamente US$ 0,151 em 4K, cerca de metade desses valores no modo em lote, além de US$ 0,25 por milhão de tokens para entrada de texto. Mil imagens em 2K custam cerca de US$ 101, previsível com precisão de dólar.
• Qwen-Image 2.1 — sem preço publicado. O custo é o seu próprio tempo de GPU com um pacote de 33 GB, e o conselho da ficha do modelo para hardware com restrições é fazer offload para a CPU via pipe.enable_model_cpu_offload(), que é mais uma válvula de escape do que uma solução.
O que o preço por consumo oferece não são apenas as imagens. É a capacidade de responder a "quanto nos custa esta funcionalidade com dez mil imagens por mês" sem primeiro fazer benchmarking do seu próprio hardware. Essa é uma vantagem real e é fácil subestimá-la, porque a alternativa — a auto-hospedagem — tem um custo genuinamente difícil de calcular: depende da sua utilização, da sua placa, da sua eletricidade e de se a máquina estaria de outra forma ociosa. A comparação honesta não é $101 por mil contra grátis. É $101 por mil contra um valor amortizado que você tem de calcular sozinho, e a maioria das equipes que faz as contas descobre que o preço por consumo é competitivo até a utilização ficar muito alta.
A licença é onde os "pesos livres" deixam de ser livres.
Esta é a diferença mais marcante entre os dois modelos, e não é nem de perto.
Nano Banana 2 é um produto comercial com termos comerciais. Você paga por imagem e distribui o que cria. O Qwen-Image 2.1 é distribuído sob o Qwen Research License Agreement, datado de 20 de setembro de 2026, que concede direitos "SOMENTE PARA FINALIDADES NÃO COMERCIAIS" e afirma que o uso comercial exige uma licença separada solicitada ao fornecedor. Isso representa uma mudança em relação à linha Qwen-Image anterior, que era distribuída sob Apache 2.0 — portanto, a opção aberta nesta comparação é aberta no sentido de que você pode lê-la e executá-la, não no sentido de que você pode construir um negócio sobre ela.
Para uma equipe de pesquisa, um hobbista, ou qualquer pessoa fazendo benchmarking, essa é uma licença adequada e o download é genuinamente gratuito. Para uma equipe de produto, isso significa que o modelo nesta comparação sem preço por imagem também não tem caminho comercial, o que invalida completamente a comparação de custos: você não está escolhendo entre $101 e algo mais barato, você está escolhendo entre um modelo cuja saída você pode vender e um que você não pode.
Resolução e proporções de aspeto, onde o modelo aberto tem uma vantagem real
Deixe a licença de lado e o Qwen-Image 2.1 faz algo que o Nano Banana 2 não faz, de uma forma que importa para fluxos de trabalho específicos.
• Qwen-Image 2.1 — 2K nativo com 2048×2048 como padrão documentado em 40 etapas de inferência, sete predefinições de proporção, até 10 imagens de referência e saída RGBA: um canal alfa real, edição em camada transparente e extração de sujeito a partir de fotos RGB.
• Nano Banana 2 — saída em 4K com suporte a proporções incomuns, incluindo extremos de 1:4 e 1:8, um alcance maior do que a maioria dos modelos oferece em qualquer direção, e divulga índices de consistência de cinco personagens e catorze objetos em uma única geração.
O canal alfa é o que merece atenção. O modelo do Google não está documentado como capaz de produzir transparência, e o Qwen-Image 2.1 o faz nativamente, o que significa que a etapa de composição que, de outro modo, seria trabalho manual — recortar o sujeito, manter as bordas suaves, colocá-lo sobre outra coisa — está dentro do modelo, e não depois dele. Se você cria assets em camadas profissionalmente, isso é uma diferença de fluxo de trabalho, e não uma alegação de qualidade. Também vale dizer claramente que ambos os modelos renderizam em tamanhos maiores do que a maioria dos trabalhos precisa: 4K e 2048×2048 já ultrapassaram o ponto em que a restrição é o modelo, e não o destino.

Um número publicado contra uma promessa
O modelo da Google tem estado em ambos os rankings de imagens da Artificial Analysis desde a primavera e está entre os cinco primeiros em texto para imagem e edição de imagens no snapshot de setembro, com cerca de Elo 1.320 em texto para imagem. Suas métricas de consistência — cinco personagens, catorze objetos — são da própria Google, mas ficam ao lado de um placar independente, o que significa que podem passar por uma verificação de sanidade em relação ao desempenho real do modelo em comparações cegas.
Qwen-Image 2.1 não possui pontuação independente. Ele tem um post de blog do fornecedor com um gráfico do Qwen-Image-Bench que nenhum terceiro reproduziu, e um relatório prático de acesso antecipado de um testador do programa Qwen Ambassador que executou os pesos finais por meio de uma interface do ModelScope Studio: aproximadamente 10–15 segundos para texto para imagem, 18–23 segundos para edição, forte manipulação de posição de câmera e de papéis de múltiplos personagens, e consistência de múltiplas referências degradando a partir de cerca de três imagens de entrada em diante. Um revisor, nenhum cronômetro exibido, nenhum conjunto de prompts publicado. É a única observação externa do modelo que existe publicamente, e deve ser lida como uma dica, e não como uma medição.
Circula também, em coberturas de terceiros, um número que descreve o Qwen-Image 2.1 como um transformer de 20 camadas. Isso contradiz o model card, que documenta um transformer de difusão single-stream de 32 camadas com 7B parâmetros no componente de geração visual, um codificador de texto Qwen3-VL 8B e um VAE RGBA de 64 canais com compressão espacial de 16×. Use o model card.
A única coisa que você pode fazer com ambos
Este é o único artigo deste lote em que o oponente é um modelo que nós realmente roteamos. O Nano Banana 2 está no OrcaRouter como google/gemini-3.1-flash-image-preview, ao lado do restante da linha de imagens — a família GPT-Image da OpenAI, os níveis do Imagen 4 do Google, as outras pré-visualizações de imagem do Gemini e o endpoint de imagem Grok Imagine da xAI — tudo por trás de um único endpoint compatível com OpenAI, ao preço de tabela do provedor, com zero markup. O Qwen-Image 2.1 não está entre os modelos que roteamos, e este artigo não vai dar a entender que está.
O que isto significa, na prática, para esta decisão é mais restrito do que um discurso de vendas e mais útil do que ele. Se quiser comparar os dois modelos com os seus próprios prompts, o lado da Google custa-lhe uma chave de API e cerca de um décimo de cêntimo por imagem em 2K, e fica no mesmo endpoint que tudo o resto que utiliza. O lado da Alibaba custa-lhe um download de 33 GB, uma GPU e uma revisão da licença de investigação antes de poder fazer seja o que for de comercial com o resultado. O failover automático entre fornecedores é a outra peça que aqui importa: uma rota pode transportar tráfego de produção num modelo medido enquanto um modelo não medido é avaliado ao lado dele, para que a avaliação nunca fique no caminho crítico.


Qual deles, para quem
• Escolha o Nano Banana 2 se você está lançando o produto. Ele tem licença comercial, um preço que você pode prever ao dólar, uma pontuação independente entre as cinco melhores nos dois rankings, saída em 4K e a maior variedade de proporções desta comparação. O custo de mil imagens em 2K é de cerca de US$ 101, e você pode começar a gerá-las hoje à tarde.
• Escolha Qwen-Image 2.1 se você está pesquisando. É gratuito para baixar, a arquitetura e o prompt de sistema de reescrita de prompt são totalmente inspecionáveis, ele renderiza nativamente em 2048×2048 com transparência real, e aceita até 10 imagens de referência com edições locais por círculo, anotação pintada ou máscara. Você não pode vender o que ele produz, e ninguém mediu se ele é bom.
A lacuna entre esses dois parágrafos é a lacuna entre os modelos, e não é uma lacuna de qualidade — é uma lacuna de maturidade, e está se fechando conforme um cronograma. Pediu-se aos testadores de acesso antecipado da Qwen que publicassem amostras ou análises até 29 de setembro de 2026. Quando forem publicados, o modelo aberto deixa de ser uma incógnita e passa a ser comparável, e a única questão que restará será a licença. Esse é o número a acompanhar, e é um arquivo de licença, não um benchmark.
