
Qwen-Image-2.1 vs Nano Banana 2 Lite: $340 por dez mil imagens, ou 13 horas de GPU
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dez mil imagens de 1024 pixels no Nano Banana 2 Lite custam cerca de US$ 340. Dez mil imagens do Qwen-Image-2.1 custam aproximadamente treze horas de uma GPU de 24 GB e uma licença que proíbe você de vender qualquer uma delas. Essa é a troca em uma linha, e é a única comparação nesta família em que os dois modelos realmente fazem o mesmo trabalho no mesmo momento. O Qwen-Image-2.1 passou a ter pesos abertos em 20 de setembro de 2026. O Nano Banana 2 Lite — o ID de modelo do fornecedor google/gemini-3.1-flash-lite-image, oficialmente Gemini 3.1 Flash-Lite Image — foi lançado em 30 de junho de 2026 e é o gerador de imagens estáticas mais barato da linha Nano Banana.
Os dois candidatos, com preços honestos
O Nano Banana 2 Lite gera uma imagem de 1K em cerca de quatro segundos, aproximadamente 2,7× mais rápido que o Gemini 3.1 Flash Image, e cobra uma taxa fixa de US$ 0,034 por imagem de 1K. As tarifas de tokens do Google por trás desse valor são US$ 0,25 por 1M de tokens de entrada e US$ 30 por 1M de tokens de saída de imagem, o que resulta em cerca de US$ 0,0336 em 1K; o modo em lote reduz isso pela metade, para aproximadamente US$ 0,0168. Não existe plano gratuito, e cada saída carrega uma marca d'água SynthID invisível.
O Qwen-Image-2.1 não tem preço, porque não há nada para comprar. É um download de aproximadamente 33 GB — um transformer de difusão de fluxo único de 7B e 32 camadas, emparelhado com um codificador de texto Qwen3-VL 8B — que você mesmo hospeda. A coisa mais próxima de uma tabela de preços é a latência medida do SGLang-Diffusion: 4,74 segundos para a passagem de denoising em uma RTX 4090 de 24 GB usando kernels Cache-DiT e INT8, 8,23 segundos para uma geração completa de 1024×1024 em 40 etapas em uma RTX PRO 6000 Blackwell com pico de ocupação de 40,1 GiB, e 2,748 segundos em uma única B200. Essas são latências de solicitação única, incluindo os componentes mencionados, não números de throughput, então trate 13 horas para dez mil imagens como uma ordem de magnitude, e não como um benchmark.
Coloque esses números lado a lado e a conta não é “$340 versus de graça”. É $340 versus treze horas de uma placa que você já possui ou aluga, mais o tempo de engenharia para montar uma stack de serving. O volume de crossover é muito menor do que a maioria das equipes supõe — mas só se a placa não ficar ociosa pelo resto do mês, e só se o resultado for algo que você tem permissão para produzir.
Três cargas de trabalho, e qual modelo assume cada uma
O volume é o eixo errado por si só. O tipo de trabalho decide isso mais rápido.
• Ativos em tela de alto volume — recortes para redes sociais, miniaturas, variantes A/B. O Nano Banana 2 Lite vence em quase todos os componentes. Quatro segundos por imagem, catorze proporções de aspecto, incluindo 1:4 e 8:1, um preço fixo por imagem que você pode prever ao centavo, modo em lote pela metade. Nada nessa carga de trabalho precisa de alfa ou 2K, e a licença comercial com marca d'água é exatamente o que você quer quando a saída é entregue.
• Impressão, composição em grande formato, ou qualquer coisa que você vá recortar bastante. Qwen-Image-2.1, e não é nem de perto. 2048×2048 nativo em 40 passos contra um modelo que é limitado de forma rígida a cerca de 1 megapixel, sem modo 2K, sem upscaling e sem parâmetro de API para aumentá-lo — em vez disso, o Google direciona trabalhos em 2K e 4K para o Nano Banana 2 ou o Nano Banana Pro. Se você precisar cortar um terço do quadro e ainda ter um ativo utilizável, o Lite não consegue chegar lá.
• Recortes transparentes, ícones, sprites, composições em camadas. Qwen-Image-2.1. O canal alfa é um componente do espaço latente RGBA de 64 canais no qual o amostrador remove o ruído, então não há etapa de segmentação nem etapa de matting; o modelo também consegue extrair um sujeito de uma fotografia comum para uma camada transparente. O Nano Banana 2 Lite não tem saída documentada com fundo transparente.
• Qualquer coisa que precise ser licenciada comercialmente. Nano Banana 2 Lite, sem ressalvas. O Qwen-Image-2.1 é distribuído sob o Qwen Research License Agreement, datado de 20 de setembro de 2026, e permite apenas pesquisa e avaliação não comerciais; a implantação comercial exige uma licença separada da Hangzhou Tongyi Laboratory Technology, e não há preço publicado nem folha de termos para uma.
Mais uma linha pertence a essa lista, e ela vai contra o modelo aberto. O Nano Banana 2 Lite sabe coisas — ele vem com um corte de conhecimento de janeiro de 2025 e um perfil de aderência a prompts construído sobre a base do Gemini 3.1 Flash Lite, com forte renderização de texto na imagem, incluindo chinês, japonês e coreano. As evidências independentes do Qwen-Image-2.1 sobre seguir instruções são escassas e mistas. Uma comparação em arena com juiz de IA que colocou o Nano Banana 2 Lite contra um modelo de imagem Qwen — o registro não fixa uma versão, então leia isso como um sinal sobre a família, e não sobre o 2.1 especificamente — deu ao Lite a vitória nos prompts espaciais estranhos ("astronauta andando a cavalo", "motorista de táxi capivara") e na renderização de texto, em que a saída do Qwen renderizou o título de um convite de Halloween como "Hallofarty Invitation". Os pontos fracos documentados do próprio Lite são rostos pequenos, detalhes finos de texto, infográficos densos e edições mascaradas complexas. Nenhum dos modelos é confiavelmente melhor em seguir uma instrução estranha; eles falham em pontos diferentes.

A questão da imagem de referência, não resolvida
A edição com várias imagens é o ponto em que um pipeline de volume deixa de conseguir substituir um modelo pelo outro, e é também a linha em que a informação pública entra em conflito.
O Qwen-Image-2.1 aceita até 10 imagens de referência e, além disso, oferece suporte a prova virtual, retratos em grupo e composição de guarda-roupa. Para o Nano Banana 2 Lite, as fontes divergem acentuadamente: a página de modelo de um provedor afirma suporte a até 14 imagens de referência para transferência de estilo e edição com múltiplas referências, enquanto um texto comparativo afirma o oposto — que o Lite aceita uma única imagem para edição, e que a capacidade de 14 referências pertence ao Nano Banana 2 completo, com no máximo cinco pessoas mais seis objetos. Diante do conflito, a posição defensável é que o Lite aceita entrada de imagem e composição com múltiplas imagens, mas que sua capacidade de referência é o diferencial que o Google usa para separá-lo do Nano Banana 2. Se seu fluxo de trabalho depende de seis personagens consistentes ao longo de uma série, verifique o limite no model card do próprio Google antes de arquitetar com base nisso.
É também aqui que os modelos deixam de ser intercambiáveis num sentido mais amplo. O Google posiciona o Nano Banana 2 Lite e o Gemini Omni Flash como um par — o modelo de imagem estática e o modelo de vídeo, concebidos para funcionar em cadeia. O Qwen-Image-2.1 não tem equivalente de vídeo, e o seu truque de animação é uma sequência encadeada de edições de regiões locais que cria um loop simples quadro a quadro, e não um modelo de vídeo.
Onde uma camada de roteamento justifica seu lugar
Nenhum destes modelos está no OrcaRouter. Não encaminhamos nenhum modelo Qwen-Image de qualquer versão, por isso o Qwen-Image-2.1 ou é alojado por conta própria ou não está disponível. Nano Banana 2 Lite — o identificador gemini-3.1-flash-lite-image — também não está no nosso catálogo; as rotas de imagem do Google que disponibilizamos são google/gemini-3.1-flash-image-preview, google/gemini-2.5-flash-image, google/gemini-3-pro-image-preview e os três níveis do Imagen 4, mais o GPT-Image-2, GPT-Image-1.5 e GPT-Image-1-mini da OpenAI, e o endpoint de imagem Grok Imagine da xAI.
O que isso proporciona a um pipeline misto é aquilo com que esta comparação continua a deparar-se: uma decisão que muda consoante o ativo. Ativos de volume seguem para uma rota alojada barata, recortes transparentes seguem para a sua própria placa, e uma alteração de preço do fornecedor no lado alojado chega no mesmo dia porque repassamos o preço de tabela do fornecedor sem margem, em vez de definirmos nós próprios o preço. Acrescente failover automático entre fornecedores, uma DSL de roteamento para compor fallbacks e fusão de modelos para chamadas em estilo de painel, e a metade alojada deixa de ser uma relação com fornecedor que tem de gerir modelo a modelo — mais de 200 modelos, um único endpoint compatível com OpenAI, uma única chave. A metade autoalojada continua a ser o seu problema, que é o custo honesto de executar um checkpoint com licença de investigação em hardware que lhe pertence.
Qual escolher, e a condição que o inverte
Se está a produzir ativos no ecrã em volume para uso comercial, o Nano Banana 2 Lite é a resposta e a questão da licença nunca se coloca: $0,034 por imagem, quatro segundos, previsível, vendável. Se precisa de 2K, transparência nativa ou dez imagens de referência, o Qwen-Image-2.1 é o único dos dois que tem qualquer uma delas, e paga isso em hardware, tempo de engenharia e uma licença não comercial que o torna um instrumento de investigação e não uma dependência de produção.
Um único fato fecharia a lacuna. Uma term sheet comercial publicada para o Qwen-Image-2.1 — com um preço e condições que alguém realmente possa assinar — transforma um trabalho de GPU de 13 horas em um item de linha que compete com US$ 340, e, nesse ponto, as vantagens de resolução e de alpha começam a conquistar cargas de trabalho que atualmente vão para o Lite por padrão. Enquanto isso não existir, a divisão é clara: o Lite para tudo o que for entregue, o Qwen-Image-2.1 para tudo o que ficar dentro da empresa, e uma stack de serving para o segundo que você mesmo mantém.


Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
