Hero card para o confronto Bernini-Diffusers-v2 versus Qwen Image 3.0, mostrando pesos Apache-2.0 que você auto-hospeda contra uma API fechada que renderiza texto até ~10px, sob o slogan Mesma descrição de cargo, respostas opostas sobre controle.
Guides & Insights

Bernini-Diffusers-v2 vs Qwen Image 3.0: Pesos que você possui vs uma API que renderiza texto

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois laboratórios chineses lançaram modelos capazes de gerar imagens com três semanas de diferença e acabaram em lados opostos da maior divisão da categoria. Qwen-Image-3.0, lançado pela equipe da Alibaba em 21 de julho de 2026 e aberto a uma API internacional em 4 de agosto, é um modelo de imagem de pesos fechados que você chama via HTTP. Bernini-Diffusers-v2, que a ByteDance publicou no Hugging Face em 13 de agosto de 2026 sem anúncio, é de pesos abertos sob Apache-2.0 que você baixa e executa. A mesma descrição geral do trabalho — geração e edição de imagens — e respostas opostas à pergunta sobre quem controla o modelo. A maior parte do que se segue é consequência dessa única decisão, então é aí que esta comparação começa, em vez de terminar.

Os pesos dividem

Qwen-Image-3.0 — pesos fechados. No momento em que escrevo, a Alibaba não publicou os pesos nem um relatório técnico para ele; você o utiliza através da API no Alibaba Cloud Bailian ou na plataforma Qwen. As saídas carregam um rótulo de proveniência AIGC. O que você compra é capacidade sem custódia: sem auto-hospedagem, sem ajuste fino, sem uso offline, sem olhar sob o capô.

Bernini-Diffusers-v2 — pesos abertos. Apache-2.0, um diretório diffusers autocontido no Hugging Face e scripts de inferência local no repositório bytedance/Bernini. Você pode fazer fine-tuning, executá-lo de forma isolada (air-gapped), manter seus dados no seu próprio hardware e parar de pagar por imagem. O preço da custódia é operá-lo: o README recomenda GPUs da classe Hopper e uma pilha Python 3.11.2 / PyTorch 2.7.1+cu126.

Para uma equipe cujas imagens contenham material confidencial, ou cujas regras de conformidade proíbam o envio de dados a uma API de terceiros, essa divisão resolve a discussão por si só.

Fidelidade de texto e layout

Onde o Qwen-Image-3.0 é genuinamente distinto é no texto. Seus números de destaque, dos materiais de divulgação da Alibaba:

• Janela de prompt — até 4.500 tokens de entrada, um salto de 4,5× em relação à geração anterior, o que permite lidar com briefs densos, como primeiras páginas de jornal ou um grid de conhecimento de nove painéis em uma única chamadabr />• Texto pequeno — renderização legível até aproximadamente 10px, incluindo notação matemática, subscritos, sobrescritos e fórmulas multilinhabr />• Idiomas — renderização nativa em 12 idiomas com 20+ fontes e 100+ estilos artísticos, além de familiaridade com interfaces comuns da web, de jogos e de software

Bernini-Diffusers-v2 não faz nenhuma alegação comparável de texto e layout em sua ficha. Seus pontos fortes estão em outra área — edição semântica baseada em planejamento e um pipeline de vídeo — e em um briefing que é principalmente "renderize este infográfico com precisão", Qwen-Image-3.0 é a escolha comprovada e Bernini é a não comprovada.

Profundidade de edição

Qwen-Image-3.0 — geração e edição, com um portfólio de truques especializados: restauração de pinturas antigas, geração de panoramas, esboço para PPT e storyboarding multi-shot. A proposta é a utilidade em produção — layouts que se sustentam, detalhes que parecem reais — em vez de uma arquitetura de edição específica.

Bernini-Diffusers-v2 — edição por meio de um planejador semântico. Um planejador Qwen2.5-VL decompõe a instrução em um plano do que deve mudar, e um renderizador baseado em Wan2.2 desenha isso. Essa é uma abordagem convincente para edições complexas e de várias etapas — "mudar a estação, substituir o carro, manter o enquadramento" — e se estende a tarefas de vídeo (t2v, v2v, rv2v) que nenhum concorrente aborda. Tudo isso é relatado pelo fornecedor e não foi verificado publicamente.

Two-column comparison scoreboard for Bernini-Diffusers-v2 and Qwen Image 3.0: weights, price, prompt window, text rendering, editing strengths, and hosted API availabilityScreenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the News and Highlights sections, including the v2 training-recipe change, and the start of the model card table

Custo

Qwen-Image-3.0 — aproximadamente $0,025 por 1K de imagens na API internacional (cerca de 0,18 yuan), com saída de até 2048×2048 e até seis imagens por chamada. Ele está precificado para competir fortemente com o restante do mercado de imagens via API — uma fração do que os modelos de imagem premium hospedados cobravam há um ano.

Bernini-Diffusers-v2 — pesos gratuitos, sem taxa por imagem, e uma conta de hardware em vez disso. A lógica econômica se inverte com o volume: auto-hospedagem é um mau negócio para imagens ocasionais e um cada vez melhor quanto mais você gera, porque o custo marginal de mais uma imagem tende a zero.

Existe um terceiro custo que favorece o lado dos pesos abertos e é fácil de subestimar: o custo da mudança. Um modelo de API fechada prende você aos seus preços, aos seus limites de taxa e ao seu roadmap; um modelo que você possui pode ser trocado, corrigido ou ajustado sem renegociar nada.

Em qual API você desenvolve?

Qwen-Image-3.0 é somente API, então se você construir sobre ela, estará se comprometendo com uma medição por imagem na infraestrutura de terceiros — que é exatamente onde o pass-through do OrcaRouter importa. O preço que você vê do nosso lado é o preço de tabela da Alibaba com margem de 0%, e uma redução de preço do fornecedor entra no mesmo dia, então a economia por imagem é do fornecedor, não uma margem de revenda por cima. O failover automático entre provedores é a outra metade do argumento: uma API de imagens que fica fora do ar no meio de uma campanha deixa de importar quando suas chamadas são roteadas ao redor dela. Se, em vez disso, você escolher o caminho dos pesos abertos com Bernini-Diffusers-v2, estará aceitando o fardo operacional hoje em troca de zero taxas por imagem, e quando um provedor hospedado eventualmente adotar os pesos, o mesmo pass-through se aplica ao que esse provedor cobrar.

Decision card for the Bernini-Diffusers-v2 versus Qwen Image 3.0 matchup: Qwen Image 3.0 rents the capability as a text-accurate API at ~$0.025 per image with zero infrastructure; Bernini-Diffusers-v2 owns the model as Apache-2.0 weights that are self-hosted and fine-tunable but unverified

O veredito

No papel, o Qwen-Image-3.0 é o modelo de imagem puro mais forte: renderização de texto comprovada, uma janela de prompt enorme, fidelidade de layout multilíngue e um preço de API competitivo. É a escolha segura para geração de imagens em produção onde o briefing é pesado em texto e o fluxo de trabalho é moldado por API. O Bernini-Diffusers-v2 é o modelo que você pode realmente possuir — pesos Apache-2.0, auto-hospedado, ajustável, com capacidade de vídeo — ao custo de operá-lo você mesmo e confiar em uma tabela de benchmarks que ninguém reproduziu. Escolha o Qwen-Image-3.0 para precisão e zero infraestrutura; escolha o Bernini-Diffusers-v2 para custódia e controle. A regra de decisão em uma linha: você quer alugar a capacidade ou possuir o modelo?

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube