Tarjeta hero para la comparativa Bernini-Diffusers-v2 versus Qwen Image 3.0, mostrando pesos Apache-2.0 que autoalojas frente a una API cerrada que renderiza texto hasta ~10px, bajo el eslogan Misma descripción del puesto, respuestas opuestas en control.
Guides & Insights

Bernini-Diffusers-v2 vs Qwen Image 3.0: Pesos que posees vs una API que renderiza texto

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Dos laboratorios chinos lanzaron modelos capaces de generar imágenes con tres semanas de diferencia y terminaron en lados opuestos de la mayor división en la categoría.Qwen-Image-3.0, lanzado por el equipo de Alibaba el 21 de julio de 2026 y abierto a una API internacional el 4 de agosto, es un modelo de imagen de pesos cerrados al que se invoca por HTTP.Bernini-Diffusers-v2, que ByteDance publicó en Hugging Face el 13 de agosto de 2026 sin aviso, es un modelo de pesos abiertos con licencia Apache-2.0 que puedes descargar y ejecutar. La misma descripción general del trabajo —generación y edición de imágenes— y respuestas opuestas a la pregunta de quién controla el modelo. La mayor parte de lo que sigue es consecuencia de esa única decisión, así que es donde comienza esta comparación en lugar de donde termina.

Los pesos dividen

Qwen-Image-3.0 — pesos cerrados. Al momento de escribir esto, Alibaba no ha publicado los pesos ni un informe técnico del modelo; se usa a través de la API en Alibaba Cloud Bailian o en la plataforma Qwen. Los resultados llevan una etiqueta de procedencia AIGC. Lo que compras es capacidad sin custodia: sin autoalojamiento, sin ajuste fino, sin uso sin conexión, sin poder mirar bajo el capó.

Bernini-Diffusers-v2 — pesos abiertos. Apache-2.0, un directorio de diffusers autónomo en Hugging Face y scripts de inferencia local en el repositorio bytedance/Bernini. Puedes ajustarlo, ejecutarlo en modo aislado, mantener tus datos en tu propio hardware y dejar de pagar por imagen. El precio de la custodia es operarlo: el README recomienda GPUs de clase Hopper y una pila de Python 3.11.2 / PyTorch 2.7.1+cu126.

Para un equipo cuyas imágenes contienen material confidencial, o cuyas normas de cumplimiento prohíben enviar datos a una API de terceros, esa división zanja el debate por sí sola.

Fidelidad de texto y diseño

Donde Qwen-Image-3.0 es genuinamente distintivo es en el texto. Sus cifras principales, de los materiales de lanzamiento de Alibaba:

• Ventana de indicaciones — hasta 4500 tokens de entrada, un salto de 4,5× respecto a la generación anterior, que es lo que le permite manejar resúmenes densos como portadas de periódicos o una cuadrícula de conocimiento de nueve paneles en una sola llamadabr />• Texto pequeño — representación legible hasta aproximadamente 10px, incluyendo notación matemática, subíndices, superíndices y fórmulas multilíneabr />• Idiomas — representación nativa en 12 idiomas con 20+ fuentes y 100+ estilos artísticos, además de familiaridad con interfaces comunes de web, juegos y software

Bernini-Diffusers-v2 no hace ninguna afirmación comparable sobre texto y maquetación en su ficha. Sus fortalezas están en otra parte — edición semántica basada en planificación y un pipeline de video — y ante un encargo que consiste principalmente en "renderizar esta infografía con precisión", Qwen-Image-3.0 es la opción demostrada y Bernini es la no probada.

Profundidad de edición

Qwen-Image-3.0 — generación más edición, con un repertorio de trucos especializados: restauración de pintura antigua, generación de panoramas, de boceto a PPT y storyboarding multi-toma. La propuesta es la utilidad en producción — composiciones que se sostienen, detalles que se perciben como reales — más que una arquitectura de edición concreta.

Bernini-Diffusers-v2 — edición mediante un planificador semántico. Un planificador Qwen2.5-VL descompone la instrucción en un plan de lo que debe cambiar, y un renderizador basado en Wan2.2 lo dibuja. Es un diseño convincente para ediciones complejas y de varios pasos — «cambia la estación, reemplaza el coche, mantén el encuadre» — y se extiende a tareas de video (t2v, v2v, rv2v) que ningún competidor aborda. Todo ello proviene del proveedor y no ha sido verificado públicamente.

Two-column comparison scoreboard for Bernini-Diffusers-v2 and Qwen Image 3.0: weights, price, prompt window, text rendering, editing strengths, and hosted API availabilityScreenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the News and Highlights sections, including the v2 training-recipe change, and the start of the model card table

Costo

Qwen-Image-3.0 — aproximadamente $0.025 por imagen de 1K en la API internacional (unos 0,18 yuanes), con una salida de hasta 2048×2048 y hasta seis imágenes por llamada. Su precio está pensado para competir duramente con el resto del mercado de imágenes por API — una fracción de lo que cobraban los modelos premium de imágenes alojados hace un año.

Bernini-Diffusers-v2 — pesos gratuitos, sin cargo por imagen, y una factura de hardware en su lugar. La economía se invierte con el volumen: el autoalojamiento es un mal negocio para imágenes ocasionales y uno cada vez mejor cuanto más generas, porque el costo marginal de una imagen adicional tiende a cero.

Hay un tercer costo que favorece al lado de los pesos abiertos y es fácil de subestimar: el costo de cambiar. Un modelo de API cerrada te bloquea en su precio, sus límites de uso y su hoja de ruta; un modelo que posees puede intercambiarse, parchearse o ajustarse sin renegociar nada.

¿Cuál es la API sobre la que construyes?

Qwen-Image-3.0 es solo API, por lo que si construyes sobre ella, te comprometes a una facturación por imagen en la infraestructura de otra persona — que es exactamente donde el pass-through de OrcaRouter importa. El precio que ves en nuestro lado es el precio de lista de Alibaba con un margen del 0%, y un recorte de precio del proveedor se aplica el mismo día, así que la economía por imagen es la del proveedor, no un margen de revendedor adicional. La conmutación automática por error entre proveedores es la otra mitad del argumento: una API de imágenes que se cae a mitad de campaña deja de importar cuando tus llamadas se enrutan a su alrededor. Si en cambio eliges el camino de los pesos abiertos con Bernini-Diffusers-v2, aceptas la carga operativa hoy a cambio de cero tarifas por imagen, y cuando un proveedor alojado eventualmente adopte los pesos, el mismo pass-through se aplica a lo que sea que cobre ese proveedor.

Decision card for the Bernini-Diffusers-v2 versus Qwen Image 3.0 matchup: Qwen Image 3.0 rents the capability as a text-accurate API at ~$0.025 per image with zero infrastructure; Bernini-Diffusers-v2 owns the model as Apache-2.0 weights that are self-hosted and fine-tunable but unverified

El veredicto

En papel, Qwen-Image-3.0 es el modelo de imagen puro más potente: renderizado de texto probado, una ventana de prompt enorme, fidelidad de maquetación multilingüe y un precio de API competitivo. Es la opción segura para la generación de imágenes en producción cuando el briefing tiene mucho texto y el flujo de trabajo está orientado a la API. Bernini-Diffusers-v2 es el modelo que de verdad puedes poseer — pesos con licencia Apache-2.0, autoalojado, ajustable, con capacidad de vídeo — a costa de operarlo tú mismo y confiar en una tabla de benchmarks que nadie ha reproducido. Elige Qwen-Image-3.0 por precisión y cero infraestructura; elige Bernini-Diffusers-v2 por custodia y control. La regla de decisión en una línea: ¿quieres alquilar la capacidad u poseer el modelo?

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube