
Bernini-Diffusers-v2 vs Qwen Image 3.0: Pesos que posees vs una API que renderiza texto
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
Dos laboratorios chinos lanzaron modelos capaces de generar imágenes con tres semanas de diferencia y terminaron en lados opuestos de la mayor división en la categoría.Qwen-Image-3.0, lanzado por el equipo de Alibaba el 21 de julio de 2026 y abierto a una API internacional el 4 de agosto, es un modelo de imagen de pesos cerrados al que se invoca por HTTP.Bernini-Diffusers-v2, que ByteDance publicó en Hugging Face el 13 de agosto de 2026 sin aviso, es un modelo de pesos abiertos con licencia Apache-2.0 que puedes descargar y ejecutar. La misma descripción general del trabajo —generación y edición de imágenes— y respuestas opuestas a la pregunta de quién controla el modelo. La mayor parte de lo que sigue es consecuencia de esa única decisión, así que es donde comienza esta comparación en lugar de donde termina.
Los pesos dividen
• Qwen-Image-3.0 — pesos cerrados. Al momento de escribir esto, Alibaba no ha publicado los pesos ni un informe técnico del modelo; se usa a través de la API en Alibaba Cloud Bailian o en la plataforma Qwen. Los resultados llevan una etiqueta de procedencia AIGC. Lo que compras es capacidad sin custodia: sin autoalojamiento, sin ajuste fino, sin uso sin conexión, sin poder mirar bajo el capó.
• Bernini-Diffusers-v2 — pesos abiertos. Apache-2.0, un directorio de diffusers autónomo en Hugging Face y scripts de inferencia local en el repositorio bytedance/Bernini. Puedes ajustarlo, ejecutarlo en modo aislado, mantener tus datos en tu propio hardware y dejar de pagar por imagen. El precio de la custodia es operarlo: el README recomienda GPUs de clase Hopper y una pila de Python 3.11.2 / PyTorch 2.7.1+cu126.
Para un equipo cuyas imágenes contienen material confidencial, o cuyas normas de cumplimiento prohíben enviar datos a una API de terceros, esa división zanja el debate por sí sola.
Fidelidad de texto y diseño
Donde Qwen-Image-3.0 es genuinamente distintivo es en el texto. Sus cifras principales, de los materiales de lanzamiento de Alibaba:
• Ventana de indicaciones — hasta 4500 tokens de entrada, un salto de 4,5× respecto a la generación anterior, que es lo que le permite manejar resúmenes densos como portadas de periódicos o una cuadrícula de conocimiento de nueve paneles en una sola llamadabr />• Texto pequeño — representación legible hasta aproximadamente 10px, incluyendo notación matemática, subíndices, superíndices y fórmulas multilíneabr />• Idiomas — representación nativa en 12 idiomas con 20+ fuentes y 100+ estilos artísticos, además de familiaridad con interfaces comunes de web, juegos y software
Bernini-Diffusers-v2 no hace ninguna afirmación comparable sobre texto y maquetación en su ficha. Sus fortalezas están en otra parte — edición semántica basada en planificación y un pipeline de video — y ante un encargo que consiste principalmente en "renderizar esta infografía con precisión", Qwen-Image-3.0 es la opción demostrada y Bernini es la no probada.
Profundidad de edición
• Qwen-Image-3.0 — generación más edición, con un repertorio de trucos especializados: restauración de pintura antigua, generación de panoramas, de boceto a PPT y storyboarding multi-toma. La propuesta es la utilidad en producción — composiciones que se sostienen, detalles que se perciben como reales — más que una arquitectura de edición concreta.
• Bernini-Diffusers-v2 — edición mediante un planificador semántico. Un planificador Qwen2.5-VL descompone la instrucción en un plan de lo que debe cambiar, y un renderizador basado en Wan2.2 lo dibuja. Es un diseño convincente para ediciones complejas y de varios pasos — «cambia la estación, reemplaza el coche, mantén el encuadre» — y se extiende a tareas de video (t2v, v2v, rv2v) que ningún competidor aborda. Todo ello proviene del proveedor y no ha sido verificado públicamente.


Costo
• Qwen-Image-3.0 — aproximadamente $0.025 por imagen de 1K en la API internacional (unos 0,18 yuanes), con una salida de hasta 2048×2048 y hasta seis imágenes por llamada. Su precio está pensado para competir duramente con el resto del mercado de imágenes por API — una fracción de lo que cobraban los modelos premium de imágenes alojados hace un año.
• Bernini-Diffusers-v2 — pesos gratuitos, sin cargo por imagen, y una factura de hardware en su lugar. La economía se invierte con el volumen: el autoalojamiento es un mal negocio para imágenes ocasionales y uno cada vez mejor cuanto más generas, porque el costo marginal de una imagen adicional tiende a cero.
Hay un tercer costo que favorece al lado de los pesos abiertos y es fácil de subestimar: el costo de cambiar. Un modelo de API cerrada te bloquea en su precio, sus límites de uso y su hoja de ruta; un modelo que posees puede intercambiarse, parchearse o ajustarse sin renegociar nada.
¿Cuál es la API sobre la que construyes?
Qwen-Image-3.0 es solo API, por lo que si construyes sobre ella, te comprometes a una facturación por imagen en la infraestructura de otra persona — que es exactamente donde el pass-through de OrcaRouter importa. El precio que ves en nuestro lado es el precio de lista de Alibaba con un margen del 0%, y un recorte de precio del proveedor se aplica el mismo día, así que la economía por imagen es la del proveedor, no un margen de revendedor adicional. La conmutación automática por error entre proveedores es la otra mitad del argumento: una API de imágenes que se cae a mitad de campaña deja de importar cuando tus llamadas se enrutan a su alrededor. Si en cambio eliges el camino de los pesos abiertos con Bernini-Diffusers-v2, aceptas la carga operativa hoy a cambio de cero tarifas por imagen, y cuando un proveedor alojado eventualmente adopte los pesos, el mismo pass-through se aplica a lo que sea que cobre ese proveedor.

El veredicto
En papel, Qwen-Image-3.0 es el modelo de imagen puro más potente: renderizado de texto probado, una ventana de prompt enorme, fidelidad de maquetación multilingüe y un precio de API competitivo. Es la opción segura para la generación de imágenes en producción cuando el briefing tiene mucho texto y el flujo de trabajo está orientado a la API. Bernini-Diffusers-v2 es el modelo que de verdad puedes poseer — pesos con licencia Apache-2.0, autoalojado, ajustable, con capacidad de vídeo — a costa de operarlo tú mismo y confiar en una tabla de benchmarks que nadie ha reproducido. Elige Qwen-Image-3.0 por precisión y cero infraestructura; elige Bernini-Diffusers-v2 por custodia y control. La regla de decisión en una línea: ¿quieres alquilar la capacidad u poseer el modelo?
