Tarjeta principal para la comparación entre Qwen-Image 2.1, pesos abiertos descargables bajo una licencia de investigación, y Meta Muse Image, un modelo agéntico accesible a través de la propia API de Meta a una tarifa plana de un centavo por imagen
Guides & Insights

Qwen-Image 2.1 vs Meta Muse Image: el modelo que puedes invocar frente al modelo que puedes conservar

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Hay una versión de esta comparación que trata sobre la calidad de imagen, y todavía no puede escribirse — no con honestidad. Qwen-Image 2.1, que el equipo de Qwen-Image publicó el 20 de septiembre de 2026, no tiene ninguna puntuación independiente de ningún tipo. Meta Muse Image, lanzado por Meta Superintelligence Labs el 7 de julio de 2026 como el primer modelo de imagen propio de Meta, sí ha sido medido — ocupa el tercer puesto en la tabla de edición de imágenes de Artificial Analysis, con un Elo de aproximadamente 1.105, está entre los cinco primeros en texto a imagen, y se sitúa en la frontera de Pareto de calidad frente a precio, con 10 dólares por cada mil imágenes. Pero la pregunta más útil sobre estos dos no es cuál es mejor. Es qué se te permite hacer con cada uno, y esas respuestas son casi perfectamente inversas.

El acceso y la capacidad de inspección son dos cosas diferentes, y nadie ofrece ambas.

Meta Muse Image es al que puedes llamar. Desde agosto de 2026 es accesible a través de la propia Model API de Meta a una tarifa plana de 0,01 $ por imagen —aproximadamente 10 $ por cada mil— mediante un endpoint compatible con OpenAI, lo que supone un cambio real respecto a cómo se describía el modelo cuando se lanzó en julio, cuando no existía ninguna vía de acceso para desarrolladores. Esa tarifa plana es inusual en una categoría en la que casi todo lo demás se factura por tokens, y hace que predecir costes sea trivial: mil imágenes cuestan diez dólares, ya sean simples o elaboradas.

Qwen-Image 2.1 es el que puedes conservar. Es una descarga de pesos —de aproximadamente 33 GB entre el transformador de difusión, el codificador de texto y el VAE— publicada bajo el Qwen Research License Agreement del 20 de septiembre de 2026, que concede derechos «ÚNICAMENTE PARA FINES NO COMERCIALES» y exige una licencia aparte para uso comercial. No hay endpoint alojado. No hay tarifa plana. Tampoco hay nada oculto: puedes leer la arquitectura, leer el prompt de sistema de reescritura de prompts, hacerle diff, sobrescribirlo y ejecutarlo todo en tu propio hardware.

Así que el intercambio no es calidad contra calidad. Es un modelo medido, tarifado y con licencia comercial que no posees, frente a un modelo gratuito, sin medición y no comercial que posees por completo. Muy pocos equipos pueden tomar cualquiera de los dos lados de eso sin renunciar a algo.

Por qué Muse no es del todo un modelo de difusión en el sentido habitual

Lo que hace que Meta Muse Image sea inusual es que no solo genera. Ejecuta un bucle: puede buscar en la web, escribir y ejecutar código, y revisar su propio resultado antes de devolver una imagen. Esa es la descripción de la propia Meta, y es la razón por la que el modelo resulta interesante en lugar de ser simplemente competitivo: los pasos agénticos son donde se resuelve la ambigüedad del prompt, y donde una petición como «hazme un gráfico con los números de este año» puede responderse en lugar de aproximarse.

También es la razón por la que su comportamiento es más difícil de razonar. Un modelo de imagen convencional es una función de la indicación a los píxeles. Uno agéntico tiene una trayectoria, y la trayectoria no es algo que se pueda leer en una ficha de modelo. Las cifras reportadas por el proveedor —94 % de consistencia de personaje entre varias imágenes, hasta 10 imágenes de referencia, salida de hasta 1600 píxeles en el lado más largo— describen la envolvente, no el bucle.

Qwen-Image 2.1 resuelve el mismo problema de ambigüedad de la manera opuesta: de forma explícita y a la vista de todos. Junto con el modelo de imágenes, el lanzamiento incluye dos checkpoints de reescritura de prompts — Qwen/Qwen-Image-2.1-PE-T2I y Qwen/Qwen-Image-2.1-PE-I2I, cada uno un Qwen3.5-VL 9B ajustado con fine-tuning de unos 18,8 GB — que toman una instrucción vaga y la reescriben como una directriz precisa antes de que el modelo de difusión la vea. La variante I2I siempre tiene una imagen de entrada, por lo que siempre es una tarea de edición. Y, algo fundamental, el comportamiento del reescritor se especifica en un system_prompt.txt que se incluye en el repositorio, lo que significa que el paso que decide qué significa tu prompt es algo que puedes leer y cambiar.

El bucle agéntico de Meta y el reescritor de prompts de Alibaba son dos respuestas a «el modelo no sabe qué querías decir». Uno es un servicio que decide por ti. El otro es un archivo que puedes editar.

Cómo se ven los números cuando solo un lado los tiene

Meta Muse Image aparece en las dos clasificaciones de imágenes de Artificial Analysis. Ocupa el tercer puesto en edición de imágenes, con un Elo de aproximadamente 1.105, por detrás de MAI-Image-2.6 con 1.122 y de GPT Image 2 (high) con 1.117, y está dentro de los cinco primeros en texto a imagen, con un Elo de alrededor de 1.116. Con $10 por cada mil imágenes, se sitúa en la frontera de Pareto de calidad frente a precio, que es donde interesa estar: no el mejor modelo de la clasificación, pero sí uno de los pocos en los que pagar más te aporta una mejora medible.

Qwen-Image 2.1 no tiene nada de eso. Tiene una publicación de blog del proveedor con un gráfico de Qwen-Image-Bench que ningún tercero ha reproducido, y tiene un único informe práctico: un probador con acceso anticipado en el programa Qwen Ambassador que ejecutó los pesos finales a través de una interfaz de ModelScope Studio e informó de aproximadamente 10–15 segundos para texto a imagen y 18–23 segundos para edición, con una consistencia de múltiples referencias que se degradaba a partir de unas tres imágenes de entrada. Un solo revisor, sin cronómetro, sin conjunto de prompts. Es una señal útil y no es un benchmark, y la forma honesta de interpretarlo es como una pista sobre dónde podría situarse el modelo, en lugar de como evidencia de dónde se sitúa.

En lo que Qwen-Image 2.1 está concretamente por delante no es en la calidad, sino en la capacidad a nivel de píxel: salida nativa en 2K a 2048×2048 de forma predeterminada, 40 pasos de inferencia, siete preajustes de relación de aspecto, hasta 10 imágenes de referencia, ediciones locales mediante círculo, anotación pintada o una máscara independiente, y generación RGBA con edición de capas transparentes y extracción de sujetos a partir de fotos RGB. El modelo de Meta se limita a 1600 píxeles y su propuesta de transparencia no está publicada. Si necesitas un canal alfa real de fábrica, alguien ya tomó esa decisión por ti.

Two-column scoreboard for Qwen-Image 2.1 and Meta Muse Image: Qwen-Image 2.1 rows read Access open weights download, self-host / Licence research-only, non-commercial / Editing score none / Output 2048x2048 native with RGBA / Prompt handling inspectable rewrite checkpoint / Price your own GPU time; Meta Muse Image rows read Access Meta Model API, OpenAI-compatible / Licence commercial, via Meta / Editing score AA #3, Elo about 1,105 / Output up to 1600px / Prompt handling agentic loop, searches and self-reviews / Price flat $0.01 per image; footer reads 'Meta figures per Artificial Analysis; Qwen-Image 2.1 has no independent score yet.'

La tarifa plana es la parte que merece la pena considerar

Un centavo fijo por imagen es una decisión de precios, no una decisión técnica, y cambia para qué sirve el modelo. La tarificación de imágenes medida por tokens penaliza la complejidad: una instrucción larga con varias imágenes de referencia cuesta más que una corta, lo que significa que el coste de una imagen está ligado a lo difícil que fue. Con una tarifa fija, ese vínculo desaparece y el comportamiento racional cambia con él: dejas de optimizar los prompts por longitud y empiezas a usar el modelo tal como se diseñó para usarse, con el bucle agéntico y las imágenes de referencia haciendo su trabajo.

Es también el tipo de precios que solo puede ofrecer una empresa que sirve su propio modelo, algo que vale la pena mencionar cuando eliges un proveedor. OrcaRouter pone más de 200 modelos detrás de un único endpoint compatible con OpenAI al precio de lista del proveedor y sin margen alguno, con conmutación por error automática entre proveedores y un DSL de enrutamiento que compone varios modelos en una sola llamada. La propiedad relevante aquí es el traspaso directo: como cobramos el precio de lista del proveedor y no uno con margen, un cambio en los precios de un proveedor —la aparición de una tarifa fija, la bajada de una tarifa por token— se refleja en nuestro lado el mismo día en lugar de esperar a un contrato. Ni Meta Muse Image ni Qwen-Image 2.1 se encuentran entre los modelos que enrutamos hoy, y este artículo no va a insinuar lo contrario; los modelos de imagen que sí ofrecemos son la familia GPT-Image de OpenAI, los niveles de Imagen 4 de Google y las vistas previas de imagen de Gemini, y el endpoint de imagen Grok Imagine de xAI.

El contraste que importa en esta comparación es que uno de estos dos modelos tiene un precio, siquiera. Meta Muse Image cuesta $0.01 por imagen, publicado, en una API a la que puedes llamar esta misma tarde. Qwen-Image 2.1 cuesta una descarga de 33 GB, una GPU que ya tienes, y una revisión legal de una licencia que dice únicamente uso no comercial.

Donde convergen accidentalmente

Ambos modelos aceptan hasta 10 imágenes de referencia. No es tanto una coincidencia como el resultado de que el sector se haya decantado por una respuesta: diez son suficientes para una hoja de personaje, un conjunto de productos o un paquete de referencias de estilo, y a partir de ahí el condicionamiento deja de ayudar y empieza a estorbar. Meta publica una cifra del 94 % de consistencia de personaje con múltiples imágenes para su modelo; Alibaba no publica ninguna equivalente, y el único informe independiente de pruebas prácticas sugiere que la consistencia empieza a degradarse en torno a la tercera imagen de referencia. Dos modelos que afirman abarcar el mismo terreno con pruebas tras de sí radicalmente distintas: toda la comparación en miniatura.

También convergen en el problema que ninguno ha resuelto: ninguno te da ambas cosas. Meta Muse Image no se puede descargar, inspeccionar ni ejecutar en tu propio hardware, y su bucle agéntico es una caja negra por construcción. Qwen-Image 2.1 no se puede vender, no se puede invocar y todavía no se puede medir frente a nada. Si tu restricción es una fecha límite, uno de estos se puede usar hoy. Si tu restricción es una revisión de cumplimiento o la necesidad de entender exactamente qué está haciendo tu pipeline, el otro lo es.

Screenshot of the Artificial Analysis image-editing leaderboard captured September 9 2026, showing Meta Muse Image ranked third at Elo 1,105 behind MAI-Image-2.6 and GPT Image 2 (high), listed at $10.0 per 1,000 images on the quality-versus-price Pareto frontier, with no Qwen-Image 2.1 entry on the boardScreenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

Elige según lo que tengas que hacer a continuación, no por cuál es mejor.

Si necesitas lanzar la generación de imágenes este trimestre bajo una licencia comercial con un modelo medible detrás, Meta Muse Image es la respuesta y 0,01 $ por imagen es una cifra que puedes incluir en un presupuesto. Si necesitas entender un modelo de imágenes de principio a fin —el enmascaramiento de atención, el reescritor de prompts, el VAE, la licencia—, Qwen-Image 2.1 es el único de los dos que te lo permite, y está a una licencia de investigación de ser inservible para cualquier otra cosa. Ninguna de las dos opciones supone una concesión en cuanto a calidad, porque la cuestión de la calidad sigue abierta en uno de los lados. Se cerrará cuando suficientes personas ejecuten Qwen-Image 2.1 en público como para ponerlo en una tabla, y a los probadores de acceso anticipado se les pidió que publicaran antes del 29 de septiembre. Esa es la fecha en la que esta comparación se convierte en real.