Una tarjeta de título principal generada con el titular Qwen-Image-2.1 encabeza ambas arenas de imágenes, con el subtítulo Lo que oculta la etiqueta n.º 1 de código abierto, que muestra dos tarjetas de clasificación etiquetadas Image Edit Arena con un chip de clasificación que indica 16 de 56 y un chip de puntuación que indica 1367, y Text-to-Image Arena con un chip de clasificación que indica 17 de 79 y un chip de puntuación que indica 1228, sobre una etiqueta que dice licencia qwen-research.
Guides & Insights

Qwen-Image-2.1 lidera ambas arenas de imágenes: lo que esconde la etiqueta n.º 1 de código abierto

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El equipo detrás de Qwen-Image-2.1 agradeció a la Arena el reconocimiento, y el reconocimiento es real. Qwen-Image-2.1 es el modelo con la puntuación más alta en ambos tableros de imagen de la Arena que los tableros no etiquetan como Propietario: 1.367 en Edición de imagen y 1.228 en Texto a imagen, en la instantánea del 22 de septiembre de 2026. Cada fila por encima de él en ambos tableros lleva una etiqueta Propietario. Tres hechos que el anuncio no incluye son igual de verificables que la propia afirmación: el puesto general que compran esas puntuaciones, el Preliminar indicador con el que se publican ambas filas, y una cadena de licencia que dice qwen-research en lugar del Apache 2.0 de sus anteriores modelos de imagen. La afirmación resiste el contacto con los tableros. Simplemente dice menos de lo que implica el titular.

Leyendo los dos tableros uno al lado del otro

Las puntuaciones de Arena son valoraciones de estilo Elo construidas a partir de votos ciegos por pares: una persona ve dos salidas, no sabe qué modelo produjo cuál, y elige. Esa es una clase de evidencia categóricamente distinta de un benchmark de proveedor, por lo que una afirmación que se apoye en ella vale la pena verificarla en lugar de repetirla. Ambos tableros se capturaron el 22 de septiembre de 2026, y ambos se leyeron fila por fila en lugar de hojearse desde el gráfico de clasificación.

A screenshot of the LMArena Image Edit Arena leaderboard, captured September 22 2026, showing the board header reading 29,902,508 votes and 56 models, with ranks 13 to 22 visible: gemini-3-pro-image-preview at 1385, reve-2.1 at 1375, gpt-image-1.5-high-fidelity at 1370, qwen-image-2.1 at rank 16 with 1367 and a confidence interval of plus or minus 9 and 4,841 votes marked Preliminary, reve-2.0 at 1358, uni-1.1-max at 1334, grok-imagine-image at 1329, uni-1.1 at 1315, gemini-3.1-flash-lite-image at 1314 and qwen-image-2.0-pro-2026-06-22 at 1304, with every row above qwen-image-2.1 labelled Proprietary.

La tabla de clasificación de Image Edit enumera 56 modelos y 29.902.508 votos. Qwen-Image-2.1 ocupa el puesto 16 con una puntuación de 1.367, un intervalo de confianza de ±9 y 4.841 votos. Las quince filas por encima de él —desde gpt-image-2.5-sunburst con 1.526 hasta gpt-image-1.5-high-fidelity con 1.370— son todas propietarias. También lo son las dos filas inmediatamente debajo de él, reve-2.0 con 1.358 y uni-1.1-max con 1.334.

A screenshot of the LMArena Text-to-Image Arena leaderboard, captured September 22 2026, showing the board header reading 6,258,152 votes and 79 models, with ranks 14 to 21 visible: gemini-3-pro-image-2k at 1246, gpt-image-1.5-high-fidelity at 1239, gemini-3-pro-image-preview at 1232, qwen-image-2.1 at rank 17 with 1228 and a confidence interval of plus or minus 11 and 2,843 votes marked Preliminary, ideogram-4.0-quality at 1204 labelled Ideogram Open Model, qwen-image-2.0-pro-2026-06-22 at 1191, uni-1.1-max at 1188 and mai-image-2 at 1183, with Proprietary labelling on every row above qwen-image-2.1.

El tablero de Texto a Imagen del mismo día enumera 79 modelos y 6.258.152 votos. Qwen-Image-2.1 ocupa el puesto 17 con 1.228, con un intervalo de confianza de ±11 y 2.843 votos. El mismo patrón: las dieciséis filas por encima son Propietarias, y la primera fila no propietaria por debajo es ideogram-4.0-quality con 1.204, etiquetada como Ideogram Open Model.

Merece la pena destacar dos detalles de esas filas, porque van en contra de la forma en que normalmente se repite la afirmación.

La clasificación y la puntuación cuentan historias distintas — 1.367 es el mejor número no propietario del panel de edición de imágenes, y además ocupa el decimosexto puesto, a 159 puntos del líder y a 3 puntos del decimoquinto.
En un panel, gana el propio modelo cerrado de Alibaba — qwen-image-3.0-pro, etiquetado como Propietario, se sitúa en 1.254 en Texto a imagen, veintiséis puntos por encima del 1.228 de qwen-image-2.1. En el panel de edición, el modelo abierto supera al anterior propietario qwen-image-2.0-pro-2026-06-22, con 1.304. El campeón de la casa no es el mismo modelo en ambos paneles.
La distancia hasta el siguiente modelo abierto es amplia en un panel y estrecha en el otro — en Edición de imágenes, la siguiente fila no propietaria es hunyuan-image-3.0-instruct con 1.302, sesenta y cinco puntos por detrás; en Texto a imagen es ideogram-4.0-quality con 1.204, veinticuatro puntos por detrás.

La cadena de licencia está haciendo más trabajo que la clasificación.

Cada fila de Arena lleva una etiqueta de organización y licencia. La de Qwen-Image-2.1 dice Alibaba · qwen-research en ambas tablas. Esa no es la etiqueta Apache 2.0 de los modelos de imagen anteriores de Alibaba: qwen-image-edit con 1,241 y qwen-image-edit-2511 con 1,235 en la tabla de edición están etiquetados como Apache 2.0, al igual que qwen-image-2512 con 1,125 y qwen-image con 1,057 en Texto a Imagen. La publicación del blog del proveedor cierra el mismo círculo, publicando los pesos bajo el Qwen Research License Agreement con fecha del 20 de septiembre de 2026, que permite la investigación y la evaluación, pero no el uso comercial.

Así que la lectura honesta de «modelo de código abierto n.º 1» es más limitada de lo que parece. Según la propia división en dos bandos del ranking —Propietario, o no—, Qwen-Image-2.1 es el primero. Según la definición de código abierto de la OSI, que no acepta restricciones de campo de uso, no es código abierto en absoluto, y tampoco lo son la mayoría de los modelos con los que se lo compara: los mismos rankings incluyen filas etiquetadas como flux-non-commercial-license, tencent-hunyuan-community, krea-2-community-license y Ideogram Open Model. El filtro «Open Source» de la Arena es un interruptor burdo entre propietario y no propietario. Es útil. No es una revisión de licencias.

Esa distinción importa más aquí que los márgenes de dos puntos, porque es lo único que no puede cambiar con otra semana de votos. Si hoy quieres un modelo de imagen con licencia permisiva de esta familia, las filas de Apache 2.0 son qwen-image-edit y qwen-image-edit-2511 —ambos más antiguos, y ambos más de ciento veinte puntos por debajo en la misma tabla de edición (1.241 y 1.235 frente a 1.367). El modelo de imagen Qwen de etiqueta abierta con mejor puntuación y el modelo de imagen Qwen comercialmente utilizable no son la misma descarga.

Preliminar significa que el número todavía puede moverse.

Ambas filas de Qwen-Image-2.1 llevan el Preliminarymarcador del tablero, que la Arena aplica cuando una fila no ha acumulado suficientes votos para que la puntuación se considere definitiva. El motivo son los recuentos de votos: 4.841 votos frente a un total del tablero de 29.902.508 en Image Edit, y 2.843 frente a 6.258.152 en Text-to-Image. En comparación, las filas que la rodean tienen muchos más: gpt-image-1.5-high-fidelity tiene 589.013 votos en el tablero de edición, y qwen-image-2.0-pro-2026-06-22 tiene 307.705 en el tablero de Text-to-Image.

Un intervalo de confianza de ±9 y otro de ±11 en un modelo con tres días de antigüedad no es una señal de advertencia; es el aspecto que tiene un lanzamiento nuevo. Pero sí significa que el orden específico en la parte superior del nivel abierto puede cambiar a medida que se acumulan los votos, en particular en Texto a Imagen, donde el margen sobre la siguiente fila abierta es de veinticuatro puntos.

Qué es el modelo, según la propia hoja del proveedor

La propia descripción de Alibaba presenta un modelo unificado de texto a imagen y edición con un componente de generación visual de 7B parámetros construido a partir de 32 capas DiT Single-Stream, generación y edición nativas de imágenes transparentes, compatibilidad con hasta 10 imágenes de referencia y un límite de salida nativo de 2048×2048; la descarga completa del pipeline es de aproximadamente 33 GB. La compatibilidad con transparencia es el elemento menos común de esa lista; el panel de edición de Arena no parece medirlo de forma evidente, así que una clasificación en el panel no es evidencia ni a favor ni en contra de esa capacidad específica.

El benchmark principal del proveedor es Qwen-Image-Bench, donde se reporta que el modelo obtiene 60.28, por delante de Nano Banana 2.0 con 59.82 y de GPT Image 1.5 con 59.65. Esa es una evaluación realizada por el proveedor, sin reproducción por terceros, y los márgenes son inferiores a un punto: una diferencia que no sobreviviría a un cambio del conjunto de prompts. Vale la pena decirlo con claridad: los números de Arena mencionados arriba son votos de otras personas, y los números de Qwen-Image-Bench son de la propia Alibaba. No son el mismo tipo de evidencia y no deberían promediarse en una sola impresión del modelo.

El soporte de despliegue llegó con el lanzamiento en lugar de después: las integraciones desde el día cero para el modelo existen en ComfyUI, SGLang, vLLM-Omni, LightX2V y la biblioteca Diffusers, lo que significa que la pregunta práctica para la mayoría de los equipos no es si el modelo se puede servir, sino si el costo de servicio encaja.

Dónde acaba una afirmación como esta si necesitas una API de imágenes esta semana

Ser precisos sobre nuestra propia posición importa aquí. OrcaRouter no enruta Qwen-Image-2.1, ni ningún modelo Qwen-Image de ninguna versión. Si fueron las puntuaciones de Arena las que te convencieron, se puede acceder al modelo a través de la API del propio proveedor y varias plataformas de terceros, o como una descarga autoalojada — no a través de nosotros. No tenemos ninguna ruta de imagen Qwen que venderte, y el puesto en la tabla no es una razón para fingir lo contrario.

Lo que enrutamos es el resto del nivel de imágenes que clasifican esas tablas, y varias de las filas por encima de Qwen-Image-2.1 están en él. GPT-Image-2, GPT-Image-1.5 y GPT-Image-1-mini de OpenAI están disponibles, al igual que los niveles de Imagen 4 de Google y los endpoints de vista previa de imágenes de Gemini, y el endpoint de imágenes de Grok Imagine de xAI. Esa combinación es la respuesta práctica a una afirmación como esta. Si la Arena hubiera puesto un modelo abierto en la parte superior directamente, cambiar de modelo sería un cambio de código de una línea en una sola clave. No lo hizo: la parte superior de ambas tablas es propietaria, y la decisión interesante está entre una descarga con licencia de investigación y un endpoint alojado al que puedes llamar hoy.

Tres propiedades de la plataforma importan para esa decisión. El enrutamiento funciona sobre un único endpoint compatible con OpenAI a través de más de 200 modelos, así que comparar las filas alojadas entre sí no implica un segundo contrato ni un segundo SDK. El precio de lista del proveedor se repercute sin margen, lo que significa que un cambio de precio del proveedor llega a tu factura el mismo día en que se anuncia, en lugar de en la siguiente renovación de contrato. Y la conmutación por error automática entre proveedores significa que un modelo nuevo, con pocos votos, puede situarse detrás de uno consolidado en una cadena de respaldo en vez de convertirse en una dependencia de producción al tercer día, que es más o menos donde se encuentra Qwen-Image-2.1 ahora mismo.

La afirmación es cierta, y más tenue de lo que parece al leerla.

Lo que Alibaba publicó es verificable: en la instantánea del 22 de septiembre de 2026 de ambos tableros de imágenes de Arena, Qwen-Image-2.1 es el modelo con mejor puntuación que no lleva la etiqueta Proprietary. Lo que la publicación comprime es todo lo que matiza esa afirmación: decimosexto y decimoséptimo en la clasificación general, una puntuación preliminar basada en unos pocos miles de votos, y una licencia de investigación que ocupa el lugar de la licencia de código abierto que la frase evoca.

A generated scoreboard titled Qwen-Image-2.1 - the scoreboard, with rows reading Image Edit Arena score 1367 at rank 16 of 56, Text-to-Image Arena score 1228 at rank 17 of 79, row status Preliminary on both boards, licence qwen-research non-commercial, Apache 2.0 sibling qwen-image-edit at 1241, and vendor benchmark Qwen-Image-Bench 60.28 unreproduced, above a footer reading Arena figures per the LMArena boards captured September 22 2026; Qwen-Image-Bench figure vendor-reported, no third-party reproduction.

Nada de esto hace que el resultado sea pequeño. Ser la primera fila no propietaria en ambas tablas, tres días después del lanzamiento, es un verdadero cambio en dónde se sitúa el nivel abierto —los modelos de imagen Qwen con licencia permisiva que lo preceden quedan más de ciento veinte puntos por detrás en la misma tabla de edición. Simplemente no es la misma afirmación que “el mejor modelo de imagen de código abierto”, y la diferencia es una línea de licencia y una columna de clasificación que tardan alrededor de un minuto en comprobarse.