Una tarjeta hero generada con el titular Qwen-Image-2.1 vs GPT-Image-2.5, que muestra una tarjeta etiquetada Qwen-Image-2.1 con un icono de descarga y el texto 33 GB de pesos junto a una tarjeta etiquetada GPT-Image-2.5 con un icono de dial medidor y el texto facturado por token, con el pie de foto: uno se descarga, el otro se mide por uso.
Guides & Insights

Qwen-Image-2.1 vs GPT-Image-2.5: La diferencia es un solo número, y no es la calidad

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Pon Qwen-Image-2.1 y GPT-Image-2.5uno al lado del otro en las especificaciones y parecen hermanos: ambos son modelos de imagen unificados de generación y edición, ambos con salida de fondo transparente, ambos lanzados en las últimas cinco semanas, ambos capaces de imágenes fijas de clase 2K. La diferencia que decide la elección entre ellos es un solo número, y no es una puntuación de benchmark. Qwen-Image-2.1 es gratis para descargar e imposible de vender. GPT-Image-2.5 es imposible de descargar y trivial de vender. Todo lo demás —la arquitectura, la latencia, la implementación de transparencia— es consecuencia de eso. Qwen-Image-2.1 se publicó como código abierto el 20 de septiembre de 2026; GPT-Image-2.5 se anunció con sus modelos de API en funcionamiento el 8 de septiembre de 2026.

Dos formas de añadir transparencia, con un mes de diferencia

Que ambos modelos adquirieran salida transparente con apenas semanas de diferencia es una coincidencia que vale la pena entender, porque las dos implementaciones no son equivalentes.

Qwen-Image-2.1 pone el alfa dentro del modelo. Elimina el ruido en un espacio latente RGBA de 64 canales con una compresión espacial de 16×, por lo que el canal alfa es un componente de primera clase de lo que produce el muestreador. No hay paso de segmentación ni pase de matting. Junto a eso hay un extra inusual: como el modelo puede decidir por prompt si emitir RGB o una imagen con canal alfa, también puede extraer un sujeto de una fotografía normal y devolver una capa transparente en lugar de una máscara binaria.

GPT-Image-2.5 opta por la vía de los parámetros. La API de OpenAI acepta un ajuste background con valor auto, opaque o transparent, y el modelo responde en consecuencia. Se trata de un interruptor de capacidad en un endpoint alojado, y no de una propiedad del espacio latente, y además tiene la ventaja de que no piensas en ello: activas la opción, obtienes el recorte y sigues adelante. La contrapartida es que recibes lo que te da el endpoint, con la resolución y el coste que el endpoint decida.

Cuál de los dos es mejor sigue genuinamente sin resolverse. En el momento de escribir esto no existía ninguna comparación pública de los bordes alfa de Qwen-Image-2.1 frente a un modelo dedicado de matting, y la única comprobación publicada del lado de Qwen es funcional: la salida PNG transparente pasó, el alfa se conservó en todo el rango de 0–255, con un PSNR RGBA de 60,69 dB en una sola muestra. Eso es una comprobación de corrección, no un veredicto de calidad. Te dice que el canal es real.

Lo que realmente puedes medir

Parámetros — El componente de generación de Qwen-Image-2.1 es un transformer de difusión de flujo único de 7B y 32 capas, emparejado con un codificador de texto Qwen3-VL 8B; aproximadamente 33 GB de pesos en total, de los cuales el DiT representa unos 14 GB. OpenAI no publica un recuento de parámetros para GPT-Image-2.5.
Resolución — Qwen-Image-2.1 genera de forma nativa hasta 2048×2048 a 40 pasos de inferencia con siete ajustes preestablecidos de relación de aspecto. GPT-Image-2.5 acepta tamaños de hasta 3840×2160 y 2160×3840, con cada lado limitado a 3840 px y se requieren múltiplos de 16.
Imágenes de referencia — Qwen-Image-2.1 acepta hasta 10 para composición de múltiples sujetos y probador virtual. Los modelos de imagen de OpenAI aceptan entradas de referencia para edición, pero el límite práctico y el comportamiento de fidelidad difieren según el modelo y el nivel de calidad.
Latencia — SGLang-Diffusion publica 2,748 s para una generación de 1024×1024 y 40 pasos en una sola B200, y 4,74 s en una RTX 4090 de 24 GB con Cache-DiT y kernels INT8, solo denoising. OpenAI informa que la variante Flare de GPT-Image-2.5 tiene hasta un 50 % menos de latencia que GPT-Image-2, y uno de los socios de lanzamiento mide 2–4× —informado por el proveedor y por el socio, respectivamente, no es una comparación controlada.
Precio — Qwen-Image-2.1 no tiene precio alojado porque no hay endpoint alojado; el costo es tu propio tiempo de GPU. GPT-Image-2.5 factura a las mismas tarifas por tokens que GPT-Image-2: $8.00 por 1M de tokens de entrada de imagen, $30.00 por 1M de tokens de salida de imagen, $5.00 por 1M de tokens de entrada de texto.
Licencia — Qwen-Image-2.1 se distribuye bajo el Qwen Research License Agreement con fecha del 20 de septiembre de 2026, solo para uso no comercial. GPT-Image-2.5 es una API comercial con procedencia C2PA y una marca de agua invisible en las salidas.

Una fila de esa lista es más endeble de lo que parece. OpenAI no publica precios por imagen para GPT-Image-2.5, solo tarifas por token, y el consumo de tokens de imagen varía según la resolución y el nivel de calidad. Las mediciones de terceros sitúan el rango entre aproximadamente $0,0059 y $0,712 por imagen en 1K, 2K y 4K con ajustes bajo, medio y alto y una relación de aspecto 1:1; útil como orden de magnitud, no como cotización. Si vas a hacer una previsión, construye la estimación a partir del recuento de tokens y de tu propia distribución de prompts, no de una cifra por imagen que haya medido otra persona.

A generated two-column scoreboard titled Qwen-Image-2.1 vs GPT-Image-2.5 - the scoreboard. Left column Qwen-Image-2.1 rows: Generation component 7B DiT; Transparency native RGBA; Resolution 2048 x 2048 native; Reference images up to 10; Price self-hosted GPU time; Licence non-commercial research only. Right column GPT-Image-2.5 rows: Generation component undisclosed; Transparency API parameter; Resolution up to 3840 x 2160; Reference images per the editing API; Price 8 and 30 dollars per 1M tokens; Licence commercial, C2PA and watermark. Footer: Qwen figures per the vendor model card, unaudited; OpenAI figures per the vendor API reference.

Los dos costos que nadie pone en la misma columna

La razón por la que esta comparación no admite una respuesta sencilla es que los dos modelos te cobran en monedas distintas, y el tipo de cambio es tu propia situación.

GPT-Image-2.5 cobra por token, lo que significa que el medidor es visible, predecible y escala linealmente con el volumen. Eso es una ventaja genuina para un producto con tráfico conocido: puedes ponerlo en un presupuesto, y un recorte de precio del proveedor mueve tu costo el mismo día. También es un impuesto sobre la exploración, porque la décima iteración de un prompt cuesta lo mismo que la primera.input_fidelityhace que esto sea más marcado de lo que sugieren las tarifas principales: la API puede aplicar automáticamente alta fidelidad en las entradas de imagen, lo que consume más tokens de entrada de lo que implica una lectura casual de la lista de precios, así que los bucles de edición cuestan más que las cifras por imagen que la gente cita.

Qwen-Image-2.1 invierte ambas propiedades. El costo marginal de la centésima generación es la electricidad. Eso lo convierte en el mejor instrumento para iterar, para rellenar lotes y para cualquier cosa en la que todavía se esté descubriendo el prompt. Lo que no te da es un número para la hoja de cálculo financiera —estás pagando por una GPU, esté ocupada o inactiva—, y no te da el derecho de vender el resultado. El Qwen Research License Agreement permite la investigación y evaluación no comerciales, y establece que el despliegue comercial requiere una licencia aparte de Hangzhou Tongyi Laboratory Technology. No hay un precio publicado para esa licencia ni condiciones declaradas. Eso no es una nota al pie; para un pipeline comercial, es la decisión en su totalidad.

Ejecutando ambos sin un segundo contrato

La respuesta realista para la mayoría de los equipos no es ni lo uno ni lo otro: es ambas. GPT-Image-2.5 se encarga de la ruta de producción, en la que el resultado se entrega a un cliente y el medidor por token es una partida de la factura. Qwen-Image-2.1 se encarga de la ruta de exploración, en la que necesitas doscientas variantes de una toma de producto transparente y ningún proveedor te venderá ese volumen a un precio razonable.

La fricción está en que ambos llegan por caminos completamente distintos. Uno es una clave de API. El otro es una descarga de 33 GB, un entorno de Python y una GPU de tu propiedad. OrcaRouter cubre la mitad alojada: más de 200 modelos tras un único endpoint compatible con OpenAI, el precio de lista del proveedor transferido sin margen alguno, conmutación automática por fallo entre proveedores, un DSL de enrutamiento para expresar respaldos y fusión de modelos para combinar varios modelos en una sola llamada. Ser precisos con este modelo importa: hoy no enrutamos GPT-Image-2.5; nuestras rutas de imágenes de OpenAI son GPT-Image-2, GPT-Image-1.5 y GPT-Image-1-mini, todos al precio de lista de OpenAI, y el día que un proveedor upstream añada los identificadores gpt-image-2.5, la misma clave los llamará sin ningún cambio de código. Tampoco enrutamos ningún modelo Qwen-Image de ninguna versión, así que Qwen-Image-2.1 no es una ruta de nuestro lado en absoluto. Lo que el precio de transferencia te ofrece mientras tanto es que, cuando OpenAI mueve una tarifa, el número de nuestro lado se mueve con ella en lugar de ir con retraso.

El veredicto, expresado como una condición en lugar de un ganador.

Si el resultado tiene que venderse, no hay discusión: GPT-Image-2.5 es el único de los dos que tienes licencia para usar, y el medidor de tokens es el precio de eso. Si el resultado es investigación, herramientas internas o evaluación, Qwen-Image-2.1 es el instrumento más potente: 2K nativo, alfa directamente del muestreador, diez imágenes de referencia y un coste marginal de cero una vez que el hardware está pagado. Si necesitas ambos, ejecuta ambos, y trata la licencia como la frontera que decide en qué canal entra cada trabajo.

Dos cosas cambiarían esto. Una hoja de términos comerciales publicada para Qwen-Image-2.1 cerraría la brecha en la fila de la licencia, que actualmente hace la mayor parte del trabajo en esta comparación. Y una entrada independiente en la clasificación de imágenes para Qwen-Image-2.1 nos diría si el resultado de Qwen-Image-Bench del proveedor —60,28, por delante de Nano Banana 2.0 con 59,82 y de GPT Image 1.5 con 59,65, primero entre los modelos abiertos— se mantiene fuera del laboratorio que lo produjo. Ninguno de los dos existe todavía. Hasta que existan, la recomendación honesta es elegir con base en la licencia y el medidor, no en el marcador.

A screenshot of OrcaRouter's own model page for openai/gpt-image-2, captured September 21 2026, showing the model description as OpenAI's token-billed image model reached through the Images API, the /v1/images/generations endpoint, and the published list rates of $8.00 per 1M image input tokens and $30.00 per 1M image output tokens.A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.