
Qwen-Image-2.1 vs GPT Image 2: Descárgalo gratis o alquila el mejor
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen-Image-2.1 es una descarga de 33 GB que puedes ejecutar gratis y no puedes vender. GPT Image 2 es una API que no puedes descargar en absoluto, facturada por token, cuatro meses en producción y situada en lo más alto de las tablas de clasificación independientes de imágenes. Esos dos hechos son todo el intercambio, y la parte interesante es que la función de transparencia —lo que hace que Qwen-Image-2.1 merezca un vistazo en primer lugar— llegó a ambos sistemas con menos de un mes de diferencia entre sí por rutas completamente distintas. Qwen-Image-2.1 se lanzó el 20 de septiembre de 2026 con alfa integrado en su espacio latente. GPT Image 2 incorporó un background: "transparent" como parámetro el 20 de agosto de 2026, a modo de indicador de API.
Dos rutas hacia la misma función
La salida transparente es la razón por la que la mayoría de la gente acaba comparando estos dos, así que empieza por ahí, porque las implementaciones no son equivalentes y la diferencia importa más que la salida.
La transparencia de Qwen-Image-2.1 es arquitectónica. Un VAE RGBA de 64 canales con compresión espacial de 16× hace que el alfa forme parte del espacio latente en el que el modelo realiza la eliminación de ruido. El mismo mecanismo permite generar con transparencia, editar dentro de una imagen que ya tiene transparencia sin aplanarla y extraer un sujeto de una fotografía RGB corriente que devuelve alfa en lugar de una máscara binaria. Es una única capacidad con tres usos, y el propio planteamiento del proveedor es que no se necesita un nodo independiente de eliminación de fondos, un modelo de matting ni una pasada de limpieza de bordes.
La transparencia de GPT Image 2 es un parámetro de la solicitud. Añadir background: "transparent" junto con output_format: "png" devuelve una imagen con un canal alfa real, y funciona tanto en la generación de imágenes a partir de texto como en la edición de imágenes y en la herramienta de generación de imágenes de la API Responses. El inpainting basado en máscaras y los fondos transparentes se pueden combinar. Se lanzó en Preview, así que la propia guía de OpenAI indica que los resultados pueden ser inestables, y la edición con transparencia se describe como volver a dibujar o eliminar un fondo, más que como un recorte preciso de contornos. Al menos dos fuentes secundarias afirman que el parámetro no está disponible y que GPT Image 2 no genera transparencia en absoluto; estas contradicen la cobertura del anuncio, las réplicas de la documentación de la API y las pruebas de terceros, así que considéralas obsoletas o erróneas en lugar de una señal en contra. La transparencia no cambia el coste en tokens: para una calidad y un tamaño determinados, una imagen transparente y una opaca consumen los mismos tokens de imagen.
Así que ambos producen alpha. Uno lo hace porque el modelo se construyó así; el otro porque un parámetro se lo pide al servicio. Cuál es mejor depende enteramente de si el alpha tiene que sobrevivir a un bucle de edición, y eso se puede probar en una tarde.
Qué te aporta la ventaja inicial de GPT Image 2
Cuatro meses en producción no es un argumento de marketing, es una brecha de madurez, y se manifiesta en lugares que son aburridos y decisivos.
• Posición independiente — GPT Image 2 ocupa el primer puesto en las clasificaciones independientes de imágenes y lleva ahí el tiempo suficiente como para que eso sea una afirmación estable y no un pico de la semana de lanzamiento. Qwen-Image-2.1 estaba totalmente ausente de esas clasificaciones cuando se escribió esto.
• Modos de fallo documentados — un modelo con cuatro meses de uso público cuenta con un conjunto de casos de fallo conocidos que puedes consultar antes de toparte con ellos. Un modelo que se hizo público ayer tiene la ficha de evaluación de un proveedor y una única prueba de integración.
• Superficie operativa — límites de tasa por niveles expresados tanto en tokens por minuto como en imágenes por minuto (desde 100.000 TPM y 5 IPM en el nivel de entrada hasta 8.000.000 TPM y 250 IPM en el nivel superior), además de compatibilidad con el endpoint por lotes. Esa es la diferencia entre una demo y una cola que puedes dimensionar.
• Cifras de calidad de un tercero — la posición en la clasificación está medida de forma independiente. El único número de Qwen-Image-2.1 es el gráfico Qwen-Image-Bench del propio proveedor, donde marca 60,28 frente a Nano Banana 2.0 con 59,82 y GPT Image 1.5 con 59,65. Material del proveedor, no reproducido.
El único punto de datos genuinamente independiente sobre Qwen-Image-2.1 es la verificación funcional publicada con la integración de SGLang: la salida de PNG transparente pasó, el alfa se conservó en todo el rango de 0 a 255, la PSNR de RGBA midió 60,69 dB en una sola muestra y las configuraciones FP8 pasaron la generación de PNG transparente. Los autores de SGLang dicen explícitamente que esta es una comprobación de corrección y no una garantía de calidad general. Es la evidencia más sólida disponible de que el canal alfa es real. No dice nada sobre si las imágenes son buenas.
El proyecto de ley, tramitado
GPT Image 2 se factura por tokens, lo que significa que el costo de un recurso depende del nivel de calidad y la resolución de una manera que un precio por imagen oculta. Las tarifas de lista publicadas son $5.00 por millón de tokens de entrada de texto, $8.00 por millón de tokens de entrada de imagen y $30.00 por millón de tokens de salida de imagen, con tarifas en caché de $1.25 y $2.00, respectivamente. OpenAI no publica una tabla estática de tokens de salida para este modelo —la tabla anterior que abarca los recuentos de tokens Bajo, Medio y Alto está marcada explícitamente como no aplicable a GPT Image 2—, por lo que las cifras a continuación son mediciones de terceros de los precios de lista en una relación de aspecto 1:1, texto a imagen:
• Salida 1K — calidad baja $0.0059, media $0.053, alta $0.211 por imagen.
• Salida 2K — $0.012 baja, $0.107 media, $0.428 alta.
• Salida 4K — $0.020 baja, $0.178 media, $0.712 alta.
La diferencia entre calidad baja y alta a la misma resolución es de un factor de aproximadamente treinta y cinco. Esa es la decisión real dentro de un pipeline de GPT Image 2: no qué modelo, sino qué nivel de calidad supera la revisión al menor costo. Y interactúa con la edición de una manera que toma a la gente por sorpresa — input_fidelity no se puede ajustar en este modelo porque procesa cada entrada de imagen con alta fidelidad automáticamente, por lo que una solicitud de edición que incluya imágenes de referencia consume más tokens de entrada de imagen de los que estimarías a partir del tamaño de salida. Por lo tanto, los bucles de generar-inspeccionar-editar son más caros aquí de lo que sugieren las cifras por imagen.
Frente a eso, el coste marginal por imagen de Qwen-Image-2.1 es la electricidad. La pega es el coste fijo y la licencia. Hay que descargar treinta y tres gigabytes; un DiT ocupa unos 14 GB y el resto se destina al codificador de texto Qwen3-VL 8B; se recomienda el offload de CPU en tarjetas con recursos limitados; y todo ello bajo el Qwen Research License Agreement con fecha del 20 de septiembre de 2026 —solo para uso no comercial, con derechos comerciales mediante un acuerdo aparte y sin precio ni condiciones publicados para ellos.

Dónde se sitúa la opción alojada
Existe un camino intermedio que evita tanto la cuestión de la GPU como la de la licencia, y es el que la mayoría de los equipos toma en realidad. OrcaRouter enruta la familia GPT-Image de OpenAI junto con los niveles de Imagen 4 de Google y las vistas previas de imagen de Gemini y el endpoint de imágenes Grok Imagine de xAI — más de 200 modelos tras un único endpoint compatible con OpenAI, el precio de lista del proveedor repercutido sin margen alguno, conmutación por error automática entre proveedores, un DSL de enrutamiento y fusión de modelos. Como el precio de lista se repercute en lugar de aplicar un margen, una rebaja de precio de un proveedor en cualquier modelo enrutado está activa ese mismo día, y como la conmutación por error es automática, que un proveedor tenga una tarde mala no se convierte en tu caída del servicio. Qwen-Image-2.1 no está entre los modelos que enrutamos, y ninguna otra versión de Qwen-Image tampoco —es una propuesta únicamente local—, así que esto no es un discurso de venta del recién llegado. Es la respuesta honesta a «¿qué uso mientras evalúo al recién llegado?».

La decisión, expresada sin rodeos.
Elige GPT Image 2 si el resultado es comercial, si necesitas un umbral mínimo de calidad medido de forma independiente, si quieres costos por activo que puedas prever y limitar, o si necesitas que esto funcione esta semana sin comprar hardware. Acepta que estás alquilando, que no puedes ajustarlo, que no puedes ejecutarlo sin conexión y que el costo por imagen escala linealmente con el volumen para siempre.
Elige Qwen-Image-2.1 si el resultado es investigación, evaluación o trabajo personal, si quieres específicamente un alpha que sobreviva a un bucle de edición en lugar de un alpha que un parámetro produjo una sola vez, si quieres leer la lógica de reescritura — los checkpoints PE-T2I y PE-I2I publicados son modelos Qwen3.5-VL 9B con ajuste fino y un system_prompt.txt legible, lo cual es más de lo que obtienes de cualquier API de imágenes alojada — o si simplemente quieres saber qué puede hacer un modelo de imágenes de pesos abiertos de 7B en septiembre de 2026 sin pagar por imagen para descubrirlo.
No elijas ninguna de las dos y derívalo si el entregable es comercial y el plazo es real. Eso no es una escapatoria; es la opción que no te obliga a resolver una cuestión de licencias para la que todavía no puedes obtener respuesta.

