
Qwen-Image-2.1 vs Grok Imagine Image 2.0: pesos gratuitos frente a un entorno de pago
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Uno de ellos no cuesta nada por imagen y viene con una licencia que prohíbe vender el resultado. El otro cuesta entre dos y seis centavos por imagen según dónde lo compres, no tiene esa restricción y aparece clasificado en las tablas que realmente puedes consultar. Qwen-Image-2.1se hizo público el 20 de septiembre de 2026 como pesos abiertos bajo una licencia de investigación. Grok Imagine Image 2.0es el endpoint de imágenes de pago del proveedor, distribuido a través de su propia API y de una variedad de proveedores externos. La elección entre ambos no es cuestión de calidad — es si quieres ser dueño del modelo o alquilar el entorno que lo rodea, y el entorno hace más trabajo del que sugiere el precio.
Lo que cuesta una imagen en cada lado
El precio de Qwen-Image-2.1 es cero por imagen y distinto de cero una sola vez. Descargas unos 33 GB —un transformer de difusión de flujo único de 7B y 32 capas de unos 14 GB, más un codificador de texto Qwen3-VL 8B que se lleva la mayor parte del resto— y, a partir de ahí, el coste marginal de una imagen es la electricidad para ejecutarla. En una tarjeta con recursos limitados, la ficha del modelo recomienda la descarga a CPU mediante pipe.enable_model_cpu_offload(), que es la vía de escape estándar y te cuesta velocidad en lugar de dinero.
El precio de Grok Imagine Image 2.0 tiene la forma opuesta. La propia documentación de xAI incluye el modelo insignia a $0.04 por imagen de salida, con el endpoint base de imágenes de Grok Imagine a $0.02 y el nivel de calidad a $0.05. Los proveedores externos se sitúan en una franja similar con sus propios niveles: uno indica tarifas fijas de $0.05 para texto a imagen y $0.06 para edición, independientemente de la resolución o el ajuste de calidad; otro cotiza $0.045 fijos tanto en 1K como en 2K para su nivel de calidad; y un tercero anuncia $0.025 para texto a imagen o edición con referencia con hasta cinco imágenes de entrada. En todo el mercado, esto se sitúa aproximadamente entre $0.02 y $0.06 por imagen, con el acceso para consumidores incluido en X Premium y SuperGrok en lugar de facturarse por imagen.
• Modelo de costos — Qwen-Image-2.1 es un costo fijo de hardware y descarga con un costo marginal cero por imagen; Grok Imagine Image 2.0 es puramente marginal y escala linealmente con el volumen para siempre.
• Punto de equilibrio — el punto de cruce es una cuestión de volumen que puedes calcular, y se mueve cada vez que un proveedor cambia una tarifa. Con unos pocos miles de imágenes al mes, la ruta alojada es trivialmente más barata que comprar una GPU; con un volumen alto y sostenido, la ruta local gana en costo y pierde en todos los demás aspectos.
• Lo que no puedes comprar del lado local — los límites de velocidad, el tiempo de actividad y el equipo de operaciones de otra persona. Lo que no puedes comprar del lado alojado son los pesos.
Lo que dicen las tablas de clasificación, y lo que no
Grok Imagine Image 2.0 tiene afirmaciones de clasificación públicas. El material de lanzamiento de xAI citó el segundo puesto general tanto en las tablas de Text-to-Image como de Image Edit Arena con fecha del 7 de agosto de 2026, por detrás de GPT Image 2; se trata de una instantánea citada por el proveedor y con marca temporal, y como tal debe interpretarse. Los rastreadores de terceros, en las semanas posteriores, lo situaron en torno al segundo puesto en edición de imágenes y al tercero en texto a imagen, de nuevo por detrás de GPT Image 2, con cifras de Elo en la zona baja de los 1.300 y algunos sitios de seguimiento que reportaban valores más cercanos a 1.173–1.175. La diferencia entre esas cifras es en sí misma la lección: las posiciones en las tablas de clasificación de esta categoría cambian de una semana a otra, y una clasificación sin fecha adjunta no es información.
Qwen-Image-2.1 no tiene ninguna clasificación en absoluto. Estaba ausente de las tablas de clasificación independientes de imágenes cuando se escribió esto. Su única cifra de calidad es el gráfico Qwen-Image-Bench del propio proveedor, donde marca 60,28 frente a Nano Banana 2.0 con 59,82 y GPT Image 1.5 con 59,65 —material del proveedor, no reproducido por ningún tercero—. El único dato genuinamente independiente es la verificación funcional publicada junto con el trabajo de integración de SGLang: la salida PNG transparente pasó, el alfa se conservó en el rango completo de 0–255, y el PSNR de RGBA midió 60,69 dB en una sola muestra que los autores describen explícitamente como una comprobación de correctitud en lugar de una garantía de calidad.
Así que el marcador honesto es: un modelo tiene un ranking público que cambia y una afirmación de proveedor vinculada a él, y el otro tiene una tarjeta de puntuación de proveedor y una prueba de integración superada. Eso no es una comparación, y ningún artículo que afirme lo contrario ha ejecutado ambos.

Alpha, y por qué es la única asimetría técnica
La transparencia de Qwen-Image-2.1 está integrada en el modelo. Un VAE RGBA de 64 canales con compresión espacial de 16× hace que el canal alfa forme parte del espacio latente que se somete a eliminación de ruido, lo que te da tres cosas a partir de un solo mecanismo: generación con transparencia, edición dentro de una imagen que ya tiene transparencia sin aplanarla primero, y extracción de sujeto a partir de una fotografía RGB común que devuelve alfa en lugar de una máscara dura. Sin nodo de eliminación de fondo, sin modelo de matting, sin limpieza de bordes: esa es la afirmación del proveedor, y la verificación funcional de SGLang es la única evidencia independiente de que el canal es real y no nominal.
Grok Imagine Image 2.0 no tiene equivalente documentado. Su superficie publicada es de texto a imagen y edición basada en referencias, con niveles de resolución y calidad, y hasta cinco imágenes de entrada en algunos proveedores. Si tu recurso necesita un sujeto recortado con bordes semitransparentes limpios —pelo, cristal, humo—, estás añadiendo un paso de matting del lado de Grok y no del lado de Qwen. Que ese paso cueste más que el quebradero de cabeza con las licencias del otro lado es la verdadera cuestión de ingeniería, y depende del tipo de contenido.
Un entorno de edición frente a un punto de control
Los dos sistemas discrepan sobre dónde debería residir la inteligencia de edición.
Grok Imagine Image 2.0 lo pone en el servicio. Envías una imagen de referencia y una instrucción, el proveedor decide qué significa eso, y los niveles de resolución y calidad se eligen por solicitud. No hay nada que leer, nada que ajustar y nada que romper, lo cual es una ventaja genuina para un equipo que no quiere ser dueño de un pipeline de diffusers. También es la razón por la que el precio varía según el proveedor para lo que nominalmente es el mismo modelo: estás comprando un entorno, no solo pesos.
Qwen-Image-2.1 lo incluye en checkpoints que puedes inspeccionar. Junto con el modelo de imágenes, incluye dos modelos de reescritura de prompts —PE-T2I y PE-I2I, cada uno un Qwen3.5-VL 9B ajustado, de unos 18,8 GB—, con el código de reescritura en una carpeta prompt_rewrite/ y un system_prompt.txt incluido que especifica, entre otras cosas, cómo se elige el idioma del texto renderizado. Eso es un nivel de inspeccionabilidad que ninguna API de imágenes alojada ofrece. También son 37,6 GB de reescritor adicionales sobre el modelo, lo cual es un costo real en disco y tiempo de carga para un componente que la mayoría de los pipelines tratará como opcional.
• Superficie de edición — Qwen-Image-2.1 admite ediciones locales mediante círculo, anotación pintada o una máscara separada, además de edición de capas transparentes y extracción de sujetos; la edición documentada de Grok Imagine Image 2.0 está basada en imágenes de referencia.
• Entradas de referencia — Qwen-Image-2.1 acepta hasta 10 imágenes de referencia, y un revisor de acceso anticipado informó que la consistencia con múltiples referencias se degrada a partir de aproximadamente tres imágenes; varios proveedores de Grok documentan hasta cinco imágenes de entrada.
• Resolución nativa — Qwen-Image-2.1 genera de forma nativa a 2K, con 2048×2048 como valor predeterminado en 40 pasos y siete preajustes de aspecto; la resolución de Grok Imagine Image 2.0 es una elección por solicitud con precio según el proveedor.
Distribución y la licencia
Aquí es donde ambos divergen con mayor nitidez, y no es en absoluto una diferencia técnica.
Grok Imagine Image 2.0 está disponible a través de la API de xAI y de múltiples proveedores externos independientes, lo que implica competencia de precios, lo que significa que la tarifa que pagas es una tarifa de mercado y no una tarifa de catálogo. No hay nada que descargar, ni GPU, ni archivo de licencia que leer, ni restricciones de uso comercial más allá de los propios términos del proveedor.
Qwen-Image-2.1 está disponible de una sola forma: descargándolo. Se distribuye bajo el Qwen Research License Agreement con fecha del 20 de septiembre de 2026, que otorga derechos únicamente para fines no comerciales y establece que el uso comercial requiere una licencia aparte que debe solicitarse al proveedor. Eso supone un endurecimiento respecto de la línea anterior de Qwen-Image, que se distribuía bajo Apache 2.0, y es el único hecho que decide la mayoría de las decisiones reales entre estas dos. Un estudio que las compara por la calidad de los resultados está respondiendo la pregunta equivocada; el estudio que no puede usar Qwen-Image-2.1 para trabajos de clientes no las está comparando en absoluto.
OrcaRouter es donde vive el lado alquilado de ese arreglo. Enrutamos más de 200 modelos detrás de un único endpoint compatible con OpenAI al precio de lista del proveedor y sin ningún margen, con conmutación por error automática entre proveedores, un DSL de enrutamiento y fusión de modelos, de modo que una ruta de imagen puede indicar un primario y un respaldo en lugar de apostarlo todo al rendimiento de un proveedor esa tarde. Enrutamos el endpoint de imagen xAI Grok Imagine, pero atención a la versión: nuestro catálogo incluye grok/grok-imagine-image, no Grok Imagine Image 2.0, así que el modelo más reciente no es algo que podamos servirle actualmente. Tampoco enrutamos ningún modelo Qwen-Image de ninguna versión, por lo que Qwen-Image-2.1 es solo local. La línea de imágenes enrutadas que sí ofrecemos es la familia GPT-Image de OpenAI, los niveles de Imagen 4 de Google y las vistas previas de imagen de Gemini, y ese endpoint de imagen Grok Imagine más antiguo; como el precio de lista se transfiere en lugar de aplicar un margen, un recorte de precio del proveedor en cualquiera de ellos está activo el mismo día.

¿Qué cambiaría esta respuesta?
Tres cosas, y las tres son plausibles dentro de un trimestre.
• Una licencia comercial para Qwen-Image-2.1. Si el proveedor publica términos a un precio que un estudio esté dispuesto a pagar, la ventaja de la transparencia y el costo marginal cero se vuelven utilizables en el trabajo comercial, y esta comparación cambia de forma por completo. Hoy no hay ningún precio publicado ni términos declarados.
• Un benchmark independiente de Qwen-Image-2.1. Un tercero que reproduzca las cifras de Qwen-Image-Bench del proveedor, o que coloque el modelo en un tablero de imágenes público, convertiría la única pregunta abierta que queda — ¿es realmente bueno? — en una pregunta resuelta.
• Un movimiento de precios por parte de Grok. La competencia entre proveedores ya ha producido una horquilla de $0.02 a $0.06 para nominalmente el mismo modelo. Un recorte duradero haría que la ruta alojada sea la predeterminada para más bandas de volumen de las que lo es actualmente.
Hasta que llegue uno de esos, el desempate no es la calidad ni el precio. Es si necesitas alpha y puedes vivir con una licencia no comercial, en cuyo caso lo descargas y pagas en hardware; o si necesitas lanzar y quieres que otro ejecute el modelo, en cuyo caso pagas por imagen y nunca vuelves a pensar en un VAE.

