
Qwen-Image-2.1 vs Gemini Omni 1.1 Flash: Uno devuelve un PNG, el otro no puede
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Lo más útil que hay que saber sobre Qwen-Image-2.1 y Gemini Omni 1.1 Flash es que no compiten entre sí. Si le pides una imagen fija a Gemini Omni 1.1 Flash, obtienes un error: la propia documentación del proveedor incluye la generación de imágenes, la edición de imágenes y la salida intercalada de imagen y texto entre las capacidades no compatibles del modelo. Si le pides un vídeo a Qwen-Image-2.1, obtienes una imagen fija de 2048×2048 con canal alfa. Cualquier tabla comparativa que los coloque en dos columnas está comparando una cámara con un proyector. La verdadera pregunta —la que de verdad cuesta dinero— es qué ocurre cuando los encadenas, y si la cadena sobrevive al contacto con la tarifa. Qwen-Image-2.1 se hizo público el 20 de septiembre de 2026; Gemini Omni 1.1 Flash está disponible de forma general desde el 27 de agosto de 2026.
Lo que cada modelo devuelve físicamente
Esta es la comparación completa, y todo lo demás se deriva de ella.
• Formato de salida — Qwen-Image-2.1 devuelve una imagen fija, de hasta 2048×2048 de forma nativa con 40 pasos de inferencia, opcionalmente con un canal alfa real; Gemini Omni 1.1 Flash devuelve video, de hasta 40 segundos ensamblado a partir de llamadas de generación y extensión de 10 segundos, y sin modo de imagen fija en absoluto.
• Transparencia — Qwen-Image-2.1 aplica eliminación de ruido en un espacio latente RGBA de 64 canales, por lo que el alfa sale del muestreador; Gemini Omni 1.1 Flash no tiene salida con fondo transparente, y solicitarla falla.
• Entrada de referencia — Qwen-Image-2.1 acepta hasta 10 imágenes de referencia para composición con múltiples sujetos; Gemini Omni 1.1 Flash acepta hasta 10 imágenes por prompt como *entrada* y hasta tres clips de video de referencia de 3 segundos.
• Límite de resolución — Qwen-Image-2.1 es 2K nativa; Gemini Omni 1.1 Flash ofrece 360p, 720p, 1080p y 4K, pero 1080p y 4K son reescalados de un render nativo de 720p en lugar de generaciones nativas.
• Cuánto cuesta — Qwen-Image-2.1 no tiene precio alojado porque no hay endpoint alojado, así que el costo es tu propio tiempo de GPU; Gemini Omni 1.1 Flash cobra $0.10 por segundo a 720p, con un nivel de borrador de 360p de alrededor de $0.03 por segundo.
• Licencia — Qwen-Image-2.1 se distribuye bajo el Acuerdo de Licencia de Investigación de Qwen con fecha 20 de septiembre de 2026, solo para uso no comercial; Gemini Omni 1.1 Flash es una API comercial cuya salida incluye procedencia de SynthID y C2PA de forma predeterminada.
La última fila es la que la gente pasa por alto. Por un lado, tienes un modelo que puedes descargar y no puedes vender. Por el otro, un modelo que no puedes descargar y puedes vender libremente — con una marca de agua invisible en cada fotograma.
¿Por qué el encuadre de «versus» sigue apareciendo de todos modos?
Busca los dos nombres juntos y encontrarás páginas que los comparan frente a frente. La razón es que la pregunta de fondo es real aunque el enfoque esté equivocado: ambos modelos ocupan el mismo flujo creativo, y ambos son lo más nuevo dentro de él. Lo que la gente intenta decidir en realidad es dónde termina la imagen fija y dónde empieza el movimiento.
Gemini Omni 1.1 Flash se ganó su lugar en esa cuestión con cifras independientes en lugar de las de los proveedores. En Artificial Analysis ocupó el primer puesto tanto en la arena de texto a video como en la de imagen a video en la categoría sin audio a fecha de 2 de septiembre de 2026, con Elo 1324 y 1364. Con el audio habilitado, baja a Elo 1237 y 1180: segundo y cuarto. Esa brecha de audio es el tipo de detalle que una hoja de especificaciones oculta y una tabla de clasificación expone.
La evidencia de Qwen-Image-2.1 es más escasa y de un tipo diferente. El propio Qwen-Image-Bench del proveedor lo sitúa en 60,28, por delante de Nano Banana 2.0 con 59,82 y de GPT Image 1.5 con 59,65, y primero entre los modelos abiertos, pero es una prueba comparativa ejecutada por el proveedor con márgenes inferiores a un punto, y no es una reproducción de terceros. Las pruebas independientes hasta ahora consisten en una ronda puntuada por humanos de GenAI Showdown con 7/15, una mejora desde 4/15 del Qwen-Image original y por detrás del 8/15 de Ideogram 4. El modelo no figuraba en los rankings de imágenes de Artificial Analysis en el momento de redactar este texto. No es una puntuación baja: es que no hay puntuación.


El traspaso, y lo que realmente cuesta
Si estás construyendo algo que necesita tanto una imagen fija como un clip, el flujo de trabajo es en una sola dirección: Qwen-Image-2.1 crea el fotograma y Gemini Omni 1.1 Flash lo anima. Lo contrario no existe.
La aritmética es implacable una vez que haces los cálculos. Un clip de 10 segundos en 720p con Gemini Omni 1.1 Flash factura alrededor de $1.00. En el nivel de borrador de 360p, esos mismos 10 segundos cuestan aproximadamente $0.30, y una escena completa de 40 segundos en 720p —una generación más tres llamadas de extensión— ronda los $4.00. Mientras tanto, la imagen fija que da origen a todo no cuesta más que la electricidad de tu propia tarjeta gráfica. Lo que significa que la decisión de costo interesante no es "qué modelo", sino "cuántas tomas". Con una imagen fija puedes iterar gratis; con un video, no. Los equipos que presupuestan la generación de video por activo en lugar de por intento son los que se llevan sorpresas, porque el primer fotograma es gratis y los reintentos no.
También hay una trampa de calidad en el traspaso. Gemini Omni 1.1 Flash renderiza de forma nativa a 720p y escala a 1080p y 4K. Si tu imagen fija es un fotograma de 2048×2048 de Qwen-Image-2.1 con un canal alfa limpio, introducirla en una ruta de vídeo que renderiza a 720p y escala descarta la mayor parte de lo que te dio el modelo de imagen —y el canal alfa se descarta por completo, porque no existe una salida de vídeo transparente. La transparencia sobrevive en el compositor, no en la cadena de modelos. Planifica la composición después de que vuelva el clip, no antes.
Dónde encaja la capa de enrutamiento
La parte incómoda de esta combinación es que no se puede acceder a ninguno de los modelos de la forma en que probablemente se accede al resto de tu stack. Gemini Omni 1.1 Flash es una API de proveedor con su propia clave y su propio contador por segundo. Qwen-Image-2.1 es una descarga de aproximadamente 33 GB —un transformador de difusión de 7B más un codificador de texto Qwen3-VL 8B— que ejecutas por tu cuenta, bajo una licencia que solo permite el uso no comercial. Dos modelos de facturación, dos rutas de acceso, un proyecto.
OrcaRouter existe exactamente para la superficie circundante: un endpoint compatible con OpenAI en más de 200 modelos, precio de lista del proveedor pasado sin margen de beneficio, conmutación por error automática entre proveedores, un DSL de enrutamiento para componer respaldos, y fusión de modelos para llamadas tipo panel. Ser precisos sobre lo que eso cubre aquí importa. No enrutamos ningún modelo Qwen-Image de ninguna versión, por lo que Qwen-Image-2.1 no es una ruta que puedas llamar de nuestro lado — se ejecuta en tu hardware o no se ejecuta en absoluto. Tampoco enrutamos Gemini Omni 1.1 Flash. Lo que sí ofrecemos en el lado del movimiento es la línea de video de Kling, incluyendo kling-v3, kling-v3-omni y kling-video-o1, además de MiniMax H3 — así que la mitad de animación de este pipeline tiene una ruta alojada que no requiere un segundo contrato con proveedor, y en el lado de imágenes ofrecemos la familia OpenAI GPT-Image, los niveles de Imagen 4 de Google y las vistas previas de imágenes de Gemini, y el endpoint de imágenes Grok Imagine de xAI. Debido a que el precio de lista se pasa tal cual en lugar de aplicar un margen, un recorte de precio de un proveedor en cualquiera de ellos está activo aquí el mismo día.
Cuál realmente necesitas
• Necesitas recursos, no metraje — Qwen-Image-2.1, y el canal alfa es la razón. Los recortes transparentes de productos, los iconos, los sprites y las composiciones por capas son donde un sampler que emite RGBA te ahorra todo un pipeline de matting.
• Necesitas movimiento, y necesitas medirlo — Gemini Omni 1.1 Flash. Es el único de los dos con resultados independientes de arena en lo más alto de una tabla de clasificación, y el único con un precio por segundo publicado que puedes incluir en un pronóstico.
• Necesitas ambos — presupuesta la mitad de vídeo por intento, no por recurso, y no des por hecho que el canal alfa llegue intacto.
• Necesitas vender el resultado — Gemini Omni 1.1 Flash, y solo Gemini Omni 1.1 Flash, hasta que Qwen publique términos comerciales para Qwen-Image-2.1. Hoy no existe un precio publicado ni una hoja de términos para esa licencia.
El resumen honesto es que la comparación que los clasifica es el artefacto equivocado. Lo que vale la pena observar a continuación es si Qwen asocia condiciones comerciales a Qwen-Image-2.1, y si Google cierra la brecha de audio en las tablas de clasificación de Omni — esos dos hechos, y no otro marcador, deciden qué mitad de este pipeline recibe el presupuesto.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
