Una tarjeta hero generada titulada 'Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash' bajo el antetítulo 'Cara a cara: dos trabajos diferentes', con el subtítulo 'Una lee una hora de metraje. La otra genera cuarenta segundos de él.' y cuatro chips: 'Solapamiento: comprensión de vídeo', 'Entrada: audio + vídeo vs prompt', 'Salida: texto vs vídeo', 'Enrutable aquí: ninguna'. El logotipo de OrcaRouter está integrado en la esquina inferior derecha.
Guides & Insights

Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash: Uno ve el vídeo, el otro lo crea

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Respuesta corta: estos dos no son sustitutos, y la comparación solo tiene sentido cuando dejas de tratar «omni» como una categoría. Qwen3.8-Omni-Flash, que el proveedor abrió a los clientes de la API el 18 de septiembre de 2026, acepta texto, imagen, audio y vídeo y devuelve texto: es un modelo para leer una hora de reunión o de metraje y contarte qué pasó. Gemini Omni 1.1 Flash, que el proveedor lanzó el 27 de agosto de 2026, acepta un prompt de texto o de imagen y devuelve vídeo con audio sincronizado: es un modelo para crear el metraje. Uno consume medios, el otro los produce. Si tu pipeline necesita ambos, necesitas ambos, y la pregunta honesta no es cuál gana, sino de cuál careces en realidad.

Ninguno de los dos modelos es de pesos abiertos, ninguno es enrutable a través de OrcaRouter, y ambos tienen precios en ejes que no pueden convertirse entre sí: tokens por un lado, segundos de video generado por el otro. Donde realmente se superponen es más estrecho de lo que sugiere el enfoque de "omni vs omni", y vale la pena precisar esa superposición antes de la aritmética de precios, porque la aritmética de precios es donde ambos se comparan incorrectamente con más frecuencia.

El error de categoría que vale la pena aclarar primero

Los materiales de lanzamiento de Alibaba comparan el Qwen3.8-Omni-Flash con el Gemini 3.8 Flash, y gran parte de la cobertura que siguió lo resumió en «supera a Gemini». Ese es un modelo de Google distinto del Gemini Omni 1.1 Flash, y los dos no son puntos de referencia intercambiables: Gemini 3.8 Flash es el modelo multimodal de propósito general, y Gemini Omni 1.1 Flash es el modelo de generación de vídeo, con una lista de precios aparte y una superficie de API distinta. Todas las cifras de Qwen frente a Gemini que circulan desde el lanzamiento —WildClawBench-MM 71,0 frente a 58,9; SpotSoundBench 67,2 frente a 39,7; AgenticVBench 36,8 frente a 45,0— corresponden a Gemini 3.8 Flash, no al modelo de vídeo Omni, y ninguna de ellas es independiente en cualquier caso. Si has llegado hasta aquí con una tabla de puntuaciones que sitúa a los dos modelos de este artículo en el mismo eje, es casi seguro que el modelo de Google de la columna de la derecha es el equivocado.

Lo que realmente hace cada uno

• Qué acepta como entrada — Qwen3.8-Omni-Flash acepta texto, imagen, audio y video, incluidos audio estéreo y espacial de cuatro canales; Gemini Omni 1.1 Flash acepta prompts de texto e imagen además de hasta tres segundos de video de referencia.

• Lo que devuelve: Qwen3.8-Omni-Flash devuelve solo texto; Gemini Omni 1.1 Flash devuelve video con audio sincronizado de forma nativa, en escenas ampliables hasta 40 segundos en incrementos de diez segundos.

• Superficie de control — Qwen3.8-Omni-Flash expone contexto, muestreo y un modo agéntico que decide por sí mismo qué mirar; Gemini Omni 1.1 Flash expone control de primer y último fotograma, una ventana retrospectiva de diez segundos para la continuidad, y un nivel de borrador de 360p que Google describe como aproximadamente un tercio del coste y cerca de un 60% más rápido.

• Resolución y acabado — Qwen3.8-Omni-Flash no tiene resolución de salida porque no produce contenido multimedia; Gemini Omni 1.1 Flash ofrece salida en 720p, 1080p y 4K.

• Contexto y duración — Qwen3.8-Omni-Flash admite un millón de tokens y hasta una hora de audio y vídeo continuos en una sola llamada; Gemini Omni 1.1 Flash está limitado por el clip que genera, no por una ventana de entrada.

• Cómo pagas — Qwen3.8-Omni-Flash se factura por token: $0.15 por millón de entrada, $0.016 en caché, $0.47 de salida en la lista internacional; Gemini Omni 1.1 Flash se factura por segundo de vídeo generado, con la tarifa publicada de Google de $0.10 por segundo para 720p.

• Apertura — cerrada por ambos lados. No hay pesos para ninguno de los dos modelos, y ninguno de los dos está disponible para enrutar a través de nuestra API hoy.

A generated two-column scoreboard titled 'Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash - the scoreboard'. Six shared dimension labels, left column Qwen3.8-Omni-Flash: 'Input: text, image, audio, video', 'Output: text only', 'Context: 1M tokens', 'Max media: 1 hour per call', 'Billing: per token', 'Price: $0.15 / $0.47 per M'; right column Gemini Omni 1.1 Flash: 'Input: text and image prompts', 'Output: video with audio', 'Context: clip-bound', 'Max media: 40s scenes', 'Billing: per second', 'Price: $0.10 per second at 720p'. The footer reads 'Qwen figures vendor-reported; Google rates per its published list.' The OrcaRouter logo is composited in the bottom-right corner.

El solapamiento es la comprensión de video, y es asimétrico

El único lugar donde un comprador podría ponerlos razonablemente uno junto al otro es un pipeline que tenga que tanto entender el material como producirlo; por ejemplo, un asistente de edición que lee una grabación larga, encuentra los momentos que vale la pena conservar y genera un corte. En la parte de comprensión, Qwen3.8-Omni-Flash está diseñado exactamente para esto: una hora de audio y video continuos por llamada, separación de hablantes y un modo agéntico que eleva la precisión en OmniVideoBench del proveedor de 63,4 a 67,8, a la vez que reduce los tokens por consulta de 145.736 a 79.117. En la parte de producción, Gemini Omni 1.1 Flash es el que puede generar el clip resultante con audio sincronizado, y el modelo de Qwen no puede producir ni un fotograma de video.

La asimetría también funciona en sentido contrario, y es más fácil pasarla por alto. El dominio de la comprensión que tiene un modelo de generación de video es instrumental: necesita suficiente de una escena para mantener un plano consistente a lo largo de una extensión de diez segundos, lo cual es un requisito distinto de responder una pregunta sobre lo que se dijo en la tercera hora de una reunión. El modelo de Google tiene el historial más largo en calidad de generación y el más corto en análisis de formato largo; el de Alibaba tiene lo contrario. Si tu tarea es «encontrar los tres minutos que importan en esta grabación», el modelo de generación no es la herramienta adecuada. Si tu tarea es «producir un clip de treinta segundos que coincida con este brief», el modelo de comprensión tampoco es la herramienta adecuada.

Por qué la comparación de precios sigue saliendo mal

Una tarifa por segundo y una tarifa por token no se convierten entre sí, y el intento de convertirlas produce los dos errores que dominan este enfrentamiento. El primero es comparar un clip generado completo con una tarifa de entrada por token y concluir que el modelo de video es cientos de veces más caro, lo cual es cierto y carece de sentido, porque no están vendiendo lo mismo. El segundo es comparar solo los precios de entrada y pasar por alto que el recorte de audio del 98% de Alibaba se aplica a las horas de audio de entrada, mientras que la tarifa de Google se aplica a los segundos de video de salida, de modo que los dos «recortes» ni siquiera están del mismo lado del medidor.

Lo que puede decirse con honestidad es esto. Según la propia metodología de Alibaba —una muestra de dos minutos multiplicada por treinta, vídeo a 720p y un fotograma por segundo—, una hora de entrada combinada de audio y vídeo a Qwen3.8-Omni-Flash se cotiza en unos $0,20, frente a los $3,27 de la generación anterior. Generar cuarenta segundos de vídeo a 720p con Gemini Omni 1.1 Flash a los $0,10 por segundo publicados por Google cuesta $4,00, y generar un borrador de los mismos cuarenta segundos a 360p se acerca a $1,20 según el criterio de Google de un tercio del coste. Ambas cifras las reportan los proveedores y ninguna se ha reproducido de forma independiente. La conclusión útil no es qué número es menor, sino que analizar una hora de metraje y generar cuarenta segundos de él se sitúan en el mismo orden de magnitud, que es la verdadera razón por la que una cadena de producción que hace ambas cosas necesita un modelo de costes, no un ganador.

Ese es también el argumento para mantener los dos en una sola clave en lugar de dos contratos. Hoy ninguno de los modelos omni es enrutable a través de OrcaRouter: Qwen3.8-Omni-Flash se ejecuta únicamente en las plataformas propias de Alibaba, y Google no ha abierto la API de vídeo Omni al enrutamiento de terceros, así que no alojamos ninguno de los dos y no vamos a fingir lo contrario. Lo que sí está disponible en nuestro catálogo es el hermano de cada familia — Qwen3.8-Flash y Gemini 3.8 Flash — ambos invocables hoy a través de un único endpoint a precio de lista del proveedor con un 0% de margen, que es lo que hace que una prueba A/B frente a las cifras del propio proveedor sea cuestión de un cambio de configuración y no de una segunda integración.

A headless screenshot of the OrcaRouter model page for Gemini 3.8 Flash at www.orcarouter.ai/models/google/gemini-3.8-flash, showing the model header, the input-modality and capability row (text, image, video, audio, tools, JSON, reasoning), the published pricing and the p50 TTFT figure.

Donde gana cada uno, dicho sin rodeos

Qwen3.8-Omni-Flashgana en todo lo que se mide en horas de entrada: transcripción y diarización de reuniones, resumen de grabaciones largas, uso de herramientas agénticas con mucho audio y coste por hora de medios procesados. Sus resultados de audio reportados por el proveedor son sólidos y su debilidad está donde el modelo nunca estuvo dirigido — los tableros con mucha carga de razonamiento, donde las primeras ejecuciones de terceros lo sitúan en el percentil 28 en razonamiento con una cifra de velocidad en el 21, en una muestra lo bastante pequeña como para que los números deban tratarse como una invitación a probar y no como un veredicto.

Gemini Omni 1.1 Flash gana en la salida: generación de planos con audio sincronizado, continuidad a lo largo de escenas extensas, control a nivel de fotograma y el acabado en 4K que un pipeline de entrega puede simplemente requerir. Su ventaja no es una puntuación de benchmark, sino que el otro modelo no puede hacer el trabajo en absoluto. Donde es más débil es en todo lo que exige mantener una hora de contexto, porque no está diseñado para eso.

La decisión, y lo que hay que vigilar

Si tienes que elegir entre ellos, la pregunta es qué mitad del pipeline está desatendida. Un equipo que ya genera video y necesita entender grabaciones largas debería estar probando Qwen3.8-Omni-Flash con su propio audio esta semana; un equipo que analiza contenido multimedia y necesita producirlo debería estar probando Gemini Omni 1.1 Flash. Un equipo que necesita ambos está considerando dos proveedores, dos modelos de facturación y dos integraciones, que es la situación en la que una sola capa de enrutamiento deja de ser una comodidad y empieza a ser lo que mantiene legible el modelo de costes.

Dos cosas cambiarían esta lectura. Una evaluación independiente de Qwen3.8-Omni-Flash sustituiría cada cifra de proveedor anterior por una comparable: ninguna existe todavía, y su ausencia es la mayor laguna individual de esta comparación. Y una tarifa publicada por Google para la salida en 1080p y 4K haría verificable la aritmética de gama alta; hoy esas cifras circulan solo como estimaciones del mercado y no como la lista propia de Google.

A headless screenshot of Google's Gemini API documentation page for Gemini Omni Flash at ai.google.dev/gemini-api/docs/omni, showing the docs navigation, the model identifier gemini-omni-1.1-flash, and the description of its native multimodality and conversational editing.

Una nota final sobre el encuadre. "Omni" ha dejado de significar algo preciso: ahora abarca un modelo que lee una hora de audio de reunión y otro que renderiza un clip de cuarenta segundos con sonido, y tratar la palabra como una categoría es la forma en que los compradores terminan comparando una tarifa por token con una tarifa por segundo y sacando una conclusión de ello. Los modelos son complementarios con un solapamiento estrecho, y la postura correcta hacia ambos, cinco días y cuatro semanas después de sus respectivos lanzamientos, es la misma: medirlos con tu propio material y mantener abierta una segunda vía.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario