Una tarjeta de título principal para la comparación 'Qwen3.8-Omni-Flash vs Qwen2.5-Omni' con el antetítulo 'Dieciocho meses de diferencia: de marzo de 2025 a septiembre de 2026', el subtítulo 'Treinta veces el contexto, una hora de contenido multimedia en lugar de segundos, y la única cosa que el modelo anterior podía hacer y que el nuevo no puede', y tres fichas de estadísticas que dicen 'Contexto: 32K a 1M', 'Contenido multimedia por llamada: de segundos a 1 hora' y 'Salida de voz: solo el modelo de 2025'.
Guides & Insights

Qwen3.8-Omni-Flash vs Qwen2.5-Omni: 18 meses después, la actualización perdió su voz

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

He aquí el hecho que hace que esta comparación sea más interesante que una simple renovación generacional. El modelo más antiguo puede hablar y el más nuevo no. Qwen2.5-Omni, lanzado en marzo de 2025, aceptaba texto, imágenes, audio y vídeo como entrada y respondía en texto o en habla natural en streaming, en un único modelo de extremo a extremo que podías descargar. Qwen3.8-Omni-Flash, lanzado el 18 de septiembre de 2026, acepta las mismas cuatro modalidades en una ventana de contexto treinta veces mayor, ingiere una hora de audio y vídeo continuos donde su antecesor manejaba segundos, y devuelve únicamente texto. Dieciocho meses de trabajo compraron una entrada muchísimo más amplia y renunciaron al canal de salida. Que eso sea un avance o un intercambio depende por completo de para qué usabas el modelo antiguo, y la respuesta se divide claramente en dos.

Las cifras de Qwen2.5-Omni son del proveedor, de sus materiales de lanzamiento de marzo de 2025, y dieciocho meses de amplio despliegue las han validado en parte. Las cifras de Qwen3.8-Omni-Flash también son de Alibaba, de materiales de lanzamiento publicados horas antes de que se escribiera esto, y nada de ellos ha sido reproducido de forma independiente. Cuando una afirmación proviene de un crítico en lugar del proveedor, se atribuye como tal. El único hecho estructural que no necesita verificación es también el más trascendental: Qwen2.5-Omni tiene pesos abiertos y es descargable, y Qwen3.8-Omni-Flash no lo es.

Qué era Qwen2.5-Omni y por qué importaba

Cuando se lanzó el 26 de marzo de 2025, Qwen2.5-Omni fue el primer modelo omnimodal de extremo a extremo de la familia; el lanzamiento lo presentó como la respuesta al problema del "zoo de especialistas", en el que la transcripción, la visión y la voz requerían cada una un modelo aparte y una capa de integración aparte. El modelo de 7B gestionaba las cuatro modalidades de entrada y tanto la salida de texto como la de voz, afirmaba haber alcanzado resultados de vanguardia en el benchmark de fusión OmniBench por delante de Gemini-1.5-Pro, y reportaba una puntuación de calidad de generación de voz de 4,51 que Alibaba describió como de nivel humano. Una variante de 3B siguió la misma arquitectura.

La ingeniería que lo hizo funcionar merece que se le ponga nombre, porque el nuevo modelo no la utiliza. Thinker-Talker dividía el trabajo en dos: un transformer Thinker fusionaba los codificadores de audio e imagen y producía semántica y texto, mientras que un Talker transmitía tokens de voz a partir de los estados ocultos del Thinker, compartiendo todo el historial de conversación. El RoPE multimodal alineado en el tiempo (TMRoPE) entrelazaba las posiciones de vídeo y audio para que los dos flujos permanecieran sincronizados. El streaming por bloques permitía que los codificadores hicieran la percepción mientras el modelo de lenguaje gestionaba secuencias largas, lo que hizo posibles las respuestas habladas de baja latencia. Incluía dos voces fijas, Chelsie y Ethan.

Las restricciones eran igual de reales. El contexto era de 32,768 tokens. La memoria era el límite determinante mucho más que la capacidad de cómputo: las propias tablas de Alibaba sitúan la inferencia en BF16 con FlashAttention-2 en aproximadamente 31 GB de memoria de GPU para un vídeo de 15 segundos, 42 GB para 30 segundos y 60 GB para un minuto completo. Un minuto de vídeo, en un modelo de 7B, en una de las GPU individuales más grandes que se podían alquilar. Ese número es el que hay que mantener a la vista, porque es el número que el modelo de 2026 fue creado para destruir.

Qué es Qwen3.8-Omni-Flash

El nuevo modelo es nativamente omni-modal en lugar de estar ensamblado — construido directamente sobre la Qwen3.8-Flash línea de arquitectura, y no como un LLM de texto con codificadores de percepción añadidos, lo cual es una diferencia estructural y no solo una etiqueta generacional. Acepta texto, imagen, audio y vídeo, incluido audio estéreo y espacial de cuatro canales, y devuelve texto a lo largo de un contexto de un millón de tokens con aproximadamente 991K de entrada máxima, 131K de salida máxima y un presupuesto de razonamiento de 262K. Gestiona hasta una hora de audio y vídeo continuos por llamada. El reconocimiento de voz cubre 74 idiomas, y la generación de voz en 29 de ellos se gestiona en las herramientas circundantes, no por el modelo. Está disponible en la plataforma Qianwen AI y en Alibaba Cloud Model Studio con el id qwen3-8-omni-flash, a 0,15 $ por millón de tokens de entrada y 0,47 $ por millón de salida, con la entrada en caché a 0,016 $.

A two-column scoreboard, 'Qwen3.8-Omni-Flash vs Qwen2.5-Omni - the scoreboard'. Left column Qwen3.8-Omni-Flash: Released 18 Sep 2026, Context 1M tokens, Media per call 1 hour continuous A/V, Output text only, Weights API only, Hardware hosted endpoint. Right column Qwen2.5-Omni: Released 26 Mar 2025, Context 32,768 tokens, Media per call seconds and GPU-bound, Output text + streaming speech, Weights open and downloadable, Hardware roughly 60GB GPU for 60s of video. The footer reads 'Qwen2.5-Omni figures per Alibaba's March 2025 release materials; Qwen3.8-Omni-Flash figures vendor-reported and unreproduced.'

Dieciocho meses, dimensión por dimensión

• Contexto — Qwen2.5-Omni, 32.768 tokens, frente a Qwen3.8-Omni-Flash, con un millón, aproximadamente un aumento de treinta veces.

• Duración de los medios — segundos de vídeo, limitados por la memoria de la GPU, frente a una hora de audio y vídeo continuos en una sola llamada alojada.

• Salida — texto más voz natural en streaming en el modelo antiguo; solo texto en el nuevo.

• Despliegue — Qwen2.5-Omni tiene pesos abiertos bajo Apache-2.0, se puede descargar desde Hugging Face y ModelScope; Qwen3.8-Omni-Flash es solo por API y no se ha anunciado la publicación de sus pesos.

• Hardware — 7B parámetros que necesitan hasta ~60 GB de memoria de GPU para un minuto de video, frente a un endpoint alojado que no aprovisionas en absoluto.

• Precio — el modelo anterior te cuesta una GPU; el nuevo cuesta $0.15 por millón de tokens de entrada, y Alibaba afirma que la entrada de audio por hora es un 98% más barata que la generación Qwen3.5-Omni-Plus a la que reemplaza.

• Generación de voz — dos voces fijas en 2025, frente a 29 idiomas de generación de voz en las herramientas de 2026, nada de ello producido por el propio modelo.

El intercambio que nadie anunció

Lean las dos hojas de especificaciones en conjunto y la forma de los últimos dieciocho meses se vuelve clara. Alibaba pasó ese intervalo resolviendo la ingesta — cuántos medios puede absorber un modelo, a qué costo y cuánto de la decisión puede tomar por sí mismo. Qwen3.8-Omni-Flash es un triunfo en ese eje. El modo Agentic Understanding, en el que el modelo elige qué muestrear en lugar de procesar cada fotograma, reduce los tokens por consulta de 145.736 a 79.117, a la vez que eleva la precisión en OmniVideoBench de 63,4 a 67,8, y el proveedor informa que el error de diarización de hablantes en AliMeeting se desploma de 88,11 a 3,35.

Lo que el intervalo no priorizó es la salida. La característica definitoria del modelo de 2025 —un modelo que te escucha y responde en voz alta, de principio a fin, sin un sintetizador de voz independiente— no tiene sucesor aquí. Si creaste un agente de voz, un pipeline de doblaje o una herramienta de accesibilidad sobre el Talker de Qwen2.5-Omni, el modelo de 2026 no es una actualización de aquel; es un componente al que tendrías que añadir una nueva etapa de texto a voz, lo que añade latencia y un proveedor a un pipeline que antes no tenía ninguno de los dos. Los materiales de lanzamiento son honestos al respecto si lees con atención la línea de modalidades, pero no es el titular, y cualquiera que migre asumiendo que «omni» significa lo mismo en ambas versiones descubrirá la diferencia en producción.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

Por qué el modelo de 2025 todavía tiene trabajo

Tres razones, y ninguna de ellas es nostalgia. La primera es la voz, como arriba. La segunda son los pesos abiertos: 32K de contexto y una huella de 7B se ejecutarán en hardware que tú controlas, sin conexión, sin que los datos salgan del edificio y sin medidor por token —la única opción si tu audio está sujeto a una regla de residencia o tu presupuesto de latencia prohíbe un viaje de ida y vuelta. La tercera es el costo con volúmenes muy bajos. Una GPU que ya tienes es gratis en el margen; los $0.15 por millón de tokens del modelo alojado son baratos pero no cero, y el costo fijo de aprovisionar contra él es real para una carga de trabajo que se ejecuta dos veces por semana.

El contraargumento es que las limitaciones del modelo antiguo aprietan más cada año. Un minuto de vídeo, 32K de contexto y la ausencia de llamadas a herramientas o de salida estructurada en un mundo donde los agentes son la forma de despliegue predeterminada constituyen un margen muy estrecho. Para un pipeline que debe ingerir reuniones grabadas, Qwen3.8-Omni-Flash no es simplemente mejor: es la diferencia entre que sea posible o no, porque el modelo de 2025 físicamente no puede albergar la entrada.

Vale la pena ser concretos sobre cuánta vida les queda a los pesos antiguos, porque llamarlos «legacy» se queda corto. El repositorio Qwen2.5-Omni-7B registró 343,676 descargas el mes pasado cuando lo revisamos el 18 de septiembre de 2026, con alrededor de cien Spaces de la comunidad y docenas de ajustes finos, adaptadores y cuantizaciones construidos sobre él. Haga lo que haga el modelo insignia, mucha gente sigue lanzando proyectos con el modelo de 2025 — y, en particular, Hugging Face no listó ningún proveedor de inferencia que lo desplegara, lo que significa que casi todo ese uso es autoalojado.

El nuevo modelo mejora al antiguo.

El detalle más extraño y más convincente del lanzamiento está enterrado cerca del final de los materiales. En un experimento que Alibaba describe como un modelo que optimiza a un modelo, Qwen3.8-Omni-Flash mejoró de forma autónoma el reconocimiento de voz del dialecto de Sichuan de Qwen2.5-Omni-3B —el hermano pequeño del modelo al que nominalmente reemplaza—, reduciendo la tasa de error de caracteres de 25,79% a 15,30% en doce horas y creando 3.413 muestras de entrenamiento a lo largo de cuatro rondas.

Ese es un argumento mejor a favor del modelo más reciente que cualquier benchmark incluido en el lanzamiento, y reformula la relación entre ambos. El modelo de 2026 no es solo un reemplazo del de 2025; es una herramienta que mejora los pesos de 2025. Si estás ejecutando Qwen2.5-Omni en producción para un idioma o dialecto que maneja mal, la ruta práctica podría ser mantener el despliegue y usar el nuevo modelo para construir los datos de entrenamiento, en lugar de migrar la carga de trabajo. No obstante, ten en cuenta que esta es una demostración reportada por el proveedor y sin una metodología publicada, por lo que debe tratarse como una anécdota alentadora y no como una receta reproducible.

A screenshot of the Hugging Face model card for Qwen/Qwen2.5-Omni-7B (captured 18 September 2026), showing the Apache-2.0 licence tag, a 'Downloads last month' figure of 343,676, a Safetensors model size of 11B params, 100 Spaces using the model, 57 adapters, 67 finetunes and 24 quantisations, a note that the model is not deployed by any Inference Provider, and the model card text describing the Thinker-Talker architecture and TMRoPE position embedding.

Si estás migrando

La decisión rara vez se reduce a un solo modelo. Un equipo que abandona un modelo omni autoalojado elige entre tres formas: quedarse en pesos abiertos y seguir aprovisionando, pasar a una API de proveedor y renunciar al control, o dividir la carga de trabajo para que solo la parte que necesita una ingesta de un millón de tokens vaya al modelo alojado. Esa tercera opción suele ser la correcta y también es la que la gente omite, porque suena a más trabajo del que es: el ajuste fino del dialecto en el que pasaste un mes no tiene que desecharse porque la etapa de resumen de reuniones se haya trasladado.

Donde el enrutamiento ayuda es en las costuras. OrcaRouter te da una sola clave para más de 200 modelos, con un 0 % de recargo sobre el precio de lista del proveedor y conmutación por error automática si un endpoint se degrada, lo que significa que la mitad alojada de un pipeline dividido no necesita su propio contrato, su propio código de cliente y su propia monitorización antes de saber si la carga de trabajo justifica algo de eso. Para que quede claro lo que no hacemos: ninguno de los dos modelos omni está en nuestro catálogo —ambos se ejecutan en las plataformas de Alibaba o en tu propio hardware—, así que esta es una decisión de enrutamiento que tomas en torno a los modelos, no a través de nosotros.

Quién debería moverse, y quién no

Cambia si tu carga de trabajo es audio o video de larga duración, si 32K de contexto es lo que impide que exista un pipeline, si necesitas comportamiento agéntico sobre contenido multimedia, o si la diarización de hablantes a escala es el problema que tienes. Quédate si necesitas que el modelo hable, si tu audio no puede salir de tu infraestructura, si dependes de los pesos específicos de Qwen2.5-Omni que ya has ajustado, o si tu volumen de llamadas es lo suficientemente bajo como para que una GPU propia sea mejor que un medidor.

La conclusión incómoda es que esto es menos un reemplazo que una bifurcación en la línea de productos. Alibaba ha pasado dieciocho meses construyendo el mejor modelo de entrada que puede y no ha construido un sucesor para la mitad de salida. Si tu trabajo vive del lado de la entrada, la actualización es casi obligatoria. Si vive del lado de la salida, el modelo de 2025 sigue siendo lo más nuevo que hace lo que necesitas, y vale la pena saberlo antes de planear una migración que eliminaría silenciosamente una capacidad de la que dependes.