
Qwen3.8-Omni-Flash ya está aquí: contexto de 1M de tokens, audio 98% más barato, solo salida de texto
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
El lanzamiento abrió Qwen3.8-Omni-Flash a los clientes de API hoy, 18 de septiembre de 2026, y la cifra con la que encabezó es una factura, no una puntuación. Por hora de entrada de audio, Qwen dice que el nuevo modelo cuesta 98% menos que su predecesor Qwen3.5-Omni-Plus; por hora de audio y vídeo combinados, 93% menos. Todo lo demás en el anuncio se desprende de ese enfoque. Qwen3.8-Omni-Flash es un modelo ómnimodal nativo —texto, imagen, audio y vídeo de entrada, un millón de tokens de contexto, hasta una hora completa de audio y vídeo continuos dentro de una sola llamada— y Alibaba no lo vende como un mejor descriptor de medios, sino como el primer modelo Qwen creado para actuar sobre ellos. El eslogan es «Sentidos ómnicos. Entrega agéntica.». El inconveniente, expresado claramente en los mismos materiales, es que el modelo responde solo en texto: oye y observa, pero no habla.
Nada de lo que aparece a continuación ha sido reproducido de forma independiente. El modelo tiene apenas unas horas, todavía no existe ninguna evaluación de terceros sobre él, y cada benchmark y cada cifra de precio de los materiales de lanzamiento son de Alibaba. Cuando una cifra la reporta el proveedor, este artículo lo indica en la frase que la contiene; cuando una lectura proviene de un crítico y no del proveedor, se atribuye. Lo único que es verificable de forma independiente hoy —que el modelo está activo en las plataformas de Alibaba y no en el catálogo de ningún otro— es justo aquello de lo que el lanzamiento tiene menos interés en hablar.
Lo que realmente se envió
La ficha técnica es inusualmente limpia para un lanzamiento omnimodal, y eso es en sí mismo la noticia: la generación anterior de modelos omni de esta familia se ensamblaba a partir de codificadores de percepción independientes atornillados a un LLM de texto, mientras que este se construye directamente sobre la línea arquitectónica Qwen3.8-Flash, con las modalidades procesadas de forma nativa en lugar de injertadas.
• Entrada: texto, imagen, audio y video, con audio espacial estéreo y de cuatro canales aceptado; la salida es solo texto.
• Contexto — un millón de tokens, con una entrada máxima de aproximadamente 991K (alrededor de 983K en modo de pensamiento), una salida máxima de 131K y un presupuesto de razonamiento que alcanza los 262K.
• Duración: hasta una hora de audio o de audio y vídeo continuos por llamada, que es la cifra que hace posibles los casos de uso de reuniones y vídeos largos sin fragmentación.
• Cobertura de voz — reconocimiento en 74 idiomas y generación de voz en 29 en las herramientas circundantes; un informe en chino sobre el lanzamiento indica 113 idiomas y dialectos para la entrada de audio.
• Disponibilidad — la plataforma de IA Qianwen y Alibaba Cloud Model Studio (Bailian), con el id de API qwen3-8-omni-flash. Los pesos no se están publicando. Se describe una variante Realtime como el primer modelo omnimodal con localización de fuentes sonoras.

El 98% es una afirmación de costo, y la aritmética detrás de ella vale la pena ver.
Una reducción del 98 % en el costo de una hora de audio es una cifra mucho mayor que una reducción del 98 % en el precio de un token, y la brecha entre esas dos cosas es donde el anuncio hace su trabajo. La cifra por hora se obtiene al calcular el precio de una muestra de dos minutos y multiplicarla por treinta, con el vídeo muestreado a 720p y un fotograma por segundo. Es una forma legítima de cotizar una carga de trabajo de producción, y también es una descripción de lo que se le pide al modelo que mire: un fotograma por segundo es suficiente para saber qué se dijo y, a grandes rasgos, qué ocurrió en pantalla, y no es ni de lejos suficiente para inspeccionar operaciones a nivel de fotograma, juzgar la calidad de la edición o detectar un artefacto de un solo fotograma. Se están multiplicando dos cambios —un auténtico recorte del precio unitario y una política de muestreo mucho más agresiva—, y solo el primero es una mejora del modelo.
Los precios unitarios en sí son concretos. El precio internacional se cotiza a $0,15 por millón de tokens de entrada, $0,016 por millón de tokens de entrada en caché, y $0,47 por millón de tokens de salida. El precio doméstico de Bailian se cotiza a ¥0,8 por millón para entrada multimodal, una rebaja desde aproximadamente ¥18. Ten en cuenta que los sistemas de facturación internacional y de China continental son independientes y las cifras no son intercambiables; cualquiera que las compare directamente obtendrá una respuesta equivocada.
Esta es la parte del anuncio en la que el enrutamiento importa más de lo habitual. OrcaRouter transfiere el precio de lista del proveedor con0 % de margen, de modo que un recorte de precios de este tipo por parte de un proveedor llega a nuestros clientes el mismo día en que se anuncia, y no en la próxima renovación de contrato. Una comparación realmente verificable ya está en nuestro propio catálogo: Qwen3.8-Flash, el modelo multimodal junto al que se construye este, se puede enrutar hoy a0,15 $ por millón de tokens de entrada y 0,47 $ por millón de salida —el mismo precio de lista que Alibaba anuncia para el nuevo modelo omni— y transportó 2470 millones de tokens de tráfico a través de nuestra API en los siete días previos a la redacción de este texto, lo que es una buena medida del apetito que ya tiene este nivel. El modelo omni en sí todavía no está en nuestro catálogo, y hasta que lo esté, se ejecuta en las propias plataformas de Alibaba y en ningún otro sitio. No vamos a fingir lo contrario.
Cada benchmark del lanzamiento compara una sola cosa
El titular es una mejora media de más del 26 % en aproximadamente 30 evaluaciones — y cada una de esas evaluaciones se hace frente a Qwen3.5-Omni-Plus. Esa es la línea de base correcta para un lanzamiento, y es una línea de base limitada: te dice que la familia avanzó, no dónde quedó en relación con cualquier cosa por la que ya podrías estar pagando.
Las cifras individuales, todas reportadas por el proveedor: WildClawBench-MM 71,0, con un aumento de 36,5 puntos y el mayor movimiento de todo el conjunto; UniClawBench 69,6; AgenticVBench con un aumento de 22,3 puntos hasta 36,8; LongAudioSpan 82,7, con un aumento de 8,3; OmniVideoBench 63,4, con un aumento de 9,6; OmniCap-IF 28,2. El par más llamativo es la diarización de hablantes en AliMeeting, donde la tasa de error cae de 88,11 a 3,35 y el cpWER de 89,61 a 17,18 — un salto lo bastante grande como para merecer escrutinio en lugar de aplausos. Un análisis técnico chino del lanzamiento sostiene precisamente eso: atribuye la mejora en gran medida a la ingeniería de front-end y de diarización que envuelve al modelo, más que al razonamiento propio de este, y advierte que el sistema se percibe como especializado en audición, con un razonamiento profundo sobre vídeo comparativamente más débil. Esa es la lectura de un crítico, no una replicación medida, pero el tamaño del delta es motivo suficiente para tenerlo presente.

El otro número que vale la pena retener no es una puntuación en absoluto. En lo que Alibaba llama modo Agentic Understanding, el modelo decide por sí mismo qué mirar y qué escuchar en lugar de procesar cada fotograma, reuniendo evidencia en rondas de grueso a fino. En OmniVideoBench, ese modo eleva la precisión de 63,4 a 67,8 al tiempo que reduce los tokens por consulta de 145.736 a 79.117 — una reducción del 45,7 %. Que la precisión suba y el costo baje simultáneamente es la afirmación más sólida del lanzamiento, y es la que respalda más directamente la propuesta agéntica.
La comparación de Gemini es más limitada de lo que sugiere la cobertura.
El posicionamiento de Alibaba es que su capacidad de audio y vídeo «se acerca» a Gemini 3.8 Flash, mientras que su rendimiento general en audio lo supera. Despojadas del encuadre, las comparaciones reportadas por el proveedor son las siguientes. WildClawBench-MM: 71,0 frente a 58,9. SpotSoundBench: 67,2 frente a 39,7. MMAU: 81,8 frente a 76,9. DailyOmni: 85,1 frente a 84,0. Son diferencias reales en audio y en el uso de herramientas centradas en el audio. También son selectivas. En AgenticVBench, el tablero puro de razonamiento de vídeo, el orden se invierte —Gemini con 45,0 frente a los 36,8 de Qwen—, y el propio informe de Alibaba admite que Gemini sigue liderando varias pruebas de comprensión de vídeo. Un resumen razonable es que Qwen se ha hecho con la mitad de audio de lo omni y sigue por detrás en la mitad de vídeo, lo cual es una afirmación distinta de la que difundieron los titulares.
«El primer modelo omnimodal de Qwen» necesita un calificador
La idea de que Qwen3.8-Omni-Flash es el primer modelo omni-modal de Qwen se difundió ampliamente hoy y vale la pena ser precisos al respecto, porque la familia tiene una entrada anterior con un justo derecho al título. Qwen2.5-Omni, un modelo abierto de 7B lanzado en marzo de 2025 bajo una arquitectura Thinker-Talker, también tomaba texto, imagen, audio y video como entrada — y generaba habla además de texto. Lo que es genuinamente primero aquí es nativa omnimodalidad: un modelo construido sobre la Qwen3.8-Flash base en lugar de un LLM de texto con codificadores de percepción adjuntos, más un brief de diseño centrado en agentes. Ambas afirmaciones son verdaderas; solo una de ellas es la que se repitió. Si estás evaluando el modelo bajo la suposición de que no existía ningún modelo omni de Qwen antes de esta semana, estarás mal calculando la ruta de actualización desde Qwen2.5-Omni, que es una comparación que hemos escrito por separado.
Las herramientas son donde realmente reside la afirmación de agentividad
Junto al modelo se lanzaron dos cosas, y son más importantes de lo que sugiere la ficha del modelo, porque son lo que convierte la percepción en entrega. Qwen-MM-Plugins es una suite de plugins multimodales para harnesses de agentes que proporciona a un agente externo comprensión de imágenes, audio, vídeo y documentos, además de memoria para vídeos largos y edición de vídeo; anuncia compatibilidad con Codex, Claude Code, Qwen Code, Gemini CLI y varios otros, e incluye herramientas con nombre propio como Video2Note, que convierte horas de vídeo en notas PDF ilustradas. Qwen-Live Harness es un entorno de ejecución de código abierto para la interacción omnicanal continua en tiempo real, que actúa como una capa de programación donde un usuario conversa en directo y delega el trabajo más pesado a agentes en segundo plano. Una advertencia de la cobertura del día del lanzamiento: la página de GitHub de Qwen-Live Harness devolvía un 404 cuando Gigazine la comprobó, así que considérese el conjunto de herramientas como anunciado, no verificado, hasta que los repositorios estén disponibles.
La frase que el lanzamiento entierra: no habla
Para un modelo cuyo predecesor generaba habla, el hecho de que Qwen3.8-Omni-Flash sea multimodal en la entrada y solo texto en la salida es la línea más decisiva de la especificación, y aparece en los materiales en gran medida como una nota al pie. Significa que el modelo no se puede incorporar por sí solo a un producto de voz a voz. Cualquier doblaje, agente de voz o conversación en tiempo real construido sobre él necesita una etapa externa de conversión de texto a voz y, para video, un renderizador externo, que es precisamente la razón por la que existen el conjunto de complementos y el arnés en vivo. La consecuencia práctica es una canalización con más partes móviles que "un único modelo omni", y una latencia que debe presupuestarse entre todas ellas.
Hay una demostración reveladora de la brecha, y de para qué sirve el modelo, escondida en el lanzamiento. En un experimento de "modelo optimizando modelo", Qwen3.8-Omni-Flash mejoró de forma autónoma el reconocimiento del dialecto de Sichuan de Qwen2.5-Omni-3B, reduciendo la tasa de error de caracteres de 25,79% a 15,30% en doce horas y construyendo 3.413 muestras de entrenamiento en cuatro rondas. Un modelo que puede diagnosticar y reparar el manejo de dialectos de un modelo hermano más pequeño está haciendo algo que una API de transcripción no puede. Eso, más que la tabla de benchmarks, es el argumento más claro de lo que se supone que significa "agéntico" aquí.

¿Qué cambiaría nuestra lectura?
La situación real, para ser honestos, es que este es un lanzamiento bien especificado, con una propuesta de precio convincente, sin evaluación independiente y con al menos una limitación estructural que el anuncio minimiza. Tres cosas lo resolverían. Una entrada en Artificial Analysis o LMArena convertiría las cifras del proveedor en cifras comparables, y todavía no existe ninguna. Una prueba de terceros de la reducción de tokens del 45,7 % —la afirmación de que la precisión aumenta mientras el costo baja— confirmaría el resultado más útil y menos glamoroso del comunicado. Y una medición independiente de la diarización de AliMeeting mostraría si la caída de 88 puntos es atribuible al modelo o al pipeline que lo rodea.
Hasta entonces, la disposición sensata es la que se aplica a cualquier modelo en su primer día: vale la pena probarlo, pero no vale la pena apostar por él para una ruta de producción. Si ya está enrutando a través de OrcaRouter, lo práctico es mantener la carga de trabajo en los modelos que ha medido y tratar Qwen3.8-Omni-Flash como un candidato para probarlo contra ellos con su propio audio y video en lugar de con la tabla comparativa de cualquiera de los proveedores. Si su caso de uso es el análisis de reuniones o de medios de formato largo en chino e inglés, la economía de tokens aquí es lo suficientemente sólida como para justificar la prueba ahora.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
