
Qwen3.8-Omni-Flash a cinco días de su lanzamiento: una puerta, sin pesos, y las primeras puntuaciones que no son de Alibaba
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Cinco días después de que el proveedor abriera Qwen3.8-Omni-Flash a los clientes de API, el modelo sigue teniendo exactamente un solo hogar. Se ejecuta en la propia plataforma Qianwen del proveedor y en su servicio en la nube Bailian; los listados de terceros que han aparecido desde el lanzamiento son proxies delante de esos mismos endpoints, no un segundo lugar donde vive el modelo. No se han publicado los pesos. Las cifras del día del lanzamiento — una reducción del 98 % en el costo de una hora de audio, una mejora media del 26 % frente a Qwen3.5-Omni-Plus, un millón de tokens de contexto, salida solo de texto — siguen siendo del proveedor y no se han reproducido. Lo que realmente ha cambiado en cinco días no es el modelo, sino el terreno a su alrededor: ha aparecido una fina capa de puntuaciones de terceros, el soporte para frameworks llegó el día cero, y la comparación que todos buscan es con Gemini 3.8 Flash en lugar del Qwen3.8-Flash junto al que se construyó este modelo. Cada uno de esos merece una mirada más de cerca que la que le dio la cobertura del lanzamiento.
La puerta es una buena puerta, y es la única.
La disponibilidad se ha ampliado sin volverse plural. El modelo responde sin cambios a una solicitud con formato OpenAI, lo que significa que el código de cliente existente funciona en su mayor parte; lo que se rompe es el endpoint, porque los hosts internacionales y de la China continental son servicios separados con facturación separada. El código que apunta al predeterminado fallará o se facturará en la moneda incorrecta, y la historia del precio por hora solo se sostiene del lado internacional. Las bibliotecas cliente de código abierto lanzaron soporte desde el día cero para el modelo, lo cual es genuinamente útil y además no constituye un segundo proveedor: una biblioteca que se comunica con Bailian es un envoltorio de conveniencia en torno a la misma única fuente de suministro.
Ese es el riesgo estructural que vale la pena nombrar. Un modelo de fuente única no tiene ruta de conmutación por error. Si el endpoint aplica límites de velocidad, se degrada o una región se queda sin servicio, no hay a dónde recurrir, y ningún grado de soporte de bibliotecas cliente cambia eso. También es la razón por la que declaramos nuestra propia posición con claridad en lugar de insinuar lo contrario: Qwen3.8-Omni-Flash no está en nuestro catálogo. No lo alojamos, y un lector que se registre esperando enrutarlo sería engañado. Lo que sí es enrutable es el resto de la familia — Qwen3.8-Flash y Qwen3.8-Max ambos están disponibles en nuestra API — y OrcaRouter transfiere el precio de lista del proveedor con un 0% de margen, así que cuando el precio del modelo omni de Alibaba cambie, o el día en que el modelo omni esté disponible para enrutar, el cambio llega a los clientes el mismo día en lugar de en la siguiente renovación de contrato.

Las primeras puntuaciones que no son de Alibaba son escasas, y no son nada halagüeñas.
No existe nada en Artificial Analysis para este modelo, y esa ausencia es el titular honesto a cinco días de distancia: las tablas de clasificación que todos citan para modelos adyacentes aún no tienen una fila para el modelo omni. El vacío lo ha llenado otra cosa. Una plataforma de evaluación de terceros ha comenzado a publicar ejecuciones contra el modelo, y su resumen merece leerse precisamente por lo mucho que no dice. Reporta clasificación de correos electrónicos con una precisión del 99,0 % (percentil 86), ética con un 95,0 % (percentil 23) y razonamiento con un 56,0 %, lo que sitúa en el percentil 28 y califica como una debilidad notable; la velocidad queda en el percentil 21, el costo en el 58, con una tasa de éxito general del 89 %.
Trátalos con verdadera cautela, y no solo porque la muestra sea pequeña. La misma página fecha el lanzamiento del modelo el 20 de septiembre, dos días después de que Alibaba lo distribuyera, no da fechas de ejecución para ninguno de los resultados y muestra una tabla de referencia vacía debajo de un resumen que describe cifras que la tabla no contiene. Ese es el perfil de un arnés temprano y con supervisión ligera, más que el de una evaluación medida, y la lectura honesta es que estos son los primeros puntos de datos no provenientes del proveedor, en lugar de los primeros fiables. Son una razón para probar el modelo por ti mismo, no una razón para concluir nada. La dirección, sin embargo, es coherente con lo que los propios materiales del proveedor implican por omisión: este es un modelo de percepción y medios de formato largo, y las tablas de clasificación con un gran peso del razonamiento no son el objetivo al que apuntaba.
También hay una trampa en los resultados de búsqueda que atrapará a la gente durante las próximas semanas. Qwen 3.8, el modelo de texto, tiene un Artificial Analysis Intelligence Index en los cuarenta, y ese número se ha citado en más de un resumen como si describiera el modelo omni. No es así. Son modelos diferentes con tareas diferentes, y el modelo omni todavía no tiene ningún índice.

La tabla de benchmarks sigue siendo un proveedor comparándose consigo mismo
La cifra de lanzamiento —una mejora media de más del 26 % en unas treinta evaluaciones— se mide enteramente frente a Qwen3.5-Omni-Plus. Eso indica que la familia avanzó. No indica dónde se sitúa el modelo frente a cualquier alternativa por la que ya podrías estar pagando, y las comparaciones selectivas que circularon junto a ella tampoco cierran esa brecha. El panorama reportado por el proveedor frente a Gemini 3.8 Flash es una victoria genuina en los paneles de audio y una derrota en los que miden trabajo agéntico con vídeo: WildClawBench-MM 71,0 frente a 58,9 y SpotSoundBench 67,2 frente a 39,7 por un lado, AgenticVBench 36,8 frente a 45,0 y OmniGAIA 74,0 frente a 78,6 por el otro. El propio lenguaje del resumen de Alibaba —rendimiento de audio y vídeo "acercándose" a Gemini, rendimiento general de audio superándolo— es más prudente que los titulares que produjo, y la versión prudente es la precisa.
• Contexto — 1M de tokens, con una entrada máxima de aproximadamente 991K (alrededor de 983K en modo de razonamiento) y una salida máxima de 131K.
• Modalidad — entrada de texto, imagen, audio y video; salida solo de texto. Sin generación de voz en el modelo base.
• Duración — hasta una hora de audio o audio-vídeo continuo por llamada, lo que hace posible el trabajo con reuniones y medios largos sin segmentación.
• Cobertura de idiomas — reconocimiento en 74 idiomas más 39 dialectos chinos en los materiales de lanzamiento, con cifras más amplias (113 idiomas y dialectos) citadas en otros lugares para la entrada de audio.
• Detalle de entrada: se acepta audio espacial estéreo y de cuatro canales, y la variante Realtime se describe como el primer modelo omni-modal capaz de localizar un objetivo por su sonido.
• Precio — $0.15 por millón de tokens de entrada, $0.016 en caché, $0.47 de salida en el lado internacional, y una lista de precios separada para China continental que no es comparable.
El 98% es real, y no es tu factura
Según la propia metodología de Alibaba —una muestra de dos minutos multiplicada por treinta, vídeo muestreado a 720p y un fotograma por segundo—, una hora de entrada de audio baja de $0,28 a menos de $0,01, y una hora de audio y vídeo combinados, de $3,27 a $0,20. Son reducciones grandes, específicas y reportadas por el proveedor, y son reducciones sobre una sola partida. La aritmética que importa es qué proporción de tu carga de trabajo representa esa partida. Un pipeline que gasta la mayor parte de sus tokens en salida, en contexto en caché o en fotogramas de vídeo muestreados con más densidad de uno por segundo verá un movimiento porcentual mucho menor en la factura que el que promete el titular, y el titular se refiere al audio de entrada, no al total. Súmale la salida solo de texto y la brecha vuelve a ampliarse: cualquier cosa que tenga que responder con voz necesita un segundo modelo, y ese modelo se factura por separado.
Esta es la parte del panorama en la que el enrutamiento demuestra su valía. El valor de un enrutador de paso no es un descuento, sino que la lista de precios del propio proveedor sea lo que usted paga, y que una carga de trabajo pueda repartirse entre varios modelos de modo que un modelo de fuente única sea un componente en lugar de una dependencia. Un modelo omni que sea lo único a lo que pueda llamar es un punto único de fallo tanto en la capa de disponibilidad como en la de precios.

Lo que cinco días de producción realmente te dirían
Tres cosas resolverían las preguntas abiertas. Una medición independiente del resultado de diarización de AliMeeting —una tasa de error que cae de 88,11 a 3,35 y un cpWER que baja de 89,61 a 17,18— mostraría si eso corresponde al modelo o a la ingeniería de diarización y de front-end que lo rodea, que es donde al menos un análisis técnico chino atribuye la mayor parte de la mejora. Una prueba reproducida de la reducción de tokens del modo agéntico, en la que la precisión subió de 63,4 a 67,8 en OmniVideoBench mientras los tokens por consulta cayeron de 145.736 a 79.117, confirmaría la afirmación más útil del lanzamiento: que el modelo puede volverse mejor y más barato al mismo tiempo. Y una fila en Artificial Analysis o en una arena convertiría cada cifra de proveedor anterior en algo comparable, que es la condición previa para que el modelo sea elegido en lugar de simplemente probado.
Hasta entonces, la postura que tiene sentido es la que se aplica a cualquier modelo con cinco días de vida, un solo host y sin evaluación independiente: vale la pena medirlo con tu propio audio y video, pero no vale la pena convertirlo en la única ruta a través de tu pipeline. Si tu carga de trabajo es análisis de reuniones o medios de formato largo en chino o inglés y tus costos están dominados por horas de entrada en lugar de tokens de salida, la economía aquí es lo suficientemente sólida como para justificar una prueba esta semana. Si tu carga de trabajo necesita salida de voz, o necesita un respaldo cuando un proveedor se degrada, el modelo tal como está hoy no puede ser la respuesta completa — y ninguna cantidad de soporte de framework desde el día cero cambia eso.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
