
Qwen3.8-Omni-Flash vs Qwen 3.8: una factura de especialista frente a una insignia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 984 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 196 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
Si quieres la versión corta: Qwen3.8-Omni-Flash es aproximadamente trece veces más barato por token que Qwen 3.8 y es el único de los dos concebido para aguantar una hora de audio y vídeo sin ahogarse, mientras que Qwen 3.8, el núcleo abierto de 2,4 billones de parámetros en la cúspide de la línea Qwen3.8, es el que usas cuando la respuesta tiene que ser correcta y no barata, y el único de los dos cuyos pesos puedes descargar. Comparten una longitud de contexto, un nombre de familia y una ventana de lanzamiento de agosto a septiembre. No son sustitutos, y todo el valor de esta comparación está en saber qué pregunta te estás haciendo en realidad.
Para ser exactos con los nombres, porque la familia está abarrotada. Qwen 3.8 aquí significa el núcleo abierto de mezcla de expertos 2.4T-A95B — el modelo detrás del endpoint Qwen3.8-Max, que Alibaba presentó el 3 de agosto de 2026 y para el que publicó los pesos el 12 de agosto, y que Artificial Analysis indexa en 40 en su Índice de Inteligencia. Qwen3.8-Omni-Flash es el modelo omnimodal nativo que Alibaba puso en servicio de API el 18 de septiembre de 2026, construido sobre la línea de arquitectura Qwen3.8-Flash, que recibe texto, imagen, audio y video y devuelve texto. Todo lo relacionado con el modelo insignia es reportado por el proveedor o indexado de forma independiente, como se señaló; todo lo relacionado con el modelo omni es reportado únicamente por el proveedor, porque tiene apenas unas horas de vida y nadie fuera de Alibaba lo ha medido.
Dos modelos, una familia, briefs de diseño opuestos
La tentación es interpretar esto como un modelo grande y uno pequeño de la misma generación, como se haría con Qwen3.8-Max frente a Qwen3.8-Flash. Esa interpretación es errónea de una forma que cuesta dinero. El Qwen 3.8 es, en su núcleo, un motor de razonamiento que resulta que acepta imágenes y vídeo; su rendimiento se mide en tokens por segundo en problemas difíciles, su precio está fijado para reflejar el cómputo que cuesta una pasada hacia delante de 95.000 millones de parámetros activos, y su hoja de evaluación es una lista de tableros de razonamiento y programación. Qwen3.8-Omni-Flash es un motor de percepción y acción que resulta que razona; su precio está fijado en función del coste de ingerir horas de contenido multimedia, y su hoja de evaluación es una lista de tableros de audio, vídeo y de llamadas a herramientas. Uno está optimizado para la profundidad por token. El otro está optimizado para tokens por hora de contenido.
Esa diferencia se manifiesta con mayor nitidez en un punto que el marketing no menciona. Ambos modelos aceptan alrededor de un millón de tokens y ambos aceptan vídeo. Pero Qwen3.8-Omni-Flash está diseñado explícitamente en torno al problema de la duración —hasta una hora de audio y vídeo continuos en una sola llamada, con un modo de Comprensión Agéntica en el que el modelo elige qué muestrear en lugar de procesar cada fotograma, reduciendo los tokens por consulta de 145.736 a 79.117 y aumentando al mismo tiempo la precisión en OmniVideoBench del 63,4 al 67,8. Qwen 3.8 no tiene ningún mecanismo equivalente publicado. Alimentarlo con dos horas de vídeo es posible sobre el papel; hacerlo a un precio que sobreviva al contacto con un equipo financiero es una cuestión distinta, y es la cuestión que el modelo omni se creó para responder.
Las dimensiones que realmente lo deciden
• Precio — Qwen3.8-Omni-Flash $0.15 por millón de entrada y $0.47 por millón de salida, frente a Qwen 3.8 a $2.00 y $6.00. Lectura de caché: $0.016 frente a $0.25.
• Pesos abiertos — Qwen 3.8 publicó sus pesos el 12 de agosto de 2026 bajo una licencia personalizada; Qwen3.8-Omni-Flash solo está disponible mediante API y Alibaba no ha dicho que se vaya a publicar.
• Contexto — un millón de tokens en ambos lados; 991K de entrada máxima en el modelo omni, con 131K de salida máxima y un presupuesto de razonamiento de 262K.
• Duración de medios — hasta una hora de audio y vídeo continuos en una sola llamada omni; el modelo insignia está documentado para entrada de vídeo, sin información asociada sobre costes por hora.
• Modalidad de salida — texto en ambos lados. Ninguno genera voz, a pesar del linaje del modelo omni.
• Puntuación independiente — Qwen 3.8 se sitúa en 40 en el Artificial Analysis Intelligence Index. Qwen3.8-Omni-Flash todavía no tiene ninguna puntuación independiente de ningún tipo.

Por qué las tablas comparativas no pueden resolver esto
No hay una tabla comparativa directa, y no va a haber una pronto. Los materiales de lanzamiento de Alibaba para Qwen3.8-Omni-Flash lo comparan exclusivamente con Qwen3.5-Omni-Plus, su predecesor directo, y con Gemini 3.8 Flash; las cifras del modelo insignia provienen de un conjunto completamente distinto de evaluaciones de razonamiento y programación. Las dos hojas no comparten ni una sola fila. Cualquiera que publique una tabla que los ponga uno al lado del otro en un mismo eje ha construido ese eje por su cuenta.
Lo que se puede decir con honestidad es direccional. Según las propias cifras del proveedor, el modelo omni supone un gran avance respecto a la línea omni que reemplaza —una ganancia media superior al 26 % en aproximadamente treinta evaluaciones, con WildClawBench-MM en 71,0, UniClawBench en 69,6, LongAudioSpan en 82,7— y una ganancia real, aunque parcial, frente a Gemini 3.8 Flash, donde lidera en tableros centrados en audio como SpotSoundBench (67,2 frente a 39,7) y MMAU (81,8 frente a 76,9), y queda por detrás en AgenticVBench, de razonamiento puramente de video (36,8 frente a 45,0). En el lado de los modelos insignia, la puntuación de 40 de Qwen 3.8 en Index es una medición independiente y vale más que cualquiera de las anteriores. Estos son tipos distintos de evidencia y no deben promediarse entre sí.

Una comparación de costos elaborada, con el supuesto declarado
Tome un trabajo de análisis de documentos largos y video: 300,000 tokens de entrada y 20,000 tokens de salida, una forma plausible para una reunión grabada de noventa minutos con diapositivas. En Qwen3.8-Omni-Flash eso es 300,000 × $0.15 por millón = $0.045 de entrada y 20,000 × $0.47 por millón = $0.0094 de salida, así que alrededor de 5.4 centavos. En Qwen 3.8 la misma llamada es 300,000 × $2.00 por millón = $0.60 y 20,000 × $6.00 por millón = $0.12, o alrededor de 72 centavos. Un poco más de trece veces el costo para el mismo número de tokens.
El número que cambia la decisión no es la proporción, sino el volumen. A cien trabajos como estos al día, eso es aproximadamente $5 al día frente a aproximadamente $72 al día: la diferencia entre una funcionalidad que lanzas y una cuyo alcance recortas. Pero si la tarea es una extracción difícil de un contrato de 300K tokens en la que una respuesta incorrecta cuesta una hora de revisión humana, la prima de 13x es irrelevante y el modelo de razonamiento más fuerte gana con el primer error que no comete. Establece la suposición antes de mirar la línea de precio, no después.
Dónde gana realmente cada uno
Qwen3.8-Omni-Flash gana en todo lo que se mide en horas. Transcripción de reuniones con diarización y extracción de tareas de seguimiento, resumen de vídeos largos, informes de investigación audiovisual, canalizaciones de subtitulado y cualquier agente que tenga que decidir por sí mismo qué minuto de una grabación es relevante. La mejora de diarización reportada por el proveedor —la tasa de error de hablante de AliMeeting cayendo de 88,11 a 3,35— es el tipo de delta que convierte una canalización revisada manualmente en una automatizada, aunque un análisis técnico chino del lanzamiento sostiene que buena parte de esa ganancia proviene de la ingeniería de front-end y de diarización que envuelve al modelo, más que del propio modelo, así que pruébalo con tu propio audio antes de retirar el paso de revisión humana. El modelo omni también gana sin rodeos en precio para cualquier carga de trabajo de texto de gran volumen en la que su calidad de texto sea adecuada, la cual Alibaba afirma que es comparable a la de modelos solo de texto del mismo tamaño —una afirmación no reproducida, y que vale la pena poner a prueba en lugar de dar por sentada.
Qwen 3.8 gana dondequiera que la salida se juzgue en lugar de contarse: razonamiento complejo, trabajo agéntico de largo horizonte, trabajo de código a gran escala, análisis de documentos de un millón de tokens donde la síntesis es el producto. También gana en una dimensión que no tiene nada que ver con las pruebas de referencia: es de pesos abiertos. Si tu restricción es la residencia de datos, el despliegue en las instalaciones, el ajuste fino o simplemente no querer un proveedor en la ruta de inferencia, el modelo omni no es candidato en absoluto, y ninguna ventaja de precio cierra esa brecha. Esa única restricción decide más despliegues reales que todos los números anteriores.
Ejecutarlos sin dos contratos
La fricción práctica en una comparación como esta rara vez es la elección del modelo; es que terminas integrando dos proveedores, dos relaciones de facturación y dos conjuntos de código de cliente para descubrir cuál querías. Qwen3.8-Max —el endpoint que contiene el núcleo abierto de 2,4 billones de parámetros— está disponible en OrcaRouter bajo el id de modelo qwen/qwen3.8-max, a $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida, con un contexto de un millón de tokens y entrada de texto, imagen y vídeo, junto con más de 200 modelos adicionales en una sola clave al precio de lista del proveedor con 0% de recargo y conmutación por error automática entre proveedores si un endpoint se degrada. Qwen3.8-Omni-Flash no está en ese catálogo —se ejecuta en las plataformas propias de Alibaba—, así que la configuración honesta hoy es el modelo insignia en nuestra ruta y el modelo omni llamado directamente, con la capa de enrutamiento dándote un lugar donde poner al perdedor de la prueba una vez que la hayas ejecutado.

El veredicto
Elige Qwen3.8-Omni-Flash cuando la entrada sea larga, la salida corta y el volumen haga que el precio unitario sea la restricción determinante. Elige Qwen 3.8 cuando la entrada sea densa, la salida sea el producto y ni la corrección ni el control del despliegue sean negociables. La zona de solapamiento —la comprensión de vídeo— es el único lugar donde existe un enfrentamiento directo real, y en esa zona el modelo omni sostiene el argumento del coste y la duración, mientras que el modelo insignia sostiene el argumento del razonamiento y los pesos abiertos. Ejecuta ambos con tus propios datos antes de comprometerte; el modelo omni aún no cuenta con una evaluación independiente, y una ventaja de precio del día del lanzamiento es exactamente el tipo de cosa que conviene confirmar contra una factura y no contra un anuncio.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
