
Qwen3.8-LiveTranslate vs Qwen 3.8: una colisión de nombres, no una comparación justa
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Busca uno de estos modelos y se te mostrará el otro. Qwen3.8-LiveTranslate, lanzado el 19 de septiembre de 2026, y Qwen3.8-Max — el modelo al que se refiere la mayoría de la gente cuando escribe «Qwen 3.8» sin sufijo, disponible de forma general desde el 3 de agosto de 2026 y actualizado como Qwen3.8-Max-0902 el 2 de septiembre — comparten un prefijo de generación y casi nada más. Uno es un sistema de interpretación simultánea que recibe audio y devuelve audio traducido y texto, facturado a través de un WebSocket con el ID qwen3.8-livetranslate-flash-realtime. El otro es un generalista de mezcla dispersa de expertos con 2,4 billones de parámetros y una ventana de contexto de 1 millón de tokens que no puede oír absolutamente nada. Ponerlos frente a frente es un error de categoría, y el hecho de que tanta gente llegue a ese error es la verdadera historia aquí: el proveedor ahora distribuye al menos cuatro cosas distintas bajo el nombre Qwen 3.8, y el esquema de nombres no te dice cuál quieres.
Lo que realmente es cada uno
La generación Qwen 3.8 se lanzó por capas a lo largo de la segunda mitad de 2026, y las capas no son intercambiables.
Qwen3.8-Max es el modelo insignia alojado: un modelo MoE disperso con aproximadamente 2,4 billones de parámetros totales y unos 95.000 millones activos por pasada hacia delante, un contexto de 1 millón de tokens, y entrada de texto, imagen y vídeo con salida solo de texto. Su precio es de 2,00 $ por millón de tokens de entrada y 6,00 $ por millón de tokens de salida, con lecturas de caché a 0,250 $ por millón. Las puntuaciones reportadas por el proveedor lo sitúan en 86,6 en Terminal-Bench 2.1, 92,6 en GPQA Diamond, 67,7 en SWE-bench Pro y 43,6 en Humanity's Last Exam.
Qwen3.8-2.4T-A95B es el lanzamiento de pesos abiertos de la misma generación, publicado el 12 de agosto de 2026: 512 expertos enrutados en 92 capas, 69 de esas capas con atención lineal y aproximadamente 4,89 TB de pesos. Es el modelo al que la mayoría de la gente se refiere cuando dice "Qwen 3.8" y habla de ejecutar algo por su cuenta en lugar de llamar a una API.
Qwen3.8-27B es el pequeño checkpoint abierto de la misma familia, y Qwen3.8-LiveTranslate es el especialista: un intérprete de arquitectura Interleave construido sobre un diseño Thinker–Talker de MoE híbrida, con 60 idiomas de origen reconocidos y 29 disponibles para la salida de voz.
El eje que los separa no es el tamaño. Es la modalidad. Qwen3.8-Max no tiene ninguna vía de entrada de audio ni salida de audio alguna. Pedirle que interprete una conversación en vivo no es cuestión de formularle mejores indicaciones; la capacidad no está en el modelo.
El contraste de especificaciones
Puestos uno al lado del otro, los dos modelos apenas coinciden en ninguna dimensión que le importe a un comprador:
• Trabajo principal — Qwen3.8-LiveTranslate: interpretación simultánea de voz a voz. Qwen3.8-Max: razonamiento general, programación, trabajo agéntico y de texto multimodal.
• Modalidad de entrada — Qwen3.8-LiveTranslate: audio e imagen. Qwen3.8-Max: texto, imagen y vídeo.
• Modalidad de salida — Qwen3.8-LiveTranslate: texto y audio sintetizado. Qwen3.8-Max: solo texto.
• Ventana de contexto — Qwen3.8-LiveTranslate: 53.248 tokens (49.152 de entrada / 4.096 de salida). Qwen3.8-Max: 1.000.000 tokens.
• Pesos — Qwen3.8-LiveTranslate: cerrado, solo API. Qwen3.8-Max: alojado, con su hermano abierto Qwen3.8-2.4T-A95B publicado bajo la misma generación.
• Límites de velocidad — Qwen3.8-LiveTranslate: 10 solicitudes y 100.000 tokens por minuto. Qwen3.8-Max: rendimiento alojado estándar, sin límite en tiempo real por solicitud.
La disparidad de contexto es la que sorprende a la gente. Qwen3.8-Max admite un millón de tokens; el intérprete admite alrededor del cinco por ciento de eso. Pero un intérprete en tiempo real no necesita un contexto largo: necesita una memoria breve y muy rápida. Su límite de entrada de 49.152 tokens está dimensionado para llevar hacia adelante los últimos minutos de una conversación y mantener la coherencia de nombres y terminología, que es exactamente la tarea que realiza la "desambiguación de contexto largo". Juzgar al intérprete por su número de contexto es como juzgar un motor de carreras por su tanque de combustible.

Por qué la comparación de precios es una trampa
Por millón de tokens, el intérprete parece drásticamente más caro que el modelo insignia: $7.50 por millón de tokens de entrada de audio frente a $2.00 por millón de tokens de entrada de texto, y $30.00 por millón de tokens de salida de audio frente a $6.00 por millón de tokens de salida de texto.
Esa comparación no tiene sentido, y es el error más común que se comete con esta clase de modelo. Los tokens de audio y los de texto no son la misma unidad. El habla se codifica en tokens de audio con una densidad que no guarda ninguna relación con el mismo contenido escrito: un minuto de conversación consume muchísimos más tokens de audio que los tokens de texto que consume su transcripción, y el audio de salida añade un segundo flujo por encima. Poner ambas tasas una al lado de la otra implica una proporción de costos que no existe en la práctica.
La diferencia estructural importa más que la diferencia de precio. Qwen factura al intérprete por token, mientras que gran parte del mercado de voz en tiempo real factura por minuto de sesión. Esos dos modelos de precios se comportan de manera completamente distinta a medida que tu audio se vuelve más silencioso, tus sesiones se acortan o tus hablantes hacen pausas: un medidor por minuto cobra por el silencio, y un medidor por token no. Si estás construyendo un modelo de costos, la pregunta no es qué tarifa es más baja; es qué medidor castiga la forma de tu uso. Y fíjate en la división regional: los precios de Pekín son de ¥40 / ¥3.3 / ¥100 / ¥160 por millón para entrada de audio, entrada de imagen, salida de texto y salida de audio, respectivamente, muy por debajo de las tarifas de Singapur, que es el tipo de diferencia que solo se vuelve visible cuando comparas las dos línea por línea.
Un punto más a favor del intérprete en cuanto a coste: Qwen mantuvo estas tarifas prácticamente sin cambios frente a Qwen3.5-LiveTranslate, con Pekín sin cambios y Singapur ligeramente más barato. Que llegue una nueva generación sin un aumento de precio no es la norma en este mercado.
Los pesos abiertos frente a solo API es la verdadera línea divisoria
Si estás eligiendo entre estos dos por principios y no por capacidad, el factor decisivo es la licencia.
Qwen3.8-Max está disponible en versión alojada, y los pesos de la clase Max de esta generación se publicaron como código abierto bajo el nombre Qwen3.8-2.4T-A95B en agosto. Esa vía existe, pero no es para cualquiera: 4,89 TB de pesos son hardware de centro de datos, y la licencia de pesos abiertos exige que las organizaciones que facturen más de 50 millones de dólares en un período de doce meses obtengan una licencia comercial de Alibaba Cloud.
Qwen3.8-LiveTranslate no tiene esa vía. Es de pesos cerrados y solo mediante API, accesible a través de una API Realtime de WebSocket que requiere quetarget_language se establezca en unsession.update evento antes de que se transmita ningún audio; no admite llamadas a funciones, ni salida estructurada, ni almacenamiento en caché de contexto, ni inferencia por lotes, ni ajuste fino. Si su requisito es ejecutar el intérprete en su propio hardware, este modelo no lo cumple y ninguna cantidad de ingeniería cambiará eso.
Eso importa para un tipo específico de comprador: el que no puede enviar audio a un tercero — un hospital, un bufete de abogados, un contratista gubernamental. Para todos los demás, la pregunta práctica es si el intérprete es lo suficientemente bueno como para justificar la dependencia, y la respuesta a eso es una medición que Qwen aún no ha permitido que nadie haga.

Elegir por trabajo, no por nombre
La respuesta correcta a «Qwen3.8-LiveTranslate o Qwen 3.8» es que probablemente necesitas la respuesta a una pregunta diferente.
• Si la tarea es interpretación en vivo —una reunión, una llamada, una transmisión—, solo uno de estos puede hacerlo, y no es el buque insignia.
• Si la tarea consiste en resumir lo que se dijo, extraer elementos de acción, responder preguntas sobre la transcripción o redactar el seguimiento, solo el modelo insignia puede hacerlo, y no es el intérprete.
• Si el trabajo es ambas cosas, estás construyendo un pipeline, y estarás pagando a dos proveedores con dos contratos y dos conjuntos de credenciales a menos que consolides de forma deliberada.
Ese tercer caso es el habitual, y es donde ejecutar ambas mitades detrás de un único endpoint deja de ser una comodidad y empieza a ser arquitectura. Qwen3.8-Max está en OrcaRouter al precio de lista del proveedor de $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida con cero margen de beneficio repercutido, por lo que un recorte de precio de Qwen llega a tu factura el mismo día en lugar de en la próxima renovación de contrato, y la conmutación por error automática significa que la mitad resumidora del pipeline no se apaga cuando un proveedor tiene una hora mala.
Para ser explícitos sobre la otra mitad, porque la distinción importa: Qwen3.8-LiveTranslate no está en nuestro catálogo. Está disponible a través de la propia API de Model Studio de Alibaba y del endpoint de prueba del proveedor en omni.qwen.ai/live-translate, y no vamos a dar a entender que enrutamos un modelo que no enrutamos. Lo que puedes poner detrás de una sola clave hoy es la pila posterior: los modelos que consumen lo que produce el intérprete.

El problema de la nomenclatura es el verdadero hallazgo
Cuatro modelos, un prefijo, ninguna convención de sufijos en la que un lector pueda confiar. «Qwen 3.8» se resuelve como el modelo insignia alojado, el checkpoint abierto de 2,4T, el modelo pequeño de 27B o el intérprete, según quién lo escriba y qué haya leído por última vez. Las tablas de benchmarks publicadas no ayudan, porque el insignia las tiene y el intérprete, en su mayoría, no: Qwen3.8-Max puede ubicarse en Terminal-Bench o GPQA Diamond, mientras que la evidencia de Qwen3.8-LiveTranslate es un retraso promedio de 2,3 segundos, un 85,7 de xCOMET-XXL en FLEURS reportado por el proveedor, y una tasa de error de diarización del 9,7 % autodeclarada, sin replicación independiente.
Así que la comparación que esta página pretende responder es en realidad una advertencia. Antes de comparar Qwen 3.8 con cualquier cosa, establece a qué Qwen 3.8 te refieres. Si acepta audio, es el intérprete, y es un especialista que compras para un solo trabajo. Si acepta video, es el buque insignia, y es un generalista que compras para los otros veinte. Cualquier evaluación que los mezcle producirá una conclusión sobre ninguno de los dos.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
