
Conoce Qwen3.8-LiveTranslate: el medio segundo que pone la interpretación con IA al ritmo humano
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-LiveTranslate se lanzó el 19 de septiembre de 2026, y todo el anuncio se reduce a una resta. El retardo promedio —LAAL, el desfase medio entre el momento en que una palabra sale de la boca de un hablante y el momento en que su traducción llega al oído del oyente— cae de 2,8 segundos en la generación anterior a 2,3 segundos. Los intérpretes humanos profesionales trabajan con un desfase entre el oído y la voz de aproximadamente 2 a 3 segundos. Esa es toda la historia: no que una máquina se haya vuelto más rápida, sino que su retardo ahora se sitúa dentro del rango en el que los oyentes dejan de notar que es una máquina. Las cifras de lanzamiento sitúan la calidad de traducción en FLEURS de la generación anterior en 83,0 xCOMET-XXL; esta se anuncia en 85,7. Ambas cifras son del proveedor, obtenidas con la propia configuración de evaluación del proveedor, y ninguna parte independiente las ha reproducido todavía, lo cual es la advertencia más importante de este artículo.
Lo que hace que el lanzamiento valga la pena leer más allá del titular es el mecanismo. Qwen no redujo la latencia creando un reconocedor más rápido o un sintetizador más ligero. Eliminó las costuras entre ellos.
Lo que realmente cambió: las costuras desaparecieron.
La interpretación simultánea clásica es una canalización de tres etapas que se ha ensamblado de la misma manera durante una década: el reconocimiento automático de voz transcribe la secuencia, la traducción automática convierte la transcripción y la síntesis de voz lee el resultado en voz alta. Cada etapa es un modelo separado con su propio presupuesto de latencia, y cada traspaso pierde algo: la prosodia en la primera, la identidad del hablante en la tercera, y unos pocos cientos de milisegundos fijos en cada límite donde un módulo tiene que esperar suficientes tokens para tener confianza.
Qwen3.8-LiveTranslate reemplaza esa cascada con lo que el proveedor denomina una arquitectura Interleave construida sobre un backbone Hybrid MoE, dividida en dos módulos cooperativos:
• Thinker — organiza video, audio, texto fuente y traducción en una única secuencia causal, intercalados por orden temporal, y produce comprensión más traducción de extremo a extremo en una sola pasada en lugar de en tres.
• Talker — toma el texto traducido junto con el original audio y sintetiza voz que conserva el timbre del hablante de origen, de modo que la voz doblada sea reconociblemente la de la persona que habló.
La afirmación arquitectónica es que, dado que el reconocimiento, la traducción y la síntesis comparten un mismo marco de modelado de secuencias en lugar de pasar mensajes entre los límites de los módulos, el sistema deja de pagar el impuesto entre módulos dos veces por cada enunciado. Esa es una explicación plausible de dónde vinieron los 0,5 segundos, y también es exactamente el tipo de afirmación que es barata de aseverar y costosa de verificar. Trátala como la explicación del proveedor, no como un resultado establecido.
Las tres capacidades que son genuinamente nuevas
La cobertura de idiomas no cambió: 60 idiomas de origen reconocidos, 29 disponibles para salida de voz — las mismas cifras que Qwen3.5-LiveTranslate. Las adiciones interesantes giran en torno a lo que ocurre cuando hay más de una persona hablando.
• Diarización de hablantes en tiempo real — cada frase se atribuye a un hablante a medida que se pronuncia, y la réplica del timbre de voz se describe como más estable en los cambios de turno. Qwen informa por sí mismo de una tasa de error de diarización del 9,7 % en su propio conjunto de pruebas largo con varios hablantes, frente al 30,6 % de Seed LiveInterpret 2.0. Ambas cifras proceden de Qwen.
• Origen y traducción en el mismo marco — el modelo emite la transcripción original y el texto traducido en una misma línea de tiempo, lo que permite formar un par de subtítulos bilingües en pantalla sin una segunda pasada de alineación.
• Desambiguación de contexto largo — el contexto anterior se arrastra hacia adelante para que los nombres, los tratamientos y los términos del dominio se mantengan consistentes. Esta es la que más importa en la práctica: el fallo clásico de la interpretación simultánea no es una palabra equivocada, sino que a la misma persona se la vierta de tres maneras distintas en una sola reunión.
La diarización es el elemento verdaderamente diferenciador aquí. Gemini 3.5 Live Translate, el modelo competidor de Google de voz a voz en tiempo real, tiene problemas documentados con la alternancia de turnos: puede costarle saber cuándo un hablante ha dejado de hablar realmente. Qwen está presentando la propiedad opuesta como una característica. Ninguna de las dos empresas ha publicado una comparación directa que lo dirima.

Leyendo con honestidad las afirmaciones del benchmark
Qwen fue probado en dos conjuntos, y vale la pena separarlos porque miden cosas diferentes.
• FLEURS, 70 direcciones de idioma — el benchmark de audio multilingüe público y ampliamente utilizado. Qwen afirma ser líder tanto frente a su predecesor como frente a lo que denomina los actuales sistemas de interpretación en tiempo real convencionales en cuanto a calidad de traducción, latencia media, precisión del reconocimiento de voz y calidad de la síntesis de voz. La comparación de xCOMET-XXL, 85,7 frente a 83,0, se encuentra aquí.
• Omnilingua-MSpeaker, 14 direcciones de idioma — el propio conjunto de evaluación de audio largo con múltiples hablantes de Qwen. La empresa afirma una mejor fidelidad, fluidez y concisión, además de una menor tasa de error de diarización. Un benchmark creado por el proveedor no carece de valor, pero tampoco es una prueba: fue diseñado por las mismas personas cuyo modelo se evalúa con él.
El resumen honesto es que FLEURS es real y público, así que el 85.7 es al menos comprobable en principio; Omnilingua-MSpeaker no lo es, así que la victoria en diarización es una afirmación hasta que alguien la vuelva a ejecutar. Ningún tercero ha publicado cifras de Qwen3.8-LiveTranslate en el momento de escribir esto, y el modelo tiene solo unas horas.
Cuánto cuesta la API y un número que te va a morder
Qwen3.8-LiveTranslate es de pesos cerrados y solo API. Se ejecuta a través de una API Realtime de WebSocket con el ID de modelo qwen3.8-livetranslate-flash-realtime, no a través de un endpoint HTTP simple. El precio es por millón de tokens y, como los tokens de audio son densos, las tarifas destacadas parecen sorprendentes junto a los modelos de texto hasta que recuerdas qué es un token de audio:
• Región de Singapur — entrada de audio $7.50, entrada de imagen $0.55, salida de texto $20.00, salida de audio $30.00 por millón de tokens.
• Región de Pekín — ¥40 de entrada de audio, ¥3,3 de entrada de imagen, ¥100 de salida de texto, ¥160 de salida de audio por millón de tokens, lo que equivale aproximadamente a $5,65 / $0,47 / $14,13 / $22,61 a los tipos de cambio actuales.
• Contexto — 53.248 tokens en total, divididos en 49.152 de entrada máxima y 4.096 de salida máxima.
• Límites de frecuencia — 10 solicitudes por minuto y 100.000 tokens por minuto, idénticos en ambas regiones.
Ese límite de velocidad es el número que hay que subrayar. Diez solicitudes por minuto es generoso para un puñado de salas de reuniones y dista mucho de ser suficiente para un despliegue de centro de contacto o una transmisión en vivo con miles de flujos concurrentes. Qwen ha mantenido el precio de la interfaz prácticamente plano respecto a la generación anterior —las tarifas de Pekín no han cambiado y Singapur es marginalmente más barato—, pero un modelo que está arquitectónicamente listo para escalar se aprovisiona como una vista previa. Cualquiera que planifique tráfico de producción debería leer el techo de 10 RPM como la restricción vinculante, no el precio por token.

Llamarlo no es como llamar a un modelo de chat.
La API Realtime está basada en eventos, lo que supone un modelo mental distinto al de un endpoint de completions. Abres un socket, recibes session.created, y luego envías un session.update para configurar la sesión antes de que se transmita cualquier audio.
• target_language es obligatorio y debe establecerse antes del primer fragmento de audio; no existe un destino predeterminado implícito.
• source_language es opcional y su valor predeterminado es la detección automática.
• output_modalities selecciona ["text"] solo para transcripción o ["text","audio"] para voz traducida.
• input_audio_buffer.append envía hacia arriba fragmentos PCM codificados en base64; response.text.delta y response.audio.delta vuelven hacia abajo, y response.done marca el final de un turno.
Dos notas prácticas. En primer lugar, un navegador no puede establecer una cabecera Authorization en un handshake de WebSocket, así que la conexión tiene que abrirse del lado del servidor y el audio retransmitirse al cliente a través de tu propio socket; esto no es algo que se conecte directamente en un front-end. En segundo lugar, Qwen advierte explícitamente que el conjunto de parámetros y eventos difiere de la generación anterior de LiveTranslate, por lo que cualquier código escrito para Qwen3.5-LiveTranslate necesita revisarse de nuevo en lugar de limitarse a reapuntarlo. Hay un endpoint de prueba gratuito en funcionamiento en omni.qwen.ai/live-translate si quieres escuchar el retardo antes de comprometer tiempo de ingeniería.
Lo que deliberadamente no hace
Qwen enumera un conjunto de capacidades como no disponibles, y la lista es esclarecedora. Sin llamadas a funciones. Sin salida estructurada. Sin búsqueda web. Sin continuación de prefijo, caché de contexto ni inferencia por lotes. Sin ajuste fino.
Es un especialista, no un generalista que se pone el sombrero de intérprete. No ejecutará tu bucle de agente ni será el modelo que resume la reunión. Diseña en consecuencia: el intérprete produce una transcripción y un flujo de audio traducido, y todo lo que viene después —el extractor de elementos de acción, el aplicador del glosario, la escritura de vuelta al CRM— es tarea de un modelo de texto aparte.
Esa división es donde un router se gana su lugar. Qwen3.8-LiveTranslate en sí está disponible a través de la propia API del proveedor y de varias plataformas de terceros; hoy no está en el catálogo de OrcaRouter, y no vamos a fingir lo contrario. Lo que sí ofrece OrcaRouter es el stack que lo rodea — incluido el buque insignia Qwen3.8-Max de la propia Alibaba, un modelo disperso de mezcla de expertos de 2,4 billones de parámetros con un contexto de 1M de tokens a $2,00 por millón de entrada y $6,00 por millón de salida, facturado al precio de lista del proveedor sin ningún margen añadido. Mantener el intérprete y los modelos que consumen su salida detrás de un único endpoint y una única clave significa que el pipeline de transcripción no necesita un segundo contrato cuando cambias el resumidor, y la conmutación automática por error mantiene viva la mitad posterior del sistema cuando un solo proveedor tambalea — lo cual, a 10 solicitudes por minuto, es un escenario que merece la pena planificar en lugar de descubrir.

Qué ver a continuación
Dos cosas convertirían este lanzamiento de una afirmación bien argumentada en un hecho establecido. La primera es una medición independiente de la latencia: LAAL es una métrica bien definida, y cualquiera que tenga el endpoint de prueba y un montaje con cronómetro puede producir una cifra que Qwen no haya generado. La segunda es la propia hoja de ruta declarada por Qwen —acercarse más al mínimo de latencia, memoria a largo plazo entre sesiones y cobertura de idiomas de cola larga y dialectos regionales—. El punto de la cola larga es el que hay que exigirles, porque 60 idiomas de origen es una cifra respetable que excluye discretamente a la mayoría de los hablantes del mundo, y la brecha entre una demo que funciona en mandarín e inglés y otra que funciona en yoruba o quechua es donde los productos de interpretación en tiempo real históricamente se han estancado.
Por ahora, la postura razonable es que Qwen3.8-LiveTranslate es el primer modelo de interpretación simultánea cuyo número estrella se enmarca frente a intérpretes humanos en lugar de frente a su propio predecesor, y ese encuadre es una prueba mucho más difícil de superar que la que sustituye. Todavía no la ha superado. Solo se ha ofrecido como voluntario para intentarlo.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
