
Qwen3.8-LiveTranslate vs. Gemini 3.5 Live Translate: uno lanza un número, el otro lanza un mapa
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Los dos principales modelos de traducción de voz en tiempo real no coinciden en qué están dispuestos a que se les mida, y esa discrepancia es más útil que cualquier comparación de especificaciones. Qwen3.8-LiveTranslate, lanzado el 19 de septiembre de 2026, encabeza su presentación con una única cifra contundente: un retardo medio de 2,3 segundos, frente a los 2,8 de la generación anterior. Gemini 3.5 Live Translate, el modelo de voz a voz del proveedor anunciado en junio de 2026 y que aún conserva un ID de modelo en versión preliminar, encabeza la suya con el alcance: más de 70 idiomas, detección automática, cambio de idioma a mitad de conversación e integración en las aplicaciones Translate y Meet del proveedor. Una empresa publicó una cifra de latencia de la que se le puede exigir responsabilidad. La otra publicó un número de idiomas. Si tienes que elegir entre ambos, entender por qué son tipos de promesas distintos importa más que cuál lista es más larga.
Dos arquitecturas que coinciden en el objetivo y en nada más
Ambos modelos existen para acabar con el mismo comportamiento: el traductor por turnos que espera a que termines una frase antes de decir nada. Esa pausa es lo que hace que la interpretación automática se sienta como interpretación automática.
Qwen3.8-LiveTranslate lo consigue con una arquitectura Interleave sobre una arquitectura troncal MoE híbrida, dividida en un módulo Thinker que integra audio, vídeo, texto fuente y traducción en una única secuencia causal, y un módulo Talker que resintetiza la traducción con el timbre del hablante original. La afirmación es que colapsar reconocimiento, traducción y síntesis en una sola secuencia elimina la latencia y la pérdida semántica que un pipeline de tres etapas paga en cada límite de módulo.
Gemini 3.5 Live Translate adopta la misma posición de extremo a extremo desde la dirección opuesta: está construido sobre Gemini 3 Pro como un modelo nativo de audio a audio, que transmite de forma continua a través de la Gemini Live API en lugar de ejecutar una cascada discreta ASR → MT → TTS. En la práctica, mantienes un WebSocket bidireccional persistente, envías fragmentos de audio de 100 ms hacia arriba y recibes fragmentos de audio traducidos hacia abajo. Ninguno de los dos modelos hace lo de antes. Ambos ahora hacen lo nuevo. Las diferencias están todas en los detalles de segundo orden.
La comparación de latencia no es el empate que parece.
Google describe Gemini 3.5 Live Translate como que se mantiene «unos segundos por detrás» del hablante. No ha publicado una cifra LAAL, ni ninguna otra métrica de latencia reproducible y con nombre, para el modelo. Qwen ha publicado 2,3 segundos y ha definido qué significa.
Esta asimetría se reduce sistemáticamente a «ambos rondan los dos o tres segundos». Esa lectura no está respaldada por nada de lo que haya dicho ninguna de las dos empresas. La frase de Google es compatible con 2 segundos y compatible con 4; la empresa simplemente se ha negado a que la fijen. La comparación que realmente se puede hacer hoy es:
• Métrica de latencia publicada — Qwen3.8-LiveTranslate: LAAL 2,3 s, reportado por el proveedor. Gemini 3.5 Live Translate: ninguna publicada.
• Medición independiente de la latencia — ninguno, para ninguno de los dos modelos. Ningún tercero ha publicado una comparación directa.
La conclusión honesta es que, en cuanto a latencia, Qwen ha hecho una afirmación falsable y Google ha hecho una vaga. Eso es un punto a favor de Qwen en transparencia y exactamente cero puntos a su favor en rendimiento hasta que alguien mida ambas. Si la latencia es el factor decisivo para tu despliegue, el estado actual de la evidencia no respalda una decisión de compra en ninguna de las dos direcciones.

60 idiomas frente a más de 70 es el marcador equivocado
Las cifras de idiomas se citan constantemente y engañan en ambos sentidos.
Qwen3.8-LiveTranslate reconoce 60 idiomas de origen y produce salida hablada en 29 de ellos. Gemini 3.5 Live Translate admite más de 70 idiomas con detección automática, y en Google Meet eso se amplía a más de 2.000 combinaciones de idiomas, donde el límite anterior era la traducción basada en inglés entre cinco idiomas.
Lee atentamente el segundo número antes de considerarlo una victoria triple. La cifra de más de 2.000 de Google cuenta pares ordenados —cada idioma de origen cruzado con cada idioma de destino—, lo cual es una medida legítima y genuinamente útil de cobertura, pero no comparable con un recuento de un solo idioma. Y la lista de Google, aunque más amplia, está muy inclinada hacia idiomas con grandes poblaciones de hablantes: afrikáans, árabe, bengalí, neerlandés, inglés, francés, alemán, hindi, indonesio, italiano, japonés, coreano, malayo, persa, polaco, portugués, ruso, español, suajili, tamil, telugu, tailandés, turco, ucraniano, urdu, vietnamita y zulú. Los 29 idiomas de salida hablada de Qwen son aún más limitados, y la lista de ninguno de los dos proveedores es una respuesta seria a la cola larga —los dialectos regionales y los idiomas de bajos recursos en los que las herramientas de interpretación han fallado históricamente de forma más grave. Ambas empresas dicen que están trabajando en ello. Ninguna lo ha lanzado.
Donde los dos realmente divergen: la sala llena de gente
El único punto en el que los modelos ofrecen promesas genuinamente distintas es el manejo de múltiples hablantes, y es la diferencia con más probabilidades de decidir un despliegue real.
Qwen3.8-LiveTranslate incluye diarización de hablantes en tiempo real: cada oración se atribuye a un hablante a medida que llega, y la replicación de voz se describe como estable a lo largo de los cambios de turno. Qwen reporta por sí mismo una tasa de error de diarización del 9,7 % en su propio conjunto de pruebas largo con múltiples hablantes, frente al 30,6 % de Seed LiveInterpret 2.0 — una comparación de proveedor en una evaluación realizada por el proveedor, así que trátala como una afirmación con un número adjunto en lugar de como un resultado. El modelo también emite el texto de origen y la traducción en la misma línea de tiempo, lo que hace posibles los subtítulos bilingües sincronizados sin una pasada de alineación separada.
Gemini 3.5 Live Translate pone el énfasis justo en lo contrario. Su fortaleza documentada es la preservación de la prosodia —mantener el tono, el ritmo, la entonación y el registro emocional del hablante, de modo que la voz traducida conserve la sensación del original—. Sus debilidades documentadas están precisamente donde la diarización ayudaría: una clonación de voz inconsistente que puede desviarse tras pausas prolongadas o decantarse por el género equivocado, una débil gestión de los turnos de palabra sin una señal clara de final de frase, problemas con acentos marcados y con pares de idiomas estrechamente relacionados como el español y el portugués, y un manejo imperfecto del ruido de fondo. Google también limita las sesiones de audio puro a 15 minutos salvo que se amplíen, y marca cada flujo de audio generado con una marca de agua SynthID que actualmente no se puede eliminar.
• Atribución de múltiples hablantes — Qwen: diarización en tiempo real, DER declarado del 9,7 %. Gemini: toma de turnos débil documentada, sin declaración de diarización.
• Fidelidad de voz — Qwen: reproducción del timbre de origen mediante el módulo Talker. Gemini: preservación de la prosodia, el tono y el ritmo; deriva de clonación documentada.
• Salida bilingüe — Qwen: el texto original y la traducción se emiten en la misma línea de tiempo. Gemini: transcripción opcional de entrada y salida, configurada por sesión.
• Marca de agua — Qwen: no se indica ninguna. Gemini: SynthID en todo el audio generado, sin ruta de eliminación.
• Duración de la sesión — Qwen: no especificado. Gemini: límite de 15 minutos en sesiones de audio puro.
• Tipos de entrada — Qwen: audio e imagen. Gemini: solo audio, sin entrada de texto.

Cuánto cuesta realmente ejecutar cada uno
Qwen3.8-LiveTranslate tiene un precio por millón de tokens a través de la WebSocket Realtime API. En la región de Singapur: $7,50 por entrada de audio, $0,55 por entrada de imagen, $20,00 por salida de texto y $30,00 por salida de audio. En Pekín: ¥40 / ¥3,3 / ¥100 / ¥160 por millón — aproximadamente $5,65 / $0,47 / $14,13 / $22,61. Su contexto es de 53.248 tokens y el límite de velocidad es de 10 solicitudes por minuto y 100.000 tokens por minuto en ambas regiones.
Ese límite de 10 RPM es el número más trascendental en la lista de tarifas. Los términos comerciales de Gemini 3.5 Live Translate no se publican de la misma manera, lo que en sí mismo es una señal sobre su madurez: Google lo está distribuyendo a través de la Live API y AI Studio en vista previa pública, Google Meet en vista previa privada para clientes seleccionados de Workspace, y la aplicación Translate en Android e iOS. Los precios de vista previa y los límites de velocidad de vista previa están sujetos a cambios sin previo aviso, y Google no se ha comprometido a una fecha de disponibilidad general.
Así que, ahora mismo, la comparación de costos es entre un modelo con un precio publicado y un techo de concurrencia estricto, y un modelo sin precio publicado y con un techo no especificado. Si necesitas modelar la economía unitaria este trimestre, solo uno de ellos se puede presupuestar.

Lo que tendría que demostrar una prueba independiente
Todo lo anterior se basa en los propios anuncios de los dos proveedores, porque nadie ha enfrentado estos modelos entre sí. Un resultado que realmente zanjara este enfrentamiento necesita cuatro cosas, y ninguna de ellas existe todavía:
• LAAL medido de la misma manera en ambos modelos, con el mismo audio, en los mismos pares de idiomas — la cifra de 2,3 s de Qwen no puede compararse con nada que Google se haya negado a declarar.
• Tasa de error de diarización en un corpus compartido de múltiples hablantes, no en el conjunto Omnilingua-MSpeaker propio de Qwen.
• Estabilidad de la clonación de voz a lo largo de sesiones largas, que es donde la propia documentación de Gemini advierte deriva y Qwen hace su afirmación más contundente.
• Comportamiento en los límites de concurrencia: si los 10 RPM de Qwen aguantan bajo la carga real de reuniones y si las cuotas de vista previa de Gemini sobreviven al contacto con producción.
Hasta que esa prueba exista, la posición defendible es estrecha: Qwen ha publicado más y ha prometido cosas más específicas; Google tiene una cobertura de idiomas más amplia y una huella de distribución que ningún modelo únicamente de API puede igualar.
¿Cuál elegir?
Céntrate en la forma de tu problema, no en el marcador, porque el marcador aún no es confiable.
Si tu carga de trabajo implica a varias partes y la atribución importa —transcripción de reuniones, un panel, una sala de audiencias, cualquier caso en el que saber quién dijo una frase traducida forme parte del valor—, Qwen3.8-LiveTranslate es el único de los dos que afirma tener esa capacidad, y la debilidad documentada de Gemini a la hora de respetar los turnos de palabra apunta en la misma dirección. Si tu carga de trabajo abarca muchos idiomas, está orientada al consumidor y ya forma parte del ecosistema de Google, los más de 70 idiomas de Gemini 3.5 Live Translate y su presencia en la aplicación Translate y en Meet son ventajas que ningún competidor exclusivamente de API iguala en distribución.
Si vas a construir un producto en lugar de comprar una demo, ten en cuenta que ambos son especialistas de nicho. Ninguno ejecuta un bucle de agente ni resume, y Qwen3.8-LiveTranslate declara explícitamente que no admite llamadas a funciones, salida estructurada, caché de contexto ni ajuste fino. El intérprete es la parte inicial de tu pipeline, no su totalidad. OrcaRouter no es el lugar para llamar a ninguno de los dos modelos de traducción hoy; ninguno está en nuestro catálogo, y preferimos decirlo antes que dar a entender lo contrario. Lo que sí ofrecemos es la mitad del stack que consume la transcripción: una sola clave para más de 200 modelos al precio de lista del proveedor y sin ningún margen añadido, para que el resumidor, el aplicador de glosarios o el agente posterior que lean esa transcripción puedan intercambiarse o conmutarse a un respaldo sin tocar un segundo contrato con proveedor.
La parte inferior de eso
Qwen3.8-LiveTranslate y Gemini 3.5 Live Translate son lo bastante similares en lo fundamental como para que el marketing se haya convertido en el factor diferenciador: uno publicó una cifra de latencia y una tarifa, el otro publicó un mapa de idiomas y un ecosistema. Ninguno se ha sometido a una prueba independiente. La versión de esta comparativa que vale la pena leer es la que se escriba después de que alguien ejecute ambos con el mismo audio, y dado lo rápido que se mueve esta categoría, puede que falte poco para eso.
Comparados en este artículo3
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
