
Gemini 3.8 Live vs GLM-4-Voice: Lo que 21 meses de IA de voz realmente han conseguido
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 459 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 183 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
GLM-4-Voice se lanzó el 3 de diciembre de 2024. Gemini 3.8 Live fue anunciado el 15 de septiembre de 2026. Eso son 21 meses, y es el hecho más importante en esta comparación — más importante que cualquier benchmark, porque determina qué tipo de pregunta estás haciendo en realidad.
Estos dos modelos no son rivales. Nadie que despliegue voz a escala en 2026 está eligiendo entre ellos por calidad. La verdadera pregunta es la que plantea GLM-4-Voice y que Gemini 3.8 Live no puede responder: ¿qué haría falta para tener esto en propiedad en lugar de alquilarlo? Esa pregunta tiene una respuesta genuina, y ha cambiado menos en 21 meses de lo que cabría esperar.
Lo que Google lanzó y lo que Zhipu lanzó
Gemini 3.8 Live es un modelo de diálogo en vivo alojado y de pesos cerrados. Gestiona entrada visual casi en tiempo real, detecta y cambia automáticamente entre 97 idiomas admitidos a mitad de la conversación, y ejecuta herramientas y llamadas a la API en segundo plano mientras la conversación continúa. Está disponible para desarrolladores a través de la API de Gemini y Google AI Studio, en vista previa privada en Gemini Enterprise, y en Search Live. El precio anunciado es de $0.005 por minuto de audio de entrada y $0.018 por minuto de audio de salida a través de la API Live; el gráfico de costo por hora de audio de entrada de Artificial Analysis lo sitúa de forma independiente en $1.50 por hora. Su hermano, Gemini 3.8 Live Extended Thinking, actualmente encabeza ese mismo índice con 82.6, mientras que Gemini 3.8 Live se sitúa en 76.0.
GLM-4-Voice es el primer modelo de voz de extremo a extremo de Zhipu AI, y es un checkpoint descargable. Es un ensamblaje de tres partes: un tokenizador de voz construido sobre un codificador Whisper-large-v3 con un cuello de botella de cuantificación vectorial de aproximadamente 0,4B de parámetros, un modelo de lenguaje autorregresivo (GLM-4-Voice-9B, inicializado a partir de GLM-4-9B) de unos 9B de parámetros, y un decodificador de flow matching reentrenado a partir de CosyVoice. Habla chino e inglés, admite emoción, tono, velocidad del habla y dialecto controlados por instrucciones —entre ellos el cantonés, el mandarín de Chongqing y el habla de Pekín—, y tokeniza la voz a 12,5 Hz en un único flujo de libro de códigos a aproximadamente 175 bps, un orden de magnitud inferior al de los códecs de audio neuronales típicos.
Las dimensiones, lado a lado:
• Lanzamiento — Gemini 3.8 Live: 15 de septiembre de 2026. GLM-4-Voice: 3 de diciembre de 2024.
• Pesos — cerrados, solo alojados frente a descargables, código Apache-2.0 con una licencia de pesos personalizada.
• Idiomas — 97 con cambio a mitad de conversación frente al chino y el inglés.
• Visión — entrada visual casi en tiempo real frente a ninguna.
• Llamada a herramientas — ejecución de herramientas y API en segundo plano a mitad de la conversación frente a la ausencia total de un canal de herramientas.
• Contexto — no publicado por Google frente a contexto de 8K, salida máxima de 4K.
• Requisito mínimo para el autoalojamiento — no aplicable frente a 32 GB de RAM más una GPU CUDA de forma oficial; aproximadamente 12 GB de VRAM en int4.
• Marca de agua — SynthID en todo el audio generado frente a ninguno descrito.

21 meses compraron capacidad, no solo calidad
La historia fácil es que un modelo de frontera de 2026 supera a un checkpoint abierto de 2024. Así es, y por un margen amplio —pero la observación más útil es que la categoría cambió de forma en lugar de avanzar a lo largo de un solo eje.
Según el propio informe técnico de Zhipu, GLM-4-Voice obtiene una precisión de voz a texto del 93.6% en Topic-StoryCloze, un 82.9% de voz a voz, una naturalidad UTMOS de 4.45 y un QA hablado de 5.40/10 en general y 5.20/10 en conocimiento — todo autoinformado y no reproducido. La evaluación independiente es más escasa y menos halagadora: en VoiceBench registra un 56.48 general, situándose alrededor del puesto 29 de 42 en una tabulación y del 30 de 40 en otra, con la comprensión multiturno descrita como débil en ambos idiomas. En el benchmark de comprensión de diálogo multiturno C³, alcanza un 11.09% en chino y un 33.22% en inglés. VCB Bench encontró que lideraba en control emocional con 93.0 en la sub-métrica SIF china, y un fuerte alineamiento texto–voz, pero el manejo de dialectos de TELEVAL alcanzó un 4.57% sin instrucción explícita.
Esos números describen un modelo que es bueno en la expresión vocal y malo en la comprensión sostenida. Ese es un modelo de voz de 2024 en una sola frase.
El 76,0 de Gemini 3.8 Live en el Speech to Speech Index de Artificial Analysis es una puntuación compuesta que combina razonamiento de voz, rendimiento agéntico, preferencia en la arena y tasa de éxito en tareas. No se trata de que el modelo más nuevo sea mejor en la misma tarea por un múltiplo mayor. Se trata de que la puntuación compuesta ahora sí incluye rendimiento agéntico y éxito en tareas — categorías en las que GLM-4-Voice no puede competir porque no tiene canal de herramientas. Al modelo de 2024 se le está poniendo nota en un juego que nunca fue diseñado para jugar.

La licencia es la parte que la gente se salta.
Si estás mirando GLM-4-Voice porque es abierto, lee los términos antes de que los pesos terminen de descargarse. La división es real y es fácil malinterpretarla:
• Code — Apache-2.0. Genuinamente permisiva.
• Pesos — una licencia personalizada que requiere atribución y registro con Zhipu para uso comercial.
«Pesos abiertos» y «Apache-2.0» no son la misma afirmación, y gran parte de la cobertura secundaria de este modelo los confunde. Si pretendes lanzar un producto comercial basado en GLM-4-Voice, el requisito de registro es un paso legal, no una formalidad, y debería estar en la ruta crítica. Un tracker va más allá y describe el modelo como propietario con uso comercial condicional. En cualquier caso, la ausencia de una factura por minuto no es la ausencia de una relación comercial.
La aritmética de los costos, hecha con honestidad
El argumento a favor del autoalojamiento es que un costo mensual fijo supera a uno por minuto cuando hay volumen. Ese argumento es real, y es más pequeño de lo que parece una vez que cuentas lo que estás operando.
GLM-4-Voice requiere oficialmente 32 GB de RAM y una GPU CUDA. Las cuantizaciones int4 de la comunidad funcionan con unos 12 GB de VRAM, en la práctica alrededor de 10–11 GB, lo que es territorio de una RTX 3060, con un techo práctico de unos 30 segundos de habla por turno. Una A10 en la nube a unos $0,50–$1,00 por hora equivale a entre $350 y $700 al mes por una instancia en ejecución continua, y eso antes de haber atendido a un solo usuario, sin conmutación por error, sin capacidad de ráfaga y sin nadie a quien avisar cuando el decodificador produce ruido a las 3 de la madrugada.
Frente a eso, Gemini 3.8 Live a $1.50 por hora de audio de entrada significa que con $350 compras aproximadamente 233 horas de voz. Eso no es evidentemente peor, y viene con capacidad que no habías aprovisionado. El punto de cruce existe; es más alto de lo que sugiere la comparación de titulares, y se desplaza según si tu tráfico es constante o en ráfagas. El tráfico en ráfagas es el caso en el que el precio por minuto gana de forma decisiva, porque las GPU inactivas facturan exactamente igual que las ocupadas.
También hay una diferencia en lo que obtienes por el dinero. Los informes de la comunidad sobre despliegues cuantizados de GLM-4-Voice sitúan la latencia del diálogo continuo en 38–120 ms, aunque esas cifras proceden de artículos, no de Zhipu. Google no ha publicado en absoluto la latencia de Gemini 3.8 Live. Si la baja latencia es un requisito estricto para ti, ninguno de los dos tiene una cifra sobre la que puedas planificar: uno cuenta con mediciones de la comunidad de terceros, y el otro con testimonios de socios y ninguna cifra.

La opción intermedia: ser dueño de la lógica, alquilar la capacidad
Enmarcar esto como autoalojado frente a alojado pasa por alto la configuración en la que la mayoría de los equipos acaba de todos modos. GLM-4-Voice no tiene canal de herramientas, así que cualquier producto construido sobre él necesita un modelo de texto aparte para hacer las búsquedas, lo que significa que el modelo de voz autoalojado se sitúa delante de un modelo de texto alojado en cualquier caso. La decisión de despliegue y la decisión de capacidades son separables.
Esa división es donde un router hace trabajo de verdad. OrcaRouter ofrece 190 modelos tras una sola clave al precio de lista del proveedor, sin margen añadido, así que el destino de delegación que hay detrás de tu front-end de voz se puede cambiar sobre tráfico en vivo sin reconstruir nada, y una bajada de precio del proveedor upstream te llega el mismo día en lugar de en la siguiente renovación. El failover automático importa más de lo habitual en una configuración autoalojada, porque cuando lo que se cayó es tu propia instancia de GPU, el modelo de backend sigue siendo accesible y la sesión no tiene por qué morir con ella. Dos aclaraciones, ya que esta comparación invita a la confusión: nosotros no alojamos GLM-4-Voice, y los endpoints Gemini 3.8 Live tampoco están en nuestro router: esos vienen de sus proveedores. Lo que sí está en el router es la capa de texto a la que ambos le pasan el trabajo.
La decisión, y la lección que subyace en ella
Elige GLM-4-Voice si necesitas el modelo en tu propio hardware, si tu tráfico es realmente constante con un volumen alto, si vas a desarrollar solo en chino o en inglés, y si necesitas modificar el modelo en lugar de llamarlo. Presupuesta el registro de la licencia como una tarea real, y espera resolver tú mismo la comprensión multiturno — es el punto débil documentado del modelo y ninguna cantidad de ajuste fino en torno a un límite de salida de 4K logrará ocultar eso por completo.
Elige Gemini 3.8 Live si tus requisitos incluyen visión, llamada a herramientas, más de dos idiomas o cualquier patrón de tráfico que describirías como con picos. Es un modelo de vista previa con cifras de contexto y latencia no publicadas, lo que supone un riesgo real de planificación, pero también es el único de los dos que puede buscar algo a mitad de frase.
La lección general vale más que cualquiera de los dos veredictos. Veintiún meses de IA de voz produjeron un modelo que no es principalmente un mejor modelo de voz —es una interfaz de voz hacia un agente. Si tu razón para querer pesos abiertos era el coste, la aritmética está más ajustada de lo que sugiere el planteamiento sin licencias. Si tu razón era el control, eso no se ha comoditizado en absoluto, y GLM-4-Voice sigue siendo una respuesta legítima a una pregunta que Gemini 3.8 Live no aborda.
