
Gemini 3.8 Live con Live Avatar: Google le pone cara a su modelo de voz
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 181 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking se lanzaron el 15 de septiembre de 2026 — los dos endpoints nativos de diálogo en vivo que Google abrió en la API del proveedor, uno optimizado para la latencia y otro para la deliberación. El 24 de septiembre, la compañía anunció Gemini 3.8 Live con Live Avatar, que combina la generación de video casi en tiempo real con el mismo bucle de voz, de modo que el modelo tiene un rostro mientras habla. Nada cambió en los dos ID de modelo. Lo que cambió es cómo puede verse la conversación y —de forma más trascendente— qué puede hacerle el modelo a la conversación mientras esta aún está en curso.
¿Qué se lanzó realmente el 24 de septiembre?
La publicación de DeepMind es breve y específica, y vale la pena separar lo que afirma de lo que significa. Live Avatar, en palabras de Google, "brinda presencia visual casi en tiempo real a la IA conversacional de Gemini" al combinar la generación de video en tiempo real con la pila de voz existente. La empresa describe una sincronización labial precisa, expresiones naturales y turnos de conversación fluidos, y da dos ejemplos de implementación: atención al cliente y recorridos interactivos. Luego dice la frase que más importa para cualquiera que planee una implementación: "A partir de hoy, Gemini 3.8 Live con Live Avatar está disponible en Gemini Enterprise."
Esa es toda la historia de la disponibilidad. Live Avatar no es un ID de modelo de la API de Gemini. La lista de modelos de audio de la API todavía contiene gemini-3.8-live y gemini-3.8-live-extended-thinking y ninguna fila de avatar, y el tarifario no incluye ninguna línea de avatar. La función llega dentro de Gemini Enterprise, lo que significa que el público del anuncio son compradores empresariales y los desarrolladores que integran en su nombre, no el desarrollador individual que llama a la Live API con una clave hoy.
Dos de las afirmaciones de la publicación merecen ser citadas textualmente, porque ambas son más contundentes que el lenguaje habitual de lanzamiento. La primera: Live Avatar "cuenta con sincronización nativa de voz a voz multilingüe" y "puede hacer la transición sin problemas entre 97 idiomas sin degradar la fidelidad del video ni introducir deriva visual". La cifra de 97 es el mismo recuento de idiomas que el lanzamiento del 15 de septiembre atribuyó a los modelos subyacentes de diálogo en vivo, así que esta es la afirmación multilingüe existente reformulada con una nueva restricción añadida: la sincronización labial y la animación facial tienen que mantener el ritmo cuando el idioma cambia a mitad de frase. La segunda: toda la salida está marcada con SynthID, "entretejido directamente en la salida de audio y video". Ambas pistas, no solo la voz.
La capacidad genuinamente nueva es la del medio.
Más allá de lo visual, el párrafo más interesante es el que trata sobre las llamadas a herramientas. Google dice que Live Avatar está respaldado por la "llamada asíncrona a herramientas", que puede "activar llamadas a herramientas y obtener datos en segundo plano mientras continúa el diálogo activo, gestionando tareas complejas y garantizando un flujo de conversación ininterrumpido". El ejemplo práctico es el registro de entrada de un huésped de hotel, donde el modelo llama a herramientas en segundo plano y sigue hablando.
Eso es una diferencia arquitectónica real con respecto a la forma de petición-respuesta en torno a la cual están construidas la mayoría de las integraciones de voz, y es la parte que lleva un coste asociado. La ejecución asíncrona significa que el modelo está haciendo un trabajo que la transcripción no muestra. En un pipeline de texto, verías la llamada a la herramienta como un turno. Aquí ocurre por debajo de una conversación que sigue en curso, lo que plantea las mismas preguntas que plantea cualquier ejecución concurrente: ¿qué ocurre si la llamada a la herramienta falla en silencio a mitad de frase, y cómo lo sabe quien llama? La publicación de Google no lo dice, y la tarjeta del modelo es el lugar donde buscarlo. Considera la afirmación de "flujo conversacional ininterrumpido" como declarada por el proveedor y no probada por ningún tercero que podamos encontrar.
Avatares predefinidos, y la lista de permitidos que limita la mitad interesante
La personalización tiene dos niveles y solo uno de ellos está disponible de forma general. Toda implementación empresarial recibe «una biblioteca de avatares predefinidos y diversos». Los avatares personalizados —generados «a partir de una imagen de referencia de alta calidad» y que «preservan el parecido con la referencia, el estilo de marca o la identidad del personaje»— están tras una barrera, y Google lo dice sin rodeos: «La creación de avatares personalizados solo está disponible actualmente mediante la inclusión en listas de permitidos para empresas».
Entonces, la capacidad que la mayoría de los equipos realmente querrá, la que permite que un avatar coincida con una marca o un personaje con nombre, es la que no puedes obtener por autoservicio. Si tu plan depende de un presentador sintético que se parezca a tu mascota, estás a la espera de una decisión sobre la lista de permitidos, y no del lanzamiento de un modelo. Eso es un hecho de adquisiciones, no técnico, y es el tipo de cosa que retrasa un trimestre sin hacer ruido.

Donde se sitúa con respecto al resto de la línea
Live Avatar no llegó a una familia de productos vacía, y la posición que ocupa se aprecia más fácilmente al compararla con los hermanos que se lanzaron en la misma quincena.
• Se ofrece como — Gemini 3.8 Live con Live Avatar es una capacidad empresarial dentro de Gemini Enterprise, frente a Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, que son endpoints de Gemini API con ID de modelo y tarifas por minuto publicadas
• Invocable por desarrolladores — Live Avatar no, sin ID de modelo ni línea de tarifa frente a los dos endpoints Live, sí, gemini-3.8-live y gemini-3.8-live-extended-thinking
• Salida — Live Avatar audio más vídeo sincronizado frente a los endpoints Live, solo audio
• Declaración de idiomas — Live Avatar 97 idiomas con sincronización labial y continuidad de expresiones frente a los endpoints Live: 97 idiomas con cambio automático a mitad de conversación
• Marca de agua — Live Avatar SynthID tanto en la pista de audio como en la de vídeo frente a los endpoints Live: SynthID en el audio generado
Los dos endpoints Live son en sí mismos el par bien documentado. Las mediciones independientes los sitúan muy separados en algunos ejes y cercanos en otros: en el Índice Speech to Speech de Artificial Analysis, Gemini 3.8 Live Extended Thinking (High) se sitúa en 82,6 frente a los 76,0 de Gemini 3.8 Live, una brecha basada sobre todo en la calidad del razonamiento más que en la dinámica conversacional, donde el orden se invierte. Las propias cifras de Google los sitúan en 68,6 % y 30,1 % en finalización de tareas de τ-Voice, y en 98 % y 92 % en Big Bench Audio. Live Avatar hereda el que invoques por debajo, y también hereda su precio, porque el avatar es una capa de presentación sobre el mismo bucle de conversación.

Lo que esto no cambia
No mejora los modelos. Live Avatar es una capa de presentación y orquestación: las cifras de calidad de Gemini 3.8 Live son las mismas que el 15 de septiembre, y quien necesite la más potente de las dos variantes sigue teniendo que elegir Extended Thinking y aceptar su latencia. No incorpora video a la API. Y no cambia el precio de hablar con el modelo, que se sigue facturando según las tarifas por minuto de audio de la Live API —$0.005 por minuto de audio de entrada y $0.018 por minuto de audio de salida—, y la generación de video del avatar no tiene precio público porque no se vende por separado.
Lo que sí cambia es el conjunto de productos que se pueden construir sin una capa de renderizado aparte. Un agente de soporte que antes hablaba y dejaba un panel en blanco en la pantalla ahora puede mostrar un rostro mientras trabaja, y el trabajo que realiza en segundo plano ya no se percibe como un silencio incómodo. Eso es un cambio significativo en la forma de una interfaz y un cambio modesto en el modelo subyacente. Ambas cosas pueden ser ciertas a la vez.

Qué observar, y una nota sobre enrutamiento
Tres cosas harían que esto pasara de ser un anuncio a una decisión de desarrollo. La lista de permitidos de avatares personalizados tendría que abrirse, porque los avatares predefinidos son una demo y los avatares personalizados son un producto. La pista de video tendría que tener un precio, porque nadie puede modelar la economía unitaria de una salida sin precio. Y un endpoint de avatar tendría que aparecer en la lista de modelos de la API, porque esa es la diferencia entre una función empresarial y algo que un desarrollador puede llamar esta noche.
Por nuestra parte, hay algo que conviene precisar, ya que es fácil suponer lo contrario: OrcaRouter no enruta los endpoints de Gemini 3.8 Live ni Live Avatar, y nada de lo que aquí se dice debe leerse como una afirmación de que sí lo hace. Lo que sí ofrecemos es el resto de la línea 3.8 de Google — google/gemini-3.8-flash entre ellos — junto con un catálogo de más de 200 modelos desde una única clave, al precio de lista del proveedor y sin recargo. Si Live Avatar orienta tu arquitectura hacia un agente que tiene que razonar sobre lo que ha dicho el cliente, la mitad de razonamiento de esa pila es la mitad que puedes consolidar hoy mismo.
