
Filtración en vivo de Gemini 3.8: dos nuevos slugs de voz y por qué "Live Extended Thinking" importa más
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Dos cadenas que no aparecen en ninguna documentación publicada surgieron esta semana en una página de cuotas de GCP: Gemini 3.8 Live, y algo llamado Live Extended Thinking. Fueron detectadas por la cuenta de seguimiento de lanzamientos @testingcatalog y publicadas el 15 de septiembre, con la advertencia escueta de que ninguna es pública. Ese es todo el registro público hasta ahora: sin ficha de modelo, sin línea de precios, sin entrada en el registro de cambios de la API, sin confirmación alguna. Pero los dos nombres se sitúan al final de una línea muy legible. Gemini 3.1 Flash Live sigue siendo el modelo que la propia documentación de la compañía recomienda para trabajar con la Live API, Gemini 3.5 Live y Gemini 3.5 Live Experimental llegaron el 26 de agosto como la familia Gemini Audio, y el lado de texto de esa misma familia —Gemini 3.8 Flash— lleva lanzándose desde el 2 de septiembre. Un "3.8 Live" cerraría esa brecha. El segundo identificador es el más interesante de los dos.
Las etiquetas primero, porque una pieza sobre filtraciones vive o muere por ellas. Esto no es un lanzamiento. Ninguno de los dos slugs ha sido anunciado, documentado, tasado ni confirmado por Google, y la fuente es una sola cuenta que hace seguimiento de lanzamientos. Todo lo que aparece a continuación sobre Gemini 3.8 Live y Live Extended Thinking en concreto no está verificado. Todo lo que aparece a continuación sobre modelos que ya están en circulación —Gemini 3.1 Flash Live, Gemini 3.5 Live, Gemini 3.8 Flash— está documentado y es verificable, y he señalado cuál es cuál a lo largo del texto.
Lo que dice la señal, y lo que no
• Se reportó — dos slugs, «Gemini 3.8 Live» y «Live Extended Thinking», que aparecen en una página de cuota de Google Cloud, publicados el 15 de septiembre con la nota de que «no son públicos».
• No reportado — un anuncio, una tarjeta de modelo, un precio, una ventana de contexto, una fecha de lanzamiento, un id de API, cualquier cifra de benchmark o cualquier confirmación de Google
• Corroboración: ninguna hasta la fecha de redacción. La página de modelos de la API Gemini de Google, actualizada por última vez el 4 de septiembre, enumera exactamente dos modelos Live conversacionales, gemini-3.1-flash-live-preview y gemini-3.5-live-translate-preview, y ninguno de ellos cuenta con una variante «Live Extended Thinking»
• Mismo informe, afirmación separada: la misma publicación del 15 de septiembre también pronosticó que Grok 4.7 «debería situarse cerca de Opus 5.0, no de 5.1» y que su trabajo multimodal «todavía necesita trabajo». Eso corresponde al modelo de otro proveedor y es un pronóstico, más que un artefacto; se menciona aquí solo para completar la fuente.
• La implicación del propio nombre —las entradas de cuota de Google Cloud son SKU por modelo, lo que aboga por un modelo de API facturable en lugar de una función dentro de la aplicación Gemini para consumidores. Eso es una inferencia a partir de la superficie en la que apareció la cadena, no un hecho confirmado.

Por qué una página de cuota es donde un modelo se filtra primero
Esta es la parte que vale la pena entender, porque explica por qué un artefacto de dos palabras merece un artículo completo. Las páginas de cuota no son superficies de marketing. Son infraestructura de facturación y límites de velocidad: cada modelo que un cliente de Cloud puede invocar necesita una entrada de cuota por proyecto antes de que se atienda la primera solicitud de pago, y esas entradas se aprovisionan mediante el mismo trabajo de ingeniería que prepara un modelo para su disponibilidad general. Que aparezca un slug allí significa que alguien ha construido la infraestructura para un SKU, no que alguien haya redactado un comunicado de prensa.
Eso corta por ambos lados, y la lectura honesta es la cautelosa. Una entrada de cuota está más avanzada que un nombre en clave en un artículo de investigación, porque implica una superficie prevista de cara al cliente. También es exactamente el tipo de cosa que se crea, se prueba y se renombra discretamente antes del lanzamiento. El lado de texto de esta familia ha avanzado lo suficientemente rápido como para convertir eso en algo concreto: Gemini 3.6 Flash llegó el 21 de julio, Gemini 3.7 Flash el 13 de agosto y Gemini 3.8 Flash el 2 de septiembre: tres lanzamientos de Flash en seis semanas. Una línea de modelos que itera tan rápido es una línea que prepara más SKU de los que lanza con esos nombres.
La línea Live ha estado funcionando con una versión de retraso
Esto es lo que convierte a "Gemini 3.8 Live" en una historia real y no en una mera curiosidad de nombres: los modelos de voz de Google no han seguido en absoluto a sus modelos de texto.
• Modelo Live API recomendado actualmente — gemini-3.1-flash-live-preview, última actualización marzo de 2026, todavía descrito en la propia documentación de Google como el modelo que se debe usar para todos los casos de uso de Live API
• Sus límites — 131,072 tokens de entrada y 65,536 tokens de salida, acepta texto, imágenes, audio y video, y devuelve texto y audio
• La familia Gemini Audio, anunciada el 26 de agosto — Gemini 3.5 Live, Gemini 3.5 Live Experimental y Gemini 3.5 Transcribe, con los modelos Transcribe que reemplazan a Chirp 3 para la transcripción de voz a texto
• Mientras tanto, la línea de texto — Gemini 3.5 Flash, Gemini 3.6 Flash, Gemini 3.7 Flash y Gemini 3.8 Flash — pasó por cuatro versiones públicas en aproximadamente la misma ventana

La línea de audio se sitúa en la generación 3.5, mientras que la línea de texto está en la 3.8. Un slug «Gemini 3.8 Live» es la primera evidencia de que Google pretende devolver la voz a la misma generación que el texto, lo que, para cualquiera que esté construyendo un agente de voz, significa que el razonamiento subyacente a una sesión Live podría saltar tres generaciones de modelos de texto a la vez en lugar de una.
Por qué "Live Extended Thinking" es el slug más interesante
Hoy, el razonamiento en un modelo Gemini Live es un dial, no un modelo. La API Live expone un parámetro thinkingLevel con cuatro ajustes — minimal, low, medium y high — y el valor predeterminado es minimal, elegido explícitamente para optimizar la latencia más baja. Ese valor predeterminado te dice para qué sirve el producto: una conversación en la que una pausa es un error.
Un slug aparte llamado "Live Extended Thinking" implica que Google se está preparando para dividir eso en dos productos en lugar de un solo control, y el razonamiento es sencillo. La latencia y la deliberación están en tensión directa en un modelo de voz —no se puede responder al instante y, a la vez, pensar a fondo antes de responder—, por lo que un único modelo con un conmutador obliga a cada llamador a elegir un punto de esa línea para cada solicitud. Dos SKU permiten que un cliente enrute la ruta rápida (manejo de interrupciones, barge-in, consultas rápidas) y la ruta lenta (un agente de voz que trabaja en una tarea de varios pasos) hacia endpoints ajustados de forma diferente, sin que uno degrade al otro.
El precedente ya existe dentro del propio lanzamiento de agosto de Google. Gemini 3.5 Live Experimental se describió como la variante capaz de «razonar directamente mientras habla» y de narrar su progreso paso a paso durante una tarea: un modelo de voz con un sabor explícitamente de pensamiento, lanzado con su propio id en lugar de como un ajuste. «Live Extended Thinking» se lee como ese instinto que pasa de una etiqueta experimental a un producto con nombre. Eso es inferencia a partir de una cadena, y es inferencia, pero es del tipo que esta línea en concreto ya ha recompensado antes.
Lo que realmente puedes llamar hoy
Nada de esto cambia a lo que puedes acceder ahora mismo, y vale la pena ser directo al respecto. No hay ningún endpoint de Gemini 3.8 Live al que llamar, ningún ajuste Live Extended Thinking que activar, y ninguna forma de comprar acceso a ninguno de los dos. Cualquier cuenta que hoy venda "acceso a Gemini 3.8 Live" está vendiendo una etiqueta, no un modelo. Los modelos Live que puedes usar de verdad son gemini-3.1-flash-live-preview y gemini-3.5-live-translate-preview, ambos en versión preliminar a través de la propia API de Google.
El lado del texto es una historia diferente, y es la parte que realmente se puede enrutar. Gemini 3.8 Flash — lanzado el 2 de septiembre a $0.75 por millón de tokens de entrada y $3.75 por millón de salida según el precio de lista de Google, y con un aumento programado al doble, $1.50 y $7.50, el 1 de enero de 2027 — se ejecuta en OrcaRouter a ese mismo precio de lista, con un 0% de margen adicional. El precio de traspaso importa más de lo habitual en un modelo con un aumento anunciado de antemano: cuando la cifra de enero entre en vigor, cambiará aquí el mismo día, sin un segundo contrato que renegociar y sin ningún cambio de código que hacer.

La línea de voz no está hoy en OrcaRouter —ningún SKU Live ni de audio nativo lo está, de ningún proveedor—, así que nada de lo que hay aquí debería interpretarse como que nosotros lo alojamos. Para lo que una capa de enrutamiento sí es genuinamente útil es para la otra mitad de esta historia. Cuando por fin llegue un modelo Live de generación 3.8, y cuando llegue junto a él una segunda variante con sesgo de razonamiento, elegir entre una ruta de voz rápida y una que delibera pasa a ser una decisión de enrutamiento en lugar de una reescritura: dos endpoints detrás de una sola clave, con conmutación por error automática si el id de vista previa contra el que compilaste se retira. En una línea que ya se ha renombrado una vez este año, eso no es una hipótesis.
¿Qué confirmaría esto — y qué lo mataría?
Una filtración debería decirte cómo podría estar equivocada. Para Gemini 3.8 Live y Live Extended Thinking, la evidencia confirmatoria es específica y verificable:
• Que la entrada de cuota se haga pública: el mismo slug apareciendo en una lista de modelos de Google Cloud o Vertex AI con un límite de velocidad asociado, en lugar de solo en una captura de pantalla
• Una entrada del registro de cambios de la API de Gemini o una fila en la página de modelos, que actualmente termina en gemini-3.1-flash-live-preview y gemini-3.5-live-translate-preview
• Una tarjeta de modelo de DeepMind — los modelos de audio de agosto se documentaron allí como "Gemini 3.5 Audio" aunque la cobertura los llamaba Live y Transcribe, así que la tarjeta es el artefacto que fija un nombre
• Una línea de precios, que es lo único que convierte un SKU preparado en un producto que alguien pueda comprar
• Desconfirmación — que los slugs se renombren, se integren en la configuración de pensamiento del modelo existente o simplemente nunca vuelvan a aparecer. Los tres son resultados habituales para una página de cuota, y cualquiera de ellos significa que esta pieza fue prematura en lugar de acertada
Qué observar y quién debe actuar
Si estás creando un agente de voz sobre la Live API, nada de tu arquitectura necesita cambiar esta semana: el modelo sobre el que lo crearías sigue siendo gemini-3.1-flash-live-preview, y el consejo honesto es mantener el id del modelo detrás de un valor de configuración y mantener un segundo endpoint Live activo, porque esta línea ya se ha renombrado una vez y puede volver a hacerlo. Si estás eligiendo un modelo de texto, esta filtración es irrelevante para ti; Gemini 3.8 Flash se está lanzando, con precio y medible ya, y la pregunta más útil es el cambio de precios de enero, no un slug de voz.
Lo que de verdad hay que observar no es el lanzamiento. Es si «Live Extended Thinking» llega como un segundo modelo o como una quinta configuración del primero. Si es un SKU aparte, Google les está diciendo a los desarrolladores que un agente de voz que piensa y un agente de voz que habla son productos diferentes — y esa es una afirmación de mayor calado que cualquier número de versión en el nombre.
Aquello para lo que una capa de enrutamiento resulta genuinamente útil es la otra mitad de esta historia.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
