Tarjeta de título principal para Gemini 3.8 Live Extended Thinking vs Gemini 3.8 Live, que muestra los dos modelos divididos por un costo de audio por hora 4 veces mayor, $3.50 frente a $0.84.
Guides & Insights

Gemini 3.8 Live Extended Thinking vs Gemini 3.8 Live: pagar 4x por los 38 puntos que importan

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Dos modelos, un lanzamiento, una tabla de tarifas y una decisión que la mayoría de los artículos interpretan mal en la misma dirección. Gemini 3.8 Live Extended Thinking y Gemini 3.8 Live se lanzaron juntos el 15 de septiembre de 2026, ambos construidos sobre Gemini 3 Pro, ambos manejan 97 idiomas con cambio automático a mitad de conversación, ambos aceptan entrada visual casi en tiempo real, ambos aplican marca de agua con SynthID al audio generado. En el índice compuesto Speech to Speech que publica Artificial Analysis, están separados por 6,6 puntos — 82,6 frente a 76,0. En el costo por hora de audio que mide esa misma tabla, están separados por un poco más de cuatro veces.

Ninguno de esos es el número que debería decidir tu arquitectura. El número que debería es 38: la brecha entre los dos en τ-Voice, el componente agéntico de finalización de tareas, donde la variante de razonamiento resuelve el 68,6 % de escenarios replicados de atención al cliente y la variante estándar resuelve el 30,1 %. No estás eligiendo entre un buen modelo y uno mejor. Estás eligiendo entre una interfaz conversacional y un sistema de razonamiento que resulta que habla, y la diferencia de precio es lo menos interesante de esa elección.

La bifurcación de precios, en las unidades en las que realmente se te factura

Empieza por la factura, porque es la parte que la gente acierta y luego sobrevalora. Ambos modelos tienen la misma tarifa publicada a través de la Live API: $0,005 por minuto de entrada de audio y $0,018 por minuto de salida de audio, y en el lado de Extended Thinking esos tokens de salida incluyen el razonamiento. La misma tarjeta, las mismas tarifas, sin un nivel premium aparte para el razonamiento.

La divergencia aparece en cuanto se mide el trabajo en lugar de los minutos. La columna de coste por hora de audio de entrada de Artificial Analysis —el coste de completar un subconjunto fijo de 40 preguntas de Big Bench Audio, normalizado a una cifra por hora— sitúa a los dos modelos en categorías completamente distintas:

Gemini 3.8 Live Extended Thinking (High) — 3,50 $ por hora de audio de entrada, según la propia medición de Artificial Analysis

Gemini 3.8 Live — $0.84 por hora, la tarifa de pago más baja de ese tablero

• GPT-Live-1 (backend de Astra, esfuerzo medio) — $5.83 por hora, así que la variante de razonamiento sigue siendo aproximadamente un 40% más barata que el modelo al que supera

Grok Voice Think Fast 2.0 High — $4.80 por hora

• GPT-Realtime-2.1 High — $10.75 por hora

Esa es la bifurcación: cuatro veces el costo de audio por hora, con la misma tarifa publicada por minuto, porque la variante de razonamiento consume más tokens al hacer la misma cantidad de escucha. Los $0.84 del modelo estándar no son un descuento, son el mínimo de toda la tabla.

Qué compran los 38 puntos

Separa el compuesto y los dos modelos dejan de parecer un par:

Índice de voz a voz — Gemini 3.8 Live Extended Thinking (High) 82.6 frente a Gemini 3.8 Live 76.0

Rendimiento agéntico (finalización de tareas de τ-Voice) — 68,6 % frente a 30,1 %

Razonamiento del habla (Big Bench Audio) — 98% vs 92%

Dinámica conversacional — 91,9% vs 96,1%

Preferencia de arena (Elo) — 990 vs 1083

Tasa de éxito de tareas — 89,1 % frente a 93,2 %

Tiempo hasta el primer audio — 1,35 s frente a 1,18 s

Costo por hora de audio de entrada — $3.50 vs $0.84

Lee eso con honestidad y el modelo más barato gana cuatro de las ocho líneas. Es más rápido en llegar al primer audio, la arena lo prefiere, tiene más probabilidades de completar una tarea superficial y obtiene mejores valoraciones en dinámica conversacional; esto último no es un premio de consolación, porque la dinámica conversacional es lo que nota quien llama. Lo que no puede hacer es terminar un trabajo que tiene pasos. Treinta coma uno por ciento frente a 68,6 % es la mayor brecha individual en todo este lanzamiento, y recae en el único eje que separa a un agente de una interfaz.

Dos advertencias sobre esas filas. La cifra de preferencia de la arena dentro del índice se congela en el momento en que un modelo pasa a ser apto para su publicación, por lo que es una instantánea y no un Elo continuo: léela como una calificación puntual y no como el gráfico en vivo de Speech Agent Arena. Y la parte alta de la tabla τ-Voice está muy ajustada: la variante de razonamiento, con un 68,6 %, supera a GPT-Live-1, con un 67,9 % (backend Astra, esfuerzo medio), por 0,7 puntos, con GPT-Live-1 (Sol, esfuerzo bajo) en un 59,3 % y Grok Voice Think Fast 2.0 High en un 56,5 % por detrás. La ventaja de 0,7 puntos sobre GPT-Live-1 está dentro del ruido. La diferencia de 38 puntos dentro de este par no lo está.

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and Gemini 3.8 Live across six dimensions: Speech to Speech Index 82.6 vs 76.0, agentic performance on tau-Voice 68.6 percent vs 30.1 percent, speech reasoning on Big Bench Audio 98 percent vs 92 percent, arena preference Elo 990 vs 1083, time to first audio 1.35 seconds vs 1.18 seconds, and cost per hour of input audio $3.50 vs $0.84.

El otro 4x: lo que te cuesta el nivel de razonamiento en código

En este lanzamiento hay una segunda bifurcación, y no aparece en ninguna tabla de clasificación. Los dos modelos no son intercambiables directamente, porque la variante de razonamiento cambia el contrato que tu cliente debe cumplir.

En el modelo estándar, Gemini 3.8 Live se comporta como espera un cliente de la API Live: las llamadas de herramientas y de API en segundo plano se ejecutan mientras el modelo sigue hablando, y turnComplete: true sigue marcando el final de un turno. No hay ningún ajuste de nivel de pensamiento que elegir, porque no hay nada separado que configurar: el modelo responde y, cuando ha respondido, el turno termina.

En Gemini 3.8 Live Extended Thinking, tres cosas cambian a la vez:

Las llamadas a funciones son siempre asíncronas. Una declaración de herramienta bloqueante no se pone en cola con educación: devuelve un error irrecuperable. Cualquier esquema de herramienta que hayas escrito para el modelo estándar debe volver a declararse como no bloqueante.

Un nuevo campo de estado lleva el estado real. Los clientes deben leer interaction_status en lugar de confiar en turnComplete: el campo indica IN_PROGRESS mientras el modelo aún está razonando o una herramienta sigue ejecutándose, y solo pasa a IDLE cuando la tarea completa ha finalizado. Un turno puede terminar mientras que la tarea aún no lo ha hecho.

La profundidad de pensamiento es un ajuste. El modelo expone niveles de razonamiento configurables — bajo, medio y alto — y las cifras 82.6 y 68.6 en el tablero son la (Alto) configuración. Bajar a bajo cambia tanto la calidad como la factura de tokens, y nada en el índice te dice lo que te cuesta bajo en la finalización de tareas.

Ese tercer punto es la trampa de la migración. Debido a que Extended Thinking responde de la misma manera a nivel de protocolo que el modelo estándar hasta que interviene una llamada a herramienta, un equipo puede cambiar el ID del modelo, ver una demo funcional y solo descubrir el contrato asíncrono en producción cuando una herramienta de reservas devuelve un error en lugar de un resultado. Presupueste la refactorización del cliente junto con la tarifa de audio 4×; en una integración madura, es el mayor de los dos costos.

Cuál de ellos está pidiendo realmente tu carga de trabajo

La forma más clara de decidir es preguntar para qué sirve la sesión, no qué tan inteligente quieres que sea.

Elige Gemini 3.8 Live cuando la conversación sea el entregable. Responder, mantener el hilo, tomar un mensaje, calificar a una persona que llama, ser agradable, rápido y barato. A 0,84 $ por hora de audio de entrada, es el modelo de voz competente más barato que cualquiera publica actualmente, la arena lo prefiere, es más fiable en tareas superficiales y es 170 milisegundos más rápido hasta el primer audio, una diferencia que quien llama percibe. Lo único que hay que aceptar es el techo: 30,1 % en la finalización de tareas de varios pasos significa que no terminará trabajo que tenga pasos, y ninguna cantidad de ingeniería de prompts mueve ese número.

Usa Gemini 3.8 Live Extended Thinking cuando la sesión tenga una tarea. Reservar, cambiar, cancelar, resolver un problema de cuenta, guiar a quien llama por un proceso de varios pasos mientras espera. Esa es la línea de los 38 puntos, y vale 3,50 $ la hora —lo cual, cabe señalar, sigue siendo más barato que ambos modelos a los que supera en la puntuación compuesta. También obtienes el comportamiento de narración que hace tolerable la espera: este modelo razona y habla al mismo tiempo, así que en lugar de silencio mientras busca algo, quien llama oye «Déjeme comprobar eso…» y el progreso a medida que avanza. Ese es el mismo problema que resuelven las arquitecturas full-duplex al no detener nunca el audio; la respuesta de Google es seguir hablando mientras trabaja.

Dos filas más que merecen ser sopesadas. Google también reporta un 35,1 % para el modelo Extended Thinking en la clasificación τ³-Banking de Sierra, frente a un 32,0 % de GPT-Live-1 Astra —una cifra reportada por el proveedor y sin ninguna lectura independiente que la respalde, y que invita a la reflexión en términos absolutos, ya que 35,1 % significa que el mejor modelo de esa clasificación falla en aproximadamente dos de cada tres intentos de tareas bancarias realistas—. Y el segundo puesto del modelo estándar en la Speech Agent Arena, que Google cita en sus propios materiales, es un resultado real en una clasificación diferente que mide preferencia en lugar de finalización de tareas. Ambas afirmaciones se sostienen. En conjunto, indican que el modelo barato es muy bueno para que le hablen y que el modelo caro es el único de los dos al que se le puede encomendar trabajo.

Ejecutando ambos, sin dos integraciones

La objeción práctica a todo esto es que elegir según la carga de trabajo significa mantener dos rutas. No tiene por qué ser así. Ambas variantes se sitúan frente a la misma clase de backend —la ejecución de herramientas en segundo plano y la planificación de varios pasos se resuelven en llamadas ordinarias a modelos de texto— y esa capa es donde reside la variación de tus costes y donde cambiar es barato.

OrcaRouter pone a disposición 190 modelos con una sola clave al precio de lista del proveedor y sin sobreprecio, por lo que un cambio de precio de un proveedor se aplica de nuestro lado el mismo día, en lugar de en la próxima renovación de contrato. Para un stack que enruta entre un nivel conversacional económico y un nivel de razonamiento costoso, las dos propiedades que importan son que el destino de delegación se puede cambiar en tráfico en vivo sin tocar la integración de voz, y que la conmutación por error automática mantiene viva una sesión cuando un backend falla o se agota el tiempo de espera. Para ser precisos sobre lo que alojamos y lo que no alojamos: los endpoints Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking no están en nuestro enrutador — esos provienen de la propia API de Google, en la API de Gemini, la API Live y Google AI Studio. Los modelos de texto a los que estos agentes delegan su trabajo con mucha frecuencia sí lo están, Gemini 3.8 Flash entre ellos.

Dónde se sitúa cada modelo en el tablero

La captura a continuación se tomó el 16 de septiembre de 2026, y la parte superior del Speech to Speech Index dice lo siguiente:

Gemini 3.8 Live Extended Thinking (High) — 82.6, primer lugar

• GPT-Live-1 (backend Astra, esfuerzo medio) — 81,5

• Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1 (backend de Sol, esfuerzo bajo) — 80.1

Gemini 3.8 Live — 76,0, quinto puesto

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

Una nota sobre la nomenclatura mientras lees esa lista: el sufijo (High) que se adjunta a este modelo en la cobertura es una etiqueta de configuración de esfuerzo de razonamiento, no un lanzamiento independiente. Es la misma convención que utiliza la junta para Grok Voice Think Fast 2.0 High y GPT-Realtime-2.1 High.

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 at 81.5, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

¿Qué sigue sin confirmar?

Una cosa sobre este par es fácil de malinterpretar, así que vale la pena decirla con claridad: ninguno de los modelos tiene disponibilidad general en el sentido contractual, aunque ambos tienen precio y documentación.

Los desarrolladores obtienen Gemini 3.8 Live en la API de Gemini, la API Live y Google AI Studio bajo el ID gemini-3.8-live; las empresas obtienen una vista previa privada en Gemini Enterprise, con Gemini Enterprise for Customer Experience listado como próximamente; los consumidores lo obtienen en Search Live. Gemini 3.8 Live Extended Thinking tiene la misma superficie para desarrolladores bajo gemini-3.8-live-extended-thinking, además de una ruta más amplia para consumidores: Gemini Live, Docs Live para suscriptores de Google AI Pro y Ultra, y Gmail Live y Keep Live para todos los suscriptores de Google AI. Los clientes empresariales de Workspace figuran como próximamente.

Lo que falta es lo que una empresa necesita antes de poner una línea de ingresos en esto: un compromiso de disponibilidad general, una cifra de disponibilidad publicada y una tarifa que Google haya prometido mantener. Los precios están publicados, y los precios de vista previa tienen la costumbre de moverse. Haga un prototipo ahora, planifique la migración y no firme un objetivo de disponibilidad que no le hayan dado.

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

La decisión que este par presenta en realidad es más limitada de lo que el índice hace parecer, y no es una escalera de calidad. Si el trabajo de tu agente es conversar, el modelo barato no es una concesión: es el mejor producto al precio más bajo, y la tarifa cuatro veces más barata es un plus, no el argumento. Si el trabajo de tu agente es terminar algo, la variante de razonamiento es la única de las dos a la que se le puede encomendar la tarea, y $3.50 por hora es un error de redondeo frente a una reserva que, de otro modo, fracasa. El error que hay que evitar es buscar un término medio: pagar por profundidad de razonamiento en una carga de trabajo que solo necesitaba una buena conversación, que es lo que ocurre cuando un equipo lee la brecha compuesta de 6.6 puntos y nunca se desplaza hacia abajo hasta el 38.