Tarjeta de título principal para Gemini 3.8 Live vs GPT-Live-1 con el antetítulo «OrcaRouter · radar de modelos — cara a cara» y el subtítulo «Dúplex completo frente al modo por turnos - el argumento de la arquitectura, releído». Dos tarjetas dicen «Gemini 3.8 Live — por turnos, visión hoy, 97 idiomas, minutos más baratos» y «GPT-Live-1 — dúplex completo, retrocanales, delega en un backend de frontera», con chips para Índice 76.0 frente a 81.5, $0.018 frente a $0.05 por minuto, y vídeo próximamente en OpenAI. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Gemini 3.8 Live vs. GPT-Live-1: dúplex completo frente al modelo que piensa mientras habla

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Durante aproximadamente dos meses, el debate quedó zanjado por la arquitectura. GPT-Live-1 es genuinamente dúplex completo: escucha mientras habla, emite señales de retroalimentación como «mhmm» y «got it», y decide varias veces por segundo si hablar o ceder. Gemini 3.8 Live, anunciado el 15 de septiembre de 2026, es un modelo por turnos. Bajo el marco anterior, eso hacía que la comparación fuera sencilla, y ahora es la manera equivocada de interpretarla.

Lo que cambió no es que Google igualara el full-duplex. Es que Google lanzó aquello que el full-duplex estaba compensando: un modelo de voz que puede mantener una conversación mientras una tarea de varios pasos se ejecuta en segundo plano, y una segunda variante que razona en voz alta mientras trabaja. La diferencia arquitectónica es real. Simplemente ya no es el eje que decide la compra.

Dos formas de mantener viva una conversación

La apuesta del full-duplex es que la calidad de la conversación es el producto. GPT-Live-1 procesa el audio de entrada y de salida de forma continua y sincrónica dentro de un único modelo, en lugar de encadenar voz a texto, luego un modelo de lenguaje y luego texto a voz. Eso elimina la pérdida de información entre etapas y produce el comportamiento que la gente realmente nota: puedes interrumpir a mitad de respuesta y se adapta; no confunde una pausa o un ruido de fondo con el final de tu turno; permanece en silencio hasta que se le da la palabra.

La apuesta por turnos que hace Gemini 3.8 Live es que la conversación es un andamiaje para el trabajo. Sus características se centran en mantener la sesión productiva en lugar de mantener un ritmo natural: procesamiento de entrada visual casi en tiempo real, transición automática entre 97 idiomas compatibles a mitad de conversación, y ejecución de herramientas y API en segundo plano que acusa recibo de una solicitud y sigue hablando mientras la llamada se completa.

Ambos modelos se niegan a colgar contigo mientras piensan. Solo que lo hacen de forma distinta. GPT-Live-1 lo consigue no deteniendo nunca el flujo de audio. Google lo consigue hablando por encima del trabajo.

A two-column scoreboard comparing Gemini 3.8 Live and GPT-Live-1. Index score 76.0 vs 81.5; architecture turn-based vs full-duplex; video and screen available today vs not at launch; agentic tau-Voice not published vs 67.9%; languages 97 vs a narrower set; voice price $0.005 in and $0.018 out per minute vs $0.05 per minute plus backend tokens. Footer reads 'Index figures per Artificial Analysis, Sep 16 2026; GPT-Live-1 all-in measured at $4.47-$5.83 per hour.' The OrcaRouter logo is composited in the bottom-right corner.

Lo que el índice realmente dice

Artificial Analysis mantiene un Speech to Speech Index — un compuesto ponderado de razonamiento de voz, rendimiento agéntico, preferencia en arena y tasa de éxito en tareas. Lee con atención el tablero capturado el 16 de septiembre de 2026, porque el titular oculta la estructura:

Gemini 3.8 Live Extended Thinking — 82.6 (primero)

• GPT-Live-1 (backend Astra, esfuerzo medio) — 81,5

Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1 (backend de Sol, esfuerzo bajo) — 80.1

Gemini 3.8 Live — 76.0

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

De ese orden se desprenden tres cosas. Primero, Google ocupa el primer puesto, pero lo ocupa con la variante costosa, no con la que desplegará la mayoría de la gente. Segundo, GPT-Live-1 aparece dos veces, porque Artificial Analysis puntúa el sistema completo en lugar del front-end de voz, y la diferencia de 1,4 puntos entre sus dos configuraciones es siete veces mayor que la diferencia de 0,2 puntos entre el primer y el segundo puesto. Tercero, el modelo del título de este enfrentamiento, Gemini 3.8 Live, queda en quinto lugar, por debajo de ambas configuraciones de GPT-Live-1.

Si se comparan en igualdad de condiciones —el nivel estándar contra el nivel estándar—, GPT-Live-1 gana este enfrentamiento en el índice compuesto, y no está ni cerca. El 82.6 pertenece a Gemini 3.8 Live Extended Thinking, que es un producto diferente a un precio diferente con un despliegue diferente.

Screenshot of the Artificial Analysis Speech to Speech leaderboard page, captured September 16, 2026. The AA-Speech to Speech Index bar chart shows Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 (Astra) at 81.5, Grok Voice Think Fast 2.0 at 81.3, GPT-Live-1 (Sol) at 80.1 and Gemini 3.8 Live at 76.0, alongside speed and cost-per-hour-of-input-audio panels.

Donde GPT-Live-1 sigue por delante

Full-duplex no es una distinción de marketing, y el desglose del benchmark muestra dónde se convierte en una ventaja real:

Rendimiento agéntico — GPT-Live-1 lidera de forma decisiva en τ-Voice con un 67,9% frente al 56,5% de Grok. Google no ha publicado una cifra comparable de τ-Voice para Gemini 3.8 Live, solo un 68,6% para la variante Extended Thinking.

Dinámica conversacional — la toma de turnos full-duplex sigue siendo el referente de naturalidad, y los modelos basados en turnos históricamente se han quedado rezagados en este aspecto.

Profundidad de delegación — GPT-Live-1 delega las consultas difíciles a un modelo de texto de frontera, con GPT-5.5 y GPT-6 Astra documentados como backends, y expone selectores de esfuerzo de razonamiento.

Fuentes — las transcripciones de voz de ChatGPT incluyen enlaces de citas, lo que sigue siendo poco común en las interacciones de voz en general.

El contrapeso es que GPT-Live-1 va por detrás en razonamiento de voz puro: 90,1 % en Big Bench Audio frente al 97,2 % de Grok. Y su cifra de latencia destacada de 0,798 segundos en Full Duplex Bench es una medición distinta del tiempo hasta el primer audio de la API, que se sitúa entre 1,24 y 1,34 segundos.

Donde Gemini 3.8 Live lleva la delantera

Las ventajas de Google tienen menos que ver con la conversación y más con lo que la sesión puede hacer:

Visión, hoy — Gemini lleva ya un tiempo admitiendo la entrada de cámara y el uso compartido de pantalla. GPT-Live-1 se lanzó sin vídeo ni uso compartido de pantalla, y OpenAI afirmó que llegarían y señaló el antiguo Modo de voz avanzada como solución provisional. Gemini 3.8 Live añade además un procesamiento de entrada visual casi en tiempo real.

Cobertura de idiomas — 97 idiomas compatibles con cambio automático a mitad de conversación, frente a una oferta mucho más limitada por parte de OpenAI.

Costo — la tarifa anunciada es de $0.005 por minuto de entrada de audio y $0.018 por minuto de salida de audio. GPT-Live-1 se factura a $0.05 por minuto de voz solo por el front-end, con un costo total medido de aproximadamente $4.47–$5.83 por hora una vez contabilizados los tokens del backend.

Un segundo nivel que razona en voz alta — Gemini 3.8 Live Extended Thinking narra el progreso con indicaciones como «Déjame comprobar eso…», lo que constituye una respuesta diferente al problema del silencio que la del dúplex completo.

La comparación de costos que importa

Las tarifas de front-end parecen una paliza — $0.018 frente a $0.05 por minuto — y las cifras por hora son aún más marcadas. El gráfico de costo por hora de audio de entrada de Artificial Analysis sitúa a Gemini 3.8 Live en $1.50 por hora, frente a $4.14 para GPT-Realtime-2 High y $10.75 para GPT-Realtime-2.1 High. Grok Voice Think Fast 2.0 se sitúa en $4.80.

El truco es que ninguno de los dos números es la factura real. Los $0.05 por minuto de GPT-Live-1 cubren solo el front-end de voz; el modelo de texto de backend que hace el razonamiento real factura por separado, y así es como un titular de $0.05 se convierte en $4.47–$5.83 por hora en total. Gemini 3.8 Live tiene la misma estructura —la ejecución de herramientas en segundo plano es trabajo del modelo de texto— y Google no ha publicado cuánto cuesta eso.

Entonces, la lectura honesta es que Gemini 3.8 Live es más barato de entrada por un margen amplio, y la comparación con todo incluido es desconocida para ambos hasta que midas tu propia carga de trabajo. Eso no es una evasiva; es el estado real de la información.

La capa a la que ambos delegan

Este es el hecho estructural que hace que este enfrentamiento sea menos una decisión de dependencia de lo que parece. Ambos modelos delegan. GPT-Live-1 pasa las consultas difíciles a un modelo de texto de backend por diseño, y la ejecución de herramientas en segundo plano del lado de Gemini se resuelve en llamadas a modelos ordinarias. En ambos casos, el front-end de voz es una capa fina sobre un modelo de texto que hace el razonamiento, y esa capa de texto es donde reside tu variación de costos y donde cambiar es barato.

OrcaRouter incluye 190 modelos con una sola clave al precio de lista del proveedor y sin recargo alguno, así que una rebaja de precios del proveedor se traslada a nuestro lado el mismo día en lugar de en la próxima renovación de contrato. Para un stack de voz, las dos propiedades que importan son que el destino de delegación se pueda cambiar con tráfico en vivo sin tocar la integración de voz, y que la conmutación por error automática mantenga viva una llamada cuando un backend falla o se agota el tiempo de espera. Una aclaración, porque es fácil dar a entender lo contrario: no alojamos los endpoints de voz Gemini 3.8 Live ni GPT-Live-1; esos provienen de las propias API de los proveedores. Los modelos de texto a los que delegan trabajo por lo general están en el router.

Screenshot of the OrcaRouter model page for google/gemini-3.8-flash, showing the 1M-token context window, 65K max output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and p50 time to first token of 3.35 seconds.

Cómo elegir

Elige GPT-Live-1 si la calidad de la conversación es el producto —la gestión natural de las interrupciones, las señales de retroalimentación y la sensación de que estás hablando con algo en lugar de operarlo— y si puedes absorber el costo total, que es sustancialmente más alto de lo que sugiere la tarifa anunciada. Ten en cuenta que su API solo pasó a estar disponible en septiembre de 2026, por lo que las herramientas de terceros en torno a él son incipientes.

Elige Gemini 3.8 Live si necesitas visión ahora, si necesitas más de un par de docenas de idiomas o si la economía por minuto domina tu modelo. Asume que estás comprando el nivel estándar, que ocupa el quinto puesto en el índice compuesto en lugar del primero, y que el 82.6 que todos citarán pertenece a la variante Extended Thinking.

Elige Gemini 3.8 Live Extended Thinkingsi el razonamiento es lo que importa y quieres el actual líder del índice, pero comprueba antes su despliegue, porque su vía de distribución a través de Gemini Live, Docs, Gmail y Keep es más amplia que la del modelo estándar, y su disponibilidad empresarial sigue en vista previa privada.

Lo que hay que observar durante el próximo trimestre es si el full-duplex sigue siendo un foso defensivo. Los modelos por turnos están cerrando la brecha conversacional por una ruta diferente —mantener el audio ocupado con narración mientras se realiza el trabajo— y, si eso se sostiene bajo tráfico real, la distinción arquitectónica que ha definido esta categoría durante un año dejará de ser aquello por lo que preguntan los compradores.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario