
Gemini 3.8 Live Extended Thinking vs GPT-Live-1: un empate de 1,1 puntos y dos facturas diferentes
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
En la puntuación compuesta, esto es un empate. Gemini 3.8 Live Extended Thinking se sitúa en 82,6 en el Speech to Speech Index de Artificial Analysis; GPT-Live-1, en su backend Astra con esfuerzo de razonamiento medio, se sitúa en 81,5. En el componente agéntico subyacente —finalización de tareas de τ-Voice—, la diferencia es de 0,7 puntos, 68,6 % frente a 67,9 %. En el componente de razonamiento es mayor y va en sentido contrario: 97,7 % en Big Bench Audio para el modelo Gemini, 90,1 % para GPT-Live-1. Nada de esa variación sobrevive a una segunda ejecución del benchmark, y nada de eso es lo que deberías usar para decidir.
Lo que separa a estos dos no es la calidad. Es que no están de acuerdo sobre qué es un agente de voz, quién hace el razonamiento y —la parte que primero afecta a una línea del presupuesto— cómo se factura la sesión. Gemini 3.8 Live Extended Thinking cobra por token de audio y razona en el mismo modelo que habla. GPT-Live-1 cobra una tarifa plana por el tiempo de la sesión, hable o no alguien, y le pasa el razonamiento real a un modelo de texto aparte que tú eliges y por el que pagas por separado. Son dos productos diferentes que llevan la misma puntuación de benchmark, y cuál encaja depende de una pregunta que la tabla de clasificación nunca hace: ¿cómo es una llamada promedio en tu línea?
El empate de 1,1 puntos, y dónde se rompe en realidad
Empieza por los números, porque la delgadez del titular es lo importante:
• Índice de voz a voz — Gemini 3.8 Live Extended Thinking (High) 82,6 vs GPT-Live-1 (backend Astra, esfuerzo medio) 81,5
• Rendimiento agéntico (finalización de tareas de τ-Voice) — 68,6 % frente a 67,9 %, con GPT-Live-1 en 59,3 % cuando ejecuta el backend Sol con esfuerzo bajo
• Razonamiento del habla (Big Bench Audio) — 97,7 % frente a 90,1 %, el único componente donde la brecha no es ruido
• Flujos de trabajo bancarios complejos (Sierra τ³-Banking, según el proveedor) — 35,1 % frente a 32,0 %
• Tiempo hasta el primer audio — 1,35 s frente a 1,24–1,34 s a través de la API
• Costo medido por hora — $3,50 vs $5,83 para la configuración de Astra, ambos según la medición de audio de entrada de Artificial Analysis
La lectura honesta es que los dos modelos son indistinguibles en la métrica compuesta, distinguibles en razonamiento sobre el habla, donde el modelo Gemini lidera por casi ocho puntos, y distinguibles en costo, donde lidera por alrededor del 40 %. Donde GPT-Live-1 toma la delantera es en las partes de la experiencia que a un benchmark le cuesta puntuar: es genuinamente dúplex completo, escucha mientras habla, emite señales de retroalimentación y decide varias veces por segundo si hablar o ceder el turno. Gemini 3.8 Live Extended Thinking funciona por turnos. Resuelve el mismo problema de fondo —una persona que llama a la que se deja en silencio mientras el agente trabaja— recurriendo en cambio a narrar, razonando y hablando al mismo tiempo con frases como «Déjame revisar eso…» mientras se ejecuta la tarea.
Ambos enfoques mantienen la línea viva. Se sienten diferentes. Solo uno de ellos aparece en un índice.

Dos modelos de facturación, y por qué la tarjeta de tarifas induce a error
Esta es la sección que decide la mayoría de los despliegues, y es la que la cobertura omite.
Gemini 3.8 Live Extended Thinking se factura igual que se factura un modelo de tokens. A través de la Live API, las tarifas publicadas son $3.00 por millón de tokens de entrada de audio —aproximadamente $0.005 por minuto de entrada de audio— y $12.00 por millón de tokens de salida de audio, unos $0.018 por minuto, y los tokens de razonamiento se cuentan dentro de esa salida. Solo pagas por el audio que se transmite. Una persona que llama y que hace una pausa, piensa o queda en espera no te cuesta nada mientras permanece en silencio.
GPT-Live-1 se factura como se factura una línea telefónica. Es una tarifa plana de $0.05 por minuto de tiempo de sesión, cobrada por segundo, sin importar quién esté hablando ni si alguien lo está. El backend de razonamiento no está incluido: el modelo de texto que realiza el razonamiento, y cualquier herramienta que invoque, se facturan por separado adicionalmente. Así es como un precio anunciado de $0.05 se convierte en una cifra total de aproximadamente $4.47 por hora en el backend Sol y $5.83 por hora en Astra medium, según las mediciones de Artificial Analysis.
Ponga esos datos uno al lado del otro y la comparación ingenua —$0,018 frente a $0,05 por minuto, una diferencia de 2,8×— es errónea en ambos sentidos. Las cifras medidas por hora sitúan la diferencia real en $3,50 frente a $5,83, más cerca de 1,7×. Pero el modelo de reloj de sesión también cambia la forma de su factura, no solo su nivel: en GPT-Live-1 su costo sigue la duración de la llamada, así que una línea con llamadas largas, silenciosas y de bajo contenido —una cola de soporte, un paso de verificación, un traspaso a un IVR— paga lo mismo que una densa. Del lado de Gemini, el costo sigue el audio, así que el silencio es gratis y la verbosidad no. Haga la aritmética con la duración media de sus propias llamadas antes de hacerla con una tarifa por minuto, porque ese es el número que decide cuál de estas opciones le resulta más barata, y la respuesta no es la misma para una línea de reservas que para una línea de triaje.
Donde sucede el pensamiento
La segunda diferencia estructural es la delegación, y es la que determina cuánto de este stack puedes intercambiar realmente.
GPT-Live-1 es un front-end. Se encarga del audio dúplex y, cuando una consulta necesita razonamiento real, pasa el trabajo a un modelo backend independiente —GPT-5.5 y GPT-6 Astra están ambos documentados como backends— con selectores de esfuerzo de razonamiento que te permiten elegir cuánto de ese backend quieres comprar. Por eso la tabla enumera GPT-Live-1 dos veces con puntuaciones distintas: 81,5 con Astra en esfuerzo medio y 80,1 con Sol en esfuerzo bajo. Esa diferencia de 1,4 puntos entre sus dos propias configuraciones es mayor que la brecha de 1,1 puntos entre los dos modelos de este enfrentamiento, lo que te indica que, en el lado de OpenAI, la configuración que eliges importa más que el proveedor que eliges.
Gemini 3.8 Live Extended Thinking razona en el mismo modelo que habla. No hay un backend separado que seleccionar ni una factura aparte por él; la contrapartida es que ajustas la profundidad con niveles de pensamiento —bajo, medio y alto— en el mismo modelo, y las cifras 82,6 y 68,6 son la (Alta) configuración. La ejecución en segundo plano de herramientas y de API se realiza de forma asíncrona en ambos lados, por lo que ningún modelo se bloquea mientras trabaja.
Una consecuencia práctica: como la inteligencia de GPT-Live-1 es un modelo de texto comprado detrás de una interfaz de voz, su techo de calidad se mueve cuando OpenAI lanza un modelo de texto, no cuando lanza un modelo de voz. El techo de Gemini 3.8 Live Extended Thinking se mueve cuando Google reentrena el modelo de audio. Si vas a hacer una apuesta a dos años por una plataforma de voz, esa diferencia en la cadencia de actualización merece más reflexión que 1,1 puntos de índice.
Qué costos de cambio, tomes el camino que tomes.
Ninguno de estos es un simple cambio de ID de modelo, y los equipos que lo tratan como tal lo descubren en producción. Pasar a Gemini 3.8 Live Extended Thinking implica aceptar un contrato de turno diferente: las llamadas a funciones siempre son asíncronas, por lo que una declaración de herramienta bloqueante devuelve un error duro en lugar de ponerse en cola, y los clientes tienen que leer el interaction_status campo — IN_PROGRESS mientras se está razonando o una herramienta sigue ejecutándose, IDLE solo cuando la tarea completa finaliza — en lugar de confiar en que turnComplete signifique que el trabajo está hecho. Pasar a GPT-Live-1 implica adoptar su infraestructura de selección de backend y una segunda superficie de facturación, y vivir con una API que solo estuvo disponible de forma general para los desarrolladores el 10 de septiembre de 2026, tras debutar en ChatGPT el 8 de julio, por lo que las herramientas de terceros, los SDK y la observabilidad a su alrededor tienen meses, no años. En cualquier dirección que te muevas, presupuesta el trabajo de integración junto a la factura de tokens. En una pila de voz madura, la refactorización suele ser la mayor de las dos.
Cómo hacer una comparación como esta sin apostar por ella
La forma sensata de resolver una pregunta de 1,1 puntos es ejecutar ambos con tu propio tráfico, y la parte incómoda es que hacerlo normalmente implica dos integraciones, dos contratos y dos conjuntos de credenciales. No tiene por qué implicar dos arquitecturas. En ambos sistemas, el front-end de voz es una capa fina sobre llamadas normales a modelos de texto —en el caso de GPT-Live-1 eso es explícito, y en el lado de Gemini la ejecución de herramientas en segundo plano se resuelve igual— y esa capa de texto es donde reside la variación de costes y donde cambiar resulta realmente barato.
OrcaRouter ofrece 190 modelos desde una sola clave, al precio de lista del proveedor y sin recargo, por lo que un cambio de precio en el upstream se refleja en nuestro lado el mismo día, en lugar de esperar a la próxima renovación de contrato. Para un stack de voz, las dos propiedades que importan son que el destino de la delegación pueda intercambiarse en tráfico en vivo sin tocar la integración de voz, y que la conmutación automática por error mantenga viva una llamada cuando un backend falla o se agota el tiempo de espera — lo que te permite probar una configuración no validada con tráfico real sin poner detrás una línea de producción. Para ser precisos sobre lo que alojamos y lo que no alojamos: ni el endpoint Gemini 3.8 Live Extended Thinking ni el endpoint GPT-Live-1 están en nuestro router — esos provienen de las propias API de Google y de OpenAI. Los modelos de texto a los que delegan sí lo están muy a menudo, entre ellos Gemini 3.8 Flash.
La parte superior del tablero, y lo poco que se asienta
La siguiente captura se tomó el 16 de septiembre de 2026:
• Gemini 3.8 Live Extended Thinking (High) — 82.6, primer lugar
• GPT-Live-1 (backend de Astra, esfuerzo medio) — 81,5
• Grok Voice Think Fast 2.0 High — 81.3
• GPT-Live-1 (backend de Sol, esfuerzo bajo) — 80.1
• Gemini 3.8 Live — 76.0
• GPT-Realtime-2.1 High — 73.9
• Gemini 3.1 Flash Live High — 71.5
Tres cosas que merecen atención. Primero, el primer y el tercer puesto están separados por 1,3 puntos, y el primero y el quinto por 6,6, así que la cima de esta tabla es un pelotón apretado, no una clasificación. Segundo, el modelo del título de este enfrentamiento no es la entrada de Gemini que ocupa el quinto puesto —ese es el Gemini 3.8 Live estándar, un producto distinto y mucho más económico que no debe confundirse con la variante de razonamiento que se compara aquí. Tercero, hay un precedente para tratar cualquier cifra de índice individual como provisional: xAI reportó 82,9 para Grok Voice Think Fast 2.0 en julio, y ese modelo marca 81,3 en esta tabla. Las puntuaciones de índice reportadas por el proveedor no siempre sobreviven al contacto con una tabla de clasificación en vivo. Las cifras de τ-Voice de 68,6 % y 67,9 % ahora figuran en una tabla pública ejecutada bajo el propio sistema de evaluación de Artificial Analysis, por lo que están corroboradas en lugar de simplemente afirmadas —pero una diferencia de 0,7 puntos entre dos modelos en el mismo sistema de evaluación no es una diferencia. Verifícalo en tu tráfico o ignóralo.

Una cifra más que conviene incluir en la decisión, porque es el número menos cómodo de esta comparación: Google reporta un 35,1 % para Gemini 3.8 Live Extended Thinking en la tabla de clasificación τ³-Banking de Sierra, frente al 32,0 % de GPT-Live-1 Astra. Son datos reportados por el proveedor, no reproducidos, y describen un mundo en el que el agente de voz líder de esa tabla falla aproximadamente dos de cada tres intentos de tareas bancarias realistas. Si tu agente tiene que completar trabajo regulado y de varios pasos, ninguno de estos modelos está terminado — y una ventaja de 3,1 puntos en ese benchmark no es una razón para elegir a un proveedor, sino una razón para mantener a una persona en el circuito.

Así que: si la naturalidad de la conversación es el producto y tus llamadas son cortas y densas, el comportamiento full-duplex de GPT-Live-1 es una ventaja real que el índice no puede ver, y la facturación por reloj de sesión es tolerable con esa duración de llamada. Si las llamadas son largas, silenciosas o variables, o si el razonamiento de voz y el coste por hora dominan, Gemini 3.8 Live Extended Thinking va por delante en los componentes que importan y es aproximadamente un 40% más barato por hora mientras lo hace — con la advertencia de que es por turnos, aún en vista previa para empresas y requiere una refactorización del cliente antes de que ejecute tus herramientas. Lo que nada de esto justifica es elegir uno u otro por la fuerza de 1,1 puntos de índice. Según la evidencia disponible, la razón honesta para elegir entre estos dos es el modelo de facturación y la arquitectura que hay debajo, y ambas son cosas que puedes medir en tu propio tráfico esta semana.
En OrcaRouter, la conmutación por error automática mantiene activa la llamada cuando un backend falla o se agota el tiempo de espera.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
