Una tarjeta de título principal que dice 'GPT-Live-1 vs Gemini 3.5 Live Translate' con el subtítulo 'Un generalista ya lanzado frente a un especialista en vista previa' y la línea 'GA a $0.05 por minuto frente a vista previa a unos $0.037 por minuto', sobre dos paneles: el izquierdo muestra una forma de onda de audio dúplex completo con flechas que se curvan en ambas direcciones y una insignia sólida de 'GA', el derecho muestra un globo terráqueo con dos burbujas de diálogo y una insignia con contorno de 'PREVIEW', con el logotipo de OrcaRouter compuesto en la esquina.
Guides & Insights

GPT-Live-1 vs Gemini 3.5 Live Translate: un generalista ya lanzado frente a un especialista en versión preliminar

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Estos dos modelos se comparan porque ambos ponen voz en tiempo real en una API, y la comparación se desmorona en el momento en que lees las fichas de los modelos. GPT-Live-1 es un modelo de voz dúplex completo de propósito general que Ope​nAI trasladó a la API para desarrolladores el 10 de septiembre de 2026, tres meses después de que se lanzara dentro de ChatGPT el 8 de julio. Gem​ini 3.5 Live Translate es un modelo de traducción de audio a audio de propósito único que Goo​gle DeepMind lanzó el 9 de junio de 2026, y su ID de modelo todavía lleva la palabra preview. Uno de estos puedes ponerlo frente a clientes que pagan hoy bajo una tarifa publicada. Al otro, Goo​gle puede cambiarlo bajo tus pies sin un aviso de deprecación. Esa asimetría, no la hoja de benchmarks, es lo que debería decidir la elección.

Dos máquinas diferentes con la misma etiqueta

Vale la pena ser directo sobre lo poco que se superponen. Gem​ini 3.5 Live Translate hace traducción. Toma audio en streaming en un idioma y devuelve audio en streaming en otro, preservando la voz y el tono del hablante, en más de 70 idiomas y más de 2000 pares de idiomas, con detección automática de idioma y funcionamiento bidireccional. No mantiene una conversación, no llama a una función ni responde a una pregunta. Es un motor de interpretación simultánea.

GPT-Live-1 es la forma opuesta. Es un modelo conversacional: escucha y habla a la vez, decide muchas veces por segundo si seguir escuchando, hacer una pausa, interrumpir o llamar a una herramienta, y delega el trabajo pesado —búsqueda web, razonamiento más profundo, tareas agénticas— a un modelo de razonamiento aparte a través de la Responses API mientras la conversación continúa. El propio ejemplo de WebRTC publicado por Ope​nAI conecta esa delegación con GPT-5.6 Terra. La traducción es una de las cosas que puede hacer; no es una característica de la que el modelo de Goo​gle tenga equivalente alguno en la otra dirección.

Entonces, la pregunta práctica es más acotada de lo que sugiere el enfrentamiento del titular: si lo que estás construyendo es interpretación, el modelo de Google está diseñado específicamente para eso y el de OpenAI es de propósito general. Si lo que estás construyendo es un agente de voz que traduce ocasionalmente, GPT-Live-1 es el único de los dos que siquiera pertenece a la categoría correcta de producto.

Cuánto cuesta cada uno por minuto de audio

Aquí es donde el especialista se gana el sueldo, y la aritmética es realmente incómoda para OpenAI.

• GPT-Live-1 — 0,05 $ por minuto de voz, facturado por segundo en lugar de redondearse al siguiente minuto completo. El razonamiento y las llamadas a herramientas que realiza el backend delegado se facturan por separado según las tarifas normales de ese modelo.

Gemini 3.5 Live Translate — $3.50 por millón de tokens de entrada de audio y $21.00 por millón de tokens de salida de audio, con la facturación calculada a 25 tokens por segundo de audio. En conjunto, eso equivale aproximadamente a $0.037 por minuto de audio traducido.

En minutos de traducción pura, Goo​gle es aproximadamente una cuarta parte más barato. Eso no es una diferencia de redondeo a escala: 10,000 minutos interpretados al mes cuestan alrededor de $500 en la capa de voz de GPT-Live-1 frente a unos $368 en Gem​ini 3.5 Live Translate. Y la diferencia es real, no un artefacto del cambio de medición, porque los dos modelos facturan en unidades genuinamente diferentes.

Hay una trampa en la otra dirección. El precio destacado de $0.05 para GPT-Live-1 es solo el de la capa de voz. Si tu agente traduce y además busca algo, o escala una frase difícil a un modelo de razonamiento, estás pagando esa delegación por encima —y el modelo delegado se cobra por token como cualquier otro modelo de frontera. Una carga de trabajo solo de traducción nunca activa eso. Una carga de trabajo de traducción más cualquier otra cosa sí lo activa, y el ganador de la comparación por minuto deja de ser obvio.

A two-column comparison scoreboard titled 'GPT-Live-1 vs Gemini 3.5 Live Translate - the scoreboard'. The GPT-Live-1 column lists Status GA, Sept 10; Price $0.05 / minute; Scope conversational agent; Languages limited, vendor-flagged gaps; Tool calling yes, delegated; Tone preservation no. The Gemini 3.5 Live Translate column lists Status preview; Price about $0.037 / minute; Scope translation only; Languages 70+; Tool calling no; Tone preservation yes. A footer reads 'GPT-Live-1 figures per OpenAI; Gemini figures per Google. Different models, different jobs.'

La etiqueta de vista previa es el riesgo que nadie tiene en cuenta

El ID del modelo de Gemini 3.5 Live Translate es gemini-3.5-live-translate-preview. Se lanzó a la API Gemini Live y a Google AI Studio como vista previa pública, y simultáneamente a la aplicación Google Translate en Android e iOS y a una vista previa privada en Google Meet para clientes selectos de Workspace. Vista previa significa lo que siempre ha significado en Google: sin garantía de estabilidad, sin una ventana de descontinuación publicada, sin compromiso de que la tarifa que pagas sobreviva al próximo lanzamiento.

Para una aplicación de consumo, eso está bien. Para las cargas de trabajo a las que este modelo está realmente dirigido —interpretación en vivo en un centro de llamadas, un producto de reuniones, un producto de viajes—, es el mayor riesgo de integración en el stack. Estás construyendo una dependencia de producción sobre un modelo al que Google no se ha comprometido explícitamente.

GPT-Live-1 tiene el problema inverso, y es menor, pero no cero. Está disponible de forma general, a una tarifa publicada, con un endpoint documentado, y no va a desaparecer. Pero su superficie de API es reducida de un modo que sorprende a los equipos que asumen que encaja directamente en una integración existente de OpenAI: hay exactamente un ID de modelo, un endpoint, y no hay ninguna ruta a través de Chat Completions, Responses, Realtime, Batch, Assistants ni fine-tuning. La única vía de entrada es el endpoint Live Sessions en v1/live/sessions sobre WebRTC, con manejo de eventos en un canal de datos. Eso es una nueva integración, no un cambio de parámetro.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Idiomas, y dónde el generalista es honestamente más débil

El número de Google es más de 70 idiomas con preservación de voz y tono. La propia documentación de OpenAI es notablemente menos segura sobre su propia cobertura: el material de lanzamiento señala que para ciertos idiomas el modelo puede tener un acento no nativo o mostrar lagunas en fluidez, y no publica un recuento de idiomas que compita con el de Google.

Eso no es un proveedor haciéndose el evasivo — es lo que parece un modelo conversacional generalista junto a un especialista entrenado para el problema. Si la propuesta de valor de tu producto es «interpretamos 40 idiomas bien», el especialista es la elección honesta y el generalista te dejará en ridículo en la cola larga. Si tu producto es un agente de voz para un mercado de habla inglesa con una función de traducción añadida como un parche, las lagunas lingüísticas del generalista nunca saldrán a relucir.

Ambos modelos incorporan una marca de agua SynthID al audio generado, lo cual importa si estás en una jurisdicción o tienes un contrato con un cliente que exija procedencia en el habla sintética. Ese punto queda empatado.

A screenshot of Google's Gemini Live API overview documentation page, showing the banner 'Preview: The Live API is in Preview', the description that the Live API enables low-latency real-time voice and vision interactions by processing continuous streams of audio, images and text, an architecture diagram in which an app exchanges text, audio and video with the Live API over a WebSocket, and a left navigation listing Live translate under Live.

Dónde la arquitectura de delegación cambia la compilación

La diferencia estructural entre estos dos es que GPT-Live-1 en realidad son dos modelos con una costura en el medio. La capa de voz mantiene viva la conversación; un modelo de razonamiento separado se encarga del pensamiento. Esa costura es donde va tu esfuerzo de ingeniería, y también es donde el modelo de costos se complica.

Conviene saber que la mitad delegada es un modelo de texto normal que puedes enrutar como cualquier otro. GPT-5.6 Terra, el backend del propio ejemplo de Ope​nAI, se sirve a través de OrcaRouter a 2,00 $ por millón de tokens de entrada y 12,00 $ por millón de salida, con una ventana de contexto de 1 M de tokens y tanto /v1/chat/completions como /v1/responses expuestos. Si quieres cambiar el cerebro de razonamiento que hay detrás de un agente de voz —por un modelo más barato en llamadas simples, o uno más potente en escalamientos—, esa mitad del stack tiene opciones, porque es una llamada de API normal que se encuentra junto a aproximadamente otros 190 modelos con una sola clave.

La mitad de voz no lo hace. GPT-Live-1 no está en OrcaRouter, y Gem​ini 3.5 Live Translate tampoco; ambos solo están disponibles a través del proveedor que los creó. Donde un router se gana su lugar en una arquitectura como esta es en todo lo que está después del audio: los modelos de texto que hacen la recuperación, el resumen, la escritura de vuelta en el CRM y la escalación, que es la mitad de la cuenta que realmente puedes consolidar en una sola clave y una sola factura.

Qué elegir realmente

• Elige Gem​ini 3.5 Live Translate si la traducción es el producto, el precio por minuto importa más que la estabilidad contractual y puedes soportar que un modelo en vista previa cambie bajo tus pies. Presupuesta aproximadamente $0.037 por minuto y mantén una capa de abstracción sobre la llamada para que un modelo GA pueda reemplazarlo sin una reescritura.

• Elige GPT-Live-1 si necesitas un agente conversacional que, de paso, traduzca; si necesitas llamadas a funciones y uso de herramientas dentro del bucle de voz; o si un equipo de adquisiciones preguntará qué ocurre cuando el modelo se retire y necesitas una respuesta mejor que «nada, probablemente».

• No elijas ninguna de las dos solo porque ganó un benchmark. Los benchmarks de ambos lados no son comparables — las cifras de dúplex completo de OpenAI son propias, no reproducidas por ningún tercero, y las afirmaciones de Google sobre lenguaje no se han probado contra un modelo generalista en el mismo conjunto de audio.

Una nota prospectiva: las dos superficies están convergiendo en lugar de colisionar. El modelo de traducción de Goo​gle ya vive dentro de Gem​ini Live, y la capa de voz de GPT-Live-1 está diseñada explícitamente para que se incorporen nuevos modelos de frontera detrás de ella. La expectativa razonable es que, en un par de ciclos de lanzamiento, la traducción del generalista mejore y la historia de integración del especialista sea menos arriesgada. Si estás construyendo hoy y la decisión está reñida, eso es un argumento a favor de la opción más barata y más reemplazable, y de mantener la ruta de audio aislada detrás de una interfaz en cualquier caso.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario