Una tarjeta de título principal que dice 'GPT-Live-1 llega a la API' con el subtítulo '$0.05 por minuto para voz dúplex completa' y la línea 'El modelo es del 8 de julio de 2026; la API para desarrolladores se lanzó el 10 de septiembre de 2026', junto a dos formas de onda de audio superpuestas con flechas que se curvan en ambas direcciones, con el logotipo de OrcaRouter compuesto en la esquina.
Guides & Insights

GPT-Live-1 llega a la API: voz dúplex completo a 0,05 $ por minuto, sin una ruta de sustitución directa desde GPT-Realtime-2.1

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

GPT-Live-1 está en la API desde el 10 de septiembre, y el número que realmente redefinirá los presupuestos no es un benchmark — es la unidad de facturación. El modelo de voz dúplex completo de OpenAIOpe​nAI ahora factura a una tarifa plana de $0.05 por minuto de voz, cobrada por segundo, mientras que el modelo con el que se compara, GPT-Realtime-2.1, se medía en tokens de audio a $32 por millón de entrada y $64 por millón de salida. El modelo en sí no es nuevo: GPT-Live-1 se lanzó dentro de ChatGPT el 8 de julio de 2026, como reemplazo de Advanced Voice Mode. Lo nuevo es que los desarrolladores por fin pueden invocarlo — y que invocarlo no se parece casi en nada a la integración de Realtime que la mayoría de los equipos ya tiene. La propia documentación de OpenAIOpe​nAI combina la capa de voz con un backend de razonamiento separado, y en el ejemplo de WebRTC publicado ese backend es GPT-5.6 Terra.

Qué se lanzó el 10 de septiembre y qué no

La superficie de la API es estrecha por diseño. Hay exactamente un ID de modelo, gpt-live-1, que también es su propia instantánea predeterminada — sin variantes con fecha que fijar. Hay exactamente un endpoint, el endpoint de Live Sessions en v1/live/sessions. Todo lo demás en la plataforma de OpenAIOpe​nAI está desactivado para este modelo: sin Chat Completions, sin Responses, sin Realtime (incluidas las variantes de traducción y transcripción), sin Assistants, sin Batch, sin ajuste fino, sin embeddings, sin generación de imágenes ni video, sin endpoints de voz o transcripción de audio, sin moderación.

Las entradas y salidas son audio y texto. Se admiten streaming y llamada a funciones; las salidas estructuradas, el ajuste fino y las salidas predichas no. La entrada de imagen y vídeo no es compatible de forma explícita — así que la superficie de «voz con vídeo» que OpenAIOpe​nAI ha insinuado no forma parte de este lanzamiento. El nivel Free no puede llamarlo en absoluto, y los límites de velocidad se miden en sesiones simultáneas en lugar de solicitudes por minuto: 25 en el Tier 1, y suben a 50, 200, 300 y 500 en los Tiers 2 a 5.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Ese enfoque de concurrencia es la primera pista de que esto no es un reemplazo directo. Los límites de frecuencia denominados en conversaciones simultáneas en vivo te dicen cuál espera OpenAIOpe​nAI que sea la unidad de escala: una línea telefónica, no una solicitud.

El cambio de precios es la historia más discreta, pero más importante.

La facturación plana por minuto es una auténtica ruptura. Con la medición por tokens, tenías que modelar el consumo de audio —cuántos tokens cuesta un segundo de silencio, cómo una persona que llama y sigue hablando por encima del agente cambia la longitud de la salida— antes de poder predecir una sola llamada. A $0.05 por minuto, la aritmética se reduce a una multiplicación:

• Una llamada de soporte de 5 minutos — $0.25 de tiempo de voz

• Una llamada de 10 minutos — $0.50

• Una media de 4 minutos en 1.000 llamadas al día — $200 al día, aproximadamente $6.000 al mes

• Una hora de línea abierta continua — $3.00

Tres detalles afinan eso. Primero, la duración no se redondea al siguiente minuto completo, por lo que una llamada de 40 segundos cuesta aproximadamente 3,3 centavos en lugar de cinco centavos completos. Segundo, la inicialización de la sesión factura 15 segundos de duración de voz por adelantado — pero eso se acredita contra los cargos de duración posteriores, no se suma encima, por lo que una llamada de menos de 15 segundos igualmente queda al precio de 15 segundos. Tercero, la voz es solo la mitad de la factura. El modelo de razonamiento del backend, sus llamadas a herramientas y cualquier búsqueda web se facturan por separado a las tarifas normales de ese modelo, lo que significa que un “modelo de voz barato” aún puede producir una llamada costosa si diriges la delegación a un razonador de frontera y dejas que busque en cada turno.

Esa estructura de dos metros es donde el enrutamiento deja de ser un lujo. En OrcaRouter, la mitad de backend de una sesión de GPT-Live-1 no es más que otra llamada a un modelo: aproximadamente 190 modelos de once proveedores upstream detrás de una sola clave, al precio de lista del proveedor trasladado sin margen alguno, y con conmutación por error automática si el backend que eliges da error o se agota el tiempo de espera. No puedes enrutar la propia capa de voz; el endpoint Live Sessions es exclusivo de OpenAI. Sí puedes enrutar sin problema todo aquello a lo que delega la capa de voz, que es la mitad que escala según lo mucho que tengan que pensar tus interlocutores.

Solo WebRTC — por qué tu código de Realtime no se podrá portar

Este es el costo práctico de la migración, y la mayoría de la cobertura del lanzamiento lo omite. Las sesiones de GPT-Live-1 se ejecutan sobre WebRTC, no sobre el transporte WebSocket sobre el que están construidas muchas integraciones existentes de Realtime. Sondear la ruta anterior con un ID de modelo GPT-Live devuelve un error que te dice con todas las letras que las sesiones requieren WebRTC.

El handshake, según la guía de WebRTC de OpenAI: tu navegador abre una RTCPeerConnection, adjunta las pistas del micrófono, abre un canal de datos y registra los listeners antes de ofertar, establece la descripción local, espera a la recolección de ICE y envía la oferta a tu propio servidor. Tu servidor entonces llama a POST /v1/live/sessions con la configuración de la sesión más transport: { type: "webrtc", sdp: ... }. Un éxito devuelve HTTP 201 con session.id y transport.sdp, que el navegador aplica como descripción remota. Los medios viajan por las pistas negociadas; el canal de datos —etiqueta oai-events— transporta transcripciones, actualizaciones de sesión y trabajo delegado. Para colgar, envías session.close y sigues leyendo hasta que llegue session.closed.

Dos trampas que vale la pena pegar en el monitor. La llamada HTTP en sí inicia la sesión, así que tampoco debes enviar session.start en el canal de datos. Y no debes añadir audio de entrada ni esperar deltas de audio de salida por ese canal — deja audio.format fuera de la configuración y deja que SDP se encargue. Los ejemplos del servidor limitan el cuerpo de la solicitud a 64 KB, aplican un tiempo de espera a la recopilación de ICE después de 10 segundos y a la finalización de la sesión después de 15.

Nada de eso es difícil. Todo es código nuevo. Si tu producto es un agente en tiempo real basado en turnos, migrar a GPT-Live-1 es una reescritura del transporte más una reescritura de la delegación, no un simple cambio de ID de modelo; vale la pena presupuestarlo como un sprint en lugar de una tarde.

Los benchmarks, y quién ejecutó cada uno de ellos

Cada cifra que aparece a continuación es de OpenAIOpe​nAI, publicada con el lanzamiento de la API y no reproducida de forma independiente por nadie en el momento de escribir esto. Esa salvedad importa más de lo habitual aquí, porque las diferencias son lo bastante grandes como para que inviten a que se citen como hechos establecidos.

A two-column comparison scoreboard titled 'GPT-Live-1 vs GPT-Realtime-2.1 — the scoreboard'. The GPT-Live-1 column lists price $0.05 per minute, billing unit per second, interactivity 80.1%, turn-taking latency 0.8 s, tool-calling accuracy 87%, and endpoint 'Live Sessions only'. The GPT-Realtime-2.1 column lists price $32 / $64 per 1M audio tokens, billing unit per audio token, interactivity 45.4%, turn-taking latency 1.4 s, tool-calling accuracy 60%, and endpoint 'Realtime + WebSocket'. A footer reads 'GPT-Live-1 figures are OpenAI's own, unreproduced; Realtime-2.1 pricing per OpenAI API docs.'

• Interactividad full-duplex — GPT-Live-1 80,1 % frente a 45,4 % de GPT-Realtime-2.1

• Latencia de cambio de turno — 0,8 s vs 1,4 s

• Precisión de invocación de herramientas — 87% vs 60%

• Benchmark de soporte de voz bancario, tasa de aprobación — 32% vs 12,4%

Lee la última línea dos veces. Una tasa de aprobación del 32 % es una gran mejora respecto al 12,4 % y aun así significa que el sistema falló aproximadamente dos tercios de las tareas en esa evaluación. Los saltos en interactividad y en la invocación de herramientas son los que describen un producto genuinamente distinto; la cifra de la banca es la honesta sobre lo lejos que aún están los agentes de voz de gestionar un flujo de trabajo regulado sin supervisión.

La evidencia de clientes es más escasa que la tabla de referencia y apunta en la misma dirección. Yelp está usando GPT-Live-1 para reservas por teléfono, y se cita al CTO Alex Levy sobre la mejora en la gestión de llamadas. La plataforma de aprendizaje de idiomas Speak informó de casi un 80 % menos de interrupciones que su anterior sistema basado en turnos —una cifra autodeclarada por una empresa con intereses en el resultado y, aun así, el número de despliegue más concreto disponible.

La capa de voz es una interfaz; tú eliges el cerebro.

La apuesta arquitectónica es la delegación, y es la parte de esta versión en la que una capa de enrutamiento encaja de forma natural. GPT-Live-1 no se encarga del pensamiento profundo. Cuando quien llama pregunta algo que requiere razonamiento, recuperación o una herramienta, el modelo pasa la tarea a través de una frontera asíncrona a un backend separado que sigue trabajando mientras continúa la conversación hablada, y luego reintegra la respuesta cuando está lista.

La configuración es explícita, y vale la pena leer el ejemplo de la documentación con atención. Junto con model: "gpt-live-1" y las instrucciones, la sesión lleva un objeto delegation de tipo responses, cuyo bloque interno responses nombra el modelo de backend, sus propias instrucciones y sus herramientas —el ejemplo usa web_search— y un tool_choice. En el ejemplo de WebRTC publicado de OpenAI​OpenAI, ese modelo de backend es GPT-5.6 Terra.

A screenshot of the OrcaRouter model page for GPT-5.6 Terra, showing the model ID openai/gpt-5.6-terra, OpenAI as the provider with a 2026-07-09 release date, a 1M-token context window with 128K max output, pricing of $2.00 per 1M input tokens and $12.00 per 1M output tokens, a p50 TTFT of 2.38 s, and the exposed endpoints /v1/chat/completions and /v1/responses.

Esa es la verdadera afirmación del diseño: cambia el backend y la experiencia de voz se vuelve más inteligente sin reentrenar el modelo de voz. También significa que el backend de delegación es portátil de una forma en que la capa de voz no lo es. OrcaRouter no incluye gpt-live-1 — el endpoint de Live Sessions es exclusivo de OpenAI, y no enrutamos nada de eso. Pero la mitad de delegación habla la API de Responses, y esa mitad es enteramente tuya para elegir. GPT-5.6 Terra está disponible en OrcaRouter al precio de lista de OpenAIOpe​nAI — $2.00 por millón de tokens de entrada y $12.00 por millón de salida, con el endpoint de Responses expuesto — así que el modelo exacto del propio ejemplo de OpenAIOpe​nAI está a una sola llamada de distancia, sin un segundo contrato ni SDK.

En la práctica, eso convierte la elección del backend en configuración. Puedes hacer una prueba A/B de un razonador económico contra uno de frontera sobre tráfico de llamadas en vivo editando una sola línea y observando la factura por llamada, o mantener el modelo de delegación detrás de un failover automático para que una mala tarde en el upstream no se lleve por delante tu línea telefónica. La capa de voz por la que pagas 0,05 $ por minuto se queda donde está; todo lo que delega pasa por una única clave a través de aproximadamente 190 modelos de once proveedores upstream, al precio de lista del proveedor y sin ningún margen.

¿Qué falta todavía?

• Sin entrada de imagen ni video — las imágenes fijas y el uso compartido de pantalla no están en esta versión, por lo que la superficie de voz multimodal que aún conservan los modos anteriores de ChatGPT sigue sin abordarse

• Sin salidas estructuradas: si tu agente necesita argumentos de herramientas validados según un esquema, esa validación debe residir en tu modelo de backend, no en la capa de voz

• Sin acceso al nivel gratuito y sin ajuste fino: tanto el costo como la personalización comienzan en los niveles de pago

• Ninguna evaluación independiente de ninguna cifra destacada — todas las cifras anteriores las realiza el proveedor

• Un límite de concurrencia de 25 sesiones simultáneas en el Nivel 1 — generoso para un piloto, ajustado para un centro de llamadas desde el primer día

Quién debería moverse, y quién debería esperar

Cambia ya si estás construyendo telefonía —líneas de reservas, reserva de citas, soporte de primera línea— y tu stack actual es la clásica cascada de ASR a LLM a TTS. La latencia y la gestión de interrupciones son exactamente lo que ese pipeline pierde, el precio por minuto es lo bastante predecible como para ponerlo en una hoja de cálculo, y los propios documentos de OpenAIOpe​nAI ahora incluyen un ejemplo de servidor al estilo Twilio del que copiar. Cambia ya también si ya usas un modelo Realtime y tu producto es genuinamente conversacional en lugar de basado en turnos, porque la gestión de interrupciones es justo la parte en la que GPT-Realtime-2.1 era peor.

Espera si tu integración está basada en turnos y funciona. La reescritura del transporte es trabajo real, el endpoint no admite nada más y no hay una ruta de migración que conserve tu código WebSocket existente. Espera también si tu caso de uso depende de salidas estructuradas de herramientas o de entrada de vídeo, ambas ausentes aquí.

Qué observar durante las próximas semanas: la primera reproducción independiente de la cifra de interactividad del 80,1 %, si la tarifa de $0,05 es introductoria, si un GPT-Live-1 mini más pequeño llega a la API tal como lo hizo en el lado del consumidor, y si la entrada de imagen y pantalla cierra la brecha. Hasta que un laboratorio externo realice esa evaluación, el resumen honesto es que este es el modelo de voz más capaz que alguien haya lanzado a los desarrolladores, con el comprobante de esa afirmación escrito por quienes lo venden.