Una tarjeta de título principal que dice 'GPT-Live-1 vs SeedRealtime', con el subtítulo 'El modelo más ambicioso que no puedes invocar' y la línea 'Disponible de forma general en la API vs solo en la app de Doubao', sobre dos paneles: el de la izquierda muestra una puerta abierta con un glifo de corchete de API y una insignia 'API'; el de la derecha muestra la misma puerta con un candado atravesado y una insignia 'SIN API'; cada uno con un icono de audio y cámara que combina una forma de onda con un diafragma, con el logotipo de OrcaRouter compuesto en la esquina.
Guides & Insights

GPT-Live-1 vs SeedRealtime: SeedRealtime es el modelo más ambicioso, y no puedes comprarlo

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Comparar GPT-Live-1 y SeedRealtime en cuanto a capacidad produce una respuesta incómoda, porque los dos modelos no compiten en los mismos términos. GPT-Live-1 es el modelo de voz dúplex completo de OpenAI, lanzado dentro de ChatGPT el 8 de julio de 2026 y abierto a los desarrolladores mediante la API Live Sessions el 10 de septiembre de 2026, con 12 voces, una tarifa por minuto publicada y un hueco importante: la entrada de imagen y video no es compatible explícitamente. SeedRealtime, lanzado por el equipo Seed de ByteDance el 5 de agosto de 2026, está construido enteramente en torno a ese hueco. Es un modelo dúplex completo audiovisual nativo que observa, escucha y habla en una única arquitectura de extremo a extremo —y solo está disponible dentro de la aplicación para consumidores Doubao, sin API pública, sin pesos abiertos, sin informe técnico y sin un número de parámetros publicado.

Lo que cada uno puede percibir realmente

La manera más clara de ver la brecha es preguntar qué sabe cada modelo sobre la habitación en la que se encuentra.

GPT-Live-1 oye. Esa es toda la superficie de entrada. Entran audio y texto, salen audio y texto, y la documentación de Ope​nAI enumera imagen y vídeo como no compatibles. Maneja extraordinariamente bien la mecánica conversacional de la escucha: decide muchas veces por segundo si seguir escuchando, hacer una pausa, interrumpir o llamar a una herramienta, y mantiene dúplex completo, por lo que sigue procesando el audio entrante mientras habla. También devuelve transcripciones de reconocimiento de voz junto con el audio, que es el tipo de detalle poco glamuroso que ahorra una semana de trabajo de integración.

SeedRealtime oye y ve, en un solo modelo en lugar de en una canalización. ByteDance describe una arquitectura unificada que maneja audio, video y texto juntos, resuelve ambigüedades con contexto visual —distingue homófonos, entiende a qué se refiere «esto» a partir de la escena, los gestos, la mirada y la acción previa— y ejecuta la percepción, la comprensión, la toma de decisiones y la expresión en paralelo en lugar de en secuencia. Las demostraciones publicadas por ByteDance incluyen una cena de grupo ruidosa en la que el modelo tiene que vincular voces con identidades, una visita a un museo, la corrección de un flujo de trabajo de espresso y la supresión de interferencias en un aeropuerto mientras mantiene memoria fuera de pantalla y realiza una búsqueda en línea.

• Entradas — GPT-Live-1 solo audio y texto, imagen y video explícitamente no compatibles frente a SeedRealtime, con audio, video y texto fusionados en un solo modelo

• Alternancia de turnos — GPT-Live-1 decide internamente, muchas veces por segundo, mientras que SeedRealtime mueve la alternancia de turnos dentro del modelo y elimina por completo el detector externo de actividad de voz

• Comportamiento proactivo — GPT-Live-1 responde, delega y llama a herramientas, frente a SeedRealtime, que se describe como alguien que habla sin que se le pida cuando un objeto objetivo aparece en el campo de visión

• Disponibilidad — GPT-Live-1 disponible de forma general en la API de Ope​nAI a 0,05 $ por minuto frente a SeedRealtime, gratis dentro de Doubao, sin API y sin fecha prevista para una

A two-column comparison scoreboard titled 'GPT-Live-1 vs SeedRealtime - the scoreboard'. The GPT-Live-1 column lists Availability GA, published rate; Price $0.05 / minute; Inputs audio and text; Video understanding not supported; Tool calling delegated to backend model; Evidence vendor benchmarks, unreproduced. The SeedRealtime column lists Availability Doubao app only, no API; Price free in app, no developer price; Inputs audio, video and text; Video understanding core capability; Tool calling tool calls woven into responses; Evidence one human-eval claim, no methodology. A footer reads 'SeedRealtime has no published parameter count, no technical report and no independent benchmarks.'

La calidad de la evidencia va en sentido contrario a la ambición

Aquí es donde la comparación deja de favorecer a ByteDance.

Ope​nAI publica cifras. Son suyas, comparan GPT-Live-1 con GPT-Realtime-2.1 en lugar de con un competidor, y ningún laboratorio independiente las ha reproducido: 80,1 % en interactividad full-duplex frente a 45,4 %, latencia de toma de turnos reducida de 1,4 segundos a 0,8, precisión de llamadas a herramientas del 60 % al 87 %. Que lo ejecute el proveedor y que no se haya reproducido es una salvedad real, y es una salvedad que al menos se puede vincular a una cifra.

ByteDance no publica casi nada. La afirmación central sobre SeedRealtime es una evaluación humana de extremo a extremo que dice que reduce a la mitad los problemas de ritmo conversacional audiovisual en comparación con sistemas en cascada de ASR más visión más TTS — menos cortes a mitad de frase, menos respuestas lentas tras una pausa, menos activaciones falsas provocadas por conversaciones de fondo. No hay tamaño de muestra, ni metodología, ni una cifra exacta de la mejora, y ninguna cifra de latencia. Tampoco hay recuento de parámetros ni informe técnico.

El resultado es que el modelo con la arquitectura más interesante es el que menos se puede evaluar. Eso no es lo mismo que decir que rinde peor —las demostraciones son realmente llamativas, y el informe de ingeniería sobre la entrada audiovisual por fragmentos y la generación en streaming sugiere un sistema real más que una demo—, pero sí significa que cualquier comparación entre estos dos en cuanto a calidad es actualmente una comparación entre un modelo documentado y un vídeo impresionante.

Por qué la brecha de la API no es un detalle

SeedRealtime se ha implementado por completo dentro de Doubao desde el 5 de agosto de 2026, tanto en voz como en video, de forma gratuita. No tiene endpoint de Volcano Engine ni de BytePlus, ni nivel de pago, ni cuota publicada, ni un plazo declarado para abrir el acceso a desarrolladores. La hoja de ruta de ByteDance menciona menor latencia, un seguimiento de hablante más preciso y tareas conectadas a herramientas; no menciona una fecha.

Hay una salvedad de acceso que lo agrava. Doubao es un producto orientado primero a China continental y, por lo general, requiere un número de móvil de China continental para registrarse, y no se ha anunciado una versión localizada en inglés. Para un equipo fuera de China, SeedRealtime no solo no se ha lanzado como API, sino que tampoco es accesible como producto.

Compara eso con la carga de integración propia de GPT-Live-1 y la disyuntiva se vuelve concreta. La API de OpenAI es limitada de unas formas que sorprenden a la gente: un solo ID de modelo, un solo endpoint en v1/live/sessions, transporte WebRTC con manejo de eventos en un canal de datos, y ninguna vía a través de Chat Completions, Responses, Realtime, Batch ni los endpoints de ajuste fino. Los límites de velocidad se expresan en sesiones concurrentes —25 en el Nivel 1, y suben a 50, 200, 300 y 500— en lugar de solicitudes por minuto, y el nivel gratuito no puede llamar al modelo en absoluto. Esa es una integración nueva, y sigue siendo una integración que puedes empezar esta tarde.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Dos respuestas al mismo problema de delegación

Ambos modelos rechazan el antiguo diseño en cascada, en el que el reconocimiento de voz, un modelo de lenguaje y la síntesis de voz se ejecutan en secuencia con aproximadamente 1,7 segundos de silencio entre turnos. Lo rechazan de manera distinta, y la diferencia te dice cuál está diseñado para una llamada telefónica y cuál está diseñado para una sala.

GPT-Live-1 divide el trabajo verticalmente. Una capa de voz rápida mantiene la conversación; todo lo que sea más pesado —búsqueda web, razonamiento más profundo, trabajo agéntico— se delega a un modelo de razonamiento aparte a través de la Responses API mientras la conversación continúa. El ejemplo de WebRTC publicado por Ope​nAI conecta ese backend con GPT-5.6 Terra. La consecuencia es que la mitad pensante es una llamada normal a un modelo de texto, con precio por token y, por lo tanto, algo que puedes elegir, intercambiar y enrutar con independencia de la capa de voz. Para una línea de soporte, esa es la forma correcta: la voz es la interfaz y el razonamiento es el producto.

SeedRealtime lo mantiene todo en una sola red, que es lo que le permite observar un gesto mientras está a mitad de frase. También es lo que hace imposible descomponerlo: no puedes intercambiar la mitad de razonamiento, porque no hay una mitad de razonamiento, y no puedes ejecutarlo en ninguna parte, porque no hay ninguna parte donde ejecutarlo.

Si hoy estás construyendo un agente de voz, esa distinción es toda la decisión. Solo uno de estos dos es un componente que puedes poner en una arquitectura. GPT-5.6 Terra, el backend del ejemplo de delegación de OpenAI, se sirve a través de OrcaRouter a 2,00 $ por millón de tokens de entrada y 12,00 $ por millón de salida con un contexto de 1 M de tokens y tanto /v1/chat/completions como /v1/responses expuestos — junto con aproximadamente otros 190 modelos con una sola clave, de modo que el nivel de razonamiento detrás de un agente de voz se puede dividir, tarificar y conmutar en caso de fallo sin tocar la ruta de audio. Ni GPT-Live-1 ni SeedRealtime son servidos por OrcaRouter; provienen de una única fuente, sus propios proveedores, y ningún router puede cambiar eso.

A screenshot of ByteDance Seed's official SeedRealtime product page in its English locale, showing the date August 5, 2026, the heading 'SeedRealtime: An Audio-Visual Full-Duplex LLM', the description that it can jointly understand audio, visual and temporal information to deliver a watch, listen and speak experience, and an EN language toggle active in the header.

¿Qué cambiaría la respuesta?

Tres cosas, en orden de probabilidad.

• Una API para desarrolladores de ByteDance. Si SeedRealtime aparece en Volcano Engine o BytePlus con una tarifa publicada, deja de ser un caso de estudio y se convierte en un producto genuinamente diferenciado: dúplex completo audiovisual sin competidor alojado en Occidente. Esa es la señal que hay que observar, y no ha aparecido.

• Visión llegando a una API de voz alojada. La documentación de GPT-Live-1 es explícita en que las imágenes y el vídeo no son compatibles, lo que se lee menos como un descuido que como una frontera deliberada de la primera versión. Si Ope​nAI lanza la superficie de vídeo que ha estado mostrando en otras partes de ChatGPT, la brecha de capacidades que hace interesante a SeedRealtime se reduce considerablemente.

• Cualquier medición independiente de SeedRealtime. Una cifra de latencia de terceros o un recuento de parámetros permitiría comparar a los dos en algo distinto de la ambición.

El veredicto práctico para cualquiera que esté construyendo ahora es breve. GPT-Live-1 es el único de estos dos que puedes desplegar y, a 0,05 $ por minuto con facturación por segundo, con doce voces y un endpoint documentado, es una opción predeterminada razonable para voz conversacional. SeedRealtime es el modelo más interesante y bien podría ser el más capaz; también es, por el momento, una demostración de cómo es una arquitectura audiovisual convergida más que un producto que puedas poner frente a un cliente. Archívalo en la categoría de lo que hay que observar, no de aquello sobre lo que construir.