
GPT-Live-1 vs. Sesame Preview: la mejor voz de esta comparación es la que no puedes comprar
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código

Pregúntale a cualquiera que haya usado ambos y la clasificación no está reñida: Sesame Preview es el asistente de voz más convincente con el que la mayoría de la gente ha hablado. También es el que no puedes usar como base. GPT-Live-1 y Sesame Preview se comparan constantemente —ambos son conversacionales, ambos gestionan las interrupciones, ambos suenan como una persona en lugar de un menú telefónico—, pero se ofrecen de maneras opuestas. GPT-Live-1 es un modelo alojado que alquilas por minuto, invocable públicamente desde el 10 de septiembre de 2026. Sesame Preview es una aplicación de consumo gratuita sin API alguna, y la voz que impresiona a la gente funciona con un modelo de producción que nunca se ha lanzado.
Lo que realmente es cada uno
• GPT-Live-1 — el modelo de voz dúplex completo de OpenAI, en ChatGPT desde el 8 de julio de 2026, en la API desde el 10 de septiembre a $0.05 por minuto de voz. Doce voces de API, sin clonación, sin entrada de imagen ni video, transcripciones y texto de respuesta devueltos con cada sesión.
• Sesame Preview — el asistente de voz para consumidores de Sesame. Gratis en iOS desde mayo de 2026, disponible de forma general en Android desde principios de agosto de 2026, además de una vista previa web centrada en la voz. Cuatro agentes —Maya, Miles, Simone y Charlie— solo en inglés, con un límite de llamada de 30 minutos que se reduce a 5 minutos cuando no se ha iniciado sesión.
• CSM-1B — la parte de Sesame que es abierta: un modelo de voz conversacional de 1B publicado bajo Apache 2.0 el 23 de abril de 2026, construido sobre una base de arquitectura Llama con un decodificador separado y el códec Mimi de Kyutai, que produce voz en inglés mono a 24 kHz a partir de un contexto de aproximadamente 4K tokens.
Las tres líneas anteriores son toda la forma de la decisión. Una empresa vende un modelo por minuto. La otra regala una aplicación y publica como código abierto un modelo más pequeño que no es el que está en la aplicación.
La brecha entre la demo y la descarga
Sesame ha hablado de esto con una franqueza inusual, y es el dato más importante para cualquiera que evalúe a ambos. La voz de la aplicación Preview —la que generó los clips virales y las reseñas del «modo de voz mejor de su clase»— es un modelo de producción más grande y cerrado. CSM-1B es un checkpoint abierto de 1B de parámetros del mismo laboratorio y, según la evaluación de quienes han ejecutado ambos, es una voz marcadamente más débil. Las sesiones en Preview también tienen un límite y están restringidas al inglés, y no hay ejecución de tareas: los agentes hablan, pero no reservan, compran ni archivan nada.
Eso deja a los desarrolladores con una oferta real pero más limitada: un checkpoint de voz conversacional autoalojable sin cuota de licencia, alojado por un proveedor de inferencia externo a $7 por millón de caracteres —aproximadamente $0,35 por hora de audio sintetizado— o gratis en tu propio hardware. Nadie ha publicado un benchmark independiente ni de la voz Preview ni de CSM-1B, así que cualquier afirmación sobre la calidad en uno u otro sentido es una impresión auditiva, no una medición. Sesame tampoco ha publicado precios públicos, ni un nivel empresarial, ni un plan de monetización; la dirección declarada de la compañía son las asociaciones de investigación y un producto de hardware previsto.

Lo que se obtiene por $0.05 por minuto y que no se obtiene gratis.
El argumento de venta de GPT-Live-1 a un desarrollador no es que suene mejor, porque esa discusión es imposible de ganar contra un modelo cerrado que nadie puede medir. Es que la cosa se puede invocar y tiene precio. En concreto, lo que obtienes mientras el medidor avanza:
• Una sesión que tú controlas: un ID de modelo, un endpoint de Live Sessions, el ejemplo de integración publicado ejecutándose sobre WebRTC, y una sesión que configuras con instrucciones, voces y un bloque de delegación.
• Manejo de interrupciones como un comportamiento documentado — 80.1% de interactividad en Full Duplex Bench v1.5 frente al 45.4% de GPT-Realtime-2.1, con una latencia de toma de turnos de 0.798 segundos y un 87% de éxito en llamadas a herramientas. Las tres son cifras de la propia OpenAI, publicadas con el lanzamiento y no reproducidas por nadie en el momento de escribir esto.
• Un backend de razonamiento que elijas: la capa de voz transfiere el trabajo pesado a través de un límite asíncrono a un modelo aparte especificado en la configuración de la sesión, que sigue trabajando mientras la conversación continúa. En el ejemplo de la documentación de OpenAI, ese backend es GPT-5.6 Terra; en el lanzamiento para consumidores de julio, era GPT-5.5.
• Transcripciones, texto de respuesta y facturación con formato de telefonía — $3.00 por una hora de línea abierta continua, cobrada por segundo, con 15 segundos de inicialización de sesión acreditados en lugar de añadidos.
Sesame te da una mejor conversación y ninguna de esas cosas. Si estás desarrollando un producto, "mejor conversación, sin API, sin precio, sin benchmark, solo en inglés, límite de 30 minutos" no es una comparación — es una lista de espera.
Hay un número en GPT-Live-1 ahora que no existía en su lanzamiento para consumidores, y es el contrapeso honesto a todo lo anterior. El índice Speech to Speech de Artificial Analysis puntúa a GPT-Live-1 con un 69,8 % —séptimo de once modelos, por detrás de GPT-Realtime-2.1 con un 73,9 % y de Grok Voice Think Fast 2.0 con un 79,0 %. Así que el modelo que puedes comprar tampoco es el mejor en la tabla independiente. Lo que la tabla no puede puntuar es aquello en lo que Sesame realmente está ganando: ninguno de los once modelos de ese índice fue valorado por lo que se siente al hablar con él, y la voz de Sesame Preview no tiene fila en ninguna parte.

La parte del stack que no pertenece a ninguna de las dos empresas
Aquí es donde ambas opciones convergen, y donde la decisión deja de ser binaria. Ni Sesame Preview ni GPT-Live-1 son un agente completo. Los agentes de Sesame no ejecutan tareas; GPT-Live-1 delega explícitamente cualquier cosa que requiera razonamiento, recuperación o una herramienta a un modelo de backend. En ambos diseños, el trabajo interesante ocurre detrás de la voz, en una llamada a un modelo de texto plano, y esa capa es portátil de una manera en que la capa de voz no lo es: puedes cambiar un backend sin volver a grabar ni un solo prompt para el modelo de voz.
Ese backend también es donde OrcaRouter resulta útil, y vale la pena ser precisos sobre lo que enrutamos y lo que no. No enrutamos GPT-Live-1: el endpoint Live Sessions es de OpenAI, y la capa de voz que hay allí queda fuera de nuestro alcance. Tampoco enrutamos el modelo de producción de Sesame, por la razón más simple de que nunca se ha ofrecido como API. Lo que sí enrutamos es la capa a la que ambos productos delegan el trabajo. Unos 190 modelos de once proveedores upstream se ejecutan detrás de una clave al precio de lista del proveedor y sin recargo, con conmutación automática por fallo entre proveedores y un DSL de enrutamiento que puede componer varios modelos en una sola llamada. Para un equipo que construye sobre una interfaz de voz no probada, esa es la protección que importa: la capa de voz se puede sustituir o quedar abandonada sin llevarse consigo la capa de razonamiento, y el modelo por el que apostaste en marzo se puede reemplazar en junio editando una sola línea.
Qué ver
Tres cosas cambiarían esta comparación, y ninguna de ellas está todavía en manos de nadie. Una API de Sesame —incluso una de pago— convertiría al instante la voz más fuerte de la categoría en una opción que se puede construir, y pondría un precio real junto a los $0.05 de GPT-Live-1. Un benchmark publicado de la voz Preview convertiría una impresión auditiva en un número, y las evaluaciones independientes suelen ser duras con las voces que solo han competido en demos. Y la primera reproducción externa de las cifras de interactividad y latencia de OpenAI zanjaría si el dúplex completo es una brecha real de capacidad o una evaluación bien elegida.
Hasta entonces, la división honesta es esta. Si estás eligiendo una voz para ti, usa Sesame Preview: es gratis, es mejor, y no te cuesta nada preferirla. Si estás eligiendo una voz para un producto que tienes que lanzar, vender y dar soporte, GPT-Live-1 es el único de los dos que realmente puedes comprar, y el hecho de que no sea el que mejor suena es el precio de entrada.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
