
StepAudio 3 Realtime vs Sesame Preview: la voz que todos elogian vs la que tiene una puntuación
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Durante la mayor parte de 2026, la afirmación más fuerte que cualquiera podía hacer sobre la IA de voz era una impresión auditiva. El asistente de Sesame sonaba más humano que cualquier otra cosa, y suficientes personas lo dijeron como para que se convirtiera en el punto de referencia — sin benchmark, sin número y sin forma de comprobarlo. El 15 de septiembre de 2026, StepAudio 3 Realtime llegó de StepFun con un número asociado a la versión medible más cercana de esa cualidad: 98,9 % en la evaluación Conversational Dynamics de Artificial Analysis, primer lugar. Sesame Preview no aparece en ese ranking.
Lo interesante no es que uno haya superado al otro. Es que la cualidad por la que Sesame se hizo famoso ahora es algo que un tercero puntúa, y el modelo con la reputación nunca ha sido medido en comparación con ella.
Qué es cada uno de estos en realidad
No son el mismo tipo de objeto, y eso determina más de la comparación que cualquier puntuación.
Sesame Preview es un asistente de voz para consumidores. Gratis en iOS desde mayo de 2026 y ampliamente disponible en Android desde principios de agosto de 2026, está construido en torno a cuatro agentes con nombre —Maya, Miles, Simone y Charlie— que mantienen el contexto entre sesiones, buscan en la web y configuran recordatorios. Solo está disponible en inglés. Las llamadas tienen un límite de 30 minutos, que se reduce a cinco minutos cuando has cerrado sesión. No hay API para su voz de producción, ni nivel empresarial, ni precios públicos.
StepAudio 3 Realtime es una superficie para desarrolladores. Es uno de los cinco modelos de la familia StepAudio 3, todos lanzados el mismo día y todos disponibles en la plataforma abierta de StepFun como API comerciales. Gestiona conversaciones nativas en dúplex completo, razona directamente sobre el habla en lugar de transcribir primero, y admite llamadas a herramientas y ejecución asíncrona de tareas largas mientras la conversación continúa. Prioriza el chino. No tiene pesos abiertos y actualmente cuenta con precios de vista previa gratuita por tiempo limitado, sin tarifa posterior a la vista previa anunciada.
Puedes construir sobre uno de estos. El otro puedes visitarlo.
Lo medible por lo que Sesame es famoso
Conversational Dynamics es un benchmark específico, y vale la pena saber qué contiene. Evalúa la toma de turnos, la gestión de pausas, la recuperación tras interrupciones y si un modelo interpreta correctamente una breve señal de retroalimentación —«ajá», «ya», «mmm»— como un estímulo en lugar de como un intento de tomar la palabra. Esos son precisamente los comportamientos que describen los oyentes cuando dicen que una voz se siente humana y no robótica, y son los comportamientos que hacen que un asistente sea agradable de conversar y no solo preciso.
StepAudio 3 Realtime lidera esa tabla con un 98,9 %, por delante de Qwen Audio 3.0 Realtime Plus con un 98,4 % y de GPT-Realtime-2 con un 95,3 %. También ocupa el primer lugar en Razonamiento de voz con un 99,7 %, según StepFun, y detrás de ello subyace la afirmación arquitectónica de que razonar sobre audio sin procesar preserva el tono y el énfasis que un paso de transcripción aplanaría: la diferencia entre oír sarcasmo y oír un cumplido.
Esta es la forma honesta de enmarcar ese resultado. El benchmark es lo más parecido que tiene la industria a una medición de aquello por lo que se elogia a Sesame, y Sesame no ha sido incluido en él. Eso no es evidencia de que StepAudio 3 Realtime suene mejor que Sesame. Es evidencia de que una de estas afirmaciones es comprobable y la otra, hasta ahora, no lo es — y de que la comprobable actualmente la ostenta un modelo con el que la mayoría de la gente nunca ha hablado.

La asimetría de disponibilidad, que es la verdadera decisión
Todo lo anterior es interesante. Esta parte es decisiva.
La voz de Sesame —esa de la que la gente habla maravillas— es un modelo de producción más grande y cerrado que Sesame nunca ha publicado como API. No puedes comprarlo, licenciarlo ni llamarlo desde tu propio producto. Si leíste que el ritmo conversacional de Sesame es el mejor disponible y concluiste que podrías tenerlo, la conclusión no se sigue de la evidencia.
Lo que Sesame realmente ha publicado como código abierto es CSM-1B, lanzado bajo Apache-2.0. Es un bloque de síntesis, no un asistente: un backbone Llama predice el primer libro de códigos de Mimi y un decodificador Llama más pequeño predice el resto, que un códec Mimi renderiza a una forma de onda de 24 kHz. Es solo en inglés, clona una voz a partir de un clip de referencia de 10 a 15 segundos y no puede generar texto en absoluto: se empareja con un modelo de lenguaje aparte. Quienes han ejecutado ambos describen la voz de CSM-1B como claramente más débil que la de la aplicación Preview, y la ficha del modelo dice en voz alta lo que normalmente se calla: una variante de CSM con ajuste fino impulsa la demo interactiva, y esa variante no es el checkpoint que puedes descargar.
StepAudio 3 Realtime no tiene nada de esa ambigüedad. Es una API comercial con una familia de modelos publicada detrás, un conjunto de capacidades declarado y ubicaciones de terceros que puedes consultar. También prioriza el chino, con precios de vista previa, y registra un tiempo hasta el primer audio de 8,83 segundos en la misma tabla de clasificación donde gana en dinámica conversacional — frente a 1,18 segundos de Gemini 3.8 Live y de 1,24 a 1,34 segundos de GPT-Live-1. Cualquiera sea la calidad conversacional que ofrezca, todavía no ha demostrado que pueda entregarla a velocidad conversacional fuera de la propia infraestructura de servicio de StepFun.

Qué hacer con esto si estás eligiendo un stack de voz
Empieza por separar las dos preguntas. «¿Cómo debería sentirse una conversación?» y «¿qué puedo lanzar?» tienen respuestas distintas, y solo una de ellas es una decisión de adquisición.
Si estás calibrando el gusto —decidir cuánta calidez debería tener tu producto, cuánto silencio es cómodo, con qué rapidez debería ceder la palabra un agente—, Sesame Preview es gratis, genuinamente excelente y un buen lugar para pasar una tarde. Úsalo como punto de referencia. No planees una integración en torno a él, porque no hay nada con lo que integrarse.
Si estás lanzando, StepAudio 3 Realtime es un candidato real con salvedades reales: precios de vista previa, cobertura prioritaria en chino, sin puntuación de índice en Artificial Analysis y la cuestión de la latencia sin resolver. Prueba la latencia antes que la calidad de la conversación. Un modelo que gana el benchmark de toma de turnos pero tarda la mayor parte de una frase en empezar a hablar es un modelo cuya mejor calidad quizá nunca llegues a demostrar.
Y si la voz de producción de Sesame llegara a tener una API, toda esta comparación se volvería a ejecutar —porque el benchmark que lo zanjaría ya existe, y Sesame por fin tendría que aparecer en él.
Dónde encaja el enrutamiento y dónde no
Los agentes de voz no son un solo modelo. Ya sea que estés ejecutando StepAudio 3 Realtime o cualquier otra cosa, la conversación constantemente delega trabajo a modelos de texto comunes —una búsqueda, una extracción, una llamada de razonamiento que se ejecuta detrás de una pausa mantenida. Esa capa de delegación es donde vive la variación de costos y donde una mala hora de un proveedor se convierte en tu caída del servicio.
Para ser precisos sobre nuestra propia cobertura: los endpoints en vivo y de voz de la familia StepAudio 3 no están en OrcaRouter, y tampoco lo está nada de lo que ha construido Sesame. Lo que sí está en OrcaRouter es la capa de texto a la que delega un agente de voz: casi 200 modelos detrás de una sola API, conmutación por error automática, un DSL de enrutamiento que compone varios en una sola llamada, y fusión de modelos cuando el criterio de un solo modelo no es suficiente, con el precio de lista del proveedor transferido sin margen de beneficio.
Esa separación es lo que hace que la cuestión de la disponibilidad sea menos fatal de lo que parece. El modelo de voz es una decisión que puedes revisar; la capa de delegación es la que se vuelve costosa de deshacer, y es la que vale la pena poner detrás de un enrutador antes de comprometerte con cualquier proveedor de voz.

El veredicto
Sesame Preview gana en lo que no se puede medir y pierde en todo lo que se puede comprar. Es la voz con mejor sonido disponible, es gratis y no se puede poner en producción; y ahora que un tercero puntúa la calidad por la que es famosa, su ausencia en esa tabla de puntuaciones es una laguna en la evidencia, no una ventaja protegida.
StepAudio 3 Realtime gana en disponibilidad, medibilidad y capacidad, y conlleva auténticas preguntas abiertas sobre precio, cobertura de idiomas y latencia. Es el único de los dos sobre el que puedes construir hoy, lo que resuelve la cuestión práctica más rápido que cualquier benchmark.
Lo que hay que observar es sencillo, y funciona en ambos sentidos: una puntuación de Conversational Dynamics para la voz de producción de Sesame, o una cifra de latencia para StepAudio 3 Realtime que lo sitúe en el mismo rango que los modelos a los que actualmente supera en calidad. Cualquiera de las dos convertiría esto de una comparación entre una medición y una reputación en un verdadero cara a cara.
