Una tarjeta hero generada para 'Gemini 3.8 TTS vs Sesame Preview' sobre un fondo blanco con suaves acentos de degradado azul y cian. La tarjeta izquierda 'Gemini 3.8 Flash TTS' enumera Elo 1.260 en el puesto 2, 8 voces de arena, un endpoint de API y $16,50 por 1M de caracteres normalizados; la tarjeta derecha 'Sesame' se divide en 'Aplicación de vista previa — gratuita, solo en inglés, sin API, sin ID de modelo' y 'Checkpoint CSM-1B — Apache 2.0, 2B de parámetros, backbone Llama'. Una línea al pie dice 'Elo según Artificial Analysis Provider Voice Arena, sept 2026; detalles de CSM-1B según su ficha del modelo'. El logotipo de OrcaRouter está superpuesto en la esquina inferior derecha.
Guides & Insights

Gemini 3.8 TTS vs Sesame Preview: uno de estos es una descarga, el otro es una aplicación

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Busca una comparación entre Gemini 3.8 Flash TTS y Sesame Preview y encontrarás muchos textos que los tratan como dos productos de la misma categoría. No lo son, y la diferencia no es un tecnicismo. Gemini 3.8 Flash TTS es un endpoint de API: tiene un identificador de modelo, una tarifa publicada, una fila en la tabla de clasificación en el puesto 2 con un Elo de 1,260 en 1,999 muestras en el Artificial Analysis Provider Voice Arena, y un formato de solicitud documentado. Sesame Preview es una aplicación gratuita de asistente de voz para consumidores con agentes con nombre, conversaciones multiturno y un límite de llamada de 30 minutos. No tiene API, ni ID de modelo, ni plan de facturación, ni puntuación en esa tabla.

El único artefacto de Sesame sobre el que realmente puedes construir es, de nuevo, algo distinto: CSM-1B, un checkpoint con licencia Apache 2.0 en Hugging Face que genera códigos de audio a partir de texto usando una arquitectura base Llama y un decodificador de audio Mimi. No es la voz de la que habla la gente cuando describe lo humana que suena la app. Así que la comparación se reduce a una pregunta que tiene respuesta: ¿quieres alquilar un modelo de voz o quieres descargar uno?

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Sesame, showing what each one is (a hosted API against a consumer app), model ID (gemini-3.8-flash-tts against none), Elo (1,260 at rank 2 against not ranked), price ($16.50 per 1M characters against free with no meter), licence (vendor terms against not applicable to the app) and two-speaker support (yes against agents rather than a script).

Dos cosas llamadas Sesame, y solo una de ellas se puede construir

La nomenclatura es el origen de la mayor parte de la confusión, así que sepárala antes de continuar.

• Sesame Preview — la aplicación. De uso gratuito, agentes llamados Maya, Miles, Simone y Charlie, conversación multiturno con contexto que persiste entre turnos, búsqueda web y recordatorios como capacidades, solo en inglés, un límite de 30 minutos por llamada. No hay una superficie para desarrolladores: nada contra lo que autenticarse, nada que medir, ningún endpoint al que llamar.

• CSM-1B — el checkpoint. Publicado en Hugging Face bajo sesame/csm-1b con una licencia Apache 2.0, un backbone Llama y un decodificador más pequeño que produce códigos de audio Mimi. Aproximadamente 2 mil millones de parámetros, inglés, pesos F32, y se ejecuta a través de Hugging Face Transformers. La tarjeta del modelo registra que la variante 1B se lanzó en marzo de 2025 y que el soporte nativo de Transformers llegó en mayo de 2025.

Esos dos comparten una empresa y un linaje de investigación, y más o menos ahí termina la relación. La app es un producto; el checkpoint es un artefacto de la investigación que la precedió. Los críticos que elogian la memoria conversacional de la app están describiendo un sistema con recuperación y gestión de estado en torno a un modelo de habla, no una propiedad del checkpoint de 2B que puedes descargar.

¿Qué hay realmente en el checkpoint?

CSM-1B es un modelo de texto a voz en el sentido arquitectónico que importa para cualquiera que planee ejecutarlo: toma texto y contexto de audio como entrada y emite códigos de audio RVQ, que el decodificador convierte en forma de onda. Los datos prácticos de la tarjeta del modelo:

• Licencia — Apache 2.0. Esta es la línea más trascendental de la página. A diferencia de las licencias de pesos solo para investigación, Apache 2.0 permite el uso comercial sin un acuerdo aparte, lo que convierte a CSM-1B en uno de los pocos checkpoints de voz abiertos genuinamente utilizables.

• Tamaño — alrededor de 2B parámetros en F32. Lo suficientemente grande como para necesitar hardware real para cualquier cosa concurrente, y lo suficientemente pequeño como para ejecutarse en un solo acelerador para desarrollo.

• Idioma — Inglés, según la tarjeta. No es un modelo multilingüe.

• Tracción — 141.461 descargas en el último mes en el momento de escribir esto, con aproximadamente 245.000 me gusta en el repositorio. Eso es un checkpoint ampliamente utilizado según los estándares de los modelos de voz abiertos, y es el argumento más sólido de que el artefacto tiene una base de usuarios real independiente de la prensa de la aplicación.

A screenshot of the Hugging Face model card for sesame/csm-1b, showing the Apache 2.0 licence, the roughly 2 billion parameter F32 weights, the Llama backbone and Mimi audio decoder description, and the repository's download and like counts.

Lo que la tarjeta no te da es una afirmación de calidad que puedas comparar con algo. No hay una entrada en la arena, ni un benchmark de proveedor reproducido por un tercero, ni una evaluación publicada de cómo se relaciona la salida del checkpoint con la de la app. Cualquiera que te diga que el modelo descargable se parece a la app lo está infiriendo del nombre.

Por qué no hay una comparación directa y por qué eso no es una laguna de investigación

No existe una comparación entre Gemini 3.8 TTS y Sesame Preview en las tablas de clasificación porque no puede existir. La arena clasifica los modelos haciendo que los oyentes comparen clips producidos por un endpoint alojado. Uno de los lados de este emparejamiento no tiene un endpoint, así que no se puede inscribir.

Vale la pena ser preciso sobre esto, porque «no existe una comparación directa» a menudo se redacta como si faltaran los datos. No es que falten. Es que no están definidos. Las dos cosas que se comparan no comparten una superficie medible:

• Gemini 3.8 Flash TTS se puntúa según sus voces alojadas nativas. Sesame Preview no tiene voces nativas que puntuar en ese sentido — tiene agentes.

• Gemini 3.8 Flash TTS publica una tabla de tarifas en tokens. Sesame Preview es gratis y no publica nada, porque no hay nada que facturar.

• Gemini 3.8 Flash TTS toma un guion y devuelve audio. Sesame Preview toma una conversación y devuelve una conversación, con cualquier recuperación y memoria que la aplicación añada por encima.

Lo más parecido a una comparación legítima es la que hay entre Gemini 3.8 Flash TTS y CSM-1B, y aun así es desigual: uno tiene un Elo independiente y una lista de precios del proveedor; el otro no tiene ninguna de las dos. Lo que sí puedes comparar es la forma del compromiso —una API con medición de uso frente a un checkpoint descargable—, y esa comparación no necesita una tabla de clasificación.

El único lado de esto que tiene números

Todo lo cuantitativo en esta combinación está del lado de Google, lo cual es en sí mismo el punto.

En el Artificial Analysis Provider Voice Arena, con datos registrados el 24 de septiembre de 2026, Gemini 3.8 Flash TTS está en el puesto 2 con un Elo de 1.260 en 1.999 muestras y 8 voces de la arena, lanzado el 23 de septiembre de 2026. Su modelo hermano, Gemini 3.8 Flash-Lite TTS, está en el puesto 6 con 1.235. Google cobra por Flash TTS $0,50 por millón de tokens de texto de entrada y $9,00 por millón de tokens de audio de salida hasta el 31 de diciembre de 2026, y luego $18,00, con Flash-Lite TTS a $0,50 y $6,00, y luego $12,00; Artificial Analysis normaliza esos valores a $16,50 y $11,00 por millón de caracteres para que puedan compartir una tabla con modelos que facturan en otras unidades. Esa normalización es la aritmética de la tabla, no una cotización de Google.

En cambio, CSM-1B no tiene precio porque no tiene medidor. Tiene un recuento de descargas, una licencia y un número de parámetros. Si tu marco de decisión necesita un Elo, esta comparación no lo aportará por el lado de Sesame, y la conclusión honesta es que las dos opciones se están evaluando con criterios distintos, y no que una de ellas no esté demostrada.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, released September 23, 2026, with Gemini 3.8 Flash-Lite TTS at rank 6 and no Sesame row anywhere on the board.

Si lo que querías era la experiencia de la aplicación

Muchas personas que buscan esta comparación no están eligiendo un modelo en absoluto. Usaron la app Sesame, les gustó cómo se sentía la conversación y quieren eso en su producto. Ese es un problema diferente, y la descarga no lo resolverá.

Lo que hace que la app se sienta como se siente no es, en su mayor parte, el modelo de voz. El contexto persistente entre turnos, la decisión de buscar en la web a mitad de conversación, la sincronización de cuándo habla un agente —eso es orquestación, y nada de eso reside en un checkpoint de 2B. Descargar CSM-1B te da una voz. Construir el comportamiento de la app sobre eso es tu ingeniería, y el límite de 30 minutos por llamada y la ausencia de una API significan que tampoco puedes alquilar la versión terminada.

Si lo que querías era un modelo de voz que puedas invocar, la respuesta honesta es que Gemini 3.8 Flash TTS es la opción con una interfaz documentada, un precio publicado, una puntuación independiente y diálogo de dos hablantes en una sola solicitud. Si lo que querías eran pesos que puedas conservar, CSM-1B bajo Apache 2.0 es el único de los dos que realmente puedes tener — y la contrapartida es que tú aportas el hardware, la pila de servicio y todas las garantías de calidad.

OrcaRouter no aloja ninguna de estas. El modelo de Google se invoca a través de la propia API de Google y de las superficies nombradas en su anuncio del 23 de septiembre; CSM-1B es un checkpoint que tú ejecutas. Para lo que sirve OrcaRouter es para la capa situada por encima de esa elección: más de 200 modelos tras una única clave al precio de lista del proveedor y sin recargo, de modo que un cambio de tarifa de un proveedor se aplica el mismo día, conmutación por error automática para que una ruta experimental no sea una dependencia de producción, y un DSL de enrutamiento que compone modelos en una sola llamada cuando una única voz no cubre todo el trabajo.

La versión corta de esta comparación es que no es realmente una comparación. Un lado tiene un tarifario y un Elo; el otro tiene una licencia y un número de descargas. Elige el lado cuya columna puedas completar de verdad.