Une carte hero générée pour « Gemini 3.8 TTS vs Sesame Preview » sur fond blanc avec de doux accents en dégradé bleu et cyan. La carte de gauche, « Gemini 3.8 Flash TTS », indique un Elo de 1 260 au rang 2, 8 voix d'arène, un point de terminaison API et 16,50 $ par million de caractères normalisés ; la carte de droite, « Sesame », se scinde en « Application Preview — gratuite, anglais uniquement, sans API, sans ID de modèle » et « Checkpoint CSM-1B — Apache 2.0, 2 milliards de paramètres, socle Llama ». Une ligne de pied de page indique : « Elo selon Artificial Analysis Provider Voice Arena, sept. 2026 ; détails du CSM-1B selon sa fiche de modèle. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

Gemini 3.8 TTS vs Sesame Preview : L’un d’eux est un téléchargement, l’autre est une application.

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Cherchez une comparaison entre Gemini 3.8 Flash TTS et Sesame Preview et vous trouverez quantité de textes qui les présentent comme deux produits de la même catégorie. Or ils ne le sont pas, et la différence n'est pas un simple détail technique. Gemini 3.8 Flash TTS est un point de terminaison d'API : il possède un identifiant de modèle, une grille tarifaire publiée, une ligne de classement à la 2e place avec un Elo de 1 260 sur 1 999 échantillons dans l'Artificial Analysis Provider Voice Arena, ainsi qu'un format de requête documenté. Sesame Preview est une application grand public gratuite d'assistant vocal, avec des agents nommés, des conversations multi-tours et un appel limité à 30 minutes. Elle n'a ni API, ni identifiant de modèle, ni formule de facturation, ni score dans ce classement.

Le seul artefact Sesame sur lequel vous pouvez réellement vous appuyer est encore autre chose : CSM-1B, un checkpoint Apache 2.0 sur Hugging Face qui génère des codes audio à partir de texte à l’aide d’un backbone Llama et d’un décodeur audio Mimi. Ce n’est pas la voix dont les gens parlent lorsqu’ils décrivent à quel point l’application semble humaine. La comparaison se ramène donc à une question à laquelle on peut répondre : voulez-vous louer un modèle vocal, ou voulez-vous en télécharger un ?

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Sesame, showing what each one is (a hosted API against a consumer app), model ID (gemini-3.8-flash-tts against none), Elo (1,260 at rank 2 against not ranked), price ($16.50 per 1M characters against free with no meter), licence (vendor terms against not applicable to the app) and two-speaker support (yes against agents rather than a script).

Deux choses appelées Sesame, et une seule d’entre elles est constructible

La dénomination est à l'origine de la majeure partie de la confusion, alors séparez-la avant d'aller plus loin.

• Sesame Preview — l'application. Gratuit, des agents nommés Maya, Miles, Simone et Charlie, conversation multi-tours avec un contexte qui persiste d'un tour à l'autre, recherche web et rappels comme fonctionnalités, anglais uniquement, une limite de 30 minutes par appel. Il n'y a pas de surface développeur : rien contre quoi s'authentifier, rien à comptabiliser, aucun point de terminaison à appeler.

• CSM-1B — le checkpoint. Publié sur Hugging Face sous sesame/csm-1b avec une licence Apache 2.0, une base Llama et un décodeur plus petit qui produit des codes audio Mimi. Environ 2 milliards de paramètres, en anglais, avec des poids F32, et il fonctionne via Hugging Face Transformers. La fiche du modèle indique que la variante 1B est sortie en mars 2025 et que la prise en charge native par Transformers est arrivée en mai 2025.

Ces deux-là sont issus de la même entreprise et de la même lignée de recherche, et c'est à peu près là que s'arrête leur relation. L'application est un produit ; le checkpoint est un artefact issu de la recherche qui l'a précédée. Les évaluateurs qui louent la mémoire conversationnelle de l'application décrivent un système avec récupération et gestion d'état autour d'un modèle vocal, et non une propriété du checkpoint 2B que vous pouvez télécharger.

Qu'y a-t-il réellement dans le checkpoint ?

CSM-1B est un modèle de synthèse vocale au sens architectural qui importe pour quiconque envisage de l’exécuter : il prend en entrée du texte et un contexte audio et émet des codes audio RVQ, que le décodeur transforme en forme d’onde. Les faits pratiques issus de la fiche du modèle :

• Licence — Apache 2.0. C'est la ligne la plus déterminante de la page. Contrairement aux licences de poids réservées à la recherche, Apache 2.0 autorise l'usage commercial sans accord distinct, ce qui fait de CSM-1B l'un des rares checkpoints vocaux ouverts véritablement exploitables.

• Taille — environ 2 milliards de paramètres en F32. Suffisamment grand pour nécessiter du matériel réel pour toute charge concurrente, suffisamment petit pour s’exécuter sur un seul accélérateur en développement.

• Langue — anglais, d’après la carte. Pas un modèle multilingue.

• Traction — 141 461 téléchargements au cours du dernier mois au moment où ces lignes sont écrites, avec environ 245 000 likes sur le dépôt. C'est un checkpoint très largement utilisé selon les normes des modèles vocaux ouverts, et c'est l'argument le plus solide pour dire que l'artefact dispose d'une véritable base d'utilisateurs, indépendante de la couverture médiatique de l'application.

A screenshot of the Hugging Face model card for sesame/csm-1b, showing the Apache 2.0 licence, the roughly 2 billion parameter F32 weights, the Llama backbone and Mimi audio decoder description, and the repository's download and like counts.

Ce que la fiche ne vous donne pas, c'est une affirmation de qualité que vous puissiez comparer à quoi que ce soit. Il n'y a pas de ligne d'arène, pas de benchmark de fournisseur reproduit par un tiers, et aucune évaluation publiée de la relation entre la sortie du checkpoint et celle de l'application. Quiconque vous affirme que le modèle téléchargeable sonne comme l'application ne fait que le déduire du nom.

Pourquoi il n’y a pas de comparaison directe, et pourquoi cela ne constitue pas une lacune de recherche

Il n'existe pas de comparaison entre Gemini 3.8 TTS et Sesame Preview dans les classements, car il ne peut pas y en avoir. L'arène classe les modèles en faisant comparer aux auditeurs des extraits produits par un point de terminaison hébergé. L'un des deux éléments de cette paire ne dispose pas de point de terminaison, il ne peut donc pas être inscrit.

Cela mérite d'être précisé, car « aucun comparatif direct n'existe » est souvent présenté comme si les données étaient manquantes. Elles ne sont pas manquantes. Elles sont indéfinies. Les deux choses que l'on compare ne partagent pas de surface mesurable :

• Gemini 3.8 Flash TTS est évalué sur ses voix hébergées natives. Sesame Preview n'a pas de voix natives à évaluer en ce sens — il dispose d'agents.

• Gemini 3.8 Flash TTS publie une grille tarifaire en tokens. Sesame Preview est gratuit et ne publie rien, car il n'y a rien à facturer.

• Gemini 3.8 Flash TTS prend un script et renvoie de l’audio. Sesame Preview prend une conversation et renvoie une conversation, avec toute la récupération et la mémoire que l’application ajoute par-dessus.

Ce qui ressemble le plus à une comparaison légitime est celle entre Gemini 3.8 Flash TTS et CSM-1B, et même celle-ci est inégale : l’un dispose d’un Elo indépendant et d’une grille tarifaire de fournisseur, l’autre n’a ni l’un ni l’autre. Ce que vous pouvez comparer, c’est la forme de l’engagement — une API facturée à l’usage contre un checkpoint téléchargeable — et cette comparaison n’a pas besoin d’un classement.

Le seul côté de ceci qui porte des chiffres

Tout ce qui est quantitatif dans cette association se trouve du côté de Google, ce qui est en soi tout l’enjeu.

Sur l'Artificial Analysis Provider Voice Arena, relevé le 24 septembre 2026, Gemini 3.8 Flash TTS, sorti le 23 septembre 2026, occupe le 2e rang avec un Elo de 1 260 sur 1 999 échantillons et 8 voix de l'arène. Son homologue Gemini 3.8 Flash-Lite TTS occupe le 6e rang avec 1 235. Google facture Flash TTS à 0,50 $ par million de jetons de texte en entrée et à 9,00 $ par million de jetons audio en sortie jusqu'au 31 décembre 2026, puis à 18,00 $, avec Flash-Lite TTS à 0,50 $ et 6,00 $, puis 12,00 $ ; Artificial Analysis normalise ces montants à 16,50 $ et 11,00 $ par million de caractères afin qu'ils puissent figurer sur un même tableau que des modèles qui facturent dans d'autres unités. Cette normalisation relève de l'arithmétique du tableau, et non d'une citation de Google.

En regard de cela, CSM-1B n’a pas de prix parce qu’il n’a pas de compteur. Il a un nombre de téléchargements, une licence et un nombre de paramètres. Si votre cadre de décision nécessite un classement Elo, cette comparaison n’en fournira pas pour le côté Sesame, et la conclusion honnête est que les deux options sont évaluées selon des critères différents plutôt que de considérer que l’une d’elles n’est pas prouvée.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, released September 23, 2026, with Gemini 3.8 Flash-Lite TTS at rank 6 and no Sesame row anywhere on the board.

Si ce que vous vouliez, c’était l’expérience de l’application

Beaucoup de personnes qui recherchent cette comparaison ne choisissent pas de modèle du tout. Elles ont utilisé l’application Sesame, ont aimé la façon dont la conversation se déroulait, et veulent cela dans leur produit. C’est un problème différent, et le téléchargement ne le résoudra pas.

Ce qui donne à l’application son ressenti, ce n’est en grande partie pas le modèle vocal. Le contexte persistant d’un tour à l’autre, la décision de rechercher sur le web en pleine conversation, le moment où un agent prend la parole : tout cela relève de l’orchestration, et rien de tout cela ne réside dans un checkpoint de 2B. Télécharger CSM-1B vous donne une voix. Construire le comportement de l’application par-dessus relève de votre ingénierie, et la limite de 30 minutes par appel ainsi que l’absence d’API signifient que vous ne pouvez pas non plus louer la version finie.

Si ce que vous vouliez, c'était un modèle vocal que vous pouvez appeler, la réponse honnête est que Gemini 3.8 Flash TTS est l'option qui dispose d'une interface documentée, d'un prix publié, d'un score indépendant et d'un dialogue à deux voix en une seule requête. Si ce que vous vouliez, c'étaient des poids que vous pouvez conserver, CSM-1B sous Apache 2.0 est celui des deux que vous pouvez réellement garder — et la contrepartie, c'est que vous fournissez vous-même le matériel, la pile de service et toutes les garanties de qualité.

OrcaRouter n'héberge ni l'un ni l'autre. Le modèle de Google est appelé via l'API propre à Google et les surfaces nommées dans son annonce du 23 septembre ; CSM-1B est un checkpoint que vous exécutez vous-même. Ce à quoi sert OrcaRouter, c'est la couche située au-dessus de ce choix : plus de 200 modèles derrière une seule clé, au prix catalogue du fournisseur et sans marge, de sorte qu'un changement de tarif d'un fournisseur est effectif le jour même, une bascule automatique pour qu'une route expérimentale ne soit pas une dépendance de production, et un DSL de routage qui compose des modèles en un seul appel lorsqu'une seule voix ne suffit pas à la tâche.

La version courte de cette comparaison, c'est qu'il ne s'agit pas vraiment d'une comparaison. D'un côté, il y a une grille tarifaire et un Elo ; de l'autre, une licence et un nombre de téléchargements. Choisissez celui dont vous pouvez réellement remplir la colonne.