Carte de titre principale pour 'GPT-Live-1 vs Sesame Preview', sous-titrée 'La meilleure voix ici est celle sans API', avec un badge indiquant 'L’un est gratuit et fermé, l’autre est payant et appelable' et trois cartes : 'Sesame Preview — application gratuite, pas d’API, voix de production non publiée', 'GPT-Live-1 — 0,05 $ par minute de voix, API publique depuis le 10 septembre 2026' et 'La partie constructible de Sesame — CSM-1B, Apache-2.0, 1 milliard de paramètres, 7 $ par million de caractères ou en auto-hébergement', au-dessus d’une bande de pied de page indiquant 'La voix de production de Sesame n’a fait l’objet d’aucun benchmark publié ; les chiffres vocaux de GPT-Live-1 sont rapportés par OpenAI.' Le logo OrcaRouter est incrusté en bas à droite.
Guides & Insights

GPT-Live-1 vs Sesame Preview : la meilleure voix de cette comparaison est celle que vous ne pouvez pas acheter

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles
A two-column scoreboard titled 'GPT-Live-1 vs Sesame Preview - the scoreboard'. Left column GPT-Live-1: 'Access: public API since September 10, 2026', 'Price: $0.05 per voice minute', 'Voices: 12 API voices, no cloning', 'Duplex: full duplex, barge-in native', 'Weights: closed', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Sesame Preview: 'Access: free consumer app, no API', 'Price: $0 to the user, no paid tier', 'Voices: four agents, one production voice', 'Duplex: conversational, interruptible', 'Weights: CSM-1B open, production model closed', 'Independent score: none, no public benchmark of the Preview voice'. Footer: 'The Sesame Preview production voice is unreleased; CSM-1B is a separate, smaller open checkpoint.'

Demandez à quiconque a utilisé les deux : le classement n’est pas serré. Sesame Preview est l’assistant vocal le plus convaincant auquel la plupart des gens aient parlé. C’est aussi celui sur lequel on ne peut pas construire. GPT-Live-1 et Sesame Preview sont constamment comparés — tous deux sont conversationnels, tous deux gèrent l’interruption, tous deux sonnent comme une personne plutôt qu’un serveur vocal interactif — mais ils sont proposés de manières opposées. GPT-Live-1 est un modèle hébergé que vous louez à la minute, accessible publiquement depuis le 10 septembre 2026. Sesame Preview est une application grand public gratuite sans aucune API, et la voix qui impressionne les gens tourne sur un modèle de production qui n’a jamais été publié.

Ce que chacun est réellement

• GPT-Live-1 — le modèle vocal en duplex intégral d'OpenAI, dans ChatGPT depuis le 8 juillet 2026, dans l'API depuis le 10 septembre à 0,05 $ par minute vocale. Douze voix API, pas de clonage, pas d'entrée image ou vidéo, transcriptions et texte de réponse renvoyés avec chaque session.

• Sesame Preview — l'assistant vocal grand public de Sesame. Gratuit sur iOS depuis mai 2026, largement disponible sur Android depuis début août 2026, ainsi qu'un aperçu web axé sur la voix. Quatre agents — Maya, Miles, Simone et Charlie — uniquement en anglais, avec une limite d'appel de 30 minutes qui est réduite à 5 minutes lorsque l'utilisateur est déconnecté.

• CSM-1B — la partie de Sesame qui est ouverte : un modèle de parole conversationnelle de 1B publié sous Apache 2.0 le 23 avril 2026, construit sur une base d’architecture Llama avec un décodeur séparé et le codec Mimi de Kyutai, produisant de la parole anglaise mono à 24 kHz à partir d’un contexte d’environ 4K tokens.

Les trois lignes ci-dessus sont toute la forme de la décision. Une entreprise vend un modèle à la minute. L'autre offre une application et met en open source un modèle plus petit, qui n'est pas celui de l'application.

L'écart entre la démo et le téléchargement

Sesame a été inhabituellement direct à ce sujet, et c’est le fait le plus important pour quiconque évalue le duo. La voix dans l’application Preview — celle qui a produit les clips viraux et les critiques évoquant le « meilleur mode vocal de sa catégorie » — est un modèle de production plus grand et fermé. CSM-1B est un checkpoint ouvert de 1 milliard de paramètres issu du même laboratoire et, selon l’évaluation des personnes qui ont testé les deux, il s’agit d’une voix nettement plus faible. Les sessions sur Preview sont également plafonnées et limitées à l’anglais, et il n’y a aucune exécution de tâches : les agents parlent, ils ne réservent, n’achètent ni ne déposent quoi que ce soit.

Cela laisse aux développeurs une offre réelle, mais plus étroite : un checkpoint de parole conversationnelle auto-hébergeable, sans frais de licence, hébergé par un fournisseur d'inférence tiers à 7 $ par million de caractères — environ 0,35 $ par heure d'audio synthétisé — ou gratuit sur votre propre matériel. Personne n'a publié de benchmark indépendant, que ce soit pour la voix Preview ou pour CSM-1B, donc toute affirmation sur la qualité, dans un sens ou dans l'autre, relève d'une impression d'écoute, et non d'une mesure. Sesame n'a pas non plus publié de tarification publique, d'offre entreprise ni de plan de monétisation ; l'orientation annoncée de l'entreprise est celle de partenariats de recherche et d'un produit matériel prévu.

A screenshot of the Sesame homepage as of September 2026, headed 'Curiosity, met' with the subline 'Personal intelligence with a point of view', and a section titled 'A collection of personal agents' reading 'Think out loud. Follow a thread. Discover something unexpected.' with a 'Get the Preview' button. The navigation offers only Blog, Team, Mobile Preview and Research Preview — no pricing, no documentation and no developer or API link.

Ce que 0,05 $ la minute permet d’obtenir et que le gratuit n’offre pas.

L’argumentaire de GPT-Live-1 auprès d’un développeur n’est pas qu’il sonne mieux, car cet argument est impossible à défendre face à un modèle fermé que personne ne peut mesurer. C’est que la chose est appelable et tarifée. Concrètement, ce que vous obtenez pendant que le compteur tourne :

• Une session que vous contrôlez — un ID de modèle, un point de terminaison Live Sessions, l’exemple d’intégration publié fonctionnant via WebRTC, et une session que vous configurez avec des instructions, des voix et un bloc de délégation.

• Gestion des interruptions comme comportement documenté — 80,1 % d’interactivité sur Full Duplex Bench v1.5 contre 45,4 % pour GPT-Realtime-2.1, avec une latence de prise de tour de 0,798 seconde et 87 % de réussite des appels d’outils. Ces trois chiffres sont ceux d’Ope​nAI, publiés avec la version et non reproduits par quiconque au moment de la rédaction.

• Un backend de raisonnement que vous choisissez — la couche vocale confie le travail lourd, au-delà d'une frontière asynchrone, à un modèle distinct nommé dans la configuration de session, qui continue de fonctionner pendant que la conversation se poursuit. Dans l'exemple de documentation d'Ope​nAI, ce backend est GPT-5.6 Terra ; lors du lancement grand public de juillet, il s'agissait de GPT-5.5.

• Transcriptions, texte de réponse et facturation de type téléphonique — 3,00 $ pour une heure de ligne ouverte en continu, facturé à la seconde, avec 15 secondes d’initialisation de session créditées plutôt qu’ajoutées.

Sesame vous offre une meilleure conversation et aucun de ces éléments. Si vous développez un produit, « meilleure conversation, pas d’API, pas de prix, pas de benchmark, anglais uniquement, limite de 30 minutes » n’est pas une comparaison — c’est une liste d’attente.

Il y a désormais sur GPT-Live-1 un chiffre qui n'existait pas lors de son lancement grand public, et c'est le contrepoids honnête à tout ce qui précède. L'indice Speech to Speech d'Artificial Analysis attribue à GPT-Live-1 un score de 69,8 % — septième sur onze modèles, derrière GPT-Realtime-2.1 à 73,9 % et derrière Grok Voice Think Fast 2.0 à 79,0 %. Ainsi, le modèle que vous pouvez acheter n'est pas non plus le meilleur du classement indépendant. Ce que le classement ne peut pas évaluer, c'est précisément ce sur quoi Sesame gagne réellement : aucun des onze modèles de cet indice n'a été noté sur la sensation que procure le fait de lui parler, et la voix de Sesame Preview ne figure sur aucune ligne, nulle part.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%. No Sesame model appears on the index.

La partie de la stack qui n’est à aucune des deux entreprises

C'est ici que les deux options convergent, et que la décision cesse d'être binaire. Ni Sesame Preview ni GPT-Live-1 n'est un agent complet. Les agents de Sesame n'exécutent pas de tâches ; GPT-Live-1 délègue explicitement tout ce qui exige du raisonnement, de la recherche ou un outil à un modèle backend. Dans les deux architectures, le travail intéressant se déroule derrière la voix, dans un simple appel à un modèle textuel, et cette couche est portable d'une manière que la couche vocale ne l'est pas — vous pouvez changer de backend sans réenregistrer le moindre prompt pour le modèle vocal.

C'est également sur ce backend qu'OrcaRouter est utile, et il vaut la peine de préciser ce que nous prenons en charge et ce que nous ne prenons pas en charge. Nous ne routons pas GPT-Live-1 : le point de terminaison Live Sessions appartient à OpenAI, et la couche vocale qui s'y trouve est hors de portée. Nous ne routons pas non plus le modèle de production de Sesame, pour la raison plus simple qu'il n'a jamais été proposé sous forme d'API. Ce que nous routons, c'est la couche à laquelle les deux produits délèguent le travail. Environ 190 modèles issus de onze fournisseurs en amont tournent derrière une seule clé, au prix catalogue du fournisseur et sans majoration, avec un basculement automatique entre fournisseurs et un DSL de routage capable de composer plusieurs modèles en un seul appel. Pour une équipe qui construit sur une interface vocale non éprouvée, c'est la couverture qui compte : la couche de parole peut être remplacée ou abandonnée sans emporter la couche de raisonnement avec elle, et le modèle sur lequel vous avez parié en mars peut être remplacé en juin en modifiant une seule ligne.

Que regarder

Trois choses changeraient cette comparaison, et aucune d'elles n'est encore entre les mains de qui que ce soit. Une API Sesame — même payante — transformerait instantanément la voix la plus forte de la catégorie en une option constructible, et mettrait un prix réel à côté des 0,05 $ de GPT-Live-1. Un benchmark publié de la voix Preview convertirait une impression d'écoute en un chiffre, et les évaluations indépendantes ont tendance à être sévères avec les voix qui n'ont jamais concouru que dans des démos. Et la première reproduction externe des chiffres d'interactivité et de latence d'Ope​nAI permettrait de trancher si le full duplex est un véritable écart de capacités ou une évaluation bien choisie.

D’ici là, la distinction honnête est la suivante. Si vous choisissez une voix pour vous-même, utilisez Sesame Preview — c’est gratuit, c’est meilleur, et cela ne vous coûte rien de le préférer. Si vous choisissez une voix pour un produit que vous devez livrer, vendre et prendre en charge, GPT-Live-1 est le seul des deux que vous pouvez réellement acheter, et le fait que ce ne soit pas celui qui sonne le mieux est le prix d’entrée.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement