Une carte de titre principale générée pour StepAudio 3 Realtime vs Sesame Preview, avec le sur-titre 'OrcaRouter · radar de modèles — face à face', le titre principal 'StepAudio 3 Realtime vs Sesame Preview' et le sous-titre 'La voix que tout le monde encense face à celle qui a un score de classement', au-dessus de deux cartes de modèle aux coins arrondis, de part et d'autre d'un symbole versus.
Guides & Insights

StepAudio 3 Realtime vs Sesame Preview : la voix que tout le monde encense face à celle qui a un score

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Pendant la majeure partie de 2026, l'affirmation la plus forte que l'on pouvait faire au sujet de l'IA vocale était une impression à l'écoute. L'assistant de Sesame sonnait plus humain que tout le reste, et suffisamment de personnes le disaient pour qu'il devienne la référence — sans aucun benchmark, aucun chiffre et aucun moyen de vérifier. Le 15 septembre 2026, StepAudio 3 Realtime est arrivé de StepFun avec un chiffre associé à la version mesurable la plus proche de cette qualité : 98,9 % à l'évaluation Conversational Dynamics d'Artificial Analysis, en première place. Sesame Preview ne figure pas dans ce classement.

L’intérêt n’est pas que l’un ait battu l’autre. C’est que la qualité qui a rendu Sesame célèbre est désormais évaluée par un tiers, et le modèle qui a cette réputation n’a jamais été mesuré à cette aune.

Ce qu'est réellement chacun de ces éléments

Ils ne sont pas du même genre d'objet, et cela détermine une plus grande part de la comparaison que n'importe quel score.

Sesame Preview est un assistant vocal grand public. Gratuit sur iOS depuis mai 2026 et largement disponible sur Android depuis début août 2026, il s’articule autour de quatre agents nommés — Maya, Miles, Simone et Charlie — qui conservent le contexte d’une session à l’autre, effectuent des recherches sur le web et programment des rappels. Il est uniquement en anglais. Les appels sont limités à 30 minutes, une durée qui passe à cinq minutes lorsque vous êtes déconnecté. Il n’existe pas d’API pour sa voix de production, pas d’offre entreprise ni de tarification publique.

StepAudio 3 Realtime est une interface destinée aux développeurs. C'est l'un des cinq modèles de la famille StepAudio 3, tous sortis le même jour et tous disponibles sur la plateforme ouverte de StepFun en tant qu'API commerciales. Il gère la conversation native en duplex intégral, raisonne directement sur la parole plutôt que de la transcrire d'abord, et prend en charge l'appel d'outils ainsi que l'exécution asynchrone de tâches longues pendant que la conversation se poursuit. Il est conçu en priorité pour le chinois. Il n'est pas à poids ouverts, et il bénéficie actuellement d'un tarif d'aperçu gratuit à durée limitée, sans tarif annoncé après l'aperçu.

L'un d'eux vous permet de construire. L'autre, vous pouvez le visiter.

La chose mesurable pour laquelle Sesame est célèbre

Conversational Dynamics est un benchmark spécifique, et il vaut la peine de savoir ce qu'il contient. Il évalue l'alternance des tours de parole, la gestion des pauses, la reprise après interruption, et si un modèle interprète correctement un bref signal d'écoute — « hum-hum », « d'accord », « mm » — comme un encouragement plutôt que comme une tentative de prendre la parole. Ce sont précisément les comportements que les auditeurs décrivent lorsqu'ils disent qu'une voix semble humaine plutôt que robotique, et ce sont les comportements qui rendent un assistant agréable à qui parler plutôt que simplement précis.

StepAudio 3 Realtime arrive en tête de ce classement avec 98,9 %, devant Qwen Audio 3.0 Realtime Plus à 98,4 % et GPT-Realtime-2 à 95,3 %. Il se classe également premier sur Speech Reasoning avec 99,7 %, comme cité par StepFun, derrière lequel se trouve l’affirmation architecturale selon laquelle le raisonnement sur l’audio brut préserve le ton et l’accentuation qu’une étape de transcription aplatirait — la différence entre entendre du sarcasme et entendre un compliment.

Voici la présentation honnête de ce résultat. Le benchmark est ce que l’industrie a de plus proche d’une mesure de ce pour quoi Sesame est loué, et Sesame n’y a pas été inscrit. Ce n’est pas une preuve que StepAudio 3 Realtime sonne mieux que Sesame. C’est la preuve que l’une de ces affirmations est vérifiable et que l’autre, jusqu’ici, ne l’est pas — et que celle qui est vérifiable est actuellement détenue par un modèle auquel la plupart des gens n’ont jamais parlé.

Screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the AA-Speech to Speech Index bar chart and the speed and cost-per-hour charts for the voice models StepAudio 3 Realtime is measured against.

L’asymétrie de disponibilité, qui est la véritable décision

Tout ce qui précède est intéressant. Cette partie est décisive.

La voix de Sesame — celle dont tout le monde s’extasie — est un modèle de production fermé et plus grand, que Sesame n’a jamais publié sous forme d’API. Vous ne pouvez ni l’acheter, ni la licencier, ni l’appeler depuis votre propre produit. Si vous avez lu que le timing conversationnel de Sesame est le meilleur disponible et en avez conclu que vous pouviez l’obtenir, cette conclusion ne découle pas des éléments de preuve.

Ce que Sesame a réellement mis en open source, c’est CSM-1B, publié sous Apache-2.0. Il s’agit d’un bloc de synthèse, pas d’un assistant : un backbone Llama prédit le premier codebook Mimi et un décodeur Llama plus petit prédit le reste, qu’un codec Mimi restitue sous forme d’onde à 24 kHz. Il est uniquement en anglais, il clone une voix à partir d’un extrait de référence de 10 à 15 secondes, et il ne peut pas du tout générer de texte — on l’associe à un modèle de langage distinct. Les personnes qui ont testé les deux décrivent la voix de CSM-1B comme nettement plus faible que celle de l’application Preview, et la fiche du modèle dit tout haut ce que l’on pense tout bas : une variante affinée de CSM alimente la démo interactive, et cette variante n’est pas le checkpoint que vous pouvez télécharger.

StepAudio 3 Realtime n’a rien de cette ambiguïté. C’est une API commerciale, adossée à une famille de modèles publiée, avec un ensemble de capacités déclarées et des positionnements tiers que l’on peut consulter. Elle est également conçue en priorité pour le chinois, proposée à un tarif de préversion, et affiche un délai avant le premier audio de 8,83 secondes sur le même classement où elle remporte la dynamique conversationnelle — contre 1,18 seconde pour Gemini 3.8 Live et 1,24 à 1,34 seconde pour GPT-Live-1. Quelle que soit la qualité conversationnelle qu’elle offre, elle n’a pas encore démontré qu’elle peut la fournir à la vitesse d’une conversation en dehors de l’environnement de service propre à StepFun.

Screenshot of the Sesame CSM-1B model card on Hugging Face showing the Apache-2.0 licence tag alongside English and text-to-speech tags, 2.45k likes and 1.65k followers, release notes for the 1B CSM variant, a description of the Llama backbone and smaller Mimi audio-code decoder, and a line stating that a fine-tuned variant of CSM powers the interactive voice demo shown in the blog post.

Que faire de ceci si vous choisissez une stack vocale

Commencez par séparer les deux questions. « Quel effet une conversation devrait-elle produire ? » et « que puis-je livrer ? » ont des réponses différentes, et une seule d'entre elles relève d'une décision d'achat.

Si vous calibrez votre goût — en décidant quelle chaleur votre produit doit avoir, quelle quantité de silence est confortable, à quelle vitesse un agent doit céder la parole — Sesame Preview est gratuit, véritablement excellent, et un bon endroit où passer un après-midi. Utilisez-le comme point de référence. Ne prévoyez pas d’intégration autour de lui, car il n’y a rien avec quoi l’intégrer.

Si vous êtes en phase de mise en production, StepAudio 3 Realtime est un vrai candidat, avec de vrais bémols : tarification en aperçu, couverture d’abord axée sur le chinois, aucun score d’index sur Artificial Analysis, et la question de la latence non résolue. Testez la latence avant la qualité de conversation. Un modèle qui remporte le benchmark de gestion des tours de parole mais met presque le temps d’une phrase à commencer à parler est un modèle dont vous risquez de ne jamais pouvoir démontrer la meilleure qualité.

Et si la voix de production de Sesame finit un jour par disposer d’une API, toute cette comparaison sera refaite — car le benchmark qui permettrait de trancher existe déjà, et Sesame devrait enfin y apparaître.

Là où le routage a sa place, et là où il ne l’a pas

Les agents vocaux ne sont pas un modèle unique. Que vous utilisiez StepAudio 3 Realtime ou autre chose, la conversation délègue constamment du travail à des modèles de texte ordinaires — une recherche, une extraction, un appel de raisonnement exécuté pendant une pause d'attente. C'est dans cette couche de délégation que se loge la variabilité des coûts, et où une heure de mauvaise performance d'un fournisseur se transforme en panne pour vous.

Pour être précis sur notre propre couverture : les points de terminaison live et voice de la famille StepAudio 3 ne sont pas sur OrcaRouter, et rien de ce que Sesame a construit ne l'est non plus. Ce qui est sur OrcaRouter, c'est la couche texte à laquelle un agent vocal délègue — près de 200 modèles derrière une seule API, un basculement automatique, un DSL de routage qui en compose plusieurs en un seul appel, et la fusion de modèles lorsque le jugement d'un seul modèle ne suffit pas, avec le prix catalogue du fournisseur répercuté sans marge.

Cette séparation est ce qui rend la question de la disponibilité moins fatale qu’elle n’en a l’air. Le modèle vocal est une décision que vous pouvez revoir ; la couche de délégation est celle qui devient coûteuse à défaire, et c’est celle qu’il vaut la peine de placer derrière un routeur avant de vous engager avec un quelconque fournisseur de voix.

A generated scoreboard titled 'StepAudio 3 Realtime vs Sesame Preview'. The StepAudio column reads Conv. Dynamics '98.9%, first place', Callable API 'yes, commercial', Languages 'Chinese-first', Session cap 'not published', Tool execution 'tool calls, async tasks', Open artifact 'none, closed'. The Sesame column reads Conv. Dynamics 'no score published', Callable API 'no API for its voice', Languages 'English only', Session cap '30 min, 5 logged out', Tool execution 'reminders, web search only', Open artifact 'CSM-1B, Apache-2.0'. Footer: 'StepAudio 3 figures vendor-cited; Sesame naturalness is a listening impression, not a benchmark.'

Le verdict

Sesame Preview gagne sur ce qui ne peut pas être mesuré et perd sur tout ce qui peut s’acheter. C’est la voix qui sonne le mieux parmi celles disponibles, elle est gratuite, et vous ne pouvez pas la mettre en production — et maintenant qu’un tiers note la qualité qui a fait sa réputation, son absence de ce classement est une lacune dans les preuves, pas une avance protégée.

StepAudio 3 Realtime l’emporte en matière de disponibilité, de mesurabilité et de capacités, et soulève de véritables questions ouvertes sur le prix, la couverture linguistique et la latence. C’est le seul des deux sur lequel vous pouvez bâtir dès aujourd’hui, ce qui règle la question pratique plus vite que n’importe quel benchmark.

Ce qu'il faut surveiller est simple, et cela joue dans les deux sens : un score de Conversational Dynamics pour la voix de production de Sesame, ou un chiffre de latence pour StepAudio 3 Realtime qui le place dans la même fourchette que les modèles qu'il surpasse actuellement en qualité. L'un ou l'autre ferait passer ceci d'une comparaison entre une mesure et une réputation à un véritable face-à-face.