Een gegenereerde hero-titelkaart voor StepAudio 3 Realtime vs Sesame Preview met de kicker 'OrcaRouter · modelradar — recht tegenover elkaar', de kop 'StepAudio 3 Realtime vs Sesame Preview' en de ondertitel 'De stem die iedereen prijst tegenover degene met een score op de ranglijst', boven twee afgeronde modelkaarten aan weerszijden van een versusteken.
Guides & Insights

StepAudio 3 Realtime vs Sesame Preview: De stem die iedereen prijst vs degene die een score heeft

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Gedurende het grootste deel van 2026 was de sterkste bewering die iemand over spraak-AI kon doen een luisterindruk. De assistent van Sesame klonk menselijker dan wat dan ook, en genoeg mensen zeiden dat ook, waardoor het het referentiepunt werd — zonder benchmark, zonder cijfer en zonder enige manier om het te controleren. Op 15 september 2026 StepAudio 3 Realtime arriveerde van StepFun met een cijfer gekoppeld aan de best meetbare versie van die kwaliteit: 98,9% op de Conversational Dynamics-evaluatie van Artificial Analysis, een eerste plaats. Sesame Preview staat niet op die ranglijst.

Het interessante is niet dat de een de ander versloeg. Het is dat de kwaliteit waar Sesame beroemd om is geworden nu iets is waar een derde partij een score aan toekent, en dat het model met de reputatie er nooit aan is afgemeten.

Wat elk van deze werkelijk is

Het zijn niet hetzelfde soort object, en dat bepaalt meer van de vergelijking dan welke score dan ook.

Sesame Preview is een spraakassistent voor consumenten. Gratis op iOS sinds mei 2026 en breed beschikbaar op Android sinds begin augustus 2026, opgebouwd rond vier agents met een naam — Maya, Miles, Simone en Charlie — die context vasthouden over sessies heen, het web doorzoeken en herinneringen instellen. Het is alleen beschikbaar in het Engels. Gesprekken lopen tot een maximum van 30 minuten, dat terugvalt naar vijf minuten wanneer je uitgelogd bent. Er is geen API voor de productiestem, geen zakelijke variant en geen openbare prijsstelling.

StepAudio 3 Realtime is een ontwikkelaarsoppervlak. Het is een van de vijf modellen in de StepAudio 3-familie, allemaal op dezelfde dag uitgebracht en allemaal live op het open platform van StepFun als commerciële API's. Het verwerkt native full-duplex gesprekken, redeneert rechtstreeks over spraak in plaats van eerst te transcriberen, en ondersteunt het aanroepen van tools en asynchrone uitvoering van langdurige taken terwijl het gesprek doorgaat. Het is Chinese-first. Het is niet open weights, en het heeft momenteel een gratis preview-prijs voor beperkte tijd, zonder dat een tarief na de preview is aangekondigd.

Op een van deze kun je bouwen. De andere kun je bezoeken.

Het meetbare ding waar Sesame beroemd om is

Conversational Dynamics is een specifieke benchmark, en het is de moeite waard om te weten wat deze inhoudt. Het beoordeelt beurtwisseling, omgaan met pauzes, herstel na onderbrekingen, en of een model een korte backchannel — "uh-huh", "right", "mm" — correct interpreteert als aanmoediging in plaats van als een poging om het gesprek over te nemen. Dat zijn precies de gedragingen die luisteraars beschrijven wanneer ze zeggen dat een stem menselijk aanvoelt in plaats van robotachtig, en het zijn de gedragingen die een assistent prettig maken om mee te praten in plaats van louter nauwkeurig.

StepAudio 3 Realtime voert dat klassement aan met 98,9%, vóór Qwen Audio 3.0 Realtime Plus met 98,4% en GPT-Realtime-2 met 95,3%. Het staat ook eerste op Speech Reasoning met 99,7%, zoals aangehaald door StepFun, waarachter de architectonische claim schuilt dat redeneren over onbewerkte audio toon en nadruk behoudt die een transcriptiestap zou afvlakken — het verschil tussen sarcasme horen en een compliment horen.

Dit is de eerlijke duiding van dat resultaat. De benchmark is het dichtst dat de industrie komt bij een meting van waar Sesame om wordt geprezen, en Sesame is er niet in opgenomen. Dat is geen bewijs dat StepAudio 3 Realtime beter klinkt dan Sesame. Het is bewijs dat een van deze beweringen controleerbaar is en de andere, tot nu toe, niet — en dat de controleerbare momenteel op naam staat van een model waarmee de meeste mensen nog nooit hebben gesproken.

Screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the AA-Speech to Speech Index bar chart and the speed and cost-per-hour charts for the voice models StepAudio 3 Realtime is measured against.

De beschikbaarheidsasymmetrie, die de echte beslissing is

Alles hierboven is interessant. Dit deel is beslissend.

De stem van Sesame — degene waar mensen lyrisch over zijn — is een groter, gesloten productiemodel dat Sesame nooit als API heeft uitgebracht. Je kunt hem niet kopen, niet in licentie nemen en niet vanuit je eigen product aanroepen. Als je hebt gelezen dat de gesprekstiming van Sesame de beste is die beschikbaar is, en daaruit hebt geconcludeerd dat je die zou kunnen hebben, dan volgt die conclusie niet uit het bewijs.

Wat Sesame daadwerkelijk open source heeft gemaakt, is CSM-1B, uitgebracht onder Apache-2.0. Het is een syntheseblok, geen assistent: een Llama-backbone voorspelt het eerste Mimi-codeboek en een kleinere Llama-decoder voorspelt de rest, die een Mimi-codec omzet naar een golfvorm van 24 kHz. Het is alleen Engels, het kloont een stem op basis van een referentieclip van 10 tot 15 seconden, en het kan helemaal geen tekst genereren — je combineert het met een apart taalmodel. Mensen die beide hebben gedraaid, beschrijven de stem van CSM-1B als duidelijk zwakker dan die van de Preview-app, en de modelkaart zegt het stille deel hardop: een fijn afgestemde variant van CSM drijft de interactieve demo aan, en die variant is niet het checkpoint dat je kunt downloaden.

StepAudio 3 Realtime heeft niets van die ambiguïteit. Het is een commerciële API met een gepubliceerde modelfamilie erachter, een aangegeven set capaciteiten, en plaatsingen door derden die je kunt opzoeken. Het is ook in de eerste plaats op het Chinees gericht, met previewprijzen, en publiceert een time-to-first-audio van 8,83 seconden op dezelfde ranglijst waarop het conversationele dynamiek wint — tegenover 1,18 seconden voor Gemini 3.8 Live en 1,24 tot 1,34 seconden voor GPT-Live-1. Wat het ook aan gesprekskwaliteit biedt, het heeft nog niet aangetoond dat het die kan leveren in gesprekstempo buiten StepFuns eigen serving-opstelling.

Screenshot of the Sesame CSM-1B model card on Hugging Face showing the Apache-2.0 licence tag alongside English and text-to-speech tags, 2.45k likes and 1.65k followers, release notes for the 1B CSM variant, a description of the Llama backbone and smaller Mimi audio-code decoder, and a line stating that a fine-tuned variant of CSM powers the interactive voice demo shown in the blog post.

Wat te doen met dit als je een voice stack kiest

Begin met de twee vragen te scheiden. "Hoe moet een gesprek aanvoelen?" en "wat kan ik opleveren?" hebben verschillende antwoorden, en slechts één ervan is een inkoopbeslissing.

Als je je smaak aan het kalibreren bent — bepalen hoeveel warmte je product moet hebben, hoeveel stilte comfortabel is, hoe snel een agent het woord moet afstaan — dan is Sesame Preview gratis, oprecht uitstekend en een goede plek om een middag door te brengen. Gebruik het als referentiepunt. Plan er geen integratie rond, want er is niets om mee te integreren.

Als je aan het shippen bent, is StepAudio 3 Realtime een echte kandidaat met echte kanttekeningen: previewprijzen, dekking met Chinees voorop, geen indexscore op Artificial Analysis, en de latentievraag is onopgelost. Test de latentie vóór de gesprekskwaliteit. Een model dat de turn-taking-benchmark wint, maar er bijna een hele zin over doet voordat het begint te spreken, is een model waarvan je de beste kwaliteit misschien nooit zult kunnen laten zien.

En als de productiestem van Sesame ooit een API krijgt, wordt deze hele vergelijking opnieuw uitgevoerd — want de benchmark die het zou beslechten bestaat al, en Sesame zou er dan eindelijk op moeten verschijnen.

Waar routing past, en waar niet

Spraakagenten zijn niet één model. Of je nu StepAudio 3 Realtime draait of iets anders, het gesprek geeft voortdurend werk door aan gewone tekstmodellen — een opzoeking, een extractie, een redeneeraanroep die achter een aangehouden pauze draait. Die delegatielaag is waar kostenvariantie leeft en waar een slecht uur van één provider jouw uitval wordt.

Om precies te zijn over onze eigen dekking: de live- en voice-endpoints in de StepAudio 3-familie staan niet op OrcaRouter, en dat geldt ook voor alles wat Sesame heeft gebouwd. Wat wel op OrcaRouter staat, is de tekstlaag waarnaar een voice-agent delegeert — bijna 200 modellen achter één API, automatische failover, een routing-DSL die er meerdere samenvoegt tot één aanroep, en modelfusie wanneer het oordeel van één model niet volstaat, met de lijstprijs van de provider doorgegeven zonder opslag.

Die splitsing is juist wat de beschikbaarheidsvraag minder fataal maakt dan ze lijkt. Het stemmodel is een beslissing die je kunt herzien; de delegatielaag is degene die duur wordt om terug te draaien, en juist die is het waard om achter een router te zetten voordat je je aan welke stemleverancier dan ook vastlegt.

A generated scoreboard titled 'StepAudio 3 Realtime vs Sesame Preview'. The StepAudio column reads Conv. Dynamics '98.9%, first place', Callable API 'yes, commercial', Languages 'Chinese-first', Session cap 'not published', Tool execution 'tool calls, async tasks', Open artifact 'none, closed'. The Sesame column reads Conv. Dynamics 'no score published', Callable API 'no API for its voice', Languages 'English only', Session cap '30 min, 5 logged out', Tool execution 'reminders, web search only', Open artifact 'CSM-1B, Apache-2.0'. Footer: 'StepAudio 3 figures vendor-cited; Sesame naturalness is a listening impression, not a benchmark.'

Het vonnis

Sesame Preview wint op het punt dat niet meetbaar is en verliest op alles wat gekocht kan worden. Het is de best klinkende stem die beschikbaar is, het is gratis, en je kunt het niet in productie nemen — en nu een derde partij de kwaliteit beoordeelt waar het beroemd om is, is de afwezigheid ervan op dat scorebord een gat in het bewijs, niet een beschermde voorsprong.

StepAudio 3 Realtime wint op beschikbaarheid, meetbaarheid en mogelijkheden, en er blijven echte open vragen over prijs, taaldekking en latency. Het is de enige van de twee waarop je vandaag kunt bouwen, wat de praktische vraag sneller beslecht dan welke benchmark dan ook.

Waar je op moet letten is simpel, en het werkt beide kanten op: een Conversational Dynamics-score voor de productiestem van Sesame, of een latentiecijfer voor StepAudio 3 Realtime dat het in dezelfde range plaatst als de modellen die het qua kwaliteit momenteel verslaat. Elk van beide zou dit veranderen van een vergelijking tussen een meting en een reputatie in een echte head-to-head.