
StepAudio 3 Realtime vs Sesame Preview: De stem die iedereen prijst vs degene die een score heeft
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Gedurende het grootste deel van 2026 was de sterkste bewering die iemand over spraak-AI kon doen een luisterindruk. De assistent van Sesame klonk menselijker dan wat dan ook, en genoeg mensen zeiden dat ook, waardoor het het referentiepunt werd — zonder benchmark, zonder cijfer en zonder enige manier om het te controleren. Op 15 september 2026 StepAudio 3 Realtime arriveerde van StepFun met een cijfer gekoppeld aan de best meetbare versie van die kwaliteit: 98,9% op de Conversational Dynamics-evaluatie van Artificial Analysis, een eerste plaats. Sesame Preview staat niet op die ranglijst.
Het interessante is niet dat de een de ander versloeg. Het is dat de kwaliteit waar Sesame beroemd om is geworden nu iets is waar een derde partij een score aan toekent, en dat het model met de reputatie er nooit aan is afgemeten.
Wat elk van deze werkelijk is
Het zijn niet hetzelfde soort object, en dat bepaalt meer van de vergelijking dan welke score dan ook.
Sesame Preview is een spraakassistent voor consumenten. Gratis op iOS sinds mei 2026 en breed beschikbaar op Android sinds begin augustus 2026, opgebouwd rond vier agents met een naam — Maya, Miles, Simone en Charlie — die context vasthouden over sessies heen, het web doorzoeken en herinneringen instellen. Het is alleen beschikbaar in het Engels. Gesprekken lopen tot een maximum van 30 minuten, dat terugvalt naar vijf minuten wanneer je uitgelogd bent. Er is geen API voor de productiestem, geen zakelijke variant en geen openbare prijsstelling.
StepAudio 3 Realtime is een ontwikkelaarsoppervlak. Het is een van de vijf modellen in de StepAudio 3-familie, allemaal op dezelfde dag uitgebracht en allemaal live op het open platform van StepFun als commerciële API's. Het verwerkt native full-duplex gesprekken, redeneert rechtstreeks over spraak in plaats van eerst te transcriberen, en ondersteunt het aanroepen van tools en asynchrone uitvoering van langdurige taken terwijl het gesprek doorgaat. Het is Chinese-first. Het is niet open weights, en het heeft momenteel een gratis preview-prijs voor beperkte tijd, zonder dat een tarief na de preview is aangekondigd.
Op een van deze kun je bouwen. De andere kun je bezoeken.
Het meetbare ding waar Sesame beroemd om is
Conversational Dynamics is een specifieke benchmark, en het is de moeite waard om te weten wat deze inhoudt. Het beoordeelt beurtwisseling, omgaan met pauzes, herstel na onderbrekingen, en of een model een korte backchannel — "uh-huh", "right", "mm" — correct interpreteert als aanmoediging in plaats van als een poging om het gesprek over te nemen. Dat zijn precies de gedragingen die luisteraars beschrijven wanneer ze zeggen dat een stem menselijk aanvoelt in plaats van robotachtig, en het zijn de gedragingen die een assistent prettig maken om mee te praten in plaats van louter nauwkeurig.
StepAudio 3 Realtime voert dat klassement aan met 98,9%, vóór Qwen Audio 3.0 Realtime Plus met 98,4% en GPT-Realtime-2 met 95,3%. Het staat ook eerste op Speech Reasoning met 99,7%, zoals aangehaald door StepFun, waarachter de architectonische claim schuilt dat redeneren over onbewerkte audio toon en nadruk behoudt die een transcriptiestap zou afvlakken — het verschil tussen sarcasme horen en een compliment horen.
Dit is de eerlijke duiding van dat resultaat. De benchmark is het dichtst dat de industrie komt bij een meting van waar Sesame om wordt geprezen, en Sesame is er niet in opgenomen. Dat is geen bewijs dat StepAudio 3 Realtime beter klinkt dan Sesame. Het is bewijs dat een van deze beweringen controleerbaar is en de andere, tot nu toe, niet — en dat de controleerbare momenteel op naam staat van een model waarmee de meeste mensen nog nooit hebben gesproken.

De beschikbaarheidsasymmetrie, die de echte beslissing is
Alles hierboven is interessant. Dit deel is beslissend.
De stem van Sesame — degene waar mensen lyrisch over zijn — is een groter, gesloten productiemodel dat Sesame nooit als API heeft uitgebracht. Je kunt hem niet kopen, niet in licentie nemen en niet vanuit je eigen product aanroepen. Als je hebt gelezen dat de gesprekstiming van Sesame de beste is die beschikbaar is, en daaruit hebt geconcludeerd dat je die zou kunnen hebben, dan volgt die conclusie niet uit het bewijs.
Wat Sesame daadwerkelijk open source heeft gemaakt, is CSM-1B, uitgebracht onder Apache-2.0. Het is een syntheseblok, geen assistent: een Llama-backbone voorspelt het eerste Mimi-codeboek en een kleinere Llama-decoder voorspelt de rest, die een Mimi-codec omzet naar een golfvorm van 24 kHz. Het is alleen Engels, het kloont een stem op basis van een referentieclip van 10 tot 15 seconden, en het kan helemaal geen tekst genereren — je combineert het met een apart taalmodel. Mensen die beide hebben gedraaid, beschrijven de stem van CSM-1B als duidelijk zwakker dan die van de Preview-app, en de modelkaart zegt het stille deel hardop: een fijn afgestemde variant van CSM drijft de interactieve demo aan, en die variant is niet het checkpoint dat je kunt downloaden.
StepAudio 3 Realtime heeft niets van die ambiguïteit. Het is een commerciële API met een gepubliceerde modelfamilie erachter, een aangegeven set capaciteiten, en plaatsingen door derden die je kunt opzoeken. Het is ook in de eerste plaats op het Chinees gericht, met previewprijzen, en publiceert een time-to-first-audio van 8,83 seconden op dezelfde ranglijst waarop het conversationele dynamiek wint — tegenover 1,18 seconden voor Gemini 3.8 Live en 1,24 tot 1,34 seconden voor GPT-Live-1. Wat het ook aan gesprekskwaliteit biedt, het heeft nog niet aangetoond dat het die kan leveren in gesprekstempo buiten StepFuns eigen serving-opstelling.

Wat te doen met dit als je een voice stack kiest
Begin met de twee vragen te scheiden. "Hoe moet een gesprek aanvoelen?" en "wat kan ik opleveren?" hebben verschillende antwoorden, en slechts één ervan is een inkoopbeslissing.
Als je je smaak aan het kalibreren bent — bepalen hoeveel warmte je product moet hebben, hoeveel stilte comfortabel is, hoe snel een agent het woord moet afstaan — dan is Sesame Preview gratis, oprecht uitstekend en een goede plek om een middag door te brengen. Gebruik het als referentiepunt. Plan er geen integratie rond, want er is niets om mee te integreren.
Als je aan het shippen bent, is StepAudio 3 Realtime een echte kandidaat met echte kanttekeningen: previewprijzen, dekking met Chinees voorop, geen indexscore op Artificial Analysis, en de latentievraag is onopgelost. Test de latentie vóór de gesprekskwaliteit. Een model dat de turn-taking-benchmark wint, maar er bijna een hele zin over doet voordat het begint te spreken, is een model waarvan je de beste kwaliteit misschien nooit zult kunnen laten zien.
En als de productiestem van Sesame ooit een API krijgt, wordt deze hele vergelijking opnieuw uitgevoerd — want de benchmark die het zou beslechten bestaat al, en Sesame zou er dan eindelijk op moeten verschijnen.
Waar routing past, en waar niet
Spraakagenten zijn niet één model. Of je nu StepAudio 3 Realtime draait of iets anders, het gesprek geeft voortdurend werk door aan gewone tekstmodellen — een opzoeking, een extractie, een redeneeraanroep die achter een aangehouden pauze draait. Die delegatielaag is waar kostenvariantie leeft en waar een slecht uur van één provider jouw uitval wordt.
Om precies te zijn over onze eigen dekking: de live- en voice-endpoints in de StepAudio 3-familie staan niet op OrcaRouter, en dat geldt ook voor alles wat Sesame heeft gebouwd. Wat wel op OrcaRouter staat, is de tekstlaag waarnaar een voice-agent delegeert — bijna 200 modellen achter één API, automatische failover, een routing-DSL die er meerdere samenvoegt tot één aanroep, en modelfusie wanneer het oordeel van één model niet volstaat, met de lijstprijs van de provider doorgegeven zonder opslag.
Die splitsing is juist wat de beschikbaarheidsvraag minder fataal maakt dan ze lijkt. Het stemmodel is een beslissing die je kunt herzien; de delegatielaag is degene die duur wordt om terug te draaien, en juist die is het waard om achter een router te zetten voordat je je aan welke stemleverancier dan ook vastlegt.

Het vonnis
Sesame Preview wint op het punt dat niet meetbaar is en verliest op alles wat gekocht kan worden. Het is de best klinkende stem die beschikbaar is, het is gratis, en je kunt het niet in productie nemen — en nu een derde partij de kwaliteit beoordeelt waar het beroemd om is, is de afwezigheid ervan op dat scorebord een gat in het bewijs, niet een beschermde voorsprong.
StepAudio 3 Realtime wint op beschikbaarheid, meetbaarheid en mogelijkheden, en er blijven echte open vragen over prijs, taaldekking en latency. Het is de enige van de twee waarop je vandaag kunt bouwen, wat de praktische vraag sneller beslecht dan welke benchmark dan ook.
Waar je op moet letten is simpel, en het werkt beide kanten op: een Conversational Dynamics-score voor de productiestem van Sesame, of een latentiecijfer voor StepAudio 3 Realtime dat het in dezelfde range plaatst als de modellen die het qua kwaliteit momenteel verslaat. Elk van beide zou dit veranderen van een vergelijking tussen een meting en een reputatie in een echte head-to-head.
