
StepAudio 3 Realtime vs Sesame Preview: Die Stimme, die alle loben, vs. diejenige, die einen Score hat
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
Für den größten Teil des Jahres 2026 war die stärkste Aussage, die jemand über Voice-KI treffen konnte, ein Höreindruck. Sesames Assistent klang menschlicher als alles andere, und genug Leute sagten es, sodass er zum Referenzpunkt wurde – ohne Benchmark, ohne Zahl und ohne Möglichkeit, es zu überprüfen. Am 15. September 2026 StepAudio 3 Realtimekam von StepFun mit einer Zahl zur am besten messbaren Version dieser Qualität: 98,9 % in Artificial Analysis' Conversational Dynamics Evaluation, erster Platz. Sesame Preview steht nicht auf dieser Rangliste.
Das Interessante daran ist nicht, dass eines das andere geschlagen hat. Es ist, dass die Qualität, für die Sesame berühmt wurde, heute von einer dritten Partei bewertet wird und das Modell mit dem Ruf nie daran gemessen wurde.
Was jedes davon tatsächlich ist
Sie sind nicht die gleiche Art von Objekt, und das bestimmt mehr über den Vergleich als jede Punktzahl.
Sesame Preview ist ein Sprachassistent für Verbraucher. Seit Mai 2026 kostenlos unter iOS und seit Anfang August 2026 breit verfügbar unter Android, basiert er auf vier namentlich genannten Agenten – Maya, Miles, Simone und Charlie –, die Kontext über Sitzungen hinweg behalten, das Web durchsuchen und Erinnerungen einrichten. Er ist nur auf Englisch verfügbar. Anrufe sind auf maximal 30 Minuten begrenzt, was auf fünf Minuten sinkt, wenn man abgemeldet ist. Es gibt keine API für seine Produktionsstimme, keine Enterprise-Stufe und keine öffentlichen Preisangaben.
StepAudio 3 Realtime ist eine Entwickleroberfläche. Es ist eines von fünf Modellen der StepAudio 3-Familie, die alle am selben Tag veröffentlicht wurden und alle als kommerzielle APIs auf StepFuns offener Plattform live sind. Es beherrscht native Vollduplex-Konversation, reasoniert direkt auf Sprache statt zuerst zu transkribieren und unterstützt Tool-Aufrufe sowie die asynchrone Ausführung langer Aufgaben, während die Konversation weiterläuft. Es ist chinesisch-first. Es hat keine offenen Gewichte und befindet sich derzeit in einer zeitlich begrenzten kostenlosen Vorschau-Preisgestaltung, wobei kein Preis nach der Vorschau angekündigt wurde.
Auf einem davon kann man aufbauen. Das andere kann man besuchen.
Das messbare Ding, für das Sesame berühmt ist
Conversational Dynamics ist ein spezifischer Benchmark, und es lohnt sich zu wissen, was er umfasst. Er bewertet Sprecherwechsel, den Umgang mit Pausen, die Wiederaufnahme nach Unterbrechungen sowie ob ein Modell einen kurzen Backchannel – „uh-huh“, „right“, „mm“ – korrekt als Ermutigung und nicht als Versuch, das Rederecht zu übernehmen, interpretiert. Das sind genau die Verhaltensweisen, die Zuhörer beschreiben, wenn sie sagen, eine Stimme fühle sich menschlich und nicht roboterhaft an, und es sind die Verhaltensweisen, die einen Assistenten zu einem angenehmen Gesprächspartner machen statt bloß zu einem akkuraten.
StepAudio 3 Realtime führt dieses Board mit 98,9 % an, vor Qwen Audio 3.0 Realtime Plus mit 98,4 % und GPT-Realtime-2 mit 95,3 %. Es belegt außerdem den ersten Platz bei Speech Reasoning mit 99,7 %, wie von StepFun angegeben, dahinter steht die architektonische Behauptung, dass Reasoning über rohes Audio Ton und Betonung bewahrt, die eine Transkriptionsstufe einebnen würde – der Unterschied zwischen dem Hören von Sarkasmus und dem Hören eines Kompliments.
Hier ist die ehrliche Einordnung dieses Ergebnisses. Der Benchmark ist das Nächste, was die Branche an einer Messung dessen hat, wofür Sesame gelobt wird, und Sesame wurde nicht in ihn eingetragen. Das ist kein Beleg dafür, dass StepAudio 3 Realtime besser klingt als Sesame. Es ist ein Beleg dafür, dass eine dieser Behauptungen überprüfbar ist und die andere, bislang, nicht – und dass die überprüfbare derzeit von einem Modell gehalten wird, mit dem die meisten Menschen noch nie gesprochen haben.

Die Verfügbarkeitsasymmetrie, die die eigentliche Entscheidung ist
Alles oben ist interessant. Dieser Teil ist entscheidend.
Sesames Stimme – die, von der alle schwärmen – ist ein größeres, geschlossenes Produktionsmodell, das Sesame nie als API veröffentlicht hat. Du kannst es weder kaufen noch lizenzieren noch aus deinem eigenen Produkt heraus aufrufen. Wenn du gelesen hast, dass Sesames Timing in Gesprächen das beste verfügbare sei, und daraus geschlossen hast, dass du es haben könntest, folgt dieser Schluss nicht aus den Belegen.
Was Sesame tatsächlich als Open Source veröffentlicht hat, ist CSM-1B, veröffentlicht unter Apache-2.0. Es ist ein Synthese-Baustein, kein Assistent: Ein Llama-Backbone sagt das erste Mimi-Codebook voraus, und ein kleinerer Llama-Decoder sagt den Rest voraus, den ein Mimi-Codec in eine 24-kHz-Wellenform umsetzt. Es ist ausschließlich auf Englisch ausgelegt, es klont eine Stimme aus einem 10 bis 15 Sekunden langen Referenzclip, und es kann überhaupt keinen Text generieren – man kombiniert es mit einem separaten Sprachmodell. Leute, die beides ausprobiert haben, beschreiben die Stimme von CSM-1B als deutlich schwächer als die der Preview-App, und die Modellkarte sagt laut, was man sonst verschweigt: Eine feinabgestimmte Variante von CSM betreibt die interaktive Demo, und diese Variante ist nicht der Checkpoint, den man herunterladen kann.
StepAudio 3 Realtime hat nichts von dieser Mehrdeutigkeit. Es ist eine kommerzielle API mit einer veröffentlichten Modellfamilie dahinter, einem angegebenen Funktionsumfang und Drittanbieter-Platzierungen, die man nachschlagen kann. Es ist außerdem chinesisch-first, mit Preview-Preisgestaltung, und weist eine Zeit bis zum ersten Audio von 8,83 Sekunden auf derselben Bestenliste aus, auf der es bei der Konversationsdynamik gewinnt – gegenüber 1,18 Sekunden für Gemini 3.8 Live und 1,24 bis 1,34 Sekunden für GPT-Live-1. Was es auch immer an Konversationsqualität bietet: Es hat noch nicht gezeigt, dass es sie mit Konversationsgeschwindigkeit außerhalb von StepFuns eigenem Serving-Setup liefern kann.

Was Sie damit tun sollten, wenn Sie einen Voice-Stack auswählen
Trennen Sie zunächst die beiden Fragen. „Wie sollte sich eine Konversation anfühlen?“ und „Was kann ich ausliefern?“ haben unterschiedliche Antworten, und nur eine davon ist eine Beschaffungsentscheidung.
Wenn Sie Ihren Geschmack kalibrieren – entscheiden, wie viel Wärme Ihr Produkt haben sollte, wie viel Stille angenehm ist, wie schnell ein Agent das Wort abgeben sollte –, ist Sesame Preview kostenlos, wirklich hervorragend und ein guter Ort, um einen Nachmittag zu verbringen. Nutzen Sie es als Referenzpunkt. Planen Sie keine Integration darum herum, denn es gibt nichts, womit man eine Integration vornehmen könnte.
Wenn Sie ausliefern, ist StepAudio 3 Realtime ein echter Kandidat mit echten Einschränkungen: Preview-Preisgestaltung, Abdeckung mit Chinesisch als erster Priorität, kein Index-Score bei Artificial Analysis und die ungeklärte Latenzfrage. Testen Sie die Latenz vor der Gesprächsqualität. Ein Modell, das den Turn-Taking-Benchmark gewinnt, aber einen Großteil der Zeit eines Satzes braucht, um mit dem Sprechen zu beginnen, ist ein Modell, dessen beste Qualität Sie vielleicht nie demonstrieren können.
Und wenn Sesames Produktionsstimme jemals eine API bekommt, wird dieser ganze Vergleich erneut durchgeführt – denn der Benchmark, der die Sache entscheiden würde, existiert bereits, und Sesame müsste endlich darin auftauchen.
Wo Routing passt und wo nicht
Voice-Agents sind kein einzelnes Modell. Ganz gleich, ob Sie StepAudio 3 Realtime oder etwas anderes betreiben, das Gespräch übergibt ständig Arbeit an gewöhnliche Textmodelle – einen Lookup, eine Extraktion, einen Reasoning-Aufruf, der hinter einer aufrechterhaltenen Pause läuft. In dieser Delegationsschicht lebt die Kostenvarianz, und hier wird die schlechte Stunde eines Anbieters zu Ihrem Ausfall.
Um genau zu sein, was unsere eigene Abdeckung betrifft: Die Live- und Voice-Endpunkte der StepAudio 3-Familie sind nicht auf OrcaRouter, und ebenso wenig irgendetwas, das Sesame entwickelt hat. Was auf OrcaRouter läuft, ist die Textebene, an die ein Voice-Agent delegiert – fast 200 Modelle hinter einer API, automatisches Failover, eine Routing-DSL, die mehrere zu einem Aufruf kombiniert, und Modell-Fusion, wenn das Urteilsvermögen eines einzelnen Modells nicht ausreicht, wobei der Listenpreis des Anbieters ohne Aufschlag weitergegeben wird.
Diese Trennung ist es, die die Verfügbarkeitsfrage weniger fatal macht, als sie aussieht. Das Voice-Modell ist eine Entscheidung, die man überdenken kann; die Delegationsschicht ist diejenige, die teuer zu entwirren ist, und sie ist diejenige, die man hinter einen Router setzen sollte, bevor man sich auf einen Voice-Anbieter festlegt.

Das Urteil
Sesame Preview gewinnt bei dem, was sich nicht messen lässt, und verliert bei allem, was sich kaufen lässt. Es ist die bestklingende verfügbare Stimme, es ist kostenlos, und man kann es nicht in Produktion einsetzen – und jetzt, da ein Dritter die Qualität bewertet, für die es berühmt ist, ist sein Fehlen in dieser Bestenliste eine Lücke in der Beweislage, kein geschützter Vorsprung.
StepAudio 3 Realtime gewinnt bei Verfügbarkeit, Messbarkeit und Leistungsfähigkeit und birgt echte offene Fragen bei Preis, Sprachabdeckung und Latenz. Es ist das einzige der beiden, auf das man heute aufbauen kann, was die praktische Frage schneller klärt als jeder Benchmark.
Worauf man achten sollte, ist einfach – und es gilt in beide Richtungen: ein Conversational Dynamics Score für die Produktionsstimme von Sesame oder ein Latenzwert für StepAudio 3 Realtime, der es in denselben Bereich bringt wie die Modelle, die es derzeit bei der Qualität übertrifft. Eines von beidem würde dies von einem Vergleich zwischen einer Messung und einem Ruf in ein echtes Kopf-an-Kopf-Duell verwandeln.
