Eine generierte Hero-Titelkarte für StepAudio 3 Realtime vs. Sesame Preview mit dem Kicker „OrcaRouter · Modell-Radar — Kopf an Kopf“, der Überschrift „StepAudio 3 Realtime vs. Sesame Preview“ und dem Untertitel „Die Stimme, die alle loben, gegen die, die einen Leaderboard-Score hat“, über zwei abgerundeten Modellkarten beidseits eines Versus-Zeichens.
Guides & Insights

StepAudio 3 Realtime vs Sesame Preview: Die Stimme, die alle loben, vs. diejenige, die einen Score hat

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Für den größten Teil des Jahres 2026 war die stärkste Aussage, die jemand über Voice-KI treffen konnte, ein Höreindruck. Sesames Assistent klang menschlicher als alles andere, und genug Leute sagten es, sodass er zum Referenzpunkt wurde – ohne Benchmark, ohne Zahl und ohne Möglichkeit, es zu überprüfen. Am 15. September 2026 StepAudio 3 Realtimekam von StepFun mit einer Zahl zur am besten messbaren Version dieser Qualität: 98,9 % in Artificial Analysis' Conversational Dynamics Evaluation, erster Platz. Sesame Preview steht nicht auf dieser Rangliste.

Das Interessante daran ist nicht, dass eines das andere geschlagen hat. Es ist, dass die Qualität, für die Sesame berühmt wurde, heute von einer dritten Partei bewertet wird und das Modell mit dem Ruf nie daran gemessen wurde.

Was jedes davon tatsächlich ist

Sie sind nicht die gleiche Art von Objekt, und das bestimmt mehr über den Vergleich als jede Punktzahl.

Sesame Preview ist ein Sprachassistent für Verbraucher. Seit Mai 2026 kostenlos unter iOS und seit Anfang August 2026 breit verfügbar unter Android, basiert er auf vier namentlich genannten Agenten – Maya, Miles, Simone und Charlie –, die Kontext über Sitzungen hinweg behalten, das Web durchsuchen und Erinnerungen einrichten. Er ist nur auf Englisch verfügbar. Anrufe sind auf maximal 30 Minuten begrenzt, was auf fünf Minuten sinkt, wenn man abgemeldet ist. Es gibt keine API für seine Produktionsstimme, keine Enterprise-Stufe und keine öffentlichen Preisangaben.

StepAudio 3 Realtime ist eine Entwickleroberfläche. Es ist eines von fünf Modellen der StepAudio 3-Familie, die alle am selben Tag veröffentlicht wurden und alle als kommerzielle APIs auf StepFuns offener Plattform live sind. Es beherrscht native Vollduplex-Konversation, reasoniert direkt auf Sprache statt zuerst zu transkribieren und unterstützt Tool-Aufrufe sowie die asynchrone Ausführung langer Aufgaben, während die Konversation weiterläuft. Es ist chinesisch-first. Es hat keine offenen Gewichte und befindet sich derzeit in einer zeitlich begrenzten kostenlosen Vorschau-Preisgestaltung, wobei kein Preis nach der Vorschau angekündigt wurde.

Auf einem davon kann man aufbauen. Das andere kann man besuchen.

Das messbare Ding, für das Sesame berühmt ist

Conversational Dynamics ist ein spezifischer Benchmark, und es lohnt sich zu wissen, was er umfasst. Er bewertet Sprecherwechsel, den Umgang mit Pausen, die Wiederaufnahme nach Unterbrechungen sowie ob ein Modell einen kurzen Backchannel – „uh-huh“, „right“, „mm“ – korrekt als Ermutigung und nicht als Versuch, das Rederecht zu übernehmen, interpretiert. Das sind genau die Verhaltensweisen, die Zuhörer beschreiben, wenn sie sagen, eine Stimme fühle sich menschlich und nicht roboterhaft an, und es sind die Verhaltensweisen, die einen Assistenten zu einem angenehmen Gesprächspartner machen statt bloß zu einem akkuraten.

StepAudio 3 Realtime führt dieses Board mit 98,9 % an, vor Qwen Audio 3.0 Realtime Plus mit 98,4 % und GPT-Realtime-2 mit 95,3 %. Es belegt außerdem den ersten Platz bei Speech Reasoning mit 99,7 %, wie von StepFun angegeben, dahinter steht die architektonische Behauptung, dass Reasoning über rohes Audio Ton und Betonung bewahrt, die eine Transkriptionsstufe einebnen würde – der Unterschied zwischen dem Hören von Sarkasmus und dem Hören eines Kompliments.

Hier ist die ehrliche Einordnung dieses Ergebnisses. Der Benchmark ist das Nächste, was die Branche an einer Messung dessen hat, wofür Sesame gelobt wird, und Sesame wurde nicht in ihn eingetragen. Das ist kein Beleg dafür, dass StepAudio 3 Realtime besser klingt als Sesame. Es ist ein Beleg dafür, dass eine dieser Behauptungen überprüfbar ist und die andere, bislang, nicht – und dass die überprüfbare derzeit von einem Modell gehalten wird, mit dem die meisten Menschen noch nie gesprochen haben.

Screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the AA-Speech to Speech Index bar chart and the speed and cost-per-hour charts for the voice models StepAudio 3 Realtime is measured against.

Die Verfügbarkeitsasymmetrie, die die eigentliche Entscheidung ist

Alles oben ist interessant. Dieser Teil ist entscheidend.

Sesames Stimme – die, von der alle schwärmen – ist ein größeres, geschlossenes Produktionsmodell, das Sesame nie als API veröffentlicht hat. Du kannst es weder kaufen noch lizenzieren noch aus deinem eigenen Produkt heraus aufrufen. Wenn du gelesen hast, dass Sesames Timing in Gesprächen das beste verfügbare sei, und daraus geschlossen hast, dass du es haben könntest, folgt dieser Schluss nicht aus den Belegen.

Was Sesame tatsächlich als Open Source veröffentlicht hat, ist CSM-1B, veröffentlicht unter Apache-2.0. Es ist ein Synthese-Baustein, kein Assistent: Ein Llama-Backbone sagt das erste Mimi-Codebook voraus, und ein kleinerer Llama-Decoder sagt den Rest voraus, den ein Mimi-Codec in eine 24-kHz-Wellenform umsetzt. Es ist ausschließlich auf Englisch ausgelegt, es klont eine Stimme aus einem 10 bis 15 Sekunden langen Referenzclip, und es kann überhaupt keinen Text generieren – man kombiniert es mit einem separaten Sprachmodell. Leute, die beides ausprobiert haben, beschreiben die Stimme von CSM-1B als deutlich schwächer als die der Preview-App, und die Modellkarte sagt laut, was man sonst verschweigt: Eine feinabgestimmte Variante von CSM betreibt die interaktive Demo, und diese Variante ist nicht der Checkpoint, den man herunterladen kann.

StepAudio 3 Realtime hat nichts von dieser Mehrdeutigkeit. Es ist eine kommerzielle API mit einer veröffentlichten Modellfamilie dahinter, einem angegebenen Funktionsumfang und Drittanbieter-Platzierungen, die man nachschlagen kann. Es ist außerdem chinesisch-first, mit Preview-Preisgestaltung, und weist eine Zeit bis zum ersten Audio von 8,83 Sekunden auf derselben Bestenliste aus, auf der es bei der Konversationsdynamik gewinnt – gegenüber 1,18 Sekunden für Gemini 3.8 Live und 1,24 bis 1,34 Sekunden für GPT-Live-1. Was es auch immer an Konversationsqualität bietet: Es hat noch nicht gezeigt, dass es sie mit Konversationsgeschwindigkeit außerhalb von StepFuns eigenem Serving-Setup liefern kann.

Screenshot of the Sesame CSM-1B model card on Hugging Face showing the Apache-2.0 licence tag alongside English and text-to-speech tags, 2.45k likes and 1.65k followers, release notes for the 1B CSM variant, a description of the Llama backbone and smaller Mimi audio-code decoder, and a line stating that a fine-tuned variant of CSM powers the interactive voice demo shown in the blog post.

Was Sie damit tun sollten, wenn Sie einen Voice-Stack auswählen

Trennen Sie zunächst die beiden Fragen. „Wie sollte sich eine Konversation anfühlen?“ und „Was kann ich ausliefern?“ haben unterschiedliche Antworten, und nur eine davon ist eine Beschaffungsentscheidung.

Wenn Sie Ihren Geschmack kalibrieren – entscheiden, wie viel Wärme Ihr Produkt haben sollte, wie viel Stille angenehm ist, wie schnell ein Agent das Wort abgeben sollte –, ist Sesame Preview kostenlos, wirklich hervorragend und ein guter Ort, um einen Nachmittag zu verbringen. Nutzen Sie es als Referenzpunkt. Planen Sie keine Integration darum herum, denn es gibt nichts, womit man eine Integration vornehmen könnte.

Wenn Sie ausliefern, ist StepAudio 3 Realtime ein echter Kandidat mit echten Einschränkungen: Preview-Preisgestaltung, Abdeckung mit Chinesisch als erster Priorität, kein Index-Score bei Artificial Analysis und die ungeklärte Latenzfrage. Testen Sie die Latenz vor der Gesprächsqualität. Ein Modell, das den Turn-Taking-Benchmark gewinnt, aber einen Großteil der Zeit eines Satzes braucht, um mit dem Sprechen zu beginnen, ist ein Modell, dessen beste Qualität Sie vielleicht nie demonstrieren können.

Und wenn Sesames Produktionsstimme jemals eine API bekommt, wird dieser ganze Vergleich erneut durchgeführt – denn der Benchmark, der die Sache entscheiden würde, existiert bereits, und Sesame müsste endlich darin auftauchen.

Wo Routing passt und wo nicht

Voice-Agents sind kein einzelnes Modell. Ganz gleich, ob Sie StepAudio 3 Realtime oder etwas anderes betreiben, das Gespräch übergibt ständig Arbeit an gewöhnliche Textmodelle – einen Lookup, eine Extraktion, einen Reasoning-Aufruf, der hinter einer aufrechterhaltenen Pause läuft. In dieser Delegationsschicht lebt die Kostenvarianz, und hier wird die schlechte Stunde eines Anbieters zu Ihrem Ausfall.

Um genau zu sein, was unsere eigene Abdeckung betrifft: Die Live- und Voice-Endpunkte der StepAudio 3-Familie sind nicht auf OrcaRouter, und ebenso wenig irgendetwas, das Sesame entwickelt hat. Was auf OrcaRouter läuft, ist die Textebene, an die ein Voice-Agent delegiert – fast 200 Modelle hinter einer API, automatisches Failover, eine Routing-DSL, die mehrere zu einem Aufruf kombiniert, und Modell-Fusion, wenn das Urteilsvermögen eines einzelnen Modells nicht ausreicht, wobei der Listenpreis des Anbieters ohne Aufschlag weitergegeben wird.

Diese Trennung ist es, die die Verfügbarkeitsfrage weniger fatal macht, als sie aussieht. Das Voice-Modell ist eine Entscheidung, die man überdenken kann; die Delegationsschicht ist diejenige, die teuer zu entwirren ist, und sie ist diejenige, die man hinter einen Router setzen sollte, bevor man sich auf einen Voice-Anbieter festlegt.

A generated scoreboard titled 'StepAudio 3 Realtime vs Sesame Preview'. The StepAudio column reads Conv. Dynamics '98.9%, first place', Callable API 'yes, commercial', Languages 'Chinese-first', Session cap 'not published', Tool execution 'tool calls, async tasks', Open artifact 'none, closed'. The Sesame column reads Conv. Dynamics 'no score published', Callable API 'no API for its voice', Languages 'English only', Session cap '30 min, 5 logged out', Tool execution 'reminders, web search only', Open artifact 'CSM-1B, Apache-2.0'. Footer: 'StepAudio 3 figures vendor-cited; Sesame naturalness is a listening impression, not a benchmark.'

Das Urteil

Sesame Preview gewinnt bei dem, was sich nicht messen lässt, und verliert bei allem, was sich kaufen lässt. Es ist die bestklingende verfügbare Stimme, es ist kostenlos, und man kann es nicht in Produktion einsetzen – und jetzt, da ein Dritter die Qualität bewertet, für die es berühmt ist, ist sein Fehlen in dieser Bestenliste eine Lücke in der Beweislage, kein geschützter Vorsprung.

StepAudio 3 Realtime gewinnt bei Verfügbarkeit, Messbarkeit und Leistungsfähigkeit und birgt echte offene Fragen bei Preis, Sprachabdeckung und Latenz. Es ist das einzige der beiden, auf das man heute aufbauen kann, was die praktische Frage schneller klärt als jeder Benchmark.

Worauf man achten sollte, ist einfach – und es gilt in beide Richtungen: ein Conversational Dynamics Score für die Produktionsstimme von Sesame oder ein Latenzwert für StepAudio 3 Realtime, der es in denselben Bereich bringt wie die Modelle, die es derzeit bei der Qualität übertrifft. Eines von beidem würde dies von einem Vergleich zwischen einer Messung und einem Ruf in ein echtes Kopf-an-Kopf-Duell verwandeln.