
StepAudio 3 Realtime vs Sesame Preview: Rösten alla hyllar vs den som har ett betyg
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Under större delen av 2026 var det starkaste påståendet någon kunde göra om röst-AI ett lyssningsintryck. Sesams assistent lät mer mänsklig än något annat, och tillräckligt många sa det, så att det blev referenspunkten – utan benchmark, utan siffra och utan sätt att kontrollera. Den 15 september 2026, StepAudio 3 Realtime anlände från StepFun med en siffra kopplad till den närmast mätbara versionen av den kvaliteten: 98,9 % i utvärderingen Conversational Dynamics från Artificial Analysis, första plats. Sesame Preview finns inte med på den listan.
Det intressanta är inte att den ena besegrade den andra. Det är att den kvalitet Sesame blev känd för nu är något som en tredje part poängsätter, och modellen med ryktet har aldrig mätts mot den.
Vad var och en av dessa faktiskt är
De är inte samma typ av objekt, och det avgör mer av jämförelsen än någon poäng.
Sesame Preview är en röstassistent för konsumenter. Gratis på iOS sedan maj 2026 och i stor utsträckning på Android sedan början av augusti 2026, uppbyggd kring fyra namngivna agenter – Maya, Miles, Simone och Charlie – som behåller kontext mellan sessioner, söker på webben och ställer in påminnelser. Den finns endast på engelska. Samtal har en gräns på 30 minuter, som sjunker till fem minuter när du är utloggad. Det finns inget API för dess produktionsröst, ingen företagsnivå och ingen offentlig prissättning.
StepAudio 3 Realtime är en utvecklaryta. Det är en av fem modeller i StepAudio 3-familjen, alla släppta samma dag och alla tillgängliga på StepFuns öppna plattform som kommersiella API:er. Den hanterar inbyggd full-duplex-konversation, resonerar direkt utifrån tal i stället för att först transkribera, och stöder verktygsanrop och asynkron körning av långvariga uppgifter medan konversationen fortsätter. Den prioriterar kinesiska. Den har inte öppna vikter, och den har för närvarande ett tidsbegränsat gratis förhandsvisningspris utan att någon prisnivå efter förhandsvisningen har meddelats.
En av dessa kan du bygga på. Den andra kan du besöka.
Det mätbara som Sesame är känt för
Conversational Dynamics är ett specifikt benchmark, och det är värt att veta vad det innehåller. Det poängsätter turtagning, paushantering, återhämtning efter avbrott, och huruvida en modell korrekt tolkar en kort backchannel – "uh-huh", "right", "mm" – som uppmuntran snarare än som ett försök att ta över ordet. Det är precis de beteenden som lyssnare beskriver när de säger att en röst känns mänsklig snarare än robotisk, och det är de beteenden som gör en assistent trevlig att prata med snarare än enbart korrekt.
StepAudio 3 Realtime toppar den listan med 98,9 %, före Qwen Audio 3.0 Realtime Plus på 98,4 % och GPT-Realtime-2 på 95,3 %. Den ligger också först inom Speech Reasoning med 99,7 %, enligt StepFun, bakom vilket ligger det arkitektoniska påståendet att resonemang över rå ljud bevarar ton och betoning som ett transkriptionssteg skulle platta till — skillnaden mellan att höra sarkasm och att höra en komplimang.
Här är den ärliga inramningen av det resultatet. Benchmarken är det närmaste branschen har till ett mått på det som Sesame beröms för, och Sesame har inte anmälts till den. Det är inte bevis för att StepAudio 3 Realtime låter bättre än Sesame. Det är bevis för att ett av dessa påståenden går att kontrollera och det andra, hittills, inte — och att det som går att kontrollera för närvarande innehas av en modell som de flesta aldrig har talat med.

Tillgänglighetsasymmetrin, som är det verkliga beslutet
Allt ovan är intressant. Den här delen är avgörande.
Sesames röst – den som folk lovordar – är en större, sluten produktionsmodell som Sesame aldrig har släppt som ett API. Du kan inte köpa den, licensiera den eller anropa den från din egen produkt. Om du har läst att Sesames samtalstajming är den bästa som finns och dragit slutsatsen att du skulle kunna få den, följer den slutsatsen inte av bevisen.
Det Sesame faktiskt har släppt som öppen källkod är CSM-1B, utgiven under Apache-2.0. CSM-1B är ett syntesblock, inte en assistent: en Llama-stomme förutsäger den första Mimi-kodboken och en mindre Llama-avkodare förutsäger resten, som en Mimi-kodek renderar till en vågform på 24 kHz. Den är endast engelskspråkig, den klonar en röst från ett referensklipp på 10–15 sekunder, och den kan inte generera text alls – du kopplar den till en separat språkmodell. Personer som har kört båda beskriver CSM-1B:s röst som klart svagare än Preview-appens, och modellkortet säger det tysta högt: en finjusterad variant av CSM driver den interaktiva demon, och den varianten är inte den checkpoint du kan ladda ner.
StepAudio 3 Realtime har inget av den tvetydigheten. Det är ett kommersiellt API med en publicerad modellfamilj bakom sig, en angiven uppsättning funktioner och tredjepartsplaceringar som du kan slå upp. Det är också kinesiskt först, förhandsprissatt och uppvisar en tid till första ljud på 8,83 sekunder på samma resultattavla där den vinner samtalsdynamik — mot 1,18 sekunder för Gemini 3.8 Live och 1,24 till 1,34 sekunder för GPT-Live-1. Vad den än erbjuder i samtalskvalitet, har den ännu inte visat att den kan leverera det i samtalstempo utanför StepFuns egen serveringsmiljö.

Vad du ska göra med detta om du väljer en röststack
Börja med att separera de två frågorna. "Hur ska en konversation kännas?" och "vad kan jag leverera?" har olika svar, och bara en av dem är ett inköpsbeslut.
Om du kalibrerar smak — bestämmer hur mycket värme din produkt bör ha, hur mycket tystnad som känns bekväm, hur snabbt en agent bör lämna ordet — är Sesame Preview gratis, genuint utmärkt och ett bra ställe att tillbringa en eftermiddag på. Använd det som referenspunkt. Planera inte någon integration runt det, eftersom det inte finns något att integrera med.
Om du ska lansera är StepAudio 3 Realtime en riktig kandidat med riktiga förbehåll: förhandspriser, täckning med kinesiska i första hand, inget indexbetyg hos Artificial Analysis och latensfrågan ännu inte löst. Testa latensen före samtalskvaliteten. En modell som vinner turtagningsbenchmarken men tar större delen av en menings tid på sig att börja tala är en modell vars bästa kvalitet du kanske aldrig får visa upp.
Och om Sesames produktionsröst någonsin får ett API kommer hela den här jämförelsen att köras om – för benchmarken som skulle avgöra saken finns redan, och Sesame skulle till slut tvingas finnas med i den.
Var routing passar, och var det inte gör det
Röstagenter är inte en enda modell. Oavsett om du kör StepAudio 3 Realtime eller något annat, lämnar samtalet ständigt över arbete till vanliga textmodeller – en uppslagning, en extrahering, ett resonemangsanrop som körs medan pausen hålls. Det delegeringslagret är där kostnadsvariationen bor och där en leverantörs dåliga timme blir ditt avbrott.
För att vara exakt om vår egen täckning: live- och röstslutpunkterna i StepAudio 3-familjen finns inte på OrcaRouter, och inte heller något som Sesame har byggt. Det som finns på OrcaRouter är det textlager som en röstagent delegerar till – nästan 200 modeller bakom ett API, automatisk failover, ett routing-DSL som komponerar flera till ett anrop, och modellfusion när en enskild models omdöme inte räcker, med leverantörens listpris vidarebefordrat utan påslag.
Den uppdelningen är det som gör tillgänglighetsfrågan mindre ödesdiger än den verkar. Röstmodellen är ett beslut du kan återkomma till; delegeringslagret är det som blir dyrt att reda ut, och det är det som är värt att lägga bakom en router innan du förbinder dig till någon röstleverantör.

Domen
Sesame Preview vinner på det som inte går att mäta och förlorar på allt som går att köpa. Det är den bäst klingande rösten som finns, den är gratis, och du kan inte sätta den i produktion — och nu när en tredje part betygsätter den kvalitet den är känd för, är dess frånvaro från den resultattavlan en lucka i bevisningen, inte ett skyddat försprång.
StepAudio 3 Realtime vinner på tillgänglighet, mätbarhet och kapacitet, och rymmer genuina öppna frågor kring pris, språktäckning och latens. Det är den enda av de två som du kan bygga på idag, vilket avgör den praktiska frågan snabbare än något benchmark.
Vad man ska hålla ögonen på är enkelt, och det fungerar åt båda hållen: en Conversational Dynamics-poäng för Sesames produktionsröst, eller en latenssiffra för StepAudio 3 Realtime som placerar den i samma spann som de modeller den för närvarande överträffar i kvalitet. Endera skulle förvandla detta från en jämförelse mellan ett mätvärde och ett rykte till en verklig direktduell.
