Wygenerowana karta tytułowa hero dla StepAudio 3 Realtime vs Sesame Preview z nadtytułem „OrcaRouter · radar modeli — bezpośrednie starcie”, nagłówkiem „StepAudio 3 Realtime vs Sesame Preview” i podtytułem „Głos, który wszyscy chwalą, kontra ten, który ma wynik na liście rankingowej”, nad dwiema zaokrąglonymi kartami modeli po obu stronach znaku versus.
Guides & Insights

StepAudio 3 Realtime vs Sesame Preview: Głos, który wszyscy chwalą, kontra ten, który ma wynik

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Przez większość 2026 roku najśmielszym twierdzeniem, jakie ktokolwiek mógł wysunąć na temat AI głosowej, było wrażenie słuchowe. Asystent Sesame brzmiał bardziej ludzko niż cokolwiek innego, a wystarczająco wiele osób to potwierdziło, że stał się punktem odniesienia — bez benchmarku, bez liczby i bez sposobu, aby to sprawdzić. 15 września 2026 r., StepAudio 3 Realtime został wprowadzony przez StepFun z liczbą przypisaną do najbliższej mierzalnej wersji tej jakości: 98,9% w ocenie Conversational Dynamics Artificial Analysis, pierwsze miejsce. Sesame Preview nie ma go na tej tablicy wyników.

Ciekawe nie jest to, że jeden pokonał drugiego. Ciekawe jest to, że jakość, dzięki której Sesame zasłynął, jest teraz czymś, co ocenia strona trzecia, a model z reputacją nigdy nie był mierzony względem niej.

Czym każde z nich właściwie jest

Nie są tym samym rodzajem obiektu, a to określa więcej w tym porównaniu niż jakikolwiek wynik.

Sesame Preview to asystent głosowy dla konsumentów. Bezpłatny na iOS od maja 2026 r. i powszechnie dostępny na Androidzie od początku sierpnia 2026 r., zbudowany wokół czterech nazwanych agentów — Maya, Miles, Simone i Charlie — którzy utrzymują kontekst między sesjami, wyszukują informacje w internecie i ustawiają przypomnienia. Działa wyłącznie w języku angielskim. Rozmowy mają limit 30 minut, który spada do pięciu minut, gdy jesteś wylogowany. Nie ma API dla jego produkcyjnego głosu, wersji enterprise ani publicznego cennika.

StepAudio 3 Realtime to interfejs deweloperski. Jest jednym z pięciu modeli w rodzinie StepAudio 3, wszystkie wydane tego samego dnia i wszystkie dostępne na otwartej platformie StepFun jako komercyjne API. Obsługuje natywną rozmowę pełnodupleksową, rozumuje bezpośrednio na mowie, zamiast najpierw ją transkrybować, oraz obsługuje wywoływanie narzędzi i asynchroniczne wykonywanie długich zadań, gdy rozmowa trwa. Jest nastawiony przede wszystkim na język chiński. Nie jest modelem z otwartymi wagami, a obecnie obowiązuje dla niego ograniczony czasowo bezpłatny cennik wersji zapoznawczej, bez ogłoszonej stawki po zakończeniu okresu zapoznawczego.

Na jednym z nich możesz coś zbudować. Drugie możesz odwiedzić.

Mierzalna rzecz, z której słynie Sesame

Conversational Dynamics to konkretny benchmark i warto wiedzieć, co obejmuje. Ocenia naprzemienność mówienia, radzenie sobie z pauzami, odzyskiwanie po przerwaniu oraz to, czy model prawidłowo odczytuje krótki backchannel — „uh-huh”, „right”, „mm” — jako zachętę, a nie jako próbę przejęcia głosu w rozmowie. To dokładnie te zachowania, które opisują słuchacze, gdy mówią, że głos brzmi ludzko, a nie robotycznie, i to one sprawiają, że z asystentem rozmawia się przyjemnie, a nie tylko że jest dokładny.

StepAudio 3 Realtime prowadzi w tym zestawieniu z wynikiem 98,9%, przed Qwen Audio 3.0 Realtime Plus z 98,4% i GPT-Realtime-2 z 95,3%. Zajmuje również pierwsze miejsce w Speech Reasoning z wynikiem 99,7%, jak podaje StepFun, za czym kryje się twierdzenie architektoniczne, że wnioskowanie na surowym dźwięku zachowuje ton i nacisk, które pośredni etap transkrypcji by spłaszczył — różnica między usłyszeniem sarkazmu a usłyszeniem komplementu.

Oto uczciwe ujęcie tego wyniku. Benchmark jest tym, co branża ma najbliższego pomiarowi tego, za co chwali się Sesame, a Sesame nie zostało do niego zgłoszone. To nie jest dowód, że StepAudio 3 Realtime brzmi lepiej niż Sesame. To dowód, że jedno z tych twierdzeń można sprawdzić, a drugiego — jak dotąd — nie, i że to, które można sprawdzić, należy obecnie do modelu, z którym większość ludzi nigdy nie rozmawiała.

Screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the AA-Speech to Speech Index bar chart and the speed and cost-per-hour charts for the voice models StepAudio 3 Realtime is measured against.

Asymetria dostępności, która jest prawdziwą decyzją

Wszystko powyższe jest interesujące. Ta część jest decydująca.

Głos Sesame — ten, którym ludzie się zachwycają — to większy, zamknięty model produkcyjny, którego Sesame nigdy nie udostępniło jako API. Nie można go kupić, licencjonować ani wywoływać z własnego produktu. Jeśli przeczytałeś, że timing konwersacyjny Sesame jest najlepszy dostępny, i wyciągnąłeś wniosek, że możesz go mieć, ten wniosek nie wynika z dowodów.

To, co Sesame faktycznie udostępniło jako open source, to CSM-1B, wydany na licencji Apache-2.0. To blok syntezy, a nie asystent: szkielet Llama przewiduje pierwszą książkę kodową Mimi, a mniejszy dekoder Llama przewiduje resztę, którą kodek Mimi renderuje do przebiegu fali dźwiękowej o częstotliwości 24 kHz. Model jest wyłącznie angielskojęzyczny, klonuje głos na podstawie 10–15-sekundowego klipu referencyjnego i w ogóle nie potrafi generować tekstu — łączy się go z osobnym modelem językowym. Osoby, które uruchomiły oba, opisują głos CSM-1B jako wyraźnie słabszy niż w aplikacji Preview, a karta modelu mówi wprost to, co zwykle się przemilcza: dostrojony wariant CSM napędza interaktywne demo, a ten wariant nie jest checkpointem, który można pobrać.

StepAudio 3 Realtime nie ma żadnej z tej niejednoznaczności. To komercyjne API, za którym stoi opublikowana rodzina modeli, zadeklarowany zestaw możliwości oraz pozycje w rankingach podmiotów trzecich, które można sprawdzić. Jest też przede wszystkim chińskojęzyczny, w cenie wersji zapoznawczej, i odnotowuje czas do pierwszego dźwięku wynoszący 8,83 sekundy na tym samym rankingu, w którym zwycięża w dynamice konwersacyjnej — w zestawieniu z 1,18 sekundy dla Gemini 3.8 Live i od 1,24 do 1,34 sekundy dla GPT-Live-1. Cokolwiek oferuje w zakresie jakości konwersacyjnej, nie wykazało jeszcze, że potrafi dostarczać ją z prędkością konwersacyjną poza własnym środowiskiem serwowania StepFun.

Screenshot of the Sesame CSM-1B model card on Hugging Face showing the Apache-2.0 licence tag alongside English and text-to-speech tags, 2.45k likes and 1.65k followers, release notes for the 1B CSM variant, a description of the Llama backbone and smaller Mimi audio-code decoder, and a line stating that a fine-tuned variant of CSM powers the interactive voice demo shown in the blog post.

Co z tym zrobić, jeśli wybierasz stack głosowy

Zacznij od rozdzielenia obu pytań. „Jakie wrażenie powinna sprawiać rozmowa?” i „co mogę wypuścić?” mają różne odpowiedzi, a tylko jedno z nich jest decyzją zakupową.

Jeśli kalibrujesz wyczucie — decydujesz, ile ciepła powinien mieć Twój produkt, ile ciszy jest komfortowe, jak szybko agent powinien oddać głos — Sesame Preview jest darmowy, naprawdę znakomity i to dobry sposób, by spędzić popołudnie. Traktuj go jako punkt odniesienia. Nie planuj wokół niego integracji, bo nie ma się z czym integrować.

Jeśli wdrażasz do produkcji, StepAudio 3 Realtime jest prawdziwym kandydatem z prawdziwymi zastrzeżeniami: ceny w wersji zapoznawczej, obsługa nastawiona przede wszystkim na język chiński, brak wyniku w indeksie Artificial Analysis i nierozstrzygnięta kwestia opóźnienia. Przetestuj opóźnienie przed jakością rozmowy. Model, który wygrywa benchmark naprzemiennego zabierania głosu, ale rozpoczęcie mówienia zajmuje mu większość czasu potrzebnego na wypowiedzenie zdania, to model, którego najlepszej jakości możesz nigdy nie mieć okazji zaprezentować.

A jeśli produkcyjny głos Sesame kiedykolwiek doczeka się API, całe to porównanie zostanie przeprowadzone ponownie — ponieważ benchmark, który by to rozstrzygnął, już istnieje, a Sesame w końcu musiałby się w nim pojawić.

Gdzie routing pasuje, a gdzie nie

Agenci głosowi to nie jeden model. Niezależnie od tego, czy używasz StepAudio 3 Realtime, czy czegokolwiek innego, rozmowa nieustannie zleca pracę zwykłym modelom tekstowym — wyszukiwanie, ekstrakcję, wywołanie rozumowania uruchamiane w tle podczas wstrzymanej pauzy. To właśnie w tej warstwie delegowania tkwi zmienność kosztów i to tam zła godzina jednego dostawcy staje się twoją awarią.

Aby być precyzyjnym co do naszego własnego zakresu: punkty końcowe live i voice w rodzinie StepAudio 3 nie znajdują się w OrcaRouter, podobnie jak nic, co zbudowało Sesame. Tym, co znajduje się w OrcaRouter, jest warstwa tekstowa, do której deleguje agent głosowy — prawie 200 modeli za jednym API, automatyczne przełączanie awaryjne, DSL routingu, który komponuje kilka w jedno wywołanie, a także fuzja modeli, gdy osąd pojedynczego modelu nie wystarcza, z ceną katalogową dostawcy przekazywaną bez marży.

Ten podział sprawia, że kwestia dostępności jest mniej katastrofalna, niż się wydaje. Model głosowy to decyzja, do której możesz wrócić; warstwa delegowania to ta, której rozplątanie staje się kosztowne, i to ją warto umieścić za routerem, zanim zwiążesz się z jakimkolwiek dostawcą technologii głosowej.

A generated scoreboard titled 'StepAudio 3 Realtime vs Sesame Preview'. The StepAudio column reads Conv. Dynamics '98.9%, first place', Callable API 'yes, commercial', Languages 'Chinese-first', Session cap 'not published', Tool execution 'tool calls, async tasks', Open artifact 'none, closed'. The Sesame column reads Conv. Dynamics 'no score published', Callable API 'no API for its voice', Languages 'English only', Session cap '30 min, 5 logged out', Tool execution 'reminders, web search only', Open artifact 'CSM-1B, Apache-2.0'. Footer: 'StepAudio 3 figures vendor-cited; Sesame naturalness is a listening impression, not a benchmark.'

Werdykt

Sesame Preview wygrywa w tym, czego nie da się zmierzyć, a przegrywa we wszystkim, co można kupić. To najlepiej brzmiący dostępny głos, jest darmowy, a nie można go wdrożyć do produkcji — a teraz, gdy strona trzecia ocenia jakość, z której słynie, jego brak na tej tablicy wyników jest luką w dowodach, a nie chronioną przewagą.

StepAudio 3 Realtime wygrywa pod względem dostępności, mierzalności i możliwości, ale niesie ze sobą prawdziwe otwarte pytania dotyczące ceny, pokrycia językowego i opóźnienia. To jedyny z tych dwóch, na którym możesz dziś budować, co rozstrzyga praktyczną kwestię szybciej niż jakikolwiek benchmark.

To, na co warto patrzeć, jest proste i działa w obie strony: wynik Conversational Dynamics dla produkcyjnego głosu Sesame albo wartość opóźnienia dla StepAudio 3 Realtime, która plasuje go w tym samym zakresie co modele, które obecnie przewyższa pod względem jakości. Każdy z tych elementów zamieniłby to z porównania pomiaru z reputacją w prawdziwe starcie bezpośrednie.