
StepAudio 3 Realtime vs Sesame Preview: Głos, który wszyscy chwalą, kontra ten, który ma wynik
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Przez większość 2026 roku najśmielszym twierdzeniem, jakie ktokolwiek mógł wysunąć na temat AI głosowej, było wrażenie słuchowe. Asystent Sesame brzmiał bardziej ludzko niż cokolwiek innego, a wystarczająco wiele osób to potwierdziło, że stał się punktem odniesienia — bez benchmarku, bez liczby i bez sposobu, aby to sprawdzić. 15 września 2026 r., StepAudio 3 Realtime został wprowadzony przez StepFun z liczbą przypisaną do najbliższej mierzalnej wersji tej jakości: 98,9% w ocenie Conversational Dynamics Artificial Analysis, pierwsze miejsce. Sesame Preview nie ma go na tej tablicy wyników.
Ciekawe nie jest to, że jeden pokonał drugiego. Ciekawe jest to, że jakość, dzięki której Sesame zasłynął, jest teraz czymś, co ocenia strona trzecia, a model z reputacją nigdy nie był mierzony względem niej.
Czym każde z nich właściwie jest
Nie są tym samym rodzajem obiektu, a to określa więcej w tym porównaniu niż jakikolwiek wynik.
Sesame Preview to asystent głosowy dla konsumentów. Bezpłatny na iOS od maja 2026 r. i powszechnie dostępny na Androidzie od początku sierpnia 2026 r., zbudowany wokół czterech nazwanych agentów — Maya, Miles, Simone i Charlie — którzy utrzymują kontekst między sesjami, wyszukują informacje w internecie i ustawiają przypomnienia. Działa wyłącznie w języku angielskim. Rozmowy mają limit 30 minut, który spada do pięciu minut, gdy jesteś wylogowany. Nie ma API dla jego produkcyjnego głosu, wersji enterprise ani publicznego cennika.
StepAudio 3 Realtime to interfejs deweloperski. Jest jednym z pięciu modeli w rodzinie StepAudio 3, wszystkie wydane tego samego dnia i wszystkie dostępne na otwartej platformie StepFun jako komercyjne API. Obsługuje natywną rozmowę pełnodupleksową, rozumuje bezpośrednio na mowie, zamiast najpierw ją transkrybować, oraz obsługuje wywoływanie narzędzi i asynchroniczne wykonywanie długich zadań, gdy rozmowa trwa. Jest nastawiony przede wszystkim na język chiński. Nie jest modelem z otwartymi wagami, a obecnie obowiązuje dla niego ograniczony czasowo bezpłatny cennik wersji zapoznawczej, bez ogłoszonej stawki po zakończeniu okresu zapoznawczego.
Na jednym z nich możesz coś zbudować. Drugie możesz odwiedzić.
Mierzalna rzecz, z której słynie Sesame
Conversational Dynamics to konkretny benchmark i warto wiedzieć, co obejmuje. Ocenia naprzemienność mówienia, radzenie sobie z pauzami, odzyskiwanie po przerwaniu oraz to, czy model prawidłowo odczytuje krótki backchannel — „uh-huh”, „right”, „mm” — jako zachętę, a nie jako próbę przejęcia głosu w rozmowie. To dokładnie te zachowania, które opisują słuchacze, gdy mówią, że głos brzmi ludzko, a nie robotycznie, i to one sprawiają, że z asystentem rozmawia się przyjemnie, a nie tylko że jest dokładny.
StepAudio 3 Realtime prowadzi w tym zestawieniu z wynikiem 98,9%, przed Qwen Audio 3.0 Realtime Plus z 98,4% i GPT-Realtime-2 z 95,3%. Zajmuje również pierwsze miejsce w Speech Reasoning z wynikiem 99,7%, jak podaje StepFun, za czym kryje się twierdzenie architektoniczne, że wnioskowanie na surowym dźwięku zachowuje ton i nacisk, które pośredni etap transkrypcji by spłaszczył — różnica między usłyszeniem sarkazmu a usłyszeniem komplementu.
Oto uczciwe ujęcie tego wyniku. Benchmark jest tym, co branża ma najbliższego pomiarowi tego, za co chwali się Sesame, a Sesame nie zostało do niego zgłoszone. To nie jest dowód, że StepAudio 3 Realtime brzmi lepiej niż Sesame. To dowód, że jedno z tych twierdzeń można sprawdzić, a drugiego — jak dotąd — nie, i że to, które można sprawdzić, należy obecnie do modelu, z którym większość ludzi nigdy nie rozmawiała.

Asymetria dostępności, która jest prawdziwą decyzją
Wszystko powyższe jest interesujące. Ta część jest decydująca.
Głos Sesame — ten, którym ludzie się zachwycają — to większy, zamknięty model produkcyjny, którego Sesame nigdy nie udostępniło jako API. Nie można go kupić, licencjonować ani wywoływać z własnego produktu. Jeśli przeczytałeś, że timing konwersacyjny Sesame jest najlepszy dostępny, i wyciągnąłeś wniosek, że możesz go mieć, ten wniosek nie wynika z dowodów.
To, co Sesame faktycznie udostępniło jako open source, to CSM-1B, wydany na licencji Apache-2.0. To blok syntezy, a nie asystent: szkielet Llama przewiduje pierwszą książkę kodową Mimi, a mniejszy dekoder Llama przewiduje resztę, którą kodek Mimi renderuje do przebiegu fali dźwiękowej o częstotliwości 24 kHz. Model jest wyłącznie angielskojęzyczny, klonuje głos na podstawie 10–15-sekundowego klipu referencyjnego i w ogóle nie potrafi generować tekstu — łączy się go z osobnym modelem językowym. Osoby, które uruchomiły oba, opisują głos CSM-1B jako wyraźnie słabszy niż w aplikacji Preview, a karta modelu mówi wprost to, co zwykle się przemilcza: dostrojony wariant CSM napędza interaktywne demo, a ten wariant nie jest checkpointem, który można pobrać.
StepAudio 3 Realtime nie ma żadnej z tej niejednoznaczności. To komercyjne API, za którym stoi opublikowana rodzina modeli, zadeklarowany zestaw możliwości oraz pozycje w rankingach podmiotów trzecich, które można sprawdzić. Jest też przede wszystkim chińskojęzyczny, w cenie wersji zapoznawczej, i odnotowuje czas do pierwszego dźwięku wynoszący 8,83 sekundy na tym samym rankingu, w którym zwycięża w dynamice konwersacyjnej — w zestawieniu z 1,18 sekundy dla Gemini 3.8 Live i od 1,24 do 1,34 sekundy dla GPT-Live-1. Cokolwiek oferuje w zakresie jakości konwersacyjnej, nie wykazało jeszcze, że potrafi dostarczać ją z prędkością konwersacyjną poza własnym środowiskiem serwowania StepFun.

Co z tym zrobić, jeśli wybierasz stack głosowy
Zacznij od rozdzielenia obu pytań. „Jakie wrażenie powinna sprawiać rozmowa?” i „co mogę wypuścić?” mają różne odpowiedzi, a tylko jedno z nich jest decyzją zakupową.
Jeśli kalibrujesz wyczucie — decydujesz, ile ciepła powinien mieć Twój produkt, ile ciszy jest komfortowe, jak szybko agent powinien oddać głos — Sesame Preview jest darmowy, naprawdę znakomity i to dobry sposób, by spędzić popołudnie. Traktuj go jako punkt odniesienia. Nie planuj wokół niego integracji, bo nie ma się z czym integrować.
Jeśli wdrażasz do produkcji, StepAudio 3 Realtime jest prawdziwym kandydatem z prawdziwymi zastrzeżeniami: ceny w wersji zapoznawczej, obsługa nastawiona przede wszystkim na język chiński, brak wyniku w indeksie Artificial Analysis i nierozstrzygnięta kwestia opóźnienia. Przetestuj opóźnienie przed jakością rozmowy. Model, który wygrywa benchmark naprzemiennego zabierania głosu, ale rozpoczęcie mówienia zajmuje mu większość czasu potrzebnego na wypowiedzenie zdania, to model, którego najlepszej jakości możesz nigdy nie mieć okazji zaprezentować.
A jeśli produkcyjny głos Sesame kiedykolwiek doczeka się API, całe to porównanie zostanie przeprowadzone ponownie — ponieważ benchmark, który by to rozstrzygnął, już istnieje, a Sesame w końcu musiałby się w nim pojawić.
Gdzie routing pasuje, a gdzie nie
Agenci głosowi to nie jeden model. Niezależnie od tego, czy używasz StepAudio 3 Realtime, czy czegokolwiek innego, rozmowa nieustannie zleca pracę zwykłym modelom tekstowym — wyszukiwanie, ekstrakcję, wywołanie rozumowania uruchamiane w tle podczas wstrzymanej pauzy. To właśnie w tej warstwie delegowania tkwi zmienność kosztów i to tam zła godzina jednego dostawcy staje się twoją awarią.
Aby być precyzyjnym co do naszego własnego zakresu: punkty końcowe live i voice w rodzinie StepAudio 3 nie znajdują się w OrcaRouter, podobnie jak nic, co zbudowało Sesame. Tym, co znajduje się w OrcaRouter, jest warstwa tekstowa, do której deleguje agent głosowy — prawie 200 modeli za jednym API, automatyczne przełączanie awaryjne, DSL routingu, który komponuje kilka w jedno wywołanie, a także fuzja modeli, gdy osąd pojedynczego modelu nie wystarcza, z ceną katalogową dostawcy przekazywaną bez marży.
Ten podział sprawia, że kwestia dostępności jest mniej katastrofalna, niż się wydaje. Model głosowy to decyzja, do której możesz wrócić; warstwa delegowania to ta, której rozplątanie staje się kosztowne, i to ją warto umieścić za routerem, zanim zwiążesz się z jakimkolwiek dostawcą technologii głosowej.

Werdykt
Sesame Preview wygrywa w tym, czego nie da się zmierzyć, a przegrywa we wszystkim, co można kupić. To najlepiej brzmiący dostępny głos, jest darmowy, a nie można go wdrożyć do produkcji — a teraz, gdy strona trzecia ocenia jakość, z której słynie, jego brak na tej tablicy wyników jest luką w dowodach, a nie chronioną przewagą.
StepAudio 3 Realtime wygrywa pod względem dostępności, mierzalności i możliwości, ale niesie ze sobą prawdziwe otwarte pytania dotyczące ceny, pokrycia językowego i opóźnienia. To jedyny z tych dwóch, na którym możesz dziś budować, co rozstrzyga praktyczną kwestię szybciej niż jakikolwiek benchmark.
To, na co warto patrzeć, jest proste i działa w obie strony: wynik Conversational Dynamics dla produkcyjnego głosu Sesame albo wartość opóźnienia dla StepAudio 3 Realtime, która plasuje go w tym samym zakresie co modele, które obecnie przewyższa pod względem jakości. Każdy z tych elementów zamieniłby to z porównania pomiaru z reputacją w prawdziwe starcie bezpośrednie.
