Сгенерированная карточка главного заголовка для StepAudio 3 Realtime vs Sesame Preview с надзаголовком «OrcaRouter · радар моделей — лицом к лицу», заголовком «StepAudio 3 Realtime vs Sesame Preview» и подзаголовком «Голос, который все хвалят, против того, у которого есть балл в таблице лидеров», над двумя скруглёнными карточками моделей по обе стороны от знака VS.
Guides & Insights

StepAudio 3 Realtime vs Sesame Preview: Голос, который все хвалят, против того, у которого есть оценка

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

На протяжении большей части 2026 года самым сильным утверждением, которое кто-либо мог сделать о голосовом ИИ, было впечатление от прослушивания. Ассистент Sesame звучал более по-человечески, чем что-либо другое, и это говорило достаточно людей, чтобы он стал точкой отсчёта — без бенчмарка, без числа и без возможности проверить. 15 сентября 2026 года StepAudio 3 Realtime появился от StepFun с числом, привязанным к ближайшей измеримой версии этого качества: 98,9% в оценке Conversational Dynamics от Artificial Analysis, первое место. Sesame Preview не входит в этот рейтинг.

Самое интересное не в том, что один превзошёл другого. А в том, что качество, которым прославился Sesame, теперь оценивает третья сторона, а модель с репутацией никогда не измерялась по этому показателю.

Что каждое из них представляет собой на самом деле

Они не относятся к одному и тому же типу объектов, и это определяет в сравнении больше, чем любая оценка.

Sesame Preview — потребительский голосовой ассистент. Бесплатный на iOS с мая 2026 года и широко доступный на Android с начала августа 2026 года, он построен вокруг четырёх именованных агентов — Maya, Miles, Simone и Charlie, — которые сохраняют контекст между сессиями, ищут в интернете и ставят напоминания. Работает только на английском языке. Звонки ограничены 30 минутами, а если вы не авторизованы, лимит снижается до пяти минут. Для его голоса в продакшене нет API, нет корпоративного тарифа и нет публичных цен.

StepAudio 3 Realtime — это интерфейс для разработчиков. Это одна из пяти моделей семейства StepAudio 3, все они выпущены в один день и все доступны на открытой платформе StepFun в качестве коммерческих API. Она поддерживает нативный полнодуплексный диалог, выполняет рассуждения непосредственно по речи, а не сначала транскрибирует её, а также поддерживает вызов инструментов и асинхронное выполнение длительных задач, пока разговор продолжается. Она ориентирована прежде всего на китайский язык. Её веса не открыты, и сейчас действует ограниченное по времени бесплатное превью-ценообразование, при этом тариф после окончания превью не объявлен.

На одном из них можно строить. Другой можно посетить.

Измеримая вещь, которой знаменит Sesame

Conversational Dynamics — это конкретный бенчмарк, и стоит знать, что он в себя включает. Он оценивает смену реплик, обработку пауз, восстановление после перебивания и то, правильно ли модель интерпретирует краткий поддакивающий сигнал — «угу», «ага», «мм» — как поощрение, а не как попытку завладеть разговором. Именно эти модели поведения описывают слушатели, когда говорят, что голос кажется человеческим, а не роботизированным, и именно эти модели поведения делают ассистента приятным в общении, а не просто точным.

StepAudio 3 Realtime возглавляет этот рейтинг с 98,9%, опережая Qwen Audio 3.0 Realtime Plus с 98,4% и GPT-Realtime-2 с 95,3%. Он также занимает первое место по Speech Reasoning с 99,7%, согласно данным StepFun; за этим стоит архитектурное утверждение, что рассуждение непосредственно над необработанным аудио сохраняет тон и акценты, которые сгладил бы промежуточный этап транскрипции — разница между тем, чтобы расслышать сарказм, и тем, чтобы расслышать комплимент.

Вот честная формулировка этого результата. Бенчмарк — это самое близкое, что есть у индустрии к измерению того, за что хвалят Sesame, а Sesame в него не заявляли. Это не доказательство того, что StepAudio 3 Realtime звучит лучше, чем Sesame. Это доказательство того, что одно из этих утверждений поддаётся проверке, а другое — пока нет, и что проверяемое сейчас принадлежит модели, с которой большинство людей никогда не общались.

Screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the AA-Speech to Speech Index bar chart and the speed and cost-per-hour charts for the voice models StepAudio 3 Realtime is measured against.

Асимметрия доступности, которая и есть настоящее решение

Всё вышесказанное интересно. Эта часть имеет решающее значение.

Голос Sesame — тот, которым все восхищаются, — это более крупная закрытая продакшн-модель, которую Sesame никогда не выпускала в виде API. Вы не можете её купить, лицензировать или вызывать из собственного продукта. Если вы прочитали, что разговорные тайминги Sesame — лучшие из доступных, и сделали вывод, что сможете получить их у себя, этот вывод не следует из доказательств.

На самом деле Sesame открыла исходный код CSM-1B, выпущенной под лицензией Apache-2.0. Это блок синтеза, а не ассистент: базовая модель Llama предсказывает первую кодовую книгу Mimi, а меньший декодер Llama предсказывает остальные, которые кодек Mimi преобразует в звуковую волну с частотой 24 кГц. Она работает только с английским, клонирует голос по 10–15-секундному эталонному клипу и вообще не умеет генерировать текст — её используют в паре с отдельной языковой моделью. Люди, запускавшие обе, описывают голос CSM-1B как заметно слабее, чем у приложения Preview, а в карточке модели прямо сказано то, о чём обычно молчат: интерактивное демо работает на дообученном варианте CSM, и этот вариант — не тот чекпоинт, который можно скачать.

StepAudio 3 Realtime лишён всей этой неоднозначности. Это коммерческий API, за которым стоит опубликованное семейство моделей, заявленный набор возможностей и сторонние размещения, которые можно проверить. Он также ориентирован в первую очередь на Китай, предлагается по цене preview и показывает время до первого аудио 8,83 секунды в том же рейтинге, где побеждает по разговорной динамике, — против 1,18 секунды у Gemini 3.8 Live и от 1,24 до 1,34 секунды у GPT-Live-1. Каким бы ни было его качество разговора, он пока не продемонстрировал, что способен обеспечить его на разговорной скорости вне собственной инфраструктуры обслуживания StepFun.

Screenshot of the Sesame CSM-1B model card on Hugging Face showing the Apache-2.0 licence tag alongside English and text-to-speech tags, 2.45k likes and 1.65k followers, release notes for the 1B CSM variant, a description of the Llama backbone and smaller Mimi audio-code decoder, and a line stating that a fine-tuned variant of CSM powers the interactive voice demo shown in the blog post.

Что делать с этим, если вы выбираете голосовой стек

Начните с разделения двух вопросов. «Какие ощущения должен вызывать разговор?» и «что я могу выпустить?» имеют разные ответы, и только один из них — решение о закупке.

Если вы калибруете вкус — решаете, сколько теплоты должно быть в вашем продукте, сколько тишины комфортно, как быстро агент должен уступать слово, — Sesame Preview бесплатен, по-настоящему превосходен и хорошее место, чтобы провести полдня. Используйте его как точку отсчёта. Не планируйте интеграцию на его основе, потому что интегрировать не с чем.

Если вы готовите релиз, StepAudio 3 Realtime — реальный кандидат с реальными оговорками: цены на этапе превью, охват с приоритетом китайского языка, отсутствие оценки в индексе Artificial Analysis и нерешённый вопрос задержки. Сначала проверьте задержку, а уже потом качество разговора. Модель, которая побеждает в бенчмарке на чередование реплик, но тратит на начало речи почти столько времени, сколько занимает большая часть предложения, — это модель, лучшее качество которой вы, возможно, так и не сможете продемонстрировать.

И если у продакшен-голоса Sesame когда-нибудь появится API, всё это сравнение придётся провести заново — потому что бенчмарк, который мог бы расставить точки над i, уже существует, и Sesame наконец придётся в нём появиться.

Где маршрутизация уместна, а где — нет

Голосовые агенты — это не одна модель. Работаете ли вы со StepAudio 3 Realtime или с чем-то другим, разговор постоянно передаёт работу обычным текстовым моделям — поиск, извлечение, вызов рассуждения, выполняемый за удержанной паузой. Именно на этом слое делегирования и живёт разброс затрат, и именно здесь неудачный час у одного провайдера становится вашим простоем.

Чтобы быть точными насчёт нашего собственного покрытия: live- и voice-эндпоинты семейства StepAudio 3 на OrcaRouter отсутствуют, как и всё, что создала Sesame. А что есть на OrcaRouter — так это текстовый слой, которому делегирует голосовой агент: почти 200 моделей за одним API, автоматический фейловер, DSL маршрутизации, объединяющий несколько моделей в один вызов, и слияние моделей, когда суждения одной модели недостаточно, при этом прайс-листовая цена провайдера передаётся без наценки.

Именно это разделение делает вопрос доступности менее фатальным, чем кажется. Голосовую модель можно пересмотреть позже; а вот слой делегирования — это то, что дорого распутывать, и именно его стоит поместить за маршрутизатор, прежде чем вы свяжете себя с каким-либо поставщиком голосовых решений.

A generated scoreboard titled 'StepAudio 3 Realtime vs Sesame Preview'. The StepAudio column reads Conv. Dynamics '98.9%, first place', Callable API 'yes, commercial', Languages 'Chinese-first', Session cap 'not published', Tool execution 'tool calls, async tasks', Open artifact 'none, closed'. The Sesame column reads Conv. Dynamics 'no score published', Callable API 'no API for its voice', Languages 'English only', Session cap '30 min, 5 logged out', Tool execution 'reminders, web search only', Open artifact 'CSM-1B, Apache-2.0'. Footer: 'StepAudio 3 figures vendor-cited; Sesame naturalness is a listening impression, not a benchmark.'

Вердикт

Sesame Preview выигрывает в том, что нельзя измерить, и проигрывает во всём, что можно купить. Это лучший по звучанию доступный голос, он бесплатен, и его нельзя запустить в продакшене — а теперь, когда третья сторона оценивает качество, которым он знаменит, его отсутствие в этой таблице оценок — это пробел в доказательствах, а не защищённое лидерство.

StepAudio 3 Realtime выигрывает по доступности, измеримости и возможностям и оставляет реальные открытые вопросы по цене, языковому покрытию и задержке. Это единственный из двух, на котором можно строить уже сегодня, что решает практический вопрос быстрее любого бенчмарка.

За чем следить — просто, и это работает в обе стороны: оценка Conversational Dynamics для продакшн-голоса Sesame или показатель задержки для StepAudio 3 Realtime, который ставит его в тот же диапазон, что и модели, которые он сейчас превосходит по качеству. Любой из этих показателей превратил бы это из сравнения измерения с репутацией в настоящее очное противостояние.