
StepAudio 3 Realtime vs Sesame Preview: Голос, который все хвалят, против того, у которого есть оценка
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
На протяжении большей части 2026 года самым сильным утверждением, которое кто-либо мог сделать о голосовом ИИ, было впечатление от прослушивания. Ассистент Sesame звучал более по-человечески, чем что-либо другое, и это говорило достаточно людей, чтобы он стал точкой отсчёта — без бенчмарка, без числа и без возможности проверить. 15 сентября 2026 года StepAudio 3 Realtime появился от StepFun с числом, привязанным к ближайшей измеримой версии этого качества: 98,9% в оценке Conversational Dynamics от Artificial Analysis, первое место. Sesame Preview не входит в этот рейтинг.
Самое интересное не в том, что один превзошёл другого. А в том, что качество, которым прославился Sesame, теперь оценивает третья сторона, а модель с репутацией никогда не измерялась по этому показателю.
Что каждое из них представляет собой на самом деле
Они не относятся к одному и тому же типу объектов, и это определяет в сравнении больше, чем любая оценка.
Sesame Preview — потребительский голосовой ассистент. Бесплатный на iOS с мая 2026 года и широко доступный на Android с начала августа 2026 года, он построен вокруг четырёх именованных агентов — Maya, Miles, Simone и Charlie, — которые сохраняют контекст между сессиями, ищут в интернете и ставят напоминания. Работает только на английском языке. Звонки ограничены 30 минутами, а если вы не авторизованы, лимит снижается до пяти минут. Для его голоса в продакшене нет API, нет корпоративного тарифа и нет публичных цен.
StepAudio 3 Realtime — это интерфейс для разработчиков. Это одна из пяти моделей семейства StepAudio 3, все они выпущены в один день и все доступны на открытой платформе StepFun в качестве коммерческих API. Она поддерживает нативный полнодуплексный диалог, выполняет рассуждения непосредственно по речи, а не сначала транскрибирует её, а также поддерживает вызов инструментов и асинхронное выполнение длительных задач, пока разговор продолжается. Она ориентирована прежде всего на китайский язык. Её веса не открыты, и сейчас действует ограниченное по времени бесплатное превью-ценообразование, при этом тариф после окончания превью не объявлен.
На одном из них можно строить. Другой можно посетить.
Измеримая вещь, которой знаменит Sesame
Conversational Dynamics — это конкретный бенчмарк, и стоит знать, что он в себя включает. Он оценивает смену реплик, обработку пауз, восстановление после перебивания и то, правильно ли модель интерпретирует краткий поддакивающий сигнал — «угу», «ага», «мм» — как поощрение, а не как попытку завладеть разговором. Именно эти модели поведения описывают слушатели, когда говорят, что голос кажется человеческим, а не роботизированным, и именно эти модели поведения делают ассистента приятным в общении, а не просто точным.
StepAudio 3 Realtime возглавляет этот рейтинг с 98,9%, опережая Qwen Audio 3.0 Realtime Plus с 98,4% и GPT-Realtime-2 с 95,3%. Он также занимает первое место по Speech Reasoning с 99,7%, согласно данным StepFun; за этим стоит архитектурное утверждение, что рассуждение непосредственно над необработанным аудио сохраняет тон и акценты, которые сгладил бы промежуточный этап транскрипции — разница между тем, чтобы расслышать сарказм, и тем, чтобы расслышать комплимент.
Вот честная формулировка этого результата. Бенчмарк — это самое близкое, что есть у индустрии к измерению того, за что хвалят Sesame, а Sesame в него не заявляли. Это не доказательство того, что StepAudio 3 Realtime звучит лучше, чем Sesame. Это доказательство того, что одно из этих утверждений поддаётся проверке, а другое — пока нет, и что проверяемое сейчас принадлежит модели, с которой большинство людей никогда не общались.

Асимметрия доступности, которая и есть настоящее решение
Всё вышесказанное интересно. Эта часть имеет решающее значение.
Голос Sesame — тот, которым все восхищаются, — это более крупная закрытая продакшн-модель, которую Sesame никогда не выпускала в виде API. Вы не можете её купить, лицензировать или вызывать из собственного продукта. Если вы прочитали, что разговорные тайминги Sesame — лучшие из доступных, и сделали вывод, что сможете получить их у себя, этот вывод не следует из доказательств.
На самом деле Sesame открыла исходный код CSM-1B, выпущенной под лицензией Apache-2.0. Это блок синтеза, а не ассистент: базовая модель Llama предсказывает первую кодовую книгу Mimi, а меньший декодер Llama предсказывает остальные, которые кодек Mimi преобразует в звуковую волну с частотой 24 кГц. Она работает только с английским, клонирует голос по 10–15-секундному эталонному клипу и вообще не умеет генерировать текст — её используют в паре с отдельной языковой моделью. Люди, запускавшие обе, описывают голос CSM-1B как заметно слабее, чем у приложения Preview, а в карточке модели прямо сказано то, о чём обычно молчат: интерактивное демо работает на дообученном варианте CSM, и этот вариант — не тот чекпоинт, который можно скачать.
StepAudio 3 Realtime лишён всей этой неоднозначности. Это коммерческий API, за которым стоит опубликованное семейство моделей, заявленный набор возможностей и сторонние размещения, которые можно проверить. Он также ориентирован в первую очередь на Китай, предлагается по цене preview и показывает время до первого аудио 8,83 секунды в том же рейтинге, где побеждает по разговорной динамике, — против 1,18 секунды у Gemini 3.8 Live и от 1,24 до 1,34 секунды у GPT-Live-1. Каким бы ни было его качество разговора, он пока не продемонстрировал, что способен обеспечить его на разговорной скорости вне собственной инфраструктуры обслуживания StepFun.

Что делать с этим, если вы выбираете голосовой стек
Начните с разделения двух вопросов. «Какие ощущения должен вызывать разговор?» и «что я могу выпустить?» имеют разные ответы, и только один из них — решение о закупке.
Если вы калибруете вкус — решаете, сколько теплоты должно быть в вашем продукте, сколько тишины комфортно, как быстро агент должен уступать слово, — Sesame Preview бесплатен, по-настоящему превосходен и хорошее место, чтобы провести полдня. Используйте его как точку отсчёта. Не планируйте интеграцию на его основе, потому что интегрировать не с чем.
Если вы готовите релиз, StepAudio 3 Realtime — реальный кандидат с реальными оговорками: цены на этапе превью, охват с приоритетом китайского языка, отсутствие оценки в индексе Artificial Analysis и нерешённый вопрос задержки. Сначала проверьте задержку, а уже потом качество разговора. Модель, которая побеждает в бенчмарке на чередование реплик, но тратит на начало речи почти столько времени, сколько занимает большая часть предложения, — это модель, лучшее качество которой вы, возможно, так и не сможете продемонстрировать.
И если у продакшен-голоса Sesame когда-нибудь появится API, всё это сравнение придётся провести заново — потому что бенчмарк, который мог бы расставить точки над i, уже существует, и Sesame наконец придётся в нём появиться.
Где маршрутизация уместна, а где — нет
Голосовые агенты — это не одна модель. Работаете ли вы со StepAudio 3 Realtime или с чем-то другим, разговор постоянно передаёт работу обычным текстовым моделям — поиск, извлечение, вызов рассуждения, выполняемый за удержанной паузой. Именно на этом слое делегирования и живёт разброс затрат, и именно здесь неудачный час у одного провайдера становится вашим простоем.
Чтобы быть точными насчёт нашего собственного покрытия: live- и voice-эндпоинты семейства StepAudio 3 на OrcaRouter отсутствуют, как и всё, что создала Sesame. А что есть на OrcaRouter — так это текстовый слой, которому делегирует голосовой агент: почти 200 моделей за одним API, автоматический фейловер, DSL маршрутизации, объединяющий несколько моделей в один вызов, и слияние моделей, когда суждения одной модели недостаточно, при этом прайс-листовая цена провайдера передаётся без наценки.
Именно это разделение делает вопрос доступности менее фатальным, чем кажется. Голосовую модель можно пересмотреть позже; а вот слой делегирования — это то, что дорого распутывать, и именно его стоит поместить за маршрутизатор, прежде чем вы свяжете себя с каким-либо поставщиком голосовых решений.

Вердикт
Sesame Preview выигрывает в том, что нельзя измерить, и проигрывает во всём, что можно купить. Это лучший по звучанию доступный голос, он бесплатен, и его нельзя запустить в продакшене — а теперь, когда третья сторона оценивает качество, которым он знаменит, его отсутствие в этой таблице оценок — это пробел в доказательствах, а не защищённое лидерство.
StepAudio 3 Realtime выигрывает по доступности, измеримости и возможностям и оставляет реальные открытые вопросы по цене, языковому покрытию и задержке. Это единственный из двух, на котором можно строить уже сегодня, что решает практический вопрос быстрее любого бенчмарка.
За чем следить — просто, и это работает в обе стороны: оценка Conversational Dynamics для продакшн-голоса Sesame или показатель задержки для StepAudio 3 Realtime, который ставит его в тот же диапазон, что и модели, которые он сейчас превосходит по качеству. Любой из этих показателей превратил бы это из сравнения измерения с репутацией в настоящее очное противостояние.
