
GPT-Live-1 против Sesame Preview: лучший голос в этом сравнении — тот, который нельзя купить
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг

Спросите любого, кто пользовался и тем, и другим, и разрыв в оценках будет огромным: Sesame Preview — самый убедительный голосовой ассистент, с которым большинству людей доводилось разговаривать. Это ещё и тот, на основе которого нельзя ничего строить. GPT-Live-1 и Sesame Preview постоянно сравнивают — оба умеют вести беседу, оба справляются с перебиваниями, оба звучат как человек, а не как телефонное меню, — но предлагаются они противоположными способами. GPT-Live-1 — это хостируемая модель, которую можно арендовать поминутно; с 10 сентября 2026 года её можно вызывать публично. Sesame Preview — бесплатное потребительское приложение, в котором вообще нет API, а голос, который впечатляет людей, работает на продакшен-модели, которая никогда не выпускалась.
Что каждый из них на самом деле из себя представляет
• GPT-Live-1 — полнодуплексная голосовая модель OpenAI, доступна в ChatGPT с 8 июля 2026 года, а в API — с 10 сентября по цене $0.05 за минуту голоса. Двенадцать голосов в API, без клонирования, без ввода изображений или видео; расшифровки и текст ответов возвращаются в каждой сессии.
• Sesame Preview — потребительский голосовой ассистент Sesame. Бесплатно на iOS с мая 2026 года, широко доступен на Android с начала августа 2026 года, а также веб-превью с приоритетом голоса. Четыре агента — Maya, Miles, Simone и Charlie — только на английском, с лимитом длительности звонка 30 минут, который сокращается до 5 минут, если вы не вошли в систему.
• CSM-1B — открытая часть Sesame: разговорная речевая модель на 1 млрд параметров, выпущенная под лицензией Apache 2.0 23 апреля 2026 года, построенная на основе архитектуры Llama с отдельным декодером и кодеком Mimi от Kyutai, генерирующая английскую монофоническую речь с частотой 24 кГц на основе контекста примерно в 4K токенов.
Три строки выше — это вся суть решения. Одна компания продаёт модель с поминутной оплатой. Другая бесплатно отдаёт приложение и открывает исходный код меньшей модели, которая не та, что используется в приложении.
Разрыв между демо и загрузкой
Sesame проявила необычную прямоту в этом вопросе, и это самый важный факт для любого, кто оценивает эту пару. Голос в приложении Preview — тот, что стал источником вирусных клипов и отзывов о «лучшем в классе голосовом режиме», — представляет собой более крупную закрытую продакшн-модель. CSM-1B — это открытый чекпойнт с 1 млрд параметров из той же лаборатории, и, по оценке людей, запускавших обе модели, голос у него заметно слабее. Сессии в Preview также ограничены по количеству и доступны только на английском, а выполнения задач нет: агенты разговаривают, но ничего не бронируют, не покупают и не оформляют.
Это оставляет разработчикам реальное, но более узкое предложение: самостоятельно размещаемый разговорный речевой чекпойнт без лицензионной платы, размещённый у одного стороннего провайдера инференса по цене $7 за миллион символов — примерно $0,35 за час синтезированного аудио — или бесплатно на вашем собственном оборудовании. Никто не опубликовал независимый бенчмарк ни для голоса Preview, ни для CSM-1B, поэтому любое заявление о качестве в любую сторону — это впечатление от прослушивания, а не измерение. Sesame также не опубликовала ни публичных цен, ни корпоративного тарифа, ни плана монетизации; заявленное направление компании — исследовательские партнёрства и запланированный аппаратный продукт.

Что можно получить за $0.05 в минуту, чего нельзя получить бесплатно
Аргумент GPT-Live-1 для разработчика не в том, что он звучит лучше, — потому что этот довод невозможно выиграть против закрытой модели, которую никто не может измерить. Он в том, что эту штуку можно вызывать и у неё есть цена. Конкретно, что вы получаете за крутящийся счётчик:
• Сеанс, которым вы управляете, — один ID модели, один эндпоинт Live Sessions, опубликованный пример интеграции, работающий через WebRTC, и сеанс, который вы настраиваете с помощью инструкций, голосов и блока делегирования.
• Обработка прерываний как документированное поведение — 80,1% интерактивности на Full Duplex Bench v1.5 против 45,4% у GPT-Realtime-2.1, при задержке смены реплик 0,798 секунды и 87% успешных вызовов инструментов. Все три — собственные цифры OpenAI, опубликованные вместе с релизом и никем не воспроизведённые на момент написания.
• Бэкенд рассуждений, который выбираете вы, — голосовой слой передаёт тяжёлую работу через асинхронную границу отдельной модели, указанной в конфигурации сессии, а та продолжает работать, пока разговор идёт. В примере из документации OpenAI этим бэкендом служит GPT-5.6 Terra; на июльском потребительском запуске это был GPT-5.5.
Транскрипты, текст ответа и тарификация в стиле телефонии — 3,00 $ за час непрерывно открытой линии, с посекундной тарификацией, при этом 15 секунд инициализации сеанса засчитываются, а не добавляются.
Sesame даёт вам лучший разговор и ничего из этого. Если вы создаёте продукт, «лучший разговор, никакого API, никакой цены, никакого бенчмарка, только английский, ограничение в 30 минут» — это не сравнение, а лист ожидания.
Теперь у GPT-Live-1 есть показатель, которого не существовало на момент его потребительского запуска, и это честный противовес всему вышесказанному. Индекс Speech to Speech от Artificial Analysis оценивает GPT-Live-1 в 69,8% — седьмое место из одиннадцати моделей, позади GPT-Realtime-2.1 с 73,9% и позади Grok Voice Think Fast 2.0 с 79,0%. Так что модель, которую можно купить, тоже не лучшая в независимом рейтинге. А то, что рейтинг не может измерить, — это именно то, в чём Sesame на самом деле выигрывает: ни одну из одиннадцати моделей в этом индексе не оценивали по тому, каково с ней разговаривать, а у голоса Sesame Preview нигде нет ни одной строки.

Та часть стека, которая не принадлежит ни одной из компаний
Вот где оба варианта сходятся, и где решение перестаёт быть бинарным. Ни Sesame Preview, ни GPT-Live-1 не являются полноценными агентами. Агенты Sesame не выполняют задачи; GPT-Live-1 явно делегирует всё, что требует рассуждений, поиска или инструмента, бэкенд-модели. В обеих архитектурах интересная работа происходит за голосом, в обычном вызове текстовой модели, и этот слой переносим так, как голосовой слой — нет: можно сменить бэкенд, не перезаписывая ни единого промпта для речевой модели.
Этот бэкенд — ещё и то место, где OrcaRouter полезен, и стоит чётко обозначить, что мы маршрутизируем, а что — нет. Мы не маршрутизируем GPT-Live-1: эндпоинт Live Sessions принадлежит OpenAI, а голосовой слой там недосягаем. Мы не маршрутизируем и продакшен-модель Sesame по более простой причине: её никогда не предлагали в виде API. А маршрутизируем мы тот слой, которому оба продукта передают работу. Примерно 190 моделей от одиннадцати апстрим-провайдеров работают через один ключ по прайс-листовой цене провайдера, без наценки, с автоматическим переключением при сбое между провайдерами и DSL маршрутизации, позволяющим объединять несколько моделей в один вызов. Для команды, строящей продукт на непроверенном голосовом фронтенде, именно это и есть та страховка, которая важна: речевой слой можно заменить или потерять, не потянув за собой слой рассуждений, а модель, на которую вы поставили в марте, можно заменить в июне, отредактировав одну строку.
Что посмотреть
Три вещи изменили бы это сравнение, и ни одна из них пока не в чьих-либо руках. API Sesame — даже платный — мгновенно превратил бы сильнейший голос в категории в вариант, на основе которого можно строить, и поставил бы реальную цену рядом с $0.05 у GPT-Live-1. Опубликованный бенчмарк голоса Preview превратил бы впечатление от прослушивания в число, а независимые оценки обычно не щадят голоса, которые соревновались только в демо. А первое воспроизведение сторонними исследователями показателей интерактивности и задержки OpenAI решило бы, представляет ли полнодуплексный режим реальный разрыв в возможностях или же это удачно выбранная оценка.
А до тех пор честный расклад таков. Если вы выбираете голос для себя, используйте Sesame Preview — он бесплатный, он лучше, и вам ничего не стоит предпочесть его. Если вы выбираете голос для продукта, который нужно выпускать, продавать и поддерживать, GPT-Live-1 — единственный из двух, который вы действительно можете купить, и то, что звучит он не лучше, — это плата за вход.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
