Hero-титульная карточка для «GPT-Live-1 vs Sesame Preview», с подзаголовком «Лучший голос здесь — тот, у которого нет API», с бейджем «Один — бесплатный и закрытый, другой — платный и доступный для вызова» и тремя карточками: «Sesame Preview — бесплатное приложение, без API, продакшен-голос не выпущен», «GPT-Live-1 — $0.05 за минуту голоса, публичный API с 10 сентября 2026 года» и «Собираемая часть Sesame — CSM-1B, Apache-2.0, 1 млрд параметров, $7 за 1 млн символов или собственный хостинг», над нижней полосой с надписью «У продакшен-голоса Sesame нет опубликованного бенчмарка; голосовые показатели GPT-Live-1 — по данным OpenAI». Логотип OrcaRouter вкомпонован в правом нижнем углу.
Guides & Insights

GPT-Live-1 против Sesame Preview: лучший голос в этом сравнении — тот, который нельзя купить

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям
A two-column scoreboard titled 'GPT-Live-1 vs Sesame Preview - the scoreboard'. Left column GPT-Live-1: 'Access: public API since September 10, 2026', 'Price: $0.05 per voice minute', 'Voices: 12 API voices, no cloning', 'Duplex: full duplex, barge-in native', 'Weights: closed', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Sesame Preview: 'Access: free consumer app, no API', 'Price: $0 to the user, no paid tier', 'Voices: four agents, one production voice', 'Duplex: conversational, interruptible', 'Weights: CSM-1B open, production model closed', 'Independent score: none, no public benchmark of the Preview voice'. Footer: 'The Sesame Preview production voice is unreleased; CSM-1B is a separate, smaller open checkpoint.'

Спросите любого, кто пользовался и тем, и другим, и разрыв в оценках будет огромным: Sesame Preview — самый убедительный голосовой ассистент, с которым большинству людей доводилось разговаривать. Это ещё и тот, на основе которого нельзя ничего строить. GPT-Live-1 и Sesame Preview постоянно сравнивают — оба умеют вести беседу, оба справляются с перебиваниями, оба звучат как человек, а не как телефонное меню, — но предлагаются они противоположными способами. GPT-Live-1 — это хостируемая модель, которую можно арендовать поминутно; с 10 сентября 2026 года её можно вызывать публично. Sesame Preview — бесплатное потребительское приложение, в котором вообще нет API, а голос, который впечатляет людей, работает на продакшен-модели, которая никогда не выпускалась.

Что каждый из них на самом деле из себя представляет

• GPT-Live-1 — полнодуплексная голосовая модель OpenAI, доступна в ChatGPT с 8 июля 2026 года, а в API — с 10 сентября по цене $0.05 за минуту голоса. Двенадцать голосов в API, без клонирования, без ввода изображений или видео; расшифровки и текст ответов возвращаются в каждой сессии.

• Sesame Preview — потребительский голосовой ассистент Sesame. Бесплатно на iOS с мая 2026 года, широко доступен на Android с начала августа 2026 года, а также веб-превью с приоритетом голоса. Четыре агента — Maya, Miles, Simone и Charlie — только на английском, с лимитом длительности звонка 30 минут, который сокращается до 5 минут, если вы не вошли в систему.

• CSM-1B — открытая часть Sesame: разговорная речевая модель на 1 млрд параметров, выпущенная под лицензией Apache 2.0 23 апреля 2026 года, построенная на основе архитектуры Llama с отдельным декодером и кодеком Mimi от Kyutai, генерирующая английскую монофоническую речь с частотой 24 кГц на основе контекста примерно в 4K токенов.

Три строки выше — это вся суть решения. Одна компания продаёт модель с поминутной оплатой. Другая бесплатно отдаёт приложение и открывает исходный код меньшей модели, которая не та, что используется в приложении.

Разрыв между демо и загрузкой

Sesame проявила необычную прямоту в этом вопросе, и это самый важный факт для любого, кто оценивает эту пару. Голос в приложении Preview — тот, что стал источником вирусных клипов и отзывов о «лучшем в классе голосовом режиме», — представляет собой более крупную закрытую продакшн-модель. CSM-1B — это открытый чекпойнт с 1 млрд параметров из той же лаборатории, и, по оценке людей, запускавших обе модели, голос у него заметно слабее. Сессии в Preview также ограничены по количеству и доступны только на английском, а выполнения задач нет: агенты разговаривают, но ничего не бронируют, не покупают и не оформляют.

Это оставляет разработчикам реальное, но более узкое предложение: самостоятельно размещаемый разговорный речевой чекпойнт без лицензионной платы, размещённый у одного стороннего провайдера инференса по цене $7 за миллион символов — примерно $0,35 за час синтезированного аудио — или бесплатно на вашем собственном оборудовании. Никто не опубликовал независимый бенчмарк ни для голоса Preview, ни для CSM-1B, поэтому любое заявление о качестве в любую сторону — это впечатление от прослушивания, а не измерение. Sesame также не опубликовала ни публичных цен, ни корпоративного тарифа, ни плана монетизации; заявленное направление компании — исследовательские партнёрства и запланированный аппаратный продукт.

A screenshot of the Sesame homepage as of September 2026, headed 'Curiosity, met' with the subline 'Personal intelligence with a point of view', and a section titled 'A collection of personal agents' reading 'Think out loud. Follow a thread. Discover something unexpected.' with a 'Get the Preview' button. The navigation offers only Blog, Team, Mobile Preview and Research Preview — no pricing, no documentation and no developer or API link.

Что можно получить за $0.05 в минуту, чего нельзя получить бесплатно

Аргумент GPT-Live-1 для разработчика не в том, что он звучит лучше, — потому что этот довод невозможно выиграть против закрытой модели, которую никто не может измерить. Он в том, что эту штуку можно вызывать и у неё есть цена. Конкретно, что вы получаете за крутящийся счётчик:

• Сеанс, которым вы управляете, — один ID модели, один эндпоинт Live Sessions, опубликованный пример интеграции, работающий через WebRTC, и сеанс, который вы настраиваете с помощью инструкций, голосов и блока делегирования.

• Обработка прерываний как документированное поведение — 80,1% интерактивности на Full Duplex Bench v1.5 против 45,4% у GPT-Realtime-2.1, при задержке смены реплик 0,798 секунды и 87% успешных вызовов инструментов. Все три — собственные цифры Ope​nAI, опубликованные вместе с релизом и никем не воспроизведённые на момент написания.

• Бэкенд рассуждений, который выбираете вы, — голосовой слой передаёт тяжёлую работу через асинхронную границу отдельной модели, указанной в конфигурации сессии, а та продолжает работать, пока разговор идёт. В примере из документации Ope​nAI этим бэкендом служит GPT-5.6 Terra; на июльском потребительском запуске это был GPT-5.5.

Транскрипты, текст ответа и тарификация в стиле телефонии — 3,00 $ за час непрерывно открытой линии, с посекундной тарификацией, при этом 15 секунд инициализации сеанса засчитываются, а не добавляются.

Sesame даёт вам лучший разговор и ничего из этого. Если вы создаёте продукт, «лучший разговор, никакого API, никакой цены, никакого бенчмарка, только английский, ограничение в 30 минут» — это не сравнение, а лист ожидания.

Теперь у GPT-Live-1 есть показатель, которого не существовало на момент его потребительского запуска, и это честный противовес всему вышесказанному. Индекс Speech to Speech от Artificial Analysis оценивает GPT-Live-1 в 69,8% — седьмое место из одиннадцати моделей, позади GPT-Realtime-2.1 с 73,9% и позади Grok Voice Think Fast 2.0 с 79,0%. Так что модель, которую можно купить, тоже не лучшая в независимом рейтинге. А то, что рейтинг не может измерить, — это именно то, в чём Sesame на самом деле выигрывает: ни одну из одиннадцати моделей в этом индексе не оценивали по тому, каково с ней разговаривать, а у голоса Sesame Preview нигде нет ни одной строки.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%. No Sesame model appears on the index.

Та часть стека, которая не принадлежит ни одной из компаний

Вот где оба варианта сходятся, и где решение перестаёт быть бинарным. Ни Sesame Preview, ни GPT-Live-1 не являются полноценными агентами. Агенты Sesame не выполняют задачи; GPT-Live-1 явно делегирует всё, что требует рассуждений, поиска или инструмента, бэкенд-модели. В обеих архитектурах интересная работа происходит за голосом, в обычном вызове текстовой модели, и этот слой переносим так, как голосовой слой — нет: можно сменить бэкенд, не перезаписывая ни единого промпта для речевой модели.

Этот бэкенд — ещё и то место, где OrcaRouter полезен, и стоит чётко обозначить, что мы маршрутизируем, а что — нет. Мы не маршрутизируем GPT-Live-1: эндпоинт Live Sessions принадлежит Ope​nAI, а голосовой слой там недосягаем. Мы не маршрутизируем и продакшен-модель Sesame по более простой причине: её никогда не предлагали в виде API. А маршрутизируем мы тот слой, которому оба продукта передают работу. Примерно 190 моделей от одиннадцати апстрим-провайдеров работают через один ключ по прайс-листовой цене провайдера, без наценки, с автоматическим переключением при сбое между провайдерами и DSL маршрутизации, позволяющим объединять несколько моделей в один вызов. Для команды, строящей продукт на непроверенном голосовом фронтенде, именно это и есть та страховка, которая важна: речевой слой можно заменить или потерять, не потянув за собой слой рассуждений, а модель, на которую вы поставили в марте, можно заменить в июне, отредактировав одну строку.

Что посмотреть

Три вещи изменили бы это сравнение, и ни одна из них пока не в чьих-либо руках. API Sesame — даже платный — мгновенно превратил бы сильнейший голос в категории в вариант, на основе которого можно строить, и поставил бы реальную цену рядом с $0.05 у GPT-Live-1. Опубликованный бенчмарк голоса Preview превратил бы впечатление от прослушивания в число, а независимые оценки обычно не щадят голоса, которые соревновались только в демо. А первое воспроизведение сторонними исследователями показателей интерактивности и задержки Ope​nAI решило бы, представляет ли полнодуплексный режим реальный разрыв в возможностях или же это удачно выбранная оценка.

А до тех пор честный расклад таков. Если вы выбираете голос для себя, используйте Sesame Preview — он бесплатный, он лучше, и вам ничего не стоит предпочесть его. Если вы выбираете голос для продукта, который нужно выпускать, продавать и поддерживать, GPT-Live-1 — единственный из двух, который вы действительно можете купить, и то, что звучит он не лучше, — это плата за вход.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно