
HeyGen Voice против Sesame Preview: голос, который можно купить, против голоса, с которым можно только поговорить
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Это не сравнение моделей, и делать вид, что это не так, было бы единственной настоящей ошибкой, возможной здесь. HeyGen Voice — это API-движок, занявший первое место на арене Controlled Voice от Artificial Analysis с 1 202 Elo, доступный через v3-эндпоинты HeyGen, продаваемый за кредиты и клонируемый по одной записи. Sesame Preview — это бесплатный потребительский голосовой ассистент, до которого можно добраться, открыв веб-страницу и заговорив с одной из четырёх именованных персон, без публичного эндпоинта, без идентификатора модели и без цены, по которой его можно арендовать. Один из них вы можете выпустить. Другой — причина, по которой вы знаете, как звучит хороший разговорный голос, и никогда не то, что вы развёртываете.
Что каждый из них на самом деле из себя представляет
Sesame Preview — это демонстрация разговорной речи. Вы попадаете в неё через собственный сайт компании, разговариваете с Майей, Майлзом, Симоной или Чарли, и этот опыт намеренно оптимизирован под дружелюбие и выразительность — компания прямо говорит об этом, объясняя, почему компаньоны ведут себя именно так. Сегодня он доступен только на английском; команда отмечает, что многоязычные возможности проявляются случайно из-за загрязнения данных и «пока работают неважно», а расширение до более чем двадцати языков — план на будущее. Сама компания описывает это как незавершённую работу: «Мы ещё не там».
В основе демо лежит Conversational Speech Model — мультимодальная текстовая и речевая архитектура, построенная на двух авторегрессионных трансформерах в стиле Llama. Она выпускается в трёх размерах — Tiny с базовой моделью на 1B и декодером на 100M, Small — 3B и 250M, Medium — 8B и 300M — каждый обучался при длине последовательности 2 048 токенов, что примерно соответствует двум минутам аудио, в течение пяти эпох на примерно одном миллионе часов преимущественно английской речи. Ключевые исследовательские компоненты открыты под Apache 2.0, и для них есть репозиторий на GitHub. Демо — то, что люди на самом деле хвалят, — это не оно. У демо нет публичного API.
HeyGen Voice — это обратная схема. Нет бесплатного потребительского приложения, чтобы попробовать; есть документированный API с каталогом голосов, эндпоинтом синтеза речи, путями клонирования и счётом. Чего нельзя сделать — так это открыть его в браузере и поговорить с ним, когда вздумается.
Почему этих двоих вообще сравнивают
Их сравнивают, потому что оба приводятся в качестве доказательства того, что синтетическая речь перешагнула некий рубеж. Sesame Preview сбросил ожидания относительно того, как может звучать разговорное аудио — реакции, когда он появился, были о том, насколько он звучал как человек, а не как движок синтеза речи. 1,202 у HeyGen Voice в контролируемом рейтинге — это то же утверждение в числовой форме: первое место среди сорока двух записей, когда каждая модель говорит одними и теми же восемью клонированными эталонными голосами.
Разница в том, что вы можете сделать с этим заявлением потом. Позиция в лидерборде воспроизводима, проверяема и привязана к эндпоинту. Впечатление от демо — ничего из этого — и, что важно, Sesame Preview вообще не фигурирует в контролируемом лидерборде, поэтому нет Elo, с которым можно было бы сравнить 1,202. Сравнение, которое люди хотят провести, недоступно — не потому, что Sesame его проиграла, а потому, что модель так и не была заявлена.
Табло

• Контролируемый голосовой Elo — HeyGen Voice: 1202, №1 из 42. Sesame Preview: не указан.
• Доступ — HeyGen Voice: документированный API v3, POST /v3/voices/speech. Sesame Preview: потребительское веб-приложение и приложение для iOS; публичного эндпоинта нет.
• Цена — HeyGen Voice: $30.00 за 1 млн символов по собственному пересчёту арены тарифов на кредиты; HeyGen не публикует тариф на голос. Sesame Preview: бесплатно и не продаётся ни за какую цену.
• Выбор голоса — HeyGen Voice: более 300 готовых голосов, создание голоса по текстовому описанию, мгновенное и профессиональное клонирование. Sesame Preview: четыре фиксированные персоны.
• Языки — HeyGen Voice: «десятки языков», количество не опубликовано. Sesame Preview: только английский, причём, по собственному признанию компании, многоязычная поддержка сегодня работает недостаточно хорошо.
• Открытые веса — HeyGen Voice: нет. Sesame Preview: CSM выпущена под лицензией Apache 2.0 в размерах 1B, 3B и 8B.

Деталь Apache 2.0 — вот что важно.
Под вердиктом «нет API» скрывается тот факт, что Sesame открыла исходный код исследовательской модели под Apache 2.0 — разрешительной лицензией, в трёх размерах, с вариантом 1B, достаточно малым, чтобы работать без дата-центра. Это принципиально иное предложение, чем демо, и это единственный путь, благодаря которому что-либо, напоминающее голос Sesame Preview, попадает в выпущенный продукт.
{{1}}Оговорки, конечно, есть. Выпущенные компоненты CSM — это исследовательские артефакты: компания отмечает, что они моделируют речевое содержание, но не структуру разговора, и относит полностью дуплексные модели к будущей работе — так что выпущенные веса — это не интерактивный опыт. А 8B-бэкбон, работающий локально, — это другая структура затрат по сравнению с $19.30 за миллион символов хостингового инференса — столько берёт самый дешёвый соперник топ-уровня на арене. У самостоятельного хостинга нет счёта за символы, но есть вполне реальный счёт за GPU-час.
Для разработчика это меняет постановку вопроса. Если в Sesame Preview вас впечатлил разговор, открытые веса вам его не дадут. Если же вас впечатлило качество голоса самой речевой модели, то они, возможно, дадут — и это можно проверить так, как нельзя проверить демо.
Как выглядит релиз в HeyGen Voice
Практические различия — самые обычные. API HeyGen принимает выбор голоса, текст и опциональные скорость от 0,5 до 1,5 и тон в пределах ±50 полутонов, с подсказкой BCP-47 локали. Пользовательские голоса создаются тремя способами: маршрут проектирования на основе описания, который возвращает до трёх ранжированных вариантов из запроса, ограниченного 1 000 символами, мгновенное клонирование по одной записи и профессиональное клонирование, обученное на двадцати минутах или более. Движковый фильтр на эндпоинте голосов также принимает движки не от HeyGen, так что платформа не является закрытым садом вокруг собственной модели.
Ничего из этого на стороне Sesame не существует, и это не недостаток Sesame Preview — такова его суть. Демо, оптимизированное, чтобы показать, что возможно, не должно сопровождаться SLA.
Счёт, впрочем, — это менее жёсткая половина. HeyGen продаёт кредиты — 600 за $29 в месяц, 1 000 за $49, 1 500 за $149 — и заявляет, что потребление зависит от модели, длительности и сложности, не публикуя тариф на голос. Указанные на арене $30.00 за миллион символов — это пересчёт этих кредитов от Artificial Analysis, а не расценка от HeyGen. Итак, модель, которую можно внедрить, имеет цену, но по чужой арифметике — что является аргументом в пользу выверенного пилотного проекта, а не критикой движка.

Что на самом деле делать с демо, которым вы восхищаетесь
Полезный ход — разделить две вещи, которые демонстрирует Sesame Preview. Разговорное поведение — очерёдность реплик, память, ощущение разговора с кем-то — это продукт системы, которая ещё не выпущена и не имеет конечной точки. Качество речи — это та часть, за которой стоят веса Apache 2.0, и та часть, которую вы можете оценить на собственном аудио, ни у кого не спрашивая разрешения.
Для всего, что между ними, путь миграции — самый обыденный: запускаться на движке, у которого есть API и рейтинг, и проектировать так, чтобы переход на модель Sesame, если она когда-нибудь выйдет коммерчески, был изменением конфигурации, а не переписыванием. Это означает абстракцию над поставщиком голоса с первого дня — один интерфейс, один ключ, движок выбирается конфигурацией. Слой маршрутизации OrcaRouter создан именно для этого: множество провайдеров за единым эндпоинтом по прайс-листу провайдера без наценки, автоматическое переключение при сбое вендора и DSL маршрутизации, позволяющий заменить движок за голосом, не трогая код приложения. Смысл не в том, что он размещает модель Sesame — это не так, — а в том, что в тот день, когда голос, которым вы восхищаетесь, станет доступен для покупки, стоимость его проверки должна быть строчкой в конфигурационном файле.
Честное закрытие
Sesame Preview — не конкурент HeyGen Voice, и оценивать его как такового не следует. Это бесплатная демонстрация только на английском языке с четырьмя персонами, которая, так уж вышло, изменила ожидания от разговорного аудио и, так уж вышло, выпустила исследовательские веса под разрешительной лицензией в трёх размерах. HeyGen Voice — движок, занимающий первое место в единственном рейтинге речи, где голос остаётся неизменным, продаваемый через API, который можно вызвать уже сегодня, по цене, которую вы пока не можете рассчитать.
Если вам нужен голос, который можно выпустить в этом квартале, выбор не между этими двумя — он между HeyGen Voice и другими платными движками на арене. Если вы ждёте Sesame, ждите весов, а не приложения.
