Сгенерированная hero-карточка под названием «HeyGen Voice vs Sesame Preview», противопоставляющая документированный речевой API с измеренным Elo потребительскому демо без публичного эндпоинта, помеченная датой Artificial Analysis — 9 октября 2026 года. Логотип OrcaRouter отображается в правом нижнем углу.
Guides & Insights

HeyGen Voice против Sesame Preview: голос, который можно купить, против голоса, с которым можно только поговорить

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Это не сравнение моделей, и делать вид, что это не так, было бы единственной настоящей ошибкой, возможной здесь. HeyGen Voice — это API-движок, занявший первое место на арене Controlled Voice от Artificial Analysis с 1 202 Elo, доступный через v3-эндпоинты HeyGen, продаваемый за кредиты и клонируемый по одной записи. Sesame Preview — это бесплатный потребительский голосовой ассистент, до которого можно добраться, открыв веб-страницу и заговорив с одной из четырёх именованных персон, без публичного эндпоинта, без идентификатора модели и без цены, по которой его можно арендовать. Один из них вы можете выпустить. Другой — причина, по которой вы знаете, как звучит хороший разговорный голос, и никогда не то, что вы развёртываете.

Что каждый из них на самом деле из себя представляет

Sesame Preview — это демонстрация разговорной речи. Вы попадаете в неё через собственный сайт компании, разговариваете с Майей, Майлзом, Симоной или Чарли, и этот опыт намеренно оптимизирован под дружелюбие и выразительность — компания прямо говорит об этом, объясняя, почему компаньоны ведут себя именно так. Сегодня он доступен только на английском; команда отмечает, что многоязычные возможности проявляются случайно из-за загрязнения данных и «пока работают неважно», а расширение до более чем двадцати языков — план на будущее. Сама компания описывает это как незавершённую работу: «Мы ещё не там».

В основе демо лежит Conversational Speech Model — мультимодальная текстовая и речевая архитектура, построенная на двух авторегрессионных трансформерах в стиле Llama. Она выпускается в трёх размерах — Tiny с базовой моделью на 1B и декодером на 100M, Small — 3B и 250M, Medium — 8B и 300M — каждый обучался при длине последовательности 2 048 токенов, что примерно соответствует двум минутам аудио, в течение пяти эпох на примерно одном миллионе часов преимущественно английской речи. Ключевые исследовательские компоненты открыты под Apache 2.0, и для них есть репозиторий на GitHub. Демо — то, что люди на самом деле хвалят, — это не оно. У демо нет публичного API.

HeyGen Voice — это обратная схема. Нет бесплатного потребительского приложения, чтобы попробовать; есть документированный API с каталогом голосов, эндпоинтом синтеза речи, путями клонирования и счётом. Чего нельзя сделать — так это открыть его в браузере и поговорить с ним, когда вздумается.

Почему этих двоих вообще сравнивают

Их сравнивают, потому что оба приводятся в качестве доказательства того, что синтетическая речь перешагнула некий рубеж. Sesame Preview сбросил ожидания относительно того, как может звучать разговорное аудио — реакции, когда он появился, были о том, насколько он звучал как человек, а не как движок синтеза речи. 1,202 у HeyGen Voice в контролируемом рейтинге — это то же утверждение в числовой форме: первое место среди сорока двух записей, когда каждая модель говорит одними и теми же восемью клонированными эталонными голосами.

Разница в том, что вы можете сделать с этим заявлением потом. Позиция в лидерборде воспроизводима, проверяема и привязана к эндпоинту. Впечатление от демо — ничего из этого — и, что важно, Sesame Preview вообще не фигурирует в контролируемом лидерборде, поэтому нет Elo, с которым можно было бы сравнить 1,202. Сравнение, которое люди хотят провести, недоступно — не потому, что Sesame его проиграла, а потому, что модель так и не была заявлена.

Табло

A generated two-column scoreboard titled 'HeyGen Voice vs Sesame Preview — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Access: documented v3 API with a speech endpoint', 'Price: $30.00 per 1M characters on the arena's conversion of credit pricing', 'Voice selection: 300+ pre-built voices, design and cloning', 'Languages: dozens of languages, count unpublished' and 'Open weights: none'. The Sesame Preview column reads 'Controlled Voice Elo: not listed', 'Access: consumer web and iOS app, no public endpoint', 'Price: free, not purchasable at any price', 'Voice selection: four fixed personas', 'Languages: English only, multilingual underperforming' and 'Open weights: CSM under Apache 2.0 in 1B, 3B and 8B'. A footer notes the arena price is a conversion of credit pricing rather than a vendor-quoted rate.

• Контролируемый голосовой Elo — HeyGen Voice: 1202, №1 из 42. Sesame Preview: не указан.

• Доступ — HeyGen Voice: документированный API v3, POST /v3/voices/speech. Sesame Preview: потребительское веб-приложение и приложение для iOS; публичного эндпоинта нет.

• Цена — HeyGen Voice: $30.00 за 1 млн символов по собственному пересчёту арены тарифов на кредиты; HeyGen не публикует тариф на голос. Sesame Preview: бесплатно и не продаётся ни за какую цену.

• Выбор голоса — HeyGen Voice: более 300 готовых голосов, создание голоса по текстовому описанию, мгновенное и профессиональное клонирование. Sesame Preview: четыре фиксированные персоны.

• Языки — HeyGen Voice: «десятки языков», количество не опубликовано. Sesame Preview: только английский, причём, по собственному признанию компании, многоязычная поддержка сегодня работает недостаточно хорошо.

• Открытые веса — HeyGen Voice: нет. Sesame Preview: CSM выпущена под лицензией Apache 2.0 в размерах 1B, 3B и 8B.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' and the ranked field with HeyGen Voice first at 1,202 Elo and Qwen-Audio-3.1-TTS-Plus second at 1,186; no Sesame entry appears anywhere on the board.

Деталь Apache 2.0 — вот что важно.

Под вердиктом «нет API» скрывается тот факт, что Sesame открыла исходный код исследовательской модели под Apache 2.0 — разрешительной лицензией, в трёх размерах, с вариантом 1B, достаточно малым, чтобы работать без дата-центра. Это принципиально иное предложение, чем демо, и это единственный путь, благодаря которому что-либо, напоминающее голос Sesame Preview, попадает в выпущенный продукт.

{{1}}Оговорки, конечно, есть. Выпущенные компоненты CSM — это исследовательские артефакты: компания отмечает, что они моделируют речевое содержание, но не структуру разговора, и относит полностью дуплексные модели к будущей работе — так что выпущенные веса — это не интерактивный опыт. А 8B-бэкбон, работающий локально, — это другая структура затрат по сравнению с $19.30 за миллион символов хостингового инференса — столько берёт самый дешёвый соперник топ-уровня на арене. У самостоятельного хостинга нет счёта за символы, но есть вполне реальный счёт за GPU-час.

Для разработчика это меняет постановку вопроса. Если в Sesame Preview вас впечатлил разговор, открытые веса вам его не дадут. Если же вас впечатлило качество голоса самой речевой модели, то они, возможно, дадут — и это можно проверить так, как нельзя проверить демо.

Как выглядит релиз в HeyGen Voice

Практические различия — самые обычные. API HeyGen принимает выбор голоса, текст и опциональные скорость от 0,5 до 1,5 и тон в пределах ±50 полутонов, с подсказкой BCP-47 локали. Пользовательские голоса создаются тремя способами: маршрут проектирования на основе описания, который возвращает до трёх ранжированных вариантов из запроса, ограниченного 1 000 символами, мгновенное клонирование по одной записи и профессиональное клонирование, обученное на двадцати минутах или более. Движковый фильтр на эндпоинте голосов также принимает движки не от HeyGen, так что платформа не является закрытым садом вокруг собственной модели.

Ничего из этого на стороне Sesame не существует, и это не недостаток Sesame Preview — такова его суть. Демо, оптимизированное, чтобы показать, что возможно, не должно сопровождаться SLA.

Счёт, впрочем, — это менее жёсткая половина. HeyGen продаёт кредиты — 600 за $29 в месяц, 1 000 за $49, 1 500 за $149 — и заявляет, что потребление зависит от модели, длительности и сложности, не публикуя тариф на голос. Указанные на арене $30.00 за миллион символов — это пересчёт этих кредитов от Artificial Analysis, а не расценка от HeyGen. Итак, модель, которую можно внедрить, имеет цену, но по чужой арифметике — что является аргументом в пользу выверенного пилотного проекта, а не критикой движка.

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech.

Что на самом деле делать с демо, которым вы восхищаетесь

Полезный ход — разделить две вещи, которые демонстрирует Sesame Preview. Разговорное поведение — очерёдность реплик, память, ощущение разговора с кем-то — это продукт системы, которая ещё не выпущена и не имеет конечной точки. Качество речи — это та часть, за которой стоят веса Apache 2.0, и та часть, которую вы можете оценить на собственном аудио, ни у кого не спрашивая разрешения.

Для всего, что между ними, путь миграции — самый обыденный: запускаться на движке, у которого есть API и рейтинг, и проектировать так, чтобы переход на модель Sesame, если она когда-нибудь выйдет коммерчески, был изменением конфигурации, а не переписыванием. Это означает абстракцию над поставщиком голоса с первого дня — один интерфейс, один ключ, движок выбирается конфигурацией. Слой маршрутизации OrcaRouter создан именно для этого: множество провайдеров за единым эндпоинтом по прайс-листу провайдера без наценки, автоматическое переключение при сбое вендора и DSL маршрутизации, позволяющий заменить движок за голосом, не трогая код приложения. Смысл не в том, что он размещает модель Sesame — это не так, — а в том, что в тот день, когда голос, которым вы восхищаетесь, станет доступен для покупки, стоимость его проверки должна быть строчкой в конфигурационном файле.

Честное закрытие

Sesame Preview — не конкурент HeyGen Voice, и оценивать его как такового не следует. Это бесплатная демонстрация только на английском языке с четырьмя персонами, которая, так уж вышло, изменила ожидания от разговорного аудио и, так уж вышло, выпустила исследовательские веса под разрешительной лицензией в трёх размерах. HeyGen Voice — движок, занимающий первое место в единственном рейтинге речи, где голос остаётся неизменным, продаваемый через API, который можно вызвать уже сегодня, по цене, которую вы пока не можете рассчитать.

Если вам нужен голос, который можно выпустить в этом квартале, выбор не между этими двумя — он между HeyGen Voice и другими платными движками на арене. Если вы ждёте Sesame, ждите весов, а не приложения.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube