Сгенерированная hero-карточка под заголовком «HeyGen Voice дебютирует на 1-м месте на Controlled Voice Arena» со строкой «1 202 Elo — опережая Qwen-Audio-3.1-TTS-Plus и Eleven v4 Turbo» и примечанием «Те же восемь клонированных эталонных голосов — Artificial Analysis, 9 октября 2026 г.». Логотип OrcaRouter отображается в правом нижнем углу.
Guides & Insights

HeyGen Voice дебютирует на 1-м месте в Controlled Voice TTS Arena — обойдя Qwen и ElevenLabs по клонированным голосам

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

9 октября 2026 года Artificial Analysis добавила HeyGen Voice в свою арену Controlled Voice, и модель сразу же вышла на первое место в ней. HeyGen Voice — первая модель преобразования текста в речь от HeyGen, оценённая на этой таблице, — набрала 1 202 балла Elo, опередив Qwen-Audio-3.1-TTS-Plus с 1 186 и Eleven v4 Turbo от ElevenLabs с 1 167. Cartesia Sonic 3.6, которая лидирует в открытой таблице Provider Voices на сайте, занимает здесь пятое место с 1 143. Это подлинный результат в таблице лидеров, созданной для устранения единственного самого серьёзного искажающего фактора в оценке голоса, и в то же время результат с очень конкретным значением, который легко переоценить: HeyGen Voice — лучший голос в этой арене на восьми клонированных эталонных голосах, но пока ещё не подтверждённый измерениями чемпион таблицы, в которой девяносто шесть моделей.

Что измеряет плата Controlled Voice и почему это важно

Artificial Analysis ведёт две речевые таблицы лидеров, и они отвечают на разные вопросы. Арена Provider Voices позволяет каждому поставщику предоставить свои собственные нативные голоса — отточенные демонстрационные голоса, которые компания выбирает, чтобы представлять себя, — и ранжирует модели по тому, насколько хорошо те звучат. Её таблица лидеров широка и зрела: девяносто шесть записей, при этом Eleven v4 Turbo на вершине с 1 328 Elo, а Cartesia Sonic 3.6 — на четвёртом месте с 1 280.

Арена Controlled Voice делает нечто более узкое и, для всех, кто выпускает продукт, более полезное. Каждая модель на ней генерирует речь с использованием одних и тех же восьми клонированных голосов — четырёх американских, четырёх британских, — так что сравнение идёт не по принципу «у кого маркетинговый голос приятнее», а «как каждый движок справляется с одним и тем же голосом, одним и тем же текстом и одними и теми же условиями записи». Это самое близкое к сопоставимому тестированию самого движка, а не демо-ролика, что есть в отрасли, и именно эта таблица имеет значение, если вы планируете клонировать голос и передать его TTS-модели.

Теперь его возглавляет HeyGen Voice. Разрыв составляет 16 Elo с Qwen-Audio-3.1-TTS-Plus и 35 с Eleven v4 Turbo, при заявленном 95% доверительном интервале примерно от 1 185 до 1 219 для показателя HeyGen. Шестнадцать Elo — это реальный разрыв, но не пропасть: на такой плотной таблице это разница между первым и вторым местом, а не между пригодным и непригодным.

A generated single-column scoreboard titled 'HeyGen Voice — the scoreboard' with rows reading 'Controlled Voice Elo: 1,202', '95% confidence interval: roughly 1,185 to 1,219', 'Rank in the controlled field: #1 of 42 ranked entries', 'Provider Voices Elo: not listed, insufficient votes', "Price on the arena's basis: $30.00 per 1M characters, derived from credit pricing" and 'Elo anchor: the board baseline is 1,000 points', with a footer reading 'Elo per Artificial Analysis, 9 October 2026. Price shown is the arena's conversion of credit pricing.' The OrcaRouter logo appears in the bottom-right corner.

Где HeyGen Voice пока не включён в рейтинг

Честная сторона этого результата в том, что HeyGen Voice вообще не появляется в списке Provider Voices, и его отсутствие не является сигналом о качестве. Artificial Analysis отмечает, что модели могут быть исключены из-за того, что у них ещё недостаточно голосов. Модель, которой всего несколько дней, с единственной по-другому оценённой ареной за плечами, просто ещё не набрала объём слепых прослушиваний, необходимый для более крупного рейтинга.

Итак, правильная интерпретация по состоянию на 10 октября 2026 года такова: HeyGen Voice — голос, занявший первое место в контролируемом сравнении клонированных голосов, и неизвестная величина на фоне более широкого поля участников. Любой, кто цитирует «лучшую TTS-модель в мире», опираясь на этот показатель, цитирует меньшую таблицу лидеров, чем подразумевает это утверждение.

A screenshot of Artificial Analysis's Provider Voice Arena leaderboard, captured 10 October 2026, showing the ranked model list with Eleven v4 Turbo first at 1,328 Elo, Eleven v4 second at 1,320, Qwen-Audio-3.1-TTS-Plus third at 1,296 and Sonic 3.6 fourth at 1,280, alongside samples, release dates and API pricing columns and 8-voice arena badges.

Два числа, стоящие за Elo

• Контролируемый голосовой Elo — HeyGen Voice: 1 202 (95% ДИ примерно 1 185–1 219). Qwen-Audio-3.1-TTS-Plus: 1 186. Eleven v4 Turbo: 1 167.

• Elo голосов провайдеров — HeyGen Voice: не указан (недостаточно голосов). Eleven v4 Turbo: 1 328 на 1-м месте. Sonic 3.6: 1 280 на 4-м месте.

• Место в контролируемом поле — HeyGen Voice: №1 из 42 ранжированных записей (№42 — OpenVoice v2 с показателем 812).

• Цена по методике арены — HeyGen Voice: $30.00 за 1 млн символов — собственный пересчёт ареной кредитной цены HeyGen. Qwen-Audio-3.1-TTS-Plus: $19.30 за 1 млн символов. Eleven v4 Turbo: $40.00 за 1 млн символов.

• Опорная точка Elo — OpenAudio S1 — это фиксированная точка отсчёта на уровне 1 000, поэтому HeyGen Voice находится на 202 балла выше опорной точки.

• Кто ещё в первой пятёрке — Eleven v4 с 1 160 и Sonic 3.6 с 1 143 замыкают первую пятёрку вслед за лидерами.

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech, above the Realtime Video and Avatar Management groups.

Что HeyGen на самом деле выпустил

Движок, лежащий в основе этой записи, — это собственный TTS-движок HeyGen, доступный через API v3 компании. Вызов GET /v3/voices принимает engine-фильтр, значения которого включают orca — собственный голосовой движок HeyGen — наряду с starfish и сквозным доступом к голосам ElevenLabs. Синтез речи выполняется через POST /v3/voices/speech; настройка для каждого запроса предоставляет speed от 0,5 до 1,5 и pitch от −50 до +50 полутонов, с BCP-47 locale-подсказкой.

В каталоге указано более 300 готовых голосов на десятках языков. Пользовательские голоса бывают трёх видов: создание голоса по текстовому описанию, которое генерирует до трёх ранжированных вариантов на основе описания длиной не более 1 000 символов, мгновенный клон по одной записи и профессиональный клон, обученный на двадцати минутах аудио или более. Последний вариант — это именно то, что фактически стресс-тестирует таблица лидеров Controlled Voice: те восемь эталонных голосов являются клонами, а именно качество клонов и отличает TTS-движки друг от друга.

В документации также указано, что движки можно выбирать для каждого голоса, а значит, HeyGen не заставляет вас использовать именно её модель: вы можете через её API направлять запросы к стороннему голосовому движку, если предпочитаете другой. Это вендор, который снижает риски, связанные с собственной моделью, и об этом стоит знать, когда вы читаете утверждение о «голосе №1» от HeyGen.

Что это меняет для тех, кто выбирает голос

Из получения результата контролируемого голоса вытекают три практических следствия, и ни одно из них не означает «переключить всё».

Во-первых, если ваш сценарий использования — клонированный голос бренда (один говорящий, множество реплик), то теперь именно эту таблицу стоит смотреть, и HeyGen Voice — модель, которую следует протестировать первой. Лидерборд, в котором голос остаётся неизменным, измеряет именно то, чем вы на самом деле будете заниматься.

Во-вторых, если ваш сценарий использования предполагает широкий набор персонажей, звучащих как носители языка, на языках, которые ваш клон не охватывает, таблица Provider Voices и её девяносто шесть записей по-прежнему остаются актуальным ориентиром, а HeyGen Voice пока не занимает там никакого места. Ничто в результате клонированного голоса не говорит о том, как движок справляется с сотней разных голосов.

В-третьих, у цены теперь есть число, но не то, которое опубликовал поставщик. Арена указывает HeyGen Voice по цене $30.00 за 1 млн символов — это пересчёт Artificial Analysis для системы кредитов, которую собственная страница HeyGen никогда не переводит в расценку за голос. Так новый лидер оказывается ниже $40.00 у Eleven v4 Turbo и выше $19.30 у тарифа Qwen — цена середины поля, привязанная к баллу за первое место, и притом выведенная, а не заявленная.

Вопрос маршрутизации

У выбора голоса есть свойство, которого нет у большинства выборов моделей: ошибка слышна конечному пользователю в пределах слога. Это делает миграцию дешёвой для тестирования и дорогой при ошибке в продакшене. Запуск нового движка за тем же интерфейсом, что и у текущего, — одна поверхность API, один ключ, прайс-листовая цена провайдера передаётся как есть, без наценки, с автоматическим переключением на второго голосового провайдера при сбое запроса — это способ получить реальный ответ о вашем собственном аудио вместо ответа графика Elo о восьми эталонных голосах. Слой маршрутизации OrcaRouter существует именно для такого рода решений: поставить претендента на долю трафика, держать текущего в тепле и позволить аварийному переключению покрыть окно, где новая модель не проверена. Таблица лидеров говорит, куда смотреть. Она не может сказать, как звучит ваш сценарий.

Что посмотреть дальше

Два числа поставят точку в этой истории. Первое — наберёт ли HeyGen Voice достаточно голосов, чтобы попасть в таблицу Provider Voices, и на каком месте оно окажется относительно 1,328 у Eleven v4 Turbo — модели, которая лидирует в этой таблице, но отстаёт на контролируемой арене; именно этот разрыв и призваны выявлять обе таблицы. Второе — публикует ли HeyGen собственный тариф на голос, чтобы полученные на арене $30.00 можно было сверить с цифрой от поставщика, а не выводить её из кредитов. Пока не появится и то, и другое, дебют на первом месте в контролируемой таблице — это сильное заявление о качестве клонированного голоса и открытый вопрос обо всём остальном.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube