
HeyGen Voice дебютирует на 1-м месте в Controlled Voice TTS Arena — обойдя Qwen и ElevenLabs по клонированным голосам
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
9 октября 2026 года Artificial Analysis добавила HeyGen Voice в свою арену Controlled Voice, и модель сразу же вышла на первое место в ней. HeyGen Voice — первая модель преобразования текста в речь от HeyGen, оценённая на этой таблице, — набрала 1 202 балла Elo, опередив Qwen-Audio-3.1-TTS-Plus с 1 186 и Eleven v4 Turbo от ElevenLabs с 1 167. Cartesia Sonic 3.6, которая лидирует в открытой таблице Provider Voices на сайте, занимает здесь пятое место с 1 143. Это подлинный результат в таблице лидеров, созданной для устранения единственного самого серьёзного искажающего фактора в оценке голоса, и в то же время результат с очень конкретным значением, который легко переоценить: HeyGen Voice — лучший голос в этой арене на восьми клонированных эталонных голосах, но пока ещё не подтверждённый измерениями чемпион таблицы, в которой девяносто шесть моделей.
Что измеряет плата Controlled Voice и почему это важно
Artificial Analysis ведёт две речевые таблицы лидеров, и они отвечают на разные вопросы. Арена Provider Voices позволяет каждому поставщику предоставить свои собственные нативные голоса — отточенные демонстрационные голоса, которые компания выбирает, чтобы представлять себя, — и ранжирует модели по тому, насколько хорошо те звучат. Её таблица лидеров широка и зрела: девяносто шесть записей, при этом Eleven v4 Turbo на вершине с 1 328 Elo, а Cartesia Sonic 3.6 — на четвёртом месте с 1 280.
Арена Controlled Voice делает нечто более узкое и, для всех, кто выпускает продукт, более полезное. Каждая модель на ней генерирует речь с использованием одних и тех же восьми клонированных голосов — четырёх американских, четырёх британских, — так что сравнение идёт не по принципу «у кого маркетинговый голос приятнее», а «как каждый движок справляется с одним и тем же голосом, одним и тем же текстом и одними и теми же условиями записи». Это самое близкое к сопоставимому тестированию самого движка, а не демо-ролика, что есть в отрасли, и именно эта таблица имеет значение, если вы планируете клонировать голос и передать его TTS-модели.
Теперь его возглавляет HeyGen Voice. Разрыв составляет 16 Elo с Qwen-Audio-3.1-TTS-Plus и 35 с Eleven v4 Turbo, при заявленном 95% доверительном интервале примерно от 1 185 до 1 219 для показателя HeyGen. Шестнадцать Elo — это реальный разрыв, но не пропасть: на такой плотной таблице это разница между первым и вторым местом, а не между пригодным и непригодным.

Где HeyGen Voice пока не включён в рейтинг
Честная сторона этого результата в том, что HeyGen Voice вообще не появляется в списке Provider Voices, и его отсутствие не является сигналом о качестве. Artificial Analysis отмечает, что модели могут быть исключены из-за того, что у них ещё недостаточно голосов. Модель, которой всего несколько дней, с единственной по-другому оценённой ареной за плечами, просто ещё не набрала объём слепых прослушиваний, необходимый для более крупного рейтинга.
Итак, правильная интерпретация по состоянию на 10 октября 2026 года такова: HeyGen Voice — голос, занявший первое место в контролируемом сравнении клонированных голосов, и неизвестная величина на фоне более широкого поля участников. Любой, кто цитирует «лучшую TTS-модель в мире», опираясь на этот показатель, цитирует меньшую таблицу лидеров, чем подразумевает это утверждение.

Два числа, стоящие за Elo
• Контролируемый голосовой Elo — HeyGen Voice: 1 202 (95% ДИ примерно 1 185–1 219). Qwen-Audio-3.1-TTS-Plus: 1 186. Eleven v4 Turbo: 1 167.
• Elo голосов провайдеров — HeyGen Voice: не указан (недостаточно голосов). Eleven v4 Turbo: 1 328 на 1-м месте. Sonic 3.6: 1 280 на 4-м месте.
• Место в контролируемом поле — HeyGen Voice: №1 из 42 ранжированных записей (№42 — OpenVoice v2 с показателем 812).
• Цена по методике арены — HeyGen Voice: $30.00 за 1 млн символов — собственный пересчёт ареной кредитной цены HeyGen. Qwen-Audio-3.1-TTS-Plus: $19.30 за 1 млн символов. Eleven v4 Turbo: $40.00 за 1 млн символов.
• Опорная точка Elo — OpenAudio S1 — это фиксированная точка отсчёта на уровне 1 000, поэтому HeyGen Voice находится на 202 балла выше опорной точки.
• Кто ещё в первой пятёрке — Eleven v4 с 1 160 и Sonic 3.6 с 1 143 замыкают первую пятёрку вслед за лидерами.

Что HeyGen на самом деле выпустил
Движок, лежащий в основе этой записи, — это собственный TTS-движок HeyGen, доступный через API v3 компании. Вызов GET /v3/voices принимает engine-фильтр, значения которого включают orca — собственный голосовой движок HeyGen — наряду с starfish и сквозным доступом к голосам ElevenLabs. Синтез речи выполняется через POST /v3/voices/speech; настройка для каждого запроса предоставляет speed от 0,5 до 1,5 и pitch от −50 до +50 полутонов, с BCP-47 locale-подсказкой.
В каталоге указано более 300 готовых голосов на десятках языков. Пользовательские голоса бывают трёх видов: создание голоса по текстовому описанию, которое генерирует до трёх ранжированных вариантов на основе описания длиной не более 1 000 символов, мгновенный клон по одной записи и профессиональный клон, обученный на двадцати минутах аудио или более. Последний вариант — это именно то, что фактически стресс-тестирует таблица лидеров Controlled Voice: те восемь эталонных голосов являются клонами, а именно качество клонов и отличает TTS-движки друг от друга.
В документации также указано, что движки можно выбирать для каждого голоса, а значит, HeyGen не заставляет вас использовать именно её модель: вы можете через её API направлять запросы к стороннему голосовому движку, если предпочитаете другой. Это вендор, который снижает риски, связанные с собственной моделью, и об этом стоит знать, когда вы читаете утверждение о «голосе №1» от HeyGen.
Что это меняет для тех, кто выбирает голос
Из получения результата контролируемого голоса вытекают три практических следствия, и ни одно из них не означает «переключить всё».
Во-первых, если ваш сценарий использования — клонированный голос бренда (один говорящий, множество реплик), то теперь именно эту таблицу стоит смотреть, и HeyGen Voice — модель, которую следует протестировать первой. Лидерборд, в котором голос остаётся неизменным, измеряет именно то, чем вы на самом деле будете заниматься.
Во-вторых, если ваш сценарий использования предполагает широкий набор персонажей, звучащих как носители языка, на языках, которые ваш клон не охватывает, таблица Provider Voices и её девяносто шесть записей по-прежнему остаются актуальным ориентиром, а HeyGen Voice пока не занимает там никакого места. Ничто в результате клонированного голоса не говорит о том, как движок справляется с сотней разных голосов.
В-третьих, у цены теперь есть число, но не то, которое опубликовал поставщик. Арена указывает HeyGen Voice по цене $30.00 за 1 млн символов — это пересчёт Artificial Analysis для системы кредитов, которую собственная страница HeyGen никогда не переводит в расценку за голос. Так новый лидер оказывается ниже $40.00 у Eleven v4 Turbo и выше $19.30 у тарифа Qwen — цена середины поля, привязанная к баллу за первое место, и притом выведенная, а не заявленная.
Вопрос маршрутизации
У выбора голоса есть свойство, которого нет у большинства выборов моделей: ошибка слышна конечному пользователю в пределах слога. Это делает миграцию дешёвой для тестирования и дорогой при ошибке в продакшене. Запуск нового движка за тем же интерфейсом, что и у текущего, — одна поверхность API, один ключ, прайс-листовая цена провайдера передаётся как есть, без наценки, с автоматическим переключением на второго голосового провайдера при сбое запроса — это способ получить реальный ответ о вашем собственном аудио вместо ответа графика Elo о восьми эталонных голосах. Слой маршрутизации OrcaRouter существует именно для такого рода решений: поставить претендента на долю трафика, держать текущего в тепле и позволить аварийному переключению покрыть окно, где новая модель не проверена. Таблица лидеров говорит, куда смотреть. Она не может сказать, как звучит ваш сценарий.
Что посмотреть дальше
Два числа поставят точку в этой истории. Первое — наберёт ли HeyGen Voice достаточно голосов, чтобы попасть в таблицу Provider Voices, и на каком месте оно окажется относительно 1,328 у Eleven v4 Turbo — модели, которая лидирует в этой таблице, но отстаёт на контролируемой арене; именно этот разрыв и призваны выявлять обе таблицы. Второе — публикует ли HeyGen собственный тариф на голос, чтобы полученные на арене $30.00 можно было сверить с цифрой от поставщика, а не выводить её из кредитов. Пока не появится и то, и другое, дебют на первом месте в контролируемой таблице — это сильное заявление о качестве клонированного голоса и открытый вопрос обо всём остальном.
