
Eleven v4 возглавляет Voice Arena: что на самом деле выиграл новый флагман ElevenLabs
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 983 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 196 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
ElevenLabs Eleven v4вышла 28 сентября и сразу заняла первое место в Provider Voice Arena от Artificial Analysis с Elo 1 319 — на 43 балла опередив Cartesia Sonic 3.6 с её 1 276 и на 52 — Google Gemini 3.8 Flash TTS с 1 267. И там же, при цене $80,00 за миллион символов, это самая дорогая модель в первой десятке. А во второй арене — той, что построена на клонированных голосах, а не на собственных голосовых наборах каждого вендора, — она вовсе не побеждает: она финиширует второй, уступая модели, которая стоит вчетверо дешевле. И то, и другое верно, а самое полезное в этом запуске — понять, под какой из этих сценариев попадает ваш случай использования.
Что на самом деле было выпущено 28 сентября?
ElevenLabs выпустила в общий доступ две модели, а не одну. ElevenLabs Eleven v4 — флагманская модель синтеза: компания называет её самой эмоциональной, а в её документации указан лимит ввода в 10 000 символов на запрос и поддержка более 90 языков. ElevenLabs Eleven v4 Turbo — низколатентный собрат: те же 90 с лишним языков, лимит в 10 000 символов и поддержка встроенных аудиотегов, которые позволяют вписать указание по подаче прямо в сценарий — смех, шёпот, гудок в линии. Обе модели с первого дня доступны в агентных, творческих и API-продуктах компании — это более быстрый запуск, чем был у поколения v3.
Страница анонса — это место, где находится список функций, и, что примечательно, не цены. ElevenLabs описывает новую архитектуру, улучшенную обработку тона, темпа и характера, более надёжный многоголосый диалог со стабильной идентичностью говорящего, улучшенный ввод IPA-фонем и мгновенные клоны голоса, создаваемые из десяти секунд аудио, наряду с существующим уровнем профессионального клонирования. Единственное число на ней — это утверждение о слушателях: вендор заявляет, что в слепых сравнениях v4 предпочитали примерно в трёх четвертях случаев. Это цифра вендора, невоспроизведённая, и её следует читать рядом с числами на табло ниже, а не вместо них.
То, где на самом деле находится ценообразование — страница с ценами на API — является более значимым документом, и она рассматривается ниже. Коротко: этот запуск не является повышением цен.
Две платы, два разных ответа
Artificial Analysis проводит две речевые арены, и они не являются вариациями друг друга. Provider Voice предлагает слушателям сравнивать собственные голоса каждого поставщика. Controlled Voice клонирует одни и те же восемь голосов — четыре американских, четыре британских — для каждого участника, поэтому диктор остаётся неизменным, а меняется только модель. Модель с отличным набором голосов по умолчанию может победить в первой и проиграть во второй. Eleven v4 поступает именно так.
• Provider Voice, Eleven v4 — ранг 1, Elo 1 319, $80.00 за миллион символов, 1 674 образца, восемь голосов арены, сентябрь 2026
• Голос провайдера, Cartesia Sonic 3.6 — 2-е место, рейтинг Эло 1 276, $49.00
• Голос провайдера, Google Gemini 3.8 Flash TTS — ранг 3, Elo 1 267, $16,50
• Provider Voice, предыдущий флагман ElevenLabs Eleven v3 — 18-е место, Elo 1,169, $100.00
• Контролируемый голос, Alibaba Qwen-Audio-3.1-TTS-Plus — ранг 1, Elo 1 178
• Controlled Voice, Eleven v4 — 2-е место, Elo 1 157, $80.00
• Controlled Voice, Cartesia Sonic 3.6 — 4-е место, Elo 1 138
• Контролируемый голос, ElevenLabs Eleven v3 — 7-е место, Elo 1 073
• Controlled Voice, Google Gemini 3.8 Flash TTS — ранг 13, Elo 1 048
• Лучший вариант с открытыми весами на Provider Voice — Breeze TTS 2, Elo 1 206, $34.00

Скачок в линейке — главная новость для всех, кто уже пользуется ElevenLabs: по сравнению со своим предшественником на том же табло Eleven v4 набирает 150 пунктов Elo в Provider Voice и 84 в Controlled Voice. Это поколенческий шаг, а не тонкая настройка, и улучшение больше на табло, где голоса выбирает сам вендор, — что, если говорить честно, означает, что его новый набор голосов по умолчанию действительно составляет часть прироста.

Табло произношения, которое не выразить в цифрах
Artificial Analysis действительно проводит раздел по устойчивости произношения, и его стоит описать должным образом, потому что гуляющая по сети сводка рейтинга описывает Eleven v4 как возглавляющий его. Таблица измеряет долю выделенных фрагментов, которые рецензенты сочли произнесёнными правильно, при этом на каждый клип приходится до трёх рецензентов, а подсказки отправляются точно так, как написаны — без раскрытия чисел, без нормализации текста. Он разбит на подкатегории, и смысл дизайна в том, что модель, которая молча переписывает "Dr." или "$4.50" перед произнесением, намеренно получает низкий балл.
Что не публикует таблица лидеров в том отображении, которое мы могли прочитать, — так это цитируемую числовую оценку по каждой модели. Поэтому там нет цифры, которую можно было бы привести для Eleven v4, а Elo 1 319 относится к предпочтению на арене — тому, насколько слушателям понравился голос, — а не к точности произношения. Если вы видите, что эти две вещи смешивают, то это и есть смешение. Защитимое утверждение из этого запуска — то, которое подкреплено числами: первое место в Provider Voice с 1 319, второе в Controlled Voice с 1 157.
Скидка в честь запуска — вот настоящая новость для вашего счёта.
ElevenLabs пересмотрела цены на новые модели одновременно с их выпуском, и скидка достаточно велика, чтобы сама по себе изменить решение о покупке. На странице цен API Eleven v4 указана по $0,022 за тысячу символов против заявленной цены $0,08 — снижение на 72% — а Eleven v4 Turbo — по $0,011 против $0,04. У обоих одинаковый срок: акция действует до 12 октября. После этого цифры вернутся к прежним, и возвращённая цена v4 — $0,08 — будет вдвое выше, чем сегодня стоит собственная v3 от ElevenLabs. Планируйте исходя из цены после акции, а не из акционной.
Пересмотр цен также меняет позицию v4 относительно конкурентов в расчёте за символ, что нормализация арены уже показывает на уровне $80.00 за миллион. Sonic 3.6 там стоит $49.00, Breeze TTS 2 — $34.00, Qwen-Audio-3.0-TTS-Plus — $19.30, а Gemini 3.8 Flash TTS — $16.50. По промо-тарифу Eleven v4 за $22 за миллион напрямую обходит Sonic 3.6. По тарифу из прайс-листа это самый дорогой голос в таблице с большим отрывом. Всем, кто составляет бюджет на Q1, стоит смотреть на второе число.

Проработанный месяц делает разницу наглядной. При пяти миллионах символов — а это продукт среднего размера, озвучивающий примерно сто часов речи — Eleven v4 в течение окна стоит $110. При возвращённых $0.08 он стоит $400. Sonic 3.6 стоит $245. Gemini 3.8 Flash TTS стоит $82,50. Тот же месяц на собственном v3 от ElevenLabs тоже стоит $400 — и это тот странный факт, который лежит в основе этого запуска: следующие две недели новый флагман дешевле модели, которую он заменяет, а в день закрытия окна он перестаёт быть дешевле и становится просто лучше.
Утверждение о задержке исходит от поставщика и зависит от уровня.
ElevenLabs публикует показатели задержки по уровням, а не по семействам моделей, и это измерения, которые компания провела сама, а не независимые данные. Для Eleven v4 Turbo указано примерно 100 мс медианного инференса и около 150 мс медианного времени до первой речи, измерено в сентябре 2026 года. Для Eleven v3 Conversational указано около 280 мс, а для более старых уровней Flash и Turbo — около 75 мс. В документации не публикуется аналогичный показатель для самого Eleven v4, а ведь именно этот уровень вам нужен, если вы создаёте агента реального времени и читаете спецификацию, а не тестируете.
Cartesia заявляет о задержке менее 90 мс для Sonic и описывает его как занявшего первое место по естественности, с клонированием голоса по десяти секундам аудио, пользовательскими словарями произношения и набором соответствия требованиям, охватывающим HIPAA, SOC 2 Type 2, GDPR и PCI. Это собственные заявления вендора на его собственной странице продукта — та же категория доказательств, что и цифры уровней задержки у ElevenLabs, и они не взаимозаменяемы с Elo арены. Напрямую двух вендоров можно сравнивать только на лидербордах.
Что это значит для вас и как это попробовать
Если вы выбираете голос для продукта, где набор голосов по умолчанию — это то, что слышат ваши пользователи, то именно результат Provider Voice имеет значение, и Eleven v4 только что занял первое место, причём на две недели прилагается скидка. Если вы клонируете голос конкретного человека и каждую модель-кандидата просят воспроизвести одних и тех же восемь дикторов, то именно таблица Controlled Voice имеет значение, а Eleven v4 — на втором месте: на 21 Elo позади лидера и, по прейскурантной цене, стоимость за символ более чем в четыре раза выше. Ни один из результатов не является неправильным; это ответы на разные вопросы, и второй из них — это тот вопрос, который на самом деле ставит большинство задач по клонированию голоса в продакшене.
OrcaRouter не размещает у себя ElevenLabs, Cartesia и других вендоров из этих таблиц, так что здесь нечего вызывать через нас, и мы не будем намекать на обратное. Что мы действительно предлагаем — это сопутствующую инфраструктуру, если ваш речевой стек в итоге охватывает нескольких провайдеров: один API-ключ для более чем 200 моделей, где прайс-листовые цены провайдеров передаются с наценкой 0%, так что снижение цены вендором — включая промо-период, подобный этому, — вступает в силу у нас в тот же день, а не в следующем расчётном цикле. Там, где речевой маршрут критичен для продакшена, автоматическое переключение при сбое переводит на работоспособный апстрим, когда один из них деградирует, и это практичный способ протестировать совершенно новый эндпоинт, не ставя на него релиз.
Дата, которую стоит внести в календарь, — 12 октября. Именно тогда Eleven v4 перестаёт быть самым дешёвым хорошим голосом на рынке и становится самым дорогим, и любое сравнение, написанное на этой неделе, в котором приводится $22 за миллион без упоминания об этом, — это сравнение, которое стоит провести заново через три недели.
