Карточка-герой для «ElevenLabs Eleven v4 vs Qwen-Audio-3.1-TTS-Plus» с двумя карточками результатов: Qwen-Audio-3.1-TTS-Plus — Elo 1 178, ранг 1 и $19,30 за 1 млн символов; ElevenLabs Eleven v4 — Elo 1 157, ранг 2 и $80,00 за 1 млн символов; с подписью «21 пункт Elo при четырёхкратном разрыве в цене». Нижний колонтитул: «Controlled Voice Arena, по данным Artificial Analysis, сентябрь 2026 г.» Логотип OrcaRouter расположен в правом нижнем углу.
Engineering & Research

Eleven v4 против Qwen Audio 3.1: самый дешёвый голос в списке победил

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

На табло, где каждому участнику дают одни и те же восемь клонированных голосов, Alibaba Qwen-Audio-3.1-TTS-Plus занял первое место с Elo 1 178, а ElevenLabs Eleven v4 занял второе место с 1 157. Модель, которая победила, стоит 19,30 доллара за миллион символов на этом табло. Модель, занявшая второе место, стоит 80,00 долларов. Это разрыв в 21 пункт по качеству и четырёхкратный разрыв в цене, указывающие в противоположные стороны, и это самый интересный результат за всю неделю запуска — интереснее, чем первое место, доставшееся ElevenLabs на другой арене, потому что там порядок обычный, и победитель — самый дорогой голос в первой десятке.

Две эти таблицы лидеров не взаимозаменяемы, и причина, по которой это противостояние выглядит именно так, целиком в том, на какую из них вы смотрите. В Provider Voice слушатели оценивают собственные голоса каждого вендора. Controlled Voice клонирует одни и те же восемь голосов — четыре американских, четыре британских — для каждой модели, так что никто не может выиграть за счёт набора голосов по умолчанию. ElevenLabs выигрывает первую с отрывом в 61 балл. Alibaba выигрывает вторую с отрывом в 21 балл. Ни одна из таблиц не ошибочна, и именно вторая предсказывает продукт, который выйдет с клонированным голосом бренда.

A two-column scoreboard for Qwen-Audio-3.1-TTS-Plus and ElevenLabs Eleven v4. Qwen: Controlled Voice rank 1 Elo 1,178; Provider Voice rank 4 Elo 1,258 on the 3.0 build; $19.30 per 1M chars; rate card not publicly readable; 3.1 on one board and 3.0 on the other; documentation not readable publicly. Eleven v4: Controlled Voice rank 2 Elo 1,157; Provider Voice rank 1 Elo 1,319; $80.00 per 1M chars; $0.022 per 1K until Oct 12; v4 on both boards; 90-plus languages and a 10,000-character cap. Footer: 'All ranks, Elo and board prices per Artificial Analysis; Qwen rate card not readable.'

Табло с голосовым управлением, полностью

• Слепое предпочтение, сопоставленные клоны — Qwen-Audio-3.1-TTS-Plus на 1-м месте, Elo 1 178, $19.30 за миллион символов против Eleven v4 на 2-м месте, Elo 1 157, $80.00.

• Слепое предпочтение, собственные голоса каждого вендора — Eleven v4 на 1-м месте, Elo 1 319 против Qwen-Audio-3.0-TTS-Plus на 4-м месте, Elo 1 258. Разрыв в 61 пункт в обратную сторону.

• Цена, нормализация арены — Qwen $19.30 против Eleven v4 $80.00. Qwen дешевле на 76%.

• Цена, прайс-лист вендора — Eleven v4: $0,022 за тысячу символов по промоакции и $0,08 после 12 октября. Собственный прайс-лист Qwen Audio 3.1 нам прочитать не удалось, поэтому нормализация арены — единственная цена, по которой мы можем сравнивать.

• Версия на каждой плате — 3.1 на Controlled Voice, 3.0 на Provider Voice. Это разные модели, и платы не взаимозаменяемы.

• Запись 3.0 в Controlled Voice — 5-е место, Elo 1 124, та же цена $19.30. Релиз 3.1 превосходит собственного предшественника на 54 Elo при идентичной цене.

• Ранние поколения Qwen на Provider Voice — Qwen3 TTS Flash занимает 79-е место, Elo 944; Qwen3 TTS занимает 82-е место, Elo 930.

• Предыдущий флагман самой ElevenLabs в рейтинге Controlled Voice — Eleven v3, 7-е место, Elo 1 073.

• Проверка на адекватность по группированной столбчатой диаграмме — разброс между восемью участниками с 1-го по 10-е место в Controlled Voice составляет 121 Elo. Преимущество Qwen в 21 пункт над Eleven v4 — меньше пятой части размаха всего поля, и это правильный масштаб, чтобы удерживать его в таких пределах.

A screenshot of the Artificial Analysis Controlled Voice Arena leaderboard, captured in English, showing Alibaba Qwen-Audio-3.1-TTS-Plus first at Elo 1,178 and $19.3 per 1M chars with 1,269 samples, ElevenLabs Eleven v4 second at Elo 1,157 and $80.0 with 1,483 samples, Cartesia Sonic 3.6 fourth at Elo 1,138, and Alibaba Qwen-Audio-3.0-TTS-Plus fifth at Elo 1,124 at the same $19.3 price, over the page subtitle 'Compare Text to Speech (TTS) models using the same 8 cloned voices (4 US, 4 UK)'.

Основную работу там делают две строки. Первая — сравнение 3.0 и 3.1: Alibaba прибавила 54 пункта Elo за одно обновление версии, вообще не изменив цену. Это более быстрый темп, чем переход ElevenLabs с v3 на v4, принёсший 84 пункта, и это означает, что конкретный порядок мест в этой статье — всего лишь снимок, который оба поставщика активно перетасовывают.

Второе — общий разброс в 121 балл. Разрыв в 21 балл на табло, полезный диапазон которого составляет около 120 баллов, — это реальное, но скромное различие, примерно того же масштаба, что и разрыв между собственными версиями Qwen 3.1 и 3.0. Если ваш сценарий использования относится к языку, под который не настраивалась ни одна из моделей, этот разрыв вполне может быть нивелирован несколькими сложными тестовыми скриптами.

Проблема с версиями, на которую никто не указывает

Результат, который распространяется как «Eleven v4 занимает второе место в Controlled Voice», точен и неполон, и это упущение важно для всех, кто планирует, опираясь на него. Модель, стоящая выше Eleven v4 в этой таблице, — это релиз Alibaba 3.1. Запись Qwen в таблице Provider Voice, тем временем, относится к релизу 3.0 — модель 3.1 не появляется в верхних строках этой таблицы в том виде, как мы её читаем. Таким образом, два заголовка — «Eleven v4 — номер один» и «Eleven v4 — номер два» — представляют собой утверждения о двух разных моделях Qwen в двух разных задачах, и версия Qwen, которая обошла Eleven v4 в одной таблице, — это не та версия Qwen, которую Eleven v4 обошла в другой.

Это не камень в огород ни одного из вендоров; это повод не доверять любому резюме такой недели, умещающемуся в одно предложение. Если вы выбираете между этими двумя системами, нужное вам сравнение — это 3.1 против v4 на вашем собственном клонированном голосе, на вашем собственном языке, и ни один из вендоров этого не опубликовал.

Что мы можем и чего не можем сказать о Qwen Audio 3.1

Честность в отношении доказательств здесь ценнее, чем полная таблица характеристик, поэтому вот граница того, на чём держится эта статья. По данным табло арены, для Qwen-Audio-3.1-TTS-Plus у нас есть: Elo для контролируемого голоса — 1 178, нормализованная цена — 19,30 доллара за миллион символов, а также тот факт, что это текущий релиз в линейке, предыдущая версия которой набрала на 54 балла меньше при той же цене.

Мы не располагаем — и не будем строить догадки — о том, каково его языковое покрытие, какова его задержка, каков лимит ввода на один запрос, поддерживает ли он встроенные директивы подачи, предлагает ли он клонирование голоса сверх восьми голосов арены и что он тарифицирует по собственной тарифной сетке. Всё это задокументировано для Eleven v4 — более 90 языков, ограничение в 10 000 символов, аудиотеги, мгновенные клоны за десять секунд, поддержка фонем IPA, — а их отсутствие на стороне Qwen — это пробел в общедоступной информации, а не минус модели. Решение о покупке, принятое только на основании этой статьи, было бы решением, принятым на основании двух цифр.

A screenshot of Artificial Analysis' Eleven v4 model page, captured in English, headed 'Eleven v4 Quality Elo, Speed & Price Analysis' and labelled 'ElevenLabs, Family ElevenLabs, Elo 1318.77', with the Provider Voice Arena Preference Elo chart showing Eleven v4 first at 1,319 ahead of Sonic 3.6 at 1,276 and Gemini 3.8 Flash TTS at 1,267, a '27 of 96 models' selector, and the Pricing section heading below.

Одно противопоставление всё же сохраняется, несмотря на это ограничение, поскольку обе стороны заявлены поставщиком или обе заявлены лидербордом. По цене нормализация лидерборда является общим знаменателем, и она даёт преимущество Qwen на 76%. По качеству при сопоставимых говорящих тот же лидерборд даёт преимущество Qwen на 21 Эло. Эти две строки сопоставимы. Всё остальное здесь не является таковым, и статья не будет делать вид, что это не так.

Почему контролируемый совет должен иметь больший вес, чем обычно

Большинство сравнений голосов по умолчанию опираются на тот рейтинг, который ставит на верхнюю строчку модель, которая вам уже нравится. В этом противостоянии есть принципиальная причина предпочесть Controlled Voice, и она конкретная, а не общая.

Alibaba и ElevenLabs соревнуются с совершенно разными активами. Преимущество ElevenLabs — библиотека голосов, созданная за годы тщательно курируемого кастинга; преимущество Alibaba — исследовательская организация, выпускающая версии моделей в быстром темпе. Таблица лидеров, которая позволяет каждому участнику привести собственные голоса, измеряет библиотеку в той же мере, что и синтезатор, и на этой таблице ElevenLabs побеждает с отрывом в 61 балл. Уберите библиотеки — одни и те же восемь клонированных дикторов для всех — и преимущество переходит к другой стороне. Если голос, который слышат ваши пользователи, — это клон конкретного человека, вы покупаете не библиотеку ElevenLabs, поэтому именно контролируемая таблица описывает вашу покупку. Если вы выбираете из меню стандартных голосов, всё наоборот, и отрыв Eleven v4 в 61 балл — это та цифра, которая имеет значение.

Есть вторая, менее удобная причина придавать вес контролируемому результату. Лидерборд с голосами вендоров вознаграждает характерный набор голосов по умолчанию, а характерный набор может поляризовать так, как средний Elo скрывает: то, что один слушатель сочтёт характерным, другой — манерным. Лидерборд с клонированными голосами и согласованными дикторами полностью устраняет эту переменную, что делает его более воспроизводимым измерением из двух.

Запуск любого из них, и то, что мы фактически маршрутизируем

OrcaRouter не размещает ни речевые модели ElevenLabs, ни речевые модели Alibaba. Ни один из этих поставщиков не представлен в нашем каталоге, поэтому вызвать любого из них через нас невозможно, и эта статья не будет утверждать обратное — для обоих вы обращаетесь к собственному API поставщика и нескольким сторонним платформам.

Что мы действительно покрываем — так это уровень выше. Если ваш речевой стек — лишь один узел в более крупном пайплайне, мы предоставляем более 200 моделей через единый ключ API, а прайс-листовые цены провайдеров передаются как есть, с наценкой 0%, поэтому изменение цен у любого вышестоящего поставщика — включая промо-период ElevenLabs и значительно более высокую цену по прайс-листу, которая последует за ним 12 октября, — отражается на нашей стороне в тот же день, когда оно происходит, а не в следующем расчётном цикле. Для решения, которое зависит от четырёхкратной разницы в цене, эта своевременность — разница между сравнением, которое долго остаётся актуальным, и тем, которое через три недели читается как ошибочное.

А там, где голосовой маршрут не должен выходить из строя, автоматическое переключение при отказе перенаправляет трафик на исправный вышестоящий узел вместо того, чтобы завершить запрос ошибкой. В сравнении, где качество настолько близко, а разрыв в цене настолько велик, разумная архитектура — это обе модели за одним эндпоинтом, где маршрутизация решает, как распределять трафик, а не постоянный выбор, сделанный на основе снимка таблицы лидеров, который оба поставщика аннулируют в течение квартала.

Вердикт и дата его истечения

Выбирайте Qwen-Audio-3.1-TTS-Plus, если вы клонируете голос и следите за расходами. Он первый в таблице, где дикторы остаются неизменными, он примерно вчетверо дешевле, и его линия движется быстрее — 54 Elo за один шаг версии при неизменной цене говорят о том, что следующая версия — более выгодная ставка, чем текущая на бумаге.

Выбирайте Eleven v4, если ваши пользователи слышат стандартные голоса, если вам нужно покрытие языков, которое можно проверить перед выпуском, или если задокументированный набор функций — аудиотеги, управление фонемами, запросы на 10 000 символов, десятисекундные клоны — выполняет в вашем продукте работу, которую не измеряют таблицы арены. Его преимущество в 61 пункт в таблице голосов поставщиков — не пустяк, и две функции, которые можно вписать в скрипт, — это возможности, а не баллы.

Назначьте дату пересмотра. Alibaba сдвинулась на 54 пункта Elo при обновлении версии в этом цикле, а ElevenLabs — на 84 за целое поколение, и промо-тариф Eleven v4 истекает 12 октября. Что бы это сравнение ни говорило сегодня, два факта, которые с наибольшей вероятностью могут его перевернуть, — релиз 3.2 и откат цены — оба произойдут до конца квартала.