Сгенерированная hero-карточка под названием «HeyGen Voice vs Qwen-Audio-3.0-TTS», показывающая разрыв в 79 пунктов по Elo для контролируемого голоса на фоне двух цен за миллион символов, с примечанием, что одна цена опубликована поставщиком, а другая — производная конверсия кредитного ценообразования, рассчитанная ареной, по данным Artificial Analysis, 9 октября 2026 года. Логотип OrcaRouter отображается в правом нижнем углу.
Engineering & Research

HeyGen Voice против Qwen-Audio-3.0-TTS: за что вы платите ради Elo и какой уровень Qwen вы на самом деле тестировали в бенчмарке

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Сначала проведите расчеты, потому что расклад не так перекошен, как предполагает табло. Qwen-Audio-3.0-TTS-Plus стоит $19,30 за миллион символов на платформе Model Studio — тариф, который публикует поставщик. HeyGen Voice стоит $30,00 за миллион символов в собственной таблице цен Artificial Analysis — цифра, которую сайт выводит из расценок HeyGen на кредиты, поскольку публичная страница цен HeyGen продает кредиты, не указывая, сколько расходуется на одну генерацию голоса. Между тем разрыв между ними по контролируемому голосу составляет 79 Elo: HeyGen Voice набрал 1 202 в арене, где все восемь эталонных голосов остаются неизменными, а Qwen-Audio-3.0-TTS-Plus — 1 123. Таким образом, более дешевая модель стоит заметно ниже более качественной, соотношение между ними примерно 1,55×, и только одна из этих двух цен — это число, под которым поставил свое имя продающий ее поставщик.

Ловушка в имени

Прежде чем делать что-либо из этого, правильно определите уровень, потому что это семейство охотно позволит вам протестировать не ту модель. Здесь важны две позиции Alibaba, и они не взаимозаменяемы.

Qwen-Audio-3.0-TTS-Plus — это модель, с которой сравнивается в этой статье. Он набирает 1 123 балла в контролируемом рейтинге — седьмое место из сорока двух — и 1 264 в рейтинге Provider Voices, где он занимает шестое место из девяноста шести. Это реальный, актуальный, потоковый TTS-продукт с опубликованным тарифом $19.30 за миллион символов.

Qwen-Audio-3.1-TTS-Plus — это его преемник по уровню, и именно он занимает второе место в контрольной таблице с 1 186 — модель, которая ближе всех подошла к тому, чтобы обойти HeyGen Voice на дебюте. Его цена указана на том же уровне — $19.30, хотя документация Alibaba предупреждает, что разные версии модели требуют совместимых голосов, поэтому «та же цена, более новый уровень» не означает «замена без изменений».

Любой, кто прочитает «#1 впереди Qwen», а затем протестирует Qwen-Audio-3.0-TTS, будет тестировать модель на 63 Elo слабее, чем та, о которой была статья. Эта придирка к уровню стоит 63 балла, что больше, чем разрыв между HeyGen Voice и третьим местом.

Табло

A generated two-column scoreboard titled 'HeyGen Voice vs Qwen-Audio-3.0-TTS — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Provider Voices Elo: not ranked', 'Price per 1M characters: $30.00, arena conversion of credit pricing', 'Cost of 100 hours of narration: roughly $1,440, derived', 'Voice control: design from a description, instant clone, professional clone' and 'Audio output: speed 0.5 to 1.5, pitch plus or minus 50 semitones'. The Qwen-Audio-3.0-TTS-Plus column reads 'Controlled Voice Elo: 1,123, #7 of 42', 'Provider Voices Elo: 1,264, #6 of 96', 'Price per 1M characters: $19.30 on Alibaba Cloud', 'Cost of 100 hours of narration: roughly $926', 'Voice control: instruction parameter, emotion and language tags, cloning and design' and 'Audio output: PCM, WAV, MP3 and Opus up to 48kHz'. A footer states that the Qwen price is Alibaba Cloud Model Studio's published rate at default settings while the HeyGen figure is the arena's conversion of credit pricing.

• Контролируемый Voice Elo (те же 8 клонированных голосов) — HeyGen Voice: 1 202, №1 из 42. Qwen-Audio-3.0-TTS-Plus: 1 123, №7.

• Elo голосов провайдеров (нативные голоса) — Qwen-Audio-3.0-TTS-Plus: 1 264, №6 из 96. HeyGen Voice: без рейтинга.

• Цена за 1 млн символов — Qwen-Audio-3.0-TTS-Plus: $19,30, цена опубликована вендором в Alibaba Cloud. HeyGen Voice: $30,00 по собственному пересчёту арены на основе кредитных цен; HeyGen не публикует тариф на голос.

• Стоимость 100 часов озвучивания — Qwen-Audio-3.0-TTS-Plus: примерно $926 при ~480 000 символов на час озвученной речи. HeyGen Voice: примерно $1 440 по курсу арены в $30,00 — получено расчётом, а не взято из тарифа.

• Управление голосом — Qwen-Audio-3.0-TTS-Plus: параметр instruction, теги эмоций и языка, клонирование голоса и дизайн голоса. HeyGen Voice: дизайн голоса по текстовому описанию длиной до 1000 символов, мгновенный клон, профессиональный клон, обученный на 20+ минутах.

• Выход — Qwen-Audio-3.0-TTS-Plus: PCM, WAV, MP3 и Opus с частотой до 48 кГц, с регулируемыми темпом, высотой тона, громкостью и битрейтом. HeyGen Voice: скорость 0.5–1.5 и высота тона ±50 полутонов на запрос.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' with HeyGen Voice first at 1,202 Elo, Qwen-Audio-3.1-TTS-Plus second at 1,186 and Qwen-Audio-3.0-TTS-Plus seventh at 1,123, alongside samples, release dates and per-1M-character API pricing columns showing $30.0 and $19.3 respectively.

Что на самом деле даёт вам инженерная команда Alibaba

Семейство Qwen-Audio-3.0-TTS — это стриминговый продукт, и документация написана в том же ключе. Запросы передаются по протоколу WebSocket, общему с CosyVoice, с потоком событий run-task, continue-task и finish-task, а также с сопутствующими ответами task-started, result-generated, task-finished и task-failed. Отмена поддерживается для всех моделей Qwen-Audio-TTS как в регионе Пекин, так и в регионе Сингапур, с помощью streaming_cancel(). Выходной сигнал достигает 48 кГц, а форматы включают Opus, что важно, если вы передаёте аудио в браузер или в телефонный звонок, а не в WAV-файл.

Две детали в этой документации легко упустить, и их позднее обнаружение обходится дорого. Теги эмоций и богатого языка применяются только к уровням Plus и Flash — не ко всему семейству — и работают только в режиме односторонней потоковой передачи. И API-ключи различаются для регионов Сингапур и Пекин, при этом рабочие пространства адресуются по URL вида wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference. Региональные ключи — это деталь конфигурации до того дня, когда они приведут к сбою.

У HeyGen иная форма продукта: API v3 в стиле REST, где POST /v3/voices/speech синтезирует речь, GET /v3/voices выводит каталог, отфильтрованный по engine-фильтру, а дизайн голоса возвращает до трёх ранжированных вариантов по текстовому запросу с seed для воспроизводимости. Документация также показывает, что engine-фильтр принимает значения за пределами собственных значений HeyGen — поэтому HeyGen с радостью направит вас к стороннему голосовому движку через свой API. Поставщик, который поставляет модель конкурента как выбираемый вариант, тем самым говорит вам кое-что о том, где, по его мнению, находится его собственная сила.

A screenshot of HeyGen's public landing page, captured 10 October 2026, showing the headline 'The video you imagine, delivered into your system.' with the line about orchestrating avatars, voices, images, editing, music and assets into deterministic, repeatable renders.

Куда уходит 79 Elo

Разрыв в 79 пунктов на контролируемой таблице лидеров значителен — он больше, чем преимущество в 16 пунктов, отделяющее HeyGen Voice от второго места, и примерно соответствует расстоянию между третьим и восьмым местами в этом поле. При этом он измеряется по одной оси.

Контролируемая арена клонирует восемь голосов и фиксирует их. Она ничего не говорит об управляемой инструкциями поверхности управления, которую предоставляет Qwen, ничего о выводе Opus с частотой 48 кГц через WebSocket с возможностью отмены и ничего о региональном развёртывании. Это инженерные свойства, и именно поэтому команда, создающая контакт-центр для мандаринского языка, не стала бы переходить на модель, которая набирает на 79 баллов больше на восьми эталонных англоязычных голосах.

То, что контролируемый результат на самом деле говорит, — это более узкое, но всё ещё полезное утверждение: когда обоим движкам дают один и тот же клонированный голос, слушатели предпочитали рендеринг HeyGen Voice. Если ваш продукт клонирует голоса, это ваша ось. Если ваш продукт выбирает голос из каталога и передаёт его потоком в звонок, таблица провайдеров ближе к вашей реальности — и там HeyGen Voice вообще не имеет ранга, тогда как Qwen-Audio-3.0-TTS-Plus занимает шестое место из девяноста шести.

Аргумент о цене, рассмотренный всерьёз

При $19,30 за миллион символов Qwen-Audio-3.0-TTS-Plus стоит примерно вдвое дешевле тарифа ElevenLabs за $40 и около 40% от $49 у Cartesia Sonic 3.6. Для объёма работы в 100 часов озвучки — около 48 миллионов символов при типичной скорости речи — это порядка $926. Тот же объём на Eleven v4 Turbo обошёлся бы примерно в $1,920, а на Sonic 3.6 — примерно в $2,352. HeyGen Voice при цене $30,00 на арене оказывается около $1,440: между дешёвым тарифом и двумя лидерами рынка, ближе к середине, чем к верхнему краю.

У этой арифметики есть оговорка, которая не нужна остальным. $19,30 — это собственный опубликованный тариф Alibaba. $30,00 — это пересчёт Artificial Analysis для системы кредитов, которую HeyGen никогда не переводил в символы, поэтому это добросовестная оценка, а не котировка. Если реальное соотношение символов на кредит хуже, чем предполагает график, преимущество в 79 пунктов Elo обходится дороже, чем подразумеваемые 1,55×; если лучше — дешевле. Модель, цену которой приходится выводить, — это модель, которую вы запускаете в пилотном режиме на измеренном срезе трафика, а не та, которую вы выбираете в качестве стандарта. Это не критика движка — это описание информации, доступной на 10 октября 2026 года.

Решая

Выбирайте Qwen-Audio-3.0-TTS-Plus, когда решение определяется стоимостью и инфраструктурой стриминга. Менее $20 за миллион символов, отменяемый WebSocket с выводом Opus 48 кГц, параметр инструкции и теги эмоций, а также шестое место в рейтинге провайдеров делают его самым экономичным из хорошо оценённых голосов в этом сравнении. Вместо него возьмите уровень 3.1, если вам нужна модель, которая на самом деле заняла второе место в контролируемом рейтинге, и проверьте список голосов, прежде чем предполагать, что замена бесплатна.

Проверьте HeyGen Voice, когда точность клонирования — это и есть продукт. Один диктор, множество строк, голос, который каждый раз должен быть *именно тем* голосом, — это та ось, которую измеряет контрольная панель, и та ось, по которой он опережает всех в этой области. Предусмотрите в бюджете период измерений, потому что модель с кредитами означает, что свою реальную стоимость вы узнаете, прогнав собственный текст, а не прочитав тарифную сетку.

И полностью игнорируйте это сравнение, если рабочая нагрузка — на китайском языке и в реальном времени. Ни одно из чисел Elo не измерялось на ваших голосах, на вашем языке или при вашем бюджете задержки.

Оставляя оба доступными

Это одна из комбинаций, где слой маршрутизации оправдывает своё место, а не является приделанным сбоку. Один ключ API, покрывающий обоих поставщиков — прайс-лист провайдера передаётся без наценки, поэтому опубликованные Alibaba $19.30 — это то, что вы платите, а изменение цены Qwen вступает в силу в тот же день, — устраняет необходимость выбирать победителя до того, как у вас появятся доказательства. Автоматическое переключение при сбое покрывает очевидный риск в голосовом конвейере, где зависший поток слышен слушателю, а DSL маршрутизации позволяет направлять массовую озвучку в дешёвый движок, а критичные для клонирования строки — в тот, что набирает на 79 пунктов больше, без двух клиентских библиотек и двух биллинговых отношений. Ценность OrcaRouter здесь не в том, что он размещает голосовую модель; она в том, что он делает стоимость выяснения того, какая из них вам нужна, практически нулевой.

Открытые вопросы

Три вещи решили бы этот вопрос. Ставка за голос на собственной странице тарифов HeyGen превратила бы $30.00, которые выводит арена, в число, которое можно проверить. Запись HeyGen на табло Provider Voices сказала бы нам, сохраняется ли преимущество клонированного голоса перед нативными голосами — тест, который Qwen-Audio-3.0-TTS-Plus проходит на шестом месте из девяноста шести. А результат для контролируемого голоса Qwen-Audio-3.1-TTS-Plus против HeyGen Voice после большего числа голосов сказал бы нам, является ли 16 Elo стабильным упорядочением. До тех пор: Qwen — это вариант с указанной ценой, пригодный для потоковой передачи и хорошо ранжированный; HeyGen Voice — вариант с более высоким баллом, но без указанной цены; и уровень, который вы тестируете, важнее заголовка, который вы читаете.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube