
Qwen-Audio-3.1 против ElevenLabs: снижение цены на 70% встречает действующего лидера
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 177 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1323 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Поставщик снизил цену на свой API Qwen-Audio-3.1-TTS примерно на 70% 23 сентября 2026 года, объявив об этом со сцены на конференции Apsara в Ханчжоу вместе с ещё четырьмя речевыми моделями. Эта одна цифра — причина, по которой это сравнение стоит писать: ElevenLabs Eleven v3 был голосом по умолчанию для продакшена у большинства западных команд при эффективной ставке около $100 за миллион символов, а убедительный конкурент только что предложил за ту же работу лишь малую долю от этой цены, одновременно расширив языковое покрытие. Эти две системы не эквивалентны — Qwen-Audio-3.1-TTS — это API, доступный только в хостинговом варианте, от Tongyi Lab этого поставщика, с меньшей экосистемой голосов, тогда как ElevenLabs — это полноценная контент-платформа с самой обширной библиотекой голосов в отрасли. Но если ваше решение когда-либо определял счёт на оплату, то на этой неделе арифметика изменилась.
Что на самом деле вышло 23 сентября?
Qwen-Audio-3.1 — это не одна модель. Это обновление всего речевого стека Alibaba из пяти моделей, и уровни имеют значение, потому что у них разная стоимость и разные задачи:
• Qwen-Audio-3.1-TTS — прямой преемник модели синтеза, которую использует большинство команд. Добавляет семь языков, доводя их общее число до 16, сохраняет 20 региональных китайских диалектов, добавляет естественный межъязыковой перенос тембра (один голос, переносимый между путунхуа, кантонским, английским и японским), управление эмоциями, темпом и стилем подачи на основе инструкций, а также обрабатывает шумное, с эхом или иным образом некачественное опорное аудио без отдельного режима шумоподавления.
• Qwen-Audio-3.1-TTS-Next — новый уровень и другой продукт. Alibaba называет её «Audiogen»-моделью: она генерирует голос, звуковые эффекты и фоновую атмосферу за один проход из текста, временных меток и эталонного аудио. Многоголосые диалоги, подкасты, звуковые ландшафты для кино и ТВ, вывод 48 кГц. Согласно документации Alibaba Cloud Model Studio, она принимает до 3 000 символов входных данных, ограничивает длительность генерируемого аудио 240 секундами для подкастов и 120 секундами в остальных случаях, работает со скоростью 3 запроса в секунду и возвращает WAV, MP3 или PCM.
• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next и Qwen-Audio-3.1-Realtime — распознавание, понимание аудио (эмоции, музыка, звуки окружающей среды, локализация событий) и полнодуплексный диалог соответственно. Именно Realtime Alibaba продвигает в аппаратную часть: Qwen Office, Qoder, QwenNote A2, настольный робот QwenNote Eva и очки Qwen AI.
Снижение цен затронуло всю линейку, а не только TTS: синтез подешевел примерно на 70%, realtime — примерно на 85%, распознавание — вплоть до 95%. Alibaba также открыла исходный код Qwen-Audio-Agent — фреймворка для создания голосовых агентов в реальном времени — и представила Qwen3.8-LiveTranslate с задержкой менее 2,5 секунды.

Табло

• Цена — Qwen-Audio-3.1-TTS: примерно на 70% ниже предыдущего поколения Qwen-Audio, в котором тариф 3.0 Plus стоил около $27,60 за 1 млн символов, а тариф Flash — около $15. ElevenLabs Eleven v3: около $100 за 1 млн символов по данным Artificial Analysis, при этом Flash — примерно $50.
• Языки — Qwen-Audio-3.1-TTS: 16 языков плюс 20 регионов китайских диалектов. ElevenLabs Eleven v3: 74 языка.
• Веса — Qwen-Audio-3.1-TTS: закрытая, размещается только в Alibaba Cloud Model Studio. ElevenLabs Eleven v3: закрытая, размещается только.
• Библиотека голосов — Qwen-Audio-3.1-TTS: нативное клонирование плюс межъязыковой перенос тембра; сопоставимой публичной площадки нет. ElevenLabs: крупнейшая общая библиотека голосов в отрасли, а также мгновенное клонирование примерно из 30 секунд аудио.
• Контроль подачи — Qwen-Audio-3.1-TTS: эмоции, темп и стиль на основе инструкций, наследует 86 встроенных тегов подачи, представленных в версии 3.0. ElevenLabs Eleven v3: аудиотеги плюс окружающая платформа (дубляж, агенты, студия).
• Независимый бенчмарк — Qwen-Audio-3.1-TTS: данных пока нет. ElevenLabs Eleven v3: 1 168 Elo в таблице лидеров Provider Voice Arena от Artificial Analysis по состоянию на август 2026 года.
Где претендент действительно побеждает
Три вещи, и только одна из них — цена.
Цена, очевидно. Снижение на 70% относительно действующего решения с ценой $100 за миллион символов — это не разница на уровне округления. Это разница между продуктом, с которым вы создаёте прототипы, и продуктом, который вы выпускаете для всех пользователей. Если вы генерируете озвучку в больших объёмах, годовая экономия — это не та статья, которую нужно отстаивать внутри компании, — она говорит сама за себя.
Китайский, однозначно. Двадцать диалектных регионов Китая — это ров, к которому ничто из того, что предлагает ElevenLabs, и близко не подходит. Если ваш продукт обслуживает пользователей из материкового Китая, носителей кантонского или аудиторию диаспоры, которая переключается между языками посреди предложения, сравнение заканчивается, не успев начаться.
Перенос тембра между языками. Qwen-Audio-3.1-TTS берёт один голос и естественно переносит его через китайский (мандарин), кантонский, английский и японский. Это конкретная возможность с конкретным сценарием использования — единый брендовый голос, который сохраняется при смене языка, — и это реальное преимущество для всех, кто локализует одного диктора, а не подбирает нового для каждого рынка.
Где ElevenLabs всё ещё выигрывает — и с большим отрывом
Широта языковой поддержки — это первое, и это самое важное. Семьдесят четыре языка против шестнадцати — это не тот разрыв, который закроешь анонсом о ценах. Если вы выпускаете продукт на польском, турецком, вьетнамском и португальском, ElevenLabs уже сегодня покрывает эти языки, а Qwen-Audio-3.1-TTS — нет.
Второе — это экосистема. ElevenLabs — не эндпоинт синтеза, а контент-платформа. Общая библиотека голосов, которую можно лицензировать, а не клонировать, рабочие процессы дубляжа, инфраструктура для агентов, студийный продукт, документированный API, за которым стоят многолетние клиентские библиотеки. Миграция с этого — проект, а не изменение конфигурации, и команды, которые на этом построились, точно знают, от чего им пришлось бы отказаться.
Третье — то, что сложнее назвать, но всё же стоит назвать: восприятие естественности для одного английского голоса. Синтез Qwen исторически был превосходен на китайском и лишь очень хорош на английском, и хотя в выпуске 3.1 заявлено улучшение многоязычного воспроизведения, независимого теста на слух для новой модели пока нет. Любой, кто говорит вам, что знает, как звучит новый голос Qwen на английском, только гадает.
Число, которое пока никому не следует называть
Это та часть истории, которую переврут в репортажах, поэтому вот она без прикрас. Qwen-Audio-3.1-TTS не имеет независимого результата в бенчмарке. Его предшественник, Qwen-Audio-3.0-TTS-Plus, по состоянию на середину августа 2026 года находился на отметке 1 234 Elo в таблице лидеров Provider Voice Arena от Artificial Analysis, располагаясь в этой таблице между вторым и пятым местами. Qwen-Audio-3.1-TTS пока не добавлен ни в одну арену. Все заявления о качестве в материалах запуска Alibaba сообщены производителем и не воспроизведены.
Это не делает эти утверждения ложными. Это делает их непроверенными, и это означает, что честная формулировка этого противостояния на данный момент такова: одна модель с ценой и без оценки против одной модели с оценкой и гораздо более высокой ценой. Всё, что сильнее этого, — это спекуляция, наряженная в одежды бенчмарка.

Та же дисциплина применима и к задержке. Ключевой показатель Alibaba по времени до первого токена для ASR-части этого семейства — 92 миллисекунды — взят из собственного высоконагруженного бенчмарка компании на спецификации 0.6B, а не из сторонних тестов, а опубликованный после запуска анализ отмечает, что ASR и TTS — это отдельные продукты в конвейере, а не единая сквозная модель, и что сообщения сообщества описывают накопление задержки в длинных диалогах при псевдопотоковом режиме. Рассматривайте показатели задержки от вендора по всему этому семейству как верхние границы, а не как измеренный опыт.
Что снижение цены даёт на практике
Возьмём реалистичную нагрузку: продукт, который синтезирует 20 млн символов озвучки в месяц на английском и мандаринском. При расценке ElevenLabs Eleven v3 примерно $100 за миллион символов это около $2000 в месяц, или $24 000 в год. При расценке Qwen-Audio-3.0-TTS-Plus примерно $27,60 за миллион тот же объём уже составлял около $552 в месяц. Если применить объявленное Alibaba 23 сентября снижение на ~70%, та же нагрузка укладывается в первые сотни долларов в месяц.
Ни одна из этих цифр не является прайс-листовой ценой, на которую можно заключить договор — ElevenLabs выставляет счета в кредитах через тарифные уровни подписки, а скидки Alibaba — это процентные снижения относительно тарифов, которые различаются по регионам и по уровням. Но общая картина сравнения однозначна, и именно на неё вы опираетесь при формировании бюджета.
Одно замечание, которое стоит отметить для тех, кто тщательно это моделирует: Alibaba Cloud перевела тарификацию транскрипции в реальном времени на сингапурском узле с тарификации по длительности на тарификацию по токенам — $0.93 за миллион входных токенов и $0.70 за миллион выходных токенов. Тарификация по токенам менее предсказуема, чем тарификация по длительности, когда вы не контролируете, сколько токенов получится из данного фрагмента аудио, а шум, тишина и многоходовой контекст увеличивают потребление токенов. Заявленное снижение на 70% не означает автоматически экономию 70% на вашем конкретном трафике.
Как на самом деле запустить switch
Если вы это оцениваете, полезно знать, во сколько миграция обойдётся вам по инженерному времени. Обе модели — закрытые размещённые API, так что в любом случае вы интегрируетесь с HTTP-эндпоинтом, а работа заключается в клиенте, политике повторных попыток и наборе голосов — а не в перестройке архитектуры.
Именно здесь помогает архитектура OrcaRouter, но сначала одна честная оговорка: мы не маршрутизируем Qwen-Audio-3.1-TTS и вообще никакие модели Qwen-Audio. Речевые эндпоинты Alibaba вне нашей зоны охвата, и то же самое верно для ElevenLabs. Что мы покрываем — это слой инференса вокруг них — один API-ключ для более чем 200 текстовых моделей с наценкой 0%, то есть цена из прайс-листа провайдера передаётся напрямую, так что снижение цены вендором действует у нас в тот же день, а не после цикла пересчёта цен. Для команд, создающих приложение, которое обеспечивает работу речевого пайплайна — суммаризатора, генератора сценариев, планировщика контента — это означает один договор вместо нескольких, автоматическое переключение при сбое, когда вышестоящий сервис деградирует, и DSL маршрутизации для объединения моделей в один вызов. Это не означает, что вы обращаетесь к голосу Qwen через нас. Кто говорит вам обратное, не читал каталог.
Кому следует двигаться, а кому — ждать
Действуйте сейчас, если ваша рабочая нагрузка ориентирована в первую очередь на китайский, если покрытие диалектов входит в список ваших требований, если стоимость объёма — это ограничение, которое удерживало вас на более дешёвом, но худшем голосе, или если вам нужен один фирменный голос, который сохранится при смене языка. Цены от 23 сентября делают экономическую выгоду очевидной, а качество китайского языка было конкурентоспособным ещё до этого.
Подождите если вы выпускаете продукт на более чем примерно шестнадцати языках, если ваш продукт зависит от лицензируемой библиотеки голосов, а не от клонирования, если вы глубоко погружены в инструментарий платформы для дубляжа или агентов, или если ваш процесс закупки требует независимой оценки качества перед утверждением. Ни одно из них не является постоянным блокером, но ни одно из них не было устранено снижением цены.
И следите за одним конкретным моментом: появится ли Qwen-Audio-3.1-TTS на арене слепого прослушивания. Как только он там появится, это сравнение перестанет быть о цене и количестве языков и начнёт сводиться к тому, действительно ли более дешёвый голос так же хорош. Именно на этот вопрос запуск не ответил.
