Карточка-баннер, сравнивающая Qwen-Audio-3.0-TTS и Qwen-Audio-3.1-TTS: у старой модели указаны выпуск 20 июля 2026 года, рейтинг Elo 1 238 и 86 встроенных тегов подачи, а у новой — анонс 23 сентября 2026 года, снижение цены на 70% и управление на основе инструкций; между ними — стрелка с подписью «девять недель».
Guides & Insights

Qwen-Audio-3.1-TTS против Qwen-Audio-3.0-TTS: что дали два месяца

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Qwen-Audio-3.0-TTS вышла 20 июля 2026 года и сразу вырвалась в верхнюю часть независимых рейтингов речи — уровень Plus достиг 1 238 Elo в рейтинге Provider Voice Arena от Artificial Analysis, заняв второе место в таблице. Девять недель спустя, 23 сентября 2026 года, производитель объявил о Qwen-Audio-3.1-TTS на конференции Apsara в Ханчжоу вместе со снижением цены примерно на 70%. Такая хронология делает это сравнение необычным: заменяемая модель не устарела — она протестирована, доказала себя и по-прежнему находится близко к вершине. Так что настоящий вопрос не в том, какая из них лучше. Он в том, что именно изменилось, имеет ли это значение для вашей рабочей нагрузки и что произойдёт с оценкой, которой вы уже доверяете, когда преемник вообще не получил оценки.

Два месяца, пять эндпоинтов, одна семья

Alibaba выпустила не одну модель. Релиз 3.1 охватывает пять: Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next и Qwen-Audio-3.1-Realtime. Для всех, кто сейчас вызывает Qwen-Audio-3.0-TTS, только одна из них подходит для прямой замены — обычный уровень TTS, — а одна является по-настоящему новым продуктом, а не обновлением.

Второй из них стоит понять, даже если вы никогда его не вызовете. Qwen-Audio-3.1-TTS-Next — это то, что Alibaba называет моделью «Audiogen»: один проход, который создаёт голос, звуковые эффекты и фоновую атмосферу вместе из текста, временных меток и референсного аудио. Диалоги с несколькими говорящими, сборка подкастов, звуковые ландшафты сцен, вывод в 48 кГц. Документация Alibaba Cloud Model Studio прямо перечисляет его ограничения — 3 000 символов входных данных, 240 секунд сгенерированного аудио для подкастов и 120 секунд в остальных случаях, 3 запроса в секунду, вывод в WAV, MP3 или PCM, а также приём до трёх референсных клипов длительностью 30 секунд каждый в форматах WAV, MP3 или OGG Opus. Референсный вход в формате raw PCM не поддерживается. Цена составляет $0,848 за миллион входных токенов и $1,696 за миллион выходных токенов на пекинском узле, за исключением промоакций, и модель поддерживает только китайский и английский языки.

Если вы используете 3.0-TTS и ваша задача — «превратить этот сценарий в голос», всё это не меняет вашу интеграцию. Если ваша задача — «собрать подкаст с двумя ведущими и музыкальными подложками», 3.1-TTS-Next — это другая категория продукта и, возможно, вообще причина обратить внимание на этот релиз.

Обновление, строка за строкой

A two-column scoreboard for Qwen-Audio-3.1-TTS and Qwen-Audio-3.0-TTS across languages, dialects, timbre transfer, delivery control, noisy reference audio and arena score, with a footer stating that the 3.1 figures are vendor-reported and unscored and the 3.0 Plus Elo is per Artificial Analysis.

• Языки — Qwen-Audio-3.1-TTS: заявленные производителем 16 языков, при этом семь добавлены по сравнению с предыдущим поколением. Qwen-Audio-3.0-TTS: 16 языков, как указано в публикациях об июльском релизе.

• Китайские диалекты — Qwen-Audio-3.1-TTS: 20 диалектных регионов, перенесено из предыдущей версии. Qwen-Audio-3.0-TTS: 20 диалектных регионов.

• Межъязыковой перенос тембра — Qwen-Audio-3.1-TTS: да, один и тот же голос переносится между мандаринским, кантонским, английским и японским. Qwen-Audio-3.0-TTS: не предоставляется.

• Управление подачей — Qwen-Audio-3.1-TTS: управление эмоциями, темпом и стилем на основе инструкций. Qwen-Audio-3.0-TTS: 86 встроенных тегов подачи.

• Зашумлённый эталонный ввод — Qwen-Audio-3.1-TTS: обрабатывает зашумлённое или содержащее эхо эталонное аудио напрямую, без отдельного режима шумоподавления. Qwen-Audio-3.0-TTS: ожидается чистое эталонное аудио.

• Независимая оценка — Qwen-Audio-3.1-TTS: пока нет. Qwen-Audio-3.0-TTS-Plus: 1 238 Эло в таблице лидеров Provider Voice Arena от Artificial Analysis по состоянию на август 2026 года.

Количество языков не сходится, и это важно

Это мелочь, которую везде в остальном замажут, поэтому стоит это отметить. В материалах Alibaba о запуске говорится, что уровень TTS 3.1 добавляет семь языков. В опубликованных материалах о поколении 3.0 за июль — включая наши собственные сравнительные статьи того месяца — для уровня 3.0 были указаны 16 языков. Семь плюс шестнадцать — это двадцать три, а не шестнадцать, и Alibaba не опубликовала объяснения расхождения между этими двумя цифрами.

Возможные объяснения прозаичны: число 3.1 может учитывать другой набор, показатель 3.0 мог быть завышен на момент запуска, или «добавляет семь» может описывать уровень ASR, а не TTS. Мы не знаем, какое именно. Что мы знаем, так это то, что количество языков с обеих сторон этого сравнения — это заявленное производителем число, которое никогда не проходило независимый аудит, и что любой, кто цитирует «16 языков» как непреложный факт о любой из моделей, цитирует маркетинговый слайд. Проверьте конкретные языки, которые вам нужны, в документации Model Studio, прежде чем планировать, исходя из количества.

A screenshot of Alibaba Cloud Model Studio's English documentation site with the Speech-to-Speech branch of the navigation open, showing the reference page for qwen3.8-livetranslate-flash-realtime with its model capabilities and context limit tables, under an Apsara 2026 Conference banner.

Управление инструкциями — это то изменение, которое действительно проявляется в коде

Из всего, что вошло в релиз TTS 3.1, именно это меняет то, как вы пишете свои промпты. Поколение 3.0 управляло подачей с помощью 86 встроенных тегов — фиксированного набора, который нужно было выучить, вставлять в нужные позиции, и который делал ровно то, что было указано, и ничего больше. Уровень 3.1 заменяет это инструкциями на естественном языке: вы описываете эмоцию, темп, стиль, который хотите, а модель интерпретирует это.

Практическая разница — это выразительность против предсказуемости. Словарь тегов — это контракт: один и тот же тег даёт одну и ту же подачу каждый раз, а именно это и нужно в производственном конвейере, где голос должен оставаться согласованным на десяти тысячах клипов. Свободная инструкция шире, но менее строгая, и она наследует обычную проблему чувствительности к промпту: две формулировки «тепло, но не сентиментально» не дадут одинакового результата, и два вызова одной и той же формулировки в разные дни — тоже.

Если ваш текущий пайплайн построен на тех 86 тегах, обновление не будет бесплатным. Вы обмениваете детерминированную поверхность управления на вероятностную, и работа по переносу — это не вызов API; это повторная валидация каждого вашего шаблона промпта на соответствие интерпретации новой модели. Заложите это в бюджет прежде, чем закладывать в него экономию.

Кросс-языковой перенос тембра, и для чего он на самом деле нужен

Один эталонный голос, единый для путунхуа, кантонского, английского и японского и сохраняющий свою идентичность при смене языка. На бумаге это звучит как пункт списка возможностей. На практике это решает конкретную и дорогостоящую проблему: один ведущий, которому приходится существовать более чем на одном языке и при этом не звучать как другой человек в каждом из них.

Традиционный обходной путь — нанять отдельного актёра озвучивания для каждого языка и смириться с тем, что голос вашего бренда теперь состоит из четырёх голосов, читающих один и тот же сценарий. Альтернатива — клонировать одного диктора для каждого языка, и это как раз тот процесс, в котором клонированные голоса обычно дрейфуют: акцент переносится, тембр истончается, а слушатели замечают это уже в пределах одного предложения. Межъязыковой перенос тембра — это утверждение, что ни на один из этих компромиссов идти не нужно.

Кроме того, прямо сейчас это совершенно не подтверждено. Не существует независимого слухового теста Qwen-Audio-3.1-TTS ни на одном языке, и собственные демо Alibaba — единственное доказательство того, что перенос работает. Если эта возможность — причина, по которой вы рассматриваете обновление, проверьте её на своём эталонном аудио, прежде чем решаться, — это пятиминутный эксперимент, и только он отвечает на этот вопрос.

Что снижение цены делает с законопроектом 3.0

Alibaba снизила цены на речевые сервисы по всей линейке: синтез — примерно на 70%, realtime — примерно на 85%, распознавание — вплоть до 95%. Изменение вступило в силу в Alibaba Cloud Model Studio 22 сентября 2026 года в 00:00 по пекинскому времени, охватывает регионы Пекин и Сингапур и применяется к эндпоинтам 3.1 TTS и 3.0 realtime. После корректировки тариф TTS Flash составляет 1,5 юаня за миллион входных токенов и 12 юаней за миллион выходных токенов; тариф realtime Flash — 1,5 за текстовый ввод, 6 за аудиоввод, 4,5 за текстовый вывод и 12 за комбинированный текстово-аудиовыход за миллион токенов.

Вот главное, если вы уже используете 3.0-TTS. По данным Artificial Analysis, уровень 3.0 Plus вплоть до августа держался около $27,60 за миллион символов, а уровень Flash — около $15. Если снижение примерно на 70% относится к используемому вами уровню, ваш счёт за ту же нагрузку упадёт примерно до трети от прежнего — и вам не придётся менять ни строки кода. Вот что необычно в этом релизе: для клиента 3.0 снижение цены значит больше, чем обновление модели, и оно наступает независимо от того, мигрируете вы или нет.

Два предостережения, которые стоит учитывать. Процентные снижения указываются относительно тарифов, которые различаются по регионам и тарифным уровням, поэтому фигурирующие в заголовках 70% — это не обещание применительно к вашему конкретному трафику. И Alibaba Cloud перевела биллинг транскрипции в реальном времени на сингапурском узле с тарификации по длительности на тарификацию по токенам — $0.93 за миллион входных токенов и $0.70 за миллион выходных токенов — что даёт менее предсказуемую основу, когда тишина, шум и многоходовой контекст увеличивают потребление токенов. Сверяйте новый тарифный лист со своим аудио, а не с пресс-релизом.

Где Qwen-Audio-3.0-TTS всё ещё остаётся правильным выбором

Три случая, и это вовсе не крайние случаи.

Когда вам нужна цифра, которую можно защитить. Qwen-Audio-3.0-TTS-Plus имеет независимый Elo 1,238 — на той же таблице для этой модели в сентябре указано 1,259, всё ещё второе место, так что оценка сместилась вверх, а не снизилась — из арены слепого прослушивания, за которой стоят тысячи голосов. У Qwen-Audio-3.1-TTS вообще нет оценки арены. Если для вашего процесса утверждения требуются доказательства от третьей стороны, именно у более старой модели они есть, и снижение цены этого не меняет.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, ranking text-to-speech models by Elo with vote counts and API pricing: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,259 on a rank range of 2-3, and ElevenLabs Eleven v3 at 1,166.

Когда детерминизм важнее выразительности. Если ваш производственный конвейер построен на поверхности управления из 86 тегов, вы располагаете системой, результаты работы которой поддаются осмыслению. Управление на основе инструкций обладает большими возможностями, но менее предсказуемо, и затраты на миграцию вполне реальны.

Когда ничто в обновлении не затрагивает вашу рабочую нагрузку. Если вы синтезируете китайский и английский при умеренной нагрузке, с чистым эталонным голосом и фиксированным набором тегов подачи, то кросс-языковой перенос тембра, устойчивость к шумному входу и семь дополнительных языков — всё это решает проблемы, которых у вас нет. Берите снижение цены и оставляйте модель.

Запуск обоих без запуска двух интеграций

Неудобная часть переключения между поколениями заключается в том, что часто требуется, чтобы обе модели работали одновременно — 3.0 для производственного пути с оценкой за ним, 3.1 для новых языков и функции переноса, а также способ переключать трафик между ними без повторного развертывания. Обе являются закрытыми размещенными API в Alibaba Cloud Model Studio, так что за одной функцией стоят две конечные точки, два ограничения скорости и два режима отказа.

Честное замечание о том, где мы находимся: OrcaRouter не маршрутизирует Qwen-Audio-3.1-TTS или любую другую модель Qwen-Audio, и мы вообще не маршрутизируем речевые эндпоинты Alibaba. Мы предоставляем слой текстового инференса вокруг пайплайна вроде этого — один API-ключ для более чем 200 моделей с наценкой 0%, цена из прайс-листа провайдера передаётся напрямую, так что снижение цены вендором отражается на нашей стороне в тот же день, а не после цикла пересмотра цен. Если сервис, управляющий вашим речевым пайплайном, — это генератор сценариев, суммаризатор или планировщик контента, это означает один договор вместо нескольких, автоматическое переключение при деградации апстрима, а также DSL маршрутизации для компоновки моделей в один вызов. Это не означает, что вы обращаетесь к голосу Qwen через нас, и любая страница, утверждающая обратное, ошибается насчёт нашего собственного каталога.

Честное резюме

Qwen-Audio-3.1-TTS — это настоящее обновление с тремя важными дополнениями: управление подачей на основе инструкций, кросс-языковой перенос тембра и устойчивость к плохому эталонному аудио, — а также снижение цены, которое стоит больше любого из них. Qwen-Audio-3.0-TTS не вытеснен так, как обычно бывает с двухмесячной моделью: он всё ещё удерживает независимую оценку в бенчмарке, которую его преемник не заслужил, и по-прежнему охватывает диапазон китайских диалектов, на котором держится большая часть различий в этом семействе.

Итак, решение более узкое, чем предполагает маркетинг. Если вы генерируете в больших объёмах, изменение цен уже касается вас. Если вам нужны новые языки или перенос тембра, сначала перейдите на новую модель и проверьте эту функцию на собственном аудио. Если вам нужен убедительный показатель качества, дождитесь, пока Qwen-Audio-3.1-TTS появится на арене слепого прослушивания — это единственное событие, которое могло бы разрешить этот вопрос, и пока оно не произошло, честная позиция такова: более новая модель — более дешёвая, а более старая — проверенная.