Сгенерированная hero-карточка заголовка для StepAudio 3 TTS против Qwen-Audio-3.0-TTS с надзаголовком «OrcaRouter · радар моделей — лицом к лицу», заголовком «StepAudio 3 TTS против Qwen-Audio-3.0-TTS» и подзаголовком «У одного есть оценка арены слепого прослушивания. Другой выпущен через семь недель после последнего голосования», над двумя скруглёнными карточками моделей по обе стороны от знака VS.
Guides & Insights

StepAudio 3 TTS против Qwen-Audio-3.0-TTS: у одной из них есть оценка Arena, и это не новая модель.

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Вот всё сравнение в одной строке. Qwen-Audio-3.0-TTS находится на Text-to-Speech Arena с Elo 1 234 для своего уровня Plus — оценка, полученная по 2 502 голосам при слепом прослушивании. StepAudio 3 TTS, выпущенный компанией StepFun 15 сентября 2026 года, вообще отсутствует в этом рейтинге. Его предшественник: StepAudio 2.5 TTS имеет Elo 1 209 по 1 306 голосам.

Так что честный вопрос не в том, «что звучит лучше». Он в том, переживёт ли разрыв в 25 пунктов Elo, измеренный на предыдущем поколении, выпуск, который, по словам StepFun, улучшил просодию и снизил цену более чем вдвое. Никто ещё не проводил это голосование, и всё нижеследующее выстроено вокруг этого пробела в доказательствах, а не вокруг попыток сделать вид, что его нет.

Совет, как он фактически читается сегодня

Стоит увидеть реальный рейтинг, потому что несколько циркулирующих публикаций ссылаются на его устаревшую версию. На арене слепого прослушивания модели синтеза ранжируются по тому, какой образец предпочли голосующие. Прочитайте верхнюю строку табло голосов провайдеров:

• Cartesia Sonic 3.6 — Elo 1 277, август 2026, $49,0 за миллион символов

• Inworld Realtime TTS-2 — Elo 1 243, август 2026, $20,8 за миллион символов

• SpeechifyAI Simba 3.2 — Elo 1 238, июль 2026, $6,6 за миллион символов

Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1 234, июль 2026 г., 27,6 доллара за миллион символов, 8 голосов в арене

• VUI Labs Luna TTS — Elo 1 229, июнь 2026, 80,0 $ за миллион символов

• Inworld Realtime TTS-2 Flash — Elo 1 213, август 2026 г., $10.4 за миллион символов

• StepFun StepAudio 2.5 TTS — Эло 1 209, август 2026 г., 85,0 $ за миллион символов, 8 голосов арены

Google Gemini 3.1 Flash TTS — Elo 1 204, апрель 2026 г., 18,3 доллара США за миллион символов

Screenshot of the Artificial Analysis Provider Voice Arena text-to-speech leaderboard, showing Cartesia Sonic 3.6 first at Elo 1,277, Alibaba Qwen-Audio-3.0-TTS-Plus fourth at Elo 1,234 over 2,502 samples at $27.6 per million characters, and StepFun StepAudio 2.5 TTS seventh at Elo 1,209 over 1,306 samples at $85.0 per million characters, with confidence intervals of -14/+14 and -16/+16 respectively.

Из этого списка сразу следуют две вещи. Первая: тариф Plus от Qwen не лидер — он четвёртый, после Cartesia, Inworld и Speechify, а показатель 1 234, который приводят как корону, — это оценка середины таблицы на табло, которое с тех пор изменилось. Вторая: StepAudio 2.5 TTS был повторно протестирован в августе 2026 года и занял седьмое место, отставая от Qwen на 25 пунктов Elo, при цене более чем в три раза выше.

И третье, что важнее всего вышесказанного: посмотрите на доверительные интервалы. Уровень Plus у Qwen указан как −14/+14 на 2 502 образцах. Для StepAudio 2.5 TTS указано −16/+16 на 1 306 образцах. Эти интервалы пересекаются. Разрыв в 25 пунктов между двумя моделями, у которых планки погрешности охватывают 14 и 16 пунктов в каждую сторону, — это не доказанное различие в качестве. Это две модели, которые арена в настоящее время не может разделить, и они ранжированы в порядке, который могли бы изменить несколько сотен дополнительных голосов.

A generated scoreboard titled 'StepAudio 3 TTS vs Qwen-Audio-3.0-TTS — the scoreboard'. The StepAudio column reads Arena Elo 'not scored yet', Samples 'none', Price '2.5 yuan / 10,000 chars', Voices 'not published', Languages 'Chinese-first', Request size 'not published'. The Qwen column reads Arena Elo '1,234, Plus tier', Samples '2,502', Price '$27.6 / 1M chars', Voices 'over 1,000', Languages '16 + 20 dialects', Request size '20,000 chars'. Footer: 'Qwen figures per the Artificial Analysis text-to-speech arena; StepAudio 3 TTS has no arena score yet.'

Чего вам стоит отсутствующая точка данных

StepAudio 3 TTS — это модель, которой StepFun заменила StepAudio 2.5 TTS; в анонсе заявлен контроль над тембром, интонацией, ритмом и дыхательными паузами, а также над паралингвистическим поведением — смехом, заминками, заиканием, повторами, самокоррекцией, — обеспечиваемый потоковой архитектурой, в которой генерация и воспроизведение накладываются друг на друга.

Это ровно тот набор качеств, который измеряет арена. Это же ровно причина, по которой отсутствие оценки разочаровывает, а не становится фатальным: бенчмарк, который ответил бы на этот вопрос, существует, проводится публично и просто не был повторно запущен с тех пор, как вышла новая модель. Любой, кто говорит вам, что StepAudio 3 TTS звучит лучше, чем Qwen-Audio-3.0-TTS, экстраполирует по предшественнику, который проиграл с разрывом в пределах собственных погрешностей.

Цена — это та часть, которая полностью задокументирована, и она сильно изменилась.

StepAudio 3 TTS тарифицируется по 2,5 юаня за 10 000 символов на собственной платформе StepFun. StepAudio 2.5 TTS тарифицировался по 5,8. В собственной колонке цен арены, основанной на количестве символов, более старая модель стоила $85,00 за миллион символов; 2,5 юаня за 10 000 символов — это примерно $35 за миллион по недавним обменным курсам — пересчёт, сделанный нами, а не опубликованный показатель, и его стоит повторить с учётом вашего собственного региона и валютного курса. Это снижение почти на 60% по той же статье расходов.

Это всё ещё выше Qwen. Qwen-Audio-3.0-TTS-Plus указан по цене $27,6 за миллион символов, а тариф Flash ещё дешевле: Alibaba Cloud Model Studio тарифицирует синтез по входным символам, а не по созданному аудио — за вывод плата отдельно не взимается. Сторонние платформы, предлагающие тариф Flash, указывают ставки на уровне 17–19 долларов за миллион, хотя из-за региональных различий любая единая заголовочная цифра ненадёжна.

Итак, картина такая: StepFun примерно вдвое снизил стоимость синтеза, сократил большую часть разрыва с Qwen, но так и не обогнал его. Если цена за символ — ваше жёсткое ограничение, довод сужается, но ответ не меняется. Если нет, цена перестала быть причиной выбирать любую из этих моделей.

Голосовой инвентарь и языковое покрытие не близки

Здесь сравнение перестаёт быть вопросом субъективного суждения и становится вопросом спецификации.

• Каталог голосов — Qwen-Audio-3.0-TTS: более 1 000 голосов по всем его уровням, против StepAudio 3 TTS без сопоставимого опубликованного количества.

• Языки — Qwen-Audio-3.0-TTS: 16 языков плюс 20 китайских диалектов, причём уровень Flash настроен на низкоресурсные языки и аутентичность диалектов, в отличие от StepAudio 3 TTS, ориентированного в первую очередь на китайский, без заявлений об эквивалентном охвате

• Размер запроса — Qwen-Audio-3.0-TTS: 20 000 символов на запрос, а StepAudio 3 TTS — не опубликовано

• Задержка — Qwen-Audio-3.0-TTS Flash: согласно собственным документам Alibaba, целевой показатель задержки до первого пакета составляет в пределах 200 мс, тогда как для потокового режима StepAudio 3 TTS опубликованных данных нет

• Разделение по уровням — Qwen-Audio-3.0-TTS Plus для выразительности, Flash для работы в реальном времени; шесть флагманских голосов закреплены за тем или иным уровнем, тогда как StepAudio 3 TTS — единый уровень

• Средства управления — управление манерой подачи на естественном языке в Qwen-Audio-3.0-TTS плюс встроенные во входной текст теги выразительности, такие как [excited], [laughing], [whispers], в отличие от просодии, выводимой моделью StepAudio 3 TTS из контекста

• Клонирование голоса — StepAudio 3 TTS берёт фиксированные 9,9 юаня за клонированный голос на всех уровнях TTS, тогда как клонирование через Qwen-Audio-3.0-TTS в Alibaba Cloud Model Studio

• Выход — Qwen-Audio-3.0-TTS: частота дискретизации по умолчанию 24 кГц, а у StepAudio 3 TTS не опубликована.

Эта строка панели управления — вот настоящее различие в дизайне, и это не вопрос качества. Теги выражений Qwen явные и синхронные: вы вписываете эмоцию в текст, и модель её воспроизводит, что делает их проверяемыми и удобными для регрессионного тестирования. Описание StepFun относится к модели, которая выводит подходящую нерешительность или смех из контекста; это звучит лучше, когда она угадывает, и гораздо труднее точно определить, когда она ошибается. Выбирайте в зависимости от того, что вы предпочитаете: создавать исполнение самостоятельно или делегировать его.

Screenshot of Alibaba Cloud Model Studio documentation for qwen-audio-3.0-tts-flash, showing the model capabilities table with text input and audio output, function calling and fine-tuning unsupported, and a note that the Flash version controls first-packet latency within 200 ms.

Как принять решение без измерения

Вы не можете прийти к ответу путём рассуждений на основе опубликованных цифр, потому что решающей среди них не существует. Остаётся тестирование, а у тестирования этих двух есть особая форма, которую стоит учесть при планировании.

Оба — коммерческие API, доступные только в хостинговом варианте: Qwen-Audio-3.0-TTS через Alibaba Cloud Model Studio, StepAudio 3 TTS через открытую платформу StepFun. Ни у одного из них нет открытых весов, поэтому нет варианта с самостоятельным хостингом, который можно было бы оценить. Если быть точными насчёт того, что здесь охватывает OrcaRouter: модели синтеза речи в нашем каталоге на сегодняшний день — это семейство OpenAI tts-1, gpt-4o-mini-tts и предварительные версии Google Gemini TTS. Ни одной из моделей, о которых говорится в этой статье, там нет, и Qwen-Audio-3.0-TTS тоже нет — ничто здесь не следует воспринимать как утверждение, что мы их предоставляем.

Та часть, которая действительно размещена на OrcaRouter, — это текстовая половина конвейера. Скрипты, которые читает ваш слой синтеза, генерируются языковой моделью, а это тот компонент, который меняется чаще всего, дороже всего обходится при перезаключении контракта и проще всего остаётся без фиксации версии — почти 200 текстовых моделей за одним API, автоматическое переключение при сбое, DSL маршрутизации, объединяющий несколько моделей в один вызов, и слияние моделей, когда суждения одной модели недостаточно, при этом цена из прайс-листа провайдера передаётся без наценки. Если вы проводите слепую оценку между этими двумя моделями синтеза, генерируйте корпус через один эндпоинт, чтобы оба кандидата читали идентичные входные данные, и держите слой синтеза за интерфейсом, который можно заменить.

Что это означает для решения

Возьмите Qwen-Audio-3.0-TTS сегодня, если вам нужна широта, — более тысячи голосов, 16 языков и 20 диалектов, задокументированный потолок запроса в 20 000 символов, уровень задержки и уровень выразительности, цель в 200 мс до первого пакета и цена ниже, чем у StepFun. Это модель, за которой стоит измерение и более широкая поверхность, и её четвёртое место по Elo — реальный результат, даже если это не та корона, за которую её выдают.

Берите StepAudio 3 TTS, если вы строите продукт с приоритетом китайского языка, хотите один тариф вместо необходимости выбирать тариф, хотите клонирование по фиксированной опубликованной цене и готовы рано перейти на модель, которая не проходила слепое тестирование. Вы платите примерно на 27% больше за символ, чем в тарифе Plus от Qwen, в обмен на заявленное улучшение просодии на поколение по сравнению с моделью, которая отставала на 25 Elo при перекрывающихся планках погрешности.

Что бы это решило — один повторный прогон арены с StepAudio 3 TTS в пуле. Пока это голосование не состоится, речь идёт об измеренной модели против неизмеренной, а 25 пунктов, разделяющих их предшественников, находятся в пределах шума — а это не рейтинг, и его не следует продавать как таковой.