
Realtime-Venus против Qwen-Audio-3.0-TTS: один читает ваш сценарий, другой должен вас услышать
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Заманчивое сравнение Realtime-Venus и Qwen-Audio-3.0-TTS — это цена за час аудио, и оно даёт аккуратный ответ, который полностью неверен. Qwen-Audio-3.0-TTS-Plus синтезирует речь примерно за $27,6 за миллион символов, что даёт около $1,66 за час готового аудио. У Realtime-Venus — 9B-полнодуплексной системы, которую команда Venus Team из Ant Group создала совместно с Университетом Цинхуа, — цены нет вовсе, потому что у неё нет хостингового сервиса; но при самостоятельном хостинге вам потребовался бы постоянно работающий GPU-узел, а это как минимум на порядок больше в час. По арифметике выигрывает синтезатор. Но эта арифметика измеряет два разных продукта: Qwen-Audio-3.0-TTS принимает текст и возвращает аудио, а Realtime-Venus принимает аудио и видео и возвращает разговор. Вопрос, который на самом деле их разделяет, не в том, что они выдают. А в том, должно ли что-то говорить в ответ.
Вся разница — во входных данных.
Выпущенная 20 июля 2026 года лабораторией Tongyi компании Alibaba Cloud, Qwen-Audio-3.0-TTS — это модель синтеза речи, предоставляемая в виде облачного API без открытых весов. Текст подаётся через HTTP-эндпоинт, а на выходе получается аудио. Здесь нет пути для аудиовхода, нет хода в диалоге, который нужно сделать, нет транскрипта для возврата и нет понятия прерывания — модель никогда ничего не слышала. Вся её модель затрат — это печатный станок: символы на входе, аудио на выходе.
Realtime-Venus, напротив, постоянно слушает. Аудиовизуальный чекпоинт содержит визуальный энкодер SigLIP2 для потоковых кадров и аудиоэнкодер Whisper-Medium, подающий данные на бэкбон Qwen3-8B, и оба чекпоинта выполняют односекундный цикл взаимодействия, который непрерывно обновляет состояние диалога и решает, говорить или молчать. Он генерирует речь с помощью дискретных S3-токенов и потокового flow-matching-декодера, а не отдельного этапа синтеза, и может возвращать текст вместе с аудиосигналом.
Это не разница в возможностях. Это разница между компонентом и системой. Поставьте их рядом — и один из них можно встроить в конвейер, перед которым уже стоят распознаватель речи и языковая модель. Другой заменяет все три.
Разобранный пример делает это наглядным.
Возьмём линию поддержки. Клиент звонит, плохо описывает проблему, замолкает на полуслове, чтобы найти номер аккаунта, его прерывает фоновое объявление, а затем задаёт уточняющий вопрос, прежде чем оператор успел закончить ответ.
Система, построенная на Qwen-Audio-3.0-TTS, рассматривает это как трёх поставщиков и три счёта: распознаватель превращает речь звонящего в текст, языковая модель решает, что сказать, а Qwen-Audio-3.0-TTS озвучивает это. Каждый переход добавляет задержку, и на каждой границе умирает просодия. Критический сбой носит структурный характер — TTS-звено не может услышать паузу в середине предложения, которое уже озвучивает, поэтому перебивание должно обрабатываться чем-то перед ним.
Realtime-Venus обрабатывает тот же звонок как единая модель, без внешнего детектора голосовой активности, без передачи управления. Его показатели Full-Duplex-Bench v1.5 — 75% реакции на прерывания и показатели продолжения 97% при поддакиваниях, 88% при речи, адресованной другому, и 86% при фоновой речи — это именно те метрики, которые описывают этот сценарий. Они также основаны на самоотчёте — из собственного технического отчёта модели — без внешнего воспроизведения. Воспринимайте их как утверждение о дизайне, а не как измерение.
Качество голоса: у одного есть Elo, у другого — ничего.
Это самая неравная часть сравнения, и она с большим перевесом в пользу Alibaba.
• Независимая оценка — Qwen-Audio-3.0-TTS-Plus занимает второе место в Provider Voice Arena от Artificial Analysis с показателем Elo 1 259 по 1 544 образцам по состоянию на 18 сентября 2026 года, уступая Cartesia Sonic 3.6 с 1 277 и опережая Inworld Realtime TTS-2 с 1 247 и Speechify Simba 3.2 с 1 241.
• С чего всё началось — в собственной колонке релизов арены эта модель указана как позиция за сентябрь 2026 года, то есть это уровень по текущей оценке, а не дата запуска 20 июля 2026 года. Когда бы она ни перемещалась, она всё время удерживалась в первой двойке.
• Realtime-Venus — ни участия в арене, ни сторонней оценки голоса, ничего. Единственный связанный с голосом показатель — это самостоятельно заявленный балл VoiceBench AlpacaEval 4,81, который в отчёте описывается как совпадающий с лучшим показателем среди сравниваемых.
• Что это значит — никто, кроме самих авторов, не оценивал, хорошо ли звучит Realtime-Venus. Это не минус ей; это просто неизвестно, а неизвестное — не то же самое, что плохое. Но если качество голоса — это то, что нужно получить на выходе, покупка модели с рейтингом Elo лучше, чем выбор модели без рейтинга на веру.


Язык, голоса и управление выразительностью
Модель Alibaba создана для широкого охвата подачи. В ней доступно более тысячи голосов, она поддерживает шестнадцать языков, включая двадцать китайских диалектных регионов, и предоставляет 86 встроенных тегов для передачи эмоций и манеры речи — поверхность управления, которую вы прописываете прямо в тексте, плюс инструкции по подаче на естественном языке. Выходной сигнал — до 48 кГц вместо 24 кГц в предыдущем поколении, а один синтез может длиться до трёх минут. Тариф Flash рассчитан примерно на 300 миллисекунд до первого пакета для воспроизведения в реальном времени; тариф Plus — это тариф качества, он генерирует около шестнадцати символов в секунду: достаточно медленно, чтобы это имело значение в реальном продукте, и незаметно при пакетном рендеринге.
Realtime-Venus имеет документацию на английском и китайском, поставляется с одним референсным голосом вместе с весами и даёт вам декодер «токен → форма волны», а не библиотеку голосов. Выразительность в том смысле, в каком она есть у Qwen — теги, инструкции, тысяча пресетов — здесь не имеет аналога. Вместо этого у него есть способность менять свою подачу в ответ на то, что он слышит, — это иной тип выразительного контроля, и его гораздо труднее вписать в спецификацию.
Цена каждого пути, если честно
Есть важная оговорка по цифре Alibaba, прежде чем кто-либо будет закладывать её в бюджет. Широко цитируемые $27,6 за миллион символов не совпадают с собственной страницей цен Alibaba в каждом снимке, а тарифные уровни тарифицируются отдельно. Проверяйте цифру на уровне аккаунта, а не полагайтесь на сравнительную таблицу, включая эту.
У Realtime-Venus нет прейскурантной цены, потому что покупать нечего. Затраты — это два 9B-чекпоинта в BF16, примерно по восемнадцать гигабайт весов каждый, ещё до памяти под активации, плюс непрерывный потоковый цикл, а значит, GPU-узел, который тарифицируется помесячно независимо от того, обращается ли кто-нибудь. При стабильном объёме это дешевле в расчёте на разговор, чем голосовой API с оплатой по факту использования. При нерегулярном объёме всё намного хуже, и точка перехода — единственный финансовый вопрос, который имеет значение.
Есть третий путь, к которому придёт много команд, и его стоит назвать, потому что он меняет форму решения. Если вы сохраняете каскад, единственное звено, которое должно быть хостируемой моделью, — это среднее, то есть рассуждение. OrcaRouter не предоставляет ни Qwen-Audio-3.0-TTS, ни Realtime-Venus; оба голосовых слоя находятся вне того, что мы обслуживаем, и мы предпочли бы сказать это прямо, а не намекать на обратное. Именно звено рассуждения мы и покрываем: почти 200 текстовых моделей за одним ключом по прайс-листу провайдера без наценки, автоматическое переключение при сбое между апстримами, чтобы неудачный день у одного провайдера не обрывал активный звонок, DSL маршрутизации, который объединяет несколько моделей в один вызов, и слияние моделей, когда решение заслуживает более одного мнения. В каскаде именно это звено вы больше всего хотите иметь возможность заменить без переговоров по контракту, и именно то, где снижение цены от поставщика вступает в силу в тот же день, а не при продлении.

Клонирование — палка о двух концах
Qwen-Audio-3.0-TTS может клонировать голос по короткому эталонному образцу, в том числе кросс-лингвально, и, согласно документации, устойчива к зашумлённому входу и входу с реверберацией. Это самая коммерчески полезная возможность в сравнении и самая обширная зона соблюдения требований. Продукту, который способен воспроизвести любого говорящего по десяти секундам аудио, придётся давать гораздо более развёрнутый ответ на вопрос «чей это голос и кто дал согласие на его использование», чем продукту, который говорит исключительно предустановленными голосами поставщика.
Realtime-Venus поставляется с эталонным голосом вместе с весами. Вы можете клонировать с его помощью, если у вас есть аудио и запуск обучения, но в релизе ничего не сделано для того, чтобы это было легко — что для развёртывания на собственной инфраструктуре внутри периметра соответствия, пожалуй, является более безопасным вариантом по умолчанию.
Какой из них вы на самом деле покупаете?
Покупайте Qwen-Audio-3.0-TTS, когда на выходе — аудио. Озвучивание, локализация, доступность, дубляж — любой рабочий процесс, где текст появляется раньше звука, а метрика — качество на час отрендеренного аудио. Начните с Flash, если воспроизведение идёт в реальном времени, переходите на Plus, когда сам голос является продуктом, и тарифицируйте процесс клонирования отдельно от библиотеки пресетов.
Выбирайте Realtime-Venus, когда на входе человек, а система должна вести себя как слушатель. Помощь с учётом камеры, взаимодействие без помощи рук — всё, где человек перебьёт на полуслове и ожидает, что система с этим справится. Размен резкий: вы отказываетесь от голоса с рейтингом Elo, тысячи пресетов и любого варианта с хостингом, а взамен получаете единственный из двух, который может вас слышать.
Большинству продуктов нужно и то, и другое, но в разных местах. Чего им не следует делить, так это модель затрат — цена за час аудио является правильной метрикой ровно для одной из этих двух моделей, и это не та, которая ведёт разговор.
