Титульная карточка для «Realtime-Venus vs Qwen-Audio-3.0-TTS» с подзаголовком «Рендерер и слушатель — не одна и та же покупка», с тремя карточками: «Qwen-Audio-3.0-TTS-Plus: Elo 1 259, второе место в Artificial Analysis Provider Voice Arena», «Realtime-Venus: оценки качества голоса не существует вовсе» и «Вся разница — во входных данных: только текст против аудио, видео и текста», над нижней полосой с надписью «Цифры Qwen — по данным Artificial Analysis; цифры Realtime-Venus — из его технического отчёта, не воспроизведены». Логотип OrcaRouter вкомпонован в правом нижнем углу.
Guides & Insights

Realtime-Venus против Qwen-Audio-3.0-TTS: один читает ваш сценарий, другой должен вас услышать

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Заманчивое сравнение Realtime-Venus и Qwen-Audio-3.0-TTS — это цена за час аудио, и оно даёт аккуратный ответ, который полностью неверен. Qwen-Audio-3.0-TTS-Plus синтезирует речь примерно за $27,6 за миллион символов, что даёт около $1,66 за час готового аудио. У Realtime-Venus — 9B-полнодуплексной системы, которую команда Venus Team из Ant Group создала совместно с Университетом Цинхуа, — цены нет вовсе, потому что у неё нет хостингового сервиса; но при самостоятельном хостинге вам потребовался бы постоянно работающий GPU-узел, а это как минимум на порядок больше в час. По арифметике выигрывает синтезатор. Но эта арифметика измеряет два разных продукта: Qwen-Audio-3.0-TTS принимает текст и возвращает аудио, а Realtime-Venus принимает аудио и видео и возвращает разговор. Вопрос, который на самом деле их разделяет, не в том, что они выдают. А в том, должно ли что-то говорить в ответ.

Вся разница — во входных данных.

Выпущенная 20 июля 2026 года лабораторией Tongyi компании Alibaba Cloud, Qwen-Audio-3.0-TTS — это модель синтеза речи, предоставляемая в виде облачного API без открытых весов. Текст подаётся через HTTP-эндпоинт, а на выходе получается аудио. Здесь нет пути для аудиовхода, нет хода в диалоге, который нужно сделать, нет транскрипта для возврата и нет понятия прерывания — модель никогда ничего не слышала. Вся её модель затрат — это печатный станок: символы на входе, аудио на выходе.

Realtime-Venus, напротив, постоянно слушает. Аудиовизуальный чекпоинт содержит визуальный энкодер SigLIP2 для потоковых кадров и аудиоэнкодер Whisper-Medium, подающий данные на бэкбон Qwen3-8B, и оба чекпоинта выполняют односекундный цикл взаимодействия, который непрерывно обновляет состояние диалога и решает, говорить или молчать. Он генерирует речь с помощью дискретных S3-токенов и потокового flow-matching-декодера, а не отдельного этапа синтеза, и может возвращать текст вместе с аудиосигналом.

Это не разница в возможностях. Это разница между компонентом и системой. Поставьте их рядом — и один из них можно встроить в конвейер, перед которым уже стоят распознаватель речи и языковая модель. Другой заменяет все три.

Разобранный пример делает это наглядным.

Возьмём линию поддержки. Клиент звонит, плохо описывает проблему, замолкает на полуслове, чтобы найти номер аккаунта, его прерывает фоновое объявление, а затем задаёт уточняющий вопрос, прежде чем оператор успел закончить ответ.

Система, построенная на Qwen-Audio-3.0-TTS, рассматривает это как трёх поставщиков и три счёта: распознаватель превращает речь звонящего в текст, языковая модель решает, что сказать, а Qwen-Audio-3.0-TTS озвучивает это. Каждый переход добавляет задержку, и на каждой границе умирает просодия. Критический сбой носит структурный характер — TTS-звено не может услышать паузу в середине предложения, которое уже озвучивает, поэтому перебивание должно обрабатываться чем-то перед ним.

Realtime-Venus обрабатывает тот же звонок как единая модель, без внешнего детектора голосовой активности, без передачи управления. Его показатели Full-Duplex-Bench v1.5 — 75% реакции на прерывания и показатели продолжения 97% при поддакиваниях, 88% при речи, адресованной другому, и 86% при фоновой речи — это именно те метрики, которые описывают этот сценарий. Они также основаны на самоотчёте — из собственного технического отчёта модели — без внешнего воспроизведения. Воспринимайте их как утверждение о дизайне, а не как измерение.

Качество голоса: у одного есть Elo, у другого — ничего.

Это самая неравная часть сравнения, и она с большим перевесом в пользу Alibaba.

• Независимая оценка — Qwen-Audio-3.0-TTS-Plus занимает второе место в Provider Voice Arena от Artificial Analysis с показателем Elo 1 259 по 1 544 образцам по состоянию на 18 сентября 2026 года, уступая Cartesia Sonic 3.6 с 1 277 и опережая Inworld Realtime TTS-2 с 1 247 и Speechify Simba 3.2 с 1 241.

• С чего всё началось — в собственной колонке релизов арены эта модель указана как позиция за сентябрь 2026 года, то есть это уровень по текущей оценке, а не дата запуска 20 июля 2026 года. Когда бы она ни перемещалась, она всё время удерживалась в первой двойке.

• Realtime-Venus — ни участия в арене, ни сторонней оценки голоса, ничего. Единственный связанный с голосом показатель — это самостоятельно заявленный балл VoiceBench AlpacaEval 4,81, который в отчёте описывается как совпадающий с лучшим показателем среди сравниваемых.

• Что это значит — никто, кроме самих авторов, не оценивал, хорошо ли звучит Realtime-Venus. Это не минус ей; это просто неизвестно, а неизвестное — не то же самое, что плохое. Но если качество голоса — это то, что нужно получить на выходе, покупка модели с рейтингом Elo лучше, чем выбор модели без рейтинга на веру.

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured 18 September 2026, showing the ranked table: Cartesia Sonic 3.6 first at Elo 1,277 with 1,810 samples, released August 2026 at $49.0 per million characters; Alibaba's Qwen-Audio-3.0-TTS-Plus second at Elo 1,259 with 1,544 samples and $27.6 per million characters; Inworld Realtime TTS-2 third at Elo 1,247; SpeechifyAI Simba 3.2 fourth at Elo 1,241; VUI Labs Luna TTS fifth at Elo 1,231; Inworld Realtime TTS-2 Flash sixth at Elo 1,216; StepFun StepAudio 2.5 TTS seventh at Elo 1,209; and BreezeBlue Breeze TTS 2 eighth at Elo 1,207 with an Open Weights badge.A two-column comparison scoreboard titled 'Realtime-Venus vs Qwen-Audio-3.0-TTS — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Job: full-duplex conversation', 'Input: audio, video and text', 'Output: text and speech', 'Independent voice score: none', 'Availability: Apache-2.0 weights, no API', 'Price: none published'. The right column, labelled Qwen-Audio-3.0-TTS, reads 'Job: text-to-speech rendering', 'Input: text only', 'Output: audio', 'Independent voice score: Elo 1,259, second of 20-plus', 'Availability: hosted API since 20 July 2026', 'Price: about $27.6 per 1M characters'. The footer reads 'Qwen figures per Artificial Analysis and Alibaba Cloud documentation; Realtime-Venus figures from its technical report, unreproduced.'

Язык, голоса и управление выразительностью

Модель Alibaba создана для широкого охвата подачи. В ней доступно более тысячи голосов, она поддерживает шестнадцать языков, включая двадцать китайских диалектных регионов, и предоставляет 86 встроенных тегов для передачи эмоций и манеры речи — поверхность управления, которую вы прописываете прямо в тексте, плюс инструкции по подаче на естественном языке. Выходной сигнал — до 48 кГц вместо 24 кГц в предыдущем поколении, а один синтез может длиться до трёх минут. Тариф Flash рассчитан примерно на 300 миллисекунд до первого пакета для воспроизведения в реальном времени; тариф Plus — это тариф качества, он генерирует около шестнадцати символов в секунду: достаточно медленно, чтобы это имело значение в реальном продукте, и незаметно при пакетном рендеринге.

Realtime-Venus имеет документацию на английском и китайском, поставляется с одним референсным голосом вместе с весами и даёт вам декодер «токен → форма волны», а не библиотеку голосов. Выразительность в том смысле, в каком она есть у Qwen — теги, инструкции, тысяча пресетов — здесь не имеет аналога. Вместо этого у него есть способность менять свою подачу в ответ на то, что он слышит, — это иной тип выразительного контроля, и его гораздо труднее вписать в спецификацию.

Цена каждого пути, если честно

Есть важная оговорка по цифре Alibaba, прежде чем кто-либо будет закладывать её в бюджет. Широко цитируемые $27,6 за миллион символов не совпадают с собственной страницей цен Alibaba в каждом снимке, а тарифные уровни тарифицируются отдельно. Проверяйте цифру на уровне аккаунта, а не полагайтесь на сравнительную таблицу, включая эту.

У Realtime-Venus нет прейскурантной цены, потому что покупать нечего. Затраты — это два 9B-чекпоинта в BF16, примерно по восемнадцать гигабайт весов каждый, ещё до памяти под активации, плюс непрерывный потоковый цикл, а значит, GPU-узел, который тарифицируется помесячно независимо от того, обращается ли кто-нибудь. При стабильном объёме это дешевле в расчёте на разговор, чем голосовой API с оплатой по факту использования. При нерегулярном объёме всё намного хуже, и точка перехода — единственный финансовый вопрос, который имеет значение.

Есть третий путь, к которому придёт много команд, и его стоит назвать, потому что он меняет форму решения. Если вы сохраняете каскад, единственное звено, которое должно быть хостируемой моделью, — это среднее, то есть рассуждение. OrcaRouter не предоставляет ни Qwen-Audio-3.0-TTS, ни Realtime-Venus; оба голосовых слоя находятся вне того, что мы обслуживаем, и мы предпочли бы сказать это прямо, а не намекать на обратное. Именно звено рассуждения мы и покрываем: почти 200 текстовых моделей за одним ключом по прайс-листу провайдера без наценки, автоматическое переключение при сбое между апстримами, чтобы неудачный день у одного провайдера не обрывал активный звонок, DSL маршрутизации, который объединяет несколько моделей в один вызов, и слияние моделей, когда решение заслуживает более одного мнения. В каскаде именно это звено вы больше всего хотите иметь возможность заменить без переговоров по контракту, и именно то, где снижение цены от поставщика вступает в силу в тот же день, а не при продлении.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge alongside the Any-to-Any, Safetensors, audio, video, streaming and full-duplex tags, the model card heading 'A full-duplex interaction system with asynchronous delegation', and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

Клонирование — палка о двух концах

Qwen-Audio-3.0-TTS может клонировать голос по короткому эталонному образцу, в том числе кросс-лингвально, и, согласно документации, устойчива к зашумлённому входу и входу с реверберацией. Это самая коммерчески полезная возможность в сравнении и самая обширная зона соблюдения требований. Продукту, который способен воспроизвести любого говорящего по десяти секундам аудио, придётся давать гораздо более развёрнутый ответ на вопрос «чей это голос и кто дал согласие на его использование», чем продукту, который говорит исключительно предустановленными голосами поставщика.

Realtime-Venus поставляется с эталонным голосом вместе с весами. Вы можете клонировать с его помощью, если у вас есть аудио и запуск обучения, но в релизе ничего не сделано для того, чтобы это было легко — что для развёртывания на собственной инфраструктуре внутри периметра соответствия, пожалуй, является более безопасным вариантом по умолчанию.

Какой из них вы на самом деле покупаете?

Покупайте Qwen-Audio-3.0-TTS, когда на выходе — аудио. Озвучивание, локализация, доступность, дубляж — любой рабочий процесс, где текст появляется раньше звука, а метрика — качество на час отрендеренного аудио. Начните с Flash, если воспроизведение идёт в реальном времени, переходите на Plus, когда сам голос является продуктом, и тарифицируйте процесс клонирования отдельно от библиотеки пресетов.

Выбирайте Realtime-Venus, когда на входе человек, а система должна вести себя как слушатель. Помощь с учётом камеры, взаимодействие без помощи рук — всё, где человек перебьёт на полуслове и ожидает, что система с этим справится. Размен резкий: вы отказываетесь от голоса с рейтингом Elo, тысячи пресетов и любого варианта с хостингом, а взамен получаете единственный из двух, который может вас слышать.

Большинству продуктов нужно и то, и другое, но в разных местах. Чего им не следует делить, так это модель затрат — цена за час аудио является правильной метрикой ровно для одной из этих двух моделей, и это не та, которая ведёт разговор.