Титульная карточка для «GPT-Live-1 vs Qwen-Audio-3.0-TTS», с подзаголовком «Один ведёт беседу, другой озвучивает сценарий», с бейджем «Не взаимозаменяемы — разные задачи, разные счета» и тремя карточками: «Qwen-Audio-3.0-TTS Plus — Elo 1 232, четвёртое место в AA Provider Voice Arena, $27,6 за 1 млн символов», «GPT-Live-1 — $0,05 за голосовую минуту, полный дуплекс, $3,00 за час открытой линии» и «Подвох — примерно 16 символов в секунду на стороне рассказчика, текст на входе и аудио на выходе», над нижней полосой с надписью «Данные Qwen по Artificial Analysis; данные GPT-Live-1 — Ope​nAI-reported.» Логотип OrcaRouter скомпонован в правом нижнем углу.
Guides & Insights

GPT-Live-1 против Qwen-Audio-3.0-TTS: разговор и диктор — не одна и та же статья расходов

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям
A two-column scoreboard titled 'GPT-Live-1 vs Qwen-Audio-3.0-TTS - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Input: audio and text', 'Price: $0.05 per voice minute', 'Interruption handling: native', 'Voices: 12, no cloning', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Qwen-Audio-3.0-TTS: 'Job: text-to-speech rendering', 'Input: text only', 'Price: $27.6 per 1M characters, about $1.66 per hour of audio', 'Interruption handling: not applicable, it never hears', 'Voices: 16 languages, cloning from short samples', 'Independent score: Elo 1,232, fourth on the AA Provider Voice Arena'. Footer: 'Qwen pricing and Elo per Artificial Analysis; GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced.'

Поставьте GPT-Live-1 и Qwen-Audio-3.0-TTS рядом по цене за час аудио — и разрыв выглядит решающим: Qwen-Audio-3.0-TTS-Plus от Aliba​ba синтезирует речь за $27,6 за миллион символов, примерно $1,66 аудио в час, тогда как GPT-Live-1 от Ope​nAI берёт $3,00 за час непрерывной открытой линии. Рассказчик дешевле, значит, рассказчик побеждает — если только это не неправильное сравнение, и причина, по которой оно неправильно, — самое полезное, что можно извлечь из этого противостояния. Qwen-Audio-3.0-TTS — это модель текст-в-речь. GPT-Live-1 — полнодуплексная разговорная модель. Одна из них читает то, что вы написали. Другая должна несколько раз в секунду решать, закончили ли вы говорить.

Один рендерит, другой беседует.

Синтез речи принимает текст и возвращает аудио. Здесь нет входного аудио, нет хода, который нужно сделать, нет понятия прерывания и нет транскрипта, который нужно вернуть, потому что модель ничего не слышала. Её модель затрат — это печатный станок: страницы на входе, аудио на выходе; качество и пропускная способность — единственные два показателя, которые имеют значение, и оба можно измерить до выпуска.

Полнодуплексная диалоговая модель обрабатывает входящее аудио, пока сама производит исходящее. В её задачи входят те стороны разговора, которые не связаны со словами: делать паузу, когда замолкает пользователь, продолжать сквозь поддакивание вроде «ага», не воспринимая его как перебивание, уступать слово посреди фразы и запускать вызов инструмента, не теряя нить разговора. GPT-Live-1 умеет всё это и вместе с сессией возвращает расшифровки распознавания речи — и это возможно только потому, что модель слушала всё время.

Если ваш продукт читает статьи вслух, преобразует документацию в аудио или озвучивает видео, GPT-Live-1 — неподходящий инструмент по цене в четыре раза выше за час. Если ваш продукт принимает телефонные звонки, Qwen-Audio-3.0-TTS — это лишь треть конвейера, которому всё ещё нужны модель ASR и языковая модель, чтобы стать разговором.

Где Qwen-Audio-3.0-TTS действительно является лучшим ответом

Аргумент в пользу модели Alibaba — не маркетинг. Выпущенная 20 июля 2026 года лабораторией Tongyi Lab компании Alibaba и представленная как хостируемый закрытый API через Alibaba Cloud Model Studio, версия Plus при появлении заняла первое место на арене синтеза речи Artificial Analysis. Однако таблица лидеров — движущаяся мишень, и эта сдвинулась: по состоянию на сентябрь 2026 года Qwen-Audio-3.0-TTS-Plus занимает четвёртое место в Provider Voice Arena с рейтингом Elo 1 232 по 2 306 образцам, позади Cartesia Sonic 3.6 с 1 275, Inworld Realtime TTS-2 с 1 244 и Simba 3.2 от Speechify с 1 233 — трёх моделей из августа и июля, вышедших после неё. Четвёртое место из более чем двадцати, когда лидерство утрачено, а ценовое преимущество сохранилось, — всё ещё сильная позиция. Просто это не та позиция, которую описывали материалы о запуске.

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured September 2026, showing the top four: Cartesia Sonic 3.6 first at Elo 1,275 and $49.0 per million characters, Inworld Realtime TTS-2 second at 1,244, SpeechifyAI Simba 3.2 third at 1,233, and Alibaba's Qwen-Audio-3.0-TTS-Plus fourth at Elo 1,232 with a confidence interval of -14/14, 2,306 samples, a July 2026 release and $27.6 per million characters.

Он лидирует в 10 из 16 языков, которые охватывает, добавляет 20 регионов китайских диалектов, поддерживает клонирование голоса по коротким образцам, включая кросс-языковое клонирование, и содержит 86 встроенных тегов эмоций и манеры подачи.

Эти оговорки достаточно конкретны, чтобы их можно было учесть при планировании.

• Пропускная способность — Plus генерирует примерно 16 символов в секунду, тогда как Simba 3.2 — 30,2, Gemini 3.1 Flash TTS — 27, а Sonic 3.5 — около 120. При пакетном рендеринге это незаметно; для работающего в реальном времени продукта именно это число определяет размер буфера.

• Документация по ценам — широко цитируемая цифра $27.6 за миллион символов не во всех снимках совпадает с собственной страницей цен Alibaba, на которой временами указывались более низкие значения для обоих тарифов. Перед тем как строить прогноз, проверьте текущую цифру на уровне аккаунта, а не в таблице лидеров.

• Библиотека голосов — несмотря на поддержку 16 языков, публичные предустановленные голоса почти полностью состоят из китайского и английского. Остальные четырнадцать языков доступны через процесс клонирования, а не в готовом виде.

• Ограничение функциональности — 86 встроенных тегов эмоций работают только в режиме односторонней потоковой передачи, поэтому выразительное управление сохраняется не на всех путях интеграции.

• Уровни — Flash ориентирован на задержку первого пакета примерно 300 мс для использования в реальном времени; Plus — это уровень качества. Это разные продукты с одинаковым названием, и выбор неправильного — распространённая первая ошибка.

Честная версия каскадного законопроекта

Вот что упускает почасовое сравнение. Разговорный продукт, построенный на модели TTS, — это каскад: модель ASR превращает речь звонящего в текст, языковая модель решает, что сказать, а модель TTS озвучивает это. Три поставщика, три счёта, три бюджета задержки, которые складываются, и передача на каждой границе, где умирает просодия. Этап TTS может стоить $1.66 за час аудио. Два других этапа — вот где на самом деле деньги и ошибки, а каскадная модель не может услышать паузу в середине предложения, которое она уже произносит.

GPT-Live-1 сводит три составляющие в одну сессию и один счётчик: $0.05 за минуту голоса, при этом бэкенд рассуждений тарифицируется отдельно. Две детали обеспечивают честность этого счёта. При инициализации сессии авансом списываются 15 секунд голоса, которые затем засчитываются в счёт последующей длительности, а не добавляются к ней. А бэкенд — это второй счётчик: все делегированные вызовы рассуждений, обращения к инструментам и веб-поиск тарифицируются по обычным тарифам этой модели, поэтому если направить делегирование на передовую модель рассуждений, которая ищет на каждом ходу, это приведёт к дорогому вызову за дешёвым голосовым слоем.

То, что независимые рейтинги говорят об этих двух моделях, поучительно именно потому, что они измеряют разные вещи, и ни один из них не приукрашивает свой предмет. Qwen-Audio-3.0-TTS-Plus занимает четвёртое место по качеству и находится почти в самом низу по пропускной способности. GPT-Live-1 занимает седьмое место из одиннадцати в индексе Speech to Speech от Artificial Analysis с показателем 69,8% — уступая GPT-Realtime-2.1, которую заменяет, с 73,9% — при этом тарифицируется по нижней границе диапазона стоимости за час входного аудио в этом индексе: 4,42 доллара против 10,75 доллара у GPT-Realtime-2.1. Ни одна из моделей не занимает первое место в своей категории. Обе дешевле того, что должны были превзойти.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with companion cost and speed charts showing GPT-Live-1 at $4.42 per hour of input audio and 0.78 seconds to first audio.

Этот второй счётчик — то место, где слой маршрутизации становится проектным решением, а не оптимизацией. OrcaRouter не несёт ни GPT-Live-1, ни Qwen-Audio-3.0-TTS — голосовой слой в обоих случаях вне нашей досягаемости, и мы его нигде не маршрутизируем. А вот со звеном рассуждений всё иначе. Около 190 моделей от одиннадцати вышестоящих провайдеров стоят за одним ключом по прейскурантной цене провайдера, без наценки, и снижение цены провайдером вступает в силу в тот же день, а не при следующем продлении контракта. Для каскада это полностью покрывает среднее звено: держите два варианта ASR и три рассуждающие модели за одной конечной точкой, сравнивайте их друг с другом на реальном трафике и позволяйте автоматическому аварийному переключению принять на себя плохой день вышестоящего провайдера, не сбрасывая вызов.

Клонирование голоса — самая коммерчески полезная возможность Qwen-Audio-3.0-TTS и одновременно самая обширная зона требований соответствия. Десяти секунд эталонного аудио достаточно, чтобы воспроизвести голос говорящего, в том числе на другом языке, — это преображает локализацию и создаёт риск везде, где важна идентичность. Ope​nAI выпустила GPT-Live-1 вообще без клонирования и без каких-либо пользовательских голосов — 12 голосов в API на выбор, и это весь список.

Эту асимметрию легко пропустить при сравнении функций и трудно пропустить при анализе рисков. У продукта, который говорит только одним из двенадцати вендорских голосов, ответ на вопрос «чей это голос и кто дал согласие на его использование» гораздо короче, чем у продукта, способного воспроизвести любой голос по образцу. Если вам нужно клонирование, решение о пайплайне уже принято за вас, и остаётся вопрос: что им управляет. Если нет, ограничение GPT-Live-1 стоит прочитать как меру контроля, которую вам не пришлось создавать.

Какой купить

Купите Qwen-Audio-3.0-TTS, если результат — это контент: озвучивание, локализация, аудио для доступности, дубляж или любой рабочий процесс, где текст существует до появления аудио, а метрика — качество на час отрендеренного материала. Начните с Flash, если вам нужно воспроизведение в реальном времени, переходите на Plus, когда сам голос является конечным результатом, и оценивайте процесс клонирования отдельно от предустановленных голосов.

Купите GPT-Live-1, если на входе человек. Линии поддержки, процессы бронирования, вступительные интервью — всё, где первый слог пользователя звучит, пока модель ещё на середине предложения, и система должна вести себя как слушатель, а не как игрок. Это стоит дороже за час аудио, и это единственный из двух, который можно прервать.

Эти двое гораздо чаще дополняют друг друга, чем соперничают: множество продуктов хотят, чтобы Qwen-Audio-3.0-TTS читал документ, а дуплексная модель обрабатывала последующий звонок. А вот общая модель затрат им не нужна. Метрика «стоимость за час аудио» подходит ровно для одной из них.