
GPT-Live-1 против Qwen-Audio-3.0-TTS: разговор и диктор — не одна и та же статья расходов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг

Поставьте GPT-Live-1 и Qwen-Audio-3.0-TTS рядом по цене за час аудио — и разрыв выглядит решающим: Qwen-Audio-3.0-TTS-Plus от Alibaba синтезирует речь за $27,6 за миллион символов, примерно $1,66 аудио в час, тогда как GPT-Live-1 от OpenAI берёт $3,00 за час непрерывной открытой линии. Рассказчик дешевле, значит, рассказчик побеждает — если только это не неправильное сравнение, и причина, по которой оно неправильно, — самое полезное, что можно извлечь из этого противостояния. Qwen-Audio-3.0-TTS — это модель текст-в-речь. GPT-Live-1 — полнодуплексная разговорная модель. Одна из них читает то, что вы написали. Другая должна несколько раз в секунду решать, закончили ли вы говорить.
Один рендерит, другой беседует.
Синтез речи принимает текст и возвращает аудио. Здесь нет входного аудио, нет хода, который нужно сделать, нет понятия прерывания и нет транскрипта, который нужно вернуть, потому что модель ничего не слышала. Её модель затрат — это печатный станок: страницы на входе, аудио на выходе; качество и пропускная способность — единственные два показателя, которые имеют значение, и оба можно измерить до выпуска.
Полнодуплексная диалоговая модель обрабатывает входящее аудио, пока сама производит исходящее. В её задачи входят те стороны разговора, которые не связаны со словами: делать паузу, когда замолкает пользователь, продолжать сквозь поддакивание вроде «ага», не воспринимая его как перебивание, уступать слово посреди фразы и запускать вызов инструмента, не теряя нить разговора. GPT-Live-1 умеет всё это и вместе с сессией возвращает расшифровки распознавания речи — и это возможно только потому, что модель слушала всё время.
Если ваш продукт читает статьи вслух, преобразует документацию в аудио или озвучивает видео, GPT-Live-1 — неподходящий инструмент по цене в четыре раза выше за час. Если ваш продукт принимает телефонные звонки, Qwen-Audio-3.0-TTS — это лишь треть конвейера, которому всё ещё нужны модель ASR и языковая модель, чтобы стать разговором.
Где Qwen-Audio-3.0-TTS действительно является лучшим ответом
Аргумент в пользу модели Alibaba — не маркетинг. Выпущенная 20 июля 2026 года лабораторией Tongyi Lab компании Alibaba и представленная как хостируемый закрытый API через Alibaba Cloud Model Studio, версия Plus при появлении заняла первое место на арене синтеза речи Artificial Analysis. Однако таблица лидеров — движущаяся мишень, и эта сдвинулась: по состоянию на сентябрь 2026 года Qwen-Audio-3.0-TTS-Plus занимает четвёртое место в Provider Voice Arena с рейтингом Elo 1 232 по 2 306 образцам, позади Cartesia Sonic 3.6 с 1 275, Inworld Realtime TTS-2 с 1 244 и Simba 3.2 от Speechify с 1 233 — трёх моделей из августа и июля, вышедших после неё. Четвёртое место из более чем двадцати, когда лидерство утрачено, а ценовое преимущество сохранилось, — всё ещё сильная позиция. Просто это не та позиция, которую описывали материалы о запуске.

Он лидирует в 10 из 16 языков, которые охватывает, добавляет 20 регионов китайских диалектов, поддерживает клонирование голоса по коротким образцам, включая кросс-языковое клонирование, и содержит 86 встроенных тегов эмоций и манеры подачи.
Эти оговорки достаточно конкретны, чтобы их можно было учесть при планировании.
• Пропускная способность — Plus генерирует примерно 16 символов в секунду, тогда как Simba 3.2 — 30,2, Gemini 3.1 Flash TTS — 27, а Sonic 3.5 — около 120. При пакетном рендеринге это незаметно; для работающего в реальном времени продукта именно это число определяет размер буфера.
• Документация по ценам — широко цитируемая цифра $27.6 за миллион символов не во всех снимках совпадает с собственной страницей цен Alibaba, на которой временами указывались более низкие значения для обоих тарифов. Перед тем как строить прогноз, проверьте текущую цифру на уровне аккаунта, а не в таблице лидеров.
• Библиотека голосов — несмотря на поддержку 16 языков, публичные предустановленные голоса почти полностью состоят из китайского и английского. Остальные четырнадцать языков доступны через процесс клонирования, а не в готовом виде.
• Ограничение функциональности — 86 встроенных тегов эмоций работают только в режиме односторонней потоковой передачи, поэтому выразительное управление сохраняется не на всех путях интеграции.
• Уровни — Flash ориентирован на задержку первого пакета примерно 300 мс для использования в реальном времени; Plus — это уровень качества. Это разные продукты с одинаковым названием, и выбор неправильного — распространённая первая ошибка.
Честная версия каскадного законопроекта
Вот что упускает почасовое сравнение. Разговорный продукт, построенный на модели TTS, — это каскад: модель ASR превращает речь звонящего в текст, языковая модель решает, что сказать, а модель TTS озвучивает это. Три поставщика, три счёта, три бюджета задержки, которые складываются, и передача на каждой границе, где умирает просодия. Этап TTS может стоить $1.66 за час аудио. Два других этапа — вот где на самом деле деньги и ошибки, а каскадная модель не может услышать паузу в середине предложения, которое она уже произносит.
GPT-Live-1 сводит три составляющие в одну сессию и один счётчик: $0.05 за минуту голоса, при этом бэкенд рассуждений тарифицируется отдельно. Две детали обеспечивают честность этого счёта. При инициализации сессии авансом списываются 15 секунд голоса, которые затем засчитываются в счёт последующей длительности, а не добавляются к ней. А бэкенд — это второй счётчик: все делегированные вызовы рассуждений, обращения к инструментам и веб-поиск тарифицируются по обычным тарифам этой модели, поэтому если направить делегирование на передовую модель рассуждений, которая ищет на каждом ходу, это приведёт к дорогому вызову за дешёвым голосовым слоем.
То, что независимые рейтинги говорят об этих двух моделях, поучительно именно потому, что они измеряют разные вещи, и ни один из них не приукрашивает свой предмет. Qwen-Audio-3.0-TTS-Plus занимает четвёртое место по качеству и находится почти в самом низу по пропускной способности. GPT-Live-1 занимает седьмое место из одиннадцати в индексе Speech to Speech от Artificial Analysis с показателем 69,8% — уступая GPT-Realtime-2.1, которую заменяет, с 73,9% — при этом тарифицируется по нижней границе диапазона стоимости за час входного аудио в этом индексе: 4,42 доллара против 10,75 доллара у GPT-Realtime-2.1. Ни одна из моделей не занимает первое место в своей категории. Обе дешевле того, что должны были превзойти.

Этот второй счётчик — то место, где слой маршрутизации становится проектным решением, а не оптимизацией. OrcaRouter не несёт ни GPT-Live-1, ни Qwen-Audio-3.0-TTS — голосовой слой в обоих случаях вне нашей досягаемости, и мы его нигде не маршрутизируем. А вот со звеном рассуждений всё иначе. Около 190 моделей от одиннадцати вышестоящих провайдеров стоят за одним ключом по прейскурантной цене провайдера, без наценки, и снижение цены провайдером вступает в силу в тот же день, а не при следующем продлении контракта. Для каскада это полностью покрывает среднее звено: держите два варианта ASR и три рассуждающие модели за одной конечной точкой, сравнивайте их друг с другом на реальном трафике и позволяйте автоматическому аварийному переключению принять на себя плохой день вышестоящего провайдера, не сбрасывая вызов.
Вопрос согласия работает в обратную сторону.
Клонирование голоса — самая коммерчески полезная возможность Qwen-Audio-3.0-TTS и одновременно самая обширная зона требований соответствия. Десяти секунд эталонного аудио достаточно, чтобы воспроизвести голос говорящего, в том числе на другом языке, — это преображает локализацию и создаёт риск везде, где важна идентичность. OpenAI выпустила GPT-Live-1 вообще без клонирования и без каких-либо пользовательских голосов — 12 голосов в API на выбор, и это весь список.
Эту асимметрию легко пропустить при сравнении функций и трудно пропустить при анализе рисков. У продукта, который говорит только одним из двенадцати вендорских голосов, ответ на вопрос «чей это голос и кто дал согласие на его использование» гораздо короче, чем у продукта, способного воспроизвести любой голос по образцу. Если вам нужно клонирование, решение о пайплайне уже принято за вас, и остаётся вопрос: что им управляет. Если нет, ограничение GPT-Live-1 стоит прочитать как меру контроля, которую вам не пришлось создавать.
Какой купить
Купите Qwen-Audio-3.0-TTS, если результат — это контент: озвучивание, локализация, аудио для доступности, дубляж или любой рабочий процесс, где текст существует до появления аудио, а метрика — качество на час отрендеренного материала. Начните с Flash, если вам нужно воспроизведение в реальном времени, переходите на Plus, когда сам голос является конечным результатом, и оценивайте процесс клонирования отдельно от предустановленных голосов.
Купите GPT-Live-1, если на входе человек. Линии поддержки, процессы бронирования, вступительные интервью — всё, где первый слог пользователя звучит, пока модель ещё на середине предложения, и система должна вести себя как слушатель, а не как игрок. Это стоит дороже за час аудио, и это единственный из двух, который можно прервать.
Эти двое гораздо чаще дополняют друг друга, чем соперничают: множество продуктов хотят, чтобы Qwen-Audio-3.0-TTS читал документ, а дуплексная модель обрабатывала последующий звонок. А вот общая модель затрат им не нужна. Метрика «стоимость за час аудио» подходит ровно для одной из них.
