Сгенерированная hero-карточка для 'Gemini 3.8 Live vs Qwen-Audio-3.1-TTS' на белом фоне с мягкими сине-голубыми градиентными акцентами. Две панели расположены под заголовком 'Две половины, обновлённые с разницей в восемь дней'. Левая панель охватывает '15 сент. 2026 — Gemini 3.8 Live и Extended Thinking в Live API'. Правая панель охватывает '23 сент. 2026 — Qwen-Audio-3.1-TTS в Apsara, синтез сокращён на ~70%'. Строка в нижнем колонтитуле гласит: 'Они встречаются в середине пайплайна, а не на одной и той же работе.' Логотип OrcaRouter скомпонован в правом нижнем углу.
Guides & Insights

Gemini 3.8 Live против Qwen-Audio-3.1-TTS: две половины голосового стека, переоценённые с разницей в восемь дней

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Gemini 3.8 Live — это модель Google для преобразования речи в речь, выпущенная 15 сентября 2026 года как gemini-3.8-live и gemini-3.8-live-extended-thinking в Live API. Qwen-Audio-3.1-TTS — это модель Alibaba для синтеза речи из текста, анонсированная на конференции Apsara в Ханчжоу 23 сентября 2026 года, восемь дней спустя, с прилагающимся к ней снижением цены примерно на 70% на синтез речи. Этот восьмидневный разрыв — причина, по которой это сравнение стоит прочитать сейчас, а не в июле. Ничего в ролях двух продуктов не изменилось — один слушает и говорит, другой читает текст вслух — но обе половины производственного голосового конвейера были перестроены или переоценены в течение двух недель, и арифметика, которая раньше решала это противостояние, тихо сместилась.

Две половины, обновляемые с разницей в восемь дней

Начнём с того, что делает это сочетание необычным: две модели не конкурируют. У голосового продукта есть рот и есть ухо — и здесь по одному из каждого. Gemini 3.8 Live замыкает цикл: аудио и видео на входе, аудио на выходе, перебивания обрабатываются, вызовы инструментов идут под разговором. Qwen-Audio-3.1-TTS принимает строку и опорный голос и возвращает исполнение. Это в первую очередь рот, а не что-либо иное, и ухом он быть не пытается.

Интересным сентябрьский тайминг делает то, что эти два анонса нацелены на противоположные концы одной и той же бюджетной статьи. Запуск Google 15 сентября был историей о возможностях, не сопровождавшейся изменением цены; анонс Alibaba 23 сентября был в основном историей о марже, а новые возможности шли прицепом. Команда, построившая гибридный пайплайн в августе, за восемь дней получила повод пересмотреть обе составляющие — и только одна из этих составляющих подешевела.

Что релиз 3.1 на самом деле изменил на стороне Qwen

23 сентября Alibaba выпустила не одну модель. Поколение 3.1 охватывает пять эндпоинтов — Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next и Qwen-Audio-3.1-Realtime — и только один из них, обычный уровень TTS, является drop-in-заменой для всех, кто уже вызывает модель TTS 3.0.

На этом уровне изменились три вещи, и одна из них — реальная стоимость миграции. Управление подачей перешло от фиксированного набора из 86 встроенных тегов к инструкциям на естественном языке: вы описываете нужные эмоции, темп и стиль вместо того, чтобы вставлять нужную скобку в нужное место. Появился кросс-языковой перенос тембра, позволяющий одному эталонному голосу сохранять свою идентичность при переходе между мандаринским, кантонским, английским и японским. А модель теперь напрямую принимает шумное или с эхом эталонное аудио без отдельного этапа шумоподавления. Языковой охват не изменился: по данным поставщика, 16 языков плюс 20 регионов китайских диалектов, и — на это стоит указать, потому что в других местах это сглаживают — в собственных материалах Alibaba говорится, что уровень 3.1 добавляет семь языков, что не согласуется с 16, указанными в опубликованном описании покрытия июльского поколения. Считайте оба числа данными поставщика, пока не проверите нужные вам конкретные языки в Model Studio.

Действительно новым продуктом в этом релизе является Qwen-Audio-3.1-TTS-Next, который Alibaba называет моделью «Audiogen»: один проход, совместно создающий голос, звуковые эффекты и фоновую атмосферу — для диалогов нескольких говорящих, сборки подкастов и работы со сценами. Его цена — $0,848 за миллион входных токенов и $1,696 за миллион выходных токенов на пекинском узле, с ограничением в 3000 символов входных данных, 240 секунд сгенерированного аудио для подкастов и 120 секунд в остальных случаях, три запроса в секунду и приёмом до трёх референсных клипов по 30 секунд каждый. Он работает только с китайским и английским. Если ваш пайплайн — это один диктор, читающий сценарий, этот продукт вам не нужен; если это два ведущих и музыкальная подложка, именно из-за него вообще стоит присмотреться к этому релизу.

Шов — это то, что вы на самом деле выбираете.

Поскольку эти две модели выполняют разные задачи, это решение — не соревнование. Вопрос в том, где вы размещаете точку передачи, и сколько вы готовы заплатить за то, чтобы этот стык был незаметен.

Есть две честные архитектуры. Первая — единая сеть: Gemini 3.8 Live обрабатывает весь ход диалога, слышит звонящего, решает, что сказать, и произносит это, а вы принимаете голос, который он вам даёт, — который вы не можете ни клонировать, ни брендировать. Вторая — каскад: распознавание, затем рассуждение, затем Qwen-Audio-3.1-TTS в роли рта, что даёт вам тысячу голосов, включая голос, записанный вашим собственным диктором, ценой задержки на двух-трёх стыках между вендорами и просодии, которая теряется, когда предложение разделяется между вызовами API.

Большинство команд в итоге получают и то, и другое, и это не отсутствие смелости. Используйте модель реального времени там, где задержка ощущается — перебивание, подтверждение, то самое «мм-хм», которое говорит звонящему, что вы всё ещё на линии, — и модель синтеза там, где слышно качество: долгое зачитывание политики, номер подтверждения, произносимый в намеренно размеренном темпе, фирменный голос, который должен быть одинаковым в каждом отдельном звонке. Гибрид — правильный ответ для большого класса продуктов. Именно здесь модель затрат становится сложной, потому что теперь вы измеряете две разные единицы.

A screenshot of the Artificial Analysis Speech to Speech leaderboard in English, captured 25 September 2026, showing the AA Speech to Speech Index panel with index values of 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with the cost-per-hour-of-input-audio axis running to roughly $10.75. The bar labels are set vertically and are not legible at capture size. No Alibaba Qwen-Audio model appears on the board, because the board scores speech-to-speech models and Qwen-Audio-3.1-TTS is a synthesis model.

Цена за аудиочас — единственная единица измерения, которая подходит обоим.

Google тарифицирует Live API по минутам; Alibaba тарифицирует тарифные уровни Qwen TTS по символам и по токенам. Чтобы сравнить их, нужно выбрать нормализатор, и единственный обоснованный вариант для голоса — это час готового аудио.

• Тарифицируется на входе — Gemini 3.8 Live за минуту аудио: $0,005 на входе и $0,018 на выходе против Qwen-Audio-3.1-TTS за миллион символов; при этом тариф 3.0 Plus держится около $27,60, а тариф Flash — около $15 до снижения, а тариф TTS Flash после него указан на уровне 1,5 юаня за миллион входных токенов и 12 юаней за миллион выходных токенов
• Тарифицируется на выходе — двусторонний разговор в Gemini 3.8 Live обходится примерно в $1,38 за час разговора реального времени по прайс-листу, до какого-либо кэширования, против Qwen-Audio-3.1-TTS — одностороннего потока; при этом тариф 3.1-Next — $0,848 за миллион входных токенов и $1,696 за миллион выходных на пекинском узле
• Слышит звонящего — Gemini 3.8 Live: да, нативный ввод аудио и видео против Qwen-Audio-3.1-TTS: нет, текст на входе и аудио на выходе
• Голоса — Gemini 3.8 Live: один голос, не клонируется, не брендируется против Qwen-Audio-3.1-TTS: более тысячи, с zero-shot-клонированием из зашумлённого эталонного аудио
• Языки — Gemini 3.8 Live: заявленные производителем 97, с переключением в середине разговора против Qwen-Audio-3.1-TTS: заявленные производителем 16 плюс 20 регионов китайских диалектов, с переносом тембра между мандаринским, кантонским, английским и японским
• Управление подачей — Gemini 3.8 Live: промпт и контекст разговора против Qwen-Audio-3.1-TTS: инструкция на естественном языке, заменяющая 86 встроенных тегов поколения 3.0
• Независимая оценка — Gemini 3.8 Live: 82,6 в Artificial Analysis Speech to Speech Index для варианта Extended Thinking и 76,0 для стандартного против Qwen-Audio-3.1-TTS: отсутствует; ближайший показатель Qwen — 1 259 Elo для тарифа 3.0 Plus предыдущего поколения в Provider Voice Arena, что является оценкой предшественника, а не этой модели

Процентное снижение указывается относительно тарифов, которые различаются в зависимости от региона и уровня, поэтому заявленные 70% — это не обещание относительно вашего трафика, а Aliba​ba Cloud также перевёл транскрипцию в реальном времени на сингапурском узле с тарификации по длительности на тарификацию по токенам — что является менее предсказуемой основой, поскольку и тишина, и многоходовой контекст увеличивают потребление токенов. Сверьте новый тарифный лист со своим аудио.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273 with a 17-point interval over 1,757 samples and $49.0 per million characters, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples at $16.5, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259 on 1,447 samples at $27.6, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0. The board scores synthesis models and carries no row for Qwen-Audio-3.1-TTS or for any Gemini 3.8 Live endpoint.

Что не решает обновление 3.1

Вот та часть, в которой легко ошибиться в обоих направлениях. Улучшения версии 3.1 не делают Qwen-Audio-3.1-TTS кандидатом на ту задачу, которую решает Gemini 3.8 Live, — управление на основе инструкций, перенос тембра и устойчивость к шумному входу делают его лишь лучшим «ртом», и ни одно из них не даёт ему «уха». Точно так же позиция Gemini 3.8 Live в бенчмарках ничего не говорит о том, переживёт ли ваш фирменный голос предложение на кантонском.

В доказательствах есть также пробел, который снижение цены делает тем более соблазнительным игнорировать. Qwen-Audio-3.1-TTS не имеет независимой оценки. Рейтинг в 1 259 Elo, который указан рядом с именем Qwen на Provider Voice Arena, принадлежит Qwen-Audio-3.0-TTS-Plus — заменяемой модели — и измерен на 1 447 образцах. У преемника пока нет собственной строки в Arena. Если для вашего процесса утверждения требуется показатель от третьей стороны — а для голоса бренда, вероятно, должен, — то у более новой модели его нет, а более дешёвый уровень — тот, который вы пока не можете защитить. Единственное событие, которое могло бы решить этот вопрос, — появление Qwen-Audio-3.1-TTS в таблице слепого прослушивания.

Где один ключ помогает, а где — нет

Одно из последствий релиза 3.1 легко упустить, потому что оно выглядит как деталь промпт-инжиниринга, а не инфраструктуры. Замена 86 жёстко закодированных тегов свободными инструкциями превращает ваши указания по подаче в текстовые артефакты. Теперь вы их генерируете, версионируете и заново проверяете каждое из них на соответствие тому, как их интерпретирует новая модель, — и режим отказа здесь — дрейф, а не ошибка, потому что две формулировки «тепло, но без сентиментальности» не сработают одинаково.

Это задача текстового вывода, обёрнутая вокруг речевого пайплайна, и именно здесь мы полезны. OrcaRouter не маршрутизирует Qwen-Audio-3.1-TTS или какую-либо модель Qwen-Audio, и мы также не маршрутизируем эндпоинты Gemini 3.8 Live — ни одну из половин этого стека нельзя вызвать через нас, и ничто здесь не должно восприниматься как утверждение, что это возможно. Что мы действительно предоставляем — это слой, который пишет и проверяет текст указаний: qwen/qwen3.8-flash и google/gemini-3.8-flash среди более чем 200 моделей, доступных по одному ключу по прайс-листу провайдера без наценки, с DSL маршрутизации, который объединяет несколько моделей в один вызов и автоматическое переключение при сбое, когда вышестоящий сервис деградирует. Когда вы собираетесь повторно проверить десять тысяч промптов доставки с помощью модели, которая только что изменила то, как она их читает, создание вариантов и оценка их согласованности — это та часть, которая должна быть одним контрактом, а не четырьмя.

Что измерить перед выбором

Три эксперимента отвечают больше, чем любой совет директоров. Пропустите один эталонный голос и один абзац вашего собственного сценария через Qwen-Audio-3.1-TTS и послушайте, даёт ли управление на основе инструкций одну и ту же подачу дважды — это и есть риск миграции, и его дешевле измерить, чем планировать с оглядкой на него. Возьмите реальную запись звонка с вашим собственным фоновым шумом и пропустите через Gemini 3.8 Live, затем проверьте, сохраняется ли очерёдность реплик, когда звонящий перебивает на середине слова — именно это пытается количественно измерить индекс преобразования речи в речь, и при столкновении с реальной телефонной линией он не выдерживает достаточно надёжно, чтобы принимать его на веру. И посчитайте арифметику по своему собственному объёму в аудиочасах, а не в единицах, в которых выставляют счета оба поставщика, потому что именно в этой конкретной паре ожидаемая разница в цене между «дешёвым китайским TTS» и «флагманом Google» никогда не была такой большой, как кажется, а после 23 сентября она стала ещё меньше.

A generated summary card for Gemini 3.8 Live vs Qwen-Audio-3.1-TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — speech-to-speech, Live API, 15 September 2026', 'Qwen-Audio-3.1-TTS — text-to-speech, Apsara, 23 September 2026', 'The gap: eight days, and only one of them got cheaper', 'Independent score: Gemini 82.6 on AA Speech to Speech; Qwen 3.1-TTS none', and 'Verdict: not substitutes — pick which half you are shopping for'. A footer line reads 'Vendor-reported figures where stated; independently measured where a board is named.' The OrcaRouter logo is composited in the bottom-right corner.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube