
Gemini 3.8 Live против Qwen-Audio-3.1-TTS: две половины голосового стека, переоценённые с разницей в восемь дней
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 36 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 181 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Gemini 3.8 Live — это модель Google для преобразования речи в речь, выпущенная 15 сентября 2026 года как gemini-3.8-live и gemini-3.8-live-extended-thinking в Live API. Qwen-Audio-3.1-TTS — это модель Alibaba для синтеза речи из текста, анонсированная на конференции Apsara в Ханчжоу 23 сентября 2026 года, восемь дней спустя, с прилагающимся к ней снижением цены примерно на 70% на синтез речи. Этот восьмидневный разрыв — причина, по которой это сравнение стоит прочитать сейчас, а не в июле. Ничего в ролях двух продуктов не изменилось — один слушает и говорит, другой читает текст вслух — но обе половины производственного голосового конвейера были перестроены или переоценены в течение двух недель, и арифметика, которая раньше решала это противостояние, тихо сместилась.
Две половины, обновляемые с разницей в восемь дней
Начнём с того, что делает это сочетание необычным: две модели не конкурируют. У голосового продукта есть рот и есть ухо — и здесь по одному из каждого. Gemini 3.8 Live замыкает цикл: аудио и видео на входе, аудио на выходе, перебивания обрабатываются, вызовы инструментов идут под разговором. Qwen-Audio-3.1-TTS принимает строку и опорный голос и возвращает исполнение. Это в первую очередь рот, а не что-либо иное, и ухом он быть не пытается.
Интересным сентябрьский тайминг делает то, что эти два анонса нацелены на противоположные концы одной и той же бюджетной статьи. Запуск Google 15 сентября был историей о возможностях, не сопровождавшейся изменением цены; анонс Alibaba 23 сентября был в основном историей о марже, а новые возможности шли прицепом. Команда, построившая гибридный пайплайн в августе, за восемь дней получила повод пересмотреть обе составляющие — и только одна из этих составляющих подешевела.
Что релиз 3.1 на самом деле изменил на стороне Qwen
23 сентября Alibaba выпустила не одну модель. Поколение 3.1 охватывает пять эндпоинтов — Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next и Qwen-Audio-3.1-Realtime — и только один из них, обычный уровень TTS, является drop-in-заменой для всех, кто уже вызывает модель TTS 3.0.
На этом уровне изменились три вещи, и одна из них — реальная стоимость миграции. Управление подачей перешло от фиксированного набора из 86 встроенных тегов к инструкциям на естественном языке: вы описываете нужные эмоции, темп и стиль вместо того, чтобы вставлять нужную скобку в нужное место. Появился кросс-языковой перенос тембра, позволяющий одному эталонному голосу сохранять свою идентичность при переходе между мандаринским, кантонским, английским и японским. А модель теперь напрямую принимает шумное или с эхом эталонное аудио без отдельного этапа шумоподавления. Языковой охват не изменился: по данным поставщика, 16 языков плюс 20 регионов китайских диалектов, и — на это стоит указать, потому что в других местах это сглаживают — в собственных материалах Alibaba говорится, что уровень 3.1 добавляет семь языков, что не согласуется с 16, указанными в опубликованном описании покрытия июльского поколения. Считайте оба числа данными поставщика, пока не проверите нужные вам конкретные языки в Model Studio.
Действительно новым продуктом в этом релизе является Qwen-Audio-3.1-TTS-Next, который Alibaba называет моделью «Audiogen»: один проход, совместно создающий голос, звуковые эффекты и фоновую атмосферу — для диалогов нескольких говорящих, сборки подкастов и работы со сценами. Его цена — $0,848 за миллион входных токенов и $1,696 за миллион выходных токенов на пекинском узле, с ограничением в 3000 символов входных данных, 240 секунд сгенерированного аудио для подкастов и 120 секунд в остальных случаях, три запроса в секунду и приёмом до трёх референсных клипов по 30 секунд каждый. Он работает только с китайским и английским. Если ваш пайплайн — это один диктор, читающий сценарий, этот продукт вам не нужен; если это два ведущих и музыкальная подложка, именно из-за него вообще стоит присмотреться к этому релизу.
Шов — это то, что вы на самом деле выбираете.
Поскольку эти две модели выполняют разные задачи, это решение — не соревнование. Вопрос в том, где вы размещаете точку передачи, и сколько вы готовы заплатить за то, чтобы этот стык был незаметен.
Есть две честные архитектуры. Первая — единая сеть: Gemini 3.8 Live обрабатывает весь ход диалога, слышит звонящего, решает, что сказать, и произносит это, а вы принимаете голос, который он вам даёт, — который вы не можете ни клонировать, ни брендировать. Вторая — каскад: распознавание, затем рассуждение, затем Qwen-Audio-3.1-TTS в роли рта, что даёт вам тысячу голосов, включая голос, записанный вашим собственным диктором, ценой задержки на двух-трёх стыках между вендорами и просодии, которая теряется, когда предложение разделяется между вызовами API.
Большинство команд в итоге получают и то, и другое, и это не отсутствие смелости. Используйте модель реального времени там, где задержка ощущается — перебивание, подтверждение, то самое «мм-хм», которое говорит звонящему, что вы всё ещё на линии, — и модель синтеза там, где слышно качество: долгое зачитывание политики, номер подтверждения, произносимый в намеренно размеренном темпе, фирменный голос, который должен быть одинаковым в каждом отдельном звонке. Гибрид — правильный ответ для большого класса продуктов. Именно здесь модель затрат становится сложной, потому что теперь вы измеряете две разные единицы.

Цена за аудиочас — единственная единица измерения, которая подходит обоим.
Google тарифицирует Live API по минутам; Alibaba тарифицирует тарифные уровни Qwen TTS по символам и по токенам. Чтобы сравнить их, нужно выбрать нормализатор, и единственный обоснованный вариант для голоса — это час готового аудио.
• Тарифицируется на входе — Gemini 3.8 Live за минуту аудио: $0,005 на входе и $0,018 на выходе против Qwen-Audio-3.1-TTS за миллион символов; при этом тариф 3.0 Plus держится около $27,60, а тариф Flash — около $15 до снижения, а тариф TTS Flash после него указан на уровне 1,5 юаня за миллион входных токенов и 12 юаней за миллион выходных токенов
• Тарифицируется на выходе — двусторонний разговор в Gemini 3.8 Live обходится примерно в $1,38 за час разговора реального времени по прайс-листу, до какого-либо кэширования, против Qwen-Audio-3.1-TTS — одностороннего потока; при этом тариф 3.1-Next — $0,848 за миллион входных токенов и $1,696 за миллион выходных на пекинском узле
• Слышит звонящего — Gemini 3.8 Live: да, нативный ввод аудио и видео против Qwen-Audio-3.1-TTS: нет, текст на входе и аудио на выходе
• Голоса — Gemini 3.8 Live: один голос, не клонируется, не брендируется против Qwen-Audio-3.1-TTS: более тысячи, с zero-shot-клонированием из зашумлённого эталонного аудио
• Языки — Gemini 3.8 Live: заявленные производителем 97, с переключением в середине разговора против Qwen-Audio-3.1-TTS: заявленные производителем 16 плюс 20 регионов китайских диалектов, с переносом тембра между мандаринским, кантонским, английским и японским
• Управление подачей — Gemini 3.8 Live: промпт и контекст разговора против Qwen-Audio-3.1-TTS: инструкция на естественном языке, заменяющая 86 встроенных тегов поколения 3.0
• Независимая оценка — Gemini 3.8 Live: 82,6 в Artificial Analysis Speech to Speech Index для варианта Extended Thinking и 76,0 для стандартного против Qwen-Audio-3.1-TTS: отсутствует; ближайший показатель Qwen — 1 259 Elo для тарифа 3.0 Plus предыдущего поколения в Provider Voice Arena, что является оценкой предшественника, а не этой модели
Процентное снижение указывается относительно тарифов, которые различаются в зависимости от региона и уровня, поэтому заявленные 70% — это не обещание относительно вашего трафика, а Alibaba Cloud также перевёл транскрипцию в реальном времени на сингапурском узле с тарификации по длительности на тарификацию по токенам — что является менее предсказуемой основой, поскольку и тишина, и многоходовой контекст увеличивают потребление токенов. Сверьте новый тарифный лист со своим аудио.

Что не решает обновление 3.1
Вот та часть, в которой легко ошибиться в обоих направлениях. Улучшения версии 3.1 не делают Qwen-Audio-3.1-TTS кандидатом на ту задачу, которую решает Gemini 3.8 Live, — управление на основе инструкций, перенос тембра и устойчивость к шумному входу делают его лишь лучшим «ртом», и ни одно из них не даёт ему «уха». Точно так же позиция Gemini 3.8 Live в бенчмарках ничего не говорит о том, переживёт ли ваш фирменный голос предложение на кантонском.
В доказательствах есть также пробел, который снижение цены делает тем более соблазнительным игнорировать. Qwen-Audio-3.1-TTS не имеет независимой оценки. Рейтинг в 1 259 Elo, который указан рядом с именем Qwen на Provider Voice Arena, принадлежит Qwen-Audio-3.0-TTS-Plus — заменяемой модели — и измерен на 1 447 образцах. У преемника пока нет собственной строки в Arena. Если для вашего процесса утверждения требуется показатель от третьей стороны — а для голоса бренда, вероятно, должен, — то у более новой модели его нет, а более дешёвый уровень — тот, который вы пока не можете защитить. Единственное событие, которое могло бы решить этот вопрос, — появление Qwen-Audio-3.1-TTS в таблице слепого прослушивания.
Где один ключ помогает, а где — нет
Одно из последствий релиза 3.1 легко упустить, потому что оно выглядит как деталь промпт-инжиниринга, а не инфраструктуры. Замена 86 жёстко закодированных тегов свободными инструкциями превращает ваши указания по подаче в текстовые артефакты. Теперь вы их генерируете, версионируете и заново проверяете каждое из них на соответствие тому, как их интерпретирует новая модель, — и режим отказа здесь — дрейф, а не ошибка, потому что две формулировки «тепло, но без сентиментальности» не сработают одинаково.
Это задача текстового вывода, обёрнутая вокруг речевого пайплайна, и именно здесь мы полезны. OrcaRouter не маршрутизирует Qwen-Audio-3.1-TTS или какую-либо модель Qwen-Audio, и мы также не маршрутизируем эндпоинты Gemini 3.8 Live — ни одну из половин этого стека нельзя вызвать через нас, и ничто здесь не должно восприниматься как утверждение, что это возможно. Что мы действительно предоставляем — это слой, который пишет и проверяет текст указаний: qwen/qwen3.8-flash и google/gemini-3.8-flash среди более чем 200 моделей, доступных по одному ключу по прайс-листу провайдера без наценки, с DSL маршрутизации, который объединяет несколько моделей в один вызов и автоматическое переключение при сбое, когда вышестоящий сервис деградирует. Когда вы собираетесь повторно проверить десять тысяч промптов доставки с помощью модели, которая только что изменила то, как она их читает, создание вариантов и оценка их согласованности — это та часть, которая должна быть одним контрактом, а не четырьмя.
Что измерить перед выбором
Три эксперимента отвечают больше, чем любой совет директоров. Пропустите один эталонный голос и один абзац вашего собственного сценария через Qwen-Audio-3.1-TTS и послушайте, даёт ли управление на основе инструкций одну и ту же подачу дважды — это и есть риск миграции, и его дешевле измерить, чем планировать с оглядкой на него. Возьмите реальную запись звонка с вашим собственным фоновым шумом и пропустите через Gemini 3.8 Live, затем проверьте, сохраняется ли очерёдность реплик, когда звонящий перебивает на середине слова — именно это пытается количественно измерить индекс преобразования речи в речь, и при столкновении с реальной телефонной линией он не выдерживает достаточно надёжно, чтобы принимать его на веру. И посчитайте арифметику по своему собственному объёму в аудиочасах, а не в единицах, в которых выставляют счета оба поставщика, потому что именно в этой конкретной паре ожидаемая разница в цене между «дешёвым китайским TTS» и «флагманом Google» никогда не была такой большой, как кажется, а после 23 сентября она стала ещё меньше.

Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
