
Gemini 3.8 TTS против Qwen Audio 3.0 TTS: два разных ответа на вопрос «сделать так, чтобы звучало правильно»
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Одно очко Elo разделяет эти две модели в Artificial Analysis Provider Voice Arena, и они приходят к этому, решая совершенно разные задачи. Qwen-Audio-3.0-TTS-Plusзанимает 3-е место с Elo 1 259 на 1 447 образцах и 15 голосах арены, выпущена в сентябре 2026 года, цена указана на уровне $27.60 за миллион символов. Gemini 3.8 Flash TTSнаходится на 2-м месте с 1 260 на 1 999 образцах и 8 голосах арены, выпущена 23 сентября 2026 года, цена указана на уровне $33.00 за миллион символов. Статистически неразличимы, разница в цене двадцать процентов, и построены на противоположных теориях о том, что делает синтезированную речь хорошей.
Самое интересное — это теория. Ответ Qwen — это встроенное управление: 86 тегов подачи, которые вы рассыпаете по тексту, чтобы модель знала, где дышать, где ставить ударение и где менять регистр. Ответ Google — это слой режиссуры: построчные инструкции, постановка с двумя говорящими и небольшой набор невербальных сигналов. Если вы уже построили конвейер, который выдаёт SSML-подобные аннотации, один из них подойдёт, а другой — нет, и эта совместимость важнее, чем одно очко Elo.
Где эти двое на самом деле сидят на доске
Честная интерпретация Provider Voice Arena требует смотреть на интервалы, а не на ранги.
• Qwen-Audio-3.0-TTS-Plus — 3-е место, Elo 1 259, 1 447 образцов, 15 голосов арены, сентябрь 2026 г., $27,6 за 1 млн символов.
• Gemini 3.8 Flash TTS — 2-е место, Elo 1 260, 1 999 образцов, 8 голосов арены, сентябрь 2026 г., $33,0 за 1 млн символов.
• Cartesia Sonic 3.6 — 1-е место, Elo 1 273, 1 757 сэмплов, 8 голосов в арене, август 2026 г., 49,0 $ за 1 млн символов.
Первые три места — это одна группа. Опубликованные интервалы у двух верхних простираются на семнадцать пунктов в каждую сторону, что шире, чем весь разброс между первым и третьим, поэтому порядок среди них не даёт устойчивого свидетельства. Что таблица действительно устанавливает, так это то, что все трое входят в ведущую группу и что ничто ниже них не близко — 10-е место, Gemini 3.1 Flash TTS, находится на отметке 1,199.
Единственная асимметрия, которую стоит отметить, — это количество голосов на арене. Qwen выставляет 15 голосов против 8 у Gemini, поэтому оценка Qwen — это среднее по более широкой выборке собственного продукта вендора. Это имеет двоякий эффект: с одной стороны, это более справедливая оценка того, как в целом звучит каталог Qwen, а с другой — это даёт Qwen больше возможностей выставить слабый голос, который тянет среднее вниз. Ни одна из этих трактовок не меняет вывода о том, что эти двое идут вровень.

86 тегов доставки относительно слоя направления
Это существенное различие, и оно определяет большинство интеграций.
Qwen-Audio-3.0-TTS поставляется с 86 встроенными тегами подачи — аннотациями, встроенными в текст, которые управляют тем, как произносится фрагмент. Это подход на основе разметки: ваш сценарий несёт исполнение. Это знакомо всем, кто работал с SSML, и хорошо сочетается с инструментами, которые генерируют текст программно, потому что поверхность управления — это преобразование строки, а не вызов API.
Gemini 3.8 Flash TTS выбирает другой путь. Вы управляете репликой так, как режиссировали бы игру актёра — темп, акценты, эмоциональная окраска — с помощью отдельной инструкции, а не встроенной разметки. Сцены с двумя говорящими можно поставить в рамках одного вызова. А небольшой набор невербальных сигналов вписывается прямо в сценарий: <laughs>, <sigh>, <gasp> — как встроенные сигналы, плюс |mhm| и |yeah| для звуков-поддакиваний.
Итак, обе модели принимают внутритекстовую аннотацию; разница — в размере словаря и в том, где находится остальная часть управления. У Qwen он шире и более плоский — 86 тегов, все в тексте. У Google он уже в тексте и шире вне его: направление подачи и распределение реплик говорящих задаются как параметры уровня вызова. Если вы переносите систему, которая уже выдаёт богатую встроенную разметку, у Qwen перенос короче. Если вы в любом случае строите логику режиссуры в коде приложения, разделение у Google получается чище.

Покрытие языков против покрытия диалектов
Числа покрытия не сопоставимы, и сравнивать их наивно — ошибка.
Gemini 3.8 Flash TTS охватывает 130 языков, автоматически определяемых по тексту; Flash-Lite TTS — 101. Это широта охвата языковых семей, что как раз и нужно для этапа локализации, который должен охватить длинный хвост рынков.
Qwen-Audio-3.0-TTS охватывает 16 языков плюс 20 диалектных регионов Китая. Это глубина внутри одной языковой семьи. Двадцать диалектных регионов — это не меньшее число, чем 130 языков, как может показаться на первый взгляд: это утверждение иного рода, и для продукта, обслуживающего китайскоязычных пользователей в разных регионах материкового Китая, оно полезнее. Модель со 130 языками и одним голосом на путунхуа не обслуживает пользователя в Сычуани так, как это делает модель с 20 диалектными регионами.
Что именно важно — целиком зависит от вашей аудитории. Если ваше требование — «хотя бы сносно на двадцати рынках», то Gemini. Если — «действительно правильно на китайском рынке», то Qwen.
Цена — и что скрывает цифра в расчёте на знак
• Qwen-Audio-3.0-TTS-Plus — 27,60 доллара США за 1 млн символов по нормализованной методике рейтинга; вариант Flash — около 15 долларов США за 1 млн символов при заявленной задержке до первого пакета около 300 мс.
• Gemini 3.8 Flash TTS — $33.00 за 1 млн нормализованных символов; Google выставляет счёт по $0.50 за миллион текстовых токенов на входе и $9.00 за миллион аудиотокенов на выходе до 31 декабря 2026 года, затем $1.00 и $18.00.
• Gemini 3.8 Flash-Lite TTS — $22,10 за 1 млн нормализованных символов на 6-м месте с рейтингом Elo 1 235; тарифицируется по $6,00 за миллион аудиотокенов до 31 декабря 2026 года.
Оба показателя в расчёте на символ — это нормализации Artificial Analysis, а не списочные цены поставщиков — Qwen выставляет счета через Alibaba Cloud Model Studio, а Google — в токенах, и ни один из них не публикует тариф за символ для этих моделей. Используйте их для соотношения, которое составляет примерно 1,2x в пользу Qwen, а не в качестве котировок.
Уровни различаются по структуре. Qwen делится на Plus и Flash, причём уровень Flash жертвует качеством ради заявленных ~300 мс до первого пакета. Google делится на Flash и Flash-Lite, а затем ещё на Standard, Batch и Flex, а также Priority — $4.50, $9.00 и $16.20 за миллион аудиотокенов в Flash TTS. Модель Google вознаграждает классификацию вашей рабочей нагрузки; модель Qwen — выбор уровня качества заранее.
Доступность — это ещё одно реальное отличие. Gemini 3.8 Flash TTS общедоступна в Gemini Developer API. Qwen-Audio-3.0-TTS закрыта и доступна только как хостинговое решение: она предоставляется через Alibaba Cloud Model Studio, открытых весов нет. Если вам нужно запускать модель самостоятельно, ни одна из них вам не подойдёт — но если ваша инфраструктура уже находится в Alibaba Cloud, то именно модель Qwen избавляет от необходимости продумывать вопросы исходящего трафика.
Претензии поставщиков с обеих сторон
Ни одна из моделей не имеет независимого бенчмарка помимо арены, и оба вендора опубликовали утверждения, которые следует помечать как таковые.
У Google для Gemini 3.8 Flash TTS: первое место в Hume AI Voice Design Benchmark с результатом 71,4, первое место в моделировании акцентов с результатом 60,8, первое и второе места в Hume Overall Quality Index для Flash и Flash-Lite, а также высшие места по слепым предпочтениям, заявленные для японского, бразильского португальского, вьетнамского, современного стандартного арабского, мексиканского испанского и хинди. Прогоны не опубликованы.
У Alibaba, для Qwen-Audio-3.0-TTS: система подачи с 86 тегами, 20 диалектных регионов и показатель ~300 мс до первого пакета на варианте Flash. Также не воспроизведено.
Рейтинг Эло на арене — единственный независимо собранный показатель качества в этой статье, и он говорит о том, что эти двое делят первое место в таблице.

Что добавляет Gemini, чего нет в Qwen
Создание голоса — самый очевидный пробел. Gemini 3.8 Flash TTS поддерживает дизайн голоса по описанию на естественном языке и клонирование голоса по 30-секундному образцу, с проверкой согласия и водяным знаком SynthID, а также учётными данными C2PA на выходе. Пользовательские голоса бывают двух видов: 200 голосов с сохранением состояния на проект со сроком жизни один год или голоса без сохранения состояния, адресуемые по voicekey_...идентификатору, который истекает через семь дней. Ремикшинг голоса указан как «скоро».
Управление форматом вывода — второе. WAV 24 кГц, моно, 16-битный знаковый PCM на унарном эндпоинте; PCM без заголовка (audio/l16) на потоковом эндпоинте; а также audio/mulaw и audio/alaw и настраиваемая частота дискретизации. Для задач, смежных с телефонией, поддержка mulaw устраняет этап транскодирования.
Кому позвонить?
Выбирайте Qwen-Audio-3.0-TTS, если ваши пользователи говорят по-китайски и требуется поддержка диалектов, если вам нужен богатый набор встроенной разметки, который ваш генератор может выдавать напрямую, или если вы уже используете Alibaba Cloud и хотите как можно быстрее получить работающий эндпоинт. Кроме того, при нормализованном сравнении он дешевле из двух, а вариант Flash ещё дешевле, если приемлемо получение первого пакета примерно за 300 мс.
Выбирайте Gemini 3.8 Flash TTS, если вам нужна широта охвата многих языков, а не глубина в одном, если вам нужно создать или воспроизвести конкретный голос, если вам нужен вывод в формате mulaw или alaw, или если «общедоступность, а не только размещение на хостинге» является требованием закупки.
Ни один из них не является плохим выбором, и ни один не является явно лучше — в этом и смысл разницы в один пункт Эло. Решение — это совместимость, а не качество.
Это также аргумент за то, чтобы пока не делать жёсткой ставки ни на один из вариантов. OrcaRouter даёт вам более 200 моделей за одним ключом по цене провайдера, без наценки, так что изменение тарифов от любой из лабораторий отразится в вашем счёте в тот же день, а не при продлении, и автоматическое переключение при сбое означает, что эндпоинт синтеза, который не справляется под нагрузкой, переходит на другой вместо того, чтобы отбросить запрос. Мы не размещаем Qwen-Audio-3.0-TTS — он предоставляется через Alibaba Cloud Model Studio — и мы не размещаем эндпоинты Gemini 3.8 TTS, которые идут из API Google. Что мы предоставляем, так это текстовый слой и маршрутизацию над ним, и именно это позволяет вам прогонять оба варианта на реальном трафике месяц, прежде чем выбрать.
Число, за которым стоит следить, — это следующая ревизия арены. При 1,447 выборках у Qwen и 1,999 у Gemini оба интервала всё ещё достаточно широки, чтобы голосование за один месяц могло их развести — или подтвердить, что ответом является ничья.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
