Сгенерированная главная карточка для «Gemini 3.8 TTS vs ElevenLabs» на белом фоне с мягкими сине-голубыми градиентными акцентами. Левая карточка «ElevenLabs Eleven v3» содержит: $100 за 1 млн символов, 70+ языков, Elo 1,167 и ранг 17; правая карточка «Gemini 3.8 Flash TTS» содержит: $33 за 1 млн символов, 130 языков, Elo 1,260 и ранг 2. В нижней строке указано: «Elo по данным Artificial Analysis Provider Voice Arena, сентябрь 2026 г.» Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Gemini 3.8 TTS против ElevenLabs: что вы получаете за тройную цену

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

При одинаковом объёме флагманская модель синтеза ElevenLabs стоит примерно втрое дороже, чем новая модель того же производителя. ElevenLabs Eleven v3 взимает $0.10 за тысячу символов — $100 за миллион — а Gemini 3.8 Flash TTS взимает $9.00 за миллион аудиотокенов, что Artificial Analysis нормализует до $33.00 за миллион символов. Это разрыв в 3,0 раза по тарифам, и это самый важный факт в этом сравнении. Интересный вопрос не в том, реален ли этот разрыв; а в том, что на самом деле покупают за дополнительные шестьдесят семь долларов на миллион символов, потому что ответ — не «более качественная речь».

A generated two-column scoreboard for ElevenLabs Eleven v3 and Gemini 3.8 Flash TTS — Eleven v3 at Arena Elo 1,167, $100.00 per 1M characters, 70-plus languages, a 280 ms latency claim and 4,345 samples; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 130 languages, no latency claim and 1,999 samples — over the footer 'Elo per Artificial Analysis; latency vendor-reported.'

Три метра, а не один

Первое, что нужно уяснить: эти два продукта измеряют не одно и то же, и опубликованные тарифные карты это скрывают.

• ElevenLabs тарифицирует по символам. Eleven v3 стоит $0.10 за 1 000 символов, с ограничением в 5 000 символов на запрос. Eleven v3 Conversational стоит $0.05 за 1 000, а модели Flash и Turbo также стоят $0.05 за 1 000, но с лимитом запроса в 40 000 символов и заявленной задержкой ~75 мс против ~280 мс у v3 Conversational.

Google выставляет счёт по токенам, и аудиотокены — это не текстовые токены. Gemini 3.8 Flash TTS взимает $0.50 за миллион входных текстовых токенов и $9.00 за миллион выходных аудиотокенов, с тарификацией 25 аудиотокенов на секунду сгенерированной речи. Опубликованного ограничения на количество символов на один запрос нет.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

• Artificial Analysis не выставляет счёт ни за один из них; она нормализует. Стоимости $100.00 и $33.00 за миллион символов в её таблице лидеров Provider Voice Arena — это производный общий знаменатель, чтобы таблица вообще могла ранжировать по цене. Полезно для соотношения, а не для котировки.

Итак, честная версия показателя 3,0x такова: при единственном доступном сопоставимом сравнении цена Google составляет примерно треть. Что это означает для вашей собственной таблицы, зависит от того, преобладают ли в вашей нагрузке короткие строки или длинные, — счётчик аудио по секундам и счётчик текста по символам резко расходятся по мере удлинения высказываний, потому что тишина, паузы и просодические добавки расходуют аудиотокены и не расходуют символы.

Отработанный месяц

Возьмите миллион символов текста — примерно столько же, сколько в романе среднего размера, — и один раз преобразуйте их в речь.

• ElevenLabs Eleven v3 — $100.00 за синтез, плюс любой тарифный план, необходимый для работы с вашей нагрузкой. В опубликованных планах Starter стоит $6, Creator — $22, Pro — $99, Scale — $299, Business — $990, и лимиты символов включены в них, а не оплачиваются отдельно.

• Gemini 3.8 Flash TTS — эквивалент $33,00 или примерно $16,50, если задание можно выполнять пакетно, поскольку уровень Batch and Flex снижает тариф на аудио вдвое — до $4,50 за миллион токенов. Приоритетное обслуживание повышает ставку до $16,20 за миллион, или около $59,40 эквивалента, что всё ещё значительно ниже, чем у ElevenLabs.

• Gemini 3.8 Flash-Lite TTS — 6,00 $ за миллион аудиотокенов, что эквивалентно примерно 22,10 $ при той же нормализации, ценой 101 языка вместо 130.

Прогоните тот же миллион символов через акционное ценообразование Google — и разрыв станет ещё больше, потому что обе новые модели Gemini TTS идут по половинной ставке до 31 декабря 2026 года, а затем их цена удваивается. Любой, кто строит бизнес-кейс на сентябрьских цифрах, строит его на скидке, у которой есть опубликованная дата истечения.

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v3 card at $0.10 per 1K characters with a 5,000-character limit, v3 Conversational at $0.05 with a 280 ms latency claim, v2 Multilingual at $0.10 with 29 languages, and Flash/Turbo at $0.05 with a 40,000-character limit.

Единственное место, где сравнение меняется на противоположное, — это очень короткие высказывания. Счётчик за символы почти ничего не берёт за подтверждение из трёх слов; счётчик за секунды аудио берёт за секунду, которую занимает произнесение подтверждения, включая тишину вокруг него. Если ваш продукт — голосовой интерфейс, состоящий из ответов в одно предложение, арифметика смещается в сторону ElevenLabs. Если это озвучивание, аудиокниги, длинноформатная локализация или что-либо, где текст длинный, а аудио ещё длиннее, она сильно смещается в сторону Google.

Вопрос качества, честно говоря

На Artificial Analysis Provider Voice Arena — слепых парных голосованиях по собственным нативным голосам каждого провайдера — две модели не близки, и Google впереди.

• Gemini 3.8 Flash TTS — 2-е место, Elo 1 260, интервал в 17 пунктов, 1 999 образцов, 8 голосов арены, выпущено в сентябре 2026 года.

• ElevenLabs Eleven v3 — 17-е место, Elo 1,167, интервал в 11 пунктов, 4 345 образцов, 8 голосов арены, в таблице указан как февраль 2026.

Их разделяют девяносто три очка Эло, и, в отличие от разрыва между тремя лидерами в той таблице, этот разрыв реален: интервал Eleven v3 — от 1 156 до 1 178, а у Gemini — от 1 243 до 1 277, без пересечения. Размер выборки у Eleven v3 более чем вдвое превышает размер выборки у Gemini, так что и эта оценка не страдает от нехватки данных.

Это по-настоящему неудобный результат для аргумента о цене, и он противоречит очевидному выводу. ElevenLabs берёт втрое больше и занимает на семнадцать позиций ниже в слепом предпочтении. Что бы ни покупали дополнительные шестьдесят семь долларов, это не лучше звучащий голос в очном сравнении.

Что на самом деле продаёт ElevenLabs

ElevenLabs в первую очередь продаёт не эндпоинт синтеза, и большинство сравнений ошибаются именно потому, что оценивают его так, будто это так. Что покупают за эти деньги:

• Библиотека голосов. Общая библиотека голосов ElevenLabs насчитывает сотни голосов и является полноценной частью продукта — люди часто приходят в ElevenLabs за конкретным голосом, который где-то услышали, а не за моделью, стоящей за ним. Gemini 3.8 Flash TTS поставляется с 30 предустановленными студийными голосами, путём голосового дизайна, который создаёт голос по описанию на естественном языке, и путём репликации, который клонирует голос по 30-секундному образцу с проверкой согласия, водяным знаком SynthID и прикреплёнными учётными данными C2PA. Каталог по умолчанию меньше; возможность создать конкретный голос сопоставима.

• Уровни задержки как отдельные продукты. Flash и Turbo при ~75 мс и лимите в 40 000 символов — это другой продукт по сравнению с v3 при ~280 мс и 5 000 символов, и оба дешевле v3. Если вашему приложению нужна задержка менее 100 мс, ElevenLabs предлагает это явно, а материалы Google о запуске не содержат сопоставимого заявления о задержке ни для одной из новых моделей TTS.

• Экосистема. Дубляж, голосовые агенты, разговорные эндпоинты, структура тарифных планов с привязанной конкурентностью — та же причина, по которой Cartesia продаёт телефонию: это стек, а не модель.

Если вы покупаете стек, 3.0x — это цена отказа от его самостоятельной сборки. Если вы покупаете вызов синтеза, вы платите 3.0x за библиотеку голосов и уровень задержки.

Что Google на самом деле продаёт

Контрдовод более узок и сильнее, чем «дешевле».

• Языковое покрытие — 130 языков в Flash TTS и 101 в Flash-Lite TTS с автоопределением по тексту, в сравнении с более чем 70 языками, указанными в документации ElevenLabs для Eleven v3. Для этапа локализации это различие — не сравнение функций, а пробел в покрытии.

• Direction — построчное управление подачей, разыгрывание сцены с двумя говорящими в рамках одного вызова и невербальные сигналы, записанные в сценарий как <laughs>, <sigh>, <gasp>, |mhm| и |yeah|. Google утверждает, что поколение 3.8 улучшило согласованность в длинных фрагментах и управление двумя говорящими по сравнению с Gemini 3.1 Flash TTS — именно для этого эти функции и предназначены. Заявление вендора, не воспроизведено.

• Модель состояний голоса — 200 пользовательских голосов с сохранением состояния на проект со сроком жизни один год, или голоса без сохранения состояния, адресуемые с помощью идентификатора voicekey_..., срок действия которого истекает через семь дней. Это инфраструктурное решение, которое можно учесть при планировании.

• Управление выводом — WAV 24 кГц, моно, 16-битный знаковый PCM на унарной конечной точке; PCM без заголовка (audio/l16) на потоковой конечной точке; а также audio/mulaw и audio/alaw с настраиваемой частотой дискретизации.

Стартовые бенчмарки Google сообщены самим вендором, и воспринимать их следует именно так: первое место в Hume AI Voice Design Benchmark с 71,4 и первое место в моделировании акцентов с 60,8, первое и второе места в Hume Overall Quality Index для Flash и Flash-Lite соответственно, а также высшие позиции в слепом предпочтении, заявленные для японского, бразильского варианта португальского, вьетнамского, современного стандартного арабского, мексиканского варианта испанского и хинди. Ни один из этих прогонов не опубликован. Приведённый выше Elo арены — единственное независимо собранное число в этой статье, и оно, по совпадению, согласуется с направлением заявлений вендора.

Переключательное исчисление

Переключайтесь, если ваша нагрузка связана с длинными форматами, многоязычностью или большими объёмами, настолько, что 3.0x появляется отдельной статьёй расходов, и если вы готовы смириться с уменьшенным каталогом голосов по умолчанию и отсутствием опубликованного тарифа с задержкой менее 100 мс. Это охватывает озвучивание, дубляж, доступность и большинство встроенных в продукты голосовых функций.

Оставайтесь, если вы покупаете весь стек — библиотеку голосов, тарифы с разной задержкой, продукты для дубляжа и агентов — или если ваша нагрузка состоит в основном из очень коротких фраз, где посекундная тарификация аудио работает против вас. Также оставайтесь, если вы уже дообучили голосовую идентичность на ElevenLabs, которую узнают ваши пользователи, потому что непрерывность голоса — это функция продукта, а воссоздание её на новой модели — это целый проект.

В любом случае разумный шаг — месяц прогнать оба варианта на реальном трафике, прежде чем на что-то решаться, и это как раз аргумент за то, чтобы не подключать ни один из них напрямую в вашу кодовую базу. OrcaRouter даёт более 200 моделей за одним ключом по прайсовой цене провайдера, без наценки, так что изменение цены от любой из лабораторий отразится в вашем счёте в тот же день, а не при продлении, и автоматическое переключение при сбое сохраняет рабочим продакшн-путь синтеза речи, когда новый эндпоинт начинает вести себя некорректно. Мы не размещаем у себя ElevenLabs — его слои синтеза и агентов — это его собственный продукт — и мы не размещаем эндпоинты Gemini 3.8 TTS, которые приходят из API Google. Мы предоставляем текстовый слой под всем этим и маршрутизацию над ним.

Число, за которым стоит следить, — это Elo Eleven v3 в следующей ревизии таблицы лидеров. Девяносто три пункта — большой дефицит для модели, которая стоит в три раза дороже, и если интервал сузится, а разрыв не сократится, аргумент о цене перестанет быть компромиссом и станет приговором.