Сгенерированная hero-карточка для «Gemini 3.8 Live vs Gemini 3.8 TTS» на белом фоне с мягкими сине-голубыми градиентными акцентами. В левой колонке с заголовком «Доступна в Live API» перечислены «gemini-3.8-live», «слышит и говорит», «аудио на входе, аудио на выходе»; в правой колонке с заголовком «Доступна на TTS-эндпоинтах» перечислены «gemini-3.8-flash-tts», «читает письменный текст», «текст на входе, аудио на выходе». В нижней строке написано: «Ни один из них не называется Gemini 3.8 TTS.» Логотип OrcaRouter встроен в правом нижнем углу.
Guides & Insights

Gemini 3.8 Live против Gemini 3.8 TTS: цикл разговора и голос для чтения носят одно название поколения

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Gemini 3.8 Live — это модель «речь-в-речь», выпущенная 15 сентября 2026 года как gemini-3.8-live и gemini-3.8-live-extended-thinking. «Gemini 3.8 TTS» — вовсе не модель: это обобщающий термин, которым материалы о запуске, включая заголовок собственного поста Google, называют пару эндпоинтов синтеза речи, появившихся 23 сентября 2026 года как gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts. Так что это не обычная страница сравнения, где два продукта борются за одну задачу. Это страница о двух задачах, которые делят один номер поколения, и о конкретной ошибке, которую люди совершают, когда принимают слова «Live» и «TTS» за два варианта одного и того же.

Форк, скрытый общим номером поколения

Документация Goog​le по генерации речи сама проводит это разграничение, и эту фразу легко пропустить при беглом чтении: «Возможность TTS отличается от генерации речи, предоставляемой через Live API». В том же отрывке объясняется почему, и причина структурная, а не связана с качеством. Live API создан для «интерактивного, неструктурированного аудио и мультимодальных входных и выходных данных». TTS через Gemini API «ориентирован на сценарии, требующие точного воспроизведения текста с тонким контролем». В более позднем примечании явно указан формат входных данных: модели TTS принимают только текст и возвращают только аудио.

Это единственное ограничение — текст на входе, аудио на выходе, никакого аудиовхода — и есть всё сравнение. Модель Gemini 3.8 Live слышит человека, который с ней говорит. Модель Gemini 3.8 Flash TTS или Flash-Lite TTS никогда никого не слышит; она читает строку и исполняет её. Всё остальное следует отсюда: бенчмарки, которые существуют для одной, бессмысленны для другой, цены измеряются в разных единицах, а режимы отказа вообще несопоставимы.

Это важно, потому что снаружи эти два сценария использования выглядят одинаково. И голосовой агент, и конвейер озвучивания в итоге выдают речь, звучащую по-человечески. Но прервать можно только один из них.

Где "Gemini 3.8 TTS" на самом деле

Откройте таблицу поддерживаемых моделей для генерации речи Gemini API, и вы найдете четыре записи TTS и ни одной записи под названием Gemini 3.8 TTS. Две из них относятся к этому поколению: Gemini 3.8 Flash TTS, идентификатор модели gemini-3.8-flash-tts, с поддержкой 130 языков, и Gemini 3.8 Flash-Lite TTS, идентификатор модели gemini-3.8-flash-lite-tts, с поддержкой 101 языка. Две другие — Gemini 3.1 Flash TTS Preview и Gemini 2.5 Pro Preview TTS — это предварительное поколение, на смену которому приходит Flash-Lite.

Итак, когда кто-то говорит «Gemini 3.8 TTS», обычно он имеет в виду уровень Flash, потому что именно его выдвигает на первый план пост о запуске и именно его выше всего оценивает таблица Arena. Когда так говорят о голосовом агенте в реальном времени, они не указывают ни на что, потому что нужная им вещь находится на другом эндпоинте с другим названием и другим контрактом ввода.

Есть третье столкновение, которое стоит назвать, потому что оно порождает худшие советы. Gemini 3.8 Live — это не модель преобразования текста в речь с дополнительными функциями. Это модель преобразования речи в речь, и причина, по которой она стоит дороже за единицу, в том, что она выполняет больше работы за единицу: слушает, рассуждает в середине высказывания, обрабатывает перебивания и, в варианте Extended Thinking, обдумывает ответ, прежде чем ответить.

Единственное число, которое действительно выдерживает сравнение

Оценки качества не переносятся между этими двумя семействами; нет единой панели, которая оценивает рассказчика и собеседника по одной и той же оси. Деньги переносятся, как только вы честно выберете единицу измерения, и честной единицей для всего, что связано с голосом, является аудиочас.

• Тарификация на входе — Gemini 3.8 Live тарифицируется за минуту аудио: $0,005 за минуту на входе и $0,018 за минуту на выходе, тогда как Gemini 3.8 Flash TTS тарифицируется за миллион аудиотокенов: $9,00 до 31 декабря 2026 года и $18,00 после
• Тарификация на выходе — двустороннее аудио Gemini 3.8 Live по прайс-листу обходится примерно в $1,38 за час одновременного ввода и вывода, без учёта любого кэширования промптов, тогда как Gemini 3.8 Flash TTS — это односторонний поток, и один миллион символов готовой озвучки по нормализации Artificial Analysis составляет $16,5
• Текстовый ввод — Gemini 3.8 Live тарифицирует текст и аудио отдельными позициями: $0,75 за миллион текстовых токенов на входе и $4,50 на выходе, тогда как эндпоинты TTS тарифицируют текстовый ввод по $0,50 за миллион токенов
• Уровень Flash-Lite — у Gemini 3.8 Live нет более дешёвого собрата; выбор — Live или Extended Thinking, тогда как Gemini 3.8 Flash-Lite TTS указан по цене $6,00, а затем $12,00 за миллион аудиотокенов, при этом Artificial Analysis называет $11,0 за миллион символов
• Структура ввода — Gemini 3.8 Live: аудио, видео и текст на входе, аудио на выходе, тогда как эндпоинты TTS: текст на входе, аудио на выходе

Показатель Live — это наши расчёты на основе опубликованных Google поминутных тарифов, а не опубликованное Google число за час. Показатели по символам — это нормализация Artificial Analysis, и именно их следует приводить, когда вы сравниваете уровни синтеза. Обратите внимание, что собственная таблица Speech to Speech от Artificial Analysis содержит отдельный столбец стоимости за час входного аудио для моделей Live — около $3.50 для Gemini 3.8 Live и $0.84 для варианта Extended Thinking — что опять-таки является другой нормализацией и не должно сопоставляться с прайс-листом с поминутной ставкой так, будто это одно и то же измерение.

A screenshot of Google's Gemini API pricing documentation in English, captured 25 September 2026, showing the speech-generation model index — a limited-access group listing Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking and Gemini 3.1 Flash Live Preview, alongside Gemini 3.8 Flash TTS, Gemini 3.8 Flash-Lite TTS and Gemini 3.1 Flash TTS Preview — above the Gemini 3.8 Flash per-million-token rates: $0.75 input through 31 December 2026 rising to $1.50, $3.75 output including thinking rising to $7.50, $0.075 context caching rising to $0.15, and storage at $0.50 rising to $1.00 per million tokens per hour, with search requests and prompts billed at $14 per 1,000 beyond the monthly free allowance. The page carries no rate-card line for a model named Gemini 3.8 TTS.

Что ломается, когда выбираешь не тот?

Режимы отказов поучительны, потому что они так непохожи друг на друга.

Вызываете эндпоинт TTS, когда вам нужен был цикл диалога, и ошибок нет. Запрос возвращает корректное аудио. Вы получаете беглый, хорошо озвученный ответ на фиксированную строку, а затем — тишина, потому что слушать там было нечему. Команды обнаруживают это, когда создают свой первый тест на перебивание (barge-in) и выясняют, что «пользователю» приходится ждать, пока завершится весь фрагмент, прежде чем начнётся следующая реплика. Дооснащение эндпоинта синтеза диалогом означает добавление распознавания речи, политики передачи хода и механизма прерывания вокруг него; в этот момент вы уже пересобрали каскад и платите за две модели вместо одной.

Вызывайте Live-эндпоинт, когда вам нужно озвучивание, и вы платите за возможности, которые не используете. Live-модель тарифицируется в обоих направлениях, потому что она ожидает оба направления. Для аудиокниги или озвучивания обучающего видео входная сторона — это сценарий, который никогда не меняется, и модели никогда не нужно ничего слышать. Вы покупаете разговорный цикл, чтобы прочитать документ вслух.

Единственный случай, когда выбор по-настоящему труден, — это каскад: распознавание, затем рассуждение, затем синтез. Эта архитектура не устарела, и для многих продакшн-систем она по-прежнему подходит, потому что позволяет независимо заменять каждый этап и выбирать для каждого отдельного поставщика. За это приходится платить задержкой и потерей просодии, которую единая сквозная модель сохраняет на границе реплики. Этот компромисс реален в обе стороны.

Где маршрут уже существует

OrcaRouter не предоставляет эндпоинты Gemini 3.8 Live или эндпоинты 3.8 TTS, и об этом стоит сказать прежде всего, когда речь идёт о маршрутизации, потому что при таком широком каталоге легко предположить обратное. А что каталог действительно содержит, так это остальную часть семейства — google/gemini-3.8-flash среди 28 моделей Goog​le и более 200 моделей в общей сложности, доступных через один ключ по прайсовой цене провайдера без наценки.

Это особенно важно именно для каскада. Если ваша архитектура — распознавание, затем рассуждение, затем синтез, то этап рассуждения — это тот этап, на котором окупается единый ключ для многих поставщиков, потому что именно этот этап вы меняете чаще всего, и именно на нём снижение цены поставщиком должно отразиться на вашем счёте в тот же день, а не при следующем продлении договора. Это также этап, на котором автоматическое переключение при сбое оправдывает себя: в каскаде есть три места, где может произойти сбой, и среднее из них дешевле всего зарезервировать.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples and priced at $16.5 per million characters, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0 per million characters. The board lists no model named Gemini 3.8 TTS.

Краткое правило принятия решений

Если модель должна отвечать на что-то, чего у неё ещё не было в виде текста, вам нужен Gemini 3.8 Live, и вам следует закладывать бюджет исходя из поминутных тарифов Goog​le на аудио, а также ожидать, что придётся подумать, какой из двух вариантов вам нужен. Если текст уже написан и задача — озвучить его, вам нужен Gemini 3.8 Flash TTS или Flash-Lite TTS, и вам следует рассчитывать бюджет за миллион символов и выбирать уровень по языковому охвату и по тому, оправдывает ли разрыв в качестве разрыв в цене.

А если вас просят сравнить «Gemini 3.8 Live и Gemini 3.8 TTS» так, будто это два разных продукта, первое полезное, что можно сделать, — спросить, о каком эндпоинте речь. Название в брифе не сводится к одному, и ответ меняет архитектуру, а не только счёт.

A generated summary card for Gemini 3.8 Live vs Gemini 3.8 TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — gemini-3.8-live on the Live API, shipped 15 September 2026', 'Gemini 3.8 TTS — not a model ID; resolves to gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts', 'Input contract: Live hears audio and video; TTS reads text only', 'The one shared unit: the hour of finished audio, not the benchmark', and 'Verdict: two jobs, one generation number — ask which endpoint'. A footer line reads 'Prices and language counts are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.
© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube