
Gemini 3.8 Live против Gemini 3.8 TTS: цикл разговора и голос для чтения носят одно название поколения
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 36 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 181 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Gemini 3.8 Live — это модель «речь-в-речь», выпущенная 15 сентября 2026 года как gemini-3.8-live и gemini-3.8-live-extended-thinking. «Gemini 3.8 TTS» — вовсе не модель: это обобщающий термин, которым материалы о запуске, включая заголовок собственного поста Google, называют пару эндпоинтов синтеза речи, появившихся 23 сентября 2026 года как gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts. Так что это не обычная страница сравнения, где два продукта борются за одну задачу. Это страница о двух задачах, которые делят один номер поколения, и о конкретной ошибке, которую люди совершают, когда принимают слова «Live» и «TTS» за два варианта одного и того же.
Форк, скрытый общим номером поколения
Документация Google по генерации речи сама проводит это разграничение, и эту фразу легко пропустить при беглом чтении: «Возможность TTS отличается от генерации речи, предоставляемой через Live API». В том же отрывке объясняется почему, и причина структурная, а не связана с качеством. Live API создан для «интерактивного, неструктурированного аудио и мультимодальных входных и выходных данных». TTS через Gemini API «ориентирован на сценарии, требующие точного воспроизведения текста с тонким контролем». В более позднем примечании явно указан формат входных данных: модели TTS принимают только текст и возвращают только аудио.
Это единственное ограничение — текст на входе, аудио на выходе, никакого аудиовхода — и есть всё сравнение. Модель Gemini 3.8 Live слышит человека, который с ней говорит. Модель Gemini 3.8 Flash TTS или Flash-Lite TTS никогда никого не слышит; она читает строку и исполняет её. Всё остальное следует отсюда: бенчмарки, которые существуют для одной, бессмысленны для другой, цены измеряются в разных единицах, а режимы отказа вообще несопоставимы.
Это важно, потому что снаружи эти два сценария использования выглядят одинаково. И голосовой агент, и конвейер озвучивания в итоге выдают речь, звучащую по-человечески. Но прервать можно только один из них.
Где "Gemini 3.8 TTS" на самом деле
Откройте таблицу поддерживаемых моделей для генерации речи Gemini API, и вы найдете четыре записи TTS и ни одной записи под названием Gemini 3.8 TTS. Две из них относятся к этому поколению: Gemini 3.8 Flash TTS, идентификатор модели gemini-3.8-flash-tts, с поддержкой 130 языков, и Gemini 3.8 Flash-Lite TTS, идентификатор модели gemini-3.8-flash-lite-tts, с поддержкой 101 языка. Две другие — Gemini 3.1 Flash TTS Preview и Gemini 2.5 Pro Preview TTS — это предварительное поколение, на смену которому приходит Flash-Lite.
Итак, когда кто-то говорит «Gemini 3.8 TTS», обычно он имеет в виду уровень Flash, потому что именно его выдвигает на первый план пост о запуске и именно его выше всего оценивает таблица Arena. Когда так говорят о голосовом агенте в реальном времени, они не указывают ни на что, потому что нужная им вещь находится на другом эндпоинте с другим названием и другим контрактом ввода.
Есть третье столкновение, которое стоит назвать, потому что оно порождает худшие советы. Gemini 3.8 Live — это не модель преобразования текста в речь с дополнительными функциями. Это модель преобразования речи в речь, и причина, по которой она стоит дороже за единицу, в том, что она выполняет больше работы за единицу: слушает, рассуждает в середине высказывания, обрабатывает перебивания и, в варианте Extended Thinking, обдумывает ответ, прежде чем ответить.
Единственное число, которое действительно выдерживает сравнение
Оценки качества не переносятся между этими двумя семействами; нет единой панели, которая оценивает рассказчика и собеседника по одной и той же оси. Деньги переносятся, как только вы честно выберете единицу измерения, и честной единицей для всего, что связано с голосом, является аудиочас.
• Тарификация на входе — Gemini 3.8 Live тарифицируется за минуту аудио: $0,005 за минуту на входе и $0,018 за минуту на выходе, тогда как Gemini 3.8 Flash TTS тарифицируется за миллион аудиотокенов: $9,00 до 31 декабря 2026 года и $18,00 после
• Тарификация на выходе — двустороннее аудио Gemini 3.8 Live по прайс-листу обходится примерно в $1,38 за час одновременного ввода и вывода, без учёта любого кэширования промптов, тогда как Gemini 3.8 Flash TTS — это односторонний поток, и один миллион символов готовой озвучки по нормализации Artificial Analysis составляет $16,5
• Текстовый ввод — Gemini 3.8 Live тарифицирует текст и аудио отдельными позициями: $0,75 за миллион текстовых токенов на входе и $4,50 на выходе, тогда как эндпоинты TTS тарифицируют текстовый ввод по $0,50 за миллион токенов
• Уровень Flash-Lite — у Gemini 3.8 Live нет более дешёвого собрата; выбор — Live или Extended Thinking, тогда как Gemini 3.8 Flash-Lite TTS указан по цене $6,00, а затем $12,00 за миллион аудиотокенов, при этом Artificial Analysis называет $11,0 за миллион символов
• Структура ввода — Gemini 3.8 Live: аудио, видео и текст на входе, аудио на выходе, тогда как эндпоинты TTS: текст на входе, аудио на выходе
Показатель Live — это наши расчёты на основе опубликованных Google поминутных тарифов, а не опубликованное Google число за час. Показатели по символам — это нормализация Artificial Analysis, и именно их следует приводить, когда вы сравниваете уровни синтеза. Обратите внимание, что собственная таблица Speech to Speech от Artificial Analysis содержит отдельный столбец стоимости за час входного аудио для моделей Live — около $3.50 для Gemini 3.8 Live и $0.84 для варианта Extended Thinking — что опять-таки является другой нормализацией и не должно сопоставляться с прайс-листом с поминутной ставкой так, будто это одно и то же измерение.

Что ломается, когда выбираешь не тот?
Режимы отказов поучительны, потому что они так непохожи друг на друга.
Вызываете эндпоинт TTS, когда вам нужен был цикл диалога, и ошибок нет. Запрос возвращает корректное аудио. Вы получаете беглый, хорошо озвученный ответ на фиксированную строку, а затем — тишина, потому что слушать там было нечему. Команды обнаруживают это, когда создают свой первый тест на перебивание (barge-in) и выясняют, что «пользователю» приходится ждать, пока завершится весь фрагмент, прежде чем начнётся следующая реплика. Дооснащение эндпоинта синтеза диалогом означает добавление распознавания речи, политики передачи хода и механизма прерывания вокруг него; в этот момент вы уже пересобрали каскад и платите за две модели вместо одной.
Вызывайте Live-эндпоинт, когда вам нужно озвучивание, и вы платите за возможности, которые не используете. Live-модель тарифицируется в обоих направлениях, потому что она ожидает оба направления. Для аудиокниги или озвучивания обучающего видео входная сторона — это сценарий, который никогда не меняется, и модели никогда не нужно ничего слышать. Вы покупаете разговорный цикл, чтобы прочитать документ вслух.
Единственный случай, когда выбор по-настоящему труден, — это каскад: распознавание, затем рассуждение, затем синтез. Эта архитектура не устарела, и для многих продакшн-систем она по-прежнему подходит, потому что позволяет независимо заменять каждый этап и выбирать для каждого отдельного поставщика. За это приходится платить задержкой и потерей просодии, которую единая сквозная модель сохраняет на границе реплики. Этот компромисс реален в обе стороны.
Где маршрут уже существует
OrcaRouter не предоставляет эндпоинты Gemini 3.8 Live или эндпоинты 3.8 TTS, и об этом стоит сказать прежде всего, когда речь идёт о маршрутизации, потому что при таком широком каталоге легко предположить обратное. А что каталог действительно содержит, так это остальную часть семейства — google/gemini-3.8-flash среди 28 моделей Google и более 200 моделей в общей сложности, доступных через один ключ по прайсовой цене провайдера без наценки.
Это особенно важно именно для каскада. Если ваша архитектура — распознавание, затем рассуждение, затем синтез, то этап рассуждения — это тот этап, на котором окупается единый ключ для многих поставщиков, потому что именно этот этап вы меняете чаще всего, и именно на нём снижение цены поставщиком должно отразиться на вашем счёте в тот же день, а не при следующем продлении договора. Это также этап, на котором автоматическое переключение при сбое оправдывает себя: в каскаде есть три места, где может произойти сбой, и среднее из них дешевле всего зарезервировать.

Краткое правило принятия решений
Если модель должна отвечать на что-то, чего у неё ещё не было в виде текста, вам нужен Gemini 3.8 Live, и вам следует закладывать бюджет исходя из поминутных тарифов Google на аудио, а также ожидать, что придётся подумать, какой из двух вариантов вам нужен. Если текст уже написан и задача — озвучить его, вам нужен Gemini 3.8 Flash TTS или Flash-Lite TTS, и вам следует рассчитывать бюджет за миллион символов и выбирать уровень по языковому охвату и по тому, оправдывает ли разрыв в качестве разрыв в цене.
А если вас просят сравнить «Gemini 3.8 Live и Gemini 3.8 TTS» так, будто это два разных продукта, первое полезное, что можно сделать, — спросить, о каком эндпоинте речь. Название в брифе не сводится к одному, и ответ меняет архитектуру, а не только счёт.

