
Gemini 3.5 Transcribe Live против Gemini 3.5 Transcribe: какой эндпоинт должно вызывать ваше приложение
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Интеллект49Кодинг
Когда Google запустил семейство Gemini 3.5 Transcribe 26 августа 2026 года, он выпустил две модели с общим именем и общей миссией, но созданные для разных этапов разговора: Gemini 3.5 Transcribe Live — стриминговый эндпоинт, доступный через Live API, и Gemini 3.5 Transcribe — эндпоинт для предварительно записанных материалов, доступный через Interactions API. Ошибка, которую большинство команд совершает в первую неделю, — воспринимать это как одну модель с двумя кнопками. Это два SKU: разные API, разные цены, разные жёсткие лимиты — и сравнение точности между ними — нечестная борьба, потому что они измеряются по разным правилам. Этот материал ставит их бок о бок, чтобы решение зависело от вашей нагрузки, а не от лидерборда.
Оба вкратце
• API — Gemini 3.5 Transcribe Live работает на Live API (WebSocket, двунаправленная потоковая передача), а Gemini 3.5 Transcribe — на Interactions API (файл на входе, транскрипт на выходе).
• Работа — живые разговоры, субтитры, голосовые агенты vs встречи, журналы звонков, архивные аудиозаписи.
• Точность — 4,0% WER в потоковом режиме против 2,6% WER в непотоковом режиме, по данным Artificial Analysis, цитируемым Google; разные режимы измерения, напрямую не сравнимы.
• Задержка — итоговая расшифровка через 0.40 с после окончания речи по сравнению с пакетной обработкой полного файла.
• Сессия — максимум 10 минут на живую сессию против файлов длительностью до 60 минут (30 минут с включенной диаризацией и временными метками).
• Спикеры — отсутствуют в потоковом режиме, в отличие от предварительно записанной стороны, где поддерживается до трех спикеров с пословными временными метками.
• Цена — около $0.009 за минуту (смешанная ставка) против около $0.005 за минуту (смешанная ставка).

Архитектурное решение: Interactions API или Live API
Обе модели относятся к семейству Google Gemini Audio, и обе находятся в публичной предварительной версии. Различия начинаются с транспорта. gemini-3-5-transcribe-live открывает WebSocket и держит его открытым: необработанный аудиопоток поступает непрерывно — обычная разбивка на кадры это фрагменты 16 кГц или 24 кГц 16-битного PCM — и модель возвращает частичные транскрипты, пока вы говорите, а затем финальный транскрипт для каждого высказывания, когда речь заканчивается. gemini-3-5-transcribe принимает полный файл, обрабатывает его и возвращает готовую стенограмму с атрибуцией говорящих и временными метками на уровне слов.
Решение о транспортировке определяет всё остальное. Если ваш продукт отображает слова по мере их произнесения — живые субтитры, голосовой агент, распознающий намерение в середине фразы, ассистент звонка, действующий во время звонка, — вы на пути Live. Если ваш продукт создаёт запись — заметку встречи, журнал звонков, архив, — вы на пути Interactions. Путаница в том, что оба производят текст; разница в том, является ли текст состоянием в реальном времени или конечным артефактом.
Точность: налог на стриминг реален.
Artificial Analysis, независимая бенчмаркинговая компания, на чьи цифры Google ссылается в своем анонсе, фиксирует среднюю частоту ошибок в словах 4,0% для стримингового endpoint и 2,6% для нестримингового. На многоязычном бенчмарке FLEURS Google сообщает о 5,50% для стриминга против 5,04% для нестриминга. Показатель 2,6% ставит Gemini 3.5 Transcribe на #5 в рейтинге WER от AA на момент запуска, позади ElevenLabs Scribe v2 с 2,2% и Microsoft MAI-Transcribe-1.5 с 2,4% — это измерения AA, а не заявления Google.
Показатель потокового режима — это не ухудшенная версия того же теста. Это другой режим: модель фиксирует слова, не услышав конца предложения, и расплачивается за это. Не выбирайте между ними только по точности, потому что при любой конкретной нагрузке разрыв может измениться в другую сторону. Выбирайте по ограничениям: потоковый эндпоинт ограничен 10-минутным сеансом, в нём нет диаризации говорящих и временных меток; эндпоинт для предварительно записанных файлов обрабатывает записи длиной до часа, определяет до трех говорящих и возвращает временные метки на уровне слов. Если вашему приложению нужны метки говорящих, потоковая модель просто не справится с задачей, каким бы ни был её WER.

Что их объединяет
Оба конечных точки используют общий механизм «интеллектуальной транскрипции», и по общим функциям выбор между ними нейтрален:
• 85+ языков с автоматическим определением, включая переключение языка в середине потока на Live-пути.
• Очистка от речевых сбоев — слова-паразиты отбрасываются, самокоррекции разрешаются («вторник — нет, среда» превращается в исправленный день).
• Автоформатирование — пунктуация, регистр и структура абзацев, применяемые к выводу.
• Пользовательский словарь — до 1000 терминов для жаргона и названий продуктов, при этом документация Google рекомендует примерно 100 для наилучших результатов.
Одно предостережение, которое относится к обоим вариантам: «умная» очистка, делающая вывод читабельным, — это дизайнерское решение, которое жертвует дословной точностью. Неуклюжие формулировки сглаживаются; текст — это интерпретация намерения моделью, а не стенограмма. Для точных транскриптов вам понадобится опция дословного вывода там, где она предусмотрена, и в любом случае стоит проверить её работу на собственном аудио.
Стоимость за минуту: live premium
Google тарифицирует аудио в токенах: 25 аудио-токенов в секунду, при этом выход — примерно 175 текстовых токенов на минуту транскрипта. По прейскуранту, совокупная стоимость минуты аудио составляет около $0.005 для gemini-3-5-transcribe и около $0.009 для gemini-3-5-transcribe-live — вход по $2 против $3.50 за миллион токенов, выход по $12 против $21 за миллион токенов. У обеих моделей сегодня есть бесплатный тариф.
Премиум — это плата за путь реального времени, а не за большую точность: вы платите примерно на 80% больше за минуту на стриминговом эндпоинте, и он транскрибирует с более высоким WER. Это честная постановка вопроса. Модель для предзаписанных файлов одновременно дешевле и точнее; стриминговая модель существует потому, что некоторым продуктам нельзя ждать окончания файла.
На какой конечной точке следует строить?
• Подписи и субтитры в реальном времени — Gemini 3.5 Transcribe Live, и проверьте ограничение на отсутствие временных меток, если вам нужен синхронизированный по времени вывод.
• Голосовые агенты — Gemini 3.5 Transcribe Live для распознавания намерения в середине предложения; планируйте с учётом 10-минутного лимита для длительных сессий.
• Встречи, интервью, архив — Gemini 3.5 Transcribe с 2.6% WER, атрибуцией говорящих и пословными временными метками.
• Пост-звонковая аналитика — Gemini 3.5 Transcribe для готовой записи; Gemini 3.5 Transcribe Live — только если анализ должен выполняться во время звонка.
• Длительное непрерывное аудио — Gemini 3.5 Transcribe, потому что 60-минутный файл лучше, чем вручную склеивать десятиминутные живые сессии.

Слой над транскриптом
Ни одна из моделей не размещается на OrcaRouter — мы не маршрутизируем речь-в-текст на сегодняшний день, и вам придётся вызывать API Google напрямую для любой из конечных точек. Что делает маршрутизирующий слой в голосовом конвейере — так это находится над транскриптом: суммаризатор, экстрактор сущностей, модель пунктов действий, которая превращает поток в решение. Именно на этом уровне OrcaRouter оправдывает свою цену — один API для более чем 200 моделей по цене провайдера без наценки, автоматическое переключение между провайдерами и DSL-маршрутизация, которая объединяет несколько моделей в один вызов. Выбирайте конечную точку транскрипции по рабочей нагрузке, затем запускайте модель, которая читает транскрипт, за одним ключом.
Суть
Gemini 3.5 Transcribe Live и Gemini 3.5 Transcribe — это одно семейство, но разные продукты. Выбирайте Live, если расшифровка должна быть готова до окончания разговора и вы можете смириться с 10-минутной сессией, без меток говорящих и без временных меток. Выбирайте Transcribe, когда результат — это запись, и точность и атрибуция важнее скорости: это дешевле, точнее и гораздо менее ограничено. Единственный неправильный ответ — предполагать, что одна конечная точка делает и то, и другое.
