Gemini 3.5 Transcribe Live против Gemini 3.5 Transcribe — какой эндпоинт должно вызывать ваше приложение. Регенерированная иллюстрация.
Guides & Insights

Gemini 3.5 Transcribe Live против Gemini 3.5 Transcribe: какой эндпоинт должно вызывать ваше приложение

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Когда Go​ogle запустил семейство Ge​mini 3.5 Transcribe 26 августа 2026 года, он выпустил две модели с общим именем и общей миссией, но созданные для разных этапов разговора: Ge​mini 3.5 Transcribe Live — стриминговый эндпоинт, доступный через Live API, и Ge​mini 3.5 Transcribe — эндпоинт для предварительно записанных материалов, доступный через Interactions API. Ошибка, которую большинство команд совершает в первую неделю, — воспринимать это как одну модель с двумя кнопками. Это два SKU: разные API, разные цены, разные жёсткие лимиты — и сравнение точности между ними — нечестная борьба, потому что они измеряются по разным правилам. Этот материал ставит их бок о бок, чтобы решение зависело от вашей нагрузки, а не от лидерборда.

Оба вкратце

• API — Ge​mini 3.5 Transcribe Live работает на Live API (WebSocket, двунаправленная потоковая передача), а Ge​mini 3.5 Transcribe — на Interactions API (файл на входе, транскрипт на выходе).

• Работа — живые разговоры, субтитры, голосовые агенты vs встречи, журналы звонков, архивные аудиозаписи.

• Точность — 4,0% WER в потоковом режиме против 2,6% WER в непотоковом режиме, по данным Artificial Analysis, цитируемым Google; разные режимы измерения, напрямую не сравнимы.

• Задержка — итоговая расшифровка через 0.40 с после окончания речи по сравнению с пакетной обработкой полного файла.

• Сессия — максимум 10 минут на живую сессию против файлов длительностью до 60 минут (30 минут с включенной диаризацией и временными метками).

• Спикеры — отсутствуют в потоковом режиме, в отличие от предварительно записанной стороны, где поддерживается до трех спикеров с пословными временными метками.

• Цена — около $0.009 за минуту (смешанная ставка) против около $0.005 за минуту (смешанная ставка).

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe - the scoreboard'. Left column Gemini 3.5 Transcribe Live: API Live API streaming, WER 4.0% streaming, Final latency 0.40s after speech, Session 10-minute cap, Speaker ID not supported, Timestamps none. Right column Gemini 3.5 Transcribe: API Interactions API files, WER 2.6% non-streaming, Final latency batch async, Session 60-minute files (30 with diarization), Speaker ID up to 3 speakers, Timestamps word-level. Footer reads 'WER per Artificial Analysis, cited by Google; limits per Google launch materials.'

Архитектурное решение: Interactions API или Live API

Обе модели относятся к семейству Google Gemini Audio, и обе находятся в публичной предварительной версии. Различия начинаются с транспорта. gemini-3-5-transcribe-live открывает WebSocket и держит его открытым: необработанный аудиопоток поступает непрерывно — обычная разбивка на кадры это фрагменты 16 кГц или 24 кГц 16-битного PCM — и модель возвращает частичные транскрипты, пока вы говорите, а затем финальный транскрипт для каждого высказывания, когда речь заканчивается. gemini-3-5-transcribe принимает полный файл, обрабатывает его и возвращает готовую стенограмму с атрибуцией говорящих и временными метками на уровне слов.

Решение о транспортировке определяет всё остальное. Если ваш продукт отображает слова по мере их произнесения — живые субтитры, голосовой агент, распознающий намерение в середине фразы, ассистент звонка, действующий во время звонка, — вы на пути Live. Если ваш продукт создаёт запись — заметку встречи, журнал звонков, архив, — вы на пути Interactions. Путаница в том, что оба производят текст; разница в том, является ли текст состоянием в реальном времени или конечным артефактом.

Точность: налог на стриминг реален.

Artificial Analysis, независимая бенчмаркинговая компания, на чьи цифры Google ссылается в своем анонсе, фиксирует среднюю частоту ошибок в словах 4,0% для стримингового endpoint и 2,6% для нестримингового. На многоязычном бенчмарке FLEURS Google сообщает о 5,50% для стриминга против 5,04% для нестриминга. Показатель 2,6% ставит Gemini 3.5 Transcribe на #5 в рейтинге WER от AA на момент запуска, позади ElevenLabs Scribe v2 с 2,2% и Microsoft MAI-Transcribe-1.5 с 2,4% — это измерения AA, а не заявления Google.

Показатель потокового режима — это не ухудшенная версия того же теста. Это другой режим: модель фиксирует слова, не услышав конца предложения, и расплачивается за это. Не выбирайте между ними только по точности, потому что при любой конкретной нагрузке разрыв может измениться в другую сторону. Выбирайте по ограничениям: потоковый эндпоинт ограничен 10-минутным сеансом, в нём нет диаризации говорящих и временных меток; эндпоинт для предварительно записанных файлов обрабатывает записи длиной до часа, определяет до трех говорящих и возвращает временные метки на уровне слов. Если вашему приложению нужны метки говорящих, потоковая модель просто не справится с задачей, каким бы ни был её WER.

A screenshot of the Artificial Analysis speech-to-text leaderboard page showing the WER Index (Non-streaming) view with model rows including an entry for Gemini 3.5 Transcribe alongside ElevenLabs and Deepgram, plus AA-WER Index dataset filters, captured August 27 2026.

Что их объединяет

Оба конечных точки используют общий механизм «интеллектуальной транскрипции», и по общим функциям выбор между ними нейтрален:

• 85+ языков с автоматическим определением, включая переключение языка в середине потока на Live-пути.

• Очистка от речевых сбоев — слова-паразиты отбрасываются, самокоррекции разрешаются («вторник — нет, среда» превращается в исправленный день).

• Автоформатирование — пунктуация, регистр и структура абзацев, применяемые к выводу.

• Пользовательский словарь — до 1000 терминов для жаргона и названий продуктов, при этом документация Google рекомендует примерно 100 для наилучших результатов.

Одно предостережение, которое относится к обоим вариантам: «умная» очистка, делающая вывод читабельным, — это дизайнерское решение, которое жертвует дословной точностью. Неуклюжие формулировки сглаживаются; текст — это интерпретация намерения моделью, а не стенограмма. Для точных транскриптов вам понадобится опция дословного вывода там, где она предусмотрена, и в любом случае стоит проверить её работу на собственном аудио.

Стоимость за минуту: live premium

Google тарифицирует аудио в токенах: 25 аудио-токенов в секунду, при этом выход — примерно 175 текстовых токенов на минуту транскрипта. По прейскуранту, совокупная стоимость минуты аудио составляет около $0.005 для gemini-3-5-transcribe и около $0.009 для gemini-3-5-transcribe-live — вход по $2 против $3.50 за миллион токенов, выход по $12 против $21 за миллион токенов. У обеих моделей сегодня есть бесплатный тариф.

Премиум — это плата за путь реального времени, а не за большую точность: вы платите примерно на 80% больше за минуту на стриминговом эндпоинте, и он транскрибирует с более высоким WER. Это честная постановка вопроса. Модель для предзаписанных файлов одновременно дешевле и точнее; стриминговая модель существует потому, что некоторым продуктам нельзя ждать окончания файла.

На какой конечной точке следует строить?

• Подписи и субтитры в реальном времени — Gemini 3.5 Transcribe Live, и проверьте ограничение на отсутствие временных меток, если вам нужен синхронизированный по времени вывод.

• Голосовые агенты — Gemini 3.5 Transcribe Live для распознавания намерения в середине предложения; планируйте с учётом 10-минутного лимита для длительных сессий.

• Встречи, интервью, архив — Ge​mini 3.5 Transcribe с 2.6% WER, атрибуцией говорящих и пословными временными метками.

• Пост-звонковая аналитика — Ge​mini 3.5 Transcribe для готовой записи; Ge​mini 3.5 Transcribe Live — только если анализ должен выполняться во время звонка.

• Длительное непрерывное аудио — Ge​mini 3.5 Transcribe, потому что 60-минутный файл лучше, чем вручную склеивать десятиминутные живые сессии.

A generated decision card titled 'Which endpoint - by workload' with a left column headed 'Pick Transcribe Live if' listing live captions, voice agents reading intent mid-sentence, and in-call analytics, and a right column headed 'Pick Transcribe if' listing meetings and interviews, call logs needing speaker labels, word-level timestamps for alignment, and long continuous audio, a footer reading 'Both are Google APIs in public preview since Aug 26 2026', and the OrcaRouter logo in the bottom-right corner.

Слой над транскриптом

Ни одна из моделей не размещается на OrcaRouter — мы не маршрутизируем речь-в-текст на сегодняшний день, и вам придётся вызывать API Google напрямую для любой из конечных точек. Что делает маршрутизирующий слой в голосовом конвейере — так это находится над транскриптом: суммаризатор, экстрактор сущностей, модель пунктов действий, которая превращает поток в решение. Именно на этом уровне OrcaRouter оправдывает свою цену — один API для более чем 200 моделей по цене провайдера без наценки, автоматическое переключение между провайдерами и DSL-маршрутизация, которая объединяет несколько моделей в один вызов. Выбирайте конечную точку транскрипции по рабочей нагрузке, затем запускайте модель, которая читает транскрипт, за одним ключом.

Суть

Ge​mini 3.5 Transcribe Live и Ge​mini 3.5 Transcribe — это одно семейство, но разные продукты. Выбирайте Live, если расшифровка должна быть готова до окончания разговора и вы можете смириться с 10-минутной сессией, без меток говорящих и без временных меток. Выбирайте Transcribe, когда результат — это запись, и точность и атрибуция важнее скорости: это дешевле, точнее и гораздо менее ограничено. Единственный неправильный ответ — предполагать, что одна конечная точка делает и то, и другое.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube