Главная карточка заголовка для «Intelligent transcription with Gemini 3.5 Transcribe»: звуковая волна, превращающаяся в форматированный текст, глобус с пометкой «85+ языков», чипы с метками говорящих, ключевые цифры — 2.6% WER в непотоковом режиме и ~$0.005/мин в смешанном режиме — и логотип OrcaRouter в правом нижнем углу.
Engineering & Research

Интеллектуальная транскрибация с Gemini 3.5 Transcribe

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Gemini 3.​5 Transcribe вышел в публичное предварительное тестирование 26 августа 2026 года и стал первой моделью Go​ogle для распознавания речи, которая действительно продаётся как модель G​emini: вы вызываете её через G​emini API с идентификатором модели, аудио тарифицируется в токенах, а Go​ogle указывает стоимость минуты аудио на своей странице с ценами. Именно эту последнюю деталь потребительские обзоры упускают из виду. В день запуска в новостях говорили об удалении слов-паразитов и редактировании голоса в Gboard, но для разработчиков на самом деле изменилось то, что транскрибация теперь находится на том же API, что и остальная линейка G​emini, с атрибуцией говорящего и пословными временными метками в базовой модели, а не в отдельном дополнении. Этот материал читается как справочник по API, потому что именно этот пробел первая волна публикаций оставляет открытым.

Сразу две оговорки, чтобы приведённые ниже цифры не вводили в заблуждение. Go​ogle не называет Gemini 3.​5 Transcribe «самой точной моделью распознавания речи, которая у нас есть» — утверждение состоит в том, что это самая точная модель для интеллектуальных голосовых взаимодействий, а это другое утверждение, и эта разница важна, когда вы читаете показатели WER. И всё здесь описывает публичную предварительную версию: два идентификатора моделей, цены и контрольные показатели — это то, что Go​ogle предлагает сегодня, и всё это может измениться до GA.

Два пути API — и идентификаторы моделей, которые нужно запомнить.

Gemini 3.​5 Transcribe поставляется в виде двух конечных точек, и выбор правильной из них — первое архитектурное решение, которое принимает команда:

• gemini-3-5-transcribe — путь для предварительно записанных файлов через Interactions API. Отправьте файл и получите расшифровку с атрибуцией говорящих (до трех спикеров; три и более — экспериментально) и посекундными метками времени. Это основной инструмент для пакетной и асинхронной обработки.

• gemini-3-5-transcribe-live — путь реального времени через Live API. Двунаправленная потоковая передача с задержкой менее секунды, предназначенная для живых разговоров, субтитров и голосовых интерфейсов.

Разделение отражает то, как устроено остальное семейство G​emini Audio, и это важно, потому что "live" — это отдельный SKU со своей ценой. Некоторые ранние прочтения этого запуска предполагают, что одна модель делает и то и другое; но это не так.

A generated two-card infographic titled 'Gemini 3.5 Transcribe - two API paths' showing the pre-recorded Interactions API path on the left labeled gemini-3-5-transcribe with a file-in transcript-out flow and speaker attribution, and the streaming Live API path on the right labeled gemini-3-5-transcribe-live with bidirectional streaming and sub-second latency, a footer reading 'Public preview, August 2026', and the OrcaRouter logo in the bottom-right corner.

Что на самом деле означает «интеллектуальная транскрипция»

В анонсе Google это представлено как движение от фонетической точности к пониманию. Оценивать следует те функции, которые вытекают из этой постановки, а не саму постановку:

• Обработка сбоев речи — «э-э» и «а-а» опускаются, а самоисправления устраняются. «Давайте встретимся во вторник — нет, в среду» транскрибируется как исправленный день, а не как расшифровка ложного старта. Это решение принимает модель, и именно в этом смысле Go​ogle называет это интеллектуальным.

• Автоформатирование — вывод возвращается в виде оформленного текста: применены пунктуация, регистр и структура абзацев, а не сырой поток токенов.

• Идентификация нескольких говорящих — до трех говорящих, определяемых в предварительно записанном аудио с пословными временными метками; три и более говорящих — экспериментально. Эта функция реализована в базовой модели, а не в отдельном сервисе диаризации.

• Настраиваемый словарь — вы можете смещать распознавание в сторону жаргона, названий продуктов и необычных написаний, предоставляя словарь, который является механизмом для вертикальных доменов.

85+ языков — автоматическое определение, с явным выделением региональных акцентов и диалектов.

• Вызов функций — модель может делегировать такие задачи, как генерация изображений или анализ файлов, другим моделям G​emini, что превращает транскрибацию в компонент более крупного агента, а не в конечный этап.

• Захват сущностей — Go​ogle заявляет о высокой производительности на зашумлённом реальном аудио и на буквенно-цифровых сущностях, таких как почтовые индексы и идентификаторы заказов.

В пресс-репортажах также упоминалось окно контекста на 96 000 токенов (примерно час аудиозаписи совещания без разбиения) и распознавание эмоций. Оба этих пункта согласуются с представленной концепцией запуска, но в карточке модели, опубликованной Go​ogle, они не выделены в качестве основных, поэтому относитесь к ним как к сообщённым, а не подтверждённым, пока не появится спецификация GA.

A generated single-column scoreboard titled 'Gemini 3.5 Transcribe - the scoreboard' with rows Release Aug 26 2026 public preview, Languages 85+ auto-detect, WER 2.6% non-streaming / 4.0% streaming, Price ~$0.005 per minute blended, APIs transcribe plus transcribe-live, and Context ~96K tokens reported, a footer reading 'WER per Artificial Analysis, cited by Google; context window press-reported', and the OrcaRouter logo in the bottom-right corner.

Числа точности, помеченные

Показатели WER, которые приводит Google, взяты из Artificial Analysis: средняя частота ошибок в словах составляет 4,0% для потоковой и 2,6% для непотоковой транскрипции. На многоязычном бенчмарке FLEURS Google сообщает о WER 5,50% для потоковой и 5,04% для непотоковой транскрипции. Google также заявляет о сокращении времени до финальной транскрипции на 70% по сравнению со своим предшественником Chirp 3.

Честное прочтение: это независимые измерения в том смысле, что Artificial Analysis — не Go​ogle, но это измерения, отобранные Go​ogle и опубликованные внутри собственного анонса Go​ogle, для модели, которая доступна для вызова всего день. Никто за пределами Go​ogle ещё не проводил состязательного сравнения один на один с open-weight моделями, с которыми большинство команд её и сравнивает, а в материалах запуска нет прямого сравнения с семейством Whisper или линейкой Parakeet от NVIDIA. Показатель «на 70% быстрее Chirp-3» — это заявление вендора, и точка. Относитесь к 2,6% и 4,0% как к сильным ранним сигналам, а не как к установленным фактам.

Сколько это стоит

На странице цен Google указаны тарифы для каждой модели в токенах и в расчетных минутах аудио. Для gemini-3-5-transcribe смешанная оценка составляет примерно $0.005 за минуту аудио по прейскурантным ценам — ввод около $0.003/мин, вывод около $0.002/мин. Для gemini-3-5-transcribe-live смешанная оценка составляет около $0.009 за минуту. Обе модели сейчас имеют бесплатный тариф.

Эти поминутные цифры — оценки, выведенные из предполагаемой скорости токенизации (25 аудиотокенов в секунду на входе, 175 текстовых токенов в минуту на выходе), поэтому они меняются, если Go​ogle изменит учёт токенов. Неизменным остаётся принцип: цена из прайс-листа и есть цена. Именно на этом принципе работает такой сквозной роутер, как OrcaRouter, — 0% наценки, цена провайдера передаётся как есть, — поэтому если Go​ogle снизит цены на транскрибацию в окне между превью и GA, снижение вступит в силу на нашей стороне в тот же день, а не после того, как реселлер обновит тарифную карту.

Где это внедряется

Для разработчиков публичная предварительная версия сегодня означает два направления: API Gemini в Google AI Studio и платформу Gemini Enterprise Agent Platform для корпоративных нагрузок. На стороне потребителей Gemini 3.5 Transcribe уже обеспечивает функцию диктовки Rambler в Gboard на Android и в приложении Gemini на macOS. Далее — Chrome: голосовой ввод в любом веб-поле, а затем Search Live, Gemini Live, Docs, Keep и Gmail. Для команды, которая это оценивает, практический ответ проще: его можно вызывать из кода уже сегодня, на английском языке, в регионах, где доступен API Gemini.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

Что это значит для вашего пайплайна

Действительно новое — это не число WER. Дело в том, что Go​ogle теперь продаёт транскрипцию с двумя функциями, которые команды раньше собирали сами — метки говорящих и временные метки на уровне слов — в базовой модели, на API G​emini, поддерживающем вызовы функций. Если вы строили конвейер для создания протоколов совещаний с диаризацией из простого транскрайбера, отдельного диаризатора и этапа форматирования, то это первая модель Go​ogle, которая объединяет эти шаги. Открытым остаётся вопрос, как нестриминговый WER в 2,6% поведёт себя на вашем собственном аудио, и пока не появится независимое воспроизведение, ответственным шагом для продакшн-команды будет прогнать реальный сэмпл через API, а не планировать на основе выбранных Go​ogle бенчмарков. Что касается работы LLM поверх транскрипта — суммаризация, структурированное извлечение, пункты действий — то именно здесь маршрутизация оправдывает себя, и именно этот слой покрывает OrcaRouter: один API для более чем 200 моделей, автоматическое резервирование между провайдерами и DSL для маршрутизации, который объединяет несколько моделей в один вызов. Сам шаг транскрипции вам стоит протестировать на своём собственном аудио, прежде чем доверять чьим-либо заявленным показателям.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube