
Интеллектуальная транскрибация с Gemini 3.5 Transcribe
- 智谱НОВИНКАZ.ai: GLM 5.3 Flash2026-08-26$0.07 / $0.25 за 1 млн токенов
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
Gemini 3.5 Transcribe вышел в публичное предварительное тестирование 26 августа 2026 года и стал первой моделью Google для распознавания речи, которая действительно продаётся как модель Gemini: вы вызываете её через Gemini API с идентификатором модели, аудио тарифицируется в токенах, а Google указывает стоимость минуты аудио на своей странице с ценами. Именно эту последнюю деталь потребительские обзоры упускают из виду. В день запуска в новостях говорили об удалении слов-паразитов и редактировании голоса в Gboard, но для разработчиков на самом деле изменилось то, что транскрибация теперь находится на том же API, что и остальная линейка Gemini, с атрибуцией говорящего и пословными временными метками в базовой модели, а не в отдельном дополнении. Этот материал читается как справочник по API, потому что именно этот пробел первая волна публикаций оставляет открытым.
Сразу две оговорки, чтобы приведённые ниже цифры не вводили в заблуждение. Google не называет Gemini 3.5 Transcribe «самой точной моделью распознавания речи, которая у нас есть» — утверждение состоит в том, что это самая точная модель для интеллектуальных голосовых взаимодействий, а это другое утверждение, и эта разница важна, когда вы читаете показатели WER. И всё здесь описывает публичную предварительную версию: два идентификатора моделей, цены и контрольные показатели — это то, что Google предлагает сегодня, и всё это может измениться до GA.
Два пути API — и идентификаторы моделей, которые нужно запомнить.
Gemini 3.5 Transcribe поставляется в виде двух конечных точек, и выбор правильной из них — первое архитектурное решение, которое принимает команда:
• gemini-3-5-transcribe — путь для предварительно записанных файлов через Interactions API. Отправьте файл и получите расшифровку с атрибуцией говорящих (до трех спикеров; три и более — экспериментально) и посекундными метками времени. Это основной инструмент для пакетной и асинхронной обработки.
• gemini-3-5-transcribe-live — путь реального времени через Live API. Двунаправленная потоковая передача с задержкой менее секунды, предназначенная для живых разговоров, субтитров и голосовых интерфейсов.
Разделение отражает то, как устроено остальное семейство Gemini Audio, и это важно, потому что "live" — это отдельный SKU со своей ценой. Некоторые ранние прочтения этого запуска предполагают, что одна модель делает и то и другое; но это не так.

Что на самом деле означает «интеллектуальная транскрипция»
В анонсе Google это представлено как движение от фонетической точности к пониманию. Оценивать следует те функции, которые вытекают из этой постановки, а не саму постановку:
• Обработка сбоев речи — «э-э» и «а-а» опускаются, а самоисправления устраняются. «Давайте встретимся во вторник — нет, в среду» транскрибируется как исправленный день, а не как расшифровка ложного старта. Это решение принимает модель, и именно в этом смысле Google называет это интеллектуальным.
• Автоформатирование — вывод возвращается в виде оформленного текста: применены пунктуация, регистр и структура абзацев, а не сырой поток токенов.
• Идентификация нескольких говорящих — до трех говорящих, определяемых в предварительно записанном аудио с пословными временными метками; три и более говорящих — экспериментально. Эта функция реализована в базовой модели, а не в отдельном сервисе диаризации.
• Настраиваемый словарь — вы можете смещать распознавание в сторону жаргона, названий продуктов и необычных написаний, предоставляя словарь, который является механизмом для вертикальных доменов.
85+ языков — автоматическое определение, с явным выделением региональных акцентов и диалектов.
• Вызов функций — модель может делегировать такие задачи, как генерация изображений или анализ файлов, другим моделям Gemini, что превращает транскрибацию в компонент более крупного агента, а не в конечный этап.
• Захват сущностей — Google заявляет о высокой производительности на зашумлённом реальном аудио и на буквенно-цифровых сущностях, таких как почтовые индексы и идентификаторы заказов.
В пресс-репортажах также упоминалось окно контекста на 96 000 токенов (примерно час аудиозаписи совещания без разбиения) и распознавание эмоций. Оба этих пункта согласуются с представленной концепцией запуска, но в карточке модели, опубликованной Google, они не выделены в качестве основных, поэтому относитесь к ним как к сообщённым, а не подтверждённым, пока не появится спецификация GA.

Числа точности, помеченные
Показатели WER, которые приводит Google, взяты из Artificial Analysis: средняя частота ошибок в словах составляет 4,0% для потоковой и 2,6% для непотоковой транскрипции. На многоязычном бенчмарке FLEURS Google сообщает о WER 5,50% для потоковой и 5,04% для непотоковой транскрипции. Google также заявляет о сокращении времени до финальной транскрипции на 70% по сравнению со своим предшественником Chirp 3.
Честное прочтение: это независимые измерения в том смысле, что Artificial Analysis — не Google, но это измерения, отобранные Google и опубликованные внутри собственного анонса Google, для модели, которая доступна для вызова всего день. Никто за пределами Google ещё не проводил состязательного сравнения один на один с open-weight моделями, с которыми большинство команд её и сравнивает, а в материалах запуска нет прямого сравнения с семейством Whisper или линейкой Parakeet от NVIDIA. Показатель «на 70% быстрее Chirp-3» — это заявление вендора, и точка. Относитесь к 2,6% и 4,0% как к сильным ранним сигналам, а не как к установленным фактам.
Сколько это стоит
На странице цен Google указаны тарифы для каждой модели в токенах и в расчетных минутах аудио. Для gemini-3-5-transcribe смешанная оценка составляет примерно $0.005 за минуту аудио по прейскурантным ценам — ввод около $0.003/мин, вывод около $0.002/мин. Для gemini-3-5-transcribe-live смешанная оценка составляет около $0.009 за минуту. Обе модели сейчас имеют бесплатный тариф.
Эти поминутные цифры — оценки, выведенные из предполагаемой скорости токенизации (25 аудиотокенов в секунду на входе, 175 текстовых токенов в минуту на выходе), поэтому они меняются, если Google изменит учёт токенов. Неизменным остаётся принцип: цена из прайс-листа и есть цена. Именно на этом принципе работает такой сквозной роутер, как OrcaRouter, — 0% наценки, цена провайдера передаётся как есть, — поэтому если Google снизит цены на транскрибацию в окне между превью и GA, снижение вступит в силу на нашей стороне в тот же день, а не после того, как реселлер обновит тарифную карту.
Где это внедряется
Для разработчиков публичная предварительная версия сегодня означает два направления: API Gemini в Google AI Studio и платформу Gemini Enterprise Agent Platform для корпоративных нагрузок. На стороне потребителей Gemini 3.5 Transcribe уже обеспечивает функцию диктовки Rambler в Gboard на Android и в приложении Gemini на macOS. Далее — Chrome: голосовой ввод в любом веб-поле, а затем Search Live, Gemini Live, Docs, Keep и Gmail. Для команды, которая это оценивает, практический ответ проще: его можно вызывать из кода уже сегодня, на английском языке, в регионах, где доступен API Gemini.

Что это значит для вашего пайплайна
Действительно новое — это не число WER. Дело в том, что Google теперь продаёт транскрипцию с двумя функциями, которые команды раньше собирали сами — метки говорящих и временные метки на уровне слов — в базовой модели, на API Gemini, поддерживающем вызовы функций. Если вы строили конвейер для создания протоколов совещаний с диаризацией из простого транскрайбера, отдельного диаризатора и этапа форматирования, то это первая модель Google, которая объединяет эти шаги. Открытым остаётся вопрос, как нестриминговый WER в 2,6% поведёт себя на вашем собственном аудио, и пока не появится независимое воспроизведение, ответственным шагом для продакшн-команды будет прогнать реальный сэмпл через API, а не планировать на основе выбранных Google бенчмарков. Что касается работы LLM поверх транскрипта — суммаризация, структурированное извлечение, пункты действий — то именно здесь маршрутизация оправдывает себя, и именно этот слой покрывает OrcaRouter: один API для более чем 200 моделей, автоматическое резервирование между провайдерами и DSL для маршрутизации, который объединяет несколько моделей в один вызов. Сам шаг транскрипции вам стоит протестировать на своём собственном аудио, прежде чем доверять чьим-либо заявленным показателям.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
