
Интеллектуальная транскрибация с Gemini 3.5 Transcribe
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 за 1 млн токенов · 85 tok/s
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
Gemini 3.5 Transcribe вышел в публичное предварительное тестирование 26 августа 2026 года и стал первой моделью Google для распознавания речи, которая действительно продаётся как модель Gemini: вы вызываете её через Gemini API с идентификатором модели, аудио тарифицируется в токенах, а Google указывает стоимость минуты аудио на своей странице с ценами. Именно эту последнюю деталь потребительские обзоры упускают из виду. В день запуска в новостях говорили об удалении слов-паразитов и редактировании голоса в Gboard, но для разработчиков на самом деле изменилось то, что транскрибация теперь находится на том же API, что и остальная линейка Gemini, с атрибуцией говорящего и пословными временными метками в базовой модели, а не в отдельном дополнении. Этот материал читается как справочник по API, потому что именно этот пробел первая волна публикаций оставляет открытым.
Сразу две оговорки, чтобы приведённые ниже цифры не вводили в заблуждение. Google не называет Gemini 3.5 Transcribe «самой точной моделью распознавания речи, которая у нас есть» — утверждение состоит в том, что это самая точная модель для интеллектуальных голосовых взаимодействий, а это другое утверждение, и эта разница важна, когда вы читаете показатели WER. И всё здесь описывает публичную предварительную версию: два идентификатора моделей, цены и контрольные показатели — это то, что Google предлагает сегодня, и всё это может измениться до GA.
Два пути API — и идентификаторы моделей, которые нужно запомнить.
Gemini 3.5 Transcribe поставляется в виде двух конечных точек, и выбор правильной из них — первое архитектурное решение, которое принимает команда:
• gemini-3-5-transcribe — путь для предварительно записанных файлов через Interactions API. Отправьте файл и получите расшифровку с атрибуцией говорящих (до трех спикеров; три и более — экспериментально) и посекундными метками времени. Это основной инструмент для пакетной и асинхронной обработки.
• gemini-3-5-transcribe-live — путь реального времени через Live API. Двунаправленная потоковая передача с задержкой менее секунды, предназначенная для живых разговоров, субтитров и голосовых интерфейсов.
Разделение отражает то, как устроено остальное семейство Gemini Audio, и это важно, потому что "live" — это отдельный SKU со своей ценой. Некоторые ранние прочтения этого запуска предполагают, что одна модель делает и то и другое; но это не так.

Что на самом деле означает «интеллектуальная транскрипция»
В анонсе Google это представлено как движение от фонетической точности к пониманию. Оценивать следует те функции, которые вытекают из этой постановки, а не саму постановку:
• Обработка сбоев речи — «э-э» и «а-а» опускаются, а самоисправления устраняются. «Давайте встретимся во вторник — нет, в среду» транскрибируется как исправленный день, а не как расшифровка ложного старта. Это решение принимает модель, и именно в этом смысле Google называет это интеллектуальным.
• Автоформатирование — вывод возвращается в виде оформленного текста: применены пунктуация, регистр и структура абзацев, а не сырой поток токенов.
• Идентификация нескольких говорящих — до трех говорящих, определяемых в предварительно записанном аудио с пословными временными метками; три и более говорящих — экспериментально. Эта функция реализована в базовой модели, а не в отдельном сервисе диаризации.
• Настраиваемый словарь — вы можете смещать распознавание в сторону жаргона, названий продуктов и необычных написаний, предоставляя словарь, который является механизмом для вертикальных доменов.
85+ языков — автоматическое определение, с явным выделением региональных акцентов и диалектов.
• Вызов функций — модель может делегировать такие задачи, как генерация изображений или анализ файлов, другим моделям Gemini, что превращает транскрибацию в компонент более крупного агента, а не в конечный этап.
• Захват сущностей — Google заявляет о высокой производительности на зашумлённом реальном аудио и на буквенно-цифровых сущностях, таких как почтовые индексы и идентификаторы заказов.
В пресс-репортажах также упоминалось окно контекста на 96 000 токенов (примерно час аудиозаписи совещания без разбиения) и распознавание эмоций. Оба этих пункта согласуются с представленной концепцией запуска, но в карточке модели, опубликованной Google, они не выделены в качестве основных, поэтому относитесь к ним как к сообщённым, а не подтверждённым, пока не появится спецификация GA.

Числа точности, помеченные
Показатели WER, которые приводит Google, взяты из Artificial Analysis: средняя частота ошибок в словах составляет 4,0% для потоковой и 2,6% для непотоковой транскрипции. На многоязычном бенчмарке FLEURS Google сообщает о WER 5,50% для потоковой и 5,04% для непотоковой транскрипции. Google также заявляет о сокращении времени до финальной транскрипции на 70% по сравнению со своим предшественником Chirp 3.
Честное прочтение: это независимые измерения в том смысле, что Artificial Analysis — не Google, но это измерения, отобранные Google и опубликованные внутри собственного анонса Google, для модели, которая доступна для вызова всего день. Никто за пределами Google ещё не проводил состязательного сравнения один на один с open-weight моделями, с которыми большинство команд её и сравнивает, а в материалах запуска нет прямого сравнения с семейством Whisper или линейкой Parakeet от NVIDIA. Показатель «на 70% быстрее Chirp-3» — это заявление вендора, и точка. Относитесь к 2,6% и 4,0% как к сильным ранним сигналам, а не как к установленным фактам.
Сколько это стоит
На странице цен Google указаны тарифы для каждой модели в токенах и в расчетных минутах аудио. Для gemini-3-5-transcribe смешанная оценка составляет примерно $0.005 за минуту аудио по прейскурантным ценам — ввод около $0.003/мин, вывод около $0.002/мин. Для gemini-3-5-transcribe-live смешанная оценка составляет около $0.009 за минуту. Обе модели сейчас имеют бесплатный тариф.
Эти поминутные цифры — оценки, выведенные из предполагаемой скорости токенизации (25 аудиотокенов в секунду на входе, 175 текстовых токенов в минуту на выходе), поэтому они меняются, если Google изменит учёт токенов. Неизменным остаётся принцип: цена из прайс-листа и есть цена. Именно на этом принципе работает такой сквозной роутер, как OrcaRouter, — 0% наценки, цена провайдера передаётся как есть, — поэтому если Google снизит цены на транскрибацию в окне между превью и GA, снижение вступит в силу на нашей стороне в тот же день, а не после того, как реселлер обновит тарифную карту.
Где это внедряется
Для разработчиков публичная предварительная версия сегодня означает два направления: API Gemini в Google AI Studio и платформу Gemini Enterprise Agent Platform для корпоративных нагрузок. На стороне потребителей Gemini 3.5 Transcribe уже обеспечивает функцию диктовки Rambler в Gboard на Android и в приложении Gemini на macOS. Далее — Chrome: голосовой ввод в любом веб-поле, а затем Search Live, Gemini Live, Docs, Keep и Gmail. Для команды, которая это оценивает, практический ответ проще: его можно вызывать из кода уже сегодня, на английском языке, в регионах, где доступен API Gemini.

Что это значит для вашего пайплайна
Действительно новое — это не число WER. Дело в том, что Google теперь продаёт транскрипцию с двумя функциями, которые команды раньше собирали сами — метки говорящих и временные метки на уровне слов — в базовой модели, на API Gemini, поддерживающем вызовы функций. Если вы строили конвейер для создания протоколов совещаний с диаризацией из простого транскрайбера, отдельного диаризатора и этапа форматирования, то это первая модель Google, которая объединяет эти шаги. Открытым остаётся вопрос, как нестриминговый WER в 2,6% поведёт себя на вашем собственном аудио, и пока не появится независимое воспроизведение, ответственным шагом для продакшн-команды будет прогнать реальный сэмпл через API, а не планировать на основе выбранных Google бенчмарков. Что касается работы LLM поверх транскрипта — суммаризация, структурированное извлечение, пункты действий — то именно здесь маршрутизация оправдывает себя, и именно этот слой покрывает OrcaRouter: один API для более чем 200 моделей, автоматическое резервирование между провайдерами и DSL для маршрутизации, который объединяет несколько моделей в один вызов. Сам шаг транскрипции вам стоит протестировать на своём собственном аудио, прежде чем доверять чьим-либо заявленным показателям.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
