
Gemini 3.5 Transcribe против Whisper Large v3 Turbo: нужно ли заменять базовую модель?
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
Whisper Large v3 Turbo — это модель, которая по умолчанию подразумевается под фразой «распознавание речи» для значительной части индустрии, а Gemini 3.5 Transcribe — первая модель транскрибации от Google, которая явно позиционируется как конкурент этого базового стандарта, а не как универсальный речевой API. Gemini 3.5 Transcribe, доступный в публичной предварительной версии с 26 августа 2026 года, переосмысляет транскрибацию как задачу рассуждения: он исправляет самооговорки, форматирует выходные данные, определяет говорящих и самостоятельно вызывает другие модели Gemini. Whisper Large v3 Turbo — это дистилляция Whisper Large-v3 от OpenAI с 809 миллионами параметров, распространяемая по лицензии MIT, которая может размещаться на собственных серверах, поддерживает 99 языков и примерно в четыре-восемь раз быстрее исходной модели в зависимости от оборудования. Одна — это управляемый интеллектуальный слой поверх аудио; другая — бесплатный, хорошо изученный компонент, который вы запускаете где угодно. Вопрос, на который отвечает эта страница, уже и полезнее, чем «что лучше»: когда базовый стандарт перестаёт быть достаточно хорошим?
Базовый уровень, если вы вдруг забыли, насколько он хорош
Whisper Large v3 Turbo заслуживает своего статуса по умолчанию, поэтому аргументы в его пользу идут первыми:
• Он работает где угодно — лицензия MIT, открытые веса, установка на ноутбук, один GPU или serverless-функцию. Никакого вендора, никакого учета, никаких данных, покидающих вашу сеть.
• Она быстрая — дистиллированный декодер (32 слоя энкодера, 4 слоя декодера вместо 32) делает её примерно в четыре раза быстрее Whisper Large-v3 на типовом оборудовании, а на некоторых — ещё быстрее, сохраняя при этом большую часть точности. По данным самой OpenAI, на A100 — примерно в восемь раз.
• Он охватывает 99 языков для транскрипции — более широкий список, чем 85+ у Gemini 3.5 Transcribe.
• Его точность хорошо документирована: 2.1% WER на {{KEEP}}LibriSpeech test-clean, 4.2% on test-other, 9.1% on Common Voice English{{/KEEP}} — цифры, которые воспроизводились сообществом на протяжении многих лет.
Экосистема огромна — faster-whisper, whisper.cpp, экспорт в ONNX и все фреймворки инференса, которые вы уже используете. Если вы можете запустить модель, вы сможете запустить и эту.

Для пакетной транскрипции английского и близких к нему языков в больших масштабах Whisper Large v3 Turbo остаётся бессменным стандартом по структурным причинам, которые не может легко преодолеть ни один разрыв в бенчмарках: он бесплатен, он ваш, и он есть везде.

Что {{1}}Gemini 3.5 Transcribe{{/1}} добавляет сверху
Ценность управляемого претендента не в том, что он превосходит базовую модель на чистом английском — этот бой цифры пока даже не могут решить однозначно. Его ценность — работа, происходящая над словами, которую Whisper явно не выполняет:
• Атрибуция говорящих — до трёх говорящих с пословными временными метками в базовой модели. Whisper транскрибирует один поток речи; у него нет понятия о том, кто что сказал.
• Интеллектуальное форматирование — устранение запинок, исправление самокоррекций, расстановка пунктуации и заглавных букв. Whisper возвращает слова в том виде, в котором они были произнесены, включая все «э-э» и «хм».
• Пользовательский словарь — смещение в сторону жаргона и необычных написаний. В Whisper нет такого механизма; вы выполняете постобработку или тонкую настройку.
• Вызов функций — транскрипт может передаваться другим моделям Gemini, что делает транскрибацию шагом в агентном конвейере, а не конечным результатом.
• Длительные сеансы — примерно час аудио за один проход (по сообщениям прессы, контекст 96K) против практической необходимости Whisper разбивать и склеивать длинные файлы.
Это другой продукт. Именно это Google имеет в виду под «интеллектуальной транскрипцией», и это та часть сравнения, которая не зависит от арифметики бенчмарков.
Вопрос точности, на который пока никто не может дать чёткого ответа.
Ключевые показатели двух моделей на самом деле не противостоят друг другу. WER 2,6% для непотокового режима Gemini 3.5 Transcribe — это измерение Artificial Analysis, цитируемое Google и рассчитанное на основе 85+ языков. Показатель 2,1% на LibriSpeech test-clean у Whisper Large v3 Turbo — это английский бенчмарк из собственной статьи OpenAI о дистилляции, многократно воспроизведённый. Разные корпуса, разное языковое покрытие, разные поставщики. Что можно сказать честно: на чистом английском открытая базовая модель и управляемый конкурент, по всей видимости, находятся в одном диапазоне, а преимущество управляемой модели заключается в её многоязычных и структурных возможностях, а не в продемонстрированной победе по WER на английском. В материалах запуска Google нет прямого сравнения с моделями семейства Whisper, а независимого состязательного сравнения пока не существует, поскольку Gemini 3.5 Transcribe находится в открытом доступе всего один день. Пока такое сравнение не появится, корона точности остаётся непереданной, и любая статья — включая эту, — объявляющая победителя по WER на основе этих двух цифр, заходит слишком далеко.

Стоимость: бесплатно по сравнению с $0.005 в минуту
Whisper Large v3 Turbo требует затрат на оборудование и не имеет поминутной тарификации. Если запускать его на GPU, который у вас уже есть, предельная стоимость минуты транскрибации близка к нулю; а если арендовать GPU, она равна стоимости инстанса за время работы. Gemini 3.5 Transcribe взимает примерно $0.005 за минуту аудио в среднем, при этом live SKU стоит около $0.009 за минуту, и есть бесплатный тариф. При тысяче часов аудио это около $300 по счетчику Gemini против нескольких долларов за время GPU на открытом базовом решении. Этот разрыв — главная история о стоимости в данном сравнении, и именно поэтому базовое решение ещё долго сохранит статус варианта по умолчанию для высокообъемной пакетной обработки англоязычного контента. Экономика управляемой модели становится оправданной только тогда, когда входящие в неё функции — диаризация, форматирование, контроль словаря — сами потребовали бы от вас инженерного времени для их реализации поверх Whisper.
Языки и стриминг
Whisper Large v3 Turbo заявляет 99 языков против 85+ у Gemini, но на практике многоязычность работает иначе: Whisper транскрибирует все 99 за один проход без автоопределения, и его точность сильнее всего падает на низкоресурсных и зашумленных языках — это компромисс дистиллированной модели. Gemini автоматически определяет язык среди своих 85+, а Google выделяет региональные акценты и диалекты. Что касается потоковой транскрипции, у Whisper нет нативной модели реального времени; для работы в реальном времени используют faster-whisper и аналогичные фреймворки на собственном оборудовании, тогда как Gemini 3.5 Transcribe имеет специально созданную конечную точку для потоковой транскрипции с заявленной задержкой менее секунды и соответствующей ценой. Если ваша рабочая нагрузка требует работы в реальном времени и многоязычности, управляемая конечная точка проще в эксплуатации; если она пакетная и англоязычная, открытая базовая модель дешевле.
Вердикт, каков он есть
Whisper Large v3 Turbo остаётся правильным выбором по умолчанию для пакетной транскрибации английской речи в больших объёмах — для всего, что должно работать на вашей собственной инфраструктуре, и для команд, которым нужен зафиксированный, проверяемый артефакт. Gemini 3.5 Transcribe — правильное решение, когда транскрипт должен быть чем-то большим, чем просто слова: метки говорящих, чистое форматирование, отраслевая лексика, многоязычность или подключение агента, — и когда вы готовы платить по счётчику за эти возможности. Обе модели сосуществуют, и подход, который делает это сосуществование дешёвым, — это граница маршрутизации: транскрайбер, подходящий под аудио, а затем уровень LLM, который решает, что происходит с текстом. Именно этот уровень и обеспечивает OrcaRouter: один API для 200+ моделей, автоматическое переключение между провайдерами и DSL для маршрутизации, позволяющий объединять несколько моделей в один вызов. Ни одна из речевых моделей не размещается на нашей стороне; выбор транскрибации — между вашим GPU и счётчиком Google, и обе эти опции будут существовать ещё долго.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
