
Grok Voice Transcribe 2.0 против Gemini 3.5 Transcribe: ниша потоковой расшифровки принадлежит одному из них
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 и Gemini 3.5 Transcribe — две новейшие фронтирные модели распознавания речи от конкурирующих лабораторий, и честный способ сравнить их — сразу признать, что они созданы не для одной и той же задачи. Grok Voice Transcribe 2.0 от SpaceXAI, выпущенная 18 сентября 2026 года, — это модель, ориентированная в первую очередь на потоковую работу, с прилагающимся пакетным режимом: она возглавляет таблицу AA-WER Streaming с показателем 2,7% доли ошибок в словах для финальных расшифровок и 3,4% для первых частичных результатов, причём оба поступают через 0,49 секунды после окончания речи. Gemini 3.5 Transcribe, выпущенная 26 августа 2026 года, — это модель, ориентированная в первую очередь на пакетную обработку, с прилагающимся потоковым SKU, и две её половины ведут себя совершенно по-разному: путь для предварительно записанного аудио даёт 2,6% AA-WER в непотоковом рейтинге Artificial Analysis, тогда как отдельный gemini-3.5-transcribe-liveэндпоинт даёт 4,0% в потоковом рейтинге при 0,40 секунды. Поставьте эти четыре числа рядом друг с другом, и форма этого противостояния очевидна: они близки по точности там, где сильна Gemini 3.5 Transcribe, и совсем не близки там, где сильна Grok Voice Transcribe 2.0.
Единственная линия, на которой они оба сражаются
Обе модели умеют транскрибировать аудио в реальном времени, так что стриминг — это единственная арена, где прямое сравнение что-то значит. Там Grok Voice Transcribe 2.0 опережает Gemini 3.5 Transcribe Live на 1,3 пункта по точности итоговой транскрипции — 2,7% против 4,0% WER на одном и том же стенде, на тех же примерно восьми часах аудио и с тем же распределением весов 50/25/25 по AA-AgentTalk, VoxPopuli и Earnings22. Это не разница, вызванная округлением; при таких уровнях ошибок это примерно одно дополнительное неверное слово на каждые семьдесят пять слов, транскрибированных моделью Google. На первых промежуточных транскрипциях разрыв ещё шире — 3,4% против 5,8%, а промежуточные — это именно те транскрипции, на которые голосовому агенту в реальном времени приходится реагировать, пока говорящий ещё не закончил.
Задержка играет в обратную сторону, и именно эта часть сравнения упускается. Gemini 3.5 Transcribe Live возвращает окончательную расшифровку через 0,40 секунды после окончания речи против 0,49 у Grok, а первый частичный результат — через 0,25 секунды против 0,49 у Grok — примерно вдвое быстрее до первого пригодного слова. Ни одна из моделей не конкурирует с по-настоящему быстрым краем этой таблицы, где Deepgram Flux показывает 0,02 секунды, а Soniox v5 — 0,05, но между этими двумя компромисс очевиден: Google быстрее заговаривает, а SpaceXAI чаще оказывается прав, когда это делает. Для агента, соблюдающего очерёдность реплик, который не должен перебивать звонящего, дополнительные 0,24 секунды задержки частичного результата — реальная цена, которую должен оправдать выигрыш в точности.

Где Gemini 3.5 Transcribe действительно выигрывает
Покрытие языков — самый очевидный пункт, и здесь нет даже близкого сравнения. Модель Google обрабатывает 85+ языков; Grok Voice Transcribe 2.0 поддерживает десятки языков, при этом форматирование в письменную форму — обратная нормализация текста, которая превращает произносимые числа, даты, валюты и адреса электронной почты в их письменные формы, — задокументировано для 25 языков. Если ваша аудиозапись на португальском, вьетнамском или представляет собой смесь двух языков с кодовым переключением внутри одного предложения, то вопрос о том, какая модель точнее в рейтинге Artificial Analysis, во многом академический, потому что этот рейтинг смещён в сторону английского и перегружен речью агентов. Google сообщает о WER 5,50% в потоковом режиме и 5,04% в непотоковом на FLEURS в рамках собственного многоязычного набора; эти цифры заявлены производителем и не воспроизведены независимо, но хотя бы вообще описывают многоязычный сценарий.
Второе преимущество — бесплатный тариф. Gemini 3.5 Transcribe предоставляет бесплатные входные и выходные токены в API Google с той оговоркой, что контент бесплатного тарифа используется для улучшения продуктов Google, а платного — нет. Для прототипа, побочного проекта или внутреннего инструмента, обрабатывающего аудио, за расшифровку которого вы бы иначе не платили, это реальная возможность, которую не может предложить ни один поставщик с почасовой оплатой. Grok Voice Transcribe 2.0 платный с первого часа аудио.
И третье: Gemini 3.5 Transcribe — это общая мультимодальная модель с режимом транскрипции, а не специализированный сервис ASR. Ей можно задавать подсказки, она может принимать текст в качестве контекста, и она находится в той же поверхности API, что и всё остальное, что выпускает Google. Если транскрипция — это один шаг в конвейере, который также требует рассуждений над транскриптом, то сохранение обоих в одном вызове модели даёт нечто такое, что не улавливается пословной частотой ошибок.
Расчёт цены за тысячу минут
Artificial Analysis приводит обе модели к стоимости за 1 000 минут аудио — это единственный способ сравнить фиксированную почасовую ставку с оплатой по токенам:
• Пакетный режим, предварительно записанные материалы — Grok Voice Transcribe 2.0 по цене $1,67 за 1000 минут ($0,10/час) против Gemini 3.5 Transcribe по цене $5,00 за 1000 минут ($0,30/час, от $2,00 за 1 млн входных и $12,00 за 1 млн выходных токенов)
• Потоковый режим — Grok Voice Transcribe 2.0 по цене $3,33 за 1 000 минут ($0,20/час) против Gemini 3.5 Transcribe Live примерно по $5,40 за 1 000 минут; смешанная ставка рассчитана из $3,50 за 1 млн входных аудиотокенов и $21,00 за 1 млн выходных текстовых токенов
• Пропускная способность в пакетном режиме — Grok Voice Transcribe 2.0 работает со скоростью примерно 162× от реального времени, тогда как Gemini 3.5 Transcribe — примерно 88× на той же плате, так что более дешёвая модель также быстрее при работе с файлами
• Ограничение live-сессии — Grok Voice Transcribe 2.0 передаёт поток через WebSocket без опубликованного потолка длительности сессии, помимо 100 одновременных сессий на команду, в отличие от Gemini 3.5 Transcribe Live, ограниченного 10 минутами на сессию
Эта последняя строка — та операционная деталь, которая определяет больше архитектур, чем цифры точности. Ограничение в 10 минут на живую сессию означает, что длинные звонки, длинные встречи и длинные стримы приходится разбивать и переустанавливать, а каждое переустановление — это шов, где теряется контекст. Потоковый эндпоинт Grok имеет ограничение на размер файла в 500 МБ на пути пакетной обработки и лимит одновременных сессий на команду в 100 на потоковом пути — это ограничение иного рода: пропускная способность, а не длительность.
Понимание тарификации по токенам стоит того, прежде чем вы решите подключиться к стороне Google, потому что она делает ваш счёт функцией двух переменных вместо одной. Gemini отдельно берёт плату за аудиовход и отдельно за текстовый вывод, поэтому модель, которая выдаёт многословное форматирование или повторяется, обходится дороже, чем та, что этого не делает, а язык с более длинными словами стоит дороже, чем язык с более короткими. Фиксированная почасовая ставка Grok никак не зависит от всего этого. Для высоконагруженных рабочих процессов фиксированная ставка легче прогнозируется, а поскольку OrcaRouter передаёт прайс-листы провайдеров без наценки — 0%, изменение на стороне любого из вендоров отразится на вашем счёте в тот же день, когда оно произойдёт, а не при следующем продлении контракта.

Контуры функций: от чего каждая отказывается
Списки возможностей расходятся сильнее, чем предполагают показатели точности, и пробелы находятся в местах, которые важны для конкретных приложений:
• Диаризация говорящих — включена без дополнительной платы в Grok Voice Transcribe 2.0; не поддерживается в Gemini 3.5 Transcribe Live, поэтому живые расшифровки с указанием говорящих на этом эндпоинте вообще недоступны
• Метки времени на уровне слов — Grok Voice Transcribe 2.0 возвращает их с оценками уверенности для каждого слова; Gemini 3.5 Transcribe Live не возвращает их вовсе, что исключает пороговую фильтрацию по уверенности и точное выравнивание субтитров
• Многоканальное аудио — Grok Voice Transcribe 2.0 транскрибирует до 8 независимых каналов за один проход; у Gemini 3.5 Transcribe Live нет аналога, поэтому многоканальные записи звонков требуют отдельных сессий для каждого канала
• Смещение в пользу ключевых терминов — Grok Voice Transcribe 2.0 принимает до 100 терминов предметной области на запрос; Gemini 3.5 Transcribe поддерживает пользовательский словарь и необязательные языковые подсказки
• Инфраструктура голосовых агентов — Grok Voice Transcribe 2.0 включает удаление слов-паразитов и определение конца реплики Smart Turn; Gemini 3.5 Transcribe Live покрывает потоковый сценарий, но оставляет логику реплик приложению
• Обработка входных данных — Grok Voice Transcribe 2.0 принимает прямую загрузку файлов размером до 500 МБ в 12 аудиоформатах; путь для предварительно записанных файлов в Gemini 3.5 Transcribe требует публичный HTTPS-URL с ограничениями в 15 минут и 300 МБ и не позволяет сочетать режим Smart formatting с пословными временными метками или метками говорящих
Закономерность в этом списке такова: SpaceXAI создала продукт для транскрипции, а Google — возможность транскрипции. Диаризация, временные метки, разделение каналов и определение реплик — это функции, которые нужны, когда транскрипция и есть всё приложение; возможность задавать промпты, широта языковой поддержки и один API для всего — то, что нужно, когда транскрипция — лишь шаг внутри более крупного приложения. Ни один из списков не лучше сам по себе, и команда, которая выбирает, опираясь только на точность, в итоге упустит тот набор, который ей не понадобился.

Выбор между ними и что меняет ответ
Выбирайте Grok Voice Transcribe 2.0, когда транскрипт должен быть точным, пока аудио ещё воспроизводится: передача очереди между агентами в реальном времени, субтитры в реальном времени, где ошибки недопустимы, потоки контакт-центра, где атрибуция говорящего и разделение каналов входят в требования, или любой пакетный конвейер, где важны и $1.67 за 1 000 минут, и 162-кратная пропускная способность. Выбирайте Gemini 3.5 Transcribe, когда аудио многоязычно и включает язык за пределами задокументированного набора Grok, когда транскрипт подаётся в модель, которая также должна рассуждать о нём, когда вы хотите использовать бесплатный уровень для прототипирования, или когда 2.6% AA-WER пакетного пути просто достаточно для ваших задач, и дополнительное языковое покрытие стоит больше, чем разница в цене.
На самом деле большинство команд здесь не выбирают. Обе модели доступны через один ключ API OrcaRouter наряду с более чем 200 другими моделями, а значит, вы можете направлять трафик живых агентов в Grok Voice Transcribe 2.0, а длинные многоязычные архивы — в Gemini 3.5 Transcribe, не поддерживая два контракта с поставщиками, две системы выставления счетов и два набора учётных данных. Именно так вы и решаете вопрос точности для собственного аудио: запустите обе на одних и тех же записях, сравните транскрипты, которые реально получили, и позвольте DSL маршрутизации направлять трафик туда, куда нужно. Таблица лидеров говорит вам, какая модель побеждает на восьми часах чужих разговоров англоязычных агентов; только ваше собственное аудио скажет, какая из них победит на вашем.
Открытый вопрос в том, что произойдёт с этим разрывом в потоковой передаче, когда Google в следующий раз пересмотрит эндпоинт Live. Gemini 3.5 Transcribe Live вышел в публичную предварительную версию, и его показатель в 4,0% был измерен примерно через день после того, как он стал доступен для вызова, — это сильный ранний сигнал, но у него было меньше времени, чтобы устояться, чем у показателя Grok, позади которого он теперь находится. Если Google закроет разрыв в 1,3 пункта по потоковой передаче, сохранив при этом задержку частичных результатов в 0,25 секунды, этот компромисс перестанет быть компромиссом, а преимущество Grok сузится до цены и функций. До тех пор разделение однозначно: самые быстрые частичные результаты — у Google, самые точные — у SpaceXAI, и ни одна модель в списке не обладает и тем, и другим.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
