Hero-карточка статьи с надписью «Grok Voice Transcribe 2.0 против Gemini 3.5 Transcribe», бейджем «СРАВНЕНИЕ МОДЕЛЕЙ» и подзаголовком «Потоковая дорожка принадлежит одной из них», с чипами: 2,7 % против 4,0 % WER потоковой передачи, 3,4 % против 5,8 % для первого частичного результата, 0,49 с против 0,40 с для финального результата и $1,67 против $5,00 за 1 000 минут, на градиенте от белого к синему с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Grok Voice Transcribe 2.0 против Gemini 3.5 Transcribe: ниша потоковой расшифровки принадлежит одному из них

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Grok Voice Transcribe 2.0 и Gemini 3.5 Transcribe — две новейшие фронтирные модели распознавания речи от конкурирующих лабораторий, и честный способ сравнить их — сразу признать, что они созданы не для одной и той же задачи. Grok Voice Transcribe 2.0 от SpaceXAI, выпущенная 18 сентября 2026 года, — это модель, ориентированная в первую очередь на потоковую работу, с прилагающимся пакетным режимом: она возглавляет таблицу AA-WER Streaming с показателем 2,7% доли ошибок в словах для финальных расшифровок и 3,4% для первых частичных результатов, причём оба поступают через 0,49 секунды после окончания речи. Gemini 3.5 Transcribe, выпущенная 26 августа 2026 года, — это модель, ориентированная в первую очередь на пакетную обработку, с прилагающимся потоковым SKU, и две её половины ведут себя совершенно по-разному: путь для предварительно записанного аудио даёт 2,6% AA-WER в непотоковом рейтинге Artificial Analysis, тогда как отдельный gemini-3.5-transcribe-liveэндпоинт даёт 4,0% в потоковом рейтинге при 0,40 секунды. Поставьте эти четыре числа рядом друг с другом, и форма этого противостояния очевидна: они близки по точности там, где сильна Gemini 3.5 Transcribe, и совсем не близки там, где сильна Grok Voice Transcribe 2.0.

Единственная линия, на которой они оба сражаются

Обе модели умеют транскрибировать аудио в реальном времени, так что стриминг — это единственная арена, где прямое сравнение что-то значит. Там Grok Voice Transcribe 2.0 опережает Gemini 3.5 Transcribe Live на 1,3 пункта по точности итоговой транскрипции — 2,7% против 4,0% WER на одном и том же стенде, на тех же примерно восьми часах аудио и с тем же распределением весов 50/25/25 по AA-AgentTalk, VoxPopuli и Earnings22. Это не разница, вызванная округлением; при таких уровнях ошибок это примерно одно дополнительное неверное слово на каждые семьдесят пять слов, транскрибированных моделью Google. На первых промежуточных транскрипциях разрыв ещё шире — 3,4% против 5,8%, а промежуточные — это именно те транскрипции, на которые голосовому агенту в реальном времени приходится реагировать, пока говорящий ещё не закончил.

Задержка играет в обратную сторону, и именно эта часть сравнения упускается. Gemini 3.5 Transcribe Live возвращает окончательную расшифровку через 0,40 секунды после окончания речи против 0,49 у Grok, а первый частичный результат — через 0,25 секунды против 0,49 у Grok — примерно вдвое быстрее до первого пригодного слова. Ни одна из моделей не конкурирует с по-настоящему быстрым краем этой таблицы, где Deepgram Flux показывает 0,02 секунды, а Soniox v5 — 0,05, но между этими двумя компромисс очевиден: Google быстрее заговаривает, а SpaceXAI чаще оказывается прав, когда это делает. Для агента, соблюдающего очерёдность реплик, который не должен перебивать звонящего, дополнительные 0,24 секунды задержки частичного результата — реальная цена, которую должен оправдать выигрыш в точности.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe — the numbers': the left column gives Grok Voice Transcribe 2.0 a 2.7% streaming final WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and a 100-concurrent-session cap; the right column gives Gemini 3.5 Transcribe 4.0%, 5.8%, 0.40s, $5.00, about $5.40 and a 10-minute session cap.

Где Gemini 3.5 Transcribe действительно выигрывает

Покрытие языков — самый очевидный пункт, и здесь нет даже близкого сравнения. Модель Google обрабатывает 85+ языков; Grok Voice Transcribe 2.0 поддерживает десятки языков, при этом форматирование в письменную форму — обратная нормализация текста, которая превращает произносимые числа, даты, валюты и адреса электронной почты в их письменные формы, — задокументировано для 25 языков. Если ваша аудиозапись на португальском, вьетнамском или представляет собой смесь двух языков с кодовым переключением внутри одного предложения, то вопрос о том, какая модель точнее в рейтинге Artificial Analysis, во многом академический, потому что этот рейтинг смещён в сторону английского и перегружен речью агентов. Google сообщает о WER 5,50% в потоковом режиме и 5,04% в непотоковом на FLEURS в рамках собственного многоязычного набора; эти цифры заявлены производителем и не воспроизведены независимо, но хотя бы вообще описывают многоязычный сценарий.

Второе преимущество — бесплатный тариф. Gemini 3.5 Transcribe предоставляет бесплатные входные и выходные токены в API Google с той оговоркой, что контент бесплатного тарифа используется для улучшения продуктов Google, а платного — нет. Для прототипа, побочного проекта или внутреннего инструмента, обрабатывающего аудио, за расшифровку которого вы бы иначе не платили, это реальная возможность, которую не может предложить ни один поставщик с почасовой оплатой. Grok Voice Transcribe 2.0 платный с первого часа аудио.

И третье: Gemini 3.5 Transcribe — это общая мультимодальная модель с режимом транскрипции, а не специализированный сервис ASR. Ей можно задавать подсказки, она может принимать текст в качестве контекста, и она находится в той же поверхности API, что и всё остальное, что выпускает Google. Если транскрипция — это один шаг в конвейере, который также требует рассуждений над транскриптом, то сохранение обоих в одном вызове модели даёт нечто такое, что не улавливается пословной частотой ошибок.

Расчёт цены за тысячу минут

Artificial Analysis приводит обе модели к стоимости за 1 000 минут аудио — это единственный способ сравнить фиксированную почасовую ставку с оплатой по токенам:

• Пакетный режим, предварительно записанные материалы — Grok Voice Transcribe 2.0 по цене $1,67 за 1000 минут ($0,10/час) против Gemini 3.5 Transcribe по цене $5,00 за 1000 минут ($0,30/час, от $2,00 за 1 млн входных и $12,00 за 1 млн выходных токенов)

• Потоковый режим — Grok Voice Transcribe 2.0 по цене $3,33 за 1 000 минут ($0,20/час) против Gemini 3.5 Transcribe Live примерно по $5,40 за 1 000 минут; смешанная ставка рассчитана из $3,50 за 1 млн входных аудиотокенов и $21,00 за 1 млн выходных текстовых токенов

• Пропускная способность в пакетном режиме — Grok Voice Transcribe 2.0 работает со скоростью примерно 162× от реального времени, тогда как Gemini 3.5 Transcribe — примерно 88× на той же плате, так что более дешёвая модель также быстрее при работе с файлами

• Ограничение live-сессии — Grok Voice Transcribe 2.0 передаёт поток через WebSocket без опубликованного потолка длительности сессии, помимо 100 одновременных сессий на команду, в отличие от Gemini 3.5 Transcribe Live, ограниченного 10 минутами на сессию

Эта последняя строка — та операционная деталь, которая определяет больше архитектур, чем цифры точности. Ограничение в 10 минут на живую сессию означает, что длинные звонки, длинные встречи и длинные стримы приходится разбивать и переустанавливать, а каждое переустановление — это шов, где теряется контекст. Потоковый эндпоинт Grok имеет ограничение на размер файла в 500 МБ на пути пакетной обработки и лимит одновременных сессий на команду в 100 на потоковом пути — это ограничение иного рода: пропускная способность, а не длительность.

Понимание тарификации по токенам стоит того, прежде чем вы решите подключиться к стороне Google, потому что она делает ваш счёт функцией двух переменных вместо одной. Gemini отдельно берёт плату за аудиовход и отдельно за текстовый вывод, поэтому модель, которая выдаёт многословное форматирование или повторяется, обходится дороже, чем та, что этого не делает, а язык с более длинными словами стоит дороже, чем язык с более короткими. Фиксированная почасовая ставка Grok никак не зависит от всего этого. Для высоконагруженных рабочих процессов фиксированная ставка легче прогнозируется, а поскольку OrcaRouter передаёт прайс-листы провайдеров без наценки — 0%, изменение на стороне любого из вендоров отразится на вашем счёте в тот же день, когда оно произойдёт, а не при следующем продлении контракта.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard, showing Grok Voice Transcribe 2.0 first at 2.728% final-transcript word error rate and 0.490s, Gemini 3.5 Transcribe Live at 3.998% and 0.395s with a 5.774% first-partial figure, and the faster Deepgram Flux and Soniox v5 rows for latency context.

Контуры функций: от чего каждая отказывается

Списки возможностей расходятся сильнее, чем предполагают показатели точности, и пробелы находятся в местах, которые важны для конкретных приложений:

• Диаризация говорящих — включена без дополнительной платы в Grok Voice Transcribe 2.0; не поддерживается в Gemini 3.5 Transcribe Live, поэтому живые расшифровки с указанием говорящих на этом эндпоинте вообще недоступны

• Метки времени на уровне слов — Grok Voice Transcribe 2.0 возвращает их с оценками уверенности для каждого слова; Gemini 3.5 Transcribe Live не возвращает их вовсе, что исключает пороговую фильтрацию по уверенности и точное выравнивание субтитров

• Многоканальное аудио — Grok Voice Transcribe 2.0 транскрибирует до 8 независимых каналов за один проход; у Gemini 3.5 Transcribe Live нет аналога, поэтому многоканальные записи звонков требуют отдельных сессий для каждого канала

• Смещение в пользу ключевых терминов — Grok Voice Transcribe 2.0 принимает до 100 терминов предметной области на запрос; Gemini 3.5 Transcribe поддерживает пользовательский словарь и необязательные языковые подсказки

• Инфраструктура голосовых агентов — Grok Voice Transcribe 2.0 включает удаление слов-паразитов и определение конца реплики Smart Turn; Gemini 3.5 Transcribe Live покрывает потоковый сценарий, но оставляет логику реплик приложению

• Обработка входных данных — Grok Voice Transcribe 2.0 принимает прямую загрузку файлов размером до 500 МБ в 12 аудиоформатах; путь для предварительно записанных файлов в Gemini 3.5 Transcribe требует публичный HTTPS-URL с ограничениями в 15 минут и 300 МБ и не позволяет сочетать режим Smart formatting с пословными временными метками или метками говорящих

Закономерность в этом списке такова: SpaceXAI создала продукт для транскрипции, а Google — возможность транскрипции. Диаризация, временные метки, разделение каналов и определение реплик — это функции, которые нужны, когда транскрипция и есть всё приложение; возможность задавать промпты, широта языковой поддержки и один API для всего — то, что нужно, когда транскрипция — лишь шаг внутри более крупного приложения. Ни один из списков не лучше сам по себе, и команда, которая выбирает, опираясь только на точность, в итоге упустит тот набор, который ей не понадобился.

Screenshot of the Google ai.google.dev speech-generation documentation for Gemini 3.5 Transcribe, showing the pre-recorded and live transcription endpoints, the token-based audio-input and text-output pricing, the supported-language list and the 10-minute live session ceiling.

Выбор между ними и что меняет ответ

Выбирайте Grok Voice Transcribe 2.0, когда транскрипт должен быть точным, пока аудио ещё воспроизводится: передача очереди между агентами в реальном времени, субтитры в реальном времени, где ошибки недопустимы, потоки контакт-центра, где атрибуция говорящего и разделение каналов входят в требования, или любой пакетный конвейер, где важны и $1.67 за 1 000 минут, и 162-кратная пропускная способность. Выбирайте Gemini 3.5 Transcribe, когда аудио многоязычно и включает язык за пределами задокументированного набора Grok, когда транскрипт подаётся в модель, которая также должна рассуждать о нём, когда вы хотите использовать бесплатный уровень для прототипирования, или когда 2.6% AA-WER пакетного пути просто достаточно для ваших задач, и дополнительное языковое покрытие стоит больше, чем разница в цене.

На самом деле большинство команд здесь не выбирают. Обе модели доступны через один ключ API OrcaRouter наряду с более чем 200 другими моделями, а значит, вы можете направлять трафик живых агентов в Grok Voice Transcribe 2.0, а длинные многоязычные архивы — в Gemini 3.5 Transcribe, не поддерживая два контракта с поставщиками, две системы выставления счетов и два набора учётных данных. Именно так вы и решаете вопрос точности для собственного аудио: запустите обе на одних и тех же записях, сравните транскрипты, которые реально получили, и позвольте DSL маршрутизации направлять трафик туда, куда нужно. Таблица лидеров говорит вам, какая модель побеждает на восьми часах чужих разговоров англоязычных агентов; только ваше собственное аудио скажет, какая из них победит на вашем.

Открытый вопрос в том, что произойдёт с этим разрывом в потоковой передаче, когда Google в следующий раз пересмотрит эндпоинт Live. Gemini 3.5 Transcribe Live вышел в публичную предварительную версию, и его показатель в 4,0% был измерен примерно через день после того, как он стал доступен для вызова, — это сильный ранний сигнал, но у него было меньше времени, чтобы устояться, чем у показателя Grok, позади которого он теперь находится. Если Google закроет разрыв в 1,3 пункта по потоковой передаче, сохранив при этом задержку частичных результатов в 0,25 секунды, этот компромисс перестанет быть компромиссом, а преимущество Grok сузится до цены и функций. До тех пор разделение однозначно: самые быстрые частичные результаты — у Google, самые точные — у SpaceXAI, и ни одна модель в списке не обладает и тем, и другим.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно