Hero-карточка статьи с надписью «Grok Voice Transcribe 2.0 против Whisper Large v3 Turbo», бейджем «СРАВНЕНИЕ МОДЕЛЕЙ» и подзаголовком «Что бесплатный базовый вариант всё ещё делает лучше», с чипами: 2,7% против 4,07% WER, $0,20 в час против весов MIT, 0,49 с против 1–5 с при самостоятельном хостинге и управляемый вариант против собственного, на фоне градиента от белого к синему с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Grok Voice Transcribe 2.0 против Whisper Large v3 Turbo: в чём бесплатный базовый вариант всё ещё лучше

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Whisper Large v3 Turbo был ответом по умолчанию на запрос «нам нужна транскрипция» с тех пор, как он был выпущен по лицензии MIT 1 октября 2024 года, и ничто в Grok Voice Transcribe 2.0 не меняет причину, по которой это так. Новая модель SpaceXAI, выпущенная 18 сентября 2026 года, — действительно гораздо лучший транскрибатор, и с большим отрывом: 2,7% ошибок в словах для финальных транскриптов и 3,4% для первых промежуточных результатов в рейтинге AA-WER Streaming от Artificial Analysis против показателя семейства Whisper в 4,07% в непотоковом рейтинге, при этом сам Turbo обычно отстаёт на несколько десятых пункта от полной Large v3, из которой он был дистиллирован. Он также стоит 0,10 доллара за час аудио при пакетной обработке и 0,20 доллара за час при потоковой. Whisper Large v3 Turbo — это файл размером 1,6 ГБ с 809 миллионами параметров, который работает на вашем собственном оборудовании, не ведёт никакого учёта, никуда не отправляет аудио и не имеет ограничения частоты запросов, ограничения на параллелизм и графика вывода из эксплуатации. Сравнение идёт не между лучшей моделью и худшей. Оно идёт между арендой точности и владением компонентом.

Тридцатисекундное окно — это вся архитектура

Whisper Large v3 Turbo наследует структуру каждой модели Whisper: аудио обрабатывается фиксированными 30-секундными окнами, энкодер запускается один раз на окно, а декодер выдаёт текст для этого фрагмента. Turbo сделала это дешевле — четыре слоя декодера вместо тридцати двух, примерно в 8 раз быстрее, чем Large v3, около 6 ГБ видеопамяти вместо 10, — но саму схему она не изменила. Внутри модели нет понятия «предложение, накопленное к данному моменту», потому что между окнами нет сохраняющегося состояния.

Этот единственный факт об устройстве объясняет всё, что из него следует. Нативной потоковой передачи нет, потому что потоковая передача требует формировать частичный вывод прямо посреди произносимой реплики, а у модели нет для этого механизма. Развёртывания Whisper в реальном времени существуют, но они представляют собой разбиение на фрагменты плюс детекцию голосовой активности плюс слой сшивания, который кто-то написал и теперь поддерживает, а задержка, вытекающая из такого конвейера, измеряется секундами, а не половиной секунды, которой достигает Grok Voice Transcribe 2.0. Диаризации говорящих нет, потому что диаризация — это отдельная задача о том, кто говорит, а не о том, что было сказано. А вариант Turbo конкретно возвращает обычный текст — без временных меток, без оценок уверенности, без обратной нормализации текста, превращающей произнесённые числа и адреса электронной почты в письменную форму.

Grok Voice Transcribe 2.0 был построен ровно наоборот. Потоковая передача — основной транспорт, пакетная обработка — те же веса за REST-эндпоинтом, а список функций читается как перечень того, что Whisper оставлял приложению: временные метки на уровне слов с уверенностью для каждого слова, диаризация говорящих, включённая без дополнительной платы, многоканальная транскрипция до 8 независимых каналов, смещение в сторону ключевых терминов — до 100 предметных терминов на запрос, обратная нормализация текста для 25 языков, удаление слов-заполнителей и определение конца реплики Smart Turn для голосовых агентов. Если вы поддерживали конвейер нарезки и сшивания вокруг Whisper, этот список — описание кода, который вы написали.

Разрыв в точности, и почему он меньше, чем кажется

• Итоговая точность транскрипта (потоковая) — Grok Voice Transcribe 2.0 с WER 2,7% на AA-WER Streaming против отсутствия результата у Whisper Large v3 Turbo, потому что модель не поддерживает потоковую работу нативно

• Точность пакетной обработки — Grok Voice Transcribe 2.0: 2,29% AA-WER против Whisper Large v3: 4,07% в нестриминговой таблице Artificial Analysis; при этом Turbo в независимом тестировании обычно отстаёт от полной версии Large v3 на 0,4–0,6 пункта

• Чистая английская речь — Whisper Large v3 Turbo достигает примерно 2,1% WER на LibriSpeech test-clean и около 4,2% на test-other, поэтому на речи студийного качества разрыв с передовым API сокращается почти до нуля

• Реальные аудиоданные — те же независимые бенчмарки оценивают Turbo примерно в 4,6% на деловых звонках с двумя собеседниками и в 8–12% на шумном аудио; именно здесь и открывается отрыв передовой модели.

• Пакетная пропускная способность — Grok Voice Transcribe 2.0 — примерно 162× реального времени против примерно 80× у Whisper Large v3 Turbo на одной скромной потребительской GPU, а на более быстром серверном оборудовании показатели достигают кратных этому значений

• Задержка потоковой передачи — 0,49 секунды до первого частичного результата в Grok Voice Transcribe 2.0 против 1–5 секунд для самостоятельно размещённых потоковых конвейеров Whisper, что является связующим кодом плюс VAD, а не возможностью модели.

Честное прочтение этого списка состоит в том, что аргумент в пользу оплаты, основанный на точности, реален, но условен. На чистом английском с одним говорящим и хорошей записью Whisper Large v3 Turbo достаточно близок, и разница редко меняет исход. В 8-кГц телефонии, шумном аудио колл-центра, речи с акцентом и коротких узкоспециализированных фразах — именно тех наборах, на которых SpaceXAI настраивала 2.0, где её собственные заявленные показатели изменились с 10,6% до 7,1% в телефонии и с 20,6% до 6,8% на коротких многоязычных командах — разрыв становится разницей между транскриптом, по которому можно строить маршрутизацию, и тем, который приходится читать. Это заявленные компанией цифры на аудио компании, не воспроизведённые никем за пределами SpaceXAI, и направление, на которое они указывают, согласуется с каждым независимым тестом Whisper на деградированном аудио.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo — the scoreboard': the left column gives Grok Voice Transcribe 2.0 native streaming with a 0.49s partial, 2.29% batch WER, included diarization, word timestamps with confidence scores, $0.20 per streaming hour and a vendor API data path; the right column gives Whisper Large v3 Turbo self-built chunking only, 4.07% for full v3, no diarization, no timestamps in Turbo, MIT weights where you pay compute, and a data path that stays on your own hardware.

Сравнение затрат — это не $0,10 против $0

Лицензия Whisper ничего не стоит; а вот запуск — нет. Экземпляр GPU, который вмещает модель размером 1,6 ГБ в 6 ГБ VRAM и транскрибирует примерно в 80× реального времени, — это и есть настоящая статья расходов, и при типичных тарифах на облачные GPU это оказывается в том же порядке величины, что и хостируемые API при непрерывных нагрузках, — с важным исключением: вы платите за ёмкость независимо от того, поступает ли аудио. Хостируемые эндпоинты Whisper существуют в широком диапазоне цен — от менее $1,20 за 1000 минут на дешёвом конце до нескольких долларов, — и этот разброс служит полезным напоминанием, что «Whisper» — это модель, а не уровень обслуживания. Нормализованная ценовая таблица Artificial Analysis указывает для самых дешёвых хостируемых эндпоинтов Whisper Large v3 цены $0,50 и $1,15 за 1000 минут; оба они ниже пакетного тарифа Grok Voice Transcribe 2.0 в $1,67 — но ни один из этих эндпоинтов не ваш, и оба идут с чужими лимитами скорости и политикой хранения.

Самостоятельный хостинг однозначно выигрывает на объёмах с неравномерной, пиковой нагрузкой. Медиаархив на десять тысяч часов стоит одинаково на вашей собственной GPU, обрабатываете ли вы его за неделю или за год, и пока вы решаете, никакой почасовой счётчик не тикает. У конвейера комплаенса, который ни при каких обстоятельствах не должен отправлять аудио за пределы сети, нет альтернативы с внешним хостингом ни за какую цену, потому что это требование архитектурное, а не финансовое. А дообучение доступно вам только в том случае, если веса у вас на руках: лицензия MIT на Whisper позволяет взять модель с 809 млн параметров и адаптировать её к одному диктору, одному акценту или узкому предметному словарю — возможность, которую ни один API не предоставляет ни при какой цене.

Зеркальное отражение состоит в том, что цена хостируемой модели может измениться у вас под ногами. SpaceXAI не изменила свой тариф при переходе с 1.0 на 2.0 — улучшение модели по неизменной цене — а Microsoft MAI-Transcribe-2 вышла на той же отметке $0.10 за аудиочас, что говорит о том, где проходит минимальная планка для передовых моделей. Если вы маршрутизируете запросы через OrcaRouter, эти цены из прайс-листа проходят без наценки — 0%, поэтому снижение цены поставщиком попадает в ваш счёт в тот же день, когда оно происходит, а не после цикла пересмотра цен. Это настоящее преимущество арендуемой стороны в этом сравнении, и его стоит взвесить против того факта, что бесплатная сторона вообще не присылает вам счёт.

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard showing Whisper Large v3 at 4.07% AA-WER and 118.9x real time at $1.15 per 1,000 minutes, alongside the cheaper hosted Whisper endpoints and the frontier rows for comparison.

Для чего на самом деле нужен каждый из них

Оставьте Whisper Large v3 Turbo, когда аудио уже является файлом, громкость высокая или неравномерная, записи достаточно чистые, и либо данные не могут покинуть вашу сеть, либо бюджет не может выдержать оплату за час. Он остаётся правильным выбором для офлайн-архивов, транскрипции на периферии и на устройстве, где модель на 1,6 ГБ квантуется до подходящего размера, пакетных конвейеров, где ограничением является пропускная способность, а не задержка, и любого проекта, где тонкая настройка на собственном аудио — это путь к нужной вам точности. Инструментарий вокруг него — whisper.cpp для периферии, faster-whisper для продакшена, сборки GGUF для ограниченной памяти — имеет за собой два года доработки сообществом, что является формой надёжности, которой не обладает ни один двухдневный API.

Переходите на Grok Voice Transcribe 2.0, когда аудио ещё поступает, когда качество записей снижено, когда нужно знать, кто говорил и когда, когда доменную лексику нужно задавать смещением, а не дообучением, или когда приложение действует на основе частичной расшифровки до того, как говорящий закончил. Путь обновления — это один параметр в существующей интеграции и откат к 1.0, если что-то пойдёт не так, что делает пробу дешёвой. Стоит отметить, что обратная миграция недёшева: код, написанный под потоковый API с диаризацией и определением реплик, не деградирует изящно в пакетную модель, возвращающую простой текст, и это аргумент за то, чтобы проверить хостинговый путь на фрагменте вашего реального аудио, прежде чем переводить на него конвейер.

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

Где на самом деле принимается решение

Большинство команд, использующих Whisper в любом масштабе, не выбирают между этими двумя моделями — они строят гибридную схему: Whisper для архива, потому что он бесплатный и достаточно хорош на чистом аудио; передовой API для live-контура, потому что больше ничто не стримит с 3,4% частичного WER; и третья модель ниже по цепочке, которая резюмирует, классифицирует или выполняет действия на основе любого текста, который получается на выходе. Именно на третьем шаге обычно и происходит разрастание — второй контракт с поставщиком для модели рассуждений, второй набор учётных данных, второй лимит запросов, за которым нужно следить. OrcaRouter схлопывает этот слой: один ключ для 200+ моделей, автоматическое переключение при деградации провайдера и DSL маршрутизации, если вы хотите отправить одну и ту же расшифровку через несколько моделей и сравнить, прежде чем выбрать одну. Сами вызовы транскрипции по-прежнему идут к тому поставщику, которого вы выбрали; перестаёт множиться всё, что идёт после них.

За чем стоит следить на стороне Whisper — так это не за новым чекпойнтом: семейство не менялось со времён Turbo, а внимание OpenAI переключилось на линейку GPT Transcribe. Следить нужно за слоем обслуживания. С каждым годом инструменты для самостоятельного хостинга становятся быстрее, а необходимое им оборудование — меньше, и каждое улучшение здесь сужает основания платить по часам. За чем стоит следить на стороне SpaceXAI — так это за сменой значения по умолчанию: когда 2.0 станет версией по умолчанию, а 1.0 будет объявлена устаревшей, каждая интеграция, которая никогда не указывала модель, перейдёт разом, включая задержку. Ни одна из этих разработок не меняет фундаментального разделения. Одна модель, которой вы владеете и которую настраиваете, одна модель, которую вы арендуете и вызываете, и честный ответ: большинство продакшен-стеков в итоге используют обе.