Карточка-герой статьи с заголовком «Grok Voice Transcribe 2.0 против NVIDIA Parakeet TDT 0.6B», значком «СРАВНЕНИЕ МОДЕЛЕЙ» и подзаголовком «две таблицы лидеров, одно вводящее в заблуждение сравнение», с чипами: 2,7% потокового WER, 6,32% среднее Open ASR, 600 млн параметров под лицензией CC-BY-4.0 и $0,10 за час пакетной обработки, поверх градиента от белого к синему с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B: две таблицы лидеров, одно вводящее в заблуждение сравнение

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

NVIDIA Parakeet TDT 0.6B — это трансдьюсер FastConformer-TDT с 600 миллионами параметров, выпущенный 14 августа 2025 года под лицензией CC-BY-4.0, и уже более года он остаётся рекомендацией по умолчанию для всех, кто хочет самостоятельно запускать транскрибацию. Grok Voice Transcribe 2.0 — это управляемая модель преобразования речи в текст от SpaceXAI, выпущенная 18 сентября 2026 года по цене $0,10 за час аудио при пакетной обработке и $0,20 за час при потоковой, с итоговым WER 2,7% в потоковом рейтинге Artificial Analysis. Если поискать сравнение между ними, вы найдёте, что Parakeet указывается с WER 13,7%, а Grok Voice Transcribe 2.0 — с 2,7%, из-за чего управляемая модель выглядит в пять раз точнее, и это действительно вводит в заблуждение при чтении. Эти два числа взяты из разных индексов Artificial Analysis, построены на разных наборах данных, опубликованы с разницей в годы, и одно из них было заменено более новыми измерениями самого вендора. Настоящее сравнение интереснее, и оно о том, что дают 600 мегабайт весов, чего не может API.

Число 13,7%, и почему вам не стоит его использовать

Отчёт Artificial Analysis «State of AI» за III квартал 2025 года поставил NVIDIA Parakeet TDT на третье место в своём индексе AA-WER с показателем 13,7%, позади Google Chirp 2 с 11,6% и собственного Canary Qwen от NVIDIA с 13,2%. Этот индекс представлял собой средневзвешенное по длительности аудио значение, рассчитанное примерно по двум часам каждого из наборов VoxPopuli, Earnings-22 и AMI-SDM — реальная речь с разнообразными акцентами, лексикой предметной области и сложными условиями канала, поэтому все показатели в нём высоки. WER 13,7% на AMI-SDM, который представляет собой аудио встреч, записанное в дальнем поле в помещениях с реверберацией, — это не плохой результат; это сложный тест.

Этот индекс больше не существует в таком виде. Artificial Analysis перестроила его как AA-WER v2, взвесив AA-AgentTalk на 50% вместе с VoxPopuli-Cleaned-AA и Earnings22-Cleaned-AA по 25% каждый, примерно восемь часов аудио, и очистка и перевзвешивание существенно изменили показатели каждой модели. В текущей таблице нестриминговых моделей Parakeet TDT 0.6B V3 находится в диапазоне низких однозначных чисел — в том же диапазоне, что и другие лидеры среди открытых моделей — а не где-то около 13,7%, и верхняя часть таблицы опустилась примерно до 2%. Все, кто всё ещё цитирует 13,7% для Parakeet, цитируют устаревшее измерение, и если они сравнивают его с показателем стриминга 2026 года, они также сравнивают две разные таблицы.

То, что можно честно поставить рядом, — гораздо уже. Собственная оценка NVIDIA на Open ASR Leaderboard — стандартные публичные англоязычные короткие наборы, прогнанные через инструментарий этого лидерборда — сообщает средний WER 6,32% для Parakeet TDT 0.6B V3 при RTFx 3 332,74 и средний 6,05% для англоязычной v2. Показатель 2,7% у Grok Voice Transcribe 2.0 — это цифра финальной расшифровки на стриминговом лидерборде, измеренная после окончания речи, на агентно-взвешенном англоязычном разговорном аудио. Другие наборы, другой лидерборд, другой режим. Управляемая модель, весьма вероятно, точнее на аудио, которое присутствует в обоих лидербордах; но размер этого преимущества не 5×, и никто не опубликовал измерение, которое позволило бы окончательно решить этот вопрос.

Какую форму на самом деле имеют эти две модели

Архитектурное различие объясняет большую часть практической разницы. Parakeet TDT 0.6B — это энкодер FastConformer с трансдьюсерным декодером типа «токен и длительность»: он предсказывает и токен, и то, на сколько кадров следует продвинуться, что позволяет ему пропускать, а не выдавать пустые метки, и это главный источник его эффективности. Он поставляется с автоматическим определением языка для 25 европейских языков, временными метками на уровне слов и сегментов, пунктуацией и регистром, а также обрабатывает длинные аудиозаписи — до 24 минут при полном внимании или около трёх часов при локальном внимании. Он доступен через NeMo 2.2, имеет MLX-реализацию для Apple Silicon, а также существуют сборки ONNX INT8, работающие на обычных CPU.

Grok Voice Transcribe 2.0 — это управляемый сервис, поэтому сравнение идёт между моделью и продуктом. Что входит в продукт по его прейскурантной цене:

• Потоковая передача — Grok Voice Transcribe 2.0 нативно через WebSocket, первый частичный результат через 0,49 секунды против чанковых или буферизованных подходов Parakeet TDT 0.6B, без полноценного интерфейса частичных транскриптов

• Смещение ключевых терминов — до 100 ключевых терминов на запрос, в отличие от Parakeet, где такая функция отсутствует

• Диаризация — включена в цену запроса, а не отдельная система, которую вы добавляете самостоятельно.

• Каналы — до восьми аудиоканалов в одном запросе против одного потока за проход

• Обратная нормализация текста — включена для 25 языков, а не только пунктуация и заглавные буквы

• Развёртывание — управляемая конечная точка в us-east-1 в отличие от весов, которые вы скачиваете, запускаете и эксплуатируете где угодно

• Лицензия — коммерческие условия API в сравнении с CC-BY-4.0 с указанием авторства

• Размер модели — не раскрыт против примерно 600 млн параметров, около 2,4 ГБ в fp32 или 1,2 ГБ в fp16

Последняя строка — та, что решает судьбу многих развертываний. Parakeet TDT 0.6B умещается в пару гигабайт, приемлемо работает на CPU ноутбука через путь INT8 ONNX и комфортно помещается на любом потребительском GPU. Это не уменьшенная версия того, что делает API, — это другая возможность, потому что это разница между функцией транскрипции, которая работает офлайн, на устройстве, без сети и без почасовой оплаты, и той, которая не работает.

Screenshot of the Hugging Face model page for nvidia/parakeet-tdt-0.6b-v2, showing the CC-BY-4.0 licence tag, the English language tag, the FastConformer-TDT architecture and 0.6B parameter fields, a callout reading 'NEW: Multilingual Parakeet TDT 0.6B V3 is now available! 25 European Languages', a description stating an RTFx of 3380 on the HF-Open-ASR leaderboard at batch size 128 with transcription of segments up to 24 minutes in a single pass, and a notice that no inference provider deploys it.

Арифметика затрат, которую никто не считает правильно

Публикуемое сравнение — «$0,10 в час против бесплатно», и оно ошибочно в обе стороны — API — не единственное, за что вы платите, а веса — не единственное, на чём вы экономите.

• Пакетная транскрипция — Grok Voice Transcribe 2.0 по цене $0,10 за час аудио, около $1,67 за 1 000 минут, против Parakeet TDT 0.6B без лицензионной платы плюс время работы GPU или CPU

• Стриминг — $0,20 за час аудио, около $3,33 за 1 000 минут, в отличие от размещения на собственных серверах, где ограничением служит ваш собственный потолок одновременных запросов, а не опубликованный тариф.

• Ограничения сервиса — 10 запросов в секунду и 100 одновременных сессий стриминга на команду против того, что позволяет ваше оборудование, без ограничения частоты запросов и без ограничения на одновременные сессии

• Стоимость, которой нет ни на одном из двух листов, — ни инженерные работы, ни стек обслуживания, ни автомасштабирование против графика дежурств, ни логика повторных попыток, ни обновления моделей, ни GPU, который вы держите разогретым для пиковой нагрузки.

При малых объёмах управляемая сторона почти всегда дешевле, потому что фиксированная стоимость варианта с собственным хостингом — это человек. При больших стабильных объёмах вариант с собственным хостингом решительно выигрывает, и точка перехода зависит от загрузки, а не от объёма аудио: GPU, который вы держите занятым, очень дёшев в расчёте на час аудио, а тот, который вы держите разогретым для пикового трафика, — нет. Команда, обрабатывающая 20 000 часов в месяц, платит $2 000 за управляемый пакетный путь и примерно один GPU-месяц среднего класса плюс инженерное время за вариант с собственным хостингом, и это даже не близко.

Причина, по которой расчёты оказываются ошибочными, в том, что сторону self-hosted обычно сравнивают по нулевой стоимости, а сторону managed — обычно по прайс-листу. Ни одно из этих значений не является реальным числом. Реально же то, что 3 332 RTFx модели Parakeet TDT 0.6B — показатель NVIDIA, полученный в пакетном режиме на оборудовании дата-центра, и его следует рассматривать как верхнюю границу, а не как обещание, — означает, что одна скромная GPU может обработать больше аудио, чем производит большинство организаций.

Когда Parakeet перестаёт быть правильным ответом

Три вещи заставляют команду уйти от открытой модели к управляемой, и ни одна из них не связана с точностью.

Первое — это смещение в пользу ключевых терминов. Если ваши транскрипты полны названий продуктов, фамилий, тикеров или отраслевого жаргона, модель без механизма смещения будет ошибаться в них, и исправить это можно будет только тонкой настройкой. Grok Voice Transcribe 2.0 принимает до 100 ключевых терминов на запрос. Parakeet TDT 0.6B не имеет этой функции. Для контакт-центров, здравоохранения и юридической работы этот единственный пробел дисквалифицирует решение, что бы ни говорил любой рейтинг.

Второе — диаризация. Parakeet выдаёт слова с временными метками; он не сообщает, кто их произнёс. Транскрипция с несколькими говорящими означает запуск отдельной модели диаризации и выравнивание результата — это уже целый проект, а не параметр конфигурации. Управляемая модель возвращает текст с атрибуцией говорящих в том же запросе.

Третий — это сам потоковый интерфейс. Parakeet достаточно быстр, чтобы на его основе строили системы реального времени — нарезали аудио на фрагменты, прогоняли модель по каждому фрагменту, сшивали вывод, — но поведение частичных транскриптов, определение конца реплики и семантика фиксации — всё это то, что вы пишете и поддерживаете сами. Grok Voice Transcribe 2.0 возвращает первый частичный результат через 0,49 секунды после того, как вы закончили говорить, — и это уже продуктовая функция.

Есть ещё одна деталь лицензирования, которая иногда удивляет команды: Parakeet TDT 0.6B V3 распространяется по CC-BY-4.0, что разрешает коммерческое использование, но требует указания авторства, а некоторые речевые модели NVIDIA с тех пор перешли на собственную Open Model License вендора. Если указание авторства является проблемой для вашего продукта, читайте карточку конкретного чекпойнта, а не предполагайте, что применяются условия всего семейства.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7% streaming, first partial 0.49s, diarization included, 100 key terms included, $0.10 per batch hour, managed in us-east-1. The right column gives NVIDIA Parakeet TDT 0.6B the rows: mean WER 6.32% Open ASR, speed 3,332 RTFx batched, diarization not included, no key-term biasing, CC-BY-4.0 weights where you pay compute, 600M params self-hosted anywhere. A footer reads 'Parakeet figures NVIDIA-reported on the Open ASR Leaderboard; Grok figures per Artificial Analysis.'

Почему API обычно всё равно выигрывает, и когда не должен

За последний год закономерность была устойчивой: команды начинают с открытой модели вроде Parakeet TDT 0.6B, потому что она бесплатна и контролируема, выпускают функцию, а затем обнаруживают, что текущие затраты — это не GPU, а обслуживание, и переходят на управляемую конечную точку. Обратная миграция тоже происходит, обычно когда объём превышает порог, при котором почасовая плата начинает выглядеть как аренда того, чем вы могли бы владеть.

Оба направления дорого выполнять, если модель напрямую встроена в ваше приложение, — что и является аргументом в пользу того, чтобы место вызова оставалось максимально простым. OrcaRouter открывает доступ более чем к 200 моделям через единый ключ, совместимый с OpenAI, с автоматическим переключением при сбое между провайдерами и 0% наценки к цене провайдера по прайс-листу, поэтому развёртывание на собственных серверах и управляемое развёртывание могут находиться за одним и тем же интерфейсом и переключаться одной строкой с названием модели. В области речи это важнее, чем обычно: лидер в лидерборде меняется каждые несколько недель, а управляемый сервис в одном регионе — это сбой в одном регионе; именно механизм переключения при сбое не даёт функции транскрипции превратиться в сбой транскрипции.

Для команд, которым нужна пропускная способность открытой модели без стека обслуживания, так же выглядит и решение: протестируйте Parakeet TDT 0.6B на своём аудио, протестируйте Grok Voice Transcribe 2.0 на том же аудио и позвольте победителю оставить трафик себе, пока вам становится всё равно, чей логотип вендора на нём.

Screenshot of the Artificial Analysis Speech to Text AI Model and Provider Leaderboard with the Non-streaming filter selected, showing the WER Index (Non-streaming), Speed Factor and Price highlight cards, the 'See Streaming Benchmarks' toggle, and the Artificial Analysis Word Error Rate Index (Non-streaming) chart with Parakeet TDT 0.6B V3 appearing among the ranked model bars.

Если нужна версия в одну строку: Parakeet TDT 0.6B по-прежнему лучший ответ на «транскрибируй что угодно, где угодно, без почасовой оплаты, на оборудовании, которое у меня уже есть», а Grok Voice Transcribe 2.0 — ответ на «транскрибируй точно, с метками говорящих и моим собственным словарём, ничего не запуская». Цифра 13,7%, из-за которой разрыв кажется огромным, — это устаревшее измерение, а честный разрыв — где-то между одним и тремя пунктами WER на перекрывающемся аудио — достаточно мал, чтобы решение определял операционный вопрос.