Hero-карточка статьи с надписью «Grok Voice Transcribe 2.0 против Granite Speech 5.0 470M TurboCTC», с бейджем «СРАВНЕНИЕ МОДЕЛЕЙ» и подзаголовком «пропускная способность против задержки», с чипами с надписями 12 600 RTFx, 2,7% WER потоковой передачи, 470M параметров и $0,20 за час потоковой передачи, на градиенте от белого к синему с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Grok Voice Transcribe 2.0 против Granite Speech 5.0 470M TurboCTC: 12 600× реального времени встречается с половиной секунды

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Granite Speech 5.0 470M TurboCTC расшифровывает около 3,5 часов аудио каждую секунду на одном H200, а Grok Voice Transcribe 2.0 возвращает первый частичный транскрипт через 0,49 секунды после того, как вы прекращаете говорить. Эти два числа ставят рядом в сравнительных постах так, будто это измерения одного и того же типа, хотя это совершенно не измерения одного и того же типа: одно — показатель пропускной способности пакетной обработки в дата-центре, никак не связанный с задержкой, другое — показатель задержки для модели, пропускную способность которой никто не публиковал. IBM выпустила Granite Speech 5.0 470M TurboCTC 25 августа 2026 года под Apache 2.0, полностью отказавшись от декодера языковой модели и выполняя декодирование за один неавторегрессионный проход CTC. SpaceXAI выпустила Grok Voice Transcribe 2.0 18 сентября 2026 года как управляемый API по цене $0,10 за час аудио для пакетной обработки и $0,20 за час для потоковой передачи. Обе модели отлично решают транскрипцию, закрывая противоположные половины одной и той же задачи, и выбирать между ними легче, когда перестаёшь сравнивать числа напрямую.

12 600× реального времени и слова, которые его уточняют

Показатель Granite — 12 600 RTFx, измеренный на одной NVIDIA H200 при пакетном выводе — это число IBM, объявленное на запуске и с тех пор независимо не воспроизведённое. RTFx — это отношение длительности аудио ко времени обработки, поэтому 12 600 означает примерно 3,5 часа аудио на секунду реального времени. Сама IBM формулирует это как более чем 20-кратную пропускную способность по сравнению с более ранними выпусками Granite Speech, и именно это утверждение здесь действительно важно: ускорение было достигнуто за счёт устранения работы, а не за счёт добавления оборудования.

Это не число задержки. Пакетное задание, которое обрабатывает 3,5 часа аудио в секунду, всё ещё может долго возвращать первый токен любого отдельного файла, в зависимости от того, как сформирован пакет и сколько аудио вы подаёте ему до запуска. IBM вообще не публикует показатели задержки для TurboCTC. В таблице лидеров для дальнего поля эти два чекпоинта являются двумя самыми быстрыми записями, но пропускная способность там измерялась на одном NVIDIA L4, который представляет собой ускоритель, близкий к датацентровым, а не телефон.

Это важно, потому что модель явно позиционируется для ноутбуков, телефонов и граничных устройств — по формулировке самой IBM — а никто не публиковал данные об однопоточной производительности ни для одного из них. Пока кто-нибудь этого не сделает, воспринимайте «12 600×» как утверждение о том, насколько дёшево можно переварить бэкфилл на арендованных GPU, что является действительно ценным и хорошо подтверждённым доказательствами заявлением, а не как утверждение о том, как быстро один пользователь получает в ответ одно предложение.

Что IBM убрала и во что это вам обойдётся

TurboCTC — это архитектура, состоящая только из энкодера: 16-слойный акустический энкодер Conformer, обученный с CTC, декодируемый жадным способом за один неавторегрессионный проход, с выходным подсловным слоем на 16 384 единицы. В контуре нет языковой модели. Именно отсюда берётся скорость, и именно отсюда же идут сокращения возможностей, причём немалые. По сравнению с более ранними моделями Granite Speech TurboCTC отказывается от перевода речи, отказывается от смещения по ключевым словам и не поставляется с инструментами для временных меток или пунктуации.

Сопоставьте это с тем, что включает в себя управляемая модель по её прейскурантной цене, и контуры сделки становятся конкретными:

• Смещение по ключевым терминам — Granite Speech 5.0 470M TurboCTC не поддерживает его, тогда как Grok Voice Transcribe 2.0 поддерживает до 100 ключевых терминов на запрос

• Пословные метки времени — не поставляются с TurboCTC, в отличие от включённых с оценками уверенности

• Перевод речи — присутствовал в более ранних моделях Granite Speech; здесь удалён, а не просто не предлагается ни в каком виде

• Языковое покрытие — только английский или автоматическое определение в широком многоязычном наборе входных данных с поддержкой форматирования на 25 языках

• Диаризация — отдельная задача, которую вы решаете сами, или она включена в стоимость запроса

• Каналы — один поток за проход против до восьми аудиоканалов в одном запросе

• Нормализация текста — отсутствие vs обратная нормализация текста, преобразующая произносимые даты, валюты и номера телефонов в письменную форму

• Развёртывание — веса, которые вы скачиваете и запускаете сами, против управляемой конечной точки в us-east-1

Читайте этот список как описание двух разных продуктов, а не как оценочную таблицу. Именно отказ от диаризации, смещения и нормализации дал такую пропускную способность. Пакетному заполнению поискового индекса 40 000 записями звонков не нужны отметки времени или разметка говорящих — ему нужно быть дешёвым и нужно завершиться — и для этой задачи отсутствующие функции не отсутствуют, они — удалённый вес.

Для всего, что работает в реальном времени, верно обратное. Если вы создаёте голосового агента, список ключевых терминов — это способ добиться правильного написания «Kubernetes», «Granola» и имён клиентов, а транскрибатор без механизма смещения будет ошибаться каждый раз, и исправить это можно только дообучением — а это уже другой проект с другим бюджетом. Эта единственная недостающая функция делает TurboCTC непригодным для одних рабочих нагрузок и не имеет значения для других, поэтому сравнение моделей менее полезно, чем сравнение рабочих нагрузок.

Screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 licence tag, the English and automatic-speech-recognition tags, a model summary describing a 470 million parameter conformer acoustic encoder trained with CTC on 60,000 hours of English audio and decoded non-autoregressively, and a bar chart of Open ASR leaderboard WER by test set — LS Clean 1.42, LS Other 2.66, SPGISpeech 3.18, Voxpopuli-Cleaned-AA 4.88, Earnings22-Cleaned-AA-chunked 6.69, AMI-Cleaned 7.52 and Gigaspeech-Cleaned 8.67 — with an average WER of 5.00% and an average RTFx of 13,042.98 measured on one H200.

Сравнение точности, которое невозможно провести чисто

IBM сообщает о совокупной частоте ошибок в словах 5,00% для чекпойнта Apache 2.0 и 4,85% для некоммерческого аналога в Open ASR Leaderboard на публичных англоязычных наборах короткой речи. Это пакетные показатели на лидерборде, в оценки которого входят AMI и Earnings22, а также длинные разговорные наборы, и они заявлены производителем — прогнаны через инструментарий лидерборда, но пока не внесены в официальную таблицу, которая также включает закрытые тестовые наборы. Опубликованная разбивка по наборам на карточке модели заслуживает прочтения, потому что среднее значение многое скрывает: LS Clean — 1,42%, LS Other — 2,66%, SPGISpeech — 3,18%, Voxpopuli-Cleaned-AA — 4,88%, Earnings22-Cleaned-AA-chunked — 6,69%, AMI-Cleaned — 7,52% и Gigaspeech-Cleaned — 8,67%, что в среднем составляет ровно 5,00%. Та же карточка приводит средний RTFx 13 042,98, измеренный на одном H200, — выше, чем показатель 12 600, использованный в публикации IBM о запуске, и оба числа принадлежат компании, относятся к одной и той же неделе и одному и тому же оборудованию.

Показатель 2,7% для итогового транскрипта Grok Voice Transcribe 2.0 не является сопоставимым измерением. Он взят из таблицы AA-WER Streaming от Artificial Analysis — взвешенной композитной оценки из AA-AgentTalk с весом 50%, VoxPopuli с весом 25% и Earnings22 с весом 25%, построенной примерно на восьми часах англоязычного разговорного аудио с агентным взвешиванием, измеренного через потоковый интерфейс. Другие наборы, другое взвешивание, другой режим работы. Поставить 2,7% рядом с 5,00% и заключить, что управляемая модель примерно вдвое точнее, — это самая распространённая ошибка, которую можно допустить в этом сравнении.

То, что можно честно сказать, оказывается более узким, но всё равно полезным. Обе модели сильны на том аудио, на котором измерялась каждая из них. Grok Voice Transcribe 2.0 возглавляет независимо проводимый стриминговый лидерборд, на котором измеряются и другие модели, что делает его рейтинг проверяемым, даже если его точное значение не переносимо. Granite Speech 5.0 470M TurboCTC имеет агрегированный WER на стандартных открытых наборах ASR и, отдельно, результат для дальнего поля, где некоммерческий чекпойнт занимает пятое место по точности, а Apache-версия — девятое, — измеренный на шумной и реверберирующей речи, что является самым сложным условием в наборе и, пожалуй, самым честным показателем в цифрах любой из моделей.

Если ваше аудио — это чистая английская речь, прочитанная вслух, разрыв в точности между этими двумя, вероятно, меньше, чем можно предположить по позициям в таблице лидеров. Если оно шумное, с акцентом, телефонное или не на английском, ни одна из таблиц мало что вам скажет, и единственный инструмент, который это делает, — ваш собственный тестовый набор.

Свободные веса против 1,67 доллара в час

Сравнение затрат — это единственное место, где эти две модели действительно легко различить, и цифра, которую обычно приводят люди, ошибочна в обоих направлениях.

• Пакетная транскрибация — Grok Voice Transcribe 2.0 по цене $0,10 за час аудио, или около $1,67 за 1 000 минут, против Granite Speech 5.0 470M TurboCTC без затрат на лицензию, плюс время GPU

• Стриминг — $0,20 за час аудио, около $3,33 за 1 000 минут против отсутствия опубликованного IBM пути для хостингового стриминга

• Лицензия — коммерческий API без весов против Apache 2.0 для основного чекпоинта и CC-BY-NC-SA-4.0 для более точной некоммерческой версии

«Бесплатно» делает много работы в первой строке. Модель только с энкодером на 470M достаточно мала, чтобы работать на скромном железе, — в этом и смысл дизайна, и причина, по которой IBM обучила её за десять дней на восьми H100 и выпустила с поддержкой `transformers>=5.16.0` и демо на WebGPU, — но кто-то всё равно платит за GPU, стек обслуживания, автомасштабирование, повторные попытки и дежурства. При малых объёмах управляемое решение обычно дешевле, чем инженерное время. При больших стабильных объёмах выигрывает путь арендованного железа, а точка перехода зависит от вашей загрузки, а не от объёма аудио: GPU, который постоянно загружен, дешёв в час, а тот, который держат прогретым для пикового трафика, — нет.

Об одной лицензионной детали стоит сказать особо, прежде чем кто-либо начнёт строить вокруг неё архитектуру. Более точная из двух контрольных точек — та, что показывает 4,85% WER, — является некоммерческой и выпущена под CC-BY-NC-SA-4.0. Контрольная точка под Apache 2.0 — это та, что показывает 5,00%, и именно её можно поставлять в составе продукта. Это разница в точности в 0,15 пункта, которая является платой за право вообще использовать модель; это также означает, что любое сравнение, в котором для «Granite Speech 5.0» указывается 4,85%, а затем обсуждается коммерческое развёртывание, ссылается не на ту контрольную точку.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: release September 18 2026, final WER 2.7% streaming, first partial 0.49s, 100 key terms included, diarization included, $0.20 per streaming hour. The right column gives Granite Speech 5.0 470M TurboCTC the rows: release August 25 2026, mean WER 5.00% Apache, speed 12,600 RTFx batched, no key terms, timestamps not shipped, Apache-2.0 weights where you pay compute. A footer reads 'Granite figures IBM-reported; Grok figures per Artificial Analysis.'

Решающее правило

Три вопроса разделяют эти две модели быстрее, чем любая таблица бенчмарков.

Транскрипт используется в реальном времени, пока говорящий ещё говорит? Если да, TurboCTC не подходит — не потому, что он медленный, а потому, что у него нет потокового интерфейса и частичного вывода, а частичный транскрипт — это иное архитектурное решение, чем быстрое пакетное декодирование. Если нет, преимущество в пропускной способности становится главным, и модель IBM очень трудно превзойти по стоимости за час обработанного аудио.

Нужна ли для работы предметная лексика? Если да, модель с биасингом выигрывает по умолчанию, а отсутствие биасинга по ключевым терминам в TurboCTC — это дисквалифицирующий недостаток, а не просто неудобство. Если нет, вы платите за функцию, которую не будете использовать на стороне управляемого решения.

Это аудио — английская начитанная речь на приличном оборудовании? Если да, оба варианта сильны, и выбор касается эксплуатации. Если нет, обе платы неинформативны, и важна только ваша собственная оценка.

Как бы там ни обернулось, операционный слой — это то место, где такое решение становится дешёвым. OrcaRouter объединяет более 200 моделей за одним ключом, совместимым с OpenAI, с автоматическим переключением между провайдерами при сбоях, так что неудачный день у управляемой конечной точки распознавания речи в одном регионе перестаёт быть вашим простоем, а прайс-лист провайдеров транслируется без наценки — 0%. Это значит, что изменение цен поставщиком или новый чекпоинт появляются у нас в тот же день. Для задачи, где правильный ответ действительно неочевиден, это снимает цену ошибки: прогоните оба варианта на своих собственных аудиозаписях через одну конечную точку, оставьте победителя и меняйте строку модели, когда выйдет следующая.

Screenshot of the SpaceXAI Speech to Text API documentation page showing the Quick Start section with a Python example posting an audio file to https://api.x.ai/v1/stt with the model parameter set to grok-voice-transcribe-2.0, alongside the API console navigation and an on-this-page index listing Supported Audio Formats, Limits, Streaming Speech-to-Text and Smart Turn.

Если коротко: Granite Speech 5.0 470M TurboCTC лучше отвечает на запрос «дёшево транскрибировать всё, что мы когда-либо записывали, на оборудовании, которое мы контролируем», а Grok Voice Transcribe 2.0 лучше отвечает на запрос «транскрибировать это в реальном времени, точно и без того, чтобы мы сами запускали серверный стек». Ключевые показатели — 12 600× и 0,49 секунды — оба верны, и ни один из них не является доказательством относительно другого.