Главная титульная карточка для Granite Speech 5.0 470M TurboCTC: значок речевой волны, бейдж с надписью «12,600 RTFx на одной H200», подписи «470M параметров», «Encoder-only CTC» и «Apache 2.0», подзаголовок «Английская ASR от IBM под лицензией Apache-2.0», нижний колонтитул «Выпущено 25 августа 2026 г.» и логотип OrcaRouter в правом нижнем углу.
Guides & Insights

Granite Speech 5.0 470M TurboCTC: ASR от IBM под лицензией Apache-2.0 заявляет 12 600 RTFx

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Granite Speech 5.0 470M TurboCTC — это модель из нового речевого релиза IBM, которую вам действительно разрешено использовать в продакшене, и это первое, что о ней нужно знать. 25 августа 2026 года IBM разместила на Hugging Face две контрольные точки для распознавания английской речи — Granite Speech 5.0 470M TurboCTC под лицензией Apache 2.0 и Granite Speech 5.0 470M TurboCTC-NC под некоммерческой лицензией CC-BY-NC-SA-4.0. Та же архитектура на 470 миллионов параметров, другие данные, противоположное лицензирование. Модель Apache — та, которую IBM указывает для «прочих сценариев использования», то есть для коммерческого продакшена на языке вендоров, — и именно она несёт ключевую цифру: IBM заявляет совокупную пропускную способность выше 12 600 RTFx на одном NVIDIA H200, что, по её расчётам, соответствует транскрибации более трёх с половиной часов английского аудио в секунду при пакетном инференсе.

Этот показатель скорости — заявление вендора суточной давности, не воспроизведённое ни одной третьей стороной, так что читайте его как сильную «бумажную» цифру, а не как подтверждённый факт. Тем не менее он заслуживает вашего внимания из-за архитектуры, стоящей за ним: Granite Speech 5.0 TurboCTC отказывается от декодера языковой модели, который использовался во всех предыдущих моделях Granite Speech, оставляя чистый Conformer-энкодер, обученный с помощью коннекционистской темпоральной классификации (CTC) и декодируемый неавторегрессивно. Именно отсутствие цикла генерации токен за токеном позволяет модели с 470 млн параметров заявлять пропускную способность, превосходящую модели в несколько раз большего размера, — и именно поэтому этот релиз важен для всех, кто создаёт системы распознавания речи, а не только для таблицы бенчмарков.

Что на самом деле было выпущено

Две контрольные точки, обе выпущены 25 августа 2026 года в организации ibm-granite на Hugging Face, обе — англоязычные ASR-модели с одинаковой архитектурой на основе только энкодера:

• Granite Speech 5.0 470M TurboCTC — Apache 2.0, коммерческое использование разрешено, обучена на примерно 60 000 часов английских аудиозаписей.

• Granite Speech 5.0 470M TurboCTC-NC — CC-BY-NC-SA-4.0, только для исследовательских и некоммерческих целей, обучена примерно на 75 000 часов англоязычного аудио.

Эта статья посвящена модели Apache — той, на которую продукт может законно полагаться, — с упоминанием варианта -NC там, где этого требует история лицензирования. Обе контрольные точки поставляются в формате safetensors в F32 и BF16, и обе имеют нативную поддержку в Hugging Face Transformers через AutoModelForCTC и AutoProcessor. Эта функция появится в следующем выпуске Transformers; до тех пор вы устанавливаете Transformers из исходников, загружаете процессор и модель и запускаете жадное декодирование. IBM также ссылается на браузерную WebGPU-демонстрацию потоковой передачи, которая является самым быстрым способом услышать, насколько низкой на самом деле является задержка.

Ставка на архитектуру: энкодер без декодера, 12,5 токенов в секунду

Изменение архитектуры — вот что стоит за заявлением о скорости. В более ранних версиях Granite Speech акустический энкодер сочетался с проектором и декодером языковой модели, и именно этот декодер был исключён. Granite Speech 5.0 470M TurboCTC — это 16-слойный энкодер Conformer, обученный с помощью CTC, а инференс представляет собой один неавторегрессивный жадный проход. Сэмплировать нечего, поэтому не нужно ждать задержки генерации.

Три детали конфигурации делают его быстрым, а не просто компактным:

• Временное прореживание в 8 раз. Фронтенд работает со скоростью 100 кадров в секунду; модель выдаёт 12,5 токена в секунду. Объединение и пропуск log-mel кадров, а затем свёртки с шагом и объединённые остаточные связи в первых двух блоках Conformer снижают выходную частоту в три этапа по 2 раза.

• Субсловный словарь вместо символов. Более ранние кодировщики Granite Speech выдавали 50 символов в секунду; версия 5.0 выдаёт 12,5 субсловных токенов в секунду из словаря BPE на 16 384 единицы (SentencePiece в варианте -NC). Меньшее количество выходных единиц в секунду аудио означает, что CTC-декодеру нужно принимать меньше решений.

• Самообусловленный CTC. Средний слой Conformer уточняет собственные промежуточные представления модели, что является приёмом, позволяющим небольшому энкодеру сохранять точность при отсутствии декодера.

Всё это есть в карточке модели и техническом описании IBM. В итоге получается контрольная точка, созданная для ноутбуков, телефонов и потоковых конвейеров, где не поместился бы тяжеловесный авторегрессионный декодер, — позиционирование на периферии явно указано в собственном описании IBM.

Заявляемые IBM цифры

Всё в этом разделе представлено IBM, прогнано через публичный конвейер лидерборда Open ASR на инфраструктуре Hugging Face по состоянию на 25 августа 2026 года и не воспроизводилось независимо. Относитесь к этим цифрам как к данным вендора, которые выглядят правдоподобно, но не являются установленной истиной:

• Пропускная способность — более 12 600 RTFx на одном NVIDIA H200 при пакетном инференсе, что IBM переводит как более 3,5 часов аудио в секунду. IBM добавляет, что это более чем в 20 раз превышает пропускную способность более ранних моделей Granite Speech. Это показатель для датацентровых GPU при пакетном инференсе, а не то, что вы получите на ноутбуке.

• Точность — совокупный показатель ошибок в словах 5,00% для модели Apache на общедоступных англоязычных наборах коротких тестов лидерборда Open ASR (вариант -NC набирает 4,85% на тех же наборах). Инференс выполнялся через инфраструктуру заданий Hugging Face и оценивался с помощью инструментария лидерборда, поэтому IBM ожидает, что результаты совпадут с официальной таблицей, когда новые модели будут в неё включены.

• Дальнее поле — в таблице лидеров FFASR для шумной и реверберирующей речи модель Apache занимает девятое место по точности, а модель -NC — пятое; обе являются самыми быстрыми участниками этой таблицы (пропускная способность измерена на одном NVIDIA L4).

• Обучение — примерно 60 000 часов публичного англоязычного аудио для модели Apache {{1}}, выполненное за десять дней на восьми NVIDIA H100 в кластере Blue Vela от IBM.{{/1}}

A generated single-column scoreboard titled 'Granite Speech 5.0 470M TurboCTC — the scoreboard' with rows reading Release Aug 25 2026, License Apache 2.0, Params 470M, Speed 12,600 RTFx (1 H200), WER 5.00% Open ASR, FFASR rank 9 fastest on board, and a footer reading 'IBM-reported as of Aug 25 2026; not yet independently reproduced.'

Что на самом деле даёт вам Apache 2.0

Именно лицензия делает этот релиз необычным. Речевые модели с открытыми весами обычно выходят под исследовательскими лицензиями или с обязательствами, от которых морщится юридический отдел продакшн-команды; здесь же коммерчески применимый двойник — тот, что IBM оценил чуть ниже по точности. Вы меняете 0,15 пункта совокупного WER (5,00% против 4,85%) на право развернуть модель в продукте, монетизировать результаты её работы, дообучать её и оставлять производные веса себе, а также использовать её в облачной инфраструктуре без мешающей оговорки об исследовательском использовании.

Этот выбор легко сделать в неверном направлении, если гнаться за таблицей лидеров. Показатель 4,85% у модели -NC обусловлен примерно 15 000 дополнительных часов обучающих данных (GigaSpeech и SPGI Speech), и это та версия, которую IBM буквально помечает как «только для исследовательских и некоммерческих целей». Это отличная модель для бенчмарков, но плохая зависимость для продукта. Модель Apache теряет немного точности, но обретает способность быть основой коммерческого конвейера транскрипции, системы контроля качества колл-центра или периферийного устройства. Если вы оцениваете это семейство, решение о лицензировании имеет приоритет над решением о бенчмарках.

A screenshot of the Hugging Face model page for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 license tag, the automatic-speech-recognition and English pipeline tags, a model card summary describing a compact 470 million parameter English ASR model trained on approximately 60,000 hours of English audio using CTC with non-autoregressive greedy decoding, and an Open ASR leaderboard evaluation line dated August 25 2026.

От чего вы отказываетесь

Отказ от языковой модели не бесплатен, и карточка модели честно говорит о сокращениях:

• Нет перевода речи. Более ранние поколения Granite Speech могли пропускать текст через языковую модель для перевода по мере транскрибирования; 5.0 — только транскрипция.

• Без смещения ключевых слов. Языковая модель также отвечала за смещение в сторону доменных терминов и имён; без неё вы получаете то, что естественным образом даёт подсловный словарь.

• Только английский. В этом релизе нет мультиязычного чекпойнта, и нет никаких признаков того, что он появится в ближайшее время.

Показатель WER 5.00% — это цифра для коротких фраз с чистым звуком. Результат FFASR (девятое место на шумной речи дальнего поля) — более реалистичный индикатор для переговорных комнат и использования без помощи рук, и это ранг, а не итоговый показатель.

Для узкой задачи транскрибации — аудио звонков, совещаний, голосовых заметок, субтитров, диктовки — ничто из этого не является помехой. Они имеют значение, если вы надеялись, что одна небольшая модель также будет переводить или надёжно транскрибировать пользовательский словарь сразу из коробки.

Как запустить это сегодня

Вам не нужен облачный API, которого ещё не существует. Модель работает локально:

• Установите Transformers из исходного кода (набор функций CTC ещё не включён в последний релиз), затем AutoModelForCTC вместе с AutoProcessor и жадное декодирование — стандартный конвейер. Процессор может вычислять log-mel признаки на устройстве модели, избавляя от копирования с хоста на устройство.

• Пример карточки модели — это двухстрочный код через pipeline: automatic-speech-recognition с моделью "ibm-granite/granite-speech-5.0-470m-turboctc".

• Потоковое демо WebGPU запускается во вкладке браузера и является самым быстрым способом оценить задержку, прежде чем потратить полдня на бенчмарк-стенд.

• Для продакшена практический вопрос — это инференс. Открытые ASR-модели этого класса обычно запускаются на CPU или небольшом GPU с чем-то вроде пакетного потокового инференса: заголовок про 12 600 RTFx — это пакетный показатель для H200; реалистичный показатель для однопоточного режима на ноутбуке будет гораздо ниже, и IBM не публиковала данные о времени до первого токена.

Именно в serving-слое сосредоточены реальные затраты и сложность открытых ASR-систем, и именно здесь платформа маршрутизации оправдывает своё существование. Модель OrcaRouter — один API для более чем 200 моделей с передачей цен провайдера без наценки (0% маржи), так что когда вендор снижает цену, снижение вступает в силу в тот же день, — плюс автоматическое переключение между провайдерами и DSL для маршрутизации, позволяющий объединять несколько моделей в один вызов. Ничто из этого не относится конкретно к Granite Speech 5.0 470M TurboCTC, потому что ни один из вариантов пока не представлен в OrcaRouter: веса появились всего день назад, и ни один коммерческий провайдер их не обслуживает. Когда такая открытая речевая модель получит хостинговое решение — или когда вы сравниваете её с уже существующими хостинговыми ASR API — маршрутизирующий слой позволяет опробовать её и откатиться без переписывания интеграции, а сквозное ценообразование обеспечивает честность сравнения.

Что ещё не подтверждено

У однодневной модели короткая документальная история, и стоит перечислить точно, что ещё неизвестно:

• Никакого стороннего бенчмарка. Показатели 12 600 RTFx, 5,00% WER и рейтинги FFASR — это собственные прогоны IBM через публичную платформу лидерборда. Никто независимый не публиковал цифр.

• Нет API, размещённого на стороне IBM. Нет страницы модели watsonx, нет управляемого эндпоинта, нет цен и нет даты, когда что-либо из этого появится.

• Нет показателей задержки стриминга. Поддержка стриминга и демо WebGPU существуют; а показателей времени до первого токена и задержки чанков — нет.

• Нет сравнения в одинаковых условиях с другими быстрыми открытыми ASR-моделями. Ключевые сопоставления — с Whisper large-v3, NVIDIA Parakeet TDT 0.6B и облачными API транскрипции — ещё никто не проводил на идентичных данных.

Что посмотреть дальше

Ближайшие сигналы — это независимые воспроизведения. Лидерборд Open ASR публичен, харнесс стандартный, а веса выложены на Hugging Face, так что сторонний прогон должен появиться в течение нескольких дней — следите, удержится ли 5.00% и переживёт ли 12 600 RTFx запуск на одном H200 вне собственной пакетной среды IBM. Другой момент, за которым стоит наблюдать, — превратит ли IBM Apache-близнеца в управляемый сервис, поскольку эндпоинт watsonx мгновенно сделал бы её открытой ASR с наиболее убедительным коммерческим путём. Granite Speech 5.0 470M TurboCTC — это с первого дня по-настоящему быстрая, по-настоящему пермиссивная английская ASR с по-настоящему скудной историей верификации. Первые два — реальны; третье — дело времени.

A generated infographic titled '3.5 hours of audio in 1 second' showing an H200 GPU card, an audio stack and a finished transcript connected by arrows, with tags reading over 12,600 RTFx, batched inference, Apache 2.0, and IBM-reported Aug 25 2026, and the OrcaRouter logo in the bottom-right corner.
© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube