Сгенерированная hero-карточка с заголовком «VibeVoice-ASR-Streaming-1.5B против Granite Speech 5.0 470M TurboCTC: два тихих стриминговых кандидата с открытыми весами», подзаголовком «Две стриминговые ASR-модели с открытыми весами, выпущенные с разницей в восемь дней», и двумя карточками моделей — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 сентября 2026 · MIT · ~3B всего · речевая LLM) и Granite Speech 5.0 470M TurboCTC (IBM · 25 августа 2026 · Apache-2.0 · 470M · чистый CTC-энкодер) — и тегами «Скорость уровня edge-устройств (IBM)», «Только английский (IBM)» и «Кто что сказал на 10 языках (Microsoft, непроверено)». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B против Granite Speech 5.0 470M TurboCTC: два незаметных стриминговых претендента с открытыми весами

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Два самых интересных релиза потоковых моделей преобразования речи в текст с открытыми весами конца августа 2026 года вышли без презентации. 25 августа IBM разместила на Hugging Face модель Granite Speech 5.0 470M TurboCTC — веса, карточку модели и пост в блоге, ничего больше — а 2 сентября Microsoft Research загрузила в неймспейс microsoft модель VibeVoice-ASR-Streaming-1.5B, не сделав вообще никакого анонса, кроме строки в новостном разделе репозитория VibeVoice на GitHub. Это вещи одного рода и противоположные инженерные ставки: модель IBM — чистый CTC-энкодер с 470 миллионами параметров, рассчитанный на работу на ноутбуке на скоростях, характерных для edge-вычислений, а модель Microsoft — речевая языковая модель класса 1.5B в обёртке из аудиотокенизаторов и диффузионной головки (всего около трёх миллиардов параметров), созданная, чтобы понимать речь как язык в процессе её транскрибации.

Прежде чем перейти к цифрам — пояснения об источниках данных, которые обеспечивают честность этого сравнения. Всё, что помечено как сообщённое IBM, взято из карточки модели Granite Speech 5.0 470M TurboCTC и её записей в лидерборде Open ASR; эти результаты были получены IBM через официальный испытательный конвейер в день релиза и пока никем независимо не воспроизведены. Всё, что касается VibeVoice-ASR-Streaming-1.5B, взято из изучения репозитория — конфигурационных файлов, карточки модели и документации Microsoft по стримингу, — поскольку Microsoft не публиковала ни показателей точности, ни задержек в текстовом виде, и никто за пределами Microsoft не тестировал эту контрольную точку. Эти две модели не прогонялись в общем конвейере; данное сравнение оценивает обе по одним и тем же публичным данным, которые на данный момент и есть всё, что предложили обе компании.

Два тихих релиза с интервалом в восемь дней

Обе модели появились одинаково буднично — и об этом стоит сказать прямо, поскольку с тех пор ни одна из компаний почти ничего не сообщала. Модель IBM Granite Speech 5.0 470M TurboCTC — это Apache-2.0-версия в рамках запуска из двух вариантов: IBM также опубликовала некоммерческого «собрата» с суффиксом -NC и несколько более высокими итоговыми показателями. На её карточке указаны дата выпуска 25 августа 2026 года, нативная поддержка Transformers и заявка в лидерборд Open ASR, датированная тем же днём. Пара стриминговых моделей Microsoft, VibeVoice-ASR-Streaming-7B и VibeVoice-ASR-Streaming-1.5B, появилась на Hugging Face в одну и ту же минуту 2 сентября; новостная строка в GitHub, анонсирующая «единую стриминговую модель ASR, которая непрерывно распознаёт, кто и что говорит, по мере поступления речи», датирована 3 сентября и упоминает модель 7B, оставляя рассматриваемую здесь 1.5B меньшим собратом, выпущенным тихо рядом с ней.

Самое интересное в том, что две команды обратились к слову «streaming» и построили прямо противоположные вещи. Granite Speech 5.0 470M TurboCTC — это энкодер на базе Conformer, обученный с помощью CTC и декодируемый за один неавторегрессивный проход: здесь нет декодера, генерирующего текст токен за токеном, поэтому модель структурно дёшева и структурно быстра. VibeVoice-ASR-Streaming-1.5B — это речевая LLM: два свёрточных токенизатора превращают аудио 24 кГц в поток речевых токенов со скоростью ~7,5 Гц, декодер семейства Qwen2 (28 слоёв, 1536 скрытых единиц — класс 1.5B) читает этот поток, а диффузионная головка выдаёт транскрипт фрагментами примерно по 2,9 секунды с упреждением около половины секунды. Первая — гоночный болид; вторая — небольшая языковая модель, которая заодно умеет слушать.

Проверка спецификации

Параметры — Granite Speech 5.0 470M TurboCTC: 470M, только энкодер, против VibeVoice-ASR-Streaming-1.5B: ~3B суммарно (основа в виде языковой модели класса 1.5B плюс токенизаторы и диффузионная головка).

• Архитектура — Conformer-энкодер с блочным самовниманием и самокондиционированием, обученный с CTC, с жадным неавторегрессионным декодированием против двойных акустических/семантических токенизаторов, подающих на каузальный декодер семейства Qwen2 с диффузионной головкой DDPM.

• Частота вывода — ~12,5 выходных кадров в секунду, потоковая передача чанками по сравнению с ~7,5 Гц речевых токенов, выдача текста порциями ~2,9 с с упреждением ~0,5 с.

• Языки — только английский против десяти: китайский, английский, французский, немецкий, итальянский, японский, корейский, португальский, русский и испанский.

• Веса — примерно 0,5 млрд параметров / менее гигабайта, класс edge-устройств против ~5,6 ГБ в bf16, класс NVIDIA GPU.

• Точность в печати — IBM сообщает о среднем WER ~5,00% на наборах коротких форм Open ASR, тогда как в тексте не публикуется ни одного показателя WER.

• Лицензия — Apache-2.0 vs MIT.

• Выпуск — 25 августа 2026 г. против 2 сентября 2026 г.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total / 1.5B-class LM, Architecture speech LLM + diffusion, Languages 10, Streaming ~2.9 s chunks + ~0.5 s lookahead, WER none published, License MIT. Right column Granite Speech 5.0 470M TurboCTC: Released Aug 25 2026, Params 470M, Architecture conformer CTC, Languages English only, Streaming chunkwise ~12.5 frames/s, WER ~5.00% (IBM-reported), License Apache-2.0. Footer reads 'Granite figures IBM-reported, unverified; VibeVoice specs read from the HF repo; no independent benchmark of either exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

Скорость: одна создана, чтобы быть маленькой, другая — чтобы быть языковой моделью.

{{1}}Архитектурное различие проявляется прежде всего в скорости и требованиях к аппаратному обеспечению. Granite Speech 5.0 470M TurboCTC ориентирована на ноутбуки, смартфоны и другие edge-устройства. Поскольку чистый CTC-энкодер ничего не сэмплирует — выход формируется одним жадным проходом по BPE-слою из 16 384 элементов, — запуск такой модели чрезвычайно дёшев. В карточке модели IBM указан показатель пропускной способности Open ASR, измеренный на одном H200 и составляющий десятки тысяч RTFx для линейки TurboCTC, а также WebGPU-демо, распознающее речь в реальном времени во вкладке браузера. Эти цифры получены IBM и не воспроизведены независимо, однако структурный аргумент сохраняет силу сам по себе: энкодер на 470M параметров без авторегрессионного декодера — это модель, которую можно запускать на аппаратном обеспечении, которое есть в смартфоне.{{/1}}

VibeVoice-ASR-Streaming-1.5B выбирает противоположный компромисс. Его декодер — это каузальная языковая модель, а значит, текст генерируется в более тяжёлом цикле, чем CTC-argmax, а документированные способы запуска предполагают самостоятельный хостинг на GPU NVIDIA — демо на Python из репозитория microsoft/VibeVoice или его плагин для vLLM — с весами bf16 около 5,6 ГБ до какого-либо KV-кэша. Microsoft не опубликовала ни одного заявления о пропускной способности или коэффициенте реального времени, поэтому нет цифры от вендора, которую можно было бы противопоставить цифре IBM. Зато архитектура LLM даёт контекст: модель переносит понимание говорящего и содержания через весь транскрипт так, как это делает языковая модель, — и в этом разница между транскрибированием звука и следованием за разговором.

Точность: один поставщик напечатал цифры, другой — картинку

Судя по имеющимся данным, Granite Speech 5.0 470M TurboCTC опережает VibeVoice-ASR-Streaming-1.5B на целый опубликованный бенчмарк. IBM в день релиза прогнала свою модель через официальную среду тестирования лидерборда Open ASR и сообщает о среднем WER около 5.00% на публичных англоязычных наборах короткой речи — показатель, измеренный вендором, не подтверждённый третьей стороной и полностью отсутствующий у Microsoft в этом сравнении. В карточке модели VibeVoice-ASR-Streaming-1.5B результаты оценки приведены в виде изображения, но без числовых значений WER, RTF или задержки в тексте; единственный числовой ориентир в семействе VibeVoice — указанный вендором средний WER 7.77% в карточке пакетной модели VibeVoice-ASR по восьми англоязычным тестовым наборам, который описывает нестриминговую модель и не переносится на стриминговую. Что бы в итоге ни показали независимые запуски, честное резюме на сегодня: IBM опубликовала число, а Microsoft — картинку.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Языки и вывод: только английский против того, кто что сказал в десяти

Granite Speech 5.0 470M TurboCTC поддерживает только английский язык и возвращает сырой распознанный текст. Для задач, на которые нацелена IBM, — корпоративной транскрипции английской речи на периферийных устройствах — это не недостаток, но сравнение заканчивается, как только ваш аудиоматериал оказывается не на английском. VibeVoice-ASR-Streaming-1.5B заявляет поддержку десяти языков и потоковый вывод с атрибуцией говорящего: в карточке модели сказано, что она «непрерывно распознаёт, кто и что говорит, по мере поступления речи», а хотворды для доменных терминов передаются в виде контекстного промпта. Обе дополнительные возможности стоит воспринимать скептически — потоковая диаризация на границах чанков действительно сложна, а это заявление не подтверждено, — но именно они являются причиной, по которой команда с живыми многоязычными совещаниями вообще обратит внимание на модель Microsoft.

Лицензирование и экосистема: Apache-2.0 против MIT, Transformers против исследовательского репозитория

Обе лицензии разрешают коммерческое использование, что уже отличает эту пару от собственной -NC-версии IBM той же архитектуры. Granite Speech 5.0 470M TurboCTC распространяется под Apache-2.0 со стандартным предоставлением патентных прав и нативно поддерживается в Hugging Face Transformers (AutoModelForCTC из transformers >= 5.16), а также в mlx-audio для Apple Silicon — то есть работает везде, где работает крупнейшее сообщество развёртывания в экосистеме, на оборудовании любого производителя. VibeVoice-ASR-Streaming-1.5B имеет лицензию MIT, что ещё проще, но его путь развёртывания — это исследовательская сборка из исходников: класс архитектуры чекпойнта, VibeVoiceForASRStreamingTraining, отсутствует в публичной документации Transformers, а собственная стриминговая документация Microsoft указывает на демонстрационный код репозитория и плагин vLLM, а не на стандартную загрузку из готовой библиотеки. Для продакшн-команды разница реальна: одна модель встраивается в существующий пайплайн Transformers уже сегодня, а другая требует поднять исследовательский репозиторий и самостоятельно проверить путь загрузки.

A screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the model title Granite-Speech-5.0-470M-TurboCTC, the Apache-2.0 license tag, the English-language tag, the automatic-speech-recognition pipeline tag, and the model summary describing a compact 470 million parameter English ASR model for edge deployment.

Какой тихий релиз стоит оценить?

В первую очередь оцените Granite Speech 5.0 470M TurboCTC, если ваша рабочая нагрузка — английский язык, ваше оборудование относится к edge-классу или ограничено по CPU, и вам нужна модель, которая легко встраивается в Transformers и имеет число на карточке для быстрой сверки. Это менее рискованный выбор по всем параметрам, кроме одного — она не поможет вам со вторым языком или с транскриптом живого совещания, где нужно определять, кто говорит.

{{1}}Обратите внимание на VibeVoice-ASR-Streaming-1.5B, если вам нужна многоязычная потоковая транскрипция, если вы хотите протестировать вывод «кто что сказал» или хотворды, либо если вы предпочитаете сделать ставку на языковую модель для распознавания речи, а не на чистый энкодер. {{/1}}{{2}}Рассчитывайте бюджет на GPU от NVIDIA, установку из исходного кода, примерно 5,6 ГБ весов модели и на оценку, которую вам придётся разработать самостоятельно, — потому что никто, включая Microsoft, пока не опубликовал цифры, на которые можно полагаться.{{/2}}

Ни один из двух этих тихих релизов не меняет главного: ASR-слой должен оставаться сменным, пока вы выясняете, какая из ставок сыграет. Обе модели пока молоды, и ни одна из них на момент написания недоступна через OrcaRouter; когда какой-либо провайдер начнёт размещать одну из них, самый безопасный способ её опробовать — маршрутизирующий слой, который открывает доступ к 200+ моделям по ценам провайдеров — наценка 0%, так что изменения цен вступают в силу в тот же день — и автоматически переключается на сервис, которому вы уже доверяете. Направьте часть реального аудио на новую модель, прочитайте транскрипты и позвольте вашему собственному трафику, а не бенчмарк-таблице из релизного дня, решить, какая тихая ставка оказалась верной.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube