«Главная титульная карточка для статьи 'VibeVoice-ASR-Streaming-1.5B' с тегом «Что нам известно на данный момент», подзаголовком «Потоковое распознавание речи от Microsoft тихо вышло в релиз» и чипами: «Выпущено 2 сентября 2026 г.», «MIT · Открытые веса» и «10 языков». Логотип OrcaRouter вкомпонован в правый нижний угол.»
Guides & Insights

VibeVoice-ASR-Streaming-1.5B, объясняем: потоковое распознавание речи Microsoft появилось без анонса

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

2 сентября 2026 года Microsoft Research выложила на Hugging Face два новых чекпойнта для распознавания речи без пресс-релиза, без записи в блоге и без лишней шумихи: microsoft/VibeVoice-ASR-Streaming-1.5B и его более крупного собрата microsoft/VibeVoice-ASR-Streaming-7B. Единственное на данный момент объявление — новостная запись от 3 сентября 2026 года в разделе новостей открытого репозитория VibeVoice от Microsoft на GitHub, в которой релиз описывается как унифицированная потоковая ASR-модель, транскрибирующая, кто что сказал, пока аудио ещё поступает, с настраиваемыми хот-словами и поддержкой десяти языков. Оба чекпойнта распространяются по лицензии MIT, оба были созданы с интервалом примерно в пять минут в официальном аккаунте microsoft на Hugging Face, и у обоих было ноль загрузок, когда мы проверили на следующий день. Мы не нашли никаких упоминаний ни об одном из них в сторонних источниках.

Это делает данную статью необычной: перед нами реальный, поддающийся датировке релиз — веса на Hugging Face датированы 2 сентября, анонс в репозитории — 3 сентября, — который широкий мир ещё не успел заметить. Всё, что можно узнать из нижеследующего, почерпнуто из изучения репозитория: файлов конфигурации, карточки модели и собственной документации Microsoft по стримингу. Всё неподтверждённое — точность, реальная задержка и сохранение атрибуции говорящего в реальном звонке с двумя собеседниками — помечено как таковое. Сослаться на бенчмарк невозможно: Microsoft ещё не опубликовала его в текстовом виде.

Единственное объявление — это новостная строка.

VibeVoice — это семейство речевых моделей Microsoft Research с открытым исходным кодом по лицензии MIT. Самый известный её ASR-компонент, microsoft/VibeVoice-ASR, вышел 21 января 2026 года: пакетная модель за один проход обрабатывает до шестидесяти минут аудио и возвращает структурированные транскрипты с указанием говорящего, времени и содержания — затем последовало около 700 000 загрузок на Hugging Face. 2 сентября та же организация опубликовала стриминговые модели-собратья: microsoft/VibeVoice-ASR-Streaming-7B и microsoft/VibeVoice-ASR-Streaming-1.5B; API Hugging Face указывает для 7B время 2026-09-02T15:46 UTC, а для 1.5B — на пять минут позже, 15:51 UTC. В таблице моделей в репозитории GitHub VibeVoice-ASR-Streaming теперь значится отдельной записью, а в разделе News размещена строка от 3 сентября с его анонсом.

Что действительно ново по сравнению с январской моделью — это модель взаимодействия: потоковые контрольные точки транскрибируют аудио по мере его поступления, а не ждут полный файл. Всё остальное — базовая архитектура речевых токенов, вывод с атрибуцией говорящего, механизм hotword — является продолжением пакетного дизайна, масштабированного и перенацеленного на использование в реальном времени. Сразу обратите внимание на разницу в языках: пакетная модель заявляет более 50 языков, тогда как в карточке потоковой версии перечислено десять.

A screenshot of the microsoft/VibeVoice GitHub repository README showing the model table that lists VibeVoice-ASR-Streaming as a member of the family and the News section entry dated September 3, 2026 announcing the streaming ASR release.

Что означает «стриминг» в этом чекпойнте

Документация Microsoft по потоковой передаче прямо описывает намерение: модель транскрибирует речь, пока аудио ещё поступает, и выдаёт текст один раз на каждый аудиочанк, так что расшифровка появляется по мере того, как говорит выступающий. Файл preprocessor_config.json из репозитория 1.5B делает этот ритм конкретным:

• Частота дискретизации и частота токенов — входное аудио 24 кГц сжимается в 3 200 раз, что даёт поток речевых токенов примерно 7,5 Гц (примерно один токен каждые 133 мс).

• Чанк — 22 кадра, что при 7,5 Гц составляет примерно 2,9 секунды аудио на каждый выдаваемый сегмент.

• Упреждение — 4 кадра, около 0,5 секунды будущего аудио, используемого для уточнения текущего сегмента.

(Арифметика очевидна из репозитория: 22 × 3 200 = 70 400 отсчётов ≈ 2,93 с при 24 кГц; 4 × 3 200 = 12 800 отсчётов ≈ 0,53 с. В документации самой Microsoft отмечается, что контрольная точка всегда работает с тем чанком, на котором она обучалась, поэтому эти параметры не настраиваются во время инференса.)

Это относит систему к чанкованному потоковому режиму, а не к пословному: живой транскрипт растёт порциями примерно по три секунды с упреждением около полусекунды, а не частичными результатами по каждому токену. Это легитимный и распространённый подход для транскрибации встреч и звонков, но он даёт иной профиль задержки, чем системы, выдающие промежуточные результаты за доли секунды. Поэтому рассматривайте «потоковый режим» как спектр и соизмеряйте его с собственным бюджетом задержки, прежде чем строить на его основе продукт для живых субтитров.

Под капотом: речевая LLM масштаба Qwen

Чтение config.json контрольной точки 1.5B дает уже знакомый рецепт VibeVoice в меньшем масштабе:

Декодер — это языковая модель семейства Qwen2, размерности которой в точности соответствуют классу Qwen2.5 масштаба 1.5B: 28 слоёв, 1 536 скрытых единиц, 12 голов внимания с 2 парами ключ-значение и окно в 65 536 токенов. Именно LLM позволяет модели переносить понимание говорящего и содержания через всю стенограмму.

Акустические и семантические токенизаторы — глубокие свёрточные энкодеры со страйдингом 8/5/5/4/2/2 — преобразуют аудио 24 кГц в поток речевых токенов ~7,5 Гц, который считывает декодер.

• Диффузионная головка (DDPM, 20 шагов денойзинга, v-prediction) размещена на стороне генерации, что согласуется с остальной линейкой VibeVoice.

• Честность размера: в собственных метаданных safetensors чекпоинта указано около 3 миллиардов параметров, что соответствует примерно 5,6 ГБ весов. "1.5B" в названии — это масштаб языкового каркаса; именно так естественно читается конфиг, чей декодер — модель Qwen класса 1.5B, а аудиотокенизаторы и диффузионная головка добавляют остальное. Строка архитектуры в конфиге, VibeVoiceForASRStreamingTraining, сигнализирует, что это чекпоинт исследовательского семейства.

A single-column scoreboard titled 'VibeVoice-ASR-Streaming-1.5B — the scoreboard' with the subtitle 'Key specs read from the Hugging Face checkpoint and Microsoft's repo' and six rows: 'Released: Sept 2, 2026', 'Streaming cadence: ~3 s chunks, ~0.5 s lookahead', 'Languages: 10', 'Speaker output: who said what (unverified)', 'Scale: 1.5B LM backbone, ~3B total', 'License: MIT, open weights'. Footer: 'Specs from HF config and microsoft/VibeVoice repo — no independent benchmarks yet.' The OrcaRouter logo is composited in the bottom-right corner.

Кто что сказал, на десяти языках

Основная возможность, указанная в карточке модели, — это потоковая транскрипция с атрибуцией говорящих: согласно собственному пункту карточки, она «непрерывно транскрибирует, кто что сказал, по мере поступления речи». Также в ней заявлена поддержка настраиваемых хот-вордов для доменных терминов и перечислены десять поддерживаемых языков — китайский, английский, французский, немецкий, итальянский, японский, корейский, португальский, русский и испанский.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the MIT license tag, the automatic-speech-recognition pipeline tag, and the card description of streaming speaker-attributed transcription with customized hotwords and ten languages.

Горячие слова реализованы через тот же механизм смещения контекста, который использует пакетная модель. В демонстрации Microsoft для командной строки вы передаёте их как контекстную информацию — например, --context_info "Microsoft,VibeVoice" — чтобы смещать распознавание в сторону имён и технических терминов без тонкой настройки. В карточке ничего не сказано об автоматическом определении языка или переключении кодов для потоковой модели, что ещё одно упущение по сравнению с заявленными возможностями пакетной модели.

Одно предостережение заслуживает особого внимания. Страница документации по потоковой передаче сосредоточена на пофрагментной выдаче и hotwords; в ней не описывается, как поддерживается атрибуция говорящего при переходе через границы фрагментов. Потоковая диаризация — действительно сложная задача: говорящие перекрываются, и именно на границе фрагмента атрибуция начинает «плыть». Формулировка «кто что сказал» на карточке — это лишь заявление вендора, пока кто-нибудь не прогонит через неё реальный звонок с двумя участниками в прямом эфире и не проверит результат.

Позиционирование: семейство VibeVoice и сегмент потокового ASR в 2026 году

Внутри семейства релиз встраивается следующим образом:

• microsoft/VibeVoice-ASR (21 января 2026 года) — флагман пакетной обработки: до 60 минут за один проход, более 50 языков, вывод Who/When/What, горячие слова, примерно 700 тысяч загрузок.

• microsoft/VibeVoice-ASR-Streaming-7B и microsoft/VibeVoice-ASR-Streaming-1.5B (2 сентября 2026 года) — новые потоковые варианты; предмет этой статьи — 1.5B.

• microsoft/VibeVoice-ASR-BitNet (23 июля 2026 года) — квантованный edge-движок, ориентированный на CPU, для пакетной модели.

Модели VibeVoice-1.5B TTS и VibeVoice-Realtime-0.5B streaming-TTS — это отдельные представители одного семейства, а не часть линейки ASR.

Более широкое направление ASR с открытыми весами весь год двигалось в сторону реального времени, поэтому новую потоковую модель есть с чем напрямую сравнивать. Qwen3-ASR (Alibaba, ~1.7B) — унифицированная потоковая и офлайн-модель, охватывающая более 50 языков и диалектов. Потоковая модель NVIDIA Nemotron 3.5 ASR имеет 0.6B параметров и поддерживает 40 языков; она распространяется по лицензии OpenMDW, а не MIT. Granite Speech 5.0 470M TurboCTC от IBM — Apache-2.0, с необычно высокими показателями пропускной способности, заявленными вендором. На этом фоне потоковая модель Microsoft выделяется тремя особенностями: лицензией MIT, архитектурой на базе LLM, которая обеспечивает понимание говорящего и содержания, а не является просто акустической моделью, и подачей в виде живой расшифровки с атрибуцией говорящим. Открытыми вопросами остаются точность и задержка в реальных условиях — ни по одному из них независимых цифр пока нет.

Что еще не проверено

Чтение репозитория показывает дизайн, но не показывает, насколько хорошо он работает. В частности:

• В тексте нет ни цифр точности, ни значений задержки. Карточка модели содержит результаты в виде изображения, но в тексте нет числовой таблицы WER, RTF или задержки — нечего независимо цитировать.

• Никакой сторонней оценки. Через день после публикации скачивания были на нуле; нет ни бенчмарка сообщества, ни записи в лидерборде, ни независимого теста, который нам удалось бы найти.

• Механизм serving здесь — исследовательская схема, собираемая из исходного кода. Документация Microsoft по потоковому инференсу запускается из клона репозитория VibeVoice на GitHub внутри контейнера NVIDIA PyTorch (nvcr.io/nvidia/pytorch, рекомендуется flash-attention). В карточке модели также показан фрагмент пайплайна Transformers, а детали установки отсылаются к GitHub; мы не проверяли, поддерживает ли текущая выпущенная версия Transformers потоковый инференс на этом чекпойнте из коробки.

• Подача — сугубо исследовательская. В репозитории Microsoft модели VibeVoice описаны как предназначенные для исследовательских целей и разработки. Веса распространяются по лицензии MIT; позиция такая: «вот наука», а не «вот поддерживаемый продукт». Заложите в бюджет собственный этап оценки.

Стоит ли на этом строить?

Командам, которые уже сами хостируют ASR, стоит потратить выходные на проверку, если их аудио входит в набор из десяти языков и им конкретно нужна транскрипция в реальном времени с привязкой к говорящему на основе модели с лицензией MIT. Учитывайте ~5,6 ГБ весов для модели 1.5B на GPU от NVIDIA и установку из исходных кодов, а также планируйте сами измерять точность на своём аудио, прежде чем доверять ей.

Для команд, которые сегодня собирают продакшн-пайплайн транскрипции, разумный ответ — дождаться одного из трёх событий: публикации Microsoft показателей точности и задержки, которые сейчас существуют лишь в виде изображения; независимого бенчмарка; либо поддерживаемого пути развёртывания с поддерживаемой средой выполнения. Чанкованный такт ~3 секунды — это также спецификация, которую стоит сверять с вашими требованиями к задержке, а не принимать на веру, опираясь на слово «стриминг».

Дешёвый способ сохранить эту возможность открытой — не привязывать приложение жёстко к одному движку транскрибации. Маршрутизирующий слой, предоставляющий доступ к множеству моделей через один API, означает, что когда VibeVoice-ASR-Streaming — или следующая открытая ASR — появится у провайдера инференса, A/B-тестирование её против вашей текущей модели на том же трафике станет изменением конфигурации, а не сменой платформы. Поскольку сквозной маршрутизатор использует цену провайдера без наценки, такое сравнение остаётся дешёвым, а автоматическое переключение при сбое не даёт молодой непроверенной модели стать единственной точкой отказа в вашем конвейере. Это общий паттерн внедрения любой модели, которой всего несколько дней: дайте ей заслужить место на реальном трафике, прежде чем ставить на неё продакшн.

Часто задаваемые вопросы

Является ли VibeVoice-ASR-Streaming-1.5B реальным релизом Microsoft?

Да. Контрольная точка размещена на официальном аккаунте Microsoft в Hugging Face с отметкой времени создания от 2 сентября 2026 года, а в репозитории microsoft/VibeVoice на GitHub в таблице моделей указана VibeVoice-ASR-Streaming с новостной записью от 3 сентября 2026 года. Необычно здесь не происхождение, а тишина: ни пресс-релиза, ни записи в блоге, ни сторонних публикаций на момент написания.

Почему два размера — 7B и 1.5B?

Microsoft загрузила обе контрольные точки в одну и ту же минуту, но не опубликовала сравнение. Судя по конфигурациям, 1.5B — это младшая версия: языковой бэкбон Qwen класса 1.5B плюс аудиостек, около 3B параметров и примерно 5.6 ГБ весов. Естественное прочтение таково: 7B — более точная модель, а 1.5B — более дешёвая и быстрая, но Microsoft этого не заявляла, и никаких бенчмарков, подтверждающих такой компромисс, нет.

Чем это отличается от предыдущей VibeVoice-ASR?

Январская пакетная модель обрабатывает до 60 минут аудио за один проход и заявляет поддержку более 50 языков. Потоковые контрольные точки транскрибируют аудио по мере его поступления, выдавая транскрипт фрагментами примерно по 3 секунды с упреждением около 0,5 секунды, а в карточке модели перечислены десять языков. Обе модели используют одну и ту же архитектуру речевых токенов, идею выходных данных с указанием говорящего и механизм горячих слов.

На данный момент VibeVoice-ASR-Streaming-1.5B — это контрольная точка плюс новостная строка. Читайте репозиторий, если вы разворачиваетесь самостоятельно и вам нужен потоковый ASR с разрешительной лицензией для оценки; подождите цифр, если выбираете продакшен-движок. Любопытный сигнал: Microsoft продвигает свою голосовую линейку к реальному времени сразу в двух размерах — и сделала это так тихо, что через день счётчик загрузок всё ещё показывал ноль.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube