
VibeVoice-ASR-Streaming-1.5B, объясняем: потоковое распознавание речи Microsoft появилось без анонса
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0259Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0258Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0166Интеллект82Кодинг
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
2 сентября 2026 года Microsoft Research выложила на Hugging Face два новых чекпойнта для распознавания речи без пресс-релиза, без записи в блоге и без лишней шумихи: microsoft/VibeVoice-ASR-Streaming-1.5B и его более крупного собрата microsoft/VibeVoice-ASR-Streaming-7B. Единственное на данный момент объявление — новостная запись от 3 сентября 2026 года в разделе новостей открытого репозитория VibeVoice от Microsoft на GitHub, в которой релиз описывается как унифицированная потоковая ASR-модель, транскрибирующая, кто что сказал, пока аудио ещё поступает, с настраиваемыми хот-словами и поддержкой десяти языков. Оба чекпойнта распространяются по лицензии MIT, оба были созданы с интервалом примерно в пять минут в официальном аккаунте microsoft на Hugging Face, и у обоих было ноль загрузок, когда мы проверили на следующий день. Мы не нашли никаких упоминаний ни об одном из них в сторонних источниках.
Это делает данную статью необычной: перед нами реальный, поддающийся датировке релиз — веса на Hugging Face датированы 2 сентября, анонс в репозитории — 3 сентября, — который широкий мир ещё не успел заметить. Всё, что можно узнать из нижеследующего, почерпнуто из изучения репозитория: файлов конфигурации, карточки модели и собственной документации Microsoft по стримингу. Всё неподтверждённое — точность, реальная задержка и сохранение атрибуции говорящего в реальном звонке с двумя собеседниками — помечено как таковое. Сослаться на бенчмарк невозможно: Microsoft ещё не опубликовала его в текстовом виде.
Единственное объявление — это новостная строка.
VibeVoice — это семейство речевых моделей Microsoft Research с открытым исходным кодом по лицензии MIT. Самый известный её ASR-компонент, microsoft/VibeVoice-ASR, вышел 21 января 2026 года: пакетная модель за один проход обрабатывает до шестидесяти минут аудио и возвращает структурированные транскрипты с указанием говорящего, времени и содержания — затем последовало около 700 000 загрузок на Hugging Face. 2 сентября та же организация опубликовала стриминговые модели-собратья: microsoft/VibeVoice-ASR-Streaming-7B и microsoft/VibeVoice-ASR-Streaming-1.5B; API Hugging Face указывает для 7B время 2026-09-02T15:46 UTC, а для 1.5B — на пять минут позже, 15:51 UTC. В таблице моделей в репозитории GitHub VibeVoice-ASR-Streaming теперь значится отдельной записью, а в разделе News размещена строка от 3 сентября с его анонсом.
Что действительно ново по сравнению с январской моделью — это модель взаимодействия: потоковые контрольные точки транскрибируют аудио по мере его поступления, а не ждут полный файл. Всё остальное — базовая архитектура речевых токенов, вывод с атрибуцией говорящего, механизм hotword — является продолжением пакетного дизайна, масштабированного и перенацеленного на использование в реальном времени. Сразу обратите внимание на разницу в языках: пакетная модель заявляет более 50 языков, тогда как в карточке потоковой версии перечислено десять.

Что означает «стриминг» в этом чекпойнте
Документация Microsoft по потоковой передаче прямо описывает намерение: модель транскрибирует речь, пока аудио ещё поступает, и выдаёт текст один раз на каждый аудиочанк, так что расшифровка появляется по мере того, как говорит выступающий. Файл preprocessor_config.json из репозитория 1.5B делает этот ритм конкретным:
• Частота дискретизации и частота токенов — входное аудио 24 кГц сжимается в 3 200 раз, что даёт поток речевых токенов примерно 7,5 Гц (примерно один токен каждые 133 мс).
• Чанк — 22 кадра, что при 7,5 Гц составляет примерно 2,9 секунды аудио на каждый выдаваемый сегмент.
• Упреждение — 4 кадра, около 0,5 секунды будущего аудио, используемого для уточнения текущего сегмента.
(Арифметика очевидна из репозитория: 22 × 3 200 = 70 400 отсчётов ≈ 2,93 с при 24 кГц; 4 × 3 200 = 12 800 отсчётов ≈ 0,53 с. В документации самой Microsoft отмечается, что контрольная точка всегда работает с тем чанком, на котором она обучалась, поэтому эти параметры не настраиваются во время инференса.)
Это относит систему к чанкованному потоковому режиму, а не к пословному: живой транскрипт растёт порциями примерно по три секунды с упреждением около полусекунды, а не частичными результатами по каждому токену. Это легитимный и распространённый подход для транскрибации встреч и звонков, но он даёт иной профиль задержки, чем системы, выдающие промежуточные результаты за доли секунды. Поэтому рассматривайте «потоковый режим» как спектр и соизмеряйте его с собственным бюджетом задержки, прежде чем строить на его основе продукт для живых субтитров.
Под капотом: речевая LLM масштаба Qwen
Чтение config.json контрольной точки 1.5B дает уже знакомый рецепт VibeVoice в меньшем масштабе:
Декодер — это языковая модель семейства Qwen2, размерности которой в точности соответствуют классу Qwen2.5 масштаба 1.5B: 28 слоёв, 1 536 скрытых единиц, 12 голов внимания с 2 парами ключ-значение и окно в 65 536 токенов. Именно LLM позволяет модели переносить понимание говорящего и содержания через всю стенограмму.
Акустические и семантические токенизаторы — глубокие свёрточные энкодеры со страйдингом 8/5/5/4/2/2 — преобразуют аудио 24 кГц в поток речевых токенов ~7,5 Гц, который считывает декодер.
• Диффузионная головка (DDPM, 20 шагов денойзинга, v-prediction) размещена на стороне генерации, что согласуется с остальной линейкой VibeVoice.
• Честность размера: в собственных метаданных safetensors чекпоинта указано около 3 миллиардов параметров, что соответствует примерно 5,6 ГБ весов. "1.5B" в названии — это масштаб языкового каркаса; именно так естественно читается конфиг, чей декодер — модель Qwen класса 1.5B, а аудиотокенизаторы и диффузионная головка добавляют остальное. Строка архитектуры в конфиге, VibeVoiceForASRStreamingTraining, сигнализирует, что это чекпоинт исследовательского семейства.

Кто что сказал, на десяти языках
Основная возможность, указанная в карточке модели, — это потоковая транскрипция с атрибуцией говорящих: согласно собственному пункту карточки, она «непрерывно транскрибирует, кто что сказал, по мере поступления речи». Также в ней заявлена поддержка настраиваемых хот-вордов для доменных терминов и перечислены десять поддерживаемых языков — китайский, английский, французский, немецкий, итальянский, японский, корейский, португальский, русский и испанский.

Горячие слова реализованы через тот же механизм смещения контекста, который использует пакетная модель. В демонстрации Microsoft для командной строки вы передаёте их как контекстную информацию — например, --context_info "Microsoft,VibeVoice" — чтобы смещать распознавание в сторону имён и технических терминов без тонкой настройки. В карточке ничего не сказано об автоматическом определении языка или переключении кодов для потоковой модели, что ещё одно упущение по сравнению с заявленными возможностями пакетной модели.
Одно предостережение заслуживает особого внимания. Страница документации по потоковой передаче сосредоточена на пофрагментной выдаче и hotwords; в ней не описывается, как поддерживается атрибуция говорящего при переходе через границы фрагментов. Потоковая диаризация — действительно сложная задача: говорящие перекрываются, и именно на границе фрагмента атрибуция начинает «плыть». Формулировка «кто что сказал» на карточке — это лишь заявление вендора, пока кто-нибудь не прогонит через неё реальный звонок с двумя участниками в прямом эфире и не проверит результат.
Позиционирование: семейство VibeVoice и сегмент потокового ASR в 2026 году
Внутри семейства релиз встраивается следующим образом:
• microsoft/VibeVoice-ASR (21 января 2026 года) — флагман пакетной обработки: до 60 минут за один проход, более 50 языков, вывод Who/When/What, горячие слова, примерно 700 тысяч загрузок.
• microsoft/VibeVoice-ASR-Streaming-7B и microsoft/VibeVoice-ASR-Streaming-1.5B (2 сентября 2026 года) — новые потоковые варианты; предмет этой статьи — 1.5B.
• microsoft/VibeVoice-ASR-BitNet (23 июля 2026 года) — квантованный edge-движок, ориентированный на CPU, для пакетной модели.
Модели VibeVoice-1.5B TTS и VibeVoice-Realtime-0.5B streaming-TTS — это отдельные представители одного семейства, а не часть линейки ASR.
Более широкое направление ASR с открытыми весами весь год двигалось в сторону реального времени, поэтому новую потоковую модель есть с чем напрямую сравнивать. Qwen3-ASR (Alibaba, ~1.7B) — унифицированная потоковая и офлайн-модель, охватывающая более 50 языков и диалектов. Потоковая модель NVIDIA Nemotron 3.5 ASR имеет 0.6B параметров и поддерживает 40 языков; она распространяется по лицензии OpenMDW, а не MIT. Granite Speech 5.0 470M TurboCTC от IBM — Apache-2.0, с необычно высокими показателями пропускной способности, заявленными вендором. На этом фоне потоковая модель Microsoft выделяется тремя особенностями: лицензией MIT, архитектурой на базе LLM, которая обеспечивает понимание говорящего и содержания, а не является просто акустической моделью, и подачей в виде живой расшифровки с атрибуцией говорящим. Открытыми вопросами остаются точность и задержка в реальных условиях — ни по одному из них независимых цифр пока нет.
Что еще не проверено
Чтение репозитория показывает дизайн, но не показывает, насколько хорошо он работает. В частности:
• В тексте нет ни цифр точности, ни значений задержки. Карточка модели содержит результаты в виде изображения, но в тексте нет числовой таблицы WER, RTF или задержки — нечего независимо цитировать.
• Никакой сторонней оценки. Через день после публикации скачивания были на нуле; нет ни бенчмарка сообщества, ни записи в лидерборде, ни независимого теста, который нам удалось бы найти.
• Механизм serving здесь — исследовательская схема, собираемая из исходного кода. Документация Microsoft по потоковому инференсу запускается из клона репозитория VibeVoice на GitHub внутри контейнера NVIDIA PyTorch (nvcr.io/nvidia/pytorch, рекомендуется flash-attention). В карточке модели также показан фрагмент пайплайна Transformers, а детали установки отсылаются к GitHub; мы не проверяли, поддерживает ли текущая выпущенная версия Transformers потоковый инференс на этом чекпойнте из коробки.
• Подача — сугубо исследовательская. В репозитории Microsoft модели VibeVoice описаны как предназначенные для исследовательских целей и разработки. Веса распространяются по лицензии MIT; позиция такая: «вот наука», а не «вот поддерживаемый продукт». Заложите в бюджет собственный этап оценки.
Стоит ли на этом строить?
Командам, которые уже сами хостируют ASR, стоит потратить выходные на проверку, если их аудио входит в набор из десяти языков и им конкретно нужна транскрипция в реальном времени с привязкой к говорящему на основе модели с лицензией MIT. Учитывайте ~5,6 ГБ весов для модели 1.5B на GPU от NVIDIA и установку из исходных кодов, а также планируйте сами измерять точность на своём аудио, прежде чем доверять ей.
Для команд, которые сегодня собирают продакшн-пайплайн транскрипции, разумный ответ — дождаться одного из трёх событий: публикации Microsoft показателей точности и задержки, которые сейчас существуют лишь в виде изображения; независимого бенчмарка; либо поддерживаемого пути развёртывания с поддерживаемой средой выполнения. Чанкованный такт ~3 секунды — это также спецификация, которую стоит сверять с вашими требованиями к задержке, а не принимать на веру, опираясь на слово «стриминг».
Дешёвый способ сохранить эту возможность открытой — не привязывать приложение жёстко к одному движку транскрибации. Маршрутизирующий слой, предоставляющий доступ к множеству моделей через один API, означает, что когда VibeVoice-ASR-Streaming — или следующая открытая ASR — появится у провайдера инференса, A/B-тестирование её против вашей текущей модели на том же трафике станет изменением конфигурации, а не сменой платформы. Поскольку сквозной маршрутизатор использует цену провайдера без наценки, такое сравнение остаётся дешёвым, а автоматическое переключение при сбое не даёт молодой непроверенной модели стать единственной точкой отказа в вашем конвейере. Это общий паттерн внедрения любой модели, которой всего несколько дней: дайте ей заслужить место на реальном трафике, прежде чем ставить на неё продакшн.
Часто задаваемые вопросы
Является ли VibeVoice-ASR-Streaming-1.5B реальным релизом Microsoft?
Да. Контрольная точка размещена на официальном аккаунте Microsoft в Hugging Face с отметкой времени создания от 2 сентября 2026 года, а в репозитории microsoft/VibeVoice на GitHub в таблице моделей указана VibeVoice-ASR-Streaming с новостной записью от 3 сентября 2026 года. Необычно здесь не происхождение, а тишина: ни пресс-релиза, ни записи в блоге, ни сторонних публикаций на момент написания.
Почему два размера — 7B и 1.5B?
Microsoft загрузила обе контрольные точки в одну и ту же минуту, но не опубликовала сравнение. Судя по конфигурациям, 1.5B — это младшая версия: языковой бэкбон Qwen класса 1.5B плюс аудиостек, около 3B параметров и примерно 5.6 ГБ весов. Естественное прочтение таково: 7B — более точная модель, а 1.5B — более дешёвая и быстрая, но Microsoft этого не заявляла, и никаких бенчмарков, подтверждающих такой компромисс, нет.
Чем это отличается от предыдущей VibeVoice-ASR?
Январская пакетная модель обрабатывает до 60 минут аудио за один проход и заявляет поддержку более 50 языков. Потоковые контрольные точки транскрибируют аудио по мере его поступления, выдавая транскрипт фрагментами примерно по 3 секунды с упреждением около 0,5 секунды, а в карточке модели перечислены десять языков. Обе модели используют одну и ту же архитектуру речевых токенов, идею выходных данных с указанием говорящего и механизм горячих слов.
На данный момент VibeVoice-ASR-Streaming-1.5B — это контрольная точка плюс новостная строка. Читайте репозиторий, если вы разворачиваетесь самостоятельно и вам нужен потоковый ASR с разрешительной лицензией для оценки; подождите цифр, если выбираете продакшен-движок. Любопытный сигнал: Microsoft продвигает свою голосовую линейку к реальному времени сразу в двух размерах — и сделала это так тихо, что через день счётчик загрузок всё ещё показывал ноль.
