Главный титульный кард, сравнивающий «VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe», с надзаголовком «Стриминговый ASR — сентябрь 2026», подзаголовком, гласящим: «два стриминговых конкурента с разницей в один день» — API Meta за $0,18 в час и чекпойнт Microsoft с лицензией MIT без собственного хостинга, — чипами «Веса MIT — 2 сентября», «API Meta — 1 сентября» и «Оба не проверены», и сноской «То же обещание, что и в заголовке». Логотип OrcaRouter размещён в правом нижнем углу.
Guides & Insights

VibeVoice-ASR-Streaming-7B против Muse Voice Transcribe: два стриминговых конкурента с разницей в один день

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

В течение примерно тридцати шести часов в начале сентября 2026 года две крупные лаборатории выпустили потоковые модели преобразования речи в текст, обещающие в заголовках одно и то же: живую расшифровку, которая ещё и сообщает, кто что сказал, прямо во время произнесения слов. 1 сентября Meta Superintelligence Labs запустила Muse Voice Transcribe как размещённый API по цене $3.00 за 1000 аудиоминут, примерно $0.18 за час, объединив в одном проходе потоковое распознавание, диаризацию 20+ говорящих и определение границ реплик. 2 сентября Microsoft Research загрузила VibeVoice-ASR-Streaming-7B на Hugging Face: открытые веса под лицензией MIT, без анонсов, карточка модели заявляет о потоковой транскрипции с атрибуцией реплик говорящим, поддержке hotwords и десяти языков, а готового размещённого сервиса нет нигде. Тот же посыл, противоположные бизнес-модели — и доказательная база с обеих сторон такая зыбкая, что ни одна из лабораторий не хотела бы, чтобы вы это заметили.

Эта страница написана в формате «что нам известно на данный момент», потому что ни у одной из моделей нет независимо подтверждённых показателей точности. Цифры Muse Voice Transcribe — это заявления Meta на день запуска, предоставленные вендором и не воспроизведённые независимо; VibeVoice-ASR-Streaming-7B вообще не публиковал никаких показателей точности потокового распознавания в текстовом виде. Поэтому приведённое ниже сравнение опирается на то, что является структурным и поддаётся проверке — {{3}}архитектуру, цену, лицензию, документированное поведение{{/3}}, — и помечает те немногие цифры вендора, которые встречаются в тексте.{{1}} Цифры Muse Voice Transcribe — это заявления Meta на день запуска, предоставленные вендором и не воспроизведённые независимо{{/1}};{{2}} VibeVoice-ASR-Streaming-7B вообще не публиковал никаких показателей точности потокового распознавания в текстовом виде{{/2}}.

Два соперника пакетного конвейера, с разницей в день.

Обе модели атакуют одно и то же допущение: будто преобразование речи в текст — это то, что запускается на готовой записи. Muse Voice Transcribe — первый продукт, который Meta называет «моделью восприятия аудио в реальном времени»: один потоковый проход выполняет распознавание, диаризацию говорящих (более двадцати голосов) и определение конца реплики — то есть решает, когда говорящий действительно закончил, а не просто взял паузу. Продукт выходит сразу на трёх поверхностях: Meta Model API — по $0.18 за аудиочас; Meta AI для Mac — удержание клавиши Fn позволяет диктовать в любое приложение; и Muse Code. Потоковая модель VibeVoice-ASR-Streaming-7B от Microsoft — часть открытого семейства VibeVoice — вышла куда тише: 2 сентября на Hugging Face появился репозиторий (судя по таймстампам, в 15:46 UTC; последнее изменение — тремя минутами позже); в нём — восемь шардов safetensors под лицензией MIT; а 3 сентября в GitHub-репозитории microsoft/VibeVoice появилась запись в новостном журнале, которая называет её «единой потоковой ASR-моделью, непрерывно транскрибирующей, кто что сказал, по мере поступления речи, с поддержкой настраиваемых хот-слов и 10 языков». Спустя день после публикации репозиторий всё ещё показывал ноль загрузок.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

Конфликт функций

Механизм потоковой передачи — Muse Voice Transcribe потребляет аудио чанками по 80 миллисекунд и фиксирует слова по мере их стабилизации, тогда как VibeVoice-ASR-Streaming-7B обрабатывает чанки примерно по 2,9 секунды с упреждением около 0,5 секунды, выводя текст один раз за каждый завершённый чанк.

• Атрибуция говорящих: 20+ говорящих за один проход; по заявлению вендора, средняя ошибка диаризации 17,5% против потокового вывода «кто что сказал», указанного в карточке модели; не проверено.

• Эндпоинтинг — встроенный: поток содержит границу завершённого высказывания, а не документируется как выходной сигнал.

• Управление контекстом — языковое, ключевое и контекстное смещение по сравнению с настраиваемыми горячими словами через контекстный промпт (--context_info).

Языки — обучение на 70+, 25 тщательно проверены при запуске, нативное переключение кода по сравнению с заявленными 10 (en, zh, es, pt, de, ja, ko, fr, ru, it).

• Доказательства — заявления вендора в день запуска: 3,1% WER на финальных результатах через 0,16 с после речи, 3,6% на первых частичных результатах, со ссылкой на лидерборд потокового распознавания Artificial Analysis; при этом ни WER для потокового режима, ни показатель задержки в текстовом виде не опубликованы.

• Стоимость и лицензия — $0,18 за аудио-час: хостинговая версия с закрытыми весами против $0 за веса (MIT), примерно 18 ГБ в bf16, самостоятельное развёртывание.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): business model - open weights MIT self-hosted; streaming cadence - ~2.9 s chunks, config-derived; speaker output - claimed who-said-what, unverified; endpointing - not documented; languages - 10 declared; price - $0 weights, ~18 GB bf16. Right column Muse Voice Transcribe (released Sep 1, 2026 - Meta Model API): hosted API closed weights; 80 ms chunks, adaptive delay, finals 0.16 s (vendor); 20+ speakers, 17.5% avg DER (vendor); built-in turn-end signal; 25 verified (70+ trained); $0.18 per audio-hour. Footer: 'Muse figures are vendor-reported launch-day claims. VibeVoice specs read from the HF repo. Neither is independently benchmarked.'

Два очень разных представления о «стриминге»

Термин «стриминг» охватывает очень широкий диапазон темпов, и разрыв между двумя рассматриваемыми подходами достаточно велик, чтобы менять то, что можно построить на каждом из них. Muse Voice Transcribe транслирует речь с гранулярностью отдельных слов. Архитектура Meta потребляет аудио фрагментами по 80 миллисекунд и использует так называемую «адаптивную задержку» — политику задержки, выработанную с помощью обучения с подкреплением, которая фиксирует каждое слово, как только модель обретает уверенность, удерживая больше контекста для слов, в которых она менее уверена, вместо применения фиксированного бюджета задержки. Вендор заявляет, что итоговая расшифровка появляется через 0,16 секунды после того, как говорящий замолкает, а первые частичные результаты — через 0,13 секунды. Такой темп рассчитан на интерактивные циклы: живые субтитры, диктовку, голосового агента, которому нужно реагировать на завершённое высказывание почти мгновенно.

VibeVoice-ASR-Streaming-7B работает в более крупном зерне. Его конфигурация предпроцессора показывает, что аудио поступает с частотой 24 кГц, сжимается в 3200 раз в токены со скоростью примерно 7,5 кадра в секунду, а затем обрабатывается блоками по 22 кадра с упреждением на 4 кадра — это примерно 2,9 секунды аудио на блок и около половины секунды упреждения. Эти цифры взяты из конфигурации, а не из измеренной задержки. Текст выдаётся по мере обработки каждого блока, при этом контекст предыдущих блоков сохраняется через кэш KV, так что длительный сеанс не пересчитывает всё с нуля. Транскрипт, растущий шагами примерно по три секунды, подходит для заметок со встреч и аналитики звонков; это другой продукт, нежели потоковая выдача слов с субсекундной задержкой для живого разговора. Ни одна из лабораторий не опубликовала измерение сквозной задержки для потоковой контрольной точки, так что воспринимайте эту ритмичность как задуманную, а реальные ощущения — как непроверенные.

Метки говорящих и определение конца высказывания: встроены в одной, заявлены в другой.

Атрибуция говорящих — та область, где потоковые продукты чаще всего преувеличивают свои возможности, и оба они претендуют на это. Реализация Muse Voice Transcribe конкретна и структурна: диаризация выполняется в том же потоковом проходе, что и распознавание, поэтому запись разговора двадцати человек может нести метки для каждого говорящего без отдельного этапа «загрузить, подождать, получить говорящих». Meta сообщает о средней частоте ошибок диаризации 17,5% — вендорская цифра, не подтверждённая независимо, но привязанная к реальному механизму. Она также выдаёт границы окончания реплик — менее заметная возможность: приложение получает чёткий сигнал «реплика говорящего завершена», не создавая детектора голосовой активности; именно поэтому голосовые агенты на «сыром» ASR так часто перебивают людей.

VibeVoice-ASR-Streaming-7B заявляет на своей карточке модели о выводе в режиме реального времени «кто что сказал», что согласуется со структурированным выводом «Кто/Когда/Что» пакетной модели VibeVoice-ASR — однако для стримингового чекпоинта это заявление не подтверждено: ни один независимый тест его не воспроизвёл, и отсутствует документированный сигнал определения конца речи, как тот, что предлагает Muse. Если ваша задача — действительно многоговорящее живое аудио, Muse сегодня предлагает более полный механизм; если же вы оцениваете, может ли модель с открытыми весами сделать то же самое на вашем оборудовании, заявление VibeVoice — как раз то, что стоит проверить на собственных записях встреч, прежде чем верить ему.

Доказательства: заявления в день запуска против пустой карты

Стоит точно понимать, что есть у каждой стороны, потому что ни у одной нет того, что на самом деле нужно покупателю. Muse Voice Transcribe имеет плотный набор показателей от вендора — 3,1% ошибок в словах на итоговых транскрипциях, 3,6% на первых частичных результатах, задержка финального результата 0,16 секунды, средняя ошибка диаризации 17,5% — всё это опубликовано Meta в день запуска и указывает на таблицу лидеров потоковой речи-в-текст Artificial Analysis, где Meta заявляет о первом месте. Это заявления, никем за пределами лаборатории не воспроизведённые, но они достаточно конкретны, чтобы их можно было опровергнуть, а это своего рода прогресс.

VibeVoice-ASR-Streaming-7B ничего этого не имеет. В его карточке модели приведён график оценки в виде изображения, а технический отчёт о потоковом режиме — PDF, но нет ни цитируемого показателя WER для потокового режима, ни задержки в текстовом виде. Единственный числовой ориентир в семействе VibeVoice — таблица, предоставленная поставщиком в карточке пакетной модели VibeVoice-ASR: средний WER 7,77% на восьми английских тестовых наборах и 2,20% на LibriSpeech clean, — которая, однако, не является показателем этой контрольной точки. Когда заявление в день запуска сталкивается с пустой карточкой, честным решающим фактором становится всё, кроме заголовочного WER: цена, лицензия, частота потоковой выдачи и функции, которые каждая сторона действительно документирует.

Языки: проверено 25 против 10 заявленных.

{{1}}Языковой охват различает эти две модели сильнее, чем громкие заявления о точности.{{/1}} {{2}}Muse Voice Transcribe обучался на 70+ языках, но Meta подтверждает 25 на момент запуска{{/2}} — {{3}}и именно проверенный список, а не список обучения, определяет производственный охват,{{/3}} {{4}}а нативная переключаемость кодов — ключевое отличие: модель умеет переключать языки в середине предложения без дополнительной команды.{{/4}} {{5}}VibeVoice-ASR-Streaming-7B заявляет в своей карточке модели 10 языков — английский, китайский, испанский, португальский, немецкий, японский, корейский, французский, русский, итальянский{{/5}} — {{6}}против 50+ у пакетной VibeVoice-ASR.{{/6}} {{7}}Если ваш трафик включает разговоры с переключением кодов, у Muse более адресное предложение;{{/7}} {{8}}если же он укладывается в эти десять языков,{{/8}} {{9}}покрытие модели Microsoft по крайней мере явно заявлено,{{/9}} {{10}}что уже больше, чем предлагает большинство анонсирующих материалов.{{/10}}

Стоимость и что остаётся вам

Разница в бизнес-моделях — самый чистый способ принять решение. Muse Voice Transcribe по цене $0,18 за час аудио не оставляет по прейскурантной цене ни одному крупному API потоковой транскрипции — без GPU, без эксплуатации, с закрытыми весами, и цену устанавливает Meta. VibeVoice-ASR-Streaming-7B можно скачать бесплатно, но это примерно 18 ГБ весов в bf16, не считая KV-кэша, для самостоятельного хостинга на GPU класса 24 ГБ; документированные пути запуска — демо-скрипты microsoft/VibeVoice или плагин vLLM, и пока ни один инференс-провайдер его не хостит. Лицензия MIT — это долгосрочный актив: веса остаются вашими — их можно хранить и дообучать так, как не позволяет ни одна API-подписка. Именно здесь ценовая картина может стать интересной: как только провайдер начнёт хостить открытую контрольную точку, вопрос $0,18 в час превращается в рыночную цену, а не в прейскурантную цену одного вендора, а это как раз та ситуация, когда сквозной роутер оправдывает своё существование. OrcaRouter сегодня не маршрутизирует распознавание речи, и ни одной из этих моделей нет в его каталоге; что он делает — так это пропускает цены провайдеров с нулевой наценкой через 200+ языковых моделей, потребляющих живой транскрипт, поэтому снижение цены вендором в любом месте этого стека вступает в силу на стороне покупателя в тот же день, когда оно объявлено.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

Часто задаваемые вопросы

Означает ли показатель WER 3,1% у Muse Voice Transcribe, что он точнее, чем VibeVoice-ASR-Streaming-7B?

Нет, и сравнение пока не имеет смысла. Заявленные Meta 3.1% — это цифра на день запуска для потокового пути, сообщённая вендором и не воспроизведённая независимо. VibeVoice-ASR-Streaming-7B вообще не публиковал показатель точности потоковой обработки в текстовом виде. Пока обе модели не прогнаны через один и тот же публичный стенд на одном и том же аудио, единственным честным утверждением остаётся то, что у Muse есть конкретная заявка, которую можно проверить, а у VibeVoice такой пока нет.

Могу ли я использовать любую из моделей на уже записанном аудио?

Да, оба, но по-разному. Muse Voice Transcribe обрабатывает записи длительностью более часа через тот же потоковый API. Плагин vLLM для VibeVoice-ASR-Streaming-7B предоставляет эндпоинт транскрибации целого файла наряду со своим WebSocket-эндпоинтом для потоковой передачи. Но оба рассчитаны на потоковый сценарий — и по архитектуре, и по цене: Muse — в силу бизнес-модели, ориентированной только на стриминг, а VibeVoice — в силу своей чанковой архитектуры, которая выдаёт результат по мере поступления аудио. Поэтому, если ваша нагрузка — это исключительно пакетная обработка файлов, специализированный API для транскрибации файлов обычно будет дешевле, а его показатели — лучше измерены, чем у любого из них.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube