
VibeVoice-ASR-Streaming-7B против Muse Voice Transcribe: два стриминговых конкурента с разницей в один день
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
В течение примерно тридцати шести часов в начале сентября 2026 года две крупные лаборатории выпустили потоковые модели преобразования речи в текст, обещающие в заголовках одно и то же: живую расшифровку, которая ещё и сообщает, кто что сказал, прямо во время произнесения слов. 1 сентября Meta Superintelligence Labs запустила Muse Voice Transcribe как размещённый API по цене $3.00 за 1000 аудиоминут, примерно $0.18 за час, объединив в одном проходе потоковое распознавание, диаризацию 20+ говорящих и определение границ реплик. 2 сентября Microsoft Research загрузила VibeVoice-ASR-Streaming-7B на Hugging Face: открытые веса под лицензией MIT, без анонсов, карточка модели заявляет о потоковой транскрипции с атрибуцией реплик говорящим, поддержке hotwords и десяти языков, а готового размещённого сервиса нет нигде. Тот же посыл, противоположные бизнес-модели — и доказательная база с обеих сторон такая зыбкая, что ни одна из лабораторий не хотела бы, чтобы вы это заметили.
Эта страница написана в формате «что нам известно на данный момент», потому что ни у одной из моделей нет независимо подтверждённых показателей точности. Цифры Muse Voice Transcribe — это заявления Meta на день запуска, предоставленные вендором и не воспроизведённые независимо; VibeVoice-ASR-Streaming-7B вообще не публиковал никаких показателей точности потокового распознавания в текстовом виде. Поэтому приведённое ниже сравнение опирается на то, что является структурным и поддаётся проверке — {{3}}архитектуру, цену, лицензию, документированное поведение{{/3}}, — и помечает те немногие цифры вендора, которые встречаются в тексте.{{1}} Цифры Muse Voice Transcribe — это заявления Meta на день запуска, предоставленные вендором и не воспроизведённые независимо{{/1}};{{2}} VibeVoice-ASR-Streaming-7B вообще не публиковал никаких показателей точности потокового распознавания в текстовом виде{{/2}}.
Два соперника пакетного конвейера, с разницей в день.
Обе модели атакуют одно и то же допущение: будто преобразование речи в текст — это то, что запускается на готовой записи. Muse Voice Transcribe — первый продукт, который Meta называет «моделью восприятия аудио в реальном времени»: один потоковый проход выполняет распознавание, диаризацию говорящих (более двадцати голосов) и определение конца реплики — то есть решает, когда говорящий действительно закончил, а не просто взял паузу. Продукт выходит сразу на трёх поверхностях: Meta Model API — по $0.18 за аудиочас; Meta AI для Mac — удержание клавиши Fn позволяет диктовать в любое приложение; и Muse Code. Потоковая модель VibeVoice-ASR-Streaming-7B от Microsoft — часть открытого семейства VibeVoice — вышла куда тише: 2 сентября на Hugging Face появился репозиторий (судя по таймстампам, в 15:46 UTC; последнее изменение — тремя минутами позже); в нём — восемь шардов safetensors под лицензией MIT; а 3 сентября в GitHub-репозитории microsoft/VibeVoice появилась запись в новостном журнале, которая называет её «единой потоковой ASR-моделью, непрерывно транскрибирующей, кто что сказал, по мере поступления речи, с поддержкой настраиваемых хот-слов и 10 языков». Спустя день после публикации репозиторий всё ещё показывал ноль загрузок.

Конфликт функций
Механизм потоковой передачи — Muse Voice Transcribe потребляет аудио чанками по 80 миллисекунд и фиксирует слова по мере их стабилизации, тогда как VibeVoice-ASR-Streaming-7B обрабатывает чанки примерно по 2,9 секунды с упреждением около 0,5 секунды, выводя текст один раз за каждый завершённый чанк.
• Атрибуция говорящих: 20+ говорящих за один проход; по заявлению вендора, средняя ошибка диаризации 17,5% против потокового вывода «кто что сказал», указанного в карточке модели; не проверено.
• Эндпоинтинг — встроенный: поток содержит границу завершённого высказывания, а не документируется как выходной сигнал.
• Управление контекстом — языковое, ключевое и контекстное смещение по сравнению с настраиваемыми горячими словами через контекстный промпт (--context_info).
Языки — обучение на 70+, 25 тщательно проверены при запуске, нативное переключение кода по сравнению с заявленными 10 (en, zh, es, pt, de, ja, ko, fr, ru, it).
• Доказательства — заявления вендора в день запуска: 3,1% WER на финальных результатах через 0,16 с после речи, 3,6% на первых частичных результатах, со ссылкой на лидерборд потокового распознавания Artificial Analysis; при этом ни WER для потокового режима, ни показатель задержки в текстовом виде не опубликованы.
• Стоимость и лицензия — $0,18 за аудио-час: хостинговая версия с закрытыми весами против $0 за веса (MIT), примерно 18 ГБ в bf16, самостоятельное развёртывание.

Два очень разных представления о «стриминге»
Термин «стриминг» охватывает очень широкий диапазон темпов, и разрыв между двумя рассматриваемыми подходами достаточно велик, чтобы менять то, что можно построить на каждом из них. Muse Voice Transcribe транслирует речь с гранулярностью отдельных слов. Архитектура Meta потребляет аудио фрагментами по 80 миллисекунд и использует так называемую «адаптивную задержку» — политику задержки, выработанную с помощью обучения с подкреплением, которая фиксирует каждое слово, как только модель обретает уверенность, удерживая больше контекста для слов, в которых она менее уверена, вместо применения фиксированного бюджета задержки. Вендор заявляет, что итоговая расшифровка появляется через 0,16 секунды после того, как говорящий замолкает, а первые частичные результаты — через 0,13 секунды. Такой темп рассчитан на интерактивные циклы: живые субтитры, диктовку, голосового агента, которому нужно реагировать на завершённое высказывание почти мгновенно.
VibeVoice-ASR-Streaming-7B работает в более крупном зерне. Его конфигурация предпроцессора показывает, что аудио поступает с частотой 24 кГц, сжимается в 3200 раз в токены со скоростью примерно 7,5 кадра в секунду, а затем обрабатывается блоками по 22 кадра с упреждением на 4 кадра — это примерно 2,9 секунды аудио на блок и около половины секунды упреждения. Эти цифры взяты из конфигурации, а не из измеренной задержки. Текст выдаётся по мере обработки каждого блока, при этом контекст предыдущих блоков сохраняется через кэш KV, так что длительный сеанс не пересчитывает всё с нуля. Транскрипт, растущий шагами примерно по три секунды, подходит для заметок со встреч и аналитики звонков; это другой продукт, нежели потоковая выдача слов с субсекундной задержкой для живого разговора. Ни одна из лабораторий не опубликовала измерение сквозной задержки для потоковой контрольной точки, так что воспринимайте эту ритмичность как задуманную, а реальные ощущения — как непроверенные.
Метки говорящих и определение конца высказывания: встроены в одной, заявлены в другой.
Атрибуция говорящих — та область, где потоковые продукты чаще всего преувеличивают свои возможности, и оба они претендуют на это. Реализация Muse Voice Transcribe конкретна и структурна: диаризация выполняется в том же потоковом проходе, что и распознавание, поэтому запись разговора двадцати человек может нести метки для каждого говорящего без отдельного этапа «загрузить, подождать, получить говорящих». Meta сообщает о средней частоте ошибок диаризации 17,5% — вендорская цифра, не подтверждённая независимо, но привязанная к реальному механизму. Она также выдаёт границы окончания реплик — менее заметная возможность: приложение получает чёткий сигнал «реплика говорящего завершена», не создавая детектора голосовой активности; именно поэтому голосовые агенты на «сыром» ASR так часто перебивают людей.
VibeVoice-ASR-Streaming-7B заявляет на своей карточке модели о выводе в режиме реального времени «кто что сказал», что согласуется со структурированным выводом «Кто/Когда/Что» пакетной модели VibeVoice-ASR — однако для стримингового чекпоинта это заявление не подтверждено: ни один независимый тест его не воспроизвёл, и отсутствует документированный сигнал определения конца речи, как тот, что предлагает Muse. Если ваша задача — действительно многоговорящее живое аудио, Muse сегодня предлагает более полный механизм; если же вы оцениваете, может ли модель с открытыми весами сделать то же самое на вашем оборудовании, заявление VibeVoice — как раз то, что стоит проверить на собственных записях встреч, прежде чем верить ему.
Доказательства: заявления в день запуска против пустой карты
Стоит точно понимать, что есть у каждой стороны, потому что ни у одной нет того, что на самом деле нужно покупателю. Muse Voice Transcribe имеет плотный набор показателей от вендора — 3,1% ошибок в словах на итоговых транскрипциях, 3,6% на первых частичных результатах, задержка финального результата 0,16 секунды, средняя ошибка диаризации 17,5% — всё это опубликовано Meta в день запуска и указывает на таблицу лидеров потоковой речи-в-текст Artificial Analysis, где Meta заявляет о первом месте. Это заявления, никем за пределами лаборатории не воспроизведённые, но они достаточно конкретны, чтобы их можно было опровергнуть, а это своего рода прогресс.
VibeVoice-ASR-Streaming-7B ничего этого не имеет. В его карточке модели приведён график оценки в виде изображения, а технический отчёт о потоковом режиме — PDF, но нет ни цитируемого показателя WER для потокового режима, ни задержки в текстовом виде. Единственный числовой ориентир в семействе VibeVoice — таблица, предоставленная поставщиком в карточке пакетной модели VibeVoice-ASR: средний WER 7,77% на восьми английских тестовых наборах и 2,20% на LibriSpeech clean, — которая, однако, не является показателем этой контрольной точки. Когда заявление в день запуска сталкивается с пустой карточкой, честным решающим фактором становится всё, кроме заголовочного WER: цена, лицензия, частота потоковой выдачи и функции, которые каждая сторона действительно документирует.
Языки: проверено 25 против 10 заявленных.
{{1}}Языковой охват различает эти две модели сильнее, чем громкие заявления о точности.{{/1}} {{2}}Muse Voice Transcribe обучался на 70+ языках, но Meta подтверждает 25 на момент запуска{{/2}} — {{3}}и именно проверенный список, а не список обучения, определяет производственный охват,{{/3}} {{4}}а нативная переключаемость кодов — ключевое отличие: модель умеет переключать языки в середине предложения без дополнительной команды.{{/4}} {{5}}VibeVoice-ASR-Streaming-7B заявляет в своей карточке модели 10 языков — английский, китайский, испанский, португальский, немецкий, японский, корейский, французский, русский, итальянский{{/5}} — {{6}}против 50+ у пакетной VibeVoice-ASR.{{/6}} {{7}}Если ваш трафик включает разговоры с переключением кодов, у Muse более адресное предложение;{{/7}} {{8}}если же он укладывается в эти десять языков,{{/8}} {{9}}покрытие модели Microsoft по крайней мере явно заявлено,{{/9}} {{10}}что уже больше, чем предлагает большинство анонсирующих материалов.{{/10}}
Стоимость и что остаётся вам
Разница в бизнес-моделях — самый чистый способ принять решение. Muse Voice Transcribe по цене $0,18 за час аудио не оставляет по прейскурантной цене ни одному крупному API потоковой транскрипции — без GPU, без эксплуатации, с закрытыми весами, и цену устанавливает Meta. VibeVoice-ASR-Streaming-7B можно скачать бесплатно, но это примерно 18 ГБ весов в bf16, не считая KV-кэша, для самостоятельного хостинга на GPU класса 24 ГБ; документированные пути запуска — демо-скрипты microsoft/VibeVoice или плагин vLLM, и пока ни один инференс-провайдер его не хостит. Лицензия MIT — это долгосрочный актив: веса остаются вашими — их можно хранить и дообучать так, как не позволяет ни одна API-подписка. Именно здесь ценовая картина может стать интересной: как только провайдер начнёт хостить открытую контрольную точку, вопрос $0,18 в час превращается в рыночную цену, а не в прейскурантную цену одного вендора, а это как раз та ситуация, когда сквозной роутер оправдывает своё существование. OrcaRouter сегодня не маршрутизирует распознавание речи, и ни одной из этих моделей нет в его каталоге; что он делает — так это пропускает цены провайдеров с нулевой наценкой через 200+ языковых моделей, потребляющих живой транскрипт, поэтому снижение цены вендором в любом месте этого стека вступает в силу на стороне покупателя в тот же день, когда оно объявлено.

Часто задаваемые вопросы
Означает ли показатель WER 3,1% у Muse Voice Transcribe, что он точнее, чем VibeVoice-ASR-Streaming-7B?
Нет, и сравнение пока не имеет смысла. Заявленные Meta 3.1% — это цифра на день запуска для потокового пути, сообщённая вендором и не воспроизведённая независимо. VibeVoice-ASR-Streaming-7B вообще не публиковал показатель точности потоковой обработки в текстовом виде. Пока обе модели не прогнаны через один и тот же публичный стенд на одном и том же аудио, единственным честным утверждением остаётся то, что у Muse есть конкретная заявка, которую можно проверить, а у VibeVoice такой пока нет.
Могу ли я использовать любую из моделей на уже записанном аудио?
Да, оба, но по-разному. Muse Voice Transcribe обрабатывает записи длительностью более часа через тот же потоковый API. Плагин vLLM для VibeVoice-ASR-Streaming-7B предоставляет эндпоинт транскрибации целого файла наряду со своим WebSocket-эндпоинтом для потоковой передачи. Но оба рассчитаны на потоковый сценарий — и по архитектуре, и по цене: Muse — в силу бизнес-модели, ориентированной только на стриминг, а VibeVoice — в силу своей чанковой архитектуры, которая выдаёт результат по мере поступления аудио. Поэтому, если ваша нагрузка — это исключительно пакетная обработка файлов, специализированный API для транскрибации файлов обычно будет дешевле, а его показатели — лучше измерены, чем у любого из них.
