Титульная карточка со сравнением „VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo": надзаголовок „ASR с открытыми весами — сентябрь 2026"; подзаголовок: потоковый чекпойнт Microsoft против модели с открытыми весами по умолчанию — что добавляет стриминг и во что обходится разница между 0.8B и 9B параметров; чипы „веса MIT — 2 сентября", „веса MIT — 2024" и „Whisper: 99 языков"; также сноска „рекорд Whisper публичен". Логотип OrcaRouter вкомпонован в правый нижний угол.
Guides & Insights

VibeVoice-ASR-Streaming-7B против Whisper Large v3 Turbo: что стриминговый чекпоинт Microsoft добавляет к стандартной модели с открытыми весами

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

В течение большей части последних двух лет ответом на вопрос «расшифровать самим и дёшево» была Whisper Large v3 Turbo — модель OpenAI с открытыми весами и 809 миллионами параметров, лицензированная под MIT, поддерживающая 99 языков, достаточно компактная для запуска на рабочей станции и бесплатная, если у вас есть собственное оборудование. 2 сентября 2026 года Microsoft Research выложила конкурента этому стандарту: VibeVoice-ASR-Streaming-7B, потоковый чекпоинт с открытыми весами под лицензией MIT на Hugging Face, который распознаёт речь по мере поступления аудио, заявляет о выводе с привязкой к говорящим и — в отличие от модели, которую большинство команд уже используют — никогда не задумывался как пакетная задача. Обе модели имеют открытые веса от крупных лабораторий. Практически всё остальное в них — это компромисс, и эта страница о том, какой именно компромисс вы выбираете.

Одна асимметрия определяет всё сравнение, поэтому она идёт первой. Whisper Large v3 Turbo — самая воспроизводимая независимыми командами модель распознавания речи в мире: тысячи команд годами перепроверяли её показатели WER на публичных бенчмарках и на собственных аудиозаписях, а её слабые стороны задокументированы не хуже, чем сильные. VibeVoice-ASR-Streaming-7B появился только вчера, у него нет ни одного независимого бенчмарка, и Microsoft не публиковала потоковый WER в читаемом виде. Всё, что ниже относится к Microsoft, взято из репозитория — конфига, карточки модели и потоковой документации Microsoft — и имеет соответствующую пометку.

Открытые веса как стандарт по умолчанию и почему он сохраняется

Whisper Large v3 Turbo — это дистиллированный собрат Whisper Large v3: он сохраняет 32-слойный энкодер и сокращает декодер с 32 слоев до четырех, благодаря чему число параметров снижается до 809M, а пропускная способность на GPU примерно учетверяется при сохранении близкой точности. Благодаря весам под лицензией MIT и небольшому размеру модель стала стандартным встроенным движком транскрипции для ботов совещаний, инструментов создания субтитров и пайплайнов записи звонков. Ее ограничения тоже хорошо известны. Это пакетная модель — она принимает аудиофайл и возвращает транскрипт, а не генерирует слова по мере их произнесения. Она не обучалась для перевода, и на этой задаче ее качество резко падает. Ее точность на шумной, акцентированной или перекрывающейся речи неравномерна, а на выходе она дает обычный текст: без пунктуации и заглавных букв по умолчанию, без диаризации говорящих, без таймстампов в этой версии и без смещения по ключевым словам. Продакшн-стеки, построенные на Whisper, собирают эти компоненты по отдельности, и каждый добавляет собственные задержки и сценарии отказов.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

Пробел в спецификации

• Параметры — 809M (дистиллированный декодер) против примерно 9B в сумме (языковой каркас Qwen2-7B плюс речевые энкодеры; «7B» относится к LLM, а на странице Hugging Face указано 9B).

• Лицензия — MIT, открытые веса, и то и другое.

• Стриминг — пакетный по своей сути: локально развёрнутые реализации стриминга обычно дают задержку 1–5 секунд против нативно-стриминговых: чанки по ~2,9 секунды с опережением ~0,5 секунды, текст выдаётся по каждому чанку, контекст сохраняется в KV-кэше.

• Языки — 99 с годами воспроизведения сообществом против заявленных 10 (en, zh, es, pt, de, ja, ko, fr, ru, it).

• Помимо расшифровки — по умолчанию ничего, в отличие от заявленной потоковой выдачи «кто что сказал» и настраиваемых горячих слов (не подтверждено).

• Заявленная точность: 2,1% WER на LibriSpeech test-clean, 4,2% на test-other, ~7,7% на Open ASR composite, 8–12% на шумном аудио в тестировании сообщества — всё независимо воспроизведено, в отличие от показателя WER для потокового режима, который не опубликован в виде текста.

• Потребление ресурсов — работает на ноутбуке или одной скромной GPU по сравнению с примерно 18 ГБ весов в bf16 без учёта KV-кэша; закладывайтесь на GPU класса 24 ГБ.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): parameters - about 9B (Qwen2-7B + encoders); streaming - native, ~2.9 s chunks; WER in print - none in text; output extras - claimed speaker IDs + hotwords; languages - 10 declared; hardware - ~18 GB bf16, 24 GB-class GPU. Right column Whisper Large v3 Turbo (open weights, released 2024): 809M distilled; batch, 1-5 s self-host streaming; 2.1% / 4.2% LibriSpeech, ~7.7% Open ASR; none by default; 99; laptop to small GPU. Footer: 'Whisper WER independently reproduced. VibeVoice specs read from the HF repo; no benchmark exists yet.'

Что на самом деле добавляет стриминг

Причина вообще рассматривать что-то помимо Whisper Large v3 Turbo — это живой режим, и здесь две модели перестают быть сопоставимыми. Whisper ориентирован на пакетную обработку: чтобы получать слова, пока говорящий ещё говорит, команды добавляют разбиение на чанки, определение голосовой активности и склеивающий код, а самостоятельные потоковые реализации обычно дают задержку от одной до пяти секунд — не дотягиваясь до субсекундной планки для телефонных агентов и живых субтитров без серьёзной инженерии. VibeVoice-ASR-Streaming-7B создан именно для этого направления. Его конфигурация показывает, что аудио сжимается в 3200 раз до потока токенов частотой 7,5 кадра в секунду, обрабатывается чанками по 22 кадра с упреждением на четыре кадра — около 2,9 секунды аудио на чанк, — при этом текст выдаётся по мере разрешения каждого чанка, а более ранний контекст сохраняется в KV-кэше, так что сессия не пересчитывается с нуля. Такой темп — это архитектурное решение, вытекающее из конфигурации, а не измеренная задержка, и никто ещё не публиковал сквозную цифру для этого; тем не менее архитектура однозначно является архитектурой живой транскрипции, в отличие от Whisper.

Послужной список Whisper долгий и публичный; у нового чекпойнта он пуст.

Точность — та область, где возраст Whisper Large v3 Turbo оказывается преимуществом. Его показатели WER 2,1% на LibriSpeech test-clean и 4,2% на test-other — это цифры при открытых весах, воспроизведённые множеством команд; его примерно 7,7% на сводном лидерборде Open ASR отстают примерно на один процентный пункт от полной версии Large v3; а задокументированные 8–12% на зашумлённом аудио в тестировании сообществом означают, что никого это не удивляет. Эти слабости являются частью характеристик — они точно указывают, где модели нужна помощь, прежде чем вы начнёте строить на её основе.

У VibeVoice-ASR-Streaming-7B нет такого послужного списка. В карточке модели результаты оценки приведены в виде изображения, а технический отчёт Microsoft о потоковом распознавании речи — это PDF, но нигде нет ни одной цифры WER для потоковой модели, которую можно было бы процитировать в тексте. Единственная числовая точка опоры в семействе — таблица от вендора в карточке пакетной модели VibeVoice-ASR (средний WER 7,77% на восьми англоязычных тестовых наборах и 2,20% на LibriSpeech clean) — к данному чекпойнту отношения не имеет; отзывы сообщества о самой пакетной модели тоже неоднозначны: её хвалят за диаризацию «из коробки» и ругают за тяжеловесность и иногда возникающие галлюцинации. Ни одно из этих обстоятельств на потоковую модель не переносится — и в этом вся суть: с Whisper вы заранее знаете типичные сценарии отказов, а с VibeVoice-ASR-Streaming-7B вы — первый тестировщик.

Языки и размер: 99 против 10, 0.8B против 9B

Две самые осязаемые составляющие цены перехода — языковой охват и размер. Whisper Large v3 Turbo распознаёт 99 языков; на низкоресурсных и тональных языках качество деградирует — тайский, кантонский и валлийский обычно называют слабыми местами, — но за этим списком стоит многолетняя практика воспроизведения сообществом. VibeVoice-ASR-Streaming-7B заявляет десять: английский, китайский, испанский, португальский, немецкий, японский, корейский, французский, русский и итальянский. Если ваш трафик входит в эти десять, вопрос охвата снят; если нет — сравнение на этом заканчивается. Размер — вторая статья расходов: 809M параметров работает на ноутбуке, тогда как около 9B суммарных параметров в bf16 означает примерно 18 ГБ весов без учёта KV-кэша и видеокарту класса 24 ГБ для комфортного обслуживания. Для команд, уже запускающих Whisper на скромном оборудовании, это серьёзное повышение требований к инфраструктуре, оправданное только реальной необходимостью транскрипции в реальном времени.

Когда суть не в бесплатности.

Whisper Large v3 Turbo бесплатен в запуске; стоимость — это оборудование и инженерная работа вокруг него. Развёртывание faster-whisper на одной T4 обходится порядка $0.05–$0.10 за час аудио по текущей ставке GPU, а при постоянной нагрузке добавляется стек диаризации и пунктуации, который вам придётся построить, потому что Whisper возвращает простой текст. VibeVoice-ASR-Streaming-7B также бесплатен в запуске, но на более дорогом оборудовании — в обмен на потоковую архитектуру, которая заявляет об атрибуции говорящих и управлении контекстом, отсутствующих у Whisper; эти заявления вам пришлось бы проверять самостоятельно, поскольку независимых бенчмарков не существует. Для пакетной транскрипции в больших объёмах пропускная способность и компактность Whisper по-прежнему выигрывают. Для живого многоголосого аудио, когда транскрипт должен поступать во время разговора, Whisper работает вопреки своей конструкции, а потоковая контрольная точка — в согласии с ней, если она вообще работает; и это как раз тот вопрос, на который нужно ответить на собственном аудио и собственном GPU.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

Прагматичный стек

Наиболее распространённый ответ в реальном мире — не «или/или», а «оба», и рекомендация здесь именно такова: оставить Whisper Large v3 Turbo в роли высокопроизводительного пакетного конвейера, где его послужной список и ресурсный след делают его непревзойдённым, а VibeVoice-ASR-Streaming-7B — оценить на живом канале, который Whisper не может обслужить с требуемой задержкой, причём с явным оценочным шлюзом, поскольку опираться здесь не на что. Обе модели могут делить один бюджет GPU и одну кодовую базу. Слой маршрутизации в этом стеке оправдывает себя на уровне выше транскриптов, а не на самой транскрипции: OrcaRouter сегодня не маршрутизирует распознавание речи, и ни одна из этих моделей не входит в его каталог, но суммаризаторы, правила алертинга и планировщики агентов, потребляющие живой транскрипт, — это ровно те 200+ языковых моделей, к которым он даёт доступ через единый API по ценам провайдеров без наценки и с автоматическим переключением между провайдерами. Потоковая контрольная точка, выпущенная без единого бенчмарка, заслуживает того же обращения, что и любая непроверенная модель: доля реального трафика за резервным маршрутом, которая завоёвывает или теряет ваше доверие на основании ваших собственных встреч, а не карточки модели.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube