
VibeVoice-ASR-Streaming-7B против Whisper Large v3 Turbo: что стриминговый чекпоинт Microsoft добавляет к стандартной модели с открытыми весами
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
В течение большей части последних двух лет ответом на вопрос «расшифровать самим и дёшево» была Whisper Large v3 Turbo — модель OpenAI с открытыми весами и 809 миллионами параметров, лицензированная под MIT, поддерживающая 99 языков, достаточно компактная для запуска на рабочей станции и бесплатная, если у вас есть собственное оборудование. 2 сентября 2026 года Microsoft Research выложила конкурента этому стандарту: VibeVoice-ASR-Streaming-7B, потоковый чекпоинт с открытыми весами под лицензией MIT на Hugging Face, который распознаёт речь по мере поступления аудио, заявляет о выводе с привязкой к говорящим и — в отличие от модели, которую большинство команд уже используют — никогда не задумывался как пакетная задача. Обе модели имеют открытые веса от крупных лабораторий. Практически всё остальное в них — это компромисс, и эта страница о том, какой именно компромисс вы выбираете.
Одна асимметрия определяет всё сравнение, поэтому она идёт первой. Whisper Large v3 Turbo — самая воспроизводимая независимыми командами модель распознавания речи в мире: тысячи команд годами перепроверяли её показатели WER на публичных бенчмарках и на собственных аудиозаписях, а её слабые стороны задокументированы не хуже, чем сильные. VibeVoice-ASR-Streaming-7B появился только вчера, у него нет ни одного независимого бенчмарка, и Microsoft не публиковала потоковый WER в читаемом виде. Всё, что ниже относится к Microsoft, взято из репозитория — конфига, карточки модели и потоковой документации Microsoft — и имеет соответствующую пометку.
Открытые веса как стандарт по умолчанию и почему он сохраняется
Whisper Large v3 Turbo — это дистиллированный собрат Whisper Large v3: он сохраняет 32-слойный энкодер и сокращает декодер с 32 слоев до четырех, благодаря чему число параметров снижается до 809M, а пропускная способность на GPU примерно учетверяется при сохранении близкой точности. Благодаря весам под лицензией MIT и небольшому размеру модель стала стандартным встроенным движком транскрипции для ботов совещаний, инструментов создания субтитров и пайплайнов записи звонков. Ее ограничения тоже хорошо известны. Это пакетная модель — она принимает аудиофайл и возвращает транскрипт, а не генерирует слова по мере их произнесения. Она не обучалась для перевода, и на этой задаче ее качество резко падает. Ее точность на шумной, акцентированной или перекрывающейся речи неравномерна, а на выходе она дает обычный текст: без пунктуации и заглавных букв по умолчанию, без диаризации говорящих, без таймстампов в этой версии и без смещения по ключевым словам. Продакшн-стеки, построенные на Whisper, собирают эти компоненты по отдельности, и каждый добавляет собственные задержки и сценарии отказов.

Пробел в спецификации
• Параметры — 809M (дистиллированный декодер) против примерно 9B в сумме (языковой каркас Qwen2-7B плюс речевые энкодеры; «7B» относится к LLM, а на странице Hugging Face указано 9B).
• Лицензия — MIT, открытые веса, и то и другое.
• Стриминг — пакетный по своей сути: локально развёрнутые реализации стриминга обычно дают задержку 1–5 секунд против нативно-стриминговых: чанки по ~2,9 секунды с опережением ~0,5 секунды, текст выдаётся по каждому чанку, контекст сохраняется в KV-кэше.
• Языки — 99 с годами воспроизведения сообществом против заявленных 10 (en, zh, es, pt, de, ja, ko, fr, ru, it).
• Помимо расшифровки — по умолчанию ничего, в отличие от заявленной потоковой выдачи «кто что сказал» и настраиваемых горячих слов (не подтверждено).
• Заявленная точность: 2,1% WER на LibriSpeech test-clean, 4,2% на test-other, ~7,7% на Open ASR composite, 8–12% на шумном аудио в тестировании сообщества — всё независимо воспроизведено, в отличие от показателя WER для потокового режима, который не опубликован в виде текста.
• Потребление ресурсов — работает на ноутбуке или одной скромной GPU по сравнению с примерно 18 ГБ весов в bf16 без учёта KV-кэша; закладывайтесь на GPU класса 24 ГБ.

Что на самом деле добавляет стриминг
Причина вообще рассматривать что-то помимо Whisper Large v3 Turbo — это живой режим, и здесь две модели перестают быть сопоставимыми. Whisper ориентирован на пакетную обработку: чтобы получать слова, пока говорящий ещё говорит, команды добавляют разбиение на чанки, определение голосовой активности и склеивающий код, а самостоятельные потоковые реализации обычно дают задержку от одной до пяти секунд — не дотягиваясь до субсекундной планки для телефонных агентов и живых субтитров без серьёзной инженерии. VibeVoice-ASR-Streaming-7B создан именно для этого направления. Его конфигурация показывает, что аудио сжимается в 3200 раз до потока токенов частотой 7,5 кадра в секунду, обрабатывается чанками по 22 кадра с упреждением на четыре кадра — около 2,9 секунды аудио на чанк, — при этом текст выдаётся по мере разрешения каждого чанка, а более ранний контекст сохраняется в KV-кэше, так что сессия не пересчитывается с нуля. Такой темп — это архитектурное решение, вытекающее из конфигурации, а не измеренная задержка, и никто ещё не публиковал сквозную цифру для этого; тем не менее архитектура однозначно является архитектурой живой транскрипции, в отличие от Whisper.
Послужной список Whisper долгий и публичный; у нового чекпойнта он пуст.
Точность — та область, где возраст Whisper Large v3 Turbo оказывается преимуществом. Его показатели WER 2,1% на LibriSpeech test-clean и 4,2% на test-other — это цифры при открытых весах, воспроизведённые множеством команд; его примерно 7,7% на сводном лидерборде Open ASR отстают примерно на один процентный пункт от полной версии Large v3; а задокументированные 8–12% на зашумлённом аудио в тестировании сообществом означают, что никого это не удивляет. Эти слабости являются частью характеристик — они точно указывают, где модели нужна помощь, прежде чем вы начнёте строить на её основе.
У VibeVoice-ASR-Streaming-7B нет такого послужного списка. В карточке модели результаты оценки приведены в виде изображения, а технический отчёт Microsoft о потоковом распознавании речи — это PDF, но нигде нет ни одной цифры WER для потоковой модели, которую можно было бы процитировать в тексте. Единственная числовая точка опоры в семействе — таблица от вендора в карточке пакетной модели VibeVoice-ASR (средний WER 7,77% на восьми англоязычных тестовых наборах и 2,20% на LibriSpeech clean) — к данному чекпойнту отношения не имеет; отзывы сообщества о самой пакетной модели тоже неоднозначны: её хвалят за диаризацию «из коробки» и ругают за тяжеловесность и иногда возникающие галлюцинации. Ни одно из этих обстоятельств на потоковую модель не переносится — и в этом вся суть: с Whisper вы заранее знаете типичные сценарии отказов, а с VibeVoice-ASR-Streaming-7B вы — первый тестировщик.
Языки и размер: 99 против 10, 0.8B против 9B
Две самые осязаемые составляющие цены перехода — языковой охват и размер. Whisper Large v3 Turbo распознаёт 99 языков; на низкоресурсных и тональных языках качество деградирует — тайский, кантонский и валлийский обычно называют слабыми местами, — но за этим списком стоит многолетняя практика воспроизведения сообществом. VibeVoice-ASR-Streaming-7B заявляет десять: английский, китайский, испанский, португальский, немецкий, японский, корейский, французский, русский и итальянский. Если ваш трафик входит в эти десять, вопрос охвата снят; если нет — сравнение на этом заканчивается. Размер — вторая статья расходов: 809M параметров работает на ноутбуке, тогда как около 9B суммарных параметров в bf16 означает примерно 18 ГБ весов без учёта KV-кэша и видеокарту класса 24 ГБ для комфортного обслуживания. Для команд, уже запускающих Whisper на скромном оборудовании, это серьёзное повышение требований к инфраструктуре, оправданное только реальной необходимостью транскрипции в реальном времени.
Когда суть не в бесплатности.
Whisper Large v3 Turbo бесплатен в запуске; стоимость — это оборудование и инженерная работа вокруг него. Развёртывание faster-whisper на одной T4 обходится порядка $0.05–$0.10 за час аудио по текущей ставке GPU, а при постоянной нагрузке добавляется стек диаризации и пунктуации, который вам придётся построить, потому что Whisper возвращает простой текст. VibeVoice-ASR-Streaming-7B также бесплатен в запуске, но на более дорогом оборудовании — в обмен на потоковую архитектуру, которая заявляет об атрибуции говорящих и управлении контекстом, отсутствующих у Whisper; эти заявления вам пришлось бы проверять самостоятельно, поскольку независимых бенчмарков не существует. Для пакетной транскрипции в больших объёмах пропускная способность и компактность Whisper по-прежнему выигрывают. Для живого многоголосого аудио, когда транскрипт должен поступать во время разговора, Whisper работает вопреки своей конструкции, а потоковая контрольная точка — в согласии с ней, если она вообще работает; и это как раз тот вопрос, на который нужно ответить на собственном аудио и собственном GPU.

Прагматичный стек
Наиболее распространённый ответ в реальном мире — не «или/или», а «оба», и рекомендация здесь именно такова: оставить Whisper Large v3 Turbo в роли высокопроизводительного пакетного конвейера, где его послужной список и ресурсный след делают его непревзойдённым, а VibeVoice-ASR-Streaming-7B — оценить на живом канале, который Whisper не может обслужить с требуемой задержкой, причём с явным оценочным шлюзом, поскольку опираться здесь не на что. Обе модели могут делить один бюджет GPU и одну кодовую базу. Слой маршрутизации в этом стеке оправдывает себя на уровне выше транскриптов, а не на самой транскрипции: OrcaRouter сегодня не маршрутизирует распознавание речи, и ни одна из этих моделей не входит в его каталог, но суммаризаторы, правила алертинга и планировщики агентов, потребляющие живой транскрипт, — это ровно те 200+ языковых моделей, к которым он даёт доступ через единый API по ценам провайдеров без наценки и с автоматическим переключением между провайдерами. Потоковая контрольная точка, выпущенная без единого бенчмарка, заслуживает того же обращения, что и любая непроверенная модель: доля реального трафика за резервным маршрутом, которая завоёвывает или теряет ваше доверие на основании ваших собственных встреч, а не карточки модели.
