Сгенерированная титульная карточка для «VibeVoice-ASR-Streaming-1.5B против Whisper Large v3 Turbo: нативный стриминг против 99-язычной рабочей лошадки» с подзаголовком «Нативный стриминг против 99-язычной рабочей лошадки», с двумя карточками моделей — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 сентября 2026 · MIT · нативный стриминг · 10 языков) и Whisper Large v3 Turbo (OpenAI · октябрь 2024 · MIT · пакетный режим · 99 языков) — и тегами: «чанки ~2,9 с + упреждение ~0,5 с», «7 млн+ скачиваний в месяц (Whisper)», «бенчмарк пока не опубликован». Логотип OrcaRouter вкомпонован в правый нижний угол.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B против Whisper Large v3 Turbo: нативная потоковая передача против рабочей лошадки на 99 языков

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Скорее всего, модель распознавания речи, которую вы используете сегодня, — это Whisper Large v3 Turbo, и появилась новая модель, которая претендует на это место. Whisper Large v3 Turbo от OpenAI — дистиллированный чекпойнт на 809 млн параметров, выпущенный в октябре 2024 года, — рабочая лошадка с открытыми весами: поддержка 99 языков, скорость в четыре–восемь раз выше, чем у оригинальной large-v3, возможность запуска на ноутбуке, лицензия MIT и поддержка крупнейшей из существующих экосистем транскрибации. VibeVoice-ASR-Streaming-1.5B, опубликованная Microsoft Research 2 сентября 2026 года, — претендент, созданный для того, чего Whisper не делает нативно: потоковой транскрибации. Она транскрибирует фрагментами по мере поступления аудио, а не проглатывает фиксированные окна, заявляет об атрибуции говорящих — и при этом поддерживает всего десять языков и не имеет ни одного опубликованного бенчмарка.

Эта последняя оговорка — причина, по которой эта страница построена вокруг вопроса миграции, а не соревнования моделей. Показатели Whisper Large v3 Turbo измерены и публичны: LibriSpeech, составной бенчмарк Open ASR, Common Voice. Тогда как карточка модели VibeVoice-ASR-Streaming-1.5B не публикует ни одного значения WER или задержки в текстовом виде, и на момент написания независимых бенчмарков не существует. Всё, что сказано ниже о стороне Microsoft, — это то, что можно узнать из её репозитория: конфигурационные файлы, карточка модели и документация Microsoft по потоковой передаче. Всё, что касается стороны Whisper, — это установленные публичные данные. Модели не запускались в прямом сравнении; сравнение проводится между тем, что доказано, и тем, что обещано.

Модель, которую вы, вероятно, уже запускаете.

Whisper Large v3 Turbo заслужил своё место негламурным способом: он быстрый, компактный, многоязычный и скучный в тех аспектах, которые нравятся продакшн-командам. Дистиллированный из Whisper large-v3 с 1,55 млрд параметров до 809 млн параметров, он сохраняет поддержку 99 языков и примерно 95% точности large-v3 — около 2,1% WER на чистом LibriSpeech, примерно 7,7–7,8% на композите Open ASR, с наибольшим ухудшением на низкоресурсных и тональных языках — при этом работает в несколько раз быстрее и занимает около 1,6 ГБ видеопамяти в FP16. Он распространяется по лицензии MIT, работает через faster-whisper, whisper.cpp и три года интеграций, а на его странице на Hugging Face за один месяц более семи миллионов загрузок. Если вы хостите транскрипцию самостоятельно, скорее всего, именно эта модель её выполняет.

Whisper Large v3 Turbo не является потоковой моделью — и никогда на это не претендовал. Он обрабатывает аудио фиксированными 30-секундными окнами и возвращает транскрипт для каждого окна; у него нет нативного обнаружения голосовой активности, нет эндпоинтинга, нет диаризации дикторов и нет механизма «горячих слов». Живая транскрипция на Whisper всегда является доработкой, которую вы создаёте сами, — и именно в этой доработке сосредоточены задержка и инженерные затраты.

Что на самом деле изменится, если переключиться

• Модель задержки — VibeVoice-ASR-Streaming-1.5B по своей конструкции выдаёт текст один раз за финализированный чанк длительностью около 2,9 секунды с упреждением ~0,5 с, в отличие от Whisper Large v3 Turbo — пакетной модели с 30-секундным окном, которой для приближения вывода к реальному времени требуется слой разбиения на чанки и их сшивания.

• Форма сеанса — неограниченные сеансы в реальном времени, где контекст переносится между сегментами через префиксный кэш, в отличие от дискретных 30-секундных окон без состояния диалога между окнами.

• Языки — десять (китайский, английский, французский, немецкий, итальянский, японский, корейский, португальский, русский, испанский) против 99.

• Точность в публикациях — ни одного опубликованного результата против ~2,1% LibriSpeech clean, ~7,7–7,8% Open ASR composite; всё измерено и находится в открытом доступе.

• Дополнительные возможности вывода — заявлены потоковая атрибуция «кто что сказал» и горячие слова, тогда как доступны временные метки слов, но отсутствуют диаризация и встроенная поддержка горячих слов.

{{1}}Аппаратное обеспечение: ~5,6 ГБ весов bf16{{2}} на NVIDIA GPU при установке из исходников{{/2}} против ~1,6 ГБ во FP16{{3}},{{/3}} работает на ноутбуках и CPU{{4}} через{{/4}} whisper.cpp{{5}} и{{/5}} faster-whisper{{6}}.{{/6}}

• Лицензия — MIT, оба.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Streaming native ~2.9 s chunks, Languages 10, WER none published, Extras who-said-what + hotwords, Hardware ~5.6 GB NVIDIA GPU, License MIT. Right column Whisper Large v3 Turbo: Released Oct 2024, Streaming none / 30 s windows, Languages 99, WER ~2.1% LibriSpeech clean, Extras timestamps, no diarization, Hardware ~1.6 GB laptop-class, License MIT. Footer reads 'Whisper figures measured and public; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

Проблема ретрофита потоковой передачи

Честный способ оценить это сравнение — признать, что у Whisper Large v3 Turbo есть проблема с потоковой обработкой, за которую вы уже заплатили или всё ещё платите. Живой конвейер на основе Whisper означает детектор голосовой активности для поиска речи, чанкер для нарезки аудио на окна размером под Whisper, перекрывающиеся окна, чтобы слова не терялись на границах, и сборщик для согласования частичных транскриптов. Сообщественные реализации такого стека дают примерно от одной до пяти секунд сквозной задержки — приемлемо для заметок с совещаний, но не дотягивает до уровня телефонных агентов и живых субтитров.

VibeVoice-ASR-Streaming-1.5B по построению исключает доработку. Его конфигурация препроцессора задаёт блок из 22 кадров и упреждение в 4 кадра на потоке речевых токенов с частотой около 7,5 Гц — это примерно 2,9 секунды аудио на каждый выдаваемый сегмент и полсекунды будущего контекста; документация Microsoft описывает, что контекст из более ранних блоков сохраняется через KV-кэш, так что живая сессия не пересчитывается с нуля. Но внимательно прочтите слово «streaming» в обеих частях этого сравнения: ни одна из моделей не является механизмом частичных результатов по отдельным словам, которые продают коммерческие API с самой низкой задержкой. Транскрипт VibeVoice намеренно растёт примерно трёхсекундными приращениями — это другой и обычно приемлемый для совещаний темп, но не субсекундный. И если ваше требование — слова на экране в течение секунды, вам стоит оценить эту геометрию блоков относительно такого бюджета, прежде чем строить на ней решение.

Точность: чем вы жертвуете, переходя на нативную потоковую передачу

Вот в чём разрыв, который и должен определять решение. У Whisper Large v3 Turbo есть публичные показатели точности, которые можно проверить, — и когда язык записи входит в число его 99 языков, эти показатели убедительны. У VibeVoice-ASR-Streaming-1.5B таких показателей нет: оценка в карточке модели — это изображение; Microsoft не опубликовал потоковый WER в текстовом виде; и единственный числовой ориентир во всём семействе — заявленный вендором средний WER 7,77% на восьми английских тестовых наборах из карточки пакетной модели VibeVoice-ASR, описывающей другую, не потоковую модель. Если говорить честно, перевести вашу транскрибацию на VibeVoice-ASR-Streaming-1.5B уже сегодня — значит принять неизвестный уровень точности на вашем собственном аудио — и именно поэтому любую оценку этой модели вы должны проводить сами, на самых сложных реальных записях, прежде чем она получит право на продакшн-трафик.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Языки и атрибуция говорящего: разрыв в возможностях работает в обе стороны.

Сравнение возможностей не одностороннее, и именно это делает выбор по-настоящему интересным. Если ваш аудиоматериал многоязычен, решение очевидно: 99 языков Whisper Large v3 Turbo покрывают то, что не покрывают десять языков VibeVoice-ASR-Streaming-1.5B, а потолок в десять языков дисквалифицирует любой пайплайн, работающий с широким спектром речи. Но если ваша нагрузка укладывается в эти десять языков и вам на самом деле нужно знать, кто и что сказал на живом совещании, стрелка указывает в другую сторону: Whisper не предлагает ни встроенной диаризации, ни горячих слов, тогда как VibeVoice-ASR-Streaming-1.5B заявляет и то и другое — потоковый вывод с атрибуцией говорящего и доменные горячие слова, передаваемые в качестве контекстного промпта. Это заявление не проверено, а потоковая диаризация на границах чанков достаточно сложна, чтобы заслуживать скепсиса, но это конкретная функция, которую никакие инженерные ухищрения с Whisper не дадут вам из коробки.

Математика миграции

По затратам и трудозатратам преимущество у действующего решения. Whisper Large v3 Turbo уже работает в вашем стеке на оборудовании, которым вы владеете, — ноутбуке, CPU, скромной GPU, — а переход на VibeVoice-ASR-Streaming-1.5B означает развёртывание исследовательской сборки из исходников на NVIDIA GPU с ~5,6 ГБ весов, проверку пути загрузки, класс архитектуры которого пока не описан в публичной документации Transformers, и создание с нуля бенчмарка, от которого зависит ваше решение. Это самый настоящий проект, и его отдача обусловлена тем, насколько значимы для вас эти непроверенные функции.

A screenshot of the Hugging Face model card for openai/whisper-large-v3-turbo, showing the OpenAI namespace, the model title Whisper, the MIT license tag, the 99-languages tag, and the automatic-speech-recognition pipeline tags, with the description of Whisper as a state-of-the-art automatic speech recognition model.

Экономичный способ запустить этот проект — не рассматривать его как замену. Оставьте Whisper Large v3 Turbo в качестве модели по умолчанию и направляйте часть живого аудио в VibeVoice-ASR-Streaming-1.5B через один API — именно для этого и существует слой маршрутизации: более 200 моделей за одной конечной точкой по ценам из прайс-листа провайдера без наценки, автоматическое переключение на резерв, когда новая модель дает сбой, и маршрутизирующий DSL, который позволяет разным рабочим нагрузкам выбирать разных транскрайберов в рамках одного вызова. Такова модель OrcaRouter, и это разница между тем, чтобы поставить свой производственный пайплайн на чекпойнт двухдневной давности, и тем, чтобы дать этому чекпойнту заслужить место рядом с рабочей лошадкой на ваших собственных транскриптах.

Часто задаваемые вопросы

Может ли Whisper Large v3 Turbo вообще работать с прямой трансляцией?

Только как доработка. Whisper Large v3 Turbo — это пакетная модель, которая обрабатывает фиксированные 30-секундные окна, поэтому для живой транскрипции поверх неё нужно построить детектор речевой активности, чанкер, стратегию перекрытия и сшиватель. Рабочие реализации существуют и обеспечивают задержку примерно от одной до пяти секунд — этого достаточно для заметок со встреч, но не дотягивает до субсекундной планки, необходимой телефонным агентам и субтитрам в реальном времени. VibeVoice-ASR-Streaming-1.5B — изначально потоковая модель: она выдаёт текст порциями по ~2,9 секунды с упреждением ~0,5 секунды, — но это потоковая обработка фрагментами, а не частичные результаты по словам, так что сверьте этот темп со своим бюджетом задержки.

Является ли VibeVoice-ASR-Streaming-1.5B более точной, чем Whisper Large v3 Turbo?

Никто пока не может ответить на этот вопрос, включая Microsoft. Точность Whisper Large v3 Turbo измерена и публична — примерно 2,1% WER на LibriSpeech clean и 7,7–7,8% на композитном наборе Open ASR. VibeVoice-ASR-Streaming-1.5B не имеет ни опубликованного в текстовом виде значения потокового WER, ни независимых бенчмарков на момент написания. Единственный способ ответить на вопрос — запустить чекпойнт на собственном аудио и сравнить транскрипты с вашей текущей системой — это именно тот тест, который данная страница рекомендует провести перед любой миграцией.

Какие языки поддерживают оба?

Whisper Large v3 Turbo поддерживает 99 языков с одним набором весов. VibeVoice-ASR-Streaming-1.5B перечисляет десять: китайский, английский, французский, немецкий, итальянский, японский, корейский, португальский, русский и испанский. Для любого аудио вне этого набора из десяти языков Whisper — единственный вариант в этой паре, и многоязычный разрыв — самая очевидная причина, по которой большинство команд останутся там, где они есть.

Whisper Large v3 Turbo — правильная модель для большинства команд в большинстве случаев, и двухдневный чекпоинт без бенчмарков — не повод менять платформу. Это повод запустить эксперимент. Если ваше аудио входит в его десять языков и атрибуция говорящего в реальном времени изменит ваш продукт, поднимите VibeVoice-ASR-Streaming-1.5B за роутером, направьте на него долю реального трафика и пусть транскрипты — а не отсутствие бенчмарка с той или иной стороны — принимают решение.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube