Сгенерированная титульная карточка для «VibeVoice-ASR-Streaming-1.5B против NVIDIA Parakeet TDT 0.6B: непроверенный претендент MIT против чемпиона Open ASR», с подзаголовком «Проверенный стандарт против вчерашнего претендента», с двумя карточками моделей — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 сентября 2026 · MIT · бенчмарки ещё не опубликованы) и NVIDIA Parakeet TDT 0.6B (NVIDIA · 5 мая 2025 · CC-BY-4.0 · №1 в Open ASR с мая 2025) — и тегами «6.05% средний WER (Parakeet)», «16 месяцев разницы» и «Кто-что-сказал + hotwords (Microsoft, непроверено)». В правом нижнем углу размещён логотип OrcaRouter.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B против NVIDIA Parakeet TDT 0.6B: непроверенный претендент под лицензией MIT против чемпиона Open ASR

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Если вам нужен speech-to-text с открытыми весами в продакшене уже сегодня, существует вариант по умолчанию, и его имя — NVIDIA Parakeet TDT 0.6B. С мая 2025 года Parakeet TDT 0.6B v2 с 600 миллионами параметров удерживает первое место в рейтинге Hugging Face Open ASR со средним показателем ошибок в словах 6,05% — позицию, которую сторонние участники воспроизводят уже более года. Самый новый претендент — VibeVoice-ASR-Streaming-1.5B, который Microsoft Research опубликовала 2 сентября 2026 года — на шестнадцать месяцев позже Parakeet — под лицензией MIT, с заявленной потоковой атрибуцией говорящего и пока что вообще без опубликованных показателей точности. На этой странице сравниваются чемпион и претендент по доказательной базе, архитектуре и тому, что каждая из них реально предлагает из коробки.

Перед техническими характеристиками важны два ярлыка, поскольку они задают всю форму этого противостояния. Показатели Parakeet устоялись: средний WER 6,05% и пропускная способность ~3 386 RTFx, стоящие за его заявлением «час аудио примерно за секунду», уже более года находятся на публичных лидербордах и в материалах NVIDIA. Что касается VibeVoice-ASR-Streaming-1.5B, то его сторона страницы — это то, что можно узнать из репозитория: карточка модели, конфигурационные файлы и документация Microsoft по стримингу, — поскольку Microsoft не публиковала ни WER, ни задержку, ни пропускную способность в текстовом виде, и на момент написания не существует независимого бенчмарка этой контрольной точки. Одна колонка каждого сравнения ниже проверена в бою; другая — это лист технических характеристик.

Их разделяют шестнадцать месяцев и одно правление в таблице лидеров

Parakeet TDT 0.6B v2 появился 5 мая 2025 года как ответ NVIDIA на проблему потокового распознавания речи (streaming ASR): энкодер FastConformer в паре с декодером-трансдьюсером токенов и длительностей (TDT), который предсказывает каждый токен и его длительность за один шаг, — эффективный приём, убирающий накладные расходы на пустые токены обычного трансдьюсера. Модель выпущена под лицензией CC-BY-4.0, коммерчески пригодна и возглавила рейтинг Open ASR благодаря среднему уровню ошибок распознавания слов 6,05%. В ней также появились функции для реального применения, которые рейтинг не измеряет: пунктуация, восстановление регистра, временные метки на уровне слов — а также энкодер с полным вниманием, принимающий до 24 минут аудио за один проход, что делает её полезной для длинных совещаний и подкастов без агрессивного разбиения на фрагменты.

VibeVoice-ASR-Streaming-1.5B — это challenger в самом чистом смысле: он существует, он задокументирован, и ничего о том, насколько хорошо он работает, не установлено. Новостная строка Microsoft на GitHub, датированная 3 сентября, анонсирует единую потоковую модель ASR, которая «непрерывно транскрибирует, кто и что сказал, по мере поступления речи», с hotwords и десятью языками, а конфиг чекпоинта описывает совершенно иную инженерную традицию — декодер языковой модели семейства Qwen2, питаемый свёрточными аудиотокенизаторами, с диффузионной головкой, выдающей результат фрагментами примерно по 2,9 секунды и с упреждением примерно 0,5 секунды. Тогда как Parakeet — это специализированная речевая модель, отточенная за год реальных развёртываний, VibeVoice-ASR-Streaming-1.5B — это чекпоинт исследовательского семейства, которому два дня от роду.

Асимметрия доказательств и есть суть.

Прочитайте остальную часть этой страницы, помня об одном факте: в этом сравнении цифры есть только на одной стороне. На стороне Parakeet TDT 0.6B — год защиты своей позиции в лидерборде: средний WER 6,05 % на публичных англоязычных наборах коротких высказываний Open ASR, около 3 386 RTFx при батче 128 на оборудовании NVIDIA и экосистема инструментов развёртывания NeMo, ускорения TensorRT и квантования FP8, проверенная в продакшене. На стороне VibeVoice-ASR-Streaming-1.5B — результат оценки из карточки модели в виде изображения, а не текста, а также заявленный вендором в карточке batch-модели VibeVoice-ASR средний WER 7,77 % на восьми англоязычных тестовых наборах. Это число описывает batch-модель, а не потоковую, и не может быть перенесено на этот чекпойнт. Претендент вполне может быть отличным; суть в том, что «вполне может быть» — это и есть вся доказательная база.

Проверка спецификации

• Параметры — NVIDIA Parakeet TDT 0.6B: 600M, энкодер FastConformer + декодер TDT против VibeVoice-ASR-Streaming-1.5B: ~3B суммарно (основа Qwen класса 1.5B плюс токенизаторы и диффузионная головка).

Выпущено — 5 мая 2025 г. против 2 сентября 2026 г.

• Точность — 6,05 % среднего WER, №1 в Open ASR с мая 2025 года; результат воспроизведён третьей стороной, тогда как конкуренты не опубликовали ничего.

• Скорость — ~3 386 RTFx при batch 128 на оборудовании NVIDIA, ~1 час аудио в секунду, тогда как опубликованных показателей пропускной способности нет.

• Стриминг — возможность потоковой передачи с контекстом полного внимания до 24 минут за проход, в отличие от чанкованного стриминга с чанками по ~2,9 с и упреждением ~0,5 с.

• Дополнительные возможности вывода — пунктуация, заглавные буквы, пословные временные метки vs потоковая атрибуция «кто что сказал» (непроверенная) и ключевые слова; десять языков.

• Лицензия — CC-BY-4.0 против MIT.

• Экосистема — NVIDIA NeMo с TensorRT и FP8 против демо-версий репозитория microsoft/VibeVoice и плагина vLLM.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total, Architecture speech LLM + diffusion, WER none published, Streaming ~2.9 s chunks, Extras who-said-what + hotwords, License MIT. Right column NVIDIA Parakeet TDT 0.6B v2: Released May 5 2025, Params 600M, Architecture FastConformer + TDT, WER 6.05% Open ASR #1, Streaming full-attention up to 24 min, Extras punctuation + timestamps, License CC-BY-4.0. Footer reads 'Parakeet figures per the Open ASR leaderboard, settled since 2025; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Под капотом: две идеи о том, для чего нужны речевые модели

Эти архитектуры воплощают два разных взгляда на задачу. {{1}}Parakeet TDT 0.6B рассматривает транскрибацию как эффективно решаемую задачу обработки сигналов: энкодер FastConformer извлекает акустические признаки, а декодер TDT совместно генерирует текстовые токены и длительности, поэтому он работает в тысячи раз быстрее реального времени и отлично чувствует себя в стеке развертывания NVIDIA.{{/1}} {{2}}VibeVoice-ASR-Streaming-1.5B рассматривает транскрибацию как языковую задачу: аудио сжимается в поток токенов и подается языковой модели, которая удерживает в контексте целую расшифровку, — и понимание модели того, кто что говорит и как реплики складываются в диалог, делает всю работу.{{/2}} Наличие LLM в основе объясняет также, почему чекпойнт насчитывает {{3}}~3 млрд параметров, а не 600 млн{{/3}}, и почему Microsoft не заявляла о работе на периферийных устройствах — {{4}}это модель, которой нужен GPU и которая использует память для хранения контекста{{/4}}.

Для живой транскрипции практическое следствие — это характер задержки. Полновнимательный энкодер Parakeet может обрабатывать длинные окна за один проход, что представляет собой иную философию потоковой обработки по сравнению с фиксированным контрактом VibeVoice-ASR-Streaming-1.5B на чанки с упреждением, где на каждый выдаваемый сегмент приходится примерно 2,9 секунды аудио. Ни одна из систем не является потоковым сервисом с частичными результатами по словам в стиле коммерческих API с минимальной задержкой; обе работают с чанками, и выбор правильной зависит от того, поступает ли ваш аудио в виде ограниченных файлов или в виде непрерывной живой сессии.

История функции и районы развертывания

Из коробки Parakeet TDT 0.6B — более полноценный продукт для транскрибации: пунктуация и заглавные буквы приходят вместе с транскриптом, есть временные метки для каждого слова для выравнивания, а 24-минутные однопроходные окна означают меньше ошибок разбиения на фрагменты на длинных записях. VibeVoice-ASR-Streaming-1.5B парирует функциями, которых нет в списке Parakeet: вывод с атрибуцией говорящих и hotwords, на десяти языках. Утверждение о потоковой диаризации — как раз то, что требует независимой проверки: именно на границах фрагментов атрибуция может сбиваться. Но это как раз причина присмотреться к модели Microsoft, а не NVIDIA, если ваше требование — знать, кто что сказал на совещании в реальном времени.

A screenshot of the Hugging Face model card for nvidia/parakeet-tdt-0.6b-v2, showing the NVIDIA namespace, the model title 'Parakeet TDT 0.6B V2 (En)', the automatic-speech-recognition and NeMo pipeline tags, and the card description of the 600-million-parameter FastConformer model with TDT decoder, punctuation and timestamps, audio segments up to 24 minutes in a single pass, and an RTFx of 3380 on the Open ASR leaderboard at batch 128.

Районы их обитания различаются не меньше, чем сами модели. Parakeet TDT 0.6B — часть экосистемы NVIDIA NeMo: TensorRT, FP8 и инструменты развертывания, оптимизированные под NVIDIA GPU, — что отлично, если вы уже работаете на инфраструктуре NVIDIA. VibeVoice-ASR-Streaming-1.5B живет в исследовательском репозитории: документированных путей два — Python-демо от Microsoft и плагин для vLLM; его архитектурный класс еще не включен в публичную документацию Transformers, а запуск означает установку из исходников и собственную проверку того, что путь загрузки работает. Для команды, которая ценит простое и документированное развертывание, уже одной этой разницы достаточно, чтобы перевесить разрыв по бенчмаркам.

Аргументы за действующего кандидата, аргументы за претендента

Аргумент в пользу NVIDIA Parakeet TDT 0.6B — это аргумент в пользу проверенной величины: год удержания позиций в лидербордах, воспроизведение сторонними командами, коммерческая лицензия, продакшн-возможности и экосистема развёртывания, выдержавшая реальный трафик. Если в этом квартале вы внедряете функцию транскрибации английской речи и вам нужны открытые веса — это обоснованный вариант по умолчанию, и бремя доказательства лежит на всём, что претендует на его замену.

Обоснование для VibeVoice-ASR-Streaming-1.5B уже и конкретнее: вам нужна потоковая атрибуция говорящего или хот-слова, вам нужно больше, чем английский, или вы верите, что подход к речи на основе языковых моделей победит, и хотите быть среди первых. Это ставка, а не решение — пока нет цифр, чтобы оправдать перевод на неё производственного трафика, и сама Microsoft занимает позицию «сначала исследования». Ни одна из моделей сегодня не обслуживается через OrcaRouter, поэтому недорогой способ проверить ставку — это паттерн, применимый к любой молодой открытой модели: держите слой распознавания речи за одним маршрутизирующим API, который предоставляет доступ к более чем 200 моделям по прейскуранту провайдера без наценки и с автоматическим переключением при сбоях, направляйте часть реального аудио на VibeVoice-ASR-Streaming-1.5B, как только провайдер её разместит, и пусть транскрипты вашего собственного трафика решают, заслуживает ли претендент корону, которую Parakeet удерживает уже шестнадцать месяцев.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube