
VibeVoice-ASR-Streaming-1.5B против NVIDIA Parakeet TDT 0.6B: непроверенный претендент под лицензией MIT против чемпиона Open ASR
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
Если вам нужен speech-to-text с открытыми весами в продакшене уже сегодня, существует вариант по умолчанию, и его имя — NVIDIA Parakeet TDT 0.6B. С мая 2025 года Parakeet TDT 0.6B v2 с 600 миллионами параметров удерживает первое место в рейтинге Hugging Face Open ASR со средним показателем ошибок в словах 6,05% — позицию, которую сторонние участники воспроизводят уже более года. Самый новый претендент — VibeVoice-ASR-Streaming-1.5B, который Microsoft Research опубликовала 2 сентября 2026 года — на шестнадцать месяцев позже Parakeet — под лицензией MIT, с заявленной потоковой атрибуцией говорящего и пока что вообще без опубликованных показателей точности. На этой странице сравниваются чемпион и претендент по доказательной базе, архитектуре и тому, что каждая из них реально предлагает из коробки.
Перед техническими характеристиками важны два ярлыка, поскольку они задают всю форму этого противостояния. Показатели Parakeet устоялись: средний WER 6,05% и пропускная способность ~3 386 RTFx, стоящие за его заявлением «час аудио примерно за секунду», уже более года находятся на публичных лидербордах и в материалах NVIDIA. Что касается VibeVoice-ASR-Streaming-1.5B, то его сторона страницы — это то, что можно узнать из репозитория: карточка модели, конфигурационные файлы и документация Microsoft по стримингу, — поскольку Microsoft не публиковала ни WER, ни задержку, ни пропускную способность в текстовом виде, и на момент написания не существует независимого бенчмарка этой контрольной точки. Одна колонка каждого сравнения ниже проверена в бою; другая — это лист технических характеристик.
Их разделяют шестнадцать месяцев и одно правление в таблице лидеров
Parakeet TDT 0.6B v2 появился 5 мая 2025 года как ответ NVIDIA на проблему потокового распознавания речи (streaming ASR): энкодер FastConformer в паре с декодером-трансдьюсером токенов и длительностей (TDT), который предсказывает каждый токен и его длительность за один шаг, — эффективный приём, убирающий накладные расходы на пустые токены обычного трансдьюсера. Модель выпущена под лицензией CC-BY-4.0, коммерчески пригодна и возглавила рейтинг Open ASR благодаря среднему уровню ошибок распознавания слов 6,05%. В ней также появились функции для реального применения, которые рейтинг не измеряет: пунктуация, восстановление регистра, временные метки на уровне слов — а также энкодер с полным вниманием, принимающий до 24 минут аудио за один проход, что делает её полезной для длинных совещаний и подкастов без агрессивного разбиения на фрагменты.
VibeVoice-ASR-Streaming-1.5B — это challenger в самом чистом смысле: он существует, он задокументирован, и ничего о том, насколько хорошо он работает, не установлено. Новостная строка Microsoft на GitHub, датированная 3 сентября, анонсирует единую потоковую модель ASR, которая «непрерывно транскрибирует, кто и что сказал, по мере поступления речи», с hotwords и десятью языками, а конфиг чекпоинта описывает совершенно иную инженерную традицию — декодер языковой модели семейства Qwen2, питаемый свёрточными аудиотокенизаторами, с диффузионной головкой, выдающей результат фрагментами примерно по 2,9 секунды и с упреждением примерно 0,5 секунды. Тогда как Parakeet — это специализированная речевая модель, отточенная за год реальных развёртываний, VibeVoice-ASR-Streaming-1.5B — это чекпоинт исследовательского семейства, которому два дня от роду.
Асимметрия доказательств и есть суть.
Прочитайте остальную часть этой страницы, помня об одном факте: в этом сравнении цифры есть только на одной стороне. На стороне Parakeet TDT 0.6B — год защиты своей позиции в лидерборде: средний WER 6,05 % на публичных англоязычных наборах коротких высказываний Open ASR, около 3 386 RTFx при батче 128 на оборудовании NVIDIA и экосистема инструментов развёртывания NeMo, ускорения TensorRT и квантования FP8, проверенная в продакшене. На стороне VibeVoice-ASR-Streaming-1.5B — результат оценки из карточки модели в виде изображения, а не текста, а также заявленный вендором в карточке batch-модели VibeVoice-ASR средний WER 7,77 % на восьми англоязычных тестовых наборах. Это число описывает batch-модель, а не потоковую, и не может быть перенесено на этот чекпойнт. Претендент вполне может быть отличным; суть в том, что «вполне может быть» — это и есть вся доказательная база.
Проверка спецификации
• Параметры — NVIDIA Parakeet TDT 0.6B: 600M, энкодер FastConformer + декодер TDT против VibeVoice-ASR-Streaming-1.5B: ~3B суммарно (основа Qwen класса 1.5B плюс токенизаторы и диффузионная головка).
Выпущено — 5 мая 2025 г. против 2 сентября 2026 г.
• Точность — 6,05 % среднего WER, №1 в Open ASR с мая 2025 года; результат воспроизведён третьей стороной, тогда как конкуренты не опубликовали ничего.
• Скорость — ~3 386 RTFx при batch 128 на оборудовании NVIDIA, ~1 час аудио в секунду, тогда как опубликованных показателей пропускной способности нет.
• Стриминг — возможность потоковой передачи с контекстом полного внимания до 24 минут за проход, в отличие от чанкованного стриминга с чанками по ~2,9 с и упреждением ~0,5 с.
• Дополнительные возможности вывода — пунктуация, заглавные буквы, пословные временные метки vs потоковая атрибуция «кто что сказал» (непроверенная) и ключевые слова; десять языков.
• Лицензия — CC-BY-4.0 против MIT.
• Экосистема — NVIDIA NeMo с TensorRT и FP8 против демо-версий репозитория microsoft/VibeVoice и плагина vLLM.


Под капотом: две идеи о том, для чего нужны речевые модели
Эти архитектуры воплощают два разных взгляда на задачу. {{1}}Parakeet TDT 0.6B рассматривает транскрибацию как эффективно решаемую задачу обработки сигналов: энкодер FastConformer извлекает акустические признаки, а декодер TDT совместно генерирует текстовые токены и длительности, поэтому он работает в тысячи раз быстрее реального времени и отлично чувствует себя в стеке развертывания NVIDIA.{{/1}} {{2}}VibeVoice-ASR-Streaming-1.5B рассматривает транскрибацию как языковую задачу: аудио сжимается в поток токенов и подается языковой модели, которая удерживает в контексте целую расшифровку, — и понимание модели того, кто что говорит и как реплики складываются в диалог, делает всю работу.{{/2}} Наличие LLM в основе объясняет также, почему чекпойнт насчитывает {{3}}~3 млрд параметров, а не 600 млн{{/3}}, и почему Microsoft не заявляла о работе на периферийных устройствах — {{4}}это модель, которой нужен GPU и которая использует память для хранения контекста{{/4}}.
Для живой транскрипции практическое следствие — это характер задержки. Полновнимательный энкодер Parakeet может обрабатывать длинные окна за один проход, что представляет собой иную философию потоковой обработки по сравнению с фиксированным контрактом VibeVoice-ASR-Streaming-1.5B на чанки с упреждением, где на каждый выдаваемый сегмент приходится примерно 2,9 секунды аудио. Ни одна из систем не является потоковым сервисом с частичными результатами по словам в стиле коммерческих API с минимальной задержкой; обе работают с чанками, и выбор правильной зависит от того, поступает ли ваш аудио в виде ограниченных файлов или в виде непрерывной живой сессии.
История функции и районы развертывания
Из коробки Parakeet TDT 0.6B — более полноценный продукт для транскрибации: пунктуация и заглавные буквы приходят вместе с транскриптом, есть временные метки для каждого слова для выравнивания, а 24-минутные однопроходные окна означают меньше ошибок разбиения на фрагменты на длинных записях. VibeVoice-ASR-Streaming-1.5B парирует функциями, которых нет в списке Parakeet: вывод с атрибуцией говорящих и hotwords, на десяти языках. Утверждение о потоковой диаризации — как раз то, что требует независимой проверки: именно на границах фрагментов атрибуция может сбиваться. Но это как раз причина присмотреться к модели Microsoft, а не NVIDIA, если ваше требование — знать, кто что сказал на совещании в реальном времени.

Районы их обитания различаются не меньше, чем сами модели. Parakeet TDT 0.6B — часть экосистемы NVIDIA NeMo: TensorRT, FP8 и инструменты развертывания, оптимизированные под NVIDIA GPU, — что отлично, если вы уже работаете на инфраструктуре NVIDIA. VibeVoice-ASR-Streaming-1.5B живет в исследовательском репозитории: документированных путей два — Python-демо от Microsoft и плагин для vLLM; его архитектурный класс еще не включен в публичную документацию Transformers, а запуск означает установку из исходников и собственную проверку того, что путь загрузки работает. Для команды, которая ценит простое и документированное развертывание, уже одной этой разницы достаточно, чтобы перевесить разрыв по бенчмаркам.
Аргументы за действующего кандидата, аргументы за претендента
Аргумент в пользу NVIDIA Parakeet TDT 0.6B — это аргумент в пользу проверенной величины: год удержания позиций в лидербордах, воспроизведение сторонними командами, коммерческая лицензия, продакшн-возможности и экосистема развёртывания, выдержавшая реальный трафик. Если в этом квартале вы внедряете функцию транскрибации английской речи и вам нужны открытые веса — это обоснованный вариант по умолчанию, и бремя доказательства лежит на всём, что претендует на его замену.
Обоснование для VibeVoice-ASR-Streaming-1.5B уже и конкретнее: вам нужна потоковая атрибуция говорящего или хот-слова, вам нужно больше, чем английский, или вы верите, что подход к речи на основе языковых моделей победит, и хотите быть среди первых. Это ставка, а не решение — пока нет цифр, чтобы оправдать перевод на неё производственного трафика, и сама Microsoft занимает позицию «сначала исследования». Ни одна из моделей сегодня не обслуживается через OrcaRouter, поэтому недорогой способ проверить ставку — это паттерн, применимый к любой молодой открытой модели: держите слой распознавания речи за одним маршрутизирующим API, который предоставляет доступ к более чем 200 моделям по прейскуранту провайдера без наценки и с автоматическим переключением при сбоях, направляйте часть реального аудио на VibeVoice-ASR-Streaming-1.5B, как только провайдер её разместит, и пусть транскрипты вашего собственного трафика решают, заслуживает ли претендент корону, которую Parakeet удерживает уже шестнадцать месяцев.
