Карточка-обложка статьи с надписью «Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B», значком «СРАВНЕНИЕ МОДЕЛЕЙ» и подзаголовком «число, которое Microsoft не опубликовала», с чипами: 2,7 % потоковый WER, 0,49 с до первого частичного результата, фрагменты по 2,9 с с атрибуцией спикеров и веса MIT при 18 ГБ, на градиенте от белого к синему с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Grok Voice Transcribe 2.0 против VibeVoice ASR Streaming 7B: Число, которое Microsoft не опубликовала

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

VibeVoice ASR Streaming 7B — это унифицированный потоковый распознаватель речи от Microsoft, загруженный на Hugging Face 2 сентября 2026 года и анонсированный на следующий день в репозитории microsoft/VibeVoice под лицензией MIT, и он делает то, чего не делают ни Grok Voice Transcribe 2.0, ни большинство его конкурентов: он выдаёт текст с атрибуцией говорящих по мере поступления аудио, без отдельного этапа диаризации. В техническом отчёте Microsoft говорится, что чекпоинт 7B достигает самых низких средних WER и CER на пяти оценочных наборах, а также лучшей или разделяющей первое место атрибуции говорящих в 12 из 13 настроек оценки. А вот карточка модели не публикует ни одной цифры в текстовом виде — ни WER, ни RTF, ни показателя задержки; результаты существуют только в виде изображений в отчёте. Grok Voice Transcribe 2.0, выпущенный шестнадцать дней спустя, 18 сентября 2026 года, по цене $0.10 за час аудио в пакетном режиме и $0.20 за час в потоковом, публикует всё: WER финальной расшифровки 2.7% и WER первого частичного результата 3.4% в потоковом лидерборде Artificial Analysis, по 0.49 секунды до каждого. Так что честная отправная точка для этого сравнения состоит в том, что одна из двух моделей измеримо лучше задокументирована, чем другая, и эта асимметрия сама по себе — самый значимый для принятия решения факт в этом противостоянии.

Что опубликовала Microsoft и что читатель может с этим сделать

Отчёт VibeVoice — это настоящее исследование, и утверждения в нём конкретны по форме, пусть и не по значениям. В нём оценивались четыре бенчмарка для совещаний — AliMeeting, AISHELL-4, AMI-SDM и AMI-IHM — плюс MLC-Challenge, на девяти языках, и сообщаются два главных результата: модель 7B показала самую низкую среднюю WER/CER по пяти наборам, а также лучшую или разделённую лучшую атрибуцию говорящих в 12 из 13 сценариев оценки. Оба утверждения относительны, а это значимый тип утверждений: «самый низкий по этим пяти наборам» — это утверждение о порядке, а порядок — именно то, что нужно покупателю.

Отсутствуют все абсолютные показатели. Нет процента WER, с которым можно было бы что-либо сравнить, нет числа пропускной способности, нет измерения задержки и нет разбивки по каждому набору в тексте. Таблица сравнения, которая ставит VibeVoice рядом с Grok Voice Transcribe 2.0 и присваивает модели Microsoft число, выдумывает это число. Можно сказать, что VibeVoice показал лучший результат в собственной оценке на пяти наборах и что никто за пределами Microsoft не проводил её повторно — нет независимого бенчмарка, нет сторонней оценки, и на момент написания ни один провайдер хостингового инференса вообще не включает эту модель в свой каталог. Таким образом, сравнение идёт между задокументированным числом и незадокументированным рейтингом, и незадокументированный рейтинг не является слабейшим из двух только потому, что в нём нет десятичной точки.

Документация Grok Voice Transcribe 2.0 страдает противоположной проблемой. Её 2,7% и 3,4% взяты из таблицы AA-WER Streaming от Artificial Analysis — взвешенной композитной оценки, где AA-AgentTalk имеет вес 50%, а VoxPopuli и Earnings22 — по 25% каждая; это около восьми часов англоязычного разговорного аудио агентского типа, независимо проведённого, что даёт действительно более надёжный источник, чем собственная оценка вендора. Но это лишь один узкий срез английского языка, и сама страница таблицы отображает 27 из 33 моделей, которые SpaceXAI учитывает, когда заявляет о первом месте из 32. Точное число на узком тесте и неточное утверждение на более широком не поддаются прямому сравнению, и эта статья не будет делать вид, что это не так.

Две с половиной секунды против половины секунды

Сравнение задержек — это единственное место, где две модели можно поставить рядом без каких-либо оговорок о наборах данных, поскольку обе публикуют свою конфигурацию потоковой передачи, — и различие здесь архитектурное, а не выбор настройки.

VibeVoice ASR Streaming 7B работает по чанкам. В выпущенных чекпойнтах используется 22 латентных кадра на чанк, что при 7,5 латентных кадра в секунду у модели составляет около 2,9 секунды аудио на чанк, с заглядыванием вперёд на четыре латентных кадра — примерно 0,5 секунды будущего аудио — и ожидаемой задержкой определения говорящего около 2,00 секунды. Текст выдаётся один раз на чанк. Это настоящая потоковая система, но её темп измеряется в секундах, а не в миллисекундах.

Grok Voice Transcribe 2.0 возвращает первый частичный транскрипт через 0,49 секунды после того, как говорящий замолкает, и завершает его через 0,49 секунды после окончания речи. Он купил эту скорость точностью — частота ошибок первого частичного результата упала с 18,3 % в версии 1.0 до 3,4 % в версии 2.0, ценой увеличения с 0,25 секунды до 0,49 секунды по тому же показателю.

Поставьте рядом друг с другом:

• Темп потоковой передачи — Grok Voice Transcribe 2.0 непрерывно выдаёт частичные результаты с задержкой первого частичного результата 0,49 секунды, тогда как VibeVoice ASR Streaming 7B выдаёт один фрагмент текста примерно каждые 2,9 секунды

• Задержка атрибуции говорящего — включена в тот же 0,49-секундный путь против примерно 2,00 секунд по проекту

• Упреждение — не опубликовано, в отличие от четырёх латентных кадров, около 0,5 секунды будущего аудио

• Практический эффект — голосовой агент может реагировать на ещё не законченное предложение, тогда как система получает абзац с пометкой говорящего каждые три секунды

Ни то, ни другое не является неправильным. Фрагмент длиной 2,9 секунды — вполне разумное решение для транскрипции встреч, где на выходе получается документ и ценность в том, что документ появляется во время встречи, а не после неё. Это неправильное решение для разговорного агента, где трёхсекундная тишина — не пауза, а сбой. Разрыв между этими двумя ритмами составляет примерно шестикратную величину, и он почти точно соответствует разнице между транскрибированием разговора и участием в нём.

Screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B, showing the MIT licence tag, the 10 languages and Streaming tags, the model card opening line 'a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the 9B parameter and BF16 tensor type fields, a notice that no inference provider deploys it, and the architecture diagram showing 2.9 second chunks with 0.5 second lookahead.

Атрибуция говорящего как выходной результат, а не этап конвейера

Именно здесь модель Microsoft действительно впереди, и эта архитектура заслуживает понимания, потому что она — причина того, что разбиение на фрагменты является крупнозернистым.

VibeVoice использует два предварительно обученных токенизатора — акустический энкодер и семантический энкодер, — работающих на частоте 24 кГц с 3200-кратным понижением дискретизации и создающих 7,5 латентных кадра в секунду — один кадр каждые 133 миллисекунды. Эти кадры проецируются в основу языковой модели Qwen2.5, а поступающая речь и генерируемый текст чередуются в виде единой последовательности, при этом ранее наблюдавшиеся речь и текст сохраняются в контексте модели. Следствие таково: идентичность говорящего никогда не становится отдельной проблемой — модель не транскрибирует, а затем решает, кто говорил; она генерирует текст, обусловленный историей аудио, которая всё ещё содержит голоса. Именно поэтому здесь нет этапа диаризации, который нужно было бы выравнивать, и поэтому утверждение Microsoft об атрибуции говорящих в 12 из 13 настроек архитектурно достоверно, а не является результатом внешней надстройки.

Цена такого дизайна — сохранение истории, которое линейно растёт с длиной записи; именно поэтому выпущенные чекпоинты рассчитаны на записи длительностью до восьми минут. Это реальный потолок, и о нём говорится прямо. Он исключает модель для длительной работы — двухчасового звонка по итогам квартала, целого дня аудио из контакт-центра — если только вы не построите собственную сегментацию и переинициализацию, что возвращает ровно ту сложность, которую архитектура должна была устранить.

Grok Voice Transcribe 2.0 решает ту же задачу иначе и с другим набором ограничений. Он включает диаризацию без дополнительной платы и поддерживает до восьми независимых аудиоканалов в одном запросе. Для контакт-центровой телефонии, где каждый участник часто поступает по собственному каналу, разделение каналов надёжнее диаризации и не сопряжено с показателем ошибок. Для смешанного аудио всё зависит от качества диаризации, и, в отличие от Muse Voice Transcribe от Meta, опубликовавшей средний показатель ошибок диаризации 17,5%, SpaceXAI вообще не публиковала показатель диаризации. Так что обе модели оставляют пробел в доказательной базе по диаризации: одна публикует рейтинг без значения, другая — список функций без измерения.

Восемнадцать гигабайт, десять языков, MIT

Факты о развёртывании расходятся настолько кардинально, что их едва ли можно сравнивать. VibeVoice ASR Streaming 7B — это примерно 18 ГБ весов bf16: в карточке Hugging Face для чекпоинта с названием 7B указано 9 млрд общих параметров, а у его собрата на 1,5B — около 5,6 ГБ. Лицензия MIT, есть демо на Python и плагин vLLM для обслуживания. Десять языков: китайский, английский, французский, немецкий, итальянский, японский, корейский, португальский, русский и испанский. Microsoft позиционирует его для исследований и разработки.

Grok Voice Transcribe 2.0 — это управляемая конечная точка, для которой не нужно скачивать веса: 12 входных форматов — от телефонного аудио 8 кГц до 48 кГц, до восьми каналов, 100 ключевых терминов на запрос, автоматическое определение языка с переключением в середине записи, обратная нормализация текста для 25 языков, файлы до 500 МБ и ограничения сервиса — 10 запросов в секунду и 100 одновременных потоковых сессий на команду. Он работает в us-east-1 и только в us-east-1.

• Веса — MIT, 18 ГБ, можно запускать где угодно — против ничего, только у вендора

• Языки — 10 именованных языков против автоматического определения с поддержкой форматирования в 25

• Смещение ключевых терминов — поддерживается через хотворды против до 100 ключевых терминов на запрос

• Длительность записи — около восьми минут на контрольную точку, прежде чем ограничением становится хранение истории, в отличие от отсутствия опубликованного потолка; файлы — до 500 МБ

• Контроль региона — что бы вы ни развёртывали, в сравнении с us-east-1

• Стоимость — отсутствие платы за лицензию, плюс 18 ГБ памяти GPU и стек обслуживания против $0,10 за час пакетной обработки и $0,20 за час потоковой обработки

Модель на 18 ГБ — это не то, что запускают на ноутбуке, а плагин vLLM подразумевает GPU с настоящей памятью. В противовес этому, лицензия MIT на модель такого размера — редкость и ценность: это единственная из двух, которую можно запустить внутри собственной сети вообще без каких-либо отношений с вендором, а для регулируемого аудио это не предпочтение, а требование. Управляемая альтернатива дешева в почасовом расчёте, но её невозможно развернуть в собственном контуре.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7% streaming, first partial 0.49s, cadence continuous partials, diarization included with no figure published, $0.10 per batch hour, managed in us-east-1. The right column gives VibeVoice ASR Streaming 7B the rows: WER lowest of five sets but unpublished, speaker attribution about 2.00s, cadence 2.9 second chunks, diarization built into streaming, MIT weights at about 18 GB, recordings up to 8 minutes. A footer reads 'VibeVoice figures Microsoft-reported with no absolute values published; Grok figures per Artificial Analysis.'

Где должно находиться решение о маршрутизации

Стоимость — это то, где две модели наконец становятся сопоставимыми так, что это даёт число. Пакетный режим Grok Voice Transcribe 2.0 стоит $0,10 за час аудио, около $1,67 за 1 000 минут, а его потоковый режим — $0,20, около $3,33. У VibeVoice ASR Streaming 7B вообще нет лицензионных отчислений; вместо этого есть примерно 18 ГБ резидентной памяти GPU и стек обслуживания vLLM, который вы эксплуатируете. Модель класса 7B такого размера не будет дешёвой в расчёте на час аудио на арендованном оборудовании, а кривая загрузки не прощает ошибок — GPU, который держат разогретым ради пикового трафика, стоит одинаково независимо от того, транскрибирует он или простаивает.

Это обычная форма спора «сделать самому или купить», и он решается по-разному в зависимости от объёма и от того, разрешено ли аудио покидать вашу сеть. Что изменилось за последний месяц — это то, как быстро меняется ответ: лидер по точности потокового распознавания менялся дважды за три недели, а модель, выпущенная в начале сентября, была вытеснена к середине сентября. Любая архитектура, в которой выбор модели дорого обратить вспять, теперь является неправильной архитектурой для этой категории.

OrcaRouter — это место, где такой разворот становится дешёвым. Один ключ, совместимый с OpenAI, покрывает более 200 моделей с автоматическим переключением при сбое между провайдерами, поэтому сбой управляемой конечной точки в одном регионе — это событие маршрутизации, а не простой, а цена из прайс-листа провайдера передаётся без наценки — 0 %, то есть изменение цены у вендора или новый чекпойнт появляются на нашей стороне в тот же день. Для команды, которая хочет протестировать VibeVoice против Grok Voice Transcribe 2.0 на своих собственных аудиоданных или сохранить самостоятельно размещённый резервный вариант за тем же интерфейсом, что и управляемый основной, место вызова перестаёт быть тем, что приходится менять.

Screenshot of the microsoft/VibeVoice GitHub repository showing the description 'Open-Source Frontier Voice AI' and the MIT licence in the About sidebar, the file listing with demo and vibevoice directories both updated with streaming ASR inference code and a vllm_plugin directory, the repository's 53.6 thousand stars, and a GitHub Trending badge reading number 1 Repository Of The Day.

Честный вердикт: VibeVoice ASR Streaming 7B — более интересная модель, а Grok Voice Transcribe 2.0 — более удобный продукт, и разрыв между этими двумя утверждениями полностью объясняется тем, что один вендор публикует графики, а другой — цифры. Если ваше требование — локальная транскрипция встреч с атрибуцией говорящих длительностью менее восьми минут, то чекпоинт Microsoft — единственный из двух, который подходит. Если ваше требование — голосовой агент, отвечающий в пределах разговорной паузы, то частота фрагментов в 2,9 секунды исключает его ещё до обсуждения точности. И если вы ждёте сравнения, которое расставило бы всё по местам — один и тот же звук через обе модели, оценённый кем-то, кто не работает ни в одной из компаний — такого измерения пока не существует, и об этом стоит помнить в следующий раз, когда таблица поставит число рядом с именем VibeVoice.