
Grok Voice Transcribe 2.0 против VibeVoice ASR Streaming 7B: Число, которое Microsoft не опубликовала
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
VibeVoice ASR Streaming 7B — это унифицированный потоковый распознаватель речи от Microsoft, загруженный на Hugging Face 2 сентября 2026 года и анонсированный на следующий день в репозитории microsoft/VibeVoice под лицензией MIT, и он делает то, чего не делают ни Grok Voice Transcribe 2.0, ни большинство его конкурентов: он выдаёт текст с атрибуцией говорящих по мере поступления аудио, без отдельного этапа диаризации. В техническом отчёте Microsoft говорится, что чекпоинт 7B достигает самых низких средних WER и CER на пяти оценочных наборах, а также лучшей или разделяющей первое место атрибуции говорящих в 12 из 13 настроек оценки. А вот карточка модели не публикует ни одной цифры в текстовом виде — ни WER, ни RTF, ни показателя задержки; результаты существуют только в виде изображений в отчёте. Grok Voice Transcribe 2.0, выпущенный шестнадцать дней спустя, 18 сентября 2026 года, по цене $0.10 за час аудио в пакетном режиме и $0.20 за час в потоковом, публикует всё: WER финальной расшифровки 2.7% и WER первого частичного результата 3.4% в потоковом лидерборде Artificial Analysis, по 0.49 секунды до каждого. Так что честная отправная точка для этого сравнения состоит в том, что одна из двух моделей измеримо лучше задокументирована, чем другая, и эта асимметрия сама по себе — самый значимый для принятия решения факт в этом противостоянии.
Что опубликовала Microsoft и что читатель может с этим сделать
Отчёт VibeVoice — это настоящее исследование, и утверждения в нём конкретны по форме, пусть и не по значениям. В нём оценивались четыре бенчмарка для совещаний — AliMeeting, AISHELL-4, AMI-SDM и AMI-IHM — плюс MLC-Challenge, на девяти языках, и сообщаются два главных результата: модель 7B показала самую низкую среднюю WER/CER по пяти наборам, а также лучшую или разделённую лучшую атрибуцию говорящих в 12 из 13 сценариев оценки. Оба утверждения относительны, а это значимый тип утверждений: «самый низкий по этим пяти наборам» — это утверждение о порядке, а порядок — именно то, что нужно покупателю.
Отсутствуют все абсолютные показатели. Нет процента WER, с которым можно было бы что-либо сравнить, нет числа пропускной способности, нет измерения задержки и нет разбивки по каждому набору в тексте. Таблица сравнения, которая ставит VibeVoice рядом с Grok Voice Transcribe 2.0 и присваивает модели Microsoft число, выдумывает это число. Можно сказать, что VibeVoice показал лучший результат в собственной оценке на пяти наборах и что никто за пределами Microsoft не проводил её повторно — нет независимого бенчмарка, нет сторонней оценки, и на момент написания ни один провайдер хостингового инференса вообще не включает эту модель в свой каталог. Таким образом, сравнение идёт между задокументированным числом и незадокументированным рейтингом, и незадокументированный рейтинг не является слабейшим из двух только потому, что в нём нет десятичной точки.
Документация Grok Voice Transcribe 2.0 страдает противоположной проблемой. Её 2,7% и 3,4% взяты из таблицы AA-WER Streaming от Artificial Analysis — взвешенной композитной оценки, где AA-AgentTalk имеет вес 50%, а VoxPopuli и Earnings22 — по 25% каждая; это около восьми часов англоязычного разговорного аудио агентского типа, независимо проведённого, что даёт действительно более надёжный источник, чем собственная оценка вендора. Но это лишь один узкий срез английского языка, и сама страница таблицы отображает 27 из 33 моделей, которые SpaceXAI учитывает, когда заявляет о первом месте из 32. Точное число на узком тесте и неточное утверждение на более широком не поддаются прямому сравнению, и эта статья не будет делать вид, что это не так.
Две с половиной секунды против половины секунды
Сравнение задержек — это единственное место, где две модели можно поставить рядом без каких-либо оговорок о наборах данных, поскольку обе публикуют свою конфигурацию потоковой передачи, — и различие здесь архитектурное, а не выбор настройки.
VibeVoice ASR Streaming 7B работает по чанкам. В выпущенных чекпойнтах используется 22 латентных кадра на чанк, что при 7,5 латентных кадра в секунду у модели составляет около 2,9 секунды аудио на чанк, с заглядыванием вперёд на четыре латентных кадра — примерно 0,5 секунды будущего аудио — и ожидаемой задержкой определения говорящего около 2,00 секунды. Текст выдаётся один раз на чанк. Это настоящая потоковая система, но её темп измеряется в секундах, а не в миллисекундах.
Grok Voice Transcribe 2.0 возвращает первый частичный транскрипт через 0,49 секунды после того, как говорящий замолкает, и завершает его через 0,49 секунды после окончания речи. Он купил эту скорость точностью — частота ошибок первого частичного результата упала с 18,3 % в версии 1.0 до 3,4 % в версии 2.0, ценой увеличения с 0,25 секунды до 0,49 секунды по тому же показателю.
Поставьте рядом друг с другом:
• Темп потоковой передачи — Grok Voice Transcribe 2.0 непрерывно выдаёт частичные результаты с задержкой первого частичного результата 0,49 секунды, тогда как VibeVoice ASR Streaming 7B выдаёт один фрагмент текста примерно каждые 2,9 секунды
• Задержка атрибуции говорящего — включена в тот же 0,49-секундный путь против примерно 2,00 секунд по проекту
• Упреждение — не опубликовано, в отличие от четырёх латентных кадров, около 0,5 секунды будущего аудио
• Практический эффект — голосовой агент может реагировать на ещё не законченное предложение, тогда как система получает абзац с пометкой говорящего каждые три секунды
Ни то, ни другое не является неправильным. Фрагмент длиной 2,9 секунды — вполне разумное решение для транскрипции встреч, где на выходе получается документ и ценность в том, что документ появляется во время встречи, а не после неё. Это неправильное решение для разговорного агента, где трёхсекундная тишина — не пауза, а сбой. Разрыв между этими двумя ритмами составляет примерно шестикратную величину, и он почти точно соответствует разнице между транскрибированием разговора и участием в нём.

Атрибуция говорящего как выходной результат, а не этап конвейера
Именно здесь модель Microsoft действительно впереди, и эта архитектура заслуживает понимания, потому что она — причина того, что разбиение на фрагменты является крупнозернистым.
VibeVoice использует два предварительно обученных токенизатора — акустический энкодер и семантический энкодер, — работающих на частоте 24 кГц с 3200-кратным понижением дискретизации и создающих 7,5 латентных кадра в секунду — один кадр каждые 133 миллисекунды. Эти кадры проецируются в основу языковой модели Qwen2.5, а поступающая речь и генерируемый текст чередуются в виде единой последовательности, при этом ранее наблюдавшиеся речь и текст сохраняются в контексте модели. Следствие таково: идентичность говорящего никогда не становится отдельной проблемой — модель не транскрибирует, а затем решает, кто говорил; она генерирует текст, обусловленный историей аудио, которая всё ещё содержит голоса. Именно поэтому здесь нет этапа диаризации, который нужно было бы выравнивать, и поэтому утверждение Microsoft об атрибуции говорящих в 12 из 13 настроек архитектурно достоверно, а не является результатом внешней надстройки.
Цена такого дизайна — сохранение истории, которое линейно растёт с длиной записи; именно поэтому выпущенные чекпоинты рассчитаны на записи длительностью до восьми минут. Это реальный потолок, и о нём говорится прямо. Он исключает модель для длительной работы — двухчасового звонка по итогам квартала, целого дня аудио из контакт-центра — если только вы не построите собственную сегментацию и переинициализацию, что возвращает ровно ту сложность, которую архитектура должна была устранить.
Grok Voice Transcribe 2.0 решает ту же задачу иначе и с другим набором ограничений. Он включает диаризацию без дополнительной платы и поддерживает до восьми независимых аудиоканалов в одном запросе. Для контакт-центровой телефонии, где каждый участник часто поступает по собственному каналу, разделение каналов надёжнее диаризации и не сопряжено с показателем ошибок. Для смешанного аудио всё зависит от качества диаризации, и, в отличие от Muse Voice Transcribe от Meta, опубликовавшей средний показатель ошибок диаризации 17,5%, SpaceXAI вообще не публиковала показатель диаризации. Так что обе модели оставляют пробел в доказательной базе по диаризации: одна публикует рейтинг без значения, другая — список функций без измерения.
Восемнадцать гигабайт, десять языков, MIT
Факты о развёртывании расходятся настолько кардинально, что их едва ли можно сравнивать. VibeVoice ASR Streaming 7B — это примерно 18 ГБ весов bf16: в карточке Hugging Face для чекпоинта с названием 7B указано 9 млрд общих параметров, а у его собрата на 1,5B — около 5,6 ГБ. Лицензия MIT, есть демо на Python и плагин vLLM для обслуживания. Десять языков: китайский, английский, французский, немецкий, итальянский, японский, корейский, португальский, русский и испанский. Microsoft позиционирует его для исследований и разработки.
Grok Voice Transcribe 2.0 — это управляемая конечная точка, для которой не нужно скачивать веса: 12 входных форматов — от телефонного аудио 8 кГц до 48 кГц, до восьми каналов, 100 ключевых терминов на запрос, автоматическое определение языка с переключением в середине записи, обратная нормализация текста для 25 языков, файлы до 500 МБ и ограничения сервиса — 10 запросов в секунду и 100 одновременных потоковых сессий на команду. Он работает в us-east-1 и только в us-east-1.
• Веса — MIT, 18 ГБ, можно запускать где угодно — против ничего, только у вендора
• Языки — 10 именованных языков против автоматического определения с поддержкой форматирования в 25
• Смещение ключевых терминов — поддерживается через хотворды против до 100 ключевых терминов на запрос
• Длительность записи — около восьми минут на контрольную точку, прежде чем ограничением становится хранение истории, в отличие от отсутствия опубликованного потолка; файлы — до 500 МБ
• Контроль региона — что бы вы ни развёртывали, в сравнении с us-east-1
• Стоимость — отсутствие платы за лицензию, плюс 18 ГБ памяти GPU и стек обслуживания против $0,10 за час пакетной обработки и $0,20 за час потоковой обработки
Модель на 18 ГБ — это не то, что запускают на ноутбуке, а плагин vLLM подразумевает GPU с настоящей памятью. В противовес этому, лицензия MIT на модель такого размера — редкость и ценность: это единственная из двух, которую можно запустить внутри собственной сети вообще без каких-либо отношений с вендором, а для регулируемого аудио это не предпочтение, а требование. Управляемая альтернатива дешева в почасовом расчёте, но её невозможно развернуть в собственном контуре.

Где должно находиться решение о маршрутизации
Стоимость — это то, где две модели наконец становятся сопоставимыми так, что это даёт число. Пакетный режим Grok Voice Transcribe 2.0 стоит $0,10 за час аудио, около $1,67 за 1 000 минут, а его потоковый режим — $0,20, около $3,33. У VibeVoice ASR Streaming 7B вообще нет лицензионных отчислений; вместо этого есть примерно 18 ГБ резидентной памяти GPU и стек обслуживания vLLM, который вы эксплуатируете. Модель класса 7B такого размера не будет дешёвой в расчёте на час аудио на арендованном оборудовании, а кривая загрузки не прощает ошибок — GPU, который держат разогретым ради пикового трафика, стоит одинаково независимо от того, транскрибирует он или простаивает.
Это обычная форма спора «сделать самому или купить», и он решается по-разному в зависимости от объёма и от того, разрешено ли аудио покидать вашу сеть. Что изменилось за последний месяц — это то, как быстро меняется ответ: лидер по точности потокового распознавания менялся дважды за три недели, а модель, выпущенная в начале сентября, была вытеснена к середине сентября. Любая архитектура, в которой выбор модели дорого обратить вспять, теперь является неправильной архитектурой для этой категории.
OrcaRouter — это место, где такой разворот становится дешёвым. Один ключ, совместимый с OpenAI, покрывает более 200 моделей с автоматическим переключением при сбое между провайдерами, поэтому сбой управляемой конечной точки в одном регионе — это событие маршрутизации, а не простой, а цена из прайс-листа провайдера передаётся без наценки — 0 %, то есть изменение цены у вендора или новый чекпойнт появляются на нашей стороне в тот же день. Для команды, которая хочет протестировать VibeVoice против Grok Voice Transcribe 2.0 на своих собственных аудиоданных или сохранить самостоятельно размещённый резервный вариант за тем же интерфейсом, что и управляемый основной, место вызова перестаёт быть тем, что приходится менять.

Честный вердикт: VibeVoice ASR Streaming 7B — более интересная модель, а Grok Voice Transcribe 2.0 — более удобный продукт, и разрыв между этими двумя утверждениями полностью объясняется тем, что один вендор публикует графики, а другой — цифры. Если ваше требование — локальная транскрипция встреч с атрибуцией говорящих длительностью менее восьми минут, то чекпоинт Microsoft — единственный из двух, который подходит. Если ваше требование — голосовой агент, отвечающий в пределах разговорной паузы, то частота фрагментов в 2,9 секунды исключает его ещё до обсуждения точности. И если вы ждёте сравнения, которое расставило бы всё по местам — один и тот же звук через обе модели, оценённый кем-то, кто не работает ни в одной из компаний — такого измерения пока не существует, и об этом стоит помнить в следующий раз, когда таблица поставит число рядом с именем VibeVoice.
