Карточка-герой статьи с надписью «Grok Voice Transcribe 2.0 vs Muse Voice Transcribe», бейджем «MODEL COMPARISON» и подзаголовком «17-дневное правление и четверть секунды», с чипами: 2,7% против 3,1% итогового WER, 0,49 с против 0,16 с после речи, $0,20 против $0,18 за час потоковой передачи и пакетная обработка вдвое дешевле, на градиенте от белого к синему с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Grok Voice Transcribe 2.0 против Muse Voice Transcribe: 17-дневное правление и четверть секунды

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

1 сентября 2026 года Meta заявила, что Muse Voice Transcribe заняла первое место в проводимой Artificial Analysis оценке потокового распознавания речи с итоговой частотой ошибок в словах 3,1%, и это утверждение оставалось неоспоренным семнадцать дней. 18 сентября SpaceXAI выпустила Grok Voice Transcribe 2.0 с показателем 2,7% в том же рейтинге и забрала себе это место. Две модели, один рейтинг, с разницей в семнадцать дней — и самое интересное сравнение здесь не разрыв в 0,4 пункта по точности, потому что модель Meta по-прежнему примерно в три раза быстрее выдаёт окончательный текст предложения: 0,16 секунды после окончания речи против 0,49 секунды у Grok Voice Transcribe 2.0. Muse Voice Transcribe — это модель восприятия аудио в реальном времени, созданная Meta Superintelligence Labs для работы внутри собственных продуктов Meta, где четверть секунды — это разница между ассистентом, который ощущается присутствующим, и тем, который ощущается медленным. Grok Voice Transcribe 2.0 — это API транскрипции, созданный для того, чтобы его мог вызвать кто угодно, по цене, которая делает пакетную работу осуществимой. Оба показателя заявлены вендором в день запуска, и только один из двух с тех пор был независимо внесён в публичный рейтинг.

Что на самом деле говорит таблица лидеров сейчас

Таблица лидеров AA-WER Streaming представляет собой взвешенный составной показатель — AA-AgentTalk с весом 50%, VoxPopuli — 25%, Earnings22 — 25%, примерно восемь часов преимущественно англоязычного аудио, в основном в форме агентских диалогов — и обе модели оцениваются на ней, что делает это редким случаем прямого сравнения, где цифры хотя бы сопоставимы. При сопоставлении, включая показатели, заявленные производителями:

• Итоговая точность транскрипции — Grok Voice Transcribe 2.0 при 2,7% WER против Muse Voice Transcribe при 3,1%

• Точность первого частичного транскрипта — 3,4 % против 3,6 %

• Время до первого частичного результата — 0,49 секунды против 0,13 секунды

• Время от окончания речи до финальной расшифровки — 0,49 секунды против 0,16 секунды

• Частота ошибок диаризации говорящих — включена, но конкретная цифра не опубликована, против среднего значения 17,5% по оценке Meta

Читайте строки точности и строки задержки отдельно, потому что они указывают в противоположных направлениях, и оба утверждения верны. По точности две модели отличаются друг от друга менее чем на четыре десятых пункта для финальных транскриптов и на две десятых для первых промежуточных результатов — разрыв настолько мал, что он изменится на противоположный в следующем релизе от любой из компаний, и настолько мал, что ни один разумный человек не должен выбирать между ними на этом основании. По задержке они не близки. Модель Meta возвращает промежуточный результат примерно за одну восьмую секунды и выдаёт финальный примерно за одну шестую секунды, тогда как у SpaceXAI — примерно полсекунды в обоих случаях.

Вот всё сравнение в одной строке: Grok Voice Transcribe 2.0 потратил задержку, чтобы купить точность, а Muse Voice Transcribe поступил наоборот. SpaceXAI снизила частоту ошибок первого частичного результата с 18,3% в версии 1.0 до 3,4% в 2.0, и ценой этого стал переход с 0,25 секунды на 0,49 секунды по тому же показателю. Модель Meta была спроектирована противоположным образом: с 80-миллисекундными аудиофрагментами и адаптивной задержкой, обученной с подкреплением, которая решает, сколько ждать перед фиксацией текста, — механизм, вся цель которого — удерживать точность, сохраняя быстроту фиксации. Ни один из этих выборов не является ошибкой. Это ответы на разные вопросы.

Какой вопрос вы задаёте?

Если транскрипт поступает голосовому агенту, который должен ответить в пределах разговорной паузы, 0,16 секунды и 0,49 секунды — это разные продукты. При человеческом обмене репликами допустима пауза в несколько сотен миллисекунд, прежде чем взаимодействие начинает казаться неправильным, а бюджет задержки общий — транскрипция, затем рассуждение, затем синтез речи. Модель, которая возвращает финальный транскрипт за шестую долю секунды, оставляет запас для остальной части конвейера; а та, которой требуется полсекунды, потребляет большую часть бюджета ещё до того, как модель успевает что-либо обдумать. Именно для этого Meta это и создала, и именно поэтому модель работает внутри Meta AI на Mac и внутри Muse Code, а не предлагается в первую очередь как эндпоинт для конвейеров других людей.

Если транскрипт — это документ — запись звонка, встреча, видеотека, архив для целей соответствия — то полсекунды ничего не решают, разница в точности по-прежнему ничего не значит, и единственное число, которое имеет значение, — это стоимость часа аудио. Именно здесь эти два варианта резко расходятся, причём в направлении, которое удивляет тех, кто смотрит только на тариф потоковой передачи.

В пакетном режиме — вдвое дешевле, при потоковой обработке — на 10% дороже.

Meta указывает стоимость Muse Voice Transcribe в размере $0.18 за час аудио, или $3.00 за 1 000 минут. Grok Voice Transcribe 2.0 указана по цене $0.10 за час для пакетной обработки и $0.20 за час для потоковой передачи. Итак:

• Стриминг — Grok Voice Transcribe 2.0 по $0.20 в час против Muse Voice Transcribe по $0.18, так что Meta примерно на 10% дешевле

• Пакетно или в записи — $0,10 в час против $0,18, поэтому SpaceXAI на 44% дешевле

• Включено по прейскурантной цене — диаризация, временные метки слов с оценкой уверенности, смещение в пользу ключевых терминов и обратная нормализация текста на стороне SpaceXAI против потоковой транскрипции, диаризации и определения конечных точек как одной модели на стороне Meta

• Бесплатный тариф или самостоятельный хостинг — ни то, ни другое, по обоим пунктам

Команда, которая работает исключительно с потоковым аудио, должна быть безразлична к выбору между ними по цене и выбирать по задержке, а значит, Meta. Команде с любым существенным объёмом записанного аудио стоит смотреть на строку пакетной обработки, потому что $0,08 в час накапливаются: 5 000 часов в месяц — это $500 у одного и $900 у другого, а разница в точности между ними меньше, чем погрешность округления любого из этих чисел.

Лицензионная ситуация одинакова в том, что важно, и различна в том, что не имеет значения. У обоих закрытые веса: Muse Voice Transcribe является проприетарным и доступен только через хостинговый API Meta, а Grok Voice Transcribe 2.0 — коммерческий API без возможности загрузки. Ни один из них не подходит, если ваше требование состоит в том, чтобы аудио никогда не покидало контролируемую вами инфраструктуру, и оба оставляют вас уязвимыми к тому, что поставщик изменит свою цену, версию модели или график прекращения поддержки у вас под ногами. Это реальное соображение, а не гипотетическое: Grok Voice Transcribe 1.0 уже идёт по пути прекращения поддержки менее чем через две недели после выпуска его преемника.

Screenshot of the Meta AI research post titled 'Introducing Muse Voice Transcribe', dated September 1, 2026 and marked a four minute read, showing the headline and an interactive demo card labelled 'Click to start transcribing' with the caption 'Experience Muse Voice Transcribe in real time', above the opening line describing the model as Meta's first real-time audio perception model.

Диаризация — это функция, которую ни один из них не выставляет на первый план.

Обе модели выполняют атрибуцию говорящего за один проход, которая два года назад была отдельной системой, прикрученной задним числом, а сравнение здесь необычно конкретное, потому что Meta опубликовала цифру, а SpaceXAI — нет.

Meta сообщает о средней частоте ошибок диаризации в 17,5% по результатам своей оценки, обрабатывает 20 и более говорящих без постобработки и делает это в рамках потоковой модели, а не на отдельном последующем этапе — «кто что сказал» приходит вместе с текстом, а не после него. Это действительно трудно сделать в потоковом режиме, где реплику говорящего можно определить, лишь услышав её достаточно, а 17,5% — это настоящая цифра с настоящей оговоркой: это собственная цифра Meta, усреднённая по выбранному Meta набору для оценки.

Модель SpaceXAI включает диаризацию без дополнительной платы, а также поддерживает до восьми независимых аудиоканалов в одном запросе — это другой способ решения той же задачи: если ваше аудио поступает в виде отдельных каналов для каждого участника, как часто бывает в телефонии контакт-центров, разделение по каналам надёжнее диаризации и вообще не требует оценки частоты ошибок. Если ваше аудио поступает одним смешанным потоком, вы зависите от качества диаризации, и только один из этих двух поставщиков сообщил вам, каково оно.

Есть различие второго порядка, которое стоит отметить: Muse Voice Transcribe рассматривает диаризацию, транскрибацию и обнаружение конечных точек как одну модель, выдающую один результат, а значит, эти компоненты не могут выходить из строя независимо. Grok Voice Transcribe 2.0 позволяет использовать каналы, ключевые термины и диаризацию как отдельные рычаги. Одну модель проще запускать, но сложнее отлаживать.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs Muse Voice Transcribe — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7%, first partial 3.4%, time after speech 0.49s, diarization included with no figure published, streaming $0.20 per hour, batch $0.10 per hour. The right column gives Muse Voice Transcribe the rows: final WER 3.1%, first partial 3.6%, time after speech 0.16s, diarization error 17.5% average, streaming $0.18 per hour, no batch tier published. A footer reads 'Both sets of figures vendor-reported at launch; Grok accuracy independently placed on Artificial Analysis.'

Языки — и где две карточки моделей перестают быть сопоставимыми

Meta обучила Muse Voice Transcribe более чем на 70 языках и тщательно проверила 25 из них на момент запуска; поддерживается нативное переключение кода внутри предложений и между ними, а также обработка аудио длительностью более часа. Grok Voice Transcribe 2.0 выполняет автоматическое определение языка с переключением во время записи и применяет обратную текстовую нормализацию — произносимые даты, валюты, номера телефонов и адреса электронной почты отображаются в письменной форме — для 25 языков.

Пересечение — это 25 всесторонне проверенных языков с одной стороны и 25 языков нормализации с другой, и эти два набора — не одни и те же 25 языков, и ни один из поставщиков не опубликовал список. «70+ языков, на которых проводилось обучение» и «25 языков с поддержкой форматирования» — это несопоставимые утверждения, и их не следует вычитать одно из другого. Можно сказать, что Meta делает более широкое многоязычное заявление, а SpaceXAI — более узкое, но более операционное: определение языка — это обязательный минимум, а форматирование того, что услышала модель, во что-то, что может разобрать нижестоящая система, — это та часть, отсутствие которой ломает интеграции.

Выбор — и причина, по которой, возможно, не вам его делать.

Отбросьте маркетинг — и решение сводится к трём предложениям. Выбирайте Muse Voice Transcribe, если расшифровка используется в реальном времени во время разговора, потому что 0,16 секунды — это не мелочь. Выбирайте Grok Voice Transcribe 2.0, если у вас много записанного аудио, потому что вдвое меньшая цена пакетной обработки — тоже не мелочь. Если вам не нужна ни одна из этих крайностей, выбирайте исходя из любых других ограничений — региона, договора, существующей интеграции, — потому что разница в точности всё равно не решит вопрос.

Сложность в том, что одна из этих двух моделей на самом деле не продаётся в обычном смысле. Muse Voice Transcribe существует, чтобы ассистент самой Meta казался быстрым, и она доступна через Meta Model API в основном потому, что Meta решила: ценность для экосистемы от открытого доступа превышает ценность эксклюзивности. Это может измениться, причём быстро: в ту же неделю Meta открыла платформу коннекторов Muse для сторонних разработчиков, а это компания, которая инвестирует в собственный канал дистрибуции, а не в роль нейтрального поставщика для всех остальных. Создание зависимости в продакшене от внутренней модели конкурента — это ставка на то, что условия не изменятся, а у этой ставки плохая история.

Эта асимметрия — аргумент за то, чтобы не вшивать жёстко ни один из них. OrcaRouter предоставляет более 200 моделей через единый ключ, совместимый с OpenAI, с автоматическим переключением при сбое между провайдерами и 0% наценки к цене провайдера по прайс-листу — так что когда SpaceXAI переключит версию по умолчанию на 2.0 и признает 1.0 устаревшей или когда Meta изменит позиционирование своего речевого API, изменение сведётся к строке модели, а не к проекту миграции. Для категории, где лидер менялся дважды за три недели, слой маршрутизации — это часть стека, которая должна быть стабильной, а модель — часть, которая не должна.

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

За следующим месяцем стоит следить за одним: проведёт ли Artificial Analysis повторное измерение Muse Voice Transcribe в стриминговом рейтинге теперь, когда Grok Voice Transcribe 2.0 вытеснил его оттуда. Показатели Meta — 3,1% — и SpaceXAI — 2,7% — оба были заявлены при запуске, но независимо проверен только показатель SpaceXAI. Если цифра Meta подтвердится, когда кто-то прогонит тест заново, разрыв в точности так мал, как кажется, и всё решает разрыв в задержке. Если нет — семнадцатидневное правление и было всей историей.