
Grok Voice Transcribe 2.0 против Muse Voice Transcribe: 17-дневное правление и четверть секунды
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
1 сентября 2026 года Meta заявила, что Muse Voice Transcribe заняла первое место в проводимой Artificial Analysis оценке потокового распознавания речи с итоговой частотой ошибок в словах 3,1%, и это утверждение оставалось неоспоренным семнадцать дней. 18 сентября SpaceXAI выпустила Grok Voice Transcribe 2.0 с показателем 2,7% в том же рейтинге и забрала себе это место. Две модели, один рейтинг, с разницей в семнадцать дней — и самое интересное сравнение здесь не разрыв в 0,4 пункта по точности, потому что модель Meta по-прежнему примерно в три раза быстрее выдаёт окончательный текст предложения: 0,16 секунды после окончания речи против 0,49 секунды у Grok Voice Transcribe 2.0. Muse Voice Transcribe — это модель восприятия аудио в реальном времени, созданная Meta Superintelligence Labs для работы внутри собственных продуктов Meta, где четверть секунды — это разница между ассистентом, который ощущается присутствующим, и тем, который ощущается медленным. Grok Voice Transcribe 2.0 — это API транскрипции, созданный для того, чтобы его мог вызвать кто угодно, по цене, которая делает пакетную работу осуществимой. Оба показателя заявлены вендором в день запуска, и только один из двух с тех пор был независимо внесён в публичный рейтинг.
Что на самом деле говорит таблица лидеров сейчас
Таблица лидеров AA-WER Streaming представляет собой взвешенный составной показатель — AA-AgentTalk с весом 50%, VoxPopuli — 25%, Earnings22 — 25%, примерно восемь часов преимущественно англоязычного аудио, в основном в форме агентских диалогов — и обе модели оцениваются на ней, что делает это редким случаем прямого сравнения, где цифры хотя бы сопоставимы. При сопоставлении, включая показатели, заявленные производителями:
• Итоговая точность транскрипции — Grok Voice Transcribe 2.0 при 2,7% WER против Muse Voice Transcribe при 3,1%
• Точность первого частичного транскрипта — 3,4 % против 3,6 %
• Время до первого частичного результата — 0,49 секунды против 0,13 секунды
• Время от окончания речи до финальной расшифровки — 0,49 секунды против 0,16 секунды
• Частота ошибок диаризации говорящих — включена, но конкретная цифра не опубликована, против среднего значения 17,5% по оценке Meta
Читайте строки точности и строки задержки отдельно, потому что они указывают в противоположных направлениях, и оба утверждения верны. По точности две модели отличаются друг от друга менее чем на четыре десятых пункта для финальных транскриптов и на две десятых для первых промежуточных результатов — разрыв настолько мал, что он изменится на противоположный в следующем релизе от любой из компаний, и настолько мал, что ни один разумный человек не должен выбирать между ними на этом основании. По задержке они не близки. Модель Meta возвращает промежуточный результат примерно за одну восьмую секунды и выдаёт финальный примерно за одну шестую секунды, тогда как у SpaceXAI — примерно полсекунды в обоих случаях.
Вот всё сравнение в одной строке: Grok Voice Transcribe 2.0 потратил задержку, чтобы купить точность, а Muse Voice Transcribe поступил наоборот. SpaceXAI снизила частоту ошибок первого частичного результата с 18,3% в версии 1.0 до 3,4% в 2.0, и ценой этого стал переход с 0,25 секунды на 0,49 секунды по тому же показателю. Модель Meta была спроектирована противоположным образом: с 80-миллисекундными аудиофрагментами и адаптивной задержкой, обученной с подкреплением, которая решает, сколько ждать перед фиксацией текста, — механизм, вся цель которого — удерживать точность, сохраняя быстроту фиксации. Ни один из этих выборов не является ошибкой. Это ответы на разные вопросы.
Какой вопрос вы задаёте?
Если транскрипт поступает голосовому агенту, который должен ответить в пределах разговорной паузы, 0,16 секунды и 0,49 секунды — это разные продукты. При человеческом обмене репликами допустима пауза в несколько сотен миллисекунд, прежде чем взаимодействие начинает казаться неправильным, а бюджет задержки общий — транскрипция, затем рассуждение, затем синтез речи. Модель, которая возвращает финальный транскрипт за шестую долю секунды, оставляет запас для остальной части конвейера; а та, которой требуется полсекунды, потребляет большую часть бюджета ещё до того, как модель успевает что-либо обдумать. Именно для этого Meta это и создала, и именно поэтому модель работает внутри Meta AI на Mac и внутри Muse Code, а не предлагается в первую очередь как эндпоинт для конвейеров других людей.
Если транскрипт — это документ — запись звонка, встреча, видеотека, архив для целей соответствия — то полсекунды ничего не решают, разница в точности по-прежнему ничего не значит, и единственное число, которое имеет значение, — это стоимость часа аудио. Именно здесь эти два варианта резко расходятся, причём в направлении, которое удивляет тех, кто смотрит только на тариф потоковой передачи.
В пакетном режиме — вдвое дешевле, при потоковой обработке — на 10% дороже.
Meta указывает стоимость Muse Voice Transcribe в размере $0.18 за час аудио, или $3.00 за 1 000 минут. Grok Voice Transcribe 2.0 указана по цене $0.10 за час для пакетной обработки и $0.20 за час для потоковой передачи. Итак:
• Стриминг — Grok Voice Transcribe 2.0 по $0.20 в час против Muse Voice Transcribe по $0.18, так что Meta примерно на 10% дешевле
• Пакетно или в записи — $0,10 в час против $0,18, поэтому SpaceXAI на 44% дешевле
• Включено по прейскурантной цене — диаризация, временные метки слов с оценкой уверенности, смещение в пользу ключевых терминов и обратная нормализация текста на стороне SpaceXAI против потоковой транскрипции, диаризации и определения конечных точек как одной модели на стороне Meta
• Бесплатный тариф или самостоятельный хостинг — ни то, ни другое, по обоим пунктам
Команда, которая работает исключительно с потоковым аудио, должна быть безразлична к выбору между ними по цене и выбирать по задержке, а значит, Meta. Команде с любым существенным объёмом записанного аудио стоит смотреть на строку пакетной обработки, потому что $0,08 в час накапливаются: 5 000 часов в месяц — это $500 у одного и $900 у другого, а разница в точности между ними меньше, чем погрешность округления любого из этих чисел.
Лицензионная ситуация одинакова в том, что важно, и различна в том, что не имеет значения. У обоих закрытые веса: Muse Voice Transcribe является проприетарным и доступен только через хостинговый API Meta, а Grok Voice Transcribe 2.0 — коммерческий API без возможности загрузки. Ни один из них не подходит, если ваше требование состоит в том, чтобы аудио никогда не покидало контролируемую вами инфраструктуру, и оба оставляют вас уязвимыми к тому, что поставщик изменит свою цену, версию модели или график прекращения поддержки у вас под ногами. Это реальное соображение, а не гипотетическое: Grok Voice Transcribe 1.0 уже идёт по пути прекращения поддержки менее чем через две недели после выпуска его преемника.

Диаризация — это функция, которую ни один из них не выставляет на первый план.
Обе модели выполняют атрибуцию говорящего за один проход, которая два года назад была отдельной системой, прикрученной задним числом, а сравнение здесь необычно конкретное, потому что Meta опубликовала цифру, а SpaceXAI — нет.
Meta сообщает о средней частоте ошибок диаризации в 17,5% по результатам своей оценки, обрабатывает 20 и более говорящих без постобработки и делает это в рамках потоковой модели, а не на отдельном последующем этапе — «кто что сказал» приходит вместе с текстом, а не после него. Это действительно трудно сделать в потоковом режиме, где реплику говорящего можно определить, лишь услышав её достаточно, а 17,5% — это настоящая цифра с настоящей оговоркой: это собственная цифра Meta, усреднённая по выбранному Meta набору для оценки.
Модель SpaceXAI включает диаризацию без дополнительной платы, а также поддерживает до восьми независимых аудиоканалов в одном запросе — это другой способ решения той же задачи: если ваше аудио поступает в виде отдельных каналов для каждого участника, как часто бывает в телефонии контакт-центров, разделение по каналам надёжнее диаризации и вообще не требует оценки частоты ошибок. Если ваше аудио поступает одним смешанным потоком, вы зависите от качества диаризации, и только один из этих двух поставщиков сообщил вам, каково оно.
Есть различие второго порядка, которое стоит отметить: Muse Voice Transcribe рассматривает диаризацию, транскрибацию и обнаружение конечных точек как одну модель, выдающую один результат, а значит, эти компоненты не могут выходить из строя независимо. Grok Voice Transcribe 2.0 позволяет использовать каналы, ключевые термины и диаризацию как отдельные рычаги. Одну модель проще запускать, но сложнее отлаживать.

Языки — и где две карточки моделей перестают быть сопоставимыми
Meta обучила Muse Voice Transcribe более чем на 70 языках и тщательно проверила 25 из них на момент запуска; поддерживается нативное переключение кода внутри предложений и между ними, а также обработка аудио длительностью более часа. Grok Voice Transcribe 2.0 выполняет автоматическое определение языка с переключением во время записи и применяет обратную текстовую нормализацию — произносимые даты, валюты, номера телефонов и адреса электронной почты отображаются в письменной форме — для 25 языков.
Пересечение — это 25 всесторонне проверенных языков с одной стороны и 25 языков нормализации с другой, и эти два набора — не одни и те же 25 языков, и ни один из поставщиков не опубликовал список. «70+ языков, на которых проводилось обучение» и «25 языков с поддержкой форматирования» — это несопоставимые утверждения, и их не следует вычитать одно из другого. Можно сказать, что Meta делает более широкое многоязычное заявление, а SpaceXAI — более узкое, но более операционное: определение языка — это обязательный минимум, а форматирование того, что услышала модель, во что-то, что может разобрать нижестоящая система, — это та часть, отсутствие которой ломает интеграции.
Выбор — и причина, по которой, возможно, не вам его делать.
Отбросьте маркетинг — и решение сводится к трём предложениям. Выбирайте Muse Voice Transcribe, если расшифровка используется в реальном времени во время разговора, потому что 0,16 секунды — это не мелочь. Выбирайте Grok Voice Transcribe 2.0, если у вас много записанного аудио, потому что вдвое меньшая цена пакетной обработки — тоже не мелочь. Если вам не нужна ни одна из этих крайностей, выбирайте исходя из любых других ограничений — региона, договора, существующей интеграции, — потому что разница в точности всё равно не решит вопрос.
Сложность в том, что одна из этих двух моделей на самом деле не продаётся в обычном смысле. Muse Voice Transcribe существует, чтобы ассистент самой Meta казался быстрым, и она доступна через Meta Model API в основном потому, что Meta решила: ценность для экосистемы от открытого доступа превышает ценность эксклюзивности. Это может измениться, причём быстро: в ту же неделю Meta открыла платформу коннекторов Muse для сторонних разработчиков, а это компания, которая инвестирует в собственный канал дистрибуции, а не в роль нейтрального поставщика для всех остальных. Создание зависимости в продакшене от внутренней модели конкурента — это ставка на то, что условия не изменятся, а у этой ставки плохая история.
Эта асимметрия — аргумент за то, чтобы не вшивать жёстко ни один из них. OrcaRouter предоставляет более 200 моделей через единый ключ, совместимый с OpenAI, с автоматическим переключением при сбое между провайдерами и 0% наценки к цене провайдера по прайс-листу — так что когда SpaceXAI переключит версию по умолчанию на 2.0 и признает 1.0 устаревшей или когда Meta изменит позиционирование своего речевого API, изменение сведётся к строке модели, а не к проекту миграции. Для категории, где лидер менялся дважды за три недели, слой маршрутизации — это часть стека, которая должна быть стабильной, а модель — часть, которая не должна.

За следующим месяцем стоит следить за одним: проведёт ли Artificial Analysis повторное измерение Muse Voice Transcribe в стриминговом рейтинге теперь, когда Grok Voice Transcribe 2.0 вытеснил его оттуда. Показатели Meta — 3,1% — и SpaceXAI — 2,7% — оба были заявлены при запуске, но независимо проверен только показатель SpaceXAI. Если цифра Meta подтвердится, когда кто-то прогонит тест заново, разрыв в точности так мал, как кажется, и всё решает разрыв в задержке. Если нет — семнадцатидневное правление и было всей историей.
