Главная карточка статьи с заголовком «MAI-Transcribe-2 vs Muse Voice Transcribe», бейджем «MODEL COMPARISON» и подзаголовком «В одну неделю — две противоположные ставки на аудио», с чипами сравнения: пакетная обработка 2,0% AA-WER против потоковой 3,1%, $1,67 против $3,00 за 1 000 минут и 60 языков при пакетной обработке против 20+ говорящих в реальном времени, на фоне градиента от белого к синему с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

MAI-Transcribe-2 против Muse Voice Transcribe: та же неделя, две противоположные ставки на аудио

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

На неделе с 1 сентября 2026 года вышли две речевые модели из двух передовых лабораторий, и правильнее всего рассматривать MAI-Transcribe-2 и Muse Voice Transcribe как противоположные ответы на вопрос, где должен жить аудиоинтеллект. Muse Voice Transcribe, выпущенная Meta Superintelligence Labs 1 сентября, — это модель восприятия аудио в реальном времени: она транскрибирует речь, разделяет по голосам более двадцати говорящих и определяет, когда говорящий закончил, — и всё это за один потоковый проход по 80-миллисекундным фрагментам живого аудио, причём она возглавляет таблицу лидеров потокового распознавания речи, на которой её замеряли. MAI-Transcribe-2, выпущенная Microsoft двумя днями позже, 3 сентября, — это противоположная ставка: пакетный движок, который вовсе не гонится за низкой задержкой в реальном времени, а вместо этого вкладывает все силы в транскрибацию заранее записанных файлов. На независимой таблице лидеров пакетного распознавания MAI-Transcribe-2 демонстрирует лучший показатель ошибок в словах, работая примерно в 411 раз быстрее реального времени, при цене около 1,67 доллара за 1000 минут. Прямое сравнение их друг с другом как «моделей транскрибации» скрывает суть настоящего выбора, которая заключается в том, в какой момент жизни аудио вам нужны слова: пока оно звучит или уже после того, как завершилось.

Два продукта, указанные в разные моменты

Muse Voice Transcribe создана для того момента, когда аудио ещё звучит. Это авторегрессионная мультимодальная модель из семейства Muse от Meta, которая совмещает три задачи в одном проходе — автоматическое распознавание речи, диаризацию говорящих для более чем двадцати дикторов и определение конца высказывания, то есть обнаружение того, что говорящий замолчал, чтобы система могла ответить. Meta сообщает, что её итоговая расшифровка появляется примерно через 0,16 секунды после того, как говорящий замолкает, с частотой ошибок в словах 3,1% на итоговых расшифровках и 3,6% на первых частичных результатах — цифры, которые Meta опубликовала в день запуска со ссылкой на стриминговый лидерборд Artificial Analysis и которые на момент написания этого текста не были независимо воспроизведены. Модель обрабатывает аудио длительностью более часа в одном потоке, переключает языки в середине предложения и обучена на 70+ языках, из которых 25 были тщательно проверены при запуске. Цена составляет $3,00 за 1000 минут аудио, то есть примерно $0,18 в час, через Meta Model API. Meta подтвердила, что веса открыты не будут.

MAI-Transcribe-2 — модель для тех случаев, когда аудио уже существует в виде файла. В нестриминговом рейтинге Artificial Analysis она показывает 2,0% AA-WER — второе место и лучший результат среди управляемых пакетных API — и работает примерно в 411 раз быстрее реального времени: это показатель пропускной способности, а не обещание низкой задержки. Модель выполняет транскрипцию на 60 языках с автоматическим определением языка, включает диаризацию дикторов, таймкоды на уровне слов, настройку на ключевые слова (keyword biasing) и выбор между стилями verbatim и clean, а также поддерживает переключение кодов — например, хинглиш и спанглиш. Она доступна через Microsoft Foundry в публичной предварительной версии и в MAI Playground по цене $0,10 за час аудио в рамках ограниченной по времени акции в честь запуска, действующей до конца года; стриминговый продукт не анонсирован. Microsoft прямо позиционирует её для длинных и пакетных аудиозаписей — рабочих нагрузок, где низкая задержка стриминговой модели бесполезна, а вот её поминутная стоимость ощутима.

A two-column scoreboard titled 'MAI-Transcribe-2 vs Muse Voice Transcribe — the scoreboard': left column MAI-Transcribe-2 lists batch pre-recorded type, 2.0% AA-WER (non-streaming), ~411x real time, $1.67 early-bird per 1,000 minutes, 60 languages and bundled diarization with unpublished rate; right column Muse Voice Transcribe lists streaming real-time type, 3.1% streaming WER (Meta-reported), final latency ~0.16s, $3.00 per 1,000 minutes, 25 verified of 70+ languages and 20+ speaker in-stream diarization; footer notes the WER figures are not comparable and Muse figures are Meta-reported.

Почему два значения точности не конфликтуют

Естественный порыв — сравнить 2.0% и 3.1% и объявить победителя, и это было бы ошибкой сразу по двум причинам. Во-первых, эти цифры измеряют разные задачи: 2.0% у MAI-Transcribe-2 — это точность непотокового распознавания на предварительно записанном аудио, когда модель может просмотреть весь файл; 3.1% у Muse Voice Transcribe — это точность потокового распознавания на итоговых транскриптах, полученная в условиях, когда транскрипция выполняется по мере поступления аудио. Потоковое распознавание — более сложная задача, поэтому таблица лидеров для потокового режима и таблица лидеров для непотокового режима — это отдельные таблицы с отдельными показателями. Во-вторых, у этих цифр разный вес: показатель MAI-Transcribe-2 — это измерение Artificial Analysis самой модели, тогда как показатель Muse Voice Transcribe — это отчёт Meta в день запуска о том, что измерила Artificial Analysis, — данные, сообщённые вендором и не воспроизведённые независимо. Честный вывод: обе модели — это достоверные заявки на верхние строчки в своих таблицах, и ни одна из цифр ничего не говорит о другой категории.

Диаризация — вот где проходит настоящее сравнение, потому что это единственная функция, которая есть в обоих продуктах, и та, где их амбиции заметно различаются. Muse Voice Transcribe разделяет более двадцати говорящих как базовую потоковую возможность, при этом Meta сообщает о средней частоте ошибок диаризации говорящих 17,5% против диапазона конкурентов, который она приводит: от 21,1% до 28,6% — снова данные Meta, непроверенные. MAI-Transcribe-2 тоже включает диаризацию, но Microsoft не публикует ни максимального числа говорящих, ни частоты ошибок диаризации вообще. Для разговора двух участников оба продукта подходят, и разница несущественна. Для фокус-группы из двенадцати человек или записи панельной дискуссии Muse Voice Transcribe — единственный из двух, у которого вообще заявлен потолок по числу говорящих, а неизмеренная диаризация MAI-Transcribe-2 — самая веская причина протестировать его, прежде чем доверять ему более сложное аудио.

Сравнение цен, которое имеет смысл

По цене эти два продукта ближе друг к другу, чем следует из противопоставления пакетного и потокового транскрибирования: $1,67 за 1 000 минут (MAI-Transcribe-2, цена раннего доступа) и $3,00 за 1 000 минут (Muse Voice Transcribe) — обе цифры находятся у нижней границы сегмента управляемых сервисов распознавания речи. Сравнение имеет смысл только внутри одной категории. Для пакетного транскрибирования заранее записанных файлов MAI-Transcribe-2 стоит меньше половины цены изначально потоковой модели и при этом показывает лучший не-потоковый WER, — но направлять записанные файлы в Muse Voice Transcribe стоило бы, только если вам нужен именно его потоковый конвейер, а это неэффективный способ обработки архива. Для живого аудио с совещаний Muse Voice Transcribe — единственный продукт из этой статьи, который вообще работает: его ставка $3,00 ниже, чем у других API транскрибации в реальном времени, с которыми он конкурировал при запуске (у Gemini 3.5 Transcribe Live — около $9 за 1 000 минут, у GPT Live Transcribe — $17), при этом он добавляет диаризацию более чем двадцати говорящих, которой те продукты не достигают. Честный заголовок о ценах звучит так: Meta установила низкую цену на потоковую транскрибацию, а Microsoft — ещё более низкую на пакетную, и обе цифры — это цены промо-периода, которые сдвинутся, как только каждый вендор объявит свою стандартную ставку.

Screenshot of the Artificial Analysis Speech-to-Text leaderboard summary table showing Word Error Rate and Median Speed Factor columns for models including MAI-Transcribe-2 and MAI-Transcribe-1.5 under Microsoft AI, alongside rows for ElevenLabs Scribe v2 and Gemini 3.5 Transcribe.

Какой для какого аудио

Если ваше аудио — живое (встречи, которые нужно расшифровывать в реальном времени, голосовые агенты, живые субтитры, всё то, где слова нужны в момент их произнесения), Muse Voice Transcribe — лучший выбор, и это даже не близко. Это единственная здесь потоковая модель: она разделяет более двадцати говорящих за один проход, а цена на неё с первого дня была рассчитана на победу именно в этой нише. Слабые места, которые стоит проверить на пилоте: показатели точности и диаризации заявлены самой Meta, а появившаяся всего неделю назад потоковая модель ещё не показала, как ведёт себя на неидеальном аудио, которое остаётся за пределами стартовых бенчмарков.

Если ваше аудио уже представлено файлами — архивами, записями звонков, медиатеками, всем, что обрабатывается пакетно, — MAI-Transcribe-2 выигрывает по всем значимым показателям: измеренный WER ниже, пропускная способность примерно на порядок выше, а цена за 1000 минут ниже, чем у потоковой модели. Его риски — зеркальное отражение рисков Muse: продукту всего четыре дня, нет потокового SKU, качество диаризации не измерено, а за ранним тарифом стоит нераскрытая стандартная цена.

Страница запуска Microsoft, представляющая MAI-Transcribe-2, перечисляет функции, которые Microsoft поставляет в комплекте и которые стриминговый конкурент не предлагает за один проход, — и именно этот документ стоит сверять, когда вы решаете, какие заявления отражают реальные возможности продукта, а какие пока остаются обещаниями из бенчмарков.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2 (dated September 3, 2026), showing the headline 'MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world' and the opening paragraph naming new features — diarization, configurable transcription styles, word-level timestamps — and comparisons against Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large and Scribe V2.

И если расшифровка — лишь первая половина вашего пайплайна, выбор между этими двумя решениями значит меньше, чем выбор, который вы делаете уровнем выше. Аудиозаписи живых встреч, расшифрованные Muse Voice Transcribe, всё ещё нуждаются в саммаризации, извлечении пунктов действий и подготовке последующих писем, прежде чем станут полезными; архивные звонки, расшифрованные MAI-Transcribe-2, всё ещё нужно искать, редактировать или направлять в нужную нижестоящую систему. Именно на этом уровне мультимодельная платформа оправдывает себя: единый API OrcaRouter для 200+ моделей с ценами провайдеров без наценки позволяет этой нижестоящей работе через одну интеграцию вызывать для каждой нагрузки свою модель — так что какая бы речевая модель ни выиграла ваш пилот, стек над расшифровкой не придётся перестраивать при смене. Ни Muse Voice Transcribe, ни MAI-Transcribe-2 в этом списке сегодня нет; обе работают на API собственных вендоров. Реально же на этой неделе разыгралась более узкая и более полезная ставка: и потоковая, и пакетная расшифровка только что стали достаточно дешёвыми, и главное различие больше не в словах — а в том, что вы с ними делаете.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube