Титульная карточка для Muse Voice Transcribe — первой модели восприятия аудио в реальном времени от Meta Superintelligence Labs, — демонстрирующая потоковую осциллограмму с подписанными распознаванием речи (ASR), диаризацией 20+ говорящих и определением конца высказывания, а также ценник с указанием $0.18 за час аудио.
Guides & Insights

Muse Voice Transcribe запущен: первая модель восприятия аудио в реальном времени от Meta

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Muse Voice Transcribe — первая модель обработки аудио в реальном времени от Meta Superintelligence Labs — вышла 1 сентября 2026 года, и её цена звучит как спойлер: $3,00 за 1000 минут аудио, то есть около $0,18 в час, в Meta Model API. За один потоковый проход она делает то, на что большинство систем транскрибации тратят три компонента: автоматическое распознавание речи, диаризацию говорящих (более 20 голосов) и определение конца высказывания — то есть решает, когда говорящий действительно закончил, а не просто задумался в середине фразы. По словам Meta, модель возглавляет лидерборд потокового распознавания речи Artificial Analysis с частотой ошибок на словах 3,1% в финальных транскриптах, выдавая результат через 0,16 секунды после того, как говорящий замолчал.

Это последнее число нужно честно подписать, прежде чем оно начнёт работать: это заявление Meta, сделанное в день запуска и ссылающееся на независимый рейтинг, для модели, к которой можно было обратиться менее суток на момент выхода анонса. Никто за пределами лаборатории пока не воспроизвёл 3,1%, и заявление о точности — это одно, а остальная часть презентации — 70+ обученных языков, нативное переключение кодов, «адаптивная задержка» на основе обучения с подкреплением — это отдельный набор вендорских заявлений в той же лодке. Всё в этом посте — состояние модели на первый день, где цифры вендора подписаны как цифры вендора.

Цифры, которые имеют значение с первого дня

• Цена — $3.00 за 1 000 аудио-минут (около $0.18 за аудио-час) на Meta Model API, что ниже, чем у всех крупных API потоковой транскрибации, которые мы отслеживаем.

• Заявление о точности — 3,1% WER на финальных транскриптах через 0,16 секунды после окончания речи; 3,6% WER на первых частичных транскриптах через 0,13 секунды. Заявлено поставщиком со ссылкой на стриминговый лидерборд Artificial Analysis.

• Диаризация — более 20 спикеров, вывод в потоковом режиме без отдельного этапа постобработки (Meta сообщает о средней частоте ошибок диаризации 17,5%).

• Языки — обучение на 70+ языках; 25 языков «тщательно проверены» при запуске; бесшовное переключение кодов внутри и между предложениями.

• Контекст — обрабатывает аудио длительностью более одного часа; настройка по языку, ключевым словам и контексту для областей с большим количеством жаргона.

A screenshot of the Meta AI Research announcement post for Muse Voice Transcribe (captured September 2, 2026), showing the headline 'Introducing Muse Voice Transcribe', the September 1, 2026 publication date, and an interactive real-time transcription demo at the top of the page.

Что здесь означает «модель слухового восприятия»?

Архитектура — это и есть история. Muse Voice Transcribe принимает аудио фрагментами по 80 миллисекунд и выводит слова потоком по мере их стабилизации, что на практике и означает «реальное время». Самое интересное — как модель решает, когда зафиксировать слово. Вместо фиксированного бюджета задержки — стандартного компромисса, при котором распознаватель либо фиксирует слово рано и угадывает, либо ждет дольше и подстраховывается, — модель использует то, что Meta называет «адаптивной задержкой»: она быстро проходит простые фрагменты речи и удерживает больше аудиоконтекста для слов, в которых менее уверена. Сама политика задержки была выработана с помощью обучения с подкреплением, так что модель по сути балансирует скорость и точность для каждого слова, а не применяет единую глобальную настройку.

Это различие — причина, по которой Meta называет Muse Voice Transcribe «моделью аудиовосприятия», а не моделью ASR. Выходной поток — это единая живая расшифровка, которая также несёт информацию о том, кто говорит и когда высказывание завершено, — три метки, которые потоковые системы обычно собирают, склеивая распознаватель с детектором голосовой активности и моделью диаризации, каждая из которых добавляет свою задержку и свои сценарии отказов.

A screenshot of the Artificial Analysis Speech to Text leaderboard showing the WER Index (non-streaming), Speed Factor, Streaming, and Price in USD per 1,000 minutes of audio sections.

Встроенные диаризация и определение конца речи

Диаризация говорящих — это часть, которая больше всего заслуживает пристального внимания, поскольку именно в этой функции стриминговые продукты чаще всего преувеличивают свои возможности. Meta утверждает, что модель разделяет 20+ говорящих в одной записи и сообщает о средней частоте ошибок диаризации 17,5%, противопоставляя это диапазону 21,1–28,6%, который она приписывает системам конкурентов. Оба числа опубликованы вендором в день запуска, и независимая оценка ещё не подтвердила 17,5%. Структурно реальным является то, что диаризация выполняется в том же потоковом проходе, что и распознавание — здесь нет второго шага «загрузите аудио, подождите, получите говорящих», и именно этот выбор конструкции делает отслеживание 20+ говорящих правдоподобным в условиях живого вещания.

Эндпоинтинг — менее заметная возможность, но, пожалуй, самая полезная. API транскрипции, отдающие сырой потоковый ASR, вынуждают клиента самостоятельно реализовывать определение конца высказывания, из-за чего голосовые агенты так часто перебивают людей или оставляют мёртвую тишину. Muse Voice Transcribe сам определяет, когда реплика завершена, и передаёт эту границу в составе потока, поэтому приложение получает чёткий сигнал «говорящий закончил» без создания собственного слоя VAD.

Многоязычное утверждение, читайте внимательно

Meta обучала модель на 70+ языках, но на запуске подтверждает 25. Это разные вещи: «обучена на» означает, что языки входили в данные; «тщательно проверено» — это подмножество, за которое Meta действительно ручается по итогам внутреннего тестирования. Для продакшн-использования реальное покрытие — это список из 25 проверенных языков, и о разрыве между 70 и 25 стоит знать, прежде чем прогонять через неё 40 языков. Что действительно необычно, так это история с переключением языковых кодов — модель переключает языки в середине предложения и в середине высказывания без дополнительных указаний, что является реальной болью в многоязычных регионах и тем, чего большинство одноязычных ASR-продуктов просто не умеют. Языковое смещение, смещение по ключевым словам и контекстное смещение дополняют историю кастомизации: можно смещать распознавание в сторону доменной лексики — именно эта функция делает потоковый ASR применимым в медицинских, юридических и службах поддержки.

Три поверхности — одна модель

Muse Voice Transcribe выходит сразу на три поверхности. Платная — это Meta Model API по цене $3.00 за 1000 аудиоминут. Потребительская — это Meta AI для Mac, где удержание клавиши Fn позволяет диктовать текст в любом приложении — ответ Meta на встроенную диктовку Apple и самое заметное реальное применение модели с первого дня. Для разработчиков — это Muse Code, агент кодинга от Meta, где голосовые команды управляют многоагентными сессиями и процессами рефакторинга. Одна модель, обеспечивающая и функцию диктовки, и агента кодинга, — это продуктовая версия идеи «одна потоковая модель, много поверхностей».

Что подрывает цена

При цене 0,18 доллара за аудио-час Muse Voice Transcribe по прейскуранту обходит всех конкурентов в области потоковой транскрипции. Сравнительный ряд в нашей выборке: Google Gemini 3.5 Transcribe Live — около 9 долларов за 1000 минут, ElevenLabs Scribe v2 Realtime — заявлено 6,50 доллара за 1000 минут, Cartesia Ink-2 — 4,00 доллара, а OpenAI GPT Live Transcribe — 17,00 доллара. Это опубликованные цифры вендоров, и у ряда этих моделей есть независимые подтверждения точности, которых у Muse пока нет: ценовое лидерство в первый день — это ещё не устоявшийся рейтинг. Но потоковая модель со встроенной диаризацией и детекцией конца фразы, выходящая на рынок примерно по цене от одной пятой до одной десятой от стоимости действующих потоковых API, — это тот самый показатель, который в любом случае меняет ожидания.

A generated price-comparison infographic titled 'Streaming transcription — list price per 1,000 minutes' showing Muse Voice Transcribe at $3.00 against Cartesia Ink-2 at $4.00, ElevenLabs Scribe v2 Realtime at $6.50, Gemini 3.5 Transcribe Live at $9.00, and GPT Live Transcribe at $17.00, with a footer noting these are vendor list prices as published in September 2026, and the OrcaRouter logo in the bottom-right corner.

Честные оговорки

Muse Voice Transcribe — проприетарный продукт, и веса не опубликованы: варианта «запустить самостоятельно» не существует, как нет и открытых весов для аудита или дообучения. Заявление о точности сделано в день запуска и независимо не воспроизведено. 25 проверенных языков могут не соответствовать заявленным 70+ языкам обучения в части покрытия низкоресурсных языков. А бенчмарк диаризации, каким бы многообещающим он ни был, — это измерение вендора, пока его не подтвердит независимый прогон. Для команд, чьё единственное требование — точная пакетная транскрибация заранее записанного аудио, по-прежнему существуют более дешёвые варианты с более прозрачным аудитом: позиционирование стриминга строится вокруг взаимодействия в реальном времени, а не вокруг того, чтобы превзойти пакетную транскрибацию по цене за аудио-час.

Что посмотреть дальше

Четыре фактора определят, станет ли этот запуск моментом или трендом. Во-первых, действительно ли стриминговый лидерборд Artificial Analysis поставит Muse Voice Transcribe на первое место после независимой проверки — заявление в день запуска должно подтверждаться закреплённой записью в таблице. Во-вторых, переживёт ли диаризация 20+ спикеров контакт с реальными шумными совещаниями. В-третьих, приведёт ли функция диктовки Meta на Mac к внедрению API разработчиками. В-четвёртых, как отреагируют на цену действующие игроки, потому что стриминговая модель с диаризацией и эндпойнтингом за $0.18 в час оказывает заметное давление на всех, кто установил более высокую цену. Когда Meta откроет модель для дополнительных партнёров по обслуживанию, сквозной шлюз вроде OrcaRouter — который передаёт публичные цены провайдеров с нулевой наценкой — покажет те же $3.00 за 1 000 минут без накрутки реселлера в день появления. До тех пор единственное место для вызова Muse Voice Transcribe — собственный API Meta.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube