Сгенерированная карточка заголовка с шапкой СПРАВКА ПО МОДЕЛИ, названием «Muse Voice Transcribe» и подзаголовком «Потоковая модель преобразования речи в текст от Meta на Model API», над четырьмя скруглёнными карточками с текстом «$0.18 за час аудио», «Потоковый WebSocket + файловый эндпоинт», «25 оценённых языков с переключением кода» и «Отметки времени на уровне реплик, а не на уровне слов», с нижним колонтитулом «Источник: собственная страница модели и документация Meta, 2026-09-29».
Guides & Insights

Muse Voice Transcribe: потоковая модель распознавания речи от Meta — объяснение

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Muse Voice Transcribe — это потоковая модель распознавания речи от Meta. Она работает в Meta Model API по цене $0,18 за час аудио, под идентификатором модели muse-voice-transcribe-1.0, и цена одинакова независимо от того, передаёте ли вы живой аудиопоток или готовую запись. Эта модель заслуживает отдельной справочной страницы, а не однострочной проверки цены, потому что важно, где именно выполняется работа: атрибуция говорящих для более чем двадцати голосов и определение конца речи выполняются внутри модели распознавания, а не в пакетном проходе, добавленном в конце потока. Она предназначена только для распознавания речи — в документации для разработчиков Meta сказано именно так: она не синтезирует речь и не предоставляет API разговора «речь-в-речь».

Это страница, на которую читатель попадает после поиска по названию самой модели, поэтому она задумана как стабильный ответ на два вопроса — что это за модель и сколько стоит час аудио, — а не как анонс. Одну дату следует зафиксировать прежде всего остального, потому что это факт о модели, а не причина, по которой существует страница: Meta Superintelligence Labs представила Muse Voice Transcribe 2026-09-01 в датированном анонсирующем посте Представляем Muse Voice Transcribe — посте, до которого читатель всё ещё может добраться через индекс блога Meta, хотя по собственному URL он больше не отвечает. Всё ниже было прочитано на собственных страницах Meta 2026-09-29, главным образом на странице модели и в документации API по распознаванию речи и обзорной документации. Там, где Meta не публикует цифру, эта страница прямо об этом сообщает, а не подставляет вместо неё косвенную оценку.

Что это такое, на языке Meta

Собственная документация Meta начинает описание без обиняков: «Muse Voice Transcribe — это модель преобразования речи в текст от Meta в Meta Model API. Расшифровывайте живую аудиодорожку или существующую запись с обнаружением реплик, метками говорящих и смещением словаря». На странице обзора то же самое сжато в одно предложение — потоковая диаризация говорящих, встроенное определение окончания речи и обнаружение голосовой активности, смещение с учётом контекста и ключевых слов, а также 25 оценённых языков с переключением между языками. Таким образом, на выходе получается единый поток расшифровки, который одновременно несёт три метки: слова, кто говорит и завершено ли высказывание. Именно эту комбинацию большинство продакшен-стеков сейчас собирают из распознавателя, отдельного детектора голосовой активности и отдельной модели диаризации, каждая из которых имеет собственный бюджет задержки.

Страница модели Meta описывает это как «конкурентоспособную задержку и точность потоковой транскрипции с атрибуцией в реальном времени для более чем 20 говорящих», а документация для разработчиков описывает поле вывода как «текст транскрипта с таймингом на уровне реплик и необязательными метками говорящих». Из этого следуют две вещи, и обе важнее этой подачи:

• Это модель с аудиовходом и текстовым выходом. Она не является ни моделью с текстом на входе, ни моделью с текстом на выходе, и Meta прямо заявляет, что это не генератор речи.

• В первую очередь это потоковая модель. Путь реального времени — не обёртка вокруг файлового пути; это сессия WebSocket с собственными событиями, режимами и ограничениями, описанными ниже.

Сколько стоит час аудио

На странице модели Muse Voice Transcribe от Meta цена указана так: «Создавайте с помощью одной модели всего за $0.18/час», а в таблице характеристик muse-voice-transcribe-1.0 указан по цене $0.18 за час аудио и $3.00 за 1000 минут. Это два способа подачи одной и той же ставки, и оба приведены на собственной странице Meta по состоянию на 2026-09-29. В документации для разработчиков та же ставка указана третьим способом: «Цена составляет $0.18 за час обработанного аудио». Ни одна цифра на этой странице не перенесена со страницы цен Meta, потому что читаемой страницы цен Meta не существует: в документации ставка вынесена на страницу «Pricing and rate limits», которая по состоянию на 2026-09-29 выдаёт Эта страница недоступна, поэтому источником сведений о ставке является страница модели, и только она здесь и использована.

Деталь о тарификации находится в документации для разработчиков, и её стоит знать, прежде чем оценивать рабочую нагрузку:

• Потоковая и непотоковая передача стоят одинаково. За использование эндпоинта реального времени доплаты нет.

• Обработка в режиме Zero-data-retention тарифицируется наравне с уровнем Standard согласно документации — это не отдельная строка доплаты.

• Оплата округляется вниз до целых секунд, поэтому двухсекундный ход тарифицируется как две секунды, а не три.

• Сбои, возникшие до создания расшифровки, не тарифицируются, как и 429 ответы с ограничением частоты.

• Бесплатные кредиты существуют на уровне платформы, а не модели. Документация Meta по распознаванию речи завершает абзац о ценах предложением «Применяются бесплатные кредиты уровня платформы». Это единственная формулировка о чём-либо бесплатном на страницах для этой модели, и она намеренно неконкретна: она указывает на платформенную схему кредитов, а не обещает бесплатный лимит на транскрибацию, и для неё не указаны ни сумма, ни срок, ни правила предоставления. Читайте это как кредит, который может уменьшить счёт, а не как бесплатный тариф для модели. Публичное заявление Meta о том, что её персональный агент «бесплатен для большинства того, что нужно людям», — это отдельное предложение о приложении Muse, и оно не распространяется на Model API.

Наглядный пример, потому что цену за час трудно ощутить: двухчасовое записанное интервью — это $0.36 за транскрибацию. Тысяча часов аудиозаписей звонков — примерно месячный объём контакт-центра среднего размера — это $180. В таком масштабе ставка — это и есть весь аргумент, а ставка — это ещё и то единственное, что может сдвинуться у вас под ногами: страница Meta — авторитетный источник по ней, и если цифра меняется там, она меняется здесь.

Потоковый интерфейс, эндпоинт за эндпоинтом

This is the part a reference page owes a reader that a launch write-up cannot carry, so here it is in the order you meet it. Base URL for Model API is https://api.meta.ai/v1 with a Bearer token, and Muse Voice Transcribe adds two endpoints on top of it.

• Живое аудио — wss://api.meta.ai/v1/asr/realtime. Транспорт — WebSocket, и деталь аутентификации — это ловушка: вы аутентифицируетесь в фрейме рукопожатия, а Authorization заголовок игнорируется. Рукопожатие должно быть первым текстовым фреймом JSON и должно прийти в течение 10 секунд. Сессия длится до 60 минут, новое WebSocket-соединение создаёт новую сессию, и токена возобновления нет.

• Записи — POST https://api.meta.ai/v1/asr/transcribe. Multipart-загрузка, и этот действительно аутентифицируется с помощью Authorization-заголовка. Входные данные ограничены: только моно 16-битный PCM WAV с частотой 16 или 24 кГц. Ограничения: 32 МБ на тело запроса и 10 минут аудио на запрос.

Внутри сеанса реального времени три режима меняют то, что вам передаётся. PUSH_TO_TALK — это режим по умолчанию, выполняющий транскрипцию одной реплики. ENDPOINTING даёт определяемые моделью границы реплик, — одна реплика на каждый обнаруженный сегмент речи, — и генерирует события speechStart, повторяющиеся transcript, speechEnd и speechComplete, с предупреждением, что speechEnd — это не транскрипт. DIARIZATION добавляет автоматическое определение и атрибуцию говорящего, генерируя события speaker с метками, такими как A и B. Частичные транскрипты бывают либо накопительными, когда каждый частичный результат заменяет предыдущий, либо в виде дельт.

Две эксплуатационные детали из одной и той же документации легко упустить, а их обнаружение в продакшене обходится дорого:

• Диаризация отмечает возможного нового говорящего, а не чёткую конечную точку речи, и Meta заявляет, что она не оптимизирована для низколатентного использования в голосовых командах. Рассматривайте эти метки как идентификаторы в рамках сессии — A в одной сессии — это не тот же человек, что A в следующей.

• Ходы могут перекрываться, поэтому состояние каждого хода должно быть привязано к идентификатору хода, а не к порядку поступления.

• Опубликованные предельные значения на одного арендатора — 128 одновременных потоков и 16 000 потоков в час.

Что работает внутри модели и что оно заменяет

Страница модели Meta делает конкретное утверждение об архитектуре, а не о показателях: «Атрибуция говорящего для 20+ говорящих и определение конца речи происходят внутри модели распознавания» — и это явно противопоставляется пакетному проходу в конце аудиопотока. Практическая разница в том, что нет второй стадии, которую нужно ждать. Метки говорящих и границы реплик поступают в том же потоке, что и слова, поэтому нижестоящий голосовой агент или интерфейс живых субтитров получает завершённую реплику и идентификацию без этапа постобработки.

Другие возможности, которые Meta описывает как встроенные в модель:

• Встроенное определение конца речи и обнаружение голосовой активности, так что вам не нужно запускать собственный VAD перед API. Как сформулировано в документации, вы получаете одну завершённую транскрипцию на каждое высказывание, не запуская собственное обнаружение голосовой активности, и обнаруженный конец речи не завершает сеанс.

• Контекстное смещение и смещение по ключевым словам, без тонкой настройки. На странице модели Meta говорится, что точность поддерживается «за счёт контекстного смещения и смещения по ключевым словам, без тонкой настройки»; именно эта функция делает потоковое ASR пригодным для предметной лексики — названий лекарств, биржевых тикеров, товарных SKU — а не для среднестатистической лексики общего языка. В документации точно указаны ограничения: ключевые слова смещают распознавание, но не гарантируют точного написания, при этом и ключевые слова, и языковое смещение фиксируются в начале сессии.

• 25 оценённых языков с переключением кода. В документации перечислены: арабский, бенгальский, нидерландский, английский, французский, немецкий, иврит, хинди, индонезийский, итальянский, японский, каннада, корейский, малайский, китайский (мандаринский), маратхи, польский, португальский, испанский, тагальский, тамильский, телугу, тайский, турецкий и вьетнамский. Переключение кода — в середине предложения и в середине высказывания, без указания, какой язык будет следующим, — это возможность, которую одноязычные распознаватели структурно не могут предоставить. Одна оговорка, которую стоит запомнить: языковое смещение — это список языков, а не произвольный контекст, и оно не заставляет модель их использовать.

Датированный пост-анонс идёт дальше: в нём говорится, что модель обучалась на более чем 70 языках, из которых 25 «тщательно проверены» — по данным вендора, и список этих 25 проверенных — то подмножество, за которое ручается Meta. Именно на этот охват следует ориентироваться при планировании, а не на 70.

Документированные ограничения

Справочная страница хороша ровно настолько, насколько хороши ограничения, которые она выводит, а Meta выводит несколько.

• Метки времени на уровне реплик, а не на уровне слов. И на странице модели, и в документации прямо сказано: «Возвращаются метки времени на уровне реплик, но не на уровне слов». Реплики содержат время начала и окончания в миллисекундах. Если вашему продукту нужен переход по клику для каждого слова — караоке-подсветка, маршрутизация по уверенности для каждого слова, принудительное выравнивание — это неподходящая модель, и никакой промпт-инжиниринг этого не изменит.

• Никаких оценок уверенности, никакого обнаружения звуковых событий, никакого определения эмоций, никакого переформатирования транскрипта. Meta перечисляет все четыре как недоступные. Вы получаете слова, реплики, тайминги и метки говорящих — и ничего о том, насколько уверена модель.

• Нет синтеза речи и API для диалога «речь-в-речь». Это работает только в одном направлении.

• Набор аудиоформатов здесь ограничен.Моно, 16-бит PCM WAV, 16 или 24 кГц. Всё остальное необходимо преобразовать перед загрузкой.

Открытые веса и путаница с Muse Glimmer

Muse Voice Transcribe — проприетарная модель, доступная через API: это не релиз с открытыми весами, и документация Meta этого никогда не утверждает. Это важно, потому что читатели приписывают путь открытых весов семейства Muse не тому названию. Muse Glimmer — это и есть тот путь: в документации Meta она описана как мультимодальная модель с открытыми весами, дистиллированная из Muse Spark и распространяемая по разрешительной лицензии Apache 2.0, которую вы скачиваете и запускаете на собственном оборудовании через такой рантайм, как vLLM, SGLang, llama.cpp или ExecuTorch. Muse Voice Transcribe на той же странице отнесена вместе с Muse Spark, Muse Image и SAM к моделям, которые вызывают, а не скачивают.

Итак: никаких весов для Muse Voice Transcribe, никакого варианта с самостоятельным хостингом, никакого способа провести аудит или дообучить. Если вам скажут обратное, значит, это спутали с Muse Glimmer. Когда веса модели не опубликованы, вся суть — в платформе хостинга, и именно об этом следующий раздел.

Как клиент попадает в него

Model API от Meta создан так, чтобы его можно было подключить к уже имеющимся у вас клиентам. Утверждение вендора, напечатанное на странице обзора API, гласит, что Model API «совместим по принципу drop-in с клиентскими библиотеками, совместимыми с OpenAI и Anthropic, а также с CLI агентов, совместимыми с OpenAI. Укажите базовый URL вашего клиента, добавьте ключ и оставьте остальной код без изменений». В целом Model API предлагает три формы запросов — Responses API, Chat Completions API и Messages API, — поэтому у существующей интеграции обычно есть соответствующий интерфейс без необходимости переписывания. Одно предостережение относительно охвата: это предложение о совместимости и эти три формы относятся к возможностям Model API в целом, а не являются строками, напечатанными на собственной странице модели Muse Voice Transcribe. Собственное руководство по быстрому старту на странице модели более узкое — там сказано лишь, что вы «направляете свой существующий клиент, совместимый с OpenAI, на Meta Model API», и что первый рабочий запрос у вас получится менее чем за пять минут.

Об одной честной лакуне стоит упомянуть на справочной странице: документация Meta для этой модели не называет официальной клиентской библиотеки для Muse Voice Transcribe, а её страница «Клиентские библиотеки» находится в разделе SAM, а не в разделе Voice. Вместо этого руководство по распознаванию речи предлагает конкретный список зависимостей — Python 3.9 или более поздней версии с websockets и sounddevice в качестве пакетов — а также сборник рецептов по основам голосового API. Таким образом, утверждение о бесшовной замене описывает интерфейс запросов Model API в целом; сам эндпоинт ASR в реальном времени — это WebSocket с собственными правилами рукопожатия и без документированной обёртки.

A screenshot of Meta's model page for Muse Voice Transcribe (captured 2026-09-29), showing the headline 'Competitive latency and streaming transcription accuracy with live attribution for 20+ speakers. Build with a single model at $0.18/hour.', a 'Meet Muse Voice Transcribe' panel of capability cards headed 'Competitive transcription accuracy', 'Live speaker and turn awareness' and 'Production pricing', a 'Muse Voice Transcribe benchmarks' section labelled 'AA-WER Streaming Index - Final Transcription Diarization' with 3.9% and 3.9%, and the pricing row reading muse-voice-transcribe-1.0 at $3.00 per 1,000 minutes and $0.18 per hour.

Что Meta не опубликовала

Отсутствие бенчмарка — это факт о документации, поэтому здесь оно и указывается как факт. На странице модели Meta для Muse Voice Transcribe нет напечатанной таблицы точности: свидетельства её точности представлены тремя графическими материалами — таблицей лидеров по потоковой частоте ошибок в словах, сравнением частоты ошибок диаризации и индексом потоковой точности — при этом в извлекаемом тексте нет никаких цифр. Сама страница модели не приводит ни частоту ошибок в словах, ни частоту ошибок диаризации, ни разбивку по языкам.

В анонсирующем посте действительно приводятся вендорские цифры, включая потоковую частоту ошибок в словах и среднюю частоту ошибок диаризации, и именно их мы публикуем при запуске модели; это собственные измерения Meta, и они до сих пор не воспроизведены третьей стороной. Эта страница не проводит это сравнение заново, потому что повторный прогон вендорского бенчмарка, опубликованного в день релиза, на справочной странице представил бы невоспроизведённый показатель как окончательно установленный. То, что можно сказать, носит более узкий характер: Meta не публикует для этой модели прямого сравнения с названным конкурентом при сопоставимых вычислительных затратах и одинаковом тестовом стенде, поэтому любое сравнение, которое вы где бы то ни было прочтёте, — это сравнение вендорских цифр, собранных в разных условиях.

Одна дата также намеренно остаётся неустановленной. На странице модели вообще нет даты выпуска — её единственный маркер версии — это -1.0 в идентификаторе модели. Дата 2026-09-01 в этом материале взята из того датированного анонсного поста и используется здесь для датировки модели, а не для сообщения о событии.

A generated reference scoreboard titled 'Muse Voice Transcribe — the reference', listing six rows for the model: price $0.18 per hour of audio, interface as a realtime WebSocket at wss://api.meta.ai/v1/asr/realtime plus a file endpoint, speaker attribution for 20+ speakers inside the recognition model, turn-level timestamps without word-level times, 25 evaluated languages with code-switching, and proprietary weights with no open download.A screenshot of the Speech to text page in Meta's Model API documentation (captured 2026-09-29), showing the opening sentence 'Muse Voice Transcribe is Meta's speech-to-text model on Meta Model API', an 'Available endpoints' table contrasting wss://api.meta.ai/v1/asr/realtime for live audio against POST https://api.meta.ai/v1/asr/transcribe for a recording and noting that the Authorization header is ignored on the WebSocket, and a Features table whose rows include language biasing across 25 supported languages with code-switching, vocabulary biasing, speech-turn detection, speaker labels, partial transcripts and progress events.

Кому стоит это использовать, а кому — нет.

Аргумент в пользу Muse Voice Transcribe узок и силён: живое аудио, где слова, личность говорящего и окончания реплик нужны в одном потоке, по цене, достаточно низкой, чтобы работать непрерывно, а не по запросу. Голосовые агенты, живые субтитры, аналитика встреч и звонков, диктовка и высокообъёмная транскрипция — это те рабочие нагрузки, которые называет Meta, и именно под них фактически заточен интерфейс — 60-минутный WebSocket с режимами определения конца реплики и метками говорящих в рамках сессии.

Доводы против него столь же конкретны. Если вам нужны временные метки на уровне слов, оценка уверенности по каждому слову, обнаружение речевых событий или эмоций либо переформатирование транскрипта, у этой модели их нет, и это задокументированное отсутствие, а не ошибка. Если ваше аудио поступает в форматах, отличных от моно 16-битного WAV с частотой 16 или 24 кГц, и вы используете конечную точку для файлов, вы платите за этап преобразования, за который в другом месте не платили бы. А если ваша задача — пакетная транскрипция архивных записей, где точность является единственным критерием, потоковое предложение не даёт вам ничего — цена на обоих путях одинакова, так что вы платите за возможность работы в реальном времени, которой не воспользуетесь.

Единственное, что нужно проверить, прежде чем зафиксировать путь в продакшн, — это показатель, ради ответа на который и существует эта страница, и это единственный показатель, который может измениться без каких-либо изменений самой модели: $0,18 за час аудио, как указано сегодня на собственной странице модели Meta. Страница Meta — авторитетный источник по этому показателю. Когда он меняется, всё, что рассчитывается на его основе, — тысяча часов в месяц, стоимость одного интервью, арифметика «разрабатывать или покупать» — меняется вместе с ним.