
Muse Voice Transcribe: потоковая модель распознавания речи от Meta — объяснение
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 1009 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 195 tok/s
- OrcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- xAISpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
Muse Voice Transcribe — это потоковая модель распознавания речи от Meta. Она работает в Meta Model API по цене $0,18 за час аудио, под идентификатором модели muse-voice-transcribe-1.0, и цена одинакова независимо от того, передаёте ли вы живой аудиопоток или готовую запись. Эта модель заслуживает отдельной справочной страницы, а не однострочной проверки цены, потому что важно, где именно выполняется работа: атрибуция говорящих для более чем двадцати голосов и определение конца речи выполняются внутри модели распознавания, а не в пакетном проходе, добавленном в конце потока. Она предназначена только для распознавания речи — в документации для разработчиков Meta сказано именно так: она не синтезирует речь и не предоставляет API разговора «речь-в-речь».
Это страница, на которую читатель попадает после поиска по названию самой модели, поэтому она задумана как стабильный ответ на два вопроса — что это за модель и сколько стоит час аудио, — а не как анонс. Одну дату следует зафиксировать прежде всего остального, потому что это факт о модели, а не причина, по которой существует страница: Meta Superintelligence Labs представила Muse Voice Transcribe 2026-09-01 в датированном анонсирующем посте Представляем Muse Voice Transcribe — посте, до которого читатель всё ещё может добраться через индекс блога Meta, хотя по собственному URL он больше не отвечает. Всё ниже было прочитано на собственных страницах Meta 2026-09-29, главным образом на странице модели и в документации API по распознаванию речи и обзорной документации. Там, где Meta не публикует цифру, эта страница прямо об этом сообщает, а не подставляет вместо неё косвенную оценку.
Что это такое, на языке Meta
Собственная документация Meta начинает описание без обиняков: «Muse Voice Transcribe — это модель преобразования речи в текст от Meta в Meta Model API. Расшифровывайте живую аудиодорожку или существующую запись с обнаружением реплик, метками говорящих и смещением словаря». На странице обзора то же самое сжато в одно предложение — потоковая диаризация говорящих, встроенное определение окончания речи и обнаружение голосовой активности, смещение с учётом контекста и ключевых слов, а также 25 оценённых языков с переключением между языками. Таким образом, на выходе получается единый поток расшифровки, который одновременно несёт три метки: слова, кто говорит и завершено ли высказывание. Именно эту комбинацию большинство продакшен-стеков сейчас собирают из распознавателя, отдельного детектора голосовой активности и отдельной модели диаризации, каждая из которых имеет собственный бюджет задержки.
Страница модели Meta описывает это как «конкурентоспособную задержку и точность потоковой транскрипции с атрибуцией в реальном времени для более чем 20 говорящих», а документация для разработчиков описывает поле вывода как «текст транскрипта с таймингом на уровне реплик и необязательными метками говорящих». Из этого следуют две вещи, и обе важнее этой подачи:
• Это модель с аудиовходом и текстовым выходом. Она не является ни моделью с текстом на входе, ни моделью с текстом на выходе, и Meta прямо заявляет, что это не генератор речи.
• В первую очередь это потоковая модель. Путь реального времени — не обёртка вокруг файлового пути; это сессия WebSocket с собственными событиями, режимами и ограничениями, описанными ниже.
Сколько стоит час аудио
На странице модели Muse Voice Transcribe от Meta цена указана так: «Создавайте с помощью одной модели всего за $0.18/час», а в таблице характеристик muse-voice-transcribe-1.0 указан по цене $0.18 за час аудио и $3.00 за 1000 минут. Это два способа подачи одной и той же ставки, и оба приведены на собственной странице Meta по состоянию на 2026-09-29. В документации для разработчиков та же ставка указана третьим способом: «Цена составляет $0.18 за час обработанного аудио». Ни одна цифра на этой странице не перенесена со страницы цен Meta, потому что читаемой страницы цен Meta не существует: в документации ставка вынесена на страницу «Pricing and rate limits», которая по состоянию на 2026-09-29 выдаёт Эта страница недоступна, поэтому источником сведений о ставке является страница модели, и только она здесь и использована.
Деталь о тарификации находится в документации для разработчиков, и её стоит знать, прежде чем оценивать рабочую нагрузку:
• Потоковая и непотоковая передача стоят одинаково. За использование эндпоинта реального времени доплаты нет.
• Обработка в режиме Zero-data-retention тарифицируется наравне с уровнем Standard согласно документации — это не отдельная строка доплаты.
• Оплата округляется вниз до целых секунд, поэтому двухсекундный ход тарифицируется как две секунды, а не три.
• Сбои, возникшие до создания расшифровки, не тарифицируются, как и 429 ответы с ограничением частоты.
• Бесплатные кредиты существуют на уровне платформы, а не модели. Документация Meta по распознаванию речи завершает абзац о ценах предложением «Применяются бесплатные кредиты уровня платформы». Это единственная формулировка о чём-либо бесплатном на страницах для этой модели, и она намеренно неконкретна: она указывает на платформенную схему кредитов, а не обещает бесплатный лимит на транскрибацию, и для неё не указаны ни сумма, ни срок, ни правила предоставления. Читайте это как кредит, который может уменьшить счёт, а не как бесплатный тариф для модели. Публичное заявление Meta о том, что её персональный агент «бесплатен для большинства того, что нужно людям», — это отдельное предложение о приложении Muse, и оно не распространяется на Model API.
Наглядный пример, потому что цену за час трудно ощутить: двухчасовое записанное интервью — это $0.36 за транскрибацию. Тысяча часов аудиозаписей звонков — примерно месячный объём контакт-центра среднего размера — это $180. В таком масштабе ставка — это и есть весь аргумент, а ставка — это ещё и то единственное, что может сдвинуться у вас под ногами: страница Meta — авторитетный источник по ней, и если цифра меняется там, она меняется здесь.
Потоковый интерфейс, эндпоинт за эндпоинтом
This is the part a reference page owes a reader that a launch write-up cannot carry, so here it is in the order you meet it. Base URL for Model API is https://api.meta.ai/v1 with a Bearer token, and Muse Voice Transcribe adds two endpoints on top of it.
• Живое аудио — wss://api.meta.ai/v1/asr/realtime. Транспорт — WebSocket, и деталь аутентификации — это ловушка: вы аутентифицируетесь в фрейме рукопожатия, а Authorization заголовок игнорируется. Рукопожатие должно быть первым текстовым фреймом JSON и должно прийти в течение 10 секунд. Сессия длится до 60 минут, новое WebSocket-соединение создаёт новую сессию, и токена возобновления нет.
• Записи — POST https://api.meta.ai/v1/asr/transcribe. Multipart-загрузка, и этот действительно аутентифицируется с помощью Authorization-заголовка. Входные данные ограничены: только моно 16-битный PCM WAV с частотой 16 или 24 кГц. Ограничения: 32 МБ на тело запроса и 10 минут аудио на запрос.
Внутри сеанса реального времени три режима меняют то, что вам передаётся. PUSH_TO_TALK — это режим по умолчанию, выполняющий транскрипцию одной реплики. ENDPOINTING даёт определяемые моделью границы реплик, — одна реплика на каждый обнаруженный сегмент речи, — и генерирует события speechStart, повторяющиеся transcript, speechEnd и speechComplete, с предупреждением, что speechEnd — это не транскрипт. DIARIZATION добавляет автоматическое определение и атрибуцию говорящего, генерируя события speaker с метками, такими как A и B. Частичные транскрипты бывают либо накопительными, когда каждый частичный результат заменяет предыдущий, либо в виде дельт.
Две эксплуатационные детали из одной и той же документации легко упустить, а их обнаружение в продакшене обходится дорого:
• Диаризация отмечает возможного нового говорящего, а не чёткую конечную точку речи, и Meta заявляет, что она не оптимизирована для низколатентного использования в голосовых командах. Рассматривайте эти метки как идентификаторы в рамках сессии — A в одной сессии — это не тот же человек, что A в следующей.
• Ходы могут перекрываться, поэтому состояние каждого хода должно быть привязано к идентификатору хода, а не к порядку поступления.
• Опубликованные предельные значения на одного арендатора — 128 одновременных потоков и 16 000 потоков в час.
Что работает внутри модели и что оно заменяет
Страница модели Meta делает конкретное утверждение об архитектуре, а не о показателях: «Атрибуция говорящего для 20+ говорящих и определение конца речи происходят внутри модели распознавания» — и это явно противопоставляется пакетному проходу в конце аудиопотока. Практическая разница в том, что нет второй стадии, которую нужно ждать. Метки говорящих и границы реплик поступают в том же потоке, что и слова, поэтому нижестоящий голосовой агент или интерфейс живых субтитров получает завершённую реплику и идентификацию без этапа постобработки.
Другие возможности, которые Meta описывает как встроенные в модель:
• Встроенное определение конца речи и обнаружение голосовой активности, так что вам не нужно запускать собственный VAD перед API. Как сформулировано в документации, вы получаете одну завершённую транскрипцию на каждое высказывание, не запуская собственное обнаружение голосовой активности, и обнаруженный конец речи не завершает сеанс.
• Контекстное смещение и смещение по ключевым словам, без тонкой настройки. На странице модели Meta говорится, что точность поддерживается «за счёт контекстного смещения и смещения по ключевым словам, без тонкой настройки»; именно эта функция делает потоковое ASR пригодным для предметной лексики — названий лекарств, биржевых тикеров, товарных SKU — а не для среднестатистической лексики общего языка. В документации точно указаны ограничения: ключевые слова смещают распознавание, но не гарантируют точного написания, при этом и ключевые слова, и языковое смещение фиксируются в начале сессии.
• 25 оценённых языков с переключением кода. В документации перечислены: арабский, бенгальский, нидерландский, английский, французский, немецкий, иврит, хинди, индонезийский, итальянский, японский, каннада, корейский, малайский, китайский (мандаринский), маратхи, польский, португальский, испанский, тагальский, тамильский, телугу, тайский, турецкий и вьетнамский. Переключение кода — в середине предложения и в середине высказывания, без указания, какой язык будет следующим, — это возможность, которую одноязычные распознаватели структурно не могут предоставить. Одна оговорка, которую стоит запомнить: языковое смещение — это список языков, а не произвольный контекст, и оно не заставляет модель их использовать.
Датированный пост-анонс идёт дальше: в нём говорится, что модель обучалась на более чем 70 языках, из которых 25 «тщательно проверены» — по данным вендора, и список этих 25 проверенных — то подмножество, за которое ручается Meta. Именно на этот охват следует ориентироваться при планировании, а не на 70.
Документированные ограничения
Справочная страница хороша ровно настолько, насколько хороши ограничения, которые она выводит, а Meta выводит несколько.
• Метки времени на уровне реплик, а не на уровне слов. И на странице модели, и в документации прямо сказано: «Возвращаются метки времени на уровне реплик, но не на уровне слов». Реплики содержат время начала и окончания в миллисекундах. Если вашему продукту нужен переход по клику для каждого слова — караоке-подсветка, маршрутизация по уверенности для каждого слова, принудительное выравнивание — это неподходящая модель, и никакой промпт-инжиниринг этого не изменит.
• Никаких оценок уверенности, никакого обнаружения звуковых событий, никакого определения эмоций, никакого переформатирования транскрипта. Meta перечисляет все четыре как недоступные. Вы получаете слова, реплики, тайминги и метки говорящих — и ничего о том, насколько уверена модель.
• Нет синтеза речи и API для диалога «речь-в-речь». Это работает только в одном направлении.
• Набор аудиоформатов здесь ограничен.Моно, 16-бит PCM WAV, 16 или 24 кГц. Всё остальное необходимо преобразовать перед загрузкой.
Открытые веса и путаница с Muse Glimmer
Muse Voice Transcribe — проприетарная модель, доступная через API: это не релиз с открытыми весами, и документация Meta этого никогда не утверждает. Это важно, потому что читатели приписывают путь открытых весов семейства Muse не тому названию. Muse Glimmer — это и есть тот путь: в документации Meta она описана как мультимодальная модель с открытыми весами, дистиллированная из Muse Spark и распространяемая по разрешительной лицензии Apache 2.0, которую вы скачиваете и запускаете на собственном оборудовании через такой рантайм, как vLLM, SGLang, llama.cpp или ExecuTorch. Muse Voice Transcribe на той же странице отнесена вместе с Muse Spark, Muse Image и SAM к моделям, которые вызывают, а не скачивают.
Итак: никаких весов для Muse Voice Transcribe, никакого варианта с самостоятельным хостингом, никакого способа провести аудит или дообучить. Если вам скажут обратное, значит, это спутали с Muse Glimmer. Когда веса модели не опубликованы, вся суть — в платформе хостинга, и именно об этом следующий раздел.
Как клиент попадает в него
Model API от Meta создан так, чтобы его можно было подключить к уже имеющимся у вас клиентам. Утверждение вендора, напечатанное на странице обзора API, гласит, что Model API «совместим по принципу drop-in с клиентскими библиотеками, совместимыми с OpenAI и Anthropic, а также с CLI агентов, совместимыми с OpenAI. Укажите базовый URL вашего клиента, добавьте ключ и оставьте остальной код без изменений». В целом Model API предлагает три формы запросов — Responses API, Chat Completions API и Messages API, — поэтому у существующей интеграции обычно есть соответствующий интерфейс без необходимости переписывания. Одно предостережение относительно охвата: это предложение о совместимости и эти три формы относятся к возможностям Model API в целом, а не являются строками, напечатанными на собственной странице модели Muse Voice Transcribe. Собственное руководство по быстрому старту на странице модели более узкое — там сказано лишь, что вы «направляете свой существующий клиент, совместимый с OpenAI, на Meta Model API», и что первый рабочий запрос у вас получится менее чем за пять минут.
Об одной честной лакуне стоит упомянуть на справочной странице: документация Meta для этой модели не называет официальной клиентской библиотеки для Muse Voice Transcribe, а её страница «Клиентские библиотеки» находится в разделе SAM, а не в разделе Voice. Вместо этого руководство по распознаванию речи предлагает конкретный список зависимостей — Python 3.9 или более поздней версии с websockets и sounddevice в качестве пакетов — а также сборник рецептов по основам голосового API. Таким образом, утверждение о бесшовной замене описывает интерфейс запросов Model API в целом; сам эндпоинт ASR в реальном времени — это WebSocket с собственными правилами рукопожатия и без документированной обёртки.

Что Meta не опубликовала
Отсутствие бенчмарка — это факт о документации, поэтому здесь оно и указывается как факт. На странице модели Meta для Muse Voice Transcribe нет напечатанной таблицы точности: свидетельства её точности представлены тремя графическими материалами — таблицей лидеров по потоковой частоте ошибок в словах, сравнением частоты ошибок диаризации и индексом потоковой точности — при этом в извлекаемом тексте нет никаких цифр. Сама страница модели не приводит ни частоту ошибок в словах, ни частоту ошибок диаризации, ни разбивку по языкам.
В анонсирующем посте действительно приводятся вендорские цифры, включая потоковую частоту ошибок в словах и среднюю частоту ошибок диаризации, и именно их мы публикуем при запуске модели; это собственные измерения Meta, и они до сих пор не воспроизведены третьей стороной. Эта страница не проводит это сравнение заново, потому что повторный прогон вендорского бенчмарка, опубликованного в день релиза, на справочной странице представил бы невоспроизведённый показатель как окончательно установленный. То, что можно сказать, носит более узкий характер: Meta не публикует для этой модели прямого сравнения с названным конкурентом при сопоставимых вычислительных затратах и одинаковом тестовом стенде, поэтому любое сравнение, которое вы где бы то ни было прочтёте, — это сравнение вендорских цифр, собранных в разных условиях.
Одна дата также намеренно остаётся неустановленной. На странице модели вообще нет даты выпуска — её единственный маркер версии — это -1.0 в идентификаторе модели. Дата 2026-09-01 в этом материале взята из того датированного анонсного поста и используется здесь для датировки модели, а не для сообщения о событии.


Кому стоит это использовать, а кому — нет.
Аргумент в пользу Muse Voice Transcribe узок и силён: живое аудио, где слова, личность говорящего и окончания реплик нужны в одном потоке, по цене, достаточно низкой, чтобы работать непрерывно, а не по запросу. Голосовые агенты, живые субтитры, аналитика встреч и звонков, диктовка и высокообъёмная транскрипция — это те рабочие нагрузки, которые называет Meta, и именно под них фактически заточен интерфейс — 60-минутный WebSocket с режимами определения конца реплики и метками говорящих в рамках сессии.
Доводы против него столь же конкретны. Если вам нужны временные метки на уровне слов, оценка уверенности по каждому слову, обнаружение речевых событий или эмоций либо переформатирование транскрипта, у этой модели их нет, и это задокументированное отсутствие, а не ошибка. Если ваше аудио поступает в форматах, отличных от моно 16-битного WAV с частотой 16 или 24 кГц, и вы используете конечную точку для файлов, вы платите за этап преобразования, за который в другом месте не платили бы. А если ваша задача — пакетная транскрипция архивных записей, где точность является единственным критерием, потоковое предложение не даёт вам ничего — цена на обоих путях одинакова, так что вы платите за возможность работы в реальном времени, которой не воспользуетесь.
Единственное, что нужно проверить, прежде чем зафиксировать путь в продакшн, — это показатель, ради ответа на который и существует эта страница, и это единственный показатель, который может измениться без каких-либо изменений самой модели: $0,18 за час аудио, как указано сегодня на собственной странице модели Meta. Страница Meta — авторитетный источник по этому показателю. Когда он меняется, всё, что рассчитывается на его основе, — тысяча часов в месяц, стоимость одного интервью, арифметика «разрабатывать или покупать» — меняется вместе с ним.
