
Muse Voice Transcribe запущен: первая модель восприятия аудио в реальном времени от Meta
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
Muse Voice Transcribe — первая модель обработки аудио в реальном времени от Meta Superintelligence Labs — вышла 1 сентября 2026 года, и её цена звучит как спойлер: $3,00 за 1000 минут аудио, то есть около $0,18 в час, в Meta Model API. За один потоковый проход она делает то, на что большинство систем транскрибации тратят три компонента: автоматическое распознавание речи, диаризацию говорящих (более 20 голосов) и определение конца высказывания — то есть решает, когда говорящий действительно закончил, а не просто задумался в середине фразы. По словам Meta, модель возглавляет лидерборд потокового распознавания речи Artificial Analysis с частотой ошибок на словах 3,1% в финальных транскриптах, выдавая результат через 0,16 секунды после того, как говорящий замолчал.
Это последнее число нужно честно подписать, прежде чем оно начнёт работать: это заявление Meta, сделанное в день запуска и ссылающееся на независимый рейтинг, для модели, к которой можно было обратиться менее суток на момент выхода анонса. Никто за пределами лаборатории пока не воспроизвёл 3,1%, и заявление о точности — это одно, а остальная часть презентации — 70+ обученных языков, нативное переключение кодов, «адаптивная задержка» на основе обучения с подкреплением — это отдельный набор вендорских заявлений в той же лодке. Всё в этом посте — состояние модели на первый день, где цифры вендора подписаны как цифры вендора.
Цифры, которые имеют значение с первого дня
• Цена — $3.00 за 1 000 аудио-минут (около $0.18 за аудио-час) на Meta Model API, что ниже, чем у всех крупных API потоковой транскрибации, которые мы отслеживаем.
• Заявление о точности — 3,1% WER на финальных транскриптах через 0,16 секунды после окончания речи; 3,6% WER на первых частичных транскриптах через 0,13 секунды. Заявлено поставщиком со ссылкой на стриминговый лидерборд Artificial Analysis.
• Диаризация — более 20 спикеров, вывод в потоковом режиме без отдельного этапа постобработки (Meta сообщает о средней частоте ошибок диаризации 17,5%).
• Языки — обучение на 70+ языках; 25 языков «тщательно проверены» при запуске; бесшовное переключение кодов внутри и между предложениями.
• Контекст — обрабатывает аудио длительностью более одного часа; настройка по языку, ключевым словам и контексту для областей с большим количеством жаргона.

Что здесь означает «модель слухового восприятия»?
Архитектура — это и есть история. Muse Voice Transcribe принимает аудио фрагментами по 80 миллисекунд и выводит слова потоком по мере их стабилизации, что на практике и означает «реальное время». Самое интересное — как модель решает, когда зафиксировать слово. Вместо фиксированного бюджета задержки — стандартного компромисса, при котором распознаватель либо фиксирует слово рано и угадывает, либо ждет дольше и подстраховывается, — модель использует то, что Meta называет «адаптивной задержкой»: она быстро проходит простые фрагменты речи и удерживает больше аудиоконтекста для слов, в которых менее уверена. Сама политика задержки была выработана с помощью обучения с подкреплением, так что модель по сути балансирует скорость и точность для каждого слова, а не применяет единую глобальную настройку.
Это различие — причина, по которой Meta называет Muse Voice Transcribe «моделью аудиовосприятия», а не моделью ASR. Выходной поток — это единая живая расшифровка, которая также несёт информацию о том, кто говорит и когда высказывание завершено, — три метки, которые потоковые системы обычно собирают, склеивая распознаватель с детектором голосовой активности и моделью диаризации, каждая из которых добавляет свою задержку и свои сценарии отказов.

Встроенные диаризация и определение конца речи
Диаризация говорящих — это часть, которая больше всего заслуживает пристального внимания, поскольку именно в этой функции стриминговые продукты чаще всего преувеличивают свои возможности. Meta утверждает, что модель разделяет 20+ говорящих в одной записи и сообщает о средней частоте ошибок диаризации 17,5%, противопоставляя это диапазону 21,1–28,6%, который она приписывает системам конкурентов. Оба числа опубликованы вендором в день запуска, и независимая оценка ещё не подтвердила 17,5%. Структурно реальным является то, что диаризация выполняется в том же потоковом проходе, что и распознавание — здесь нет второго шага «загрузите аудио, подождите, получите говорящих», и именно этот выбор конструкции делает отслеживание 20+ говорящих правдоподобным в условиях живого вещания.
Эндпоинтинг — менее заметная возможность, но, пожалуй, самая полезная. API транскрипции, отдающие сырой потоковый ASR, вынуждают клиента самостоятельно реализовывать определение конца высказывания, из-за чего голосовые агенты так часто перебивают людей или оставляют мёртвую тишину. Muse Voice Transcribe сам определяет, когда реплика завершена, и передаёт эту границу в составе потока, поэтому приложение получает чёткий сигнал «говорящий закончил» без создания собственного слоя VAD.
Многоязычное утверждение, читайте внимательно
Meta обучала модель на 70+ языках, но на запуске подтверждает 25. Это разные вещи: «обучена на» означает, что языки входили в данные; «тщательно проверено» — это подмножество, за которое Meta действительно ручается по итогам внутреннего тестирования. Для продакшн-использования реальное покрытие — это список из 25 проверенных языков, и о разрыве между 70 и 25 стоит знать, прежде чем прогонять через неё 40 языков. Что действительно необычно, так это история с переключением языковых кодов — модель переключает языки в середине предложения и в середине высказывания без дополнительных указаний, что является реальной болью в многоязычных регионах и тем, чего большинство одноязычных ASR-продуктов просто не умеют. Языковое смещение, смещение по ключевым словам и контекстное смещение дополняют историю кастомизации: можно смещать распознавание в сторону доменной лексики — именно эта функция делает потоковый ASR применимым в медицинских, юридических и службах поддержки.
Три поверхности — одна модель
Muse Voice Transcribe выходит сразу на три поверхности. Платная — это Meta Model API по цене $3.00 за 1000 аудиоминут. Потребительская — это Meta AI для Mac, где удержание клавиши Fn позволяет диктовать текст в любом приложении — ответ Meta на встроенную диктовку Apple и самое заметное реальное применение модели с первого дня. Для разработчиков — это Muse Code, агент кодинга от Meta, где голосовые команды управляют многоагентными сессиями и процессами рефакторинга. Одна модель, обеспечивающая и функцию диктовки, и агента кодинга, — это продуктовая версия идеи «одна потоковая модель, много поверхностей».
Что подрывает цена
При цене 0,18 доллара за аудио-час Muse Voice Transcribe по прейскуранту обходит всех конкурентов в области потоковой транскрипции. Сравнительный ряд в нашей выборке: Google Gemini 3.5 Transcribe Live — около 9 долларов за 1000 минут, ElevenLabs Scribe v2 Realtime — заявлено 6,50 доллара за 1000 минут, Cartesia Ink-2 — 4,00 доллара, а OpenAI GPT Live Transcribe — 17,00 доллара. Это опубликованные цифры вендоров, и у ряда этих моделей есть независимые подтверждения точности, которых у Muse пока нет: ценовое лидерство в первый день — это ещё не устоявшийся рейтинг. Но потоковая модель со встроенной диаризацией и детекцией конца фразы, выходящая на рынок примерно по цене от одной пятой до одной десятой от стоимости действующих потоковых API, — это тот самый показатель, который в любом случае меняет ожидания.

Честные оговорки
Muse Voice Transcribe — проприетарный продукт, и веса не опубликованы: варианта «запустить самостоятельно» не существует, как нет и открытых весов для аудита или дообучения. Заявление о точности сделано в день запуска и независимо не воспроизведено. 25 проверенных языков могут не соответствовать заявленным 70+ языкам обучения в части покрытия низкоресурсных языков. А бенчмарк диаризации, каким бы многообещающим он ни был, — это измерение вендора, пока его не подтвердит независимый прогон. Для команд, чьё единственное требование — точная пакетная транскрибация заранее записанного аудио, по-прежнему существуют более дешёвые варианты с более прозрачным аудитом: позиционирование стриминга строится вокруг взаимодействия в реальном времени, а не вокруг того, чтобы превзойти пакетную транскрибацию по цене за аудио-час.
Что посмотреть дальше
Четыре фактора определят, станет ли этот запуск моментом или трендом. Во-первых, действительно ли стриминговый лидерборд Artificial Analysis поставит Muse Voice Transcribe на первое место после независимой проверки — заявление в день запуска должно подтверждаться закреплённой записью в таблице. Во-вторых, переживёт ли диаризация 20+ спикеров контакт с реальными шумными совещаниями. В-третьих, приведёт ли функция диктовки Meta на Mac к внедрению API разработчиками. В-четвёртых, как отреагируют на цену действующие игроки, потому что стриминговая модель с диаризацией и эндпойнтингом за $0.18 в час оказывает заметное давление на всех, кто установил более высокую цену. Когда Meta откроет модель для дополнительных партнёров по обслуживанию, сквозной шлюз вроде OrcaRouter — который передаёт публичные цены провайдеров с нулевой наценкой — покажет те же $3.00 за 1 000 минут без накрутки реселлера в день появления. До тех пор единственное место для вызова Muse Voice Transcribe — собственный API Meta.
