
Motif-Audio: аудиофундаментальная модель, которую Motif Technologies выпустила, никому не сказав
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 за 1 млн токенов · 56 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Flash 07312026-07-3150Интеллект69Кодинг
- qwenНОВИНКАQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 201 tok/s
- orcaНОВИНКАOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicНОВИНКАAnthropic: Claude Opus 52026-07-2461Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2150Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1651Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1557Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0854Интеллект72Кодинг
- tencentTencent: Hy32026-07-0641Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
- anthropicAnthropic: Claude Sonnet 52026-06-3053Интеллект72Кодинг
- klingKling: Kling 3.0 Turbo2026-06-1757Интеллект52Кодинг57Математика
- z-aiZ.ai: GLM 5.22026-06-1651Интеллект69Кодинг60Математика
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Интеллект61Кодинг61Математика
В верхней части Motif-Audioкарточки модели есть HTML-комментарий, который не предназначался для читателей: "TODO перед публичным релизом: добавить ссылки на статью и демо/Space в Model Sources." Он всё ещё там. 22 июля 2026 года Motif Technologies загрузила веса, код модели, конфиг и карточку на 13 КБ в Hugging Face одним коммитом — и на этом остановилась. Ни статьи. Ни демо-Space. Ни записи в блоге, ни анонсирующего треда, ни пресс-релиза. Две недели спустя в репозитории 14 загрузок и 14 лайков — примерно столько получает модель, когда её находят только те, кто уже следит за страницей организации.
Тишина здесь обманчива, потому что лежащая под ней карточка — не заглушка. Она описывает двухпоточный аудиоавтоэнкодер с 726 млн параметров, тестирует его на 21 датасете в сравнении с DAC, EnCodec, Mimi, X-Codec2, SemantiCodec, WavLM, HuBERT и Whisper Large v3, включает рабочий код для инференса и выпускает всё это под лицензией MIT. Всё в этой статье прочитано из этого репозитория — карточка, config.json и model.py — плюс расчёты, которые мы сделали сами там, где карточка не указывает число. Каждый показатель производительности ниже — собственный результат Motif, полученный самой Motif и никем не воспроизведённый: насколько нам известно, никто за пределами компании ещё не опубликовал ни одного независимого измерения этой модели.
Что такое Motif-Audio, и четыре вещи, чем оно не является
Это автоэнкодер для звука. Вы подаёте ему исходную монофоническую форму волны с частотой 16 кГц; он кодирует её в непрерывное латентное представление и декодирует латент обратно в форму волны. В карточке указаны ровно два прямых применения: реконструкция и нейровокодирование для общего аудио и речи, а также использование латентного представления в качестве входного представления для некоторой другой модели ниже по конвейеру. Это более узкий продукт, чем предполагает фраза «универсальная базовая аудиомодель», и именно это несоответствие чаще всего вводит читателей в заблуждение.
• Это не преобразование текста в речь. Никакого текстового управления нет, и в карточке синтез, управляемый текстом, явно указан как выходящий за рамки. Модель может только заново рендерить уже существующий звук.
• Это не источник токенов для аудио-LLM. Латентное представление непрерывно, а не последовательность квантованных индексов кодовой книги, поэтому паттерн в стиле Moshi/Mimi — подача дискретных аудио-токенов в языковую модель — здесь не применяется. В карточке об этом сказано прямо, что является отрадным проявлением дисциплины: многие релизы кодеков позволяют читателям думать иначе.
• Это не полнодиапазонный. Частота дискретизации 16 кГц накладывает жёсткий потолок Найквиста в 8 кГц на всё, чего касается. Хорошо для речи и обнаружения событий; стена для музыкального продакшена или всего, что требует воздуха и сибилянтов в целости.
• И несмотря на слово «кодек», это не компрессор битрейта. Этот требует отдельного раздела, поскольку собственная таблица реконструкции карты напрашивается именно на то сравнение, которое архитектура не может поддержать.

Двухпоточная архитектура и почему её обучение обошлось дёшево
Модель пропускает одну форму сигнала через два параллельных энкодера и объединяет их.
• Семантический поток заморожен и выполняет основную работу. Он читает 80-биновую лог-мел-спектрограмму как 2D-изображение и обрабатывает её с помощью 48-слойного vision-трансформера шириной 1024 с 16 головками внимания, использующего патчи 16x16, 2D-поворотные эмбеддинги и четыре регистровых токена — около 605M параметров модели. Он был предобучен самостоятельно с помощью маскированного моделирования спектрограмм: предсказание замаскированных частотно-временных областей по их окружению, извлечение структуры контента из неразмеченного аудио и последующая заморозка.
• Акустический поток небольшой и обученный.Он считывает мел-спектрограмму с более высоким разрешением на 160 бинов и встраивает её с помощью одного Conv2d, ядро которого охватывает всю высоту 160 бинов и два временных кадра — намеренно неглубокий путь, единственная задача которого — тонкие спектральные детали, которые отбрасывает семантический кодировщик.
• Fusion — это один слой кросс-внимания, в котором акустические токены являются запросом, а семантические токены — ключами и значениями, за которым следует остаточное сложение и RMS-норма. То, какой поток является запросом, имеет значение, как показывает следующий раздел.
• Декодер представляет собой магистраль ConvNeXt из 12 блоков с промежуточным слоем шириной 4096, активациями Snake и головкой обратного STFT, которая предсказывает амплитуду и фазу и напрямую реконструирует сигнал без авторегрессии.
Обучались только 121M параметров — акустический энкодер, слой слияния и декодер. В этом и заключается экономически интересный факт, скрытый в количестве параметров: Motif получил конкурентоспособную аудиомодель на основе замороженного самообучающегося бэкбона плюс небольшую обученную оболочку, что совершенно иной бюджет по сравнению со сквозным обучением 726M параметров. Это также архитектура, которая тихо ставит всё на качество замороженного энкодера.
Небольшое несоответствие, на которое стоит обратить внимание тем, кто считает: в карточке указано 726M всего, тогда как средство чтения safetensors от Hugging Face насчитывает 752.4M параметров BF16 в контрольной точке. Разрыв в 26M, без объяснений. Это не тревожный сигнал — расхождения в учёте буферов и голов обычны — но число в карточке не совпадает с числом в файле.
Номер, который карта никогда не печатает.
Нигде в карточке модели не указаны частота кадров латентного представления, его размерность в секунду или эквивалентная битовая скорость. Каждая из этих величин выводится из config.json и model.py, а ответ переосмысливает всю таблицу реконструкции. Арифметика, которую может проверить любой:
• Аудио с частотой 16 000 Гц и длиной скачка 160 даёт 100 мел-кадров в секунду.
• Встраивание акустических патчей использует ядро размером 160 бинов на 2 кадра с соответствующим шагом, поэтому оно выдает 50 токенов в секунду с размерностью 1024.
• Слой слияния обращает внимание от акустического потока к семантическому, поэтому объединённый латентный вектор наследует длину акустической последовательности: 50 векторов в секунду, шириной 1024.
• Транспонированная свёртка декодера повышает разрешение этих токенов ровно в 2 раза, возвращая их к 100 кадрам, а iSTFT-головка с hop 160 превращает 100 кадров в 16 000 отсчётов. Цепочка замыкается — что и является проверкой того, что показание 50 Гц верно.
Теперь посчитаем. При bfloat16: 50 векторов в секунду × 1024 измерения × 2 байта = 102,4 кБ/с, или примерно 819 кбит/с. Несжатый 16-битный PCM на 16 кГц — это 256 кбит/с. «компактное непрерывное представление» примерно в 3,2 раза больше, чем исходное аудио, которое оно кодирует, и примерно в 6 раз больше 160-биновой мел-спектрограммы, из которой оно вычисляется.
Это не скандал — это то, как должно выглядеть генеративное латентное пространство, точно так же, как латентное пространство диффузионной VAE для изображений — это не JPEG. Но это означает, что таблица реконструкции оценивает Motif-Audio в сравнении с системами, выполняющими принципиально более сложную задачу. Mimi, EnCodec, DAC и X-Codec2 в своих стандартных конфигурациях работают в диапазоне примерно от 1 до 6 кбит/с. Motif-Audio реконструирует из информации, поступающей со скоростью примерно в сто раз больше в секунду. Читайте эту таблицу как свидетельство того, что декодер точен, а не как свидетельство того, что этот кодек сжимает лучше, чем DAC. В пользу Motif следует сказать, что раздел «вне области применения» уже предупреждает против того, чтобы рассматривать его как токеновый кодек; тем не менее раздел оценки помещает его в таблицу с четырьмя такими кодеками.
Одна оговорка относительно наших собственных вычислений: это расчётное значение, а не заявленное производителем. Если мы неверно поняли направление слияния, исправление укладывается в одну строку — загрузите модель и выведите форму z_fused.
Честно читая собственное табло Motif
Семантическая оценка замораживает признаки модели и обучает поверх них небольшой MLP-зонд на 21 наборе данных из трёх семейств, в сравнении с шестью базовыми моделями. Это стандартный протокол, и при этом по-настоящему широкий. Кроме того, он целиком проводится вендором.

• По экологическому звуку он выигрывает во всех колонках.Точность ESC-50 — 0.911, UrbanSound8K — 0.871, DESED F1 — 0.616, FSD50k mAP — 0.478, Clotho R@1 — 0.066, а FSD18-Kaggle mAP — 0.759 против 0.496 у Whisper Large v3 — самый большой разрыв во всей карточке. Если вы занимаетесь разметкой аудио или обнаружением акустических событий, это именно тот результат, который должен побудить вас скачать эту модель.
• По речи он лучший в трёх из одиннадцати столбцов — CREMA-D 0.744, RAVDESS 0.726, VoxCeleb1 0.754. Это распознавание эмоций и идентификация говорящего — именно то, в чём должен быть силён поток, передающий тембр и текстуру. Whisper Large v3 по-прежнему лидирует в большинстве остальных.
• Есть одна явная прореха. По обратной WER на LibriSpeech-100h Motif-Audio набирает 0.000 против 0.900 у Whisper Large v3 и 0.825 у HuBERT. На Fluent Speech Commands — 0.800 против 0.987 у HuBERT. Отчасти это, вероятно, особенность инструмента, а не модели — DAC, SemantiCodec и MSM-MAE тоже показывают ровно 0.000 в этой колонке, а MLP-зонд на уровне фреймов — плохой способ распознавания. Но практический вывод в любом случае остаётся: если вам нужны замороженные признаки для ASR, это не та модель.
• Таблица также служит абляцией, и Motif, похоже, об этом не упомянул. MSM-MAE, один из шести бейзлайнов, относится к тому же семейству маскированного моделирования спектрограмм, из которого происходит замороженный семантический энкодер. Таким образом, сравнение этих двух строк показывает, что на самом деле даёт обученный акустический поток. Motif-Audio выигрывает в 15 из 21 столбцов, сводит один вничью и проигрывает в пяти. Все шесть столбцов по окружающей среде улучшаются, некоторые значительно. Два из пяти проигрышей приходятся на музыку: FMA 0.582 против 0.627, NSynth 0.699 против 0.730. Добавление акустических деталей очень помогает на звуковых событиях и паралингвистике, но немного вредит классификации тембра музыки.
• Одна колонка — лучшая в таблице, но всё равно плохая. Motif-Audio показывает лучший результат в транскрипции нот MAESTRO с F1 = 0.200, тогда как все остальные системы находятся в диапазоне от 0.000 до 0.128. Победа в колонке, где потолок составляет 0.2, — это не способность к транскрипции, а указание на то, что замороженные функции пока не справляются с этой задачей.
Реконструкция: сильная, но всё ещё не лучшая в своей собственной таблице.
На LibriSpeech test-clean Motif-Audio показывает PESQ 3.768, STOI 0.980 и 1.97% WER на реконструированном аудио, при FAD 0.4506. DAC превосходит его по двум из этих четырёх показателей — PESQ 4.010 и FAD 0.2099 — и немного опережает по WER: 1.94%. Motif-Audio уверенно выигрывает по STOI. По сравнению с Mimi (PESQ 3.439), EnCodec (2.768) и X-Codec2 (2.433) он явно впереди, хотя опять же при значительно более высокой информационной скорости.
Самая красноречивая в своей незаметности строка — последняя: корейские FLEURS, PESQ 3.731, CER 5.13%, FAD 0.1448 — лучший показатель FAD во всей таблице. Это единственная оценка не на английском языке в карточке, и рядом с ней не запускался ни один бейзлайн. Для корейской компании, разрабатывающей суверенный ИИ, оценка реконструкции корейского языка и её публикация без конкурентов выглядит не столько бенчмарком, сколько внутренним приёмочным тестом, попавшим в публичную карточку.
Четыре репозитория за три дня
Motif-Audio появился не один, и этот контекст меняет то, чем он, вероятно, является.
• 20 июля — Motif-3-Beta, флагманская модель с 315B параметрами и архитектурой mixture-of-experts, чей показатель по Artificial Analysis Intelligence Index составил 44, что обеспечило ей третье место среди open-source моделей мира. Мы освещали этот релиз отдельно; именно эта модель сделала компанию заметной за пределами Кореи.
• 21 июля — Motif-Vision-Encoder, vision-трансформер на 7B параметров с опубликованными результатами в сравнении с DINOv3, V-JEPA 2.1 и SigLIP2.
• 22 июля — Motif-Audio.
• Ранее — Motif-VAE, видеотокенизатор, в июне; Motif-Video-2B в апреле.

Из этого списка вырисовываются две закономерности. Первая — лицензирование: все компоненты имеют лицензию MIT — аудиоавтоэнкодер, визуальный энкодер, видео-VAE — в то время как Motif-3 (Beta), флагманская LLM, ограничена личным, образовательным и некоммерческим исследовательским использованием. Motif раздаёт части, а мозг держит под замком. Это последовательная стратегия для компании, чья модель выручки строится на вычислительном бизнесе Moreh и государственной программе суверенного ИИ Кореи, а не на продаже весов.
Второе: перечень компонентов начинает выглядеть как единое целое. Текстовая опорная модель, визуальный энкодер, видеотокенизатор и теперь аудиоавтоэнкодер, в карточке которого в качестве третьей возможности указано, что он даёт «основу, на которой можно строить модели преобразования текста в аудио и генерации музыки». Библиотека, объявленная в репозитории, — это diffusers. Непрерывное латентное представление шириной 1024 плюс diffusers — это стандартная основа для латентно-диффузионной генерации аудио. Motif ничего подобного не анонсировал — это вывод, сделанный на основе четырёх репозиториев и тега метаданных, а не дорожная карта. Но именно такое прочтение подтверждают артефакты.
Разрыв в принятии между родственными моделями поразителен, и о нём стоит помнить, глядя на счётчик загрузок: Motif-3-Beta — 4 674 загрузки и 210 лайков, Motif-Vision-Encoder — 2 143, а Motif-Audio — 14. Одна и та же организация, одна и та же неделя, три порядка разницы. Качество аудиомодели этого не объясняет. Объясняет то, что о ней не объявили.
Запуск и место такой модели
Раздел «Начало работы» необычно честно говорит о своих острых углах, и каждый из них обойдется вам в час, если вы их пропустите.
• Установите torchcodec.Последние выпуски torchaudio декодируют через него, поэтому torchaudio.load вызывает ImportError без него. Полный набор: torch, torchaudio, torchcodec, diffusers, timm.
• Загрузите с trust_remote_code=True. Код модели поставляется вместе с весами и направляется через auto_map, поэтому нативного класса Transformers здесь нет.
• Приводите тип через .to(device, torch.bfloat16), а не через torch_dtype в from_pretrained. В карточке прямо сказано, что эти два способа не эквивалентны: второй оставляет буферы мел-фильтробанка в float32 и не воспроизводит заявленные результаты. Очень немногие карточки удосуживаются описать такие специфичные грабли, и тот факт, что в этой карточке они описаны, позволяет предположить, что кто-то уже на них наступил внутри компании.
• Подайте на вход mono 16 kHz, имеющее форму (batch, 1, samples), дополненное так, чтобы количество мел-кадров делилось на 16, затем обрежьте выход обратно. Карта поставляется с pad_for_model, вспомогательной функцией, которая выполняет вычисления.
• Forward возвращает четыре тензора: реконструированную форму сигнала плюс z_fused, z_sem и z_acou, так что вы можете использовать любой поток отдельно в качестве признаков.
Чего вы не найдете, так это размещенной конечной точки. Боковая панель самого Hugging Face говорит об этом прямо: «Эта модель не развернута ни одним провайдером инференса». Motif-Audio — это веса, а не API: никто не предоставляет его как сервис, включая нас, — и для того, что живет внутри вашего тренировочного цикла или вашего экстрактора признаков, это правильная форма. Стоит внести ясность, какую половину аудиостека это описывает. Части, которые вы арендуете, — это слой синтеза и языковая модель, которая выполняет рассуждения между ушами; на OrcaRouter они находятся за одним ключом по цене провайдера из прайс-листа с нулевой наценкой и автоматическим переключением при сбое, так что замена OpenAI TTS-1 HD на другого поставщика речи — это изменение строки, а не закупочный цикл. Части, которые вы размещаете у себя, — это те, которые вы дообучаете, квантуете и встраиваете в конвейер, — например, такой замороженный энкодер. Кодек — не проблема маршрутизации. А вот поставщик синтеза, которого вы можете заменить в следующем квартале, — это проблема маршрутизации.
Что до сих пор непознаваемо?
• Нет статьи. В TODO самой карточки обещана одна; полка Papers организации на Hugging Face до сих пор содержит только технические отчёты Motif-Video 2B и Motif 2 12.7B. Пока аудиостатья не вышла, описание архитектуры — это всё, что есть, без абляций, объясняющих, почему семантический поток остаётся замороженным или относительно чего выбирался размер акустического патча.
• Раскрытие обучающих данных отсутствует.«Неразмеченный аудио» — вот и всё заявление. Лицензия MIT на веса решает вопрос лицензии на код и не решает ничего насчёт происхождения — и, в отличие от карточки визуального энкодера, которая явно перекладывает соблюдение лицензии набора данных на конечных пользователей, аудиокарточка вообще не поднимает эту тему.
• Никаких цифр по задержке, пропускной способности или потоковой передаче.Трансформер с 48 слоями, работающий с окнами спектрограммы по 5,12 секунды, явно не рассчитан на работу в реальном времени, и в описании карты это никогда не утверждается. Если вы рассматриваете её для живого звука, будьте готовы, что замеры придётся делать самостоятельно.
• Нет варианта 24 кГц или 48 кГц, нет квантованных сборок, нет демо Space, нет аудиосэмплов для прослушивания. Для модели, чья основная идея — качество реконструкции, выпуск без единого клипа «до/после» — странное упущение.
• Никакой независимой оценки не проводилось. Каждое число здесь принадлежит Motif.
Три вопроса, которые возникнут к этому репозиторию
Можно ли построить на нём голосовой продукт?
Не с тем, что было выпущено. В нём нет текстового кондиционирования, поэтому оно не может говорить — оно лишь перерендеривает аудио, которое вы ему даёте. Что оно реально может, так это лежать в основе голосового продукта, который обучает кто-то другой: модели text-to-speech или text-to-audio, которая учится предсказывать z_fused по тексту, а декодер Motif-Audio превращает этот латент в звук. Именно это и есть питч «Generate» в начале карточки. Это основа для продукта, а не сам продукт.
Действительно ли лицензия MIT безопасна для коммерческого использования, учитывая, что флагманская — нет?
Лицензии на Hugging Face действуют для каждого репозитория отдельно, и эта лицензия не оставляет простора для толкований: MIT — можно использовать, модифицировать и распространять в коммерческих целях, сохраняя уведомление об авторстве, без каких-либо гарантий. Сложность не в тексте лицензии, а в отсутствии указания на набор данных. В карточке визуального энкодера прямо написано, что соблюдение лицензии на набор данных ложится на пользователей; в аудиокарточке не упомянут ни один корпус. Если речь о готовом продукте — это вопрос к вашему юристу, а не к карточке модели. В карточке также справедливо отмечено, что точная реконструкция делает модель полезным компонентом в пайплайнах клонирования голоса и спуфинга.
Стоит ли мне заменить DAC, EnCodec или Mimi на него?
Это полностью зависит от того, для чего предназначен ваш кодек. Для транспортировки или хранения с ограниченной пропускной способностью — нет: приведённые выше расчёты битрейта исключают это, и не для этого он создавался. Как замороженный экстрактор признаков для аудиотегирования, обнаружения событий или паралингвистики — это сильнейшее решение в своей таблице с большим отрывом, распространяется по лицензии MIT, и его недорого оценить: запустите свой пробник, сравните с текущим бэкбоном, оставьте победителя. Как латентное пространство для генеративной аудиомодели — это правдоподобно и явно является предполагаемым использованием, но вы будете первым, кто опубликует такой результат, а это либо возможность, либо предупреждение — в зависимости от ваших сроков.
Что посмотреть
Наиболее показательным для этого репозитория в течение следующего месяца будет то, будет ли этот TODO когда-либо закрыт. Если появятся статья, демо Space и родственный компонент text-to-audio, значит Motif-Audio был первой публичной частью омнимодального стека, выпущенной рано, потому что части лицензированы под MIT, а флагман — нет, и 14 загрузок будут выглядеть как сноска. Если же репозиторий останется на одном коммите до осени, это был внутренний компонент, который кто-то сделал публичным, потому что MIT проще, чем приватный бакет, и интересным артефактом всегда был рецепт «замороженный бэкбон плюс небольшая обёртка», а не чекпоинт.
В любом случае, веса доступны, лицензия пермиссивная, и честная позиция для всех, кто сейчас вне Motif, такова: мы прочли очень хорошую карточку модели, и никто её не проверил. Самый быстрый способ начать проверку — загрузить её и вывести форму z_fused.
