
Motif-Audio: Motif Technologies가 아무에게도 알리지 않고 출시한 오디오 파운데이션 모델
- qwenNEWQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 100만 토큰당 · 56 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3150지능69코딩
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 201 tok/s
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNEWAnthropic: Claude Opus 52026-07-2461지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2150지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1651지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1557지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0951지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0955지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0959지능77코딩
- grokxAI: Grok 4.52026-07-0854지능72코딩
- tencentTencent: Hy32026-07-0641지능59코딩
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232지능42코딩
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226지능39코딩
- anthropicAnthropic: Claude Sonnet 52026-06-3053지능72코딩
- klingKling: Kling 3.0 Turbo2026-06-1757지능52코딩57수학
- z-aiZ.ai: GLM 5.22026-06-1651지능69코딩60수학
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242지능61코딩61수학
상단 근처에 Motif-Audio 모델 카드에는 아무도 보지 못하게 한 HTML 주석이 있다: "공개 전 TODO: Model Sources에 논문 및 demo/Space 링크를 추가하세요." 그 주석은 여전히 있다. 2026년 7월 22일, Motif Technologies는 가중치, 모델링 코드, 설정(config), 그리고 13KB 크기의 카드를 단일 커밋으로 Hugging Face에 업로드했다. 그리고는 멈췄다. 논문도 없다. 데모 Space도 없다. 블로그 게시물도, 출시 스레드도, 보도자료도 없다. 2주 후 저장소에는 다운로드 14회, 좋아요 14개가 나타나 있는데, 이는 그 모델을 찾는 사람이 조직(org) 페이지를 이미 팔로우하는 사람들뿐일 때 대략적으로 얻을 수 있는 수치다.
침묵은 오해를 부르는 부분입니다. 그 아래에 있는 카드는 자리표시자가 아니기 때문입니다. 이 카드는 726M 파라미터의 듀얼 스트림 오디오 오토인코더를 문서화하고, 21개 데이터셋에서 DAC, EnCodec, Mimi, X-Codec2, SemantiCodec, WavLM, HuBERT, Whisper Large v3와 비교해 벤치마크를 수행하며, 작동하는 추론 코드를 제공하고, 전체를 MIT 라이선스로 공개합니다. 이 글의 모든 내용은 해당 저장소 — 카드, config.json 및 model.py — 에서 직접 읽은 것이며, 카드가 숫자를 생략한 부분은 우리가 직접 계산했습니다. 아래의 모든 성능 수치는 Motif가 자체적으로 실행한 결과로, 외부에서 재현되지 않았습니다: 우리가 아는 한, 회사 외부의 누구도 이 모델에 대한 독립적 측정 결과를 단 한 건도 발표하지 않았습니다.
Motif-Audio가 무엇인지, 그리고 그것이 아닌 네 가지
소리를 위한 오토인코더입니다. 원시 16kHz 모노 파형을 입력하면 연속 잠재 표현으로 인코딩한 뒤, 다시 파형으로 디코딩합니다. 카드가 허용하는 직접적인 용도는 정확히 두 가지입니다. 일반 오디오 및 음성에 대한 재구성과 신경 보코딩, 그리고 다른 모델의 다운스트림 입력 표현으로 잠재 표현을 사용하는 것입니다. 이는 "범용 오디오 기반 모델"이라는 표현이 시사하는 것보다 더 좁은 제품이며, 바로 그 불일치 때문에 대부분의 독자가 오해하게 됩니다.
• 이것은 텍스트 음성 변환이 아닙니다. 어떤 종류의 텍스트 조건화도 없으며, 이 카드는 텍스트 조건화 합성을 명시적으로 범위 밖으로 규정합니다. 이미 존재하는 오디오만 다시 렌더링할 수 있습니다.
• 오디오 LLM용 토큰 소스가 아닙니다. 잠재 표현은 연속적이며, 양자화된 코드북 인덱스의 시퀀스가 아니므로, 이산 오디오 토큰을 언어 모델에 입력하는 Moshi/Mimi 스타일의 패턴은 적용되지 않습니다. 카드에는 이 점이 명백히 명시되어 있는데, 이는 반가운 절제입니다. 많은 코덱 릴리스가 독자들이 그 반대로 가정하도록 내버려두기 때문입니다.
• 풀밴드가 아닙니다. 16kHz 샘플링은 닿는 모든 것에 8kHz 나이퀴스트 상한선이라는 단단한 벽을 설정합니다. 음성 및 이벤트 감지에는 충분하지만, 음악 제작이나 공기감과 치찰음이 그대로 살아있어야 하는 모든 것에는 벽과 같습니다.
• 그리고 "코덱"이라는 단어에도 불구하고, 이것은 비트레이트 압축기가 아닙니다. 그것은 자체 섹션이 필요한데, 카드 자체의 재구성 테이블이 아키텍처가 지원할 수 없는 비교를 정확히 불러일으키기 때문입니다.

듀얼 스트림 설계, 그리고 훈련 비용이 저렴했던 이유
모델은 하나의 파형을 두 개의 병렬 인코더에 통과시켜 이를 융합합니다.
• 의미론적 스트림은 동결되어 있으며 핵심적인 작업을 수행합니다. 80-빈 로그-멜 스펙트로그램을 2D 이미지로 읽어 16x16 패치, 2D 회전 임베딩 및 4개의 레지스터 토큰을 사용하는 48레이어, 1024너비, 16헤드 비전 트랜스포머로 처리합니다 — 모델 파라미터의 약 605M에 해당합니다. 마스크된 스펙트로그램 모델링을 통해 자체적으로 사전 학습되었습니다: 주변에서 마스크된 시간-주파수 영역을 예측하여 레이블이 없는 오디오에서 콘텐츠 구조를 학습한 다음 동결합니다.
• The acoustic stream is tiny and trained. It reads a higher-resolution 160-bin mel and embeds it with a single Conv2d whose kernel spans the full 160-bin height and two time frames — a deliberately shallow path whose only job is the fine spectral detail the semantic encoder discards.
• Fusion은 하나의 크로스 어텐션 레이어로, 음향 토큰이 쿼리(query)이고 의미 토큰이 키(key)와 값(value)이 되는 구조이며, 그 뒤에 잔차 덧셈(residual add)과 RMS norm이 이어집니다. 어느 스트림이 쿼리인지가 중요한데, 이는 다음 절에서 보여줍니다.
• 디코더는 12블록 ConvNeXt 백본으로, 4096 너비의 중간 레이어, Snake 활성화 함수, 크기와 위상을 예측하여 파형을 직접 재구성하는 역-STFT 헤드를 갖추고 있으며 자기회귀는 사용하지 않는다.
{{1}}훈련된 것은 오직 1억 2100만 개의 파라미터(음향 인코더, 퓨전 레이어, 디코더)뿐이었다.{{/1}} {{2}}이것이 파라미터 수에 숨겨진 경제적으로 흥미로운 사실이다:{{/2}} {{3}}Motif는 고정된 자기지도 학습 백본과 작은 학습된 셸만으로 경쟁력 있는 오디오 모델을 얻어냈는데,{{/3}} {{4}}이는 7억 2600만 개의 파라미터를 엔드투엔드로 학습하는 것과는 매우 다른 비용 구조다.{{/4}} {{5}}또한 이 설계는 고정된 인코더의 품질에 모든 것을 조용히 거는 방식이기도 하다.{{/5}}
숫자를 확인하는 사람이라면 주목할 만한 작은 불일치가 하나 있다. 카드에는 총 726M이라고 표시되어 있는 반면, Hugging Face의 safetensors 리더는 체크포인트에서 752.4M BF16 파라미터를 집계한다. 설명되지 않은 26M 차이다. 경고 신호는 아니다. 버퍼와 헤드에 대한 회계상 차이는 흔한 일이기 때문이다. 하지만 카드의 숫자는 파일의 숫자와 다르다.
카드가 절대 인쇄하지 않는 번호
모델 카드에는 잠재 변수의 프레임 속도, 초당 차원 수 또는 이에 상당하는 비트레이트가 명시되어 있지 않습니다. 이 모든 것은 config.json 및 model.py에서 파생할 수 있으며, 답변은 전체 재구성 표를 다시 해석합니다. 누구나 확인할 수 있는 계산은 다음과 같습니다:
• 16,000Hz 오디오에서 홉 길이가 160이면 초당 100멜 프레임이 생성됩니다.
• 음향 패치 임베딩은 일치하는 스트라이드를 가진 160-빈 × 2-프레임 커널을 사용하므로 1024차원에서 초당 50개의 토큰.
• 융합 계층은 음향 스트림에서 의미 스트림으로 어텐션을 수행하므로, 융합된 잠재 표현은 음향 시퀀스 길이를 상속받습니다: 초당 50개 벡터, 너비 1024.
• 디코더의 전치 합성곱은 해당 토큰들을 정확히 2배 업샘플링하여 100 프레임으로 되돌리고, hop 160의 iSTFT 헤드는 100 프레임을 16,000 샘플로 변환합니다. 체인이 닫힙니다 — 이것이 50Hz 판독값이 올바른지 확인하는 방법입니다.
이제 비용을 계산해 보자. bfloat16 기준으로 초당 50개 벡터 × 1024차원 × 2바이트는 102.4kB/s, 즉 대략 819kbit/s이다. 압축되지 않은 16비트 PCM(16kHz)은 256kbit/s이다. "컴팩트 연속 표현"은 약 인코딩 대상인 원본 오디오보다 3.2배 크며, 계산에 사용된 160빈 멜 스펙트로그램 크기의 약 6배이다.
그것은 스캔들이 아니다 — 그것은 생성적 잠재 공간이 당연히 그래야 하는 모습이다. 이미지 확산 VAE의 잠재 표현이 JPEG가 아닌 것과 같은 이치다. 그러나 그것은 재구성 표가 Motif-Audio를 근본적으로 더 어려운 작업을 수행하는 시스템들과 비교 평가하고 있음을 의미한다. Mimi, EnCodec, DAC 및 X-Codec2는 표준 구성에서 대략 1~6kbit/s 범위로 동작한다. Motif-Audio는 초당 그보다 약 백 배 많은 정보로부터 재구성한다. 그 표는 디코더가 충실하다는 증거로 읽어야지, 이것이 DAC보다 더 잘 압축한다는 증거로 읽어서는 안 된다. Motif의 공로를 인정하자면, 범위 외 섹션에서 이미 이것을 토큰 코덱으로 취급하는 것에 대해 경고하고 있다. 그런데도 평가 섹션에서는 어쨌든 그것을 네 개의 토큰 코덱과 같은 표에 넣는다.
우리 자체 계산에 관한 한 가지 주의사항: 이 값은 공급업체가 명시한 값이 아니라 파생된 값입니다. 융합 방향을 잘못 읽었다면, 수정에는 한 줄이면 됩니다 — 모델을 로드하고 z_fused.
Motif 자체 스코어보드를 솔직하게 읽기
의미론적 평가는 모델의 특징을 고정한 상태에서 그 위에 작은 MLP 프로브를 훈련시키며, 세 계열의 21개 데이터셋과 6개 기준선을 대상으로 수행됩니다. 이는 표준 프로토콜이면서 진정으로 광범위한 프로토콜입니다. 또한 전적으로 공급업체가 주도합니다.

• 환경 음향 부문에서는 모든 지표를 휩쓸었습니다. ESC-50 정확도 0.911, UrbanSound8K 0.871, DESED F1 0.616, FSD50k mAP 0.478, Clotho R@1 0.066, 그리고 Whisper Large v3의 0.496 대비 FSD18-Kaggle mAP 0.759 — 카드 전체에서 가장 큰 격차입니다. 오디오 태깅이나 음향 이벤트 감지를 구축하고 있다면, 이 결과가 다운로드를 결정하게 해 줄 것입니다.
• 음성의 경우 11개 열 중 3개에서 최고입니다. — CREMA-D 0.744, RAVDESS 0.726, VoxCeleb1 0.754. 이는 감정 인식과 화자 식별로, 음색과 질감을 담은 스트림이 잘해야 할 부분입니다. Whisper Large v3는 여전히 나머지 대부분을 앞서고 있습니다.
• 명백한 구멍이 하나 있습니다. LibriSpeech-100h inverse-WER에서 Motif-Audio는 0.000을 기록한 반면, Whisper Large v3는 0.900, HuBERT는 0.825를 기록했습니다. Fluent Speech Commands에서는 HuBERT의 0.987에 비해 0.800을 기록했습니다. 그 낮은 성능 중 일부는 아마도 모델이라기보다 측정 도구 때문일 것입니다. DAC, SemantiCodec, MSM-MAE도 해당 열에서 0.000을 기록했으며, 프레임 수준 MLP 프로브는 인식에 부적합한 방식입니다. 하지만 실질적인 결론은 어느 쪽이든 동일합니다. ASR용 frozen features가 필요하다면 이 모델은 적합하지 않습니다.
• 이 표는 제거(ablation) 실험을 겸하며, Motif는 이를 언급하지 않은 것으로 보인다. MSM-MAE는 여섯 기준선(baseline) 중 하나로, 동결된 의미 인코더가 속한 것과 동일한 마스크드 스펙트로그램 모델링 계열이다. 따라서 두 행을 비교하면 훈련된 음향 스트림이 실제로 얼마나 기여하는지 측정할 수 있다. Motif-Audio는 21개 열 중 15개에서 이기고, 1개는 비기며, 5개에서 진다. 환경 관련 6개 열은 모두 향상되었으며, 여러 항목은 큰 폭으로 향상되었다. 5개의 패배 중 2개는 음악이다: FMA 0.582 대 0.627, NSynth 0.699 대 0.730. 음향 세부 정보를 추가하면 음향 사건과 준언어적(paralinguistic) 분석에 큰 도움이 되지만, 음악 음색 분류에는 약간 해가 된다.
• 한 열은 표 내 최고지만 여전히 나쁘다. Motif-Audio는 MAESTRO 음표 전사에서 0.200 F1로 최고 성능을 보였으며, 다른 모든 시스템은 0.000과 0.128 사이에 있다. 최고점이 0.2인 열에서 1위를 차지한다는 것은 전사 능력이 아니라, 동결된 특징이 아직 이 작업을 수행할 수 없다는 신호다.
재구성: 강력하지만, 여전히 자체 테이블에서 최고는 아니다
LibriSpeech test-clean에서 Motif-Audio는 재구성된 오디오에 대해 PESQ 3.768, STOI 0.980, 1.97% WER을 달성했으며, FAD는 0.4506이다. DAC는 이 중 두 지표에서 이를 능가한다 — PESQ 4.010과 FAD 0.2099 — 그리고 WER도 1.94%로 근소하게 앞선다. Motif-Audio는 STOI에서 확실히 우위를 점한다. Mimi(PESQ 3.439), EnCodec(2.768), X-Codec2(2.433)와 비교하면 명백히 앞서지만, 역시 훨씬 더 높은 정보 전송률에서의 결과다.
가장 조용히 의미를 드러내는 행은 마지막 행이다: 한국어 FLEURS, PESQ 3.731, CER 5.13%, FAD 0.1448 — 표 전체에서 가장 좋은 FAD 수치다. 이는 카드에서 유일한 비영어 평가이며, 그 옆에 실행된 기준선(baseline)도 없다. 한국의 주권(sovereign) AI 기업이 한국어 재구성 결과를 평가하고 경쟁사 없이 보고하는 모습은 벤치마크라기보다는 공개 카드에 포함된 내부 수용 테스트처럼 읽힌다.
3일 만에 저장소 4개
Motif-Audio는 혼자 온 것이 아니며, 그 맥락이 그것이 아마 무엇인지를 바꾼다.
• July 20 — Motif-3-Beta, the 315B-parameter mixture-of-experts flagship, whose Artificial Analysis Intelligence Index of 44 put it third among open-source models globally. We covered that release separately; it is the model that made the company visible outside Korea.
• 7월 21일 — Motif-Vision-Encoder, DINOv3, V-JEPA 2.1 및 SigLIP2와의 비교 결과가 발표된 7B 비전 트랜스포머.
• 7월 22일 — Motif-Audio.
• 앞서 — Motif-VAE(비디오 토크나이저)는 6월; Motif-Video-2B는 4월.

그 목록에서는 두 가지 패턴이 드러난다. 첫 번째는 라이선스다. 오디오 오토인코더, 비전 인코더, 비디오 VAE 등 구성 요소는 모두 MIT 라이선스인 반면, Motif-3 (Beta)라는 플래그십 LLM은 개인·교육·비상업적 연구 용도로만 제한된다. Motif는 부품은 공개하고 두뇌는 잠가 둔다. 이는 가중치 판매가 아니라 Moreh의 컴퓨팅 사업과 한국 정부의 주권 AI 프로그램에서 수익을 창출하는 회사에게 일관된 전략이다.
The second is that the parts list is starting to look like a whole. A text backbone, a vision encoder, a video tokenizer, and now an audio autoencoder whose card advertises, as its third capability, giving "text-to-audio and music generation models a foundation to build on." The library declared in the repo is diffusers. A continuous 1024-wide latent plus diffusers is the standard substrate for latent-diffusion audio generation. Motif has announced nothing of the kind — this is an inference from four repositories and a metadata tag, not a roadmap. But it is the reading the artifacts support.
형제 모델 간의 채택 격차는 뚜렷하며, 다운로드 카운터를 볼 때 이를 염두에 둘 만하다. Motif-3-Beta는 다운로드 4,674회, 좋아요 210개를 기록했고, Motif-Vision-Encoder는 2,143회, Motif-Audio는 14회다. 같은 조직, 같은 주에 세 자릿수 차이가 난다. 오디오 모델의 품질로는 그 차이를 설명할 수 없다. 발표하지 않은 것이 그 차이를 설명한다.
실행하기와 이런 모델이 어울리는 위치
시작하기 섹션은 자신의 까다로운 부분에 대해 이례적으로 솔직하며, 그 부분들을 건너뛰면 각각 한 시간씩 손해를 보게 될 것입니다.
• torchcodec을 설치하세요. 최근 torchaudio 릴리스는 이를 통해 디코딩하므로, torchaudio.load는 없으면 ImportError가 발생합니다. 전체 세트: torch, torchaudio, torchcodec, diffusers, timm.
• trust_remote_code=True로 로드하세요.모델링 코드는 가중치와 함께 제공되며 auto_map을 통해 라우팅되므로 Transformers 네이티브 클래스가 없습니다.
• .to(device, torch.bfloat16)로 캐스팅하고, from_pretrained에서 torch_dtype을 사용하지 마세요.카드에는 이 둘이 동등하지 않다고 명확히 명시되어 있습니다. 후자는 멜 필터뱅크 버퍼를 float32로 남겨두며 보고된 점수를 재현하지 못합니다. 이렇게 구체적인 함정까지 문서화한 카드는 거의 없으며, 이 카드가 그렇게 했다는 것은 내부적으로 누군가 그 함정에 걸렸음을 시사합니다.
• 모노 16kHz 오디오를 입력하세요. (batch, 1, samples) 형태로 만들고, 멜 프레임 수가 16으로 나누어지도록 패딩한 다음, 출력을 다시 트리밍합니다. 카드에는 pad_for_model이라는 계산을 수행하는 헬퍼가 포함되어 있습니다.
• Forward는 네 개의 텐서를 반환합니다: 재구성된 파형과 z_fused, z_sem, z_acou를 포함하므로, 각 스트림을 별도로 특징으로 사용할 수 있습니다.
당신이 찾을 수 없는 것은 호스팅된 엔드포인트입니다. Hugging Face의 자체 사이드바는 "이 모델은 어떤 Inference Provider에서도 배포되지 않습니다."라고 분명히 말합니다. Motif-Audio는 가중치(weights)이며 API가 아닙니다. 우리를 포함해 아무도 이를 서빙하지 않습니다. 그리고 훈련 루프나 특징 추출기 안에 들어가는 무언가에게는 그것이 올바른 형태입니다. 이것이 오디오 스택의 어느 부분을 설명하는지 명확히 하는 것은 중요합니다. 당신이 임대하는 부분은 합성 레이어와 머릿속에서 추론을 수행하는 언어 모델입니다. OrcaRouter에서는 그러한 것들이 0% 마크업과 자동 장애 조치를 포함한 공급업체 목록 가격으로 하나의 키 뒤에 있습니다. 그래서 스와핑(swapping)은OpenAI TTS-1 HD를다른 음성 공급업체로 교체하는 것이 곧 문자열 변경이지 조달 절차가 아닙니다. 당신이 호스팅하는 것은 파인튜닝하고 양자화하고 파이프라인에 통합하는 것들입니다 — 이와 같은 고정된 인코더 말이죠. 코덱은 라우팅 문제가 아닙니다. 다음 분기에 교체할 수도 있는 합성 공급업체는 라우팅 문제입니다.
여전히 알 수 없는 것
• 논문 없음. 모델 카드 자체의 TODO에는 논문이 하나 있다고 약속하지만, 해당 조직의 Hugging Face Papers 선반에는 여전히 Motif-Video 2B와 Motif 2 12.7B 기술 보고서만 나열되어 있다. 오디오 논문이 게재될 때까지는 아키텍처 설명이 전부이며, 의미론적 스트림이 왜 동결되어 있는지나 음향 패치 크기가 무엇과 비교해 선택되었는지를 설명하는 ablation 연구는 없다.
• 학습 데이터 미공개. "'레이블 없는 오디오'가 진술의 전부입니다. 가중치에 대한 MIT 라이선스는 코드 라이선스를 확정하지만 출처에 대해서는 아무것도 확정하지 않습니다. 그리고 비전 인코더 카드가 데이터셋 라이선스 준수를 명시적으로 하위 사용자에게 전가하는 것과 달리, 오디오 카드는 그 주제를 전혀 다루지 않습니다.
• No latency, throughput or streaming numbers. A 48-layer transformer over 5.12-second spectrogram windows is not obviously a real-time design, and the card never claims it is. If you are considering it for live audio, assume you will be the one measuring.
• 24kHz 또는 48kHz 변형 없음, 양자화된 빌드도 없고, 데모 Space도 없으며, 들어볼 오디오 샘플도 없습니다. 재구성 품질이 전부인 모델이 단 하나의 전후 비교 클립도 없이 출시된 것은 이상한 누락입니다.
• 어떤 종류의 독립적인 평가도 없습니다. 여기 있는 모든 숫자는 Motif의 것입니다.
이 저장소가 받게 될 세 가지 질문
그 위에 음성 제품을 구축할 수 있나요?
출시된 제품으로는 그렇지 않습니다. 텍스트 컨디셔닝이 없어 말할 수 없고, 입력받은 오디오를 다시 렌더링할 수 있을 뿐입니다. 실질적으로 가능한 용도는 다른 사람이 훈련하는 음성 제품의 하부에 깔리는 것입니다. 즉, 텍스트에서 z_fused를 예측하도록 학습하는 텍스트 음성 변환 또는 텍스트-오디오 모델로서, Motif-Audio의 디코더가 그 잠재 변수를 소리로 바꿔 주는 방식입니다. 이것이 바로 카드 서두의 'Generate' 홍보 문구가 말하는 내용입니다. 이는 제품을 위한 기반일 뿐, 제품 자체는 아닙니다.
플래그십이 안전하지 않은데, MIT 라이선스는 정말 상업적 사용에 안전한가요?
Hugging Face의 라이선스는 저장소마다 다르며, 이 저장소의 라이선스는 명확합니다: MIT이며, 상업적 사용, 수정, 재배포가 허용되고, 저작권 고지를 유지해야 하며, 보증은 제공되지 않습니다. 문제는 라이선스 텍스트가 아니라 데이터 명세(data statement)가 빠져 있다는 점입니다. 비전 인코더의 카드는 데이터셋 라이선스 준수가 다운스트림 사용자에게 있음을 서면으로 명시하지만, 오디오 카드는 말뭉치(corpus)를 전혀 언급하지 않습니다. 이 모델을 출시 제품에 포함한다면, 이는 모델 카드가 아니라 회사의 법무 담당자에게 문의할 문제입니다. 또한 이 카드는 정확하게도, 충실한 재구성이 이 모델을 음성 복제 및 스푸핑 파이프라인에서 사용할 수 있는 구성 요소가 되게 한다고 지적합니다.
DAC, EnCodec 또는 Mimi를 그것으로 대체해야 할까요?
그것은 전적으로 코덱의 용도에 달려 있습니다. 대역폭이 제한된 전송이나 저장을 위한 것이라면, 아니요 — 위의 비트레이트 계산이 그 가능성을 배제하며, 그것은 애초에 그런 용도로 만들어진 것이 아닙니다. 오디오 태깅, 이벤트 감지, 준언어학을 위한 고정 특성 추출기로서는 자체 표에서 압도적으로 가장 강력하고, MIT 라이선스이며, 평가 비용도 저렴합니다. 프로브를 실행하고, 현재 백본과 비교한 다음, 승자를 유지하면 됩니다. 생성형 오디오 모델의 잠재 공간으로서는 그럴듯하고 분명히 의도된 용도입니다 — 하지만 그 결과를 발표하는 첫 번째 사람이 될 것이며, 그것은 마감 기한에 따라 기회이거나 경고입니다.
볼 것
향후 한 달 동안 이 저장소에 대해 가장 유익한 정보는 그 TODO가 실제로 해결되는지 여부입니다. 논문, 데모 Space, 그리고 텍스트-투-오디오 자매 제품이 등장한다면, Motif-Audio는 옴니모달 스택의 첫 번째 공개 구성 요소였다는 뜻이며, 부품들이 MIT 라이선스이고 플래그십이 그렇지 않기 때문에 일찍 공개된 것이고, 14회 다운로드는 각주처럼 보일 것입니다. 저장소가 가을 내내 커밋 하나에 머물러 있다면, 그것은 누군가가 비공개 버킷보다 MIT가 더 쉬웠기 때문에 공개한 내부 구성 요소였으며, 흥미로운 산출물은 항상 체크포인트가 아니라 동결 백본에 작은 셸을 더한 레시피였습니다.
어느 쪽이든, 가중치는 공개되었고, 라이선스는 허용적입니다. 지금 Motif 외부의 모든 사람이 솔직히 인정할 수 있는 입장은, 우리가 아주 훌륭한 모델 카드를 읽었지만 아무도 그것을 확인하지 않았다는 것입니다. 확인을 시작하는 가장 빠른 방법은 모델을 로드하고 z_fused의 shape을 출력하는 것입니다.
