
Motif-Audio:Motif Technologiesが誰にも知らせずに出荷したオーディオ基盤モデル
- qwenNEWQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 100万トークンあたり · 56 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3150知能69コーディング
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり · 201 tok/s
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNEWAnthropic: Claude Opus 52026-07-2461知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2150知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1651知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1557知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0951知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0955知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0959知能77コーディング
- grokxAI: Grok 4.52026-07-0854知能72コーディング
- tencentTencent: Hy32026-07-0641知能59コーディング
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232知能42コーディング
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226知能39コーディング
- anthropicAnthropic: Claude Sonnet 52026-06-3053知能72コーディング
- klingKling: Kling 3.0 Turbo2026-06-1757知能52コーディング57数学
- z-aiZ.ai: GLM 5.22026-06-1651知能69コーディング60数学
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242知能61コーディング61数学
Near the top of the Motif-Audio model card there is an HTML comment no reader was meant to see: "TODO before public release: add paper and demo/Space links to Model Sources." It is still there. On July 22, 2026, Motif Technologies pushed the weights, the modeling code, a config and a 13 KB card to Hugging Face in a single commit — and then stopped. No paper. No demo Space. No blog post, no launch thread, no press note. Two weeks later the repository shows 14 downloads and 14 likes, which is roughly what a model gets when the only people who find it are the ones already watching the org page.
沈黙こそが誤解を招く部分だ。なぜなら、その下にあるカードはプレースホルダーではないからだ。そこには726Mパラメータのデュアルストリームオーディオオートエンコーダが文書化され、21のデータセットでDAC、EnCodec、Mimi、X-Codec2、SemantiCodec、WavLM、HuBERT、Whisper Large v3とのベンチマークが行われ、動作する推論コードが同梱され、全体がMITライセンスで公開されている。この記事の内容はすべて、そのリポジトリ——カード、config.jsonとmodel.py——から読み取ったものであり、さらに、カードに数値が記載されていない箇所は私たち自身で計算した。以下のすべての性能数値はMotif自身のものであり、Motifが実行したものであり、第三者による再現は行われていない。私たちが確認できる限り、社外の誰もこのモデルの独立した測定結果をまだ一つも発表していない。
Motif-Audioとは何か、そしてMotif-Audioではない4つのこと
これは音声用のオートエンコーダーです。生の16kHzモノラル波形を入力すると、それを連続潜在表現にエンコードし、その潜在表現を波形にデコードします。カードが認めている直接的な用途は正確に2つだけです。一般的なオーディオと音声のための再構成とニューラルボコーディング、そして、潜在表現を下流の別のモデルの入力表現として使うことです。これは「汎用オーディオ基盤モデル」というフレーズが示唆するものよりも狭い製品であり、その乖離こそが、ほとんどの読者が誤解するポイントです。
• これはテキスト読み上げではありません。テキスト条件付けは一切なく、カードにはテキスト条件付き合成が明示的に範囲外と記載されています。既存のオーディオを再レンダリングすることしかできません。
• これは音声LLMのトークンソースではありません。潜在表現は連続的であり、量子化されたコードブックインデックスの系列ではないため、離散的な音声トークンを言語モデルに入力するMoshi/Mimiスタイルの手法は当てはまりません。カードにはそのことが明確に書かれており、これは歓迎すべき規律です。多くのコーデックのリリースでは、読者がそうでないと推測したまま放置されるからです。
• フルバンドではありません。16kHzサンプリングは、扱うあらゆるものに8kHzという厳格なナイキスト上限を課します。音声やイベント検出には十分ですが、音楽制作や、空気感と歯擦音を保つ必要があるものにとっては壁となります。
• そして、「codec」という言葉にもかかわらず、これはビットレート圧縮器ではありません。それは独自のセクションが必要です。なぜなら、カード自身の再構成テーブルは、そのアーキテクチャが支えることができないまさにその比較を促すからです。

デュアルストリーム設計、そしてトレーニングが安価だった理由
このモデルは、1つの波形を2つの並列エンコーダに通し、それらを融合します。
• 意味ストリームは凍結されており、主要な処理を担います。 80ビンのログメルスペクトログラムを2D画像として読み取り、16×16パッチ、2D回転埋め込み、4つのレジスタトークンを使用する48層・1024次元・16ヘッドのビジョントランスフォーマーで処理します。これはモデルのパラメータの約605Mに相当します。マスク化スペクトログラムモデリングによって独自に事前学習されました。マスクされた時間周波数領域を周囲から予測し、ラベルなし音声からコンテンツ構造を学習してから、凍結されます。
• 音響ストリームは小さく、訓練されている。それは、より高解像度の160ビンのメルを読み取り、カーネルが160ビン全体の高さと2つの時間フレームにわたる単一のConv2dでそれを埋め込む——セマンティックエンコーダが破棄する微細なスペクトル詳細のみを担当する、意図的に浅い経路である。
• Fusion はクロスアテンション層の 1 つであり、そこでは音響トークンがクエリ、意味トークンがキーとバリューとして機能し、その後に残差加算と RMS norm が続きます。どちらのストリームがクエリであるかが重要です。次のセクションで示します。
• デコーダーは12ブロックのConvNeXtバックボーンであり、4096幅の中間層、Snakeアクティベーション、そして大きさと位相を予測して波形を直接再構成する逆STFTヘッドを備え、自己回帰は行いません。
トレーニングされたのはわずか1億2100万パラメータのみ——音響エンコーダ、フュージョン層、そしてデコーダである。これがパラメータ数に隠された経済的に興味深い事実だ。Motifは、凍結された自己教師ありバックボーンと小さな訓練済みシェルから競争力のある音声モデルを実現した。これは、7億2600万パラメータをエンドツーエンドで訓練するのとはまったく異なる予算である。また、この設計は凍結されたエンコーダの品質に静かにすべてを賭けるものでもある。
数えている人にとって指摘に値する小さな不整合が1つあります:カードには合計726Mと記載されていますが、Hugging Faceのsafetensorsリーダーはチェックポイント内のBF16パラメータを752.4Mと数えます。26Mの差があり、説明はされていません。危険信号というわけではありません — バッファやヘッドに関する数え方の違いはよくあることです — しかし、カードの数字はファイルの数字とは異なります。
カードに決して印刷されない番号
モデルカードのどこにも、潜在変数のフレームレート、1秒あたりの次元数、または同等のビットレートは記載されていません。それらのすべては、以下から導出可能である:config.jsonとmodel.py、そしてその答えは再構成テーブル全体を捉え直します。誰でも確認できる算数は以下の通りです。
• 16,000 Hzのオーディオとホップ長160からは、毎秒100メルフレームが得られます。
• 音響パッチ埋め込みは、対応するストライドを持つ160ビン×2フレームのカーネルを使用するため、1024次元で毎秒50トークンを出力する。
• 融合層は音響ストリームから意味ストリームへ注意を向けるため、融合された潜在表現は音響シーケンス長を引き継ぎます:毎秒50ベクトル、幅1024。
• デコーダーの転置畳み込みは、それらのトークンをちょうど2倍アップサンプリングして100フレームに戻し、ホップ160のiSTFTヘッドが100フレームを16,000サンプルに変換する。チェーンが閉じる——これが50Hzの読み取りが正しいことの確認でもある。
では、計算してみましょう。bfloat16では、毎秒50ベクトル×1024次元×2バイトで102.4 kB/s、つまりおよそ819 kbit/s。非圧縮の16ビットPCM(16kHz)は256 kbit/sです。「コンパクト連続表現」は約それが符号化する生オーディオより3.2倍大きい、そしてそれが計算される元となる160ビンのメルスペクトログラムの約6倍のサイズです。
これはスキャンダルではない——生成潜在空間が本来あるべき姿とはそういうものであり、画像拡散VAEの潜在表現がJPEGではないのと同じことだ。しかし、そのことは、再構成テーブルがMotif-Audioを、根本的にはるかに困難な課題に取り組んでいるシステム群とスコアリングしていることを意味する。Mimi、EnCodec、DAC、X-Codec2は標準構成でおおよそ1~6 kbit/sの範囲で動作する。Motif-Audioは、毎秒その約100倍の情報量から再構成する。あのテーブルは、DACより圧縮効率が良い証拠としてではなく、デコーダーが忠実である証拠として読むべきだ。Motifを評価すべき点として、適用範囲外セクションはすでにこれをトークンコーデックとして扱うことへの警告を含んでいる。それにもかかわらず評価セクションは、これを4つのトークンコーデックと同じ表に載せている。
私たち自身の計算には注意点が1つあります:これはベンダーが明言した値ではなく、導出された値です。もし融合方向を読み間違えていた場合、修正は1行で済みます — モデルをロードして、z_fused。
Motif自身のスコアボードを正直に読む
この意味評価では、モデルの特徴量を凍結し、その上に小さなMLPプローブを学習させる。それを3つのファミリーにわたる21のデータセットで実施し、6つのベースラインと比較する。これは標準的なプロトコルであり、真に広範なものである。また、完全にベンダー側で実行される。

• 環境音では全項目を席巻しています。ESC-50精度0.911、UrbanSound8K 0.871、DESED F1 0.616、FSD50k mAP 0.478、Clotho R@1 0.066、FSD18-Kaggle mAP 0.759。これはWhisper Large v3の0.496に対する成績で、カード全体で最も大きな差です。オーディオタグ付けや音響イベント検出を構築しているなら、この結果がダウンロードの決め手になるでしょう。
• 音声においては、11列中3列で最高です — CREMA-D 0.744、RAVDESS 0.726、VoxCeleb1 0.754。これは感情認識と話者識別であり、音色と質感を伝えるストリームが得意とすべきまさにその分野です。Whisper Large v3は、残りの大半で依然としてリードしています。
• 完全な穴が1つあります。LibriSpeech-100h逆WERでは、Motif-Audioは0.000を記録し、Whisper Large v3は0.900、HuBERTは0.825です。Fluent Speech Commandsは0.800で、HuBERTの0.987に対して劣っています。この差の一部は、おそらくモデルではなく評価手段に起因します。というのも、DAC、SemantiCodec、MSM-MAEもその列で0.000を記録しており、フレームレベルのMLPプローブは認識に不向きな方法だからです。しかし、実用的な結論はどちらにせよ変わりません。ASR用に凍結特徴量が必要なら、このモデルは適していません。
• この表はアブレーション分析を兼ねているが、Motifはその点に触れていないようだ。 MSM-MAEは、6つのベースラインの1つであり、凍結されたセマンティックエンコーダーと同じマスクド・スペクトログラム・モデリングファミリーに属する。したがって、この2つの行を比較することで、学習済みの音響ストリームが実際に何をもたらすのかを測ることができる。Motif-Audioは21列中15列で勝利し、1列で引き分け、5列で敗北した。環境に関する6列はすべて改善しており、そのうちのいくつかは大幅に改善している。5つの敗北のうち2つは音楽関連のものだ:FMAは0.582対0.627、NSynthは0.699対0.730。音響的な詳細の追加は、サウンドイベントとパラ言語情報に大いに役立つ一方、音楽の音色分類にはわずかに悪影響を及ぼす。
• ある列はテーブル内で最良だが、それでも悪い。 Motif-AudioはMAESTROノート転写で0.200 F1を達成してトップだが、他のすべてのシステムは0.000から0.128の範囲にある。上限が0.2の列で勝利することは転写能力ではなく、凍結された特徴量ではまだこのタスクを実行できないという指摘である。
再構築:強力、それでもそのテーブル内では最高ではない
LibriSpeech test-clean では、Motif-Audio は再構成された音声に対して PESQ 3.768、STOI 0.980、WER 1.97% を記録し、FAD は 0.4506 である。DAC はこれら4つのうち2つで上回っており、PESQ 4.010 と FAD 0.2099 を達成し、WER 1.94% でもわずかに勝っている。Motif-Audio は STOI で完全に勝っている。Mimi (PESQ 3.439)、EnCodec (2.768)、X-Codec2 (2.433) と比較すると、明らかにリードしているが、ただし、はるかに高い情報レートでの話である。
最も静かに真相を明かす行は最後の行だ。Korean FLEURS、PESQ 3.731、CER 5.13%、FAD 0.1448 — これは表全体で最高のFADである。このカード内で唯一の非英語評価であり、併せて実行されたベースラインもない。韓国の主権AI企業にとって、韓国語の再構築を評価し、競合なしで報告することは、ベンチマークというよりも、公開カードに紛れ込んだ内部受け入れテストのように読める。
3日間で4つのリポジトリ
Motif-Audioは単独でやってきたわけではなく、その文脈がそれがおそらく何であるかを変える。
• 7月20日 — Motif-3-Betaは、315BパラメータのMixture-of-Experts(MoE)フラッグシップであり、そのArtificial Analysis Intelligence Indexは44で、オープンソースモデルとして世界第3位にランクインしました。このリリースについては別途取り上げています。このモデルにより、同社は韓国国外でも知られる存在になりました。
• 7月21日 — DINOv3、V-JEPA 2.1、SigLIP2との比較結果が公表されている7Bビジョントランスフォーマー「Motif-Vision-Encoder」。
• 7月22日 — Motif-Audio.
• 以前 — 6月にビデオトークナイザーのMotif-VAE、4月にMotif-Video-2B。

そのリストからは2つのパターンが浮かび上がる。1つ目はライセンス形態だ。オーディオオートエンコーダー、ビジョンエンコーダー、ビデオVAEといったコンポーネントはすべてMITライセンスである一方、Motif-3 (Beta)という旗艦LLMは、個人利用、教育目的、非商用の研究利用に限定されている。Motifは部品を無償提供しつつ、頭脳にはゲートをかけている。これは、収益の源泉がウェイトの販売ではなく、Morehのコンピュート事業と韓国政府のソブリンAIプログラムにある企業にとって、一貫した戦略である。
第二に、部品リストが全体のように見え始めていることだ。テキストバックボーン、視覚エンコーダー、動画トークナイザー、そして今回、音声オートエンコーダーが加わった。そのカードは3番目の機能として「テキストから音声生成および音楽生成モデルに構築基盤を提供する」と宣伝している。リポジトリで宣言されているライブラリはdiffusersである。連続的な1024次元の潜在変数とdiffusersは、潜在拡散音声生成の標準的な基盤である。Motifはそのようなことを一切発表していない——これは4つのリポジトリとメタデータタグからの推論であり、ロードマップではない。しかし、それが成果物が支持する読み方である。
兄弟モデル間の導入格差は顕著で、ダウンロードカウンターを見るときはその点を念頭に置く価値がある。Motif-3-Betaはダウンロード数4,674、いいね数210、Motif-Vision-Encoderは2,143、Motif-Audioは14だ。同じ組織、同じ週で、桁が3つも違う。オーディオモデルの品質がその理由を説明するわけではない。発表しなかったことが理由だ。
それを実行し、このようなモデルがどこに適合するか
「はじめに」セクションは、自身の難しい部分について珍しいほど正直で、それを読み飛ばすと、それぞれ1時間のロスになる。
• torchcodec をインストールしてください。最近の torchaudio リリースは torchcodec を経由してデコードするため、torchaudio.loadはそれが無いと ImportError を発生させます。完全なセット:torch、torchaudio、torchcodec、diffusers、timm。
• trust_remote_code=True を指定してロードします。 モデリングコードは重みと一緒に配布され、auto_map を介してルーティングされるため、Transformers ネイティブのクラスは存在しません。
• キャストには、from_pretrained の torch_dtype ではなく、.to(device, torch.bfloat16) を使用してください。カードには、この2つは同等ではないと明確に記載されています。後者(torch_dtype)はメルフィルタバンクのバッファをfloat32のままにし、報告されたスコアを再現しません。これほど具体的な落とし穴を文書化しているカードはほとんどありません。このカードがそれを記載しているという事実は、社内の誰かがそれで痛い目にあったことを示唆しています。
• モノラル16kHzで入力し、(batch, 1, samples) の形状にし、メルフレーム数が16の倍数になるようにパディングしてから、出力を元の長さに切り戻します。このカードには、pad_for_model ヘルパーが同梱されており、これがその計算を行います。
• Forward は4つのテンソルを返します:再構成された波形に加えて、z_fused、z_sem、z_acou が含まれるため、いずれのストリームも別々に特徴量として使用できます。
見つからないのは、ホスト型エンドポイントです。Hugging Face のサイドバー自体も「このモデルはどの Inference Provider によってもデプロイされていません」とはっきり述べています。Motif-Audio は重みであって API ではありません。私たちを含め、誰もそれを提供していません。トレーニングループや特徴抽出器の中に存在するものにとっては、それが正しい形です。それがオーディオスタックのどの半分を指しているのかを明確にしておく価値があります。レンタルする部分は、合成レイヤーと、頭の中で推論を行う言語モデルです。OrcaRouter ではそれらは単一のキーの背後に、プロバイダー定価・0%マークアップ・自動フェイルオーバーで配置されています。したがって、スワップとはOpenAI TTS-1 HDを別の音声ベンダーに交換することであり、文字列の変更であって、調達サイクルではありません。ホストする側の部品は、ファインチューニングし、量子化し、パイプラインに組み込むもの、つまりこのような凍結されたエンコーダーです。コーデックはルーティング問題ではありません。来四半期に交換するかもしれない合成ベンダーこそが、ルーティング問題です。
まだ知り得ないものは何か
• 論文なし。カード自身のTODOには論文が約束されているが、Hugging Face の org の Papers 棚には、まだ Motif-Video 2B と Motif 2 12.7B のテクニカルレポートしか掲載されていない。音声論文が公開されるまではアーキテクチャの説明だけがすべてであり、セマンティックストリームがなぜ凍結されたままなのか、音響パッチサイズが何に対して選ばれたのかを説明するアブレーションも存在しない。
• トレーニングデータの開示はない。"Unlabeled audio"(ラベルなし音声)というのがその記述のすべてである。重みに対するMITライセンスはコードのライセンスを確定させるが、来歴(provenance)については何も確定させない。そして、データセットライセンスの遵守を明示的に下流の利用者に求めるビジョンエンコーダーのカードとは異なり、オーディオカードはその話題に一切触れない。
• レイテンシ、スループット、ストリーミングの数値は一切示されていない。5.12秒のスペクトログラム窓にわたる48層トランスフォーマーは、明らかにリアルタイム設計とは言えず、カードもそのようには主張していない。ライブオーディオでの使用を検討しているなら、計測するのは自分自身だと思っておくべきだ。
• 24kHz/48kHzバリアントなし、量子化ビルドなし、デモSpaceなし、試聴できるオーディオサンプルなし。再構築品質を全面的に売りにしているモデルなのに、before/afterクリップをひとつも同梱せずにリリースするのは奇妙な欠落だ。
• いかなる種類の独立した評価もありません。ここにある数字はすべてMotifのものです。
このリポジトリが受けるであろう3つの質問
それで音声製品を構築できますか?
出荷されたものでは無理だ。テキストによる条件付けがないため、話すことはできず、与えられた音声を再レンダリングするだけだ。現実的に可能なのは、他の誰かが訓練する音声プロダクトの下に位置することだ。すなわち、テキストからz_fusedを予測することを学習するテキスト読み上げまたはテキストから音声を生成するモデルであり、Motif-Audioのデコーダーがその潜在表現を音に変換する。それはまさに、カード冒頭の「Generate」の売り込みである。プロダクトの基盤であって、プロダクトではない。
フラッグシップ製品がそうでないことを考えると、MITライセンスは本当に商用利用に安全なのでしょうか?
Hugging Face 上のライセンスはリポジトリごとに定められており、これは明確です。MIT、商用利用・改変・再配布が可能、著作権表示の保持、無保証です。複雑なのはライセンス本文ではなく、データに関する記述が欠けている点です。ビジョンエンコーダーのカードは、データセットのライセンス遵守をダウンストリーム利用者に文書で求めていますが、音声カードはコーパスを一切明示していません。これを製品として出荷するなら、モデルカードではなく、御社の法務担当者に確認すべき問題です。またカードは、忠実な再構成が音声クローンやなりすましパイプラインで利用可能なコンポーネントとなることを、正しく指摘しています。
DAC、EnCodec、またはMimiをそれに置き換えるべきですか?
それは、あなたのコーデックが何のためにあるかに完全に依存します。帯域幅が制約される転送やストレージのためであれば、いいえ——上記のビットレートの算術がそれを除外します。そして、それはそもそもそのために作られた仕事ではありません。オーディオタグ付け、イベント検出、またはパラ言語学のための凍結された特徴抽出器としては、それは自らのテーブルの中で断然最強であり、MITライセンスであり、評価するのは安価です。プローブを実行し、現在のバックボーンと比較し、勝者を維持してください。生成オーディオモデルのための潜在空間としては、それはもっともらしく、明らかに意図された使用法です——しかし、あなたがその結果を最初に公表することになるでしょう。それは、締め切り次第で、機会か警告のどちらかです。
何を見るべきか
このリポジトリについて、今後1ヶ月で最も多くのことを教えてくれるのは、あのTODOが解決されるかどうかだ。論文、デモ用のSpace、そしてテキストから音声を生成する姉妹プロジェクトが登場すれば、Motif-Audioはオムニモーダルスタックの最初の公開コンポーネントであり、各部分がMITライセンスで旗艦プロジェクトはそうではないために早期にリリースされたことになり、14回のダウンロードは脚注のように見えるだろう。逆に、このリポジトリが秋までコミット1つのままであれば、それは誰かが内部コンポーネントを公開したものであり、プライベートバケットを使うよりもMITライセンスの方が簡単だったからだ。そして興味深い成果物は常に、凍結されたバックボーンと小さなシェルを組み合わせたレシピであって、チェックポイントではなかったのだ。
いずれにせよ、重みは公開されており、ライセンスは寛容です。そして、現時点でMotifの外部にいる全員にとって正直な立場としては、私たちは非常に優れたモデルカードを読んだものの、誰もそれを検証していません。検証を始める最速の方法は、それをロードしてz_fusedの形状を出力することです。
