Motif-Audio-1
Engineering & Research

Motif-Audio: het audio-foundationmodel dat Motif Technologies uitbracht zonder het iemand te vertellen.

Auteur

Jim Song

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Bovenaan de Motif-Audio modelkaart staat een HTML-commentaar dat geen enkele lezer had mogen zien: "TODO vóór de publieke release: paper- en demo/Space-links aan Model Sources toevoegen." Het staat er nog steeds. Op 22 juli 2026 pushte Motif Technologies de gewichten, de modelcode, een config en een modelkaart van 13 KB in één commit naar Hugging Face — en stopte daarna. Geen paper. Geen demo-Space. Geen blogpost, geen launch-thread, geen persbericht. Twee weken later toont de repository 14 downloads en 14 likes — ongeveer wat een model krijgt als de enigen die het vinden degenen zijn die de org-pagina al volgen.

De stilte is het misleidende deel, want de kaart eronder is geen placeholder. De kaart documenteert een dual-stream audio-autoencoder met 726M parameters, benchmarkt hem op 21 datasets tegen DAC, EnCodec, Mimi, X-Codec2, SemantiCodec, WavLM, HuBERT en Whisper Large v3, levert werkende inferentiecode en brengt het geheel uit onder MIT. Alles in dit artikel is gelezen uit die repository — de kaart, config.json en model.py — plus rekenwerk dat we zelf hebben gedaan waar de kaart een getal weglaat. Elk prestatiecijfer hieronder is van Motif zelf, uitgevoerd door Motif, niet gereproduceerd: voor zover wij kunnen nagaan, heeft niemand buiten het bedrijf nog een enkele onafhankelijke meting van dit model gepubliceerd.

Wat Motif-Audio is, en de vier dingen die het niet is

Het is een autoencoder voor geluid. Je geeft het een ruwe mono-golfvorm van 16 kHz; het encodeert die in een continue latent en decodeert de latent terug naar een golfvorm. De modelkaart staat exact twee directe toepassingen toe: reconstructie en neurale vocoding voor algemene audio en spraak, en het gebruik van de latent als invoerrepresentatie voor een ander model stroomafwaarts. Dat is een smaller product dan de zinsnede 'algemeen toepasbaar audio-fundamentmodel' doet vermoeden, en precies die discrepantie is waar de meeste lezers de mist in gaan.

Het is geen tekst-naar-spraak. Er is geen enkele vorm van tekstconditionering, en de kaart vermeldt tekstgeconditioneerde synthese als expliciet buiten beschouwing. Het kan alleen audio opnieuw renderen die al bestaat.

Het is geen tokenbron voor audio-LLM's. De latente representatie is continu, geen reeks van gekwantiseerde codebook-indices, dus het patroon in Moshi/Mimi-stijl van het voeden van discrete audio-tokens in een taalmodel is hier niet van toepassing. De kaart zegt dit ronduit, wat een welkome dosis discipline is — heel wat codec-releases laten lezers het tegenovergestelde aannemen.

Het is niet full-band. 16 kHz-sampling legt een hard Nyquist-plafond van 8 kHz op aan alles wat het aanraakt. Prima voor spraak en gebeurtenisdetectie; een muur voor muziekproductie of alles waarvoor lucht en sisklanken intact moeten blijven.

En ondanks het woord 'codec' is het geen bitrate-compressor. Dat verdient een eigen sectie, omdat de reconstructietabel van de kaart precies de vergelijking uitnodigt die de architectuur niet kan ondersteunen.

Motif-Audio-2

Het dual-stream ontwerp, en waarom het goedkoop was om te trainen

Het model voert één golfvorm door twee parallelle encoders en fuseert ze.

De semantische stroom is bevroren en doet het zware werk. Het leest een 80-bins log-mel-spectrogram als een 2D-afbeelding en verwerkt het met een 48-laags, 1024-breed, 16-koppige vision-transformer die 16x16 patches, 2D-rotary-embeddings en vier register-tokens gebruikt — ongeveer 605M van de parameters van het model. Het werd zelfstandig voorgetraind met gemaskeerde spectrogrammodellering: voorspel gemaskeerde tijd-frequentiegebieden op basis van hun omgeving, leer inhoudsstructuur uit ongelabelde audio en vries het daarna in.

The acoustic stream is tiny and trained. It reads a higher-resolution 160-bin mel and embeds it with a single Conv2d whose kernel spans the full 160-bin height and two time frames — a deliberately shallow path whose only job is the fine spectral detail the semantic encoder discards.

Fusion is één cross-attentielaag waarin de akoestische tokens de query zijn en de semantische tokens de keys en values zijn, gevolgd door een residuele optelling en RMS-norm. Het is van belang welke stroom de query is, zoals het volgende gedeelte laat zien.

De decoder is een ConvNeXt-backbone van 12 blokken met een 4096-brede tussenlaag, Snake-activaties en een inverse-STFT-kop die magnitude en fase voorspelt en de golfvorm direct reconstrueert, zonder autoregressie.

Er werden slechts 121M parameters getraind — de akoestische encoder, de fusielaag en de decoder. Dat is het economisch interessante feit dat schuilgaat in het parameteraantal: Motif kreeg een concurrerend audiomodel uit een bevroren self-supervised backbone plus een kleine getrainde schil, wat een heel ander budget is dan 726M parameters end-to-end trainen. Het is ook een ontwerp dat stilletjes alles inzet op de kwaliteit van de bevroren encoder.

Een kleine inconsistentie die het vermelden waard is voor iedereen die optelt: de kaart vermeldt 726M totaal, terwijl de safetensors-lezer van Hugging Face 752,4M BF16-parameters in de checkpoint telt. Een gat van 26M, onverklaard. Geen rode vlag — verschillen in boekhouding over buffers en heads zijn normaal — maar het getal op de kaart is niet het getal van het bestand.

Het nummer dat de kaart nooit afdrukt

Nergens vermeldt de modelkaart de framesnelheid van de latent, de dimensionaliteit per seconde, of een equivalente bitsnelheid. Elk daarvan is afleidbaar uit config.json en model.py, en het antwoord herformuleert de volledige reconstructietabel. De rekenkunde, die iedereen kan controleren:

• 16.000 Hz audio met een hoplengte van 160 geeft 100 mel-frames per seconde.

• De akoestische patch-embedding gebruikt een kernel van 160 bins bij 2 frames met bijpassende stride, dus het produceert 50 tokens per seconde met 1024 dimensies.

• De fusielaag richt de aandacht van de akoestische stroom naar de semantische stroom, zodat het gefuseerde latent de akoestische reekslengte erft: 50 vectoren per seconde, 1024 breed.

• De getransponeerde convolutie van de decoder verhoogt die tokens met precies 2 terug naar 100 frames, en de iSTFT-kop met hop 160 zet 100 frames om in 16.000 samples. De keten sluit — dat is de controle dat de 50 Hz-waarde klopt.

Bereken nu de prijs. Bij bfloat16 is 50 vectoren per seconde maal 1024 dimensies maal 2 bytes 102,4 kB/s, of ruwweg 819 kbit/s. Ongecomprimeerde 16-bit PCM bij 16 kHz is 256 kbit/s. De "compacte continue representatie" is ongeveer 3,2x groter dan de ruwe audio die het codeert, en ongeveer 6x de grootte van het 160-bin mel-spectrogram waaruit het wordt berekend.

Dat is geen schandaal — het is hoe een generatieve latente ruimte eruit hoort te zien, net zoals een latente afbeelding van een diffusie-VAE geen JPEG is. Maar het betekent wel dat de reconstructietabel Motif-Audio beoordeelt tegen systemen die een fundamenteel moeilijkere taak uitvoeren. Mimi, EnCodec, DAC en X-Codec2 werken in hun standaardconfiguraties ergens in het bereik van ruwweg 1 tot 6 kbit/s. Motif-Audio reconstrueert uit iets dat in de orde van honderd keer meer informatie per seconde zit. Lees die tabel als bewijs dat de decoder getrouw is, niet als bewijs dat dit beter comprimeert dan DAC. Tot eer van Motif: het out-of-scope-gedeelte waarschuwt al om het niet als een tokencodec te behandelen; de evaluatiesectie zet het vervolgens toch in een tabel met vier ervan.

Eén kanttekening bij onze eigen berekening: dit is afgeleid, niet door de leverancier vermeld. Als we de fusierichting verkeerd hebben gelezen, kost de correctie één regel — laad het model en print de vorm van z_fused.

Het eerlijk lezen van Motif's eigen scorebord

De semantische evaluatie bevriest de features van het model en traint daar bovenop een kleine MLP-probe, over 21 datasets in drie families, tegen zes baselines. Het is een standaardprotocol en een werkelijk breed protocol. Het wordt ook volledig door de leverancier uitgevoerd.

Motif-Audio-3

Op omgevingsgeluid wint het elke kolom. ESC-50 accuracy 0.911, UrbanSound8K 0.871, DESED F1 0.616, FSD50k mAP 0.478, Clotho R@1 0.066, en FSD18-Kaggle mAP 0.759 tegenover 0.496 van Whisper Large v3 — de grootste marge in de hele kaart. Als je audio-tagging of akoestische gebeurtenisdetectie bouwt, is dit het resultaat dat je zou moeten overtuigen om het te downloaden.

Bij spraak is het in drie van de elf kolommen het beste — CREMA-D 0.744, RAVDESS 0.726, VoxCeleb1 0.754. Dat zijn emotieherkenning en sprekeridentificatie, precies waar een stream met timbre en textuur goed in zou moeten zijn. Whisper Large v3 staat nog steeds bovenaan in de meeste overige categorieën.

Er is één regelrecht gat. Op LibriSpeech-100h inverse-WER scoort Motif-Audio 0,000, tegen 0,900 voor Whisper Large v3 en 0,825 voor HuBERT. Fluent Speech Commands scoort 0,800 tegen HuBERT's 0,987. Een deel daarvan komt waarschijnlijk door het instrument in plaats van het model — DAC, SemantiCodec en MSM-MAE scoren ook een vlakke 0,000 in die kolom, en een frame-level MLP-probe is een slechte manier om herkenning te doen. Maar de praktische conclusie geldt hoe dan ook: als je frozen features nodig hebt voor ASR, is dit niet het juiste model.

De tabel fungeert tevens als ablatie, en Motif lijkt dat niet te hebben vermeld. MSM-MAE, een van de zes baselines, komt uit dezelfde familie van masked-spectrogram-modellering als de frozen semantische encoder. Het vergelijken van die twee rijen meet dus wat de getrainde akoestische stroom daadwerkelijk oplevert. Motif-Audio wint 15 van de 21 kolommen, speelt één gelijk en verliest er vijf. Alle zes omgevingskolommen verbeteren, sommige aanzienlijk. Twee van de vijf verliezen betreffen muziek: FMA 0.582 tegen 0.627, NSynth 0.699 tegen 0.730. Het toevoegen van akoestische details helpt enorm bij geluidsgebeurtenissen en paralinguïstiek, en doet licht afbreuk aan de classificatie van muziekklankkleur.

Eén kolom is de beste in de tabel en nog steeds slecht. Motif-Audio behaalt de beste score op MAESTRO-noottranscriptie met 0.200 F1, terwijl elk ander systeem tussen 0.000 en 0.128 ligt. Het winnen van een kolom waarin het maximum 0.2 is, is geen transcriptiecapaciteit; het is een teken dat bevroren features deze taak nog niet aankunnen.

Reconstructie: sterk, en nog steeds niet de beste in zijn eigen tabel

Op LibriSpeech test-clean behaalt Motif-Audio een PESQ van 3,768, een STOI van 0,980 en een WER van 1,97% op de gereconstrueerde audio, met een FAD van 0,4506. DAC doet het beter op twee van die vier — PESQ 4,010 en FAD 0,2099 — en wint nipt op WER met 1,94%. Motif-Audio wint STOI overtuigend. Tegen Mimi (PESQ 3,439), EnCodec (2,768) en X-Codec2 (2,433) is het duidelijk beter, maar opnieuw tegen een veel hogere informatiesnelheid.

De meest subtiel onthullende rij is de laatste: Korean FLEURS, PESQ 3,731, CER 5,13%, FAD 0,1448 — de beste FAD van de hele tabel. Het is de enige niet-Engelse evaluatie in de modelkaart, en er draait geen baseline naast mee. Voor een Koreaans soeverein-AI-bedrijf leest het evalueren van Koreaanse reconstructie en het rapporteren daarvan zonder concurrenten minder als een benchmark en meer als een interne acceptatietest die in de openbare modelkaart is beland.

Vier repositories in drie dagen

Motif-Audio kwam niet alleen, en die context verandert wat het waarschijnlijk is.

20 juli — Motif-3-Beta, het vlaggenschip met 315 miljard parameters en mixture-of-experts, waarvan de Artificial Analysis Intelligence Index van 44 het wereldwijd op de derde plaats zette onder open-source modellen. We hebben die release apart behandeld; het is het model dat het bedrijf buiten Korea zichtbaar maakte.

21 juli — Motif-Vision-Encoder, een vision-transformer van 7B met gepubliceerde resultaten tegen DINOv3, V-JEPA 2.1 en SigLIP2.

22 juli — Motif-Audio.

Eerder — Motif-VAE, een video-tokenizer, in juni; Motif-Video-2B in april.

Motif-Audio-4

Uit die lijst komen twee patronen naar voren. Het eerste is licentiëring: de componenten zijn allemaal MIT — de audio-autoencoder, de vision-encoder, de video-VAE — terwijl Motif-3 (Beta), het vlaggenschip-LLM, beperkt is tot persoonlijk, educatief en niet-commercieel onderzoeksgebruik. Motif geeft de onderdelen weg en schermt de hersenen af. Dat is een coherente strategie voor een bedrijf waarvan het inkomstenmodel loopt via Moreh's compute-business en een Koreaans overheidsprogramma voor soevereine AI, niet via het verkopen van gewichten.

Het tweede is dat de onderdelenlijst op een geheel begint te lijken. Een tekst-backbone, een visie-encoder, een video-tokenizer en nu een audio-autoencoder waarvan de kaart als derde mogelijkheid adverteert dat deze "text-to-audio- en muziekgeneratiemodellen een fundament om op voort te bouwen" biedt. De bibliotheek die in de repo wordt vermeld is diffusers. Een continu 1024-breed latent plus diffusers is het standaardsubstraat voor latent-diffusie-audiogeneratie. Motif heeft niets van dien aard aangekondigd — dit is een afleiding uit vier repositories en een metadatatag, geen routekaart. Maar het is de lezing die de artefacten ondersteunen.

De adoptiekloof tussen zustermodellen is schril, en het is goed om dat in perspectief te houden wanneer je de downloadteller ziet: Motif-3-Beta staat op 4.674 downloads en 210 likes, Motif-Vision-Encoder op 2.143, en Motif-Audio op 14. Zelfde organisatie, zelfde week, drie grootteordes uit elkaar. Niets aan de kwaliteit van het audiomodel verklaart dat. Het niet aankondigen wel.

Het draaien ervan, en waar een model zoals dit past

Het gedeelte over de eerste stappen is ongewoon eerlijk over zijn eigen scherpe randjes, en elk daarvan kost je een uur als je ze overslaat.

Installeer torchcodec.Recente torchaudio-releases decoderen via torchcodec, dus torchaudio.loadgeeft een ImportError zonder torchcodec. Volledige set: torch, torchaudio, torchcodec, diffusers, timm.

Laad met trust_remote_code=True. De modelcode wordt meegeleverd met de gewichten en wordt via auto_map gerouteerd, dus er is geen Transformers-native klasse.

Cast met .to(device, torch.bfloat16), niet torch_dtype in from_pretrained. De modelkaart vermeldt duidelijk dat de twee niet equivalent zijn: de tweede laat de mel-filterbankbuffers in float32 staan en reproduceert de gerapporteerde scores niet. Weinig kaarten nemen de moeite om een zo specifieke valkuil te documenteren, en het feit dat deze dat wel doet, suggereert dat iemand er intern door is gebeten.

Voer het in als mono 16 kHz, met vorm (batch, 1, samples), opgevuld zodat het aantal mel-frames deelbaar is door 16, en knip de uitvoer vervolgens terug. De kaart wordt geleverd met een pad_for_model helper die de berekening uitvoert.

Forward retourneert vier tensoren: de gereconstrueerde golfvorm plus z_fused, z_sem en z_acou, zodat u elke stream afzonderlijk als kenmerken kunt gebruiken.

Wat je niet zult vinden, is een gehost eindpunt. Hugging Face's eigen zijbalk zegt het ronduit: "Dit model wordt door geen enkele Inference Provider aangeboden." Motif-Audio is gewichten, geen API — niemand serveert het, wij ook niet — en voor iets dat in je trainingsloop of je feature-extractor leeft, is dat de juiste vorm. Het is de moeite waard om helder te zijn over welke helft van een audio-stack dat beschrijft. De stukken die je huurt zijn de syntheselaag en het taalmodel dat het redeneren tussen de oren doet; op OrcaRouter zitten die achter één sleutel tegen de catalogusprijs van de provider, met 0% opslag en automatische failover, dus het vervangen van OpenAI TTS-1 HD door een andere spraakleverancier is een stringwijziging in plaats van een inkoopprocedure. De stukken die je host zijn degenen die je verfijnt, kwantiseert en in een pipeline bakt — een bevroren encoder zoals deze. Een codec is geen routeringsprobleem. Een synthesereverancier die je volgend kwartaal misschien vervangt, is dat wel.

Wat nog onkenbaar is

Geen paper. De TODO van de kaart zelf belooft er een; de Papers-sectie van de organisatie op Hugging Face vermeldt nog steeds alleen de technische rapporten van Motif-Video 2B en Motif 2 12.7B. Totdat er een audiopaper verschijnt, is de architectuurbeschrijving alles wat er is, zonder een ablatie die uitlegt waarom de semantische stream bevroren blijft of waartegen de akoestische patchgrootte is afgewogen.

Geen openbaarmaking van trainingsgegevens."Unlabeled audio" is de volledige verklaring. MIT op de gewichten regelt de codelicentie en doet geen uitspraak over de herkomst — en in tegenstelling tot de vision-encoderkaart, die de naleving van de dataseticentie expliciet afwentelt op downstream-gebruikers, gaat de audiokaart er helemaal niet op in.

Geen latentie-, doorvoer- of streamingcijfers.Een 48-laags transformer over spectrogramvensters van 5,12 seconden is niet duidelijk een realtime ontwerp, en de kaart beweert dat ook niet. Als je het overweegt voor live audio, ga er dan van uit dat jij degene bent die meet.

Geen 24 kHz- of 48 kHz-variant, geen gekwantiseerde builds, geen demo Space, geen audiosamples om naar te luisteren. Voor een model waarvan het hele verkoopargument reconstructiekwaliteit is, is het zonder een enkele voor/na-clip uitbrengen een vreemde omissie.

Geen enkele onafhankelijke evaluatie van welke aard dan ook. Elk getal hier is van Motif.

Drie vragen die deze repo gaat krijgen

Kan ik er een voiceproduct op bouwen?

Niet met wat er is uitgebracht. Er is geen tekstconditionering, dus het kan niet spreken — het kan alleen audio opnieuw renderen die je het geeft. Wat het aannemelijk wel kan, is ten grondslag liggen aan een spraakproduct dat iemand anders traint: een tekst-naar-spraak- of tekst-naar-audiomodel dat leert z_fused uit tekst te voorspellen, waarbij de decoder van Motif-Audio die latente representatie omzet in geluid. Dat is precies de "Generate"-pitch in de opening van de kaart. Het is een fundament voor een product, geen product.

Is de MIT-licentie echt veilig voor commercieel gebruik, aangezien het vlaggenschip dat niet is?

Licenties op Hugging Face zijn per repository, en deze is ondubbelzinnig: MIT, gebruik, wijzig en herdistribueer commercieel, behoud de copyrightvermelding, zonder garantie. De complicatie zit niet in de licentietekst, maar in het ontbreken van een datastatement. De kaart van de vision-encoder legt de naleving van de datasetlicentie schriftelijk bij downstream-gebruikers; de audiokaart noemt helemaal geen corpus. Als dit in een uitgebracht product terechtkomt, is dat een vraag voor je eigen juridische adviseur, niet voor een modelkaart. De kaart wijst er ook terecht op dat getrouwe reconstructie het model tot een bruikbaar onderdeel maakt in voice-cloning- en spoofing-pijplijnen.

Moet ik DAC, EnCodec of Mimi ermee vervangen?

Het hangt er volledig van af waarvoor je codec bedoeld is. Voor transport of opslag met beperkte bandbreedte, nee — de bitrate-berekening hierboven sluit dat uit, en dat is niet de taak waarvoor het gebouwd is. Als een bevroren feature-extractor voor audio-tagging, gebeurtenisdetectie of paralinguïstiek, is het met afstand het sterkste in zijn eigen tabel, MIT-gelicenseerd en goedkoop om te evalueren: draai je probe, vergelijk met je huidige backbone, houd de winnaar. Als de latente ruimte voor een generatief audiomodel, is het aannemelijk en duidelijk het beoogde gebruik — maar je zou de eerste zijn die dat resultaat publiceert, wat een kans of een waarschuwing is, afhankelijk van je deadline.

Wat te kijken

Het meest informatieve aan deze repository in de komende maand is of die TODO ooit wordt opgelost. Als er een paper, een demo Space en een text-to-audio-tegenhanger verschijnen, dan was Motif-Audio het eerste openbare onderdeel van een omni-modale stack, vroeg uitgebracht omdat de onderdelen MIT zijn en het vlaggenschip niet, en zullen 14 downloads eruitzien als een voetnoot. Als de repo de hele herfst op één commit blijft staan, was het een intern onderdeel dat iemand openbaar maakte omdat MIT gemakkelijker was dan een privébucket, en het interessante artefact was altijd het recept van bevroren backbone plus kleine shell, eerder dan de checkpoint.

Hoe dan ook, de gewichten staan online, de licentie is permissief, en de eerlijke positie voor iedereen buiten Motif op dit moment is dat we een zeer goede modelkaart hebben gelezen en niemand deze heeft gecontroleerd. De snelste manier om te beginnen met controleren is om het te laden en de vorm van z_fused te printen.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

Neem contact op

Word lid van de community

DiscordEmailXGitHubYouTube