Hero-titelkaart voor Muse Voice Transcribe, Meta Superintelligence Labs' eerste realtime audio-perceptiemodel, met een streaming golfvorm met gelabelde ASR, 20+ sprekersdiarisatie en endpointing, en een prijskaartje van $0,18 per audio-uur.
Guides & Insights

Muse Voice Transcribe is live: Meta's eerste real-time audio-perceptiemodel

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Muse Voice Transcribe, het eerste realtime audio-perceptiemodel van Meta Superintelligence Labs, werd op 1 september 2026 uitgebracht en de prijs is een verrassing: $3,00 per 1.000 minuten audio — ongeveer $0,18 per uur — op de Meta Model API. In één streaming doorgang doet het wat de meeste transcriptie-stapels over drie systemen verdelen: automatische spraakherkenning, sprekerdiarisatie over meer dan 20 stemmen, en endpointing, de taak om te bepalen wanneer een spreker daadwerkelijk is uitgesproken in plaats van midden in een gedachte te pauzeren. Meta zegt dat het model de Artificial Analysis streaming spraak-naar-tekst-ranglijst aanvoert met een woordfoutpercentage van 3,1% op definitieve transcripten, die 0,16 seconden nadat de spreker stopt met praten worden geleverd.

Dat laatste getal verdient een eerlijk etiket voordat het aan het werk gaat: het is Meta's claim op de lanceringsdag, die naar een onafhankelijke ranglijst verwijst, voor een model dat nog geen dag aanroepbaar was toen de aankondiging naar buiten kwam. Niemand buiten het lab heeft de 3,1% tot nu toe gereproduceerd, en de nauwkeurigheidsclaim is één ding, terwijl de rest van het verhaal — 70+ getrainde talen, native code-switching, met reinforcement learning aangeleerde "adaptive delay" — een aparte set leveranciersverklaringen in hetzelfde schuitje is. Alles in dit bericht is de staat van het model op dag één, met leveranciersgetallen die als leveranciersgetallen zijn gelabeld.

De cijfers die ertoe doen op dag één

• Prijs — $3,00 per 1.000 audiominuten (ongeveer $0,18 per audio-uur) op de Meta Model API, waarmee we elke grote streaming-transcriptie-API die we volgen onderbieden.

• Nauwkeurigheidsclaim — 3,1% WER op definitieve transcripties 0,16 seconden na het einde van de spraak; 3,6% WER op eerste gedeeltelijke transcripties na 0,13 seconden. Gerapporteerd door de leverancier, met verwijzing naar het Artificial Analysis streaming leaderboard.

• Diarisatie — 20+ sprekers, streaming gegenereerd zonder aparte nabewerkingsstap (Meta rapporteert een gemiddelde diarisatiefout van 17,5%).

• Talen — getraind op 70+; 25 "uitgebreid geverifieerd" bij lancering; naadloze code-switching binnen en tussen zinnen.

• Context — verwerkt audio langer dan een uur; taal-, trefwoord- en contextbias voor jargonrijke domeinen.

A screenshot of the Meta AI Research announcement post for Muse Voice Transcribe (captured September 2, 2026), showing the headline 'Introducing Muse Voice Transcribe', the September 1, 2026 publication date, and an interactive real-time transcription demo at the top of the page.

Wat 'audio perception model' hier betekent

De architectuur is het verhaal. Muse Voice Transcribe verwerkt audio in brokken van 80 milliseconden en streamt woorden uit zodra ze stabiliseren; dat is wat 'realtime' in de praktijk betekent. Het interessante is hoe het model bepaalt wanneer het een woord definitief vastlegt. In plaats van een vast latentiebudget — de standaard afweging waarbij een herkenner ofwel vroeg vastlegt en gokt, ofwel langer wacht en zich indekt — gebruikt het model wat Meta 'adaptive delay' noemt: het gaat snel door eenvoudige spraak heen en houdt meer audiocontext vast voor woorden waarover het minder zeker is. De vertragingsstrategie zelf is aangeleerd via reinforcement learning, dus het model weegt per woord effectief snelheid en nauwkeurigheid tegen elkaar af, in plaats van één globale instelling toe te passen.

Dat onderscheid is de reden waarom Meta Muse Voice Transcribe een "audioperceptiemodel" noemt in plaats van een ASR-model. De outputstroom is een enkel live transcript dat ook aangeeft wie er spreekt en wanneer de uiting compleet is — drie labels die streaming systemen gewoonlijk samenstellen door een herkenner te koppelen aan een spraakactiviteitsdetector en een diarisatiemodel, die elk hun eigen latentie en faalmodi toevoegen.

A screenshot of the Artificial Analysis Speech to Text leaderboard showing the WER Index (non-streaming), Speed Factor, Streaming, and Price in USD per 1,000 minutes of audio sections.

Diarisatie en endpointing, ingebouwd

Diarisatie van sprekers is het onderdeel dat het meest de moeite waard is om onder de loep te nemen, omdat het de functie is waar streamingproducten het vaakst overdrijven. Meta zegt dat het model 20+ sprekers in een enkele opname scheidt en rapporteert een gemiddelde diarisatiefout van 17,5%, wat het afzet tegen een bereik van 21,1–28,6% dat het aan concurrerende systemen toeschrijft. Beide cijfers zijn door de leverancier op de lanceringsdag gepubliceerd, en geen onafhankelijke evaluatie heeft de 17,5% tot nu toe bevestigd. Wat structureel reëel is, is dat de diarisatie in dezelfde streamingpass draait als de herkenning — er is geen tweede stap van 'audio uploaden, wachten, sprekers terugkrijgen', en dat is de ontwerpkeuze die het volgen van 20+ sprekers in een live-omgeving überhaupt plausibel maakt.

Endpointing is de stillere functionaliteit en misschien wel de nuttigste. Transcriptie-API's die ruwe streaming-ASR aanbieden, dwingen de aanroeper om zelf het einde van een uiting te detecteren, en daardoor onderbreken spraakagenten mensen zo vaak of laten ze stiltes vallen. Muse Voice Transcribe beslist wanneer een beurt compleet is en geeft die grens mee in de stream, zodat een toepassing een duidelijk signaal krijgt dat 'deze spreker klaar is' zonder een VAD-laag te bouwen.

De meertalige claim, lees aandachtig

Meta heeft het model getraind op 70+ talen, maar valideert er bij de lancering 25. Dat zijn verschillende dingen: "getraind op" betekent dat de data deze talen bevatte; "uitgebreid geverifieerd" is de subset waar Meta daadwerkelijk achter staat met interne tests. Voor productiegebruik is de lijst van 25 geverifieerde talen de daadwerkelijke dekking, en het verschil tussen 70 en 25 is goed om te weten voordat je 40 talen erdoorheen stuurt. Wat echt ongewoon is, is het code-switching-verhaal: het model is ontworpen om midden in een zin en midden in een uiting van taal te wisselen zonder dat dit wordt gevraagd. Dat is een echt pijnpunt in meertalige regio's en iets wat de meeste eentalige ASR-producten simpelweg niet kunnen. Taal-, trefwoord- en contextbias ronden het aanpassingsverhaal af: je kunt de herkenning laten afstemmen op een domeinwoordenlijst. Dat is de functie die streaming ASR bruikbaar maakt in medische, juridische en ondersteuningswachtrijen.

Drie oppervlakken, één model

Muse Voice Transcribe wordt tegelijkertijd op drie platforms uitgebracht. De betaalde versie is de Meta Model API voor $3,00 per 1.000 audiominuten. De consumentenversie is Meta AI voor Mac, waarbij je door de Fn-toets ingedrukt te houden in elke applicatie kunt dicteren — Meta's antwoord op de ingebouwde dicteerfunctie van Apple en de meest zichtbare toepassing van het model in de praktijk op dag één. De ontwikkelaarsversie is Muse Code, Meta's codeeragent, waar spraakopdrachten multi-agent-sessies en refactoring-workflows aansturen. Eén model dat een dicteerfunctie en een codeeragent aandrijft, is de tot product gemaakte versie van het 'one streaming model, many surfaces'-verhaal.

Wat de prijs onderbiedt

Met $0,18 per audio-uur onderbiedt Muse Voice Transcribe de streamingtranscriptiesector qua lijstprijs. De vergelijkingsset zoals wij die bijhouden: Google's Gemini 3.5 Transcribe Live kost ongeveer $9 per 1.000 minuten, ElevenLabs' Scribe v2 Realtime staat vermeld op $6,50 per 1.000 minuten, Cartesia's Ink-2 op $4,00, en OpenAI's GPT Live Transcribe op $17,00. Dat zijn de door de leveranciers gepubliceerde cijfers, en verschillende van die modellen hebben onafhankelijk bewijs van nauwkeurigheid dat Muse nog niet heeft — prijsleiderschap op dag één is niet hetzelfde als een gevestigde ranglijst. Maar een streamingmodel met ingebouwde diarisatie en endpointing dat de markt betreedt tegen ongeveer een vijfde tot een tiende van de prijs van de bestaande streaming-API's is het soort getal dat hoe dan ook de verwachtingen bijstelt.

A generated price-comparison infographic titled 'Streaming transcription — list price per 1,000 minutes' showing Muse Voice Transcribe at $3.00 against Cartesia Ink-2 at $4.00, ElevenLabs Scribe v2 Realtime at $6.50, Gemini 3.5 Transcribe Live at $9.00, and GPT Live Transcribe at $17.00, with a footer noting these are vendor list prices as published in September 2026, and the OrcaRouter logo in the bottom-right corner.

De eerlijke kanttekeningen

Muse Voice Transcribe is propriëtair en de gewichten zijn niet gepubliceerd — de optie om het zelf te draaien bestaat niet, en er is geen open-gewichten-pad voor audit of fine-tuning. De nauwkeurigheidsclaim is van de lanceerdag en niet gereproduceerd. De 25 geverifieerde talen komen mogelijk niet overeen met het cijfer van 70+ 'getraind op' wat betreft dekking van laag-resource talen. En de diarisatie-benchmark, hoe veelbelovend ook, is een leveranciersmeting totdat een onafhankelijke run dit bevestigt. Voor teams die alleen nauwkeurige batchtranscriptie van vooraf opgenomen audio nodig hebben, bestaan er nog steeds goedkopere en beter gecontroleerde opties — de streaming-pitch gaat over realtime-interactie, niet over het verslaan van de batchtranscriptiewereld op kosten per audio-uur.

Wat nu te kijken

Vier dingen bepalen of deze lancering een moment of een trend wordt. {{1}}Ten eerste of de Artificial Analysis streaming-ranglijst Muse Voice Transcribe na onafhankelijke verificatie daadwerkelijk op #1 vermeldt — de claim van de lanceringsdag heeft een definitieve ranglijstvermelding nodig.{{/1}} {{2}}Ten tweede of de diarisatie van 20+ sprekers standhoudt bij echte, rumoerige vergaderingen.{{/2}} {{3}}Ten derde of Meta's Mac-dicteerinterface zich vertaalt naar adoptie van de API door ontwikkelaars.{{/3}} {{4}}Ten vierde hoe de gevestigde spelers op prijs reageren, want een streamingmodel met diarisatie en endpointing voor $0,18 per uur legt zichtbare druk op iedereen daarboven.{{/4}} Wanneer Meta het model openstelt voor aanvullende servicepartners, zou een doorgeefgateway zoals {{KEEP}}OrcaRouter{{/KEEP}} — die lijstprijzen van providers met 0% opslag doorstuurt — hetzelfde bedrag van $3,00 per 1.000 minuten tonen, zonder opslag van de wederverkoper, op de dag dat het beschikbaar komt. Tot die tijd is Meta's eigen API de enige plek om Muse Voice Transcribe aan te roepen.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube