Een gegenereerde titelkaart met als kop MODEL REFERENCE en de titel 'Muse Voice Transcribe' en de ondertitel 'Meta's streaming spraak-naar-tekst-model op Model API', boven vier afgeronde kaarten met de tekst '$0,18 per uur audio', 'Streaming WebSocket + file-endpoint', '25 geëvalueerde talen met code-switching' en 'Tijdstempels op beurtniveau, niet op woordniveau', met een voettekst met de tekst 'Bron: Meta's eigen modelpagina en documentatie, 2026-09-29.'
Guides & Insights

Muse Voice Transcribe: Meta's streaming spraak-naar-tekstmodel, uitgelegd

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Muse Voice Transcribe is Meta's streaming spraak-naar-tekst-model. Het draait op de Meta Model API voor $0,18 per uur audio, onder model-id muse-voice-transcribe-1.0, en de prijs is hetzelfde of je nu live audio streamt of een afgeronde opname aanlevert. Wat het een referentiepagina waard maakt in plaats van een prijscheck van één regel, is waar het werk gebeurt: sprekerattributie voor meer dan twintig stemmen en detectie van spraakeinde draaien in het herkenningsmodel zelf, niet in een batchronde die aan het einde van de stream wordt vastgeschroefd. Het is uitsluitend spraak-naar-tekst — de ontwikkelaarsdocumentatie van Meta zegt het met zoveel woorden: het synthetiseert geen spraak en biedt geen spraak-naar-spraak-conversatie-API.

Dit is de pagina waarop een lezer terechtkomt na het zoeken op de naam van het model zelf, dus is ze gebouwd als het stabiele antwoord op twee vragen — wat is dit model, en wat kost een uur audio — in plaats van als een aankondiging. Eén datum hoort vóór alles in het dossier, omdat het een feit over het model is en niet de reden dat de pagina bestaat: Meta Superintelligence Labs introduceerde Muse Voice Transcribe op 2026-09-01, in de gedateerde aankondigingspost Introductie van Muse Voice Transcribe — de post die een lezer nog via Meta's blogindex kan bereiken, hoewel die niet meer op de eigen URL antwoordt. Alles hieronder is op 2026-09-29 gelezen op Meta's eigen pagina's, voornamelijk de modelpagina en de spraak-naar-tekst- en overzichtsdocumentatie van de API. Waar Meta geen cijfer publiceert, vermeldt deze pagina dat in plaats van een proxy te gebruiken.

Wat het is, in termen van Meta

Meta's eigen documentatie opent de beschrijving ronduit: "Muse Voice Transcribe is Meta's spraak-naar-tekstmodel op de Meta Model API. Transcribeer live-audio of een bestaande opname, met detectie van spraakbeurten, sprekerslabels en biasing van vocabulaire." De overzichtspagina vat hetzelfde samen in één zin: streaming sprekersdiarisatie, native endpointing en spraakactiviteitsdetectie, contextuele en op trefwoorden gebaseerde biasing, en 25 geëvalueerde talen met code-switching. De uitvoer is dus één enkele transcriptiestroom die drie labels tegelijk draagt: de woorden, wie er spreekt, en of de uiting voltooid is. Dat is de combinatie die de meeste productiestacks momenteel samenstellen uit een recognizer plus een aparte spraakactiviteitsdetector plus een apart diarisatiemodel, elk met een eigen latencybudget.

Meta's modelpagina presenteert dit als "competitieve latentie en nauwkeurigheid van streamingtranscriptie met live-attributie voor 20+ sprekers", en de ontwikkelaarsdocumentatie beschrijft het uitvoerveld als "Transcripttekst met timing op beurtniveau en optionele sprekerlabels". Daaruit volgen twee dingen, en beide doen er meer toe dan de framing:

• Het is een audio-in-, tekst-uit-model. Het is geen tekst-in- en ook geen tekst-uit-model, en Meta stelt expliciet dat het geen spraakgenerator is.

• Het is in de eerste plaats een streamingmodel. Het realtime-pad is geen wrapper rond het bestandspad; het is een WebSocket-sessie met eigen gebeurtenissen, modi en limieten, die hieronder worden beschreven.

Wat een uur audio kost

De modelpagina van Meta voor Muse Voice Transcribe geeft de prijs aan als "Bouw met één model voor $0,18/uur", en de specificatietabel ervan bevat muse-voice-transcribe-1.0 tegen $0,18 per uur audio en $3,00 per 1.000 minuten. Dat zijn twee manieren om één tarief in eenheden uit te drukken, en beide staan op de eigen pagina van Meta zoals gelezen op 2026-09-29. De ontwikkelaarsdocumentatie vermeldt hetzelfde tarief op een derde manier: "Prijsstelling is $0,18 per uur verwerkte audio." Geen enkel cijfer op deze pagina is overgenomen van een Meta-prijzenpagina, want er is geen leesbare Meta-prijzenpagina om te lezen: de documentatie verwijst voor het tarief naar een pagina "Prijzen en limieten" die antwoordt Deze pagina is niet beschikbaar zoals gelezen op 2026-09-29, dus de modelpagina is de gezaghebbende bron voor het tarief, en die is de enige die hier wordt gebruikt.

Het factureringsdetail staat in de ontwikkelaarsdocumentatie en is goed om te weten voordat je de grootte van een workload bepaalt:

• Streaming en niet-streaming kosten hetzelfde. Er geldt geen toeslag voor het realtime-endpoint.

• Verwerking met zero-dataretentie is geprijsd op hetzelfde niveau als de Standard-tier, volgens de documentatie — het is geen toeslagregel.

• Facturering rondt naar beneden af op hele seconden, dus een beurt van twee seconden wordt gefactureerd als twee seconden en niet als drie.

• Storingen die optreden voordat een transcript wordt geproduceerd, worden niet gefactureerd, en evenmin 429 rate-limitreacties.

• Gratis tegoeden bestaan op platformniveau, niet op modelniveau. Meta's documentatie over spraak-naar-tekst eindigt de prijsalinea met de zin "Tegoeden voor de gratis laag van het platform zijn van toepassing." Dat is de enige bewoording over iets gratis op de pagina's voor dit model, en die is bewust niet-specifiek: het verwijst naar een tegoedregeling op platformniveau in plaats van een gratis tegoed voor transcriptie te beloven, en er wordt geen bedrag, duur of geschiktheidsregel voor vermeld. Zie het als een tegoed dat een factuur kan verlagen, niet als een gratis laag voor het model. Meta's verklaring aan consumenten dat zijn persoonlijke agent "gratis is voor het meeste wat mensen nodig hebben" is een aparte zin over de Muse-app en geldt niet voor Model API.

Uitgewerkt voorbeeld, want per uur is moeilijk te bevatten: een opgenomen interview van twee uur kost $0,36 aan transcriptie. Duizend uur aan gespreksaudio — ruwweg het maandelijkse volume van een middelgroot contactcenter — kost $180. Op die schaal is het tarief het hele argument, en een tarief is ook precies het enige dat onder je vandaan kan schuiven: Meta's pagina is op dat punt de autoriteit, en als het cijfer daar verandert, verandert het hier.

De streaming-interface, endpoint voor endpoint

This is the part a reference page owes a reader that a launch write-up cannot carry, so here it is in the order you meet it. Base URL for Model API is https://api.meta.ai/v1 with a Bearer token, and Muse Voice Transcribe adds two endpoints on top of it.

• Live audio — wss://api.meta.ai/v1/asr/realtime. Het transport is WebSocket, en het authenticatiedetail is een valkuil: je authenticeert in het handshake-frame, en de Authorization-header wordt genegeerd. De handshake moet het eerste JSON-tekstframe zijn en moet binnen 10 seconden aankomen. Een sessie duurt maximaal 60 minuten, een nieuwe WebSocket creëert een nieuwe sessie, en er is geen resume-token.

• Opnamen — POST https://api.meta.ai/v1/asr/transcribe. Multipart-upload, en deze verifieert wél met de Authorization-header. De invoer is beperkt: alleen mono 16-bits PCM WAV op 16 of 24 kHz. Maxima zijn 32 MB per body en 10 minuten audio per verzoek.

Binnen de realtime-sessie veranderen drie modi wat je aangereikt krijgt. PUSH_TO_TALK is de standaard en doet transcriptie van één beurt. ENDPOINTING geeft door het model gedetecteerde beurtgrenzen, één beurt per gedetecteerd spraaksegment, en genereert speechStart, herhaald transcript, speechEnd en speechComplete gebeurtenissen — met de waarschuwing dat speechEnd niet de transcriptie is. DIARIZATION voegt automatische sprekerdetectie en -toewijzing toe, en genereert speaker-gebeurtenissen met labels zoals A en B. Partiële transcripties zijn ofwel cumulatief, waarbij elke partiële transcriptie de vorige vervangt, ofwel als delta's.

Twee operationele details uit dezelfde documentatie zijn gemakkelijk te missen en duur om in productie te ontdekken:

• Diarisatie markeert een mogelijke nieuwe spreker in plaats van een schoon spraakeindpunt, en Meta verklaart dat het niet is afgestemd op gebruik met lage latentie voor spraakopdrachten. Behandel de labels als sessiegebonden identifiers — A in de ene sessie is niet dezelfde persoon als A in de volgende.

• Beurten kunnen elkaar overlappen, dus de status per beurt moet worden gekoppeld aan de beurtidentificatie in plaats van aan de volgorde van binnenkomst.

• De gepubliceerde limieten per tenant zijn 128 gelijktijdige streams en 16.000 streams per uur.

Wat er in het model draait, en wat het vervangt

De modelpagina van Meta doet een specifieke bewering over architectuur in plaats van over scores: "Sprekertoewijzing voor 20+ sprekers en detectie van spraakeinde vinden plaats in het herkenningsmodel" — en contrasteert dat expliciet met een batchpass aan het einde van de audiostream. Het praktische verschil is dat er geen tweede fase is om op te wachten. Sprekerslabels en beurtgrenzen komen binnen op dezelfde stream als de woorden, zodat een downstream voice-agent of live-ondertitelingsinterface een voltooide beurt en een identiteit krijgt zonder een nabewerkingsstap.

De andere capaciteiten die Meta documenteert als zijnde aanwezig in het model:

• Native endpointing en spraakactiviteitsdetectie, zodat je niet je eigen VAD voor de API draait. In de bewoording van de documentatie krijg je één voltooid transcript per uiting zonder je eigen spraakactiviteitsdetectie te draaien, en een gedetecteerd einde van spraak beëindigt de sessie niet.

• Contextuele en trefwoordbias, zonder fine-tuning. Op de modelpagina van Meta staat dat de nauwkeurigheid "door contextuele en trefwoordbias, zonder fine-tuning" behouden blijft, wat de functie is die streaming-ASR bruikbaar maakt voor domeinwoordenschat — medicijnnamen, tickersymbolen, product-SKU's — in plaats van voor het gemiddelde van de algemene taal. De documentatie is nauwkeurig over de beperkingen: trefwoorden beïnvloeden de herkenning, maar garanderen geen exacte spelling, en zowel trefwoorden als taalbias worden bij de start van de sessie vastgezet.

• 25 geëvalueerde talen met codewisseling. De documentatie somt ze op: Arabisch, Bengaals, Nederlands, Engels, Frans, Duits, Hebreeuws, Hindi, Indonesisch, Italiaans, Japans, Kannada, Koreaans, Maleis, Mandarijn Chinees, Marathi, Pools, Portugees, Spaans, Tagalog, Tamil, Telugu, Thai, Turks en Vietnamees. Codewisseling — midden in een zin en midden in een uiting, zonder te weten welke taal eraan komt — is de capaciteit die eentalige herkenners structureel niet kunnen bieden. Eén voorbehoud om in gedachten te houden: taalbias is een lijst met talen, geen vrije context, en het dwingt het model niet om ze te gebruiken.

De gedateerde aankondigingspost gaat verder: er staat dat het model is getraind op 70+ talen, waarvan 25 "uitgebreid geverifieerd" — volgens de leverancier, en de lijst van 25 geverifieerde talen is de subset waar Meta achter staat. Dat is de dekking waarop je moet plannen, niet de 70.

De gedocumenteerde limieten

Een referentiepagina is slechts zo goed als de beperkingen die erop staan, en Meta vermeldt er verschillende.

• Timestamps op beurtniveau, niet op woordniveau.Zowel de modelpagina als de documentatie zegt het ronduit: "Het retourneert timestamps op beurtniveau, maar niet op woordniveau." Beurten bevatten start- en eindtijden in milliseconden. Als je product per woord klik-naar-seek nodig heeft — karaoke-highlighting, confidence-routing per woord, forced alignment — dan is dit het verkeerde model, en geen enkele hoeveelheid prompt engineering verandert dat.

• Geen betrouwbaarheidsscores, geen detectie van geluidsgebeurtenissen, geen emotiedetectie, geen herformattering van transcripties. Meta vermeldt alle vier als niet beschikbaar. Je krijgt woorden, beurten, timingen en sprekerlabels, en niets over hoe zeker het model is.

• Geen spraaksynthese en geen spraak-naar-spraak-conversatie-API. Het is slechts één richting.

• Audioformaten zijn beperkt voor het bestandspad. Mono 16-bit PCM WAV, 16 of 24 kHz. Al het andere moet worden geconverteerd voordat het wordt geüpload.

Open weights, en de Muse Glimmer-verwarring

Muse Voice Transcribe is propriëtair en wordt via de API aangeboden — het is geen open-weightrelease, en de documentatie van Meta beweert nooit het tegendeel. Dit is belangrijk omdat lezers het open-weightpad van de Muse-familie aan de verkeerde naam koppelen. Muse Glimmer is dat pad: de documentatie van Meta beschrijft het als een open-weight multimodaal model dat uit Muse Spark is gedistilleerd, verspreid onder een permissieve Apache 2.0-licentie, dat je downloadt en op je eigen hardware draait via een runtime zoals vLLM, SGLang, llama.cpp of ExecuTorch. Muse Voice Transcribe staat op dezelfde pagina samen met Muse Spark, Muse Image en SAM gegroepeerd als modellen die je aanroept in plaats van downloadt.

Dus: geen gewichten voor Muse Voice Transcribe, geen self-hosted optie, geen mogelijkheid om het te auditen of fine-tunen. Als een pagina je iets anders vertelt, verwart die het met Muse Glimmer. Wanneer de gewichten van een model niet worden gepubliceerd, is het serverplatform het hele verhaal — en daarover gaat de volgende sectie.

Hoe een klant het bereikt

Meta's Model API is gebouwd om te worden ingezet in clients die u al hebt. De bewering van de leverancier, die op de overzichtspagina van de API staat, is dat Model API "drop-in compatibel is met de OpenAI-compatibele en Anthropic-compatibele clientbibliotheken, en met OpenAI-compatibele agent-CLI's. Stel de basis-URL van uw client in, voeg uw sleutel toe en behoud de rest van uw code." In het algemeen biedt Model API drie verzoekvormen — de Responses API, de Chat Completions API en de Messages API — zodat een bestaande integratie meestal een overeenkomstig oppervlak heeft zonder dat u iets hoeft te herschrijven. Eén waarschuwing over de reikwijdte: die bewering over compatibiliteit en die drie vormen zijn mogelijkheden van Model API als geheel, niet regels die op de eigen modelpagina van Muse Voice Transcribe staan. De eigen quickstart van de modelpagina is beperkter — er staat alleen dat u "uw bestaande OpenAI-compatibele client naar Meta Model API laat wijzen", en dat u binnen vijf minuten een eerste werkend verzoek hebt.

Eén oprechte leemte die het vermelden waard is op een referentiepagina: Meta's documentatie voor dit model noemt geen officiële clientbibliotheek voor Muse Voice Transcribe, en de pagina "Client libraries" staat onder de SAM-sectie in plaats van de Voice-sectie. Wat de spraak-naar-tekstgids je in plaats daarvan biedt, is een concrete lijst met afhankelijkheden — Python 3.9 of nieuwer met de websockets- en sounddevice-pakketten — plus een cookbook met de basisprincipes van de voice-API. Dus de drop-inclaim beschrijft het requestoppervlak van Model API in het algemeen; het realtime-ASR-endpoint zelf is een WebSocket met zijn eigen handshake-regels en geen gedocumenteerde wrapper.

A screenshot of Meta's model page for Muse Voice Transcribe (captured 2026-09-29), showing the headline 'Competitive latency and streaming transcription accuracy with live attribution for 20+ speakers. Build with a single model at $0.18/hour.', a 'Meet Muse Voice Transcribe' panel of capability cards headed 'Competitive transcription accuracy', 'Live speaker and turn awareness' and 'Production pricing', a 'Muse Voice Transcribe benchmarks' section labelled 'AA-WER Streaming Index - Final Transcription Diarization' with 3.9% and 3.9%, and the pricing row reading muse-voice-transcribe-1.0 at $3.00 per 1,000 minutes and $0.18 per hour.

Wat Meta niet heeft gepubliceerd

Een ontbrekende benchmark is een feit over de documentatie, dus hier wordt het als zodanig vermeld. De modelpagina van Meta voor Muse Voice Transcribe bevat geen gedrukte nauwkeurigheidstabel: het nauwkeurigheidsbewijs wordt geleverd in de vorm van drie afbeeldingsassets — een streaming leaderboard voor woordfoutpercentage, een vergelijking van diarisatiefoutpercentages en een streaming-nauwkeurigheidsindex — zonder cijfers in de extraheerbare tekst. De modelpagina zelf geeft geen woordfoutpercentage, geen diarisatiefoutpercentage en geen uitsplitsing per taal.

Het aankondigingsbericht bevat wel degelijk door de leverancier gerapporteerde cijfers, waaronder een streaming-woordfoutpercentage en een gemiddeld diarisatiefoutpercentage, en dat zijn de cijfers die we hebben opgetekend toen het model werd gelanceerd; het zijn de eigen metingen van Meta en ze zijn nog steeds niet door een derde partij gereproduceerd. Deze pagina voert die vergelijking niet opnieuw uit, want het opnieuw uitvoeren van een leveranciersbenchmark van de releasedatum op een referentiepagina zou een niet-gereproduceerd cijfer als een vaststaand cijfer presenteren. Wat ronduit gezegd kan worden, is beperkter: Meta publiceert geen rechtstreekse evaluatie tegen een met naam genoemde concurrent bij gelijke inspanning en gelijke evaluatieopzet voor dit model, dus elke vergelijking die u ergens leest, is een vergelijking van leverancierscijfers die onder verschillende omstandigheden zijn verzameld.

Eén datum blijft ook bewust niet vastgesteld. De modelpagina bevat helemaal geen releasedatum — de enige versiemarkering is de -1.0 in de model-id. De datum 2026-09-01 in dit stuk komt uit die gedateerde aankondigingspost, en wordt hier gebruikt om het model te dateren in plaats van om een gebeurtenis te melden.

A generated reference scoreboard titled 'Muse Voice Transcribe — the reference', listing six rows for the model: price $0.18 per hour of audio, interface as a realtime WebSocket at wss://api.meta.ai/v1/asr/realtime plus a file endpoint, speaker attribution for 20+ speakers inside the recognition model, turn-level timestamps without word-level times, 25 evaluated languages with code-switching, and proprietary weights with no open download.A screenshot of the Speech to text page in Meta's Model API documentation (captured 2026-09-29), showing the opening sentence 'Muse Voice Transcribe is Meta's speech-to-text model on Meta Model API', an 'Available endpoints' table contrasting wss://api.meta.ai/v1/asr/realtime for live audio against POST https://api.meta.ai/v1/asr/transcribe for a recording and noting that the Authorization header is ignored on the WebSocket, and a Features table whose rows include language biasing across 25 supported languages with code-switching, vocabulary biasing, speech-turn detection, speaker labels, partial transcripts and progress events.

Voor wie is het bedoeld, en voor wie niet

Het pleidooi voor Muse Voice Transcribe is beperkt en krachtig: live-audio waarbij je woorden, sprekeridentiteit en beurteindes op dezelfde stream nodig hebt, tegen een prijs die laag genoeg is om continu te draaien in plaats van op aanvraag. Voice agents, live ondertiteling, vergader- en gespreksintelligentie, dictatie en transcriptie met hoog volume zijn de workloads die Meta noemt, en het zijn de workloads waarvoor de interface daadwerkelijk is ingericht — een WebSocket van 60 minuten met endpointing-modi en sprekerlabels per sessie.

Het tegenargument is even specifiek. Als je tijdstempels op woordniveau, betrouwbaarheid per woord, detectie van geluidsgebeurtenissen of emoties, of herformattering van transcripten nodig hebt, dan heeft dit model die niet, en dat is een gedocumenteerd ontbreken in plaats van een bug. Als je audio binnenkomt in andere formaten dan mono 16-bit WAV met 16 of 24 kHz en je gebruikt het bestandseindpunt, betaal je een conversiestap die je elders niet zou betalen. En als je vereiste batchtranscriptie is van gearchiveerde opnamen waarbij nauwkeurigheid de enige as is, levert het streamingverhaal je niets op — de prijs is op beide paden hetzelfde, dus je betaalt voor realtimecapaciteit die je niet zult gebruiken.

Het enige dat je moet controleren voordat je een productiepad vastlegt, is het cijfer waarop deze pagina antwoord wil geven, en het is het enige cijfer dat kan veranderen zonder dat het model zelf ook maar enigszins verandert: $0,18 per uur audio, zoals vandaag op Meta's eigen modelpagina staat. Meta's pagina is daarin de autoriteit. Als dat cijfer verschuift, verschuift alles wat erop is gebaseerd — de maand van duizend uur, de kosten per interview, de rekensom bouwen versus kopen — mee.