Hero-titelkort för Muse Voice Transcribe, Meta Superintelligence Labs första realtidsmodell för ljudperception, som visar en strömmande vågform där ASR, talardiarisering för 20+ talare och endpointing är märkta, samt en prisbricka som anger 0,18 USD per ljudtimme.
Guides & Insights

Muse Voice Transcribe är live: Metas första realtidsmodell för ljudperception

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Muse Voice Transcribe, den första realtidsmodellen för ljuduppfattning från Meta Superintelligence Labs, lanserades den 1 september 2026 och är prissatt som en spoiler: 3,00 USD per 1 000 minuter ljud – cirka 0,18 USD i timmen – via Meta Model API. I ett enda strömmande steg gör den vad de flesta transkriptionsstackar delar upp mellan tre system: automatisk taligenkänning, talardiarisering över fler än 20 röster och endpointing – uppgiften att avgöra när en talare faktiskt har slutat prata snarare än pausat mitt i en tanke. Meta uppger att modellen toppar Artificial Analysis leaderboard för strömmande tal-till-text med en ordfelsfrekvens på 3,1 % på slutliga transkript, levererade 0,16 sekunder efter att talaren slutat prata.

Den sista siffran behöver sin ärliga etikett innan den gör något arbete: den är Metas lanseringsdagspåstående, som pekar på en oberoende topplista, för en modell som hade kunnat anropas i mindre än en dag när tillkännagivandet kom ut. Ingen utanför labbet har reproducerat 3,1 % ännu, och noggrannhetspåståendet är en sak medan resten av säljsnacket — 70+ tränade språk, inbyggd kodväxling, förstärkningsinlärd "adaptiv fördröjning" — är en separat uppsättning leverantörsuttalanden i samma båt. Allt i detta inlägg är modellens tillstånd på dag ett, med leverantörssiffror märkta som leverantörssiffror.

Siffrorna som spelar roll från dag ett.

• Pris — 3,00 USD per 1 000 ljudminuter (cirka 0,18 USD per ljudtimme) på Meta Model API, vilket undercutar alla större streaming-transkriptions-API:er vi spårar.

• Noggrannhetspåstående — 3,1 % WER på slutgiltiga transkript 0,16 sekunder efter talets slut; 3,6 % WER på första partiella transkript 0,13 sekunder. Leverantörsrapporterat, med hänvisning till Artificial Analysis streaming-ledartavla.

• Diarisering — 20+ talare, strömmas ut utan separat efterbehandlingssteg (Meta rapporterar en genomsnittlig diariseringsfelfrekvens på 17,5%).

• Språk — tränad på 70+; 25 "omfattande verifierade" vid lansering; sömlös kodväxling inom och mellan meningar.

• {{1}}Context{{/1}} — {{2}}hanterar ljud längre än en timme; språk-, nyckelords- och kontextanpassning för jargongtunga domäner.{{/2}}

A screenshot of the Meta AI Research announcement post for Muse Voice Transcribe (captured September 2, 2026), showing the headline 'Introducing Muse Voice Transcribe', the September 1, 2026 publication date, and an interactive real-time transcription demo at the top of the page.

Vad 'auditiv perceptionsmodell' betyder här

Arkitekturen är berättelsen. Muse Voice Transcribe tar emot ljud i block på 80 millisekunder och strömmar ut ord när de stabiliseras, vilket är vad "realtid" innebär i praktiken. Det intressanta är hur den beslutar när ett ord ska fastställas. Istället för en fast latensbudget — den vanliga avvägningen där en igenkännare antingen fastställer tidigt och gissar eller väntar längre och garderar sig — använder modellen det Meta kallar "adaptiv fördröjning": den rör sig snabbt genom enkelt tal och håller kvar mer ljudkontext för ord den är mindre säker på. Själva fördröjningspolicyn lärdes in genom förstärkningsinlärning, så modellen balanserar i praktiken hastighet och noggrannhet per ord istället för att tillämpa en global inställning.

Den distinktionen är anledningen till att Meta kallar Muse Voice Transcribe för en ”ljudperceptionsmodell” snarare än en ASR-modell. Utströmmen är ett enda live-transkript som även förmedlar vem som talar och när yttrandet är avslutat — tre etiketter som strömmande system vanligtvis sätter samman genom att koppla en taligenkännare till en röstaktivitetsdetektor och en diariseringsmodell, där var och en tillför sin egen latens och sina egna felmoder.

A screenshot of the Artificial Analysis Speech to Text leaderboard showing the WER Index (non-streaming), Speed Factor, Streaming, and Price in USD per 1,000 minutes of audio sections.

Diarisering och endpointing, inbyggt

Talardiarisering är den del som mest förtjänar att granskas, eftersom det är den funktion där streamingprodukter oftast överdriver. Meta säger att modellen separerar 20+ talare i en enda inspelning och rapporterar en genomsnittlig diariseringsfelfrekvens på 17,5 %, vilket de ställer mot ett intervall på 21,1–28,6 % som de tillskriver konkurrerande system. Båda siffrorna är publicerade av leverantören på lanseringsdagen, och ingen oberoende utvärdering har bekräftat 17,5 % ännu. Det som är strukturellt verkligt är att diariseringen körs i samma streaming-pass som taligenkänningen – det finns inget andra steg som ”ladda upp ljudet, vänta, få tillbaka talarna”, vilket är det designval som överhuvudtaget gör spårning av 20+ talare rimlig i ett live-sammanhang.

Endpointing är den mer lågmälda funktionen och utan tvekan den mest användbara. Transkriptions-API:er som exponerar rå strömmande ASR tvingar anroparen att själv implementera detektering av yttrandeslut, vilket är anledningen till att röstassistenter så ofta avbryter människor eller lämnar tomma tystnader. Muse Voice Transcribe avgör när en tur är avslutad och skickar ut den gränsen som en del av strömmen, så att en applikation får en tydlig "talaren är klar"-signal utan att bygga ett VAD-lager.

Det flerspråkiga påståendet, läs noga.

Meta tränade modellen på 70+ språk men validerar 25 vid lansering. Det är två olika saker: "tränad på" betyder att datan inkluderade dem; "utförligt verifierad" är delmängden Meta faktiskt står bakom med interna tester. För produktionsanvändning är den 25-verifierade listan den verkliga täckningen, och gapet mellan 70 och 25 är värt att känna till innan du skickar 40 språk genom den. Det som verkligen är ovanligt är språkväxlingshistorien – modellen är designad för att växla språk mitt i en mening och mitt i ett yttrande utan att bli tillsagd, vilket är en verklig smärtpunkt i flerspråkiga regioner och något de flesta enspråkiga ASR-produkter helt enkelt inte kan göra. Språk-, nyckelords- och kontextbias avrundar anpassningsbilden: du kan styra igenkänningen mot en domänspecifik vokabulär, vilket är funktionen som gör strömmande ASR användbart i vård-, juridik- och supportköer.

Tre ytor, en modell

Muse Voice Transcribe lanseras på tre ytor samtidigt. Den betalda versionen är Meta Model API för 3,00 USD per 1 000 ljudminuter. Konsumentversionen är Meta AI för Mac, där man håller ned Fn-tangenten för att diktera i valfritt program – Metas svar på Apples inbyggda diktamen, och den mest synliga verkliga driftsättningen av modellen på dag ett. Utvecklarvarianten är Muse Code, Metas kodningsagent, där röstkommandon styr multiagentsessioner och refaktoriseringsflöden. En modell som driver en diktamenfunktion och en kodningsagent är den produktifierade versionen av konceptet "en strömmande modell, många ytor".

Vad priset underbjuder

Till 0,18 dollar per ljudtimme underbjuder Muse Voice Transcribe de strömmande transkriptionstjänsterna vad gäller listpris. Den jämförelseuppsättning vi följer: Googles Gemini 3.5 Transcribe Live kostar ungefär 9 dollar per 1 000 minuter, ElevenLabs Scribe v2 Realtime har listpriset 6,50 dollar per 1 000 minuter, Cartesias Ink-2 4,00 dollar och OpenAIs GPT Live Transcribe 17,00 dollar. Det är leverantörernas publicerade siffror, och flera av dessa modeller har oberoende bevis för noggrannhet som Muse ännu saknar – prisledarskap på dag ett är inte detsamma som en fastställd topplista. Men en strömmande modell med inbyggd diarisering och slutpunktsdetektering som kommer in till ungefär en femtedel till en tiondel av priset för de befintliga strömmande API:erna är den typen av siffra som återställer förväntningarna oavsett.

A generated price-comparison infographic titled 'Streaming transcription — list price per 1,000 minutes' showing Muse Voice Transcribe at $3.00 against Cartesia Ink-2 at $4.00, ElevenLabs Scribe v2 Realtime at $6.50, Gemini 3.5 Transcribe Live at $9.00, and GPT Live Transcribe at $17.00, with a footer noting these are vendor list prices as published in September 2026, and the OrcaRouter logo in the bottom-right corner.

De ärliga varningarna

Muse Voice Transcribe är proprietär, och vikterna är inte publicerade – alternativet "kör det själv" finns inte, och det finns ingen öppen väg med vikter för granskning eller finjustering. Noggrannhetsanspråket är från lanseringsdagen och ej reproducerat. De 25 verifierade språken kanske inte matchar siffran på 70+ "tränade på" för täckning av lågresursspråk. Och diariseringsriktmärket, hur lovande det än är, är en leverantörsmätning tills en oberoende körning bekräftar det. För team vars enda krav är korrekt batchtranskribering av förinspelat ljud finns fortfarande billigare och bättre granskade alternativ – streamingargumentet handlar om realtidsinteraktion, inte om att slå batchtranskriberingsvärlden på kostnad per ljudtimme.

Vad du ska titta på härnäst

Fyra saker avgör om den här lanseringen blir ett ögonblick eller en trend. För det första, huruvida Artificial Analysis streaming-topplista faktiskt listar {{1}}Muse Voice Transcribe{{/1}} på #1 efter oberoende verifiering — lanseringsdagens påstående behöver en fastställd listplacering. För det andra, huruvida diarisering av 20+ talare överlever kontakt med verkliga, stökiga möten. För det tredje, huruvida {{2}}Metas Mac-dikteringsyta{{/2}} leder till att utvecklare använder API:et. För det fjärde, hur de etablerade aktörerna svarar på priset, eftersom en strömmande modell med diarisering och endpointing för 0,18 dollar i timmen sätter synlig press på alla som ligger över. När Meta öppnar modellen för ytterligare serving-partners skulle en pass-through-gateway som {{3}}OrcaRouter{{/3}} — som vidarebefordrar leverantörernas listpriser med 0 % påslag — visa samma siffra på 3,00 dollar per 1 000 minuter utan återförsäljarpåslag, den dag den landar. Till dess kan {{4}}Muse Voice Transcribe{{/4}} endast anropas via Metas eget API.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube