
Muse Voice Transcribe: Metas strömmande tal-till-text-modell, förklarad
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 1009 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 195 tok/s
- OrcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- xAISpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
Muse Voice Transcribe är Metas strömmande tal-till-text-modell. Den körs på Meta Model API till $0.18 per timme ljud, under modell-id:t muse-voice-transcribe-1.0, och priset är detsamma oavsett om du strömmar ljud live eller skickar in en färdig inspelning. Det som gör den värd en referenssida snarare än en enkel priskoll är var arbetet utförs: talarattribution för fler än tjugo röster och detektering av talslut körs inuti igenkänningsmodellen, inte i en batchkörning som hängs på i slutet av strömmen. Den är enbart tal-till-text – Metas utvecklardokumentation säger det med lika många ord: den syntetiserar inte tal och den tillhandahåller inget API för tal-till-tal-konversation.
Det här är sidan en läsare landar på efter att ha sökt på modellens eget namn, så den är byggd för att vara det stabila svaret på två frågor – vad är den här modellen, och vad kostar en timme ljud – snarare än ett tillkännagivande. Ett datum hör till protokollet före allt annat, eftersom det är ett faktum om modellen och inte anledningen till att sidan finns: Meta Superintelligence Labs introducerade Muse Voice Transcribe den 1 september 2026, i det daterade tillkännagivandeinlägget Introducerar Muse Voice Transcribe – inlägget som en läsare fortfarande kan nå via Metas bloggindex, även om det inte längre svarar på sin egen URL. Allt nedan lästes på Metas egna sidor den 29 september 2026, främst modellsidan och API:ets dokumentation för tal-till-text och översikt. Där Meta inte publicerar någon siffra säger den här sidan det i stället för att ta till en proxy.
Vad det är, i Metas terminologi
Metas egen dokumentation inleder sin beskrivning rakt på sak: "Muse Voice Transcribe är Metas tal-till-text-modell på Meta Model API. Transkribera liveljud eller en befintlig inspelning, med detektering av talarturer, talaretiketter och ordförrådsbias." Översiktssidan komprimerar samma sak till en enda mening – strömmande talardiarisering, inbyggd ändpunktsdetektering och röstaktivitetsdetektering, kontextuell och nyckelordsbaserad bias, samt 25 utvärderade språk med kodväxling. Så resultatet är en enda transkriptionsström som bär tre etiketter samtidigt: orden, vem som talar och huruvida yttrandet är avslutat. Det är den kombination som de flesta produktionsstackar för närvarande sätter samman av en igenkännare plus en separat röstaktivitetsdetektor plus en separat diariseringsmodell, var och en med sin egen latensbudget.
Metas modellsida ramar in detta som ”konkurrenskraftig latens och noggrannhet vid strömmande transkribering med attribuering i realtid för 20+ talare”, och utvecklardokumentationen beskriver utdatafältet som ”Transkriptionstext med turspecifika tidsangivelser och valfria talaretiketter”. Två saker följer av detta, och båda är viktigare än inramningen:
• Det är en ljud-in-, text-ut-modell. Den är varken text-in eller text-ut, och Meta är tydliga med att den inte är en talgenerator.
• Det är först och främst en streamingmodell. Realtidsvägen är inte ett omslag runt filsökvägen; det är en WebSocket-session med egna händelser, lägen och begränsningar, som beskrivs nedan.
Vad en timmes ljud kostar
Metas modellsida för Muse Voice Transcribe anger priset som "Bygg med en enda modell för $0,18/timme", och dess specifikationstabell listar muse-voice-transcribe-1.0 till $0,18 per timme av ljud och $3,00 per 1 000 minuter. Det är två enhetsangivelser för en och samma avgift, och båda står tryckta på Metas egen sida i den version som lästes 2026-09-29. Utvecklardokumentationen anger samma avgift på ett tredje sätt: "Prissättningen är $0,18 per timme för bearbetat ljud." Ingen siffra på den här sidan är hämtad från en Meta-prissida, eftersom det inte finns någon läsbar Meta-prissida att läsa: dokumentationen länkar ut avgiften till en sida med "Prissättning och anropsgränser" som svarar Den här sidan är inte tillgänglig i den version som lästes 2026-09-29, så modellsidan är den auktoritativa källan för avgiften, och det är den enda som används här.
Faktureringsdetaljen finns i utvecklardokumentationen och är värd att känna till innan du dimensionerar en arbetsbelastning:
• Streaming och icke-streaming kostar samma sak. Det finns ingen extra kostnad för realtidsslutpunkten.
• Bearbetning med noll datalagring har samma pris som Standard-nivån, enligt dokumentationen – det är inte en tilläggsrad.
• Faktureringen avrundas nedåt till hela sekunder, så en tur på två sekunder debiteras som två sekunder och inte tre.
• Fel som inträffar innan en transkription har producerats faktureras inte, och inte heller 429-svar för hastighetsbegränsning.
• Gratiskrediter finns på plattformsnivå, inte på modellnivå. Metas dokumentation för tal-till-text avslutar sitt prisstycke med meningen ”Plattformens gratiskrediter gäller.” Det är den enda formuleringen som nämner något gratis på sidorna för den här modellen, och den är medvetet ospecifik: den pekar på ett plattformskreditsystem i stället för att utlova en gratiskvot för transkribering, och ingen siffra, varaktighet eller behörighetsregel anges för den. Läs det som en kredit som kan minska en räkning, inte som en gratisnivå för modellen. Metas konsumentvända uttalande att dess personliga agent är ”gratis för det mesta som människor behöver” är en separat mening om Muse-appen och gäller inte för Model API.
Genomräknat exempel, eftersom priset per timme är svårt att få grepp om: en två timmar lång inspelad intervju kostar 0,36 dollar att transkribera. Tusen timmar samtalsljud – ungefär den månatliga volymen för ett medelstort kontaktcenter – kostar 180 dollar. I den skalan är taxan hela argumentet, och en taxa är också det enda som kan förändras under fötterna på dig: Metas sida är auktoriteten för den, och om siffran ändras där, ändras den här.
Strömningsgränssnittet, slutpunkt för slutpunkt
This is the part a reference page owes a reader that a launch write-up cannot carry, so here it is in the order you meet it. Base URL for Model API is https://api.meta.ai/v1 with a Bearer token, and Muse Voice Transcribe adds two endpoints on top of it.
• Live-ljud — wss://api.meta.ai/v1/asr/realtime. Transporten är WebSocket, och autentiseringsdetaljen är en fälla: du autentiserar i handskakningsramen, och Authorization-huvudet ignoreras. Handskakningen måste vara den första JSON-textramen och måste anlända inom 10 sekunder. En session varar i upp till 60 minuter, en ny WebSocket skapar en ny session, och det finns ingen återupptagningstoken.
• Inspelningar — POST https://api.meta.ai/v1/asr/transcribe. Multipart-uppladdning, och den här verkligen autentiserar med Authorization-headern. Indata är snävt: endast mono 16-bitars PCM WAV vid 16 eller 24 kHz. Gränserna är 32 MB per body och 10 minuters ljud per begäran.
I realtidssessionen ändrar tre lägen vad du får. PUSH_TO_TALK är standard och utför transkribering av en enda tur. ENDPOINTING ger modellupptäckta turgränser, en tur per detekterat talsegment, och skickar ut speechStart, upprepade transcript, speechEnd och speechComplete-händelser – med varningen att speechEnd inte är transkriptet. DIARIZATION lägger till automatisk talaridentifiering och tillskrivning, och skickar ut speaker-händelser med etiketter som A och B. Partiella transkript kommer antingen kumulativt, där varje partiell ersätter den föregående, eller som deltan.
Två operativa detaljer i samma dokumentation är lätta att missa och dyra att upptäcka i produktion:
• Diarisering markerar en möjlig ny talare snarare än en tydlig slutpunkt för tal, och Meta uppger att den inte är optimerad för låg latens eller röststyrning. Behandla etiketterna som sessionsbundna identifierare — A i en session är inte samma person som A i nästa.
• Turer kan överlappa, så tillstånd per tur bör nycklas på turnidentifieraren snarare än på ankomstordningen.
De publicerade taken per tenant är 128 samtidiga strömmar och 16 000 strömmar per timme.
Vad som körs inuti modellen, och vad det ersätter
Metas modellsida gör ett specifikt påstående om arkitektur snarare än om poäng: ”Talartilldelning för 20+ talare och detektering av talslut sker inuti igenkänningsmodellen” – och den kontrasterar det uttryckligen mot en batchkörning i slutet av ljudströmmen. Den praktiska skillnaden är att det inte finns något andra steg att vänta på. Talaretiketter och turgränser anländer i samma ström som orden, så en nedströms röstagent eller en yta för direkttextning får en fullbordad tur och en identitet utan ett efterbearbetningssteg.
De andra förmågorna som Meta dokumenterar som befintliga i modellen:
• Inbyggd endpointing och röstaktivitetsdetektering, så att du inte kör din egen VAD framför API:et. Enligt dokumentationens formulering får du en fullständig transkription per yttrande utan att köra din egen röstaktivitetsdetektering, och ett detekterat talslut avslutar inte sessionen.
• Kontextuell och nyckelordsbaserad biasering, utan finjustering. Metas modellsida beskriver att noggrannheten bibehålls "genom kontextuell och nyckelordsbaserad biasering, utan finjustering", vilket är funktionen som gör strömmande ASR användbar för domänvokabulär – läkemedelsnamn, tickersymboler, produkt-SKU:er – snarare än för allmänspråkets genomsnitt. Dokumentationen är tydlig med begränsningarna: nyckelord biaserar igenkänningen men garanterar inte en exakt stavning, och både nyckelord och språkbias låses vid sessionens start.
• 25 utvärderade språk med kodväxling. Dokumentationen listar dem: arabiska, bengaliska, nederländska, engelska, franska, tyska, hebreiska, hindi, indonesiska, italienska, japanska, kannada, koreanska, malajiska, mandarinkinesiska, marathi, polska, portugisiska, spanska, tagalog, tamil, telugu, thailändska, turkiska och vietnamesiska. Kodväxling – mitt i meningar och yttranden utan att man får veta vilket språk som kommer – är den förmåga som enspråkiga igenkännare strukturellt sett inte kan erbjuda. Ett förbehåll värt att ta med sig: språkbias är en lista över språk, inte fritt formulerad kontext, och den tvingar inte modellen att använda dem.
Det daterade tillkännagivandeinlägget går längre: det säger att modellen tränades på 70+ språk, varav 25 ”extensivt verifierade” – enligt leverantörens uppgifter – och listan över de 25 verifierade är den delmängd Meta står bakom. Det är den täckningen man bör planera mot, inte de 70.
De dokumenterade gränserna
En referenssida är bara så bra som de begränsningar den anger, och Meta anger flera.
• Tidsstämplar på tur-nivå, inte på ordnivå.Både modellsidan och dokumentationen säger det rakt ut: "Den returnerar tidsstämplar på tur-nivå, men inte tidsstämplar på ordnivå." Turer har start- och sluttider i millisekunder. Om din produkt behöver klick-för-att-spola per ord – karaoke-markering, konfidensroutning per ord, tvingad alignering – är detta fel modell, och ingen mängd prompt engineering ändrar på det.
• Inga konfidenspoäng, ingen ljudhändelsedetektering, ingen känslodetektering, ingen omformatering av transkriptionen. Meta listar alla fyra som otillgängliga. Du får ord, turer, tidsangivelser och talaretiketter – och inget om hur säker modellen är.
• Ingen talsyntes och inget API för tal-till-tal-konversation. Det går bara i en riktning.
• Ljudformaten är begränsade i filsökvägen. Mono 16-bitars PCM WAV, 16 eller 24 kHz. Allt annat måste konverteras innan det laddas upp.
Öppna vikter och förvirringen kring Muse Glimmer
Muse Voice Transcribe är proprietärt och tillhandahålls via API:et – det är inte en släpp med öppna vikter, och Metas dokumentation påstår aldrig något annat. Detta spelar roll eftersom läsare kopplar Muse-familjens bana för öppna vikter till fel namn. Muse Glimmer är den vägen: Metas dokumentation beskriver den som en multimodal modell med öppna vikter destillerad från Muse Spark, distribuerad under en tillåtande Apache 2.0-licens, som du laddar ner och kör på din egen hårdvara via en runtime som vLLM, SGLang, llama.cpp eller ExecuTorch. Muse Voice Transcribe grupperas på samma sida tillsammans med Muse Spark, Muse Image och SAM som modeller du anropar i stället för att ladda ner.
Så: inga vikter för Muse Voice Transcribe, inget självhostat alternativ, ingen väg att granska eller finjustera den. Om en sida säger något annat har den sammanblandat den med Muse Glimmer. När en modells vikter inte publiceras är servingplattformen hela historien – och det är vad nästa avsnitt handlar om.
Hur en klient når den
Meta's Model API är byggt för att kunna läggas in direkt i klienter du redan har. Leverantörens påstående, som står på API:ets översiktssida, är att Model API "är drop-in-kompatibelt med de OpenAI-kompatibla och Anthropic-kompatibla klientbiblioteken, och med OpenAI-kompatibla agent-CLI:er. Ange klientens bas-URL, lägg till din nyckel och behåll resten av koden." För Model API i allmänhet erbjuds tre typer av förfrågningar – Responses API, Chat Completions API och Messages API – så en befintlig integration har vanligtvis en matchande yta utan att behöva skrivas om. En varning om omfattningen: den där kompatibilitetsmeningen och de tre typerna är funktioner hos Model API som helhet, inte rader som står på Muse Voice Transcribes egen modellsida. Modellsidans egen snabbstart är snävare – den säger bara att du ska "peka din befintliga OpenAI-kompatibla klient mot Meta Model API", och att du kommer att ha en första fungerande förfrågan på under fem minuter.
En ärlig lucka värd att påpeka på en referenssida: Metas dokumentation för den här modellen namnger inget officiellt klientbibliotek för Muse Voice Transcribe, och dess sida "Client libraries" ligger under SAM-avsnittet i stället för under Voice-avsnittet. Vad tal-till-text-guiden ger dig i stället är en konkret beroendelista — Python 3.9 eller senare med websockets- och sounddevice-paketen — plus en kokbok för voice-API:ets grunder. Så drop-in-påståendet beskriver Model API:s anropsyta i allmänhet; själva realtids-ASR-slutpunkten är en WebSocket med egna handskakningsregler och ingen dokumenterad wrapper.

Vad Meta inte har publicerat
En frånvarande benchmark är ett faktum om dokumentationen, så här anges det som ett. Metas modellsida för Muse Voice Transcribe innehåller ingen tryckt noggrannhetstabell: dess noggrannhetsbevis levereras som tre bildtillgångar — en resultattavla för ordfelsfrekvens vid strömning, en jämförelse av diariseringsfelfrekvens och ett strömningsnoggrannhetsindex — utan siffror i den extraherbara texten. Själva modellsidan ger ingen ordfelsfrekvens, ingen diariseringsfelfrekvens och ingen uppdelning per språk.
Inlägget med tillkännagivandet innehåller förvisso leverantörsrapporterade siffror, inklusive en ordningsfelkvot för strömning och en genomsnittlig diariseringsfelkvot, och det är de siffror vi sammanställde när modellen lanserades; de är Metas egna mätningar och har fortfarande inte reproducerats av någon tredje part. Den här sidan kör inte om den jämförelsen, eftersom att köra om ett leverantörsbenchmark från lanseringsdagen på en referenssida skulle framställa en icke reproducerad siffra som en fastställd sådan. Det som rent ut kan sägas är snävare: Meta publicerar ingen direkt jämförelse mot en namngiven konkurrent vid matchad ansträngning och matchad testrigg för den här modellen, så varje jämförelse du läser någonstans är en jämförelse av leverantörssiffror insamlade under olika förhållanden.
Ett datum förblir också avsiktligt inte fastställt. Modellsidan har inget utgivningsdatum alls — dess enda versionsmarkör är -1.0 i modell-id:t. Datumet 2026-09-01 i den här artikeln kommer från det daterade tillkännagivandeinlägget, och det används här för att datera modellen snarare än att rapportera en händelse.


Vem bör använda det, och vem bör inte
Argumentet för Muse Voice Transcribe är snävt och starkt: live-ljud där du behöver ord, talaridentitet och turslut i samma ström, till ett pris som är tillräckligt lågt för att köras kontinuerligt i stället för på begäran. Röstagenter, direkttextning, mötes- och samtalsintelligens, diktering och storskalig transkribering är de arbetsbelastningar som Meta nämner, och de är de arbetsbelastningar som gränssnittet faktiskt är utformat för – en WebSocket på 60 minuter med endpointing-lägen och sessionsbundna talaretiketter.
Argumentet mot det är lika specifikt. Om du behöver tidsstämplar på ordnivå, konfidens per ord, detektering av ljudhändelser eller känslor, eller omformatering av transkriptioner, saknar den här modellen dem, och det är en dokumenterad avsaknad snarare än en bugg. Om ditt ljud anländer i andra format än mono 16-bitars WAV vid 16 eller 24 kHz och du använder filslutpunkten, betalar du för ett konverteringssteg som du inte skulle betala någon annanstans. Och om ditt krav är batchtranskribering av arkiverade inspelningar där noggrannhet är den enda axeln, ger streamingargumentet dig ingenting — priset är detsamma på båda vägarna, så du betalar för realtidskapacitet som du inte kommer att använda.
Det enda du behöver kontrollera innan du binder dig vid en produktionsväg är siffran som den här sidan finns till för att besvara, och det är den enda siffran som kan ändras utan att modellen ändras överhuvudtaget: 0,18 dollar per timme ljud, precis som det står tryckt på Metas egen modellsida i dag. Metas sida är den auktoritativa källan för den. När den ändras, ändras allt som dimensionerats utifrån den – tusentimmarsmånaden, kostnaden per intervju, bygga-kontra-köpa-kalkylen – med den.
