Wygenerowana karta tytułowa z nagłówkiem ODNIESIENIE MODELU, tytułem „Muse Voice Transcribe” i podtytułem „Strumieniowy model zamiany mowy na tekst Meta w Model API”, nad czterema zaokrąglonymi kartami o treści „0,18 USD za godzinę audio”, „Strumieniowy WebSocket + punkt końcowy plików”, „25 ocenianych języków z przełączaniem kodu” i „Znaczniki czasu na poziomie tur, nie na poziomie słów”, ze stopką o treści „Źródło: własna strona modelu Meta i dokumentacja, 29.09.2026”.
Guides & Insights

Muse Voice Transcribe: wyjaśnienie strumieniowego modelu zamiany mowy na tekst od Meta

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Muse Voice Transcribe to strumieniowy model zamiany mowy na tekst firmy Meta. Działa w Meta Model API za 0,18 USD za godzinę dźwięku, pod identyfikatorem modelu muse-voice-transcribe-1.0, a cena jest taka sama niezależnie od tego, czy przesyłasz dźwięk na żywo, czy przekazujesz gotowe nagranie. To, co czyni go wartym osobnej strony referencyjnej, a nie jednolinijkowego sprawdzenia ceny, to miejsce, w którym odbywa się praca: przypisywanie mówców dla ponad dwudziestu głosów i wykrywanie końca wypowiedzi działają wewnątrz modelu rozpoznawania, a nie w przebiegu wsadowym doklejonym na końcu strumienia. To wyłącznie zamiana mowy na tekst — dokumentacja dla programistów Meta mówi to wprost: model nie syntezuje mowy i nie udostępnia interfejsu API konwersacji mowa-do-mowy.

To jest strona, na którą trafia czytelnik po wyszukaniu nazwy samego modelu, więc pomyślano ją jako stabilną odpowiedź na dwa pytania — czym jest ten model i ile kosztuje godzina dźwięku — a nie jako ogłoszenie. Jedna data powinna trafić do zapisu przed wszystkim innym, ponieważ jest faktem o modelu, a nie powodem, dla którego ta strona istnieje: Meta Superintelligence Labs wprowadziło Muse Voice Transcribe w dniu 2026-09-01, w datowanym poście ogłaszającym Przedstawiamy Muse Voice Transcribe — poście, do którego czytelnik wciąż może dotrzeć przez indeks bloga Meta, choć nie odpowiada już pod własnym adresem URL. Wszystko poniżej odczytano na własnych stronach Meta w dniu 29 września 2026 r., głównie na stronie modelu oraz w dokumentacji API dotyczącej zamiany mowy na tekst i w dokumentacji przeglądowej. Tam, gdzie Meta nie podaje żadnej liczby, strona ta mówi o tym wprost, zamiast sięgać po dane zastępcze.

Czym to jest, w terminologii Meta

Własna dokumentacja Meta rozpoczyna opis wprost: „Muse Voice Transcribe to model zamiany mowy na tekst Meta w Meta Model API. Transkrybuj dźwięk na żywo lub istniejące nagranie, z wykrywaniem tur mówienia, etykietami mówców i faworyzowaniem słownictwa”. Strona przeglądu sprowadza to samo do jednego zdania — strumieniowa diaryzacja mówców, natywne wykrywanie końca wypowiedzi i wykrywanie aktywności głosowej, faworyzowanie kontekstowe i słów kluczowych oraz 25 ocenianych języków z przełączaniem kodu. Wynikiem jest więc pojedynczy strumień transkrypcji niosący jednocześnie trzy etykiety: słowa, kto mówi i czy wypowiedź została zakończona. To właśnie kombinacja, którą większość produkcyjnych stosów obecnie składa z rozpoznawacza oraz osobnego detektora aktywności głosowej i osobnego modelu diaryzacji, z których każdy ma własny budżet opóźnień.

Strona modelu Meta przedstawia to jako „konkurencyjną latencję i dokładność transkrypcji strumieniowej z przypisywaniem mówców na żywo dla ponad 20 osób”, a dokumentacja dla programistów opisuje pole wyjściowe jako „Tekst transkrypcji z chronometrażem na poziomie tur i opcjonalnymi etykietami mówców”. Wynikają z tego dwie rzeczy — i obie mają większe znaczenie niż samo przedstawienie:

• Jest to model o wejściu audio i wyjściu tekstowym. Nie jest to model ani z wejściem tekstowym, ani z wyjściem tekstowym, a Meta jednoznacznie stwierdza, że nie jest to generator mowy.

• To przede wszystkim model strumieniowy. Ścieżka czasu rzeczywistego nie jest opakowaniem wokół ścieżki plikowej; to sesja WebSocket z własnymi zdarzeniami, trybami i limitami, opisanymi poniżej.

Ile kosztuje godzina audio

Strona modelu Muse Voice Transcribe w serwisie Meta podaje cenę jako „Buduj z użyciem jednego modelu w cenie $0.18 za godzinę", a jej tabela specyfikacji wymienia muse-voice-transcribe-1.0 w cenie $0.18 za godzinę dźwięku i $3.00 za 1000 minut. To dwa ujęcia tej samej stawki w różnych jednostkach i oba są wydrukowane na własnej stronie Meta według stanu na 29.09.2026 r. Dokumentacja dla programistów podaje tę samą stawkę w trzeci sposób: „Cennik to $0.18 za godzinę przetwarzanego dźwięku". Żadna liczba na tej stronie nie została przeniesiona ze strony cennika Meta, bo nie ma czytelnej strony cennika Meta, którą można by odczytać: dokumentacja odsyła ze stawką do strony „Cennik i limity szybkości", która w wersji czytanej 29.09.2026 r. odpowiada Ta strona nie jest dostępna, więc to strona modelu jest źródłem dokumentacyjnym tej stawki i jest jedynym źródłem wykorzystanym w tym tekście.

Szczegół dotyczący rozliczeń znajduje się w dokumentacji dla programistów i warto go poznać, zanim określisz rozmiar obciążenia:

• Strumieniowanie i niestrumieniowanie kosztują tyle samo. Nie ma żadnej dopłaty za endpoint czasu rzeczywistego.

• Przetwarzanie z zerowym przechowywaniem danych jest wyceniane na równi z poziomem Standard, zgodnie z dokumentacją — nie jest to pozycja dopłaty.

• Rozliczanie zaokrągla w dół do pełnych sekund, więc dwusekundowa tura jest rozliczana jako dwie sekundy, a nie trzy.

• Niepowodzenia występujące przed wygenerowaniem transkrypcji nie są rozliczane, podobnie jak 429 związane z limitem szybkości.

• Darmowe środki istnieją na poziomie platformy, a nie na poziomie modelu. Dokumentacja Meta dotycząca zamiany mowy na tekst kończy akapit o cenniku zdaniem „Obowiązują środki z darmowego planu platformy”. To jedyne sformułowanie wspominające o czymkolwiek darmowym na stronach dla tego modelu i celowo jest niesprecyzowane: wskazuje na platformowy system środków, zamiast obiecywać darmowy limit na transkrypcję, a nie podano dla niego żadnej liczby, okresu ani kryteriów kwalifikowalności. Należy to rozumieć jako środki, które mogą obniżyć rachunek, a nie jako darmowy plan dla tego modelu. Skierowane do konsumentów oświadczenie Meta, że jej osobisty agent jest „darmowy w większości tego, czego ludzie potrzebują”, to osobne zdanie dotyczące aplikacji Muse i nie obejmuje Model API.

Przykład obliczeniowy, bo stawkę godzinową trudno wyczuć: dwugodzinny nagrany wywiad to 0,36 USD za transkrypcję. Tysiąc godzin nagrań audio z rozmów — mniej więcej miesięczny wolumen średniej wielkości centrum kontaktowego — to 180 USD. W tej skali stawka jest całym argumentem, a stawka to także jedyna rzecz, która może przesunąć się pod twoimi stopami: strona Meta jest tu autorytetem, a jeśli ta liczba zmieni się tam, zmieni się i tutaj.

Interfejs strumieniowy, punkt końcowy po punkcie końcowym

This is the part a reference page owes a reader that a launch write-up cannot carry, so here it is in the order you meet it. Base URL for Model API is https://api.meta.ai/v1 with a Bearer token, and Muse Voice Transcribe adds two endpoints on top of it.

• Dźwięk na żywo — wss://api.meta.ai/v1/asr/realtime. Transport odbywa się przez WebSocket, a szczegół uwierzytelniania jest pułapką: uwierzytelniasz się w ramce handshake, a nagłówek Authorization jest ignorowany. Handshake musi być pierwszą tekstową ramką JSON i musi dotrzeć w ciągu 10 sekund. Sesja trwa maksymalnie 60 minut, nowy WebSocket tworzy nową sesję, a nie ma tokenu wznowienia.

• Nagrania — POST https://api.meta.ai/v1/asr/transcribe. Przesyłanie wieloczęściowe (multipart), a ten jednak uwierzytelnia się za pomocą nagłówka Authorization. Format wejściowy jest wąski: wyłącznie mono 16-bit PCM WAV przy 16 lub 24 kHz. Limity to 32 MB na treść żądania i 10 minut dźwięku na żądanie.

W sesji czasu rzeczywistego trzy tryby zmieniają to, co otrzymujesz. PUSH_TO_TALK jest domyślny i wykonuje transkrypcję pojedynczej tury. ENDPOINTING daje wykrywane przez model granice tur, jedna tura na wykryty segment mowy, emitując speechStart, powtarzane transcript, speechEnd i speechComplete zdarzenia — z ostrzeżeniem, że speechEnd nie jest transkrypcją. DIARIZATION dodaje automatyczne wykrywanie i przypisywanie mówców, emitując speaker zdarzenia z etykietami takimi jak A i B. Transkrypcje częściowe są albo narastające, gdzie każda część zastępuje poprzednią, albo w postaci delt.

Dwa szczegóły operacyjne z tej samej dokumentacji łatwo przeoczyć, a ich odkrycie na produkcji jest kosztowne:

• Diaryzacja oznacza możliwego nowego mówcę, a nie wyraźny koniec wypowiedzi, a Meta twierdzi, że nie jest dostrojona do zastosowań wymagających niskich opóźnień ani użycia w poleceniach głosowych. Traktuj etykiety jako identyfikatory ważne w obrębie sesji — A w jednej sesji nie jest tą samą osobą co A w następnej.

Tury mogą się nakładać, więc stan dla poszczególnych tur powinien być kluczowany identyfikatorem tury, a nie kolejnością napływu.

• Opublikowane limity na dzierżawcę to 128 równoczesnych strumieni i 16 000 strumieni na godzinę.

Co działa wewnątrz modelu i co zastępuje

Strona modelu Meta zawiera konkretne twierdzenie dotyczące architektury, a nie wyników: „Atrybucja mówcy dla ponad 20 mówców i wykrywanie końca wypowiedzi odbywają się wewnątrz modelu rozpoznawania” — i wyraźnie przeciwstawia to przebiegowi wsadowemu na końcu strumienia audio. Praktyczna różnica polega na tym, że nie ma drugiego etapu, na który trzeba czekać. Etykiety mówców i granice tur przychodzą w tym samym strumieniu co słowa, więc dalszy agent głosowy lub interfejs z napisami na żywo otrzymuje kompletną turę i tożsamość bez dodatkowego kroku przetwarzania końcowego.

Pozostałe możliwości, które Meta dokumentuje jako znajdujące się w modelu:

• Natywne wykrywanie końca wypowiedzi i aktywności głosowej, dzięki czemu nie musisz uruchamiać własnego VAD przed API. Jak ujęto to w dokumentacji, otrzymujesz jedną kompletną transkrypcję na wypowiedź bez uruchamiania własnego wykrywania aktywności głosowej, a wykryty koniec mowy nie kończy sesji.

• Ukierunkowanie na kontekst i słowa kluczowe, bez dostrajania. Strona modelu Meta opisuje, że dokładność utrzymano „dzięki ukierunkowaniu na kontekst i słowa kluczowe, bez dostrajania”, co jest cechą, dzięki której strumieniowe ASR jest użyteczne w przypadku słownictwa dziedzinowego — nazw leków, symboli tickerów, kodów SKU produktów — a nie przeciętnego języka ogólnego. Dokumentacja precyzyjnie określa ograniczenia: słowa kluczowe ukierunkowują rozpoznawanie, ale nie gwarantują dokładnej pisowni, a zarówno słowa kluczowe, jak i ukierunkowanie językowe są ustalone na początku sesji.

• 25 ocenianych języków z przełączaniem kodu. Dokumentacja wymienia je: arabski, bengalski, niderlandzki, angielski, francuski, niemiecki, hebrajski, hindi, indonezyjski, włoski, japoński, kannada, koreański, malajski, chiński mandaryński, marathi, polski, portugalski, hiszpański, tagalski, tamilski, telugu, tajski, turecki i wietnamski. Przełączanie kodu — w środku zdania i w środku wypowiedzi, bez uprzedzenia, który język nadchodzi — to zdolność, której rozpoznawacze jednojęzyczne strukturalnie nie mogą zaoferować. Warto pamiętać o jednym zastrzeżeniu: preferencja językowa to lista języków, a nie dowolny kontekst, i nie zmusza modelu do ich użycia.

Opatrzony datą post ogłoszeniowy idzie dalej: mówi, że model wytrenowano na 70+ językach, z których 25 „gruntownie zweryfikowano” — tak podaje dostawca, a lista tych 25 zweryfikowanych to podzbiór, za którym stoi Meta. To jest pokrycie, względem którego należy planować, a nie 70.

Udokumentowane limity

Strona referencyjna jest tylko tak dobra, jak ograniczenia, które podaje, a Meta podaje ich kilka.

• Znaczniki czasu na poziomie tur, a nie na poziomie słów. Zarówno strona modelu, jak i dokumentacja mówią to wprost: „Zwraca znaczniki czasu na poziomie tur, ale nie na poziomie słów”. Tury zawierają czasy początku i końca w milisekundach. Jeśli Twój produkt wymaga kliknięcia, aby przejść do konkretnego słowa — podświetlania w stylu karaoke, routingu na podstawie pewności dla poszczególnych słów, wymuszonego wyrównania — to jest zły model i żadna ilość inżynierii promptów tego nie zmieni.

• Brak ocen pewności, brak wykrywania zdarzeń dźwiękowych, brak wykrywania emocji, brak przeformatowywania transkrypcji. Meta wymienia wszystkie cztery jako niedostępne. Otrzymujesz słowa, tury, znaczniki czasu i etykiety mówców, a nic o tym, jak pewny jest model.

• Brak syntezy mowy i brak API do konwersacji mowa-do-mowy. Jest to tylko jednokierunkowe.

• Wybór formatów audio na ścieżce pliku jest niewielki. Mono 16-bit PCM WAV, 16 lub 24 kHz. Wszystko inne musi zostać przekonwertowane przed przesłaniem.

Otwarte wagi i zamieszanie wokół Muse Glimmer

Muse Voice Transcribe to rozwiązanie zastrzeżone, udostępniane przez API — nie jest to wydanie z otwartymi wagami i dokumentacja Meta nigdy nie twierdzi inaczej. Ma to znaczenie, ponieważ czytelnicy przypisują ścieżkę otwartych wag rodziny Muse do niewłaściwej nazwy. Muse Glimmer jest tą ścieżką: dokumentacja Meta opisuje go jako multimodalny model z otwartymi wagami, destylowany z Muse Spark, dystrybuowany na permisywnej licencji Apache 2.0, który pobierasz i uruchamiasz na własnym sprzęcie za pomocą środowiska uruchomieniowego takiego jak vLLM, SGLang, llama.cpp czy ExecuTorch. Muse Voice Transcribe jest na tej samej stronie grupowany razem z Muse Spark, Muse Image i SAM jako modele, które się wywołuje, a nie pobiera.

Tak więc: żadnych wag dla Muse Voice Transcribe, żadnej opcji samodzielnego hostowania, żadnej możliwości audytu ani dostrajania go. Jeśli jakaś strona mówi inaczej, pomieszała go z Muse Glimmer. Gdy wagi modelu nie są publikowane, platforma serwująca to cała historia — i o tym jest następna sekcja.

Jak klient do niego dociera

Model API firmy Meta zostało stworzone tak, aby można je było wpiąć do klientów, których już używasz. Twierdzenie dostawcy, widniejące na stronie przeglądu API, mówi, że Model API „jest bezpośrednio kompatybilne z bibliotekami klientów zgodnymi z OpenAI i Anthropic oraz z interfejsami CLI agentów zgodnymi z OpenAI. Ustaw bazowy adres URL swojego klienta, dodaj swój klucz i zachowaj resztę kodu”. Ogólnie w Model API oferowane są trzy kształty żądań — Responses API, Chat Completions API i Messages API — więc istniejąca integracja zwykle ma pasujący interfejs bez przepisywania. Jedno zastrzeżenie dotyczące zakresu: to zdanie o kompatybilności i te trzy kształty to możliwości całego Model API, a nie wiersze umieszczone na własnej stronie modelu Muse Voice Transcribe. Własny szybki start na stronie modelu jest węższy — mówi tylko, że „kierujesz swojego istniejącego klienta zgodnego z OpenAI na Meta Model API” i że pierwsze działające żądanie wykonasz w mniej niż pięć minut.

Jedna uczciwa luka warta odnotowania na stronie referencyjnej: dokumentacja Meta dla tego modelu nie wymienia żadnej oficjalnej biblioteki klienta dla Muse Voice Transcribe, a jej strona „Client libraries” znajduje się w sekcji SAM, a nie w sekcji Voice. Przewodnik po rozpoznawaniu mowy daje zamiast tego konkretną listę zależności — Python 3.9 lub nowszy z websockets i sounddevice w postaci pakietów — plus podręcznik podstaw API głosowego. Zatem obietnica „drop-in” opisuje ogólnie powierzchnię żądań Model API; sam endpoint ASR czasu rzeczywistego to WebSocket z własnymi regułami uzgadniania i bez udokumentowanej nakładki.

A screenshot of Meta's model page for Muse Voice Transcribe (captured 2026-09-29), showing the headline 'Competitive latency and streaming transcription accuracy with live attribution for 20+ speakers. Build with a single model at $0.18/hour.', a 'Meet Muse Voice Transcribe' panel of capability cards headed 'Competitive transcription accuracy', 'Live speaker and turn awareness' and 'Production pricing', a 'Muse Voice Transcribe benchmarks' section labelled 'AA-WER Streaming Index - Final Transcription Diarization' with 3.9% and 3.9%, and the pricing row reading muse-voice-transcribe-1.0 at $3.00 per 1,000 minutes and $0.18 per hour.

Czego Meta nie opublikowała

Brak benchmarku jest faktem dotyczącym dokumentacji, więc tak też został tu przedstawiony. Strona modelu Muse Transcribe firmy Meta nie zawiera zamieszczonej tabeli dokładności: jej dowody dotyczące dokładności są dostarczane w postaci trzech zasobów graficznych — rankingu strumieniowego współczynnika błędów słów, porównania współczynnika błędów diarizacji oraz strumieniowego wskaźnika dokładności — bez żadnych liczb w tekście możliwym do wyodrębnienia. Sama strona modelu nie podaje współczynnika błędów słów, współczynnika błędów diarizacji ani rozbicia na poszczególne języki.

Post ogłaszający rzeczywiście zawiera dane liczbowe podane przez producenta, w tym strumieniowy współczynnik błędów słów i średni współczynnik błędów diaryzacji, i to właśnie te liczby opisaliśmy w chwili premiery modelu; są to pomiary samej Meta i wciąż nie zostały powtórzone przez żadną stronę trzecią. Ta strona nie powtarza tego porównania, ponieważ ponowne przeprowadzenie benchmarku producenta z dnia premiery na stronie referencyjnej przedstawiłoby niepowtórzoną liczbę jako ustaloną. To, co można powiedzieć wprost, jest węższe: Meta nie publikuje dla tego modelu żadnej bezpośredniej oceny porównawczej z nazwanym konkurentem przy porównywalnym nakładzie i porównywalnym zestawie narzędzi, więc każde porównanie, które gdziekolwiek przeczytasz, jest porównaniem liczb producenta zebranych w odmiennych warunkach.

Jedna data również celowo pozostaje nieustalona. Strona modelu nie podaje żadnej daty wydania — jej jedynym oznaczeniem wersji jest -1.0 w identyfikatorze modelu. Data 2026-09-01 w tym tekście pochodzi z tego opatrzonego datą posta ogłoszeniowego i została tu użyta do datowania modelu, a nie do relacjonowania wydarzenia.

A generated reference scoreboard titled 'Muse Voice Transcribe — the reference', listing six rows for the model: price $0.18 per hour of audio, interface as a realtime WebSocket at wss://api.meta.ai/v1/asr/realtime plus a file endpoint, speaker attribution for 20+ speakers inside the recognition model, turn-level timestamps without word-level times, 25 evaluated languages with code-switching, and proprietary weights with no open download.A screenshot of the Speech to text page in Meta's Model API documentation (captured 2026-09-29), showing the opening sentence 'Muse Voice Transcribe is Meta's speech-to-text model on Meta Model API', an 'Available endpoints' table contrasting wss://api.meta.ai/v1/asr/realtime for live audio against POST https://api.meta.ai/v1/asr/transcribe for a recording and noting that the Authorization header is ignored on the WebSocket, and a Features table whose rows include language biasing across 25 supported languages with code-switching, vocabulary biasing, speech-turn detection, speaker labels, partial transcripts and progress events.

Kto powinien po to sięgnąć, a kto nie

Argument za Muse Voice Transcribe jest wąski i mocny: dźwięk na żywo, w którym potrzebujesz słów, tożsamości mówcy i zakończeń tur w tym samym strumieniu, w cenie wystarczająco niskiej, by działać w trybie ciągłym, a nie na żądanie. Agenci głosowi, napisy na żywo, analityka spotkań i rozmów, dyktowanie oraz transkrypcja o dużej skali to obciążenia, które wymienia Meta, i to pod nie interfejs jest w rzeczywistości ukształtowany — 60-minutowy WebSocket z trybami endpointingu i etykietami mówców w zakresie sesji.

Argumenty przeciwko niemu są równie konkretne. Jeśli potrzebujesz znaczników czasu na poziomie słów, pewności dla poszczególnych słów, wykrywania zdarzeń dźwiękowych lub emocji albo przeformatowywania transkrypcji, ten model ich nie ma, i jest to udokumentowany brak, a nie błąd. Jeśli Twoje audio przychodzi w formatach innych niż monofoniczny 16-bitowy WAV przy 16 lub 24 kHz, a korzystasz z punktu końcowego pliku, płacisz za krok konwersji, którego nie ponosiłbyś gdzie indziej. A jeśli Twoim wymaganiem jest transkrypcja wsadowa zarchiwizowanych nagrań, w której dokładność jest jedyną osią, oferta streamingu nie daje Ci nic — cena jest taka sama w obu ścieżkach, więc płacisz za możliwość czasu rzeczywistego, której nie wykorzystasz.

Jedyną rzeczą, którą trzeba sprawdzić, zanim zdecydujesz się na ścieżkę produkcyjną, jest liczba, na którą ta strona ma odpowiedzieć — i jest to ta jedna liczba, która może się zmienić, choć model nie zmienia się wcale: 0,18 USD za godzinę audio, jak dziś podano na własnej stronie modelu Meta. To strona Meta jest tu autorytetem. Gdy się zmieni, wszystko, co jest na niej oparte — miesiąc tysiąca godzin, koszt pojedynczej rozmowy, kalkulacja „zbudować czy kupić” — zmieni się razem z nią.