Tytułowa karta hero dla Muse Voice Transcribe — pierwszego modelu percepcji audio w czasie rzeczywistym Meta Superintelligence Labs — pokazująca strumieniowy przebieg fali z oznaczeniami ASR, diarizacji 20+ mówców i wykrywania końca wypowiedzi oraz chip z ceną 0,18 USD za godzinę audio.
Guides & Insights

Muse Voice Transcribe jest już dostępne: pierwszy model Meta do percepcji audio w czasie rzeczywistym

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Muse Voice Transcribe, pierwszy model percepcji audio w czasie rzeczywistym z Meta Superintelligence Labs, zadebiutował 1 września 2026 roku i ma cenę jak spoiler: 3,00 USD za 1000 minut audio — około 0,18 USD za godzinę — w Meta Model API. W jednym przejściu strumieniowym robi to, co większość zestawów transkrypcyjnych dzieli na trzy systemy: automatyczne rozpoznawanie mowy, diaryzację mówców wśród ponad 20 głosów oraz endpointing, czyli określanie, kiedy mówca faktycznie skończył, a nie zrobił pauzy w środku myśli. Meta twierdzi, że model przewodzi w rankingu Artificial Analysis strumieniowej zamiany mowy na tekst ze wskaźnikiem błędów słów wynoszącym 3,1% w końcowych transkryptach, dostarczanych 0,16 sekundy po tym, jak mówca przestaje mówić.

Ta ostatnia liczba potrzebuje uczciwej etykiety, zanim zacznie działać: to deklaracja Meta z dnia premiery, wskazująca na niezależny ranking, dla modelu, który był dostępny do wywołań przez mniej niż dobę, gdy ukazało się ogłoszenie. Nikt poza laboratorium nie odtworzył jeszcze wyniku 3,1%, a deklaracja dokładności to jedno, podczas gdy reszta oferty — 70+ języków treningowych, rodzime przełączanie kodów, „adaptacyjne opóźnienie” wyuczone przez wzmacnianie — to osobny zestaw deklaracji producenta w tej samej łodzi. Wszystko w tym poście to stan modelu w dniu pierwszym, z liczbami producenta oznaczonymi jako liczby producenta.

Liczby, które mają znaczenie pierwszego dnia

• Cena — 3,00 USD za 1 000 minut audio (około 0,18 USD za godzinę audio) na Meta Model API, przebijając cenowo wszystkie główne API do transkrypcji strumieniowej, które śledzimy.

• Deklaracja dokładności — 3,1% WER w końcowych transkryptach po 0,16 sekundy od zakończenia mowy; 3,6% WER w pierwszych transkryptach częściowych po 0,13 sekundy. Zgłoszone przez dostawcę, powołując się na ranking strumieniowy Artificial Analysis.

• Diaryzacja — ponad 20 mówców, emitowana strumieniowo bez osobnego etapu post-processingu (Meta podaje średni wskaźnik błędów diaryzacji na poziomie 17,5%).

• Języki — trenowany na 70+; 25 „dokładnie zweryfikowanych" przy premierze; płynne przełączanie kodów w zdaniach i między zdaniami.

Kontekst — obsługuje audio dłuższe niż godzina; dostrajanie języka, słów kluczowych i kontekstu dla dziedzin pełnych żargonu.

A screenshot of the Meta AI Research announcement post for Muse Voice Transcribe (captured September 2, 2026), showing the headline 'Introducing Muse Voice Transcribe', the September 1, 2026 publication date, and an interactive real-time transcription demo at the top of the page.

Co oznacza tutaj "model percepcji audio"

Najważniejsza jest architektura. Muse Voice Transcribe pobiera dźwięk w 80-milisekundowych porcjach i wyprowadza słowa strumieniowo, w miarę jak się stabilizują — to właśnie w praktyce oznacza „czas rzeczywisty”. Najciekawsze jest to, jak model decyduje, kiedy zatwierdzić słowo. Zamiast stałego budżetu opóźnienia — standardowego kompromisu, w którym rozpoznawca albo zatwierdza wcześnie i zgaduje, albo czeka dłużej i wstrzymuje się z ostateczną decyzją — model stosuje coś, co Meta nazywa „opóźnieniem adaptacyjnym”: szybko przechodzi przez łatwe fragmenty mowy i zatrzymuje więcej kontekstu audio dla słów, co do których jest mniej pewien. Sama polityka opóźnień jest efektem uczenia przez wzmacnianie, więc model w efekcie równoważy szybkość i dokładność dla każdego słowa z osobna, zamiast stosować jedno globalne ustawienie.

Ta właśnie różnica sprawia, że Meta nazywa Muse Voice Transcribe „modelem percepcji audio”, a nie modelem ASR. Strumień wyjściowy to pojedyncza transkrypcja na żywo, która zawiera również informację, kto mówi i kiedy wypowiedź jest zakończona — trzy etykiety, które systemy strumieniowe zwykle kompletują, sklejając rozpoznawacz z detektorem aktywności głosowej i modelem diarizacji, z których każdy dodaje własne opóźnienie i własne tryby awarii.

A screenshot of the Artificial Analysis Speech to Text leaderboard showing the WER Index (non-streaming), Speed Factor, Streaming, and Price in USD per 1,000 minutes of audio sections.

Diaryzacja i endpointing — wbudowane

Diaryzacja mówców to element najbardziej wart dokładnego przeanalizowania, ponieważ to funkcja, w której produkty streamingowe najczęściej przeceniają swoje możliwości. Meta twierdzi, że model rozdziela 20+ mówców w pojedynczym nagraniu i podaje średni wskaźnik błędów diaryzacji na poziomie 17,5%, który przeciwstawia zakresowi 21,1–28,6%, przypisywanemu systemom konkurencji. Obie liczby zostały opublikowane przez producenta w dniu premiery i żadna niezależna ocena nie potwierdziła jeszcze 17,5%. To, co jest strukturalnie realne, to fakt, że diaryzacja odbywa się w tym samym przebiegu strumieniowym co rozpoznawanie — nie ma drugiego kroku w postaci „wgraj audio, poczekaj, otrzymaj mówców”, a to właśnie wybór projektowy, który sprawia, że śledzenie 20+ mówców jest w ogóle wiarygodne w środowisku na żywo.

Endpointing to mniej zauważalna funkcja, ale prawdopodobnie najbardziej przydatna. Interfejsy API transkrypcji, które udostępniają surowy strumieniowy ASR, zmuszają wywołującego do samodzielnego zaimplementowania wykrywania końca wypowiedzi, dlatego agenci głosowi tak często przerywają ludziom lub pozostawiają ciszę. Muse Voice Transcribe decyduje, kiedy tura jest zakończona, i emituje tę granicę jako część strumienia, dzięki czemu aplikacja otrzymuje czysty sygnał „ten mówca skończył” bez budowania warstwy VAD.

Wielojęzyczne twierdzenie, przeczytaj uważnie

Meta wytrenowała model na ponad 70 językach, ale na starcie waliduje 25. To dwie różne rzeczy: „wytrenowany na” oznacza, że dane obejmowały te języki; „gruntownie zweryfikowany” to podzbiór, za którym Meta faktycznie stoi, potwierdzony testami wewnętrznymi. Do użytku produkcyjnego lista 25 zweryfikowanych języków to realny zasięg, a różnica między 70 a 25 jest warta poznania, zanim skierujesz przez niego 40 języków. Co jest naprawdę niezwykłe, to historia przełączania kodów — model jest zaprojektowany tak, aby przełączać języki w środku zdania i w środku wypowiedzi bez polecenia, co jest realnym problemem w regionach wielojęzycznych i czymś, czego większość jednojęzycznych produktów ASR po prostu nie potrafi. Biasowanie językowe, słów kluczowych i kontekstowe uzupełnia obraz dostosowywania: możesz ukierunkować rozpoznawanie na słownictwo domenowe, co jest funkcją sprawiającą, że streamingowe ASR jest użyteczne w kolejkach medycznych, prawnych i wsparcia.

Trzy powierzchnie, jeden model

Muse Voice Transcribe jest dostępne jednocześnie w trzech odsłonach. Płatną jest Meta Model API w cenie 3,00 USD za 1000 minut audio. Konsumencką jest Meta AI dla komputerów Mac, gdzie przytrzymanie klawisza Fn dyktuje tekst w dowolnej aplikacji — odpowiedź Meta na wbudowane dyktowanie Apple i najbardziej widoczne wdrożenie modelu w praktyce na start. Deweloperską jest Muse Code, agent kodowania Meta, w którym polecenia głosowe sterują sesjami wieloagentowymi i procesami refaktoryzacji. Jeden model napędzający funkcję dyktowania i agenta kodowania to sproduktowiona wersja hasła „jeden model strumieniowy, wiele powierzchni”.

Co cena podcina

Przy cenie 0,18 USD za godzinę audio, Muse Voice Transcribe ma niższą cenę katalogową niż konkurencyjne usługi transkrypcji strumieniowej. Zestaw porównawczy, jaki śledzimy: Google Gemini 3.5 Transcribe Live to około 9 USD za 1000 minut, ElevenLabs Scribe v2 Realtime ma cenę katalogową 6,50 USD za 1000 minut, Cartesia Ink-2 – 4,00 USD, a OpenAI GPT Live Transcribe – 17,00 USD. To są opublikowane dane producentów, a kilka z tych modeli ma niezależne dowody dokładności, których Muse jeszcze nie ma — przewaga cenowa od pierwszego dnia to nie to samo co ustalony ranking. Ale model strumieniowy z wbudowaną diarizacją i endpointingiem, wchodzący na rynek z ceną mniej więcej od jednej piątej do jednej dziesiątej ceny dotychczasowych interfejsów API do transkrypcji strumieniowej, to liczba, która i tak zmienia oczekiwania.

A generated price-comparison infographic titled 'Streaming transcription — list price per 1,000 minutes' showing Muse Voice Transcribe at $3.00 against Cartesia Ink-2 at $4.00, ElevenLabs Scribe v2 Realtime at $6.50, Gemini 3.5 Transcribe Live at $9.00, and GPT Live Transcribe at $17.00, with a footer noting these are vendor list prices as published in September 2026, and the OrcaRouter logo in the bottom-right corner.

Uczciwe zastrzeżenia

Muse Voice Transcribe jest zastrzeżonym oprogramowaniem, a wagi nie są publikowane — opcja „uruchom samodzielnie" nie istnieje i nie ma ścieżki otwartych wag do audytu ani dostrajania. Deklaracja dokładności pochodzi z dnia premiery i nie została niezależnie potwierdzona. 25 zweryfikowanych języków może nie odpowiadać liczbie ponad 70 języków „uwzględnionych w treningu" w zakresie pokrycia języków niskozasobowych. A benchmark diaryzacji, jakkolwiek obiecujący, jest pomiarem producenta, dopóki nie potwierdzi go niezależne uruchomienie. Dla zespołów, których jedynym wymaganiem jest dokładna transkrypcja wsadowa wcześniej nagranego audio, wciąż istnieją tańsze i lepiej audytowane opcje — argument za streamowaniem dotyczy interakcji w czasie rzeczywistym, a nie pobicia świata transkrypcji wsadowej pod względem kosztu za godzinę audio.

Co obejrzeć dalej

Cztery rzeczy zadecydują, czy ta premiera będzie chwilą, czy trendem. Po pierwsze, czy streamingowy ranking Artificial Analysis faktycznie umieści Muse Voice Transcribe na #1 po niezależnej weryfikacji — deklaracja z dnia premiery wymaga ustalonego wpisu w rankingu. Po drugie, czy diaryzacja 20+ mówców przetrwa zderzenie z prawdziwymi, hałaśliwymi spotkaniami. Po trzecie, czy interfejs dyktowania Meta na Macu przełoży się na adopcję API przez programistów. Po czwarte, jak dotychczasowi gracze zareagują na cenę, ponieważ model strumieniowy z diaryzacją i wykrywaniem końca wypowiedzi za 0,18 USD za godzinę wywiera widoczną presję na wszystkich powyżej. Gdy Meta udostępni model dodatkowym partnerom serwisowym, brama typu pass-through, taka jak OrcaRouter — która przekazuje ceny katalogowe dostawców z 0% marżą — ujawniłaby tę samą kwotę 3,00 USD za 1 000 minut, bez narzutów odsprzedawcy, w dniu jej pojawienia się. Do tego czasu jedynym miejscem, w którym można wywołać Muse Voice Transcribe, jest własne API Meta.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube