
Muse Voice Transcribe jest już dostępne: pierwszy model Meta do percepcji audio w czasie rzeczywistym
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
Muse Voice Transcribe, pierwszy model percepcji audio w czasie rzeczywistym z Meta Superintelligence Labs, zadebiutował 1 września 2026 roku i ma cenę jak spoiler: 3,00 USD za 1000 minut audio — około 0,18 USD za godzinę — w Meta Model API. W jednym przejściu strumieniowym robi to, co większość zestawów transkrypcyjnych dzieli na trzy systemy: automatyczne rozpoznawanie mowy, diaryzację mówców wśród ponad 20 głosów oraz endpointing, czyli określanie, kiedy mówca faktycznie skończył, a nie zrobił pauzy w środku myśli. Meta twierdzi, że model przewodzi w rankingu Artificial Analysis strumieniowej zamiany mowy na tekst ze wskaźnikiem błędów słów wynoszącym 3,1% w końcowych transkryptach, dostarczanych 0,16 sekundy po tym, jak mówca przestaje mówić.
Ta ostatnia liczba potrzebuje uczciwej etykiety, zanim zacznie działać: to deklaracja Meta z dnia premiery, wskazująca na niezależny ranking, dla modelu, który był dostępny do wywołań przez mniej niż dobę, gdy ukazało się ogłoszenie. Nikt poza laboratorium nie odtworzył jeszcze wyniku 3,1%, a deklaracja dokładności to jedno, podczas gdy reszta oferty — 70+ języków treningowych, rodzime przełączanie kodów, „adaptacyjne opóźnienie” wyuczone przez wzmacnianie — to osobny zestaw deklaracji producenta w tej samej łodzi. Wszystko w tym poście to stan modelu w dniu pierwszym, z liczbami producenta oznaczonymi jako liczby producenta.
Liczby, które mają znaczenie pierwszego dnia
• Cena — 3,00 USD za 1 000 minut audio (około 0,18 USD za godzinę audio) na Meta Model API, przebijając cenowo wszystkie główne API do transkrypcji strumieniowej, które śledzimy.
• Deklaracja dokładności — 3,1% WER w końcowych transkryptach po 0,16 sekundy od zakończenia mowy; 3,6% WER w pierwszych transkryptach częściowych po 0,13 sekundy. Zgłoszone przez dostawcę, powołując się na ranking strumieniowy Artificial Analysis.
• Diaryzacja — ponad 20 mówców, emitowana strumieniowo bez osobnego etapu post-processingu (Meta podaje średni wskaźnik błędów diaryzacji na poziomie 17,5%).
• Języki — trenowany na 70+; 25 „dokładnie zweryfikowanych" przy premierze; płynne przełączanie kodów w zdaniach i między zdaniami.
Kontekst — obsługuje audio dłuższe niż godzina; dostrajanie języka, słów kluczowych i kontekstu dla dziedzin pełnych żargonu.

Co oznacza tutaj "model percepcji audio"
Najważniejsza jest architektura. Muse Voice Transcribe pobiera dźwięk w 80-milisekundowych porcjach i wyprowadza słowa strumieniowo, w miarę jak się stabilizują — to właśnie w praktyce oznacza „czas rzeczywisty”. Najciekawsze jest to, jak model decyduje, kiedy zatwierdzić słowo. Zamiast stałego budżetu opóźnienia — standardowego kompromisu, w którym rozpoznawca albo zatwierdza wcześnie i zgaduje, albo czeka dłużej i wstrzymuje się z ostateczną decyzją — model stosuje coś, co Meta nazywa „opóźnieniem adaptacyjnym”: szybko przechodzi przez łatwe fragmenty mowy i zatrzymuje więcej kontekstu audio dla słów, co do których jest mniej pewien. Sama polityka opóźnień jest efektem uczenia przez wzmacnianie, więc model w efekcie równoważy szybkość i dokładność dla każdego słowa z osobna, zamiast stosować jedno globalne ustawienie.
Ta właśnie różnica sprawia, że Meta nazywa Muse Voice Transcribe „modelem percepcji audio”, a nie modelem ASR. Strumień wyjściowy to pojedyncza transkrypcja na żywo, która zawiera również informację, kto mówi i kiedy wypowiedź jest zakończona — trzy etykiety, które systemy strumieniowe zwykle kompletują, sklejając rozpoznawacz z detektorem aktywności głosowej i modelem diarizacji, z których każdy dodaje własne opóźnienie i własne tryby awarii.

Diaryzacja i endpointing — wbudowane
Diaryzacja mówców to element najbardziej wart dokładnego przeanalizowania, ponieważ to funkcja, w której produkty streamingowe najczęściej przeceniają swoje możliwości. Meta twierdzi, że model rozdziela 20+ mówców w pojedynczym nagraniu i podaje średni wskaźnik błędów diaryzacji na poziomie 17,5%, który przeciwstawia zakresowi 21,1–28,6%, przypisywanemu systemom konkurencji. Obie liczby zostały opublikowane przez producenta w dniu premiery i żadna niezależna ocena nie potwierdziła jeszcze 17,5%. To, co jest strukturalnie realne, to fakt, że diaryzacja odbywa się w tym samym przebiegu strumieniowym co rozpoznawanie — nie ma drugiego kroku w postaci „wgraj audio, poczekaj, otrzymaj mówców”, a to właśnie wybór projektowy, który sprawia, że śledzenie 20+ mówców jest w ogóle wiarygodne w środowisku na żywo.
Endpointing to mniej zauważalna funkcja, ale prawdopodobnie najbardziej przydatna. Interfejsy API transkrypcji, które udostępniają surowy strumieniowy ASR, zmuszają wywołującego do samodzielnego zaimplementowania wykrywania końca wypowiedzi, dlatego agenci głosowi tak często przerywają ludziom lub pozostawiają ciszę. Muse Voice Transcribe decyduje, kiedy tura jest zakończona, i emituje tę granicę jako część strumienia, dzięki czemu aplikacja otrzymuje czysty sygnał „ten mówca skończył” bez budowania warstwy VAD.
Wielojęzyczne twierdzenie, przeczytaj uważnie
Meta wytrenowała model na ponad 70 językach, ale na starcie waliduje 25. To dwie różne rzeczy: „wytrenowany na” oznacza, że dane obejmowały te języki; „gruntownie zweryfikowany” to podzbiór, za którym Meta faktycznie stoi, potwierdzony testami wewnętrznymi. Do użytku produkcyjnego lista 25 zweryfikowanych języków to realny zasięg, a różnica między 70 a 25 jest warta poznania, zanim skierujesz przez niego 40 języków. Co jest naprawdę niezwykłe, to historia przełączania kodów — model jest zaprojektowany tak, aby przełączać języki w środku zdania i w środku wypowiedzi bez polecenia, co jest realnym problemem w regionach wielojęzycznych i czymś, czego większość jednojęzycznych produktów ASR po prostu nie potrafi. Biasowanie językowe, słów kluczowych i kontekstowe uzupełnia obraz dostosowywania: możesz ukierunkować rozpoznawanie na słownictwo domenowe, co jest funkcją sprawiającą, że streamingowe ASR jest użyteczne w kolejkach medycznych, prawnych i wsparcia.
Trzy powierzchnie, jeden model
Muse Voice Transcribe jest dostępne jednocześnie w trzech odsłonach. Płatną jest Meta Model API w cenie 3,00 USD za 1000 minut audio. Konsumencką jest Meta AI dla komputerów Mac, gdzie przytrzymanie klawisza Fn dyktuje tekst w dowolnej aplikacji — odpowiedź Meta na wbudowane dyktowanie Apple i najbardziej widoczne wdrożenie modelu w praktyce na start. Deweloperską jest Muse Code, agent kodowania Meta, w którym polecenia głosowe sterują sesjami wieloagentowymi i procesami refaktoryzacji. Jeden model napędzający funkcję dyktowania i agenta kodowania to sproduktowiona wersja hasła „jeden model strumieniowy, wiele powierzchni”.
Co cena podcina
Przy cenie 0,18 USD za godzinę audio, Muse Voice Transcribe ma niższą cenę katalogową niż konkurencyjne usługi transkrypcji strumieniowej. Zestaw porównawczy, jaki śledzimy: Google Gemini 3.5 Transcribe Live to około 9 USD za 1000 minut, ElevenLabs Scribe v2 Realtime ma cenę katalogową 6,50 USD za 1000 minut, Cartesia Ink-2 – 4,00 USD, a OpenAI GPT Live Transcribe – 17,00 USD. To są opublikowane dane producentów, a kilka z tych modeli ma niezależne dowody dokładności, których Muse jeszcze nie ma — przewaga cenowa od pierwszego dnia to nie to samo co ustalony ranking. Ale model strumieniowy z wbudowaną diarizacją i endpointingiem, wchodzący na rynek z ceną mniej więcej od jednej piątej do jednej dziesiątej ceny dotychczasowych interfejsów API do transkrypcji strumieniowej, to liczba, która i tak zmienia oczekiwania.

Uczciwe zastrzeżenia
Muse Voice Transcribe jest zastrzeżonym oprogramowaniem, a wagi nie są publikowane — opcja „uruchom samodzielnie" nie istnieje i nie ma ścieżki otwartych wag do audytu ani dostrajania. Deklaracja dokładności pochodzi z dnia premiery i nie została niezależnie potwierdzona. 25 zweryfikowanych języków może nie odpowiadać liczbie ponad 70 języków „uwzględnionych w treningu" w zakresie pokrycia języków niskozasobowych. A benchmark diaryzacji, jakkolwiek obiecujący, jest pomiarem producenta, dopóki nie potwierdzi go niezależne uruchomienie. Dla zespołów, których jedynym wymaganiem jest dokładna transkrypcja wsadowa wcześniej nagranego audio, wciąż istnieją tańsze i lepiej audytowane opcje — argument za streamowaniem dotyczy interakcji w czasie rzeczywistym, a nie pobicia świata transkrypcji wsadowej pod względem kosztu za godzinę audio.
Co obejrzeć dalej
Cztery rzeczy zadecydują, czy ta premiera będzie chwilą, czy trendem. Po pierwsze, czy streamingowy ranking Artificial Analysis faktycznie umieści Muse Voice Transcribe na #1 po niezależnej weryfikacji — deklaracja z dnia premiery wymaga ustalonego wpisu w rankingu. Po drugie, czy diaryzacja 20+ mówców przetrwa zderzenie z prawdziwymi, hałaśliwymi spotkaniami. Po trzecie, czy interfejs dyktowania Meta na Macu przełoży się na adopcję API przez programistów. Po czwarte, jak dotychczasowi gracze zareagują na cenę, ponieważ model strumieniowy z diaryzacją i wykrywaniem końca wypowiedzi za 0,18 USD za godzinę wywiera widoczną presję na wszystkich powyżej. Gdy Meta udostępni model dodatkowym partnerom serwisowym, brama typu pass-through, taka jak OrcaRouter — która przekazuje ceny katalogowe dostawców z 0% marżą — ujawniłaby tę samą kwotę 3,00 USD za 1 000 minut, bez narzutów odsprzedawcy, w dniu jej pojawienia się. Do tego czasu jedynym miejscem, w którym można wywołać Muse Voice Transcribe, jest własne API Meta.
