
Grok Voice Transcribe 2.0 vs Muse Voice Transcribe: 17-dniowe panowanie i ćwierć sekundy
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
1 września 2026 r. Meta poinformowała, że Muse Voice Transcribe zajął pierwsze miejsce w ewaluacji strumieniowego rozpoznawania mowy Artificial Analysis z końcowym współczynnikiem błędów słów na poziomie 3,1%, a to twierdzenie przez siedemnaście dni pozostało niepodważone. 18 września SpaceXAI udostępniła Grok Voice Transcribe 2.0 z wynikiem 2,7% na tej samej liście i przejęła to miejsce. Dwa modele, jeden ranking, siedemnaście dni różnicy — a ciekawsze porównanie nie dotyczy 0,4 punktu różnicy w dokładności, ponieważ model Meta nadal finalizuje zdanie około trzy razy szybciej: 0,16 sekundy po zakończeniu wypowiedzi wobec 0,49 sekundy w Grok Voice Transcribe 2.0. Muse Voice Transcribe to model percepcji audio w czasie rzeczywistym zbudowany przez Meta Superintelligence Labs do działania w produktach samej Meta, gdzie ćwierć sekundy to różnica między asystentem, który wydaje się obecny, a takim, który wydaje się wolny. Grok Voice Transcribe 2.0 to API transkrypcji stworzone z myślą o tym, by mógł je wywoływać każdy, w cenie, która czyni przetwarzanie wsadowe wykonalnym. Obie liczby zostały podane przez producenta w dniu premiery i tylko jedna z nich została od tego czasu niezależnie umieszczona na publicznej liście.
Co tak naprawdę mówi teraz tabela wyników
Tablica AA-WER Streaming to ważony kompozyt — AA-AgentTalk w 50%, VoxPopuli w 25%, Earnings22 w 25%, około ośmiu godzin w większości angielskiego audio o profilu agentowym — a oba modele są na niej mierzone, co czyni to rzadkim bezpośrednim porównaniem, w którym liczby są przynajmniej porównywalne. Zestawione obok siebie, z uwzględnieniem liczb podanych przez dostawców:
• Końcowa dokładność transkrypcji — Grok Voice Transcribe 2.0 przy 2,7% WER w porównaniu z Muse Voice Transcribe przy 3,1%
• Dokładność pierwszego częściowego transkryptu — 3,4% vs 3,6%
• Czas do pierwszego częściowego wyniku — 0,49 sekundy vs 0,13 sekundy
• Czas od zakończenia mowy do końcowej transkrypcji — 0,49 sekundy wobec 0,16 sekundy
• Wskaźnik błędu diaryzacji mówców — uwzględniony, nie opublikowano wartości w porównaniu ze średnią 17,5% w ewaluacji Meta
Odczytaj wiersze dotyczące dokładności i wiersze dotyczące opóźnienia osobno, ponieważ wskazują przeciwne kierunki i oba są prawdziwe. Pod względem dokładności dwa modele dzieli nie więcej niż cztery dziesiąte punktu w przypadku transkrypcji końcowych i dwie dziesiąte w przypadku pierwszych transkrypcji częściowych — różnica tak mała, że odwróci się przy następnym wydaniu którejkolwiek z firm, i tak mała, że żadna rozsądna osoba nie powinna na jej podstawie wybierać między nimi. Pod względem opóźnienia nie są blisko siebie. Model Meta zwraca wynik częściowy w około jedną ósmą sekundy i finalizuje w około jedną szóstą sekundy, w porównaniu z około pół sekundy w obu kierunkach w przypadku SpaceXAI.
Całe porównanie sprowadza się do jednego zdania: Grok Voice Transcribe 2.0 poświęcił opóźnienie, by zyskać dokładność, a Muse Voice Transcribe zrobił odwrotnie. SpaceXAI obniżył wskaźnik błędów pierwszego wyniku częściowego z 18,3% w wersji 1.0 do 3,4% w wersji 2.0, a ceną tego było przejście z 0,25 sekundy do 0,49 sekundy przy tej samej mierze. Model Meta został zaprojektowany odwrotnie, z 80-milisekundowymi fragmentami dźwięku i adaptacyjnym opóźnieniem wyuczonym przez uczenie ze wzmocnieniem, które decyduje, jak długo czekać przed zatwierdzeniem tekstu — mechanizm, którego całym celem jest utrzymanie dokładności przy jednoczesnym zachowaniu szybkiego zatwierdzania. Żaden z tych wyborów nie jest błędem. To odpowiedzi na różne pytania.
Które pytanie zadajesz?
Jeśli transkrypcja zasila agenta głosowego, który musi odpowiedzieć w pauzie rozmowy, 0,16 sekundy i 0,49 sekundy to różne produkty. Ludzka naprzemienność mówienia toleruje lukę kilkuset milisekund, zanim interakcja zacznie wydawać się nieodpowiednia, a budżet opóźnienia jest współdzielony — transkrypcja, potem rozumowanie, potem synteza mowy. Model, który zwraca końcową transkrypcję w jednej szóstej sekundy, zostawia miejsce dla reszty potoku; ten, który potrzebuje pół sekundy, zużywa większość budżetu, zanim model pomyśli o czymkolwiek. Właśnie do tego Meta go zbudowała i dlatego model działa w Meta AI na Macu oraz w Muse Code, a nie jest oferowany przede wszystkim jako punkt końcowy dla potoków innych ludzi.
Jeśli transkrypcja jest dokumentem — nagraniem rozmowy, spotkaniem, biblioteką wideo, archiwum zgodności — to pół sekundy nic nie znaczy, różnica w dokładności nadal nic nie znaczy, a jedyną liczbą, która się liczy, jest koszt godziny audio. I tu właśnie te dwie rzeczy mocno się rozchodzą, i to w kierunku, który zaskakuje osoby patrzące wyłącznie na stawkę za streaming.
O połowę taniej w trybie wsadowym, o jedną dziesiątą drożej w trybie strumieniowym.
Meta podaje Muse Voice Transcribe po $0.18 za godzinę audio lub $3.00 za 1000 minut. Grok Voice Transcribe 2.0 jest wyceniony na $0.10 za godzinę w trybie wsadowym i $0.20 za godzinę w trybie strumieniowym. A zatem:
• Strumieniowanie — Grok Voice Transcribe 2.0 po $0.20 za godzinę w porównaniu z Muse Voice Transcribe po $0.18, więc Meta jest około 10% tańsza
• Wsadowe lub nagrane — 0,10 USD za godzinę w porównaniu z 0,18 USD, więc SpaceXAI jest o 44% tańszy
• Wliczone w cenie katalogowej — diaryzacja, znaczniki czasu słów z poziomem ufności, ukierunkowanie na terminy kluczowe i odwrotna normalizacja tekstu po stronie SpaceXAI w porównaniu z transkrypcją strumieniową, diaryzacją i wykrywaniem punktów końcowych jako jednym modelem po stronie Meta
• Darmowy plan lub self-hosting — ani jedno, ani drugie
Zespół, który wyłącznie strumieniuje, powinien być obojętny pod względem ceny przy wyborze między nimi i powinien wybierać na podstawie opóźnienia, co oznacza Meta. Zespół z jakimkolwiek znaczącym wolumenem nagranego audio powinien spojrzeć na wiersz wsadowy, ponieważ 0,08 USD za godzinę się kumuluje: 5000 godzin miesięcznie to 500 USD w przypadku jednego i 900 USD w przypadku drugiego, a różnica w dokładności między nimi jest mniejsza niż zaokrąglenie którejkolwiek z tych liczb.
Sytuacja licencyjna jest identyczna w tym, co istotne, a różna w tym, co nieistotne. Oba mają zamknięte wagi — Muse Voice Transcribe jest własnościowe i dostępne wyłącznie przez hostowane API Meta, a Grok Voice Transcribe 2.0 to komercyjne API bez możliwości pobrania. Żaden z nich nie wchodzi w grę, jeśli wymagasz, by dźwięk nigdy nie opuszczał infrastruktury, którą kontrolujesz, a oba narażają cię na to, że dostawca zmieni cenę, wersję modelu lub harmonogram wycofania, gdy już z niego korzystasz. To realna kwestia, a nie hipotetyczna: Grok Voice Transcribe 1.0 już znajduje się na ścieżce wycofania, niecałe dwa tygodnie po premierze swojego następcy.

Diaryzacja, czyli funkcja, której żaden z nich nie wysuwa na pierwszy plan
Oba modele wykonują atrybucję mówcy w jednym przebiegu, która jeszcze dwa lata temu była osobnym systemem doklejonym później, a porównanie jest tu wyjątkowo konkretne, ponieważ Meta opublikowała liczbę, a SpaceXAI nie.
Meta podaje średni wskaźnik błędu diaryzacji na poziomie 17,5% w swojej ewaluacji, obsługuje 20 lub więcej mówców bez przetwarzania końcowego i robi to w ramach modelu strumieniowego, a nie jako dalszy etap — „kto co powiedział” pojawia się razem z tekstem, a nie po nim. To jest naprawdę trudne do zrobienia w kontekście strumieniowym, gdzie turę mówcy można zidentyfikować dopiero po usłyszeniu wystarczającej jej części, a 17,5% to prawdziwa liczba z prawdziwym zastrzeżeniem: jest to liczba samej Meta, uśredniona po zbiorze ewaluacyjnym wybranym przez Meta.
Model SpaceXAI obejmuje diaryzację bez dodatkowych kosztów, a także obsługuje do ośmiu niezależnych kanałów audio w pojedynczym żądaniu, co jest innym sposobem rozwiązania tego samego problemu — jeśli Twoje audio przychodzi jako osobne kanały dla poszczególnych uczestników, co często ma miejsce w telefonii centrów kontaktowych, separacja kanałów jest bardziej niezawodna niż diaryzacja i w ogóle nie wymaga wskaźnika błędów. Jeśli Twoje audio przychodzi jako jeden zmiksowany strumień, jesteś zależny od jakości diaryzacji, a tylko jeden z tych dwóch dostawców powiedział Ci, jaka ona jest.
Warto odnotować różnicę drugiego rzędu: Muse Voice Transcribe traktuje diaryzację, transkrypcję i detekcję punktów końcowych jako jeden model dający jeden wynik, co oznacza, że komponenty nie mogą zawieść niezależnie. Grok Voice Transcribe 2.0 pozwala traktować kanały, kluczowe terminy i diaryzację jako osobne dźwignie. Pojedynczy model jest prostszy w uruchomieniu i trudniejszy w debugowaniu.

Języki oraz to, gdzie dwie karty modeli przestają być porównywalne
Meta wytrenowała Muse Voice Transcribe na ponad 70 językach i zweryfikowała 25 z nich dogłębnie podczas premiery, z natywnym przełączaniem kodów wewnątrz zdań i między nimi oraz obsługą nagrań dłuższych niż godzina. Grok Voice Transcribe 2.0 obsługuje automatyczne wykrywanie języka z przełączaniem w trakcie nagrywania i stosuje odwrotną normalizację tekstu — mówione daty, waluty, numery telefonów i adresy e-mail zapisywane w formie pisemnej — w 25 językach.
Część wspólna to 25 języków wszechstronnie zweryfikowanych po jednej stronie i 25 języków normalizacyjnych po drugiej, a te dwa zbiory to nie te same 25 i żaden z dostawców nie opublikował tej listy. „70+ wytrenowanych języków” i „25 języków z obsługą formatowania” to nie są porównywalne twierdzenia i nie należy ich od siebie odejmować. Można natomiast powiedzieć, że Meta formułuje szersze twierdzenie dotyczące wielu języków, a SpaceXAI – węższe, ale bardziej operacyjne: wykrycie języka to warunek konieczny, a sformatowanie tego, co usłyszał model, w coś, co system dalszego przetwarzania może sparsować, to część, która psuje integracje, gdy jej brakuje.
Wybór i powód, dla którego możesz nie być tym, kto go dokona.
Odłóż marketing na bok, a decyzja sprowadza się do trzech zdań. Wybierz Muse Voice Transcribe, jeśli transkrypcja jest odbierana na żywo podczas rozmowy, bo 0,16 sekundy to nie detal. Wybierz Grok Voice Transcribe 2.0, jeśli masz nagrane audio w dużej ilości, bo połowa ceny wsadowej też nie jest detalem. Jeśli nie potrzebujesz żadnej z tych skrajności, wybierz na podstawie tego, co jeszcze cię ogranicza — regionu, umowy, istniejącej integracji — bo różnica w dokładności tego nie rozstrzygnie.
Komplikacja polega na tym, że jeden z tych dwóch modeli nie jest tak naprawdę na sprzedaż w zwykłym tego słowa znaczeniu. Muse Voice Transcribe istnieje po to, aby własny asystent Meta wydawał się szybki, a jest dostępny przez Meta Model API głównie dlatego, że Meta uznała, iż wartość ekosystemowa ekspozycji przewyższa wartość ekskluzywności. To może się zmienić i to szybko: Meta spędziła ten sam tydzień na otwieraniu platformy konektorów Muse dla deweloperów zewnętrznych, co oznacza firmę inwestującą we własny kanał dystrybucji, a nie starającą się być neutralnym dostawcą dla wszystkich innych. Budowanie produkcyjnej zależności od wewnętrznego modelu konkurenta to zakład, że warunki się nie zmienią, a ten zakład ma złą historię.
Ta asymetria jest argumentem przeciwko zakodowaniu na sztywno któregokolwiek z nich. OrcaRouter udostępnia ponad 200 modeli za pojedynczym kluczem zgodnym z OpenAI, z automatycznym przełączaniem awaryjnym między dostawcami i 0% narzutu względem ceny katalogowej dostawcy — więc gdy SpaceXAI przełączy wartość domyślną na 2.0 i wycofa 1.0, albo gdy Meta zmieni pozycjonowanie swojego API mowy, zmiana sprowadza się do ciągu znaków modelu, a nie do projektu migracji. W kategorii, w której lider zmieniał się dwukrotnie w ciągu trzech tygodni, warstwa routingu jest tą częścią stosu, która powinna być stabilna, a model — tą, która stabilna być nie powinna.

Jedna rzecz, na którą warto zwrócić uwagę w nadchodzącym miesiącu: czy Artificial Analysis ponownie zmierzy Muse Voice Transcribe na tablicy streamingowej, skoro Grok Voice Transcribe 2.0 wyparł go z niej. Oba wyniki – 3,1% Meta i 2,7% SpaceXAI – podano na premierze, ale tylko wynik SpaceXAI został niezależnie sklasyfikowany. Jeśli wynik Meta się utrzyma, gdy ktoś powtórzy pomiar, różnica w dokładności jest tak mała, jak wygląda, a różnica w opóźnieniu decyduje o wszystkim. Jeśli nie, siedemnastodniowe panowanie było całą historią.
