Karta hero artykułu z tytułem „MAI-Transcribe-2 vs Muse Voice Transcribe”, plakietką „PORÓWNANIE MODELI” i podtytułem „W tym samym tygodniu dwa przeciwstawne zakłady na audio”, z chipami porównawczymi: tryb wsadowy 2.0% AA-WER wobec strumieniowania 3.1%, 1,67 USD wobec 3,00 USD za 1000 minut, a także 60 języków w trybie wsadowym wobec 20+ mówców w czasie rzeczywistym; całość umieszczona na tle z gradientem od bieli do błękitu, z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

MAI-Transcribe-2 vs Muse Voice Transcribe: Ten sam tydzień, dwa przeciwstawne zakłady na audio

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Tydzień rozpoczynający się 1 września 2026 roku przyniósł dwa modele mowy z dwóch czołowych laboratoriów, a MAI-Transcribe-2 i Muse Voice Transcribe najlepiej rozumieć jako przeciwstawne odpowiedzi na pytanie, gdzie powinna mieszkać inteligencja audio. Muse Voice Transcribe, wydany przez Meta Superintelligence Labs 1 września, to model percepcji audio działający w czasie rzeczywistym: transkrybuje, rozdziela ponad dwudziestu mówców i wykrywa, kiedy mówca skończył — wszystko w jednym strumieniowym przebiegu po 80-milisekundowych fragmentach dźwięku na żywo — i przoduje w rankingu strumieniowej zamiany mowy na tekst, na którym go zmierzono. MAI-Transcribe-2, wydany przez Microsoft dwa dni później, 3 września, to zakład przeciwny: silnik wsadowy, który w ogóle nie goni za opóźnieniem na żywo, a zamiast tego wkłada wszystko w transkrypcję wcześniej nagranych plików, osiągając najlepszy współczynnik błędów słownych w niezależnym rankingu trybu nie-strumieniowego, z grubsza 411× szybciej niż czas rzeczywisty, za około 1,67 dolara za 1 000 minut. Porównywanie ich bezpośrednio jako „modeli transkrypcyjnych" przesłania faktyczną decyzję, która dotyczy momentu w życiu dźwięku, w którym potrzebujesz słów: gdy on wciąż trwa albo gdy już się skończył.

Dwa produkty wskazane w różnych momentach.

Muse Voice Transcribe został stworzony z myślą o momencie, gdy dźwięk wciąż trwa. To autoregresyjny model multimodalny z rodziny Muse firmy Meta, który łączy trzy zadania w jednym przebiegu — automatyczne rozpoznawanie mowy, diaryzację ponad dwudziestu mówców oraz endpointing, czyli wykrywanie, że mówca zakończył wypowiedź, aby system mógł odpowiedzieć. Meta podaje, że końcowy transkrypt pojawia się około 0,16 sekundy po tym, jak mówca przestaje mówić, ze współczynnikiem błędów słownych na poziomie 3,1% dla tych końcowych transkryptów i 3,6% dla pierwszych wersji częściowych — to liczby, które Meta opublikowała w dniu premiery, opierając się na rankingu strumieniowania Artificial Analysis, i które nie zostały niezależnie potwierdzone w chwili pisania tego tekstu. Model obsługuje audio dłuższe niż godzinę w jednym strumieniu, przełącza języki w środku zdania i został wytrenowany na 70+ językach, z czego 25 zostało gruntownie zweryfikowanych przy premierze. Jego cena to 3,00 USD za 1000 minut audio, czyli około 0,18 USD za godzinę, za pośrednictwem Meta Model API. Meta potwierdziła, że wagi nie zostaną udostępnione.

MAI-Transcribe-2 jest stworzony z myślą o momencie, gdy audio jest już plikiem. Model Microsoftu osiąga 2,0% AA-WER na liście liderów Artificial Analysis dla przetwarzania niestrumieniowego — drugie miejsce i najlepszy wynik wśród zarządzanych interfejsów API do przetwarzania wsadowego — i działa z szybkością około 411× względem czasu rzeczywistego, co jest miarą przepustowości, a nie obietnicą niskiego opóźnienia. Transkrybuje w 60 językach z automatyczną identyfikacją języka, oferuje diarizację mówców, znaczniki czasowe na poziomie słów, biasing słów kluczowych oraz style dosłowny i oczyszczony, a także obsługuje przełączanie kodów, takie jak Hinglish i Spanglish. Jest dostępny przez Microsoft Foundry w publicznej wersji zapoznawczej oraz w MAI Playground w cenie 0,10 USD za godzinę audio w ramach ograniczonej czasowo oferty premiowej obowiązującej do końca roku; nie ogłoszono żadnego produktu strumieniowego. Wpis Microsoftu pozycjonuje go wprost jako narzędzie do długich form i audio wsadowego — czyli obciążeń, w których niskie opóźnienie modelu strumieniowego jest bezużyteczne, ale jego koszt za minutę już nie.

A two-column scoreboard titled 'MAI-Transcribe-2 vs Muse Voice Transcribe — the scoreboard': left column MAI-Transcribe-2 lists batch pre-recorded type, 2.0% AA-WER (non-streaming), ~411x real time, $1.67 early-bird per 1,000 minutes, 60 languages and bundled diarization with unpublished rate; right column Muse Voice Transcribe lists streaming real-time type, 3.1% streaming WER (Meta-reported), final latency ~0.16s, $3.00 per 1,000 minutes, 25 verified of 70+ languages and 20+ speaker in-stream diarization; footer notes the WER figures are not comparable and Muse figures are Meta-reported.

Dlaczego te dwie liczby dokładności nie są ze sobą sprzeczne

Naturalnym odruchem jest porównanie 2,0% z 3,1% i wskazanie zwycięzcy — a to byłoby błędem z dwóch powodów. Po pierwsze, liczby te dotyczą różnych zadań: 2,0% modelu MAI-Transcribe-2 to dokładność transkrypcji niestrumieniowej na wcześniej nagranym materiale audio, gdzie model może przeanalizować cały plik; 3,1% modelu Muse Voice Transcribe to dokładność transkrypcji strumieniowej na końcowych transkryptach, uzyskana pod warunkiem transkrybowania w miarę napływu dźwięku. Przetwarzanie strumieniowe jest trudniejszym problemem, dlatego ranking transkrypcji strumieniowej i ranking transkrypcji niestrumieniowej to osobne zestawienia z osobnymi wynikami. Po drugie, liczby te nie są równorzędne: wynik MAI-Transcribe-2 to pomiar modelu wykonany przez Artificial Analysis, wynik Muse Voice Transcribe to zaś opublikowany w dniu premiery raport Meta o tym, co zmierzyło Artificial Analysis — dane od producenta, bez niezależnego powtórzenia. Rzetelne stwierdzenie jest takie: oba modele to wiarygodne kandydatury na szczyty swoich rankingów, a żadna z tych liczb nie mówi nic o drugiej kategorii.

Prawdziwe porównanie rozgrywa się w diaryzacji, ponieważ to jedyna funkcja, którą oferują oba produkty, i jedyna, w której ich ambicje wyraźnie się różnią. Muse Voice Transcribe w ramach podstawowej funkcji przetwarzania strumieniowego rozróżnia ponad dwudziestu mówców; Meta podaje średni wskaźnik błędów diaryzacji mówców wynoszący 17,5% wobec zakresu 21,1–28,6%, który przypisuje konkurencji — znów są to dane raportowane przez Meta i niezweryfikowane. MAI-Transcribe-2 również ma wbudowaną diaryzację, ale Microsoft nie publikuje ani maksymalnej liczby mówców, ani żadnego wskaźnika błędów diaryzacji. W przypadku rozmowy dwóch osób oba produkty sprawdzają się dobrze, a różnica między nimi nie ma znaczenia. W przypadku dwunastoosobowej grupy fokusowej lub nagrania panelu dyskusyjnego Muse Voice Transcribe jest jedynym z tych dwóch produktów, dla którego w ogóle podano górny limit liczby mówców, a niezmierzona diaryzacja MAI-Transcribe-2 to najważniejszy powód, aby przetestować ten produkt, zanim powierzy mu się trudniejsze audio.

Porównanie cen, które ma sens.

Pod względem ceny oba rozwiązania są sobie bliższe, niż wynikałoby z przeciwstawienia trybu wsadowego strumieniowemu: zarówno 1,67 USD za 1000 minut (MAI-Transcribe-2, oferta early-bird), jak i 3,00 USD za 1000 minut (Muse Voice Transcribe) to dolna półka cenowa w segmencie zarządzanego rozpoznawania mowy. Porównanie ma jednak sens tylko w ramach jednej kategorii. W przypadku wsadowej transkrypcji wcześniej nagranych plików MAI-Transcribe-2 kosztuje mniej niż połowę ceny modelu zaprojektowanego natywnie pod strumieniowanie, oferując przy tym lepszy WER w trybie niestrumieniowym — ale przekazywanie nagranych plików do Muse Voice Transcribe miałoby sens tylko wtedy, gdyby ktoś celowo chciał wykorzystać jego strumieniowy potok, co nie jest efektywnym sposobem przetwarzania archiwum. W przypadku dźwięku z transmitowanych na żywo spotkań Muse Voice Transcribe to jedyny produkt opisany w tym artykule, który w ogóle się sprawdza; jego stawka 3,00 USD jest przy tym niższa niż ceny innych interfejsów API do transkrypcji w czasie rzeczywistym obecnych na rynku w chwili jego premiery — Gemini 3.5 Transcribe Live kosztuje około 9 USD za 1000 minut, a GPT Live Transcribe 17 USD — a do tego oferuje diaryzację ponad dwudziestu mówców, której tamte produkty nie mają. Najbardziej uczciwe podsumowanie cenowe brzmi następująco: Meta wyznaczyła niską cenę za strumieniowanie, Microsoft zaś jeszcze niższą za tryb wsadowy i obie te kwoty to ceny z okresu promocyjnego, które zmienią się, gdy każdy z producentów ogłosi swoją standardową stawkę.

Screenshot of the Artificial Analysis Speech-to-Text leaderboard summary table showing Word Error Rate and Median Speed Factor columns for models including MAI-Transcribe-2 and MAI-Transcribe-1.5 under Microsoft AI, alongside rows for ElevenLabs Scribe v2 and Gemini 3.5 Transcribe.

Które do którego audio

Jeśli Twoje audio jest na żywo — spotkania transkrybowane w czasie rzeczywistym, agenci głosowi, napisy na żywo, cokolwiek, gdzie słowa są potrzebne w trakcie ich wypowiadania — Muse Voice Transcribe to ten wybór i to bezdyskusyjnie. To jedyny tutaj model strumieniowy, rozdziela ponad dwudziestu mówców w jednym przebiegu i od pierwszego dnia został wyceniony tak, by wygrywać w tej kategorii. Jego słabości to te, które trzeba wziąć pod lupę podczas testów: wskaźniki dokładności i diaryzacji pochodzą od Meta, a tygodniowy model strumieniowy nie pokazał jeszcze, jak zachowuje się na nieczystym audio, które istnieje poza benchmarkami z premiery.

Jeśli Twój materiał audio to już pliki — archiwa, nagrania rozmów, biblioteki multimediów, cokolwiek przetwarzanego hurtowo — to MAI-Transcribe-2 jest lepszym wyborem pod każdym istotnym względem: ma niższy zmierzony WER, przepustowość mniej więcej o rząd wielkości większą i cenę za 1000 minut niższą niż w modelu strumieniowym. Jego ryzyka są lustrzanym odbiciem ryzyk Muse: cztery dni na rynku, brak SKU do streamingu, niezmierzona jakość diaryzacji oraz stawka early-bird, za którą stoi nieujawniona cena standardowa.

Strona startowa Microsoftu prezentująca MAI-Transcribe-2 wymienia funkcje, które Microsoft oferuje w pakiecie, a których streamingowy konkurent nie zapewnia w jednym przebiegu. To właśnie ten dokument należy sprawdzić, gdy decydujesz, które deklaracje dotyczą realnych funkcji produktu, a które wciąż pozostają obietnicami z benchmarków.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2 (dated September 3, 2026), showing the headline 'MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world' and the opening paragraph naming new features — diarization, configurable transcription styles, word-level timestamps — and comparisons against Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large and Scribe V2.

A jeśli transkrypt to tylko pierwsza połowa Twojego potoku, wybór między tymi dwoma ma mniejsze znaczenie niż wybór, jakiego dokonujesz ponad nimi. Audio ze spotkań na żywo transkrybowane przez Muse Voice Transcribe wciąż wymaga podsumowania, wyodrębnienia zadań do wykonania i przygotowania szkicu dalszych działań, zanim będzie użyteczne; zarchiwizowane rozmowy transkrybowane przez MAI-Transcribe-2 wciąż trzeba przeszukać, poddać redakcji lub przekierować do właściwego systemu niższego szczebla. To właśnie na tej warstwie platforma wielomodelowa udowadnia swoją wartość — jedno API OrcaRouter obejmujące ponad 200 modeli, z cenami katalogowymi dostawców przekazywanymi dalej z zerowym narzutem, pozwala dalszym etapom wywoływać inny model dla każdego rodzaju obciążenia w ramach jednej integracji, więc jeśli którykolwiek model mowy wygra w pilotażu, warstwa nad transkryptem nie musi być przebudowywana, by przełączyć się na inny model. Na tej liście nie ma dziś ani Muse Voice Transcribe, ani MAI-Transcribe-2 — każde z nich działa wyłącznie przez API swojego dostawcy. Zakład rozstrzygnięty w tym tygodniu jest węższy i bardziej użyteczny: zarówno transkrypcja w czasie rzeczywistym, jak i wsadowa właśnie stały się na tyle tanie, że czynnikiem różnicującym nie są już słowa — lecz to, co z nimi robisz.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube