Karta hero artykułu z napisem „MAI-Transcribe-2-Streaming Is Live” i plakietką „NOWY MODEL · MICROSOFT AI” oraz podtytułem „Microsoft zdobywa koronę transkrypcji strumieniowej przy 2,5% WER”, z paskiem statystyk pokazującym 2,5% strumieniowy współczynnik błędów słów przy 0,13 s po zakończeniu mowy, oznaczonym na karcie jako twierdzenie Microsoftu i pierwszy zarówno w przypadku transkrypcji końcowych, jak i częściowych; 60 języków z automatycznym ciągłym wykrywaniem języka; oraz 9,00 USD za 1000 minut, opisywane jako 0,54 USD za godzinę audio w cenie promocyjnej do 2026 r.; na gradiencie od białego do niebieskiego z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

MAI-Transcribe-2-Streaming jest już dostępny: Microsoft zdobywa koronę transkrypcji strumieniowej przy 2,5% WER

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

MAI-Transcribe-2-Streaming to odpowiedź Microsoft AI na jedno pytanie, które pozostawiło otwarte wrześniowe wydanie Microsoft AI, a odpowiedź nadeszła w 28 dni. Wydany 1 października 2026 r. MAI-Transcribe-2-Streaming to model zamiany mowy na tekst działający w czasie rzeczywistym, który transkrybuje w miarę napływania słów, a nie po zakończeniu pliku. Microsoft twierdzi, że zajmuje pierwsze miejsce pod względem dokładności zarówno w przypadku transkrypcji końcowych, jak i częściowych w ewaluacji AA-WER Streaming firmy Artificial Analysis, przy współczynniku błędów słów na poziomie 2,5%, a transkrypcja końcowa jest gotowa 0,13 sekundy po zakończeniu mowy. To twierdzenie dostawcy oparte na metodologii trackera, a nie wiersz publikowany przez tracker — w chwili pisania nie ma go wśród 37 modeli w rankingu, a model, który miałby go wyprzeć, to Gro​k Voice Transcribe 2.0 (Streaming) z wynikiem 2,73% i 0,49 sekundy. Model, na którym jest zbudowany, MAI-Transcribe-2, został wydany 3 września jako model wsadowy o WER 2,0%, bez SKU czasu rzeczywistego; wariant strumieniowy zamyka tę lukę, nie tracąc wiele z dokładności, która uczyniła wersję wsadową godną uwagi. To, z czego rezygnuje, to cena: w momencie premiery strumieniowanie jest 5,4× droższe od stawki wsadowej.

Narracja, jakiej chce Microsoft, to kompletne zwycięstwo na tablicy wyników streamingu. Narracja, którą wspierają liczby, jest węższa i ciekawsza — model, który twierdzi, że prowadzi jednocześnie pod względem dokładności i opóźnienia, na froncie, gdzie najdokładniejsza pozycja na tablicy potrzebuje cztery razy więcej czasu, by się ustabilizować, niż najszybsze z nich, a żadna z tych szybkich nie ma wskaźnika błędów słów poniżej 3%, w cenie takiej samej jak dotychczasowy dostawca, a nie niższej od niego. Oto ta premiera, tak jak się odbyła, z oznaczonymi twierdzeniami dostawcy.

Co Microsoft wydał 1 października

MAI-Transcribe-2-Streaming jest udostępniany przez stos mowy Microsoftu w usłudze Azure AI Speech, z dokumentacją pod własną nazwą modelu i tym samym modelem dystrybucji wyłącznie przez API, bez wag, co w wersji wsadowej. Transkrybuje 60 języków z automatycznym ciągłym wykrywaniem języka, więc sesja, która przełącza języki w trakcie strumienia, nie musi być deklarowana z góry. Microsoft pozycjonuje go na granicy Pareto dokładności i opóźnienia na wykresie strumieniowym Artificial Analysis — to odczyt danych trackera dokonany przez dostawcę i odczyt, który wspiera sam wykres trackera.

Model strumieniowy nie był całym wydaniem. Microsoft dostarczył wraz z nim dwa modele głosowe: MAI-Voice-2.1, obejmujący 23 języki w 26 lokalizacjach, oraz MAI-Voice-2.1-Flash, który obsługuje do 45 sekund dźwięku przy opóźnieniu około 150 ms. Jeśli rozpatrywać to jako zestaw, premiera z 1 października to kompletny stos konwersacyjny w czasie rzeczywistym — słyszeć, rozumieć, mówić — a nie premiera pojedynczego modelu.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models as accurate, fast and low cost, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

Odczytywanie rankingu streamingu

AA-WER Streaming mierzy dwie rzeczy dla każdego modelu: jak błędny jest gotowy transkrypt oraz ile czasu po tym, jak mówiący przestaje mówić, zajmuje jego ukończenie. Twierdzenie Microsoftu jest takie, że MAI-Transcribe-2-Streaming prowadzi pod oboma względami: 2,5% wskaźnika błędów słów w końcowym transkrypcie przy 0,13 sekundy po zakończeniu mowy oraz te same 2,5% w pierwszym częściowym transkrypcie przy 0,12 sekundy, co według Microsoftu jest pierwszym miejscem pod względem dokładności w obu przypadkach. Traktuj to jako dane dostawcy — na etapie pisania tego tekstu własna tablica wyników streamingowych trackera nie umieściła jeszcze tego modelu, więc nie ma niezależnego wiersza MAI-Transcribe-2-Streaming do odczytania. To, co tablica faktycznie pokazuje, to konkurencja, którą model twierdzi, że wyprzedza, a konkurencja jest bliżej, niż sugeruje przedstawianie tego w kategoriach „korony”:

• Grok Voice Transcribe 2.0 — 2,73% WER końcowego transkryptu po 0,49 sekundy od zakończenia mowy, według Artificial Analysis, i obecny lider rankingu. To wynik o 0,23 punktu gorszy od deklarowanego przez Microsoft 2,5% i około cztery razy wolniejszy w ustalaniu — różnica między napisami, które nadążają, a tymi, które zostają z tyłu.

• Muse Voice Transcribe — 3,06% przy 0,16 sekundy, według Artificial Analysis. Najbliższy konkurent pod względem opóźnienia: około 30 milisekund za nim i o 0,5 punktu gorszy pod względem dokładności niż deklaracja Microsoftu.

• ElevenLabs Scribe v2 Realtime — 3,59% przy 0,14 sekundy według Artificial Analysis. W praktyce remis pod względem szybkości, ponad punkt straty pod względem dokładności.

Gemini 3.5 Transcribe Live — 4,00% WER w trybie strumieniowym przy 0,40 sekundy, wartość opublikowana przez Artificial Analysis i cytowana przez Google dla jego własnego modelu Live API. To różnica 1,5 punktu i właśnie na tym porównaniu skupia się to wydanie.

Kolumna pierwszych wyników częściowych to miejsce, w którym twierdzenie najmniej przypomina resztę tabeli. W tym samym trackerze pierwsze wyniki częściowe Grok Voice Transcribe 2.0 wynoszą 3,36%, a Gemini 3.5 Transcribe Live — 5,77% — wyniki częściowe powinny być gorsze od końcowego zapisu, często o punkt lub więcej, ponieważ model zatwierdza wynik, zanim zdanie się skończy. Pierwszy wynik częściowy zgodny z końcowym wynikiem to naprawdę nietypowa część premiery Microsoftu i to właśnie tej części własne dane trackera nie mogą jeszcze potwierdzić. Traktuj to jako twierdzenie, dopóki nie pojawi się wiersz.

Szczere zastrzeżenie jest takie, że 0,13 sekundy i 0,16 sekundy to dla człowieka czytającego napisy takie samo doświadczenie produktu, a 2,5% wobec 2,73%, które obecnie prowadzi w tabeli, to około dwóch błędów na 1000 słów. Przewaga tej wielkości jest realna, ale niewielka, a to, czy jest to przewaga, którą ktokolwiek może odczuć, zależy od obciążenia. To, co naprawdę boli, to ogon: strumień z centrum kontaktowego działający osiem godzin dziennie na poziomie 2,73% wobec 2,5% to dziesiątki tysięcy dodatkowych błędnych słów rocznie, a błędy słów w transkrypcji nie rozkładają się równomiernie — skupiają się dokładnie na tych nazwach własnych i liczbach, które czynią transkrypcję użyteczną.

A generated comparison card titled 'The streaming field, by the numbers' with a left column for MAI-Transcribe-2-Streaming (final-transcript word error rate 2.5% flagged as Microsoft's claim, time to final transcript 0.13s after speech end, first-partial word error rate 2.5% at 0.12s flagged as claimed, $9.00 per 1,000 minutes introductory, 60 languages with automatic detection, and 'not yet plotted' for the tracker's board) and a right column headed 'The field it claims to beat' listing Grok Voice Transcribe 2.0 at 2.73% and 0.49s, Muse Voice Transcribe at 3.06% and 0.16s, ElevenLabs Scribe v2 Realtime at 3.59% and 0.14s, Qwen3 ASR Flash Realtime at 3.73% and 0.48s, Gemini 3.5 Transcribe Live at 4.00% and 0.40s, and a board size of 37 models, with a footer noting that Microsoft's figures are the vendor's own claim measured on Artificial Analysis's streaming methodology while the right-hand column is what Artificial Analysis currently publishes, all times being after detected end of speech, and the OrcaRouter logo bottom right.

Co można kupić za 9,00 USD na 1 000 minut

Strumieniowanie jest droższe niż przetwarzanie wsadowe, a Microsoft wycenił je na górze kategorii czasu rzeczywistego, a nie poniżej niej. MAI-Transcribe-2-Streaming figuruje w cenniku na poziomie 0,54 USD za godzinę audio, co daje 9,00 USD za 1000 minut strumieniowanego audio; stawka jest opisana jako wprowadzająca i ważna do końca roku. Dla porównania, wsadowy MAI-Transcribe-2 kosztuje 0,10 USD za godzinę audio — 1,67 USD za 1000 minut — więc transkrypcja w czasie rzeczywistym kosztuje około 5,4× stawki za przetwarzanie plikowe w tej samej rodzinie bazowej i wiąże się z o 0,5 punktu wyższym wskaźnikiem błędów słów. To nie jest narzut, który Microsoft ukrywa; to uczciwa cena stałego połączenia i częściowej transkrypcji, która musi być poprawna, zanim zdanie się skończy.

Na tle reszty segmentu streamingowego obraz jest mieszany. MAI-Transcribe-2-Streaming dorównuje Gemini 3.5 Transcribe Live przy około 9 USD za 1000 minut — większa dokładność, ta sama cena. Znajduje się powyżej ElevenLabs Scribe v2 Realtime i Deepgram Flux przy około 6,50 USD za 1000 minut, powyżej Cartesia Ink-2 przy około 4 USD i około trzykrotnie przewyższa Muse Voice Transcribe przy około 3 USD. Premiera jest więc zagraniem na dokładność i opóźnienie przy parytetowej cenie, a nie wojną cenową; zespoły, które już korzystają z tańszego modelu streamingowego, będą wymieniać dolary na punkty WER.

Ten kompromis wart jest precyzyjnego nazwania, bo to ten sam kompromis, który odwróciło uruchomienie trybu wsadowego. We wrześniu Microsoft sprawił, że dokładność stała się tania. W październiku sprawił, że dokładność w czasie rzeczywistym kosztowała tyle samo co u wszystkich innych. Jeśli twój potok potrzebuje transkrypcji dopiero z czasem, nic związane z 1 października nie zmienia twojego rachunku. Jeśli potrzebuje ich, gdy rozmowa wciąż trwa, kalkulacja właśnie przesunęła się w stronę jakości.

A single-column scoreboard card titled 'MAI-Transcribe-2-Streaming — the launch scoreboard' listing 2.5% final-transcript WER at 0.13s, 2.5% first-partial WER at 0.12s, an accuracy rank claimed at #1 for final and partial transcripts, tracker status 'not yet plotted on the 37-model board', $9.00 per 1,000 minutes ($0.54 per audio-hour) introductory through 2026, 60 languages with automatic continuous detection, no published diarization or word-level timestamp claim for the streaming SKU, and the batch sibling MAI-Transcribe-2 at 2.0% AA-WER, roughly 411x real time and $1.67 per 1,000 minutes, with the OrcaRouter logo bottom right.

Budowanie na transkrypcji to druga połowa tej decyzji i właśnie tam warstwa wielu modeli uzasadnia swoje istnienie. Transkrypcja w czasie rzeczywistym rzadko jest końcem potoku — jest podsumowywana, oceniana, przeszukiwana, kierowana i eskalowana, a te kroki wymagają różnych modeli przy różnych kosztach. OrcaRouter istnieje dla tej warstwy: jedno API obejmujące ponad 200 modeli, ceny katalogowe dostawców przekazywane dalej przy 0% marży, automatyczne przełączanie awaryjne oraz DSL routingu, który potrafi wysłać transkrypcję na żywo do jednego modelu w celu kontroli zgodności, a do innego — w celu tworzenia notatek ze spotkania, bez konieczności drugiej integracji. Sam MAI-Transcribe-2-Streaming nie znajduje się na tej liście — jest udostępniany przez własny stos technologii mowy Microsoftu — ale transkrypcja strumieniowa, którą generuje, to dokładnie ten rodzaj danych wejściowych o dużym wolumenie i wrażliwych na opóźnienia, który przemawia za utrzymaniem warstwy powyżej niej jako niezależnej od modeli.

Co nie zostało jeszcze udowodnione.

Trzy kwestie pozostają naprawdę nierozstrzygnięte. Po pierwsze, diaryzacja: model wsadowy zawiera przypisanie mówcy, ale nie podano dla niego współczynnika błędu diaryzacji, a materiały Microsoftu dotyczące strumieniowania w ogóle nie zawierają twierdzenia o diaryzacji — w przypadku modelu czasu rzeczywistego zasilającego asystę dla agentów na żywo lub napisy, kto co powiedział to często funkcja ważniejsza niż surowy WER. Po drugie, podział wielojęzyczny: 60 języków z automatycznym ciągłym wykrywaniem języka to szerokie twierdzenie, a opóźnienie modelu strumieniowego dla poszczególnych języków może się różnić znacznie bardziej niż w modelu wsadowym, ponieważ jakość częściowej transkrypcji zależy od tego, jak szybko model zdecyduje się na język. Microsoft nie opublikował tabeli strumieniowania dla poszczególnych języków. Po trzecie, WER strumieniowania mierzy się na czystym dźwięku benchmarkowym; trybem awarii, który szkodzi rzeczywistym wdrożeniom, jest zaszumiony strumień far-field, a w dniu premiery nie istniało niezależne porównanie strumieniowania far-field.

Gdzie to pozostawia twój stack

Ciekawe w tej premierze nie jest to, że Microsoft ma najdokładniejszą transkrypcję strumieniową. Ciekawy jest rytm: tryb wsadowy we wrześniu, strumieniowy w październiku, w tej samej rodzinie, w tej samej dokumentacji, ze strukturą cenową, która obejmuje teraz od 1,67 USD do 9,00 USD za 1000 minut za tę samą podstawową funkcję. To po raz pierwszy daje zespołom realny wybór — płacić za czas rzeczywisty tylko tam, gdzie ma on znaczenie, a wszystko inne przetwarzać wsadowo — ale oznacza też, że warstwa transkrypcji jest teraz czymś, co dostraja się do poszczególnych obciążeń, a nie standaryzuje raz na zawsze.

Jeśli czytać tezę z nagłówka dosłownie, trzyma się ona jako oświadczenie dostawcy: Microsoft twierdzi, że MAI-Transcribe-2-Streaming jest pierwszy zarówno pod względem dokładności końcowego transkryptu, jak i pierwszego częściowego, oraz że znajduje się na granicy Pareto. Gwiazdki oznaczają, że tablica trackera nie naniosła jeszcze tego modelu, przewaga, którą deklaruje nad obecnym liderem, jest na tyle mała, że może zniknąć przy ponownym przebiegu, przewaga cenowa wynosi zero, a historia diaryzacji nie została jeszcze opowiedziana. Na te rzeczy trzeba patrzeć, a nie na koronę.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie