Karta hero artykułu z napisem „MAI-Transcribe-2-Streaming vs MAI-Transcribe-2”, plakietką „TA SAMA RODZINA · DWA PROGI CENOWE” i podtytułem „Zapłać 5,4x za timing na poziomie słów”, zbudowana jako dwie karty z nazwami modeli rozdzielone plakietką VS, z paskiem chipów pokazującym 9,00 USD wobec 1,67 USD za 1000 minut, deklarowany współczynnik błędów słów 2,5% wobec audytowanego 2,0%, 0,13 s do końcowego transkryptu wobec około 411x czasu rzeczywistego oraz znaczniki czasu i diaryzacja wyłącznie w wariancie wsadowym, na tle gradientu od bieli do błękitu z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

MAI-Transcribe-2-Streaming vs MAI-Transcribe-2: Zapłać 5,4× za znaczniki czasowe na poziomie słów

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

MAI-Transcribe-2-Streaming i MAI-Transcribe-2 to ta sama rodzina modeli podzielona na dwa poziomy cenowe, a podział jest na tyle klarowny, że można na jego podstawie planować. MAI-Transcribe-2 został wydany 3 września 2026 jako model wsadowy: 2,0% współczynnika błędów słów na tablicy non-streaming Artificial Analysis, około 411× szybciej niż w czasie rzeczywistym i 0,10 USD za godzinę audio — około 1,67 USD za 1000 minut. MAI-Transcribe-2-Streaming został wydany 1 października 2026 jako wariant czasu rzeczywistego: deklarowany współczynnik błędów słów w trybie strumieniowym na poziomie 2,5% przy 0,13 sekundy do końcowego transkryptu, który Microsoft opisuje jako pierwszy pod względem dokładności zarówno dla końcowych, jak i częściowych transkryptów, mierzony metodologią strumieniową Artificial Analysis, a jeszcze nie umieszczony jako wiersz na tablicy trackera. 0,54 USD za godzinę audio — około 9,00 USD za 1000 minut. Te same 60 języków, ta sama dystrybucja wyłącznie przez API, brak opublikowanych wag. Strumieniowanie kosztuje 5,4× stawkę wsadową i, według własnych danych Microsoftu, 0,5 punktu dokładności. To, czy to okazja, czy podatek, zależy wyłącznie od jednego pytania: czy cokolwiek w twoim potoku potrzebuje transkryptu, zanim zdanie się skończy?

Ponieważ oba modele pochodzą od jednego dostawcy i z jednej dokumentacji, porównanie jest wyjątkowo przejrzyste — bez zgadywania, czy funkcje są równoważne, bez niezgodności wersji benchmarków, bez „ich wyniki kontra nasze wyniki”. To jeden dostawca wyceniający dwie prędkości tej samej możliwości, a ciekawa praca polega na ustaleniu, które obciążenia faktycznie obejmuje tańszy poziom.

Rodzina, w dwóch rzędach

• MAI-Transcribe-2 — przetwarzanie wsadowe, wcześniej nagrane audio, wydany 3 września 2026. 2,0% AA-WER, drugie miejsce na liście rankingowej modeli nieprzesyłających strumieniowo Artificial Analysis. Około 411× szybciej niż czas rzeczywisty, również drugie miejsce. 0,10 USD za godzinę audio, około 1,67 USD za 1000 minut, w ramach oferty ograniczonej czasowo do końca roku, bez opublikowanej ceny standardowej. Łączy diaryzację mówców i zwraca znaczniki czasu na poziomie słów. 60 języków z automatyczną identyfikacją języka.

• MAI-Transcribe-2-Streaming — transkrypcja ciągła w czasie rzeczywistym w stylu WebSocket, wydana 1 października 2026 r. Microsoft podaje 2,5% WER końcowej transkrypcji po 0,13 sekundy od zakończenia mowy oraz takie samo 2,5% przy pierwszym wyniku częściowym po 0,12 sekundy, co opisuje jako pierwszeństwo pod względem dokładności w obu tych przypadkach — to twierdzenie producenta zmierzone metodologią strumieniową Artificial Analysis, choć w chwili pisania własna tablica tego trackera (37 modeli) nie uwzględniła jeszcze tego modelu, a jej obecnym liderem jest Grok Voice Transcribe 2.0 z wynikiem 2,73% i 0,49 sekundy. 0,54 USD za godzinę audio, około 9,00 USD za 1000 minut, w cenie wprowadzeniowej do końca roku. 60 języków z automatycznym ciągłym wykrywaniem języka. Brak opublikowanych deklaracji dotyczących diaryzacji, brak opublikowanych deklaracji dotyczących znaczników czasu poszczególnych słów.

Jedyna asymetria, która nie dotyczy szybkości ani ceny, to możliwości: diaryzacja i znaczniki czasu słów w modelu wsadowym są udokumentowanymi funkcjami, a w modelu strumieniowym nie są. Ma to większe znaczenie niż 0,5-punktowa różnica w dokładności i jest powodem, dla którego wiele zespołów ostatecznie będzie używać obu.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

Co faktycznie daje 5.4×

Przy 1,67 USD za 1000 minut transkrypcja wsadowa na tym poziomie dokładności ma koszt krańcowy bliski zeru. Przy 9,00 USD za 1000 minut transkrypcja strumieniowa to realna pozycja kosztowa — mniej więcej tyle, ile kosztowałoby pięciokrotne transkrybowanie tego samego nagrania, plus pół punktu procentowego dokładności. Nie chodzi więc o to, czy transkrypcja w czasie rzeczywistym jest warta więcej; chodzi o to, które konkretne minuty jej potrzebują.

Obciążenia, w których jest to wyraźnie widoczne: napisy na żywo, które osoba czyta, podczas gdy mówca mówi, gdzie 0,13 sekundy w porównaniu z końcem pliku to cały produkt; asysta agenta w czasie rzeczywistym i ocena zgodności, gdzie interwencja, która dociera po zakończeniu rozmowy, jest bezwartościowa; oraz interaktywne aplikacje głosowe, w których tura nie może się zakończyć, dopóki nie zakończy się transkrypcja. We wszystkich trzech model wsadowy nie jest tańszą opcją, lecz opcją wykluczoną — nie ma ceny, przy której transkrypcja po fakcie staje się transkrypcją w czasie rzeczywistym.

Zadania, w których wyraźnie nie ma zastosowania: nagrania spotkań i połączeń przetwarzane po fakcie, archiwa multimediów, wsadowa kontrola jakości (QA) w centrach kontaktowych, przegląd zgodności zakończonych połączeń, tworzenie napisów do podcastów i filmów. To dokładnie te potoki przetwarzania, w których model wsadowy z prędkością 411× czasu rzeczywistego i stawką 1,67 USD miał zwyciężać, a płacenie 5,4× więcej, żeby skrócić o kilkaset milisekund transkrypcję, której nikt nie przeczyta do jutra, jest zwykłym marnotrawstwem. Dodaj funkcje diaryzacji i znaczników czasu słów — model wsadowy ma je udokumentowane, model strumieniowy nie — a argument za przetwarzaniem po fakcie staje się mocniejszy, nie słabszy.

Najciekawszy jest środek, w którym te dwa rozwiązania naprawdę się uzupełniają: uruchamiaj strumieniowanie dla warstwy na żywo, a przetwarzanie wsadowe dla zapisu. Rozmowa z obsługą transkrybowana w czasie rzeczywistym, aby zasilać panel wspomagający agenta, a następnie ponownie transkrybowana wsadowo przez noc w celu utworzenia archiwalnego zapisu z diaryzacją i znacznikami czasu, kosztuje niewielką dopłatę względem samego przetwarzania wsadowego i daje oba zachowania. Taki wzorzec stał się możliwy dopiero we wrześniu, a wydanie z października jest tym, co go dopełnia.

Gdzie ujawnia się struktura dwóch dywizji

Dwie rzeczy dotyczące tej rodziny są warte zauważenia, ponieważ mają charakter strukturalny, a nie przypadkowy.

Po pierwsze, hierarchia dokładności jest odwrócona względem zwykłego wzorca. Modele strumieniowe zwykle płacą znaczący koszt dokładności za wyniki w czasie rzeczywistym; tutaj koszt ten wynosi 0,5 punktu, z 2,0% w rankingu wsadowym do deklarowanych 2,5% w strumieniowym. Microsoft uzyskał model czasu rzeczywistego w granicach pół punktu od swojego flagowego modelu wsadowego według własnych danych, co jest rzeczywistym osiągnięciem inżynieryjnym październikowego wydania, jeśli się utrzyma — a nie miejscem na szczycie tabeli, które dobry ponowny przebieg mógłby przesunąć, a którego tracker jeszcze nie potwierdził.

Po drugie, również struktura cen jest odwrócona względem typowego schematu. Dostawcy zwykle udzielają rabatu na wyższy próg wolumenowy; Microsoft wycenił streaming na 5,4× stawki batch i pozostawił obie na stawkach wprowadzających, które wygasają w tym samym czasie. To wygląda mniej jak zamierzona premia za streaming, a bardziej jak dwie osobne premiery, z których każda obejmuje rabat premierowy, bez opublikowanej standardowej stawki dla żadnej z nich. Zespoły planujące budżet na 2027 r. powinny traktować obie liczby jako tymczasowe — zarówno 1,67 USD, jak i 9,00 USD oznaczono jako oferty ograniczone czasowo, a dla żadnej z nich nie ogłoszono ceny zastępującej.

A generated two-column scoreboard card titled 'One family, two divisions' contrasting MAI-Transcribe-2 (batch) — non-streaming, 2.0% AA-WER at #2, roughly 411x real time at #2, $1.67 per 1,000 minutes ($0.10 per audio-hour), bundled diarization, returned word timestamps, 60 languages with automatic ID, released September 3, 2026 — with MAI-Transcribe-2-Streaming — streaming, 2.5% claimed word error rate, 0.13s to final transcript, $9.00 per 1,000 minutes ($0.54 per audio-hour), diarization not published, word timestamps not published, 60 languages with continuous detection, released October 1, 2026, with the OrcaRouter logo bottom right.

Co nie zostało jeszcze udowodnione.

Otwarte pytania z września dotyczące modelu wsadowego wciąż pozostają otwarte: brak opublikowanego wskaźnika błędu diaryzacji, brak rozbicia na poszczególne języki stojącego za twierdzeniem o 60 językach oraz cena promocyjna bez wskazanego następcy. Model strumieniowy dodaje jeszcze jedno, charakterystyczne dla pracy w czasie rzeczywistym — WER strumieniowania mierzy się na czystym dźwięku, a jakość częściowego transkryptu w zaszumionym strumieniu z pola dalekiego to tryb awarii, który ma największe znaczenie we wdrożeniu i jest najsłabiej omówiony w materiałach premierowych. Odziedziczył również bliskość wyników na tablicy strumieniowej: pierwsza trójka na tablicy trackera z 37 modelami mieści się w ułamku punktu, więc „pierwsze miejsce” to stan, który może zmienić ponowny przebieg — a pierwsze miejsce Microsoftu jest twierdzeniem, a nie wierszem.

Pytanie na poziomie rodziny jest jednak tym, na które warto zwrócić uwagę. Microsoft sprzedaje teraz tę samą możliwość w dwóch cenach różniących się pięciokrotnie, przy czym w droższym poziomie brakuje dwóch funkcji, które tańszy poziom wymienia w dokumentacji. Jeśli diaryzacja i znaczniki czasu słów pojawią się w SKU strumieniowym, luka zwęzi się do czystego kompromisu między opóźnieniem a ceną, co jest znacznie prostszą decyzją. Jeśli nie, struktura dwudywizyjna jest trwała i architektury należy budować wokół niej.

Gdzie to pozostawia stos transkrypcji

A generated routing card titled 'Which minutes go on which tier' splitting workloads into a streaming column (live captions a person reads while the speaker talks, real-time agent assist, compliance or quality scoring that must land before the call ends, interactive voice turns) and a batch column (meeting and call recordings processed after the fact, media archives, contact-centre batch QA, podcast and video captioning, anything needing bundled diarization or word-level timestamps), with a note that a stream-and-reprocess pattern covers both and a footer stating that neither tier is on OrcaRouter and both are served through Microsoft's own speech stack, with the OrcaRouter logo bottom right.

Praktyczny wniosek jest taki, że we wrześniu transkrypcja przestała być pojedynczą pozycją na liście, a w październiku stała się decyzją o routingu. Pipeline, który kiedyś standaryzował się na jednym API, teraz chce streamingu dla warstwy na żywo, przetwarzania wsadowego dla archiwum i reguły określającej, które nagranie audio trafia którą ścieżką — a ta reguła sama w sobie jest problemem routingu, co stanowi dziwną ilość złożoności, jaka ma się zmieścić w jednym cyklu wydawniczym jednego dostawcy.

Najmocniej odbija się to na tym, co znajduje się powyżej transkryptu. Niezależnie od tego, która warstwa wygeneruje tekst, jest on następnie streszczany, klasyfikowany, redagowany i kierowany, a te kroki działają na modelach językowych z własnymi profilami opóźnień i kosztów — transkrypcja na żywo potrzebuje szybkiego, taniego modelu, a archiwalna może pozwolić sobie na mocniejszy. OrcaRouter obejmuje dokładnie tę warstwę: jedno API dla ponad 200 modeli, ceny katalogowe dostawców przekazywane bez marży (0%), automatyczne przełączanie awaryjne oraz DSL routingu, który wybiera model dla danego obciążenia, a nie dla danego potoku. Ani MAI-Transcribe-2-Streaming, ani MAI-Transcribe-2 nie znajdują się na tej liście — oba są obsługiwane przez własny stos technologii mowy Microsoftu — ale dwudzielna warstwa transkrypcji to najsilniejszy jak dotąd argument za tym, by wszystko poniżej niej pozostało przenośne.

Uczciwe podsumowanie: streaming to nie lepszy MAI-Transcribe-2, to drugi produkt w drugiej cenie. Kupuj go na te minuty, które naprawdę muszą być w czasie rzeczywistym, a resztę zostaw w tańszym planie — i zaplanuj budżet z myślą o tym, że obie stawki zostaną ponownie wycenione, gdy skończy się okres wprowadzający.