
MAI-Transcribe-2-Streaming vs MAI-Transcribe-2: Zapłać 5,4× za znaczniki czasowe na poziomie słów
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 221 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
MAI-Transcribe-2-Streaming i MAI-Transcribe-2 to ta sama rodzina modeli podzielona na dwa poziomy cenowe, a podział jest na tyle klarowny, że można na jego podstawie planować. MAI-Transcribe-2 został wydany 3 września 2026 jako model wsadowy: 2,0% współczynnika błędów słów na tablicy non-streaming Artificial Analysis, około 411× szybciej niż w czasie rzeczywistym i 0,10 USD za godzinę audio — około 1,67 USD za 1000 minut. MAI-Transcribe-2-Streaming został wydany 1 października 2026 jako wariant czasu rzeczywistego: deklarowany współczynnik błędów słów w trybie strumieniowym na poziomie 2,5% przy 0,13 sekundy do końcowego transkryptu, który Microsoft opisuje jako pierwszy pod względem dokładności zarówno dla końcowych, jak i częściowych transkryptów, mierzony metodologią strumieniową Artificial Analysis, a jeszcze nie umieszczony jako wiersz na tablicy trackera. 0,54 USD za godzinę audio — około 9,00 USD za 1000 minut. Te same 60 języków, ta sama dystrybucja wyłącznie przez API, brak opublikowanych wag. Strumieniowanie kosztuje 5,4× stawkę wsadową i, według własnych danych Microsoftu, 0,5 punktu dokładności. To, czy to okazja, czy podatek, zależy wyłącznie od jednego pytania: czy cokolwiek w twoim potoku potrzebuje transkryptu, zanim zdanie się skończy?
Ponieważ oba modele pochodzą od jednego dostawcy i z jednej dokumentacji, porównanie jest wyjątkowo przejrzyste — bez zgadywania, czy funkcje są równoważne, bez niezgodności wersji benchmarków, bez „ich wyniki kontra nasze wyniki”. To jeden dostawca wyceniający dwie prędkości tej samej możliwości, a ciekawa praca polega na ustaleniu, które obciążenia faktycznie obejmuje tańszy poziom.
Rodzina, w dwóch rzędach
• MAI-Transcribe-2 — przetwarzanie wsadowe, wcześniej nagrane audio, wydany 3 września 2026. 2,0% AA-WER, drugie miejsce na liście rankingowej modeli nieprzesyłających strumieniowo Artificial Analysis. Około 411× szybciej niż czas rzeczywisty, również drugie miejsce. 0,10 USD za godzinę audio, około 1,67 USD za 1000 minut, w ramach oferty ograniczonej czasowo do końca roku, bez opublikowanej ceny standardowej. Łączy diaryzację mówców i zwraca znaczniki czasu na poziomie słów. 60 języków z automatyczną identyfikacją języka.
• MAI-Transcribe-2-Streaming — transkrypcja ciągła w czasie rzeczywistym w stylu WebSocket, wydana 1 października 2026 r. Microsoft podaje 2,5% WER końcowej transkrypcji po 0,13 sekundy od zakończenia mowy oraz takie samo 2,5% przy pierwszym wyniku częściowym po 0,12 sekundy, co opisuje jako pierwszeństwo pod względem dokładności w obu tych przypadkach — to twierdzenie producenta zmierzone metodologią strumieniową Artificial Analysis, choć w chwili pisania własna tablica tego trackera (37 modeli) nie uwzględniła jeszcze tego modelu, a jej obecnym liderem jest Grok Voice Transcribe 2.0 z wynikiem 2,73% i 0,49 sekundy. 0,54 USD za godzinę audio, około 9,00 USD za 1000 minut, w cenie wprowadzeniowej do końca roku. 60 języków z automatycznym ciągłym wykrywaniem języka. Brak opublikowanych deklaracji dotyczących diaryzacji, brak opublikowanych deklaracji dotyczących znaczników czasu poszczególnych słów.
Jedyna asymetria, która nie dotyczy szybkości ani ceny, to możliwości: diaryzacja i znaczniki czasu słów w modelu wsadowym są udokumentowanymi funkcjami, a w modelu strumieniowym nie są. Ma to większe znaczenie niż 0,5-punktowa różnica w dokładności i jest powodem, dla którego wiele zespołów ostatecznie będzie używać obu.

Co faktycznie daje 5.4×
Przy 1,67 USD za 1000 minut transkrypcja wsadowa na tym poziomie dokładności ma koszt krańcowy bliski zeru. Przy 9,00 USD za 1000 minut transkrypcja strumieniowa to realna pozycja kosztowa — mniej więcej tyle, ile kosztowałoby pięciokrotne transkrybowanie tego samego nagrania, plus pół punktu procentowego dokładności. Nie chodzi więc o to, czy transkrypcja w czasie rzeczywistym jest warta więcej; chodzi o to, które konkretne minuty jej potrzebują.
Obciążenia, w których jest to wyraźnie widoczne: napisy na żywo, które osoba czyta, podczas gdy mówca mówi, gdzie 0,13 sekundy w porównaniu z końcem pliku to cały produkt; asysta agenta w czasie rzeczywistym i ocena zgodności, gdzie interwencja, która dociera po zakończeniu rozmowy, jest bezwartościowa; oraz interaktywne aplikacje głosowe, w których tura nie może się zakończyć, dopóki nie zakończy się transkrypcja. We wszystkich trzech model wsadowy nie jest tańszą opcją, lecz opcją wykluczoną — nie ma ceny, przy której transkrypcja po fakcie staje się transkrypcją w czasie rzeczywistym.
Zadania, w których wyraźnie nie ma zastosowania: nagrania spotkań i połączeń przetwarzane po fakcie, archiwa multimediów, wsadowa kontrola jakości (QA) w centrach kontaktowych, przegląd zgodności zakończonych połączeń, tworzenie napisów do podcastów i filmów. To dokładnie te potoki przetwarzania, w których model wsadowy z prędkością 411× czasu rzeczywistego i stawką 1,67 USD miał zwyciężać, a płacenie 5,4× więcej, żeby skrócić o kilkaset milisekund transkrypcję, której nikt nie przeczyta do jutra, jest zwykłym marnotrawstwem. Dodaj funkcje diaryzacji i znaczników czasu słów — model wsadowy ma je udokumentowane, model strumieniowy nie — a argument za przetwarzaniem po fakcie staje się mocniejszy, nie słabszy.
Najciekawszy jest środek, w którym te dwa rozwiązania naprawdę się uzupełniają: uruchamiaj strumieniowanie dla warstwy na żywo, a przetwarzanie wsadowe dla zapisu. Rozmowa z obsługą transkrybowana w czasie rzeczywistym, aby zasilać panel wspomagający agenta, a następnie ponownie transkrybowana wsadowo przez noc w celu utworzenia archiwalnego zapisu z diaryzacją i znacznikami czasu, kosztuje niewielką dopłatę względem samego przetwarzania wsadowego i daje oba zachowania. Taki wzorzec stał się możliwy dopiero we wrześniu, a wydanie z października jest tym, co go dopełnia.
Gdzie ujawnia się struktura dwóch dywizji
Dwie rzeczy dotyczące tej rodziny są warte zauważenia, ponieważ mają charakter strukturalny, a nie przypadkowy.
Po pierwsze, hierarchia dokładności jest odwrócona względem zwykłego wzorca. Modele strumieniowe zwykle płacą znaczący koszt dokładności za wyniki w czasie rzeczywistym; tutaj koszt ten wynosi 0,5 punktu, z 2,0% w rankingu wsadowym do deklarowanych 2,5% w strumieniowym. Microsoft uzyskał model czasu rzeczywistego w granicach pół punktu od swojego flagowego modelu wsadowego według własnych danych, co jest rzeczywistym osiągnięciem inżynieryjnym październikowego wydania, jeśli się utrzyma — a nie miejscem na szczycie tabeli, które dobry ponowny przebieg mógłby przesunąć, a którego tracker jeszcze nie potwierdził.
Po drugie, również struktura cen jest odwrócona względem typowego schematu. Dostawcy zwykle udzielają rabatu na wyższy próg wolumenowy; Microsoft wycenił streaming na 5,4× stawki batch i pozostawił obie na stawkach wprowadzających, które wygasają w tym samym czasie. To wygląda mniej jak zamierzona premia za streaming, a bardziej jak dwie osobne premiery, z których każda obejmuje rabat premierowy, bez opublikowanej standardowej stawki dla żadnej z nich. Zespoły planujące budżet na 2027 r. powinny traktować obie liczby jako tymczasowe — zarówno 1,67 USD, jak i 9,00 USD oznaczono jako oferty ograniczone czasowo, a dla żadnej z nich nie ogłoszono ceny zastępującej.

Co nie zostało jeszcze udowodnione.
Otwarte pytania z września dotyczące modelu wsadowego wciąż pozostają otwarte: brak opublikowanego wskaźnika błędu diaryzacji, brak rozbicia na poszczególne języki stojącego za twierdzeniem o 60 językach oraz cena promocyjna bez wskazanego następcy. Model strumieniowy dodaje jeszcze jedno, charakterystyczne dla pracy w czasie rzeczywistym — WER strumieniowania mierzy się na czystym dźwięku, a jakość częściowego transkryptu w zaszumionym strumieniu z pola dalekiego to tryb awarii, który ma największe znaczenie we wdrożeniu i jest najsłabiej omówiony w materiałach premierowych. Odziedziczył również bliskość wyników na tablicy strumieniowej: pierwsza trójka na tablicy trackera z 37 modelami mieści się w ułamku punktu, więc „pierwsze miejsce” to stan, który może zmienić ponowny przebieg — a pierwsze miejsce Microsoftu jest twierdzeniem, a nie wierszem.
Pytanie na poziomie rodziny jest jednak tym, na które warto zwrócić uwagę. Microsoft sprzedaje teraz tę samą możliwość w dwóch cenach różniących się pięciokrotnie, przy czym w droższym poziomie brakuje dwóch funkcji, które tańszy poziom wymienia w dokumentacji. Jeśli diaryzacja i znaczniki czasu słów pojawią się w SKU strumieniowym, luka zwęzi się do czystego kompromisu między opóźnieniem a ceną, co jest znacznie prostszą decyzją. Jeśli nie, struktura dwudywizyjna jest trwała i architektury należy budować wokół niej.
Gdzie to pozostawia stos transkrypcji

Praktyczny wniosek jest taki, że we wrześniu transkrypcja przestała być pojedynczą pozycją na liście, a w październiku stała się decyzją o routingu. Pipeline, który kiedyś standaryzował się na jednym API, teraz chce streamingu dla warstwy na żywo, przetwarzania wsadowego dla archiwum i reguły określającej, które nagranie audio trafia którą ścieżką — a ta reguła sama w sobie jest problemem routingu, co stanowi dziwną ilość złożoności, jaka ma się zmieścić w jednym cyklu wydawniczym jednego dostawcy.
Najmocniej odbija się to na tym, co znajduje się powyżej transkryptu. Niezależnie od tego, która warstwa wygeneruje tekst, jest on następnie streszczany, klasyfikowany, redagowany i kierowany, a te kroki działają na modelach językowych z własnymi profilami opóźnień i kosztów — transkrypcja na żywo potrzebuje szybkiego, taniego modelu, a archiwalna może pozwolić sobie na mocniejszy. OrcaRouter obejmuje dokładnie tę warstwę: jedno API dla ponad 200 modeli, ceny katalogowe dostawców przekazywane bez marży (0%), automatyczne przełączanie awaryjne oraz DSL routingu, który wybiera model dla danego obciążenia, a nie dla danego potoku. Ani MAI-Transcribe-2-Streaming, ani MAI-Transcribe-2 nie znajdują się na tej liście — oba są obsługiwane przez własny stos technologii mowy Microsoftu — ale dwudzielna warstwa transkrypcji to najsilniejszy jak dotąd argument za tym, by wszystko poniżej niej pozostało przenośne.
Uczciwe podsumowanie: streaming to nie lepszy MAI-Transcribe-2, to drugi produkt w drugiej cenie. Kupuj go na te minuty, które naprawdę muszą być w czasie rzeczywistym, a resztę zostaw w tańszym planie — i zaplanuj budżet z myślą o tym, że obie stawki zostaną ponownie wycenione, gdy skończy się okres wprowadzający.
