Karta hero artykułu z napisem „MAI-Transcribe-2 już działa”, plakietką „NOWOŚCI · MICROSOFT AI” oraz podtytułem „Microsoft chce zdominować rynek zamiany mowy na tekst za 0,10 USD za godzinę”, z paskiem statystyk pokazującym AA-WER 2,0% (pozycja #2 według Artificial Analysis), szybkość ~411× względem czasu rzeczywistego (#2) i cenę startową 0,10 USD za godzinę, na gradiencie od bieli do błękitu z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

MAI-Transcribe-2 już dostępny: Microsoft za 0,10 USD za godzinę chce zawładnąć rynkiem zamiany mowy na tekst

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

MAI-Transcribe-2 to model, na który Microsoft AI stawia, że zamieni transkrypcję mowy w towar, a nie funkcję premium, a liczby, z którymi zadebiutował, są zaprojektowane tak, by ten argument popierać. Udostępniony 3 września 2026 r. w publicznej wersji zapoznawczej w Microsoft Foundry, MAI Playground oraz na własnych interfejsach API Microsoftu, jest trzecim modelem mowy Microsoftu w ciągu pięciu miesięcy — po MAI-Transcribe-1 z kwietnia (0,36 USD za godzinę audio) i MAI-Transcribe-1.5 z czerwca — i pierwszym, który wyprzedza każdego wymienionego przez siebie konkurenta świadczącego usługi zarządzane w dwóch metrykach, na które zespoły faktycznie patrzą przy zakupie. Na rankingu Artificial Analysis obejmującym niestrumieniowy wskaźnik błędów słownych zajmuje drugie miejsce z wynikiem 2,0% AA-WER oraz drugie pod względem szybkości około 411× większej niż czas rzeczywisty, co razem plasuje go na granicy Pareto dokładności i szybkości: na tamtej liście żaden model nie jest jednocześnie dokładniejszy i szybszy. Cena startowa jest o około 72% niższa od ceny poprzednika.

„Najszybszy, najdokładniejszy i najtańszy model rozpoznawania mowy na świecie” to własny nagłówek Microsoftu dotyczący premiery — i należy go czytać z gwiazdkami towarzyszącymi materiałowi źródłowemu. To historia premiery, jaka naprawdę miała miejsce, z oznaczeniem twierdzeń producenta i oddzieleniem fragmentów, które wciąż wymagają dowodu.

Co Microsoft faktycznie wydał

MAI-Transcribe-2 to model transkrypcji wsadowej przeznaczony do pracy z wcześniej nagranym materiałem, kierowany głównie do długich nagrań audio — spotkań, rozmów, archiwów medialnych, nagrań z centrów kontaktowych. Microsoft pozycjonuje go właśnie dla obciążeń, w których kluczowe znaczenie mają przepustowość i koszt za minutę. Transkrybuje w 60 językach z automatyczną identyfikacją języka, obejmuje diaryzację mówców, która przypisuje słowa właściwej osobie, zwraca znaczniki czasowe na poziomie słów i obsługuje biasing słów kluczowych dla nazw, skrótów i terminologii branżowej. Dwa konfigurowalne style transkrypcji pokrywają typowy podział: „verbatim”, który zachowuje wypełniacze i fałszywe starty dla transkrypcji zgodnych z wymogami, oraz „clean”, który usuwa niepłynności pod napisy i notatki. Microsoft zwraca również uwagę na przełączanie kodów w mowie mieszanojęzycznej, takiej jak hinglish i spanglish, oraz na odporność na hałaśliwe nagrania z rzeczywistych warunków.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2 (dated September 3, 2026), showing the headline 'MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world' and the opening paragraph naming new features — diarization, configurable transcription styles, word-level timestamps — and comparisons against Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large and Scribe V2.

Historia dostępności jest równie ważna jak lista funkcji. Microsoft nie uzależnia tego od swojego korporacyjnego stosu mowy: model można dziś zademonstrować w MAI Playground, a za pośrednictwem Microsoft Foundry jest udostępniany w publicznej wersji zapoznawczej, z dokumentacją Foundry umieszczoną w ramach usługi Azure AI Speech. To celowa decyzja dystrybucyjna — umieścić model graniczny tam, gdzie programista może go uruchomić za pomocą klucza, a nie tam, gdzie najpierw musi go zatwierdzić korporacyjny cykl sprzedaży. Microsoft nie opublikował wag, a nic w materiałach premierowych nie wskazuje, że to zrobi.

Czytając nagłówek dosłownie

„Najszybszy, najdokładniejszy i najtańszy na świecie” to trzy twierdzenia o różnej sile, a sam post startowy po cichu osłabia dwa z nich. Uczciwa wersja każdego z nich:

• Dokładność — Na liście liderów Artificial Analysis, MAI-Transcribe-2 zajmuje drugie miejsce z wynikiem 2,0% AA-WER, a nie pierwsze; sam tekst Microsoftu mówi, że jest drugi. Określenie „najdokładniejszy” przetrwa tylko wtedy, gdy odczyta się je jako „wśród zarządzanych interfejsów API do transkrypcji wsadowej, które osiągają ten poziom” — a nawet wtedy jest to twierdzenie o modelu mającym cztery dni, a nie ugruntowana korona. Microsoft osobno podaje, że model jest pierwszy w wielojęzycznym benchmarku FLEURS przy średniej WER wynoszącej 5,2% dla 60 języków — ta liczba pochodzi z postu Microsoftu o premierze, a nie została jeszcze niezależnie przeliczona dla każdego języka z osobna.

• Szybkość — Według Artificial Analysis, MAI-Transcribe-2 działa około 411× szybciej niż w czasie rzeczywistym, co daje mu drugie miejsce w tym zestawieniu. Co ciekawe, sam komunikat Microsoftu nigdy nie podaje tej bezwzględnej liczby; zamiast tego przedstawia przyjaźniejsze mnożniki względne — „nawet 10× szybsze przetwarzanie niż u czołowych konkurentów, zwłaszcza w przypadku długich nagrań audio”, a konkretnie: 10× szybciej niż GPT-Transcribe od OpenAI, 7× szybciej niż Scribe v2 od ElevenLabs i 5× szybciej niż Gemini 3.5 Transcribe. Te proporcje to sposób, w jaki Microsoft ujmuje te same dane od Artificial Analysis, a wartości bazowe mają znaczenie: „5× szybciej niż Gemini 3.5 Transcribe” brzmi jak niewielka różnica, dopóki nie przeliczy się tego na minuty obliczeń na godzinę materiału audio.

• Najtańsza — to prawda tylko w obrębie dwóch ograniczeń, co Microsoft jasno stwierdza. Stawka 0,10 USD to „oferta limitowana do końca roku”, a żadna standardowa cena po promocji nie została ujawniona w materiałach z premiery. Jest też najtańsza wśród zarządzanych interfejsów API o wysokiej dokładności; samodzielnie hostowany otwarty model, taki jak Whisper Large v3 Turbo, wciąż transkrybuje praktycznie za koszt energii elektrycznej. Argument o utowarowieniu jest realny — jest po prostu węższy, niż sugeruje nagłówek.

Screenshot of the Artificial Analysis Speech-to-Text leaderboard summary table showing Word Error Rate and Median Speed Factor columns for models including MAI-Transcribe-2 and MAI-Transcribe-1.5 under Microsoft AI, alongside rows for ElevenLabs Scribe v2 and Gemini 3.5 Transcribe.

Co można kupić za 1,67 dolara za 1000 minut

Wyceniony na 0,10 USD za godzinę audio, MAI-Transcribe-2 kosztuje około 1,67 USD za 1000 minut nagrania. Ta liczba robi wrażenie dopiero na tle innych zarządzanych API do transkrypcji, które konkurują dokładnością. GPT-Transcribe kosztuje 4,50 USD za 1000 minut; wariant transkrypcji gotowych nagrań Gemini 3.5 Transcribe to przy cenniku tokenowym Google'a mniej więcej 5 USD za 1000 minut; Scribe v2 od ElevenLabs wyceniono jeszcze wyżej. Przy 1000 godzinach audio miesięcznie — poważnym, choć nie ogromnym wolumenie dla contact center czy mediów — różnica między MAI-Transcribe-2 w cenie promocyjnej a GPT-Transcribe w cenie katalogowej wynosi rzędu 170 USD miesięcznie, i to każdego miesiąca, pomijając już wszelkie różnice w dokładności. To właśnie ta luka cenowa sprawia, że transkrypcja przestaje być pozycją, którą zespoły optymalizują, a staje się pozycją, którą ignorują.

Dwa zastrzeżenia należy wspomnieć jednym tchem. Po pierwsze, cena promocyjna jest eksperymentem cenowym, dopóki nie przestaje nim być: zespoły, które budują produkt w oparciu o stawkę $0.10, powinny wiedzieć, że standardowa stawka nie jest ujawniana, a realistyczna liczba do planowania budżetu na 2027 rok znajduje się gdzieś pomiędzy ofertą startową a tym, co Microsoft poda po jej wygaśnięciu. Po drugie, „najtańszy w tej klasie dokładności” nie mówi nic o całkowitym koszcie posiadania — model jest dostępny wyłącznie przez API, więc porównanie, które ma znaczenie dla zespołów o dużym wolumenie, to $1.67 za 1000 minut wobec pełnego kosztu uruchomienia własnego stacku z otwartymi wagami, a nie tylko zestawienie z innymi API.

Skompresowane do tablicy wyników pozycja startowa wygląda tak — każda liczba poniżej niesie ze sobą etykietę źródła przypisaną jej w treści powyżej.

A single-column scoreboard titled 'MAI-Transcribe-2 — the scoreboard' listing AA-WER 2.0% (#2 per Artificial Analysis), speed ~411x real time (#2), price $1.67 per 1,000 minutes early-bird through 2026, 60 languages with automatic language ID, bundled diarization with unpublished error rate, and no streaming SKU announced, with the OrcaRouter logo bottom right.

Co nie zostało jeszcze udowodnione.

Pomimo całej szczegółowości deklaracji dotyczących premiery, trzy kwestie pozostają realnie otwarte. Pierwszą z nich jest streaming: MAI-Transcribe-2 to model wsadowy, narracja Microsoftu o szybkości dotyczy przepustowości plików, a żaden wariant czasu rzeczywistego nie został zapowiedziany ani zademonstrowany — „411×" nie jest liczbą dotyczącą opóźnień w transkrypcji na żywo. Drugą jest jakość diaryzacji: przypisywanie mówców jest oferowane w pakiecie, ale Microsoft nie publikuje współczynnika błędów diaryzacji, a to właśnie ta funkcja najprawdopodobniej wypadnie gorzej w niezależnych testach niż WER. Trzecią jest rozbicie wielojęzyczne: pojedyncza średnia FLEURS dla 60 języków może ukryć duże różnice między poszczególnymi językami, a Microsoft nie opublikował tabeli dla każdego języka. Każdy z tych powodów sprawia, że historia nie jest zakończona czwartego dnia.

Gdzie to opuszcza twój stos transkrypcji

Nic z tego nie wymaga wyboru MAI-Transcribe-2 już dziś, co jest właśnie powodem, dla którego cennik zasługuje na uwagę zespołów, które nie poszukują nowego dostawcy. Zamiana mowy na tekst rzadko jest końcem potoku — transkrypcje bywają podsumowywane, przetwarzane, przeszukiwane i przekazywane dalej, a ta dalsza warstwa to miejsce, gdzie konfiguracja wielomodelowa udowadnia swoją przydatność. Platforma taka jak OrcaRouter istnieje właśnie dla tej części stosu: jedno API obejmujące ponad 200 modeli, ceny dostawców przenoszone z zerowym narzutem, automatyczne przełączanie awaryjne oraz język DSL do routowania, który pozwala, by transkrypcja trafiała do innego modelu zależnie od zadania — protokoły spotkań do jednego sumaryzatora, przegląd zgodności do innego — bez potrzeby drugiej integracji. Sam MAI-Transcribe-2 nie znajduje się obecnie na tej liście; działa w autorskim API Microsoftu oraz na platformach zewnętrznych wymienianych przez Microsoft. Jednak cena, po której został właśnie udostępniony, to jak dotąd najlepszy argument za tym, aby warstwę znajdującą się nad transkrypcją budować niezależnie od modelu.

Cena startowa mówi sama za siebie. Microsoft nie próbuje wygrać w rozpoznawaniu mowy na tekst wyłącznie funkcjami — próbuje sprawić, by wysoka dokładność była tak tania, że ta kategoria przestaje być osobną pozycją w budżecie. MAI-Transcribe-2 zasługuje na uwagę, jaką otrzymuje; wystarczy przeczytać „najszybszy, najdokładniejszy i najtańszy na świecie” z tymi trzema gwiazdkami: drugi pod względem AA-WER, promocyjne ceny do końca roku oraz historia streamingu, której jeszcze nie opowiedziano.