
Grok Voice Transcribe 2.0 vs MAI Transcribe 2: Dwa tory, a nie dwóch rywali
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Te dwa modele zostały wydane w odstępie piętnastu dni i wycenione co do centa identycznie, a niemal nigdy nie znajdą się w tej samej decyzji zakupowej. Grok Voice Transcribe 2.0, wydany przez SpaceXAI 18 września 2026 r., to model, który wywołujesz, gdy audio wciąż napływa — strumieniuje przez WebSocket, emituje wyniki pośrednie mniej więcej co 500 ms i przewodzi w rankingu AA-WER Streaming Artificial Analysis z 2,7% wskaźnikiem błędów słów dla transkrypcji końcowych i 3,4% dla pierwszych wyników częściowych. MAI-Transcribe-2, wydany przez Microsoft AI 3 września 2026 r., to model, który wywołujesz, gdy audio jest już plikiem — działa tylko w trybie wsadowym, a w rankingu non-streaming Artificial Analysis jest najdokładniejszym zarządzanym modelem z wynikiem 2,04% AA-WER, przed Grok Voice Transcribe 2.0 z 2,29% i około 2× szybszym pod względem przepustowości. Oba są wycenione na 0,10 USD za godzinę audio, około 1,67 USD za 1000 minut. Jeśli Twoim wymaganiem jest czas rzeczywisty, nie ma czego porównywać. Jeśli Twoim wymaganiem jest plik, jest.
Granica, której żaden dostawca nie wytyczy za ciebie
Obsługa strumieniowania nie jest przełącznikiem funkcji. Grok Voice Transcribe 2.0 udostępnia ten sam model przez REST dla nagranych plików i przez `wss://api.x.ai/v1/stt` dla audio na żywo, więc dokładność, którą mierzysz na swoim archiwum, jest dokładnością, którą otrzymujesz podczas rozmowy na żywo. MAI-Transcribe-2 nie ma w ogóle SKU do strumieniowania: materiały premierowe Microsoftu pozycjonują go wyraźnie do długich nagrań i audio przetwarzanego wsadowo, a choć karta modelu wymienia napisy w czasie rzeczywistym wśród scenariuszy zastosowań, droga do tego prowadzi przez segmentowanie audio i przesyłanie każdego segmentu przez API wsadowe — czyli potok, który sam budujesz i utrzymujesz, a nie gwarancja opóźnienia, którą kupujesz. Ogłaszana przez Microsoft przepustowość rzędu około 411× czasu rzeczywistego to wskaźnik szybkości przetwarzania, a nie czasu odpowiedzi, i te dwie rzeczy są stale mylone w relacjach z tej premiery.
Praktyczna konsekwencja: jeśli tworzysz agentów głosowych obsługujących naprzemienność mówienia, napisy na żywo lub cokolwiek, gdzie człowiek albo model reaguje na mowę w trakcie jej trwania, MAI-Transcribe-2 nie jest kandydatem, niezależnie od tego, jak dobra jest jego dokładność. Jeśli transkrybujesz spotkania po fakcie, nocne nagrania z centrów kontaktowych, archiwa mediów lub zaległości związane ze zgodnością, strumieniowanie jest zbędnym balastem, a wyniki przetwarzania wsadowego to cała historia.
Gdzie MAI-Transcribe-2 naprawdę przoduje
Najpierw dokładność na plikach. Różnica 2,04% wobec 2,29% jest mierzona na tym samym niezależnym środowisku testowym — AA-WER v2 od Artificial Analysis, w 50% AA-AgentTalk i po 25% VoxPopuli oraz Earnings22 — co czyni ją najbardziej klarownym faktem w tym porównaniu. To różnica 0,25 punktu, czyli o około dwa i pół błędu mniej na tysiąc słów. To, czy ma to znaczenie, zależy od tego, co robisz z transkrypcją; w przypadku przeszukiwalnego archiwum nie, a w przypadku dokumentacji prawnej lub medycznej może mieć.
Przepustowość, po drugie, i to o więcej niż różnica w dokładności: 333× czasu rzeczywistego wobec 162× Grok Voice Transcribe 2.0. Obie liczby to pomiary Artificial Analysis liczby sekund audio wejściowego transkrybowanych na sekundę, a nie twierdzenia dostawców. Przy takim tempie tysiącgodzinne archiwum kończy się po około trzech godzinach obliczeń na modelu Microsoft i około sześciu na modelu SpaceXAI. W przypadku jednorazowej migracji nie ma to znaczenia; w przypadku potoku, który przyjmuje dane w sposób ciągły, skrócenie czasu zegarowego o połowę to realna różnica w przepustowości.
Pokrycie językowe, po trzecie. Microsoft podaje 60 języków z automatycznym wykrywaniem, przełączaniem kodów w obrębie jednego nagrania i średnim wskaźnikiem błędów słów wynoszącym 5,2% na FLEURS — liczba podana przez dostawcę, nieodtworzona niezależnie, ale przynajmniej opisuje przypadek wielojęzyczny w oparciu o podaną listę języków. SpaceXAI dokumentuje dziesiątki języków z przełączaniem w trakcie nagrania i formatowaniem formy pisanej w 25 przypadkach. Jeśli Twoje audio wykracza poza dobrze pokryty zestaw języka angielskiego i głównych języków europejskich, wartość z FLEURS jest bardziej informatywna niż ranking obciążony angielskim i pełen rozmów z agentami.
Jeszcze dwie różnice, które mają znaczenie operacyjne. MAI-Transcribe-2 oferuje konfigurowalne style transkrypcji — verbatim, zachowujący dysfluencje, oraz clean, który je usuwa — podczas gdy Grok Voice Transcribe 2.0 radzi sobie z tym samym problemem za pomocą flagi usuwania słów wypełniających. Model Microsoftu jest w publicznej wersji zapoznawczej na Microsoft Foundry, co oznacza brak SLA i stałą rekomendację, by nie używać go produkcyjnie do czasu przejścia do ogólnej dostępności (GA); model SpaceXAI jest ogólnie dostępny z opublikowanymi limitami: 10 żądań na sekundę i 100 równoczesnych sesji strumieniowych na zespół.

Gdzie Grok Voice Transcribe 2.0 naprawdę ma przewagę
• Strumieniowanie w czasie rzeczywistym — punkt końcowy WebSocket z wynikami pośrednimi co ~500 ms, w przeciwieństwie do trybu wyłącznie wsadowego bez zapowiedzianego SKU w czasie rzeczywistym
• Dokładność pierwszego częściowego transkryptu — 3,4% WER przy 0,49 s w AA-WER Streaming, kategorii, w której MAI-Transcribe-2 nie bierze udziału
• Dokładność wsadowa dla audio typu agent-talk — 2,29% ogółem, ale na podzbiorze AA-AgentTalk tablicy bez streamingu ranking jest bardziej zbity, niż sugeruje nagłówek, a w mieszance z dużym udziałem agentów na tablicy streamingu Grok prowadzi bezapelacyjnie
• Infrastruktura agenta głosowego — wykrywanie końca tury przez Smart Turn i usuwanie słów wypełniających są wbudowane w model, podczas gdy MAI-Transcribe-2 pozostawia logikę tur wywołującemu
• Dźwięk wielokanałowy — do 8 niezależnych kanałów transkrybowanych w jednym przebiegu, co ma znaczenie w przypadku nagrań stereo lub rozmów z wieloma uczestnikami
• Pewność na poziomie słowa — znaczniki czasu zawierają ocenę pewności dla każdego słowa, dzięki czemu fragmenty o niskiej pewności można oznaczyć flagą, zamiast ufać im w równym stopniu
• Warunki dostępności — ogólna dostępność z opublikowanymi limitami współbieżności w porównaniu z publiczną wersją zapoznawczą bez SLA
• Trwałość ceny — 0,10 USD za godzinę to obowiązująca stawka zarówno dla przetwarzania wsadowego, jak i podstawa dla warstwy strumieniowania za 0,20 USD, przy czym identyczne 0,10 USD Microsoftu to ograniczona czasowo oferta premierowa bez ogłoszonej standardowej stawki na 2027 r.
Ten ostatni punkt jest tym, który większość porównań pomija. Oba modele kosztują dziś tyle samo, a jedna z tych cen ma datę ważności, której druga nie ma. Microsoft nie opublikował stawki po promocji, a doniesienia są sprzeczne co do tego, czy oferta obowiązuje do końca 2026 r., czy nie ma w ogóle podanego terminu zakończenia. Jeśli modelujesz trzyletni budżet na transkrypcję w oparciu o 1,67 USD za 1 000 minut od Microsoftu, modelujesz liczbę, do której dostawca się nie zobowiązał.

Nakładanie się jest realne i stanowi większość listy funkcji.
Pomijając kwestię streamingu, oba produkty mocno się do siebie zbliżają. Oba wykonują diaryzację mówców. Oba zwracają znaczniki czasu na poziomie słów. Oba obsługują odwrotną normalizację tekstu — liczby, daty, waluty i dane kontaktowe zapisane w formie pisemnej. Oba przyjmują terminologię dziedzinową: Grok Voice Transcribe 2.0 jako maksymalnie 100 kluczowych terminów na żądanie, a MAI-Transcribe-2 jako listy terminologii dziedzinowej i skrótów. Oba automatycznie wykrywają język i nadążają za mówcą przełączającym języki w trakcie nagrania. Oba obsługują telefoniczne audio 8 kHz, czyli przypadek, na którym większość modeli transkrypcji po cichu zawodzi, i ten, przeciwko któremu SpaceXAI optymalizował najintensywniej — jego wewnętrzny zestaw telefoniczny poprawił się z 10,6% do 7,1% WER między wersjami, co jest wartością raportowaną przez firmę na podstawie firmowego audio.
Oba mają również limity wejściowe, które kształtują architektury, a nie tylko budżety. Grok Voice Transcribe 2.0 przyjmuje pliki o rozmiarze do 500 MB w 12 formatach audio, z częstotliwościami próbkowania od 8 kHz do 48 kHz. Limity MAI-Transcribe-2 są określane przez ścieżkę Foundry, a nie przez sam model, a zespoły powinny zapoznać się z dokumentacją Microsoftu, aby poznać aktualny limit, zamiast zakładać parytet z dedykowaną usługą STT.
To, co oznacza ta zbieżność, sprowadza się do tego, że decyzja redukuje się do trzech pytań w kolejności: czy musi działać na żywo, ile języków faktycznie masz i ile kosztuje cię różnica w dokładności. Pierwsze pytanie jest binarne i od razu eliminuje jedną opcję. Na drugie zwykle można odpowiedzieć na podstawie próbki własnego audio. Trzecia z nich jest na tyle niewielka, że w przypadku większości obciążeń opartych na plikach nie przesądzi o niczym — różnica 0,25 punktu jest realna, ale realny jest też fakt, że oba modele mieszczą się w granicach pół punktu od najlepszego wyniku, jaki ktokolwiek zmierzył.

Co zrobić z tym
Traktuj je jako dwutorowy stos, a nie bezpośrednie starcie. Centrum kontaktowe, które prowadzi asystę na żywo dla agentów i nocną archiwizację zgodności, nie wybiera między Grok Voice Transcribe 2.0 a MAI-Transcribe-2 — używa obu, a jedyne pytanie brzmi, czy kosztuje to dwie relacje z dostawcami, dwa zestawy poświadczeń, dwie faktury i dwa limity szybkości. Żaden z tych modeli nie znajduje się dziś w katalogu OrcaRouter, więc same wywołania transkrypcji trafiają do własnego API każdego dostawcy. Jeden klucz OrcaRouter obejmuje natomiast wszystko, co dzieje się dalej: moduł podsumowujący, klasyfikator, agenta, który wnioskuje na podstawie transkryptu, oraz zadanie ewaluacyjne porównujące wyniki obu dostawców na tym samym nagraniu. To ostatnie jest powodem, by się tym przejmować — nie można zdecydować między tymi modelami na podstawie rankingu, ponieważ ranking to osiem godzin angielskiej rozmowy agenta, a twoje audio nie.
Uważaj na dwie rzeczy. Po pierwsze, czy Microsoft przypisze MAI-Transcribe-2 standardową cenę, gdy zakończy się oferta premierowa; stała stawka 1,67 USD za 1000 minut uczyniłaby go domyślnym wyborem wsadowym już choćby ze względu na koszt, a powrót do stawki 0,36 USD za godzinę z MAI-Transcribe-1 sprawiłby, że ta rozmowa byłaby znacznie krótsza. Po drugie, czy Microsoft wypuści SKU strumieniowe. Karta modelu już wskazuje napisy w czasie rzeczywistym jako docelowy scenariusz, a jedyną rzeczą, która stoi między MAI-Transcribe-2 a ścieżką strumieniową, jest endpoint — jeśli to wejdzie, te dwie przestaną być osobnymi ścieżkami i zaczną być rywalami.
