Karta hero artykułu z napisem „MAI-Transcribe-2-Streaming vs Gemini 3.5 Transcribe Live”, z plakietką „POJEDYNEK · STRUMIENIOWE ROZPOZNAWANIE MOWY NA TEKST” i podtytułem „Ta sama cena $9, inny kompromis”, z chipami pokazującymi 2,5% deklarowane wobec 4,00% po audycie, 0,13 s wobec 0,40 s do wyniku końcowego, 60 języków wobec 85+ oraz brak opublikowanej diaryzacji w obu przypadkach, na tle gradientu od białego do niebieskiego z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

MAI-Transcribe-2-Streaming vs Gemini 3.5 Transcribe Live: ta sama cena 9 USD, inny kompromis

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

MAI-Transcribe-2-Streaming i Gemini 3.5 Transcribe Live kosztują tyle samo i opierają się na przeciwnych teoriach dotyczących tego, do czego służy transkryber strumieniowy. Oba kształtują się na poziomie około 9,00 USD za 1000 minut strumieniowanego dźwięku. Model Microsoftu, wydany 1 października 2026 r., to precyzyjne narzędzie: deklarowany 2,5% wskaźnik błędów słów w strumieniu przy 0,13 sekundy do końcowej transkrypcji, pierwszy pod względem dokładności zarówno transkrypcji końcowych, jak i częściowych według samego Microsoftu, mierzony według strumieniowej metodyki Artificial Analysis, ale jeszcze nienaniesiony jako wiersz na tej tablicy. Drugi model, dostępny w publicznej wersji zapoznawczej od 26 sierpnia 2026 r. i udostępniany przez Live API, to narzędzie zasięgu: ponad 85 języków z przełączaniem w trakcie strumienia, darmowy plan i 4,00% wskaźnik błędów słów w strumieniu przy 0,40 sekundy, czyli wartość, którą Artificial Analysis dla niego mierzy. Żaden z nich nie jest oczywistym wyborem, a powodem jest to, że tak naprawdę nie konkurują o ten sam rodzaj obciążenia.

Oto bezpośrednie porównanie tak, jak faktycznie prezentują się liczby — dane podane przez dostawców są oznaczone, dane z trackera mają podane źródło, a także te fragmenty, w których jeden model wygrywa w wymiarze, którego drugi w ogóle nie kwestionuje.

Wersja jednolinijkowa

• Dokładność i opóźnienie — MAI-Transcribe-2-Streaming, według opublikowanych danych. Microsoft twierdzi, że osiąga 2,5% WER w trybie strumieniowym przy 0,13 sekundy do końcowego transkryptu, co daje pierwsze miejsce pod względem dokładności zarówno dla transkryptów końcowych, jak i częściowych, oraz 2,5% dla pierwszego transkryptu częściowego przy 0,12 sekundy. Na tym tle Artificial Analysis ma Gemini 3.5 Transcribe Live na poziomie 4,00% przy 0,40 sekundy. Deklarowana przewaga Microsoftu to 1,5 punktu i około trzykrotnie szybsze dojście do stabilnego wyniku. Zastrzeżenie jest takie, że tracker nie umieścił jeszcze na wykresie samego MAI-Transcribe-2-Streaming — obecnym liderem rankingu jest Grok Voice Transcribe 2.0 z 2,73% i 0,49 sekundy, a Muse Voice Transcribe ma 3,06% i 0,16 sekundy — więc 2,5% to dane producenta odnoszone do stawki, którą tracker faktycznie mierzy. Nie jest to wyrównany pojedynek na osi, którą publikują oba modele, ale tylko jedna jej strona jest publikowana niezależnie.

• Zakres językowy — Gemini 3.5 Transcribe Live. Ponad 85 języków z automatycznym wykrywaniem i możliwością zmiany języka w trakcie transmisji bez restartowania sesji, co jest sztandarowym twierdzeniem Google dotyczącym Live API. MAI-Transcribe-2-Streaming obsługuje 60 języków z automatycznym ciągłym wykrywaniem języka. Dolny pułap Microsoftu jest wyższy; górny pułap Google'a jest szerszy, a różnica 25 języków dotyczy głównie języków, w których model strumieniowy dla jednego języka w ogóle nie nadaje się do użycia.

• Charakter sesji — Gemini 3.5 Transcribe Live, a ten aspekt działa w obie strony. Live API to sesja WebSocket z limitem 10 minut, co jest w porządku w przypadku tury agenta głosowego, ale niewygodne w przypadku godzinnego spotkania; Microsoft nie publikuje równoważnego limitu sesji dla swojego modelu strumieniowego, co ma znaczenie, jeśli jednostką pracy jest rozmowa, a nie tura konwersacji.

• Koszt wejścia — Gemini 3.5 Transcribe Live. Dostępny jest bezpłatny plan, a łączna stawka Google wynosi około 0,009 USD za minutę w modelu rozliczania opartym na tokenach. Stawka Microsoftu wynosząca 0,54 USD za godzinę audio to cena wprowadzająca, która – jak twierdzi Microsoft – obowiązuje do końca roku; standardowa cena nie została ujawniona — taka sama struktura jak w przypadku wrześniowej premiery trybu wsadowego.

Screenshot of the Artificial Analysis Speech-to-Text leaderboard page showing the AA-WER Streaming Index chart, which plots final-transcript word error rate against time to final transcription after end of speech across the streaming field; MAI-Transcribe-2-Streaming does not appear on the chart.

Dlaczego luka w dokładności jest większa, niż się wydaje

Różnica 1,5 punktu we współczynniku błędów słów brzmi jak kwestia zaokrąglenia, dopóki nie przeliczy się jej na koszty. Przy strumieniowym WER wynoszącym 4,00% Gemini 3.5 Transcribe Live myli około 40 słów na 1000; przy deklarowanych przez Microsoft 2,5% MAI-Transcribe-2-Streaming myli 25. W przypadku wolumenów, jakie generuje potok czasu rzeczywistego — organizacja wsparcia obsługująca 5000 godzin rozmów miesięcznie to 300 000 minut, czyli ponad 45 milionów słów przy tempie konwersacyjnym — ta różnica przekłada się na miliony błędnych słów rocznie, skoncentrowanych w encjach, od których zależą systemy downstream: nazwach kont, numerach zgłoszeń, dawkach, adresach.

Różnicę w opóźnieniu jest trudniej sprzedać. 0,13 sekundy w porównaniu z 0,40 sekundy po zakończeniu wypowiedzi jest zauważalna w strumieniu napisów na żywo — poniżej około 0,2 sekundy jest odbierane jako jednoczesność, a jedna trzecia sekundy sprawia wrażenie, że transkrypcja goni mówiącego — ale nie jest zauważalna w panelu wspomagania agenta, który odświeża się w ludzkiej skali czasu. Jeśli twoim odbiorcą jest osoba czytająca na bieżąco, przewaga Microsoftu w opóźnieniu jest produktem. Jeśli twoim odbiorcą jest model, który otrzymuje końcową transkrypcję, gdy tura się kończy, to tylko liczba.

Obie liczby mają to samo zastrzeżenie i warto to raz podkreślić: to wyniki z pojedynczego przebiegu z tablicy śledzenia obejmującej 37 modeli, a różnica między pierwszym a trzecim miejscem na tej tablicy wynosi mniej niż punkt. Ponowne uruchomienie może przetasować czołówkę rankingu streamingu, czego nie może zrobić dwupunktowa różnica na tablicy wsadowej. Co więcej, 2,5% Microsoftu w ogóle nie ma jeszcze na tablicy — to twierdzenie dostawcy zmierzone metodologią trackera, co jest czymś innym niż wiersz publikowany przez trackera.

Granice są tam, gdzie tak naprawdę mieszka decyzja.

Ograniczenia funkcji oddzielają te dwa szybciej niż benchmarki, a biegną one w przeciwnych kierunkach.

Gemini 3.5 Transcribe Live ma trzy udokumentowane ograniczenia: limit sesji wynoszący 10 minut w Live API, brak diaryzacji mówców i brak znaczników czasu na poziomie słów. Pierwsze jest architektoniczne — strumieniowanie przez sesję WebSocket ma z założenia górny limit — i oznacza, że długotrwała transkrypcja na żywo musi być łączona między sesjami, a obsługa łączeń pozostaje po twojej stronie. Dwa pozostałe są bezwzględne: jeśli twój produkt wymaga przypisania mowy do mówcy lub umieszczenia słowa przy znaczniku czasu na potrzeby wyszukiwania bądź synchronizacji napisów, Gemini 3.5 Transcribe Live nie zrobi tego za żadną cenę.

Ograniczenia MAI-Transcribe-2-Streaming są słabiej udokumentowane, co samo w sobie jest informacją. Microsoft nie zgłasza żadnych twierdzeń o diaryzacji dla modelu strumieniowego ani żadnych twierdzeń o znacznikach czasu słów; wsadowy MAI-Transcribe-2 zawiera diaryzację i zwraca znaczniki czasu na poziomie słów, ale to jest produkt wsadowy, a zakładanie, że strumieniowy SKU je dziedziczy, to dokładnie ten rodzaj wnioskowania, któremu materiał premierowy ma zapobiegać. Microsoft twierdzi natomiast, że obsługiwanych jest 60 języków z ciągłym wykrywaniem języka oraz pozycjonowanie na froncie Pareto pod względem dokładności i opóźnienia — oba te twierdzenia dostawcy są spójne z danymi trackera.

Uczciwa ocena funkcji wygląda więc tak: żaden z modeli strumieniowych nie publikuje diaryzacji ani znaczników czasu słów. Gemini 3.5 Transcribe Live ma opublikowany limit sesji i darmowy plan; MAI-Transcribe-2-Streaming ma opublikowaną liczbę języków i nie ma opublikowanego limitu. Jeśli Twoje wymagania obejmują diaryzację, żadne z nich nie jest odpowiedzią — patrzysz na transkrypcję wsadową z warstwą strumieniową przykręconą z przodu.

Co tak naprawdę mówi ci parytet cen

Dwóch dostawców dochodzących do tych samych 9 USD za 1000 minut z przeciwnych kierunków to najciekawszy fakt w tym porównaniu. Google osiągnął to dzięki rozliczaniu opartemu na tokenach w sesji Live API: audio na wejściu po 3,50 USD za milion tokenów, tekst na wyjściu po 21 USD za milion i przybliżone zużycie 175 tokenów tekstowych na minutę, co przekłada się na około 0,009 USD na minutę. Microsoft osiągnął to, podając stałą stawkę 0,54 USD za godzinę audio dla modelu z rodziny, której odpowiednik wsadowy kosztuje 0,10 USD. Jeden to rozliczana sesja w czasie rzeczywistym; drugi to stała stawka za minutę z rabatem wprowadzającym.

Te struktury zachowują się różnie w miarę skalowania. Stawka ryczałtowa jest przewidywalna i łatwa do zaplanowania w budżecie; sesja rozliczana na podstawie tokenów zmienia się w zależności od tego, ile model odpowiada i jak długo pozostaje bezczynnie otwarta. W przypadku potoku o dużym natężeniu ruchu stawka ryczałtowa jest korzystniejszym rachunkiem; dla prototypu lub funkcji o małym wolumenie darmowy plan i rozliczanie za tokeny są przyjaźniejszym punktem wejścia.

A generated bar-comparison card titled 'Two routes to $9.00 per 1,000 minutes' showing MAI-Transcribe-2-Streaming at a flat $0.54 per audio-hour introductory rate and Gemini 3.5 Transcribe Live at roughly $0.009 per minute blended from token pricing, both at $9.00, with MAI-Transcribe-2 (batch sibling) at $1.67, and a note that neither streaming rate has an announced post-promotional successor and that Gemini's blended figure uses $3.50 per million audio-in and $21 per million text-out at about 175 text tokens per minute, with the OrcaRouter logo bottom right.

To, czego nie zmienia żadna z tych struktur, to warstwa powyżej transkrypcji. Niezależnie od tego, który model ją tworzy, transkrypcja na żywo jest wejściem do streszczania, klasyfikacji, redakcji i routingu, a te kroki mają własne krzywe kosztów i jakości — zwykle są uruchamiane na kilku modelach, a nie na jednym. To warstwa, którą obejmuje OrcaRouter: jedno API dla ponad 200 modeli, ceny katalogowe dostawców przekazywane dalej z 0% marży, automatyczne przełączanie awaryjne i DSL routingu, który może kierować transkrypcję do różnych modeli w zależności od obciążenia. Ani MAI-Transcribe-2-Streaming, ani Gemini 3.5 Transcribe Live nie znajdują się na tej liście — są obsługiwane odpowiednio przez własne stosy mowy Microsoftu i Google’a — a celem nie jest ich routowanie, lecz utrzymanie przenośności wszystkiego, co znajduje się za nimi w potoku.

A generated three-axis comparison card titled 'Streaming speech-to-text, on three axes' contrasting MAI-Transcribe-2-Streaming (2.5% streaming WER as a claim, 0.13s to final, 60 languages with automatic detection, no published session cap, diarization not published, word timestamps not published, $9.00 per 1,000 minutes introductory) with Gemini 3.5 Transcribe Live (4.00% streaming WER per Artificial Analysis, 0.40s to final, 85+ languages with mid-stream switching, a 10-minute session cap on the Live API, no diarization, no word timestamps, no session cap published), with the OrcaRouter logo bottom right.

Który wybrać

Wybierz MAI-Transcribe-2-Streaming, gdy produktem są dokładność i czas stabilizacji: napisy na żywo czytane przez człowieka, ocena zgodności lub jakości w czasie rzeczywistym, w której błędnie rozpoznana encja ma koszt, albo długie sesje, które 10-minutowy limit Gemini zmuszałby cię sklejać. Wybierz Gemini 3.5 Transcribe Live, gdy produktem jest pokrycie językowe: globalne wdrożenie w językach, których nie sposób z góry wyliczyć, przełączanie języków w trakcie strumienia albo prototyp, w którym darmowy plan i rozliczanie za tokeny znoszą zobowiązanie. Zespoły, które potrzebują obu, nie są skazane na jeden wybór — to dwa różne API o różnych modelach sesji, a uczciwa architektura polega na kierowaniu według obciążenia, a nie na standaryzacji na jednym z nich.

Wniosek, który warto wyciągnąć z tego porównania, nie polega na tym, że Microsoft wygrał. Chodzi o to, że transkrypcja strumieniowa ma teraz dwie wiarygodne, wiodące opcje o identycznej cenie, co oznacza, że decyzja przeniosła się z pytania „co jest dostępne” na pytanie „czego potrzebuje to konkretne obciążenie”. To lepszy rodzaj problemu.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie