Karta hero artykułu z napisem „Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe”, z odznaką „PORÓWNANIE MODELI” i podtytułem „Pas strumieniowania należy do jednego z nich”, z żetonami: 2,7% vs 4,0% WER strumieniowania, 3,4% vs 5,8% pierwszy wynik częściowy, 0,49 s vs 0,40 s wynik końcowy i 1,67 USD vs 5,00 USD za 1000 minut, na tle gradientu od białego do niebieskiego, z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Grok Voice Transcribe 2.0 kontra Gemini 3.5 Transcribe: Pasmo transmisji strumieniowej należy do jednego z nich

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Grok Voice Transcribe 2.0 i Gemini 3.5 Transcribe to dwa najnowsze czołowe modele zamiany mowy na tekst od konkurencyjnych laboratoriów, a uczciwym sposobem ich porównania jest przyznanie od razu, że nie zostały stworzone do tego samego zadania. Grok Voice Transcribe 2.0 firmy SpaceXAI, wydany 18 września 2026 r., to model zorientowany przede wszystkim na strumieniowanie, z dołączonym trybem wsadowym: przewodzi rankingowi AA-WER Streaming z 2,7% współczynnikiem błędów słów dla transkrypcji końcowych i 3,4% dla pierwszych wyników częściowych, przy czym oba pojawiają się 0,49 sekundy po zakończeniu mowy. Gemini 3.5 Transcribe, wydany 26 sierpnia 2026 r., to model zorientowany przede wszystkim na przetwarzanie wsadowe, z dołączonym SKU strumieniowym, a jego dwie połowy zachowują się bardzo różnie — ścieżka nagrań wcześniejszych osiąga 2,6% AA-WER w rankingu niestrumieniowym Artificial Analysis, podczas gdy osobny gemini-3.5-transcribe-live endpoint osiąga 4,0% w rankingu strumieniowym przy 0,40 sekundy. Zestaw te cztery liczby obok siebie, a kształt tego starcia stanie się oczywisty: są blisko siebie pod względem dokładności tam, gdzie Gemini 3.5 Transcribe jest mocny, i nie są blisko tam, gdzie mocny jest Grok Voice Transcribe 2.0.

Jedyna linia, na której oboje walczą

Oba modele potrafią transkrybować dźwięk na żywo, więc streaming to jedyna dziedzina, w której bezpośrednie porównanie ma sens. Tam Grok Voice Transcribe 2.0 wyprzedza Gemini 3.5 Transcribe Live o 1,3 punktu pod względem dokładności transkrypcji końcowej — 2,7% wobec 4,0% WER w tym samym środowisku testowym, na tych samych mniej więcej ośmiu godzinach dźwięku i przy tym samym rozkładzie wag 50/25/25 w AA-AgentTalk, VoxPopuli i Earnings22. To nie jest różnica wynikająca z zaokrąglenia; przy takich wskaźnikach błędów to mniej więcej jedno dodatkowe błędne słowo na każde siedemdziesiąt pięć słów transkrybowanych przez model Google. W przypadku pierwszych transkrypcji częściowych różnica jest jeszcze większa — 3,4% wobec 5,8% — a to właśnie na transkrypcjach częściowych agent głosowy na żywo musi działać, zanim mówiący skończy.

Opóźnienie działa w drugą stronę i to jest ta część porównania, która umyka. Gemini 3.5 Transcribe Live zwraca ostateczny transkrypt 0,40 sekundy po zakończeniu mowy wobec 0,49 u Groka, a pierwszy wynik częściowy po 0,25 sekundy wobec 0,49 u Groka — około dwa razy szybciej do pierwszego użytecznego słowa. Żaden z tych modeli nie rywalizuje z naprawdę szybką częścią tego rankingu, w której Deepgram Flux osiąga 0,02 sekundy, a Soniox v5 0,05, ale między tymi dwoma kompromis jest wyraźny: Google szybciej się odzywa, SpaceXAI z większym prawdopodobieństwem ma rację, gdy już to robi. W przypadku agenta prowadzącego naprzemienną rozmowę, który nie może wchodzić w słowo dzwoniącemu, dodatkowe 0,24 sekundy opóźnienia w wynikach częściowych to realny koszt, który musi uzasadnić przewaga w dokładności.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe — the numbers': the left column gives Grok Voice Transcribe 2.0 a 2.7% streaming final WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and a 100-concurrent-session cap; the right column gives Gemini 3.5 Transcribe 4.0%, 5.8%, 0.40s, $5.00, about $5.40 and a 10-minute session cap.

Gdzie Gemini 3.5 Transcribe faktycznie wygrywa

Pokrycie językowe jest najoczywistszą przewagą — i nie ma tu nawet zbliżonej konkurencji. Model Google'a obsługuje ponad 85 języków; Grok Voice Transcribe 2.0 obsługuje dziesiątki, z formatowaniem w formie pisemnej — odwrotną normalizacją tekstu, która zamienia wypowiadane liczby, daty, waluty i adresy e-mail na ich zapisane formy — udokumentowanym w 25 językach. Jeśli Twoje nagranie jest po portugalsku, wietnamsku albo jest mieszanką dwóch języków z przełączaniem kodu w jednym zdaniu, pytanie, który model jest dokładniejszy w rankingu Artificial Analysis, jest w dużej mierze akademickie, ponieważ ten ranking jest zdominowany przez angielski i rozmowy agentów. Google podaje 5,50% WER w trybie strumieniowym i 5,04% w trybie niestrumieniowym na FLEURS w swoim własnym zestawie wielojęzycznym; są to liczby raportowane przez dostawcę i nieodtworzone niezależnie, ale przynajmniej w ogóle opisują przypadek wielojęzyczny.

Drugim atutem jest darmowy plan. Gemini 3.5 Transcribe oferuje darmowe tokeny wejściowe i wyjściowe w API Google, z zastrzeżeniem, że treści z darmowego planu są wykorzystywane do ulepszania produktów Google, a treści z planu płatnego nie. W przypadku prototypu, projektu pobocznego lub narzędzia wewnętrznego przetwarzającego audio, za którego transkrypcję normalnie byś nie zapłacił, jest to realna opcja, której nie dorówna żaden dostawca rozliczający się za godzinę. Grok Voice Transcribe 2.0 jest płatny od pierwszej godziny audio.

Po trzecie, Gemini 3.5 Transcribe to ogólny model multimodalny z trybem transkrypcji, a nie specjalizowana usługa ASR. Można go wywoływać za pomocą podpowiedzi, może przyjmować tekst jako kontekst i znajduje się w tym samym interfejsie API co wszystko inne, co udostępnia Google. Jeśli transkrypcja jest jednym z kroków potoku, który wymaga również rozumowania nad transkryptem, utrzymanie obu w jednym wywołaniu modelu jest warte coś, czego wskaźnik błędów na słowo nie oddaje.

Kalkulacja ceny za tysiąc minut

Artificial Analysis normalizuje oba modele do kosztu za 1000 minut audio, co jest jedynym sposobem porównania stałej stawki godzinowej z rozliczaniem za tokeny:

• Wsadowe, wstępnie nagrane — Grok Voice Transcribe 2.0 za 1,67 USD za 1000 minut (0,10 USD/godz.) w porównaniu z Gemini 3.5 Transcribe za 5,00 USD za 1000 minut (0,30 USD/godz., od 2,00 USD za 1 mln tokenów wejściowych i 12,00 USD za 1 mln tokenów wyjściowych)

• Transmisja strumieniowa — Grok Voice Transcribe 2.0 po 3,33 USD za 1000 minut (0,20 USD/godz.) w porównaniu z Gemini 3.5 Transcribe Live po około 5,40 USD za 1000 minut, przy stawce mieszanej obliczonej na podstawie 3,50 USD za 1 mln tokenów wejściowych audio i 21,00 USD za 1 mln tokenów wyjściowych tekstowych

• Przepustowość wsadowa — Grok Voice Transcribe 2.0 przy około 162× czasu rzeczywistego w porównaniu z Gemini 3.5 Transcribe przy około 88× na tej samej platformie, więc tańszy model jest również szybszy w pracy z plikami

• Limit sesji na żywo — Grok Voice Transcribe 2.0 strumieniuje przez WebSocket bez publikowanego pułapu sesji poza 100 równoczesnymi sesjami na zespół, podczas gdy Gemini 3.5 Transcribe Live ma limit 10 minut na sesję

Ta ostatnia linia to szczegół operacyjny, który przesądza o większej liczbie architektur niż liczby dotyczące dokładności. Limit 10 minut na sesję na żywo oznacza, że długie połączenia, długie spotkania i długie transmisje muszą być pocięte i ustanawiane od nowa, a każde ponowne ustanowienie to szew, w którym ginie kontekst. Punkt końcowy strumieniowania Groka ma limit rozmiaru pliku wynoszący 500 MB na ścieżce wsadowej oraz limit współbieżności wynoszący 100 sesji na zespół na ścieżce strumieniowania, co jest innym rodzajem ograniczenia — przepustowość, a nie czas trwania.

Rozliczanie za tokeny warto zrozumieć, zanim zdecydujesz się na rozwiązanie Google, ponieważ sprawia ono, że twój rachunek staje się funkcją dwóch zmiennych, a nie jednej. Gemini nalicza osobno opłaty za wejście audio i wyjście tekstowe, więc model, który generuje rozwlekłe formatowanie albo się powtarza, kosztuje więcej niż taki, który tego nie robi, a język z dłuższymi słowami kosztuje więcej niż język z krótszymi. Stała stawka godzinowa Groka nie zmienia się pod wpływem żadnego z tych czynników. W przypadku obciążeń o dużym wolumenie stała stawka jest łatwiejsza do prognozowania, a ponieważ OrcaRouter przekazuje ceny katalogowe dostawców bez marży (0%), zmiana po stronie któregokolwiek z dostawców trafia do twojego rachunku w dniu, w którym nastąpi, a nie przy kolejnym odnowieniu umowy.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard, showing Grok Voice Transcribe 2.0 first at 2.728% final-transcript word error rate and 0.490s, Gemini 3.5 Transcribe Live at 3.998% and 0.395s with a 5.774% first-partial figure, and the faster Deepgram Flux and Soniox v5 rows for latency context.

Kształty funkcji: czego każda z nich odmawia zrobić

Listy możliwości różnią się bardziej, niż sugerują to liczby dotyczące dokładności, a luki występują w miejscach istotnych dla konkretnych zastosowań:

• Diaryzacja mówców — wliczona bez dodatkowych opłat w Grok Voice Transcribe 2.0; nieobsługiwana w Gemini 3.5 Transcribe Live, więc transkrypcje na żywo z przypisaniem mówców nie są w ogóle dostępne w tym punkcie końcowym

• Znaczniki czasu na poziomie słów — Grok Voice Transcribe 2.0 zwraca je wraz z ocenami pewności dla poszczególnych słów; Gemini 3.5 Transcribe Live nie zwraca żadnych, co wyklucza progowanie pewności i precyzyjne wyrównanie napisów

• Audio wielokanałowe — Grok Voice Transcribe 2.0 transkrybuje do 8 niezależnych kanałów w jednym przebiegu; Gemini 3.5 Transcribe Live nie ma odpowiednika, więc wielokanałowe nagrania rozmów wymagają osobnych sesji dla każdego kanału

• Faworyzowanie kluczowych terminów — Grok Voice Transcribe 2.0 przyjmuje do 100 terminów domenowych na żądanie; Gemini 3.5 Transcribe przyjmuje własne słownictwo i opcjonalne wskazówki językowe

• Zaplecze agentów głosowych — Grok Voice Transcribe 2.0 wprowadza usuwanie słów-wypełniaczy oraz wykrywanie końca tury Smart Turn; Gemini 3.5 Transcribe Live obsługuje przypadek strumieniowania, ale logikę tur pozostawia aplikacji

• Obsługa danych wejściowych — Grok Voice Transcribe 2.0 przyjmuje bezpośrednie przesyłanie plików do 500 MB w 12 formatach audio; ścieżka dla nagrań wcześniej przygotowanych Gemini 3.5 Transcribe wymaga publicznego adresu URL HTTPS z limitem 15 minut i 300 MB i nie może łączyć swojego trybu Smart formatting ze znacznikami czasu słów ani etykietami mówców.

Wzorzec na tej liście jest taki, że SpaceXAI zbudował produkt do transkrypcji, a Google zbudowało możliwość transkrypcji. Diaryzacja, znaczniki czasu, dzielenie kanałów i wykrywanie tur to funkcje, których potrzebujesz, gdy transkrypcja jest całą aplikacją; możliwość promptowania, szeroki zakres językowy i jedno API do wszystkiego to to, czego chcesz, gdy transkrypcja jest krokiem wewnątrz większej całości. Żadna z list nie jest lepsza w abstrakcji, a zespół, który wybiera tylko na podstawie dokładności, skończy na braku tego zestawu, którego nie potrzebował.

Screenshot of the Google ai.google.dev speech-generation documentation for Gemini 3.5 Transcribe, showing the pre-recorded and live transcription endpoints, the token-based audio-input and text-output pricing, the supported-language list and the 10-minute live session ceiling.

Wybór między nimi i co zmienia odpowiedź

Sięgaj po Grok Voice Transcribe 2.0, gdy transkrypcja musi być poprawna, podczas gdy dźwięk wciąż jest odtwarzany: naprzemienne wypowiedzi agentów na żywo, napisy w czasie rzeczywistym, które nie mogą sobie pozwolić na błąd, strumienie z centrów kontaktowych, w których przypisanie mówiącego i separacja kanałów są częścią wymagań, albo dowolny potok przetwarzania wsadowego, w którym zarówno 1,67 USD za 1000 minut, jak i 162× przepustowości mają znaczenie. Sięgaj po Gemini 3.5 Transcribe, gdy audio jest wielojęzyczne w języku spoza udokumentowanego zestawu Grok, gdy transkrypcja zasila model, który także musi nad nią rozumować, gdy chcesz mieć darmowy plan do prototypowania albo gdy 2,6% AA-WER w trybie wsadowym jest po prostu wystarczające do tego, co robisz, a dodatkowe pokrycie językowe jest warte więcej niż różnica w cenie.

Większość zespołów tak naprawdę nie dokonuje tu wyboru. Oba modele są dostępne przez jeden klucz API OrcaRouter obok ponad 200 innych modeli, co oznacza, że możesz kierować ruch agenta na żywo do Grok Voice Transcribe 2.0, a długie wielojęzyczne archiwa do Gemini 3.5 Transcribe, bez utrzymywania dwóch umów z dostawcami, dwóch relacji rozliczeniowych i dwóch zestawów poświadczeń. To także sposób na rozstrzygnięcie kwestii dokładności dla własnego audio: uruchom oba modele na tych samych nagraniach, porównaj transkrypcje, które faktycznie otrzymałeś, i pozwól DSL-owi routingu kierować ruch tam, gdzie powinien trafić. Ranking mówi ci, który model wygrywa na ośmiu godzinach cudzej rozmowy agenta po angielsku; tylko twoje własne audio mówi ci, który z nich wygrywa na twoich nagraniach.

Otwarte pytanie brzmi, co stanie się z tą luką w strumieniowaniu, gdy Google następnym razem zmieni endpoint Live. Gemini 3.5 Transcribe Live zadebiutował w publicznej wersji zapoznawczej, a jego wynik 4,0% zmierzono około dobę po tym, jak można było go wywołać — to silny wczesny sygnał, ale miał mniej czasu, by się ustabilizować niż wynik Groka, za którym obecnie się plasuje. Jeśli Google zamknie 1,3-punktową lukę w strumieniowaniu, zachowując 0,25-sekundowe opóźnienie wyników częściowych, ten kompromis przestanie być kompromisem, a przewaga Groka ograniczy się do ceny i funkcji. Do tego czasu podział jest wyraźny: najszybsze wyniki częściowe należą do Google’a, najdokładniejsze do SpaceXAI, a żaden model na liście nie ma obu tych cech.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie