Karta główna artykułu z napisem „Grok Voice Transcribe 2.0”, plakietką „NOWOŚCI” i podtytułem „Miejsce nr 1 pod względem dokładności streamingu, w niezmienionej cenie”, z chipami o treści: 2,7% WER końcowego transkryptu, 3,4% pierwszego wyniku częściowego, 0,49 s po zakończeniu mowy i 0,20 USD za godzinę streamingu, na tle gradientu od białego do niebieskiego, z logo OrcaRouter w prawym dolnym rogu.
Engineering & Research

Grok Voice Transcribe 2.0 zajmuje 1. miejsce w rankingu dokładności transkrypcji strumieniowej przy niezmienionej cenie

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Grok Voice Transcribe 2.0 to model zamiany mowy na tekst, który został wydany przez SpaceXAI 18 września 2026 r., a jedyna liczba, która ma w nim znaczenie, to nie ta, od której zaczyna się wpis o premierze. Oto ona: pierwszy częściowy transkrypt — tekst, na którym agent głosowy faktycznie może działać, gdy rozmówca wciąż mówi i jest przerywany — spadł z 18,3% współczynnika błędów słów (WER) w Grok Voice Transcribe 1.0 do 3,4%. To pomiar na tablicy AA-WER Streaming firmy Artificial Analysis, gdzie nowy model zajmuje obecnie pierwsze miejsce zarówno w rankingu Final Transcript (2,7% WER, 0,49 sekundy po zakończeniu wypowiedzi), jak i w rankingu First Partial Transcript (3,4%, 0,49 sekundy). Dokładność finalnego transkryptu również się poprawiła, z 3,9% do 2,7%, co jest realne, ale umiarkowane. Skok w transkrypcie częściowym jest tym, który zmienia to, co można zbudować.

Co właściwie zmieniło się między 1.0 a 2.0

Obie wersje to ten sam produkt w tym samym API, a SpaceXAI nie wprowadziło żadnych zmian w interfejsie: Grok Voice Transcribe 2.0 wybiera się, przekazującgrok-voice-transcribe-2.0 do /v1/stt zamiast grok-voice-transcribe-1.0, albo wybierając tę wersję podczas tworzenia połączenia WebSocket do strumieniowania. Istniejące integracje, które pomijają parametr model, nadal otrzymują 1.0, dopóki SpaceXAI nie zmieni ustawienia domyślnego, co według firmy nastąpi w nadchodzących tygodniach wraz z wycofaniem starszej wersji. Do tego czasu 2.0 wymaga jawnego wyboru, a 1.0 można świadomie przypiąć, co jest właściwym rozwiązaniem dla takiej zmiany: możesz przetestować ją w A/B na własnym audio, zanim stanie się ona domyślnym ustawieniem produkcyjnym, niezależnie od tego, czy o to prosiłeś, czy nie.

Zestawione obok siebie liczby Artificial Analysis mówią o czymś bardziej konkretnym niż „dwa razy większa dokładność”:

• Dokładność końcowej transkrypcji — Grok Voice Transcribe 2.0 przy 2,7% WER w porównaniu z Grok Voice Transcribe 1.0 przy 3,9% w AA-WER Streaming; obie wartości mierzone po zakończeniu wypowiedzi

• Dokładność pierwszego częściowego transkryptu — 3,4% WER vs 18,3%, największa pojedyncza różnica między obiema wersjami

• Czas do końcowej transkrypcji — 0,49 s vs 0,37 s, więc nowy model wolniej zatwierdza niż ten, który zastępuje

• Czas do pierwszego częściowego wyniku — 0,49 s vs 0,25 s, również wolniej

• Dokładność wsadowa (bez strumieniowania) — 2,3% AA-WER w rankingu bez strumieniowania Artificial Analysis, wobec 4,07% dla Whisper Large v3 i 3,31% dla GPT Transcribe

• Przepustowość wsadowa — około 162× szybciej niż czas rzeczywisty na tej samej płytce, za 333× MAI-Transcribe-2 i przed 88× Gemini 3.5 Transcribe

Czwarta i piąta linia to szczere zastrzeżenie w tym wydaniu. SpaceXAI okupiło dokładność opóźnieniem. Nowy model zwraca pierwszy wynik częściowy i transkrypt końcowy o około jedną trzecią sekundy wolniej niż wersja 1.0. Na tablicy wyników, na której Deepgram Flux zwraca wynik częściowy w 0,02 sekundy, a Soniox v5 w 0,05, Grok Voice Transcribe 2.0 wcale nie konkuruje szybkością — konkuruje poprawnością i wygrywa ten kompromis z dużą przewagą. To, czy to właściwy kompromis, zależy wyłącznie od tego, czy Twoja aplikacja to agent głosowy działający na żywo, który musi zacząć odpowiadać głosem, czy pipeline transkrypcyjny, w którym pół sekundy jest niezauważalne.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Grok Voice Transcribe 1.0 — the numbers': the left column gives Grok Voice Transcribe 2.0 a 2.7% final transcript WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives Grok Voice Transcribe 1.0 3.9%, 18.3%, 0.37s and the same two prices, with throughput not measured; the footer credits both columns to Artificial Analysis.

Twierdzenie o „dwukrotnie większej dokładności” — sprawdzone

Nagłówek SpaceXAI mówi, że wersja 2.0 jest dwa razy dokładniejsza niż 1.0 w tej samej cenie, a jej własna tabela ewaluacyjna to potwierdza na wybranych przez nią zbiorach. W przypadku 8 kHz angielskich rozmów obsługi klienta współczynnik błędów słów spadł z 10,6% do 7,1%. W rozmowach z Grokiem — z 8,7% do 3,3%. W przypadku danych mówionych uwierzytelniających — kodów kont, numerów telefonów, adresów e-mail — z 7,2% do 3,2%. W przypadku krótkich poleceń w 19 językach — z 20,6% do 6,8%, czyli mniej więcej dwie trzecie mniej błędów. Te cztery zbiory pochodzą z ruchu produkcyjnego SpaceXAI, a porównania są własnością SpaceXAI; nikt spoza firmy ich nie odtworzył. Tabelę należy traktować jako mapę tego, gdzie model został dostrojony, a nie jako ogólną gwarancję dokładności.

Wynik Artificial Analysis to część, która nie została zgłoszona przez dostawcę: niezależny zestaw pomiarowy uruchomiony na około ośmiu godzinach audio, z wagą 50% dla prywatnego zbioru AA-AgentTalk i po 25% dla VoxPopuli i Earnings22. Wspiera węższe i bardziej użyteczne twierdzenie niż „dwukrotnie większa dokładność” — że na tym konkretnym miksie ten model jest najdokładniejszym zmierzonym transkryberem strumieniowym. Jeden szczegół wart wspomnienia: post SpaceXAI opisuje pierwsze miejsce „wśród 32 modeli strumieniowych”, podczas gdy sama strona rankingu przedstawia 27 z 33 modeli. Miejsce w rankingu jest prawdziwe; liczba uczestników w materiałach marketingowych to liczba podana przez firmę, a nie liczba z rankingu.

Warto też doprecyzować, co obejmuje pierwsze miejsce w AA-WER Streaming, a czego nie obejmuje. Ranking jest zorientowany na język angielski i zdominowany przez rozmowy agentów. Nie mierzy twojego akcentu, twojego kodeka, słownictwa dziedzinowego ani twojego ośmiokanałowego audio z centrum obsługi telefonicznej. Model, który zajmuje w nim pierwsze miejsce, wciąż może mocno przegrać na twoich nagraniach i właśnie dlatego okno opt-in ma znaczenie.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard, showing Grok Voice Transcribe 2.0 first on both the Final Transcription ranking at 2.728% word error rate and 0.490s and the First Partial Transcription ranking at 3.359% and 0.489s, with Grok Voice Transcribe 1.0 further down at 18.275% on partials.

Ceny pozostają bez zmian, a to jest tutaj drugi najważniejszy fakt.

Grok Voice Transcribe 2.0 kosztuje tyle, ile kosztowała wersja 1.0: 0,10 USD za godzinę audio w przypadku przetwarzania wsadowego i plików nagranych przez endpoint REST oraz 0,20 USD za godzinę audio w przypadku strumieniowania przez WebSocket. W cenniku Artificial Analysis SKU strumieniowe osiąga 3,33 USD za 1000 minut, a SKU wsadowe 1,67 USD — taka sama stawka za przetwarzanie wsadowe, jaką Microsoft pobiera w przypadku MAI-Transcribe-2, i około jednej trzeciej tego, ile kosztuje ElevenLabs Scribe v2 Realtime za minutę strumieniowania.

Diaryzacja, znaczniki czasu na poziomie słów z ocenami pewności oraz faworyzowanie kluczowych terminów są wliczone w tę stawkę, a nie rozliczane osobno, co nie jest powszechne na tym rynku. Gemini 3.5 Transcribe Live rozlicza za token zarówno za wejście audio, jak i wyjście tekstowe, więc koszt zmienia się w zależności od tego, ile model mówi, a nie tylko od tego, jak długo trwało audio. Stała stawka za godzinę jest łatwiejsza do prognozowania i łatwiejsza do porównania między dostawcami — a ponieważ OrcaRouter przekazuje ceny katalogowe dostawców bez marży (0% marży), zmiana tej stawki po stronie dostawcy pojawiłaby się po naszej stronie tego samego dnia, a nie po cyklu zmiany cen.

Co tak naprawdę daje ci API

Lista możliwości jest szeroka i w większości odziedziczona, a nie nowa, co warto wiedzieć, jeśli oceniasz aktualizację wyłącznie pod kątem funkcji:

• Przetwarzanie wsadowe i strumieniowe w jednym modelu — REST dla nagranych plików do 500 MB, WebSocket pod wss://api.x.ai/v1/stt z wynikami tymczasowymi przesyłanymi mniej więcej co 500 ms

• W zestawie diaryzacja mówców oraz transkrypcja wielokanałowa do 8 niezależnych kanałów

• Znaczniki czasu na poziomie słów z ocenami pewności, dzięki czemu można ustalać próg dla fragmentów o niskiej pewności, zamiast w równym stopniu ufać całemu transkryptowi

• Faworyzowanie terminów kluczowych: do 100 terminów domenowych na żądanie, każdy o długości do 50 znaków

• Odwrotna normalizacja tekstu dla liczb, dat, walut, numerów telefonów i adresów e-mail, z obsługą formatowania w formie pisanej w 25 językach

• Usuwanie słów wypełniających i wykrywanie końca wypowiedzi Smart Turn skierowane wprost do agentów głosowych

• Automatyczne wykrywanie języka z przełączaniem języka w trakcie nagrywania w jednym przebiegu, w 12 formatach audio i częstotliwościach próbkowania od 8 kHz do 48 kHz

• Limity usługi: 10 żądań na sekundę zarówno w REST, jak i w strumieniowaniu, oraz 100 równoczesnych sesji strumieniowych na zespół, hostowane w us-east-1

Jedyna uwaga produkcyjna, której nie ma na liście funkcji: usługa działa w jednym regionie. Jeśli Twoje audio pochodzi spoza Stanów Zjednoczonych, odcinek sieciowy jest teraz częścią Twojego budżetu opóźnień, a AA-WER Streaming jawnie wlicza opóźnienie sieciowe do swojego pomiaru czasu. SpaceXAI oferuje warunki zerowej retencji danych i powołuje się na SOC 2 Type II, umowy BAA oraz opcje rezydencji danych w UE, więc kwestia zgodności jest bardziej rozwinięta niż kwestia geograficzna.

Screenshot of the SpaceXAI docs.x.ai Speech-to-Text page listing the Grok Voice Transcribe 2.0 REST and WebSocket endpoints, the grok-voice-transcribe-2.0 model parameter, the 500 MB file limit, key-term biasing and the published rate limits.

Kto powinien wykonać ruch i na co uważać

Jeśli już korzystasz z Grok Voice Transcribe 1.0, a Twoja aplikacja działa na podstawie częściowych transkrypcji — wykrywanie tur, barge-in, odpowiedzi agenta na żywo — luka w dokładności częściowej od 18,3% do 3,4% jest wystarczająco duża, że testowanie 2.0 nie jest opcjonalne. Ta liczba przechodząca z „zwykle błędnej” na „zwykle poprawną” to różnica między częściową transkrypcją, na której można oprzeć routing, a taką, którą można tylko wyświetlić. Jeśli Twoja aplikacja czeka na końcowe transkrypcje z nagranych plików, poprawa jest realna, ale mniejsza, a dodatkowe 0,12 sekundy opóźnienia zatwierdzenia jest tego kosztem.

Jeśli korzystasz z zupełnie innego dostawcy, powodem, by przyjrzeć się temu wydaniu, nie jest pozycja w rankingu — chodzi o to, że czołowe laboratorium właśnie znacznie poprawiło swój model transkrypcji, nie podnosząc ceny, a tak wygląda rynek, gdy dokładność przestaje być tym, za co się pobiera opłatę. Ścieżka aktualizacji jest też najtańszą z możliwych: jeden parametr, żadnych zmian w kodzie, żadnej nowej umowy, a do tego możliwość przypięcia wersji, jeśli coś pójdzie nie tak.

Następną rzeczą, na którą warto uważać, jest zmiana domyślnej wersji. Gdy SpaceXAI ustawi 2.0 jako domyślną i zacznie wycofywać 1.0, każda integracja, która nigdy nie przekazywała parametru modelu, przejdzie na nowy model od razu — wraz ze zmianą opóźnienia. Zespoły, które polegają na starym 0,25-sekundowym taktowaniu wyników częściowych, powinny już teraz przypiąć wersję, zamiast odkrywać tę zmianę na produkcji. Druga rzecz, na którą warto uważać, to niezależna reprodukcja: wpis w Artificial Analysis to prawdziwy pomiar, ale to jedna tablica wyników na jednym miksie audio i żadna strona trzecia nie opublikowała jeszcze testu 1.0 kontra 2.0 w identycznych warunkach na produkcyjnym audio.