
Grok Voice Transcribe 2.0 zajmuje 1. miejsce w rankingu dokładności transkrypcji strumieniowej przy niezmienionej cenie
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 to model zamiany mowy na tekst, który został wydany przez SpaceXAI 18 września 2026 r., a jedyna liczba, która ma w nim znaczenie, to nie ta, od której zaczyna się wpis o premierze. Oto ona: pierwszy częściowy transkrypt — tekst, na którym agent głosowy faktycznie może działać, gdy rozmówca wciąż mówi i jest przerywany — spadł z 18,3% współczynnika błędów słów (WER) w Grok Voice Transcribe 1.0 do 3,4%. To pomiar na tablicy AA-WER Streaming firmy Artificial Analysis, gdzie nowy model zajmuje obecnie pierwsze miejsce zarówno w rankingu Final Transcript (2,7% WER, 0,49 sekundy po zakończeniu wypowiedzi), jak i w rankingu First Partial Transcript (3,4%, 0,49 sekundy). Dokładność finalnego transkryptu również się poprawiła, z 3,9% do 2,7%, co jest realne, ale umiarkowane. Skok w transkrypcie częściowym jest tym, który zmienia to, co można zbudować.
Co właściwie zmieniło się między 1.0 a 2.0
Obie wersje to ten sam produkt w tym samym API, a SpaceXAI nie wprowadziło żadnych zmian w interfejsie: Grok Voice Transcribe 2.0 wybiera się, przekazującgrok-voice-transcribe-2.0 do /v1/stt zamiast grok-voice-transcribe-1.0, albo wybierając tę wersję podczas tworzenia połączenia WebSocket do strumieniowania. Istniejące integracje, które pomijają parametr model, nadal otrzymują 1.0, dopóki SpaceXAI nie zmieni ustawienia domyślnego, co według firmy nastąpi w nadchodzących tygodniach wraz z wycofaniem starszej wersji. Do tego czasu 2.0 wymaga jawnego wyboru, a 1.0 można świadomie przypiąć, co jest właściwym rozwiązaniem dla takiej zmiany: możesz przetestować ją w A/B na własnym audio, zanim stanie się ona domyślnym ustawieniem produkcyjnym, niezależnie od tego, czy o to prosiłeś, czy nie.
Zestawione obok siebie liczby Artificial Analysis mówią o czymś bardziej konkretnym niż „dwa razy większa dokładność”:
• Dokładność końcowej transkrypcji — Grok Voice Transcribe 2.0 przy 2,7% WER w porównaniu z Grok Voice Transcribe 1.0 przy 3,9% w AA-WER Streaming; obie wartości mierzone po zakończeniu wypowiedzi
• Dokładność pierwszego częściowego transkryptu — 3,4% WER vs 18,3%, największa pojedyncza różnica między obiema wersjami
• Czas do końcowej transkrypcji — 0,49 s vs 0,37 s, więc nowy model wolniej zatwierdza niż ten, który zastępuje
• Czas do pierwszego częściowego wyniku — 0,49 s vs 0,25 s, również wolniej
• Dokładność wsadowa (bez strumieniowania) — 2,3% AA-WER w rankingu bez strumieniowania Artificial Analysis, wobec 4,07% dla Whisper Large v3 i 3,31% dla GPT Transcribe
• Przepustowość wsadowa — około 162× szybciej niż czas rzeczywisty na tej samej płytce, za 333× MAI-Transcribe-2 i przed 88× Gemini 3.5 Transcribe
Czwarta i piąta linia to szczere zastrzeżenie w tym wydaniu. SpaceXAI okupiło dokładność opóźnieniem. Nowy model zwraca pierwszy wynik częściowy i transkrypt końcowy o około jedną trzecią sekundy wolniej niż wersja 1.0. Na tablicy wyników, na której Deepgram Flux zwraca wynik częściowy w 0,02 sekundy, a Soniox v5 w 0,05, Grok Voice Transcribe 2.0 wcale nie konkuruje szybkością — konkuruje poprawnością i wygrywa ten kompromis z dużą przewagą. To, czy to właściwy kompromis, zależy wyłącznie od tego, czy Twoja aplikacja to agent głosowy działający na żywo, który musi zacząć odpowiadać głosem, czy pipeline transkrypcyjny, w którym pół sekundy jest niezauważalne.

Twierdzenie o „dwukrotnie większej dokładności” — sprawdzone
Nagłówek SpaceXAI mówi, że wersja 2.0 jest dwa razy dokładniejsza niż 1.0 w tej samej cenie, a jej własna tabela ewaluacyjna to potwierdza na wybranych przez nią zbiorach. W przypadku 8 kHz angielskich rozmów obsługi klienta współczynnik błędów słów spadł z 10,6% do 7,1%. W rozmowach z Grokiem — z 8,7% do 3,3%. W przypadku danych mówionych uwierzytelniających — kodów kont, numerów telefonów, adresów e-mail — z 7,2% do 3,2%. W przypadku krótkich poleceń w 19 językach — z 20,6% do 6,8%, czyli mniej więcej dwie trzecie mniej błędów. Te cztery zbiory pochodzą z ruchu produkcyjnego SpaceXAI, a porównania są własnością SpaceXAI; nikt spoza firmy ich nie odtworzył. Tabelę należy traktować jako mapę tego, gdzie model został dostrojony, a nie jako ogólną gwarancję dokładności.
Wynik Artificial Analysis to część, która nie została zgłoszona przez dostawcę: niezależny zestaw pomiarowy uruchomiony na około ośmiu godzinach audio, z wagą 50% dla prywatnego zbioru AA-AgentTalk i po 25% dla VoxPopuli i Earnings22. Wspiera węższe i bardziej użyteczne twierdzenie niż „dwukrotnie większa dokładność” — że na tym konkretnym miksie ten model jest najdokładniejszym zmierzonym transkryberem strumieniowym. Jeden szczegół wart wspomnienia: post SpaceXAI opisuje pierwsze miejsce „wśród 32 modeli strumieniowych”, podczas gdy sama strona rankingu przedstawia 27 z 33 modeli. Miejsce w rankingu jest prawdziwe; liczba uczestników w materiałach marketingowych to liczba podana przez firmę, a nie liczba z rankingu.
Warto też doprecyzować, co obejmuje pierwsze miejsce w AA-WER Streaming, a czego nie obejmuje. Ranking jest zorientowany na język angielski i zdominowany przez rozmowy agentów. Nie mierzy twojego akcentu, twojego kodeka, słownictwa dziedzinowego ani twojego ośmiokanałowego audio z centrum obsługi telefonicznej. Model, który zajmuje w nim pierwsze miejsce, wciąż może mocno przegrać na twoich nagraniach i właśnie dlatego okno opt-in ma znaczenie.

Ceny pozostają bez zmian, a to jest tutaj drugi najważniejszy fakt.
Grok Voice Transcribe 2.0 kosztuje tyle, ile kosztowała wersja 1.0: 0,10 USD za godzinę audio w przypadku przetwarzania wsadowego i plików nagranych przez endpoint REST oraz 0,20 USD za godzinę audio w przypadku strumieniowania przez WebSocket. W cenniku Artificial Analysis SKU strumieniowe osiąga 3,33 USD za 1000 minut, a SKU wsadowe 1,67 USD — taka sama stawka za przetwarzanie wsadowe, jaką Microsoft pobiera w przypadku MAI-Transcribe-2, i około jednej trzeciej tego, ile kosztuje ElevenLabs Scribe v2 Realtime za minutę strumieniowania.
Diaryzacja, znaczniki czasu na poziomie słów z ocenami pewności oraz faworyzowanie kluczowych terminów są wliczone w tę stawkę, a nie rozliczane osobno, co nie jest powszechne na tym rynku. Gemini 3.5 Transcribe Live rozlicza za token zarówno za wejście audio, jak i wyjście tekstowe, więc koszt zmienia się w zależności od tego, ile model mówi, a nie tylko od tego, jak długo trwało audio. Stała stawka za godzinę jest łatwiejsza do prognozowania i łatwiejsza do porównania między dostawcami — a ponieważ OrcaRouter przekazuje ceny katalogowe dostawców bez marży (0% marży), zmiana tej stawki po stronie dostawcy pojawiłaby się po naszej stronie tego samego dnia, a nie po cyklu zmiany cen.
Co tak naprawdę daje ci API
Lista możliwości jest szeroka i w większości odziedziczona, a nie nowa, co warto wiedzieć, jeśli oceniasz aktualizację wyłącznie pod kątem funkcji:
• Przetwarzanie wsadowe i strumieniowe w jednym modelu — REST dla nagranych plików do 500 MB, WebSocket pod wss://api.x.ai/v1/stt z wynikami tymczasowymi przesyłanymi mniej więcej co 500 ms
• W zestawie diaryzacja mówców oraz transkrypcja wielokanałowa do 8 niezależnych kanałów
• Znaczniki czasu na poziomie słów z ocenami pewności, dzięki czemu można ustalać próg dla fragmentów o niskiej pewności, zamiast w równym stopniu ufać całemu transkryptowi
• Faworyzowanie terminów kluczowych: do 100 terminów domenowych na żądanie, każdy o długości do 50 znaków
• Odwrotna normalizacja tekstu dla liczb, dat, walut, numerów telefonów i adresów e-mail, z obsługą formatowania w formie pisanej w 25 językach
• Usuwanie słów wypełniających i wykrywanie końca wypowiedzi Smart Turn skierowane wprost do agentów głosowych
• Automatyczne wykrywanie języka z przełączaniem języka w trakcie nagrywania w jednym przebiegu, w 12 formatach audio i częstotliwościach próbkowania od 8 kHz do 48 kHz
• Limity usługi: 10 żądań na sekundę zarówno w REST, jak i w strumieniowaniu, oraz 100 równoczesnych sesji strumieniowych na zespół, hostowane w us-east-1
Jedyna uwaga produkcyjna, której nie ma na liście funkcji: usługa działa w jednym regionie. Jeśli Twoje audio pochodzi spoza Stanów Zjednoczonych, odcinek sieciowy jest teraz częścią Twojego budżetu opóźnień, a AA-WER Streaming jawnie wlicza opóźnienie sieciowe do swojego pomiaru czasu. SpaceXAI oferuje warunki zerowej retencji danych i powołuje się na SOC 2 Type II, umowy BAA oraz opcje rezydencji danych w UE, więc kwestia zgodności jest bardziej rozwinięta niż kwestia geograficzna.

Kto powinien wykonać ruch i na co uważać
Jeśli już korzystasz z Grok Voice Transcribe 1.0, a Twoja aplikacja działa na podstawie częściowych transkrypcji — wykrywanie tur, barge-in, odpowiedzi agenta na żywo — luka w dokładności częściowej od 18,3% do 3,4% jest wystarczająco duża, że testowanie 2.0 nie jest opcjonalne. Ta liczba przechodząca z „zwykle błędnej” na „zwykle poprawną” to różnica między częściową transkrypcją, na której można oprzeć routing, a taką, którą można tylko wyświetlić. Jeśli Twoja aplikacja czeka na końcowe transkrypcje z nagranych plików, poprawa jest realna, ale mniejsza, a dodatkowe 0,12 sekundy opóźnienia zatwierdzenia jest tego kosztem.
Jeśli korzystasz z zupełnie innego dostawcy, powodem, by przyjrzeć się temu wydaniu, nie jest pozycja w rankingu — chodzi o to, że czołowe laboratorium właśnie znacznie poprawiło swój model transkrypcji, nie podnosząc ceny, a tak wygląda rynek, gdy dokładność przestaje być tym, za co się pobiera opłatę. Ścieżka aktualizacji jest też najtańszą z możliwych: jeden parametr, żadnych zmian w kodzie, żadnej nowej umowy, a do tego możliwość przypięcia wersji, jeśli coś pójdzie nie tak.
Następną rzeczą, na którą warto uważać, jest zmiana domyślnej wersji. Gdy SpaceXAI ustawi 2.0 jako domyślną i zacznie wycofywać 1.0, każda integracja, która nigdy nie przekazywała parametru modelu, przejdzie na nowy model od razu — wraz ze zmianą opóźnienia. Zespoły, które polegają na starym 0,25-sekundowym taktowaniu wyników częściowych, powinny już teraz przypiąć wersję, zamiast odkrywać tę zmianę na produkcji. Druga rzecz, na którą warto uważać, to niezależna reprodukcja: wpis w Artificial Analysis to prawdziwy pomiar, ale to jedna tablica wyników na jednym miksie audio i żadna strona trzecia nie opublikowała jeszcze testu 1.0 kontra 2.0 w identycznych warunkach na produkcyjnym audio.
