Grok Voice Think Fast 2.0: najszybszy i najdroższy agent głosowy xAI, wyjaśniony
Guides & Insights

Grok Voice Think Fast 2.0: najszybszy i najdroższy agent głosowy xAI, wyjaśniony

Autor

Jim Song

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

xAI wypuściło Grok Voice Think Fast 2.0 29 lipca 2026 roku — określany przez xAI jako „najbardziej zaawansowany model mowy do mowy” i nowy flagowiec swojej linii agentów głosowych. Odpowiada szybciej niż jakikolwiek rywal z pierwszej piątki (0,70 s do pierwszego dźwięku), przoduje w benchmarku agentów głosowych i transkrybuje dokładniej niż poprzednia generacja. Jest też o 60% droższy za minutę niż model, który zastępuje, jest rozliczany za pomocą licznika minutowego, który po cichu podnosi rachunek, oraz zawiera przełącznik aliasu wersji, który automatycznie aktywuje się za tydzień. Ten przewodnik wyjaśnia, czym naprawdę jest Think Fast 2.0, co xAI zmieniło pod maską, jak historia benchmarków dzieli się na niezależne wyniki i twierdzenia producenta, ile tak naprawdę kosztuje po przeliczeniu, oraz jak go wywoływać — a także zastrzeżenia, które warto przeczytać przed skierowaniem przez niego produkcyjnego ruchu połączeń.

Uwaga o dokładności: szczegóły premiery, ceny oraz trafność nagłówków i twierdzenia biznesowe pochodzą z ogłoszenia i dokumentacji xAI (2026-07-29). Złożone wyniki Artificial Analysis są niezależne i mierzone przez strony trzecie. Twierdzenia raportowane przez xAI — wyniki A/B Starlink, mnożniki transkrypcji, „60% mniej tokenów rozumowania" oraz określenie „prawie 5 razy szybciej" — nie mają opublikowanych danych źródłowych; traktuj je jako orientacyjne dane producenta i przeprowadź własne ewaluacje. Specyfikacje, ceny i zachowanie aliasów mogą się zmienić; zweryfikuj, zanim zaczniesz budować.

TL;DR. Grok Voice Think Fast 2.0 to model xAI typu end-to-end speech-to-speech przeznaczony dla agentów głosowych: audio na wejściu, audio na wyjściu przez WebSocket, bez osobnego potoku ASR→LLM→TTS. Jest naprawdę szybki (0,70 s do pierwszej odpowiedzi audio — jedyny model z pierwszej piątki poniżej sekundy) i naprawdę mocny w zadaniach agentów głosowych, zajmując pierwsze miejsce w benchmarku τ-Voice agent firmy Artificial Analysis (56,5%), a plasując się na drugim miejscu w ogólnym indeksie jakości speech-to-speech (82,9%), za Qwen Audio 3.0 Realtime Plus (84,1%). Rozumuje podczas mówienia — zmniejszając medianę zużycia tokenów rozumowania do około 40% w porównaniu ze starym modelem — i kosztuje 0,08 USD za minutę, wobec 0,05 USD wcześniej. Haczyk tkwi w liczniku: głos jest rozliczany za minutę czasu zegarowego audio, więc 60-procentowa podwyżka ceny modelu, którego obsługa jest tańsza, trafia bezpośrednio na twoją fakturę. A 5 sierpnia alias grok-voice-latest zacznie automatycznie przekierowywać na wersję 2.0, więc zespoły korzystające ze starej wersji muszą go świadomie przypiąć przed tym terminem.

Najważniejsze wnioski

Natywna mowa-na-mowę: jeden model od mikrofonu do głośnika, bez łańcucha ASR→LLM→TTS — dlatego pierwsze audio pojawia się w 0,70 s.

• Lider agentowy: #1 w benchmarku agentów τ-Voice firmy Artificial Analysis (56,5%), znacznie wyprzedzając GPT-Realtime-2.1 (45,7%) i Gemini 3.1 Flash (37,7%).

• Nie jest ogólnym liderem: #2 w indeksie jakości mowa-na-mowę (82.9%), za Qwen Audio 3.0 Realtime Plus (84.1%); OpenAI nadal wygrywa w dynamice konwersacji (95.7% vs 95.1%).

• 60% drożej: 0,08 USD/min (~4,80 USD/godz.) vs 0,05 USD/min za Think Fast 1.0 — mimo że model rzekomo zużywa ~60% mniej tokenów rozumowania.

• Przełączenie aliasu 5 sierpnia: grok-voice-latest będzie automatycznie kierować do wersji 2.0; przypnij grok-voice-think-fast-1.0 przed tym terminem, aby pozostać przy tańszej wersji.

• Oznacz każde twierdzenie: wyniki Artificial Analysis są niezależne; współczynniki Starlink A/B, mnożniki transkrypcji i ramy szybkości pochodzą z xAI i są niepublikowane.

Czym jest Grok Voice Think Fast 2.0

Grok Voice to rodzina modeli xAI działających w czasie rzeczywistym, przetwarzających mowę na mowę. „Think Fast” to linia szybkich odpowiedzi, wprowadzona pierwotnie wraz z Voice Agent Builder w kwietniu 2026 roku; Think Fast 2.0 to druga generacja tej linii, wydana 29 lipca 2026 roku. Model jest end-to-end: pobiera surowe audio, rozumuje i emituje dźwięk bezpośrednio, zamiast uruchamiać potok, w którym model rozpoznawania mowy zasila tekstowy LLM, a ten zasila model zamiany tekstu na mowę. Ten wybór architektoniczny jest źródłem przewagi w opóźnieniach — nie ma tu sekwencyjnych przeskoków ani pośredniego tekstu, więc model może zacząć odpowiadać, jeszcze słuchając.

xAI pozycjonuje go wyraźnie pod agentów głosowych AI: linie obsługi klienta, sprzedaż telefoniczną, recepcję, telefonię i inne zastosowania, w których system rozmawia z człowiekiem w czasie rzeczywistym i musi faktycznie coś załatwić — umówić rozmowę, zakwalifikować lead, zaktualizować rekord, przeszukać sieć — a nie tylko czatować. Akcent na działanie, a nie samą transkrypcję czy syntezę, to pole bitwy, na które celuje ta premiera.

Co nowego w porównaniu z Think Fast 1.0

Przejście z wersji 1.0 to coś więcej niż zmiana numeru; xAI opisuje trzy zmiany strukturalne:

• Równoległe rozumowanie podczas mówienia. Model rozumuje zapytanie w trakcie mówienia, zamiast najpierw myśleć, a potem mówić. W praktyce wywołania narzędzi mogą zostać uruchomione, zanim agent skończy pierwsze zdanie — to duża sprawa w przypadku przepływów głosowych o niskich opóźnieniach.

• Znacznie mniej tokenów rozumowania. xAI podaje, że mediana użycia tokenów rozumowania spadła do około 0,4x poprzednika (czyli o mniej więcej 60% mniej), co jest częścią powodu, dla którego — według firmy — model jest tańszy w utrzymaniu, mimo że cena wzrosła.

• Styl konwersacji wyuczony przez uczenie przez wzmacnianie. RL zmieniło sposób prowadzenia rozmów: krótsze zdania, jedno pytanie naraz, zero wypełniaczy — bardziej zwięzły, bardziej „ludzki” styl rozmowy, który sprawdza się w pracy telefonicznej, gdzie rozwlekłość pochłania minuty (a przy taryfie za minutę — pieniądze).

Jeśli chodzi o mierzalną szybkość, czas do pierwszego dźwięku spadł z 1.25s w wersji 1.0 do 0.70s w wersji 2.0. W zakresie transkrypcji xAI raportuje około 1.4x poprawę w 24 językach (dane producenta, poniżej).

Benchmarki, benchmark po benchmarku.

Premiera opiera się na Artificial Analysis, niezależnym zewnętrznym podmiocie zajmującym się benchmarkami. To istotne: w przeciwieństwie do większości pozostałych liczb w ogłoszeniu, te zostały zmierzone przez neutralną stronę i to właśnie je warto porównywać wprost. Obraz zbiorczy jest lepszy niż pojedynczy nagłówek.

Indeks jakości mowa-do-mowy: 82,9% (drugie miejsce). To ogólny wskaźnik zbiorczy mowa-do-mowy, który wzrósł z 75,7% dla Think Fast 1.0. Wyprzedza GPT-Realtime-2.1 (79,1%) i Gemini 3.1 Flash (69,5%) — ale nie jest pierwszy. Qwen Audio 3.0 Realtime Plus prowadzi z 84,1%. Więc „najlepszy ogólny model głosowy” to przesada, której nie potwierdzają dane; „najszybszy agentowy model głosowy w czołówce” to trafne określenie.

Benchmark agentowy τ-Voice: 56,5% (pierwsze miejsce). To metryka, która dla xAI jest najważniejsza, a ranking jest prawdziwy: 56,5% bije Think Fast 1.0 (52,1%), GPT-Realtime-2.1 (45,7%) i Gemini 3.1 Flash (37,7%). τ-Voice mierzy skuteczność agentów głosowych — jak dobrze model wykonuje zadania za pośrednictwem kanału głosowego, w tym korzystając z narzędzi w trakcie rozmowy. Na wąskiej osi „czy potrafi wykonać zadanie” prowadzi Grok. Musk promował dokładnie ten ranking.

Big Bench Audio: 97,2%. Benchmark rozumowania mowy; wynik solidny, choć Qwen osiągnął rekordowe 99,2%.

Full Duplex Bench: 95.1%. Dynamika konwersacji — obsługa przerwań, przejmowanie głosu, wtrącanie się. To duży skok w porównaniu z 77.8% w wersji 1.0, ale OpenAI wciąż nieznacznie przewyższa ten wynik, osiągając 95.7%, a Qwen prowadzi z 98.4%.

Czas do pierwszego audio: 0,70 s. To najbardziej znacząca liczba dla rzeczywistych produktów głosowych. Spadła z 1,25 s i jest jedyną wartością poniżej sekundy wśród pięciu najlepiej ocenianych modeli; niezależne testy w dużej mierze potwierdzają odpowiedź poniżej sekundy. Opóźnienie do pierwszego tokena w strumieniowym TTS wynosi około 285 ms. W przypadku telefonii i zastosowań w czasie rzeczywistym opóźnienie jest wskaźnikiem, który użytkownicy odczuwają przy każdej turze rozmowy, i to właśnie tutaj wersja 2.0 jest zdecydowanie najlepsza.

Czytając wiersze, profil jest konkretny: najszybszy w mówieniu, najlepszy w wykonywaniu zadań, drugi w ogólnej ocenie, trzeci w finezji konwersacji. To doskonały model agenta głosowego i przeciętne twierdzenie o „najlepszym głosie chatbota”. Wybierz go do zadań, którym odpowiada górny wiersz.

Dokładność transkrypcji

Poza rozmową xAI twierdzi, że zapewnia znacznie lepszą transkrypcję. Jego wewnętrzna ewaluacja w 24 językach i na tysiącach fraz rzekomo pokazuje około 1.4x dokładności Think Fast 1.0 oraz 1.5–2x dokładności dedykowanych modeli transkrypcji, takich jak Deepgram Nova 3 i ElevenLabs Scribe v2. W zaszumionych, rzeczywistych warunkach — hałas w tle, kompresja telefoniczna, połączenia o niskiej przepustowości — zgłaszana różnica w dokładności względem dedykowanych modeli STT wzrasta do około 10x.

To są dokładnie twierdzenia, które należy traktować ostrożnie. Są one raportowane przez xAI; narzędzie ewaluacyjne, zestawy fraz i profile szumów nie zostały opublikowane. Niezależny test transkrypcji hałaśliwych rozmów telefonicznych w wersji 2.0 w porównaniu z Deepgram lub ElevenLabs byłby wartościowy, ale na dzień dzisiejszy nie został opublikowany. Kierunkowo, modele end-to-end wchłaniające więcej danych telefonicznych podczas treningu to prawdopodobna realna poprawa — ale „10x” należy zweryfikować, a nie powtarzać jako fakt.

Cennik: $0.08 za minutę i pytanie o 60%

W tym miejscu premiera staje się kontrowersyjna. Think Fast 2.0 kosztuje 0,08 USD za minutę audio — około 4,80 USD za godzinę — plus 0,004 USD za każdą wiadomość tekstową na wejściu. Think Fast 1.0 kosztował 0,05 USD za minutę (3,00 USD za godzinę). To wzrost o 60%, który nastąpił w tym samym miesiącu, w którym OpenAI obniżyło ceny GPT-5.6 Luna o 80% i Terra o 20%, powołując się na te same malejące koszty serwowania, które xAI deklaruje dla tego modelu.

Licznik to cała historia. Modele tekstowe rozliczane są za token, więc gdy model staje się wydajniejszy, rachunek klienta automatycznie maleje. Modele głosowe rozliczane są za minutę rzeczywistego audio, a długość rozmowy ustala osoba mówiąca, a nie model. Zyski z wydajności w produkcie rozliczanym za minutę trafiają do sprzedawcy, a nie do kupującego. Dlatego model, który podobno zużywa ~60% mniej tokenów rozumowania — a przez to jest tańszy w obsłudze dla xAI — kosztuje 60% więcej do wynajęcia.

Wykonaj obliczenia na realnym scenariuszu połączeń. 4-minutowe połączenie w wersji 1.0 kosztuje 0,20 USD; to samo połączenie w wersji 2.0 kosztuje 0,32 USD. Dziesięć tysięcy takich połączeń miesięcznie to 40 000 minut: 2000 USD/miesiąc w wersji 1.0 wobec 3200 USD/miesiąc w wersji 2.0 — różnica 1200 USD/miesiąc, czyli około 14 400 USD/rok, która wynika wyłącznie ze zmiany routingu, a nie z liczby połączeń. Nawet znaczne przyspieszenie ledwo to zmienia: skrócenie każdego połączenia o pełne 10 sekund oszczędza około 0,013 USD, podczas gdy wzrost ceny dodaje 0,12 USD — odzyskujesz z grubsza jedną dziewiątą wzrostu. Jakikolwiek biznesowy argument, który przedstawia wersję 2.0 jako tańszy model, myli „szybsze” z „tańsze”.

Dla kontekstu, 2.0 jest nadal około 2,2 razy tańsze niż GPT-Realtime-2.1 High, kosztujące około 10,75 USD za godzinę. Więc w wartościach bezwzględnych nie jest drogie — jest drogie w porównaniu do swojego poprzednika i do kierunku, w którym w tamtym miesiącu zmierzał każdy inny dostawca modeli.

Pułapka migracyjna z 5 sierpnia

Jest z tym związany termin. 5 sierpnia 2026 r. alias grok-voice-latest automatycznie zacznie przekierowywać na Think Fast 2.0. Jeśli przez ten alias używasz Think Fast 1.0, „nicnierobienie” przeniesie Cię — i Twój rachunek — do nowej wersji tego dnia. Aby pozostać przy 1.0, musisz przed 5 sierpnia jawnie przypiąć identyfikator modelu grok-voice-think-fast-1.0.

Obie uzasadnione opcje wymagają działania przed terminem: albo świadomie pozostać przy wersji 1.0, ponieważ twoje skryptowane przepływy działały dobrze przy 3,00 USD za godzinę, albo świadomie przejść na wersję 2.0 i zaktualizować prognozę przy 4,80 USD za godzinę, uzasadniając to jakością, a nie oszczędnościami. Nie do obrony jest odkrycie zmiany dopiero we wrześniowej fakturze. Dobra zasada: traktuj każdy alias kończący się na „latest” jako stałe polecenie akceptowania tego, co dostawca dostarczy w następnej kolejności — w tym jego ceny.

Jak uzyskać do niego dostęp i z niego korzystać

Think Fast 2.0 jest dostępny przez API Speech-to-Speech firmy xAI pod identyfikatorem modelu grok-voice-think-fast-2.0, z grok-voice-latest jako aliasem aktualizowanym. Jest to model czasu rzeczywistego, pełnodupleksowy, działający przez WebSocket: wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0, uwierzytelniany nagłówkiem Authorization: Bearer podczas uzgadniania połączenia. W przypadku aplikacji przeglądarkowych generuj efemeryczne tokeny po stronie serwera za pośrednictwem punktu końcowego sesji czasu rzeczywistego, aby nadrzędny klucz API nigdy nie trafiał do klienta.

API jest zgodne z OpenAI Realtime, więc istniejący kod do rozmów głosowych w czasie rzeczywistym zwykle wymaga tylko zmiany adresu bazowego i klucza. Konfiguracja sesji odbywa się przez zdarzenie session.update: wybierz predefiniowany głos (eve, ara, rex, sal, leo), ustaw wejściowy i wyjściowy format audio (domyślnie PCM16 przy 24 kHz; μ-law dla telefonii), włącz po stronie serwera wykrywanie aktywności głosowej i zarejestruj narzędzia — w tym wbudowane narzędzie do przeszukiwania internetu — aby agent mógł działać w trakcie rozmowy. Przebieg zdarzeń jest zgodny ze standardowym wzorcem: klient dołącza ramki bufora audio, serwer strumieniuje różnice audio odpowiedzi, a zdarzenia z argumentami wywołań narzędzi są wyzwalane, gdy model zdecyduje się działać, a wyniki są odsyłane jako wyjścia wywołań funkcji. Model obsługuje ponad 25 języków i klonowanie głosu z około minuty mowy.

Zwróć uwagę, czym to nie jest: to model agentowy typu speech-to-speech, a nie ogólna usługa transkrypcji czy tłumaczenia. Jeśli głównym zadaniem Twojego produktu jest tania konwersja audio na tekst, dedykowany model STT to inne narzędzie — a przy rozliczeniu za minutę płacisz za całą rozmowę, więc same zadania transkrypcji szybko stają się kosztowne.

Jak to się wpisuje w stack agenta głosowego

Think Fast 2.0 to wyspecjalizowany model głosowy czasu rzeczywistego, dostępny przez dedykowane API xAI, a nie uniwersalny LLM hostowany przez router modeli. Ścieżka głosowa działa bezpośrednio na WebSocketu xAI — to właśnie tam mieści się opóźnienie poniżej sekundy, które nie przetrwa pośredniego przeskoku.

Wszystko inne wokół produktu głosowego — logika języka naturalnego, która nie jest krytyczna czasowo, rozumowanie zapasowe, gdy rozmowa zbacza ze scenariusza, streszczanie, analityka, follow-up e-mailowy, który agent wysyła po rozmowie — to ogólna praca tekstowa i multimodalna. Do tej części vendor-neutralny endpoint, taki jak OrcaRouter, zapewnia jeden interfejs API kompatybilny z OpenAI dla wielu LLM-ów, więc nie jesteś przywiązany do jednego dostawcy w częściach stosu, które nie potrzebują kanału głosowego w czasie rzeczywistym. Czysty podział: dedykowane API xAI dla samego strumieniowego głosu, OrcaRouter (lub podobne) dla tekstu i multimodalnego rozumowania wokół niego.

Rywalizacja: szybkość agentów a surowa inteligencja

Think Fast 2.0 ląduje w samym środku najbardziej konkurencyjnego rynku w AI w tej chwili — agentów głosowych działających w czasie rzeczywistym — a tabela benchmarków sprawia, że kompromisy są wyjątkowo widoczne.

Qwen Audio 3.0 Realtime Plus jest liderem pod względem inteligencji: 84,1% w indeksie jakości mowa-do-mowy (pierwsze miejsce), rekordowe 99,2% w Big Bench Audio i 98,4% w pełnym dupleksie. Ale jego średni czas do pierwszego dźwięku wynosi około 4,02 sekundy — czyli mniej więcej 5,7 razy wolniej niż 0,70 s u Groka. W samochodach, urządzeniach noszonych i rozmowach telefonicznych ta różnica to nie „szybkość vs powolność”, lecz „używalność vs bezużyteczność”. Qwen dzieli się również na wariant Plus (jakość) i wariant Flash (pierwszy pakiet po około 300 ms) dla różnych scenariuszy, co jest przemyślaną odpowiedzią na to samo napięcie.

GPT-Realtime-2.1 zajmuje środkowe miejsce w większości kategorii (79,1% jakości, 45,7% agentowości) i wygrywa pod względem dynamiki konwersacji (95,7%). Jego poziom High kosztuje około 2,2 razy więcej za godzinę niż Grok. Dla zespołów już mocno zakorzenionych w ekosystemie OpenAI pozostaje najmniej problematyczną opcją domyślną.

Gemini 3.1 Flash pozostaje w tyle pod względem jakości i kompozytów agentowych (69.5%, 37.7%), ale jest częścią szerszego stosu głosowego Gemini i ekosystemu Google, który wiele zespołów preferuje z innych powodów.

Praktyczny wniosek: wybieraj w zależności od obciążenia. Jeśli Twój agent głosowy musi działać natychmiast i niezawodnie realizować zadania wspierane narzędziami (wsparcie, kwalifikacja, rezerwacja), Think Fast 2.0 jest obecnie najmocniejszą zmierzoną opcją. Jeśli priorytetem jest najgłębsze rozumowanie i możesz zaakceptować wielosekundowe opóźnienie, wygrywa Qwen Plus. Jeśli najbardziej liczą się płynność konwersacji i dopasowanie do ekosystemu, GPT-Realtime-2.1 pozostaje liderem do pokonania.

Trzy scenariusze, w których to pasuje.

1. Wsparcie telefoniczne i telefonia

Najważniejsza kombinacja: pierwsze audio w czasie poniżej sekundy, solidna transkrypcja zaszumionych rozmów telefonicznych (wg danych dostawcy) i obsługa przerwań w pełnym dupleksie. Linia wsparcia, na której agent zaczyna mówić niemal natychmiast i może w trakcie wypowiedzi wyciągnąć informacje o koncie, to dokładnie to, do czego dostrojono wersję 2.0. Jej krótszy, jedno-pytanie-na-raz styl mówienia RL również dobrze pasuje do telefonii, gdzie minuty są jednostką rozliczeniową — niezależnie od licznika każdego z dostawców.

2. Kwalifikacja leadów i follow-up po rozmowie

Głos agentowy to obszar, w którym 2.0 jest naprawdę pierwszy, a kwalifikacja leadów to kanoniczne zadanie głosu agentowego: kwalifikuj, kieruj i wyzwalaj działania następcze, dopóki intencja jest świeża. Jego wywoływanie narzędzi może odpalić, zanim skończy się pierwsze zdanie, więc agent może tworzyć rekord CRM, wciąż rozmawiając z potencjalnym klientem. Zaplanuj atrybucję na poziomie sesji i ścisłe uprawnienia narzędzi — agent głosowy może popełnić błąd w czasie rzeczywistym, a sprzątanie po nim należy do ciebie.

3. Produkty voice-agent w aktywnym rozwoju

Dla twórców wdrażających własnych agentów głosowych — integracje Tradecraft i GrokTerm, na które powołuje się xAI, są dokładnie tego typu — szybkość wersji 2.0 i kompatybilne z OpenAI API sprawiają, że jest to bezproblemowy drop-in dla kodu GPT-Realtime. Przypnij wersję, przeprowadź wąski pilotaż z jasnym warunkiem sukcesu (np. „kwalifikuj i kieruj odwiedzających stronę z cennikiem”) i mierz koszt za ukończony wynik, a nie koszt za minutę.

Ograniczenia i zastrzeżenia

W chwili pisania tego tekstu Think Fast 2.0 ma pięć dni, co widać w zastrzeżeniach. Wyniki testów A/B Starlink (wyższa konwersja i ograniczenie wsparcia) są raportowane przez xAI bez opublikowanych danych; mnożniki transkrypcji i określenie „niemal 5 razy szybsze” to również twierdzenia dostawcy, a nie niezależne benchmarki. Jedyny artykuł, na jaki trafisz, zarzucający „regresję wydajności i sfałszowane raporty z testów”, odnosi się do tej samej niemożności weryfikacji — publikowane przez xAI liczby nie zostały niezależnie odtworzone, a wrażliwa na niezawodność społeczność głosowa słusznie podchodzi z podejrzliwością do niepublikowanych wskaźników dostawcy. Benchmarki nie zmierzą też Twojego najgorszego połączenia: odpowiedź w 0,70 s jest bezwartościowa, jeśli agent z pewnością przekieruje lead do niewłaściwego zespołu. Rozliczenia za głos są naliczane za minutę, z już wliczoną podwyżką ceny, więc realna jest ekspozycja na koszty. I jak w przypadku każdego zupełnie nowego modelu działającego w czasie rzeczywistym, należy spodziewać się zmian w API. Zweryfikuj roszczenia dotyczące dokładności na własnym materiale audio, przypnij wersje w środowisku produkcyjnym i wdróż eskalację oraz nagrywanie przed pierwszym rzeczywistym połączeniem.

Często zadawane pytania

Co to jest Grok Voice Think Fast 2.0?

Flagowy model xAI typu mowa-do-mowy dla agentów głosowych, wydany 29 lipca 2026 r.: natywna transmisja end-to-end audio-audio przez WebSocket, z czasem do pierwszego dźwięku wynoszącym 0,70 s i pierwszym miejscem w benchmarku agentowym τ-Voice.

Ile kosztuje Grok Voice Think Fast 2.0?

0,08 USD za minutę audio (około 4,80 USD/godzinę) plus 0,004 USD za wejściową wiadomość tekstową — to wzrost o 60% w porównaniu z 0,05 USD/minutę w Think Fast 1.0.

Czy Think Fast 2.0 to najlepszy model głosowy?

Jest najszybszy i najlepszy w zadaniach agentowych (56,5% τ-Voice, pierwsze miejsce) i drugi pod względem ogólnego wskaźnika jakości mowa-do-mowy (82,9%), za Qwen Audio 3.0 Realtime Plus (84,1%). „Najlepszy” zależy od obciążenia.

Co się zmieniło od Think Fast 1.0?

Równoległe rozumowanie podczas mówienia (myśli, gdy mówi), około 60% mniej tokenów rozumowania, dostrojony przez RL krótszy styl konwersacji, poprawa transkrypcji o 1.4x (raportowana przez dostawcę) i czas do pierwszego dźwięku skrócony z 1.25s do 0.70s.

Czy mój przełącznik ruchu Think Fast 1.0 przełączy się automatycznie?

Tak, 5 sierpnia 2026 r., jeśli używasz aliasu grok-voice-latest. Przypnij grok-voice-think-fast-1.0 przed tym terminem, aby pozostać na 1.0, albo świadomie przejdź na 2.0 i ponownie oszacuj koszty.

Jak wywołać Grok Voice Think Fast 2.0?

Poprzez API Speech-to-Speech od xAI — WebSocket w czasie rzeczywistym (wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0) kompatybilny z OpenAI Realtime API, z gotowymi głosami, VAD po stronie serwera i wywoływaniem narzędzi.

Z którymi modelami głosowymi konkuruje?

Qwen Audio 3.0 Realtime Plus (bardziej inteligentny, ale znacznie wolniejszy — pierwsze audio po 4,02 s), GPT-Realtime-2.1 (lepsza dynamika konwersacji, ~2,2x droższy w wariancie High) oraz Gemini 3.1 Flash.

Czy twierdzenia dotyczące benchmarków są wiarygodne?

Wyniki Artificial Analysis są niezależne i solidne. Wyniki A/B Starlinka, mnożniki transkrypcji i ujęcie prędkości są raportowane przez xAI bez opublikowanych danych — traktuj je jako orientacyjne i zweryfikuj na własnym audio.

Czy Grok Voice jest dobry do transkrypcji?

Transkrybuje w trakcie rozmowy, a xAI twierdzi, że osiąga znaczną poprawę w porównaniu z dedykowanymi modelami STT w warunkach hałasu — ale opłata naliczana jest za minutę rozmowy, więc dedykowane zadania transkrypcji są lepiej obsługiwane przez dedykowany model STT.

Sedno sprawy

Grok Voice Think Fast 2.0 to najsilniejszy zmierzony dotąd agentowy model głosowy i najszybszy w najwyższej półce z dużą przewagą — 0,70 s do pierwszej odpowiedzi audio to realna, niezależnie potwierdzona wygrana dla użytkownika, a pierwsze miejsce w τ-Voice to prawdziwy ranking. Uczciwe podsumowanie jest konkretne: to najlepsze narzędzie w swojej klasie dla głosowych agentów działających w czasie rzeczywistym i wspieranych narzędziami, ale nie najlepszy model głosowy pod każdym względem — Qwen prowadzi pod względem inteligencji, a OpenAI w finezji konwersacyjnej. Kontrowersje nie dotyczą szybkości. Dotyczą cennika: 60-procentowa podwyżka ceny modelu, który według xAI jest tańszy w utrzymaniu, automatyczna migracja aliasów z twardym terminem oraz nagłówkowe twierdzenia oparte na niepublikowanych danych producenta. Używaj go ze względu na agentową szybkość, przypnij wersję, oznaczaj twierdzenia producenta i weryfikuj dokładność na własnych połączeniach — a ogólny tekst i rozumowanie wokół produktu głosowego trzymaj na neutralnym względem producentów endpointcie, takim jak OrcaRouter.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube