Główna karta tytułowa dla „Realtime-Venus vs Grok Voice Think Fast 2.0”, z podtytułem „Jeden można kupić jeszcze dziś po południu. Drugi to plik do pobrania.”, z trzema kartami o treści „Grok Voice Think Fast 2.0: 0,08 USD za minutę audio, 0,70 s do pierwszego dźwięku”, „Realtime-Venus: wagi Apache-2.0, brak API, brak cennika” oraz „Wspólny zakład: rozumować podczas mówienia, a nie wcześniej”, nad paskiem stopki o treści „Dane Groka według Artificial Analysis i dokumentacji xAI; dane Realtime-Venus z jego raportu technicznego, nieodtworzone.” Logo OrcaRouter jest złożone w prawym dolnym rogu.
Guides & Insights

Realtime-Venus kontra Grok Voice Think Fast 2.0: Tylko jedno z nich ma cenę

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Postaw Realtime-Venus i Grok Voice Think Fast 2.0 obok siebie, a pierwsza różnica nie jest benchmarkiem, lecz zamówieniem zakupu. Grok Voice Think Fast 2.0 to hostowany model zamiany mowy na mowę, który trafił do sprzedaży 29 lipca 2026 r. w cenie 0,08 USD za minutę audio, z opublikowanym czasem do pierwszego dźwięku wynoszącym 0,70 sekundy i wynikami benchmarków od strony trzeciej. Realtime-Venus to system pełnodupleksowy 9B od zespołu Venus Team należącego do Ant Group i Uniwersytetu Tsinghua, który istnieje w postaci wag Apache-2.0, raportu technicznego z 12 września 2026 r. i niczego, na co można zadzwonić. Jeden z nich możesz podłączyć do linii telefonicznej jeszcze przed końcem tygodnia. Drugi możesz przeczytać. Okazuje się, że ta asymetria jest znacznie bardziej użytecznym porównaniem, niż byłaby tabela wyników, ponieważ oba modele postawiły niemal taki sam zakład architektoniczny, a potem całkowicie rozeszły się w tym, co z nim zrobić.

Krótka odpowiedź

Wybierz Grok Voice Think Fast 2.0, jeśli potrzebujesz działającego agenta głosowego już teraz, na produkcji, z cennikiem, który możesz wpisać do budżetu, i gwarancją opóźnienia, którą możesz przetestować. Wybierz Realtime-Venus, jeśli chcesz mieć własny stack — jeśli Twoje dane nie mogą opuścić Twojej infrastruktury, jeśli musisz dostroić front end albo jeśli oceniasz architekturę, a nie wypuszczasz produkt. Nie ma trzeciego przypadku, w którym ze sobą konkurują, ponieważ jeden ma API, a drugi nie.

Zgadzają się co do trudnego problemu.

Ciekawe jest to, jak podobna jest diagnoza. Oba modele istnieją z powodu tej samej sprzeczności: kontrola rozmowy musi działać z granularnością poniżej sekundy, a rozumowanie zajmuje sekundy. Model, który zatrzymuje się, by pomyśleć, przestaje sprawiać wrażenie obecnego.

Grok Voice Think Fast 2.0 rozwiązuje to, rozumując podczas mówienia. Linia Think Fast powstała w oparciu o założenie, że model nie powinien najpierw wnioskować, a dopiero potem generować mowę; zamiast tego strumieniuje mowę i myśli równolegle, dzięki czemu wywołanie narzędzia może zostać uruchomione, zanim agent skończy swoje pierwsze zdanie. xAI podaje, że wersja 2.0 zużywa około 0,4-krotności liczby tokenów rozumowania wykorzystywanych przez poprzednika, co jest przedstawiane jako poprawa pod względem kosztów i opóźnień, a nie jakości.

Realtime-Venus rozwiązuje to, w ogóle nie rozwiązując tego we frontendzie. Jego środowisko uruchomieniowe z podwójną pętlą utrzymuje jednosekundową pętlę interakcji — percepcję, kontrolę tur, generowanie mowy — i przekazuje wszystko, co kosztowne, do osobnego komponentu o nazwie Realtime-Venus-Harness poprzez asynchroniczne znaczniki delegacji emitowane we własnej ukrytej sekwencji modelu. Konwersacja pierwszoplanowa nigdy się nie zatrzymuje. Wyniki w tle są ponownie integrowane, gdy nadejdą.

To różne odpowiedzi inżynieryjne na to samo pytanie i mają różne tryby awarii. Rozumowanie podczas mówienia przenosi ciężar na model, który musi utrzymać spójność obu wątków. Delegowanie przenosi ciężar na środowisko uruchomieniowe, które musi powstrzymać obie pętle przed wzajemnym zakłócaniem się — dlatego właśnie przyczynowe przechwytywanie zadania z artykułu Realtime-Venus, izolowany zrzut stanu dla każdego delegowanego zadania, jest szczegółem, który niesie ten projekt.

Jedyny wskaźnik, na podstawie którego można zmierzyć oba

Testy porównawcze pełnego dupleksu to jedyne miejsce, w którym te dwa się pokrywają, a nie pokrywają się one w sposób czysty.

• Obsługa przerwań — Realtime-Venus podaje, że odpowiada na 75% przerwań użytkownika w Full-Duplex-Bench v1.5. Grok Voice Think Fast 2.0 uzyskuje 95,1% w Full Duplex Bench według Artificial Analysis, w porównaniu z 77,8% w wersji 1.0.

• Kontynuacja przy nakładaniu się mowy — Realtime-Venus raportuje 97% kontynuacji przy sygnałach potakujących, 88% przy mowie skierowanej do innych i 86% przy mowie w tle, oraz twierdzi, że przewyższa Gemini 3.1 Live i GPT-4o we wszystkich trzech przypadkach.

• Różne instrumenty, różni autorzy — dane Realtime-Venus pochodzą z własnego raportu technicznego, bez zewnętrznej reprodukcji. Dane Grok pochodzą od strony trzeciej, która uruchomiła ten model. Porównywanie liczby zgłoszonej samodzielnie z liczbą zmierzoną niezależnie nie jest porównaniem, a powyższa różnica równie dobrze może być metodologiczna, co rzeczywista.

Uczciwa ocena: na podstawie dostępnych dowodów Grok Voice Think Fast 2.0 jest jedynym z tych dwóch, którego zachowanie w trybie pełnego dupleksu zostało zmierzone przez kogoś, kto nie ma interesu w wyniku.

Gdzie niezależne liczby umieszczają Grok Voice Think Fast 2.0

Najbardziej przejrzysty aktualny odczyt pochodzi z Speech Agent Arena firmy Artificial Analysis, która ocenia modele na podstawie preferencji w ślepym teście podczas rozmów głosowych na żywo w zadaniach takich jak rezerwowanie wizyty u dentysty i zamawianie jedzenia na wynos. Na dzień 18 września 2026 r. Grok Voice Think Fast 2.0 High zajmuje siódme miejsce spośród ponad dwudziestu pozycji z wynikiem Elo 1011 na podstawie 552 próbek — za Gemini 3.1 Flash Live Minimal od Google z wynikiem 1096, Gemini 3.8 Live z 1083 i GPT-Live-1 z 1053, a znacznie wyprzedzając własnego poprzednika, Grok Voice Think Fast 1.0, z wynikiem 908.

Kolumna obok Elo jest tą ciekawszą. Pod względem skuteczności wykonywania zadań Grok Voice Think Fast 2.0 odnotowuje 94,6%, najwyższy wynik w całej widocznej pierwszej dwudziestce — powyżej 93,2% Gemini 3.8 Live, 91,5% GPT-Realtime-2.1 High i 90,9% GPT-Live-1. Siódmy pod względem preferencji, pierwszy pod względem ukończonych zadań — to nietypowy i dość specyficzny profil: słuchacze nie przepadają za głosem, ale on wykonuje zadanie. Jeśli Twój produkt wykonuje zadania, a nie tylko rozmawia, to właśnie ta kolumna przewiduje Twój wynik i jest najsilniejszym niezależnym dowodem, jaki ma którykolwiek z tych dwóch modeli.

A screenshot of the Artificial Analysis Speech Agent Arena Leaderboard captured 18 September 2026. The table reads, in rank order: Gemini 3.1 Flash Live Minimal Elo 1,096 with a 74.6% task success rate; Gemini 3.8 Live Elo 1,083 and 93.2%; Gemini 3.1 Flash Live High Elo 1,063 and 71.8%; GPT-Live-1 (Sol, low) Elo 1,053 and 90.9%; GPT-Live-1 (Astra, medium) Elo 1,048 and 87.4%; Cartesia Line Elo 1,027 and 77.5%; Grok Voice Think Fast 2.0 High Elo 1,011, 552 samples and 94.6%; GPT-Realtime-1.5 Elo 1,000 and 85.1%; and further down Grok Voice Think Fast 1.0 at Elo 908 with 80.7%.

Liczby opublikowane przez xAI przy premierze to inne narzędzie i należy je czytać osobno: 82,9% w indeksie jakości mowy do mowy Artificial Analysis, pierwsze miejsce w agentowym benchmarku τ-Voice z wynikiem 56,5%, 97,2% w Big Bench Audio i 95,1% w Full Duplex Bench. Takie były wyniki, gdy model trafił do sprzedaży pod koniec lipca 2026 r., a rankingi w tej kategorii zmieniają się co miesiąc — i właśnie dlatego tabela areny powyżej, czytana dziś, jest warta więcej niż liczby z premiery.

A two-column comparison scoreboard titled 'Realtime-Venus vs Grok Voice Think Fast 2.0 — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Availability: Apache-2.0 weights, no API', 'Price: none published', 'Modality: audio, video and text', 'Interruption response: 75% reported', 'Continuation under overlap: 97 / 88 / 86% reported', 'Independent scores: none'. The right column, labelled Grok Voice Think Fast 2.0, reads 'Availability: hosted API since 29 July 2026', 'Price: $0.08 per audio minute', 'Modality: audio and text', 'Interruption handling: 95.1% Full Duplex Bench at launch', 'Time to first audio: 0.70 s', 'Independent scores: Elo 1,011 and 94.6% task success on the Speech Agent Arena'. The footer reads 'Realtime-Venus figures from its technical report, unreproduced; Grok figures per Artificial Analysis and xAI documentation.'

Rachunek oraz te jego części, które nie znajdują się na rachunku

Grok Voice Think Fast 2.0 kosztuje 0,08 USD za minutę audio, czyli około 4,80 USD za godzinę, plus 0,004 USD za każdą wiadomość tekstową na wejściu. To wzrost o 60% w stosunku do 0,05 USD za minutę, które wersja 1.0 pobierała w momencie premiery, a xAI automatycznie przeniósł kroczący grok-voice-latest alias na wersję 2.0 w dniu 5 sierpnia 2026 r., więc zespoły, które chciały pozostać przy starej cenie, musiały przed tą datą przypiąć konkretną wersję. Model rozliczania za minutę oznacza też, że korzyści z usprawnień wydajności przypadają dostawcy: jeśli model zacznie sprawniej kończyć połączenia, rachunek za jedno połączenie spadnie, ale koszt za minutę już nie.

Realtime-Venus nie ma rachunku, bo nie ma usługi. Zamiast tego ma dolną granicę sprzętową. Dwa checkpointy 9B w BF16 to około osiemnaście gigabajtów wag każdy, nie licząc pamięci aktywacji, a karta opisuje pętlę strumieniowania na sekundę, która musi działać nieprzerwanie. Węzeł GPU zdolny do tego ma miesięczny koszt i jest on stały — płacisz go niezależnie od tego, czy ktokolwiek z niego korzysta. Dla produktu o stałym ruchu jest to tańsze niż 4,80 USD za godzinę. Dla produktu o przerywanym ruchu jest to dramatycznie droższe, a punkt przecięcia jest jedyną kwestią finansową, która ma tu znaczenie.

Wagi, kontrola i co każde z nich pozwala zmienić

W tym miejscu te dwa modele przestają być w ogóle porównywalne.

• Dostrajanie — Realtime-Venus udostępnia wagi. Możesz je dostrajać, kwantyzować, uruchamiać w środowisku odizolowanym od sieci i przeglądać każdą warstwę. Grok Voice Think Fast 2.0 to zamknięty model hostowany; możesz zmieniać jedynie prompt, wybór głosu i narzędzia, które rejestrujesz.

• Głos — Grok Voice Think Fast 2.0 dostarcza gotowe głosy i obsługuje klonowanie własnego głosu na podstawie około minuty mowy. Realtime-Venus dostarcza głos referencyjny oraz dołączony dekoder przekształcający tokeny w przebieg fali, a wszystko, co wykracza poza ten zakres, jest już twoim problemem.

• Zasięg — Grok Voice Think Fast 2.0 obsługuje ponad 25 języków i domyślnie nadaje w PCM16 przy 24 kHz, z μ-law dla telefonii, w sesji WebSocket zgodnej z OpenAI Realtime. Ta zgodność to prawdziwy atut migracyjny: większość istniejącego kodu głosowego czasu rzeczywistego wymaga tylko zmiany bazowego adresu URL i klucza. Realtime-Venus dokumentuje język angielski i chiński.

• Wideo — Realtime-Venus-Omni przepuszcza strumieniowe wideo i obrazy przez enkoder SigLIP2 i prowadzi ciągłą percepcję wizualną. Grok Voice Think Fast 2.0 działa na dźwięku i tekście; nie ma ścieżki kamery.

• Długi kontekst — Realtime-Venus obsługuje kontekst 40 960 tokenów oraz pamięć długich wideo niewymagającą trenowania, którą można włączyć dla czterdziestominutowego okna. Grok Voice Think Fast 2.0 to model sesyjny bez porównywalnej, publicznie opisanej funkcji pamięci.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Any-to-Any, Transformers, Safetensors, audio, video, speech, streaming and full-duplex tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

Gdzie każde z nich się psuje

Awarie, na które warto się przygotować, są odwrotne. Ekspozycja Grok Voice Think Fast 2.0 to uzależnienie od dostawcy i niezweryfikowalny marketing: wyniki testów A/B Starlink należące do xAI, mnożniki dokładności transkrypcji tej firmy oraz jej sposób przedstawiania szybkości są w całości raportowane przez firmę, bez opublikowanych danych źródłowych, a model rozliczania za minutę, który zmienia cenę o 60% między wersjami, wykazał, że zmieni cenę. Przypnij swoją wersję i przeprowadź własne ewaluacje na własnym materiale audio.

Słabością Realtime-Venus jest to, że nikt jej nie uruchomił. Jej benchmarki są samodzielnie raportowane, jej środowisko testowe jest nieudokumentowane w stosunku do jej znaczenia, a jej latencja w rzeczywistym wdrożeniu jest nieznana — raport opisuje jednosekundowy rytm interakcji, który jest parametrem projektowym, a nie zmierzonym czasem do pierwszego dźwięku. Model bez API i bez możliwości odtworzenia nie ma żadnego dorobku, tylko specyfikację.

Istnieje ścieżka pośrednia, którą warto przedstawić wprost, bo właśnie tak postąpi większość zespołów. Jeśli budujesz system oparty na delegowaniu — sam wybierz frontend, a kosztowną pracę przekaż modelowi tekstowemu — frontend i odnoga rozumowania nie muszą pochodzić z tego samego miejsca. OrcaRouter nie oferuje ani Realtime-Venus, ani Grok Voice Think Fast 2.0; obie warstwy głosowe znajdują się poza tym, co udostępniamy, i mówimy to wprost, zamiast sugerować coś przeciwnego. Delegowana odnoga to inna sprawa. Blisko 200 modeli tekstowych dostępnych jest za jednym kluczem w cenie katalogowej dostawcy, bez marży, z automatycznym przełączaniem awaryjnym, dzięki któremu awaria po stronie dostawcy nie zerwie trwającej rozmowy, językiem DSL do routingu, pozwalającym złożyć kilka modeli w jedno wywołanie, oraz fuzją modeli do decyzji, które zasługują na więcej niż jedną opinię. To ta połowa agenta głosowego, która zyskuje na wymienności, i ta połowa, którą możesz zmienić bez dotykania modelu prowadzącego rozmowę.

Który wybrać

Wybierz Grok Voice Think Fast 2.0 w tym kwartale. Jest dostępny, ma niezależne wyniki benchmarków, zajmuje pierwsze miejsce w ewaluacji agentowej, która przewiduje, czy twój agent może zrobić cokolwiek użytecznego, a 0,70 sekundy do pierwszego dźwięku to liczba, wokół której możesz zbudować doświadczenie użytkownika. Zaplanuj budżet na 60% wzrost ceny względem 1.0 i przypnij wersję swojego modelu.

Wybierz Realtime-Venus tylko wtedy, gdy ograniczeniem jest własność. Jeśli Twoje wdrożenie nie może wywołać zewnętrznego API, jeśli musisz dostroić konwersacyjny front end lub jeśli potrzebujesz kamery — te trzy przypadki to cała sprawa, a są one mocne, gdy mają zastosowanie.

Nie powinna o tym decydować tabela benchmarków, ponieważ jej dwie strony zostały wytworzone przez różne osoby w różnych warunkach. Liczby Grok Voice Think Fast 2.0 zostały zmierzone przez kogoś innego. Liczby Realtime-Venus nie. Dopóki to się nie zmieni, porównanie, które jest faktycznie dostępne, dotyczy produktu i artykułu.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie