Karta tytułowa artykułu o indeksie GPT-Live-1 Speech to Speech przedstawiająca trzy najlepsze wyniki: GPT-Live-1 z GPT-6 Astra przy średnim wysiłku — 81,5; Grok Voice Think Fast 2.0 High — 81,3; oraz GPT-Live-1 z GPT-5.6 Sol przy niskim wysiłku — 80,1
Guides & Insights

GPT-Live-1 na szczycie Speech to Speech Index z wynikiem 81,5 — ale ranking należy do jego backendu

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

GPT-Live-1, pełnodupleksowy model głosowy, który po raz pierwszy pojawił się w ChatGPT 8 lipca 2026 r., jest teraz pierwszy w Artificial Analysis Speech to Speech Index z wynikiem 81,5 — pozycja ta istnieje tylko dlatego, że model został skierowany na GPT-6 Astra, by ten wykonał za niego rozumowanie. Uruchom ten sam interfejs głosowy z GPT-5.6 Sol jako delegowanym backendem przy niskim wysiłku rozumowania, a uzyska wynik 80,1, co daje trzecie miejsce. Drugie miejsce, z wynikiem 81,3, należy do Grok Voice Think Fast 2.0 High.

Dwie szczere uwagi przed liczbami. Model nie jest nowy: GPT-Live-1 trafił do API dla deweloperów 10 września 2026 r., po dwóch miesiącach jako domyślny głos ChatGPT. Nowością — według pomiaru z 15 września — jest to, że ocenił go zewnętrzny ewaluator; to jedyna rzecz, której brakowało dotąd we wszystkich tekstach o tym modelu, w tym w naszym własnym, gdzie jedynymi dostępnymi danymi liczbowymi były te, które OpenAI opublikowało o sobie. A przewaga 0,2 punktu nad drugim miejscem jest mniejsza niż 1,4-punktowa różnica między dwiema konfiguracjami samego GPT-Live-1, co jest najbardziej użyteczną liczbą na tablicy wyników.

Zatem nagłówek „GPT-Live-1 to najlepszy model głosowy” nie do końca odpowiada temu, co mówi ranking. Mówi on, że GPT-Live-1 z GPT-6 Astra przy średnim poziomie wysiłku jest najlepszy o jedną piątą punktu, a wybór backendu wpływa na wynik bardziej niż jakikolwiek konkurencyjny model.

Co tak naprawdę mierzy ten indeks

Artificial Analysis tworzy Speech to Speech Index jako równo ważony kompozyt czterech części: Speech Reasoning, mierzony przez Big Bench Audio; Agentic Performance, mierzony przez τ-Voice; Arena Preference, ranking Elo oparty na preferencjach ludzi porównywanych parami; oraz Task Success Rate. Tylko modele, w przypadku których dostępne są wszystkie cztery komponenty, otrzymują wartość indeksu — wszystko inne pokazuje myślnik, dlatego tabela ma znacznie więcej wierszy niż wyników. Sam indeks został uruchomiony 23 czerwca 2026 r. i od tego czasu został dwukrotnie zrewidowany, ostatnio po to, by zastąpić Conversational Dynamics przez Task Success, więc wynik z jednej wersji nie jest ściśle porównywalny z wynikiem z innej.

Dwa kolejne szczegóły metodologiczne mają znaczenie, gdy czytasz ranking. Arena Elo jest zamrożone na wartości z momentu, w którym dany model po raz pierwszy nadawał się do publikacji, więc komponent preferencji nagradza wczesne pojawienie się, a nie bycie najlepszym dzisiaj. A indeks ocenia cały system, a nie pojedynczy model: w przypadku GPT-Live-1 liczba obejmuje front end głosowy oraz dowolny model backendowy, któremu przekazuje pracę. To celowy wybór projektowy i właśnie dlatego ten sam model pojawia się dwukrotnie z różnymi wynikami.

Czołówka tej dziedziny, zgodnie z publikacją:

• GPT-Live-1 (Astra, medium) — indeks 81,5, pierwsze miejsce

• Grok Voice Think Fast 2.0 High — indeks 81,3, drugie miejsce

• GPT-Live-1 (Sol, niski) — indeks 80,1, trzeci

• GPT-Realtime-2.1 High — indeks 73,9, czwarty

• GPT-Realtime-2 High — indeks 73.6, piąte miejsce

• Grok Voice Think Fast 1.0 — indeks 72,3, szósty

• Gemini 3.1 Flash Live High — indeks 71,5, siódmy

Artificial Analysis Speech to Speech leaderboard showing GPT-Live-1 with Astra at medium effort first at 81.5, Grok Voice Think Fast 2.0 High second at 81.3, and GPT-Live-1 with Sol at low effort third at 80.1, with the rest of the field from GPT-Realtime-2.1 High at 73.9 down to GPT-Realtime-2.1 Mini Minimal at 52.8

Dla zobrazowania skali model, który GPT-Live-1 zastępuje, plasuje się 7,6 punktu poniżej niego. To prawdziwa różnica pokoleń i nie podlega dyskusji.

Zwycięstwo o 0,2 punktu wynika dokładnie z jednego komponentu

Rozłóż złożony wynik na części, a obaj liderzy przestaną wyglądać jak modele tego samego rodzaju. W rozbiciu na komponenty, według Artificial Analysis:

• Wydajność agentowa (τ-Voice) — GPT-Live-1 67,9% vs Grok Voice Think Fast 2.0 High 56,5%

• Rozumowanie mowy (Big Bench Audio) — 90% vs 97%

• Wskaźnik skuteczności zadań — 87,4% vs 94,6%

• Arena Elo — 1048 kontra 1011

• Czas do pierwszego dźwięku — 1,34 s vs 0,70 s

• Koszt za godzinę, z uwzględnieniem backendu — 5,83 USD vs 4,80 USD

Comparison scoreboard for GPT-Live-1 with Astra at medium effort against Grok Voice Think Fast 2.0 High, contrasting their Speech to Speech Index scores of 81.5 and 81.3, agentic performance of 67.9% and 56.5%, speech reasoning of 90% and 97%, task success of 87.4% and 94.6%, time to first audio of 1.34 and 0.70 seconds, and cost per hour of $5.83 and $4.80

GPT-Live-1 wygrywa dwie z sześciu linii i przegrywa cztery, a mimo to zajmuje pierwsze miejsce w indeksie. Arytmetyka nie jest zagadką: różnica w τ-Voice wynosi 11,4 punktu, znacznie więcej niż jakikolwiek inny odstęp w tabeli, a przy równym ważeniu przeciąga wynik złożony przez linię. Mówiąc wprost, GPT-Live-1 jest lepszym agentem, a Grok Voice Think Fast 2.0 High jest lepszym słuchaczem i szybszym — a indeks akurat waży to, w czym GPT-Live-1 jest dobry, wystarczająco mocno, by uczynić go pierwszym.

Jeśli Twój produkt to agent głosowy, który rezerwuje, rozwiązuje sprawy lub realizuje transakcje, przewaga 11,4 punktu w τ-Voice to liczba, która przewiduje Twoje doświadczenie. Jeśli Twój produkt to rozmowa, która musi wydawać się natychmiastowa i nigdy nie wchodzić w słowo użytkownikowi, czas 0,70 sekundy do pierwszego dźwięku to liczba, która przewiduje Twoje doświadczenie, a Grok wygrywa w tej kategorii mniej więcej dwukrotnie. W przypadku regulowanego wykonywania zadań pojawia się drugie ostrzeżenie: wskaźnik skuteczności zadań Groka na poziomie 94,6% jest najwyższy w widocznej tabeli, a 87,4% GPT-Live-1 oznacza, że mniej więcej co ósme zadanie nie zostaje ukończone. Obie wartości to poprawa względem poprzedniej generacji. Żadna z nich nie jest rozwiązaniem problemu.

Wiersz #1 to konfiguracja routingu, a nie model

Oto część, która zasługuje na więcej uwagi niż pozycja w tabeli liderów. GPT-Live-1 to warstwa głosowa w trybie pełnego dupleksu, która sama obsługuje słuchanie, mówienie, przerywanie i przechodzenie między mówiącymi, a wnioskowanie, wywoływanie narzędzi i wyszukiwanie przekazuje do oddzielnego modelu zaplecza, podczas gdy rozmowa trwa. Artificial Analysis oceniło dwie z tych par jako osobne wpisy. Astra przy średnim poziomie wysiłku uzyskała 81,5. Sol przy niskim poziomie wysiłku uzyskała 80,1.

Ten rozrzut 1,4 punktu to sedno. Różnica między pierwszym a drugim miejscem wynosi 0,2 punktu. Różnica między dwiema ocenianymi konfiguracjami GPT-Live-1 jest siedem razy większa. Między tymi wierszami nie zmieniło się nic w modelu głosowym — zmieniło się tylko to, który model myślał i z jakim poziomem wysiłku. Ranking systemów mówi ci trafnie, że konfiguracja jest produktem.

To również rewiduje nasze własne raportowanie. 11 września 2026 r. odnotowaliśmy GPT-Live-1 na poziomie 69,8% w tym indeksie, za zarówno GPT-Realtime-2.1, jak i Grok. Taki był wówczas dostępny odczyt i wspierał on rozsądny wniosek — że OpenAI zbudowało najlepszą mechanikę konwersacyjną, a nie najlepszego agenta głosowego. Indeks zawiera teraz dwie delegowane konfiguracje GPT-Live-1 z wynikami 81,5 i 80,1. Artificial Analysis nie publikuje dziennika zmian, a w sierpniu zrewidowało komponenty indeksu, więc nie możemy z całą pewnością stwierdzić, czy wcześniejsza wartość była konfiguracją nieocenioną lub częściowo ocenioną, czy przebiegiem według starszego ważenia; obserwowalne jest to, że delegowane pary pojawiają się teraz jako osobne, kompletne wiersze, oraz że odpowiedź zmieniła się wraz z ich pojawieniem się.

Praktyczna konsekwencja jest taka, że „który model głosowy” to złe pytanie, a właściwym jest „który model głosowy plus który backend, przy jakim poziomie wysiłku”. To pytanie o routing i właśnie na nie odpowiada nasz własny produkt. OrcaRouter udostępnia backend delegacji GPT-Live-1, GPT-6 Astra, przez ten sam punkt końcowy zgodny z OpenAI, co ponad 200 innych modeli, więc podmiana warstwy myślenia to zmiana identyfikatora modelu, a nie integracja. DSL routingu składa kilka modeli w jedno wywołanie, a automatyczny failover oznacza, że nieprzetestowana kombinacja nie jest zakładem produkcyjnym — jeśli backend ulegnie degradacji, żądanie trafi gdzie indziej, zamiast zakończyć się niepowodzeniem. Precyzując, czego nie robimy: sam GPT-Live-1 nie znajduje się w naszym katalogu i nie serwujemy go. Backend, do którego deleguje, to inna sprawa.

Ile kosztuje godzina tego

Front end GPT-Live-1 jest rozliczany po 0,05 USD za minutę głosu, co sekundę, co daje 3,00 USD za godzinę otwartego połączenia. To nie cały rachunek: rozumowanie delegowane, wywołania narzędzi i wyszukiwanie w sieci są rozliczane osobno według stawek, jakie nalicza model backendowy. W Artificial Analysis zmierzono całkowity koszt, dlatego to właśnie kolumna kosztów Artificial Analysis jest tą, której należy użyć:

• GPT-Live-1 (Sol, niski) — 4,47 USD za godzinę

• Grok Voice Think Fast 2.0 High — 4,80 USD za godzinę

• GPT-Live-1 (Astra, medium) — 5,83 USD za godzinę

• GPT-Realtime-2.1 High — 10,75 USD za godzinę

Zwycięzca rankingu jest najdroższy z trzech obecnych opcji, a konfiguracja, która wygrała, kosztuje o 30% więcej za godzinę niż konfiguracja, która zajęła trzecie miejsce. Patrząc z drugiej strony, podział jest wymowny: 3,00 USD z każdej godziny to warstwa głosowa, a reszta — 1,47 USD w przypadku Sol, 2,83 USD w przypadku Astra — to tokeny backendu. Warstwa myślenia stanowi gdzieś między jedną trzecią a połową twojego rachunku, co jest dużym udziałem jak na komponent, który ranking sprowadza do przypisu.

OrcaRouter model page for GPT-6 Astra showing the model id openai/gpt-6-astra, a 1M-token context window, 128K max output, a p50 time to first token of 6.75 seconds, and pricing of $10.00 per million input tokens and $50.00 per million output tokens

W porównaniu z modelem, który zastępuje, cała rodzina jest jednak mniej więcej o połowę tańsza — front-end w cenie 0,05 USD za minutę to prawdziwa obniżka, a nie przepakowanie. Ponieważ tokeny backendu są rozliczane według stawek backendu, koszt wdrożenia GPT-Live-1 zależy głównie od tego, do którego modelu rozumującego kierujesz żądania, a backendy mogą być własnymi modelami OpenAI lub modelami firm trzecich. W OrcaRouter te backendy są przekazywane po cenie katalogowej dostawcy z 0% marży, więc zmiana ceny przez dostawcę w warstwie rozumowania obowiązuje tego samego dnia, a nie dopiero w następnym cyklu rozliczeniowym.

Czego indeks nie rozstrzyga

Trzy zastrzeżenia, podane przez źródło, a nie wywnioskowane. Zarówno wpisy GPT-Live-1, jak i Grok Voice Think Fast 2.0 High są oznaczone jako oparte na pojedynczym badaniu, co jest zbyt słabą podstawą dla decyzji o 0,2 punktu — ponowny przebieg mógłby zmienić kolejność pierwszego i drugiego miejsca, mimo że w żadnym z modeli nic by się nie zmieniło. Arena Elo, jak zauważono, została zamrożona na pierwszym nadającym się do publikacji pomiarze każdego modelu. A indeks nie zawiera wpisu o tym, jak te systemy zachowują się podczas długiej rozmowy: komponenty są z założenia krótkohoryzontowe, podczas gdy mechanizmem awarii, który faktycznie zabija agentów głosowych w produkcji, jest dryf w trakcie dwudziestominutowej rozmowy.

Osobno, i od dostawcy, a nie z indeksu: API GPT-Live-1 zostało wydane bez wejścia obrazu i wideo, bez ustrukturyzowanych wyników i bez darmowego planu, a jego limity szybkości są liczone w równoczesnych sesjach, a nie w żądaniach na minutę. To ograniczenia z dnia premiery, które mogą już się zmienić; sprawdź je, zanim zaczniesz je uwzględniać w projekcie.

Co zrobić z tym

Jeśli w tym tygodniu wybierasz architekturę, a nie model, indeks premiuje wzorzec delegowany w pracy agentowej, a wzorzec kaskadowy pod kątem opóźnień. GPT-Live-1 z wynikiem 81,5 to najsilniejszy jak dotąd dowód, że rozdzielenie konwersacji od rozumowania to właściwy kształt dla agentów głosowych realizujących zadania. Grok Voice Think Fast 2.0 High z wynikiem 81,3, z czasem 0,70 sekundy do pierwszego dźwięku i 94,6% skuteczności realizacji zadań, to najsilniejszy dowód, że kształt delegowany nie jest jedynym, który działa — i że nie jest jeszcze najszybszy.

Decyzja, która wynika z tych liczb, jest tańsza, niż się wydaje. Obie konfiguracje GPT-Live-1 oraz model, który pobił go w czterech z sześciu komponentów, dzieli różnica nie większa niż 1,36 USD za godzinę. Przy takiej różnicy właściwym posunięciem jest przestać czytać rankingi i przepuścić własne transkrypcje przez oba. Indeks pokazuje kształt kompromisu; nie powie ci jednak, po której jego stronie znajdują się twoi użytkownicy.

Pytania, które nasuwa liczba

Czy GPT-Live-1 to teraz najlepszy model głosowy?

Jeśli chodzi o wynik zbiorczy — tak, o 0,2 punktu i tylko na podstawie jednej próby. Jeśli chodzi o komponenty, wszystko zależy od tego, co budujesz: prowadzi pod względem wydajności agentowej i preferencji w arenie, a pozostaje w tyle pod względem rozumowania mowy, wskaźnika sukcesu zadań i czasu do pierwszego dźwięku. Przewaga 0,2 punktu w wyniku zbiorczym oparta na jednej przewadze 11,4 punktu w komponencie to pierwsze miejsce, które da się obronić, ale nie rozstrzygające.

Czy trzeba użyć GPT-6 Astra, żeby uzyskać 81,5?

Dla dokładnie tego wiersza tak — 81,5 należy do GPT-Live-1 skonfigurowanego z Astra przy średnim poziomie wysiłku rozumowania. Sol przy niskim poziomie wysiłku to udokumentowana alternatywa z wynikiem 80,1 i tańsza o 1,36 USD za godzinę, a OpenAI wspiera używanie modeli firm trzecich jako backendu, więc wpisy w tabeli liderów to dwa punkty na krzywej, a nie jedyne opcje. To, które połączenie jest najlepsze dla Twojego obciążenia, nie jest czymś, na co publiczny indeks może odpowiedzieć za Ciebie.

Dlaczego ten sam model uzyskał wynik 69,8 w naszym wcześniejszym omówieniu, a teraz 81,5?

Te dwie liczby dotyczą różnych rzeczy. Wcześniejszy odczyt umieszczał GPT-Live-1 w indeksie jako pojedynczy wpis; obecna tabela zawiera jego dwie delegowane konfiguracje jako osobne, w pełni ocenione wiersze, przy czym konfiguracja z Astra ma 81,5, a konfiguracja z Sol 80,1. Artificial Analysis zmieniło komponenty indeksu w sierpniu i nie publikuje dziennika zmian, więc traktuj tę deltę jako zmianę w tym, co mierzono, a nie jako dowód na to, że model się poprawił — a każdy pojedynczy wynik złożony dla modelu delegującego traktuj jako stwierdzenie o konfiguracji.