
GPT-Live-1 na szczycie Speech to Speech Index z wynikiem 81,5 — ale ranking należy do jego backendu
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GPT-Live-1, pełnodupleksowy model głosowy, który po raz pierwszy pojawił się w ChatGPT 8 lipca 2026 r., jest teraz pierwszy w Artificial Analysis Speech to Speech Index z wynikiem 81,5 — pozycja ta istnieje tylko dlatego, że model został skierowany na GPT-6 Astra, by ten wykonał za niego rozumowanie. Uruchom ten sam interfejs głosowy z GPT-5.6 Sol jako delegowanym backendem przy niskim wysiłku rozumowania, a uzyska wynik 80,1, co daje trzecie miejsce. Drugie miejsce, z wynikiem 81,3, należy do Grok Voice Think Fast 2.0 High.
Dwie szczere uwagi przed liczbami. Model nie jest nowy: GPT-Live-1 trafił do API dla deweloperów 10 września 2026 r., po dwóch miesiącach jako domyślny głos ChatGPT. Nowością — według pomiaru z 15 września — jest to, że ocenił go zewnętrzny ewaluator; to jedyna rzecz, której brakowało dotąd we wszystkich tekstach o tym modelu, w tym w naszym własnym, gdzie jedynymi dostępnymi danymi liczbowymi były te, które OpenAI opublikowało o sobie. A przewaga 0,2 punktu nad drugim miejscem jest mniejsza niż 1,4-punktowa różnica między dwiema konfiguracjami samego GPT-Live-1, co jest najbardziej użyteczną liczbą na tablicy wyników.
Zatem nagłówek „GPT-Live-1 to najlepszy model głosowy” nie do końca odpowiada temu, co mówi ranking. Mówi on, że GPT-Live-1 z GPT-6 Astra przy średnim poziomie wysiłku jest najlepszy o jedną piątą punktu, a wybór backendu wpływa na wynik bardziej niż jakikolwiek konkurencyjny model.
Co tak naprawdę mierzy ten indeks
Artificial Analysis tworzy Speech to Speech Index jako równo ważony kompozyt czterech części: Speech Reasoning, mierzony przez Big Bench Audio; Agentic Performance, mierzony przez τ-Voice; Arena Preference, ranking Elo oparty na preferencjach ludzi porównywanych parami; oraz Task Success Rate. Tylko modele, w przypadku których dostępne są wszystkie cztery komponenty, otrzymują wartość indeksu — wszystko inne pokazuje myślnik, dlatego tabela ma znacznie więcej wierszy niż wyników. Sam indeks został uruchomiony 23 czerwca 2026 r. i od tego czasu został dwukrotnie zrewidowany, ostatnio po to, by zastąpić Conversational Dynamics przez Task Success, więc wynik z jednej wersji nie jest ściśle porównywalny z wynikiem z innej.
Dwa kolejne szczegóły metodologiczne mają znaczenie, gdy czytasz ranking. Arena Elo jest zamrożone na wartości z momentu, w którym dany model po raz pierwszy nadawał się do publikacji, więc komponent preferencji nagradza wczesne pojawienie się, a nie bycie najlepszym dzisiaj. A indeks ocenia cały system, a nie pojedynczy model: w przypadku GPT-Live-1 liczba obejmuje front end głosowy oraz dowolny model backendowy, któremu przekazuje pracę. To celowy wybór projektowy i właśnie dlatego ten sam model pojawia się dwukrotnie z różnymi wynikami.
Czołówka tej dziedziny, zgodnie z publikacją:
• GPT-Live-1 (Astra, medium) — indeks 81,5, pierwsze miejsce
• Grok Voice Think Fast 2.0 High — indeks 81,3, drugie miejsce
• GPT-Live-1 (Sol, niski) — indeks 80,1, trzeci
• GPT-Realtime-2.1 High — indeks 73,9, czwarty
• GPT-Realtime-2 High — indeks 73.6, piąte miejsce
• Grok Voice Think Fast 1.0 — indeks 72,3, szósty
• Gemini 3.1 Flash Live High — indeks 71,5, siódmy

Dla zobrazowania skali model, który GPT-Live-1 zastępuje, plasuje się 7,6 punktu poniżej niego. To prawdziwa różnica pokoleń i nie podlega dyskusji.
Zwycięstwo o 0,2 punktu wynika dokładnie z jednego komponentu
Rozłóż złożony wynik na części, a obaj liderzy przestaną wyglądać jak modele tego samego rodzaju. W rozbiciu na komponenty, według Artificial Analysis:
• Wydajność agentowa (τ-Voice) — GPT-Live-1 67,9% vs Grok Voice Think Fast 2.0 High 56,5%
• Rozumowanie mowy (Big Bench Audio) — 90% vs 97%
• Wskaźnik skuteczności zadań — 87,4% vs 94,6%
• Arena Elo — 1048 kontra 1011
• Czas do pierwszego dźwięku — 1,34 s vs 0,70 s
• Koszt za godzinę, z uwzględnieniem backendu — 5,83 USD vs 4,80 USD

GPT-Live-1 wygrywa dwie z sześciu linii i przegrywa cztery, a mimo to zajmuje pierwsze miejsce w indeksie. Arytmetyka nie jest zagadką: różnica w τ-Voice wynosi 11,4 punktu, znacznie więcej niż jakikolwiek inny odstęp w tabeli, a przy równym ważeniu przeciąga wynik złożony przez linię. Mówiąc wprost, GPT-Live-1 jest lepszym agentem, a Grok Voice Think Fast 2.0 High jest lepszym słuchaczem i szybszym — a indeks akurat waży to, w czym GPT-Live-1 jest dobry, wystarczająco mocno, by uczynić go pierwszym.
Jeśli Twój produkt to agent głosowy, który rezerwuje, rozwiązuje sprawy lub realizuje transakcje, przewaga 11,4 punktu w τ-Voice to liczba, która przewiduje Twoje doświadczenie. Jeśli Twój produkt to rozmowa, która musi wydawać się natychmiastowa i nigdy nie wchodzić w słowo użytkownikowi, czas 0,70 sekundy do pierwszego dźwięku to liczba, która przewiduje Twoje doświadczenie, a Grok wygrywa w tej kategorii mniej więcej dwukrotnie. W przypadku regulowanego wykonywania zadań pojawia się drugie ostrzeżenie: wskaźnik skuteczności zadań Groka na poziomie 94,6% jest najwyższy w widocznej tabeli, a 87,4% GPT-Live-1 oznacza, że mniej więcej co ósme zadanie nie zostaje ukończone. Obie wartości to poprawa względem poprzedniej generacji. Żadna z nich nie jest rozwiązaniem problemu.
Wiersz #1 to konfiguracja routingu, a nie model
Oto część, która zasługuje na więcej uwagi niż pozycja w tabeli liderów. GPT-Live-1 to warstwa głosowa w trybie pełnego dupleksu, która sama obsługuje słuchanie, mówienie, przerywanie i przechodzenie między mówiącymi, a wnioskowanie, wywoływanie narzędzi i wyszukiwanie przekazuje do oddzielnego modelu zaplecza, podczas gdy rozmowa trwa. Artificial Analysis oceniło dwie z tych par jako osobne wpisy. Astra przy średnim poziomie wysiłku uzyskała 81,5. Sol przy niskim poziomie wysiłku uzyskała 80,1.
Ten rozrzut 1,4 punktu to sedno. Różnica między pierwszym a drugim miejscem wynosi 0,2 punktu. Różnica między dwiema ocenianymi konfiguracjami GPT-Live-1 jest siedem razy większa. Między tymi wierszami nie zmieniło się nic w modelu głosowym — zmieniło się tylko to, który model myślał i z jakim poziomem wysiłku. Ranking systemów mówi ci trafnie, że konfiguracja jest produktem.
To również rewiduje nasze własne raportowanie. 11 września 2026 r. odnotowaliśmy GPT-Live-1 na poziomie 69,8% w tym indeksie, za zarówno GPT-Realtime-2.1, jak i Grok. Taki był wówczas dostępny odczyt i wspierał on rozsądny wniosek — że OpenAI zbudowało najlepszą mechanikę konwersacyjną, a nie najlepszego agenta głosowego. Indeks zawiera teraz dwie delegowane konfiguracje GPT-Live-1 z wynikami 81,5 i 80,1. Artificial Analysis nie publikuje dziennika zmian, a w sierpniu zrewidowało komponenty indeksu, więc nie możemy z całą pewnością stwierdzić, czy wcześniejsza wartość była konfiguracją nieocenioną lub częściowo ocenioną, czy przebiegiem według starszego ważenia; obserwowalne jest to, że delegowane pary pojawiają się teraz jako osobne, kompletne wiersze, oraz że odpowiedź zmieniła się wraz z ich pojawieniem się.
Praktyczna konsekwencja jest taka, że „który model głosowy” to złe pytanie, a właściwym jest „który model głosowy plus który backend, przy jakim poziomie wysiłku”. To pytanie o routing i właśnie na nie odpowiada nasz własny produkt. OrcaRouter udostępnia backend delegacji GPT-Live-1, GPT-6 Astra, przez ten sam punkt końcowy zgodny z OpenAI, co ponad 200 innych modeli, więc podmiana warstwy myślenia to zmiana identyfikatora modelu, a nie integracja. DSL routingu składa kilka modeli w jedno wywołanie, a automatyczny failover oznacza, że nieprzetestowana kombinacja nie jest zakładem produkcyjnym — jeśli backend ulegnie degradacji, żądanie trafi gdzie indziej, zamiast zakończyć się niepowodzeniem. Precyzując, czego nie robimy: sam GPT-Live-1 nie znajduje się w naszym katalogu i nie serwujemy go. Backend, do którego deleguje, to inna sprawa.
Ile kosztuje godzina tego
Front end GPT-Live-1 jest rozliczany po 0,05 USD za minutę głosu, co sekundę, co daje 3,00 USD za godzinę otwartego połączenia. To nie cały rachunek: rozumowanie delegowane, wywołania narzędzi i wyszukiwanie w sieci są rozliczane osobno według stawek, jakie nalicza model backendowy. W Artificial Analysis zmierzono całkowity koszt, dlatego to właśnie kolumna kosztów Artificial Analysis jest tą, której należy użyć:
• GPT-Live-1 (Sol, niski) — 4,47 USD za godzinę
• Grok Voice Think Fast 2.0 High — 4,80 USD za godzinę
• GPT-Live-1 (Astra, medium) — 5,83 USD za godzinę
• GPT-Realtime-2.1 High — 10,75 USD za godzinę
Zwycięzca rankingu jest najdroższy z trzech obecnych opcji, a konfiguracja, która wygrała, kosztuje o 30% więcej za godzinę niż konfiguracja, która zajęła trzecie miejsce. Patrząc z drugiej strony, podział jest wymowny: 3,00 USD z każdej godziny to warstwa głosowa, a reszta — 1,47 USD w przypadku Sol, 2,83 USD w przypadku Astra — to tokeny backendu. Warstwa myślenia stanowi gdzieś między jedną trzecią a połową twojego rachunku, co jest dużym udziałem jak na komponent, który ranking sprowadza do przypisu.

W porównaniu z modelem, który zastępuje, cała rodzina jest jednak mniej więcej o połowę tańsza — front-end w cenie 0,05 USD za minutę to prawdziwa obniżka, a nie przepakowanie. Ponieważ tokeny backendu są rozliczane według stawek backendu, koszt wdrożenia GPT-Live-1 zależy głównie od tego, do którego modelu rozumującego kierujesz żądania, a backendy mogą być własnymi modelami OpenAI lub modelami firm trzecich. W OrcaRouter te backendy są przekazywane po cenie katalogowej dostawcy z 0% marży, więc zmiana ceny przez dostawcę w warstwie rozumowania obowiązuje tego samego dnia, a nie dopiero w następnym cyklu rozliczeniowym.
Czego indeks nie rozstrzyga
Trzy zastrzeżenia, podane przez źródło, a nie wywnioskowane. Zarówno wpisy GPT-Live-1, jak i Grok Voice Think Fast 2.0 High są oznaczone jako oparte na pojedynczym badaniu, co jest zbyt słabą podstawą dla decyzji o 0,2 punktu — ponowny przebieg mógłby zmienić kolejność pierwszego i drugiego miejsca, mimo że w żadnym z modeli nic by się nie zmieniło. Arena Elo, jak zauważono, została zamrożona na pierwszym nadającym się do publikacji pomiarze każdego modelu. A indeks nie zawiera wpisu o tym, jak te systemy zachowują się podczas długiej rozmowy: komponenty są z założenia krótkohoryzontowe, podczas gdy mechanizmem awarii, który faktycznie zabija agentów głosowych w produkcji, jest dryf w trakcie dwudziestominutowej rozmowy.
Osobno, i od dostawcy, a nie z indeksu: API GPT-Live-1 zostało wydane bez wejścia obrazu i wideo, bez ustrukturyzowanych wyników i bez darmowego planu, a jego limity szybkości są liczone w równoczesnych sesjach, a nie w żądaniach na minutę. To ograniczenia z dnia premiery, które mogą już się zmienić; sprawdź je, zanim zaczniesz je uwzględniać w projekcie.
Co zrobić z tym
Jeśli w tym tygodniu wybierasz architekturę, a nie model, indeks premiuje wzorzec delegowany w pracy agentowej, a wzorzec kaskadowy pod kątem opóźnień. GPT-Live-1 z wynikiem 81,5 to najsilniejszy jak dotąd dowód, że rozdzielenie konwersacji od rozumowania to właściwy kształt dla agentów głosowych realizujących zadania. Grok Voice Think Fast 2.0 High z wynikiem 81,3, z czasem 0,70 sekundy do pierwszego dźwięku i 94,6% skuteczności realizacji zadań, to najsilniejszy dowód, że kształt delegowany nie jest jedynym, który działa — i że nie jest jeszcze najszybszy.
Decyzja, która wynika z tych liczb, jest tańsza, niż się wydaje. Obie konfiguracje GPT-Live-1 oraz model, który pobił go w czterech z sześciu komponentów, dzieli różnica nie większa niż 1,36 USD za godzinę. Przy takiej różnicy właściwym posunięciem jest przestać czytać rankingi i przepuścić własne transkrypcje przez oba. Indeks pokazuje kształt kompromisu; nie powie ci jednak, po której jego stronie znajdują się twoi użytkownicy.
Pytania, które nasuwa liczba
Czy GPT-Live-1 to teraz najlepszy model głosowy?
Jeśli chodzi o wynik zbiorczy — tak, o 0,2 punktu i tylko na podstawie jednej próby. Jeśli chodzi o komponenty, wszystko zależy od tego, co budujesz: prowadzi pod względem wydajności agentowej i preferencji w arenie, a pozostaje w tyle pod względem rozumowania mowy, wskaźnika sukcesu zadań i czasu do pierwszego dźwięku. Przewaga 0,2 punktu w wyniku zbiorczym oparta na jednej przewadze 11,4 punktu w komponencie to pierwsze miejsce, które da się obronić, ale nie rozstrzygające.
Czy trzeba użyć GPT-6 Astra, żeby uzyskać 81,5?
Dla dokładnie tego wiersza tak — 81,5 należy do GPT-Live-1 skonfigurowanego z Astra przy średnim poziomie wysiłku rozumowania. Sol przy niskim poziomie wysiłku to udokumentowana alternatywa z wynikiem 80,1 i tańsza o 1,36 USD za godzinę, a OpenAI wspiera używanie modeli firm trzecich jako backendu, więc wpisy w tabeli liderów to dwa punkty na krzywej, a nie jedyne opcje. To, które połączenie jest najlepsze dla Twojego obciążenia, nie jest czymś, na co publiczny indeks może odpowiedzieć za Ciebie.
Dlaczego ten sam model uzyskał wynik 69,8 w naszym wcześniejszym omówieniu, a teraz 81,5?
Te dwie liczby dotyczą różnych rzeczy. Wcześniejszy odczyt umieszczał GPT-Live-1 w indeksie jako pojedynczy wpis; obecna tabela zawiera jego dwie delegowane konfiguracje jako osobne, w pełni ocenione wiersze, przy czym konfiguracja z Astra ma 81,5, a konfiguracja z Sol 80,1. Artificial Analysis zmieniło komponenty indeksu w sierpniu i nie publikuje dziennika zmian, więc traktuj tę deltę jako zmianę w tym, co mierzono, a nie jako dowód na to, że model się poprawił — a każdy pojedynczy wynik złożony dla modelu delegującego traktuj jako stwierdzenie o konfiguracji.
