Główna karta tytułowa dla Gemini 3.8 Live Extended Thinking vs GPT-Live-1, pokazująca dwa modele głosowe oddalone o 1,1 punktu indeksu, z różnymi modelami rozliczeń.
Guides & Insights

Gemini 3.8 Live Extended Thinking vs GPT-Live-1: remis 1,1 punktu i dwa różne rachunki

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Jeśli chodzi o wynik łączny, jest remis. Gemini 3.8 Live Extended Thinking osiąga 82,6 w indeksie Speech to Speech Index firmy Artificial Analysis; GPT-Live-1 w swoim zapleczu Astra przy średnim poziomie wysiłku rozumowania osiąga 81,5. W leżącym u podstaw komponencie agentowym — ukończeniu zadań τ-Voice — różnica wynosi 0,7 punktu, 68,6% wobec 67,9%. W komponencie rozumowania jest większa i przebiega w drugą stronę: 97,7% w Big Bench Audio dla modelu Gemini, 90,1% dla GPT-Live-1. Nic z tego rozrzutu nie przetrwa drugiego przebiegu testu porównawczego i nic z tego nie powinno być podstawą twojej decyzji.

Tego, co dzieli te dwa rozwiązania, nie stanowi jakość. Chodzi o to, że nie zgadzają się co do tego, czym jest agent głosowy, kto odpowiada za myślenie i — co jako pierwsze odbija się na pozycji budżetowej — w jaki sposób rozliczana jest sesja. Gemini 3.8 Live Extended Thinking nalicza opłaty za token audio i rozumuje w tym samym modelu, który mówi. GPT-Live-1 pobiera stałą stawkę za czas sesji, niezależnie od tego, czy ktoś mówi, a samo myślenie przekazuje osobnemu modelowi tekstowemu, który wybierasz i za który płacisz oddzielnie. To dwa różne produkty noszące ten sam wynik benchmarku, a to, który pasuje, zależy od pytania, którego ranking nigdy nie zadaje: jak wygląda przeciętna rozmowa na twojej linii?

1,1-punktowe wiązanie i gdzie tak naprawdę pęka

Zacznij od liczb, bo właśnie w tym rzecz, jak cienki jest nagłówek:

Indeks mowy na mowę — Gemini 3.8 Live Extended Thinking (wysoki) 82,6 vs GPT-Live-1 (backend Astra, średni wysiłek) 81,5

Wydajność agentowa (ukończenie zadania τ-Voice) — 68,6% vs 67,9%, a GPT-Live-1 na poziomie 59,3%, gdy uruchamia backend Sol przy niskim nakładzie

Rozumowanie mowy (Big Bench Audio) — 97,7% vs 90,1%, jedyny komponent, w którym różnica nie jest szumem

Złożone procesy bankowe (Sierra τ³-Banking, według dostawcy) — 35,1% vs 32,0%

Czas do pierwszego dźwięku — 1,35 s vs 1,24–1,34 s przez API

Zmierzony koszt za godzinę — 3,50 USD wobec 5,83 USD w konfiguracji Astra, oba na podstawie pomiaru dźwięku wejściowego Artificial Analysis

Uczciwa interpretacja jest taka, że oba modele są nieodróżnialne w wyniku łącznym, odróżnialne w rozumowaniu mowy, gdzie model Gemini prowadzi o prawie osiem punktów, oraz odróżnialne pod względem kosztu, gdzie prowadzi o około 40%. Tam, gdzie GPT-Live-1 wysuwa się na prowadzenie, jest w tych częściach doświadczenia, które benchmarkowi trudno ocenić: naprawdę działa w trybie pełnego dupleksu, słucha, gdy mówi, emituje sygnały podtrzymujące i kilka razy na sekundę decyduje, czy mówić, czy ustąpić. Gemini 3.8 Live Extended Thinking działa w trybie turowym. Rozwiązuje ten sam podstawowy problem — rozmówcę pozostawionego w ciszy, gdy agent pracuje — zamiast tego narracją, rozumując i mówiąc jednocześnie, z sygnałami takimi jak „Pozwól, że to sprawdzę…”, gdy zadanie trwa.

Oba podejścia utrzymują tę linię przy życiu. Odczuwa się je inaczej. Tylko jedno z nich pojawia się w indeksie.

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and GPT-Live-1 across six dimensions: Speech to Speech Index 82.6 vs 81.5, agentic performance on tau-Voice 68.6 percent vs 67.9 percent, speech reasoning on Big Bench Audio 97.7 percent vs 90.1 percent, billing model per audio token vs per session minute, reasoning location in-model vs delegated to a backend text model, and cost per hour $3.50 vs $5.83.

Dwa modele rozliczeń i dlaczego cennik wprowadza w błąd

To jest sekcja, która decyduje o większości wdrożeń, i to właśnie ją omówienie pomija.

Gemini 3.8 Live Extended Thinking jest rozliczany tak samo jak model tokenowy. W przypadku Live API opublikowane stawki wynoszą 3,00 USD za milion tokenów wejściowych audio — około 0,005 USD za minutę wejścia audio — oraz 12,00 USD za milion tokenów wyjściowych audio, czyli około 0,018 USD za minutę, przy czym tokeny rozumowania są wliczane do tego wyjścia. Płacisz za dźwięk, który płynie. Dzwoniący, który robi pauzę, myśli albo zostaje zawieszony na linii, nie kosztuje cię nic, dopóki milczy.

GPT-Live-1 jest rozliczany tak jak linia telefoniczna. Ma stałą stawkę 0,05 USD za minutę czasu sesji, naliczaną co sekundę, niezależnie od tego, kto mówi i czy ktokolwiek w ogóle mówi. Backend rozumowania nie jest wliczony: model tekstowy wykonujący myślenie oraz wszelkie narzędzia, które wywołuje, są rozliczane osobno, dodatkowo. W ten sposób stawka 0,05 USD z nagłówka zamienia się w całkowity koszt wynoszący około 4,47 USD za godzinę na backendzie Sol i 5,83 USD za godzinę na Astra medium, według pomiarów Artificial Analysis.

Zestaw je obok siebie, a naiwne porównanie — $0,018 wobec $0,05 za minutę, różnica 2,8× — jest błędne w obie strony. Zmierzone stawki godzinowe wskazują, że rzeczywista różnica wynosi $3,50 wobec $5,83, czyli bliżej 1,7×. Ale model zegara sesji zmienia również kształt twojego rachunku, a nie tylko jego wysokość: w GPT-Live-1 twój koszt zależy od czasu trwania połączenia, więc linia z długimi, cichymi, mało treściwymi rozmowami — kolejka wsparcia, krok weryfikacji, przekazanie do IVR — płaci tyle samo, co intensywna. Po stronie Gemini koszt zależy od dźwięku, więc cisza jest darmowa, a gadatliwość nie. Wykonaj obliczenia na podstawie własnej średniej długości połączenia, zanim zrobisz to na podstawie stawki za minutę, ponieważ to ta liczba decyduje, które z nich jest dla ciebie tańsze, a odpowiedź nie jest taka sama dla linii rezerwacyjnej i linii triage'u.

Gdzie dzieje się myślenie

Drugą różnicą strukturalną jest delegacja i to ona decyduje o tym, jak dużą część tego stosu możesz faktycznie wymienić.

GPT-Live-1 to front-end. Obsługuje dwukierunkowe audio, a gdy zapytanie wymaga prawdziwego rozumowania, przekazuje pracę do osobnego modelu backendowego — GPT-5.5 i GPT-6 Astra są udokumentowane jako backendy — z selektorami wysiłku rozumowania, które pozwalają wybrać, jak dużą część tego backendu chcesz kupić. Dlatego tablica wyników wymienia GPT-Live-1 dwukrotnie, z różnymi wynikami: 81,5 na Astrze przy średnim wysiłku, 80,1 na Sol przy niskim. Ta 1,4-punktowa różnica między jego własnymi dwiema konfiguracjami jest większa niż 1,1-punktowa luka między dwoma modelami w tym starciu, co pokazuje, że po stronie OpenAI wybrana konfiguracja ma większe znaczenie niż wybrany dostawca.

Gemini 3.8 Live Extended Thinking rozumuje w tym samym modelu, który mówi. Nie ma osobnego backendu do wyboru ani osobnego rachunku za niego; kompromis polega na tym, że głębokość dostrajasz za pomocą poziomów myślenia — niskiego, średniego i wysokiego — w tym samym modelu, a wartości 82,6 i 68,6 odpowiadają konfiguracji (Wysoki) Wykonywanie narzędzi w tle i przez API odbywa się asynchronicznie po obu stronach, więc żaden model nie zawiesza się podczas pracy.

Jedna praktyczna konsekwencja: ponieważ inteligencja GPT-Live-1 to kupiony model tekstowy stojący za interfejsem głosowym, jego pułap jakości przesuwa się, gdy OpenAI wypuszcza model tekstowy, a nie gdy wypuszcza model głosowy. Pułap Gemini 3.8 Live Extended Thinking przesuwa się, gdy Google ponownie trenuje model audio. Jeśli zawierasz dwuletni zakład dotyczący platformy głosowej, ta różnica w tempie aktualizacji zasługuje na więcej namysłu niż 1,1 punktu indeksu.

Jakie koszty zmiany, niezależnie od tego, którą drogę wybierzesz

Żadna z tych zmian nie jest prostą zamianą identyfikatora modelu, a zespoły, które traktują ją jako taką, przekonują się o tym na produkcji. Przejście na Gemini 3.8 Live Extended Thinking oznacza zaakceptowanie innej umowy dotyczącej tury: wywołania funkcji są zawsze asynchroniczne, więc blokująca deklaracja narzędzia zwraca twardy błąd zamiast trafiać do kolejki, a klienci muszą odczytywać interaction_status, czyli pole — IN_PROGRESS gdy trwa rozumowanie lub nadal działa narzędzie, IDLE tylko wtedy, gdy całe zadanie się zakończy — zamiast ufać, że turnComplete oznacza wykonanie pracy. Przejście na GPT-Live-1 oznacza przyjęcie jego mechanizmów wyboru backendu i drugiego obszaru rozliczeń oraz życie z API, które stało się ogólnie dostępne dla deweloperów dopiero 10 września 2026 r., po debiucie w ChatGPT 8 lipca — więc zewnętrzne narzędzia, zestawy SDK i obserwowalność wokół niego mają kilka miesięcy, a nie lat. Niezależnie od kierunku, w jakim zmierzasz, zaplanuj pracę integracyjną obok rachunku za tokeny. W dojrzałym stosie głosowym refaktoryzacja jest zwykle większym z tych dwóch zadań.

Jak przeprowadzić takie porównanie, nie obstawiając tego

Rozsądnym sposobem rozstrzygnięcia kwestii 1,1 punktu jest uruchomienie obu na własnym ruchu, a niezręczne jest to, że zwykle oznacza to dwie integracje, dwie umowy i dwa zestawy danych uwierzytelniających. Nie musi to jednak oznaczać dwóch architektur. W obu tych systemach front-end głosowy to cienka warstwa nad zwykłymi wywołaniami modelu tekstowego — w przypadku GPT-Live-1 jest to jawne, a po stronie Gemini wykonywanie narzędzi w tle rozwiązuje się tak samo — i to właśnie w tej warstwie tekstowej mieści się wariancja Twoich kosztów oraz to ona sprawia, że przełączenie jest naprawdę tanie.

OrcaRouter udostępnia 190 modeli z jednego klucza w cenie katalogowej dostawcy, bez marży, więc zmiana ceny po stronie dostawcy obowiązuje u nas tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy. W przypadku stosu głosowego istotne są dwie właściwości: to, że cel delegowania można podmienić na ruchu na żywo bez ingerencji w integrację głosową, oraz to, że automatyczne przełączanie awaryjne podtrzymuje połączenie, gdy backend zwróci błąd lub przekroczy limit czasu — dzięki temu można przetestować niesprawdzoną konfigurację na prawdziwym ruchu, nie stawiając za nią linii produkcyjnej. Aby było jasne, co hostujemy, a czego nie: ani endpoint Gemini 3.8 Live Extended Thinking, ani endpoint GPT-Live-1 nie znajdują się na naszym routerze — pochodzą one z własnych API Google i OpenAI. Modele tekstowe, do których delegują, bardzo często są na naszym routerze, w tym Gemini 3.8 Flash.

Czołówka tabeli i jak mało się stabilizuje.

Poniższy zrzut został wykonany 16 września 2026:

Gemini 3.8 Live Extended Thinking (High) — 82,6, pierwsze miejsce

GPT-Live-1 (backend Astra, średni wysiłek) — 81,5

Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1 (backend Sol, niski wysiłek) — 80.1

• Gemini 3.8 Live — 76.0

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

Warto zwrócić uwagę na trzy rzeczy. Po pierwsze, pierwsze i trzecie miejsce dzieli 1,3 punktu, a pierwsze i piąte 6,6, więc czołówka tej tabeli to ścisk, a nie ranking. Po drugie, model w tytule tego starcia to nie piąty wpis Gemini — to standardowy Gemini 3.8 Live, inny i znacznie tańszy produkt, którego nie należy mylić z porównywanym tu wariantem rozumującym. Po trzecie, istnieje precedens, by każdą pojedynczą wartość indeksu traktować jako tymczasową: xAI podało w lipcu 82,9 dla Grok Voice Think Fast 2.0, a ten model na tej tabeli wskazuje 81,3. Wyniki indeksu podawane przez dostawców nie zawsze wytrzymują zderzenie z działającą na żywo tabelą liderów. Wyniki 68,6% i 67,9% dla τ-Voice znajdują się teraz na publicznej tabeli prowadzonej w oparciu o własne środowisko testowe Artificial Analysis, więc są potwierdzone, a nie tylko deklarowane — ale różnica 0,7 punktu między dwoma modelami w tym samym środowisku testowym to nie różnica. Sprawdź to na własnym ruchu albo zignoruj.

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6, GPT-Live-1 at 81.5 and 80.1, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

Jeszcze jedna liczba warta uwzględnienia w decyzji, ponieważ jest to najbardziej niewygodna liczba w tym porównaniu: Google podaje 35,1% dla Gemini 3.8 Live Extended Thinking w rankingu τ³-Banking firmy Sierra, w porównaniu z 32,0% dla GPT-Live-1 Astra. Są to dane raportowane przez dostawców, niepowtórzone, i opisują świat, w którym wiodący agent głosowy w tym rankingu zawodzi w około dwóch z każdych trzech realistycznych prób wykonania zadania bankowego. Jeśli Twój agent musi wykonać regulowane, wieloetapowe zadania, żaden z tych modeli nie jest gotowy — a przewaga 3,1 punktu w tym benchmarku nie jest powodem, by wybierać dostawcę, lecz powodem, by utrzymać człowieka w pętli.

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

A więc: jeśli produktem jest naturalność rozmowy, a Twoje rozmowy są krótkie i intensywne, zachowanie full-duplex GPT-Live-1 jest realną przewagą, której indeks nie widzi, a rozliczanie według czasu sesji jest znośne przy takiej długości rozmowy. Jeśli rozmowy są długie, ciche lub zmienne albo jeśli rozumowanie mowy i koszt za godzinę dominują, Gemini 3.8 Live Extended Thinking jest z przodu w komponentach, które mają znaczenie, i jest przy tym około 40% tańszy za godzinę — z zastrzeżeniem, że działa w trybie turowym, jest wciąż w wersji zapoznawczej dla przedsiębiorstw i wymaga refaktoryzacji klienta, zanim uruchomi Twoje narzędzia. Czego to wszystko nie uzasadnia, to wybierania któregokolwiek z nich na podstawie przewagi 1,1 punktu indeksu. Na podstawie dostępnych dowodów uczciwym powodem wyboru między tymi dwoma jest model rozliczeń i architektura pod nim, a oba te elementy możesz zmierzyć na własnym ruchu w tym tygodniu.

W OrcaRouter automatyczne przełączanie awaryjne nie przerywa połączenia, gdy backend zgłosi błąd lub przekroczy limit czasu.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie