Główna karta tytułowa dla Gemini 3.8 Live vs GPT-Live-1 z nadtytułem 'OrcaRouter · radar modeli — bezpośrednie starcie' i podtytułem 'Full-duplex kontra turowy – spór o architekturę, odczytany na nowo.' Dwie karty głoszą 'Gemini 3.8 Live — tryb turowy, wizja już dziś, 97 języków, tańsze minuty' oraz 'GPT-Live-1 — full-duplex, kanały zwrotne, deleguje do frontierowego backendu', z chipami: Indeks 76,0 vs 81,5, 0,018 USD vs 0,05 USD za minutę, a wideo już wkrótce w OpenAI. Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

Gemini 3.8 Live vs GPT-Live-1: pełny duplex kontra model, który myśli, kiedy mówi

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Przez około dwa miesiące spór rozstrzygała architektura. GPT-Live-1jest prawdziwie pełnodupleksowy — słucha, jednocześnie mówiąc, wydaje dźwięki podtrzymujące rozmowę, takie jak „mhmm" i „rozumiem", i kilka razy na sekundę decyduje, czy mówić, czy ustąpić. Gemini 3.8 Liveogłoszony 15 września 2026 roku, to model oparty na turach. W starym ujęciu czyniło to porównanie łatwym, a obecnie jest to niewłaściwy sposób jego odczytywania.

To, co się zmieniło, to nie to, że Google dorównało w zakresie full-duplex. Chodzi o to, że Google dostarczyło rzecz, którą full-duplex miał kompensować: model głosowy, który potrafi prowadzić rozmowę, gdy wieloetapowe zadanie działa w tle, oraz drugi wariant, który rozumuje na głos podczas pracy. Różnica architektoniczna jest realna. Po prostu nie jest już osią, która decyduje o zakupie.

Dwa sposoby na podtrzymanie rozmowy

Zakład o pełny dupleks opiera się na tym, że jakość rozmowy jest produktem. GPT-Live-1 przetwarza dźwięk wejściowy i wyjściowy w sposób ciągły i synchroniczny wewnątrz jednego modelu, zamiast łączyć rozpoznawanie mowy na tekst z modelem językowym, a następnie z syntezą mowy. To eliminuje utratę informacji między etapami i daje zachowanie, które ludzie faktycznie zauważają: możesz wtrącić się w połowie odpowiedzi, a ono się dostosowuje; nie myli pauzy ani szumu w tle z końcem twojej wypowiedzi; milczy, dopóki nie zostanie wywołane.

Zakład oparty na turach, który stawia Gemini 3.8 Live, polega na tym, że rozmowa jest rusztowaniem dla pracy. Jego funkcje służą temu, by sesja pozostawała produktywna, a nie by zachować naturalny rytm: przetwarzanie danych wejściowych wizualnych niemal w czasie rzeczywistym, automatyczne przełączanie między 97 obsługiwanymi językami w trakcie rozmowy oraz wykonywanie narzędzi i API w tle, które potwierdza żądanie i mówi dalej, gdy wywołanie się zakończy.

Oba modele odmawiają rozłączenia się z tobą, gdy myślą. Po prostu odmawiają w różny sposób. GPT-Live-1 robi to, nigdy nie zatrzymując strumienia audio. Google robi to, mówiąc przez wykonywaną pracę.

A two-column scoreboard comparing Gemini 3.8 Live and GPT-Live-1. Index score 76.0 vs 81.5; architecture turn-based vs full-duplex; video and screen available today vs not at launch; agentic tau-Voice not published vs 67.9%; languages 97 vs a narrower set; voice price $0.005 in and $0.018 out per minute vs $0.05 per minute plus backend tokens. Footer reads 'Index figures per Artificial Analysis, Sep 16 2026; GPT-Live-1 all-in measured at $4.47-$5.83 per hour.' The OrcaRouter logo is composited in the bottom-right corner.

Co tak naprawdę mówi indeks

Artificial Analysis prowadzi Speech to Speech Index — ważony kompozyt rozumowania głosowego, wydajności agentowej, preferencji w arenie i wskaźnika sukcesu zadań. Przeczytaj uważnie tablicę zarejestrowaną 16 września 2026 r., ponieważ nagłówek ukrywa strukturę:

Gemini 3.8 Live Extended Thinking — 82,6 (pierwsze)

• GPT-Live-1 (backend Astra, średni wysiłek) — 81,5

Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1 (backend Sol, niski wysiłek) — 80.1

Gemini 3.8 Live — 76.0

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

Z tego uporządkowania wynikają trzy rzeczy. Po pierwsze, Google zajmuje najwyższą pozycję, ale zajmuje ją z drogim wariantem, a nie tym, który wdroży większość osób. Po drugie, GPT-Live-1 pojawia się dwukrotnie, ponieważ Artificial Analysis ocenia cały system, a nie front-end głosowy — a różnica 1,4 punktu między jego dwiema konfiguracjami jest siedmiokrotnie większa niż różnica 0,2 punktu między pierwszym a drugim miejscem. Po trzecie, model z tytułu tego zestawienia, Gemini 3.8 Live, zajmuje piąte miejsce, poniżej obu konfiguracji GPT-Live-1.

Jeśli porównujesz to, co porównywalne — wersję standardową z wersją standardową — GPT-Live-1 wygrywa to starcie w indeksie złożonym i to nie jest nawet blisko. Wynik 82,6 należy do Gemini 3.8 Live Extended Thinking, który jest innym produktem w innej cenie i z innym wdrożeniem.

Screenshot of the Artificial Analysis Speech to Speech leaderboard page, captured September 16, 2026. The AA-Speech to Speech Index bar chart shows Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 (Astra) at 81.5, Grok Voice Think Fast 2.0 at 81.3, GPT-Live-1 (Sol) at 80.1 and Gemini 3.8 Live at 76.0, alongside speed and cost-per-hour-of-input-audio panels.

Gdzie GPT-Live-1 wciąż ma przewagę

Full-duplex nie jest zabiegiem marketingowym, a podział wyników benchmarków pokazuje, gdzie przekłada się na realną przewagę:

Wydajność agentowa — GPT-Live-1 zdecydowanie prowadzi w τ-Voice z wynikiem 67,9% wobec 56,5% Groka. Google nie opublikował porównywalnego wyniku τ-Voice dla Gemini 3.8 Live, jedynie 68,6% dla wariantu Extended Thinking.

Dynamika konwersacji — naprzemienność pełnodupleksowa wciąż pozostaje wyznacznikiem naturalności, a modele działające w trybie turowym historycznie pozostawały pod tym względem w tyle.

Głębokość delegacji — GPT-Live-1 przekazuje trudne zapytania do wiodącego modelu tekstowego, przy czym zarówno GPT-5.5, jak i GPT-6 Astra są udokumentowane jako backendy, a także udostępnia selektory poziomu wysiłku rozumowania.

Pozyskiwanie źródeł — transkrypcje głosowe z ChatGPT zawierają linki do cytowań, co ogólnie rzadko występuje w interakcjach głosowych.

Przeciwwagą jest to, że GPT-Live-1 ustępuje w zakresie rozumowania na surowej mowie: 90,1% w Big Bench Audio wobec 97,2% uzyskanych przez Grok. A jego główny wskaźnik opóźnienia wynoszący 0,798 sekundy w Full Duplex Bench to inny pomiar niż czas API do pierwszego dźwięku, który wynosi 1,24–1,34 sekundy.

Gdzie Gemini 3.8 Live ma przewagę

Zalety Google'a mniej dotyczą rozmowy, a bardziej tego, co może zrobić sesja:

Wizja, dziś — Gemini od jakiegoś czasu obsługuje wejście z kamery i udostępnianie ekranu. GPT-Live-1 zadebiutował bez wideo i udostępniania ekranu, a OpenAI zapowiada, że się pojawią, i wskazuje starszy Advanced Voice Mode jako rozwiązanie tymczasowe. Gemini 3.8 Live dodaje do tego przetwarzanie danych wizualnych niemal w czasie rzeczywistym.

Zakres językowy — 97 obsługiwanych języków z automatycznym przełączaniem w trakcie rozmowy, w porównaniu ze znacznie węższą ofertą po stronie OpenAI.

Koszt — ogłoszona stawka wynosi 0,005 USD za minutę wejścia audio i 0,018 USD za minutę wyjścia audio. GPT-Live-1 jest rozliczany po 0,05 USD za minutę głosową wyłącznie za front-end, a całkowity zmierzony koszt to około 4,47–5,83 USD za godzinę, gdy uwzględni się tokeny backendu.

Drugi poziom, który rozumuje na głos — Gemini 3.8 Live Extended Thinking opisuje postępy za pomocą sygnałów takich jak „Pozwól, że to sprawdzę…”, co jest inną odpowiedzią na problem ciszy niż tryb pełnego dupleksu.

Porównanie kosztów, które ma znaczenie

Ceny w pierwszym rzucie wyglądają na pogrom — 0,018 USD wobec 0,05 USD za minutę — a stawki za godzinę są jeszcze bardziej wymowne. Wykres Artificial Analysis przedstawiający koszt godziny wejściowego dźwięku plasuje Gemini 3.8 Live na 1,50 USD za godzinę, w porównaniu z 4,14 USD dla GPT-Realtime-2 High i 10,75 USD dla GPT-Realtime-2.1 High. Grok Voice Think Fast 2.0 wypada na 4,80 USD.

Haczyk polega na tym, że żadna z tych liczb nie jest prawdziwym rachunkiem. Stawka GPT-Live-1 wynosząca 0,05 USD za minutę obejmuje wyłącznie interfejs głosowy; model tekstowy działający w tle, który wykonuje właściwe rozumowanie, jest rozliczany osobno — i właśnie tak z 0,05 USD z nagłówka robi się 4,47–5,83 USD za godzinę łącznie. Gemini 3.8 Live ma tę samą strukturę — wykonywanie narzędzi w tle to praca modelu tekstowego — a Google nie ujawniło, ile to kosztuje.

Uczciwa interpretacja jest więc taka, że Gemini 3.8 Live jest znacznie tańszy na wejściu, a porównanie całkowitych kosztów pozostaje nieznane dla obu, dopóki nie zmierzysz własnego obciążenia. To nie jest unik; to rzeczywisty stan informacji.

Warstwa, do której oboje delegują

Oto fakt strukturalny, który sprawia, że to starcie jest mniej decyzją o przywiązaniu do jednego dostawcy, niż się wydaje. Oba modele delegują zadania. GPT-Live-1 z założenia przekazuje trudne zapytania do backendowego modelu tekstowego, a wykonywanie narzędzi w tle po stronie Gemini sprowadza się do zwykłych wywołań modelu. W obu przypadkach interfejs głosowy to cienka warstwa nad modelem tekstowym, który odpowiada za rozumowanie — i to właśnie w tej warstwie tekstowej tkwi zmienność kosztów oraz to tam przełączanie jest tanie.

OrcaRouter oferuje 190 modeli za jednym kluczem w cenie katalogowej dostawcy, bez marży, więc obniżka cen u dostawcy trafia na naszą stronę tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy. W przypadku stosu głosowego liczą się dwie właściwości: cel delegowania można podmienić na ruchu na żywo bez ingerencji w integrację głosową, a automatyczne przełączanie awaryjne utrzymuje połączenie, gdy backend zwróci błąd lub przekroczy limit czasu. Jedno doprecyzowanie, bo łatwo można zasugerować coś przeciwnego: nie hostujemy punktów końcowych głosowych Gemini 3.8 Live ani GPT-Live-1 — pochodzą one z własnych interfejsów API dostawców. Modele tekstowe, którym przekazują pracę, są zazwyczaj na routerze.

Screenshot of the OrcaRouter model page for google/gemini-3.8-flash, showing the 1M-token context window, 65K max output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and p50 time to first token of 3.35 seconds.

Jak wybrać

Wybierz GPT-Live-1, jeśli jakość rozmowy jest produktem — naturalne radzenie sobie z przerywaniem, sygnały podtrzymujące i poczucie, że rozmawiasz z czymś, a nie obsługujesz tego — oraz jeśli możesz udźwignąć koszt całkowity, który jest znacznie wyższy, niż sugeruje stawka podstawowa. Pamiętaj, że jego API stało się dostępne dopiero we wrześniu 2026 r., więc narzędzia firm trzecich wokół niego są jeszcze młode.

Wybierz Gemini 3.8 Live, jeśli już teraz potrzebujesz możliwości wizyjnych, jeśli potrzebujesz więcej niż dwudziestu kilku języków albo jeśli ekonomika rozliczania za minutę dominuje w twoim modelu. Zaakceptuj, że kupujesz standardowy poziom, który plasuje się na piątym miejscu w indeksie złożonym, a nie na pierwszym, oraz że 82,6, które wszyscy będą cytować, należy do wariantu Extended Thinking.

Wybierz Gemini 3.8 Live Extended Thinking, jeśli rozumowanie jest tu najważniejsze i chcesz obecnego lidera indeksu — ale najpierw sprawdź jego wdrożenie, ponieważ jego ścieżka dystrybucji przez Gemini Live, Docs, Gmail i Keep jest szersza niż w modelu standardowym, a jego dostępność dla przedsiębiorstw nadal jest w prywatnej wersji zapoznawczej.

To, na co warto patrzeć w nadchodzącym kwartale, to czy full-duplex pozostanie fosą. Modele działające w turach zamykają lukę konwersacyjną inną drogą — utrzymując audio zajęte narracją, gdy wykonywana jest praca — a jeśli to wytrzyma w warunkach rzeczywistego ruchu, wyróżnik architektoniczny, który od roku definiuje tę kategorię, przestanie być tym, o co pytają kupujący.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie