
Gemini 3.8 Live vs GPT-Live-1: pełny duplex kontra model, który myśli, kiedy mówi
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Przez około dwa miesiące spór rozstrzygała architektura. GPT-Live-1jest prawdziwie pełnodupleksowy — słucha, jednocześnie mówiąc, wydaje dźwięki podtrzymujące rozmowę, takie jak „mhmm" i „rozumiem", i kilka razy na sekundę decyduje, czy mówić, czy ustąpić. Gemini 3.8 Liveogłoszony 15 września 2026 roku, to model oparty na turach. W starym ujęciu czyniło to porównanie łatwym, a obecnie jest to niewłaściwy sposób jego odczytywania.
To, co się zmieniło, to nie to, że Google dorównało w zakresie full-duplex. Chodzi o to, że Google dostarczyło rzecz, którą full-duplex miał kompensować: model głosowy, który potrafi prowadzić rozmowę, gdy wieloetapowe zadanie działa w tle, oraz drugi wariant, który rozumuje na głos podczas pracy. Różnica architektoniczna jest realna. Po prostu nie jest już osią, która decyduje o zakupie.
Dwa sposoby na podtrzymanie rozmowy
Zakład o pełny dupleks opiera się na tym, że jakość rozmowy jest produktem. GPT-Live-1 przetwarza dźwięk wejściowy i wyjściowy w sposób ciągły i synchroniczny wewnątrz jednego modelu, zamiast łączyć rozpoznawanie mowy na tekst z modelem językowym, a następnie z syntezą mowy. To eliminuje utratę informacji między etapami i daje zachowanie, które ludzie faktycznie zauważają: możesz wtrącić się w połowie odpowiedzi, a ono się dostosowuje; nie myli pauzy ani szumu w tle z końcem twojej wypowiedzi; milczy, dopóki nie zostanie wywołane.
Zakład oparty na turach, który stawia Gemini 3.8 Live, polega na tym, że rozmowa jest rusztowaniem dla pracy. Jego funkcje służą temu, by sesja pozostawała produktywna, a nie by zachować naturalny rytm: przetwarzanie danych wejściowych wizualnych niemal w czasie rzeczywistym, automatyczne przełączanie między 97 obsługiwanymi językami w trakcie rozmowy oraz wykonywanie narzędzi i API w tle, które potwierdza żądanie i mówi dalej, gdy wywołanie się zakończy.
Oba modele odmawiają rozłączenia się z tobą, gdy myślą. Po prostu odmawiają w różny sposób. GPT-Live-1 robi to, nigdy nie zatrzymując strumienia audio. Google robi to, mówiąc przez wykonywaną pracę.

Co tak naprawdę mówi indeks
Artificial Analysis prowadzi Speech to Speech Index — ważony kompozyt rozumowania głosowego, wydajności agentowej, preferencji w arenie i wskaźnika sukcesu zadań. Przeczytaj uważnie tablicę zarejestrowaną 16 września 2026 r., ponieważ nagłówek ukrywa strukturę:
• Gemini 3.8 Live Extended Thinking — 82,6 (pierwsze)
• GPT-Live-1 (backend Astra, średni wysiłek) — 81,5
• Grok Voice Think Fast 2.0 High — 81.3
• GPT-Live-1 (backend Sol, niski wysiłek) — 80.1
• Gemini 3.8 Live — 76.0
• GPT-Realtime-2.1 High — 73.9
• Gemini 3.1 Flash Live High — 71.5
Z tego uporządkowania wynikają trzy rzeczy. Po pierwsze, Google zajmuje najwyższą pozycję, ale zajmuje ją z drogim wariantem, a nie tym, który wdroży większość osób. Po drugie, GPT-Live-1 pojawia się dwukrotnie, ponieważ Artificial Analysis ocenia cały system, a nie front-end głosowy — a różnica 1,4 punktu między jego dwiema konfiguracjami jest siedmiokrotnie większa niż różnica 0,2 punktu między pierwszym a drugim miejscem. Po trzecie, model z tytułu tego zestawienia, Gemini 3.8 Live, zajmuje piąte miejsce, poniżej obu konfiguracji GPT-Live-1.
Jeśli porównujesz to, co porównywalne — wersję standardową z wersją standardową — GPT-Live-1 wygrywa to starcie w indeksie złożonym i to nie jest nawet blisko. Wynik 82,6 należy do Gemini 3.8 Live Extended Thinking, który jest innym produktem w innej cenie i z innym wdrożeniem.

Gdzie GPT-Live-1 wciąż ma przewagę
Full-duplex nie jest zabiegiem marketingowym, a podział wyników benchmarków pokazuje, gdzie przekłada się na realną przewagę:
• Wydajność agentowa — GPT-Live-1 zdecydowanie prowadzi w τ-Voice z wynikiem 67,9% wobec 56,5% Groka. Google nie opublikował porównywalnego wyniku τ-Voice dla Gemini 3.8 Live, jedynie 68,6% dla wariantu Extended Thinking.
• Dynamika konwersacji — naprzemienność pełnodupleksowa wciąż pozostaje wyznacznikiem naturalności, a modele działające w trybie turowym historycznie pozostawały pod tym względem w tyle.
• Głębokość delegacji — GPT-Live-1 przekazuje trudne zapytania do wiodącego modelu tekstowego, przy czym zarówno GPT-5.5, jak i GPT-6 Astra są udokumentowane jako backendy, a także udostępnia selektory poziomu wysiłku rozumowania.
• Pozyskiwanie źródeł — transkrypcje głosowe z ChatGPT zawierają linki do cytowań, co ogólnie rzadko występuje w interakcjach głosowych.
Przeciwwagą jest to, że GPT-Live-1 ustępuje w zakresie rozumowania na surowej mowie: 90,1% w Big Bench Audio wobec 97,2% uzyskanych przez Grok. A jego główny wskaźnik opóźnienia wynoszący 0,798 sekundy w Full Duplex Bench to inny pomiar niż czas API do pierwszego dźwięku, który wynosi 1,24–1,34 sekundy.
Gdzie Gemini 3.8 Live ma przewagę
Zalety Google'a mniej dotyczą rozmowy, a bardziej tego, co może zrobić sesja:
• Wizja, dziś — Gemini od jakiegoś czasu obsługuje wejście z kamery i udostępnianie ekranu. GPT-Live-1 zadebiutował bez wideo i udostępniania ekranu, a OpenAI zapowiada, że się pojawią, i wskazuje starszy Advanced Voice Mode jako rozwiązanie tymczasowe. Gemini 3.8 Live dodaje do tego przetwarzanie danych wizualnych niemal w czasie rzeczywistym.
• Zakres językowy — 97 obsługiwanych języków z automatycznym przełączaniem w trakcie rozmowy, w porównaniu ze znacznie węższą ofertą po stronie OpenAI.
• Koszt — ogłoszona stawka wynosi 0,005 USD za minutę wejścia audio i 0,018 USD za minutę wyjścia audio. GPT-Live-1 jest rozliczany po 0,05 USD za minutę głosową wyłącznie za front-end, a całkowity zmierzony koszt to około 4,47–5,83 USD za godzinę, gdy uwzględni się tokeny backendu.
• Drugi poziom, który rozumuje na głos — Gemini 3.8 Live Extended Thinking opisuje postępy za pomocą sygnałów takich jak „Pozwól, że to sprawdzę…”, co jest inną odpowiedzią na problem ciszy niż tryb pełnego dupleksu.
Porównanie kosztów, które ma znaczenie
Ceny w pierwszym rzucie wyglądają na pogrom — 0,018 USD wobec 0,05 USD za minutę — a stawki za godzinę są jeszcze bardziej wymowne. Wykres Artificial Analysis przedstawiający koszt godziny wejściowego dźwięku plasuje Gemini 3.8 Live na 1,50 USD za godzinę, w porównaniu z 4,14 USD dla GPT-Realtime-2 High i 10,75 USD dla GPT-Realtime-2.1 High. Grok Voice Think Fast 2.0 wypada na 4,80 USD.
Haczyk polega na tym, że żadna z tych liczb nie jest prawdziwym rachunkiem. Stawka GPT-Live-1 wynosząca 0,05 USD za minutę obejmuje wyłącznie interfejs głosowy; model tekstowy działający w tle, który wykonuje właściwe rozumowanie, jest rozliczany osobno — i właśnie tak z 0,05 USD z nagłówka robi się 4,47–5,83 USD za godzinę łącznie. Gemini 3.8 Live ma tę samą strukturę — wykonywanie narzędzi w tle to praca modelu tekstowego — a Google nie ujawniło, ile to kosztuje.
Uczciwa interpretacja jest więc taka, że Gemini 3.8 Live jest znacznie tańszy na wejściu, a porównanie całkowitych kosztów pozostaje nieznane dla obu, dopóki nie zmierzysz własnego obciążenia. To nie jest unik; to rzeczywisty stan informacji.
Warstwa, do której oboje delegują
Oto fakt strukturalny, który sprawia, że to starcie jest mniej decyzją o przywiązaniu do jednego dostawcy, niż się wydaje. Oba modele delegują zadania. GPT-Live-1 z założenia przekazuje trudne zapytania do backendowego modelu tekstowego, a wykonywanie narzędzi w tle po stronie Gemini sprowadza się do zwykłych wywołań modelu. W obu przypadkach interfejs głosowy to cienka warstwa nad modelem tekstowym, który odpowiada za rozumowanie — i to właśnie w tej warstwie tekstowej tkwi zmienność kosztów oraz to tam przełączanie jest tanie.
OrcaRouter oferuje 190 modeli za jednym kluczem w cenie katalogowej dostawcy, bez marży, więc obniżka cen u dostawcy trafia na naszą stronę tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy. W przypadku stosu głosowego liczą się dwie właściwości: cel delegowania można podmienić na ruchu na żywo bez ingerencji w integrację głosową, a automatyczne przełączanie awaryjne utrzymuje połączenie, gdy backend zwróci błąd lub przekroczy limit czasu. Jedno doprecyzowanie, bo łatwo można zasugerować coś przeciwnego: nie hostujemy punktów końcowych głosowych Gemini 3.8 Live ani GPT-Live-1 — pochodzą one z własnych interfejsów API dostawców. Modele tekstowe, którym przekazują pracę, są zazwyczaj na routerze.

Jak wybrać
Wybierz GPT-Live-1, jeśli jakość rozmowy jest produktem — naturalne radzenie sobie z przerywaniem, sygnały podtrzymujące i poczucie, że rozmawiasz z czymś, a nie obsługujesz tego — oraz jeśli możesz udźwignąć koszt całkowity, który jest znacznie wyższy, niż sugeruje stawka podstawowa. Pamiętaj, że jego API stało się dostępne dopiero we wrześniu 2026 r., więc narzędzia firm trzecich wokół niego są jeszcze młode.
Wybierz Gemini 3.8 Live, jeśli już teraz potrzebujesz możliwości wizyjnych, jeśli potrzebujesz więcej niż dwudziestu kilku języków albo jeśli ekonomika rozliczania za minutę dominuje w twoim modelu. Zaakceptuj, że kupujesz standardowy poziom, który plasuje się na piątym miejscu w indeksie złożonym, a nie na pierwszym, oraz że 82,6, które wszyscy będą cytować, należy do wariantu Extended Thinking.
Wybierz Gemini 3.8 Live Extended Thinking, jeśli rozumowanie jest tu najważniejsze i chcesz obecnego lidera indeksu — ale najpierw sprawdź jego wdrożenie, ponieważ jego ścieżka dystrybucji przez Gemini Live, Docs, Gmail i Keep jest szersza niż w modelu standardowym, a jego dostępność dla przedsiębiorstw nadal jest w prywatnej wersji zapoznawczej.
To, na co warto patrzeć w nadchodzącym kwartale, to czy full-duplex pozostanie fosą. Modele działające w turach zamykają lukę konwersacyjną inną drogą — utrzymując audio zajęte narracją, gdy wykonywana jest praca — a jeśli to wytrzyma w warunkach rzeczywistego ruchu, wyróżnik architektoniczny, który od roku definiuje tę kategorię, przestanie być tym, o co pytają kupujący.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
