
Gemini 3.8 Live Extended Thinking vs Gemini 3.8 Live: Płacenie 4x więcej za te 38 punktów, które się liczą
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dwa modele, jedna premiera, jeden cennik i decyzja, co do której większość opracowań myli się w tym samym kierunku. Gemini 3.8 Live Extended Thinking i Gemini 3.8 Live zadebiutowały razem 15 września 2026 r., oba oparte na Gemini 3 Pro, oba obsługują 97 języków z automatycznym przełączaniem w trakcie rozmowy, oba przyjmują niemal w czasie rzeczywistym dane wizualne, oba opatrują generowane audio znakiem wodnym SynthID. W kompozytowym Speech to Speech Index publikowanym przez Artificial Analysis dzieli je 6,6 punktu — 82,6 wobec 76,0. Pod względem godzinowego kosztu audio mierzonego przez to samo zestawienie różnią się nieco ponad czterokrotnie.
Żadna z tych liczb nie jest liczbą, która powinna decydować o twojej architekturze. Liczbą, która powinna decydować, jest 38: różnica między nimi w τ-Voice, komponencie agentowego wykonywania zadań, gdzie wariant rozumujący rozwiązuje 68,6% replik scenariuszy obsługi klienta, a wariant standardowy rozwiązuje 30,1%. Nie wybierasz między dobrym modelem a lepszym. Wybierasz między interfejsem konwersacyjnym a systemem rozumującym, który akurat mówi, a różnica w cenie jest najmniej interesującym elementem tego wyboru.
Widełki cenowe, w jednostkach, w których faktycznie jesteś rozliczany
Zacznij od rachunku, bo to jest ta część, którą ludzie dobrze rozumieją, a potem przywiązują do niej zbyt dużą wagę. W przypadku obu modeli obowiązuje ta sama opublikowana stawka przez Live API: $0.005 za minutę wejścia audio i $0.018 za minutę wyjścia audio, a po stronie Extended Thinking te tokeny wyjściowe obejmują myślenie. Ta sama karta, te same stawki, brak osobnego poziomu premium dla rozumowania.
Rozbieżność ujawnia się, gdy mierzy się pracę, a nie minuty. Kolumna kosztu na godzinę wejściowego audio w Artificial Analysis — koszt ukończenia stałego, 40-pytaniowego podzbioru Big Bench Audio, znormalizowany do wartości godzinowej — umieszcza te dwa modele w całkowicie różnych przedziałach:
• Gemini 3.8 Live Extended Thinking (High) — 3,50 USD za godzinę dźwięku wejściowego, według własnego pomiaru Artificial Analysis
• Gemini 3.8 Live — 0,84 USD za godzinę, najniższa płatna stawka na tej tablicy
• GPT-Live-1 (Astra backend, średni wysiłek) — 5,83 USD za godzinę, więc wariant rozumowania wciąż jest tańszy od modelu, który przewyższa, o około 40%
• Grok Voice Think Fast 2.0 High — 4,80 USD za godzinę
• GPT-Realtime-2.1 High — 10,75 USD za godzinę
To jest to rozwidlenie: czterokrotność godzinowego kosztu audio przy tej samej publikowanej stawce za minutę, ponieważ wariant rozumujący zużywa więcej tokenów, wykonując tę samą ilość słuchania. 0,84 USD dla standardowego modelu nie jest zniżką — to dolna granica całej tabeli.
Co można kupić za 38 punktów
Rozłóż kompozyt na części, a dwa modele przestają wyglądać jak para:
• Indeks mowy na mowę — Gemini 3.8 Live Extended Thinking (High) 82,6 vs Gemini 3.8 Live 76,0
• Wydajność agentowa (ukończenie zadań τ-Voice) — 68,6% vs 30,1%
• Rozumowanie mowy (Big Bench Audio) — 98% vs 92%
• Dynamika konwersacji — 91,9% vs 96,1%
• Preferencja areny (Elo) — 990 vs 1083
• Wskaźnik pomyślnego wykonania zadania — 89,1% vs 93,2%
• Czas do pierwszego dźwięku — 1,35 s vs 1,18 s
• Koszt za godzinę wejściowego audio — $3.50 vs $0.84
Przeczytaj to uczciwie, a tańszy model wygrywa w czterech z ośmiu wierszy. Szybciej osiąga pierwszy dźwięk, jest preferowany przez arenę, częściej kończy płytkie zadanie i jest lepiej oceniany pod względem dynamiki konwersacyjnej — a ta ostatnia nie jest nagrodą pocieszenia, ponieważ to dynamikę konwersacyjną zauważa dzwoniący. Nie potrafi natomiast dokończyć zadania, które ma kroki. 31,1% wobec 68,6% to największa pojedyncza różnica w całym tym wydaniu i trafia na tę jedyną oś, która odróżnia agenta od interfejsu.
Dwa zastrzeżenia do tych wierszy. Wskaźnik preferencji areny w indeksie jest zamrożony w momencie, gdy model kwalifikuje się do publikacji, więc to migawka, a nie aktualizowane na bieżąco Elo — czytaj go jako ocenę z konkretnego punktu w czasie, a nie jako wykres Speech Agent Arena na żywo. A czołówka tablicy τ-Voice jest bardzo wyrównana: wariant rozumujący z wynikiem 68,6% wyprzedza GPT-Live-1 z 67,9% (backend Astra, średni wysiłek) o 0,7 punktu, a za nim plasują się GPT-Live-1 (Sol, niski wysiłek) z 59,3% i Grok Voice Think Fast 2.0 High z 56,5%. Przewaga 0,7 punktu nad GPT-Live-1 mieści się w granicach szumu. Różnica 38 punktów w obrębie tej pary już nie.

Drugie 4x: ile kosztuje cię poziom rozumowania w kodzie
W tym wydaniu jest drugi fork i nie pojawia się on na żadnej tablicy liderów. Te dwa modele nie są wymienne bezpośrednio, ponieważ wariant rozumujący zmienia kontrakt, którego musi przestrzegać Twój klient.
W modelu standardowym, Gemini 3.8 Livezachowuje się tak, jak oczekuje klient Live API: wywołania narzędzi i API w tle działają, gdy model nadal mówi, a turnComplete: truenadal oznacza koniec tury. Nie ma żadnego ustawienia poziomu myślenia do wyboru, ponieważ nie ma nic osobnego do skonfigurowania — model odpowiada, a gdy odpowie, tura się kończy.
W przypadku Gemini 3.8 Live Extended Thinking trzy rzeczy zmieniają się jednocześnie:
• Wywołania funkcji są zawsze asynchroniczne. Deklaracja blokującego narzędzia nie ustawia się grzecznie w kolejce — zwraca twardy błąd. Każdy schemat narzędzia, który napisałeś dla standardowego modelu, musi zostać ponownie zadeklarowany jako nieblokujący.
• Nowe pole statusu przenosi rzeczywisty stan. Klienci muszą odczytywać interaction_status zamiast ufać turnComplete: pole przyjmuje wartość IN_PROGRESS, gdy model wciąż rozumuje lub narzędzie wciąż działa, i ustala się na IDLE dopiero wtedy, gdy całe zadanie zostanie ukończone. Tura może się zakończyć, gdy zadanie jeszcze nie zostało ukończone.
• Głębokość myślenia to pokrętło. Model udostępnia konfigurowalne poziomy rozumowania — niski, średni i wysoki — a liczby 82,6 i 68,6 na tablicy to (Wysoka) konfiguracja. Przejście na niski zmienia zarówno jakość, jak i koszt tokenów, a nic na indeksie nie mówi, ile kosztuje Cię niski poziom w zakresie ukończenia zadania.
Ten trzeci punkt to pułapka migracji. Ponieważ Extended Thinking odpowiada w warstwie transmisji dokładnie tak samo jak model standardowy, dopóki nie pojawi się wywołanie narzędzia, zespół może podmienić identyfikator modelu, zobaczyć działające demo i dopiero na produkcji odkryć kontrakt asynchroniczny, gdy narzędzie do rezerwacji zwróci błąd zamiast wyniku. Zaplanuj budżet na refaktoryzację klienta obok 4× stawki za audio; w dojrzałej integracji to większy z tych dwóch kosztów.
Którego z nich faktycznie wymaga Twoje obciążenie?
Najprostszy sposób na podjęcie decyzji to zapytać, do czego ma służyć sesja, a nie jak inteligentna ma być.
Wybierz Gemini 3.8 Live, gdy rozmowa jest tym, co ma zostać dostarczone. Odpowiadanie, podtrzymywanie wątku, przyjmowanie wiadomości, wstępna kwalifikacja dzwoniącego, bycie miłym, szybkim i tanim. Przy $0,84 za godzinę wejściowego dźwięku to najtańszy kompetentny model głosowy, jaki ktokolwiek obecnie publikuje, jest preferowany przez arenę, jest bardziej niezawodny w płytkich zadaniach i jest o 170 milisekund szybszy do pierwszego dźwięku — różnicę, którą dzwoniący czuje. Trzeba zaakceptować jedno: pułap. 30,1% w realizacji zadań wieloetapowych oznacza, że nie dokończy pracy, która ma kroki, i żadna ilość inżynierii promptów nie zmieni tej liczby.
Wybierz Gemini 3.8 Live Extended Thinking, gdy sesja ma zadanie. Rezerwowanie, zmienianie, anulowanie, rozwiązywanie problemu z kontem, prowadzenie dzwoniącego przez wieloetapowy proces, gdy ten czeka. To linia 38 punktów i jest warta 3,50 dolara za godzinę — co, warto zauważyć, jest wciąż tańsze niż oba modele, które przewyższa pod względem wyniku złożonego. Otrzymujesz także zachowanie narracyjne, które czyni oczekiwanie znośnym: ten model rozumuje i mówi jednocześnie, więc zamiast ciszy, gdy czegoś szuka, dzwoniący słyszy „Pozwól, że to sprawdzę…” oraz informacje o postępach na bieżąco. To ten sam problem, który architektury pełnego dupleksu rozwiązują, nigdy nie zatrzymując dźwięku; odpowiedzią Google jest mówienie dalej w trakcie pracy.
Jeszcze dwa wiersze warte rozważenia. Google podaje również 35,1% dla modelu Extended Thinking w rankingu τ³-Banking firmy Sierra, wobec 32,0% dla GPT-Live-1 Astra — liczba raportowana przez dostawcę, za którą nie stoi żaden niezależny odczyt, i dająca do myślenia w ujęciu absolutnym, ponieważ 35,1% oznacza, że najlepszy model na tej tablicy ponosi porażkę w około dwóch z każdych trzech realistycznych prób wykonania zadania bankowego. A drugie miejsce modelu standardowego w Speech Agent Arena, które Google cytuje we własnych materiałach, to prawdziwy wynik na innej tablicy, mierzącej preferencje, a nie ukończenie zadania. Oba te stwierdzenia są prawdziwe. Razem mówią, że tani model bardzo dobrze sobie radzi jako rozmówca, a drogi model jest jedynym z tej dwójki, któremu można dać pracę.
Uruchamianie obu, bez dwóch integracji
Praktyczny zarzut wobec tego wszystkiego jest taki, że wybieranie indywidualnie dla każdego obciążenia oznacza utrzymywanie dwóch ścieżek. Nie musi tak być. Oba warianty stoją przed tą samą klasą backendu — wykonywanie narzędzi w tle i planowanie wieloetapowe sprowadzają się do zwykłych wywołań modelu tekstowego — a właśnie w tej warstwie tkwi zmienność twoich kosztów i w której przełączanie jest tanie.
OrcaRouter udostępnia 190 modeli z jednego klucza w cenie katalogowej dostawcy, bez marży, więc zmiana ceny przez dostawcę obowiązuje po naszej stronie tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy. W przypadku stosu, który kieruje ruch między tanią warstwą konwersacyjną a drogą warstwą rozumowania, liczą się dwie właściwości: cel delegacji można podmienić na ruchu produkcyjnym bez ingerencji w integrację głosową oraz to, że automatyczne przełączanie awaryjne podtrzymuje sesję, gdy backend zwróci błąd lub przekroczy limit czasu. Aby było jasne, co hostujemy, a czego nie: punkty końcowe Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking nie znajdują się w naszym routerze — pochodzą one z własnego API Google, w Gemini API, Live API i Google AI Studio. Modele tekstowe, którym ci agenci przekazują swoją pracę, bardzo często jednak znajdują się w naszym routerze — między innymi Gemini 3.8 Flash.
Gdzie każdy model znajduje się na planszy
Poniższy zrzut ekranu został wykonany 16 września 2026 r., a górna część Speech to Speech Index brzmi następująco:
• Gemini 3.8 Live Extended Thinking (High) — 82,6, pierwsze miejsce
• GPT-Live-1 (backend Astra, średni wysiłek) — 81,5
• Grok Voice Think Fast 2.0 High — 81.3
• GPT-Live-1 (backend Sol, niski wysiłek) — 80.1
• Gemini 3.8 Live — 76,0, piąte miejsce
• GPT-Realtime-2.1 High — 73.9
• Gemini 3.1 Flash Live High — 71.5
Jedna uwaga dotycząca nazewnictwa, gdy czytasz tę listę: (High) – przyrostek dołączony do tego modelu w materiałach to etykieta konfiguracji poziomu wysiłku rozumowania, a nie osobne wydanie. To ta sama konwencja, której redakcja używa w przypadku Grok Voice Think Fast 2.0 High i GPT-Realtime-2.1 High.

Co jest jeszcze niezatwierdzone?
Jedną rzecz dotyczącą tej pary łatwo jest błędnie odczytać, więc warto powiedzieć to wprost: żaden z tych modeli nie jest ogólnie dostępny w sensie umownym, mimo że oba mają ustaloną cenę i dokumentację.
Deweloperzy otrzymują Gemini 3.8 Live w Gemini API, Live API i Google AI Studio pod identyfikatorem gemini-3.8-live; przedsiębiorstwa otrzymują prywatny podgląd w Gemini Enterprise, a Gemini Enterprise for Customer Experience jest wymienione jako dostępne wkrótce; konsumenci otrzymują go w Search Live. Gemini 3.8 Live Extended Thinking ma ten sam zestaw możliwości dla deweloperów pod gemini-3.8-live-extended-thinking, a dodatkowo szerszą ścieżkę dla konsumentów — Gemini Live, Docs Live dla subskrybentów Google AI Pro i Ultra oraz Gmail Live i Keep Live dla wszystkich subskrybentów Google AI. Klienci biznesowi Workspace są wymienieni jako dostępni wkrótce.
Brakuje tego, czego przedsiębiorstwo potrzebuje, zanim oprze na tym linię przychodów: zobowiązania dotyczącego ogólnej dostępności, opublikowanego wskaźnika czasu działania i stawki, którą Google obiecało utrzymać. Ceny są publikowane, a ceny w wersji zapoznawczej mają zwyczaj się zmieniać. Twórz prototyp już teraz, planuj migrację i nie podpisuj celu dostępności, którego ci nie podano.

Decyzja, którą ta dwójka faktycznie przedstawia, jest węższa, niż sugeruje indeks, i nie jest drabiną jakości. Jeśli zadaniem twojego agenta jest rozmowa, tani model nie jest kompromisem — to lepszy produkt w niższej cenie, a czterokrotnie niższa stawka jest bonusem, a nie argumentem. Jeśli zadaniem twojego agenta jest coś ukończyć, wariant rozumujący jest jedynym z tej dwójki, któremu w ogóle można zlecić to zadanie, a 3,50 dolara za godzinę to błąd zaokrąglenia wobec rezerwacji, która w przeciwnym razie się nie uda. Błędem, którego należy unikać, jest szukanie kompromisu: płacenie za głębię rozumowania przy obciążeniu, które zawsze potrzebowało tylko dobrej rozmowy — co zdarza się, gdy zespół czyta o 6,6-punktowej luce w wyniku zbiorczym i nigdy nie przewija w dół do 38.
