Wygenerowana karta hero zatytułowana Gemini 3.8 Live z pogrubioną plakietką NIEZWERYFIKOWANE, podtytuł 'Dwa nieopublikowane slugi głosowe na stronie limitu Google Cloud – co wiemy do tej pory', chipsy o treści 'Źródło: X/@testingcatalog', '15 września 2026' i 'Niepubliczny – brak karty modelu', trzy karty o treści 'Zgłoszony slug: Gemini 3.8 Live', 'Zgłoszony slug: Live Extended Thinking' i 'Dzisiejsza linia live: gemini-3.1-flash-live-preview, marzec 2026', oraz stopka 'Oba slugi niezweryfikowane – Google nie potwierdziło żadnego z nich.'
Guides & Insights

Gemini 3.8 Live Leak: Dwa nowe identyfikatory głosowe i dlaczego „Live Extended Thinking” ma większe znaczenie

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwa ciągi znaków, które nie pojawiają się w żadnej opublikowanej dokumentacji, pojawiły się w tym tygodniu na stronie limitów GCP: Gemini 3.8 Live, i coś o nazwie Live Extended Thinking. Zostały zauważone przez konto śledzące wydania @testingcatalog i opublikowane 15 września, z wyraźnym zastrzeżeniem, że żaden z nich nie jest publiczny. To jak dotąd cały publiczny zapis — brak karty modelu, brak informacji o cenie, brak wpisu w dzienniku zmian API, brak potwierdzenia. Ale te dwie nazwy znajdują się na końcu bardzo czytelnego ciągu. Gemini 3.1 Flash Live jest wciąż modelem, który własna dokumentacja firmy zaleca do pracy z Live API, Gemini 3.5 Live i Gemini 3.5 Live Experimental pojawiły się 26 sierpnia jako rodzina Gemini Audio, a część tekstowa tej samej rodziny — Gemini 3.8 Flash — jest udostępniana od 2 września. "3.8 Live" zamknąłby tę lukę. Drugi slug jest ciekawszy z tych dwóch.

Najpierw oznaczenia, bo materiał o przecieku żyje lub umiera dzięki nim. To nie jest premiera. Żaden z tych slugów nie został ogłoszony, udokumentowany, wyceniony ani potwierdzony przez Google, a źródłem jest pojedyncze konto śledzące wydania. Wszystko poniżej, co dotyczy konkretnie Gemini 3.8 Live i Live Extended Thinking, jest niezweryfikowane. Wszystko poniżej o modelach już dostępnych — Gemini 3.1 Flash Live, Gemini 3.5 Live, Gemini 3.8 Flash — jest udokumentowane i możliwe do sprawdzenia, a w całym tekście oznaczyłem, co jest czym.

Co mówi sygnał, a czego nie

• Zgłoszono — dwa slugi, „Gemini 3.8 Live” i „Live Extended Thinking”, pojawiające się na stronie przydziałów Google Cloud, opublikowane 15 września z adnotacją, że są „niepubliczne”

• Nie podano — ogłoszenia, karty modelu, ceny, okna kontekstowego, daty wydania, identyfikatora API, żadnego wyniku benchmarku ani żadnego potwierdzenia od Google

• Potwierdzenie — brak na chwilę obecną. Strona modeli Gemini API firmy Google, ostatnio zaktualizowana 4 września, wymienia dokładnie dwa konwersacyjne modele Live, gemini-3.1-flash-live-preview i gemini-3.5-live-translate-preview, a żaden z nich nie ma wariantu „Live Extended Thinking”

• Ten sam brief, osobne twierdzenie — ten sam wpis z 15 września prognozował również, że Grok 4.7 „powinien trafić w okolice Opus 5.0, a nie 5.1”, a jego prace multimodalne „wciąż wymagają dopracowania”. To model innego dostawcy i prognoza, a nie artefakt; wspomniano o tym tutaj wyłącznie dla kompletności źródła

• Już sama nazwa na to wskazuje — wpisy limitów w Google Cloud dotyczą SKU poszczególnych modeli, co przemawia za płatnym modelem API, a nie funkcją wewnątrz konsumenckiej aplikacji Gemini. To wniosek wyciągnięty z miejsca, w którym pojawił się ten ciąg, a nie potwierdzony fakt.

A generated six-row scoreboard titled 'Gemini 3.8 Live - the scoreboard', rows reading 'Status: leak - quota page only, not public', 'Reported slugs: Gemini 3.8 Live + Live Extended Thinking', 'Live line today: gemini-3.1-flash-live-preview, March 2026', 'Thinking control: thinkingLevel minimal/low/medium/high', 'Text sibling: Gemini 3.8 Flash, shipped Sept 2', 'Independent score: none - nothing to test', with the footer 'Gemini 3.8 Live and Live Extended Thinking unverified; Live-line details per Google's Gemini API docs.'

Dlaczego strona z limitem jest miejscem, w którym model wycieka jako pierwszy

To jest część warta zrozumienia, ponieważ wyjaśnia, dlaczego dwuwyrazowy artefakt zasługuje na cały artykuł. Strony limitów nie są miejscami do działań marketingowych. Stanowią infrastrukturę rozliczeń i limitów tempa: każdy model, który klient Cloud może wywołać, potrzebuje wpisu limitu dla projektu, zanim zostanie obsłużone pierwsze płatne żądanie, a te wpisy są tworzone przez tę samą pracę inżynierską, która przygotowuje model do ogólnej dostępności. Pojawienie się tam sluga oznacza, że ktoś zbudował zaplecze techniczne dla SKU — a nie że ktoś przygotował szkic komunikatu prasowego.

To działa w obie strony, a uczciwa interpretacja skłania się ku ostrożności. Wpis dotyczący limitu jest bardziej zaawansowany niż nazwa kodowa w artykule naukowym, ponieważ sugeruje zamierzony interfejs dla klienta. Jest to także dokładnie ten rodzaj rzeczy, który powstaje, jest testowany i po cichu przemianowywany przed premierą. Strona tekstowa tej rodziny rozwijała się wystarczająco szybko, by to unaocznić: Gemini 3.6 Flash pojawił się 21 lipca, Gemini 3.7 Flash 13 sierpnia, a Gemini 3.8 Flash 2 września — trzy wydania Flash w sześć tygodni. Linia modeli iterująca tak szybko to linia, która przygotowuje więcej SKU, niż wypuszcza pod tymi nazwami.

Linia Live przez cały czas pozostawała o jedną wersję w tyle

Oto, co sprawia, że „Gemini 3.8 Live” to prawdziwa historia, a nie ciekawostka nazewnicza: modele głosowe Google wcale nie nadążały za jego modelami tekstowymi.

• Zalecany obecnie model Live API — gemini-3.1-flash-live-preview, najnowsza aktualizacja: marzec 2026, w dokumentacji Google nadal opisywany jako model do stosowania we wszystkich przypadkach użycia Live API

• Jego limity — 131 072 tokenów wejściowych i 65 536 tokenów wyjściowych; przyjmuje tekst, obrazy, audio i wideo, a zwraca tekst i audio

• Rodzina Gemini Audio, ogłoszona 26 sierpnia — Gemini 3.5 Live, Gemini 3.5 Live Experimental i Gemini 3.5 Transcribe, przy czym modele Transcribe zastępują Chirp 3 w zakresie zamiany mowy na tekst

• Tymczasem linia tekstowa — Gemini 3.5 Flash, Gemini 3.6 Flash, Gemini 3.7 Flash i Gemini 3.8 Flash — przeszła przez cztery publiczne wersje w mniej więcej tym samym oknie czasowym

A screenshot of Google's Gemini API documentation page for gemini-3.1-flash-live-preview, captured September 15, 2026, showing the banner 'Gemini 3.8 Flash is now available', the heading 'Gemini 3.1 Flash Live preview' described as a low-latency audio-to-audio model, model code gemini-3.1-flash-live-preview, supported data types text/images/audio/video in and text and audio out, an input token limit of 131,072 and an output token limit of 65,536, and capability chips including Live API Supported and Thinking Supported.

Więc linia audio znajduje się na generacji 3.5, podczas gdy linia tekstowa jest na 3.8. Slug „Gemini 3.8 Live” to pierwszy dowód na to, że Google zamierza przywrócić głos do tej samej generacji co tekst — co dla każdego, kto buduje agenta głosowego, oznacza, że rozumowanie leżące u podstaw sesji Live mogłoby przeskoczyć naraz o trzy generacje modelu tekstowego, a nie o jedną.

Dlaczego "Live Extended Thinking" to ciekawszy slug

Dziś myślenie w modelu Gemini Live to pokrętło, a nie model. Live API udostępnia thinkingLevel jako parametr z czterema ustawieniami — minimal, low, medium i high — a domyślne to minimal, wybrane celowo, aby zoptymalizować pod kątem najniższego opóźnienia. Ta wartość domyślna mówi, do czego służy produkt: rozmowa, w której pauza to błąd.

Osobny slug o nazwie „Live Extended Thinking” sugeruje, że Google przygotowuje się do rozdzielenia tego na dwa produkty, a nie jedno pokrętło, a uzasadnienie jest proste. Latencja i namysł są w bezpośrednim konflikcie w modelu głosowym — nie można jednocześnie odpowiadać natychmiast i głęboko się zastanawiać przed odpowiedzią — więc pojedynczy model z przełącznikiem zmusza każdego wywołującego do wybrania jednego punktu na tej linii dla każdego żądania. Dwa SKU pozwalają klientowi skierować szybką ścieżkę (obsługa przerwań, barge-in, szybkie wyszukiwania) i wolną ścieżkę (agent głosowy wykonujący zadanie wieloetapowe) do odmiennie dostrojonych punktów końcowych, bez pogarszania jednej przez drugą.

Precedens już istnieje w samej sierpniowej premierze Google. Gemini 3.5 Live Experimental został opisany jako wariant, który potrafi „rozumować bezpośrednio podczas mówienia” i krok po kroku relacjonować swoje postępy w trakcie zadania — model głosowy jednoznacznie zabarwiony myśleniem, wydany pod własnym identyfikatorem, a nie jako ustawienie. „Live Extended Thinking” brzmi jak ten instynkt, który awansuje z etykiety eksperymentalnej do nazwanego produktu. To wnioskowanie z ciągu znaków i to jest wnioskowanie — ale takie, które ta konkretna linia już wcześniej nagradzała.

Co można dziś faktycznie nazwać

Nic tutaj nie zmienia tego, do czego możesz uzyskać dostęp w tej chwili, i warto powiedzieć to wprost. Nie istnieje żaden punkt końcowy Gemini 3.8 Live, który można by wywołać, żadne ustawienie Live Extended Thinking, które można by włączyć, ani sposób na kupienie dostępu do któregokolwiek z nich. Każde konto, które dziś sprzedaje „dostęp do Gemini 3.8 Live”, sprzedaje etykietę, a nie model. Modele Live, z których naprawdę możesz korzystać, to gemini-3.1-flash-live-preview i gemini-3.5-live-translate-preview, oba w wersji zapoznawczej za pośrednictwem własnego API Google.

Strona tekstowa to zupełnie inny obraz, i to właśnie ta część, która faktycznie podlega routingowi. Gemini 3.8 Flash — wydany 2 września w cenie 0,75 USD za milion tokenów wejściowych i 3,75 USD za milion tokenów wyjściowych według własnego cennika Google, z zaplanowanym podwojeniem do 1,50 USD i 7,50 USD 1 stycznia 2027 r. — działa w OrcaRouter w tej samej cenie katalogowej, bez doliczania marży. Cennik typu pass-through ma większe znaczenie niż zwykle w przypadku modelu z zapowiedzianym wcześniej wzrostem cen: gdy styczniowa stawka wejdzie w życie, tutaj zmieni się tego samego dnia, bez drugiej umowy do renegocjacji i bez konieczności zmiany kodu.

The OrcaRouter model page for google/gemini-3.8-flash, showing the Google vendor name and the 2026-09-02 date, a 1M-token context window, 65K max output, text, image, video, file and audio input with text output, a p50 time-to-first-token of 3.46s, and pricing of $0.75 per 1M input tokens and $3.75 per 1M output tokens.

Linia głosowa nie jest dziś dostępna w OrcaRouter — żaden SKU Live ani native-audio nie jest dostępny, od żadnego dostawcy — więc nic tutaj nie powinno być odczytywane jako to, że ją hostujemy. To, do czego warstwa routingu naprawdę się przydaje, to druga połowa tej historii. Kiedy pojawi się model Live generacji 3.8, a obok niego pojawi się drugi, nastawiony na myślenie wariant, wybór między szybką ścieżką głosową a rozważającą staje się decyzją routingową, a nie przepisaniem: dwa endpointy za jednym kluczem, z automatycznym przełączaniem awaryjnym, jeśli identyfikator preview, pod który budowałeś, zostanie wycofany. W przypadku linii, która już raz w tym roku zmieniła nazwę, to nie jest hipoteza.

Co by to potwierdziło — a co by to unicestwiło

Materiał oparty na przecieku powinien mówić, w jaki sposób może się mylić. W przypadku Gemini 3.8 Live i Live Extended Thinking dowody potwierdzające są konkretne i weryfikowalne:

• Wpis limitu staje się publiczny — ten sam slug pojawia się na liście modeli Google Cloud lub Vertex AI z przypisanym limitem szybkości, a nie tylko na zrzucie ekranu

• Wpis w dzienniku zmian interfejsu Gemini API lub wiersz na stronie modeli, który obecnie kończy się na gemini-3.1-flash-live-preview i gemini-3.5-live-translate-preview

• Karta modelu DeepMind — sierpniowe modele audio zostały tam udokumentowane jako „Gemini 3.5 Audio”, mimo że w doniesieniach nazywano je Live i Transcribe, więc to karta jest artefaktem, który rozstrzyga nazwę.

• Wiersz cenowy — jedyna rzecz, która zamienia SKU w wersji roboczej w produkt, który ktoś może kupić

• Zaprzeczenie — slugi zostają przemianowane, włączone do ustawień myślenia istniejącego modelu albo po prostu już się nie pojawiają. Wszystkie trzy to zwyczajne wyniki dla strony z limitem, a każdy z nich oznacza, że ten tekst był przedwczesny, a nie trafny.

Na co uważać i kto powinien działać

Jeśli budujesz agenta głosowego na Live API, w tym tygodniu nic w twojej architekturze nie musi się zmieniać — model, na którym byś budował, to nadal gemini-3.1-flash-live-preview, a szczera rada jest taka, żeby trzymać identyfikator modelu jako wartość konfiguracji i utrzymywać drugi endpoint Live w gotowości, ponieważ ta linia już raz zmieniła nazwę i może zrobić to ponownie. Jeśli wybierasz model tekstowy, ten przeciek jest dla ciebie nieistotny; Gemini 3.8 Flash jest już dostępny, wyceniony i mierzalny, a bardziej przydatnym pytaniem jest styczniowa zmiana ceny, a nie slug głosowy.

To, na co naprawdę warto patrzeć, to nie premiera. Chodzi o to, czy „Live Extended Thinking” pojawi się jako drugi model, czy jako piąte ustawienie w pierwszym z nich. Jeśli to osobny SKU, Google mówi deweloperom, że agent głosowy, który myśli, i agent głosowy, który mówi, to różne produkty — a to twierdzenie o większych konsekwencjach niż jakikolwiek numer wersji w nazwie.

To, warstwa routingu jest naprawdę przydatna, to druga połowa tej historii.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie