Gemini 3.5 Transcribe Live a Gemini 3.5 Transcribe — który endpoint powinna wywoływać Twoja aplikacja. Zregenerowana ilustracja.
Guides & Insights

Gemini 3.5 Transcribe Live a Gemini 3.5 Transcribe: który endpoint powinna wywołać Twoja aplikacja

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Kiedy Go​ogle wypuściło rodzinę Ge​mini 3.5 Transcribe 26 sierpnia 2026 roku, wydało dwa modele, które mają wspólną nazwę i misję, ale są zbudowane z myślą o różnych etapach rozmowy: Ge​mini 3.5 Transcribe Live — końcówkę strumieniową udostępnianą przez Live API — oraz Ge​mini 3.5 Transcribe — końcówkę do nagrań wcześniej przygotowanych, serwowaną przez Interactions API. Błędem, jaki większość zespołów popełnia w pierwszym tygodniu, jest traktowanie tego jako jednego modelu z dwoma przyciskami. To dwa SKU — inne API, inne ceny, inne twarde limity — a porównanie dokładności między nimi nie jest uczciwą walką, bo mierzy się je według różnych zasad. Ten artykuł zestawia oba rozwiązania obok siebie, żeby decyzja zależała od Twojego obciążenia pracą, a nie od listy rankingowej.

Te dwa na pierwszy rzut oka

• API — Ge​mini 3.5 Transcribe Live działa na Live API (WebSocket, przesyłanie strumieniowe dwukierunkowe), a Ge​mini 3.5 Transcribe na Interactions API (plik na wejściu, transkrypcja na wyjściu).

• Zadania — rozmowy na żywo, napisy, agenci głosowi a spotkania, rejestry połączeń, archiwalne audio.

• Dokładność — 4,0% WER streaming vs 2,6% WER non-streaming, według Artificial Analysis, cytowane przez Google; różne tryby pomiaru, nie wprost porównywalne.

• Opóźnienie — końcowy transkrypt 0,40 s po zakończeniu mowy w porównaniu z przetwarzaniem wsadowym całego pliku.

• Sesja — limit 10 minut na sesję na żywo w porównaniu z plikami do 60 minut (30 minut przy włączonej diaryzacji i znacznikach czasowych).

• Mówcy — brak po stronie strumieniowej w porównaniu z maksymalnie trzema mówcami ze znacznikami czasowymi na poziomie słów po stronie nagrań wcześniej zarejestrowanych.

• Cena — około $0,009 za minutę średnio w porównaniu z około $0,005 za minutę średnio.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe - the scoreboard'. Left column Gemini 3.5 Transcribe Live: API Live API streaming, WER 4.0% streaming, Final latency 0.40s after speech, Session 10-minute cap, Speaker ID not supported, Timestamps none. Right column Gemini 3.5 Transcribe: API Interactions API files, WER 2.6% non-streaming, Final latency batch async, Session 60-minute files (30 with diarization), Speaker ID up to 3 speakers, Timestamps word-level. Footer reads 'WER per Artificial Analysis, cited by Google; limits per Google launch materials.'

Decyzja architektoniczna: Interactions API czy Live API

Oba modele należą do rodziny Gemini Audio od Go​ogle i oba są w publicznej wersji zapoznawczej. Różnica zaczyna się na poziomie transportu. gemini-3-5-transcribe-live otwiera WebSocket i utrzymuje go otwartym: surowe audio jest przesyłane strumieniowo w sposób ciągły — typowa ramka to 16 kHz lub 24 kHz, 16-bitowe fragmenty PCM — a model zwraca częściowe transkrypcje podczas mówienia, a następnie końcową transkrypcję dla każdej wypowiedzi, gdy mowa się kończy. gemini-3-5-transcribe przyjmuje kompletny plik, przetwarza go i zwraca gotową transkrypcję z przypisaniem mówców i znacznikami czasowymi na poziomie słów.

Decyzja o transporcie determinuje wszystko inne. Jeśli Twój produkt renderuje słowa w miarę ich wypowiadania — napisy na żywo, agent głosowy odczytujący intencję w środku zdania, asystent połączeń działający podczas trwającego połączenia — jesteś na ścieżce Live. Jeśli Twój produkt tworzy zapis — notatkę ze spotkania, log połączeń, archiwum — jesteś na ścieżce Interactions. Zamieszanie wynika z tego, że oba rozwiązania generują tekst; różnica polega na tym, czy tekst jest stanem w czasie rzeczywistym, czy końcowym artefaktem.

Dokładność: podatek streamingowy jest realny

Artificial Analysis, niezależna organizacja benchmarkowa, na której liczby powołuje się Go​ogle we wpisie ogłaszającym premierę, mierzy średni współczynnik błędów słownych na poziomie 4,0% dla wariantu strumieniowego i 2,6% dla niestrumieniowego. W wielojęzycznym benchmarku FLEURS Go​ogle podaje 5,50% dla wariantu strumieniowego wobec 5,04% dla niestrumieniowego. Wartość 2,6% plasuje Ge​mini 3.5 Transcribe na 5. miejscu listy rankingowej WER prowadzonej przez AA w momencie premiery, za ElevenLabs Scribe v2 (2,2%) i Microsoft MAI-Transcribe-1.5 (2,4%) — to są pomiary AA, a nie deklaracje Go​ogle.

Numer strumieniowy nie jest gorszą wersją tego samego testu. To inny reżim: model zobowiązuje się do słów, zanim usłyszy koniec zdania, i ponosi tego koszty. Nie wybieraj między tymi dwoma na podstawie samej dokładności, ponieważ w przypadku każdego konkretnego obciążenia różnica może się odwrócić. Wybieraj na podstawie ograniczeń: punkt końcowy strumieniowy ma limit sesji wynoszący 10 minut, nie oferuje diarizacji mówców ani znaczników czasowych; punkt końcowy do nagrań z góry obsługuje pliki trwające godzinę, przypisuje wypowiedzi maksymalnie trzem mówcom i zwraca znaczniki czasowe na poziomie słów. Jeśli Twoja aplikacja potrzebuje etykiet mówców, model strumieniowy po prostu nie jest w stanie wykonać tego zadania, niezależnie od swojego WER.

A screenshot of the Artificial Analysis speech-to-text leaderboard page showing the WER Index (Non-streaming) view with model rows including an entry for Gemini 3.5 Transcribe alongside ElevenLabs and Deepgram, plus AA-WER Index dataset filters, captured August 27 2026.

Co ich łączy

Oba punkty końcowe współdzielą silnik „inteligentnej transkrypcji”, a w przypadku wspólnych funkcji wybór między nimi jest neutralny:

• 85+ języków z automatycznym wykrywaniem, w tym przełączanie języka w trakcie transmisji na ścieżce Live.

• Oczyszczanie niepłynności — wypełniacze usuwane, samokorekty rozwiązywane („wtorek — nie, środa" zostaje zapisane jako skorygowany dzień).

• Automatyczne formatowanie — interpunkcja, wielkość liter i struktura akapitów zastosowane do wyniku.

• Własne słownictwo — do 1000 terminów na żargon i nazwy produktów, przy czym dokumentacja Google zaleca około 100 dla najlepszych wyników.

Jedno zastrzeżenie dotyczące obu: „inteligentne” czyszczenie, które sprawia, że wynik jest czytelny, to decyzja projektowa odbywająca się kosztem wierności dosłownej. Niezgrabne sformułowania są wygładzane; tekst jest odczytaniem intencji przez model, a nie zapisem sądowym. Do dokładnych transkrypcji potrzebna będzie opcja dosłowna tam, gdzie jest dostępna, a w obu przypadkach warto zweryfikować działanie na własnym nagraniu.

Koszt za minutę: premium na żywo

Go​ogle wycenia audio w tokenach: 25 tokenów audio na sekundę, z wyjściem około 175 tokenów tekstu na minutę transkryptu. Przy cenach katalogowych łączny koszt minuty audio wynosi około 0,005 USD dla gemini-3-5-transcribe i około 0,009 USD dla gemini-3-5-transcribe-live — wejście po 2 USD wobec 3,50 USD za milion tokenów, wyjście po 12 USD wobec 21 USD za milion tokenów. Obie usługi mają obecnie darmowy poziom.

Dopłata daje ścieżkę czasu rzeczywistego, a nie większą dokładność: płacisz około 80% więcej za minutę za streamingowy endpoint, a transkrybuje on z wyższym WER. To jest uczciwe ujęcie. Model transkrypcji nagrań jest zarówno tańszy, jak i dokładniejszy; model streamingowy istnieje, ponieważ niektóre produkty nie mogą czekać na zakończenie pliku.

Na którym endpointzie powinieneś budować

Napisy i podtytuły na żywo — Ge​mini 3.5 Transcribe Live, i sprawdź limit bez znaczników czasu, jeśli potrzebujesz wyjścia zsynchronizowanego z czasem.

• Agenci głosowi — Ge​mini 3.5 Transcribe Live do wykrywania intencji w trakcie zdania; planuj z uwzględnieniem 10-minutowego limitu dla długich sesji.

• Spotkania, wywiady, archiwizacja — Ge​mini 3.5 Transcribe, z 2,6% WER, przypisywaniem mówców i znacznikami czasowymi na poziomie słów.

• Analiza po rozmowie — Ge​mini 3.5 Transcribe dla gotowego zapisu; Ge​mini 3.5 Transcribe Live tylko wtedy, gdy analiza musi być przeprowadzona w trakcie rozmowy.

• Długie ciągłe audio — Ge​mini 3.5 Transcribe, ponieważ 60-minutowy plik bije na głowę ręczne sklejanie dziesięciominutowych sesji na żywo.

A generated decision card titled 'Which endpoint - by workload' with a left column headed 'Pick Transcribe Live if' listing live captions, voice agents reading intent mid-sentence, and in-call analytics, and a right column headed 'Pick Transcribe if' listing meetings and interviews, call logs needing speaker labels, word-level timestamps for alignment, and long continuous audio, a footer reading 'Both are Google APIs in public preview since Aug 26 2026', and the OrcaRouter logo in the bottom-right corner.

Warstwa nad transkryptem

Żaden z tych modeli nie jest hostowany przez OrcaRouter — obecnie nie routujemy zamiany mowy na tekst, a dla każdego punktu końcowego będziesz wywoływać API Go​ogle bezpośrednio. Warstwa routingu w potoku głosowym działa na poziomie powyżej transkryptu: streszczacz, ekstraktor encji, model pozycji działań, który zamienia strumień w decyzję. To w tej warstwie OrcaRouter zarabia na siebie — jedno API dla ponad 200 modeli w cenie katalogowej dostawcy bez narzutów, automatyczny failover między dostawcami oraz DSL routingu, który komponuje kilka modeli w jedno wywołanie. Wybierz punkt końcowy transkrypcji w zależności od obciążenia, a następnie uruchom model, który czyta transkrypt pod jednym kluczem.

Sedno sprawy

Ge​mini 3.5 Transcribe Live i Ge​mini 3.5 Transcribe to ta sama rodzina, ale różne produkty. Wybierz Live, gdy transkrypt musi powstać przed zakończeniem rozmowy i akceptujesz 10-minutową sesję, brak etykiet mówców i brak znaczników czasu. Wybierz Transcribe, gdy wynik ma być zapisem, a dokładność i atrybucja są ważniejsze niż szybkość — jest tańszy, dokładniejszy i znacznie mniej ograniczony. Jedynym błędem jest założenie, że jeden endpoint obsługuje oba przypadki.