
Gemini 3.5 Transcribe Live a Gemini 3.5 Transcribe: który endpoint powinna wywołać Twoja aplikacja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Inteligencja49Kod
Kiedy Google wypuściło rodzinę Gemini 3.5 Transcribe 26 sierpnia 2026 roku, wydało dwa modele, które mają wspólną nazwę i misję, ale są zbudowane z myślą o różnych etapach rozmowy: Gemini 3.5 Transcribe Live — końcówkę strumieniową udostępnianą przez Live API — oraz Gemini 3.5 Transcribe — końcówkę do nagrań wcześniej przygotowanych, serwowaną przez Interactions API. Błędem, jaki większość zespołów popełnia w pierwszym tygodniu, jest traktowanie tego jako jednego modelu z dwoma przyciskami. To dwa SKU — inne API, inne ceny, inne twarde limity — a porównanie dokładności między nimi nie jest uczciwą walką, bo mierzy się je według różnych zasad. Ten artykuł zestawia oba rozwiązania obok siebie, żeby decyzja zależała od Twojego obciążenia pracą, a nie od listy rankingowej.
Te dwa na pierwszy rzut oka
• API — Gemini 3.5 Transcribe Live działa na Live API (WebSocket, przesyłanie strumieniowe dwukierunkowe), a Gemini 3.5 Transcribe na Interactions API (plik na wejściu, transkrypcja na wyjściu).
• Zadania — rozmowy na żywo, napisy, agenci głosowi a spotkania, rejestry połączeń, archiwalne audio.
• Dokładność — 4,0% WER streaming vs 2,6% WER non-streaming, według Artificial Analysis, cytowane przez Google; różne tryby pomiaru, nie wprost porównywalne.
• Opóźnienie — końcowy transkrypt 0,40 s po zakończeniu mowy w porównaniu z przetwarzaniem wsadowym całego pliku.
• Sesja — limit 10 minut na sesję na żywo w porównaniu z plikami do 60 minut (30 minut przy włączonej diaryzacji i znacznikach czasowych).
• Mówcy — brak po stronie strumieniowej w porównaniu z maksymalnie trzema mówcami ze znacznikami czasowymi na poziomie słów po stronie nagrań wcześniej zarejestrowanych.
• Cena — około $0,009 za minutę średnio w porównaniu z około $0,005 za minutę średnio.

Decyzja architektoniczna: Interactions API czy Live API
Oba modele należą do rodziny Gemini Audio od Google i oba są w publicznej wersji zapoznawczej. Różnica zaczyna się na poziomie transportu. gemini-3-5-transcribe-live otwiera WebSocket i utrzymuje go otwartym: surowe audio jest przesyłane strumieniowo w sposób ciągły — typowa ramka to 16 kHz lub 24 kHz, 16-bitowe fragmenty PCM — a model zwraca częściowe transkrypcje podczas mówienia, a następnie końcową transkrypcję dla każdej wypowiedzi, gdy mowa się kończy. gemini-3-5-transcribe przyjmuje kompletny plik, przetwarza go i zwraca gotową transkrypcję z przypisaniem mówców i znacznikami czasowymi na poziomie słów.
Decyzja o transporcie determinuje wszystko inne. Jeśli Twój produkt renderuje słowa w miarę ich wypowiadania — napisy na żywo, agent głosowy odczytujący intencję w środku zdania, asystent połączeń działający podczas trwającego połączenia — jesteś na ścieżce Live. Jeśli Twój produkt tworzy zapis — notatkę ze spotkania, log połączeń, archiwum — jesteś na ścieżce Interactions. Zamieszanie wynika z tego, że oba rozwiązania generują tekst; różnica polega na tym, czy tekst jest stanem w czasie rzeczywistym, czy końcowym artefaktem.
Dokładność: podatek streamingowy jest realny
Artificial Analysis, niezależna organizacja benchmarkowa, na której liczby powołuje się Google we wpisie ogłaszającym premierę, mierzy średni współczynnik błędów słownych na poziomie 4,0% dla wariantu strumieniowego i 2,6% dla niestrumieniowego. W wielojęzycznym benchmarku FLEURS Google podaje 5,50% dla wariantu strumieniowego wobec 5,04% dla niestrumieniowego. Wartość 2,6% plasuje Gemini 3.5 Transcribe na 5. miejscu listy rankingowej WER prowadzonej przez AA w momencie premiery, za ElevenLabs Scribe v2 (2,2%) i Microsoft MAI-Transcribe-1.5 (2,4%) — to są pomiary AA, a nie deklaracje Google.
Numer strumieniowy nie jest gorszą wersją tego samego testu. To inny reżim: model zobowiązuje się do słów, zanim usłyszy koniec zdania, i ponosi tego koszty. Nie wybieraj między tymi dwoma na podstawie samej dokładności, ponieważ w przypadku każdego konkretnego obciążenia różnica może się odwrócić. Wybieraj na podstawie ograniczeń: punkt końcowy strumieniowy ma limit sesji wynoszący 10 minut, nie oferuje diarizacji mówców ani znaczników czasowych; punkt końcowy do nagrań z góry obsługuje pliki trwające godzinę, przypisuje wypowiedzi maksymalnie trzem mówcom i zwraca znaczniki czasowe na poziomie słów. Jeśli Twoja aplikacja potrzebuje etykiet mówców, model strumieniowy po prostu nie jest w stanie wykonać tego zadania, niezależnie od swojego WER.

Co ich łączy
Oba punkty końcowe współdzielą silnik „inteligentnej transkrypcji”, a w przypadku wspólnych funkcji wybór między nimi jest neutralny:
• 85+ języków z automatycznym wykrywaniem, w tym przełączanie języka w trakcie transmisji na ścieżce Live.
• Oczyszczanie niepłynności — wypełniacze usuwane, samokorekty rozwiązywane („wtorek — nie, środa" zostaje zapisane jako skorygowany dzień).
• Automatyczne formatowanie — interpunkcja, wielkość liter i struktura akapitów zastosowane do wyniku.
• Własne słownictwo — do 1000 terminów na żargon i nazwy produktów, przy czym dokumentacja Google zaleca około 100 dla najlepszych wyników.
Jedno zastrzeżenie dotyczące obu: „inteligentne” czyszczenie, które sprawia, że wynik jest czytelny, to decyzja projektowa odbywająca się kosztem wierności dosłownej. Niezgrabne sformułowania są wygładzane; tekst jest odczytaniem intencji przez model, a nie zapisem sądowym. Do dokładnych transkrypcji potrzebna będzie opcja dosłowna tam, gdzie jest dostępna, a w obu przypadkach warto zweryfikować działanie na własnym nagraniu.
Koszt za minutę: premium na żywo
Google wycenia audio w tokenach: 25 tokenów audio na sekundę, z wyjściem około 175 tokenów tekstu na minutę transkryptu. Przy cenach katalogowych łączny koszt minuty audio wynosi około 0,005 USD dla gemini-3-5-transcribe i około 0,009 USD dla gemini-3-5-transcribe-live — wejście po 2 USD wobec 3,50 USD za milion tokenów, wyjście po 12 USD wobec 21 USD za milion tokenów. Obie usługi mają obecnie darmowy poziom.
Dopłata daje ścieżkę czasu rzeczywistego, a nie większą dokładność: płacisz około 80% więcej za minutę za streamingowy endpoint, a transkrybuje on z wyższym WER. To jest uczciwe ujęcie. Model transkrypcji nagrań jest zarówno tańszy, jak i dokładniejszy; model streamingowy istnieje, ponieważ niektóre produkty nie mogą czekać na zakończenie pliku.
Na którym endpointzie powinieneś budować
Napisy i podtytuły na żywo — Gemini 3.5 Transcribe Live, i sprawdź limit bez znaczników czasu, jeśli potrzebujesz wyjścia zsynchronizowanego z czasem.
• Agenci głosowi — Gemini 3.5 Transcribe Live do wykrywania intencji w trakcie zdania; planuj z uwzględnieniem 10-minutowego limitu dla długich sesji.
• Spotkania, wywiady, archiwizacja — Gemini 3.5 Transcribe, z 2,6% WER, przypisywaniem mówców i znacznikami czasowymi na poziomie słów.
• Analiza po rozmowie — Gemini 3.5 Transcribe dla gotowego zapisu; Gemini 3.5 Transcribe Live tylko wtedy, gdy analiza musi być przeprowadzona w trakcie rozmowy.
• Długie ciągłe audio — Gemini 3.5 Transcribe, ponieważ 60-minutowy plik bije na głowę ręczne sklejanie dziesięciominutowych sesji na żywo.

Warstwa nad transkryptem
Żaden z tych modeli nie jest hostowany przez OrcaRouter — obecnie nie routujemy zamiany mowy na tekst, a dla każdego punktu końcowego będziesz wywoływać API Google bezpośrednio. Warstwa routingu w potoku głosowym działa na poziomie powyżej transkryptu: streszczacz, ekstraktor encji, model pozycji działań, który zamienia strumień w decyzję. To w tej warstwie OrcaRouter zarabia na siebie — jedno API dla ponad 200 modeli w cenie katalogowej dostawcy bez narzutów, automatyczny failover między dostawcami oraz DSL routingu, który komponuje kilka modeli w jedno wywołanie. Wybierz punkt końcowy transkrypcji w zależności od obciążenia, a następnie uruchom model, który czyta transkrypt pod jednym kluczem.
Sedno sprawy
Gemini 3.5 Transcribe Live i Gemini 3.5 Transcribe to ta sama rodzina, ale różne produkty. Wybierz Live, gdy transkrypt musi powstać przed zakończeniem rozmowy i akceptujesz 10-minutową sesję, brak etykiet mówców i brak znaczników czasu. Wybierz Transcribe, gdy wynik ma być zapisem, a dokładność i atrybucja są ważniejsze niż szybkość — jest tańszy, dokładniejszy i znacznie mniej ograniczony. Jedynym błędem jest założenie, że jeden endpoint obsługuje oba przypadki.
