Karta tytułowa hero dla „Inteligentnej transkrypcji z Gemini 3.5 Transcribe” przedstawiająca przebieg fali dźwiękowej zamieniający się w sformatowany tekst, globus oznaczony 85+ językami, chipy z etykietami mówców, kluczowe liczby: 2,6% WER (niestrumieniowo) i ~0,005 USD/min średnio, oraz logo OrcaRouter w prawym dolnym rogu.
Engineering & Research

Inteligentna transkrypcja z Gemini 3.5 Transcribe

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Gemini 3.​5 Transcribe wszedł w fazę publicznej zapowiedzi 26 sierpnia 2026 roku i jest to pierwszy model zamiany mowy na tekst Go​ogle, który jest naprawdę sprzedawany jako model G​emini: wywołujesz go przez API G​emini z identyfikatorem modelu, audio jest wyceniane w tokenach, a Go​ogle podaje koszt za minutę audio na swojej stronie cenowej. Ten ostatni szczegół umyka relacjom konsumenckim. Historie z dnia premiery dotyczą usuwania słów wypełniających i edycji głosu w Gboard, ale to, co faktycznie zmieniło się dla programistów, to fakt, że transkrypcja znajduje się teraz na tej samej powierzchni API co reszta linii G​emini, z przypisywaniem mówców i znacznikami czasowymi na poziomie słów w podstawowym modelu, a nie w osobnej usłudze dodatkowej. Ten tekst czyta się jak dokumentacja API, bo właśnie tę lukę pozostawiają pierwsze teksty o tym wydarzeniu.

Na wstępie dwie uwagi, żeby poniższe liczby nie wprowadzały w błąd. Go​ogle nie nazywa Gemini 3.​5 Transcribe „najdokładniejszym modelem zamiany mowy na tekst, jaki mamy” — twierdzenie dotyczy najbardziej precyzyjnego modelu do inteligentnych interakcji głosowych, co jest innym stwierdzeniem, a ta różnica ma znaczenie, gdy czytasz wskaźniki WER. A wszystko to opisuje publiczną wersję zapoznawczą: dwa identyfikatory modeli, ceny i wyniki benchmarków są tym, co Go​ogle udostępnia dziś, a wszystko to może się zmienić przed GA.

Dwie ścieżki API — oraz identyfikatory modeli do zapamiętania.

Gemini 3.5 Transcribe jest dostarczany jako dwa endpointy, a wybór właściwego z nich jest pierwszą decyzją architektoniczną, jaką podejmuje zespół:

• gemini-3-5-transcribe — ścieżka dla wcześniej nagranych plików przez Interactions API. Wyślij plik, a otrzymasz transkrypcję z przypisaniem mówców (do trzech mówców; trzech lub więcej to eksperyment) oraz znacznikami czasowymi na poziomie słów. To koń roboczy do przetwarzania wsadowego i asynchronicznego.

• gemini-3-5-transcribe-live — ścieżka czasu rzeczywistego przez Live API. Dwukierunkowe przesyłanie strumieniowe z opóźnieniem poniżej sekundy, przeznaczone do rozmów na żywo, napisów i interfejsów sterowanych głosem.

Ten podział odzwierciedla sposób, w jaki rozmieszczona jest reszta rodziny G​emini Audio, i ma znaczenie, ponieważ "live" to odrębny SKU z własną ceną. Kilka wczesnych odczytów tej premiery zakłada, że jeden model robi jedno i drugie; tak nie jest.

A generated two-card infographic titled 'Gemini 3.5 Transcribe - two API paths' showing the pre-recorded Interactions API path on the left labeled gemini-3-5-transcribe with a file-in transcript-out flow and speaker attribution, and the streaming Live API path on the right labeled gemini-3-5-transcribe-live with bidirectional streaming and sub-second latency, a footer reading 'Public preview, August 2026', and the OrcaRouter logo in the bottom-right corner.

Co właściwie oznacza „inteligentna transkrypcja”

Wpis Google dotyczący premiery przedstawia to jako przejście od dokładności fonetycznej do zrozumienia. To cechy wynikające z tego ujęcia należy oceniać, a nie samo ujęcie:

• Obsługa niepłynności — „ums” i „ahs” są pomijane, a samokorekty są rozstrzygane. „Spotkajmy się we wtorek — nie, w środę” transkrybuje się jako poprawiony dzień, a nie jako transkrypcja fałszywego startu. To decyzja, którą model podejmuje, i właśnie w tym sensie Google nazywa to inteligentnym.

• Automatyczne formatowanie — wynik jest zwracany w formie dopracowanego tekstu: z poprawną interpunkcją, wielkością liter i strukturą akapitów, a nie jako surowy strumień tokenów.

• Identyfikacja wielu mówców — przypisanie do maksymalnie trzech mówców w wcześniej nagranym audio ze znacznikami czasowymi na poziomie słów; obsługa trzech i więcej mówców jest eksperymentalna. Ta funkcja jest częścią modelu bazowego, a nie osobnej usługi diarizacji.

• Własne słownictwo — możesz ukierunkować rozpoznawanie na żargon, nazwy produktów i nietypowe pisownie, dostarczając słownik, co jest mechanizmem obsługi domen wertykalnych.

• 85+ języków — automatyczne wykrywanie, z wyraźnym wskazaniem akcentów regionalnych i dialektów.

• Wywoływanie funkcji — model może delegować zadania, takie jak generowanie obrazów czy analiza plików, do innych modeli G​emini, co zamienia transkrypcję w komponent większego agenta, a nie krok końcowy.

• Przechwytywanie encji — Go​ogle twierdzi, że osiąga wysoką skuteczność w przypadku zaszumionego, rzeczywistego audio oraz encji alfanumerycznych, takich jak kody pocztowe i identyfikatory zamówień.

Relacje prasowe donoszą również o oknie kontekstowym obejmującym 96 000 tokenów (mniej więcej godzinę nagrania spotkania bez dzielenia) oraz o wykrywaniu emocji. Obie te cechy są spójne z narracją premiery, ale karta modelu opublikowana przez Go​ogle nie eksponuje ich, więc należy traktować je jako doniesienia, a nie potwierdzone informacje, dopóki nie pojawi się specyfikacja GA.

A generated single-column scoreboard titled 'Gemini 3.5 Transcribe - the scoreboard' with rows Release Aug 26 2026 public preview, Languages 85+ auto-detect, WER 2.6% non-streaming / 4.0% streaming, Price ~$0.005 per minute blended, APIs transcribe plus transcribe-live, and Context ~96K tokens reported, a footer reading 'WER per Artificial Analysis, cited by Google; context window press-reported', and the OrcaRouter logo in the bottom-right corner.

Liczby dokładności, oznaczone

Liczby WER, które przytacza Go​ogle, pochodzą z Artificial Analysis: średni wskaźnik błędów słownych wynosi 4.0% dla transkrypcji strumieniowej i 2.6% dla transkrypcji niestrumieniowej. W wielojęzycznym benchmarku FLEURS Go​ogle podaje WER na poziomie 5.50% dla transkrypcji strumieniowej i 5.04% dla niestrumieniowej. Go​ogle twierdzi również, że czas do uzyskania końcowej transkrypcji poprawił się o 70% w porównaniu z poprzednią wersją, Chirp 3.

Uczciwe odczytanie: są to niezależne pomiary w tym sensie, że Artificial Analysis nie jest Go​ogle, ale są to pomiary wybrane przez Google, opublikowane we własnym ogłoszeniu Go​ogle, dotyczące modelu, który można wywoływać od zaledwie jednego dnia. Nikt spoza Go​ogle nie przeprowadził jeszcze bezpośredniego, adwersarialnego porównania z modelami o otwartych wagach, z którymi większość zespołów go porównuje, a materiały premierowe nie zawierają bezpośredniego porównania z rodziną Whisper ani linią Parakeet firmy NVIDIA. Liczba 70% szybciej niż Chirp-3 to deklaracja producenta, kropka. Traktuj 2,6% i 4,0% jako mocne wczesne sygnały, a nie ustalone fakty.

Ile to kosztuje

Strona cenowa Go​ogle podaje dla każdego modelu dane w tokenach oraz w szacowanych minutach audio. Dla gemini-3-5-transcribe łączny szacunek to około $0.005 za minutę audio w cenach katalogowych — wejście około $0.003/min, wyjście około $0.002/min. Dla gemini-3-5-transcribe-live łączny szacunek to około $0.009 za minutę. Oba mają dziś darmowy poziom.

Te wartości za minutę są szacunkami opartymi na założonym współczynniku tokenów (25 tokenów audio na sekundę na wejściu, 175 tokenów tekstu na minutę na wyjściu), więc zmieniają się, jeśli Go​ogle zmieni sposób rozliczania tokenów. Niezmienna jest zasada: cena katalogowa to cena. Dokładnie na tej zasadzie działa router pass-through, taki jak OrcaRouter — 0% narzutu, cena katalogowa dostawcy przekazywana dalej — więc jeśli Go​ogle obniży ceny transkrypcji w oknie między preview a GA, obniżka obowiązuje po naszej stronie tego samego dnia, a nie po tym, jak reseller zaktualizuje cennik.

Gdzie to jest wdrażane

Dla programistów publiczna wersja zapoznawcza oznacza dziś dwa obszary: API G​emini w Go​ogle AI Studio oraz platformę G​emini Enterprise Agent Platform dla obciążeń korporacyjnych. Po stronie konsumenckiej G​emini 3.​5 Transcribe już obsługuje funkcję dyktowania Rambler w Gboard na Androidzie oraz aplikację G​emini na macOS. Chrome jest następny — dyktowanie w dowolnym polu internetowym — a następnie Search Live, G​emini Live, Docs, Keep i Gmail. Dla zespołu oceniającego to praktyczna odpowiedź jest prostsza: można je wywoływać z kodu już dziś, po angielsku, w regionach, w których API G​emini jest dostępne.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

Co to oznacza dla Twojego pipeline'u

To, co jest naprawdę nowe, to nie liczba WER. Chodzi o to, że Go​{{1}}ogle{{/1}} sprzedaje teraz transkrypcję z dwiema funkcjami, które zespoły wcześniej składały samodzielnie — etykietami mówców i znacznikami czasowymi na poziomie słów — w modelu bazowym, na powierzchni API G​{{2}}emini{{/2}} obsługującej wywoływanie funkcji. Jeśli budowałeś potok diaryzowanych notatek ze spotkań ze zwykłego transkrybera, osobnego diaryzera i przebiegu formatowania, to pierwszy model Go​{{3}}ogle{{/3}}, który scala te kroki. Otwarte pytanie brzmi, jak 2,6% WER w trybie niestrumieniowym sprawdzi się na Twoim własnym audio; dopóki nie pojawi się niezależna reprodukcja, odpowiedzialnym posunięciem dla zespołu produkcyjnego jest przepuszczenie prawdziwej próbki przez API, a nie planowanie budżetu w oparciu o benchmarki wybrane przez Go​{{4}}ogle{{/4}}. Jeśli chodzi o pracę LLM wykonywaną na transkrypcji — streszczenie, ekstrakcję strukturalną, punkty działań — to warstwa, na której routing udowadnia swoją przydatność, i warstwa, którą obejmuje OrcaRouter: jedno API dla ponad 200 modeli, automatyczne przełączanie awaryjne między dostawcami oraz DSL routingu, który składa kilka modeli w jedno wywołanie. Sam etap transkrypcji powinieneś przetestować na własnym audio, zanim uwierzysz czyjejkolwiek liczbie z nagłówka.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube