
Inteligentna transkrypcja z Gemini 3.5 Transcribe
- 智谱NOWOŚĆZ.ai: GLM 5.3 Flash2026-08-26$0.07 / $0.25 za 1 mln tokenów
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
Gemini 3.5 Transcribe wszedł w fazę publicznej zapowiedzi 26 sierpnia 2026 roku i jest to pierwszy model zamiany mowy na tekst Google, który jest naprawdę sprzedawany jako model Gemini: wywołujesz go przez API Gemini z identyfikatorem modelu, audio jest wyceniane w tokenach, a Google podaje koszt za minutę audio na swojej stronie cenowej. Ten ostatni szczegół umyka relacjom konsumenckim. Historie z dnia premiery dotyczą usuwania słów wypełniających i edycji głosu w Gboard, ale to, co faktycznie zmieniło się dla programistów, to fakt, że transkrypcja znajduje się teraz na tej samej powierzchni API co reszta linii Gemini, z przypisywaniem mówców i znacznikami czasowymi na poziomie słów w podstawowym modelu, a nie w osobnej usłudze dodatkowej. Ten tekst czyta się jak dokumentacja API, bo właśnie tę lukę pozostawiają pierwsze teksty o tym wydarzeniu.
Na wstępie dwie uwagi, żeby poniższe liczby nie wprowadzały w błąd. Google nie nazywa Gemini 3.5 Transcribe „najdokładniejszym modelem zamiany mowy na tekst, jaki mamy” — twierdzenie dotyczy najbardziej precyzyjnego modelu do inteligentnych interakcji głosowych, co jest innym stwierdzeniem, a ta różnica ma znaczenie, gdy czytasz wskaźniki WER. A wszystko to opisuje publiczną wersję zapoznawczą: dwa identyfikatory modeli, ceny i wyniki benchmarków są tym, co Google udostępnia dziś, a wszystko to może się zmienić przed GA.
Dwie ścieżki API — oraz identyfikatory modeli do zapamiętania.
Gemini 3.5 Transcribe jest dostarczany jako dwa endpointy, a wybór właściwego z nich jest pierwszą decyzją architektoniczną, jaką podejmuje zespół:
• gemini-3-5-transcribe — ścieżka dla wcześniej nagranych plików przez Interactions API. Wyślij plik, a otrzymasz transkrypcję z przypisaniem mówców (do trzech mówców; trzech lub więcej to eksperyment) oraz znacznikami czasowymi na poziomie słów. To koń roboczy do przetwarzania wsadowego i asynchronicznego.
• gemini-3-5-transcribe-live — ścieżka czasu rzeczywistego przez Live API. Dwukierunkowe przesyłanie strumieniowe z opóźnieniem poniżej sekundy, przeznaczone do rozmów na żywo, napisów i interfejsów sterowanych głosem.
Ten podział odzwierciedla sposób, w jaki rozmieszczona jest reszta rodziny Gemini Audio, i ma znaczenie, ponieważ "live" to odrębny SKU z własną ceną. Kilka wczesnych odczytów tej premiery zakłada, że jeden model robi jedno i drugie; tak nie jest.

Co właściwie oznacza „inteligentna transkrypcja”
Wpis Google dotyczący premiery przedstawia to jako przejście od dokładności fonetycznej do zrozumienia. To cechy wynikające z tego ujęcia należy oceniać, a nie samo ujęcie:
• Obsługa niepłynności — „ums” i „ahs” są pomijane, a samokorekty są rozstrzygane. „Spotkajmy się we wtorek — nie, w środę” transkrybuje się jako poprawiony dzień, a nie jako transkrypcja fałszywego startu. To decyzja, którą model podejmuje, i właśnie w tym sensie Google nazywa to inteligentnym.
• Automatyczne formatowanie — wynik jest zwracany w formie dopracowanego tekstu: z poprawną interpunkcją, wielkością liter i strukturą akapitów, a nie jako surowy strumień tokenów.
• Identyfikacja wielu mówców — przypisanie do maksymalnie trzech mówców w wcześniej nagranym audio ze znacznikami czasowymi na poziomie słów; obsługa trzech i więcej mówców jest eksperymentalna. Ta funkcja jest częścią modelu bazowego, a nie osobnej usługi diarizacji.
• Własne słownictwo — możesz ukierunkować rozpoznawanie na żargon, nazwy produktów i nietypowe pisownie, dostarczając słownik, co jest mechanizmem obsługi domen wertykalnych.
• 85+ języków — automatyczne wykrywanie, z wyraźnym wskazaniem akcentów regionalnych i dialektów.
• Wywoływanie funkcji — model może delegować zadania, takie jak generowanie obrazów czy analiza plików, do innych modeli Gemini, co zamienia transkrypcję w komponent większego agenta, a nie krok końcowy.
• Przechwytywanie encji — Google twierdzi, że osiąga wysoką skuteczność w przypadku zaszumionego, rzeczywistego audio oraz encji alfanumerycznych, takich jak kody pocztowe i identyfikatory zamówień.
Relacje prasowe donoszą również o oknie kontekstowym obejmującym 96 000 tokenów (mniej więcej godzinę nagrania spotkania bez dzielenia) oraz o wykrywaniu emocji. Obie te cechy są spójne z narracją premiery, ale karta modelu opublikowana przez Google nie eksponuje ich, więc należy traktować je jako doniesienia, a nie potwierdzone informacje, dopóki nie pojawi się specyfikacja GA.

Liczby dokładności, oznaczone
Liczby WER, które przytacza Google, pochodzą z Artificial Analysis: średni wskaźnik błędów słownych wynosi 4.0% dla transkrypcji strumieniowej i 2.6% dla transkrypcji niestrumieniowej. W wielojęzycznym benchmarku FLEURS Google podaje WER na poziomie 5.50% dla transkrypcji strumieniowej i 5.04% dla niestrumieniowej. Google twierdzi również, że czas do uzyskania końcowej transkrypcji poprawił się o 70% w porównaniu z poprzednią wersją, Chirp 3.
Uczciwe odczytanie: są to niezależne pomiary w tym sensie, że Artificial Analysis nie jest Google, ale są to pomiary wybrane przez Google, opublikowane we własnym ogłoszeniu Google, dotyczące modelu, który można wywoływać od zaledwie jednego dnia. Nikt spoza Google nie przeprowadził jeszcze bezpośredniego, adwersarialnego porównania z modelami o otwartych wagach, z którymi większość zespołów go porównuje, a materiały premierowe nie zawierają bezpośredniego porównania z rodziną Whisper ani linią Parakeet firmy NVIDIA. Liczba 70% szybciej niż Chirp-3 to deklaracja producenta, kropka. Traktuj 2,6% i 4,0% jako mocne wczesne sygnały, a nie ustalone fakty.
Ile to kosztuje
Strona cenowa Google podaje dla każdego modelu dane w tokenach oraz w szacowanych minutach audio. Dla gemini-3-5-transcribe łączny szacunek to około $0.005 za minutę audio w cenach katalogowych — wejście około $0.003/min, wyjście około $0.002/min. Dla gemini-3-5-transcribe-live łączny szacunek to około $0.009 za minutę. Oba mają dziś darmowy poziom.
Te wartości za minutę są szacunkami opartymi na założonym współczynniku tokenów (25 tokenów audio na sekundę na wejściu, 175 tokenów tekstu na minutę na wyjściu), więc zmieniają się, jeśli Google zmieni sposób rozliczania tokenów. Niezmienna jest zasada: cena katalogowa to cena. Dokładnie na tej zasadzie działa router pass-through, taki jak OrcaRouter — 0% narzutu, cena katalogowa dostawcy przekazywana dalej — więc jeśli Google obniży ceny transkrypcji w oknie między preview a GA, obniżka obowiązuje po naszej stronie tego samego dnia, a nie po tym, jak reseller zaktualizuje cennik.
Gdzie to jest wdrażane
Dla programistów publiczna wersja zapoznawcza oznacza dziś dwa obszary: API Gemini w Google AI Studio oraz platformę Gemini Enterprise Agent Platform dla obciążeń korporacyjnych. Po stronie konsumenckiej Gemini 3.5 Transcribe już obsługuje funkcję dyktowania Rambler w Gboard na Androidzie oraz aplikację Gemini na macOS. Chrome jest następny — dyktowanie w dowolnym polu internetowym — a następnie Search Live, Gemini Live, Docs, Keep i Gmail. Dla zespołu oceniającego to praktyczna odpowiedź jest prostsza: można je wywoływać z kodu już dziś, po angielsku, w regionach, w których API Gemini jest dostępne.

Co to oznacza dla Twojego pipeline'u
To, co jest naprawdę nowe, to nie liczba WER. Chodzi o to, że Go{{1}}ogle{{/1}} sprzedaje teraz transkrypcję z dwiema funkcjami, które zespoły wcześniej składały samodzielnie — etykietami mówców i znacznikami czasowymi na poziomie słów — w modelu bazowym, na powierzchni API G{{2}}emini{{/2}} obsługującej wywoływanie funkcji. Jeśli budowałeś potok diaryzowanych notatek ze spotkań ze zwykłego transkrybera, osobnego diaryzera i przebiegu formatowania, to pierwszy model Go{{3}}ogle{{/3}}, który scala te kroki. Otwarte pytanie brzmi, jak 2,6% WER w trybie niestrumieniowym sprawdzi się na Twoim własnym audio; dopóki nie pojawi się niezależna reprodukcja, odpowiedzialnym posunięciem dla zespołu produkcyjnego jest przepuszczenie prawdziwej próbki przez API, a nie planowanie budżetu w oparciu o benchmarki wybrane przez Go{{4}}ogle{{/4}}. Jeśli chodzi o pracę LLM wykonywaną na transkrypcji — streszczenie, ekstrakcję strukturalną, punkty działań — to warstwa, na której routing udowadnia swoją przydatność, i warstwa, którą obejmuje OrcaRouter: jedno API dla ponad 200 modeli, automatyczne przełączanie awaryjne między dostawcami oraz DSL routingu, który składa kilka modeli w jedno wywołanie. Sam etap transkrypcji powinieneś przetestować na własnym audio, zanim uwierzysz czyjejkolwiek liczbie z nagłówka.
