
Gemini 3.5 Transcribe kontra Whisper Large v3 Turbo: czy linia bazowa wymaga wymiany?
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
Whisper Large v3 Turbo to model, do którego w dużej części branży domyślnie odnosi się określenie „speech-to-text”, a Gemini 3.5 Transcribe to pierwszy model transkrypcji Google, który jest jawnie sprzedawany jako konkurent tej linii bazowej, a nie jako generyczny interfejs API do rozpoznawania mowy. Gemini 3.5 Transcribe, dostępny w publicznej wersji zapoznawczej od 26 sierpnia 2026 roku, przedstawia transkrypcję jako zadanie wymagające rozumowania — obsługuje samokorekty, formatuje wynik, przypisuje wypowiedzi poszczególnym mówcom i samodzielnie wywołuje inne modele Gemini. Whisper Large v3 Turbo to dystylacja modelu Whisper Large-v3 firmy OpenAI o 809 milionach parametrów, na licencji MIT, nadająca się do samodzielnego hostowania, obsługująca 99 języków i z grubsza cztery do ośmiu razy szybsza niż model, z którego powstała, w zależności od sprzętu. Jeden to zarządzana warstwa inteligencji przetwarzająca audio; drugi to darmowy, dobrze poznany komponent, który możesz uruchomić wszędzie tam, gdzie chcesz. Pytanie, na które ta strona ma odpowiedzieć, jest węższe i bardziej użyteczne niż „który jest lepszy”: kiedy linia bazowa przestaje być wystarczająco dobra?
Linia bazowa, na wypadek gdybyś zapomniał, jak dobra jest.
Whisper Large v3 Turbo zasługuje na swój domyślny status, więc argumenty za nim idą w pierwszej kolejności:
• Działa wszędzie — licencja MIT, otwarte wagi, instalowalny na laptopie, pojedynczym GPU lub funkcji serverless. Bez dostawcy, bez licznika, żadne dane nie opuszczają Twojej sieci.
• Jest szybki — zdestylowany dekoder (32 warstwy enkodera, 4 warstwy dekodera, zamiast 32) sprawia, że jest mniej więcej cztery razy szybszy niż Whisper Large-v3 na typowym sprzęcie, a na niektórych nawet szybszy, zachowując przy tym większość swojej dokładności. Sam OpenAI podaje, że na A100 jest około osiem razy szybszy.
• Obejmuje 99 języków do transkrypcji, czyli szerszą listę niż 85+ w Gemini 3.5 Transcribe.
• Jego dokładność jest dobrze udokumentowana: 2,1% WER na LibriSpeech test-clean, 4,2% na test-other, 9,1% na Common Voice English — liczby, które od lat są replikowane przez społeczność.
Ekosystem jest ogromny — faster-whisper, whisper.cpp, eksporty ONNX i każdy framework wnioskowania, którego już używasz. Jeśli możesz uruchomić model, możesz uruchomić ten.

W przypadku transkrypcji wsadowej tekstów angielskich i zbliżonych do angielskiego na dużą skalę, Whisper Large v3 Turbo pozostaje standardem z przyczyn strukturalnych, których żadna różnica w benchmarkach łatwo nie odwróci: jest darmowy, jest twój i jest wszędzie.

Co Gemini 3.5 Transcribe dodaje od siebie
Wartość zarządzanego pretendenta nie polega na tym, że na czystym angielskim pokonuje bazę — to walka, której liczby nawet jeszcze nie potrafią rozstrzygnąć jednoznacznie. Jego wartość leży w pracy, która odbywa się ponad słowami, czego Whisper wprost nie robi:
• Atrybucja mówcy — do trzech mówców ze znacznikami czasowymi na poziomie słów, w modelu bazowym. Whisper transkrybuje jeden strumień mowy; nie ma pojęcia, kto co powiedział.
• Inteligentne formatowanie — usuwanie niepłynności, rozstrzyganie samokorekt, stosowanie interpunkcji i wielkości liter. Whisper zwraca słowa tak, jak zostały wypowiedziane, z „yyy” włącznie.
• Własne słownictwo — skłonność do żargonu i nietypowych pisowni. Whisper nie ma takiego mechanizmu; stosuj post-processing lub dostrajanie.
• Wywoływanie funkcji — transkrypt może przekazać kontrolę innym modelom Gemini, czyniąc transkrypcję krokiem w potoku agenta, a nie końcowym wynikiem.
• Długie sesje — około godziny audio w jednym przebiegu (według doniesień prasowych kontekst 96K) w porównaniu z praktyczną potrzebą Whispera, by dzielić długie pliki na fragmenty i sklejać je.
To jest inny produkt. To właśnie Google rozumie przez „inteligentną transkrypcję” i jest to część porównania, która nie zależy od arytmetyki benchmarków.
Pytanie o dokładność, na które nikt nie potrafi jeszcze odpowiedzieć jednoznacznie.
Najważniejsze wyniki tych dwóch modeli nie mierzą się faktycznie bezpośrednio. Wskaźnik WER 2,6% dla trybu niestrumieniowego Gemini 3.5 Transcribe to pomiar Artificial Analysis przywołany przez Google, obliczony dla ponad 85 języków. Z kolei wynik 2,1% Whisper Large v3 Turbo na zbiorze LibriSpeech test-clean to anglojęzyczny benchmark z pracy OpenAI o destylacji, szeroko replikowany. Inne korpusy, inny zakres języków, inni dostawcy. Co można uczciwie powiedzieć: na czystym angielskim otwarty model bazowy i zarządzany pretendent pozostają prawdopodobnie na podobnym poziomie, a przewaga zarządzanego modelu leży w jego funkcjach wielojęzycznych i strukturalnych, nie zaś w wykazanym zwycięstwie w angielskim WER. Materiały premierowe Google nie zawierają bezpośredniego porównania z modelami z rodziny Whisper, a niezależne porównanie krytyczne nie istnieje, ponieważ Gemini 3.5 Transcribe jest publiczny dopiero od jednego dnia. Dopóki takie się nie pojawi, korona najdokładniejszego modelu pozostaje nieprzyznana, a każdy artykuł — w tym ten — który na podstawie tych dwóch liczb ogłasza zwycięzcę pod względem WER, przesadza.

Koszt: bezpłatnie do uruchomienia, 0,005 USD za minutę
{{1}}Whisper Large v3 Turbo{{/1}} ma koszt sprzętowy, ale nie ma licznika. Uruchom go na GPU, które już masz, a koszt krańcowy za minutę transkrypcji będzie bliski zeru; wynajmij GPU, a będzie to tyle, ile kosztuje instancja, póki pracuje. {{2}}Gemini 3.5 Transcribe{{/2}} pobiera około 0,005 USD za minutę dźwięku w ujęciu mieszanym, wariant live to około 0,009 USD za minutę, a do tego jest darmowy poziom. Przy tysiącu godzin dźwięku to około 300 USD na liczniku Gemini wobec kilku dolarów za czas GPU na otwartym baseline. Ta różnica to prawdziwa historia kosztów w tym zestawieniu i dlatego baseline na długo zachowa status domyślnego rozwiązania do wysokonakładowej angielskiej transkrypcji wsadowej. Ekonomika modelu zarządzanego domyka się dopiero wtedy, gdy funkcje, które ma w pakiecie — diarizacja, formatowanie, kontrola słownictwa — same kosztowałyby ci czas inżynierski na złożenie ich na bazie Whisper.
Języki i streaming
Whisper Large v3 Turbo wymienia 99 języków, podczas gdy {{1}}Gemini{{/1}} ma ich 85+, ale w praktyce wielojęzyczność wygląda inaczej: Whisper transkrybuje wszystkie 99 w jednym przebiegu bez automatycznego wykrywania, a jego dokładność najbardziej spada na językach niskozasobowych i zaszumionych — to kompromis destylowanego modelu. {{2}}Gemini{{/2}} automatycznie wykrywa język wśród swoich 85+, a {{3}}Google{{/3}} podkreśla regionalne akcenty i dialekty. W przypadku streamingu Whisper nie ma natywnego modelu czasu rzeczywistego; wdrożenia czasu rzeczywistego wykorzystują faster-whisper i podobne frameworki na własnym sprzęcie, podczas gdy {{4}}Gemini 3.5 Transcribe{{/4}} ma dedykowany endpoint na żywo z deklarowanym opóźnieniem poniżej sekundy i ceną adekwatną do tego. Jeśli Twoje obciążenie jest na żywo i wielojęzyczne, zarządzany endpoint jest prostszy w obsłudze; jeśli jest wsadowe i anglojęzyczne, otwarty model bazowy jest tańszy.
Werdykt, taki jaki jest
{{1}}Whisper Large v3 Turbo{{/1}} pozostaje właściwym wyborem domyślnym do wsadowej transkrypcji angielskiej na dużą skalę, do wszystkiego, co musi działać na własnej infrastrukturze, oraz dla zespołów, które chcą zamrożonego, audytowalnego artefaktu. {{2}}Gemini 3.5 Transcribe{{/2}} to właściwy wybór, gdy transkrypt musi być czymś więcej niż słowami — etykiety mówców, czyste formatowanie, słownictwo branżowe, obsługa wielu języków lub podpięcie agenta — i gdy jesteś skłonny płacić według licznika za te funkcje. Oba rozwiązania współistnieją, a wzorzec, który czyni to współistnienie tanim, to granica routingu: transkryber dobrany do audio, a następnie warstwa LLM, która decyduje, co dzieje się z tekstem. Tą warstwą zarządza OrcaRouter — jedno API dla ponad 200 modeli, automatyczne przełączanie awaryjne między dostawcami oraz DSL routingu do komponowania kilku modeli w jedno wywołanie. Żaden z modeli mowy nie jest hostowany po naszej stronie; wybór transkrypcji to wybór między twoim GPU a licznikiem Google — i oba będą obecne przez długi czas.
