Karta tytułowa hero dla 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo' z podtytułem 'czy linia bazowa wymaga wymiany?', przedstawiająca zarządzaną kartę API po lewej stronie oznaczoną Gemini 3.5 Transcribe na poziomie 2,6% WER w trybie non-streaming oraz kartę otwartych wag po prawej stronie oznaczoną Whisper Large v3 Turbo na poziomie 2,1% w LibriSpeech clean, z plakietką MIT i tagiem 809M, oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Gemini 3.5 Transcribe kontra Whisper Large v3 Turbo: czy linia bazowa wymaga wymiany?

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Whisper Large v3 Turbo to model, do którego w dużej części branży domyślnie odnosi się określenie „speech-to-text”, a Gemini 3.​5 Transcribe to pierwszy model transkrypcji Go​ogle, który jest jawnie sprzedawany jako konkurent tej linii bazowej, a nie jako generyczny interfejs API do rozpoznawania mowy. Gemini 3.​5 Transcribe, dostępny w publicznej wersji zapoznawczej od 26 sierpnia 2026 roku, przedstawia transkrypcję jako zadanie wymagające rozumowania — obsługuje samokorekty, formatuje wynik, przypisuje wypowiedzi poszczególnym mówcom i samodzielnie wywołuje inne modele G​emini. Whisper Large v3 Turbo to dystylacja modelu Whisper Large-v3 firmy Ope​nAI o 809 milionach parametrów, na licencji MIT, nadająca się do samodzielnego hostowania, obsługująca 99 języków i z grubsza cztery do ośmiu razy szybsza niż model, z którego powstała, w zależności od sprzętu. Jeden to zarządzana warstwa inteligencji przetwarzająca audio; drugi to darmowy, dobrze poznany komponent, który możesz uruchomić wszędzie tam, gdzie chcesz. Pytanie, na które ta strona ma odpowiedzieć, jest węższe i bardziej użyteczne niż „który jest lepszy”: kiedy linia bazowa przestaje być wystarczająco dobra?

Linia bazowa, na wypadek gdybyś zapomniał, jak dobra jest.

Whisper Large v3 Turbo zasługuje na swój domyślny status, więc argumenty za nim idą w pierwszej kolejności:

• Działa wszędzie — licencja MIT, otwarte wagi, instalowalny na laptopie, pojedynczym GPU lub funkcji serverless. Bez dostawcy, bez licznika, żadne dane nie opuszczają Twojej sieci.

• Jest szybki — zdestylowany dekoder (32 warstwy enkodera, 4 warstwy dekodera, zamiast 32) sprawia, że jest mniej więcej cztery razy szybszy niż Whisper Large-v3 na typowym sprzęcie, a na niektórych nawet szybszy, zachowując przy tym większość swojej dokładności. Sam OpenAI podaje, że na A100 jest około osiem razy szybszy.

• Obejmuje 99 języków do transkrypcji, czyli szerszą listę niż 85+ w Gemini 3.5 Transcribe.

• Jego dokładność jest dobrze udokumentowana: 2,1% WER na LibriSpeech test-clean, 4,2% na test-other, 9,1% na Common Voice English — liczby, które od lat są replikowane przez społeczność.

Ekosystem jest ogromny — faster-whisper, whisper.cpp, eksporty ONNX i każdy framework wnioskowania, którego już używasz. Jeśli możesz uruchomić model, możesz uruchomić ten.

A screenshot of the Hugging Face model page for openai/whisper-large-v3-turbo, showing the MIT license tag, the automatic-speech-recognition pipeline tag, the Transformers and Safetensors tags, the 99-languages tag, and the model card for the 809 million parameter distilled version of Whisper Large-v3, captured August 27 2026.

W przypadku transkrypcji wsadowej tekstów angielskich i zbliżonych do angielskiego na dużą skalę, Whisper Large v3 Turbo pozostaje standardem z przyczyn strukturalnych, których żadna różnica w benchmarkach łatwo nie odwróci: jest darmowy, jest twój i jest wszędzie.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo - the scoreboard'. Left column Gemini 3.5 Transcribe: Deployment managed API, Languages 85+, WER 2.6% non-streaming, Speaker ID built in, Formatting intelligent, Price ~$0.005/min. Right column Whisper Large v3 Turbo: Deployment anywhere self-host, Languages 99, WER 2.1% LibriSpeech clean, Speaker ID none, Formatting plain, Price free to run. Footer reads 'Gemini WER per Artificial Analysis, cited by Google; Whisper WER on LibriSpeech - a different set, see text.'

Co Gemini 3.5 Transcribe dodaje od siebie

Wartość zarządzanego pretendenta nie polega na tym, że na czystym angielskim pokonuje bazę — to walka, której liczby nawet jeszcze nie potrafią rozstrzygnąć jednoznacznie. Jego wartość leży w pracy, która odbywa się ponad słowami, czego Whisper wprost nie robi:

• Atrybucja mówcy — do trzech mówców ze znacznikami czasowymi na poziomie słów, w modelu bazowym. Whisper transkrybuje jeden strumień mowy; nie ma pojęcia, kto co powiedział.

• Inteligentne formatowanie — usuwanie niepłynności, rozstrzyganie samokorekt, stosowanie interpunkcji i wielkości liter. Whisper zwraca słowa tak, jak zostały wypowiedziane, z „yyy” włącznie.

• Własne słownictwo — skłonność do żargonu i nietypowych pisowni. Whisper nie ma takiego mechanizmu; stosuj post-processing lub dostrajanie.

• Wywoływanie funkcji — transkrypt może przekazać kontrolę innym modelom G​emini, czyniąc transkrypcję krokiem w potoku agenta, a nie końcowym wynikiem.

• Długie sesje — około godziny audio w jednym przebiegu (według doniesień prasowych kontekst 96K) w porównaniu z praktyczną potrzebą Whispera, by dzielić długie pliki na fragmenty i sklejać je.

To jest inny produkt. To właśnie Go​ogle rozumie przez „inteligentną transkrypcję” i jest to część porównania, która nie zależy od arytmetyki benchmarków.

Pytanie o dokładność, na które nikt nie potrafi jeszcze odpowiedzieć jednoznacznie.

Najważniejsze wyniki tych dwóch modeli nie mierzą się faktycznie bezpośrednio. Wskaźnik WER 2,6% dla trybu niestrumieniowego Gemini 3.5 Transcribe to pomiar Artificial Analysis przywołany przez Google, obliczony dla ponad 85 języków. Z kolei wynik 2,1% Whisper Large v3 Turbo na zbiorze LibriSpeech test-clean to anglojęzyczny benchmark z pracy OpenAI o destylacji, szeroko replikowany. Inne korpusy, inny zakres języków, inni dostawcy. Co można uczciwie powiedzieć: na czystym angielskim otwarty model bazowy i zarządzany pretendent pozostają prawdopodobnie na podobnym poziomie, a przewaga zarządzanego modelu leży w jego funkcjach wielojęzycznych i strukturalnych, nie zaś w wykazanym zwycięstwie w angielskim WER. Materiały premierowe Google nie zawierają bezpośredniego porównania z modelami z rodziny Whisper, a niezależne porównanie krytyczne nie istnieje, ponieważ Gemini 3.5 Transcribe jest publiczny dopiero od jednego dnia. Dopóki takie się nie pojawi, korona najdokładniejszego modelu pozostaje nieprzyznana, a każdy artykuł — w tym ten — który na podstawie tych dwóch liczb ogłasza zwycięzcę pod względem WER, przesadza.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

Koszt: bezpłatnie do uruchomienia, 0,005 USD za minutę

{{1}}Whisper Large v3 Turbo{{/1}} ma koszt sprzętowy, ale nie ma licznika. Uruchom go na GPU, które już masz, a koszt krańcowy za minutę transkrypcji będzie bliski zeru; wynajmij GPU, a będzie to tyle, ile kosztuje instancja, póki pracuje. {{2}}Gemini 3.​5 Transcribe{{/2}} pobiera około 0,005 USD za minutę dźwięku w ujęciu mieszanym, wariant live to około 0,009 USD za minutę, a do tego jest darmowy poziom. Przy tysiącu godzin dźwięku to około 300 USD na liczniku G​emini wobec kilku dolarów za czas GPU na otwartym baseline. Ta różnica to prawdziwa historia kosztów w tym zestawieniu i dlatego baseline na długo zachowa status domyślnego rozwiązania do wysokonakładowej angielskiej transkrypcji wsadowej. Ekonomika modelu zarządzanego domyka się dopiero wtedy, gdy funkcje, które ma w pakiecie — diarizacja, formatowanie, kontrola słownictwa — same kosztowałyby ci czas inżynierski na złożenie ich na bazie Whisper.

Języki i streaming

Whisper Large v3 Turbo wymienia 99 języków, podczas gdy {{1}}G​emini{{/1}} ma ich 85+, ale w praktyce wielojęzyczność wygląda inaczej: Whisper transkrybuje wszystkie 99 w jednym przebiegu bez automatycznego wykrywania, a jego dokładność najbardziej spada na językach niskozasobowych i zaszumionych — to kompromis destylowanego modelu. {{2}}G​emini{{/2}} automatycznie wykrywa język wśród swoich 85+, a {{3}}Go​ogle{{/3}} podkreśla regionalne akcenty i dialekty. W przypadku streamingu Whisper nie ma natywnego modelu czasu rzeczywistego; wdrożenia czasu rzeczywistego wykorzystują faster-whisper i podobne frameworki na własnym sprzęcie, podczas gdy {{4}}Gemini 3.​5 Transcribe{{/4}} ma dedykowany endpoint na żywo z deklarowanym opóźnieniem poniżej sekundy i ceną adekwatną do tego. Jeśli Twoje obciążenie jest na żywo i wielojęzyczne, zarządzany endpoint jest prostszy w obsłudze; jeśli jest wsadowe i anglojęzyczne, otwarty model bazowy jest tańszy.

Werdykt, taki jaki jest

{{1}}Whisper Large v3 Turbo{{/1}} pozostaje właściwym wyborem domyślnym do wsadowej transkrypcji angielskiej na dużą skalę, do wszystkiego, co musi działać na własnej infrastrukturze, oraz dla zespołów, które chcą zamrożonego, audytowalnego artefaktu. {{2}}Gemini 3.​5 Transcribe{{/2}} to właściwy wybór, gdy transkrypt musi być czymś więcej niż słowami — etykiety mówców, czyste formatowanie, słownictwo branżowe, obsługa wielu języków lub podpięcie agenta — i gdy jesteś skłonny płacić według licznika za te funkcje. Oba rozwiązania współistnieją, a wzorzec, który czyni to współistnienie tanim, to granica routingu: transkryber dobrany do audio, a następnie warstwa LLM, która decyduje, co dzieje się z tekstem. Tą warstwą zarządza OrcaRouter — jedno API dla ponad 200 modeli, automatyczne przełączanie awaryjne między dostawcami oraz DSL routingu do komponowania kilku modeli w jedno wywołanie. Żaden z modeli mowy nie jest hostowany po naszej stronie; wybór transkrypcji to wybór między twoim GPU a licznikiem Go​ogle — i oba będą obecne przez długi czas.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube