Kartu judul hero untuk 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo' dengan subjudul 'apakah baseline perlu diganti?', menampilkan kartu API terkelola di kiri berlabel Gemini 3.5 Transcribe dengan WER non-streaming 2,6% dan kartu bobot terbuka di kanan berlabel Whisper Large v3 Turbo dengan LibriSpeech clean 2,1%, lencana MIT, dan tag 809M, serta logo OrcaRouter di sudut kanan bawah.
Guides & Insights

Gemini 3.5 Transcribe vs Whisper Large v3 Turbo: apakah baseline perlu diganti?

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Whisper Large v3 Turbo adalah model yang menjadi default untuk frasa "speech-to-text" bagi sebagian besar industri, dan Gemini 3.​5 Transcribe adalah model transkripsi Go​ogle pertama yang secara eksplisit dijual sebagai penantang baseline tersebut, bukan sebagai API ucapan generik. Gemini 3.​5 Transcribe, dalam pratinjau publik sejak 26 Agustus 2026, membingkai ulang transkripsi sebagai tugas penalaran — ia menyelesaikan koreksi diri, memformat keluaran, menentukan pembicara, dan memanggil model G​emini lain secara mandiri. Whisper Large v3 Turbo adalah distilasi 809 juta parameter dari Whisper Large-v3 oleh Ope​nAI, berlisensi MIT, dapat di-hosting sendiri, mendukung 99 bahasa, dan kira-kira empat hingga delapan kali lebih cepat daripada model asalnya tergantung pada perangkat kerasnya. Satu adalah lapisan kecerdasan terkelola di atas audio; yang lain adalah komponen gratis yang dipahami dengan baik yang bisa Anda jalankan di mana pun Anda mau. Pertanyaan yang hendak dijawab oleh halaman ini lebih sempit dan lebih berguna daripada "mana yang lebih baik": kapan baseline berhenti menjadi cukup baik?

Garis dasarnya, kalau-kalau kamu lupa betapa bagusnya itu.

Whisper Large v3 Turbo pantas mendapatkan status default-nya, jadi argumen untuknya dikemukakan lebih dulu:

• Dapat berjalan di mana saja — lisensi MIT, bobot terbuka, dapat diinstal di laptop, satu GPU, atau fungsi serverless. Tanpa vendor, tanpa meteran, tanpa data yang meninggalkan jaringan Anda.

• Ini cepat — decoder hasil distilasi (32 lapisan encoder, 4 lapisan decoder, turun dari 32) membuatnya kira-kira empat kali lebih cepat daripada Whisper Large-v3 pada perangkat keras umum, bahkan lebih cepat lagi di sebagian perangkat, sambil mempertahankan sebagian besar akurasinya. Angka OpenAI sendiri sekitar delapan kali lipat pada A100.

Ini mencakup 99 bahasa untuk transkripsi, daftar yang lebih luas daripada 85+ milik Gemini 3.5 Transcribe.

• Akurasinya terdokumentasi dengan baik: 2.1% WER pada LibriSpeech test-clean, 4.2% pada test-other, 9.1% pada Common Voice English — angka-angka yang telah direplikasi di seluruh komunitas selama bertahun-tahun.

{{1}}Ekosistemnya sangat besar — faster-whisper, whisper.cpp, ekspor ONNX, dan semua kerangka kerja inferensi yang sudah Anda gunakan. Jika Anda bisa menjalankan model, Anda bisa menjalankan yang satu ini.

A screenshot of the Hugging Face model page for openai/whisper-large-v3-turbo, showing the MIT license tag, the automatic-speech-recognition pipeline tag, the Transformers and Safetensors tags, the 99-languages tag, and the model card for the 809 million parameter distilled version of Whisper Large-v3, captured August 27 2026.

Untuk transkripsi batch bahasa Inggris dan bahasa yang mendekati Inggris dalam skala besar, Whisper Large v3 Turbo adalah pemimpin pasar karena alasan struktural yang tidak dapat dengan mudah dikalahkan oleh celah tolok ukur mana pun: ia gratis, ia milik Anda, dan ia ada di mana-mana.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo - the scoreboard'. Left column Gemini 3.5 Transcribe: Deployment managed API, Languages 85+, WER 2.6% non-streaming, Speaker ID built in, Formatting intelligent, Price ~$0.005/min. Right column Whisper Large v3 Turbo: Deployment anywhere self-host, Languages 99, WER 2.1% LibriSpeech clean, Speaker ID none, Formatting plain, Price free to run. Footer reads 'Gemini WER per Artificial Analysis, cited by Google; Whisper WER on LibriSpeech - a different set, see text.'

Apa yang ditambahkan Gemini 3.​5 Transcribe

Nilai penantang terkelola bukanlah bahwa ia mengungguli baseline pada bahasa Inggris yang bersih — itu adalah pertarungan yang bahkan angka-angka belum bisa selesaikan secara bersih. Nilainya adalah pekerjaan yang terjadi di atas kata-kata, yang secara eksplisit tidak dilakukan Whisper:

• Atribusi pembicara — hingga tiga pembicara dengan stempel waktu per kata, dalam model dasar. Whisper mentranskripsikan satu aliran ucapan; ia tidak memiliki konsep tentang siapa yang mengatakan apa.

• Pemformatan cerdas — disfluensi dihilangkan, koreksi diri dirapikan, tanda baca dan kapitalisasi diterapkan. Whisper mengembalikan kata-kata sebagaimana diucapkan, lengkap dengan segala 'um'-nya.

• Kosakata kustom — cenderung memihak pada jargon dan ejaan yang tidak lazim. Whisper tidak memiliki mekanisme semacam itu; Anda melakukan pasca-pemrosesan atau fine-tuning.

• Pemanggilan fungsi — transkrip dapat meneruskan ke model G​emini lainnya, menjadikan transkripsi sebagai langkah dalam pipeline agen, bukan keluaran akhir.

• Sesi panjang — kira-kira satu jam audio dalam satu kali proses (konteks 96K yang dilaporkan pers) dibandingkan dengan kebutuhan praktis Whisper untuk memotong dan menyambung file panjang.

Itu adalah produk yang berbeda. Itulah yang dimaksud Google dengan "transkripsi cerdas," dan itu adalah bagian dari perbandingan yang tidak bergantung pada aritmetika benchmark.

Pertanyaan akurasi yang belum bisa dijawab dengan tuntas oleh siapa pun.

Angka-angka utama kedua model tersebut sebenarnya tidak saling berhadapan. WER non-streaming sebesar 2,6% dari Gemini 3.​5 Transcribe adalah pengukuran Artificial Analysis yang dikutip oleh Go​ogle, dihitung dari 85+ bahasa. WER 2,1% pada LibriSpeech test-clean milik Whisper Large v3 Turbo adalah tolok ukur bahasa Inggris dari makalah distilasi Ope​nAI sendiri, yang telah direplikasi secara luas. Korpusnya berbeda, cakupan bahasanya berbeda, vendornya berbeda. Yang dapat dikatakan dengan jujur: pada bahasa Inggris yang bersih, baseline terbuka dan penantang terkelola tersebut masuk akal bila berada di kisaran yang sama, dan keunggulan model terkelola terletak pada fitur multibahasa dan strukturalnya, bukan pada kemenangan WER bahasa Inggris yang telah terbukti. Materi peluncuran Go​ogle tidak memuat perbandingan head-to-head dengan model-model keluarga Whisper, dan perbandingan adversarial independen pun belum ada karena Gemini 3.​5 Transcribe baru dipublikasikan sehari. Sampai perbandingan tersebut muncul, mahkota akurasi belum diklaim, dan artikel mana pun — termasuk artikel ini — yang menyatakan pemenang WER berdasarkan kedua angka tersebut adalah berlebihan.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

Biaya: gratis untuk dijalankan dibandingkan $0.005 per menit

Whisper Large v3 Turbo memiliki biaya perangkat keras dan tanpa meteran. Jika dijalankan di GPU yang sudah Anda miliki, biaya marjinal per menit transkripsi hampir nol; jika menyewa GPU, biayanya sesuai dengan biaya instance selama bekerja. Gemini 3.​5 Transcribe mengenakan biaya sekitar $0,005 per menit audio gabungan, dengan SKU live sekitar $0,009 per menit dan ada tingkat gratis. Untuk seribu jam audio, itu sekitar $300 pada meteran G​emini dibandingkan dengan beberapa dolar waktu GPU pada baseline terbuka. Kesenjangan itulah kisah biaya sebenarnya dari perbandingan ini, dan itulah sebabnya baseline akan tetap menjadi status default untuk pekerjaan batch bahasa Inggris bervolume tinggi untuk waktu yang lama. Ekonomi model terkelola baru menutup ketika fitur-fitur yang disertakannya — diarization, pemformatan, kontrol kosakata — akan menyita waktu rekayasa Anda untuk dirakit di atas Whisper.

Bahasa dan streaming

Whisper Large v3 Turbo mendaftarkan 99 bahasa dibandingkan dengan 85+ milik G​emini, tetapi dalam praktiknya, cerita multibahasa berbeda: Whisper mentranskripsikan semua 99 dalam satu proses tanpa deteksi otomatis, dan akurasinya paling menurun pada bahasa bersumber daya rendah dan berisik — itulah trade-off dari model hasil distilasi. G​emini mendeteksi otomatis di antara 85+ bahasanya, dan Go​ogle menyoroti aksen dan dialek regional. Untuk streaming, Whisper tidak memiliki model real-time bawaan; penerapan real-time menggunakan faster-whisper dan kerangka kerja serupa di perangkat keras Anda sendiri, sementara G​emini 3.​5 Transcribe memiliki endpoint live yang dirancang khusus dengan klaim latensi sub-detik dan harga yang sepadan. Jika beban kerja Anda bersifat live dan multibahasa, endpoint terkelola lebih sederhana dioperasikan; jika bersifat batch dan berbahasa Inggris, baseline terbuka lebih murah.

Vonisnya, apa adanya.

Whisper Large v3 Turbo tetap menjadi pilihan default yang tepat untuk transkripsi batch bahasa Inggris dalam skala besar, untuk apa pun yang harus berjalan di infrastruktur Anda sendiri, dan untuk tim yang menginginkan artefak yang beku dan dapat diaudit. Gemini 3.​5 Transcribe adalah pilihan yang tepat ketika transkrip harus lebih dari sekadar kata-kata — label pembicara, format yang bersih, kosakata domain, cakupan multibahasa, atau kait agen — dan ketika Anda bersedia membayar per penggunaan untuk fitur-fitur tersebut. Keduanya hidup berdampingan, dan pola yang membuat hidup berdampingan itu murah adalah batas perutean: transkriber yang cocok dengan audio, lalu lapisan LLM yang memutuskan apa yang terjadi pada teks. Lapisan itulah yang dioperasikan OrcaRouter — satu API di lebih dari 200 model, failover otomatis antar penyedia, dan DSL perutean untuk menyusun beberapa model dalam satu panggilan. Tidak ada model ucapan yang dihosting di sisi kami; pilihan transkripsi adalah antara GPU Anda dan meteran Go​ogle, dan keduanya akan ada untuk waktu yang lama.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube