
Gemini 3.5 Transcribe vs Whisper Large v3 Turbo: apakah baseline perlu diganti?
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
Whisper Large v3 Turbo adalah model yang menjadi default untuk frasa "speech-to-text" bagi sebagian besar industri, dan Gemini 3.5 Transcribe adalah model transkripsi Google pertama yang secara eksplisit dijual sebagai penantang baseline tersebut, bukan sebagai API ucapan generik. Gemini 3.5 Transcribe, dalam pratinjau publik sejak 26 Agustus 2026, membingkai ulang transkripsi sebagai tugas penalaran — ia menyelesaikan koreksi diri, memformat keluaran, menentukan pembicara, dan memanggil model Gemini lain secara mandiri. Whisper Large v3 Turbo adalah distilasi 809 juta parameter dari Whisper Large-v3 oleh OpenAI, berlisensi MIT, dapat di-hosting sendiri, mendukung 99 bahasa, dan kira-kira empat hingga delapan kali lebih cepat daripada model asalnya tergantung pada perangkat kerasnya. Satu adalah lapisan kecerdasan terkelola di atas audio; yang lain adalah komponen gratis yang dipahami dengan baik yang bisa Anda jalankan di mana pun Anda mau. Pertanyaan yang hendak dijawab oleh halaman ini lebih sempit dan lebih berguna daripada "mana yang lebih baik": kapan baseline berhenti menjadi cukup baik?
Garis dasarnya, kalau-kalau kamu lupa betapa bagusnya itu.
Whisper Large v3 Turbo pantas mendapatkan status default-nya, jadi argumen untuknya dikemukakan lebih dulu:
• Dapat berjalan di mana saja — lisensi MIT, bobot terbuka, dapat diinstal di laptop, satu GPU, atau fungsi serverless. Tanpa vendor, tanpa meteran, tanpa data yang meninggalkan jaringan Anda.
• Ini cepat — decoder hasil distilasi (32 lapisan encoder, 4 lapisan decoder, turun dari 32) membuatnya kira-kira empat kali lebih cepat daripada Whisper Large-v3 pada perangkat keras umum, bahkan lebih cepat lagi di sebagian perangkat, sambil mempertahankan sebagian besar akurasinya. Angka OpenAI sendiri sekitar delapan kali lipat pada A100.
Ini mencakup 99 bahasa untuk transkripsi, daftar yang lebih luas daripada 85+ milik Gemini 3.5 Transcribe.
• Akurasinya terdokumentasi dengan baik: 2.1% WER pada LibriSpeech test-clean, 4.2% pada test-other, 9.1% pada Common Voice English — angka-angka yang telah direplikasi di seluruh komunitas selama bertahun-tahun.
{{1}}Ekosistemnya sangat besar — faster-whisper, whisper.cpp, ekspor ONNX, dan semua kerangka kerja inferensi yang sudah Anda gunakan. Jika Anda bisa menjalankan model, Anda bisa menjalankan yang satu ini.

Untuk transkripsi batch bahasa Inggris dan bahasa yang mendekati Inggris dalam skala besar, Whisper Large v3 Turbo adalah pemimpin pasar karena alasan struktural yang tidak dapat dengan mudah dikalahkan oleh celah tolok ukur mana pun: ia gratis, ia milik Anda, dan ia ada di mana-mana.

Apa yang ditambahkan Gemini 3.5 Transcribe
Nilai penantang terkelola bukanlah bahwa ia mengungguli baseline pada bahasa Inggris yang bersih — itu adalah pertarungan yang bahkan angka-angka belum bisa selesaikan secara bersih. Nilainya adalah pekerjaan yang terjadi di atas kata-kata, yang secara eksplisit tidak dilakukan Whisper:
• Atribusi pembicara — hingga tiga pembicara dengan stempel waktu per kata, dalam model dasar. Whisper mentranskripsikan satu aliran ucapan; ia tidak memiliki konsep tentang siapa yang mengatakan apa.
• Pemformatan cerdas — disfluensi dihilangkan, koreksi diri dirapikan, tanda baca dan kapitalisasi diterapkan. Whisper mengembalikan kata-kata sebagaimana diucapkan, lengkap dengan segala 'um'-nya.
• Kosakata kustom — cenderung memihak pada jargon dan ejaan yang tidak lazim. Whisper tidak memiliki mekanisme semacam itu; Anda melakukan pasca-pemrosesan atau fine-tuning.
• Pemanggilan fungsi — transkrip dapat meneruskan ke model Gemini lainnya, menjadikan transkripsi sebagai langkah dalam pipeline agen, bukan keluaran akhir.
• Sesi panjang — kira-kira satu jam audio dalam satu kali proses (konteks 96K yang dilaporkan pers) dibandingkan dengan kebutuhan praktis Whisper untuk memotong dan menyambung file panjang.
Itu adalah produk yang berbeda. Itulah yang dimaksud Google dengan "transkripsi cerdas," dan itu adalah bagian dari perbandingan yang tidak bergantung pada aritmetika benchmark.
Pertanyaan akurasi yang belum bisa dijawab dengan tuntas oleh siapa pun.
Angka-angka utama kedua model tersebut sebenarnya tidak saling berhadapan. WER non-streaming sebesar 2,6% dari Gemini 3.5 Transcribe adalah pengukuran Artificial Analysis yang dikutip oleh Google, dihitung dari 85+ bahasa. WER 2,1% pada LibriSpeech test-clean milik Whisper Large v3 Turbo adalah tolok ukur bahasa Inggris dari makalah distilasi OpenAI sendiri, yang telah direplikasi secara luas. Korpusnya berbeda, cakupan bahasanya berbeda, vendornya berbeda. Yang dapat dikatakan dengan jujur: pada bahasa Inggris yang bersih, baseline terbuka dan penantang terkelola tersebut masuk akal bila berada di kisaran yang sama, dan keunggulan model terkelola terletak pada fitur multibahasa dan strukturalnya, bukan pada kemenangan WER bahasa Inggris yang telah terbukti. Materi peluncuran Google tidak memuat perbandingan head-to-head dengan model-model keluarga Whisper, dan perbandingan adversarial independen pun belum ada karena Gemini 3.5 Transcribe baru dipublikasikan sehari. Sampai perbandingan tersebut muncul, mahkota akurasi belum diklaim, dan artikel mana pun — termasuk artikel ini — yang menyatakan pemenang WER berdasarkan kedua angka tersebut adalah berlebihan.

Biaya: gratis untuk dijalankan dibandingkan $0.005 per menit
Whisper Large v3 Turbo memiliki biaya perangkat keras dan tanpa meteran. Jika dijalankan di GPU yang sudah Anda miliki, biaya marjinal per menit transkripsi hampir nol; jika menyewa GPU, biayanya sesuai dengan biaya instance selama bekerja. Gemini 3.5 Transcribe mengenakan biaya sekitar $0,005 per menit audio gabungan, dengan SKU live sekitar $0,009 per menit dan ada tingkat gratis. Untuk seribu jam audio, itu sekitar $300 pada meteran Gemini dibandingkan dengan beberapa dolar waktu GPU pada baseline terbuka. Kesenjangan itulah kisah biaya sebenarnya dari perbandingan ini, dan itulah sebabnya baseline akan tetap menjadi status default untuk pekerjaan batch bahasa Inggris bervolume tinggi untuk waktu yang lama. Ekonomi model terkelola baru menutup ketika fitur-fitur yang disertakannya — diarization, pemformatan, kontrol kosakata — akan menyita waktu rekayasa Anda untuk dirakit di atas Whisper.
Bahasa dan streaming
Whisper Large v3 Turbo mendaftarkan 99 bahasa dibandingkan dengan 85+ milik Gemini, tetapi dalam praktiknya, cerita multibahasa berbeda: Whisper mentranskripsikan semua 99 dalam satu proses tanpa deteksi otomatis, dan akurasinya paling menurun pada bahasa bersumber daya rendah dan berisik — itulah trade-off dari model hasil distilasi. Gemini mendeteksi otomatis di antara 85+ bahasanya, dan Google menyoroti aksen dan dialek regional. Untuk streaming, Whisper tidak memiliki model real-time bawaan; penerapan real-time menggunakan faster-whisper dan kerangka kerja serupa di perangkat keras Anda sendiri, sementara Gemini 3.5 Transcribe memiliki endpoint live yang dirancang khusus dengan klaim latensi sub-detik dan harga yang sepadan. Jika beban kerja Anda bersifat live dan multibahasa, endpoint terkelola lebih sederhana dioperasikan; jika bersifat batch dan berbahasa Inggris, baseline terbuka lebih murah.
Vonisnya, apa adanya.
Whisper Large v3 Turbo tetap menjadi pilihan default yang tepat untuk transkripsi batch bahasa Inggris dalam skala besar, untuk apa pun yang harus berjalan di infrastruktur Anda sendiri, dan untuk tim yang menginginkan artefak yang beku dan dapat diaudit. Gemini 3.5 Transcribe adalah pilihan yang tepat ketika transkrip harus lebih dari sekadar kata-kata — label pembicara, format yang bersih, kosakata domain, cakupan multibahasa, atau kait agen — dan ketika Anda bersedia membayar per penggunaan untuk fitur-fitur tersebut. Keduanya hidup berdampingan, dan pola yang membuat hidup berdampingan itu murah adalah batas perutean: transkriber yang cocok dengan audio, lalu lapisan LLM yang memutuskan apa yang terjadi pada teks. Lapisan itulah yang dioperasikan OrcaRouter — satu API di lebih dari 200 model, failover otomatis antar penyedia, dan DSL perutean untuk menyusun beberapa model dalam satu panggilan. Tidak ada model ucapan yang dihosting di sisi kami; pilihan transkripsi adalah antara GPU Anda dan meteran Google, dan keduanya akan ada untuk waktu yang lama.
