Kartu hero artikel yang bertuliskan 'Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo' dengan lencana 'PERBANDINGAN MODEL' dan subjudul 'Apa yang masih lebih baik dilakukan baseline gratis', dengan chip yang bertuliskan 2,7% vs 4,07% WER, $0,20 per jam vs bobot MIT, 0,49s vs 1-5s dihosting sendiri dan terkelola vs dimiliki, di atas gradien putih ke biru dengan logo OrcaRouter di kanan bawah.
Guides & Insights

Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo: Apa yang Masih Lebih Baik Dilakukan Baseline Gratis

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Whisper Large v3 Turbo telah menjadi jawaban default untuk "kita perlu transkripsi" sejak dirilis di bawah lisensi MIT pada 1 Oktober 2024, dan tidak ada apa pun tentang Grok Voice Transcribe 2.0 yang mengubah alasannya. Model baru SpaceXAI, yang dikirim pada 18 September 2026, adalah alat transkripsi yang benar-benar lebih baik dengan selisih yang lebar — tingkat kesalahan kata 2,7% untuk transkrip final dan 3,4% untuk parsial pertama pada papan AA-WER Streaming Artificial Analysis, dibandingkan angka keluarga Whisper sebesar 4,07% pada papan non-streaming, dengan Turbo sendiri biasanya beberapa persepuluh poin di belakang Large v3 penuh yang menjadi asal distilasinya. Harganya juga $0,10 per jam audio untuk batch dan $0,20 per jam untuk streaming. Whisper Large v3 Turbo adalah file 1,6 GB dengan 809 juta parameter yang berjalan di perangkat keras Anda sendiri, tidak menghitung apa pun, tidak mengirim audio ke mana pun, dan tidak memiliki batas laju, batas konkurensi, maupun jadwal penghentian. Perbandingannya bukan antara model yang lebih baik dan yang lebih buruk. Ini antara menyewa akurasi dan memiliki komponen.

Jendela tiga puluh detik adalah keseluruhan arsitekturnya

Whisper Large v3 Turbo mewarisi struktur setiap model Whisper: audio diproses dalam jendela tetap berdurasi 30 detik, encoder dijalankan sekali per jendela, dan decoder mengeluarkan teks untuk potongan tersebut. Turbo membuatnya lebih murah — empat lapisan decoder alih-alih tiga puluh dua, sekitar 8× lebih cepat daripada Large v3, sekitar 6 GB VRAM alih-alih 10 — tetapi tidak mengubah bentuknya. Tidak ada gagasan tentang "kalimat sejauh ini" di dalam model, karena tidak ada status persisten antarjendela.

Satu fakta desain itu menjelaskan semua konsekuensi di hilirnya. Tidak ada streaming native, karena streaming mengharuskan komitmen pada output parsial di tengah ujaran dan model tidak memiliki mekanisme untuk itu. Penerapan Whisper real-time memang ada, tetapi itu adalah pemotongan ditambah deteksi aktivitas suara ditambah lapisan penyambungan yang ditulis seseorang dan kini dipelihara, dan latensi yang dihasilkan dari pipeline itu diukur dalam detik, bukan setengah detik yang dicapai Grok Voice Transcribe 2.0. Tidak ada diarisasi pembicara, karena diarisasi adalah masalah terpisah tentang siapa yang berbicara, bukan tentang apa yang dikatakan. Dan varian Turbo secara khusus mengembalikan teks biasa — tanpa stempel waktu, tanpa skor keyakinan, tanpa normalisasi teks terbalik yang mengubah angka dan alamat email yang diucapkan menjadi bentuk tertulis.

Grok Voice Transcribe 2.0 dibangun dengan pendekatan yang terbalik. Streaming adalah transport utama, batch adalah bobot yang sama di balik endpoint REST, dan daftar fiturnya terbaca seperti daftar hal yang Whisper serahkan ke aplikasi: timestamp tingkat kata dengan keyakinan per kata, diarisasi pembicara disertakan tanpa biaya tambahan, transkripsi multisaluran hingga 8 saluran independen, bias istilah kunci hingga 100 istilah domain per permintaan, normalisasi teks invers di 25 bahasa, penghapusan kata pengisi, dan deteksi akhir giliran Smart Turn untuk agen suara. Jika Anda selama ini memelihara pipeline chunking-and-stitching di sekitar Whisper, daftar itu adalah deskripsi dari kode yang Anda tulis.

Kesenjangan akurasi, dan mengapa itu lebih kecil dari yang terlihat

• Akurasi transkrip akhir (streaming) — Grok Voice Transcribe 2.0 pada 2,7% WER di AA-WER Streaming vs tidak ada entri Whisper Large v3 Turbo, karena model tersebut tidak dapat melakukan streaming secara native

• Akurasi batch — Grok Voice Transcribe 2.0 pada 2,29% AA-WER vs Whisper Large v3 pada 4,07% di papan non-streaming Artificial Analysis, dengan Turbo biasanya tertinggal 0,4 hingga 0,6 poin dari Large v3 penuh dalam pengujian independen

• Audio bahasa Inggris yang bersih — Whisper Large v3 Turbo mencapai sekitar 2,1% WER pada LibriSpeech test-clean dan sekitar 4,2% pada test-other, sehingga pada ucapan berkualitas studio, selisih dengan API terdepan menyempit hingga hampir tidak ada

• Audio dunia nyata — tolok ukur independen yang sama menempatkan Turbo pada sekitar 4,6% untuk panggilan bisnis dua penutur dan 8–12% pada audio bising, dan di sinilah keunggulan model frontier melebar

• Throughput batch — Grok Voice Transcribe 2.0 sekitar 162× waktu nyata vs Whisper Large v3 Turbo sekitar 80× pada satu GPU konsumen sederhana, dengan perangkat keras penyajian yang lebih cepat mencapai kelipatan dari itu

• Latensi streaming — 0,49 detik ke hasil parsial pertama pada Grok Voice Transcribe 2.0 vs 1–5 detik untuk pipeline streaming Whisper yang dihosting sendiri, yang merupakan kode perekat plus VAD, bukan kemampuan model

Pembacaan yang jujur atas daftar itu adalah bahwa argumen akurasi untuk membayar memang nyata tetapi bersifat kondisional. Pada bahasa Inggris yang bersih, hanya satu pembicara, dan terekam dengan baik, Whisper Large v3 Turbo sudah cukup dekat sehingga perbedaannya jarang mengubah hasil. Pada telefoni 8 kHz, audio pusat panggilan yang bising, ucapan beraksen, dan frasa pendek khusus domain — kumpulan persis yang menjadi acuan SpaceXAI dalam menyetel 2.0, tempat angka yang dilaporkannya sendiri bergerak dari 10,6% ke 7,1% pada telefoni dan 20,6% ke 6,8% pada perintah multibahasa pendek — kesenjangannya menjadi perbedaan antara transkrip yang bisa Anda jadikan dasar perutean dan transkrip yang harus Anda baca. Itu adalah angka yang dilaporkan perusahaan berdasarkan audio milik perusahaan sendiri, belum direproduksi oleh siapa pun di luar SpaceXAI, dan arah yang ditunjukkannya konsisten dengan setiap uji independen Whisper pada audio yang terdegradasi.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo — the scoreboard': the left column gives Grok Voice Transcribe 2.0 native streaming with a 0.49s partial, 2.29% batch WER, included diarization, word timestamps with confidence scores, $0.20 per streaming hour and a vendor API data path; the right column gives Whisper Large v3 Turbo self-built chunking only, 4.07% for full v3, no diarization, no timestamps in Turbo, MIT weights where you pay compute, and a data path that stays on your own hardware.

Perbandingan biaya bukanlah $0,10 versus $0

Lisensi Whisper tidak berbiaya; menjalankannya tidak. Instance GPU yang menampung model 1,6 GB dalam VRAM 6 GB dan mentranskripsi pada kecepatan sekitar 80× waktu nyata adalah pos biaya yang sebenarnya, dan pada tarif GPU cloud yang umum, itu berada dalam orde besaran yang sama dengan API yang dihosting untuk beban kerja berkelanjutan — dengan pengecualian penting bahwa Anda membayar kapasitas, terlepas dari ada atau tidaknya audio yang mengalir. Endpoint Whisper yang dihosting tersedia dalam rentang harga yang lebar, dari di bawah $1,20 per 1.000 menit di ujung termurah hingga beberapa dolar, dan variasi ini adalah pengingat berguna bahwa "Whisper" adalah sebuah model, bukan tingkat layanan. Papan harga ternormalisasi Artificial Analysis menempatkan endpoint Whisper Large v3 yang dihosting termurah pada $0,50 dan $1,15 per 1.000 menit, yang keduanya lebih murah daripada tarif batch Grok Voice Transcribe 2.0 sebesar $1,67 — tetapi tidak satu pun dari endpoint tersebut milik Anda, dan keduanya disertai batas laju serta kebijakan retensi milik orang lain.

Di sinilah self-hosting menang mutlak: pada volume dengan pola yang melonjak-lonjak. Arsip media berdurasi sepuluh ribu jam memakan biaya yang sama di GPU Anda sendiri, baik Anda memprosesnya dalam seminggu atau setahun, dan tidak ada meter per jam yang berjalan selagi Anda memutuskan. Pipeline kepatuhan yang tidak boleh pernah mengirim audio ke luar jaringan tidak memiliki alternatif hosted pada harga berapa pun, karena persyaratannya bersifat arsitektural, bukan finansial. Dan fine-tuning hanya tersedia bagi Anda jika Anda memegang bobotnya: lisensi MIT Whisper memungkinkan Anda mengambil model 809M-parameter dan menyesuaikannya untuk satu pembicara, satu aksen, atau kosakata domain yang sempit, yang merupakan kemampuan yang tidak diekspos API mana pun pada titik harga berapa pun.

Kebalikannya adalah harga model yang dihosting bisa berubah sewaktu-waktu. SpaceXAI tidak mengubah tarifnya saat beralih dari 1.0 ke 2.0 — peningkatan model dengan harga yang tetap — dan MAI-Transcribe-2 milik Microsoft hadir dengan harga yang persis sama, yaitu $0,10 per jam audio, yang menunjukkan di mana batas bawah frontier berada. Jika Anda merutekan melalui OrcaRouter, harga daftar tersebut diteruskan tanpa markup 0%, sehingga pemotongan harga dari vendor langsung sampai ke tagihan Anda pada hari itu juga, bukan setelah satu siklus penetapan harga ulang. Itu adalah keunggulan nyata dari sisi sewa dalam perbandingan ini, dan hal itu layak ditimbang dengan fakta bahwa sisi gratis sama sekali tidak pernah mengirimkan tagihan kepada Anda.

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard showing Whisper Large v3 at 4.07% AA-WER and 118.9x real time at $1.15 per 1,000 minutes, alongside the cheaper hosted Whisper endpoints and the frontier rows for comparison.

Apa sebenarnya kegunaan masing-masing

Simpan Whisper Large v3 Turbo ketika audio sudah berupa file, volumenya tinggi atau tidak teratur, rekamannya cukup bersih, dan baik data tidak dapat keluar dari jaringan Anda maupun anggaran tidak dapat menyerap biaya per jam. Ini tetap menjadi pilihan yang tepat untuk arsip offline, transkripsi edge dan on-device di mana model 1,6 GB dikuantisasi agar muat, pipeline batch di mana throughput menjadi kendala, bukan latensi, dan proyek apa pun di mana fine-tuning pada audio Anda sendiri adalah jalur menuju akurasi yang Anda butuhkan. Perkakas di sekitarnya — whisper.cpp untuk edge, faster-whisper untuk produksi, build GGUF untuk memori terbatas — telah memiliki dua tahun pematangan oleh komunitas di belakangnya, yang merupakan bentuk keandalan yang tidak dimiliki API yang baru berusia dua hari.

Beralihlah ke Grok Voice Transcribe 2.0 ketika audio masih terus masuk, ketika rekaman mengalami penurunan kualitas, ketika Anda perlu mengetahui siapa yang berbicara dan kapan, ketika kosakata domain harus diberi bias alih-alih di-fine-tune, atau ketika aplikasi bertindak atas transkrip parsial sebelum pembicara selesai. Jalur peningkatannya adalah satu parameter pada integrasi yang sudah ada dan pin kembali ke 1.0 jika terjadi kesalahan, yang membuat uji cobanya murah. Perlu dicatat bahwa migrasi balik tidaklah murah: kode yang ditulis terhadap API streaming dengan diarisasi dan deteksi giliran tidak dapat diturunkan dengan mulus menjadi model batch yang mengembalikan teks biasa, yang menjadi argumen untuk membuktikan jalur hosted pada sebagian kecil audio nyata Anda sebelum mengikatkan pipeline ke sana.

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

Di mana keputusan itu sebenarnya dibuat

Sebagian besar tim yang menjalankan Whisper pada skala apa pun tidak memilih di antara kedua model ini, mereka menjalankan hibrida: Whisper untuk arsip karena gratis dan cukup baik pada audio bersih, API frontier untuk jalur langsung karena tidak ada yang lain yang melakukan streaming pada WER parsial 3,4%, dan model ketiga di hilir yang merangkum, mengklasifikasikan, atau bertindak atas teks apa pun yang dihasilkan. Langkah ketiga itulah tempat penyebaran biasanya terjadi — kontrak vendor kedua untuk model penalaran, kumpulan kredensial kedua, batas laju kedua yang harus dipantau. OrcaRouter meruntuhkan lapisan itu: satu kunci di lebih dari 200 model, failover otomatis saat penyedia menurun, dan DSL perutean jika Anda ingin mengirim transkrip yang sama melalui beberapa model dan membandingkannya sebelum memilih satu. Panggilan transkripsi itu sendiri tetap mengarah ke vendor mana pun yang Anda pilih; yang berhenti berlipat ganda adalah segala sesuatu setelahnya.

Hal yang perlu diperhatikan di sisi Whisper bukanlah checkpoint baru — keluarga ini belum bergerak sejak Turbo, dan perhatian OpenAI telah beralih ke lini GPT Transcribe. Yang perlu diperhatikan adalah lapisan serving. Setiap tahun perkakas yang di-host sendiri menjadi lebih cepat dan perangkat keras yang dibutuhkannya semakin kecil, dan setiap peningkatan di sana mempersempit alasan untuk membayar per jam. Hal yang perlu diperhatikan di sisi SpaceXAI adalah perubahan default: ketika 2.0 menjadi default dan 1.0 ditinggalkan, setiap integrasi yang tidak pernah menyebutkan model akan berpindah sekaligus, termasuk latensi. Tidak ada dari kedua perkembangan ini yang mengubah pembagian mendasar. Satu model yang Anda miliki dan setel, satu model yang Anda sewa dan panggil, dan jawaban jujur bahwa sebagian besar stack produksi akhirnya menjalankan keduanya.