Kartu judul hero yang dihasilkan dengan judul utama 'StepAudio 3 ASR vs Whisper Large v3 Turbo' dan subjudul '1,7 persen berbanding 4,6 persen, dan tidak ada pengujian head-to-head yang ada', di atas footer 'StepAudio menurut Artificial Analysis; Whisper menurut Hugging Face.'
Guides & Insights

StepAudio 3 ASR vs Whisper Large v3 Turbo: 1,7% Berbanding 4,6%, dan Tidak Ada yang Menjalankan Uji Tersebut

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Perbandingan yang Anda inginkan tidak ada. StepAudio 3 ASR dan Whisper Large v3 Turboberada pada indeks AA-WER Artificial Analysis yang sama untuk speech to text non-streaming — tingkat kesalahan kata 1,7% dibandingkan angka dalam kisaran 4 hingga 5,5% — dan per akhir September 2026 belum ada yang menerbitkan perbandingan langsung pada audio yang identik. Bukan StepFun, bukan para pengelola Whisper, bukan laboratorium independen. Dokumentasi StepFun sendiri membandingkan dengan Doubao ASR 2.0, Seed 2.0 Lite dan HY3.0 ASR Preview, semuanya produk ASR Tiongkok. Sisi Whisper tidak memiliki vendor yang menerbitkan perbandingan sama sekali, karena Whisper Large v3 Turbo telah dapat diunduh selama bertahun-tahun dan angkanya bergantung pada siapa yang menyajikannya.

Jadi halaman ini melakukan versi yang jujur: halaman ini membaca satu papan yang mengukur keduanya, memisahkan apa yang dapat dibandingkan dari yang tidak, dan menyatakan dengan gamblang di mana buktinya habis. Jawaban singkatnya adalah bahwa kesenjangan pada akurasi itu nyata dan lebarnya sekitar tiga poin, dan kesenjangan pada semua hal lainnya — harga, lisensi, kemampuan penerapan — bergerak ke arah sebaliknya dan lebih besar.

Apa sebenarnya masing-masing itu

StepAudio 3 ASR adalah model transkripsi terkelola yang dirilis oleh StepFun pada 15 September 2026 sebagai bagian dari keluarga audio StepAudio 3 yang terdiri dari lima model. Model ini diakses melalui satu endpoint streaming yang mengembalikan teks secara bertahap selama decoding dan transkrip akhir di akhir proses. StepFun mendeskripsikannya sebagai transkripsi dengan model bahasa yang dilampirkan untuk konteks, disetel untuk audio medis, hukum, keuangan, otomotif, dan pemrograman serta untuk input yang membuat recogniser konvensional kewalahan — ucapan berbisik, ucapan cepat, ucapan tersambung, nyanyian, dan audio dengan musik di latarnya. Tidak ada bobot terbuka, tidak ada jalur on-premise, dan tidak ada opsi self-hosting di tingkat mana pun. Tarif daftar yang dipublikasikan adalah 2,8 yuan per jam, sekitar $6,67 per 1.000 menit pada sumbu harga milik papan peringkat itu sendiri.

Whisper Large v3 Turbo adalah model dengan bobot terbuka yang diterbitkan oleh OpenAI di bawah lisensi MIT: 809 juta parameter, 99 bahasa, turunan dari Whisper large-v3 yang dipangkas dan disetel secara halus dengan lapisan decoder yang dikurangi. Model ini telah diunduh jutaan kali dan disediakan secara komersial oleh banyak platform serta dapat dijalankan di perangkat keras Anda sendiri. Properti terakhir itulah inti perbandingannya, dan itulah alasan mengapa selisih akurasi bukan satu-satunya angka yang penting.

Satu-satunya papan yang mengukur keduanya

Indeks AA-WER milik Artificial Analysis melaporkan persentase kata yang ditranskripsikan secara salah, semakin rendah semakin baik, dan versi 2-nya menggabungkan tiga kumpulan data: AA-AgentTalk sebesar 50%, VoxPopuli-Cleaned-AA sebesar 25%, dan Earnings22-Cleaned-AA sebesar 25%. Tampilan non-streaming menampilkan 36 dari 71 model yang dilacaknya. Kedua model muncul di dalamnya, yang lebih banyak daripada yang dapat diklaim oleh sebagian besar perbandingan.

Baca sebagaimana papan mencantumkannya:

• StepAudio 3 ASR — 1,7% AA-WER, sekitar $6,67 per 1.000 menit audio

• Whisper Large v3 Turbo, satu endpoint yang dihosting — AA-WER 4,6%, sekitar $0,67 per 1.000 menit

• Whisper Large v3 Turbo, endpoint hosted kedua — AA-WER 5,5%, sekitar $15,00 per 1.000 menit

• Whisper Large v3, generasi open-weights yang berbeda — 4,1% pada satu endpoint, 10,1% pada endpoint lainnya

• StepAudio 2.5 ASR, generasi sebelumnya dari StepFun — 4,7%

Dua baris terakhir adalah yang paling instruktif di papan itu, dan sama sekali bukan tentang StepFun. Bobot Whisper terbuka yang sama mencetak skor 4,1% di satu endpoint dan 10,1% di endpoint lain. Itu adalah selisih 6 poin pada parameter yang identik, yang sepenuhnya dihasilkan oleh perbedaan dalam penyajian: strategi chunking, perangkat keras, konfigurasi decoding, dan cara setiap host menangani audio yang lebih panjang daripada batas internalnya. Catatan kaki papan itu sendiri menyatakan hal itu, dengan mencatat bahwa untuk salah satu datasetnya, beberapa model audionya dipotong menjadi sekitar sembilan menit dan yang lain menjadi sekitar tiga puluh detik karena batas waktu.

Yang berarti perbandingan "StepAudio 3 ASR vs Whisper Large v3 Turbo" sebenarnya adalah dua perbandingan yang bertumpuk. Model dibandingkan dengan bobotnya, dan model dibandingkan dengan endpoint mana pun yang kebetulan Anda gunakan sebagai tolok ukur. Perbandingan kedua bervariasi lebih besar daripada yang pertama.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs Whisper Large v3 Turbo — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', Price per 1000 min '6.67 dollars', Weights 'hosted only', Licence 'proprietary', Deployment 'StepFun API', Head-to-head test 'none published'. Right column Whisper Large v3 Turbo reads AA-WER '4.6% to 5.5%', Price per 1000 min '0.67 to 15 dollars', Weights '809M open', Licence 'MIT', Deployment 'self-host or any host', Head-to-head test 'none published'. Footer reads 'StepAudio per Artificial Analysis; Whisper per Hugging Face and Artificial Analysis.'

Dari mana kesenjangan akurasi berasal, dan sejauh mana kita bisa memercayainya

Tiga poin tingkat kesalahan kata adalah selisih yang besar dalam bidang di mana lima sistem teratas hanya terpaut 0,6 poin satu sama lain. Angka ini juga satu-satunya angka dalam perbandingan ini yang diukur oleh pihak ketiga, dan angka ini disertai catatan-catatan nyata yang bisa berdampak ke dua arah.

Menentang StepAudio 3 ASR: angka tersebut adalah indeks gabungan, dan campurannya adalah 50% AA-AgentTalk — kumpulan data percakapan agen. Model yang disetel untuk transkripsi khusus domain dengan LLM yang dilampirkan untuk konteks sangat cocok untuk bentuk audio seperti itu. Ubah bobot indeks ke arah ucapan yang dibaca atau berita siaran dan urutan peringkatnya bisa mengetat. Selain itu, masih belum ada laporan teknis yang diterbitkan untuk model ASR tersebut, tidak ada set pengujian yang dirilis, tidak ada konfigurasi dekode, dan tidak ada protokol yang dapat direproduksi dari siapa pun di luar StepFun.

Melawan Whisper Large v3 Turbo: angka 4,6% itu adalah angka dari satu endpoint yang dihosting, bukan properti dari modelnya. Bobotnya tetap dan publik; skornya tidak. Tim yang menjalankan bobot yang sama dengan hati-hati, dengan chunking yang sesuai domain dan konfigurasi dekoder yang baik, bisa mencapai hasil yang jauh lebih baik daripada baris di papan peringkat itu — dan tim yang menjalankannya dengan sembarangan bisa mencapai hasil yang lebih buruk daripada 10,1% yang dicatat oleh generasi bobot terbuka lainnya. Ringkasan yang jujur adalah bahwa sisi bobot terbuka dari perbandingan ini memiliki batas bawah yang bisa Anda ukur dan batas atas yang harus Anda perjuangkan.

Yang hilang adalah angka yang akan menyelesaikannya: kedua sistem, satu set audio, satu protokol dekode, dipublikasikan. Belum ada yang menjalankannya, dan sampai ada yang melakukannya, "1.7% vs 4.6%" adalah perbandingan dua pengukuran yang diambil dalam kondisi berbeda, bukan pengukuran dua sistem yang diadu satu sama lain.

Empat dimensi lainnya, di mana Whisper menang dengan margin lebih besar.

Akurasi adalah dimensi tempat StepFun unggul. Untuk sisa daftar, model open-weight tidak mendekat, dan inilah yang menentukan apakah suatu deployment memungkinkan sama sekali:

• Lisensi dan bobot — bobot terbuka berlisensi MIT dengan 809 juta parameter vs API yang dihosting tanpa bobot yang dipublikasikan pada tingkat mana pun.

• Deployment — dihosting sendiri, on-premise, air-gapped, atau melalui salah satu dari puluhan platform komersial vs hanya API StepFun.

• Batas bawah biaya — sekitar $0,67 per 1.000 menit pada satu endpoint yang dihosting, dan bahkan lebih rendah jika Anda menjalankannya sendiri, dibandingkan sekitar $6,67 per 1.000 menit pada tarif yang dipublikasikan vendor.

• Residensi data — audio tidak pernah meninggalkan infrastruktur yang Anda kendalikan vs audio yang dikirim ke endpoint pihak ketiga.

• Risiko integrasi — model tidak dapat ditarik, diubah harganya, atau dihentikan di bawah Anda, karena Anda memegang bobotnya, bukan tarif hosted yang dapat berubah mengikuti daftar harga.

• Perilaku audio panjang — chunking adalah keputusan Anda dan dapat disesuaikan per file vs apa pun yang dilakukan endpoint vendor secara internal, yang tidak didokumentasikan.

Selisih harga itu kira-kira sepuluh banding satu dibandingkan endpoint Whisper yang lebih murah, dan itu adalah kebalikan dari apa yang terjadi di dalam lini StepFun sendiri: model yang digantikan oleh yang ini, StepAudio 2.5 ASR, tercantum pada 0,15 yuan per jam, dan tier saat ini tercantum pada 2,8. StepFun menaikkan tarif transkripsi sekitar sembilan belas kali untuk mendapatkan akurasi, yang menempatkannya di pasar yang berbeda dari model open-weights yang dihosting sendiri, bukan sebagai versi yang lebih mahal darinya.

Screenshot of the Hugging Face model card for whisper-large-v3-turbo, showing the MIT licence badge, Safetensors format and 99 languages tags, 6,637,070 downloads last month, and the note that the model is a finetuned version of a pruned Whisper large-v3 with the decoding layers reduced from 32 to 4.

Mana yang harus Anda pilih

Pembagian ini lebih rapi daripada kebanyakan adu langsung:

• Pilih Whisper Large v3 Turbo jika audionya biasa, volumenya tinggi, datanya tidak boleh keluar dari infrastruktur Anda, atau Anda memerlukan penerapan yang permanen dan harga yang stabil. Lisensi MIT berarti keputusan itu ada di tangan Anda untuk dibalik dan tidak ada yang bisa menariknya kembali.

• Gunakan StepAudio 3 ASR jika audionya benar-benar sulit — beraksen, dibisikkan, dinyanyikan, atau ada musik di latar belakangnya — atau jika domainnya adalah salah satu dari lima domain yang dioptimalkan StepFun. Itulah nilai lebih yang Anda dapatkan dari versi premium, dan pada audio seperti itu, selisih akurasi tiga poin adalah perbedaan antara transkrip yang bisa digunakan dan proses koreksi manual.

• Jangan memilih salah satu secara eksklusif jika Anda tidak tahu yang mana audio Anda. Biaya jika salah bersifat asimetris: jalur open-weights dapat diuji pada perangkat keras Anda sendiri seharga satu jam GPU, dan jalur hosted tidak memerlukan biaya untuk dicoba tetapi mengikat Anda pada tarif yang tidak dapat Anda kendalikan.

Argumen untuk hibrida lebih kuat di sini dibandingkan pada sebagian besar perbandingan, dan alasannya adalah sebaran endpoint di papan skor. Karena bobot Whisper yang sama menghasilkan skor antara 4,1% hingga 10,1% tergantung pada siapa yang menyajikannya, langkah praktisnya adalah merutekan jalur open-weights ke lebih dari satu host daripada berkomitmen pada satu host — yang merupakan hal yang diberikan oleh failover otomatis, dan itulah mekanisme yang sama yang memungkinkan Anda menempatkan model hosted di depan jalur produksi tanpa mempertaruhkan jalur tersebut padanya.

Bagaimana ini masuk ke dalam sebuah stack, dan apa yang kami layani dan tidak layani

Apa pun yang Anda pilih untuk transkripsi, transkripnya akan pergi ke suatu tempat. Peringkas, ekstraksi terstruktur, pemeriksaan kepatuhan, indeks pencarian — panggilan-panggilan itu bermuara pada model teks biasa, dan itulah bagian dari tagihan yang meningkat seiring penggunaan, bukan seiring menit audio. Model realtime milik StepFun sendiri mengiklankan pemanggilan alat dan eksekusi asinkron untuk tugas-tugas panjang, yang berarti bahkan lapisan audio terus-menerus menyerahkan pekerjaan kepada sesuatu yang bukan model audio.

Untuk menjelaskan cakupannya secara eksplisit, karena mudah untuk menyiratkan sebaliknya: baik StepAudio 3 ASR maupun Whisper Large v3 Turbo tidak ada di OrcaRouter. StepAudio diakses melalui API milik StepFun sendiri, dan bobot Whisper menjadi milik Anda untuk dijalankan atau dibawa ke platform hosting. Yang dibawa OrcaRouter adalah lapisan delegasi tempat transkrip dialirkan — hampir 200 model teks di balik satu API, dengan failover otomatis sehingga panggilan hilir tidak mati karena satu penyedia, DSL perutean yang menggabungkan beberapa model menjadi satu panggilan, dan fusi model ketika penilaian satu model tidak cukup. Ketika penyedia menerbitkan tarif, harga daftar itu diteruskan tanpa markup, sehingga perubahan harga sampai ke tagihan Anda pada hari diumumkan — yang, mengingat perbandingan ini memuat vendor yang menaikkan tarif transkripsinya sembilan belas kali lipat dalam satu rilis, bukanlah manfaat hipotetis.

Jika Anda akan membelanjakan uang sungguhan untuk pertanyaan akurasi, urutan yang murah adalah ini: jalankan bobot terbuka pada audio Anda sendiri terlebih dahulu, karena Anda bisa, dan karena angka yang Anda dapatkan akan lebih relevan daripada papan peringkat mana pun. Lalu putuskan apakah selisih yang tersisa layak dibayar sepuluh kali tarifnya. Sebagian besar tim akan menemukan bahwa itu layak untuk sebagian kecil trafik mereka dan tidak untuk sisanya, dan itu adalah masalah perutean, bukan pilihan model.

Apa yang bisa menyelesaikannya

Satu tes yang dipublikasikan. Kedua sistem, audio yang sama, protokol dekode yang sama, pembagian yang jujur antara tuturan yang dibaca, audio percakapan, dan kasus-kasus sulit yang diklaim StepFun telah disetel untuknya. Sampai itu ada, perbandingannya adalah indeks pihak ketiga di satu sisi dan sekumpulan bobot terbuka dengan skor yang bervariasi di sisi lain, dan satu-satunya cara yang bertanggung jawab untuk membacanya adalah sebagai titik awal, bukan jawaban.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR near the top at 1.7% and Whisper Large v3 Turbo rows further down at 4.6% and 5.5% on two different hosted endpoints, with the AA-WER v2 methodology line and the per-1000-minutes price axis visible.