Kartu judul hero yang dihasilkan dengan judul utama 'StepAudio 3 ASR vs StepAudio 3' dan subjudul 'Satu adalah model. Yang lain adalah lima produk dengan satu nama', di atas footer 'Angka StepFun sebagaimana diterbitkan September 2026.'
Guides & Insights

StepAudio 3 ASR vs StepAudio 3: Tidak Ada Model dengan Nama Itu

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Cari StepAudio 3 dan Anda akan menemukan sebuah keluarga, bukan model. Rilis audio StepFun pada 15 September 2026 menempatkan lima produk di bawah nama itu — Realtime, ASR, text-to-speech, Gen dan Music — dan produk transkripsi di antaranya, StepAudio 3 ASR, adalah yang telah menaiki papan peringkat sejak saat itu. Tingkat yang disebut dokumentasi StepFun sendiri sebagai model ASR terbesarnya hingga saat ini adalah StepAudio 3 ASR Max, dan saudara percakapan yang berbagi tulang punggung dengannya adalah StepAudio 3 Realtime. Jika Anda mencoba membandingkan "StepAudio 3 ASR" dengan "StepAudio 3", Anda membandingkan produk dengan lini produk, dan jawabannya sepenuhnya bergantung pada yang mana dari ketiganya yang sebenarnya Anda maksud.

Halaman ini menyelesaikannya. Ini bukan perbandingan pemasaran — ini adalah disambiguasi yang Anda butuhkan sebelum Anda dapat membaca lembar spesifikasi StepAudio 3 mana pun dengan benar, karena tiga nama di atas membawa harga, endpoint, dan mode kegagalan yang berbeda.

Mengapa nama itu ambigu

StepFun merilis seluruh stack audio dalam satu hari, dan konvensi penamaan itu membuat nama keluarga menjadi akar dari setiap nama produk. Itu rapi di slide peluncuran dan canggung di tempat lain. Artinya, pencarian untuk nama keluarga tersebut mengembalikan campuran lima produk berbeda, dan baris benchmark yang diberi label "StepAudio 3" bisa saja merujuk ke salah satu dari kelimanya.

Konsekuensi praktisnya adalah Anda tidak dapat mengetahui dari sebuah judul hal mana yang diukur. Postingan yang mengatakan "StepAudio 3 menduduki puncak papan peringkat transkripsi" sedang menjelaskan StepAudio 3 ASR. Postingan yang mengatakan "StepAudio 3 unggul dalam dinamika percakapan" sedang menjelaskan StepAudio 3 Realtime. Keduanya benar, keduanya adalah produk yang berbeda, dan keduanya tidak dapat saling menggantikan.

Ada ambiguitas kedua secara khusus di dalam lini ASR. Dokumentasi StepFun menyebut tier ASR Max sebagai model ASR terbesarnya hingga saat ini, dengan harga tersendiri dan endpoint tersendiri, sedangkan baris-baris papan peringkat publik memakai label yang lebih sederhana. Menentukan apakah keduanya adalah satu SKU dengan dua nama atau dua SKU adalah hal paling berguna yang dapat dilakukan halaman ini, dan bagian berikutnya melakukannya.

Tiga hal yang bisa dimaksudkan oleh nama tersebut

StepAudio 3 ASR — produk transkripsi. Endpoint streaming yang mengembalikan teks secara bertahap saat mendekode dan transkrip akhir di akhir. StepFun mendeskripsikannya sebagai transkripsi dengan model bahasa yang dilampirkan untuk konteks, yang disetel untuk audio medis, hukum, keuangan, otomotif, dan pemrograman, serta untuk input yang sulit seperti ucapan berbisik, ucapan cepat, tuturan tersambung, nyanyian, dan musik latar. Ini adalah model yang berada pada tingkat kesalahan kata 1,7% dalam indeks AA-WER Artificial Analysis untuk konversi ucapan ke teks non-streaming.

StepAudio 3 ASR Max — tier yang oleh dokumentasi StepFun disebut sebagai model ASR terbesarnya hingga saat ini. Model ini memiliki tarif daftar resmi sebesar 2,8 yuan per jam. Ini bukan transkripsi yang lebih murah; ini adalah puncak dari lini ASR.

StepAudio 3 Realtime — model percakapan dupleks penuh. Ia bernalar langsung atas ucapan alih-alih menjalankan rantai transkripsi-lalu-penalaran, dan transkripsi menjadi produk sampingannya. Ini bukan produk ASR, dan akurasinya pada tugas transkripsi bukanlah hal yang menjadi sasaran penyetelannya.

Semua hal lain dalam keluarga ini — TTS, Gen, Music — adalah pekerjaan yang sepenuhnya berbeda dan tidak boleh muncul sama sekali dalam perbandingan transkripsi.

Apakah ASR dan ASR Max model yang sama?

Bukti menunjukkan ya, dan pengecekannya bersifat aritmetika. StepFun mencantumkan tier ASR Max sebesar 2,8 yuan per jam. Dikonversi dengan kurs sekitar 7,1 yuan per dolar, itu sekitar $0,39 per jam, atau kira-kira $6,6 per 1.000 menit. Artificial Analysis mencantumkan model tersebut di papan peringkatnya sebesar $6,67 per 1.000 menit. Dua angka yang diterbitkan secara independen, satu dari daftar harga vendor dan satu dari papan pihak ketiga, selisihnya dalam satu sen satu sama lain. Itulah yang Anda harapkan jika baris di papan peringkat dan tarif daftar ASR Max menggambarkan SKU yang sama.

Ada baiknya kita tepat mengenai apa yang dibuktikan dan tidak dibuktikan oleh hal itu. Hal itu membuktikan bahwa sumbu harga di papan peringkat dan kartu tarif vendor merujuk pada produk yang sama dengan harga yang sama. Hal itu tidak membuktikan bahwa angka 1,7% di papan peringkat diukur pada endpoint persis yang akan Anda panggil, karena papan tersebut tidak memublikasikan konfigurasi decoding-nya atau endpoint yang diaksesnya. Jadi: produk yang sama, sangat mungkin; kondisi pengukuran yang sama, belum terverifikasi.

Yang pasti adalah lompatan antargenerasi di dalam lini ini. StepAudio 2.5 ASR berada di 4,7% pada papan yang sama dengan 0,15 yuan per jam. Tingkat saat ini adalah 1,7% dengan 2,8 yuan per jam. Itu berarti pengurangan 64% dalam tingkat kesalahan kata dengan tarif sekitar sembilan belas kali lipat — trade-off paling tajam di keluarga ini dan yang menentukan apakah peningkatan itu sepadan.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs StepAudio 2.5 ASR — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', List price '2.8 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'tuned for whisper and singing', Vendor gains 'Chinese down 9.3%'. Right column StepAudio 2.5 ASR reads AA-WER '4.7%', List price '0.15 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'not tuned for it', Vendor gains 'previous baseline'. Footer reads 'Accuracy figures per Artificial Analysis; the rest vendor-reported.'

Dimensi yang benar-benar berbeda

Setelah penamaannya disepakati, perbandingannya menyusut menjadi daftar singkat. Inilah yang mengubah sebuah keputusan:

• Akurasi — StepAudio 3 ASR sebesar 1,7% AA-WER non-streaming vs StepAudio 2.5 ASR sebesar 4,7% pada papan yang sama. Diukur oleh Artificial Analysis, bukan oleh StepFun.

• Harga — 2,8 yuan per jam vs 0,15 yuan per jam. Keduanya tarif daftar vendor, keduanya berlaku saat ini. Kira-kira 19 kali.

• Bobot — hanya API hosted untuk keduanya. Tidak ada open weights di mana pun dalam keluarga ini, tidak ada jalur on-premise, tidak ada opsi self-hosting di tier mana pun.

• Bentuk endpoint — endpoint transkripsi streaming tunggal yang mengembalikan teks inkremental dan final, dibandingkan dengan bentuk yang sama pada generasi sebelumnya. Tidak ada yang berubah pada model integrasi, jadi migrasi hanyalah penukaran pengenal model, bukan penulisan ulang.

• Penyetelan audio sulit — StepAudio 3 ASR secara eksplisit disetel untuk ucapan yang dibisikkan, cepat, mengalir, dan dinyanyikan serta untuk audio dengan musik di bawahnya. Penyetelan itulah produknya; generasi sebelumnya tidak dibuat untuk itu.

• Klaim vendor atas peningkatan domain — StepFun melaporkan bahasa Tionghoa turun 9,3%, bahasa Inggris turun 25,0%, dialek turun 22,3%, vertikal turun 42,1% dan alih kode turun 27,9% dari generasi ke generasi. Dilaporkan vendor dan belum direproduksi, jadi anggap sebagai indikatif arah.

Yang secara mencolok tidak ada dalam daftar itu: panjang konteks, dukungan format audio, durasi audio maksimum, dan pengenal model. Dokumentasi publik StepFun untuk model ini tidak mencantumkannya, dan siapa pun yang mengutip angka-angka itu sebenarnya sedang mengutip hal lain.

ASR vs Realtime adalah perbandingan yang sebenarnya dibutuhkan orang

Jika Anda memilih di antara produk transkripsi dan bukan di antara generasi, perbandingan yang menarik bukanlah ASR versus ASR Max — melainkan ASR versus Realtime. Materi teknis StepFun sendiri menyatakan bahwa keduanya berbagi tahap prapelatihan dan pelatihan menengah serta baru berbeda selama penyetelan halus terawasi. Basis yang sama, penyetelan halus yang berbeda, produk yang berbeda.

Fakta tunggal itu memiliki tafsiran praktis. Tingkat kesalahan kata sebesar 1,7% adalah properti dari fine-tune ASR. Itu bukan janji tentang model realtime, yang mengoptimalkan giliran bicara, penanganan interupsi, dan penalaran atas ucapan alih-alih akurasi transkrip. Jika arsitektur Anda bertranskripsi sebagai efek samping dari percakapan langsung, Anda tidak membeli 1,7% — Anda membeli model percakapan yang kebetulan menghasilkan teks.

Kebalikannya juga benar dan kurang jelas: karena mereka berbagi tulang punggung, model ASR bukanlah model spesialis kecil yang ditempelkan pada keluarga tersebut. Ini adalah sistem dengan skala yang sama, yang disetel halus secara berbeda. Itulah sebabnya tarif ASR mendekati tarif anggota keluarga lainnya, bukan mendekati ujung murah pasar.

Apa yang harus dilakukan dengan ini jika Anda memilih salah satu?

Tiga pertanyaan akan menjawabnya. Apakah Anda memerlukan transkrip, atau memerlukan percakapan? Jika transkrip, StepAudio 3 ASR adalah produknya dan nama keluarga hanyalah gangguan. Jika percakapan, Anda menginginkan StepAudio 3 Realtime dan Anda sama sekali tidak perlu membaca tolok ukur ASR. Dan jika Anda memerlukan transkrip untuk audio yang benar-benar sulit — beraksen, dibisikkan, dinyanyikan, atau dengan musik di bawahnya — premi 19x adalah harga dari tingkat yang telah disetel untuk itu, dan ujian yang jujur adalah audio Anda sendiri, bukan indeks campuran.

Keputusan yang mudah salah diambil adalah memperlakukan lapisan transkripsi sebagai permanen. Apa pun yang Anda pilih, transkrip adalah masukan untuk hal lain — perangkum, ekstraksi terstruktur, pemeriksaan kepatuhan, indeks pencarian — dan panggilan-panggilan itu berakhir pada model teks biasa. Itulah lapisan yang berskala dengan penggunaan, bukan dengan menit audio, dan itulah lapisan yang layak dijaga agar tetap portabel sejak awal. OrcaRouter menempatkan hampir 200 model teks di balik satu API dengan failover otomatis antar penyedia, DSL perutean yang menyusun beberapa model menjadi satu panggilan, dan fusi model ketika pertimbangan satu model tidak cukup. Ketika penyedia mempublikasikan tarif, harga daftar itu diteruskan tanpa markup, sehingga perubahan harga di sisi teks sampai ke tagihan Anda pada hari diumumkan.

Agar jelas soal cakupan, karena halaman ini membahas keluarga yang tidak kami layani: tidak ada endpoint StepAudio 3 di OrcaRouter. Model transkripsi dan suara diakses melalui API milik StepFun sendiri. Yang dibawa OrcaRouter adalah lapisan penalaran di hilir transkrip, dan di situlah keputusan untuk beralih itu murah untuk dibuat dan mahal untuk ditunda.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR in first place at 1.7% and StepAudio 2.5 ASR at 4.7% further down the ranking, with the AA-WER v2 three-dataset methodology line naming AA-AgentTalk, VoxPopuli-Cleaned-AA and Earnings22-Cleaned-AA.

Apa yang belum diputuskan siapa pun

Penamaannya dapat diselesaikan. Klaim performanya belum dapat diselesaikan. Masih belum ada laporan teknis yang diterbitkan untuk model ASR tersebut, tidak ada set pengujian yang dirilis, tidak ada konfigurasi decoding, dan tidak ada protokol yang dapat direproduksi dari siapa pun di luar StepFun, dan perbandingan vendor sendiri ditujukan terhadap produk ASR Tiongkok lain, bukan terhadap model open-weight yang sudah mapan. Angka 1,7% adalah pengukuran pihak ketiga yang nyata pada indeks gabungan tiga dataset; semua hal lain tentang model ini adalah klaim vendor.

Dua hal akan mengubah gambaran. Adu langsung melawan Whisper Large v3 Turbo pada audio yang identik, yang belum dipublikasikan oleh siapa pun. Dan tarif untuk sisa keluarga — empat dari lima model StepAudio 3 masih memakai harga pratinjau gratis untuk waktu terbatas saat peluncuran, dan hanya transkripsi serta sintesis yang memiliki tarif terpublikasi, yang berarti daftar harga yang bisa Anda baca hari ini mencakup dua dari lima produk.

Screenshot of the arXiv abstract page for the StepAudio 3 Realtime Technical Report, listing the v1 submission of 12 September 2026 and the v2 revision of 19 September 2026, with the abstract describing the integrated voice agent and the top-performer claim on the Artificial Analysis Full-Duplex Bench.

Itu adalah lapisan yang diskalakan berdasarkan penggunaan, bukan berdasarkan menit audio, dan lapisan itulah yang layak dijaga tetap portabel sejak awal. failover otomatis antar penyedia, DSL perutean yang menggabungkan beberapa penyedia menjadi satu panggilan, dan fusi model ketika penilaian satu model saja tidak cukup.