
StepAudio 3 Realtime vs Sesame Preview: Suara yang Dipuji Semua Orang vs Suara yang Punya Skor
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Sepanjang sebagian besar tahun 2026, klaim terkuat yang bisa dibuat siapa pun tentang AI suara adalah kesan saat mendengarkan. Asisten Sesame terdengar lebih manusiawi daripada yang lain, dan cukup banyak orang mengatakan demikian sehingga hal itu menjadi titik acuan — tanpa tolok ukur, tanpa angka, dan tanpa cara untuk memeriksa. Pada 15 September 2026, StepAudio 3 Realtime hadir dari StepFun dengan angka yang melekat pada versi paling terukur dari kualitas itu: 98,9% pada evaluasi Conversational Dynamics milik Artificial Analysis, peringkat pertama. Sesame Preview tidak ada di papan itu.
Bagian yang menarik bukanlah bahwa yang satu mengalahkan yang lain. Yang menarik adalah bahwa kualitas yang membuat Sesame terkenal kini menjadi sesuatu yang dinilai oleh pihak ketiga, dan model yang memiliki reputasi itu belum pernah diukur terhadapnya.
Apa sebenarnya masing-masing dari ini
Mereka bukan jenis objek yang sama, dan itu menentukan lebih banyak tentang perbandingan tersebut daripada skor mana pun.
Sesame Preview adalah asisten suara konsumen. Gratis di iOS sejak Mei 2026 dan tersedia luas di Android sejak awal Agustus 2026, dibangun di sekitar empat agen bernama — Maya, Miles, Simone, dan Charlie — yang mempertahankan konteks di seluruh sesi, mencari di web, dan menyetel pengingat. Layanan ini hanya tersedia dalam bahasa Inggris. Panggilan dibatasi hingga 30 menit, yang turun menjadi lima menit saat Anda keluar dari akun. Tidak ada API untuk suara produksinya, tidak ada tier perusahaan, dan tidak ada harga publik.
StepAudio 3 Realtime adalah antarmuka pengembang. Ini adalah salah satu dari lima model dalam keluarga StepAudio 3, semuanya dirilis pada hari yang sama dan semuanya tersedia di platform terbuka StepFun sebagai API komersial. Model ini menangani percakapan dupleks penuh native, bernalar langsung atas ucapan alih-alih mentranskripsikannya terlebih dahulu, serta mendukung pemanggilan alat dan eksekusi asinkron tugas-tugas panjang saat percakapan terus berlangsung. Model ini mengutamakan bahasa Mandarin. Model ini tidak membuka bobotnya, dan saat ini berada pada harga pratinjau gratis untuk waktu terbatas tanpa tarif setelah pratinjau yang diumumkan.
Salah satunya dapat Anda bangun di atasnya. Yang lain dapat Anda kunjungi.
Hal terukur yang membuat Sesame terkenal
Conversational Dynamics adalah tolok ukur khusus, dan penting untuk mengetahui apa yang ada di dalamnya. Ini menilai giliran bicara, penanganan jeda, pemulihan dari interupsi, dan apakah model dengan benar menafsirkan backchannel singkat — "uh-huh", "right", "mm" — sebagai dorongan bukan sebagai upaya merebut giliran bicara. Itulah tepatnya perilaku yang digambarkan pendengar ketika mereka mengatakan sebuah suara terasa manusiawi bukan seperti robot, dan itulah perilaku yang membuat asisten menyenangkan untuk diajak bicara bukan sekadar akurat.
StepAudio 3 Realtime memimpin papan peringkat itu dengan 98,9%, di depan Qwen Audio 3.0 Realtime Plus pada 98,4% dan GPT-Realtime-2 pada 95,3%. Ia juga menempati peringkat pertama pada Speech Reasoning dengan 99,7% sebagaimana dikutip oleh StepFun, yang di baliknya terdapat klaim arsitektural bahwa penalaran atas audio mentah mempertahankan nada dan penekanan yang akan diratakan oleh tahap transkripsi — perbedaan antara mendengar sarkasme dan mendengar pujian.
Berikut penyajian yang jujur atas hasil itu. Tolok ukur tersebut adalah hal yang paling mendekati pengukuran di industri atas apa yang dipuji dari Sesame, dan Sesame belum dimasukkan ke dalamnya. Itu bukan bukti bahwa StepAudio 3 Realtime terdengar lebih bagus daripada Sesame. Itu adalah bukti bahwa salah satu dari klaim ini dapat diperiksa dan yang lain, sejauh ini, tidak — dan bahwa klaim yang dapat diperiksa itu saat ini dipegang oleh model yang belum pernah diajak bicara oleh sebagian besar orang.

Asimetri ketersediaan, yang merupakan keputusan sesungguhnya
Semua hal di atas menarik. Bagian ini menentukan.
Suara Sesame — yang dipuji banyak orang — adalah model produksi yang lebih besar dan tertutup yang belum pernah dirilis Sesame sebagai API. Anda tidak dapat membelinya, melisensinya, atau memanggilnya dari produk Anda sendiri. Jika Anda membaca bahwa timing percakapan Sesame adalah yang terbaik yang tersedia dan menyimpulkan bahwa Anda bisa memilikinya, kesimpulan itu tidak mengikuti dari bukti.
Yang sebenarnya dirilis Sesame sebagai sumber terbuka adalah CSM-1B, yang dirilis di bawah Apache-2.0. Ini adalah blok sintesis, bukan asisten: tulang punggung Llama memprediksi codebook Mimi pertama dan dekoder Llama yang lebih kecil memprediksi sisanya, yang dirender oleh codec Mimi menjadi bentuk gelombang 24 kHz. Model ini hanya untuk bahasa Inggris, mengkloning suara dari klip referensi 10 hingga 15 detik, dan sama sekali tidak dapat menghasilkan teks — Anda memasangkannya dengan model bahasa terpisah. Orang-orang yang telah menjalankan keduanya menggambarkan suara CSM-1B sebagai jelas lebih lemah daripada suara aplikasi Preview, dan kartu model mengatakan hal yang biasanya tersirat dengan lantang: varian CSM yang telah di-fine-tune menggerakkan demo interaktif, dan varian itu bukan checkpoint yang dapat Anda unduh.
StepAudio 3 Realtime tidak memiliki ambiguitas semacam itu. Ini adalah API komersial dengan keluarga model yang dipublikasikan di baliknya, rangkaian kemampuan yang dinyatakan, dan penempatan pihak ketiga yang dapat Anda cari. Ini juga mengutamakan bahasa Tionghoa, berharga pratinjau, dan mencatat waktu ke audio pertama sebesar 8,83 detik di papan peringkat yang sama tempat ia memenangkan dinamika percakapan — dibandingkan 1,18 detik untuk Gemini 3.8 Live dan 1,24 hingga 1,34 detik untuk GPT-Live-1. Apa pun yang ditawarkannya dalam hal kualitas percakapan, ia belum menunjukkan bahwa ia dapat menyampaikannya pada kecepatan percakapan di luar infrastruktur penyajian milik StepFun sendiri.

Apa yang harus dilakukan dengan ini jika Anda memilih stack suara
Mulailah dengan memisahkan kedua pertanyaan itu. "Bagaimana seharusnya percakapan terasa?" dan "apa yang bisa saya rilis?" memiliki jawaban yang berbeda, dan hanya salah satunya yang merupakan keputusan pengadaan.
Jika Anda sedang mengkalibrasi selera — menentukan seberapa besar kehangatan yang harus dimiliki produk Anda, seberapa nyaman keheningan, seberapa cepat agen harus menyerahkan giliran bicara — Sesame Preview gratis, benar-benar sangat bagus, dan tempat yang baik untuk menghabiskan waktu satu sore. Jadikan ini sebagai titik acuan. Jangan rencanakan integrasi dengan itu, karena tidak ada yang bisa diintegrasikan.
Jika Anda sedang merilis produk, StepAudio 3 Realtime adalah kandidat nyata dengan catatan penting yang nyata: harga pratinjau, cakupan yang mengutamakan bahasa Mandarin, tidak ada skor indeks di Artificial Analysis, dan pertanyaan latensi yang belum terjawab. Uji latensi sebelum kualitas percakapan. Model yang menang di tolok ukur pengambilan giliran tetapi membutuhkan waktu hampir selama satu kalimat untuk mulai berbicara adalah model yang kualitas terbaiknya mungkin tidak akan pernah bisa Anda tunjukkan.
Jika suara produksi Sesame suatu saat mendapatkan API, seluruh perbandingan ini akan dijalankan ulang — karena benchmark yang akan menyelesaikannya sudah ada, dan Sesame akhirnya harus muncul di dalamnya.
Di mana routing cocok, dan di mana tidak
Agen suara bukanlah satu model. Baik Anda menjalankan StepAudio 3 Realtime atau apa pun lainnya, percakapan terus-menerus menyerahkan pekerjaan kepada model teks biasa — pencarian, ekstraksi, panggilan penalaran yang berjalan di balik jeda yang ditahan. Lapisan delegasi itulah tempat variasi biaya berada dan tempat jam buruk satu penyedia menjadi gangguan layanan Anda.
Untuk lebih tepat mengenai cakupan kami sendiri: endpoint live dan voice dalam keluarga StepAudio 3 tidak ada di OrcaRouter, dan begitu pula apa pun yang telah dibangun Sesame. Yang ada di OrcaRouter adalah lapisan teks yang didelegasikan oleh agen suara — hampir 200 model di balik satu API, failover otomatis, DSL perutean yang menggabungkan beberapa menjadi satu panggilan, dan fusi model ketika penilaian satu model saja tidak cukup, dengan harga daftar penyedia diteruskan tanpa markup.
Pemisahan itulah yang membuat pertanyaan ketersediaan tidak begitu fatal seperti yang terlihat. Model suara adalah keputusan yang bisa Anda tinjau kembali; lapisan delegasi adalah yang menjadi mahal untuk dibongkar, dan itulah yang layak ditempatkan di belakang sebuah router sebelum Anda berkomitmen pada penyedia suara mana pun.

Putusan
Sesame Preview menang pada hal yang tidak bisa diukur dan kalah pada segala hal yang bisa dibeli. Itu adalah suara terbaik yang tersedia, gratis, dan Anda tidak bisa memasukkannya ke produksi — dan sekarang setelah pihak ketiga menilai kualitas yang membuatnya terkenal, ketidakhadirannya dari papan skor itu adalah celah dalam bukti, bukan keunggulan yang terlindungi.
StepAudio 3 Realtime unggul dalam ketersediaan, keterukuran, dan kemampuan, serta menyisakan pertanyaan terbuka yang nyata tentang harga, cakupan bahasa, dan latensi. Ini satu-satunya dari keduanya yang dapat Anda bangun di atasnya hari ini, yang menyelesaikan pertanyaan praktis lebih cepat daripada tolok ukur apa pun.
Yang perlu diperhatikan sederhana, dan hal itu bisa berlaku dua arah: skor Conversational Dynamics untuk suara produksi Sesame, atau angka latensi untuk StepAudio 3 Realtime yang menempatkannya dalam kisaran yang sama dengan model-model yang saat ini dikalahkannya dalam hal kualitas. Salah satu saja akan mengubah ini dari perbandingan antara pengukuran dan reputasi menjadi adu langsung yang sebenarnya.
