
GPT-Live-1 vs Sesame Preview: Suara Terbaik dalam Perbandingan Ini Adalah Suara yang Tidak Dapat Anda Beli
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding

Tanyakan kepada siapa pun yang pernah menggunakan keduanya, dan selisih peringkatnya tidak tipis: Sesame Preview adalah asisten suara paling meyakinkan yang pernah diajak bicara oleh kebanyakan orang. Ini juga yang tidak bisa Anda jadikan fondasi. GPT-Live-1 dan Sesame Preview terus-menerus dibandingkan — keduanya dapat diajak bercakap-cakap, keduanya menangani interupsi, keduanya terdengar seperti manusia alih-alih menu telepon berjenjang — tetapi keduanya ditawarkan dengan cara yang berlawanan. GPT-Live-1 adalah model hosted yang Anda sewa per menit, dapat dipanggil secara publik sejak 10 September 2026. Sesame Preview adalah aplikasi konsumen gratis tanpa API sama sekali, dan suara yang membuat orang terkesan berjalan pada model produksi yang belum pernah dirilis.
Apa sebenarnya masing-masing itu
• GPT-Live-1 — model suara dupleks penuh OpenAI, tersedia di ChatGPT sejak 8 Juli 2026, di API sejak 10 September dengan $0,05 per menit suara. Dua belas suara API, tanpa kloning, tanpa input gambar atau video, transkrip dan teks respons dikembalikan pada setiap sesi.
• Pratinjau Sesame — asisten suara konsumen milik Sesame. Gratis di iOS sejak Mei 2026, tersedia secara luas di Android sejak awal Agustus 2026, plus pratinjau web yang mengutamakan suara. Empat agen — Maya, Miles, Simone, dan Charlie — hanya bahasa Inggris, dengan batas panggilan 30 menit yang turun menjadi 5 menit saat keluar dari akun.
• CSM-1B — bagian dari Sesame yang terbuka: model ucapan percakapan 1B yang dirilis di bawah Apache 2.0 pada 23 April 2026, dibangun di atas tulang punggung arsitektur Llama dengan dekoder terpisah dan codec Mimi milik Kyutai, menghasilkan ucapan bahasa Inggris mono 24 kHz dari konteks sekitar 4K token.
Tiga baris di atas adalah keseluruhan bentuk keputusan itu. Satu perusahaan menjual model per menit. Perusahaan lainnya memberikan aplikasi secara gratis dan merilis secara sumber terbuka model yang lebih kecil yang bukan model yang ada di aplikasi tersebut.
Kesenjangan antara demo dan unduhan
Sesame telah bersikap sangat terus terang tentang hal ini, dan ini adalah satu-satunya fakta terpenting bagi siapa pun yang mengevaluasi pasangan tersebut. Suara di aplikasi Preview — suara yang menghasilkan klip viral dan ulasan "mode suara terbaik di kelasnya" — adalah model produksi tertutup yang lebih besar. CSM-1B adalah checkpoint terbuka berparameter 1B dari lab yang sama, dan menurut penilaian orang-orang yang telah menjalankan keduanya, suaranya jelas lebih lemah. Sesi di Preview juga dibatasi dan hanya tersedia dalam bahasa Inggris, dan tidak ada eksekusi tugas: para agen itu berbicara, mereka tidak memesan, membeli, atau mengarsipkan apa pun.
Hal itu menyisakan penawaran yang nyata tetapi lebih sempit bagi pengembang: checkpoint suara percakapan yang dapat dihosting sendiri tanpa biaya lisensi, dihosting oleh satu penyedia inferensi pihak ketiga dengan harga $7 per juta karakter — kira-kira $0,35 per jam audio yang disintesis — atau gratis di perangkat keras Anda sendiri. Belum ada yang mempublikasikan tolok ukur independen untuk suara Preview maupun CSM-1B, jadi klaim kualitas apa pun, baik positif maupun negatif, hanyalah kesan mendengarkan, bukan hasil pengukuran. Sesame juga belum menerbitkan harga publik, tier enterprise, maupun rencana monetisasi; arah yang dinyatakan perusahaan adalah kemitraan riset dan produk perangkat keras yang direncanakan.

Apa yang dapat dibeli dengan $0.05 per menit yang tidak dapat diperoleh secara gratis
Tawaran GPT-Live-1 kepada pengembang bukanlah bahwa model itu terdengar lebih baik, karena argumen tersebut tidak mungkin dimenangkan melawan model tertutup yang tidak dapat diukur oleh siapa pun. Tawaran itu adalah bahwa hal tersebut dapat dipanggil dan diberi harga. Secara konkret, inilah yang Anda dapatkan saat meteran berjalan:
• Sesi yang Anda kendalikan — satu ID model, satu endpoint Live Sessions, contoh integrasi yang dipublikasikan yang berjalan di atas WebRTC, dan sesi yang Anda konfigurasikan dengan instruksi, suara, dan blok delegasi.
• Penanganan interupsi sebagai perilaku yang didokumentasikan — interaktivitas 80,1% pada Full Duplex Bench v1.5 dibandingkan 45,4% untuk GPT-Realtime-2.1, dengan latensi pergantian giliran 0,798 detik dan keberhasilan pemanggilan alat 87%. Ketiganya adalah angka OpenAI sendiri, yang diterbitkan bersama rilis tersebut dan tidak direproduksi oleh siapa pun pada saat penulisan ini.
• Backend penalaran yang Anda pilih — lapisan suara menyerahkan pekerjaan berat melintasi batas asinkron ke model terpisah yang disebutkan dalam konfigurasi sesi, yang tetap bekerja saat percakapan berlanjut. Dalam contoh dokumentasi OpenAI, backend tersebut adalah GPT-5.6 Terra; pada peluncuran konsumen Juli, model itu adalah GPT-5.5.
• Transkrip, teks respons, dan penagihan bergaya teleponi — $3,00 untuk satu jam saluran terbuka terus-menerus, ditagih per detik, dengan 15 detik inisialisasi sesi dikreditkan, bukan ditambahkan.
Sesame memberi Anda percakapan yang lebih baik dan tidak satu pun dari hal-hal itu. Jika Anda sedang membangun produk, "percakapan yang lebih baik, tanpa API, tanpa harga, tanpa benchmark, hanya bahasa Inggris, batas 30 menit" bukanlah sebuah perbandingan — itu adalah daftar tunggu.
Ada angka pada GPT-Live-1 sekarang yang tidak ada saat peluncuran konsumennya, dan itu adalah penyeimbang yang jujur untuk semua hal di atas. Indeks Speech to Speech dari Artificial Analysis memberi skor GPT-Live-1 sebesar 69,8% — peringkat ketujuh dari sebelas model, di bawah GPT-Realtime-2.1 dengan 73,9% dan di bawah Grok Voice Think Fast 2.0 dengan 79,0%. Jadi model yang bisa Anda beli juga bukan yang terbaik di papan independen itu. Yang tidak bisa dinilai oleh papan tersebut adalah hal yang sebenarnya dimenangkan Sesame: tidak satu pun dari sebelas model di indeks itu dinilai berdasarkan bagaimana rasanya berbicara dengannya, dan suara Sesame Preview tidak memiliki baris di mana pun.

Bagian dari stack yang bukan milik perusahaan mana pun
Di sinilah kedua opsi bertemu, dan di sinilah keputusan tidak lagi bersifat biner. Baik Sesame Preview maupun GPT-Live-1 bukanlah agen yang lengkap. Agen Sesame tidak mengeksekusi tugas; GPT-Live-1 secara eksplisit mendelegasikan apa pun yang memerlukan penalaran, pengambilan informasi, atau alat ke model backend. Dalam kedua desain, pekerjaan yang menarik terjadi di balik suara, dalam panggilan model teks biasa, dan lapisan itu portabel dengan cara yang tidak dimiliki lapisan suara — Anda dapat memindahkan backend tanpa merekam ulang satu pun prompt untuk model suara.
Backend itulah juga tempat OrcaRouter berguna, dan penting untuk bersikap tepat tentang apa yang kami tangani dan tidak kami tangani. Kami tidak merutekan GPT-Live-1: endpoint Live Sessions milik OpenAI, dan lapisan suara di sana tidak terjangkau. Kami juga tidak merutekan model produksi Sesame, karena alasan yang lebih sederhana bahwa model itu belum pernah ditawarkan sebagai API. Yang kami rutekan adalah lapisan yang menjadi tempat kedua produk menyerahkan pekerjaan. Sekitar 190 model dari sebelas penyedia hulu berjalan di balik satu kunci dengan harga daftar penyedia tanpa markup, dengan failover otomatis antarpenyedia dan DSL perutean yang dapat menyusun beberapa model menjadi satu panggilan. Bagi tim yang membangun di atas front end suara yang belum teruji, itulah lindung nilai yang penting: lapisan ucapan dapat ditukar atau ditinggalkan tanpa ikut membawa lapisan penalaran, dan model yang Anda pertaruhkan pada Maret dapat digantikan pada Juni dengan mengedit satu baris.
Apa yang harus ditonton
Tiga hal akan mengubah perbandingan ini, dan belum ada satu pun yang berada di tangan siapa pun. Sesame API — bahkan yang berbayar — akan seketika mengubah suara terkuat di kategori ini menjadi opsi yang dapat dibangun, dan akan menempatkan harga nyata di samping $0.05 milik GPT-Live-1. Benchmark yang dipublikasikan untuk suara Preview akan mengubah kesan dari mendengarkan menjadi angka, dan evaluasi independen cenderung tidak ramah terhadap suara yang selama ini hanya bersaing dalam demo. Dan reproduksi dari pihak luar yang pertama atas angka interaktivitas dan latensi OpenAI akan menentukan apakah dupleks penuh merupakan kesenjangan kemampuan yang nyata atau evaluasi yang dipilih dengan baik.
Sampai saat itu, pembagian yang jujur adalah ini. Jika Anda memilih suara untuk diri sendiri, gunakan Sesame Preview — gratis, lebih baik, dan Anda tidak kehilangan apa pun dengan lebih memilihnya. Jika Anda memilih suara untuk produk yang harus Anda rilis, jual, dan dukung, GPT-Live-1 adalah satu-satunya dari keduanya yang benar-benar dapat Anda beli, dan fakta bahwa ia bukan yang terdengar lebih bagus adalah harga yang harus dibayar.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
