Kartu judul hero untuk 'GPT-Live-1 vs Sesame Preview', dengan subjudul 'Suara terbaik di sini adalah yang tanpa API', dengan lencana bertuliskan 'Satu gratis dan tertutup, satu berbayar dan dapat dipanggil' dan tiga kartu: 'Sesame Preview — aplikasi gratis, tanpa API, suara produksi belum dirilis', 'GPT-Live-1 — $0.05 per menit suara, API publik sejak 10 September 2026' dan 'Bagian Sesame yang dapat dibangun — CSM-1B, Apache-2.0, 1B parameter, $7 per 1 juta karakter atau self-host', di atas strip footer bertuliskan 'Suara produksi Sesame tidak memiliki benchmark yang dipublikasikan; angka suara GPT-Live-1 dilaporkan oleh OpenAI.' Logo OrcaRouter dikompositkan di kanan bawah.
Guides & Insights

GPT-Live-1 vs Sesame Preview: Suara Terbaik dalam Perbandingan Ini Adalah Suara yang Tidak Dapat Anda Beli

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel
A two-column scoreboard titled 'GPT-Live-1 vs Sesame Preview - the scoreboard'. Left column GPT-Live-1: 'Access: public API since September 10, 2026', 'Price: $0.05 per voice minute', 'Voices: 12 API voices, no cloning', 'Duplex: full duplex, barge-in native', 'Weights: closed', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Sesame Preview: 'Access: free consumer app, no API', 'Price: $0 to the user, no paid tier', 'Voices: four agents, one production voice', 'Duplex: conversational, interruptible', 'Weights: CSM-1B open, production model closed', 'Independent score: none, no public benchmark of the Preview voice'. Footer: 'The Sesame Preview production voice is unreleased; CSM-1B is a separate, smaller open checkpoint.'

Tanyakan kepada siapa pun yang pernah menggunakan keduanya, dan selisih peringkatnya tidak tipis: Sesame Preview adalah asisten suara paling meyakinkan yang pernah diajak bicara oleh kebanyakan orang. Ini juga yang tidak bisa Anda jadikan fondasi. GPT-Live-1 dan Sesame Preview terus-menerus dibandingkan — keduanya dapat diajak bercakap-cakap, keduanya menangani interupsi, keduanya terdengar seperti manusia alih-alih menu telepon berjenjang — tetapi keduanya ditawarkan dengan cara yang berlawanan. GPT-Live-1 adalah model hosted yang Anda sewa per menit, dapat dipanggil secara publik sejak 10 September 2026. Sesame Preview adalah aplikasi konsumen gratis tanpa API sama sekali, dan suara yang membuat orang terkesan berjalan pada model produksi yang belum pernah dirilis.

Apa sebenarnya masing-masing itu

• GPT-Live-1 — model suara dupleks penuh OpenAI, tersedia di ChatGPT sejak 8 Juli 2026, di API sejak 10 September dengan $0,05 per menit suara. Dua belas suara API, tanpa kloning, tanpa input gambar atau video, transkrip dan teks respons dikembalikan pada setiap sesi.

• Pratinjau Sesame — asisten suara konsumen milik Sesame. Gratis di iOS sejak Mei 2026, tersedia secara luas di Android sejak awal Agustus 2026, plus pratinjau web yang mengutamakan suara. Empat agen — Maya, Miles, Simone, dan Charlie — hanya bahasa Inggris, dengan batas panggilan 30 menit yang turun menjadi 5 menit saat keluar dari akun.

• CSM-1B — bagian dari Sesame yang terbuka: model ucapan percakapan 1B yang dirilis di bawah Apache 2.0 pada 23 April 2026, dibangun di atas tulang punggung arsitektur Llama dengan dekoder terpisah dan codec Mimi milik Kyutai, menghasilkan ucapan bahasa Inggris mono 24 kHz dari konteks sekitar 4K token.

Tiga baris di atas adalah keseluruhan bentuk keputusan itu. Satu perusahaan menjual model per menit. Perusahaan lainnya memberikan aplikasi secara gratis dan merilis secara sumber terbuka model yang lebih kecil yang bukan model yang ada di aplikasi tersebut.

Kesenjangan antara demo dan unduhan

Sesame telah bersikap sangat terus terang tentang hal ini, dan ini adalah satu-satunya fakta terpenting bagi siapa pun yang mengevaluasi pasangan tersebut. Suara di aplikasi Preview — suara yang menghasilkan klip viral dan ulasan "mode suara terbaik di kelasnya" — adalah model produksi tertutup yang lebih besar. CSM-1B adalah checkpoint terbuka berparameter 1B dari lab yang sama, dan menurut penilaian orang-orang yang telah menjalankan keduanya, suaranya jelas lebih lemah. Sesi di Preview juga dibatasi dan hanya tersedia dalam bahasa Inggris, dan tidak ada eksekusi tugas: para agen itu berbicara, mereka tidak memesan, membeli, atau mengarsipkan apa pun.

Hal itu menyisakan penawaran yang nyata tetapi lebih sempit bagi pengembang: checkpoint suara percakapan yang dapat dihosting sendiri tanpa biaya lisensi, dihosting oleh satu penyedia inferensi pihak ketiga dengan harga $7 per juta karakter — kira-kira $0,35 per jam audio yang disintesis — atau gratis di perangkat keras Anda sendiri. Belum ada yang mempublikasikan tolok ukur independen untuk suara Preview maupun CSM-1B, jadi klaim kualitas apa pun, baik positif maupun negatif, hanyalah kesan mendengarkan, bukan hasil pengukuran. Sesame juga belum menerbitkan harga publik, tier enterprise, maupun rencana monetisasi; arah yang dinyatakan perusahaan adalah kemitraan riset dan produk perangkat keras yang direncanakan.

A screenshot of the Sesame homepage as of September 2026, headed 'Curiosity, met' with the subline 'Personal intelligence with a point of view', and a section titled 'A collection of personal agents' reading 'Think out loud. Follow a thread. Discover something unexpected.' with a 'Get the Preview' button. The navigation offers only Blog, Team, Mobile Preview and Research Preview — no pricing, no documentation and no developer or API link.

Apa yang dapat dibeli dengan $0.05 per menit yang tidak dapat diperoleh secara gratis

Tawaran GPT-Live-1 kepada pengembang bukanlah bahwa model itu terdengar lebih baik, karena argumen tersebut tidak mungkin dimenangkan melawan model tertutup yang tidak dapat diukur oleh siapa pun. Tawaran itu adalah bahwa hal tersebut dapat dipanggil dan diberi harga. Secara konkret, inilah yang Anda dapatkan saat meteran berjalan:

• Sesi yang Anda kendalikan — satu ID model, satu endpoint Live Sessions, contoh integrasi yang dipublikasikan yang berjalan di atas WebRTC, dan sesi yang Anda konfigurasikan dengan instruksi, suara, dan blok delegasi.

• Penanganan interupsi sebagai perilaku yang didokumentasikan — interaktivitas 80,1% pada Full Duplex Bench v1.5 dibandingkan 45,4% untuk GPT-Realtime-2.1, dengan latensi pergantian giliran 0,798 detik dan keberhasilan pemanggilan alat 87%. Ketiganya adalah angka Ope​nAI sendiri, yang diterbitkan bersama rilis tersebut dan tidak direproduksi oleh siapa pun pada saat penulisan ini.

• Backend penalaran yang Anda pilih — lapisan suara menyerahkan pekerjaan berat melintasi batas asinkron ke model terpisah yang disebutkan dalam konfigurasi sesi, yang tetap bekerja saat percakapan berlanjut. Dalam contoh dokumentasi OpenAI, backend tersebut adalah GPT-5.6 Terra; pada peluncuran konsumen Juli, model itu adalah GPT-5.5.

• Transkrip, teks respons, dan penagihan bergaya teleponi — $3,00 untuk satu jam saluran terbuka terus-menerus, ditagih per detik, dengan 15 detik inisialisasi sesi dikreditkan, bukan ditambahkan.

Sesame memberi Anda percakapan yang lebih baik dan tidak satu pun dari hal-hal itu. Jika Anda sedang membangun produk, "percakapan yang lebih baik, tanpa API, tanpa harga, tanpa benchmark, hanya bahasa Inggris, batas 30 menit" bukanlah sebuah perbandingan — itu adalah daftar tunggu.

Ada angka pada GPT-Live-1 sekarang yang tidak ada saat peluncuran konsumennya, dan itu adalah penyeimbang yang jujur untuk semua hal di atas. Indeks Speech to Speech dari Artificial Analysis memberi skor GPT-Live-1 sebesar 69,8% — peringkat ketujuh dari sebelas model, di bawah GPT-Realtime-2.1 dengan 73,9% dan di bawah Grok Voice Think Fast 2.0 dengan 79,0%. Jadi model yang bisa Anda beli juga bukan yang terbaik di papan independen itu. Yang tidak bisa dinilai oleh papan tersebut adalah hal yang sebenarnya dimenangkan Sesame: tidak satu pun dari sebelas model di indeks itu dinilai berdasarkan bagaimana rasanya berbicara dengannya, dan suara Sesame Preview tidak memiliki baris di mana pun.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%. No Sesame model appears on the index.

Bagian dari stack yang bukan milik perusahaan mana pun

Di sinilah kedua opsi bertemu, dan di sinilah keputusan tidak lagi bersifat biner. Baik Sesame Preview maupun GPT-Live-1 bukanlah agen yang lengkap. Agen Sesame tidak mengeksekusi tugas; GPT-Live-1 secara eksplisit mendelegasikan apa pun yang memerlukan penalaran, pengambilan informasi, atau alat ke model backend. Dalam kedua desain, pekerjaan yang menarik terjadi di balik suara, dalam panggilan model teks biasa, dan lapisan itu portabel dengan cara yang tidak dimiliki lapisan suara — Anda dapat memindahkan backend tanpa merekam ulang satu pun prompt untuk model suara.

Backend itulah juga tempat OrcaRouter berguna, dan penting untuk bersikap tepat tentang apa yang kami tangani dan tidak kami tangani. Kami tidak merutekan GPT-Live-1: endpoint Live Sessions milik Ope​nAI, dan lapisan suara di sana tidak terjangkau. Kami juga tidak merutekan model produksi Sesame, karena alasan yang lebih sederhana bahwa model itu belum pernah ditawarkan sebagai API. Yang kami rutekan adalah lapisan yang menjadi tempat kedua produk menyerahkan pekerjaan. Sekitar 190 model dari sebelas penyedia hulu berjalan di balik satu kunci dengan harga daftar penyedia tanpa markup, dengan failover otomatis antarpenyedia dan DSL perutean yang dapat menyusun beberapa model menjadi satu panggilan. Bagi tim yang membangun di atas front end suara yang belum teruji, itulah lindung nilai yang penting: lapisan ucapan dapat ditukar atau ditinggalkan tanpa ikut membawa lapisan penalaran, dan model yang Anda pertaruhkan pada Maret dapat digantikan pada Juni dengan mengedit satu baris.

Apa yang harus ditonton

Tiga hal akan mengubah perbandingan ini, dan belum ada satu pun yang berada di tangan siapa pun. Sesame API — bahkan yang berbayar — akan seketika mengubah suara terkuat di kategori ini menjadi opsi yang dapat dibangun, dan akan menempatkan harga nyata di samping $0.05 milik GPT-Live-1. Benchmark yang dipublikasikan untuk suara Preview akan mengubah kesan dari mendengarkan menjadi angka, dan evaluasi independen cenderung tidak ramah terhadap suara yang selama ini hanya bersaing dalam demo. Dan reproduksi dari pihak luar yang pertama atas angka interaktivitas dan latensi OpenAI akan menentukan apakah dupleks penuh merupakan kesenjangan kemampuan yang nyata atau evaluasi yang dipilih dengan baik.

Sampai saat itu, pembagian yang jujur adalah ini. Jika Anda memilih suara untuk diri sendiri, gunakan Sesame Preview — gratis, lebih baik, dan Anda tidak kehilangan apa pun dengan lebih memilihnya. Jika Anda memilih suara untuk produk yang harus Anda rilis, jual, dan dukung, GPT-Live-1 adalah satu-satunya dari keduanya yang benar-benar dapat Anda beli, dan fakta bahwa ia bukan yang terdengar lebih bagus adalah harga yang harus dibayar.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari