
HeyGen Voice vs Sesame Preview: Suara yang Bisa Anda Beli versus Suara yang Hanya Bisa Anda Ajak Bicara
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Ini bukan perbandingan model, dan berpura-pura sebaliknya justru satu-satunya kesalahan nyata yang tersedia di sini. HeyGen Voice adalah mesin API — menduduki peringkat pertama di arena Controlled Voice milik Artificial Analysis pada 1.202 Elo, diakses melalui endpoint v3 HeyGen, dijual per kredit, dapat dikloning dari satu rekaman. Sesame Preview adalah asisten suara konsumen gratis yang Anda jangkau dengan membuka halaman web dan berbicara kepada salah satu dari empat persona bernama, tanpa endpoint publik, tanpa pengenal model, dan tanpa harga yang memungkinkannya disewa. Salah satunya bisa Anda rilis. Yang lain adalah alasan Anda tahu bagaimana suara percakapan yang bagus terdengar, dan tidak pernah menjadi hal yang Anda deploy.
Apa sebenarnya masing-masing itu
Sesame Preview adalah demonstrasi percakapan lisan. Anda mengaksesnya melalui situs perusahaan sendiri, Anda berbicara dengan Maya, Miles, Simone, atau Charlie, dan pengalaman itu sengaja dioptimalkan untuk keramahan dan ekspresivitas — perusahaan menyatakan hal itu saat menjelaskan mengapa para pendamping berperilaku seperti itu. Saat ini hanya tersedia dalam bahasa Inggris, dengan tim mencatat bahwa kemampuan multibahasa muncul secara insidental dari kontaminasi data dan "belum berkinerja baik," serta bahwa memperluas ke lebih dari dua puluh bahasa merupakan rencana masa depan. Rumusan perusahaan sendiri masih dalam proses: "Kami belum sampai di sana."
Di balik demo ini terdapat Conversational Speech Model, arsitektur multimodal teks-dan-ucapan yang dibangun dari dua transformer bergaya Llama autoregresif. Model ini tersedia dalam tiga ukuran — Tiny dengan backbone 1B dan decoder 100M, Small pada 3B dan 250M, Medium pada 8B dan 300M — masing-masing dilatih pada panjang sekuens 2.048 token, sekitar dua menit audio, selama lima epoch pada sekitar satu juta jam ucapan yang sebagian besar berbahasa Inggris. Komponen penelitian utamanya open-source di bawah Apache 2.0, dan ada repositori GitHub untuknya. Demo — hal yang sebenarnya dipuji orang — bukan itu. Demo tidak memiliki API publik.
HeyGen Voice adalah susunan yang berkebalikan. Tidak ada aplikasi konsumen gratis untuk dicoba; yang ada adalah API terdokumentasi dengan katalog suara, endpoint ucapan, jalur kloning, dan tagihan. Yang tidak bisa Anda lakukan adalah membukanya di browser dan mengobrol dengannya sesuka hati.
Kenapa keduanya tetap saja dibandingkan?
Keduanya dibandingkan karena keduanya dijadikan bukti bahwa ucapan sintetis telah melewati suatu batas. Sesame Preview mengubah ulang ekspektasi tentang seperti apa audio percakapan bisa terdengar — reaksi saat peluncurannya adalah tentang seberapa mirip ia terdengar seperti manusia alih-alih mesin text-to-speech. Skor 1.202 milik HeyGen Voice di papan terkontrol adalah klaim yang sama dalam bentuk angka: peringkat pertama di antara empat puluh dua entri ketika setiap model mengucapkan delapan suara referensi hasil kloning yang sama.
Perbedaannya adalah apa yang bisa Anda lakukan dengan klaim itu setelahnya. Posisi papan dapat direproduksi, dapat diuji, dan terikat pada sebuah endpoint. Kesan demo bukan salah satu dari hal-hal itu — dan, yang penting, Sesame Preview sama sekali tidak muncul di papan terkendali, jadi tidak ada Elo untuk dibandingkan dengan 1.202. Perbandingan yang ingin dibuat orang tidak tersedia, bukan karena Sesame kehilangannya, melainkan karena model tersebut tidak pernah dimasukkan.
Papan skor

• Controlled Voice Elo — HeyGen Voice: 1.202, #1 dari 42. Sesame Preview: tidak terdaftar.
• Akses — HeyGen Voice: API v3 yang terdokumentasi, POST /v3/voices/speech. Sesame Preview: aplikasi web konsumen dan aplikasi iOS; tidak ada endpoint publik.
• Harga — HeyGen Voice: $30,00 per 1 juta karakter berdasarkan konversi harga kredit versi arena itu sendiri; HeyGen tidak mempublikasikan tarif suara. Sesame Preview: gratis, dan tidak dapat dibeli dengan harga berapa pun.
• Pemilihan suara — HeyGen Voice: 300+ suara siap pakai, desain suara yang dijelaskan melalui teks, kloning instan dan profesional. Sesame Preview: empat persona tetap.
• Bahasa — HeyGen Voice: "lusinan bahasa", jumlahnya tidak dipublikasikan. Sesame Preview: hanya bahasa Inggris, dengan dukungan multibahasa yang saat ini kurang optimal menurut pengakuan perusahaan sendiri.
• Bobot terbuka — HeyGen Voice: tidak ada. Sesame Preview: CSM dirilis di bawah Apache 2.0 dalam ukuran 1B, 3B, dan 8B.

Detail Apache 2.0 itulah yang penting
Terkubur di bawah putusan "tanpa API" adalah fakta bahwa Sesame merilis model risetnya sebagai open source di bawah Apache 2.0 — lisensi permisif, dalam tiga ukuran, dengan varian 1B yang cukup kecil untuk dijalankan tanpa pusat data. Itu adalah proposisi yang benar-benar berbeda dari demo, dan itulah satu-satunya jalur yang memungkinkan apa pun yang menyerupai suara Sesame Preview berakhir di produk yang dirilis.
Dua catatan penting membuatnya tetap jujur. Komponen CSM yang dirilis adalah artefak riset: perusahaan mencatat bahwa model-model tersebut menangani konten ucapan tetapi bukan struktur percakapan, dan mengarah pada model dupleks penuh sebagai pekerjaan masa depan — jadi bobot yang dirilis bukanlah pengalaman interaktif. Dan backbone 8B yang berjalan secara lokal memiliki struktur biaya yang berbeda dari $19,30 per juta karakter untuk inferensi terkelola, yang merupakan tarif yang dibebankan oleh rival kelas atas termurah di arena. Self-hosting tidak memiliki tagihan per karakter dan memiliki tagihan per jam GPU yang sangat nyata.
Bagi seorang pembangun, itu merumuskan ulang pertanyaannya. Jika yang mengesankan Anda tentang Sesame Preview adalah percakapannya, bobot terbuka tidak memberikannya kepada Anda. Jika yang mengesankan Anda adalah kualitas suara dari model ucapan itu sendiri, bobot terbuka mungkin bisa — dan itu dapat diuji dengan cara yang tidak bisa dilakukan demo.
Seperti apa pengiriman di HeyGen Voice
Perbedaan praktisnya adalah perbedaan yang biasa. API HeyGen menerima pilihan suara, teks, dan opsional kecepatan antara 0,5 dan 1,5 dan pitch dalam rentang ±50 semiton, dengan BCP-47 locale sebagai petunjuk. Suara kustom hadir dalam tiga cara: rute desain yang digerakkan deskripsi yang mengembalikan hingga tiga opsi berperingkat dari prompt yang dibatasi 1.000 karakter, klon instan dari satu rekaman, dan klon profesional yang dilatih pada dua puluh menit atau lebih. Engine filter pada endpoint voices juga menerima engine non-HeyGen, sehingga platform ini bukanlah taman tertutup di sekitar modelnya sendiri.
Tidak ada satu pun dari itu di sisi Sesame, dan itu bukan kekurangan Sesame Preview — memang begitulah adanya. Demo yang dioptimalkan untuk menunjukkan apa yang mungkin tidak seharusnya menyandang SLA.
Namun, tagihannya adalah bagian yang lebih ringan. HeyGen menjual kredit — 600 seharga $29/bulan, 1.000 seharga $49, 1.500 seharga $149 — dan menyatakan bahwa konsumsi bervariasi menurut model, durasi, dan kompleksitas, tanpa menerbitkan tarif suara. Angka $30,00 per juta karakter yang dicantumkan arena adalah konversi Artificial Analysis atas kredit tersebut, bukan kutipan dari HeyGen. Jadi, model yang dapat Anda luncurkan sudah diberi harga, tetapi berdasarkan perhitungan orang lain — yang merupakan argumen untuk uji coba terukur alih-alih kritik terhadap mesinnya.

Apa yang sebenarnya harus dilakukan dengan demo yang Anda kagumi
Langkah yang berguna adalah memisahkan dua hal yang ditunjukkan Sesame Preview. Perilaku percakapan — giliran bicara, memori, rasa sedang berbicara dengan seseorang — adalah produk dari sistem yang belum dirilis dan tidak memiliki endpoint. Kualitas ucapan adalah bagian yang didukung oleh bobot Apache 2.0, dan bagian yang dapat Anda evaluasi pada audio Anda sendiri tanpa meminta izin siapa pun.
Untuk segala hal di antaranya, jalur migrasinya adalah yang biasa saja: rilis di atas engine yang memiliki API dan peringkat, lalu rancang agar mengadopsi model Sesame, jika suatu saat dirilis secara komersial, menjadi perubahan konfigurasi, bukan penulisan ulang. Itu berarti adanya abstraksi atas penyedia suara sejak hari pertama — satu antarmuka, satu kunci, engine dipilih lewat config. Lapisan routing OrcaRouter dibuat justru untuk ini: banyak penyedia di balik satu endpoint dengan harga daftar penyedia tanpa markup, failover otomatis saat vendor macet, dan DSL routing yang memungkinkan Anda menukar engine di balik sebuah suara tanpa menyentuh kode aplikasi. Intinya bukan bahwa ia menghosting model Sesame — memang tidak — melainkan bahwa pada hari suara yang Anda kagumi menjadi dapat dibeli, biaya untuk mencobanya seharusnya cukup satu baris di file config.
Penutupan yang jujur
Sesame Preview bukan pesaing bagi HeyGen Voice dan tidak seharusnya dinilai sebagai pesaing. Ini adalah demonstrasi gratis, hanya berbahasa Inggris, dengan empat persona, yang kebetulan telah mengatur ulang ekspektasi untuk audio percakapan dan kebetulan telah merilis bobot riset berlisensi permisif dalam tiga ukuran. HeyGen Voice adalah mesin peringkat teratas di satu-satunya papan peringkat ucapan yang menjaga suara tetap konstan, dijual melalui API yang dapat Anda panggil hari ini, dengan harga yang belum dapat Anda hitung.
Jika Anda membutuhkan suara yang bisa Anda rilis kuartal ini, keputusannya bukan antara kedua ini — melainkan antara HeyGen Voice dan mesin berbayar lainnya di arena. Jika Anda menunggu Sesame, tunggulah bobotnya, bukan aplikasinya.
