Kartu judul untuk 'Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B': judul besar, subjudul 'Suara yang tidak bisa Anda lisensikan, dan suara yang tidak bisa Anda rilis', dan dua kartu ikon datar — 'Sesame Preview' dengan ikon garis telepon-dan-orang serta lencana bertuliskan 'Aplikasi gratis · tanpa API · pilihan pengulas', dan 'NVIDIA NemotronLabs VoiceChat 11B' dengan ikon garis unduhan-dan-server serta lencana bertuliskan 'Bobot terbuka · khusus riset · host mandiri'. Footer: 'Dua suara terbaik yang tidak bisa dirilis — voice AI, Agustus 2026.' Logo OrcaRouter ditempatkan di kanan bawah.
Guides & Insights

Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B: Suara yang Tak Bisa Anda Lisensikan, dan Suara yang Tak Bisa Anda Rilis

Penulis

Jim Song

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Dua model suara yang paling banyak diperbincangkan tahun 2026 memiliki satu kesamaan yang tidak akan diungkapkan oleh liputan peluncuran mana pun: Anda tidak dapat memasukkan salah satu dari keduanya ke dalam produk. Sesame Preview adalah asisten konsumen gratis yang suara percakapannya membuat TestingCatalog menyebutnya "salah satu mode suara terbaik yang tersedia di pasar," dan model produksi di baliknya tidak memiliki API, tidak ada ID model, dan tidak ada lisensi yang bisa Anda beli — perusahaan itu sama sekali belum merilisnya. NVIDIA NemotronLabs VoiceChat 11B adalah kebalikannya: bobotnya terbuka untuk umum, desain full-duplex adalah yang benar-benar pertama, dan lisensinya menyatakan hanya untuk tujuan penelitian, sehingga tidak ada yang bisa secara sah mengedarkannya juga. Satu adalah suara yang dapat Anda dengar tetapi tidak dapat disewa. Yang lainnya adalah suara yang dapat Anda miliki tetapi tidak dapat dijual. Ini adalah perbandingan dua pintu terkunci, dan pertanyaan yang berguna adalah di depan kunci mana Anda berdiri.

Dua pintu terkunci, dengan kunci yang berbeda

Mulailah dari bentuk masing-masing, karena nama-nama itu menyembunyikan betapa berbedanya kedua produk tersebut. Sesame Preview adalah sebuah aplikasi, bukan API. Ia menyertakan empat agen dengan kepribadian yang berbeda — Maya (hangat dan kreatif), Miles (santai dan tajam), Simone (ingin tahu dan intelektual), Charlie (cerdas dan hangat) — masing-masing dengan suaranya sendiri dan memorinya sendiri yang tersinkronisasi di web dan seluler saat Anda masuk. Ia mencari di web, melakukan penelusuran mendalam, mencatat dan mengingatkan, serta mengirim ringkasan setelah setiap panggilan. Pratinjau ini gratis tanpa tingkatan berbayar, hanya dalam bahasa Inggris, dibatasi maksimal 30 menit per panggilan saat masuk (lima menit jika tidak), dan dengan sengaja tidak menjalankan tugas: ia akan bertukar pikiran dan meneliti, tetapi ia tidak akan memesan penerbangan Anda. Tidak ada kunci API di mana pun dalam produk ini — suara produksi adalah fitur aplikasi, bukan sebuah endpoint.

Screenshot of Sesame's official Mobile Preview page (sesame.com/mobile-preview), showing 'Personal agents for curious people' and 'Preview available now on iOS and Android' with App Store and Google Play links. Captured August 6, 2026.

NVIDIA NemotronLabs VoiceChat 11B justru kebalikannya: sebuah checkpoint, bukan produk. Model ini tiba di Hugging Face pada 3 Agustus 2026 tanpa pengumuman — tidak ada postingan peluncuran, tidak ada laporan teknis, tidak ada tweet; kartu model itulah pengumumannya. Ini adalah model ucapan full-duplex dengan 11B parameter (kami mengurai header safetensors dan menghitung 11,095 miliar parameter yang tersebar di 1.626 tensor) yang dibangun sebagai satu tumpukan: encoder Fast Conformer yang mengolah audio 16 kHz dalam frame 80 ms dengan konteks kanan nol, backbone Nemotron Nano 9B v2 yang menangani penalaran, decoder NVIDIA TTS yang menghasilkan audio 22,05 kHz, decoder RNN-T yang mentranskripsi pengguna, serta saluran keluaran terpisah yang menghasilkan skrip pemanggilan alat tanpa mencemari balasan lisan. Model ini mendengarkan dan berbicara secara bersamaan, dapat disela di tengah kata, dan NVIDIA mengklaimnya sebagai model full-duplex terbuka pertama dengan pemanggilan alat. Apakah klaim tersebut bertahan ketika bersentuhan dengan kenyataan akan dibahas dalam bagian tersendiri di bawah ini.

Tolok ukur tempat mereka berbeda — dua kandidat untuk "percakapan terbaik," dua standar bukti yang rusak

Kedua model mempertaruhkan seluruh reputasi mereka pada hal yang sama: kualitas percakapan — giliran berbicara, interupsi, waktu alami, nuansa pertukaran yang nyata. Itulah sebabnya mereka layak berada dalam satu judul berita. Di situlah perbandingan menjadi aneh, karena tidak ada satu pun kandidat yang dapat dinilai dengan tepat.

Sesame Preview tidak memiliki angka apa pun. Model produksinya belum dirilis dan tidak terdaftar — tidak ada ID model, tidak ada entri di papan peringkat ucapan-ke-ucapan Artificial Analysis, tidak ada target latensi, tidak ada tolok ukur apa pun. Pernyataan TestingCatalog bahwa ini adalah "salah satu mode suara terbaik yang tersedia di pasaran" adalah konsensus pengulas, bukan pengukuran, dan tidak ada cara untuk melakukan uji buta A/B terhadap apa pun. Satu-satunya model Sesame yang dapat dijalankan secara independen oleh siapa pun adalah basis CSM-1B berbobot terbuka, dan itu adalah checkpoint text-to-speech, bukan suara aplikasi tersebut.

NVIDIA NemotronLabs VoiceChat 11B memiliki masalah sebaliknya: ia punya angka, tetapi angka-angka itu terbagi di antara dua standar bukti yang tidak sejalan. NVIDIA melaporkan 448 ms untuk mengambil giliran dengan lancar, 480 ms untuk menyerah saat disela, dan tingkat pengambilalihan sempurna 1,0 atas gangguan pengguna — semuanya diukur oleh vendor pada Full-Duplex-Bench 1.0 milik NVIDIA sendiri, dan tidak ada satu pun yang direplikasi secara independen. Pengukuran independen dari keluarga model ini diarsipkan dengan nama dan jumlah parameter yang berbeda — "Nemotron 3 VoiceChat (V1)" pada 12B, label yang tidak pernah direkonsiliasikan NVIDIA dengan checkpoint 11B di Hugging Face — dan hasilnya kurang bagus di sisi pemahaman: 29,2% pada Big Bench Audio menurut Artificial Analysis, dibandingkan dengan 37,0% pada kartu NVIDIA sendiri. Pada VoiceBench, keluarga ini mendapat skor 58,10, hasil open full-duplex terbaik di papan tersebut. Jadi model yang sama sekaligus menjadi pemimpin di antara checkpoint open full-duplex dan sekitar tiga banding satu tertinggal di belakang pemimpin realtime yang di-host dalam memahami apa yang didengarnya.

A two-column comparison scoreboard for Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B. Sesame Preview: 'free app, 4 voice agents', 'Independent score: none — app unreleased', 'How you buy it: no API — app only', 'Callable voice: CSM-1B, $7/M chars', 'Memory: per-agent, syncs across devices', 'Latency: no published target'. NVIDIA NemotronLabs VoiceChat 11B: 'open full-duplex checkpoint', 'Independent score: VoiceBench 58.10 (V1/12B)', 'How you buy it: not buyable — research-only', 'Callable voice: none — 80 GB self-host', 'Memory: ~2 min audio context max', 'Latency: 448 ms turn-taking (NVIDIA)'. Footer: 'Nemotron figures per NVIDIA / Artificial Analysis (V1 12B lineage); Sesame app voice unmeasured; prices per vendor/OpenRouter.' OrcaRouter logo composited bottom-right.

Perbedaannya, kemudian, bukanlah mana yang lebih baik. Melainkan bahwa dua kandidat untuk percakapan terbaik tahun 2026 dinilai berdasarkan bukti yang berlawanan dan sama-sama tidak lengkap. Suara yang menurut para pengulas terasa paling manusiawi tidak memiliki pengukuran sama sekali, dan suara yang memiliki entri papan peringkat aktual adalah suara yang kelemahannya bersifat publik. Anda tidak dapat membandingkan reputasi dengan angka, dan di sini hanya ada satu angka — dan angka itu bukan yang menyanjung.

Access — unduhan dari toko aplikasi, atau build 80 GB

Jika Anda ingin mencoba salah satunya, garis awal berbeda dengan cara yang lebih penting daripada spesifikasi apa pun.

Sesame Preview is a download. The official page reads "Preview available now on iOS and Android," and the Android build has been rolling out since mid-July (the Android beta added image upload and voice memos). There is no API key anywhere. A developer who wants Sesame's actual voice has nothing to call — the only Sesame model reachable through an API is the open-weight CSM-1B base, listed at $7 per million characters, and that is the architecture behind the app, not the app's voice: a text-to-speech checkpoint with a 4K context window and no conversational abilities of its own.

NVIDIA NemotronLabs VoiceChat 11B bukanlah unduhan yang bisa langsung Anda jalankan — ini adalah build yang harus Anda dirikan sendiri. Hugging Face menyatakan model tersebut "tidak diterapkan oleh Penyedia Inferensi mana pun"; NVIDIA belum menghostingnya; dan config.json di repositori tersebut adalah konfigurasi pelatihan NeMo, sehingga tidak ada checkpoint Transformers yang dapat Anda arahkan ke AutoModel. Jalur yang didukung adalah lingkungan conda yang dipatok pada Python 3.12, PyTorch 2.10, dan Transformers 4.56, dengan causal-conv1d dan mamba-ssm yang dikompilasi dari sumber, pada GPU 80 GB (A100, H100, H200, B200, atau RTX 6000) yang menjalankan vLLM — atau kontainer NGC NIM milik NVIDIA, yang mengekspos WebSocket yang kompatibel dengan Realtime O​penAI di /v1/realtime setelah Anda berada di perangkat keras tersebut. Penghitung unduhan menceritakan kisah akses: sekitar 80 unduhan pada bulan pertama model tersebut dibandingkan 107 suka. Orang-orang menandainya; hampir tidak ada yang menjalankannya. Satu catatan jujur untuk peneliti yang melakukannya: tulang punggung penalaran yang menjadi dasar checkpoint ini, Nemotron Nano 9B v2, adalah model yang dihosting yang dapat Anda panggil hari ini — model full-duplex di sekitarnya tidak, dan kesenjangan itulah inti permasalahannya.

The Hugging Face model card for nvidia/NVIDIA-NemotronLabs-VoiceChat-11B, showing the OpenMDW 1.1 research-only license, 'This model isn't deployed by any Inference Provider', natural turn-taking / barge-in / tool calling, ~450 ms response, 11B params, and 80 downloads in the last month with 107 likes. Captured August 6, 2026.

Harga — aplikasi gratis, beban gratis, dan tagihan 80 GB.

Kedua model tersebut "gratis," dan kata tersebut sama-sama menyesatkan dalam kedua kasus tersebut.

Sesame Preview is genuinely free — no paid tier, no ads, no data selling — because it is a preview you are being invited to test, and Sesame's monetization is a later problem. NVIDIA NemotronLabs VoiceChat 11B's weights cost nothing to download, but the hardware does: a continuously-running H100-class instance at roughly $2–3 an hour lands near $1,500–2,200 a month before you have written any application code, hired anyone to keep it up, or served a second concurrent conversation — and because the license forbids commercial use, that is money you can only spend on research. Between them sits CSM-1B at $7 per million characters, a hosted price for a model whose default is self-hosting.

Tolok ukur yang jujur untuk hari ketika salah satu dari keduanya mulai dapat dibeli: apa pun model suara terhosting yang Anda pilih, harga daftar penyedialah yang harus Anda bayar, tanpa markup perutean di atasnya — penerusan yang membuat pemotongan harga vendor muncul di tagihan Anda pada hari yang sama, bukan setelah satu siklus kontrak. Tidak satu pun model dalam artikel ini yang dapat dipanggil melalui OrcaRouter: suara produksi Sesame tidak memiliki API sama sekali, dan NVIDIA NemotronLabs VoiceChat 11B tidak dapat dipanggil melalui apa pun. Tolok ukur ini adalah untuk suara yang benar-benar dapat Anda beli, dan itulah standar yang membuat basis T​TS seharga $7 per juta karakter atau API berkualitas Sesame di masa depan mudah untuk diberi harga secara jujur.

Memory — aplikasi yang ingat vs model yang lupa

Di sini kesenjangannya adalah ngarai, dan ini adalah alasan paling konkret mengapa keduanya bukan pengganti satu sama lain. Aplikasi Sesame Preview mengingat: {{1}}setiap agen membawa memori per-agen yang tersinkron di web dan seluler saat Anda masuk, panggilan dapat berlangsung hingga 30 menit, dan Mode Incognito membaca memori masa lalu tanpa membuat yang baru{{/1}}. Sebaliknya, CSM-1B sumber terbuka memiliki jendela konteks 4K — kira-kira tiga hingga empat menit teks — dan tidak memiliki telinga untuk mendengarkan Anda.

NVIDIA NemotronLabs VoiceChat 11B menyimpan paling banyak sekitar dua menit konteks audio — dataloader pelatihan membatasi ucapan hingga 142.39 detik, dan kartu tersebut memperingatkan bahwa percakapan di luar jendela dua menit mungkin tidak dipertahankan. Untuk panggilan dukungan yang perlu mengingat apa yang disepakati empat menit lalu, batas itu sendiri sudah mendiskualifikasi. Tambahkan satu suara tetap (Aria) tanpa kloning di checkpoint yang dirilis, dan model yang terbuka tentang arsitekturnya juga merupakan model yang tidak dapat mengingat pelanggan atau mengubah suaranya sendiri.

Apa yang masing-masing benar-benar buruk

Tenang, karena perbandingan yang berhenti pada kekuatan adalah pemasaran:

Sesame Preview: tidak ada API — Anda tidak dapat memasukkan suara ini ke dalam produk, dan model produksinya belum dirilis dan belum dinilai. Hanya bahasa Inggris, tanpa eksekusi tugas, batas panggilan 30 menit, dan tidak ada tolok ukur independen apa pun. Satu-satunya model terbuka, CSM-1B, memiliki jendela konteks 4K, tanpa pemanggilan alat, tanpa sisi mendengarkan, dan bukan suara aplikasi.

NVIDIA NemotronLabs VoiceChat 11B: lisensi khusus riset (OpenMDW v1.1) — Anda dapat mengunduh, mempelajari, dan menyetelnya, tetapi Anda tidak dapat merilisnya, begitu pula siapa pun yang membangun di atasnya. Tidak ada endpoint yang dihosting, jadi "mencobanya" berarti GPU 80 GB dan build dari sumber. Hanya bahasa Inggris, batas memori sekitar 2 menit, satu suara tetap. NVIDIA menyatakan bahwa model ini mungkin berkinerja lebih buruk daripada backbone-nya sendiri dalam hal pengetahuan dan mengikuti instruksi, dengan penalaran multi-langkah dan aritmetika yang disebut lemah. Model ini dapat memotong kalimat Anda di tengah-tengah, berubah menjadi omong kosong yang tidak dapat dipulihkan atau berbicara sendiri setelah beberapa giliran, menghilangkan kata-kata dalam transkripsi, dan secara eksplisit tidak cocok untuk ruangan yang bising atau bergema. Pemanggilan alat (tool calling) hanya berfungsi dengan perintah dan respons ASCII, maksimal lima alat per sesi, dan akurasi argumennya (44.2%) serta tingkat keberhasilan percobaan pertama (33%) berarti model ini lebih andal dalam memilih alat yang tepat daripada dalam mengisi argumen alatnya.

Siapa yang harus memilih yang mana

Karena keduanya tidak dapat dipanggil, jawaban yang jujur dimulai dari apa yang Anda coba lakukan.

Rasakan suara dengan ulasan terbaik tahun 2026: Sesame Preview, gratis, hari ini — sebagai aplikasi. Empat agen, penanganan interupsi, kemudahan penggunaan mode berkendara yang terus dikutip para peninjau: itu adalah produk konsumen, dan nilainya justru hal yang tidak dapat Anda ukur.

Pelajari pemodelan ucapan full-duplex: NVIDIA NemotronLabs VoiceChat 11B adalah unduhan yang lebih menarik dalam kategorinya — sebuah checkpoint terbuka 11B dengan kanal pemanggilan alat yang berfungsi, sekitar 550.000 jam audio pelatihan campuran, dan hasil VoiceBench full-duplex terbuka terbaik sejauh ini, semuanya dengan biaya nol dolar untuk bobotnya. Lisensi khusus riset bukanlah kendala untuk pekerjaan tersebut.

Build on Sesame's architecture: CSM-1B is the only Sesame model a developer can actually call — $7 per million characters, Apache-2.0, zero-shot voice cloning — with the honest caveat that it is a base text-to-speech model, not the production voice the app uses.

Luncurkan produk suara pada kuartal ini: bukan keduanya. Anda memerlukan model speech-to-speech realtime yang dihosting dengan lisensi komersial, dan cara aman untuk mengadopsi model yang belum Anda pertaruhkan sebagai jalur produksi adalah dengan mengarahkan lalu lintas ke model tersebut di samping model yang sudah teruji dengan failover otomatis, sehingga suara yang belum teruji tidak akan pernah menjatuhkan panggilan live. Satu API untuk mengakses 200+ model yang dihosting dengan harga daftar penyedia, tanpa markup, adalah yang membuat mencoba suara yang baru tersedia menjadi perubahan konfigurasi, bukan penulisan ulang.

Pola ini layak diberi nama karena akan berulang. Kedua model ini hanya berjarak satu peristiwa dari menjadi dapat dipanggil — Sesame pada hari ia merilis ID model atau API, NVIDIA NemotronLabs VoiceChat 11B pada hari NVIDIA menerbitkan lisensi komersial atau siapa pun menghostingnya. Ketika itu terjadi, langkah yang tepat bukanlah merobohkan tumpukan suara Anda yang sekarang. Melainkan menambahkan suara baru di samping suara lama dan merutekan dengan failover, persis seperti yang Anda lakukan untuk model baru yang belum teruji. Keduanya adalah suara terbaik yang belum dapat dirilis pada tahun 2026; infrastruktur untuk merilis suara ketiga sudah ada.

Apa yang akan mengubah perbandingan ini?

Empat peristiwa akan menulis ulang tulisan ini. Sebuah API atau ID model untuk suara produksi Sesame — begitu itu terjadi, Sesame berhenti menjadi aplikasi dan menjadi pemain yang telah lama ditunggu pasar voice-API terhosting. Lisensi komersial atau endpoint terhosting untuk NVIDIA NemotronLabs VoiceChat 11B, yang akan mengubah artefak riset menjadi opsi produk nyata dalam semalam. Skor independen untuk suara Sesame — pencantuman di papan speech-to-speech milik Artificial Analysis akan memberi klaim "suara terbaik" sesuatu untuk diuji. Dan laporan teknis dari NVIDIA yang merekonsiliasi checkpoint 11B dengan entri 12B "Nemotron 3 VoiceChat (V1)" yang diukur papan peringkat, yang merupakan prasyarat untuk mempercayai angka-angka dari keluarga model tersebut. Sampai salah satu dari itu hadir, ringkasan yang akurat sederhana: dua suara percakapan paling menarik di tahun 2026 sama-sama terkunci — satu oleh perusahaan yang tidak akan menjual, yang lain oleh lisensi yang tidak akan dirilis.

FAQ

Bisakah saya menggunakan suara salah satu model di dalam aplikasi saya sendiri?

No, and the two reasons are the shape of this comparison. Sesame Preview's production voice has no API, no model ID, and no endpoint — it exists only as the app. NVIDIA NemotronLabs VoiceChat 11B is open-weight but research-only (OpenMDW v1.1), self-hosted on an 80 GB GPU, with no hosted inference provider. The only Sesame model a developer can call is CSM-1B at $7 per million characters, and it is a text-to-speech base, not the app's voice.

Manakah dari keduanya yang sebenarnya terdengar lebih manusiawi?

Tidak diketahui, dengan alasan yang berbeda untuk masing-masing. Sesame Preview tidak memiliki skor independen sama sekali — pernyataan TestingCatalog bahwa ini "salah satu mode suara terbaik yang tersedia di pasar" adalah konsensus pengulas, bukan sebuah pengukuran. Waktu percakapan NVIDIA NemotronLabs VoiceChat 11B (448 ms giliran bicara, 480 ms waktu menyerah saat interupsi) dilaporkan oleh NVIDIA dan belum direproduksi, dan angka independen Big Bench Audio-nya (29,2%, menurut Artificial Analysis, tercantum di bawah "Nemotron 3 VoiceChat (V1)") mengukur pemahaman, bukan seberapa enak suaranya didengar. Yang satu memiliki reputasi yang bisa Anda dengar; yang lainnya memiliki angka yang menjawab pertanyaan yang berbeda.

Apakah NVIDIA NemotronLabs VoiceChat 11B benar-benar gratis?

Bobotnya gratis; modelnya tidak murah. Menjalankannya membutuhkan GPU 80 GB (sekitar $2–3 per jam on-demand, $1.500–2.200 per bulan jika terus aktif) dan kompilasi dari sumber, dan lisensi OpenMDW v1.1 membatasinya hanya untuk tujuan riset — jadi bahkan setelah pengeluaran tersebut, Anda tidak dapat secara sah menaruhnya di hadapan pelanggan.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube