
NVIDIA NemotronLabs VoiceChat 11B: Model Suara Full-Duplex yang NVIDIA Rilis Tanpa Diumumkan
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
Dua kartu model berada di repositori Hugging Face yang sama, dan keduanya saling bertentangan. Kartu yang tampil di halaman menyebut model tersebut NVIDIA NemotronLabs VoiceChat 11B, memberikan tanggal rilisnya sebagai 3 Agustus 2026, dan mencantumkan parameter 11B. Kartu kedua, sebuah file bernama overview.md yang tidak dilihat siapa pun kecuali mereka membuka tab Files, menyebut model yang sama sebagai 12B, memberi tanggal rilis 16 Juli, memuat bagian tolok ukur yang tidak ada di kartu publik, dan masih memiliki kata TODO yang berada di tempat deskripsi hasil seharusnya ada. Tidak ada satu pun kartu yang disertai posting peluncuran, siaran pers, laporan teknis, atau cuitan dari NVIDIA.
Akan tetapi, yang ada di dalamnya bukanlah placeholder. Ini adalah checkpoint 44 GB yang mendengarkan dan berbicara secara bersamaan: satu tumpukan yang menerima audio mikrofon dan mengeluarkan ucapan yang disintesis, tanpa relai biasa dari pengenalan ucapan ke model bahasa lalu ke text-to-speech. Dibangun di atas Nemotron Nano 9B v2 backbone, model ini dapat memanggil alat di tengah kalimat sambil terus berbicara, dan NVIDIA mengklaim bahwa ini adalah model full-duplex terbuka pertama yang mampu melakukan hal tersebut.
Semua yang di bawah ini dibaca langsung dari repositori tersebut — dua kartu, config.json, dan indeks tensor di dalam file bobot, yang kami urai sendiri untuk menyelesaikan pertanyaan 11B-versus-12B. Setiap angka performa yang NVIDIA publikasikan untuk model ini adalah milik NVIDIA sendiri, diukur oleh NVIDIA, dan tidak direproduksi. Tepatnya ada satu pengukuran independen dari garis keturunan ini yang tersedia di publik, dari Artificial Analysis, dan itu tercatat dengan nama yang berbeda dan jumlah parameter yang berbeda — yang ternyata menjadi hal paling menarik tentang rilis ini.
Apa yang sebenarnya ada di dalam repositori
Repo ini dibuat pada tanggal 29 Juli 2026 dan terakhir diubah pada tanggal 4 Agustus. Repo ini berisi tujuh belas file: dua kartu model yang bersaing, sebuah lisensi, sebuah config.json, satu 44,4 GB model.safetensors, sebuah diagram arsitektur, sebuah direktori tokenizer RNN-T, empat catatan kebijakan singkat tentang bias, keamanan, privasi, dan keterjelasan, serta tiga .wav file — demo giliran bicara, demo barge-in, dan demo pemanggilan alat — yang disematkan sebagai pemutar audio di bagian atas kartu sehingga Anda mendengar model sebelum membacanya.
Beberapa hal tidak ada, dan itu lebih penting daripada daftar file.
• Tidak ada makalah untuk model ini. Kartu tersebut mengutip lima: VoiceBench, Full-Duplex-Bench 1.0, Full-Duplex-Bench v3, SALM-Duplex, Audio Flamingo 3, ditambah pracetak PersonaPlex milik NVIDIA sendiri. Tidak satu pun dari semuanya merupakan laporan teknis NemotronLabs VoiceChat. Arsitekturnya dijelaskan dalam sekitar tiga paragraf dan sebuah diagram, dan itulah seluruh catatan publik tentang bagaimana model tersebut dibangun.
• Tidak ada cara untuk memanggilnya. Halaman Hugging Face menyatakan dengan jelas bahwa model tersebut "tidak digunakan oleh Penyedia Inferensi mana pun." Tidak ada endpoint yang dihosting, baik dari NVIDIA maupun pihak lain. Satu-satunya utas komunitas yang terbuka di repositori adalah pengguna yang meminta NVIDIA untuk menambahkan handler.py sehingga checkpoint tersebut dapat di-deploy ke Hugging Face Inference Endpoints — seseorang yang mencoba menjalankannya dengan cara mudah dan ternyata tidak ada.
• Tidak ada pipeline_tag dan tidak ada library_name. Itulah mengapa halaman ini tidak memiliki widget inferensi dan label tugas, dan ini merupakan gejala dari masalah yang lebih mendalam: config.json bukanlah config Transformers. Ini adalah NeMo 32 KB training config, lengkap dengan blok AdamW, jadwal learning-rate, bucket bins dataloader, dan split validasi. Anda tidak bisa mengarahkan AutoModel.from_pretrained ke ini. Anda mengklon cabang spesifik dari repositori Speech NVIDIA — nemotron-labs-voicechat — buat lingkungan conda yang dipatok ke Python 3.12, PyTorch 2.10, dan Transformers 4.56, kompilasi causal-conv1d dan mamba-ssm tanpa isolasi build, dan jalankan skrip mereka.
Penghitung unduhan mencerminkan semua itu. 107 suka berbanding 80 unduhan pada bulan pertama model tersebut adalah tanda dari rilis yang orang-orang tandai dan tidak dijalankan.

Kami menghitung parameternya, dan 11B menang.
Berkas safetensors membawa header JSON yang mencantumkan setiap tensor, bentuknya, dan tipe datanya, sehingga jumlah parameter bukanlah masalah opini. Kami mengambil header tersebut dan menjumlahkannya: 11.095 juta parameter dalam 1.626 tensor float32, menempati 44,38 GB. Jadi kartu yang dirender benar dan overview.md sudah usang — ini adalah model 11B, dan angka 12B adalah sisa.
Pohon model Hugging Face menjelaskan dari mana 12B mungkin muncul. Garis keturunannya mencakup Nemotron Nano 12B v2 Base, lalu Nemotron Nano 12B v2, kemudian Nemotron Nano 9B v2, dan baru setelah itu model ini. Keluarga backbone teks NVIDIA sendiri berisi 12B dan 9B, dengan 9B sebagai turunan terpangkas dari 12B, dan VoiceChat dibangun di atas 9B. Kartu yang disusun lebih awal dalam rantai tersebut tentu akan membawa angka yang lebih besar.
Header juga terbagi dengan rapi di sepanjang dua bagian arsitektur:
• Sisi pemahaman — 10.098B. Dari jumlah tersebut, 7.714B adalah tumpukan transformer Nemotron Nano v2, 0.609B adalah encoder ucapan, dan tiga matriks terpisah 131,072 × 4,480 masing-masing sebesar 0.587B.
• Sisi berbicara — 0.997B. Sebuah tulang punggung text-to-speech dengan 28 lapisan dan lebar 1,152 pada 0.595B, kepala keluaran mixture-of-Gaussians 0.159B, dan codec audio neural yang encoder dan decoder-nya masing-masing 0.092B.
Dua konsekuensi praktis muncul dari dtype. Yang pertama adalah bahwa unduhan 44 GB itu bukan model yang besar, melainkan model biasa yang dikirim dalam float32; ubah ke bfloat16 dan bobotnya menjadi sekitar 22 GB. Yang kedua adalah bahwa batas minimum yang dinyatakan NVIDIA sebesar 80 GB GPU adalah konsekuensi dari pilihan tersebut, bukan dari ukuran model, dan siapa pun dengan kartu 48 GB yang bersedia mengonversi checkpoint sendiri tidak serta-merta terkunci — meskipun belum ada yang mempublikasikan hasil run yang terkonfirmasi pada ukuran itu, jadi anggap saja sebagai perhitungan, bukan janji.
Bagaimana ia mendengarkan dan berbicara pada saat yang bersamaan
"Full duplex" adalah inti dari rilis ini, dan konfigurasi menunjukkan bagaimana ia didapatkan. Tiga pilihan desain melakukan pekerjaan tersebut.
• Encoder ucapan tidak dapat melihat ke depan. Ini adalah Conformer 24-lapis, 8-kepala yang konteks perhatiannya diatur ke [70, 0] — tujuh puluh bingkai konteks kiri dan nol bingkai konteks kanan. Pengenal konvensional mengintip audio setelah momen berjalan untuk mengklarifikasi apa yang baru saja didengarnya; pengenal ini tidak diizinkan melakukan hal tersebut, yang mengorbankan akurasi tetapi memberi kemampuan untuk mengeluarkan keputusan seketika saat sebuah bingkai tiba.
• Semuanya dikuantisasi menjadi 80 ms. Panjang frame pada konfigurasi adalah 0,08 detik, sesuai dengan ukuran potongan 80 ms yang telah dijelaskan NVIDIA di tempat lain untuk bidang pekerjaan ini. Model memutuskan setiap 80 ms apakah akan terus mendengarkan atau mulai berbicara. Irama itulah yang membuat barge-in terasa langsung, bukan sekadar sopan.
• Panggilan tool keluar dari mulut mereka sendiri. Ingat tiga matriks kosakata 131.072 yang bentuknya identik. Satu adalah embedding masukan, satu lagi adalah head model bahasa biasa — dan yang ketiga diberi nama function_head. "Saluran keluaran terpisah untuk skrip pemanggilan tool" dalam prosa kartu tersebut secara harfiah adalah proyeksi keluaran ketiga, selebar 587 juta parameter, berjalan paralel dengan pembangkitan ucapan. Itulah alasan arsitektural mengapa model dapat mengirimkan panggilan tool tanpa menghentikan percakapan, dan ini adalah komitmen desain yang nyata, bukan sekadar konvensi prompt.
Di bagian hilir, dekoder text-to-speech memprediksi kode untuk codec residual-vector-quantized dengan 31 kuantizer dan rasio downsampling 7, 7, dan 9 — reduksi 441× yang menghasilkan laju token audio sebesar 50 frame per detik, dengan keluaran 22,05 kHz. Inputnya 16 kHz. Ada juga dekoder RNN-T dan joint network dalam checkpoint, itulah sebabnya keluaran yang dideklarasikan model mencakup transkrip dari pengguna di samping teks dan audionya sendiri: transkripsi tersebut adalah head pengenalan yang sesungguhnya, bukan produk sampingan. Suara default disebut Aria, dan klip referensi tiga detik mengondisikan pembicaranya.
Satu detail lagi dari konfigurasi ini layak disorot karena menguatkan keterbatasan yang disebutkan: dataloader pelatihan membatasi ucapan hingga 142.39 detik. Peringatan pada kartu bahwa model hanya dapat memuat konteks audio maksimal dua menit terlihat pada pipa data yang menghasilkannya.
Skor, dan siapa yang sebenarnya mengukurnya
Klaim utama NVIDIA adalah latensi dan peringkat. Pada Full-Duplex-Bench 1.0, mereka melaporkan 448 ms untuk mengambil giliran dengan lancar dan 480 ms untuk mengalah saat terinterupsi, dengan tingkat pengambilalihan 0,82 pada pergantian giliran yang lancar dan 1,0 pada interupsi pengguna, serta skor penilai GPT-4o sebesar 4,33 pada penanganan interupsi. Mereka mengklaim peringkat #2 di antara model full-duplex terbuka di VoiceBench dan #2 di antara model terbuka di Full-Duplex-Bench. Semua itu adalah hasil pengujian NVIDIA sendiri.
Sejajarkan mereka dengan dunia luar dan dua celah terbuka.
• Pada penalaran wicara, nilai vendor lebih tinggi sekitar delapan poin. Berkas yang belum dirender overview.md melaporkan 37,0% pada Big Bench Audio. Artificial Analysis secara independen mengukur keluarga model ini pada 29,2%. Tolok ukur yang sama, keluarga yang sama, selisih yang cukup besar untuk mengubah posisi model dalam peringkat.
• Pada VoiceBench, angka vendor terlalu rendah. Kartu ini mengklaim #2 di antara model full-duplex terbuka; papan peringkat VoiceBench publik menempatkan model ini pada 58.10, yang merupakan teratas dari kelompok full-duplex terbuka, di depan Freeze-Omni dengan 55.20 dan Moshi dengan 29.51. Kartu draf NVIDIA sendiri melaporkan 55.1 untuk dirinya sendiri — di bawah angka yang sekarang tercantum di papan peringkat.
Ada juga keanehan yang lebih kecil: tabel perbandingan milik NVIDIA sendiri menilai para pesaingnya lebih murah hati daripada Artificial Analysis. Kartu draf menempatkan Freeze-Omni pada 33,4% dan PersonaPlex 7B pada 19,1% di Big Bench Audio; Artificial Analysis mengukur 33,9% dan 12,6%. Urutan antar-rekan tetap bertahan apa pun caranya, yang meyakinkan, tetapi ini mengingatkan bahwa tolok ukur vendor dan tolok ukur independen tidak menghasilkan angka yang sama bahkan untuk pihak ketiga.

Grafik ini membuat judul yang jujur tak terelakkan. Di antara model full-duplex terbuka, ini adalah langkah maju yang sesungguhnya — ia lebih dari dua kali lipat PersonaPlex dalam penalaran lisan dan meninggalkan Moshi dalam kategori yang sama sekali berbeda. Jika dibandingkan dengan yang bisa Anda beli, ia tidak mendekati sama sekali: Step-Audio R1.1 pada 96%, Voice Agent milik Grok 4.5 dan Gemini 2.5 Flash (Thinking) pada 92%, Nova 2.0 Sonic pada 87%. Itu kira-kira kesenjangan tiga banding satu dalam penalaran dari masukan lisan.
Cara paling jelas untuk melihat berapa biaya full duplex saat ini adalah di dalam katalog NVIDIA sendiri. Pada VoiceBench, NVIDIA Nemotron 3 Nano Omni 30B A3B — model yang lebih besar yang tidak full duplex — mencetak skor 89,39, dibandingkan dengan 58,10 untuk VoiceChat. Sekitar tiga puluh poin kualitas asisten adalah harga dari penanganan interupsi dan pengambilan giliran bicara di bawah 500 ms, setidaknya pada generasi ini. Jika produk Anda tidak membutuhkan model yang dapat dipotong di tengah kata, Anda membayar mahal untuk fitur yang tidak akan Anda gunakan.
Pemanggilan tool adalah sorotan utamanya, dan juga bagian yang paling lemah.
"Model full-duplex terbuka pertama yang mendukung pemanggilan alat" adalah klaim yang menjadi dasar rilis ini, dan angka-angka di bawahnya tidak merata. Pada konversi lisan BFCL-v3, NVIDIA melaporkan rata-rata 56,1%: 58,5% sederhana, 62,5% ganda, 42,5% paralel, 27,5% paralel-ganda, dan 89,6% untuk penolakan yang benar terhadap panggilan tidak relevan. Pada Full-Duplex-Bench v3, perbedaannya bahkan lebih tajam.
• Pemilihan alat — 82.5%. Memilih fungsi yang tepat dari daftar, yang oleh NVIDIA digambarkan secara wajar sebagai kompetitif dengan model-model terdepan.
• Akurasi argumen — 44,2%. Mengisi parameter fungsi tersebut dengan benar berdasarkan apa yang dikatakan pengguna.
• Pass@1 — 33%. Berhasil melakukan seluruh panggilan dengan benar pada percobaan pertama.
Model yang dua pertiga lebih andal mengetahui tool mana yang diinginkannya dibandingkan mengisi argumen tool-nya adalah model yang akan dengan percaya diri mencari cuaca untuk kota yang salah. Dalam agen teks, Anda akan menangkapnya dengan lapisan validasi dan percobaan ulang; dalam panggilan suara langsung, percobaan ulang itu terdengar, dan kartu tersebut mencatat bahwa model tidak boleh mencoba ulang panggilan yang gagal sama sekali — model tersebut diinstruksikan untuk memberi tahu pengguna bahwa API mengalami masalah.
Batasan operasional di sekitarnya ketat, dan NVIDIA menyebutkannya secara lugas: maksimal lima alat per sesi sebelum kualitas menurun, tidak ada panggilan multi-alat simultan yang andal, tidak ada cara bagi pengguna untuk menginterupsi saat alat sedang dieksekusi, dan kecenderungan dalam percakapan campuran untuk menjawab dari pengetahuannya sendiri alih-alih memanggil alat yang seharusnya ia panggil. Respons alat yang panjang membuat agen macet, dan fitur 'pesan tunggu' ada untuk menutupi hal itu — Anda menulis frasa lebih dahulu yang diucapkan agen saat panggilan dipicu, sehingga keheningan terisi oleh sesuatu.
Satu keanehan yang akan membuat seseorang menghabiskan satu sore: prompt sistem dan respons alat harus hanya ASCII. Tanpa em dash, tanpa tanda kutip melengkung, tanpa simbol derajat, tanpa emoji. Keluaran alat harus diubah menjadi kalimat ASCII biasa yang mudah diucapkan sebelum sampai ke model, yang berarti respons API JSON tidak dapat diteruskan mentah-mentah.
Berapa biaya untuk menjalankannya, dan lisensi yang menghalangi Anda
Mulai dengan perangkat keras. Dokumentasi cabang NVIDIA meminta GPU dengan memori minimal 80 GB, yang mengarah ke H100 atau H200, dan konfigurasi yang diuji adalah H100 dengan vLLM. Kapasitas H100 on-demand berkisar sekitar $2–3 per jam di berbagai cloud GPU pada umumnya, sehingga instance yang berjalan terus-menerus berada di sekitar $1.500–2.200 per bulan sebelum Anda menulis kode aplikasi apa pun, mempekerjakan siapa pun untuk menjaganya tetap berjalan, atau melayani percakapan konkuren kedua.
Sekarang perbandingannya. Artificial Analysis menormalkan penetapan harga ucapan-ke-ucapan yang di-host menjadi biaya per jam audio input, dan rentang saat ini berkisar dari sekitar $1,42/jam di ujung murah hingga $10,75/jam untuk tingkat premium termahal, dengan opsi pasar menengah yang terkenal seperti Grok Voice Think Fast 2.0 berada di $4,80/jam — itu $0,08 per menit audio.

Baca kedua paragraf tersebut bersama-sama dan kasus self-hosting lebih lemah dari yang terlihat. H100 khusus hanya lebih murah daripada endpoint hosted dengan harga menengah jika Anda benar-benar menjaganya tetap sibuk, dan lebih mahal daripada ujung murah pasar hosted hampir tanpa memandang tingkat utilisasi, sementara Anda juga menanggung biaya rekayasa, on-call, dan model yang mencetak 29,2% di mana opsi hosted mencetak 87–96%.
Dan kemudian ada temboknya. Lisensinya adalah OpenMDW License Agreement v1.1, dan kartu tersebut menyatakan dalam blok kutipannya sendiri bahwa model "hanya siap untuk tujuan penelitian." Kode pada cabang GitHub adalah Apache-2.0; sedangkan bobotnya tidak. Anda dapat mengunduhnya, mempelajarinya, menyempurnakannya, melakukan benchmarking, dan menulis tentangnya. Anda tidak dapat menyajikannya kepada pelanggan. Setiap argumen ekonomi di atas karenanya hanyalah bersifat akademis bagi perusahaan yang mencoba meluncurkan produk suara — pertanyaannya tidak pernah apakah perhitungan GPU berhasil.
Yang juga menjadi alasan mengapa kami akan mengatakan hal yang jelas secara gamblang: NemotronLabs VoiceChat 11B tidak dapat dipanggil melalui OrcaRouter, karena ia tidak dapat dipanggil melalui apa pun. Yang didapatkan dari satu kunci tersebut adalah garis dasar yang seharusnya menjadi tolok ukurnya — model suara dan audio yang di-hosting berada di balik satu API dengan markup 0%, artinya kami meneruskan harga daftar penyedia secara langsung, jadi ketika vendor menurunkan tarif audionya, angka yang lebih rendah itulah yang Anda bayarkan pada hari itu juga, bukan setelah satu siklus kontrak. Jika Anda menentukan harga untuk agen suara, angka per menit itulah yang harus dikalahkan oleh GPU 80 GB, dan hal itu layak untuk diketahui secara pasti sebelum Anda berkomitmen pada sebuah rack.
Masalah penamaan: 11B, 12B, NemotronLabs, Nemotron 3
Di sinilah sebagian besar liputan awal keliru, jadi ada baiknya berhati-hati membedakan apa yang sudah pasti dan apa yang belum.
Empat platform milik NVIDIA sendiri mendeskripsikan karya ini dengan tiga label berbeda. Hugging Face menerbitkan "NVIDIA NemotronLabs VoiceChat 11B" dengan bobot terbuka dan lisensi khusus riset. Blog pengembang NVIDIA, pada Maret 2026, mendeskripsikan "Nemotron 3 VoiceChat" sebagai model dupleks penuh 12B parameter dalam akses awal, yang menargetkan sub-300 ms latensi ujung-ke-ujung pada potongan 80 ms, dengan program akses awal yang menawarkan kontainer referensi, hasil tolok ukur, dan jalur penyesuaian halus, serta menjanjikan "bobot terbuka dan dapat diperiksa untuk penerapan perusahaan." Papan peringkat publik VoiceBench dan Artificial Analysis sama-sama mencatat entri mereka sebagai "Nemotron 3 VoiceChat (V1)," 12B.
Apa yang dapat diketahui: deskripsi arsitekturnya cocok komponen demi komponen — encoder Fast Conformer, backbone Nemotron Nano v2 9B, decoder text-to-speech NVIDIA, saluran pemanggilan alat terpisah, bingkai 80 ms, satu stack terpadu. Kartu yang tidak dirender di repositori Hugging Face menggunakan angka 12B seperti yang digunakan platform lain. Ini adalah lini kerja yang sama, dan entri pihak ketiga hampir pasti mengukur keluarga ini.
Apa yang tidak dikonfirmasi: bahwa checkpoint yang dapat Anda unduh hari ini adalah sama bit-demi-bit dengan apa yang dievaluasi oleh Artificial Analysis dan VoiceBench, atau apa yang diberikan oleh program akses awal. Dua detail bertentangan dengan asumsi tersebut. Jumlah parameter berbeda, 11.095B yang terukur dibandingkan dengan 12B sesuai pengajuan. Dan target latensi berbeda tajam — tawaran enterprise dari blog adalah kurang dari 300 ms end-to-end, sementara kartu yang dikirim mencatat 448 ms dan 480 ms pada Full-Duplex-Bench. Itu bisa jadi titik pengukuran berbeda pada model yang sama, atau model yang berbeda. NVIDIA belum mengatakan, karena NVIDIA belum sama sekali mengatakan apa pun tentang rilis ini.
Kesimpulan praktisnya: jika Anda mengutip angka untuk model ini, sebutkan dari permukaan mana angka itu berasal. Liputan yang mengaitkan 29,2% milik Artificial Analysis dengan kartu model Hugging Face, atau 37,0% milik NVIDIA dengan pengujian independen, telah menggabungkan dua hal yang NVIDIA sendiri pisahkan dalam dokumen-dokumen terpisah dengan jumlah parameter yang berbeda.
Di mana ia rusak
Bagian keterbatasan pada kartu drafnya luar biasa jujur, dan cabang GitHub-nya menambahkan lebih banyak lagi. Dikumpulkan:
• Hanya bahasa Inggris, dan tidak ada peta jalan multibahasa di repositori.
• Memori dua menit. Percakapan yang melebihi jendela audio dua menit mungkin tidak dapat disimpan — batas keras untuk panggilan dukungan atau apa pun yang perlu mengingat apa yang disepakati empat menit lalu.
• Lebih bodoh daripada backbone-nya sendiri. NVIDIA menyatakan bahwa model ini mungkin berkinerja lebih buruk daripada Nemotron Nano 9B v2 dalam hal pengetahuan, mengikuti instruksi dan keamanan, karena disetel untuk kealamian percakapan. Model ini tidak dilatih secara eksplisit untuk penalaran atau penyelarasan; penalaran multi-langkah dan aritmetika disebut sebagai kelemahan.
• Tidak ada backchanneling yang andal. "Mm-hm" yang menandakan bahwa manusia masih mendengarkan tidak ditangani secara sistematis.
• Ia akan memotong Anda di tengah kalimat. Catatan cabang mencantumkan interupsi terhadap pengguna saat jeda di tengah kalimat, dan "kelanjutan yang tak terkendali / bicara sendiri," di antara mode kegagalan yang diketahui — biaya langsung dari encoder dengan konteks kanan nol.
• Hanya ruangan yang tenang. Secara eksplisit tidak cocok untuk lingkungan yang bising atau bergema, terutama saat ada percakapan di latar belakang. Hal ini mengecualikan sebagian besar lantai call center dan sebagian besar mobil.
Siapa yang sebenarnya harus mengunduh ini
Para peneliti yang bekerja pada pemodelan ucapan dupleks mendapatkan yang paling banyak di sini, dan harus beralih: checkpoint terbuka 11B dengan saluran pemanggilan alat yang berfungsi, dilatih pada sekitar 550.000 jam audio asli dan sintetis yang digabungkan, adalah titik awal yang jauh lebih baik daripada mengimplementasikan ulang dari makalah SALM-Duplex. Lisensi penelitian bukanlah kendala pada pekerjaan itu.
Tim yang membangun agen suara sebaiknya membaca kartu tersebut dan melewati unduhan. Apa pun yang Anda pelajari dari checkpoint float32 44 GB yang tidak dapat Anda rilis tidak akan mengubah arsitektur Anda, dan pelajaran yang jujur dari benchmark tersebut adalah bahwa full duplex end-to-end belum kompetitif dengan model hosted yang baik pada hal yang paling diperhatikan pengguna, yaitu apakah asisten memahami mereka. Sementara itu, langkah yang masuk akal adalah membangun menggunakan endpoint yang dihosting dan menjaga biaya peralihan tetap murah — satu kunci untuk 200+ model dengan failover otomatis berarti insiden penyedia tidak akan memutus saluran telepon Anda di tengah panggilan, dan itu berarti beralih ke model full-duplex terbuka nanti hanyalah perubahan konfigurasi, bukan penulisan ulang.
Perusahaan yang secara khusus peduli tentang hal ini sebaiknya mendaftar ke akses awal Nemotron 3 VoiceChat daripada membangun di atas bobot Hugging Face. Program itulah tempat lisensi yang dapat digunakan, kontainer referensi, dan klaim di bawah 300 ms berada. Checkpoint publik adalah pratinjau penelitian dari ide yang sama, diterbitkan tanpa dokumen administratif yang memungkinkan Anda menggunakannya.
Tiga pertanyaan yang akan terus ditanyakan pada repo ini
Bolehkah saya menggunakannya secara komersial jika saya melakukan fine-tuning secara ekstensif?Tidak. OpenMDW v1.1 beserta pernyataan "research purposes only" pada kartu tersebut mengatur bobot dan segala sesuatu yang diturunkan darinya; lisensi Apache-2.0 di cabang GitHub mencakup kode inferensi, bukan checkpoint. Fine-tuning tidak lantas membersihkan lisensi. Jika yang Anda butuhkan adalah hak komersial, program akses awal adalah jalur yang memang telah disiapkan NVIDIA untuk itu.
Apakah ini model yang sama dengan yang ada di papan peringkat? Keluarga yang sama, hampir dapat dipastikan; artefak yang identik, tidak terkonfirmasi. Entri papan peringkat dan Artificial Analysis tercantum sebagai "Nemotron 3 VoiceChat (V1)" pada 12B, checkpoint yang dapat diunduh berukuran 11.095B, dan NVIDIA belum menerbitkan apa pun yang merekonsiliasi keduanya. Gunakan angka papan peringkat sebagai pembacaan independen terbaik yang tersedia tentang garis keturunan, bukan sebagai pengukuran terverifikasi dari file di Hugging Face.
Apakah bisa berjalan pada kartu yang lebih kecil dari 80 GB? Mungkin, dengan usaha, dan belum ada yang memublikasikan buktinya. Bobotnya adalah float32, jadi konversi ke bfloat16 seharusnya bisa menurunkan sekitar 44 GB parameter menjadi sekitar 22 GB, yang menyisakan ruang yang cukup pada kartu 48 GB sebelum memperhitungkan cache KV, codec, dan buffer streaming. Tetapi jalur yang didukung adalah vLLM pada H100 dengan 80 GB, kontainer deployment-nya dibuat untuk itu, dan satu-satunya konfigurasi teruji yang dilaporkan NVIDIA adalah konfigurasi tersebut. Perhitungkan waktu, bukan hanya VRAM.
Apa yang harus ditonton
Ada tiga hal yang masing-masing akan mengubah cara pandang terhadap rilis ini. Laporan teknis, atau bahkan kartu model yang berhenti berkontradiksi dengan dirinya sendiri, akan memberi tahu kita apakah {{1}}checkpoint 11B{{/1}} adalah artefak yang diukur oleh papan peringkat. Reproduksi latensi independen — seseorang di luar NVIDIA yang mengonfirmasi waktu turn-taking 448 ms pada perangkat keras mereka sendiri — akan mengubah klaim paling menarik dari rilis ini dari sekadar pemasaran menjadi fakta. Dan lisensi komersial, atau endpoint yang dihosting oleh siapa pun, akan membawa ini dari sekadar hal menarik yang menyertai makalah penelitian menjadi opsi nyata bagi banyak tim yang dengan senang hati akan menukar sebagian kualitas penalaran demi agen suara yang dapat disela.
Sampai salah satu dari hal-hal itu terwujud, deskripsi yang akurat sempit tetapi benar-benar penting: NVIDIA telah menerbitkan checkpoint suara full-duplex terbuka terkuat yang pernah diukur, memberinya saluran pemanggilan alat pertama yang berfungsi dalam kategori tersebut, melisensikannya sehingga tidak ada yang bisa merilisnya, dan menolak untuk menyebutkan bahwa semua ini terjadi.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
