Kartu hero yang dihasilkan untuk 'Muse Realtime Avatar: Meta Memberi Wajah pada Agen Muse-nya, pada 870 Milidetik per Giliran', menampilkan overline 'Meta Superintelligence Labs — 23 September 2026', judul utama, dan tiga fakta dari postingan riset Meta: video potret 448×768 pada 25 fps, sekitar 870 ms dari akhir giliran ke byte pertama, dan 12 sesi real-time bersamaan pada satu NVIDIA GB200. Subjudulnya berbunyi 'Ini bukan kepala yang berbicara. Ini adalah lapisan render di atas model suara.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Engineering & Research

Muse Realtime Avatar: Meta Memberi Wajah pada Agen Muse-nya, dengan 870 Milidetik per Giliran

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Angka yang dipilih Meta untuk dijadikan pembuka adalah 870 milidetik. Itulah durasi yang dibutuhkan Muse Realtime Avatar, menurut pengukuran Meta sendiri, sejak Anda berhenti berbicara hingga saat byte pertama dari balasan suara-dan-video yang tersinkronisasi tiba. Ini adalah angka yang benar-benar agresif untuk sistem yang harus menghasilkan video, dan angka itu layak dibaca dengan cermat — karena hampir semua hal menarik tentang model perwujudan baru Meta terletak pada celah antara apa yang diukur oleh angka tersebut dan apa yang orang akan anggap diukur olehnya.

Muse Realtime Avatar diumumkan pada 23 September 2026 di Meta Connect dan ditulis pada hari yang sama oleh Meta Superintelligence Labs dalam postingan riset berjudul "Menghidupkan Muse Anda." Ia memperluas Muse Realtime Voice, lapisan percakapan di dalam agen Muse milik Meta, dengan memberinya tubuh. Ini bukan chatbot dengan avatar standar: Anda memberinya gambar referensi — sebuah foto, ilustrasi seluruh tubuh, seekor hewan, benda rumah tangga — dan ia merender objek itu sedang berbicara, memberi isyarat, dan mengubah postur dalam video berkelanjutan sepanjang percakapan. Zuckerberg mengatakan di atas panggung bahwa avatar yang terpasang pada Muse miliknya bernama Jolly.

Aliran token bersama, bukan proses lip-sync

Arsitekturnya adalah bagian yang layak dipahami, karena ini menjelaskan mengapa Meta terus mengatakan "embodiment" alih-alih "avatar". Muse Realtime Voice menghasilkan aliran token ucapan — yang oleh postingan itu disebut VQs — yang membawa konten dari apa yang diucapkan sekaligus prosodinya: tempo, penekanan, naik dan turunnya. Muse Realtime Avatar mengonsumsi aliran yang sama. Ini adalah Diffusion Transformer yang digerakkan audio yang dikondisikan pada token ucapan tersebut, pada media referensi yang Anda berikan, dan pada jendela bergulir dari laten video terbaru, dan ia menghasilkan video dalam potongan kausal pendek, mengalirkan setiap laten baru ke depan sebagai konteks gerak untuk laten berikutnya.

Berbagi satu aliran token itulah yang menjaga suara, gerakan bibir, dan ekspresi tetap terkunci bersama. Alternatifnya — buat audionya, lalu jalankan model sinkronisasi bibir terpisah di atasnya — adalah cara sebagian besar industri avatar bekerja, dan itulah sebabnya begitu banyak avatar tersebut terlihat seperti sedang disulih suara. Desain Meta menghilangkan sambungan itu secara konstruksi. Jendela laten bergulir adalah paruh kedua dari gagasan ini: tanpanya, generator berbasis potongan akan melenceng, dan pada menit ketiga karakter Anda diam-diam telah berubah menjadi orang lain.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player paused at 0:00 of 0:51 showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as state-of-the-art embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

Empat angka yang dipublikasikan, dan apa yang sebenarnya diukur oleh masing-masing.

Meta memublikasikan lebih banyak angka daripada yang biasa untuk sebuah postingan riset yang disertakan pada fitur konsumen. Keempat angka di bawah ini dilaporkan oleh perusahaan, diukur oleh Meta terhadap baseline yang dipilih Meta; tidak satu pun darinya telah direproduksi di luar perusahaan.

870 ms dari akhir giliran ke byte pertama. Ini adalah angka awal respons. Ini bukan waktu untuk balasan lengkap, dan ini bukan latensi pengiriman berkelanjutan untuk sisa panggilan. Sebuah sistem dapat mencapai 870 ms ke byte pertama dan tetap terasa lambat pada detik kedua belas. Postingan Meta secara eksplisit menyatakan bahwa ini adalah ukuran byte pertama; liputan yang mengabaikan kualifikasi tersebut menganggapnya sebagai responsivitas end-to-end, padahal bukan.

Video potret 448×768 pada 25 frame per detik. Itu adalah bingkai tinggi berbentuk ponsel, bukan bingkai lanskap, dan 25 fps terasa sinematik alih-alih mulus — laju bingkai standar untuk film, di bawah 30 atau 60 fps yang akan diberikan oleh umpan kamera asli. Meta menyatakan bahwa demo diberi tanda air dengan lapisan transparan agar penerima dapat mengetahui bahwa mereka tidak sedang melihat umpan kamera biasa.

Evaluasi model 60× lebih sedikit.Dibahas dengan tepat di bawah ini, karena inilah angka yang paling mungkin salah dibaca.

12 sesi real-time bersamaan pada satu NVIDIA GB200. Meta melaporkan bahwa pekerjaan penyajiannya — cache KV persisten, perutean sadar cache, batching dinamis sadar latensi, pelatihan sadar kuantisasi empat bit, kernel fusi, dan penangkapan CUDA Graph, yang dikembangkan bersama NVIDIA — meningkatkan kapasitas 8× dibandingkan baseline BF16 dua langkah miliknya sendiri. Aritmetika di baliknya sederhana: setiap langkah generasi menghasilkan delapan frame, yaitu 320 ms pemutaran, dalam 20 ms waktu model, atau 2,5 ms per frame. Baik angka 12 maupun 8× diukur terhadap baseline yang ditentukan Meta, bukan terhadap perangkat keras vendor lain.

Mengapa 60× tidak 60× lebih cepat

Klaim kompresi adalah klaim yang akan paling sering diulang dan paling sedikit dipahami. Model guru Meta adalah model difusi 40 langkah dengan classifier-free guidance tiga arah — tiga pass per langkah, sehingga 120 evaluasi model untuk menghasilkan satu potongan video. Model siswa adalah model kausal dua langkah tanpa panduan dengan cache KV panjang tetap, yang dilatih melalui distilasi dan self-forcing, dan membutuhkan dua evaluasi untuk potongan yang sama. Itu adalah pengurangan 60× dalam evaluasi per potongan pada kualitas yang, dalam kata-kata Meta, mendekati guru.

Ini adalah pengurangan komputasi per potongan. Evaluasi yang enam puluh kali lebih sedikit tidak berarti pengguna menunggu satu per enam puluh dari waktu itu, karena latensi memiliki kontributor lain sebelum distilasi dan masih memilikinya setelahnya. Grafik dalam unggahan Meta sendiri menunjukkan apa yang dibeli oleh pengurangan tersebut dalam hal kualitas: preferensi manusia naik dari 45% menjadi 55%. Itulah versi cerita yang jujur — inti dari distilasi adalah membuat sistem yang setidaknya dapat berjalan secara real-time, dan biaya kualitasnya ditekan hingga sekitar sepuluh poin preferensi, bukan dihilangkan.

Evaluasi, termasuk hasil yang berjalan sebaliknya

Meta diuji terhadap dua sistem avatar komersial, Runway Characters dan HeyGen LiveAvatar, dengan menggunakan identitas avatar yang dipadankan sehingga penilai membandingkan animasi, bukan desain karakter. Penilai melakukan percakapan langsung selama dua hingga tiga menit dengan setiap sistem dan kemudian membandingkan kualitas visual, sinkronisasi, konsistensi karakter, dan tingkah laku.

Meta melaporkan lebih disukai 78% berbanding 22% dibanding Runway Characters dan 88% berbanding 12% dibanding HeyGen LiveAvatar, serta lebih disukai pada setiap dimensi yang dievaluasi. Lalu postingan tersebut melakukan sesuatu yang tidak dilakukan sebagian besar evaluasi vendor: ia mengungkapkan bahwa perbandingan gerak-gerik terhadap Runway Characters secara statistik tidak dapat dibedakan dari paritas. Hasil seri di dalam sapu bersih adalah hal kecil, tetapi itulah detail yang memberi tahu Anda bahwa sapu bersih tersebut dilaporkan secara jujur, bukan dipilih-pilih.

Batas-batas pengujiannya lebih penting daripada hasil serinya. Dua sampai tiga menit adalah percakapan yang singkat. Para penilainya adalah milik Meta. Dan unggahan itu sendiri memperingatkan bahwa demonstrasinya "mengilustrasikan kemampuan model dan tidak semuanya mencerminkan avatar yang tersedia di aplikasi Muse" — yang merupakan cara tim riset mengatakan, secara gamblang, bahwa video yang Anda tonton belum tentu produk yang akan Anda dapatkan.

Apa yang tidak dapat Anda lakukan dengannya

Tidak ada API untuk Muse Realtime Avatar. Tidak ada harga, tidak ada kartu tarif, tidak ada daftar tunggu dan tidak ada tanggal publikasi. Meta tidak mengatakan kapan pengguna atau pengembang akan dapat menggunakannya. Aplikasi Muse untuk usia 18 tahun ke atas adalah satu-satunya platform yang dituju, dan avatar tersebut hadir bersama serangkaian fitur Muse lainnya — kustomisasi suara, alamat email Muse, kontrol komputer Mac, integrasi kacamata — yang memiliki jadwalnya sendiri, beberapa di antaranya disebutkan sebagai "beberapa bulan mendatang."

Perbandingan yang penting di sini bukanlah dengan Runway atau HeyGen. Perbandingannya adalah dengan bagian lain dari stack Muse. Muse Spark, model penalaran yang menjadi landasan agen, telah tersedia bagi para pengembang sejak Meta membukanya melalui Meta Model API, dan Muse Spark 1.2 disediakan melalui OrcaRouter sebagai meta/muse-spark-1.2 dengan harga $1,25 per juta token masukan dan $4,25 per juta token keluaran, harga daftar penyedia tanpa markup, di dalam jendela konteks satu juta token yang sudah menerima teks, gambar, video, audio, dan file. Itu adalah bagian Muse yang dapat Anda panggil hari ini. Wajahnya adalah bagian yang tidak dapat Anda panggil.

Asimetri itu layak direnungkan jika Anda merencanakan apa pun. Agen yang bernalar selama panggilan video dan agen yang muncul dalam panggilan video adalah produk yang berbeda dengan batasan yang berbeda, dan hanya satu di antaranya yang tercantum di kartu tarif.

A generated scoreboard titled 'Muse Realtime Avatar — the scoreboard' with six rows: turn to first byte — about 870 ms; video — 448×768 portrait at 25 fps; evaluations — 60× fewer than baseline; concurrency — 12 sessions per NVIDIA GB200; capacity — 8× over two-step BF16; developer access — none announced. A footer reads 'All figures company-reported by Meta; none independently reproduced.'

Tontonan Berikutnya

Tiga hal akan mengubah ini dari sebuah pengumuman menjadi sebuah keputusan. Yang pertama adalah tanggal rilis untuk avatar di dalam Muse, karena semua yang diterbitkan Meta adalah tentang model, dan tidak ada yang diterbitkannya tentang produk yang bisa Anda gunakan pada hari Kamis. Yang kedua adalah pengukuran latensi yang diambil sepanjang percakapan panjang, bukan pada byte pertama — 870 ms hanyalah pistol start, dan pertanyaan yang diajukan panggilan sungguhan adalah apa yang terjadi pada menit kesepuluh. Yang ketiga adalah apakah sistem mempertahankan karakter dalam kondisi adversarial: pengguna yang sengaja mengganti topik, bergerak cepat, atau memberinya gambar referensi yang dirancang agar tampak seperti orang nyata.

Sampai saat itu, ringkasan yang jujur adalah yang tersirat dalam tulisan riset itu tanpa mengatakannya. Muse Realtime Avatar adalah karya rekayasa yang nyata dengan hasil kompresi yang nyata di baliknya, didemonstrasikan dalam lingkungan yang terkendali, dievaluasi oleh perusahaan yang membangunnya, dalam percakapan yang berlangsung selama pesanan kopi. Itu bukan vaporware. Itu juga bukan sesuatu yang dapat Anda beli, rutekan, atau benchmark — dan itu adalah klaim-klaim yang berbeda.

A screenshot of the OrcaRouter model page for Meta Muse Spark 1.2, showing the model id meta/muse-spark-1.2, input modalities text, image, video, file and audio with text output, capability badges for vision, audio, tools, JSON and reasoning, a p50 time-to-first-token of 4.91 seconds, and pricing of $1.25 per million input tokens and $4.25 per million output tokens, with 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.