Kartu hero yang dihasilkan untuk artikel 'Muse Realtime Avatar vs SeedRealtime', menampilkan dua kartu membulat di kedua sisi judul. Kartu kiri menampilkan 'Muse Realtime Avatar' di atas ikon bingkai video keluar dan baris 'menghasilkan video' dan 'Meta, mengumumkan 23 Sep'; kartu kanan menampilkan 'SeedRealtime' di atas ikon layar-dan-mata dan baris 'menonton video' dan 'ByteDance, merilis 5 Agu'. Subjudul menampilkan 'Tidak ada yang memiliki kartu tarif.' Logo OrcaRouter dikomposit di sudut kanan bawah.
Guides & Insights

Muse Realtime Avatar vs SeedRealtime: Dua Model yang Hanya Bisa Anda Tonton

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Tak satu pun dari keduanya memiliki kartu tarif. Muse Realtime Avatar, yang diumumkan Meta pada 23 September 2026 di Meta Connect, tidak memiliki API, tidak ada endpoint, tidak ada harga, dan tidak ada tanggal — ini adalah kemampuan agen Muse milik Meta, yang didemonstrasikan dalam pos riset berjudul "Bringing Your Muse to Life." SeedRealtime, yang dirilis ByteDance Seed pada 5 Agustus 2026, tidak memiliki API, tidak ada bobot, tidak ada laporan teknis, dan tidak ada jumlah parameter — ia hanya ada di dalam aplikasi Doubao milik ByteDance sendiri, dan pos ByteDance hanya menyatakan bahwa sistem itu telah "diluncurkan sepenuhnya." Dua dari perusahaan AI konsumen terbesar di dunia meluncurkan sistem real-time audio-visual dalam rentang tujuh minggu satu sama lain dan tidak satu pun bisa dibeli. Itulah perbandingannya, dan ini lebih menarik daripada tabel benchmark yang tak bisa dibangun oleh siapa pun.

Yang membedakan keduanya adalah arah aliran video. SeedRealtime mengamati dan mendengarkan serta membicarakan apa yang dilihatnya — audio, video, dan teks masuk ke satu jaringan ujung-ke-ujung, dengan pergantian giliran dipindahkan dari detektor aktivitas suara eksternal ke dalam model itu sendiri. Muse Realtime Avatar menghasilkan: Anda memberinya gambar referensi, sebuah foto atau ilustrasi atau objek, dan ia merender objek itu sedang berbicara dan bergestur dalam video terus-menerus sepanjang percakapan. Video SeedRealtime adalah masukan. Video Muse Realtime Avatar adalah keluaran. Keduanya digambarkan sebagai dupleks penuh, keduanya audio-visual, dan keduanya melakukan pekerjaan yang berlawanan di bawah label tersebut.

Apa masing-masingnya, dan di mana ia berada

Enam baris, dan dua baris terakhir adalah yang menentukan apa pun.

Video — Muse Realtime Avatar menghasilkannya, pada resolusi potret 448×768 dan 25 frame per detik, dengan tanda air berupa overlay transparan sehingga penonton dapat mengetahui bahwa itu bukan umpan kamera; SeedRealtime memersepsinya, mengalirkan frame ke jaringan yang sama yang menangani audio.

Taruhan arsitektural — Muse Realtime Avatar berbagi satu aliran token antara suara dan video, sehingga Diffusion Transformer yang digerakkan audio mengonsumsi token ucapan Muse Realtime Voice secara langsung dan tidak ada yang disinkronkan dengan gerak bibir setelahnya; SeedRealtime melipat giliran bicara ke dalam model, sehingga siapa yang berbicara dan kapan berhenti menjadi keputusan detektor aktivitas suara eksternal.

Di mana ini berjalan — Muse Realtime Avatar adalah kemampuan di dalam agen Muse milik Meta; SeedRealtime ada di dalam aplikasi Doubao milik ByteDance.

Akses pengembang — tidak ada yang memiliki API. Tidak ada yang mempublikasikan bobot. Tidak ada opsi serverless, tidak ada endpoint yang dihosting, dan tidak ada platform pihak ketiga yang menyediakan salah satu dari keduanya.

Harga — tidak dipublikasikan untuk keduanya, karena tidak ada penawaran komersial dari kedua belah pihak.

Evaluasi independen — tidak ada untuk kedua sistem. Setiap angka yang telah dipublikasikan masing-masing perusahaan tentang modelnya sendiri merupakan data pihak pertama, dan tidak ada penilai eksternal yang menjalankan salah satu dari keduanya.

Dua basis bukti, keduanya pihak pertama, dan salah satunya jauh lebih tipis

Di sini perbandingannya berhenti menjadi simetris. Meta menerbitkan empat angka untuk Muse Realtime Avatar, semuanya dilaporkan sendiri oleh perusahaan, diukur terhadap baseline yang dipilih Meta, tidak satu pun direproduksi di luar perusahaan: 870 ms dari akhir giliran Anda hingga byte pertama balasan suara-dan-video tersinkronisasi; video potret 448×768 pada 25 frame per detik; evaluasi model 60× lebih sedikit daripada baseline-nya sendiri; dan 12 sesi real-time bersamaan pada satu NVIDIA GB200, peningkatan kapasitas 8× dibandingkan baseline BF16 dua langkah Meta yang berasal dari pelatihan sadar kuantisasi empat bit dan batching dinamis yang sadar latensi. Meta juga menerbitkan perbandingan preferensi terhadap dua sistem avatar komersial — 78/22 terhadap salah satunya, 88/12 terhadap yang lain — dan mengungkapkan bahwa dalam hal tingkah laku khas, hasil terhadap salah satunya secara statistik tidak dapat dibedakan dari paritas. Pengungkapan itu lebih bernilai daripada kemenangannya; itulah jenis hasil yang biasanya dihilangkan oleh sebagian besar postingan peluncuran.

Bukti yang diterbitkan SeedRealtime adalah satu evaluasi manusia end-to-end. ByteDance mengatakan bahwa dibandingkan sistem bertingkat — model visi yang dihubungkan ke model ASR yang dihubungkan ke LLM yang dihubungkan ke suara text-to-speech — SeedRealtime memangkas separuh masalah tempo percakapan audio-visual, dengan lebih sedikit pemutusan, lebih sedikit pemicu palsu, serta balasan yang lebih lambat dan lebih alami. Yang belum diterbitkan ByteDance adalah ukuran sampel, metodologi, jumlah anotator, angka latensi dalam milidetik, nama tolok ukur, atau skor. Satu laporan sekunder menyebutkan peningkatan 12% dalam kefasihan percakapan dibandingkan model-model sebelumnya milik tim tersebut. Itulah seluruh basis bukti publiknya.

Jadi, peringkat jujur dari verifiabilitas adalah: tidak ada yang memiliki uji independen; milik Meta adalah serangkaian pengukuran dengan baseline yang dinyatakan dan hasil negatif yang diungkapkan; milik ByteDance adalah klaim preferensi tunggal yang desainnya tidak dijelaskan. Keduanya tidak dapat direproduksi, tetapi hanya satu di antaranya yang cukup spesifik untuk diperdebatkan.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs SeedRealtime — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'SeedRealtime'. Rows read: Video — generated output vs perceived input; Where it runs — Muse app vs Doubao app; Developer access — none vs none; Price — none published vs none published; Published figures — 870 ms first byte, 448x768 at 25 fps, 12 sessions per GB200 vs one human preference claim, no numbers; Independent runs — none vs none. A footer line reads 'Both systems author-reported; neither independently evaluated, and neither is callable.'

Langkah yang diambil oleh masing-masing

Kedua sistem adalah jawaban atas masalah yang sama, dan patut dilihat bahwa kedua jawaban itu berbeda.

Bagi sistem yang mengawasi, bagian tersulit adalah mengetahui kapan harus berbicara. Model yang terus-menerus menerima bingkai kamera dan audio harus memutuskan, tanpa pemicu eksternal, apakah orang di depannya sudah selesai, apakah ia telah disapa, dan apakah objek yang baru saja masuk ke bingkai itu relevan. Itulah masalah yang dipindahkan SeedRealtime ke dalam model, dan ByteDance melakukan langkah itu di tiga modalitas alih-alih dua — versi yang lebih sulit dari apa yang masing-masing dilakukan Google, OpenAI, dan NVIDIA untuk audio saja. Perilaku demo mengikuti dari itu: mengikat suara ke wajah dalam percakapan kelompok, berbicara tanpa diminta saat sesuatu masuk ke bingkai, memandu seseorang melalui museum atau perbaikan.

Bagi sistem yang melakukan rendering, bagian tersulitnya adalah tetap koheren. Menghasilkan video dalam potongan kausal yang pendek berarti setiap potongan dikondisikan pada potongan sebelumnya, dan mode kegagalannya adalah drift — pada menit ketiga, karakternya diam-diam sudah menjadi orang lain. Jendela bergulir Meta atas latent video terkini adalah jawaban untuk itu, dan aliran token bersama adalah jawaban untuk kegagalan yang berbeda, yaitu tampilan ter-dub yang muncul ketika audio dihasilkan lebih dulu lalu model lip-sync dijalankan di atasnya setelahnya.

Kedua langkah tersebut tidak tersedia di sistem lain. SeedRealtime tidak memiliki gambar referensi yang harus diikuti, karena ia tidak merender siapa pun. Muse Realtime Avatar tidak memiliki dunia eksternal untuk dilacak, karena seluruh tugasnya adalah menghasilkan wajah yang cocok dengan suara.

A screenshot of the ByteDance Seed blog post 'SeedRealtime: An Audio-Visual Full-Duplex LLM', dated August 5, 2026, showing the headline, the post date, and the opening description of SeedRealtime as a native audio-visual full-duplex model.

Mengapa model yang tidak dapat dipanggil tetap merupakan pertanyaan perutean

Kedua sistem ini melakukan delegasi. Muse Realtime Avatar berada di atas Muse Realtime Voice, yang merupakan lapisan percakapan dari sebuah agen yang penalarannya berjalan di Muse Spark — model itulah yang melakukan rendering, bukan pemikiran. Desain SeedRealtime menjaga percakapan tetap berjalan saat pekerjaan latar belakang berlangsung, yang berarti pekerjaan yang melampaui apa yang dapat dilakukannya secara inline dikirim ke tempat lain lalu kembali. Dalam kedua arsitektur tersebut, yang digunakan pengguna untuk berinteraksi adalah front end, dan kecerdasannya adalah model teks terpisah di belakangnya.

Model teks terpisah itu adalah inferensi biasa, dan itulah bagian dari stack yang benar-benar dapat Anda beli. Di OrcaRouter, itu adalah satu endpoint yang mencakup 196 model dari 15 penyedia, dengan harga daftar penyedia yang diteruskan tanpa markup, dengan failover otomatis saat model yang Anda pilih mengalami error atau timeout. Kami tidak menghosting SeedRealtime — itu milik ByteDance, di dalam Doubao, dan tidak ada yang perlu dirutekan. Kami juga tidak menghosting Muse Realtime Avatar, dan tidak ada pihak lain yang melakukannya. Yang kami sediakan adalah lapisan tempat kedua sistem menyerahkan kerja beratnya, yaitu lapisan yang berubah saat Anda ingin model berbeda yang melakukan pemikiran.

Apa yang bisa mengubah jawabannya

Untuk SeedRealtime, bagian yang hilang bukanlah sebuah fitur — melainkan buktinya. Laporan teknis dengan jumlah parameter, rangkaian benchmark, dan evaluasi manusia yang dijelaskan akan menggesernya dari "sebuah demonstrasi di dalam aplikasi" menjadi sesuatu yang bisa dianalisis oleh sebuah tim. Postingan ByteDance juga menautkan tujuan generik "Try Dola" dan "Try in Playground" tanpa mengklaim bobot atau API yang terdokumentasi, yang merupakan pola sebuah fitur produk ketimbang perilisan model.

Bagi Muse Realtime Avatar, bagian yang hilang bersifat komersial: kartu tarif, endpoint, tanggal, serta ketentuan wilayah dan usia yang belum sepenuhnya dijelaskan Meta. Postingan Meta mencatat bahwa demo-demonya tidak semuanya mencerminkan avatar yang tersedia di aplikasi Muse, dan itulah kalimat yang semestinya menjadi acuan bagi rencana apa pun yang dibangun seputar hal ini.

Sampai salah satu dari hal itu berubah, perbandingannya memiliki bentuk yang luar biasa singkat. Kedua model bersifat audio-visual, keduanya full-duplex, keduanya benar-benar rekayasa yang mengesankan, dan tak satu pun dapat dipanggil dari terminal oleh siapa pun yang membaca ini. Perbedaannya adalah apa yang akan Anda lakukan dengan keduanya jika Anda bisa: yang satu memberi Anda karakter yang berbicara, dan yang satu memberi Anda sistem yang memperhatikan.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.