Kartu judul hero untuk 'Tavus Griffin vs Muse Realtime Avatar' dengan subjudul 'Dua Wajah 2026, Dua Masalah Berbeda', di atas empat chip: Griffin 48% dianggap manusia; Griffin 0,43 dtk audio-ke-video; Muse Realtime Avatar 870 ms ke byte pertama; Muse Realtime Avatar 448x768 pada 25 fps.
Engineering & Research

Tavus Griffin vs Muse Realtime Avatar: Dua Wajah 2026, Dua Masalah yang Berbeda

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Tavus Griffin dan Muse Realtime Avatar sama-sama ada untuk memecahkan masalah memalukan yang sama — model bahasa yang bisa berbicara tetapi tidak punya wajah — dan keduanya menyerangnya dari ujung yang berlawanan. Griffin adalah Human Interaction Model video-ke-video yang mengamati peserta melalui kamera dan menghasilkan sisi lain percakapan secara real time, dan diumumkan oleh Tavus pada Oktober 2026 sebagai pratinjau riset untuk penguji terpilih. Muse Realtime Avatar adalah lapisan perwujudan Meta untuk agen Muse-nya, diumumkan di Meta Connect pada 23 September 2026, dan ia menerima audio lalu mengubahnya menjadi potret berbicara yang tersinkronisasi. Keduanya tidak bisa dibeli. Perbedaannya terletak pada apa yang masing-masing coba benahi, dan hal itu langsung terlihat begitu Anda bertanya apa yang sebenarnya diterima setiap model sebagai masukan.

Versi singkatnya

• Masukan Griffin adalah orang di ujung sana — video dan audio dari peserta langsung, yang harus dibaca, ditanggapi, dan diinterupsi olehnya.

• Input Muse Realtime Avatar adalah ucapan agen itu sendiri — aliran token dari Muse Realtime Voice yang diubahnya menjadi wajah yang cocok.

• Tavus mengukur Griffin dari apakah orang mempercayainya, dan mempublikasikan angka 48% dari panggilan video satu menit.

• Meta mengukur Muse Realtime Avatar dalam hal apakah ia mampu mengimbangi, dan mempublikasikan 870 milidetik dari akhir giliran hingga byte pertama.

• Keduanya tidak memiliki API publik, harga yang dipublikasikan, atau tanggal ketersediaan umum.

Baca keempat baris itu bersama-sama dan bentuk pertentangannya menjadi jelas. Tavus mengoptimalkan keyakinan orang lain. Meta mengoptimalkan waktu.

Board titled 'Two Faces, Two Measurements'. Tavus Griffin column: input the live participant, video and audio; optimises for whether the other person believes it; headline figure 48% of 54 participants in a one-minute video call; output 720p duplex video at 25 fps; latency 0.43 s average audio to video on H100s; access research preview, selected testers only. Muse Realtime Avatar column: input Muse Realtime Voice's own speech tokens; optimises for the clock, end of turn to first frame; headline figure 870 ms from end of turn to first byte; output 448x768 portrait at 25 fps; capacity 12 concurrent sessions on one NVIDIA GB200; access research post only, no API.

Griffin: model yang harus dipercaya

Kerangka berpikir Tavus adalah bahwa Griffin merupakan Model Interaksi Manusia pertama, dan arsitektur di balik klaim tersebut adalah sistem dua bagian yang menggabungkan Pemodelan Percakapan Berkelanjutan dengan Pembangkitan Audio-Visual. Bagian pertama bersifat perilaku: ia memutuskan apa yang seharusnya dilakukan persona dari satu momen ke momen berikutnya, menggunakan apa yang dapat dilihat dan didengarnya. Bagian kedua adalah rendering, dan Tavus membaginya lagi menjadi pembangkitan ucapan streaming dan pembangkitan video streaming.

Angka-angka yang ditonjolkan Tavus bukanlah angka throughput. Dalam studi yang dijalankan perusahaan bersama Queen Mary University of London, 26 dari 54 peserta — 48% — percaya Griffin adalah orang sungguhan setelah panggilan video satu menit, dibandingkan dengan 1 dari 41 (2,4%) untuk stack sebelumnya, yaitu generasi wajah Phoenix-4.5, turn-taking Sparrow-2, dan visi Raven-1. Peserta yang tidak tertipu biasanya mulai ragu dalam 20 detik pertama. Pada tolok ukur VideoFDB milik NVIDIA, yang dinilai pada September 2026, Tavus melaporkan Griffin berada di peringkat pertama untuk AI tatap muka dengan skor generasi 3,83, dibandingkan dengan baseline terkuat yang dilaporkan sebesar 2,80 dan referensi manusia 3,92, serta skor persepsi 3,73, dibandingkan dengan 3,44 untuk baseline terbaik yang dilaporkan dan 4,20 untuk referensi manusia. Angka-angka tersebut dilaporkan vendor dan spesifik untuk tolok ukur tersebut, tetapi poin perbandingan dengan manusia adalah yang menarik.

Rekayasa di balik angka-angka tersebut adalah codec bernama Tavec dan sebuah transformer difusi autoregresif. Tavec berjalan pada 48 kHz dengan 40 nilai per frame pada 100 frame per detik, tanpa codebook, decoder yang sepenuhnya kausal, dan paket sekecil 10 milidetik — dirancang agar wajah dapat mulai bergerak sebelum sebuah kalimat selesai. Jalur video mengirim 720p dalam potongan 320 milidetik, di mana satu laten setara dengan delapan frame pada 25 fps, tiga langkah difusi per laten, dan kompresi temporal 8× dalam VAE. Proses distilasi tiga tahap (pencocokan distribusi, lalu autoregresif teacher-forcing, lalu self-forcing) adalah yang memungkinkannya menjalankan ketiga langkah itu secara real time. Klaim utama soal latensi adalah rata-rata 0,43 detik dari audio ke video pada H100s, yang menurut Tavus sekitar setengah dari metode tercepat berikutnya yang diukurnya. Kloning suara memerlukan sampel sekitar 10 detik.

Harga dari semua ini adalah Tavus tidak dapat merilisnya. Griffin-Lite, pratinjau riset itu, hanya tersedia bagi kelompok terpilih penguji awal; dalam tulisan mengenai peluncurannya, perusahaan menyatakan dengan gamblang bahwa Griffin-Lite tidak akan tersedia untuk penggunaan pelanggan saat ini dan bahwa pihaknya memperkirakan akan merilis Griffin segera setelah masalah keamanan tertentu diatasi. Griffin tidak ada di platform Tavus, dan akan hadir di sana “setelah kami menemukan cara untuk merilisnya dengan aman”. Model yang meyakinkan 48% dari waktu dalam panggilan satu menit, dari sudut pandang penerapan, adalah model yang meyakinkan 48% dari waktu dalam panggilan satu menit.

Screenshot of the Tavus website's Griffin announcement, captured 2 October 2026: the headline 'The First Human Interaction Model' under 'Introducing Griffin', a paragraph describing a video-to-video system that listens while the other person talks, and three statistic tiles reading 48% of people believed Griffin was a real person after a one-minute video call, #1 on NVIDIA's independent test of face-to-face AI, and 37% ahead of the next best AI at reacting in the moment, dated October 1st, 2026.

Muse Realtime Avatar: model yang harus bisa mengimbangi

Muse Realtime Avatar diumumkan pada 23 September 2026 di Meta Connect dan ditulis pada hari yang sama oleh Meta Superintelligence Labs dengan judul "Bringing Your Muse to Life". Pembingkaian Meta lebih sempit dan lebih mekanis daripada Tavus: agen Muse sudah memiliki suara, berkat Muse Realtime Voice, dan avatar adalah lapisan yang memberi suara itu tubuh.

Angka yang dipublikasikan adalah 870 milidetik dari akhir giliran hingga bita pertama — yaitu, dari saat pengguna berhenti berbicara hingga saat bita video pertama avatar siap. Avatar merender potret 448×768 pada 25 frame per detik. Meta mengatakan sistem ini melakukan sekitar 60× lebih sedikit evaluasi per potongan dibandingkan baseline-nya, dan bahwa satu NVIDIA GB200 dapat menangani 12 sesi real-time bersamaan dengan peningkatan kapasitas 8× dibandingkan implementasi BF16 dua langkah.

Perbedaan arsitektural dari Griffin adalah dari mana informasinya berasal. Muse Realtime Avatar memperluas Muse Realtime Voice dan berbagi aliran token ucapannya — representasi VQ yang sama yang dihasilkan model suara itulah yang menggerakkan wajah, bukan pemahaman visual terpisah tentang peserta. Itu menjadikannya lapisan perwujudan DiT yang digerakkan audio: efisien, terikat erat dengan model suaranya sendiri, dan sama sekali tidak berupaya membaca manusia di ujung lain panggilan. Ini adalah mulut dan wajah untuk agen, bukan mitra percakapan yang mengawasi Anda.

Meta belum menerbitkan API, harga, maupun tanggal rilis untuk Muse Realtime Avatar. Postingan riset itulah satu-satunya catatan publik yang ada.

Di mana kedua desain itu benar-benar berbeda

Cara paling jelas untuk melihat pemisahan itu adalah dengan bertanya apa yang terjadi ketika pengguna menyela.

Griffin bersifat dupleks penuh dan dirancang untuk dapat diinterupsi di tengah ucapan — ia dapat mengamati dan mendengarkan sambil berbicara, itulah sebabnya pemasaran Tavus bersandar pada gagasan bahwa Griffin mempelajari perilaku percakapan alih-alih video. Itu juga sebabnya rangkaian tolok ukurnya dibangun di sekitar persepsi dan reaksi, dan sebabnya keunggulan 37% atas sistem terbaik berikutnya dalam bereaksi saat itu juga merupakan klaim yang perusahaan repot-repot kemukakan.

Angka akhir-giliran 870 milidetik milik Muse Realtime Avatar memberi tahu Anda kisah sebaliknya: ini adalah pipeline di mana giliran berakhir, token audio terselesaikan, lalu wajah menyusul. Ini cepat — 870 ms adalah angka yang baik untuk perender potret — tetapi pengukuran itu sendiri mengasumsikan bahwa batas giliran ada, yang justru merupakan asumsi yang dibangun untuk dibuang oleh model dupleks.

Itu bukanlah kritik terhadap salah satu desain. Meta sedang membangun wajah untuk agen yang hidup di dalam antarmuka asisten milik Meta sendiri, di mana batas giliran yang bersih adalah model interaksi yang wajar. Tavus sedang membangun sesuatu yang harus bertahan saat orang asing memutuskan, dalam dua puluh detik, apakah orang di layar itu nyata.

Tidak satu pun dari keduanya ada dalam daftar harga — dan hanya satu bagian dari Muse yang dapat dipanggil.

Baik Tavus Griffin maupun Muse Realtime Avatar tidak dapat dimasukkan ke produksi saat ini. Griffin terbatas pada penguji terpilih; Muse Realtime Avatar tidak memiliki API, harga, maupun tanggal. Jika Anda berencana melakukan build, kedua fakta tersebut harus masuk ke dalam rencana.

Yang perlu diperhatikan adalah bagian dari stack Muse yang dapat diakses. Keluarga Muse milik Meta mencakup Muse Spark, dan satu checkpoint darinya — meta/muse-spark-1.2 — aktif di katalog kami dengan harga $1,25 per juta token input dan $4,25 per juta token output dengan tanpa markup terhadap harga daftar Meta. Ini bukan avatar: ia menerima input teks, gambar, video, audio, dan PDF serta mengembalikan teks, dengan jendela konteks 1 juta token dan upaya penalaran yang dapat dikonfigurasi. Tetapi ini adalah bagian dari lini Muse yang benar-benar dapat Anda panggil, dan jika Anda sedang membangun agen yang suatu hari akan berada di balik avatar, separuh bahasanya adalah separuh yang dapat Anda mulai. OrcaRouter meneruskan harga daftar penyedia dengan markup 0%, sehingga perubahan harga Meta tercermin di kartu kami pada hari yang sama alih-alih siklus penagihan berikutnya, dan permintaan yang gagal pada satu penyedia akan dicoba ulang ke penyedia yang sehat alih-alih muncul sebagai timeout.

Screenshot of the OrcaRouter model page for Muse Spark 1.2, showing the model id meta/muse-spark-1.2, a 1M-token context window, text, image, video, file and audio inputs producing text output, a p50 time to first token of 10.00 s, input pricing of $1.25 per million tokens and output pricing of $4.25 per million tokens, and 6.2M tokens of traffic over seven days.

Logika yang sama berlaku untuk sisi video di dunia ini. Kami tidak merutekan Muse Realtime Avatar dan kami tidak merutekan Tavus Griffin, dan kami tidak akan mengklaim sebaliknya. Yang kami rutekan adalah katalog lebih dari dua ratus model di seluruh modalitas yang sama, sehingga prototipe yang bertukar antara agen teks, model suara, dan generator video tetap menggunakan satu kunci sementara dua model dalam artikel ini tetap belum dirilis.

Mana yang lebih jauh dari pengiriman

Dalam catatan publik, Muse Realtime Avatar masih lebih jauh. Produk ini memiliki tulisan riset dan tidak memiliki API, tidak memiliki harga, dan tidak memiliki tanggal. Griffin juga tidak memiliki API dan tidak memiliki harga, tetapi memiliki niat rilis yang eksplisit — "segera setelah masalah keamanan ini ditangani" — tingkat pratinjau bernama yang sudah ada hari ini untuk penguji terpilih, dan setumpuk hasil benchmark yang dipublikasikan dari perangkat uji independen. Itu adalah posisi yang lebih maju, meskipun disertai pengakuan bahwa model tersebut belum cukup aman untuk diserahkan kepada pelanggan.

Jebakan dalam membandingkannya adalah menganggap angka 870 milidetik dapat dibandingkan secara langsung dengan angka 0,43 detik. Keduanya mengukur hal yang berbeda: Meta mengukur dari akhir suatu giliran hingga byte pertama sebuah potret, sedangkan Tavus mengukur latensi audio-ke-video di dalam aliran dupleks kontinu yang gilirannya bukan peristiwa yang bersih. Angka-angka itu keduanya nyata dan bukan pengukuran yang sama, dan siapa pun yang menyajikannya dalam satu kolom sedang merugikan pembaca.

Intinya

Muse Realtime Avatar adalah lapisan perwujudan: audio masuk, potret keluar, 870 milidetik dari akhir giliran ke byte pertama, 448×768 pada 25 fps, tanpa API dan tanpa tanggal rilis. Tavus Griffin adalah Model Interaksi Manusia dupleks: peserta masuk, wajah yang bereaksi keluar, latensi rata-rata audio-ke-video 0,43 detik pada H100, dan vendor yang bersedia mempublikasikan bahwa 48% orang mengira itu manusia sekaligus menyatakan bahwa pelanggan tidak dapat menggunakannya. Meta sedang membangun sesuatu yang mampu mengimbangi. Tavus sedang membangun sesuatu yang lolos. Keduanya tidak dapat dibeli, yang berarti satu-satunya keputusan yang tersedia saat ini adalah separuh masalah mana yang harus mulai dikerjakan — dan bagi sebagian besar tim, separuh itu adalah model bahasa di bawahnya.