
Tavus Griffin: Model Interaksi Manusia Pertama dan 48% yang Lulus Tes Turing Video
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 223 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Dua puluh enam dari lima puluh empat orang menyelesaikan panggilan video satu menit dan mengatakan bahwa pasangan mereka adalah orang sungguhan. Itulah angka yang dijadikan andalan Tavus untuk Tavus Griffin, yang diumumkan pada 1 Oktober 2026, dan ini adalah hasil yang sungguh mencolok: pada protokol yang sama, tumpukan teknologi sebelumnya milik perusahaan — Phoenix-4.5 yang merender wajah, Raven-1 yang melakukan persepsi, Sparrow-2 yang mengelola dinamika giliran — menghasilkan satu orang yang percaya dari empat puluh satu, atau 2,4%. Dua penafsiran yang jelas atas lonjakan itu keduanya salah, dan memisahkan keduanya merupakan sebagian besar dari uraian berikutnya. Griffin bukanlah mesin avatar yang lebih baik, dan bukan pula produk yang bisa Anda beli. Ini adalah pratinjau riset bernama Griffin-Lite, terbuka untuk penguji tepercaya tertentu, tanpa harga, tanpa API publik, dan tanpa entri di papan peringkat video independen mana pun. Fakta bahwa kedua hal itu benar sekaligus adalah cerita yang sebenarnya.
Apa yang tidak dilakukan oleh 48% itu, dan apa yang tidak dilakukannya
Studi ini adalah uji Turing tatap muka, bukan survei preferensi, dan protokolnya perlu dinyatakan secara presisi karena itulah klaim yang menopangnya. Lima puluh empat peserta direkrut melalui platform riset independen dan diberi tahu bahwa mereka akan dipasangkan dengan peserta lain untuk panggilan video satu menit tentang apa yang mereka nantikan tahun ini. Mitra mereka adalah PAL yang menjalankan Griffin-Lite, yang menghasilkan wajah, suara, dan respons secara real time. Hanya pada akhir survei mereka ditanya apakah pernah terlintas dalam pikiran mereka bahwa mitra itu mungkin bukan orang sungguhan, dan setiap peserta kemudian diberi tahu bahwa itu adalah AI. Uji pembanding menggunakan protokol yang sama pada stack yang lebih lama, dengan empat puluh satu peserta.
Angka-angka pendukung sama pentingnya dengan judul utamanya. Mereka yang percaya merasa yakin — rata-rata 79% — dan begitu pula mereka yang meragukan, sebesar 81%, dan itulah yang diinginkan sebuah studi: tidak ada yang menebak-nebak. Lebih dari separuh peserta mengatakan kemungkinan itu sama sekali tidak terlintas di pikiran mereka selama panggilan, dan hampir semua dari kelompok itu kemudian mengatakan bahwa pasangannya nyata. Peserta yang memang curiga cenderung mulai curiga dalam dua puluh detik pertama. Itulah kalimat paling tidak nyaman dalam laporan ini dan yang seharusnya membentuk cara Anda membaca bagian keselamatan nanti.
Dalam skala tujuh poin, model ini rata-rata mendapat 5,4 untuk tampak alami, 5,6 untuk tampak dapat dipercaya, 5,8 untuk apakah para peserta akan senang berbicara dengannya lagi — skor yang tetap 5,4 bahkan di antara peserta yang dengan tepat mengidentifikasinya sebagai AI — dan 5,5 untuk apakah mereka merasa mitra bicaranya benar-benar mendengarkan. Skor terendah adalah 4,9, untuk apakah percakapan mengalir secara alami. Jika dibaca sebagai satu kesatuan, itu adalah profil yang spesifik: Griffin-Lite meyakinkan dari satu momen ke momen berikutnya dan sedikit kurang meyakinkan sebagai sebuah alur.
Tolok ukur independen, dan cara membaca dua jalurnya
Angka kualitas berasal dari VideoFDB milik NVIDIA, sebuah benchmark untuk percakapan audio-visual dupleks penuh yang menilai model pada dua jalur terpisah — generasi, yang berarti apakah model menghasilkan perilaku yang tepat, dan persepsi, yang berarti apakah model memahami momen tersebut — masing-masing dengan rubriknya sendiri dan papan peringkatnya sendiri. NVIDIA membangun benchmark tersebut, melakukan evaluasi dengan penilainya sendiri terhadap metrik yang dipublikasikan, dan memberi skor pada respons dengan skala nol hingga lima. Tavus tidak menjalankannya, itulah alasan untuk mengutipnya.
• Generasi — Griffin-Lite memperoleh skor 3,83, sistem yang dipublikasikan dengan skor tertinggi berikutnya memperoleh 2,80 (Gemini 2.5 dengan Anam), dan referensi ground-truth manusia adalah 3,92. Itu 1,03 lebih unggul daripada sistem pembanding terbaik dan 0,09 di bawah manusia.
• Persepsi — 3,73 terhadap referensi manusia 4,20, dengan 3,44 untuk baseline terkuat yang dilaporkan, MiniCPM-o 4.5 dalam konfigurasi hanya audionya. Gemini 2.5 Flash Native mencetak 3,17 dan gpt-realtime milik OpenAI mencetak 2,97.
• Penyelarasan tingkat takeover — 62,8% pada generasi dan 73,8% pada persepsi. Ini mengukur seberapa dekat keputusan model tentang kapan harus berbicara dengan waktu dalam percakapan referensi, dan Tavus menyebut keduanya sebagai yang tertinggi di antara sistem mana pun di papan peringkat.
Ada dua catatan yang perlu menyertai angka-angka itu sebelum siapa pun mengulanginya. Selisih generasi terhadap manusia adalah 0,09 pada skala lima poin yang dinilai oleh model bahasa, yang lebih tepat dibaca sebagai "mendekati manusia pada rubrik ini" ketimbang "setara level manusia". Dan perbandingan persepsinya bukanlah perbandingan yang setara: MiniCPM-o 4.5 dan gpt-realtime dinilai dalam konfigurasi hanya audio, sementara Griffin juga membaca video. Keunggulan 0,29 poin atas baseline hanya audio itu nyata, tetapi sebagian dari yang diukurnya adalah nilai dari memiliki mata.
Kalimat ringkasan milik vendor sendiri — peringkat pertama dalam uji independen NVIDIA atas AI tatap muka, 37% lebih unggul daripada AI terbaik berikutnya dalam bereaksi saat itu juga — merupakan karakterisasi dari data yang sama, bukan temuan terpisah. Pertahankan skor jalur yang mendasarinya, bukan pembingkaiannya.

Dua mesin, berjalan pada saat yang sama
Klaim arsitekturalnya lebih mudah dievaluasi daripada pemasaran di sekitarnya, karena ini adalah klaim tentang apa yang berjalan secara bersamaan. Griffin digambarkan sebagai dua sistem yang bekerja secara paralel, bukan pipeline yang melakukan serah terima antar tahap.
Yang pertama adalah mesin Pemodelan Percakapan Berkelanjutan. Ia menyerap audio dan video orang tersebut dan menilai ulang pertukaran itu pada interval sub-detik secara teratur — Tavus menyebutnya mini-turn — memutuskan pada masing-masingnya apakah akan tetap diam, memberi sinyal, backchannel, atau mengambil giliran. Outputnya bukan hanya kata-kata tetapi serangkaian kontrol ekspresif yang membawa waktu, sikap, ekspresi wajah, dan gestur. Inti dari desain ini adalah bahwa keputusan yang dibuat di tengah kalimat muncul dalam suara dan wajah dalam mini-turn yang sama alih-alih setelah serah-terima, yang memungkinkan model berhenti ketika dipotong, mengangguk saat mendengarkan, dan memperlakukan jeda untuk berpikir sebagai sesuatu selain akhir dari giliran.
Yang kedua adalah mesin generasi audio-visual yang mengubah kontrol tersebut menjadi suara dan piksel secara bersamaan: generator ucapan streaming dan generator video streaming yang digerakkan oleh sinyal yang sama, sehingga perubahan nada dan perubahan ekspresi terjadi pada ketukan yang sama.
Satu catatan kejujuran tentang materi yang Tavus terbitkan bersama ini, karena ini mudah disalahartikan sebagai pengukuran. Diagram interaktif dari pertukaran sembilan detik dianotasi dalam teks halaman itu sendiri sebagai ilustratif dan secara eksplisit bukan diukur dari sesi nyata. Peringatan yang sama berlaku untuk gambar waktu turn-based versus full-duplex. Yang diukur adalah angka latensi di bagian bawah.
Di dalam stack streaming
Sisi audio dibangun di sekitar codec bernama Tavec, sebuah autoencoder konvolusional yang memetakan audio 48 kHz ke laten kontinu berisi 40 nilai per frame pada 100 frame per detik, tanpa codebook. Decoder-nya sepenuhnya kausal, sehingga mempertahankan state antar chunk dan memancarkan paket audio sekecil 10 ms tanpa lookahead. Satu menit ucapan adalah 6.000 frame laten alih-alih 2,88 juta sampel mentah, yang membuat urutan cukup murah bagi transformer ucapan untuk memprediksi lebih cepat daripada waktu nyata. Generator ucapan itu sendiri adalah transformer difusi autoregresif yang mengondisikan pada prefiks pembicara yang dikodekan — suara dapat dikloning dari sekitar sepuluh detik audio — dan menghasilkan satu chunk laten pada satu waktu saat kontrol tiba, sehingga pemutaran dimulai sebelum ucapan selesai.
Sisi video dimulai dari premis yang sama: kompresi temporal yang kuat adalah yang membuat model difusi cukup cepat untuk mengobrol. Generator autoregresif beberapa langkah mengambil foto referensi, audio streaming, dan kontrol streaming, lalu menghasilkan satu laten per langkah pada tiga langkah difusi per laten. VAE memampatkan waktu delapan kali lipat, jadi pada 25 fps satu laten adalah delapan frame, atau 320 ms video 720p. Laten yang lebih lama disimpan pada resolusi yang semakin rendah agar rollout panjang tetap terjangkau. Hasilnya adalah generator yang mengeluarkan 720p dalam potongan 320 ms secara real time.
Untuk sampai ke sana, diperlukan distilasi tiga tahap dari guru difusi banyak-langkah dua arah yang besar: Distribution Matching Distillation menjadi siswa beberapa langkah, teacher forcing untuk mengubah siswa tersebut menjadi model autoregresif yang menghasilkan satu latent pada satu waktu, dan akhirnya pelatihan dengan self-forcing pada riwayat yang dihasilkan model itu sendiri plus mekanisme tambahan yang bekerja pada frame riwayat agar rollout panjang tidak melenceng. Tahap ketiga itulah yang mengatasi mode kegagalan yang biasanya dimiliki kelas model ini — wajah yang memburuk, atau latar belakang yang perlahan bergeser, selama percakapan yang berlangsung beberapa menit.
Angka latensi, yang merupakan klaim produk yang sebenarnya
Dibandingkan dengan empat model difusi streaming yang telah dipublikasikan dalam setelan audio-ke-video, di mana setiap model menerima ucapan dan gambar referensi dan harus menghasilkan wajah yang berbicara, generator Griffin-Lite rata-rata mencatat latensi audio-ke-video sebenarnya sebesar 0,43 detik pada H100s — waktu dari saat potongan audio tiba hingga video menampilkan efeknya. Tavus menyebutnya sebagai setengah dari metode tercepat berikutnya. Pihaknya juga melaporkan peringkat pertama pada kualitas perseptual DOVER dan FID serta pada THEval, kerangka evaluasi talking-head, dan peringkat kedua pada keyakinan lip-sync LSE-C di 7,27, di belakang satu baseline — dengan vendor mencatat bahwa LSE-C memberi ganjaran pada gerakan mulut yang mencolok, termasuk gerakan melewati titik saat terlihat alami.
Semua itu adalah pengukuran Tavus sendiri terhadap baseline yang dipilihnya. Semuanya berguna karena spesifik dan karena angka 0,43 detik adalah jenis angka yang entah bertahan dalam pengujian langsung atau tidak. Semuanya tidak independen, dan satu-satunya skor independen dalam artikel ini adalah dua trek VideoFDB di atas.

Mengapa tidak ada harga untuk dibandingkan
Griffin-Lite tersedia hari ini bagi sekelompok kecil penguji awal sebagai pratinjau riset, dengan rilis yang lebih luas dari model yang lebih mumpuni menyusul. Model ini tidak akan tersedia untuk penggunaan pelanggan saat ini. Akses dilakukan melalui formulir permintaan. Model ini tidak ada di platform Tavus, dan kalimat penutup perusahaan sendiri dalam pengumuman itu menyatakannya secara gamblang: Griffin belum ada di platform Tavus, dan akan hadir setelah Tavus menemukan cara merilisnya dengan aman. Segala hal yang biasanya dibandingkan pembeli — harga per detik atau per permintaan, pengenal model, batas laju, SLA, daftar wilayah — belum ada. Tavus mengarahkan siapa pun yang ingin membangun hari ini ke model yang sudah digunakan 150.000 pengembang dan bisnis, yaitu ketiga pendahulunya, bukan Griffin.
Itu bukan detail teknis yang perlu diberi catatan kaki. Itu mengubah untuk apa model ini ditujukan saat ini. Itu adalah target evaluasi bagi tim yang produknya bergantung pada apakah seseorang bisa membedakannya, dan sinyal tentang ke mana roadmap vendor mengarah. Itu bukan sesuatu yang bisa dijadikan landasan untuk membangun jalur yang menghadap pelanggan kuartal ini.
Gerbang keamanan adalah rencana rilis
Hal paling menarik yang ditulis Tavus tentang Griffin bukanlah tentang modelnya. Melainkan pengakuan bahwa sifat-sifat yang sama yang membuat model interaksi manusia menjadi antarmuka yang lebih baik juga membuatnya lebih baik dalam menipu seseorang agar percaya bahwa itu bukan AI, bahwa diperlukan kerja penyelarasan dan keselamatan lebih lanjut sebelum peluncuran yang aman, dan bahwa perusahaan sedang mengerjakan fitur pengungkapan serta bekerja sama dengan organisasi pada evaluasi keselamatan AI. Mengingat hampir setengah dari sampel langsung tidak dapat membedakannya, dan mereka yang bisa sebagian besar menyadarinya dalam waktu dua puluh detik, mekanisme pengungkapan yang bertahan dalam percakapan santai bukanlah sekadar nilai tambah.
Dua hal akan mengubah artikel ini secara substansial. Kartu model yang dipublikasikan dengan endpoint dan harga akan menggeser Griffin dari hasil riset menjadi pertanyaan pengadaan. Dan entri di papan video independen — dengan catatan bahwa papan-papan itu menilai klip pendek berdasarkan preferensi berpasangan dan tidak dibuat untuk menilai percakapan langsung, sehingga ketidakcocokan itu mungkin permanen, bukan sementara — akan memberikan pemeriksaan eksternal terhadap klaim latensi dan kualitas. Sampai salah satu dari hal-hal itu terwujud, trek VideoFDB adalah bukti terkuat yang tersedia dan disertai selisih manusia masing-masing sebesar 0,09 dan 0,47 poin.
Argumen tandingan yang layak dipertimbangkan adalah bahwa menjalankan benchmark bukanlah deployment. Protokol NVIDIA memberi setiap sistem tugas pengambilan giliran bicara yang sama dan penilai yang sama; protokol itu tidak mengatakan apa pun tentang bagaimana perilaku jam kesembilan sebuah panggilan, apa yang terjadi ketika dua orang saling memotong pembicaraan selama satu menit penuh, atau apakah kontrol ekspresif menurun pada wajah yang dirender buruk oleh foto referensi. Tavus melaporkan pelatihan khusus drift — tahap self-forcing dan mekanisme history — sebagai perbaikan untuk tepat hal itu, dan laporan adalah semua yang dimiliki pembaca sampai seseorang di luar Tavus menjalankan sesi panjang dan menerbitkannya. Perlakukan benchmark sebagai bukti terbaik yang tersedia, bukan sebagai hasil deployment.
Apa yang harus dibangun di sekitarnya untuk sementara waktu
Pertanyaan praktis bagi tim yang menginginkan sesuatu seperti ini hari ini adalah bagian mana dari stack yang sudah dapat dibeli. Antarmuka video percakapan adalah sebuah rantai — pengenalan ucapan, model bahasa, sintesis ucapan, dan dalam kasus Tavus, model rendering — dan tiga yang pertama sudah menjadi komoditas. Semua itu berada di balik satu endpoint yang kompatibel dengan OpenAI di OrcaRouter dengan 200+ model pada kunci yang sama dan harga daftar penyedia diteruskan pada markup 0%, sehingga pemotongan harga vendor langsung berlaku di sini pada hari yang sama alih-alih setelah siklus kontrak. Jika Anda merakit pipeline interaksi dan ingin menjaga lapisan generasi tetap terbuka sampai Griffin atau sesuatu seperti itu menjadi produk yang sebenarnya, di situlah penggantiannya memerlukan perubahan konfigurasi alih-alih migrasi. Tavus Griffin sendiri bukan model yang dirutekan di sini, dan tidak akan demikian selama masih berupa pratinjau di balik formulir permintaan.
Hal yang layak diperhatikan bukanlah demo reel lainnya. Yang penting adalah apakah perkakas pengungkapan yang sedang dibangun Tavus akan dipublikasikan, dan apakah kelompok riset kedua mereproduksi protokol tatap muka tersebut. Kelulusan uji Turing sebesar ini justru merupakan jenis hasil yang membutuhkan laboratorium kedua untuk menjalankannya.

