
Tavus Griffin vs Alibaba Wan 2.7: Model Konversasional vs Model Generatif
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 223 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Cara yang menggoda untuk membandingkan Tavus Griffin dan Alibaba Wan 2.7 adalah per detik video, dan perbandingan itu tidak bisa dilakukan. Wan 2.7 memiliki daftar tarif yang dipublikasikan — $9,00 per menit pada 1080p di endpoint internasional Alibaba Cloud di Singapura, dengan tier Beijing dan Tokyo yang lebih murah — dan Tavus Griffin tidak memiliki daftar tarif sama sekali, karena Griffin-Lite dirilis pada 1 Oktober 2026 sebagai pratinjau riset untuk penguji tepercaya terpilih di balik formulir permintaan. Yang dimiliki keduanya adalah sebuah kata: video. Di luar itu, keduanya adalah jawaban atas pertanyaan yang berbeda. Yang satu ditanya apa yang harus terjadi selanjutnya dalam sebuah percakapan; yang lain ditanya seperti apa pemandangan yang dideskripsikan. Perbandingan yang menarik bukanlah kualitas, melainkan apa yang masing-masing butuhkan dari Anda sebelum menghasilkan apa pun, dan apa yang Anda dapatkan kembali.
Perbedaannya adalah loop, bukan resolusinya.
Wan 2.7 menghasilkan klip demi klip dari sebuah prompt. Anda menuliskan deskripsi, Anda mendapatkan sepotong rekaman, Anda melihatnya, lalu Anda menulis lagi. Wan 2.7 adalah rangkaian empat model — text-to-video, image-to-video, reference-to-video, dan video-edit — dan interaksinya pada dasarnya adalah: sebuah input, sebuah output yang dirender, dan keputusan apakah akan menyimpannya. Tidak ada bagian dari proses ini yang berjalan saat Anda masih menentukan apa yang ingin Anda minta.
Griffin dibangun dengan pendekatan yang berkebalikan. Ini adalah sistem dupleks penuh: mesin Pemodelan Percakapan Berkelanjutan yang menyerap audio dan video serta menilai ulang percakapan pada interval sub-detik, memutuskan apakah akan tetap diam, memberi isyarat, backchannel, atau mengambil giliran, dan mengeluarkan kontrol ekspresif yang menggerakkan generator ucapan streaming dan generator video streaming secara paralel. Sistem ini menghasilkan 720p dalam potongan 320 ms dari satu foto referensi, dan klaim yang penting adalah bahwa keputusan yang dibuat di tengah kalimat muncul pada suara dan wajah dalam mini-turn yang sama. Tolok ukur untuk ini bukanlah papan peringkat klip. Tolok ukurnya adalah apakah Anda dapat menyela sistem ini.
Sederhananya: Wan 2.7 menjawab pertanyaan "seperti apa adegan ini terlihat saat bergerak?" Griffin menjawab "apa yang harus dilakukan wajah dan suara ini dalam dua ratus milidetik berikutnya, mengingat orang tersebut baru saja berhenti sejenak."
Harga, di satu sisi jika ada
Tarif yang dipublikasikan Wan 2.7 dihitung per detik video yang dihasilkan, dan tingkatan harganya tidak seragam di seluruh suite, yang merupakan detail yang paling sering dilewatkan halaman perbandingan.
• wan2.7-t2v dan wan2.7-i2v — ditagih hanya berdasarkan durasi output. Singapura Internasional: $0.10/dtk pada 720p dan $0.15/dtk pada 1080p, yaitu angka $9.00/menit yang muncul di papan peringkat. Beijing dan Tokyo mencantumkan $0.086/dtk dan $0.143/dtk untuk pekerjaan yang sama.
• wan2.7-r2v (referensi-ke-video) — ditagih berdasarkan durasi video input, dibatasi maksimal lima detik, ditambah output. Masukkan referensi lima detik ke dalam generasi lima belas detik dan Anda akan ditagih selama dua puluh detik.
• wan2.7-videoedit — ditagih hanya berdasarkan output, dengan footage input gratis.
Dua fakta siklus hidup patut disebutkan di samping angka-angka itu. Alibaba memberikan diskon peluncuran 30% untuk waktu terbatas pada platform Bailian dan Qwen Cloud miliknya sendiri, berlaku hingga 23 September 2026, yang kini sudah lewat. Dan pemberitahuan penghentian Model Studio milik Alibaba Cloud (ID 118434) menonaktifkan beberapa model lama pada 10 Oktober 2026, termasuk wan2.7-r2v dan wan2.7-image. Ini terjadi pada tingkat varian, bukan penghentian generasi — wan2.7-t2v dan wan2.7-i2v tetap terdaftar dengan tarif yang masih berlaku dan halaman yang diperbarui baru-baru ini pada 11 September — tetapi jika reference-to-video adalah alasan Anda melihat 2.7, jalur itu sudah ada tanggalnya.
Perbandingan dengan Griffin memiliki satu pernyataan yang jujur: tidak ada harga yang bisa diletakkan di samping harga Wan 2.7, karena Tavus belum menerbitkan satu pun. Griffin-Lite tidak ada di platform Tavus, pengumuman itu menyatakan bahwa fitur ini tidak akan tersedia untuk penggunaan pelanggan saat ini, dan kalimat penutup perusahaan sendiri adalah bahwa Griffin akan hadir setelah perusahaan menemukan cara merilisnya dengan aman. Tidak ada tarif per detik, tidak ada tarif per permintaan, tidak ada tier gratis, tidak ada tier enterprise. Siapa pun yang menyebutkan harga untuk Griffin sedang mengarangnya.
Skor kualitas: dua papan yang tidak memenuhi
Kedua model itu telah dinilai menggunakan instrumen yang sama sekali berbeda, sehingga tidak ada perbandingan Elo di antara keduanya.
Wan 2.7 memiliki dua entri di arena video Artificial Analysis, dan keduanya tidak berada di posisi yang sama — itulah jebakan dalam mengutip satu angka untuknya. Elo di sana diturunkan dari suara preferensi manusia secara buta berpasangan, sebuah metodologi yang dibuat untuk klip pendek hasil generasi, dan kedua pembacaan di bawah ini berasal dari papan yang dibaca pada 2 Oktober 2026.
• Wan2.7-260612 (build Juni) dalam teks-ke-video (dengan audio) — ke-13–ke-14, Elo 1.032 (±10) berdasarkan lebih dari 4.645 suara, $9,00/menit.
• Wan 2.7 (build April) dalam image-to-video (dengan audio) — ke-12 dari 34, Elo 1.077 dari 4.571 suara, $9,00/menit, papan peringkat yang memiliki kira-kira jumlah suara yang sama tetapi menempatkannya secara signifikan lebih tinggi.
• Wan 3.0, saudara yang lebih baru — peringkat ke-1 dengan Elo 1.157 pada teks-ke-video dan peringkat ke-6 dengan 1.164 pada gambar-ke-video, keduanya bertarif $12,00/menit. Itulah angka yang perlu diketahui sebelum Anda membandingkan Wan 2.7 dengan apa pun: generasi berikutnya milik Alibaba sendiri adalah penghuni puncak klasemen, dan 2.7 adalah build papan tengah.

Griffin berada di atas VideoFDB milik NVIDIA, sebuah tolok ukur untuk percakapan audio-visual dupleks penuh yang dibangun dan dinilai secara independen oleh NVIDIA pada September 2026, menggunakan juri model bahasa terhadap rubrik nol hingga lima. Griffin-Lite memperoleh skor 3,83 pada jalur generasi dibandingkan dengan referensi manusia 3,92 dan 2,80 untuk sistem terpublikasi dengan skor tertinggi berikutnya, serta 3,73 pada jalur persepsi dibandingkan dengan referensi manusia 4,20. Tavus juga melaporkan latensi audio-ke-video sebenarnya sebesar 0,43 detik untuk generator tersebut dibandingkan dengan empat baseline difusi streaming yang dipublikasikan pada H100s.
Kedua kumpulan angka itu sah dan keduanya tidak dapat dibawa ke konteks lain. Elo di arena adalah hitungan suara tentang preferensi klip; VideoFDB adalah skor rubrik juri tentang perilaku percakapan. Tidak ada jembatan di antara keduanya, dan jebakan sampel rendah juga berlaku ke arah sebaliknya: pita ±10 arena pada Wan 2.7 cukup lebar sehingga posisinya terhadap para tetangganya tidak ditetapkan secara ketat, dan selisih generasi 0,09 poin NVIDIA terhadap manusia cukup kecil pada rubrik lima poin sehingga "dekat dengan referensi manusia" adalah pembacaan yang jujur, bukan "setingkat manusia". Perbandingan persepsinya juga tidak setara — beberapa sistem yang berada di bawah Griffin, termasuk gpt-realtime milik OpenAI dan MiniCPM-o 4.5, dinilai dalam konfigurasi hanya audio sementara Griffin juga mempersepsi video. Sebagian dari keunggulan 0,29 poin itu mengukur fakta bahwa Griffin punya mata.
Apa yang masing-masing butuhkan darimu
Di sinilah perbandingan menjadi berguna, karena inputnya adalah produk-produk tersebut.
• Masukan — Wan 2.7 menerima teks, gambar, video, dan audio. Griffin menerima orang langsung melalui kamera dan mikrofon, dan sama sekali tidak menghasilkan klip saat diminta.
• Output — Wan 2.7 menghasilkan file video, 2 hingga 15 detik per generasi, hingga 1080p, dengan audio native. Griffin menghasilkan percakapan yang berlangsung terus-menerus: video 720p pada 25 fps dalam potongan 320 ms, dihasilkan secara real time dan diputar saat didekode.
• Apa yang mengendalikannya — Wan 2.7 dikendalikan oleh prompt dan oleh hingga lima gambar subjek serta lima klip referensi, dalam batas maksimum sepuluh aset referensi per permintaan. Griffin dikendalikan oleh apa yang dilakukan orang tersebut: jeda, pandangan yang dialihkan, gerakan, interupsi.
• Horizon waktu — satuan kerja Wan 2.7 adalah klip berdurasi paling lama lima belas detik, yang kemudian Anda rangkai. Satuan kerja Griffin adalah percakapan, itulah sebabnya arsitektur harus mengatasi drift — distilasi tiga tahap menjadi generator autoregresif, yang dilatih pada riwayat yang dihasilkannya sendiri agar rollout panjang tetap stabil — alih-alih berjuang untuk satu generasi tunggal yang lebih panjang.
• Wadah keluaran — Wan 2.7 mengembalikan file milik Anda yang dapat diedit, disesuaikan warnanya, dan didistribusikan. Griffin mengembalikan sesi yang telah dirender. Tidak ada file untuk diedit, karena pikselnya dihasilkan per segmen dari foto referensi dan riwayat model itu sendiri, serta latar belakang, bayangan, dan kursi tempat orang itu duduk merupakan bagian dari proses generasi.
Satu perbedaan struktural yang layak disebutkan: biaya Wan 2.7 meningkat seiring durasi keluaran dan kualitasnya meningkat seiring seberapa spesifik prompt Anda. Biaya Griffin belum terukur dan kualitasnya meningkat seiring seberapa alami orang di sisi lain. Anda dapat meningkatkan yang satu dengan menulis brief yang lebih baik dan yang lain hanya dengan menggunakannya bersama orang nyata.

Referensi dan konsistensi, di mana kedua desain berbenturan
Wan 2.7 mengontrol konsistensi subjek melalui referensi yang disediakan: lima gambar subjek, lima klip referensi, total sepuluh aset. Ini adalah pendekatan fotografi — Anda menunjukkan kepadanya seperti apa subjeknya dan ia mempertahankan tampilan itu di sepanjang proses generasi.
Griffin mengontrol hal yang sama dengan cara yang berlawanan. Ia menghasilkan setiap piksel di setiap frame dari satu gambar referensi secara real time, dan pengumumannya secara eksplisit menyatakan bahwa ia mengontrol seluruh adegan, bukan wajahnya: lengan dan jari, pergerakan kursi, bayangan yang ditimbulkan, dan latar belakang di belakangnya. Konsistensi di sana dicapai dengan menjadikan lingkungan sebagai target generasi alih-alih plate yang dikomposit.
Tidak ada pendekatan yang secara mutlak lebih baik dan keduanya gagal dengan cara yang berbeda. Pembangkitan yang dikondisikan referensi gagal karena menyimpang dari subjek yang diberikan sepanjang klip yang panjang. Pembangkitan per potongan dengan riwayat autoregresif gagal karena mengembara sepanjang sesi yang panjang jika penanganan penyimpangannya salah, yang justru merupakan kegagalan yang hendak dicegah oleh tahap distilasi ketiga. Wan 2.7 adalah pilihan yang lebih aman ketika hasil yang harus diserahkan adalah orang tertentu dengan tampilan tertentu. Griffin tidak bersaing untuk brief tersebut.
Keselamatan, asal-usul, dan postur rilis
Wan 2.7 tidak membawa sistem provenans terbitan yang sebanding dengan tanda air yang mampu bertahan setelah kompresi — pengumuman tersebut menyebut kualitas audio dan akurasi teks di layar sebagai area yang masih perlu digarap, yang merupakan catatan keterbatasan soal kesetiaan, bukan soal keamanan.
Kisah keamanan Griffin justru terbalik: alasan yang dinyatakan Tavus untuk mempertahankannya dalam pratinjau adalah bahwa sifat-sifat yang sama yang membuatnya menjadi antarmuka yang lebih baik juga membuatnya lebih baik dalam meyakinkan seseorang bahwa mereka sedang berbicara dengan manusia, dan angka-angkanya mendukung kekhawatiran tersebut. Dalam studi langsung perusahaan sendiri, 26 dari 54 peserta percaya bahwa lawan bicara mereka adalah orang sungguhan, dibandingkan dengan 1 dari 41 pada stack sebelumnya, Phoenix-4.5 / Raven-1 / Sparrow-2. Peserta yang memang curiga cenderung mulai curiga dalam dua puluh detik pertama. Tavus mengatakan bahwa pekerjaan penyelarasan dan pengungkapan lebih lanjut diperlukan sebelum peluncuran, bahwa perusahaan sedang membangun fitur pengungkapan, dan bahwa perusahaan sedang bekerja sama dengan berbagai organisasi dalam evaluasi keselamatan. Itu adalah hal paling substantif yang pernah diterbitkan siapa pun tentang model ini, dan itulah juga sebabnya tidak ada produk yang bisa dibeli.
Bagi siapa pun yang membandingkan keduanya sebagai alat, konsekuensi praktisnya sederhana: yang satu dapat dihasilkan sesuai permintaan dan dapat dikirim hari ini, dan yang lain adalah target evaluasi yang perilisannya bergantung pada masalah yang belum dipecahkan oleh vendor.
Yang mana, untuk apa
• Pilih Wan 2.7 jika hasil yang diinginkan adalah footage. Penyuntingan berbasis instruksi terhadap materi yang sudah ada adalah beban kerja yang membuatnya luar biasa kuat dan luar biasa murah, karena varian penyuntingan hanya menagih output dan menganggap footage input gratis. Varian reference-to-video miliknya layak diperiksa terhadap penghentian 10 Oktober sebelum Anda berkomitmen padanya.
• Jangan pilih Griffin untuk apa pun kuartal ini, karena Anda tidak bisa. Minta akses jika Anda perlu mengetahui apakah seseorang dapat mengetahuinya, atau jika peta jalan Anda bergantung pada lapisan interaksi, bukan lapisan rekaman.
• Perhatikan celahnya, bukan salah satu modelnya. Kedatangan Griffin membuat perbandingan yang lebih menarik menjadi perbandingan masa depan: sebuah sistem yang menghasilkan seluruh percakapan versus sebuah suite yang menghasilkan seluruh adegan. Produk pertama yang melakukan keduanya akan menjadi produk yang layak dijadikan pembanding saat membaca ulang ini.
Di mana router cocok, dan di mana tidak
Tidak satu pun dari model ini ada dalam katalog OrcaRouter, dan itu perlu dinyatakan sebelum hal lain di bagian ini. Wan 2.7 dapat diakses melalui platform milik Alibaba sendiri — Model Studio di Alibaba Cloud dan Qwen Cloud — serta melalui alat kreatif pihak ketiga yang mengintegrasikannya setelah peluncuran; Tavus Griffin hanya dapat diakses melalui formulir permintaan. Jika salah satunya menjadi dapat dirutekan, model tersebut akan muncul dengan harga daftar penyedia.
Bagian dari pipeline video yang merupakan masalah routing adalah teks di sekitarnya. Daftar shot, ekspansi prompt, pembuatan caption, ringkasan tinjauan kualitas, dan pekerjaan transkrip atau dialog yang menyuplai proses reference-to-video semuanya adalah panggilan teks, dan itu berjalan pada endpoint kompatibel OpenAI yang sama di OrcaRouter seperti 200+ model lainnya pada harga daftar penyedia dengan tambahan markup 0%, sehingga pemotongan harga vendor langsung berlaku pada hari yang sama, bukan setelah siklus kontrak. Membagi model murah untuk proses massal dan model frontier untuk proses final hanyalah perubahan konfigurasi di sana, bukan hubungan vendor kedua — argumen yang sama berlaku untuk lapisan generasi, setelah lapisan generasi menjadi sesuatu yang dapat Anda panggil.
Yang perlu diperhatikan: apakah varian referensi dan penyuntingan dari suite Wan 2.7 tetap bertahan tanpa perubahan melewati pensiunnya Model Studio pada 10 Oktober, dan apakah gerbang keamanan Griffin menghasilkan kartu model terbitan dengan endpoint di dalamnya. Dua peristiwa itulah yang akan mengubah perbandingan ini dari esai desain menjadi keputusan pengadaan.

