Tavus Griffinのヒーロータイトルカード。サブタイトルは「最初のHuman Interaction Model — 2026年10月1日発表」で、その下に3つのチップが並び、「48%が実在の人物だと思った」「VideoFDB生成: 3.83(人間の参照値3.92に対して)」「音声から映像へのレイテンシ0.43秒」と表示。フッター:「すべての数値はベンダーおよびNVIDIAによる報告。Griffin-Liteは研究プレビューであり、一般提供はされていません。」OrcaRouterのロゴが右下に合成されている。
Guides & Insights

Tavus Griffin:初のヒューマンインタラクションモデルと、ビデオチューリングテストを通過した48%

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

54人中26人が1分間のビデオ通話を完了し、相手は実在の人物だったと述べた。それがTavusがTavus Griffinで前面に押し出している数字であり、2026年10月1日に発表されたものだ。そしてこれは真に衝撃的な結果である。同じプロトコル上で、同社の以前のスタック——Phoenix-4.5が顔をレンダリングし、Raven-1が知覚を担い、Sparrow-2がターンダイナミクスを管理していた——は、41人中1人、つまり2.4%しか信じさせられなかった。この跳躍に対する2つの明白な解釈はどちらも誤りであり、それらを切り分けることが、以下の記述の大部分を占める。Griffinはより優れたアバターエンジンではなく、購入できる製品でもない。それはGriffin-Liteと呼ばれる研究プレビューであり、選ばれた信頼できるテスターに公開されているもので、価格設定も公開APIも、独立系の動画リーダーボードへの掲載もない。それら両方が同時に成り立っていることこそが、実際のストーリーなのだ。

48%が測っているもの、測っていないもの

この研究は選好調査ではなく対面式チューリングテストであり、そのプロトコルは、これが主張の根幹をなすものであるだけに、正確に述べておく価値がある。54名の参加者が独立した研究プラットフォームを通じて募集され、今年楽しみにしていることについて1分間のビデオ通話をするため、別の参加者とマッチングされると告げられた。相手はGriffin-Liteを稼働させるPALで、顔、声、応答をリアルタイムで生成していた。調査の最後になって初めて、相手が実在の人物ではないかもしれないという考えが頭をよぎったかどうかを尋ねられ、その後、すべての参加者に相手がAIであると告げられた。比較実行では、同じプロトコルを旧スタックに対して用い、41名の参加者を対象とした。

裏付けとなる数字は、見出しと同じくらい重要だ。信じた人たちは自信を持っていた——平均79%——そして疑った人たちも同様で、81%だった。これは研究が望むところだ。誰も当てずっぽうではなかった。参加者の半数以上は、通話中にその可能性がまったく頭に浮かばなかったと述べ、そのグループのほぼ全員が、相手は実在すると続けて答えた。実際に疑った参加者は、最初の20秒以内に疑い始める傾向があった。それはこの報告書の中で最も心地よくない一行であり、後に安全に関するセクションをどう読むべきかを形作る一行だ。

7段階評価で、モデルは自然に見える点で平均5.4、信頼できるように見える点で5.6、参加者がまたそれと話したいと思うかで5.8——そのスコアは、AIだと正しく見抜いた参加者の間でも5.4を維持した——そして相手が本当に聞いていると感じたかで5.5だった。最も低いスコアは4.9で、会話が自然に流れたかどうかについてだった。全体として読むと、それは特定のプロフィールだ。Griffin-Liteは一瞬一瞬では説得力があるが、一続きの流れとしてはやや説得力が落ちる。

独立したベンチマークと、その2つのトラックの読み方

品質スコアはNVIDIAのVideoFDBに由来します。これは全二重の音声視覚会話向けベンチマークで、モデルを2つの別々のトラックで評価します — 生成、つまりモデルが正しい振る舞いを生み出すかどうか、そして知覚、つまりその場の状況を理解しているかどうか — それぞれに独自のルーブリックと独自のリーダーボードがあります。NVIDIAがこのベンチマークを構築し、公表された指標に対して自社のジャッジを用いて評価を実施し、応答を0~5の尺度で採点します。Tavusはそれを実行していません。それがこれを引用する理由です。

• 生成 — Griffin-Liteは3.83を記録し、次に高い公開システムは2.80(Gemini 2.5とAnam)、人間のグラウンドトゥルース参照は3.92でした。これは最高の比較可能なシステムを1.03上回り、人間を0.09下回ります。

• 知覚 — 人間の参照値4.20に対して3.73、報告されている中で最強のベースラインである音声のみの構成のMiniCPM-o 4.5は3.44でした。Gemini 2.5 Flash Nativeは3.17、OpenAIのgpt-realtimeは2.97でした。

• 発話権取得率の整合性 — 生成で62.8%、知覚で73.8%。これは、モデルがいつ話すかについての判断が、参照会話におけるタイミングとどれだけ一致しているかを測るものであり、Tavusは、その両方がボード上のどのシステムよりも高いと説明しています。

これらの数字を誰かが繰り返す前に、二つの注意点を付しておくべきだ。人間に対する生成ギャップは、言語モデルが判定した5点尺度で0.09であり、これは「人間レベル」と読むより「この評価基準では人間に近い」と読む方が適切だ。また、知覚の比較は同等条件ではない。MiniCPM-o 4.5 と gpt-realtime は音声のみの構成で評価されているが、Griffin は映像も読み取る。音声のみのベースラインに対する0.29ポイントの優位は本物だが、それが測っているものの一部は「目があること」の価値である。

ベンダー自身の要約文 — NVIDIAの対面AIに関する独立テストで首位、その場の反応において次善のAIを37%上回る — は、別個の知見ではなく、同じデータの特徴づけである。基になるトラックのスコアは保持し、そのフレーミングは保持しない。

A screenshot of NVIDIA's VideoFDB project page, captured 2 October 2026: the heading "VideoFDB — Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents", the note that it is the first benchmark for full-duplex audio-visual-to-audio-visual conversation, the author list (Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini De Mello) credited to NVIDIA, links to leaderboard, paper and Hugging Face dataset, and an abstract arguing that natural conversation is full-duplex.

2つのエンジン、同時に動作中

アーキテクチャ上の主張は、それを取り巻くマーケティングよりも評価しやすい。なぜなら、それは何が並行して動作するかについての主張だからだ。Griffin は、段階間で受け渡しを行うパイプラインではなく、並行して動作する2つのシステムとして説明されている。

最初は継続的会話モデリングエンジンです。これは人の音声と映像を取り込み、一定のサブ秒間隔でやり取りを再評価します — Tavusはこれをミニターンと呼んでいます — 各ミニターンで、沈黙するか、合図を送るか、あいづちを打つか、ターンを取るかを決定します。出力は言葉だけでなく、タイミング、姿勢、表情、ジェスチャーを伴う一連の表現制御です。設計の要点は、文中でなされた決定が、ハンドオフの後ではなく同じミニターン内で声と顔に現れることです。これによりモデルは、遮られたときに止まり、聞いている間にうなずき、考え込むための間をターンの終わりとは別のものとして扱うことができます。

第二は、それらのコントロールを音とピクセルへと一体で変換する音声映像生成エンジンです。同じ信号によって駆動されるストリーミング音声生成器とストリーミング映像生成器を備え、トーンの変化と表情の変化が同じ拍で重なります。

これと一緒にTavusが公開した資料について、正直に一言添えておきます。測定値と誤解されかねないからです。9秒間のやり取りのインタラクティブ図は、ページ自体のテキストで例示用と注記されており、実際のセッションから測定したものではないと明記されています。同じ注意事項は、ターン制と全二重の比較のタイミング図にも当てはまります。測定されているのは、さらに下にあるレイテンシの数値です。

ストリーミングスタックの内部

音声側は、Tavec と呼ばれるコーデックを中心に構築されています。これは畳み込みオートエンコーダであり、48 kHz の音声を、コードブックを一切使わずに、毎秒 100 フレームでフレームあたり 40 個の連続潜在値にマッピングします。そのデコーダは完全に因果的であるため、チャンクをまたいで状態を保持し、先読みなしで 10 ms という小さな音声パケットを出力します。1 分の音声は 288 万個の生サンプルではなく 6,000 個の潜在フレームであり、これにより音声トランスフォーマーがリアルタイムより速く予測できるほどシーケンスのコストが低くなります。音声生成器自体は自己回帰拡散トランスフォーマーで、エンコードされた話者プレフィックスに条件付けられ(声は約 10 秒の音声からクローン可能)、制御が到着するにつれて一度に 1 つの潜在チャンクを生成するため、発話が終わる前に再生が始まります。

動画側も同じ前提から始まります。強い時間圧縮こそが、拡散モデルを会話ができるほど高速にするのです。数ステップの自己回帰生成器は、参照写真、ストリーミング音声、ストリーミング制御を受け取り、潜在変数あたり3拡散ステップで、ステップごとに1つの潜在変数を生成します。VAEは時間を8分の1に圧縮するので、25 fpsでは1つの潜在変数は8フレーム、つまり720p動画の320ミリ秒に相当します。古い潜在変数は次第に低い解像度で保持されるため、長いロールアウトでも手頃なコストに抑えられます。その結果、リアルタイムで320ミリ秒のチャンクで720pを出力する生成器が得られます。

そこに到達するには、大規模な双方向多ステップ拡散教師からの3段階蒸留が必要だった。分布マッチング蒸留によって数ステップの生徒モデルを作り、教師強制によってその生徒を一度に1つの潜在表現を生成する自己回帰モデルに変換し、最後にモデル自身が生成した履歴に対する自己強制と、履歴フレームに作用する追加機構を併用して訓練することで、長いロールアウトがドリフトしないようにした。この第3段階が、この種のモデルが通常抱える失敗モード——数分続く会話の中で顔が劣化したり、背景が徐々に漂ったりする——に対処するものである。

レイテンシーの数値、それこそが本当の製品の主張だ

公開されている4つのストリーミング拡散モデルと、音声から動画への設定で比較した場合、各モデルは音声と参照画像を受け取り、トーキングフェイスを生成する必要がある。Griffin-Liteのジェネレーターは、H100s上で真の音声から動画へのレイテンシが平均0.43秒だった — 音声が到着してから、その効果が動画に表示されるまでの時間である。Tavusはそれを、次に速い手法の半分の時間だと説明している。また、DOVERとFIDの知覚品質、およびトーキングヘッド評価フレームワークであるTHEvalで1位、LSE-Cのリップシンク信頼度では7.27で2位(1つのベースラインに次ぐ)と報告している — ベンダーは、LSE-Cが顕著な口の動きを評価し、自然に見える範囲を超えた動きも含むと注記している。

それらはすべて、Tavusが自ら選んだベースラインに対するTavus自身の測定値です。それらが有用なのは、具体的であるからであり、また0.43秒という数値が、ライブテストで通用するかしないかの類の数値だからです。それらは独立したものではなく、この記事で唯一独立したスコアは、上記の2つのVideoFDBトラックです。

A screenshot of Tavus's own Griffin announcement page at tavus.io/griffin, captured 2 October 2026: the heading "INTRODUCING GRIFFIN", the strapline "The First Human Interaction Model", the description of Griffin as the world's first Human Interaction Model that listens while watching expressions and pauses, and the byline "By: Hassaan Raza, Ioannis Patras, Head of Tavus Research Team".

なぜ比較できる価格がないのですか

Griffin-Liteは本日、研究プレビューとして選ばれた早期テスターの一団に提供されており、より高性能なモデルの一層広い公開がその後に行われる予定です。現時点では顧客向けには提供されません。アクセスは申請フォームによるものです。これはTavusプラットフォーム上にはなく、同社の発表の締めくくりの一文もそれを率直に述べています。つまり、GriffinはまだTavusプラットフォーム上にはなく、Tavusが安全にリリースする方法を確立し次第、登場するということです。購入者が通常比較するあらゆる項目——秒単位またはリクエスト単位の価格、モデル識別子、レート制限、SLA、リージョン一覧——はまだ存在しません。Tavusは、今日すぐに構築したいと考える人々に、15万人の開発者と企業がすでに使用しているモデルを指し示しています。それはGriffinではなく、3つの前世代モデルです。

それは脚注で済ませるような技術的な細かい話ではない。このモデルが今何のためのものかを変える。人が見分けられるかどうかに製品がかかっているチームにとっては評価対象であり、ベンダーのロードマップがどこへ向かうのかを示すシグナルでもある。今四半期にこれで顧客向けの導線を築くためのものではない。

セーフティゲートがリリース計画です

TavusがGriffinについて書いた最も興味深い点は、モデルそのものについてではない。それは、人間との対話モデルをより良いインターフェースにするのと同じ特性が、それがAIではないと人に信じ込ませるのにもより優れているという認めであり、安全にリリースする前にさらなるアラインメントと安全性の取り組みが必要であること、そして同社が開示機能に取り組んでおり、AI安全性評価について組織と協力しているということである。ライブサンプルのほぼ半数が見分けられず、見分けられた者もほとんどが20秒以内に気づいたことを考えると、何気ない会話でも機能する開示メカニズムは、あると嬉しいものでは済まない。

この記事を実質的に変えるものが二つある。エンドポイントと価格を記載した公開モデルカードが出れば、Griffinは研究結果から調達上の検討課題へと変わる。そして独立系の動画ボードへの掲載があれば——ただし、それらのボードは短いクリップをペアワイズ選好で採点するもので、ライブの会話を採点するようには作られていないため、この不一致は一時的というより恒久的かもしれない——レイテンシと品質に関する主張に外部からの検証を与えるだろう。そのどちらかが実現するまでは、VideoFDBのトラックが利用可能な最強の証拠であり、それにはそれぞれ0.09ポイントと0.47ポイントの人間との差が伴う。

検討に値する反論は、ベンチマークの実行はデプロイではない、というものだ。NVIDIAのプロトコルは、あらゆるシステムに同じターン交代タスクと同じ判定者を与えるが、通話の9時間目がどう振る舞うか、2人が丸1分間互いに重なって話し続けたときに何が起きるか、参照写真がうまく描画できなかった顔で表情制御が劣化するかどうかについては、何も語っていない。Tavusは、まさにそのための解決策として、ドリフトに特化したトレーニング——セルフフォーシングの段階と履歴のメカニズム——を報告しており、Tavusの外部の誰かが長時間セッションを実行して公表するまでは、読者に手に入るのは報告だけだ。ベンチマークは、デプロイの結果としてではなく、入手可能な最良の証拠として扱うべきである。

当面、その周りに何を作るか

このようなものを今すぐ導入したいチームにとっての現実的な問いは、スタックのどの部分がすでに購入可能かという点です。会話型ビデオインターフェースは連鎖であり——音声認識、言語モデル、音声合成、そしてTavusの場合はレンダリングモデル——最初の3つはコモディティです。これらはOrcaRouterのOpenAI互換エンドポイント1つの背後にあり、同じキーで200以上のモデルが利用でき、プロバイダの定価が0%のマークアップでそのまま適用され、ベンダーの値下げは契約サイクルを経るのではなくその日のうちにここに反映されます。インタラクションパイプラインを組み立てていて、Griffinやそれに類するものが実際の製品になるまで生成レイヤーを開いたままにしておきたいなら、そこでは差し替えはマイグレーションではなく設定変更で済みます。Tavus Griffin自体はここではルーティングされるモデルではなく、リクエストフォームの後ろにあるプレビューである間はそうなることはありません。

注目すべきは、別のデモリールではない。Tavusが構築している開示ツールが公開されるかどうか、そして第二の研究グループが対面プロトコルを再現するかどうかである。これほど大規模なチューリングテストの合格は、まさに第二の研究所がそれを実行する必要がある類の結果である。

An explainer scoreboard for Tavus Griffin with six rows: Status: research preview; Pricing: none published; Model type: human interaction model; VideoFDB generation: 3.83 of 5; VideoFDB perception: 3.73 of 5; Open issue: disclosure. Footer: "NVIDIA VideoFDB per Tavus and NVIDIA, September 2026." The OrcaRouter logo is composited bottom-right.