Tavus Griffin을 위한 히어로 타이틀 카드로, 부제는 "최초의 Human Interaction Model — 2026년 10월 1일 발표"이며, 그 위에 "48%가 실제 사람이라고 생각함", "VideoFDB 생성: 인간 기준 3.92 대비 3.83", "0.43초 오디오-비디오 지연 시간"이라고 적힌 세 개의 칩이 있습니다. 푸터: "모든 수치는 벤더 및 NVIDIA 보고 기준이며, Griffin-Lite는 연구 프리뷰로 일반 제공되지 않습니다." OrcaRouter 로고는 오른쪽 하단에 합성되어 있습니다.
Guides & Insights

Tavus Griffin: 최초의 인간 상호작용 모델과 비디오 튜링 테스트를 통과한 48%

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

54명 중 26명이 1분짜리 화상 통화를 마치고 상대가 실제 사람이었다고 말했다. 이것이 Tavus가 Tavus Griffin을 위해 앞세우는 수치이며, 2026년 10월 1일에 발표되었고, 이는 정말로 눈에 띄는 결과다: 동일한 프로토콜에서 이 회사의 이전 스택 — Phoenix-4.5가 얼굴을 렌더링하고, Raven-1이 인지를 담당하고, Sparrow-2가 턴 역학을 관리하던 — 은 41명 중 1명, 즉 2.4%의 신봉자를 만들어냈다. 그 도약에 대한 두 가지 명백한 해석은 둘 다 틀렸으며, 그것들을 구분하는 것이 이어지는 내용의 대부분을 차지한다. Griffin은 더 나은 아바타 엔진이 아니며, 구매할 수 있는 제품도 아니다. 그것은 Griffin-Lite라는 연구 프리뷰로, 일부 신뢰받는 테스터에게만 공개되며, 가격도, 공개 API도, 어떤 독립 비디오 리더보드에서의 등재도 없다. 이 두 가지가 동시에 사실이라는 점이 실제 이야기다.

48%가 측정하는 것과 측정하지 않는 것

이 연구는 선호도 조사가 아니라 대면 튜링 테스트이며, 이 프로토콜을 정확히 밝히는 것은 그것이 핵심을 떠받치는 주장이기 때문이다. 54명의 참가자가 독립 연구 플랫폼을 통해 모집되었고, 올해 기대하는 것에 대해 1분간 영상 통화를 나눌 다른 참가자와 연결될 것이라고 들었다. 그들의 파트너는 Griffin-Lite를 실행하는 PAL로, 얼굴과 목소리, 응답을 실시간으로 생성했다. 설문이 끝날 때에만 그들은 파트너가 실제 사람이 아닐 수도 있다는 생각이 들었는지 질문받았고, 이후 모든 참가자에게 그것이 AI라고 말해졌다. 비교 실행은 41명의 참가자를 대상으로 더 오래된 스택에 동일한 프로토콜을 사용했다.

뒷받침하는 수치들은 헤드라인만큼이나 중요하다. 믿는 쪽도 자신감을 보였고 — 평균 79% — 의심하는 쪽도 81%로 마찬가지였다. 이는 연구가 바라는 바로, 아무도 감으로 답하지 않았다는 뜻이다. 참가자의 절반 이상은 통화 중에 그 가능성을 전혀 떠올리지 않았다고 말했고, 그 집단의 거의 전부가 이어서 상대가 실제였다고 말했다. 실제로 의심한 참가자들은 대개 첫 20초 안에 의심하는 경향이 있었다. 그것은 이 보고서에서 가장 불편한 대목이며, 나중에 안전 섹션을 읽는 방식을 좌우해야 할 대목이기도 하다.

7점 척도에서 이 모델은 자연스러워 보이는 정도에서 평균 5.4점, 신뢰할 만해 보이는 정도에서 5.6점, 참가자들이 이 모델과 다시 대화하는 것을 즐길지 여부에서 5.8점—이 점수는 자신이 AI임을 올바르게 알아차린 참가자들 사이에서도 5.4점을 유지했다—, 그리고 대화 상대가 정말로 자신의 말을 듣고 있다고 느꼈는지 여부에서 5.5점을 받았다. 가장 낮은 점수는 대화가 자연스럽게 흘러갔는지 여부에 대한 4.9점이었다. 전체를 하나로 놓고 보면, 이는 하나의 특정한 프로필이다: Griffin-Lite는 한 순간 한 순간은 설득력이 있지만, 전체 흐름으로 보면 설득력이 약간 떨어진다.

독립 벤치마크, 그리고 두 트랙을 읽는 방법

품질 수치는 NVIDIA의 VideoFDB에서 나온다. VideoFDB는 전이중 오디오-비주얼 대화를 위한 벤치마크로, 모델을 두 개의 별도 트랙에서 평가한다. 생성은 모델이 올바른 행동을 만들어 내는지를, 인지는 그 순간을 이해하는지를 뜻하며, 각 트랙에는 자체 평가 기준과 자체 리더보드가 있다. NVIDIA가 이 벤치마크를 구축했고, 공개된 지표에 따라 자체 심사자로 평가를 수행하며, 응답에 0점에서 5점 척도로 점수를 매긴다. Tavus는 이를 실행하지 않았는데, 바로 그 점이 이 수치를 인용하는 이유다.

• 생성 — Griffin-Lite는 3.83점을 기록했고, 공개된 시스템 중 그다음으로 높은 점수를 받은 시스템은 2.80점(Gemini 2.5 with Anam)을 기록했으며, 인간 정답 기준은 3.92점이다. 이는 비교 가능한 최고 시스템보다 1.03점 앞서고 인간보다 0.09점 낮다.

• 지각 — 인간 기준 4.20 대비 3.73이며, 보고된 가장 강력한 기준선인 오디오 전용 구성의 MiniCPM-o 4.5는 3.44를 기록했습니다. Gemini 2.5 Flash Native는 3.17, OpenAI의 gpt-realtime은 2.97을 기록했습니다.

• 테이크오버율 정렬 — 생성에서 62.8%, 인식에서 73.8%. 이는 모델이 언제 말할지에 대한 결정이 참조 대화의 타이밍과 얼마나 밀접하게 일치하는지를 측정하며, Tavus는 두 지표 모두 보드에 있는 모든 시스템 가운데 가장 높다고 설명합니다.

이 수치들에는 누구든 이를 다시 말하기 전에 두 가지 단서가 따라붙어야 한다. 인간과의 생성 격차는 언어 모델이 판정한 5점 척도에서 0.09인데, 이는 "인간 수준"이라기보다 "이 평가 기준에서는 인간에 가깝다"로 읽는 편이 낫다. 그리고 지각 비교는 동일 조건 비교가 아니다: MiniCPM-o 4.5와 gpt-realtime은 오디오 전용 구성에서 점수가 매겨지는 반면, Griffin은 영상도 읽는다. 오디오 전용 기준선에 대한 0.29점 우위는 실재하지만, 그것이 측정하는 것의 일부는 눈이 있다는 것의 가치다.

벤더 자체의 요약 문구 — NVIDIA의 독립적인 대면 AI 테스트에서 1위, 즉각 반응에서 차선의 AI보다 37% 앞섬 — 는 별도의 발견이라기보다 동일한 데이터에 대한 표현일 뿐입니다. 프레이밍이 아니라 기저에 있는 트랙 점수를 유지하세요.

A screenshot of NVIDIA's VideoFDB project page, captured 2 October 2026: the heading "VideoFDB — Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents", the note that it is the first benchmark for full-duplex audio-visual-to-audio-visual conversation, the author list (Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini De Mello) credited to NVIDIA, links to leaderboard, paper and Hugging Face dataset, and an abstract arguing that natural conversation is full-duplex.

동시에 작동하는 두 개의 엔진

아키텍처 주장은 그 주변의 마케팅보다 평가하기가 더 쉽다. 왜냐하면 그것은 무엇이 동시에 실행되는지에 관한 주장이기 때문이다. Griffin은 단계 사이를 넘겨주는 파이프라인이 아니라 병렬로 작동하는 두 시스템으로 설명된다.

첫 번째는 연속 대화 모델링 엔진이다. 사람의 오디오와 비디오를 입력받아 1초 미만의 일정한 간격으로 대화를 재평가한다 — Tavus는 이를 미니 턴이라고 부른다 — 각 미니 턴에서 침묵할지, 신호를 보낼지, 백채널할지, 발언권을 가져갈지 결정한다. 출력은 단어만이 아니라 타이밍, 태도, 표정, 몸짓을 담은 일련의 표현 제어 신호다. 설계의 핵심은 문장 중간에 내려진 결정이 핸드오프 이후가 아니라 같은 미니 턴 안에서 음성과 얼굴에 나타난다는 점이다. 이 덕분에 모델은 말이 끊기면 멈추고, 들으면서 고개를 끄덕이며, 생각하기 위한 멈춤을 턴의 끝과 다른 것으로 취급할 수 있다.

두 번째는 그러한 제어를 소리와 픽셀로 함께 바꾸는 시청각 생성 엔진입니다: 동일한 신호로 구동되는 스트리밍 음성 생성기와 스트리밍 영상 생성기로, 어조의 변화와 표정의 변화가 같은 박자에 맞아떨어집니다.

이와 함께 Tavus가 공개한 자료에 관해 정직하게 덧붙일 점이 하나 있습니다. 측정값으로 오해하기 쉽기 때문입니다. 9초짜리 주고받기의 인터랙티브 다이어그램은 페이지 자체 텍스트에서 예시용이라고 주석이 달려 있으며, 실제 세션에서 측정한 것이 아니라고 명시되어 있습니다. 턴 기반 대 전이중 통신 타이밍 도표에도 같은 주의가 적용됩니다. 측정된 것은 더 아래에 있는 지연 시간 수치입니다.

스트리밍 스택 내부

오디오 측은 Tavec이라는 코덱을 중심으로 구축되며, 이는 48kHz 오디오를 초당 100프레임에서 프레임당 40개의 값으로 이루어진 연속 잠재 표현으로 매핑하는 컨볼루션 오토인코더로, 코드북이 없습니다. 그 디코더는 완전히 인과적이어서 청크 간에 상태를 유지하고 미리보기 없이 10ms만큼 작은 오디오 패킷을 내보냅니다. 1분의 음성은 288만 개의 원시 샘플이 아니라 6,000개의 잠재 프레임이며, 이것이 음성 트랜스포머가 실시간보다 빠르게 예측할 수 있을 만큼 시퀀스를 저렴하게 만드는 이유입니다. 음성 생성기 자체는 인코딩된 화자 프리픽스에 조건화하는 자기회귀 확산 트랜스포머로, 약 10초의 오디오로 음성을 복제할 수 있으며, 제어가 도착할 때마다 한 번에 하나의 잠재 청크를 생성하므로 발화가 끝나기 전에 재생이 시작됩니다.

영상 쪽은 같은 전제에서 출발한다. 강한 시간 압축이야말로 디퓨전 모델이 대화를 이어갈 만큼 빨라지게 해 주는 요소다. 몇 단계짜리 자기회귀 생성기는 참조 사진, 스트리밍 오디오, 스트리밍 제어를 입력받아 단계마다 잠재 하나를 생성하며, 잠재당 세 번의 디퓨전 단계를 거친다. VAE는 시간을 8배 압축하므로 25fps에서 잠재 하나는 8프레임, 즉 720p 영상 320ms 분량이다. 오래된 잠재는 점차 낮은 해상도로 유지되어 긴 롤아웃도 감당 가능한 비용으로 이어진다. 그 결과 실시간으로 320ms 청크 단위로 720p를 출력하는 생성기가 만들어진다.

거기까지 도달하려면 대규모 양방향 다단계 확산 교사 모델로부터의 3단계 증류가 필요했다: 몇 단계짜리 학생 모델로의 Distribution Matching Distillation, 그 학생을 한 번에 하나의 잠재를 생성하는 자기회귀 모델로 바꾸기 위한 teacher forcing, 그리고 마지막으로 모델 자체가 생성한 이력에 대한 self-forcing과 함께, 긴 롤아웃이 표류하지 않도록 이력 프레임에 작용하는 추가 메커니즘을 사용한 훈련이다. 이 세 번째 단계가 바로 이런 부류의 모델이 흔히 갖는 실패 모드 — 몇 분 동안 이어지는 대화에서 얼굴이 저하되거나 배경이 서서히 흘러가는 문제 — 를 다룬다.

지연 시간 수치, 즉 진짜 제품 주장

오디오-투-비디오 설정에서 공개된 네 가지 스트리밍 확산 모델을 상대로, 각 모델이 음성과 참조 이미지를 받고 말하는 얼굴을 생성해야 하는 가운데, Griffin-Lite의 생성기는 H100s에서 평균 0.43초의 실제 오디오-투-비디오 지연 시간을 기록했습니다. 즉, 오디오 조각이 도착한 때부터 비디오가 그 효과를 보여주기까지의 시간입니다. Tavus는 이를 두 번째로 빠른 방법의 절반이라고 설명합니다. 또한 DOVER 및 FID 지각 품질과 토킹 헤드 평가 프레임워크인 THEval에서 1위를, LSE-C 립싱크 신뢰도에서는 7.27로 한 베이스라인에 뒤진 2위를 보고합니다 — 벤더는 LSE-C가 두드러진 입 움직임, 자연스러워 보이는 정도를 넘어선 움직임까지도 보상한다고 지적합니다.

그 모든 것은 Tavus가 선택한 기준선에 대한 Tavus 자체 측정치입니다. 구체적이라는 점, 그리고 0.43초라는 수치가 실제 테스트에서 검증될 수도, 그렇지 않을 수도 있는 종류의 숫자라는 점에서 유용합니다. 그것들은 독립적이지 않으며, 이 기사에서 유일하게 독립적인 점수는 위의 두 VideoFDB 트랙입니다.

A screenshot of Tavus's own Griffin announcement page at tavus.io/griffin, captured 2 October 2026: the heading "INTRODUCING GRIFFIN", the strapline "The First Human Interaction Model", the description of Griffin as the world's first Human Interaction Model that listens while watching expressions and pauses, and the byline "By: Hassaan Raza, Ioannis Patras, Head of Tavus Research Team".

왜 비교할 가격이 없나요?

Griffin-Lite는 오늘 일부 엄선된 얼리 테스터 그룹에게 연구 프리뷰로 제공되며, 더 뛰어난 모델의 더 폭넓은 출시가 뒤따를 예정입니다. 현재로서는 고객 사용 용도로 제공되지 않습니다. 접근은 신청 양식을 통해서만 가능합니다. Tavus 플랫폼에는 없으며, 발표문에서 회사가 직접 맺은 맺음말도 이를 분명히 밝힙니다: Griffin은 아직 Tavus 플랫폼에 없으며, Tavus가 이를 안전하게 출시하는 방법을 마련하면 제공될 것입니다. 구매자가 일반적으로 비교하는 모든 요소 — 초당 또는 요청당 가격, 모델 식별자, 요청 한도, SLA, 리전 목록 — 은 아직 존재하지 않습니다. Tavus는 오늘 바로 구축하려는 모든 이에게 이미 150,000명의 개발자와 기업이 사용 중인 모델들을 안내하며, 이는 Griffin이 아니라 세 가지 이전 모델입니다.

그것은 각주로 붙여 넘길 만한 기술적 사항이 아니다. 그것은 지금 당장 이 모델이 무엇을 위한 것인지를 바꾼다. 사람이 구별할 수 있는지에 제품이 좌우되는 팀들에게는 평가 대상이고, 벤더의 로드맵이 어디로 향하는지에 대한 신호다. 이번 분기에 고객 대면 경로를 구축할 기반으로 삼을 만한 것은 아니다.

안전 게이트는 릴리스 계획입니다.

Tavus가 Griffin에 대해 쓴 글에서 가장 흥미로운 점은 모델 자체에 관한 것이 아니다. 그것은 인간 상호작용 모델을 더 나은 인터페이스로 만들어 주는 바로 그 속성들이, 동시에 그것이 AI가 아니라고 믿게 속이는 데에도 더 뛰어나게 만든다는 인정이며, 안전한 출시 전에 추가적인 정렬(alignment) 및 안전 작업이 필요하고, 회사가 공개(disclosure) 기능을 개발 중이며 여러 기관과 AI 안전성 평가를 진행 중이라는 점이다. 실제 표본의 거의 절반이 구분하지 못했고, 구분한 사람들도 대부분 20초 안에 알아냈다는 점을 고려하면, 일상적인 대화에서도 통하는 공개 메커니즘은 있으면 좋은 선택적 기능이 아니다.

두 가지가 이 글을 실질적으로 바꿀 것입니다. 엔드포인트와 가격이 공개된 모델 카드가 나오면 Griffin은 연구 결과에서 조달 검토 사안으로 바뀔 것입니다. 그리고 독립적인 비디오 게시판에 항목이 올라오면 — 단, 그 게시판들은 짧은 클립을 쌍대 선호도로 평가하며 실시간 대화를 평가하도록 만들어지지 않았으므로, 이 불일치는 일시적이라기보다 영구적일 수 있다는 단서가 붙습니다 — 지연 시간과 품질 주장에 외부 검증을 제공할 것입니다. 그중 하나가 실현되기 전까지는 VideoFDB 트랙이 이용 가능한 가장 강력한 증거이며, 각각 0.09점과 0.47점의 인간 대비 격차를 동반합니다.

고려해 볼 만한 반론은 벤치마크 실행이 배포가 아니라는 점이다. NVIDIA의 프로토콜은 모든 시스템에 동일한 발언 순서 과제와 동일한 심판을 부여하지만, 통화가 아홉 시간째 이어질 때 어떻게 동작하는지, 두 사람이 꼬박 1분 동안 서로 말을 겹쳐 할 때 무슨 일이 일어나는지, 또는 참조 사진이 형편없이 렌더링한 얼굴에서 표현 제어가 저하되는지에 대해서는 아무것도 말해 주지 않는다. Tavus는 드리프트 특화 학습, 즉 셀프 포싱 단계와 히스토리 메커니즘을 바로 그 문제에 대한 해결책이라고 보고하며, Tavus 외부의 누군가가 장시간 세션을 실행해 공개하기 전까지 독자가 가질 수 있는 것은 보고서뿐이다. 벤치마크를 배포 결과로 취급하지 말고 이용 가능한 최선의 증거로 취급하라.

그동안 그 주변에 무엇을 만들어야 할까

오늘 이런 것을 원하는 팀이 당면한 실질적인 질문은 스택의 어떤 부분이 이미 구매 가능한가이다. 대화형 비디오 인터페이스는 하나의 사슬 — 음성 인식, 언어 모델, 음성 합성, 그리고 Tavus의 경우 렌더링 모델 — 이며, 앞의 세 가지는 범용 상품이다. 그것들은 OrcaRouter의 하나의 OpenAI 호환 엔드포인트 뒤에 있는데, 이 엔드포인트는 200개 이상의 모델을 동일한 키로 제공하고, 제공업체 정가를 0% 마크업으로 그대로 전달한다. 따라서 공급업체의 가격 인하는 계약 주기를 거친 뒤가 아니라 같은 날 여기에서 바로 적용된다. 상호작용 파이프라인을 구성하면서 Griffin 또는 그와 비슷한 것이 실제 제품이 될 때까지 생성 계층을 열어 두고 싶다면, 바로 그때 교체 비용은 마이그레이션이 아니라 설정 변경 한 번으로 끝난다. Tavus Griffin 자체는 여기서 라우팅되는 모델이 아니며, 요청 양식 뒤에 있는 프리뷰인 동안에는 그렇지도 않을 것이다.

주목할 만한 것은 또 하나의 데모 영상이 아니다. Tavus가 만들고 있는 공개 도구가 실제로 공개되는지, 그리고 제2의 연구 그룹이 대면 프로토콜을 재현하는지 여부다. 이 정도로 큰 규모의 튜링 테스트 통과는 제2의 연구소가 직접 실행해 검증해야 하는 바로 그런 종류의 결과다.

An explainer scoreboard for Tavus Griffin with six rows: Status: research preview; Pricing: none published; Model type: human interaction model; VideoFDB generation: 3.83 of 5; VideoFDB perception: 3.73 of 5; Open issue: disclosure. Footer: "NVIDIA VideoFDB per Tavus and NVIDIA, September 2026." The OrcaRouter logo is composited bottom-right.