Thẻ tiêu đề hero cho Tavus Griffin, với phụ đề “Mô hình Tương tác Con người đầu tiên — công bố ngày 1 tháng 10 năm 2026”, phía trên ba chip ghi “48% nghĩ đó là người thật”, “Tạo VideoFDB: 3,83 so với mốc tham chiếu con người 3,92” và “độ trễ từ âm thanh sang video 0,43 giây”. Chân trang: “Mọi số liệu do nhà cung cấp và NVIDIA báo cáo; Griffin-Lite là bản xem trước nghiên cứu, chưa được phát hành rộng rãi.” Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Tavus Griffin: Mô hình Tương tác Con người đầu tiên và 48% đã vượt qua Bài kiểm tra Turing qua Video

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mươi sáu trong số năm mươi tư người đã hoàn thành một cuộc gọi video kéo dài một phút và nói rằng người đối thoại của họ là người thật. Đó là con số mà Tavus đang đưa lên hàng đầu cho Tavus Griffin, được công bố vào ngày 1 tháng 10 năm 2026, và đó thực sự là một kết quả gây ấn tượng mạnh: theo cùng một giao thức, ngăn xếp trước đây của công ty — Phoenix-4.5 kết xuất khuôn mặt, Raven-1 đảm nhiệm việc nhận biết, Sparrow-2 quản lý động lực lượt nói — chỉ có một trong bốn mươi mốt người tin, tức 2,4%. Hai cách diễn giải hiển nhiên về bước nhảy vọt đó đều sai, và việc tách bạch chúng là phần lớn nội dung tiếp theo. Griffin không phải là một công cụ avatar tốt hơn, và nó cũng không phải là một sản phẩm bạn có thể mua. Đó là một bản xem trước nghiên cứu có tên Griffin-Lite, mở cho một số người thử nghiệm đáng tin cậy được chọn lọc, không có bảng giá, không có API công khai và không có tên trên bất kỳ bảng xếp hạng video độc lập nào. Việc cả hai điều đó cùng đúng một lúc chính là câu chuyện thực sự.

Những gì 48% đo lường, và những gì nó không đo lường

Nghiên cứu này là một bài kiểm tra Turing mặt đối mặt chứ không phải một khảo sát sở thích, và quy trình đáng được nêu chính xác vì nó là tuyên bố trụ cột. Năm mươi tư người tham gia được tuyển qua một nền tảng nghiên cứu độc lập và được thông báo rằng họ sẽ được ghép với một người tham gia khác cho một cuộc gọi video một phút về điều họ mong chờ trong năm nay. Đối tác của họ là một PAL đang chạy Griffin-Lite, tạo khuôn mặt, giọng nói và phản hồi theo thời gian thực. Chỉ đến cuối khảo sát, họ mới được hỏi liệu họ có từng thoáng nghĩ rằng đối tác có thể không phải là người thật hay không, và sau đó mọi người tham gia đều được thông báo đó là AI. Lần chạy đối chứng sử dụng cùng quy trình trên ngăn xếp cũ hơn, với bốn mươi mốt người tham gia.

Các số liệu hỗ trợ quan trọng không kém phần tiêu đề. Những người tin thì tự tin — trung bình 79% — và những người hoài nghi cũng vậy, ở mức 81%, đúng như một nghiên cứu mong muốn: không ai đoán mò. Hơn một nửa số người tham gia cho biết khả năng đó hoàn toàn chưa từng thoáng qua đầu họ trong cuộc gọi, và gần như toàn bộ nhóm đó nói tiếp rằng người bạn đàm thoại là thật. Những người tham gia thực sự nghi ngờ thì thường nghi ngờ trong vòng hai mươi giây đầu tiên. Đó là dòng khó chịu nhất trong báo cáo và là dòng nên định hình cách bạn đọc phần an toàn ở phần sau.

Trên thang điểm bảy, mô hình đạt trung bình 5,4 về việc có vẻ tự nhiên, 5,6 về việc có vẻ đáng tin cậy, 5,8 về việc liệu những người tham gia có thích trò chuyện với nó lần nữa không — một điểm số vẫn giữ ở mức 5,4 ngay cả trong số những người tham gia đã xác định đúng nó là AI — và 5,5 về việc liệu họ có cảm thấy đối tác của mình thực sự đang lắng nghe không. Điểm thấp nhất là 4,9, về việc cuộc trò chuyện có diễn ra tự nhiên không. Đọc như một tập hợp, đó là một hồ sơ cụ thể: Griffin-Lite thuyết phục trong từng khoảnh khắc và hơi kém thuyết phục hơn khi xét như một mạch truyện.

Điểm chuẩn độc lập và cách đọc hai nhánh của nó

Các con số về chất lượng đến từ VideoFDB của NVIDIA, một bộ chuẩn đánh giá cho hội thoại âm thanh-hình ảnh song công toàn phần, chấm điểm một mô hình trên hai hạng mục riêng biệt — tạo sinh, nghĩa là liệu mô hình có tạo ra hành vi đúng hay không, và nhận thức, nghĩa là liệu nó có hiểu được thời điểm hay không — mỗi hạng mục có tiêu chí đánh giá riêng và bảng xếp hạng riêng. NVIDIA đã xây dựng bộ chuẩn này, tiến hành đánh giá bằng giám khảo của riêng mình dựa trên các chỉ số đã công bố, và chấm điểm phản hồi theo thang điểm từ 0 đến 5. Tavus không chạy nó, và đó chính là lý do để trích dẫn nó.

• Tạo sinh — Griffin-Lite đạt 3,83, hệ thống được công bố có điểm cao tiếp theo đạt 2,80 (Gemini 2.5 với Anam), và tham chiếu chuẩn đối chiếu của con người là 3,92. Con số đó dẫn trước hệ thống tương đương tốt nhất 1,03 điểm và thấp hơn con người 0,09 điểm.

• Nhận thức — 3.73 so với mức tham chiếu của con người là 4.20, với 3.44 cho baseline mạnh nhất được báo cáo, MiniCPM-o 4.5 trong cấu hình chỉ âm thanh. Gemini 2.5 Flash Native đạt 3.17 và gpt-realtime của OpenAI đạt 2.97.

• Căn chỉnh tỷ lệ tiếp quản — 62,8% ở phần tạo và 73,8% ở phần nhận thức. Chỉ số này đo mức độ khớp giữa các quyết định của mô hình về thời điểm nên nói với thời điểm trong các cuộc hội thoại tham chiếu, và Tavus mô tả cả hai là mức cao nhất so với bất kỳ hệ thống nào trên bảng xếp hạng.

Hai lưu ý cần đi kèm với những con số đó trước khi bất kỳ ai lặp lại chúng. Khoảng cách thế hệ so với con người là 0,09 trên thang năm điểm do một mô hình ngôn ngữ đánh giá, nên được hiểu là “gần với con người theo tiêu chí đánh giá này” hơn là “đạt trình độ con người”. Và so sánh về nhận thức không phải là so sánh tương đương: MiniCPM-o 4.5 và gpt-realtime được chấm điểm trong các cấu hình chỉ có âm thanh, trong khi Griffin cũng đọc video. Mức dẫn trước 0,29 điểm so với đường cơ sở chỉ có âm thanh là thật, nhưng một phần điều mà nó đo lường là giá trị của việc có mắt.

Dòng tóm tắt của chính nhà cung cấp — đứng đầu trong bài kiểm tra độc lập của NVIDIA về AI giao tiếp trực tiếp, dẫn trước AI tốt thứ hai 37% về khả năng phản ứng tức thời — là cách mô tả cùng một dữ liệu chứ không phải một phát hiện riêng. Hãy giữ điểm số theo hạng mục cơ bản, không giữ cách đóng khung.

A screenshot of NVIDIA's VideoFDB project page, captured 2 October 2026: the heading "VideoFDB — Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents", the note that it is the first benchmark for full-duplex audio-visual-to-audio-visual conversation, the author list (Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini De Mello) credited to NVIDIA, links to leaderboard, paper and Hugging Face dataset, and an abstract arguing that natural conversation is full-duplex.

Hai động cơ, chạy cùng một lúc

Tuyên bố về kiến trúc dễ đánh giá hơn so với hoạt động tiếp thị xung quanh nó, bởi vì đó là một tuyên bố về những gì chạy đồng thời. Griffin được mô tả là hai hệ thống hoạt động song song thay vì một pipeline chuyển giao giữa các giai đoạn.

Đầu tiên là một engine Continuous Conversational Modeling (mô hình hội thoại liên tục). Nó tiếp nhận âm thanh và hình ảnh của người đối diện rồi đánh giá lại cuộc trao đổi theo những khoảng đều đặn dưới một giây — Tavus gọi đó là các mini-turn — để ở mỗi mốc quyết định xem nên im lặng, phát tín hiệu, đáp tín hiệu (backchannel), hay giành lượt nói. Đầu ra không chỉ là lời nói mà còn là một tập các thông số điều khiển biểu cảm mang theo thời điểm, thái độ, nét mặt và cử chỉ. Điểm mấu chốt của thiết kế này là một quyết định đưa ra ngay giữa câu sẽ hiện lên trong giọng nói và gương mặt trong cùng mini-turn đó, thay vì sau một lần bàn giao lượt — chính điều này cho phép mô hình dừng lại khi bị ngắt lời, gật đầu trong lúc đang nghe, và coi một quãng ngừng để suy nghĩ là điều gì đó không phải dấu chấm hết cho lượt nói.

Thứ hai là một cỗ máy tạo sinh nghe-nhìn, biến những điều khiển đó thành âm thanh và điểm ảnh cùng lúc: một bộ tạo giọng nói theo luồng và một bộ tạo video theo luồng được dẫn dắt bởi cùng những tín hiệu, để một thay đổi về giọng điệu và một thay đổi về biểu cảm cùng rơi vào một nhịp.

Một lưu ý trung thực về tài liệu mà Tavus công bố kèm theo nội dung này, vì rất dễ nhầm đó là số liệu đo lường. Sơ đồ tương tác về một cuộc trao đổi kéo dài chín giây được chú thích ngay trong phần văn bản của trang là chỉ mang tính minh họa và nói rõ rằng không được đo từ một phiên thực tế. Lưu ý tương tự cũng áp dụng cho biểu đồ thời gian so sánh lượt luân phiên với song công toàn phần. Thứ được đo là con số độ trễ ở phần dưới.

Bên trong ngăn xếp phát trực tuyến

Phần âm thanh được xây dựng xung quanh một codec gọi là Tavec, một bộ tự mã hóa tích chập ánh xạ âm thanh 48 kHz thành một latent liên tục gồm 40 giá trị mỗi khung ở tốc độ 100 khung mỗi giây, không có codebook. Bộ giải mã của nó hoàn toàn nhân quả, vì vậy nó mang trạng thái qua các đoạn và phát ra các gói âm thanh nhỏ tới 10 ms mà không cần nhìn trước. Một phút giọng nói là 6.000 khung latent thay vì 2,88 triệu mẫu thô, đó là điều khiến chuỗi trở nên nhẹ đủ để speech transformer dự đoán nhanh hơn thời gian thực. Bản thân bộ sinh giọng nói là một diffusion transformer tự hồi quy điều kiện trên một tiền tố người nói đã được mã hóa — một giọng nói có thể được nhân bản từ khoảng mười giây âm thanh — và tạo ra từng đoạn latent một khi các điều khiển đến, vì vậy việc phát lại bắt đầu trước khi phát ngôn kết thúc.

Phía video bắt đầu từ cùng một tiền đề: nén thời gian mạnh là yếu tố khiến một mô hình khuếch tán đủ nhanh để duy trì một cuộc trò chuyện. Một bộ sinh tự hồi quy vài bước nhận một ảnh tham chiếu, âm thanh dạng luồng và các điều khiển dạng luồng, rồi tạo ra một latent mỗi bước với ba bước khuếch tán cho mỗi latent. Một VAE nén thời gian tám lần, nên ở 25 fps, một latent là tám khung hình, tức 320 ms video 720p. Các latent cũ hơn được giữ ở độ phân giải thấp dần để các đợt sinh dài vẫn khả thi về chi phí. Kết quả là một bộ sinh phát ra 720p theo từng khối 320 ms trong thời gian thực.

Để đạt được điều đó cần một quá trình chưng cất ba giai đoạn từ một teacher khuếch tán nhiều bước, hai chiều, quy mô lớn: Chưng cất Khớp Phân phối (Distribution Matching Distillation) thành một student ít bước, teacher forcing để chuyển student đó thành một mô hình tự hồi quy sinh ra từng latent một, và cuối cùng là huấn luyện với self-forcing trên chính lịch sử do mô hình sinh ra, cùng một cơ chế bổ sung tác động lên các khung hình trong lịch sử để những chuỗi triển khai dài không bị trôi dạt. Giai đoạn thứ ba chính là giai đoạn xử lý chế độ thất bại mà loại mô hình này thường mắc phải — một khuôn mặt bị suy giảm chất lượng, hoặc một phông nền dần trôi đi, qua một cuộc trò chuyện kéo dài hàng phút.

Con số độ trễ, vốn mới là tuyên bố sản phẩm thực sự.

Trong bối cảnh so sánh với bốn mô hình khuếch tán streaming đã công bố trong thiết lập âm thanh-sang-video, nơi mỗi mô hình nhận giọng nói và một ảnh tham chiếu và phải tạo ra khuôn mặt đang nói, bộ tạo của Griffin-Lite đạt độ trễ âm thanh-sang-video thực sự trung bình 0,43 giây trên H100 — thời gian từ khi một đoạn âm thanh đến cho đến khi video thể hiện hiệu ứng của nó. Tavus mô tả đó là một nửa so với phương pháp nhanh thứ hai. Nó cũng báo cáo vị trí đầu tiên về chất lượng cảm nhận DOVER và FID và trên THEval, một framework đánh giá talking-head, và vị trí thứ hai về độ tin cậy đồng bộ môi LSE-C ở mức 7,27, sau một baseline — với nhà cung cấp lưu ý rằng LSE-C thưởng cho chuyển động miệng rõ rệt, bao gồm cả chuyển động vượt quá điểm trông tự nhiên.

Tất cả những con số đó đều là các phép đo của chính Tavus so với những đường cơ sở mà nó tự chọn. Chúng hữu ích vì chúng cụ thể và vì con số 0,43 giây là kiểu số liệu mà hoặc sẽ đứng vững trong một bài kiểm tra trực tiếp, hoặc sẽ không. Chúng không độc lập, và những điểm số độc lập duy nhất trong bài viết này là hai track VideoFDB ở trên.

A screenshot of Tavus's own Griffin announcement page at tavus.io/griffin, captured 2 October 2026: the heading "INTRODUCING GRIFFIN", the strapline "The First Human Interaction Model", the description of Griffin as the world's first Human Interaction Model that listens while watching expressions and pauses, and the byline "By: Hassaan Raza, Ioannis Patras, Head of Tavus Research Team".

Tại sao không có giá để so sánh

Griffin-Lite hiện có sẵn cho một nhóm người thử nghiệm sớm được chọn lọc dưới dạng bản xem trước nghiên cứu, và sẽ có bản phát hành rộng rãi hơn của một mô hình có năng lực cao hơn sau đó. Hiện tại, nó sẽ không khả dụng để khách hàng sử dụng. Việc truy cập được thực hiện bằng biểu mẫu yêu cầu. Nó không có trên nền tảng Tavus, và dòng kết thúc của chính công ty trong thông báo cũng nói rõ điều đó: Griffin hiện chưa có trên nền tảng Tavus, và sẽ xuất hiện khi Tavus tìm ra cách phát hành nó một cách an toàn. Mọi thứ mà người mua thường so sánh — giá theo giây hoặc theo yêu cầu, mã định danh mô hình, giới hạn tốc độ, SLA, danh sách khu vực — vẫn chưa tồn tại. Tavus hướng bất kỳ ai muốn xây dựng ngay hôm nay đến các mô hình mà 150.000 nhà phát triển và doanh nghiệp đã sử dụng, tức là ba mô hình tiền nhiệm, không phải Griffin.

Đó không phải là một chi tiết kỹ thuật để hạ xuống thành chú thích. Nó thay đổi mục đích của mô hình này ngay lúc này. Nó là một mục tiêu đánh giá cho những đội ngũ mà sản phẩm phụ thuộc vào việc một người có thể phân biệt được hay không, và là một tín hiệu về việc lộ trình của nhà cung cấp đang hướng tới đâu. Đây không phải là thứ để xây dựng một lộ trình hướng tới khách hàng trong quý này.

Cổng an toàn chính là kế hoạch phát hành

Điều thú vị nhất mà Tavus viết về Griffin không phải là về mô hình. Đó là sự thừa nhận rằng chính những đặc tính khiến một mô hình tương tác với con người trở thành một giao diện tốt hơn cũng khiến nó giỏi hơn trong việc lừa ai đó tin rằng nó không phải là AI, rằng cần phải có thêm công việc căn chỉnh và an toàn trước khi phát hành an toàn, và rằng công ty đang xây dựng các tính năng tiết lộ và phối hợp với các tổ chức về đánh giá an toàn AI. Xét rằng gần một nửa số người trong một mẫu trực tiếp không thể nhận ra, và những người nhận ra thì phần lớn đều phát hiện trong vòng hai mươi giây, một cơ chế tiết lộ có thể trụ được qua một cuộc trò chuyện thông thường không phải là thứ chỉ có thì tốt.

Hai điều sẽ làm thay đổi bài viết này một cách đáng kể. Một model card được công bố có endpoint và mức giá sẽ đưa Griffin từ kết quả nghiên cứu thành câu hỏi mua sắm. Và một mục trên một bảng xếp hạng video độc lập — với lưu ý rằng các bảng đó chấm điểm các clip ngắn bằng so sánh cặp và không được thiết kế để chấm điểm một cuộc trò chuyện trực tiếp, nên sự không khớp có thể là vĩnh viễn thay vì tạm thời — sẽ mang lại cho các tuyên bố về độ trễ và chất lượng một sự kiểm chứng từ bên ngoài. Cho đến khi một trong những điều đó thành hiện thực, các track của VideoFDB là bằng chứng mạnh nhất hiện có và chúng đi kèm với khoảng cách con người lần lượt là 0.09 và 0.47 điểm.

Lập luận phản bác đáng cân nhắc là một lần chạy benchmark không phải là một bản triển khai. Quy trình của NVIDIA cho mọi hệ thống cùng một tác vụ luân phiên lượt nói và cùng một giám khảo; nó không nói gì về việc giờ thứ chín của một cuộc gọi diễn ra thế nào, điều gì xảy ra khi hai người nói chồng lên nhau suốt cả một phút, hay liệu các điều khiển biểu cảm có xuống cấp trên một khuôn mặt mà bức ảnh tham chiếu tái tạo kém hay không. Tavus báo cáo quá trình huấn luyện chuyên biệt cho độ trôi — giai đoạn self-forcing và cơ chế lịch sử — là giải pháp cho đúng vấn đề đó, và các báo cáo là tất cả những gì người đọc có được cho đến khi ai đó bên ngoài Tavus chạy một phiên dài và công bố nó. Hãy coi benchmark là bằng chứng tốt nhất hiện có, chứ không phải là kết quả triển khai.

Xây dựng gì xung quanh nó trong lúc chờ đợi

Câu hỏi thực tế đối với một nhóm muốn có thứ như thế này ngay hôm nay là những phần nào của stack đã sẵn sàng để mua. Một giao diện video hội thoại là một chuỗi — nhận dạng giọng nói, một mô hình ngôn ngữ, tổng hợp giọng nói, và trong trường hợp của Tavus là một mô hình kết xuất — và ba phần đầu tiên thì đã là hàng phổ thông. Chúng nằm sau một endpoint tương thích OpenAI tại OrcaRouter với hơn 200 mô hình dùng chung một key và giá niêm yết của nhà cung cấp được chuyển tiếp với mức markup 0%, nên việc nhà cung cấp giảm giá sẽ có hiệu lực ở đây ngay trong cùng ngày thay vì phải chờ hết một chu kỳ hợp đồng. Nếu bạn đang lắp ghép một pipeline tương tác và muốn giữ lớp tạo sinh luôn mở cho đến khi Griffin hay một thứ tương tự trở thành sản phẩm thực sự, thì đó chính là chỗ mà việc hoán đổi chỉ tốn một thay đổi cấu hình thay vì một cuộc di trú. Bản thân Tavus Griffin không phải là một mô hình được định tuyến ở đây, và sẽ không phải như vậy khi nó còn là bản xem trước nằm sau một biểu mẫu yêu cầu.

Điều đáng để theo dõi không phải là một video demo khác. Mà là liệu bộ công cụ tiết lộ mà Tavus đang xây dựng có được công bố hay không, và liệu một nhóm nghiên cứu thứ hai có tái lập được giao thức mặt đối mặt hay không. Một lần vượt qua Turing test lớn đến vậy đúng là kiểu kết quả cần một phòng thí nghiệm thứ hai chạy lại nó.

An explainer scoreboard for Tavus Griffin with six rows: Status: research preview; Pricing: none published; Model type: human interaction model; VideoFDB generation: 3.83 of 5; VideoFDB perception: 3.73 of 5; Open issue: disclosure. Footer: "NVIDIA VideoFDB per Tavus and NVIDIA, September 2026." The OrcaRouter logo is composited bottom-right.