Główna karta tytułowa dla Tavus Griffin, z podtytułem „pierwsza interakcja z człowiekiem — ogłoszona 1 października 2026”, nad chipami o treści „48% uznało, że to prawdziwa osoba”, „Generowanie VideoFDB: 3,83 wobec 3,92 dla referencji człowieka” i „opóźnienie audio-wideo 0,43 s”. Stopka: „Wszystkie wartości podane przez dostawcę i NVIDIA; Griffin-Lite to badawcza wersja zapoznawcza, ogólnie niedostępna.” Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

Tavus Griffin: Pierwszy model interakcji z człowiekiem i 48%, które przeszło test Turinga na wideo

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwadzieścia sześć z pięćdziesięciu czterech osób ukończyło jednominutową rozmowę wideo i stwierdziło, że ich rozmówca był prawdziwym człowiekiem. To liczba, którą Tavus wysuwa na pierwszy plan w przypadku Tavus Griffin, ogłoszonego 1 października 2026 roku, i jest to naprawdę uderzający wynik: przy tym samym protokole poprzedni stos technologiczny firmy — Phoenix-4.5 renderujący twarz, Raven-1 odpowiadający za percepcję, Sparrow-2 zarządzający dynamiką tur — dał jedną przekonaną osobę na czterdzieści jeden, czyli 2,4%. Dwa oczywiste odczytania tego skoku są oba błędne, a ich rozdzielenie to większość tego, co następuje. Griffin nie jest lepszym silnikiem awatarów i nie jest produktem, który można kupić. To podgląd badawczy o nazwie Griffin-Lite, otwarty dla wybranych zaufanych testerów, bez cennika, bez publicznego API i bez pozycji w jakimkolwiek niezależnym rankingu wideo. To, że obie te rzeczy są prawdziwe jednocześnie, jest sednem tej historii.

Co mierzy 48%, a czego nie

Badanie to test Turinga twarzą w twarz, a nie ankieta preferencji, a protokół warto przytoczyć dokładnie, ponieważ to on stanowi kluczowe twierdzenie. Pięćdziesięciu czterech uczestników zrekrutowano przez niezależną platformę badawczą i poinformowano, że zostaną dopasowani do innego uczestnika na jednominutową rozmowę wideo o tym, na co czekają w tym roku. Ich partnerem był PAL działający na Griffin-Lite, generujący twarz, głos i odpowiedzi w czasie rzeczywistym. Dopiero na końcu ankiety zapytano ich, czy przyszło im do głowy, że partner może nie być prawdziwą osobą, a każdemu uczestnikowi powiedziano następnie, że to AI. W przebiegu porównawczym zastosowano ten sam protokół na starszym stosie, z czterdziestoma jeden uczestnikami.

Liczby uzupełniające mają takie samo znaczenie jak nagłówek. Wierzący byli pewni — średnio 79% — podobnie jak wątpiący, na poziomie 81%, czego właśnie chce badanie: nikt nie zgadywał. Ponad połowa uczestników stwierdziła, że ta możliwość w ogóle nie przyszła im do głowy podczas rozmowy, a niemal wszyscy z tej grupy uznali następnie, że partner był prawdziwy. Uczestnicy, którzy jednak podejrzewali, zwykle zaczynali podejrzewać w ciągu pierwszych dwudziestu sekund. To najmniej komfortowe zdanie w raporcie i to, które powinno kształtować sposób, w jaki czytasz późniejszą sekcję o bezpieczeństwie.

W siedmiopunktowej skali model uzyskał średnio 5,4 za sprawianie wrażenia naturalnego, 5,6 za sprawianie wrażenia godnego zaufania, 5,8 w kwestii tego, czy uczestnicy z przyjemnością rozmawialiby z nim ponownie — wynik ten utrzymał się na poziomie 5,4 nawet wśród uczestników, którzy prawidłowo rozpoznali go jako AI — oraz 5,5 w kwestii tego, czy czuli, że ich rozmówca naprawdę słucha. Najniższy wynik wyniósł 4,9 za to, czy rozmowa płynęła naturalnie. Odczytane razem, to konkretny profil: Griffin-Lite jest przekonujący w pojedynczych momentach, ale nieco mniej przekonujący jako całość.

Niezależny benchmark i jak odczytywać jego dwie ścieżki

Liczby dotyczące jakości pochodzą z VideoFDB firmy NVIDIA — benchmarku do pełnodupleksowej rozmowy audiowizualnej, który ocenia model w dwóch osobnych torach: generowaniu, czyli tym, czy model wytwarza właściwe zachowanie, oraz percepcji, czyli tym, czy rozumie daną chwilę — każdy z własnymi kryteriami oceny i własnym rankingiem. NVIDIA stworzyła ten benchmark, przeprowadza ocenę za pomocą własnego sędziego według opublikowanych metryk i punktuje odpowiedź w skali od zera do pięciu. Tavus go nie przeprowadził, co jest powodem, by go cytować.

• Generowanie — Griffin-Lite uzyskał 3,83, kolejny najwyżej oceniony opublikowany system uzyskał 2,80 (Gemini 2.5 z Anam), a ludzki wynik referencyjny ground truth to 3,92. To 1,03 punktu przewagi nad najlepszym porównywalnym systemem i 0,09 punktu poniżej wyniku człowieka.

• Percepcja — 3,73 w porównaniu z referencją ludzką 4,20, przy 3,44 dla najsilniejszego raportowanego wyniku bazowego, MiniCPM-o 4.5 w konfiguracji wyłącznie audio. Gemini 2.5 Flash Native uzyskał 3,17, a gpt-realtime od OpenAI — 2,97.

• Dopasowanie wskaźnika przejmowania głosu — 62,8% w generowaniu i 73,8% w percepcji. Mierzy ono, jak ściśle decyzje modelu o tym, kiedy zabrać głos, pokrywają się z rozkładem czasowym wypowiedzi w rozmowach referencyjnych, a Tavus opisuje oba te wyniki jako najwyższe spośród wszystkich systemów w rankingu.

Do tych liczb należą dwa zastrzeżenia, zanim ktokolwiek je powtórzy. Luka generacyjna względem człowieka wynosi 0,09 w pięciopunktowej skali ocenianej przez model językowy, co lepiej odczytywać jako „blisko człowieka w tej rubryce” niż jako „na poziomie człowieka”. A porównanie percepcji nie jest porównaniem jak do jak: MiniCPM-o 4.5 i gpt-realtime są oceniane w konfiguracjach wyłącznie audio, podczas gdy Griffin analizuje również wideo. Przewaga 0,29 punktu nad bazą wyłącznie audio jest realna, ale część tego, co mierzy, to wartość posiadania oczu.

Własne podsumowanie dostawcy — pierwsze miejsce w niezależnym teście AI w bezpośredniej konfrontacji firmy NVIDIA, o 37% przed kolejnym najlepszym AI pod względem natychmiastowego reagowania — jest charakterystyką tych samych danych, a nie odrębnym ustaleniem. Zachowaj bazowe wyniki torów, a nie sposób ich przedstawienia.

A screenshot of NVIDIA's VideoFDB project page, captured 2 October 2026: the heading "VideoFDB — Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents", the note that it is the first benchmark for full-duplex audio-visual-to-audio-visual conversation, the author list (Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini De Mello) credited to NVIDIA, links to leaderboard, paper and Hugging Face dataset, and an abstract arguing that natural conversation is full-duplex.

Dwa silniki, pracujące w tym samym czasie

Teza architektoniczna jest łatwiejsza do oceny niż marketing wokół niej, ponieważ dotyczy tego, co działa współbieżnie. Griffin jest opisywany jako dwa systemy pracujące równolegle, a nie jako potok przekazujący zadania między etapami.

Pierwszym jest silnik Continuous Conversational Modeling. Wczytuje on dźwięk i obraz rozmówcy oraz w regularnych odstępach krótszych niż sekunda ponownie ocenia wymianę — Tavus nazywa je mini-turami — decydując przy każdej z nich, czy milczeć, sygnalizować, wtrącać sygnał zwrotny, czy przejmować turę. Wynikiem nie są wyłącznie słowa, ale zestaw elementów sterujących ekspresją, które niosą ze sobą wyczucie czasu, postawę, mimikę twarzy i gesty. Istotą tego projektu jest to, że decyzja podjęta w połowie zdania pojawia się w głosie i na twarzy w ramach tej samej mini-tury, a nie dopiero po przekazaniu tury, co pozwala modelowi zatrzymać się, gdy zostanie przerwany, kiwnąć głową, słuchając, i potraktować pauzę na zastanowienie jako coś innego niż koniec tury.

Drugi to silnik generowania audio-wizualnego, który zamienia te elementy sterujące w dźwięk i piksele jednocześnie: strumieniowy generator mowy i strumieniowy generator wideo napędzane tymi samymi sygnałami, dzięki czemu zmiana tonu i zmiana wyrazu trafiają w ten sam rytm.

Jedna uwaga dotycząca rzetelności odnośnie materiału, który Tavus opublikował wraz z tym, ponieważ łatwo byłoby pomylić go z pomiarem. Interaktywny diagram dziewięciosekundowej wymiany jest opatrzony w samym tekście strony adnotacją, że ma charakter ilustracyjny i wyraźnie nie został zmierzony na podstawie rzeczywistej sesji. To samo zastrzeżenie dotyczy wykresu czasowego porównującego tryb turowy z pełnym dupleksem. Tym, co zostało zmierzone, jest podana niżej wartość opóźnienia.

Wewnątrz stosu streamingu

Część audio opiera się na kodeku o nazwie Tavec, konwolucyjnym autoenkoderze, który mapuje dźwięk 48 kHz na ciągły wektor latentny o 40 wartościach na ramkę przy 100 ramkach na sekundę, bez słowników kodowych. Jego dekoder jest w pełni przyczynowy, więc przenosi stan między fragmentami i emituje pakiety audio o długości zaledwie 10 ms bez wyprzedzenia. Minuta mowy to 6 000 latentnych ramek, a nie 2,88 miliona surowych próbek, co sprawia, że sekwencja jest wystarczająco tania, aby transformer mowy mógł przewidywać szybciej niż w czasie rzeczywistym. Sam generator mowy to autoregresyjny transformer dyfuzyjny, który warunkuje się na zakodowanym prefiksie mówcy — głos można sklonować na podstawie około dziesięciu sekund dźwięku — i generuje jeden fragment latentny na raz, gdy pojawiają się elementy sterujące, więc odtwarzanie rozpoczyna się, zanim wypowiedź zostanie ukończona.

Strona wideo wychodzi z tego samego założenia: silna kompresja czasowa sprawia, że model dyfuzyjny jest wystarczająco szybki, by podtrzymać rozmowę. Kilkukrokowy generator autoregresyjny pobiera zdjęcie referencyjne, strumieniowe audio i strumieniowe elementy sterujące, a następnie tworzy jedną reprezentację utajoną na krok przy trzech krokach dyfuzji na reprezentację utajoną. VAE kompresuje czas ośmiokrotnie, więc przy 25 fps jedna reprezentacja utajona to osiem klatek, czyli 320 ms wideo 720p. Starsze reprezentacje utajone są przechowywane w coraz niższej rozdzielczości, aby długie serie generowania pozostawały opłacalne. Wynikiem jest generator, który emituje 720p w porcjach po 320 ms w czasie rzeczywistym.

Dotarcie do tego wymagało trzystopniowej destylacji z dużego, dwukierunkowego, wielokrokowego nauczyciela dyfuzyjnego: Distribution Matching Distillation do kilkukrokowego studenta, teacher forcing, aby przekształcić tego studenta w model autoregresyjny generujący jeden latent naraz, a na końcu treningu z self-forcing na własnej historii wygenerowanej przez model oraz dodanego mechanizmu działającego na klatkach historii, tak aby długie rollouts nie dryfowały. To właśnie ten trzeci etap rozwiązuje typowy dla tej klasy modeli tryb awarii — twarz, która się degraduje, albo tło, które powoli wędruje, podczas rozmowy trwającej wiele minut.

Liczba opóźnienia, która jest rzeczywistą obietnicą produktu

W porównaniu z czterema opublikowanymi strumieniowymi modelami dyfuzyjnymi w scenariuszu audio-to-video, gdzie każdy model otrzymuje mowę i obraz referencyjny i musi wygenerować mówiącą twarz, generator Griffin-Lite osiągał średnio 0,43 sekundy rzeczywistego opóźnienia audio-to-video na H100s — czas od nadejścia fragmentu audio do pokazania jego efektu w wideo. Tavus określa to jako połowę czasu najszybszej alternatywnej metody. Firma podaje również pierwsze miejsce w zakresie jakości percepcyjnej DOVER i FID oraz w THEval, frameworku do oceny talking-head, a drugie w zakresie pewności synchronizacji ust LSE-C na poziomie 7,27, za jednym rozwiązaniem bazowym — przy czym dostawca zauważa, że LSE-C nagradza wyraźny ruch ust, w tym ruch wykraczający poza punkt, w którym wygląda to naturalnie.

Wszystkie te pomiary to własne pomiary Tavus względem wybranych przez siebie punktów odniesienia. Są przydatne, ponieważ są konkretne i ponieważ wartość 0,43 sekundy to taki rodzaj liczby, która albo obroni się w teście na żywo, albo nie. Nie są niezależne, a jedynymi niezależnymi wynikami w tym artykule są dwa tracki VideoFDB powyżej.

A screenshot of Tavus's own Griffin announcement page at tavus.io/griffin, captured 2 October 2026: the heading "INTRODUCING GRIFFIN", the strapline "The First Human Interaction Model", the description of Griffin as the world's first Human Interaction Model that listens while watching expressions and pauses, and the byline "By: Hassaan Raza, Ioannis Patras, Head of Tavus Research Team".

Dlaczego nie ma ceny do porównania

Griffin-Lite jest dostępny od dziś dla wybranej grupy wczesnych testerów jako podgląd badawczy, a szersze wydanie bardziej zaawansowanego modelu ma nastąpić później. W tym momencie nie będzie dostępny do użytku przez klientów. Dostęp odbywa się poprzez formularz zgłoszeniowy. Nie ma go na platformie Tavus, a sama firma w zakończeniu ogłoszenia mówi to wprost: Griffin nie jest jeszcze na platformie Tavus i pojawi się, gdy Tavus opracuje, jak bezpiecznie go wydać. Wszystko, co nabywca normalnie by porównywał — ceny za sekundę lub za żądanie, identyfikator modelu, limity szybkości, SLA, lista regionów — jeszcze nie istnieje. Tavus kieruje każdego, kto chce budować już dziś, do modeli, z których korzysta już 150 000 programistów i firm, a są to trzy poprzednie modele, a nie Griffin.

To nie jest szczegół techniczny, który można zepchnąć do przypisu. To zmienia, do czego ten model służy w tej chwili. Jest celem oceny dla zespołów, których produkt zależy od tego, czy człowiek potrafi to odróżnić, oraz sygnałem tego, dokąd zmierza mapa drogowa dostawcy. Nie jest to coś, na czym w tym kwartale należy budować ścieżkę skierowaną do klientów.

Brama bezpieczeństwa to plan wydania

Najciekawsze, co Tavus napisał o Griffinie, nie dotyczy samego modelu. To przyznanie, że te same właściwości, które czynią model interakcji z człowiekiem lepszym interfejsem, czynią go również lepszym w oszukiwaniu kogoś, by uwierzył, że nie jest AI, że przed bezpiecznym wydaniem wymagana jest dalsza praca nad alignmentem i bezpieczeństwem oraz że firma pracuje nad funkcjami ujawniania i współpracuje z organizacjami przy ocenach bezpieczeństwa AI. Biorąc pod uwagę, że prawie połowa próby na żywo nie potrafiła tego rozpoznać, a ci, którzy potrafili, w większości domyślili się w ciągu dwudziestu sekund, mechanizm ujawniania, który przetrwa swobodną rozmowę, nie jest miłym dodatkiem.

Dwie rzeczy istotnie zmieniłyby ten artykuł. Opublikowana karta modelu z endpointem i ceną przeniosłaby go z wyniku badań do kwestii zakupu. A wpis na niezależnej tablicy rankingowej wideo — z zastrzeżeniem, że te tablice oceniają krótkie klipy na podstawie preferencji parami i nie są stworzone do oceniania rozmowy na żywo, więc niedopasowanie może być trwałe, a nie tymczasowe — dałby twierdzeniom o opóźnieniu i jakości zewnętrzną weryfikację. Dopóki jedno z nich się nie pojawi, ścieżki VideoFDB są dostępnym dowodem i wiążą się z luką odpowiednio 0,09 i 0,47 punktu.

Warto rozważyć kontrargument, że przeprowadzenie benchmarku to nie wdrożenie. Protokół NVIDIA daje każdemu systemowi to samo zadanie naprzemiennego zabierania głosu i tego samego sędziego; nie mówi nic o tym, jak zachowuje się dziewiąta godzina rozmowy, co się dzieje, gdy dwie osoby mówią jedna przez drugą przez pełną minutę, ani czy elementy sterowania ekspresją ulegają degradacji na twarzy, którą zdjęcie referencyjne odwzorowało źle. Tavus podaje trening ukierunkowany na dryf — etap self-forcing i mechanizm historii — jako rozwiązanie dokładnie tego problemu, a doniesienia to wszystko, co ma czytelnik, dopóki ktoś spoza Tavus nie przeprowadzi długiej sesji i nie opublikuje jej wyników. Traktuj benchmark jako najlepszy dostępny dowód, a nie jako wynik wdrożenia.

Co w międzyczasie zbudować wokół tego

Praktyczne pytanie dla zespołu, który chce dziś czegoś takiego, brzmi: które części stosu można już kupić. Konwersacyjny interfejs wideo to łańcuch — rozpoznawanie mowy, model językowy, synteza mowy, a w przypadku Tavus model renderujący — a pierwsze trzy są towarem masowym. Te trzy działają za jednym punktem końcowym zgodnym z OpenAI w OrcaRouter, z ponad 200 modelami na tym samym kluczu, a cena katalogowa dostawcy jest przekazywana przy 0% marży, więc obniżka ceny dostawcy obowiązuje tu tego samego dnia, a nie po cyklu umownym. Jeśli składasz potok interakcji i chcesz pozostawić warstwę generowania otwartą, dopóki Griffin lub coś podobnego nie stanie się rzeczywistym produktem, właśnie tam podmiana kosztuje zmianę konfiguracji, a nie migrację. Sam Tavus Griffin nie jest tu modelem routowanym i nie będzie, dopóki jest wersją zapoznawczą za formularzem zgłoszeniowym.

To, na co warto patrzeć, to nie kolejna pokazówka. Chodzi o to, czy narzędzia do ujawniania, które buduje Tavus, zostaną opublikowane, i czy druga grupa badawcza odtworzy protokół twarzą w twarz. Zaliczenie testu Turinga na taką skalę to dokładnie ten rodzaj wyniku, który wymaga, by drugie laboratorium go przeprowadziło.

An explainer scoreboard for Tavus Griffin with six rows: Status: research preview; Pricing: none published; Model type: human interaction model; VideoFDB generation: 3.83 of 5; VideoFDB perception: 3.73 of 5; Open issue: disclosure. Footer: "NVIDIA VideoFDB per Tavus and NVIDIA, September 2026." The OrcaRouter logo is composited bottom-right.