Karta tytułowa hero dla „Tavus Griffin vs Muse Realtime Avatar” z podtytułem „Dwie twarze 2026, dwa różne problemy”, nad czterema chipami: Griffin 48% uznawało go za człowieka; Griffin 0,43 s od audio do wideo; Muse Realtime Avatar 870 ms do pierwszego bajtu; Muse Realtime Avatar 448x768 przy 25 fps.
Engineering & Research

Tavus Griffin vs Muse Realtime Avatar: Dwie twarze 2026 roku, dwa różne problemy

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Zarówno Tavus Griffin, jak i Muse Realtime Avatar istnieją po to, aby rozwiązać ten sam żenujący problem — model językowy, który potrafi mówić, ale nie ma twarzy — i atakują go z przeciwnych stron. Griffin to model interakcji międzyludzkich wideo-do-wideo, który obserwuje uczestnika przez kamerę i generuje drugą stronę rozmowy w czasie rzeczywistym; został ogłoszony przez Tavus w październiku 2026 r. jako podgląd badawczy dla wybranych testerów. Muse Realtime Avatar to warstwa ucieleśnienia firmy Meta dla jej agenta Muse, ogłoszona na Meta Connect 23 września 2026 r.; przyjmuje dźwięk i zamienia go w zsynchronizowany mówiący portret. Żadnego z nich nie można kupić. Różnica tkwi w tym, co każdy z nich stara się zrobić dobrze, i ujawnia się w momencie, gdy zapytasz, co każdy model faktycznie otrzymuje na wejściu.

Krótka wersja

• Wejściem Griffina jest osoba po drugiej stronie — wideo i audio uczestnika na żywo, które musi odczytywać, na które musi odpowiadać i przez które musi być przerywany.

• Dane wejściowe Muse Realtime Avatar to własna mowa agenta — strumień tokenów z Muse Realtime Voice, który przekształca w dopasowaną twarz.

• Tavus mierzy Griffina pod kątem tego, czy ludzie w niego wierzą, i publikuje wynik 48% z jednominutowej rozmowy wideo.

• Meta mierzy Muse Realtime Avatar pod kątem tego, czy nadąża, i podaje 870 milisekund od końca tury do pierwszego bajtu.

• Żaden z nich nie ma publicznego API, opublikowanej ceny ani daty ogólnej dostępności.

Przeczytaj te cztery wiersze razem, a kształt sporu staje się oczywisty. Tavus optymalizuje pod kątem przekonań drugiej osoby. Meta optymalizuje pod kątem zegara.

Board titled 'Two Faces, Two Measurements'. Tavus Griffin column: input the live participant, video and audio; optimises for whether the other person believes it; headline figure 48% of 54 participants in a one-minute video call; output 720p duplex video at 25 fps; latency 0.43 s average audio to video on H100s; access research preview, selected testers only. Muse Realtime Avatar column: input Muse Realtime Voice's own speech tokens; optimises for the clock, end of turn to first frame; headline figure 870 ms from end of turn to first byte; output 448x768 portrait at 25 fps; capacity 12 concurrent sessions on one NVIDIA GB200; access research post only, no API.

Griffin: model, w którego trzeba uwierzyć

Tavus ujmuje to tak, że Griffin jest pierwszym Human Interaction Model, a architektura stojąca za tym twierdzeniem to dwuczęściowy system łączący Continuous Conversational Modeling z Audio-Visual Generation. Pierwsza część jest behawioralna: decyduje, co persona powinna robić z jednej chwili na drugą, wykorzystując to, co widzi i słyszy. Druga część to rendering, który Tavus dzieli jeszcze na strumieniowe generowanie mowy i strumieniowe generowanie wideo.

Liczby, które Tavus wysuwa na pierwszy plan, nie są liczbami przepustowości. W badaniu, które firma przeprowadziła z Queen Mary University of London, 26 z 54 uczestników — 48% — uznało, że Griffin jest prawdziwą osobą po jednominutowej rozmowie wideo, w porównaniu z 1 z 41 (2,4%) w przypadku jej poprzedniego zestawu: generowania twarzy Phoenix-4.5, naprzemiennego zabierania głosu Sparrow-2 i modułu wizyjnego Raven-1. Uczestnicy, których nie udało się oszukać, zwykle zaczynali wątpić w ciągu pierwszych 20 sekund. W benchmarku VideoFDB firmy NVIDIA, którego wyniki oceniano we wrześniu 2026 r., Tavus podaje, że Griffin zajmuje pierwsze miejsce w kategorii AI twarzą w twarz z wynikiem generowania 3,83 wobec 2,80 najsilniejszego zgłoszonego wyniku bazowego i 3,92 punktu odniesienia dla człowieka oraz z wynikiem percepcji 3,73 wobec 3,44 dla najlepszego zgłoszonego wyniku bazowego i 4,20 punktu odniesienia dla człowieka. Te liczby są raportowane przez dostawcę i dotyczą konkretnego benchmarku, ale to punkty odniesienia dla człowieka są najciekawsze.

Inżynieria stojąca za tymi liczbami to kodek o nazwie Tavec i autoregresyjny transformer dyfuzyjny. Tavec działa przy 48 kHz, generując 40 wartości na klatkę przy 100 klatkach na sekundę, bez codebooków, z w pełni przyczynowym dekoderem i pakietami o rozmiarze już od 10 milisekund — zaprojektowany tak, aby twarz mogła zacząć się poruszać, zanim zdanie zostanie dokończone. Ścieżka wideo przesyła 720p w 320-milisekundowych fragmentach, gdzie jeden latent odpowiada ośmiu klatkom przy 25 fps, na latent przypadają trzy kroki dyfuzji, a w VAE występuje 8× kompresja czasowa. Trzyetapowy proces destylacji (dopasowywanie rozkładu, potem autoregresyjne wymuszanie nauczyciela, a następnie samowymuszanie) pozwala mu w ogóle wykonywać te trzy kroki w czasie rzeczywistym. Najważniejsza deklaracja dotycząca opóźnienia mówi o średnio 0,43 sekundy od dźwięku do wideo na H100, co według Tavus stanowi około połowy czasu kolejnej najszybszej zmierzonej metody. Klonowanie głosu wymaga około 10-sekundowej próbki.

Cena tego wszystkiego jest taka, że Tavus nie może go wypuścić. Griffin-Lite, podgląd badawczy, jest dostępny tylko dla wybranej grupy wczesnych testerów; pisząc o premierze, firma oświadcza wprost, że Griffin-Lite nie będzie w tej chwili dostępny do użytku klientów i że przewiduje wydanie Griffina bardzo wkrótce po rozwiązaniu pewnych kwestii związanych z bezpieczeństwem. Griffin nie znajduje się na platformie Tavus i pojawi się tam „gdy rozpracujemy, jak bezpiecznie go wydać”. Model, który przekonuje w 48% przypadków podczas jednominutowej rozmowy, jest — z punktu widzenia wdrożenia — modelem, który przekonuje w 48% przypadków podczas jednominutowej rozmowy.

Screenshot of the Tavus website's Griffin announcement, captured 2 October 2026: the headline 'The First Human Interaction Model' under 'Introducing Griffin', a paragraph describing a video-to-video system that listens while the other person talks, and three statistic tiles reading 48% of people believed Griffin was a real person after a one-minute video call, #1 on NVIDIA's independent test of face-to-face AI, and 37% ahead of the next best AI at reacting in the moment, dated October 1st, 2026.

Muse Realtime Avatar: model, który musi dotrzymywać tempa

Muse Realtime Avatar został ogłoszony 23 września 2026 na Meta Connect i opisany tego samego dnia przez Meta Superintelligence Labs pod tytułem „Bringing Your Muse to Life”. Sposób ujęcia Meta jest węższy i bardziej mechaniczny niż Tavus: agent Muse miał już głos dzięki Muse Realtime Voice, a awatar to warstwa, która nadaje temu głosowi ciało.

Opublikowana wartość to 870 milisekund od końca tury do pierwszego bajtu — czyli od momentu, w którym użytkownik przestaje mówić, do momentu, w którym gotowy jest pierwszy bajt wideo awatara. Awatar renderuje portret 448×768 przy 25 klatkach na sekundę. Meta twierdzi, że system wykonuje około 60× mniej ewaluacji na fragment niż jego baseline, a pojedynczy NVIDIA GB200 może obsługiwać 12 jednoczesnych sesji w czasie rzeczywistym, zapewniając 8× większą przepustowość niż dwuetapowa implementacja BF16.

Różnica architektoniczna względem Griffin polega na tym, skąd pochodzą informacje. Muse Realtime Avatar rozszerza Muse Realtime Voice i współdzieli jego strumień tokenów mowy — to ta sama reprezentacja VQ, którą wytwarza model głosowy, napędza twarz, a nie odrębne rozumienie wizualne uczestnika. Czyni to z niego warstwę ucieleśnienia DiT sterowaną dźwiękiem: wydajną, ściśle powiązaną z własnym modelem głosowym i wcale niepróbującą odczytywać człowieka po drugiej stronie połączenia. To usta i twarz dla agenta, a nie partner do rozmowy, który cię obserwuje.

Meta nie opublikowała żadnego API, ceny ani daty premiery Muse Realtime Avatar. Wpis badawczy to całość publicznie dostępnych informacji.

Gdzie te dwa projekty naprawdę się różnią

Najwyraźniejszym sposobem dostrzeżenia podziału jest zapytanie, co się dzieje, gdy użytkownik przerywa.

Griffin działa w trybie pełnego dupleksu i został zaprojektowany tak, aby można było mu przerwać w połowie wypowiedzi — potrafi obserwować i słuchać, jednocześnie mówiąc, dlatego marketing Tavus opiera się na idei, że Griffin uczy się zachowań konwersacyjnych, a nie wideo. To także powód, dla którego jego zestaw benchmarków zbudowano wokół percepcji i reakcji oraz dlaczego 37% przewagi nad następnym najlepszym systemem w reagowaniu na bieżąco jest twierdzeniem, które firma zadaje sobie trud, by głosić.

Liczba 870 milisekund dla końca tury w Muse Realtime Avatar opowiada odwrotną historię: to potok, w którym tura dobiega końca, tokeny audio się rozwiązują, a dopiero potem twarz nadąża. Jest szybki — 870 ms to dobry wynik jak na renderer portretów — ale sam pomiar zakłada istnienie granicy tury, a właśnie to założenie model duplex został zbudowany po to, by odrzucić.

To nie jest krytyka żadnego z tych projektów. Meta buduje twarz dla agenta, który żyje wewnątrz powierzchni własnego asystenta Meta, gdzie wyraźna granica tury jest rozsądnym modelem interakcji. Tavus buduje coś, co musi przetrwać, gdy nieznajomy w ciągu dwudziestu sekund decyduje, czy osoba na ekranie jest prawdziwa.

Żaden z nich nie jest w cenniku — i tylko jedna część Muse jest wywoływalna.

Ani Tavus Griffin, ani Muse Realtime Avatar nie mogą dziś zostać wdrożone do produkcji. Griffin jest ograniczony do wybranych testerów; Muse Realtime Avatar nie ma API, ceny ani daty. Jeśli planujesz wdrożenie, oba te fakty powinny znaleźć się w planie.

Warto podkreślić, że chodzi o tę część stosu Muse, która jest dostępna. Rodzina Muse od Meta obejmuje Muse Spark, a jeden z jej checkpointów — meta/muse-spark-1.2 — jest dostępny w naszym katalogu w cenie 1,25 USD za milion tokenów wejściowych i 4,25 USD za milion tokenów wyjściowych, z zerową marżą wobec ceny katalogowej Meta. To nie jest awatar: przyjmuje tekst, obraz, wideo, audio i PDF, a zwraca tekst, z oknem kontekstowym 1 mln tokenów i konfigurowalnym poziomem rozumowania. Ale to ta część linii Muse, którą faktycznie możesz wywołać, a jeśli budujesz agenta, który pewnego dnia stanie za awatarem, połowa językowa jest tą połową, od której możesz zacząć. OrcaRouter przekazuje ceny katalogowe dostawców przy 0% marży, więc zmiana ceny Meta jest odzwierciedlana na naszej karcie tego samego dnia, a nie w następnym cyklu rozliczeniowym, a żądanie, które nie powiedzie się u jednego dostawcy, jest ponawiane u sprawnego dostawcy zamiast kończyć się przekroczeniem limitu czasu.

Screenshot of the OrcaRouter model page for Muse Spark 1.2, showing the model id meta/muse-spark-1.2, a 1M-token context window, text, image, video, file and audio inputs producing text output, a p50 time to first token of 10.00 s, input pricing of $1.25 per million tokens and output pricing of $4.25 per million tokens, and 6.2M tokens of traffic over seven days.

Ta sama logika odnosi się do strony wideo. Nie kierujemy ruchu do Muse Realtime Avatar ani nie kierujemy ruchu do Tavus Griffin i nie będziemy twierdzić inaczej. To, co kierujemy, to katalog ponad dwustu modeli obejmujący te same modalności, dzięki czemu prototyp, który przełącza się między agentem tekstowym, modelem głosowym i generatorem wideo, pozostaje na jednym kluczu, podczas gdy dwa modele z tego artykułu pozostają niewydane.

Który z nich jest dalej od wysyłki?

Według publicznie dostępnych informacji Muse Realtime Avatar jest dalej. Ma wpis badawczy, brak API, brak ceny i brak daty. Griffin również nie ma API ani ceny, ale ma wyraźny zamiar wydania — „wkrótce po rozwiązaniu tych obaw dotyczących bezpieczeństwa” — nazwany poziom wersji zapoznawczej, który istnieje dziś dla wybranych testerów, oraz stos opublikowanych wyników benchmarków z niezależnego środowiska testowego. To bardziej zaawansowana pozycja, nawet jeśli wiąże się z przyznaniem, że model nie jest wystarczająco bezpieczny, by przekazać go klientom.

Pułapką w ich porównywaniu jest traktowanie wartości 870 milisekund jako bezpośrednio porównywalnej z wartością 0,43 sekundy. Mierzą one różne rzeczy: Meta mierzy od końca tury do pierwszego bajtu portretu, a Tavus mierzy opóźnienie od audio do wideo w ciągłym strumieniu dwukierunkowym, w którym tury nie są czystymi zdarzeniami. Obie liczby są prawdziwe i nie są tym samym pomiarem, a każdy, kto przedstawia je w jednej kolumnie, wyrządza czytelnikowi krzywdę.

Konkluzja

Muse Realtime Avatar to warstwa ucieleśnienia: dźwięk na wejściu, portret na wyjściu, 870 milisekund od końca tury do pierwszego bajtu, 448×768 przy 25 fps, brak API i brak daty. Tavus Griffin to dwukierunkowy model interakcji z człowiekiem: uczestnik na wejściu, reagująca twarz na wyjściu, średnie opóźnienie audio-wideo 0,43 sekundy na H100s, a do tego dostawca gotów opublikować, że 48% ludzi uznało go za człowieka, jednocześnie stwierdzając, że klienci nie mogą go używać. Meta buduje coś, co nadąża. Tavus buduje coś, co uchodzi za człowieka. Żadnego z nich nie można kupić, co oznacza, że jedyną decyzją dostępną dziś jest to, od której połowy problemu zacząć — a dla większości zespołów tą połową jest model językowy leżący pod spodem.