
Tavus Griffin vs Muse Realtime Avatar: Dwie twarze 2026 roku, dwa różne problemy
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 223 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Zarówno Tavus Griffin, jak i Muse Realtime Avatar istnieją po to, aby rozwiązać ten sam żenujący problem — model językowy, który potrafi mówić, ale nie ma twarzy — i atakują go z przeciwnych stron. Griffin to model interakcji międzyludzkich wideo-do-wideo, który obserwuje uczestnika przez kamerę i generuje drugą stronę rozmowy w czasie rzeczywistym; został ogłoszony przez Tavus w październiku 2026 r. jako podgląd badawczy dla wybranych testerów. Muse Realtime Avatar to warstwa ucieleśnienia firmy Meta dla jej agenta Muse, ogłoszona na Meta Connect 23 września 2026 r.; przyjmuje dźwięk i zamienia go w zsynchronizowany mówiący portret. Żadnego z nich nie można kupić. Różnica tkwi w tym, co każdy z nich stara się zrobić dobrze, i ujawnia się w momencie, gdy zapytasz, co każdy model faktycznie otrzymuje na wejściu.
Krótka wersja
• Wejściem Griffina jest osoba po drugiej stronie — wideo i audio uczestnika na żywo, które musi odczytywać, na które musi odpowiadać i przez które musi być przerywany.
• Dane wejściowe Muse Realtime Avatar to własna mowa agenta — strumień tokenów z Muse Realtime Voice, który przekształca w dopasowaną twarz.
• Tavus mierzy Griffina pod kątem tego, czy ludzie w niego wierzą, i publikuje wynik 48% z jednominutowej rozmowy wideo.
• Meta mierzy Muse Realtime Avatar pod kątem tego, czy nadąża, i podaje 870 milisekund od końca tury do pierwszego bajtu.
• Żaden z nich nie ma publicznego API, opublikowanej ceny ani daty ogólnej dostępności.
Przeczytaj te cztery wiersze razem, a kształt sporu staje się oczywisty. Tavus optymalizuje pod kątem przekonań drugiej osoby. Meta optymalizuje pod kątem zegara.

Griffin: model, w którego trzeba uwierzyć
Tavus ujmuje to tak, że Griffin jest pierwszym Human Interaction Model, a architektura stojąca za tym twierdzeniem to dwuczęściowy system łączący Continuous Conversational Modeling z Audio-Visual Generation. Pierwsza część jest behawioralna: decyduje, co persona powinna robić z jednej chwili na drugą, wykorzystując to, co widzi i słyszy. Druga część to rendering, który Tavus dzieli jeszcze na strumieniowe generowanie mowy i strumieniowe generowanie wideo.
Liczby, które Tavus wysuwa na pierwszy plan, nie są liczbami przepustowości. W badaniu, które firma przeprowadziła z Queen Mary University of London, 26 z 54 uczestników — 48% — uznało, że Griffin jest prawdziwą osobą po jednominutowej rozmowie wideo, w porównaniu z 1 z 41 (2,4%) w przypadku jej poprzedniego zestawu: generowania twarzy Phoenix-4.5, naprzemiennego zabierania głosu Sparrow-2 i modułu wizyjnego Raven-1. Uczestnicy, których nie udało się oszukać, zwykle zaczynali wątpić w ciągu pierwszych 20 sekund. W benchmarku VideoFDB firmy NVIDIA, którego wyniki oceniano we wrześniu 2026 r., Tavus podaje, że Griffin zajmuje pierwsze miejsce w kategorii AI twarzą w twarz z wynikiem generowania 3,83 wobec 2,80 najsilniejszego zgłoszonego wyniku bazowego i 3,92 punktu odniesienia dla człowieka oraz z wynikiem percepcji 3,73 wobec 3,44 dla najlepszego zgłoszonego wyniku bazowego i 4,20 punktu odniesienia dla człowieka. Te liczby są raportowane przez dostawcę i dotyczą konkretnego benchmarku, ale to punkty odniesienia dla człowieka są najciekawsze.
Inżynieria stojąca za tymi liczbami to kodek o nazwie Tavec i autoregresyjny transformer dyfuzyjny. Tavec działa przy 48 kHz, generując 40 wartości na klatkę przy 100 klatkach na sekundę, bez codebooków, z w pełni przyczynowym dekoderem i pakietami o rozmiarze już od 10 milisekund — zaprojektowany tak, aby twarz mogła zacząć się poruszać, zanim zdanie zostanie dokończone. Ścieżka wideo przesyła 720p w 320-milisekundowych fragmentach, gdzie jeden latent odpowiada ośmiu klatkom przy 25 fps, na latent przypadają trzy kroki dyfuzji, a w VAE występuje 8× kompresja czasowa. Trzyetapowy proces destylacji (dopasowywanie rozkładu, potem autoregresyjne wymuszanie nauczyciela, a następnie samowymuszanie) pozwala mu w ogóle wykonywać te trzy kroki w czasie rzeczywistym. Najważniejsza deklaracja dotycząca opóźnienia mówi o średnio 0,43 sekundy od dźwięku do wideo na H100, co według Tavus stanowi około połowy czasu kolejnej najszybszej zmierzonej metody. Klonowanie głosu wymaga około 10-sekundowej próbki.
Cena tego wszystkiego jest taka, że Tavus nie może go wypuścić. Griffin-Lite, podgląd badawczy, jest dostępny tylko dla wybranej grupy wczesnych testerów; pisząc o premierze, firma oświadcza wprost, że Griffin-Lite nie będzie w tej chwili dostępny do użytku klientów i że przewiduje wydanie Griffina bardzo wkrótce po rozwiązaniu pewnych kwestii związanych z bezpieczeństwem. Griffin nie znajduje się na platformie Tavus i pojawi się tam „gdy rozpracujemy, jak bezpiecznie go wydać”. Model, który przekonuje w 48% przypadków podczas jednominutowej rozmowy, jest — z punktu widzenia wdrożenia — modelem, który przekonuje w 48% przypadków podczas jednominutowej rozmowy.

Muse Realtime Avatar: model, który musi dotrzymywać tempa
Muse Realtime Avatar został ogłoszony 23 września 2026 na Meta Connect i opisany tego samego dnia przez Meta Superintelligence Labs pod tytułem „Bringing Your Muse to Life”. Sposób ujęcia Meta jest węższy i bardziej mechaniczny niż Tavus: agent Muse miał już głos dzięki Muse Realtime Voice, a awatar to warstwa, która nadaje temu głosowi ciało.
Opublikowana wartość to 870 milisekund od końca tury do pierwszego bajtu — czyli od momentu, w którym użytkownik przestaje mówić, do momentu, w którym gotowy jest pierwszy bajt wideo awatara. Awatar renderuje portret 448×768 przy 25 klatkach na sekundę. Meta twierdzi, że system wykonuje około 60× mniej ewaluacji na fragment niż jego baseline, a pojedynczy NVIDIA GB200 może obsługiwać 12 jednoczesnych sesji w czasie rzeczywistym, zapewniając 8× większą przepustowość niż dwuetapowa implementacja BF16.
Różnica architektoniczna względem Griffin polega na tym, skąd pochodzą informacje. Muse Realtime Avatar rozszerza Muse Realtime Voice i współdzieli jego strumień tokenów mowy — to ta sama reprezentacja VQ, którą wytwarza model głosowy, napędza twarz, a nie odrębne rozumienie wizualne uczestnika. Czyni to z niego warstwę ucieleśnienia DiT sterowaną dźwiękiem: wydajną, ściśle powiązaną z własnym modelem głosowym i wcale niepróbującą odczytywać człowieka po drugiej stronie połączenia. To usta i twarz dla agenta, a nie partner do rozmowy, który cię obserwuje.
Meta nie opublikowała żadnego API, ceny ani daty premiery Muse Realtime Avatar. Wpis badawczy to całość publicznie dostępnych informacji.
Gdzie te dwa projekty naprawdę się różnią
Najwyraźniejszym sposobem dostrzeżenia podziału jest zapytanie, co się dzieje, gdy użytkownik przerywa.
Griffin działa w trybie pełnego dupleksu i został zaprojektowany tak, aby można było mu przerwać w połowie wypowiedzi — potrafi obserwować i słuchać, jednocześnie mówiąc, dlatego marketing Tavus opiera się na idei, że Griffin uczy się zachowań konwersacyjnych, a nie wideo. To także powód, dla którego jego zestaw benchmarków zbudowano wokół percepcji i reakcji oraz dlaczego 37% przewagi nad następnym najlepszym systemem w reagowaniu na bieżąco jest twierdzeniem, które firma zadaje sobie trud, by głosić.
Liczba 870 milisekund dla końca tury w Muse Realtime Avatar opowiada odwrotną historię: to potok, w którym tura dobiega końca, tokeny audio się rozwiązują, a dopiero potem twarz nadąża. Jest szybki — 870 ms to dobry wynik jak na renderer portretów — ale sam pomiar zakłada istnienie granicy tury, a właśnie to założenie model duplex został zbudowany po to, by odrzucić.
To nie jest krytyka żadnego z tych projektów. Meta buduje twarz dla agenta, który żyje wewnątrz powierzchni własnego asystenta Meta, gdzie wyraźna granica tury jest rozsądnym modelem interakcji. Tavus buduje coś, co musi przetrwać, gdy nieznajomy w ciągu dwudziestu sekund decyduje, czy osoba na ekranie jest prawdziwa.
Żaden z nich nie jest w cenniku — i tylko jedna część Muse jest wywoływalna.
Ani Tavus Griffin, ani Muse Realtime Avatar nie mogą dziś zostać wdrożone do produkcji. Griffin jest ograniczony do wybranych testerów; Muse Realtime Avatar nie ma API, ceny ani daty. Jeśli planujesz wdrożenie, oba te fakty powinny znaleźć się w planie.
Warto podkreślić, że chodzi o tę część stosu Muse, która jest dostępna. Rodzina Muse od Meta obejmuje Muse Spark, a jeden z jej checkpointów — meta/muse-spark-1.2 — jest dostępny w naszym katalogu w cenie 1,25 USD za milion tokenów wejściowych i 4,25 USD za milion tokenów wyjściowych, z zerową marżą wobec ceny katalogowej Meta. To nie jest awatar: przyjmuje tekst, obraz, wideo, audio i PDF, a zwraca tekst, z oknem kontekstowym 1 mln tokenów i konfigurowalnym poziomem rozumowania. Ale to ta część linii Muse, którą faktycznie możesz wywołać, a jeśli budujesz agenta, który pewnego dnia stanie za awatarem, połowa językowa jest tą połową, od której możesz zacząć. OrcaRouter przekazuje ceny katalogowe dostawców przy 0% marży, więc zmiana ceny Meta jest odzwierciedlana na naszej karcie tego samego dnia, a nie w następnym cyklu rozliczeniowym, a żądanie, które nie powiedzie się u jednego dostawcy, jest ponawiane u sprawnego dostawcy zamiast kończyć się przekroczeniem limitu czasu.

Ta sama logika odnosi się do strony wideo. Nie kierujemy ruchu do Muse Realtime Avatar ani nie kierujemy ruchu do Tavus Griffin i nie będziemy twierdzić inaczej. To, co kierujemy, to katalog ponad dwustu modeli obejmujący te same modalności, dzięki czemu prototyp, który przełącza się między agentem tekstowym, modelem głosowym i generatorem wideo, pozostaje na jednym kluczu, podczas gdy dwa modele z tego artykułu pozostają niewydane.
Który z nich jest dalej od wysyłki?
Według publicznie dostępnych informacji Muse Realtime Avatar jest dalej. Ma wpis badawczy, brak API, brak ceny i brak daty. Griffin również nie ma API ani ceny, ale ma wyraźny zamiar wydania — „wkrótce po rozwiązaniu tych obaw dotyczących bezpieczeństwa” — nazwany poziom wersji zapoznawczej, który istnieje dziś dla wybranych testerów, oraz stos opublikowanych wyników benchmarków z niezależnego środowiska testowego. To bardziej zaawansowana pozycja, nawet jeśli wiąże się z przyznaniem, że model nie jest wystarczająco bezpieczny, by przekazać go klientom.
Pułapką w ich porównywaniu jest traktowanie wartości 870 milisekund jako bezpośrednio porównywalnej z wartością 0,43 sekundy. Mierzą one różne rzeczy: Meta mierzy od końca tury do pierwszego bajtu portretu, a Tavus mierzy opóźnienie od audio do wideo w ciągłym strumieniu dwukierunkowym, w którym tury nie są czystymi zdarzeniami. Obie liczby są prawdziwe i nie są tym samym pomiarem, a każdy, kto przedstawia je w jednej kolumnie, wyrządza czytelnikowi krzywdę.
Konkluzja
Muse Realtime Avatar to warstwa ucieleśnienia: dźwięk na wejściu, portret na wyjściu, 870 milisekund od końca tury do pierwszego bajtu, 448×768 przy 25 fps, brak API i brak daty. Tavus Griffin to dwukierunkowy model interakcji z człowiekiem: uczestnik na wejściu, reagująca twarz na wyjściu, średnie opóźnienie audio-wideo 0,43 sekundy na H100s, a do tego dostawca gotów opublikować, że 48% ludzi uznało go za człowieka, jednocześnie stwierdzając, że klienci nie mogą go używać. Meta buduje coś, co nadąża. Tavus buduje coś, co uchodzi za człowieka. Żadnego z nich nie można kupić, co oznacza, że jedyną decyzją dostępną dziś jest to, od której połowy problemu zacząć — a dla większości zespołów tą połową jest model językowy leżący pod spodem.
