
Muse Realtime Avatar: Meta daje twarz swojemu agentowi Muse — 870 milisekund na turę
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 180 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
Liczba, którą Meta postanowiła się pochwalić, to 870 milisekund. Tyle bowiem trwa Muse Realtime Avatar, według pomiarów samej Meta, od chwili, gdy przestaniesz mówić, do chwili, gdy dotrze pierwszy bajt zsynchronizowanej odpowiedzi głosowej i wideo. To naprawdę agresywny wynik jak na system, który musi generować wideo, i warto odczytywać go precyzyjnie — ponieważ niemal wszystko, co interesujące w nowym modelu ucieleśnienia Meta, kryje się w luce między tym, co ta liczba mierzy, a tym, co ludzie będą zakładać, że mierzy.
Muse Realtime Avatar został ogłoszony 23 września 2026 na Meta Connect i opisany tego samego dnia przez Meta Superintelligence Labs w poście badawczym zatytułowanym „Ożywianie Twojej Muse”. Rozszerza Muse Realtime Voice, warstwę konwersacyjną wewnątrz agenta Muse Meta, dając mu ciało. To nie jest chatbot ze standardowym avatarem: przekazujesz mu obraz referencyjny — fotografię, ilustrację całego ciała, zwierzę, przedmiot domowy — a on renderuje tę rzecz mówiącą, gestykulującą i zmieniającą postawę w ciągłym wideo przez cały czas trwania rozmowy. Zuckerberg powiedział na scenie, że avatar przypisany do jego własnego Muse nazywa się Jolly.
Wspólny strumień tokenów, a nie przebieg lip-sync
Architektura to część, którą warto zrozumieć, ponieważ wyjaśnia, dlaczego Meta wciąż mówi „embodiment”, a nie „avatar”. Muse Realtime Voice wytwarza strumień tokenów mowy — wpis nazywa je VQ — które niosą zarówno treść wypowiedzi, jak i jej prozodię: tempo, nacisk, wznoszenie i opadanie. Muse Realtime Avatar konsumuje ten sam strumień. To sterowany dźwiękiem Diffusion Transformer warunkowany tymi tokenami mowy, dostarczonymi przez Ciebie materiałami referencyjnymi oraz przesuwanym oknem ostatnich latentów wideo; generuje wideo w krótkich przyczynowych fragmentach, przekazując każdy nowy latent dalej jako kontekst ruchu dla następnego.
Współdzielenie jednego strumienia tokenów utrzymuje głos, ruch warg i mimikę w ścisłym związku. Alternatywa — wygenerować dźwięk, a następnie przepuścić go przez osobny model synchronizacji ruchu warg — to sposób działania większości branży awatarów i dlatego tak wiele z tych awatarów wygląda, jakby były dubbingowane. Konstrukcja Meta usuwa ten styk z założenia. Przesuwane okno utajone to druga połowa tego pomysłu: bez niego generator oparty na fragmentach dryfuje i po trzeciej minucie twoja postać po cichu staje się kimś innym.

Cztery opublikowane liczby — i co tak naprawdę mierzy każda z nich
Meta opublikowała więcej liczb niż zwykle w poście badawczym dołączonym do funkcji konsumenckiej. Wszystkie cztery poniżej są raportowane przez firmę, mierzone przez Meta względem wybranych przez Meta punktów odniesienia; żadna z nich nie została odtworzona poza firmą.
• 870 ms od zakończenia tury do pierwszego bajtu. To wskaźnik rozpoczęcia odpowiedzi. Nie jest to czas potrzebny na uzyskanie pełnej odpowiedzi ani ciągłe opóźnienie dostarczania w pozostałej części rozmowy. System może osiągnąć 870 ms do pierwszego bajtu i nadal sprawiać wrażenie powolnego w dwunastej sekundzie. Wpis Meta wyraźnie stwierdza, że to miara pierwszego bajtu; doniesienia, które pomijają to zastrzeżenie, odczytują ją jako responsywność end-to-end, którą ona nie jest.
• Wideo pionowe 448×768 przy 25 klatkach na sekundę.To wysoki kadr w kształcie telefonu, a nie poziomy, a 25 kl./s jest bardziej kinowe niż płynne — to standardowa liczba klatek dla filmu, poniżej 30 lub 60 kl./s, które dałby natywny strumień z kamery. Meta twierdzi, że wersje demonstracyjne są oznaczone znakiem wodnym w postaci przezroczystej nakładki, aby odbiorca mógł poznać, że nie patrzy na zwykły strumień z kamery.
• 60× mniej ewaluacji modelu. Omówiono to należycie poniżej, ponieważ ta liczba najłatwiej może zostać błędnie odczytana.
• 12 równoczesnych sesji czasu rzeczywistego na jednym NVIDIA GB200. Meta podaje, że jej prace nad obsługą — trwałe pamięci podręczne KV, routing świadomy pamięci podręcznej, dynamiczne grupowanie z uwzględnieniem opóźnień, uczenie z uwzględnieniem kwantyzacji czterobitowej, sfuzjowane jądra i przechwytywanie CUDA Graph, opracowane wspólnie z NVIDIA — zwiększyły przepustowość 8× względem własnego dwuetapowego baseline'u BF16. Arytmetyka za tym jest prosta: każdy krok generowania tworzy osiem klatek, co daje 320 ms odtwarzania, w 20 ms czasu modelu, czyli 2,5 ms na klatkę. Zarówno liczba 12, jak i 8× odnoszą się do baseline'u określonego przez Meta, a nie do sprzętu innego dostawcy.
Dlaczego 60× nie jest 60× szybsze
Twierdzenie o kompresji jest tym, które będzie powtarzane najczęściej i rozumiane najrzadziej. Model nauczycielski Meta był 40-krokowym modelem dyfuzyjnym z potrójnym classifier-free guidance — trzy przejścia na krok, czyli 120 ewaluacji modelu, by wytworzyć jeden fragment wideo. Model uczniowski to nieprowadzony dwukrokowy model przyczynowy ze stałej długości pamięcią podręczną KV, trenowany przez destylację i self-forcing, i potrzebuje dwóch ewaluacji dla tego samego fragmentu. To 60-krotne zmniejszenie liczby ewaluacji na fragment przy, jak ujmuje to Meta, jakości zbliżonej do nauczyciela.
To redukcja obliczeń przypadająca na fragment. Sześćdziesiąt razy mniej ewaluacji nie oznacza, że użytkownik czeka jedną sześćdziesiątą tego czasu, ponieważ opóźnienie miało inne źródła przed destylacją i nadal je ma po niej. Wykres we wpisie samej Meta pokazuje, co ta redukcja dała pod względem jakości: preferencje ludzi rosną z 45% do 55%. To uczciwa wersja tej historii — celem destylacji było stworzenie systemu, który w ogóle mógłby działać w czasie rzeczywistym, a koszt jakości został ograniczony do około dziesięciu punktów preferencji, a nie wyeliminowany.
Ocena, w tym wynik, który poszedł w drugą stronę
Meta przetestowała dwa komercyjne systemy awatarów, Runway Characters i HeyGen LiveAvatar, wykorzystując dopasowane tożsamości awatarów, aby oceniający porównywali animację, a nie projekt postaci. Oceniający prowadzili z każdym systemem rozmowy na żywo trwające od dwóch do trzech minut, a następnie porównywali jakość wizualną, synchronizację, spójność postaci i manieryzmy.
Meta podaje, że jest preferowana w stosunku 78% do 22% względem Runway Characters i 88% do 12% względem HeyGen LiveAvatar, a także że jest preferowana w każdym ocenianym wymiarze. Następnie wpis robi coś, czego większość ocen dostawców nie robi: ujawnia, że porównanie manieryzmów z Runway Characters nie było statystycznie odróżnialne od remisu. Remis w ramach pełnego zwycięstwa to drobiazg, ale to właśnie ten szczegół mówi, że pełne zwycięstwo jest raportowane uczciwie, a nie wybiórczo.
Ograniczenia testu mają większe znaczenie niż sam remis. Od dwóch do trzech minut to krótka rozmowa. Oceniający pochodzili z Meta. A sam wpis ostrzega, że jego demonstracje „ilustrują możliwości modelu i nie wszystkie odzwierciedlają awatary dostępne w aplikacji Muse” — co jest wyrazem tego, że zespół badawczy mówi wprost, iż obejrzany film niekoniecznie jest produktem, który otrzymasz.
Czego nie możesz z tym zrobić
Nie ma API dla Muse Realtime Avatar. Nie ma ceny, cennika, listy oczekujących ani opublikowanej daty. Meta nie powiedziała, kiedy użytkownicy lub deweloperzy będą mogli z niego korzystać. Aplikacja Muse dla osób od 18 lat to jedyna platforma, na której się pojawi, a awatar nadchodzi wraz z zestawem innych funkcji Muse — personalizacją głosu, adresem e-mail Muse, sterowaniem komputerem Mac, integracją z okularami — które mają własne harmonogramy, a w przypadku niektórych z nich podano, że pojawią się „w nadchodzących miesiącach”.
Porównanie, które ma tu znaczenie, nie dotyczy Runway ani HeyGen. Dotyczy reszty stosu Muse. Muse Spark, model rozumowania, na którym działa agent, jest dostępny dla deweloperów od czasu, gdy Meta udostępniła go przez Meta Model API, a Muse Spark 1.2 jest udostępniany przez OrcaRouter jako meta/muse-spark-1.2 w cenie 1,25 USD za milion tokenów wejściowych i 4,25 USD za milion tokenów wyjściowych, cena katalogowa dostawcy bez marży, w oknie kontekstowym o rozmiarze miliona tokenów, które już przyjmuje tekst, obrazy, wideo, audio i pliki. To jest ta część Muse, którą możesz wywołać już dziś. Twarz to ta część, której nie możesz.
Ta asymetria zasługuje na chwilę namysłu, jeśli cokolwiek planujesz. Agent, który rozumuje podczas rozmowy wideo, i agent, który pojawia się w takiej rozmowie, to różne produkty o różnych ograniczeniach, a tylko jeden z nich widnieje w cenniku stawek.

Co obejrzeć dalej
Trzy rzeczy zmieniłyby to z zapowiedzi w decyzję. Pierwsza to data premiery awatara w Muse, ponieważ wszystko, co opublikowała Meta, dotyczy modelu, a nic, co opublikowała, nie dotyczy produktu, którego można użyć w czwartek. Druga to pomiar opóźnienia wykonany podczas długiej rozmowy, a nie przy pierwszym bajcie — 870 ms to strzał startowy, a pytanie, jakie zadaje prawdziwe połączenie, brzmi: co się dzieje w dziesiątej minucie. Trzecia to, czy system pozostaje w roli w warunkach adwersarialnych: użytkownik, który celowo zmienia temat, działa szybko lub podaje mu obraz referencyjny zaprojektowany tak, by wyglądał jak prawdziwa osoba.
Do tego czasu uczciwym podsumowaniem jest to, co post badawczy sugeruje, nie mówiąc tego wprost. Muse Realtime Avatar to prawdziwe osiągnięcie inżynieryjne, za którym stoi prawdziwy wynik kompresji, zademonstrowane w kontrolowanych warunkach, ocenione przez firmę, która go zbudowała, w rozmowach trwających tyle, co zamówienie kawy. To nie jest vaporware. Nie jest to też coś, co można kupić, routować czy poddać benchmarkowi — a to są różne twierdzenia.

