
Muse Realtime Avatar: Co zbudowała Meta, na czym to działa i dlaczego wciąż nie możesz do niego zadzwonić
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 1009 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 195 tok/s
- OrcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Muse Realtime Avatar to technologia ucieleśnienia Meta. Pobiera strumień mowy, który Muse Realtime Voice generuje, i renderuje odpowiadający mu występ: skieruj go na fotograficzny portret, a twarz odpowie drobnymi zmianami wyrazu; skieruj go na ilustrację całej sylwetki, a postać gestykuluje i zmienia postawę, gdy mówi. Meta AI Research zaprezentowało go 23 września 2026 r. w poście zatytułowanym „Bringing Your Muse to Life”. To wynik badań, a nie produkt — strona samej Meta nie oferuje dla niego żadnego API, ceny, listy oczekujących ani daty publikacji — więc uczciwa odpowiedź na pytanie „czy mogę go dziś użyć” brzmi: nie. Model Muse, który możesz dziś wywołać, jest inny: Meta Muse Spark 1.2.
Tę odpowiedź warto podać w pierwszym akapicie, a nie w ostatnim, ponieważ czytelnik, który szuka tej nazwy, zwykle decyduje, czy oprzeć na niej swoje plany. Oprzyj swoje plany na badaniach, a nie na punkcie końcowym.
Jedną rzecz trzeba powiedzieć wprost, zanim przejdziemy do czegokolwiek innego, bo ta strona łamie zasadę, do której powinna się przyznać. Ten blog zwykle pisze o modelach w tygodniu ich premiery. Muse Realtime Avatar został ogłoszony tydzień przed publikacją tej strony, więc przy ścisłym odczytaniu okna świeżości ten wpis zostałby pominięty. To nie jest artykuł informacyjny o wydarzeniu z datą. To strona referencyjna modelu, który jest obecny w dzisiejszej rozmowie o katalogu: strona, do której czytelnik trafia po wpisaniu nazwy samego modelu, której uzasadnieniem jest stały popyt w wyszukiwaniach, który sami zmierzyliśmy, a nie świeżość premiery. Wrześniowe ogłoszenie jest tu przywołane jako fakt datujący model, a nie jako wydarzenie do relacjonowania, i nic poniżej nie jest drugim ogłoszeniem. Nasze omówienie tamtego dnia to osobny tekst i pozostaje osobny.
Gdzie to się plasuje w rodzinie Muse
Meta jednoznacznie stwierdza, że są to dwie warstwy jednego systemu, a nie dwa produkty. W ujęciu Meta: „Muse Realtime Voice i Muse Realtime Avatar tworzą jeden system strumieniowy łączący inteligencję, głos i ucieleśnienie”. Warstwa głosowa dostarcza inteligencję konwersacyjną i emituje strumień tokenów mowy — Meta nazywa je VQs — które niosą zarówno to, co jest powiedziane, jak i to, w jaki sposób jest to przekazywane. Dekoder audio zamienia te tokeny na dźwięk, a warstwa awatara konsumuje ten sam strumień, aby wygenerować obraz. Współdzielenie jednego strumienia tokenów utrzymuje głos, ruch warg i wyraz twarzy w synchronizacji; nie ma osobnego przebiegu synchronizacji ust dołączanego później.
A więc: Muse Realtime Voice to warstwa konwersacyjna. Muse Realtime Avatar to warstwa ucieleśnienia zbudowana na niej. Żadna z nich nie jest tym, co można wywołać.
Zachowaj równie dużą ostrożność w przypadku sąsiedniej nazwy, ponieważ to ona najłatwiej może zostać pomylona z którąkolwiek z nich. Muse Voice Transcribe to punkt końcowy transkrypcji i jest to naprawdę inny produkt. Dokumentacja deweloperska Meta jest jednoznaczna: „Służy wyłącznie do zamiany mowy na tekst; nie syntetyzuje mowy ani nie udostępnia interfejsu API do konwersacji mowa-do-mowy”. Zwraca znaczniki czasu na poziomie tur, a nie na poziomie pojedynczych słów, a Meta podaje go na tej stronie w cenie 0,18 USD za godzinę. To rzeczywisty, płatny punkt końcowy. To nie jest głos i z pewnością nie jest awatarem.
Model Muse, który faktycznie można wywołać, to Meta Muse Spark 1.2 — model rozumowania, który Meta dostarcza z kontekstem miliona tokenów oraz wejściem tekstowym, obrazowym, wideo, plikowym i audio. Ten można u nas kierować już dziś, w cenie cennikowej dostawcy bez żadnej marży, na tym samym kluczu co wszystko inne w katalogu, a jego aktualna karta zawiera pełną specyfikację. Nie oferujemy Muse Realtime Avatar. Sprawdziliśmy ponownie aktualną listę modeli podczas pisania tego tekstu i jedyne wpisy Muse na niej to dwa checkpointy Spark: 1.2 i jego poprzednik 1.1. Powiedzenie czegokolwiek łagodniejszego — że rodzina jest „częściowo dostępna” — sugerowałoby, że kierujemy coś, czego nie kierujemy.

Technologia, ujęta własnymi słowami Meta
Opis architektury podany przez Meta jest na tyle zwięzły, że można go zacytować, a nie parafrazować. Muse Realtime Avatar to „sterowany dźwiękiem Transformer dyfuzyjny warunkowany strumieniem tokenów mowy, mediami referencyjnymi i przesuwanym oknem ostatnich latentów wideo”, i „generuje wideo w krótkich przyczynowych fragmentach”. Druga połowa tego zdania jest częścią nośną: gdy każdy fragment się zakończy, jego najnowsze wygenerowane latenty stają się kontekstem ruchu dla następnego. Podany przez Meta powód to ciągłość — wygląd i maniery awatara są przenoszone między turami, podczas gdy obliczenia pozostają ograniczone, co pozwala generować tak długo, jak długo trwa rozmowa, zamiast dryfować lub wyczerpywać budżet.
Mechanizm pochodzenia należy omówić w tym samym akapicie, ponieważ Meta przedstawia go jako część systemu, a nie jako coś dodanego później: wygenerowane wideo zawiera trwały, niewidoczny znak wodny nakładany za pomocą Meta Video Seal, który – jak twierdzi Meta – nie dodaje opóźnienia do ścieżki czasu rzeczywistego.
Meta zmierzyła to coś i opublikowała dla tego cztery liczby. Te liczby — oraz konkretne zastrzeżenia, których każda z nich wymaga, w tym to, które brzmi jak przyspieszenie, a nim nie jest — należą do tekstu zapowiedzi premiery, który zawiera je z nienaruszonym kontekstem. Nie będziemy tu powtarzać samych liczb, ponieważ sama liczba to dokładnie to, czemu wersja z zastrzeżeniami ma zapobiegać.
Ogłoszenie omówiliśmy tego samego dnia w naszym wpisie o premierze Muse Realtime Avatar, który wciąż pozostaje miejscem, gdzie można w całości przeczytać wyważone twierdzenia.
Czym nie jest nazwa
Trzech fałszywych sąsiadów warto wykluczyć pojedynczo, ponieważ każdy z nich jest rozsądnym domysłem opartym wyłącznie na nazwie.
• To nie jest Muse Voice Transcribe. Ten endpoint konwertuje mowę na tekst i, według własnego opisu Meta, nie robi nic w drugą stronę. Jeśli potrzebujesz transkrypcji, Meta sprzedaje taką, a to coś innego w innej cenie.
• To nie jest usługa klonowania głosu. Nic na stronach Meta nie opisuje syntezowania głosu konkretnej osoby, sprzedaży modelu głosu ani przyjmowania próbki głosu od użytkownika. Warstwa głosowa jest opisana jako generująca strumień tokenów; warstwa awatara jest opisana jako konsumująca go. Kształt produktu, który zwykle sugeruje to sformułowanie — wgraj próbkę, otrzymaj klon — nie jest tym, co jest tu opisane, a materiały demonstracyjne, które Meta publikuje, są przedstawiane jako ilustracja możliwości modelu.
• To nie jest awatar konsumencki w samej aplikacji Meta. Meta dołącza do swoich przykładów zastrzeżenie, które łatwo przeoczyć i które warto zachować: demonstracje „ilustrują możliwości modelu i nie wszystkie odzwierciedlają awatary dostępne w aplikacji Muse”, a Muse jest przeznaczona dla użytkowników w wieku 18 lat i starszych. Przeczytaj to dosłownie. Część tego, co pokazuje post, to możliwości, a nie asortyment.
Czwartą nazwę warto wyodrębnić z innego powodu. Muse Realtime Avatar to nie Muse Video — model do generowania wideo, który przez większość tego roku widnieje w publicznym rankingu, ale nie został wydany. Nasza własna strona poświęcona tej sytuacji — Muse Video: data premiery, dostęp przez API i co może zmienić Meta Connect — zawiera zastrzeżenie, które powtórzymy tu dosłownie, zamiast je ulepszać: każda strona podająca konkretny dzień premiery lub cenę Muse Video bez nowszego ogłoszenia Meta uprawia spekulacje. Ta sama zasada dotyczy tematu tej strony, dlatego nie podaje ona ani jednego, ani drugiego. Tamten artykuł podaje też datę, której nie wolno nam pomylić: Muse Video jest zapowiedziany na 7 lipca 2026 r. i nie został wydany, dlatego wyszukiwanie tej rodziny modeli zwraca daty należące do innego modelu.

Do czego służy ta strona i co mogłoby ją zmienić
Powód, dla którego strona referencyjna jest tu właściwym rozwiązaniem, jest wymierny. W ciągu 28 dni poprzedzających 25 września 2026 r. dokładna fraza uzyskała 164 wyświetlenia w naszej wyszukiwarce i zero kliknięć, a jej najlepsza pozycja to 9,3. Ponad pięćdziesiąt naszych stron wspomina gdzieś ten fragment, a niemal cały ten ruch trafia na jeden wpis ogłoszeniowy. Fraza o realnym, trwałym popycie, która plasuje się tuż poza pierwszą stroną wyników i nie generuje żadnych konwersji, nie jest problemem popytu ani problemem jakości — to problem strony. Nie było strony, której tematem był sam model. To jest ta strona.
Ta pozycja jest także powodem, dla którego nic tutaj nie jest podane jako news. Czytelnik trafiający tu z wyszukiwania nazwy chce trzech rzeczy w kolejności: czym to jest, czy jest dostępne i na czym zostało zbudowane. Odpowiedzi znajdują się powyżej, w tej kolejności, bez wymyślania dat i bez wymieniania konkurenta.

To, co zmieniłoby tę stronę, to jedno ogłoszenie. Jeśli Meta opublikuje endpoint, cenę, listę oczekujących lub datę dla Muse Realtime Avatar, sekcja dostępności przestaje być „nie" i staje się specyfikacją, a ta strona zostanie przepisana, a nie uzupełniona. Jeśli Meta wyda Muse Video, powyższy akapit zmieni się razem z nim. Dopóki jedno lub drugie nie nastąpi, użytecznym posunięciem dla dewelopera jest to najmniej efektowne: utrzymać posiadany już interfejs wskazujący na model, do którego faktycznie można dotrzeć. Każdy model w katalogu, w tym Meta Muse Spark 1.2, znajduje się za jednym endpointem zgodnym z OpenAI i jednym kluczem, co oznacza, że wypróbowanie tej części tej rodziny, która istnieje, kosztuje zmianę ciągu modelu, a nie nową umowę. Gdy warstwa ucieleśnienia stanie się wywoływalna, koszt przełączenia również powinien być ciągiem.
