Wygenerowana karta główna do artykułu „Muse Realtime Avatar vs Realtime-Venus”, pokazująca dwie zaokrąglone karty po obu stronach nagłówka. Lewa karta zawiera napis „Muse Realtime Avatar” nad ikoną wychodzącej klatki wideo oraz wiersze „generuje wideo” i „448x768 przy 25 fps, zamknięty”; prawa karta zawiera napis „Realtime-Venus” nad ikoną kamery wejściowej oraz wiersze „odczytuje wideo” i „2 x 9B, Apache-2.0, do pobrania”. Podtytuł brzmi: „Jeden renderuje twarz. Drugi ją obserwuje”. Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

Muse Realtime Avatar kontra Realtime-Venus: wyjście wideo kontra wejście wideo

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwa systemy ogłoszone w odstępie dziewięciu dni oba nazywają siebie systemami czasu rzeczywistego i oba roszczą sobie prawo do etykiety audiowizualnej, a mimo to wskazują w przeciwnych kierunkach wzdłuż tej samej osi. Muse Realtime Avatar, ogłoszony przez Meta 23 września 2026 r., przyjmuje fotografię i generuje wideo, na którym ona mówi — jego wideo to dane wyjściowe, portretowe klatki 448×768 w liczbie 25 na sekundę, tworzone przez sterowany dźwiękiem Diffusion Transformer, który dzieli strumień tokenów z Muse Realtime Voice. Realtime-Venus, przesłany na arXiv 12 września 2026 r. przez Venus Team z Ant Group we współpracy z Uniwersytetem Tsinghua, konsumuje wideo: punkt kontrolny Realtime-Venus-Omni przesyła strumieniowo klatki z kamery przez enkoder SigLIP2 i opowiada o tym, co widzi, natomiast punkt kontrolny Realtime-Venus-Audio to ten sam szkielet z wyłączonym na etapie wczytywania modułem widzenia. Jeden renderuje twarz. Drugi ją obserwuje. Żadnego z nich nie można wywołać, a tylko jeden można pobrać — i to okazuje się różnicą o większym znaczeniu.

Odwrócenie dostępności warto przedstawić wprost, zanim przejdziemy do czegokolwiek innego, ponieważ stoi w sprzeczności z wszelkimi oczekiwaniami wobec produktu Meta i wydania laboratorium badawczego. System Meta jest zamknięty: ogłoszony na Connect, zaprezentowany w poście badawczym, wbudowany w agenta Muse, bez API, bez wag, bez ceny i bez daty. System Ant Group jest otwarty: dwa checkpointy 9B jako BF16 safetensors na licencji Apache-2.0 w inclusionAI/Realtime-Venus na Hugging Face, z własnym kodem Transformers, plikiem requirements, głosem referencyjnym, stroną projektu i towarzyszącym repozytorium GitHub. Firma z produktem konsumenckim nie dostarczyła niczego, co można wziąć do ręki. Zespół badawczy dostarczył całość.

Co każdy z nich robi z ramką

Kierunek wideo to cała różnica architektoniczna i nie jest to kwestia nacisku.

Wideo — Muse Realtime Avatar generuje je na podstawie tokenów mowy, obrazu referencyjnego i przesuwnego okna ostatnich latentów wideo; Realtime-Venus-Omni je odbiera, a enkoder wizualny SigLIP2 strumieniuje klatki do modelu razem z dźwiękiem.

Audio — Muse Realtime Avatar steruje generowaniem na podstawie tokenów mowy Muse Realtime Voice, które łączą w sobie treść i prozodię; Realtime-Venus generuje mowę jako dyskretne tokeny S3 dekodowane przez strumieniowy dekoder dopasowania przepływu, zamiast doczepiać na końcu osobny model syntezy mowy.

Szkielet — Architektura Meta to sterowany dźwiękiem Diffusion Transformer o nieujawnionym rozmiarze; Realtime-Venus bazuje na szkielecie językowym Qwen3-8B z enkoderem audio Whisper-Medium, a karta modelu podaje, że checkpoint Omni został zaadaptowany z MiniCPM-o 4.5.

Wagi — wagi Muse Realtime Avatar nie zostały opublikowane i nic nie wskazuje, że zostaną; Realtime-Venus udostępnia dwa checkpointy 9B, w formacie BF16, z kontekstem 40 960 tokenów w obu przypadkach, na licencji Apache-2.0.

Dostęp — Muse Realtime Avatar nie ma API ani daty; Realtime-Venus również nie ma API, a jego karta wprost stwierdza, że nie jest wdrażany przez żadnego dostawcę inferencji.

Gdzie to działa — Muse Realtime Avatar działa wewnątrz aplikacji Muse dla użytkowników, których Meta nie wyliczyła, na warunkach 18+; Realtime-Venus działa na twoich własnych GPU, już dziś, jeśli masz sprzęt i apetyt.

Przeczytaj dwie ostatnie linijki razem, a praktyczna różnica stanie się widoczna. Żadnego z tych systemów nie można wywołać. Jeden z nich można uruchomić.

Pobieranie 9B jest prawdziwe — podobnie jak to, ile cię to kosztuje.

Realtime-Venus nie jest zaślepką repozytorium. Wagi są na miejscu, niestandardowy kod ładowania jest na miejscu, a licencja na najwyższym poziomie to Apache-2.0. Dwie rzeczy z nim związane warto znać, zanim zaczniesz go uwzględniać w planach.

Pierwsze to to, czego nie ma w wagach. Środowisko wykonawcze z podwójną pętlą, które nadaje tej architekturze jej wyróżniający charakter — jednosekundowa pętla interakcji plus działający w tle scheduler, nazywany w artykule Realtime-Venus-Harness, który wykonuje delegowane zadania w oparciu o izolowaną migawkę stanu rozmowy, dzięki czemu długotrwałe zadanie nie może zostać zaburzone przez to, że rozmowa toczy się dalej — znajduje się w repozytorium GitHub jako osobny komponent. Projekt delegacji, który jest naprawdę nowym pomysłem w raporcie, to ta część, którą sam składasz i której sam musisz zaufać.

Drugi punkt to rodowód. Karta podaje, że checkpoint Omni został zaadaptowany z MiniCPM-o 4.5, 9B modelu omni-modalnego, który OpenBMB udostępnił jako open source wcześniej w 2026 roku. To nie jest szczegół na marginesie. Oznacza to, że wkład Ant Group to post-training, środowisko uruchomieniowe i projekt delegacji nałożone na cudzy strumieniowy backbone — co jest węższym i bardziej konkretnym twierdzeniem niż „nowy model omni 9B” — i bardziej użytecznym, ponieważ mówi, gdzie szukać, jeśli coś w enkoderze wizyjnym zacznie działać nie tak.

Liczby i dokładnie czyje one są

I tu właśnie oba systemy zbiegają się w sposób, który w niczym nie pomaga: żaden z nich nie ma ani jednej niezależnej oceny. Cztery wyniki Meta są raportowane przez firmę względem wybranych przez Meta poziomów odniesienia. Wyniki Realtime-Venus są raportowane przez autorów w raporcie technicznym, przy czym żadna strona trzecia nie opublikowała uruchomienia i nie ma wpisu na liście rankingowej, z którym można by je porównać. Nie ma publicznego pomiaru żadnego z tych systemów wykonanego przez kogoś, kto go nie zbudował.

Cztery wyniki Meta, zgodnie z publikacją: 870 ms od zakończenia twojej wypowiedzi do pierwszego bajtu zsynchronizowanej odpowiedzi głosowo-wideo; wideo w orientacji pionowej 448×768 przy 25 klatkach na sekundę; 60× mniej ewaluacji modelu niż w jego własnym baseline; oraz 12 równoczesnych sesji w czasie rzeczywistym na jednym NVIDIA GB200 — 8× wzrost przepustowości względem dwuetapowego baseline’u BF16 Meta. Meta ujawnia także wyniki preferencji w porównaniu z dwoma komercyjnymi systemami awatarów, z których jeden — jak podaje — nie różni się statystycznie od parytetu pod względem sposobu bycia — ujawnienie, które warto docenić, ponieważ to rodzaj wyniku, który pomija większość postów premierowych.

Ant Group, zgodnie z publikacją: najlepszy wynik w sześciu z ośmiu benchmarków wideo wykorzystywanych w raporcie, w tym StreamingBench 70.2, OVO-Bench 64.7 i Daily-Omni 81.3 dla checkpointu Omni; a dla checkpointu Audio: MMAU 78.0, MMAU-Pro 63.2, Llama Questions 83.8, Speech CMMLU 67.8 oraz wynik 4.81 w VoiceBench AlpacaEval, który raport opisuje jako dorównujący najlepszemu wynikowi porównawczemu.

Jedną asymetrię w dowodach warto nazwać. Liczby Ant Group to wyniki benchmarków z nazwanymi zestawami testowymi — zasadniczo odtwarzalne przez każdego, kto zechce pobrać wagi i uruchomić zestaw testów. Główna liczba Meta to pomiar opóźnienia na własnym stosie obsługi Meta, który nikt spoza Meta nie może odtworzyć, ponieważ nikt spoza Meta nie ma tego systemu. Otwarte wydanie, innymi słowy, jest również tym łatwiejszym do sprawdzenia.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Realtime-Venus — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Realtime-Venus'. Rows read: Video — generated output vs perceived input; Weights — not published vs 2 x 9B, BF16, Apache-2.0; Context — undisclosed vs 40,960 tokens; Access — no API, no date vs no API, self-host only; Headline figure — 870 ms to first byte of voice + video vs StreamingBench 70.2 and Daily-Omni 81.3; Independent runs — none vs none. A footer line reads 'Meta and Ant Group figures both author-reported; neither system independently evaluated.'A screenshot of the Hugging Face model card for inclusionAI/Realtime-Venus, showing the repository name, the Apache-2.0 licence and arXiv 2609.13814 tags, the tagline 'A full-duplex interaction system with asynchronous delegation', the Project Page, GitHub, ModelScope and Licence links, the three-panel overview figure covering proactive response, delegated tool work and audio interruption, and an Inference Providers panel stating the model is not deployed by any inference provider.

Dlaczego oba te przypadki to ukryty problem z routingiem

Żaden z tych systemów nie jest kompletnym agentem i w równym stopniu dotyczy to obu. Muse Realtime Avatar to warstwa renderowania przykręcona do Muse Realtime Voice, która jest warstwą konwersacyjną agenta, którego rozumowanie działa na Muse Spark. Realtime-Venus deleguje wszystko, co wykracza poza to, co może zrobić bezpośrednio — wyszukiwanie, wywołania narzędzi, trudne rozumowanie — do harnessu, który wykonuje tę pracę w tle na podstawie migawki rozmowy. W obu projektach to, z czym rozmawia użytkownik, jest front endem, a myślenie odbywa się w osobnym modelu tekstowym.

Ten osobny model tekstowy to część, którą możesz routować. W OrcaRouter to jeden endpoint dla 196 modeli od 15 dostawców, w cenie katalogowej dostawcy przekazywanej dalej z zerową marżą, z automatycznym przełączaniem awaryjnym, gdy model zwróci błąd lub przekroczy limit czasu — co ma większe znaczenie niż zwykle, gdy po drugiej stronie znajduje się hostowany na własnym serwerze checkpoint, którego nikt niezależnie nie ocenił. Nie hostujemy Realtime-Venus: to plik do pobrania i nie serwujemy go. Nie hostujemy też Muse Realtime Avatar, bo nikt tego nie robi. Dostarczamy warstwę, której obie architektury przekazują swoją ciężką pracę, dzięki czemu nieudowodniony komponent po którejkolwiek stronie rozmowy to jedna linia konfiguracji, a nie ryzyko produkcyjne.

Który z nich jest faktycznie bardziej zaawansowany?

Odruch każe powiedzieć, że to system Meta, ponieważ Meta ma produkt i film demonstracyjny. Dowody mówią coś ciekawszego. System Meta ma lepszą inżynierię produkcyjną — 12 równoczesnych sesji na GB200 to wynik serwowania, a ujawnione testy preferencji względem produktów awatarowych dostępnych na rynku to jedyne bezpośrednie porównania liczbowe, jakimi dysponuje którykolwiek z tych systemów. System Ant Group ma lepszą weryfikowalność: nazwane benchmarki, opublikowane wagi, licencję Apache-2.0 i raport, który każdy może spróbować odtworzyć.

Czego brakuje obu, to sposobu, by za to zapłacić. A ten, któremu bliżej do użyteczności, to nie ten z aplikacją konsumencką — to ten, który możesz pobrać jeszcze dziś wieczorem i sam się o nim przekonać, na własnym sprzęcie, na własnych danych, bez żadnej zapowiedzi.

Jeśli dokonujesz wyboru, pytanie nie brzmi, który model jest lepszy. Chodzi o to, czy chcesz twarz, do której nie możesz zadzwonić, czy kamerę, którą możesz uruchomić.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.