
Muse Realtime Avatar vs SeedRealtime: Dwa modele, które możesz tylko oglądać
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 180 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
Żadne z nich nie ma cennika. Muse Realtime Avatar, ogłoszony przez Meta 23 września 2026 roku na Meta Connect, nie ma API, nie ma punktu końcowego, nie ma ceny ani daty — to funkcja agenta Muse od Meta, zaprezentowana w poście badawczym zatytułowanym „Bringing Your Muse to Life”. SeedRealtime, wydany przez ByteDance Seed 5 sierpnia 2026 roku, nie ma API, nie ma wag, nie ma raportu technicznego ani liczby parametrów — istnieje wewnątrz własnej aplikacji Doubao firmy ByteDance, a wpis ByteDance mówi jedynie, że został „w pełni udostępniony”. Dwie z największych na świecie firm zajmujących się konsumencką sztuczną inteligencją wypuściły w ciągu siedmiu tygodni od siebie systemy audiowizualne działające w czasie rzeczywistym i żadnego z nich nie można kupić. To jest właśnie to porównanie i jest ono ciekawsze niż tabela benchmarków, której nikt nie jest w stanie zbudować.
Różni je kierunek przepływu wideo. SeedRealtime obserwuje, słucha i mówi o tym, co widzi — dźwięk, wideo i tekst trafiają do jednej sieci end-to-end, a mechanizm naprzemiennego zabierania głosu został przeniesiony z zewnętrznego detektora aktywności głosowej do samego modelu. Muse Realtime Avatar generuje: przekazujesz mu obraz referencyjny — fotografię, ilustrację lub obiekt — a on renderuje tę rzecz mówiącą i gestykulującą w ciągłym wideo przez cały czas trwania rozmowy. Wideo SeedRealtime jest wejściem. Wideo Muse Realtime Avatar jest wyjściem. Oba są opisywane jako pracujące w pełnym dupleksie, oba są audiowizualne, a pod tą samą etykietą wykonują przeciwne zadania.
Czym jest każde z nich i gdzie się znajduje
Sześć linii, a ostatnie dwie to te, które o czymkolwiek decydują.
• Wideo — Muse Realtime Avatar generuje je w rozdzielczości portretowej 448×768 i przy 25 klatkach na sekundę, ze znakiem wodnym w postaci przezroczystej nakładki, dzięki czemu widz może stwierdzić, że nie jest to obraz z kamery; SeedRealtime je odbiera, strumieniując klatki do tej samej sieci, która obsługuje dźwięk.
• Założenie architektoniczne — Muse Realtime Avatar współdzieli jeden strumień tokenów między mową a wideo, więc Diffusion Transformer sterowany dźwiękiem bezpośrednio konsumuje tokeny mowy Muse Realtime Voice i nic nie jest później synchronizowane z ruchem warg; SeedRealtime wbudowuje naprzemienność mówienia w model, więc to, kto mówi i kiedy, przestaje być decyzją zewnętrznego detektora aktywności głosowej.
• Gdzie to działa — Muse Realtime Avatar to funkcja w agencie Muse firmy Meta; SeedRealtime znajduje się w aplikacji Doubao firmy ByteDance.
• Dostęp dla deweloperów — żaden z nich nie ma API. Żaden nie publikuje wag. Nie ma opcji serverless, hostowanego endpointu ani platformy zewnętrznej oferującej którykolwiek z nich.
• Cena — nieopublikowana dla obu stron, ponieważ nie ma oferty handlowej po żadnej ze stron.
• Niezależna ocena — brak dla żadnego z systemów. Każda liczba, jaką którakolwiek z firm opublikowała na temat własnego modelu, pochodzi z pierwszej ręki, a żaden zewnętrzny ewaluator nie przetestował żadnego z nich.
Dwie bazy dowodowe, obie własne, a jedna z nich jest znacznie uboższa.
Tutaj porównanie przestaje być symetryczne. Meta opublikowała cztery liczby dla Muse Realtime Avatar, wszystkie raportowane przez firmę, mierzone względem wybranych przez Meta punktów odniesienia, żadna nie została odtworzona poza firmą: 870 ms od końca twojej wypowiedzi do pierwszego bajtu zsynchronizowanej odpowiedzi głosowej i wideo; wideo w orientacji portretowej 448×768 przy 25 klatkach na sekundę; 60× mniej ewaluacji modelu niż w jej własnym punkcie odniesienia; oraz 12 jednoczesnych sesji w czasie rzeczywistym na jednym NVIDIA GB200, co daje 8× wzrost pojemności w porównaniu z dwuetapowym punktem odniesienia BF16 Meta dzięki treningowi świadomemu kwantyzacji czterobitowej i dynamicznemu grupowaniu wsadowemu z uwzględnieniem opóźnień. Meta opublikowała również porównanie preferencji z dwoma komercyjnymi systemami awatarów — 78/22 przeciwko jednemu, 88/12 przeciwko drugiemu — i ujawniła, że w przypadku sposobu bycia wynik przeciwko jednemu z nich nie różni się istotnie statystycznie od parytetu. To ujawnienie jest warte więcej niż zwycięstwa; to rodzaj wyniku, który większość postów premierowych pomija.
Opublikowane dowody SeedRealtime to jedna ewaluacja end-to-end z udziałem ludzi. ByteDance twierdzi, że w porównaniu z systemami kaskadowymi — model wizyjny połączony z modelem ASR, połączonym z LLM, połączonym z syntezatorem mowy tekst-na-mowę — SeedRealtime o połowę zmniejsza problemy z tempem konwersacji audiowizualnej, przy mniejszej liczbie przerwań, mniejszej liczbie fałszywych wyzwalaczy oraz wolniejszych, bardziej naturalnych odpowiedziach. ByteDance nie opublikował natomiast liczebności próby, metodologii, liczby adnotatorów, wartości opóźnienia w milisekundach, nazwy benchmarku ani wyniku. Jeden wtórny raport podaje 12% wzrost płynności konwersacyjnej w porównaniu z wcześniejszymi modelami zespołu. To cała publiczna baza dowodowa.
Więc uczciwy ranking weryfikowalności wygląda tak: żadna z nich nie ma niezależnego przebiegu; Meta ma zestaw pomiarów z podanymi punktami odniesienia i ujawnionym wynikiem negatywnym; ByteDance to pojedyncze twierdzenie o preferencji, którego projektu nie opisano. Żadna z nich nie jest powtarzalna, ale tylko jedna jest na tyle konkretna, by można było się z nią spierać.

Ruch, który wykonał każdy z nich
Oba systemy są odpowiedziami na ten sam problem i warto dostrzec, że te dwie odpowiedzi są różne.
W przypadku systemu, który obserwuje, trudna część to wiedzieć, kiedy się odezwać. Model, który nieprzerwanie odbiera klatki z kamery i dźwięk, musi bez zewnętrznego wyzwalacza zdecydować, czy osoba przed nim skończyła, czy zwrócono się do niego i czy obiekt, który właśnie pojawił się w kadrze, jest istotny. To problem, który SeedRealtime przeniósł do wnętrza modelu, a ByteDance dokonał tego w trzech modalnościach, a nie dwóch — trudniejsza wersja tego, co Google, OpenAI i NVIDIA zrobiły dla samego dźwięku. Z tego wynikają zachowania z demonstracji: przypisanie głosu do twarzy w rozmowie grupowej, odezwanie się bez zachęty, gdy coś pojawi się w kadrze, prowadzenie kogoś przez muzeum lub naprawę.
Dla systemu, który renderuje, najtrudniejsze jest zachowanie spójności. Generowanie wideo w krótkich przyczynowych fragmentach oznacza, że każdy fragment jest warunkowany przez poprzedni, a trybem awarii jest dryf — po trzeciej minucie postać po cichu staje się kimś innym. Przesuwne okno ostatnich latentów wideo od Meta jest odpowiedzią na to, a współdzielony strumień tokenów jest odpowiedzią na inną awarię: efekt dubbingu, który pojawia się, gdy najpierw generuje się audio, a potem przepuszcza się przez nie model synchronizacji ust.
Żadne z tych posunięć nie jest dostępne w drugim systemie. SeedRealtime nie ma obrazu referencyjnego, któremu miałby pozostać wierny, ponieważ nie renderuje nikogo. Muse Realtime Avatar nie ma żadnego zewnętrznego świata do śledzenia, ponieważ jego całym zadaniem jest tworzenie twarzy pasującej do głosu.

Dlaczego model, którego nie można wywołać, wciąż jest kwestią routingu
Oba te systemy delegują zadania. Muse Realtime Avatar opiera się na Muse Realtime Voice, który jest warstwą konwersacyjną agenta, którego rozumowanie działa na Muse Spark — to model zajmuje się renderowaniem, a nie myśleniem. Konstrukcja SeedRealtime pozwala kontynuować rozmowę, podczas gdy w tle wykonywana jest praca, co oznacza, że praca wykraczająca poza to, co może zrobić inline, trafia gdzie indziej i wraca. W obu architekturach to, z czym wchodzi w interakcję użytkownik, jest front-endem, a inteligencja to oddzielny model tekstowy stojący za nim.
Ten osobny model tekstowy to zwykłe wnioskowanie i właśnie tę część stosu można faktycznie kupić. W OrcaRouter to jeden endpoint obejmujący 196 modeli od 15 dostawców, w cenie katalogowej dostawcy przekazywanej bez żadnej marży, z automatycznym przełączaniem awaryjnym, gdy wybrany model zwróci błąd lub przekroczy limit czasu. Nie hostujemy SeedRealtime — należy do ByteDance, działa wewnątrz Doubao i nie ma tu czego routingować. Nie hostujemy też Muse Realtime Avatar i nikt inny również. To, co oferujemy, to warstwa, której oba systemy przekazują swoją ciężką pracę, a jest to warstwa, która się zmienia, gdy chcesz, aby myślenie realizował inny model.
Co zmieniłoby odpowiedź
W przypadku SeedRealtime brakującym elementem nie jest funkcja — są to dowody. Raport techniczny z liczbą parametrów, zestawem benchmarków i opisaną ewaluacją z udziałem ludzi przeniósłby go z „demonstracji wewnątrz aplikacji” do czegoś, co zespół mógłby poddać analizie. Post ByteDance zawiera również odnośniki do ogólnych celów „Try Dola” i „Try in Playground”, nie deklarując wag ani udokumentowanego API, co jest schematem funkcji produktu, a nie wydania modelu.
W przypadku Muse Realtime Avatar brakującym elementem jest kwestia komercyjna: cennik, punkt końcowy, data oraz warunki dotyczące regionu i wieku, których Meta nie określiła w pełni. We wpisie Meta zauważa, że nie wszystkie jej dema odzwierciedlają awatary dostępne w aplikacji Muse, a to zdanie powinno rządzić każdym planem zbudowanym wokół tego.
Dopóki jedno z nich się nie zmieni, porównanie ma niezwykle krótką formę. Oba modele są audiowizualne, oba działają w trybie pełnego dupleksu, oba są naprawdę imponującymi osiągnięciami inżynierii, i żadnego z nich nie może wywołać z terminala nikt, kto to czyta. Różnica polega na tym, co byś z nimi zrobił, gdybyś mógł: jeden daje ci postać, która mówi, a drugi daje ci system, który zauważa.

