Eine generierte Hero-Karte für den Artikel 'Muse Realtime Avatar vs SeedRealtime', die zwei abgerundete Karten links und rechts der Überschrift zeigt. Die linke Karte zeigt 'Muse Realtime Avatar' über einem Symbol für ein ausgehendes Video-Frame und den Zeilen 'generiert das Video' und 'Meta, angekündigt am 23. September'; die rechte Karte zeigt 'SeedRealtime' über einem Bildschirm-und-Auge-Symbol und den Zeilen 'schaut das Video' und 'ByteDance, ausgeliefert am 5. August'. Ein Untertitel lautet 'Keines der beiden hat eine Preisliste.' Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

Muse Realtime Avatar vs. SeedRealtime: Zwei Modelle, die man nur beobachten kann

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Keines von beiden hat eine Preisliste. Muse Realtime Avatar, am 23. September 2026 auf dem Meta Connect von Meta angekündigt, hat keine API, keinen Endpunkt, keinen Preis und kein Datum — es ist eine Fähigkeit von Metas Muse-Agent, demonstriert in einem Forschungspost mit dem Titel „Bringing Your Muse to Life". SeedRealtime, am 5. August 2026 von ByteDance Seed veröffentlicht, hat keine API, keine Gewichte, keinen technischen Bericht und keine Parameteranzahl — es existiert in ByteDances eigener Doubao-App, und in ByteDances Post heißt es lediglich, es sei „vollständig ausgerollt" worden. Zwei der größten Consumer-KI-Unternehmen der Welt haben innerhalb von sieben Wochen zueinander audiovisuelle Echtzeitsysteme ausgeliefert, und keines von beiden ist käuflich zu erwerben. Das ist der Vergleich, und er ist interessanter als die Benchmark-Tabelle, die niemand erstellen kann.

Was sie unterscheidet, ist die Richtung, in die das Video fließt. SeedRealtime schaut und hört zu und spricht darüber, was es sieht – Audio, Video und Text in einem einzigen End-to-End-Netzwerk, wobei der Sprecherwechsel von einem externen Voice-Activity-Detektor in das Modell selbst verlagert wurde. Muse Realtime Avatar generiert: Man übergibt ihm ein Referenzbild – ein Foto, eine Illustration oder ein Objekt – und es rendert dieses Ding, wie es spricht und gestikuliert, in kontinuierlichem Video für die Dauer des Gesprächs. SeedRealtimes Video ist Eingabe. Muse Realtime Avatars Video ist Ausgabe. Beide werden als Vollduplex beschrieben, beide sind audiovisuell, und sie verrichten unter dieser Bezeichnung entgegengesetzte Aufgaben.

Was jedes Einzelne ist und wo es lebt

Sechs Zeilen, und die letzten beiden sind die, die überhaupt etwas entscheiden.

Video — Muse Realtime Avatar erzeugt es in Porträtauflösung von 448×768 und mit 25 Bildern pro Sekunde, mit einem transparenten Overlay als Wasserzeichen versehen, sodass ein Betrachter erkennen kann, dass es sich nicht um einen Kamerastream handelt; SeedRealtime nimmt es wahr und streamt Frames in dasselbe Netzwerk, das auch das Audio verarbeitet.

Die architektonische Wette — Muse Realtime Avatar teilt einen Token-Stream zwischen Stimme und Video, sodass ein audiogesteuerter Diffusion-Transformer die Sprach-Tokens von Muse Realtime Voice direkt verarbeitet und nichts nachträglich lippensynchronisiert wird; SeedRealtime bettet den Turn-Taking in das Modell ein, sodass nicht mehr ein externer Voice-Activity-Detector entscheidet, wer spricht und wann.

Wo es läuft — Muse Realtime Avatar ist eine Funktion innerhalb von Metas Muse-Agent; SeedRealtime ist in ByteDances Doubao-App enthalten.

Entwicklerzugang — Keines der beiden hat eine API. Keines der beiden veröffentlicht Gewichte. Es gibt keine serverlose Option, keinen gehosteten Endpunkt und keine Drittanbieterplattform, die eines der beiden anbietet.

Preis — bei beiden nicht veröffentlicht, da auf keiner Seite ein kommerzielles Angebot vorliegt.

Unabhängige Bewertung — keine für eines der beiden Systeme. Jede Zahl, die eines der beiden Unternehmen zu seinem eigenen Modell veröffentlicht hat, ist eine Eigenangabe, und kein externer Gutachter hat eines von beiden getestet.

Zwei Evidenzbasen, beide aus erster Hand, und eine davon ist deutlich dünner.

Hier ist der Vergleich nicht mehr symmetrisch. Meta hat vier Werte für Muse Realtime Avatar veröffentlicht, alle vom Unternehmen selbst berichtet, gemessen an von Meta gewählten Baselines, keiner davon wurde außerhalb des Unternehmens reproduziert: 870 ms vom Ende Ihres Gesprächsbeitrags bis zum ersten Byte einer synchronisierten Sprach- und Videoantwort; 448×768 Hochformat-Video mit 25 Bildern pro Sekunde; 60× weniger Modell-Evaluierungen als die eigene Baseline; und 12 gleichzeitige Echtzeitsitzungen auf einem NVIDIA GB200, ein 8-facher Kapazitätsgewinn gegenüber Metas zweistufiger BF16-Baseline, erzielt durch quantisierungsbewusstes Training mit vier Bit und latenzbewusstes dynamisches Batching. Meta hat außerdem einen Präferenzvergleich gegen zwei kommerzielle Avatar-Systeme veröffentlicht – 78/22 gegen das eine, 88/12 gegen das andere – und offengelegt, dass das Ergebnis in Bezug auf Manierismen gegen eines von ihnen statistisch nicht von Gleichstand zu unterscheiden ist. Diese Offenlegung wiegt mehr als die Siege; sie ist die Art von Ergebnis, die die meisten Launch-Posts auslassen.

Die veröffentlichte Evidenz von SeedRealtime besteht aus einer einzigen Ende-zu-Ende-Menschbewertung. ByteDance sagt, dass SeedRealtime im Vergleich zu kaskadierten Systemen – ein Vision-Modell, verdrahtet mit einem ASR-Modell, das mit einem LLM verbunden ist, das wiederum mit einer Text-to-Speech-Stimme verdrahtet ist – audio-visuelle Probleme mit dem Gesprächsrhythmus halbiert, mit weniger Abbrüchen, weniger Fehlauslösungen und langsameren, natürlicheren Antworten. Was ByteDance nicht veröffentlicht hat, sind eine Stichprobengröße, eine Methodik, eine Anzahl von Annotatoren, ein Latenzwert in Millisekunden, ein Benchmark-Name oder ein Score. Ein Sekundärbericht nennt einen Zuwachs von 12 % bei der Gesprächsflüssigkeit gegenüber den früheren Modellen des Teams. Das ist die gesamte öffentliche Evidenzbasis.

Also sieht die ehrliche Rangfolge der Verifizierbarkeit so aus: Keines von beiden hat einen unabhängigen Lauf; Metas ist eine Reihe von Messungen mit angegebenen Baselines und einem offengelegten Negativbefund; ByteDances ist eine einzelne Präferenzbehauptung, deren Design nicht beschrieben wird. Keines von beiden ist reproduzierbar, aber nur eines ist spezifisch genug, um sich damit auseinanderzusetzen.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs SeedRealtime — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'SeedRealtime'. Rows read: Video — generated output vs perceived input; Where it runs — Muse app vs Doubao app; Developer access — none vs none; Price — none published vs none published; Published figures — 870 ms first byte, 448x768 at 25 fps, 12 sessions per GB200 vs one human preference claim, no numbers; Independent runs — none vs none. A footer line reads 'Both systems author-reported; neither independently evaluated, and neither is callable.'

Der Zug, den jeder Einzelne machte

Beide Systeme sind Antworten auf dasselbe Problem, und es lohnt sich zu sehen, dass die beiden Antworten unterschiedlich sind.

Für ein System, das beobachtet, ist der schwierige Teil zu wissen, wann es sprechen soll. Ein Modell, das fortlaufend Kamerabilder und Audio empfängt, muss ohne externen Auslöser entscheiden, ob die Person vor ihm fertig gesprochen hat, ob es angesprochen wurde und ob das Objekt, das gerade ins Bild gekommen ist, relevant ist. Das ist das Problem, das SeedRealtime ins Modell verlagert hat, und ByteDance hat den Schritt über drei Modalitäten statt zwei vollzogen — eine schwierigere Version dessen, was Google, OpenAI und NVIDIA jeweils nur für Audio getan haben. Die Demo-Verhaltensweisen ergeben sich daraus: eine Stimme in einem Gruppengespräch an ein Gesicht zu binden, sich unaufgefordert zu Wort zu melden, wenn etwas ins Bild kommt, jemanden durch ein Museum oder eine Reparatur zu führen.

Für ein System, das rendert, ist der schwierige Teil, kohärent zu bleiben. Video in kurzen kausalen Chunks zu generieren bedeutet, dass jeder Chunk auf dem letzten konditioniert ist, und der Fehlermodus ist Drift – bis zur dritten Minute ist die Figur unbemerkt jemand anderes geworden. Metas gleitendes Fenster der jüngsten Video-Latents ist die Antwort darauf, und der gemeinsame Token-Stream ist die Antwort auf einen anderen Fehler, den synchronisierten Look, den man erhält, wenn Audio zuerst generiert wird und danach ein Lip-Sync-Modell darüber angewendet wird.

Keiner der beiden Züge ist im jeweils anderen System verfügbar. SeedRealtime hat kein Referenzbild, dem es treu bleiben müsste, denn es rendert niemanden. Muse Realtime Avatar hat keine externe Welt zu verfolgen, denn seine gesamte Aufgabe besteht darin, ein Gesicht zu erzeugen, das zu einer Stimme passt.

A screenshot of the ByteDance Seed blog post 'SeedRealtime: An Audio-Visual Full-Duplex LLM', dated August 5, 2026, showing the headline, the post date, and the opening description of SeedRealtime as a native audio-visual full-duplex model.

Warum ein nicht aufrufbares Modell immer noch eine Routing-Frage ist

Beide dieser Systeme delegieren. Muse Realtime Avatar sitzt auf Muse Realtime Voice auf, der Konversationsschicht eines Agenten, dessen Reasoning auf Muse Spark läuft – das Modell übernimmt das Rendering, nicht das Denken. Das Design von SeedRealtime hält die Konversation am Laufen, während Hintergrundarbeit stattfindet, was bedeutet, dass die Arbeit, die über das hinausgeht, was es inline erledigen kann, woanders hingeht und zurückkommt. In beiden Architekturen ist das, womit der Nutzer interagiert, ein Frontend, und die Intelligenz ist ein separates Textmodell dahinter.

Dieses separate Textmodell ist gewöhnliche Inferenz und der Teil des Stacks, den man tatsächlich kaufen kann. Bei OrcaRouter ist es ein Endpunkt für 196 Modelle von 15 Anbietern, zu den Listenpreisen der Anbieter ohne Aufschlag weitergegeben, mit automatischem Failover, wenn das von Ihnen gewählte Modell Fehler verursacht oder ein Timeout auftritt. Wir hosten SeedRealtime nicht – es gehört ByteDance und läuft in Doubao, und es gibt nichts zu routen. Wir hosten auch Muse Realtime Avatar nicht, und niemand sonst tut das. Was wir anbieten, ist die Ebene, an die beide Systeme ihre schwere Arbeit übergeben, und genau diese Ebene ändert sich, wenn Sie ein anderes Modell die Denkarbeit machen lassen möchten.

Was würde die Antwort ändern?

Bei SeedRealtime ist das fehlende Puzzleteil keine Funktion – es sind die Belege. Ein technischer Bericht mit Parameteranzahl, einer Benchmark-Suite und einer beschriebenen menschlichen Evaluation würde es von einer „Demonstration innerhalb einer App“ zu etwas machen, worüber ein Team nachdenken könnte. ByteDances Beitrag verlinkt außerdem generische Ziele wie „Try Dola“ und „Try in Playground“, ohne Gewichte oder eine dokumentierte API zu beanspruchen, was eher das Muster eines Produktmerkmals als einer Modellveröffentlichung ist.

Beim Muse Realtime Avatar ist das fehlende Puzzleteil kommerzieller Natur: eine Preisliste, ein Endpunkt, ein Datum sowie die Regional- und Altersbestimmungen, die Meta nicht vollständig dargelegt hat. Metas Beitrag weist darauf hin, dass seine Demos nicht alle Avatare widerspiegeln, die in der Muse-App verfügbar sind – das ist der Satz, der für jeden darauf aufbauenden Plan maßgeblich sein sollte.

Bis sich eines davon ändert, hat der Vergleich eine ungewöhnlich kurze Form. Beide Modelle sind audiovisuell, beide sind Vollduplex, beide sind wirklich beeindruckende Ingenieursleistungen, und keines von beiden lässt sich von irgendjemandem, der das hier liest, von einem Terminal aus aufrufen. Der Unterschied liegt darin, was man mit ihnen tun würde, wenn man könnte: Das eine gibt einem eine Figur, die spricht, und das andere gibt einem ein System, das bemerkt.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.