Eine generierte Hero-Karte für „Muse Realtime Avatar: Meta gibt seinem Muse-Agenten ein Gesicht – 870 Millisekunden pro Turn“, die die Overline „Meta Superintelligence Labs — 23. September 2026“, die Schlagzeile und drei Fakten aus Metas Forschungsbeitrag zeigt: 448×768 Hochformat-Video mit 25 fps, etwa 870 ms vom Ende des Turns bis zum ersten Byte und 12 gleichzeitige Echtzeit-Sitzungen auf einem NVIDIA GB200. Ein Untertitel lautet: „Es ist kein Talking Head. Es ist eine Rendering-Schicht über einem Stimmmodell.“ Das OrcaRouter-Logo ist unten rechts eingefügt.
Engineering & Research

Muse Realtime Avatar: Meta gibt seinem Muse Agent ein Gesicht, mit 870 Millisekunden pro Runde

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die Zahl, die Meta als Aufhänger gewählt hat, ist 870 Millisekunden. Das ist die Zeit, die Muse Realtime Avatarbraucht – nach Metas eigener Messung – von dem Moment, in dem man aufhört zu sprechen, bis zu dem Moment, in dem das erste Byte einer synchronisierten Sprach- und Videoantwort eintrifft. Das ist ein wirklich aggressiver Wert für ein System, das Video erzeugen muss, und es lohnt sich, ihn genau zu lesen – denn fast alles Interessante an Metas neuem Embodiment-Modell steckt in der Lücke zwischen dem, was diese Zahl misst, und dem, was die Leute annehmen werden, dass sie misst.

Muse Realtime Avatar wurde am 23. September 2026 auf der Meta Connect angekündigt und am selben Tag von Meta Superintelligence Labs in einem Forschungsbeitrag mit dem Titel „Deine Muse zum Leben erwecken“ beschrieben. Er erweitert Muse Realtime Voice, die Konversationsebene innerhalb von Metas Muse-Agenten, indem er ihr einen Körper gibt. Es ist kein Chatbot mit einem Standard-Avatar: Man übergibt ihm ein Referenzbild – ein Foto, eine Ganzkörperillustration, ein Tier, einen Haushaltsgegenstand – und es stellt dieses Ding dar, wie es spricht, gestikuliert und seine Körperhaltung verändert, in durchgehendem Video für die Dauer des Gesprächs. Zuckerberg sagte auf der Bühne, dass der Avatar, der seiner eigenen Muse zugeordnet ist, Jolly heißt.

Ein gemeinsamer Token-Stream, kein Lip-Sync-Pass

Die Architektur ist der Teil, den es sich zu verstehen lohnt, denn sie erklärt, warum Meta immer wieder „embodiment“ statt „avatar“ sagt. Muse Realtime Voice erzeugt einen Strom von Sprach-Tokens – im Beitrag werden sie VQs genannt –, die sowohl den Inhalt des Gesagten als auch seine Prosodie tragen: das Tempo, die Betonung, das Steigen und Fallen. Muse Realtime Avatar konsumiert denselben Strom. Er ist ein audiogesteuerter Diffusion Transformer, konditioniert auf diese Sprach-Tokens, auf die von Ihnen bereitgestellten Referenzmedien und auf ein gleitendes Fenster der jüngsten Video-Latents, und er erzeugt Video in kurzen kausalen Chunks, wobei er jedes neue Latent als Bewegungskontext für das nächste weiterreicht.

Ein gemeinsamer Token-Stream ist das, was Stimme, Lippenbewegung und Ausdruck zusammenhält. Die Alternative – erst das Audio erzeugen und dann ein separates Lip-Sync-Modell darüberlaufen zu lassen – ist die Arbeitsweise des Großteils der Avatar-Branche, und deshalb sehen so viele dieser Avatare aus, als würden sie synchronisiert. Metas Design beseitigt diese Nahtstelle konstruktionsbedingt. Das rollierende latente Fenster ist die zweite Hälfte der Idee: Ohne es driftet ein chunk-basierter Generator, und nach drei Minuten ist deine Figur still und leise jemand anderes geworden.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player paused at 0:00 of 0:51 showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as state-of-the-art embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

Vier veröffentlichte Zahlen – und was jede einzelne tatsächlich misst

Meta hat mehr Zahlen veröffentlicht, als für einen Forschungsbeitrag üblich ist, der zu einem Consumer-Feature gehört. Alle vier unten aufgeführten Zahlen sind unternehmenseigene Angaben, von Meta anhand von Baselines gemessen, die Meta selbst gewählt hat; keine von ihnen wurde außerhalb des Unternehmens reproduziert.

870 ms vom Ende des Redebeitrags bis zum ersten Byte. Dies ist eine Kennzahl für den Antwortbeginn. Sie ist nicht die Zeit bis zu einer vollständigen Antwort und auch nicht die fortlaufende Übermittlungslatenz für den Rest des Anrufs. Ein System kann 870 ms bis zum ersten Byte erreichen und sich bei Sekunde zwölf immer noch träge anfühlen. Metas Beitrag stellt ausdrücklich klar, dass es sich um das First-Byte-Maß handelt; Berichterstattung, die den einschränkenden Zusatz weglässt, interpretiert es als End-to-End-Reaktionsfähigkeit, was es nicht ist.

448×768-Hochformatvideo mit 25 Bildern pro Sekunde. Das ist ein hoher, telefonförmiger Rahmen, kein Querformat, und 25 fps sind eher filmisch als flüssig – die Standardbildrate für Film, unter den 30 oder 60 fps, die ein nativer Kamerastream liefern würde. Meta sagt, Demos würden mit einem transparenten Overlay als Wasserzeichen versehen, damit Empfänger erkennen können, dass sie kein normales Kamerabild sehen.

60-mal weniger Modellbewertungen. Wird weiter unten ausführlich behandelt, denn diese Zahl wird am ehesten falsch verstanden.

12 gleichzeitige Echtzeit-Sitzungen auf einem NVIDIA GB200. Meta berichtet, dass seine Serving-Arbeit – persistente KV-Caches, cache-bewusstes Routing, latenzbewusstes dynamisches Batching, vier-Bit-Quantisierungs-bewusstes Training, fusionierte Kernel und CUDA-Graph-Capture, entwickelt mit NVIDIA – die Kapazität um das 8-Fache gegenüber seiner eigenen zweistufigen BF16-Baseline erhöht hat. Die Arithmetik dahinter ist sauber: Jeder Generierungsschritt erzeugt acht Frames – das sind 320 ms Wiedergabe – in 20 ms Modellzeit, also 2,5 ms pro Frame. Sowohl die 12 als auch das 8-Fache beziehen sich auf Metas angegebene Baseline, nicht auf die Hardware eines anderen Anbieters.

Warum 60× nicht 60× schneller ist

Die Komprimierungsbehauptung ist diejenige, die am häufigsten wiederholt und am wenigsten verstanden werden wird. Metas Lehrer-Modell war ein 40-Schritt-Diffusionsmodell mit dreifachem Classifier-Free Guidance – drei Durchläufe pro Schritt, also 120 Modellbewertungen, um einen Videoblock zu erzeugen. Das Schüler-Modell ist ein ungeführtes kausales Zwei-Schritt-Modell mit einem KV-Cache fester Länge, trainiert durch Destillation und Self-Forcing, und es benötigt zwei Bewertungen für denselben Block. Das ist eine 60-fache Reduzierung der Bewertungen pro Block bei – mit Metas Worten – nahezu Lehrerqualität.

Es handelt sich um eine Reduzierung des Rechenaufwands pro Chunk. Sechzigmal weniger Auswertungen bedeuten nicht, dass ein Nutzer nur ein Sechzigstel so lange wartet, denn die Latenz hatte schon vor der Destillation andere Einflussfaktoren und hat sie auch danach noch. Das Diagramm in Metas eigenem Beitrag zeigt, was die Reduktion in puncto Qualität brachte: Die menschliche Präferenz stieg von 45 % auf 55 %. Das ist die ehrliche Version der Geschichte – das Ziel der Destillation war, ein System zu schaffen, das überhaupt in Echtzeit laufen konnte, und die Qualitätseinbuße wurde auf etwa zehn Präferenzpunkte begrenzt, statt beseitigt zu werden.

Die Bewertung, einschließlich des Ergebnisses, das anders ausfiel

Meta testete gegen zwei kommerzielle Avatar-Systeme, Runway Characters und HeyGen LiveAvatar, wobei übereinstimmende Avatar-Identitäten verwendet wurden, sodass die Bewerter die Animation und nicht das Charakterdesign verglichen. Die Bewerter führten mit jedem System zwei- bis dreiminütige Live-Gespräche und verglichen anschließend die visuelle Qualität, die Synchronisation, die Charakterkonsistenz und die Eigenheiten.

Meta gibt an, gegenüber Runway Characters mit 78 % zu 22 % und gegenüber HeyGen LiveAvatar mit 88 % zu 12 % bevorzugt zu werden und in jeder bewerteten Dimension bevorzugt zu werden. Dann tut der Beitrag etwas, das die meisten Anbieterbewertungen nicht tun: Er legt offen, dass der Vergleich der Eigenheiten mit Runway Characters statistisch nicht von Gleichstand zu unterscheiden war. Ein Gleichstand innerhalb eines Durchmarschs ist eine Kleinigkeit, aber es ist das Detail, das einem verrät, dass über den Durchmarsch ehrlich berichtet wird, statt Rosinen herauszupicken.

Die Grenzen des Tests wiegen schwerer als das Unentschieden. Zwei bis drei Minuten sind ein kurzes Gespräch. Die Bewerter kamen von Meta. Und der Beitrag selbst warnt, dass seine Demonstrationen „die Leistungsfähigkeit des Modells veranschaulichen und nicht alle die in der Muse-App verfügbaren Avatare widerspiegeln“ – womit ein Forschungsteam unmissverständlich sagt, dass das Video, das du gesehen hast, nicht unbedingt das Produkt ist, das du erhalten wirst.

Was Sie damit nicht tun können

Es gibt keine API für Muse Realtime Avatar. Es gibt keinen Preis, keine Preisliste, keine Warteliste und kein Veröffentlichungsdatum. Meta hat nicht gesagt, wann Nutzer oder Entwickler es verwenden können werden. Die Muse-App ab 18 Jahren ist die einzige Oberfläche, auf die es zusteuert, und der Avatar erscheint zusammen mit einer Reihe weiterer Muse-Funktionen — Stimmanpassung, eine Muse-E-Mail-Adresse, Mac-Computersteuerung, Brillenintegration —, die eigene Zeitpläne haben, von denen einige mit „in den kommenden Monaten“ angegeben werden.

Der Vergleich, der hier zählt, ist nicht der mit Runway oder HeyGen. Er ist der mit dem Rest des Muse-Stacks. Muse Spark, das Reasoning-Modell, auf dem der Agent läuft, ist für Entwickler verfügbar, seit Meta es über die Meta Model API geöffnet hat, und Muse Spark 1.2 wird über OrcaRouter als meta/muse-spark-1.2 für 1,25 $ pro Million Input-Tokens und 4,25 $ pro Million Output-Tokens angeboten, Listenpreis des Anbieters ohne Aufschlag, innerhalb eines Kontextfensters von einer Million Tokens, das bereits Text, Bilder, Video, Audio und Dateien akzeptiert. Das ist der Teil von Muse, den man heute aufrufen kann. Das Gesicht ist der Teil, den man nicht aufrufen kann.

Diese Asymmetrie sollten Sie auf sich wirken lassen, wenn Sie irgendetwas planen. Ein Agent, der per Videoanruf Schlussfolgerungen zieht, und ein Agent, der in einem Videoanruf erscheint, sind unterschiedliche Produkte mit unterschiedlichen Einschränkungen, und nur eines von ihnen steht auf einer Preisliste.

A generated scoreboard titled 'Muse Realtime Avatar — the scoreboard' with six rows: turn to first byte — about 870 ms; video — 448×768 portrait at 25 fps; evaluations — 60× fewer than baseline; concurrency — 12 sessions per NVIDIA GB200; capacity — 8× over two-step BF16; developer access — none announced. A footer reads 'All figures company-reported by Meta; none independently reproduced.'

Was als Nächstes ansehen

Drei Dinge würden daraus statt einer Ankündigung eine Entscheidung machen. Das erste ist ein Veröffentlichungsdatum für den Avatar in Muse, denn alles, was Meta veröffentlicht hat, dreht sich um ein Modell, und nichts davon dreht sich um ein Produkt, das man an einem Donnerstag benutzen kann. Das zweite ist eine Latenzmessung über ein langes Gespräch hinweg statt beim ersten Byte – 870 ms sind ein Startschuss, und die Frage, die ein echter Anruf aufwirft, ist, was in der zehnten Minute passiert. Das dritte ist, ob das System unter adversariellen Bedingungen den Charakter hält: ein Nutzer, der absichtlich das Thema wechselt, schnell vorgeht oder ihm ein Referenzbild einspeist, das so gestaltet ist, dass es wie eine echte Person aussieht.

Bis dahin ist die ehrliche Zusammenfassung diejenige, die der Forschungsbeitrag impliziert, ohne sie auszusprechen. Muse Realtime Avatar ist ein echtes Stück Engineering mit einem echten Kompressionsergebnis dahinter, demonstriert in einem kontrollierten Rahmen, bewertet von dem Unternehmen, das es gebaut hat, in Gesprächen, die so lange dauerten wie eine Kaffeebestellung. Es ist keine Vaporware. Es ist außerdem nichts, das man kaufen, routen oder benchmarken kann – und das sind unterschiedliche Behauptungen.

A screenshot of the OrcaRouter model page for Meta Muse Spark 1.2, showing the model id meta/muse-spark-1.2, input modalities text, image, video, file and audio with text output, capability badges for vision, audio, tools, JSON and reasoning, a p50 time-to-first-token of 4.91 seconds, and pricing of $1.25 per million input tokens and $4.25 per million output tokens, with 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.