
Muse Realtime Avatar: Was Meta gebaut hat, worauf es läuft und warum du es trotzdem nicht anrufen kannst
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 1009 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 195 tok/s
- OrcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Muse Realtime Avatar ist Metas Verkörperungstechnologie. Es nimmt den Sprachstrom, den Muse Realtime Voice erzeugt, und rendert die passende Performance: Richtet man es auf ein fotografisches Porträt, antwortet das Gesicht mit kleinen Veränderungen des Gesichtsausdrucks; richtet man es auf eine Ganzkörperillustration, gestikuliert die Figur und verändert ihre Haltung, während sie spricht. Meta AI Research stellte es am 23. September 2026 in einem Beitrag mit dem Titel „Bringing Your Muse to Life“ vor. Es ist ein Forschungsergebnis, kein Produkt — Metas eigene Seite bietet weder eine API noch einen Preis noch eine Warteliste noch ein Veröffentlichungsdatum dafür — deshalb lautet die ehrliche Antwort auf die Frage „Kann ich es heute nutzen?“ Nein. Das Muse-Modell, das man heute aufrufen kann, ist ein anderes, Meta Muse Spark 1.2.
Diese Antwort sollte man im ersten Absatz nennen, nicht im letzten, denn wer diesen Namen sucht, entscheidet normalerweise gerade, ob er ihn bei seiner Planung berücksichtigen soll. Richten Sie Ihre Planung nach der Forschung, nicht nach einem Endpunkt.
Eine Sache muss vor allem anderen klar gesagt werden, weil diese Seite eine Regel bricht, die sie zugeben sollte. Dieser Blog schreibt normalerweise über Modelle in der Woche ihres Launches. Muse Realtime Avatar wurde eine Woche vor Veröffentlichung dieser Seite angekündigt, sodass der Beitrag bei strenger Auslegung des Aktualitätsfensters übersprungen würde. Dies ist kein Nachrichtenartikel über ein datiertes Ereignis. Es ist die Referenzseite für ein Modell, das heute im Kataloggespräch aktiv ist: die Seite, die ein Leser erreicht, nachdem er den Namen des Modells selbst eingegeben hat, deren Rechtfertigung eine dauerhafte Suchnachfrage ist, die wir selbst gemessen haben, statt der Aktualität eines Launches. Die September-Ankündigung wird hier als Tatsache genannt, die das Modell datiert, nicht als ein Ereignis, über das berichtet werden soll, und nichts im Folgenden ist eine zweite Ankündigung. Unsere Berichterstattung über diesen Tag ist ein separater Artikel und bleibt separat.
Wo es in der Muse-Familie steht
Meta macht ausdrücklich klar, dass dies zwei Schichten eines Systems sind, nicht zwei Produkte. In Metas Formulierung: „Muse Realtime Voice und Muse Realtime Avatar bilden ein einziges Streaming-System, das Intelligenz, Stimme und Verkörperung verbindet.“ Die Voice-Schicht liefert die konversationelle Intelligenz und gibt einen Strom von Sprach-Tokens aus – Meta nennt sie VQs –, die sowohl transportieren, was gesagt wird, als auch, wie es dargeboten wird. Ein Audio-Decoder wandelt diese Tokens in Klang um, und die Avatar-Schicht konsumiert denselben Strom, um das Bild zu erzeugen. Der gemeinsame Token-Strom sorgt dafür, dass Stimme, Lippenbewegung und Ausdruck im Gleichschritt bleiben; es gibt keinen separaten Lip-Sync-Durchlauf, der nachträglich angeflanscht wird.
Also: Muse Realtime Voice ist die Konversationsschicht. Muse Realtime Avatar ist die Verkörperungsschicht, die darauf aufbaut. Keines von beiden ist das, was du anrufen kannst.
Seien Sie ebenso vorsichtig bei einem benachbarten Namen, denn er ist derjenige, der am ehesten mit einem der beiden verwechselt wird. Muse Voice Transcribe ist ein Transkript-Endpunkt und ein wirklich anderes Produkt. Metas Entwicklerdokumentation ist eindeutig: „Es ist nur Speech-to-Text; es synthetisiert keine Sprache und bietet keine Speech-to-Speech-Konversations-API.“ Es liefert Zeitstempel auf Turn-Ebene und nicht auf Wortebene, und Meta führt es auf dieser Seite mit 0,18 $ pro Stunde auf. Es ist ein echter, bepreister Endpunkt. Es ist keine Stimme, und es ist ganz sicher kein Avatar.
Das tatsächlich aufrufbare Muse-Modell ist Meta Muse Spark 1.2, das Reasoning-Modell, das Meta mit einem Kontext von einer Million Token sowie Text-, Bild-, Video-, Datei- und Audioeingabe ausliefert. Dieses ist hier heute routbar, zum Listenpreis des Anbieters ohne Aufschlag, mit demselben Schlüssel wie alles andere im Katalog, und seine Live-Karte enthält die vollständige Spezifikation. Muse Realtime Avatar führen wir nicht. Wir haben die Live-Modellliste beim Verfassen dieses Textes erneut geprüft, und die einzigen Muse-Einträge darin sind die beiden Spark-Checkpoints, 1.2 und sein Vorgänger 1.1. Etwas Weicheres als das zu sagen – dass die Familie „teilweise verfügbar“ sei – würde implizieren, dass wir etwas routen, was wir nicht tun.

Die Technologie, in Metas eigenen Worten
Metas Beschreibung der Architektur ist kompakt genug, um sie zu zitieren, statt sie zu paraphrasieren. Muse Realtime Avatar ist „ein audiogesteuerter Diffusion Transformer, konditioniert auf einen Speech-Token-Stream, Referenzmedien und ein rollierendes Fenster aktueller Video-Latents“ und „generiert Video in kurzen kausalen Chunks“. Die zweite Hälfte dieses Satzes ist der tragende Teil: Sobald ein Chunk abgeschlossen ist, werden seine neuesten generierten Latents zum Bewegungskontext für den nächsten. Metas angegebener Grund ist Kontinuität – das Aussehen und die Eigenheiten des Avatars werden über die einzelnen Turns hinweg weitergetragen, während die Berechnung begrenzt bleibt; dadurch kann die Generierung so lange fortgesetzt werden, wie das Gespräch dauert, statt abzudriften oder das Budget zu erschöpfen.
Der Provenienzmechanismus gehört in denselben Absatz, weil Meta ihn als Teil des Systems und nicht als nachträglichen Einfall präsentiert: Generierte Videos tragen ein dauerhaftes, unsichtbares Wasserzeichen, das über Meta Video Seal angebracht wird und laut Meta keine Latenz zum Echtzeitpfad hinzufügt.
Meta hat diese Sache gemessen und vier Zahlen dafür veröffentlicht. Diese Zahlen – und die spezifischen Einschränkungen, die jede einzelne braucht, einschließlich derjenigen, die wie eine Beschleunigung klingt und keine ist – gehören zum Launch-Artikel, der sie mit ihrem Kontext intakt wiedergibt. Wir werden die nackten Zahlen hier nicht wiederholen, denn eine nackte Zahl ist genau das, was die mit Einschränkungen versehene Version verhindern soll.
Wir haben die Ankündigung am selben Tag in unserem Beitrag zum Launch von Muse Realtime Avatar behandelt, und er bleibt der Ort, an dem man die abgewogenen Aussagen in voller Länge nachlesen kann.
Was der Name nicht ist
Es lohnt sich, drei falsche Freunde einen nach dem anderen auszuschließen, weil jeder von ihnen allein aufgrund des Namens eine naheliegende Vermutung ist.
• Es ist nicht Muse Voice Transcribe. Dieser Endpunkt wandelt Sprache in Text um und leistet laut Metas eigener Beschreibung in die andere Richtung nichts. Wenn Sie ein Transkript brauchen, verkauft Meta eines, und das ist etwas anderes mit einem anderen Preis.
• Es handelt sich nicht um einen Voice-Cloning-Dienst. Nichts auf Metas Seiten beschreibt die Synthese der Stimme einer bestimmten Person, den Verkauf eines Stimmmodells oder die Entgegennahme einer Stimmprobe von einem Nutzer. Die Voice-Schicht wird als Erzeuger eines Token-Streams beschrieben; die Avatar-Schicht wird als dessen Konsument beschrieben. Die Produktform, die diese Formulierung üblicherweise impliziert – eine Probe hochladen, einen Klon erhalten –, ist nicht das, was hier beschrieben wird, und das Demo-Material, das Meta tatsächlich veröffentlicht, wird als Veranschaulichung der Leistungsfähigkeit des Modells präsentiert.
• Es handelt sich nicht um einen Verbraucher-Avatar in Metas eigener App. Meta versieht seine Beispiele mit einem Hinweis, der leicht zu übersehen und den es wert ist, festgehalten zu werden: Die Demonstrationen „veranschaulichen die Fähigkeiten des Modells und spiegeln nicht alle Avatare wider, die in der Muse-App verfügbar sind“, und Muse ist für Nutzer ab 18 Jahren. Nehmen Sie das wörtlich. Einiges von dem, was der Beitrag zeigt, ist Fähigkeit, nicht Bestand.
Ein vierter Name verdient es, aus einem anderen Grund gesondert betrachtet zu werden. Muse Realtime Avatar ist nicht Muse Video, das videogenerierende Modell, das den größten Teil dieses Jahres in einer öffentlichen Rangliste steht, ohne veröffentlicht worden zu sein. Unsere eigene Seite zu dieser Situation – Muse Video: Veröffentlichungsdatum, API-Zugriff und was Meta Connect ändern könnte – enthält eine Einschränkung, die wir hier wortwörtlich wiederholen, statt sie zu verbessern: Jede Seite, die einen konkreten Veröffentlichungstag oder einen Preis für Muse Video nennt, ohne dass eine neuere Meta-Ankündigung vorliegt, spekuliert. Dieselbe Disziplin gilt für das Thema dieser Seite, weshalb diese Seite weder das eine noch das andere nennt. Dieser Beitrag liefert außerdem das Datum, das wir nicht verwechseln dürfen: Muse Video wird am 7. Juli 2026 in einer Vorschau präsentiert und ist nicht veröffentlicht, weshalb eine Suche nach dieser Familie Termine zutage fördert, die zu einem anderen Modell gehören.

Wofür diese Seite da ist und was sie verändern würde
Der Grund, warum eine Referenzseite hier die richtige Form ist, ist messbar. In den 28 Tagen bis zum 25. September 2026 erzielte der exakte Begriff in unserer Such-Property 164 Impressionen und keine Klicks, mit seiner besten Position 9,3. Mehr als fünfzig unserer Seiten erwähnen das Fragment irgendwo, und fast der gesamte Traffic landet auf einem einzigen Ankündigungsbeitrag. Ein Begriff mit echter, anhaltender Nachfrage, der knapp außerhalb der ersten Seite rankt und niemanden konvertiert, ist kein Nachfrageproblem und kein Qualitätsproblem – es ist ein Seitenproblem. Es gab keine Seite, deren Thema das Modell selbst war. Dies ist die besagte Seite.
Die Position ist auch der Grund, warum hier nichts als Neuigkeit aufgemacht wird. Ein Leser, der über eine Namenssuche hier ankommt, will drei Dinge in dieser Reihenfolge wissen: was das ist, ob es verfügbar ist und worauf es aufbaut. Sie werden oben in genau dieser Reihenfolge beantwortet, ohne erfundene Daten und ohne Nennung eines Wettbewerbers.

Was die Seite ändern würde, ist eine einzige Ankündigung. Wenn Meta einen Endpoint, einen Preis, eine Warteliste oder ein Datum für Muse Realtime Avatar veröffentlicht, hört der Verfügbarkeitsabschnitt auf, ein „Nein“ zu sein, und wird zu einer Spezifikation, und diese Seite wird neu geschrieben statt ergänzt. Wenn Meta Muse Video ausliefert, ändert sich der obige Absatz mit. Bis eines von beidem passiert, ist der nützliche Schritt für einen Entwickler der wenig glamouröse: Halte die Schnittstelle, die du bereits hast, auf das Modell gerichtet, das du tatsächlich erreichen kannst. Jedes Modell im Katalog, einschließlich Meta Muse Spark 1.2, steht hinter einem OpenAI-kompatiblen Endpunkt und einem Schlüssel, was bedeutet, dass der Versuch, den existierenden Teil dieser Familie auszuprobieren, dich eine Änderung am Modell-String statt eines neuen Vertrags kostet. Wenn die Embodiment-Schicht aufrufbar wird, sollten die Wechselkosten ebenfalls ein String sein.
