Hero-Titelkarte für „Tavus Griffin vs. Muse Realtime Avatar" mit dem Untertitel „Zwei Gesichter aus 2026, zwei verschiedene Probleme", über vier Chips: Griffin 48 % hielten es für einen Menschen; Griffin 0,43 s von Audio zu Video; Muse Realtime Avatar 870 ms bis zum ersten Byte; Muse Realtime Avatar 448x768 bei 25 fps.
Engineering & Research

Tavus Griffin vs. Muse Realtime Avatar: Zwei Gesichter 2026, zwei unterschiedliche Probleme

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Sowohl Tavus Griffin als auch Muse Realtime Avatar existieren, um dasselbe peinliche Problem zu lösen – ein Sprachmodell, das sprechen kann, aber kein Gesicht hat – und sie gehen es von entgegengesetzten Enden an. Griffin ist ein Video-zu-Video-Human-Interaction-Modell, das einen Teilnehmer über eine Kamera beobachtet und die andere Seite des Gesprächs in Echtzeit erzeugt; es wurde von Tavus im Oktober 2026 als Forschungsvorschau für ausgewählte Tester angekündigt. Muse Realtime Avatar ist Metas Verkörperungsschicht für seinen Muse-Agenten, angekündigt auf der Meta Connect am 23. September 2026, und es nimmt Audio entgegen und verwandelt es in ein synchronisiertes sprechendes Porträt. Keines von beiden ist käuflich. Der Unterschied liegt darin, was jedes von ihnen richtig hinbekommen will, und er zeigt sich in dem Moment, in dem man fragt, was jedes Modell tatsächlich als Eingabe erhält.

Die Kurzfassung

• Griffins Eingabe ist die Person am anderen Ende — Video und Audio eines Live-Teilnehmers, die es lesen muss, auf die es reagieren muss und von denen es unterbrochen werden muss.

• Die Eingabe von Muse Realtime Avatar ist die eigene Sprache des Agenten — ein Strom von Tokens von Muse Realtime Voice, den es in ein passendes Gesicht umwandelt.

• Tavus misst Griffin daran, ob Menschen es glauben, und veröffentlicht aus einem einminütigen Videoanruf eine 48-%-Zahl.

• Meta misst den Muse Realtime Avatar daran, ob er mithält, und veröffentlicht 870 Millisekunden vom Ende des Redebeitrags bis zum ersten Byte.

• Keines von beiden verfügt über eine öffentliche API, einen veröffentlichten Preis oder ein Datum für die allgemeine Verfügbarkeit.

Lies diese vier Zeilen zusammen, und die Gestalt des Widerspruchs ist offensichtlich. Tavus optimiert auf den Glauben der anderen Person. Meta optimiert auf die Uhr.

Board titled 'Two Faces, Two Measurements'. Tavus Griffin column: input the live participant, video and audio; optimises for whether the other person believes it; headline figure 48% of 54 participants in a one-minute video call; output 720p duplex video at 25 fps; latency 0.43 s average audio to video on H100s; access research preview, selected testers only. Muse Realtime Avatar column: input Muse Realtime Voice's own speech tokens; optimises for the clock, end of turn to first frame; headline figure 870 ms from end of turn to first byte; output 448x768 portrait at 25 fps; capacity 12 concurrent sessions on one NVIDIA GB200; access research post only, no API.

Griffin: das Modell, dem man glauben muss

Tavus’ Einordnung lautet, dass Griffin das erste Human Interaction Model ist, und die Architektur hinter dieser Behauptung ist ein zweiteiliges System, das Continuous Conversational Modeling mit Audio-Visual Generation kombiniert. Der erste Teil ist verhaltensbezogen: Er entscheidet von einem Moment zum nächsten, was die Persona tun sollte, und nutzt dabei, was sie sehen und hören kann. Der zweite Teil ist das Rendering, und Tavus unterteilt diesen wiederum in Streaming-Spracherzeugung und Streaming-Videogenerierung.

Die Zahlen, die Tavus an den Anfang stellt, sind keine Durchsatzzahlen. In einer Studie, die das Unternehmen mit der Queen Mary University of London durchführte, hielten 26 von 54 Teilnehmenden – 48 % – Griffin nach einem einminütigen Videoanruf für eine echte Person, gegenüber 1 von 41 (2,4 %) bei seinem vorherigen Stack aus Phoenix-4.5-Gesichtsgenerierung, Sparrow-2-Turn-Taking und Raven-1-Vision. Teilnehmende, die nicht getäuscht wurden, zweifelten meist innerhalb der ersten 20 Sekunden. Auf NVIDIAs VideoFDB-Benchmark, bewertet im September 2026, meldet Tavus Griffin auf Platz eins bei Face-to-Face-KI mit einem Generierungswert von 3,83 gegenüber einer stärksten gemeldeten Baseline von 2,80 und einer menschlichen Referenz von 3,92 sowie einem Wahrnehmungswert von 3,73 gegenüber 3,44 für die beste gemeldete Baseline und einer menschlichen Referenz von 4,20. Diese Zahlen sind vom Anbieter gemeldet und benchmarkspezifisch, aber die menschlichen Vergleichspunkte sind die interessanten.

Die Technik hinter diesen Zahlen ist ein Codec namens Tavec und ein autoregressiver Diffusions-Transformer. Tavec läuft bei 48 kHz mit 40 Werten pro Frame bei 100 Frames pro Sekunde, ohne Codebooks, mit einem vollständig kausalen Decoder und Paketen von nur 10 Millisekunden – so konzipiert, dass sich ein Gesicht bewegen kann, bevor ein Satz zu Ende ist. Der Videopfad überträgt 720p in 320-Millisekunden-Chunks, wobei ein Latent acht Frames bei 25 fps entspricht, drei Diffusionsschritte pro Latent und eine 8-fache zeitliche Kompression im VAE. Ein dreistufiger Destillationsprozess (Distribution Matching, dann Teacher-Forcing-Autoregression, dann Self-Forcing) ist es, was es überhaupt ermöglicht, diese drei Schritte in Echtzeit auszuführen. Die zentrale Latenzangabe ist ein Durchschnitt von 0,43 Sekunden von Audio zu Video auf H100s, was laut Tavus etwa halb so lang ist wie bei der nächstschnellsten gemessenen Methode. Voice-Cloning benötigt ungefähr eine 10-sekündige Probe.

Der Preis für all das ist, dass Tavus es nicht ausliefern kann. Griffin-Lite, die Forschungsvorschau, ist nur einem ausgewählten Kreis früher Tester zugänglich; in einer Mitteilung zur Veröffentlichung erklärt das Unternehmen unmissverständlich, dass Griffin-Lite derzeit nicht für die Kundennutzung verfügbar sein wird und dass es beabsichtigt, Griffin sehr bald zu veröffentlichen, nachdem bestimmte Sicherheitsbedenken ausgeräumt sind. Griffin ist nicht auf der Tavus-Plattform und wird dort erst ankommen, „sobald wir herausgefunden haben, wie wir es sicher veröffentlichen können“. Ein Modell, das in einem einminütigen Anruf 48 % der Zeit überzeugt, ist aus Sicht des Einsatzes ein Modell, das in einem einminütigen Anruf 48 % der Zeit überzeugt.

Screenshot of the Tavus website's Griffin announcement, captured 2 October 2026: the headline 'The First Human Interaction Model' under 'Introducing Griffin', a paragraph describing a video-to-video system that listens while the other person talks, and three statistic tiles reading 48% of people believed Griffin was a real person after a one-minute video call, #1 on NVIDIA's independent test of face-to-face AI, and 37% ahead of the next best AI at reacting in the moment, dated October 1st, 2026.

Muse Replay Avatar: das Modell, das mithalten muss

Muse Realtime Avatar wurde am 23. September 2026 auf der Meta Connect angekündigt und noch am selben Tag von Meta Superintelligence Labs unter dem Titel „Bringing Your Muse to Life“ beschrieben. Metas Darstellung ist enger und mechanischer als die von Tavus: Der Muse-Agent hatte bereits eine Stimme – dank Muse Realtime Voice –, und der Avatar ist die Schicht, die dieser Stimme einen Körper verleiht.

Die veröffentlichte Zahl ist 870 Millisekunden vom Ende des Turns bis zum ersten Byte – also vom Moment, in dem der Nutzer aufhört zu sprechen, bis zu dem Moment, in dem das erste Videobyte des Avatars bereit ist. Der Avatar rendert ein Porträt im Format 448×768 mit 25 Bildern pro Sekunde. Meta sagt, das System führe pro Chunk etwa 60× weniger Auswertungen durch als seine Baseline und dass ein einzelner NVIDIA GB200 12 gleichzeitige Echtzeit-Sitzungen bewältigen kann, mit einem Kapazitätsgewinn von 8× gegenüber einer zweistufigen BF16-Implementierung.

Der architektonische Unterschied zu Griffin liegt darin, woher die Informationen stammen. Muse Realtime Avatar erweitert Muse Realtime Voice und teilt dessen Speech-Token-Stream – dieselbe VQ-Repräsentation, die das Voice-Modell erzeugt, steuert das Gesicht, statt eines separaten visuellen Verständnisses eines Teilnehmers. Das macht es zu einer audiogesteuerten DiT-Embodiment-Schicht: effizient, eng an sein eigenes Voice-Modell gekoppelt und ohne den Versuch, den Menschen am anderen Ende des Anrufs überhaupt zu lesen. Es ist ein Mund und ein Gesicht für einen Agenten, kein Gesprächspartner, der dich beobachtet.

Meta hat für Muse Realtime Avatar weder eine API noch einen Preis noch ein Veröffentlichungsdatum veröffentlicht. Der Forschungsbeitrag ist der gesamte öffentliche Kenntnisstand.

Wo die beiden Designs tatsächlich voneinander abweichen

Am deutlichsten erkennt man die Trennung, wenn man fragt, was passiert, wenn der Nutzer unterbricht.

Griffin ist vollduplexfähig und darauf ausgelegt, mitten in einer Äußerung unterbrochen zu werden – er kann während des Sprechens zusehen und zuhören, weshalb sich das Marketing von Tavus auf die Idee stützt, dass Griffin eher Gesprächsverhalten als Video lernt. Das ist auch der Grund, warum seine Benchmark-Suite auf Wahrnehmung und Reaktion ausgerichtet ist und warum der Vorsprung von 37 % gegenüber dem nächstbesten System bei der Reaktion im Moment eine Behauptung ist, die das Unternehmen bewusst aufstellt.

Die 870-Millisekunden-Zahl von Muse Realtime Avatar für das Turn-Ende erzählt die gegenteilige Geschichte: Es ist eine Pipeline, in der der Turn endet, die Audio-Tokens aufgelöst werden und dann das Gesicht hinterherkommt. Sie ist schnell – 870 ms sind ein guter Wert für einen Porträt-Renderer –, doch die Messung selbst setzt voraus, dass eine Turn-Grenze existiert, und genau diese Annahme ist es, die ein Duplexmodell per Konstruktion verwirft.

Das ist keine Kritik an einem der beiden Designs. Meta baut ein Gesicht für einen Agenten, der in Metas eigenen Assistenten-Oberflächen lebt, wo eine saubere Turn-Grenze ein vernünftiges Modell der Interaktion ist. Tavus baut etwas, das es überstehen muss, dass ein Fremder innerhalb von zwanzig Sekunden entscheidet, ob die Person auf dem Bildschirm echt ist.

Weder das eine noch das andere steht auf einer Preisliste – und nur ein Teil von Muse ist aufrufbar

Weder Tavus Griffin noch Muse Realtime Avatar können heute in Produktion gehen. Griffin ist auf ausgewählte Tester beschränkt; Muse Realtime Avatar hat keine API, keinen Preis und kein Datum. Wenn Sie einen Build planen, gehören beide Fakten in den Plan.

Was hervorzuheben ist, ist der Teil des Muse-Stacks. Der ist erreichbar. Metas Muse-Familie umfasst Muse Spark, und ein Checkpoint davon — meta/muse-spark-1.2 — ist in unserem Katalog verfügbar zu $1,25 pro Million Input-Tokens und $4,25 pro Million Output-Tokens mit null Aufschlag auf Metas Listenpreis. Es ist nicht der Avatar: Es nimmt Text-, Bild-, Video-, Audio- und PDF-Eingaben entgegen und gibt Text zurück, mit einem Kontextfenster von 1 Mio. Tokens und konfigurierbarem Reasoning-Aufwand. Aber es ist der Teil der Muse-Linie, den Sie tatsächlich aufrufen können, und wenn Sie den Agenten bauen, der eines Tages hinter einem Avatar sitzen wird, ist die Sprachhälfte die Hälfte, mit der Sie anfangen können. OrcaRouter gibt die Listenpreise der Anbieter mit 0 % Aufschlag weiter, sodass eine Preisänderung von Meta noch am selben Tag auf unserer Karte erscheint und nicht erst im nächsten Abrechnungszyklus, und eine Anfrage, die bei einem Anbieter fehlschlägt, wird gegen einen gesunden erneut versucht, statt als Timeout aufzutauchen.

Screenshot of the OrcaRouter model page for Muse Spark 1.2, showing the model id meta/muse-spark-1.2, a 1M-token context window, text, image, video, file and audio inputs producing text output, a p50 time to first token of 10.00 s, input pricing of $1.25 per million tokens and output pricing of $4.25 per million tokens, and 6.2M tokens of traffic over seven days.

Dieselbe Logik gilt für die Videoseite der Welt. Wir routen Muse Realtime Avatar nicht und wir routen Tavus Griffin nicht, und wir werden nichts anderes behaupten. Was wir hingegen routen, ist ein Katalog von über zweihundert Modellen über dieselben Modalitäten hinweg, sodass ein Prototyp, der zwischen einem Text-Agenten, einem Sprachmodell und einem Videogenerator wechselt, auf einem einzigen Schlüssel bleibt, während die beiden Modelle in diesem Artikel weiterhin unveröffentlicht bleiben.

Welches ist weiter vom Versand entfernt?

Nach öffentlich zugänglichen Informationen ist Muse Realtime Avatar weiter entfernt. Es gibt einen Research-Post und keine API, keinen Preis und kein Datum. Griffin hat ebenfalls keine API und keinen Preis, aber eine ausdrückliche Veröffentlichungsabsicht – „sehr bald, nachdem diese Sicherheitsbedenken ausgeräumt sind“ –, eine benannte Preview-Stufe, die heute für ausgewählte Tester existiert, und eine Reihe veröffentlichter Benchmark-Ergebnisse aus einem unabhängigen Test-Harness. Das ist eine weiter fortgeschrittene Position, auch wenn damit das Eingeständnis einhergeht, dass das Modell nicht sicher genug ist, um es Kunden in die Hand zu geben.

Die Falle beim Vergleich besteht darin, die 870-Millisekunden-Angabe als direkt vergleichbar mit der 0,43-Sekunden-Angabe zu behandeln. Sie messen unterschiedliche Dinge: Meta misst vom Ende eines Turns bis zum ersten Byte eines Porträts, und Tavus misst die Audio-zu-Video-Latenz innerhalb eines kontinuierlichen Duplex-Streams, in dem Turns keine sauberen Ereignisse sind. Die Zahlen sind beide real, und sie sind nicht dieselbe Messung, und wer sie in einer Spalte präsentiert, erweist dem Leser einen Bärendienst.

Fazit

Muse Realtime Avatar ist eine Verkörperungsschicht: Audio hinein, Porträt hinaus, 870 Millisekunden vom Ende des Redebeitrags bis zum ersten Byte, 448×768 bei 25 fps, keine API und kein Datum. Tavus Griffin ist ein duplexes Human-Interaction-Modell: Teilnehmende hinein, ein reagierendes Gesicht hinaus, 0,43 Sekunden durchschnittliche Audio-zu-Video-Latenz auf H100s, und ein Anbieter, der bereit ist zu veröffentlichen, dass 48 % der Menschen dachten, es sei menschlich, während er zugleich angibt, dass Kunden es nicht nutzen können. Meta baut etwas, das mithält. Tavus baut etwas, das als menschlich durchgeht. Keines von beiden ist käuflich zu erwerben, was bedeutet, dass die einzige heute verfügbare Entscheidung ist, mit welcher Hälfte des Problems man beginnt – und für die meisten Teams ist diese Hälfte das darunterliegende Sprachmodell.